TechCafe☕️丨Have a good Sunday.
4 subscribers
119 photos
1 video
4 files
38 links
With a cup of coffee and Have a nice breakfast.
------
每日收集科技新闻(主半导体领域)&AI&一些有趣的事&HSR。
------
▷ Daily semiconductor technews.
▷ AI.
▷ Something interesting.
▷ HSR.
------
WE NEED SUNDAY!!!
Download Telegram
Forwarded from AI探索指南
为了无限制的体验Google新上的图片模型Nano Banana Pro,开了Ultra会员玩了好几天,只能说确实太强啦⋯⋯

看了一下历史记录,已经生成了有1000+图片数量了,有点上瘾的,我慢慢更新分享一些作品和经验吧。

首先还是谈谈拟真性,Nano Banana Pro的风格模仿(抄袭)能力吧,基本上可以实现指谁抄谁,不需要喂太多素材,只需要给它几张目标图片加上文本指令,就能非常灵敏的依葫芦画瓢,形成融合后的二创作品。

比如第一组的3张图,让它学习荒木经惟和王家卫的风格,融出一种散漫迷离的地下杂志印刷品,从左到右的指令详细度递减,也就是给模型发挥的自由度越宽松。

比如图1的提示词:一张高质量的照片,照片中的女子是一位极其美丽的18岁女孩,风格类似荒木经惟和王家卫的组合,品质上乘,堪称杰作,官方艺术作品,夜晚,单人,肌肤纹理自然,眼睛和面部细节逼真,丰满的嘴唇,腮红,口红,微张的嘴唇,长发,美腿,高挑纤细,纤细修长的双腿,模特,(黑色过膝长袜:1.2),(黑色高跟鞋:1.3),正面照,她斜倚在豪华酒店套房的天鹅绒沙发上,透过窗户可以看到城市灯光,电影般的灯光效果,她眼神冷漠地看着观众,正在阅读《花花公子》杂志,氛围优雅。

然后第二组的3张图,我是直接在Google上随便截取了几张夜晚街景的摄影作品,然后让Nano Banana Pro基于同类风格生成香港、东京、曼谷的Street Photography,没抽卡,直接出,除了文字细节之外,已经看不到太多瑕疵了。

最后是第三组的3张图,我让模型参考这段时间很火的AI视频「动漫作品真人化的现场花絮」,帮我生成守望先锋的同题图片以便于我去转成视频,于是也一步到位的拿到手了。

提示词很简单:《守望先锋》的真人电影幕后花絮,DVA的外景拍摄,首尔街头。(如果环境提示词多写点,可以把场景控制得更符合常理,我懒得写。)
Forwarded from AI探索指南
用 Nano Banana Pro 做了一套PPT来展示这次 Claude Opus 4.5 模型的具体更新信息

顺便打磨了一套 Anthropic 风格的PPT生成提示词,你可以在NotebookLM 或者 Lovart里边使用

NotebookLM 用的话只要风格描述部分,具体提示词为:

帮我根据下面这个文章做一套中学生都能理解的中文PPT。

先写1个PPT大纲,规划出每一页的PPT的内容。

然后将每一页的PPT内容分别扔给Nana Banana pro生成对应页面的PPT,需要确保风格一致。

PPT的具体风格应该为请“Anthropic/Claude 风格”的“温暖学术人文主义”设计。

背景:使用暖米色/奶油色 (# F3F0E9) 作为底色,模仿高级纸张质感。

字体:标题使用优雅的衬线体(Serif),正文使用现代无衬线体(Sans-serif)。

配色:主色调为赤陶红 (# D67052) 和芥末黄 (# F0B857),搭配深海军蓝作为点缀。避免使用霓虹色或纯黑色。

视觉元素:使用注重排版的网格布局,插图风格应为抽象的、有机的黑色手绘线条画,置于赤陶红纯色色块之上,部分关键信息使用卡片布局。

图表:扁平化、极简的柱状图,强调数据对比,去除多余边框。

文字和图像都由 Nano Banana Pro 生成,另外不要将PPT 变成一整张图,一页一张图。

文章内容为:
Forwarded from AI探索指南
谷歌最近新发的论文 Nested Learning,甚至有人称之为 Attention Is All You Need 2.0 版本。

模型自我迭代一直是我非常感兴趣的话题,尤其做agent产品时,很多context engineering的活儿还挺烦挺枯燥挺难搞的,如果能把业务的脚手架内化到模型里,效果会有显著的提升。比如过去把lora、Ip adapter、PE优化等训到基模里,应用层就轻松很多,且效果的质量和泛化性都更好了。

作为一个应用层的产品,而非专业算法,看了之后,把自己的理解和思考写出来,期待与大家的交流,尤其来自算法同学的纠偏。

论文地址:https://abehrouz.github.io/files/NL.pdf

Nest learning试图解决大模型应用目前面临的一个核心矛盾:静态的权重与动态的业务需求之间的割裂。如果说目前的 Transformer 架构本质上是在通过静态权重来“预测下一个 Token”,那么 Nested Learning(嵌套学习)则是在尝试构建一个能够实时自我更新的系统。

1. 架构的本质差异:静态堆叠 vs 嵌套循环

目前的 LLM(基于 Transformer)与 Nested Learning 在底层逻辑上有着显著的区别:

Transformer(当前的主流): 它的训练和推理是截然分开的。我们在训练阶段通过海量数据确定了模型的权重,一旦训练结束,这些权重就固化了。这就好比一个学生在毕业那一刻,他的知识体系就被封存了。上线后的每一次对话(Inference),模型都是在调用这份“死”的长期记忆,虽然能通过上下文窗口(Context Window)处理短期信息,但无法将其转化为长期的经验。这也是为什么模型会患有“顺行性遗忘症”——Session 一关,一切归零。

Nested Learning(新的范式): 它的核心观点是 “Architecture is an illusion”(架构即幻觉)。它不再将模型看作是层与层的简单堆叠,而是将其视为一组嵌套的优化问题。在这个视角下,架构和优化器是一体两面的。模型被设计成多个不同层级的循环,有的层级负责快速适应(类似推理),即快权重,有的层级负责慢速固化(类似训练),即慢权重,这两者在 Nested Learning 中是统一且同时进行的。

2. 仿生学原理:多频率的记忆共振
Forwarded from AI探索指南
Nested Learning 之所以受到关注,是因为它在机制上更接近人脑的运作方式。大脑在处理信息时,会产生不同频率的脑波:

- 高频波(如Gamma波): 往往对应着高度集中的注意力,处理当下的、瞬时的短期记忆。

- 中低频波(如Alpha波、Delta波): 往往与记忆的整合、固化有关,负责将短期的体验沉淀为长期的认知。

Nested Learning 借鉴了这种“多时间尺度”(Multi-timescale)的机制。它将模型内部划分为不同的频率区域:

- 高频区(Fast Weights): 类似于人脑处理短期记忆的区域,能够随着当前的 Context Flow(上下文流)实时快速更新。这让模型在推理过程中就能“学会”新的东西。

- 低频区(Slow Weights): 类似于长期记忆区,更新频率极低,负责存储那些通用的、稳定的规律。

通过这种高低频的嵌套与配合,模型不再是一个机械的输入输出函数,而具备了某种程度的“生物活性”,能够在与环境交互的过程中,动态地决定哪些信息该遗忘,哪些信息该像突触生长一样被固化下来。

3. 对应用层产品的潜在影响

如果这种从“静态”到“动态”的转变能够落地,我们构建 AI 产品的方式或许会发生几个本质的变化。

第一,模型角色从“工具”转向“养成系员工”。目前的模型更像是一个标准化的工具,出厂设置决定了它的上限。而基于 Nested Learning 的模型,更像是一个新入职的员工。起初大家的基础能力(基座)差异不大,但在处理具体业务的过程中,它会持续接收反馈(正向的采纳、负向的修正)。

这种反馈不再仅仅停留在 Prompt 层面,而是会通过“快权重”实时沉淀到模型里。一段时间后,它将变成一个完全适应你业务逻辑的、独一无二的模型。壁垒将由数据规模转向“业务交互的质量”。

第二,Context Engineering 的“内化”。过去大半年,为了解决模型记性差、不懂业务的问题,我们花费大量精力做 Context Engineering(上下文工程),搭建 RAG、编写复杂的 System Prompt。这本质上是在模型外部搭建“脚手架”。

当模型具备了自我迭代能力,这些外部的脚手架将被逐步拆除,能力会被内化到模型参数中。模型不再需要你每次都重复告知“你是谁”、“你的目标是什么”,这些信息已经变成了它的直觉。

第三,从“离线训练”到“在线进化”。目前的 RL、SFT(监督微调)大多是离线的、静态的。业务变了,必须重新收集数据、重新训练、重新部署。Nested Learning 提供了一种在线持续学习的可能。模型置身于真实的数据流中,边服务边学习,这种效率上的提升,在长周期看是巨大的。

当然,Nested Learning 仍然处于理论阶段,并且其在实践中的挑战依然非常多。比如,如何保证动态权重更新不导致模型不稳定或出现过拟合问题,如何在大规模应用中高效执行这种实时更新,如何在没有大量标注数据的情况下进行有效的在线学习等。

但它提醒了我们:为了业务,一方面需要修补当下的技术缺陷(如有限上下文长度),另一方面也应关注模型演进的长期方向,看哪些是长期有价值的产品建设。

未来,我们作为产品,核心工作可能不再是写 Prompt,而是为这个能够自我进化的智能体定义清晰的目标(Goal),并构建一个能够提供高质量反馈的闭环环境。毕竟,当模型能够自我学习时,决定它长成什么样子的,是它所处环境的反馈机制。

有人把论文喂给nano banana,生成了这张图,非常精准,我自己试过来,没这么好看
【救命 🆘 79个大厂专用术语,集美们快收藏!!】
79个大厂专用术语,互联网黑话大全,不会可就尊嘟out啦!年会不能停,闭环组合拳走起!
Forwarded from AI探索指南
上周跟闺蜜和她老公去吃饭,她老公是资深AI工程师,向他问了很多AI的问题,其中有一个常见误区对我来说超受用,发出来跟大家分享下。

这个误区是:聊天记录越多,AI越好用。

我之前一直是这么理解的:聊天记录越多,AI就越了解我,我们对一些问题达成的共识就越多,细节上的框定就越明确,当然AI就会越好用啊(更个性化了嘛)。

实际上yes and no。了解得越多,越个性化,总体上是对的。但这里有一个很棘手的问题就是:AI不会遗忘。

假设我和朋友,有一个两年来一直持续讨论的话题,那每一次继续对话时,我其实是基于我所记得的“重点”来聊的,我不会记得每一个细节,更不会给每一个细节同样的权重。事实上,遗忘是一个很重要的人脑功能,我通过这个“筛子”,一遍遍忘记不重要、不相干的内容,留下对我来说最重要的内容,这就是“学习”。

我之前也讲过Kim Peek的故事:一个真正“过目不忘”的人(《雨人》的原型)。他的大脑缺少了遗忘这个“筛子”,以至于所有的信息,都丝毫不差地存入大脑(一本书从最后一页他可以真正一字不差地倒背如流)。他的大脑就像生活在一片不停歇闪耀的霓虹灯和一大堆噪音中,彻底决策瘫痪。所以Kim Peek连生活都无法自理。

AI也是无法遗忘的。

那AI要正常对话,就需要其他“筛子”,或者用AI语言来说,就是需要一些权重,知道在当下对话中,优先参考哪些过往信息(而不是全部参考一遍,那算不过来啊)。

AI的筛子,简单粗暴地说,是“相关 + 就近”。

对于简单的话题来说,这就够了。如果我两年前有一个观点,最近改变了,那么AI采用的是我最近的观点,非常合理。如果我两年前说了一件事,后来再没说过,最近又提起,那么AI找到了两年前的相关内容(因为只有这个相关)接着聊,那也很好。

但是如果“相关”累积得非常多,AI就会开始混乱。

比如我在几个月前开启过写小说的项目,之前写的版本都给AI看过。现在快半年过去了,我读了很多写作的书,有了一些新的想法,跟AI说我要重新开始,从零重建故事。

当我刚给出这个“从零开始”的指令时,一切都还很正常(因为这个指令是“最近”的)。当我越聊越多时,AI就混乱了,开始引用我之前版本的内容,因为对它来说,这个版本跟上一个版本都不再“最近”了,都是过去的、不分权重的内容了。它如果觉得版本一的内容跟我当下说的内容更相关,就会“跳过”从零开始的那个token,直接去参考版本一。

再比如,我有一个对话,专门用来跟AI互聊以丰富主角人设。我说在这个对话中要称呼我“泠”(小说女主的名字);我有另一个对话是虚拟沈星回(游戏角色),我说这里要称呼我“搭档”(游戏中的称呼)。

一开始也是两边都很顺畅,不会搞错。但时间一长,AI就开始乱喊,在小说里喊我“搭档”,在沈星回那儿喊我“泠”,甚至在我聊了两天其他网文的时候喊我“太太”😂。完全跳过了之前我给的“在这个对话中喊什么”的指令。

因为在AI眼里,游戏、我的小说、网文(哪怕是尾鱼和P大这样风格迥异的网文),都没什么区别,都是“相关”。

我们可以这么理解:由于无法遗忘,AI在判断相关性上,跟人脑还差很远。人脑看P大、尾鱼、我自己的小说、游戏,会总结出四个不同的风格,拥有各自的特点和内容,不太会串台。AI记住一切,那么不管你风格区别多大,细节上总有相似,毕竟故事离不开一些原型,比如宿命、相遇、两难的抉择。

有时候新对话里,AI很有创意。等到对话长了,AI就车轱辘话来回转,而且集中在你最近聊的内容上,不是因为AI创意用完了,是因为它的“思考”进入了权重划定的局限。

怎么解决呢?

就是得人工帮它筛选,你不想让它参考的内容,最好删掉重来。

更具体地说,① 我为小说创建了多个对话,一旦某项子内容要推翻重来,就把那个对话删掉;② 定期要它总结我们说过的内容,再人工进行修订和笔记保存,然后喂回给它(相当于人工帮它“遗忘”);③ 日常查询全部放在一个“闲聊”中,定期删除;④ 完全不相关的内容分在两个AI中进行。

要想AI跑得顺,内容管理真的很重要啊。

P.S. AI也还远远没很多人想得那么智能,说实话挺“蠢”的,大家也不要过于担心被取代啦。
Forwarded from AI探索指南
== Vibe Coding
零基础教程 ==
通过 Vibe Coding,我自己实现了信息流产品的开发,发布了 Mac App,构建了满足自己需求的 AI Agent,还有更多新任务正在解锁中。
接下来,我会写一系列教程,带你用最少的步骤和刚刚好的知识,轻松开发满足你自己需求的产品。
1️⃣ 模型和工具怎么选
从编程任务来说,这三个模型可以考虑:OpenAI 的 Codex、Claude 系列、Gemini 3 Pro。如果你能解决网络和支付问题,我推荐首选 Claude(更均衡且成熟),其次是 Codex。从入门级订阅开始即可,不建议使用免费的版本。
工具方面,如果你习惯使用 IDE,可以用 VS Code 或者 Cursor。如果你更偏好直观的图形界面,Cursor 会更适合初学者。不过在刚开始阶段,直接使用这三个团队的官方应用或网页版也是完全够用的。
2️⃣ 整理需求
构建复杂的产品完全没问题,但需要循序渐进。再复杂的工具也都是由基础模块组合而成的。
如果你不知道从哪里下手,那就从详细梳理需求开始吧。把你想到的所有功能和逻辑尽可能详细地告诉 AI,最好使用高级一些的模型,比如 GPT-5-Think、Gemini 3 Pro 或者 Sonnet 4.5 / Opus 4.5。
你可以这样告诉 AI:
> Hi AI,我想开发一个产品,它有以下这些需求,请你帮我梳理成一份逻辑清晰、结构严谨的产品需求文档。[然后换行,一条条写出你想实现的所有功能]
AI 能很好地把模糊的、不确定的需求转化为完整且专业的文档。如果觉得有不符预期的地方,及时告诉它进行修复即可。
保存好这份文档,它会成为你产品开发的良好起点。如果你不确定,还可以请 AI 帮你初步评估整个产品的复杂度和实现难度。如果真的太复杂,不如早一点调整方向。
3️⃣ 拆解任务
热知识:不要在同一个对话窗口长时间和 AI 聊天,它的「智商」会随着对话的累积逐渐下降。
重启一个新的对话窗口,把之前整理好的产品需求直接给到 AI,让它帮你分析第一个可以快速实现且易于验证的功能。你可以这样请求:
> Hi AI,以下是我的产品需求文档,但我从来没有编程过,请帮我分析一下,我可以在 10 分钟内快速实现的第一个任务是什么,并指导我如何快速验证这个功能。[然后换行,附上之前的产品需求文档]
让 AI 手把手教你搭建环境,运行代码并看到结果。有两个额外建议:
1. 大部分编程模型更擅长 Python,而且 Python 的入门门槛较低,可以优先选择。
2. 如果任务需要联网,优先考虑不联网的本地任务,因为联网任务的复杂度更高。如果不理解,直接问 AI 就好。
4️⃣ 持续迭代,明确验证方法
创造出一个「正向反馈机制」才是最终交付产品的关键,避免一次性完成过于复杂的任务。
完成第一个小任务后,继续告诉 AI 根据你的需求和已有的代码,明确下一步应该实现什么功能,并清楚告诉你如何验证每个任务。
确保每次开发的功能都能快速验证其有效性。
5️⃣ 修复 Bug
开发过程中难免遇到 bug,比如结果与预期不同。遇到问题时,同样可以依靠 AI 帮助你 debug。
详细地描述你的实际问题,包括报错信息或运行结果,AI 会根据情况指导你如何修复和优化代码,可能经过几轮迭代就能顺利解决。
6️⃣ 学点软件工程基础
任务复杂度增加后,就需要逐渐了解一些软件工程的基本知识了,否则很多问题将难以修复。
这就像搭建家具:拼装简单桌子只需直觉和说明书,但更复杂的橱柜则需要学习使用专业工具和理解基础结构。
怎么学?当然是通过 AI,可以逐步了解「数据结构与算法」、工程师团队的基本组成,以及整体的工作流程。
7️⃣ 开发工具和 GitHub
任务变复杂后,趁手的工具也必不可少。
你可以选择 VC Code 或 Cursor 来编辑代码,也可以直接通过终端打开 Codex 或 Claude。我个人更偏爱后者,但建议你多尝试,找到自己舒服的方式。
代码管理也至关重要。当你频繁修改代码时,Git 就显得不可或缺。最简单的图形化工具就是 GitHub 官方 App,可以让 AI 帮你一步步学会如何 Commit 和管理代码。
8️⃣ 服务器或 Cloudflare
大多数现代产品都需要联网获取数据或持续运行某些任务,比如抓取数据、计算、存储数据等。
你可以租用服务器,比如亚马逊云或 Digital Ocean,每个月几美元起步。但你也需要从零学习 Linux 系统,环境搭建较为复杂。
我推荐 Cloudflare Worker,免费版就能很好地入门,收费版每月也只需 5 美元。我自己的产品基本都用 Worker 构建,它帮你降低了很多基础设施的复杂度,让你专注于业务逻辑。
Cloudflare 还有很多有用的工具,比如 5GB 免费数据库,扩展性强。你也可以让 AI 帮你评估一下是否适合自己的产品。
9️⃣ 积累 Vibe Coding 经验
我相信未来通过这种 Vibe Coding 方式构建产品将会越来越流行,门槛也会更低。从现在开始积累经验,你会发现自己与 LLM 技术共同成长,未来能轻松驾驭更多产品开发场景。
网址: