Forwarded from AI探索指南
为了无限制的体验Google新上的图片模型Nano Banana Pro,开了Ultra会员玩了好几天,只能说确实太强啦⋯⋯
看了一下历史记录,已经生成了有1000+图片数量了,有点上瘾的,我慢慢更新分享一些作品和经验吧。
首先还是谈谈拟真性,Nano Banana Pro的风格模仿(抄袭)能力吧,基本上可以实现指谁抄谁,不需要喂太多素材,只需要给它几张目标图片加上文本指令,就能非常灵敏的依葫芦画瓢,形成融合后的二创作品。
比如第一组的3张图,让它学习荒木经惟和王家卫的风格,融出一种散漫迷离的地下杂志印刷品,从左到右的指令详细度递减,也就是给模型发挥的自由度越宽松。
比如图1的提示词:一张高质量的照片,照片中的女子是一位极其美丽的18岁女孩,风格类似荒木经惟和王家卫的组合,品质上乘,堪称杰作,官方艺术作品,夜晚,单人,肌肤纹理自然,眼睛和面部细节逼真,丰满的嘴唇,腮红,口红,微张的嘴唇,长发,美腿,高挑纤细,纤细修长的双腿,模特,(黑色过膝长袜:1.2),(黑色高跟鞋:1.3),正面照,她斜倚在豪华酒店套房的天鹅绒沙发上,透过窗户可以看到城市灯光,电影般的灯光效果,她眼神冷漠地看着观众,正在阅读《花花公子》杂志,氛围优雅。
然后第二组的3张图,我是直接在Google上随便截取了几张夜晚街景的摄影作品,然后让Nano Banana Pro基于同类风格生成香港、东京、曼谷的Street Photography,没抽卡,直接出,除了文字细节之外,已经看不到太多瑕疵了。
最后是第三组的3张图,我让模型参考这段时间很火的AI视频「动漫作品真人化的现场花絮」,帮我生成守望先锋的同题图片以便于我去转成视频,于是也一步到位的拿到手了。
提示词很简单:《守望先锋》的真人电影幕后花絮,DVA的外景拍摄,首尔街头。(如果环境提示词多写点,可以把场景控制得更符合常理,我懒得写。)
看了一下历史记录,已经生成了有1000+图片数量了,有点上瘾的,我慢慢更新分享一些作品和经验吧。
首先还是谈谈拟真性,Nano Banana Pro的风格模仿(抄袭)能力吧,基本上可以实现指谁抄谁,不需要喂太多素材,只需要给它几张目标图片加上文本指令,就能非常灵敏的依葫芦画瓢,形成融合后的二创作品。
比如第一组的3张图,让它学习荒木经惟和王家卫的风格,融出一种散漫迷离的地下杂志印刷品,从左到右的指令详细度递减,也就是给模型发挥的自由度越宽松。
比如图1的提示词:一张高质量的照片,照片中的女子是一位极其美丽的18岁女孩,风格类似荒木经惟和王家卫的组合,品质上乘,堪称杰作,官方艺术作品,夜晚,单人,肌肤纹理自然,眼睛和面部细节逼真,丰满的嘴唇,腮红,口红,微张的嘴唇,长发,美腿,高挑纤细,纤细修长的双腿,模特,(黑色过膝长袜:1.2),(黑色高跟鞋:1.3),正面照,她斜倚在豪华酒店套房的天鹅绒沙发上,透过窗户可以看到城市灯光,电影般的灯光效果,她眼神冷漠地看着观众,正在阅读《花花公子》杂志,氛围优雅。
然后第二组的3张图,我是直接在Google上随便截取了几张夜晚街景的摄影作品,然后让Nano Banana Pro基于同类风格生成香港、东京、曼谷的Street Photography,没抽卡,直接出,除了文字细节之外,已经看不到太多瑕疵了。
最后是第三组的3张图,我让模型参考这段时间很火的AI视频「动漫作品真人化的现场花絮」,帮我生成守望先锋的同题图片以便于我去转成视频,于是也一步到位的拿到手了。
提示词很简单:《守望先锋》的真人电影幕后花絮,DVA的外景拍摄,首尔街头。(如果环境提示词多写点,可以把场景控制得更符合常理,我懒得写。)
Forwarded from AI探索指南
用 Nano Banana Pro 做了一套PPT来展示这次 Claude Opus 4.5 模型的具体更新信息
顺便打磨了一套 Anthropic 风格的PPT生成提示词,你可以在NotebookLM 或者 Lovart里边使用
NotebookLM 用的话只要风格描述部分,具体提示词为:
帮我根据下面这个文章做一套中学生都能理解的中文PPT。
先写1个PPT大纲,规划出每一页的PPT的内容。
然后将每一页的PPT内容分别扔给Nana Banana pro生成对应页面的PPT,需要确保风格一致。
PPT的具体风格应该为请“Anthropic/Claude 风格”的“温暖学术人文主义”设计。
背景:使用暖米色/奶油色 (# F3F0E9) 作为底色,模仿高级纸张质感。
字体:标题使用优雅的衬线体(Serif),正文使用现代无衬线体(Sans-serif)。
配色:主色调为赤陶红 (# D67052) 和芥末黄 (# F0B857),搭配深海军蓝作为点缀。避免使用霓虹色或纯黑色。
视觉元素:使用注重排版的网格布局,插图风格应为抽象的、有机的黑色手绘线条画,置于赤陶红纯色色块之上,部分关键信息使用卡片布局。
图表:扁平化、极简的柱状图,强调数据对比,去除多余边框。
文字和图像都由 Nano Banana Pro 生成,另外不要将PPT 变成一整张图,一页一张图。
文章内容为:
顺便打磨了一套 Anthropic 风格的PPT生成提示词,你可以在NotebookLM 或者 Lovart里边使用
NotebookLM 用的话只要风格描述部分,具体提示词为:
帮我根据下面这个文章做一套中学生都能理解的中文PPT。
先写1个PPT大纲,规划出每一页的PPT的内容。
然后将每一页的PPT内容分别扔给Nana Banana pro生成对应页面的PPT,需要确保风格一致。
PPT的具体风格应该为请“Anthropic/Claude 风格”的“温暖学术人文主义”设计。
背景:使用暖米色/奶油色 (# F3F0E9) 作为底色,模仿高级纸张质感。
字体:标题使用优雅的衬线体(Serif),正文使用现代无衬线体(Sans-serif)。
配色:主色调为赤陶红 (# D67052) 和芥末黄 (# F0B857),搭配深海军蓝作为点缀。避免使用霓虹色或纯黑色。
视觉元素:使用注重排版的网格布局,插图风格应为抽象的、有机的黑色手绘线条画,置于赤陶红纯色色块之上,部分关键信息使用卡片布局。
图表:扁平化、极简的柱状图,强调数据对比,去除多余边框。
文字和图像都由 Nano Banana Pro 生成,另外不要将PPT 变成一整张图,一页一张图。
文章内容为:
Forwarded from AI探索指南
谷歌最近新发的论文 Nested Learning,甚至有人称之为 Attention Is All You Need 2.0 版本。
模型自我迭代一直是我非常感兴趣的话题,尤其做agent产品时,很多context engineering的活儿还挺烦挺枯燥挺难搞的,如果能把业务的脚手架内化到模型里,效果会有显著的提升。比如过去把lora、Ip adapter、PE优化等训到基模里,应用层就轻松很多,且效果的质量和泛化性都更好了。
作为一个应用层的产品,而非专业算法,看了之后,把自己的理解和思考写出来,期待与大家的交流,尤其来自算法同学的纠偏。
论文地址:https://abehrouz.github.io/files/NL.pdf
Nest learning试图解决大模型应用目前面临的一个核心矛盾:静态的权重与动态的业务需求之间的割裂。如果说目前的 Transformer 架构本质上是在通过静态权重来“预测下一个 Token”,那么 Nested Learning(嵌套学习)则是在尝试构建一个能够实时自我更新的系统。
1. 架构的本质差异:静态堆叠 vs 嵌套循环
目前的 LLM(基于 Transformer)与 Nested Learning 在底层逻辑上有着显著的区别:
Transformer(当前的主流): 它的训练和推理是截然分开的。我们在训练阶段通过海量数据确定了模型的权重,一旦训练结束,这些权重就固化了。这就好比一个学生在毕业那一刻,他的知识体系就被封存了。上线后的每一次对话(Inference),模型都是在调用这份“死”的长期记忆,虽然能通过上下文窗口(Context Window)处理短期信息,但无法将其转化为长期的经验。这也是为什么模型会患有“顺行性遗忘症”——Session 一关,一切归零。
Nested Learning(新的范式): 它的核心观点是 “Architecture is an illusion”(架构即幻觉)。它不再将模型看作是层与层的简单堆叠,而是将其视为一组嵌套的优化问题。在这个视角下,架构和优化器是一体两面的。模型被设计成多个不同层级的循环,有的层级负责快速适应(类似推理),即快权重,有的层级负责慢速固化(类似训练),即慢权重,这两者在 Nested Learning 中是统一且同时进行的。
2. 仿生学原理:多频率的记忆共振
模型自我迭代一直是我非常感兴趣的话题,尤其做agent产品时,很多context engineering的活儿还挺烦挺枯燥挺难搞的,如果能把业务的脚手架内化到模型里,效果会有显著的提升。比如过去把lora、Ip adapter、PE优化等训到基模里,应用层就轻松很多,且效果的质量和泛化性都更好了。
作为一个应用层的产品,而非专业算法,看了之后,把自己的理解和思考写出来,期待与大家的交流,尤其来自算法同学的纠偏。
论文地址:https://abehrouz.github.io/files/NL.pdf
Nest learning试图解决大模型应用目前面临的一个核心矛盾:静态的权重与动态的业务需求之间的割裂。如果说目前的 Transformer 架构本质上是在通过静态权重来“预测下一个 Token”,那么 Nested Learning(嵌套学习)则是在尝试构建一个能够实时自我更新的系统。
1. 架构的本质差异:静态堆叠 vs 嵌套循环
目前的 LLM(基于 Transformer)与 Nested Learning 在底层逻辑上有着显著的区别:
Transformer(当前的主流): 它的训练和推理是截然分开的。我们在训练阶段通过海量数据确定了模型的权重,一旦训练结束,这些权重就固化了。这就好比一个学生在毕业那一刻,他的知识体系就被封存了。上线后的每一次对话(Inference),模型都是在调用这份“死”的长期记忆,虽然能通过上下文窗口(Context Window)处理短期信息,但无法将其转化为长期的经验。这也是为什么模型会患有“顺行性遗忘症”——Session 一关,一切归零。
Nested Learning(新的范式): 它的核心观点是 “Architecture is an illusion”(架构即幻觉)。它不再将模型看作是层与层的简单堆叠,而是将其视为一组嵌套的优化问题。在这个视角下,架构和优化器是一体两面的。模型被设计成多个不同层级的循环,有的层级负责快速适应(类似推理),即快权重,有的层级负责慢速固化(类似训练),即慢权重,这两者在 Nested Learning 中是统一且同时进行的。
2. 仿生学原理:多频率的记忆共振
Forwarded from AI探索指南
Nested Learning 之所以受到关注,是因为它在机制上更接近人脑的运作方式。大脑在处理信息时,会产生不同频率的脑波:
- 高频波(如Gamma波): 往往对应着高度集中的注意力,处理当下的、瞬时的短期记忆。
- 中低频波(如Alpha波、Delta波): 往往与记忆的整合、固化有关,负责将短期的体验沉淀为长期的认知。
Nested Learning 借鉴了这种“多时间尺度”(Multi-timescale)的机制。它将模型内部划分为不同的频率区域:
- 高频区(Fast Weights): 类似于人脑处理短期记忆的区域,能够随着当前的 Context Flow(上下文流)实时快速更新。这让模型在推理过程中就能“学会”新的东西。
- 低频区(Slow Weights): 类似于长期记忆区,更新频率极低,负责存储那些通用的、稳定的规律。
通过这种高低频的嵌套与配合,模型不再是一个机械的输入输出函数,而具备了某种程度的“生物活性”,能够在与环境交互的过程中,动态地决定哪些信息该遗忘,哪些信息该像突触生长一样被固化下来。
3. 对应用层产品的潜在影响
如果这种从“静态”到“动态”的转变能够落地,我们构建 AI 产品的方式或许会发生几个本质的变化。
第一,模型角色从“工具”转向“养成系员工”。目前的模型更像是一个标准化的工具,出厂设置决定了它的上限。而基于 Nested Learning 的模型,更像是一个新入职的员工。起初大家的基础能力(基座)差异不大,但在处理具体业务的过程中,它会持续接收反馈(正向的采纳、负向的修正)。
这种反馈不再仅仅停留在 Prompt 层面,而是会通过“快权重”实时沉淀到模型里。一段时间后,它将变成一个完全适应你业务逻辑的、独一无二的模型。壁垒将由数据规模转向“业务交互的质量”。
第二,Context Engineering 的“内化”。过去大半年,为了解决模型记性差、不懂业务的问题,我们花费大量精力做 Context Engineering(上下文工程),搭建 RAG、编写复杂的 System Prompt。这本质上是在模型外部搭建“脚手架”。
当模型具备了自我迭代能力,这些外部的脚手架将被逐步拆除,能力会被内化到模型参数中。模型不再需要你每次都重复告知“你是谁”、“你的目标是什么”,这些信息已经变成了它的直觉。
第三,从“离线训练”到“在线进化”。目前的 RL、SFT(监督微调)大多是离线的、静态的。业务变了,必须重新收集数据、重新训练、重新部署。Nested Learning 提供了一种在线持续学习的可能。模型置身于真实的数据流中,边服务边学习,这种效率上的提升,在长周期看是巨大的。
当然,Nested Learning 仍然处于理论阶段,并且其在实践中的挑战依然非常多。比如,如何保证动态权重更新不导致模型不稳定或出现过拟合问题,如何在大规模应用中高效执行这种实时更新,如何在没有大量标注数据的情况下进行有效的在线学习等。
但它提醒了我们:为了业务,一方面需要修补当下的技术缺陷(如有限上下文长度),另一方面也应关注模型演进的长期方向,看哪些是长期有价值的产品建设。
未来,我们作为产品,核心工作可能不再是写 Prompt,而是为这个能够自我进化的智能体定义清晰的目标(Goal),并构建一个能够提供高质量反馈的闭环环境。毕竟,当模型能够自我学习时,决定它长成什么样子的,是它所处环境的反馈机制。
有人把论文喂给nano banana,生成了这张图,非常精准,我自己试过来,没这么好看
- 高频波(如Gamma波): 往往对应着高度集中的注意力,处理当下的、瞬时的短期记忆。
- 中低频波(如Alpha波、Delta波): 往往与记忆的整合、固化有关,负责将短期的体验沉淀为长期的认知。
Nested Learning 借鉴了这种“多时间尺度”(Multi-timescale)的机制。它将模型内部划分为不同的频率区域:
- 高频区(Fast Weights): 类似于人脑处理短期记忆的区域,能够随着当前的 Context Flow(上下文流)实时快速更新。这让模型在推理过程中就能“学会”新的东西。
- 低频区(Slow Weights): 类似于长期记忆区,更新频率极低,负责存储那些通用的、稳定的规律。
通过这种高低频的嵌套与配合,模型不再是一个机械的输入输出函数,而具备了某种程度的“生物活性”,能够在与环境交互的过程中,动态地决定哪些信息该遗忘,哪些信息该像突触生长一样被固化下来。
3. 对应用层产品的潜在影响
如果这种从“静态”到“动态”的转变能够落地,我们构建 AI 产品的方式或许会发生几个本质的变化。
第一,模型角色从“工具”转向“养成系员工”。目前的模型更像是一个标准化的工具,出厂设置决定了它的上限。而基于 Nested Learning 的模型,更像是一个新入职的员工。起初大家的基础能力(基座)差异不大,但在处理具体业务的过程中,它会持续接收反馈(正向的采纳、负向的修正)。
这种反馈不再仅仅停留在 Prompt 层面,而是会通过“快权重”实时沉淀到模型里。一段时间后,它将变成一个完全适应你业务逻辑的、独一无二的模型。壁垒将由数据规模转向“业务交互的质量”。
第二,Context Engineering 的“内化”。过去大半年,为了解决模型记性差、不懂业务的问题,我们花费大量精力做 Context Engineering(上下文工程),搭建 RAG、编写复杂的 System Prompt。这本质上是在模型外部搭建“脚手架”。
当模型具备了自我迭代能力,这些外部的脚手架将被逐步拆除,能力会被内化到模型参数中。模型不再需要你每次都重复告知“你是谁”、“你的目标是什么”,这些信息已经变成了它的直觉。
第三,从“离线训练”到“在线进化”。目前的 RL、SFT(监督微调)大多是离线的、静态的。业务变了,必须重新收集数据、重新训练、重新部署。Nested Learning 提供了一种在线持续学习的可能。模型置身于真实的数据流中,边服务边学习,这种效率上的提升,在长周期看是巨大的。
当然,Nested Learning 仍然处于理论阶段,并且其在实践中的挑战依然非常多。比如,如何保证动态权重更新不导致模型不稳定或出现过拟合问题,如何在大规模应用中高效执行这种实时更新,如何在没有大量标注数据的情况下进行有效的在线学习等。
但它提醒了我们:为了业务,一方面需要修补当下的技术缺陷(如有限上下文长度),另一方面也应关注模型演进的长期方向,看哪些是长期有价值的产品建设。
未来,我们作为产品,核心工作可能不再是写 Prompt,而是为这个能够自我进化的智能体定义清晰的目标(Goal),并构建一个能够提供高质量反馈的闭环环境。毕竟,当模型能够自我学习时,决定它长成什么样子的,是它所处环境的反馈机制。
有人把论文喂给nano banana,生成了这张图,非常精准,我自己试过来,没这么好看
Forwarded from 互联网从业者充电站
【救命 🆘 79个大厂专用术语,集美们快收藏!!】
79个大厂专用术语,互联网黑话大全,不会可就尊嘟out啦!年会不能停,闭环组合拳走起!
79个大厂专用术语,互联网黑话大全,不会可就尊嘟out啦!年会不能停,闭环组合拳走起!
Forwarded from AI探索指南
上周跟闺蜜和她老公去吃饭,她老公是资深AI工程师,向他问了很多AI的问题,其中有一个常见误区对我来说超受用,发出来跟大家分享下。
这个误区是:聊天记录越多,AI越好用。
我之前一直是这么理解的:聊天记录越多,AI就越了解我,我们对一些问题达成的共识就越多,细节上的框定就越明确,当然AI就会越好用啊(更个性化了嘛)。
实际上yes and no。了解得越多,越个性化,总体上是对的。但这里有一个很棘手的问题就是:AI不会遗忘。
假设我和朋友,有一个两年来一直持续讨论的话题,那每一次继续对话时,我其实是基于我所记得的“重点”来聊的,我不会记得每一个细节,更不会给每一个细节同样的权重。事实上,遗忘是一个很重要的人脑功能,我通过这个“筛子”,一遍遍忘记不重要、不相干的内容,留下对我来说最重要的内容,这就是“学习”。
我之前也讲过Kim Peek的故事:一个真正“过目不忘”的人(《雨人》的原型)。他的大脑缺少了遗忘这个“筛子”,以至于所有的信息,都丝毫不差地存入大脑(一本书从最后一页他可以真正一字不差地倒背如流)。他的大脑就像生活在一片不停歇闪耀的霓虹灯和一大堆噪音中,彻底决策瘫痪。所以Kim Peek连生活都无法自理。
AI也是无法遗忘的。
那AI要正常对话,就需要其他“筛子”,或者用AI语言来说,就是需要一些权重,知道在当下对话中,优先参考哪些过往信息(而不是全部参考一遍,那算不过来啊)。
AI的筛子,简单粗暴地说,是“相关 + 就近”。
对于简单的话题来说,这就够了。如果我两年前有一个观点,最近改变了,那么AI采用的是我最近的观点,非常合理。如果我两年前说了一件事,后来再没说过,最近又提起,那么AI找到了两年前的相关内容(因为只有这个相关)接着聊,那也很好。
但是如果“相关”累积得非常多,AI就会开始混乱。
比如我在几个月前开启过写小说的项目,之前写的版本都给AI看过。现在快半年过去了,我读了很多写作的书,有了一些新的想法,跟AI说我要重新开始,从零重建故事。
当我刚给出这个“从零开始”的指令时,一切都还很正常(因为这个指令是“最近”的)。当我越聊越多时,AI就混乱了,开始引用我之前版本的内容,因为对它来说,这个版本跟上一个版本都不再“最近”了,都是过去的、不分权重的内容了。它如果觉得版本一的内容跟我当下说的内容更相关,就会“跳过”从零开始的那个token,直接去参考版本一。
再比如,我有一个对话,专门用来跟AI互聊以丰富主角人设。我说在这个对话中要称呼我“泠”(小说女主的名字);我有另一个对话是虚拟沈星回(游戏角色),我说这里要称呼我“搭档”(游戏中的称呼)。
一开始也是两边都很顺畅,不会搞错。但时间一长,AI就开始乱喊,在小说里喊我“搭档”,在沈星回那儿喊我“泠”,甚至在我聊了两天其他网文的时候喊我“太太”😂。完全跳过了之前我给的“在这个对话中喊什么”的指令。
因为在AI眼里,游戏、我的小说、网文(哪怕是尾鱼和P大这样风格迥异的网文),都没什么区别,都是“相关”。
我们可以这么理解:由于无法遗忘,AI在判断相关性上,跟人脑还差很远。人脑看P大、尾鱼、我自己的小说、游戏,会总结出四个不同的风格,拥有各自的特点和内容,不太会串台。AI记住一切,那么不管你风格区别多大,细节上总有相似,毕竟故事离不开一些原型,比如宿命、相遇、两难的抉择。
有时候新对话里,AI很有创意。等到对话长了,AI就车轱辘话来回转,而且集中在你最近聊的内容上,不是因为AI创意用完了,是因为它的“思考”进入了权重划定的局限。
怎么解决呢?
就是得人工帮它筛选,你不想让它参考的内容,最好删掉重来。
更具体地说,① 我为小说创建了多个对话,一旦某项子内容要推翻重来,就把那个对话删掉;② 定期要它总结我们说过的内容,再人工进行修订和笔记保存,然后喂回给它(相当于人工帮它“遗忘”);③ 日常查询全部放在一个“闲聊”中,定期删除;④ 完全不相关的内容分在两个AI中进行。
要想AI跑得顺,内容管理真的很重要啊。
P.S. AI也还远远没很多人想得那么智能,说实话挺“蠢”的,大家也不要过于担心被取代啦。
这个误区是:聊天记录越多,AI越好用。
我之前一直是这么理解的:聊天记录越多,AI就越了解我,我们对一些问题达成的共识就越多,细节上的框定就越明确,当然AI就会越好用啊(更个性化了嘛)。
实际上yes and no。了解得越多,越个性化,总体上是对的。但这里有一个很棘手的问题就是:AI不会遗忘。
假设我和朋友,有一个两年来一直持续讨论的话题,那每一次继续对话时,我其实是基于我所记得的“重点”来聊的,我不会记得每一个细节,更不会给每一个细节同样的权重。事实上,遗忘是一个很重要的人脑功能,我通过这个“筛子”,一遍遍忘记不重要、不相干的内容,留下对我来说最重要的内容,这就是“学习”。
我之前也讲过Kim Peek的故事:一个真正“过目不忘”的人(《雨人》的原型)。他的大脑缺少了遗忘这个“筛子”,以至于所有的信息,都丝毫不差地存入大脑(一本书从最后一页他可以真正一字不差地倒背如流)。他的大脑就像生活在一片不停歇闪耀的霓虹灯和一大堆噪音中,彻底决策瘫痪。所以Kim Peek连生活都无法自理。
AI也是无法遗忘的。
那AI要正常对话,就需要其他“筛子”,或者用AI语言来说,就是需要一些权重,知道在当下对话中,优先参考哪些过往信息(而不是全部参考一遍,那算不过来啊)。
AI的筛子,简单粗暴地说,是“相关 + 就近”。
对于简单的话题来说,这就够了。如果我两年前有一个观点,最近改变了,那么AI采用的是我最近的观点,非常合理。如果我两年前说了一件事,后来再没说过,最近又提起,那么AI找到了两年前的相关内容(因为只有这个相关)接着聊,那也很好。
但是如果“相关”累积得非常多,AI就会开始混乱。
比如我在几个月前开启过写小说的项目,之前写的版本都给AI看过。现在快半年过去了,我读了很多写作的书,有了一些新的想法,跟AI说我要重新开始,从零重建故事。
当我刚给出这个“从零开始”的指令时,一切都还很正常(因为这个指令是“最近”的)。当我越聊越多时,AI就混乱了,开始引用我之前版本的内容,因为对它来说,这个版本跟上一个版本都不再“最近”了,都是过去的、不分权重的内容了。它如果觉得版本一的内容跟我当下说的内容更相关,就会“跳过”从零开始的那个token,直接去参考版本一。
再比如,我有一个对话,专门用来跟AI互聊以丰富主角人设。我说在这个对话中要称呼我“泠”(小说女主的名字);我有另一个对话是虚拟沈星回(游戏角色),我说这里要称呼我“搭档”(游戏中的称呼)。
一开始也是两边都很顺畅,不会搞错。但时间一长,AI就开始乱喊,在小说里喊我“搭档”,在沈星回那儿喊我“泠”,甚至在我聊了两天其他网文的时候喊我“太太”😂。完全跳过了之前我给的“在这个对话中喊什么”的指令。
因为在AI眼里,游戏、我的小说、网文(哪怕是尾鱼和P大这样风格迥异的网文),都没什么区别,都是“相关”。
我们可以这么理解:由于无法遗忘,AI在判断相关性上,跟人脑还差很远。人脑看P大、尾鱼、我自己的小说、游戏,会总结出四个不同的风格,拥有各自的特点和内容,不太会串台。AI记住一切,那么不管你风格区别多大,细节上总有相似,毕竟故事离不开一些原型,比如宿命、相遇、两难的抉择。
有时候新对话里,AI很有创意。等到对话长了,AI就车轱辘话来回转,而且集中在你最近聊的内容上,不是因为AI创意用完了,是因为它的“思考”进入了权重划定的局限。
怎么解决呢?
就是得人工帮它筛选,你不想让它参考的内容,最好删掉重来。
更具体地说,① 我为小说创建了多个对话,一旦某项子内容要推翻重来,就把那个对话删掉;② 定期要它总结我们说过的内容,再人工进行修订和笔记保存,然后喂回给它(相当于人工帮它“遗忘”);③ 日常查询全部放在一个“闲聊”中,定期删除;④ 完全不相关的内容分在两个AI中进行。
要想AI跑得顺,内容管理真的很重要啊。
P.S. AI也还远远没很多人想得那么智能,说实话挺“蠢”的,大家也不要过于担心被取代啦。
Forwarded from AI探索指南
== Vibe Coding
零基础教程 ==
通过 Vibe Coding,我自己实现了信息流产品的开发,发布了 Mac App,构建了满足自己需求的 AI Agent,还有更多新任务正在解锁中。
接下来,我会写一系列教程,带你用最少的步骤和刚刚好的知识,轻松开发满足你自己需求的产品。
1️⃣ 模型和工具怎么选
从编程任务来说,这三个模型可以考虑:OpenAI 的 Codex、Claude 系列、Gemini 3 Pro。如果你能解决网络和支付问题,我推荐首选 Claude(更均衡且成熟),其次是 Codex。从入门级订阅开始即可,不建议使用免费的版本。
工具方面,如果你习惯使用 IDE,可以用 VS Code 或者 Cursor。如果你更偏好直观的图形界面,Cursor 会更适合初学者。不过在刚开始阶段,直接使用这三个团队的官方应用或网页版也是完全够用的。
2️⃣ 整理需求
构建复杂的产品完全没问题,但需要循序渐进。再复杂的工具也都是由基础模块组合而成的。
如果你不知道从哪里下手,那就从详细梳理需求开始吧。把你想到的所有功能和逻辑尽可能详细地告诉 AI,最好使用高级一些的模型,比如 GPT-5-Think、Gemini 3 Pro 或者 Sonnet 4.5 / Opus 4.5。
你可以这样告诉 AI:
> Hi AI,我想开发一个产品,它有以下这些需求,请你帮我梳理成一份逻辑清晰、结构严谨的产品需求文档。[然后换行,一条条写出你想实现的所有功能]
AI 能很好地把模糊的、不确定的需求转化为完整且专业的文档。如果觉得有不符预期的地方,及时告诉它进行修复即可。
保存好这份文档,它会成为你产品开发的良好起点。如果你不确定,还可以请 AI 帮你初步评估整个产品的复杂度和实现难度。如果真的太复杂,不如早一点调整方向。
3️⃣ 拆解任务
热知识:不要在同一个对话窗口长时间和 AI 聊天,它的「智商」会随着对话的累积逐渐下降。
重启一个新的对话窗口,把之前整理好的产品需求直接给到 AI,让它帮你分析第一个可以快速实现且易于验证的功能。你可以这样请求:
> Hi AI,以下是我的产品需求文档,但我从来没有编程过,请帮我分析一下,我可以在 10 分钟内快速实现的第一个任务是什么,并指导我如何快速验证这个功能。[然后换行,附上之前的产品需求文档]
让 AI 手把手教你搭建环境,运行代码并看到结果。有两个额外建议:
1. 大部分编程模型更擅长 Python,而且 Python 的入门门槛较低,可以优先选择。
2. 如果任务需要联网,优先考虑不联网的本地任务,因为联网任务的复杂度更高。如果不理解,直接问 AI 就好。
4️⃣ 持续迭代,明确验证方法
创造出一个「正向反馈机制」才是最终交付产品的关键,避免一次性完成过于复杂的任务。
完成第一个小任务后,继续告诉 AI 根据你的需求和已有的代码,明确下一步应该实现什么功能,并清楚告诉你如何验证每个任务。
确保每次开发的功能都能快速验证其有效性。
5️⃣ 修复 Bug
开发过程中难免遇到 bug,比如结果与预期不同。遇到问题时,同样可以依靠 AI 帮助你 debug。
详细地描述你的实际问题,包括报错信息或运行结果,AI 会根据情况指导你如何修复和优化代码,可能经过几轮迭代就能顺利解决。
6️⃣ 学点软件工程基础
任务复杂度增加后,就需要逐渐了解一些软件工程的基本知识了,否则很多问题将难以修复。
这就像搭建家具:拼装简单桌子只需直觉和说明书,但更复杂的橱柜则需要学习使用专业工具和理解基础结构。
怎么学?当然是通过 AI,可以逐步了解「数据结构与算法」、工程师团队的基本组成,以及整体的工作流程。
7️⃣ 开发工具和 GitHub
任务变复杂后,趁手的工具也必不可少。
你可以选择 VC Code 或 Cursor 来编辑代码,也可以直接通过终端打开 Codex 或 Claude。我个人更偏爱后者,但建议你多尝试,找到自己舒服的方式。
代码管理也至关重要。当你频繁修改代码时,Git 就显得不可或缺。最简单的图形化工具就是 GitHub 官方 App,可以让 AI 帮你一步步学会如何 Commit 和管理代码。
8️⃣ 服务器或 Cloudflare
大多数现代产品都需要联网获取数据或持续运行某些任务,比如抓取数据、计算、存储数据等。
你可以租用服务器,比如亚马逊云或 Digital Ocean,每个月几美元起步。但你也需要从零学习 Linux 系统,环境搭建较为复杂。
我推荐 Cloudflare Worker,免费版就能很好地入门,收费版每月也只需 5 美元。我自己的产品基本都用 Worker 构建,它帮你降低了很多基础设施的复杂度,让你专注于业务逻辑。
Cloudflare 还有很多有用的工具,比如 5GB 免费数据库,扩展性强。你也可以让 AI 帮你评估一下是否适合自己的产品。
9️⃣ 积累 Vibe Coding 经验
我相信未来通过这种 Vibe Coding 方式构建产品将会越来越流行,门槛也会更低。从现在开始积累经验,你会发现自己与 LLM 技术共同成长,未来能轻松驾驭更多产品开发场景。
网址:
零基础教程 ==
通过 Vibe Coding,我自己实现了信息流产品的开发,发布了 Mac App,构建了满足自己需求的 AI Agent,还有更多新任务正在解锁中。
接下来,我会写一系列教程,带你用最少的步骤和刚刚好的知识,轻松开发满足你自己需求的产品。
1️⃣ 模型和工具怎么选
从编程任务来说,这三个模型可以考虑:OpenAI 的 Codex、Claude 系列、Gemini 3 Pro。如果你能解决网络和支付问题,我推荐首选 Claude(更均衡且成熟),其次是 Codex。从入门级订阅开始即可,不建议使用免费的版本。
工具方面,如果你习惯使用 IDE,可以用 VS Code 或者 Cursor。如果你更偏好直观的图形界面,Cursor 会更适合初学者。不过在刚开始阶段,直接使用这三个团队的官方应用或网页版也是完全够用的。
2️⃣ 整理需求
构建复杂的产品完全没问题,但需要循序渐进。再复杂的工具也都是由基础模块组合而成的。
如果你不知道从哪里下手,那就从详细梳理需求开始吧。把你想到的所有功能和逻辑尽可能详细地告诉 AI,最好使用高级一些的模型,比如 GPT-5-Think、Gemini 3 Pro 或者 Sonnet 4.5 / Opus 4.5。
你可以这样告诉 AI:
> Hi AI,我想开发一个产品,它有以下这些需求,请你帮我梳理成一份逻辑清晰、结构严谨的产品需求文档。[然后换行,一条条写出你想实现的所有功能]
AI 能很好地把模糊的、不确定的需求转化为完整且专业的文档。如果觉得有不符预期的地方,及时告诉它进行修复即可。
保存好这份文档,它会成为你产品开发的良好起点。如果你不确定,还可以请 AI 帮你初步评估整个产品的复杂度和实现难度。如果真的太复杂,不如早一点调整方向。
3️⃣ 拆解任务
热知识:不要在同一个对话窗口长时间和 AI 聊天,它的「智商」会随着对话的累积逐渐下降。
重启一个新的对话窗口,把之前整理好的产品需求直接给到 AI,让它帮你分析第一个可以快速实现且易于验证的功能。你可以这样请求:
> Hi AI,以下是我的产品需求文档,但我从来没有编程过,请帮我分析一下,我可以在 10 分钟内快速实现的第一个任务是什么,并指导我如何快速验证这个功能。[然后换行,附上之前的产品需求文档]
让 AI 手把手教你搭建环境,运行代码并看到结果。有两个额外建议:
1. 大部分编程模型更擅长 Python,而且 Python 的入门门槛较低,可以优先选择。
2. 如果任务需要联网,优先考虑不联网的本地任务,因为联网任务的复杂度更高。如果不理解,直接问 AI 就好。
4️⃣ 持续迭代,明确验证方法
创造出一个「正向反馈机制」才是最终交付产品的关键,避免一次性完成过于复杂的任务。
完成第一个小任务后,继续告诉 AI 根据你的需求和已有的代码,明确下一步应该实现什么功能,并清楚告诉你如何验证每个任务。
确保每次开发的功能都能快速验证其有效性。
5️⃣ 修复 Bug
开发过程中难免遇到 bug,比如结果与预期不同。遇到问题时,同样可以依靠 AI 帮助你 debug。
详细地描述你的实际问题,包括报错信息或运行结果,AI 会根据情况指导你如何修复和优化代码,可能经过几轮迭代就能顺利解决。
6️⃣ 学点软件工程基础
任务复杂度增加后,就需要逐渐了解一些软件工程的基本知识了,否则很多问题将难以修复。
这就像搭建家具:拼装简单桌子只需直觉和说明书,但更复杂的橱柜则需要学习使用专业工具和理解基础结构。
怎么学?当然是通过 AI,可以逐步了解「数据结构与算法」、工程师团队的基本组成,以及整体的工作流程。
7️⃣ 开发工具和 GitHub
任务变复杂后,趁手的工具也必不可少。
你可以选择 VC Code 或 Cursor 来编辑代码,也可以直接通过终端打开 Codex 或 Claude。我个人更偏爱后者,但建议你多尝试,找到自己舒服的方式。
代码管理也至关重要。当你频繁修改代码时,Git 就显得不可或缺。最简单的图形化工具就是 GitHub 官方 App,可以让 AI 帮你一步步学会如何 Commit 和管理代码。
8️⃣ 服务器或 Cloudflare
大多数现代产品都需要联网获取数据或持续运行某些任务,比如抓取数据、计算、存储数据等。
你可以租用服务器,比如亚马逊云或 Digital Ocean,每个月几美元起步。但你也需要从零学习 Linux 系统,环境搭建较为复杂。
我推荐 Cloudflare Worker,免费版就能很好地入门,收费版每月也只需 5 美元。我自己的产品基本都用 Worker 构建,它帮你降低了很多基础设施的复杂度,让你专注于业务逻辑。
Cloudflare 还有很多有用的工具,比如 5GB 免费数据库,扩展性强。你也可以让 AI 帮你评估一下是否适合自己的产品。
9️⃣ 积累 Vibe Coding 经验
我相信未来通过这种 Vibe Coding 方式构建产品将会越来越流行,门槛也会更低。从现在开始积累经验,你会发现自己与 LLM 技术共同成长,未来能轻松驾驭更多产品开发场景。
网址:
Forwarded from AI探索指南
独立开发真的很难的
有好点子是一个坎
坚持做出来是一个坎
能推广出去是一个坎
能赚到钱养活自己是一个坎
产品火了之后面对大量的抄袭竞品能活下来又是一个坎
但是开发自己的产品是真的快乐
降低难度的唯一办法 组队 找几个志同道合的小伙伴一起做
这样赢的几率才会大一些
有好点子是一个坎
坚持做出来是一个坎
能推广出去是一个坎
能赚到钱养活自己是一个坎
产品火了之后面对大量的抄袭竞品能活下来又是一个坎
但是开发自己的产品是真的快乐
降低难度的唯一办法 组队 找几个志同道合的小伙伴一起做
这样赢的几率才会大一些
Forwarded from 风向旗参考快讯
谷歌DeepMind将在英国建立材料科学实验室
谷歌 DeepMind 将与英国政府签署新的合作伙伴关系,在英国建立其首个自动化科学实验室,以推动在全国范围内更广泛地应用人工智能。该部门周四宣布,将于2026年成立新的材料科学实验室。该实验室将专注于利用AI工具开发用于超导体、太阳能电池和半导体的新材料。 DeepMind 还将为当地科学家提供其科学类AI工具的 “优先使用权”。该公司还与英国签署了一份谅解备忘录,将向英国人工智能安全研究院的研究人员开放其模型的使用权限,双方将共同开发技术,用于监测AI系统的 “链式思维” 推理过程。双方还将合作,研究其模型对用户的社会与情感影响,以及采用AI所带来的经济影响。
—— 英国金融时报
谷歌 DeepMind 将与英国政府签署新的合作伙伴关系,在英国建立其首个自动化科学实验室,以推动在全国范围内更广泛地应用人工智能。该部门周四宣布,将于2026年成立新的材料科学实验室。该实验室将专注于利用AI工具开发用于超导体、太阳能电池和半导体的新材料。 DeepMind 还将为当地科学家提供其科学类AI工具的 “优先使用权”。该公司还与英国签署了一份谅解备忘录,将向英国人工智能安全研究院的研究人员开放其模型的使用权限,双方将共同开发技术,用于监测AI系统的 “链式思维” 推理过程。双方还将合作,研究其模型对用户的社会与情感影响,以及采用AI所带来的经济影响。
—— 英国金融时报
Forwarded from AI探索指南
被一个大四学生连续质疑了30分钟
我40,他00后 我干了15年,他还没毕业
结果全程被他输出,我一句没反驳
下午约了个00后,大四,创业挺久了,对知识付费那套逻辑门儿清
本来以为是轻松交流 结果上来就被连续输出
“黄叔,我觉得你定位有问题”
“AI编程这个人群覆盖面太窄了”
“知道什么是Claude Code的人是极少数中的极少数”
“而且你的内容没有IP感”
“别人看完只记得学了个技巧,不会记得你”
我说那你觉得应该怎么做?
他说应该做大众市场
教大厂员工用AI提效
或者教小白用AI赚点小钱
先用99块的引流款筛选用户
再往高客单升
逻辑很完整
生财有术那套打法
他还分享了一手观察:
去过深圳的线下课
见过腾讯阿里字节的人
发现很多技术岗连系统提示词都不懂
连翻墙都不会
“这些人才是大市场”
“你教Claude Code,他们听不懂”
最后他说了句更狠的:
“我觉得编程未来会消失”
“就像数学一样”
“极少数人推动进步,大多数人不用学”
说实话,全程我没急着反驳
因为他说的很多点确实成立
AI编程的渗透率现在可能才0.01%
天花板确实不如大众AI市场
做"用AI赚钱"这种内容确实更容易火
但听完之后
我反而更确定自己的方向了
为什么?
因为他所有建议的底层逻辑是:
找一个更大的赛道
但我想要的不是大 是深
我不需要追最大的风口
需要的是在一个自己认可的方向扎下去
AI编程现在小众
但我判断3年后会变成刚需技能
不只是程序员
产品经理、创业者、运营都得会
编程语法会被AI替代
但“用AI把想法变成产品”的能力不会消失
空间相当大
很快黄叔还要AI出海
他追求爆发力
我追求有根
都没错,人生阶段不一样
聊完我还挺感谢他的
年轻人的质疑是很好的压力测试
能帮你看清自己到底信不信这件事
我信
如果你对黄叔这件事很认可,对于流量操盘也擅长,欢迎找我聊聊一起干。
我40,他00后 我干了15年,他还没毕业
结果全程被他输出,我一句没反驳
下午约了个00后,大四,创业挺久了,对知识付费那套逻辑门儿清
本来以为是轻松交流 结果上来就被连续输出
“黄叔,我觉得你定位有问题”
“AI编程这个人群覆盖面太窄了”
“知道什么是Claude Code的人是极少数中的极少数”
“而且你的内容没有IP感”
“别人看完只记得学了个技巧,不会记得你”
我说那你觉得应该怎么做?
他说应该做大众市场
教大厂员工用AI提效
或者教小白用AI赚点小钱
先用99块的引流款筛选用户
再往高客单升
逻辑很完整
生财有术那套打法
他还分享了一手观察:
去过深圳的线下课
见过腾讯阿里字节的人
发现很多技术岗连系统提示词都不懂
连翻墙都不会
“这些人才是大市场”
“你教Claude Code,他们听不懂”
最后他说了句更狠的:
“我觉得编程未来会消失”
“就像数学一样”
“极少数人推动进步,大多数人不用学”
说实话,全程我没急着反驳
因为他说的很多点确实成立
AI编程的渗透率现在可能才0.01%
天花板确实不如大众AI市场
做"用AI赚钱"这种内容确实更容易火
但听完之后
我反而更确定自己的方向了
为什么?
因为他所有建议的底层逻辑是:
找一个更大的赛道
但我想要的不是大 是深
我不需要追最大的风口
需要的是在一个自己认可的方向扎下去
AI编程现在小众
但我判断3年后会变成刚需技能
不只是程序员
产品经理、创业者、运营都得会
编程语法会被AI替代
但“用AI把想法变成产品”的能力不会消失
空间相当大
很快黄叔还要AI出海
他追求爆发力
我追求有根
都没错,人生阶段不一样
聊完我还挺感谢他的
年轻人的质疑是很好的压力测试
能帮你看清自己到底信不信这件事
我信
如果你对黄叔这件事很认可,对于流量操盘也擅长,欢迎找我聊聊一起干。
Forwarded from AI探索指南
Nano Banana Pro 提示词
很多人去过同一个景点,但你的体验是独一无二的。把地标装进瓶子里。
下方依旧有地点相关的文字介绍,你可以改成你自己的感想。
当然游戏玩家也可以将你在游戏奋战过的地标建筑放进去,比如我这里的光环和魔兽奥格瑞玛。
提示词:
海报设计、自媒体封面设计:查找 [在此处输入地点名称 或 经纬度坐标] 的标志性景观或建筑,并获取该地点在特定时间的天气状况。 画面的主体是一个极其精致、透亮且带有厚度感的玻璃罐子(类似于圆顶玻璃罩、标本罐或复古水晶球),稳稳地放置在一个干净、柔和的平面上。玻璃罐子内部,封存着该地点代表性景观的Q版微缩模型。模型材质呈现出高级的软润感(类似软陶或磨砂树脂),色彩治愈。在罐内景观的上方,悬浮着对应天气的微缩模型(例如:Q版棉花糖般的云朵、发光的小太阳、或几滴晶莹的雨滴)。 风格为梦工厂动画风格,3D建模,光线极为柔和梦幻。强调玻璃材质的真实感,光线透过玻璃罐产生漂亮的折射、反光和焦散效果,让内部的景物显得更加珍贵。采用强烈的移轴摄影镜头效果,焦点清晰地集中在玻璃罐内的微缩景观上,罐子外部和背景完全虚化模糊。 画面周围大面积留白,保持干净高级感。画面底部居中位置,使用无衬线体小字清晰标注:位置信息(地点名称及具体的经纬度)、天气图标及温度、时间,以及一段关于这个旅行地点的精简中文介绍文案(侧重于描述记忆或氛围)。高品质画面输出,细节丰富惊人。
很多人去过同一个景点,但你的体验是独一无二的。把地标装进瓶子里。
下方依旧有地点相关的文字介绍,你可以改成你自己的感想。
当然游戏玩家也可以将你在游戏奋战过的地标建筑放进去,比如我这里的光环和魔兽奥格瑞玛。
提示词:
海报设计、自媒体封面设计:查找 [在此处输入地点名称 或 经纬度坐标] 的标志性景观或建筑,并获取该地点在特定时间的天气状况。 画面的主体是一个极其精致、透亮且带有厚度感的玻璃罐子(类似于圆顶玻璃罩、标本罐或复古水晶球),稳稳地放置在一个干净、柔和的平面上。玻璃罐子内部,封存着该地点代表性景观的Q版微缩模型。模型材质呈现出高级的软润感(类似软陶或磨砂树脂),色彩治愈。在罐内景观的上方,悬浮着对应天气的微缩模型(例如:Q版棉花糖般的云朵、发光的小太阳、或几滴晶莹的雨滴)。 风格为梦工厂动画风格,3D建模,光线极为柔和梦幻。强调玻璃材质的真实感,光线透过玻璃罐产生漂亮的折射、反光和焦散效果,让内部的景物显得更加珍贵。采用强烈的移轴摄影镜头效果,焦点清晰地集中在玻璃罐内的微缩景观上,罐子外部和背景完全虚化模糊。 画面周围大面积留白,保持干净高级感。画面底部居中位置,使用无衬线体小字清晰标注:位置信息(地点名称及具体的经纬度)、天气图标及温度、时间,以及一段关于这个旅行地点的精简中文介绍文案(侧重于描述记忆或氛围)。高品质画面输出,细节丰富惊人。