DPS Build
988 subscribers
147 photos
3 videos
10 files
490 links
AI, coding, data science and startups
Download Telegram
Forwarded from DPS Main
近距离观察了朋友怎么用 AI,然后给了一些建议。

背景是我们合作在写一套培训课程,有比较特殊的文件要求 (scorn),我们两人精力有限,都想借助 AI 完成大部分工作。我们的分工是我朋友负责文字和图片内容,我负责除此之外的所有。

所以最近几周,我构建了大量的工具,比如课程内容写在 yml 文件里,然后可以渲染成 html,这样就可以在浏览器里预览所有内容和交互。还把客户的要求全都提炼出来,形成一套半自动生成内容,全自动渲染部署的系统(他们非常主观,没有系统性的书面要求)。

结果和我朋友之前产生了不小的 gap,我在项目里特地为她的 agent 优化,这样只要她的 claude 读到项目,理论上就可以无缝衔接。但无论怎么试,发现有巨大的隔阂。

直到今天近距离观察她是怎么用的,才发现原因:

1. 她打开 cluade desktop,然后手敲一大行 prompt,让 claude 根据素材生成 prompt;

2. 然后把相应的文件和上面的 prompt 放到千问的聊天框里,让千问干活;

3. 然后再把千问的结果贴回 claude,然后又问 claude 哪些地方需要插图,并要它生成图片的 prompt;

4. 再把这些贴到 Meta AI 里的聊天框,生成图片。再下载回来,丢给 claude。

如此反复。

我建议她:

1. 使用 paseo 来调度不同的 agent;

2. 安装 opencode,这样可以用 qwen 的 API,而且不贵。

3. 可以在 paseo 里直接用 claude 调用 opencode cli。让 claude 读到项目的上下文,然后生成相应的 prompt,直接调用 qwen 生成内容;

4. 预览之后,要求 qwen 修复一些问题;

5. 然后让 claude 查看什么地方适合插图,看看项目里是否已经有爬取的图片或者生成的图片可以直接用,没有的话,生成 prompt 丢给 codex 去生成图片;

6. 然后把生成的图片,和相应的 prompt 写成图片描述,存到 manifest 里。以后再用的时候,就可以通过 manifest 直接定位到图片。

对了,以上几步都生成了 skill,以后她都不用怎么手敲 prompt 了,只要 / 就能调用 skill
👍3
Vibe coding 最大的代价就是体重飙升,今年长了5公斤。

每周三四次的训练我也没断啊,要是没这些,岂不是长更多?

看来要 vibe fitting 了
为了研究一个抄袭问题,重新开始学习各种语言学 / NLP 知识,也算是回炉重造了
这两天学到的一个技巧是,跑一个主对话,只让它做调度,活全派给 subagents,subagents 的 model 也让它来调度。省 token,省 context window。

举个例子,我在主对话里跑 opus 4.6,让它根据项目进度安排活,然后指派给 subagents with proper models。一般它会调 sonnet 或者 haiku,并且会自动把任务计划写好,等着 subagent 跑完会回报进度。

简单来说就是 mapreduce。尤其适合睡前安排任务跑过夜。
👍3
DPS Build
这两天学到的一个技巧是,跑一个主对话,只让它做调度,活全派给 subagents,subagents 的 model 也让它来调度。省 token,省 context window。 举个例子,我在主对话里跑 opus 4.6,让它根据项目进度安排活,然后指派给 subagents with proper models。一般它会调 sonnet 或者 haiku,并且会自动把任务计划写好,等着 subagent 跑完会回报进度。 简单来说就是 mapreduce。尤其适合睡前安排任务跑过夜。
再多说几句这个方法吧:

1. 主对话 opus 其实够了,如果特别难的问题,可以让它交给 subagent,在那里面调用 fable 或者 gpt 5.6 sol,这样比主对话里直接用 fable 要省很多 token;

2. 因为主对话可能会跑得很长,所以尽量选用 1m 的窗口,这样不怎么担心要不要压缩;

3. 真要压缩了不如写个 handoff doc,重新开一个主对话;

4. 主对话里基本上不用 plan 模式了,因为丢给 subagent 的时候,基本上就相当于在 subagent 里来了一个 plan 模式。这样的好处,也是在省主对话的 token,subagent 随用随抛,不占主对话的窗口。
好家伙,让 fable 和 sol 调查完之后,opus 一口气开了31个 subagents 干活😅
DPS Build
为了研究一个抄袭问题,重新开始学习各种语言学 / NLP 知识,也算是回炉重造了
不少人问我怎么弄的,确实所有的代码都是 vibe code 的,不是两三个 skill 能讲清楚的。

这几天重温了很多 NLP 的算法,以前要搞清楚一个算法细节,需要读论文,找实现,标注数据,做实验,反复好几轮。有了 agent 之后,迭代速度快多了,但是大方向还是需要人来把控。

就像一个完全写过代码的人完全不知道有 git 一样,如果之前没有那么多年的 nlp 经验,我也不可能这么快地指挥 agent 干活。同理,现在上手前端项目,对我来说还是有许多未知的。

所以么,我当然看得到 AI 的潜力,但是对于人而言,要知道自己有不知道的领域才是最大的挑战。

最后说一句,最近听说很多律所严禁刚入行的律师使用 AI,直到两三年之后才能用。我觉得挺有道理的,这样不仅可以让他们知道哪些是可以学会的,哪些是可以交给 AI 代劳的,哪些是自己不知道的。
👍1
DPS Build
好家伙,让 fable 和 sol 调查完之后,opus 一口气开了31个 subagents 干活😅
这是目前的执行方式:

1. Main 里跑着 Opus 4.6 1M,跑了一天,用掉的 context window 还不到一半,主要让它调度,汇总信息;
2. Review 里跑着 GPT 5.6 Luna,让它只审核代码,提交代码;
3. 后面是 Fable 和 Sol 两个参谋,遇到复杂的问题就交给他们思考,然后丢回 Main。

最大的优点并不仅仅是节省 token,主要是帮助我保持专注。
👍1
一分都不能少😅
DPS Build
前阵子,为了现金流,接了一个与核心业务完全不相干的活,现在后悔不已。 核心业务已经搭好了工具库,有项目进来就可以上手,有些个例需要临时休整一下,可以同时接好几个项目,所以整体来说比较容易拓展。 这个不相干的活处处都是雷: 1. 每一个子项目都要按需抓取数据,而且是从不同的网站抓,能不能抓得到还是未知数; 2. 设计大量前端设计,客户非科技行业,非产品经理,无法提供详细量化目标; 3. 要用到的工具库非常小众,需要花大量时间试错。 4. 最要命的是这种项目几乎是一次性的,不太可能再有类似的需求。…
尽管抱怨了不少,还是继续在做这个项目。

写了不少代码,觉得没有办法复用,好可惜。

结果我搭档开始读 JD,有大量的课件需要整理,又是 claude 又是 gemini notebook。

我说这么用太割裂,两个工具无法相互积累,不如都用 claude。

她说她还是喜欢 notebook 里的 flashcards,我说我们自己的项目里有啊,你直接让 agent 调用就行,还可以做成 skill,定义什么样的概念放到 flashcards 里。

顺手演示了一下,直接让 agent 读课件,然后就可以生成想要的 flashcards。

也算是合理复用了 🤪
DPS Build
尽管抱怨了不少,还是继续在做这个项目。 写了不少代码,觉得没有办法复用,好可惜。 结果我搭档开始读 JD,有大量的课件需要整理,又是 claude 又是 gemini notebook。 我说这么用太割裂,两个工具无法相互积累,不如都用 claude。 她说她还是喜欢 notebook 里的 flashcards,我说我们自己的项目里有啊,你直接让 agent 调用就行,还可以做成 skill,定义什么样的概念放到 flashcards 里。 顺手演示了一下,直接让 agent 读课件,然后就可以生成想要的…
完整的工作流在这里,这也让我意识到了 FDE 的重要性:

1. 作为程序员出身的我们,天然地以为所有人对于 AI,对于 agent 的认知都是类似的;
2. 作为一般人,以为 AI 就是聊天框,就是几个 skill;

两边都不知道对方的不知道,这中间的差距非常大,而 FDE 正好可以解决这些

https://t.me/tms_ur_way/3968
看看能不能如期送到 😛
👍3
DPS Build
不少人问我怎么弄的,确实所有的代码都是 vibe code 的,不是两三个 skill 能讲清楚的。 这几天重温了很多 NLP 的算法,以前要搞清楚一个算法细节,需要读论文,找实现,标注数据,做实验,反复好几轮。有了 agent 之后,迭代速度快多了,但是大方向还是需要人来把控。 就像一个完全写过代码的人完全不知道有 git 一样,如果之前没有那么多年的 nlp 经验,我也不可能这么快地指挥 agent 干活。同理,现在上手前端项目,对我来说还是有许多未知的。 所以么,我当然看得到 AI 的潜力,但…
上一周基本跑通了整个流程,也拿到一些结果,但有一个问题始终困扰着我:

用 whisper-mlx 把录音转成中文后,所有的标点都丢失了,英语倒还好。这样以来,问题很大,因为 whisper 的模型是根据根据时间窗口切割结果的,比如3秒,10秒之类的,但没有标点就无法重新分句,只能硬拿3秒10秒这样的切块和英语做对比。尽管也能看出一些眉目(抄得太厉害了),但总归难以说服自己。

我一开始想直接在切块里添加标点,然后再分句。但这样的问题很大,每个切块都是破损的,这样直接喂给模型,效果还是很差。后来我想,要不干脆直接把所有一段录音的所有切块直接拼在一起,然后再添加标点,再分句。查了查,还真有人这么玩过,而且还有专门的模型。结果拿来一试,不光分句的问题解决了,后续的问题也解决了不少。

有了 agent,这就是一两小时的事,没有 agent,恐怕是一两周的活。