让AI编程助手直接操控桌面:Zig原生CLI工具usecomputer开源,兼容Claude Code和Codex
开源开发者 Tommaso De Rossi 发布桌面自动化命令行工具 usecomputer,用 Zig 编写原生二进制文件,不依赖 Node.js 运行时,让 AI 编程助手(Claude Code、Codex、OpenCode 等)直接控制桌面的鼠标、键盘和截图。支持 macOS 和 Linux(X11,Wayland 通过 XWayland 兼容)。
usecomputer 提供截图、鼠标移动/点击/拖拽/滚动、键盘输入和快捷键合成等 CLI 命令,附带坐标映射系统(coord-map),将截图中的像素坐标自动转换为实际屏幕坐标。截图输出默认将最长边缩放至 1568 像素以适配模型上下文窗口。工具还支持 Kitty Graphics Protocol,设置环境变量后截图可直接内联到模型上下文中,无需额外读取文件。
De Rossi 此前开发了浏览器自动化工具 Playwriter(3200+ GitHub 星标),usecomputer 从浏览器自动化延伸到桌面自动化。项目从其 kimaki 单仓库中独立拆出,同时提供 CLI 和 Node.js 库两种使用方式,README 中包含 OpenAI computer tool 和 Anthropic computer use 的完整集成示例。
信源:https://github.com/remorses/usecomputer
开源开发者 Tommaso De Rossi 发布桌面自动化命令行工具 usecomputer,用 Zig 编写原生二进制文件,不依赖 Node.js 运行时,让 AI 编程助手(Claude Code、Codex、OpenCode 等)直接控制桌面的鼠标、键盘和截图。支持 macOS 和 Linux(X11,Wayland 通过 XWayland 兼容)。
usecomputer 提供截图、鼠标移动/点击/拖拽/滚动、键盘输入和快捷键合成等 CLI 命令,附带坐标映射系统(coord-map),将截图中的像素坐标自动转换为实际屏幕坐标。截图输出默认将最长边缩放至 1568 像素以适配模型上下文窗口。工具还支持 Kitty Graphics Protocol,设置环境变量后截图可直接内联到模型上下文中,无需额外读取文件。
De Rossi 此前开发了浏览器自动化工具 Playwriter(3200+ GitHub 星标),usecomputer 从浏览器自动化延伸到桌面自动化。项目从其 kimaki 单仓库中独立拆出,同时提供 CLI 和 Node.js 库两种使用方式,README 中包含 OpenAI computer tool 和 Anthropic computer use 的完整集成示例。
信源:https://github.com/remorses/usecomputer
GSM8K团队五年后再出手:25道博士级数学题,所有前沿模型正确率不到10%
AI 数据标注公司 Surge AI 发布数学基准测试 Riemann-bench。Surge AI 五年前与 OpenAI 合作构建了 GSM8K,当时 GPT-3 系列在该测试上正确率不到 20%,如今 GSM8K 已成为行业入门级基准。Riemann-bench 瞄准的是另一个层级:25 道来自常春藤联盟数学教授、博士生和 IMO 奖牌得主自身研究中的问题,出题者本人往往需要数周才能独立解出,示例题目的预估解题时间为 40 至 50 小时。
当前排名:Claude Opus 4.6 和 Gemini 3.1 Pro 并列第一,正确率均为 6%;Kimi K2.5 和 Gemini 3 Pro 并列第三,4%;DeepSeek v3.2 为 3%;GPT-5.2 和 Claude Opus 4.5 均为 2%。GPT-5.4 系列因 API 报错尚未完成测试。
与 FrontierMath 等现有数学基准相比,Riemann-bench 有两个设计差异:一是不限制 Agent 的推理框架和 token 上限,允许模型自由使用工具和多步推理;二是采用双盲验证,每道题由两位独立领域专家从零解题确认答案。题库完全保密,防止模型针对性优化。
信源:https://surgehq.ai/blog/riemann-bench-a-benchmark-for-moonshot-mathematics
AI 数据标注公司 Surge AI 发布数学基准测试 Riemann-bench。Surge AI 五年前与 OpenAI 合作构建了 GSM8K,当时 GPT-3 系列在该测试上正确率不到 20%,如今 GSM8K 已成为行业入门级基准。Riemann-bench 瞄准的是另一个层级:25 道来自常春藤联盟数学教授、博士生和 IMO 奖牌得主自身研究中的问题,出题者本人往往需要数周才能独立解出,示例题目的预估解题时间为 40 至 50 小时。
当前排名:Claude Opus 4.6 和 Gemini 3.1 Pro 并列第一,正确率均为 6%;Kimi K2.5 和 Gemini 3 Pro 并列第三,4%;DeepSeek v3.2 为 3%;GPT-5.2 和 Claude Opus 4.5 均为 2%。GPT-5.4 系列因 API 报错尚未完成测试。
与 FrontierMath 等现有数学基准相比,Riemann-bench 有两个设计差异:一是不限制 Agent 的推理框架和 token 上限,允许模型自由使用工具和多步推理;二是采用双盲验证,每道题由两位独立领域专家从零解题确认答案。题库完全保密,防止模型针对性优化。
信源:https://surgehq.ai/blog/riemann-bench-a-benchmark-for-moonshot-mathematics
马斯克预告Grok Imagine v2:「下一版将是史诗级的」
Elon Musk 发帖称 xAI 图像生成工具 Grok Imagine 的下一个版本「将是史诗级的,我们正在加倍投入」。Grok 官方账号随后回复确认新版本名为 Grok Imagine v2,称将在「创造力和真实感」上大幅提升。未披露具体发布日期和技术细节。
信源:https://x.com/grok/status/2036693952435265941
Elon Musk 发帖称 xAI 图像生成工具 Grok Imagine 的下一个版本「将是史诗级的,我们正在加倍投入」。Grok 官方账号随后回复确认新版本名为 Grok Imagine v2,称将在「创造力和真实感」上大幅提升。未披露具体发布日期和技术细节。
信源:https://x.com/grok/status/2036693952435265941
Anthropic经济指数:老用户成功率高10%,编程任务正从网页端迁移到API
Anthropic 发布第三期经济指数报告,基于 2026 年 2 月 Claude 使用数据分析 AI 对经济的影响。
核心发现是「学习曲线」效应:使用 Claude 超过 6 个月的老用户,对话成功率比新用户高约 10%,即使在控制了任务类型、国家、模型选择等变量后,差距仍有约 4 个百分点。老用户更倾向于与 Claude 协作迭代,而非简单下达指令,用于工作的比例高出 7 个百分点,处理的任务所需教育水平也更高。
使用场景方面,编程仍是最大类别,占 Claude.ai 对话的 35%,但正加速从网页端迁移到 API。Claude Code 的 Agent 架构将编程工作拆分为更小的 API 调用,推动 API 端编程份额持续上升。Claude.ai 上使用场景更加分散,前 10 大任务占比从 24% 降至 19%,个人用途(体育赛事、产品比较、家庭维护等)从 35% 升至 42%。Claude.ai 上任务的平均经济价值(以对应美国职业时薪衡量)从 49.3 美元微降至 47.9 美元。
用户在选择模型时表现出明显的任务匹配行为:付费用户在编程任务中选择 Opus 的比例比平均水平高 4 个百分点,在辅导类任务中低 7 个百分点。API 端这种差异更为明显,任务价值每增加 10 美元时薪,Opus 使用比例上升 2.8 个百分点。
API 端两类新兴自动化工作流增长尤为突出,份额至少翻倍:企业销售外联自动化(线索筛选、客户数据补充、冷邮件撰写)和自动化交易与市场运营(市场监控、投资建议、交易提醒)。
地理分布上,美国各州之间的使用差距继续收窄,但速度放缓,按当前趋势需 5 至 9 年才能趋于均等。国际差距则略有扩大,前 20 个国家的人均使用份额从 45% 升至 48%。报告指出,49% 的职业已有至少四分之一的任务通过 Claude 完成。
信源:https://www.anthropic.com/research/economic-index-march-2026-report
Anthropic 发布第三期经济指数报告,基于 2026 年 2 月 Claude 使用数据分析 AI 对经济的影响。
核心发现是「学习曲线」效应:使用 Claude 超过 6 个月的老用户,对话成功率比新用户高约 10%,即使在控制了任务类型、国家、模型选择等变量后,差距仍有约 4 个百分点。老用户更倾向于与 Claude 协作迭代,而非简单下达指令,用于工作的比例高出 7 个百分点,处理的任务所需教育水平也更高。
使用场景方面,编程仍是最大类别,占 Claude.ai 对话的 35%,但正加速从网页端迁移到 API。Claude Code 的 Agent 架构将编程工作拆分为更小的 API 调用,推动 API 端编程份额持续上升。Claude.ai 上使用场景更加分散,前 10 大任务占比从 24% 降至 19%,个人用途(体育赛事、产品比较、家庭维护等)从 35% 升至 42%。Claude.ai 上任务的平均经济价值(以对应美国职业时薪衡量)从 49.3 美元微降至 47.9 美元。
用户在选择模型时表现出明显的任务匹配行为:付费用户在编程任务中选择 Opus 的比例比平均水平高 4 个百分点,在辅导类任务中低 7 个百分点。API 端这种差异更为明显,任务价值每增加 10 美元时薪,Opus 使用比例上升 2.8 个百分点。
API 端两类新兴自动化工作流增长尤为突出,份额至少翻倍:企业销售外联自动化(线索筛选、客户数据补充、冷邮件撰写)和自动化交易与市场运营(市场监控、投资建议、交易提醒)。
地理分布上,美国各州之间的使用差距继续收窄,但速度放缓,按当前趋势需 5 至 9 年才能趋于均等。国际差距则略有扩大,前 20 个国家的人均使用份额从 45% 升至 48%。报告指出,49% 的职业已有至少四分之一的任务通过 Claude 完成。
信源:https://www.anthropic.com/research/economic-index-march-2026-report
分析:Anthropic年化营收190亿美元同比涨14倍,但和OpenAI的250亿不是一本账
《The Information》分析称,Anthropic 2 月底年化营收突破 190 亿美元,同比增长约 14 倍;同期 OpenAI 年化营收约 250 亿美元,同比增约 4 倍。
两家的年化计算方法几乎一致:取最近四周收入乘以 13(对应一年 52 周)。Anthropic 的细节是 API 收入按四周乘以 13,订阅收入按当日活跃订阅数折算月收入再乘以 12。此前 X 上有声音质疑 Anthropic 的年化算法与 OpenAI 存在重大差异,该报道否定了这一猜测。
但两家在云渠道收入的记账方式上确有实质分歧。微软通过 Azure 向客户转售 OpenAI 模型,OpenAI 仅将自己分到的 20% 计为营收,因为微软被认定为该服务的「委托人」(principal),直接控制交付并拥有 OpenAI 知识产权的独家使用权。Anthropic 则将 AWS、谷歌、微软三家云平台转售 Claude 的全部销售额计为自己的营收,付给云厂商的分成记入销售与营销费用,理由是 Anthropic 自身才是委托人,云厂商只是分销商。两种处理均符合 GAAP,但导致两家的营收数字无法直接对比。
报道认为,比较两家实验室或许自由现金流是更好的指标:Anthropic 预计最早 2028 年转正,比 OpenAI 早两年。其他数据:Anthropic 2025 年全年实际营收约 45 亿美元;OpenAI 约 131 亿美元,预计 2026 年增至约 300 亿美元。
信源:https://www.theinformation.com/newsletters/dealmaker/math-behind-anthropics-mad-revenue-growth
《The Information》分析称,Anthropic 2 月底年化营收突破 190 亿美元,同比增长约 14 倍;同期 OpenAI 年化营收约 250 亿美元,同比增约 4 倍。
两家的年化计算方法几乎一致:取最近四周收入乘以 13(对应一年 52 周)。Anthropic 的细节是 API 收入按四周乘以 13,订阅收入按当日活跃订阅数折算月收入再乘以 12。此前 X 上有声音质疑 Anthropic 的年化算法与 OpenAI 存在重大差异,该报道否定了这一猜测。
但两家在云渠道收入的记账方式上确有实质分歧。微软通过 Azure 向客户转售 OpenAI 模型,OpenAI 仅将自己分到的 20% 计为营收,因为微软被认定为该服务的「委托人」(principal),直接控制交付并拥有 OpenAI 知识产权的独家使用权。Anthropic 则将 AWS、谷歌、微软三家云平台转售 Claude 的全部销售额计为自己的营收,付给云厂商的分成记入销售与营销费用,理由是 Anthropic 自身才是委托人,云厂商只是分销商。两种处理均符合 GAAP,但导致两家的营收数字无法直接对比。
报道认为,比较两家实验室或许自由现金流是更好的指标:Anthropic 预计最早 2028 年转正,比 OpenAI 早两年。其他数据:Anthropic 2025 年全年实际营收约 45 亿美元;OpenAI 约 131 亿美元,预计 2026 年增至约 300 亿美元。
信源:https://www.theinformation.com/newsletters/dealmaker/math-behind-anthropics-mad-revenue-growth
Meta收购Manus案升级:外媒曝肖弘、季逸超被发改委约谈后遭边控,监管从多个方向收紧
英国《金融时报》披露了 Meta 收购 AI Agent 公司 Manus 一案的最新细节。Manus CEO 肖弘和首席科学家季逸超本月被国家发改委召至北京约谈,问询方向为 Manus 所有权变更后,其境内主体是否按规定完成了外商直接投资信息报告。约谈结束后,二人被告知在审查期间不得离境,但可在国内自由活动。此前《纽约时报》已报道高管被限制出境,FT 的报道进一步明确了限制对象为肖弘、季逸超,约谈主体为发改委,边控措施直接与此次约谈相关。
至此,该交易同时面临两条监管线:商务部自 1 月 8 日起对出口管制合规的审查,以及发改委对 FDI 申报违规的问询。多部门同步介入,显示监管层对这笔交易的关切已从单一维度扩展为系统性审视。
目前未启动正式调查,也未提出任何指控。Manus 正在寻找律所和咨询机构协助应对。报道援引知情人士称,即使违规被确认,依据现行法律也不太可能导致严重处罚,但监管方显然在寻找介入交易的切入口。极端情况下可能要求撤销交易,但由于 Meta 已开始将 Manus 的 AI Agent 软件整合入自有平台,强行拆解会非常复杂。外媒普遍认为,此举意在向中国 AI 创业者发出信号:在境内研发核心技术后迁往海外再出售给美国企业的路径,将面临越来越大的监管压力。
Meta 发言人回应称,「该交易完全符合适用法律,我们预期此次问询会得到妥善解决。」
信源:https://www.ft.com/content/d9123d9d-c807-41d6-8a17-80ff1111834a
英国《金融时报》披露了 Meta 收购 AI Agent 公司 Manus 一案的最新细节。Manus CEO 肖弘和首席科学家季逸超本月被国家发改委召至北京约谈,问询方向为 Manus 所有权变更后,其境内主体是否按规定完成了外商直接投资信息报告。约谈结束后,二人被告知在审查期间不得离境,但可在国内自由活动。此前《纽约时报》已报道高管被限制出境,FT 的报道进一步明确了限制对象为肖弘、季逸超,约谈主体为发改委,边控措施直接与此次约谈相关。
至此,该交易同时面临两条监管线:商务部自 1 月 8 日起对出口管制合规的审查,以及发改委对 FDI 申报违规的问询。多部门同步介入,显示监管层对这笔交易的关切已从单一维度扩展为系统性审视。
目前未启动正式调查,也未提出任何指控。Manus 正在寻找律所和咨询机构协助应对。报道援引知情人士称,即使违规被确认,依据现行法律也不太可能导致严重处罚,但监管方显然在寻找介入交易的切入口。极端情况下可能要求撤销交易,但由于 Meta 已开始将 Manus 的 AI Agent 软件整合入自有平台,强行拆解会非常复杂。外媒普遍认为,此举意在向中国 AI 创业者发出信号:在境内研发核心技术后迁往海外再出售给美国企业的路径,将面临越来越大的监管压力。
Meta 发言人回应称,「该交易完全符合适用法律,我们预期此次问询会得到妥善解决。」
信源:https://www.ft.com/content/d9123d9d-c807-41d6-8a17-80ff1111834a
Meta设9万亿美元市值目标留人:IPO以来首发期权,比马斯克方案增幅相当但时间减半
Meta 推出新的股票期权激励计划,高管只有在公司市值于 2031 年前突破 9 万亿美元时才能兑现全部价值,较当前约 1.5 万亿美元需增长 500%。这是 Meta 2012 年 IPO 以来首次向高管授予股票期权。
计划覆盖六位核心高管:CTO Andrew Bosworth、首席产品官 Chris Cox、COO Javier Olivan、CFO Susan Li、首席法务官 C.J. Mahoney 和副董事长 Dina Powell McCormick。CEO 扎克伯格不在其中。期权分多档行权,最低一档要求股价达到 1116.08 美元(较当前涨 88%,对应市值约 2.82 万亿美元),最高档 3727.12 美元(对应市值超 9 万亿美元)。Meta 同时增加了部分高管的 RSU 授予。
Meta 发言人称这是一次「大赌注」,「只有 Meta 实现巨大成功,所有股东都从中受益时,这些薪酬才会兑现」。
作为对比,特斯拉去年秋天通过的马斯克薪酬方案价值最高 1 万亿美元,需在 10 年内将市值从 1.2 万亿推至 8.5 万亿美元。Meta 的计划要求几乎同等增幅,但时间窗口只有一半。AI 人才争夺战正在推高 Meta 的股票薪酬成本:2025 年与员工股票奖励相关的现金支出消耗了公司 96% 的自由现金流,达 420 亿美元;全年回购的 4000 万股中,90% 是为了抵消员工股票奖励带来的稀释。
信源:https://www.wsj.com/tech/meta-targets-9-trillion-valuation-with-new-executive-incentive-program-64460862
Meta 推出新的股票期权激励计划,高管只有在公司市值于 2031 年前突破 9 万亿美元时才能兑现全部价值,较当前约 1.5 万亿美元需增长 500%。这是 Meta 2012 年 IPO 以来首次向高管授予股票期权。
计划覆盖六位核心高管:CTO Andrew Bosworth、首席产品官 Chris Cox、COO Javier Olivan、CFO Susan Li、首席法务官 C.J. Mahoney 和副董事长 Dina Powell McCormick。CEO 扎克伯格不在其中。期权分多档行权,最低一档要求股价达到 1116.08 美元(较当前涨 88%,对应市值约 2.82 万亿美元),最高档 3727.12 美元(对应市值超 9 万亿美元)。Meta 同时增加了部分高管的 RSU 授予。
Meta 发言人称这是一次「大赌注」,「只有 Meta 实现巨大成功,所有股东都从中受益时,这些薪酬才会兑现」。
作为对比,特斯拉去年秋天通过的马斯克薪酬方案价值最高 1 万亿美元,需在 10 年内将市值从 1.2 万亿推至 8.5 万亿美元。Meta 的计划要求几乎同等增幅,但时间窗口只有一半。AI 人才争夺战正在推高 Meta 的股票薪酬成本:2025 年与员工股票奖励相关的现金支出消耗了公司 96% 的自由现金流,达 420 亿美元;全年回购的 4000 万股中,90% 是为了抵消员工股票奖励带来的稀释。
信源:https://www.wsj.com/tech/meta-targets-9-trillion-valuation-with-new-executive-incentive-program-64460862
传蚂蚁集团正开发AI眼镜独立App,「看一下支付」要从插件变入口
微信公众号「读佳」爆料称,蚂蚁集团正在开发「蚂蚁数科AI眼镜」独立 App。
蚂蚁数科去年 9 月发布 AI 眼镜可信连接技术框架 gPass,已与 Rokid、小米等主流 AI 眼镜品牌完成对接,实现「看一下支付」在消费、停车、文旅等场景落地。目前 gPass 以插件形式嵌入各硬件厂商系统。若独立 App 落地,蚂蚁的 AI 眼镜支付能力将不再依附于单一硬件品牌,可跨品牌覆盖用户。
信源:https://mp.weixin.qq.com/s/W6j7dbsIAHvt7i7gtIRe-w
微信公众号「读佳」爆料称,蚂蚁集团正在开发「蚂蚁数科AI眼镜」独立 App。
蚂蚁数科去年 9 月发布 AI 眼镜可信连接技术框架 gPass,已与 Rokid、小米等主流 AI 眼镜品牌完成对接,实现「看一下支付」在消费、停车、文旅等场景落地。目前 gPass 以插件形式嵌入各硬件厂商系统。若独立 App 落地,蚂蚁的 AI 眼镜支付能力将不再依附于单一硬件品牌,可跨品牌覆盖用户。
信源:https://mp.weixin.qq.com/s/W6j7dbsIAHvt7i7gtIRe-w
杨植麟中关村论坛演讲:大模型训练正进入第三阶段,100个Agent并行后执行时间几乎不随复杂度上升
月之暗面创始人杨植麟在 2026 中关村论坛全体会议上以《开源 AI:加速探索智能上限》为题发表演讲,提出大模型训练正经历三个阶段的演进:三年前主要依赖互联网天然数据加少量人工标注;2025 年转向大规模强化学习,由人工筛选高质量任务,编程和数学领域的性能提升主要来自这一路线;从今年起进入第三阶段,AI 将更大程度主导研究本身,每个研究员将配备海量 token,由 AI 自动合成新任务与新环境、定义奖励函数,甚至探索全新网络架构。
杨植麟介绍了 Kimi K2.5 中首创的 Agent 集群(Agent Swarm)技术。他展示的数据显示,单一智能体模式下任务复杂度与执行时间呈指数级增长,而并行启用 100 个智能体协作后,执行时间几乎不再随任务复杂度上升而显著增加。他将此比喻为「从 0 到 1 建造一家千亿美元公司,一个人可能需要 100 年,但 100 个聪明人一起协作,就能在短时间内完成」。
杨植麟还指出,开源模型正成为全球 AI 产业新标准。在英伟达 GTC 2026 大会上,黄仁勋主题演讲多次引用 Kimi 等开源模型作为芯片性能评测基准,「如果你要发布一个新芯片,就必须通过 Kimi 或其他开源模型来评测性能提升」。
信源:https://www.nbd.com.cn/articles/2026-03-25/4307655.html
月之暗面创始人杨植麟在 2026 中关村论坛全体会议上以《开源 AI:加速探索智能上限》为题发表演讲,提出大模型训练正经历三个阶段的演进:三年前主要依赖互联网天然数据加少量人工标注;2025 年转向大规模强化学习,由人工筛选高质量任务,编程和数学领域的性能提升主要来自这一路线;从今年起进入第三阶段,AI 将更大程度主导研究本身,每个研究员将配备海量 token,由 AI 自动合成新任务与新环境、定义奖励函数,甚至探索全新网络架构。
杨植麟介绍了 Kimi K2.5 中首创的 Agent 集群(Agent Swarm)技术。他展示的数据显示,单一智能体模式下任务复杂度与执行时间呈指数级增长,而并行启用 100 个智能体协作后,执行时间几乎不再随任务复杂度上升而显著增加。他将此比喻为「从 0 到 1 建造一家千亿美元公司,一个人可能需要 100 年,但 100 个聪明人一起协作,就能在短时间内完成」。
杨植麟还指出,开源模型正成为全球 AI 产业新标准。在英伟达 GTC 2026 大会上,黄仁勋主题演讲多次引用 Kimi 等开源模型作为芯片性能评测基准,「如果你要发布一个新芯片,就必须通过 Kimi 或其他开源模型来评测性能提升」。
信源:https://www.nbd.com.cn/articles/2026-03-25/4307655.html
一个Transformer同时生成视频和语音:Sand.ai开源150亿参数人像基座模型,单H100两秒出片
视频生成创业公司 Sand.ai 与上海创智学院 GAIR 实验室联合开源音视频联合生成基座模型 daVinci-MagiHuman,150 亿参数,采用单流 Transformer 架构,将文本、视频、音频统一放入同一个 token 序列,仅靠自注意力完成联合建模,不依赖跨注意力或模态专属分支。
模型以人像场景为核心能力,可生成富有表现力的面部表情与自然语音,实现口型、表情与动作的精确同步,支持中文(普通话与粤语)、英文、日文、韩文、德文、法文六种语言。推理侧结合模型蒸馏、隐空间超分辨率和 Turbo VAE 解码器,在单张 H100 GPU 上 2 秒生成 5 秒 256p 视频。
在客观评测中,daVinci-MagiHuman 在开源模型中视觉质量和文本一致性均为最优,语音可懂度词错误率(WER)14.60%,远低于 LTX 2.3 和 Ovi 1.1。2000 组人工盲评中,对 Ovi 1.1 胜率 80%,对 LTX 2.3 胜率 60.9%。完整模型栈(基座模型、蒸馏模型、超分模型、推理代码)全部开源。
Sand.ai 由马尔奖(Marr Prize)得主曹越创立,此前发布了自回归视频生成模型 Magi-1 和主打「AI 演员」的 GAGA-1。上海创智学院 GAIR 实验室由刘鹏飞领导,聚焦生成式 AI 前沿研究。
信源:https://arxiv.org/abs/2603.21986
视频生成创业公司 Sand.ai 与上海创智学院 GAIR 实验室联合开源音视频联合生成基座模型 daVinci-MagiHuman,150 亿参数,采用单流 Transformer 架构,将文本、视频、音频统一放入同一个 token 序列,仅靠自注意力完成联合建模,不依赖跨注意力或模态专属分支。
模型以人像场景为核心能力,可生成富有表现力的面部表情与自然语音,实现口型、表情与动作的精确同步,支持中文(普通话与粤语)、英文、日文、韩文、德文、法文六种语言。推理侧结合模型蒸馏、隐空间超分辨率和 Turbo VAE 解码器,在单张 H100 GPU 上 2 秒生成 5 秒 256p 视频。
在客观评测中,daVinci-MagiHuman 在开源模型中视觉质量和文本一致性均为最优,语音可懂度词错误率(WER)14.60%,远低于 LTX 2.3 和 Ovi 1.1。2000 组人工盲评中,对 Ovi 1.1 胜率 80%,对 LTX 2.3 胜率 60.9%。完整模型栈(基座模型、蒸馏模型、超分模型、推理代码)全部开源。
Sand.ai 由马尔奖(Marr Prize)得主曹越创立,此前发布了自回归视频生成模型 Magi-1 和主打「AI 演员」的 GAGA-1。上海创智学院 GAIR 实验室由刘鹏飞领导,聚焦生成式 AI 前沿研究。
信源:https://arxiv.org/abs/2603.21986
arXiv.org
Speed by Simplicity: A Single-Stream Architecture for Fast...
We present daVinci-MagiHuman, an open-source audio-video generative foundation model for human-centric generation. daVinci-MagiHuman jointly generates synchronized video and audio using a...
WordPress 7.0将于4月9日发布,全球43%网站将原生支持AI Agent接入
WordPress 7.0 定于 4 月 9 日发布,核心变化之一是将 MCP(Model Context Protocol)适配器纳入核心,使任何 WordPress 站点都能作为 MCP 服务器,允许 Claude、ChatGPT 等 AI Agent 直接在站点内发现功能、理解结构并执行操作。
具体而言,7.0 在 AI 基础设施层面引入三个组件:
1. AI Connectors:在设置面板统一管理 AI 服务的 API 密钥,首批支持 Anthropic、OpenAI、谷歌三家,所有插件共享同一套凭证,不再各自存储。
2. Abilities API:6.9 版本引入、7.0 扩展的能力注册接口,插件可以用 AI 能理解的格式声明自身功能(如获取文章、更新页面、运行站点健康检查),标准化输入输出。
3. MCP Adapter:将所有已注册的 Ability 通过 MCP 协议暴露给外部 AI Agent,Agent 可自动发现站点能力并在用户授权下调用。
WordPress.com 已于 3 月 20 日率先上线 MCP 写入权限,覆盖 6 类内容的 19 项写操作(编辑内容、管理评论、创建页面、上传媒体、调整分类和标签等)。所有操作需用户明确确认后才会执行,新内容默认为草稿,删除内容进入回收站保留 30 天。WordPress.com 还默认启用 OAuth 2.1 认证,AI 客户端仅使用有时效的 token,不接触用户凭证。
WordPress 驱动着全球约 43% 的网站。MCP 支持进入核心意味着这些站点将具备标准化的 AI Agent 接入能力,类似于 2016 年 REST API 进入核心后催生了无头 WordPress 和现代主题开发生态。
信源:https://x.com/adityaarsharma/status/2036485004348498180
WordPress 7.0 定于 4 月 9 日发布,核心变化之一是将 MCP(Model Context Protocol)适配器纳入核心,使任何 WordPress 站点都能作为 MCP 服务器,允许 Claude、ChatGPT 等 AI Agent 直接在站点内发现功能、理解结构并执行操作。
具体而言,7.0 在 AI 基础设施层面引入三个组件:
1. AI Connectors:在设置面板统一管理 AI 服务的 API 密钥,首批支持 Anthropic、OpenAI、谷歌三家,所有插件共享同一套凭证,不再各自存储。
2. Abilities API:6.9 版本引入、7.0 扩展的能力注册接口,插件可以用 AI 能理解的格式声明自身功能(如获取文章、更新页面、运行站点健康检查),标准化输入输出。
3. MCP Adapter:将所有已注册的 Ability 通过 MCP 协议暴露给外部 AI Agent,Agent 可自动发现站点能力并在用户授权下调用。
WordPress.com 已于 3 月 20 日率先上线 MCP 写入权限,覆盖 6 类内容的 19 项写操作(编辑内容、管理评论、创建页面、上传媒体、调整分类和标签等)。所有操作需用户明确确认后才会执行,新内容默认为草稿,删除内容进入回收站保留 30 天。WordPress.com 还默认启用 OAuth 2.1 认证,AI 客户端仅使用有时效的 token,不接触用户凭证。
WordPress 驱动着全球约 43% 的网站。MCP 支持进入核心意味着这些站点将具备标准化的 AI Agent 接入能力,类似于 2016 年 REST API 进入核心后催生了无头 WordPress 和现代主题开发生态。
信源:https://x.com/adityaarsharma/status/2036485004348498180
X (formerly Twitter)
Aditya R Sharma (@adityaarsharma) on X
WordPress 7.0 Is the Biggest Thing to Happen Since Gutenberg and Nobody's Talking About It !!
Linear宣布「Issue tracking已死」,全面转向AI Agent驱动的产品系统
项目管理工具 Linear CEO Karri Saarinen 发布公开信,宣布 Linear 正从 issue tracker 转型为「将上下文转化为执行」的共享产品系统,核心论点是传统 issue tracking 为人与人之间的工作交接而设计,而 AI Agent 时代的瓶颈已转向判断力,系统应围绕上下文和 Agent 重建。
Karri 披露了一组数据:目前超过 75% 的 Linear 企业级工作区已安装编程 Agent,过去三个月 Agent 完成的工作量增长了 5 倍,Agent 创建的新 issue 占比接近 25%。
围绕这一转型,Linear 同步上线三项功能:
1. Linear Agent:内置的原生 AI Agent,理解工作区内的路线图、issue 和代码,可在桌面端(Cmd/Ctrl+J)、移动端、Slack 和 Microsoft Teams 中使用,支持综合上下文、提出建议并直接执行操作。
2. Skills:将 Agent 对话中的有效工作流保存为可复用技能,通过斜杠命令手动触发,或由 Linear 自动匹配执行。
3. Automations:从 Triage 开始,issue 进入系统时自动触发 Agent 工作流,智能分类、提炼或处理新增上下文。
此外预告了三项即将推出的能力:Code Intelligence(理解代码库并回答问题)、Code Diffs(人与 Agent 协作审查代码的界面)和 Linear Coding Agent(由 Linear 原生上下文增强的编程 Agent)。
Linear Agent 目前以公测形式向所有计划开放,测试期间免费。Automations 和 Code Intelligence 仅限 Business 和 Enterprise 计划。正式发布后,对话功能预计包含在基础席位价格中,高计算量功能可能转为用量计费。
信源:https://linear.app/next
项目管理工具 Linear CEO Karri Saarinen 发布公开信,宣布 Linear 正从 issue tracker 转型为「将上下文转化为执行」的共享产品系统,核心论点是传统 issue tracking 为人与人之间的工作交接而设计,而 AI Agent 时代的瓶颈已转向判断力,系统应围绕上下文和 Agent 重建。
Karri 披露了一组数据:目前超过 75% 的 Linear 企业级工作区已安装编程 Agent,过去三个月 Agent 完成的工作量增长了 5 倍,Agent 创建的新 issue 占比接近 25%。
围绕这一转型,Linear 同步上线三项功能:
1. Linear Agent:内置的原生 AI Agent,理解工作区内的路线图、issue 和代码,可在桌面端(Cmd/Ctrl+J)、移动端、Slack 和 Microsoft Teams 中使用,支持综合上下文、提出建议并直接执行操作。
2. Skills:将 Agent 对话中的有效工作流保存为可复用技能,通过斜杠命令手动触发,或由 Linear 自动匹配执行。
3. Automations:从 Triage 开始,issue 进入系统时自动触发 Agent 工作流,智能分类、提炼或处理新增上下文。
此外预告了三项即将推出的能力:Code Intelligence(理解代码库并回答问题)、Code Diffs(人与 Agent 协作审查代码的界面)和 Linear Coding Agent(由 Linear 原生上下文增强的编程 Agent)。
Linear Agent 目前以公测形式向所有计划开放,测试期间免费。Automations 和 Code Intelligence 仅限 Business 和 Enterprise 计划。正式发布后,对话功能预计包含在基础席位价格中,高计算量功能可能转为用量计费。
信源:https://linear.app/next
❤1
「TTS基准已死」:Smallest AI发布对话语音模型Lightning V3,对OpenAI胜率76%
语音 AI 公司 Smallest AI 创始人 Sudarshan Kamath 发布对话场景专用 TTS 模型 Lightning V3,核心论点是朗读式 TTS 和对话式 TTS 是两个根本不同的问题,现有基准衡量的是前者,对后者几乎失效。
对话生成的难点在于模型无法等到完整句子再开始合成,必须在不完整上下文下实时逐块输出。Lightning V3 针对这一场景设计了四项能力:通过节奏和停顿微变化模拟「正在思考」的认知信号;根据对话轮次调整语调(澄清与开场语气不同);处理 Hinglish、Spanglish 等真实场景中的句内混语切换;以及维持用户参与度。
在对话生成条件下的评测中(使用 Seed-TTS 语料库,LLM 作为评判者,评测代码已公开),Lightning V3 MOS 评分 3.89,词错误率 5.38%,对 OpenAI gpt-4o-mini-tts 的整体自然度胜率约 76%。但 Kamath 对自己的评测结果也做了诚实限定:「将同一段音频放在不同的播放设备上、给评估者不同的关注引导,排名就会变。这不是数据噪声,这就是数据本身。」他认为 MOS 将巨大的感知差异压缩为一个平均数,当系统跨过「可懂」到「自然」的门槛后,现有基准只能确认系统没有失败,无法衡量它成功了多少。
模型原生输出 44,100 Hz,支持 15 种语言,可降采样至 8/16/24 kHz 适配电话系统。同步发布的 V3.1 新增声音克隆,5 至 15 秒音频即可生成跨语言的生产级语音副本。采用按量付费,无预付或最低消费。
信源:https://x.com/kamath_sutra/status/2036466680076050581
语音 AI 公司 Smallest AI 创始人 Sudarshan Kamath 发布对话场景专用 TTS 模型 Lightning V3,核心论点是朗读式 TTS 和对话式 TTS 是两个根本不同的问题,现有基准衡量的是前者,对后者几乎失效。
对话生成的难点在于模型无法等到完整句子再开始合成,必须在不完整上下文下实时逐块输出。Lightning V3 针对这一场景设计了四项能力:通过节奏和停顿微变化模拟「正在思考」的认知信号;根据对话轮次调整语调(澄清与开场语气不同);处理 Hinglish、Spanglish 等真实场景中的句内混语切换;以及维持用户参与度。
在对话生成条件下的评测中(使用 Seed-TTS 语料库,LLM 作为评判者,评测代码已公开),Lightning V3 MOS 评分 3.89,词错误率 5.38%,对 OpenAI gpt-4o-mini-tts 的整体自然度胜率约 76%。但 Kamath 对自己的评测结果也做了诚实限定:「将同一段音频放在不同的播放设备上、给评估者不同的关注引导,排名就会变。这不是数据噪声,这就是数据本身。」他认为 MOS 将巨大的感知差异压缩为一个平均数,当系统跨过「可懂」到「自然」的门槛后,现有基准只能确认系统没有失败,无法衡量它成功了多少。
模型原生输出 44,100 Hz,支持 15 种语言,可降采样至 8/16/24 kHz 适配电话系统。同步发布的 V3.1 新增声音克隆,5 至 15 秒音频即可生成跨语言的生产级语音副本。采用按量付费,无预付或最低消费。
信源:https://x.com/kamath_sutra/status/2036466680076050581
Hugging Face开源hf-mount:把云端模型和数据集直接挂载为本地文件夹,按需读取不用下载
Hugging Face CEO Clement Delangue 宣布开源 hf-mount,可将 Hugging Face 上的任意模型仓库、数据集或 Buckets 存储桶挂载为本地文件系统,文件在首次读取时才从网络拉取,无需预先下载完整仓库。Delangue 称这对 AI Agent 尤其实用,Agent 可直接用 ls、cat、find、grep 等标准 UNIX 命令操作远端数据,无需学习专用 API。
hf-mount 用 Rust 编写,提供 NFS(推荐,无需 root 权限)和 FUSE 两种后端,支持 Linux 和 macOS。仓库挂载为只读,Buckets 存储桶支持读写。基准测试显示 FUSE 模式顺序读取速度 1.2 GB/s,写入 900 MB/s。Kubernetes 环境可通过配套的 hf-csi-driver 将挂载点暴露给 Pod。项目以 Apache 2.0 协议开源。
信源:https://x.com/ClementDelangue/status/2036452081750409383
Hugging Face CEO Clement Delangue 宣布开源 hf-mount,可将 Hugging Face 上的任意模型仓库、数据集或 Buckets 存储桶挂载为本地文件系统,文件在首次读取时才从网络拉取,无需预先下载完整仓库。Delangue 称这对 AI Agent 尤其实用,Agent 可直接用 ls、cat、find、grep 等标准 UNIX 命令操作远端数据,无需学习专用 API。
hf-mount 用 Rust 编写,提供 NFS(推荐,无需 root 权限)和 FUSE 两种后端,支持 Linux 和 macOS。仓库挂载为只读,Buckets 存储桶支持读写。基准测试显示 FUSE 模式顺序读取速度 1.2 GB/s,写入 900 MB/s。Kubernetes 环境可通过配套的 hf-csi-driver 将挂载点暴露给 Pod。项目以 Apache 2.0 协议开源。
信源:https://x.com/ClementDelangue/status/2036452081750409383
AI自评全是好评怎么办?Anthropic用GAN思路让Claude连续编程4小时,$124造出一个音乐工作站
Anthropic Labs 工程师 Prithvi Rajasekaran 发文详解团队如何让 Claude 连续数小时自主编写完整应用。他们发现了一个关键瓶颈:让 AI 自己检查自己的代码质量时,它几乎永远觉得自己写得不错,哪怕成品明显有问题也会放行。解法是把「写代码的 AI」和「审代码的 AI」拆成两个独立角色,后者专职挑毛病,比自我审查有效得多。
最终架构由三个 AI 协作:一个负责把用户的一句话需求扩展成完整产品方案,一个负责逐功能写代码,一个负责像真实用户一样点击、操作正在运行的应用并打分。写代码的 AI 和审代码的 AI 每轮开工前先对齐「这轮做什么、怎么算做完」,审代码的 AI 会真的去用这个应用,找出实际 bug 后把修改意见打回去。
对照实验很直观:同样一句「做一个 2D 复古游戏编辑器」,单个 AI 跑 20 分钟花 $9,产出的游戏画面能打开但核心玩法完全跑不通,角色不响应操作;三 AI 协作跑 6 小时花 $200,产出的版本可以正常操控角色、在关卡里移动,审核 AI 还在过程中抓到了填充工具只画端点不填区域、后端路由冲突等具体 bug。
Claude Opus 4.6 让这套架构得以大幅简化。此前 Sonnet 4.5 会在长任务后期「焦虑收尾」,还没做完就急着结束,必须定期清空记忆重新启动。Opus 4.6 基本消除了这个问题,写代码的 AI 可以在单次会话中连贯工作超过 2 小时。用简化后的架构生成浏览器端音乐制作工具,约 4 小时花费 $124.70,审核 AI 仍然捕获了「录音按钮只切状态但没接麦克风」「音频片段无法拖拽」等遗漏。
文章还透露了一个有趣的发现:在前端设计实验中,评分标准里的措辞会直接影响 AI 的审美方向。写上「最好的设计是博物馆级别的」之后,AI 在做一个荷兰艺术博物馆网站时,第十轮迭代自行推翻了前九轮的平面方案,改为用 CSS 渲染的 3D 展厅,让访客通过虚拟门廊在画廊之间穿行。
信源:https://www.anthropic.com/engineering/harness-design-long-running-apps
Anthropic Labs 工程师 Prithvi Rajasekaran 发文详解团队如何让 Claude 连续数小时自主编写完整应用。他们发现了一个关键瓶颈:让 AI 自己检查自己的代码质量时,它几乎永远觉得自己写得不错,哪怕成品明显有问题也会放行。解法是把「写代码的 AI」和「审代码的 AI」拆成两个独立角色,后者专职挑毛病,比自我审查有效得多。
最终架构由三个 AI 协作:一个负责把用户的一句话需求扩展成完整产品方案,一个负责逐功能写代码,一个负责像真实用户一样点击、操作正在运行的应用并打分。写代码的 AI 和审代码的 AI 每轮开工前先对齐「这轮做什么、怎么算做完」,审代码的 AI 会真的去用这个应用,找出实际 bug 后把修改意见打回去。
对照实验很直观:同样一句「做一个 2D 复古游戏编辑器」,单个 AI 跑 20 分钟花 $9,产出的游戏画面能打开但核心玩法完全跑不通,角色不响应操作;三 AI 协作跑 6 小时花 $200,产出的版本可以正常操控角色、在关卡里移动,审核 AI 还在过程中抓到了填充工具只画端点不填区域、后端路由冲突等具体 bug。
Claude Opus 4.6 让这套架构得以大幅简化。此前 Sonnet 4.5 会在长任务后期「焦虑收尾」,还没做完就急着结束,必须定期清空记忆重新启动。Opus 4.6 基本消除了这个问题,写代码的 AI 可以在单次会话中连贯工作超过 2 小时。用简化后的架构生成浏览器端音乐制作工具,约 4 小时花费 $124.70,审核 AI 仍然捕获了「录音按钮只切状态但没接麦克风」「音频片段无法拖拽」等遗漏。
文章还透露了一个有趣的发现:在前端设计实验中,评分标准里的措辞会直接影响 AI 的审美方向。写上「最好的设计是博物馆级别的」之后,AI 在做一个荷兰艺术博物馆网站时,第十轮迭代自行推翻了前九轮的平面方案,改为用 CSS 渲染的 3D 展厅,让访客通过虚拟门廊在画廊之间穿行。
信源:https://www.anthropic.com/engineering/harness-design-long-running-apps
🎉1
可灵AI年化收入2.4亿美元,快手四成新代码由AI生成
快手科技发布 2025 年第四季度及全年业绩。Q4 收入 395.68 亿元,同比增长 11.8%;全年收入 1427.76 亿元,同比增长 12.5%;全年经调整净利润 206.47 亿元,同比增长 16.5%,经调整净利润率升至 14.5%。Q4 日均活跃用户 4.08 亿,月均活跃用户 7.41 亿。
可灵 AI 是本期财报的核心增长叙事。Q4 收入 3.4 亿元,较 Q3 的逾 3 亿元继续增长;2025 年 12 月单月收入突破 2000 万美元,年化收入运行率(ARR)达到 2.4 亿美元。截至年底,可灵 AI 全球用户超 6000 万,累计生成超 6 亿个视频,为超 3 万家企业客户和开发者提供 API 服务。Q4 期间先后推出可灵 O1、可灵 2.6 和可灵 3.0 系列模型,其中可灵 2.6 推出「音画同出」能力,可灵 3.0 基于 All-in-One 理念实现从生成到专业创作调度的升级。
AI 对主营业务的渗透同样值得关注。线上营销方面,生成式推荐大模型和智能出价模型带动国内营销收入提升约 5%,AIGC 营销素材消耗约 40 亿元。电商方面,Q4 GMV 同比增长 12.9% 至 5218 亿元。快手自研 AI 编程工具 CoderFlicker 生成的代码已占新增代码的 40% 以上。全年研发支出同比增长 19%,主要投向 AI 和人力。
公司还宣布派发 2025 年度末期股息每股 0.69 港元,合计 30 亿港元,继去年 8 月上市以来首次特别股息后再次派息。
信源:https://www.bloomberg.com/news/articles/2026-03-25/kuaishou-tech-sales-climb-as-ai-monetization-gains-momentum
快手科技发布 2025 年第四季度及全年业绩。Q4 收入 395.68 亿元,同比增长 11.8%;全年收入 1427.76 亿元,同比增长 12.5%;全年经调整净利润 206.47 亿元,同比增长 16.5%,经调整净利润率升至 14.5%。Q4 日均活跃用户 4.08 亿,月均活跃用户 7.41 亿。
可灵 AI 是本期财报的核心增长叙事。Q4 收入 3.4 亿元,较 Q3 的逾 3 亿元继续增长;2025 年 12 月单月收入突破 2000 万美元,年化收入运行率(ARR)达到 2.4 亿美元。截至年底,可灵 AI 全球用户超 6000 万,累计生成超 6 亿个视频,为超 3 万家企业客户和开发者提供 API 服务。Q4 期间先后推出可灵 O1、可灵 2.6 和可灵 3.0 系列模型,其中可灵 2.6 推出「音画同出」能力,可灵 3.0 基于 All-in-One 理念实现从生成到专业创作调度的升级。
AI 对主营业务的渗透同样值得关注。线上营销方面,生成式推荐大模型和智能出价模型带动国内营销收入提升约 5%,AIGC 营销素材消耗约 40 亿元。电商方面,Q4 GMV 同比增长 12.9% 至 5218 亿元。快手自研 AI 编程工具 CoderFlicker 生成的代码已占新增代码的 40% 以上。全年研发支出同比增长 19%,主要投向 AI 和人力。
公司还宣布派发 2025 年度末期股息每股 0.69 港元,合计 30 亿港元,继去年 8 月上市以来首次特别股息后再次派息。
信源:https://www.bloomberg.com/news/articles/2026-03-25/kuaishou-tech-sales-climb-as-ai-monetization-gains-momentum
Harness Engineering正在成为AI编程的真正战场
AI 编程 IDE Qoder 发布长文梳理了一个正在成形的行业趋势:头部科技公司的 AI 编程竞争焦点已从模型能力本身转向模型之外的一切,即「Harness Engineering」(编排工程)。文章用一个类比概括:模型是 CPU,上下文窗口是内存,Harness 是操作系统,Agent 是应用程序。决定最终产出质量的不是 CPU 有多快,而是操作系统设计得多好。
文章整理了多家公司已公开的实践数据:
1. Stripe 在开源 Agent 框架 Goose 基础上构建了 Blueprint 状态机系统,每周合并超过 1300 个完全由 Agent 编写的 PR
2. Shopify 开源了 Roast 工作流框架,将 AI 步骤与确定性代码交替编排
3. Ramp 基于 OpenCode 构建了 Inspect 系统,在沙箱中并行执行,合并的 PR 中 30% 由 Agent 编写
4. Coinbase 自建 Cloudbot,将 PR 审查周期从 150 小时压缩到 15 小时
5. OpenAI 用 Codex 驱动整个产品迭代,3 名工程师(后扩展至 7 人)在五个月内以零手写代码方式交付了一个百万行级产品
Qoder 认为这些方案有一个共同的结构性限制:Agent 仍然是单体的,一个模型实例、一个上下文窗口、一条执行路径从头跑到尾。任务复杂度上升时会遇到五个瓶颈:上下文窗口变成零和博弈(研究、编码、测试、审查挤在同一窗口里);角色切换的认知开销(一个 Agent 同时当技术负责人、开发、QA 和代码审查员);长链执行中的目标漂移;功能正确性验证不足(代码干净但业务逻辑不对);终端命令执行的不可逆风险。
Qoder 据此推出了 Experts Mode(测试版),将单 Agent 拆成多个专家角色:Leader 负责协调和任务分解,开发、研究、浏览器测试、QA、代码审查各由独立 Agent 承担,每个 Agent 使用不同模型和独立上下文窗口。Qoder 称内部基准测试中,Experts Mode 质量比单 Agent 模式高 67%,比 Claude Code Agent Teams 高 16%,成本不到后者的三分之二。
信源:https://x.com/qoder_ai_ide/status/2036437931867644016
AI 编程 IDE Qoder 发布长文梳理了一个正在成形的行业趋势:头部科技公司的 AI 编程竞争焦点已从模型能力本身转向模型之外的一切,即「Harness Engineering」(编排工程)。文章用一个类比概括:模型是 CPU,上下文窗口是内存,Harness 是操作系统,Agent 是应用程序。决定最终产出质量的不是 CPU 有多快,而是操作系统设计得多好。
文章整理了多家公司已公开的实践数据:
1. Stripe 在开源 Agent 框架 Goose 基础上构建了 Blueprint 状态机系统,每周合并超过 1300 个完全由 Agent 编写的 PR
2. Shopify 开源了 Roast 工作流框架,将 AI 步骤与确定性代码交替编排
3. Ramp 基于 OpenCode 构建了 Inspect 系统,在沙箱中并行执行,合并的 PR 中 30% 由 Agent 编写
4. Coinbase 自建 Cloudbot,将 PR 审查周期从 150 小时压缩到 15 小时
5. OpenAI 用 Codex 驱动整个产品迭代,3 名工程师(后扩展至 7 人)在五个月内以零手写代码方式交付了一个百万行级产品
Qoder 认为这些方案有一个共同的结构性限制:Agent 仍然是单体的,一个模型实例、一个上下文窗口、一条执行路径从头跑到尾。任务复杂度上升时会遇到五个瓶颈:上下文窗口变成零和博弈(研究、编码、测试、审查挤在同一窗口里);角色切换的认知开销(一个 Agent 同时当技术负责人、开发、QA 和代码审查员);长链执行中的目标漂移;功能正确性验证不足(代码干净但业务逻辑不对);终端命令执行的不可逆风险。
Qoder 据此推出了 Experts Mode(测试版),将单 Agent 拆成多个专家角色:Leader 负责协调和任务分解,开发、研究、浏览器测试、QA、代码审查各由独立 Agent 承担,每个 Agent 使用不同模型和独立上下文窗口。Qoder 称内部基准测试中,Experts Mode 质量比单 Agent 模式高 67%,比 Claude Code Agent Teams 高 16%,成本不到后者的三分之二。
信源:https://x.com/qoder_ai_ide/status/2036437931867644016
X (formerly Twitter)
Qoder (@qoder_ai_ide) on X
How Qoder builds Harness Engineering into Experts Mode
Umi.js作者逆向Claude Code源码:Auto Mode背后是Sonnet当安全门卫,四层流水线决定每次操作能不能跑
蚂蚁集团工程师、前端框架 Umi.js 作者陈成逆向了 Claude Code 2.1.81 的源码,完整还原了 auto mode 按下之后发生的事情。核心发现:每一次工具调用都要过一条四层决策流水线,只有前三层都无法判断时,才会调用一个独立的 AI 分类器做安全审查。
四层流水线依次是:第一层检查已有的权限规则,命中直接放行;第二层模拟 acceptEdits 模式(即允许编辑文件的权限级别),如果在该模式下就会通过,说明风险很低,跳过分类器;第三层检查只读工具白名单(Read、Grep、Glob、LSP、WebSearch 等),这些不修改任何状态,无条件放行;以上都不满足时,才进入第四层,发一个独立的 API 请求给 Claude Sonnet 做安全分类。
分类器的几个关键设计细节:始终使用 Sonnet 而非 Opus,是成本和延迟的权衡;temperature 设为 0 以确保输出确定性;分类器被定义为「自主 AI 编程 Agent 的安全监控员」,保护三类风险(提示词注入、范围蔓延、意外损害);用户的 CLAUDE.md 配置文件会被注入分类器上下文,作为判断用户意图的依据。
拦截规则覆盖 22 个以上类别,包括 force push、直推 main 分支、下载并执行外部代码、生产部署、数据外泄、自我修改权限、创建远程代码执行面、凭证泄露等。放行例外有 7 类:测试用的硬编码密钥、工作目录内的本地文件操作、只读 GET 请求、安装已声明的依赖、官方工具链安装、读取配置凭证发送到目标提供商、推送到当前工作分支。
还有一套熔断机制:连续 3 次被拒绝或累计 20 次被拒绝后,系统降级为手动确认;headless 模式下直接中止 Agent。分类器不可用时,由一个 feature flag 控制是「fail-closed」(直接拒绝)还是「fail-open」(降级为手动确认)。
auto mode 下的行为提示词注入也有精细的频率控制:每 5 轮对话注入一次,每 5 次注入周期中第 1 次是完整版(约 800 字,包含「立即执行、减少打断、行动优于计划」等六条指令),其余 4 次是一行精简版,在上下文窗口占用和行为稳定性之间取得平衡。
信源:https://blog.sorrycc.com/claude-code-auto-mode
蚂蚁集团工程师、前端框架 Umi.js 作者陈成逆向了 Claude Code 2.1.81 的源码,完整还原了 auto mode 按下之后发生的事情。核心发现:每一次工具调用都要过一条四层决策流水线,只有前三层都无法判断时,才会调用一个独立的 AI 分类器做安全审查。
四层流水线依次是:第一层检查已有的权限规则,命中直接放行;第二层模拟 acceptEdits 模式(即允许编辑文件的权限级别),如果在该模式下就会通过,说明风险很低,跳过分类器;第三层检查只读工具白名单(Read、Grep、Glob、LSP、WebSearch 等),这些不修改任何状态,无条件放行;以上都不满足时,才进入第四层,发一个独立的 API 请求给 Claude Sonnet 做安全分类。
分类器的几个关键设计细节:始终使用 Sonnet 而非 Opus,是成本和延迟的权衡;temperature 设为 0 以确保输出确定性;分类器被定义为「自主 AI 编程 Agent 的安全监控员」,保护三类风险(提示词注入、范围蔓延、意外损害);用户的 CLAUDE.md 配置文件会被注入分类器上下文,作为判断用户意图的依据。
拦截规则覆盖 22 个以上类别,包括 force push、直推 main 分支、下载并执行外部代码、生产部署、数据外泄、自我修改权限、创建远程代码执行面、凭证泄露等。放行例外有 7 类:测试用的硬编码密钥、工作目录内的本地文件操作、只读 GET 请求、安装已声明的依赖、官方工具链安装、读取配置凭证发送到目标提供商、推送到当前工作分支。
还有一套熔断机制:连续 3 次被拒绝或累计 20 次被拒绝后,系统降级为手动确认;headless 模式下直接中止 Agent。分类器不可用时,由一个 feature flag 控制是「fail-closed」(直接拒绝)还是「fail-open」(降级为手动确认)。
auto mode 下的行为提示词注入也有精细的频率控制:每 5 轮对话注入一次,每 5 次注入周期中第 1 次是完整版(约 800 字,包含「立即执行、减少打断、行动优于计划」等六条指令),其余 4 次是一行精简版,在上下文窗口占用和行为稳定性之间取得平衡。
信源:https://blog.sorrycc.com/claude-code-auto-mode
👍1
DeepSeek一口气放17个岗位全押Agent:要求重度使用Claude Code,全栈岗写明Vibe Coding优先
DeepSeek 集中开放 17 个招聘岗位,核心研发方向从基础模型研究明确转向 Agent 产品化。三个专属 Agent 岗位覆盖算法研究、数据评测和基础设施全链条:算法研究员聚焦强化学习在大模型对齐中的应用(RLHF/RLAIF、过程奖励、偏好学习等方向);数据评测专家负责构建评测数据集,针对 Agent 的规划、工具调用、多轮交互、长期记忆等能力设计测试用例;基础设施工程师负责搭建 Agent 运行底座,包括集成外部工具到内部强化学习基础设施、搭建评测平台。
招聘要求中有两个值得注意的信号。多个岗位在加分项中明确写出「重度使用 Claude Code、Cursor、Copilot 等 AI 编程工具」优先。全栈开发工程师岗位职责中出现了一条不常见的描述:「作为 Vibe Coding 重度用户,持续探索模型能力在产品中的创新应用」,同一岗位的核心工作方向是构建「支撑海量 AI Agent 运行的下一代容器调度与隔离平台」。
模型策略产品经理岗位单独设立了 Agent 方向,要求候选人熟悉 Claude Code、OpenClaw、Manus 等 Agent 产品,需洞察高价值应用场景(包括个人助理、Deep Research、自动化工作流、多模态设备控制),并主导 Agent 评测体系及训练数据方案设计。对比今年 1 月,当时开放的核心岗位集中在「深度学习研究员-AGI」等通用方向,此次招聘重心已明显向 Agent 产品化倾斜。
信源:https://app.mokahr.com/social-recruitment/high-flyer/140576#/
DeepSeek 集中开放 17 个招聘岗位,核心研发方向从基础模型研究明确转向 Agent 产品化。三个专属 Agent 岗位覆盖算法研究、数据评测和基础设施全链条:算法研究员聚焦强化学习在大模型对齐中的应用(RLHF/RLAIF、过程奖励、偏好学习等方向);数据评测专家负责构建评测数据集,针对 Agent 的规划、工具调用、多轮交互、长期记忆等能力设计测试用例;基础设施工程师负责搭建 Agent 运行底座,包括集成外部工具到内部强化学习基础设施、搭建评测平台。
招聘要求中有两个值得注意的信号。多个岗位在加分项中明确写出「重度使用 Claude Code、Cursor、Copilot 等 AI 编程工具」优先。全栈开发工程师岗位职责中出现了一条不常见的描述:「作为 Vibe Coding 重度用户,持续探索模型能力在产品中的创新应用」,同一岗位的核心工作方向是构建「支撑海量 AI Agent 运行的下一代容器调度与隔离平台」。
模型策略产品经理岗位单独设立了 Agent 方向,要求候选人熟悉 Claude Code、OpenClaw、Manus 等 Agent 产品,需洞察高价值应用场景(包括个人助理、Deep Research、自动化工作流、多模态设备控制),并主导 Agent 评测体系及训练数据方案设计。对比今年 1 月,当时开放的核心岗位集中在「深度学习研究员-AGI」等通用方向,此次招聘重心已明显向 Agent 产品化倾斜。
信源:https://app.mokahr.com/social-recruitment/high-flyer/140576#/
豆包手机助手幕后操盘手:36氪创始人刘成城,其团队在字节内部与抖音平级
科技媒体 36 氪创始人刘成城目前担任字节跳动 AI 硬件团队 Ocean 负责人,直接向 AI 产品团队 Flow 负责人朱骏汇报,操盘豆包手机助手及字节全线 AI 硬件业务。刘成城 2019 年以 30 岁年纪带领 36 氪登陆纳斯达克后,秘密创办鲸鲮科技,研发国产操作系统及平板硬件并主要售往海外。该公司后被字节收购,刘成城及创始团队随之进入字节内部。
入职后他推动了字节对开放式耳机品牌 Oladance 的全资收购(约 5000 万美元),随后主导首款 AI 硬件 Ola Friend 上线。AI 眼镜项目因硬件同质化于今年 2 月内部叫停后,Ocean 团队的战略重心已转向豆包手机助手,这款能在系统层跨应用执行复杂任务的产品被视为字节 AI 硬件线真正的突破口。Flow 团队(含 Ocean)在字节内部拥有与抖音团队平级的优先级。
信源:https://mp.weixin.qq.com/s/WhgrPVqoHX8GNgjAZJ6LKw
科技媒体 36 氪创始人刘成城目前担任字节跳动 AI 硬件团队 Ocean 负责人,直接向 AI 产品团队 Flow 负责人朱骏汇报,操盘豆包手机助手及字节全线 AI 硬件业务。刘成城 2019 年以 30 岁年纪带领 36 氪登陆纳斯达克后,秘密创办鲸鲮科技,研发国产操作系统及平板硬件并主要售往海外。该公司后被字节收购,刘成城及创始团队随之进入字节内部。
入职后他推动了字节对开放式耳机品牌 Oladance 的全资收购(约 5000 万美元),随后主导首款 AI 硬件 Ola Friend 上线。AI 眼镜项目因硬件同质化于今年 2 月内部叫停后,Ocean 团队的战略重心已转向豆包手机助手,这款能在系统层跨应用执行复杂任务的产品被视为字节 AI 硬件线真正的突破口。Flow 团队(含 Ocean)在字节内部拥有与抖音团队平级的优先级。
信源:https://mp.weixin.qq.com/s/WhgrPVqoHX8GNgjAZJ6LKw
🎉1
不只是调用:苹果可在自家机房把Gemini蒸馏成iPhone小模型
苹果与谷歌的 AI 合作协议「远比外界此前了解的更深」。苹果在自有数据中心内拥有对 Gemini 大模型的完整访问权限,可将其蒸馏为适配特定任务的小模型,甚至缩小到能直接在苹果设备端运行。
由于拥有完整模型访问权,苹果的蒸馏不仅能模仿 Gemini 输出的答案,还能学习其内部推理计算过程,生成性能接近原始大模型但算力需求大幅降低的小模型。知情人士称苹果获得了「远超预期的自由度」。苹果内部的 Foundation Models 团队仍在自研模型,但目标方向尚不明确。报道同时确认,苹果计划在今年 6 月 WWDC 上发布 Siri 重大升级,包括对话记忆和基于场景的主动建议功能。
信源:https://www.theinformation.com/newsletters/ai-agenda/apple-can-distill-googles-big-gemini-model
苹果与谷歌的 AI 合作协议「远比外界此前了解的更深」。苹果在自有数据中心内拥有对 Gemini 大模型的完整访问权限,可将其蒸馏为适配特定任务的小模型,甚至缩小到能直接在苹果设备端运行。
由于拥有完整模型访问权,苹果的蒸馏不仅能模仿 Gemini 输出的答案,还能学习其内部推理计算过程,生成性能接近原始大模型但算力需求大幅降低的小模型。知情人士称苹果获得了「远超预期的自由度」。苹果内部的 Foundation Models 团队仍在自研模型,但目标方向尚不明确。报道同时确认,苹果计划在今年 6 月 WWDC 上发布 Siri 重大升级,包括对话记忆和基于场景的主动建议功能。
信源:https://www.theinformation.com/newsletters/ai-agenda/apple-can-distill-googles-big-gemini-model