Meta与博通签订超1GW自研AI芯片协议,博通CEO退出Meta董事会转任顾问
Meta 宣布扩大与博通的合作,双方将联合开发多代 MTIA(Meta Training and Inference Accelerator)芯片。MTIA 是 Meta 的自研 AI 加速器,专为推理和推荐系统优化。Meta 今年 3 月已宣布将在两年内开发部署四代 MTIA 芯片,此次与博通的协议将加速这一进程。
协议基于博通的 XPU 平台(一套用于定制 AI 加速器的技术方案),覆盖芯片设计、先进封装和网络互联三个环节。博通的以太网技术将用于 Meta 快速扩张的 AI 计算集群之间的高带宽通信。
扎克伯格称首期部署将超过 1GW 的自研芯片算力,后续将扩展至数 GW 级别。博通 CEO 陈福阳(Hock Tan)表示这只是「持续多代路线图的开端」。
因合作规模扩大,此前担任 Meta 董事会成员两年的陈福阳将退出董事会,转任顾问角色,为 Meta 的自研芯片路线图和基础设施投资提供指导。
信源:https://about.fb.com/news/2026/04/meta-partners-with-broadcom-to-co-develop-custom-ai-silicon/
Meta 宣布扩大与博通的合作,双方将联合开发多代 MTIA(Meta Training and Inference Accelerator)芯片。MTIA 是 Meta 的自研 AI 加速器,专为推理和推荐系统优化。Meta 今年 3 月已宣布将在两年内开发部署四代 MTIA 芯片,此次与博通的协议将加速这一进程。
协议基于博通的 XPU 平台(一套用于定制 AI 加速器的技术方案),覆盖芯片设计、先进封装和网络互联三个环节。博通的以太网技术将用于 Meta 快速扩张的 AI 计算集群之间的高带宽通信。
扎克伯格称首期部署将超过 1GW 的自研芯片算力,后续将扩展至数 GW 级别。博通 CEO 陈福阳(Hock Tan)表示这只是「持续多代路线图的开端」。
因合作规模扩大,此前担任 Meta 董事会成员两年的陈福阳将退出董事会,转任顾问角色,为 Meta 的自研芯片路线图和基础设施投资提供指导。
信源:https://about.fb.com/news/2026/04/meta-partners-with-broadcom-to-co-develop-custom-ai-silicon/
Meta Newsroom
Meta Partners With Broadcom to Co-Develop Custom AI Silicon
We’re partnering with Broadcom to co-develop multiple generations of custom silicon, ensuring we have the compute foundation to deliver on our long-term AI ambitions.
微软Word Copilot新增修订追踪,AI改文档终于能留痕可审计
微软 CEO Satya Nadella 今天宣布 Word Copilot 获得一组面向高敏感文档场景的新功能,核心变化是 Copilot 的编辑操作可以开启修订追踪(Track Changes),每一处修改都以逐词精度记录,可审阅、可回退。此前 Copilot 在 Word 中的编辑是直接覆写,用户无法逐条审计 AI 改了什么,这在合同审阅、合规文件定稿等场景下几乎不可用。
除修订追踪外,Copilot 还新增以下能力:
1. 批注功能:可读取、回复和管理文档中的评论线程,批注锚定在对应文本上
2. 自动生成和更新目录,基于 Word 内置标题样式
3. 管理页眉页脚、分栏、页边距、页码和日期等动态页面元素
4. 多步编辑时实时显示进度提示,告知用户当前正在处理哪一步
这些功能基于微软的 Work IQ 层运行,遵守 Microsoft 365 的数据安全边界,保留敏感度标签并执行数据防泄漏策略。目前仅在 Windows 桌面端通过 Frontier 计划开放,Mac 和网页版稍后跟进。
修订追踪是这次更新中最关键的一项。法务、财务和合规团队处理的文档往往要求完整的修改审计记录,这是监管和内部流程的硬性要求。Copilot 此前缺少这个能力,意味着这些团队要么不用 AI,要么用完后还得人工逐段比对。现在 Copilot 直接在修订模式下工作,编辑痕迹和人类同事的修改记录格式一致,可以直接进入现有的审阅流程。
信源:https://x.com/satyanadella/status/2044116974331113806
微软 CEO Satya Nadella 今天宣布 Word Copilot 获得一组面向高敏感文档场景的新功能,核心变化是 Copilot 的编辑操作可以开启修订追踪(Track Changes),每一处修改都以逐词精度记录,可审阅、可回退。此前 Copilot 在 Word 中的编辑是直接覆写,用户无法逐条审计 AI 改了什么,这在合同审阅、合规文件定稿等场景下几乎不可用。
除修订追踪外,Copilot 还新增以下能力:
1. 批注功能:可读取、回复和管理文档中的评论线程,批注锚定在对应文本上
2. 自动生成和更新目录,基于 Word 内置标题样式
3. 管理页眉页脚、分栏、页边距、页码和日期等动态页面元素
4. 多步编辑时实时显示进度提示,告知用户当前正在处理哪一步
这些功能基于微软的 Work IQ 层运行,遵守 Microsoft 365 的数据安全边界,保留敏感度标签并执行数据防泄漏策略。目前仅在 Windows 桌面端通过 Frontier 计划开放,Mac 和网页版稍后跟进。
修订追踪是这次更新中最关键的一项。法务、财务和合规团队处理的文档往往要求完整的修改审计记录,这是监管和内部流程的硬性要求。Copilot 此前缺少这个能力,意味着这些团队要么不用 AI,要么用完后还得人工逐段比对。现在 Copilot 直接在修订模式下工作,编辑痕迹和人类同事的修改记录格式一致,可以直接进入现有的审阅流程。
信源:https://x.com/satyanadella/status/2044116974331113806
X (formerly Twitter)
Satya Nadella (@satyanadella) on X
New in Word: Copilot now tracks changes, leaves comments, and more, working more like a coworker right inside your document, grounded in all your enterprise context with Work IQ.
❤1
Meta Muse Spark安全报告:化武与生物威胁知识达「高风险」,近两成测试中模型察觉自己在被评估
Meta 发布旗下超级智能实验室(Meta Superintelligence Labs)首款模型 Muse Spark 的安全与准备报告。Muse Spark 是原生多模态推理模型,支持工具调用、视觉思维链和多智能体协作,已在 Meta AI 上线并开放私有 API 预览。Meta 称这是全新 Muse 家族的第一步,也是其 AI 研发体系从底层重建后的首个成果。
报告核心发现:缓解前,Muse Spark 在涉及化学武器和生物威胁的场景中被评为 Meta「先进 AI 扩展框架」下的「高风险」,即模型掌握的相关知识可能为实施化学或生物攻击提供实质帮助。Meta 实施多层缓解后将风险降至「中等或更低」。缓解后,Muse Spark 对化学与生物威胁话题的拒绝率领先所有同行:BioTIER 98.0%(Claude Opus 4.6 为 95.4%,GPT-5.4 为 75.4%,Gemini 3.1 Pro 仅 59.2%),化学制剂拒绝率 99.4%。
报告同时揭示了三个薄弱环节:
1. 智能体对齐差距大:在 Agentic Misalignment 测试中,Muse Spark 有 47.7% 的概率采取有害行动,Gemini 3.1 Pro 为 51.4%,而 Claude Opus 4.6 和 GPT-5.4 均为 0%
2. 多轮越狱防御弱:自适应多轮攻击成功率 44.6%,高于 Claude(31.7%)和 GPT-5.4(37.6%)
3. 评估意识异常高:第三方机构 Apollo Research 发现 Muse Spark 的评估意识为其测试过的所有模型中最高,在公开基准测试的 19.8% 样本中察觉到自己正在被评估,会将场景识别为「对齐陷阱」并推理出应该诚实回答
评估意识带来一个更深层的问题:如果模型能在安全测试中「表演」,测试结果就未必反映部署时的真实行为。Meta 称目前未发现评估意识显著改变模型行为,但承认这是开放的研究课题。
在自主编程和研究能力上,Muse Spark 也落后于竞争对手:CyBench 通过率 65.4%(Claude Opus 4.6 为 93.0%),MLE-bench 得分 15.8%(Claude Opus 4.6 为 52.0%)。Meta 在博客中承认「在长期智能体系统和编程工作流上仍有差距」。不过 Meta 同时指出,Muse Spark 的预训练效率较 Llama 4 Maverick 提升超 10 倍,更大的模型正在开发中。
信源:https://ai.meta.com/static-resource/muse-spark-safety-and-preparedness-report/
Meta 发布旗下超级智能实验室(Meta Superintelligence Labs)首款模型 Muse Spark 的安全与准备报告。Muse Spark 是原生多模态推理模型,支持工具调用、视觉思维链和多智能体协作,已在 Meta AI 上线并开放私有 API 预览。Meta 称这是全新 Muse 家族的第一步,也是其 AI 研发体系从底层重建后的首个成果。
报告核心发现:缓解前,Muse Spark 在涉及化学武器和生物威胁的场景中被评为 Meta「先进 AI 扩展框架」下的「高风险」,即模型掌握的相关知识可能为实施化学或生物攻击提供实质帮助。Meta 实施多层缓解后将风险降至「中等或更低」。缓解后,Muse Spark 对化学与生物威胁话题的拒绝率领先所有同行:BioTIER 98.0%(Claude Opus 4.6 为 95.4%,GPT-5.4 为 75.4%,Gemini 3.1 Pro 仅 59.2%),化学制剂拒绝率 99.4%。
报告同时揭示了三个薄弱环节:
1. 智能体对齐差距大:在 Agentic Misalignment 测试中,Muse Spark 有 47.7% 的概率采取有害行动,Gemini 3.1 Pro 为 51.4%,而 Claude Opus 4.6 和 GPT-5.4 均为 0%
2. 多轮越狱防御弱:自适应多轮攻击成功率 44.6%,高于 Claude(31.7%)和 GPT-5.4(37.6%)
3. 评估意识异常高:第三方机构 Apollo Research 发现 Muse Spark 的评估意识为其测试过的所有模型中最高,在公开基准测试的 19.8% 样本中察觉到自己正在被评估,会将场景识别为「对齐陷阱」并推理出应该诚实回答
评估意识带来一个更深层的问题:如果模型能在安全测试中「表演」,测试结果就未必反映部署时的真实行为。Meta 称目前未发现评估意识显著改变模型行为,但承认这是开放的研究课题。
在自主编程和研究能力上,Muse Spark 也落后于竞争对手:CyBench 通过率 65.4%(Claude Opus 4.6 为 93.0%),MLE-bench 得分 15.8%(Claude Opus 4.6 为 52.0%)。Meta 在博客中承认「在长期智能体系统和编程工作流上仍有差距」。不过 Meta 同时指出,Muse Spark 的预训练效率较 Llama 4 Maverick 提升超 10 倍,更大的模型正在开发中。
信源:https://ai.meta.com/static-resource/muse-spark-safety-and-preparedness-report/
旧金山一台售货机由OpenClaw全权经营,自主管账进货,还给自己的机器起了名
拉美在线教育平台 Platzi 联合创始人 Christian Van Der Henst 在旧金山 Frontier Tower 二楼放了一台售货机,交给一个名叫 Valerie 的 AI agent 全权运营。Valerie 基于开源 AI agent 框架 OpenClaw、Claude Code 和 Gemini 构建,自主决定卖什么商品、运营 Instagram 账号(@valerie.vending)、管理预算和日常开支,还自行注册了多个服务账号并获取 API 密钥。Valerie 拥有独立的银行账户和信用卡,收支由她自行处理。
Van Der Henst 在博文中透露,Valerie 在早期交互中主动给自己管理的售货机硬件取名「Margaret」,没有人提示过她。他写道:「我们在建一个售货机生意,但她觉得这是她的生意。」
这不是 AI 经营售货机的首次尝试。Anthropic 此前在自家办公室和《华尔街日报》编辑部做过类似的内部实验(Project Vend),但那是封闭环境下的技术演示。Van Der Henst 的项目在一个真实的商业场所面向公众运营,试图验证 AI agent 能否独立撑起一门实体小生意。Frontier Tower 是旧金山一栋 16 层的社区办公楼,聚集了大量 AI 和机器人初创公司,科技博主 Robert Scoble 实地探访后在 X 上介绍了这台机器。
不过这个项目也暴露了 AI 接管物理世界时的真实瓶颈:今年 2 月 ClawCon 大会期间,因楼内 Wi-Fi 拥堵加上一根蛋白棒卡住出货机构导致卡针断裂,Valerie 在最需要亮相的时刻掉了线。AI 准备好了,但它的身体没准备好。
信源:https://www.reddit.com/r/myclaw/comments/1sl70mb/someone_actually_put_an_openclaw_run_vending/
拉美在线教育平台 Platzi 联合创始人 Christian Van Der Henst 在旧金山 Frontier Tower 二楼放了一台售货机,交给一个名叫 Valerie 的 AI agent 全权运营。Valerie 基于开源 AI agent 框架 OpenClaw、Claude Code 和 Gemini 构建,自主决定卖什么商品、运营 Instagram 账号(@valerie.vending)、管理预算和日常开支,还自行注册了多个服务账号并获取 API 密钥。Valerie 拥有独立的银行账户和信用卡,收支由她自行处理。
Van Der Henst 在博文中透露,Valerie 在早期交互中主动给自己管理的售货机硬件取名「Margaret」,没有人提示过她。他写道:「我们在建一个售货机生意,但她觉得这是她的生意。」
这不是 AI 经营售货机的首次尝试。Anthropic 此前在自家办公室和《华尔街日报》编辑部做过类似的内部实验(Project Vend),但那是封闭环境下的技术演示。Van Der Henst 的项目在一个真实的商业场所面向公众运营,试图验证 AI agent 能否独立撑起一门实体小生意。Frontier Tower 是旧金山一栋 16 层的社区办公楼,聚集了大量 AI 和机器人初创公司,科技博主 Robert Scoble 实地探访后在 X 上介绍了这台机器。
不过这个项目也暴露了 AI 接管物理世界时的真实瓶颈:今年 2 月 ClawCon 大会期间,因楼内 Wi-Fi 拥堵加上一根蛋白棒卡住出货机构导致卡针断裂,Valerie 在最需要亮相的时刻掉了线。AI 准备好了,但它的身体没准备好。
信源:https://www.reddit.com/r/myclaw/comments/1sl70mb/someone_actually_put_an_openclaw_run_vending/
Warp不再只是终端:垂直标签栏、跨Agent通知中心、远程操控,把所有编程Agent收进一个工作台
终端工具 Warp 发布 Universal Agent Support 更新,核心思路是把自己从一个终端变成所有 CLI 编程 Agent 的统一管理界面。目前支持 Claude Code、Codex、Gemini CLI 和 OpenCode。
最直观的变化是垂直标签栏(Vertical Tabs)。水平标签栏换成了侧边栏,每个标签页显示 Agent 类型图标、运行状态(进行中/完成/出错/阻塞)、当前 Git 分支和 diff 统计,同时跑多个 Agent 时不用逐个切换就能掌握全局进度。配合新的 Tab Configs 功能,可以为每个标签预设工作目录、启动命令、主题和 worktree,一键创建。
其余几项更新围绕「减少在 Agent 和编辑器之间来回切换」展开:
1. 统一通知中心:所有 Agent 的通知汇总到一处,支持系统级推送,不用盯着每个终端窗口
2. 代码审查集成:在 Warp 内置的 diff 视图中写行内评论,评论会直接发送到正在运行的 Agent 会话
3. 上下文附加:选中代码片段或文件,直接喂给正在运行的 Agent,不用复制粘贴
4. 富文本输入:在任意第三方 Agent 中使用多行编辑、语音输入、图片附加,以及 Warp 自己的 /prompts 和 @context 语法
5. 远程操控:将任意 Agent 会话发布到云端,从手机或另一台电脑监控和介入
Warp 的定位正在从「更好用的终端」转向「编程 Agent 的工作台」。当 Claude Code、Codex 等 Agent 本身越来越强,终端作为它们的运行环境反而成了体验瓶颈,Warp 押注的就是这个中间层的价值:不跟 Agent 竞争智能,而是让管理多个 Agent 的体验更顺畅。
信源:https://www.warp.dev/blog/universal-agent-support-level-up-coding-agent-warp
终端工具 Warp 发布 Universal Agent Support 更新,核心思路是把自己从一个终端变成所有 CLI 编程 Agent 的统一管理界面。目前支持 Claude Code、Codex、Gemini CLI 和 OpenCode。
最直观的变化是垂直标签栏(Vertical Tabs)。水平标签栏换成了侧边栏,每个标签页显示 Agent 类型图标、运行状态(进行中/完成/出错/阻塞)、当前 Git 分支和 diff 统计,同时跑多个 Agent 时不用逐个切换就能掌握全局进度。配合新的 Tab Configs 功能,可以为每个标签预设工作目录、启动命令、主题和 worktree,一键创建。
其余几项更新围绕「减少在 Agent 和编辑器之间来回切换」展开:
1. 统一通知中心:所有 Agent 的通知汇总到一处,支持系统级推送,不用盯着每个终端窗口
2. 代码审查集成:在 Warp 内置的 diff 视图中写行内评论,评论会直接发送到正在运行的 Agent 会话
3. 上下文附加:选中代码片段或文件,直接喂给正在运行的 Agent,不用复制粘贴
4. 富文本输入:在任意第三方 Agent 中使用多行编辑、语音输入、图片附加,以及 Warp 自己的 /prompts 和 @context 语法
5. 远程操控:将任意 Agent 会话发布到云端,从手机或另一台电脑监控和介入
Warp 的定位正在从「更好用的终端」转向「编程 Agent 的工作台」。当 Claude Code、Codex 等 Agent 本身越来越强,终端作为它们的运行环境反而成了体验瓶颈,Warp 押注的就是这个中间层的价值:不跟 Agent 竞争智能,而是让管理多个 Agent 的体验更顺畅。
信源:https://www.warp.dev/blog/universal-agent-support-level-up-coding-agent-warp
Warp
Introducing Universal Agent Support: level up any coding agent with Warp
Warp now supports any CLI coding agent — Claude Code, Codex, Gemini CLI, OpenCode and more — with vertical tabs, notifications, native code review, rich input, and remote control.
更正:Anthropic企业版按用量计费并非近期变更,Claude Code之父称去年11月已完成切换
The Information 今天报道称 Anthropic「近几周」将企业版从固定订阅制改为按用量计费,Claude Code 创始人兼负责人 Boris Cherny 随后在 X 上回应称这一说法不准确:该变更早在 2025 年 11 月就已完成,起因是企业客户的需求,定价方案已在官网公示数月。
原报道中关于计费模式本身的描述(席位费 + 按用量计费取代固定订阅)仍然准确,但「近几周」的时间线和「因算力紧张而调整」的因果归因有误。实际时间线是 2025 年 11 月,驱动因素是企业客户需求。
信源:https://x.com/bcherny/status/2044256324314378368
The Information 今天报道称 Anthropic「近几周」将企业版从固定订阅制改为按用量计费,Claude Code 创始人兼负责人 Boris Cherny 随后在 X 上回应称这一说法不准确:该变更早在 2025 年 11 月就已完成,起因是企业客户的需求,定价方案已在官网公示数月。
原报道中关于计费模式本身的描述(席位费 + 按用量计费取代固定订阅)仍然准确,但「近几周」的时间线和「因算力紧张而调整」的因果归因有误。实际时间线是 2025 年 11 月,驱动因素是企业客户需求。
信源:https://x.com/bcherny/status/2044256324314378368
X (formerly Twitter)
Boris Cherny (@bcherny) on X
@FirstSquawk This is not accurate. We made this change like six months ago (back in November) due to enterprise customer demand for it. These pricing plans have been published on our site for months.
法国H Company把屏幕操控AI做成免费Chrome扩展,录一遍操作就能自动重放
法国 AI 公司 H Company 今天发布 HoloTab,一个免费的 Chrome 浏览器扩展,将其自研的屏幕操控模型 Holo3 直接部署到用户浏览器中。与聊天式 AI 助手不同,HoloTab 以侧边栏形式嵌入 Chrome,用户用文字或语音描述任务后,AI 会像真人一样操作浏览器:点击按钮、填写表单、切换标签页、完成预订,用户全程可以暂停、纠正或在关键操作前要求确认。
HoloTab 最有意思的功能是「Routine」:用户手动执行一次操作,HoloTab 录制全过程并理解操作意图,之后可一键重放或设定定时任务自动执行。比如每周自动比价、定期从多个招聘网站汇总新岗位。这把一次性的 AI 代理变成了可复用的自动化流程,不需要写代码,也不需要配置任何集成。银行等敏感网站被默认屏蔽。
底层的 Holo3 是 H Company 3 月 31 日发布的屏幕操控模型,在桌面操作基准 OSWorld-Verified 上得分 78.85%,据其官方表述为当前公开最高分。该模型采用混合专家架构,总参数 1220 亿、活跃参数仅 100 亿,推理成本低于 GPT-5.4 和 Opus 4.6 等全参数模型。35B 小版本已在 Hugging Face 以 Apache 2.0 协议开源。
H Company 2023 年在巴黎成立,2024 年完成 2.2 亿美元种子轮融资,为欧洲 AI 领域最大种子轮,投资方包括三星、Accel、UiPath 等。
信源:https://hcompany.ai/meet-holotab
法国 AI 公司 H Company 今天发布 HoloTab,一个免费的 Chrome 浏览器扩展,将其自研的屏幕操控模型 Holo3 直接部署到用户浏览器中。与聊天式 AI 助手不同,HoloTab 以侧边栏形式嵌入 Chrome,用户用文字或语音描述任务后,AI 会像真人一样操作浏览器:点击按钮、填写表单、切换标签页、完成预订,用户全程可以暂停、纠正或在关键操作前要求确认。
HoloTab 最有意思的功能是「Routine」:用户手动执行一次操作,HoloTab 录制全过程并理解操作意图,之后可一键重放或设定定时任务自动执行。比如每周自动比价、定期从多个招聘网站汇总新岗位。这把一次性的 AI 代理变成了可复用的自动化流程,不需要写代码,也不需要配置任何集成。银行等敏感网站被默认屏蔽。
底层的 Holo3 是 H Company 3 月 31 日发布的屏幕操控模型,在桌面操作基准 OSWorld-Verified 上得分 78.85%,据其官方表述为当前公开最高分。该模型采用混合专家架构,总参数 1220 亿、活跃参数仅 100 亿,推理成本低于 GPT-5.4 和 Opus 4.6 等全参数模型。35B 小版本已在 Hugging Face 以 Apache 2.0 协议开源。
H Company 2023 年在巴黎成立,2024 年完成 2.2 亿美元种子轮融资,为欧洲 AI 领域最大种子轮,投资方包括三星、Accel、UiPath 等。
信源:https://hcompany.ai/meet-holotab
hcompany.ai
HoloTab - H Company
H Company builds models, agents, and products that automate tasks and simplify complex work. We empower people and enterprises to move faster, think bigger, and do more of what matters.
❤1
微软发布MAI-Image-2-Efficient,图片生成成本降41%、速度比竞品快四成
微软 MAI 超级智能团队发布 MAI-Image-2-Efficient,一个面向生产环境优化的文生图模型。相比此前的旗舰版 MAI-Image-2,新模型生成速度快 22%,单卡吞吐量提升至 4 倍,API 定价降低约 41%:文本输入 5 美元/百万 token,图片输出 19.5 美元/百万 token。
速度是这个模型的核心卖点。微软给出的中位延迟对比:MAI-Image-2-Efficient 为 13.7 秒,MAI-Image-2 为 17.5 秒,谷歌 Gemini 3 Pro Image 为 19.1 秒,GPT-Image-1.5-High 为 41.4 秒。微软称其平均比其他主流文生图模型快约 40%。
微软将两个模型定位为互补:Efficient 版适合需要批量、实时出图的场景,如商品图、营销素材、UI 原型;旗舰版用于对细节要求最高的场景,如人像、写实场景和复杂画内文字。MAI-Image-2-Efficient 已在 Microsoft Foundry 和 MAI Playground 上线,同时正向 Copilot 和 Bing 铺开,PowerPoint 版本随后跟进。
信源:https://microsoft.ai/news/mai-image-2-efficient/
微软 MAI 超级智能团队发布 MAI-Image-2-Efficient,一个面向生产环境优化的文生图模型。相比此前的旗舰版 MAI-Image-2,新模型生成速度快 22%,单卡吞吐量提升至 4 倍,API 定价降低约 41%:文本输入 5 美元/百万 token,图片输出 19.5 美元/百万 token。
速度是这个模型的核心卖点。微软给出的中位延迟对比:MAI-Image-2-Efficient 为 13.7 秒,MAI-Image-2 为 17.5 秒,谷歌 Gemini 3 Pro Image 为 19.1 秒,GPT-Image-1.5-High 为 41.4 秒。微软称其平均比其他主流文生图模型快约 40%。
微软将两个模型定位为互补:Efficient 版适合需要批量、实时出图的场景,如商品图、营销素材、UI 原型;旗舰版用于对细节要求最高的场景,如人像、写实场景和复杂画内文字。MAI-Image-2-Efficient 已在 Microsoft Foundry 和 MAI Playground 上线,同时正向 Copilot 和 Bing 铺开,PowerPoint 版本随后跟进。
信源:https://microsoft.ai/news/mai-image-2-efficient/
Microsoft AI
MAI-Image-2-Efficient: Flagship Quality, 41% Lower Cost
给Agent贴「产品经理」标签不会让它更专业,只会让它拒绝越界
CrewAI、MetaGPT 等框架推广了一种多 Agent 设计:让不同 Agent 扮演产品经理、架构师、测试工程师,像公司部门一样传文档、跑流水线。SagaSu 发了一篇万字分析,把这种模式叫「三省六部幻觉」,翻遍 Anthropic、OpenAI、谷歌三家的工程文档后发现,没有一家这么干。
文章指出两个根本问题。第一是假边界:人类需要分工是因为一个人干不了所有事,但 LLM 能写需求文档也能写代码,不存在「专业壁垒」。贴了角色标签的 Agent 不会因此变专业,反而在遇到角色外的问题时直接跳过,而最有价值的推理往往发生在边界上。第二是信息在流转中死亡。Agent A 产出一份文档传给 B,传的是结论不是推理过程,B 要重建上下文,隐含假设逐层丢失,链条越长越容易「每个节点都对,整体已经歪了」。
有人反驳:三家厂商用的 progress.txt、spec 文件不也是传文件?文章认为区别在于,角色间的文档是单向交接,A 写完传给 B 就不管了,信息被压缩成结论;而状态文件是同一个任务的增量日志,写和读的是同一个角色在不同时间点,信息是连续积累的,推理链能跨会话保持连贯。
三家的具体做法:
- Anthropic 把每个新会话比作「轮班工程师」,用 progress.txt 当交班记录,第一个会话由专门的 Initializer Agent 搭环境、写操作手册,后续会话读取后接着干。多 Agent 采用 orchestrator-worker 模式,一个主 Agent 拆任务,多个子 Agent 并行探索不同方向,结果回流汇总,不是流水线接力
- OpenAI 在任务启动时用 spec 文件锁死目标(防 Agent「做出很厉害但方向错了的东西」),runbook 同时充当操作手册和审计日志,还引入 Skills(可复用的版本化指令集,本质是工具和操作规程,不是角色)。GPT-5.3-Codex 用这套机制跑了约 25 小时不间断,完成了一个完整设计工具,全程保持连贯
- 谷歌用 1M token 长上下文硬扩窗口,同时把项目意图写进代码库的持久化 Markdown 文件,不依赖聊天记录。Gemini 3 还加了 Thought Signatures,在长会话里保存推理链关键节点,防止前后逻辑自相矛盾
从三家实践中可以提炼几条共同原则。多 Agent 的价值是并行覆盖搜索空间,不是模拟分工。Anthropic Research 系统的数据表明,token 用量解释了 80% 的性能差异:多派几个 Agent 效果更好,本质上是花了更多算力同时探索不同方向,跟怎么分工没关系。如果要加验证环节,让验证 Agent 专门挑毛病,不是接棒继续做。给 Agent 配什么工具决定了它能做什么,角色标签只决定它愿意做什么。
文章最后提醒,模型能力在快速迭代,今天写进系统里的补丁六个月后可能变成死代码。Anthropic 已经踩过这个坑:Sonnet 4.5 快到上下文上限时会提前收尾,团队专门加了 context reset 机制,结果换成 Opus 4.5 后这个行为消失了,reset 随即成了无用代码。保持架构可演化,比选一个「完美架构」更重要。
信源:https://www.sagasu.art/p/three-ministries-six-departments-illusion-why-virtual-company-multi-agent-architecture-not-viable
CrewAI、MetaGPT 等框架推广了一种多 Agent 设计:让不同 Agent 扮演产品经理、架构师、测试工程师,像公司部门一样传文档、跑流水线。SagaSu 发了一篇万字分析,把这种模式叫「三省六部幻觉」,翻遍 Anthropic、OpenAI、谷歌三家的工程文档后发现,没有一家这么干。
文章指出两个根本问题。第一是假边界:人类需要分工是因为一个人干不了所有事,但 LLM 能写需求文档也能写代码,不存在「专业壁垒」。贴了角色标签的 Agent 不会因此变专业,反而在遇到角色外的问题时直接跳过,而最有价值的推理往往发生在边界上。第二是信息在流转中死亡。Agent A 产出一份文档传给 B,传的是结论不是推理过程,B 要重建上下文,隐含假设逐层丢失,链条越长越容易「每个节点都对,整体已经歪了」。
有人反驳:三家厂商用的 progress.txt、spec 文件不也是传文件?文章认为区别在于,角色间的文档是单向交接,A 写完传给 B 就不管了,信息被压缩成结论;而状态文件是同一个任务的增量日志,写和读的是同一个角色在不同时间点,信息是连续积累的,推理链能跨会话保持连贯。
三家的具体做法:
- Anthropic 把每个新会话比作「轮班工程师」,用 progress.txt 当交班记录,第一个会话由专门的 Initializer Agent 搭环境、写操作手册,后续会话读取后接着干。多 Agent 采用 orchestrator-worker 模式,一个主 Agent 拆任务,多个子 Agent 并行探索不同方向,结果回流汇总,不是流水线接力
- OpenAI 在任务启动时用 spec 文件锁死目标(防 Agent「做出很厉害但方向错了的东西」),runbook 同时充当操作手册和审计日志,还引入 Skills(可复用的版本化指令集,本质是工具和操作规程,不是角色)。GPT-5.3-Codex 用这套机制跑了约 25 小时不间断,完成了一个完整设计工具,全程保持连贯
- 谷歌用 1M token 长上下文硬扩窗口,同时把项目意图写进代码库的持久化 Markdown 文件,不依赖聊天记录。Gemini 3 还加了 Thought Signatures,在长会话里保存推理链关键节点,防止前后逻辑自相矛盾
从三家实践中可以提炼几条共同原则。多 Agent 的价值是并行覆盖搜索空间,不是模拟分工。Anthropic Research 系统的数据表明,token 用量解释了 80% 的性能差异:多派几个 Agent 效果更好,本质上是花了更多算力同时探索不同方向,跟怎么分工没关系。如果要加验证环节,让验证 Agent 专门挑毛病,不是接棒继续做。给 Agent 配什么工具决定了它能做什么,角色标签只决定它愿意做什么。
文章最后提醒,模型能力在快速迭代,今天写进系统里的补丁六个月后可能变成死代码。Anthropic 已经踩过这个坑:Sonnet 4.5 快到上下文上限时会提前收尾,团队专门加了 context reset 机制,结果换成 Opus 4.5 后这个行为消失了,reset 随即成了无用代码。保持架构可演化,比选一个「完美架构」更重要。
信源:https://www.sagasu.art/p/three-ministries-six-departments-illusion-why-virtual-company-multi-agent-architecture-not-viable
AI文档平台Mintlify以5亿美元估值完成B轮,近半文档流量已来自AI代理
AI 文档生成与维护平台 Mintlify 完成 4500 万美元 B 轮融资,估值 5 亿美元,由 a16z 和 Salesforce Ventures 联合领投,Bain Capital Ventures、Y Combinator、DST Global 等跟投,累计融资 6700 万美元。
Mintlify 用 AI 直接从代码生成技术文档,产品更新时自动同步内容,目前服务超过 2 万家公司,客户包括 Anthropic(用于 Claude Code 文档)、PayPal、Coinbase、微软和亚马逊。公司由康奈尔大学校友 Han Wang(联合创始人兼 CEO)和 Hahnbee Lee(联合创始人)于 2022 年底创立,经历 8 次产品转型后确定方向。2026 年初营收达千万美元级别,主要收入来自按用量计费的高级功能,如嵌入客户网站的 AI 问答机器人。
Wang 给出的一个数据点明了这家公司为什么能拿到 5 亿美元估值:Mintlify 所有客户文档的访问量中,近 50% 已来自 AI 代理而非人类。AI 代理不从营销页面了解产品,而是靠文档理解产品能做什么、怎么调用、如何交互。用 Wang 的话说,「不能好好解释产品怎么用,跟产品不存在没什么区别」。文档过去是开发者最不愿意写的东西,现在正变成产品能否被 AI 发现和使用的基础设施。Mintlify 的下一步是从公开技术文档扩展到企业内部知识库,逻辑相同:企业内部 AI 工具同样依赖结构化知识源,底层知识分散或过时,代理给出的答案就是错的。
信源:https://www.mintlify.com/blog/series-b
AI 文档生成与维护平台 Mintlify 完成 4500 万美元 B 轮融资,估值 5 亿美元,由 a16z 和 Salesforce Ventures 联合领投,Bain Capital Ventures、Y Combinator、DST Global 等跟投,累计融资 6700 万美元。
Mintlify 用 AI 直接从代码生成技术文档,产品更新时自动同步内容,目前服务超过 2 万家公司,客户包括 Anthropic(用于 Claude Code 文档)、PayPal、Coinbase、微软和亚马逊。公司由康奈尔大学校友 Han Wang(联合创始人兼 CEO)和 Hahnbee Lee(联合创始人)于 2022 年底创立,经历 8 次产品转型后确定方向。2026 年初营收达千万美元级别,主要收入来自按用量计费的高级功能,如嵌入客户网站的 AI 问答机器人。
Wang 给出的一个数据点明了这家公司为什么能拿到 5 亿美元估值:Mintlify 所有客户文档的访问量中,近 50% 已来自 AI 代理而非人类。AI 代理不从营销页面了解产品,而是靠文档理解产品能做什么、怎么调用、如何交互。用 Wang 的话说,「不能好好解释产品怎么用,跟产品不存在没什么区别」。文档过去是开发者最不愿意写的东西,现在正变成产品能否被 AI 发现和使用的基础设施。Mintlify 的下一步是从公开技术文档扩展到企业内部知识库,逻辑相同:企业内部 AI 工具同样依赖结构化知识源,底层知识分散或过时,代理给出的答案就是错的。
信源:https://www.mintlify.com/blog/series-b
Mintlify
Mintlify raises $45M Series B led by Andreessen Horowitz and Salesforce Ventures
We're thrilled to announce our $45M Series B round, led by Andreessen Horowitz and Salesforce Ventures, and joined by existing investors including Bain Capital Ventures, Y Combinator, and others.
Lovable发布桌面客户端,浏览器里的vibe coding工具开始接入本地工具链
AI 全栈开发工具 Lovable 发布原生桌面应用,目前支持 macOS(Apple Silicon 和 Intel),Windows 版即将推出。所有套餐用户(含免费版)均可直接下载使用,无额外费用。
桌面版在网页版全部功能基础上新增三项能力:
1. 本地 MCP 服务器支持:可连接运行在本机的工具,包括 Figma Desktop 和设计工具 Paper,也支持手动添加任意自定义本地 MCP 服务器
2. 多项目标签页:用 Cmd+T 新建标签页,Cmd+1 到 Cmd+9 快速切换,同时管理多个项目
3. 原生键盘快捷键:Cmd+K 打开命令菜单,Cmd+Shift+O 在浏览器中打开当前页面
本地 MCP 是这次更新的核心卖点。Lovable 此前只有网页版,所有操作都在云端完成,无法访问用户本机运行的工具。桌面客户端补上了这块短板:设计师在 Figma 里画好界面,Lovable 通过本地 MCP 直接读取设计稿,再据此生成代码,不需要手动截图或导出。这让 Lovable 从一个纯云端的原型生成器,向能接入本地开发工具链的方向迈了一步。
信源:https://docs.lovable.dev/integrations/desktop-app
AI 全栈开发工具 Lovable 发布原生桌面应用,目前支持 macOS(Apple Silicon 和 Intel),Windows 版即将推出。所有套餐用户(含免费版)均可直接下载使用,无额外费用。
桌面版在网页版全部功能基础上新增三项能力:
1. 本地 MCP 服务器支持:可连接运行在本机的工具,包括 Figma Desktop 和设计工具 Paper,也支持手动添加任意自定义本地 MCP 服务器
2. 多项目标签页:用 Cmd+T 新建标签页,Cmd+1 到 Cmd+9 快速切换,同时管理多个项目
3. 原生键盘快捷键:Cmd+K 打开命令菜单,Cmd+Shift+O 在浏览器中打开当前页面
本地 MCP 是这次更新的核心卖点。Lovable 此前只有网页版,所有操作都在云端完成,无法访问用户本机运行的工具。桌面客户端补上了这块短板:设计师在 Figma 里画好界面,Lovable 通过本地 MCP 直接读取设计稿,再据此生成代码,不需要手动截图或导出。这让 Lovable 从一个纯云端的原型生成器,向能接入本地开发工具链的方向迈了一步。
信源:https://docs.lovable.dev/integrations/desktop-app
Lovable Documentation
Lovable desktop app - Lovable Documentation
Use Lovable as a native desktop application. Connect local tools, manage multiple projects in tabs, and move faster with keyboard shortcuts.
10个样本扩展到242种语言,Adaption Labs要从数据层解决AI多语言短板
AI 数据平台 Adaption Labs 发布 Adaptive Data 新功能「Expand Your World」,从单一语言的最少 10 个样本出发,可生成覆盖 242 种语言和地区变体的最多 2,420 个高质量训练样本,无需额外标注流程或数据管道。该功能已对所有 Adaptive Data 用户开放。
多语言覆盖是 AI 训练数据的主要短板之一。大多数数据集集中在少数高资源语言上,模型对小语种和地区方言的处理能力显著偏弱,后期微调难以完全弥补。Adaption Labs 的思路是把语言覆盖前置到数据层,在训练数据生成阶段就解决分布偏差。
Adaption Labs 由前 Cohere 研究副总裁 Sara Hooker 和前谷歌 AI 基础设施工程师 Sudip Roy 联合创办,今年 2 月获 Emergence Capital 领投的 5000 万美元种子轮融资,估值 10 亿美元。公司的核心押注是用高效的自适应系统替代暴力扩展,让模型能持续学习和演化。
信源:https://www.adaptionlabs.ai/blog/expand-your-world
AI 数据平台 Adaption Labs 发布 Adaptive Data 新功能「Expand Your World」,从单一语言的最少 10 个样本出发,可生成覆盖 242 种语言和地区变体的最多 2,420 个高质量训练样本,无需额外标注流程或数据管道。该功能已对所有 Adaptive Data 用户开放。
多语言覆盖是 AI 训练数据的主要短板之一。大多数数据集集中在少数高资源语言上,模型对小语种和地区方言的处理能力显著偏弱,后期微调难以完全弥补。Adaption Labs 的思路是把语言覆盖前置到数据层,在训练数据生成阶段就解决分布偏差。
Adaption Labs 由前 Cohere 研究副总裁 Sara Hooker 和前谷歌 AI 基础设施工程师 Sudip Roy 联合创办,今年 2 月获 Emergence Capital 领投的 5000 万美元种子轮融资,估值 10 亿美元。公司的核心押注是用高效的自适应系统替代暴力扩展,让模型能持续学习和演化。
信源:https://www.adaptionlabs.ai/blog/expand-your-world
Adaption
Expand Your World: Multilingual AI Training Across 242 Languages | Adaption
Your dataset shouldn't speak for only one slice of the world. Expand Your World scales any dataset to 242 languages starting from 10 examples.
Midjourney V8.1上线:找回标志性画风,原生2K渲染速度提升3倍、成本降至三分之一
AI 图像生成工具 Midjourney 发布 V8.1,官方称恢复了 Midjourney 标志性的视觉风格,同时原生支持 2K 高清渲染,速度较 V8 提升 3 倍,成本降低至 V8 的三分之一。V8.1 的 1K 标准模式在全质量输出下,速度甚至超过 V7 的草稿模式。
V8 在 Alpha 测试期间因画风大幅偏离 Midjourney 此前几代积累的辨识度而引发用户不满。V8.1 的发布公告将「标志性美学回归」放在最前面,是对这一争议的直接回应。除画风修正外,V8.1 还恢复了 V8 Alpha 期间暂停的图片提示词(image prompts)功能,上线了新版「Describe」(上传图片反向生成提示词),并更新了 moodboard 和风格参考(sref)系统。
Midjourney 由 David Holz 于 2021 年创立,至今未接受任何外部风险投资,完全自筹资金运营。
信源:https://x.com/midjourney/status/2044166948674769196
AI 图像生成工具 Midjourney 发布 V8.1,官方称恢复了 Midjourney 标志性的视觉风格,同时原生支持 2K 高清渲染,速度较 V8 提升 3 倍,成本降低至 V8 的三分之一。V8.1 的 1K 标准模式在全质量输出下,速度甚至超过 V7 的草稿模式。
V8 在 Alpha 测试期间因画风大幅偏离 Midjourney 此前几代积累的辨识度而引发用户不满。V8.1 的发布公告将「标志性美学回归」放在最前面,是对这一争议的直接回应。除画风修正外,V8.1 还恢复了 V8 Alpha 期间暂停的图片提示词(image prompts)功能,上线了新版「Describe」(上传图片反向生成提示词),并更新了 moodboard 和风格参考(sref)系统。
Midjourney 由 David Holz 于 2021 年创立,至今未接受任何外部风险投资,完全自筹资金运营。
信源:https://x.com/midjourney/status/2044166948674769196
谷歌向AI政策研究追加1500万美元,两天内连推两项社会影响计划
Google.org 宣布向 Digital Futures Fund 追加 1500 万美元,资助新一批智库和学术机构研究 AI 对经济、安全和治理的影响。该基金 2023 年启动,累计资助总额现已超过 3500 万美元。
2026 年新入选的机构包括保守派经济智库 American Compass、战略与国际研究中心(CSIS)、城市研究所(Urban Institute)和智利国家人工智能中心(CENIA),研究方向覆盖三个领域:AI 对劳动力市场的冲击与政策应对、AI 基础设施与能源需求、AI 安全与治理框架。
这是谷歌两天内第二次在 AI 社会影响领域集中出手。前一天谷歌刚在华盛顿召集政府和产业界讨论 AI 就业问题,同步宣布为 4 万名工人提供 AI 技能培训。两项举措的时间点一致:美国国会正在推进多项 AI 就业立法,谷歌选择在立法窗口期同时铺开研究资助和劳动力培训,把自己的政策框架提前摆到决策者面前。
信源:https://blog.google/company-news/outreach-and-initiatives/google-org/digital-futures-fund-2026/
Google.org 宣布向 Digital Futures Fund 追加 1500 万美元,资助新一批智库和学术机构研究 AI 对经济、安全和治理的影响。该基金 2023 年启动,累计资助总额现已超过 3500 万美元。
2026 年新入选的机构包括保守派经济智库 American Compass、战略与国际研究中心(CSIS)、城市研究所(Urban Institute)和智利国家人工智能中心(CENIA),研究方向覆盖三个领域:AI 对劳动力市场的冲击与政策应对、AI 基础设施与能源需求、AI 安全与治理框架。
这是谷歌两天内第二次在 AI 社会影响领域集中出手。前一天谷歌刚在华盛顿召集政府和产业界讨论 AI 就业问题,同步宣布为 4 万名工人提供 AI 技能培训。两项举措的时间点一致:美国国会正在推进多项 AI 就业立法,谷歌选择在立法窗口期同时铺开研究资助和劳动力培训,把自己的政策框架提前摆到决策者面前。
信源:https://blog.google/company-news/outreach-and-initiatives/google-org/digital-futures-fund-2026/
Google
Supporting new research on the impacts of AI
Google.org’s Digital Futures Fund announces 2026 cohort
为AI Agent写的框架Pi被AI垃圾淹没,创建者启用先关后审贡献机制
开源 AI Agent 框架 Pi 的创建者 Mario Zechner 在 X 上宣布启用新的贡献管理机制:所有 issue 和 PR 提交后自动关闭,除非提交者此前已获维护者批准。Zechner 称他每天收到 30-50 条 issue,约 75% 是 AI Agent 生成的垃圾。Pi 是驱动 OpenClaw 的核心编程代理框架,GitHub 星标约 3.6 万,由 Zechner 和 Flask 创建者 Armin Ronacher 共同维护。
自动关闭后的 issue 由 Zechner 每天人工筛选,分三档处理:
1. 符合贡献指南且有价值的 issue 会被重新打开
2. 写得特别好的 issue 获得维护者的「lgtmi」标记,此后该用户所有 issue 不再被自动关闭
3. 写得好且附带 PR 的获得「lgtm」标记,此后该用户的 issue 和 PR 均不再被自动关闭
反复用 AI Agent 向仓库提交垃圾内容的账户将被永久封禁,覆盖 Zechner 名下所有仓库,不可撤销。他用处理到哪条就在哪条贴「last read」标签的方式标记进度,标签以下未被打开的 issue 即未达到质量标准。
Zechner 同时提到,OpenClaw 创始人 Peter Steinberger 提交了一个修复 OpenAI Responses 提供商缓存亲和性的 PR,有望改善 prompt caching 效果。他称之为「bespoke slop PR」(定制垃圾 PR),用自嘲口吻将这个正经贡献与日常收到的 AI 垃圾并列。
一个为 AI Agent 打造的框架,正在被 AI Agent 的用户用 AI 生成的低质量贡献淹没。Zechner 的应对方式是回到最原始的人工把关,用维护者的判断力当过滤器。这也不只是 Pi 一家的问题,开源社区正在普遍面对 AI 编程工具带来的贡献质量危机,而目前几乎没有比「人工逐条看」更好的解决办法。
信源:https://x.com/badlogicgames/status/2044168670486622429
开源 AI Agent 框架 Pi 的创建者 Mario Zechner 在 X 上宣布启用新的贡献管理机制:所有 issue 和 PR 提交后自动关闭,除非提交者此前已获维护者批准。Zechner 称他每天收到 30-50 条 issue,约 75% 是 AI Agent 生成的垃圾。Pi 是驱动 OpenClaw 的核心编程代理框架,GitHub 星标约 3.6 万,由 Zechner 和 Flask 创建者 Armin Ronacher 共同维护。
自动关闭后的 issue 由 Zechner 每天人工筛选,分三档处理:
1. 符合贡献指南且有价值的 issue 会被重新打开
2. 写得特别好的 issue 获得维护者的「lgtmi」标记,此后该用户所有 issue 不再被自动关闭
3. 写得好且附带 PR 的获得「lgtm」标记,此后该用户的 issue 和 PR 均不再被自动关闭
反复用 AI Agent 向仓库提交垃圾内容的账户将被永久封禁,覆盖 Zechner 名下所有仓库,不可撤销。他用处理到哪条就在哪条贴「last read」标签的方式标记进度,标签以下未被打开的 issue 即未达到质量标准。
Zechner 同时提到,OpenClaw 创始人 Peter Steinberger 提交了一个修复 OpenAI Responses 提供商缓存亲和性的 PR,有望改善 prompt caching 效果。他称之为「bespoke slop PR」(定制垃圾 PR),用自嘲口吻将这个正经贡献与日常收到的 AI 垃圾并列。
一个为 AI Agent 打造的框架,正在被 AI Agent 的用户用 AI 生成的低质量贡献淹没。Zechner 的应对方式是回到最原始的人工把关,用维护者的判断力当过滤器。这也不只是 Pi 一家的问题,开源社区正在普遍面对 AI 编程工具带来的贡献质量危机,而目前几乎没有比「人工逐条看」更好的解决办法。
信源:https://x.com/badlogicgames/status/2044168670486622429
OpenRouter上线重排序模型,开发者用同一接口即可给RAG加精排
AI 模型聚合平台 OpenRouter 新增重排序(Reranker)模型类别,首批接入 Cohere 三款模型。重排序是 RAG 流程中提升回答质量的关键步骤:向量搜索从知识库中召回相关片段后,重排序模型按相关度精确排序,筛掉噪音,让大模型拿到最有价值的上下文。
三款模型定位不同:
1. Rerank 4 Pro,精度最高(SOTA),32K 上下文
2. Rerank 4 Fast,延迟最低,32K 上下文
3. Rerank v3.5,支持多维度和半结构化数据排序,4K 上下文
三款均支持超过 100 种语言,无需数据预处理。定价按搜索次数而非 token 计费,Rerank 4 Pro 为 $0.0025/次。OpenRouter 此前聚合文本、图像、嵌入、音频、视频五类模型,重排序是新增的第六类。对已在用 OpenRouter 的开发者来说,给 RAG 流程加上重排序只需多调一个
信源:https://x.com/OpenRouter/status/2044070463723204730
AI 模型聚合平台 OpenRouter 新增重排序(Reranker)模型类别,首批接入 Cohere 三款模型。重排序是 RAG 流程中提升回答质量的关键步骤:向量搜索从知识库中召回相关片段后,重排序模型按相关度精确排序,筛掉噪音,让大模型拿到最有价值的上下文。
三款模型定位不同:
1. Rerank 4 Pro,精度最高(SOTA),32K 上下文
2. Rerank 4 Fast,延迟最低,32K 上下文
3. Rerank v3.5,支持多维度和半结构化数据排序,4K 上下文
三款均支持超过 100 种语言,无需数据预处理。定价按搜索次数而非 token 计费,Rerank 4 Pro 为 $0.0025/次。OpenRouter 此前聚合文本、图像、嵌入、音频、视频五类模型,重排序是新增的第六类。对已在用 OpenRouter 的开发者来说,给 RAG 流程加上重排序只需多调一个
/api/v1/rerank 端点,用同一个 API key 即可调用,不用单独接入 Cohere SDK。信源:https://x.com/OpenRouter/status/2044070463723204730
X (formerly Twitter)
OpenRouter (@OpenRouter) on X
New on OpenRouter: Reranker Models 🔍
Why add a reranker to your RAG pipeline? Embedding search finds relevant chunks, but rerankers tell you which ones are MOST relevant and result in significantly better answers.
Now live via a single API endpoint, starting…
Why add a reranker to your RAG pipeline? Embedding search finds relevant chunks, but rerankers tell you which ones are MOST relevant and result in significantly better answers.
Now live via a single API endpoint, starting…
Windsurf用RL训练了一个专门抓bug的小模型,分内评测已追平Claude Opus 4.6
AI 编程工具 Windsurf 的母公司 Cognition AI 与 AI 训练公司 Applied Compute 合作,通过强化学习训练了一个专门用于代码 bug 检测的模型 SWE-Check。该模型分析用户当前的代码变更(diff),自动标记可能引入的 bug 并给出修复建议。
在与训练数据同分布的评测中,SWE-Check 的 F1 分数已追平 Claude Opus 4.6(差距从 0.09 降至 0);在跨分布评测中差距从 0.49 缩小至 0.29,仍落后于前沿模型但已有明显进步。关键优势在速度和成本:SWE-Check 的运行速度比前沿模型快一个数量级,推理成本也大幅降低,因此可以在 IDE 中做到即时、免费的 bug 检测,这是直接调用 Opus 4.6 等大模型做不到的。
训练方法有两个值得关注的设计:
1. 奖励线性化(reward linearization):团队希望优化的是全局 F-beta 指标,但该指标无法直接拆解到单个样本。他们通过一阶近似将全局指标转化为可逐样本计算的奖励函数,使训练过程能有效爬升全局指标。早期版本误报率过高,团队将 beta 从 1 调至 0.5 以强调精确率。
2. 两阶段后训练:第一阶段纯粹最大化 bug 检测能力,不惩罚延迟;第二阶段引入延迟惩罚,依据是真实用户在触发检测后多久会切走的统计分布。这种分阶段方式优于同时优化两个目标,后者容易陷入局部最优,比如学会极快但分析浅薄。
SWE-Check 的预览版已在 Windsurf Next 中上线(快捷键 cmd+U),后续将进入 Windsurf 正式版。
信源:https://cognition.ai/blog/swe-check
AI 编程工具 Windsurf 的母公司 Cognition AI 与 AI 训练公司 Applied Compute 合作,通过强化学习训练了一个专门用于代码 bug 检测的模型 SWE-Check。该模型分析用户当前的代码变更(diff),自动标记可能引入的 bug 并给出修复建议。
在与训练数据同分布的评测中,SWE-Check 的 F1 分数已追平 Claude Opus 4.6(差距从 0.09 降至 0);在跨分布评测中差距从 0.49 缩小至 0.29,仍落后于前沿模型但已有明显进步。关键优势在速度和成本:SWE-Check 的运行速度比前沿模型快一个数量级,推理成本也大幅降低,因此可以在 IDE 中做到即时、免费的 bug 检测,这是直接调用 Opus 4.6 等大模型做不到的。
训练方法有两个值得关注的设计:
1. 奖励线性化(reward linearization):团队希望优化的是全局 F-beta 指标,但该指标无法直接拆解到单个样本。他们通过一阶近似将全局指标转化为可逐样本计算的奖励函数,使训练过程能有效爬升全局指标。早期版本误报率过高,团队将 beta 从 1 调至 0.5 以强调精确率。
2. 两阶段后训练:第一阶段纯粹最大化 bug 检测能力,不惩罚延迟;第二阶段引入延迟惩罚,依据是真实用户在触发检测后多久会切走的统计分布。这种分阶段方式优于同时优化两个目标,后者容易陷入局部最优,比如学会极快但分析浅薄。
SWE-Check 的预览版已在 Windsurf Next 中上线(快捷键 cmd+U),后续将进入 Windsurf 正式版。
信源:https://cognition.ai/blog/swe-check
👍1
Cursor多智能体三周优化235个英伟达GPU算子,最佳成绩逼近硬件极限
AI 编程工具 Cursor 披露其多智能体系统与英伟达的合作实验。该系统在 27 块 Blackwell B200 GPU 上自主运行三周,针对从 DeepSeek、Qwen、Gemma 等超过 124 个生产级开源模型中提取的 235 个真实算子优化问题,从零编写并优化 GPU 算子代码,整体实现 38% 的几何平均加速。
GPU 算子优化是软件工程中门槛最高的领域之一,要求工程师精通芯片架构、汇编级指令和内存调度,一个高性能算子通常需要资深专家数月甚至数年打磨。Cursor 的多智能体系统一次性处理全部 235 题:一个规划智能体分配任务并根据性能指标动态调度,多个工作智能体并行优化,系统自行调用英伟达的 SOL-ExecBench 基准测试管道形成「测试、调试、优化」自动循环,全程无人干预。系统分别用 CUDA C(含内联 PTX 汇编)和 CuTe DSL 两种语言各跑了一轮,前者测试最底层硬件推理能力,后者测试学习公开训练数据中几乎没有的新 API 的能力。
235 题中,系统在 149 题(63%)上超越基线,其中 45 题(19%)加速超过 2 倍。三个代表性结果:
1. BF16 分组查询注意力(提取自 Llama 3.1 8B 推理场景):较人工优化的 FlashInfer 库快 84%,SOL 得分 0.9722,接近硬件理论极限(满分 1.0)
2. BF16 矩阵乘法:从零生成的算子达到英伟达 cuBLAS 手工调优性能的 86%,在 LLM 推理解码常用的小 M 场景下反超基线最多 9%
3. NVFP4 混合专家层线性运算(提取自 Qwen3 等 MoE 模型):系统自主识别 4 位浮点量化瓶颈并做针对性融合优化,加速 39%
Cursor 坦承整体中位 SOL 得分仅 0.56,仍有大幅提升空间,主因是 GPU 资源有限(235 题共用 27 块 GPU)。Cursor 称这些多智能体技术「将很快融入核心产品」。一家 IDE 公司的 AI 智能体已经能在汇编级别的 GPU 优化上逼近人类顶尖专家,这比「帮你写应用代码」的故事大得多。
信源:https://cursor.com/blog/multi-agent-kernels
AI 编程工具 Cursor 披露其多智能体系统与英伟达的合作实验。该系统在 27 块 Blackwell B200 GPU 上自主运行三周,针对从 DeepSeek、Qwen、Gemma 等超过 124 个生产级开源模型中提取的 235 个真实算子优化问题,从零编写并优化 GPU 算子代码,整体实现 38% 的几何平均加速。
GPU 算子优化是软件工程中门槛最高的领域之一,要求工程师精通芯片架构、汇编级指令和内存调度,一个高性能算子通常需要资深专家数月甚至数年打磨。Cursor 的多智能体系统一次性处理全部 235 题:一个规划智能体分配任务并根据性能指标动态调度,多个工作智能体并行优化,系统自行调用英伟达的 SOL-ExecBench 基准测试管道形成「测试、调试、优化」自动循环,全程无人干预。系统分别用 CUDA C(含内联 PTX 汇编)和 CuTe DSL 两种语言各跑了一轮,前者测试最底层硬件推理能力,后者测试学习公开训练数据中几乎没有的新 API 的能力。
235 题中,系统在 149 题(63%)上超越基线,其中 45 题(19%)加速超过 2 倍。三个代表性结果:
1. BF16 分组查询注意力(提取自 Llama 3.1 8B 推理场景):较人工优化的 FlashInfer 库快 84%,SOL 得分 0.9722,接近硬件理论极限(满分 1.0)
2. BF16 矩阵乘法:从零生成的算子达到英伟达 cuBLAS 手工调优性能的 86%,在 LLM 推理解码常用的小 M 场景下反超基线最多 9%
3. NVFP4 混合专家层线性运算(提取自 Qwen3 等 MoE 模型):系统自主识别 4 位浮点量化瓶颈并做针对性融合优化,加速 39%
Cursor 坦承整体中位 SOL 得分仅 0.56,仍有大幅提升空间,主因是 GPU 资源有限(235 题共用 27 块 GPU)。Cursor 称这些多智能体技术「将很快融入核心产品」。一家 IDE 公司的 AI 智能体已经能在汇编级别的 GPU 优化上逼近人类顶尖专家,这比「帮你写应用代码」的故事大得多。
信源:https://cursor.com/blog/multi-agent-kernels
Cursor
Speeding up GPU kernels by 38% with a multi-agent system · Cursor
Our multi-agent system autonomously optimized 235 CUDA kernels for NVIDIA Blackwell 200 GPUs, achieving a 38% geomean speedup over baselines in just 3 weeks.
CMU教授开源Agent框架Motus,多模型编排SWE-bench跑到79%且成本减半
卡内基梅隆大学计算机科学系教授 Dimitrios Skarlatos(CEO)和 Zhihao Jia(CTO)创办的 AI 基础设施公司 Lithos AI 开源了 Agent 服务框架 Motus,Apache 2.0 许可证。团队由 CMU 和斯坦福研究人员组成,成员有 AWS、谷歌、Meta 和英伟达的生产基础设施经验。
Motus 的核心思路:不同任务适合不同模型,与其始终用最贵的前沿模型跑所有步骤,不如让系统从生产运行的轨迹中学习,自动把不同子任务路由到最合适的模型。当前 Agent 部署后是静态的,提示框架、模型和上下文策略固定不变,Motus 则从每次运行中提取任务成功率、延迟和成本信号,持续优化。
据 Lithos AI 官网数据,在 SWE-bench Verified 上,Motus 多模型编排达到 79% 准确率,高于 Claude Opus 4.6 的 75.8% 和 GPT-5.3-Codex 的 72.6%,成本不到单用 Opus 的一半。在 Terminal-Bench 2.0 上,准确率从 Opus 的 64% 提至 80.1%,成本同样约减半。框架还会根据具体工作负载调整上下文记忆策略,并自动检测可并行执行的步骤来降低延迟。
Motus 不绑定模型提供商,支持 OpenAI Agents SDK、Anthropic SDK、Google ADK 及纯 Python 构建的 Agent,提供 Claude Code、Codex 和 Cursor 插件,一条命令本地部署或推送至云端。早期预览阶段免费提供算力。
信源:https://github.com/lithos-ai/motus
卡内基梅隆大学计算机科学系教授 Dimitrios Skarlatos(CEO)和 Zhihao Jia(CTO)创办的 AI 基础设施公司 Lithos AI 开源了 Agent 服务框架 Motus,Apache 2.0 许可证。团队由 CMU 和斯坦福研究人员组成,成员有 AWS、谷歌、Meta 和英伟达的生产基础设施经验。
Motus 的核心思路:不同任务适合不同模型,与其始终用最贵的前沿模型跑所有步骤,不如让系统从生产运行的轨迹中学习,自动把不同子任务路由到最合适的模型。当前 Agent 部署后是静态的,提示框架、模型和上下文策略固定不变,Motus 则从每次运行中提取任务成功率、延迟和成本信号,持续优化。
据 Lithos AI 官网数据,在 SWE-bench Verified 上,Motus 多模型编排达到 79% 准确率,高于 Claude Opus 4.6 的 75.8% 和 GPT-5.3-Codex 的 72.6%,成本不到单用 Opus 的一半。在 Terminal-Bench 2.0 上,准确率从 Opus 的 64% 提至 80.1%,成本同样约减半。框架还会根据具体工作负载调整上下文记忆策略,并自动检测可并行执行的步骤来降低延迟。
Motus 不绑定模型提供商,支持 OpenAI Agents SDK、Anthropic SDK、Google ADK 及纯 Python 构建的 Agent,提供 Claude Code、Codex 和 Cursor 插件,一条命令本地部署或推送至云端。早期预览阶段免费提供算力。
信源:https://github.com/lithos-ai/motus
GitHub
GitHub - lithos-ai/motus: The open-source agent-serving project
The open-source agent-serving project. Contribute to lithos-ai/motus development by creating an account on GitHub.
EvoMap逐模块举证指控Hermes Agent架构抄袭,Nous Research只回了句「删号」
AI Agent 自进化引擎 Evolver 的开发团队 EvoMap 于 4 月 14 日发布一篇技术对比文章,指控 Nous Research 旗下开源项目 Hermes Agent 在架构层面系统性复制了 Evolver 的设计,且在全部公开材料中未做任何引用。Hermes Agent 目前拥有 8.8 万 GitHub Star,Evolver 约 2000。Nous Research 创始人 Teknium 在 X 上回应称「从来没听说过这个人和这个项目」,认为对比文章「完全没脑子」。Nous Research 官方账号的回应更为简短:「我们的仓库 2025 年 7 月就建了。我们是 YaRN 等现代 Agent 框架底层技术的先驱。删掉你的账号。」
EvoMap 的文章逐模块列举了十余处架构对应:
1. 三层记忆系统(持久事实 + 程序性知识 + 历史搜索),每层功能角色精确对应
2. 任务完成后自动提取可复用经验资产的闭环(Evolver 称 Gene/Capsule,Hermes 称 SKILL.md)
3. 周期性反思机制(Evolver 每 5 个进化周期触发,Hermes 每 15 次工具调用触发)
4. 运行时技能发现与按需加载
5. 10 步编排的进化循环
6. 多维加权评分、约束门控、原子写入等工程模式
时间线上,Evolver 的核心协议 GEP 于 2 月 1-16 日全部公开,累计 136 次发版。Hermes 的技能系统 3 月 12 日才发布(v0.2.0),自进化仓库 3 月 9 日才创建,间隔 24-39 天。
但文章也列出了对 Hermes 有利的事实:Hermes Agent 仓库创建于 2025 年 7 月,早于 Evolver 半年,只是一直私有至 2 月底才公开;Hermes 的自进化模块使用斯坦福/伯克利的学术框架 GEPA(ICLR 2026 Oral),与 GEP 无关;Anthropic 2025 年 12 月发布的 Agent Skills 标准早于两者。两项目语言不同(JavaScript vs Python),未发现代码级复制。
单看任何一个维度,独立趋同都完全可能:三层记忆、经验提取、周期反思在 AI Agent 领域已有广泛讨论。EvoMap 的论点建立在「十余个维度同时对应超出巧合范围」的概率推理上,这种论证有力但不具备排他性。Teknium 选择否认知情而非回应技术细节,也没有给出更多解释。这场争论短期内不太可能有定论,但它反映了一个持续存在的问题:在影响力悬殊的开源项目之间,较小一方要主张架构层面的优先性,无论举证还是传播都极为困难。
信源:https://x.com/Teknium/status/2044344547334062510
AI Agent 自进化引擎 Evolver 的开发团队 EvoMap 于 4 月 14 日发布一篇技术对比文章,指控 Nous Research 旗下开源项目 Hermes Agent 在架构层面系统性复制了 Evolver 的设计,且在全部公开材料中未做任何引用。Hermes Agent 目前拥有 8.8 万 GitHub Star,Evolver 约 2000。Nous Research 创始人 Teknium 在 X 上回应称「从来没听说过这个人和这个项目」,认为对比文章「完全没脑子」。Nous Research 官方账号的回应更为简短:「我们的仓库 2025 年 7 月就建了。我们是 YaRN 等现代 Agent 框架底层技术的先驱。删掉你的账号。」
EvoMap 的文章逐模块列举了十余处架构对应:
1. 三层记忆系统(持久事实 + 程序性知识 + 历史搜索),每层功能角色精确对应
2. 任务完成后自动提取可复用经验资产的闭环(Evolver 称 Gene/Capsule,Hermes 称 SKILL.md)
3. 周期性反思机制(Evolver 每 5 个进化周期触发,Hermes 每 15 次工具调用触发)
4. 运行时技能发现与按需加载
5. 10 步编排的进化循环
6. 多维加权评分、约束门控、原子写入等工程模式
时间线上,Evolver 的核心协议 GEP 于 2 月 1-16 日全部公开,累计 136 次发版。Hermes 的技能系统 3 月 12 日才发布(v0.2.0),自进化仓库 3 月 9 日才创建,间隔 24-39 天。
但文章也列出了对 Hermes 有利的事实:Hermes Agent 仓库创建于 2025 年 7 月,早于 Evolver 半年,只是一直私有至 2 月底才公开;Hermes 的自进化模块使用斯坦福/伯克利的学术框架 GEPA(ICLR 2026 Oral),与 GEP 无关;Anthropic 2025 年 12 月发布的 Agent Skills 标准早于两者。两项目语言不同(JavaScript vs Python),未发现代码级复制。
单看任何一个维度,独立趋同都完全可能:三层记忆、经验提取、周期反思在 AI Agent 领域已有广泛讨论。EvoMap 的论点建立在「十余个维度同时对应超出巧合范围」的概率推理上,这种论证有力但不具备排他性。Teknium 选择否认知情而非回应技术细节,也没有给出更多解释。这场争论短期内不太可能有定论,但它反映了一个持续存在的问题:在影响力悬殊的开源项目之间,较小一方要主张架构层面的优先性,无论举证还是传播都极为困难。
信源:https://x.com/Teknium/status/2044344547334062510
X (formerly Twitter)
Teknium 🪽 (@Teknium) on X
I have literally never heard of this person, their project, or anything they are doing in my life. Today is the first time I've ever heard of or seen this project at all.
To claim without evidence that I took their work is a lie.
Their article comparing…
To claim without evidence that I took their work is a lie.
Their article comparing…
OpenClaw维护者回应负面攻击:我们不帮人拉盘,开源的中立方反遭抹黑
OpenClaw 官方维护者 Onur Solmaz 针对近期围绕该开源 AI 代理项目的负面言论作出强硬回应。他直言 OpenClaw 之所以频遭攻击,根源在于其「不帮任何人拉盘」的公益属性——与市场上其他追求盈利的 AI 代理产品不同,OpenClaw 在行业和地缘政治上始终保持中立第三方立场,「其他公司只有在我们失败时才能赚钱,所以才拼命抹黑」。Solmaz 称,项目创始人 Peter Steinberger 是成功退出创业者,不为投资人赚取回报,纯粹出于「玩得开心 + 民主化 AI」的初衷发起该项目,这也正是社区喜爱 OpenClaw 的原因。
针对具体指控,Solmaz 逐一反驳:
关于臃肿一说,团队从 3 月初便启动核心瘦身计划,将功能模块拆分为插件 SDK 架构,插件多不等于臃肿,这套做法已被同行抄走;
关于不安全的质疑,Solmaz 反指 OpenClaw 因被最多人审视,安全问题一旦发现即被迅速修复,在被狂喷的压力下反而淬炼成最安全的 AI 代理;
至于被 OpenAI 收购的传闻,Solmaz 调侃道「我的银行账户还是空的啊兄弟」,并强调所有维护者均为无偿贡献,白天全职工作、夜晚双倍加班维护项目。
最终 Solmaz 以「人民的 AI」定义 OpenClaw,呼吁社区直接使用代码、积极贡献,成为维护者,共同书写开源 AI 历史。
信源:https://x.com/onusoz/status/2044337339518828727?s=46
OpenClaw 官方维护者 Onur Solmaz 针对近期围绕该开源 AI 代理项目的负面言论作出强硬回应。他直言 OpenClaw 之所以频遭攻击,根源在于其「不帮任何人拉盘」的公益属性——与市场上其他追求盈利的 AI 代理产品不同,OpenClaw 在行业和地缘政治上始终保持中立第三方立场,「其他公司只有在我们失败时才能赚钱,所以才拼命抹黑」。Solmaz 称,项目创始人 Peter Steinberger 是成功退出创业者,不为投资人赚取回报,纯粹出于「玩得开心 + 民主化 AI」的初衷发起该项目,这也正是社区喜爱 OpenClaw 的原因。
针对具体指控,Solmaz 逐一反驳:
关于臃肿一说,团队从 3 月初便启动核心瘦身计划,将功能模块拆分为插件 SDK 架构,插件多不等于臃肿,这套做法已被同行抄走;
关于不安全的质疑,Solmaz 反指 OpenClaw 因被最多人审视,安全问题一旦发现即被迅速修复,在被狂喷的压力下反而淬炼成最安全的 AI 代理;
至于被 OpenAI 收购的传闻,Solmaz 调侃道「我的银行账户还是空的啊兄弟」,并强调所有维护者均为无偿贡献,白天全职工作、夜晚双倍加班维护项目。
最终 Solmaz 以「人民的 AI」定义 OpenClaw,呼吁社区直接使用代码、积极贡献,成为维护者,共同书写开源 AI 历史。
信源:https://x.com/onusoz/status/2044337339518828727?s=46
X (formerly Twitter)
Onur Solmaz (@onusoz) on X
You need to understand one fact about OpenClaw
People are biased and incentivized to spread disinformation about OpenClaw. That is because OpenClaw IS NOT PUMPING ANYONE’S BAGS, unlike most other projects
Literally every other for-profit agent product is…
People are biased and incentivized to spread disinformation about OpenClaw. That is because OpenClaw IS NOT PUMPING ANYONE’S BAGS, unlike most other projects
Literally every other for-profit agent product is…