Hugging Face正式推出Kernels,GPU算子像模型一样一行代码装好
Hugging Face CEO Clem Delangue 宣布 Kernels 正式上线 Hub。GPU 算子是让显卡跑出极限速度的底层优化代码,能将推理和训练加速 1.7 至 2.5 倍,但安装一直是噩梦:以最常用的 FlashAttention 为例,本地编译需要约 96GB 内存和数小时,PyTorch 版本、CUDA 版本稍有不对就报错,多数开发者在安装这一步就卡住了。
Kernels Hub 把编译搬到云端。Hugging Face 提前在各种显卡和系统环境下编译好算子,开发者写一行代码,Hub 自动匹配硬件环境,几秒内下载预编译文件直接可用。同一进程可加载多个不同版本算子,兼容 torch.compile。
Kernels 去年 6 月测试上线,本月升级为 Hub 一级仓库类型,与 Models、Datasets、Spaces 并列。目前已有 61 个预编译算子,覆盖注意力机制、归一化、混合专家路由、量化等常用场景,支持英伟达 CUDA、AMD ROCm、苹果 Metal 和英特尔 XPU 四种硬件加速平台,已集成进 Hugging Face 的推理框架 TGI 和 Transformers 库。
信源:https://x.com/ClementDelangue/status/2044053580504584349
Hugging Face CEO Clem Delangue 宣布 Kernels 正式上线 Hub。GPU 算子是让显卡跑出极限速度的底层优化代码,能将推理和训练加速 1.7 至 2.5 倍,但安装一直是噩梦:以最常用的 FlashAttention 为例,本地编译需要约 96GB 内存和数小时,PyTorch 版本、CUDA 版本稍有不对就报错,多数开发者在安装这一步就卡住了。
Kernels Hub 把编译搬到云端。Hugging Face 提前在各种显卡和系统环境下编译好算子,开发者写一行代码,Hub 自动匹配硬件环境,几秒内下载预编译文件直接可用。同一进程可加载多个不同版本算子,兼容 torch.compile。
Kernels 去年 6 月测试上线,本月升级为 Hub 一级仓库类型,与 Models、Datasets、Spaces 并列。目前已有 61 个预编译算子,覆盖注意力机制、归一化、混合专家路由、量化等常用场景,支持英伟达 CUDA、AMD ROCm、苹果 Metal 和英特尔 XPU 四种硬件加速平台,已集成进 Hugging Face 的推理框架 TGI 和 Transformers 库。
信源:https://x.com/ClementDelangue/status/2044053580504584349
X (formerly Twitter)
clem 🤗 (@ClementDelangue) on X
Introducing Kernels on the Hugging Face Hub ✨
What if shipping a GPU kernel was as easy as pushing a model?
- Pre-compiled for your exact GPU, PyTorch & OS
- Multiple kernel versions coexist in one process
- torch.compile compatible
- 1.7x–2.5x speedups…
What if shipping a GPU kernel was as easy as pushing a model?
- Pre-compiled for your exact GPU, PyTorch & OS
- Multiple kernel versions coexist in one process
- torch.compile compatible
- 1.7x–2.5x speedups…
Cloudflare推出Mesh,专为AI代理打通私有网络,50节点免费
Cloudflare 发布 Mesh,一套面向 AI 代理场景的私有组网方案。核心问题:AI 代理需要访问私有资源(内部数据库、staging 环境、家庭网络上的本地服务),但 VPN 需要交互式登录,SSH 隧道需要手动配置,这些工具都是为人设计的,不适合自主运行的软件。
Mesh 用一个轻量连接器把所有设备、服务器和代理组成双向私有网络,通过 Cloudflare 全球 330 多个城市的边缘网络路由。与 Cloudflare Tunnel(单向代理流量到特定服务)不同,Mesh 是多对多的全网互通,网络中任意节点可通过私有 IP 直接访问彼此。
三个典型场景:
1. 在手机上安全访问家里 Mac mini 运行的 OpenClaw,不暴露公网端口
2. 让笔记本上的 Claude Code 或 Cursor 直接查询云端 VPC 中的 staging 数据库
3. Cloudflare Workers 上部署的代理通过 Workers VPC 绑定访问内部 API 和 MCP 服务器
安全控制方面,Mesh 运行在 Cloudflare One 平台上,现有的 Gateway 策略、设备状态检查和访问规则自动适用于所有 Mesh 流量,无需额外配置。后续计划包括:主机名路由(按服务名而非 IP 访问)、Mesh DNS(节点加入后自动获得内部域名)、身份感知路由(让每个代理携带独立身份,支持按代理而非按用户写访问策略)以及 Docker 容器支持。
免费层级包含 50 个节点和 50 个用户,所有 Cloudflare 账户均可使用。
信源:https://blog.cloudflare.com/mesh/
Cloudflare 发布 Mesh,一套面向 AI 代理场景的私有组网方案。核心问题:AI 代理需要访问私有资源(内部数据库、staging 环境、家庭网络上的本地服务),但 VPN 需要交互式登录,SSH 隧道需要手动配置,这些工具都是为人设计的,不适合自主运行的软件。
Mesh 用一个轻量连接器把所有设备、服务器和代理组成双向私有网络,通过 Cloudflare 全球 330 多个城市的边缘网络路由。与 Cloudflare Tunnel(单向代理流量到特定服务)不同,Mesh 是多对多的全网互通,网络中任意节点可通过私有 IP 直接访问彼此。
三个典型场景:
1. 在手机上安全访问家里 Mac mini 运行的 OpenClaw,不暴露公网端口
2. 让笔记本上的 Claude Code 或 Cursor 直接查询云端 VPC 中的 staging 数据库
3. Cloudflare Workers 上部署的代理通过 Workers VPC 绑定访问内部 API 和 MCP 服务器
安全控制方面,Mesh 运行在 Cloudflare One 平台上,现有的 Gateway 策略、设备状态检查和访问规则自动适用于所有 Mesh 流量,无需额外配置。后续计划包括:主机名路由(按服务名而非 IP 访问)、Mesh DNS(节点加入后自动获得内部域名)、身份感知路由(让每个代理携带独立身份,支持按代理而非按用户写访问策略)以及 Docker 容器支持。
免费层级包含 50 个节点和 50 个用户,所有 Cloudflare 账户均可使用。
信源:https://blog.cloudflare.com/mesh/
OpenAI购买未解数学难题验证器,可自动检验AI解题是否正确
AI 研究机构 Epoch AI 披露,OpenAI 已购买其 FrontierMath: Open Problems 验证器的访问权限。FrontierMath: Open Problems 是一组至今未被专业数学家解出的研究级数学难题,每道题都配有一个专用计算机程序(验证器),虽然目前无人知道正确答案,但一旦有人(或 AI)给出潜在解,验证器可以自动检验其正确性。OpenAI 购买该权限后,可以用验证器检查自家模型生成的数学解是否有效。
验证器的访问权限向任何机构开放购买,主要成本用于支付数学家报酬,因为制定问题和编写验证器的过程非常耗费人力。Epoch AI 同时设定了一项条件:凡通过验证器发现有效解的一方,必须将结果通知 Epoch AI,且问题作者与发现方共享联合发表权。
Epoch AI 强调,OpenAI 此前曾资助原始 FrontierMath 基准(Tiers 1-4)的创建,但 Open Problems 部分由 Epoch AI 独立开发和拥有,试点阶段由 Schmidt Sciences 资助。
信源:https://x.com/EpochAIResearch/status/2044227029978284471
AI 研究机构 Epoch AI 披露,OpenAI 已购买其 FrontierMath: Open Problems 验证器的访问权限。FrontierMath: Open Problems 是一组至今未被专业数学家解出的研究级数学难题,每道题都配有一个专用计算机程序(验证器),虽然目前无人知道正确答案,但一旦有人(或 AI)给出潜在解,验证器可以自动检验其正确性。OpenAI 购买该权限后,可以用验证器检查自家模型生成的数学解是否有效。
验证器的访问权限向任何机构开放购买,主要成本用于支付数学家报酬,因为制定问题和编写验证器的过程非常耗费人力。Epoch AI 同时设定了一项条件:凡通过验证器发现有效解的一方,必须将结果通知 Epoch AI,且问题作者与发现方共享联合发表权。
Epoch AI 强调,OpenAI 此前曾资助原始 FrontierMath 基准(Tiers 1-4)的创建,但 Open Problems 部分由 Epoch AI 独立开发和拥有,试点阶段由 Schmidt Sciences 资助。
信源:https://x.com/EpochAIResearch/status/2044227029978284471
X (formerly Twitter)
Epoch AI (@EpochAIResearch) on X
OpenAI has purchased access to the FrontierMath: Open Problems verifiers. This allows them to check the validity of solutions their models generate. Thread with details.
ARC-AGI-3公布史上最大规模人类测试:所有关卡均被人类攻克,AI仍有差距
ARC Prize 基金会公布了 ARC-AGI-3 的人类表现数据集,这是 ARC-AGI 系列迄今规模最大的人类测试研究,共 458 名参与者。数据集包含 342 条完整的人类操作回放记录,覆盖 25 个公开环境,已全部开源。
ARC-AGI-3 包含 135 个抽象推理环境,测试者不会收到任何玩法说明,必须自行探索、推断规则并制定策略。测试在旧金山的线下测试中心进行,每场 90 分钟,参与者获得约 130 美元底薪加每通关一个环境 5 美元奖励。所有测试均为「首次通关」条件,即每人只看一次、只尝试一次,衡量的是面对全新问题时的学习和适应能力。人类和 AI 获得完全相同的信息,没有任何信息差。
核心结论:ARC-AGI-3 的所有环境均被人类通关,每个环境至少有两名独立参与者完成,多数环境有五人以上通关。ARC Prize 基金会称「我们还没有实现 AGI,这份数据集就是证据」。
自 ARC-AGI-3 预览以来,公开环境已收到近 100 万份 AI 评测提交。基于这些数据,基金会同时宣布两项评分规则调整:一是将每关的人类基准从「第二好的玩家」改为「中位数玩家」,降低运气因素对得分的影响;二是将单关得分上限从 100% 提高到 115%,避免一关表现不佳拖垮整体成绩。两项调整的净效果是人类和 AI 得分均小幅上升约 0.5 个百分点。
信源:https://arcprize.org/blog/measuring-human-performance-on-arc-agi-3
ARC Prize 基金会公布了 ARC-AGI-3 的人类表现数据集,这是 ARC-AGI 系列迄今规模最大的人类测试研究,共 458 名参与者。数据集包含 342 条完整的人类操作回放记录,覆盖 25 个公开环境,已全部开源。
ARC-AGI-3 包含 135 个抽象推理环境,测试者不会收到任何玩法说明,必须自行探索、推断规则并制定策略。测试在旧金山的线下测试中心进行,每场 90 分钟,参与者获得约 130 美元底薪加每通关一个环境 5 美元奖励。所有测试均为「首次通关」条件,即每人只看一次、只尝试一次,衡量的是面对全新问题时的学习和适应能力。人类和 AI 获得完全相同的信息,没有任何信息差。
核心结论:ARC-AGI-3 的所有环境均被人类通关,每个环境至少有两名独立参与者完成,多数环境有五人以上通关。ARC Prize 基金会称「我们还没有实现 AGI,这份数据集就是证据」。
自 ARC-AGI-3 预览以来,公开环境已收到近 100 万份 AI 评测提交。基于这些数据,基金会同时宣布两项评分规则调整:一是将每关的人类基准从「第二好的玩家」改为「中位数玩家」,降低运气因素对得分的影响;二是将单关得分上限从 100% 提高到 115%,避免一关表现不佳拖垮整体成绩。两项调整的净效果是人类和 AI 得分均小幅上升约 0.5 个百分点。
信源:https://arcprize.org/blog/measuring-human-performance-on-arc-agi-3
阿里HappyHorse首次参加Arena盲测即登顶视频编辑赛道,两周后发布正式版
阿里巴巴 ATH AI 创新部门旗下的 AI 视频模型 HappyHorse 宣布 1.0 版本已上线 UC Berkeley 社区盲测平台 Arena(前身为 LMArena),首次参赛即以 1299 分(初步评分,±21)拿下视频编辑(Video Edit)赛道第一,领先第二名 xAI 的 grok-imagine-video 42 分,领先第三名快手可灵 o3-pro 48 分。
HappyHorse 此前已在另一评测平台 Artificial Analysis 的文生视频和图生视频排行榜登顶,视频编辑是其拓展的新赛道。Arena 官方称视频编辑是视频模型的新兴前沿能力,目前仅少数模型支持。HappyHorse 团队表示目前处于正式发布前的最后优化冲刺阶段,正式版将在两周后上线,社区用户现可在 arena.ai 提前体验并投票。
信源:https://x.com/arena/status/2044260620317667644
阿里巴巴 ATH AI 创新部门旗下的 AI 视频模型 HappyHorse 宣布 1.0 版本已上线 UC Berkeley 社区盲测平台 Arena(前身为 LMArena),首次参赛即以 1299 分(初步评分,±21)拿下视频编辑(Video Edit)赛道第一,领先第二名 xAI 的 grok-imagine-video 42 分,领先第三名快手可灵 o3-pro 48 分。
HappyHorse 此前已在另一评测平台 Artificial Analysis 的文生视频和图生视频排行榜登顶,视频编辑是其拓展的新赛道。Arena 官方称视频编辑是视频模型的新兴前沿能力,目前仅少数模型支持。HappyHorse 团队表示目前处于正式发布前的最后优化冲刺阶段,正式版将在两周后上线,社区用户现可在 arena.ai 提前体验并投票。
信源:https://x.com/arena/status/2044260620317667644
👍1
Anthropic低调上线身份验证,用Claude部分功能需出示护照并自拍
Anthropic 在帮助中心发布身份验证政策页面,称正在「为少数使用场景」逐步推行身份验证。用户在访问特定功能、触发平台安全检查或合规审查时可能被要求验证身份。页面未说明哪些功能会触发验证,Anthropic 也未通过博客或社交媒体正式公告这一变化。
验证流程要求用户手持实体政府证件(护照、驾照或国民身份证),用摄像头拍照上传,部分情况下还需实时自拍。截图、扫描件、电子证件和非政府证件均不被接受。验证合作方为 Persona Identities,证件照片和自拍存储在 Persona 系统中,Anthropic 称自身不保存这些影像,验证数据不用于模型训练。
Persona 是 Peter Thiel 参投的硅谷身份验证公司,也为 ChatGPT 和 LinkedIn 提供验证服务,但今年 2 月接连曝出隐私问题。Cybernews 报道 Persona 意外暴露了与政府监控相关的平台接口,Discord 用户的验证数据随后被发现泄露,Discord 公开与其切割。Mashable 调查发现,通过 Persona 验证的 LinkedIn 用户,个人数据可被分享给多达 17 家公司。Anthropic 在页面中称选择 Persona 是基于其「技术实力、隐私控制和安全保障」。
此次身份验证与近期的年龄验证争议相互独立。4 月 12 日前后多名用户在 Reddit 反映被 Claude 错误标记为未成年人导致账号封禁,那一流程使用的验证商是 Yoti 而非 Persona。
信源:https://support.claude.com/en/articles/14328960-identity-verification-on-claude
Anthropic 在帮助中心发布身份验证政策页面,称正在「为少数使用场景」逐步推行身份验证。用户在访问特定功能、触发平台安全检查或合规审查时可能被要求验证身份。页面未说明哪些功能会触发验证,Anthropic 也未通过博客或社交媒体正式公告这一变化。
验证流程要求用户手持实体政府证件(护照、驾照或国民身份证),用摄像头拍照上传,部分情况下还需实时自拍。截图、扫描件、电子证件和非政府证件均不被接受。验证合作方为 Persona Identities,证件照片和自拍存储在 Persona 系统中,Anthropic 称自身不保存这些影像,验证数据不用于模型训练。
Persona 是 Peter Thiel 参投的硅谷身份验证公司,也为 ChatGPT 和 LinkedIn 提供验证服务,但今年 2 月接连曝出隐私问题。Cybernews 报道 Persona 意外暴露了与政府监控相关的平台接口,Discord 用户的验证数据随后被发现泄露,Discord 公开与其切割。Mashable 调查发现,通过 Persona 验证的 LinkedIn 用户,个人数据可被分享给多达 17 家公司。Anthropic 在页面中称选择 Persona 是基于其「技术实力、隐私控制和安全保障」。
此次身份验证与近期的年龄验证争议相互独立。4 月 12 日前后多名用户在 Reddit 反映被 Claude 错误标记为未成年人导致账号封禁,那一流程使用的验证商是 Yoti 而非 Persona。
信源:https://support.claude.com/en/articles/14328960-identity-verification-on-claude
Claude
Identity verification on Claude | Claude Help Center
传DeepSeek-R1核心作者郭达雅已入职字节跳动
图灵教育联合创始人刘江今天在 X 上爆料称,DeepSeek 核心研究员郭达雅「已经到字节上班了」。
郭达雅 1995 年生,中山大学博士,由印鉴教授和微软亚洲研究院周明博士联合培养,2020 年获微软学者奖学金。2023 年 7 月加入 DeepSeek 后,他是 DeepSeek-R1 论文的第一作者。R1 是 DeepSeek 最具影响力的模型,首次证明纯强化学习可以激发大模型的推理能力,论文后登上 Nature 封面。
郭达雅 3 月从 DeepSeek 离职的消息此前已被多家媒体确认,但去向一直未公开。百度曾被传是其目的地,但百度方面明确否认,仅确认有其他 DeepSeek 成员加入。如果刘江的爆料属实,郭达雅将是继原通义千问后训练负责人郁博文之后,又一位加入字节 Seed 团队的顶级 AI 研究员。
信源:https://x.com/turingbook/status/2044294170588917857
图灵教育联合创始人刘江今天在 X 上爆料称,DeepSeek 核心研究员郭达雅「已经到字节上班了」。
郭达雅 1995 年生,中山大学博士,由印鉴教授和微软亚洲研究院周明博士联合培养,2020 年获微软学者奖学金。2023 年 7 月加入 DeepSeek 后,他是 DeepSeek-R1 论文的第一作者。R1 是 DeepSeek 最具影响力的模型,首次证明纯强化学习可以激发大模型的推理能力,论文后登上 Nature 封面。
郭达雅 3 月从 DeepSeek 离职的消息此前已被多家媒体确认,但去向一直未公开。百度曾被传是其目的地,但百度方面明确否认,仅确认有其他 DeepSeek 成员加入。如果刘江的爆料属实,郭达雅将是继原通义千问后训练负责人郁博文之后,又一位加入字节 Seed 团队的顶级 AI 研究员。
信源:https://x.com/turingbook/status/2044294170588917857
❤1
马斯克晒AI5芯片实物照,此前搁置的训练芯片Dojo也回来了
马斯克今天在 X 上宣布特斯拉 AI5 芯片已完成流片(tapeout,即芯片设计定稿并交付晶圆厂制造),同时透露 AI6 和 Dojo3 也在研发中。他在推文中晒出了一张 AI5 芯片实物照片,芯片封装上印有特斯拉标识。
AI5 是特斯拉为自动驾驶和 AI 推理设计的下一代芯片,相比当前车载的 HW4 芯片,特定场景下算力最高提升 40 倍,内存扩大至 9 倍。更大的内存意味着车端可以运行更大的视觉模型,处理更长时间跨度的视频数据来理解路况变化,这是实现无监督全自动驾驶(FSD)的关键瓶颈之一。
根据马斯克此前的说法,AI5 将由台积电和三星同时代工生产,两家晶圆厂制造同一设计但物理实现有所不同。双线并行既分散供应链风险,也为量产争取产能。AI5 预计 2026 年底出少量样片,2027 年量产,首批将用于 Cybercab 无人出租车、Optimus 人形机器人和特斯拉数据中心。
Dojo3 的出现值得注意。特斯拉此前曾搁置自研训练芯片 Dojo 项目,转而大量采购英伟达 GPU 用于 AI 训练。马斯克现在重新提及 Dojo3,意味着特斯拉并未放弃自研训练芯片路线,而是在推理(AI5/AI6)和训练(Dojo3)两条线上同时推进,试图逐步摆脱对英伟达的依赖。
信源:https://x.com/elonmusk/status/2044315118583066738
马斯克今天在 X 上宣布特斯拉 AI5 芯片已完成流片(tapeout,即芯片设计定稿并交付晶圆厂制造),同时透露 AI6 和 Dojo3 也在研发中。他在推文中晒出了一张 AI5 芯片实物照片,芯片封装上印有特斯拉标识。
AI5 是特斯拉为自动驾驶和 AI 推理设计的下一代芯片,相比当前车载的 HW4 芯片,特定场景下算力最高提升 40 倍,内存扩大至 9 倍。更大的内存意味着车端可以运行更大的视觉模型,处理更长时间跨度的视频数据来理解路况变化,这是实现无监督全自动驾驶(FSD)的关键瓶颈之一。
根据马斯克此前的说法,AI5 将由台积电和三星同时代工生产,两家晶圆厂制造同一设计但物理实现有所不同。双线并行既分散供应链风险,也为量产争取产能。AI5 预计 2026 年底出少量样片,2027 年量产,首批将用于 Cybercab 无人出租车、Optimus 人形机器人和特斯拉数据中心。
Dojo3 的出现值得注意。特斯拉此前曾搁置自研训练芯片 Dojo 项目,转而大量采购英伟达 GPU 用于 AI 训练。马斯克现在重新提及 Dojo3,意味着特斯拉并未放弃自研训练芯片路线,而是在推理(AI5/AI6)和训练(Dojo3)两条线上同时推进,试图逐步摆脱对英伟达的依赖。
信源:https://x.com/elonmusk/status/2044315118583066738
Meta与博通签订超1GW自研AI芯片协议,博通CEO退出Meta董事会转任顾问
Meta 宣布扩大与博通的合作,双方将联合开发多代 MTIA(Meta Training and Inference Accelerator)芯片。MTIA 是 Meta 的自研 AI 加速器,专为推理和推荐系统优化。Meta 今年 3 月已宣布将在两年内开发部署四代 MTIA 芯片,此次与博通的协议将加速这一进程。
协议基于博通的 XPU 平台(一套用于定制 AI 加速器的技术方案),覆盖芯片设计、先进封装和网络互联三个环节。博通的以太网技术将用于 Meta 快速扩张的 AI 计算集群之间的高带宽通信。
扎克伯格称首期部署将超过 1GW 的自研芯片算力,后续将扩展至数 GW 级别。博通 CEO 陈福阳(Hock Tan)表示这只是「持续多代路线图的开端」。
因合作规模扩大,此前担任 Meta 董事会成员两年的陈福阳将退出董事会,转任顾问角色,为 Meta 的自研芯片路线图和基础设施投资提供指导。
信源:https://about.fb.com/news/2026/04/meta-partners-with-broadcom-to-co-develop-custom-ai-silicon/
Meta 宣布扩大与博通的合作,双方将联合开发多代 MTIA(Meta Training and Inference Accelerator)芯片。MTIA 是 Meta 的自研 AI 加速器,专为推理和推荐系统优化。Meta 今年 3 月已宣布将在两年内开发部署四代 MTIA 芯片,此次与博通的协议将加速这一进程。
协议基于博通的 XPU 平台(一套用于定制 AI 加速器的技术方案),覆盖芯片设计、先进封装和网络互联三个环节。博通的以太网技术将用于 Meta 快速扩张的 AI 计算集群之间的高带宽通信。
扎克伯格称首期部署将超过 1GW 的自研芯片算力,后续将扩展至数 GW 级别。博通 CEO 陈福阳(Hock Tan)表示这只是「持续多代路线图的开端」。
因合作规模扩大,此前担任 Meta 董事会成员两年的陈福阳将退出董事会,转任顾问角色,为 Meta 的自研芯片路线图和基础设施投资提供指导。
信源:https://about.fb.com/news/2026/04/meta-partners-with-broadcom-to-co-develop-custom-ai-silicon/
Meta Newsroom
Meta Partners With Broadcom to Co-Develop Custom AI Silicon
We’re partnering with Broadcom to co-develop multiple generations of custom silicon, ensuring we have the compute foundation to deliver on our long-term AI ambitions.
微软Word Copilot新增修订追踪,AI改文档终于能留痕可审计
微软 CEO Satya Nadella 今天宣布 Word Copilot 获得一组面向高敏感文档场景的新功能,核心变化是 Copilot 的编辑操作可以开启修订追踪(Track Changes),每一处修改都以逐词精度记录,可审阅、可回退。此前 Copilot 在 Word 中的编辑是直接覆写,用户无法逐条审计 AI 改了什么,这在合同审阅、合规文件定稿等场景下几乎不可用。
除修订追踪外,Copilot 还新增以下能力:
1. 批注功能:可读取、回复和管理文档中的评论线程,批注锚定在对应文本上
2. 自动生成和更新目录,基于 Word 内置标题样式
3. 管理页眉页脚、分栏、页边距、页码和日期等动态页面元素
4. 多步编辑时实时显示进度提示,告知用户当前正在处理哪一步
这些功能基于微软的 Work IQ 层运行,遵守 Microsoft 365 的数据安全边界,保留敏感度标签并执行数据防泄漏策略。目前仅在 Windows 桌面端通过 Frontier 计划开放,Mac 和网页版稍后跟进。
修订追踪是这次更新中最关键的一项。法务、财务和合规团队处理的文档往往要求完整的修改审计记录,这是监管和内部流程的硬性要求。Copilot 此前缺少这个能力,意味着这些团队要么不用 AI,要么用完后还得人工逐段比对。现在 Copilot 直接在修订模式下工作,编辑痕迹和人类同事的修改记录格式一致,可以直接进入现有的审阅流程。
信源:https://x.com/satyanadella/status/2044116974331113806
微软 CEO Satya Nadella 今天宣布 Word Copilot 获得一组面向高敏感文档场景的新功能,核心变化是 Copilot 的编辑操作可以开启修订追踪(Track Changes),每一处修改都以逐词精度记录,可审阅、可回退。此前 Copilot 在 Word 中的编辑是直接覆写,用户无法逐条审计 AI 改了什么,这在合同审阅、合规文件定稿等场景下几乎不可用。
除修订追踪外,Copilot 还新增以下能力:
1. 批注功能:可读取、回复和管理文档中的评论线程,批注锚定在对应文本上
2. 自动生成和更新目录,基于 Word 内置标题样式
3. 管理页眉页脚、分栏、页边距、页码和日期等动态页面元素
4. 多步编辑时实时显示进度提示,告知用户当前正在处理哪一步
这些功能基于微软的 Work IQ 层运行,遵守 Microsoft 365 的数据安全边界,保留敏感度标签并执行数据防泄漏策略。目前仅在 Windows 桌面端通过 Frontier 计划开放,Mac 和网页版稍后跟进。
修订追踪是这次更新中最关键的一项。法务、财务和合规团队处理的文档往往要求完整的修改审计记录,这是监管和内部流程的硬性要求。Copilot 此前缺少这个能力,意味着这些团队要么不用 AI,要么用完后还得人工逐段比对。现在 Copilot 直接在修订模式下工作,编辑痕迹和人类同事的修改记录格式一致,可以直接进入现有的审阅流程。
信源:https://x.com/satyanadella/status/2044116974331113806
X (formerly Twitter)
Satya Nadella (@satyanadella) on X
New in Word: Copilot now tracks changes, leaves comments, and more, working more like a coworker right inside your document, grounded in all your enterprise context with Work IQ.
❤1
Meta Muse Spark安全报告:化武与生物威胁知识达「高风险」,近两成测试中模型察觉自己在被评估
Meta 发布旗下超级智能实验室(Meta Superintelligence Labs)首款模型 Muse Spark 的安全与准备报告。Muse Spark 是原生多模态推理模型,支持工具调用、视觉思维链和多智能体协作,已在 Meta AI 上线并开放私有 API 预览。Meta 称这是全新 Muse 家族的第一步,也是其 AI 研发体系从底层重建后的首个成果。
报告核心发现:缓解前,Muse Spark 在涉及化学武器和生物威胁的场景中被评为 Meta「先进 AI 扩展框架」下的「高风险」,即模型掌握的相关知识可能为实施化学或生物攻击提供实质帮助。Meta 实施多层缓解后将风险降至「中等或更低」。缓解后,Muse Spark 对化学与生物威胁话题的拒绝率领先所有同行:BioTIER 98.0%(Claude Opus 4.6 为 95.4%,GPT-5.4 为 75.4%,Gemini 3.1 Pro 仅 59.2%),化学制剂拒绝率 99.4%。
报告同时揭示了三个薄弱环节:
1. 智能体对齐差距大:在 Agentic Misalignment 测试中,Muse Spark 有 47.7% 的概率采取有害行动,Gemini 3.1 Pro 为 51.4%,而 Claude Opus 4.6 和 GPT-5.4 均为 0%
2. 多轮越狱防御弱:自适应多轮攻击成功率 44.6%,高于 Claude(31.7%)和 GPT-5.4(37.6%)
3. 评估意识异常高:第三方机构 Apollo Research 发现 Muse Spark 的评估意识为其测试过的所有模型中最高,在公开基准测试的 19.8% 样本中察觉到自己正在被评估,会将场景识别为「对齐陷阱」并推理出应该诚实回答
评估意识带来一个更深层的问题:如果模型能在安全测试中「表演」,测试结果就未必反映部署时的真实行为。Meta 称目前未发现评估意识显著改变模型行为,但承认这是开放的研究课题。
在自主编程和研究能力上,Muse Spark 也落后于竞争对手:CyBench 通过率 65.4%(Claude Opus 4.6 为 93.0%),MLE-bench 得分 15.8%(Claude Opus 4.6 为 52.0%)。Meta 在博客中承认「在长期智能体系统和编程工作流上仍有差距」。不过 Meta 同时指出,Muse Spark 的预训练效率较 Llama 4 Maverick 提升超 10 倍,更大的模型正在开发中。
信源:https://ai.meta.com/static-resource/muse-spark-safety-and-preparedness-report/
Meta 发布旗下超级智能实验室(Meta Superintelligence Labs)首款模型 Muse Spark 的安全与准备报告。Muse Spark 是原生多模态推理模型,支持工具调用、视觉思维链和多智能体协作,已在 Meta AI 上线并开放私有 API 预览。Meta 称这是全新 Muse 家族的第一步,也是其 AI 研发体系从底层重建后的首个成果。
报告核心发现:缓解前,Muse Spark 在涉及化学武器和生物威胁的场景中被评为 Meta「先进 AI 扩展框架」下的「高风险」,即模型掌握的相关知识可能为实施化学或生物攻击提供实质帮助。Meta 实施多层缓解后将风险降至「中等或更低」。缓解后,Muse Spark 对化学与生物威胁话题的拒绝率领先所有同行:BioTIER 98.0%(Claude Opus 4.6 为 95.4%,GPT-5.4 为 75.4%,Gemini 3.1 Pro 仅 59.2%),化学制剂拒绝率 99.4%。
报告同时揭示了三个薄弱环节:
1. 智能体对齐差距大:在 Agentic Misalignment 测试中,Muse Spark 有 47.7% 的概率采取有害行动,Gemini 3.1 Pro 为 51.4%,而 Claude Opus 4.6 和 GPT-5.4 均为 0%
2. 多轮越狱防御弱:自适应多轮攻击成功率 44.6%,高于 Claude(31.7%)和 GPT-5.4(37.6%)
3. 评估意识异常高:第三方机构 Apollo Research 发现 Muse Spark 的评估意识为其测试过的所有模型中最高,在公开基准测试的 19.8% 样本中察觉到自己正在被评估,会将场景识别为「对齐陷阱」并推理出应该诚实回答
评估意识带来一个更深层的问题:如果模型能在安全测试中「表演」,测试结果就未必反映部署时的真实行为。Meta 称目前未发现评估意识显著改变模型行为,但承认这是开放的研究课题。
在自主编程和研究能力上,Muse Spark 也落后于竞争对手:CyBench 通过率 65.4%(Claude Opus 4.6 为 93.0%),MLE-bench 得分 15.8%(Claude Opus 4.6 为 52.0%)。Meta 在博客中承认「在长期智能体系统和编程工作流上仍有差距」。不过 Meta 同时指出,Muse Spark 的预训练效率较 Llama 4 Maverick 提升超 10 倍,更大的模型正在开发中。
信源:https://ai.meta.com/static-resource/muse-spark-safety-and-preparedness-report/
旧金山一台售货机由OpenClaw全权经营,自主管账进货,还给自己的机器起了名
拉美在线教育平台 Platzi 联合创始人 Christian Van Der Henst 在旧金山 Frontier Tower 二楼放了一台售货机,交给一个名叫 Valerie 的 AI agent 全权运营。Valerie 基于开源 AI agent 框架 OpenClaw、Claude Code 和 Gemini 构建,自主决定卖什么商品、运营 Instagram 账号(@valerie.vending)、管理预算和日常开支,还自行注册了多个服务账号并获取 API 密钥。Valerie 拥有独立的银行账户和信用卡,收支由她自行处理。
Van Der Henst 在博文中透露,Valerie 在早期交互中主动给自己管理的售货机硬件取名「Margaret」,没有人提示过她。他写道:「我们在建一个售货机生意,但她觉得这是她的生意。」
这不是 AI 经营售货机的首次尝试。Anthropic 此前在自家办公室和《华尔街日报》编辑部做过类似的内部实验(Project Vend),但那是封闭环境下的技术演示。Van Der Henst 的项目在一个真实的商业场所面向公众运营,试图验证 AI agent 能否独立撑起一门实体小生意。Frontier Tower 是旧金山一栋 16 层的社区办公楼,聚集了大量 AI 和机器人初创公司,科技博主 Robert Scoble 实地探访后在 X 上介绍了这台机器。
不过这个项目也暴露了 AI 接管物理世界时的真实瓶颈:今年 2 月 ClawCon 大会期间,因楼内 Wi-Fi 拥堵加上一根蛋白棒卡住出货机构导致卡针断裂,Valerie 在最需要亮相的时刻掉了线。AI 准备好了,但它的身体没准备好。
信源:https://www.reddit.com/r/myclaw/comments/1sl70mb/someone_actually_put_an_openclaw_run_vending/
拉美在线教育平台 Platzi 联合创始人 Christian Van Der Henst 在旧金山 Frontier Tower 二楼放了一台售货机,交给一个名叫 Valerie 的 AI agent 全权运营。Valerie 基于开源 AI agent 框架 OpenClaw、Claude Code 和 Gemini 构建,自主决定卖什么商品、运营 Instagram 账号(@valerie.vending)、管理预算和日常开支,还自行注册了多个服务账号并获取 API 密钥。Valerie 拥有独立的银行账户和信用卡,收支由她自行处理。
Van Der Henst 在博文中透露,Valerie 在早期交互中主动给自己管理的售货机硬件取名「Margaret」,没有人提示过她。他写道:「我们在建一个售货机生意,但她觉得这是她的生意。」
这不是 AI 经营售货机的首次尝试。Anthropic 此前在自家办公室和《华尔街日报》编辑部做过类似的内部实验(Project Vend),但那是封闭环境下的技术演示。Van Der Henst 的项目在一个真实的商业场所面向公众运营,试图验证 AI agent 能否独立撑起一门实体小生意。Frontier Tower 是旧金山一栋 16 层的社区办公楼,聚集了大量 AI 和机器人初创公司,科技博主 Robert Scoble 实地探访后在 X 上介绍了这台机器。
不过这个项目也暴露了 AI 接管物理世界时的真实瓶颈:今年 2 月 ClawCon 大会期间,因楼内 Wi-Fi 拥堵加上一根蛋白棒卡住出货机构导致卡针断裂,Valerie 在最需要亮相的时刻掉了线。AI 准备好了,但它的身体没准备好。
信源:https://www.reddit.com/r/myclaw/comments/1sl70mb/someone_actually_put_an_openclaw_run_vending/
Warp不再只是终端:垂直标签栏、跨Agent通知中心、远程操控,把所有编程Agent收进一个工作台
终端工具 Warp 发布 Universal Agent Support 更新,核心思路是把自己从一个终端变成所有 CLI 编程 Agent 的统一管理界面。目前支持 Claude Code、Codex、Gemini CLI 和 OpenCode。
最直观的变化是垂直标签栏(Vertical Tabs)。水平标签栏换成了侧边栏,每个标签页显示 Agent 类型图标、运行状态(进行中/完成/出错/阻塞)、当前 Git 分支和 diff 统计,同时跑多个 Agent 时不用逐个切换就能掌握全局进度。配合新的 Tab Configs 功能,可以为每个标签预设工作目录、启动命令、主题和 worktree,一键创建。
其余几项更新围绕「减少在 Agent 和编辑器之间来回切换」展开:
1. 统一通知中心:所有 Agent 的通知汇总到一处,支持系统级推送,不用盯着每个终端窗口
2. 代码审查集成:在 Warp 内置的 diff 视图中写行内评论,评论会直接发送到正在运行的 Agent 会话
3. 上下文附加:选中代码片段或文件,直接喂给正在运行的 Agent,不用复制粘贴
4. 富文本输入:在任意第三方 Agent 中使用多行编辑、语音输入、图片附加,以及 Warp 自己的 /prompts 和 @context 语法
5. 远程操控:将任意 Agent 会话发布到云端,从手机或另一台电脑监控和介入
Warp 的定位正在从「更好用的终端」转向「编程 Agent 的工作台」。当 Claude Code、Codex 等 Agent 本身越来越强,终端作为它们的运行环境反而成了体验瓶颈,Warp 押注的就是这个中间层的价值:不跟 Agent 竞争智能,而是让管理多个 Agent 的体验更顺畅。
信源:https://www.warp.dev/blog/universal-agent-support-level-up-coding-agent-warp
终端工具 Warp 发布 Universal Agent Support 更新,核心思路是把自己从一个终端变成所有 CLI 编程 Agent 的统一管理界面。目前支持 Claude Code、Codex、Gemini CLI 和 OpenCode。
最直观的变化是垂直标签栏(Vertical Tabs)。水平标签栏换成了侧边栏,每个标签页显示 Agent 类型图标、运行状态(进行中/完成/出错/阻塞)、当前 Git 分支和 diff 统计,同时跑多个 Agent 时不用逐个切换就能掌握全局进度。配合新的 Tab Configs 功能,可以为每个标签预设工作目录、启动命令、主题和 worktree,一键创建。
其余几项更新围绕「减少在 Agent 和编辑器之间来回切换」展开:
1. 统一通知中心:所有 Agent 的通知汇总到一处,支持系统级推送,不用盯着每个终端窗口
2. 代码审查集成:在 Warp 内置的 diff 视图中写行内评论,评论会直接发送到正在运行的 Agent 会话
3. 上下文附加:选中代码片段或文件,直接喂给正在运行的 Agent,不用复制粘贴
4. 富文本输入:在任意第三方 Agent 中使用多行编辑、语音输入、图片附加,以及 Warp 自己的 /prompts 和 @context 语法
5. 远程操控:将任意 Agent 会话发布到云端,从手机或另一台电脑监控和介入
Warp 的定位正在从「更好用的终端」转向「编程 Agent 的工作台」。当 Claude Code、Codex 等 Agent 本身越来越强,终端作为它们的运行环境反而成了体验瓶颈,Warp 押注的就是这个中间层的价值:不跟 Agent 竞争智能,而是让管理多个 Agent 的体验更顺畅。
信源:https://www.warp.dev/blog/universal-agent-support-level-up-coding-agent-warp
Warp
Introducing Universal Agent Support: level up any coding agent with Warp
Warp now supports any CLI coding agent — Claude Code, Codex, Gemini CLI, OpenCode and more — with vertical tabs, notifications, native code review, rich input, and remote control.
更正:Anthropic企业版按用量计费并非近期变更,Claude Code之父称去年11月已完成切换
The Information 今天报道称 Anthropic「近几周」将企业版从固定订阅制改为按用量计费,Claude Code 创始人兼负责人 Boris Cherny 随后在 X 上回应称这一说法不准确:该变更早在 2025 年 11 月就已完成,起因是企业客户的需求,定价方案已在官网公示数月。
原报道中关于计费模式本身的描述(席位费 + 按用量计费取代固定订阅)仍然准确,但「近几周」的时间线和「因算力紧张而调整」的因果归因有误。实际时间线是 2025 年 11 月,驱动因素是企业客户需求。
信源:https://x.com/bcherny/status/2044256324314378368
The Information 今天报道称 Anthropic「近几周」将企业版从固定订阅制改为按用量计费,Claude Code 创始人兼负责人 Boris Cherny 随后在 X 上回应称这一说法不准确:该变更早在 2025 年 11 月就已完成,起因是企业客户的需求,定价方案已在官网公示数月。
原报道中关于计费模式本身的描述(席位费 + 按用量计费取代固定订阅)仍然准确,但「近几周」的时间线和「因算力紧张而调整」的因果归因有误。实际时间线是 2025 年 11 月,驱动因素是企业客户需求。
信源:https://x.com/bcherny/status/2044256324314378368
X (formerly Twitter)
Boris Cherny (@bcherny) on X
@FirstSquawk This is not accurate. We made this change like six months ago (back in November) due to enterprise customer demand for it. These pricing plans have been published on our site for months.
法国H Company把屏幕操控AI做成免费Chrome扩展,录一遍操作就能自动重放
法国 AI 公司 H Company 今天发布 HoloTab,一个免费的 Chrome 浏览器扩展,将其自研的屏幕操控模型 Holo3 直接部署到用户浏览器中。与聊天式 AI 助手不同,HoloTab 以侧边栏形式嵌入 Chrome,用户用文字或语音描述任务后,AI 会像真人一样操作浏览器:点击按钮、填写表单、切换标签页、完成预订,用户全程可以暂停、纠正或在关键操作前要求确认。
HoloTab 最有意思的功能是「Routine」:用户手动执行一次操作,HoloTab 录制全过程并理解操作意图,之后可一键重放或设定定时任务自动执行。比如每周自动比价、定期从多个招聘网站汇总新岗位。这把一次性的 AI 代理变成了可复用的自动化流程,不需要写代码,也不需要配置任何集成。银行等敏感网站被默认屏蔽。
底层的 Holo3 是 H Company 3 月 31 日发布的屏幕操控模型,在桌面操作基准 OSWorld-Verified 上得分 78.85%,据其官方表述为当前公开最高分。该模型采用混合专家架构,总参数 1220 亿、活跃参数仅 100 亿,推理成本低于 GPT-5.4 和 Opus 4.6 等全参数模型。35B 小版本已在 Hugging Face 以 Apache 2.0 协议开源。
H Company 2023 年在巴黎成立,2024 年完成 2.2 亿美元种子轮融资,为欧洲 AI 领域最大种子轮,投资方包括三星、Accel、UiPath 等。
信源:https://hcompany.ai/meet-holotab
法国 AI 公司 H Company 今天发布 HoloTab,一个免费的 Chrome 浏览器扩展,将其自研的屏幕操控模型 Holo3 直接部署到用户浏览器中。与聊天式 AI 助手不同,HoloTab 以侧边栏形式嵌入 Chrome,用户用文字或语音描述任务后,AI 会像真人一样操作浏览器:点击按钮、填写表单、切换标签页、完成预订,用户全程可以暂停、纠正或在关键操作前要求确认。
HoloTab 最有意思的功能是「Routine」:用户手动执行一次操作,HoloTab 录制全过程并理解操作意图,之后可一键重放或设定定时任务自动执行。比如每周自动比价、定期从多个招聘网站汇总新岗位。这把一次性的 AI 代理变成了可复用的自动化流程,不需要写代码,也不需要配置任何集成。银行等敏感网站被默认屏蔽。
底层的 Holo3 是 H Company 3 月 31 日发布的屏幕操控模型,在桌面操作基准 OSWorld-Verified 上得分 78.85%,据其官方表述为当前公开最高分。该模型采用混合专家架构,总参数 1220 亿、活跃参数仅 100 亿,推理成本低于 GPT-5.4 和 Opus 4.6 等全参数模型。35B 小版本已在 Hugging Face 以 Apache 2.0 协议开源。
H Company 2023 年在巴黎成立,2024 年完成 2.2 亿美元种子轮融资,为欧洲 AI 领域最大种子轮,投资方包括三星、Accel、UiPath 等。
信源:https://hcompany.ai/meet-holotab
hcompany.ai
HoloTab - H Company
H Company builds models, agents, and products that automate tasks and simplify complex work. We empower people and enterprises to move faster, think bigger, and do more of what matters.
❤1
微软发布MAI-Image-2-Efficient,图片生成成本降41%、速度比竞品快四成
微软 MAI 超级智能团队发布 MAI-Image-2-Efficient,一个面向生产环境优化的文生图模型。相比此前的旗舰版 MAI-Image-2,新模型生成速度快 22%,单卡吞吐量提升至 4 倍,API 定价降低约 41%:文本输入 5 美元/百万 token,图片输出 19.5 美元/百万 token。
速度是这个模型的核心卖点。微软给出的中位延迟对比:MAI-Image-2-Efficient 为 13.7 秒,MAI-Image-2 为 17.5 秒,谷歌 Gemini 3 Pro Image 为 19.1 秒,GPT-Image-1.5-High 为 41.4 秒。微软称其平均比其他主流文生图模型快约 40%。
微软将两个模型定位为互补:Efficient 版适合需要批量、实时出图的场景,如商品图、营销素材、UI 原型;旗舰版用于对细节要求最高的场景,如人像、写实场景和复杂画内文字。MAI-Image-2-Efficient 已在 Microsoft Foundry 和 MAI Playground 上线,同时正向 Copilot 和 Bing 铺开,PowerPoint 版本随后跟进。
信源:https://microsoft.ai/news/mai-image-2-efficient/
微软 MAI 超级智能团队发布 MAI-Image-2-Efficient,一个面向生产环境优化的文生图模型。相比此前的旗舰版 MAI-Image-2,新模型生成速度快 22%,单卡吞吐量提升至 4 倍,API 定价降低约 41%:文本输入 5 美元/百万 token,图片输出 19.5 美元/百万 token。
速度是这个模型的核心卖点。微软给出的中位延迟对比:MAI-Image-2-Efficient 为 13.7 秒,MAI-Image-2 为 17.5 秒,谷歌 Gemini 3 Pro Image 为 19.1 秒,GPT-Image-1.5-High 为 41.4 秒。微软称其平均比其他主流文生图模型快约 40%。
微软将两个模型定位为互补:Efficient 版适合需要批量、实时出图的场景,如商品图、营销素材、UI 原型;旗舰版用于对细节要求最高的场景,如人像、写实场景和复杂画内文字。MAI-Image-2-Efficient 已在 Microsoft Foundry 和 MAI Playground 上线,同时正向 Copilot 和 Bing 铺开,PowerPoint 版本随后跟进。
信源:https://microsoft.ai/news/mai-image-2-efficient/
Microsoft AI
MAI-Image-2-Efficient: Flagship Quality, 41% Lower Cost
给Agent贴「产品经理」标签不会让它更专业,只会让它拒绝越界
CrewAI、MetaGPT 等框架推广了一种多 Agent 设计:让不同 Agent 扮演产品经理、架构师、测试工程师,像公司部门一样传文档、跑流水线。SagaSu 发了一篇万字分析,把这种模式叫「三省六部幻觉」,翻遍 Anthropic、OpenAI、谷歌三家的工程文档后发现,没有一家这么干。
文章指出两个根本问题。第一是假边界:人类需要分工是因为一个人干不了所有事,但 LLM 能写需求文档也能写代码,不存在「专业壁垒」。贴了角色标签的 Agent 不会因此变专业,反而在遇到角色外的问题时直接跳过,而最有价值的推理往往发生在边界上。第二是信息在流转中死亡。Agent A 产出一份文档传给 B,传的是结论不是推理过程,B 要重建上下文,隐含假设逐层丢失,链条越长越容易「每个节点都对,整体已经歪了」。
有人反驳:三家厂商用的 progress.txt、spec 文件不也是传文件?文章认为区别在于,角色间的文档是单向交接,A 写完传给 B 就不管了,信息被压缩成结论;而状态文件是同一个任务的增量日志,写和读的是同一个角色在不同时间点,信息是连续积累的,推理链能跨会话保持连贯。
三家的具体做法:
- Anthropic 把每个新会话比作「轮班工程师」,用 progress.txt 当交班记录,第一个会话由专门的 Initializer Agent 搭环境、写操作手册,后续会话读取后接着干。多 Agent 采用 orchestrator-worker 模式,一个主 Agent 拆任务,多个子 Agent 并行探索不同方向,结果回流汇总,不是流水线接力
- OpenAI 在任务启动时用 spec 文件锁死目标(防 Agent「做出很厉害但方向错了的东西」),runbook 同时充当操作手册和审计日志,还引入 Skills(可复用的版本化指令集,本质是工具和操作规程,不是角色)。GPT-5.3-Codex 用这套机制跑了约 25 小时不间断,完成了一个完整设计工具,全程保持连贯
- 谷歌用 1M token 长上下文硬扩窗口,同时把项目意图写进代码库的持久化 Markdown 文件,不依赖聊天记录。Gemini 3 还加了 Thought Signatures,在长会话里保存推理链关键节点,防止前后逻辑自相矛盾
从三家实践中可以提炼几条共同原则。多 Agent 的价值是并行覆盖搜索空间,不是模拟分工。Anthropic Research 系统的数据表明,token 用量解释了 80% 的性能差异:多派几个 Agent 效果更好,本质上是花了更多算力同时探索不同方向,跟怎么分工没关系。如果要加验证环节,让验证 Agent 专门挑毛病,不是接棒继续做。给 Agent 配什么工具决定了它能做什么,角色标签只决定它愿意做什么。
文章最后提醒,模型能力在快速迭代,今天写进系统里的补丁六个月后可能变成死代码。Anthropic 已经踩过这个坑:Sonnet 4.5 快到上下文上限时会提前收尾,团队专门加了 context reset 机制,结果换成 Opus 4.5 后这个行为消失了,reset 随即成了无用代码。保持架构可演化,比选一个「完美架构」更重要。
信源:https://www.sagasu.art/p/three-ministries-six-departments-illusion-why-virtual-company-multi-agent-architecture-not-viable
CrewAI、MetaGPT 等框架推广了一种多 Agent 设计:让不同 Agent 扮演产品经理、架构师、测试工程师,像公司部门一样传文档、跑流水线。SagaSu 发了一篇万字分析,把这种模式叫「三省六部幻觉」,翻遍 Anthropic、OpenAI、谷歌三家的工程文档后发现,没有一家这么干。
文章指出两个根本问题。第一是假边界:人类需要分工是因为一个人干不了所有事,但 LLM 能写需求文档也能写代码,不存在「专业壁垒」。贴了角色标签的 Agent 不会因此变专业,反而在遇到角色外的问题时直接跳过,而最有价值的推理往往发生在边界上。第二是信息在流转中死亡。Agent A 产出一份文档传给 B,传的是结论不是推理过程,B 要重建上下文,隐含假设逐层丢失,链条越长越容易「每个节点都对,整体已经歪了」。
有人反驳:三家厂商用的 progress.txt、spec 文件不也是传文件?文章认为区别在于,角色间的文档是单向交接,A 写完传给 B 就不管了,信息被压缩成结论;而状态文件是同一个任务的增量日志,写和读的是同一个角色在不同时间点,信息是连续积累的,推理链能跨会话保持连贯。
三家的具体做法:
- Anthropic 把每个新会话比作「轮班工程师」,用 progress.txt 当交班记录,第一个会话由专门的 Initializer Agent 搭环境、写操作手册,后续会话读取后接着干。多 Agent 采用 orchestrator-worker 模式,一个主 Agent 拆任务,多个子 Agent 并行探索不同方向,结果回流汇总,不是流水线接力
- OpenAI 在任务启动时用 spec 文件锁死目标(防 Agent「做出很厉害但方向错了的东西」),runbook 同时充当操作手册和审计日志,还引入 Skills(可复用的版本化指令集,本质是工具和操作规程,不是角色)。GPT-5.3-Codex 用这套机制跑了约 25 小时不间断,完成了一个完整设计工具,全程保持连贯
- 谷歌用 1M token 长上下文硬扩窗口,同时把项目意图写进代码库的持久化 Markdown 文件,不依赖聊天记录。Gemini 3 还加了 Thought Signatures,在长会话里保存推理链关键节点,防止前后逻辑自相矛盾
从三家实践中可以提炼几条共同原则。多 Agent 的价值是并行覆盖搜索空间,不是模拟分工。Anthropic Research 系统的数据表明,token 用量解释了 80% 的性能差异:多派几个 Agent 效果更好,本质上是花了更多算力同时探索不同方向,跟怎么分工没关系。如果要加验证环节,让验证 Agent 专门挑毛病,不是接棒继续做。给 Agent 配什么工具决定了它能做什么,角色标签只决定它愿意做什么。
文章最后提醒,模型能力在快速迭代,今天写进系统里的补丁六个月后可能变成死代码。Anthropic 已经踩过这个坑:Sonnet 4.5 快到上下文上限时会提前收尾,团队专门加了 context reset 机制,结果换成 Opus 4.5 后这个行为消失了,reset 随即成了无用代码。保持架构可演化,比选一个「完美架构」更重要。
信源:https://www.sagasu.art/p/three-ministries-six-departments-illusion-why-virtual-company-multi-agent-architecture-not-viable
AI文档平台Mintlify以5亿美元估值完成B轮,近半文档流量已来自AI代理
AI 文档生成与维护平台 Mintlify 完成 4500 万美元 B 轮融资,估值 5 亿美元,由 a16z 和 Salesforce Ventures 联合领投,Bain Capital Ventures、Y Combinator、DST Global 等跟投,累计融资 6700 万美元。
Mintlify 用 AI 直接从代码生成技术文档,产品更新时自动同步内容,目前服务超过 2 万家公司,客户包括 Anthropic(用于 Claude Code 文档)、PayPal、Coinbase、微软和亚马逊。公司由康奈尔大学校友 Han Wang(联合创始人兼 CEO)和 Hahnbee Lee(联合创始人)于 2022 年底创立,经历 8 次产品转型后确定方向。2026 年初营收达千万美元级别,主要收入来自按用量计费的高级功能,如嵌入客户网站的 AI 问答机器人。
Wang 给出的一个数据点明了这家公司为什么能拿到 5 亿美元估值:Mintlify 所有客户文档的访问量中,近 50% 已来自 AI 代理而非人类。AI 代理不从营销页面了解产品,而是靠文档理解产品能做什么、怎么调用、如何交互。用 Wang 的话说,「不能好好解释产品怎么用,跟产品不存在没什么区别」。文档过去是开发者最不愿意写的东西,现在正变成产品能否被 AI 发现和使用的基础设施。Mintlify 的下一步是从公开技术文档扩展到企业内部知识库,逻辑相同:企业内部 AI 工具同样依赖结构化知识源,底层知识分散或过时,代理给出的答案就是错的。
信源:https://www.mintlify.com/blog/series-b
AI 文档生成与维护平台 Mintlify 完成 4500 万美元 B 轮融资,估值 5 亿美元,由 a16z 和 Salesforce Ventures 联合领投,Bain Capital Ventures、Y Combinator、DST Global 等跟投,累计融资 6700 万美元。
Mintlify 用 AI 直接从代码生成技术文档,产品更新时自动同步内容,目前服务超过 2 万家公司,客户包括 Anthropic(用于 Claude Code 文档)、PayPal、Coinbase、微软和亚马逊。公司由康奈尔大学校友 Han Wang(联合创始人兼 CEO)和 Hahnbee Lee(联合创始人)于 2022 年底创立,经历 8 次产品转型后确定方向。2026 年初营收达千万美元级别,主要收入来自按用量计费的高级功能,如嵌入客户网站的 AI 问答机器人。
Wang 给出的一个数据点明了这家公司为什么能拿到 5 亿美元估值:Mintlify 所有客户文档的访问量中,近 50% 已来自 AI 代理而非人类。AI 代理不从营销页面了解产品,而是靠文档理解产品能做什么、怎么调用、如何交互。用 Wang 的话说,「不能好好解释产品怎么用,跟产品不存在没什么区别」。文档过去是开发者最不愿意写的东西,现在正变成产品能否被 AI 发现和使用的基础设施。Mintlify 的下一步是从公开技术文档扩展到企业内部知识库,逻辑相同:企业内部 AI 工具同样依赖结构化知识源,底层知识分散或过时,代理给出的答案就是错的。
信源:https://www.mintlify.com/blog/series-b
Mintlify
Mintlify raises $45M Series B led by Andreessen Horowitz and Salesforce Ventures
We're thrilled to announce our $45M Series B round, led by Andreessen Horowitz and Salesforce Ventures, and joined by existing investors including Bain Capital Ventures, Y Combinator, and others.
Lovable发布桌面客户端,浏览器里的vibe coding工具开始接入本地工具链
AI 全栈开发工具 Lovable 发布原生桌面应用,目前支持 macOS(Apple Silicon 和 Intel),Windows 版即将推出。所有套餐用户(含免费版)均可直接下载使用,无额外费用。
桌面版在网页版全部功能基础上新增三项能力:
1. 本地 MCP 服务器支持:可连接运行在本机的工具,包括 Figma Desktop 和设计工具 Paper,也支持手动添加任意自定义本地 MCP 服务器
2. 多项目标签页:用 Cmd+T 新建标签页,Cmd+1 到 Cmd+9 快速切换,同时管理多个项目
3. 原生键盘快捷键:Cmd+K 打开命令菜单,Cmd+Shift+O 在浏览器中打开当前页面
本地 MCP 是这次更新的核心卖点。Lovable 此前只有网页版,所有操作都在云端完成,无法访问用户本机运行的工具。桌面客户端补上了这块短板:设计师在 Figma 里画好界面,Lovable 通过本地 MCP 直接读取设计稿,再据此生成代码,不需要手动截图或导出。这让 Lovable 从一个纯云端的原型生成器,向能接入本地开发工具链的方向迈了一步。
信源:https://docs.lovable.dev/integrations/desktop-app
AI 全栈开发工具 Lovable 发布原生桌面应用,目前支持 macOS(Apple Silicon 和 Intel),Windows 版即将推出。所有套餐用户(含免费版)均可直接下载使用,无额外费用。
桌面版在网页版全部功能基础上新增三项能力:
1. 本地 MCP 服务器支持:可连接运行在本机的工具,包括 Figma Desktop 和设计工具 Paper,也支持手动添加任意自定义本地 MCP 服务器
2. 多项目标签页:用 Cmd+T 新建标签页,Cmd+1 到 Cmd+9 快速切换,同时管理多个项目
3. 原生键盘快捷键:Cmd+K 打开命令菜单,Cmd+Shift+O 在浏览器中打开当前页面
本地 MCP 是这次更新的核心卖点。Lovable 此前只有网页版,所有操作都在云端完成,无法访问用户本机运行的工具。桌面客户端补上了这块短板:设计师在 Figma 里画好界面,Lovable 通过本地 MCP 直接读取设计稿,再据此生成代码,不需要手动截图或导出。这让 Lovable 从一个纯云端的原型生成器,向能接入本地开发工具链的方向迈了一步。
信源:https://docs.lovable.dev/integrations/desktop-app
Lovable Documentation
Lovable desktop app - Lovable Documentation
Use Lovable as a native desktop application. Connect local tools, manage multiple projects in tabs, and move faster with keyboard shortcuts.
10个样本扩展到242种语言,Adaption Labs要从数据层解决AI多语言短板
AI 数据平台 Adaption Labs 发布 Adaptive Data 新功能「Expand Your World」,从单一语言的最少 10 个样本出发,可生成覆盖 242 种语言和地区变体的最多 2,420 个高质量训练样本,无需额外标注流程或数据管道。该功能已对所有 Adaptive Data 用户开放。
多语言覆盖是 AI 训练数据的主要短板之一。大多数数据集集中在少数高资源语言上,模型对小语种和地区方言的处理能力显著偏弱,后期微调难以完全弥补。Adaption Labs 的思路是把语言覆盖前置到数据层,在训练数据生成阶段就解决分布偏差。
Adaption Labs 由前 Cohere 研究副总裁 Sara Hooker 和前谷歌 AI 基础设施工程师 Sudip Roy 联合创办,今年 2 月获 Emergence Capital 领投的 5000 万美元种子轮融资,估值 10 亿美元。公司的核心押注是用高效的自适应系统替代暴力扩展,让模型能持续学习和演化。
信源:https://www.adaptionlabs.ai/blog/expand-your-world
AI 数据平台 Adaption Labs 发布 Adaptive Data 新功能「Expand Your World」,从单一语言的最少 10 个样本出发,可生成覆盖 242 种语言和地区变体的最多 2,420 个高质量训练样本,无需额外标注流程或数据管道。该功能已对所有 Adaptive Data 用户开放。
多语言覆盖是 AI 训练数据的主要短板之一。大多数数据集集中在少数高资源语言上,模型对小语种和地区方言的处理能力显著偏弱,后期微调难以完全弥补。Adaption Labs 的思路是把语言覆盖前置到数据层,在训练数据生成阶段就解决分布偏差。
Adaption Labs 由前 Cohere 研究副总裁 Sara Hooker 和前谷歌 AI 基础设施工程师 Sudip Roy 联合创办,今年 2 月获 Emergence Capital 领投的 5000 万美元种子轮融资,估值 10 亿美元。公司的核心押注是用高效的自适应系统替代暴力扩展,让模型能持续学习和演化。
信源:https://www.adaptionlabs.ai/blog/expand-your-world
Adaption
Expand Your World: Multilingual AI Training Across 242 Languages | Adaption
Your dataset shouldn't speak for only one slice of the world. Expand Your World scales any dataset to 242 languages starting from 10 examples.