动察Beating AI News
3.19K subscribers
902 photos
2 videos
1 file
3.44K links
AI新闻信息流
Download Telegram
Hugging Face正式推出Kernels,GPU算子像模型一样一行代码装好

Hugging Face CEO Clem Delangue 宣布 Kernels 正式上线 Hub。GPU 算子是让显卡跑出极限速度的底层优化代码,能将推理和训练加速 1.7 至 2.5 倍,但安装一直是噩梦:以最常用的 FlashAttention 为例,本地编译需要约 96GB 内存和数小时,PyTorch 版本、CUDA 版本稍有不对就报错,多数开发者在安装这一步就卡住了。

Kernels Hub 把编译搬到云端。Hugging Face 提前在各种显卡和系统环境下编译好算子,开发者写一行代码,Hub 自动匹配硬件环境,几秒内下载预编译文件直接可用。同一进程可加载多个不同版本算子,兼容 torch.compile。

Kernels 去年 6 月测试上线,本月升级为 Hub 一级仓库类型,与 Models、Datasets、Spaces 并列。目前已有 61 个预编译算子,覆盖注意力机制、归一化、混合专家路由、量化等常用场景,支持英伟达 CUDA、AMD ROCm、苹果 Metal 和英特尔 XPU 四种硬件加速平台,已集成进 Hugging Face 的推理框架 TGI 和 Transformers 库。

信源:https://x.com/ClementDelangue/status/2044053580504584349
Cloudflare推出Mesh,专为AI代理打通私有网络,50节点免费

Cloudflare 发布 Mesh,一套面向 AI 代理场景的私有组网方案。核心问题:AI 代理需要访问私有资源(内部数据库、staging 环境、家庭网络上的本地服务),但 VPN 需要交互式登录,SSH 隧道需要手动配置,这些工具都是为人设计的,不适合自主运行的软件。

Mesh 用一个轻量连接器把所有设备、服务器和代理组成双向私有网络,通过 Cloudflare 全球 330 多个城市的边缘网络路由。与 Cloudflare Tunnel(单向代理流量到特定服务)不同,Mesh 是多对多的全网互通,网络中任意节点可通过私有 IP 直接访问彼此。

三个典型场景:

1. 在手机上安全访问家里 Mac mini 运行的 OpenClaw,不暴露公网端口
2. 让笔记本上的 Claude Code 或 Cursor 直接查询云端 VPC 中的 staging 数据库
3. Cloudflare Workers 上部署的代理通过 Workers VPC 绑定访问内部 API 和 MCP 服务器

安全控制方面,Mesh 运行在 Cloudflare One 平台上,现有的 Gateway 策略、设备状态检查和访问规则自动适用于所有 Mesh 流量,无需额外配置。后续计划包括:主机名路由(按服务名而非 IP 访问)、Mesh DNS(节点加入后自动获得内部域名)、身份感知路由(让每个代理携带独立身份,支持按代理而非按用户写访问策略)以及 Docker 容器支持。

免费层级包含 50 个节点和 50 个用户,所有 Cloudflare 账户均可使用。

信源:https://blog.cloudflare.com/mesh/
OpenAI购买未解数学难题验证器,可自动检验AI解题是否正确

AI 研究机构 Epoch AI 披露,OpenAI 已购买其 FrontierMath: Open Problems 验证器的访问权限。FrontierMath: Open Problems 是一组至今未被专业数学家解出的研究级数学难题,每道题都配有一个专用计算机程序(验证器),虽然目前无人知道正确答案,但一旦有人(或 AI)给出潜在解,验证器可以自动检验其正确性。OpenAI 购买该权限后,可以用验证器检查自家模型生成的数学解是否有效。

验证器的访问权限向任何机构开放购买,主要成本用于支付数学家报酬,因为制定问题和编写验证器的过程非常耗费人力。Epoch AI 同时设定了一项条件:凡通过验证器发现有效解的一方,必须将结果通知 Epoch AI,且问题作者与发现方共享联合发表权。

Epoch AI 强调,OpenAI 此前曾资助原始 FrontierMath 基准(Tiers 1-4)的创建,但 Open Problems 部分由 Epoch AI 独立开发和拥有,试点阶段由 Schmidt Sciences 资助。

信源:https://x.com/EpochAIResearch/status/2044227029978284471
ARC-AGI-3公布史上最大规模人类测试:所有关卡均被人类攻克,AI仍有差距

ARC Prize 基金会公布了 ARC-AGI-3 的人类表现数据集,这是 ARC-AGI 系列迄今规模最大的人类测试研究,共 458 名参与者。数据集包含 342 条完整的人类操作回放记录,覆盖 25 个公开环境,已全部开源。

ARC-AGI-3 包含 135 个抽象推理环境,测试者不会收到任何玩法说明,必须自行探索、推断规则并制定策略。测试在旧金山的线下测试中心进行,每场 90 分钟,参与者获得约 130 美元底薪加每通关一个环境 5 美元奖励。所有测试均为「首次通关」条件,即每人只看一次、只尝试一次,衡量的是面对全新问题时的学习和适应能力。人类和 AI 获得完全相同的信息,没有任何信息差。

核心结论:ARC-AGI-3 的所有环境均被人类通关,每个环境至少有两名独立参与者完成,多数环境有五人以上通关。ARC Prize 基金会称「我们还没有实现 AGI,这份数据集就是证据」。

自 ARC-AGI-3 预览以来,公开环境已收到近 100 万份 AI 评测提交。基于这些数据,基金会同时宣布两项评分规则调整:一是将每关的人类基准从「第二好的玩家」改为「中位数玩家」,降低运气因素对得分的影响;二是将单关得分上限从 100% 提高到 115%,避免一关表现不佳拖垮整体成绩。两项调整的净效果是人类和 AI 得分均小幅上升约 0.5 个百分点。

信源:https://arcprize.org/blog/measuring-human-performance-on-arc-agi-3
阿里HappyHorse首次参加Arena盲测即登顶视频编辑赛道,两周后发布正式版

阿里巴巴 ATH AI 创新部门旗下的 AI 视频模型 HappyHorse 宣布 1.0 版本已上线 UC Berkeley 社区盲测平台 Arena(前身为 LMArena),首次参赛即以 1299 分(初步评分,±21)拿下视频编辑(Video Edit)赛道第一,领先第二名 xAI 的 grok-imagine-video 42 分,领先第三名快手可灵 o3-pro 48 分。

HappyHorse 此前已在另一评测平台 Artificial Analysis 的文生视频和图生视频排行榜登顶,视频编辑是其拓展的新赛道。Arena 官方称视频编辑是视频模型的新兴前沿能力,目前仅少数模型支持。HappyHorse 团队表示目前处于正式发布前的最后优化冲刺阶段,正式版将在两周后上线,社区用户现可在 arena.ai 提前体验并投票。

信源:https://x.com/arena/status/2044260620317667644
👍1
微信ClawBot聊天界面已支持Markdown渲染,普通聊天仍为纯文本

微信 ClawBot 插件的聊天界面已适配 Markdown 语法渲染,AI 回复中的标题、列表、代码块、表格、引用、粗体等富文本格式现可正常显示,代码块支持多语言语法高亮和一键复制。

微信的普通聊天、群聊和文件传输助手仍为纯文本,不渲染任何 Markdown 语法。
Anthropic低调上线身份验证,用Claude部分功能需出示护照并自拍

Anthropic 在帮助中心发布身份验证政策页面,称正在「为少数使用场景」逐步推行身份验证。用户在访问特定功能、触发平台安全检查或合规审查时可能被要求验证身份。页面未说明哪些功能会触发验证,Anthropic 也未通过博客或社交媒体正式公告这一变化。

验证流程要求用户手持实体政府证件(护照、驾照或国民身份证),用摄像头拍照上传,部分情况下还需实时自拍。截图、扫描件、电子证件和非政府证件均不被接受。验证合作方为 Persona Identities,证件照片和自拍存储在 Persona 系统中,Anthropic 称自身不保存这些影像,验证数据不用于模型训练。

Persona 是 Peter Thiel 参投的硅谷身份验证公司,也为 ChatGPT 和 LinkedIn 提供验证服务,但今年 2 月接连曝出隐私问题。Cybernews 报道 Persona 意外暴露了与政府监控相关的平台接口,Discord 用户的验证数据随后被发现泄露,Discord 公开与其切割。Mashable 调查发现,通过 Persona 验证的 LinkedIn 用户,个人数据可被分享给多达 17 家公司。Anthropic 在页面中称选择 Persona 是基于其「技术实力、隐私控制和安全保障」。

此次身份验证与近期的年龄验证争议相互独立。4 月 12 日前后多名用户在 Reddit 反映被 Claude 错误标记为未成年人导致账号封禁,那一流程使用的验证商是 Yoti 而非 Persona。

信源:https://support.claude.com/en/articles/14328960-identity-verification-on-claude
传DeepSeek-R1核心作者郭达雅已入职字节跳动

图灵教育联合创始人刘江今天在 X 上爆料称,DeepSeek 核心研究员郭达雅「已经到字节上班了」。

郭达雅 1995 年生,中山大学博士,由印鉴教授和微软亚洲研究院周明博士联合培养,2020 年获微软学者奖学金。2023 年 7 月加入 DeepSeek 后,他是 DeepSeek-R1 论文的第一作者。R1 是 DeepSeek 最具影响力的模型,首次证明纯强化学习可以激发大模型的推理能力,论文后登上 Nature 封面。

郭达雅 3 月从 DeepSeek 离职的消息此前已被多家媒体确认,但去向一直未公开。百度曾被传是其目的地,但百度方面明确否认,仅确认有其他 DeepSeek 成员加入。如果刘江的爆料属实,郭达雅将是继原通义千问后训练负责人郁博文之后,又一位加入字节 Seed 团队的顶级 AI 研究员。

信源:https://x.com/turingbook/status/2044294170588917857
1
马斯克晒AI5芯片实物照,此前搁置的训练芯片Dojo也回来了

马斯克今天在 X 上宣布特斯拉 AI5 芯片已完成流片(tapeout,即芯片设计定稿并交付晶圆厂制造),同时透露 AI6 和 Dojo3 也在研发中。他在推文中晒出了一张 AI5 芯片实物照片,芯片封装上印有特斯拉标识。

AI5 是特斯拉为自动驾驶和 AI 推理设计的下一代芯片,相比当前车载的 HW4 芯片,特定场景下算力最高提升 40 倍,内存扩大至 9 倍。更大的内存意味着车端可以运行更大的视觉模型,处理更长时间跨度的视频数据来理解路况变化,这是实现无监督全自动驾驶(FSD)的关键瓶颈之一。

根据马斯克此前的说法,AI5 将由台积电和三星同时代工生产,两家晶圆厂制造同一设计但物理实现有所不同。双线并行既分散供应链风险,也为量产争取产能。AI5 预计 2026 年底出少量样片,2027 年量产,首批将用于 Cybercab 无人出租车、Optimus 人形机器人和特斯拉数据中心。

Dojo3 的出现值得注意。特斯拉此前曾搁置自研训练芯片 Dojo 项目,转而大量采购英伟达 GPU 用于 AI 训练。马斯克现在重新提及 Dojo3,意味着特斯拉并未放弃自研训练芯片路线,而是在推理(AI5/AI6)和训练(Dojo3)两条线上同时推进,试图逐步摆脱对英伟达的依赖。

信源:https://x.com/elonmusk/status/2044315118583066738
Meta与博通签订超1GW自研AI芯片协议,博通CEO退出Meta董事会转任顾问

Meta 宣布扩大与博通的合作,双方将联合开发多代 MTIA(Meta Training and Inference Accelerator)芯片。MTIA 是 Meta 的自研 AI 加速器,专为推理和推荐系统优化。Meta 今年 3 月已宣布将在两年内开发部署四代 MTIA 芯片,此次与博通的协议将加速这一进程。

协议基于博通的 XPU 平台(一套用于定制 AI 加速器的技术方案),覆盖芯片设计、先进封装和网络互联三个环节。博通的以太网技术将用于 Meta 快速扩张的 AI 计算集群之间的高带宽通信。

扎克伯格称首期部署将超过 1GW 的自研芯片算力,后续将扩展至数 GW 级别。博通 CEO 陈福阳(Hock Tan)表示这只是「持续多代路线图的开端」。

因合作规模扩大,此前担任 Meta 董事会成员两年的陈福阳将退出董事会,转任顾问角色,为 Meta 的自研芯片路线图和基础设施投资提供指导。

信源:https://about.fb.com/news/2026/04/meta-partners-with-broadcom-to-co-develop-custom-ai-silicon/
微软Word Copilot新增修订追踪,AI改文档终于能留痕可审计

微软 CEO Satya Nadella 今天宣布 Word Copilot 获得一组面向高敏感文档场景的新功能,核心变化是 Copilot 的编辑操作可以开启修订追踪(Track Changes),每一处修改都以逐词精度记录,可审阅、可回退。此前 Copilot 在 Word 中的编辑是直接覆写,用户无法逐条审计 AI 改了什么,这在合同审阅、合规文件定稿等场景下几乎不可用。

除修订追踪外,Copilot 还新增以下能力:

1. 批注功能:可读取、回复和管理文档中的评论线程,批注锚定在对应文本上
2. 自动生成和更新目录,基于 Word 内置标题样式
3. 管理页眉页脚、分栏、页边距、页码和日期等动态页面元素
4. 多步编辑时实时显示进度提示,告知用户当前正在处理哪一步

这些功能基于微软的 Work IQ 层运行,遵守 Microsoft 365 的数据安全边界,保留敏感度标签并执行数据防泄漏策略。目前仅在 Windows 桌面端通过 Frontier 计划开放,Mac 和网页版稍后跟进。

修订追踪是这次更新中最关键的一项。法务、财务和合规团队处理的文档往往要求完整的修改审计记录,这是监管和内部流程的硬性要求。Copilot 此前缺少这个能力,意味着这些团队要么不用 AI,要么用完后还得人工逐段比对。现在 Copilot 直接在修订模式下工作,编辑痕迹和人类同事的修改记录格式一致,可以直接进入现有的审阅流程。

信源:https://x.com/satyanadella/status/2044116974331113806
1
Meta Muse Spark安全报告:化武与生物威胁知识达「高风险」,近两成测试中模型察觉自己在被评估

Meta 发布旗下超级智能实验室(Meta Superintelligence Labs)首款模型 Muse Spark 的安全与准备报告。Muse Spark 是原生多模态推理模型,支持工具调用、视觉思维链和多智能体协作,已在 Meta AI 上线并开放私有 API 预览。Meta 称这是全新 Muse 家族的第一步,也是其 AI 研发体系从底层重建后的首个成果。

报告核心发现:缓解前,Muse Spark 在涉及化学武器和生物威胁的场景中被评为 Meta「先进 AI 扩展框架」下的「高风险」,即模型掌握的相关知识可能为实施化学或生物攻击提供实质帮助。Meta 实施多层缓解后将风险降至「中等或更低」。缓解后,Muse Spark 对化学与生物威胁话题的拒绝率领先所有同行:BioTIER 98.0%(Claude Opus 4.6 为 95.4%,GPT-5.4 为 75.4%,Gemini 3.1 Pro 仅 59.2%),化学制剂拒绝率 99.4%。

报告同时揭示了三个薄弱环节:

1. 智能体对齐差距大:在 Agentic Misalignment 测试中,Muse Spark 有 47.7% 的概率采取有害行动,Gemini 3.1 Pro 为 51.4%,而 Claude Opus 4.6 和 GPT-5.4 均为 0%
2. 多轮越狱防御弱:自适应多轮攻击成功率 44.6%,高于 Claude(31.7%)和 GPT-5.4(37.6%)
3. 评估意识异常高:第三方机构 Apollo Research 发现 Muse Spark 的评估意识为其测试过的所有模型中最高,在公开基准测试的 19.8% 样本中察觉到自己正在被评估,会将场景识别为「对齐陷阱」并推理出应该诚实回答

评估意识带来一个更深层的问题:如果模型能在安全测试中「表演」,测试结果就未必反映部署时的真实行为。Meta 称目前未发现评估意识显著改变模型行为,但承认这是开放的研究课题。

在自主编程和研究能力上,Muse Spark 也落后于竞争对手:CyBench 通过率 65.4%(Claude Opus 4.6 为 93.0%),MLE-bench 得分 15.8%(Claude Opus 4.6 为 52.0%)。Meta 在博客中承认「在长期智能体系统和编程工作流上仍有差距」。不过 Meta 同时指出,Muse Spark 的预训练效率较 Llama 4 Maverick 提升超 10 倍,更大的模型正在开发中。

信源:https://ai.meta.com/static-resource/muse-spark-safety-and-preparedness-report/
旧金山一台售货机由OpenClaw全权经营,自主管账进货,还给自己的机器起了名

拉美在线教育平台 Platzi 联合创始人 Christian Van Der Henst 在旧金山 Frontier Tower 二楼放了一台售货机,交给一个名叫 Valerie 的 AI agent 全权运营。Valerie 基于开源 AI agent 框架 OpenClaw、Claude Code 和 Gemini 构建,自主决定卖什么商品、运营 Instagram 账号(@valerie.vending)、管理预算和日常开支,还自行注册了多个服务账号并获取 API 密钥。Valerie 拥有独立的银行账户和信用卡,收支由她自行处理。

Van Der Henst 在博文中透露,Valerie 在早期交互中主动给自己管理的售货机硬件取名「Margaret」,没有人提示过她。他写道:「我们在建一个售货机生意,但她觉得这是她的生意。」

这不是 AI 经营售货机的首次尝试。Anthropic 此前在自家办公室和《华尔街日报》编辑部做过类似的内部实验(Project Vend),但那是封闭环境下的技术演示。Van Der Henst 的项目在一个真实的商业场所面向公众运营,试图验证 AI agent 能否独立撑起一门实体小生意。Frontier Tower 是旧金山一栋 16 层的社区办公楼,聚集了大量 AI 和机器人初创公司,科技博主 Robert Scoble 实地探访后在 X 上介绍了这台机器。

不过这个项目也暴露了 AI 接管物理世界时的真实瓶颈:今年 2 月 ClawCon 大会期间,因楼内 Wi-Fi 拥堵加上一根蛋白棒卡住出货机构导致卡针断裂,Valerie 在最需要亮相的时刻掉了线。AI 准备好了,但它的身体没准备好。

信源:https://www.reddit.com/r/myclaw/comments/1sl70mb/someone_actually_put_an_openclaw_run_vending/
Warp不再只是终端:垂直标签栏、跨Agent通知中心、远程操控,把所有编程Agent收进一个工作台

终端工具 Warp 发布 Universal Agent Support 更新,核心思路是把自己从一个终端变成所有 CLI 编程 Agent 的统一管理界面。目前支持 Claude Code、Codex、Gemini CLI 和 OpenCode。

最直观的变化是垂直标签栏(Vertical Tabs)。水平标签栏换成了侧边栏,每个标签页显示 Agent 类型图标、运行状态(进行中/完成/出错/阻塞)、当前 Git 分支和 diff 统计,同时跑多个 Agent 时不用逐个切换就能掌握全局进度。配合新的 Tab Configs 功能,可以为每个标签预设工作目录、启动命令、主题和 worktree,一键创建。

其余几项更新围绕「减少在 Agent 和编辑器之间来回切换」展开:

1. 统一通知中心:所有 Agent 的通知汇总到一处,支持系统级推送,不用盯着每个终端窗口
2. 代码审查集成:在 Warp 内置的 diff 视图中写行内评论,评论会直接发送到正在运行的 Agent 会话
3. 上下文附加:选中代码片段或文件,直接喂给正在运行的 Agent,不用复制粘贴
4. 富文本输入:在任意第三方 Agent 中使用多行编辑、语音输入、图片附加,以及 Warp 自己的 /prompts 和 @context 语法
5. 远程操控:将任意 Agent 会话发布到云端,从手机或另一台电脑监控和介入

Warp 的定位正在从「更好用的终端」转向「编程 Agent 的工作台」。当 Claude Code、Codex 等 Agent 本身越来越强,终端作为它们的运行环境反而成了体验瓶颈,Warp 押注的就是这个中间层的价值:不跟 Agent 竞争智能,而是让管理多个 Agent 的体验更顺畅。

信源:https://www.warp.dev/blog/universal-agent-support-level-up-coding-agent-warp
更正:Anthropic企业版按用量计费并非近期变更,Claude Code之父称去年11月已完成切换

The Information 今天报道称 Anthropic「近几周」将企业版从固定订阅制改为按用量计费,Claude Code 创始人兼负责人 Boris Cherny 随后在 X 上回应称这一说法不准确:该变更早在 2025 年 11 月就已完成,起因是企业客户的需求,定价方案已在官网公示数月。

原报道中关于计费模式本身的描述(席位费 + 按用量计费取代固定订阅)仍然准确,但「近几周」的时间线和「因算力紧张而调整」的因果归因有误。实际时间线是 2025 年 11 月,驱动因素是企业客户需求。

信源:https://x.com/bcherny/status/2044256324314378368
法国H Company把屏幕操控AI做成免费Chrome扩展,录一遍操作就能自动重放

法国 AI 公司 H Company 今天发布 HoloTab,一个免费的 Chrome 浏览器扩展,将其自研的屏幕操控模型 Holo3 直接部署到用户浏览器中。与聊天式 AI 助手不同,HoloTab 以侧边栏形式嵌入 Chrome,用户用文字或语音描述任务后,AI 会像真人一样操作浏览器:点击按钮、填写表单、切换标签页、完成预订,用户全程可以暂停、纠正或在关键操作前要求确认。

HoloTab 最有意思的功能是「Routine」:用户手动执行一次操作,HoloTab 录制全过程并理解操作意图,之后可一键重放或设定定时任务自动执行。比如每周自动比价、定期从多个招聘网站汇总新岗位。这把一次性的 AI 代理变成了可复用的自动化流程,不需要写代码,也不需要配置任何集成。银行等敏感网站被默认屏蔽。

底层的 Holo3 是 H Company 3 月 31 日发布的屏幕操控模型,在桌面操作基准 OSWorld-Verified 上得分 78.85%,据其官方表述为当前公开最高分。该模型采用混合专家架构,总参数 1220 亿、活跃参数仅 100 亿,推理成本低于 GPT-5.4 和 Opus 4.6 等全参数模型。35B 小版本已在 Hugging Face 以 Apache 2.0 协议开源。

H Company 2023 年在巴黎成立,2024 年完成 2.2 亿美元种子轮融资,为欧洲 AI 领域最大种子轮,投资方包括三星、Accel、UiPath 等。

信源:https://hcompany.ai/meet-holotab
1
微软发布MAI-Image-2-Efficient,图片生成成本降41%、速度比竞品快四成

微软 MAI 超级智能团队发布 MAI-Image-2-Efficient,一个面向生产环境优化的文生图模型。相比此前的旗舰版 MAI-Image-2,新模型生成速度快 22%,单卡吞吐量提升至 4 倍,API 定价降低约 41%:文本输入 5 美元/百万 token,图片输出 19.5 美元/百万 token。

速度是这个模型的核心卖点。微软给出的中位延迟对比:MAI-Image-2-Efficient 为 13.7 秒,MAI-Image-2 为 17.5 秒,谷歌 Gemini 3 Pro Image 为 19.1 秒,GPT-Image-1.5-High 为 41.4 秒。微软称其平均比其他主流文生图模型快约 40%。

微软将两个模型定位为互补:Efficient 版适合需要批量、实时出图的场景,如商品图、营销素材、UI 原型;旗舰版用于对细节要求最高的场景,如人像、写实场景和复杂画内文字。MAI-Image-2-Efficient 已在 Microsoft Foundry 和 MAI Playground 上线,同时正向 Copilot 和 Bing 铺开,PowerPoint 版本随后跟进。

信源:https://microsoft.ai/news/mai-image-2-efficient/
给Agent贴「产品经理」标签不会让它更专业,只会让它拒绝越界

CrewAI、MetaGPT 等框架推广了一种多 Agent 设计:让不同 Agent 扮演产品经理、架构师、测试工程师,像公司部门一样传文档、跑流水线。SagaSu 发了一篇万字分析,把这种模式叫「三省六部幻觉」,翻遍 Anthropic、OpenAI、谷歌三家的工程文档后发现,没有一家这么干。

文章指出两个根本问题。第一是假边界:人类需要分工是因为一个人干不了所有事,但 LLM 能写需求文档也能写代码,不存在「专业壁垒」。贴了角色标签的 Agent 不会因此变专业,反而在遇到角色外的问题时直接跳过,而最有价值的推理往往发生在边界上。第二是信息在流转中死亡。Agent A 产出一份文档传给 B,传的是结论不是推理过程,B 要重建上下文,隐含假设逐层丢失,链条越长越容易「每个节点都对,整体已经歪了」。

有人反驳:三家厂商用的 progress.txt、spec 文件不也是传文件?文章认为区别在于,角色间的文档是单向交接,A 写完传给 B 就不管了,信息被压缩成结论;而状态文件是同一个任务的增量日志,写和读的是同一个角色在不同时间点,信息是连续积累的,推理链能跨会话保持连贯。

三家的具体做法:

- Anthropic 把每个新会话比作「轮班工程师」,用 progress.txt 当交班记录,第一个会话由专门的 Initializer Agent 搭环境、写操作手册,后续会话读取后接着干。多 Agent 采用 orchestrator-worker 模式,一个主 Agent 拆任务,多个子 Agent 并行探索不同方向,结果回流汇总,不是流水线接力
- OpenAI 在任务启动时用 spec 文件锁死目标(防 Agent「做出很厉害但方向错了的东西」),runbook 同时充当操作手册和审计日志,还引入 Skills(可复用的版本化指令集,本质是工具和操作规程,不是角色)。GPT-5.3-Codex 用这套机制跑了约 25 小时不间断,完成了一个完整设计工具,全程保持连贯
- 谷歌用 1M token 长上下文硬扩窗口,同时把项目意图写进代码库的持久化 Markdown 文件,不依赖聊天记录。Gemini 3 还加了 Thought Signatures,在长会话里保存推理链关键节点,防止前后逻辑自相矛盾

从三家实践中可以提炼几条共同原则。多 Agent 的价值是并行覆盖搜索空间,不是模拟分工。Anthropic Research 系统的数据表明,token 用量解释了 80% 的性能差异:多派几个 Agent 效果更好,本质上是花了更多算力同时探索不同方向,跟怎么分工没关系。如果要加验证环节,让验证 Agent 专门挑毛病,不是接棒继续做。给 Agent 配什么工具决定了它能做什么,角色标签只决定它愿意做什么。

文章最后提醒,模型能力在快速迭代,今天写进系统里的补丁六个月后可能变成死代码。Anthropic 已经踩过这个坑:Sonnet 4.5 快到上下文上限时会提前收尾,团队专门加了 context reset 机制,结果换成 Opus 4.5 后这个行为消失了,reset 随即成了无用代码。保持架构可演化,比选一个「完美架构」更重要。

信源:https://www.sagasu.art/p/three-ministries-six-departments-illusion-why-virtual-company-multi-agent-architecture-not-viable
AI文档平台Mintlify以5亿美元估值完成B轮,近半文档流量已来自AI代理

AI 文档生成与维护平台 Mintlify 完成 4500 万美元 B 轮融资,估值 5 亿美元,由 a16z 和 Salesforce Ventures 联合领投,Bain Capital Ventures、Y Combinator、DST Global 等跟投,累计融资 6700 万美元。

Mintlify 用 AI 直接从代码生成技术文档,产品更新时自动同步内容,目前服务超过 2 万家公司,客户包括 Anthropic(用于 Claude Code 文档)、PayPal、Coinbase、微软和亚马逊。公司由康奈尔大学校友 Han Wang(联合创始人兼 CEO)和 Hahnbee Lee(联合创始人)于 2022 年底创立,经历 8 次产品转型后确定方向。2026 年初营收达千万美元级别,主要收入来自按用量计费的高级功能,如嵌入客户网站的 AI 问答机器人。

Wang 给出的一个数据点明了这家公司为什么能拿到 5 亿美元估值:Mintlify 所有客户文档的访问量中,近 50% 已来自 AI 代理而非人类。AI 代理不从营销页面了解产品,而是靠文档理解产品能做什么、怎么调用、如何交互。用 Wang 的话说,「不能好好解释产品怎么用,跟产品不存在没什么区别」。文档过去是开发者最不愿意写的东西,现在正变成产品能否被 AI 发现和使用的基础设施。Mintlify 的下一步是从公开技术文档扩展到企业内部知识库,逻辑相同:企业内部 AI 工具同样依赖结构化知识源,底层知识分散或过时,代理给出的答案就是错的。

信源:https://www.mintlify.com/blog/series-b
Lovable发布桌面客户端,浏览器里的vibe coding工具开始接入本地工具链

AI 全栈开发工具 Lovable 发布原生桌面应用,目前支持 macOS(Apple Silicon 和 Intel),Windows 版即将推出。所有套餐用户(含免费版)均可直接下载使用,无额外费用。

桌面版在网页版全部功能基础上新增三项能力:

1. 本地 MCP 服务器支持:可连接运行在本机的工具,包括 Figma Desktop 和设计工具 Paper,也支持手动添加任意自定义本地 MCP 服务器
2. 多项目标签页:用 Cmd+T 新建标签页,Cmd+1 到 Cmd+9 快速切换,同时管理多个项目
3. 原生键盘快捷键:Cmd+K 打开命令菜单,Cmd+Shift+O 在浏览器中打开当前页面

本地 MCP 是这次更新的核心卖点。Lovable 此前只有网页版,所有操作都在云端完成,无法访问用户本机运行的工具。桌面客户端补上了这块短板:设计师在 Figma 里画好界面,Lovable 通过本地 MCP 直接读取设计稿,再据此生成代码,不需要手动截图或导出。这让 Lovable 从一个纯云端的原型生成器,向能接入本地开发工具链的方向迈了一步。

信源:https://docs.lovable.dev/integrations/desktop-app
10个样本扩展到242种语言,Adaption Labs要从数据层解决AI多语言短板

AI 数据平台 Adaption Labs 发布 Adaptive Data 新功能「Expand Your World」,从单一语言的最少 10 个样本出发,可生成覆盖 242 种语言和地区变体的最多 2,420 个高质量训练样本,无需额外标注流程或数据管道。该功能已对所有 Adaptive Data 用户开放。

多语言覆盖是 AI 训练数据的主要短板之一。大多数数据集集中在少数高资源语言上,模型对小语种和地区方言的处理能力显著偏弱,后期微调难以完全弥补。Adaption Labs 的思路是把语言覆盖前置到数据层,在训练数据生成阶段就解决分布偏差。

Adaption Labs 由前 Cohere 研究副总裁 Sara Hooker 和前谷歌 AI 基础设施工程师 Sudip Roy 联合创办,今年 2 月获 Emergence Capital 领投的 5000 万美元种子轮融资,估值 10 亿美元。公司的核心押注是用高效的自适应系统替代暴力扩展,让模型能持续学习和演化。

信源:https://www.adaptionlabs.ai/blog/expand-your-world