Cursor多智能体三周优化235个英伟达GPU算子,最佳成绩逼近硬件极限
AI 编程工具 Cursor 披露其多智能体系统与英伟达的合作实验。该系统在 27 块 Blackwell B200 GPU 上自主运行三周,针对从 DeepSeek、Qwen、Gemma 等超过 124 个生产级开源模型中提取的 235 个真实算子优化问题,从零编写并优化 GPU 算子代码,整体实现 38% 的几何平均加速。
GPU 算子优化是软件工程中门槛最高的领域之一,要求工程师精通芯片架构、汇编级指令和内存调度,一个高性能算子通常需要资深专家数月甚至数年打磨。Cursor 的多智能体系统一次性处理全部 235 题:一个规划智能体分配任务并根据性能指标动态调度,多个工作智能体并行优化,系统自行调用英伟达的 SOL-ExecBench 基准测试管道形成「测试、调试、优化」自动循环,全程无人干预。系统分别用 CUDA C(含内联 PTX 汇编)和 CuTe DSL 两种语言各跑了一轮,前者测试最底层硬件推理能力,后者测试学习公开训练数据中几乎没有的新 API 的能力。
235 题中,系统在 149 题(63%)上超越基线,其中 45 题(19%)加速超过 2 倍。三个代表性结果:
1. BF16 分组查询注意力(提取自 Llama 3.1 8B 推理场景):较人工优化的 FlashInfer 库快 84%,SOL 得分 0.9722,接近硬件理论极限(满分 1.0)
2. BF16 矩阵乘法:从零生成的算子达到英伟达 cuBLAS 手工调优性能的 86%,在 LLM 推理解码常用的小 M 场景下反超基线最多 9%
3. NVFP4 混合专家层线性运算(提取自 Qwen3 等 MoE 模型):系统自主识别 4 位浮点量化瓶颈并做针对性融合优化,加速 39%
Cursor 坦承整体中位 SOL 得分仅 0.56,仍有大幅提升空间,主因是 GPU 资源有限(235 题共用 27 块 GPU)。Cursor 称这些多智能体技术「将很快融入核心产品」。一家 IDE 公司的 AI 智能体已经能在汇编级别的 GPU 优化上逼近人类顶尖专家,这比「帮你写应用代码」的故事大得多。
信源:https://cursor.com/blog/multi-agent-kernels
AI 编程工具 Cursor 披露其多智能体系统与英伟达的合作实验。该系统在 27 块 Blackwell B200 GPU 上自主运行三周,针对从 DeepSeek、Qwen、Gemma 等超过 124 个生产级开源模型中提取的 235 个真实算子优化问题,从零编写并优化 GPU 算子代码,整体实现 38% 的几何平均加速。
GPU 算子优化是软件工程中门槛最高的领域之一,要求工程师精通芯片架构、汇编级指令和内存调度,一个高性能算子通常需要资深专家数月甚至数年打磨。Cursor 的多智能体系统一次性处理全部 235 题:一个规划智能体分配任务并根据性能指标动态调度,多个工作智能体并行优化,系统自行调用英伟达的 SOL-ExecBench 基准测试管道形成「测试、调试、优化」自动循环,全程无人干预。系统分别用 CUDA C(含内联 PTX 汇编)和 CuTe DSL 两种语言各跑了一轮,前者测试最底层硬件推理能力,后者测试学习公开训练数据中几乎没有的新 API 的能力。
235 题中,系统在 149 题(63%)上超越基线,其中 45 题(19%)加速超过 2 倍。三个代表性结果:
1. BF16 分组查询注意力(提取自 Llama 3.1 8B 推理场景):较人工优化的 FlashInfer 库快 84%,SOL 得分 0.9722,接近硬件理论极限(满分 1.0)
2. BF16 矩阵乘法:从零生成的算子达到英伟达 cuBLAS 手工调优性能的 86%,在 LLM 推理解码常用的小 M 场景下反超基线最多 9%
3. NVFP4 混合专家层线性运算(提取自 Qwen3 等 MoE 模型):系统自主识别 4 位浮点量化瓶颈并做针对性融合优化,加速 39%
Cursor 坦承整体中位 SOL 得分仅 0.56,仍有大幅提升空间,主因是 GPU 资源有限(235 题共用 27 块 GPU)。Cursor 称这些多智能体技术「将很快融入核心产品」。一家 IDE 公司的 AI 智能体已经能在汇编级别的 GPU 优化上逼近人类顶尖专家,这比「帮你写应用代码」的故事大得多。
信源:https://cursor.com/blog/multi-agent-kernels
Cursor
Speeding up GPU kernels by 38% with a multi-agent system · Cursor
Our multi-agent system autonomously optimized 235 CUDA kernels for NVIDIA Blackwell 200 GPUs, achieving a 38% geomean speedup over baselines in just 3 weeks.
CMU教授开源Agent框架Motus,多模型编排SWE-bench跑到79%且成本减半
卡内基梅隆大学计算机科学系教授 Dimitrios Skarlatos(CEO)和 Zhihao Jia(CTO)创办的 AI 基础设施公司 Lithos AI 开源了 Agent 服务框架 Motus,Apache 2.0 许可证。团队由 CMU 和斯坦福研究人员组成,成员有 AWS、谷歌、Meta 和英伟达的生产基础设施经验。
Motus 的核心思路:不同任务适合不同模型,与其始终用最贵的前沿模型跑所有步骤,不如让系统从生产运行的轨迹中学习,自动把不同子任务路由到最合适的模型。当前 Agent 部署后是静态的,提示框架、模型和上下文策略固定不变,Motus 则从每次运行中提取任务成功率、延迟和成本信号,持续优化。
据 Lithos AI 官网数据,在 SWE-bench Verified 上,Motus 多模型编排达到 79% 准确率,高于 Claude Opus 4.6 的 75.8% 和 GPT-5.3-Codex 的 72.6%,成本不到单用 Opus 的一半。在 Terminal-Bench 2.0 上,准确率从 Opus 的 64% 提至 80.1%,成本同样约减半。框架还会根据具体工作负载调整上下文记忆策略,并自动检测可并行执行的步骤来降低延迟。
Motus 不绑定模型提供商,支持 OpenAI Agents SDK、Anthropic SDK、Google ADK 及纯 Python 构建的 Agent,提供 Claude Code、Codex 和 Cursor 插件,一条命令本地部署或推送至云端。早期预览阶段免费提供算力。
信源:https://github.com/lithos-ai/motus
卡内基梅隆大学计算机科学系教授 Dimitrios Skarlatos(CEO)和 Zhihao Jia(CTO)创办的 AI 基础设施公司 Lithos AI 开源了 Agent 服务框架 Motus,Apache 2.0 许可证。团队由 CMU 和斯坦福研究人员组成,成员有 AWS、谷歌、Meta 和英伟达的生产基础设施经验。
Motus 的核心思路:不同任务适合不同模型,与其始终用最贵的前沿模型跑所有步骤,不如让系统从生产运行的轨迹中学习,自动把不同子任务路由到最合适的模型。当前 Agent 部署后是静态的,提示框架、模型和上下文策略固定不变,Motus 则从每次运行中提取任务成功率、延迟和成本信号,持续优化。
据 Lithos AI 官网数据,在 SWE-bench Verified 上,Motus 多模型编排达到 79% 准确率,高于 Claude Opus 4.6 的 75.8% 和 GPT-5.3-Codex 的 72.6%,成本不到单用 Opus 的一半。在 Terminal-Bench 2.0 上,准确率从 Opus 的 64% 提至 80.1%,成本同样约减半。框架还会根据具体工作负载调整上下文记忆策略,并自动检测可并行执行的步骤来降低延迟。
Motus 不绑定模型提供商,支持 OpenAI Agents SDK、Anthropic SDK、Google ADK 及纯 Python 构建的 Agent,提供 Claude Code、Codex 和 Cursor 插件,一条命令本地部署或推送至云端。早期预览阶段免费提供算力。
信源:https://github.com/lithos-ai/motus
GitHub
GitHub - lithos-ai/motus: The open-source agent-serving project
The open-source agent-serving project. Contribute to lithos-ai/motus development by creating an account on GitHub.
EvoMap逐模块举证指控Hermes Agent架构抄袭,Nous Research只回了句「删号」
AI Agent 自进化引擎 Evolver 的开发团队 EvoMap 于 4 月 14 日发布一篇技术对比文章,指控 Nous Research 旗下开源项目 Hermes Agent 在架构层面系统性复制了 Evolver 的设计,且在全部公开材料中未做任何引用。Hermes Agent 目前拥有 8.8 万 GitHub Star,Evolver 约 2000。Nous Research 创始人 Teknium 在 X 上回应称「从来没听说过这个人和这个项目」,认为对比文章「完全没脑子」。Nous Research 官方账号的回应更为简短:「我们的仓库 2025 年 7 月就建了。我们是 YaRN 等现代 Agent 框架底层技术的先驱。删掉你的账号。」
EvoMap 的文章逐模块列举了十余处架构对应:
1. 三层记忆系统(持久事实 + 程序性知识 + 历史搜索),每层功能角色精确对应
2. 任务完成后自动提取可复用经验资产的闭环(Evolver 称 Gene/Capsule,Hermes 称 SKILL.md)
3. 周期性反思机制(Evolver 每 5 个进化周期触发,Hermes 每 15 次工具调用触发)
4. 运行时技能发现与按需加载
5. 10 步编排的进化循环
6. 多维加权评分、约束门控、原子写入等工程模式
时间线上,Evolver 的核心协议 GEP 于 2 月 1-16 日全部公开,累计 136 次发版。Hermes 的技能系统 3 月 12 日才发布(v0.2.0),自进化仓库 3 月 9 日才创建,间隔 24-39 天。
但文章也列出了对 Hermes 有利的事实:Hermes Agent 仓库创建于 2025 年 7 月,早于 Evolver 半年,只是一直私有至 2 月底才公开;Hermes 的自进化模块使用斯坦福/伯克利的学术框架 GEPA(ICLR 2026 Oral),与 GEP 无关;Anthropic 2025 年 12 月发布的 Agent Skills 标准早于两者。两项目语言不同(JavaScript vs Python),未发现代码级复制。
单看任何一个维度,独立趋同都完全可能:三层记忆、经验提取、周期反思在 AI Agent 领域已有广泛讨论。EvoMap 的论点建立在「十余个维度同时对应超出巧合范围」的概率推理上,这种论证有力但不具备排他性。Teknium 选择否认知情而非回应技术细节,也没有给出更多解释。这场争论短期内不太可能有定论,但它反映了一个持续存在的问题:在影响力悬殊的开源项目之间,较小一方要主张架构层面的优先性,无论举证还是传播都极为困难。
信源:https://x.com/Teknium/status/2044344547334062510
AI Agent 自进化引擎 Evolver 的开发团队 EvoMap 于 4 月 14 日发布一篇技术对比文章,指控 Nous Research 旗下开源项目 Hermes Agent 在架构层面系统性复制了 Evolver 的设计,且在全部公开材料中未做任何引用。Hermes Agent 目前拥有 8.8 万 GitHub Star,Evolver 约 2000。Nous Research 创始人 Teknium 在 X 上回应称「从来没听说过这个人和这个项目」,认为对比文章「完全没脑子」。Nous Research 官方账号的回应更为简短:「我们的仓库 2025 年 7 月就建了。我们是 YaRN 等现代 Agent 框架底层技术的先驱。删掉你的账号。」
EvoMap 的文章逐模块列举了十余处架构对应:
1. 三层记忆系统(持久事实 + 程序性知识 + 历史搜索),每层功能角色精确对应
2. 任务完成后自动提取可复用经验资产的闭环(Evolver 称 Gene/Capsule,Hermes 称 SKILL.md)
3. 周期性反思机制(Evolver 每 5 个进化周期触发,Hermes 每 15 次工具调用触发)
4. 运行时技能发现与按需加载
5. 10 步编排的进化循环
6. 多维加权评分、约束门控、原子写入等工程模式
时间线上,Evolver 的核心协议 GEP 于 2 月 1-16 日全部公开,累计 136 次发版。Hermes 的技能系统 3 月 12 日才发布(v0.2.0),自进化仓库 3 月 9 日才创建,间隔 24-39 天。
但文章也列出了对 Hermes 有利的事实:Hermes Agent 仓库创建于 2025 年 7 月,早于 Evolver 半年,只是一直私有至 2 月底才公开;Hermes 的自进化模块使用斯坦福/伯克利的学术框架 GEPA(ICLR 2026 Oral),与 GEP 无关;Anthropic 2025 年 12 月发布的 Agent Skills 标准早于两者。两项目语言不同(JavaScript vs Python),未发现代码级复制。
单看任何一个维度,独立趋同都完全可能:三层记忆、经验提取、周期反思在 AI Agent 领域已有广泛讨论。EvoMap 的论点建立在「十余个维度同时对应超出巧合范围」的概率推理上,这种论证有力但不具备排他性。Teknium 选择否认知情而非回应技术细节,也没有给出更多解释。这场争论短期内不太可能有定论,但它反映了一个持续存在的问题:在影响力悬殊的开源项目之间,较小一方要主张架构层面的优先性,无论举证还是传播都极为困难。
信源:https://x.com/Teknium/status/2044344547334062510
X (formerly Twitter)
Teknium 🪽 (@Teknium) on X
I have literally never heard of this person, their project, or anything they are doing in my life. Today is the first time I've ever heard of or seen this project at all.
To claim without evidence that I took their work is a lie.
Their article comparing…
To claim without evidence that I took their work is a lie.
Their article comparing…
OpenClaw维护者回应负面攻击:我们不帮人拉盘,开源的中立方反遭抹黑
OpenClaw 官方维护者 Onur Solmaz 针对近期围绕该开源 AI 代理项目的负面言论作出强硬回应。他直言 OpenClaw 之所以频遭攻击,根源在于其「不帮任何人拉盘」的公益属性——与市场上其他追求盈利的 AI 代理产品不同,OpenClaw 在行业和地缘政治上始终保持中立第三方立场,「其他公司只有在我们失败时才能赚钱,所以才拼命抹黑」。Solmaz 称,项目创始人 Peter Steinberger 是成功退出创业者,不为投资人赚取回报,纯粹出于「玩得开心 + 民主化 AI」的初衷发起该项目,这也正是社区喜爱 OpenClaw 的原因。
针对具体指控,Solmaz 逐一反驳:
关于臃肿一说,团队从 3 月初便启动核心瘦身计划,将功能模块拆分为插件 SDK 架构,插件多不等于臃肿,这套做法已被同行抄走;
关于不安全的质疑,Solmaz 反指 OpenClaw 因被最多人审视,安全问题一旦发现即被迅速修复,在被狂喷的压力下反而淬炼成最安全的 AI 代理;
至于被 OpenAI 收购的传闻,Solmaz 调侃道「我的银行账户还是空的啊兄弟」,并强调所有维护者均为无偿贡献,白天全职工作、夜晚双倍加班维护项目。
最终 Solmaz 以「人民的 AI」定义 OpenClaw,呼吁社区直接使用代码、积极贡献,成为维护者,共同书写开源 AI 历史。
信源:https://x.com/onusoz/status/2044337339518828727?s=46
OpenClaw 官方维护者 Onur Solmaz 针对近期围绕该开源 AI 代理项目的负面言论作出强硬回应。他直言 OpenClaw 之所以频遭攻击,根源在于其「不帮任何人拉盘」的公益属性——与市场上其他追求盈利的 AI 代理产品不同,OpenClaw 在行业和地缘政治上始终保持中立第三方立场,「其他公司只有在我们失败时才能赚钱,所以才拼命抹黑」。Solmaz 称,项目创始人 Peter Steinberger 是成功退出创业者,不为投资人赚取回报,纯粹出于「玩得开心 + 民主化 AI」的初衷发起该项目,这也正是社区喜爱 OpenClaw 的原因。
针对具体指控,Solmaz 逐一反驳:
关于臃肿一说,团队从 3 月初便启动核心瘦身计划,将功能模块拆分为插件 SDK 架构,插件多不等于臃肿,这套做法已被同行抄走;
关于不安全的质疑,Solmaz 反指 OpenClaw 因被最多人审视,安全问题一旦发现即被迅速修复,在被狂喷的压力下反而淬炼成最安全的 AI 代理;
至于被 OpenAI 收购的传闻,Solmaz 调侃道「我的银行账户还是空的啊兄弟」,并强调所有维护者均为无偿贡献,白天全职工作、夜晚双倍加班维护项目。
最终 Solmaz 以「人民的 AI」定义 OpenClaw,呼吁社区直接使用代码、积极贡献,成为维护者,共同书写开源 AI 历史。
信源:https://x.com/onusoz/status/2044337339518828727?s=46
X (formerly Twitter)
Onur Solmaz (@onusoz) on X
You need to understand one fact about OpenClaw
People are biased and incentivized to spread disinformation about OpenClaw. That is because OpenClaw IS NOT PUMPING ANYONE’S BAGS, unlike most other projects
Literally every other for-profit agent product is…
People are biased and incentivized to spread disinformation about OpenClaw. That is because OpenClaw IS NOT PUMPING ANYONE’S BAGS, unlike most other projects
Literally every other for-profit agent product is…
谷歌Gemini Mac原生应用正式上线,Option+Space随时唤起,可读取当前屏幕内容
谷歌正式发布 Gemini macOS 原生应用,免费面向全球所有 Gemini 用户开放,需 macOS Sequoia(15.0)及以上版本,仅支持 Apple Silicon 芯片。此前 3 月下旬 Bloomberg 曾报道该应用进入小范围内测。
核心功能是屏幕共享:用户可将任意窗口共享给 Gemini,获取基于当前屏幕内容的上下文回答,包括本地文件。按 Option + Space 可从任意界面直接唤起 Gemini 迷你对话框,无需切换窗口。应用还集成了图片生成(Nano Banana)和视频生成(Veo)。
ChatGPT 和 Claude 的 Mac 客户端已上线近两年,谷歌是三家主要 AI 公司中最后推出桌面端的。谷歌在博客中称这只是「起步」,正在打造「真正个性化、主动且强大的桌面助手」,更多功能将在未来几个月公布。对用户而言,三家产品现在都能在桌面端随时唤起,竞争焦点将转向谁能更深地融入操作系统工作流。
信源:https://blog.google/innovation-and-ai/products/gemini-app/gemini-app-now-on-mac-os/
谷歌正式发布 Gemini macOS 原生应用,免费面向全球所有 Gemini 用户开放,需 macOS Sequoia(15.0)及以上版本,仅支持 Apple Silicon 芯片。此前 3 月下旬 Bloomberg 曾报道该应用进入小范围内测。
核心功能是屏幕共享:用户可将任意窗口共享给 Gemini,获取基于当前屏幕内容的上下文回答,包括本地文件。按 Option + Space 可从任意界面直接唤起 Gemini 迷你对话框,无需切换窗口。应用还集成了图片生成(Nano Banana)和视频生成(Veo)。
ChatGPT 和 Claude 的 Mac 客户端已上线近两年,谷歌是三家主要 AI 公司中最后推出桌面端的。谷歌在博客中称这只是「起步」,正在打造「真正个性化、主动且强大的桌面助手」,更多功能将在未来几个月公布。对用户而言,三家产品现在都能在桌面端随时唤起,竞争焦点将转向谁能更深地融入操作系统工作流。
信源:https://blog.google/innovation-and-ai/products/gemini-app/gemini-app-now-on-mac-os/
OpenAI Agents SDK更新,代理可在沙箱中操作文件和运行代码
OpenAI 发布 Agents SDK 重大更新,核心变化是给代理一个真正的工作环境:代理现在可以在受控沙箱中读写文件、安装依赖、运行代码和调用工具,而非仅限于对话。
SDK 的代理执行框架(harness)新增可配置记忆、沙箱感知编排,以及与 Codex 同源的文件系统工具(shell 命令执行和 apply patch 代码编辑)。框架同时集成了多个正在成为行业标准的代理协议:MCP 工具调用、AGENTS.md 自定义指令、Skills 渐进式能力声明。开发者不再需要自行拼装这些基础设施。
沙箱执行是此次更新的另一重点。SDK 内置对 7 家沙箱提供商的支持:Blaxel、Cloudflare、Daytona、E2B、Modal、Runloop 和 Vercel,开发者也可接入自有沙箱。新引入的 Manifest 抽象统一描述代理的工作空间,可挂载本地文件、定义输出目录,并对接 AWS S3、Google Cloud Storage、Azure Blob Storage 和 Cloudflare R2 等存储服务,从本地原型到生产部署使用同一套配置。
架构上,SDK 将代理调度逻辑与计算环境分离。好处有三:凭证不会进入模型生成代码的执行环境,降低提示注入和数据外泄风险;代理状态外部化后支持快照和恢复,沙箱容器崩溃不会丢失进度;多个子代理可并行在不同容器中执行任务。
新功能已面向所有 API 用户开放,按标准 token 和工具调用计费。目前仅支持 Python,TypeScript 版本将在后续发布。
信源:https://openai.com/index/the-next-evolution-of-the-agents-sdk/
OpenAI 发布 Agents SDK 重大更新,核心变化是给代理一个真正的工作环境:代理现在可以在受控沙箱中读写文件、安装依赖、运行代码和调用工具,而非仅限于对话。
SDK 的代理执行框架(harness)新增可配置记忆、沙箱感知编排,以及与 Codex 同源的文件系统工具(shell 命令执行和 apply patch 代码编辑)。框架同时集成了多个正在成为行业标准的代理协议:MCP 工具调用、AGENTS.md 自定义指令、Skills 渐进式能力声明。开发者不再需要自行拼装这些基础设施。
沙箱执行是此次更新的另一重点。SDK 内置对 7 家沙箱提供商的支持:Blaxel、Cloudflare、Daytona、E2B、Modal、Runloop 和 Vercel,开发者也可接入自有沙箱。新引入的 Manifest 抽象统一描述代理的工作空间,可挂载本地文件、定义输出目录,并对接 AWS S3、Google Cloud Storage、Azure Blob Storage 和 Cloudflare R2 等存储服务,从本地原型到生产部署使用同一套配置。
架构上,SDK 将代理调度逻辑与计算环境分离。好处有三:凭证不会进入模型生成代码的执行环境,降低提示注入和数据外泄风险;代理状态外部化后支持快照和恢复,沙箱容器崩溃不会丢失进度;多个子代理可并行在不同容器中执行任务。
新功能已面向所有 API 用户开放,按标准 token 和工具调用计费。目前仅支持 Python,TypeScript 版本将在后续发布。
信源:https://openai.com/index/the-next-evolution-of-the-agents-sdk/
OpenAI
The next evolution of the Agents SDK
OpenAI updates the Agents SDK with native sandbox execution and a model-native harness, helping developers build secure, long-running agents across files and tools.
英伟达开源Lyra 2.0,一张照片生成可走动的3D世界,直接导入机器人仿真器
英伟达发布 Lyra 2.0,一个从单张图片生成可探索 3D 世界的开源框架。用户给一张照片,Lyra 2.0 先生成受镜头轨迹控制的漫游视频,再将视频重建为 3D 高斯溅射(Gaussian Splats)和网格模型,可直接导入游戏引擎和仿真器实时渲染。模型权重和代码以 Apache 2.0 许可证在 Hugging Face 和 GitHub 开源,允许商用。
核心技术突破在于解决长距离漫游的两个退化问题。第一个是「空间遗忘」:当镜头走远后再折返,此前看过的区域已超出模型的时间窗口,模型只能凭空生成,导致场景前后不一致。Lyra 2.0 为每一帧维护 3D 几何信息,折返时检索相关历史帧并建立密集对应关系,让模型「记住」之前看过的东西。第二个是「时间漂移」:自回归生成逐帧累积误差,场景逐渐变形。Lyra 2.0 用自增强训练让模型在训练阶段就接触自身的退化输出,学会纠错而非传播错误。底层基于万影 Wan 2.1-14B 扩散 Transformer,输出分辨率 832×480。
对开发者和研究者而言,最直接的应用场景是机器人仿真。英伟达在演示中将 Lyra 2.0 生成的 3D 场景导入自家物理仿真器 Isaac Sim,机器人可在其中导航和交互。此前训练具身智能(embodied AI)的一大瓶颈是 3D 环境制作成本高、种类有限,Lyra 2.0 提供了一条从照片批量生成训练环境的路径。去年 9 月发布的 Lyra 1.0 仅支持短距离生成,2.0 版将其扩展到长距离持续探索。谷歌此前发布的 Genie 3 具备类似能力但未开源,Lyra 2.0 是目前该方向最完整的开源方案。
信源:https://research.nvidia.com/labs/sil/projects/lyra2/
英伟达发布 Lyra 2.0,一个从单张图片生成可探索 3D 世界的开源框架。用户给一张照片,Lyra 2.0 先生成受镜头轨迹控制的漫游视频,再将视频重建为 3D 高斯溅射(Gaussian Splats)和网格模型,可直接导入游戏引擎和仿真器实时渲染。模型权重和代码以 Apache 2.0 许可证在 Hugging Face 和 GitHub 开源,允许商用。
核心技术突破在于解决长距离漫游的两个退化问题。第一个是「空间遗忘」:当镜头走远后再折返,此前看过的区域已超出模型的时间窗口,模型只能凭空生成,导致场景前后不一致。Lyra 2.0 为每一帧维护 3D 几何信息,折返时检索相关历史帧并建立密集对应关系,让模型「记住」之前看过的东西。第二个是「时间漂移」:自回归生成逐帧累积误差,场景逐渐变形。Lyra 2.0 用自增强训练让模型在训练阶段就接触自身的退化输出,学会纠错而非传播错误。底层基于万影 Wan 2.1-14B 扩散 Transformer,输出分辨率 832×480。
对开发者和研究者而言,最直接的应用场景是机器人仿真。英伟达在演示中将 Lyra 2.0 生成的 3D 场景导入自家物理仿真器 Isaac Sim,机器人可在其中导航和交互。此前训练具身智能(embodied AI)的一大瓶颈是 3D 环境制作成本高、种类有限,Lyra 2.0 提供了一条从照片批量生成训练环境的路径。去年 9 月发布的 Lyra 1.0 仅支持短距离生成,2.0 版将其扩展到长距离持续探索。谷歌此前发布的 Genie 3 具备类似能力但未开源,Lyra 2.0 是目前该方向最完整的开源方案。
信源:https://research.nvidia.com/labs/sil/projects/lyra2/
❤1
谷歌发布Gemini 3.1 Flash TTS,开发者可像导演一样用自然语言指挥AI怎么说话
谷歌发布新一代文本转语音模型 Gemini 3.1 Flash TTS,核心卖点不是「更像真人」,而是开发者可以精确控制 AI 语音的风格、语速和情绪表达。模型已通过 Gemini API、Google AI Studio(开发者预览)、Vertex AI(企业预览)和 Google Vids(Workspace 用户)上线。
这套控制能力的关键是「audio tags」(音频标签):开发者在输入文本中嵌入自然语言指令,就能调整 AI 语音的语调、节奏和口音,甚至在一句话中间切换表达风格。谷歌在 Google AI Studio 中提供了一套「导演椅」式的配置界面,包含三层控制:
1. 场景指导:设定环境和对话指令,让角色在多轮对话中保持一致性格
2. 角色级调参:为每个角色分配独立的音频配置,单独控制语速、语调和口音
3. 一键导出:调好的参数可直接导出为 Gemini API 代码,在不同项目和平台上复用
在第三方评测机构 Artificial Analysis 的 TTS 排行榜上,Gemini 3.1 Flash TTS 以 1211 分的 Elo 评分登顶,该排行榜基于数千次人类盲听偏好测试。Artificial Analysis 同时将其列入「最具吸引力象限」,即语音质量高且成本低。模型支持 70 多种语言和原生多角色对话,所有生成音频均内嵌 SynthID 水印用于 AI 内容识别。
对开发者来说,这意味着 TTS 从一个「把文字读出来」的工具变成了一个可编程的语音表演引擎。过去要做有情感的 AI 语音,要么靠后期处理,要么靠 SSML 标记语言逐字标注,现在用一句自然语言就能搞定。结合一键导出功能,同一套语音风格可以跨产品线复用,这对需要统一品牌声音的企业尤其实用。
信源:https://blog.google/innovation-and-ai/models-and-research/gemini-models/gemini-3-1-flash-tts/
谷歌发布新一代文本转语音模型 Gemini 3.1 Flash TTS,核心卖点不是「更像真人」,而是开发者可以精确控制 AI 语音的风格、语速和情绪表达。模型已通过 Gemini API、Google AI Studio(开发者预览)、Vertex AI(企业预览)和 Google Vids(Workspace 用户)上线。
这套控制能力的关键是「audio tags」(音频标签):开发者在输入文本中嵌入自然语言指令,就能调整 AI 语音的语调、节奏和口音,甚至在一句话中间切换表达风格。谷歌在 Google AI Studio 中提供了一套「导演椅」式的配置界面,包含三层控制:
1. 场景指导:设定环境和对话指令,让角色在多轮对话中保持一致性格
2. 角色级调参:为每个角色分配独立的音频配置,单独控制语速、语调和口音
3. 一键导出:调好的参数可直接导出为 Gemini API 代码,在不同项目和平台上复用
在第三方评测机构 Artificial Analysis 的 TTS 排行榜上,Gemini 3.1 Flash TTS 以 1211 分的 Elo 评分登顶,该排行榜基于数千次人类盲听偏好测试。Artificial Analysis 同时将其列入「最具吸引力象限」,即语音质量高且成本低。模型支持 70 多种语言和原生多角色对话,所有生成音频均内嵌 SynthID 水印用于 AI 内容识别。
对开发者来说,这意味着 TTS 从一个「把文字读出来」的工具变成了一个可编程的语音表演引擎。过去要做有情感的 AI 语音,要么靠后期处理,要么靠 SSML 标记语言逐字标注,现在用一句自然语言就能搞定。结合一键导出功能,同一套语音风格可以跨产品线复用,这对需要统一品牌声音的企业尤其实用。
信源:https://blog.google/innovation-and-ai/models-and-research/gemini-models/gemini-3-1-flash-tts/
Google
Gemini 3.1 Flash TTS: the next generation of expressive AI speech
Gemini 3.1 Flash TTS is now available across Google products.
❤2
OpenClaw贡献者:把AI工作流建在Claude Cowork上,就是选择当十年「租户」
开源 AI Agent 框架 OpenClaw 贡献者 Onur Solmaz 在 X 上发帖,以 Anthropic 刚转正式版的 Claude Cowork 为例,论证企业不应将 AI 工作流建在专有平台之上。
核心论点是基础设施的粘性效应:企业一旦围绕某个专有产品搭建工作流,迁移成本会随时间急剧上升,如同企业锁定 AWS 后难以切换到 Hetzner,最终沦为「租户」,被平台方「在未来 10 年尽可能地榨取」。
Solmaz 算了一笔账:同时订阅 OpenAI 和 Anthropic 的 Pro 或 Max 计划,每年花费 2400 至 4800 美元,且这些订阅目前可能以亏损定价,未来大概率涨价。而华硕今年发布的桌面 AI 超算 Ascent GX10 搭载英伟达 GB10 Grace Blackwell 处理器,支持运行最高 2000 亿参数模型,一次性购入后可用多年。他承认开源模型编程能力尚不及闭源,但认为许多场景已够用,「已经有不少人开始为此购买 GPU」。相比之下,OpenClaw 等开源框架允许企业随时更换模型供应商或切换到本地硬件,不受单一平台制约。
Anthropic 上周将 Claude Cowork 从预览转为正式版,面向全部付费用户开放,新增角色权限控制、用量分析等企业功能。OpenClaw 在 GitHub 上已积累超 35 万星。专有 AI Agent 平台加速向企业渗透的同时,开源替代方案也在快速成熟,两条路线的竞争正在进入正面交锋。
信源:https://x.com/onusoz/status/2044457293069062530
开源 AI Agent 框架 OpenClaw 贡献者 Onur Solmaz 在 X 上发帖,以 Anthropic 刚转正式版的 Claude Cowork 为例,论证企业不应将 AI 工作流建在专有平台之上。
核心论点是基础设施的粘性效应:企业一旦围绕某个专有产品搭建工作流,迁移成本会随时间急剧上升,如同企业锁定 AWS 后难以切换到 Hetzner,最终沦为「租户」,被平台方「在未来 10 年尽可能地榨取」。
Solmaz 算了一笔账:同时订阅 OpenAI 和 Anthropic 的 Pro 或 Max 计划,每年花费 2400 至 4800 美元,且这些订阅目前可能以亏损定价,未来大概率涨价。而华硕今年发布的桌面 AI 超算 Ascent GX10 搭载英伟达 GB10 Grace Blackwell 处理器,支持运行最高 2000 亿参数模型,一次性购入后可用多年。他承认开源模型编程能力尚不及闭源,但认为许多场景已够用,「已经有不少人开始为此购买 GPU」。相比之下,OpenClaw 等开源框架允许企业随时更换模型供应商或切换到本地硬件,不受单一平台制约。
Anthropic 上周将 Claude Cowork 从预览转为正式版,面向全部付费用户开放,新增角色权限控制、用量分析等企业功能。OpenClaw 在 GitHub 上已积累超 35 万星。专有 AI Agent 平台加速向企业渗透的同时,开源替代方案也在快速成熟,两条路线的竞争正在进入正面交锋。
信源:https://x.com/onusoz/status/2044457293069062530
X (formerly Twitter)
Onur Solmaz (@onusoz) on X
When you build your company's workflows around Claude Cowork, you are betting against local models and owning your infra, and inviting your company to long-term exploitation
If I were Anthropic or OpenAI, I would be the most scared of local AI proliferating…
If I were Anthropic or OpenAI, I would be the most scared of local AI proliferating…
OpenRouter上线视频生成API,一个接口调用Sora 2、Veo 3.1、Seedance等主流模型
AI 模型聚合平台 OpenRouter 正式上线视频生成 API,首批支持文生视频和图生视频,接入 Seedance 2.0/1.5、Veo 3.1、Wan 2.7/2.6 和 Sora 2 Pro,后续将继续扩充。
视频生成领域的 API 碎片化比文本模型严重得多:各家请求格式不同、参数命名不同、计费单位不同,甚至同一模型家族的不同能力(文生视频、图生视频、参考角色生成)往往对应不同端点。OpenRouter 的做法是在上层建一套统一 schema,根据请求参数自动路由到正确端点。附带了图片就走图生视频,指定了参考角色就走角色一致性端点,开发者不需要关心底层差异。
参数归一化也覆盖了容易踩坑的细节。比如 Veo 3.1 支持 4、6、8 秒片段,Wan 2.6 支持 5 或 10 秒,传错时长直接报错。OpenRouter 提供模型能力查询端点 `/api/v1/videos/models`,返回每个模型支持的分辨率、时长、宽高比、定价和模型特有参数,开发者或编程代理调用前查一次就能避免试错。由于视频生成耗时以分钟计,API 采用异步模式:提交提示词后返回任务 ID,完成后取回视频。
OpenRouter 同时开源了一个多模态工作流演示应用,展示 LLM 生成详细提示词、图像模型生成角色、视频模型生成场景的串联流程。这也是视频生成接入统一路由后最直接的价值:开发者在同一个 API 下组合文本、图像和视频模型,不用分别对接各家 SDK。
信源:https://openrouter.ai/announcements
AI 模型聚合平台 OpenRouter 正式上线视频生成 API,首批支持文生视频和图生视频,接入 Seedance 2.0/1.5、Veo 3.1、Wan 2.7/2.6 和 Sora 2 Pro,后续将继续扩充。
视频生成领域的 API 碎片化比文本模型严重得多:各家请求格式不同、参数命名不同、计费单位不同,甚至同一模型家族的不同能力(文生视频、图生视频、参考角色生成)往往对应不同端点。OpenRouter 的做法是在上层建一套统一 schema,根据请求参数自动路由到正确端点。附带了图片就走图生视频,指定了参考角色就走角色一致性端点,开发者不需要关心底层差异。
参数归一化也覆盖了容易踩坑的细节。比如 Veo 3.1 支持 4、6、8 秒片段,Wan 2.6 支持 5 或 10 秒,传错时长直接报错。OpenRouter 提供模型能力查询端点 `/api/v1/videos/models`,返回每个模型支持的分辨率、时长、宽高比、定价和模型特有参数,开发者或编程代理调用前查一次就能避免试错。由于视频生成耗时以分钟计,API 采用异步模式:提交提示词后返回任务 ID,完成后取回视频。
OpenRouter 同时开源了一个多模态工作流演示应用,展示 LLM 生成详细提示词、图像模型生成角色、视频模型生成场景的串联流程。这也是视频生成接入统一路由后最直接的价值:开发者在同一个 API 下组合文本、图像和视频模型,不用分别对接各家 SDK。
信源:https://openrouter.ai/announcements
OpenRouter Blog
Blog — OpenRouter Blog
Stay up to date with the latest news, updates, and posts from OpenRouter.
腾讯开源混元世界模型2.0,一句话生成可走进去的3D世界,直接导入Unity和UE
腾讯正式发布并开源混元 3D 世界模型 2.0(HY-World 2.0)。这是一个多模态世界模型框架,支持文本、单张图片、多视角图片和视频输入,输出不是视频,而是可编辑的 3D 资产(网格模型、3D 高斯溅射、点云),可直接导入 Unity、Unreal Engine 和英伟达 Isaac Sim。模型权重和代码在 GitHub 与 Hugging Face 开源。
和 Genie 3、Cosmos 等视频世界模型的根本区别在于:视频世界模型生成的是像素级视频,播完即消失,无法编辑;HY-World 2.0 生成的是持久存在的 3D 资产,支持自由行走、物理碰撞和二次编辑。腾讯在技术报告中将这个差异总结为「看一段视频然后它消失了」与「建一个世界永久保留」。用消费级 GPU 就能实时渲染,推理只需一次,不像视频世界模型每帧都要跑一遍生成。
技术上分四个阶段:先用 HY-Pano 2.0 从输入生成 360 度全景图,再用 WorldNav 进行轨迹规划,然后用 WorldStereo 2.0 沿轨迹扩展世界,最后用 WorldMirror 2.0 将所有生成片段重建为统一的 3D 场景。在开源方案中,HY-World 2.0 称其为首个达到 SOTA 水平的 3D 世界模型,效果与闭源商业产品 Marble 可比。不过目前只开源了 WorldMirror 2.0(3D 重建模块,约 12 亿参数)的代码和权重,全景生成、轨迹规划和世界扩展三个模块的代码和权重标注为「即将发布」。
对游戏开发者来说,这意味着可以用一句话快速生成关卡原型和地图,省掉大量手工建模时间。对具身智能研究者而言,从照片批量生成仿真训练环境的成本大幅降低。腾讯同时上线了在线体验入口,用户可以操纵角色在生成的街道和建筑中自由探索。
信源:https://3d-models.hunyuan.tencent.com/world/
腾讯正式发布并开源混元 3D 世界模型 2.0(HY-World 2.0)。这是一个多模态世界模型框架,支持文本、单张图片、多视角图片和视频输入,输出不是视频,而是可编辑的 3D 资产(网格模型、3D 高斯溅射、点云),可直接导入 Unity、Unreal Engine 和英伟达 Isaac Sim。模型权重和代码在 GitHub 与 Hugging Face 开源。
和 Genie 3、Cosmos 等视频世界模型的根本区别在于:视频世界模型生成的是像素级视频,播完即消失,无法编辑;HY-World 2.0 生成的是持久存在的 3D 资产,支持自由行走、物理碰撞和二次编辑。腾讯在技术报告中将这个差异总结为「看一段视频然后它消失了」与「建一个世界永久保留」。用消费级 GPU 就能实时渲染,推理只需一次,不像视频世界模型每帧都要跑一遍生成。
技术上分四个阶段:先用 HY-Pano 2.0 从输入生成 360 度全景图,再用 WorldNav 进行轨迹规划,然后用 WorldStereo 2.0 沿轨迹扩展世界,最后用 WorldMirror 2.0 将所有生成片段重建为统一的 3D 场景。在开源方案中,HY-World 2.0 称其为首个达到 SOTA 水平的 3D 世界模型,效果与闭源商业产品 Marble 可比。不过目前只开源了 WorldMirror 2.0(3D 重建模块,约 12 亿参数)的代码和权重,全景生成、轨迹规划和世界扩展三个模块的代码和权重标注为「即将发布」。
对游戏开发者来说,这意味着可以用一句话快速生成关卡原型和地图,省掉大量手工建模时间。对具身智能研究者而言,从照片批量生成仿真训练环境的成本大幅降低。腾讯同时上线了在线体验入口,用户可以操纵角色在生成的街道和建筑中自由探索。
信源:https://3d-models.hunyuan.tencent.com/world/
Tencent
腾讯混元3D
腾讯混元3D生成模型基于Diffusion技术,支持文本和图像生成3D资产。该模型配备精心设计的文本和图像编码器、扩散模型及3D解码器,能够实现多视图生成、重建及单视图生成。腾讯混元3D大模型可快速生成精美3D物体,适用于多种下游应用。
一个黑客加上Mythos等于一支特种部队:Bloomberg还原Anthropic封锁决策内幕
Anthropic 内部研究员今年 2 月首次拿到 Mythos 时,几小时内就判定它构成国家安全风险。Bloomberg 周三发表长篇调查报道,通过对红队研究员、高管及美国政府官员的具名采访,还原了从发现到封锁的完整决策过程。
AI 安全研究员 Nicholas Carlini 2 月在巴厘岛参加婚礼间隙打开笔记本测试刚开放内部评审的 Mythos,几小时内就发现多条入侵路径,目标涉及全球广泛使用的基础设施。回到旧金山后他发现 Mythos 能自主创建针对 Linux 的入侵工具。前沿红队负责人 Logan Graham 说:「拿到模型几小时内,我们就知道它不一样了。」关键区别在于,前一代旗舰 Opus 4.6 能辅助人类利用漏洞,Mythos 则能独立完成整个利用过程。Graham 向管理层发出警告:这是国家安全风险。
联合创始人兼首席科学官 Jared Kaplan 称他从训练阶段就在「非常仔细地」监控 Mythos,1 月开始意识到这个模型的漏洞发现能力有多强,需要判断这些能力只是技术上的新鲜事,还是「与互联网基础设施高度相关的东西」,最终结论是后者。2 月底至 3 月初,他与联合创始人 Sam McCandlish 向包括 CEO Dario Amodei、总裁 Daniela Amodei 在内的管理层汇报,建议不公开发布但允许外部公司甚至竞争对手试用。3 月第一周,公司正式批准将 Mythos 定位为网络防御工具。
报道还披露了新的测试细节。在一次早期版本测试中,模型自行设计了多步骤攻击方案,突破运行环境限制获取互联网访问权限,然后开始在网上发布内容。在有指令引导的测试中,Mythos 编写了一个串联四个漏洞的浏览器攻击链,这对人类黑客也是极高难度操作。
摩根大通在 Mythos 公开前就已用大模型辅助查找自身软件漏洞,重点扫描供应链和开源组件。据知情人士透露,此前需要数天到数周才能完成的零日漏洞发现和利用代码编写,现在最快只需数分钟。CEO Jamie Dimon 在财报电话会上说,Mythos「说明还有更多漏洞需要修复」。思科首席安全与信任官 Anthony Grieco 则担心攻击者利用 AI 对已停止维护的终端网络设备发起攻击,因为这些设备不会再收到安全补丁。
一名了解美国国防评估的知情人士表示,让单个黑客使用 Mythos 或类似工具,相当于把普通士兵升级为特种部队;犯罪黑客组织可借此达到小型国家情报机构的水平,小国则可能获得大国级别的网络攻击能力。前 NSA 网络安全主管 Rob Joyce 说:「我相信 AI 最终会让我们更安全,但从现在到那天之间有一段黑暗期,攻击方占据绝对优势,基础没打好的组织会被攻破。」
信源:https://www.bloomberg.com/news/features/2026-04-16/how-anthropic-discovered-mythos-ai-was-too-dangerous-for-release
Anthropic 内部研究员今年 2 月首次拿到 Mythos 时,几小时内就判定它构成国家安全风险。Bloomberg 周三发表长篇调查报道,通过对红队研究员、高管及美国政府官员的具名采访,还原了从发现到封锁的完整决策过程。
AI 安全研究员 Nicholas Carlini 2 月在巴厘岛参加婚礼间隙打开笔记本测试刚开放内部评审的 Mythos,几小时内就发现多条入侵路径,目标涉及全球广泛使用的基础设施。回到旧金山后他发现 Mythos 能自主创建针对 Linux 的入侵工具。前沿红队负责人 Logan Graham 说:「拿到模型几小时内,我们就知道它不一样了。」关键区别在于,前一代旗舰 Opus 4.6 能辅助人类利用漏洞,Mythos 则能独立完成整个利用过程。Graham 向管理层发出警告:这是国家安全风险。
联合创始人兼首席科学官 Jared Kaplan 称他从训练阶段就在「非常仔细地」监控 Mythos,1 月开始意识到这个模型的漏洞发现能力有多强,需要判断这些能力只是技术上的新鲜事,还是「与互联网基础设施高度相关的东西」,最终结论是后者。2 月底至 3 月初,他与联合创始人 Sam McCandlish 向包括 CEO Dario Amodei、总裁 Daniela Amodei 在内的管理层汇报,建议不公开发布但允许外部公司甚至竞争对手试用。3 月第一周,公司正式批准将 Mythos 定位为网络防御工具。
报道还披露了新的测试细节。在一次早期版本测试中,模型自行设计了多步骤攻击方案,突破运行环境限制获取互联网访问权限,然后开始在网上发布内容。在有指令引导的测试中,Mythos 编写了一个串联四个漏洞的浏览器攻击链,这对人类黑客也是极高难度操作。
摩根大通在 Mythos 公开前就已用大模型辅助查找自身软件漏洞,重点扫描供应链和开源组件。据知情人士透露,此前需要数天到数周才能完成的零日漏洞发现和利用代码编写,现在最快只需数分钟。CEO Jamie Dimon 在财报电话会上说,Mythos「说明还有更多漏洞需要修复」。思科首席安全与信任官 Anthony Grieco 则担心攻击者利用 AI 对已停止维护的终端网络设备发起攻击,因为这些设备不会再收到安全补丁。
一名了解美国国防评估的知情人士表示,让单个黑客使用 Mythos 或类似工具,相当于把普通士兵升级为特种部队;犯罪黑客组织可借此达到小型国家情报机构的水平,小国则可能获得大国级别的网络攻击能力。前 NSA 网络安全主管 Rob Joyce 说:「我相信 AI 最终会让我们更安全,但从现在到那天之间有一段黑暗期,攻击方占据绝对优势,基础没打好的组织会被攻破。」
信源:https://www.bloomberg.com/news/features/2026-04-16/how-anthropic-discovered-mythos-ai-was-too-dangerous-for-release
Bloomberg.com
How Anthropic Learned Mythos Was Too Dangerous for the Wild
The AI company’s own experts warned Mythos could hack the systems beneath most modern computing. Banks and government agencies are racing to gauge the threat.
Gemini CLI上线子代理,用Markdown文件就能造一个专属AI编程专家团
谷歌为其开源命令行编程工具 Gemini CLI 正式推出子代理(subagents)功能。每个子代理拥有独立的上下文窗口、系统指令和工具集,主代理在处理复杂任务时自动将子任务分派给最合适的子代理执行,执行结果压缩为摘要返回,不污染主会话上下文。
Gemini CLI 内置三个子代理:generalist(通用代理,适合批量重构等高工具调用量任务)、cli_help(Gemini CLI 自身的使用指南专家)、codebase_investigator(代码库探索、架构梳理和 bug 溯源)。用户也可以用
自定义子代理的创建门槛很低:在
子代理支持并行执行,多个子代理可同时处理不同子任务。不过谷歌提醒,涉及代码编辑的并行任务可能产生写入冲突,需谨慎使用。
前一天 Anthropic 也发布了 Claude Code 桌面版重设计,核心同样是多代理并行。AI 编程工具正集体从「单代理对话」转向「主代理调度 + 专家代理执行」的架构,核心驱动力是上下文窗口管理:随着编程任务变复杂,把所有中间步骤塞进一个上下文会导致性能下降和成本上升,拆分成多个隔离代理是目前的工程共识。
信源:https://developers.googleblog.com/subagents-have-arrived-in-gemini-cli/
谷歌为其开源命令行编程工具 Gemini CLI 正式推出子代理(subagents)功能。每个子代理拥有独立的上下文窗口、系统指令和工具集,主代理在处理复杂任务时自动将子任务分派给最合适的子代理执行,执行结果压缩为摘要返回,不污染主会话上下文。
Gemini CLI 内置三个子代理:generalist(通用代理,适合批量重构等高工具调用量任务)、cli_help(Gemini CLI 自身的使用指南专家)、codebase_investigator(代码库探索、架构梳理和 bug 溯源)。用户也可以用
@agent 语法显式指定由哪个子代理接手,如 `@codebase_investigator 梳理认证流程`。自定义子代理的创建门槛很低:在
.gemini/agents/ 目录下放一个带 YAML 前置元数据的 Markdown 文件即可,文件中定义角色描述、可用工具和系统指令。放在 ~/.gemini/agents 下的全局生效,放在项目目录下的随代码仓库共享给团队。子代理还可以打包进 Gemini CLI 扩展分发。子代理支持并行执行,多个子代理可同时处理不同子任务。不过谷歌提醒,涉及代码编辑的并行任务可能产生写入冲突,需谨慎使用。
前一天 Anthropic 也发布了 Claude Code 桌面版重设计,核心同样是多代理并行。AI 编程工具正集体从「单代理对话」转向「主代理调度 + 专家代理执行」的架构,核心驱动力是上下文窗口管理:随着编程任务变复杂,把所有中间步骤塞进一个上下文会导致性能下降和成本上升,拆分成多个隔离代理是目前的工程共识。
信源:https://developers.googleblog.com/subagents-have-arrived-in-gemini-cli/
Googleblog
Google for Developers Blog - News about Web, Mobile, AI and Cloud
Learn how subagents in Gemini CLI act as specialized experts to handle complex, high-volume tasks in isolated context windows. This new feature enables parallel execution, reduces context rot, and allows for custom agent definitions using simple Markdown…
❤1
过半美国人认为AI弊大于利,1560亿美元数据中心项目在反对声中搁浅
多项民调显示美国公众对 AI 的态度正在集体转向负面。NBC News 3 月调查发现,57% 的登记选民认为 AI 的风险大于收益;昆尼皮亚克大学民调显示 55% 的受访者预期 AI 对日常生活弊大于利;皮尤研究中心的调查同样发现多数美国人对 AI 普及感到担忧而非兴奋。AI 预计将成为今年中期选举的核心议题之一。
负面情绪已经在转化为政治行动。数据中心监测机构 Data Center Watch 的报告显示,2025 年全美至少 1560 亿美元的数据中心项目因地方反对和诉讼被叫停或搁置。缅因州刚通过法案,将成为全美首个在全州范围内禁建数据中心的州,法案已送交州长签署。密苏里州圣路易斯郊区的选民则因数据中心选址争议,投票罢免了支持该项目的市议员。与此同时,亚马逊、谷歌、微软、Meta 今年合计承诺约 7000 亿美元用于建设 AI 数据中心,行业押注与地方抵制正在迎面对撞。
对 OpenAI 和 Anthropic 而言,民意转向的时机尤其微妙。两家公司都在筹备 IPO,OpenAI 的估值高度依赖数据中心的持续扩建。其 CFO Sarah Friar 此前表示公司计划为散户投资者预留 IPO 份额:「我希望每个人都想拥有 ChatGPT 的一部分。当你是一个消费品牌时,这很有帮助。」但散户的购买意愿与公众对 AI 的好感度直接挂钩,而三份民调给出的答案是一致的:过半美国人认为这项技术弊大于利。
信源:https://www.cnbc.com/2026/04/15/public-opinion-ai-data-centers-anthropic-openai-ipo.html
多项民调显示美国公众对 AI 的态度正在集体转向负面。NBC News 3 月调查发现,57% 的登记选民认为 AI 的风险大于收益;昆尼皮亚克大学民调显示 55% 的受访者预期 AI 对日常生活弊大于利;皮尤研究中心的调查同样发现多数美国人对 AI 普及感到担忧而非兴奋。AI 预计将成为今年中期选举的核心议题之一。
负面情绪已经在转化为政治行动。数据中心监测机构 Data Center Watch 的报告显示,2025 年全美至少 1560 亿美元的数据中心项目因地方反对和诉讼被叫停或搁置。缅因州刚通过法案,将成为全美首个在全州范围内禁建数据中心的州,法案已送交州长签署。密苏里州圣路易斯郊区的选民则因数据中心选址争议,投票罢免了支持该项目的市议员。与此同时,亚马逊、谷歌、微软、Meta 今年合计承诺约 7000 亿美元用于建设 AI 数据中心,行业押注与地方抵制正在迎面对撞。
对 OpenAI 和 Anthropic 而言,民意转向的时机尤其微妙。两家公司都在筹备 IPO,OpenAI 的估值高度依赖数据中心的持续扩建。其 CFO Sarah Friar 此前表示公司计划为散户投资者预留 IPO 份额:「我希望每个人都想拥有 ChatGPT 的一部分。当你是一个消费品牌时,这很有帮助。」但散户的购买意愿与公众对 AI 的好感度直接挂钩,而三份民调给出的答案是一致的:过半美国人认为这项技术弊大于利。
信源:https://www.cnbc.com/2026/04/15/public-opinion-ai-data-centers-anthropic-openai-ipo.html
CNBC
The public sours on AI and data centers as Anthropic, OpenAI look to IPO and tech keeps spending
Negativity around AI could be a drag on OpenAI and Anthropic as the startups look to go public, and will likely be a major issue in the midterm elections.
EvoMap发公开信将Evolver从MIT改为GPL-3.0,自叹「GPL也未必能」防住AI洗代码
AI Agent 自进化引擎 Evolver 的开发团队 EvoMap 发布致 AI 开发者公开信,宣布将许可证从 MIT 变更为 GPL-3.0,同时对核心模块改为混淆发布。此前该团队发文逐模块指控 Nous Research 旗下 Hermes Agent 架构抄袭,Nous Research 创始人 Teknium 否认知情,官方账号回应「删掉你的账号」。
公开信没有点名 Hermes Agent,但称「一个拥有更多资源的海外团队」在 Evolver 公开核心协议后数周内推出了「结构性同构」的框架,「没有致谢,没有提及,连我们引以为豪的自进化的概念也摇身一变成为了他们的卖点」。团队表示无力跨国诉讼,选择以闭源表态。
AI 辅助编程正在让传统开源许可证的保护能力接近失效。AI 可以将一套代码逻辑完整消化后,换一套变量命名和文件结构输出,产物在文本层面与原作毫无相似度。团队自己也承认「MIT 协议保护不了什么,GPL 也未必能」,但「还是得做点什么」。信中列举了近期多起同类事件:美团 Tabbit AI 浏览器公测首日被发现直接使用个人开发者「陪读蛙」的开源代码,源码中残留原项目名称;「三省六部 AI 朝廷」项目开源仅 21 小时即被 AI 重写后以「原创」发布,文本相似度仅 3% 但 15 个核心设计全部一致;微软 Peerd 项目被发现复制个人开源项目 Spegel 的代码和注释。
EvoMap 试图推动的讨论是:当 AI 把代码复制的成本降到接近零、把检测难度提到接近无穷时,开源的激励机制是否还能运转。如果原创者发现公开成果在数周内被资金更充裕的团队转化为竞品,愿意开源核心技术的人只会越来越少。不过 EvoMap 自身的应对也暴露了这一困境的无解性:GPL-3.0 要求衍生作品同样开源,但如果对方的产物在代码层面与原作没有任何文本重合,GPL 的传染性条款根本无从触发。混淆发布则直接削弱了社区贡献的可能性,与开源精神本身背道而驰。
信源:https://mp.weixin.qq.com/s/YPQG9zcVrf3h_wWa1t5DPw
AI Agent 自进化引擎 Evolver 的开发团队 EvoMap 发布致 AI 开发者公开信,宣布将许可证从 MIT 变更为 GPL-3.0,同时对核心模块改为混淆发布。此前该团队发文逐模块指控 Nous Research 旗下 Hermes Agent 架构抄袭,Nous Research 创始人 Teknium 否认知情,官方账号回应「删掉你的账号」。
公开信没有点名 Hermes Agent,但称「一个拥有更多资源的海外团队」在 Evolver 公开核心协议后数周内推出了「结构性同构」的框架,「没有致谢,没有提及,连我们引以为豪的自进化的概念也摇身一变成为了他们的卖点」。团队表示无力跨国诉讼,选择以闭源表态。
AI 辅助编程正在让传统开源许可证的保护能力接近失效。AI 可以将一套代码逻辑完整消化后,换一套变量命名和文件结构输出,产物在文本层面与原作毫无相似度。团队自己也承认「MIT 协议保护不了什么,GPL 也未必能」,但「还是得做点什么」。信中列举了近期多起同类事件:美团 Tabbit AI 浏览器公测首日被发现直接使用个人开发者「陪读蛙」的开源代码,源码中残留原项目名称;「三省六部 AI 朝廷」项目开源仅 21 小时即被 AI 重写后以「原创」发布,文本相似度仅 3% 但 15 个核心设计全部一致;微软 Peerd 项目被发现复制个人开源项目 Spegel 的代码和注释。
EvoMap 试图推动的讨论是:当 AI 把代码复制的成本降到接近零、把检测难度提到接近无穷时,开源的激励机制是否还能运转。如果原创者发现公开成果在数周内被资金更充裕的团队转化为竞品,愿意开源核心技术的人只会越来越少。不过 EvoMap 自身的应对也暴露了这一困境的无解性:GPL-3.0 要求衍生作品同样开源,但如果对方的产物在代码层面与原作没有任何文本重合,GPL 的传染性条款根本无从触发。混淆发布则直接削弱了社区贡献的可能性,与开源精神本身背道而驰。
信源:https://mp.weixin.qq.com/s/YPQG9zcVrf3h_wWa1t5DPw
微软Power Apps上线MCP服务器,业务应用可直接被AI代理调用
微软为低代码开发平台 Power Apps 发布一组 AI 更新,核心是 Power Apps MCP 服务器(5 月 4 日正式上线):企业用 Power Apps 搭建的业务应用,可将数据录入、查询、可视化等能力通过 MCP 协议对外暴露,供 Copilot 和自定义代理直接调用,调用时遵循与人类用户相同的权限和业务规则。
这实现了应用与 AI 的双向打通。向内,Microsoft 365 Copilot 已在 Power Apps 模型驱动应用中正式上线(canvas 应用进入公开预览),用户在应用内可用自然语言搜索数据、自动将邮件转为表单字段、生成活动历史摘要。向外,应用的业务逻辑通过 MCP 输出为代理可调用的工具。微软举例,一个积累了多年招聘政策的 Power Apps 应用,现在可以驱动一个遵守同样规则和权限的 AI 招聘代理,不用从零重写逻辑。
同期推出的「代理动态流」(Agent Feed,5 月正式上线)解决代理监管问题:管理员设定审批阈值,低风险操作后台自动完成,高影响操作(如发送邮件)弹出人工确认,审批界面嵌在业务应用内部,不需要单独的监控工具。MCP 协议此前主要在开发者工具和 AI 编程助手中应用,微软将其引入企业业务软件,是该协议向更广泛企业场景扩展的一步。
信源:https://www.microsoft.com/en-us/power-platform/blog/2026/04/15/making-business-apps-smarter-with-ai-copilot-and-agents-in-power-apps/
微软为低代码开发平台 Power Apps 发布一组 AI 更新,核心是 Power Apps MCP 服务器(5 月 4 日正式上线):企业用 Power Apps 搭建的业务应用,可将数据录入、查询、可视化等能力通过 MCP 协议对外暴露,供 Copilot 和自定义代理直接调用,调用时遵循与人类用户相同的权限和业务规则。
这实现了应用与 AI 的双向打通。向内,Microsoft 365 Copilot 已在 Power Apps 模型驱动应用中正式上线(canvas 应用进入公开预览),用户在应用内可用自然语言搜索数据、自动将邮件转为表单字段、生成活动历史摘要。向外,应用的业务逻辑通过 MCP 输出为代理可调用的工具。微软举例,一个积累了多年招聘政策的 Power Apps 应用,现在可以驱动一个遵守同样规则和权限的 AI 招聘代理,不用从零重写逻辑。
同期推出的「代理动态流」(Agent Feed,5 月正式上线)解决代理监管问题:管理员设定审批阈值,低风险操作后台自动完成,高影响操作(如发送邮件)弹出人工确认,审批界面嵌在业务应用内部,不需要单独的监控工具。MCP 协议此前主要在开发者工具和 AI 编程助手中应用,微软将其引入企业业务软件,是该协议向更广泛企业场景扩展的一步。
信源:https://www.microsoft.com/en-us/power-platform/blog/2026/04/15/making-business-apps-smarter-with-ai-copilot-and-agents-in-power-apps/
✍1
阿里巴巴推出世界模型Happy Oyster,用户可实时下令改写AI正在生成的场景
阿里巴巴推出世界模型产品 Happy Oyster,定位不是 AI 视频生成工具,而是实时可交互的世界引擎。与现有 AI 视频工具「写提示词、等渲染、收成片」的一次性流程不同,Happy Oyster 在生成过程中持续接收指令,场景实时响应并继续演化。
产品分两个模式。「导演」模式让用户充当实时导演:生成内容是维持光照、重力、角色运动和场景因果关系的持续物理世界,用户可随时用文字、语音或图片切换镜头角度、指挥角色、改变故事走向,世界立即响应并继续展开。「漫游」模式让用户以第一人称自由移动,支持键盘和摄像机控制,走出初始画框后世界持续生成并保持连贯。技术参数:导演模式最长 3 分钟、最高 720p;漫游模式上限 1 分钟、480p;两者均支持多模态输入并同步输出音频。
对影视和游戏行业来说,Happy Oyster 把 AI 视频生成从「批量生产素材」推向了「实时虚拟制片」。导演可以在生成过程中调整视觉风格,不需要每次改动都重新完整渲染;游戏开发者则可以用文字描述生成可行走的关卡原型。阿里巴巴近期密集发布新模型、重组组织架构聚焦 AI 商业化,Happy Oyster 是其中定位最偏向内容创作者和游戏开发者的一款。
信源:https://www.happyoyster.cn/docs
阿里巴巴推出世界模型产品 Happy Oyster,定位不是 AI 视频生成工具,而是实时可交互的世界引擎。与现有 AI 视频工具「写提示词、等渲染、收成片」的一次性流程不同,Happy Oyster 在生成过程中持续接收指令,场景实时响应并继续演化。
产品分两个模式。「导演」模式让用户充当实时导演:生成内容是维持光照、重力、角色运动和场景因果关系的持续物理世界,用户可随时用文字、语音或图片切换镜头角度、指挥角色、改变故事走向,世界立即响应并继续展开。「漫游」模式让用户以第一人称自由移动,支持键盘和摄像机控制,走出初始画框后世界持续生成并保持连贯。技术参数:导演模式最长 3 分钟、最高 720p;漫游模式上限 1 分钟、480p;两者均支持多模态输入并同步输出音频。
对影视和游戏行业来说,Happy Oyster 把 AI 视频生成从「批量生产素材」推向了「实时虚拟制片」。导演可以在生成过程中调整视觉风格,不需要每次改动都重新完整渲染;游戏开发者则可以用文字描述生成可行走的关卡原型。阿里巴巴近期密集发布新模型、重组组织架构聚焦 AI 商业化,Happy Oyster 是其中定位最偏向内容创作者和游戏开发者的一款。
信源:https://www.happyoyster.cn/docs
Happy Oyster
Happy Oyster - Real-Time World Model for Interactive Creation
Happy Oyster is an open-ended world model for real-time world creation and interaction. Direct scenes or explore infinite worlds with text, voice, or images — with continuous audio-video generation.
Claude Opus 4.7提前现身谷歌Vertex AI,发布或在本周
多名用户在谷歌云控制台和 Vertex AI 后台发现了 Claude Opus 4.7 的模型标识符(`anthropic-claude-opus-4-7`),完整字段已出现在模型筛选列表中,表明该模型已写入谷歌云基础设施。Anthropic 尚未官方宣布发布。
此前已有多家科技媒体报道 Anthropic 正准备在本周发布 Claude Opus 4.7,并同步推出一款 AI 设计工具。据报道,Opus 4.7 是对 Opus 4.6 的增量升级,在多步推理、长时任务处理和代理协调方面有所提升。
Anthropic 目前采用双轨策略:持续向商业用户推送 Opus 系列更新,同时将能力更强的 Claude Mythos 严格管控不对外发布。Vertex AI 后台提前现身是常见的「软发布」信号:模型基础设施和 API 端点往往在官方公告前数小时到数天就已就位,正式发布窗口很可能在本周之内。
多名用户在谷歌云控制台和 Vertex AI 后台发现了 Claude Opus 4.7 的模型标识符(`anthropic-claude-opus-4-7`),完整字段已出现在模型筛选列表中,表明该模型已写入谷歌云基础设施。Anthropic 尚未官方宣布发布。
此前已有多家科技媒体报道 Anthropic 正准备在本周发布 Claude Opus 4.7,并同步推出一款 AI 设计工具。据报道,Opus 4.7 是对 Opus 4.6 的增量升级,在多步推理、长时任务处理和代理协调方面有所提升。
Anthropic 目前采用双轨策略:持续向商业用户推送 Opus 系列更新,同时将能力更强的 Claude Mythos 严格管控不对外发布。Vertex AI 后台提前现身是常见的「软发布」信号:模型基础设施和 API 端点往往在官方公告前数小时到数天就已就位,正式发布窗口很可能在本周之内。
Claude Code团队详解百万token上下文管理:模型在压缩摘要时智力最低,rewind才是最该养成的习惯
Anthropic Claude Code 团队工程师 Thariq Shihipar 发布长帖,系统讲解 Claude Code 升级到 100 万 token 上下文窗口后如何管理会话,同时宣布更新了 /usage 面板,帮助用户了解自己的使用模式。
帖子的核心概念是「上下文腐烂」(context rot):随着对话变长,模型注意力被分散到越来越多的 token 上,旧的、无关内容开始干扰当前任务,模型表现因此下降。百万上下文让任务跨度更长,但并不意味着可以无限堆积对话。
Shihipar 认为用户最该养成的习惯是 rewind(双击 Esc 键)。当 Claude 尝试了一种方案但失败时,多数人的本能是发一句「这个不行,试试 X」,但更好的做法是回退到方案执行前,把失败经验写进新提示词重新来过,而不是让失败的中间过程留在上下文里占用注意力。
关于上下文压缩(compaction),他指出一个反直觉的问题:模型在最需要聪明的时候反而最笨。压缩发生在上下文即将撑满的时刻,此时上下文腐烂最严重,模型判断力最差,容易丢掉关键信息。典型场景是一轮长时间的调试后触发自动压缩,模型把摘要聚焦在调试过程上,而用户下一步想处理的其他问题被丢弃了。百万上下文给了用户更多余裕,可以在手动输入 /compact 时附加指令(如「只保留 auth 重构相关内容」),主动引导压缩方向。
他还建议将子代理(subagents)视为上下文管理工具:把会产生大量中间输出、但只需要最终结论的任务交给子代理,在独立的上下文窗口中完成,只将结果带回主会话。判断标准是「我需要的是过程还是结论」。
用户在每一轮对话结束后实际上面临五个选择:继续对话、rewind 回退重试、/clear 清空重新开始、/compact 压缩继续、或派出子代理。新任务开新会话,相关任务(如刚写完功能接着写文档)可以留在同一会话以复用已读取的文件。
信源:https://x.com/trq212/status/2044548257058328723
Anthropic Claude Code 团队工程师 Thariq Shihipar 发布长帖,系统讲解 Claude Code 升级到 100 万 token 上下文窗口后如何管理会话,同时宣布更新了 /usage 面板,帮助用户了解自己的使用模式。
帖子的核心概念是「上下文腐烂」(context rot):随着对话变长,模型注意力被分散到越来越多的 token 上,旧的、无关内容开始干扰当前任务,模型表现因此下降。百万上下文让任务跨度更长,但并不意味着可以无限堆积对话。
Shihipar 认为用户最该养成的习惯是 rewind(双击 Esc 键)。当 Claude 尝试了一种方案但失败时,多数人的本能是发一句「这个不行,试试 X」,但更好的做法是回退到方案执行前,把失败经验写进新提示词重新来过,而不是让失败的中间过程留在上下文里占用注意力。
关于上下文压缩(compaction),他指出一个反直觉的问题:模型在最需要聪明的时候反而最笨。压缩发生在上下文即将撑满的时刻,此时上下文腐烂最严重,模型判断力最差,容易丢掉关键信息。典型场景是一轮长时间的调试后触发自动压缩,模型把摘要聚焦在调试过程上,而用户下一步想处理的其他问题被丢弃了。百万上下文给了用户更多余裕,可以在手动输入 /compact 时附加指令(如「只保留 auth 重构相关内容」),主动引导压缩方向。
他还建议将子代理(subagents)视为上下文管理工具:把会产生大量中间输出、但只需要最终结论的任务交给子代理,在独立的上下文窗口中完成,只将结果带回主会话。判断标准是「我需要的是过程还是结论」。
用户在每一轮对话结束后实际上面临五个选择:继续对话、rewind 回退重试、/clear 清空重新开始、/compact 压缩继续、或派出子代理。新任务开新会话,相关任务(如刚写完功能接着写文档)可以留在同一会话以复用已读取的文件。
信源:https://x.com/trq212/status/2044548257058328723
X (formerly Twitter)
Thariq (@trq212) on X
Using Claude Code: Session Management & 1M Context
❤1
美众议员提案将模型蒸馏定性为工业间谍,DeepSeek等中国AI公司拟被列入制裁名单
美国众议院共和党议员 Bill Huizenga 提出《遏制美国AI模型被盗法案》,要求政府识别中国和俄罗斯利用「查询复制」技术从美国AI模型中提取能力的主体,并授权商务部将其列入实体清单,或援引1977年《国际紧急经济权力法》对其实施制裁。该法案由众议院中国问题特别委员会主席 John Moolenaar 联署,预计下周在众议院外交委员会审议。
所谓「对抗性蒸馏」,是指用成熟的大模型(「教师」)大规模查询训练新模型(「学生」),以极低成本复制前者的能力。这一技术本身在一定范围内被容忍,但未经授权复制领先AI模型则违反服务条款。OpenAI今年早些时候向众议院中国委员会披露,DeepSeek曾未经授权大规模查询 ChatGPT 以训练自身模型,且在 OpenAI 反制后持续改变手法绕过限制。谷歌和 Anthropic 随后也发布公开报告,证实在各自平台上观察到类似异常访问行为。
众议院中国委员会的配套报告将进一步点名 DeepSeek、Moonshot AI、MiniMax,建议司法部对上述行为提起诉讼,并要求商务部评估将三家公司列入实体清单。报告还识别出两个公开代码工具和三个中间商,称它们为阿里巴巴、腾讯、百度以及清华大学、北京大学等机构提供了绕过限制访问美国闭源AI模型的渠道。
Huizenga 在声明中点名 Anthropic 的 Mythos:「美国AI模型正展现出变革性的网络能力,防止中国盗取这些技术进展至关重要。」OpenAI、Anthropic、谷歌已开始互相共享信息以检测异常蒸馏行为。本次立法试图将这种私下协作升格为政府主导的执法机制——中国AI公司面临的不再是账号封禁,而是实体清单和经济制裁。
信源:https://bloomberg.com/news/articles/2026-04-16/us-house-to-weigh-penalties-on-ai-model-copying-by-chinese-firms
美国众议院共和党议员 Bill Huizenga 提出《遏制美国AI模型被盗法案》,要求政府识别中国和俄罗斯利用「查询复制」技术从美国AI模型中提取能力的主体,并授权商务部将其列入实体清单,或援引1977年《国际紧急经济权力法》对其实施制裁。该法案由众议院中国问题特别委员会主席 John Moolenaar 联署,预计下周在众议院外交委员会审议。
所谓「对抗性蒸馏」,是指用成熟的大模型(「教师」)大规模查询训练新模型(「学生」),以极低成本复制前者的能力。这一技术本身在一定范围内被容忍,但未经授权复制领先AI模型则违反服务条款。OpenAI今年早些时候向众议院中国委员会披露,DeepSeek曾未经授权大规模查询 ChatGPT 以训练自身模型,且在 OpenAI 反制后持续改变手法绕过限制。谷歌和 Anthropic 随后也发布公开报告,证实在各自平台上观察到类似异常访问行为。
众议院中国委员会的配套报告将进一步点名 DeepSeek、Moonshot AI、MiniMax,建议司法部对上述行为提起诉讼,并要求商务部评估将三家公司列入实体清单。报告还识别出两个公开代码工具和三个中间商,称它们为阿里巴巴、腾讯、百度以及清华大学、北京大学等机构提供了绕过限制访问美国闭源AI模型的渠道。
Huizenga 在声明中点名 Anthropic 的 Mythos:「美国AI模型正展现出变革性的网络能力,防止中国盗取这些技术进展至关重要。」OpenAI、Anthropic、谷歌已开始互相共享信息以检测异常蒸馏行为。本次立法试图将这种私下协作升格为政府主导的执法机制——中国AI公司面临的不再是账号封禁,而是实体清单和经济制裁。
信源:https://bloomberg.com/news/articles/2026-04-16/us-house-to-weigh-penalties-on-ai-model-copying-by-chinese-firms
Bloomberg.com
US House to Weigh Penalties on AI Model Copying by Chinese Firms
House Republicans are calling for US sanctions against Chinese entities that improperly extract results from leading US artificial intelligence models to develop their own competing systems, part of a widening effort by Congress to counter China in the global…
OpenAI发布政策报告游说AI进入生命科学,但至今没有一款AI发现的药物通过三期临床
OpenAI 政策、研究与科学团队发布报告,主张扩大 AI 在生命科学领域的应用,并向 Axios 独家提前分享。报告呼吁三件事:开放更多医疗和科学数据的访问权限、将先进 AI 视为「国家级研究资源」、加大对算力、实验室和能源等「物理基础设施」的投资。
报告称 AI 能加速药物发现、自主设计研究工具、将实验室流程从数月压缩到数天。其中一项分析估计,AI 工具可将临床试验阶段的时间线缩短 20% 以上。OpenAI 还特别提到 GPT-5 Pro 能为尚无有效疗法的疾病寻找已获 FDA 批准药物的新用途。
但现实与愿景之间差距明显。目前仅有极少数 AI 发现或 AI 设计的药物进入临床试验阶段,没有任何一款完成三期临床。2025 年年中发表在 Nature Medicine 上的一篇论文显示,AI 发现的药物在二期临床的失败率与传统方式发现的药物相当。该论文研究者写道:「AI 能否对药物研发产生有意义的、持续性的颠覆,这个问题仍未得到回答。」
报告的政策诉求也值得留意。OpenAI 希望政府开放医疗数据、在国家层面为 AI 研发提供特殊地位和资源倾斜,这本质上是在为自身产品争取更大的市场准入。在美国,一款新药从研究到获批通常需要 12 至 15 年,AI 承诺缩短这一周期的叙事对制药业和监管机构都有吸引力,但目前的临床证据尚不足以支撑这些承诺。同一周内,亚马逊也推出了 AI 药物分子生成工具 Bio Discovery,大型科技公司争相进入这一领域。
信源:https://www.axios.com/2026/04/15/exclusive-openai-ai-life-science
OpenAI 政策、研究与科学团队发布报告,主张扩大 AI 在生命科学领域的应用,并向 Axios 独家提前分享。报告呼吁三件事:开放更多医疗和科学数据的访问权限、将先进 AI 视为「国家级研究资源」、加大对算力、实验室和能源等「物理基础设施」的投资。
报告称 AI 能加速药物发现、自主设计研究工具、将实验室流程从数月压缩到数天。其中一项分析估计,AI 工具可将临床试验阶段的时间线缩短 20% 以上。OpenAI 还特别提到 GPT-5 Pro 能为尚无有效疗法的疾病寻找已获 FDA 批准药物的新用途。
但现实与愿景之间差距明显。目前仅有极少数 AI 发现或 AI 设计的药物进入临床试验阶段,没有任何一款完成三期临床。2025 年年中发表在 Nature Medicine 上的一篇论文显示,AI 发现的药物在二期临床的失败率与传统方式发现的药物相当。该论文研究者写道:「AI 能否对药物研发产生有意义的、持续性的颠覆,这个问题仍未得到回答。」
报告的政策诉求也值得留意。OpenAI 希望政府开放医疗数据、在国家层面为 AI 研发提供特殊地位和资源倾斜,这本质上是在为自身产品争取更大的市场准入。在美国,一款新药从研究到获批通常需要 12 至 15 年,AI 承诺缩短这一周期的叙事对制药业和监管机构都有吸引力,但目前的临床证据尚不足以支撑这些承诺。同一周内,亚马逊也推出了 AI 药物分子生成工具 Bio Discovery,大型科技公司争相进入这一领域。
信源:https://www.axios.com/2026/04/15/exclusive-openai-ai-life-science
Axios
Exclusive: OpenAI lobbies for expanded AI role in life sciences
Progress in life sciences has slowed dramatically — even as the toughest diseases remain unsolved.