动察Beating AI News
3.16K subscribers
890 photos
2 videos
1 file
3.41K links
AI新闻信息流
Download Telegram
英伟达开源Lyra 2.0,一张照片生成可走动的3D世界,直接导入机器人仿真器

英伟达发布 Lyra 2.0,一个从单张图片生成可探索 3D 世界的开源框架。用户给一张照片,Lyra 2.0 先生成受镜头轨迹控制的漫游视频,再将视频重建为 3D 高斯溅射(Gaussian Splats)和网格模型,可直接导入游戏引擎和仿真器实时渲染。模型权重和代码以 Apache 2.0 许可证在 Hugging Face 和 GitHub 开源,允许商用。

核心技术突破在于解决长距离漫游的两个退化问题。第一个是「空间遗忘」:当镜头走远后再折返,此前看过的区域已超出模型的时间窗口,模型只能凭空生成,导致场景前后不一致。Lyra 2.0 为每一帧维护 3D 几何信息,折返时检索相关历史帧并建立密集对应关系,让模型「记住」之前看过的东西。第二个是「时间漂移」:自回归生成逐帧累积误差,场景逐渐变形。Lyra 2.0 用自增强训练让模型在训练阶段就接触自身的退化输出,学会纠错而非传播错误。底层基于万影 Wan 2.1-14B 扩散 Transformer,输出分辨率 832×480。

对开发者和研究者而言,最直接的应用场景是机器人仿真。英伟达在演示中将 Lyra 2.0 生成的 3D 场景导入自家物理仿真器 Isaac Sim,机器人可在其中导航和交互。此前训练具身智能(embodied AI)的一大瓶颈是 3D 环境制作成本高、种类有限,Lyra 2.0 提供了一条从照片批量生成训练环境的路径。去年 9 月发布的 Lyra 1.0 仅支持短距离生成,2.0 版将其扩展到长距离持续探索。谷歌此前发布的 Genie 3 具备类似能力但未开源,Lyra 2.0 是目前该方向最完整的开源方案。

信源:https://research.nvidia.com/labs/sil/projects/lyra2/
1
谷歌发布Gemini 3.1 Flash TTS,开发者可像导演一样用自然语言指挥AI怎么说话

谷歌发布新一代文本转语音模型 Gemini 3.1 Flash TTS,核心卖点不是「更像真人」,而是开发者可以精确控制 AI 语音的风格、语速和情绪表达。模型已通过 Gemini API、Google AI Studio(开发者预览)、Vertex AI(企业预览)和 Google Vids(Workspace 用户)上线。

这套控制能力的关键是「audio tags」(音频标签):开发者在输入文本中嵌入自然语言指令,就能调整 AI 语音的语调、节奏和口音,甚至在一句话中间切换表达风格。谷歌在 Google AI Studio 中提供了一套「导演椅」式的配置界面,包含三层控制:

1. 场景指导:设定环境和对话指令,让角色在多轮对话中保持一致性格
2. 角色级调参:为每个角色分配独立的音频配置,单独控制语速、语调和口音
3. 一键导出:调好的参数可直接导出为 Gemini API 代码,在不同项目和平台上复用

在第三方评测机构 Artificial Analysis 的 TTS 排行榜上,Gemini 3.1 Flash TTS 以 1211 分的 Elo 评分登顶,该排行榜基于数千次人类盲听偏好测试。Artificial Analysis 同时将其列入「最具吸引力象限」,即语音质量高且成本低。模型支持 70 多种语言和原生多角色对话,所有生成音频均内嵌 SynthID 水印用于 AI 内容识别。

对开发者来说,这意味着 TTS 从一个「把文字读出来」的工具变成了一个可编程的语音表演引擎。过去要做有情感的 AI 语音,要么靠后期处理,要么靠 SSML 标记语言逐字标注,现在用一句自然语言就能搞定。结合一键导出功能,同一套语音风格可以跨产品线复用,这对需要统一品牌声音的企业尤其实用。

信源:https://blog.google/innovation-and-ai/models-and-research/gemini-models/gemini-3-1-flash-tts/
2
OpenClaw贡献者:把AI工作流建在Claude Cowork上,就是选择当十年「租户」

开源 AI Agent 框架 OpenClaw 贡献者 Onur Solmaz 在 X 上发帖,以 Anthropic 刚转正式版的 Claude Cowork 为例,论证企业不应将 AI 工作流建在专有平台之上。

核心论点是基础设施的粘性效应:企业一旦围绕某个专有产品搭建工作流,迁移成本会随时间急剧上升,如同企业锁定 AWS 后难以切换到 Hetzner,最终沦为「租户」,被平台方「在未来 10 年尽可能地榨取」。

Solmaz 算了一笔账:同时订阅 OpenAI 和 Anthropic 的 Pro 或 Max 计划,每年花费 2400 至 4800 美元,且这些订阅目前可能以亏损定价,未来大概率涨价。而华硕今年发布的桌面 AI 超算 Ascent GX10 搭载英伟达 GB10 Grace Blackwell 处理器,支持运行最高 2000 亿参数模型,一次性购入后可用多年。他承认开源模型编程能力尚不及闭源,但认为许多场景已够用,「已经有不少人开始为此购买 GPU」。相比之下,OpenClaw 等开源框架允许企业随时更换模型供应商或切换到本地硬件,不受单一平台制约。

Anthropic 上周将 Claude Cowork 从预览转为正式版,面向全部付费用户开放,新增角色权限控制、用量分析等企业功能。OpenClaw 在 GitHub 上已积累超 35 万星。专有 AI Agent 平台加速向企业渗透的同时,开源替代方案也在快速成熟,两条路线的竞争正在进入正面交锋。

信源:https://x.com/onusoz/status/2044457293069062530
OpenRouter上线视频生成API,一个接口调用Sora 2、Veo 3.1、Seedance等主流模型

AI 模型聚合平台 OpenRouter 正式上线视频生成 API,首批支持文生视频和图生视频,接入 Seedance 2.0/1.5、Veo 3.1、Wan 2.7/2.6 和 Sora 2 Pro,后续将继续扩充。

视频生成领域的 API 碎片化比文本模型严重得多:各家请求格式不同、参数命名不同、计费单位不同,甚至同一模型家族的不同能力(文生视频、图生视频、参考角色生成)往往对应不同端点。OpenRouter 的做法是在上层建一套统一 schema,根据请求参数自动路由到正确端点。附带了图片就走图生视频,指定了参考角色就走角色一致性端点,开发者不需要关心底层差异。

参数归一化也覆盖了容易踩坑的细节。比如 Veo 3.1 支持 4、6、8 秒片段,Wan 2.6 支持 5 或 10 秒,传错时长直接报错。OpenRouter 提供模型能力查询端点 `/api/v1/videos/models`,返回每个模型支持的分辨率、时长、宽高比、定价和模型特有参数,开发者或编程代理调用前查一次就能避免试错。由于视频生成耗时以分钟计,API 采用异步模式:提交提示词后返回任务 ID,完成后取回视频。

OpenRouter 同时开源了一个多模态工作流演示应用,展示 LLM 生成详细提示词、图像模型生成角色、视频模型生成场景的串联流程。这也是视频生成接入统一路由后最直接的价值:开发者在同一个 API 下组合文本、图像和视频模型,不用分别对接各家 SDK。

信源:https://openrouter.ai/announcements
腾讯开源混元世界模型2.0,一句话生成可走进去的3D世界,直接导入Unity和UE

腾讯正式发布并开源混元 3D 世界模型 2.0(HY-World 2.0)。这是一个多模态世界模型框架,支持文本、单张图片、多视角图片和视频输入,输出不是视频,而是可编辑的 3D 资产(网格模型、3D 高斯溅射、点云),可直接导入 Unity、Unreal Engine 和英伟达 Isaac Sim。模型权重和代码在 GitHub 与 Hugging Face 开源。

和 Genie 3、Cosmos 等视频世界模型的根本区别在于:视频世界模型生成的是像素级视频,播完即消失,无法编辑;HY-World 2.0 生成的是持久存在的 3D 资产,支持自由行走、物理碰撞和二次编辑。腾讯在技术报告中将这个差异总结为「看一段视频然后它消失了」与「建一个世界永久保留」。用消费级 GPU 就能实时渲染,推理只需一次,不像视频世界模型每帧都要跑一遍生成。

技术上分四个阶段:先用 HY-Pano 2.0 从输入生成 360 度全景图,再用 WorldNav 进行轨迹规划,然后用 WorldStereo 2.0 沿轨迹扩展世界,最后用 WorldMirror 2.0 将所有生成片段重建为统一的 3D 场景。在开源方案中,HY-World 2.0 称其为首个达到 SOTA 水平的 3D 世界模型,效果与闭源商业产品 Marble 可比。不过目前只开源了 WorldMirror 2.0(3D 重建模块,约 12 亿参数)的代码和权重,全景生成、轨迹规划和世界扩展三个模块的代码和权重标注为「即将发布」。

对游戏开发者来说,这意味着可以用一句话快速生成关卡原型和地图,省掉大量手工建模时间。对具身智能研究者而言,从照片批量生成仿真训练环境的成本大幅降低。腾讯同时上线了在线体验入口,用户可以操纵角色在生成的街道和建筑中自由探索。

信源:https://3d-models.hunyuan.tencent.com/world/
一个黑客加上Mythos等于一支特种部队:Bloomberg还原Anthropic封锁决策内幕

Anthropic 内部研究员今年 2 月首次拿到 Mythos 时,几小时内就判定它构成国家安全风险。Bloomberg 周三发表长篇调查报道,通过对红队研究员、高管及美国政府官员的具名采访,还原了从发现到封锁的完整决策过程。

AI 安全研究员 Nicholas Carlini 2 月在巴厘岛参加婚礼间隙打开笔记本测试刚开放内部评审的 Mythos,几小时内就发现多条入侵路径,目标涉及全球广泛使用的基础设施。回到旧金山后他发现 Mythos 能自主创建针对 Linux 的入侵工具。前沿红队负责人 Logan Graham 说:「拿到模型几小时内,我们就知道它不一样了。」关键区别在于,前一代旗舰 Opus 4.6 能辅助人类利用漏洞,Mythos 则能独立完成整个利用过程。Graham 向管理层发出警告:这是国家安全风险。

联合创始人兼首席科学官 Jared Kaplan 称他从训练阶段就在「非常仔细地」监控 Mythos,1 月开始意识到这个模型的漏洞发现能力有多强,需要判断这些能力只是技术上的新鲜事,还是「与互联网基础设施高度相关的东西」,最终结论是后者。2 月底至 3 月初,他与联合创始人 Sam McCandlish 向包括 CEO Dario Amodei、总裁 Daniela Amodei 在内的管理层汇报,建议不公开发布但允许外部公司甚至竞争对手试用。3 月第一周,公司正式批准将 Mythos 定位为网络防御工具。

报道还披露了新的测试细节。在一次早期版本测试中,模型自行设计了多步骤攻击方案,突破运行环境限制获取互联网访问权限,然后开始在网上发布内容。在有指令引导的测试中,Mythos 编写了一个串联四个漏洞的浏览器攻击链,这对人类黑客也是极高难度操作。

摩根大通在 Mythos 公开前就已用大模型辅助查找自身软件漏洞,重点扫描供应链和开源组件。据知情人士透露,此前需要数天到数周才能完成的零日漏洞发现和利用代码编写,现在最快只需数分钟。CEO Jamie Dimon 在财报电话会上说,Mythos「说明还有更多漏洞需要修复」。思科首席安全与信任官 Anthony Grieco 则担心攻击者利用 AI 对已停止维护的终端网络设备发起攻击,因为这些设备不会再收到安全补丁。

一名了解美国国防评估的知情人士表示,让单个黑客使用 Mythos 或类似工具,相当于把普通士兵升级为特种部队;犯罪黑客组织可借此达到小型国家情报机构的水平,小国则可能获得大国级别的网络攻击能力。前 NSA 网络安全主管 Rob Joyce 说:「我相信 AI 最终会让我们更安全,但从现在到那天之间有一段黑暗期,攻击方占据绝对优势,基础没打好的组织会被攻破。」

信源:https://www.bloomberg.com/news/features/2026-04-16/how-anthropic-discovered-mythos-ai-was-too-dangerous-for-release
Gemini CLI上线子代理,用Markdown文件就能造一个专属AI编程专家团

谷歌为其开源命令行编程工具 Gemini CLI 正式推出子代理(subagents)功能。每个子代理拥有独立的上下文窗口、系统指令和工具集,主代理在处理复杂任务时自动将子任务分派给最合适的子代理执行,执行结果压缩为摘要返回,不污染主会话上下文。

Gemini CLI 内置三个子代理:generalist(通用代理,适合批量重构等高工具调用量任务)、cli_help(Gemini CLI 自身的使用指南专家)、codebase_investigator(代码库探索、架构梳理和 bug 溯源)。用户也可以用 @agent 语法显式指定由哪个子代理接手,如 `@codebase_investigator 梳理认证流程`。

自定义子代理的创建门槛很低:在 .gemini/agents/ 目录下放一个带 YAML 前置元数据的 Markdown 文件即可,文件中定义角色描述、可用工具和系统指令。放在 ~/.gemini/agents 下的全局生效,放在项目目录下的随代码仓库共享给团队。子代理还可以打包进 Gemini CLI 扩展分发。

子代理支持并行执行,多个子代理可同时处理不同子任务。不过谷歌提醒,涉及代码编辑的并行任务可能产生写入冲突,需谨慎使用。

前一天 Anthropic 也发布了 Claude Code 桌面版重设计,核心同样是多代理并行。AI 编程工具正集体从「单代理对话」转向「主代理调度 + 专家代理执行」的架构,核心驱动力是上下文窗口管理:随着编程任务变复杂,把所有中间步骤塞进一个上下文会导致性能下降和成本上升,拆分成多个隔离代理是目前的工程共识。

信源:https://developers.googleblog.com/subagents-have-arrived-in-gemini-cli/
1
过半美国人认为AI弊大于利,1560亿美元数据中心项目在反对声中搁浅

多项民调显示美国公众对 AI 的态度正在集体转向负面。NBC News 3 月调查发现,57% 的登记选民认为 AI 的风险大于收益;昆尼皮亚克大学民调显示 55% 的受访者预期 AI 对日常生活弊大于利;皮尤研究中心的调查同样发现多数美国人对 AI 普及感到担忧而非兴奋。AI 预计将成为今年中期选举的核心议题之一。

负面情绪已经在转化为政治行动。数据中心监测机构 Data Center Watch 的报告显示,2025 年全美至少 1560 亿美元的数据中心项目因地方反对和诉讼被叫停或搁置。缅因州刚通过法案,将成为全美首个在全州范围内禁建数据中心的州,法案已送交州长签署。密苏里州圣路易斯郊区的选民则因数据中心选址争议,投票罢免了支持该项目的市议员。与此同时,亚马逊、谷歌、微软、Meta 今年合计承诺约 7000 亿美元用于建设 AI 数据中心,行业押注与地方抵制正在迎面对撞。

对 OpenAI 和 Anthropic 而言,民意转向的时机尤其微妙。两家公司都在筹备 IPO,OpenAI 的估值高度依赖数据中心的持续扩建。其 CFO Sarah Friar 此前表示公司计划为散户投资者预留 IPO 份额:「我希望每个人都想拥有 ChatGPT 的一部分。当你是一个消费品牌时,这很有帮助。」但散户的购买意愿与公众对 AI 的好感度直接挂钩,而三份民调给出的答案是一致的:过半美国人认为这项技术弊大于利。

信源:https://www.cnbc.com/2026/04/15/public-opinion-ai-data-centers-anthropic-openai-ipo.html
EvoMap发公开信将Evolver从MIT改为GPL-3.0,自叹「GPL也未必能」防住AI洗代码

AI Agent 自进化引擎 Evolver 的开发团队 EvoMap 发布致 AI 开发者公开信,宣布将许可证从 MIT 变更为 GPL-3.0,同时对核心模块改为混淆发布。此前该团队发文逐模块指控 Nous Research 旗下 Hermes Agent 架构抄袭,Nous Research 创始人 Teknium 否认知情,官方账号回应「删掉你的账号」。

公开信没有点名 Hermes Agent,但称「一个拥有更多资源的海外团队」在 Evolver 公开核心协议后数周内推出了「结构性同构」的框架,「没有致谢,没有提及,连我们引以为豪的自进化的概念也摇身一变成为了他们的卖点」。团队表示无力跨国诉讼,选择以闭源表态。

AI 辅助编程正在让传统开源许可证的保护能力接近失效。AI 可以将一套代码逻辑完整消化后,换一套变量命名和文件结构输出,产物在文本层面与原作毫无相似度。团队自己也承认「MIT 协议保护不了什么,GPL 也未必能」,但「还是得做点什么」。信中列举了近期多起同类事件:美团 Tabbit AI 浏览器公测首日被发现直接使用个人开发者「陪读蛙」的开源代码,源码中残留原项目名称;「三省六部 AI 朝廷」项目开源仅 21 小时即被 AI 重写后以「原创」发布,文本相似度仅 3% 但 15 个核心设计全部一致;微软 Peerd 项目被发现复制个人开源项目 Spegel 的代码和注释。

EvoMap 试图推动的讨论是:当 AI 把代码复制的成本降到接近零、把检测难度提到接近无穷时,开源的激励机制是否还能运转。如果原创者发现公开成果在数周内被资金更充裕的团队转化为竞品,愿意开源核心技术的人只会越来越少。不过 EvoMap 自身的应对也暴露了这一困境的无解性:GPL-3.0 要求衍生作品同样开源,但如果对方的产物在代码层面与原作没有任何文本重合,GPL 的传染性条款根本无从触发。混淆发布则直接削弱了社区贡献的可能性,与开源精神本身背道而驰。

信源:https://mp.weixin.qq.com/s/YPQG9zcVrf3h_wWa1t5DPw
微软Power Apps上线MCP服务器,业务应用可直接被AI代理调用

微软为低代码开发平台 Power Apps 发布一组 AI 更新,核心是 Power Apps MCP 服务器(5 月 4 日正式上线):企业用 Power Apps 搭建的业务应用,可将数据录入、查询、可视化等能力通过 MCP 协议对外暴露,供 Copilot 和自定义代理直接调用,调用时遵循与人类用户相同的权限和业务规则。

这实现了应用与 AI 的双向打通。向内,Microsoft 365 Copilot 已在 Power Apps 模型驱动应用中正式上线(canvas 应用进入公开预览),用户在应用内可用自然语言搜索数据、自动将邮件转为表单字段、生成活动历史摘要。向外,应用的业务逻辑通过 MCP 输出为代理可调用的工具。微软举例,一个积累了多年招聘政策的 Power Apps 应用,现在可以驱动一个遵守同样规则和权限的 AI 招聘代理,不用从零重写逻辑。

同期推出的「代理动态流」(Agent Feed,5 月正式上线)解决代理监管问题:管理员设定审批阈值,低风险操作后台自动完成,高影响操作(如发送邮件)弹出人工确认,审批界面嵌在业务应用内部,不需要单独的监控工具。MCP 协议此前主要在开发者工具和 AI 编程助手中应用,微软将其引入企业业务软件,是该协议向更广泛企业场景扩展的一步。

信源:https://www.microsoft.com/en-us/power-platform/blog/2026/04/15/making-business-apps-smarter-with-ai-copilot-and-agents-in-power-apps/
1
阿里巴巴推出世界模型Happy Oyster,用户可实时下令改写AI正在生成的场景

阿里巴巴推出世界模型产品 Happy Oyster,定位不是 AI 视频生成工具,而是实时可交互的世界引擎。与现有 AI 视频工具「写提示词、等渲染、收成片」的一次性流程不同,Happy Oyster 在生成过程中持续接收指令,场景实时响应并继续演化。

产品分两个模式。「导演」模式让用户充当实时导演:生成内容是维持光照、重力、角色运动和场景因果关系的持续物理世界,用户可随时用文字、语音或图片切换镜头角度、指挥角色、改变故事走向,世界立即响应并继续展开。「漫游」模式让用户以第一人称自由移动,支持键盘和摄像机控制,走出初始画框后世界持续生成并保持连贯。技术参数:导演模式最长 3 分钟、最高 720p;漫游模式上限 1 分钟、480p;两者均支持多模态输入并同步输出音频。

对影视和游戏行业来说,Happy Oyster 把 AI 视频生成从「批量生产素材」推向了「实时虚拟制片」。导演可以在生成过程中调整视觉风格,不需要每次改动都重新完整渲染;游戏开发者则可以用文字描述生成可行走的关卡原型。阿里巴巴近期密集发布新模型、重组组织架构聚焦 AI 商业化,Happy Oyster 是其中定位最偏向内容创作者和游戏开发者的一款。

信源:https://www.happyoyster.cn/docs
Claude Opus 4.7提前现身谷歌Vertex AI,发布或在本周

多名用户在谷歌云控制台和 Vertex AI 后台发现了 Claude Opus 4.7 的模型标识符(`anthropic-claude-opus-4-7`),完整字段已出现在模型筛选列表中,表明该模型已写入谷歌云基础设施。Anthropic 尚未官方宣布发布。

此前已有多家科技媒体报道 Anthropic 正准备在本周发布 Claude Opus 4.7,并同步推出一款 AI 设计工具。据报道,Opus 4.7 是对 Opus 4.6 的增量升级,在多步推理、长时任务处理和代理协调方面有所提升。

Anthropic 目前采用双轨策略:持续向商业用户推送 Opus 系列更新,同时将能力更强的 Claude Mythos 严格管控不对外发布。Vertex AI 后台提前现身是常见的「软发布」信号:模型基础设施和 API 端点往往在官方公告前数小时到数天就已就位,正式发布窗口很可能在本周之内。
Claude Code团队详解百万token上下文管理:模型在压缩摘要时智力最低,rewind才是最该养成的习惯

Anthropic Claude Code 团队工程师 Thariq Shihipar 发布长帖,系统讲解 Claude Code 升级到 100 万 token 上下文窗口后如何管理会话,同时宣布更新了 /usage 面板,帮助用户了解自己的使用模式。

帖子的核心概念是「上下文腐烂」(context rot):随着对话变长,模型注意力被分散到越来越多的 token 上,旧的、无关内容开始干扰当前任务,模型表现因此下降。百万上下文让任务跨度更长,但并不意味着可以无限堆积对话。

Shihipar 认为用户最该养成的习惯是 rewind(双击 Esc 键)。当 Claude 尝试了一种方案但失败时,多数人的本能是发一句「这个不行,试试 X」,但更好的做法是回退到方案执行前,把失败经验写进新提示词重新来过,而不是让失败的中间过程留在上下文里占用注意力。

关于上下文压缩(compaction),他指出一个反直觉的问题:模型在最需要聪明的时候反而最笨。压缩发生在上下文即将撑满的时刻,此时上下文腐烂最严重,模型判断力最差,容易丢掉关键信息。典型场景是一轮长时间的调试后触发自动压缩,模型把摘要聚焦在调试过程上,而用户下一步想处理的其他问题被丢弃了。百万上下文给了用户更多余裕,可以在手动输入 /compact 时附加指令(如「只保留 auth 重构相关内容」),主动引导压缩方向。

他还建议将子代理(subagents)视为上下文管理工具:把会产生大量中间输出、但只需要最终结论的任务交给子代理,在独立的上下文窗口中完成,只将结果带回主会话。判断标准是「我需要的是过程还是结论」。

用户在每一轮对话结束后实际上面临五个选择:继续对话、rewind 回退重试、/clear 清空重新开始、/compact 压缩继续、或派出子代理。新任务开新会话,相关任务(如刚写完功能接着写文档)可以留在同一会话以复用已读取的文件。

信源:https://x.com/trq212/status/2044548257058328723
1
美众议员提案将模型蒸馏定性为工业间谍,DeepSeek等中国AI公司拟被列入制裁名单

美国众议院共和党议员 Bill Huizenga 提出《遏制美国AI模型被盗法案》,要求政府识别中国和俄罗斯利用「查询复制」技术从美国AI模型中提取能力的主体,并授权商务部将其列入实体清单,或援引1977年《国际紧急经济权力法》对其实施制裁。该法案由众议院中国问题特别委员会主席 John Moolenaar 联署,预计下周在众议院外交委员会审议。

所谓「对抗性蒸馏」,是指用成熟的大模型(「教师」)大规模查询训练新模型(「学生」),以极低成本复制前者的能力。这一技术本身在一定范围内被容忍,但未经授权复制领先AI模型则违反服务条款。OpenAI今年早些时候向众议院中国委员会披露,DeepSeek曾未经授权大规模查询 ChatGPT 以训练自身模型,且在 OpenAI 反制后持续改变手法绕过限制。谷歌和 Anthropic 随后也发布公开报告,证实在各自平台上观察到类似异常访问行为。

众议院中国委员会的配套报告将进一步点名 DeepSeek、Moonshot AI、MiniMax,建议司法部对上述行为提起诉讼,并要求商务部评估将三家公司列入实体清单。报告还识别出两个公开代码工具和三个中间商,称它们为阿里巴巴、腾讯、百度以及清华大学、北京大学等机构提供了绕过限制访问美国闭源AI模型的渠道。

Huizenga 在声明中点名 Anthropic 的 Mythos:「美国AI模型正展现出变革性的网络能力,防止中国盗取这些技术进展至关重要。」OpenAI、Anthropic、谷歌已开始互相共享信息以检测异常蒸馏行为。本次立法试图将这种私下协作升格为政府主导的执法机制——中国AI公司面临的不再是账号封禁,而是实体清单和经济制裁。

信源:https://bloomberg.com/news/articles/2026-04-16/us-house-to-weigh-penalties-on-ai-model-copying-by-chinese-firms
OpenAI发布政策报告游说AI进入生命科学,但至今没有一款AI发现的药物通过三期临床

OpenAI 政策、研究与科学团队发布报告,主张扩大 AI 在生命科学领域的应用,并向 Axios 独家提前分享。报告呼吁三件事:开放更多医疗和科学数据的访问权限、将先进 AI 视为「国家级研究资源」、加大对算力、实验室和能源等「物理基础设施」的投资。

报告称 AI 能加速药物发现、自主设计研究工具、将实验室流程从数月压缩到数天。其中一项分析估计,AI 工具可将临床试验阶段的时间线缩短 20% 以上。OpenAI 还特别提到 GPT-5 Pro 能为尚无有效疗法的疾病寻找已获 FDA 批准药物的新用途。

但现实与愿景之间差距明显。目前仅有极少数 AI 发现或 AI 设计的药物进入临床试验阶段,没有任何一款完成三期临床。2025 年年中发表在 Nature Medicine 上的一篇论文显示,AI 发现的药物在二期临床的失败率与传统方式发现的药物相当。该论文研究者写道:「AI 能否对药物研发产生有意义的、持续性的颠覆,这个问题仍未得到回答。」

报告的政策诉求也值得留意。OpenAI 希望政府开放医疗数据、在国家层面为 AI 研发提供特殊地位和资源倾斜,这本质上是在为自身产品争取更大的市场准入。在美国,一款新药从研究到获批通常需要 12 至 15 年,AI 承诺缩短这一周期的叙事对制药业和监管机构都有吸引力,但目前的临床证据尚不足以支撑这些承诺。同一周内,亚马逊也推出了 AI 药物分子生成工具 Bio Discovery,大型科技公司争相进入这一领域。

信源:https://www.axios.com/2026/04/15/exclusive-openai-ai-life-science
Cursor Agent现在可以造仪表盘:Canvas让AI输出从文字变成可交互界面

Cursor 3.1 推出 Canvas 功能。Agent 处理完任务后,输出不再只是代码或 markdown 文字,可以直接生成一个可交互的 React 界面,里面有图表、表格、diff 视图或自定义逻辑。Canvas 作为持久工件存在于 Agents Window,与终端、浏览器、版本控制并排显示。

核心变化在于信息密度。以事故响应为例:此前 Agent 把 Datadog、Databricks、Sentry 的时序数据整理成 markdown 表格,难以解读,还要自己再做可视化。现在 Agent 直接把多来源数据合并进同一张 Canvas 图表里。PR 审查同理:Agent 可以按重要性对变更分组、为复杂算法生成伪代码,而不是把所有 diff 平铺出来。

Cursor 团队自己在 Eval 分析中也用了 Canvas。此前工程师要逐条翻 request ID 查失败模式,一度考虑单独开发一个 web app,最终改为直接在 Cursor 里建一个 Skill,让 Agent 读取所有 rollout、归类失败原因、生成可交互的分析界面,这套流程帮助团队在近期两次新模型上线中显著减少了排查时间。

Canvas 支持自定义扩展:在 Cursor Marketplace 发布的 Docs Canvas Skill 可以让 Agent 为任意代码仓库生成交互式架构图。用户也可以自己编写 Skill 来定义 Agent 生成哪种类型的 Canvas。

信源:https://cursor.com/blog/canvas
Windsurf 2.0把IDE变成代理调度中心,Devin云端代理免费内置

Cognition AI 发布 Windsurf 2.0,核心更新是「代理指挥中心」(Agent Command Center)和 Devin 云端代理直接内置。IDE 不再只是写代码的地方,变成了管理一支 AI 代理团队的调度台。

代理指挥中心用看板(Kanban)视图展示所有正在运行的代理,本地和云端统一管理,按状态分列。设计意图很明确:当工程师同时跑几十个代理处理同一项目的不同部分时,瓶颈不是代码能力,是人的注意力和工作记忆。看板让工程师一眼看清哪个代理在干活、哪个卡住了、哪个等待审查。

「空间」(Spaces)是新增的工作组织单元。一个空间把一项任务相关的所有东西打包在一起:代理会话、PR、文件和上下文。在空间内新建代理会话时,自动继承该空间已有的项目上下文,不需要每次重新描述需求。切换空间就是切换任务,每个任务背后有一组代理在运行。

Devin 是 Cognition 此前独立运营的自主编程代理,拥有自己的云端虚拟机、桌面环境和浏览器,能端到端完成调试、部署、测试等任务。现在直接内置进 Windsurf:用户可以在本地代理上制定方案,一键派给 Devin 在云端执行,合上笔记本也不中断。Devin 完成后提交 PR,用户在 Windsurf 里直接审查 diff、跑测试或交给本地代理修缮。Devin 对所有 Windsurf 套餐用户开放,正在分批上线。

信源:https://windsurf.com/blog/windsurf-2-0
Cloudflare发布Project Think,要让AI代理像网站一样部署到云端:崩溃自恢复、闲时零成本

Cloudflare 发布 Project Think,为其开源 Agents SDK 新增一整套构建长期运行 AI 代理的基础设施:持久化执行、子代理、沙箱代码执行和持久会话。开发者可以单独使用这些组件,也可以直接用 Think 基类快速搭建完整的代理应用,用 npx wrangler deploy 一键部署到 Cloudflare 全球网络。目前为预览版。

Project Think 要解决的核心问题是:当前的编程代理(Claude Code、Codex、OpenClaw 等)只能跑在本地笔记本或昂贵的 VPS 上,笔记本合盖就断,无法多人协作,闲置时仍在烧钱。Cloudflare 的方案基于 Durable Objects(持久化对象),每个代理是一个独立的 actor,自带 SQLite 数据库,无事可做时休眠,收到请求时被唤醒,闲时计算成本为零。按 Cloudflare 的计算,1 万个代理各自仅 1% 时间活跃,传统容器方案需要 1 万个常驻实例,Durable Objects 任意时刻只有约 100 个在运行。

技术上有几个值得关注的设计:

1. 持久化执行(Fibers):代理运行中如果环境崩溃(部署更新、平台重启、资源耗尽),SDK 在 SQLite 中记录了检查点,重启后从断点恢复,不丢失进度
2. 代码模式(codemode):不让模型逐个调用工具再逐个读取结果,而是让模型直接写一段程序一次性完成任务。Cloudflare 用自家 API 的 MCP 服务器举例:暴露全部 API 端点需要约 117 万 token 描述工具,改用 codemode 只需两个工具(search 和 execute)约 1000 token,减少 99.9%
3. 五级执行阶梯:从最轻量的虚拟文件系统(Tier 0)到完整的沙箱环境(Tier 4,支持 git clone、npm test 等),代理按需逐级升级能力,不必一开始就启动重量级容器
4. 自编写扩展:代理可以在运行时自己编写 TypeScript 扩展并注册为新工具,扩展在沙箱中运行,权限受控。比如用户让代理管理 GitHub PR,代理可以当场写一个 GitHub 集成扩展,下次直接调用

Cloudflare 在博客中将 AI 代理分为三个阶段:第一波是无状态聊天机器人,第二波是本地运行的编程代理,第三波是作为云基础设施运行的持久化代理。Project Think 是 Cloudflare 对第三波的押注。对开发者而言,这套方案的吸引力在于将代理的运维成本从「按实例计费」变成「按实际使用计费」,如果代理大部分时间在等待用户指令,成本接近于零。

信源:https://blog.cloudflare.com/project-think/
阶跃StepAudio 2.5 TTS上线,情绪控制精细到「克制的悲伤、没有哭腔」

阶跃星辰正式发布 StepAudio 2.5 TTS。与需要预设情绪标签的传统 TTS 不同,这一代支持用自然语言描述控制语音的每一处细节:标签只能表达「悲伤」,自然语言可以进一步描述「克制的悲伤、没有哭腔、轻轻发颤」,AI 据此合成对应音色。

控制分三层。全局语境控制设定整段语音的情绪基调和场景氛围,让多轮对话中的角色表达保持连贯;文中语境控制在句子层面调节语气、节奏、停顿、重音和呼吸感,甚至可以刻画角色的心理活动和潜台词;零样本音色复刻(Zeroshot TTS)无需重新训练,任意参考录音即可仿出音色,情感和风格可独立调节。三项功能已全量上线阶跃星辰开放平台和 Step Plan。

同一天,谷歌也发布了 Gemini 3.1 Flash TTS,同样以自然语言指令替代 SSML 标签实现精细控制,并在第三方评测中登顶。两家在同日用相同思路发版,说明 TTS 的控制范式正在集体从「选标签」转向「说需求」。对有声内容创作者和配音导演来说,以前调情绪要靠反复录制,现在用一句话描述就能定义音色的细腻层次。

信源:https://mp.weixin.qq.com/s/8SKwa5105umsFeIiUz-eEg
MiniMax推出云端Hermes助手MaxHermes:完成任务后自动提炼技能,越用越懂你

MiniMax 今日正式上线 MaxHermes,将 Hermes Agent 打包为官方云端 AI 助手。核心差异在于零部署门槛:无需自备服务器或 API Key,已打通飞书、钉钉、企业微信三个 IM 渠道,7×24 小时在线,费用可用 Token Plan 抵扣。

重点卖点是自我进化机制。每完成一项复杂任务,MaxHermes 自动从中提炼可复用技能,保存为独立文档,后续任务按需调用并根据反馈持续改进。MiniMax 将此与 OpenClaw 作对比:OpenClaw 的技能依赖人工预设,部署后即固定;MaxHermes 的技能由 Agent 自主生成和迭代。叠加跨会话持久记忆、自然语言设定定时任务和多子代理并行机制,底层模型为 MiniMax M2.7。

Hermes Agent 此前需要用户自行部署,MaxHermes 是 MiniMax 将其打包为自家托管产品的首次落地。后续计划接入 Skillhub 社区,MaxClaw 用户可一键迁移已有的技能和人设配置。

信源:https://mp.weixin.qq.com/s/gTUk7CpQYstYcAMzqClAow
黄仁勋:Anthropic用谷歌TPU是当初投资换来的,没早点投Anthropic是我的失误

英伟达 CEO 黄仁勋在接受播客主持人 Dwarkesh Patel 采访时坦承,未能在 Anthropic 创立早期参与投资是一个失误,同时首次公开解释了 Anthropic 算力主要依赖谷歌 TPU 和亚马逊 Trainium 的原因。

谷歌和 AWS 在 Anthropic 早期投入了数十亿美元,作为交换,Anthropic 的算力主要使用这两家公司的平台。黄仁勋说,当时英伟达没有做出同样规模投资的能力和意识:「我没有深刻意识到,VC 根本不可能给一家 AI 实验室投入 50 亿到 100 亿美元。他们没有其他选项,这是我的失误。」他说如果可以重来、且英伟达当时有今天的体量,「我会非常乐意做这件事」。

他明确否定了「专用芯片正在替代 GPU」的市场叙事:「Anthropic 是一个特例,不是趋势。没有 Anthropic,TPU 的增长从哪里来?完全来自 Anthropic。没有 Anthropic,Trainium 的增长从哪里来?完全来自 Anthropic。」在他看来,Anthropic 用专用芯片反映的是投资协议的约束,不是性能或成本层面的技术判断。

英伟达此后通过后期大额投资弥补了这一缺位。今年 2 月,英伟达向 OpenAI 投资 300 亿美元(主要以 GPU 算力和基础设施承诺的形式),黄仁勋称这可能是 OpenAI 上市前「最后一次」投资。去年 11 月,英伟达与微软联合向 Anthropic 投资,英伟达出资最高 100 亿美元,推动 Anthropic 估值升至约 3500 亿美元。黄仁勋在采访中说,这两笔投资的逻辑一样:「世界需要他们存在。」

信源:https://www.youtube.com/watch?v=Hrbq66XqtCo
1