动察Beating AI News
3.19K subscribers
902 photos
2 videos
1 file
3.44K links
AI新闻信息流
Download Telegram
过半美国人认为AI弊大于利,1560亿美元数据中心项目在反对声中搁浅

多项民调显示美国公众对 AI 的态度正在集体转向负面。NBC News 3 月调查发现,57% 的登记选民认为 AI 的风险大于收益;昆尼皮亚克大学民调显示 55% 的受访者预期 AI 对日常生活弊大于利;皮尤研究中心的调查同样发现多数美国人对 AI 普及感到担忧而非兴奋。AI 预计将成为今年中期选举的核心议题之一。

负面情绪已经在转化为政治行动。数据中心监测机构 Data Center Watch 的报告显示,2025 年全美至少 1560 亿美元的数据中心项目因地方反对和诉讼被叫停或搁置。缅因州刚通过法案,将成为全美首个在全州范围内禁建数据中心的州,法案已送交州长签署。密苏里州圣路易斯郊区的选民则因数据中心选址争议,投票罢免了支持该项目的市议员。与此同时,亚马逊、谷歌、微软、Meta 今年合计承诺约 7000 亿美元用于建设 AI 数据中心,行业押注与地方抵制正在迎面对撞。

对 OpenAI 和 Anthropic 而言,民意转向的时机尤其微妙。两家公司都在筹备 IPO,OpenAI 的估值高度依赖数据中心的持续扩建。其 CFO Sarah Friar 此前表示公司计划为散户投资者预留 IPO 份额:「我希望每个人都想拥有 ChatGPT 的一部分。当你是一个消费品牌时,这很有帮助。」但散户的购买意愿与公众对 AI 的好感度直接挂钩,而三份民调给出的答案是一致的:过半美国人认为这项技术弊大于利。

信源:https://www.cnbc.com/2026/04/15/public-opinion-ai-data-centers-anthropic-openai-ipo.html
EvoMap发公开信将Evolver从MIT改为GPL-3.0,自叹「GPL也未必能」防住AI洗代码

AI Agent 自进化引擎 Evolver 的开发团队 EvoMap 发布致 AI 开发者公开信,宣布将许可证从 MIT 变更为 GPL-3.0,同时对核心模块改为混淆发布。此前该团队发文逐模块指控 Nous Research 旗下 Hermes Agent 架构抄袭,Nous Research 创始人 Teknium 否认知情,官方账号回应「删掉你的账号」。

公开信没有点名 Hermes Agent,但称「一个拥有更多资源的海外团队」在 Evolver 公开核心协议后数周内推出了「结构性同构」的框架,「没有致谢,没有提及,连我们引以为豪的自进化的概念也摇身一变成为了他们的卖点」。团队表示无力跨国诉讼,选择以闭源表态。

AI 辅助编程正在让传统开源许可证的保护能力接近失效。AI 可以将一套代码逻辑完整消化后,换一套变量命名和文件结构输出,产物在文本层面与原作毫无相似度。团队自己也承认「MIT 协议保护不了什么,GPL 也未必能」,但「还是得做点什么」。信中列举了近期多起同类事件:美团 Tabbit AI 浏览器公测首日被发现直接使用个人开发者「陪读蛙」的开源代码,源码中残留原项目名称;「三省六部 AI 朝廷」项目开源仅 21 小时即被 AI 重写后以「原创」发布,文本相似度仅 3% 但 15 个核心设计全部一致;微软 Peerd 项目被发现复制个人开源项目 Spegel 的代码和注释。

EvoMap 试图推动的讨论是:当 AI 把代码复制的成本降到接近零、把检测难度提到接近无穷时,开源的激励机制是否还能运转。如果原创者发现公开成果在数周内被资金更充裕的团队转化为竞品,愿意开源核心技术的人只会越来越少。不过 EvoMap 自身的应对也暴露了这一困境的无解性:GPL-3.0 要求衍生作品同样开源,但如果对方的产物在代码层面与原作没有任何文本重合,GPL 的传染性条款根本无从触发。混淆发布则直接削弱了社区贡献的可能性,与开源精神本身背道而驰。

信源:https://mp.weixin.qq.com/s/YPQG9zcVrf3h_wWa1t5DPw
微软Power Apps上线MCP服务器,业务应用可直接被AI代理调用

微软为低代码开发平台 Power Apps 发布一组 AI 更新,核心是 Power Apps MCP 服务器(5 月 4 日正式上线):企业用 Power Apps 搭建的业务应用,可将数据录入、查询、可视化等能力通过 MCP 协议对外暴露,供 Copilot 和自定义代理直接调用,调用时遵循与人类用户相同的权限和业务规则。

这实现了应用与 AI 的双向打通。向内,Microsoft 365 Copilot 已在 Power Apps 模型驱动应用中正式上线(canvas 应用进入公开预览),用户在应用内可用自然语言搜索数据、自动将邮件转为表单字段、生成活动历史摘要。向外,应用的业务逻辑通过 MCP 输出为代理可调用的工具。微软举例,一个积累了多年招聘政策的 Power Apps 应用,现在可以驱动一个遵守同样规则和权限的 AI 招聘代理,不用从零重写逻辑。

同期推出的「代理动态流」(Agent Feed,5 月正式上线)解决代理监管问题:管理员设定审批阈值,低风险操作后台自动完成,高影响操作(如发送邮件)弹出人工确认,审批界面嵌在业务应用内部,不需要单独的监控工具。MCP 协议此前主要在开发者工具和 AI 编程助手中应用,微软将其引入企业业务软件,是该协议向更广泛企业场景扩展的一步。

信源:https://www.microsoft.com/en-us/power-platform/blog/2026/04/15/making-business-apps-smarter-with-ai-copilot-and-agents-in-power-apps/
1
阿里巴巴推出世界模型Happy Oyster,用户可实时下令改写AI正在生成的场景

阿里巴巴推出世界模型产品 Happy Oyster,定位不是 AI 视频生成工具,而是实时可交互的世界引擎。与现有 AI 视频工具「写提示词、等渲染、收成片」的一次性流程不同,Happy Oyster 在生成过程中持续接收指令,场景实时响应并继续演化。

产品分两个模式。「导演」模式让用户充当实时导演:生成内容是维持光照、重力、角色运动和场景因果关系的持续物理世界,用户可随时用文字、语音或图片切换镜头角度、指挥角色、改变故事走向,世界立即响应并继续展开。「漫游」模式让用户以第一人称自由移动,支持键盘和摄像机控制,走出初始画框后世界持续生成并保持连贯。技术参数:导演模式最长 3 分钟、最高 720p;漫游模式上限 1 分钟、480p;两者均支持多模态输入并同步输出音频。

对影视和游戏行业来说,Happy Oyster 把 AI 视频生成从「批量生产素材」推向了「实时虚拟制片」。导演可以在生成过程中调整视觉风格,不需要每次改动都重新完整渲染;游戏开发者则可以用文字描述生成可行走的关卡原型。阿里巴巴近期密集发布新模型、重组组织架构聚焦 AI 商业化,Happy Oyster 是其中定位最偏向内容创作者和游戏开发者的一款。

信源:https://www.happyoyster.cn/docs
Claude Opus 4.7提前现身谷歌Vertex AI,发布或在本周

多名用户在谷歌云控制台和 Vertex AI 后台发现了 Claude Opus 4.7 的模型标识符(`anthropic-claude-opus-4-7`),完整字段已出现在模型筛选列表中,表明该模型已写入谷歌云基础设施。Anthropic 尚未官方宣布发布。

此前已有多家科技媒体报道 Anthropic 正准备在本周发布 Claude Opus 4.7,并同步推出一款 AI 设计工具。据报道,Opus 4.7 是对 Opus 4.6 的增量升级,在多步推理、长时任务处理和代理协调方面有所提升。

Anthropic 目前采用双轨策略:持续向商业用户推送 Opus 系列更新,同时将能力更强的 Claude Mythos 严格管控不对外发布。Vertex AI 后台提前现身是常见的「软发布」信号:模型基础设施和 API 端点往往在官方公告前数小时到数天就已就位,正式发布窗口很可能在本周之内。
Claude Code团队详解百万token上下文管理:模型在压缩摘要时智力最低,rewind才是最该养成的习惯

Anthropic Claude Code 团队工程师 Thariq Shihipar 发布长帖,系统讲解 Claude Code 升级到 100 万 token 上下文窗口后如何管理会话,同时宣布更新了 /usage 面板,帮助用户了解自己的使用模式。

帖子的核心概念是「上下文腐烂」(context rot):随着对话变长,模型注意力被分散到越来越多的 token 上,旧的、无关内容开始干扰当前任务,模型表现因此下降。百万上下文让任务跨度更长,但并不意味着可以无限堆积对话。

Shihipar 认为用户最该养成的习惯是 rewind(双击 Esc 键)。当 Claude 尝试了一种方案但失败时,多数人的本能是发一句「这个不行,试试 X」,但更好的做法是回退到方案执行前,把失败经验写进新提示词重新来过,而不是让失败的中间过程留在上下文里占用注意力。

关于上下文压缩(compaction),他指出一个反直觉的问题:模型在最需要聪明的时候反而最笨。压缩发生在上下文即将撑满的时刻,此时上下文腐烂最严重,模型判断力最差,容易丢掉关键信息。典型场景是一轮长时间的调试后触发自动压缩,模型把摘要聚焦在调试过程上,而用户下一步想处理的其他问题被丢弃了。百万上下文给了用户更多余裕,可以在手动输入 /compact 时附加指令(如「只保留 auth 重构相关内容」),主动引导压缩方向。

他还建议将子代理(subagents)视为上下文管理工具:把会产生大量中间输出、但只需要最终结论的任务交给子代理,在独立的上下文窗口中完成,只将结果带回主会话。判断标准是「我需要的是过程还是结论」。

用户在每一轮对话结束后实际上面临五个选择:继续对话、rewind 回退重试、/clear 清空重新开始、/compact 压缩继续、或派出子代理。新任务开新会话,相关任务(如刚写完功能接着写文档)可以留在同一会话以复用已读取的文件。

信源:https://x.com/trq212/status/2044548257058328723
1
美众议员提案将模型蒸馏定性为工业间谍,DeepSeek等中国AI公司拟被列入制裁名单

美国众议院共和党议员 Bill Huizenga 提出《遏制美国AI模型被盗法案》,要求政府识别中国和俄罗斯利用「查询复制」技术从美国AI模型中提取能力的主体,并授权商务部将其列入实体清单,或援引1977年《国际紧急经济权力法》对其实施制裁。该法案由众议院中国问题特别委员会主席 John Moolenaar 联署,预计下周在众议院外交委员会审议。

所谓「对抗性蒸馏」,是指用成熟的大模型(「教师」)大规模查询训练新模型(「学生」),以极低成本复制前者的能力。这一技术本身在一定范围内被容忍,但未经授权复制领先AI模型则违反服务条款。OpenAI今年早些时候向众议院中国委员会披露,DeepSeek曾未经授权大规模查询 ChatGPT 以训练自身模型,且在 OpenAI 反制后持续改变手法绕过限制。谷歌和 Anthropic 随后也发布公开报告,证实在各自平台上观察到类似异常访问行为。

众议院中国委员会的配套报告将进一步点名 DeepSeek、Moonshot AI、MiniMax,建议司法部对上述行为提起诉讼,并要求商务部评估将三家公司列入实体清单。报告还识别出两个公开代码工具和三个中间商,称它们为阿里巴巴、腾讯、百度以及清华大学、北京大学等机构提供了绕过限制访问美国闭源AI模型的渠道。

Huizenga 在声明中点名 Anthropic 的 Mythos:「美国AI模型正展现出变革性的网络能力,防止中国盗取这些技术进展至关重要。」OpenAI、Anthropic、谷歌已开始互相共享信息以检测异常蒸馏行为。本次立法试图将这种私下协作升格为政府主导的执法机制——中国AI公司面临的不再是账号封禁,而是实体清单和经济制裁。

信源:https://bloomberg.com/news/articles/2026-04-16/us-house-to-weigh-penalties-on-ai-model-copying-by-chinese-firms
OpenAI发布政策报告游说AI进入生命科学,但至今没有一款AI发现的药物通过三期临床

OpenAI 政策、研究与科学团队发布报告,主张扩大 AI 在生命科学领域的应用,并向 Axios 独家提前分享。报告呼吁三件事:开放更多医疗和科学数据的访问权限、将先进 AI 视为「国家级研究资源」、加大对算力、实验室和能源等「物理基础设施」的投资。

报告称 AI 能加速药物发现、自主设计研究工具、将实验室流程从数月压缩到数天。其中一项分析估计,AI 工具可将临床试验阶段的时间线缩短 20% 以上。OpenAI 还特别提到 GPT-5 Pro 能为尚无有效疗法的疾病寻找已获 FDA 批准药物的新用途。

但现实与愿景之间差距明显。目前仅有极少数 AI 发现或 AI 设计的药物进入临床试验阶段,没有任何一款完成三期临床。2025 年年中发表在 Nature Medicine 上的一篇论文显示,AI 发现的药物在二期临床的失败率与传统方式发现的药物相当。该论文研究者写道:「AI 能否对药物研发产生有意义的、持续性的颠覆,这个问题仍未得到回答。」

报告的政策诉求也值得留意。OpenAI 希望政府开放医疗数据、在国家层面为 AI 研发提供特殊地位和资源倾斜,这本质上是在为自身产品争取更大的市场准入。在美国,一款新药从研究到获批通常需要 12 至 15 年,AI 承诺缩短这一周期的叙事对制药业和监管机构都有吸引力,但目前的临床证据尚不足以支撑这些承诺。同一周内,亚马逊也推出了 AI 药物分子生成工具 Bio Discovery,大型科技公司争相进入这一领域。

信源:https://www.axios.com/2026/04/15/exclusive-openai-ai-life-science
Cursor Agent现在可以造仪表盘:Canvas让AI输出从文字变成可交互界面

Cursor 3.1 推出 Canvas 功能。Agent 处理完任务后,输出不再只是代码或 markdown 文字,可以直接生成一个可交互的 React 界面,里面有图表、表格、diff 视图或自定义逻辑。Canvas 作为持久工件存在于 Agents Window,与终端、浏览器、版本控制并排显示。

核心变化在于信息密度。以事故响应为例:此前 Agent 把 Datadog、Databricks、Sentry 的时序数据整理成 markdown 表格,难以解读,还要自己再做可视化。现在 Agent 直接把多来源数据合并进同一张 Canvas 图表里。PR 审查同理:Agent 可以按重要性对变更分组、为复杂算法生成伪代码,而不是把所有 diff 平铺出来。

Cursor 团队自己在 Eval 分析中也用了 Canvas。此前工程师要逐条翻 request ID 查失败模式,一度考虑单独开发一个 web app,最终改为直接在 Cursor 里建一个 Skill,让 Agent 读取所有 rollout、归类失败原因、生成可交互的分析界面,这套流程帮助团队在近期两次新模型上线中显著减少了排查时间。

Canvas 支持自定义扩展:在 Cursor Marketplace 发布的 Docs Canvas Skill 可以让 Agent 为任意代码仓库生成交互式架构图。用户也可以自己编写 Skill 来定义 Agent 生成哪种类型的 Canvas。

信源:https://cursor.com/blog/canvas
Windsurf 2.0把IDE变成代理调度中心,Devin云端代理免费内置

Cognition AI 发布 Windsurf 2.0,核心更新是「代理指挥中心」(Agent Command Center)和 Devin 云端代理直接内置。IDE 不再只是写代码的地方,变成了管理一支 AI 代理团队的调度台。

代理指挥中心用看板(Kanban)视图展示所有正在运行的代理,本地和云端统一管理,按状态分列。设计意图很明确:当工程师同时跑几十个代理处理同一项目的不同部分时,瓶颈不是代码能力,是人的注意力和工作记忆。看板让工程师一眼看清哪个代理在干活、哪个卡住了、哪个等待审查。

「空间」(Spaces)是新增的工作组织单元。一个空间把一项任务相关的所有东西打包在一起:代理会话、PR、文件和上下文。在空间内新建代理会话时,自动继承该空间已有的项目上下文,不需要每次重新描述需求。切换空间就是切换任务,每个任务背后有一组代理在运行。

Devin 是 Cognition 此前独立运营的自主编程代理,拥有自己的云端虚拟机、桌面环境和浏览器,能端到端完成调试、部署、测试等任务。现在直接内置进 Windsurf:用户可以在本地代理上制定方案,一键派给 Devin 在云端执行,合上笔记本也不中断。Devin 完成后提交 PR,用户在 Windsurf 里直接审查 diff、跑测试或交给本地代理修缮。Devin 对所有 Windsurf 套餐用户开放,正在分批上线。

信源:https://windsurf.com/blog/windsurf-2-0
Cloudflare发布Project Think,要让AI代理像网站一样部署到云端:崩溃自恢复、闲时零成本

Cloudflare 发布 Project Think,为其开源 Agents SDK 新增一整套构建长期运行 AI 代理的基础设施:持久化执行、子代理、沙箱代码执行和持久会话。开发者可以单独使用这些组件,也可以直接用 Think 基类快速搭建完整的代理应用,用 npx wrangler deploy 一键部署到 Cloudflare 全球网络。目前为预览版。

Project Think 要解决的核心问题是:当前的编程代理(Claude Code、Codex、OpenClaw 等)只能跑在本地笔记本或昂贵的 VPS 上,笔记本合盖就断,无法多人协作,闲置时仍在烧钱。Cloudflare 的方案基于 Durable Objects(持久化对象),每个代理是一个独立的 actor,自带 SQLite 数据库,无事可做时休眠,收到请求时被唤醒,闲时计算成本为零。按 Cloudflare 的计算,1 万个代理各自仅 1% 时间活跃,传统容器方案需要 1 万个常驻实例,Durable Objects 任意时刻只有约 100 个在运行。

技术上有几个值得关注的设计:

1. 持久化执行(Fibers):代理运行中如果环境崩溃(部署更新、平台重启、资源耗尽),SDK 在 SQLite 中记录了检查点,重启后从断点恢复,不丢失进度
2. 代码模式(codemode):不让模型逐个调用工具再逐个读取结果,而是让模型直接写一段程序一次性完成任务。Cloudflare 用自家 API 的 MCP 服务器举例:暴露全部 API 端点需要约 117 万 token 描述工具,改用 codemode 只需两个工具(search 和 execute)约 1000 token,减少 99.9%
3. 五级执行阶梯:从最轻量的虚拟文件系统(Tier 0)到完整的沙箱环境(Tier 4,支持 git clone、npm test 等),代理按需逐级升级能力,不必一开始就启动重量级容器
4. 自编写扩展:代理可以在运行时自己编写 TypeScript 扩展并注册为新工具,扩展在沙箱中运行,权限受控。比如用户让代理管理 GitHub PR,代理可以当场写一个 GitHub 集成扩展,下次直接调用

Cloudflare 在博客中将 AI 代理分为三个阶段:第一波是无状态聊天机器人,第二波是本地运行的编程代理,第三波是作为云基础设施运行的持久化代理。Project Think 是 Cloudflare 对第三波的押注。对开发者而言,这套方案的吸引力在于将代理的运维成本从「按实例计费」变成「按实际使用计费」,如果代理大部分时间在等待用户指令,成本接近于零。

信源:https://blog.cloudflare.com/project-think/
阶跃StepAudio 2.5 TTS上线,情绪控制精细到「克制的悲伤、没有哭腔」

阶跃星辰正式发布 StepAudio 2.5 TTS。与需要预设情绪标签的传统 TTS 不同,这一代支持用自然语言描述控制语音的每一处细节:标签只能表达「悲伤」,自然语言可以进一步描述「克制的悲伤、没有哭腔、轻轻发颤」,AI 据此合成对应音色。

控制分三层。全局语境控制设定整段语音的情绪基调和场景氛围,让多轮对话中的角色表达保持连贯;文中语境控制在句子层面调节语气、节奏、停顿、重音和呼吸感,甚至可以刻画角色的心理活动和潜台词;零样本音色复刻(Zeroshot TTS)无需重新训练,任意参考录音即可仿出音色,情感和风格可独立调节。三项功能已全量上线阶跃星辰开放平台和 Step Plan。

同一天,谷歌也发布了 Gemini 3.1 Flash TTS,同样以自然语言指令替代 SSML 标签实现精细控制,并在第三方评测中登顶。两家在同日用相同思路发版,说明 TTS 的控制范式正在集体从「选标签」转向「说需求」。对有声内容创作者和配音导演来说,以前调情绪要靠反复录制,现在用一句话描述就能定义音色的细腻层次。

信源:https://mp.weixin.qq.com/s/8SKwa5105umsFeIiUz-eEg
MiniMax推出云端Hermes助手MaxHermes:完成任务后自动提炼技能,越用越懂你

MiniMax 今日正式上线 MaxHermes,将 Hermes Agent 打包为官方云端 AI 助手。核心差异在于零部署门槛:无需自备服务器或 API Key,已打通飞书、钉钉、企业微信三个 IM 渠道,7×24 小时在线,费用可用 Token Plan 抵扣。

重点卖点是自我进化机制。每完成一项复杂任务,MaxHermes 自动从中提炼可复用技能,保存为独立文档,后续任务按需调用并根据反馈持续改进。MiniMax 将此与 OpenClaw 作对比:OpenClaw 的技能依赖人工预设,部署后即固定;MaxHermes 的技能由 Agent 自主生成和迭代。叠加跨会话持久记忆、自然语言设定定时任务和多子代理并行机制,底层模型为 MiniMax M2.7。

Hermes Agent 此前需要用户自行部署,MaxHermes 是 MiniMax 将其打包为自家托管产品的首次落地。后续计划接入 Skillhub 社区,MaxClaw 用户可一键迁移已有的技能和人设配置。

信源:https://mp.weixin.qq.com/s/gTUk7CpQYstYcAMzqClAow
黄仁勋:Anthropic用谷歌TPU是当初投资换来的,没早点投Anthropic是我的失误

英伟达 CEO 黄仁勋在接受播客主持人 Dwarkesh Patel 采访时坦承,未能在 Anthropic 创立早期参与投资是一个失误,同时首次公开解释了 Anthropic 算力主要依赖谷歌 TPU 和亚马逊 Trainium 的原因。

谷歌和 AWS 在 Anthropic 早期投入了数十亿美元,作为交换,Anthropic 的算力主要使用这两家公司的平台。黄仁勋说,当时英伟达没有做出同样规模投资的能力和意识:「我没有深刻意识到,VC 根本不可能给一家 AI 实验室投入 50 亿到 100 亿美元。他们没有其他选项,这是我的失误。」他说如果可以重来、且英伟达当时有今天的体量,「我会非常乐意做这件事」。

他明确否定了「专用芯片正在替代 GPU」的市场叙事:「Anthropic 是一个特例,不是趋势。没有 Anthropic,TPU 的增长从哪里来?完全来自 Anthropic。没有 Anthropic,Trainium 的增长从哪里来?完全来自 Anthropic。」在他看来,Anthropic 用专用芯片反映的是投资协议的约束,不是性能或成本层面的技术判断。

英伟达此后通过后期大额投资弥补了这一缺位。今年 2 月,英伟达向 OpenAI 投资 300 亿美元(主要以 GPU 算力和基础设施承诺的形式),黄仁勋称这可能是 OpenAI 上市前「最后一次」投资。去年 11 月,英伟达与微软联合向 Anthropic 投资,英伟达出资最高 100 亿美元,推动 Anthropic 估值升至约 3500 亿美元。黄仁勋在采访中说,这两笔投资的逻辑一样:「世界需要他们存在。」

信源:https://www.youtube.com/watch?v=Hrbq66XqtCo
1
黄仁勋:中国早已越过训练Mythos级模型的算力门槛,限制出口只会加速华为崛起

英伟达 CEO 黄仁勋在 Dwarkesh Patel 采访中强烈反对 AI 芯片出口管制政策,认为这不仅无法阻断中国的 AI 能力,还在过去几年已经制造了适得其反的结果。

黄仁勋的核心论点是:中国已越过临界点。他说,中国拥有大量 7nm 芯片产能和充裕的廉价能源,而 AI 训练是并行计算问题,更多的旧芯片可以弥补单芯片的性能差距。「你们担心的那个能力门槛,中国早就达到了,而且已经超过了。」Anthropic 的 Mythos 是在「相当普通的算力规模」上训练出来的,而这种算力在中国已大量存在。黄仁勋称华为刚刚实现了公司历史上最高的单年业绩,出货了数以百万计的芯片,「远多于 Anthropic 所拥有的」。不过华为 2025 年报显示其营收为 8809 亿元,实为历史次高,低于 2020 年的 8914 亿元峰值。

他还指出,中国拥有全球约 50% 的 AI 研究者,算法创新往往比算力堆叠更能决定模型能力的上限,DeepSeek 是他举出的具体证据:「DeepSeek 不是一个可以忽视的进步。如果未来某天 DeepSeek 级别的模型率先在华为芯片上发布,那对我们的国家将是一个可怕的结果。」这一假设场景可能即将成为现实:据 The Information 报道,DeepSeek 正准备在华为 Ascend 芯片上发布 V4 模型,预计 4 月下旬上线,将成为首个不依赖英伟达硬件的前沿 AI 模型。阿里巴巴、字节跳动、腾讯等中国大厂也在大量采购华为芯片,价格数周内上涨了约 20%。

出口管制已带来反效果。限制措施加速了中国本土芯片产业的崛起,迫使中国 AI 生态转向为本土硬件优化。黄仁勋认为这对美国才是真正的威胁:「如果未来 AI 模型在别人的技术栈上运行最好,那才是美国的噩耗。」中国占全球技术产业约 40%,放弃这一市场将损害美国芯片层面的长期竞争力。

他明确区分了两个可以并行的目标:国内保持算力领先,同时在全球市场竞争。「我们不应该主动放弃市场。如果最终输了就输了,但为什么要拱手相让?」

信源:https://www.youtube.com/watch?v=Hrbq66XqtCo
黄仁勋公开挑战TPU和Trainium跑推理基准:「没有一家敢来」

黄仁勋在 Dwarkesh Patel 采访中直接点名挑战谷歌 TPU 和亚马逊 Trainium 参加公开推理基准测试,称两者至今未应战。

「英伟达的计算栈是全球性能 TCO 比最高的平台,没有例外。世界上没有任何一家公司能向我证明他们的平台更好,一家都没有。」他提到 SemiAnalysis 分析师 Dylan Patel 推出的 InferenceMAX 推理基准,称该测试已公开,「TPU 不来,Trainium 不来。我非常欢迎 Trainium 来验证他们总在声称的 40% 成本优势。我也很想看看 TPU 的成本优势到底在哪,在我看来从第一性原理上就完全说不通。」

他将英伟达 GPU 类比为 F1 赛车,CPU 为凯迪拉克轿车:「人人都能开到 100 英里时速,但要推到极限需要极高的专业能力。」英伟达为各大 AI 实验室配备了大量工程师优化技术栈,「通常优化完毕后,他们的模型速度提升 2 倍、3 倍,50% 是常事。在他们现有的 Hopper 和 Blackwell 集群上,这直接意味着收入翻倍。」

对于超大规模云厂商自建内核削弱 CUDA 的担忧,黄仁勋指出英伟达自身向 Triton 等第三方框架贡献了大量底层技术,「Triton 的后端有大量英伟达技术」。CUDA 生态目前有数亿 GPU 装机量,覆盖所有主流云服务商。「如果你是一家 AI 初创公司,你会选最普及的架构、最大的装机量和最丰富的生态。三者都是英伟达。」他还补充了一个常被忽视的维度:英伟达是唯一一家能保证每年交付下一代架构的公司。Vera Rubin 今年上线,Vera Rubin Ultra 明年,Feynman 后年,之后还有一代尚未公布代号的产品。「找一个 ASIC 团队,看你能不能把整个业务押在他们每年都会准时交付上。」

信源:https://www.youtube.com/watch?v=Hrbq66XqtCo
黄仁勋:AI不会消灭软件公司,代理将让工具使用量指数级增长

黄仁勋在采访中反驳了「AI 将令软件公司估值崩溃」的流行叙事,提出相反判断:AI 代理将大幅推高传统软件工具的使用量,对软件公司而言是需求倍增而非替代。

「我看到的和大多数人看到的恰恰相反。代理的数量会指数级增长,工具使用者的数量也会指数级增长。」他举例:Synopsys 的芯片设计编译器、Cadence 的版图工具、设计规则检查器,这些工具的实例数量将随代理数量急剧增加。「今天我们受限于工程师的数量。明天,这些工程师将被一批代理支持。我们会以前所未有的方式探索设计空间,用的还是今天的工具。」

他承认代理目前还不够擅长使用工具,这是市场尚未反映这一逻辑的原因:「要么软件公司自己建代理,要么代理变得足够聪明来使用这些工具。我认为两者都会发生。」

这个判断的背景是,近期大量企业软件公司(尤其是 EDA、CAD 等工程工具领域)因市场预期 AI 将替代工程工作而遭遇估值下调。黄仁勋提供了一个不同的框架:AI 不是 SaaS 的终结者,而是 SaaS 需求的倍增器。区别在于,多数市场分析关注的是 AI 替代人类工程师的那部分产出,而黄仁勋关注的是代理自身也需要调用工具来完成工作。

信源:https://www.youtube.com/watch?v=Hrbq66XqtCo
英伟达200亿美元收购Groq后首谈战略:推理token要按质论价,低延迟高单价是新赛道

黄仁勋在采访中首次详细解释了英伟达收购 Groq 的战略逻辑。英伟达去年 12 月以 200 亿美元收购了 Groq 的推理芯片业务,Groq 创始人 Jonathan Ross 及核心团队加入英伟达,Groq 作为独立公司继续运营。今年 3 月 GTC 大会上,英伟达发布了合并后首款芯片 Groq 3 LPU,由三星 4nm 工艺制造,英伟达称其在万亿参数模型上的每兆瓦推理吞吐量是 Blackwell NVL72 的 35 倍。

黄仁勋说,收购 Groq 的驱动力是推理市场的分层。此前推理优化只有一个方向:提高吞吐量。但 token 的商业价值已大幅上升,不同用户愿意为不同响应速度付不同价格。「如果我能给软件工程师提供响应更快的 token,让他们比现在更高效,我愿意为此付费。但这个市场直到最近才出现。」

他将这描述为推理市场帕累托前沿的扩展:在现有高吞吐量方案之外,新增一个低延迟、高单价的市场段。同一个模型,根据响应时间差异化定价,「虽然吞吐量更低,但单价能弥补」。Groq 的 LPU 架构以确定性低延迟著称,与英伟达 GPU 的高吞吐量路线互补,收购补上了英伟达在推理产品线上缺失的一块。

信源:https://www.youtube.com/watch?v=Hrbq66XqtCo
Claude Opus 4.6已在向用户自报「claude-opus-4-7」,Anthropic疑似静默切换模型

多名用户今日发现,在 claude.ai 上选择 Opus 4.6 对话时,直接询问模型的 model slug,得到的回答是「claude-opus-4-7」。界面仍显示「Opus 4.6」,但模型自报的内部标识符已变。X 用户 @evanM_FP 的截图显示,模型明确回复「Claude Opus 4.6, with the model string claude-opus-4-7」。

这不是 Opus 4.7 标识符首次被发现。3 月 31 日,Anthropic 在 Claude Code 的 npm 包中意外附带了一份 60MB 的 source map 文件,安全研究者从中解包出约 1900 个 TypeScript 源文件,其中包含 claude-opus-4.7claude-sonnet-4.8 等内部模型标识符。4 月 12 日,该标识符又在 Anthropic 的内部 API 系统中被人发现。4 月 14 日,《The Information》援引知情人士报道称 Anthropic 最快本周发布 Opus 4.7。现在用户端的模型自报将这条线索链推到了最后一步:模型可能已经在线上运行。
1
Nucleus-Image开源,17B参数推理仅激活2B,无后训练基准超Imagen4

Nucleus AI 团队发布文生图模型 Nucleus-Image,同步开源模型权重、训练代码和训练数据集,许可证为 Apache 2.0,可商用。模型采用稀疏混合专家(MoE)扩散变换器架构,总参数量 17B,分布在每层 64 个路由专家中,每次推理仅激活约 2B 参数,推理成本显著低于同参数量级的密集模型。

在三项标准基准上,Nucleus-Image 与闭源头部模型持平甚至超越:GenEval 得分 0.87,与千问图像模型持平,空间位置子项(0.85)居所有对比模型之首;DPG-Bench 得分 88.79,综合排名第一;OneIG-Bench 得分 0.522,超过谷歌 Imagen4(0.515)和 Recraft V3(0.502)。以上成绩全部来自纯预训练,未做 DPO、强化学习或人类偏好调优。Nucleus AI 官方称这是「该质量级别上首个全开源 MoE 扩散模型」。

训练数据从网络大规模爬取,经多轮过滤、去重和美学评分后保留 7 亿张图片,生成 15 亿图文对;训练分三阶段从 256 到 1024 分辨率逐步推进,共 170 万步。文本编码器使用 Qwen3-VL-8B-Instruct,通过 diffusers 库调用,并内置跨去噪步骤的文本 KV 缓存,进一步降低推理开销。

对需要在本地部署图像生成的开发者来说,17B 参数但只需激活 2B 的设计意味着消费级 GPU 也有运行空间。完整开源(权重 + 训练代码 + 数据集)相对罕见——多数开源图像模型只放权重,数据集和训练细节仍封闭,这也是文生图领域可复现研究的主要瓶颈之一。

信源:https://arxiv.org/abs/2604.12163
METR更新AI代理能力基准,Gemini 3.1 Pro可靠性超越所有前沿模型登顶

AI 安全评估机构 METR 更新「时间地平线」(Time Horizon)基准,新增谷歌 Gemini 3.1 Pro 的测试数据。该基准追踪前沿 AI 代理独立完成编程任务的能力上限,自今年 2 月上线以来已成为衡量 AI 代理能力增长的重要参考。

测量方式是让人类软件工程专家(平均约 5 年经验)和 AI 代理完成同一组超过一百项软件任务,用人类耗时衡量任务难度。核心指标有两个:50% 时间地平线(AI 有一半概率完成的最高任务难度)和 80% 时间地平线(AI 有八成概率完成的最高任务难度)。

Gemini 3.1 Pro 在两个指标上的排名出现反转。50% 时间地平线排第二,仅次于大幅领先的 Claude Opus 4.6:

1. Claude Opus 4.6:约 12.0 小时
2. Gemini 3.1 Pro:约 6.4 小时
3. GPT-5.2:约 5.9 小时
4. GPT-5.4:约 5.7 小时

但在更严格的 80% 时间地平线上,Gemini 3.1 Pro 反超登顶:

1. Gemini 3.1 Pro:约 1.5 小时
2. Claude Opus 4.6:约 1.2 小时
3. GPT-5.2:约 1.1 小时

Claude Opus 4.6 能挑战更难的任务但成功率波动大,Gemini 3.1 Pro 天花板低一些但在能力范围内更稳定。对需要可预测结果的生产场景,后者可能更实用。

相比上一代 Gemini 3 Pro(50% 时间地平线约 3.7 小时),Gemini 3.1 Pro 提升约 71%。从更长的时间线看,METR 的数据显示前沿模型的时间地平线从 2019 年 GPT-2 的几秒钟增长到如今的十余小时,约每 4.3 个月翻一番,METR 称「没有看到指数增长放缓的迹象」。

需注意,METR 的任务覆盖软件工程、机器学习和网络安全,且均为定义清晰、可自动评分的独立任务。METR 在后续研究中发现,当评分方式从算法判定改为人类整体评判时,AI 表现显著下降。12 小时的时间地平线不等于 AI 能替代人类半天的实际工作。

信源:https://metr.org/time-horizons/