动察Beating AI News
3.16K subscribers
890 photos
2 videos
1 file
3.41K links
AI新闻信息流
Download Telegram
美众议员提案将模型蒸馏定性为工业间谍,DeepSeek等中国AI公司拟被列入制裁名单

美国众议院共和党议员 Bill Huizenga 提出《遏制美国AI模型被盗法案》,要求政府识别中国和俄罗斯利用「查询复制」技术从美国AI模型中提取能力的主体,并授权商务部将其列入实体清单,或援引1977年《国际紧急经济权力法》对其实施制裁。该法案由众议院中国问题特别委员会主席 John Moolenaar 联署,预计下周在众议院外交委员会审议。

所谓「对抗性蒸馏」,是指用成熟的大模型(「教师」)大规模查询训练新模型(「学生」),以极低成本复制前者的能力。这一技术本身在一定范围内被容忍,但未经授权复制领先AI模型则违反服务条款。OpenAI今年早些时候向众议院中国委员会披露,DeepSeek曾未经授权大规模查询 ChatGPT 以训练自身模型,且在 OpenAI 反制后持续改变手法绕过限制。谷歌和 Anthropic 随后也发布公开报告,证实在各自平台上观察到类似异常访问行为。

众议院中国委员会的配套报告将进一步点名 DeepSeek、Moonshot AI、MiniMax,建议司法部对上述行为提起诉讼,并要求商务部评估将三家公司列入实体清单。报告还识别出两个公开代码工具和三个中间商,称它们为阿里巴巴、腾讯、百度以及清华大学、北京大学等机构提供了绕过限制访问美国闭源AI模型的渠道。

Huizenga 在声明中点名 Anthropic 的 Mythos:「美国AI模型正展现出变革性的网络能力,防止中国盗取这些技术进展至关重要。」OpenAI、Anthropic、谷歌已开始互相共享信息以检测异常蒸馏行为。本次立法试图将这种私下协作升格为政府主导的执法机制——中国AI公司面临的不再是账号封禁,而是实体清单和经济制裁。

信源:https://bloomberg.com/news/articles/2026-04-16/us-house-to-weigh-penalties-on-ai-model-copying-by-chinese-firms
OpenAI发布政策报告游说AI进入生命科学,但至今没有一款AI发现的药物通过三期临床

OpenAI 政策、研究与科学团队发布报告,主张扩大 AI 在生命科学领域的应用,并向 Axios 独家提前分享。报告呼吁三件事:开放更多医疗和科学数据的访问权限、将先进 AI 视为「国家级研究资源」、加大对算力、实验室和能源等「物理基础设施」的投资。

报告称 AI 能加速药物发现、自主设计研究工具、将实验室流程从数月压缩到数天。其中一项分析估计,AI 工具可将临床试验阶段的时间线缩短 20% 以上。OpenAI 还特别提到 GPT-5 Pro 能为尚无有效疗法的疾病寻找已获 FDA 批准药物的新用途。

但现实与愿景之间差距明显。目前仅有极少数 AI 发现或 AI 设计的药物进入临床试验阶段,没有任何一款完成三期临床。2025 年年中发表在 Nature Medicine 上的一篇论文显示,AI 发现的药物在二期临床的失败率与传统方式发现的药物相当。该论文研究者写道:「AI 能否对药物研发产生有意义的、持续性的颠覆,这个问题仍未得到回答。」

报告的政策诉求也值得留意。OpenAI 希望政府开放医疗数据、在国家层面为 AI 研发提供特殊地位和资源倾斜,这本质上是在为自身产品争取更大的市场准入。在美国,一款新药从研究到获批通常需要 12 至 15 年,AI 承诺缩短这一周期的叙事对制药业和监管机构都有吸引力,但目前的临床证据尚不足以支撑这些承诺。同一周内,亚马逊也推出了 AI 药物分子生成工具 Bio Discovery,大型科技公司争相进入这一领域。

信源:https://www.axios.com/2026/04/15/exclusive-openai-ai-life-science
Cursor Agent现在可以造仪表盘:Canvas让AI输出从文字变成可交互界面

Cursor 3.1 推出 Canvas 功能。Agent 处理完任务后,输出不再只是代码或 markdown 文字,可以直接生成一个可交互的 React 界面,里面有图表、表格、diff 视图或自定义逻辑。Canvas 作为持久工件存在于 Agents Window,与终端、浏览器、版本控制并排显示。

核心变化在于信息密度。以事故响应为例:此前 Agent 把 Datadog、Databricks、Sentry 的时序数据整理成 markdown 表格,难以解读,还要自己再做可视化。现在 Agent 直接把多来源数据合并进同一张 Canvas 图表里。PR 审查同理:Agent 可以按重要性对变更分组、为复杂算法生成伪代码,而不是把所有 diff 平铺出来。

Cursor 团队自己在 Eval 分析中也用了 Canvas。此前工程师要逐条翻 request ID 查失败模式,一度考虑单独开发一个 web app,最终改为直接在 Cursor 里建一个 Skill,让 Agent 读取所有 rollout、归类失败原因、生成可交互的分析界面,这套流程帮助团队在近期两次新模型上线中显著减少了排查时间。

Canvas 支持自定义扩展:在 Cursor Marketplace 发布的 Docs Canvas Skill 可以让 Agent 为任意代码仓库生成交互式架构图。用户也可以自己编写 Skill 来定义 Agent 生成哪种类型的 Canvas。

信源:https://cursor.com/blog/canvas
Windsurf 2.0把IDE变成代理调度中心,Devin云端代理免费内置

Cognition AI 发布 Windsurf 2.0,核心更新是「代理指挥中心」(Agent Command Center)和 Devin 云端代理直接内置。IDE 不再只是写代码的地方,变成了管理一支 AI 代理团队的调度台。

代理指挥中心用看板(Kanban)视图展示所有正在运行的代理,本地和云端统一管理,按状态分列。设计意图很明确:当工程师同时跑几十个代理处理同一项目的不同部分时,瓶颈不是代码能力,是人的注意力和工作记忆。看板让工程师一眼看清哪个代理在干活、哪个卡住了、哪个等待审查。

「空间」(Spaces)是新增的工作组织单元。一个空间把一项任务相关的所有东西打包在一起:代理会话、PR、文件和上下文。在空间内新建代理会话时,自动继承该空间已有的项目上下文,不需要每次重新描述需求。切换空间就是切换任务,每个任务背后有一组代理在运行。

Devin 是 Cognition 此前独立运营的自主编程代理,拥有自己的云端虚拟机、桌面环境和浏览器,能端到端完成调试、部署、测试等任务。现在直接内置进 Windsurf:用户可以在本地代理上制定方案,一键派给 Devin 在云端执行,合上笔记本也不中断。Devin 完成后提交 PR,用户在 Windsurf 里直接审查 diff、跑测试或交给本地代理修缮。Devin 对所有 Windsurf 套餐用户开放,正在分批上线。

信源:https://windsurf.com/blog/windsurf-2-0
Cloudflare发布Project Think,要让AI代理像网站一样部署到云端:崩溃自恢复、闲时零成本

Cloudflare 发布 Project Think,为其开源 Agents SDK 新增一整套构建长期运行 AI 代理的基础设施:持久化执行、子代理、沙箱代码执行和持久会话。开发者可以单独使用这些组件,也可以直接用 Think 基类快速搭建完整的代理应用,用 npx wrangler deploy 一键部署到 Cloudflare 全球网络。目前为预览版。

Project Think 要解决的核心问题是:当前的编程代理(Claude Code、Codex、OpenClaw 等)只能跑在本地笔记本或昂贵的 VPS 上,笔记本合盖就断,无法多人协作,闲置时仍在烧钱。Cloudflare 的方案基于 Durable Objects(持久化对象),每个代理是一个独立的 actor,自带 SQLite 数据库,无事可做时休眠,收到请求时被唤醒,闲时计算成本为零。按 Cloudflare 的计算,1 万个代理各自仅 1% 时间活跃,传统容器方案需要 1 万个常驻实例,Durable Objects 任意时刻只有约 100 个在运行。

技术上有几个值得关注的设计:

1. 持久化执行(Fibers):代理运行中如果环境崩溃(部署更新、平台重启、资源耗尽),SDK 在 SQLite 中记录了检查点,重启后从断点恢复,不丢失进度
2. 代码模式(codemode):不让模型逐个调用工具再逐个读取结果,而是让模型直接写一段程序一次性完成任务。Cloudflare 用自家 API 的 MCP 服务器举例:暴露全部 API 端点需要约 117 万 token 描述工具,改用 codemode 只需两个工具(search 和 execute)约 1000 token,减少 99.9%
3. 五级执行阶梯:从最轻量的虚拟文件系统(Tier 0)到完整的沙箱环境(Tier 4,支持 git clone、npm test 等),代理按需逐级升级能力,不必一开始就启动重量级容器
4. 自编写扩展:代理可以在运行时自己编写 TypeScript 扩展并注册为新工具,扩展在沙箱中运行,权限受控。比如用户让代理管理 GitHub PR,代理可以当场写一个 GitHub 集成扩展,下次直接调用

Cloudflare 在博客中将 AI 代理分为三个阶段:第一波是无状态聊天机器人,第二波是本地运行的编程代理,第三波是作为云基础设施运行的持久化代理。Project Think 是 Cloudflare 对第三波的押注。对开发者而言,这套方案的吸引力在于将代理的运维成本从「按实例计费」变成「按实际使用计费」,如果代理大部分时间在等待用户指令,成本接近于零。

信源:https://blog.cloudflare.com/project-think/
阶跃StepAudio 2.5 TTS上线,情绪控制精细到「克制的悲伤、没有哭腔」

阶跃星辰正式发布 StepAudio 2.5 TTS。与需要预设情绪标签的传统 TTS 不同,这一代支持用自然语言描述控制语音的每一处细节:标签只能表达「悲伤」,自然语言可以进一步描述「克制的悲伤、没有哭腔、轻轻发颤」,AI 据此合成对应音色。

控制分三层。全局语境控制设定整段语音的情绪基调和场景氛围,让多轮对话中的角色表达保持连贯;文中语境控制在句子层面调节语气、节奏、停顿、重音和呼吸感,甚至可以刻画角色的心理活动和潜台词;零样本音色复刻(Zeroshot TTS)无需重新训练,任意参考录音即可仿出音色,情感和风格可独立调节。三项功能已全量上线阶跃星辰开放平台和 Step Plan。

同一天,谷歌也发布了 Gemini 3.1 Flash TTS,同样以自然语言指令替代 SSML 标签实现精细控制,并在第三方评测中登顶。两家在同日用相同思路发版,说明 TTS 的控制范式正在集体从「选标签」转向「说需求」。对有声内容创作者和配音导演来说,以前调情绪要靠反复录制,现在用一句话描述就能定义音色的细腻层次。

信源:https://mp.weixin.qq.com/s/8SKwa5105umsFeIiUz-eEg
MiniMax推出云端Hermes助手MaxHermes:完成任务后自动提炼技能,越用越懂你

MiniMax 今日正式上线 MaxHermes,将 Hermes Agent 打包为官方云端 AI 助手。核心差异在于零部署门槛:无需自备服务器或 API Key,已打通飞书、钉钉、企业微信三个 IM 渠道,7×24 小时在线,费用可用 Token Plan 抵扣。

重点卖点是自我进化机制。每完成一项复杂任务,MaxHermes 自动从中提炼可复用技能,保存为独立文档,后续任务按需调用并根据反馈持续改进。MiniMax 将此与 OpenClaw 作对比:OpenClaw 的技能依赖人工预设,部署后即固定;MaxHermes 的技能由 Agent 自主生成和迭代。叠加跨会话持久记忆、自然语言设定定时任务和多子代理并行机制,底层模型为 MiniMax M2.7。

Hermes Agent 此前需要用户自行部署,MaxHermes 是 MiniMax 将其打包为自家托管产品的首次落地。后续计划接入 Skillhub 社区,MaxClaw 用户可一键迁移已有的技能和人设配置。

信源:https://mp.weixin.qq.com/s/gTUk7CpQYstYcAMzqClAow
黄仁勋:Anthropic用谷歌TPU是当初投资换来的,没早点投Anthropic是我的失误

英伟达 CEO 黄仁勋在接受播客主持人 Dwarkesh Patel 采访时坦承,未能在 Anthropic 创立早期参与投资是一个失误,同时首次公开解释了 Anthropic 算力主要依赖谷歌 TPU 和亚马逊 Trainium 的原因。

谷歌和 AWS 在 Anthropic 早期投入了数十亿美元,作为交换,Anthropic 的算力主要使用这两家公司的平台。黄仁勋说,当时英伟达没有做出同样规模投资的能力和意识:「我没有深刻意识到,VC 根本不可能给一家 AI 实验室投入 50 亿到 100 亿美元。他们没有其他选项,这是我的失误。」他说如果可以重来、且英伟达当时有今天的体量,「我会非常乐意做这件事」。

他明确否定了「专用芯片正在替代 GPU」的市场叙事:「Anthropic 是一个特例,不是趋势。没有 Anthropic,TPU 的增长从哪里来?完全来自 Anthropic。没有 Anthropic,Trainium 的增长从哪里来?完全来自 Anthropic。」在他看来,Anthropic 用专用芯片反映的是投资协议的约束,不是性能或成本层面的技术判断。

英伟达此后通过后期大额投资弥补了这一缺位。今年 2 月,英伟达向 OpenAI 投资 300 亿美元(主要以 GPU 算力和基础设施承诺的形式),黄仁勋称这可能是 OpenAI 上市前「最后一次」投资。去年 11 月,英伟达与微软联合向 Anthropic 投资,英伟达出资最高 100 亿美元,推动 Anthropic 估值升至约 3500 亿美元。黄仁勋在采访中说,这两笔投资的逻辑一样:「世界需要他们存在。」

信源:https://www.youtube.com/watch?v=Hrbq66XqtCo
1
黄仁勋:中国早已越过训练Mythos级模型的算力门槛,限制出口只会加速华为崛起

英伟达 CEO 黄仁勋在 Dwarkesh Patel 采访中强烈反对 AI 芯片出口管制政策,认为这不仅无法阻断中国的 AI 能力,还在过去几年已经制造了适得其反的结果。

黄仁勋的核心论点是:中国已越过临界点。他说,中国拥有大量 7nm 芯片产能和充裕的廉价能源,而 AI 训练是并行计算问题,更多的旧芯片可以弥补单芯片的性能差距。「你们担心的那个能力门槛,中国早就达到了,而且已经超过了。」Anthropic 的 Mythos 是在「相当普通的算力规模」上训练出来的,而这种算力在中国已大量存在。黄仁勋称华为刚刚实现了公司历史上最高的单年业绩,出货了数以百万计的芯片,「远多于 Anthropic 所拥有的」。不过华为 2025 年报显示其营收为 8809 亿元,实为历史次高,低于 2020 年的 8914 亿元峰值。

他还指出,中国拥有全球约 50% 的 AI 研究者,算法创新往往比算力堆叠更能决定模型能力的上限,DeepSeek 是他举出的具体证据:「DeepSeek 不是一个可以忽视的进步。如果未来某天 DeepSeek 级别的模型率先在华为芯片上发布,那对我们的国家将是一个可怕的结果。」这一假设场景可能即将成为现实:据 The Information 报道,DeepSeek 正准备在华为 Ascend 芯片上发布 V4 模型,预计 4 月下旬上线,将成为首个不依赖英伟达硬件的前沿 AI 模型。阿里巴巴、字节跳动、腾讯等中国大厂也在大量采购华为芯片,价格数周内上涨了约 20%。

出口管制已带来反效果。限制措施加速了中国本土芯片产业的崛起,迫使中国 AI 生态转向为本土硬件优化。黄仁勋认为这对美国才是真正的威胁:「如果未来 AI 模型在别人的技术栈上运行最好,那才是美国的噩耗。」中国占全球技术产业约 40%,放弃这一市场将损害美国芯片层面的长期竞争力。

他明确区分了两个可以并行的目标:国内保持算力领先,同时在全球市场竞争。「我们不应该主动放弃市场。如果最终输了就输了,但为什么要拱手相让?」

信源:https://www.youtube.com/watch?v=Hrbq66XqtCo
黄仁勋公开挑战TPU和Trainium跑推理基准:「没有一家敢来」

黄仁勋在 Dwarkesh Patel 采访中直接点名挑战谷歌 TPU 和亚马逊 Trainium 参加公开推理基准测试,称两者至今未应战。

「英伟达的计算栈是全球性能 TCO 比最高的平台,没有例外。世界上没有任何一家公司能向我证明他们的平台更好,一家都没有。」他提到 SemiAnalysis 分析师 Dylan Patel 推出的 InferenceMAX 推理基准,称该测试已公开,「TPU 不来,Trainium 不来。我非常欢迎 Trainium 来验证他们总在声称的 40% 成本优势。我也很想看看 TPU 的成本优势到底在哪,在我看来从第一性原理上就完全说不通。」

他将英伟达 GPU 类比为 F1 赛车,CPU 为凯迪拉克轿车:「人人都能开到 100 英里时速,但要推到极限需要极高的专业能力。」英伟达为各大 AI 实验室配备了大量工程师优化技术栈,「通常优化完毕后,他们的模型速度提升 2 倍、3 倍,50% 是常事。在他们现有的 Hopper 和 Blackwell 集群上,这直接意味着收入翻倍。」

对于超大规模云厂商自建内核削弱 CUDA 的担忧,黄仁勋指出英伟达自身向 Triton 等第三方框架贡献了大量底层技术,「Triton 的后端有大量英伟达技术」。CUDA 生态目前有数亿 GPU 装机量,覆盖所有主流云服务商。「如果你是一家 AI 初创公司,你会选最普及的架构、最大的装机量和最丰富的生态。三者都是英伟达。」他还补充了一个常被忽视的维度:英伟达是唯一一家能保证每年交付下一代架构的公司。Vera Rubin 今年上线,Vera Rubin Ultra 明年,Feynman 后年,之后还有一代尚未公布代号的产品。「找一个 ASIC 团队,看你能不能把整个业务押在他们每年都会准时交付上。」

信源:https://www.youtube.com/watch?v=Hrbq66XqtCo
黄仁勋:AI不会消灭软件公司,代理将让工具使用量指数级增长

黄仁勋在采访中反驳了「AI 将令软件公司估值崩溃」的流行叙事,提出相反判断:AI 代理将大幅推高传统软件工具的使用量,对软件公司而言是需求倍增而非替代。

「我看到的和大多数人看到的恰恰相反。代理的数量会指数级增长,工具使用者的数量也会指数级增长。」他举例:Synopsys 的芯片设计编译器、Cadence 的版图工具、设计规则检查器,这些工具的实例数量将随代理数量急剧增加。「今天我们受限于工程师的数量。明天,这些工程师将被一批代理支持。我们会以前所未有的方式探索设计空间,用的还是今天的工具。」

他承认代理目前还不够擅长使用工具,这是市场尚未反映这一逻辑的原因:「要么软件公司自己建代理,要么代理变得足够聪明来使用这些工具。我认为两者都会发生。」

这个判断的背景是,近期大量企业软件公司(尤其是 EDA、CAD 等工程工具领域)因市场预期 AI 将替代工程工作而遭遇估值下调。黄仁勋提供了一个不同的框架:AI 不是 SaaS 的终结者,而是 SaaS 需求的倍增器。区别在于,多数市场分析关注的是 AI 替代人类工程师的那部分产出,而黄仁勋关注的是代理自身也需要调用工具来完成工作。

信源:https://www.youtube.com/watch?v=Hrbq66XqtCo
英伟达200亿美元收购Groq后首谈战略:推理token要按质论价,低延迟高单价是新赛道

黄仁勋在采访中首次详细解释了英伟达收购 Groq 的战略逻辑。英伟达去年 12 月以 200 亿美元收购了 Groq 的推理芯片业务,Groq 创始人 Jonathan Ross 及核心团队加入英伟达,Groq 作为独立公司继续运营。今年 3 月 GTC 大会上,英伟达发布了合并后首款芯片 Groq 3 LPU,由三星 4nm 工艺制造,英伟达称其在万亿参数模型上的每兆瓦推理吞吐量是 Blackwell NVL72 的 35 倍。

黄仁勋说,收购 Groq 的驱动力是推理市场的分层。此前推理优化只有一个方向:提高吞吐量。但 token 的商业价值已大幅上升,不同用户愿意为不同响应速度付不同价格。「如果我能给软件工程师提供响应更快的 token,让他们比现在更高效,我愿意为此付费。但这个市场直到最近才出现。」

他将这描述为推理市场帕累托前沿的扩展:在现有高吞吐量方案之外,新增一个低延迟、高单价的市场段。同一个模型,根据响应时间差异化定价,「虽然吞吐量更低,但单价能弥补」。Groq 的 LPU 架构以确定性低延迟著称,与英伟达 GPU 的高吞吐量路线互补,收购补上了英伟达在推理产品线上缺失的一块。

信源:https://www.youtube.com/watch?v=Hrbq66XqtCo
Claude Opus 4.6已在向用户自报「claude-opus-4-7」,Anthropic疑似静默切换模型

多名用户今日发现,在 claude.ai 上选择 Opus 4.6 对话时,直接询问模型的 model slug,得到的回答是「claude-opus-4-7」。界面仍显示「Opus 4.6」,但模型自报的内部标识符已变。X 用户 @evanM_FP 的截图显示,模型明确回复「Claude Opus 4.6, with the model string claude-opus-4-7」。

这不是 Opus 4.7 标识符首次被发现。3 月 31 日,Anthropic 在 Claude Code 的 npm 包中意外附带了一份 60MB 的 source map 文件,安全研究者从中解包出约 1900 个 TypeScript 源文件,其中包含 claude-opus-4.7claude-sonnet-4.8 等内部模型标识符。4 月 12 日,该标识符又在 Anthropic 的内部 API 系统中被人发现。4 月 14 日,《The Information》援引知情人士报道称 Anthropic 最快本周发布 Opus 4.7。现在用户端的模型自报将这条线索链推到了最后一步:模型可能已经在线上运行。
1
Nucleus-Image开源,17B参数推理仅激活2B,无后训练基准超Imagen4

Nucleus AI 团队发布文生图模型 Nucleus-Image,同步开源模型权重、训练代码和训练数据集,许可证为 Apache 2.0,可商用。模型采用稀疏混合专家(MoE)扩散变换器架构,总参数量 17B,分布在每层 64 个路由专家中,每次推理仅激活约 2B 参数,推理成本显著低于同参数量级的密集模型。

在三项标准基准上,Nucleus-Image 与闭源头部模型持平甚至超越:GenEval 得分 0.87,与千问图像模型持平,空间位置子项(0.85)居所有对比模型之首;DPG-Bench 得分 88.79,综合排名第一;OneIG-Bench 得分 0.522,超过谷歌 Imagen4(0.515)和 Recraft V3(0.502)。以上成绩全部来自纯预训练,未做 DPO、强化学习或人类偏好调优。Nucleus AI 官方称这是「该质量级别上首个全开源 MoE 扩散模型」。

训练数据从网络大规模爬取,经多轮过滤、去重和美学评分后保留 7 亿张图片,生成 15 亿图文对;训练分三阶段从 256 到 1024 分辨率逐步推进,共 170 万步。文本编码器使用 Qwen3-VL-8B-Instruct,通过 diffusers 库调用,并内置跨去噪步骤的文本 KV 缓存,进一步降低推理开销。

对需要在本地部署图像生成的开发者来说,17B 参数但只需激活 2B 的设计意味着消费级 GPU 也有运行空间。完整开源(权重 + 训练代码 + 数据集)相对罕见——多数开源图像模型只放权重,数据集和训练细节仍封闭,这也是文生图领域可复现研究的主要瓶颈之一。

信源:https://arxiv.org/abs/2604.12163
METR更新AI代理能力基准,Gemini 3.1 Pro可靠性超越所有前沿模型登顶

AI 安全评估机构 METR 更新「时间地平线」(Time Horizon)基准,新增谷歌 Gemini 3.1 Pro 的测试数据。该基准追踪前沿 AI 代理独立完成编程任务的能力上限,自今年 2 月上线以来已成为衡量 AI 代理能力增长的重要参考。

测量方式是让人类软件工程专家(平均约 5 年经验)和 AI 代理完成同一组超过一百项软件任务,用人类耗时衡量任务难度。核心指标有两个:50% 时间地平线(AI 有一半概率完成的最高任务难度)和 80% 时间地平线(AI 有八成概率完成的最高任务难度)。

Gemini 3.1 Pro 在两个指标上的排名出现反转。50% 时间地平线排第二,仅次于大幅领先的 Claude Opus 4.6:

1. Claude Opus 4.6:约 12.0 小时
2. Gemini 3.1 Pro:约 6.4 小时
3. GPT-5.2:约 5.9 小时
4. GPT-5.4:约 5.7 小时

但在更严格的 80% 时间地平线上,Gemini 3.1 Pro 反超登顶:

1. Gemini 3.1 Pro:约 1.5 小时
2. Claude Opus 4.6:约 1.2 小时
3. GPT-5.2:约 1.1 小时

Claude Opus 4.6 能挑战更难的任务但成功率波动大,Gemini 3.1 Pro 天花板低一些但在能力范围内更稳定。对需要可预测结果的生产场景,后者可能更实用。

相比上一代 Gemini 3 Pro(50% 时间地平线约 3.7 小时),Gemini 3.1 Pro 提升约 71%。从更长的时间线看,METR 的数据显示前沿模型的时间地平线从 2019 年 GPT-2 的几秒钟增长到如今的十余小时,约每 4.3 个月翻一番,METR 称「没有看到指数增长放缓的迹象」。

需注意,METR 的任务覆盖软件工程、机器学习和网络安全,且均为定义清晰、可自动评分的独立任务。METR 在后续研究中发现,当评分方式从算法判定改为人类整体评判时,AI 表现显著下降。12 小时的时间地平线不等于 AI 能替代人类半天的实际工作。

信源:https://metr.org/time-horizons/
ChatGPT流量份额一年从77%跌至57%,Gemini翻四倍升至25%

Similarweb 发布截至 2026 年 3 月的生成式 AI 网站流量份额数据。过去 12 个月,ChatGPT 从 77.43% 降至 56.72%,丢掉超过 20 个百分点;Gemini 从 6.00% 升至 25.46%,翻了四倍多,吃下了流失份额的大头。

各产品 3 月份额:
1. ChatGPT:56.72%
2. Gemini:25.46%
3. Claude:6.02%
4. DeepSeek:3.74%
5. Grok:3.44%
6. Copilot:1.99%
7. Perplexity:1.64%

短期变动最剧烈的是 Claude:一年前仅 1.40%,1 月还在 2.22%,3 月突破 6%,其中 2 月到 3 月单月接近翻倍。Grok 从一年前的第二名(7.03%)跌至第五(3.44%),被 DeepSeek 反超。Copilot 的上升部分源于统计口径调整,Similarweb 将微软 m365.cloud.microsoft/chat 纳入了 Copilot 流量。

一年前 ChatGPT 以 77% 的份额近乎垄断,如今前两名合计 82%(ChatGPT 57% + Gemini 25%),格局从一家独大变为两强主导。两种增长的形态截然不同:Gemini 逐季匀速爬升,Claude 则在前 10 个月几乎没动、最近两个月突然从 2% 拉到 6%。Grok 跌幅最深,一年前排第二,如今已被三家超过。

信源:https://x.com/Similarweb/status/2044682637860573534
苹果把近200名Siri程序员送回「编程学校」,距新版Siri发布仅两个月

苹果计划将近 200 名 Siri 程序员送去参加为期数周的 AI 编程培训班,学习使用 AI 工具写代码。此时距新版 Siri 预计在 6 月 WWDC 上亮相仅剩两个月。Siri 团队总人数达数百人,培训结束后核心开发组仅保留约 60 人,另有约 60 人转入评估组,负责测试 Siri 的指令处理和安全合规。

苹果软件工程等部门已大规模采用 Claude Code 等 AI 编程工具,部分团队为此分配了大笔预算,但 Siri 团队未能跟上。这支团队在苹果内部以「落后者」著称,15 年来人员臃肿、内部政治分裂,在 ChatGPT 等大语言模型崛起后更难以保持竞争力。苹果近年多次重组 Siri:去年初将团队从 AI 部门负责人 John Giannandrea 手中划出,交由软件主管 Craig Federighi 管辖,Vision Pro 负责人 Mike Rockwell 直接负责 Siri 产品。此前苹果曾计划 2025 年初发布新版 Siri,但遭遇延期。Giannandrea 去年 12 月宣布退休,据 Bloomberg 报道,本周将是他在苹果担任顾问的最后一天。

新版 Siri 将由谷歌 Gemini 驱动,支持更自然的对话、直接回答问题、提供情感支持和完成预订等任务。苹果正与谷歌讨论由后者托管运行新 Siri 的服务器,目前仍有大量工作待完成。一家以自研芯片和操作系统著称的公司,语音助手要靠竞争对手的模型和服务器来运行,Siri 团队要靠培训班来学会用 AI 写代码,这本身就是苹果在生成式 AI 浪潮中处境的缩影。

信源:https://www.theinformation.com/articles/apple-sends-siri-staffers-coding-bootcamp-latest-shakeup-organization?rc=h8czej
谷歌AI编程工具Antigravity连续多日宕机,付费用户被锁最长7天,官方至今未回应

谷歌 AI 编程 IDE Antigravity 近一周持续出现大面积服务中断。4 月 14 日至 15 日的一次宕机超过 9 小时,所有模型(包括 Gemini 3.1 Pro、Gemini 3.1 Flash 和通过 Antigravity 接入的 Claude)均无法使用,返回 HTTP 503 错误和「Our servers are experiencing high traffic right now」提示。谷歌官方开发者论坛上相关帖子在一天内涌入 120 条回复、80 名用户报告相同问题。

问题不只是临时宕机。月付 20 美元的 Pro 用户反映,原本宣传的 5 小时配额重置周期实际变成了 5 到 7 天的完全锁定,期间无法使用任何模型。谷歌的应对是弹窗建议升级到月付 200 美元的 Ultra 计划。但 Ultra 用户同样报告配额被无声削减、服务不可用。一名 Ultra 订阅者在论坛警告:「别升级了,Ultra 现在也一样,配额被静默砍掉,没有客服,没有公告。」更讽刺的是,Antigravity 内置的 bug 反馈工具本身也无法提交,用户只能涌向论坛。

这不是偶发故障。论坛上最早的配额异常投诉帖可追溯到今年 1 月 25 日,至今已累积超过 639 条回复和 2.65 万次浏览,问题持续近三个月未解决。过去一周集中爆发了多个新帖:「Antigravity 完全无法使用」「Pro 账户被锁 7 天请求手动重置配额」「点击重试反而锁定整个账户」。部分用户已卸载 Antigravity 转向 Cursor 和 Claude Code,论坛上「bye bye antigravity hi cursor」的留言获得高赞。

Antigravity 是谷歌在 AI 编程工具赛道的核心产品,集成多模型调用、浏览器操控、CLI 执行和推理模式切换,今年初上线时被定位为 Cursor 和 Claude Code 的直接竞品。但从用户反馈看,产品的基础可靠性远未达到生产级别。付费用户被锁在门外数天、官方零沟通、连 bug 反馈通道都是坏的,这对一款需要开发者将日常工作流迁移上来的工具来说是致命的。AI 编程工具的竞争已进入拼稳定性和信任的阶段,宕机本身不罕见,但持续三个月的配额混乱加上完全缺位的官方响应,正在把早期用户推向竞品。

信源:https://discuss.ai.google.dev/t/antigravity-servers-down-for-over-7-hours/139906
🤔1
马斯克:Grok Build下周发Beta,编程能力5月才能接近Opus 4.6

Elon Musk 宣布 xAI 的编程工具 Grok Build 将于下周发布 Beta 版,同时提供应用(app)和终端(terminal)两种形态。这是 Grok Build 首次获得明确的上线时间。

Grok Build 对标 Anthropic 的 Claude Code 和 OpenAI 的 Codex。此前对平台代码的拆解显示,该工具可通过命令行在本地运行,也可通过网页界面远程操作。区别于竞品的一个功能是 Model Arena 模式,多个 AI 代理同时处理同一编程任务,用户对比结果后选择最优方案。计费上,xAI 正在搭建积分制体系,订阅用户每月获得固定额度,超出按需购买,与 Claude Code 和 Codex 的模式一致。

不过 Musk 自己也清楚差距。他 4 月 12 日在 X 上说,Grok 的编程能力「要到 5 月才能接近 Opus 4.6,6 月才可能追平甚至超越」,并称「按正常标准很短,但在 AI 领域算很长」。Opus 4.6 是 Anthropic 当前最强的 Claude 模型。

下周的 Beta 版在编程能力上大概率还不是同类最强,但 xAI 急于在 AI 编程工具市场卡位,先把产品形态和商业基础设施铺出来。

信源:https://x.com/elonmusk/status/2044681781816025139
DeepSeek开源GPU算子库DeepGEMM大版本更新,新增Mega MoE将MoE五步运算融合为单个kernel

DeepSeek 今天发布 DeepGEMM 开源以来最大一次更新。这个去年 2 月「开源周」期间发布的 GPU 算子库,原本只做 FP8 矩阵乘法,现在扩展为覆盖大模型推理关键环节的完整算子库,支持 FP8、FP4、BF16 多种精度的矩阵运算,以及 MoE 和注意力评分等专用算子。

核心新增是 Mega MoE。MoE(混合专家)架构是 DeepSeek V3 等模型的基础,推理时需要依次执行五个步骤:EP 分发、第一层线性变换、SwiGLU 激活、第二层线性变换、EP 合并。传统做法是五个独立 kernel 依次调用,每次调用都要等上一步完成、数据在显存里搬来搬去。Mega MoE 把这五步融合成一个 kernel,让 NVLink 通信和 Tensor Core 计算同时进行,省去中间的等待和数据搬运。目前仅支持 FP8×FP4 精度组合,需要 PyTorch 2.9 及以上版本,团队表示仍在优化中,性能对比数据将稍后公布。

其他新增包括:FP8×FP4 混合精度矩阵乘法、支持更大 MTP 的 FP4 注意力评分算子(Indexer)、PDL(程序化依赖启动,一种减少 kernel 启动延迟的 GPU 调度优化)、更快的 JIT 编译速度,以及对 MoE 矩阵运算的多项优化。此次更新还适配了 DeepEPv2 的 MoE 数据布局。

PR 说明中特别注明:「本次发布仅与 DeepGEMM 开发相关,与内部模型发布无关。」

信源:https://github.com/deepseek-ai/DeepGEMM/pull/304
3
OpenAI想靠ChatGPT广告2027年赚110亿美元,但试点CPM只卖到15美元

OpenAI 即将为 ChatGPT 广告引入按点击计费(CPC)模式,并在探索以转化为导向的广告形式(促成购买或应用下载),但后者尚无明确时间表。

广告业务的现状与野心差距明显。OpenAI 今年 2 月开始在免费版和最低价付费版 ChatGPT 中向美国登录用户展示广告,最初目标 CPM(千次展示成本)高达 60 美元,对标流媒体电视等高端广告位。但部分广告主实际成交 CPM 仅为 15 至 25 美元,可能反映出竞标广告位的买家太少。试点期也被迫延长:广告展示频次不够高,早期广告主的预算到 3 月底仍未花完。OpenAI 3 月底在博客中称试点广告 6 周内突破 1 亿美元 ARR,但未说明计算口径。

OpenAI 一季度向投资者表示,预计今年广告收入达 24 亿美元,2027 年达 110 亿美元。后一个目标若实现,其广告规模将远超 Snap 和 Pinterest。

广告主的核心不满是缺乏效果追踪。Meta 和谷歌提供详细的受众画像和转化归因,OpenAI 目前只给聚合数据(展示量、点击量、花费)。营销机构 Brainlabs 程序化业务负责人 Ben Kahan 说:「很多有预算想试新渠道的客户都在观望,因为他们觉得拿不到想要的效果数据。」

OpenAI 正加速补课。近几周已向部分广告主开放自助管理后台,此前投放全靠电子表格和电话沟通;与广告技术公司 Criteo 合作代售;新签约广告主月度最低承诺降至 3 万至 5 万美元,早期最低预付为 20 万美元。但定向能力仍是短板,广告主只能提供宽泛关键词作为投放指引,无法按特定提示词或用户类型精准投放。广告格式也仅有短标题加小图,营销机构 Jellyfish 首席解决方案官 Jai Amin 称目前的格式「相当老派」。

OpenAI 做广告的真正挑战不是技术,而是广告主的预期管理。传统数字广告经过二十年迭代,已形成一套从曝光到转化的完整归因体系,广告主习惯了按效果付费和精准定向。ChatGPT 的对话式交互天然难以套用这套逻辑:每次回答都是动态生成的,没有固定页面可以锚定广告位,也无法像搜索广告那样按关键词竞价。从 CPM 转向 CPC 和转化计费是正确方向,但要真正与 Meta 和谷歌竞争,OpenAI 需要解决的不只是计费模式,还有整个广告测量和定向基础设施。

信源:https://www.theinformation.com/articles/openai-plans-new-pricing-chatgpt-ads-explores-upgrades