英伟达200亿美元收购Groq后首谈战略:推理token要按质论价,低延迟高单价是新赛道
黄仁勋在采访中首次详细解释了英伟达收购 Groq 的战略逻辑。英伟达去年 12 月以 200 亿美元收购了 Groq 的推理芯片业务,Groq 创始人 Jonathan Ross 及核心团队加入英伟达,Groq 作为独立公司继续运营。今年 3 月 GTC 大会上,英伟达发布了合并后首款芯片 Groq 3 LPU,由三星 4nm 工艺制造,英伟达称其在万亿参数模型上的每兆瓦推理吞吐量是 Blackwell NVL72 的 35 倍。
黄仁勋说,收购 Groq 的驱动力是推理市场的分层。此前推理优化只有一个方向:提高吞吐量。但 token 的商业价值已大幅上升,不同用户愿意为不同响应速度付不同价格。「如果我能给软件工程师提供响应更快的 token,让他们比现在更高效,我愿意为此付费。但这个市场直到最近才出现。」
他将这描述为推理市场帕累托前沿的扩展:在现有高吞吐量方案之外,新增一个低延迟、高单价的市场段。同一个模型,根据响应时间差异化定价,「虽然吞吐量更低,但单价能弥补」。Groq 的 LPU 架构以确定性低延迟著称,与英伟达 GPU 的高吞吐量路线互补,收购补上了英伟达在推理产品线上缺失的一块。
信源:https://www.youtube.com/watch?v=Hrbq66XqtCo
黄仁勋在采访中首次详细解释了英伟达收购 Groq 的战略逻辑。英伟达去年 12 月以 200 亿美元收购了 Groq 的推理芯片业务,Groq 创始人 Jonathan Ross 及核心团队加入英伟达,Groq 作为独立公司继续运营。今年 3 月 GTC 大会上,英伟达发布了合并后首款芯片 Groq 3 LPU,由三星 4nm 工艺制造,英伟达称其在万亿参数模型上的每兆瓦推理吞吐量是 Blackwell NVL72 的 35 倍。
黄仁勋说,收购 Groq 的驱动力是推理市场的分层。此前推理优化只有一个方向:提高吞吐量。但 token 的商业价值已大幅上升,不同用户愿意为不同响应速度付不同价格。「如果我能给软件工程师提供响应更快的 token,让他们比现在更高效,我愿意为此付费。但这个市场直到最近才出现。」
他将这描述为推理市场帕累托前沿的扩展:在现有高吞吐量方案之外,新增一个低延迟、高单价的市场段。同一个模型,根据响应时间差异化定价,「虽然吞吐量更低,但单价能弥补」。Groq 的 LPU 架构以确定性低延迟著称,与英伟达 GPU 的高吞吐量路线互补,收购补上了英伟达在推理产品线上缺失的一块。
信源:https://www.youtube.com/watch?v=Hrbq66XqtCo
YouTube
Jensen Huang – Will Nvidia’s moat persist?
I asked Jensen about TPU competition, Nvidia’s lock on the ever more bottlenecked supply chain needed to make advanced chips, whether we should be selling AI chips to China, why Nvidia doesn’t just become a hyperscaler, how it makes its investments, and much…
Claude Opus 4.6已在向用户自报「claude-opus-4-7」,Anthropic疑似静默切换模型
多名用户今日发现,在 claude.ai 上选择 Opus 4.6 对话时,直接询问模型的 model slug,得到的回答是「claude-opus-4-7」。界面仍显示「Opus 4.6」,但模型自报的内部标识符已变。X 用户 @evanM_FP 的截图显示,模型明确回复「Claude Opus 4.6, with the model string claude-opus-4-7」。
这不是 Opus 4.7 标识符首次被发现。3 月 31 日,Anthropic 在 Claude Code 的 npm 包中意外附带了一份 60MB 的 source map 文件,安全研究者从中解包出约 1900 个 TypeScript 源文件,其中包含
多名用户今日发现,在 claude.ai 上选择 Opus 4.6 对话时,直接询问模型的 model slug,得到的回答是「claude-opus-4-7」。界面仍显示「Opus 4.6」,但模型自报的内部标识符已变。X 用户 @evanM_FP 的截图显示,模型明确回复「Claude Opus 4.6, with the model string claude-opus-4-7」。
这不是 Opus 4.7 标识符首次被发现。3 月 31 日,Anthropic 在 Claude Code 的 npm 包中意外附带了一份 60MB 的 source map 文件,安全研究者从中解包出约 1900 个 TypeScript 源文件,其中包含
claude-opus-4.7 和 claude-sonnet-4.8 等内部模型标识符。4 月 12 日,该标识符又在 Anthropic 的内部 API 系统中被人发现。4 月 14 日,《The Information》援引知情人士报道称 Anthropic 最快本周发布 Opus 4.7。现在用户端的模型自报将这条线索链推到了最后一步:模型可能已经在线上运行。❤1
Nucleus-Image开源,17B参数推理仅激活2B,无后训练基准超Imagen4
Nucleus AI 团队发布文生图模型 Nucleus-Image,同步开源模型权重、训练代码和训练数据集,许可证为 Apache 2.0,可商用。模型采用稀疏混合专家(MoE)扩散变换器架构,总参数量 17B,分布在每层 64 个路由专家中,每次推理仅激活约 2B 参数,推理成本显著低于同参数量级的密集模型。
在三项标准基准上,Nucleus-Image 与闭源头部模型持平甚至超越:GenEval 得分 0.87,与千问图像模型持平,空间位置子项(0.85)居所有对比模型之首;DPG-Bench 得分 88.79,综合排名第一;OneIG-Bench 得分 0.522,超过谷歌 Imagen4(0.515)和 Recraft V3(0.502)。以上成绩全部来自纯预训练,未做 DPO、强化学习或人类偏好调优。Nucleus AI 官方称这是「该质量级别上首个全开源 MoE 扩散模型」。
训练数据从网络大规模爬取,经多轮过滤、去重和美学评分后保留 7 亿张图片,生成 15 亿图文对;训练分三阶段从 256 到 1024 分辨率逐步推进,共 170 万步。文本编码器使用 Qwen3-VL-8B-Instruct,通过 diffusers 库调用,并内置跨去噪步骤的文本 KV 缓存,进一步降低推理开销。
对需要在本地部署图像生成的开发者来说,17B 参数但只需激活 2B 的设计意味着消费级 GPU 也有运行空间。完整开源(权重 + 训练代码 + 数据集)相对罕见——多数开源图像模型只放权重,数据集和训练细节仍封闭,这也是文生图领域可复现研究的主要瓶颈之一。
信源:https://arxiv.org/abs/2604.12163
Nucleus AI 团队发布文生图模型 Nucleus-Image,同步开源模型权重、训练代码和训练数据集,许可证为 Apache 2.0,可商用。模型采用稀疏混合专家(MoE)扩散变换器架构,总参数量 17B,分布在每层 64 个路由专家中,每次推理仅激活约 2B 参数,推理成本显著低于同参数量级的密集模型。
在三项标准基准上,Nucleus-Image 与闭源头部模型持平甚至超越:GenEval 得分 0.87,与千问图像模型持平,空间位置子项(0.85)居所有对比模型之首;DPG-Bench 得分 88.79,综合排名第一;OneIG-Bench 得分 0.522,超过谷歌 Imagen4(0.515)和 Recraft V3(0.502)。以上成绩全部来自纯预训练,未做 DPO、强化学习或人类偏好调优。Nucleus AI 官方称这是「该质量级别上首个全开源 MoE 扩散模型」。
训练数据从网络大规模爬取,经多轮过滤、去重和美学评分后保留 7 亿张图片,生成 15 亿图文对;训练分三阶段从 256 到 1024 分辨率逐步推进,共 170 万步。文本编码器使用 Qwen3-VL-8B-Instruct,通过 diffusers 库调用,并内置跨去噪步骤的文本 KV 缓存,进一步降低推理开销。
对需要在本地部署图像生成的开发者来说,17B 参数但只需激活 2B 的设计意味着消费级 GPU 也有运行空间。完整开源(权重 + 训练代码 + 数据集)相对罕见——多数开源图像模型只放权重,数据集和训练细节仍封闭,这也是文生图领域可复现研究的主要瓶颈之一。
信源:https://arxiv.org/abs/2604.12163
METR更新AI代理能力基准,Gemini 3.1 Pro可靠性超越所有前沿模型登顶
AI 安全评估机构 METR 更新「时间地平线」(Time Horizon)基准,新增谷歌 Gemini 3.1 Pro 的测试数据。该基准追踪前沿 AI 代理独立完成编程任务的能力上限,自今年 2 月上线以来已成为衡量 AI 代理能力增长的重要参考。
测量方式是让人类软件工程专家(平均约 5 年经验)和 AI 代理完成同一组超过一百项软件任务,用人类耗时衡量任务难度。核心指标有两个:50% 时间地平线(AI 有一半概率完成的最高任务难度)和 80% 时间地平线(AI 有八成概率完成的最高任务难度)。
Gemini 3.1 Pro 在两个指标上的排名出现反转。50% 时间地平线排第二,仅次于大幅领先的 Claude Opus 4.6:
1. Claude Opus 4.6:约 12.0 小时
2. Gemini 3.1 Pro:约 6.4 小时
3. GPT-5.2:约 5.9 小时
4. GPT-5.4:约 5.7 小时
但在更严格的 80% 时间地平线上,Gemini 3.1 Pro 反超登顶:
1. Gemini 3.1 Pro:约 1.5 小时
2. Claude Opus 4.6:约 1.2 小时
3. GPT-5.2:约 1.1 小时
Claude Opus 4.6 能挑战更难的任务但成功率波动大,Gemini 3.1 Pro 天花板低一些但在能力范围内更稳定。对需要可预测结果的生产场景,后者可能更实用。
相比上一代 Gemini 3 Pro(50% 时间地平线约 3.7 小时),Gemini 3.1 Pro 提升约 71%。从更长的时间线看,METR 的数据显示前沿模型的时间地平线从 2019 年 GPT-2 的几秒钟增长到如今的十余小时,约每 4.3 个月翻一番,METR 称「没有看到指数增长放缓的迹象」。
需注意,METR 的任务覆盖软件工程、机器学习和网络安全,且均为定义清晰、可自动评分的独立任务。METR 在后续研究中发现,当评分方式从算法判定改为人类整体评判时,AI 表现显著下降。12 小时的时间地平线不等于 AI 能替代人类半天的实际工作。
信源:https://metr.org/time-horizons/
AI 安全评估机构 METR 更新「时间地平线」(Time Horizon)基准,新增谷歌 Gemini 3.1 Pro 的测试数据。该基准追踪前沿 AI 代理独立完成编程任务的能力上限,自今年 2 月上线以来已成为衡量 AI 代理能力增长的重要参考。
测量方式是让人类软件工程专家(平均约 5 年经验)和 AI 代理完成同一组超过一百项软件任务,用人类耗时衡量任务难度。核心指标有两个:50% 时间地平线(AI 有一半概率完成的最高任务难度)和 80% 时间地平线(AI 有八成概率完成的最高任务难度)。
Gemini 3.1 Pro 在两个指标上的排名出现反转。50% 时间地平线排第二,仅次于大幅领先的 Claude Opus 4.6:
1. Claude Opus 4.6:约 12.0 小时
2. Gemini 3.1 Pro:约 6.4 小时
3. GPT-5.2:约 5.9 小时
4. GPT-5.4:约 5.7 小时
但在更严格的 80% 时间地平线上,Gemini 3.1 Pro 反超登顶:
1. Gemini 3.1 Pro:约 1.5 小时
2. Claude Opus 4.6:约 1.2 小时
3. GPT-5.2:约 1.1 小时
Claude Opus 4.6 能挑战更难的任务但成功率波动大,Gemini 3.1 Pro 天花板低一些但在能力范围内更稳定。对需要可预测结果的生产场景,后者可能更实用。
相比上一代 Gemini 3 Pro(50% 时间地平线约 3.7 小时),Gemini 3.1 Pro 提升约 71%。从更长的时间线看,METR 的数据显示前沿模型的时间地平线从 2019 年 GPT-2 的几秒钟增长到如今的十余小时,约每 4.3 个月翻一番,METR 称「没有看到指数增长放缓的迹象」。
需注意,METR 的任务覆盖软件工程、机器学习和网络安全,且均为定义清晰、可自动评分的独立任务。METR 在后续研究中发现,当评分方式从算法判定改为人类整体评判时,AI 表现显著下降。12 小时的时间地平线不等于 AI 能替代人类半天的实际工作。
信源:https://metr.org/time-horizons/
metr.org
Task-Completion Time Horizons of Frontier AI Models
Our most up-to-date measurements of the time horizons for public frontier language models.
ChatGPT流量份额一年从77%跌至57%,Gemini翻四倍升至25%
Similarweb 发布截至 2026 年 3 月的生成式 AI 网站流量份额数据。过去 12 个月,ChatGPT 从 77.43% 降至 56.72%,丢掉超过 20 个百分点;Gemini 从 6.00% 升至 25.46%,翻了四倍多,吃下了流失份额的大头。
各产品 3 月份额:
1. ChatGPT:56.72%
2. Gemini:25.46%
3. Claude:6.02%
4. DeepSeek:3.74%
5. Grok:3.44%
6. Copilot:1.99%
7. Perplexity:1.64%
短期变动最剧烈的是 Claude:一年前仅 1.40%,1 月还在 2.22%,3 月突破 6%,其中 2 月到 3 月单月接近翻倍。Grok 从一年前的第二名(7.03%)跌至第五(3.44%),被 DeepSeek 反超。Copilot 的上升部分源于统计口径调整,Similarweb 将微软 m365.cloud.microsoft/chat 纳入了 Copilot 流量。
一年前 ChatGPT 以 77% 的份额近乎垄断,如今前两名合计 82%(ChatGPT 57% + Gemini 25%),格局从一家独大变为两强主导。两种增长的形态截然不同:Gemini 逐季匀速爬升,Claude 则在前 10 个月几乎没动、最近两个月突然从 2% 拉到 6%。Grok 跌幅最深,一年前排第二,如今已被三家超过。
信源:https://x.com/Similarweb/status/2044682637860573534
Similarweb 发布截至 2026 年 3 月的生成式 AI 网站流量份额数据。过去 12 个月,ChatGPT 从 77.43% 降至 56.72%,丢掉超过 20 个百分点;Gemini 从 6.00% 升至 25.46%,翻了四倍多,吃下了流失份额的大头。
各产品 3 月份额:
1. ChatGPT:56.72%
2. Gemini:25.46%
3. Claude:6.02%
4. DeepSeek:3.74%
5. Grok:3.44%
6. Copilot:1.99%
7. Perplexity:1.64%
短期变动最剧烈的是 Claude:一年前仅 1.40%,1 月还在 2.22%,3 月突破 6%,其中 2 月到 3 月单月接近翻倍。Grok 从一年前的第二名(7.03%)跌至第五(3.44%),被 DeepSeek 反超。Copilot 的上升部分源于统计口径调整,Similarweb 将微软 m365.cloud.microsoft/chat 纳入了 Copilot 流量。
一年前 ChatGPT 以 77% 的份额近乎垄断,如今前两名合计 82%(ChatGPT 57% + Gemini 25%),格局从一家独大变为两强主导。两种增长的形态截然不同:Gemini 逐季匀速爬升,Claude 则在前 10 个月几乎没动、最近两个月突然从 2% 拉到 6%。Grok 跌幅最深,一年前排第二,如今已被三家超过。
信源:https://x.com/Similarweb/status/2044682637860573534
苹果把近200名Siri程序员送回「编程学校」,距新版Siri发布仅两个月
苹果计划将近 200 名 Siri 程序员送去参加为期数周的 AI 编程培训班,学习使用 AI 工具写代码。此时距新版 Siri 预计在 6 月 WWDC 上亮相仅剩两个月。Siri 团队总人数达数百人,培训结束后核心开发组仅保留约 60 人,另有约 60 人转入评估组,负责测试 Siri 的指令处理和安全合规。
苹果软件工程等部门已大规模采用 Claude Code 等 AI 编程工具,部分团队为此分配了大笔预算,但 Siri 团队未能跟上。这支团队在苹果内部以「落后者」著称,15 年来人员臃肿、内部政治分裂,在 ChatGPT 等大语言模型崛起后更难以保持竞争力。苹果近年多次重组 Siri:去年初将团队从 AI 部门负责人 John Giannandrea 手中划出,交由软件主管 Craig Federighi 管辖,Vision Pro 负责人 Mike Rockwell 直接负责 Siri 产品。此前苹果曾计划 2025 年初发布新版 Siri,但遭遇延期。Giannandrea 去年 12 月宣布退休,据 Bloomberg 报道,本周将是他在苹果担任顾问的最后一天。
新版 Siri 将由谷歌 Gemini 驱动,支持更自然的对话、直接回答问题、提供情感支持和完成预订等任务。苹果正与谷歌讨论由后者托管运行新 Siri 的服务器,目前仍有大量工作待完成。一家以自研芯片和操作系统著称的公司,语音助手要靠竞争对手的模型和服务器来运行,Siri 团队要靠培训班来学会用 AI 写代码,这本身就是苹果在生成式 AI 浪潮中处境的缩影。
信源:https://www.theinformation.com/articles/apple-sends-siri-staffers-coding-bootcamp-latest-shakeup-organization?rc=h8czej
苹果计划将近 200 名 Siri 程序员送去参加为期数周的 AI 编程培训班,学习使用 AI 工具写代码。此时距新版 Siri 预计在 6 月 WWDC 上亮相仅剩两个月。Siri 团队总人数达数百人,培训结束后核心开发组仅保留约 60 人,另有约 60 人转入评估组,负责测试 Siri 的指令处理和安全合规。
苹果软件工程等部门已大规模采用 Claude Code 等 AI 编程工具,部分团队为此分配了大笔预算,但 Siri 团队未能跟上。这支团队在苹果内部以「落后者」著称,15 年来人员臃肿、内部政治分裂,在 ChatGPT 等大语言模型崛起后更难以保持竞争力。苹果近年多次重组 Siri:去年初将团队从 AI 部门负责人 John Giannandrea 手中划出,交由软件主管 Craig Federighi 管辖,Vision Pro 负责人 Mike Rockwell 直接负责 Siri 产品。此前苹果曾计划 2025 年初发布新版 Siri,但遭遇延期。Giannandrea 去年 12 月宣布退休,据 Bloomberg 报道,本周将是他在苹果担任顾问的最后一天。
新版 Siri 将由谷歌 Gemini 驱动,支持更自然的对话、直接回答问题、提供情感支持和完成预订等任务。苹果正与谷歌讨论由后者托管运行新 Siri 的服务器,目前仍有大量工作待完成。一家以自研芯片和操作系统著称的公司,语音助手要靠竞争对手的模型和服务器来运行,Siri 团队要靠培训班来学会用 AI 写代码,这本身就是苹果在生成式 AI 浪潮中处境的缩影。
信源:https://www.theinformation.com/articles/apple-sends-siri-staffers-coding-bootcamp-latest-shakeup-organization?rc=h8czej
The Information
Apple Sends Siri Staffers to Coding ‘Bootcamp’ in Latest Shakeup For Organization
Apple is sending a portion of its Siri programmers back to coding school just two months before the company is expected to unveil a major, AI-powered revamp of the voice assistant, people familiar with the team said. The company plans to send a significant…
谷歌AI编程工具Antigravity连续多日宕机,付费用户被锁最长7天,官方至今未回应
谷歌 AI 编程 IDE Antigravity 近一周持续出现大面积服务中断。4 月 14 日至 15 日的一次宕机超过 9 小时,所有模型(包括 Gemini 3.1 Pro、Gemini 3.1 Flash 和通过 Antigravity 接入的 Claude)均无法使用,返回 HTTP 503 错误和「Our servers are experiencing high traffic right now」提示。谷歌官方开发者论坛上相关帖子在一天内涌入 120 条回复、80 名用户报告相同问题。
问题不只是临时宕机。月付 20 美元的 Pro 用户反映,原本宣传的 5 小时配额重置周期实际变成了 5 到 7 天的完全锁定,期间无法使用任何模型。谷歌的应对是弹窗建议升级到月付 200 美元的 Ultra 计划。但 Ultra 用户同样报告配额被无声削减、服务不可用。一名 Ultra 订阅者在论坛警告:「别升级了,Ultra 现在也一样,配额被静默砍掉,没有客服,没有公告。」更讽刺的是,Antigravity 内置的 bug 反馈工具本身也无法提交,用户只能涌向论坛。
这不是偶发故障。论坛上最早的配额异常投诉帖可追溯到今年 1 月 25 日,至今已累积超过 639 条回复和 2.65 万次浏览,问题持续近三个月未解决。过去一周集中爆发了多个新帖:「Antigravity 完全无法使用」「Pro 账户被锁 7 天请求手动重置配额」「点击重试反而锁定整个账户」。部分用户已卸载 Antigravity 转向 Cursor 和 Claude Code,论坛上「bye bye antigravity hi cursor」的留言获得高赞。
Antigravity 是谷歌在 AI 编程工具赛道的核心产品,集成多模型调用、浏览器操控、CLI 执行和推理模式切换,今年初上线时被定位为 Cursor 和 Claude Code 的直接竞品。但从用户反馈看,产品的基础可靠性远未达到生产级别。付费用户被锁在门外数天、官方零沟通、连 bug 反馈通道都是坏的,这对一款需要开发者将日常工作流迁移上来的工具来说是致命的。AI 编程工具的竞争已进入拼稳定性和信任的阶段,宕机本身不罕见,但持续三个月的配额混乱加上完全缺位的官方响应,正在把早期用户推向竞品。
信源:https://discuss.ai.google.dev/t/antigravity-servers-down-for-over-7-hours/139906
谷歌 AI 编程 IDE Antigravity 近一周持续出现大面积服务中断。4 月 14 日至 15 日的一次宕机超过 9 小时,所有模型(包括 Gemini 3.1 Pro、Gemini 3.1 Flash 和通过 Antigravity 接入的 Claude)均无法使用,返回 HTTP 503 错误和「Our servers are experiencing high traffic right now」提示。谷歌官方开发者论坛上相关帖子在一天内涌入 120 条回复、80 名用户报告相同问题。
问题不只是临时宕机。月付 20 美元的 Pro 用户反映,原本宣传的 5 小时配额重置周期实际变成了 5 到 7 天的完全锁定,期间无法使用任何模型。谷歌的应对是弹窗建议升级到月付 200 美元的 Ultra 计划。但 Ultra 用户同样报告配额被无声削减、服务不可用。一名 Ultra 订阅者在论坛警告:「别升级了,Ultra 现在也一样,配额被静默砍掉,没有客服,没有公告。」更讽刺的是,Antigravity 内置的 bug 反馈工具本身也无法提交,用户只能涌向论坛。
这不是偶发故障。论坛上最早的配额异常投诉帖可追溯到今年 1 月 25 日,至今已累积超过 639 条回复和 2.65 万次浏览,问题持续近三个月未解决。过去一周集中爆发了多个新帖:「Antigravity 完全无法使用」「Pro 账户被锁 7 天请求手动重置配额」「点击重试反而锁定整个账户」。部分用户已卸载 Antigravity 转向 Cursor 和 Claude Code,论坛上「bye bye antigravity hi cursor」的留言获得高赞。
Antigravity 是谷歌在 AI 编程工具赛道的核心产品,集成多模型调用、浏览器操控、CLI 执行和推理模式切换,今年初上线时被定位为 Cursor 和 Claude Code 的直接竞品。但从用户反馈看,产品的基础可靠性远未达到生产级别。付费用户被锁在门外数天、官方零沟通、连 bug 反馈通道都是坏的,这对一款需要开发者将日常工作流迁移上来的工具来说是致命的。AI 编程工具的竞争已进入拼稳定性和信任的阶段,宕机本身不罕见,但持续三个月的配额混乱加上完全缺位的官方响应,正在把早期用户推向竞品。
信源:https://discuss.ai.google.dev/t/antigravity-servers-down-for-over-7-hours/139906
Google AI Developers Forum
Antigravity servers down for over 7 hours!
“Our servers are experiencing high traffic right now, please try again in a minute” This has been happening for far too long! I haven’t been able to get any work done at all. Unfortunately, I rely on antigravity to build for my clients. Ive reverted to…
🤔1
马斯克:Grok Build下周发Beta,编程能力5月才能接近Opus 4.6
Elon Musk 宣布 xAI 的编程工具 Grok Build 将于下周发布 Beta 版,同时提供应用(app)和终端(terminal)两种形态。这是 Grok Build 首次获得明确的上线时间。
Grok Build 对标 Anthropic 的 Claude Code 和 OpenAI 的 Codex。此前对平台代码的拆解显示,该工具可通过命令行在本地运行,也可通过网页界面远程操作。区别于竞品的一个功能是 Model Arena 模式,多个 AI 代理同时处理同一编程任务,用户对比结果后选择最优方案。计费上,xAI 正在搭建积分制体系,订阅用户每月获得固定额度,超出按需购买,与 Claude Code 和 Codex 的模式一致。
不过 Musk 自己也清楚差距。他 4 月 12 日在 X 上说,Grok 的编程能力「要到 5 月才能接近 Opus 4.6,6 月才可能追平甚至超越」,并称「按正常标准很短,但在 AI 领域算很长」。Opus 4.6 是 Anthropic 当前最强的 Claude 模型。
下周的 Beta 版在编程能力上大概率还不是同类最强,但 xAI 急于在 AI 编程工具市场卡位,先把产品形态和商业基础设施铺出来。
信源:https://x.com/elonmusk/status/2044681781816025139
Elon Musk 宣布 xAI 的编程工具 Grok Build 将于下周发布 Beta 版,同时提供应用(app)和终端(terminal)两种形态。这是 Grok Build 首次获得明确的上线时间。
Grok Build 对标 Anthropic 的 Claude Code 和 OpenAI 的 Codex。此前对平台代码的拆解显示,该工具可通过命令行在本地运行,也可通过网页界面远程操作。区别于竞品的一个功能是 Model Arena 模式,多个 AI 代理同时处理同一编程任务,用户对比结果后选择最优方案。计费上,xAI 正在搭建积分制体系,订阅用户每月获得固定额度,超出按需购买,与 Claude Code 和 Codex 的模式一致。
不过 Musk 自己也清楚差距。他 4 月 12 日在 X 上说,Grok 的编程能力「要到 5 月才能接近 Opus 4.6,6 月才可能追平甚至超越」,并称「按正常标准很短,但在 AI 领域算很长」。Opus 4.6 是 Anthropic 当前最强的 Claude 模型。
下周的 Beta 版在编程能力上大概率还不是同类最强,但 xAI 急于在 AI 编程工具市场卡位,先把产品形态和商业基础设施铺出来。
信源:https://x.com/elonmusk/status/2044681781816025139
X (formerly Twitter)
Elon Musk (@elonmusk) on X
@HighlyUnspoken @cb_doge @Similarweb @grok Beta release of Grok Build app & terminal next week
DeepSeek开源GPU算子库DeepGEMM大版本更新,新增Mega MoE将MoE五步运算融合为单个kernel
DeepSeek 今天发布 DeepGEMM 开源以来最大一次更新。这个去年 2 月「开源周」期间发布的 GPU 算子库,原本只做 FP8 矩阵乘法,现在扩展为覆盖大模型推理关键环节的完整算子库,支持 FP8、FP4、BF16 多种精度的矩阵运算,以及 MoE 和注意力评分等专用算子。
核心新增是 Mega MoE。MoE(混合专家)架构是 DeepSeek V3 等模型的基础,推理时需要依次执行五个步骤:EP 分发、第一层线性变换、SwiGLU 激活、第二层线性变换、EP 合并。传统做法是五个独立 kernel 依次调用,每次调用都要等上一步完成、数据在显存里搬来搬去。Mega MoE 把这五步融合成一个 kernel,让 NVLink 通信和 Tensor Core 计算同时进行,省去中间的等待和数据搬运。目前仅支持 FP8×FP4 精度组合,需要 PyTorch 2.9 及以上版本,团队表示仍在优化中,性能对比数据将稍后公布。
其他新增包括:FP8×FP4 混合精度矩阵乘法、支持更大 MTP 的 FP4 注意力评分算子(Indexer)、PDL(程序化依赖启动,一种减少 kernel 启动延迟的 GPU 调度优化)、更快的 JIT 编译速度,以及对 MoE 矩阵运算的多项优化。此次更新还适配了 DeepEPv2 的 MoE 数据布局。
PR 说明中特别注明:「本次发布仅与 DeepGEMM 开发相关,与内部模型发布无关。」
信源:https://github.com/deepseek-ai/DeepGEMM/pull/304
DeepSeek 今天发布 DeepGEMM 开源以来最大一次更新。这个去年 2 月「开源周」期间发布的 GPU 算子库,原本只做 FP8 矩阵乘法,现在扩展为覆盖大模型推理关键环节的完整算子库,支持 FP8、FP4、BF16 多种精度的矩阵运算,以及 MoE 和注意力评分等专用算子。
核心新增是 Mega MoE。MoE(混合专家)架构是 DeepSeek V3 等模型的基础,推理时需要依次执行五个步骤:EP 分发、第一层线性变换、SwiGLU 激活、第二层线性变换、EP 合并。传统做法是五个独立 kernel 依次调用,每次调用都要等上一步完成、数据在显存里搬来搬去。Mega MoE 把这五步融合成一个 kernel,让 NVLink 通信和 Tensor Core 计算同时进行,省去中间的等待和数据搬运。目前仅支持 FP8×FP4 精度组合,需要 PyTorch 2.9 及以上版本,团队表示仍在优化中,性能对比数据将稍后公布。
其他新增包括:FP8×FP4 混合精度矩阵乘法、支持更大 MTP 的 FP4 注意力评分算子(Indexer)、PDL(程序化依赖启动,一种减少 kernel 启动延迟的 GPU 调度优化)、更快的 JIT 编译速度,以及对 MoE 矩阵运算的多项优化。此次更新还适配了 DeepEPv2 的 MoE 数据布局。
PR 说明中特别注明:「本次发布仅与 DeepGEMM 开发相关,与内部模型发布无关。」
信源:https://github.com/deepseek-ai/DeepGEMM/pull/304
❤3
OpenAI想靠ChatGPT广告2027年赚110亿美元,但试点CPM只卖到15美元
OpenAI 即将为 ChatGPT 广告引入按点击计费(CPC)模式,并在探索以转化为导向的广告形式(促成购买或应用下载),但后者尚无明确时间表。
广告业务的现状与野心差距明显。OpenAI 今年 2 月开始在免费版和最低价付费版 ChatGPT 中向美国登录用户展示广告,最初目标 CPM(千次展示成本)高达 60 美元,对标流媒体电视等高端广告位。但部分广告主实际成交 CPM 仅为 15 至 25 美元,可能反映出竞标广告位的买家太少。试点期也被迫延长:广告展示频次不够高,早期广告主的预算到 3 月底仍未花完。OpenAI 3 月底在博客中称试点广告 6 周内突破 1 亿美元 ARR,但未说明计算口径。
OpenAI 一季度向投资者表示,预计今年广告收入达 24 亿美元,2027 年达 110 亿美元。后一个目标若实现,其广告规模将远超 Snap 和 Pinterest。
广告主的核心不满是缺乏效果追踪。Meta 和谷歌提供详细的受众画像和转化归因,OpenAI 目前只给聚合数据(展示量、点击量、花费)。营销机构 Brainlabs 程序化业务负责人 Ben Kahan 说:「很多有预算想试新渠道的客户都在观望,因为他们觉得拿不到想要的效果数据。」
OpenAI 正加速补课。近几周已向部分广告主开放自助管理后台,此前投放全靠电子表格和电话沟通;与广告技术公司 Criteo 合作代售;新签约广告主月度最低承诺降至 3 万至 5 万美元,早期最低预付为 20 万美元。但定向能力仍是短板,广告主只能提供宽泛关键词作为投放指引,无法按特定提示词或用户类型精准投放。广告格式也仅有短标题加小图,营销机构 Jellyfish 首席解决方案官 Jai Amin 称目前的格式「相当老派」。
OpenAI 做广告的真正挑战不是技术,而是广告主的预期管理。传统数字广告经过二十年迭代,已形成一套从曝光到转化的完整归因体系,广告主习惯了按效果付费和精准定向。ChatGPT 的对话式交互天然难以套用这套逻辑:每次回答都是动态生成的,没有固定页面可以锚定广告位,也无法像搜索广告那样按关键词竞价。从 CPM 转向 CPC 和转化计费是正确方向,但要真正与 Meta 和谷歌竞争,OpenAI 需要解决的不只是计费模式,还有整个广告测量和定向基础设施。
信源:https://www.theinformation.com/articles/openai-plans-new-pricing-chatgpt-ads-explores-upgrades
OpenAI 即将为 ChatGPT 广告引入按点击计费(CPC)模式,并在探索以转化为导向的广告形式(促成购买或应用下载),但后者尚无明确时间表。
广告业务的现状与野心差距明显。OpenAI 今年 2 月开始在免费版和最低价付费版 ChatGPT 中向美国登录用户展示广告,最初目标 CPM(千次展示成本)高达 60 美元,对标流媒体电视等高端广告位。但部分广告主实际成交 CPM 仅为 15 至 25 美元,可能反映出竞标广告位的买家太少。试点期也被迫延长:广告展示频次不够高,早期广告主的预算到 3 月底仍未花完。OpenAI 3 月底在博客中称试点广告 6 周内突破 1 亿美元 ARR,但未说明计算口径。
OpenAI 一季度向投资者表示,预计今年广告收入达 24 亿美元,2027 年达 110 亿美元。后一个目标若实现,其广告规模将远超 Snap 和 Pinterest。
广告主的核心不满是缺乏效果追踪。Meta 和谷歌提供详细的受众画像和转化归因,OpenAI 目前只给聚合数据(展示量、点击量、花费)。营销机构 Brainlabs 程序化业务负责人 Ben Kahan 说:「很多有预算想试新渠道的客户都在观望,因为他们觉得拿不到想要的效果数据。」
OpenAI 正加速补课。近几周已向部分广告主开放自助管理后台,此前投放全靠电子表格和电话沟通;与广告技术公司 Criteo 合作代售;新签约广告主月度最低承诺降至 3 万至 5 万美元,早期最低预付为 20 万美元。但定向能力仍是短板,广告主只能提供宽泛关键词作为投放指引,无法按特定提示词或用户类型精准投放。广告格式也仅有短标题加小图,营销机构 Jellyfish 首席解决方案官 Jai Amin 称目前的格式「相当老派」。
OpenAI 做广告的真正挑战不是技术,而是广告主的预期管理。传统数字广告经过二十年迭代,已形成一套从曝光到转化的完整归因体系,广告主习惯了按效果付费和精准定向。ChatGPT 的对话式交互天然难以套用这套逻辑:每次回答都是动态生成的,没有固定页面可以锚定广告位,也无法像搜索广告那样按关键词竞价。从 CPM 转向 CPC 和转化计费是正确方向,但要真正与 Meta 和谷歌竞争,OpenAI 需要解决的不只是计费模式,还有整个广告测量和定向基础设施。
信源:https://www.theinformation.com/articles/openai-plans-new-pricing-chatgpt-ads-explores-upgrades
The Information
OpenAI Plans New Pricing for ChatGPT Ads, Explores Other Upgrades
OpenAI plans to start pricing some ChatGPT ads based on whether people click on the ads rather than just how many people see them, an agency executive who spoke with OpenAI employees and works with ChatGPT advertisers said. At the same time, OpenAI has also…
Skild AI收购斑马技术机器人业务,「一个大脑控制所有机器人」路线开始落地
机器人基础模型公司 Skild AI 宣布收购斑马技术(Zebra Technologies)的机器人自动化业务,包括已在多个大型物流仓库部署的 Symmetry Fulfillment 调度平台。该业务前身为仓储移动机器人公司 Fetch Robotics。交易条款未披露。
Skild AI 2023 年成立于匹兹堡,核心产品「Skild Brain」是一套通用机器人 AI,不需要针对每种机器人单独训练,同一个模型能直接控制人形机器人、四足机器人、机械臂、自主移动机器人等不同硬件。公司投资方包括软银、英伟达风投、贝佐斯、红杉资本、Lightspeed、Coatue 等,估值超 140 亿美元。新闻稿还披露,Skild AI 2025 年在几个月内从零做到约 3000 万美元营收。
这笔收购的意义在于从「卖大脑」到「管仓库」。上个月 Skild AI 刚与 ABB 机器人和 Universal Robots 达成合作,将 Skild Brain 部署到工业机器人上,但那本质上还是卖软件。这次收购直接拿到了斑马技术在仓储领域的调度基础设施和客户关系。Symmetry 平台能实时协调不同类型的机器人与佩戴斑马可穿戴设备的一线工人。收购完成后,Skild AI 将能提供完整的仓库自动化方案:人形机器人负责拣选,机械臂打包,AMR 搬运,Symmetry 统一调度,Skild Brain 统一控制。
当前仓库自动化高度碎片化,每类机器人对应一套专用软件,换一种机器人几乎要从头开发。Skild AI CEO Deepak Pathak 称,拆掉现有仓库再围着预编程机器人重建在经济上不可行,将斑马的人机协作调度平台与 Skild AI 的通用大脑结合,才能改变现有仓库的自动化方式。
信源:https://www.businesswire.com/news/home/20260415518240/en/Skild-AI-Acquires-Zebra-Technologies-Robotics-Automation-Business
机器人基础模型公司 Skild AI 宣布收购斑马技术(Zebra Technologies)的机器人自动化业务,包括已在多个大型物流仓库部署的 Symmetry Fulfillment 调度平台。该业务前身为仓储移动机器人公司 Fetch Robotics。交易条款未披露。
Skild AI 2023 年成立于匹兹堡,核心产品「Skild Brain」是一套通用机器人 AI,不需要针对每种机器人单独训练,同一个模型能直接控制人形机器人、四足机器人、机械臂、自主移动机器人等不同硬件。公司投资方包括软银、英伟达风投、贝佐斯、红杉资本、Lightspeed、Coatue 等,估值超 140 亿美元。新闻稿还披露,Skild AI 2025 年在几个月内从零做到约 3000 万美元营收。
这笔收购的意义在于从「卖大脑」到「管仓库」。上个月 Skild AI 刚与 ABB 机器人和 Universal Robots 达成合作,将 Skild Brain 部署到工业机器人上,但那本质上还是卖软件。这次收购直接拿到了斑马技术在仓储领域的调度基础设施和客户关系。Symmetry 平台能实时协调不同类型的机器人与佩戴斑马可穿戴设备的一线工人。收购完成后,Skild AI 将能提供完整的仓库自动化方案:人形机器人负责拣选,机械臂打包,AMR 搬运,Symmetry 统一调度,Skild Brain 统一控制。
当前仓库自动化高度碎片化,每类机器人对应一套专用软件,换一种机器人几乎要从头开发。Skild AI CEO Deepak Pathak 称,拆掉现有仓库再围着预编程机器人重建在经济上不可行,将斑马的人机协作调度平台与 Skild AI 的通用大脑结合,才能改变现有仓库的自动化方式。
信源:https://www.businesswire.com/news/home/20260415518240/en/Skild-AI-Acquires-Zebra-Technologies-Robotics-Automation-Business
Businesswire
Skild AI Acquires Zebra Technologies' Robotics Automation Business
Skild AI today announced the acquisition of Zebra Technologies' Robotics Automation business, including its Symmetry Fulfillment orchestration platform. This...
苹果前高管及Nuvia团队再创业,AICPU初创公司Nuvacore获红杉资本投资
苹果前低功耗芯片架构负责人、Nuvia创始人Gerard Williams III宣布再次创业,推出AICPU初创公司Nuvacore。该公司已获得红杉资本(Sequoia Capital)领投的种子轮融资,旨在为AI时代重新设计通用CPU核心。
Nuvacore创始团队极具竞争力,除Williams外,联合创始人还包括同样来自苹果和Nuvia的核心成员John Bruno与Ram Srinivasan。Williams此前创立的Nuvia于2021年被高通以14亿美元收购,其技术成果Oryon架构目前已成为高通PC和手机芯片的核心竞争力。
与追求渐进式改进的传统厂商不同,Nuvacore主张从零开始重写硅片规则。其核心产品是针对AI工作负载和「智能体计算」(agentic computing)高度优化的通用CPU。公司称其设计在实现最高性能的同时具备极高的面积效率,可应用于从核心基础设施到先进AI系统的各类场景。
信源:https://www.nuvacore.ai/?p=1
苹果前低功耗芯片架构负责人、Nuvia创始人Gerard Williams III宣布再次创业,推出AICPU初创公司Nuvacore。该公司已获得红杉资本(Sequoia Capital)领投的种子轮融资,旨在为AI时代重新设计通用CPU核心。
Nuvacore创始团队极具竞争力,除Williams外,联合创始人还包括同样来自苹果和Nuvia的核心成员John Bruno与Ram Srinivasan。Williams此前创立的Nuvia于2021年被高通以14亿美元收购,其技术成果Oryon架构目前已成为高通PC和手机芯片的核心竞争力。
与追求渐进式改进的传统厂商不同,Nuvacore主张从零开始重写硅片规则。其核心产品是针对AI工作负载和「智能体计算」(agentic computing)高度优化的通用CPU。公司称其设计在实现最高性能的同时具备极高的面积效率,可应用于从核心基础设施到先进AI系统的各类场景。
信源:https://www.nuvacore.ai/?p=1
NUVACORE
Engineered for Altitude: Why NUVACORE is Rewriting the Rules of Silicon - NUVACORE
AI编程初创公司Augment推出Intent工作站,引入「规格驱动」多智能体编排模式
AI 编程初创公司 Augment Code 宣布推出全新开发者工作站 Intent,将 AI 编程从单纯的对话辅助升级为多智能体协同模式。该产品引入了「规格驱动开发(Spec-Driven Development)」概念,通过一个协调者智能体(Coordinator)自动将复杂任务拆解为动态更新的 living spec,并分发给多个并行的专家智能体(如测试、文档、后端专家)执行。
Intent 工作站不仅集成了浏览器、终端和 Git 管理,还支持「可恢复会话」功能,允许开发者在跨天工作时完整保留所有智能体状态与上下文。此外,Intent 采取开放策略,开发者无需 Augment 订阅即可直接在工作站中使用 Claude Code、OpenAI Codex 等第三方智能体工具。
信源:https://www.augmentcode.com/product/intent
AI 编程初创公司 Augment Code 宣布推出全新开发者工作站 Intent,将 AI 编程从单纯的对话辅助升级为多智能体协同模式。该产品引入了「规格驱动开发(Spec-Driven Development)」概念,通过一个协调者智能体(Coordinator)自动将复杂任务拆解为动态更新的 living spec,并分发给多个并行的专家智能体(如测试、文档、后端专家)执行。
Intent 工作站不仅集成了浏览器、终端和 Git 管理,还支持「可恢复会话」功能,允许开发者在跨天工作时完整保留所有智能体状态与上下文。此外,Intent 采取开放策略,开发者无需 Augment 订阅即可直接在工作站中使用 Claude Code、OpenAI Codex 等第三方智能体工具。
信源:https://www.augmentcode.com/product/intent
Intent
Today's software development workspace.
郭达雅近亿元年薪入职字节Seed任agent负责人,阿里腾讯曾同时争抢
晚点LatePost 独家报道证实,前 DeepSeek 研究员郭达雅已加入字节跳动大模型研发团队 Seed,担任 agent 负责人之一,职级 L8。他的薪资总包由现金、字节期权和豆包股组成,需满足一定条件才能全额兑现。据晚点估算,若豆包股价格持续增长,四年归属期满后总收益可达数亿元,折合年均近亿元。
阿里、腾讯、字节三家先后接触郭达雅,阿里甚至开出了后训练负责人的职位。他最终选择字节,主要因为研究方向契合:他去年 10 月就已计划离开 DeepSeek,原因之一是看好 agent 方向,而 DeepSeek 内部当时对 agent 的优先级不高。
此前拿到这一级别待遇的是被腾讯请去临危受命、统管全局的姚顺雨,而郭达雅仅作为 agent 负责人「之一」就获得同等待遇,说明 agent 方向在大厂内部的战略权重已大幅提升。伴随他的加入,Seed 内部正启动针对 agent 和 Coding 的组织整合。晚点援引接近团队的员工称,2025 年底字节每次训练 Code 模型,「上面都说是最后一次了」。今年 1 月底字节跳动 CEO 梁汝波在全员会上将 AI 模型能力列为 2026 年「重中之重」,近亿元引进郭达雅是这一转向的直接体现。
信源:https://mp.weixin.qq.com/s/vAE8KmnM2Mhbq4Y4Xacenw
晚点LatePost 独家报道证实,前 DeepSeek 研究员郭达雅已加入字节跳动大模型研发团队 Seed,担任 agent 负责人之一,职级 L8。他的薪资总包由现金、字节期权和豆包股组成,需满足一定条件才能全额兑现。据晚点估算,若豆包股价格持续增长,四年归属期满后总收益可达数亿元,折合年均近亿元。
阿里、腾讯、字节三家先后接触郭达雅,阿里甚至开出了后训练负责人的职位。他最终选择字节,主要因为研究方向契合:他去年 10 月就已计划离开 DeepSeek,原因之一是看好 agent 方向,而 DeepSeek 内部当时对 agent 的优先级不高。
此前拿到这一级别待遇的是被腾讯请去临危受命、统管全局的姚顺雨,而郭达雅仅作为 agent 负责人「之一」就获得同等待遇,说明 agent 方向在大厂内部的战略权重已大幅提升。伴随他的加入,Seed 内部正启动针对 agent 和 Coding 的组织整合。晚点援引接近团队的员工称,2025 年底字节每次训练 Code 模型,「上面都说是最后一次了」。今年 1 月底字节跳动 CEO 梁汝波在全员会上将 AI 模型能力列为 2026 年「重中之重」,近亿元引进郭达雅是这一转向的直接体现。
信源:https://mp.weixin.qq.com/s/vAE8KmnM2Mhbq4Y4Xacenw
字节回应「近亿元挖来DeepSeek核心员工」:近期没有招聘到近亿元年薪员工
针对字节跳动花费近亿元挖来前 DeepSeek 研究员郭达雅的消息,抖音副总裁李亮回应称,字节跳动招聘的所有 Seed 团队技术人员的薪资体系都是一样的,包括现金、字节期权和豆包期权,期权是四年期全部归属,没有所谓「需要满足一定条件才能拿全」的情况,近期更没有招聘到近亿元年薪的员工。Seed 员工的字节和豆包期权未来收益根据期权价格有波动,假如业务发展的很好,不排除有些 Seed 技术人员四年后收益会达到数亿元。
信源:https://m.yicai.com/brief/103136827.html
针对字节跳动花费近亿元挖来前 DeepSeek 研究员郭达雅的消息,抖音副总裁李亮回应称,字节跳动招聘的所有 Seed 团队技术人员的薪资体系都是一样的,包括现金、字节期权和豆包期权,期权是四年期全部归属,没有所谓「需要满足一定条件才能拿全」的情况,近期更没有招聘到近亿元年薪的员工。Seed 员工的字节和豆包期权未来收益根据期权价格有波动,假如业务发展的很好,不排除有些 Seed 技术人员四年后收益会达到数亿元。
信源:https://m.yicai.com/brief/103136827.html
Yicai
字节近亿元挖来DeepSeek核心员工?官方回应
4月16日,针对字节跳动花费近亿元挖来前DeepSeek研究员郭达雅的传闻,抖音副总裁李亮回应称,字节跳动招聘的所有Seed团队技术人员的薪
通义千问开源Qwen3.6首个模型,35B总参数仅激活3B,编程能力追平27B稠密模型
阿里巴巴通义实验室开源 Qwen3.6-35B-A3B,这是 Qwen3.6 系列的首个模型,采用稀疏混合专家(MoE)架构,总参数 350 亿,每次推理仅激活 30 亿参数。
模型主打编程场景。在 SWE-bench、Terminal-Bench 等智能体编程基准上,Qwen3.6-35B-A3B 大幅超越前代 Qwen3.5-35B-A3B,并追平 Qwen3.5-27B、Gemma-31B 等参数量大数倍的稠密模型。换句话说,跑这个模型的算力成本只有同等性能稠密模型的零头,对本地部署和 API 调用场景都意味着显著降本。
模型同时具备原生多模态能力,支持图文理解、文档解析和空间智能任务,在 RefCOCO 目标定位基准上得分 92.0。
实际使用层面,模型已上架 Hugging Face 和 ModelScope,可本地部署。API 即将在阿里云百炼上线(模型名 qwen3.6-flash),同时兼容 OpenAI 和 Anthropic 两套 API 协议,可直接接入 Claude Code、OpenClaw、Qwen Code 等编程助手。通义实验室表示后续将继续扩展 Qwen3.6 开源家族。
信源:https://mp.weixin.qq.com/s/4VCtPRFaj2i2gpapCpLBwQ
阿里巴巴通义实验室开源 Qwen3.6-35B-A3B,这是 Qwen3.6 系列的首个模型,采用稀疏混合专家(MoE)架构,总参数 350 亿,每次推理仅激活 30 亿参数。
模型主打编程场景。在 SWE-bench、Terminal-Bench 等智能体编程基准上,Qwen3.6-35B-A3B 大幅超越前代 Qwen3.5-35B-A3B,并追平 Qwen3.5-27B、Gemma-31B 等参数量大数倍的稠密模型。换句话说,跑这个模型的算力成本只有同等性能稠密模型的零头,对本地部署和 API 调用场景都意味着显著降本。
模型同时具备原生多模态能力,支持图文理解、文档解析和空间智能任务,在 RefCOCO 目标定位基准上得分 92.0。
实际使用层面,模型已上架 Hugging Face 和 ModelScope,可本地部署。API 即将在阿里云百炼上线(模型名 qwen3.6-flash),同时兼容 OpenAI 和 Anthropic 两套 API 协议,可直接接入 Claude Code、OpenClaw、Qwen Code 等编程助手。通义实验室表示后续将继续扩展 Qwen3.6 开源家族。
信源:https://mp.weixin.qq.com/s/4VCtPRFaj2i2gpapCpLBwQ
Anthropic发布Opus 4.7,刻意削弱网络攻击能力,为全面开放最强模型Mythos铺路
Anthropic 发布新一代旗舰模型 Claude Opus 4.7,已在所有 Claude 产品、API 及 Amazon Bedrock、Google Cloud Vertex AI、Microsoft Foundry 上线,定价与 Opus 4.6 相同(输入 5 美元/百万 token,输出 25 美元/百万 token)。
编程是本次升级的重点。Anthropic 称用户现在可以放心地把最难的编程任务交给 Opus 4.7,无需密切监督。多家早期测试方给出了具体数据:AI 编程工具 Cursor 的内部基准测试中,Opus 4.7 完成率 70%,Opus 4.6 为 58%;协作工具 Notion 报告代理任务成功率提升 14%,工具调用错误降至三分之一;日本电商平台乐天在其 SWE-Bench 上测得 Opus 4.7 解决的生产级任务数量是 Opus 4.6 的 3 倍。代码审查工具 CodeRabbit 称其召回率提升超 10%,速度略快于 GPT-5.4 xhigh。
视觉能力升级幅度同样显著。Opus 4.7 支持长边最高 2576 像素(约 375 万像素)的图片输入,像素总量是此前 Claude 模型的 3 倍以上。自动化渗透测试公司 XBOW 测得其视觉精度基准从 Opus 4.6 的 54.5% 跃升至 98.5%。更高分辨率意味着模型可以处理密集截图、复杂图表等此前力不从心的视觉任务,但也会消耗更多 token。
比起性能提升,更值得关注的是 Anthropic 在这款模型上的安全实验。上周 Anthropic 发布了 Project Glasswing 计划,讨论 AI 模型在网络安全领域的风险与收益,并表示将其最强模型 Claude Mythos Preview 的发布范围保持有限,先在能力较弱的模型上测试新的网络安全防护措施。Opus 4.7 是第一个试验田:Anthropic 称在训练过程中尝试了选择性削弱模型的网络攻击能力,同时保留其他能力,并在部署时加入了自动检测和拦截高风险网络安全用途的机制。需要将模型用于合法安全工作(如漏洞研究、渗透测试)的专业人士,可申请加入新设立的 Cyber Verification Program。这意味着 Opus 4.7 不只是一次常规升级,更是 Anthropic 测试「能力与安全可以分别调控」这一假设的关键实验,其结果将直接决定 Mythos 级别模型何时能全面开放。
其他更新:API 新增介于 high 和 max 之间的 xhigh 推理等级,以及公测阶段的任务预算功能;Claude Code 新增 /ultrareview 代码审查命令,auto mode 扩展至 Max 用户。迁移方面,Opus 4.7 使用了新分词器,相同输入可能消耗约 1.0 至 1.35 倍的 token。
信源:https://www.anthropic.com/news/claude-opus-4-7
Anthropic 发布新一代旗舰模型 Claude Opus 4.7,已在所有 Claude 产品、API 及 Amazon Bedrock、Google Cloud Vertex AI、Microsoft Foundry 上线,定价与 Opus 4.6 相同(输入 5 美元/百万 token,输出 25 美元/百万 token)。
编程是本次升级的重点。Anthropic 称用户现在可以放心地把最难的编程任务交给 Opus 4.7,无需密切监督。多家早期测试方给出了具体数据:AI 编程工具 Cursor 的内部基准测试中,Opus 4.7 完成率 70%,Opus 4.6 为 58%;协作工具 Notion 报告代理任务成功率提升 14%,工具调用错误降至三分之一;日本电商平台乐天在其 SWE-Bench 上测得 Opus 4.7 解决的生产级任务数量是 Opus 4.6 的 3 倍。代码审查工具 CodeRabbit 称其召回率提升超 10%,速度略快于 GPT-5.4 xhigh。
视觉能力升级幅度同样显著。Opus 4.7 支持长边最高 2576 像素(约 375 万像素)的图片输入,像素总量是此前 Claude 模型的 3 倍以上。自动化渗透测试公司 XBOW 测得其视觉精度基准从 Opus 4.6 的 54.5% 跃升至 98.5%。更高分辨率意味着模型可以处理密集截图、复杂图表等此前力不从心的视觉任务,但也会消耗更多 token。
比起性能提升,更值得关注的是 Anthropic 在这款模型上的安全实验。上周 Anthropic 发布了 Project Glasswing 计划,讨论 AI 模型在网络安全领域的风险与收益,并表示将其最强模型 Claude Mythos Preview 的发布范围保持有限,先在能力较弱的模型上测试新的网络安全防护措施。Opus 4.7 是第一个试验田:Anthropic 称在训练过程中尝试了选择性削弱模型的网络攻击能力,同时保留其他能力,并在部署时加入了自动检测和拦截高风险网络安全用途的机制。需要将模型用于合法安全工作(如漏洞研究、渗透测试)的专业人士,可申请加入新设立的 Cyber Verification Program。这意味着 Opus 4.7 不只是一次常规升级,更是 Anthropic 测试「能力与安全可以分别调控」这一假设的关键实验,其结果将直接决定 Mythos 级别模型何时能全面开放。
其他更新:API 新增介于 high 和 max 之间的 xhigh 推理等级,以及公测阶段的任务预算功能;Claude Code 新增 /ultrareview 代码审查命令,auto mode 扩展至 Max 用户。迁移方面,Opus 4.7 使用了新分词器,相同输入可能消耗约 1.0 至 1.35 倍的 token。
信源:https://www.anthropic.com/news/claude-opus-4-7
Anthropic
Introducing Claude Opus 4.7
Our latest model, Claude Opus 4.7, is now generally available. Opus 4.7 is a notable improvement on Opus 4.6 in advanced software engineering, with particular gains on the most difficult tasks.
❤2
OpenAI首个行业专用模型GPT-Rosalind瞄准制药,RNA预测超过95%人类专家
OpenAI 发布 GPT-Rosalind,这是该公司首个针对特定行业构建的前沿推理模型,面向生物学、药物发现和转化医学。模型以对揭示 DNA 结构做出关键贡献的科学家 Rosalind Franklin 命名,目前作为研究预览版在 ChatGPT、Codex 和 API 上线,仅面向通过资质审核的美国企业客户开放,预览期间不消耗现有额度。
选择生命科学作为第一个垂直行业,本身就是一个战略信号。OpenAI 给出的理由是:一款新药从靶点发现到获批上市平均需要 10 至 15 年,AI 在早期发现阶段的提速会向下游复利式传导,更好的靶点选择、更强的生物学假设、更高质量的实验设计,最终提高整条管线的成功率。
性能方面,GPT-Rosalind 在生物信息学基准 BixBench 上取得已公开模型中的最高分。在涵盖文献检索、序列操作、实验方案设计等 11 项研究任务的 LABBench2 基准上,6 项超过 GPT-5.4,提升最显著的是分子克隆实验设计(CloningQA)。与 AI 基因治疗公司 Dyno Therapeutics 合作的评测使用了未公开、未被训练数据污染的 RNA 序列,模型十次提交中的最优结果在序列功能预测上排在人类专家历史成绩的第 95 百分位以上,序列生成排在第 84 百分位左右。
OpenAI 同时在 GitHub 开源了 Codex 生命科学研究插件,接入超过 50 个公共多组学数据库、文献源和生物工具,覆盖人类遗传学、功能基因组学、蛋白质结构、生物化学等领域。插件所有用户均可免费使用,不限于 GPT-Rosalind,也可搭配通用模型。Amgen、Moderna、Allen Institute、Thermo Fisher Scientific 等已参与早期合作,OpenAI 还与洛斯阿拉莫斯国家实验室探索 AI 引导的蛋白质和催化剂设计。GPT-Rosalind 是其生命科学模型系列的首个版本,后续将持续扩展生化推理能力。
信源:https://openai.com/index/introducing-gpt-rosalind/
OpenAI 发布 GPT-Rosalind,这是该公司首个针对特定行业构建的前沿推理模型,面向生物学、药物发现和转化医学。模型以对揭示 DNA 结构做出关键贡献的科学家 Rosalind Franklin 命名,目前作为研究预览版在 ChatGPT、Codex 和 API 上线,仅面向通过资质审核的美国企业客户开放,预览期间不消耗现有额度。
选择生命科学作为第一个垂直行业,本身就是一个战略信号。OpenAI 给出的理由是:一款新药从靶点发现到获批上市平均需要 10 至 15 年,AI 在早期发现阶段的提速会向下游复利式传导,更好的靶点选择、更强的生物学假设、更高质量的实验设计,最终提高整条管线的成功率。
性能方面,GPT-Rosalind 在生物信息学基准 BixBench 上取得已公开模型中的最高分。在涵盖文献检索、序列操作、实验方案设计等 11 项研究任务的 LABBench2 基准上,6 项超过 GPT-5.4,提升最显著的是分子克隆实验设计(CloningQA)。与 AI 基因治疗公司 Dyno Therapeutics 合作的评测使用了未公开、未被训练数据污染的 RNA 序列,模型十次提交中的最优结果在序列功能预测上排在人类专家历史成绩的第 95 百分位以上,序列生成排在第 84 百分位左右。
OpenAI 同时在 GitHub 开源了 Codex 生命科学研究插件,接入超过 50 个公共多组学数据库、文献源和生物工具,覆盖人类遗传学、功能基因组学、蛋白质结构、生物化学等领域。插件所有用户均可免费使用,不限于 GPT-Rosalind,也可搭配通用模型。Amgen、Moderna、Allen Institute、Thermo Fisher Scientific 等已参与早期合作,OpenAI 还与洛斯阿拉莫斯国家实验室探索 AI 引导的蛋白质和催化剂设计。GPT-Rosalind 是其生命科学模型系列的首个版本,后续将持续扩展生化推理能力。
信源:https://openai.com/index/introducing-gpt-rosalind/
OpenAI
Introducing GPT-Rosalind for life sciences research
OpenAI introduces GPT-Rosalind, a frontier reasoning model built to accelerate drug discovery, genomics analysis, protein reasoning, and scientific research workflows.
OpenAI Codex大更新:可直接操控Mac桌面,能跨天自动醒来继续干活
OpenAI 发布 Codex 重大更新,目前每周有超过 300 万开发者使用这款产品。此次更新的核心变化是 Codex 不再局限于写代码,开始介入软件开发的全流程。
最大的功能跃迁是「后台电脑操控」:Codex 现在可以直接在 Mac 上看屏幕、点鼠标、敲键盘,操作任何应用程序,且多个代理可并行工作,各用各的光标,不干扰用户正在做的事情。对开发者来说,这意味着迭代前端界面、测试应用或操作没有 API 的工具时,不用再手动截图描述,代理自己看着办。
应用内新增浏览器,用户可以直接在页面上标注评论给代理下指令,适合前端和游戏开发中的快速迭代。图片生成方面集成了 gpt-image-1.5,可在同一工作流中生成产品概念图、UI 设计稿和游戏素材。新增超过 90 个插件,覆盖 Atlassian Rovo(JIRA 管理)、CircleCI、CodeRabbit、GitLab Issues、Microsoft Suite、Neon by Databricks 等开发工具链。
自动化能力的扩展更值得关注。Codex 现在可以复用已有对话线程保留上下文,自行安排未来任务并自动唤醒继续执行,时间跨度可达数天甚至数周。同时推出记忆功能预览版,能记住用户的偏好、纠正和历史操作中积累的信息,让后续任务完成得更快。Codex 还会基于项目上下文、已连接的插件和记忆,主动建议用户从哪里开始一天的工作或接续之前的项目,比如识别 Google Docs 中待处理的评论,拉取 Slack、Notion 和代码库的相关上下文,生成优先级排序的行动清单。
开发者工作流方面新增 GitHub PR 评审评论处理、多终端标签页、通过 SSH 连接远程 devbox(alpha 阶段),以及侧边栏文件预览(支持 PDF、电子表格、幻灯片和文档)。
这些更新正在向已登录 ChatGPT 的 Codex 桌面端用户逐步推送。记忆和主动建议功能将稍后面向企业版、教育版及欧盟/英国用户开放,电脑操控目前仅支持 macOS。
信源:https://openai.com/index/codex-for-almost-everything/
OpenAI 发布 Codex 重大更新,目前每周有超过 300 万开发者使用这款产品。此次更新的核心变化是 Codex 不再局限于写代码,开始介入软件开发的全流程。
最大的功能跃迁是「后台电脑操控」:Codex 现在可以直接在 Mac 上看屏幕、点鼠标、敲键盘,操作任何应用程序,且多个代理可并行工作,各用各的光标,不干扰用户正在做的事情。对开发者来说,这意味着迭代前端界面、测试应用或操作没有 API 的工具时,不用再手动截图描述,代理自己看着办。
应用内新增浏览器,用户可以直接在页面上标注评论给代理下指令,适合前端和游戏开发中的快速迭代。图片生成方面集成了 gpt-image-1.5,可在同一工作流中生成产品概念图、UI 设计稿和游戏素材。新增超过 90 个插件,覆盖 Atlassian Rovo(JIRA 管理)、CircleCI、CodeRabbit、GitLab Issues、Microsoft Suite、Neon by Databricks 等开发工具链。
自动化能力的扩展更值得关注。Codex 现在可以复用已有对话线程保留上下文,自行安排未来任务并自动唤醒继续执行,时间跨度可达数天甚至数周。同时推出记忆功能预览版,能记住用户的偏好、纠正和历史操作中积累的信息,让后续任务完成得更快。Codex 还会基于项目上下文、已连接的插件和记忆,主动建议用户从哪里开始一天的工作或接续之前的项目,比如识别 Google Docs 中待处理的评论,拉取 Slack、Notion 和代码库的相关上下文,生成优先级排序的行动清单。
开发者工作流方面新增 GitHub PR 评审评论处理、多终端标签页、通过 SSH 连接远程 devbox(alpha 阶段),以及侧边栏文件预览(支持 PDF、电子表格、幻灯片和文档)。
这些更新正在向已登录 ChatGPT 的 Codex 桌面端用户逐步推送。记忆和主动建议功能将稍后面向企业版、教育版及欧盟/英国用户开放,电脑操控目前仅支持 macOS。
信源:https://openai.com/index/codex-for-almost-everything/
OpenAI
Codex for (almost) everything
The updated Codex app for macOS and Windows adds computer use, in-app browsing, image generation, memory, and plugins to accelerate developer workflows.
👍1
Anthropic被曝筹备AI设计工具,Instagram联合创始人退出Figma董事会避嫌
Anthropic 首席产品官 Mike Krieger 4 月 14 日辞去界面设计公司 Figma 的董事席位,Figma 当日向美国证券交易委员会(SEC)披露了这一变动。同一天,《The Information》独家报道称 Anthropic 正在筹备 AI 设计工具,将与 Figma 的核心产品直接竞争。Krieger 加入 Figma 董事会不到一年。
Krieger 此前联合创办了 Instagram 和 AI 新闻应用 Artifact,2024 年出任 Anthropic 首席产品官。Figma 是全球最主流的 UI/UX 设计工具,此前与 Anthropic 深度合作,将 Claude 模型集成到自家产品中作为设计助手。如今合作方变成了竞争对手,Anthropic 不再满足于做嵌入他人产品的基础设施层,开始向应用层扩张。
这是今年投资者口中「SaaS 末日论」(SaaSpocalypse)的最新案例:头部 AI 实验室凭借基础模型优势亲自下场做应用,挤压传统软件公司的空间。iShares 主要软件 ETF(IGV)年内已跌近 18%。不过 Figma 股价在消息公布后反而上涨约 5%,市场尚未认定 AI 实验室能真正复制成熟设计工具多年积累的专业工作流和客户关系。
信源:https://techcrunch.com/2026/04/16/anthropic-cpo-leaves-figmas-board-after-reports-he-will-offer-a-competing-product/
Anthropic 首席产品官 Mike Krieger 4 月 14 日辞去界面设计公司 Figma 的董事席位,Figma 当日向美国证券交易委员会(SEC)披露了这一变动。同一天,《The Information》独家报道称 Anthropic 正在筹备 AI 设计工具,将与 Figma 的核心产品直接竞争。Krieger 加入 Figma 董事会不到一年。
Krieger 此前联合创办了 Instagram 和 AI 新闻应用 Artifact,2024 年出任 Anthropic 首席产品官。Figma 是全球最主流的 UI/UX 设计工具,此前与 Anthropic 深度合作,将 Claude 模型集成到自家产品中作为设计助手。如今合作方变成了竞争对手,Anthropic 不再满足于做嵌入他人产品的基础设施层,开始向应用层扩张。
这是今年投资者口中「SaaS 末日论」(SaaSpocalypse)的最新案例:头部 AI 实验室凭借基础模型优势亲自下场做应用,挤压传统软件公司的空间。iShares 主要软件 ETF(IGV)年内已跌近 18%。不过 Figma 股价在消息公布后反而上涨约 5%,市场尚未认定 AI 实验室能真正复制成熟设计工具多年积累的专业工作流和客户关系。
信源:https://techcrunch.com/2026/04/16/anthropic-cpo-leaves-figmas-board-after-reports-he-will-offer-a-competing-product/
TechCrunch
Anthropic CPO leaves Figma's board after reports he will offer a competing product | TechCrunch
Krieger's departure and any forthcoming design tools will be another data point for investors who fear the SaaSpocalypse — that the largest AI labs will come to dominate software businesses, a thesis that has rocked public markets at times this year.
OpenAI网络安全联盟首批名单公布:华尔街六大行集体加入,1000万美元资助开源安全
OpenAI 公布「网络安全可信访问」(Trusted Access for Cyber)计划的首批合作机构。14 家机构中,华尔街占了近一半:美国银行、贝莱德、纽约梅隆银行、花旗、高盛、摩根大通、摩根士丹利,加上网络安全公司 CrowdStrike、Zscaler、SpecterOps、iVerify,以及思科、英伟达、甲骨文。这些机构将获得 GPT-5.4-Cyber 的访问权限,用于各自数字基础设施的安全防御。
金融机构扎堆并不意外。银行是全球遭受网络攻击最密集的行业之一,安全团队规模大、预算充足、对新工具的采纳速度快,也最有动力在 AI 安全工具的早期阶段就参与进来争取影响力。纽约梅隆银行首席信息官 Leigh-Ann Russell 在声明中称,该行正与「推动这些努力的前沿力量」密切合作。
同时,OpenAI 宣布通过「网络安全资助计划」投入 1000 万美元 API 额度,面向开源安全和漏洞研究团队。首批受资助方包括软件供应链安全公司 Socket 和 Semgrep,以及漏洞研究机构 Calif 和 Trail of Bits。OpenAI 在博文中提到,并非每个组织都有全天候安全团队能在漏洞「周五晚间披露」时及时响应,这正是资助计划想解决的问题。
OpenAI 还向美国 AI 标准与创新中心(CAISI)和英国 AI 安全研究所(UK AISI)提供了 GPT-5.4-Cyber 访问权限,供两家机构评估模型的网络安全能力和安全防护措施。
信源:https://openai.com/index/accelerating-cyber-defense-ecosystem/
OpenAI 公布「网络安全可信访问」(Trusted Access for Cyber)计划的首批合作机构。14 家机构中,华尔街占了近一半:美国银行、贝莱德、纽约梅隆银行、花旗、高盛、摩根大通、摩根士丹利,加上网络安全公司 CrowdStrike、Zscaler、SpecterOps、iVerify,以及思科、英伟达、甲骨文。这些机构将获得 GPT-5.4-Cyber 的访问权限,用于各自数字基础设施的安全防御。
金融机构扎堆并不意外。银行是全球遭受网络攻击最密集的行业之一,安全团队规模大、预算充足、对新工具的采纳速度快,也最有动力在 AI 安全工具的早期阶段就参与进来争取影响力。纽约梅隆银行首席信息官 Leigh-Ann Russell 在声明中称,该行正与「推动这些努力的前沿力量」密切合作。
同时,OpenAI 宣布通过「网络安全资助计划」投入 1000 万美元 API 额度,面向开源安全和漏洞研究团队。首批受资助方包括软件供应链安全公司 Socket 和 Semgrep,以及漏洞研究机构 Calif 和 Trail of Bits。OpenAI 在博文中提到,并非每个组织都有全天候安全团队能在漏洞「周五晚间披露」时及时响应,这正是资助计划想解决的问题。
OpenAI 还向美国 AI 标准与创新中心(CAISI)和英国 AI 安全研究所(UK AISI)提供了 GPT-5.4-Cyber 访问权限,供两家机构评估模型的网络安全能力和安全防护措施。
信源:https://openai.com/index/accelerating-cyber-defense-ecosystem/
OpenAI
Accelerating the cyber defense ecosystem that protects us all
Leading security firms and enterprises join OpenAI’s Trusted Access for Cyber, using GPT-5.4-Cyber and $10M in API grants to strengthen global cyber defense.