动察Beating AI News
3.01K subscribers
802 photos
2 videos
3.26K links
AI新闻信息流
Download Telegram
微软Azure重回40%增速反转减速趋势,全年资本开支飙至1900亿美元

微软公布 FY26 Q3(截至 3 月 31 日)财报,营收 828.9 亿美元,同比增 18%,超出分析师预期的 813.9 亿美元。调整后每股收益 4.27 美元,高于预期的 4.06 美元。运营利润 384 亿美元,同比增 20%。

Azure 及其他云服务收入增长 40%(固定汇率口径 39%),超出管理层此前给出的 37% 至 38% 指引。过去三个季度 Azure 增速一路放慢:去年 7-9 月 40%、去年 10-12 月 39%、管理层对本季指引又降到 37-38%,市场担心见顶,今年 1 月上季财报发布后微软单日市值蒸发 3570 亿美元。这次实际增速反弹回 40%,证明此前的减速是数据中心产能没跟上,不是客户需求在退潮。

AI 业务年化收入 370 亿美元,同比增 123%。Microsoft 365 Copilot 付费席位突破 2000 万,1 月时为 1500 万。CEO Nadella 称 Copilot 周活跃度已与 Outlook 持平。微软云总收入 545 亿美元,增 29%。商业剩余履约义务(已签约未确认收入的合同额)6270 亿美元,接近翻倍。

资本支出(含融资租赁)319 亿美元,同比增 49%,但低于分析师预期的 352.9 亿美元约 34 亿。CFO Amy Hood 将全年资本支出预估上调至 1900 亿美元,其中约 250 亿来自元器件涨价,远超分析师此前预期的 1546 亿。毛利率降至 67.6%,为 2022 年以来最低,主要因数据中心折旧成本攀升。

微软同周宣布重组与 OpenAI 的合作关系:取消向 OpenAI 的收入分成,保留 Azure 作为 OpenAI 主要云平台的优先地位,以及至 2032 年的非独占模型许可。Nadella 在电话会上称微软拥有 OpenAI 前沿模型的免版税使用权,「我们完全打算充分利用」。

下季 Azure 指引 39% 至 40% 固定汇率增速,远高于分析师预期的 37%。营收指引 867 至 878 亿美元,中值与预期的 875.3 亿基本持平。

信源:https://www.microsoft.com/en-us/investor/earnings/fy-2026-q3/press-release-webcast
谷歌母公司CEO透露谷歌算力分配优先级:DeepMind第一,TPU十年来首次直售

Alphabet 一季度财报电话会上,分析师追问算力稀缺时怎么分配。CEO Sundar Pichai 给出了优先级:第一保障 Google DeepMind 训练前沿模型,其余按投资回报率(ROIC)框架在 Search、YouTube 和 Cloud 之间调配。他坦承公司短期内算力受限,「如果能满足需求,云收入本可更高」。

为缓解供应压力,谷歌将首次向部分客户直接出售 TPU 硬件,供其部署在自有数据中心。此前十年,TPU 只做内部使用和云端租赁,从未直售。目标客户包括量化交易公司 Hudson River Trading、AI 实验室 Thinking Machines Lab 和机器人公司 Boston Dynamics。CFO Anat Ashkenazi 给出了收入节奏:TPU 硬件销售收入今年只确认一小部分,绝大部分在 2027 年兑现。这批硬件协议已计入云积压订单(本季度接近翻倍至 4620 亿美元),但大头仍是常规谷歌云平台(GCP)合同,预计 24 个月内确认略超 50%。

需求增长的另一个信号:Gemini 等谷歌自研模型 API 的 token 处理量从上季度的 100 亿/分钟升至 160 亿/分钟,季度环比增长 60%。过去 12 个月有 330 个云客户各自处理超 1 万亿 token,35 个客户突破 10 万亿。

信源:https://www.investing.com/news/transcripts/earnings-call-transcript-alphabet-q1-2026-earnings-soar-stock-dips-93CH-4647252
亚马逊CEO:芯片业务独立运营值500亿美元,Trainium四代全线满订

亚马逊 CEO Andy Jassy 在一季度财报电话会上花了大量篇幅谈自研芯片。他说如果把芯片业务拆出来独立运营、像其他芯片公司一样对外卖芯,年化营收将达到 500 亿美元。按他的说法,亚马逊自研芯片业务已跻身全球数据中心芯片前三,「达到这个速度非同寻常」。

四代 Trainium(亚马逊自研 AI 训练芯片)的供需状况:Trainium2 已售罄;Trainium3 今年初刚开始出货,性价比比 Trainium2 再高 30% 至 40%,近乎满订;Trainium4 还有约 18 个月才大规模上市,已被预订大半。Jassy 称 Trainium 已积累超 2250 亿美元的收入承诺,来自 Anthropic 和 OpenAI 的多年大规模训练合约(各签下数吉瓦级算力),以及 Uber 等企业客户。

Jassy 算了一笔账:大规模使用 Trainium 做推理,每年可比依赖外部芯片省下数百亿美元 CapEx,运营利润率优势达数百个基点。Amazon Bedrock(AWS 的模型推理服务,超 12.5 万客户使用,近 80% Fortune 100 企业在用)大部分推理已跑在 Trainium 上。

被问到会不会直接卖 Trainium 机架,Jassy 说要在满足现有客户需求和外部销售之间平衡,但「我预计未来几年很可能会开始卖」。AWS 积压订单 3640 亿美元,尚未包含 Anthropic 上周宣布的超千亿美元大单。

信源:https://www.marketbeat.com/instant-alerts/amazoncom-q1-earnings-call-highlights-2026-04-29/
马斯克旧账被翻:停钱、争权、挖人,还让前女友留在OpenAI董事会当线人

马斯克诉 OpenAI 案周三进入交叉盘问阶段,OpenAI 律师 Savitt 用马斯克自己的邮件和短信还原了一条时间线。马斯克 2017 年春季率先停止了每季度 500 万美元的付款,当时他是 OpenAI 最主要的资金来源。家族办公室负责人 Birchall 8 月写信问要不要继续扣着不付,马斯克回了一个字:「Yes。」紧接着 9 月,马斯克在讨论设立营利实体时要求选 4 名董事(其他创始人合计只有 3 名),在邮件中写道「我将毫无疑问地拥有公司的初始控制权」。OpenAI 联合创始人兼前首席科学家 Sutskever 回信拒绝,认为这给了马斯克过大的权力。

争控制权失败后的 10 月,马斯克仍在 OpenAI 董事会任上,却开始从 OpenAI 挖人。他给 Tesla 副总裁写信说已说服早期研究员 Karpathy 加入 Tesla,「OpenAI 那帮人会想杀了我,但这事必须做」。同月他还让 Neuralink 联合创始人直接从 OpenAI 挖人:「直接招,我没问题。」

2018 年 2 月,马斯克给时任 OpenAI 董事 Shivon Zilis(马斯克 4 个孩子的母亲、Neuralink 高管)发短信:「我们打算主动从 OpenAI 挖 3 到 4 个人去 Tesla。」Zilis 问是否该继续留在 OpenAI 董事会「保持友好」以便「让信息持续流过来」,马斯克说是。Savitt 用这段短信试图证明马斯克在离开 OpenAI 后仍通过 Zilis 获取内部信息。

马斯克在盘问中反复表达不满,称 Savitt 的问题「是设计来骗我的」。法官 Gonzalez Rogers 一度要求双方冷静。当 Savitt 追问马斯克承诺捐 10 亿美元却只出了 3800 万时,马斯克答「我贡献了我的声誉,这些东西都有价值」。Savitt 还在当天早些时候用马斯克 3 月的推文打脸:马斯克上午作证称 Tesla 没有在做 AGI,Savitt 随即展示马斯克本人发的推文「Tesla will be one of the companies to make AGI」。

马斯克周四继续接受盘问。之后 Birchall 和 OpenAI 总裁 Brockman 预计将作为证人出庭。

信源:https://www.wired.com/story/model-behavior-elon-musk-cross-examined-sam-altman/
蚂蚁百灵万亿参数旗舰Ling-2.6-1T开源:1万亿参数激活630亿,MIT许可

蚂蚁百灵(Inclusion AI)正式开源旗舰模型 Ling-2.6-1T 权重。总参数 1 万亿,每次推理激活 630 亿(63B),MoE 架构,上下文 256K,MIT 许可。昨天开源的 flash 版(1040 亿参数 / 激活 74 亿)主打轻量高速,这次的 1T 版面向复杂任务场景。

架构与 flash 版一致,采用 MLA + Lightning Linear 混合注意力。1T 版新增「快速思考」训练策略,通过在后训练阶段引入「上下文过程冗余抑制」奖励,压缩冗长的思维链输出,在不损失推理质量的前提下降低 token 消耗。

评测方面,SWE-bench Verified 72.2%(flash 版 61.2%),作为参照,DeepSeek V4 Pro 等开源模型已超 80%。Artificial Analysis 综合智能指数 34,总输出约 1600 万 token。模型兼容 Claude Code、OpenClaw、OpenCode 等主流 agent 框架,OpenRouter 已上线免费 API。部署最低需 8 卡 GPU,支持 SGLang 和 vLLM(两个主流开源大模型推理引擎)。

信源:https://huggingface.co/inclusionAI/Ling-2.6-1T
WLD跌了98%,Altman也不推UBI了

OpenAI CEO Sam Altman 在《大西洋月刊》CEO Nicholas Thompson 的播客中说:「我对 UBI 的信念没有以前那么强了。」全民基本收入(UBI,给所有人定期发现金)是他推了 8 年的招牌主张,现在他觉得发钱这条路走不通了。他更想搞的是「集体所有权」,让所有人持有算力份额或 AI 公司的股权,AI 赚得越多你也分得越多,而不是每月领一笔固定的钱。

Altman 为了推 UBI 还搞了一个加密货币项目 World(原名 Worldcoin),核心设计是扫描虹膜确认真人身份后发 WLD 代币,等于一个加密版的全民发钱。但 WLD 现价约 0.25 美元,距 2024 年 3 月历史高点 11.82 美元跌了 98%。4 周前 World 基金会还在历史低点附近抛售了 2.39 亿枚 WLD,套现 6500 万美元。Altman 在这个时候说不信 UBI 了,时机值得玩味。

他担心的是 AI 红利被少数人吃掉。他说如果算力有限、工具难用、整合度低,有钱人就会把算力价格炒上去,加剧贫富分化。他认为最重要的是大量建造算力,把智能做得尽可能便宜和普及。光有算力还不够,工具也得好用。他拿 Codex 举例:三个月前还是个命令行工具,只有一小撮技术人员能搞定;现在装个 App 就能用,但对非技术用户来说还是不够友好,「还有很多事要做」。

信源:https://www.youtube.com/watch?v=i9yXrdQ6noo
OpenAI或已用纯AI数据训过模型,Altman:「不确定该不该说」

OpenAI CEO Sam Altman 在《大西洋月刊》CEO Nicholas Thompson 的播客中聊到合成数据。Thompson 说现在网上到处是 AI 写的内容,人连写作风格都在学 AI,未来模型不可能不吃到 AI 生成的数据。他说「GPT-4 是最后一个没怎么用 AI 数据的模型」,Altman 点头同意。

Thompson 直接追问:有没有跑过完全用合成数据(用 AI 的输出来训下一代 AI)训练的模型?Altman 停了一下,说「我不确定该不该说」。这句话等于默认了。他紧接着说,模型的核心就是学会推理,这件事纯合成数据完全能做到。他拿数学打比方:一个完全没见过人类数据的模型,能不能比人类算得更好?「我觉得可以。」但反过来,一个没接触过人类文化的模型,能不能理解人类的价值观?「那大概不行。」

合成数据一直有「疯牛病」的说法:AI 反复吃自己的输出,信息会不会一代代退化变质。按 Altman 的说法,教 AI 算数学不需要人,教 AI 理解人才需要人。

信源:https://www.youtube.com/watch?v=i9yXrdQ6noo
Altman自创「AI韧性」取代「AI安全」:以前的思路全过时了

OpenAI CEO Sam Altman 在《大西洋月刊》CEO Nicholas Thompson 的播客中说,以前觉得 AI 安全就是两件事:把模型对齐好、别让坏人拿到。现在这套不够用了。他造了个新说法叫「AI 韧性」(AI resilience),意思是光管好自家模型没用,开源模型能绕过一切限制,整个社会都得建防御体系。

更让他意外的是 agent 会互相「传染」。OpenClaw 上线后,他亲眼看到异常行为从一个 agent 扩散到另一个 agent,这是他之前压根没想过的事。Thompson 顺着问:如果 OpenAI 员工的 agent 出去被人操控了,回来把你们公司系统搞崩呢?Altman 觉得完全有可能。

他不觉得坐下来想理论能解决这种问题,OpenAI 的策略还是先放出去,出了事再改。网络安全也一样,好模型既能入侵系统也能保护系统,就看防守方能不能跑在攻击方前面。

Altman 自己倒不怎么怕。他说本来坚决不给 Codex 开 Yolo 模式(全权访问电脑),结果只撑了几个小时就投降了。他有两台电脑,一台已经完全交给 Codex 管 Slack、iMessage、WhatsApp、Signal 和邮件。有些人半夜爬起来给 Codex 派活,觉得不跑就是浪费时间,Altman 说自己没到那个程度,但「理解那种感觉」。

信源:https://www.youtube.com/watch?v=i9yXrdQ6noo
OpenAI查清了「哥布林」从哪来的:一个性格奖励信号污染了整条训练流水线

OpenAI 发文复盘了困扰 GPT 系列多代的「哥布林」问题。从 GPT-5.1 起,模型越来越爱在回答里塞哥布林、小妖精之类的奇幻生物比喻,用户投诉不断。GPT-5.1 上线后,ChatGPT 对话中出现「goblin」一词的频率上升了 175%。到 GPT-5.4,问题彻底爆发。

根源在 ChatGPT 的「书呆子」(Nerdy)人格定制功能。这个人格的系统提示词要求模型「用语言的趣味性消解一本正经」「承认世界的怪异并享受它」。训练时,用于强化这个人格风格的奖励信号对含有奇幻生物词汇的输出打了更高分,76.2% 的数据集中都能观察到这种偏向。

问题是奖励信号只在「书呆子」人格下生效,但强化学习不保证学到的行为只留在触发条件里。一旦模型在某个条件下被奖励了某种说话习惯,这种习惯就会通过后续训练扩散到其他场景。扩散路径很清晰:奖励信号鼓励了带哥布林的输出,这些输出出现在后续的监督微调(SFT)数据里,模型越来越习惯产出这类词,形成正反馈循环。数据上看,「书呆子」人格只占 ChatGPT 全部回复的 2.5%,却贡献了 66.7% 的哥布林提及量。GPT-5.4 中「书呆子」人格的哥布林出现率较 GPT-5.2 暴涨 3881%。

GPT-5.5 在根因查明前就开始训练了,哥布林已经混进了 SFT 数据。OpenAI 在 3 月下线了「书呆子」人格,移除了偏向奇幻生物的奖励信号并过滤了训练数据。对已上线的 GPT-5.5,则在 Codex 的开发者提示词中加入抑制指令。OpenAI 称这次调查催生了一套新的模型行为审计工具。

信源:https://openai.com/index/where-the-goblins-came-from/
1
英伟达发Blackwell成本明细:GPU贵一倍,每token反便宜35倍

英伟达发博客拆解推理硬件选型,核心论点一句话:评估推理基础设施应看「每 token 成本」而非「每 GPU 每小时成本」。用 GPU 单价比,Blackwell 更贵;用 token 成本比,Blackwell 碾压上一代。

博客以 DeepSeek-R1(MoE 推理模型)为测试对象,对比 Blackwell(GB300 NVL72)与上一代 Hopper(HGX H200)。按云市场租赁参考价,Blackwell 每 GPU 每小时 2.65 美元,比 Hopper 的 1.41 美元贵近一倍,但单 GPU 每秒 token 产出从 90 跳到 6000,65 倍的吞吐提升分摊下来,每百万 token 成本从 4.20 美元降到 0.12 美元。每兆瓦 token 产出提升 50 倍。

需要注意的前提:0.12 美元这个数字建立在 FP4 低精度推理加 MTP(多 token 预测,让模型一次生成多个 token 来提速)等多项软件优化全部开启的基础上。SemiAnalysis InferenceX v2 原始数据显示,同样的 GB300 NVL72 跑 DeepSeek-R1,不开 MTP 时每百万 token 成本约 2.35 美元,开启后降至约 0.11 美元,单这一项优化就拉开 21 倍差距。以上均为 DeepSeek-R1 单一模型的测试结果,不同模型架构和规模下数字会不同。

信源:https://blogs.nvidia.com/blog/lowest-token-cost-ai-factories/
阿里发布「数字员工」QoderWake:内部已上岗,根因分析从30分钟压到2分钟

阿里发布企业级 AI agent 产品 QoderWake,定位「数字员工」,能在真实工作流中承担程序员、运营、分析师等岗位。同步上线的还有 Qoder 移动端,用户可在手机上远程操作桌面端 Qoder 完成任务。

QoderWake 采用 Harness-First 架构,核心区别于通用 agent 的地方在于经验留存:每次执行后,会把经验归类沉淀到记忆、技能、策略、验证规则和工作流五个维度,下次遇到类似任务直接调用,不用从零开始。内置防腐机制(Anti-Rot Governance)会持续淘汰过时经验、合并冲突、撤回失效策略。

目前已上线的角色是「数字程序员」,在阿里内部已上岗运行。代码有更新时自动整理变更简报,出错时先做诊断输出初诊报告,遇到告警先做分诊判断是否需要升级给人。以单条问题的根因分析为例,耗时从 30 分钟缩短至 2 分钟,全流程无人值守。数字分析师、数字客户经理等更多角色近期上线。

Qoder 移动端与常见的 IM 接入 agent 不同,可直接展示思考链和工作流,支持主动弹窗让用户确认关键步骤。目前已接入 Qoder CLI 全部能力,后续将打通 Qoder IDE、QoderWork、QoderWake 全系产品。QoderWake 已开启邀测。

信源:https://mp.weixin.qq.com/s/eJZ5iWYw3TfSOLdeyVBfiw
白宫反对Anthropic将Mythos扩至120家公司:自己要用,算力不够分

Anthropic 提议让约 70 家公司和机构新增使用 Mythos,加上现有约 50 家将达约 120 家,白宫以安全和算力为由拒绝。Mythos 4 月初发布,能检测并利用大量关键软件的漏洞,目前仅限管理关键基础设施的企业测试,没有公开发布计划。

白宫担心 Anthropic 算力不够。多开放 70 家商业用户,政府自己用 Mythos 可能就卡了。白宫 AI 顾问 David Sacks 公开说过,Anthropic 限量发布本身就说明它的算力不如对手。Anthropic 已和亚马逊、谷歌、博通签了算力采购协议,但新产能还没上线。

政治上也没缓和。特朗普政府批评 Anthropic 雇了多名拜登政府前官员,还不满其与自由派组织的关联。一个细节能看出信任程度:Anthropic 前研究员 Collin Burns 本已被安排进政府的 AI 模型评估岗位,白宫高层知道后直接换人,理由是不想让 AI 公司的人坐在要跟各大 AI 公司打交道的位子上。

信源:https://www.wsj.com/tech/ai/white-house-opposes-anthropics-plan-to-expand-access-to-mythos-model-dc281ab5
英伟达卖不进中国,寒武纪Q1营收翻倍至28.8亿净利增长近三倍

寒武纪一季度营收 28.8 亿元,去年同期 11.1 亿,同比增 159%。净利润 10.1 亿元,去年同期 3.56 亿。财报发布后股价单日涨 14%,为去年 8 月底以来最大涨幅。Bernstein 分析师 Qingyuan Lin 团队研报称,这组数据确认寒武纪已进入「规模化盈利阶段」,驱动力是 AI 算力需求激增和运营杠杆放大。

寒武纪和华为争夺的是同一块市场:美国出口管制切断了英伟达和 AMD 向中国销售高端 AI 加速器(专用于 AI 计算的芯片)的通道。两家中国公司均被列入美国商务部实体清单,无法使用美国技术和台积电代工,芯片性能仍落后于美国对手,但中国企业对国产替代的需求并未减退。寒武纪今年 AI 芯片产能可能增至去年的三倍以上,过去 12 个月股价已翻倍。

摩根士丹利预计,中国 AI 芯片市场到 2030 年将达 670 亿美元,超过四分之三由国产厂商供应,2024 年这一比例仅三分之一。同日披露一季报的沐曦(AI 芯片厂商)营收同比增 75%,北方华创(半导体设备厂商)营收增 26%。

信源:https://www.bloomberg.com/news/articles/2026-04-29/cambricon-s-revenue-jumps-on-strong-ai-chip-demand-in-china
Altman:OpenAI要做「永远低利润」公司,不吃产业链

OpenAI CEO Sam Altman 在 Stripe Sessions 上说,希望 OpenAI 成为一家「永远低利润、但规模巨大且增长快」的基础设施公司,提供一种「智能仪表」,任何人都能买来自动化业务、开发产品、或直接嵌入自己的服务。他把 Stripe 当模板:按用量收费,互联网越大 Stripe 越赚,用户也越开心。OpenAI 已经签了 20 年期电力和土地合同来支撑这条路。

他直接承认 AI 的切换成本很低。用户最近从竞品编程工具大量涌入 Codex,说明 AI 越聪明换平台越容易,「你跟 agent 说一句就搬了」。这种行业结构下高利润本来就不现实。Collison 问怎么看「AI 公司会往上吞掉整条价值链」。Altman 说有些公司确实想这么干,OpenAI 不想。他把数据中心、模型、harness(调度和编排 AI 的中间层)看作一个整体集群,输出「可用的智能」,其他公司在上面建产品,模型越聪明对方越受益。如果一家公司暗暗希望模型别进步,说明它在补模型的短板,下一次升级迟早淘汰它。

他也劝企业别高估 AI 对现有商业结构的冲击:agent 之间确实要处理支付,但钱终归要走某个通道,做好产品的公司不会因为 AI 就消失。「世界在这件事上有点走火入魔了。」他点名 Shopify CEO Toby Lütke 是他见过的最好的 AI 采纳者:自己动手、逼团队跟上,不搞 token 排行榜之类的花活,就是一句话「所有业务都用 AI」。

信源:https://www.youtube.com/watch?v=1ySBxK7viNs
1
Altman:下一阶段的OpenAI我可能管不了,要么找人要么造AI

Stripe CEO Patrick Collison 在 Stripe Sessions 上问 Sam Altman:把 OpenAI 今天的人数设为 100,5 年后是多少?Altman 答:「希望是 200。」

他说 OpenAI 正进入第三阶段。第一阶段是纯研究实验室,说要造 AGI 听起来像疯话。第二阶段加了产品公司。第三阶段要变成大规模「token 工厂」,把智能做成公共设施,尽可能便宜好用,需要深度全栈整合和大量基础设施。每一次转型管理方式都得大改,他说第三阶段恐怕「不是我擅长的风格」,要么找人来管,要么「造一个 AI 来管」。

Collison 问 OpenAI 最疯狂的未公开故事。Altman 说 GPT-4 训完到发布之间隔了 8 个月,全公司都在内部用,知道它跟以前完全不一样,但外面没人知道。他们有时在走廊里互相问:「我们是不是集体陷入了妄想?」没有任何外部反馈来校准自己的判断,那段时间极其怪异。

聊到怎么管一群都觉得自己最聪明的人,Altman 转述一位写 OpenAI 传记的作者对他的总结:「你最厉害的一点是让一群都认为只有自己最能干的人一起干活,干到搞出突破。」他说代价是「很多痛苦」,关键是共识:所有人都押注 scale,把算力集中在一个方向上。训 GPT-3 时几乎全公司算力都压在这一条线上,当时接触的 DeepMind 研究员觉得这种做法疯了,算力必须均分给各组,否则内部会因为抢资源搞出恶性竞争文化。OpenAI 不听,继续集中下注。

信源:https://www.youtube.com/watch?v=1ySBxK7viNs
1
Anthropic发布BioMysteryBench:5名专家都答不出的生物题,Claude Mythos能解出30%

Anthropic 发布 BioMysteryBench,99 道生物信息学题,由领域专家基于真实数据集出题。数据涵盖 DNA/RNA 测序、蛋白质组学、代谢组学等,每道题的答案都能从数据本身的客观属性验证,不取决于出题者选了什么分析方法。比如给一组 RNA-seq 数据,问实验组敲掉了哪个基因;给全基因组测序数据,问谁是谁的父母。

Claude 拿到一个容器,里面预装常用生信工具,可以自己用 pip 和 conda 装软件,也可以连 NCBI、Ensembl 等公共数据库下参考基因组,怎么分析随意,只看最终答案。99 道题里 76 道至少有一名人类专家做对,剩下 23 道让最多 5 名专家分别试过,没人答出来。

人类能做的 76 道题,Opus 4.6 准确率 77.4%,Mythos Preview 更高。23 道专家做不出的题,Mythos Preview 解出 30%。Claude 怎么做到的?一种是靠预训练吃进去的海量论文知识,人类得翻几十篇文献做元分析才能拼出来的结论,它直接推出来了;另一种是拿不准时同时跑好几套分析方法,哪个结论多条路都指向,就选哪个。

不过答对和稳定答对是两回事。人类可解题上,Opus 4.6 答对的题 86% 在 5 次重复中至少对 4 次;人类困难题上这一比例降到 44%,近半数正确答案只在 5 次里碰对 1 到 2 次,更像是碰巧走通了某条路。

罗氏旗下的基因泰克(Genentech,美国最大生物技术公司之一)同期发布了思路相似的 CompBioBench(100 道计算生物学题),Claude Opus 4.6 整体 81%、最难题 69%,两套独立评测结论一致。

信源:https://www.anthropic.com/research/Evaluating-Claude-For-Bioinformatics-With-BioMysteryBench
OpenAI 将向关键网安防御者开放 GPT-5.5-Cyber

OpenAI 发布名为「智能时代的网络安全」的行动计划白皮书,提出五大支柱框架,面向美国联邦、州和地方政府及盟友提供 AI 网安防御能力。CEO Sam Altman 同步宣布开始向关键网安防御者推送 GPT-5.5-Cyber,称其为「前沿网安模型」。

白皮书由 OpenAI 国家安全政策主管 Sasha Baker 署名,核心主张是:攻击者不会等,与其限制前沿模型只给少数合作伙伴,不如加速向可信防御者开放。五支柱分别是:民主化网安防御、政企协调、前沿能力安全保护、部署可见性与控制、帮助个人用户自我保护。

具体扩展计划包括:把 TAC(可信网安准入)项目从安全厂商和研究员扩展到各级政府部门;优先覆盖金融行业;通过托管安全服务商(MSSP)和 CISA 项目间接覆盖缺乏自建能力的小型医院、学区和水务局;并计划向民主盟友国家扩展准入。

GPT-5.5-Cyber 是继 4 月中旬 GPT-5.4-Cyber 之后的升级版本。GPT-5.5 的网安能力在 OpenAI 准备框架中被评为 High(未达 Critical),在 CyberGym 评测上得分 81.8%,高于 Claude Opus 4.7 的 73.1%。白皮书还提到,ChatGPT 用户每月发送超 1500 万条消息要求检查可疑内容是否为诈骗。

信源:https://x.com/sama/status/2049712078836170843?s=46
xAI坐拥50万张GPU但利用率仅11%,竞争对手称「低得离谱」

马斯克旗下 xAI 拥有约 50 万张英伟达 GPU,公开数据中属于 AI 开发商里最大的集群之一。但内部备忘录显示,xAI 近几周的 MFU(Model Flops Utilization,衡量芯片实际算力产出占理论峰值的比例)仅约 11%。一名竞争对手实验室的研究员称,大多数公司要突破 40% 都很难,但 11%「低得离谱」。

利用率低是行业通病。AI 训练是间歇式的:GPU 在训练时满负荷运转,研究员分析结果、决定下一步时芯片就闲着了。硬件层面也有瓶颈:高带宽内存(HBM)速度跟不上计算芯片,成千上万张 GPU 之间传输数据时网络任何薄弱环节都会拖慢整个集群。

行业内还有「刷数据」现象。一家大型实验室的研究员透露,同事会反复重跑训练实验来抬高利用率数字,一方面避免被上级批评,另一方面防止闲置的 GPU 被调给其他团队。

信源:https://www.theinformation.com/newsletters/ai-agenda/xai-shows-hard-use-lot-gpus
1
开源编辑器Zed发布1.0:放弃Electron,用Rust + GPU渲染从零重写

代码编辑器 Zed 发布 1.0。Zed 由 Atom 编辑器创始人 Nathan Sobo 团队打造,Atom 当年 fork Chromium 做桌面应用,顺手催生了 Electron 框架,后者成为 VS Code 的底座。Sobo 团队认为 Web 技术给编辑器设了天花板,于是放弃 Electron,用 Rust 从零重写,整个 UI 像游戏引擎一样直接喂数据给 GPU 着色器渲染,自研了 UI 框架 GPUI。

五年开发,代码量超百万行,覆盖 Mac、Windows、Linux。功能面已补齐现代编辑器的标配:Git 集成、SSH 远程开发、调试器、彩虹括号。AI 方面,Zed 支持同一窗口并行跑多个 agent,编辑预测按键级粒度提示下一步改动。开放的 Agent Client Protocol 已接入 Claude Agent、Codex、OpenCode,最近 Cursor 也加入。

同步推出企业版 Zed for Business,提供集中计费、角色权限和团队管理。Zed 今年 2 月完成 Sequoia 领投的 3200 万美元 B 轮,总融资超 4200 万美元。团队正在开发 DeltaDB,一个基于 CRDT(无冲突复制数据类型)的同步引擎,按字符级粒度追踪每次改动,目标是让多个人和多个 agent 共享同一份实时代码视图,在 agent 生成代码的上下文里直接做 review,而不用等 PR。

Zed 开源,目前有数十万开发者日活使用。

信源:https://zed.dev/blog/zed-1-0
Cursor开放TypeScript SDK:几行代码启动编程agent,可嵌入CI/CD和客户产品

AI 编程工具 Cursor 发布 TypeScript SDK 公开 beta 版,开发者用 npm install @cursor/sdk 安装后,几行代码就能启动与 Cursor 桌面端、CLI、网页端相同运行时的编程 agent。SDK 支持三种运行模式:本地运行、Cursor Cloud(每个 agent 独占一台沙箱虚拟机)、以及自托管的 worker 节点。

Cloud 模式下,agent 在笔记本合盖或断网后继续工作,完成后可自动开 PR、推分支或附上截图。开发者可以随时从 Cursor 桌面端或网页接入查看进度或接管任务。agent 继承 Cursor 全套能力:代码库索引与语义搜索、MCP 服务器连接外部工具、Skills 目录自动加载技能、Hooks 控制 agent 循环、子 agent 委派子任务。模型可选 Cursor 支持的所有前沿模型,包括专用编程模型 Composer 2。

典型用法包括从 CI/CD 流水线(代码持续集成 / 持续部署的自动化管道)直接触发 agent 修 bug、总结变更,或嵌入客户产品让终端用户直接获得 agent 体验。已有企业在用 SDK 搭建内部无代码查询工具。SDK 对所有 Cursor 用户开放,按 token 消费量计费。

信源:https://cursor.com/blog/typescript-sdk
xAI内测Grok Imagine Agent:无限画布上一句话出整套短片

多名用户在 X 上发帖称,Grok 网页版正在灰度上线 Imagine Agent Mode(beta)。这是 xAI 在已有的 Grok Imagine 图像视频生成基础上新加的 agent 模式,交互界面从传统聊天窗口换成了无限画布。

用户截图显示,Grok 侧边栏新增「Imagine」入口,点进去是一块开放画布,右侧列出预设工作流模板:Create Worlds、Short Film、UGC Product Stories(用户生成内容的产品图文包)、Brand Identity。用一句话说清想要什么,agent 在画布上一步步把图片和视频全部生成出来。具体能力包括同时生成和编辑多张图片、把静态图转成视频后自动拼接、视频裁剪和淡入淡出、导出成品。

TestingCatalog 称 Imagine Agent 可以处理复杂的多步指令,例如「生成一部 1 分钟短片」「生成一整套漫画」「生成 UGC 产品图文包」。另一名用户展示了 agent 先批量生成 3 组产品图和 3 组模特照片,再自动组合成社交媒体素材包的完整流程。

xAI 尚未发布官方公告。

信源:https://x.com/testingcatalog/status/2049649752699249019