动察Beating AI News
3.01K subscribers
802 photos
2 videos
3.26K links
AI新闻信息流
Download Telegram
440MB翻译33种语言:腾讯混元开源手机离线翻译模型

腾讯混元团队开源翻译模型 Hy-MT1.5-1.8B-1.25bit,把 18 亿参数的翻译模型压缩到 440MB,下载后可在手机上完全离线运行,支持 33 种语言、1056 个翻译方向,覆盖中英日法阿俄及藏语、蒙古语等少数民族语言。

压缩用的是腾讯自研的 Sherry(稀疏三值量化)技术,已被 NLP 顶会 ACL 2026 录用。核心做法是每 4 个参数取 3 个最重要的用 1-bit 存储、1 个置零,平均每个参数只占 1.25 bit,配合专为手机 CPU 设计的推理内核可常驻后台。腾讯称该模型在翻译评测中超过谷歌翻译,接近 235B 级大模型效果。同时提供 2-bit 版本(574MB),精度几乎无损。模型权重、代码和技术报告已在 HuggingFace 和魔搭社区开源,附带安卓 APK 可直接安装体验,iOS 版后续推出。

信源:https://mp.weixin.qq.com/s/GMl4FiB8HRwqZc-1_T9XOw
👍2
Qwen开源FlashQLA:线性注意力前向提速3倍,TP8场景比FlashInfer快5倍

Qwen 团队开源 FlashQLA,一套针对 GDN(Gated Delta Network,Qwen3-Next / 3.5 / 3.6 全系列使用的线性注意力层)的高性能算子库。在 H200 上实测,前向比 FLA Triton kernel 快 2-3 倍,反向快 2 倍;对比 FlashInfer,TP8 场景前向最高快 5.33 倍。

提速的核心在于利用 GDN 门控值的指数衰减特性做卡内自动上下文并行(AutoCP)。传统做法需要计算一个校正矩阵 M 来拼接各子序列的状态,计算量甚至超过状态矩阵本身。FlashQLA 发现 60%-80% 的注意力头上门控值不会常驻 1,只需 6-8 个 chunk 的预热就能让状态误差降到噪声以下,直接跳过 M 的计算。系统会根据 batch size、头数和序列长度自动判断是否启用 CP,无需手动配置。

算子层面,FlashQLA 没有把整个计算流融合成单一 kernel,也没有拆成逐步独立 kernel,而是折中拆成两个融合 kernel 并在中间插入 CP 预处理。每个 kernel 内部用 TileLang 实现 warp 级特化(warp specialization),一个生产者 warp group 负责数据搬运,三个消费者 warp group 分别算不同中间变量,通过乒乓结构重叠访存和计算。提速在 TP 分片多、头数少的场景最明显,正好是大模型多卡部署和端侧 agent 推理的典型配置。

信源:https://qwen.ai/blog/flashqla
金融Agent平台Rogo获1.6亿美元D轮融资,不到三个月连融两轮

专为高频金融场景设计的 AI 平台 Rogo 宣布完成 1.6 亿美元 D 轮融资,由 Kleiner Perkins 领投,Sequoia、Thrive Capital、Khosla Ventures、J.P. Morgan 等参投。今年 1 月末 Rogo 刚完成 7500 万美元 C 轮融资,两轮间隔不到三个月。至此,公司累计融资额超 3 亿美元。

Rogo 同步推出面向个人的金融 Agent 平台 Felix。系统设计思路从「像搜索引擎一样问答」转向「像发邮件给同事一样委派任务」。投行家和分析师可将建模型、查财报、搭 PPT 等多步长流程任务抛给 Felix 执行,并在过程中与其沟通迭代,将时间腾出用于客户沟通等高杠杆工作。目前该平台已被超 250 家顶尖投资银行、资产管理公司和私募股权机构的 3.5 万名专业人士使用。

信源:https://rogo.ai/news/series-d
Anthropic考虑新一轮融资,估值超9000亿美元将反超OpenAI

Anthropic 正在考虑一轮新融资,估值超过 9000 亿美元。如果成行,Anthropic 将超越 3 月刚以 8520 亿美元完成融资的 OpenAI,成为全球估值最高的 AI 创业公司。

多名知情人士称,已有投资者向 Anthropic 开出超过其当前估值一倍以上的报价。谈判尚处极早期,Anthropic 还没有接受任何要约。此前 Anthropic 曾多次拒绝 8000 亿美元及以上估值的入股提议。

Anthropic 目前估值 3500 亿美元,由谷歌和亚马逊两笔大额投资锚定。谷歌近期承诺以该估值投入 100 亿美元,如 Anthropic 达到特定业绩目标再追加 300 亿;亚马逊以同一估值投入 50 亿美元,计划后续追加 200 亿。尚不清楚这两家是否会参与新一轮融资。Anthropic 同时在考虑最早 10 月进行 IPO。

信源:https://www.bloomberg.com/news/articles/2026-04-29/anthropic-considering-funding-offers-at-over-900-billion-value
「AI杀死搜索」?谷歌搜索量创历史新高,Alphabet每股收益翻倍碾压预期

Alphabet 公布一季度财报,营收(不含合作伙伴分成)947 亿美元,超出分析师预期的 916 亿美元;每股收益 5.11 美元,接近华尔街预期 2.62 美元的两倍。财报发布后股价盘后涨超 6%。

CEO Sundar Pichai 称,谷歌在搜索中整合 AI 工具后,搜索查询量创历史新高,同时用 AI 回答用户问题的成本已被压低。这是对「聊天机器人将蚕食谷歌搜索」这一叙事最直接的反驳。

云业务收入 200 亿美元,超出预期的 184 亿美元。积压订单(已签约但尚未确认为收入的合同额)较上季度接近翻倍,突破 4600 亿美元。Pichai 称公司短期内受限于算力,「云收入本可更高」,正在加大投入。公司还将对部分客户开放在其自有数据中心使用 TPU(谷歌自研 AI 芯片,英伟达之外的主要替代方案)。

Gemini Enterprise(面向企业的 AI agent 平台)付费月活用户环比增长 40%。消费端 Gemini 聊天机器人在 2025 年底有 7.5 亿用户。

CFO Anat Ashkenazi 表示,今年资本支出预算上调至最高 1900 亿美元,此前预估 1850 亿美元,已是 2025 年实际支出的两倍;2027 年将「大幅」高于这一水平。公司同时宣布股息增加 5%。

信源:https://www.bloomberg.com/news/articles/2026-04-29/alphabet-sales-beat-estimates-on-google-cloud-ai-customers
1
Meta营收增33%超预期,但全年资本开支上调至最高1450亿美元,盘后跌7%

Meta 公布一季度财报,营收 563.1 亿美元,同比增长 33%,超过华尔街预期的 554.5 亿美元。调整后每股收益 7.31 美元,高于预期的 6.79 美元。报告利润中包含一笔 80.3 亿美元的一次性税收优惠,来自美国财政部今年 2 月简化企业替代最低税的新规,部分抵消去年因减税法案产生的 159.3 亿美元税费。

营收和利润都超预期,但股价盘后跌约 7%,核心原因是资本开支再度加码。Meta 将全年资本支出指引从 1150 至 1350 亿美元上调至 1250 至 1450 亿美元,比此前高出 100 亿美元。2025 年全年实际资本支出为 722 亿美元,一年内接近翻倍。CFO Susan Li 称上调原因是元器件涨价和新增数据中心建设需求,并在电话会上表示「到目前为止,我们一直在低估算力需求」。

用户数据同样拖累股价。旗下应用日活人数 35.6 亿,同比增长 4%,但低于分析师预期的 36.2 亿,环比上季也有所下降。Meta 将此归因于伊朗断网和俄罗斯限制 WhatsApp 访问。

广告业务仍是核心增长引擎。广告收入 550.2 亿美元,占总营收超 98%。广告展示量同比增 19%,每条广告均价提升 12%。

CEO 扎克伯格在电话会上称 Muse Spark 是「今年最大的里程碑」,该模型由 Alexandr Wang 领导的 Meta 超级智能实验室推出。发布后 Meta AI 每用户会话量出现双位数增长。扎克伯格还表示 Meta「不反对」做编程工具,但「这不是我们的主要重心」。

Meta 同时披露将于 5 月裁员约 10%,涉及约 8000 名员工,另取消 6000 个开放职位。CFO Li 称裁员将帮助公司「行动更快」,并抵消基础设施投资。截至 3 月底,员工总数为 77,986 人。

Q2 营收指引 580 至 610 亿美元,与分析师预期大致持平。

信源:https://investor.atmeta.com/investor-news/press-release-details/2026/Meta-Reports-First-Quarter-2026-Results/default.aspx
OpenClaw v2026.4.27:接入Codex桌面控制,DeepInfra成为内置提供商

开源个人 AI 助手 OpenClaw 发布 v2026.4.27。两个面向用户的新功能最值得关注:Codex Computer Use 和 DeepInfra 内置支持。

Codex Computer Use 让 OpenClaw 的 Codex 模式 agent 获得桌面控制能力,可以操作鼠标、键盘和屏幕。新增 /codex computer-use status/install 命令和 marketplace 自动发现,启动前强制检查 MCP 服务器可用性,检查不通过则拒绝进入 Codex 模式。该功能由 OpenAI 员工 @pash-openai 贡献。

DeepInfra 作为内置提供商加入,配好 API Key 即可使用,支持 OpenAI 兼容的模型动态发现、图片生成与编辑、TTS、embedding,不再需要手动配置端点。

架构层面,大量模型提供商目录(DeepSeek、Mistral、NVIDIA、Cerebras 等)从运行时动态扫描迁移到插件清单(manifest)静态声明,插件启动也从隐式全量加载改为显式 activation.onStartup 声明。直接效果是网关启动更快,插件审计更清晰。此外 Docker sandbox 新增 GPU 直通选项,企业部署新增出站 HTTP 代理路由。bug 修复超百项,覆盖 Telegram、Slack、飞书、Discord 等主要渠道的稳定性问题。

信源:https://github.com/openclaw/openclaw/releases/tag/v2026.4.27
1
亚马逊EPS账面翻倍碾压预期,扣掉Anthropic投资收益后差1分钱

亚马逊公布一季度财报,总营收 1815 亿美元,同比增 17%,超出华尔街预期的 1773 亿美元。每股收益 2.78 美元,表面上远超分析师预期的 1.64 美元,但其中包含一笔 168 亿美元的 Anthropic 投资税前收益。剔除这笔一次性收益后,调整后每股收益约 1.61 美元,反而比预期低了 1 分钱。盘后股价跌超 3%。

AWS 营收 375.9 亿美元,同比增 28%,超出预期的 366.4 亿美元,是 15 个季度以来最快增速。运营利润 141.6 亿美元,运营利润率 37.7%,远超预期的 128.4 亿美元。CEO Andy Jassy 称自研芯片业务年化营收已突破 200 亿美元,同比增速超过三位数。过去 12 个月亚马逊已部署超 210 万颗 AI 芯片,其中过半为自研 Trainium。

一季度资本支出 442 亿美元,高于预期的 436 亿美元,全年预算 2000 亿美元。代价是过去 12 个月自由现金流降至 12 亿美元,同比缩水 95%。广告业务营收 172.4 亿美元,同比增 24%,超出预期。

Q2 营收指引 1940 至 1990 亿美元,高于分析师预期的 1889 亿美元。运营利润指引 200 至 240 亿美元。Prime Day 将提前至 6 月举办。

信源:https://ir.aboutamazon.com/news-release/news-release-details/2026/Amazon-com-Announces-First-Quarter-Results/
1
微软Azure重回40%增速反转减速趋势,全年资本开支飙至1900亿美元

微软公布 FY26 Q3(截至 3 月 31 日)财报,营收 828.9 亿美元,同比增 18%,超出分析师预期的 813.9 亿美元。调整后每股收益 4.27 美元,高于预期的 4.06 美元。运营利润 384 亿美元,同比增 20%。

Azure 及其他云服务收入增长 40%(固定汇率口径 39%),超出管理层此前给出的 37% 至 38% 指引。过去三个季度 Azure 增速一路放慢:去年 7-9 月 40%、去年 10-12 月 39%、管理层对本季指引又降到 37-38%,市场担心见顶,今年 1 月上季财报发布后微软单日市值蒸发 3570 亿美元。这次实际增速反弹回 40%,证明此前的减速是数据中心产能没跟上,不是客户需求在退潮。

AI 业务年化收入 370 亿美元,同比增 123%。Microsoft 365 Copilot 付费席位突破 2000 万,1 月时为 1500 万。CEO Nadella 称 Copilot 周活跃度已与 Outlook 持平。微软云总收入 545 亿美元,增 29%。商业剩余履约义务(已签约未确认收入的合同额)6270 亿美元,接近翻倍。

资本支出(含融资租赁)319 亿美元,同比增 49%,但低于分析师预期的 352.9 亿美元约 34 亿。CFO Amy Hood 将全年资本支出预估上调至 1900 亿美元,其中约 250 亿来自元器件涨价,远超分析师此前预期的 1546 亿。毛利率降至 67.6%,为 2022 年以来最低,主要因数据中心折旧成本攀升。

微软同周宣布重组与 OpenAI 的合作关系:取消向 OpenAI 的收入分成,保留 Azure 作为 OpenAI 主要云平台的优先地位,以及至 2032 年的非独占模型许可。Nadella 在电话会上称微软拥有 OpenAI 前沿模型的免版税使用权,「我们完全打算充分利用」。

下季 Azure 指引 39% 至 40% 固定汇率增速,远高于分析师预期的 37%。营收指引 867 至 878 亿美元,中值与预期的 875.3 亿基本持平。

信源:https://www.microsoft.com/en-us/investor/earnings/fy-2026-q3/press-release-webcast
谷歌母公司CEO透露谷歌算力分配优先级:DeepMind第一,TPU十年来首次直售

Alphabet 一季度财报电话会上,分析师追问算力稀缺时怎么分配。CEO Sundar Pichai 给出了优先级:第一保障 Google DeepMind 训练前沿模型,其余按投资回报率(ROIC)框架在 Search、YouTube 和 Cloud 之间调配。他坦承公司短期内算力受限,「如果能满足需求,云收入本可更高」。

为缓解供应压力,谷歌将首次向部分客户直接出售 TPU 硬件,供其部署在自有数据中心。此前十年,TPU 只做内部使用和云端租赁,从未直售。目标客户包括量化交易公司 Hudson River Trading、AI 实验室 Thinking Machines Lab 和机器人公司 Boston Dynamics。CFO Anat Ashkenazi 给出了收入节奏:TPU 硬件销售收入今年只确认一小部分,绝大部分在 2027 年兑现。这批硬件协议已计入云积压订单(本季度接近翻倍至 4620 亿美元),但大头仍是常规谷歌云平台(GCP)合同,预计 24 个月内确认略超 50%。

需求增长的另一个信号:Gemini 等谷歌自研模型 API 的 token 处理量从上季度的 100 亿/分钟升至 160 亿/分钟,季度环比增长 60%。过去 12 个月有 330 个云客户各自处理超 1 万亿 token,35 个客户突破 10 万亿。

信源:https://www.investing.com/news/transcripts/earnings-call-transcript-alphabet-q1-2026-earnings-soar-stock-dips-93CH-4647252
亚马逊CEO:芯片业务独立运营值500亿美元,Trainium四代全线满订

亚马逊 CEO Andy Jassy 在一季度财报电话会上花了大量篇幅谈自研芯片。他说如果把芯片业务拆出来独立运营、像其他芯片公司一样对外卖芯,年化营收将达到 500 亿美元。按他的说法,亚马逊自研芯片业务已跻身全球数据中心芯片前三,「达到这个速度非同寻常」。

四代 Trainium(亚马逊自研 AI 训练芯片)的供需状况:Trainium2 已售罄;Trainium3 今年初刚开始出货,性价比比 Trainium2 再高 30% 至 40%,近乎满订;Trainium4 还有约 18 个月才大规模上市,已被预订大半。Jassy 称 Trainium 已积累超 2250 亿美元的收入承诺,来自 Anthropic 和 OpenAI 的多年大规模训练合约(各签下数吉瓦级算力),以及 Uber 等企业客户。

Jassy 算了一笔账:大规模使用 Trainium 做推理,每年可比依赖外部芯片省下数百亿美元 CapEx,运营利润率优势达数百个基点。Amazon Bedrock(AWS 的模型推理服务,超 12.5 万客户使用,近 80% Fortune 100 企业在用)大部分推理已跑在 Trainium 上。

被问到会不会直接卖 Trainium 机架,Jassy 说要在满足现有客户需求和外部销售之间平衡,但「我预计未来几年很可能会开始卖」。AWS 积压订单 3640 亿美元,尚未包含 Anthropic 上周宣布的超千亿美元大单。

信源:https://www.marketbeat.com/instant-alerts/amazoncom-q1-earnings-call-highlights-2026-04-29/
马斯克旧账被翻:停钱、争权、挖人,还让前女友留在OpenAI董事会当线人

马斯克诉 OpenAI 案周三进入交叉盘问阶段,OpenAI 律师 Savitt 用马斯克自己的邮件和短信还原了一条时间线。马斯克 2017 年春季率先停止了每季度 500 万美元的付款,当时他是 OpenAI 最主要的资金来源。家族办公室负责人 Birchall 8 月写信问要不要继续扣着不付,马斯克回了一个字:「Yes。」紧接着 9 月,马斯克在讨论设立营利实体时要求选 4 名董事(其他创始人合计只有 3 名),在邮件中写道「我将毫无疑问地拥有公司的初始控制权」。OpenAI 联合创始人兼前首席科学家 Sutskever 回信拒绝,认为这给了马斯克过大的权力。

争控制权失败后的 10 月,马斯克仍在 OpenAI 董事会任上,却开始从 OpenAI 挖人。他给 Tesla 副总裁写信说已说服早期研究员 Karpathy 加入 Tesla,「OpenAI 那帮人会想杀了我,但这事必须做」。同月他还让 Neuralink 联合创始人直接从 OpenAI 挖人:「直接招,我没问题。」

2018 年 2 月,马斯克给时任 OpenAI 董事 Shivon Zilis(马斯克 4 个孩子的母亲、Neuralink 高管)发短信:「我们打算主动从 OpenAI 挖 3 到 4 个人去 Tesla。」Zilis 问是否该继续留在 OpenAI 董事会「保持友好」以便「让信息持续流过来」,马斯克说是。Savitt 用这段短信试图证明马斯克在离开 OpenAI 后仍通过 Zilis 获取内部信息。

马斯克在盘问中反复表达不满,称 Savitt 的问题「是设计来骗我的」。法官 Gonzalez Rogers 一度要求双方冷静。当 Savitt 追问马斯克承诺捐 10 亿美元却只出了 3800 万时,马斯克答「我贡献了我的声誉,这些东西都有价值」。Savitt 还在当天早些时候用马斯克 3 月的推文打脸:马斯克上午作证称 Tesla 没有在做 AGI,Savitt 随即展示马斯克本人发的推文「Tesla will be one of the companies to make AGI」。

马斯克周四继续接受盘问。之后 Birchall 和 OpenAI 总裁 Brockman 预计将作为证人出庭。

信源:https://www.wired.com/story/model-behavior-elon-musk-cross-examined-sam-altman/
蚂蚁百灵万亿参数旗舰Ling-2.6-1T开源:1万亿参数激活630亿,MIT许可

蚂蚁百灵(Inclusion AI)正式开源旗舰模型 Ling-2.6-1T 权重。总参数 1 万亿,每次推理激活 630 亿(63B),MoE 架构,上下文 256K,MIT 许可。昨天开源的 flash 版(1040 亿参数 / 激活 74 亿)主打轻量高速,这次的 1T 版面向复杂任务场景。

架构与 flash 版一致,采用 MLA + Lightning Linear 混合注意力。1T 版新增「快速思考」训练策略,通过在后训练阶段引入「上下文过程冗余抑制」奖励,压缩冗长的思维链输出,在不损失推理质量的前提下降低 token 消耗。

评测方面,SWE-bench Verified 72.2%(flash 版 61.2%),作为参照,DeepSeek V4 Pro 等开源模型已超 80%。Artificial Analysis 综合智能指数 34,总输出约 1600 万 token。模型兼容 Claude Code、OpenClaw、OpenCode 等主流 agent 框架,OpenRouter 已上线免费 API。部署最低需 8 卡 GPU,支持 SGLang 和 vLLM(两个主流开源大模型推理引擎)。

信源:https://huggingface.co/inclusionAI/Ling-2.6-1T
WLD跌了98%,Altman也不推UBI了

OpenAI CEO Sam Altman 在《大西洋月刊》CEO Nicholas Thompson 的播客中说:「我对 UBI 的信念没有以前那么强了。」全民基本收入(UBI,给所有人定期发现金)是他推了 8 年的招牌主张,现在他觉得发钱这条路走不通了。他更想搞的是「集体所有权」,让所有人持有算力份额或 AI 公司的股权,AI 赚得越多你也分得越多,而不是每月领一笔固定的钱。

Altman 为了推 UBI 还搞了一个加密货币项目 World(原名 Worldcoin),核心设计是扫描虹膜确认真人身份后发 WLD 代币,等于一个加密版的全民发钱。但 WLD 现价约 0.25 美元,距 2024 年 3 月历史高点 11.82 美元跌了 98%。4 周前 World 基金会还在历史低点附近抛售了 2.39 亿枚 WLD,套现 6500 万美元。Altman 在这个时候说不信 UBI 了,时机值得玩味。

他担心的是 AI 红利被少数人吃掉。他说如果算力有限、工具难用、整合度低,有钱人就会把算力价格炒上去,加剧贫富分化。他认为最重要的是大量建造算力,把智能做得尽可能便宜和普及。光有算力还不够,工具也得好用。他拿 Codex 举例:三个月前还是个命令行工具,只有一小撮技术人员能搞定;现在装个 App 就能用,但对非技术用户来说还是不够友好,「还有很多事要做」。

信源:https://www.youtube.com/watch?v=i9yXrdQ6noo
OpenAI或已用纯AI数据训过模型,Altman:「不确定该不该说」

OpenAI CEO Sam Altman 在《大西洋月刊》CEO Nicholas Thompson 的播客中聊到合成数据。Thompson 说现在网上到处是 AI 写的内容,人连写作风格都在学 AI,未来模型不可能不吃到 AI 生成的数据。他说「GPT-4 是最后一个没怎么用 AI 数据的模型」,Altman 点头同意。

Thompson 直接追问:有没有跑过完全用合成数据(用 AI 的输出来训下一代 AI)训练的模型?Altman 停了一下,说「我不确定该不该说」。这句话等于默认了。他紧接着说,模型的核心就是学会推理,这件事纯合成数据完全能做到。他拿数学打比方:一个完全没见过人类数据的模型,能不能比人类算得更好?「我觉得可以。」但反过来,一个没接触过人类文化的模型,能不能理解人类的价值观?「那大概不行。」

合成数据一直有「疯牛病」的说法:AI 反复吃自己的输出,信息会不会一代代退化变质。按 Altman 的说法,教 AI 算数学不需要人,教 AI 理解人才需要人。

信源:https://www.youtube.com/watch?v=i9yXrdQ6noo
Altman自创「AI韧性」取代「AI安全」:以前的思路全过时了

OpenAI CEO Sam Altman 在《大西洋月刊》CEO Nicholas Thompson 的播客中说,以前觉得 AI 安全就是两件事:把模型对齐好、别让坏人拿到。现在这套不够用了。他造了个新说法叫「AI 韧性」(AI resilience),意思是光管好自家模型没用,开源模型能绕过一切限制,整个社会都得建防御体系。

更让他意外的是 agent 会互相「传染」。OpenClaw 上线后,他亲眼看到异常行为从一个 agent 扩散到另一个 agent,这是他之前压根没想过的事。Thompson 顺着问:如果 OpenAI 员工的 agent 出去被人操控了,回来把你们公司系统搞崩呢?Altman 觉得完全有可能。

他不觉得坐下来想理论能解决这种问题,OpenAI 的策略还是先放出去,出了事再改。网络安全也一样,好模型既能入侵系统也能保护系统,就看防守方能不能跑在攻击方前面。

Altman 自己倒不怎么怕。他说本来坚决不给 Codex 开 Yolo 模式(全权访问电脑),结果只撑了几个小时就投降了。他有两台电脑,一台已经完全交给 Codex 管 Slack、iMessage、WhatsApp、Signal 和邮件。有些人半夜爬起来给 Codex 派活,觉得不跑就是浪费时间,Altman 说自己没到那个程度,但「理解那种感觉」。

信源:https://www.youtube.com/watch?v=i9yXrdQ6noo
OpenAI查清了「哥布林」从哪来的:一个性格奖励信号污染了整条训练流水线

OpenAI 发文复盘了困扰 GPT 系列多代的「哥布林」问题。从 GPT-5.1 起,模型越来越爱在回答里塞哥布林、小妖精之类的奇幻生物比喻,用户投诉不断。GPT-5.1 上线后,ChatGPT 对话中出现「goblin」一词的频率上升了 175%。到 GPT-5.4,问题彻底爆发。

根源在 ChatGPT 的「书呆子」(Nerdy)人格定制功能。这个人格的系统提示词要求模型「用语言的趣味性消解一本正经」「承认世界的怪异并享受它」。训练时,用于强化这个人格风格的奖励信号对含有奇幻生物词汇的输出打了更高分,76.2% 的数据集中都能观察到这种偏向。

问题是奖励信号只在「书呆子」人格下生效,但强化学习不保证学到的行为只留在触发条件里。一旦模型在某个条件下被奖励了某种说话习惯,这种习惯就会通过后续训练扩散到其他场景。扩散路径很清晰:奖励信号鼓励了带哥布林的输出,这些输出出现在后续的监督微调(SFT)数据里,模型越来越习惯产出这类词,形成正反馈循环。数据上看,「书呆子」人格只占 ChatGPT 全部回复的 2.5%,却贡献了 66.7% 的哥布林提及量。GPT-5.4 中「书呆子」人格的哥布林出现率较 GPT-5.2 暴涨 3881%。

GPT-5.5 在根因查明前就开始训练了,哥布林已经混进了 SFT 数据。OpenAI 在 3 月下线了「书呆子」人格,移除了偏向奇幻生物的奖励信号并过滤了训练数据。对已上线的 GPT-5.5,则在 Codex 的开发者提示词中加入抑制指令。OpenAI 称这次调查催生了一套新的模型行为审计工具。

信源:https://openai.com/index/where-the-goblins-came-from/
1
英伟达发Blackwell成本明细:GPU贵一倍,每token反便宜35倍

英伟达发博客拆解推理硬件选型,核心论点一句话:评估推理基础设施应看「每 token 成本」而非「每 GPU 每小时成本」。用 GPU 单价比,Blackwell 更贵;用 token 成本比,Blackwell 碾压上一代。

博客以 DeepSeek-R1(MoE 推理模型)为测试对象,对比 Blackwell(GB300 NVL72)与上一代 Hopper(HGX H200)。按云市场租赁参考价,Blackwell 每 GPU 每小时 2.65 美元,比 Hopper 的 1.41 美元贵近一倍,但单 GPU 每秒 token 产出从 90 跳到 6000,65 倍的吞吐提升分摊下来,每百万 token 成本从 4.20 美元降到 0.12 美元。每兆瓦 token 产出提升 50 倍。

需要注意的前提:0.12 美元这个数字建立在 FP4 低精度推理加 MTP(多 token 预测,让模型一次生成多个 token 来提速)等多项软件优化全部开启的基础上。SemiAnalysis InferenceX v2 原始数据显示,同样的 GB300 NVL72 跑 DeepSeek-R1,不开 MTP 时每百万 token 成本约 2.35 美元,开启后降至约 0.11 美元,单这一项优化就拉开 21 倍差距。以上均为 DeepSeek-R1 单一模型的测试结果,不同模型架构和规模下数字会不同。

信源:https://blogs.nvidia.com/blog/lowest-token-cost-ai-factories/
阿里发布「数字员工」QoderWake:内部已上岗,根因分析从30分钟压到2分钟

阿里发布企业级 AI agent 产品 QoderWake,定位「数字员工」,能在真实工作流中承担程序员、运营、分析师等岗位。同步上线的还有 Qoder 移动端,用户可在手机上远程操作桌面端 Qoder 完成任务。

QoderWake 采用 Harness-First 架构,核心区别于通用 agent 的地方在于经验留存:每次执行后,会把经验归类沉淀到记忆、技能、策略、验证规则和工作流五个维度,下次遇到类似任务直接调用,不用从零开始。内置防腐机制(Anti-Rot Governance)会持续淘汰过时经验、合并冲突、撤回失效策略。

目前已上线的角色是「数字程序员」,在阿里内部已上岗运行。代码有更新时自动整理变更简报,出错时先做诊断输出初诊报告,遇到告警先做分诊判断是否需要升级给人。以单条问题的根因分析为例,耗时从 30 分钟缩短至 2 分钟,全流程无人值守。数字分析师、数字客户经理等更多角色近期上线。

Qoder 移动端与常见的 IM 接入 agent 不同,可直接展示思考链和工作流,支持主动弹窗让用户确认关键步骤。目前已接入 Qoder CLI 全部能力,后续将打通 Qoder IDE、QoderWork、QoderWake 全系产品。QoderWake 已开启邀测。

信源:https://mp.weixin.qq.com/s/eJZ5iWYw3TfSOLdeyVBfiw
白宫反对Anthropic将Mythos扩至120家公司:自己要用,算力不够分

Anthropic 提议让约 70 家公司和机构新增使用 Mythos,加上现有约 50 家将达约 120 家,白宫以安全和算力为由拒绝。Mythos 4 月初发布,能检测并利用大量关键软件的漏洞,目前仅限管理关键基础设施的企业测试,没有公开发布计划。

白宫担心 Anthropic 算力不够。多开放 70 家商业用户,政府自己用 Mythos 可能就卡了。白宫 AI 顾问 David Sacks 公开说过,Anthropic 限量发布本身就说明它的算力不如对手。Anthropic 已和亚马逊、谷歌、博通签了算力采购协议,但新产能还没上线。

政治上也没缓和。特朗普政府批评 Anthropic 雇了多名拜登政府前官员,还不满其与自由派组织的关联。一个细节能看出信任程度:Anthropic 前研究员 Collin Burns 本已被安排进政府的 AI 模型评估岗位,白宫高层知道后直接换人,理由是不想让 AI 公司的人坐在要跟各大 AI 公司打交道的位子上。

信源:https://www.wsj.com/tech/ai/white-house-opposes-anthropics-plan-to-expand-access-to-mythos-model-dc281ab5