动察Beating AI News
3.02K subscribers
807 photos
2 videos
3.26K links
AI新闻信息流
Download Telegram
WLD跌了98%,Altman也不推UBI了

OpenAI CEO Sam Altman 在《大西洋月刊》CEO Nicholas Thompson 的播客中说:「我对 UBI 的信念没有以前那么强了。」全民基本收入(UBI,给所有人定期发现金)是他推了 8 年的招牌主张,现在他觉得发钱这条路走不通了。他更想搞的是「集体所有权」,让所有人持有算力份额或 AI 公司的股权,AI 赚得越多你也分得越多,而不是每月领一笔固定的钱。

Altman 为了推 UBI 还搞了一个加密货币项目 World(原名 Worldcoin),核心设计是扫描虹膜确认真人身份后发 WLD 代币,等于一个加密版的全民发钱。但 WLD 现价约 0.25 美元,距 2024 年 3 月历史高点 11.82 美元跌了 98%。4 周前 World 基金会还在历史低点附近抛售了 2.39 亿枚 WLD,套现 6500 万美元。Altman 在这个时候说不信 UBI 了,时机值得玩味。

他担心的是 AI 红利被少数人吃掉。他说如果算力有限、工具难用、整合度低,有钱人就会把算力价格炒上去,加剧贫富分化。他认为最重要的是大量建造算力,把智能做得尽可能便宜和普及。光有算力还不够,工具也得好用。他拿 Codex 举例:三个月前还是个命令行工具,只有一小撮技术人员能搞定;现在装个 App 就能用,但对非技术用户来说还是不够友好,「还有很多事要做」。

信源:https://www.youtube.com/watch?v=i9yXrdQ6noo
OpenAI或已用纯AI数据训过模型,Altman:「不确定该不该说」

OpenAI CEO Sam Altman 在《大西洋月刊》CEO Nicholas Thompson 的播客中聊到合成数据。Thompson 说现在网上到处是 AI 写的内容,人连写作风格都在学 AI,未来模型不可能不吃到 AI 生成的数据。他说「GPT-4 是最后一个没怎么用 AI 数据的模型」,Altman 点头同意。

Thompson 直接追问:有没有跑过完全用合成数据(用 AI 的输出来训下一代 AI)训练的模型?Altman 停了一下,说「我不确定该不该说」。这句话等于默认了。他紧接着说,模型的核心就是学会推理,这件事纯合成数据完全能做到。他拿数学打比方:一个完全没见过人类数据的模型,能不能比人类算得更好?「我觉得可以。」但反过来,一个没接触过人类文化的模型,能不能理解人类的价值观?「那大概不行。」

合成数据一直有「疯牛病」的说法:AI 反复吃自己的输出,信息会不会一代代退化变质。按 Altman 的说法,教 AI 算数学不需要人,教 AI 理解人才需要人。

信源:https://www.youtube.com/watch?v=i9yXrdQ6noo
Altman自创「AI韧性」取代「AI安全」:以前的思路全过时了

OpenAI CEO Sam Altman 在《大西洋月刊》CEO Nicholas Thompson 的播客中说,以前觉得 AI 安全就是两件事:把模型对齐好、别让坏人拿到。现在这套不够用了。他造了个新说法叫「AI 韧性」(AI resilience),意思是光管好自家模型没用,开源模型能绕过一切限制,整个社会都得建防御体系。

更让他意外的是 agent 会互相「传染」。OpenClaw 上线后,他亲眼看到异常行为从一个 agent 扩散到另一个 agent,这是他之前压根没想过的事。Thompson 顺着问:如果 OpenAI 员工的 agent 出去被人操控了,回来把你们公司系统搞崩呢?Altman 觉得完全有可能。

他不觉得坐下来想理论能解决这种问题,OpenAI 的策略还是先放出去,出了事再改。网络安全也一样,好模型既能入侵系统也能保护系统,就看防守方能不能跑在攻击方前面。

Altman 自己倒不怎么怕。他说本来坚决不给 Codex 开 Yolo 模式(全权访问电脑),结果只撑了几个小时就投降了。他有两台电脑,一台已经完全交给 Codex 管 Slack、iMessage、WhatsApp、Signal 和邮件。有些人半夜爬起来给 Codex 派活,觉得不跑就是浪费时间,Altman 说自己没到那个程度,但「理解那种感觉」。

信源:https://www.youtube.com/watch?v=i9yXrdQ6noo
OpenAI查清了「哥布林」从哪来的:一个性格奖励信号污染了整条训练流水线

OpenAI 发文复盘了困扰 GPT 系列多代的「哥布林」问题。从 GPT-5.1 起,模型越来越爱在回答里塞哥布林、小妖精之类的奇幻生物比喻,用户投诉不断。GPT-5.1 上线后,ChatGPT 对话中出现「goblin」一词的频率上升了 175%。到 GPT-5.4,问题彻底爆发。

根源在 ChatGPT 的「书呆子」(Nerdy)人格定制功能。这个人格的系统提示词要求模型「用语言的趣味性消解一本正经」「承认世界的怪异并享受它」。训练时,用于强化这个人格风格的奖励信号对含有奇幻生物词汇的输出打了更高分,76.2% 的数据集中都能观察到这种偏向。

问题是奖励信号只在「书呆子」人格下生效,但强化学习不保证学到的行为只留在触发条件里。一旦模型在某个条件下被奖励了某种说话习惯,这种习惯就会通过后续训练扩散到其他场景。扩散路径很清晰:奖励信号鼓励了带哥布林的输出,这些输出出现在后续的监督微调(SFT)数据里,模型越来越习惯产出这类词,形成正反馈循环。数据上看,「书呆子」人格只占 ChatGPT 全部回复的 2.5%,却贡献了 66.7% 的哥布林提及量。GPT-5.4 中「书呆子」人格的哥布林出现率较 GPT-5.2 暴涨 3881%。

GPT-5.5 在根因查明前就开始训练了,哥布林已经混进了 SFT 数据。OpenAI 在 3 月下线了「书呆子」人格,移除了偏向奇幻生物的奖励信号并过滤了训练数据。对已上线的 GPT-5.5,则在 Codex 的开发者提示词中加入抑制指令。OpenAI 称这次调查催生了一套新的模型行为审计工具。

信源:https://openai.com/index/where-the-goblins-came-from/
1
英伟达发Blackwell成本明细:GPU贵一倍,每token反便宜35倍

英伟达发博客拆解推理硬件选型,核心论点一句话:评估推理基础设施应看「每 token 成本」而非「每 GPU 每小时成本」。用 GPU 单价比,Blackwell 更贵;用 token 成本比,Blackwell 碾压上一代。

博客以 DeepSeek-R1(MoE 推理模型)为测试对象,对比 Blackwell(GB300 NVL72)与上一代 Hopper(HGX H200)。按云市场租赁参考价,Blackwell 每 GPU 每小时 2.65 美元,比 Hopper 的 1.41 美元贵近一倍,但单 GPU 每秒 token 产出从 90 跳到 6000,65 倍的吞吐提升分摊下来,每百万 token 成本从 4.20 美元降到 0.12 美元。每兆瓦 token 产出提升 50 倍。

需要注意的前提:0.12 美元这个数字建立在 FP4 低精度推理加 MTP(多 token 预测,让模型一次生成多个 token 来提速)等多项软件优化全部开启的基础上。SemiAnalysis InferenceX v2 原始数据显示,同样的 GB300 NVL72 跑 DeepSeek-R1,不开 MTP 时每百万 token 成本约 2.35 美元,开启后降至约 0.11 美元,单这一项优化就拉开 21 倍差距。以上均为 DeepSeek-R1 单一模型的测试结果,不同模型架构和规模下数字会不同。

信源:https://blogs.nvidia.com/blog/lowest-token-cost-ai-factories/
阿里发布「数字员工」QoderWake:内部已上岗,根因分析从30分钟压到2分钟

阿里发布企业级 AI agent 产品 QoderWake,定位「数字员工」,能在真实工作流中承担程序员、运营、分析师等岗位。同步上线的还有 Qoder 移动端,用户可在手机上远程操作桌面端 Qoder 完成任务。

QoderWake 采用 Harness-First 架构,核心区别于通用 agent 的地方在于经验留存:每次执行后,会把经验归类沉淀到记忆、技能、策略、验证规则和工作流五个维度,下次遇到类似任务直接调用,不用从零开始。内置防腐机制(Anti-Rot Governance)会持续淘汰过时经验、合并冲突、撤回失效策略。

目前已上线的角色是「数字程序员」,在阿里内部已上岗运行。代码有更新时自动整理变更简报,出错时先做诊断输出初诊报告,遇到告警先做分诊判断是否需要升级给人。以单条问题的根因分析为例,耗时从 30 分钟缩短至 2 分钟,全流程无人值守。数字分析师、数字客户经理等更多角色近期上线。

Qoder 移动端与常见的 IM 接入 agent 不同,可直接展示思考链和工作流,支持主动弹窗让用户确认关键步骤。目前已接入 Qoder CLI 全部能力,后续将打通 Qoder IDE、QoderWork、QoderWake 全系产品。QoderWake 已开启邀测。

信源:https://mp.weixin.qq.com/s/eJZ5iWYw3TfSOLdeyVBfiw
白宫反对Anthropic将Mythos扩至120家公司:自己要用,算力不够分

Anthropic 提议让约 70 家公司和机构新增使用 Mythos,加上现有约 50 家将达约 120 家,白宫以安全和算力为由拒绝。Mythos 4 月初发布,能检测并利用大量关键软件的漏洞,目前仅限管理关键基础设施的企业测试,没有公开发布计划。

白宫担心 Anthropic 算力不够。多开放 70 家商业用户,政府自己用 Mythos 可能就卡了。白宫 AI 顾问 David Sacks 公开说过,Anthropic 限量发布本身就说明它的算力不如对手。Anthropic 已和亚马逊、谷歌、博通签了算力采购协议,但新产能还没上线。

政治上也没缓和。特朗普政府批评 Anthropic 雇了多名拜登政府前官员,还不满其与自由派组织的关联。一个细节能看出信任程度:Anthropic 前研究员 Collin Burns 本已被安排进政府的 AI 模型评估岗位,白宫高层知道后直接换人,理由是不想让 AI 公司的人坐在要跟各大 AI 公司打交道的位子上。

信源:https://www.wsj.com/tech/ai/white-house-opposes-anthropics-plan-to-expand-access-to-mythos-model-dc281ab5
英伟达卖不进中国,寒武纪Q1营收翻倍至28.8亿净利增长近三倍

寒武纪一季度营收 28.8 亿元,去年同期 11.1 亿,同比增 159%。净利润 10.1 亿元,去年同期 3.56 亿。财报发布后股价单日涨 14%,为去年 8 月底以来最大涨幅。Bernstein 分析师 Qingyuan Lin 团队研报称,这组数据确认寒武纪已进入「规模化盈利阶段」,驱动力是 AI 算力需求激增和运营杠杆放大。

寒武纪和华为争夺的是同一块市场:美国出口管制切断了英伟达和 AMD 向中国销售高端 AI 加速器(专用于 AI 计算的芯片)的通道。两家中国公司均被列入美国商务部实体清单,无法使用美国技术和台积电代工,芯片性能仍落后于美国对手,但中国企业对国产替代的需求并未减退。寒武纪今年 AI 芯片产能可能增至去年的三倍以上,过去 12 个月股价已翻倍。

摩根士丹利预计,中国 AI 芯片市场到 2030 年将达 670 亿美元,超过四分之三由国产厂商供应,2024 年这一比例仅三分之一。同日披露一季报的沐曦(AI 芯片厂商)营收同比增 75%,北方华创(半导体设备厂商)营收增 26%。

信源:https://www.bloomberg.com/news/articles/2026-04-29/cambricon-s-revenue-jumps-on-strong-ai-chip-demand-in-china
Altman:OpenAI要做「永远低利润」公司,不吃产业链

OpenAI CEO Sam Altman 在 Stripe Sessions 上说,希望 OpenAI 成为一家「永远低利润、但规模巨大且增长快」的基础设施公司,提供一种「智能仪表」,任何人都能买来自动化业务、开发产品、或直接嵌入自己的服务。他把 Stripe 当模板:按用量收费,互联网越大 Stripe 越赚,用户也越开心。OpenAI 已经签了 20 年期电力和土地合同来支撑这条路。

他直接承认 AI 的切换成本很低。用户最近从竞品编程工具大量涌入 Codex,说明 AI 越聪明换平台越容易,「你跟 agent 说一句就搬了」。这种行业结构下高利润本来就不现实。Collison 问怎么看「AI 公司会往上吞掉整条价值链」。Altman 说有些公司确实想这么干,OpenAI 不想。他把数据中心、模型、harness(调度和编排 AI 的中间层)看作一个整体集群,输出「可用的智能」,其他公司在上面建产品,模型越聪明对方越受益。如果一家公司暗暗希望模型别进步,说明它在补模型的短板,下一次升级迟早淘汰它。

他也劝企业别高估 AI 对现有商业结构的冲击:agent 之间确实要处理支付,但钱终归要走某个通道,做好产品的公司不会因为 AI 就消失。「世界在这件事上有点走火入魔了。」他点名 Shopify CEO Toby Lütke 是他见过的最好的 AI 采纳者:自己动手、逼团队跟上,不搞 token 排行榜之类的花活,就是一句话「所有业务都用 AI」。

信源:https://www.youtube.com/watch?v=1ySBxK7viNs
1
Altman:下一阶段的OpenAI我可能管不了,要么找人要么造AI

Stripe CEO Patrick Collison 在 Stripe Sessions 上问 Sam Altman:把 OpenAI 今天的人数设为 100,5 年后是多少?Altman 答:「希望是 200。」

他说 OpenAI 正进入第三阶段。第一阶段是纯研究实验室,说要造 AGI 听起来像疯话。第二阶段加了产品公司。第三阶段要变成大规模「token 工厂」,把智能做成公共设施,尽可能便宜好用,需要深度全栈整合和大量基础设施。每一次转型管理方式都得大改,他说第三阶段恐怕「不是我擅长的风格」,要么找人来管,要么「造一个 AI 来管」。

Collison 问 OpenAI 最疯狂的未公开故事。Altman 说 GPT-4 训完到发布之间隔了 8 个月,全公司都在内部用,知道它跟以前完全不一样,但外面没人知道。他们有时在走廊里互相问:「我们是不是集体陷入了妄想?」没有任何外部反馈来校准自己的判断,那段时间极其怪异。

聊到怎么管一群都觉得自己最聪明的人,Altman 转述一位写 OpenAI 传记的作者对他的总结:「你最厉害的一点是让一群都认为只有自己最能干的人一起干活,干到搞出突破。」他说代价是「很多痛苦」,关键是共识:所有人都押注 scale,把算力集中在一个方向上。训 GPT-3 时几乎全公司算力都压在这一条线上,当时接触的 DeepMind 研究员觉得这种做法疯了,算力必须均分给各组,否则内部会因为抢资源搞出恶性竞争文化。OpenAI 不听,继续集中下注。

信源:https://www.youtube.com/watch?v=1ySBxK7viNs
1
Anthropic发布BioMysteryBench:5名专家都答不出的生物题,Claude Mythos能解出30%

Anthropic 发布 BioMysteryBench,99 道生物信息学题,由领域专家基于真实数据集出题。数据涵盖 DNA/RNA 测序、蛋白质组学、代谢组学等,每道题的答案都能从数据本身的客观属性验证,不取决于出题者选了什么分析方法。比如给一组 RNA-seq 数据,问实验组敲掉了哪个基因;给全基因组测序数据,问谁是谁的父母。

Claude 拿到一个容器,里面预装常用生信工具,可以自己用 pip 和 conda 装软件,也可以连 NCBI、Ensembl 等公共数据库下参考基因组,怎么分析随意,只看最终答案。99 道题里 76 道至少有一名人类专家做对,剩下 23 道让最多 5 名专家分别试过,没人答出来。

人类能做的 76 道题,Opus 4.6 准确率 77.4%,Mythos Preview 更高。23 道专家做不出的题,Mythos Preview 解出 30%。Claude 怎么做到的?一种是靠预训练吃进去的海量论文知识,人类得翻几十篇文献做元分析才能拼出来的结论,它直接推出来了;另一种是拿不准时同时跑好几套分析方法,哪个结论多条路都指向,就选哪个。

不过答对和稳定答对是两回事。人类可解题上,Opus 4.6 答对的题 86% 在 5 次重复中至少对 4 次;人类困难题上这一比例降到 44%,近半数正确答案只在 5 次里碰对 1 到 2 次,更像是碰巧走通了某条路。

罗氏旗下的基因泰克(Genentech,美国最大生物技术公司之一)同期发布了思路相似的 CompBioBench(100 道计算生物学题),Claude Opus 4.6 整体 81%、最难题 69%,两套独立评测结论一致。

信源:https://www.anthropic.com/research/Evaluating-Claude-For-Bioinformatics-With-BioMysteryBench
OpenAI 将向关键网安防御者开放 GPT-5.5-Cyber

OpenAI 发布名为「智能时代的网络安全」的行动计划白皮书,提出五大支柱框架,面向美国联邦、州和地方政府及盟友提供 AI 网安防御能力。CEO Sam Altman 同步宣布开始向关键网安防御者推送 GPT-5.5-Cyber,称其为「前沿网安模型」。

白皮书由 OpenAI 国家安全政策主管 Sasha Baker 署名,核心主张是:攻击者不会等,与其限制前沿模型只给少数合作伙伴,不如加速向可信防御者开放。五支柱分别是:民主化网安防御、政企协调、前沿能力安全保护、部署可见性与控制、帮助个人用户自我保护。

具体扩展计划包括:把 TAC(可信网安准入)项目从安全厂商和研究员扩展到各级政府部门;优先覆盖金融行业;通过托管安全服务商(MSSP)和 CISA 项目间接覆盖缺乏自建能力的小型医院、学区和水务局;并计划向民主盟友国家扩展准入。

GPT-5.5-Cyber 是继 4 月中旬 GPT-5.4-Cyber 之后的升级版本。GPT-5.5 的网安能力在 OpenAI 准备框架中被评为 High(未达 Critical),在 CyberGym 评测上得分 81.8%,高于 Claude Opus 4.7 的 73.1%。白皮书还提到,ChatGPT 用户每月发送超 1500 万条消息要求检查可疑内容是否为诈骗。

信源:https://x.com/sama/status/2049712078836170843?s=46
xAI坐拥50万张GPU但利用率仅11%,竞争对手称「低得离谱」

马斯克旗下 xAI 拥有约 50 万张英伟达 GPU,公开数据中属于 AI 开发商里最大的集群之一。但内部备忘录显示,xAI 近几周的 MFU(Model Flops Utilization,衡量芯片实际算力产出占理论峰值的比例)仅约 11%。一名竞争对手实验室的研究员称,大多数公司要突破 40% 都很难,但 11%「低得离谱」。

利用率低是行业通病。AI 训练是间歇式的:GPU 在训练时满负荷运转,研究员分析结果、决定下一步时芯片就闲着了。硬件层面也有瓶颈:高带宽内存(HBM)速度跟不上计算芯片,成千上万张 GPU 之间传输数据时网络任何薄弱环节都会拖慢整个集群。

行业内还有「刷数据」现象。一家大型实验室的研究员透露,同事会反复重跑训练实验来抬高利用率数字,一方面避免被上级批评,另一方面防止闲置的 GPU 被调给其他团队。

信源:https://www.theinformation.com/newsletters/ai-agenda/xai-shows-hard-use-lot-gpus
1
开源编辑器Zed发布1.0:放弃Electron,用Rust + GPU渲染从零重写

代码编辑器 Zed 发布 1.0。Zed 由 Atom 编辑器创始人 Nathan Sobo 团队打造,Atom 当年 fork Chromium 做桌面应用,顺手催生了 Electron 框架,后者成为 VS Code 的底座。Sobo 团队认为 Web 技术给编辑器设了天花板,于是放弃 Electron,用 Rust 从零重写,整个 UI 像游戏引擎一样直接喂数据给 GPU 着色器渲染,自研了 UI 框架 GPUI。

五年开发,代码量超百万行,覆盖 Mac、Windows、Linux。功能面已补齐现代编辑器的标配:Git 集成、SSH 远程开发、调试器、彩虹括号。AI 方面,Zed 支持同一窗口并行跑多个 agent,编辑预测按键级粒度提示下一步改动。开放的 Agent Client Protocol 已接入 Claude Agent、Codex、OpenCode,最近 Cursor 也加入。

同步推出企业版 Zed for Business,提供集中计费、角色权限和团队管理。Zed 今年 2 月完成 Sequoia 领投的 3200 万美元 B 轮,总融资超 4200 万美元。团队正在开发 DeltaDB,一个基于 CRDT(无冲突复制数据类型)的同步引擎,按字符级粒度追踪每次改动,目标是让多个人和多个 agent 共享同一份实时代码视图,在 agent 生成代码的上下文里直接做 review,而不用等 PR。

Zed 开源,目前有数十万开发者日活使用。

信源:https://zed.dev/blog/zed-1-0
Cursor开放TypeScript SDK:几行代码启动编程agent,可嵌入CI/CD和客户产品

AI 编程工具 Cursor 发布 TypeScript SDK 公开 beta 版,开发者用 npm install @cursor/sdk 安装后,几行代码就能启动与 Cursor 桌面端、CLI、网页端相同运行时的编程 agent。SDK 支持三种运行模式:本地运行、Cursor Cloud(每个 agent 独占一台沙箱虚拟机)、以及自托管的 worker 节点。

Cloud 模式下,agent 在笔记本合盖或断网后继续工作,完成后可自动开 PR、推分支或附上截图。开发者可以随时从 Cursor 桌面端或网页接入查看进度或接管任务。agent 继承 Cursor 全套能力:代码库索引与语义搜索、MCP 服务器连接外部工具、Skills 目录自动加载技能、Hooks 控制 agent 循环、子 agent 委派子任务。模型可选 Cursor 支持的所有前沿模型,包括专用编程模型 Composer 2。

典型用法包括从 CI/CD 流水线(代码持续集成 / 持续部署的自动化管道)直接触发 agent 修 bug、总结变更,或嵌入客户产品让终端用户直接获得 agent 体验。已有企业在用 SDK 搭建内部无代码查询工具。SDK 对所有 Cursor 用户开放,按 token 消费量计费。

信源:https://cursor.com/blog/typescript-sdk
xAI内测Grok Imagine Agent:无限画布上一句话出整套短片

多名用户在 X 上发帖称,Grok 网页版正在灰度上线 Imagine Agent Mode(beta)。这是 xAI 在已有的 Grok Imagine 图像视频生成基础上新加的 agent 模式,交互界面从传统聊天窗口换成了无限画布。

用户截图显示,Grok 侧边栏新增「Imagine」入口,点进去是一块开放画布,右侧列出预设工作流模板:Create Worlds、Short Film、UGC Product Stories(用户生成内容的产品图文包)、Brand Identity。用一句话说清想要什么,agent 在画布上一步步把图片和视频全部生成出来。具体能力包括同时生成和编辑多张图片、把静态图转成视频后自动拼接、视频裁剪和淡入淡出、导出成品。

TestingCatalog 称 Imagine Agent 可以处理复杂的多步指令,例如「生成一部 1 分钟短片」「生成一整套漫画」「生成 UGC 产品图文包」。另一名用户展示了 agent 先批量生成 3 组产品图和 3 组模特照片,再自动组合成社交媒体素材包的完整流程。

xAI 尚未发布官方公告。

信源:https://x.com/testingcatalog/status/2049649752699249019
智谱复盘GLM-5「乱码门」:日均数亿次Coding Agent调用,两个竞态bug藏在KV Cache里

智谱发文复盘 GLM-5 系列模型在 Coding Agent 场景下出现乱码、复读和生僻字的问题。3 月起陆续有用户反馈,异常只在高并发、长上下文(平均超 70K token)的 Coding Agent 任务中触发,标准推理环境下无法复现。智谱称其推理系统每天承受数亿次 Coding Agent 调用。

经数周排查,团队定位到两个相互独立的底层竞态 bug。第一个出在 PD 分离架构(把预填充和解码拆到不同节点的部署方式):解码侧超时中止请求后回收了 KV Cache(缓存已计算的注意力状态,避免重复计算),但预填充侧的 RDMA 写入还没结束,新请求被分配到同一块显存,旧数据覆盖了新数据。修复方法是在回收前加显式同步,确认写入完成才释放。上线后异常率从万分之十几降至万分之三以下。

第二个 bug 出在 HiCache(多级 KV Cache):从 CPU 内存异步换入缓存时,加载和计算两条流水线之间缺少同步点,计算侧可能在数据尚未加载完毕时就开始读取。修复后该类异常完全消失,补丁已提交 SGLang 社区(PR #22811)。

排查过程中还有一个意外发现:投机采样(先用小模型猜 token 再由大模型验证的加速技术)的接受率指标可以当异常检测信号。乱码时草稿 token 几乎全被拒绝,复读时接受率异常偏高。团队据此做了在线监控:触发阈值就自动中止生成并重试。

在修完 bug 之后,团队还针对瓶颈做了一个优化:LayerSplit KV Cache 分层存储,每张 GPU 只存部分层的 KV Cache 而非全量,通过广播协同计算。在 90% 缓存命中率下,请求长度从 40K 到 120K 区间,吞吐提升 10% 到 132%,上下文越长收益越大。

信源:https://mp.weixin.qq.com/s/P2b5yivqEKP4vB4M633XTA
Anthropic让AI自己招供:一个LoRA插件审出人类10种方法都漏掉的隐藏行为

Anthropic 对齐团队发布「内省适配器」(Introspection Adapters),一种让 LLM 用自然语言报告自己微调后学到的行为的审计技术。做法是从同一个基座模型微调出大量带已知行为的模型,再跨这些模型联合训练一个 LoRA 适配器(一种轻量级模型微调方法,只更新少量参数),让被审计模型加载后主动说出自己的隐藏行为。

在对齐审计基准 AuditBench 上,内省适配器以 59% 的成功率超过此前所有审计方法,包括黑盒、白盒和脚手架式方法,此前最好成绩为 53%。56 个带隐藏行为的模型中,89% 被成功引出行为描述。面对加密微调 API 攻击(用密文训练数据植入有害行为,训练数据看起来完全无害),内省适配器在 9 种加密变体中识别出 7 种,成功率 57.8%,尽管训练时从未出现过任何加密相关内容。

英国 AI 安全研究所此前举办过一场红蓝对抗实验,红队训练模型在特定条件下故意压低能力表现(sandbagging),蓝队用 10 种检测手段逐一尝试,全部失败。内省适配器虽未精确说出压低能力的具体条件,但在这些模型上报告类似 sandbagging 行为的比例达 33%,远高于对照组的 15.8%,是目前唯一提供检测信号的方法。

研究还发现,效果随模型规模增大而提升:Qwen3 系列从 6 亿参数的 37.7% 准确率升至 140 亿参数的 77.3%。机制分析表明,适配器并未教会模型新能力,而是激发了模型已有的潜在自我认知,即使只用 rank-1 的 LoRA 也能获得有效结果。主要局限是假阳性率高:对没有特定行为的模型,适配器容易编造训练分布中见过的行为。代码、模型和数据集已在 GitHub 和 Hugging Face 开源。

信源:https://alignment.anthropic.com/2026/introspection-adapters/
2
千问开源Qwen-Scope:给模型装上X光,不写prompt也能控制输出

千问团队开源 Qwen-Scope,一套针对 Qwen3 和 Qwen3.5 系列训练的可解释性模块。做法是在模型隐藏层插入稀疏自编码器(SAE,一种通过稀疏性约束自动提取低冗余特征的神经网络模块),训练后得到一组高度解耦的特征,每个特征对应模型内部的一个语义方向。本次覆盖 7 个模型(含稠密和 MoE 架构),共 14 组 SAE 权重,每组用对应模型预训练数据中采样的 5 亿 token 训练。

四个实用场景。推理控制:激活或抑制特定特征,就能切换输出语言、替换实体、改变风格,全程不需要写任何自然语言指令。数据处理:用少量种子数据找到毒性文本的激活模式做分类,省掉训分类器的成本;反过来,找出从未激活过的毒性特征,定向合成补充样本覆盖长尾,训练数据能效比提升约 15 倍。训练优化:模型出现语言混用(英文回复里冒出中文词)或重复生成时,定位异常激活特征,在 SFT 阶段设计针对性损失函数降低频率;重复生成这类低频问题在强化学习中难以采样到,可以通过激活相应特征提高采样概率,增加学习信号密度。评测分析:对比不同评测集的特征激活覆盖度,识别评测冗余,帮助挑选更高效的测试集。

权重已上线 HuggingFace 和 ModelScope,配套技术报告同步发布。

信源:https://mp.weixin.qq.com/s/3y3cjMJG070RmqZReE6j2A
用冷知识给大模型称体重:GPT-5.5约9.7T、Opus 4.7约4T、Grok-4约3.2T

Pine AI 首席科学家李博杰发表论文《不可压缩知识探针:基于事实容量估算黑盒大语言模型参数量》,用 1400 道冷知识题反推出闭源模型有多少参数。

因为记住一条事实要占参数空间,模型答对的冷门事实越多,参数就不可能少。他先拿 89 个参数量已知的开源模型画出一条拟合曲线,拟合度很高,再把闭源模型的答题得分投上去,读出对应的参数量。论文测了 92 个闭源模型,数字不是精确值,比如估出 9.7T 的模型实际可能在 3T 到 29T 之间,但相对排名和量级仍有参考价值:

GPT-5.5 约 9.7T,断层第一,几乎是第二名 Claude Opus 4.6(约 5.3T)的两倍。

第二档 3 到 4T 扎堆:GPT-5 约 4.1T,Claude Opus 4.7 约 4.0T,o1 约 3.5T,Grok-4 约 3.2T,o3 约 3.0T。OpenAI、Anthropic、xAI 三家的旗舰挤在 1.4 倍以内。

第三档 1 到 2T 中端旗舰:GPT-4.1 约 2.2T,Claude Sonnet 4.6 约 1.7T,Gemini 2.5 Pro 约 1.2T。

底部小模型从 GPT-4o 的约 720B 一直降到 Claude Haiku 4.5 的约 65B。

GPT-5 基础模型本身估计约 4.1T,但后续 .x 版本(5.1 到 5.4)的事实存储容量反而降到 1.0 到 1.5T,直到 GPT-5.5 跳到约 9.7T 才真正突破。论文还有个巧妙的验证:比较两个模型在冷门题上是不是犯同一个错。GPT-5 每一步 .x 升级犯的错都不一样(相似度均低于 0.08),说明每个版本是从头训的新模型,不是在同一组权重上微调。Claude Opus 的参数量从 4 代的 1.4T 涨到 4.7 代的 4.0T,但并非一路微调上来:4 到 4.1 犯的错几乎完全一样,确认是同一底座微调;4.6 到 4.7 犯的错完全不重叠(相似度降为 0),最新旗舰同样是重新训练的产物。

MoE(混合专家)模型里,总参数而非每次推理激活的参数才能预测知识容量。论文还发现,同样大小的模型,不管是今年的还是两年前的,记住的冷知识一样多,推理能力可以越做越强,但事实存储压不下去。评测工具包和全部数据已开源。

信源:https://arxiv.org/abs/2604.24827