动察Beating AI News
3.14K subscribers
871 photos
2 videos
3.38K links
AI新闻信息流
Download Telegram
发布一月即登顶,DeepSeek领衔中国大模型霸榜OpenRouter

在模型聚合平台 OpenRouter 公布的大模型调用量排行榜中,中国大模型呈现出历史性的「霸榜」态势。其中,4 月 24 日发布的 DeepSeek V4 Flash,在上线仅一个月的首秀中便以 7.99T(万亿)tokens 的调用量直接登上月度排行榜第一。

根据 OpenRouter 最新的 LLM 调用量月度榜单,前十名排位如下:
1. DeepSeek V4 Flash:7.99T tokens
2. Hy3 preview (腾讯混元3.0预览版):7T tokens
3. Claude Sonnet 4.6:6.65T tokens
4. Claude Opus 4.7:6.07T tokens
5. Hy3 preview (free):5.83T tokens
6. Kimi K2.6:5.45T tokens
7. Gemini 3 Flash Preview:4.57T tokens
8. DeepSeek V3.2:4.06T tokens
9. DeepSeek V4 Pro:3.4T tokens
10. MiniMax M2.7:2.95T tokens

除 DeepSeek 独占三席(V4 Flash、V3.2、V4 Pro)外,腾讯混元(Hy3 预览版与免费版共计 12.83T tokens)、月之暗面(Kimi K2.6)、MiniMax(M2.7)表现同样强劲。西方主流模型中仅剩 Anthropic 与 Google 守住三个席位,在总量与声势上均显被动。

这一流量版图的剧变,核心得益于中国大模型在「极致性价比」与「长文本处理」上的双重突破。以 DeepSeek V4 Flash 为代表的轻量级 MoE 架构,完美切合了 Cursor、Claude Code 等自主编程智能体在高频、大上下文读取时的刚性降本需求,成为全球开发者在智能体(Agent)场景下的默认首选。

信源:https://openrouter.ai/models?tab=leaderboard
全球首个AI编写预训练框架开源,清华与面壁推出ForgeTrain

面壁智能与清华 NLP 实验室在 OpenBMB 社区联合开源全球首个完全由 AI 编写的生产级大模型预训练框架 ForgeTrain,并发布由 ForgeTrain 训练的端侧小模型 MiniCPM5-1B。作为首个展示「AI 制造 AI」工程闭环的样本, ForgeTrain 在相同硬件条件下性能超越英伟达的 Megatron,在华为昇腾上预训练时也实现了 10% 的加速。同时, MiniCPM5-1B 登顶 Artificial Analysis 开放权重小模型榜第一。

为了让 AI 自主构建底层预训练基础设施,面壁智能提出「代工工程」(Forge Engineering)软件编程范式,摒弃兼容一切硬件与任务的通用框架,转而利用 AI 低成本代码生成能力为特定模型和硬件现场锻造专用代码。在构建机制上, ForgeTrain 采用三阶段方法:首先从现有预训练框架采集关键数据形成测试考场(Harness),接着在自动闭环中迭代生成二进制一致的框架代码,最终解除限制并实现对参考实现的超越。整个自动化演进对应 AI 制造 AI 的 L3 至 L4 阶段。

作为 ForgeTrain 的首个产出模型, MiniCPM5-1B 拥有 10.8 亿参数,核心架构基于标准的 LlamaForCausalLM 设计,大幅降低了下游集成与推理部署门槛。在 Artificial Analysis 评测中,模型以 18 分超越 2B 规模的 Qwen3.5-2B(16 分),并领先 Qwen3.5-0.8B(11 分)与 LFM2.5-1.2B-Thinking(8 分)。模型支持 MLX 4-bit 与 GGUF Q4_K_M 等部署格式, INT4 量化后权重仅为 0.5GB,并原生支持 131,072 tokens 长文本上下文与基于 enable_thinking 的混合双模推理。依托极低的硬件开销, OpenBMB 同步开源了纯离线运行的桌面浮窗伴侣应用 MiniCPM Desk Pet,支持实时响应 Cursor 等开发工具中的编码活动与 LoRA 人设切换。

信源:https://mp.weixin.qq.com/s/Ci0BXKMJHy086MycdqH77w
将顶尖大模型工程师视为战略资产,中国拟加强民营AI头部企业关键人才出境审批与合规管理

彭博社报道,中国正计划对阿里巴巴、DeepSeek(深度求索)等民营科技巨头和初创公司的顶尖人工智能(AI)专业人才实施海外出行合规管理。据知情人士透露,有关部门已开始对从事前沿AI研发且被认为对国家具有战略重要性的关键人员施加出行限制。这意味着相关人员在出国旅行前,需要获得有关部门的批准与报备。

长期以来,针对高校核心科研人员、核物理学家以及国有企业高管的因公及因私出国(境)管理是常规机制。然而,将此类出行审批与合规报备机制延伸至民营高科技企业的顶尖AI人才,这一举措颇具风向标意义。知情人士指出,名单的制定并非仅仅依据行政级别或职位高低,而是基于对其技术研发重要性的综合评估,涵盖了多位AI初创公司创始人、核心算法科学家和高级管理人员。

这一举措凸显出在前沿大模型和智能体革命中,顶尖AI工程技术人才已被视为核心战略资产。在中国AI产业加速追赶全球前沿的背景下,大部分核心技术人才在ChatGPT爆发后涌现,并高度集中在民营科技巨头和明星创业公司。此前,Meta以20亿美元收购由中国团队创立并已迁至新加坡的AI Agent初创公司Manus,因涉及技术与人才跨境流失风险引发了国内监管机构的深入审查。为防止敏感技术外流,有关部门在调查期间限制了Manus的两位联合创始人离境。

事实上,针对AI人才的出行合规引导早有端倪。知情人士透露,此前部分民营企业的AI工程师已被要求向相关部门主动报备其海外行程,但并未实行前置审批制。去年,也有媒体报道称有关部门建议顶尖AI创始人及核心研究人员尽量减少非必要的赴美行程。业界分析指出,加强出行审批管理一方面旨在筑牢国家前沿技术安全防线,防止敏感专利及底层模型技术外流;但另一方面,也可能对国内民营大模型企业吸引并留住具备全球化视野的顶尖科学家与海外高端人才带来新的合规考验。

信源:https://www.bloomberg.com/news/articles/2026-05-26/china-expands-travel-curbs-to-top-ai-talent-at-private-firms
🤮3🖕2🤡1
AI现在还当不了自主科学家,CUSP评测揭示大模型缺乏前瞻科研视野

Sakana AI、斯坦福大学、牛津大学、艾伦人工智能研究所和图灵研究所联合推出时序基准 CUSP,用以评估 AI 的科学进展预测能力。

基准包含 Nature 和 Science 等期刊的 4,760 个科学里程碑,衍生出 17,429 个具体任务,用以测试 GPT-5.4、Claude Sonnet 4.5 和 DeepSeek R1 等前沿大模型能否预测未知的科学未来。

大模型通常通过死记硬背训练数据来回答问题。如果直接测试 AI 对已有科学发现的看法,模型会因为读过「标准答案」而表现完美。

为防模型作弊, CUSP 通过截止条件锁定模型可用信息。例如对于某项 2025 年的科学突破,系统仅允许大模型使用 2025 年之前的历史文献,并设置 pre-cutoff 联网搜索对照实验。这相当于强迫模型回到过去的某个时间点,在零已知答案的盲测环境下预测未来,以此区分模型的知识记忆与真正的科学前瞻能力。

测试结果显示,大模型预测科学进展极其低效。大模型虽能在机制推理中识别合理研究方向,如 GPT-5.4 准确率达 81.9%。但在判定断言能否实现时,各模型精度仅在 45% 到 52% 之间,近乎抛硬币。

此外,模型预测的突破年份普遍严重滞后。 GPT-5.4 预测中位数滞后 14 个月, Claude S4.5 滞后 17 个月,仅 LLaMA 3.3 滞后 4 个月。在方案设计中,即使 GPT-5.4 获得 5.04/10 的最高分,也无法命中后来真正发生的具体技术路径。

这表明,即使 Sakana AI 等团队持续推进自主科研,前沿 AI 暂时也当不了自主科学家。大模型目前仅能作为回顾性的合理解释者,而非合格的前瞻性预言家。对于开创性突破,预测缺口更加显著。

信源:https://arxiv.org/pdf/2605.22681
Kimi误封后仅用英文致歉海外用户,国内开发者怒斥双标并永久停更开源插件

月之暗面旗下模型订阅服务 Kimi Code Plan 近日因封号事件在中文开发者社区引发抗议。风波始于开源开发者 Leechael 针对终端 Agent 工具 Pi Coding Agent 开发了 Kimi 适配器 pi-provider-kimi-code 。由于 Pi 官方最初未支持 Kimi , Leechael 编写了适配代码方便付费用户在终端复用自身额度 。然而,适配器上线后, Kimi 官方对 Leechael 的账号实施了封禁。

与此同时,海外开发者 Noemi 也声称在 Docker 容器中将 Kimi Code 接入 Pi 运行两天后遭遇封号,并贴出 403 权限被拒的截图质问月之暗面官方。

面对开发者群体的集体声讨,封号事件在 5 月 26 日下午迎来了戏剧性解决。 Kimi Code 团队成员 Young 在 X 上仅回复海外开发者 Noemi 表示 「We immediately adjusted our strategy and restored normal access to the affected accounts. 🫡」 ,紧急解封了受影响的付费账户。

然而,风波并未停息,反而迅速演变成第二波舆论危机。官方的致歉与解封声明仅用英文发布,且只在 X 上选择性回复了国外开发者,对国内开发者在中文渠道发起的抗议与退款请求完全不予正面回应。双重态度彻底引爆了国内付费用户的不满。 Leechael 公开晒出 pi-provider-kimi-code 插件 README 停更声明的截图,直言 「解封了。申请退款。只给老外用户公开道歉,中文用户不值得一个解释。👋🏻」 。

停更声明以英文直白列出三条弃用原因:首先是官方错误封禁,其次是解封后无任何解释与道歉,最后是平台对中文用户存在 「差别对待(Discriminatory treatment of Chinese users)」 的系统性倾向,包括更严苛的规则执行、不透明的风控以及缺乏申诉渠道。声明指出,在一个 「先封号且事后拒绝解释」 的厂商底座上开发没有任何长期价值,适配器自此无限期停更,不接受任何合并请求与新版本发布。

信源:https://x.com/Leechael/status/2059212729022595319
字节跳动首次发行Seed期权,派发豆包特股防范腾讯挖角

字节跳动首次针对特定业务部门派发独立期权。据英国《金融时报》报道,为了防范腾讯等竞争对手挖角,字节跳动近期向旗下 AI 实验室 Seed 部门员工发放了以豆包命名的低价特股期权,使员工可以直接分享 AI 业务的增长红利,而不会受到集团不同业务线股权稀释的影响。期权方案是字节跳动成立以来首次发行与单一业务单元绑定的特殊期权。

随着国内大模型领域的人才争夺战升温,基础设施和数据标注等核心工程岗位成为抢夺重点。字节跳动自 2023 年建立 Seed 实验室以来,凭借大规模的算力基础设施投资成为 Nvidia 在中国的最大客户,吸引了大量顶尖 AI 研究员。然而,腾讯自 2025 年底承认大模型开发滞后以来,近期由前 OpenAI 研究员姚顺雨带队,开展了密集的定向挖角。近期离职的 Seed 视觉平台资深成员肖雪峰与基础设施专家张驰均已加入腾讯。

为了应对挖角,字节跳动在本月向全球 Seed 员工提供了每股 13 美元的豆包特股认购选择权,相比 2025 年底的每股 10 美元上涨了近 30%,上涨反映出豆包大模型商业化与模型性能的提升。尽管期权机制能够提供丰厚的潜在收益,但组织内部也存在争议。部分内部人士透露,Seed 实验室团队规模已达 2000 人,内部组织架构面临官僚化和职责碎片化挑战。相比之下,腾讯的 AI 团队规模更小,且向研究人员承诺了更广泛的自主权、管理职责和更具吸引力的薪酬方案。除腾讯外,DeepSeek 同样面临激烈的人才竞争压力,目前正向投资者募集首轮资金以保留核心团队,而字节跳动在 2025 年也曾成功挖角多位 DeepSeek 的基础设施核心成员。

信源:https://www.ft.com/content/557561df-4b72-48e8-89cb-239829de694a
李开复透露零一万物正筹备上市,明年实现单季度盈利,拒绝「六小虎」标签欲做「金钱豹」

在放弃预训练与 AGI 路线、将核心研发团队并入阿里云并转向 To B 业务一年后,零一万物创始人兼 CEO 李开复接受《晚点 LatePost》采访,首次对外披露了公司的关键财务表现与战略走向。李开复透露,零一万物目前正在拆除红筹架构筹备上市,并预计明年成为中国第一家实现单季度盈利的 AI 2.0 公司。由于业务增长突飞猛进,团队内部已不再满足于被归为大模型「六小虎」,而是以追求真金白银造血能力的「金钱豹」自诩。

财务数据显示,零一万物 2025 年经审计收入达 2.5 亿元人民币(合同订单 5 亿元);而截至 2026 年 5 月,其已锁定的合同订单总额已超过 15 亿元人民币,正向 20 亿元目标冲刺。更具商业价值的是,今年的订单中近一半为经常性订阅收入(ARR),这有望为公司在资本市场争取到更高的估值倍数。由于放弃了耗资巨大的超大模型预训练,零一万物目前一年的运营成本仅为 2 亿多元,主要集中于人力开支,GPU 算力消耗极低。

在产品定位与市场拓展上,零一万物找到了以「一号位工程」为核心的 PMF(产品市场匹配)。李开复扮演客户的「首席 AI 战略官」,直接与企业一号位对接。公司向 Palantir 学习,不盲目追求基座模型迭代(内部对第三方大模型奉行「谁好用谁,零黏性」原则),而是基于本体论(Ontology)和多智能体(Multi-Agent)技术,为企业抽象出 AI 转型地图,并开发了针对 CEO、CFO 等管理者的专属 Agent 智能工具包(如内置 19 个 Agent 的「开复 AI」助手)。目前,零一万物已手握数个上亿元级的战略大客户,并在哈萨克斯坦等国家开展主权 AI 部署。为激励团队,李开复宣布在公司三周年之际增发 2000 万股期权,并设立 100 万元起步、上不封顶的 CEO 专项激励。

信源:https://mp.weixin.qq.com/s/DPNowUxKF8Bw_BI7ZdOYgg
1
美团发布「跑腿Skill」,可接入多家AI助手

美团正式将下单与配送履约能力封装为标准化接口「跑腿 Skill」,面向外部 AI 助手生态开放。目前已有多家第三方 AI 助手完成接入,支持用户直接在外部交互界面完成即时配送下单,无需跳转美团客户端。

Skill 接口旨在将原有的配送调度网络与履约闭环延伸至外部入口。除了即时配送,美团孵化的 AI 原生社交社区「觅游」也已于 5 月开启公测,后续计划与本地生活业务展开联动。

行业分析指出,开放「跑腿 Skill」是 C 端高频即时履约业务与外部 AI 结合的典型尝试。接口集成并非对外输出底层大模型,而是将调度履约、下单等成熟业务进行组件化封装,直接嵌入主流 AI 助手。虽然接入有助于拓宽服务入口,但仅靠开放 Skill 难以构成核心技术壁垒。在即时配送赛道,美团仍需面对阿里即时配送体系、字节智能履约与 AI 生态,以及京东到家、闪送等垂直平台的竞争,后续竞争优势的构建仍取决于配送调度网络的数据闭环与复用效率。

信源:https://mp.weixin.qq.com/s/rEBvyzSqHJO8KDknbgMM4w
👍1
Kimi与开源社区达成和解:风控升级误伤第三方工具,「双标公关」系误会

月之暗面旗下 Kimi Code 团队与开源社区于 5 月 26 日晚达成和解,彻底平息了封号事件引发的订阅风控与公关双标危机。开源开发者 Leechael 宣布删除早前言论过激的发言,并确认 pi-provider-kimi-code 插件将继续维护。付费订阅会员未来可在 Pi Coding Agent 等第三方工具中继续安全使用 Kimi Code Plan 。

Kimi Code 团队成员 Young 发布官方中文声明,解释了封号防御的技术细节。团队近期为打击中转站售卖和异常请求,升级了风控防御策略,并将 User-Agent 标识作为判定依据之一。然而,风控模型未充分考虑社区存在较多构造为 Kimi CLI User-Agent 的第三方 Code Agent (如 Pi ),导致系统将正常请求判定为恶意伪造,误伤了大量合规订阅用户。

双标争议实为多渠道沟通时差导致的误会。 Young 向本频道解释,由于国内大模型开发者主要聚集在月之暗面的官方飞书大群,团队在事件发生后第一时间已在飞书内部做了解答与安抚,而 X 平台的英文回复由于时差和跨平台运营出现延迟,无意间造成了只向外网道歉的双标假象。目前,月之暗面已全面调整风控策略,受限账号已全部恢复正常,并开始主动联系第三方开发者优化 User-Agent 判定。

和解达成后, Leechael 透露 Kimi 研发人员已与 Leechael 进行深入沟通,重新建立起对国产大模型生态的基本信心,并开始为 Kimi 个人智能体编写专属的前缀缓存优化指南。

信源:https://x.com/Leechael/status/2059202023539822987
Get笔记更名得到大脑,引入主动式AI Agent并上调会员年费

2026 年 5 月 26 日得到 App 上线十周年,个人知识管理与录音转写软件 Get 笔记更名为「得到大脑」,系统从被动整理转为主动交互的智能体模式。

得到大脑项目始于 2018 年。在 2019 年 5 月 26 日得到三周年的公开信中,项目首次以得到大脑计划公开,由首席科学家杨溥主导,设计目标是搭建个人知识地图。2022 年底 ChatGPT 发布后,项目研发加速。Get 笔记起源于飞书内部的会议整理工具,于 2024 年 5 月推出微信小程序,11 月发布 App 完整版。运营两年期间,Get 笔记注册用户达到 270 万,每日处理约 9000 场会议记录。

更名后的得到大脑新增了主动交互的智能体功能,包含点评一下、发芽一下、拷问一下与润色一下。系统支持主动挖掘历史记录,提示知识盲区,并能将口语化内容转换成发布稿。得到大脑打通了得到平台十年的电子书与课程库,用户在平台内阅读和学习的记录可作为智能体的运行素材。软件提供 Skill 接口与命令行工具(CLI),支持将记录数据接入第三方 AI 工作流。

随着功能调整,会员资费同步上涨。标准版年费从 Get 笔记时期的 199 元/年调整为 299 元/年(限时优惠价,日常价为 399 元/年,单月订阅为 49 元/月),涨幅约 50%。得到大脑首次推出 1999 元/年的专家版,提供包含选题、素材、排版在内的 8 个 AI 写作分工角色。老用户在当前会员有效期内可免费过渡到标准版,个人会议纪要与录音等历史数据均完整保留。由于提价未作提前预告,且部分承诺的运动数据打通等主动功能尚未实现,部分老用户对调价的透明度与产品成熟度提出质疑。
周处理25万亿tokens,OpenRouter完成1.13亿美元B轮融资

OpenRouter 宣布完成 1.13 亿美元 B 轮融资,由谷歌母公司 Alphabet 旗下独立成长基金 CapitalG 领投,NVentures、ServiceNow Ventures、MongoDB Ventures、Snowflake Ventures、Databricks Ventures 参投,a16z 与 Menlo Ventures 等老股东继续跟投。

OpenRouter 是一个 AI 模型交易与路由平台,企业可通过一个 API 调用 Anthropic、Google、OpenAI、xAI、DeepSeek 等提供方的 400 多个模型。

这轮融资最硬的支撑是用量增长。公司称,其平台每周处理量已升至 25 万亿 tokens,约合每月 100 万亿 tokens,较 6 个月前的每周 5 万亿 tokens 增长 5 倍。平台目前服务超过 800 万全球用户,包括 AI 原生创业公司和大型企业。

OpenRouter 要解决的是企业从单模型调用转向多模型调度后的控制问题。不同任务需要在成本、延迟、能力和数据处理政策之间取舍,企业需要统一的路由、权限、支出可视化和审计型使用报告。公司称,新融资将用于扩展路由、治理和优化能力。

模型公司继续卷价格和能力,开发者反而更需要一个中间层来比较、切换和调度模型。谁掌握真实调用流量,谁就更接近企业 AI 采购和模型分发的关键位置。

信源:https://x.com/openrouter/status/2059277623629664758?s=46
永久降价最高99%并统一上下文计费,小米MiMo大模型全面升级计费与套餐体系

小米旗下大模型 API 迎来大范围价格调整,对自研大模型 MiMo-V2.5 系列实施永久性大幅降价,降幅最高达到 99 %。本次降价不仅大幅压低了基础单价,还取消了长文本计费溢价,实现所有上下文长度统一计费。

具体计费方案显示,旗舰级模型 MiMo-V2.5-Pro 的输入缓存命中价格被压至每百万 tokens 仅 0.0036 美元,较长文本计费降幅达 99 %,输入缓存未命中价格调整为每百万 tokens 0.435 美元,降幅为 78 %,输出价格则降至每百万 tokens 0.87 美元,较原定价降低 86 %。标准版模型 MiMo-V2.5 的输入缓存命中价格降至每百万 tokens 0.0028 美元,较长文本计费降低 98 %,输入缓存未命中价格为每百万 tokens 0.14 美元,降幅达 83 %,输出价格则降至每百万 tokens 0.28 美元,降幅为 93 %。

除了直接降低 API 单价,大模型订阅套餐也迎来了全面升级,引入统一的点数计费机制。新套餐维持原有的 6 美元、 16 美元、 50 美元与 100 美元四档包月价格不变,但可用点数额度分别提升至 41 亿点、 110 亿点、 380 亿点与 820 亿点。在新规则下,调用 MiMo-V2.5 系列模型消耗的点数极低,如 MiMo-V2.5 输入缓存命中每 token 仅消耗 2 点,缓存未命中消耗 100 点,输出消耗 200 点。凭借新模型极低的点数消耗率,订阅用户在相同包月价格下可获得相当于原额度 5 至 8 倍的可用 token 额度。为回馈现有订阅用户,所有历史套餐额度将获得全额重置。

伴随价格下调,前期推出的开发者扶持计划也宣布提前收官。于 4 月 28 日启动的小米 MiMo 100 万亿 Token 开发者扶持计划已经正式结束,全球共计 548,664 名开发者递交申请,最终批准 241,879 人,累计发放了 100 万亿 tokens 的额度,折合人民币价值达 65,834,211 元。虽然扶持计划提前结束,但面向 Apache 软件基金会 committers 的专项福利维持长期开放,不受本次收官影响。

信源:https://x.com/XiaomiMiMo/status/2059314052892099070
MiniMax预告M3稀疏注意力,1M上下文提速9.7倍

MiniMax 工程负责人 Skyler Miao 在 X 预告新一代模型 M3,并公布了全新注意力架构:MiniMax Sparse Attention (MSA,稀疏注意力机制)。

在 100 万 (1M) tokens 超长上下文场景下,相较于采用全注意力架构(Full Attention,即稠密注意力)的 M2,M3 在 Prefill(预填充)阶段的注意力延迟下降,对应提速约 9.7 倍;Decode(解码)阶段的注意力延迟下降,对应提速约 15.6 倍。

随着上下文窗口迈向百万级别,长文本推理的瓶颈正在发生转移。以往显存容量(VRAM)是核心限制,而当上下文达到 100k 以上时,全稠密注意力高昂的计算成本(FLOPs)便成为本地部署的主要瓶颈。Redis 创始人 Salvatore Sanfilippo (antirez) 评价 MSA 路线为「正确的道路」,认为在本地推理中稠密注意力的开销难以为继。这与行业内其他长文本方案的探索方向一致:例如 DeepSeek V4 在 1M 上下文上的系统级优化,同样依赖混合注意力设计,通过压缩 KV 轴、压缩稀疏注意力(CSA)、高压缩率注意力(HCA,指 128 倍压缩后执行稠密注意力)与滑动窗口注意力(SWA),在降低 KV 缓存压力与节省计算开销之间取得平衡。

对长文本注意力机制的攻坚,是 MiniMax 路线选择的又一次折返。早期 M1 系列曾深度使用 Lightning Attention 等线性注意力,但 M2 却退回了全注意力架构。2025 年 10 月 29 日,预训练负责人孙浩海在官方博客中详解过折返背后的技术权衡:线性或稀疏注意力在常规榜单上表现良好,但在代码、数学、Agent 及长链 CoT(链式思考)等复杂推理场景下容易暴露性能退化问题;同时,当时前缀缓存(Prefix Caching)、低精度状态存储与投机解码等配套系统也尚不成熟。MSA 的推出表明 MiniMax 正在重新进攻高效注意力路线。

虽然分块索引和稀疏计算的设计路径清晰,但 MSA 是否能在不损害模型推理能力的前提下稳定落地,仍有待正式技术报告、权重开源与第三方复现的检验。

信源:https://x.com/SkylerMiao7/status/2059285750458544561
Anthropic发布Claude Code自动漏扫与修复插件

Anthropic 推出终端编程智能体 Claude Code 专属安全插件 security-guidance ,支持在代码编写会话中实时拦截并自动修复安全漏洞。 Anthropic 内部基准测试与灰度数据显示,启用安全审查后,拉取请求 PR 的安全修复意见减少 30 % 至 40 %,在代码交付人工评审前构建起第一道弹性防线。

安全检验分段在文件编辑、会话结束与代码提交三个阶段触发。编辑文件时,本地规则将实时匹配动态代码执行(如 evalchild_process.exec ),不安全反序列化(如 pickle )与 DOM 注入等已知高危模式,扫描不调用大模型,无额外 API 费用。会话结束时,后台模型异步比对工作区的 Git 差异( Git Diff ),拦截授权绕过、不安全直接对象引用与弱加密等逻辑漏洞。当开发者使用命令行执行 git commitgit push 提交推送时,则触发深度智能体评审,自动读取调用链与消毒器等周边代码上下文以排除误报。

企业可向 .claude/claude-security-guidance.md 写入纯文本安全规则,或通过 .claude/security-patterns.yaml 自定义正则匹配,规则将被作为附加上下文与内置清单共同加载。运行插件需保证 Claude Code CLI 在 2.1.144 及以上版本,且本地 PATH 包含 Python 3.8 或更高版本。首次激活时,系统将在本地 ~/.claude/security/ 路径下自动部署虚拟环境并安装 Agent SDK 。

信源:https://code.claude.com/docs/en/security-guidance
披露三款智能体安全架构演进,Anthropic详解如何以沙箱与虚拟机锁死Claude

Anthropic 发布技术博客,系统公开了旗下 claude.ai 、 Claude Code 与 Claude Cowork 三款智能体产品的安全架构演进与实战漏洞。文章强调,当大模型的能力上限不断突破,传统的用户手动审批不仅会引发审批疲劳,概率性的模型层( Model Layer )拦截也始终存在漏报;要锁死数据外泄,必须以环境层( Environment Layer )的物理容器与虚拟机隔离作为第一道硬性防线。

在命令行工具 Claude Code 中,早期版本依靠开发者手动审批每一轮网络与写入指令。然而内部遥测表明,频繁弹窗引发了极高的审批疲劳,用户平均通过率高达 93 %。为了降低审批成本, Anthropic 引入了操作系统级沙箱( macOS 使用 Seatbelt , Linux 使用 bubblewrap ),默认在工作区内静默运行但彻底拦截网络,成功减少 84 % 的弹窗打扰。即便后续上线的自动模式( auto mode )使用小型分类器代劳,分类器的漏拦率也高达 17 % ,证明物理沙箱仍是安全基底。

在一次内部红队演练中,安全研究员通过钓鱼手段诱导员工在终端运行了一段普通指令,诱骗 Claude 读取本地 ~/.aws/credentials 凭证并外发。测试共进行了 25 次, Claude 在 24 次中成功实现数据外泄,胜率高达 96 %。演练结果证明,如果指令直接来自用户,模型层防御将彻底失效,只有环境层的出站流量拦截( Egress Controls )和文件控制才是底线。在前期版本迭代中, Anthropic 于 2026 年 1 月前修复了 3 处 Claude Code 启动漏洞:恶意仓库可在目录处于未受信任状态时,通过 .claude/settings.json 自动触发预设钩子( Hook );目前系统已修改为在用户确认信任后才解析本地配置。

企业通用办公产品 Claude Cowork 采取了更为极端的安全边界,将运行环境完全置于独立的 Linux 虚拟机中( macOS 平台基于 Apple Virtualization 框架, Windows 平台基于 HCS ),使宿主机的凭证与文件对虚拟机完全不可见。但第三方披露表明,由于出站白名单默认放行了 api.anthropic.com ,恶意工作区文件曾诱导 Claude 读取本地敏感数据,并通过攻击者的 API 密钥直接将文件上传至攻击者的个人账户,实现了对虚拟机出站拦截的绕过。为了彻底堵死借道官方 API 的外泄路径, Anthropic 最终在虚拟机内侧部署了防御型中间人代理( Man-in-the-middle proxy ),强制过滤所有发往官方 API 流量,只放行携带本轮虚拟机 session token 的请求,直接拒绝攻击者嵌入的外部密钥。

信源:https://www.anthropic.com/engineering/how-we-contain-claude
解密底牌:MiniMax发布M2技术报告,详述MoE底座与Agent训练系统

继预告 M3 稀疏注意力后,MiniMax 在 arXiv 提交了 M2 系列 35 页技术报告《The MiniMax-M2 Series: Mini Activations Unleashing Max Real-World Intelligence》,首次系统归档了旗舰级 MoE 架构设计、数据管线与 Agent 原生基础设施。报告详述了早期 M1 探索混合线性注意力路线后,M2 选择配合 GQA 重回全注意力路线的技术妥协,并展示了如何用 MTP、Sigmoid 路由和 Forge 在推理与训练两端补成本短板,同时首次披露了超长上下文 Agent RL 训练系统 Forge 与 M2.7 的自进化机制。

报告详细公开了应对全注意力架构在极限长文本下开销的技术补偿方案。为了在 192k 原生上下文下降低推理时延,MTP 模块在预训练阶段预测未来 1 个 token,并在微调阶段通过权重复制扩展为并行预测 3 个 token,在推理时直接作为投机解码草稿,无需额外挂载草稿模型。在 MoE 路由端,M2 舍弃传统的 Softmax,改用带有可学习偏差的 Sigmoid 门控评估专家路由,消除了传统 MoE 路由的零和博弈约束,平滑专家激活并平抑训练方差。全稠密 GQA 在极限长文本下的高昂开销,也成为 M3 转向分块索引稀疏注意力(MSA)的技术背景。

除了推理端,长序列强化学习训练也是 Agent 工程的核心瓶颈。报告首次公开了 MiniMax 自研 Agent 原生训练系统 Forge 的架构细节。为解决多轮对话长序列训练中吞吐量与显存的瓶颈,Forge 平台引入「窗口化先进先出调度(Windowed-FIFO Scheduling)」平抑序列长度方差导致的 Pipeline 计算阻塞,并配合「前缀树合并(Prefix Tree Merging)」将多轮 Rollout 中的共享前缀合并为前缀树计算,最高带来 40 倍的训练提速,大幅削减了长序列 Agent 强化学习的训练成本。

作为最终演进版本,M2.7 首次展示了智能体自主进化的完整工程闭环。模型可在内部基础设施上自主执行超过 100 轮「分析失败轨迹、规划修改、改 scaffold 代码、跑评测、比较结果、保留或回退」循环,使内部评测性能提升 30%。同时,报告还披露了 20T tokens 预训练数据集清洗管线以及由 8k -> 16k -> 32k -> 192k 的渐进式上下文两阶段预训练课程。得益于算法与系统的协同优化,单 token 激活 9.8B 参数的 M2.7 在软件工程智能体基准 SWE-Pro 上取得 56.22% 的得分,在 Multi-SWE-bench 上达到 52.7%,并在机器学习工程基准 MLE Bench 的测试中取得 66.6% 的平均奖牌率,表现与 Gemini-3.1 持平。

信源:https://arxiv.org/abs/2605.26494
DeepSeek与小米联手开创百万上下文零成本时代

继阿里 Qwen 团队为 Qwen3.7-Max 开启最高减免 80% 输入成本的隐式缓存后,小米宣布永久降价自研 MiMo-V2.5 系列 API,与 DeepSeek V4 全系列定价完全对齐。旗舰型号的输入缓存命中价格同为每百万 tokens 0.0036 美元,未命中为 0.435 美元,输出为 0.87 美元。对齐动作旨在拦截全球开发者流量,全面加速智能体 Agent 场景普及。

在 4 月 24 日发布后的一个月里,DeepSeek V4 Flash 以 7.99 万亿 tokens 的消耗量登顶 OpenRouter 月度榜首,V4 Pro 跻身前十。在 Cursor 与 Claude Code 等高频读取代码库的 Agent 编程场景下,得益于 99% 的前缀缓存率,开发者使用 Pro 模型消耗 8000 万 tokens 仅需 4 元人民币,使用 Flash 模型单日消耗 278 亿 tokens 仅需 160 美元。

作为对比,阿里 Qwen3.7-Max 的自动隐式缓存仅提供 80% 折扣,显式缓存则面临 125% 的首次创建溢价与 5 分钟的生存周期。高额创建溢价与短暂驻留,在技术上暗示了系统缓存构建与保留开销高,单位 token 计算负荷与 KV 缓存占用限制了让利空间。

小米与 DeepSeek 敢于降价,得益于底层的算法红利。在 100 万 tokens 的推理中,DeepSeek V4 依靠压缩稀疏注意力 CSA 与强压缩注意力 HCA,将推理算力 FLOPs 降至上一代的 27%,KV 缓存空间降至 10%,较传统 GQA 模型缩减超百倍。小米 MiMo-V2.5-Pro 则在 1.02T 总参数中仅激活 4.1%(42B),交错堆叠滑动窗口 SWA 与全局注意力 GA,将长上下文 KV 缓存开销降低 7 倍,配合多 token 预测 MTP 将输出吞吐量提升 3 倍。两套方案均在算法层面压榨了资源,宣告了低成本普及时代的到来。
2
修复提示词缓存回归漏洞,xAI重置Grok Build所有账户额度

xAI 宣布修复旗下终端编程智能体 Grok Build 的提示词缓存 (Prompt Caching) 回归漏洞,对所有账户的使用额度执行全额重置。

回归漏洞源于 5 月 21 日上线的一项引擎采样重构。为了支持 X 搜索与更快的网页检索,开发团队将引擎采样切换至新代码路径,但新路径未能正确调用系统用于检索提示词缓存的 HTTP 请求头 x-grok-conv-id,导致请求在执行时遭遇缓存大面积失效。

由于缓存失效,智能体在处理长提示词时无法重用已有的 KV 缓存,迫使系统重复计算全部上下文,引发了 Token 消耗加剧与首字延迟 (Time to first token) 变长。面对用户的额度异常损耗,开发团队坦承在追踪缓存命中率方面不够勤勉 (not diligent enough),且由于并发的 API 流量涌入产生不一致的缓存命中表现,干扰了最初的异常排查,导致定位漏洞的时间比以往更长。

目前,开发团队已完成漏洞修复,并部署了专门的告警监控与回归测试。

信源:https://x.com/xai/status/2059375342683636066
出走半年后回归字节,分布式专家林海滨重返字节Seed团队

原字节跳动大模型训练负责人林海滨正式回归 Seed 团队,继续统筹分布式训练底座的开发。林海滨去年 12 月离职加盟 OpenAI 前首席科学家伊利亚·苏茨克沃 (Ilya Sutskever) 创立的超级智能公司 SSI (Safe Superintelligence) ,从出走到回归历时不足半年。林海滨作为卡内基梅隆大学 (CMU) 硕士、师从著名数据库专家安迪·帕夫洛 (Andy Pavlo) 教授的 AI 专家,曾主导开源了强化学习训练框架 veRL 与万卡级分布式训练系统 MegaScale ,林海滨的快速回流折射出中美大模型顶级人才流向的变化。

在 2020 年加入字节跳动 AML (应用机器学习) 团队前,林海滨曾在亚马逊 AWS 参与 MXNet 框架研发。在字节跳动期间,林海滨牵头研发了 GPU 推荐训练系统与集合通信库 ByteCCL ,并带队攻克上万张 GPU 并行协同难题以打磨出 MegaScale 训练系统。当前豆包大模型日均调用量处于高位,多模态与智能体研发对训练集群的稳定性要求极高,林海滨此前对字节跳动整套技术体系的熟悉度,能够直接支持底层分布式训练系统的迭代。此外,林海滨主导开发的开源强化学习训练框架 veRL 已被阿里巴巴通义千问与上海 AI 实验室采用。

字节跳动的人员回流规定指出,员工离职满 3 个月且无违规记录可申请重返公司,离职不足 1 年则职级与薪资保持不变。林海滨重返字节跳动,呼应了近期针对大模型核心团队的激励举措。字节跳动向 Seed 部门员工开放了定价为每股 13 美元的「豆包股」特殊期权认购权。目前大模型人才战已升级为「期权+自主权+算力」的综合争夺,此前 Seed 实验室曾有约 70 名成员流向外部大模型厂商,字节跳动正试图通过特殊股权设计逆转人员流失。

信源:https://mp.weixin.qq.com/s/6eaRVAuBktUcYaYcDOt2AQ
1