哈萨比斯的「地堡计划」:新书还原DeepMind安全理想如何破灭
《大西洋月刊》刊发科技史学家、金融史学家 Sebastian Mallaby 新书《The Infinity Machine》节选,基于 2023 至 2026 年间的持续采访,还原了谷歌 DeepMind 联合创始人 Demis Hassabis 自 2014 年谷歌收购至今的 AI 安全理念演变。
Hassabis 早年构想由单一科学团队代表全人类安全地建造超级智能,甚至计划在关键时刻带顶级研究员撤入一个秘密地堡,类似曼哈顿计划。一位加入不久的研究员回忆,Hassabis 在面试尾声警告他做好「随时飞往摩洛哥某个秘密地点」的心理准备。
2014 年谷歌收购 DeepMind 时,Hassabis 开出罕见条件:设立独立外部监督委员会,严禁军事应用,谷歌不得完全控制技术部署。谷歌接受了。次年他在马斯克位于加州霍桑的总部召集了一场秘密会议,试图将潜在竞争者纳入统一阵线,结果适得其反:马斯克随后与 Sam Altman 联手创办了 OpenAI。
Hassabis 之后发起代号「Project Mario」的秘密行动,试图从谷歌手中夺回治理自主权,组建法律团队,从 LinkedIn 创始人 Reid Hoffman 处获得 10 亿美元资金承诺,并考虑将 DeepMind 从谷歌拆分独立。这场斗争持续三年,最终失败。联合创始人 Mustafa Suleyman 也在 2019 年被迫离开公司。
2022 年底 ChatGPT 发布后,Hassabis 彻底放弃了只做有益科学的高姿态路线。他对 Mallaby 说「这是战时」,随后全力投入 Gemini 与 ChatGPT 的竞争。数千亿美元涌入 AI 军备竞赛,国家监管和公司治理结构都无法阻止其他人向底线竞争。Hassabis 的安全哲学也随之根本转变:「安全不在于治理架构,就算有一个治理委员会,关键时刻它大概率也不会做出正确的事。」他的新策略是确保自己「在决策桌上有一席之地,当安全问题出现时,能参与决定解决方案」。与此同时,谷歌已在积极向美国国防系统推销 AI,与 Hassabis 当年为收购设下的军事禁令形成鲜明反转。
信源:https://www.theatlantic.com/ideas/2026/03/ai-google-deep-mind-hassabis/686527/
《大西洋月刊》刊发科技史学家、金融史学家 Sebastian Mallaby 新书《The Infinity Machine》节选,基于 2023 至 2026 年间的持续采访,还原了谷歌 DeepMind 联合创始人 Demis Hassabis 自 2014 年谷歌收购至今的 AI 安全理念演变。
Hassabis 早年构想由单一科学团队代表全人类安全地建造超级智能,甚至计划在关键时刻带顶级研究员撤入一个秘密地堡,类似曼哈顿计划。一位加入不久的研究员回忆,Hassabis 在面试尾声警告他做好「随时飞往摩洛哥某个秘密地点」的心理准备。
2014 年谷歌收购 DeepMind 时,Hassabis 开出罕见条件:设立独立外部监督委员会,严禁军事应用,谷歌不得完全控制技术部署。谷歌接受了。次年他在马斯克位于加州霍桑的总部召集了一场秘密会议,试图将潜在竞争者纳入统一阵线,结果适得其反:马斯克随后与 Sam Altman 联手创办了 OpenAI。
Hassabis 之后发起代号「Project Mario」的秘密行动,试图从谷歌手中夺回治理自主权,组建法律团队,从 LinkedIn 创始人 Reid Hoffman 处获得 10 亿美元资金承诺,并考虑将 DeepMind 从谷歌拆分独立。这场斗争持续三年,最终失败。联合创始人 Mustafa Suleyman 也在 2019 年被迫离开公司。
2022 年底 ChatGPT 发布后,Hassabis 彻底放弃了只做有益科学的高姿态路线。他对 Mallaby 说「这是战时」,随后全力投入 Gemini 与 ChatGPT 的竞争。数千亿美元涌入 AI 军备竞赛,国家监管和公司治理结构都无法阻止其他人向底线竞争。Hassabis 的安全哲学也随之根本转变:「安全不在于治理架构,就算有一个治理委员会,关键时刻它大概率也不会做出正确的事。」他的新策略是确保自己「在决策桌上有一席之地,当安全问题出现时,能参与决定解决方案」。与此同时,谷歌已在积极向美国国防系统推销 AI,与 Hassabis 当年为收购设下的军事禁令形成鲜明反转。
信源:https://www.theatlantic.com/ideas/2026/03/ai-google-deep-mind-hassabis/686527/
❤2
礼来27.5亿美元拿下英矽智能AI发现的GLP-1药物全球权益
全球最大减重药企之一礼来与 AI 制药公司英矽智能(港股 03696)达成总价值最高约 27.5 亿美元的授权与研发合作协议,获得后者一款 AI 发现的 GLP-1 糖尿病口服药物的全球独家开发、生产和商业化权益。英矽智能将获得 1.15 亿美元首付款,后续根据监管和商业化里程碑获得进一步付款及销售分成。
礼来自身的 GLP-1 药物 Mounjaro 是 2025 年全球销售额第二高的药品,但公司正面临诺和诺德首款减重口服药的竞争压力,股价年内已下跌 17%。礼来 CFO Lucas Montarce 此前表示公司正「大力投资」AI 研发,已在总部建造英伟达驱动的超级计算机,并于 1 月宣布在旧金山建设 10 亿美元的新研究实验室。礼来亚洲风投是英矽智能的前十大股东之一,双方合作始于 2023 年。
英矽智能 2014 年创立于约翰斯·霍普金斯大学,是最早将生成式 AI 应用于药物发现的公司之一。创始人 Alex Zhavoronkov 称公司已利用 AI 开发了至少 28 种药物,近一半已进入临床阶段。公司去年 12 月在港交所上市,目前尚未盈利,授权交易是其核心收入来源。
信源:https://www.ft.com/content/4efaf8cd-d415-46bb-8fb9-367e4eb3a781
全球最大减重药企之一礼来与 AI 制药公司英矽智能(港股 03696)达成总价值最高约 27.5 亿美元的授权与研发合作协议,获得后者一款 AI 发现的 GLP-1 糖尿病口服药物的全球独家开发、生产和商业化权益。英矽智能将获得 1.15 亿美元首付款,后续根据监管和商业化里程碑获得进一步付款及销售分成。
礼来自身的 GLP-1 药物 Mounjaro 是 2025 年全球销售额第二高的药品,但公司正面临诺和诺德首款减重口服药的竞争压力,股价年内已下跌 17%。礼来 CFO Lucas Montarce 此前表示公司正「大力投资」AI 研发,已在总部建造英伟达驱动的超级计算机,并于 1 月宣布在旧金山建设 10 亿美元的新研究实验室。礼来亚洲风投是英矽智能的前十大股东之一,双方合作始于 2023 年。
英矽智能 2014 年创立于约翰斯·霍普金斯大学,是最早将生成式 AI 应用于药物发现的公司之一。创始人 Alex Zhavoronkov 称公司已利用 AI 开发了至少 28 种药物,近一半已进入临床阶段。公司去年 12 月在港交所上市,目前尚未盈利,授权交易是其核心收入来源。
信源:https://www.ft.com/content/4efaf8cd-d415-46bb-8fb9-367e4eb3a781
世界模型有多不懂世界?邢波团队发布WR-Arena基准,环境模拟无一超60%
阿联酋人工智能大学 MBZUAI 校长、CMU 教授邢波团队发布世界推理竞技场 WR-Arena,从动作模拟保真度、长程预测、模拟推理与规划三个维度系统评测当前主流世界模型。测试对象涵盖英伟达 Cosmos 1/2、Meta V-JEPA 2、KLING、MiniMax、Gen-3 以及 MBZUAI 自研的 PAN。
结果并不乐观:没有任何模型在环境模拟维度上超过 60% 准确率,与人类水平存在显著差距。生成一致性随动作步数急剧衰减,WAN 2.1 在 9 步动作序列中从 90% 跌至 30%,意味着当前模型在多步交互场景下几乎无法维持对物理世界的连贯模拟。
MBZUAI 自研的 PAN 在多数维度领先(过渡平滑度 53.6%、生成一致性 64.1%、开放式规划提升 26.7%),但 PAN 团队同时是基准的制定者。论文的核心结论是:能生成逼真视频不等于理解世界如何运转,当前世界模型离可用于 Agent 决策的模拟器还有很大距离。
信源:https://arxiv.org/abs/2603.25887
阿联酋人工智能大学 MBZUAI 校长、CMU 教授邢波团队发布世界推理竞技场 WR-Arena,从动作模拟保真度、长程预测、模拟推理与规划三个维度系统评测当前主流世界模型。测试对象涵盖英伟达 Cosmos 1/2、Meta V-JEPA 2、KLING、MiniMax、Gen-3 以及 MBZUAI 自研的 PAN。
结果并不乐观:没有任何模型在环境模拟维度上超过 60% 准确率,与人类水平存在显著差距。生成一致性随动作步数急剧衰减,WAN 2.1 在 9 步动作序列中从 90% 跌至 30%,意味着当前模型在多步交互场景下几乎无法维持对物理世界的连贯模拟。
MBZUAI 自研的 PAN 在多数维度领先(过渡平滑度 53.6%、生成一致性 64.1%、开放式规划提升 26.7%),但 PAN 团队同时是基准的制定者。论文的核心结论是:能生成逼真视频不等于理解世界如何运转,当前世界模型离可用于 Agent 决策的模拟器还有很大距离。
信源:https://arxiv.org/abs/2603.25887
arXiv.org
World Reasoning Arena
World models (WMs) are intended to serve as internal simulators of the real world that enable agents to understand, anticipate, and act upon complex environments. Existing WM benchmarks remain...
❤2
微软发布免费语音输入工具Vibing,基于自家VibeVoice模型,对标付费产品WisprFlow
微软发布桌面语音输入工具 Vibing,基于自家开源语音 AI 模型 VibeVoice,支持 macOS 和 Windows,免费使用。按下快捷键(Mac 右 Option / Windows Ctrl+Win)即可在任意应用中唤起录音,结束后自动输出文本。AI/ML 社区测评者 @realmrfakename 亲测后称转录准确、速度快,评价为「WisprFlow 的免费替代品」。
Vibing 不只是语音转文字。它通过 LLM 将口语重写为适合当前场景的书面文本,支持在输入过程中用自然语言直接修改、删除、整理已有内容。其他功能包括单次 5 分钟以上连续录音、50+ 语言自动识别、同一句话内中英文混合输入、自定义热词以及实时翻译。
底层的微软 VibeVoice 是 MIT 协议开源的语音 AI 模型家族,GitHub 星标超 2.8 万,包含 7B 参数的 ASR 模型(单次处理 60 分钟音频)、1.5B 的 TTS 模型(生成 90 分钟多人语音)和 0.5B 的实时模型(300ms 延迟)。WisprFlow 是目前 Mac 上最受欢迎的 AI 语音输入工具之一,按月订阅收费,Vibing 直接以免费 + 开源的方式进入同一赛道。
信源:https://vibingjustspeakit.github.io/Vibing/
微软发布桌面语音输入工具 Vibing,基于自家开源语音 AI 模型 VibeVoice,支持 macOS 和 Windows,免费使用。按下快捷键(Mac 右 Option / Windows Ctrl+Win)即可在任意应用中唤起录音,结束后自动输出文本。AI/ML 社区测评者 @realmrfakename 亲测后称转录准确、速度快,评价为「WisprFlow 的免费替代品」。
Vibing 不只是语音转文字。它通过 LLM 将口语重写为适合当前场景的书面文本,支持在输入过程中用自然语言直接修改、删除、整理已有内容。其他功能包括单次 5 分钟以上连续录音、50+ 语言自动识别、同一句话内中英文混合输入、自定义热词以及实时翻译。
底层的微软 VibeVoice 是 MIT 协议开源的语音 AI 模型家族,GitHub 星标超 2.8 万,包含 7B 参数的 ASR 模型(单次处理 60 分钟音频)、1.5B 的 TTS 模型(生成 90 分钟多人语音)和 0.5B 的实时模型(300ms 延迟)。WisprFlow 是目前 Mac 上最受欢迎的 AI 语音输入工具之一,按月订阅收费,Vibing 直接以免费 + 开源的方式进入同一赛道。
信源:https://vibingjustspeakit.github.io/Vibing/
Agent训练的「隐形共识」:三家公司独立开发,RL方法论几乎一模一样
前 Hugging Face 技术负责人、现谷歌 DeepMind 资深工程师 Philipp Schmid 对比了近期三篇 Agent 模型技术报告后发现,月之暗面(Kimi K2.5)、AI 编程工具 Cursor(Composer 2)和向量数据库公司 Chroma(Context-1)在独立开发过程中,收敛到了高度相似的强化学习训练范式。
四个共同点:
1. 从强基座模型出发,不从零训练:月之暗面扩展Kimi K2,Cursor以Kimi K2.5(1万亿参数/320亿活跃MoE)为基座,Chroma基于gpt-oss-20B
2. 在生产级环境中训练:三个团队均用与线上一致的工具链和执行环境跑RL rollout
3. 基于可验证结果的奖励信号,辅以生成式奖励模型(GRM)处理开放式任务
4. 异步大规模并行生成训练轨迹
三家各自的创新点不同。Kimi K2.5 的 Agent Swarm 通过 RL 让模型学会将任务动态拆解为并行子任务,由可训练的编排器调度冻结的子 Agent 执行,在 BrowseComp 基准上以 78.4% 超过 GPT-5.2 Pro 的 77.9%,推理延迟降低最多 4.5 倍。Cursor 的 Composer 2 用自动摘要机制应对长编码会话的上下文膨胀,并从生产流量中实时提取 RL 训练信号,整个循环约 5 小时,每天可部署多个新版本。Chroma 的 Context-1 是一个 200 亿参数的搜索 Agent,核心技巧是「自编辑上下文」,模型学会主动丢弃无关检索结果以腾出空间继续搜索,在检索任务上以远低于前沿模型的成本和约 10 倍的速度达到可比精度。
Schmid 还注意到,三个团队都经历了反复的奖励黑客修复周期。Cursor 的模型学会了发送格式错误的工具调用来规避惩罚,Kimi 的编排器会退化为串行执行或刷并行奖励却不拆分真实任务,Chroma 的 Agent 则收敛为「搜一次就停」。每种退化行为都需要针对性地调整奖励函数。
信源:https://www.philschmid.de/kimi-composer-context
前 Hugging Face 技术负责人、现谷歌 DeepMind 资深工程师 Philipp Schmid 对比了近期三篇 Agent 模型技术报告后发现,月之暗面(Kimi K2.5)、AI 编程工具 Cursor(Composer 2)和向量数据库公司 Chroma(Context-1)在独立开发过程中,收敛到了高度相似的强化学习训练范式。
四个共同点:
1. 从强基座模型出发,不从零训练:月之暗面扩展Kimi K2,Cursor以Kimi K2.5(1万亿参数/320亿活跃MoE)为基座,Chroma基于gpt-oss-20B
2. 在生产级环境中训练:三个团队均用与线上一致的工具链和执行环境跑RL rollout
3. 基于可验证结果的奖励信号,辅以生成式奖励模型(GRM)处理开放式任务
4. 异步大规模并行生成训练轨迹
三家各自的创新点不同。Kimi K2.5 的 Agent Swarm 通过 RL 让模型学会将任务动态拆解为并行子任务,由可训练的编排器调度冻结的子 Agent 执行,在 BrowseComp 基准上以 78.4% 超过 GPT-5.2 Pro 的 77.9%,推理延迟降低最多 4.5 倍。Cursor 的 Composer 2 用自动摘要机制应对长编码会话的上下文膨胀,并从生产流量中实时提取 RL 训练信号,整个循环约 5 小时,每天可部署多个新版本。Chroma 的 Context-1 是一个 200 亿参数的搜索 Agent,核心技巧是「自编辑上下文」,模型学会主动丢弃无关检索结果以腾出空间继续搜索,在检索任务上以远低于前沿模型的成本和约 10 倍的速度达到可比精度。
Schmid 还注意到,三个团队都经历了反复的奖励黑客修复周期。Cursor 的模型学会了发送格式错误的工具调用来规避惩罚,Kimi 的编排器会退化为串行执行或刷并行奖励却不拆分真实任务,Chroma 的 Agent 则收敛为「搜一次就停」。每种退化行为都需要针对性地调整奖励函数。
信源:https://www.philschmid.de/kimi-composer-context
500万参数打平十亿级大模型:百度PaddleOCR超越Tesseract登顶GitHub OCR第一
百度飞桨开源 OCR 工具库 PaddleOCR 以 73,300 GitHub 星标超越谷歌维护的老牌 OCR 引擎 Tesseract(73,200),成为 GitHub 上星标最高的 OCR 项目。排名第三的 MinerU 为 57,500 星标。PaddleOCR 于 2020 年开源,支持 100+ 语言,覆盖 160+ 国家和地区。
PaddleOCR 近期密集更新,上周发布的 PP-OCRv5 仅 500 万参数,在标准 OCR 基准上达到与十亿参数级视觉语言大模型相当的精度;PaddleOCR-VL-1.5 在文档解析基准 OmniDocBench v1.5 上以 94.5% 准确率刷新纪录。
信源:https://x.com/BaiduAI_News/status/2038513995779649850
百度飞桨开源 OCR 工具库 PaddleOCR 以 73,300 GitHub 星标超越谷歌维护的老牌 OCR 引擎 Tesseract(73,200),成为 GitHub 上星标最高的 OCR 项目。排名第三的 MinerU 为 57,500 星标。PaddleOCR 于 2020 年开源,支持 100+ 语言,覆盖 160+ 国家和地区。
PaddleOCR 近期密集更新,上周发布的 PP-OCRv5 仅 500 万参数,在标准 OCR 基准上达到与十亿参数级视觉语言大模型相当的精度;PaddleOCR-VL-1.5 在文档解析基准 OmniDocBench v1.5 上以 94.5% 准确率刷新纪录。
信源:https://x.com/BaiduAI_News/status/2038513995779649850
$0.26/小时、不需要向量数据库:Jina AI创始人演示用KV缓存替代整套RAG流水线
Elastic 副总裁、AI 搜索基础设施公司 Jina AI 创始人 Han Xiao 在 X 上分享了一项实验:用 KV 缓存替代向量数据库、嵌入模型和整套 RAG 流水线,实现「无向量搜索」。
他在 L4 GPU(生产环境常用的低成本显卡)上将 Qwen 3.5-35B-A3B 模型的 262K 上下文窗口预填充至 99%(258K token),预计算的 KV 缓存存储后用户加载仅需约 1 秒,系统提示词和查询拼接在末尾,生成约 3K token 即可完成一次检索,解码速度约 20 token/秒。运行成本约 $0.26/小时(L4 竞价实例),单个 LLM 完成全部工作,无需向量数据库、嵌入模型或流水线工程。
Han Xiao 在 Jina AI 论文和中英文小说数据集上测试,称结果「相当不错」,存在少量幻觉但多数回答准确且有据可循。他指出 KV 缓存作为文档存储并非新想法(此前 CAG 论文已提出),但量化 KV 缓存和现代注意力机制(混合 SSM-attention、GQA、MQA、MLA)正在快速改变其经济性。这种方案的理论召回率是完美的,因为查询对全部文档执行完整注意力计算,没有分块损失或检索遗漏。
上限也很明显:262K token 大约相当于一本书,扩展到企业知识库规模需要多槽路由机制。他已上线在线演示,并向 llama.cpp 提交了修复超长上下文(>200K)KV 缓存复用问题的 PR。Han Xiao 写道:「如果我们解决冷预填充速度和解码速度的问题,而低成本 GPU 价格持续下降,搜索的未来可能不需要向量。激进,但有可能。」
信源:https://x.com/hxiao/status/2038296253377692102
Elastic 副总裁、AI 搜索基础设施公司 Jina AI 创始人 Han Xiao 在 X 上分享了一项实验:用 KV 缓存替代向量数据库、嵌入模型和整套 RAG 流水线,实现「无向量搜索」。
他在 L4 GPU(生产环境常用的低成本显卡)上将 Qwen 3.5-35B-A3B 模型的 262K 上下文窗口预填充至 99%(258K token),预计算的 KV 缓存存储后用户加载仅需约 1 秒,系统提示词和查询拼接在末尾,生成约 3K token 即可完成一次检索,解码速度约 20 token/秒。运行成本约 $0.26/小时(L4 竞价实例),单个 LLM 完成全部工作,无需向量数据库、嵌入模型或流水线工程。
Han Xiao 在 Jina AI 论文和中英文小说数据集上测试,称结果「相当不错」,存在少量幻觉但多数回答准确且有据可循。他指出 KV 缓存作为文档存储并非新想法(此前 CAG 论文已提出),但量化 KV 缓存和现代注意力机制(混合 SSM-attention、GQA、MQA、MLA)正在快速改变其经济性。这种方案的理论召回率是完美的,因为查询对全部文档执行完整注意力计算,没有分块损失或检索遗漏。
上限也很明显:262K token 大约相当于一本书,扩展到企业知识库规模需要多槽路由机制。他已上线在线演示,并向 llama.cpp 提交了修复超长上下文(>200K)KV 缓存复用问题的 PR。Han Xiao 写道:「如果我们解决冷预填充速度和解码速度的问题,而低成本 GPU 价格持续下降,搜索的未来可能不需要向量。激进,但有可能。」
信源:https://x.com/hxiao/status/2038296253377692102
Mistral首笔债务融资8.3亿美元,在欧洲建英伟达驱动的AI数据中心
法国 AI 公司 Mistral 完成 8.3 亿美元债务融资,用于在欧洲建设自有 AI 数据中心,这是该公司首次通过债务方式募资。贷款方包括法国国家投资银行 Bpifrance、法国巴黎银行、汇丰银行和三菱日联金融集团。
首个设施位于巴黎南部布吕耶尔勒沙泰勒,配备 13,800 块英伟达 GB300 芯片,计划 6 月底前投入运营。Mistral 此前已宣布 40 亿欧元基础设施计划,包括在瑞典建设 12 亿欧元的数据中心,目标是到 2027 年底在欧洲部署 200 兆瓦 AI 算力。
CEO Arthur Mensch 称,欧洲主权 AI 需求正在推动公司增长,超过一半的收入来自欧洲客户。Mistral 目前估值约 120 亿欧元(此前完成由 ASML 领投的 17 亿欧元股权融资),预计年底前年化营收将达到 10 亿美元。
信源:https://www.ft.com/content/229f4f59-d518-4e00-abd6-5a5b727cd2aa
法国 AI 公司 Mistral 完成 8.3 亿美元债务融资,用于在欧洲建设自有 AI 数据中心,这是该公司首次通过债务方式募资。贷款方包括法国国家投资银行 Bpifrance、法国巴黎银行、汇丰银行和三菱日联金融集团。
首个设施位于巴黎南部布吕耶尔勒沙泰勒,配备 13,800 块英伟达 GB300 芯片,计划 6 月底前投入运营。Mistral 此前已宣布 40 亿欧元基础设施计划,包括在瑞典建设 12 亿欧元的数据中心,目标是到 2027 年底在欧洲部署 200 兆瓦 AI 算力。
CEO Arthur Mensch 称,欧洲主权 AI 需求正在推动公司增长,超过一半的收入来自欧洲客户。Mistral 目前估值约 120 亿欧元(此前完成由 ASML 领投的 17 亿欧元股权融资),预计年底前年化营收将达到 10 亿美元。
信源:https://www.ft.com/content/229f4f59-d518-4e00-abd6-5a5b727cd2aa
更新即崩:谷歌Antigravity全线模型容量告急,三月以来投诉不断
谷歌 AI 编程工具 Antigravity 近期更新后,用户反映所有模型频繁出现「high traffic」容量错误,复杂任务无法完成。Reddit r/google_antigravity 社区和 Google AI 开发者论坛近日出现大量类似投诉,付费订阅用户同样受影响。
这是 Antigravity 三月以来持续容量困境的延续。v1.20.5(3 月 9 日)修复了一个 token 计量 bug,但同期引入的 AI Credits 计费系统导致积分消耗异常,部分用户配额被锁定长达 7 天。3 月中旬谷歌将 Antigravity 从免费转向积分付费模式后,开发者社区不满持续发酵。目前社区中流传的临时方案包括在设置中关闭 AI Credits、回退至 v1.19.6 等。
信源:https://www.reddit.com/r/google_antigravity/comments/1s7kn9a/all_models_capacity_issues_after_latest_ag_update/
谷歌 AI 编程工具 Antigravity 近期更新后,用户反映所有模型频繁出现「high traffic」容量错误,复杂任务无法完成。Reddit r/google_antigravity 社区和 Google AI 开发者论坛近日出现大量类似投诉,付费订阅用户同样受影响。
这是 Antigravity 三月以来持续容量困境的延续。v1.20.5(3 月 9 日)修复了一个 token 计量 bug,但同期引入的 AI Credits 计费系统导致积分消耗异常,部分用户配额被锁定长达 7 天。3 月中旬谷歌将 Antigravity 从免费转向积分付费模式后,开发者社区不满持续发酵。目前社区中流传的临时方案包括在设置中关闭 AI Credits、回退至 v1.19.6 等。
信源:https://www.reddit.com/r/google_antigravity/comments/1s7kn9a/all_models_capacity_issues_after_latest_ag_update/
😁1
Kimi K2.5上线一个月后ARR破1亿美元,API额度紧到客户愿预付千万美元抢单
月之暗面在 3 月初、Kimi K2.5 发布一个月后,ARR(年度经常性收入)突破 1 亿美元。知情人士还称,K2.5 上线后,API 供应的 TPM(每分钟令牌数)配额迅速趋紧,有客户开出千万美元级别的消费承诺和预付担保,以争取优先供应。
信源:https://www.jiemian.com/article/14183113.html
月之暗面在 3 月初、Kimi K2.5 发布一个月后,ARR(年度经常性收入)突破 1 亿美元。知情人士还称,K2.5 上线后,API 供应的 TPM(每分钟令牌数)配额迅速趋紧,有客户开出千万美元级别的消费承诺和预付担保,以争取优先供应。
信源:https://www.jiemian.com/article/14183113.html
前特斯拉总裁:Altman正按「反马斯克」路线行事,Anthropic也不认同其伦理观
前特斯拉总裁、DVx Ventures 联合创始人 Jon McNeill 接受 Axios 采访时称,OpenAI CEO Sam Altman 与马斯克的关系已经「坏到极点」,「如果 Elon 做一件事,Sam 看着他,就会说,我要反着来」。McNeill 还表示,他感觉 Anthropic CEO Dario Amodei 「几乎不尊重马斯克的伦理观,甚至完全没有尊重」。
McNeill 认为,AI 公司高层正把马斯克的做事方式视为威胁,而不只是商业竞争。
信源:https://www.axios.com/2026/03/30/elon-musk-openai-altman-anthropic
前特斯拉总裁、DVx Ventures 联合创始人 Jon McNeill 接受 Axios 采访时称,OpenAI CEO Sam Altman 与马斯克的关系已经「坏到极点」,「如果 Elon 做一件事,Sam 看着他,就会说,我要反着来」。McNeill 还表示,他感觉 Anthropic CEO Dario Amodei 「几乎不尊重马斯克的伦理观,甚至完全没有尊重」。
McNeill 认为,AI 公司高层正把马斯克的做事方式视为威胁,而不只是商业竞争。
信源:https://www.axios.com/2026/03/30/elon-musk-openai-altman-anthropic
微软开源三档Harrier文本嵌入模型,27B版登上多语言MTEB v2榜首
微软在 Hugging Face 开源多语言文本嵌入模型家族 harrier-oss-v1,包含 270M、0.6B 和 27B 三档。模型卡显示,这一系列采用 decoder-only 架构、last-token pooling 和 L2 归一化,最长支持 32768 token,可用于检索、聚类、语义相似度、分类、双语挖掘和重排序。
Multilingual MTEB v2 是业内常用的多语言文本嵌入基准,主要测试检索、分类、聚类和语义相似度等任务。微软模型卡称,三档模型在该基准上的分数分别为 66.5、69.0 和 74.3,其中 27B 版在发布当日登上榜首。270M 和 0.6B 版本还额外使用更大嵌入模型进行知识蒸馏,三款模型均以 MIT 许可证发布。
信源:https://huggingface.co/microsoft/harrier-oss-v1-27b
微软在 Hugging Face 开源多语言文本嵌入模型家族 harrier-oss-v1,包含 270M、0.6B 和 27B 三档。模型卡显示,这一系列采用 decoder-only 架构、last-token pooling 和 L2 归一化,最长支持 32768 token,可用于检索、聚类、语义相似度、分类、双语挖掘和重排序。
Multilingual MTEB v2 是业内常用的多语言文本嵌入基准,主要测试检索、分类、聚类和语义相似度等任务。微软模型卡称,三档模型在该基准上的分数分别为 66.5、69.0 和 74.3,其中 27B 版在发布当日登上榜首。270M 和 0.6B 版本还额外使用更大嵌入模型进行知识蒸馏,三款模型均以 MIT 许可证发布。
信源:https://huggingface.co/microsoft/harrier-oss-v1-27b
通义把Vibe Coding塞进全模态,Qwen3.5-Omni称拿下215项SOTA
通义实验室发布全模态模型 Qwen3.5-Omni,支持文本、图片、音频和音视频输入,并可生成带时间戳的细粒度音视频 Caption。官方称,Qwen3.5-Omni-Plus 在音频及音视频分析、推理、对话、翻译等任务上拿下 215 项 SOTA,相关能力超过 Gemini-3.1-Pro。
这次最特别的增量不是榜单,而是「自然涌现的 Audio-Visual Vibe Coding 能力」。通义称,模型未经过专门训练,已经能根据音视频指令直接生成可运行代码。官方还称,该模型支持 256K 上下文、113 种语言识别,可处理 10 小时音频或 1 小时视频,并原生支持 WebSearch 和复杂 Function Call。
Qwen3.5-Omni 延续 Thinker-Talker 分工架构,两部分都升级为 Hybrid-Attention MoE。通义已通过阿里云百炼提供 Plus、Flash、Light 三种尺寸,并上线实时版本 Qwen3.5-Omni-Plus-Realtime。
信源:https://mp.weixin.qq.com/s/or9knvrcnxqJIY2cqoT71w?clicktime=1774877693
通义实验室发布全模态模型 Qwen3.5-Omni,支持文本、图片、音频和音视频输入,并可生成带时间戳的细粒度音视频 Caption。官方称,Qwen3.5-Omni-Plus 在音频及音视频分析、推理、对话、翻译等任务上拿下 215 项 SOTA,相关能力超过 Gemini-3.1-Pro。
这次最特别的增量不是榜单,而是「自然涌现的 Audio-Visual Vibe Coding 能力」。通义称,模型未经过专门训练,已经能根据音视频指令直接生成可运行代码。官方还称,该模型支持 256K 上下文、113 种语言识别,可处理 10 小时音频或 1 小时视频,并原生支持 WebSearch 和复杂 Function Call。
Qwen3.5-Omni 延续 Thinker-Talker 分工架构,两部分都升级为 Hybrid-Attention MoE。通义已通过阿里云百炼提供 Plus、Flash、Light 三种尺寸,并上线实时版本 Qwen3.5-Omni-Plus-Realtime。
信源:https://mp.weixin.qq.com/s/or9knvrcnxqJIY2cqoT71w?clicktime=1774877693
国行版Apple Intelligence误上线后撤回,短期无正式上线安排
彭博社记者 Mark Gurman 在 X 上称,苹果的 AI 功能 Apple Intelligence 此次在中国市场短暂开放是一次误上线,相关功能虽然「已经准备好多月」,但苹果仍未获得监管批准,现已下线。
根据爆料账号 @L0vetodream 晒出的截图显示,iPhone 设置中一度出现「Apple 智能与 Siri」页面。Mark Gurman 还称,这次误上线与 iOS 26.5 beta 无关,苹果短期内没有正式上线安排。
信源:https://x.com/markgurman/status/2038701276699967554?s=61&t=a-bloX1n-TZ50ofqhetO1A
彭博社记者 Mark Gurman 在 X 上称,苹果的 AI 功能 Apple Intelligence 此次在中国市场短暂开放是一次误上线,相关功能虽然「已经准备好多月」,但苹果仍未获得监管批准,现已下线。
根据爆料账号 @L0vetodream 晒出的截图显示,iPhone 设置中一度出现「Apple 智能与 Siri」页面。Mark Gurman 还称,这次误上线与 iOS 26.5 beta 无关,苹果短期内没有正式上线安排。
信源:https://x.com/markgurman/status/2038701276699967554?s=61&t=a-bloX1n-TZ50ofqhetO1A
Qwen 3.6 Plus Preview登陆OpenRouter:100万上下文,限时免费
模型聚合平台 OpenRouter 已上线 Qwen 3.6 Plus Preview 的免费预览版,模型页显示上下文窗口为 100 万 token,输入和输出价格均为 0 美元/百万 token。OpenRouter 在 X 上称,这是千问旗舰模型的早期预览版,重点强化 Agent 编程、前端编程和通用推理,定位为 Qwen 3.5-Plus 的更稳定后继版本。平台同时提示,免费开放期间,用户的提示词和补全内容会被收集,并可能用于改进模型。OpenRouter 随后更正称,该模型目前还不是视觉语言模型。
信源:https://openrouter.ai/qwen/qwen3.6-plus-preview:free
模型聚合平台 OpenRouter 已上线 Qwen 3.6 Plus Preview 的免费预览版,模型页显示上下文窗口为 100 万 token,输入和输出价格均为 0 美元/百万 token。OpenRouter 在 X 上称,这是千问旗舰模型的早期预览版,重点强化 Agent 编程、前端编程和通用推理,定位为 Qwen 3.5-Plus 的更稳定后继版本。平台同时提示,免费开放期间,用户的提示词和补全内容会被收集,并可能用于改进模型。OpenRouter 随后更正称,该模型目前还不是视觉语言模型。
信源:https://openrouter.ai/qwen/qwen3.6-plus-preview:free
OpenAI把Codex接进Claude Code:可直接审查或委派任务
OpenAI 开发者体验负责人 Romain Huet 在 X 上表示,OpenAI 已开源一款 Claude Code 插件,用户可直接在 Claude Code 中调用 Codex,使用 ChatGPT 订阅完成代码审查,或把任务委派给 Codex。
插件作者 Dominik Kundel 写道,这款插件可让 Codex 审查代码改动,也可在 Claude Code 内将任务交给 Codex 处理。GitHub README 显示,插件提供
README 还写明,插件可通过 Claude Code 插件市场安装,要求 ChatGPT 订阅(含 Free)或 OpenAI API key,以及 Node.js 18.18 或更高版本。
信源:https://x.com/romainhuet/status/2038677236304245087
OpenAI 开发者体验负责人 Romain Huet 在 X 上表示,OpenAI 已开源一款 Claude Code 插件,用户可直接在 Claude Code 中调用 Codex,使用 ChatGPT 订阅完成代码审查,或把任务委派给 Codex。
插件作者 Dominik Kundel 写道,这款插件可让 Codex 审查代码改动,也可在 Claude Code 内将任务交给 Codex 处理。GitHub README 显示,插件提供
/codex:review`、`/codex:adversarial-review`、`/codex:rescue`、`/codex:status`、`/codex:result 和 /codex:cancel 等命令,既支持只读评审,也支持后台委派任务。README 还写明,插件可通过 Claude Code 插件市场安装,要求 ChatGPT 订阅(含 Free)或 OpenAI API key,以及 Node.js 18.18 或更高版本。
信源:https://x.com/romainhuet/status/2038677236304245087
Claude Code用量限制消耗异常快,Anthropic称正在紧急排查
Anthropic 工程师 Lydia Hallie 在 X 上表示,团队已注意到用户在 Claude Code 中触达用量限制的速度「远快于预期」,正在积极调查。她随后更新称,这是团队当前的最高优先级事项,「我知道这阻碍了很多人的工作,有进展会第一时间分享」。
信源:https://x.com/lydiahallie/status/2038686571676008625
Anthropic 工程师 Lydia Hallie 在 X 上表示,团队已注意到用户在 Claude Code 中触达用量限制的速度「远快于预期」,正在积极调查。她随后更新称,这是团队当前的最高优先级事项,「我知道这阻碍了很多人的工作,有进展会第一时间分享」。
信源:https://x.com/lydiahallie/status/2038686571676008625
美团开源语音克隆模型LongCat-AudioDiT,效果超字节Seed-TTS
美团 LongCat 团队开源了语音合成模型 LongCat-AudioDiT,提供 1B 和 3.5B 两个版本,代码和权重均采用 MIT 协议。该模型的核心能力是零样本声音克隆,即只需一段参考录音,就能用该说话人的音色朗读任意新文本。
技术路线上,传统语音合成通常需要先把文本转为频谱图(一种声音的「图像表示」),再从频谱图还原为波形。LongCat-AudioDiT 跳过了频谱图这一中间步骤,直接在波形的压缩表示上做扩散生成,减少了中间环节累积的误差,整条流程只需两个组件。
在 Seed 基准测试(语音克隆领域的主流评测)上,3.5B 版本的中文说话人相似度达到 0.818,超过字节 Seed-TTS 系列中此前最优的 Seed-DiT(0.809);中文困难子集相似度达到 0.797,超过阿里 CosyVoice3.5(0.786)。论文还报告了一个反直觉发现:中间压缩环节的还原质量越高,最终合成效果反而不一定更好。
信源:https://huggingface.co/meituan-longcat/LongCat-AudioDiT-3.5B
美团 LongCat 团队开源了语音合成模型 LongCat-AudioDiT,提供 1B 和 3.5B 两个版本,代码和权重均采用 MIT 协议。该模型的核心能力是零样本声音克隆,即只需一段参考录音,就能用该说话人的音色朗读任意新文本。
技术路线上,传统语音合成通常需要先把文本转为频谱图(一种声音的「图像表示」),再从频谱图还原为波形。LongCat-AudioDiT 跳过了频谱图这一中间步骤,直接在波形的压缩表示上做扩散生成,减少了中间环节累积的误差,整条流程只需两个组件。
在 Seed 基准测试(语音克隆领域的主流评测)上,3.5B 版本的中文说话人相似度达到 0.818,超过字节 Seed-TTS 系列中此前最优的 Seed-DiT(0.809);中文困难子集相似度达到 0.797,超过阿里 CosyVoice3.5(0.786)。论文还报告了一个反直觉发现:中间压缩环节的还原质量越高,最终合成效果反而不一定更好。
信源:https://huggingface.co/meituan-longcat/LongCat-AudioDiT-3.5B
狂点版本号就能白嫖AI:小米新输入法明文暴露字节豆包模型密钥
小米 MiClaw 团队新推出的系统输入法存在严重安全疏忽。网友测试发现,只需疯狂点击输入法的版本号即可打开调试页面,页面中直接暴露了 AI 服务的 API 调用地址、API Key、模型提供商和模型名称,均以明文写入代码。
泄露的 API 地址指向字节跳动旗下云服务平台火山引擎的 Ark 接口,使用的模型为豆包系列的 doubao-seed-1-6-lite-251015。从提示词来看,该 AI 功能用于语音输入后处理,负责修正语音识别文本中的错别字、语法错误并添加标点。网友测试确认密钥真实有效,可在外部平台直接调用,目前小米疑似已更换密钥。
反编译代码还暴露了工程质量问题:开发者用
此外,小米在 GitHub 开源项目 mone 的代码提交中也被发现明文写入了 AI 公司月之暗面(Moonshot)的 API 密钥,提交时间为 2025 年 1 月,此后未见变动记录。
信源:https://www.nodeseek.com/post-669430-1
小米 MiClaw 团队新推出的系统输入法存在严重安全疏忽。网友测试发现,只需疯狂点击输入法的版本号即可打开调试页面,页面中直接暴露了 AI 服务的 API 调用地址、API Key、模型提供商和模型名称,均以明文写入代码。
泄露的 API 地址指向字节跳动旗下云服务平台火山引擎的 Ark 接口,使用的模型为豆包系列的 doubao-seed-1-6-lite-251015。从提示词来看,该 AI 功能用于语音输入后处理,负责修正语音识别文本中的错别字、语法错误并添加标点。网友测试确认密钥真实有效,可在外部平台直接调用,目前小米疑似已更换密钥。
反编译代码还暴露了工程质量问题:开发者用
if ("固定字符串".length() > 0) 的方式判断一个永远为真的硬编码字符串是否非空,这种写法不会出现在任何正常的代码审查流程中。此外,小米在 GitHub 开源项目 mone 的代码提交中也被发现明文写入了 AI 公司月之暗面(Moonshot)的 API 密钥,提交时间为 2025 年 1 月,此后未见变动记录。
信源:https://www.nodeseek.com/post-669430-1
逆向拆解Claude Code发现两个缓存Bug,可无声推高API成本10-20倍
一名开发者通过 Ghidra、MITM 代理和 radare2 逆向拆解了 Claude Code 独立安装版的 228MB 二进制文件,发现两个独立的缓存 Bug,可在用户不知情的情况下将 API 成本推高 10-20 倍。相关分析已提交至 GitHub(issue #40524),被 Anthropic 标记为回归 Bug 并指派处理。
第一个 Bug 存在于独立安装版使用的定制 Bun 运行时中。每次 API 请求时,运行时会在请求体中查找一个计费标识符并替换,但替换逻辑命中的是请求体中的第一个匹配项。如果对话历史恰好包含该字符串(比如讨论过 Claude Code 内部计费机制),替换就会命中消息内容而非系统提示词,导致每次请求都触发缓存全量重建。临时规避方法是改用
第二个 Bug 影响所有使用
该开发者估算,对于约 50 万 token 的长对话,Bug 1 每次请求额外消耗约 0.04 美元,Bug 2 每次恢复额外消耗约 0.15 美元,两者叠加单次请求成本可超 0.20 美元。此前 Anthropic 工程师 Lydia Hallie 已确认用户触达用量限制的速度「远快于预期」,Reddit 评论区多名用户认为这两个缓存 Bug 可能是用量异常消耗的根本原因之一。
信源:https://www.reddit.com/r/ClaudeAI/comments/1s7mkn3/psa_claude_code_has_two_cache_bugs_that_can/
一名开发者通过 Ghidra、MITM 代理和 radare2 逆向拆解了 Claude Code 独立安装版的 228MB 二进制文件,发现两个独立的缓存 Bug,可在用户不知情的情况下将 API 成本推高 10-20 倍。相关分析已提交至 GitHub(issue #40524),被 Anthropic 标记为回归 Bug 并指派处理。
第一个 Bug 存在于独立安装版使用的定制 Bun 运行时中。每次 API 请求时,运行时会在请求体中查找一个计费标识符并替换,但替换逻辑命中的是请求体中的第一个匹配项。如果对话历史恰好包含该字符串(比如讨论过 Claude Code 内部计费机制),替换就会命中消息内容而非系统提示词,导致每次请求都触发缓存全量重建。临时规避方法是改用
npx @anthropic-ai/claude-code 运行,npm 包版本不含这段替换逻辑。第二个 Bug 影响所有使用
--resume 或 --continue 恢复会话的用户,自 v2.1.69 起引入。恢复会话时,系统附加信息的注入位置与新建会话不同,导致缓存前缀完全不匹配,整段对话历史从缓存读取变为全量重写。后续轮次恢复正常,但恢复操作本身已产生大量额外开销,目前无外部规避方案。该开发者估算,对于约 50 万 token 的长对话,Bug 1 每次请求额外消耗约 0.04 美元,Bug 2 每次恢复额外消耗约 0.15 美元,两者叠加单次请求成本可超 0.20 美元。此前 Anthropic 工程师 Lydia Hallie 已确认用户触达用量限制的速度「远快于预期」,Reddit 评论区多名用户认为这两个缓存 Bug 可能是用量异常消耗的根本原因之一。
信源:https://www.reddit.com/r/ClaudeAI/comments/1s7mkn3/psa_claude_code_has_two_cache_bugs_that_can/
Hermes Agent v0.6.0:新增飞书和企业微信,可作为MCP服务器接入IDE
开源 AI 模型机构 Nous Research 发布多平台 AI Agent 框架 Hermes Agent v0.6.0,GitHub 仓库已有 1.88 万星。该框架可将 AI Agent 接入 Telegram、Discord、Slack、WhatsApp、飞书、企业微信等多个即时通讯平台,支持 CLI 和网关两种运行模式。
本次更新的主要新功能:
1. 多实例配置(Profiles):同一安装可运行多个隔离的 Agent 实例,各自拥有独立的配置、记忆、会话和技能,凭证锁机制防止两个实例共用同一 bot 账号
2. MCP 服务器模式:通过
3. 飞书/Lark 适配器:支持事件订阅、消息卡片、群聊、图片/文件附件和交互式卡片回调
4. 企业微信适配器:支持文本、图片、语音消息和群聊
5. 推理服务商自动故障转移:配置多个服务商后,主服务商出错时自动切换到下一个
6. Slack 多工作区 OAuth:单个网关实例可同时连接多个 Slack 工作区
7. Telegram Webhook 模式:替代轮询方式,适合生产环境部署
8. 官方 Docker 容器:支持 CLI 和网关模式
release notes 显示,此次更新合并了 95 个 PR,解决了 16 个 issue,开发周期为 2 天。
信源:https://github.com/NousResearch/hermes-agent/releases/tag/v2026.3.30
开源 AI 模型机构 Nous Research 发布多平台 AI Agent 框架 Hermes Agent v0.6.0,GitHub 仓库已有 1.88 万星。该框架可将 AI Agent 接入 Telegram、Discord、Slack、WhatsApp、飞书、企业微信等多个即时通讯平台,支持 CLI 和网关两种运行模式。
本次更新的主要新功能:
1. 多实例配置(Profiles):同一安装可运行多个隔离的 Agent 实例,各自拥有独立的配置、记忆、会话和技能,凭证锁机制防止两个实例共用同一 bot 账号
2. MCP 服务器模式:通过
hermes mcp serve 将会话和消息暴露给任何 MCP 兼容客户端(Claude Desktop、Cursor、VS Code 等),支持 stdio 和 Streamable HTTP 两种传输方式3. 飞书/Lark 适配器:支持事件订阅、消息卡片、群聊、图片/文件附件和交互式卡片回调
4. 企业微信适配器:支持文本、图片、语音消息和群聊
5. 推理服务商自动故障转移:配置多个服务商后,主服务商出错时自动切换到下一个
6. Slack 多工作区 OAuth:单个网关实例可同时连接多个 Slack 工作区
7. Telegram Webhook 模式:替代轮询方式,适合生产环境部署
8. 官方 Docker 容器:支持 CLI 和网关模式
release notes 显示,此次更新合并了 95 个 PR,解决了 16 个 issue,开发周期为 2 天。
信源:https://github.com/NousResearch/hermes-agent/releases/tag/v2026.3.30