Meta AI已悄悄接入谷歌Gemini,Avocado至少5个变体仍在内部赛马
Meta 正在内部并行测试至少 5 个 Avocado 模型变体:
1. Avocado 9B:90 亿参数的小型版本
2. Avocado Mango:标记为「agent」和「sub-agent」,支持图像生成的多模态变体
3. Avocado TOMM:全称「Tool of Many Models」,基于 Avocado 的多模型调度架构
4. Avocado Thinking 5.6:最新版推理模型
5. Paricado:纯文本对话模型
多条产品线并行意味着 Meta 尚未确定最终出货形态。更值得关注的是,Meta AI 的部分用户请求已实际通过谷歌 Gemini 模型处理,不再停留在此前报道的「内部讨论」阶段。Avocado 此前因内部测试落后于谷歌、OpenAI 和 Anthropic 的前沿模型,发布时间已从 3 月推迟至最早 5 月。
此外,Avocado 预计将采用闭源发布,这是 Meta 对 Llama 时代开源路线的明确转向。在扎克伯格追求超级智能的目标下,Meta 的 AI 战略正从「开源标杆」转向「性能优先」。
信源:https://www.testingcatalog.com/exclusive-meta-tests-avocado-9b-avocado-mango-agent-and-more/
Meta 正在内部并行测试至少 5 个 Avocado 模型变体:
1. Avocado 9B:90 亿参数的小型版本
2. Avocado Mango:标记为「agent」和「sub-agent」,支持图像生成的多模态变体
3. Avocado TOMM:全称「Tool of Many Models」,基于 Avocado 的多模型调度架构
4. Avocado Thinking 5.6:最新版推理模型
5. Paricado:纯文本对话模型
多条产品线并行意味着 Meta 尚未确定最终出货形态。更值得关注的是,Meta AI 的部分用户请求已实际通过谷歌 Gemini 模型处理,不再停留在此前报道的「内部讨论」阶段。Avocado 此前因内部测试落后于谷歌、OpenAI 和 Anthropic 的前沿模型,发布时间已从 3 月推迟至最早 5 月。
此外,Avocado 预计将采用闭源发布,这是 Meta 对 Llama 时代开源路线的明确转向。在扎克伯格追求超级智能的目标下,Meta 的 AI 战略正从「开源标杆」转向「性能优先」。
信源:https://www.testingcatalog.com/exclusive-meta-tests-avocado-9b-avocado-mango-agent-and-more/
从「无药可用」到「无疾病证据」:GitLab联创AI辅助抗癌路径复盘
GitLab 联合创始人兼执行主席 Sid Sijbrandij 近日在 OpenAI Forum 活动中,与遗传学家 Jacob Stern 共同分享了用 AI 辅助对抗骨肉瘤的完整经历。
Sid 于 2022 年底确诊脊椎骨肉瘤,肿瘤直径 6 厘米。2023 年经历手术切除、脊柱融合、放疗和高强度化疗后,癌症仍在 2024 年复发,标准治疗方案已基本耗尽,主治医生无法推荐有效的下一步治疗。Sid 随后辞去日常职务,组建个人医疗团队,由前 10x Genomics 高管 Jacob Stern 主导运营,以「创始人模式」全面接管自己的治疗决策。
团队采取「极限诊断」策略,对肿瘤进行单细胞测序、DNA/RNA 测序、靶向影像和类器官测试等全方位分析,累计产生 25TB 数据。单细胞测序发现肿瘤高度表达 FAP 蛋白,团队据此在德国找到一种针对 FAP 的实验性放射性配体疗法。两次治疗后肿瘤坏死 60%、缩小 20%,并从脊髓硬膜脱离,外科医生得以再次手术将其切除。
AI 在整个过程中充当加速器。Jacob 将肿瘤 RNA 测序数据直接输入 GPT-4 分析,AI 标记出后来被证明关键的 B7H3 靶点,并识别出肿瘤免疫微环境的动态特征。团队还搭建了一套 Agent 系统,输入自然语言问题后可自动完成文献检索、假设生成和生物信息分析,单次运行约 20 美元、耗时 30 分钟,可直接对 60 万个单细胞数据执行分析并生成报告。在设计个性化 mRNA 肿瘤疫苗时,AI 也被用于辅助筛选候选新抗原。Jacob 表示,AI 不能替代专科医生,但让他「有能力成为专科医生的合格对话者」,在自己并非专家的领域快速上手并推进合作。
Sid 表示经过靶向放射性治疗和手术后,目前处于「无疾病证据」状态,可用治疗选项已从零扩展到 30 种。团队正将这套方法产品化,已孵化 Thalus(基因表达分析与靶点发现)、Arden(复杂免疫疾病个性化治疗)等公司,目标是降低个体化治疗的门槛。
信源:https://forum.openai.com/public/videos/event-replay-from-terminal-to-turnaround-how-gitlabs-co-founder-leveraged-chatgpt-in-his-cancer-fight-2026-03-18
GitLab 联合创始人兼执行主席 Sid Sijbrandij 近日在 OpenAI Forum 活动中,与遗传学家 Jacob Stern 共同分享了用 AI 辅助对抗骨肉瘤的完整经历。
Sid 于 2022 年底确诊脊椎骨肉瘤,肿瘤直径 6 厘米。2023 年经历手术切除、脊柱融合、放疗和高强度化疗后,癌症仍在 2024 年复发,标准治疗方案已基本耗尽,主治医生无法推荐有效的下一步治疗。Sid 随后辞去日常职务,组建个人医疗团队,由前 10x Genomics 高管 Jacob Stern 主导运营,以「创始人模式」全面接管自己的治疗决策。
团队采取「极限诊断」策略,对肿瘤进行单细胞测序、DNA/RNA 测序、靶向影像和类器官测试等全方位分析,累计产生 25TB 数据。单细胞测序发现肿瘤高度表达 FAP 蛋白,团队据此在德国找到一种针对 FAP 的实验性放射性配体疗法。两次治疗后肿瘤坏死 60%、缩小 20%,并从脊髓硬膜脱离,外科医生得以再次手术将其切除。
AI 在整个过程中充当加速器。Jacob 将肿瘤 RNA 测序数据直接输入 GPT-4 分析,AI 标记出后来被证明关键的 B7H3 靶点,并识别出肿瘤免疫微环境的动态特征。团队还搭建了一套 Agent 系统,输入自然语言问题后可自动完成文献检索、假设生成和生物信息分析,单次运行约 20 美元、耗时 30 分钟,可直接对 60 万个单细胞数据执行分析并生成报告。在设计个性化 mRNA 肿瘤疫苗时,AI 也被用于辅助筛选候选新抗原。Jacob 表示,AI 不能替代专科医生,但让他「有能力成为专科医生的合格对话者」,在自己并非专家的领域快速上手并推进合作。
Sid 表示经过靶向放射性治疗和手术后,目前处于「无疾病证据」状态,可用治疗选项已从零扩展到 30 种。团队正将这套方法产品化,已孵化 Thalus(基因表达分析与靶点发现)、Arden(复杂免疫疾病个性化治疗)等公司,目标是降低个体化治疗的门槛。
信源:https://forum.openai.com/public/videos/event-replay-from-terminal-to-turnaround-how-gitlabs-co-founder-leveraged-chatgpt-in-his-cancer-fight-2026-03-18
❤1
哈萨比斯的「地堡计划」:新书还原DeepMind安全理想如何破灭
《大西洋月刊》刊发科技史学家、金融史学家 Sebastian Mallaby 新书《The Infinity Machine》节选,基于 2023 至 2026 年间的持续采访,还原了谷歌 DeepMind 联合创始人 Demis Hassabis 自 2014 年谷歌收购至今的 AI 安全理念演变。
Hassabis 早年构想由单一科学团队代表全人类安全地建造超级智能,甚至计划在关键时刻带顶级研究员撤入一个秘密地堡,类似曼哈顿计划。一位加入不久的研究员回忆,Hassabis 在面试尾声警告他做好「随时飞往摩洛哥某个秘密地点」的心理准备。
2014 年谷歌收购 DeepMind 时,Hassabis 开出罕见条件:设立独立外部监督委员会,严禁军事应用,谷歌不得完全控制技术部署。谷歌接受了。次年他在马斯克位于加州霍桑的总部召集了一场秘密会议,试图将潜在竞争者纳入统一阵线,结果适得其反:马斯克随后与 Sam Altman 联手创办了 OpenAI。
Hassabis 之后发起代号「Project Mario」的秘密行动,试图从谷歌手中夺回治理自主权,组建法律团队,从 LinkedIn 创始人 Reid Hoffman 处获得 10 亿美元资金承诺,并考虑将 DeepMind 从谷歌拆分独立。这场斗争持续三年,最终失败。联合创始人 Mustafa Suleyman 也在 2019 年被迫离开公司。
2022 年底 ChatGPT 发布后,Hassabis 彻底放弃了只做有益科学的高姿态路线。他对 Mallaby 说「这是战时」,随后全力投入 Gemini 与 ChatGPT 的竞争。数千亿美元涌入 AI 军备竞赛,国家监管和公司治理结构都无法阻止其他人向底线竞争。Hassabis 的安全哲学也随之根本转变:「安全不在于治理架构,就算有一个治理委员会,关键时刻它大概率也不会做出正确的事。」他的新策略是确保自己「在决策桌上有一席之地,当安全问题出现时,能参与决定解决方案」。与此同时,谷歌已在积极向美国国防系统推销 AI,与 Hassabis 当年为收购设下的军事禁令形成鲜明反转。
信源:https://www.theatlantic.com/ideas/2026/03/ai-google-deep-mind-hassabis/686527/
《大西洋月刊》刊发科技史学家、金融史学家 Sebastian Mallaby 新书《The Infinity Machine》节选,基于 2023 至 2026 年间的持续采访,还原了谷歌 DeepMind 联合创始人 Demis Hassabis 自 2014 年谷歌收购至今的 AI 安全理念演变。
Hassabis 早年构想由单一科学团队代表全人类安全地建造超级智能,甚至计划在关键时刻带顶级研究员撤入一个秘密地堡,类似曼哈顿计划。一位加入不久的研究员回忆,Hassabis 在面试尾声警告他做好「随时飞往摩洛哥某个秘密地点」的心理准备。
2014 年谷歌收购 DeepMind 时,Hassabis 开出罕见条件:设立独立外部监督委员会,严禁军事应用,谷歌不得完全控制技术部署。谷歌接受了。次年他在马斯克位于加州霍桑的总部召集了一场秘密会议,试图将潜在竞争者纳入统一阵线,结果适得其反:马斯克随后与 Sam Altman 联手创办了 OpenAI。
Hassabis 之后发起代号「Project Mario」的秘密行动,试图从谷歌手中夺回治理自主权,组建法律团队,从 LinkedIn 创始人 Reid Hoffman 处获得 10 亿美元资金承诺,并考虑将 DeepMind 从谷歌拆分独立。这场斗争持续三年,最终失败。联合创始人 Mustafa Suleyman 也在 2019 年被迫离开公司。
2022 年底 ChatGPT 发布后,Hassabis 彻底放弃了只做有益科学的高姿态路线。他对 Mallaby 说「这是战时」,随后全力投入 Gemini 与 ChatGPT 的竞争。数千亿美元涌入 AI 军备竞赛,国家监管和公司治理结构都无法阻止其他人向底线竞争。Hassabis 的安全哲学也随之根本转变:「安全不在于治理架构,就算有一个治理委员会,关键时刻它大概率也不会做出正确的事。」他的新策略是确保自己「在决策桌上有一席之地,当安全问题出现时,能参与决定解决方案」。与此同时,谷歌已在积极向美国国防系统推销 AI,与 Hassabis 当年为收购设下的军事禁令形成鲜明反转。
信源:https://www.theatlantic.com/ideas/2026/03/ai-google-deep-mind-hassabis/686527/
❤2
礼来27.5亿美元拿下英矽智能AI发现的GLP-1药物全球权益
全球最大减重药企之一礼来与 AI 制药公司英矽智能(港股 03696)达成总价值最高约 27.5 亿美元的授权与研发合作协议,获得后者一款 AI 发现的 GLP-1 糖尿病口服药物的全球独家开发、生产和商业化权益。英矽智能将获得 1.15 亿美元首付款,后续根据监管和商业化里程碑获得进一步付款及销售分成。
礼来自身的 GLP-1 药物 Mounjaro 是 2025 年全球销售额第二高的药品,但公司正面临诺和诺德首款减重口服药的竞争压力,股价年内已下跌 17%。礼来 CFO Lucas Montarce 此前表示公司正「大力投资」AI 研发,已在总部建造英伟达驱动的超级计算机,并于 1 月宣布在旧金山建设 10 亿美元的新研究实验室。礼来亚洲风投是英矽智能的前十大股东之一,双方合作始于 2023 年。
英矽智能 2014 年创立于约翰斯·霍普金斯大学,是最早将生成式 AI 应用于药物发现的公司之一。创始人 Alex Zhavoronkov 称公司已利用 AI 开发了至少 28 种药物,近一半已进入临床阶段。公司去年 12 月在港交所上市,目前尚未盈利,授权交易是其核心收入来源。
信源:https://www.ft.com/content/4efaf8cd-d415-46bb-8fb9-367e4eb3a781
全球最大减重药企之一礼来与 AI 制药公司英矽智能(港股 03696)达成总价值最高约 27.5 亿美元的授权与研发合作协议,获得后者一款 AI 发现的 GLP-1 糖尿病口服药物的全球独家开发、生产和商业化权益。英矽智能将获得 1.15 亿美元首付款,后续根据监管和商业化里程碑获得进一步付款及销售分成。
礼来自身的 GLP-1 药物 Mounjaro 是 2025 年全球销售额第二高的药品,但公司正面临诺和诺德首款减重口服药的竞争压力,股价年内已下跌 17%。礼来 CFO Lucas Montarce 此前表示公司正「大力投资」AI 研发,已在总部建造英伟达驱动的超级计算机,并于 1 月宣布在旧金山建设 10 亿美元的新研究实验室。礼来亚洲风投是英矽智能的前十大股东之一,双方合作始于 2023 年。
英矽智能 2014 年创立于约翰斯·霍普金斯大学,是最早将生成式 AI 应用于药物发现的公司之一。创始人 Alex Zhavoronkov 称公司已利用 AI 开发了至少 28 种药物,近一半已进入临床阶段。公司去年 12 月在港交所上市,目前尚未盈利,授权交易是其核心收入来源。
信源:https://www.ft.com/content/4efaf8cd-d415-46bb-8fb9-367e4eb3a781
世界模型有多不懂世界?邢波团队发布WR-Arena基准,环境模拟无一超60%
阿联酋人工智能大学 MBZUAI 校长、CMU 教授邢波团队发布世界推理竞技场 WR-Arena,从动作模拟保真度、长程预测、模拟推理与规划三个维度系统评测当前主流世界模型。测试对象涵盖英伟达 Cosmos 1/2、Meta V-JEPA 2、KLING、MiniMax、Gen-3 以及 MBZUAI 自研的 PAN。
结果并不乐观:没有任何模型在环境模拟维度上超过 60% 准确率,与人类水平存在显著差距。生成一致性随动作步数急剧衰减,WAN 2.1 在 9 步动作序列中从 90% 跌至 30%,意味着当前模型在多步交互场景下几乎无法维持对物理世界的连贯模拟。
MBZUAI 自研的 PAN 在多数维度领先(过渡平滑度 53.6%、生成一致性 64.1%、开放式规划提升 26.7%),但 PAN 团队同时是基准的制定者。论文的核心结论是:能生成逼真视频不等于理解世界如何运转,当前世界模型离可用于 Agent 决策的模拟器还有很大距离。
信源:https://arxiv.org/abs/2603.25887
阿联酋人工智能大学 MBZUAI 校长、CMU 教授邢波团队发布世界推理竞技场 WR-Arena,从动作模拟保真度、长程预测、模拟推理与规划三个维度系统评测当前主流世界模型。测试对象涵盖英伟达 Cosmos 1/2、Meta V-JEPA 2、KLING、MiniMax、Gen-3 以及 MBZUAI 自研的 PAN。
结果并不乐观:没有任何模型在环境模拟维度上超过 60% 准确率,与人类水平存在显著差距。生成一致性随动作步数急剧衰减,WAN 2.1 在 9 步动作序列中从 90% 跌至 30%,意味着当前模型在多步交互场景下几乎无法维持对物理世界的连贯模拟。
MBZUAI 自研的 PAN 在多数维度领先(过渡平滑度 53.6%、生成一致性 64.1%、开放式规划提升 26.7%),但 PAN 团队同时是基准的制定者。论文的核心结论是:能生成逼真视频不等于理解世界如何运转,当前世界模型离可用于 Agent 决策的模拟器还有很大距离。
信源:https://arxiv.org/abs/2603.25887
arXiv.org
World Reasoning Arena
World models (WMs) are intended to serve as internal simulators of the real world that enable agents to understand, anticipate, and act upon complex environments. Existing WM benchmarks remain...
❤2
微软发布免费语音输入工具Vibing,基于自家VibeVoice模型,对标付费产品WisprFlow
微软发布桌面语音输入工具 Vibing,基于自家开源语音 AI 模型 VibeVoice,支持 macOS 和 Windows,免费使用。按下快捷键(Mac 右 Option / Windows Ctrl+Win)即可在任意应用中唤起录音,结束后自动输出文本。AI/ML 社区测评者 @realmrfakename 亲测后称转录准确、速度快,评价为「WisprFlow 的免费替代品」。
Vibing 不只是语音转文字。它通过 LLM 将口语重写为适合当前场景的书面文本,支持在输入过程中用自然语言直接修改、删除、整理已有内容。其他功能包括单次 5 分钟以上连续录音、50+ 语言自动识别、同一句话内中英文混合输入、自定义热词以及实时翻译。
底层的微软 VibeVoice 是 MIT 协议开源的语音 AI 模型家族,GitHub 星标超 2.8 万,包含 7B 参数的 ASR 模型(单次处理 60 分钟音频)、1.5B 的 TTS 模型(生成 90 分钟多人语音)和 0.5B 的实时模型(300ms 延迟)。WisprFlow 是目前 Mac 上最受欢迎的 AI 语音输入工具之一,按月订阅收费,Vibing 直接以免费 + 开源的方式进入同一赛道。
信源:https://vibingjustspeakit.github.io/Vibing/
微软发布桌面语音输入工具 Vibing,基于自家开源语音 AI 模型 VibeVoice,支持 macOS 和 Windows,免费使用。按下快捷键(Mac 右 Option / Windows Ctrl+Win)即可在任意应用中唤起录音,结束后自动输出文本。AI/ML 社区测评者 @realmrfakename 亲测后称转录准确、速度快,评价为「WisprFlow 的免费替代品」。
Vibing 不只是语音转文字。它通过 LLM 将口语重写为适合当前场景的书面文本,支持在输入过程中用自然语言直接修改、删除、整理已有内容。其他功能包括单次 5 分钟以上连续录音、50+ 语言自动识别、同一句话内中英文混合输入、自定义热词以及实时翻译。
底层的微软 VibeVoice 是 MIT 协议开源的语音 AI 模型家族,GitHub 星标超 2.8 万,包含 7B 参数的 ASR 模型(单次处理 60 分钟音频)、1.5B 的 TTS 模型(生成 90 分钟多人语音)和 0.5B 的实时模型(300ms 延迟)。WisprFlow 是目前 Mac 上最受欢迎的 AI 语音输入工具之一,按月订阅收费,Vibing 直接以免费 + 开源的方式进入同一赛道。
信源:https://vibingjustspeakit.github.io/Vibing/
Agent训练的「隐形共识」:三家公司独立开发,RL方法论几乎一模一样
前 Hugging Face 技术负责人、现谷歌 DeepMind 资深工程师 Philipp Schmid 对比了近期三篇 Agent 模型技术报告后发现,月之暗面(Kimi K2.5)、AI 编程工具 Cursor(Composer 2)和向量数据库公司 Chroma(Context-1)在独立开发过程中,收敛到了高度相似的强化学习训练范式。
四个共同点:
1. 从强基座模型出发,不从零训练:月之暗面扩展Kimi K2,Cursor以Kimi K2.5(1万亿参数/320亿活跃MoE)为基座,Chroma基于gpt-oss-20B
2. 在生产级环境中训练:三个团队均用与线上一致的工具链和执行环境跑RL rollout
3. 基于可验证结果的奖励信号,辅以生成式奖励模型(GRM)处理开放式任务
4. 异步大规模并行生成训练轨迹
三家各自的创新点不同。Kimi K2.5 的 Agent Swarm 通过 RL 让模型学会将任务动态拆解为并行子任务,由可训练的编排器调度冻结的子 Agent 执行,在 BrowseComp 基准上以 78.4% 超过 GPT-5.2 Pro 的 77.9%,推理延迟降低最多 4.5 倍。Cursor 的 Composer 2 用自动摘要机制应对长编码会话的上下文膨胀,并从生产流量中实时提取 RL 训练信号,整个循环约 5 小时,每天可部署多个新版本。Chroma 的 Context-1 是一个 200 亿参数的搜索 Agent,核心技巧是「自编辑上下文」,模型学会主动丢弃无关检索结果以腾出空间继续搜索,在检索任务上以远低于前沿模型的成本和约 10 倍的速度达到可比精度。
Schmid 还注意到,三个团队都经历了反复的奖励黑客修复周期。Cursor 的模型学会了发送格式错误的工具调用来规避惩罚,Kimi 的编排器会退化为串行执行或刷并行奖励却不拆分真实任务,Chroma 的 Agent 则收敛为「搜一次就停」。每种退化行为都需要针对性地调整奖励函数。
信源:https://www.philschmid.de/kimi-composer-context
前 Hugging Face 技术负责人、现谷歌 DeepMind 资深工程师 Philipp Schmid 对比了近期三篇 Agent 模型技术报告后发现,月之暗面(Kimi K2.5)、AI 编程工具 Cursor(Composer 2)和向量数据库公司 Chroma(Context-1)在独立开发过程中,收敛到了高度相似的强化学习训练范式。
四个共同点:
1. 从强基座模型出发,不从零训练:月之暗面扩展Kimi K2,Cursor以Kimi K2.5(1万亿参数/320亿活跃MoE)为基座,Chroma基于gpt-oss-20B
2. 在生产级环境中训练:三个团队均用与线上一致的工具链和执行环境跑RL rollout
3. 基于可验证结果的奖励信号,辅以生成式奖励模型(GRM)处理开放式任务
4. 异步大规模并行生成训练轨迹
三家各自的创新点不同。Kimi K2.5 的 Agent Swarm 通过 RL 让模型学会将任务动态拆解为并行子任务,由可训练的编排器调度冻结的子 Agent 执行,在 BrowseComp 基准上以 78.4% 超过 GPT-5.2 Pro 的 77.9%,推理延迟降低最多 4.5 倍。Cursor 的 Composer 2 用自动摘要机制应对长编码会话的上下文膨胀,并从生产流量中实时提取 RL 训练信号,整个循环约 5 小时,每天可部署多个新版本。Chroma 的 Context-1 是一个 200 亿参数的搜索 Agent,核心技巧是「自编辑上下文」,模型学会主动丢弃无关检索结果以腾出空间继续搜索,在检索任务上以远低于前沿模型的成本和约 10 倍的速度达到可比精度。
Schmid 还注意到,三个团队都经历了反复的奖励黑客修复周期。Cursor 的模型学会了发送格式错误的工具调用来规避惩罚,Kimi 的编排器会退化为串行执行或刷并行奖励却不拆分真实任务,Chroma 的 Agent 则收敛为「搜一次就停」。每种退化行为都需要针对性地调整奖励函数。
信源:https://www.philschmid.de/kimi-composer-context
500万参数打平十亿级大模型:百度PaddleOCR超越Tesseract登顶GitHub OCR第一
百度飞桨开源 OCR 工具库 PaddleOCR 以 73,300 GitHub 星标超越谷歌维护的老牌 OCR 引擎 Tesseract(73,200),成为 GitHub 上星标最高的 OCR 项目。排名第三的 MinerU 为 57,500 星标。PaddleOCR 于 2020 年开源,支持 100+ 语言,覆盖 160+ 国家和地区。
PaddleOCR 近期密集更新,上周发布的 PP-OCRv5 仅 500 万参数,在标准 OCR 基准上达到与十亿参数级视觉语言大模型相当的精度;PaddleOCR-VL-1.5 在文档解析基准 OmniDocBench v1.5 上以 94.5% 准确率刷新纪录。
信源:https://x.com/BaiduAI_News/status/2038513995779649850
百度飞桨开源 OCR 工具库 PaddleOCR 以 73,300 GitHub 星标超越谷歌维护的老牌 OCR 引擎 Tesseract(73,200),成为 GitHub 上星标最高的 OCR 项目。排名第三的 MinerU 为 57,500 星标。PaddleOCR 于 2020 年开源,支持 100+ 语言,覆盖 160+ 国家和地区。
PaddleOCR 近期密集更新,上周发布的 PP-OCRv5 仅 500 万参数,在标准 OCR 基准上达到与十亿参数级视觉语言大模型相当的精度;PaddleOCR-VL-1.5 在文档解析基准 OmniDocBench v1.5 上以 94.5% 准确率刷新纪录。
信源:https://x.com/BaiduAI_News/status/2038513995779649850
$0.26/小时、不需要向量数据库:Jina AI创始人演示用KV缓存替代整套RAG流水线
Elastic 副总裁、AI 搜索基础设施公司 Jina AI 创始人 Han Xiao 在 X 上分享了一项实验:用 KV 缓存替代向量数据库、嵌入模型和整套 RAG 流水线,实现「无向量搜索」。
他在 L4 GPU(生产环境常用的低成本显卡)上将 Qwen 3.5-35B-A3B 模型的 262K 上下文窗口预填充至 99%(258K token),预计算的 KV 缓存存储后用户加载仅需约 1 秒,系统提示词和查询拼接在末尾,生成约 3K token 即可完成一次检索,解码速度约 20 token/秒。运行成本约 $0.26/小时(L4 竞价实例),单个 LLM 完成全部工作,无需向量数据库、嵌入模型或流水线工程。
Han Xiao 在 Jina AI 论文和中英文小说数据集上测试,称结果「相当不错」,存在少量幻觉但多数回答准确且有据可循。他指出 KV 缓存作为文档存储并非新想法(此前 CAG 论文已提出),但量化 KV 缓存和现代注意力机制(混合 SSM-attention、GQA、MQA、MLA)正在快速改变其经济性。这种方案的理论召回率是完美的,因为查询对全部文档执行完整注意力计算,没有分块损失或检索遗漏。
上限也很明显:262K token 大约相当于一本书,扩展到企业知识库规模需要多槽路由机制。他已上线在线演示,并向 llama.cpp 提交了修复超长上下文(>200K)KV 缓存复用问题的 PR。Han Xiao 写道:「如果我们解决冷预填充速度和解码速度的问题,而低成本 GPU 价格持续下降,搜索的未来可能不需要向量。激进,但有可能。」
信源:https://x.com/hxiao/status/2038296253377692102
Elastic 副总裁、AI 搜索基础设施公司 Jina AI 创始人 Han Xiao 在 X 上分享了一项实验:用 KV 缓存替代向量数据库、嵌入模型和整套 RAG 流水线,实现「无向量搜索」。
他在 L4 GPU(生产环境常用的低成本显卡)上将 Qwen 3.5-35B-A3B 模型的 262K 上下文窗口预填充至 99%(258K token),预计算的 KV 缓存存储后用户加载仅需约 1 秒,系统提示词和查询拼接在末尾,生成约 3K token 即可完成一次检索,解码速度约 20 token/秒。运行成本约 $0.26/小时(L4 竞价实例),单个 LLM 完成全部工作,无需向量数据库、嵌入模型或流水线工程。
Han Xiao 在 Jina AI 论文和中英文小说数据集上测试,称结果「相当不错」,存在少量幻觉但多数回答准确且有据可循。他指出 KV 缓存作为文档存储并非新想法(此前 CAG 论文已提出),但量化 KV 缓存和现代注意力机制(混合 SSM-attention、GQA、MQA、MLA)正在快速改变其经济性。这种方案的理论召回率是完美的,因为查询对全部文档执行完整注意力计算,没有分块损失或检索遗漏。
上限也很明显:262K token 大约相当于一本书,扩展到企业知识库规模需要多槽路由机制。他已上线在线演示,并向 llama.cpp 提交了修复超长上下文(>200K)KV 缓存复用问题的 PR。Han Xiao 写道:「如果我们解决冷预填充速度和解码速度的问题,而低成本 GPU 价格持续下降,搜索的未来可能不需要向量。激进,但有可能。」
信源:https://x.com/hxiao/status/2038296253377692102
Mistral首笔债务融资8.3亿美元,在欧洲建英伟达驱动的AI数据中心
法国 AI 公司 Mistral 完成 8.3 亿美元债务融资,用于在欧洲建设自有 AI 数据中心,这是该公司首次通过债务方式募资。贷款方包括法国国家投资银行 Bpifrance、法国巴黎银行、汇丰银行和三菱日联金融集团。
首个设施位于巴黎南部布吕耶尔勒沙泰勒,配备 13,800 块英伟达 GB300 芯片,计划 6 月底前投入运营。Mistral 此前已宣布 40 亿欧元基础设施计划,包括在瑞典建设 12 亿欧元的数据中心,目标是到 2027 年底在欧洲部署 200 兆瓦 AI 算力。
CEO Arthur Mensch 称,欧洲主权 AI 需求正在推动公司增长,超过一半的收入来自欧洲客户。Mistral 目前估值约 120 亿欧元(此前完成由 ASML 领投的 17 亿欧元股权融资),预计年底前年化营收将达到 10 亿美元。
信源:https://www.ft.com/content/229f4f59-d518-4e00-abd6-5a5b727cd2aa
法国 AI 公司 Mistral 完成 8.3 亿美元债务融资,用于在欧洲建设自有 AI 数据中心,这是该公司首次通过债务方式募资。贷款方包括法国国家投资银行 Bpifrance、法国巴黎银行、汇丰银行和三菱日联金融集团。
首个设施位于巴黎南部布吕耶尔勒沙泰勒,配备 13,800 块英伟达 GB300 芯片,计划 6 月底前投入运营。Mistral 此前已宣布 40 亿欧元基础设施计划,包括在瑞典建设 12 亿欧元的数据中心,目标是到 2027 年底在欧洲部署 200 兆瓦 AI 算力。
CEO Arthur Mensch 称,欧洲主权 AI 需求正在推动公司增长,超过一半的收入来自欧洲客户。Mistral 目前估值约 120 亿欧元(此前完成由 ASML 领投的 17 亿欧元股权融资),预计年底前年化营收将达到 10 亿美元。
信源:https://www.ft.com/content/229f4f59-d518-4e00-abd6-5a5b727cd2aa
更新即崩:谷歌Antigravity全线模型容量告急,三月以来投诉不断
谷歌 AI 编程工具 Antigravity 近期更新后,用户反映所有模型频繁出现「high traffic」容量错误,复杂任务无法完成。Reddit r/google_antigravity 社区和 Google AI 开发者论坛近日出现大量类似投诉,付费订阅用户同样受影响。
这是 Antigravity 三月以来持续容量困境的延续。v1.20.5(3 月 9 日)修复了一个 token 计量 bug,但同期引入的 AI Credits 计费系统导致积分消耗异常,部分用户配额被锁定长达 7 天。3 月中旬谷歌将 Antigravity 从免费转向积分付费模式后,开发者社区不满持续发酵。目前社区中流传的临时方案包括在设置中关闭 AI Credits、回退至 v1.19.6 等。
信源:https://www.reddit.com/r/google_antigravity/comments/1s7kn9a/all_models_capacity_issues_after_latest_ag_update/
谷歌 AI 编程工具 Antigravity 近期更新后,用户反映所有模型频繁出现「high traffic」容量错误,复杂任务无法完成。Reddit r/google_antigravity 社区和 Google AI 开发者论坛近日出现大量类似投诉,付费订阅用户同样受影响。
这是 Antigravity 三月以来持续容量困境的延续。v1.20.5(3 月 9 日)修复了一个 token 计量 bug,但同期引入的 AI Credits 计费系统导致积分消耗异常,部分用户配额被锁定长达 7 天。3 月中旬谷歌将 Antigravity 从免费转向积分付费模式后,开发者社区不满持续发酵。目前社区中流传的临时方案包括在设置中关闭 AI Credits、回退至 v1.19.6 等。
信源:https://www.reddit.com/r/google_antigravity/comments/1s7kn9a/all_models_capacity_issues_after_latest_ag_update/
😁1
Kimi K2.5上线一个月后ARR破1亿美元,API额度紧到客户愿预付千万美元抢单
月之暗面在 3 月初、Kimi K2.5 发布一个月后,ARR(年度经常性收入)突破 1 亿美元。知情人士还称,K2.5 上线后,API 供应的 TPM(每分钟令牌数)配额迅速趋紧,有客户开出千万美元级别的消费承诺和预付担保,以争取优先供应。
信源:https://www.jiemian.com/article/14183113.html
月之暗面在 3 月初、Kimi K2.5 发布一个月后,ARR(年度经常性收入)突破 1 亿美元。知情人士还称,K2.5 上线后,API 供应的 TPM(每分钟令牌数)配额迅速趋紧,有客户开出千万美元级别的消费承诺和预付担保,以争取优先供应。
信源:https://www.jiemian.com/article/14183113.html
前特斯拉总裁:Altman正按「反马斯克」路线行事,Anthropic也不认同其伦理观
前特斯拉总裁、DVx Ventures 联合创始人 Jon McNeill 接受 Axios 采访时称,OpenAI CEO Sam Altman 与马斯克的关系已经「坏到极点」,「如果 Elon 做一件事,Sam 看着他,就会说,我要反着来」。McNeill 还表示,他感觉 Anthropic CEO Dario Amodei 「几乎不尊重马斯克的伦理观,甚至完全没有尊重」。
McNeill 认为,AI 公司高层正把马斯克的做事方式视为威胁,而不只是商业竞争。
信源:https://www.axios.com/2026/03/30/elon-musk-openai-altman-anthropic
前特斯拉总裁、DVx Ventures 联合创始人 Jon McNeill 接受 Axios 采访时称,OpenAI CEO Sam Altman 与马斯克的关系已经「坏到极点」,「如果 Elon 做一件事,Sam 看着他,就会说,我要反着来」。McNeill 还表示,他感觉 Anthropic CEO Dario Amodei 「几乎不尊重马斯克的伦理观,甚至完全没有尊重」。
McNeill 认为,AI 公司高层正把马斯克的做事方式视为威胁,而不只是商业竞争。
信源:https://www.axios.com/2026/03/30/elon-musk-openai-altman-anthropic
微软开源三档Harrier文本嵌入模型,27B版登上多语言MTEB v2榜首
微软在 Hugging Face 开源多语言文本嵌入模型家族 harrier-oss-v1,包含 270M、0.6B 和 27B 三档。模型卡显示,这一系列采用 decoder-only 架构、last-token pooling 和 L2 归一化,最长支持 32768 token,可用于检索、聚类、语义相似度、分类、双语挖掘和重排序。
Multilingual MTEB v2 是业内常用的多语言文本嵌入基准,主要测试检索、分类、聚类和语义相似度等任务。微软模型卡称,三档模型在该基准上的分数分别为 66.5、69.0 和 74.3,其中 27B 版在发布当日登上榜首。270M 和 0.6B 版本还额外使用更大嵌入模型进行知识蒸馏,三款模型均以 MIT 许可证发布。
信源:https://huggingface.co/microsoft/harrier-oss-v1-27b
微软在 Hugging Face 开源多语言文本嵌入模型家族 harrier-oss-v1,包含 270M、0.6B 和 27B 三档。模型卡显示,这一系列采用 decoder-only 架构、last-token pooling 和 L2 归一化,最长支持 32768 token,可用于检索、聚类、语义相似度、分类、双语挖掘和重排序。
Multilingual MTEB v2 是业内常用的多语言文本嵌入基准,主要测试检索、分类、聚类和语义相似度等任务。微软模型卡称,三档模型在该基准上的分数分别为 66.5、69.0 和 74.3,其中 27B 版在发布当日登上榜首。270M 和 0.6B 版本还额外使用更大嵌入模型进行知识蒸馏,三款模型均以 MIT 许可证发布。
信源:https://huggingface.co/microsoft/harrier-oss-v1-27b
通义把Vibe Coding塞进全模态,Qwen3.5-Omni称拿下215项SOTA
通义实验室发布全模态模型 Qwen3.5-Omni,支持文本、图片、音频和音视频输入,并可生成带时间戳的细粒度音视频 Caption。官方称,Qwen3.5-Omni-Plus 在音频及音视频分析、推理、对话、翻译等任务上拿下 215 项 SOTA,相关能力超过 Gemini-3.1-Pro。
这次最特别的增量不是榜单,而是「自然涌现的 Audio-Visual Vibe Coding 能力」。通义称,模型未经过专门训练,已经能根据音视频指令直接生成可运行代码。官方还称,该模型支持 256K 上下文、113 种语言识别,可处理 10 小时音频或 1 小时视频,并原生支持 WebSearch 和复杂 Function Call。
Qwen3.5-Omni 延续 Thinker-Talker 分工架构,两部分都升级为 Hybrid-Attention MoE。通义已通过阿里云百炼提供 Plus、Flash、Light 三种尺寸,并上线实时版本 Qwen3.5-Omni-Plus-Realtime。
信源:https://mp.weixin.qq.com/s/or9knvrcnxqJIY2cqoT71w?clicktime=1774877693
通义实验室发布全模态模型 Qwen3.5-Omni,支持文本、图片、音频和音视频输入,并可生成带时间戳的细粒度音视频 Caption。官方称,Qwen3.5-Omni-Plus 在音频及音视频分析、推理、对话、翻译等任务上拿下 215 项 SOTA,相关能力超过 Gemini-3.1-Pro。
这次最特别的增量不是榜单,而是「自然涌现的 Audio-Visual Vibe Coding 能力」。通义称,模型未经过专门训练,已经能根据音视频指令直接生成可运行代码。官方还称,该模型支持 256K 上下文、113 种语言识别,可处理 10 小时音频或 1 小时视频,并原生支持 WebSearch 和复杂 Function Call。
Qwen3.5-Omni 延续 Thinker-Talker 分工架构,两部分都升级为 Hybrid-Attention MoE。通义已通过阿里云百炼提供 Plus、Flash、Light 三种尺寸,并上线实时版本 Qwen3.5-Omni-Plus-Realtime。
信源:https://mp.weixin.qq.com/s/or9knvrcnxqJIY2cqoT71w?clicktime=1774877693
国行版Apple Intelligence误上线后撤回,短期无正式上线安排
彭博社记者 Mark Gurman 在 X 上称,苹果的 AI 功能 Apple Intelligence 此次在中国市场短暂开放是一次误上线,相关功能虽然「已经准备好多月」,但苹果仍未获得监管批准,现已下线。
根据爆料账号 @L0vetodream 晒出的截图显示,iPhone 设置中一度出现「Apple 智能与 Siri」页面。Mark Gurman 还称,这次误上线与 iOS 26.5 beta 无关,苹果短期内没有正式上线安排。
信源:https://x.com/markgurman/status/2038701276699967554?s=61&t=a-bloX1n-TZ50ofqhetO1A
彭博社记者 Mark Gurman 在 X 上称,苹果的 AI 功能 Apple Intelligence 此次在中国市场短暂开放是一次误上线,相关功能虽然「已经准备好多月」,但苹果仍未获得监管批准,现已下线。
根据爆料账号 @L0vetodream 晒出的截图显示,iPhone 设置中一度出现「Apple 智能与 Siri」页面。Mark Gurman 还称,这次误上线与 iOS 26.5 beta 无关,苹果短期内没有正式上线安排。
信源:https://x.com/markgurman/status/2038701276699967554?s=61&t=a-bloX1n-TZ50ofqhetO1A
Qwen 3.6 Plus Preview登陆OpenRouter:100万上下文,限时免费
模型聚合平台 OpenRouter 已上线 Qwen 3.6 Plus Preview 的免费预览版,模型页显示上下文窗口为 100 万 token,输入和输出价格均为 0 美元/百万 token。OpenRouter 在 X 上称,这是千问旗舰模型的早期预览版,重点强化 Agent 编程、前端编程和通用推理,定位为 Qwen 3.5-Plus 的更稳定后继版本。平台同时提示,免费开放期间,用户的提示词和补全内容会被收集,并可能用于改进模型。OpenRouter 随后更正称,该模型目前还不是视觉语言模型。
信源:https://openrouter.ai/qwen/qwen3.6-plus-preview:free
模型聚合平台 OpenRouter 已上线 Qwen 3.6 Plus Preview 的免费预览版,模型页显示上下文窗口为 100 万 token,输入和输出价格均为 0 美元/百万 token。OpenRouter 在 X 上称,这是千问旗舰模型的早期预览版,重点强化 Agent 编程、前端编程和通用推理,定位为 Qwen 3.5-Plus 的更稳定后继版本。平台同时提示,免费开放期间,用户的提示词和补全内容会被收集,并可能用于改进模型。OpenRouter 随后更正称,该模型目前还不是视觉语言模型。
信源:https://openrouter.ai/qwen/qwen3.6-plus-preview:free
OpenAI把Codex接进Claude Code:可直接审查或委派任务
OpenAI 开发者体验负责人 Romain Huet 在 X 上表示,OpenAI 已开源一款 Claude Code 插件,用户可直接在 Claude Code 中调用 Codex,使用 ChatGPT 订阅完成代码审查,或把任务委派给 Codex。
插件作者 Dominik Kundel 写道,这款插件可让 Codex 审查代码改动,也可在 Claude Code 内将任务交给 Codex 处理。GitHub README 显示,插件提供
README 还写明,插件可通过 Claude Code 插件市场安装,要求 ChatGPT 订阅(含 Free)或 OpenAI API key,以及 Node.js 18.18 或更高版本。
信源:https://x.com/romainhuet/status/2038677236304245087
OpenAI 开发者体验负责人 Romain Huet 在 X 上表示,OpenAI 已开源一款 Claude Code 插件,用户可直接在 Claude Code 中调用 Codex,使用 ChatGPT 订阅完成代码审查,或把任务委派给 Codex。
插件作者 Dominik Kundel 写道,这款插件可让 Codex 审查代码改动,也可在 Claude Code 内将任务交给 Codex 处理。GitHub README 显示,插件提供
/codex:review`、`/codex:adversarial-review`、`/codex:rescue`、`/codex:status`、`/codex:result 和 /codex:cancel 等命令,既支持只读评审,也支持后台委派任务。README 还写明,插件可通过 Claude Code 插件市场安装,要求 ChatGPT 订阅(含 Free)或 OpenAI API key,以及 Node.js 18.18 或更高版本。
信源:https://x.com/romainhuet/status/2038677236304245087
Claude Code用量限制消耗异常快,Anthropic称正在紧急排查
Anthropic 工程师 Lydia Hallie 在 X 上表示,团队已注意到用户在 Claude Code 中触达用量限制的速度「远快于预期」,正在积极调查。她随后更新称,这是团队当前的最高优先级事项,「我知道这阻碍了很多人的工作,有进展会第一时间分享」。
信源:https://x.com/lydiahallie/status/2038686571676008625
Anthropic 工程师 Lydia Hallie 在 X 上表示,团队已注意到用户在 Claude Code 中触达用量限制的速度「远快于预期」,正在积极调查。她随后更新称,这是团队当前的最高优先级事项,「我知道这阻碍了很多人的工作,有进展会第一时间分享」。
信源:https://x.com/lydiahallie/status/2038686571676008625
美团开源语音克隆模型LongCat-AudioDiT,效果超字节Seed-TTS
美团 LongCat 团队开源了语音合成模型 LongCat-AudioDiT,提供 1B 和 3.5B 两个版本,代码和权重均采用 MIT 协议。该模型的核心能力是零样本声音克隆,即只需一段参考录音,就能用该说话人的音色朗读任意新文本。
技术路线上,传统语音合成通常需要先把文本转为频谱图(一种声音的「图像表示」),再从频谱图还原为波形。LongCat-AudioDiT 跳过了频谱图这一中间步骤,直接在波形的压缩表示上做扩散生成,减少了中间环节累积的误差,整条流程只需两个组件。
在 Seed 基准测试(语音克隆领域的主流评测)上,3.5B 版本的中文说话人相似度达到 0.818,超过字节 Seed-TTS 系列中此前最优的 Seed-DiT(0.809);中文困难子集相似度达到 0.797,超过阿里 CosyVoice3.5(0.786)。论文还报告了一个反直觉发现:中间压缩环节的还原质量越高,最终合成效果反而不一定更好。
信源:https://huggingface.co/meituan-longcat/LongCat-AudioDiT-3.5B
美团 LongCat 团队开源了语音合成模型 LongCat-AudioDiT,提供 1B 和 3.5B 两个版本,代码和权重均采用 MIT 协议。该模型的核心能力是零样本声音克隆,即只需一段参考录音,就能用该说话人的音色朗读任意新文本。
技术路线上,传统语音合成通常需要先把文本转为频谱图(一种声音的「图像表示」),再从频谱图还原为波形。LongCat-AudioDiT 跳过了频谱图这一中间步骤,直接在波形的压缩表示上做扩散生成,减少了中间环节累积的误差,整条流程只需两个组件。
在 Seed 基准测试(语音克隆领域的主流评测)上,3.5B 版本的中文说话人相似度达到 0.818,超过字节 Seed-TTS 系列中此前最优的 Seed-DiT(0.809);中文困难子集相似度达到 0.797,超过阿里 CosyVoice3.5(0.786)。论文还报告了一个反直觉发现:中间压缩环节的还原质量越高,最终合成效果反而不一定更好。
信源:https://huggingface.co/meituan-longcat/LongCat-AudioDiT-3.5B
狂点版本号就能白嫖AI:小米新输入法明文暴露字节豆包模型密钥
小米 MiClaw 团队新推出的系统输入法存在严重安全疏忽。网友测试发现,只需疯狂点击输入法的版本号即可打开调试页面,页面中直接暴露了 AI 服务的 API 调用地址、API Key、模型提供商和模型名称,均以明文写入代码。
泄露的 API 地址指向字节跳动旗下云服务平台火山引擎的 Ark 接口,使用的模型为豆包系列的 doubao-seed-1-6-lite-251015。从提示词来看,该 AI 功能用于语音输入后处理,负责修正语音识别文本中的错别字、语法错误并添加标点。网友测试确认密钥真实有效,可在外部平台直接调用,目前小米疑似已更换密钥。
反编译代码还暴露了工程质量问题:开发者用
此外,小米在 GitHub 开源项目 mone 的代码提交中也被发现明文写入了 AI 公司月之暗面(Moonshot)的 API 密钥,提交时间为 2025 年 1 月,此后未见变动记录。
信源:https://www.nodeseek.com/post-669430-1
小米 MiClaw 团队新推出的系统输入法存在严重安全疏忽。网友测试发现,只需疯狂点击输入法的版本号即可打开调试页面,页面中直接暴露了 AI 服务的 API 调用地址、API Key、模型提供商和模型名称,均以明文写入代码。
泄露的 API 地址指向字节跳动旗下云服务平台火山引擎的 Ark 接口,使用的模型为豆包系列的 doubao-seed-1-6-lite-251015。从提示词来看,该 AI 功能用于语音输入后处理,负责修正语音识别文本中的错别字、语法错误并添加标点。网友测试确认密钥真实有效,可在外部平台直接调用,目前小米疑似已更换密钥。
反编译代码还暴露了工程质量问题:开发者用
if ("固定字符串".length() > 0) 的方式判断一个永远为真的硬编码字符串是否非空,这种写法不会出现在任何正常的代码审查流程中。此外,小米在 GitHub 开源项目 mone 的代码提交中也被发现明文写入了 AI 公司月之暗面(Moonshot)的 API 密钥,提交时间为 2025 年 1 月,此后未见变动记录。
信源:https://www.nodeseek.com/post-669430-1