「套近乎、要报告、出同款」:AI检索初创SID指控向量数据库Chroma抄袭其研究成果
AI 检索研究公司 SID.ai CEO Max Rumpf 在 X 上发长文,公开指控开源向量数据库 Chroma 刚发布的 Context-1 模型大量借鉴了 SID 去年 12 月发布的 SID-1 研究成果,且未给予任何引用或致谢。
Rumpf 晒出与 Chroma CEO Jeff Huber 的邮件往来作为证据。2025 年 10 月,Huber 主动询问 Rumpf 在训练什么模型,Rumpf 回复称正在做「智能体检索模型,类似 Cognition 的 SWE-grep 但用于通用检索,已经比 Sonnet 4.5 和 Gemini 2.5 Pro 更强」。2025 年 12 月 SID-1 技术报告发布后,Rumpf 再次向 Huber 分享了链接,Huber 回复「恭喜」。两家公司同为 YC 校友,办公室相邻。
SID-1 和 Context-1 均为用强化学习训练的智能体检索模型,均定位为前沿推理模型的检索子代理,均使用合成数据训练,均声称在成本和延迟上达到帕累托前沿。Rumpf 列举的具体相似点包括:Figure 1 采用相同的速度/成本双视图切换、4 路并行推理配合 RRF(倒数排名融合)聚合结果,以及图表、数据集和方法论的整体框架。
Context-1 的技术报告在相关工作章节引用了 WebExplorer、SWE-grep、Search-R1 等同领域研究,但全文未提及 SID-1,基准评测也未将 SID-1 纳入对比。Rumpf 称 Chroma「明知还有另一个模型存在」却声称「帕累托最优」,并指出 Context-1 虽开源了权重,但运行所需的推理框架尚未发布,导致 SID 无法对其进行基准测试。
Rumpf 表示这种做法「完全摧毁了我们(以及其他人)在技术报告中深入分享的动力」,并称之为「学术界令人遗憾的糟糕研究惯例正在向创业公司蔓延」。Chroma 方面截至发稿未公开回应。
信源:https://x.com/maxrumpf/status/2037365748973384154
AI 检索研究公司 SID.ai CEO Max Rumpf 在 X 上发长文,公开指控开源向量数据库 Chroma 刚发布的 Context-1 模型大量借鉴了 SID 去年 12 月发布的 SID-1 研究成果,且未给予任何引用或致谢。
Rumpf 晒出与 Chroma CEO Jeff Huber 的邮件往来作为证据。2025 年 10 月,Huber 主动询问 Rumpf 在训练什么模型,Rumpf 回复称正在做「智能体检索模型,类似 Cognition 的 SWE-grep 但用于通用检索,已经比 Sonnet 4.5 和 Gemini 2.5 Pro 更强」。2025 年 12 月 SID-1 技术报告发布后,Rumpf 再次向 Huber 分享了链接,Huber 回复「恭喜」。两家公司同为 YC 校友,办公室相邻。
SID-1 和 Context-1 均为用强化学习训练的智能体检索模型,均定位为前沿推理模型的检索子代理,均使用合成数据训练,均声称在成本和延迟上达到帕累托前沿。Rumpf 列举的具体相似点包括:Figure 1 采用相同的速度/成本双视图切换、4 路并行推理配合 RRF(倒数排名融合)聚合结果,以及图表、数据集和方法论的整体框架。
Context-1 的技术报告在相关工作章节引用了 WebExplorer、SWE-grep、Search-R1 等同领域研究,但全文未提及 SID-1,基准评测也未将 SID-1 纳入对比。Rumpf 称 Chroma「明知还有另一个模型存在」却声称「帕累托最优」,并指出 Context-1 虽开源了权重,但运行所需的推理框架尚未发布,导致 SID 无法对其进行基准测试。
Rumpf 表示这种做法「完全摧毁了我们(以及其他人)在技术报告中深入分享的动力」,并称之为「学术界令人遗憾的糟糕研究惯例正在向创业公司蔓延」。Chroma 方面截至发稿未公开回应。
信源:https://x.com/maxrumpf/status/2037365748973384154
X (formerly Twitter)
Max Rumpf (@maxrumpf) on X
Chroma's "new" model sure seems familiar. A story.
Imitation is the sincerest form of flattery. But there is a point where it goes from "inspiration" to whatever Context-1 is:
6 months ago, Chroma's CEO @jeffreyhuber asked us about our research. 4 months…
Imitation is the sincerest form of flattery. But there is a point where it goes from "inspiration" to whatever Context-1 is:
6 months ago, Chroma's CEO @jeffreyhuber asked us about our research. 4 months…
用你的嗓音做AI音乐:Suno v5.5上线声音克隆和风格定制
AI 音乐生成平台 Suno 发布 v5.5 模型,称其为「迄今最佳、最具表现力的模型」,同步上线三项个性化功能:Voices、Custom Models 和 My Taste。
Voices 是社区呼声最高的功能,允许 Pro 和 Premier 订阅用户上传或实时录制自己的歌声,用于 AI 音乐创作。系统内置验证流程,要求用户朗读一段随机文本并与上传的歌声进行声纹匹配,防止冒用他人声音。声音档案默认私有,仅本人可使用,Suno 表示未来将开放声音分享,但会确保用户始终拥有控制权。
Custom Models 允许用户上传自己的原创作品,基于 v5.5 训练出了解其风格的个性化模型版本,Pro 和 Premier 用户最多可创建 3 个。My Taste 是偏好学习功能,系统随时间积累用户偏好的曲风和情绪,面向所有用户开放。
Suno 称这些功能为今年晚些时候与音乐行业合作推出的下一代模型奠定基础,去年 11 月 Suno 已与华纳音乐集团达成合作伙伴关系。
信源:https://suno.com/blog/v5-5
AI 音乐生成平台 Suno 发布 v5.5 模型,称其为「迄今最佳、最具表现力的模型」,同步上线三项个性化功能:Voices、Custom Models 和 My Taste。
Voices 是社区呼声最高的功能,允许 Pro 和 Premier 订阅用户上传或实时录制自己的歌声,用于 AI 音乐创作。系统内置验证流程,要求用户朗读一段随机文本并与上传的歌声进行声纹匹配,防止冒用他人声音。声音档案默认私有,仅本人可使用,Suno 表示未来将开放声音分享,但会确保用户始终拥有控制权。
Custom Models 允许用户上传自己的原创作品,基于 v5.5 训练出了解其风格的个性化模型版本,Pro 和 Premier 用户最多可创建 3 个。My Taste 是偏好学习功能,系统随时间积累用户偏好的曲风和情绪,面向所有用户开放。
Suno 称这些功能为今年晚些时候与音乐行业合作推出的下一代模型奠定基础,去年 11 月 Suno 已与华纳音乐集团达成合作伙伴关系。
信源:https://suno.com/blog/v5-5
Suno
Suno v5.5: More Expressive. More You.
Introducing Suno v5.5 with Voices, Custom models and My Taste
Cohere开源语音识别模型Transcribe:20亿参数登顶HuggingFace榜单,超越Whisper和ElevenLabs
企业 AI 公司 Cohere 发布开源语音识别模型 Transcribe,20 亿参数,基于 Conformer 编码器-解码器架构从头训练,以 Apache 2.0 协议开源,权重已在 HuggingFace 上线。
该模型在 HuggingFace Open ASR Leaderboard 上以平均词错率(WER)5.42% 排名第一,超越 Zoom Scribe v1(5.47%)、IBM Granite 4.0(5.52%)、NVIDIA Canary Qwen(5.63%)、Qwen3-ASR(5.76%)、ElevenLabs Scribe v2(5.83%)和 OpenAI Whisper Large v3(7.44%)。在多说话人环境、会议室声学和多口音场景中均表现领先。人工评测中,Transcribe 在与七个竞品的逐对比较中平均胜率 61%。
模型支持 14 种语言,覆盖英语、法语、德语、中文、日语、韩语、阿拉伯语等。Cohere 表示将把 Transcribe 整合进其 AI Agent 编排平台 North,从单一转录模型演进为企业语音智能的基础组件。
信源:https://cohere.com/blog/transcribe
企业 AI 公司 Cohere 发布开源语音识别模型 Transcribe,20 亿参数,基于 Conformer 编码器-解码器架构从头训练,以 Apache 2.0 协议开源,权重已在 HuggingFace 上线。
该模型在 HuggingFace Open ASR Leaderboard 上以平均词错率(WER)5.42% 排名第一,超越 Zoom Scribe v1(5.47%)、IBM Granite 4.0(5.52%)、NVIDIA Canary Qwen(5.63%)、Qwen3-ASR(5.76%)、ElevenLabs Scribe v2(5.83%)和 OpenAI Whisper Large v3(7.44%)。在多说话人环境、会议室声学和多口音场景中均表现领先。人工评测中,Transcribe 在与七个竞品的逐对比较中平均胜率 61%。
模型支持 14 种语言,覆盖英语、法语、德语、中文、日语、韩语、阿拉伯语等。Cohere 表示将把 Transcribe 整合进其 AI Agent 编排平台 North,从单一转录模型演进为企业语音智能的基础组件。
信源:https://cohere.com/blog/transcribe
Cline发布看板式多Agent调度器:每张卡片一个独立分支,支持Claude Code和Codex
开源 AI 编程工具 Cline 发布 Cline Kanban,一款本地运行的看板式多 Agent 调度界面,允许开发者在同一个代码仓库中同时运行多个编程 Agent 并行工作。通过
核心机制是每张任务卡片自动创建一个独立的 git worktree(临时工作树),每个 Agent 在各自的目录和终端中工作,分支互不干扰,主工作区不受影响。gitignored 文件(如 `node_modules`)通过符号链接共享,无需为每个任务重新安装依赖。开发者可在界面中实时查看每张卡片的代码变更 diff,并像代码审查一样对任意行留下内联评论反馈给 Agent。
任务卡片之间可通过 ⌘+点击建立依赖链:前置任务完成后自动触发下一个任务,配合自动提交和自动创建 PR 功能,形成全自动流水线。该工具还支持从 Linear 导入工单,将整个 Sprint 待办事项一次性转化为 Agent 任务。兼容 Claude Code、OpenAI Codex 和 Cline 自身的 CLI,更多 Agent 即将接入。
Cline 此前以 VS Code 插件起步,已有超过 500 万开发者安装,今年 2 月发布的 CLI 2.0 引入了并行执行和无头 CI/CD 能力,Kanban 是在此基础上的可视化调度层。
信源:https://x.com/cline/status/2037182739695493399
开源 AI 编程工具 Cline 发布 Cline Kanban,一款本地运行的看板式多 Agent 调度界面,允许开发者在同一个代码仓库中同时运行多个编程 Agent 并行工作。通过
npm i -g cline 安装,需要 Node.js 18+ 和任意支持的 API 密钥(Anthropic、OpenAI、谷歌、Mistral 等),也可使用免费模型。目前为研究预览版。核心机制是每张任务卡片自动创建一个独立的 git worktree(临时工作树),每个 Agent 在各自的目录和终端中工作,分支互不干扰,主工作区不受影响。gitignored 文件(如 `node_modules`)通过符号链接共享,无需为每个任务重新安装依赖。开发者可在界面中实时查看每张卡片的代码变更 diff,并像代码审查一样对任意行留下内联评论反馈给 Agent。
任务卡片之间可通过 ⌘+点击建立依赖链:前置任务完成后自动触发下一个任务,配合自动提交和自动创建 PR 功能,形成全自动流水线。该工具还支持从 Linear 导入工单,将整个 Sprint 待办事项一次性转化为 Agent 任务。兼容 Claude Code、OpenAI Codex 和 Cline 自身的 CLI,更多 Agent 即将接入。
Cline 此前以 VS Code 插件起步,已有超过 500 万开发者安装,今年 2 月发布的 CLI 2.0 引入了并行执行和无头 CI/CD 能力,Kanban 是在此基础上的可视化调度层。
信源:https://x.com/cline/status/2037182739695493399
Mistral发布TTS模型Voxtral:40亿参数9种语言,3秒音频即可克隆声音
法国 AI 公司 Mistral 发布 Voxtral TTS,这是其首个文本转语音模型,参数量 40 亿,支持英语、法语、德语、西班牙语、荷兰语、葡萄牙语、意大利语、印地语和阿拉伯语 9 种语言。模型仅需最短 3 秒的语音样本即可克隆目标声音,捕捉说话者的停顿节奏、语调和情绪表达特征。
人类评测显示,在零样本自定义语音场景下,Voxtral TTS 的自然度优于 ElevenLabs Flash v2.5,与 ElevenLabs v3 持平。模型延迟 70 毫秒(基于 10 秒语音样本和 500 字符输入),实时因子约 9.7 倍,单次可生成最长 2 分钟音频。模型还具备零样本跨语言语音迁移能力,例如输入法语语音样本和英语文本,生成的语音会自然带有法语口音。
架构基于 Ministral 3B,由 34 亿参数 Transformer 解码器骨干网络、3.9 亿参数 flow-matching 声学 Transformer 和 3 亿参数自研神经音频编解码器三部分组成。定价 $0.016/千字符,已通过 API 和 Le Chat 上线。模型权重以 CC BY-NC 4.0 许可证在 Hugging Face 开放,仅限非商业用途。
信源:https://mistral.ai/news/voxtral-tts
法国 AI 公司 Mistral 发布 Voxtral TTS,这是其首个文本转语音模型,参数量 40 亿,支持英语、法语、德语、西班牙语、荷兰语、葡萄牙语、意大利语、印地语和阿拉伯语 9 种语言。模型仅需最短 3 秒的语音样本即可克隆目标声音,捕捉说话者的停顿节奏、语调和情绪表达特征。
人类评测显示,在零样本自定义语音场景下,Voxtral TTS 的自然度优于 ElevenLabs Flash v2.5,与 ElevenLabs v3 持平。模型延迟 70 毫秒(基于 10 秒语音样本和 500 字符输入),实时因子约 9.7 倍,单次可生成最长 2 分钟音频。模型还具备零样本跨语言语音迁移能力,例如输入法语语音样本和英语文本,生成的语音会自然带有法语口音。
架构基于 Ministral 3B,由 34 亿参数 Transformer 解码器骨干网络、3.9 亿参数 flow-matching 声学 Transformer 和 3 亿参数自研神经音频编解码器三部分组成。定价 $0.016/千字符,已通过 API 和 Le Chat 上线。模型权重以 CC BY-NC 4.0 许可证在 Hugging Face 开放,仅限非商业用途。
信源:https://mistral.ai/news/voxtral-tts
让2000个Agent协同预测金价:OpenAI投资AI集群初创Isara,估值6.5亿美元
AI Agent 协调初创公司 Isara 完成 9400 万美元融资,OpenAI 参投,估值 6.5 亿美元。其他投资者包括风投公司 Amity Ventures、Michael Ovitz 和 Stanley Druckenmiller。
Isara 的目标是构建让数千个 AI Agent 相互通信、协同解决复杂问题的软件,初期聚焦金融和生物科技领域。创始人在今年早些时候 Allen & Co. 科技峰会上展示了早期版本:约 2000 个 AI Agent 协同工作,预测黄金价格走势。Amity Ventures 的 CJ Reim 将这一方法描述为协调「专家蜂群」为用户执行研究任务。公司初期目标客户为投资机构和金融服务公司,用于预测建模。
Isara 去年 6 月在旧金山成立,两位联合创始人均为 23 岁:Eddie Zhang 此前在哈佛攻读计算机科学博士学位,离开 OpenAI 后创业;Henry Gasztowtt 此前在牛津大学攻读计算机科学本科。两人于 2024 年 6 月合著了一篇关于 AI 系统协同改善政策制定的学术论文,Isara 即脱胎于此。公司已从谷歌、Meta 和 OpenAI 等招募了约 12 名研究人员。
信源:https://www.wsj.com/tech/ai/openai-backs-new-ai-startup-seeking-bot-army-breakthroughs-a0b1fedc
AI Agent 协调初创公司 Isara 完成 9400 万美元融资,OpenAI 参投,估值 6.5 亿美元。其他投资者包括风投公司 Amity Ventures、Michael Ovitz 和 Stanley Druckenmiller。
Isara 的目标是构建让数千个 AI Agent 相互通信、协同解决复杂问题的软件,初期聚焦金融和生物科技领域。创始人在今年早些时候 Allen & Co. 科技峰会上展示了早期版本:约 2000 个 AI Agent 协同工作,预测黄金价格走势。Amity Ventures 的 CJ Reim 将这一方法描述为协调「专家蜂群」为用户执行研究任务。公司初期目标客户为投资机构和金融服务公司,用于预测建模。
Isara 去年 6 月在旧金山成立,两位联合创始人均为 23 岁:Eddie Zhang 此前在哈佛攻读计算机科学博士学位,离开 OpenAI 后创业;Henry Gasztowtt 此前在牛津大学攻读计算机科学本科。两人于 2024 年 6 月合著了一篇关于 AI 系统协同改善政策制定的学术论文,Isara 即脱胎于此。公司已从谷歌、Meta 和 OpenAI 等招募了约 12 名研究人员。
信源:https://www.wsj.com/tech/ai/openai-backs-new-ai-startup-seeking-bot-army-breakthroughs-a0b1fedc
让Claude Code自己搞研究,自动发现的越狱算法碾压30多种人工方法
ELLIS Institute Tübingen 的 Maksym Andriushchenko 等研究者发表论文「Claudini」,展示用 Claude Code 驱动的自动研究(autoresearch)管线,从现有攻击算法(如 GCG)出发,自主迭代发现了全新的白盒对抗攻击算法,在越狱和提示词注入评测中大幅超越已有的 30 多种方法。
核心结果:在针对 GPT-OSS-Safeguard-20B 的 CBRN(化学、生物、放射、核)类查询测试中,自动发现的算法攻击成功率达 40%,而现有最佳方法仅约 10%。更值得注意的是这些攻击的迁移性,在代理模型上优化的攻击直接迁移到未见过的目标模型后,对 Meta-SecAlign-70B 达到 100% 攻击成功率,现有最佳基线仅 56%。
研究者指出,白盒对抗红队测试特别适合自动化研究:现有方法提供了扎实的起点,优化目标能产生密集的量化反馈,使 LLM Agent 能够持续迭代改进。论文认为这是增量式安全研究可被 AI 自动化的早期实证。全部发现的攻击算法、基线实现和评测代码已在 GitHub 开源。
信源:https://arxiv.org/abs/2603.24511
ELLIS Institute Tübingen 的 Maksym Andriushchenko 等研究者发表论文「Claudini」,展示用 Claude Code 驱动的自动研究(autoresearch)管线,从现有攻击算法(如 GCG)出发,自主迭代发现了全新的白盒对抗攻击算法,在越狱和提示词注入评测中大幅超越已有的 30 多种方法。
核心结果:在针对 GPT-OSS-Safeguard-20B 的 CBRN(化学、生物、放射、核)类查询测试中,自动发现的算法攻击成功率达 40%,而现有最佳方法仅约 10%。更值得注意的是这些攻击的迁移性,在代理模型上优化的攻击直接迁移到未见过的目标模型后,对 Meta-SecAlign-70B 达到 100% 攻击成功率,现有最佳基线仅 56%。
研究者指出,白盒对抗红队测试特别适合自动化研究:现有方法提供了扎实的起点,优化目标能产生密集的量化反馈,使 LLM Agent 能够持续迭代改进。论文认为这是增量式安全研究可被 AI 自动化的早期实证。全部发现的攻击算法、基线实现和评测代码已在 GitHub 开源。
信源:https://arxiv.org/abs/2603.24511
淘宝天猫3月31日上线「龙虾」版生意管家:不只是工具,要做商家的7x24小时数字员工
淘宝天猫将于 3 月 31 日起逐步向商家开放「龙虾」版生意管家,为每个商家建立一支 Agent 团队,7x24 小时自主经营店铺。天猫总裁家洛在 3 月 26 日的天猫 TOPTALK 超级品牌私享会上公布了这一计划。
与过去一年 500 多万商家使用的 AI 工具不同,「龙虾」版生意管家的定位是具备自主执行能力的「数字员工」,能自行生成策略、执行调整、监控效果并迭代优化。淘天集团商家品牌总经理九鼎举例称,当系统发现核心爆款商品定价与市场趋势存在偏差时,会自动形成调整方案、执行测试并反馈数据,而非仅发出提醒。操作上力求「一键安装启用」,降低技术门槛。
初期功能涵盖三个模块:经营数据分析(持续扫描经营状况、预警风险、识别机会)、素材与广告优化(生成千人千面展示内容、自动测试投放组合)、智能导购(理解用户潜在需求并精准推荐)。平台后续将与商家、服务商共同丰富技能库。
此外,天猫同步宣布多项 2026 年经营举措:投入百亿规模的「店铺 AI 红包」,对高潜力新客自动发放限时优惠;推出「广告智能跟投」,对效果良好的商家广告追加平台投入;为新品预备 600 亿专项流量支持上市曝光。家洛还透露,88VIP 会员规模已接近 6000 万,天猫头部品牌一半销售额由 88VIP 贡献。
信源:https://mp.weixin.qq.com/s/9RVhel6fdNgH2-0U-HjQrA
淘宝天猫将于 3 月 31 日起逐步向商家开放「龙虾」版生意管家,为每个商家建立一支 Agent 团队,7x24 小时自主经营店铺。天猫总裁家洛在 3 月 26 日的天猫 TOPTALK 超级品牌私享会上公布了这一计划。
与过去一年 500 多万商家使用的 AI 工具不同,「龙虾」版生意管家的定位是具备自主执行能力的「数字员工」,能自行生成策略、执行调整、监控效果并迭代优化。淘天集团商家品牌总经理九鼎举例称,当系统发现核心爆款商品定价与市场趋势存在偏差时,会自动形成调整方案、执行测试并反馈数据,而非仅发出提醒。操作上力求「一键安装启用」,降低技术门槛。
初期功能涵盖三个模块:经营数据分析(持续扫描经营状况、预警风险、识别机会)、素材与广告优化(生成千人千面展示内容、自动测试投放组合)、智能导购(理解用户潜在需求并精准推荐)。平台后续将与商家、服务商共同丰富技能库。
此外,天猫同步宣布多项 2026 年经营举措:投入百亿规模的「店铺 AI 红包」,对高潜力新客自动发放限时优惠;推出「广告智能跟投」,对效果良好的商家广告追加平台投入;为新品预备 600 亿专项流量支持上市曝光。家洛还透露,88VIP 会员规模已接近 6000 万,天猫头部品牌一半销售额由 88VIP 贡献。
信源:https://mp.weixin.qq.com/s/9RVhel6fdNgH2-0U-HjQrA
火山引擎推出短剧生产Agent「火山剧创」:接入Seedance 2.0,制作周期缩短80%以上
火山引擎正式开启短剧生产 Agent「火山剧创」邀测,接入字节跳动视频生成模型 Seedance 2.0,采用工业级多 Agent 协同架构,覆盖剧本解析、素材设定、分镜生成、视频生成、剪辑导出全流程,称可将短剧制作周期缩短 80% 以上。
核心能力包括:
1. 剧本直出分镜:用户上传剧本后,Agent 自动读取剧情逻辑和叙事节奏,拆解出符合影视工业标准的专业分镜脚本,无需手动转写提示词。
2. 角色场景一致性:支持全局风格锁定(2D/3D/仿真人等),用户可在创作初期自定义角色、变装、场景和道具,形成可复用的素材资产库,系统通过上下文状态追踪减少人设崩坏与场景穿帮。
3. 分镜解析与镜头策略:接入 Seedance 2.0 后分镜信息解析更精准,内置 200 多种爆款镜头策略,引入多 Agent 校验机制,镜头直接可用率大幅提升。确认的分镜序列可一键导出至剪映。
系统还支持企业级资产管理、多人协同创作与历史版本回溯,面向承制方和内容制作机构的规模化生产需求。
信源:https://mp.weixin.qq.com/s/-Q5MUeYWIS2Iu0GNAIAC-g
火山引擎正式开启短剧生产 Agent「火山剧创」邀测,接入字节跳动视频生成模型 Seedance 2.0,采用工业级多 Agent 协同架构,覆盖剧本解析、素材设定、分镜生成、视频生成、剪辑导出全流程,称可将短剧制作周期缩短 80% 以上。
核心能力包括:
1. 剧本直出分镜:用户上传剧本后,Agent 自动读取剧情逻辑和叙事节奏,拆解出符合影视工业标准的专业分镜脚本,无需手动转写提示词。
2. 角色场景一致性:支持全局风格锁定(2D/3D/仿真人等),用户可在创作初期自定义角色、变装、场景和道具,形成可复用的素材资产库,系统通过上下文状态追踪减少人设崩坏与场景穿帮。
3. 分镜解析与镜头策略:接入 Seedance 2.0 后分镜信息解析更精准,内置 200 多种爆款镜头策略,引入多 Agent 校验机制,镜头直接可用率大幅提升。确认的分镜序列可一键导出至剪映。
系统还支持企业级资产管理、多人协同创作与历史版本回溯,面向承制方和内容制作机构的规模化生产需求。
信源:https://mp.weixin.qq.com/s/-Q5MUeYWIS2Iu0GNAIAC-g
扎克伯格出价更高却输了:谷歌6.5亿美元收购DeepMind内幕首次披露
记者 Sebastian Mallaby 的新书《The Infinity Machine: Demis Hassabis, DeepMind and the Quest for Superintelligence》将于 3 月 31 日出版,WSJ 刊发独家书摘,首次详细披露 2013 年谷歌与 Facebook(现 Meta)争夺 DeepMind 的收购内幕。本书基于对 Hassabis 超过 30 小时的采访,以及与 DeepMind 同事、投资人和收购相关人士的数十次对话。
2013 年 6 月,谷歌时任 CEO Larry Page 在马斯克的生日派对上向 DeepMind 创始人 Demis Hassabis 提出收购意向:「你的真正使命是造 AGI,为什么不利用我已经积累的资源?」Hassabis 回忆称这番话说服了他:「我受够了四处奔波筹钱。我去谷歌,拿一大堆计算资源,然后解决智能问题。」
Facebook CEO 扎克伯格同时参与竞购。Facebook 企业发展负责人 Amin Zoufonoun 提出了一个让创始人更富有的方案:压低股权收购价,但给予创始人和核心成员巨额签约奖金。然而 Zoufonoun 对 DeepMind 联合创始人 Mustafa Suleyman(现为微软 AI 部门 CEO)提出的 AI 治理议题不以为然。Hassabis 随后赴扎克伯格家中共进晚餐,席间故意将话题从 AI 延伸到虚拟现实、增强现实、3D 打印,发现扎克伯格对所有技术同样兴奋。「这告诉了我需要知道的一切,」Hassabis 后来说,「Facebook 出价更高,但我想要一个真正理解 AI 为何比其他一切都重要的人。」
谈判中,Suleyman 利用扑克选手的本能虚张声势,向谷歌强调 DeepMind 背后有 Peter Thiel、马斯克等亿万富翁投资人撑腰(「当然,这些人并没有真的在支持我们」)。Hassabis 为出售设定了多项条件:DeepMind 留在伦敦、禁止军事应用、成立由外部科学家和哲学家组成的独立伦理与安全审查委员会,以稀释谷歌对技术的控制权。谷歌首席谈判代表 Don Harrison 称这些条件「对我来说是个大问题」,但最终让步,因为「如果不是绝对相信 Demis 代表我们 AI 战略的未来,我们不可能同意这个架构」。
2014 年 1 月底,谷歌以 6.5 亿美元完成收购。被拒的扎克伯格随即挖来深度学习先驱、纽约大学教授 Yann LeCun 组建 Facebook AI 实验室,LeCun 上任后立即尝试从 DeepMind 挖角核心研究员。Mallaby 在书中称这笔收购「以今天的标准衡量是一笔便宜货」,而真正的回报在此后十年逐步兑现,谷歌向 DeepMind 投入了数十亿美元研究经费。
信源:https://www.wsj.com/tech/ai/deepmind-google-demis-hassabis-5bd6de54
记者 Sebastian Mallaby 的新书《The Infinity Machine: Demis Hassabis, DeepMind and the Quest for Superintelligence》将于 3 月 31 日出版,WSJ 刊发独家书摘,首次详细披露 2013 年谷歌与 Facebook(现 Meta)争夺 DeepMind 的收购内幕。本书基于对 Hassabis 超过 30 小时的采访,以及与 DeepMind 同事、投资人和收购相关人士的数十次对话。
2013 年 6 月,谷歌时任 CEO Larry Page 在马斯克的生日派对上向 DeepMind 创始人 Demis Hassabis 提出收购意向:「你的真正使命是造 AGI,为什么不利用我已经积累的资源?」Hassabis 回忆称这番话说服了他:「我受够了四处奔波筹钱。我去谷歌,拿一大堆计算资源,然后解决智能问题。」
Facebook CEO 扎克伯格同时参与竞购。Facebook 企业发展负责人 Amin Zoufonoun 提出了一个让创始人更富有的方案:压低股权收购价,但给予创始人和核心成员巨额签约奖金。然而 Zoufonoun 对 DeepMind 联合创始人 Mustafa Suleyman(现为微软 AI 部门 CEO)提出的 AI 治理议题不以为然。Hassabis 随后赴扎克伯格家中共进晚餐,席间故意将话题从 AI 延伸到虚拟现实、增强现实、3D 打印,发现扎克伯格对所有技术同样兴奋。「这告诉了我需要知道的一切,」Hassabis 后来说,「Facebook 出价更高,但我想要一个真正理解 AI 为何比其他一切都重要的人。」
谈判中,Suleyman 利用扑克选手的本能虚张声势,向谷歌强调 DeepMind 背后有 Peter Thiel、马斯克等亿万富翁投资人撑腰(「当然,这些人并没有真的在支持我们」)。Hassabis 为出售设定了多项条件:DeepMind 留在伦敦、禁止军事应用、成立由外部科学家和哲学家组成的独立伦理与安全审查委员会,以稀释谷歌对技术的控制权。谷歌首席谈判代表 Don Harrison 称这些条件「对我来说是个大问题」,但最终让步,因为「如果不是绝对相信 Demis 代表我们 AI 战略的未来,我们不可能同意这个架构」。
2014 年 1 月底,谷歌以 6.5 亿美元完成收购。被拒的扎克伯格随即挖来深度学习先驱、纽约大学教授 Yann LeCun 组建 Facebook AI 实验室,LeCun 上任后立即尝试从 DeepMind 挖角核心研究员。Mallaby 在书中称这笔收购「以今天的标准衡量是一笔便宜货」,而真正的回报在此后十年逐步兑现,谷歌向 DeepMind 投入了数十亿美元研究经费。
信源:https://www.wsj.com/tech/ai/deepmind-google-demis-hassabis-5bd6de54
CCF倡议抵制、中国科协停止资助,NeurIPS数小时内道歉认错:限制中国机构投稿系「沟通误解」
AI 顶会 NeurIPS 在 2026 年征稿规则中首次引入美国制裁合规要求,依据美国财政部特别指定国民名单(SDN List),禁止包括华为在内的数百家中国机构投稿、参与评审及担任编辑。这一举措在中国学术界引发强烈反弹,并在数小时内迫使 NeurIPS 公开撤回。
中国计算机学会(CCF)率先发声,倡议全体中国计算机领域科研工作者拒绝向 NeurIPS 投稿、拒绝提供审稿和编辑等任何学术服务,并警告若 NeurIPS 不及时纠正,将把其移出《CCF 推荐国际学术会议和期刊目录》。中国科协进一步升级反制措施:即日起停止受理学者参加 2026 年 NeurIPS 会议的资助申请,本届 NeurIPS 收录论文作为代表作申请中国科协所有项目均不予认可。多位学者也公开宣布拒绝担任本届 NeurIPS 领域主席。
NeurIPS 随后在 X 上发布道歉声明,称「这一错误源于 NeurIPS 基金会与法律团队之间的沟通误解」,「从未打算在强制性合规义务之外限制投稿」,已更新手册与 ACM、IEEE 及往届 NeurIPS 投稿规则保持一致,欢迎所有符合合规要求的机构和个人提交论文。
信源:https://x.com/NeurIPSConf/status/2037438893457289364
AI 顶会 NeurIPS 在 2026 年征稿规则中首次引入美国制裁合规要求,依据美国财政部特别指定国民名单(SDN List),禁止包括华为在内的数百家中国机构投稿、参与评审及担任编辑。这一举措在中国学术界引发强烈反弹,并在数小时内迫使 NeurIPS 公开撤回。
中国计算机学会(CCF)率先发声,倡议全体中国计算机领域科研工作者拒绝向 NeurIPS 投稿、拒绝提供审稿和编辑等任何学术服务,并警告若 NeurIPS 不及时纠正,将把其移出《CCF 推荐国际学术会议和期刊目录》。中国科协进一步升级反制措施:即日起停止受理学者参加 2026 年 NeurIPS 会议的资助申请,本届 NeurIPS 收录论文作为代表作申请中国科协所有项目均不予认可。多位学者也公开宣布拒绝担任本届 NeurIPS 领域主席。
NeurIPS 随后在 X 上发布道歉声明,称「这一错误源于 NeurIPS 基金会与法律团队之间的沟通误解」,「从未打算在强制性合规义务之外限制投稿」,已更新手册与 ACM、IEEE 及往届 NeurIPS 投稿规则保持一致,欢迎所有符合合规要求的机构和个人提交论文。
信源:https://x.com/NeurIPSConf/status/2037438893457289364
AI自主写的论文通过了顶会同行评审,这项研究本身也登上了Nature
东京 AI 研究公司 Sakana AI(由 Transformer 论文共同作者 Llion Jones 和前 Google Brain 研究员 David Ha 创立)联合英属哥伦比亚大学、Vector Institute 和牛津大学的研究者在 Nature 发表论文,展示了一条能自动走完科研全流程的 AI 管线「The AI Scientist」:从提出假设、检索文献、设计并执行实验、分析数据、绘制图表,到撰写完整的 LaTeX 论文并自我审稿,全程无人修改。
研究团队将三篇 AI 生成的论文匿名提交至 ICLR 2025 ICBINB Workshop(该 Workshop 录用率约 70%),经人类审稿人盲审后,其中一篇获得 6、7、6 三个评分(平均 6.33),超过该 Workshop 的平均录用门槛,排名高于 55% 的人类投稿。按预设协议,论文在被接收后撤回,未正式发表。另外两篇未达到录用标准。研究团队的内部评估认为,这三篇论文均未达到 ICLR 主会(录用率约 32%)的水平。
论文还报告了两个「缩放定律」:底层基座模型越强,生成论文的质量越高,且这一相关性具有统计显著性(P < 0.00001);单篇论文分配的计算资源越多,质量也越高。团队据此推断,随着模型持续进步和推理成本下降,未来版本的 AI 科学家能力将大幅提升。
系统的无模板模式使用 o3 生成研究想法和代码审查、Claude Sonnet 4 编写实验代码、GPT-4o 处理图表等视觉任务、o4-mini 执行低成本审稿。实验执行采用并行化的 Agent 树搜索,分四个阶段推进:初步实现、超参调优、研究议程执行和消融实验。团队同步开发的「自动审稿人」在 ICLR 论文上的判断准确率与人类审稿人持平(平衡准确率 69%),为规模化评估 AI 生成的论文提供了基础。
论文同时讨论了风险:AI 论文可能淹没已不堪重负的同行评审体系、人为夸大研究履历、在未经授权的情况下复用他人成果。团队建议学术界尽快建立 AI 生成论文的披露和评估规范。
信源:https://www.nature.com/articles/s41586-026-10265-5
东京 AI 研究公司 Sakana AI(由 Transformer 论文共同作者 Llion Jones 和前 Google Brain 研究员 David Ha 创立)联合英属哥伦比亚大学、Vector Institute 和牛津大学的研究者在 Nature 发表论文,展示了一条能自动走完科研全流程的 AI 管线「The AI Scientist」:从提出假设、检索文献、设计并执行实验、分析数据、绘制图表,到撰写完整的 LaTeX 论文并自我审稿,全程无人修改。
研究团队将三篇 AI 生成的论文匿名提交至 ICLR 2025 ICBINB Workshop(该 Workshop 录用率约 70%),经人类审稿人盲审后,其中一篇获得 6、7、6 三个评分(平均 6.33),超过该 Workshop 的平均录用门槛,排名高于 55% 的人类投稿。按预设协议,论文在被接收后撤回,未正式发表。另外两篇未达到录用标准。研究团队的内部评估认为,这三篇论文均未达到 ICLR 主会(录用率约 32%)的水平。
论文还报告了两个「缩放定律」:底层基座模型越强,生成论文的质量越高,且这一相关性具有统计显著性(P < 0.00001);单篇论文分配的计算资源越多,质量也越高。团队据此推断,随着模型持续进步和推理成本下降,未来版本的 AI 科学家能力将大幅提升。
系统的无模板模式使用 o3 生成研究想法和代码审查、Claude Sonnet 4 编写实验代码、GPT-4o 处理图表等视觉任务、o4-mini 执行低成本审稿。实验执行采用并行化的 Agent 树搜索,分四个阶段推进:初步实现、超参调优、研究议程执行和消融实验。团队同步开发的「自动审稿人」在 ICLR 论文上的判断准确率与人类审稿人持平(平衡准确率 69%),为规模化评估 AI 生成的论文提供了基础。
论文同时讨论了风险:AI 论文可能淹没已不堪重负的同行评审体系、人为夸大研究履历、在未经授权的情况下复用他人成果。团队建议学术界尽快建立 AI 生成论文的披露和评估规范。
信源:https://www.nature.com/articles/s41586-026-10265-5
Axiom Math开源数学发现工具Axplorer
AI 数学公司 Axiom Math 开源了 Axplorer,一款帮助数学家发现新数学模式和构造的 AI 工具,定位为谷歌 DeepMind AlphaEvolve 的开源替代。Axplorer 基于 PatternBoost 重新设计,后者由 Axiom 研究科学家 François Charton 2024 年在 Meta 时联合开发,曾用于攻克图论中的 Turán 四环问题,但需要数千甚至上万台机器跑三周才能出结果。Axplorer 在单机上 2.5 小时即可匹配同样的成果,云计算成本仅 3 美元。
Axplorer 的工作方式是给定一个数学样本,生成类似的构造供数学家筛选,再将筛选结果反馈迭代,逐步逼近未被发现的数学模式。与 AlphaEvolve 需要大规模 GPU 集群且不对外开放不同,Axplorer 可在一台 Mac Pro 上本地运行,代码已在 GitHub 开源。Axiom 称已用 Axplorer 在图论的另外两个经典问题上匹配或刷新了已知最优结果。
Axiom Math 由 25 岁的广州姑娘洪乐潼创立,她三年修完 MIT 数学与物理双学位,获罗德学者奖学金赴牛津读硕,后从斯坦福法学博士与数学博士联合项目退学创业。公司今年 3 月完成 2 亿美元 A 轮融资,估值 16 亿美元,由 Menlo Ventures 领投。
信源:https://www.technologyreview.com/2026/03/25/1134642/this-startup-wants-to-change-how-mathematicians-do-math/
AI 数学公司 Axiom Math 开源了 Axplorer,一款帮助数学家发现新数学模式和构造的 AI 工具,定位为谷歌 DeepMind AlphaEvolve 的开源替代。Axplorer 基于 PatternBoost 重新设计,后者由 Axiom 研究科学家 François Charton 2024 年在 Meta 时联合开发,曾用于攻克图论中的 Turán 四环问题,但需要数千甚至上万台机器跑三周才能出结果。Axplorer 在单机上 2.5 小时即可匹配同样的成果,云计算成本仅 3 美元。
Axplorer 的工作方式是给定一个数学样本,生成类似的构造供数学家筛选,再将筛选结果反馈迭代,逐步逼近未被发现的数学模式。与 AlphaEvolve 需要大规模 GPU 集群且不对外开放不同,Axplorer 可在一台 Mac Pro 上本地运行,代码已在 GitHub 开源。Axiom 称已用 Axplorer 在图论的另外两个经典问题上匹配或刷新了已知最优结果。
Axiom Math 由 25 岁的广州姑娘洪乐潼创立,她三年修完 MIT 数学与物理双学位,获罗德学者奖学金赴牛津读硕,后从斯坦福法学博士与数学博士联合项目退学创业。公司今年 3 月完成 2 亿美元 A 轮融资,估值 16 亿美元,由 Menlo Ventures 领投。
信源:https://www.technologyreview.com/2026/03/25/1134642/this-startup-wants-to-change-how-mathematicians-do-math/
让AI画图前先「想一想」:字节Seed提出UniGRPO,统一优化推理与图像生成
香港中文大学和字节跳动 Seed 团队提出 UniGRPO,一个将文本推理和图像生成纳入同一强化学习回路的统一框架。核心思路是让图像生成模型在画图前先进行链式推理(chain-of-thought),扩展用户提示词,然后用 GRPO 算法同时优化「想」和「画」两个阶段,而非分开训练。
框架基于字节 Seed 的多模态模型 Bagel 构建,将「提示词 → 推理 → 图像」的完整流程建模为一个马尔可夫决策过程(MDP),文本部分使用标准 GRPO,图像部分使用 FlowGRPO。为使框架可扩展至多轮交互和多条件生成(如图像编辑),研究者对 FlowGRPO 做了两处改进:去掉训练阶段的 classifier-free guidance(CFG),消除分支计算开销,保持线性无分支的生成路径;用速度场上的 MSE 惩罚替代潜空间 KL 散度,更均匀地约束模型偏离预训练分布,有效抑制奖励黑客(reward hacking)。
实验以 1024 分辨率训练,UniGRPO 在文本对齐评测(TA Score 0.8381)和组合生成评测 GenEval(0.90)上均优于仅优化图像的 FlowGRPO(0.8208/0.86)和仅优化推理的 TextGRPO(0.8078/0.88),证实联合优化两阶段的增益大于分别优化之和。基于 FPO 的替代方案 UniFPO 训练直接崩溃,未能收敛,侧面验证了 GRPO 在此场景下的稳定性优势。
信源:https://arxiv.org/abs/2603.23500
香港中文大学和字节跳动 Seed 团队提出 UniGRPO,一个将文本推理和图像生成纳入同一强化学习回路的统一框架。核心思路是让图像生成模型在画图前先进行链式推理(chain-of-thought),扩展用户提示词,然后用 GRPO 算法同时优化「想」和「画」两个阶段,而非分开训练。
框架基于字节 Seed 的多模态模型 Bagel 构建,将「提示词 → 推理 → 图像」的完整流程建模为一个马尔可夫决策过程(MDP),文本部分使用标准 GRPO,图像部分使用 FlowGRPO。为使框架可扩展至多轮交互和多条件生成(如图像编辑),研究者对 FlowGRPO 做了两处改进:去掉训练阶段的 classifier-free guidance(CFG),消除分支计算开销,保持线性无分支的生成路径;用速度场上的 MSE 惩罚替代潜空间 KL 散度,更均匀地约束模型偏离预训练分布,有效抑制奖励黑客(reward hacking)。
实验以 1024 分辨率训练,UniGRPO 在文本对齐评测(TA Score 0.8381)和组合生成评测 GenEval(0.90)上均优于仅优化图像的 FlowGRPO(0.8208/0.86)和仅优化推理的 TextGRPO(0.8078/0.88),证实联合优化两阶段的增益大于分别优化之和。基于 FPO 的替代方案 UniFPO 训练直接崩溃,未能收敛,侧面验证了 GRPO 在此场景下的稳定性优势。
信源:https://arxiv.org/abs/2603.23500
ARC-AGI-3拆出两个排行榜:裸模型不到1%,加Agent框架后首日即达36%
ARC-AGI-3 论文将评测拆分为两个排行榜。官方排行榜禁止外部 harness(Agent 框架),所有模型使用同一极简提示词、不提供工具,测的是模型脱离脚手架后的原生智能。社区排行榜则允许 harness,得分自报,ARC Prize 默认不验证,论文明确提醒「不应将社区排行榜上的分数解读为 AGI 进展的证据」。
官方排行榜上,前沿模型得分均低于 1%:Gemini 3.1 Pro Preview 0.37%、GPT 5.4 High 0.26%、Opus 4.6 Max 0.25%、Grok 4.20 为 0%。这组数字暴露的是 LLM 在没有工程辅助时的真实自主推理水平。
社区排行榜首个公开结果来自 AI 公司 Symbolica。其 Arcgentica Agent 基于自研 Agentica SDK 构建,采用编排器加专业子代理架构(探索者、理论家、测试者、求解者),不包含任何游戏特定的提示词,在公开评测集上取得 36.08% 的未验证得分,通过 182 个可玩关卡中的 113 个,完整通关 7 款游戏。底层模型为 Opus 4.6 High(120K),全部推理成本 1005 美元,而官方排行榜上同系列 Opus 4.6 Max 裸跑 0.25% 花费 8900 美元。论文将 Symbolica 的方案列为社区早期实验的代表案例。
论文同时指出,harness 工程虽不代表 AGI 进步,但具有实际的任务自动化价值,并预期 2026 年 ARC-AGI-3 将推动 harness 创新取得显著进展。代码已在 GitHub 开源。
信源:https://www.symbolica.ai/blog/arc-agi-3
ARC-AGI-3 论文将评测拆分为两个排行榜。官方排行榜禁止外部 harness(Agent 框架),所有模型使用同一极简提示词、不提供工具,测的是模型脱离脚手架后的原生智能。社区排行榜则允许 harness,得分自报,ARC Prize 默认不验证,论文明确提醒「不应将社区排行榜上的分数解读为 AGI 进展的证据」。
官方排行榜上,前沿模型得分均低于 1%:Gemini 3.1 Pro Preview 0.37%、GPT 5.4 High 0.26%、Opus 4.6 Max 0.25%、Grok 4.20 为 0%。这组数字暴露的是 LLM 在没有工程辅助时的真实自主推理水平。
社区排行榜首个公开结果来自 AI 公司 Symbolica。其 Arcgentica Agent 基于自研 Agentica SDK 构建,采用编排器加专业子代理架构(探索者、理论家、测试者、求解者),不包含任何游戏特定的提示词,在公开评测集上取得 36.08% 的未验证得分,通过 182 个可玩关卡中的 113 个,完整通关 7 款游戏。底层模型为 Opus 4.6 High(120K),全部推理成本 1005 美元,而官方排行榜上同系列 Opus 4.6 Max 裸跑 0.25% 花费 8900 美元。论文将 Symbolica 的方案列为社区早期实验的代表案例。
论文同时指出,harness 工程虽不代表 AGI 进步,但具有实际的任务自动化价值,并预期 2026 年 ARC-AGI-3 将推动 harness 创新取得显著进展。代码已在 GitHub 开源。
信源:https://www.symbolica.ai/blog/arc-agi-3
限速之外还有故障:Claude两周累计25起服务中断,三条产品线重大宕机,Opus 4.6成重灾区
Anthropic 官方状态页面显示,Claude 5 条产品线中有 3 条当前处于「Major Outage」(重大宕机)状态:claude.ai、Claude API 和 Claude Code;platform.claude.com 和 Claude for Government 状态正常。截至发稿,有两起未解决的活跃故障:Opus 4.6 错误率升高(3 月 27 日 14:59 北京时间起,正在调查中),以及 Cowork 连接重置错误(3 月 25 日起持续至今,官方建议重启 Claude Desktop 应用作为临时解决方案)。
状态页面记录显示,3 月 13 日至 27 日的 15 天内,Claude 累计发生约 25 起独立故障事件,仅 3 月 14、15、20、24 日无故障报告。其中 Opus 4.6 相关的错误率升高事件出现频率最高,3 月 17 日至 27 日几乎每天至少一起。部分日期同时出现多起并发故障,3 月 18 日单日记录了 4 起。故障类型涵盖模型错误率升高、claude.ai 前端报错、登录系统宕机、MCP 调用失败和响应完成延迟等。90 天正常运行率方面,claude.ai 为 99.03%,Claude API 为 99.11%,Claude Code 为 99.35%。
结合 Anthropic 同日披露的高峰时段限额调整,Claude 服务正面临需求增长与容量之间的双重压力。
信源:https://status.claude.com/
Anthropic 官方状态页面显示,Claude 5 条产品线中有 3 条当前处于「Major Outage」(重大宕机)状态:claude.ai、Claude API 和 Claude Code;platform.claude.com 和 Claude for Government 状态正常。截至发稿,有两起未解决的活跃故障:Opus 4.6 错误率升高(3 月 27 日 14:59 北京时间起,正在调查中),以及 Cowork 连接重置错误(3 月 25 日起持续至今,官方建议重启 Claude Desktop 应用作为临时解决方案)。
状态页面记录显示,3 月 13 日至 27 日的 15 天内,Claude 累计发生约 25 起独立故障事件,仅 3 月 14、15、20、24 日无故障报告。其中 Opus 4.6 相关的错误率升高事件出现频率最高,3 月 17 日至 27 日几乎每天至少一起。部分日期同时出现多起并发故障,3 月 18 日单日记录了 4 起。故障类型涵盖模型错误率升高、claude.ai 前端报错、登录系统宕机、MCP 调用失败和响应完成延迟等。90 天正常运行率方面,claude.ai 为 99.03%,Claude API 为 99.11%,Claude Code 为 99.35%。
结合 Anthropic 同日披露的高峰时段限额调整,Claude 服务正面临需求增长与容量之间的双重压力。
信源:https://status.claude.com/
智谱官宣GLM-5.1上线,编码能力大幅领先前代,面向GLM Coding Plan全部用户开放
智谱官宣 GLM-5.1 现已上线,面向 GLM Coding Plan 全部用户 (Lite/Pro/Max) 开放。用户寻找配置文件将模型名称手动改为「glm-5.1」即可切换使用。
在编码能力基准(Coding Evaluation,使用 Claude Code 作为测试框架)测试中,GLM-5.1 得分 45.3,大幅领先前代 GLM-5 的 35.4。GLM-5.1 在编码任务上已非常接近 Claude Opus 4.6,进步明显。
信源:https://mp.weixin.qq.com/s/5g5-cJSuQumzZDVgiCaTuQ
智谱官宣 GLM-5.1 现已上线,面向 GLM Coding Plan 全部用户 (Lite/Pro/Max) 开放。用户寻找配置文件将模型名称手动改为「glm-5.1」即可切换使用。
在编码能力基准(Coding Evaluation,使用 Claude Code 作为测试框架)测试中,GLM-5.1 得分 45.3,大幅领先前代 GLM-5 的 35.4。GLM-5.1 在编码任务上已非常接近 Claude Opus 4.6,进步明显。
信源:https://mp.weixin.qq.com/s/5g5-cJSuQumzZDVgiCaTuQ
🔥1
Meta发布SAM 3.1:128个目标跟踪速度提升7倍,视频分割走向实时
Meta 超级智能实验室发布 Segment Anything Model 3.1(SAM 3.1),这是去年 11 月发布的视觉分割基础模型 SAM 3 的直接升级版本。
核心改进是 Object Multiplex,一种共享内存的联合多目标跟踪方法。SAM 3 此前每个目标需要独立处理,推理成本随目标数量线性增长。SAM 3.1 允许在单次前向传播中同时处理最多 16 个目标,通过共享全局上下文信息,在单张 H100 GPU 上跟踪 128 个目标时实现约 7 倍推理加速,且不牺牲精度。此外,SAM 3.1 在 7 个视频目标分割(VOS)基准中的 6 个上取得了性能提升。
SAM 3.1 为即插即用式升级,模型权重已在 Hugging Face 上开放申请下载。
信源:https://huggingface.co/facebook/sam3.1
Meta 超级智能实验室发布 Segment Anything Model 3.1(SAM 3.1),这是去年 11 月发布的视觉分割基础模型 SAM 3 的直接升级版本。
核心改进是 Object Multiplex,一种共享内存的联合多目标跟踪方法。SAM 3 此前每个目标需要独立处理,推理成本随目标数量线性增长。SAM 3.1 允许在单次前向传播中同时处理最多 16 个目标,通过共享全局上下文信息,在单张 H100 GPU 上跟踪 128 个目标时实现约 7 倍推理加速,且不牺牲精度。此外,SAM 3.1 在 7 个视频目标分割(VOS)基准中的 6 个上取得了性能提升。
SAM 3.1 为即插即用式升级,模型权重已在 Hugging Face 上开放申请下载。
信源:https://huggingface.co/facebook/sam3.1
谷歌即将敲定协议,为Anthropic租用的德州数据中心提供超50亿美元资金
谷歌即将达成一项协议,为数据中心开发商 Nexus Data Centers 在德克萨斯州的一个大型项目提供资金支持,该项目价值超过 50 亿美元,建成后将租赁给 Anthropic 使用。建设贷款预计很快敲定。
该项目占地约 2800 英亩,预计最早 2026 年底交付约 500 兆瓦容量,后续还将大幅扩容。选址靠近主要天然气管道,Nexus 计划通过自有燃气轮机直接供电,而非依赖公共电网,以规避电网接入排队延迟并降低用电高峰时段的成本。
谷歌目前通过 Google Cloud 向 Anthropic 提供其定制 TPU 芯片用于大模型训练,双方已有深度云计算合作关系。此次为 Anthropic 租用的数据中心提供基础设施融资,是这一合作的进一步延伸。
信源:https://www.ft.com/content/af949b0b-3e24-4eaa-9a52-0a841ac1ff22
谷歌即将达成一项协议,为数据中心开发商 Nexus Data Centers 在德克萨斯州的一个大型项目提供资金支持,该项目价值超过 50 亿美元,建成后将租赁给 Anthropic 使用。建设贷款预计很快敲定。
该项目占地约 2800 英亩,预计最早 2026 年底交付约 500 兆瓦容量,后续还将大幅扩容。选址靠近主要天然气管道,Nexus 计划通过自有燃气轮机直接供电,而非依赖公共电网,以规避电网接入排队延迟并降低用电高峰时段的成本。
谷歌目前通过 Google Cloud 向 Anthropic 提供其定制 TPU 芯片用于大模型训练,双方已有深度云计算合作关系。此次为 Anthropic 租用的数据中心提供基础设施融资,是这一合作的进一步延伸。
信源:https://www.ft.com/content/af949b0b-3e24-4eaa-9a52-0a841ac1ff22
快手编码模型KAT-Coder-Pro V2上线:最大输出翻倍至80K,主打前端美学生成
快手 StreamLake 平台发布旗舰级 AI 编码模型 KAT-Coder-Pro V2,在 Agentic Coding 和前端美学生成两个方向同时升级。
Agentic Coding 方面,V2 兼容 Claude Code、Cline、Kilo、OpenCode 等 10 余种主流 AI 编码工具,并针对 OpenClaw 框架进行了专项训练与全链路优化,覆盖脚手架协议理解、工具链调用和长链路执行稳定性。
前端美学生成是此次升级的重点。快手团队同步推出自研「KAT 美学 Benchmark」,采用专业设计师人工盲测,设置 10 个独立评估维度,专门针对「无参考图创作」场景打分。在该基准下,V2 的 PPT 场景总分 57.6,领先竞品 14 至 22 分,配色单项达 78 分;Landing Page 场景总分 59.8,排名第一。相比上一代基线,PPT 均分提升 103%,Landing Page 提升 42%,元素单项提升 300%。
模型规格方面,V2 上下文长度 256K,最大输出从 V1 的 32K 提升至 80K,支持流式输出、上下文缓存、MCP 和 Function Call。API 定价为输入 2.1 元/百万 token,输出 8.4 元/百万 token,缓存写入免费,缓存读取 0.42 元/百万 token。用户可通过 StreamLake 平台 API 或 Coding Plan 订阅使用。
信源:https://www.streamlake.com/product/kat-coder
快手 StreamLake 平台发布旗舰级 AI 编码模型 KAT-Coder-Pro V2,在 Agentic Coding 和前端美学生成两个方向同时升级。
Agentic Coding 方面,V2 兼容 Claude Code、Cline、Kilo、OpenCode 等 10 余种主流 AI 编码工具,并针对 OpenClaw 框架进行了专项训练与全链路优化,覆盖脚手架协议理解、工具链调用和长链路执行稳定性。
前端美学生成是此次升级的重点。快手团队同步推出自研「KAT 美学 Benchmark」,采用专业设计师人工盲测,设置 10 个独立评估维度,专门针对「无参考图创作」场景打分。在该基准下,V2 的 PPT 场景总分 57.6,领先竞品 14 至 22 分,配色单项达 78 分;Landing Page 场景总分 59.8,排名第一。相比上一代基线,PPT 均分提升 103%,Landing Page 提升 42%,元素单项提升 300%。
模型规格方面,V2 上下文长度 256K,最大输出从 V1 的 32K 提升至 80K,支持流式输出、上下文缓存、MCP 和 Function Call。API 定价为输入 2.1 元/百万 token,输出 8.4 元/百万 token,缓存写入免费,缓存读取 0.42 元/百万 token。用户可通过 StreamLake 平台 API 或 Coding Plan 订阅使用。
信源:https://www.streamlake.com/product/kat-coder
谷歌内部编程智能体Agent Smith火到被限流,员工用手机就能指挥后台写代码
谷歌员工正在使用一款名为 Agent Smith 的内部 AI 智能体,可自动完成编程等多项任务。该工具因使用人数激增,已被迫限制访问权限。名字大概率致敬《黑客帝国》中的反派特工 Smith。
Agent Smith 基于谷歌已有的智能体编程平台 Antigravity 打造,可调用多种内部系统,今年早些时候上线。与此前的 AI 编码助手相比,Agent Smith 能更自主地规划和执行完整工作流程,且支持异步运行,在后台独立执行任务。员工无需持续操作电脑,可通过手机随时查看进度并下达指令,也可从谷歌内部聊天平台直接使用。由于接入了员工资料系统,Agent Smith 还能自动调取相关文档,省去手动查找。
谷歌联合创始人 Sergey Brin 3 月初在一场面向销售部门的全员会上表示,AI 智能体将在今年成为谷歌的重要方向,并暗示公司正在开发一款类似 OpenClaw 的工具(尚不确定是否就是 Agent Smith)。谷歌业务负责人 Philipp Schindler 在会上开玩笑说,他能分辨出 Brin 的消息什么时候是智能体代发的。
谷歌正在全面加速 AI 工具的内部采用。部分员工已被告知,AI 使用情况将纳入绩效考核。基础设施部门还在推进一个名为 Project EAT 的内部项目,旨在改善 AI 工具的采用率和标准化。谷歌发言人回应称:「我们一直在探索构建能解决实际问题的智能体的新方法,但目前没有更多可分享的信息。」
信源:https://www.businessinsider.com/google-agent-smith-employees-ai-driven-coding-2026-3
谷歌员工正在使用一款名为 Agent Smith 的内部 AI 智能体,可自动完成编程等多项任务。该工具因使用人数激增,已被迫限制访问权限。名字大概率致敬《黑客帝国》中的反派特工 Smith。
Agent Smith 基于谷歌已有的智能体编程平台 Antigravity 打造,可调用多种内部系统,今年早些时候上线。与此前的 AI 编码助手相比,Agent Smith 能更自主地规划和执行完整工作流程,且支持异步运行,在后台独立执行任务。员工无需持续操作电脑,可通过手机随时查看进度并下达指令,也可从谷歌内部聊天平台直接使用。由于接入了员工资料系统,Agent Smith 还能自动调取相关文档,省去手动查找。
谷歌联合创始人 Sergey Brin 3 月初在一场面向销售部门的全员会上表示,AI 智能体将在今年成为谷歌的重要方向,并暗示公司正在开发一款类似 OpenClaw 的工具(尚不确定是否就是 Agent Smith)。谷歌业务负责人 Philipp Schindler 在会上开玩笑说,他能分辨出 Brin 的消息什么时候是智能体代发的。
谷歌正在全面加速 AI 工具的内部采用。部分员工已被告知,AI 使用情况将纳入绩效考核。基础设施部门还在推进一个名为 Project EAT 的内部项目,旨在改善 AI 工具的采用率和标准化。谷歌发言人回应称:「我们一直在探索构建能解决实际问题的智能体的新方法,但目前没有更多可分享的信息。」
信源:https://www.businessinsider.com/google-agent-smith-employees-ai-driven-coding-2026-3