「AI狗疫苗」当事人公开完整技术方案:300GB基因数据、三款聊天机器人分工、从靶点筛选到给药时序
澳大利亚 AI 咨询公司创始人 Paul Conyngham 在 X 上发布长文,首次公开了他用 AI 聊天机器人为爱犬 Rosie 设计个性化 mRNA 癌症疫苗的完整技术方案。Rosie 是一只 8 岁的斯塔福郡斗牛梗混血犬,2024 年 5 月确诊恶性肥大细胞癌,兽医判定仅剩数月生命。
Conyngham 没有生物学背景,整个过程依赖 ChatGPT、Gemini 和 Grok 三款 AI 聊天机器人分工协作。他先通过新南威尔士大学(UNSW)Ramaciotti 中心的 Martin Smith 教授和 Garvan 研究所团队完成 Rosie 的全基因组测序与 RNA 测序,共约 300GB 原始数据。随后用 ChatGPT 设计生物信息学分析流程,使用 AlphaFold 2 建模突变蛋白结构,最终在 DNA 和 RNA 数据的交叉验证中锁定 c-KIT 基因突变,筛选出 7 个新抗原靶点。Gemini Pro 2 负责构建多表位疫苗序列,Grok 3 完成结构稳定性验证。
疫苗由 UNSW mRNA 研究所的 Pall Thordarson 教授团队制造,在昆士兰大学兽医学院由 Rachel Allavena 教授团队实施接种。治疗方案并非仅有疫苗,而是由 AI 帮助设计的三联疗法:mRNA 疫苗训练免疫系统识别癌细胞,酪氨酸激酶抑制剂阻断 c-KIT 突变驱动的癌细胞增殖和血管生成,PD-1 检查点抑制剂解除癌细胞对 T 细胞的抑制信号。三者的给药时序由 ChatGPT 和 Gemini 协助规划,因为免疫抑制药物和免疫激活疫苗不能同时使用。
2025 年 12 月开始治疗,三个月后 Rosie 腿部两处肿瘤明显缩小,但臀部一处肿瘤未响应,已手术切除并送检基因组分析,初步显示其突变特征与疫苗设计针对的癌症存在差异。Conyngham 总结称,AI 聊天机器人让他「一个人拥有了一个研究所的能力」,涵盖流程规划、教育学习、技术排错、合规文书和科学设计。他表示正在评估将这一流程规模化的可能性,「不会止于一只狗」。
专家提醒这仅是单一个案而非对照研究,尚不构成 AI 可以治愈癌症的证据。
信源:https://x.com/paul_conyngham/status/2036940410363535823
澳大利亚 AI 咨询公司创始人 Paul Conyngham 在 X 上发布长文,首次公开了他用 AI 聊天机器人为爱犬 Rosie 设计个性化 mRNA 癌症疫苗的完整技术方案。Rosie 是一只 8 岁的斯塔福郡斗牛梗混血犬,2024 年 5 月确诊恶性肥大细胞癌,兽医判定仅剩数月生命。
Conyngham 没有生物学背景,整个过程依赖 ChatGPT、Gemini 和 Grok 三款 AI 聊天机器人分工协作。他先通过新南威尔士大学(UNSW)Ramaciotti 中心的 Martin Smith 教授和 Garvan 研究所团队完成 Rosie 的全基因组测序与 RNA 测序,共约 300GB 原始数据。随后用 ChatGPT 设计生物信息学分析流程,使用 AlphaFold 2 建模突变蛋白结构,最终在 DNA 和 RNA 数据的交叉验证中锁定 c-KIT 基因突变,筛选出 7 个新抗原靶点。Gemini Pro 2 负责构建多表位疫苗序列,Grok 3 完成结构稳定性验证。
疫苗由 UNSW mRNA 研究所的 Pall Thordarson 教授团队制造,在昆士兰大学兽医学院由 Rachel Allavena 教授团队实施接种。治疗方案并非仅有疫苗,而是由 AI 帮助设计的三联疗法:mRNA 疫苗训练免疫系统识别癌细胞,酪氨酸激酶抑制剂阻断 c-KIT 突变驱动的癌细胞增殖和血管生成,PD-1 检查点抑制剂解除癌细胞对 T 细胞的抑制信号。三者的给药时序由 ChatGPT 和 Gemini 协助规划,因为免疫抑制药物和免疫激活疫苗不能同时使用。
2025 年 12 月开始治疗,三个月后 Rosie 腿部两处肿瘤明显缩小,但臀部一处肿瘤未响应,已手术切除并送检基因组分析,初步显示其突变特征与疫苗设计针对的癌症存在差异。Conyngham 总结称,AI 聊天机器人让他「一个人拥有了一个研究所的能力」,涵盖流程规划、教育学习、技术排错、合规文书和科学设计。他表示正在评估将这一流程规模化的可能性,「不会止于一只狗」。
专家提醒这仅是单一个案而非对照研究,尚不构成 AI 可以治愈癌症的证据。
信源:https://x.com/paul_conyngham/status/2036940410363535823
动察Beating AI News
估值翻约5倍:智谱押注的Agent Computer公司吾云创新接近完成大额融资 深圳 AI 硬件公司吾云创新(Zettlab)正接近完成一轮大额融资,被称为 2026 年 Agent Computer 领域最大笔融资。相比去年 9 月超亿元的 A 轮,目前估值已翻约 5 倍。 吾云创新专注于将 AI 与数据存储融合,打造集存储与本地 AI 运算于一体的智能设备,支持文档分析、语音转写、语义搜索和图像识别等本地化 AI 任务。团队核心成员来自大疆和云鲸。上轮融资由星连资本(Z基金)领投,祥峰投资和蜂巧…
从AI NAS转向「Agent Computer」:大疆、云鲸前员工要做龙虾的「天选设备」
端侧 AI 硬件公司 Zettlab(吾云创新)创始人郭亚楠在接受极客公园专访时透露,公司正从 AI NAS 转型为「Agent Computer」,新产品将在数月内推出。郭亚楠此前先后在大疆和云鲸任职,2023 年 GPT 兴起后全职创业,去年推出的 AI NAS 产品众筹破千万。
郭亚楠将 Agent Computer 定义为一种全新的个人计算设备:以个人数据为核心资产,以上下文(Context)为操作系统,以 Agent 为主要使用者。他认为传统操作系统服务于用户和开发者的双边逻辑正在瓦解,因为开发成本趋近于零、用户不再依赖图形界面,真正高频使用设备的将是各种自动运行的 BOT。
产品定位从第一代的「重存储、轻计算」转向「轻存储、重计算」。郭亚楠称 OpenClaw(龙虾)的爆发证明,即便数据量不大,泛知识工作者对个人数据的处理需求也非常强烈。新设备采用端云协同架构,数据预处理在端侧完成,决策编排调用云端大模型,主打开箱即用,目标是成为不需要复杂配置的「活龙虾」。
信源:https://mp.weixin.qq.com/s/UbVodOvPprScY4VK4bVrYQ
端侧 AI 硬件公司 Zettlab(吾云创新)创始人郭亚楠在接受极客公园专访时透露,公司正从 AI NAS 转型为「Agent Computer」,新产品将在数月内推出。郭亚楠此前先后在大疆和云鲸任职,2023 年 GPT 兴起后全职创业,去年推出的 AI NAS 产品众筹破千万。
郭亚楠将 Agent Computer 定义为一种全新的个人计算设备:以个人数据为核心资产,以上下文(Context)为操作系统,以 Agent 为主要使用者。他认为传统操作系统服务于用户和开发者的双边逻辑正在瓦解,因为开发成本趋近于零、用户不再依赖图形界面,真正高频使用设备的将是各种自动运行的 BOT。
产品定位从第一代的「重存储、轻计算」转向「轻存储、重计算」。郭亚楠称 OpenClaw(龙虾)的爆发证明,即便数据量不大,泛知识工作者对个人数据的处理需求也非常强烈。新设备采用端云协同架构,数据预处理在端侧完成,决策编排调用云端大模型,主打开箱即用,目标是成为不需要复杂配置的「活龙虾」。
信源:https://mp.weixin.qq.com/s/UbVodOvPprScY4VK4bVrYQ
专用压缩模型替代Claude Code内置方案,YC公司Morph称长会话端到端提速37%
YC 孵化的 AI 编程基础设施公司 Morph 发布 Claude Code 插件,集成两项核心功能:代码搜索子代理 WarpGrep 和专用上下文压缩模型 FlashCompact。Morph 称该插件可将 Claude Code 长会话的端到端速度提升 37%,同时节省 token 消耗并提高准确率。
FlashCompact 是专为编程代理设计的上下文压缩模型,吞吐量达 33,000 token/s,可在不到 2 秒内将上下文压缩 50%-70%,旨在替代 Claude Code 内置的自动压缩机制。Claude Code 在上下文窗口接近 200K token 上限时会触发自动压缩,但可能丢失文件路径、报错信息和调试状态等关键信息,FlashCompact 声称可将压缩触发频率降低 3-4 倍。WarpGrep 则是一个经强化学习训练的代码搜索子代理,在独立上下文窗口中运行,避免搜索结果污染主代理上下文,单次搜索耗时不到 6 秒,在 SWE-Bench Pro 基准上排名第一。
该插件同时支持 Cursor、Windsurf、Codex、Amp、OpenCode、Antigravity 等 AI 编程工具。Morph 的客户包括 JetBrains、Vercel、Webflow、币安等。
信源:https://www.morphllm.com/mcp
YC 孵化的 AI 编程基础设施公司 Morph 发布 Claude Code 插件,集成两项核心功能:代码搜索子代理 WarpGrep 和专用上下文压缩模型 FlashCompact。Morph 称该插件可将 Claude Code 长会话的端到端速度提升 37%,同时节省 token 消耗并提高准确率。
FlashCompact 是专为编程代理设计的上下文压缩模型,吞吐量达 33,000 token/s,可在不到 2 秒内将上下文压缩 50%-70%,旨在替代 Claude Code 内置的自动压缩机制。Claude Code 在上下文窗口接近 200K token 上限时会触发自动压缩,但可能丢失文件路径、报错信息和调试状态等关键信息,FlashCompact 声称可将压缩触发频率降低 3-4 倍。WarpGrep 则是一个经强化学习训练的代码搜索子代理,在独立上下文窗口中运行,避免搜索结果污染主代理上下文,单次搜索耗时不到 6 秒,在 SWE-Bench Pro 基准上排名第一。
该插件同时支持 Cursor、Windsurf、Codex、Amp、OpenCode、Antigravity 等 AI 编程工具。Morph 的客户包括 JetBrains、Vercel、Webflow、币安等。
信源:https://www.morphllm.com/mcp
OpenClaw将设独立基金会:英伟达、字节跳动已加入,腾讯正在接洽
OpenClaw 将转入一个即将成立的独立基金会继续开源运营。创始人、奥地利开发者 Peter Steinberger 在加入 OpenAI 后接受 Bloomberg 首次专访时透露,英伟达和字节跳动已确认加入基金会,腾讯正在接洽,也与微软有过沟通。他称自己在这件事上「试图当瑞士」。
OpenAI CEO Sam Altman 此前称 Steinberger 是「天才」,并表示「未来将是极度多 Agent 的,支持开源对我们很重要」。Steinberger 在 OpenAI 加入了 Codex 团队,并透露 Codex 与 OpenClaw 的融合方向:Agent 足够聪明时会自主编写代码来增强自身能力,「编程」与「非编程」的边界正在消失,「这也是我们在 OpenAI 最终决定将两者合一的原因」。他描绘的多 Agent 未来是每个人既有工作 Agent 又有个人 Agent,两者可以互相调用,但各自守住数据边界。
专访中他还谈及中美在 AI Agent 应用上的分歧:「在美国,有些公司你用了 OpenClaw 会被开除;在中国,有些公司你不用才会被开除。」他说中国企业给他展示过一张表格,列出每位员工的名字,旁边有一栏写着「今天自动化了什么?」,在积极推动员工用 AI 将效率提升 10 倍。而在美国,一些公司出于安全顾虑已限制员工使用。Steinberger 认为两种做法都不完美,但美国可以从中国更快拥抱新技术中学到一些东西,「这东西太新了,唯一能学会它的方式就是实际去用、去看」。在 GTC 期间他与 MiniMax、月之暗面、腾讯等中国公司有过交流。
信源:https://www.bloomberg.com/news/newsletters/2026-03-26/openclaw-creator-says-us-can-learn-from-china-s-ai-adoption
OpenClaw 将转入一个即将成立的独立基金会继续开源运营。创始人、奥地利开发者 Peter Steinberger 在加入 OpenAI 后接受 Bloomberg 首次专访时透露,英伟达和字节跳动已确认加入基金会,腾讯正在接洽,也与微软有过沟通。他称自己在这件事上「试图当瑞士」。
OpenAI CEO Sam Altman 此前称 Steinberger 是「天才」,并表示「未来将是极度多 Agent 的,支持开源对我们很重要」。Steinberger 在 OpenAI 加入了 Codex 团队,并透露 Codex 与 OpenClaw 的融合方向:Agent 足够聪明时会自主编写代码来增强自身能力,「编程」与「非编程」的边界正在消失,「这也是我们在 OpenAI 最终决定将两者合一的原因」。他描绘的多 Agent 未来是每个人既有工作 Agent 又有个人 Agent,两者可以互相调用,但各自守住数据边界。
专访中他还谈及中美在 AI Agent 应用上的分歧:「在美国,有些公司你用了 OpenClaw 会被开除;在中国,有些公司你不用才会被开除。」他说中国企业给他展示过一张表格,列出每位员工的名字,旁边有一栏写着「今天自动化了什么?」,在积极推动员工用 AI 将效率提升 10 倍。而在美国,一些公司出于安全顾虑已限制员工使用。Steinberger 认为两种做法都不完美,但美国可以从中国更快拥抱新技术中学到一些东西,「这东西太新了,唯一能学会它的方式就是实际去用、去看」。在 GTC 期间他与 MiniMax、月之暗面、腾讯等中国公司有过交流。
信源:https://www.bloomberg.com/news/newsletters/2026-03-26/openclaw-creator-says-us-can-learn-from-china-s-ai-adoption
Sierra发布「造Agent的Agent」Ghostwriter:无需工程师,说话就能搭AI客服
AI 智能体公司 Sierra 发布 Ghostwriter,一款「造 Agent 的 Agent」自助工具。企业用户无需工程团队,用自然语言描述客服工作流程,上传现有文档、通话记录甚至白板照片,即可生成覆盖语音、在线聊天和邮件三个渠道、支持 30 多种语言的 AI 客服 Agent。
Sierra 由前 Salesforce CEO、现任 OpenAI 董事长 Bret Taylor 联合创立,估值 100 亿美元,已服务财富 50 强中的 40%。此前部署依赖工程团队定制,Ghostwriter 将这一过程压缩为一场自然语言对话。平台采用模型无关架构,底层调用 OpenAI、Anthropic 和谷歌的模型。Ghostwriter 上线后持续分析真实客户交互,自动定位表现不佳的环节,在沙箱环境中验证改进后自动部署,Sierra 称之为「Agent 流水线」。
定价模式为按结果收费:只有当 Agent 完整解决客户问题且无需转人工时才收取费用。Sierra 此前的定制部署已初步验证这一路径:Rocket Mortgage 的 Agent 将房贷再融资流程从数小时压缩至约 30 分钟,Ramp 的 Agent 独立处理了 90% 的客服请求。
信源:https://t.co/Z3IBO0rruX
AI 智能体公司 Sierra 发布 Ghostwriter,一款「造 Agent 的 Agent」自助工具。企业用户无需工程团队,用自然语言描述客服工作流程,上传现有文档、通话记录甚至白板照片,即可生成覆盖语音、在线聊天和邮件三个渠道、支持 30 多种语言的 AI 客服 Agent。
Sierra 由前 Salesforce CEO、现任 OpenAI 董事长 Bret Taylor 联合创立,估值 100 亿美元,已服务财富 50 强中的 40%。此前部署依赖工程团队定制,Ghostwriter 将这一过程压缩为一场自然语言对话。平台采用模型无关架构,底层调用 OpenAI、Anthropic 和谷歌的模型。Ghostwriter 上线后持续分析真实客户交互,自动定位表现不佳的环节,在沙箱环境中验证改进后自动部署,Sierra 称之为「Agent 流水线」。
定价模式为按结果收费:只有当 Agent 完整解决客户问题且无需转人工时才收取费用。Sierra 此前的定制部署已初步验证这一路径:Rocket Mortgage 的 Agent 将房贷再融资流程从数小时压缩至约 30 分钟,Ramp 的 Agent 独立处理了 90% 的客服请求。
信源:https://t.co/Z3IBO0rruX
token两月翻十倍:中关村论坛OpenClaw圆桌上的算力焦虑与提价逻辑
月之暗面创始人杨植麟在 2026 中关村论坛主持了一场 OpenClaw 与 AI 开源主题圆桌,嘉宾包括智谱华章 CEO 张鹏、AI 算力基础设施公司无问芯穹联合创始人兼 CEO 夏立雪、小米 MiMo 大模型负责人罗福莉和香港大学助理教授黄超,覆盖模型、算力基础设施和 Agent 应用三个层面。
夏立雪给出了一个直观数据:无问芯穹自 1 月底以来 token 用量每两周翻一番,累计已翻十倍,「上次见到这个速度还是 3G 时代手机流量的感觉」。张鹏从模型厂商角度解释了智谱 GLM5 Turbo 近期提价的逻辑:Agent 不再是一问一答,完成一个任务消耗的 token 量可能是回答简单问题的十倍甚至百倍,背后涉及长程任务规划、持续 debug 和多模态信息处理,「长期靠低价竞争不利于整个行业发展」。
罗福莉认为 Agent 时代的核心瓶颈是长上下文的推理成本与速度,只有在百万乃至千万 token 的上下文规模下做到成本够低、速度够快,才会有真正高生产力价值的任务被交给模型。她透露,模型「自进化」已从概念走向实践,在目标明确的科学研究任务上,模型已能自主运行两三天,团队自身的研究效率因此加速近十倍。她还抛出一个问题:推理需求过去一段时间已增长近十倍,今年整体 token 增长会不会到百倍?
黄超从 Agent 应用层拆解了三个技术瓶颈:长链路任务的 planning 能力不足、多 Agent 协作带来的 memory 膨胀压力,以及 skill 生态中低质量工具和恶意注入的风险。他指出,现有框架的记忆管理仍停留在文件系统和 Markdown 格式,未来需要走向分层设计。
圆桌最后,四位嘉宾各用一个词概括未来 12 个月的趋势:
1. 黄超:「生态」,软件将从面向人类转向 Agent Native 设计
2. 罗福莉:「自进化」,称这是「唯一能创造出新东西的地方」
3. 夏立雪:「可持续 token」,希望中国成为世界的 token 工厂
4. 张鹏:「算力」,称十倍增长的背后「还有一百倍的需求没有被满足」
信源:https://mp.weixin.qq.com/s/huv31nYzRx_vueNhBHEC_w
月之暗面创始人杨植麟在 2026 中关村论坛主持了一场 OpenClaw 与 AI 开源主题圆桌,嘉宾包括智谱华章 CEO 张鹏、AI 算力基础设施公司无问芯穹联合创始人兼 CEO 夏立雪、小米 MiMo 大模型负责人罗福莉和香港大学助理教授黄超,覆盖模型、算力基础设施和 Agent 应用三个层面。
夏立雪给出了一个直观数据:无问芯穹自 1 月底以来 token 用量每两周翻一番,累计已翻十倍,「上次见到这个速度还是 3G 时代手机流量的感觉」。张鹏从模型厂商角度解释了智谱 GLM5 Turbo 近期提价的逻辑:Agent 不再是一问一答,完成一个任务消耗的 token 量可能是回答简单问题的十倍甚至百倍,背后涉及长程任务规划、持续 debug 和多模态信息处理,「长期靠低价竞争不利于整个行业发展」。
罗福莉认为 Agent 时代的核心瓶颈是长上下文的推理成本与速度,只有在百万乃至千万 token 的上下文规模下做到成本够低、速度够快,才会有真正高生产力价值的任务被交给模型。她透露,模型「自进化」已从概念走向实践,在目标明确的科学研究任务上,模型已能自主运行两三天,团队自身的研究效率因此加速近十倍。她还抛出一个问题:推理需求过去一段时间已增长近十倍,今年整体 token 增长会不会到百倍?
黄超从 Agent 应用层拆解了三个技术瓶颈:长链路任务的 planning 能力不足、多 Agent 协作带来的 memory 膨胀压力,以及 skill 生态中低质量工具和恶意注入的风险。他指出,现有框架的记忆管理仍停留在文件系统和 Markdown 格式,未来需要走向分层设计。
圆桌最后,四位嘉宾各用一个词概括未来 12 个月的趋势:
1. 黄超:「生态」,软件将从面向人类转向 Agent Native 设计
2. 罗福莉:「自进化」,称这是「唯一能创造出新东西的地方」
3. 夏立雪:「可持续 token」,希望中国成为世界的 token 工厂
4. 张鹏:「算力」,称十倍增长的背后「还有一百倍的需求没有被满足」
信源:https://mp.weixin.qq.com/s/huv31nYzRx_vueNhBHEC_w
「套近乎、要报告、出同款」:AI检索初创SID指控向量数据库Chroma抄袭其研究成果
AI 检索研究公司 SID.ai CEO Max Rumpf 在 X 上发长文,公开指控开源向量数据库 Chroma 刚发布的 Context-1 模型大量借鉴了 SID 去年 12 月发布的 SID-1 研究成果,且未给予任何引用或致谢。
Rumpf 晒出与 Chroma CEO Jeff Huber 的邮件往来作为证据。2025 年 10 月,Huber 主动询问 Rumpf 在训练什么模型,Rumpf 回复称正在做「智能体检索模型,类似 Cognition 的 SWE-grep 但用于通用检索,已经比 Sonnet 4.5 和 Gemini 2.5 Pro 更强」。2025 年 12 月 SID-1 技术报告发布后,Rumpf 再次向 Huber 分享了链接,Huber 回复「恭喜」。两家公司同为 YC 校友,办公室相邻。
SID-1 和 Context-1 均为用强化学习训练的智能体检索模型,均定位为前沿推理模型的检索子代理,均使用合成数据训练,均声称在成本和延迟上达到帕累托前沿。Rumpf 列举的具体相似点包括:Figure 1 采用相同的速度/成本双视图切换、4 路并行推理配合 RRF(倒数排名融合)聚合结果,以及图表、数据集和方法论的整体框架。
Context-1 的技术报告在相关工作章节引用了 WebExplorer、SWE-grep、Search-R1 等同领域研究,但全文未提及 SID-1,基准评测也未将 SID-1 纳入对比。Rumpf 称 Chroma「明知还有另一个模型存在」却声称「帕累托最优」,并指出 Context-1 虽开源了权重,但运行所需的推理框架尚未发布,导致 SID 无法对其进行基准测试。
Rumpf 表示这种做法「完全摧毁了我们(以及其他人)在技术报告中深入分享的动力」,并称之为「学术界令人遗憾的糟糕研究惯例正在向创业公司蔓延」。Chroma 方面截至发稿未公开回应。
信源:https://x.com/maxrumpf/status/2037365748973384154
AI 检索研究公司 SID.ai CEO Max Rumpf 在 X 上发长文,公开指控开源向量数据库 Chroma 刚发布的 Context-1 模型大量借鉴了 SID 去年 12 月发布的 SID-1 研究成果,且未给予任何引用或致谢。
Rumpf 晒出与 Chroma CEO Jeff Huber 的邮件往来作为证据。2025 年 10 月,Huber 主动询问 Rumpf 在训练什么模型,Rumpf 回复称正在做「智能体检索模型,类似 Cognition 的 SWE-grep 但用于通用检索,已经比 Sonnet 4.5 和 Gemini 2.5 Pro 更强」。2025 年 12 月 SID-1 技术报告发布后,Rumpf 再次向 Huber 分享了链接,Huber 回复「恭喜」。两家公司同为 YC 校友,办公室相邻。
SID-1 和 Context-1 均为用强化学习训练的智能体检索模型,均定位为前沿推理模型的检索子代理,均使用合成数据训练,均声称在成本和延迟上达到帕累托前沿。Rumpf 列举的具体相似点包括:Figure 1 采用相同的速度/成本双视图切换、4 路并行推理配合 RRF(倒数排名融合)聚合结果,以及图表、数据集和方法论的整体框架。
Context-1 的技术报告在相关工作章节引用了 WebExplorer、SWE-grep、Search-R1 等同领域研究,但全文未提及 SID-1,基准评测也未将 SID-1 纳入对比。Rumpf 称 Chroma「明知还有另一个模型存在」却声称「帕累托最优」,并指出 Context-1 虽开源了权重,但运行所需的推理框架尚未发布,导致 SID 无法对其进行基准测试。
Rumpf 表示这种做法「完全摧毁了我们(以及其他人)在技术报告中深入分享的动力」,并称之为「学术界令人遗憾的糟糕研究惯例正在向创业公司蔓延」。Chroma 方面截至发稿未公开回应。
信源:https://x.com/maxrumpf/status/2037365748973384154
X (formerly Twitter)
Max Rumpf (@maxrumpf) on X
Chroma's "new" model sure seems familiar. A story.
Imitation is the sincerest form of flattery. But there is a point where it goes from "inspiration" to whatever Context-1 is:
6 months ago, Chroma's CEO @jeffreyhuber asked us about our research. 4 months…
Imitation is the sincerest form of flattery. But there is a point where it goes from "inspiration" to whatever Context-1 is:
6 months ago, Chroma's CEO @jeffreyhuber asked us about our research. 4 months…
用你的嗓音做AI音乐:Suno v5.5上线声音克隆和风格定制
AI 音乐生成平台 Suno 发布 v5.5 模型,称其为「迄今最佳、最具表现力的模型」,同步上线三项个性化功能:Voices、Custom Models 和 My Taste。
Voices 是社区呼声最高的功能,允许 Pro 和 Premier 订阅用户上传或实时录制自己的歌声,用于 AI 音乐创作。系统内置验证流程,要求用户朗读一段随机文本并与上传的歌声进行声纹匹配,防止冒用他人声音。声音档案默认私有,仅本人可使用,Suno 表示未来将开放声音分享,但会确保用户始终拥有控制权。
Custom Models 允许用户上传自己的原创作品,基于 v5.5 训练出了解其风格的个性化模型版本,Pro 和 Premier 用户最多可创建 3 个。My Taste 是偏好学习功能,系统随时间积累用户偏好的曲风和情绪,面向所有用户开放。
Suno 称这些功能为今年晚些时候与音乐行业合作推出的下一代模型奠定基础,去年 11 月 Suno 已与华纳音乐集团达成合作伙伴关系。
信源:https://suno.com/blog/v5-5
AI 音乐生成平台 Suno 发布 v5.5 模型,称其为「迄今最佳、最具表现力的模型」,同步上线三项个性化功能:Voices、Custom Models 和 My Taste。
Voices 是社区呼声最高的功能,允许 Pro 和 Premier 订阅用户上传或实时录制自己的歌声,用于 AI 音乐创作。系统内置验证流程,要求用户朗读一段随机文本并与上传的歌声进行声纹匹配,防止冒用他人声音。声音档案默认私有,仅本人可使用,Suno 表示未来将开放声音分享,但会确保用户始终拥有控制权。
Custom Models 允许用户上传自己的原创作品,基于 v5.5 训练出了解其风格的个性化模型版本,Pro 和 Premier 用户最多可创建 3 个。My Taste 是偏好学习功能,系统随时间积累用户偏好的曲风和情绪,面向所有用户开放。
Suno 称这些功能为今年晚些时候与音乐行业合作推出的下一代模型奠定基础,去年 11 月 Suno 已与华纳音乐集团达成合作伙伴关系。
信源:https://suno.com/blog/v5-5
Suno
Suno v5.5: More Expressive. More You.
Introducing Suno v5.5 with Voices, Custom models and My Taste
Cohere开源语音识别模型Transcribe:20亿参数登顶HuggingFace榜单,超越Whisper和ElevenLabs
企业 AI 公司 Cohere 发布开源语音识别模型 Transcribe,20 亿参数,基于 Conformer 编码器-解码器架构从头训练,以 Apache 2.0 协议开源,权重已在 HuggingFace 上线。
该模型在 HuggingFace Open ASR Leaderboard 上以平均词错率(WER)5.42% 排名第一,超越 Zoom Scribe v1(5.47%)、IBM Granite 4.0(5.52%)、NVIDIA Canary Qwen(5.63%)、Qwen3-ASR(5.76%)、ElevenLabs Scribe v2(5.83%)和 OpenAI Whisper Large v3(7.44%)。在多说话人环境、会议室声学和多口音场景中均表现领先。人工评测中,Transcribe 在与七个竞品的逐对比较中平均胜率 61%。
模型支持 14 种语言,覆盖英语、法语、德语、中文、日语、韩语、阿拉伯语等。Cohere 表示将把 Transcribe 整合进其 AI Agent 编排平台 North,从单一转录模型演进为企业语音智能的基础组件。
信源:https://cohere.com/blog/transcribe
企业 AI 公司 Cohere 发布开源语音识别模型 Transcribe,20 亿参数,基于 Conformer 编码器-解码器架构从头训练,以 Apache 2.0 协议开源,权重已在 HuggingFace 上线。
该模型在 HuggingFace Open ASR Leaderboard 上以平均词错率(WER)5.42% 排名第一,超越 Zoom Scribe v1(5.47%)、IBM Granite 4.0(5.52%)、NVIDIA Canary Qwen(5.63%)、Qwen3-ASR(5.76%)、ElevenLabs Scribe v2(5.83%)和 OpenAI Whisper Large v3(7.44%)。在多说话人环境、会议室声学和多口音场景中均表现领先。人工评测中,Transcribe 在与七个竞品的逐对比较中平均胜率 61%。
模型支持 14 种语言,覆盖英语、法语、德语、中文、日语、韩语、阿拉伯语等。Cohere 表示将把 Transcribe 整合进其 AI Agent 编排平台 North,从单一转录模型演进为企业语音智能的基础组件。
信源:https://cohere.com/blog/transcribe
Cline发布看板式多Agent调度器:每张卡片一个独立分支,支持Claude Code和Codex
开源 AI 编程工具 Cline 发布 Cline Kanban,一款本地运行的看板式多 Agent 调度界面,允许开发者在同一个代码仓库中同时运行多个编程 Agent 并行工作。通过
核心机制是每张任务卡片自动创建一个独立的 git worktree(临时工作树),每个 Agent 在各自的目录和终端中工作,分支互不干扰,主工作区不受影响。gitignored 文件(如 `node_modules`)通过符号链接共享,无需为每个任务重新安装依赖。开发者可在界面中实时查看每张卡片的代码变更 diff,并像代码审查一样对任意行留下内联评论反馈给 Agent。
任务卡片之间可通过 ⌘+点击建立依赖链:前置任务完成后自动触发下一个任务,配合自动提交和自动创建 PR 功能,形成全自动流水线。该工具还支持从 Linear 导入工单,将整个 Sprint 待办事项一次性转化为 Agent 任务。兼容 Claude Code、OpenAI Codex 和 Cline 自身的 CLI,更多 Agent 即将接入。
Cline 此前以 VS Code 插件起步,已有超过 500 万开发者安装,今年 2 月发布的 CLI 2.0 引入了并行执行和无头 CI/CD 能力,Kanban 是在此基础上的可视化调度层。
信源:https://x.com/cline/status/2037182739695493399
开源 AI 编程工具 Cline 发布 Cline Kanban,一款本地运行的看板式多 Agent 调度界面,允许开发者在同一个代码仓库中同时运行多个编程 Agent 并行工作。通过
npm i -g cline 安装,需要 Node.js 18+ 和任意支持的 API 密钥(Anthropic、OpenAI、谷歌、Mistral 等),也可使用免费模型。目前为研究预览版。核心机制是每张任务卡片自动创建一个独立的 git worktree(临时工作树),每个 Agent 在各自的目录和终端中工作,分支互不干扰,主工作区不受影响。gitignored 文件(如 `node_modules`)通过符号链接共享,无需为每个任务重新安装依赖。开发者可在界面中实时查看每张卡片的代码变更 diff,并像代码审查一样对任意行留下内联评论反馈给 Agent。
任务卡片之间可通过 ⌘+点击建立依赖链:前置任务完成后自动触发下一个任务,配合自动提交和自动创建 PR 功能,形成全自动流水线。该工具还支持从 Linear 导入工单,将整个 Sprint 待办事项一次性转化为 Agent 任务。兼容 Claude Code、OpenAI Codex 和 Cline 自身的 CLI,更多 Agent 即将接入。
Cline 此前以 VS Code 插件起步,已有超过 500 万开发者安装,今年 2 月发布的 CLI 2.0 引入了并行执行和无头 CI/CD 能力,Kanban 是在此基础上的可视化调度层。
信源:https://x.com/cline/status/2037182739695493399
Mistral发布TTS模型Voxtral:40亿参数9种语言,3秒音频即可克隆声音
法国 AI 公司 Mistral 发布 Voxtral TTS,这是其首个文本转语音模型,参数量 40 亿,支持英语、法语、德语、西班牙语、荷兰语、葡萄牙语、意大利语、印地语和阿拉伯语 9 种语言。模型仅需最短 3 秒的语音样本即可克隆目标声音,捕捉说话者的停顿节奏、语调和情绪表达特征。
人类评测显示,在零样本自定义语音场景下,Voxtral TTS 的自然度优于 ElevenLabs Flash v2.5,与 ElevenLabs v3 持平。模型延迟 70 毫秒(基于 10 秒语音样本和 500 字符输入),实时因子约 9.7 倍,单次可生成最长 2 分钟音频。模型还具备零样本跨语言语音迁移能力,例如输入法语语音样本和英语文本,生成的语音会自然带有法语口音。
架构基于 Ministral 3B,由 34 亿参数 Transformer 解码器骨干网络、3.9 亿参数 flow-matching 声学 Transformer 和 3 亿参数自研神经音频编解码器三部分组成。定价 $0.016/千字符,已通过 API 和 Le Chat 上线。模型权重以 CC BY-NC 4.0 许可证在 Hugging Face 开放,仅限非商业用途。
信源:https://mistral.ai/news/voxtral-tts
法国 AI 公司 Mistral 发布 Voxtral TTS,这是其首个文本转语音模型,参数量 40 亿,支持英语、法语、德语、西班牙语、荷兰语、葡萄牙语、意大利语、印地语和阿拉伯语 9 种语言。模型仅需最短 3 秒的语音样本即可克隆目标声音,捕捉说话者的停顿节奏、语调和情绪表达特征。
人类评测显示,在零样本自定义语音场景下,Voxtral TTS 的自然度优于 ElevenLabs Flash v2.5,与 ElevenLabs v3 持平。模型延迟 70 毫秒(基于 10 秒语音样本和 500 字符输入),实时因子约 9.7 倍,单次可生成最长 2 分钟音频。模型还具备零样本跨语言语音迁移能力,例如输入法语语音样本和英语文本,生成的语音会自然带有法语口音。
架构基于 Ministral 3B,由 34 亿参数 Transformer 解码器骨干网络、3.9 亿参数 flow-matching 声学 Transformer 和 3 亿参数自研神经音频编解码器三部分组成。定价 $0.016/千字符,已通过 API 和 Le Chat 上线。模型权重以 CC BY-NC 4.0 许可证在 Hugging Face 开放,仅限非商业用途。
信源:https://mistral.ai/news/voxtral-tts
让2000个Agent协同预测金价:OpenAI投资AI集群初创Isara,估值6.5亿美元
AI Agent 协调初创公司 Isara 完成 9400 万美元融资,OpenAI 参投,估值 6.5 亿美元。其他投资者包括风投公司 Amity Ventures、Michael Ovitz 和 Stanley Druckenmiller。
Isara 的目标是构建让数千个 AI Agent 相互通信、协同解决复杂问题的软件,初期聚焦金融和生物科技领域。创始人在今年早些时候 Allen & Co. 科技峰会上展示了早期版本:约 2000 个 AI Agent 协同工作,预测黄金价格走势。Amity Ventures 的 CJ Reim 将这一方法描述为协调「专家蜂群」为用户执行研究任务。公司初期目标客户为投资机构和金融服务公司,用于预测建模。
Isara 去年 6 月在旧金山成立,两位联合创始人均为 23 岁:Eddie Zhang 此前在哈佛攻读计算机科学博士学位,离开 OpenAI 后创业;Henry Gasztowtt 此前在牛津大学攻读计算机科学本科。两人于 2024 年 6 月合著了一篇关于 AI 系统协同改善政策制定的学术论文,Isara 即脱胎于此。公司已从谷歌、Meta 和 OpenAI 等招募了约 12 名研究人员。
信源:https://www.wsj.com/tech/ai/openai-backs-new-ai-startup-seeking-bot-army-breakthroughs-a0b1fedc
AI Agent 协调初创公司 Isara 完成 9400 万美元融资,OpenAI 参投,估值 6.5 亿美元。其他投资者包括风投公司 Amity Ventures、Michael Ovitz 和 Stanley Druckenmiller。
Isara 的目标是构建让数千个 AI Agent 相互通信、协同解决复杂问题的软件,初期聚焦金融和生物科技领域。创始人在今年早些时候 Allen & Co. 科技峰会上展示了早期版本:约 2000 个 AI Agent 协同工作,预测黄金价格走势。Amity Ventures 的 CJ Reim 将这一方法描述为协调「专家蜂群」为用户执行研究任务。公司初期目标客户为投资机构和金融服务公司,用于预测建模。
Isara 去年 6 月在旧金山成立,两位联合创始人均为 23 岁:Eddie Zhang 此前在哈佛攻读计算机科学博士学位,离开 OpenAI 后创业;Henry Gasztowtt 此前在牛津大学攻读计算机科学本科。两人于 2024 年 6 月合著了一篇关于 AI 系统协同改善政策制定的学术论文,Isara 即脱胎于此。公司已从谷歌、Meta 和 OpenAI 等招募了约 12 名研究人员。
信源:https://www.wsj.com/tech/ai/openai-backs-new-ai-startup-seeking-bot-army-breakthroughs-a0b1fedc
让Claude Code自己搞研究,自动发现的越狱算法碾压30多种人工方法
ELLIS Institute Tübingen 的 Maksym Andriushchenko 等研究者发表论文「Claudini」,展示用 Claude Code 驱动的自动研究(autoresearch)管线,从现有攻击算法(如 GCG)出发,自主迭代发现了全新的白盒对抗攻击算法,在越狱和提示词注入评测中大幅超越已有的 30 多种方法。
核心结果:在针对 GPT-OSS-Safeguard-20B 的 CBRN(化学、生物、放射、核)类查询测试中,自动发现的算法攻击成功率达 40%,而现有最佳方法仅约 10%。更值得注意的是这些攻击的迁移性,在代理模型上优化的攻击直接迁移到未见过的目标模型后,对 Meta-SecAlign-70B 达到 100% 攻击成功率,现有最佳基线仅 56%。
研究者指出,白盒对抗红队测试特别适合自动化研究:现有方法提供了扎实的起点,优化目标能产生密集的量化反馈,使 LLM Agent 能够持续迭代改进。论文认为这是增量式安全研究可被 AI 自动化的早期实证。全部发现的攻击算法、基线实现和评测代码已在 GitHub 开源。
信源:https://arxiv.org/abs/2603.24511
ELLIS Institute Tübingen 的 Maksym Andriushchenko 等研究者发表论文「Claudini」,展示用 Claude Code 驱动的自动研究(autoresearch)管线,从现有攻击算法(如 GCG)出发,自主迭代发现了全新的白盒对抗攻击算法,在越狱和提示词注入评测中大幅超越已有的 30 多种方法。
核心结果:在针对 GPT-OSS-Safeguard-20B 的 CBRN(化学、生物、放射、核)类查询测试中,自动发现的算法攻击成功率达 40%,而现有最佳方法仅约 10%。更值得注意的是这些攻击的迁移性,在代理模型上优化的攻击直接迁移到未见过的目标模型后,对 Meta-SecAlign-70B 达到 100% 攻击成功率,现有最佳基线仅 56%。
研究者指出,白盒对抗红队测试特别适合自动化研究:现有方法提供了扎实的起点,优化目标能产生密集的量化反馈,使 LLM Agent 能够持续迭代改进。论文认为这是增量式安全研究可被 AI 自动化的早期实证。全部发现的攻击算法、基线实现和评测代码已在 GitHub 开源。
信源:https://arxiv.org/abs/2603.24511
淘宝天猫3月31日上线「龙虾」版生意管家:不只是工具,要做商家的7x24小时数字员工
淘宝天猫将于 3 月 31 日起逐步向商家开放「龙虾」版生意管家,为每个商家建立一支 Agent 团队,7x24 小时自主经营店铺。天猫总裁家洛在 3 月 26 日的天猫 TOPTALK 超级品牌私享会上公布了这一计划。
与过去一年 500 多万商家使用的 AI 工具不同,「龙虾」版生意管家的定位是具备自主执行能力的「数字员工」,能自行生成策略、执行调整、监控效果并迭代优化。淘天集团商家品牌总经理九鼎举例称,当系统发现核心爆款商品定价与市场趋势存在偏差时,会自动形成调整方案、执行测试并反馈数据,而非仅发出提醒。操作上力求「一键安装启用」,降低技术门槛。
初期功能涵盖三个模块:经营数据分析(持续扫描经营状况、预警风险、识别机会)、素材与广告优化(生成千人千面展示内容、自动测试投放组合)、智能导购(理解用户潜在需求并精准推荐)。平台后续将与商家、服务商共同丰富技能库。
此外,天猫同步宣布多项 2026 年经营举措:投入百亿规模的「店铺 AI 红包」,对高潜力新客自动发放限时优惠;推出「广告智能跟投」,对效果良好的商家广告追加平台投入;为新品预备 600 亿专项流量支持上市曝光。家洛还透露,88VIP 会员规模已接近 6000 万,天猫头部品牌一半销售额由 88VIP 贡献。
信源:https://mp.weixin.qq.com/s/9RVhel6fdNgH2-0U-HjQrA
淘宝天猫将于 3 月 31 日起逐步向商家开放「龙虾」版生意管家,为每个商家建立一支 Agent 团队,7x24 小时自主经营店铺。天猫总裁家洛在 3 月 26 日的天猫 TOPTALK 超级品牌私享会上公布了这一计划。
与过去一年 500 多万商家使用的 AI 工具不同,「龙虾」版生意管家的定位是具备自主执行能力的「数字员工」,能自行生成策略、执行调整、监控效果并迭代优化。淘天集团商家品牌总经理九鼎举例称,当系统发现核心爆款商品定价与市场趋势存在偏差时,会自动形成调整方案、执行测试并反馈数据,而非仅发出提醒。操作上力求「一键安装启用」,降低技术门槛。
初期功能涵盖三个模块:经营数据分析(持续扫描经营状况、预警风险、识别机会)、素材与广告优化(生成千人千面展示内容、自动测试投放组合)、智能导购(理解用户潜在需求并精准推荐)。平台后续将与商家、服务商共同丰富技能库。
此外,天猫同步宣布多项 2026 年经营举措:投入百亿规模的「店铺 AI 红包」,对高潜力新客自动发放限时优惠;推出「广告智能跟投」,对效果良好的商家广告追加平台投入;为新品预备 600 亿专项流量支持上市曝光。家洛还透露,88VIP 会员规模已接近 6000 万,天猫头部品牌一半销售额由 88VIP 贡献。
信源:https://mp.weixin.qq.com/s/9RVhel6fdNgH2-0U-HjQrA
火山引擎推出短剧生产Agent「火山剧创」:接入Seedance 2.0,制作周期缩短80%以上
火山引擎正式开启短剧生产 Agent「火山剧创」邀测,接入字节跳动视频生成模型 Seedance 2.0,采用工业级多 Agent 协同架构,覆盖剧本解析、素材设定、分镜生成、视频生成、剪辑导出全流程,称可将短剧制作周期缩短 80% 以上。
核心能力包括:
1. 剧本直出分镜:用户上传剧本后,Agent 自动读取剧情逻辑和叙事节奏,拆解出符合影视工业标准的专业分镜脚本,无需手动转写提示词。
2. 角色场景一致性:支持全局风格锁定(2D/3D/仿真人等),用户可在创作初期自定义角色、变装、场景和道具,形成可复用的素材资产库,系统通过上下文状态追踪减少人设崩坏与场景穿帮。
3. 分镜解析与镜头策略:接入 Seedance 2.0 后分镜信息解析更精准,内置 200 多种爆款镜头策略,引入多 Agent 校验机制,镜头直接可用率大幅提升。确认的分镜序列可一键导出至剪映。
系统还支持企业级资产管理、多人协同创作与历史版本回溯,面向承制方和内容制作机构的规模化生产需求。
信源:https://mp.weixin.qq.com/s/-Q5MUeYWIS2Iu0GNAIAC-g
火山引擎正式开启短剧生产 Agent「火山剧创」邀测,接入字节跳动视频生成模型 Seedance 2.0,采用工业级多 Agent 协同架构,覆盖剧本解析、素材设定、分镜生成、视频生成、剪辑导出全流程,称可将短剧制作周期缩短 80% 以上。
核心能力包括:
1. 剧本直出分镜:用户上传剧本后,Agent 自动读取剧情逻辑和叙事节奏,拆解出符合影视工业标准的专业分镜脚本,无需手动转写提示词。
2. 角色场景一致性:支持全局风格锁定(2D/3D/仿真人等),用户可在创作初期自定义角色、变装、场景和道具,形成可复用的素材资产库,系统通过上下文状态追踪减少人设崩坏与场景穿帮。
3. 分镜解析与镜头策略:接入 Seedance 2.0 后分镜信息解析更精准,内置 200 多种爆款镜头策略,引入多 Agent 校验机制,镜头直接可用率大幅提升。确认的分镜序列可一键导出至剪映。
系统还支持企业级资产管理、多人协同创作与历史版本回溯,面向承制方和内容制作机构的规模化生产需求。
信源:https://mp.weixin.qq.com/s/-Q5MUeYWIS2Iu0GNAIAC-g
扎克伯格出价更高却输了:谷歌6.5亿美元收购DeepMind内幕首次披露
记者 Sebastian Mallaby 的新书《The Infinity Machine: Demis Hassabis, DeepMind and the Quest for Superintelligence》将于 3 月 31 日出版,WSJ 刊发独家书摘,首次详细披露 2013 年谷歌与 Facebook(现 Meta)争夺 DeepMind 的收购内幕。本书基于对 Hassabis 超过 30 小时的采访,以及与 DeepMind 同事、投资人和收购相关人士的数十次对话。
2013 年 6 月,谷歌时任 CEO Larry Page 在马斯克的生日派对上向 DeepMind 创始人 Demis Hassabis 提出收购意向:「你的真正使命是造 AGI,为什么不利用我已经积累的资源?」Hassabis 回忆称这番话说服了他:「我受够了四处奔波筹钱。我去谷歌,拿一大堆计算资源,然后解决智能问题。」
Facebook CEO 扎克伯格同时参与竞购。Facebook 企业发展负责人 Amin Zoufonoun 提出了一个让创始人更富有的方案:压低股权收购价,但给予创始人和核心成员巨额签约奖金。然而 Zoufonoun 对 DeepMind 联合创始人 Mustafa Suleyman(现为微软 AI 部门 CEO)提出的 AI 治理议题不以为然。Hassabis 随后赴扎克伯格家中共进晚餐,席间故意将话题从 AI 延伸到虚拟现实、增强现实、3D 打印,发现扎克伯格对所有技术同样兴奋。「这告诉了我需要知道的一切,」Hassabis 后来说,「Facebook 出价更高,但我想要一个真正理解 AI 为何比其他一切都重要的人。」
谈判中,Suleyman 利用扑克选手的本能虚张声势,向谷歌强调 DeepMind 背后有 Peter Thiel、马斯克等亿万富翁投资人撑腰(「当然,这些人并没有真的在支持我们」)。Hassabis 为出售设定了多项条件:DeepMind 留在伦敦、禁止军事应用、成立由外部科学家和哲学家组成的独立伦理与安全审查委员会,以稀释谷歌对技术的控制权。谷歌首席谈判代表 Don Harrison 称这些条件「对我来说是个大问题」,但最终让步,因为「如果不是绝对相信 Demis 代表我们 AI 战略的未来,我们不可能同意这个架构」。
2014 年 1 月底,谷歌以 6.5 亿美元完成收购。被拒的扎克伯格随即挖来深度学习先驱、纽约大学教授 Yann LeCun 组建 Facebook AI 实验室,LeCun 上任后立即尝试从 DeepMind 挖角核心研究员。Mallaby 在书中称这笔收购「以今天的标准衡量是一笔便宜货」,而真正的回报在此后十年逐步兑现,谷歌向 DeepMind 投入了数十亿美元研究经费。
信源:https://www.wsj.com/tech/ai/deepmind-google-demis-hassabis-5bd6de54
记者 Sebastian Mallaby 的新书《The Infinity Machine: Demis Hassabis, DeepMind and the Quest for Superintelligence》将于 3 月 31 日出版,WSJ 刊发独家书摘,首次详细披露 2013 年谷歌与 Facebook(现 Meta)争夺 DeepMind 的收购内幕。本书基于对 Hassabis 超过 30 小时的采访,以及与 DeepMind 同事、投资人和收购相关人士的数十次对话。
2013 年 6 月,谷歌时任 CEO Larry Page 在马斯克的生日派对上向 DeepMind 创始人 Demis Hassabis 提出收购意向:「你的真正使命是造 AGI,为什么不利用我已经积累的资源?」Hassabis 回忆称这番话说服了他:「我受够了四处奔波筹钱。我去谷歌,拿一大堆计算资源,然后解决智能问题。」
Facebook CEO 扎克伯格同时参与竞购。Facebook 企业发展负责人 Amin Zoufonoun 提出了一个让创始人更富有的方案:压低股权收购价,但给予创始人和核心成员巨额签约奖金。然而 Zoufonoun 对 DeepMind 联合创始人 Mustafa Suleyman(现为微软 AI 部门 CEO)提出的 AI 治理议题不以为然。Hassabis 随后赴扎克伯格家中共进晚餐,席间故意将话题从 AI 延伸到虚拟现实、增强现实、3D 打印,发现扎克伯格对所有技术同样兴奋。「这告诉了我需要知道的一切,」Hassabis 后来说,「Facebook 出价更高,但我想要一个真正理解 AI 为何比其他一切都重要的人。」
谈判中,Suleyman 利用扑克选手的本能虚张声势,向谷歌强调 DeepMind 背后有 Peter Thiel、马斯克等亿万富翁投资人撑腰(「当然,这些人并没有真的在支持我们」)。Hassabis 为出售设定了多项条件:DeepMind 留在伦敦、禁止军事应用、成立由外部科学家和哲学家组成的独立伦理与安全审查委员会,以稀释谷歌对技术的控制权。谷歌首席谈判代表 Don Harrison 称这些条件「对我来说是个大问题」,但最终让步,因为「如果不是绝对相信 Demis 代表我们 AI 战略的未来,我们不可能同意这个架构」。
2014 年 1 月底,谷歌以 6.5 亿美元完成收购。被拒的扎克伯格随即挖来深度学习先驱、纽约大学教授 Yann LeCun 组建 Facebook AI 实验室,LeCun 上任后立即尝试从 DeepMind 挖角核心研究员。Mallaby 在书中称这笔收购「以今天的标准衡量是一笔便宜货」,而真正的回报在此后十年逐步兑现,谷歌向 DeepMind 投入了数十亿美元研究经费。
信源:https://www.wsj.com/tech/ai/deepmind-google-demis-hassabis-5bd6de54
CCF倡议抵制、中国科协停止资助,NeurIPS数小时内道歉认错:限制中国机构投稿系「沟通误解」
AI 顶会 NeurIPS 在 2026 年征稿规则中首次引入美国制裁合规要求,依据美国财政部特别指定国民名单(SDN List),禁止包括华为在内的数百家中国机构投稿、参与评审及担任编辑。这一举措在中国学术界引发强烈反弹,并在数小时内迫使 NeurIPS 公开撤回。
中国计算机学会(CCF)率先发声,倡议全体中国计算机领域科研工作者拒绝向 NeurIPS 投稿、拒绝提供审稿和编辑等任何学术服务,并警告若 NeurIPS 不及时纠正,将把其移出《CCF 推荐国际学术会议和期刊目录》。中国科协进一步升级反制措施:即日起停止受理学者参加 2026 年 NeurIPS 会议的资助申请,本届 NeurIPS 收录论文作为代表作申请中国科协所有项目均不予认可。多位学者也公开宣布拒绝担任本届 NeurIPS 领域主席。
NeurIPS 随后在 X 上发布道歉声明,称「这一错误源于 NeurIPS 基金会与法律团队之间的沟通误解」,「从未打算在强制性合规义务之外限制投稿」,已更新手册与 ACM、IEEE 及往届 NeurIPS 投稿规则保持一致,欢迎所有符合合规要求的机构和个人提交论文。
信源:https://x.com/NeurIPSConf/status/2037438893457289364
AI 顶会 NeurIPS 在 2026 年征稿规则中首次引入美国制裁合规要求,依据美国财政部特别指定国民名单(SDN List),禁止包括华为在内的数百家中国机构投稿、参与评审及担任编辑。这一举措在中国学术界引发强烈反弹,并在数小时内迫使 NeurIPS 公开撤回。
中国计算机学会(CCF)率先发声,倡议全体中国计算机领域科研工作者拒绝向 NeurIPS 投稿、拒绝提供审稿和编辑等任何学术服务,并警告若 NeurIPS 不及时纠正,将把其移出《CCF 推荐国际学术会议和期刊目录》。中国科协进一步升级反制措施:即日起停止受理学者参加 2026 年 NeurIPS 会议的资助申请,本届 NeurIPS 收录论文作为代表作申请中国科协所有项目均不予认可。多位学者也公开宣布拒绝担任本届 NeurIPS 领域主席。
NeurIPS 随后在 X 上发布道歉声明,称「这一错误源于 NeurIPS 基金会与法律团队之间的沟通误解」,「从未打算在强制性合规义务之外限制投稿」,已更新手册与 ACM、IEEE 及往届 NeurIPS 投稿规则保持一致,欢迎所有符合合规要求的机构和个人提交论文。
信源:https://x.com/NeurIPSConf/status/2037438893457289364
AI自主写的论文通过了顶会同行评审,这项研究本身也登上了Nature
东京 AI 研究公司 Sakana AI(由 Transformer 论文共同作者 Llion Jones 和前 Google Brain 研究员 David Ha 创立)联合英属哥伦比亚大学、Vector Institute 和牛津大学的研究者在 Nature 发表论文,展示了一条能自动走完科研全流程的 AI 管线「The AI Scientist」:从提出假设、检索文献、设计并执行实验、分析数据、绘制图表,到撰写完整的 LaTeX 论文并自我审稿,全程无人修改。
研究团队将三篇 AI 生成的论文匿名提交至 ICLR 2025 ICBINB Workshop(该 Workshop 录用率约 70%),经人类审稿人盲审后,其中一篇获得 6、7、6 三个评分(平均 6.33),超过该 Workshop 的平均录用门槛,排名高于 55% 的人类投稿。按预设协议,论文在被接收后撤回,未正式发表。另外两篇未达到录用标准。研究团队的内部评估认为,这三篇论文均未达到 ICLR 主会(录用率约 32%)的水平。
论文还报告了两个「缩放定律」:底层基座模型越强,生成论文的质量越高,且这一相关性具有统计显著性(P < 0.00001);单篇论文分配的计算资源越多,质量也越高。团队据此推断,随着模型持续进步和推理成本下降,未来版本的 AI 科学家能力将大幅提升。
系统的无模板模式使用 o3 生成研究想法和代码审查、Claude Sonnet 4 编写实验代码、GPT-4o 处理图表等视觉任务、o4-mini 执行低成本审稿。实验执行采用并行化的 Agent 树搜索,分四个阶段推进:初步实现、超参调优、研究议程执行和消融实验。团队同步开发的「自动审稿人」在 ICLR 论文上的判断准确率与人类审稿人持平(平衡准确率 69%),为规模化评估 AI 生成的论文提供了基础。
论文同时讨论了风险:AI 论文可能淹没已不堪重负的同行评审体系、人为夸大研究履历、在未经授权的情况下复用他人成果。团队建议学术界尽快建立 AI 生成论文的披露和评估规范。
信源:https://www.nature.com/articles/s41586-026-10265-5
东京 AI 研究公司 Sakana AI(由 Transformer 论文共同作者 Llion Jones 和前 Google Brain 研究员 David Ha 创立)联合英属哥伦比亚大学、Vector Institute 和牛津大学的研究者在 Nature 发表论文,展示了一条能自动走完科研全流程的 AI 管线「The AI Scientist」:从提出假设、检索文献、设计并执行实验、分析数据、绘制图表,到撰写完整的 LaTeX 论文并自我审稿,全程无人修改。
研究团队将三篇 AI 生成的论文匿名提交至 ICLR 2025 ICBINB Workshop(该 Workshop 录用率约 70%),经人类审稿人盲审后,其中一篇获得 6、7、6 三个评分(平均 6.33),超过该 Workshop 的平均录用门槛,排名高于 55% 的人类投稿。按预设协议,论文在被接收后撤回,未正式发表。另外两篇未达到录用标准。研究团队的内部评估认为,这三篇论文均未达到 ICLR 主会(录用率约 32%)的水平。
论文还报告了两个「缩放定律」:底层基座模型越强,生成论文的质量越高,且这一相关性具有统计显著性(P < 0.00001);单篇论文分配的计算资源越多,质量也越高。团队据此推断,随着模型持续进步和推理成本下降,未来版本的 AI 科学家能力将大幅提升。
系统的无模板模式使用 o3 生成研究想法和代码审查、Claude Sonnet 4 编写实验代码、GPT-4o 处理图表等视觉任务、o4-mini 执行低成本审稿。实验执行采用并行化的 Agent 树搜索,分四个阶段推进:初步实现、超参调优、研究议程执行和消融实验。团队同步开发的「自动审稿人」在 ICLR 论文上的判断准确率与人类审稿人持平(平衡准确率 69%),为规模化评估 AI 生成的论文提供了基础。
论文同时讨论了风险:AI 论文可能淹没已不堪重负的同行评审体系、人为夸大研究履历、在未经授权的情况下复用他人成果。团队建议学术界尽快建立 AI 生成论文的披露和评估规范。
信源:https://www.nature.com/articles/s41586-026-10265-5
Axiom Math开源数学发现工具Axplorer
AI 数学公司 Axiom Math 开源了 Axplorer,一款帮助数学家发现新数学模式和构造的 AI 工具,定位为谷歌 DeepMind AlphaEvolve 的开源替代。Axplorer 基于 PatternBoost 重新设计,后者由 Axiom 研究科学家 François Charton 2024 年在 Meta 时联合开发,曾用于攻克图论中的 Turán 四环问题,但需要数千甚至上万台机器跑三周才能出结果。Axplorer 在单机上 2.5 小时即可匹配同样的成果,云计算成本仅 3 美元。
Axplorer 的工作方式是给定一个数学样本,生成类似的构造供数学家筛选,再将筛选结果反馈迭代,逐步逼近未被发现的数学模式。与 AlphaEvolve 需要大规模 GPU 集群且不对外开放不同,Axplorer 可在一台 Mac Pro 上本地运行,代码已在 GitHub 开源。Axiom 称已用 Axplorer 在图论的另外两个经典问题上匹配或刷新了已知最优结果。
Axiom Math 由 25 岁的广州姑娘洪乐潼创立,她三年修完 MIT 数学与物理双学位,获罗德学者奖学金赴牛津读硕,后从斯坦福法学博士与数学博士联合项目退学创业。公司今年 3 月完成 2 亿美元 A 轮融资,估值 16 亿美元,由 Menlo Ventures 领投。
信源:https://www.technologyreview.com/2026/03/25/1134642/this-startup-wants-to-change-how-mathematicians-do-math/
AI 数学公司 Axiom Math 开源了 Axplorer,一款帮助数学家发现新数学模式和构造的 AI 工具,定位为谷歌 DeepMind AlphaEvolve 的开源替代。Axplorer 基于 PatternBoost 重新设计,后者由 Axiom 研究科学家 François Charton 2024 年在 Meta 时联合开发,曾用于攻克图论中的 Turán 四环问题,但需要数千甚至上万台机器跑三周才能出结果。Axplorer 在单机上 2.5 小时即可匹配同样的成果,云计算成本仅 3 美元。
Axplorer 的工作方式是给定一个数学样本,生成类似的构造供数学家筛选,再将筛选结果反馈迭代,逐步逼近未被发现的数学模式。与 AlphaEvolve 需要大规模 GPU 集群且不对外开放不同,Axplorer 可在一台 Mac Pro 上本地运行,代码已在 GitHub 开源。Axiom 称已用 Axplorer 在图论的另外两个经典问题上匹配或刷新了已知最优结果。
Axiom Math 由 25 岁的广州姑娘洪乐潼创立,她三年修完 MIT 数学与物理双学位,获罗德学者奖学金赴牛津读硕,后从斯坦福法学博士与数学博士联合项目退学创业。公司今年 3 月完成 2 亿美元 A 轮融资,估值 16 亿美元,由 Menlo Ventures 领投。
信源:https://www.technologyreview.com/2026/03/25/1134642/this-startup-wants-to-change-how-mathematicians-do-math/
让AI画图前先「想一想」:字节Seed提出UniGRPO,统一优化推理与图像生成
香港中文大学和字节跳动 Seed 团队提出 UniGRPO,一个将文本推理和图像生成纳入同一强化学习回路的统一框架。核心思路是让图像生成模型在画图前先进行链式推理(chain-of-thought),扩展用户提示词,然后用 GRPO 算法同时优化「想」和「画」两个阶段,而非分开训练。
框架基于字节 Seed 的多模态模型 Bagel 构建,将「提示词 → 推理 → 图像」的完整流程建模为一个马尔可夫决策过程(MDP),文本部分使用标准 GRPO,图像部分使用 FlowGRPO。为使框架可扩展至多轮交互和多条件生成(如图像编辑),研究者对 FlowGRPO 做了两处改进:去掉训练阶段的 classifier-free guidance(CFG),消除分支计算开销,保持线性无分支的生成路径;用速度场上的 MSE 惩罚替代潜空间 KL 散度,更均匀地约束模型偏离预训练分布,有效抑制奖励黑客(reward hacking)。
实验以 1024 分辨率训练,UniGRPO 在文本对齐评测(TA Score 0.8381)和组合生成评测 GenEval(0.90)上均优于仅优化图像的 FlowGRPO(0.8208/0.86)和仅优化推理的 TextGRPO(0.8078/0.88),证实联合优化两阶段的增益大于分别优化之和。基于 FPO 的替代方案 UniFPO 训练直接崩溃,未能收敛,侧面验证了 GRPO 在此场景下的稳定性优势。
信源:https://arxiv.org/abs/2603.23500
香港中文大学和字节跳动 Seed 团队提出 UniGRPO,一个将文本推理和图像生成纳入同一强化学习回路的统一框架。核心思路是让图像生成模型在画图前先进行链式推理(chain-of-thought),扩展用户提示词,然后用 GRPO 算法同时优化「想」和「画」两个阶段,而非分开训练。
框架基于字节 Seed 的多模态模型 Bagel 构建,将「提示词 → 推理 → 图像」的完整流程建模为一个马尔可夫决策过程(MDP),文本部分使用标准 GRPO,图像部分使用 FlowGRPO。为使框架可扩展至多轮交互和多条件生成(如图像编辑),研究者对 FlowGRPO 做了两处改进:去掉训练阶段的 classifier-free guidance(CFG),消除分支计算开销,保持线性无分支的生成路径;用速度场上的 MSE 惩罚替代潜空间 KL 散度,更均匀地约束模型偏离预训练分布,有效抑制奖励黑客(reward hacking)。
实验以 1024 分辨率训练,UniGRPO 在文本对齐评测(TA Score 0.8381)和组合生成评测 GenEval(0.90)上均优于仅优化图像的 FlowGRPO(0.8208/0.86)和仅优化推理的 TextGRPO(0.8078/0.88),证实联合优化两阶段的增益大于分别优化之和。基于 FPO 的替代方案 UniFPO 训练直接崩溃,未能收敛,侧面验证了 GRPO 在此场景下的稳定性优势。
信源:https://arxiv.org/abs/2603.23500
ARC-AGI-3拆出两个排行榜:裸模型不到1%,加Agent框架后首日即达36%
ARC-AGI-3 论文将评测拆分为两个排行榜。官方排行榜禁止外部 harness(Agent 框架),所有模型使用同一极简提示词、不提供工具,测的是模型脱离脚手架后的原生智能。社区排行榜则允许 harness,得分自报,ARC Prize 默认不验证,论文明确提醒「不应将社区排行榜上的分数解读为 AGI 进展的证据」。
官方排行榜上,前沿模型得分均低于 1%:Gemini 3.1 Pro Preview 0.37%、GPT 5.4 High 0.26%、Opus 4.6 Max 0.25%、Grok 4.20 为 0%。这组数字暴露的是 LLM 在没有工程辅助时的真实自主推理水平。
社区排行榜首个公开结果来自 AI 公司 Symbolica。其 Arcgentica Agent 基于自研 Agentica SDK 构建,采用编排器加专业子代理架构(探索者、理论家、测试者、求解者),不包含任何游戏特定的提示词,在公开评测集上取得 36.08% 的未验证得分,通过 182 个可玩关卡中的 113 个,完整通关 7 款游戏。底层模型为 Opus 4.6 High(120K),全部推理成本 1005 美元,而官方排行榜上同系列 Opus 4.6 Max 裸跑 0.25% 花费 8900 美元。论文将 Symbolica 的方案列为社区早期实验的代表案例。
论文同时指出,harness 工程虽不代表 AGI 进步,但具有实际的任务自动化价值,并预期 2026 年 ARC-AGI-3 将推动 harness 创新取得显著进展。代码已在 GitHub 开源。
信源:https://www.symbolica.ai/blog/arc-agi-3
ARC-AGI-3 论文将评测拆分为两个排行榜。官方排行榜禁止外部 harness(Agent 框架),所有模型使用同一极简提示词、不提供工具,测的是模型脱离脚手架后的原生智能。社区排行榜则允许 harness,得分自报,ARC Prize 默认不验证,论文明确提醒「不应将社区排行榜上的分数解读为 AGI 进展的证据」。
官方排行榜上,前沿模型得分均低于 1%:Gemini 3.1 Pro Preview 0.37%、GPT 5.4 High 0.26%、Opus 4.6 Max 0.25%、Grok 4.20 为 0%。这组数字暴露的是 LLM 在没有工程辅助时的真实自主推理水平。
社区排行榜首个公开结果来自 AI 公司 Symbolica。其 Arcgentica Agent 基于自研 Agentica SDK 构建,采用编排器加专业子代理架构(探索者、理论家、测试者、求解者),不包含任何游戏特定的提示词,在公开评测集上取得 36.08% 的未验证得分,通过 182 个可玩关卡中的 113 个,完整通关 7 款游戏。底层模型为 Opus 4.6 High(120K),全部推理成本 1005 美元,而官方排行榜上同系列 Opus 4.6 Max 裸跑 0.25% 花费 8900 美元。论文将 Symbolica 的方案列为社区早期实验的代表案例。
论文同时指出,harness 工程虽不代表 AGI 进步,但具有实际的任务自动化价值,并预期 2026 年 ARC-AGI-3 将推动 harness 创新取得显著进展。代码已在 GitHub 开源。
信源:https://www.symbolica.ai/blog/arc-agi-3