Hugging Face支持可视化上传的Pi trace,代理执行过程能直接分享
Hugging Face 现已支持可视化用户上传的 Pi trace。按截图显示,上传后可直接在页面里查看一次代理会话的文件、工具调用和执行结果,不用再只对着原始 trace 文件翻日志。
Hugging Face CEO Clément Delangue 表示,目标是让分享 agent trace 变得更常见。对现在的代理社区来说,更稀缺的是能拿来分析、比较和复现的真实执行轨迹。Hugging Face 这次补上的就是这一层基础设施。
信源:https://x.com/ClementDelangue/status/2044834155125424326
Hugging Face 现已支持可视化用户上传的 Pi trace。按截图显示,上传后可直接在页面里查看一次代理会话的文件、工具调用和执行结果,不用再只对着原始 trace 文件翻日志。
Hugging Face CEO Clément Delangue 表示,目标是让分享 agent trace 变得更常见。对现在的代理社区来说,更稀缺的是能拿来分析、比较和复现的真实执行轨迹。Hugging Face 这次补上的就是这一层基础设施。
信源:https://x.com/ClementDelangue/status/2044834155125424326
X (formerly Twitter)
clem 🤗 (@ClementDelangue) on X
You can now visualize Pi traces that you upload on
@huggingface!
Let's make sharing agent traces 10x more common to make agent AI more open and collaborative! Also, because it's fun to analyze @badlogicgames's traces 😂😂😂
@huggingface!
Let's make sharing agent traces 10x more common to make agent AI more open and collaborative! Also, because it's fun to analyze @badlogicgames's traces 😂😂😂
PrismML推出1.58比特模型Ternary Bonsai,参数缩减9倍智能度反超同类
PrismML 发布 Ternary Bonsai 系列语言模型,通过 1.58 比特(ternary weights)技术,在保持高性能的同时将模型显存占用缩减至 16 比特模型的九分之一。该系列包含 8B、4B 和 1.7B 三种参数规模,现已在 Hugging Face 开源并支持苹果设备原生运行。
所谓 1.58 比特模型,是指将神经网络中的权重限制在 {-1, 0, +1} 三个值。相比此前追求极致压缩的 1 比特模型(权重仅为 {-1, +1}),引入「0」值能够有效剔除冗余连接,让模型在极小的体积下依然保留复杂的推理能力。此次发布的 Ternary Bonsai 8B 权重文件仅 1.75 GB,其基准测试均分达到 75.5,不仅比自家的 1 比特版本高出 5 分,甚至在「智能密度」(每 GB 显存贡献的性能)上大幅领先 Qwen3 等同类稠密模型。
能效比和运行速度是该系列的另一核心优势。在 iPhone 17 Pro Max 上,8B 版本运行速度可达 27 tok/s,能效比提升约 3 至 4 倍。这对于需要在手机、笔记本等端侧设备上部署高性能 AI 的开发者而言,意味着可以用极小的内存代价换取接近完整精度模型的智能表现。
目前,Ternary Bonsai 模型已在 Apple 设备上通过 MLX 框架实现原生支持。模型权重采用 Apache 2.0 协议分发。
信源:https://prismml.com/news/ternary-bonsai
PrismML 发布 Ternary Bonsai 系列语言模型,通过 1.58 比特(ternary weights)技术,在保持高性能的同时将模型显存占用缩减至 16 比特模型的九分之一。该系列包含 8B、4B 和 1.7B 三种参数规模,现已在 Hugging Face 开源并支持苹果设备原生运行。
所谓 1.58 比特模型,是指将神经网络中的权重限制在 {-1, 0, +1} 三个值。相比此前追求极致压缩的 1 比特模型(权重仅为 {-1, +1}),引入「0」值能够有效剔除冗余连接,让模型在极小的体积下依然保留复杂的推理能力。此次发布的 Ternary Bonsai 8B 权重文件仅 1.75 GB,其基准测试均分达到 75.5,不仅比自家的 1 比特版本高出 5 分,甚至在「智能密度」(每 GB 显存贡献的性能)上大幅领先 Qwen3 等同类稠密模型。
能效比和运行速度是该系列的另一核心优势。在 iPhone 17 Pro Max 上,8B 版本运行速度可达 27 tok/s,能效比提升约 3 至 4 倍。这对于需要在手机、笔记本等端侧设备上部署高性能 AI 的开发者而言,意味着可以用极小的内存代价换取接近完整精度模型的智能表现。
目前,Ternary Bonsai 模型已在 Apple 设备上通过 MLX 框架实现原生支持。模型权重采用 Apache 2.0 协议分发。
信源:https://prismml.com/news/ternary-bonsai
Prismml
PrismML — Introducing Ternary Bonsai: Top Intelligence at 1.58 Bits
Today, we’re announcing Ternary Bonsai, a new family of 1.58-bit language models designed to balance strict memory constraints with high accuracy requirements.
❤1
Firecrawl 开源自主网页代理框架:支持多模型与并行子代理,一键生成调研工具
Firecrawl 正式开源网页代理框架 Web Agent,旨在帮助开发者构建能自主执行「搜索-抓取-交互」闭环任务的 AI 代理。该框架基于 Firecrawl 现有的
框架的核心架构采用了「计划-行动」(Plan-Act)循环机制。代理在接收指令后,会先拆解步骤,通过并行生成的「子代理」(Subagents)在独立的浏览器会话中同步作业。这种设计在处理大规模并发任务时优势明显,例如视频演示中代理能同时从多家公司官网提取实时股票数据与新闻。
对于开发者而言,该工具显著降低了网页代理的开发门槛。通过
信源:https://github.com/firecrawl/web-agent
Firecrawl 正式开源网页代理框架 Web Agent,旨在帮助开发者构建能自主执行「搜索-抓取-交互」闭环任务的 AI 代理。该框架基于 Firecrawl 现有的
/agent 架构,支持接入 Anthropic、OpenAI 或各类自托管大模型,强调在网页调研场景下的灵活性与自托管能力。框架的核心架构采用了「计划-行动」(Plan-Act)循环机制。代理在接收指令后,会先拆解步骤,通过并行生成的「子代理」(Subagents)在独立的浏览器会话中同步作业。这种设计在处理大规模并发任务时优势明显,例如视频演示中代理能同时从多家公司官网提取实时股票数据与新闻。
对于开发者而言,该工具显著降低了网页代理的开发门槛。通过
firecrawl create agent 命令,即可快速生成基于 Next.js 或 Express 的完整代理模板。此外,框架引入了可复用的「技能手册」(SKILL.md),开发者可以将复杂的作业流程(如针对 Yahoo Finance 的特定抓取逻辑)封装为 Skill,供代理在后续任务中直接调用。信源:https://github.com/firecrawl/web-agent
GitHub
GitHub - firecrawl/web-agent: 🔥 Open-source web data agent optimized for structured web research
🔥 Open-source web data agent optimized for structured web research - firecrawl/web-agent
OpenAI 就业研究报告:AI 或将增加工作岗位而非导致失业大潮
OpenAI 一项针对 900 多种职业的研究显示,AI 在劳动力市场引发的震荡可能并不像大众预期的那样充满悲剧色彩。报告指出,尽管数据录入、簿记和客服等职业面临极高的自动化风险(约占总就业人数的 18%),但这些领域的从业者已在利用 AI 处理约三倍于其他职业的任务量,且失业率上升速度反而低于低风险职业。
这种反直觉的现象源于「消费弹性」:当 AI 让某项任务(如写代码)的产出变得更廉价、更快捷时,市场对该服务的总需求往往会呈指数级增长,从而抵消了效率提升带来的减员压力。报告将职业分为四类:除上述高风险组外,46% 的职业(如教师、家政人员)受影响极小;24% 的角色虽然可能缩减规模,但仍需人类主导;而 12% 的职业(如软件开发)则会因 AI 的普及而实现岗位扩张。
目前,高风险职业的从业者仅利用了 AI 理论能力的不到四分之一。
信源:https://cdn.openai.com/pdf/the-ai-jobs-transition-framework_report.pdf
OpenAI 一项针对 900 多种职业的研究显示,AI 在劳动力市场引发的震荡可能并不像大众预期的那样充满悲剧色彩。报告指出,尽管数据录入、簿记和客服等职业面临极高的自动化风险(约占总就业人数的 18%),但这些领域的从业者已在利用 AI 处理约三倍于其他职业的任务量,且失业率上升速度反而低于低风险职业。
这种反直觉的现象源于「消费弹性」:当 AI 让某项任务(如写代码)的产出变得更廉价、更快捷时,市场对该服务的总需求往往会呈指数级增长,从而抵消了效率提升带来的减员压力。报告将职业分为四类:除上述高风险组外,46% 的职业(如教师、家政人员)受影响极小;24% 的角色虽然可能缩减规模,但仍需人类主导;而 12% 的职业(如软件开发)则会因 AI 的普及而实现岗位扩张。
目前,高风险职业的从业者仅利用了 AI 理论能力的不到四分之一。
信源:https://cdn.openai.com/pdf/the-ai-jobs-transition-framework_report.pdf
xAI 静默测试 Grok 4.3:Beta 版现身官网下拉菜单
多名用户发现,xAI 官方网站 Grok.com 的模型选择菜单中出现了「Grok 4.3 (beta)」选项,并标注为「Early Access」(早期访问)。此前,xAI 网页端的主力版本为 2 月发布的 Grok 4.20 系列。
Grok 4.3 的核心改进预计集中在超长上下文处理能力以及原生的多模态视频理解上。
信源:https://x.com/mrfanduuuuu/status/2045070600293785608?s=46
多名用户发现,xAI 官方网站 Grok.com 的模型选择菜单中出现了「Grok 4.3 (beta)」选项,并标注为「Early Access」(早期访问)。此前,xAI 网页端的主力版本为 2 月发布的 Grok 4.20 系列。
Grok 4.3 的核心改进预计集中在超长上下文处理能力以及原生的多模态视频理解上。
信源:https://x.com/mrfanduuuuu/status/2045070600293785608?s=46
马斯克 xAI 转向「云厂商」角色,向 AI 编程独角兽 Cursor 开放数万颗 GPU 算力
xAI 计划向 AI 编程初创公司 Cursor 提供大规模算力支持,允许其在 xAI 的基础设施上训练最新编程模型 Composer 2.5。据 Business Insider 披露,Cursor 将调用 xAI 旗下「Colossus」数据中心中的数万颗 GPU。这一安排标志着 xAI 战略的重大转向:通过出租冗余算力,xAI 正在从单纯的模型研发商向类似 AWS、CoreWeave 的云服务商角色扩张。
这一合作背景复杂。今年 3 月,xAI 刚从 Cursor 挖走了两名产品工程主管负责其产品团队。此外,xAI 内部一份备忘录显示,其目前的 GPU 利用率(MFU)仅为 11%,远低于 35% 至 45% 的行业平均水平。xAI 总裁 Michael Nicolls 已要求团队在数月内将利用率提升至 50%。向外部独角兽开放算力,既能分摊昂贵的数据中心运营成本,也能通过服务顶级编程代理获取宝贵的工程反馈。
目前,Cursor 正以 500 亿美元的估值进行融资谈判。在 OpenAI 和 Anthropic 激进切入编程助理赛道的背景下,绑定 xAI 的算力资源已成为其维持竞争优势的关键砝码。
信源:https://www.businessinsider.com/elon-musk-xai-compute-cursor-ai-model-training-2026-4
xAI 计划向 AI 编程初创公司 Cursor 提供大规模算力支持,允许其在 xAI 的基础设施上训练最新编程模型 Composer 2.5。据 Business Insider 披露,Cursor 将调用 xAI 旗下「Colossus」数据中心中的数万颗 GPU。这一安排标志着 xAI 战略的重大转向:通过出租冗余算力,xAI 正在从单纯的模型研发商向类似 AWS、CoreWeave 的云服务商角色扩张。
这一合作背景复杂。今年 3 月,xAI 刚从 Cursor 挖走了两名产品工程主管负责其产品团队。此外,xAI 内部一份备忘录显示,其目前的 GPU 利用率(MFU)仅为 11%,远低于 35% 至 45% 的行业平均水平。xAI 总裁 Michael Nicolls 已要求团队在数月内将利用率提升至 50%。向外部独角兽开放算力,既能分摊昂贵的数据中心运营成本,也能通过服务顶级编程代理获取宝贵的工程反馈。
目前,Cursor 正以 500 亿美元的估值进行融资谈判。在 OpenAI 和 Anthropic 激进切入编程助理赛道的背景下,绑定 xAI 的算力资源已成为其维持竞争优势的关键砝码。
信源:https://www.businessinsider.com/elon-musk-xai-compute-cursor-ai-model-training-2026-4
Business Insider
Elon Musk's xAI plans to supply computing power to coding startup Cursor
Elon Musk's xAI is collaborating with Cursor, which is using xAI's GPUs for model training, people with knowledge of the matter said.
NUS团队发布GameWorld基准,在34款浏览器游戏中评估多模态AI代理
新加坡国立大学(NUS)团队发布 GameWorld,一个旨在标准化评估多模态大语言模型(MLLM)在视频游戏中作为通用代理能力的基准测试。该研究指出,尽管视频游戏提供了理想的闭环交互测试床,但现有评估常受限于操作接口不统一和人工启发式验证。
GameWorld 包含 34 款多样的浏览器游戏和 170 项任务,并为每个任务配备了基于游戏底层状态的可验证指标,以实现客观的结果评估。研究团队测试了两种代理接口:一是直接输出键鼠指令的「计算机使用(computer-use)」代理,二是通过语义解析在语义动作空间中操作的通用多模态代理。
在对 18 种「模型-接口」组合进行的大规模测试中,结果显示即便当前表现最好的 AI 代理,其游戏能力也远未达到人类水平。研究进一步暴露了游戏代理在实时交互延迟、上下文记忆敏感度以及动作有效性等方面的严峻挑战。相关论文及项目代码已在 Hugging Face 和 GitHub 公开。
信源:https://huggingface.co/papers/2604.07429
新加坡国立大学(NUS)团队发布 GameWorld,一个旨在标准化评估多模态大语言模型(MLLM)在视频游戏中作为通用代理能力的基准测试。该研究指出,尽管视频游戏提供了理想的闭环交互测试床,但现有评估常受限于操作接口不统一和人工启发式验证。
GameWorld 包含 34 款多样的浏览器游戏和 170 项任务,并为每个任务配备了基于游戏底层状态的可验证指标,以实现客观的结果评估。研究团队测试了两种代理接口:一是直接输出键鼠指令的「计算机使用(computer-use)」代理,二是通过语义解析在语义动作空间中操作的通用多模态代理。
在对 18 种「模型-接口」组合进行的大规模测试中,结果显示即便当前表现最好的 AI 代理,其游戏能力也远未达到人类水平。研究进一步暴露了游戏代理在实时交互延迟、上下文记忆敏感度以及动作有效性等方面的严峻挑战。相关论文及项目代码已在 Hugging Face 和 GitHub 公开。
信源:https://huggingface.co/papers/2604.07429
huggingface.co
Paper page - GameWorld: Towards Standardized and Verifiable Evaluation of Multimodal Game Agents
Join the discussion on this paper page
Quiver 发布 Arrow 1.1:SVG 矢量生成成本直降 50%,新增 Max 精度模型
矢量图形生成平台 Quiver AI 宣布推出 Arrow 1.1,这是其基于代码生成(而非像素逼近)逻辑的 SVG 专项模型的重大升级。新版本在提升视觉设计感的同时,重点实现了生产环境下的成本缩减:文本转 SVG 的成本降低了 33.3%,而图像矢量化成本则大幅下降 50%。
Arrow 1.1 的核心进化在于「决策逻辑」的转变。相比 1.0 版本,新模型更倾向于使用几何原语(如形状、文本、基本几何体)而非单纯依赖路径堆叠,生成的 SVG 文件更易于编辑、检查和扩展。同时,Arrow 1.1 在遵循 Prompt 的布局平衡与颜色选取上也更具「设计师思维」。
针对高精度需求的场景,Quiver 同步推出了 Arrow 1.1 Max 模型。该模型在保持核心逻辑一致的基础上,牺牲了部分运行速度以换取极致的形状对齐与细节稳定性,适用于技术图表、服装设计稿(Technical Flats)以及精密工程示意图。目前,Arrow 1.1 已在 Quiver 官网控制台上线,支持开发者通过 API 接入现有的设计与开发工作流。
信源:https://quiver.ai/blog/introducing-arrow-1-1
矢量图形生成平台 Quiver AI 宣布推出 Arrow 1.1,这是其基于代码生成(而非像素逼近)逻辑的 SVG 专项模型的重大升级。新版本在提升视觉设计感的同时,重点实现了生产环境下的成本缩减:文本转 SVG 的成本降低了 33.3%,而图像矢量化成本则大幅下降 50%。
Arrow 1.1 的核心进化在于「决策逻辑」的转变。相比 1.0 版本,新模型更倾向于使用几何原语(如形状、文本、基本几何体)而非单纯依赖路径堆叠,生成的 SVG 文件更易于编辑、检查和扩展。同时,Arrow 1.1 在遵循 Prompt 的布局平衡与颜色选取上也更具「设计师思维」。
针对高精度需求的场景,Quiver 同步推出了 Arrow 1.1 Max 模型。该模型在保持核心逻辑一致的基础上,牺牲了部分运行速度以换取极致的形状对齐与细节稳定性,适用于技术图表、服装设计稿(Technical Flats)以及精密工程示意图。目前,Arrow 1.1 已在 Quiver 官网控制台上线,支持开发者通过 API 接入现有的设计与开发工作流。
信源:https://quiver.ai/blog/introducing-arrow-1-1
Mem0 发布长效记忆架构研究:准确率领先 OpenAI 26%,推理延迟降低 91%
个性化 AI 记忆平台 Mem0 近期公开了其核心长效记忆算法的研究成果。实验数据显示,在 LOCOMO 基准测试中,Mem0 的响应准确率比 OpenAI 的内置记忆功能高出 26%,同时由于其「事实化」的检索机制,其 P95 推理延迟降低了 91%,Token 消耗量缩减了 90%。
该算法解决的核心问题是 AI 代理在长周期交互中的「健忘」现象。与单纯扩大 LLM 上下文窗口的暴力路径不同,Mem0 采用了一种两阶段处理管线:在「提取阶段」,系统会从最新对话、滚动摘要和历史记录中提取关键事实;在「更新阶段」,系统通过向量数据库进行比对,执行新增、更新、删除冲突或忽略等操作,确保记忆库的精简与一致。
研究还介绍了一种增强型变体 Mem0ᵍ。该版本引入了图数据库结构,将提取的事实转化为带标签的节点与边,从而捕获多会话间的复杂实体关系。在实际生产环境中,Mem0 能在 0.71 秒内完成从记忆检索到回答生成的全流程,而传统的「全上下文」方法则需要近 10 秒。目前,该研究已被欧洲人工智能会议(ECAI)接收,相关代码已在 GitHub 开源。
信源:https://mem0.ai/research
个性化 AI 记忆平台 Mem0 近期公开了其核心长效记忆算法的研究成果。实验数据显示,在 LOCOMO 基准测试中,Mem0 的响应准确率比 OpenAI 的内置记忆功能高出 26%,同时由于其「事实化」的检索机制,其 P95 推理延迟降低了 91%,Token 消耗量缩减了 90%。
该算法解决的核心问题是 AI 代理在长周期交互中的「健忘」现象。与单纯扩大 LLM 上下文窗口的暴力路径不同,Mem0 采用了一种两阶段处理管线:在「提取阶段」,系统会从最新对话、滚动摘要和历史记录中提取关键事实;在「更新阶段」,系统通过向量数据库进行比对,执行新增、更新、删除冲突或忽略等操作,确保记忆库的精简与一致。
研究还介绍了一种增强型变体 Mem0ᵍ。该版本引入了图数据库结构,将提取的事实转化为带标签的节点与边,从而捕获多会话间的复杂实体关系。在实际生产环境中,Mem0 能在 0.71 秒内完成从记忆检索到回答生成的全流程,而传统的「全上下文」方法则需要近 10 秒。目前,该研究已被欧洲人工智能会议(ECAI)接收,相关代码已在 GitHub 开源。
信源:https://mem0.ai/research
DeepSeek拟以至少100亿美元估值开启首轮融资,应对核心人才流失与V4研发延迟
AI 初创公司 DeepSeek(深度求索)正在洽谈首轮外部融资,计划以至少 100 亿美元的估值募集至少 3 亿美元资金。这标志着这家此前由对冲基金幻方量化(High-Flyer)全资支持、一度坚持技术理想主义且拒绝外部资本的初创公司,在融资策略上的重大转向。
此次调整正值 DeepSeek 面临技术迭代压力与竞争对手挖角的双重挑战。虽然 R1 模型曾以极低成本实现高性能震撼全球,但其下一代旗舰模型 V4 的发布进度已多次推迟。推迟原因除工程挑战外,还包括 DeepSeek 工程师正试图让 V4 原生适配华为芯片。由于此前模型主要基于英伟达芯片开发,这一底层架构的切换显著拉长了研发周期。
与此同时,核心团队成员出现流失。V3 模型的核心贡献者罗福莉已加入小米负责 AI 部门,另一位关键研究员郭达雅则被字节跳动以更高薪酬挖走。
信源:https://www.theinformation.com/articles/chinas-deepseek-raising-money-first-time-10-billion-plus-valuation
AI 初创公司 DeepSeek(深度求索)正在洽谈首轮外部融资,计划以至少 100 亿美元的估值募集至少 3 亿美元资金。这标志着这家此前由对冲基金幻方量化(High-Flyer)全资支持、一度坚持技术理想主义且拒绝外部资本的初创公司,在融资策略上的重大转向。
此次调整正值 DeepSeek 面临技术迭代压力与竞争对手挖角的双重挑战。虽然 R1 模型曾以极低成本实现高性能震撼全球,但其下一代旗舰模型 V4 的发布进度已多次推迟。推迟原因除工程挑战外,还包括 DeepSeek 工程师正试图让 V4 原生适配华为芯片。由于此前模型主要基于英伟达芯片开发,这一底层架构的切换显著拉长了研发周期。
与此同时,核心团队成员出现流失。V3 模型的核心贡献者罗福莉已加入小米负责 AI 部门,另一位关键研究员郭达雅则被字节跳动以更高薪酬挖走。
信源:https://www.theinformation.com/articles/chinas-deepseek-raising-money-first-time-10-billion-plus-valuation
The Information
China’s DeepSeek is Raising Money for First Time, At $10 Billion-Plus Valuation
DeepSeek is in talks to raise outside capital for the first time, seeking to beef up its financial war chest so it can better compete in the costly battle to develop leading AI models, according to five people familiar with the matter. DeepSeek is owned by…
Anthropic CEO Amodei给Mythos技术壁垒定了半年到一年窗口期
Anthropic CEO Dario Amodei 在英国《金融时报》「Lunch with the FT」专访中说,他推测开源模型和中国开发者能在 6 到 12 个月内复制 Claude Mythos 的网络安全能力。
Mythos 是 Anthropic 能力上限最高、未对外公开发布的模型,因能大规模发现软件零日漏洞被内部判定为国家安全风险。过去两周,白宫推动联邦机构接入,美国官员与主要银行紧急会商,敦促它们用 Mythos 加固自身网络安全。
Amodei 同时透露,Anthropic 已与 40 多家组织合作推进 Project Glasswing 漏洞修补项目,参与方包括亚马逊、苹果和微软。他承认公司自身的数据安全实践也在受审视,起因是部分 Claude 代码曾发生泄漏。
他的预测意味着 Anthropic 正在同时做两件事:一边延缓 Mythos 级能力扩散,一边推动美国政府和关键基础设施抢先用它把系统漏洞修完。能力扩散到所有人手里那天,防御底子必须已经打好。
信源:https://www.ft.com/content/9e0e0fc6-ab7d-4b69-a8b1-5a972b82fb06
Anthropic CEO Dario Amodei 在英国《金融时报》「Lunch with the FT」专访中说,他推测开源模型和中国开发者能在 6 到 12 个月内复制 Claude Mythos 的网络安全能力。
Mythos 是 Anthropic 能力上限最高、未对外公开发布的模型,因能大规模发现软件零日漏洞被内部判定为国家安全风险。过去两周,白宫推动联邦机构接入,美国官员与主要银行紧急会商,敦促它们用 Mythos 加固自身网络安全。
Amodei 同时透露,Anthropic 已与 40 多家组织合作推进 Project Glasswing 漏洞修补项目,参与方包括亚马逊、苹果和微软。他承认公司自身的数据安全实践也在受审视,起因是部分 Claude 代码曾发生泄漏。
他的预测意味着 Anthropic 正在同时做两件事:一边延缓 Mythos 级能力扩散,一边推动美国政府和关键基础设施抢先用它把系统漏洞修完。能力扩散到所有人手里那天,防御底子必须已经打好。
信源:https://www.ft.com/content/9e0e0fc6-ab7d-4b69-a8b1-5a972b82fb06
OpenAI 核心高层同日离职:Sora 负责人与前CPO退出,科学研究部门遭拆分
OpenAI 两位核心成员 Bill Peebles 和 Kevin Weil 于 4 月 18 日先后宣布离职。Bill Peebles 是视频生成模型 Sora 的核心负责人之一,他见证了 Sora 从最初两人团队到发布 Sora 2 的全过程。Kevin Weil 曾任 OpenAI 首席产品官(CPO),去年 10 月加入研究团队并创立了 OpenAI for Science 部门。
伴随 Kevin Weil 的离职,OpenAI 内部的科学研究部门(OpenAI for Science)也将被拆分并分散到其他研究团队中。Kevin Weil 在离职信中表示,加速科学进步将是实现 AGI 过程中最积极的成果之一。
OpenAI 两位核心成员 Bill Peebles 和 Kevin Weil 于 4 月 18 日先后宣布离职。Bill Peebles 是视频生成模型 Sora 的核心负责人之一,他见证了 Sora 从最初两人团队到发布 Sora 2 的全过程。Kevin Weil 曾任 OpenAI 首席产品官(CPO),去年 10 月加入研究团队并创立了 OpenAI for Science 部门。
伴随 Kevin Weil 的离职,OpenAI 内部的科学研究部门(OpenAI for Science)也将被拆分并分散到其他研究团队中。Kevin Weil 在离职信中表示,加速科学进步将是实现 AGI 过程中最积极的成果之一。
Cursor接近敲定20亿美元新融资,估值500亿美元半年翻倍
AI 编程工具公司 Cursor 接近完成新一轮融资,将至少融入 20 亿美元,投前估值 500 亿美元。TechCrunch 援引四位知情人士称,Thrive Capital 和 Andreessen Horowitz 这两家老股东预计领投,战略投资人英伟达也将出资,Battery Ventures 或作为新投资人加入。该轮融资已超额认购,但具体条款仍可能调整。
若顺利完成,估值将比 Cursor 6 个月前 293 亿美元(投后)的水平几乎翻倍。当时那轮由 Accel 与 Coatue 共同领投,融资金额 23 亿美元。
收入是支撑这次估值的核心数据。Cursor 今年 2 月年化收入达到 20 亿美元,公司预计 2026 年底年化收入将超过 60 亿美元,意味着 10 个月内至少翻三倍。
毛利结构也在改善。和大多数依赖第三方模型的 AI 编程公司一样,Cursor 此前长期毛利为负,卖产品的收入不足以覆盖底层模型 API 成本。去年 11 月推出自研 Composer 模型,加上接入 Kimi 等更便宜的模型后,公司已实现略微正毛利。其中针对大企业的销售已正毛利,个人开发者账户仍亏。Cursor 减少对外部供应商的依赖,意在避免被 Anthropic 等模型公司取代。Anthropic 旗下的 Claude Code 是 Cursor 当前最主要的竞争对手。
信源:https://techcrunch.com/2026/04/17/sources-cursor-in-talks-to-raise-2b-at-50b-valuation-as-enterprise-growth-surges/
AI 编程工具公司 Cursor 接近完成新一轮融资,将至少融入 20 亿美元,投前估值 500 亿美元。TechCrunch 援引四位知情人士称,Thrive Capital 和 Andreessen Horowitz 这两家老股东预计领投,战略投资人英伟达也将出资,Battery Ventures 或作为新投资人加入。该轮融资已超额认购,但具体条款仍可能调整。
若顺利完成,估值将比 Cursor 6 个月前 293 亿美元(投后)的水平几乎翻倍。当时那轮由 Accel 与 Coatue 共同领投,融资金额 23 亿美元。
收入是支撑这次估值的核心数据。Cursor 今年 2 月年化收入达到 20 亿美元,公司预计 2026 年底年化收入将超过 60 亿美元,意味着 10 个月内至少翻三倍。
毛利结构也在改善。和大多数依赖第三方模型的 AI 编程公司一样,Cursor 此前长期毛利为负,卖产品的收入不足以覆盖底层模型 API 成本。去年 11 月推出自研 Composer 模型,加上接入 Kimi 等更便宜的模型后,公司已实现略微正毛利。其中针对大企业的销售已正毛利,个人开发者账户仍亏。Cursor 减少对外部供应商的依赖,意在避免被 Anthropic 等模型公司取代。Anthropic 旗下的 Claude Code 是 Cursor 当前最主要的竞争对手。
信源:https://techcrunch.com/2026/04/17/sources-cursor-in-talks-to-raise-2b-at-50b-valuation-as-enterprise-growth-surges/
TechCrunch
Sources: Cursor in talks to raise $2B+ at $50B valuation as enterprise growth surges | TechCrunch
Returning backers a16z and Thrive are expected to lead the round.
SemiAnalysis 年营收跳涨至 1 亿美元,前员工起诉称 Patel 要求研报配合其投资
一个月前英伟达 GTC 大会上,CEO 黄仁勋花了 5 分钟讲 AI 行业研究机构 SemiAnalysis 新推出的 AI 芯片性能榜单 InferenceX,屏幕上挂着 SemiAnalysis 的徽标。CNBC 主持人 Jim Cramer 在《Mad Money》节目里形容这家机构是行业「圣经」,是「仲裁者,像上帝一样」。SemiAnalysis 的创始人是 29 岁的 Dylan Patel,他此前发表文章批评 AMD 的 AI 芯片 MI300X,一天内就拿到了与 AMD CEO Lisa Su 的 90 分钟面谈。
SemiAnalysis 今年营收预计从去年的 2000 万美元跳涨至 1 亿美元。在新闻通讯平台 Substack 上有超过 25 万订阅者,付费订阅 500 美元一年,但核心收入不来自订阅费,而是把更详尽的研报和供应链数据卖给初创公司、投资机构,以及英伟达等大公司的内部团队。
Patel 同时是投资人,已入股约 20 家 AI 初创公司,包括 Mira Murati 创办的 Thinking Machines Lab,以及去年与英伟达达成超过 9 亿美元授权合作的芯片公司 Enfabrica。SemiAnalysis 研报写到这些公司时,不会像传统媒体那样主动披露 Patel 的投资关系,对它们的竞争对手也照常覆盖。
近期,Patel 与前员工 Wei Zhou 互相起诉,两人此前是密友。Zhou 起诉称,Patel 曾要求他把云服务商 Fluidstack 的内部信息写入 SemiAnalysis 研报,而 Patel 此前已通过特殊目的载体(SPV)筹资投资 Fluidstack。Zhou 称担心此举违法、拒绝配合后被开除;Patel 反诉称 Zhou 是因对同事无礼、醉酒上班等原因被解雇。诉讼后,客户开始担心 SemiAnalysis 如何处理机密信息,公司计划聘请外部机构出具一份数据处理报告。Patel 同时在筹集一支风险投资基金。若筹成,他的投资组合会进一步扩大,与研报业务的利益冲突也会更深。
信源:https://www.theinformation.com/articles/dylan-patel-semianalysis-grabbed-sway-silicon-valley
一个月前英伟达 GTC 大会上,CEO 黄仁勋花了 5 分钟讲 AI 行业研究机构 SemiAnalysis 新推出的 AI 芯片性能榜单 InferenceX,屏幕上挂着 SemiAnalysis 的徽标。CNBC 主持人 Jim Cramer 在《Mad Money》节目里形容这家机构是行业「圣经」,是「仲裁者,像上帝一样」。SemiAnalysis 的创始人是 29 岁的 Dylan Patel,他此前发表文章批评 AMD 的 AI 芯片 MI300X,一天内就拿到了与 AMD CEO Lisa Su 的 90 分钟面谈。
SemiAnalysis 今年营收预计从去年的 2000 万美元跳涨至 1 亿美元。在新闻通讯平台 Substack 上有超过 25 万订阅者,付费订阅 500 美元一年,但核心收入不来自订阅费,而是把更详尽的研报和供应链数据卖给初创公司、投资机构,以及英伟达等大公司的内部团队。
Patel 同时是投资人,已入股约 20 家 AI 初创公司,包括 Mira Murati 创办的 Thinking Machines Lab,以及去年与英伟达达成超过 9 亿美元授权合作的芯片公司 Enfabrica。SemiAnalysis 研报写到这些公司时,不会像传统媒体那样主动披露 Patel 的投资关系,对它们的竞争对手也照常覆盖。
近期,Patel 与前员工 Wei Zhou 互相起诉,两人此前是密友。Zhou 起诉称,Patel 曾要求他把云服务商 Fluidstack 的内部信息写入 SemiAnalysis 研报,而 Patel 此前已通过特殊目的载体(SPV)筹资投资 Fluidstack。Zhou 称担心此举违法、拒绝配合后被开除;Patel 反诉称 Zhou 是因对同事无礼、醉酒上班等原因被解雇。诉讼后,客户开始担心 SemiAnalysis 如何处理机密信息,公司计划聘请外部机构出具一份数据处理报告。Patel 同时在筹集一支风险投资基金。若筹成,他的投资组合会进一步扩大,与研报业务的利益冲突也会更深。
信源:https://www.theinformation.com/articles/dylan-patel-semianalysis-grabbed-sway-silicon-valley
The Information
How Dylan Patel and SemiAnalysis Grabbed Sway in Silicon Valley
For Dylan Patel, founder of SemiAnalysis, an influential AI industry newsletter and research firm, Nvidia deserves the kind of dogged observation and study the tabloid press once devoted to Princess Diana. Hescrutinizesthe chip giant’s new products,documentsits…
OpenAI B2B工程负责人Srinivas Narayanan宣布离职,称重大产品发布前夕是「正确时机」
OpenAI B2B 工程团队负责人 Srinivas Narayanan 4 月 18 日宣布离职,这是继 Sora 负责人和科学部门负责人之后,OpenAI 同日流失的第三位核心高管。Narayanan 曾主导应用工程团队从 40 人的初创规模壮大,并直接负责 ChatGPT 及 API 等核心商业化产品的研发与交付。
他在离职信中表示,在公司近期及即将发布的重大产品节点前夕,是其退居幕后的「正确时机」。Narayanan 离职后计划先陪伴年迈的父母,尚未透露下一步去向。
信源:https://x.com/snsf/status/2045261554484986155
OpenAI B2B 工程团队负责人 Srinivas Narayanan 4 月 18 日宣布离职,这是继 Sora 负责人和科学部门负责人之后,OpenAI 同日流失的第三位核心高管。Narayanan 曾主导应用工程团队从 40 人的初创规模壮大,并直接负责 ChatGPT 及 API 等核心商业化产品的研发与交付。
他在离职信中表示,在公司近期及即将发布的重大产品节点前夕,是其退居幕后的「正确时机」。Narayanan 离职后计划先陪伴年迈的父母,尚未透露下一步去向。
信源:https://x.com/snsf/status/2045261554484986155
X (formerly Twitter)
Srinivas Narayanan (@snsf) on X
After 3 incredible years, I am leaving OpenAI at the end of next week.
I shared my decision with the OpenAI leadership team at the start of the month and here is a shorter version of what I shared with my team earlier this week.
===
Hi Team,
I have decided…
I shared my decision with the OpenAI leadership team at the start of the month and here is a shorter version of what I shared with my team earlier this week.
===
Hi Team,
I have decided…
Anthropic 发布 Claude Design,用对话生成原型、幻灯片和落地页
Anthropic 4 月 17 日在 Anthropic Labs 旗下推出 Claude Design,定位是通过与 Claude 对话产出设计稿、交互原型、幻灯片和营销物料。产品由 Claude Opus 4.7 驱动,以研究预览形式向 Pro、Max、Team、Enterprise 订阅者开放,当天分批推送,入口为 claude.ai/design。Enterprise 账户默认关闭,需管理员在组织设置中启用。
用户用自然语言描述需求,Claude 给出初版后,可通过对话、内嵌评论、直接编辑,以及 Claude 即时生成的自定义调节滑杆来改细节。初始设置阶段 Claude 会读取团队的代码库和设计文件,建立专属设计系统,此后每个项目自动沿用团队的配色、字体和组件,团队可维护多套设计系统并随时迭代。输入支持文本 prompt、DOCX、PPTX、XLSX 文档和图片,也能用 web capture 工具从目标网站直接抓取 UI 元素,让原型看起来更贴近真实产品。输出可作为组织内链接分享,或导出 PDF、PPTX、独立 HTML,以及一键推送到 Canva。
Claude Design 与 Claude Code 直接打通。设计定稿后会被打包成 handoff bundle,交给 Claude Code 一条指令即可进入实现环节。对设计师,这解决了试错轮次长期被项目时间挤压的问题;对产品经理、创始人和营销岗,这是一条绕开专业设计门槛、直接产出可用视觉物料并衔接工程交付的新链路。
官方列出的早期用户里,学习平台 Brilliant 称此前在其他工具中需要 20 多轮 prompt 才能还原的复杂交互页,在 Claude Design 里 2 轮就能完成;Datadog 表示能在一次会议里完成从粗略想法到可运行原型的过程;Canva 则被列为主要导出目标之一。
信源:https://www.anthropic.com/news/claude-design-anthropic-labs
Anthropic 4 月 17 日在 Anthropic Labs 旗下推出 Claude Design,定位是通过与 Claude 对话产出设计稿、交互原型、幻灯片和营销物料。产品由 Claude Opus 4.7 驱动,以研究预览形式向 Pro、Max、Team、Enterprise 订阅者开放,当天分批推送,入口为 claude.ai/design。Enterprise 账户默认关闭,需管理员在组织设置中启用。
用户用自然语言描述需求,Claude 给出初版后,可通过对话、内嵌评论、直接编辑,以及 Claude 即时生成的自定义调节滑杆来改细节。初始设置阶段 Claude 会读取团队的代码库和设计文件,建立专属设计系统,此后每个项目自动沿用团队的配色、字体和组件,团队可维护多套设计系统并随时迭代。输入支持文本 prompt、DOCX、PPTX、XLSX 文档和图片,也能用 web capture 工具从目标网站直接抓取 UI 元素,让原型看起来更贴近真实产品。输出可作为组织内链接分享,或导出 PDF、PPTX、独立 HTML,以及一键推送到 Canva。
Claude Design 与 Claude Code 直接打通。设计定稿后会被打包成 handoff bundle,交给 Claude Code 一条指令即可进入实现环节。对设计师,这解决了试错轮次长期被项目时间挤压的问题;对产品经理、创始人和营销岗,这是一条绕开专业设计门槛、直接产出可用视觉物料并衔接工程交付的新链路。
官方列出的早期用户里,学习平台 Brilliant 称此前在其他工具中需要 20 多轮 prompt 才能还原的复杂交互页,在 Claude Design 里 2 轮就能完成;Datadog 表示能在一次会议里完成从粗略想法到可运行原型的过程;Canva 则被列为主要导出目标之一。
信源:https://www.anthropic.com/news/claude-design-anthropic-labs
Claude
Claude Design | Turn Ideas into Design | Claude by Anthropic
Describe a prototype, deck, or one-pager, and Claude builds a draft. Refine it yourself, or hand it off to your tools or Claude Code. You're the designer, from start to finish.
xAI 开放 Grok STT 与 TTS 音频 API,STT 整体词错率压到 6.9%
xAI 上线两个独立音频 API:Grok Speech to Text 和 Grok Text to Speech。两者来自支撑 Grok Voice、特斯拉车载系统和 Starlink 客服的同一套音频栈,此次以独立 endpoint 形式开放,开发者可直接接入语音代理、实时转录、无障碍工具和播客等应用。
STT 提供两种模式。REST API 用于对大音频文件批量转录,毫秒级返回;WebSocket API 面向实时语音流。附带能力包括词级时间戳、说话人分离(diarization)、多通道分别识别,以及 Inverse Text Normalization,即把口语里的数字、日期、货币自动整形为规范的结构化文本。语种覆盖 25 种以上,可在对话中无缝切换。
xAI 同时公布一组词错率(WER,数值越低越好)对比:整体场景 Grok 6.9%,ElevenLabs 9.0%,Deepgram 11.0%,AssemblyAI 12.9%;「电话通话实体识别」差距被拉得更大,Grok 5.0%,对应三家分别为 12.0%、13.5%、21.3%。会议、视频播客、电话三类常见业务场景下 Grok 也都小幅领先。这组数字由 xAI 自行测试公布,尚无第三方复测。
定价上,STT 批处理 0.10 美元/小时、流式 0.20 美元/小时;TTS 为 4.20 美元/100 万字符。
TTS 支持用内联 Speech Tags 控制情感和韵律,例如 `[laugh]`、`[sigh]`、`[whisper]`、`<emphasis>`、`<slow>`、`<pause>`。开发者不必手写 SSML 标记,就能让朗读带上笑声、叹气、低语或局部强调。
信源:https://x.ai/news/grok-stt-and-tts-apis
xAI 上线两个独立音频 API:Grok Speech to Text 和 Grok Text to Speech。两者来自支撑 Grok Voice、特斯拉车载系统和 Starlink 客服的同一套音频栈,此次以独立 endpoint 形式开放,开发者可直接接入语音代理、实时转录、无障碍工具和播客等应用。
STT 提供两种模式。REST API 用于对大音频文件批量转录,毫秒级返回;WebSocket API 面向实时语音流。附带能力包括词级时间戳、说话人分离(diarization)、多通道分别识别,以及 Inverse Text Normalization,即把口语里的数字、日期、货币自动整形为规范的结构化文本。语种覆盖 25 种以上,可在对话中无缝切换。
xAI 同时公布一组词错率(WER,数值越低越好)对比:整体场景 Grok 6.9%,ElevenLabs 9.0%,Deepgram 11.0%,AssemblyAI 12.9%;「电话通话实体识别」差距被拉得更大,Grok 5.0%,对应三家分别为 12.0%、13.5%、21.3%。会议、视频播客、电话三类常见业务场景下 Grok 也都小幅领先。这组数字由 xAI 自行测试公布,尚无第三方复测。
定价上,STT 批处理 0.10 美元/小时、流式 0.20 美元/小时;TTS 为 4.20 美元/100 万字符。
TTS 支持用内联 Speech Tags 控制情感和韵律,例如 `[laugh]`、`[sigh]`、`[whisper]`、`<emphasis>`、`<slow>`、`<pause>`。开发者不必手写 SSML 标记,就能让朗读带上笑声、叹气、低语或局部强调。
信源:https://x.ai/news/grok-stt-and-tts-apis
x.ai
Grok Speech to Text and Text to Speech APIs
Fast and accurate. Natural, expressive voices. Simple pricing. Multilingual support.
马斯克:Grok 4.3 beta 仍是 0.5T 训练中间版,1T 旗舰还差 5 天完成初训
Grok 4.3 (beta) 已对订阅最高档 SuperGrok Heavy 的用户开放。17 日,用户已在 Grok.com 下拉菜单里看到该版本带有「Early Access」标记。18 日早晨,X 用户 Mark Kretschmann 发帖称这一版本拥有 1T 参数、体量是 Grok 4.20 的两倍,训练时间也显著更长。xAI 及特斯拉 CEO 马斯克(Elon Musk)随后在同条推文下更正,当前的 4.3 (beta) 仍是 0.5T 模型,只是一份更新的训练检查点,并非外界推测的 1T 新模型。
马斯克同时透露,真正的 1T 旗舰距离初始训练完成还剩约 5 天。他形容 1T 模型将在编码、长上下文和各项技能上形成阶跃式提升,并称 SpaceXAI 模型工厂已经跑通,之后预计每两周能下线一版改进后的基础模型。
信源:https://x.com/elonmusk/status/2045293644693770630
Grok 4.3 (beta) 已对订阅最高档 SuperGrok Heavy 的用户开放。17 日,用户已在 Grok.com 下拉菜单里看到该版本带有「Early Access」标记。18 日早晨,X 用户 Mark Kretschmann 发帖称这一版本拥有 1T 参数、体量是 Grok 4.20 的两倍,训练时间也显著更长。xAI 及特斯拉 CEO 马斯克(Elon Musk)随后在同条推文下更正,当前的 4.3 (beta) 仍是 0.5T 模型,只是一份更新的训练检查点,并非外界推测的 1T 新模型。
马斯克同时透露,真正的 1T 旗舰距离初始训练完成还剩约 5 天。他形容 1T 模型将在编码、长上下文和各项技能上形成阶跃式提升,并称 SpaceXAI 模型工厂已经跑通,之后预计每两周能下线一版改进后的基础模型。
信源:https://x.com/elonmusk/status/2045293644693770630
X (formerly Twitter)
Elon Musk (@elonmusk) on X
@mark_k @xai This is still 0.5T, but a more recent training checkpoint.
1T model is ~5 days away from finishing initial training. Will be a major step change improvement in coding, long context and skills.
The SpaceXAI model factory is finally working.…
1T model is ~5 days away from finishing initial training. Will be a major step change improvement in coding, long context and skills.
The SpaceXAI model factory is finally working.…
ProducerAI更名Flow Music,上线片段替换与延展
今年 2 月加入 Google Labs 的 AI 音乐创作平台 ProducerAI 宣布产品正式更名为 Google Flow Music,纳入 Google Flow 家族,入口为 flowmusic.google。Google Flow 是 Google 在 2025 年 I/O 上发布的 AI 视频生成套件,原本只涵盖视频方向,此次把 AI 音乐能力补进同一产品线。官方称团队和使命不变。
同步上线两项 remix 能力:replace(替换)和 extend(延展)。用户用自然语言 prompt 圈出歌曲里的某一段,交给名为 Producer 的智能体修改,例如把一段 lofi 钢琴前奏延展成 dubstep drop、一次性替换多段副歌,或者让它对同一段吉他 solo 生成 5 个备选版本。
这次更新把 AI 生成音乐的工作流从「整首重生」推向「局部可控」。过去用 Suno、Udio 这类工具,生成结果不满意时多数情况只能整首重跑再手动拼接,现在可以针对一首歌反复改局部、保留其他部分不动,更贴近传统音乐制作的迭代节奏。
信源:https://x.com/googleflowmusic/status/2045250153356108026
今年 2 月加入 Google Labs 的 AI 音乐创作平台 ProducerAI 宣布产品正式更名为 Google Flow Music,纳入 Google Flow 家族,入口为 flowmusic.google。Google Flow 是 Google 在 2025 年 I/O 上发布的 AI 视频生成套件,原本只涵盖视频方向,此次把 AI 音乐能力补进同一产品线。官方称团队和使命不变。
同步上线两项 remix 能力:replace(替换)和 extend(延展)。用户用自然语言 prompt 圈出歌曲里的某一段,交给名为 Producer 的智能体修改,例如把一段 lofi 钢琴前奏延展成 dubstep drop、一次性替换多段副歌,或者让它对同一段吉他 solo 生成 5 个备选版本。
这次更新把 AI 生成音乐的工作流从「整首重生」推向「局部可控」。过去用 Suno、Udio 这类工具,生成结果不满意时多数情况只能整首重跑再手动拼接,现在可以针对一首歌反复改局部、保留其他部分不动,更贴近传统音乐制作的迭代节奏。
信源:https://x.com/googleflowmusic/status/2045250153356108026
X (formerly Twitter)
Google Flow Music (@googleflowmusic) on X
1/ A new era, a new name, and a new feature drop. 🚀
ProducerAI is officially "Google Flow Music"! We're still the same team, with the same mission: building tools that push the boundaries of human creativity.
To kick off this new chapter, we're launching…
ProducerAI is officially "Google Flow Music"! We're still the same team, with the same mission: building tools that push the boundaries of human creativity.
To kick off this new chapter, we're launching…
月之暗面与清华新论文:LLM 预填充可跨数据中心,1T 模型吞吐升 54%
月之暗面(Moonshot AI)与清华大学 4 月 16 日在 arXiv 挂出新论文《Prefill-as-a-Service》,提出让大模型推理的预填充阶段(prefill)跨数据中心运行。
大模型推理分两步:prefill 先把输入一次性读进来、生成一份 KV 缓存;decode 再根据这份缓存逐字吐出结果。两步需要的硬件特性完全不同,prefill 吃算力,decode 吃显存带宽。业界主流做法是把两步拆到不同机器上(PD 分离),但这要求两边在同一个数据中心里用 RDMA 互联,因为密集 attention 模型的 KV 缓存每秒几十 Gbps 地吐,一旦传慢 GPU 就空转。
转折来自新一代 hybrid attention 模型。论文实测 Kimi Linear、MiMo-V2-Flash、Ring-2.5-1T 等模型通过少量完整 attention 层加大量线性层的组合,把 KV 缓存吞吐量砍掉了约一个数量级,Ring-2.5-1T 的综合压缩比达到 36 倍。这时 KV 缓存可以从 RDMA 专网搬到普通以太网上传。
PrfaaS 的具体做法:组建独立的「预填充集群」,只把长上下文、未命中前缀缓存的请求路由过去,短请求留在本地 PD 集群;预填充完成后通过以太网把 KV 缓存回传本地集群做 decode。配套引入长度阈值路由、带宽感知调度器和混合前缀缓存池。论文用内部 1T 参数 hybrid 模型(基于 Kimi Linear 架构)做了一组实测,整体服务吞吐比同构 PD 部署高 54%,比朴素异构方案高 32%,每台机器只占适中的跨数据中心带宽。
信源:https://arxiv.org/html/2604.15039v1
月之暗面(Moonshot AI)与清华大学 4 月 16 日在 arXiv 挂出新论文《Prefill-as-a-Service》,提出让大模型推理的预填充阶段(prefill)跨数据中心运行。
大模型推理分两步:prefill 先把输入一次性读进来、生成一份 KV 缓存;decode 再根据这份缓存逐字吐出结果。两步需要的硬件特性完全不同,prefill 吃算力,decode 吃显存带宽。业界主流做法是把两步拆到不同机器上(PD 分离),但这要求两边在同一个数据中心里用 RDMA 互联,因为密集 attention 模型的 KV 缓存每秒几十 Gbps 地吐,一旦传慢 GPU 就空转。
转折来自新一代 hybrid attention 模型。论文实测 Kimi Linear、MiMo-V2-Flash、Ring-2.5-1T 等模型通过少量完整 attention 层加大量线性层的组合,把 KV 缓存吞吐量砍掉了约一个数量级,Ring-2.5-1T 的综合压缩比达到 36 倍。这时 KV 缓存可以从 RDMA 专网搬到普通以太网上传。
PrfaaS 的具体做法:组建独立的「预填充集群」,只把长上下文、未命中前缀缓存的请求路由过去,短请求留在本地 PD 集群;预填充完成后通过以太网把 KV 缓存回传本地集群做 decode。配套引入长度阈值路由、带宽感知调度器和混合前缀缓存池。论文用内部 1T 参数 hybrid 模型(基于 Kimi Linear 架构)做了一组实测,整体服务吞吐比同构 PD 部署高 54%,比朴素异构方案高 32%,每台机器只占适中的跨数据中心带宽。
信源:https://arxiv.org/html/2604.15039v1
❤1