xAI 静默测试 Grok 4.3:Beta 版现身官网下拉菜单
多名用户发现,xAI 官方网站 Grok.com 的模型选择菜单中出现了「Grok 4.3 (beta)」选项,并标注为「Early Access」(早期访问)。此前,xAI 网页端的主力版本为 2 月发布的 Grok 4.20 系列。
Grok 4.3 的核心改进预计集中在超长上下文处理能力以及原生的多模态视频理解上。
信源:https://x.com/mrfanduuuuu/status/2045070600293785608?s=46
多名用户发现,xAI 官方网站 Grok.com 的模型选择菜单中出现了「Grok 4.3 (beta)」选项,并标注为「Early Access」(早期访问)。此前,xAI 网页端的主力版本为 2 月发布的 Grok 4.20 系列。
Grok 4.3 的核心改进预计集中在超长上下文处理能力以及原生的多模态视频理解上。
信源:https://x.com/mrfanduuuuu/status/2045070600293785608?s=46
马斯克 xAI 转向「云厂商」角色,向 AI 编程独角兽 Cursor 开放数万颗 GPU 算力
xAI 计划向 AI 编程初创公司 Cursor 提供大规模算力支持,允许其在 xAI 的基础设施上训练最新编程模型 Composer 2.5。据 Business Insider 披露,Cursor 将调用 xAI 旗下「Colossus」数据中心中的数万颗 GPU。这一安排标志着 xAI 战略的重大转向:通过出租冗余算力,xAI 正在从单纯的模型研发商向类似 AWS、CoreWeave 的云服务商角色扩张。
这一合作背景复杂。今年 3 月,xAI 刚从 Cursor 挖走了两名产品工程主管负责其产品团队。此外,xAI 内部一份备忘录显示,其目前的 GPU 利用率(MFU)仅为 11%,远低于 35% 至 45% 的行业平均水平。xAI 总裁 Michael Nicolls 已要求团队在数月内将利用率提升至 50%。向外部独角兽开放算力,既能分摊昂贵的数据中心运营成本,也能通过服务顶级编程代理获取宝贵的工程反馈。
目前,Cursor 正以 500 亿美元的估值进行融资谈判。在 OpenAI 和 Anthropic 激进切入编程助理赛道的背景下,绑定 xAI 的算力资源已成为其维持竞争优势的关键砝码。
信源:https://www.businessinsider.com/elon-musk-xai-compute-cursor-ai-model-training-2026-4
xAI 计划向 AI 编程初创公司 Cursor 提供大规模算力支持,允许其在 xAI 的基础设施上训练最新编程模型 Composer 2.5。据 Business Insider 披露,Cursor 将调用 xAI 旗下「Colossus」数据中心中的数万颗 GPU。这一安排标志着 xAI 战略的重大转向:通过出租冗余算力,xAI 正在从单纯的模型研发商向类似 AWS、CoreWeave 的云服务商角色扩张。
这一合作背景复杂。今年 3 月,xAI 刚从 Cursor 挖走了两名产品工程主管负责其产品团队。此外,xAI 内部一份备忘录显示,其目前的 GPU 利用率(MFU)仅为 11%,远低于 35% 至 45% 的行业平均水平。xAI 总裁 Michael Nicolls 已要求团队在数月内将利用率提升至 50%。向外部独角兽开放算力,既能分摊昂贵的数据中心运营成本,也能通过服务顶级编程代理获取宝贵的工程反馈。
目前,Cursor 正以 500 亿美元的估值进行融资谈判。在 OpenAI 和 Anthropic 激进切入编程助理赛道的背景下,绑定 xAI 的算力资源已成为其维持竞争优势的关键砝码。
信源:https://www.businessinsider.com/elon-musk-xai-compute-cursor-ai-model-training-2026-4
Business Insider
Elon Musk's xAI plans to supply computing power to coding startup Cursor
Elon Musk's xAI is collaborating with Cursor, which is using xAI's GPUs for model training, people with knowledge of the matter said.
NUS团队发布GameWorld基准,在34款浏览器游戏中评估多模态AI代理
新加坡国立大学(NUS)团队发布 GameWorld,一个旨在标准化评估多模态大语言模型(MLLM)在视频游戏中作为通用代理能力的基准测试。该研究指出,尽管视频游戏提供了理想的闭环交互测试床,但现有评估常受限于操作接口不统一和人工启发式验证。
GameWorld 包含 34 款多样的浏览器游戏和 170 项任务,并为每个任务配备了基于游戏底层状态的可验证指标,以实现客观的结果评估。研究团队测试了两种代理接口:一是直接输出键鼠指令的「计算机使用(computer-use)」代理,二是通过语义解析在语义动作空间中操作的通用多模态代理。
在对 18 种「模型-接口」组合进行的大规模测试中,结果显示即便当前表现最好的 AI 代理,其游戏能力也远未达到人类水平。研究进一步暴露了游戏代理在实时交互延迟、上下文记忆敏感度以及动作有效性等方面的严峻挑战。相关论文及项目代码已在 Hugging Face 和 GitHub 公开。
信源:https://huggingface.co/papers/2604.07429
新加坡国立大学(NUS)团队发布 GameWorld,一个旨在标准化评估多模态大语言模型(MLLM)在视频游戏中作为通用代理能力的基准测试。该研究指出,尽管视频游戏提供了理想的闭环交互测试床,但现有评估常受限于操作接口不统一和人工启发式验证。
GameWorld 包含 34 款多样的浏览器游戏和 170 项任务,并为每个任务配备了基于游戏底层状态的可验证指标,以实现客观的结果评估。研究团队测试了两种代理接口:一是直接输出键鼠指令的「计算机使用(computer-use)」代理,二是通过语义解析在语义动作空间中操作的通用多模态代理。
在对 18 种「模型-接口」组合进行的大规模测试中,结果显示即便当前表现最好的 AI 代理,其游戏能力也远未达到人类水平。研究进一步暴露了游戏代理在实时交互延迟、上下文记忆敏感度以及动作有效性等方面的严峻挑战。相关论文及项目代码已在 Hugging Face 和 GitHub 公开。
信源:https://huggingface.co/papers/2604.07429
huggingface.co
Paper page - GameWorld: Towards Standardized and Verifiable Evaluation of Multimodal Game Agents
Join the discussion on this paper page
Quiver 发布 Arrow 1.1:SVG 矢量生成成本直降 50%,新增 Max 精度模型
矢量图形生成平台 Quiver AI 宣布推出 Arrow 1.1,这是其基于代码生成(而非像素逼近)逻辑的 SVG 专项模型的重大升级。新版本在提升视觉设计感的同时,重点实现了生产环境下的成本缩减:文本转 SVG 的成本降低了 33.3%,而图像矢量化成本则大幅下降 50%。
Arrow 1.1 的核心进化在于「决策逻辑」的转变。相比 1.0 版本,新模型更倾向于使用几何原语(如形状、文本、基本几何体)而非单纯依赖路径堆叠,生成的 SVG 文件更易于编辑、检查和扩展。同时,Arrow 1.1 在遵循 Prompt 的布局平衡与颜色选取上也更具「设计师思维」。
针对高精度需求的场景,Quiver 同步推出了 Arrow 1.1 Max 模型。该模型在保持核心逻辑一致的基础上,牺牲了部分运行速度以换取极致的形状对齐与细节稳定性,适用于技术图表、服装设计稿(Technical Flats)以及精密工程示意图。目前,Arrow 1.1 已在 Quiver 官网控制台上线,支持开发者通过 API 接入现有的设计与开发工作流。
信源:https://quiver.ai/blog/introducing-arrow-1-1
矢量图形生成平台 Quiver AI 宣布推出 Arrow 1.1,这是其基于代码生成(而非像素逼近)逻辑的 SVG 专项模型的重大升级。新版本在提升视觉设计感的同时,重点实现了生产环境下的成本缩减:文本转 SVG 的成本降低了 33.3%,而图像矢量化成本则大幅下降 50%。
Arrow 1.1 的核心进化在于「决策逻辑」的转变。相比 1.0 版本,新模型更倾向于使用几何原语(如形状、文本、基本几何体)而非单纯依赖路径堆叠,生成的 SVG 文件更易于编辑、检查和扩展。同时,Arrow 1.1 在遵循 Prompt 的布局平衡与颜色选取上也更具「设计师思维」。
针对高精度需求的场景,Quiver 同步推出了 Arrow 1.1 Max 模型。该模型在保持核心逻辑一致的基础上,牺牲了部分运行速度以换取极致的形状对齐与细节稳定性,适用于技术图表、服装设计稿(Technical Flats)以及精密工程示意图。目前,Arrow 1.1 已在 Quiver 官网控制台上线,支持开发者通过 API 接入现有的设计与开发工作流。
信源:https://quiver.ai/blog/introducing-arrow-1-1
Mem0 发布长效记忆架构研究:准确率领先 OpenAI 26%,推理延迟降低 91%
个性化 AI 记忆平台 Mem0 近期公开了其核心长效记忆算法的研究成果。实验数据显示,在 LOCOMO 基准测试中,Mem0 的响应准确率比 OpenAI 的内置记忆功能高出 26%,同时由于其「事实化」的检索机制,其 P95 推理延迟降低了 91%,Token 消耗量缩减了 90%。
该算法解决的核心问题是 AI 代理在长周期交互中的「健忘」现象。与单纯扩大 LLM 上下文窗口的暴力路径不同,Mem0 采用了一种两阶段处理管线:在「提取阶段」,系统会从最新对话、滚动摘要和历史记录中提取关键事实;在「更新阶段」,系统通过向量数据库进行比对,执行新增、更新、删除冲突或忽略等操作,确保记忆库的精简与一致。
研究还介绍了一种增强型变体 Mem0ᵍ。该版本引入了图数据库结构,将提取的事实转化为带标签的节点与边,从而捕获多会话间的复杂实体关系。在实际生产环境中,Mem0 能在 0.71 秒内完成从记忆检索到回答生成的全流程,而传统的「全上下文」方法则需要近 10 秒。目前,该研究已被欧洲人工智能会议(ECAI)接收,相关代码已在 GitHub 开源。
信源:https://mem0.ai/research
个性化 AI 记忆平台 Mem0 近期公开了其核心长效记忆算法的研究成果。实验数据显示,在 LOCOMO 基准测试中,Mem0 的响应准确率比 OpenAI 的内置记忆功能高出 26%,同时由于其「事实化」的检索机制,其 P95 推理延迟降低了 91%,Token 消耗量缩减了 90%。
该算法解决的核心问题是 AI 代理在长周期交互中的「健忘」现象。与单纯扩大 LLM 上下文窗口的暴力路径不同,Mem0 采用了一种两阶段处理管线:在「提取阶段」,系统会从最新对话、滚动摘要和历史记录中提取关键事实;在「更新阶段」,系统通过向量数据库进行比对,执行新增、更新、删除冲突或忽略等操作,确保记忆库的精简与一致。
研究还介绍了一种增强型变体 Mem0ᵍ。该版本引入了图数据库结构,将提取的事实转化为带标签的节点与边,从而捕获多会话间的复杂实体关系。在实际生产环境中,Mem0 能在 0.71 秒内完成从记忆检索到回答生成的全流程,而传统的「全上下文」方法则需要近 10 秒。目前,该研究已被欧洲人工智能会议(ECAI)接收,相关代码已在 GitHub 开源。
信源:https://mem0.ai/research
DeepSeek拟以至少100亿美元估值开启首轮融资,应对核心人才流失与V4研发延迟
AI 初创公司 DeepSeek(深度求索)正在洽谈首轮外部融资,计划以至少 100 亿美元的估值募集至少 3 亿美元资金。这标志着这家此前由对冲基金幻方量化(High-Flyer)全资支持、一度坚持技术理想主义且拒绝外部资本的初创公司,在融资策略上的重大转向。
此次调整正值 DeepSeek 面临技术迭代压力与竞争对手挖角的双重挑战。虽然 R1 模型曾以极低成本实现高性能震撼全球,但其下一代旗舰模型 V4 的发布进度已多次推迟。推迟原因除工程挑战外,还包括 DeepSeek 工程师正试图让 V4 原生适配华为芯片。由于此前模型主要基于英伟达芯片开发,这一底层架构的切换显著拉长了研发周期。
与此同时,核心团队成员出现流失。V3 模型的核心贡献者罗福莉已加入小米负责 AI 部门,另一位关键研究员郭达雅则被字节跳动以更高薪酬挖走。
信源:https://www.theinformation.com/articles/chinas-deepseek-raising-money-first-time-10-billion-plus-valuation
AI 初创公司 DeepSeek(深度求索)正在洽谈首轮外部融资,计划以至少 100 亿美元的估值募集至少 3 亿美元资金。这标志着这家此前由对冲基金幻方量化(High-Flyer)全资支持、一度坚持技术理想主义且拒绝外部资本的初创公司,在融资策略上的重大转向。
此次调整正值 DeepSeek 面临技术迭代压力与竞争对手挖角的双重挑战。虽然 R1 模型曾以极低成本实现高性能震撼全球,但其下一代旗舰模型 V4 的发布进度已多次推迟。推迟原因除工程挑战外,还包括 DeepSeek 工程师正试图让 V4 原生适配华为芯片。由于此前模型主要基于英伟达芯片开发,这一底层架构的切换显著拉长了研发周期。
与此同时,核心团队成员出现流失。V3 模型的核心贡献者罗福莉已加入小米负责 AI 部门,另一位关键研究员郭达雅则被字节跳动以更高薪酬挖走。
信源:https://www.theinformation.com/articles/chinas-deepseek-raising-money-first-time-10-billion-plus-valuation
The Information
China’s DeepSeek is Raising Money for First Time, At $10 Billion-Plus Valuation
DeepSeek is in talks to raise outside capital for the first time, seeking to beef up its financial war chest so it can better compete in the costly battle to develop leading AI models, according to five people familiar with the matter. DeepSeek is owned by…
Anthropic CEO Amodei给Mythos技术壁垒定了半年到一年窗口期
Anthropic CEO Dario Amodei 在英国《金融时报》「Lunch with the FT」专访中说,他推测开源模型和中国开发者能在 6 到 12 个月内复制 Claude Mythos 的网络安全能力。
Mythos 是 Anthropic 能力上限最高、未对外公开发布的模型,因能大规模发现软件零日漏洞被内部判定为国家安全风险。过去两周,白宫推动联邦机构接入,美国官员与主要银行紧急会商,敦促它们用 Mythos 加固自身网络安全。
Amodei 同时透露,Anthropic 已与 40 多家组织合作推进 Project Glasswing 漏洞修补项目,参与方包括亚马逊、苹果和微软。他承认公司自身的数据安全实践也在受审视,起因是部分 Claude 代码曾发生泄漏。
他的预测意味着 Anthropic 正在同时做两件事:一边延缓 Mythos 级能力扩散,一边推动美国政府和关键基础设施抢先用它把系统漏洞修完。能力扩散到所有人手里那天,防御底子必须已经打好。
信源:https://www.ft.com/content/9e0e0fc6-ab7d-4b69-a8b1-5a972b82fb06
Anthropic CEO Dario Amodei 在英国《金融时报》「Lunch with the FT」专访中说,他推测开源模型和中国开发者能在 6 到 12 个月内复制 Claude Mythos 的网络安全能力。
Mythos 是 Anthropic 能力上限最高、未对外公开发布的模型,因能大规模发现软件零日漏洞被内部判定为国家安全风险。过去两周,白宫推动联邦机构接入,美国官员与主要银行紧急会商,敦促它们用 Mythos 加固自身网络安全。
Amodei 同时透露,Anthropic 已与 40 多家组织合作推进 Project Glasswing 漏洞修补项目,参与方包括亚马逊、苹果和微软。他承认公司自身的数据安全实践也在受审视,起因是部分 Claude 代码曾发生泄漏。
他的预测意味着 Anthropic 正在同时做两件事:一边延缓 Mythos 级能力扩散,一边推动美国政府和关键基础设施抢先用它把系统漏洞修完。能力扩散到所有人手里那天,防御底子必须已经打好。
信源:https://www.ft.com/content/9e0e0fc6-ab7d-4b69-a8b1-5a972b82fb06
OpenAI 核心高层同日离职:Sora 负责人与前CPO退出,科学研究部门遭拆分
OpenAI 两位核心成员 Bill Peebles 和 Kevin Weil 于 4 月 18 日先后宣布离职。Bill Peebles 是视频生成模型 Sora 的核心负责人之一,他见证了 Sora 从最初两人团队到发布 Sora 2 的全过程。Kevin Weil 曾任 OpenAI 首席产品官(CPO),去年 10 月加入研究团队并创立了 OpenAI for Science 部门。
伴随 Kevin Weil 的离职,OpenAI 内部的科学研究部门(OpenAI for Science)也将被拆分并分散到其他研究团队中。Kevin Weil 在离职信中表示,加速科学进步将是实现 AGI 过程中最积极的成果之一。
OpenAI 两位核心成员 Bill Peebles 和 Kevin Weil 于 4 月 18 日先后宣布离职。Bill Peebles 是视频生成模型 Sora 的核心负责人之一,他见证了 Sora 从最初两人团队到发布 Sora 2 的全过程。Kevin Weil 曾任 OpenAI 首席产品官(CPO),去年 10 月加入研究团队并创立了 OpenAI for Science 部门。
伴随 Kevin Weil 的离职,OpenAI 内部的科学研究部门(OpenAI for Science)也将被拆分并分散到其他研究团队中。Kevin Weil 在离职信中表示,加速科学进步将是实现 AGI 过程中最积极的成果之一。
Cursor接近敲定20亿美元新融资,估值500亿美元半年翻倍
AI 编程工具公司 Cursor 接近完成新一轮融资,将至少融入 20 亿美元,投前估值 500 亿美元。TechCrunch 援引四位知情人士称,Thrive Capital 和 Andreessen Horowitz 这两家老股东预计领投,战略投资人英伟达也将出资,Battery Ventures 或作为新投资人加入。该轮融资已超额认购,但具体条款仍可能调整。
若顺利完成,估值将比 Cursor 6 个月前 293 亿美元(投后)的水平几乎翻倍。当时那轮由 Accel 与 Coatue 共同领投,融资金额 23 亿美元。
收入是支撑这次估值的核心数据。Cursor 今年 2 月年化收入达到 20 亿美元,公司预计 2026 年底年化收入将超过 60 亿美元,意味着 10 个月内至少翻三倍。
毛利结构也在改善。和大多数依赖第三方模型的 AI 编程公司一样,Cursor 此前长期毛利为负,卖产品的收入不足以覆盖底层模型 API 成本。去年 11 月推出自研 Composer 模型,加上接入 Kimi 等更便宜的模型后,公司已实现略微正毛利。其中针对大企业的销售已正毛利,个人开发者账户仍亏。Cursor 减少对外部供应商的依赖,意在避免被 Anthropic 等模型公司取代。Anthropic 旗下的 Claude Code 是 Cursor 当前最主要的竞争对手。
信源:https://techcrunch.com/2026/04/17/sources-cursor-in-talks-to-raise-2b-at-50b-valuation-as-enterprise-growth-surges/
AI 编程工具公司 Cursor 接近完成新一轮融资,将至少融入 20 亿美元,投前估值 500 亿美元。TechCrunch 援引四位知情人士称,Thrive Capital 和 Andreessen Horowitz 这两家老股东预计领投,战略投资人英伟达也将出资,Battery Ventures 或作为新投资人加入。该轮融资已超额认购,但具体条款仍可能调整。
若顺利完成,估值将比 Cursor 6 个月前 293 亿美元(投后)的水平几乎翻倍。当时那轮由 Accel 与 Coatue 共同领投,融资金额 23 亿美元。
收入是支撑这次估值的核心数据。Cursor 今年 2 月年化收入达到 20 亿美元,公司预计 2026 年底年化收入将超过 60 亿美元,意味着 10 个月内至少翻三倍。
毛利结构也在改善。和大多数依赖第三方模型的 AI 编程公司一样,Cursor 此前长期毛利为负,卖产品的收入不足以覆盖底层模型 API 成本。去年 11 月推出自研 Composer 模型,加上接入 Kimi 等更便宜的模型后,公司已实现略微正毛利。其中针对大企业的销售已正毛利,个人开发者账户仍亏。Cursor 减少对外部供应商的依赖,意在避免被 Anthropic 等模型公司取代。Anthropic 旗下的 Claude Code 是 Cursor 当前最主要的竞争对手。
信源:https://techcrunch.com/2026/04/17/sources-cursor-in-talks-to-raise-2b-at-50b-valuation-as-enterprise-growth-surges/
TechCrunch
Sources: Cursor in talks to raise $2B+ at $50B valuation as enterprise growth surges | TechCrunch
Returning backers a16z and Thrive are expected to lead the round.
SemiAnalysis 年营收跳涨至 1 亿美元,前员工起诉称 Patel 要求研报配合其投资
一个月前英伟达 GTC 大会上,CEO 黄仁勋花了 5 分钟讲 AI 行业研究机构 SemiAnalysis 新推出的 AI 芯片性能榜单 InferenceX,屏幕上挂着 SemiAnalysis 的徽标。CNBC 主持人 Jim Cramer 在《Mad Money》节目里形容这家机构是行业「圣经」,是「仲裁者,像上帝一样」。SemiAnalysis 的创始人是 29 岁的 Dylan Patel,他此前发表文章批评 AMD 的 AI 芯片 MI300X,一天内就拿到了与 AMD CEO Lisa Su 的 90 分钟面谈。
SemiAnalysis 今年营收预计从去年的 2000 万美元跳涨至 1 亿美元。在新闻通讯平台 Substack 上有超过 25 万订阅者,付费订阅 500 美元一年,但核心收入不来自订阅费,而是把更详尽的研报和供应链数据卖给初创公司、投资机构,以及英伟达等大公司的内部团队。
Patel 同时是投资人,已入股约 20 家 AI 初创公司,包括 Mira Murati 创办的 Thinking Machines Lab,以及去年与英伟达达成超过 9 亿美元授权合作的芯片公司 Enfabrica。SemiAnalysis 研报写到这些公司时,不会像传统媒体那样主动披露 Patel 的投资关系,对它们的竞争对手也照常覆盖。
近期,Patel 与前员工 Wei Zhou 互相起诉,两人此前是密友。Zhou 起诉称,Patel 曾要求他把云服务商 Fluidstack 的内部信息写入 SemiAnalysis 研报,而 Patel 此前已通过特殊目的载体(SPV)筹资投资 Fluidstack。Zhou 称担心此举违法、拒绝配合后被开除;Patel 反诉称 Zhou 是因对同事无礼、醉酒上班等原因被解雇。诉讼后,客户开始担心 SemiAnalysis 如何处理机密信息,公司计划聘请外部机构出具一份数据处理报告。Patel 同时在筹集一支风险投资基金。若筹成,他的投资组合会进一步扩大,与研报业务的利益冲突也会更深。
信源:https://www.theinformation.com/articles/dylan-patel-semianalysis-grabbed-sway-silicon-valley
一个月前英伟达 GTC 大会上,CEO 黄仁勋花了 5 分钟讲 AI 行业研究机构 SemiAnalysis 新推出的 AI 芯片性能榜单 InferenceX,屏幕上挂着 SemiAnalysis 的徽标。CNBC 主持人 Jim Cramer 在《Mad Money》节目里形容这家机构是行业「圣经」,是「仲裁者,像上帝一样」。SemiAnalysis 的创始人是 29 岁的 Dylan Patel,他此前发表文章批评 AMD 的 AI 芯片 MI300X,一天内就拿到了与 AMD CEO Lisa Su 的 90 分钟面谈。
SemiAnalysis 今年营收预计从去年的 2000 万美元跳涨至 1 亿美元。在新闻通讯平台 Substack 上有超过 25 万订阅者,付费订阅 500 美元一年,但核心收入不来自订阅费,而是把更详尽的研报和供应链数据卖给初创公司、投资机构,以及英伟达等大公司的内部团队。
Patel 同时是投资人,已入股约 20 家 AI 初创公司,包括 Mira Murati 创办的 Thinking Machines Lab,以及去年与英伟达达成超过 9 亿美元授权合作的芯片公司 Enfabrica。SemiAnalysis 研报写到这些公司时,不会像传统媒体那样主动披露 Patel 的投资关系,对它们的竞争对手也照常覆盖。
近期,Patel 与前员工 Wei Zhou 互相起诉,两人此前是密友。Zhou 起诉称,Patel 曾要求他把云服务商 Fluidstack 的内部信息写入 SemiAnalysis 研报,而 Patel 此前已通过特殊目的载体(SPV)筹资投资 Fluidstack。Zhou 称担心此举违法、拒绝配合后被开除;Patel 反诉称 Zhou 是因对同事无礼、醉酒上班等原因被解雇。诉讼后,客户开始担心 SemiAnalysis 如何处理机密信息,公司计划聘请外部机构出具一份数据处理报告。Patel 同时在筹集一支风险投资基金。若筹成,他的投资组合会进一步扩大,与研报业务的利益冲突也会更深。
信源:https://www.theinformation.com/articles/dylan-patel-semianalysis-grabbed-sway-silicon-valley
The Information
How Dylan Patel and SemiAnalysis Grabbed Sway in Silicon Valley
For Dylan Patel, founder of SemiAnalysis, an influential AI industry newsletter and research firm, Nvidia deserves the kind of dogged observation and study the tabloid press once devoted to Princess Diana. Hescrutinizesthe chip giant’s new products,documentsits…
OpenAI B2B工程负责人Srinivas Narayanan宣布离职,称重大产品发布前夕是「正确时机」
OpenAI B2B 工程团队负责人 Srinivas Narayanan 4 月 18 日宣布离职,这是继 Sora 负责人和科学部门负责人之后,OpenAI 同日流失的第三位核心高管。Narayanan 曾主导应用工程团队从 40 人的初创规模壮大,并直接负责 ChatGPT 及 API 等核心商业化产品的研发与交付。
他在离职信中表示,在公司近期及即将发布的重大产品节点前夕,是其退居幕后的「正确时机」。Narayanan 离职后计划先陪伴年迈的父母,尚未透露下一步去向。
信源:https://x.com/snsf/status/2045261554484986155
OpenAI B2B 工程团队负责人 Srinivas Narayanan 4 月 18 日宣布离职,这是继 Sora 负责人和科学部门负责人之后,OpenAI 同日流失的第三位核心高管。Narayanan 曾主导应用工程团队从 40 人的初创规模壮大,并直接负责 ChatGPT 及 API 等核心商业化产品的研发与交付。
他在离职信中表示,在公司近期及即将发布的重大产品节点前夕,是其退居幕后的「正确时机」。Narayanan 离职后计划先陪伴年迈的父母,尚未透露下一步去向。
信源:https://x.com/snsf/status/2045261554484986155
X (formerly Twitter)
Srinivas Narayanan (@snsf) on X
After 3 incredible years, I am leaving OpenAI at the end of next week.
I shared my decision with the OpenAI leadership team at the start of the month and here is a shorter version of what I shared with my team earlier this week.
===
Hi Team,
I have decided…
I shared my decision with the OpenAI leadership team at the start of the month and here is a shorter version of what I shared with my team earlier this week.
===
Hi Team,
I have decided…
Anthropic 发布 Claude Design,用对话生成原型、幻灯片和落地页
Anthropic 4 月 17 日在 Anthropic Labs 旗下推出 Claude Design,定位是通过与 Claude 对话产出设计稿、交互原型、幻灯片和营销物料。产品由 Claude Opus 4.7 驱动,以研究预览形式向 Pro、Max、Team、Enterprise 订阅者开放,当天分批推送,入口为 claude.ai/design。Enterprise 账户默认关闭,需管理员在组织设置中启用。
用户用自然语言描述需求,Claude 给出初版后,可通过对话、内嵌评论、直接编辑,以及 Claude 即时生成的自定义调节滑杆来改细节。初始设置阶段 Claude 会读取团队的代码库和设计文件,建立专属设计系统,此后每个项目自动沿用团队的配色、字体和组件,团队可维护多套设计系统并随时迭代。输入支持文本 prompt、DOCX、PPTX、XLSX 文档和图片,也能用 web capture 工具从目标网站直接抓取 UI 元素,让原型看起来更贴近真实产品。输出可作为组织内链接分享,或导出 PDF、PPTX、独立 HTML,以及一键推送到 Canva。
Claude Design 与 Claude Code 直接打通。设计定稿后会被打包成 handoff bundle,交给 Claude Code 一条指令即可进入实现环节。对设计师,这解决了试错轮次长期被项目时间挤压的问题;对产品经理、创始人和营销岗,这是一条绕开专业设计门槛、直接产出可用视觉物料并衔接工程交付的新链路。
官方列出的早期用户里,学习平台 Brilliant 称此前在其他工具中需要 20 多轮 prompt 才能还原的复杂交互页,在 Claude Design 里 2 轮就能完成;Datadog 表示能在一次会议里完成从粗略想法到可运行原型的过程;Canva 则被列为主要导出目标之一。
信源:https://www.anthropic.com/news/claude-design-anthropic-labs
Anthropic 4 月 17 日在 Anthropic Labs 旗下推出 Claude Design,定位是通过与 Claude 对话产出设计稿、交互原型、幻灯片和营销物料。产品由 Claude Opus 4.7 驱动,以研究预览形式向 Pro、Max、Team、Enterprise 订阅者开放,当天分批推送,入口为 claude.ai/design。Enterprise 账户默认关闭,需管理员在组织设置中启用。
用户用自然语言描述需求,Claude 给出初版后,可通过对话、内嵌评论、直接编辑,以及 Claude 即时生成的自定义调节滑杆来改细节。初始设置阶段 Claude 会读取团队的代码库和设计文件,建立专属设计系统,此后每个项目自动沿用团队的配色、字体和组件,团队可维护多套设计系统并随时迭代。输入支持文本 prompt、DOCX、PPTX、XLSX 文档和图片,也能用 web capture 工具从目标网站直接抓取 UI 元素,让原型看起来更贴近真实产品。输出可作为组织内链接分享,或导出 PDF、PPTX、独立 HTML,以及一键推送到 Canva。
Claude Design 与 Claude Code 直接打通。设计定稿后会被打包成 handoff bundle,交给 Claude Code 一条指令即可进入实现环节。对设计师,这解决了试错轮次长期被项目时间挤压的问题;对产品经理、创始人和营销岗,这是一条绕开专业设计门槛、直接产出可用视觉物料并衔接工程交付的新链路。
官方列出的早期用户里,学习平台 Brilliant 称此前在其他工具中需要 20 多轮 prompt 才能还原的复杂交互页,在 Claude Design 里 2 轮就能完成;Datadog 表示能在一次会议里完成从粗略想法到可运行原型的过程;Canva 则被列为主要导出目标之一。
信源:https://www.anthropic.com/news/claude-design-anthropic-labs
Claude
Claude Design | Turn Ideas into Design | Claude by Anthropic
Describe a prototype, deck, or one-pager, and Claude builds a draft. Refine it yourself, or hand it off to your tools or Claude Code. You're the designer, from start to finish.
xAI 开放 Grok STT 与 TTS 音频 API,STT 整体词错率压到 6.9%
xAI 上线两个独立音频 API:Grok Speech to Text 和 Grok Text to Speech。两者来自支撑 Grok Voice、特斯拉车载系统和 Starlink 客服的同一套音频栈,此次以独立 endpoint 形式开放,开发者可直接接入语音代理、实时转录、无障碍工具和播客等应用。
STT 提供两种模式。REST API 用于对大音频文件批量转录,毫秒级返回;WebSocket API 面向实时语音流。附带能力包括词级时间戳、说话人分离(diarization)、多通道分别识别,以及 Inverse Text Normalization,即把口语里的数字、日期、货币自动整形为规范的结构化文本。语种覆盖 25 种以上,可在对话中无缝切换。
xAI 同时公布一组词错率(WER,数值越低越好)对比:整体场景 Grok 6.9%,ElevenLabs 9.0%,Deepgram 11.0%,AssemblyAI 12.9%;「电话通话实体识别」差距被拉得更大,Grok 5.0%,对应三家分别为 12.0%、13.5%、21.3%。会议、视频播客、电话三类常见业务场景下 Grok 也都小幅领先。这组数字由 xAI 自行测试公布,尚无第三方复测。
定价上,STT 批处理 0.10 美元/小时、流式 0.20 美元/小时;TTS 为 4.20 美元/100 万字符。
TTS 支持用内联 Speech Tags 控制情感和韵律,例如 `[laugh]`、`[sigh]`、`[whisper]`、`<emphasis>`、`<slow>`、`<pause>`。开发者不必手写 SSML 标记,就能让朗读带上笑声、叹气、低语或局部强调。
信源:https://x.ai/news/grok-stt-and-tts-apis
xAI 上线两个独立音频 API:Grok Speech to Text 和 Grok Text to Speech。两者来自支撑 Grok Voice、特斯拉车载系统和 Starlink 客服的同一套音频栈,此次以独立 endpoint 形式开放,开发者可直接接入语音代理、实时转录、无障碍工具和播客等应用。
STT 提供两种模式。REST API 用于对大音频文件批量转录,毫秒级返回;WebSocket API 面向实时语音流。附带能力包括词级时间戳、说话人分离(diarization)、多通道分别识别,以及 Inverse Text Normalization,即把口语里的数字、日期、货币自动整形为规范的结构化文本。语种覆盖 25 种以上,可在对话中无缝切换。
xAI 同时公布一组词错率(WER,数值越低越好)对比:整体场景 Grok 6.9%,ElevenLabs 9.0%,Deepgram 11.0%,AssemblyAI 12.9%;「电话通话实体识别」差距被拉得更大,Grok 5.0%,对应三家分别为 12.0%、13.5%、21.3%。会议、视频播客、电话三类常见业务场景下 Grok 也都小幅领先。这组数字由 xAI 自行测试公布,尚无第三方复测。
定价上,STT 批处理 0.10 美元/小时、流式 0.20 美元/小时;TTS 为 4.20 美元/100 万字符。
TTS 支持用内联 Speech Tags 控制情感和韵律,例如 `[laugh]`、`[sigh]`、`[whisper]`、`<emphasis>`、`<slow>`、`<pause>`。开发者不必手写 SSML 标记,就能让朗读带上笑声、叹气、低语或局部强调。
信源:https://x.ai/news/grok-stt-and-tts-apis
x.ai
Grok Speech to Text and Text to Speech APIs
Fast and accurate. Natural, expressive voices. Simple pricing. Multilingual support.
马斯克:Grok 4.3 beta 仍是 0.5T 训练中间版,1T 旗舰还差 5 天完成初训
Grok 4.3 (beta) 已对订阅最高档 SuperGrok Heavy 的用户开放。17 日,用户已在 Grok.com 下拉菜单里看到该版本带有「Early Access」标记。18 日早晨,X 用户 Mark Kretschmann 发帖称这一版本拥有 1T 参数、体量是 Grok 4.20 的两倍,训练时间也显著更长。xAI 及特斯拉 CEO 马斯克(Elon Musk)随后在同条推文下更正,当前的 4.3 (beta) 仍是 0.5T 模型,只是一份更新的训练检查点,并非外界推测的 1T 新模型。
马斯克同时透露,真正的 1T 旗舰距离初始训练完成还剩约 5 天。他形容 1T 模型将在编码、长上下文和各项技能上形成阶跃式提升,并称 SpaceXAI 模型工厂已经跑通,之后预计每两周能下线一版改进后的基础模型。
信源:https://x.com/elonmusk/status/2045293644693770630
Grok 4.3 (beta) 已对订阅最高档 SuperGrok Heavy 的用户开放。17 日,用户已在 Grok.com 下拉菜单里看到该版本带有「Early Access」标记。18 日早晨,X 用户 Mark Kretschmann 发帖称这一版本拥有 1T 参数、体量是 Grok 4.20 的两倍,训练时间也显著更长。xAI 及特斯拉 CEO 马斯克(Elon Musk)随后在同条推文下更正,当前的 4.3 (beta) 仍是 0.5T 模型,只是一份更新的训练检查点,并非外界推测的 1T 新模型。
马斯克同时透露,真正的 1T 旗舰距离初始训练完成还剩约 5 天。他形容 1T 模型将在编码、长上下文和各项技能上形成阶跃式提升,并称 SpaceXAI 模型工厂已经跑通,之后预计每两周能下线一版改进后的基础模型。
信源:https://x.com/elonmusk/status/2045293644693770630
X (formerly Twitter)
Elon Musk (@elonmusk) on X
@mark_k @xai This is still 0.5T, but a more recent training checkpoint.
1T model is ~5 days away from finishing initial training. Will be a major step change improvement in coding, long context and skills.
The SpaceXAI model factory is finally working.…
1T model is ~5 days away from finishing initial training. Will be a major step change improvement in coding, long context and skills.
The SpaceXAI model factory is finally working.…
ProducerAI更名Flow Music,上线片段替换与延展
今年 2 月加入 Google Labs 的 AI 音乐创作平台 ProducerAI 宣布产品正式更名为 Google Flow Music,纳入 Google Flow 家族,入口为 flowmusic.google。Google Flow 是 Google 在 2025 年 I/O 上发布的 AI 视频生成套件,原本只涵盖视频方向,此次把 AI 音乐能力补进同一产品线。官方称团队和使命不变。
同步上线两项 remix 能力:replace(替换)和 extend(延展)。用户用自然语言 prompt 圈出歌曲里的某一段,交给名为 Producer 的智能体修改,例如把一段 lofi 钢琴前奏延展成 dubstep drop、一次性替换多段副歌,或者让它对同一段吉他 solo 生成 5 个备选版本。
这次更新把 AI 生成音乐的工作流从「整首重生」推向「局部可控」。过去用 Suno、Udio 这类工具,生成结果不满意时多数情况只能整首重跑再手动拼接,现在可以针对一首歌反复改局部、保留其他部分不动,更贴近传统音乐制作的迭代节奏。
信源:https://x.com/googleflowmusic/status/2045250153356108026
今年 2 月加入 Google Labs 的 AI 音乐创作平台 ProducerAI 宣布产品正式更名为 Google Flow Music,纳入 Google Flow 家族,入口为 flowmusic.google。Google Flow 是 Google 在 2025 年 I/O 上发布的 AI 视频生成套件,原本只涵盖视频方向,此次把 AI 音乐能力补进同一产品线。官方称团队和使命不变。
同步上线两项 remix 能力:replace(替换)和 extend(延展)。用户用自然语言 prompt 圈出歌曲里的某一段,交给名为 Producer 的智能体修改,例如把一段 lofi 钢琴前奏延展成 dubstep drop、一次性替换多段副歌,或者让它对同一段吉他 solo 生成 5 个备选版本。
这次更新把 AI 生成音乐的工作流从「整首重生」推向「局部可控」。过去用 Suno、Udio 这类工具,生成结果不满意时多数情况只能整首重跑再手动拼接,现在可以针对一首歌反复改局部、保留其他部分不动,更贴近传统音乐制作的迭代节奏。
信源:https://x.com/googleflowmusic/status/2045250153356108026
X (formerly Twitter)
Google Flow Music (@googleflowmusic) on X
1/ A new era, a new name, and a new feature drop. 🚀
ProducerAI is officially "Google Flow Music"! We're still the same team, with the same mission: building tools that push the boundaries of human creativity.
To kick off this new chapter, we're launching…
ProducerAI is officially "Google Flow Music"! We're still the same team, with the same mission: building tools that push the boundaries of human creativity.
To kick off this new chapter, we're launching…
月之暗面与清华新论文:LLM 预填充可跨数据中心,1T 模型吞吐升 54%
月之暗面(Moonshot AI)与清华大学 4 月 16 日在 arXiv 挂出新论文《Prefill-as-a-Service》,提出让大模型推理的预填充阶段(prefill)跨数据中心运行。
大模型推理分两步:prefill 先把输入一次性读进来、生成一份 KV 缓存;decode 再根据这份缓存逐字吐出结果。两步需要的硬件特性完全不同,prefill 吃算力,decode 吃显存带宽。业界主流做法是把两步拆到不同机器上(PD 分离),但这要求两边在同一个数据中心里用 RDMA 互联,因为密集 attention 模型的 KV 缓存每秒几十 Gbps 地吐,一旦传慢 GPU 就空转。
转折来自新一代 hybrid attention 模型。论文实测 Kimi Linear、MiMo-V2-Flash、Ring-2.5-1T 等模型通过少量完整 attention 层加大量线性层的组合,把 KV 缓存吞吐量砍掉了约一个数量级,Ring-2.5-1T 的综合压缩比达到 36 倍。这时 KV 缓存可以从 RDMA 专网搬到普通以太网上传。
PrfaaS 的具体做法:组建独立的「预填充集群」,只把长上下文、未命中前缀缓存的请求路由过去,短请求留在本地 PD 集群;预填充完成后通过以太网把 KV 缓存回传本地集群做 decode。配套引入长度阈值路由、带宽感知调度器和混合前缀缓存池。论文用内部 1T 参数 hybrid 模型(基于 Kimi Linear 架构)做了一组实测,整体服务吞吐比同构 PD 部署高 54%,比朴素异构方案高 32%,每台机器只占适中的跨数据中心带宽。
信源:https://arxiv.org/html/2604.15039v1
月之暗面(Moonshot AI)与清华大学 4 月 16 日在 arXiv 挂出新论文《Prefill-as-a-Service》,提出让大模型推理的预填充阶段(prefill)跨数据中心运行。
大模型推理分两步:prefill 先把输入一次性读进来、生成一份 KV 缓存;decode 再根据这份缓存逐字吐出结果。两步需要的硬件特性完全不同,prefill 吃算力,decode 吃显存带宽。业界主流做法是把两步拆到不同机器上(PD 分离),但这要求两边在同一个数据中心里用 RDMA 互联,因为密集 attention 模型的 KV 缓存每秒几十 Gbps 地吐,一旦传慢 GPU 就空转。
转折来自新一代 hybrid attention 模型。论文实测 Kimi Linear、MiMo-V2-Flash、Ring-2.5-1T 等模型通过少量完整 attention 层加大量线性层的组合,把 KV 缓存吞吐量砍掉了约一个数量级,Ring-2.5-1T 的综合压缩比达到 36 倍。这时 KV 缓存可以从 RDMA 专网搬到普通以太网上传。
PrfaaS 的具体做法:组建独立的「预填充集群」,只把长上下文、未命中前缀缓存的请求路由过去,短请求留在本地 PD 集群;预填充完成后通过以太网把 KV 缓存回传本地集群做 decode。配套引入长度阈值路由、带宽感知调度器和混合前缀缓存池。论文用内部 1T 参数 hybrid 模型(基于 Kimi Linear 架构)做了一组实测,整体服务吞吐比同构 PD 部署高 54%,比朴素异构方案高 32%,每台机器只占适中的跨数据中心带宽。
信源:https://arxiv.org/html/2604.15039v1
❤1
X API把「自有数据读取」砍到每千次1美元,发帖反向涨价
X 近期发布新一轮 API 调价,新费率自 4 月 20 日生效。最大变化是「自有读取」(Owned Reads)按次计价 0.001 美元,相当于 1 美元能调 1000 次。该档覆盖开发者用自己的应用读取本账号的发帖、提及、点赞、收藏、关注者、关注列表、屏蔽与静音名单、置顶列表、自有列表、加入列表与列表归属共 12 个 GET 端点。
写入端反向涨价。POST /2/tweets 主接口由 0.01 美元上调至 0.015 美元/条。带 URL 的发帖单独定价 0.20 美元/条,仅「召唤回复」(summoned replies)保留 0.01 美元的旧价。同步对自助层级(self-serve tiers)账号砍掉三类写入操作:关注/取关、点赞/取消点赞、引用转发,对应端点全部禁用。
Owned Reads 大降价让开发者用接近免费的成本就能拉自己账号的全部公开数据,智能体框架可以直接围绕用户的 X 列表、关注、收藏搭轻量应用,不必再为每次拉取付出可观费用。带 URL 发帖的高定价对应自动化引流贴;自动关注、点赞、引用转发从自助级被一次性砍掉,相当于把账号增长动作收紧到付费更高的层级。
特斯拉与 xAI CEO 马斯克 4 月 19 日在 X 回应称,开发者可通过开源智能体网关 OpenClaw 接入 X API,并写「我们想做得便宜,但不能把家底送人」。
信源:https://devcommunity.x.com/t/x-api-pricing-update-owned-reads-now-0-001-other-changes-effective-april-20-2026/263025
X 近期发布新一轮 API 调价,新费率自 4 月 20 日生效。最大变化是「自有读取」(Owned Reads)按次计价 0.001 美元,相当于 1 美元能调 1000 次。该档覆盖开发者用自己的应用读取本账号的发帖、提及、点赞、收藏、关注者、关注列表、屏蔽与静音名单、置顶列表、自有列表、加入列表与列表归属共 12 个 GET 端点。
写入端反向涨价。POST /2/tweets 主接口由 0.01 美元上调至 0.015 美元/条。带 URL 的发帖单独定价 0.20 美元/条,仅「召唤回复」(summoned replies)保留 0.01 美元的旧价。同步对自助层级(self-serve tiers)账号砍掉三类写入操作:关注/取关、点赞/取消点赞、引用转发,对应端点全部禁用。
Owned Reads 大降价让开发者用接近免费的成本就能拉自己账号的全部公开数据,智能体框架可以直接围绕用户的 X 列表、关注、收藏搭轻量应用,不必再为每次拉取付出可观费用。带 URL 发帖的高定价对应自动化引流贴;自动关注、点赞、引用转发从自助级被一次性砍掉,相当于把账号增长动作收紧到付费更高的层级。
特斯拉与 xAI CEO 马斯克 4 月 19 日在 X 回应称,开发者可通过开源智能体网关 OpenClaw 接入 X API,并写「我们想做得便宜,但不能把家底送人」。
信源:https://devcommunity.x.com/t/x-api-pricing-update-owned-reads-now-0-001-other-changes-effective-april-20-2026/263025
❤1
browser-use开源自愈浏览器工具Browser Harness
browser-use 在 GitHub 开源 Browser Harness,一个让大模型直接操作浏览器的工具,核心代码集中在四个 Python 文件、合计约 592 行。创始人 Gregor Zunic 在 X 上写,团队受够了浏览器框架限制 LLM,于是把框架整块拿掉。四份文件分工:run.py 约 36 行做 Python 入口;helpers.py 约 195 行放初始工具调用;admin.py 与 daemon.py 合计约 361 行,负责守护进程启动,以及 Chrome DevTools Protocol(CDP)websocket 到本地 socket 的桥接。
主打能力是「自愈」。智能体任务中若发现 helpers.py 缺要用的函数,例如 upload_file(),会直接改源码把函数补上再继续跑,整套系统只留一条通往 Chrome 的 websocket。Zunic 发帖称他至今没找到 Browser Harness 解决不了的浏览器任务。
远程端走 browser-use Cloud,免费层三路并发,不要求信用卡。仓库 domain-skills 目录另收录 GitHub、Amazon、HackerNews 等数十个站点的抓取经验,由团队用 Browser Harness 实跑后整理;整体以即插即用形式对接 Claude Code 和 Codex。
信源:https://github.com/browser-use/browser-harness
browser-use 在 GitHub 开源 Browser Harness,一个让大模型直接操作浏览器的工具,核心代码集中在四个 Python 文件、合计约 592 行。创始人 Gregor Zunic 在 X 上写,团队受够了浏览器框架限制 LLM,于是把框架整块拿掉。四份文件分工:run.py 约 36 行做 Python 入口;helpers.py 约 195 行放初始工具调用;admin.py 与 daemon.py 合计约 361 行,负责守护进程启动,以及 Chrome DevTools Protocol(CDP)websocket 到本地 socket 的桥接。
主打能力是「自愈」。智能体任务中若发现 helpers.py 缺要用的函数,例如 upload_file(),会直接改源码把函数补上再继续跑,整套系统只留一条通往 Chrome 的 websocket。Zunic 发帖称他至今没找到 Browser Harness 解决不了的浏览器任务。
远程端走 browser-use Cloud,免费层三路并发,不要求信用卡。仓库 domain-skills 目录另收录 GitHub、Amazon、HackerNews 等数十个站点的抓取经验,由团队用 Browser Harness 实跑后整理;整体以即插即用形式对接 Claude Code 和 Codex。
信源:https://github.com/browser-use/browser-harness
GitHub
GitHub - browser-use/browser-harness: Browser Harness | Self-healing harness that enables LLMs to complete any task.
Browser Harness | Self-healing harness that enables LLMs to complete any task. - browser-use/browser-harness
Claude Code 改用原生二进制,运行时不再依赖 Node.js
Claude Code 从 v2.1.113 开始,npm 包里分发的内容由 JavaScript 构建产物换成了各平台原生二进制。
安装命令
最直观的变化是启动延迟。JS 版本每次敲下 `claude`,系统要先拉起一个 Node.js 进程,读入并即时编译所有脚本,再进入 CLI 主循环;这段开销对 CLI 场景最碍事,因为工具启停频繁,每次都要从头重跑。原生二进制的做法是把 JS 引擎和全部代码在发布时就打包进一个可执行文件,用户这边操作系统直接加载,省掉 Node.js 起进程和 JIT 预热的部分。对一天敲几十上百次命令的人,这段延迟的消失是能直接感觉到的。
第二层变化在依赖。Claude Code 运行时不再需要本机安装 Node.js,也不再受 Node.js 版本差异影响。CLI 工具对外部运行时的依赖越少,安装失败和环境冲突的概率越低。
信源:https://github.com/anthropics/claude-code/releases/tag/v2.1.113
Claude Code 从 v2.1.113 开始,npm 包里分发的内容由 JavaScript 构建产物换成了各平台原生二进制。
安装命令
npm install -g @anthropic-ai/claude-code 保持不变,npm 在背后根据平台 optional dependency 拉取对应的预编译二进制,并通过 postinstall 脚本链接到位;如需继续使用 JS 版本,可将版本号 pin 到 v2.1.113 之前。最直观的变化是启动延迟。JS 版本每次敲下 `claude`,系统要先拉起一个 Node.js 进程,读入并即时编译所有脚本,再进入 CLI 主循环;这段开销对 CLI 场景最碍事,因为工具启停频繁,每次都要从头重跑。原生二进制的做法是把 JS 引擎和全部代码在发布时就打包进一个可执行文件,用户这边操作系统直接加载,省掉 Node.js 起进程和 JIT 预热的部分。对一天敲几十上百次命令的人,这段延迟的消失是能直接感觉到的。
第二层变化在依赖。Claude Code 运行时不再需要本机安装 Node.js,也不再受 Node.js 版本差异影响。CLI 工具对外部运行时的依赖越少,安装失败和环境冲突的概率越低。
信源:https://github.com/anthropics/claude-code/releases/tag/v2.1.113
DeepSeek V4传下周发布,Yifan Zhang披露三项架构组件
普林斯顿博士生 Yifan Zhang 透露,中国 AI 公司 DeepSeek(深度求索)的下一代旗舰 V4 将在下周发布;他在跟帖里列出三项架构组件:稀疏 MQA(Sparse Multi-Query Attention)、融合 MoE 大核(Fused MoE Mega Kernel)、Hyper-Connections。Zhang 本科北大元培、硕士清华姚班,现为普林斯顿 AI Lab Fellow,曾在字节跳动 Seed 基础模型团队任研究实习生;目前不在 DeepSeek 任职,DeepSeek 官方也未就发布时间表作出确认。
三项组件各对应 LLM 优化里的一条独立方向。稀疏 MQA 是在多查询注意力基础上引入稀疏性,用于在长上下文场景进一步压低推理算力和显存占用;融合 MoE 大核把 MoE 的路由判断与专家矩阵乘法编进同一个 GPU kernel,砍掉推理阶段大量 kernel 启动和显存搬运开销;Hyper-Connections 是对残差连接的泛化,用多条可学习加权通路替代单一残差加法。
信源:https://x.com/yifan_zhang_/status/2045694320993276133
普林斯顿博士生 Yifan Zhang 透露,中国 AI 公司 DeepSeek(深度求索)的下一代旗舰 V4 将在下周发布;他在跟帖里列出三项架构组件:稀疏 MQA(Sparse Multi-Query Attention)、融合 MoE 大核(Fused MoE Mega Kernel)、Hyper-Connections。Zhang 本科北大元培、硕士清华姚班,现为普林斯顿 AI Lab Fellow,曾在字节跳动 Seed 基础模型团队任研究实习生;目前不在 DeepSeek 任职,DeepSeek 官方也未就发布时间表作出确认。
三项组件各对应 LLM 优化里的一条独立方向。稀疏 MQA 是在多查询注意力基础上引入稀疏性,用于在长上下文场景进一步压低推理算力和显存占用;融合 MoE 大核把 MoE 的路由判断与专家矩阵乘法编进同一个 GPU kernel,砍掉推理阶段大量 kernel 启动和显存搬运开销;Hyper-Connections 是对残差连接的泛化,用多条可学习加权通路替代单一残差加法。
信源:https://x.com/yifan_zhang_/status/2045694320993276133