营收狂飙五倍反超OpenAI,Anthropic年化450亿美元且率先盈利
最新财务数据显示, Anthropic 年化营业收入已狂飙至近 450 亿美元,不仅在 2026 年前 5 个月内实现 5 倍暴涨,更一举反超 OpenAI 约 35% 。相比之下, OpenAI 如今的年化营收增速明显放缓,仅维持在 300 亿至 330 亿美元区间。而在去年年底, Anthropic 的年化营收还只有 90 亿美元,尚不足 OpenAI 的一半。如今反超不仅让业界震惊,也为两家公司即将展开的首次公开募股( IPO )对决增添了巨大的变数。
更具戏剧性的是两家公司的盈利水平。得益于企业端客户对高客单价服务的强劲需求, Anthropic 预计在第二季度实现 5.59 亿美元运营利润,运营利润率达到 5% ,率先扭亏为盈。反观 OpenAI 则陷入极度严重的亏损泥潭,由于背负数百亿的服务器租用成本以及供养数亿免费用户的负担, OpenAI 在第一季度的运营利润率为负 122% ,相当于单季度净亏损至少 70 亿美元,全年烧钱预算高达 250 亿美元。
业务结构差异也凸显了双方的底牌。 Anthropic 专注于向企业出售代码编写与白领自动化工具,甚至允许将云服务商的分销收入一并合并入账。相比之下, OpenAI 除了要将 20% 的收入永久上缴给微软,还不得不收缩 Sora 视频模型等高耗能项目以节省开支。 OpenAI 财务总监 Sarah Friar 曾对首席执行官 Sam Altman 匆忙推进上市表示担忧,然而面对财务底子更厚、率先盈利的 Anthropic 步步紧逼,率先去股市吸金或许成了 OpenAI 唯一的选择。
信源:https://www.theinformation.com/newsletters/the-briefing/anthropic-likely-generating-least-35-revenue-openai
最新财务数据显示, Anthropic 年化营业收入已狂飙至近 450 亿美元,不仅在 2026 年前 5 个月内实现 5 倍暴涨,更一举反超 OpenAI 约 35% 。相比之下, OpenAI 如今的年化营收增速明显放缓,仅维持在 300 亿至 330 亿美元区间。而在去年年底, Anthropic 的年化营收还只有 90 亿美元,尚不足 OpenAI 的一半。如今反超不仅让业界震惊,也为两家公司即将展开的首次公开募股( IPO )对决增添了巨大的变数。
更具戏剧性的是两家公司的盈利水平。得益于企业端客户对高客单价服务的强劲需求, Anthropic 预计在第二季度实现 5.59 亿美元运营利润,运营利润率达到 5% ,率先扭亏为盈。反观 OpenAI 则陷入极度严重的亏损泥潭,由于背负数百亿的服务器租用成本以及供养数亿免费用户的负担, OpenAI 在第一季度的运营利润率为负 122% ,相当于单季度净亏损至少 70 亿美元,全年烧钱预算高达 250 亿美元。
业务结构差异也凸显了双方的底牌。 Anthropic 专注于向企业出售代码编写与白领自动化工具,甚至允许将云服务商的分销收入一并合并入账。相比之下, OpenAI 除了要将 20% 的收入永久上缴给微软,还不得不收缩 Sora 视频模型等高耗能项目以节省开支。 OpenAI 财务总监 Sarah Friar 曾对首席执行官 Sam Altman 匆忙推进上市表示担忧,然而面对财务底子更厚、率先盈利的 Anthropic 步步紧逼,率先去股市吸金或许成了 OpenAI 唯一的选择。
信源:https://www.theinformation.com/newsletters/the-briefing/anthropic-likely-generating-least-35-revenue-openai
The Information
Anthropic Is Likely Generating at Least 35% More Revenue Than OpenAI
On New Year’s Day, OpenAI leaders would have been happy to hear that the company’s monthly revenue would rise more than 50% over the first five months of 2026, roughly in line with the projections it previously shared with investors. But they’re not likely…
复旦联合美团LongCat开源交互式世界模型基准WBench
复旦大学与美团 Longcat 团队联合开源交互式世界模型基准 WBench ,评估视频生成在物理规则、时空一致与交互控制的底层建模能力。基准包含 289 个测试用例与 1058 轮交互,涵盖第一与第三人称双视角,整合导航控制、主体动作、事件编辑与视角切换。 WBench 统一了文本指令、 6 自由度位姿与离散动作接口,实现跨控制范式比对。评估体系包含 22 个自动指标,打分结果与人类盲测胜率的 Spearman 秩相关系数至少达到 0.94。
测试表明,相较于趋于饱和的视频质量,交互控制与模型的渲染、一致性及物理水平几乎解耦。相机运动控制并不保证主体一致性,例如导航表现优秀的 HY-World 1.5 和 Matrix-Game 3.0 在第三人称视角下均面临主体身份丢失和视角漂移瓶颈。同时,物理正确性与渲染质量高度正相关,但与控制能力接近零相关。开源世界模型在多个维度领跑,HY-World 1.5 取得导航控制最高分,LingBot-World 夺得一致性榜首,Matrix-Game 3.0 则在动作导航中位列第一。
多轮交互表明,所有模型性能均随轮数增加而衰退,导航控制因累积空间偏差退化最快。显式几何控制能有效缓解漂移,例如 HY-World 1.5 的多轮稳定性远超文本驱动的 Kling 3.0。场景动态与主体刚性构成基准难度的底层逻辑,第一人称、静态场景与刚体机器人主体极易跑通,而剧烈运动、动物等非刚体主体因形变和速度复杂性仍是业界长期挑战。
信源:https://x.com/Meituan_LongCat/status/2059658634829996047
复旦大学与美团 Longcat 团队联合开源交互式世界模型基准 WBench ,评估视频生成在物理规则、时空一致与交互控制的底层建模能力。基准包含 289 个测试用例与 1058 轮交互,涵盖第一与第三人称双视角,整合导航控制、主体动作、事件编辑与视角切换。 WBench 统一了文本指令、 6 自由度位姿与离散动作接口,实现跨控制范式比对。评估体系包含 22 个自动指标,打分结果与人类盲测胜率的 Spearman 秩相关系数至少达到 0.94。
测试表明,相较于趋于饱和的视频质量,交互控制与模型的渲染、一致性及物理水平几乎解耦。相机运动控制并不保证主体一致性,例如导航表现优秀的 HY-World 1.5 和 Matrix-Game 3.0 在第三人称视角下均面临主体身份丢失和视角漂移瓶颈。同时,物理正确性与渲染质量高度正相关,但与控制能力接近零相关。开源世界模型在多个维度领跑,HY-World 1.5 取得导航控制最高分,LingBot-World 夺得一致性榜首,Matrix-Game 3.0 则在动作导航中位列第一。
多轮交互表明,所有模型性能均随轮数增加而衰退,导航控制因累积空间偏差退化最快。显式几何控制能有效缓解漂移,例如 HY-World 1.5 的多轮稳定性远超文本驱动的 Kling 3.0。场景动态与主体刚性构成基准难度的底层逻辑,第一人称、静态场景与刚体机器人主体极易跑通,而剧烈运动、动物等非刚体主体因形变和速度复杂性仍是业界长期挑战。
信源:https://x.com/Meituan_LongCat/status/2059658634829996047
X (formerly Twitter)
Meituan LongCat (@Meituan_LongCat) on X
The next challenge for world models is to generate worlds that users can control, reconstruct, and reason about.
Introducing WBench: a comprehensive benchmark for interactive world models.
What does it test?
- 4 major interaction types: navigation, subject…
Introducing WBench: a comprehensive benchmark for interactive world models.
What does it test?
- 4 major interaction types: navigation, subject…
杨立昆联手LanceDB推出stable-worldmodel解决世界模型碎片化
前 Meta 首席 AI 科学家、世界模型公司 AMI Labs 联合创始人杨立昆(Yann LeCun)联合 Mila 研究所、布朗大学、牛津大学及 LanceDB 等机构,推出全新开源平台 stable-worldmodel(简称 swm)。项目由 Mila 研究所博士生 Lucas Maes 担任第一作者,AMI Labs 研究员 Randall Balestriero 担任通讯作者,旨在标准化与复现具身智能领域的世界模型研究。
世界模型研究面临着代码库支离破碎、视频数据加载极度缓慢、缺乏标准化泛化基准等三大瓶颈。由于不同团队往往需要从头构建专属的数据流与核心算法,重复开发不仅效率低下,还极易引入细微不一致性,从而损害公平比较与研究的可复现性。
为了消除输入输出与视频数据加载的瓶颈,stable-worldmodel 引入了基于 Lance 格式的高性能数据层,提供针对 MP4 视频、HDF5 以及 LeRobot 机器人数据集的转换工具。在算法实现上,平台集成了包括 DINO-WM、PLDM、LeWM、GCBC、GCIVL 以及 GCIQL 等多种主流世界模型基线,并提供 CEM、MPPI 以及基于梯度的规划求解器。
评估环境支持定制视觉、几何及物理因子的变化,允许研究人员系统性地测试模型的动力学理解、控制性能、表示质量以及分布外泛化水平。通过在单一框架下集成完整的数据流与评估体系,stable-worldmodel 能够大幅削减世界模型的研发门槛与基础设施成本,为具身智能研究提供了一个高复现性的标准化底座。
信源:https://arxiv.org/abs/2605.21800
前 Meta 首席 AI 科学家、世界模型公司 AMI Labs 联合创始人杨立昆(Yann LeCun)联合 Mila 研究所、布朗大学、牛津大学及 LanceDB 等机构,推出全新开源平台 stable-worldmodel(简称 swm)。项目由 Mila 研究所博士生 Lucas Maes 担任第一作者,AMI Labs 研究员 Randall Balestriero 担任通讯作者,旨在标准化与复现具身智能领域的世界模型研究。
世界模型研究面临着代码库支离破碎、视频数据加载极度缓慢、缺乏标准化泛化基准等三大瓶颈。由于不同团队往往需要从头构建专属的数据流与核心算法,重复开发不仅效率低下,还极易引入细微不一致性,从而损害公平比较与研究的可复现性。
为了消除输入输出与视频数据加载的瓶颈,stable-worldmodel 引入了基于 Lance 格式的高性能数据层,提供针对 MP4 视频、HDF5 以及 LeRobot 机器人数据集的转换工具。在算法实现上,平台集成了包括 DINO-WM、PLDM、LeWM、GCBC、GCIVL 以及 GCIQL 等多种主流世界模型基线,并提供 CEM、MPPI 以及基于梯度的规划求解器。
评估环境支持定制视觉、几何及物理因子的变化,允许研究人员系统性地测试模型的动力学理解、控制性能、表示质量以及分布外泛化水平。通过在单一框架下集成完整的数据流与评估体系,stable-worldmodel 能够大幅削减世界模型的研发门槛与基础设施成本,为具身智能研究提供了一个高复现性的标准化底座。
信源:https://arxiv.org/abs/2605.21800
arXiv.org
stable-worldmodel: A Platform for Reproducible World Modeling...
World models are central to building agents that can reason, plan, and generalize beyond their training data. However, research on world models is currently fragmented, with disparate codebases,...
应对CPU最高涨价35%,字节跳动自研Arm与RISC-V服务器芯片
字节跳动正在自研服务器中央处理器( CPU ),用于支撑旗下人工智能基础设施,并为 Coze 等智能体( Agent )平台的规模化部署提供算力保障。由于英特尔( Intel )与 AMD 在近几个月内将服务器 CPU 的报价环比上调 10% 至 35% ,且交货周期拉长至 6 个月,促使字节跳动加速推进自研芯片计划以控制成本。
在技术架构上,字节跳动同时推进两条 CPU 研发路线,分别基于 Arm 架构与开源 RISC-V 指令集。并行开发双版本有利于在承诺高昂的流片与量产成本前,充分评估不同架构在自身数据中心负载下的性价比。虽然项目目前仍处于早期阶段,但字节跳动已接触多家外部合作伙伴,共同参与芯片设计并着手锁定晶圆代工厂产能。
自研芯片的动力源于人工智能应用向推理( Inference )端的快速倾斜。执行复杂的智能体任务对服务器 CPU 的算力与配合调度提出了更高要求。随着行业对中央处理器需求飙升,英特尔( Intel )在今年 2 月曾警告中国客户服务器 CPU 的交货周期已拉长至 6 个月, AMD 首席执行官苏姿丰( Lisa Su )也坦言全球 CPU 市场供给将持续偏紧。为了降低计算开支并针对特定工作负载优化性能,谷歌( Google )、亚马逊( Amazon )与微软( Microsoft )等全球超大规模云厂商此前均已推出自研 CPU 芯片。英伟达( Nvidia )同样在加速切入规模达 2000 亿美元的 CPU 市场,计划通过全新 Vera 处理器以及集成 Groq 推理技术的 AI 系统,防御自身在算力生态中的霸主地位。
信源:https://www.reuters.com/world/china/bytedance-developing-custom-cpu-chips-support-ai-rollout-sources-say-2026-05-28/
字节跳动正在自研服务器中央处理器( CPU ),用于支撑旗下人工智能基础设施,并为 Coze 等智能体( Agent )平台的规模化部署提供算力保障。由于英特尔( Intel )与 AMD 在近几个月内将服务器 CPU 的报价环比上调 10% 至 35% ,且交货周期拉长至 6 个月,促使字节跳动加速推进自研芯片计划以控制成本。
在技术架构上,字节跳动同时推进两条 CPU 研发路线,分别基于 Arm 架构与开源 RISC-V 指令集。并行开发双版本有利于在承诺高昂的流片与量产成本前,充分评估不同架构在自身数据中心负载下的性价比。虽然项目目前仍处于早期阶段,但字节跳动已接触多家外部合作伙伴,共同参与芯片设计并着手锁定晶圆代工厂产能。
自研芯片的动力源于人工智能应用向推理( Inference )端的快速倾斜。执行复杂的智能体任务对服务器 CPU 的算力与配合调度提出了更高要求。随着行业对中央处理器需求飙升,英特尔( Intel )在今年 2 月曾警告中国客户服务器 CPU 的交货周期已拉长至 6 个月, AMD 首席执行官苏姿丰( Lisa Su )也坦言全球 CPU 市场供给将持续偏紧。为了降低计算开支并针对特定工作负载优化性能,谷歌( Google )、亚马逊( Amazon )与微软( Microsoft )等全球超大规模云厂商此前均已推出自研 CPU 芯片。英伟达( Nvidia )同样在加速切入规模达 2000 亿美元的 CPU 市场,计划通过全新 Vera 处理器以及集成 Groq 推理技术的 AI 系统,防御自身在算力生态中的霸主地位。
信源:https://www.reuters.com/world/china/bytedance-developing-custom-cpu-chips-support-ai-rollout-sources-say-2026-05-28/
SpaceX自研C语言AI训练框架接近完工,将用于训练Grok v5
马斯克透露,SpaceX 内部团队正在接近完成用 C 语言自研的超大规模 AI 训练框架 V1.0 版本。
在硬件映射与并行机制上,全新训练栈能精准适配由 22 万张英伟达 GB300 加速卡与 800G 网卡组成的超大规模计算集群。为了压榨底层算力,框架在设计上极度贴近裸金属(bare metal)底层,并深度采用流水线并行(pipeline parallelism)技术。在应对超大规模训练任务时,纯 C 语言编写的底层架构相较于谷歌主流的高级 AI 框架 JAX,潜在运行速度可提升一个数量级以上(即 10 倍以上)。
全新自研训练栈将运行于 SpaceX 旗下的 Colossus 超级计算集群,直接服务于下一代大模型 Grok v5 的全量训练与迭代。
信源:https://x.com/elonmusk/status/2059884150187053488
马斯克透露,SpaceX 内部团队正在接近完成用 C 语言自研的超大规模 AI 训练框架 V1.0 版本。
在硬件映射与并行机制上,全新训练栈能精准适配由 22 万张英伟达 GB300 加速卡与 800G 网卡组成的超大规模计算集群。为了压榨底层算力,框架在设计上极度贴近裸金属(bare metal)底层,并深度采用流水线并行(pipeline parallelism)技术。在应对超大规模训练任务时,纯 C 语言编写的底层架构相较于谷歌主流的高级 AI 框架 JAX,潜在运行速度可提升一个数量级以上(即 10 倍以上)。
全新自研训练栈将运行于 SpaceX 旗下的 Colossus 超级计算集群,直接服务于下一代大模型 Grok v5 的全量训练与迭代。
信源:https://x.com/elonmusk/status/2059884150187053488
6.5亿参数跑到83.3%,Surya OCR 2成3B以下开源OCR新标杆
开源文档智能平台 Datalab 正式发布全新多语言 OCR 开源模型 Surya OCR 2。新模型仅有 6.5 亿参数,在权威文档智能评测 olmOCR-bench 中取得 83.3% 的成绩,在 30 亿参数以下级别位列第一,性能甚至超越了体积约 14 倍的初代 90 亿参数版本,实现了参数量与准确率的帕累托最优。
在功能上, Surya OCR 2 将版面分析、文本识别和表格识别等三大任务收拢到单一视觉语言模型( VLM )中,而文本行检测与 OCR 错漏检测仍通过独立的轻量级模型运行。用户通过单次模型调用便能完成全页 OCR 识别,输出包含坐标框和阅读顺序的结构化 HTML 代码,其中数学公式以 HTML math 标签输出,跨行跨列表格则被整理为标准 HTML 格式。而在多语言支持上,新模型在 91 种语言的测试中取得 87.2% 的综合通过率(中文通过率 82.5% ),并对残损文档与手写体进行深度优化。
在部署效率上, Surya OCR 2 支持两大推理后端。系统在英伟达 GPU 设备上运行 Docker 并启用 vLLM 后端,单张 RTX 5090 显卡能实现每秒 5.35 页的超高吞吐率。在苹果设备或普通 CPU 环境下,系统则通过 llama.cpp 载入 GGUF 格式,在 M1 电脑上实现完全的本地端侧运行。目前,新模型的源代码基于 Apache 2.0 协议开源,权重基于 OpenRAIL-M 协议免费提供给个人、高校及年收入 500 万美元以下的初创企业。而 Datalab 官方也同步开放了搭载更强 40 亿参数 Chandra 2 模型的付费 API ,并赠送 5 美元体验额度。
信源:https://datalab.to/blog/surya-2
开源文档智能平台 Datalab 正式发布全新多语言 OCR 开源模型 Surya OCR 2。新模型仅有 6.5 亿参数,在权威文档智能评测 olmOCR-bench 中取得 83.3% 的成绩,在 30 亿参数以下级别位列第一,性能甚至超越了体积约 14 倍的初代 90 亿参数版本,实现了参数量与准确率的帕累托最优。
在功能上, Surya OCR 2 将版面分析、文本识别和表格识别等三大任务收拢到单一视觉语言模型( VLM )中,而文本行检测与 OCR 错漏检测仍通过独立的轻量级模型运行。用户通过单次模型调用便能完成全页 OCR 识别,输出包含坐标框和阅读顺序的结构化 HTML 代码,其中数学公式以 HTML math 标签输出,跨行跨列表格则被整理为标准 HTML 格式。而在多语言支持上,新模型在 91 种语言的测试中取得 87.2% 的综合通过率(中文通过率 82.5% ),并对残损文档与手写体进行深度优化。
在部署效率上, Surya OCR 2 支持两大推理后端。系统在英伟达 GPU 设备上运行 Docker 并启用 vLLM 后端,单张 RTX 5090 显卡能实现每秒 5.35 页的超高吞吐率。在苹果设备或普通 CPU 环境下,系统则通过 llama.cpp 载入 GGUF 格式,在 M1 电脑上实现完全的本地端侧运行。目前,新模型的源代码基于 Apache 2.0 协议开源,权重基于 OpenRAIL-M 协议免费提供给个人、高校及年收入 500 万美元以下的初创企业。而 Datalab 官方也同步开放了搭载更强 40 亿参数 Chandra 2 模型的付费 API ,并赠送 5 美元体验额度。
信源:https://datalab.to/blog/surya-2
马斯克辟谣:SpaceX与Anthropic为180天短租且随时可收回算力
针对外部分析师关于 SpaceX 将以 3 年 450 亿美元天价把 Colossus 集群租给 Anthropic 的传闻,SpaceX 创始人埃隆·马斯克(Elon Musk)做出紧急澄清。马斯克明确表示,SpaceX 并未向 Anthropic 做出长达数年的算力租赁承诺。目前的合作本质上是一项仅有 180 天的短期租赁协议,到期后任何一方只需提前 90 天书面通知,即可随时无条件终止合同。
马斯克强调,锁定短期合同并非 Anthropic 的本意,而是 SpaceX 方面的强硬要求。在当前全球前沿大模型竞争与算力吃紧的背景下,SpaceX 必须保留随时收回计算资源的绝对主导权。如果未来内部算力需求变得极其紧张,SpaceX 将毫不犹豫地收回集群。虽然他表示不会让 Anthropic 陷入绝境、会提供合理的过渡缓冲期,但退租的主动权完全由 SpaceX 掌控。
招股书披露的月付租金方案曾被外部分析师解读为 SpaceX 转型算力托管服务(CaaS)并成功挖到「三年 450 亿美元印钞机」的铁证。然而,马斯克的最新表态表明,算力所有权在当前人工智能决战阶段属于不可让渡的战略主权,SpaceX 不会允许自身沦为被竞争对手长期锁死的底层硬件代工厂。
信源:https://x.com/elonmusk/status/2057228707606196434
针对外部分析师关于 SpaceX 将以 3 年 450 亿美元天价把 Colossus 集群租给 Anthropic 的传闻,SpaceX 创始人埃隆·马斯克(Elon Musk)做出紧急澄清。马斯克明确表示,SpaceX 并未向 Anthropic 做出长达数年的算力租赁承诺。目前的合作本质上是一项仅有 180 天的短期租赁协议,到期后任何一方只需提前 90 天书面通知,即可随时无条件终止合同。
马斯克强调,锁定短期合同并非 Anthropic 的本意,而是 SpaceX 方面的强硬要求。在当前全球前沿大模型竞争与算力吃紧的背景下,SpaceX 必须保留随时收回计算资源的绝对主导权。如果未来内部算力需求变得极其紧张,SpaceX 将毫不犹豫地收回集群。虽然他表示不会让 Anthropic 陷入绝境、会提供合理的过渡缓冲期,但退租的主动权完全由 SpaceX 掌控。
招股书披露的月付租金方案曾被外部分析师解读为 SpaceX 转型算力托管服务(CaaS)并成功挖到「三年 450 亿美元印钞机」的铁证。然而,马斯克的最新表态表明,算力所有权在当前人工智能决战阶段属于不可让渡的战略主权,SpaceX 不会允许自身沦为被竞争对手长期锁死的底层硬件代工厂。
信源:https://x.com/elonmusk/status/2057228707606196434
LangSmith推出Context Hub,联合MongoDB等制定智能体开源内存标准
LangChain 宣布在旗下开发平台 LangSmith 中上线 Context Hub 模块,为大模型智能体提供版本控制、协同编辑与环境隔离的上下文中央文件库。创始人 Harrison Chase 表示,新模块不仅支持 AGENTS.md 与 Skills 规则文件的直接导入,还能作为虚拟文件系统无缝接入 Deep Agents 运行环境,避免智能体因配置漂移或指令过期而运行失效。
传统的智能体开发中,工程团队通常将智能体控制代码保存在 GitHub 仓库中,而控制智能体行为的行为说明、专业知识与工作流政策则经常散落在各处,缺乏严谨的版本控制。由于上下文规则往往需要产品经理、市场人员或客服主管等非技术人员协同修改,直接使用代码仓库极易增加跨团队协作摩擦。Context Hub 通过提供免代码的网页端编辑器与内置的 Commit 历史树,将人类的配置迭代与智能体在运行中的自我更新进行统一管理,允许团队通过 dev 、 staging 与 prod 等环境标签将已验证的上下文一键推送至不同生产阶段。
除了推出管理工具, LangChain 还宣布正在与 Elastic 、 MongoDB 、 Pinecone 和 Redis 联合制定智能体内存开放标准。合作旨在打破不同智能体框架、数据库与检索系统之间的壁垒,为多模态智能体探索一条包含片段记忆、语义搜索与规程指令的通用数据读写接口。MongoDB 首席产品官 Pablo Stern-Plaza 指出,智能体环境需要极高响应速度的动态 Schema 与精细检索,开放标准将为生成式智能体的工程落地提供可移植、高复现的内存参考架构。
信源:https://x.com/hwchase17/status/2059687279199924462
LangChain 宣布在旗下开发平台 LangSmith 中上线 Context Hub 模块,为大模型智能体提供版本控制、协同编辑与环境隔离的上下文中央文件库。创始人 Harrison Chase 表示,新模块不仅支持 AGENTS.md 与 Skills 规则文件的直接导入,还能作为虚拟文件系统无缝接入 Deep Agents 运行环境,避免智能体因配置漂移或指令过期而运行失效。
传统的智能体开发中,工程团队通常将智能体控制代码保存在 GitHub 仓库中,而控制智能体行为的行为说明、专业知识与工作流政策则经常散落在各处,缺乏严谨的版本控制。由于上下文规则往往需要产品经理、市场人员或客服主管等非技术人员协同修改,直接使用代码仓库极易增加跨团队协作摩擦。Context Hub 通过提供免代码的网页端编辑器与内置的 Commit 历史树,将人类的配置迭代与智能体在运行中的自我更新进行统一管理,允许团队通过 dev 、 staging 与 prod 等环境标签将已验证的上下文一键推送至不同生产阶段。
除了推出管理工具, LangChain 还宣布正在与 Elastic 、 MongoDB 、 Pinecone 和 Redis 联合制定智能体内存开放标准。合作旨在打破不同智能体框架、数据库与检索系统之间的壁垒,为多模态智能体探索一条包含片段记忆、语义搜索与规程指令的通用数据读写接口。MongoDB 首席产品官 Pablo Stern-Plaza 指出,智能体环境需要极高响应速度的动态 Schema 与精细检索,开放标准将为生成式智能体的工程落地提供可移植、高复现的内存参考架构。
信源:https://x.com/hwchase17/status/2059687279199924462
X (formerly Twitter)
Harrison Chase (@hwchase17) on X
We launched Context Hub as a way to manage skills, AGENTS.md files, and other context files an agent might need
You can easily use it as a virtual filesystem in deepagents
See this video for more info!
You can easily use it as a virtual filesystem in deepagents
See this video for more info!
合格税单比例由25%飙升至86%,OpenAI联手Thrive打造自演进税收智能体
OpenAI 联合传统业务数字化改造平台 Thrive Holdings 宣布,已为旗下拥有 30 多家会计师事务所网络的 Crete 专业联盟研发出具备自适应演进能力的税收智能体(Tax AI)。在运行机制上,会计师日常报税时的改错行为会被系统自动转化为测试用例,随后由 Codex 模型针对测试自动生成代码补丁,并以合并请求(PR)形式提交给程序员复核。「会计师提错、 AI 写补丁、程序员把关」的闭环设计,将以往漫长的软件修 Bug 周期压缩至秒级,在保障高合规安全红线的同时实现了智能体的快速自主演进。
在试点项目中,智能体共处理了 7000 份 1040 和 1041 类型的复杂税单。部署 6 周后,能够让正确字段填报率达到 75% 门槛的税单比例,从初期的 25% 飙升至 86%,系统最高字段填报准确率则达到 97%。在实际报税业务中,系统帮助会计师平均节省了约三分之一的税单准备时间,整体业务吞吐量提升了约 50%。
合作始于 2025 年 12 月 OpenAI 对 Thrive Holdings 的股权投资。与大模型厂商主导常规技术输出的传统模式不同,协议明确规定,由合作产出的所有税收智能体相关知识产权(IP)及最终产品均归属数字化改造平台 Thrive Holdings 所有,OpenAI 则直接派遣工程师参与联合开发。独特的 IP 隔离模式保障了垂直领域企业在 AI 转型中的技术与产品主权。
信源:https://openai.com/index/building-self-improving-tax-agents-with-codex/
OpenAI 联合传统业务数字化改造平台 Thrive Holdings 宣布,已为旗下拥有 30 多家会计师事务所网络的 Crete 专业联盟研发出具备自适应演进能力的税收智能体(Tax AI)。在运行机制上,会计师日常报税时的改错行为会被系统自动转化为测试用例,随后由 Codex 模型针对测试自动生成代码补丁,并以合并请求(PR)形式提交给程序员复核。「会计师提错、 AI 写补丁、程序员把关」的闭环设计,将以往漫长的软件修 Bug 周期压缩至秒级,在保障高合规安全红线的同时实现了智能体的快速自主演进。
在试点项目中,智能体共处理了 7000 份 1040 和 1041 类型的复杂税单。部署 6 周后,能够让正确字段填报率达到 75% 门槛的税单比例,从初期的 25% 飙升至 86%,系统最高字段填报准确率则达到 97%。在实际报税业务中,系统帮助会计师平均节省了约三分之一的税单准备时间,整体业务吞吐量提升了约 50%。
合作始于 2025 年 12 月 OpenAI 对 Thrive Holdings 的股权投资。与大模型厂商主导常规技术输出的传统模式不同,协议明确规定,由合作产出的所有税收智能体相关知识产权(IP)及最终产品均归属数字化改造平台 Thrive Holdings 所有,OpenAI 则直接派遣工程师参与联合开发。独特的 IP 隔离模式保障了垂直领域企业在 AI 转型中的技术与产品主权。
信源:https://openai.com/index/building-self-improving-tax-agents-with-codex/
OpenAI
Building self-improving tax agents with Codex
See how OpenAI, Thrive, and Crete built a self-improving tax agent with Codex, automating filings, improving accuracy, and accelerating workflows.
LlamaIndex重构推出LiteParse v2.0,纯Rust核心提速达100倍
LlamaIndex 宣布将开源文档解析库 LiteParse 彻底用 Rust 重写,发布 2.0 版本。重构后的核心解析器在处理小文档时速度提升达 100 倍,解析大文档也有近 3 倍的提速。重构旨在为 AI 智能体与检索增强生成 RAG 管道提供本地运行、极速且无需调用大模型的空间版面解析底座。
LiteParse 2.0 保持了无大模型依赖的本地化运行设计,集成 PDFium 深度定制分支进行空间版面分析,并结合 tesseract-rs 库在本地实现光学字符识别 OCR 功能。工具目前支持 PDF 与包括 DOCX 、 XLSX 以及 PPTX 在内的 Office 文档。解析器将文本按文档布局进行二维空间投影,输出保留位置与版面相对关系的结构化文本,以极低功耗为大模型提供高保真定位与引用前情。
在生态接入与分发上, LlamaIndex 提供了跨主流运行时的原生包支持。开发者可以通过 Python 的 pip install liteparse 、 JavaScript 的 npm i @llamaindex/liteparse 、 Rust 的 Cargo 仓库快速接入开发流程。得益于底层采用 Rust 构建,新版本通过编译为 WebAssembly 格式,打通了浏览器端与边缘计算节点的本地运行能力。需要指出的是,由于运行环境受限,在 WebAssembly 环境下的 OCR 功能并非内置,开发者需要通过外部回调注入(如调用 tesseract.js )实现文件扫描。
信源:https://www.llamaindex.ai/blog/liteparse-v2-0-runs-everywhere
LlamaIndex 宣布将开源文档解析库 LiteParse 彻底用 Rust 重写,发布 2.0 版本。重构后的核心解析器在处理小文档时速度提升达 100 倍,解析大文档也有近 3 倍的提速。重构旨在为 AI 智能体与检索增强生成 RAG 管道提供本地运行、极速且无需调用大模型的空间版面解析底座。
LiteParse 2.0 保持了无大模型依赖的本地化运行设计,集成 PDFium 深度定制分支进行空间版面分析,并结合 tesseract-rs 库在本地实现光学字符识别 OCR 功能。工具目前支持 PDF 与包括 DOCX 、 XLSX 以及 PPTX 在内的 Office 文档。解析器将文本按文档布局进行二维空间投影,输出保留位置与版面相对关系的结构化文本,以极低功耗为大模型提供高保真定位与引用前情。
在生态接入与分发上, LlamaIndex 提供了跨主流运行时的原生包支持。开发者可以通过 Python 的 pip install liteparse 、 JavaScript 的 npm i @llamaindex/liteparse 、 Rust 的 Cargo 仓库快速接入开发流程。得益于底层采用 Rust 构建,新版本通过编译为 WebAssembly 格式,打通了浏览器端与边缘计算节点的本地运行能力。需要指出的是,由于运行环境受限,在 WebAssembly 环境下的 OCR 功能并非内置,开发者需要通过外部回调注入(如调用 tesseract.js )实现文件扫描。
信源:https://www.llamaindex.ai/blog/liteparse-v2-0-runs-everywhere
www.llamaindex.ai
Up to 100x Fast Parsing with LiteParse v2.0 and Rust
We rewrote LiteParse with Rust to make it up to 100x faster and run anywhere, including Python, Node/JS, WASM, Rust, and Edge runtimes.
宛如心理治疗,彭博社揭秘Anthropic如坐针毡的文化面试细节
彭博社报道,生成式人工智能巨头 Anthropic 正在实施极具行业争议且难度极高的面试流程,严禁求职者使用人工智能工具作弊,并引入了被称为「心理诊疗式」的文化面试。
伴随员工规模在近半年内快速扩张,首席执行官 Dario Amodei 透露自己要花近 1/3 到 40% 的时间在文化建设上。这场文化面试评分具有一票否决权,核心目的在于筛选出高度契合安全使命、具备独立思考能力的求职者。
候选人需通过高达 5 轮的严格筛选,包含签署保密协议(NDA)。在面试中,除获明确授权外,严禁使用大语言模型辅助。在淘汰率极高的文化面试中,面试官会采取快速问答的连续施压方式以获取评估信号,甚至在回答不再有增量信息时直接打断。部分候选人透露,面试官在提问时没有任何面部表情或反馈,给求职者带来巨大的心理压力。
面试最核心的关卡在于考核候选人的价值观与对人工智能毁灭性威胁前沿的认知。面试官会抛出经典的职业道德困境,盘问候选人在冲突瞬间的情绪感受、应对举措及事后反思,旨在评估求职者真实的道德挣扎。另外,候选人还需回答「自己坚守过哪些不同寻常的信念,如何在处境困难时捍卫自身信念」。
总裁 Daniela Amodei 指出,面试不需要求职者拥护某套固定教条,而是考核能不能和意见不同的人理性讨论。 公司想要敢于质疑决策并保持独立思考的人,而不是一味奉迎的应声虫。
信源:https://www.bloomberg.com/news/features/2026-05-28/anthropic-job-recruiting-brings-in-diverse-careers-to-build-claude
彭博社报道,生成式人工智能巨头 Anthropic 正在实施极具行业争议且难度极高的面试流程,严禁求职者使用人工智能工具作弊,并引入了被称为「心理诊疗式」的文化面试。
伴随员工规模在近半年内快速扩张,首席执行官 Dario Amodei 透露自己要花近 1/3 到 40% 的时间在文化建设上。这场文化面试评分具有一票否决权,核心目的在于筛选出高度契合安全使命、具备独立思考能力的求职者。
候选人需通过高达 5 轮的严格筛选,包含签署保密协议(NDA)。在面试中,除获明确授权外,严禁使用大语言模型辅助。在淘汰率极高的文化面试中,面试官会采取快速问答的连续施压方式以获取评估信号,甚至在回答不再有增量信息时直接打断。部分候选人透露,面试官在提问时没有任何面部表情或反馈,给求职者带来巨大的心理压力。
面试最核心的关卡在于考核候选人的价值观与对人工智能毁灭性威胁前沿的认知。面试官会抛出经典的职业道德困境,盘问候选人在冲突瞬间的情绪感受、应对举措及事后反思,旨在评估求职者真实的道德挣扎。另外,候选人还需回答「自己坚守过哪些不同寻常的信念,如何在处境困难时捍卫自身信念」。
总裁 Daniela Amodei 指出,面试不需要求职者拥护某套固定教条,而是考核能不能和意见不同的人理性讨论。 公司想要敢于质疑决策并保持独立思考的人,而不是一味奉迎的应声虫。
信源:https://www.bloomberg.com/news/features/2026-05-28/anthropic-job-recruiting-brings-in-diverse-careers-to-build-claude
Bloomberg.com
What It Takes to Get a Job at Anthropic
To win a coveted role, candidates shouldn’t outsource their thinking to AI — and should be prepared to talk about their worldview.
🤡1
ElevenLabs推出Music v2.0,支持局部重绘与结构化作曲,API价格降50%
ElevenLabs 发布新一代音乐生成模型 Music v2.0,全面升级人声合成、乐器伴奏及多语种编排品质。技术核心在于引入局部重绘与分段结构化作曲功能。创作者能够精准框选并重新生成音轨中的特定音频片段,无需更改其余部分;同时支持显式定义前奏、主歌、副歌及尾奏,解决了长音频生成中常见的布局坍塌与结构失真问题。
在声学表现上,新算法支持高密度歌词与快速说唱任务,并具备在单轨内无缝跨流派切换的能力(例如从歌剧瞬间转为重金属)。生成的音乐纯粹基于合规授权数据训练,拥有完整的商业使用权,免除了广告、视频与品牌内容创作者的同步授权费用及版权争议。
在商业落地与生态分发层面,Music v2.0 直接赋能三条主要产品线。面向独立音乐人的 ElevenMusic 平台支持在线试听与重混创作,面向品牌方的 ElevenCreative 订阅服务提供视频商用音乐下载,面向开发者的 ElevenAPI 则提供高并发音乐生成接口。伴随发布,ElevenLabs 宣布大幅调降定价,API 自助服务费率降幅达 50%,Creative 订阅资费则下调 40%。
信源:https://elevenlabs.io/blog/introducing-music-v2
ElevenLabs 发布新一代音乐生成模型 Music v2.0,全面升级人声合成、乐器伴奏及多语种编排品质。技术核心在于引入局部重绘与分段结构化作曲功能。创作者能够精准框选并重新生成音轨中的特定音频片段,无需更改其余部分;同时支持显式定义前奏、主歌、副歌及尾奏,解决了长音频生成中常见的布局坍塌与结构失真问题。
在声学表现上,新算法支持高密度歌词与快速说唱任务,并具备在单轨内无缝跨流派切换的能力(例如从歌剧瞬间转为重金属)。生成的音乐纯粹基于合规授权数据训练,拥有完整的商业使用权,免除了广告、视频与品牌内容创作者的同步授权费用及版权争议。
在商业落地与生态分发层面,Music v2.0 直接赋能三条主要产品线。面向独立音乐人的 ElevenMusic 平台支持在线试听与重混创作,面向品牌方的 ElevenCreative 订阅服务提供视频商用音乐下载,面向开发者的 ElevenAPI 则提供高并发音乐生成接口。伴随发布,ElevenLabs 宣布大幅调降定价,API 自助服务费率降幅达 50%,Creative 订阅资费则下调 40%。
信源:https://elevenlabs.io/blog/introducing-music-v2
ElevenLabs
Introducing Music v2, our groundbreaking new music model
Better vocals, instrumentation, and arrangement across every genre, improved multilingual support plus capabilities that weren't possible before.
英伟达发布Gamma-World,多智能体世界模型支持四人协作与实时24 FPS
英伟达联合清华大学、多伦多大学以及 Vector Institute 的研究人员发表多智能体生成式世界模型 Gamma-World ,打破了虚拟环境模拟长期局限于单人或双人互动的瓶颈。团队目前发布了项目页面与论文,代码与权重计划于近期开源。
模型引入了旋转位置编码的高维推广和信息中介标记两项机制,在保证多名玩家能被独立控制的同时,首次实现了在无需重新训练的前提下,直接从双玩家零样本推广至四玩家协作。
多玩家世界模型的首要挑战,在于让每个玩家保持独立控制且动作互不冲突。研究团队设计了单工旋转智能体编码( Simplex Rotary Agent Encoding ),将经典的旋转位置编码( RoPE )推向高维角度空间。新编码方式让所有玩家拥有完全等价的物理对称性,不再依赖固定的玩家编号,从而实现更自然的独立指代与操控。
为了防止玩家增多导致计算量呈二次方暴增,方案引入了稀疏中心注意力( Sparse Hub Attention )机制。系统通过可学习的中心标记传递交互信息,将玩家之间的注意力计算成本成功压缩至线性级别。
在生成速度上,团队将高延迟的扩散模型教师蒸馏为因果模型学生,配合键值缓存( KV Cache )实现了每秒 24 帧( 24 FPS )的实时动作响应输出。多人游戏环境的评测表明,新模型在视频画面逼真度、动作响应可控性以及玩家间一致性上,均明显优于传统的插槽式和密集注意力网络。
信源:https://research.nvidia.com/labs/sil/projects/gamma-world/
英伟达联合清华大学、多伦多大学以及 Vector Institute 的研究人员发表多智能体生成式世界模型 Gamma-World ,打破了虚拟环境模拟长期局限于单人或双人互动的瓶颈。团队目前发布了项目页面与论文,代码与权重计划于近期开源。
模型引入了旋转位置编码的高维推广和信息中介标记两项机制,在保证多名玩家能被独立控制的同时,首次实现了在无需重新训练的前提下,直接从双玩家零样本推广至四玩家协作。
多玩家世界模型的首要挑战,在于让每个玩家保持独立控制且动作互不冲突。研究团队设计了单工旋转智能体编码( Simplex Rotary Agent Encoding ),将经典的旋转位置编码( RoPE )推向高维角度空间。新编码方式让所有玩家拥有完全等价的物理对称性,不再依赖固定的玩家编号,从而实现更自然的独立指代与操控。
为了防止玩家增多导致计算量呈二次方暴增,方案引入了稀疏中心注意力( Sparse Hub Attention )机制。系统通过可学习的中心标记传递交互信息,将玩家之间的注意力计算成本成功压缩至线性级别。
在生成速度上,团队将高延迟的扩散模型教师蒸馏为因果模型学生,配合键值缓存( KV Cache )实现了每秒 24 帧( 24 FPS )的实时动作响应输出。多人游戏环境的评测表明,新模型在视频画面逼真度、动作响应可控性以及玩家间一致性上,均明显优于传统的插槽式和密集注意力网络。
信源:https://research.nvidia.com/labs/sil/projects/gamma-world/
Nvidia
γ-World: Generative Multi-Agent World Modeling Beyond Two Players
γ-World: A generative multi-agent world model for interactive simulation
ElevenLabs开源Speech Engine Skill,实现低延迟实时语音对话集成
语音 AI 独角兽 ElevenLabs 正式开源实时语音对话组件 Speech Engine Skill。Speech Engine Skill 遵循 Agent Skills 开放规范,旨在让 AI 智能体与大语言模型应用快速集成高保真、低延迟的语音交互能力。开发者仅需运行
Speech Engine Skill 基于高性能 WebSocket 连接构建,每个连接代表一个通话会话。用户开口说话时,浏览器捕获音频并流式传输给 ElevenLabs,ElevenLabs 实时完成语音转文字并将文本推送给开发者的服务器。服务器通过大语言模型生成流式文本响应,利用 SDK 的
为了简化前端开发,ElevenLabs 同步推出
信源:https://x.com/ElevenLabsDevs/status/2059646861913330031
语音 AI 独角兽 ElevenLabs 正式开源实时语音对话组件 Speech Engine Skill。Speech Engine Skill 遵循 Agent Skills 开放规范,旨在让 AI 智能体与大语言模型应用快速集成高保真、低延迟的语音交互能力。开发者仅需运行
npx skills add elevenlabs/skills 命令,即可把语音引擎添加到项目运行时中,无需对接多套 API 或构建复杂状态机。Speech Engine Skill 基于高性能 WebSocket 连接构建,每个连接代表一个通话会话。用户开口说话时,浏览器捕获音频并流式传输给 ElevenLabs,ElevenLabs 实时完成语音转文字并将文本推送给开发者的服务器。服务器通过大语言模型生成流式文本响应,利用 SDK 的
sendResponse() 或 send_response() 函数(支持字符串或异步迭代器)将响应传回,ElevenLabs 随后将其转换为低延迟合成语音在浏览器中播放。SDK 在后台管理网络路由、请求签名校验、心跳检测和会话生命周期,并原生支持插话打断与对话轮转。为了简化前端开发,ElevenLabs 同步推出
@elevenlabs/react 与 @elevenlabs/client 客户端库。前端页面仅需极少代码,配合服务器发放的安全会话凭证,即可快速拉起具备抗噪声与抗打断能力的数字语音助手。在实际部署中,ElevenLabs 建议将语音识别文本视为不可信输入,在服务端配置确定性的安全护栏或意图白名单校验,避免原始语音转写文本直接映射为大模型特权动作或敏感工具调用。信源:https://x.com/ElevenLabsDevs/status/2059646861913330031
X (formerly Twitter)
ElevenLabs Developers (@ElevenLabsDevs) on X
Introducing the Speech Engine Skill
Give any agent a voice without leaving your LLM stack. Speech Engine handles speech to text, turn-taking, interruptions, and text to speech, while your server streams the LLM response.
Install with
> npx skills add e…
Give any agent a voice without leaving your LLM stack. Speech Engine handles speech to text, turn-taking, interruptions, and text to speech, while your server streams the LLM response.
Install with
> npx skills add e…
IBM投资50亿启动Project Lightwell,调集两万工程师用AI守卫开源安全
IBM 联手旗下开源软件子公司红帽(Red Hat) 正式推出「Project Lightwell」计划,将投资 50 亿美元并调集超过 2 万名全职工程师,利用前沿人工智能技术建立安全清理机制,在大规模开源软件中识别并修复安全漏洞。目前,美国银行、摩根大通、维萨(Visa)、万事达卡(Mastercard)、富国银行和摩根士丹利已作为早期合作方接入平台。
以往红帽的安全工具主要局限于自身的系统环境。 Project Lightwell 将防护范围大幅向外扩展,覆盖包括人工智能框架、代码库以及分布式数据流平台 Apache Kafka 在内的更广泛开源技术生态。作为投入的一部分, 2 万名全职工程师全部来自 IBM 现有员工,将百分之百专注于漏洞识别与修复。
信源:https://www.axios.com/2026/05/28/ibm-ai-push-cyber-threats
IBM 联手旗下开源软件子公司红帽(Red Hat) 正式推出「Project Lightwell」计划,将投资 50 亿美元并调集超过 2 万名全职工程师,利用前沿人工智能技术建立安全清理机制,在大规模开源软件中识别并修复安全漏洞。目前,美国银行、摩根大通、维萨(Visa)、万事达卡(Mastercard)、富国银行和摩根士丹利已作为早期合作方接入平台。
以往红帽的安全工具主要局限于自身的系统环境。 Project Lightwell 将防护范围大幅向外扩展,覆盖包括人工智能框架、代码库以及分布式数据流平台 Apache Kafka 在内的更广泛开源技术生态。作为投入的一部分, 2 万名全职工程师全部来自 IBM 现有员工,将百分之百专注于漏洞识别与修复。
信源:https://www.axios.com/2026/05/28/ibm-ai-push-cyber-threats
Axios
Exclusive: IBM launches $5 billion AI push to combat cyber threats
IBM is investing $5 billion and deploying more than 20,000 engineers to help secure open source software.
中美AI衍生品竞速,上海期交所筹建Token期货
上海期货交易所正在筹划推出针对 AI Token(人工智能模型处理的最小信息单位)的期货合约,标志着中美两国在人工智能与金融衍生品领域竞争的进一步升级。与美国芝加哥商品交易所(CME)和洲际交易所(ICE)筹备中的 GPU 算力租赁期货不同,上海期交所的期货合约直接挂钩用于 AI 服务定价的 Token 消耗量,旨在为整个 AI 产业链提供对冲算力与推理成本的新型金融工具。
Token 期货的研究设计,旨在应对中国急剧膨胀的算力与 Token 消费需求。官方数据显示,自 2024 年初以来,中国每日的 Token 使用量已暴增 1000 倍,截至 2026 年 3 月底已突破 140 万亿个。同时,算力短缺在近期持续加剧,迫使多家国内大模型厂商对用户实施访问配额控制。为了加速构建算力现货与衍生品市场,官方商品指数公司已于 2025 年 12 月发布了多款算力指数,作为期货合约的底层标的基准。
学界与金融界专家指出,尽早推出 Token 期货对于中国在半导体和人工智能竞争中维系金融定价权至关重要。华东师范大学上海 AI 金融学院院长邵怡蕾强调,中美是全球仅有的两个具备大规模量产 AI 能力的国家,掌握 Token 定价权将在双边竞争中扮演关键角色。尽管有券商预测中国算力期货的落地仍需 3 至 5 年,且面临市场碎片化等现实障碍,但 Token 期货的提早筹备已向外界展示了中国构建主权 AI 金融生态的明确野心。
信源:https://www.reuters.com/world/china/china-works-ai-token-futures-market-sources-say-race-with-us-2026-05-28/
上海期货交易所正在筹划推出针对 AI Token(人工智能模型处理的最小信息单位)的期货合约,标志着中美两国在人工智能与金融衍生品领域竞争的进一步升级。与美国芝加哥商品交易所(CME)和洲际交易所(ICE)筹备中的 GPU 算力租赁期货不同,上海期交所的期货合约直接挂钩用于 AI 服务定价的 Token 消耗量,旨在为整个 AI 产业链提供对冲算力与推理成本的新型金融工具。
Token 期货的研究设计,旨在应对中国急剧膨胀的算力与 Token 消费需求。官方数据显示,自 2024 年初以来,中国每日的 Token 使用量已暴增 1000 倍,截至 2026 年 3 月底已突破 140 万亿个。同时,算力短缺在近期持续加剧,迫使多家国内大模型厂商对用户实施访问配额控制。为了加速构建算力现货与衍生品市场,官方商品指数公司已于 2025 年 12 月发布了多款算力指数,作为期货合约的底层标的基准。
学界与金融界专家指出,尽早推出 Token 期货对于中国在半导体和人工智能竞争中维系金融定价权至关重要。华东师范大学上海 AI 金融学院院长邵怡蕾强调,中美是全球仅有的两个具备大规模量产 AI 能力的国家,掌握 Token 定价权将在双边竞争中扮演关键角色。尽管有券商预测中国算力期货的落地仍需 3 至 5 年,且面临市场碎片化等现实障碍,但 Token 期货的提早筹备已向外界展示了中国构建主权 AI 金融生态的明确野心。
信源:https://www.reuters.com/world/china/china-works-ai-token-futures-market-sources-say-race-with-us-2026-05-28/
Perplexity开源推理底座pplx-garden,绕过英伟达网络税实现多卡极速通信
搜索引擎巨头 Perplexity AI 正式开源生产环境使用的高性能推理基础设施工具包 pplx-garden。项目核心是自研的 Rust 高性能点对点通信库 fabric-lib (又称 TransferEngine),旨在打破英伟达独家专属通信协议的硬件绑定,帮助开发者在无需购买昂贵专属网络交换机的前提下,实现万亿参数大模型在异构多显卡集群上的极速运行。
传统的分布式大模型推理极度依赖英伟达的专属高速通信网络,导致硬件部署成本极高且面临供应链锁死。 fabric-lib 实现了硬件层面的去绑定化,不仅完美适配 NVIDIA ConnectX-7 网卡,还原生支持亚马逊廉价的 AWS EFA 传统以太网卡,将多卡之间的网络带宽直接拉满至 400 Gbps 。针对 AWS EFA 乱序传输的物理缺陷, Perplexity 首创了 ImmCounter 计数器同步机制,在无需对数据包顺序做硬性假设的前提下,实现高效的「零拷贝」数据流转。通信库内置了专为混合专家模型 MoE 设计的数据分发算法,将显卡接收数据与矩阵计算深度重叠,极大地压榨了解码阶段的算力空间。
在实际生产中, pplx-garden 带来的工程效益极为显著。在解耦推理架构中,网络库实现了 Prefill 节点与 Decoder 节点之间键值缓存的极速调度。在异步强化学习训练中,仅需 1.3 秒即可完成万亿参数级模型的权重同步与下发。为解决分词阶段的计算延迟, pplx-garden 配套开源了用 Rust 重构的 pplx-unigram 分词器,将 CPU 消耗直降 5 至 6 倍,消除了重排与向量模型在分词阶段的性能瓶颈。
信源:https://github.com/perplexityai/pplx-garden
搜索引擎巨头 Perplexity AI 正式开源生产环境使用的高性能推理基础设施工具包 pplx-garden。项目核心是自研的 Rust 高性能点对点通信库 fabric-lib (又称 TransferEngine),旨在打破英伟达独家专属通信协议的硬件绑定,帮助开发者在无需购买昂贵专属网络交换机的前提下,实现万亿参数大模型在异构多显卡集群上的极速运行。
传统的分布式大模型推理极度依赖英伟达的专属高速通信网络,导致硬件部署成本极高且面临供应链锁死。 fabric-lib 实现了硬件层面的去绑定化,不仅完美适配 NVIDIA ConnectX-7 网卡,还原生支持亚马逊廉价的 AWS EFA 传统以太网卡,将多卡之间的网络带宽直接拉满至 400 Gbps 。针对 AWS EFA 乱序传输的物理缺陷, Perplexity 首创了 ImmCounter 计数器同步机制,在无需对数据包顺序做硬性假设的前提下,实现高效的「零拷贝」数据流转。通信库内置了专为混合专家模型 MoE 设计的数据分发算法,将显卡接收数据与矩阵计算深度重叠,极大地压榨了解码阶段的算力空间。
在实际生产中, pplx-garden 带来的工程效益极为显著。在解耦推理架构中,网络库实现了 Prefill 节点与 Decoder 节点之间键值缓存的极速调度。在异步强化学习训练中,仅需 1.3 秒即可完成万亿参数级模型的权重同步与下发。为解决分词阶段的计算延迟, pplx-garden 配套开源了用 Rust 重构的 pplx-unigram 分词器,将 CPU 消耗直降 5 至 6 倍,消除了重排与向量模型在分词阶段的性能瓶颈。
信源:https://github.com/perplexityai/pplx-garden
GitHub
GitHub - perplexityai/pplx-garden: Perplexity open source garden for inference technology
Perplexity open source garden for inference technology - perplexityai/pplx-garden
OpenAI发布安全MCP隧道,ChatGPT可安全「入驻」企业内网
OpenAI 推出安全 MCP 隧道(Secure MCP Tunnels),解决了企业在将内网私密数据安全接入大模型时面临的合规障碍。新方案允许企业在不公开 IP 地址或开放入站端口的前提下,将私有网络内的工具与数据库连接至 ChatGPT、Codex 以及 Responses API。以往企业为了让 AI 助手读取内网数据,必须在防火墙上开放入站通路,这在网络安全规范中属于极高风险的红线。新通道仅需在本地网络中运行开源客户端工具 tunnel-client,通过单向出站的 HTTPS 连接维持通信,云端模型便能在不暴露企业网络边界的前提下安全调用内网工具。
在安全管理上,新方案将控制权完整保留在企业手中。不同于容易造成全局泄漏的传统网络代理,客户端工具支持精细的「接口白名单」控制,企业可以限制大模型只在预设的具体数据与操作范围内进行调用,彻底杜绝了模型越权读取内网资产的风险。同时,隧道权限与 OpenAI 现有的工作区角色体系深度绑定,企业能通过官方平台对特定用户和运行时进行精准授权,并兼容企业级的出站代理、自定义 CA 证书以及控制面 mTLS 安全认证。
目前,开源客户端已支持 Kubernetes Sidecar、独立 Pod 以及系统服务等部署模式,并提供本地 Web 管理界面以展示健康度与连接指标。
信源:https://developers.openai.com/api/docs/guides/secure-mcp-tunnels
OpenAI 推出安全 MCP 隧道(Secure MCP Tunnels),解决了企业在将内网私密数据安全接入大模型时面临的合规障碍。新方案允许企业在不公开 IP 地址或开放入站端口的前提下,将私有网络内的工具与数据库连接至 ChatGPT、Codex 以及 Responses API。以往企业为了让 AI 助手读取内网数据,必须在防火墙上开放入站通路,这在网络安全规范中属于极高风险的红线。新通道仅需在本地网络中运行开源客户端工具 tunnel-client,通过单向出站的 HTTPS 连接维持通信,云端模型便能在不暴露企业网络边界的前提下安全调用内网工具。
在安全管理上,新方案将控制权完整保留在企业手中。不同于容易造成全局泄漏的传统网络代理,客户端工具支持精细的「接口白名单」控制,企业可以限制大模型只在预设的具体数据与操作范围内进行调用,彻底杜绝了模型越权读取内网资产的风险。同时,隧道权限与 OpenAI 现有的工作区角色体系深度绑定,企业能通过官方平台对特定用户和运行时进行精准授权,并兼容企业级的出站代理、自定义 CA 证书以及控制面 mTLS 安全认证。
目前,开源客户端已支持 Kubernetes Sidecar、独立 Pod 以及系统服务等部署模式,并提供本地 Web 管理界面以展示健康度与连接指标。
信源:https://developers.openai.com/api/docs/guides/secure-mcp-tunnels
OpenAI Developers
Secure MCP Tunnel | OpenAI API
Connect private or on-prem MCP servers to supported OpenAI products with an outbound-only MCP tunnel, without exposing them to the public internet.
QuarqLabs开源四层持久记忆智能体架构Quarq Agent,并宣布公司全面转向机器人基础设施
初创公司 QuarqLabs 开源其核心项目 Quarq Agent 的
Quarq Agent 创新性地提出了一套包含「查询、存储、推理、学习」的四层模块化长期记忆体系。在「查询层」,系统在后台将提问扩展为多视角检索假设,并结合本地 FAISS 向量与关键词进行混合搜索;在「存储层」,记忆被分类为语义(偏好与事实)、情景(事件历史)和程序(行为指令与格式规则)三类,前两者由本地向量库与 JSON 支撑,后者则由规则集独立维护;在「推理层」,系统通过严格区分事件与存储时间、隔离实体关联以及在信息不足时主动坦承缺失等显式护栏阻断幻觉;在「学习层」,系统在后台异步运行独立模型,完成记忆的增删、更新与去重合并,不增加交互延迟。
在生态与落地层面,Quarq Agent 专注于极简的本地化部署,内置了 Gmail、Google Calendar 以及 PDF 结构化报告生成等多项开箱即用技能,支持开发者通过 Python 脚本在
信源:https://x.com/quarqlabs/status/2059320863070286177
初创公司 QuarqLabs 开源其核心项目 Quarq Agent 的
v0.4.0 版本。该项目旨在为 AI 智能体提供「持续学习」的长期记忆架构,解决智能体容易遗忘、难以进行长跨度时间推理以及容易产生幻觉的痛点。同时,QuarqLabs 宣布其战略重心全面转向机器人基础设施(Robotics Infrastructure),该项目将被归档作为开源研究资产,公司不再提供主动维护。Quarq Agent 创新性地提出了一套包含「查询、存储、推理、学习」的四层模块化长期记忆体系。在「查询层」,系统在后台将提问扩展为多视角检索假设,并结合本地 FAISS 向量与关键词进行混合搜索;在「存储层」,记忆被分类为语义(偏好与事实)、情景(事件历史)和程序(行为指令与格式规则)三类,前两者由本地向量库与 JSON 支撑,后者则由规则集独立维护;在「推理层」,系统通过严格区分事件与存储时间、隔离实体关联以及在信息不足时主动坦承缺失等显式护栏阻断幻觉;在「学习层」,系统在后台异步运行独立模型,完成记忆的增删、更新与去重合并,不增加交互延迟。
在生态与落地层面,Quarq Agent 专注于极简的本地化部署,内置了 Gmail、Google Calendar 以及 PDF 结构化报告生成等多项开箱即用技能,支持开发者通过 Python 脚本在
tools 目录中动态扩展。作为完全开源且设计完备的「记忆优先(Memory-First)」智能体参考实现,为构建长期伴随式智能体提供了极高工程价值的底座。信源:https://x.com/quarqlabs/status/2059320863070286177
X (formerly Twitter)
Quarq (@quarqlabs) on X
We are open sourcing Quarq Agent
Sakana AI推出DiffusionBlocks,独立分块训练使显存降至B分之一
大模型训练一直面临着显存消耗巨大的难题。传统方法要求整个模型在反向传播中保持激活状态,显存需求随着模型层数变深而急剧攀升。为了降低开发门槛, Sakana AI 联合东京大学在 ICLR 2026 大会上推出了全新训练框架 DiffusionBlocks 。新框架将神经网络划分为多个模块,通过将分块更新重新解释为扩散模型的逆向去噪过程,实现各模块的独立训练。
分块训练彻底打破了显存随模型层数线性增长的瓶颈。在训练时,算法每次只需随机抽取一个区块进行加载与更新,非抽样区块无需载入显存或参与计算,使显存消耗直接降至原先的 B 分之一。多项实验表明,分块训练不仅显存极低,在视觉 Transformer 、 DiT 图像生成以及文本生成任务中均能匹配甚至超越传统的端到端训练效果。
针对循环深度模型( Looped Transformer ),新框架同样展现出独特的优化价值。循环深度模型通常依赖开销极高的跨时间步反向传播( BPTT )进行训练,而 DiffusionBlocks 通过模拟逐步逼近目标的动态过程,在训练阶段只需进行单次前向传播便可完成参数更新,并在推理时完全保留原有的 K 次迭代机制,大幅削减了训练阶段的计算开支。
信源:https://pub.sakana.ai/diffusionblocks/
大模型训练一直面临着显存消耗巨大的难题。传统方法要求整个模型在反向传播中保持激活状态,显存需求随着模型层数变深而急剧攀升。为了降低开发门槛, Sakana AI 联合东京大学在 ICLR 2026 大会上推出了全新训练框架 DiffusionBlocks 。新框架将神经网络划分为多个模块,通过将分块更新重新解释为扩散模型的逆向去噪过程,实现各模块的独立训练。
分块训练彻底打破了显存随模型层数线性增长的瓶颈。在训练时,算法每次只需随机抽取一个区块进行加载与更新,非抽样区块无需载入显存或参与计算,使显存消耗直接降至原先的 B 分之一。多项实验表明,分块训练不仅显存极低,在视觉 Transformer 、 DiT 图像生成以及文本生成任务中均能匹配甚至超越传统的端到端训练效果。
针对循环深度模型( Looped Transformer ),新框架同样展现出独特的优化价值。循环深度模型通常依赖开销极高的跨时间步反向传播( BPTT )进行训练,而 DiffusionBlocks 通过模拟逐步逼近目标的动态过程,在训练阶段只需进行单次前向传播便可完成参数更新,并在推理时完全保留原有的 K 次迭代机制,大幅削减了训练阶段的计算开支。
信源:https://pub.sakana.ai/diffusionblocks/
Sakana AI
DiffusionBlocks: Training Neural Networks One Block at a Time
DiffusionBlocks converts residual networks into independently trainable blocks via a diffusion interpretation, cutting training memory by B× while matching end-to-end performance.
内置通用向量嵌入并集成视频生成,OpenClaw发布v2026.5.27
开源 AI 助手项目 OpenClaw 发布了 v2026.5.27 版本,将支持本地与托管端点的 OpenAI 兼容向量嵌入( Embedding )服务收归为内置核心引擎,并废弃了原有的插件兼容注册模式。新版本还集成了 Pixverse 视频生成服务,支持 API 区域选择与外部插件封装,为智能体生态原生补齐了 AI 视频创作能力。同时,新版打通了 vLLM 深度思考( Thinking )参数对接,并允许直接路由裸直连的 Anthropic 模型标识符。
安全防御与通道交付方面,新版实施了更为严密的安全隔离。系统将群组 Prompt 文本完全隔离在系统 Prompt 之外以防范恶意提示词注入,并拦截了具有副作用的命令包装器与非安全的 Node 运行期环境变量覆盖。为防范未授权的 Tailscale 网络暴露,节点与设备角色审批权限已收归管理员。在即时通讯信道上, Telegram 消息发送机制变更为持久化投递队列,提升了跨网络波动的发送成功率。
信源:https://github.com/openclaw/openclaw/releases/tag/v2026.5.27
开源 AI 助手项目 OpenClaw 发布了 v2026.5.27 版本,将支持本地与托管端点的 OpenAI 兼容向量嵌入( Embedding )服务收归为内置核心引擎,并废弃了原有的插件兼容注册模式。新版本还集成了 Pixverse 视频生成服务,支持 API 区域选择与外部插件封装,为智能体生态原生补齐了 AI 视频创作能力。同时,新版打通了 vLLM 深度思考( Thinking )参数对接,并允许直接路由裸直连的 Anthropic 模型标识符。
安全防御与通道交付方面,新版实施了更为严密的安全隔离。系统将群组 Prompt 文本完全隔离在系统 Prompt 之外以防范恶意提示词注入,并拦截了具有副作用的命令包装器与非安全的 Node 运行期环境变量覆盖。为防范未授权的 Tailscale 网络暴露,节点与设备角色审批权限已收归管理员。在即时通讯信道上, Telegram 消息发送机制变更为持久化投递队列,提升了跨网络波动的发送成功率。
信源:https://github.com/openclaw/openclaw/releases/tag/v2026.5.27
GitHub
Release openclaw 2026.5.27 · openclaw/openclaw
Highlights
Stronger security and content boundaries: group prompt text is kept out of the system prompt, repeated-dot hostnames are normalized, side-effecting command wrappers and unsafe Node runt...
Stronger security and content boundaries: group prompt text is kept out of the system prompt, repeated-dot hostnames are normalized, side-effecting command wrappers and unsafe Node runt...