英伟达发布Gamma-World,多智能体世界模型支持四人协作与实时24 FPS
英伟达联合清华大学、多伦多大学以及 Vector Institute 的研究人员发表多智能体生成式世界模型 Gamma-World ,打破了虚拟环境模拟长期局限于单人或双人互动的瓶颈。团队目前发布了项目页面与论文,代码与权重计划于近期开源。
模型引入了旋转位置编码的高维推广和信息中介标记两项机制,在保证多名玩家能被独立控制的同时,首次实现了在无需重新训练的前提下,直接从双玩家零样本推广至四玩家协作。
多玩家世界模型的首要挑战,在于让每个玩家保持独立控制且动作互不冲突。研究团队设计了单工旋转智能体编码( Simplex Rotary Agent Encoding ),将经典的旋转位置编码( RoPE )推向高维角度空间。新编码方式让所有玩家拥有完全等价的物理对称性,不再依赖固定的玩家编号,从而实现更自然的独立指代与操控。
为了防止玩家增多导致计算量呈二次方暴增,方案引入了稀疏中心注意力( Sparse Hub Attention )机制。系统通过可学习的中心标记传递交互信息,将玩家之间的注意力计算成本成功压缩至线性级别。
在生成速度上,团队将高延迟的扩散模型教师蒸馏为因果模型学生,配合键值缓存( KV Cache )实现了每秒 24 帧( 24 FPS )的实时动作响应输出。多人游戏环境的评测表明,新模型在视频画面逼真度、动作响应可控性以及玩家间一致性上,均明显优于传统的插槽式和密集注意力网络。
信源:https://research.nvidia.com/labs/sil/projects/gamma-world/
英伟达联合清华大学、多伦多大学以及 Vector Institute 的研究人员发表多智能体生成式世界模型 Gamma-World ,打破了虚拟环境模拟长期局限于单人或双人互动的瓶颈。团队目前发布了项目页面与论文,代码与权重计划于近期开源。
模型引入了旋转位置编码的高维推广和信息中介标记两项机制,在保证多名玩家能被独立控制的同时,首次实现了在无需重新训练的前提下,直接从双玩家零样本推广至四玩家协作。
多玩家世界模型的首要挑战,在于让每个玩家保持独立控制且动作互不冲突。研究团队设计了单工旋转智能体编码( Simplex Rotary Agent Encoding ),将经典的旋转位置编码( RoPE )推向高维角度空间。新编码方式让所有玩家拥有完全等价的物理对称性,不再依赖固定的玩家编号,从而实现更自然的独立指代与操控。
为了防止玩家增多导致计算量呈二次方暴增,方案引入了稀疏中心注意力( Sparse Hub Attention )机制。系统通过可学习的中心标记传递交互信息,将玩家之间的注意力计算成本成功压缩至线性级别。
在生成速度上,团队将高延迟的扩散模型教师蒸馏为因果模型学生,配合键值缓存( KV Cache )实现了每秒 24 帧( 24 FPS )的实时动作响应输出。多人游戏环境的评测表明,新模型在视频画面逼真度、动作响应可控性以及玩家间一致性上,均明显优于传统的插槽式和密集注意力网络。
信源:https://research.nvidia.com/labs/sil/projects/gamma-world/
Nvidia
γ-World: Generative Multi-Agent World Modeling Beyond Two Players
γ-World: A generative multi-agent world model for interactive simulation
ElevenLabs开源Speech Engine Skill,实现低延迟实时语音对话集成
语音 AI 独角兽 ElevenLabs 正式开源实时语音对话组件 Speech Engine Skill。Speech Engine Skill 遵循 Agent Skills 开放规范,旨在让 AI 智能体与大语言模型应用快速集成高保真、低延迟的语音交互能力。开发者仅需运行
Speech Engine Skill 基于高性能 WebSocket 连接构建,每个连接代表一个通话会话。用户开口说话时,浏览器捕获音频并流式传输给 ElevenLabs,ElevenLabs 实时完成语音转文字并将文本推送给开发者的服务器。服务器通过大语言模型生成流式文本响应,利用 SDK 的
为了简化前端开发,ElevenLabs 同步推出
信源:https://x.com/ElevenLabsDevs/status/2059646861913330031
语音 AI 独角兽 ElevenLabs 正式开源实时语音对话组件 Speech Engine Skill。Speech Engine Skill 遵循 Agent Skills 开放规范,旨在让 AI 智能体与大语言模型应用快速集成高保真、低延迟的语音交互能力。开发者仅需运行
npx skills add elevenlabs/skills 命令,即可把语音引擎添加到项目运行时中,无需对接多套 API 或构建复杂状态机。Speech Engine Skill 基于高性能 WebSocket 连接构建,每个连接代表一个通话会话。用户开口说话时,浏览器捕获音频并流式传输给 ElevenLabs,ElevenLabs 实时完成语音转文字并将文本推送给开发者的服务器。服务器通过大语言模型生成流式文本响应,利用 SDK 的
sendResponse() 或 send_response() 函数(支持字符串或异步迭代器)将响应传回,ElevenLabs 随后将其转换为低延迟合成语音在浏览器中播放。SDK 在后台管理网络路由、请求签名校验、心跳检测和会话生命周期,并原生支持插话打断与对话轮转。为了简化前端开发,ElevenLabs 同步推出
@elevenlabs/react 与 @elevenlabs/client 客户端库。前端页面仅需极少代码,配合服务器发放的安全会话凭证,即可快速拉起具备抗噪声与抗打断能力的数字语音助手。在实际部署中,ElevenLabs 建议将语音识别文本视为不可信输入,在服务端配置确定性的安全护栏或意图白名单校验,避免原始语音转写文本直接映射为大模型特权动作或敏感工具调用。信源:https://x.com/ElevenLabsDevs/status/2059646861913330031
X (formerly Twitter)
ElevenLabs Developers (@ElevenLabsDevs) on X
Introducing the Speech Engine Skill
Give any agent a voice without leaving your LLM stack. Speech Engine handles speech to text, turn-taking, interruptions, and text to speech, while your server streams the LLM response.
Install with
> npx skills add e…
Give any agent a voice without leaving your LLM stack. Speech Engine handles speech to text, turn-taking, interruptions, and text to speech, while your server streams the LLM response.
Install with
> npx skills add e…
IBM投资50亿启动Project Lightwell,调集两万工程师用AI守卫开源安全
IBM 联手旗下开源软件子公司红帽(Red Hat) 正式推出「Project Lightwell」计划,将投资 50 亿美元并调集超过 2 万名全职工程师,利用前沿人工智能技术建立安全清理机制,在大规模开源软件中识别并修复安全漏洞。目前,美国银行、摩根大通、维萨(Visa)、万事达卡(Mastercard)、富国银行和摩根士丹利已作为早期合作方接入平台。
以往红帽的安全工具主要局限于自身的系统环境。 Project Lightwell 将防护范围大幅向外扩展,覆盖包括人工智能框架、代码库以及分布式数据流平台 Apache Kafka 在内的更广泛开源技术生态。作为投入的一部分, 2 万名全职工程师全部来自 IBM 现有员工,将百分之百专注于漏洞识别与修复。
信源:https://www.axios.com/2026/05/28/ibm-ai-push-cyber-threats
IBM 联手旗下开源软件子公司红帽(Red Hat) 正式推出「Project Lightwell」计划,将投资 50 亿美元并调集超过 2 万名全职工程师,利用前沿人工智能技术建立安全清理机制,在大规模开源软件中识别并修复安全漏洞。目前,美国银行、摩根大通、维萨(Visa)、万事达卡(Mastercard)、富国银行和摩根士丹利已作为早期合作方接入平台。
以往红帽的安全工具主要局限于自身的系统环境。 Project Lightwell 将防护范围大幅向外扩展,覆盖包括人工智能框架、代码库以及分布式数据流平台 Apache Kafka 在内的更广泛开源技术生态。作为投入的一部分, 2 万名全职工程师全部来自 IBM 现有员工,将百分之百专注于漏洞识别与修复。
信源:https://www.axios.com/2026/05/28/ibm-ai-push-cyber-threats
Axios
Exclusive: IBM launches $5 billion AI push to combat cyber threats
IBM is investing $5 billion and deploying more than 20,000 engineers to help secure open source software.
中美AI衍生品竞速,上海期交所筹建Token期货
上海期货交易所正在筹划推出针对 AI Token(人工智能模型处理的最小信息单位)的期货合约,标志着中美两国在人工智能与金融衍生品领域竞争的进一步升级。与美国芝加哥商品交易所(CME)和洲际交易所(ICE)筹备中的 GPU 算力租赁期货不同,上海期交所的期货合约直接挂钩用于 AI 服务定价的 Token 消耗量,旨在为整个 AI 产业链提供对冲算力与推理成本的新型金融工具。
Token 期货的研究设计,旨在应对中国急剧膨胀的算力与 Token 消费需求。官方数据显示,自 2024 年初以来,中国每日的 Token 使用量已暴增 1000 倍,截至 2026 年 3 月底已突破 140 万亿个。同时,算力短缺在近期持续加剧,迫使多家国内大模型厂商对用户实施访问配额控制。为了加速构建算力现货与衍生品市场,官方商品指数公司已于 2025 年 12 月发布了多款算力指数,作为期货合约的底层标的基准。
学界与金融界专家指出,尽早推出 Token 期货对于中国在半导体和人工智能竞争中维系金融定价权至关重要。华东师范大学上海 AI 金融学院院长邵怡蕾强调,中美是全球仅有的两个具备大规模量产 AI 能力的国家,掌握 Token 定价权将在双边竞争中扮演关键角色。尽管有券商预测中国算力期货的落地仍需 3 至 5 年,且面临市场碎片化等现实障碍,但 Token 期货的提早筹备已向外界展示了中国构建主权 AI 金融生态的明确野心。
信源:https://www.reuters.com/world/china/china-works-ai-token-futures-market-sources-say-race-with-us-2026-05-28/
上海期货交易所正在筹划推出针对 AI Token(人工智能模型处理的最小信息单位)的期货合约,标志着中美两国在人工智能与金融衍生品领域竞争的进一步升级。与美国芝加哥商品交易所(CME)和洲际交易所(ICE)筹备中的 GPU 算力租赁期货不同,上海期交所的期货合约直接挂钩用于 AI 服务定价的 Token 消耗量,旨在为整个 AI 产业链提供对冲算力与推理成本的新型金融工具。
Token 期货的研究设计,旨在应对中国急剧膨胀的算力与 Token 消费需求。官方数据显示,自 2024 年初以来,中国每日的 Token 使用量已暴增 1000 倍,截至 2026 年 3 月底已突破 140 万亿个。同时,算力短缺在近期持续加剧,迫使多家国内大模型厂商对用户实施访问配额控制。为了加速构建算力现货与衍生品市场,官方商品指数公司已于 2025 年 12 月发布了多款算力指数,作为期货合约的底层标的基准。
学界与金融界专家指出,尽早推出 Token 期货对于中国在半导体和人工智能竞争中维系金融定价权至关重要。华东师范大学上海 AI 金融学院院长邵怡蕾强调,中美是全球仅有的两个具备大规模量产 AI 能力的国家,掌握 Token 定价权将在双边竞争中扮演关键角色。尽管有券商预测中国算力期货的落地仍需 3 至 5 年,且面临市场碎片化等现实障碍,但 Token 期货的提早筹备已向外界展示了中国构建主权 AI 金融生态的明确野心。
信源:https://www.reuters.com/world/china/china-works-ai-token-futures-market-sources-say-race-with-us-2026-05-28/
Perplexity开源推理底座pplx-garden,绕过英伟达网络税实现多卡极速通信
搜索引擎巨头 Perplexity AI 正式开源生产环境使用的高性能推理基础设施工具包 pplx-garden。项目核心是自研的 Rust 高性能点对点通信库 fabric-lib (又称 TransferEngine),旨在打破英伟达独家专属通信协议的硬件绑定,帮助开发者在无需购买昂贵专属网络交换机的前提下,实现万亿参数大模型在异构多显卡集群上的极速运行。
传统的分布式大模型推理极度依赖英伟达的专属高速通信网络,导致硬件部署成本极高且面临供应链锁死。 fabric-lib 实现了硬件层面的去绑定化,不仅完美适配 NVIDIA ConnectX-7 网卡,还原生支持亚马逊廉价的 AWS EFA 传统以太网卡,将多卡之间的网络带宽直接拉满至 400 Gbps 。针对 AWS EFA 乱序传输的物理缺陷, Perplexity 首创了 ImmCounter 计数器同步机制,在无需对数据包顺序做硬性假设的前提下,实现高效的「零拷贝」数据流转。通信库内置了专为混合专家模型 MoE 设计的数据分发算法,将显卡接收数据与矩阵计算深度重叠,极大地压榨了解码阶段的算力空间。
在实际生产中, pplx-garden 带来的工程效益极为显著。在解耦推理架构中,网络库实现了 Prefill 节点与 Decoder 节点之间键值缓存的极速调度。在异步强化学习训练中,仅需 1.3 秒即可完成万亿参数级模型的权重同步与下发。为解决分词阶段的计算延迟, pplx-garden 配套开源了用 Rust 重构的 pplx-unigram 分词器,将 CPU 消耗直降 5 至 6 倍,消除了重排与向量模型在分词阶段的性能瓶颈。
信源:https://github.com/perplexityai/pplx-garden
搜索引擎巨头 Perplexity AI 正式开源生产环境使用的高性能推理基础设施工具包 pplx-garden。项目核心是自研的 Rust 高性能点对点通信库 fabric-lib (又称 TransferEngine),旨在打破英伟达独家专属通信协议的硬件绑定,帮助开发者在无需购买昂贵专属网络交换机的前提下,实现万亿参数大模型在异构多显卡集群上的极速运行。
传统的分布式大模型推理极度依赖英伟达的专属高速通信网络,导致硬件部署成本极高且面临供应链锁死。 fabric-lib 实现了硬件层面的去绑定化,不仅完美适配 NVIDIA ConnectX-7 网卡,还原生支持亚马逊廉价的 AWS EFA 传统以太网卡,将多卡之间的网络带宽直接拉满至 400 Gbps 。针对 AWS EFA 乱序传输的物理缺陷, Perplexity 首创了 ImmCounter 计数器同步机制,在无需对数据包顺序做硬性假设的前提下,实现高效的「零拷贝」数据流转。通信库内置了专为混合专家模型 MoE 设计的数据分发算法,将显卡接收数据与矩阵计算深度重叠,极大地压榨了解码阶段的算力空间。
在实际生产中, pplx-garden 带来的工程效益极为显著。在解耦推理架构中,网络库实现了 Prefill 节点与 Decoder 节点之间键值缓存的极速调度。在异步强化学习训练中,仅需 1.3 秒即可完成万亿参数级模型的权重同步与下发。为解决分词阶段的计算延迟, pplx-garden 配套开源了用 Rust 重构的 pplx-unigram 分词器,将 CPU 消耗直降 5 至 6 倍,消除了重排与向量模型在分词阶段的性能瓶颈。
信源:https://github.com/perplexityai/pplx-garden
GitHub
GitHub - perplexityai/pplx-garden: Perplexity open source garden for inference technology
Perplexity open source garden for inference technology - perplexityai/pplx-garden
OpenAI发布安全MCP隧道,ChatGPT可安全「入驻」企业内网
OpenAI 推出安全 MCP 隧道(Secure MCP Tunnels),解决了企业在将内网私密数据安全接入大模型时面临的合规障碍。新方案允许企业在不公开 IP 地址或开放入站端口的前提下,将私有网络内的工具与数据库连接至 ChatGPT、Codex 以及 Responses API。以往企业为了让 AI 助手读取内网数据,必须在防火墙上开放入站通路,这在网络安全规范中属于极高风险的红线。新通道仅需在本地网络中运行开源客户端工具 tunnel-client,通过单向出站的 HTTPS 连接维持通信,云端模型便能在不暴露企业网络边界的前提下安全调用内网工具。
在安全管理上,新方案将控制权完整保留在企业手中。不同于容易造成全局泄漏的传统网络代理,客户端工具支持精细的「接口白名单」控制,企业可以限制大模型只在预设的具体数据与操作范围内进行调用,彻底杜绝了模型越权读取内网资产的风险。同时,隧道权限与 OpenAI 现有的工作区角色体系深度绑定,企业能通过官方平台对特定用户和运行时进行精准授权,并兼容企业级的出站代理、自定义 CA 证书以及控制面 mTLS 安全认证。
目前,开源客户端已支持 Kubernetes Sidecar、独立 Pod 以及系统服务等部署模式,并提供本地 Web 管理界面以展示健康度与连接指标。
信源:https://developers.openai.com/api/docs/guides/secure-mcp-tunnels
OpenAI 推出安全 MCP 隧道(Secure MCP Tunnels),解决了企业在将内网私密数据安全接入大模型时面临的合规障碍。新方案允许企业在不公开 IP 地址或开放入站端口的前提下,将私有网络内的工具与数据库连接至 ChatGPT、Codex 以及 Responses API。以往企业为了让 AI 助手读取内网数据,必须在防火墙上开放入站通路,这在网络安全规范中属于极高风险的红线。新通道仅需在本地网络中运行开源客户端工具 tunnel-client,通过单向出站的 HTTPS 连接维持通信,云端模型便能在不暴露企业网络边界的前提下安全调用内网工具。
在安全管理上,新方案将控制权完整保留在企业手中。不同于容易造成全局泄漏的传统网络代理,客户端工具支持精细的「接口白名单」控制,企业可以限制大模型只在预设的具体数据与操作范围内进行调用,彻底杜绝了模型越权读取内网资产的风险。同时,隧道权限与 OpenAI 现有的工作区角色体系深度绑定,企业能通过官方平台对特定用户和运行时进行精准授权,并兼容企业级的出站代理、自定义 CA 证书以及控制面 mTLS 安全认证。
目前,开源客户端已支持 Kubernetes Sidecar、独立 Pod 以及系统服务等部署模式,并提供本地 Web 管理界面以展示健康度与连接指标。
信源:https://developers.openai.com/api/docs/guides/secure-mcp-tunnels
OpenAI Developers
Secure MCP Tunnel | OpenAI API
Connect private or on-prem MCP servers to supported OpenAI products with an outbound-only MCP tunnel, without exposing them to the public internet.
QuarqLabs开源四层持久记忆智能体架构Quarq Agent,并宣布公司全面转向机器人基础设施
初创公司 QuarqLabs 开源其核心项目 Quarq Agent 的
Quarq Agent 创新性地提出了一套包含「查询、存储、推理、学习」的四层模块化长期记忆体系。在「查询层」,系统在后台将提问扩展为多视角检索假设,并结合本地 FAISS 向量与关键词进行混合搜索;在「存储层」,记忆被分类为语义(偏好与事实)、情景(事件历史)和程序(行为指令与格式规则)三类,前两者由本地向量库与 JSON 支撑,后者则由规则集独立维护;在「推理层」,系统通过严格区分事件与存储时间、隔离实体关联以及在信息不足时主动坦承缺失等显式护栏阻断幻觉;在「学习层」,系统在后台异步运行独立模型,完成记忆的增删、更新与去重合并,不增加交互延迟。
在生态与落地层面,Quarq Agent 专注于极简的本地化部署,内置了 Gmail、Google Calendar 以及 PDF 结构化报告生成等多项开箱即用技能,支持开发者通过 Python 脚本在
信源:https://x.com/quarqlabs/status/2059320863070286177
初创公司 QuarqLabs 开源其核心项目 Quarq Agent 的
v0.4.0 版本。该项目旨在为 AI 智能体提供「持续学习」的长期记忆架构,解决智能体容易遗忘、难以进行长跨度时间推理以及容易产生幻觉的痛点。同时,QuarqLabs 宣布其战略重心全面转向机器人基础设施(Robotics Infrastructure),该项目将被归档作为开源研究资产,公司不再提供主动维护。Quarq Agent 创新性地提出了一套包含「查询、存储、推理、学习」的四层模块化长期记忆体系。在「查询层」,系统在后台将提问扩展为多视角检索假设,并结合本地 FAISS 向量与关键词进行混合搜索;在「存储层」,记忆被分类为语义(偏好与事实)、情景(事件历史)和程序(行为指令与格式规则)三类,前两者由本地向量库与 JSON 支撑,后者则由规则集独立维护;在「推理层」,系统通过严格区分事件与存储时间、隔离实体关联以及在信息不足时主动坦承缺失等显式护栏阻断幻觉;在「学习层」,系统在后台异步运行独立模型,完成记忆的增删、更新与去重合并,不增加交互延迟。
在生态与落地层面,Quarq Agent 专注于极简的本地化部署,内置了 Gmail、Google Calendar 以及 PDF 结构化报告生成等多项开箱即用技能,支持开发者通过 Python 脚本在
tools 目录中动态扩展。作为完全开源且设计完备的「记忆优先(Memory-First)」智能体参考实现,为构建长期伴随式智能体提供了极高工程价值的底座。信源:https://x.com/quarqlabs/status/2059320863070286177
X (formerly Twitter)
Quarq (@quarqlabs) on X
We are open sourcing Quarq Agent
Sakana AI推出DiffusionBlocks,独立分块训练使显存降至B分之一
大模型训练一直面临着显存消耗巨大的难题。传统方法要求整个模型在反向传播中保持激活状态,显存需求随着模型层数变深而急剧攀升。为了降低开发门槛, Sakana AI 联合东京大学在 ICLR 2026 大会上推出了全新训练框架 DiffusionBlocks 。新框架将神经网络划分为多个模块,通过将分块更新重新解释为扩散模型的逆向去噪过程,实现各模块的独立训练。
分块训练彻底打破了显存随模型层数线性增长的瓶颈。在训练时,算法每次只需随机抽取一个区块进行加载与更新,非抽样区块无需载入显存或参与计算,使显存消耗直接降至原先的 B 分之一。多项实验表明,分块训练不仅显存极低,在视觉 Transformer 、 DiT 图像生成以及文本生成任务中均能匹配甚至超越传统的端到端训练效果。
针对循环深度模型( Looped Transformer ),新框架同样展现出独特的优化价值。循环深度模型通常依赖开销极高的跨时间步反向传播( BPTT )进行训练,而 DiffusionBlocks 通过模拟逐步逼近目标的动态过程,在训练阶段只需进行单次前向传播便可完成参数更新,并在推理时完全保留原有的 K 次迭代机制,大幅削减了训练阶段的计算开支。
信源:https://pub.sakana.ai/diffusionblocks/
大模型训练一直面临着显存消耗巨大的难题。传统方法要求整个模型在反向传播中保持激活状态,显存需求随着模型层数变深而急剧攀升。为了降低开发门槛, Sakana AI 联合东京大学在 ICLR 2026 大会上推出了全新训练框架 DiffusionBlocks 。新框架将神经网络划分为多个模块,通过将分块更新重新解释为扩散模型的逆向去噪过程,实现各模块的独立训练。
分块训练彻底打破了显存随模型层数线性增长的瓶颈。在训练时,算法每次只需随机抽取一个区块进行加载与更新,非抽样区块无需载入显存或参与计算,使显存消耗直接降至原先的 B 分之一。多项实验表明,分块训练不仅显存极低,在视觉 Transformer 、 DiT 图像生成以及文本生成任务中均能匹配甚至超越传统的端到端训练效果。
针对循环深度模型( Looped Transformer ),新框架同样展现出独特的优化价值。循环深度模型通常依赖开销极高的跨时间步反向传播( BPTT )进行训练,而 DiffusionBlocks 通过模拟逐步逼近目标的动态过程,在训练阶段只需进行单次前向传播便可完成参数更新,并在推理时完全保留原有的 K 次迭代机制,大幅削减了训练阶段的计算开支。
信源:https://pub.sakana.ai/diffusionblocks/
Sakana AI
DiffusionBlocks: Training Neural Networks One Block at a Time
DiffusionBlocks converts residual networks into independently trainable blocks via a diffusion interpretation, cutting training memory by B× while matching end-to-end performance.
内置通用向量嵌入并集成视频生成,OpenClaw发布v2026.5.27
开源 AI 助手项目 OpenClaw 发布了 v2026.5.27 版本,将支持本地与托管端点的 OpenAI 兼容向量嵌入( Embedding )服务收归为内置核心引擎,并废弃了原有的插件兼容注册模式。新版本还集成了 Pixverse 视频生成服务,支持 API 区域选择与外部插件封装,为智能体生态原生补齐了 AI 视频创作能力。同时,新版打通了 vLLM 深度思考( Thinking )参数对接,并允许直接路由裸直连的 Anthropic 模型标识符。
安全防御与通道交付方面,新版实施了更为严密的安全隔离。系统将群组 Prompt 文本完全隔离在系统 Prompt 之外以防范恶意提示词注入,并拦截了具有副作用的命令包装器与非安全的 Node 运行期环境变量覆盖。为防范未授权的 Tailscale 网络暴露,节点与设备角色审批权限已收归管理员。在即时通讯信道上, Telegram 消息发送机制变更为持久化投递队列,提升了跨网络波动的发送成功率。
信源:https://github.com/openclaw/openclaw/releases/tag/v2026.5.27
开源 AI 助手项目 OpenClaw 发布了 v2026.5.27 版本,将支持本地与托管端点的 OpenAI 兼容向量嵌入( Embedding )服务收归为内置核心引擎,并废弃了原有的插件兼容注册模式。新版本还集成了 Pixverse 视频生成服务,支持 API 区域选择与外部插件封装,为智能体生态原生补齐了 AI 视频创作能力。同时,新版打通了 vLLM 深度思考( Thinking )参数对接,并允许直接路由裸直连的 Anthropic 模型标识符。
安全防御与通道交付方面,新版实施了更为严密的安全隔离。系统将群组 Prompt 文本完全隔离在系统 Prompt 之外以防范恶意提示词注入,并拦截了具有副作用的命令包装器与非安全的 Node 运行期环境变量覆盖。为防范未授权的 Tailscale 网络暴露,节点与设备角色审批权限已收归管理员。在即时通讯信道上, Telegram 消息发送机制变更为持久化投递队列,提升了跨网络波动的发送成功率。
信源:https://github.com/openclaw/openclaw/releases/tag/v2026.5.27
GitHub
Release openclaw 2026.5.27 · openclaw/openclaw
Highlights
Stronger security and content boundaries: group prompt text is kept out of the system prompt, repeated-dot hostnames are normalized, side-effecting command wrappers and unsafe Node runt...
Stronger security and content boundaries: group prompt text is kept out of the system prompt, repeated-dot hostnames are normalized, side-effecting command wrappers and unsafe Node runt...
Anthropic官宣H轮融资650亿美元,估值达9650亿美元,年化营收冲破470亿美元
Anthropic 官方宣布完成 H 轮融资,金额高达 650 亿美元,投后估值达到 9650 亿美元。本轮融资由 Altimeter Capital 、 Dragoneer 、 Greenoaks 以及 Sequoia 领投。大额资金的注入使这家大模型企业超越竞争对手 OpenAI ,成为全球估值最高的人工智能初创公司。
除了大规模的资本扩张,业务端的强劲增长也提供了关键支撑。就在本月上旬,年化营收运行率已经越过 470 亿美元大关。企业级客户的爆发式采购成为拉动营收的核心引擎,越来越多的机构将智能体部署在核心业务流程中。所得资金将主要用于推进前沿研究与扩展算力中心,以支撑全球用户对旗下 Claude 模型快速飙升的使用需求。
信源:https://www.anthropic.com/news/series-h-funding
Anthropic 官方宣布完成 H 轮融资,金额高达 650 亿美元,投后估值达到 9650 亿美元。本轮融资由 Altimeter Capital 、 Dragoneer 、 Greenoaks 以及 Sequoia 领投。大额资金的注入使这家大模型企业超越竞争对手 OpenAI ,成为全球估值最高的人工智能初创公司。
除了大规模的资本扩张,业务端的强劲增长也提供了关键支撑。就在本月上旬,年化营收运行率已经越过 470 亿美元大关。企业级客户的爆发式采购成为拉动营收的核心引擎,越来越多的机构将智能体部署在核心业务流程中。所得资金将主要用于推进前沿研究与扩展算力中心,以支撑全球用户对旗下 Claude 模型快速飙升的使用需求。
信源:https://www.anthropic.com/news/series-h-funding
Anthropic发布Opus 4.8,全面升级智能体编码与推理
Anthropic 宣布推出最新旗舰模型 Claude Opus 4.8。新模型在保留前代价格的同时,大幅精进了软件开发、智能体操作、复杂推理及知识工作的能力上限。网页端 claude.ai 同步上线「努力程度控制(Effort Control)」功能,允许用户手动调整特定任务的探索深度上限。
基准测试数据佐证了新模型的性能跨越。在软件开发基准 SWE-Bench Pro 评测中,Opus 4.8 取得 69.2% 的成绩,大幅超越前代(64.3%),并抛离竞争对手 GPT-5.5(58.6%)与 Gemini 3.1 Pro(54.2%)。多学科前沿推理测试
同步推出的「快速模式」将运行速度拉升至 2.5 倍,而 API 计费价格则降至前代的三分之一。早期测试反馈表明,Opus 4.8 能够主动标记输入或输出数据中的潜在瑕疵,在长会话中展现出极佳的自我纠错与长程协作能力,改善了开发环境的信噪比。
信源:https://www.anthropic.com/news/claude-opus-4-8
Anthropic 宣布推出最新旗舰模型 Claude Opus 4.8。新模型在保留前代价格的同时,大幅精进了软件开发、智能体操作、复杂推理及知识工作的能力上限。网页端 claude.ai 同步上线「努力程度控制(Effort Control)」功能,允许用户手动调整特定任务的探索深度上限。
基准测试数据佐证了新模型的性能跨越。在软件开发基准 SWE-Bench Pro 评测中,Opus 4.8 取得 69.2% 的成绩,大幅超越前代(64.3%),并抛离竞争对手 GPT-5.5(58.6%)与 Gemini 3.1 Pro(54.2%)。多学科前沿推理测试
Humanity's Last Exam 结果显示,新模型在工具辅助下得分飙升至 57.9%,无工具状态下为 49.8%,均居行业首位。另外,网络智能体测试 OSWorld-Verified 录得 83.4%,并在浏览器智能体测试 Online-Mind2Web 中以 84.0% 的成绩创下业界最高分。同步推出的「快速模式」将运行速度拉升至 2.5 倍,而 API 计费价格则降至前代的三分之一。早期测试反馈表明,Opus 4.8 能够主动标记输入或输出数据中的潜在瑕疵,在长会话中展现出极佳的自我纠错与长程协作能力,改善了开发环境的信噪比。
信源:https://www.anthropic.com/news/claude-opus-4-8
Anthropic
Introducing Claude Opus 4.8
Our latest model, Claude Opus 4.8, is an upgrade to our Opus class of models, with stronger performance across coding, agentic tasks, and professional work, and the consistency to handle long-running work.
原生协调数百并行子智能体,Claude Code上线动态工作流
Anthropic 宣布在终端编程智能体 Claude Code(含 CLI、Desktop 以及 VS Code 插件)中上线「动态工作流」的预览版。全新工作流专为全局性研发难题设计,旨在自主解决跨服务代码库的复杂 Bug 追踪、数百个文件的整体重构与框架迁移,以及上线前全方位的对抗性测试。开发团队指出,原本需要数个季度规划的大型迁移项目,如今能在数天内完成。
机制层面,动态工作流摒弃了传统的单线程模式。当用户发起长程任务时,主智能体会自主编写编排脚本,将目标拆解并分发给数十至数百个并行子智能体。在合并代码前,系统会指派独立子智能体进行多视角对抗测试,并引入两轮代码审查(Reviewer Agents),直至多方结果收敛。为支持长达数天甚至数周的持续运行,系统支持增量自动存档与断点续传。
Bun 创始人 Jarred Sumner 率先披露了极限重构实战。在短短 11 天内,动态工作流协助团队将 Bun 核心从 Zig 语言移植到 Rust 语言,生成近 75 万行 Rust 代码,且通过了原测试套件中 99.8% 的用例。目前,动态工作流已向 Max、Team 以及 API 用户默认开放。开发人员可通过在 effort 菜单中开启全新的
信源:https://claude.com/blog/introducing-dynamic-workflows-in-claude-code
Anthropic 宣布在终端编程智能体 Claude Code(含 CLI、Desktop 以及 VS Code 插件)中上线「动态工作流」的预览版。全新工作流专为全局性研发难题设计,旨在自主解决跨服务代码库的复杂 Bug 追踪、数百个文件的整体重构与框架迁移,以及上线前全方位的对抗性测试。开发团队指出,原本需要数个季度规划的大型迁移项目,如今能在数天内完成。
机制层面,动态工作流摒弃了传统的单线程模式。当用户发起长程任务时,主智能体会自主编写编排脚本,将目标拆解并分发给数十至数百个并行子智能体。在合并代码前,系统会指派独立子智能体进行多视角对抗测试,并引入两轮代码审查(Reviewer Agents),直至多方结果收敛。为支持长达数天甚至数周的持续运行,系统支持增量自动存档与断点续传。
Bun 创始人 Jarred Sumner 率先披露了极限重构实战。在短短 11 天内,动态工作流协助团队将 Bun 核心从 Zig 语言移植到 Rust 语言,生成近 75 万行 Rust 代码,且通过了原测试套件中 99.8% 的用例。目前,动态工作流已向 Max、Team 以及 API 用户默认开放。开发人员可通过在 effort 菜单中开启全新的
ultracode 设定以激活新特性,在新配置下 Claude Code 的努力程度会被拉满至极高,并由大模型自主裁决何时启动动态工作流。信源:https://claude.com/blog/introducing-dynamic-workflows-in-claude-code
安全机制取得关键突破,Anthropic最快数周内公开下一代Mythos级模型
Anthropic 在最新发布的旗舰模型 Claude Opus 4.8 官方公告中确认,开发团队在安全防御与保障机制上取得了突破性进展,预计最快将在未来几周内向所有客户推出拥有超旗舰智能的下一代 Mythos 级模型。而在五月二十二日发布的 Glasswing 软件安全项目报告中,研究团队曾强调,在开发出更强效的安全保障机制前不会向公众开放 Mythos 级模型。
作为拥有端到端攻破靶场等极强网络攻防实力的前沿模型,Mythos 级模型的公开化曾长期受制于「发现漏洞仅需数秒,修补漏洞需要数周」的严重攻防时间差。为防范模型被滥用并造成严重危害,Anthropic 团队目前正加速开发更强效的安全防御机制。同时,官方已开始向符合条件的安全团队定向提供扫描编排套件等工具,帮助防御侧建立不对称优势。
信源:https://www.anthropic.com/news/claude-opus-4-8
Anthropic 在最新发布的旗舰模型 Claude Opus 4.8 官方公告中确认,开发团队在安全防御与保障机制上取得了突破性进展,预计最快将在未来几周内向所有客户推出拥有超旗舰智能的下一代 Mythos 级模型。而在五月二十二日发布的 Glasswing 软件安全项目报告中,研究团队曾强调,在开发出更强效的安全保障机制前不会向公众开放 Mythos 级模型。
作为拥有端到端攻破靶场等极强网络攻防实力的前沿模型,Mythos 级模型的公开化曾长期受制于「发现漏洞仅需数秒,修补漏洞需要数周」的严重攻防时间差。为防范模型被滥用并造成严重危害,Anthropic 团队目前正加速开发更强效的安全防御机制。同时,官方已开始向符合条件的安全团队定向提供扫描编排套件等工具,帮助防御侧建立不对称优势。
信源:https://www.anthropic.com/news/claude-opus-4-8
阶跃开源Step 3.7 Flash,主打生产级Agent的多模态MoE模型
阶跃星辰正式发布并开源新一代 Flash 大模型 Step 3.7 Flash,系统优化了生产级 Agent、代码、联网搜索与多模态工作流。模型采用 Apache 2.0 协议开源,采用 196B 语言主干与 1.8B 视觉 Transformer(ViT)组成的稀疏 MoE 架构,总参数量达 198B,激活参数仅为 11B。在支持 256K 上下文与 3 档推理的同时,最高速度达 400 Tokens/s,并针对 Mac Studio M4 Max、DGX Spark 与 AMD AI Max + 395 等本地硬件进行了适配。
作为生产级 Agent 底座,Step 3.7 Flash 具备原生多模态理解与执行能力,可自主框选、裁剪并重读 UI 界面或图表,且在信息不确定时能主动检索验证。Step 3.7 Flash 在 ClawEval-1.1 自主任务执行评测中以 67.1% 夺冠,并在 SimpleVQA Search(79.2%)、V* Python(95.3%)与 SWE-Bench Pro(56.3%,位列全球第二)等测试中展现出极强的工程推理能力。在多工具协同与任务执行方面,模型在 Toolathlon 上达到 49.5%,在横跨 44 种职业的 GDPval 上达到 45.8%,并在 τ²-bench 通信全部难度测试中取得 98% 以上的通过率。
阶跃星辰针对 Claude Code、OpenClaw、KiloCode、RooCode、Hermes Agent 等框架与 MCP 协议深度兼容,同步开源 Hugging Face、ModelScope 接口与端侧 GGUF 版本,并与 OpenRouter、ZenMux 及 Fireworks AI 等平台完成适配。
信源:https://mp.weixin.qq.com/s/W1qyqwE19w-k4eKWRIEZuQ
阶跃星辰正式发布并开源新一代 Flash 大模型 Step 3.7 Flash,系统优化了生产级 Agent、代码、联网搜索与多模态工作流。模型采用 Apache 2.0 协议开源,采用 196B 语言主干与 1.8B 视觉 Transformer(ViT)组成的稀疏 MoE 架构,总参数量达 198B,激活参数仅为 11B。在支持 256K 上下文与 3 档推理的同时,最高速度达 400 Tokens/s,并针对 Mac Studio M4 Max、DGX Spark 与 AMD AI Max + 395 等本地硬件进行了适配。
作为生产级 Agent 底座,Step 3.7 Flash 具备原生多模态理解与执行能力,可自主框选、裁剪并重读 UI 界面或图表,且在信息不确定时能主动检索验证。Step 3.7 Flash 在 ClawEval-1.1 自主任务执行评测中以 67.1% 夺冠,并在 SimpleVQA Search(79.2%)、V* Python(95.3%)与 SWE-Bench Pro(56.3%,位列全球第二)等测试中展现出极强的工程推理能力。在多工具协同与任务执行方面,模型在 Toolathlon 上达到 49.5%,在横跨 44 种职业的 GDPval 上达到 45.8%,并在 τ²-bench 通信全部难度测试中取得 98% 以上的通过率。
阶跃星辰针对 Claude Code、OpenClaw、KiloCode、RooCode、Hermes Agent 等框架与 MCP 协议深度兼容,同步开源 Hugging Face、ModelScope 接口与端侧 GGUF 版本,并与 OpenRouter、ZenMux 及 Fireworks AI 等平台完成适配。
信源:https://mp.weixin.qq.com/s/W1qyqwE19w-k4eKWRIEZuQ
苹果重构Siri并端侧蒸馏Gemini,云端拟采用英伟达机密计算保障隐私
苹果计划在下月 WWDC 上确立端侧 AI 架构,将大模型与自研芯片深度绑定。针对基础任务,苹果正通过端侧蒸馏谷歌万亿参数级 Gemini,训练轻量模型以降低网络延迟;高复杂度推理任务则路由至云端处理。
为保障云端隐私,苹果批准在 Google Cloud 中采用 NVIDIA 机密计算技术对 GPU 处理的数据与模型加密。采用第三方云改变了苹果此前宣称的「所有非本地 AI 请求均在自研芯片服务器 Private Cloud Compute 中处理」的承诺,不过苹果仍将保留 Private Cloud Compute 品牌。同时,苹果正寻求收购专注于本地运行的初创公司,已将 Liquid AI 列为潜在收购对象。
系统层面的具体功能显示,iOS 27 将对 Siri 进行深度重构。Siri 将集成至 Dynamic Island,并提供全新的「Search or Ask」下拉界面。系统还将上线独立的 Siri 聊天应用以提供类似 Perplexity 的复杂工作流处理能力。此外,用户可以在「Extensions」设置中选择谷歌 Gemini、OpenAI 旗下 ChatGPT 或 Anthropic 旗下 Claude 等第三方智能体。
相机应用将新增专用 Siri 模式以取代「视觉智能」功能,支持用户拍摄物体并调用谷歌反向图像搜索,同时提供可自定义的快捷组件面板以供调整曝光、焦距与夜间模式。照片应用将引入「Extend」与「Reframe」等生成式 AI 工具。系统还包含语法检查、Image Playground 生成式壁纸,并针对折叠屏多任务进行底层优化。系统开发将侧重于漏洞修复与效率提升。
信源:https://www.bloomberg.com/news/features/2026-05-28/apple-ios-27-photos-screenshots-revamped-siri-pro-camera-app-new-ai-features
苹果计划在下月 WWDC 上确立端侧 AI 架构,将大模型与自研芯片深度绑定。针对基础任务,苹果正通过端侧蒸馏谷歌万亿参数级 Gemini,训练轻量模型以降低网络延迟;高复杂度推理任务则路由至云端处理。
为保障云端隐私,苹果批准在 Google Cloud 中采用 NVIDIA 机密计算技术对 GPU 处理的数据与模型加密。采用第三方云改变了苹果此前宣称的「所有非本地 AI 请求均在自研芯片服务器 Private Cloud Compute 中处理」的承诺,不过苹果仍将保留 Private Cloud Compute 品牌。同时,苹果正寻求收购专注于本地运行的初创公司,已将 Liquid AI 列为潜在收购对象。
系统层面的具体功能显示,iOS 27 将对 Siri 进行深度重构。Siri 将集成至 Dynamic Island,并提供全新的「Search or Ask」下拉界面。系统还将上线独立的 Siri 聊天应用以提供类似 Perplexity 的复杂工作流处理能力。此外,用户可以在「Extensions」设置中选择谷歌 Gemini、OpenAI 旗下 ChatGPT 或 Anthropic 旗下 Claude 等第三方智能体。
相机应用将新增专用 Siri 模式以取代「视觉智能」功能,支持用户拍摄物体并调用谷歌反向图像搜索,同时提供可自定义的快捷组件面板以供调整曝光、焦距与夜间模式。照片应用将引入「Extend」与「Reframe」等生成式 AI 工具。系统还包含语法检查、Image Playground 生成式壁纸,并针对折叠屏多任务进行底层优化。系统开发将侧重于漏洞修复与效率提升。
信源:https://www.bloomberg.com/news/features/2026-05-28/apple-ios-27-photos-screenshots-revamped-siri-pro-camera-app-new-ai-features
Ars Technica
Apple working to cram massive Gemini model into iPhone to power new Siri
As Apple tries to shrink Gemini for the iPhone, a cloud component is probably inevitable.
腾讯混元发布Hy-Memory:以六层双系统演化链架构打造Agent超强第二大脑
腾讯混元发布专为 OpenClaw 等长期协作型智能体设计的高效记忆插件 Hy-Memory。系统通过 6 层记忆框架、System 1 与 System 2 双系统及演化链设计,解决传统记忆系统在长周期协作中的记忆碎片化、注意力稀释和幻觉痛点,让 Agent 在跨天及跨会话运行时真正实现记得住、记得对、记得轻、更懂你。
技术架构上,Hy-Memory 摒弃单一向量表,首创六层记忆框架,将记忆精细划分为事实、画像、心智模型和前瞻意图。为兼顾响应速度与深度认知,系统复刻人脑双系统机制:实时响应的 System 1 毫秒级抽离 L1–L4 即时事实与会话摘要;后台运行的 System 2 则在秒至分钟级提炼 L5–L6 用户心智模型与知识网络,确保主对话零延迟。
针对用户偏好与事实的持续变动,系统引入演化链,通过 supersedes 指针将新旧记忆串联,检索时可自动展开整条链条。这既保证 Agent 获取最新结论,又完整保留了用户决策的因果路径(如从有氧跑步、HIIT 膝盖受伤到混合训练的完整演变),避免重复推荐已被否决的方案。
在长期记忆评测 LongMemEval 中,Hy-Memory 取得 85.2 的成绩,在偏好、时序推理和知识更新等演化指标上均领先;在长期真实对话评测 PersonaMem 中同样居首。性能方面,Hy-Memory 写入速度是 Graphiti 的 8 倍,记忆条数仅为 mem0 的 1/3、Graphiti 的 1/4 左右,单条记忆信息密度提升 45% 以上。在长上下文处理中,Token 消耗降低 35%,记忆更新速度提升 20%。
Hy-Memory 提供 Lite、Pro 和 Ultra 三档配置,支持一行命令集成。系统默认采用 Chroma 本地嵌入式向量库,无需部署 Qdrant 或 Docker 等外部服务,共用同一 SDK 支持无缝升级。
信源:https://mp.weixin.qq.com/s/dH5PGpxqArFZkSq3-QxWYA
腾讯混元发布专为 OpenClaw 等长期协作型智能体设计的高效记忆插件 Hy-Memory。系统通过 6 层记忆框架、System 1 与 System 2 双系统及演化链设计,解决传统记忆系统在长周期协作中的记忆碎片化、注意力稀释和幻觉痛点,让 Agent 在跨天及跨会话运行时真正实现记得住、记得对、记得轻、更懂你。
技术架构上,Hy-Memory 摒弃单一向量表,首创六层记忆框架,将记忆精细划分为事实、画像、心智模型和前瞻意图。为兼顾响应速度与深度认知,系统复刻人脑双系统机制:实时响应的 System 1 毫秒级抽离 L1–L4 即时事实与会话摘要;后台运行的 System 2 则在秒至分钟级提炼 L5–L6 用户心智模型与知识网络,确保主对话零延迟。
针对用户偏好与事实的持续变动,系统引入演化链,通过 supersedes 指针将新旧记忆串联,检索时可自动展开整条链条。这既保证 Agent 获取最新结论,又完整保留了用户决策的因果路径(如从有氧跑步、HIIT 膝盖受伤到混合训练的完整演变),避免重复推荐已被否决的方案。
在长期记忆评测 LongMemEval 中,Hy-Memory 取得 85.2 的成绩,在偏好、时序推理和知识更新等演化指标上均领先;在长期真实对话评测 PersonaMem 中同样居首。性能方面,Hy-Memory 写入速度是 Graphiti 的 8 倍,记忆条数仅为 mem0 的 1/3、Graphiti 的 1/4 左右,单条记忆信息密度提升 45% 以上。在长上下文处理中,Token 消耗降低 35%,记忆更新速度提升 20%。
Hy-Memory 提供 Lite、Pro 和 Ultra 三档配置,支持一行命令集成。系统默认采用 Chroma 本地嵌入式向量库,无需部署 Qdrant 或 Docker 等外部服务,共用同一 SDK 支持无缝升级。
信源:https://mp.weixin.qq.com/s/dH5PGpxqArFZkSq3-QxWYA
用1B激活参数跑本地思考,Liquid AI开源端侧MoE模型LFM2.5-8B-A1B
前沿端侧 AI 研发公司 Liquid AI 发布并开源了新一代端侧混合专家模型 LFM2.5-8B-A1B。新模型专为手机、电脑和机器人打造,虽然拥有 8B 总参数,但每次运行只需调用 1B 激活参数(Active 1B),运行极其轻快。发布采用 LFM 开放权重许可,支持在个人设备或单张消费级显卡上本地微调与离线运行。
另据《The Information》独家披露,正极力重回端侧路线的苹果已将 Liquid AI 列为潜在收购对象,以支撑后续 iOS 系统的本地离线智能服务。
作为主打本地运行的模型,LFM2.5-8B-A1B 已转型为「先思考、后回答」的纯推理模型,在给出最终答案前会先展示完整的思维链。得益于每次运行只需 1B 激活参数,推理时的思考成本极低,在不牺牲手机、电脑运行速度的前提下大幅提升了回答质量。一次性处理信息的容量从 32K 单词量飙升至 128K,相当于能轻松吞下一整本书或长篇开发代码。为了让非英语用户使用更顺畅,词表翻倍至 128K,使得处理泰语和印地语的效率分别提升了 238.2% 与 120.4%,阿拉伯语也获得了 38.8% 的效率提升。
针对本地小模型极其容易陷入的死循环毛病,Liquid 团队进行了专项优化,彻底让模型摆脱了在思考时反复倒退的「鬼打墙」现象。为了解决小模型经常胡言乱语的幻觉问题,开发人员在安全防线上加入靶向强化学习,让模型在遇到超出自身知识边界的问题时,能老老实实主动说「不知道」,使回答准确率(无幻觉率)从前代的 7.46% 跃升至 63.47%。在复杂任务和工具调用测试中,得分大幅领先竞品。生态上,LFM2.5-8B-A1B 首日兼容
信源:http://liquid.ai/blog/lfm2-5-8b-a1b
前沿端侧 AI 研发公司 Liquid AI 发布并开源了新一代端侧混合专家模型 LFM2.5-8B-A1B。新模型专为手机、电脑和机器人打造,虽然拥有 8B 总参数,但每次运行只需调用 1B 激活参数(Active 1B),运行极其轻快。发布采用 LFM 开放权重许可,支持在个人设备或单张消费级显卡上本地微调与离线运行。
另据《The Information》独家披露,正极力重回端侧路线的苹果已将 Liquid AI 列为潜在收购对象,以支撑后续 iOS 系统的本地离线智能服务。
作为主打本地运行的模型,LFM2.5-8B-A1B 已转型为「先思考、后回答」的纯推理模型,在给出最终答案前会先展示完整的思维链。得益于每次运行只需 1B 激活参数,推理时的思考成本极低,在不牺牲手机、电脑运行速度的前提下大幅提升了回答质量。一次性处理信息的容量从 32K 单词量飙升至 128K,相当于能轻松吞下一整本书或长篇开发代码。为了让非英语用户使用更顺畅,词表翻倍至 128K,使得处理泰语和印地语的效率分别提升了 238.2% 与 120.4%,阿拉伯语也获得了 38.8% 的效率提升。
针对本地小模型极其容易陷入的死循环毛病,Liquid 团队进行了专项优化,彻底让模型摆脱了在思考时反复倒退的「鬼打墙」现象。为了解决小模型经常胡言乱语的幻觉问题,开发人员在安全防线上加入靶向强化学习,让模型在遇到超出自身知识边界的问题时,能老老实实主动说「不知道」,使回答准确率(无幻觉率)从前代的 7.46% 跃升至 63.47%。在复杂任务和工具调用测试中,得分大幅领先竞品。生态上,LFM2.5-8B-A1B 首日兼容
llama.cpp`、`MLX 等主流本地运行框架,在苹果 M5 Max 电脑芯片上能跑到每秒 253 个词元的极致速度,即便是手机端也能流畅离线运行。信源:http://liquid.ai/blog/lfm2-5-8b-a1b
Liquid AI
LFM2.5-8B-A1B: An Even Better On-Device Mixture of Experts — Blog
Explore Liquid AI’s LFM2.5-8B-A1B, an on-device Mixture of Experts model with 128K context, fast tool calling, and strong AI benchmarks.
前苹果Vision Pro主管创立,世界模型公司Reactor融资5900万美元
由前 Apple Vision Pro 开发主管创立的世界模型公司 Reactor 正式宣布走出隐身模式,完成了高达 5900 万美元的种子轮与 A 轮融资。资金由光速创投(Lightspeed Venture Partners)领投,Amplify Partners、WndrCo、云九资本以及 FPV Ventures 参投。资金将主要用于加速世界模型基础设施的研发与全球化部署,帮助开发者在 10 行代码内,将前沿世界模型实时流式传输至应用程序中。
主流 AI 视频通常偏重生成速度,Reactor 则主攻交互速度与超低延迟,目标是将画面延迟压缩至 50 毫秒以内。通过提供统一的开发接口与工具包,开发者不用操心复杂的底层服务器架构,就能做出实时响应的交互式 AI 应用。画面像素、音频和物理动作均在眨眼间按需生成,不再需要预先渲染,这也为媒体娱乐、具身智能和机器人带来了实时反应的全新可能。
Reactor 的两位联合创始人背景亮眼:CEO Alberto Taiuti 曾是知名 3D 与视频生成工具 Luma AI 的联合创始人兼前 CTO,而 CTO Bryce Schmidtchen 曾与 Alberto 共同在苹果担任 Apple Vision Pro 的技术主管。过去半年来,团队吸引了来自苹果、Meta、谷歌、Luma AI、Netflix 和 Replicate 等顶尖机构的成员加入。
信源:https://x.com/reactorworld/status/2060015607928819876
由前 Apple Vision Pro 开发主管创立的世界模型公司 Reactor 正式宣布走出隐身模式,完成了高达 5900 万美元的种子轮与 A 轮融资。资金由光速创投(Lightspeed Venture Partners)领投,Amplify Partners、WndrCo、云九资本以及 FPV Ventures 参投。资金将主要用于加速世界模型基础设施的研发与全球化部署,帮助开发者在 10 行代码内,将前沿世界模型实时流式传输至应用程序中。
主流 AI 视频通常偏重生成速度,Reactor 则主攻交互速度与超低延迟,目标是将画面延迟压缩至 50 毫秒以内。通过提供统一的开发接口与工具包,开发者不用操心复杂的底层服务器架构,就能做出实时响应的交互式 AI 应用。画面像素、音频和物理动作均在眨眼间按需生成,不再需要预先渲染,这也为媒体娱乐、具身智能和机器人带来了实时反应的全新可能。
Reactor 的两位联合创始人背景亮眼:CEO Alberto Taiuti 曾是知名 3D 与视频生成工具 Luma AI 的联合创始人兼前 CTO,而 CTO Bryce Schmidtchen 曾与 Alberto 共同在苹果担任 Apple Vision Pro 的技术主管。过去半年来,团队吸引了来自苹果、Meta、谷歌、Luma AI、Netflix 和 Replicate 等顶尖机构的成员加入。
信源:https://x.com/reactorworld/status/2060015607928819876
X (formerly Twitter)
reactor (@reactorworld) on X
Today Reactor is coming out of stealth. We’ve raised $59M in Seed and Series A funding, led by @lightspeedvp, with participation from @AmplifyPartners, @wndrco, @Sky9Capital, and @FPVventures.
Reactor is the platform for building in the World Model era:…
Reactor is the platform for building in the World Model era:…
Hermes Agent发布v0.15.0,大幅瘦身代码并升级多智能体平台
NousResearch 团队正式发布开源智能体项目 Hermes Agent v0.15.0 版本。运行核心 run_agent.py 代码量从原先的 16083 行大幅精减 76% 至 3821 行,并完全重构为 14 个高内聚模块,消除了编辑器加载卡顿。在冷启动与搜索性能上,开发团队通过延迟引入 OpenAI 依赖包与优化高频函数调用,将 Termux 终端 cold-start 时间压缩至 0.8 秒, hermes --version 速度提升 63% 至 258 毫秒。重组后的会话搜索工具 session_search 摒弃了大模型调用,改用免配置的本地过滤,让搜索耗时缩短至 20 毫秒,实现了 4500 倍的提速与完全零成本运行。
看板工具升级为完整的多智能体协作平台。开发者只需输入 hermes kanban swarm 即可一键初始化包含协调者、并行工作者、独立校验与合成节点的 Swarm 工作流,并新增了单任务模型覆盖与定时启动支持。安全防御方面,新版本引入了针对 Brainworm 攻击的主动威胁防御,在工具输出、召回记忆与外部技能加载等三个关键卡口实施流量过滤与边界标记,防止智能体被恶意文件或网络服务夺取控制权。
生态系统与第三方集成也迎来深度升级。系统支持基于 Bitwarden 统一托管所有云端 API 密钥,上线了可单命令加载多技能的工具包,并新增了 Nous 官方 MCP 服务目录交互式安装面板。 xAI 生态整合新增了 xAI Web Search 网络搜索插件,在 hermes proxy 代理中打通了 Grok 专属执行引导,且 hermes doctor 诊断流程能对已线模型自动预警,支持一键热迁移。为了修复版本首发时的阻碍级故障,官方在数小时内紧急推出了 v0.15.1 补丁版本,彻底消除了面板在 loopback 模式下面临的 401 无限重载循环,同时修复了 Docker 容器内 npx 等裸命令路径解析失效、 Kanban 工作线程在 SIGTERM 信号下无法被正常终止等缺陷。
信源:https://github.com/NousResearch/hermes-agent/releases/tag/v2026.5.28
NousResearch 团队正式发布开源智能体项目 Hermes Agent v0.15.0 版本。运行核心 run_agent.py 代码量从原先的 16083 行大幅精减 76% 至 3821 行,并完全重构为 14 个高内聚模块,消除了编辑器加载卡顿。在冷启动与搜索性能上,开发团队通过延迟引入 OpenAI 依赖包与优化高频函数调用,将 Termux 终端 cold-start 时间压缩至 0.8 秒, hermes --version 速度提升 63% 至 258 毫秒。重组后的会话搜索工具 session_search 摒弃了大模型调用,改用免配置的本地过滤,让搜索耗时缩短至 20 毫秒,实现了 4500 倍的提速与完全零成本运行。
看板工具升级为完整的多智能体协作平台。开发者只需输入 hermes kanban swarm 即可一键初始化包含协调者、并行工作者、独立校验与合成节点的 Swarm 工作流,并新增了单任务模型覆盖与定时启动支持。安全防御方面,新版本引入了针对 Brainworm 攻击的主动威胁防御,在工具输出、召回记忆与外部技能加载等三个关键卡口实施流量过滤与边界标记,防止智能体被恶意文件或网络服务夺取控制权。
生态系统与第三方集成也迎来深度升级。系统支持基于 Bitwarden 统一托管所有云端 API 密钥,上线了可单命令加载多技能的工具包,并新增了 Nous 官方 MCP 服务目录交互式安装面板。 xAI 生态整合新增了 xAI Web Search 网络搜索插件,在 hermes proxy 代理中打通了 Grok 专属执行引导,且 hermes doctor 诊断流程能对已线模型自动预警,支持一键热迁移。为了修复版本首发时的阻碍级故障,官方在数小时内紧急推出了 v0.15.1 补丁版本,彻底消除了面板在 loopback 模式下面临的 401 无限重载循环,同时修复了 Docker 容器内 npx 等裸命令路径解析失效、 Kanban 工作线程在 SIGTERM 信号下无法被正常终止等缺陷。
信源:https://github.com/NousResearch/hermes-agent/releases/tag/v2026.5.28
GitHub
Release Hermes Agent v0.15.0 (2026.5.28) — The Velocity Release · NousResearch/hermes-agent
Hermes Agent v0.15.0 (v2026.5.28)
Release Date: May 28, 2026
Since v0.14.0: 1,302 commits · 747 merged PRs · 1,746 files changed · 282,712 insertions · 36,699 deletions · 560+ issues closed (15 P0,...
Release Date: May 28, 2026
Since v0.14.0: 1,302 commits · 747 merged PRs · 1,746 files changed · 282,712 insertions · 36,699 deletions · 560+ issues closed (15 P0,...
❤1
ChatGPT市占率降至六成,消费级AI步入三足鼎立时代
SimilarWeb 最新流量数据显示,消费级 AI 市场已正式告别 ChatGPT 的「一马当先」格局,步入由 OpenAI、Google 与 Anthropic 主导的三足鼎立时代。过去半年中,ChatGPT 的全球用户流量份额从 80% 大幅滑落至 60%。同时,Gemini 独立访客流量相对 ChatGPT 翻倍,比例从 20% 攀升至 50%,Claude 的相对比例则从 3% 激增至 20%。
在全球前 100 大网站中,Claude 上季度以 255% 的环比增速(升至全球第 36 位)成为增长最快的网站,而 DeepSeek 则以 105% 的增速位居第 78 位。结合官方活跃用户数据(ChatGPT 周活跃 900M,Gemini 月活跃 900M)换算表明,ChatGPT 网页与移动端周活跃(WAU)约 900M、月活跃(MAU)达 1.5B,Gemini 维持约 500M WAU 与 900M MAU,Claude 约 150M 至 200M WAU,以及 250M 至 300M MAU。
地缘分布显示,Gemini 在非英语地区的流量已追赶至 ChatGPT 的 65% 至 70%,包括印度、巴西、日本、印尼、韩国与越南,而 Claude 在中国市场录得了非常亮眼的增长。
信源:https://x.com/deedydas/status/2060013445291094348
SimilarWeb 最新流量数据显示,消费级 AI 市场已正式告别 ChatGPT 的「一马当先」格局,步入由 OpenAI、Google 与 Anthropic 主导的三足鼎立时代。过去半年中,ChatGPT 的全球用户流量份额从 80% 大幅滑落至 60%。同时,Gemini 独立访客流量相对 ChatGPT 翻倍,比例从 20% 攀升至 50%,Claude 的相对比例则从 3% 激增至 20%。
在全球前 100 大网站中,Claude 上季度以 255% 的环比增速(升至全球第 36 位)成为增长最快的网站,而 DeepSeek 则以 105% 的增速位居第 78 位。结合官方活跃用户数据(ChatGPT 周活跃 900M,Gemini 月活跃 900M)换算表明,ChatGPT 网页与移动端周活跃(WAU)约 900M、月活跃(MAU)达 1.5B,Gemini 维持约 500M WAU 与 900M MAU,Claude 约 150M 至 200M WAU,以及 250M 至 300M MAU。
地缘分布显示,Gemini 在非英语地区的流量已追赶至 ChatGPT 的 65% 至 70%,包括印度、巴西、日本、印尼、韩国与越南,而 Claude 在中国市场录得了非常亮眼的增长。
信源:https://x.com/deedydas/status/2060013445291094348
开源神作遭大厂「官方收割」?王牌插件OMO贴脸炮轰Anthropic、FactoryAI像素级抄袭其Agent编排架构
在 Anthropic 随 Opus 4.8 推出 Claude Code 动态工作流与 ultracode 模式仅数小时后,开源框架 OMO 团队在 X 上发起猛烈攻势,公开指责 Anthropic 像素级抄袭了其多模型编排架构。
OMO 作为 16.7 万星开源终端 Agent 项目 OpenCode 官方认定的 No.1 插件,由 23 岁韩国黑客 Q 开发,并由运营团队 Sisyphus Labs 宣发,目前已斩获 6 万星,在开发者社区极具声量。
这场风波直接撕开了大厂「先封杀、后吸收」的掠夺路径。今年 1 月,Q 在 OMO 中推出了用于多模型动态编排的 ultrawork 工作流以及负责合并审查的协调大脑 atlas。由于这套编排机制在运行多智能体递归循环时会吞噬天量 Token,被 OpenCode 联合创始人 Dax Raad 吐槽为「Token 燃烧器」,高能耗调用直接促使 Anthropic 在 4 月份痛下杀手,强行封禁了第三方客户端使用订阅额度的通道。
仅仅三个月后,Anthropic 官方就将这套已被开源验证的动态编排逻辑收编,化身为自家 Claude Code 的闭源收费主打功能。
除了死磕 Anthropic,OMO 团队与 FactoryAI 在今年 2 月也存在旧怨。FactoryAI 此前高调宣传的 Missions 多天自主任务流,被指直接搬运了 OMO 的三层 Agent 架构:OMO 的规划器 Prometheus 变成了 Factory 的计划审批流,协调大脑 Atlas 被改名包装为 orchestrator Droid,执行器 Sisyphus Junior 变成了 Worker Droid,甚至连原装的技能过滤机制都被简化挪用。
面对 OMO 团队晒出的历史开发记录,以及要求大厂公开致谢并承认原创贡献的喊话,两家大厂至今装聋作哑。开源团队则继续在推特上进行多维度反击。
一方面,Sisyphus Labs 强调 OMO 框架是完全模型无关的,用户不需要高昂的官方配额,用本地或便宜的 GPT、Gemini 甚至 Kimi 模型同样能跑起 ultrawork 工作流,并透露正在开发基于 GPT-5.5 的 Codex 适配版本。
另一方面,Q 亲身试用后对新模型打出了毒舌评价,认为新模型不过是一款不错的 GPT-5.5 中量级模型。此外,Q 还反手给出了一个幽默的嘲讽:他直接用 Anthropic 的官方新工具,命令它把 OMO 原创的编排逻辑重写一遍,做成一个可以反向挂载到 Claude Code 上的兼容插件。Q 调侃道,这就当是帮大厂做个兼容实验,毕竟开源团队的创意被直接拿走,大家早都习以为常了。
信源:https://x.com/q_yeon_gyu_kim/status/2060215394334552103
在 Anthropic 随 Opus 4.8 推出 Claude Code 动态工作流与 ultracode 模式仅数小时后,开源框架 OMO 团队在 X 上发起猛烈攻势,公开指责 Anthropic 像素级抄袭了其多模型编排架构。
OMO 作为 16.7 万星开源终端 Agent 项目 OpenCode 官方认定的 No.1 插件,由 23 岁韩国黑客 Q 开发,并由运营团队 Sisyphus Labs 宣发,目前已斩获 6 万星,在开发者社区极具声量。
这场风波直接撕开了大厂「先封杀、后吸收」的掠夺路径。今年 1 月,Q 在 OMO 中推出了用于多模型动态编排的 ultrawork 工作流以及负责合并审查的协调大脑 atlas。由于这套编排机制在运行多智能体递归循环时会吞噬天量 Token,被 OpenCode 联合创始人 Dax Raad 吐槽为「Token 燃烧器」,高能耗调用直接促使 Anthropic 在 4 月份痛下杀手,强行封禁了第三方客户端使用订阅额度的通道。
仅仅三个月后,Anthropic 官方就将这套已被开源验证的动态编排逻辑收编,化身为自家 Claude Code 的闭源收费主打功能。
除了死磕 Anthropic,OMO 团队与 FactoryAI 在今年 2 月也存在旧怨。FactoryAI 此前高调宣传的 Missions 多天自主任务流,被指直接搬运了 OMO 的三层 Agent 架构:OMO 的规划器 Prometheus 变成了 Factory 的计划审批流,协调大脑 Atlas 被改名包装为 orchestrator Droid,执行器 Sisyphus Junior 变成了 Worker Droid,甚至连原装的技能过滤机制都被简化挪用。
面对 OMO 团队晒出的历史开发记录,以及要求大厂公开致谢并承认原创贡献的喊话,两家大厂至今装聋作哑。开源团队则继续在推特上进行多维度反击。
一方面,Sisyphus Labs 强调 OMO 框架是完全模型无关的,用户不需要高昂的官方配额,用本地或便宜的 GPT、Gemini 甚至 Kimi 模型同样能跑起 ultrawork 工作流,并透露正在开发基于 GPT-5.5 的 Codex 适配版本。
另一方面,Q 亲身试用后对新模型打出了毒舌评价,认为新模型不过是一款不错的 GPT-5.5 中量级模型。此外,Q 还反手给出了一个幽默的嘲讽:他直接用 Anthropic 的官方新工具,命令它把 OMO 原创的编排逻辑重写一遍,做成一个可以反向挂载到 Claude Code 上的兼容插件。Q 调侃道,这就当是帮大厂做个兼容实验,毕竟开源团队的创意被直接拿走,大家早都习以为常了。
信源:https://x.com/q_yeon_gyu_kim/status/2060215394334552103
X (formerly Twitter)
Q (@q_yeon_gyu_kim) on X
@realsigridjin i am using their ultracode
to rewrite my whole legit ultrawork system to their own claude code as a plugin
i mean this is just an "experiment" like @jarredsumner has done
it would be better gave us credits
but this is what me an my team used…
to rewrite my whole legit ultrawork system to their own claude code as a plugin
i mean this is just an "experiment" like @jarredsumner has done
it would be better gave us credits
but this is what me an my team used…