Palantir CTO称对伊朗行动为「首个AI驱动的重大冲突」:48小时2000次打击
Palantir CTO Shyam Sankar 在 Fox News 节目上称美国对伊朗的「壮阔之怒」行动(Operation Epic Fury,2 月 28 日启动)是首个 AI 在军事打击中发挥核心作用的重大冲突。他称 48 小时内完成约 2000 次打击,「规划在以往同等规模冲突所需时间的零头内完成,每天的打击量超过此前同类行动的两倍。」据华盛顿邮报和 NBC 报道,Palantir 的 AI 目标生成平台 Maven 在行动首 24 小时内生成了约 1000 个优先打击目标。
Sankar 将人机协作比喻为「钢铁侠战甲」,强调决策权仍由人类掌握。围绕该行动的争议持续发酵,有报道称一次打击击中伊朗女子学校造成超 100 名平民死亡,特朗普政府声称该打击由伊朗自身军队实施,国防部正在调查。
信源:https://www.foxnews.com/media/palantir-executive-says-ai-enabling-rapid-battlefield-planning-high-speed-us-strike-operations
Palantir CTO Shyam Sankar 在 Fox News 节目上称美国对伊朗的「壮阔之怒」行动(Operation Epic Fury,2 月 28 日启动)是首个 AI 在军事打击中发挥核心作用的重大冲突。他称 48 小时内完成约 2000 次打击,「规划在以往同等规模冲突所需时间的零头内完成,每天的打击量超过此前同类行动的两倍。」据华盛顿邮报和 NBC 报道,Palantir 的 AI 目标生成平台 Maven 在行动首 24 小时内生成了约 1000 个优先打击目标。
Sankar 将人机协作比喻为「钢铁侠战甲」,强调决策权仍由人类掌握。围绕该行动的争议持续发酵,有报道称一次打击击中伊朗女子学校造成超 100 名平民死亡,特朗普政府声称该打击由伊朗自身军队实施,国防部正在调查。
信源:https://www.foxnews.com/media/palantir-executive-says-ai-enabling-rapid-battlefield-planning-high-speed-us-strike-operations
OpenAI COO:AI瓶颈已从电力转向内存芯片
OpenAI COO Brad Lightcap 在华盛顿 Hill and Valley Forum 上表示,内存芯片短缺是当前 AI 基础设施扩张的首要瓶颈:「现在是内存。过去是电力。」
科技公司正消耗越来越多的内存芯片产能,大量采购英伟达 AI 加速器是主因。内存短缺已从 AI 行业蔓延至消费电子和汽车。
信源:https://www.bloomberg.com/news/articles/2026-03-24/openai-s-lightcap-sees-memory-shortage-as-bottleneck-risk-for-ai
OpenAI COO Brad Lightcap 在华盛顿 Hill and Valley Forum 上表示,内存芯片短缺是当前 AI 基础设施扩张的首要瓶颈:「现在是内存。过去是电力。」
科技公司正消耗越来越多的内存芯片产能,大量采购英伟达 AI 加速器是主因。内存短缺已从 AI 行业蔓延至消费电子和汽车。
信源:https://www.bloomberg.com/news/articles/2026-03-24/openai-s-lightcap-sees-memory-shortage-as-bottleneck-risk-for-ai
Meta让CTO接管「AI原生」转型:Bosworth从元宇宙转向AI For Work
Meta 任命 CTO Andrew Bosworth(内部称 Boz)负责公司「AI For Work」计划,接替此前负责人 Guy Rosen。Bosworth 2006 年加入 Facebook,2022 年出任 CTO,此前主管 VR/AR 元宇宙业务。今年 1 月 Meta 裁撤元宇宙部门约 1500 个岗位后,将投入转向 AI 眼镜等方向。
Bosworth 在内部备忘录中称:「早期试点、对新想法的压力测试意愿,以及让团队快速拥抱 AI 工具的速度,创造了真正的动力。」AI For Work 旨在加速 AI 在 Meta 7.8 万人团队中的全面应用。
信源:https://www.wsj.com/tech/ai/meta-names-new-leader-of-companys-efforts-to-become-ai-native-8d7fe912
Meta 任命 CTO Andrew Bosworth(内部称 Boz)负责公司「AI For Work」计划,接替此前负责人 Guy Rosen。Bosworth 2006 年加入 Facebook,2022 年出任 CTO,此前主管 VR/AR 元宇宙业务。今年 1 月 Meta 裁撤元宇宙部门约 1500 个岗位后,将投入转向 AI 眼镜等方向。
Bosworth 在内部备忘录中称:「早期试点、对新想法的压力测试意愿,以及让团队快速拥抱 AI 工具的速度,创造了真正的动力。」AI For Work 旨在加速 AI 在 Meta 7.8 万人团队中的全面应用。
信源:https://www.wsj.com/tech/ai/meta-names-new-leader-of-companys-efforts-to-become-ai-native-8d7fe912
一句pip install偷光所有密钥:Karpathy称LiteLLM投毒为「软件界最恐怖的事」
OpenAI 创始成员 Andrej Karpathy 发帖称 AI 代理开发工具 LiteLLM 遭遇的供应链攻击是「现代软件中基本上最恐怖的事」。LiteLLM 月下载量 9700 万次,v1.82.7 和 v1.82.8 两个中毒版本已从 PyPI 下架。
仅一句
更危险的是传染性:任何依赖 LiteLLM 的项目都会连带中招,例如 `pip install dspy`(依赖 litellm>=1.64.0)同样会触发恶意代码。中毒版本在 PyPI 上仅存活约 1 小时便被发现,原因颇为讽刺:攻击者自己的恶意代码有个 bug,导致内存耗尽崩溃。开发者 Callum McMahon 在 AI 编程工具 Cursor 中使用一个 MCP 插件时,LiteLLM 作为传递依赖被拉入,安装后机器直接崩溃,由此暴露了攻击。Karpathy 评论称:「如果攻击者没有 vibe code 这次攻击,它可能数天甚至数周都不会被发现。」
攻击组织 TeamPCP 于 2 月底利用 LiteLLM 的 CI/CD 管道中 Trivy 漏洞扫描器在 GitHub Actions 中的配置缺陷入侵,窃取了 PyPI 发布令牌,随后绕过 GitHub 直接向 PyPI 上传恶意版本。LiteLLM 维护方 Berri AI CEO Krrish Dholakia 表示已删除所有发布令牌,计划转向基于 JWT 的可信发布机制。PyPA 发布安全通告 PYSEC-2026-2,建议所有安装过受影响版本的用户假设环境中所有凭证已泄露,应立即轮换。
信源:https://x.com/karpathy/status/2036487306585268612
OpenAI 创始成员 Andrej Karpathy 发帖称 AI 代理开发工具 LiteLLM 遭遇的供应链攻击是「现代软件中基本上最恐怖的事」。LiteLLM 月下载量 9700 万次,v1.82.7 和 v1.82.8 两个中毒版本已从 PyPI 下架。
仅一句
pip install litellm 就足以窃取机器上的 SSH 密钥、AWS/GCP/Azure 云凭证、Kubernetes 配置、git 凭证、环境变量(含所有 API 密钥)、shell 历史记录、加密钱包、SSL 私钥、CI/CD 密钥和数据库密码。恶意代码通过 4096 位 RSA 加密打包数据外传至伪装域名 models.litellm.cloud`,还会尝试在 Kubernetes 集群的 `kube-system 命名空间中创建特权容器植入持久后门。更危险的是传染性:任何依赖 LiteLLM 的项目都会连带中招,例如 `pip install dspy`(依赖 litellm>=1.64.0)同样会触发恶意代码。中毒版本在 PyPI 上仅存活约 1 小时便被发现,原因颇为讽刺:攻击者自己的恶意代码有个 bug,导致内存耗尽崩溃。开发者 Callum McMahon 在 AI 编程工具 Cursor 中使用一个 MCP 插件时,LiteLLM 作为传递依赖被拉入,安装后机器直接崩溃,由此暴露了攻击。Karpathy 评论称:「如果攻击者没有 vibe code 这次攻击,它可能数天甚至数周都不会被发现。」
攻击组织 TeamPCP 于 2 月底利用 LiteLLM 的 CI/CD 管道中 Trivy 漏洞扫描器在 GitHub Actions 中的配置缺陷入侵,窃取了 PyPI 发布令牌,随后绕过 GitHub 直接向 PyPI 上传恶意版本。LiteLLM 维护方 Berri AI CEO Krrish Dholakia 表示已删除所有发布令牌,计划转向基于 JWT 的可信发布机制。PyPA 发布安全通告 PYSEC-2026-2,建议所有安装过受影响版本的用户假设环境中所有凭证已泄露,应立即轮换。
信源:https://x.com/karpathy/status/2036487306585268612
OpenAI完成下一代模型Spud预训练,Altman卸下安全职责全力建数据中心
OpenAI CEO Sam Altman 在全员会上宣布,公司下一代主力模型代号 Spud 已完成预训练,预计「几周内」会有一个「非常强的模型」,Altman 称团队相信它「真的能推动经济发展」。
Altman 同时宣布将 AI 安全(safety)团队移交首席研究官 Mark Chen 的研究部门,信息安全(security)团队划归联合创始人兼总裁 Greg Brockman 领导的「规模化」部门,自己将专注于融资、供应链和「以前所未有的规模建设数据中心」。高管 Fidji Simo 负责的产品部门更名为「AGI Deployment」。OpenAI 上周已告知员工,将把 ChatGPT、编程 Agent Codex 和浏览器 Atlas 合并为桌面端「超级应用」。
信源:https://www.theinformation.com/articles/openai-ceo-shifts-responsibilities-preps-spud-ai-model
OpenAI CEO Sam Altman 在全员会上宣布,公司下一代主力模型代号 Spud 已完成预训练,预计「几周内」会有一个「非常强的模型」,Altman 称团队相信它「真的能推动经济发展」。
Altman 同时宣布将 AI 安全(safety)团队移交首席研究官 Mark Chen 的研究部门,信息安全(security)团队划归联合创始人兼总裁 Greg Brockman 领导的「规模化」部门,自己将专注于融资、供应链和「以前所未有的规模建设数据中心」。高管 Fidji Simo 负责的产品部门更名为「AGI Deployment」。OpenAI 上周已告知员工,将把 ChatGPT、编程 Agent Codex 和浏览器 Atlas 合并为桌面端「超级应用」。
信源:https://www.theinformation.com/articles/openai-ceo-shifts-responsibilities-preps-spud-ai-model
全球仅三家:火山引擎日均词元(Token)调用破百万亿,不到两月涨超60%
字节跳动云计算业务火山引擎的日均云端大模型调用量已超过 100 万亿词元(Token),春节以来不到两个月上涨超 60%。全球目前仅 OpenAI、谷歌与字节跳动三家公司达到这一量级,字节的消耗主要来自中国市场,海外市场处于快速增长阶段。
火山引擎人士称,增长还是在约束条件下实现的,视频生成模型 Seedance 2.0 API 尚未在海外正式上线。过去一个多月,来自个人用户的词元(Token)消耗增长了约 16 倍,OpenClaw 等 Agent 产品将 AI 推向大众用户是主要推动力。
火山引擎此前定下 2026 年 MaaS(模型即服务)业务收入超百亿元的目标,随着 Seed 2.0、Seedance 2.0 等模型发布和 OpenClaw 持续爆火,团队已上调收入目标。字节在国内云计算起步最晚,将 MaaS 视为弯道超车的核心战场。
国家数据局昨日披露,中国日均词元(Token)调用量今年 3 月已突破 140 万亿。2024 年初这一数字为 1000 亿,2025 年底跃升至 100 万亿,两年增长超千倍。
信源:https://mp.weixin.qq.com/s/sHL6k9vf8UNgYkfaj2qmbA
字节跳动云计算业务火山引擎的日均云端大模型调用量已超过 100 万亿词元(Token),春节以来不到两个月上涨超 60%。全球目前仅 OpenAI、谷歌与字节跳动三家公司达到这一量级,字节的消耗主要来自中国市场,海外市场处于快速增长阶段。
火山引擎人士称,增长还是在约束条件下实现的,视频生成模型 Seedance 2.0 API 尚未在海外正式上线。过去一个多月,来自个人用户的词元(Token)消耗增长了约 16 倍,OpenClaw 等 Agent 产品将 AI 推向大众用户是主要推动力。
火山引擎此前定下 2026 年 MaaS(模型即服务)业务收入超百亿元的目标,随着 Seed 2.0、Seedance 2.0 等模型发布和 OpenClaw 持续爆火,团队已上调收入目标。字节在国内云计算起步最晚,将 MaaS 视为弯道超车的核心战场。
国家数据局昨日披露,中国日均词元(Token)调用量今年 3 月已突破 140 万亿。2024 年初这一数字为 1000 亿,2025 年底跃升至 100 万亿,两年增长超千倍。
信源:https://mp.weixin.qq.com/s/sHL6k9vf8UNgYkfaj2qmbA
商汤下半年EBITDA上市后首次转正:全年营收破50亿增33%,亏损收窄近六成
商汤科技发布 2025 年全年业绩公告,总收入超 50 亿元,同比增长 33%,创历史新高,增幅为近三年最快。全年净亏损收窄 58.6%,下半年息税折旧摊销前利润(EBITDA)为 3.8 亿元,上市后首次转正。下半年经营性现金流也自上市以来首次实现正向净流入,贸易应收回款达 48.7 亿元创历史新高。
其中生成式 AI 业务增长 51%。泛办公领域的小浣熊家族累计服务 1500 万个人用户与数千家企业客户,全年月活增长 7 倍。商汤宣布将于 2026 年第二季度推出基于第二代 NEO 架构的全新模型,去年 12 月商汤发布并开源了首代 NEO 原生多模态模型架构。
信源:https://www.ithome.com/0/932/300.htm
商汤科技发布 2025 年全年业绩公告,总收入超 50 亿元,同比增长 33%,创历史新高,增幅为近三年最快。全年净亏损收窄 58.6%,下半年息税折旧摊销前利润(EBITDA)为 3.8 亿元,上市后首次转正。下半年经营性现金流也自上市以来首次实现正向净流入,贸易应收回款达 48.7 亿元创历史新高。
其中生成式 AI 业务增长 51%。泛办公领域的小浣熊家族累计服务 1500 万个人用户与数千家企业客户,全年月活增长 7 倍。商汤宣布将于 2026 年第二季度推出基于第二代 NEO 架构的全新模型,去年 12 月商汤发布并开源了首代 NEO 原生多模态模型架构。
信源:https://www.ithome.com/0/932/300.htm
博通称台积电产能触顶:AI芯片供应链全面吃紧,PCB交期从6周拉到半年
芯片设计公司博通的物理层产品部门产品营销总监 Natarajan Ramachandran 表示,台积电的生产产能正在触及上限,「几年前我还会说它的产能是无限的」。他称台积电将在 2027 年前扩充产能,但 2026 年这一产能瓶颈已经「卡住了供应链」。
短缺已蔓延至半导体以外。Ramachandran 称激光器领域出现明显供应约束,PCB(印刷电路板)成为「意想不到的」瓶颈,用于光收发器的 PCB 交期从约 6 周拉长至 6 个月,台湾和中国大陆的 PCB 供应商均面临产能上限。许多客户正与供应商签订 3 至 4 年的长期协议以锁定产能,三星电子上周也表示正与主要客户转向 3 至 5 年的长约。
信源:https://www.reuters.com/world/asia-pacific/broadcom-flags-supply-constraints-says-tsmc-capacity-bottleneck-2026-03-24/
芯片设计公司博通的物理层产品部门产品营销总监 Natarajan Ramachandran 表示,台积电的生产产能正在触及上限,「几年前我还会说它的产能是无限的」。他称台积电将在 2027 年前扩充产能,但 2026 年这一产能瓶颈已经「卡住了供应链」。
短缺已蔓延至半导体以外。Ramachandran 称激光器领域出现明显供应约束,PCB(印刷电路板)成为「意想不到的」瓶颈,用于光收发器的 PCB 交期从约 6 周拉长至 6 个月,台湾和中国大陆的 PCB 供应商均面临产能上限。许多客户正与供应商签订 3 至 4 年的长期协议以锁定产能,三星电子上周也表示正与主要客户转向 3 至 5 年的长约。
信源:https://www.reuters.com/world/asia-pacific/broadcom-flags-supply-constraints-says-tsmc-capacity-bottleneck-2026-03-24/
全球最大主权基金半数员工用Claude编程,下一步让AI自主做投资决策
管理 2.1 万亿美元资产的挪威主权财富基金(Norges Bank Investment Management)约半数员工已在使用 Anthropic 的 Claude 大语言模型自行编写 AI 工具。基金机器学习与 AI 负责人 Stian Kirkeberg 在一场 AI 研讨会上介绍,员工主要用这些工具辅助决策,包括监控基金投资的 7000 家公司的 ESG 和财务风险、模拟合同谈判、准备公司会议等。
Kirkeberg 表示,未来将允许部分 AI 智能体在人类监督下自主做出有限决策。「原则是让 AI 为我们分析,从而做出更好的人类决策,」他说,「到某个阶段,我们会信任智能体能做出部分决策,我们只需监控它的行为。」他强调目前尚未实施这一模式,人类监督仍不可或缺。
基金 CEO Nicolai Tangen 曾称不采用 AI 的公司是「彻头彻尾的蠢货」(complete morons)。他表示基金在 AI 上投入了「数百万克朗」,回报达到「数十亿克朗」级别。基金目前已在用 AI 分析交易时机以降低交易成本,员工规模将维持约 700 人,但岗位将从后台行政向前端投资转移。
信源:https://www.reuters.com/business/norway-wealth-fund-moves-towards-some-ai-driven-decisions-with-humans-control-2026-03-24/
管理 2.1 万亿美元资产的挪威主权财富基金(Norges Bank Investment Management)约半数员工已在使用 Anthropic 的 Claude 大语言模型自行编写 AI 工具。基金机器学习与 AI 负责人 Stian Kirkeberg 在一场 AI 研讨会上介绍,员工主要用这些工具辅助决策,包括监控基金投资的 7000 家公司的 ESG 和财务风险、模拟合同谈判、准备公司会议等。
Kirkeberg 表示,未来将允许部分 AI 智能体在人类监督下自主做出有限决策。「原则是让 AI 为我们分析,从而做出更好的人类决策,」他说,「到某个阶段,我们会信任智能体能做出部分决策,我们只需监控它的行为。」他强调目前尚未实施这一模式,人类监督仍不可或缺。
基金 CEO Nicolai Tangen 曾称不采用 AI 的公司是「彻头彻尾的蠢货」(complete morons)。他表示基金在 AI 上投入了「数百万克朗」,回报达到「数十亿克朗」级别。基金目前已在用 AI 分析交易时机以降低交易成本,员工规模将维持约 700 人,但岗位将从后台行政向前端投资转移。
信源:https://www.reuters.com/business/norway-wealth-fund-moves-towards-some-ai-driven-decisions-with-humans-control-2026-03-24/
黄金穹顶核心软件首次曝光:Anduril和Palantir牵头,军工巨头反当分包商
Anduril Industries 和 Palantir 正在牵头开发特朗普政府 1850 亿美元「黄金穹顶」反导防御系统的核心指控软件,目标今年夏天完成测试。参与开发的还包括从谷歌母公司 Alphabet 脱胎的网络公司 Aalyria Technologies、AI 创业公司 Scale AI 和软件公司 Swoop Technologies。
该软件被项目负责人、太空军上将 Michael Guetlein 称为「胶水层」,负责连接分布在不同军种的雷达、太空传感器和导弹拦截系统,让指挥官统一调度武器应对空中威胁。Guetlein 称:「我们从第一天就认识到,指挥与控制将是我们的核心优势。」该软件是唯一由 Guetlein 办公室直接管理的黄金穹顶项目。
传统上直接与五角大楼签约的洛克希德·马丁、诺斯罗普·格鲁曼和 RTX 三家军工巨头,在该项目中反而以分包商身份加入,为科技公司提供支持。Anduril 本月还赢得了美国陆军一项价值最高 200 亿美元的十年期合同。
信源:https://www.wsj.com/politics/national-security/anduril-palantir-are-developing-golden-dome-missile-shields-software-63c36db4?gaa_at=eafs&gaa_n=AWEtsqcuLJJO8XhVNlJ_6GZuvQM_CMBMyjLtQoFD3Hf9em_xcc2CgnLniiD4P-L-N2E%3D&gaa_ts=69c36170&gaa_sig=JS5g9nFvUsiNB-zowWEe_JSDSTdDzO-t76sPPJXM-f0PjOZ_6_k0Wno4Ph_xEA3R4V0vRw4Hp9HksHmr-pQX5w%3D%3D
Anduril Industries 和 Palantir 正在牵头开发特朗普政府 1850 亿美元「黄金穹顶」反导防御系统的核心指控软件,目标今年夏天完成测试。参与开发的还包括从谷歌母公司 Alphabet 脱胎的网络公司 Aalyria Technologies、AI 创业公司 Scale AI 和软件公司 Swoop Technologies。
该软件被项目负责人、太空军上将 Michael Guetlein 称为「胶水层」,负责连接分布在不同军种的雷达、太空传感器和导弹拦截系统,让指挥官统一调度武器应对空中威胁。Guetlein 称:「我们从第一天就认识到,指挥与控制将是我们的核心优势。」该软件是唯一由 Guetlein 办公室直接管理的黄金穹顶项目。
传统上直接与五角大楼签约的洛克希德·马丁、诺斯罗普·格鲁曼和 RTX 三家军工巨头,在该项目中反而以分包商身份加入,为科技公司提供支持。Anduril 本月还赢得了美国陆军一项价值最高 200 亿美元的十年期合同。
信源:https://www.wsj.com/politics/national-security/anduril-palantir-are-developing-golden-dome-missile-shields-software-63c36db4?gaa_at=eafs&gaa_n=AWEtsqcuLJJO8XhVNlJ_6GZuvQM_CMBMyjLtQoFD3Hf9em_xcc2CgnLniiD4P-L-N2E%3D&gaa_ts=69c36170&gaa_sig=JS5g9nFvUsiNB-zowWEe_JSDSTdDzO-t76sPPJXM-f0PjOZ_6_k0Wno4Ph_xEA3R4V0vRw4Hp9HksHmr-pQX5w%3D%3D
GPT-5.2也只答对四分之一:Sierra发布τ³-Bench测出AI Agent真实水平
AI 智能体公司 Sierra 发布 τ³-Bench 基准测试,在 2024 年 6 月推出的 τ-Bench 基础上新增知识库和语音两个评估维度。
τ-Knowledge 构建了一个金融科技客服场景 τ-Banking,包含 698 篇文档、21 个产品类别、约 19.5 万 token 的知识库。智能体需要在其中检索正确策略文档,推理并执行多步工具调用,例如找到争议交易的退款政策、冻结银行卡、发起争议并发放临时信用额度,且顺序必须正确。表现最好的前沿模型 GPT-5.2(高推理模式)仅通过约 25% 的任务;即使直接提供完成任务所需的全部文档,通过率也只升至 40%,表明瓶颈不仅在于检索,更在于理解信息并正确执行操作。
τ-Voice 在 OpenAI Realtime、谷歌 Gemini Live 和 xAI Grok Voice 三家语音服务上进行测试,模拟真实通话环境:带口音的用户从嘈杂咖啡店拨入,网络信号不稳,且会随时打断智能体。在理想条件下,最佳语音智能体的任务完成率接近非推理文本模型(约 54% 对比 31%-51%),引入真实音频条件后降至 26%-38%。文本推理模型可达约 85%,差距悬殊。身份验证是最大的失败点,智能体一旦听错用户姓名或邮箱地址,后续所有操作都会连锁失败。
此次更新还纳入了亚马逊 τ²-Bench Verified 团队和 Anthropic 等提交的社区修正,提升了原有航空、零售和电信场景的评估准确性。
信源:https://sierra.ai/blog/bench-advancing-agent-benchmarking-to-knowledge-and-voice
AI 智能体公司 Sierra 发布 τ³-Bench 基准测试,在 2024 年 6 月推出的 τ-Bench 基础上新增知识库和语音两个评估维度。
τ-Knowledge 构建了一个金融科技客服场景 τ-Banking,包含 698 篇文档、21 个产品类别、约 19.5 万 token 的知识库。智能体需要在其中检索正确策略文档,推理并执行多步工具调用,例如找到争议交易的退款政策、冻结银行卡、发起争议并发放临时信用额度,且顺序必须正确。表现最好的前沿模型 GPT-5.2(高推理模式)仅通过约 25% 的任务;即使直接提供完成任务所需的全部文档,通过率也只升至 40%,表明瓶颈不仅在于检索,更在于理解信息并正确执行操作。
τ-Voice 在 OpenAI Realtime、谷歌 Gemini Live 和 xAI Grok Voice 三家语音服务上进行测试,模拟真实通话环境:带口音的用户从嘈杂咖啡店拨入,网络信号不稳,且会随时打断智能体。在理想条件下,最佳语音智能体的任务完成率接近非推理文本模型(约 54% 对比 31%-51%),引入真实音频条件后降至 26%-38%。文本推理模型可达约 85%,差距悬殊。身份验证是最大的失败点,智能体一旦听错用户姓名或邮箱地址,后续所有操作都会连锁失败。
此次更新还纳入了亚马逊 τ²-Bench Verified 团队和 Anthropic 等提交的社区修正,提升了原有航空、零售和电信场景的评估准确性。
信源:https://sierra.ai/blog/bench-advancing-agent-benchmarking-to-knowledge-and-voice
问一句话终端长出仪表盘:Vercel json-render推出Generative TUI
Vercel 开源 Generative UI 框架 json-render 的创建者 Chris Tate 发布终端渲染器 @json-render/ink,将 AI 生成界面的能力带入命令行。用户输入自然语言提问,即可在终端中实时渲染包含图表、表格、指标卡片等组件的数据仪表盘,演示中展示了一个完整的 iPhone 销售趋势面板,含柱状图、季度明细表和市场份额图。
该渲染器基于 Ink(基于 React 的终端 UI 库)构建,提供 27 个预置组件,支持流式渲染,AI 生成的 JSON spec 随模型响应逐步呈现。开发者可通过
json-render 今年 1 月开源,GitHub 星标超 1.33 万,支持 React、Vue、Svelte、SolidJS、React Native、PDF、邮件、终端和 3D 场景共 9 个渲染目标,均从同一组件目录生成。核心机制是 AI 只能使用开发者预定义的组件,输出受 JSON schema 约束,确保可预测性。
信源:https://x.com/ctatedev/status/2036149934441783691
Vercel 开源 Generative UI 框架 json-render 的创建者 Chris Tate 发布终端渲染器 @json-render/ink,将 AI 生成界面的能力带入命令行。用户输入自然语言提问,即可在终端中实时渲染包含图表、表格、指标卡片等组件的数据仪表盘,演示中展示了一个完整的 iPhone 销售趋势面板,含柱状图、季度明细表和市场份额图。
该渲染器基于 Ink(基于 React 的终端 UI 库)构建,提供 27 个预置组件,支持流式渲染,AI 生成的 JSON spec 随模型响应逐步呈现。开发者可通过
npx skills add vercel-labs/json-render --skill ink 一键安装为 Claude Code skill。json-render 今年 1 月开源,GitHub 星标超 1.33 万,支持 React、Vue、Svelte、SolidJS、React Native、PDF、邮件、终端和 3D 场景共 9 个渲染目标,均从同一组件目录生成。核心机制是 AI 只能使用开发者预定义的组件,输出受 JSON schema 约束,确保可预测性。
信源:https://x.com/ctatedev/status/2036149934441783691
元宝派上电脑了:视频连麦、共享屏幕、边聊边问AI
腾讯 AI 助手元宝宣布「元宝派」电脑版正式上线。元宝派是今年 1 月内测的多人社交空间,深度打通微信和 QQ,用户将元宝电脑版升级至最新版本后可在侧边栏进入。
电脑版新增视频连麦和屏幕共享功能,连麦时弹出独立窗口,可同步电脑声音并自定义画质。用户在群聊中可随时 @元宝 提问,不用退出对话即可调用 AI。手机与电脑消息实时同步,文件拖入聊天框即可上传。龙虾(OpenClaw)Bot 也已登陆电脑端,3 月 24 日至 4 月 1 日每天中午 12 点和晚 8 点可免费领取,每只自带 Token 额度。
信源:https://mp.weixin.qq.com/s/10A13ZuOVNDFQrKDIm6KjA
腾讯 AI 助手元宝宣布「元宝派」电脑版正式上线。元宝派是今年 1 月内测的多人社交空间,深度打通微信和 QQ,用户将元宝电脑版升级至最新版本后可在侧边栏进入。
电脑版新增视频连麦和屏幕共享功能,连麦时弹出独立窗口,可同步电脑声音并自定义画质。用户在群聊中可随时 @元宝 提问,不用退出对话即可调用 AI。手机与电脑消息实时同步,文件拖入聊天框即可上传。龙虾(OpenClaw)Bot 也已登陆电脑端,3 月 24 日至 4 月 1 日每天中午 12 点和晚 8 点可免费领取,每只自带 Token 额度。
信源:https://mp.weixin.qq.com/s/10A13ZuOVNDFQrKDIm6KjA
中国模型上次SWE-rebench全落前十被嘲「刷分」,这次占了四席
SWE-rebench 是一个每月从 GitHub 抽取全新软件工程任务(issue + PR)的实时基准测试,模型无法提前针对题目优化。维护者 Ibragim 3 月 23 日公布榜单更新,取消了此前的示例演示和 80 步操作限制,新增辅助评估任务。
最新前十排名:
1. Claude Opus 4.6:65.3%
2. GPT-5.2 medium:64.4%
3. GLM-5:62.8%
4. GPT-5.4 medium:62.8%
5. Gemini 3.1 Pro Preview:62.3%
6. DeepSeek-V3.2:60.9%
7. Claude Sonnet 4.6:60.7%
8. Claude Sonnet 4.5:60.0%
9. Qwen3.5-397B-A17B:59.9%
10. Step-3.5-Flash:59.6%
智谱 AI 的开源模型 GLM-5(MIT 协议)以 62.8% 排名第三,是榜上最高的开源模型。中国模型占前十中四席,除 GLM-5 外,还有深度求索 DeepSeek-V3.2(第六)、阿里通义千问 Qwen3.5-397B-A17B(第九)以及阶跃星辰 Step-3.5-Flash(第十)。智谱 Z.ai 全球负责人李子玄评论称,上一次 SWE-rebench 更新时中国模型全部落在前十之外,被批评为「benchmaxing」(刷分)。
信源:https://x.com/ZixuanLi_/status/2036114799029821491
SWE-rebench 是一个每月从 GitHub 抽取全新软件工程任务(issue + PR)的实时基准测试,模型无法提前针对题目优化。维护者 Ibragim 3 月 23 日公布榜单更新,取消了此前的示例演示和 80 步操作限制,新增辅助评估任务。
最新前十排名:
1. Claude Opus 4.6:65.3%
2. GPT-5.2 medium:64.4%
3. GLM-5:62.8%
4. GPT-5.4 medium:62.8%
5. Gemini 3.1 Pro Preview:62.3%
6. DeepSeek-V3.2:60.9%
7. Claude Sonnet 4.6:60.7%
8. Claude Sonnet 4.5:60.0%
9. Qwen3.5-397B-A17B:59.9%
10. Step-3.5-Flash:59.6%
智谱 AI 的开源模型 GLM-5(MIT 协议)以 62.8% 排名第三,是榜上最高的开源模型。中国模型占前十中四席,除 GLM-5 外,还有深度求索 DeepSeek-V3.2(第六)、阿里通义千问 Qwen3.5-397B-A17B(第九)以及阶跃星辰 Step-3.5-Flash(第十)。智谱 Z.ai 全球负责人李子玄评论称,上一次 SWE-rebench 更新时中国模型全部落在前十之外,被批评为「benchmaxing」(刷分)。
信源:https://x.com/ZixuanLi_/status/2036114799029821491
AI密钥不再裸奔:Tailscale网关Aperture开放自助注册,Agent调用全程可追踪
组网工具 Tailscale 将其 AI 网关 Aperture 从候补名单制改为自助注册,开发者可直接开通使用,目前为 alpha 阶段。
Aperture 解决的是 AI 时代的密钥扩散问题:开发者将 LLM API 密钥复制到本地 .env 文件、CI 管道、容器、Agent 运行时,每一步都扩大攻击面。Aperture 将密钥集中存储在网关内,客户端通过 Tailscale 身份认证发起请求,网关代为向模型提供商鉴权,密钥不再出现在应用环境中。以 Claude Code 为例,只需将
目前支持 Anthropic、OpenAI、AWS Bedrock、Google Vertex AI、Google AI Studio、Vercel AI Gateway、OpenRouter 及本地部署模型共 8 类提供商。平台提供按用户和 Agent 维度的 token 消耗与 API 调用量追踪,员工离职或密钥泄露时只需在 Tailscale 中移除权限,无需逐一轮换密钥。Aperture 可独立于 Tailscale 付费计划单独购买。
信源:https://tailscale.com/blog/aperture-self-serve
组网工具 Tailscale 将其 AI 网关 Aperture 从候补名单制改为自助注册,开发者可直接开通使用,目前为 alpha 阶段。
Aperture 解决的是 AI 时代的密钥扩散问题:开发者将 LLM API 密钥复制到本地 .env 文件、CI 管道、容器、Agent 运行时,每一步都扩大攻击面。Aperture 将密钥集中存储在网关内,客户端通过 Tailscale 身份认证发起请求,网关代为向模型提供商鉴权,密钥不再出现在应用环境中。以 Claude Code 为例,只需将
ANTHROPIC_BASE_URL 设为 http://ai 即可接入,无需在本地存储任何密钥。目前支持 Anthropic、OpenAI、AWS Bedrock、Google Vertex AI、Google AI Studio、Vercel AI Gateway、OpenRouter 及本地部署模型共 8 类提供商。平台提供按用户和 Agent 维度的 token 消耗与 API 调用量追踪,员工离职或密钥泄露时只需在 Tailscale 中移除权限,无需逐一轮换密钥。Aperture 可独立于 Tailscale 付费计划单独购买。
信源:https://tailscale.com/blog/aperture-self-serve
只看截图就能操作浏览器:AI2开源80亿参数网页Agent,四项基准超GPT-4o方案
非营利 AI 研究机构 AI2(Allen Institute for AI)发布开源视觉网页智能体 MolmoWeb,基于其 Molmo 2 多模态模型构建,提供 4B 和 8B 两个版本,模型权重、训练数据、代码和评估工具全部公开。
MolmoWeb 的核心设计是纯视觉驱动:通过截图理解网页界面,不依赖 HTML 或无障碍树等结构化页面数据。模型在每一步接收任务指令和当前页面截图,生成推理过程和下一步浏览器操作(点击、输入、滚动等),可完成搜索、表单填写、商品比价等日常任务。单张截图远比序列化的页面结构紧凑,且视觉界面在底层代码变动时仍保持稳定。
在 WebVoyager、Online-Mind2Web、DeepShop、WebTailBench 四个主流基准上,MolmoWeb (8B) 均为开源模型最优:WebVoyager 78.2%、DeepShop 42.3%、WebTailBench 49.5%,全面超越此前最强的开源模型 Fara-7B。4B 版本在 30 步限制下也优于 Fara-7B 的 100 步表现。MolmoWeb 还超越了基于 GPT-4o 等闭源模型构建的网页智能体,后者使用了标注截图和结构化页面数据等更丰富的输入。通过测试时扩展(运行多次独立推理取最优),8B 模型在 WebVoyager 上可达 94.7%(pass@4)。
AI2 同步开源训练数据集 MolmoWebMix,包含 3.6 万条人类操作轨迹(覆盖 1100 多个网站、62.3 万个子任务演示)、由文本智能体生成的合成轨迹,以及 220 万组网页截图问答对。训练过程未使用任何闭源视觉智能体的蒸馏数据。
信源:https://allenai.org/blog/molmoweb
非营利 AI 研究机构 AI2(Allen Institute for AI)发布开源视觉网页智能体 MolmoWeb,基于其 Molmo 2 多模态模型构建,提供 4B 和 8B 两个版本,模型权重、训练数据、代码和评估工具全部公开。
MolmoWeb 的核心设计是纯视觉驱动:通过截图理解网页界面,不依赖 HTML 或无障碍树等结构化页面数据。模型在每一步接收任务指令和当前页面截图,生成推理过程和下一步浏览器操作(点击、输入、滚动等),可完成搜索、表单填写、商品比价等日常任务。单张截图远比序列化的页面结构紧凑,且视觉界面在底层代码变动时仍保持稳定。
在 WebVoyager、Online-Mind2Web、DeepShop、WebTailBench 四个主流基准上,MolmoWeb (8B) 均为开源模型最优:WebVoyager 78.2%、DeepShop 42.3%、WebTailBench 49.5%,全面超越此前最强的开源模型 Fara-7B。4B 版本在 30 步限制下也优于 Fara-7B 的 100 步表现。MolmoWeb 还超越了基于 GPT-4o 等闭源模型构建的网页智能体,后者使用了标注截图和结构化页面数据等更丰富的输入。通过测试时扩展(运行多次独立推理取最优),8B 模型在 WebVoyager 上可达 94.7%(pass@4)。
AI2 同步开源训练数据集 MolmoWebMix,包含 3.6 万条人类操作轨迹(覆盖 1100 多个网站、62.3 万个子任务演示)、由文本智能体生成的合成轨迹,以及 220 万组网页截图问答对。训练过程未使用任何闭源视觉智能体的蒸馏数据。
信源:https://allenai.org/blog/molmoweb
AI Agent也要有域名了:.agent顶级域名社区竞标下月启动,Brave、阿里云等700家公司加入
一个由 3000 多名成员(700 多家公司和 2300 多名开发者)组成的社区正在向 ICANN 申请 .agent 顶级域名,主张这一 AI 命名层应由社区治理,而非被单一公司控制。隐私浏览器 Brave 宣布已注册 .agent 域名并加入该倡议,其他参与方还包括 Ollama、Datadog、Netlify、Sourcegraph、阿里云、Product Hunt 等。
该社区认为,.agent 之于 AI Agent 网络,就像 DNS 之于早期互联网:谁控制了命名层,谁就能决定哪些 Agent 可以被发现、哪些被封锁。社区治理模式旨在确保透明的注册政策、可预期的定价,以及不受任何单一公司董事会左右的准入规则。
ICANN 的申请窗口将于 2026 年 4 月下旬开放,持续 90 天。在有争议的顶级域名分配中,ICANN 采用「社区优先评估」(CPE)机制,由第三方专家小组从社区规模、与域名的关联度、注册政策和社区背书四个维度打分,社区的成员数量和多样性直接影响竞标结果。
信源:https://agentcommunity.org/about
一个由 3000 多名成员(700 多家公司和 2300 多名开发者)组成的社区正在向 ICANN 申请 .agent 顶级域名,主张这一 AI 命名层应由社区治理,而非被单一公司控制。隐私浏览器 Brave 宣布已注册 .agent 域名并加入该倡议,其他参与方还包括 Ollama、Datadog、Netlify、Sourcegraph、阿里云、Product Hunt 等。
该社区认为,.agent 之于 AI Agent 网络,就像 DNS 之于早期互联网:谁控制了命名层,谁就能决定哪些 Agent 可以被发现、哪些被封锁。社区治理模式旨在确保透明的注册政策、可预期的定价,以及不受任何单一公司董事会左右的准入规则。
ICANN 的申请窗口将于 2026 年 4 月下旬开放,持续 90 天。在有争议的顶级域名分配中,ICANN 采用「社区优先评估」(CPE)机制,由第三方专家小组从社区规模、与域名的关联度、注册政策和社区背书四个维度打分,社区的成员数量和多样性直接影响竞标结果。
信源:https://agentcommunity.org/about
阿里云JVS Claw全面开放:无需邀请码即可「养虾」,新增语音和文件空间
阿里云宣布 AI 智能体产品 JVS Claw 全面开放,所有用户无需邀请码,下载客户端即可获得一只云端「龙虾」。此前该产品处于邀请制内测阶段。
新版主要更新:
1. 手机 App 新增语音输入,支持语音下达任务
2. JVS 文件空间提供 5GB 专属存储,可在多轮对话中搜索历史任务
3. 新增 Skill 管控台,支持第三方 Skill 自定义开关
4. Clawbot 支持一键热升级,无需重建
5. 新增定时任务专用入口
6. 支持微博龙虾助手一键接入
阿里云同步发布《JVS 养虾宝典》,列举 20 多种使用场景。
信源:https://mp.weixin.qq.com/s/1UGnrKk9PSIQ0XkWKmiBPw?clicktime=1774418862&enterid=1774418862&scene=126&sessionid=1774418861&subscene=7
阿里云宣布 AI 智能体产品 JVS Claw 全面开放,所有用户无需邀请码,下载客户端即可获得一只云端「龙虾」。此前该产品处于邀请制内测阶段。
新版主要更新:
1. 手机 App 新增语音输入,支持语音下达任务
2. JVS 文件空间提供 5GB 专属存储,可在多轮对话中搜索历史任务
3. 新增 Skill 管控台,支持第三方 Skill 自定义开关
4. Clawbot 支持一键热升级,无需重建
5. 新增定时任务专用入口
6. 支持微博龙虾助手一键接入
阿里云同步发布《JVS 养虾宝典》,列举 20 多种使用场景。
信源:https://mp.weixin.qq.com/s/1UGnrKk9PSIQ0XkWKmiBPw?clicktime=1774418862&enterid=1774418862&scene=126&sessionid=1774418861&subscene=7
Cursor发布Composer2技术报告:RL环境完全模拟真实用户场景,底座模型得分提升70%
Cursor 发布 Composer 2 技术报告,首次披露完整训练方案。底座 Kimi K2.5 为 MoE 架构,总参数 1.04 万亿、激活参数 320 亿。训练分两阶段:先在代码数据上继续预训练以增强编码知识,再通过大规模强化学习提升端到端编码能力。RL 环境完全模拟真实 Cursor 使用场景,包括文件编辑、终端操作、代码搜索等工具调用,让模型在接近生产环境的条件下学习。
报告同步公布了自研基准 CursorBench 的构建方法:从工程团队的真实编码会话中采集任务,而非人工构造。底座 Kimi K2.5 在该基准上仅得 36.0 分,经两阶段训练后 Composer 2 达到 61.3 分,提升 70%。Cursor 称其推理成本显著低于 GPT-5.4 和 Claude Opus 4.6 等前沿模型 API,在准确率与成本之间实现帕累托最优。
信源:https://cursor.com/resources/Composer2.pdf
Cursor 发布 Composer 2 技术报告,首次披露完整训练方案。底座 Kimi K2.5 为 MoE 架构,总参数 1.04 万亿、激活参数 320 亿。训练分两阶段:先在代码数据上继续预训练以增强编码知识,再通过大规模强化学习提升端到端编码能力。RL 环境完全模拟真实 Cursor 使用场景,包括文件编辑、终端操作、代码搜索等工具调用,让模型在接近生产环境的条件下学习。
报告同步公布了自研基准 CursorBench 的构建方法:从工程团队的真实编码会话中采集任务,而非人工构造。底座 Kimi K2.5 在该基准上仅得 36.0 分,经两阶段训练后 Composer 2 达到 61.3 分,提升 70%。Cursor 称其推理成本显著低于 GPT-5.4 和 Claude Opus 4.6 等前沿模型 API,在准确率与成本之间实现帕累托最优。
信源:https://cursor.com/resources/Composer2.pdf
Papers with Code创始团队再出发:OpenReward上线330+强化学习环境,一个API训练AI Agent
Papers with Code 联合创始人 Ross Taylor 创办的伦敦 AI 研发公司 General Reasoning 发布开放平台 OpenReward,提供 330 多个强化学习环境和超 450 万个独立任务,开发者通过单一 API 即可训练和评估 AI 智能体。平台基于团队同步发布的 Open Reward Standard(ORS),一个开源 HTTP 协议,环境代码托管在 GitHub,可与任意训练框架和沙盒提供商对接,平台提供可选的托管基础设施,按实际用量计费。
Taylor 此前在 Meta AI 主导了 Llama 2/3 的研发,也是科学大模型 Galactica 的第一作者。他与 Robert Stojnic 于 2018 年联合创建 Papers with Code,后被 Meta 收购,去年关闭。General Reasoning 成立于 2025 年,去年完成 1090 万美元融资。
首批上线的重点环境包括:
1. 英伟达 Nemotron-Math-Proofs-v1:约 58 万道数学证明题,附带 90 万条推理轨迹
2. Nebius 的 SWE-rebench-V2:覆盖 Python、JavaScript、Go、Rust 的 3.2 万多个软件工程任务
3. Eigent 的 SETA:面向 CLI 操作的训练环境,提供 1000 至 1 万个任务
4. EndlessTerminals:程序化生成的终端任务环境
平台目前为公开测试版,训练功能以早期研究预览形式开放,计算资源有限。
信源:https://www.gr.inc/releases/introducing-openreward
Papers with Code 联合创始人 Ross Taylor 创办的伦敦 AI 研发公司 General Reasoning 发布开放平台 OpenReward,提供 330 多个强化学习环境和超 450 万个独立任务,开发者通过单一 API 即可训练和评估 AI 智能体。平台基于团队同步发布的 Open Reward Standard(ORS),一个开源 HTTP 协议,环境代码托管在 GitHub,可与任意训练框架和沙盒提供商对接,平台提供可选的托管基础设施,按实际用量计费。
Taylor 此前在 Meta AI 主导了 Llama 2/3 的研发,也是科学大模型 Galactica 的第一作者。他与 Robert Stojnic 于 2018 年联合创建 Papers with Code,后被 Meta 收购,去年关闭。General Reasoning 成立于 2025 年,去年完成 1090 万美元融资。
首批上线的重点环境包括:
1. 英伟达 Nemotron-Math-Proofs-v1:约 58 万道数学证明题,附带 90 万条推理轨迹
2. Nebius 的 SWE-rebench-V2:覆盖 Python、JavaScript、Go、Rust 的 3.2 万多个软件工程任务
3. Eigent 的 SETA:面向 CLI 操作的训练环境,提供 1000 至 1 万个任务
4. EndlessTerminals:程序化生成的终端任务环境
平台目前为公开测试版,训练功能以早期研究预览形式开放,计算资源有限。
信源:https://www.gr.inc/releases/introducing-openreward
Figure创始人自掏1亿美元做「个人AI」:前苹果iPhone Air设计师加盟,要造一系列AI硬件
人形机器人公司 Figure CEO Brett Adcock 宣布创办新 AI 实验室 Hark,目标是打造「全球最先进的个人智能」,将自研多模态模型与定制硬件深度整合,构建人与机器之间的通用交互界面。Hark 已秘密运营 8 个月,由 Adcock 个人出资 1 亿美元启动,据福布斯估算其净资产为 191 亿美元。
Adcock 对 Bloomberg 表示,Hark 正在开发「一系列 AI 设备,既有个人用的,也有家庭用的」,形态将有别于现有的手机、可穿戴设备和智能眼镜。首批 AI 模型计划今年夏天发布,硬件随后跟进。
团队方面,前苹果工业设计师 Abidur Chowdhury 出任设计负责人,他在苹果工作七年,参与了 iPhone 和 Mac 产品线设计,包括近期的 iPhone Air。硬件团队还引入了苹果资深员工 David Narajowski 和 Dave Wilkes。AI 研究侧从 Meta 超级智能实验室(Superintelligence Lab)招入多名高级研究员。团队目前约 45 人,预计上半年扩至 100 人,成员还来自谷歌、亚马逊和特斯拉。Hark 已与英伟达达成算力协议,数千块 GPU 将于下月上线用于模型训练。
Adcock 是连续创业者,2022 年创办的 Figure 最近一轮估值 390 亿美元,此前还创办了招聘平台 Vettery(1 亿美元退出)、电动垂直起降飞行器公司 Archer(NYSE: ACHR)和武器检测公司 Cover。Figure 将保持独立运营。
信源:https://x.com/adcock_brett/status/2036461258443202810
人形机器人公司 Figure CEO Brett Adcock 宣布创办新 AI 实验室 Hark,目标是打造「全球最先进的个人智能」,将自研多模态模型与定制硬件深度整合,构建人与机器之间的通用交互界面。Hark 已秘密运营 8 个月,由 Adcock 个人出资 1 亿美元启动,据福布斯估算其净资产为 191 亿美元。
Adcock 对 Bloomberg 表示,Hark 正在开发「一系列 AI 设备,既有个人用的,也有家庭用的」,形态将有别于现有的手机、可穿戴设备和智能眼镜。首批 AI 模型计划今年夏天发布,硬件随后跟进。
团队方面,前苹果工业设计师 Abidur Chowdhury 出任设计负责人,他在苹果工作七年,参与了 iPhone 和 Mac 产品线设计,包括近期的 iPhone Air。硬件团队还引入了苹果资深员工 David Narajowski 和 Dave Wilkes。AI 研究侧从 Meta 超级智能实验室(Superintelligence Lab)招入多名高级研究员。团队目前约 45 人,预计上半年扩至 100 人,成员还来自谷歌、亚马逊和特斯拉。Hark 已与英伟达达成算力协议,数千块 GPU 将于下月上线用于模型训练。
Adcock 是连续创业者,2022 年创办的 Figure 最近一轮估值 390 亿美元,此前还创办了招聘平台 Vettery(1 亿美元退出)、电动垂直起降飞行器公司 Archer(NYSE: ACHR)和武器检测公司 Cover。Figure 将保持独立运营。
信源:https://x.com/adcock_brett/status/2036461258443202810