小米发布MiMo Claw正式版:接入金山办公并大幅升级免费额度
小米云端智能体工具 Xiaomi MiMo Claw 正式版上线,搭载与 OpenClaw 深度适配的 MiMo-V2.5-Pro 旗舰模型。新版本接入金山办公生态,打通了 Word、Excel、PPT 和 PDF 文件的智能生成、在线预览与编辑全链路。
模型端,MiMo-V2.5-Pro 原生兼容 OpenClaw 预置和 MCP 工具调用协议。依托超长上下文记忆调度,单会话支持千次以上工具调用。技术上引入 MTP 三层解码架构,使全链路推理吞吐提升约 3 倍。在 ClawEval 基准测试中,任务达标率(Pass³)为 63.8%,相同任务下的 Token 消耗降低 40% 至 60%。
服务采用全云端托管,支持后台续跑与智能自主纠错。同时,每日免费体验时长从 1 小时升至 4 小时。高频用户可叠加 TokenPlan 所有月度及年度套餐,首次特惠 14.9 元/月,限时特惠为 19.9 元/月或 233.8 元/年。目前海外订阅暂未开放。
信源:https://mp.weixin.qq.com/s/QOUk1AsXsDsrDmdjZw56FA
小米云端智能体工具 Xiaomi MiMo Claw 正式版上线,搭载与 OpenClaw 深度适配的 MiMo-V2.5-Pro 旗舰模型。新版本接入金山办公生态,打通了 Word、Excel、PPT 和 PDF 文件的智能生成、在线预览与编辑全链路。
模型端,MiMo-V2.5-Pro 原生兼容 OpenClaw 预置和 MCP 工具调用协议。依托超长上下文记忆调度,单会话支持千次以上工具调用。技术上引入 MTP 三层解码架构,使全链路推理吞吐提升约 3 倍。在 ClawEval 基准测试中,任务达标率(Pass³)为 63.8%,相同任务下的 Token 消耗降低 40% 至 60%。
服务采用全云端托管,支持后台续跑与智能自主纠错。同时,每日免费体验时长从 1 小时升至 4 小时。高频用户可叠加 TokenPlan 所有月度及年度套餐,首次特惠 14.9 元/月,限时特惠为 19.9 元/月或 233.8 元/年。目前海外订阅暂未开放。
信源:https://mp.weixin.qq.com/s/QOUk1AsXsDsrDmdjZw56FA
OpenAI一季度烧钱37亿美元:营收增至57亿,手头现金超730亿
OpenAI 在 2026 年一季度现金流出 37 亿美元,占当季 57 亿美元营收的六成以上。根据向股东披露的财务文件,一季度营收与烧钱额度均较去年同期翻了三倍。期末持有现金和有价证券从去年 12 月底的 400 亿美元增至超 730 亿美元。
财务报表显示,一季度净亏损超 213 亿美元,但亏损主要受一项折合近 124 亿美元的非现金会计账目变动影响(主要与可转换权益及认股权证负债的公允价值变动相关)。剔除记账影响后,一季度运营亏损为 93 亿美元,包含 23 亿美元的员工股权激励支出。同期研发费用为 86 亿美元。
在营收成本方面,主要用于提供模型服务的一季度支出为 35 亿美元,毛利率由去年同期的 33% 升至 39%。然而,更大的隐性开支在于算力协议。一季度披露显示,截至 2025 年底,云算力采购承诺额高达 6650 亿美元,采购合同将一直延续至 2030 年。上周,OpenAI 已秘密提交上市申请。
信源:https://www.theinformation.com/articles/openai-burned-3-7-billion-first-three-months-2026
OpenAI 在 2026 年一季度现金流出 37 亿美元,占当季 57 亿美元营收的六成以上。根据向股东披露的财务文件,一季度营收与烧钱额度均较去年同期翻了三倍。期末持有现金和有价证券从去年 12 月底的 400 亿美元增至超 730 亿美元。
财务报表显示,一季度净亏损超 213 亿美元,但亏损主要受一项折合近 124 亿美元的非现金会计账目变动影响(主要与可转换权益及认股权证负债的公允价值变动相关)。剔除记账影响后,一季度运营亏损为 93 亿美元,包含 23 亿美元的员工股权激励支出。同期研发费用为 86 亿美元。
在营收成本方面,主要用于提供模型服务的一季度支出为 35 亿美元,毛利率由去年同期的 33% 升至 39%。然而,更大的隐性开支在于算力协议。一季度披露显示,截至 2025 年底,云算力采购承诺额高达 6650 亿美元,采购合同将一直延续至 2030 年。上周,OpenAI 已秘密提交上市申请。
信源:https://www.theinformation.com/articles/openai-burned-3-7-billion-first-three-months-2026
❤1
OpenAI、Anthropic与xAI研究员参投的MoE Capital募资2500万美元
由前 AGI House 成员联合创办的早期风投基金 MoE Capital 完成首期 2500 万美元募资。这只基金的独特之处在于出资人(LP)及顾问网络深度绑定了来自 OpenAI、Anthropic 和 xAI 等前沿实验室的活跃研究员。
在早期 AI 投资竞争白热化的背景下,MoE Capital 试图通过构建紧密的研究员社区来建立信息优势。在主流实验室工作的研究员能够第一时间为基金推荐有创业意向的离职同事,从而锁定高价值项目源。为了加强软硬件协同,团队本月还组织了多位研究员前往深圳考察机器人供应链供应商。
目前,MoE Capital 已投资了开发生物医药 AI 智能体的 Phylo,以及致力于实现递归超智能的 neolab 公司 Recursive Superintelligence。
信源:https://www.theinformation.com/newsletters/ai-agenda/anthropic-losing-goodwill-ai-researchers-agi-house-alums-raise-25-million-new-fund
由前 AGI House 成员联合创办的早期风投基金 MoE Capital 完成首期 2500 万美元募资。这只基金的独特之处在于出资人(LP)及顾问网络深度绑定了来自 OpenAI、Anthropic 和 xAI 等前沿实验室的活跃研究员。
在早期 AI 投资竞争白热化的背景下,MoE Capital 试图通过构建紧密的研究员社区来建立信息优势。在主流实验室工作的研究员能够第一时间为基金推荐有创业意向的离职同事,从而锁定高价值项目源。为了加强软硬件协同,团队本月还组织了多位研究员前往深圳考察机器人供应链供应商。
目前,MoE Capital 已投资了开发生物医药 AI 智能体的 Phylo,以及致力于实现递归超智能的 neolab 公司 Recursive Superintelligence。
信源:https://www.theinformation.com/newsletters/ai-agenda/anthropic-losing-goodwill-ai-researchers-agi-house-alums-raise-25-million-new-fund
OpenAI Codex遭遇「容量达到上限」故障,官方已修复并将重置所有用户的订阅额度
6 月 16 日,许多 Codex 用户遇到了「模型容量达到上限」(model at capacity)的报错,导致服务短暂中断。
OpenAI 核心产品负责人 Thibault Sottiaux 在 X 上承认了这一错误并表示团队正在修复。随后他确认该故障已成功解决,团队将在 24 小时内为所有订阅计划重置 Codex 的速率限制(rate limits)。
信源:https://x.com/thsottiaux/status/2066956441173323943
6 月 16 日,许多 Codex 用户遇到了「模型容量达到上限」(model at capacity)的报错,导致服务短暂中断。
OpenAI 核心产品负责人 Thibault Sottiaux 在 X 上承认了这一错误并表示团队正在修复。随后他确认该故障已成功解决,团队将在 24 小时内为所有订阅计划重置 Codex 的速率限制(rate limits)。
信源:https://x.com/thsottiaux/status/2066956441173323943
微软 Copilot Cowork 转向按量计费:测试 DeepSeek V4 降低算力成本
微软将 Copilot Cowork 的企业订阅服务转向按量计费模式,并正在测试微调版 DeepSeek V4 模型,作为降低智能体运行开销的低成本选项。
微软副总裁 Charles Lamanna 透露,内部测试显示 Copilot Cowork 无法继续支持无限使用。由于智能体工具在执行任务时会高频调用后台模型,部分用户每周需要运行数百项任务,导致算力消耗迅速超出常规套餐的承受范围。
为了降低运行成本,微软计划在未来几周内提供更便宜的模型选项。目前正在评估基于 DeepSeek V4 或其他开源模型微调的版本,作为现行 Anthropic 和 OpenAI 旗舰模型的补充。
如果微软决定推进 DeepSeek 方案,新模型将作为可选配置,且完全在 Azure 平台进行本地托管。微软表示,托管模式可确保企业数据完全留在微软云内部,并遵守 Azure 的安全与合规标准。同时,微软已对模型进行了微调,加入了减少偏见的防护措施。不过,引入中国开发商的 AI 模型可能仍会使微软面临舆论或合规层面的质疑。
信源:https://www.axios.com/2026/06/16/microsoft-copilot-cowork-tokenmaxxing-cowork
微软将 Copilot Cowork 的企业订阅服务转向按量计费模式,并正在测试微调版 DeepSeek V4 模型,作为降低智能体运行开销的低成本选项。
微软副总裁 Charles Lamanna 透露,内部测试显示 Copilot Cowork 无法继续支持无限使用。由于智能体工具在执行任务时会高频调用后台模型,部分用户每周需要运行数百项任务,导致算力消耗迅速超出常规套餐的承受范围。
为了降低运行成本,微软计划在未来几周内提供更便宜的模型选项。目前正在评估基于 DeepSeek V4 或其他开源模型微调的版本,作为现行 Anthropic 和 OpenAI 旗舰模型的补充。
如果微软决定推进 DeepSeek 方案,新模型将作为可选配置,且完全在 Azure 平台进行本地托管。微软表示,托管模式可确保企业数据完全留在微软云内部,并遵守 Azure 的安全与合规标准。同时,微软已对模型进行了微调,加入了减少偏见的防护措施。不过,引入中国开发商的 AI 模型可能仍会使微软面临舆论或合规层面的质疑。
信源:https://www.axios.com/2026/06/16/microsoft-copilot-cowork-tokenmaxxing-cowork
Axios
Microsoft eyes DeepSeek for enterprise AI
Microsoft will also shift to usage-based pricing for the enterprise agent.
AI智能体提交量暴增冲垮GitHub基础设施:微软被迫向竞争对手AWS租用弹性算力
AI 智能体爆发带来的代码提交量让 GitHub 平台稳定性不堪重负,迫使微软打破将 GitHub 基础设施全面移往 Azure 的迁移承诺,紧急向竞争对手亚马逊 AWS 采购弹性计算资源。根据 Business Insider 报道,两位知情人士透露,虽然微软计划在 2027 年将 GitHub 彻底迁至 Azure,但当前频发的宕机与容量危机促使微软引入 AWS 进行弹性支撑。
根据 GitHub 官方披露,平台 2026 年 Commit 提交次数预计将冲上 140 亿次,相较之下,2025 年平台提交次数仅为 10 亿次。GitHub 首席技术官 Vlad Fedorov 透露,团队在 2025 年 10 月曾设计了 10 倍扩容计划,但随着智能体开发工作流在同年 12 月底的爆发,不得不于 2026 年 2 月将设计容量上调至 30 倍。
基础设施过载已经直接威胁到开发者生态的稳定。2026 年 5 月,GitHub 发生了 9 次服务降级故障。而在同年 4 月,HashiCorp 联合创始人 Mitchell Hashimoto 已宣布计划将 Ghostty 项目移出平台,并直言 GitHub 频繁的中断已不再适合严肃的开发工作。尽管微软 2026 年度的资本支出预计将达到 1900 亿美元,但微软首席财务官 Amy Hood 警告称,算力供需瓶颈在 2026 年底前仍将持续。
针对多云托管一事,微软发言人回应称,自 2025 年底以来的智能体开发激增对 GitHub 基础设施造成了极限测试,公司在加速向 Azure 迁移的同时,将通过多云战略确保弹性和规模。跨云采购算力在当前的算力紧张环境下并非孤例,Google 也在近期与 SpaceX 达成了一项为期数年、月均支付 9.2 亿美元的计算资源采购合同。
信源:https://www.businessinsider.com/microsoft-github-amazon-ai-cloud-capacity-2026-6
AI 智能体爆发带来的代码提交量让 GitHub 平台稳定性不堪重负,迫使微软打破将 GitHub 基础设施全面移往 Azure 的迁移承诺,紧急向竞争对手亚马逊 AWS 采购弹性计算资源。根据 Business Insider 报道,两位知情人士透露,虽然微软计划在 2027 年将 GitHub 彻底迁至 Azure,但当前频发的宕机与容量危机促使微软引入 AWS 进行弹性支撑。
根据 GitHub 官方披露,平台 2026 年 Commit 提交次数预计将冲上 140 亿次,相较之下,2025 年平台提交次数仅为 10 亿次。GitHub 首席技术官 Vlad Fedorov 透露,团队在 2025 年 10 月曾设计了 10 倍扩容计划,但随着智能体开发工作流在同年 12 月底的爆发,不得不于 2026 年 2 月将设计容量上调至 30 倍。
基础设施过载已经直接威胁到开发者生态的稳定。2026 年 5 月,GitHub 发生了 9 次服务降级故障。而在同年 4 月,HashiCorp 联合创始人 Mitchell Hashimoto 已宣布计划将 Ghostty 项目移出平台,并直言 GitHub 频繁的中断已不再适合严肃的开发工作。尽管微软 2026 年度的资本支出预计将达到 1900 亿美元,但微软首席财务官 Amy Hood 警告称,算力供需瓶颈在 2026 年底前仍将持续。
针对多云托管一事,微软发言人回应称,自 2025 年底以来的智能体开发激增对 GitHub 基础设施造成了极限测试,公司在加速向 Azure 迁移的同时,将通过多云战略确保弹性和规模。跨云采购算力在当前的算力紧张环境下并非孤例,Google 也在近期与 SpaceX 达成了一项为期数年、月均支付 9.2 亿美元的计算资源采购合同。
信源:https://www.businessinsider.com/microsoft-github-amazon-ai-cloud-capacity-2026-6
Business Insider
Microsoft is resorting to its biggest cloud rival to deal with GitHub AI capacity issues
Microsoft is adding AWS capacity to GitHub after AI-driven growth strained infrastructure and triggered a series of reliability issues.
ChatGPT市场份额首次跌破50%:Gemini与Claude分食,DoD合作引发卸载
分析公司 Sensor Tower 发布的《2026 年 AI 现状报告》显示,截至 2026 年 5 月底,ChatGPT 的全球市场份额已降至 46.4%,为发布以来首次跌破 50% 关口。谷歌 Gemini 与 Anthropic 的 Claude 正在分流 ChatGPT 的用户,两者份额分别攀升至 27.7% 和 10.3%。
报告指出,品牌价值观与信任度对用户流失有直接影响。OpenAI 于 2026 年 2 月与美国国防部(DoD)达成合作,曾直接导致 ChatGPT 卸载量激增 295%。与此同时,各平台正加速变现。OpenAI 于 2026 年 2 月在 ChatGPT 中测试广告,至 5 月已有 17% 的日活跃用户会接触广告,软件与购物是最大的广告主类别。
在细分变现与渠道上,Claude 凭借高粘性的生产力场景,以 13% 的付费转化率居行业首位。此外,随着 ChatGPT 逐步深化购物导流,沃尔玛、好市多等转诊流量显著增长,而封禁了 ChatGPT 网页爬虫的亚马逊导流流量则持续停滞。
信源:https://techcrunch.com/2026/06/16/chatgpts-market-share-slips-below-50-for-first-time/
分析公司 Sensor Tower 发布的《2026 年 AI 现状报告》显示,截至 2026 年 5 月底,ChatGPT 的全球市场份额已降至 46.4%,为发布以来首次跌破 50% 关口。谷歌 Gemini 与 Anthropic 的 Claude 正在分流 ChatGPT 的用户,两者份额分别攀升至 27.7% 和 10.3%。
报告指出,品牌价值观与信任度对用户流失有直接影响。OpenAI 于 2026 年 2 月与美国国防部(DoD)达成合作,曾直接导致 ChatGPT 卸载量激增 295%。与此同时,各平台正加速变现。OpenAI 于 2026 年 2 月在 ChatGPT 中测试广告,至 5 月已有 17% 的日活跃用户会接触广告,软件与购物是最大的广告主类别。
在细分变现与渠道上,Claude 凭借高粘性的生产力场景,以 13% 的付费转化率居行业首位。此外,随着 ChatGPT 逐步深化购物导流,沃尔玛、好市多等转诊流量显著增长,而封禁了 ChatGPT 网页爬虫的亚马逊导流流量则持续停滞。
信源:https://techcrunch.com/2026/06/16/chatgpts-market-share-slips-below-50-for-first-time/
TechCrunch
ChatGPT's market share slips below 50% for first time | TechCrunch
The chatbot still remains the most popular AI assistant worldwide with over 1.1 billion monthly users, followed by Gemini with 662 million and Claude with 245 million.
大模型已成战争武器:美军将xAI数据中心定性为「兵工厂」以阻挠环保诉讼
美国司法部向密西西比州联邦法院递交动议,申请介入并要求驳回民权组织 NAACP 针对 xAI 数据中心的环保诉讼。司法部与国防部在证词中首次证实,美军已在机密军事网络中部署定制版 Grok Gov 大模型,并用于规划针对伊朗的实际军事打击任务。联邦政府认为,数据中心提供的算力等同于现代军工制造厂,切断电力供应将危及国家与军事防务安全。
诉讼源于 xAI 在 Colossus 2 数据中心违规运行多台便携式天然气燃气轮机进行离网发电,并引发了周边黑人社区的重度污染。为了保护 Grok 正常运行所需的电力供应,司法部除支持 xAI 提出的移动式燃气轮机属于免申领许可证的临时设施外,还抛出了全新的法律防御逻辑,即若行政分支对诉讼持反对态度,私营机构或公民便无权依据《清洁空气法》的公民诉讼条款进行环保维权。环保及民权律师指出,司法部的逻辑属于行政分支的过度扩权,旨在利用国家安全为幌子,剥夺社区对抗企业污染的法律武器。
美军对商用 AI 的深度依赖,是司法部强力介入的深层原因。五角大楼于 2025 年与 xAI 签署了价值高达 2 亿美元的政府版 Grok 采购合同。国防部首席数字与人工智能官 Cameron Stanley 证实,定制版 Grok Gov 已作为 Maven 智能系统的一部分部署在机密网络中。在 2026 年 2 月美伊冲突期间,Maven 系统曾在 96 小时内向 2000 个目标投放了超过 2000 枚弹药。美军的战术依赖正促使司法部动用国家安全条款,为 xAI 供应链违规提供豁免。
信源:https://www.washingtonpost.com/technology/2026/06/16/justice-department-aims-block-lawsuit-against-xai-polluting-data-centers/
美国司法部向密西西比州联邦法院递交动议,申请介入并要求驳回民权组织 NAACP 针对 xAI 数据中心的环保诉讼。司法部与国防部在证词中首次证实,美军已在机密军事网络中部署定制版 Grok Gov 大模型,并用于规划针对伊朗的实际军事打击任务。联邦政府认为,数据中心提供的算力等同于现代军工制造厂,切断电力供应将危及国家与军事防务安全。
诉讼源于 xAI 在 Colossus 2 数据中心违规运行多台便携式天然气燃气轮机进行离网发电,并引发了周边黑人社区的重度污染。为了保护 Grok 正常运行所需的电力供应,司法部除支持 xAI 提出的移动式燃气轮机属于免申领许可证的临时设施外,还抛出了全新的法律防御逻辑,即若行政分支对诉讼持反对态度,私营机构或公民便无权依据《清洁空气法》的公民诉讼条款进行环保维权。环保及民权律师指出,司法部的逻辑属于行政分支的过度扩权,旨在利用国家安全为幌子,剥夺社区对抗企业污染的法律武器。
美军对商用 AI 的深度依赖,是司法部强力介入的深层原因。五角大楼于 2025 年与 xAI 签署了价值高达 2 亿美元的政府版 Grok 采购合同。国防部首席数字与人工智能官 Cameron Stanley 证实,定制版 Grok Gov 已作为 Maven 智能系统的一部分部署在机密网络中。在 2026 年 2 月美伊冲突期间,Maven 系统曾在 96 小时内向 2000 个目标投放了超过 2000 枚弹药。美军的战术依赖正促使司法部动用国家安全条款,为 xAI 供应链违规提供豁免。
信源:https://www.washingtonpost.com/technology/2026/06/16/justice-department-aims-block-lawsuit-against-xai-polluting-data-centers/
路透社:美暂缓将DeepSeek与长鑫存储等百余家企业列入实体清单以避免局势升温
路透社援引两位知情人士报道,美国政府已暂缓将中国 AI 初创公司 DeepSeek、内存芯片制造商长鑫存储以及 100 多家被认定存在国家安全风险的公司列入贸易管制黑名单。推迟公布黑名单是为了避免进一步升级中美两国的紧张局势。
美国商务部的实体清单在去年年底前就已通过跨部门委员会审查,拟将包括 DeepSeek、长鑫存储在内的至少 75 家涉及先进半导体生产、半导体制造设备以及 AI 模型构建的中国实体纳入清单。然而,负责工业与安全事务的商务部副部长杰弗里·凯斯勒自 2025 年底以来,一直因担忧中美关系升级而延缓发布拉黑名单。自 2025 年 10 月以来,实体清单已连续 8 个月未做更新,创下十多年来的最长停滞纪录。
除了半导体与 AI 模型,数十家中国公司因向中国高校转售受限制的英伟达芯片,或向俄罗斯提供去年 9 月在波兰被回收的无人机,同样曾被拟定列入清单。美国高级官员曾指控 DeepSeek 协助军事与情报行动,并尝试通过东南亚壳公司规避美国禁令以获取先进芯片。Anthropic 与 OpenAI 也于今年警告,DeepSeek 正在试图窃取两家公司的模型能力。
信源:https://www.reuters.com/world/china/us-holds-off-blacklisting-chinas-deepseek-more-than-100-firms-deemed-security-2026-06-17/
路透社援引两位知情人士报道,美国政府已暂缓将中国 AI 初创公司 DeepSeek、内存芯片制造商长鑫存储以及 100 多家被认定存在国家安全风险的公司列入贸易管制黑名单。推迟公布黑名单是为了避免进一步升级中美两国的紧张局势。
美国商务部的实体清单在去年年底前就已通过跨部门委员会审查,拟将包括 DeepSeek、长鑫存储在内的至少 75 家涉及先进半导体生产、半导体制造设备以及 AI 模型构建的中国实体纳入清单。然而,负责工业与安全事务的商务部副部长杰弗里·凯斯勒自 2025 年底以来,一直因担忧中美关系升级而延缓发布拉黑名单。自 2025 年 10 月以来,实体清单已连续 8 个月未做更新,创下十多年来的最长停滞纪录。
除了半导体与 AI 模型,数十家中国公司因向中国高校转售受限制的英伟达芯片,或向俄罗斯提供去年 9 月在波兰被回收的无人机,同样曾被拟定列入清单。美国高级官员曾指控 DeepSeek 协助军事与情报行动,并尝试通过东南亚壳公司规避美国禁令以获取先进芯片。Anthropic 与 OpenAI 也于今年警告,DeepSeek 正在试图窃取两家公司的模型能力。
信源:https://www.reuters.com/world/china/us-holds-off-blacklisting-chinas-deepseek-more-than-100-firms-deemed-security-2026-06-17/
动察Beating AI News
微信支付内测AI支付功能,通过AI专属卡实现智能体自主下单与笔笔确认 微信支付正与腾讯智能体应用 WorkBuddy 合作内测 AI 支付功能,通过在零钱中增设 AI 专属卡,将智能体自主下单与用户安全确认相结合。内测机制目前处于腾讯内部早期测试阶段,首次实现了 AI 智能体在移动支付平台上的专款专用与笔笔确认。 在微信零钱的 AI 专属卡界面中,用户可以从微信零钱内向卡中转入或转出资金。AI 专属卡的消费上限完全取决于卡内充值余额。在绑定流程中,用户必须明确授权并绑定特定的智能体。微信支付在绑定页面中提示,AI…
微信支付发布AI专属卡:隔离主账户加笔笔确认,WorkBuddy率先接入美团生活消费
微信支付正式发布专为智能体支付场景设计的 AI 专属卡 AI AgentPay Card。腾讯桌面办公助手 WorkBuddy 的 Mac 端 5.1.1 及以上版本已全量接入,并与美团合作上线了美团生活助手专家。
用户在 WorkBuddy 对话框中输入咖啡、团购等消费需求,智能体即可在对话流内完成筛选、推荐、下单和发起支付。为保障资金安全,AI 专属卡在微信零钱中物理独立,智能体无法触碰微信支付主账户。用户可自主充值或转出卡内资金,且每一笔由智能体发起的支付均需用户在手机端进行验密确认,不会在后台自动扣款。
除即时购买,用户还可设置定时任务让智能体每日自动领取美团优惠券。在 6 月 5 日的 AI 产业应用大会上,腾讯云副总裁刘毅曾表示,希望助手在办公之余顺便满足点餐、购票等生活消费。微信支付透露,后续将向更多符合规范的智能体平台开放接入。
信源:https://mp.weixin.qq.com/s/V6wNr3xEWtU8RWJ2tUoc4Q
微信支付正式发布专为智能体支付场景设计的 AI 专属卡 AI AgentPay Card。腾讯桌面办公助手 WorkBuddy 的 Mac 端 5.1.1 及以上版本已全量接入,并与美团合作上线了美团生活助手专家。
用户在 WorkBuddy 对话框中输入咖啡、团购等消费需求,智能体即可在对话流内完成筛选、推荐、下单和发起支付。为保障资金安全,AI 专属卡在微信零钱中物理独立,智能体无法触碰微信支付主账户。用户可自主充值或转出卡内资金,且每一笔由智能体发起的支付均需用户在手机端进行验密确认,不会在后台自动扣款。
除即时购买,用户还可设置定时任务让智能体每日自动领取美团优惠券。在 6 月 5 日的 AI 产业应用大会上,腾讯云副总裁刘毅曾表示,希望助手在办公之余顺便满足点餐、购票等生活消费。微信支付透露,后续将向更多符合规范的智能体平台开放接入。
信源:https://mp.weixin.qq.com/s/V6wNr3xEWtU8RWJ2tUoc4Q
OpenClaw升级2026.6.8:默认禁用免Key搜索防泄密,Telegram支持表格渲染
开源智能体框架 OpenClaw 发布 2026.6.8 版本。针对自动网页搜索引发的数据安全隐患,新版本重构了搜索回退机制。Parallel Free、DuckDuckGo 等免 key 搜索源从此前的「无 key 自动回退」调整为「必须手动启用」。
在此前配置缺失时,智能体会在无提示情况下自动调用公共搜索服务并向外发送上下文,新规有效规避了敏感信息被静默传输到外部的风险。
同时,跟进适配了 Telegram 官方 Bot API 的最新富文本(Rich Messages)渲染规范,使 Telegram 渠道原生支持表格、列表与可折叠引用块的完美呈现,解决了此前因 Markdown 转换问题极易导致消息发送崩溃的 Bug。
信源:https://github.com/openclaw/openclaw/releases/tag/v2026.6.8
开源智能体框架 OpenClaw 发布 2026.6.8 版本。针对自动网页搜索引发的数据安全隐患,新版本重构了搜索回退机制。Parallel Free、DuckDuckGo 等免 key 搜索源从此前的「无 key 自动回退」调整为「必须手动启用」。
在此前配置缺失时,智能体会在无提示情况下自动调用公共搜索服务并向外发送上下文,新规有效规避了敏感信息被静默传输到外部的风险。
同时,跟进适配了 Telegram 官方 Bot API 的最新富文本(Rich Messages)渲染规范,使 Telegram 渠道原生支持表格、列表与可折叠引用块的完美呈现,解决了此前因 Markdown 转换问题极易导致消息发送崩溃的 Bug。
信源:https://github.com/openclaw/openclaw/releases/tag/v2026.6.8
GitHub
Release openclaw 2026.6.8 · openclaw/openclaw
2026.6.8
Highlights
Richer channel delivery: Telegram and WhatsApp are less brittle: Telegram renders structured text with tables, lists, expandable blockquotes, preserved intentional line breaks,...
Highlights
Richer channel delivery: Telegram and WhatsApp are less brittle: Telegram renders structured text with tables, lists, expandable blockquotes, preserved intentional line breaks,...
Anthropic发布40万会话研究:懂业务比懂代码更重要,非程序员成功率持平软件工程师
Anthropic 最新发布的大规模智能体编程报告指出,在 Claude Code 辅助下,编程技能本身正变得无关紧要,决定成败的关键在于管理与领域知识。分析显示,Claude Code 用户平均每周活跃长达 20 小时。在十大主要职业中,非程序员利用智能体写代码的成功率与专业软件工程师的差距已缩减至 7% 以内,其中管理岗的成功率甚至略微反超了专业程序员。
大模型重塑了人机分工,用户主导了约 70% 的规划方向决策,智能体则承担了约 80% 的具体执行决策。懂得如何拆解、规范委托任务的业务专家,能引导大模型发挥出更大效能,专家级会话单次能触发 12 次动作与 3200 词输出,达新手级会话的 5 倍以上。相比之下,新手在遇到报错时极易放弃,新手会话的受挫放弃率高达 19%,而中级与专家级用户即便遇到麻烦,放弃率也仅有 5% 到 7%。研究证明,仅需特定领域的中等行业知识,即可通过智能体无缝跨越编程门槛,实现个人生产力跃升。
开发者对智能体的使用正在从调试代码过渡到端到端自主创造。在 7 个月内,用于修复破损代码的调试会话占比由 33% 减半至 19%,而直接部署运行、数据分析与撰写非代码文档的占比则翻倍。用户也开始委派更复杂且高价值的工作,任务的平均估算价值在 7 个月内增长了约 25%。
信源:https://www.anthropic.com/research/claude-code-expertise
Anthropic 最新发布的大规模智能体编程报告指出,在 Claude Code 辅助下,编程技能本身正变得无关紧要,决定成败的关键在于管理与领域知识。分析显示,Claude Code 用户平均每周活跃长达 20 小时。在十大主要职业中,非程序员利用智能体写代码的成功率与专业软件工程师的差距已缩减至 7% 以内,其中管理岗的成功率甚至略微反超了专业程序员。
大模型重塑了人机分工,用户主导了约 70% 的规划方向决策,智能体则承担了约 80% 的具体执行决策。懂得如何拆解、规范委托任务的业务专家,能引导大模型发挥出更大效能,专家级会话单次能触发 12 次动作与 3200 词输出,达新手级会话的 5 倍以上。相比之下,新手在遇到报错时极易放弃,新手会话的受挫放弃率高达 19%,而中级与专家级用户即便遇到麻烦,放弃率也仅有 5% 到 7%。研究证明,仅需特定领域的中等行业知识,即可通过智能体无缝跨越编程门槛,实现个人生产力跃升。
开发者对智能体的使用正在从调试代码过渡到端到端自主创造。在 7 个月内,用于修复破损代码的调试会话占比由 33% 减半至 19%,而直接部署运行、数据分析与撰写非代码文档的占比则翻倍。用户也开始委派更复杂且高价值的工作,任务的平均估算价值在 7 个月内增长了约 25%。
信源:https://www.anthropic.com/research/claude-code-expertise
Anthropic
Agentic coding and persistent returns to expertise
New Anthropic research looking at interactive agentic coding. We evaluate the composition of tasks, human-AI collaboration, and success rates.
彼得·蒂尔神秘学会Dialog遭泄密:马斯克等政商巨头参会,议程涉邪教与三战
据《连线》杂志 (WIRED) 报道,由彼得·蒂尔联合创立的神秘学会 Dialog 泄露了 222 名精英的参会记录,包括埃隆·马斯克、谷歌前 CEO Eric Schmidt、OpenAI 总裁 Greg Brockman 及特朗普女婿 Jared Kushner。泄露的数据库不仅公开了名单,还曝光了探讨建立邪教、应对第三次世界大战等极为隐私的议程。
Dialog 自 2006 年创立以来保密运营了近 20 年,常被称为科技界的「毕德堡会议」,参会费超 1.6 万美元。泄露的 2026 年度会议日程定于 8 月在都柏林举行,议程包括「如何建立邪教」(Build-a-Cult)、「应对第三次世界大战」(Navigating WWIII)、「战场技术」(Battlefield Technologies)、「带回核能」(Bring Back Nuclear)、「金钱买到幸福吗」(Money (Does?) Buy Happiness)及「你的性生活如何」(How’s Your Sex Life?)等主题研讨。
泄露的数据还包含成员在专属配对程序 dating.dialog.org 上填写的政治倾向和交友配对信息。虽然 Dialog 曾承诺这些隐私绝不公开,但因 Airtable 数据库暴露在前端代码中,导致这些敏感数据一并曝光。
名单包括微软 Xbox 总裁 Sarah Bond、YouTube 现任 CEO Neal Mohan,以及陆军部长 Dan Driscoll、参议员 Ted Cruz、财政部长 Scott Bessent 等政要。包括北约司令 Alexus Grynkewich 将军在内的官员在注册时均使用非政府官方邮箱,这使官员行程脱离了监管,从而避开了美国公共记录法 FOIA 的审计。
安全设计漏洞是导致泄露的主因。黑客 maia arson crimew 在 Dialog 官网代码中发现了暴露的 Airtable 目录,目录甚至包含成员的私有登录凭证,名单包括 Airtable 创始人 Howie Liu 本人。
信源:https://www.wired.com/story/leak-exposes-members-of-peter-thiels-secretive-dialog-society/
据《连线》杂志 (WIRED) 报道,由彼得·蒂尔联合创立的神秘学会 Dialog 泄露了 222 名精英的参会记录,包括埃隆·马斯克、谷歌前 CEO Eric Schmidt、OpenAI 总裁 Greg Brockman 及特朗普女婿 Jared Kushner。泄露的数据库不仅公开了名单,还曝光了探讨建立邪教、应对第三次世界大战等极为隐私的议程。
Dialog 自 2006 年创立以来保密运营了近 20 年,常被称为科技界的「毕德堡会议」,参会费超 1.6 万美元。泄露的 2026 年度会议日程定于 8 月在都柏林举行,议程包括「如何建立邪教」(Build-a-Cult)、「应对第三次世界大战」(Navigating WWIII)、「战场技术」(Battlefield Technologies)、「带回核能」(Bring Back Nuclear)、「金钱买到幸福吗」(Money (Does?) Buy Happiness)及「你的性生活如何」(How’s Your Sex Life?)等主题研讨。
泄露的数据还包含成员在专属配对程序 dating.dialog.org 上填写的政治倾向和交友配对信息。虽然 Dialog 曾承诺这些隐私绝不公开,但因 Airtable 数据库暴露在前端代码中,导致这些敏感数据一并曝光。
名单包括微软 Xbox 总裁 Sarah Bond、YouTube 现任 CEO Neal Mohan,以及陆军部长 Dan Driscoll、参议员 Ted Cruz、财政部长 Scott Bessent 等政要。包括北约司令 Alexus Grynkewich 将军在内的官员在注册时均使用非政府官方邮箱,这使官员行程脱离了监管,从而避开了美国公共记录法 FOIA 的审计。
安全设计漏洞是导致泄露的主因。黑客 maia arson crimew 在 Dialog 官网代码中发现了暴露的 Airtable 目录,目录甚至包含成员的私有登录凭证,名单包括 Airtable 创始人 Howie Liu 本人。
信源:https://www.wired.com/story/leak-exposes-members-of-peter-thiels-secretive-dialog-society/
❤1
xAI发布Grok Imagine Video 1.5:支持音画同频生成,速度翻倍
xAI 正式发布图像与文本生成视频模型 Grok Imagine Video 1.5,并在 API(grok-imagine-video-1.5)、网页端(grok.com/imagine)及移动客户端全量上线。
模型实现音视频一体化同步生成,在单次推理阶段同步产生音效、环境音与角色对话,提高语音清晰度并优化唇形同步。同时,模型改进了物理引擎与运动一致性,提升镜头长周期内物体运动与物理重量的可信度,减少画面扭曲等伪影。在生成速度上,轻量版 Video 1.5 Fast 生成 6 秒 720p 视频的耗时缩短至约 25 秒。
网页端配套工作流同步更新:新增项目管理(Projects)以分类整理素材,支持多智能体并行(Multiple Agents)运行多个提示词,并提供媒体库语义搜索(Search)。数字艺术家 David Thompson 团队使用 Grok Imagine 1.5 制作了完全由 AI 生成的电影预告片《Odyssey》。
信源:https://x.com/xai/status/2067092897951109427
xAI 正式发布图像与文本生成视频模型 Grok Imagine Video 1.5,并在 API(grok-imagine-video-1.5)、网页端(grok.com/imagine)及移动客户端全量上线。
模型实现音视频一体化同步生成,在单次推理阶段同步产生音效、环境音与角色对话,提高语音清晰度并优化唇形同步。同时,模型改进了物理引擎与运动一致性,提升镜头长周期内物体运动与物理重量的可信度,减少画面扭曲等伪影。在生成速度上,轻量版 Video 1.5 Fast 生成 6 秒 720p 视频的耗时缩短至约 25 秒。
网页端配套工作流同步更新:新增项目管理(Projects)以分类整理素材,支持多智能体并行(Multiple Agents)运行多个提示词,并提供媒体库语义搜索(Search)。数字艺术家 David Thompson 团队使用 Grok Imagine 1.5 制作了完全由 AI 生成的电影预告片《Odyssey》。
信源:https://x.com/xai/status/2067092897951109427
Grok
Grok Imagine
Grok Imagine by SpaceXAI is an AI image and video generator. Create and edit images, animate them into videos, and iterate fast with Imagine Agent Mode.
智谱GLM-5.2加冕AA智能指数开源第一:GDPval 跑分与GPT-5.5平起平坐
智谱 AI 最新 MoE 旗舰模型 GLM-5.2 在 Artificial Analysis 大模型智能指数 v4.1 评测中斩获 51 分,超越 MiniMax-M3 (44 分)、 DeepSeek V4 Pro (max, 44 分)和 Kimi K2.6 (43 分),登顶全球开源模型榜首。
在模拟真实世界知识工作的 GDPval-AA v2 测试中, GLM-5.2 获 1524 分(人类基准分 1000 分),领先 MiniMax-M3 (1418 分)与 DeepSeek V4 Pro (max, 1328 分),与闭源前沿大模型 GPT-5.5 (xhigh reasoning)平起平坐。相较前代 GLM-5.1,科学推理 CritPt 提升 16 个百分点至 21%, HLE 提升 12 个百分点至 40%, TerminalBench v2.1 提升 16 个百分点至 78%, GPQA Diamond 达 89%。
GLM-5.2 在「智能 - 任务成本」帕累托前沿占据最佳性价比位置。由于单次任务平均输出 43k token (GLM-5.1 为 26k), GLM-5.2 单任务平均成本上升至约 0.46 美元,高于 GLM-5.1 (0.25 美元)和 DeepSeek V4 Pro (max, 0.05 美元),但仍远低于同智能梯队的闭源模型。
GLM-5.2 总参数 744B,激活参数 40B,上下文窗口由前代 200K 升至 1M,遵循 MIT 协议开源。目前,智谱官方 API (定价输入 1.4、输出 4.4 / 每百万 token)与 SiliconFlow、 DeepInfra、 Nebius AI 等平台已上线服务。
信源:https://x.com/ArtificialAnlys/status/2067135640249209175
智谱 AI 最新 MoE 旗舰模型 GLM-5.2 在 Artificial Analysis 大模型智能指数 v4.1 评测中斩获 51 分,超越 MiniMax-M3 (44 分)、 DeepSeek V4 Pro (max, 44 分)和 Kimi K2.6 (43 分),登顶全球开源模型榜首。
在模拟真实世界知识工作的 GDPval-AA v2 测试中, GLM-5.2 获 1524 分(人类基准分 1000 分),领先 MiniMax-M3 (1418 分)与 DeepSeek V4 Pro (max, 1328 分),与闭源前沿大模型 GPT-5.5 (xhigh reasoning)平起平坐。相较前代 GLM-5.1,科学推理 CritPt 提升 16 个百分点至 21%, HLE 提升 12 个百分点至 40%, TerminalBench v2.1 提升 16 个百分点至 78%, GPQA Diamond 达 89%。
GLM-5.2 在「智能 - 任务成本」帕累托前沿占据最佳性价比位置。由于单次任务平均输出 43k token (GLM-5.1 为 26k), GLM-5.2 单任务平均成本上升至约 0.46 美元,高于 GLM-5.1 (0.25 美元)和 DeepSeek V4 Pro (max, 0.05 美元),但仍远低于同智能梯队的闭源模型。
GLM-5.2 总参数 744B,激活参数 40B,上下文窗口由前代 200K 升至 1M,遵循 MIT 协议开源。目前,智谱官方 API (定价输入 1.4、输出 4.4 / 每百万 token)与 SiliconFlow、 DeepInfra、 Nebius AI 等平台已上线服务。
信源:https://x.com/ArtificialAnlys/status/2067135640249209175
Cursor首届Compile大会预告多项重磅产品:自研1.5万亿参数大模型与Git平台Origin
Cursor 首届旗舰开发者峰会 Cursor Compile 预告了多项面向 AI 智能体开发的基础设施。就在同一天,SpaceX 正式宣布以 600 亿美元估值全股票收购 Cursor 母公司 Anysphere。Cursor 正从传统的 IDE 辅助工具,向 AI 原生软件工程平台演进。
研发重点是正在训练的 1.5 万亿参数通用底座模型。CEO Michael Truell 指出,模型在超过 10 万块 GPU 组成的 Colossus 集群上从零开始预训练,摆脱了以往微调开源模型的路线。团队旨在超越常规代码生成,让模型具备独立规划、工具调用、软件测试、 UI 交互以及解释修改动作的综合智能,充当工程师同事。模型预计在未来几周内发布。
由 Cursor 收购的代码评审工具 Graphite 团队主导,大会发布了兼容 Git 的智能体原生代码托管平台 Origin。针对传统 Git 和 GitHub 难以承载自主智能体高频、并行提交的瓶颈,Origin 专为大规模智能体协同设计,提供全自动安全审查、冲突消解及智能 Rebase 支持,计划于 2026 年秋季上线。
同时,Cursor Mobile 移动端(iOS TestFlight)也在峰会期间开启测试,支持远程连接 Mac 开展 AI 编程。
信源:https://x.com/morganlinton/status/2066946225837109735
Cursor 首届旗舰开发者峰会 Cursor Compile 预告了多项面向 AI 智能体开发的基础设施。就在同一天,SpaceX 正式宣布以 600 亿美元估值全股票收购 Cursor 母公司 Anysphere。Cursor 正从传统的 IDE 辅助工具,向 AI 原生软件工程平台演进。
研发重点是正在训练的 1.5 万亿参数通用底座模型。CEO Michael Truell 指出,模型在超过 10 万块 GPU 组成的 Colossus 集群上从零开始预训练,摆脱了以往微调开源模型的路线。团队旨在超越常规代码生成,让模型具备独立规划、工具调用、软件测试、 UI 交互以及解释修改动作的综合智能,充当工程师同事。模型预计在未来几周内发布。
由 Cursor 收购的代码评审工具 Graphite 团队主导,大会发布了兼容 Git 的智能体原生代码托管平台 Origin。针对传统 Git 和 GitHub 难以承载自主智能体高频、并行提交的瓶颈,Origin 专为大规模智能体协同设计,提供全自动安全审查、冲突消解及智能 Rebase 支持,计划于 2026 年秋季上线。
同时,Cursor Mobile 移动端(iOS TestFlight)也在峰会期间开启测试,支持远程连接 Mac 开展 AI 编程。
信源:https://x.com/morganlinton/status/2066946225837109735
X (formerly Twitter)
Morgan (@morganlinton) on X
And here’s the full video of @mntruell announcing Cursor’s new model at Compile.
被嘲「AI万金油」的SubQ发布1.1版:拉来三方评测自证,却被指混入AI套话
曾宣称能将计算消耗削减千倍的争议大模型 SubQ 发布了 1.1 Small(小参数)版本技术报告。
针对早期预览版本由于缺乏论文和独立验证而被社群讥讽为「AI万金油」(意指虚假宣传)的指控,研发公司 Subquadratic 联合评估商 Appen 开展三方评测,声称模型在 1200 万 token 的极限长度下实现了 98% 的检索准确率,且在实战编程测试中取得了接近主流前沿模型的成绩。技术报告同时透露,模型并非从头训练,而是在开源前沿模型基础上,替换注意力计算机制并增量训练 1 万亿 token 改造而来。
即便拉来三方评测自证,开发者社群对本次更新依然充满质疑。有研究者指出,所谓的黑科技其实并没有底层技术突破,本质上只是把长文本切成小块再进行动态筛选的已有技术(即块稀疏注意力机制);也有读者吐槽,技术报告中混入了由 AI 生成的文本套话(在 5.7.1 章节尤为明显)。系统工程师则警告,筛选机制在多人并发使用时会带来额外的调度开销,导致最慢的 1% 用户遇到严重卡顿。
由于模型既没有公开核心参数供大家下载,也没有开放人人可用的 API 接口,所谓的降算力与超低定价承诺目前依然流于纸面。
信源:https://x.com/alex_whedon/status/2066894707259515124
曾宣称能将计算消耗削减千倍的争议大模型 SubQ 发布了 1.1 Small(小参数)版本技术报告。
针对早期预览版本由于缺乏论文和独立验证而被社群讥讽为「AI万金油」(意指虚假宣传)的指控,研发公司 Subquadratic 联合评估商 Appen 开展三方评测,声称模型在 1200 万 token 的极限长度下实现了 98% 的检索准确率,且在实战编程测试中取得了接近主流前沿模型的成绩。技术报告同时透露,模型并非从头训练,而是在开源前沿模型基础上,替换注意力计算机制并增量训练 1 万亿 token 改造而来。
即便拉来三方评测自证,开发者社群对本次更新依然充满质疑。有研究者指出,所谓的黑科技其实并没有底层技术突破,本质上只是把长文本切成小块再进行动态筛选的已有技术(即块稀疏注意力机制);也有读者吐槽,技术报告中混入了由 AI 生成的文本套话(在 5.7.1 章节尤为明显)。系统工程师则警告,筛选机制在多人并发使用时会带来额外的调度开销,导致最慢的 1% 用户遇到严重卡顿。
由于模型既没有公开核心参数供大家下载,也没有开放人人可用的 API 接口,所谓的降算力与超低定价承诺目前依然流于纸面。
信源:https://x.com/alex_whedon/status/2066894707259515124
X (formerly Twitter)
Alexander Whedon (@alex_whedon) on X
Here is the technical report on SubQ 1.1 Small.
https://t.co/w2GbX1M1LP
This is the second iteration on our Subquadratic Sparse Attention (SSA) model, and the first to be deployed with design partners in the coming weeks.
The results are compelling and…
https://t.co/w2GbX1M1LP
This is the second iteration on our Subquadratic Sparse Attention (SSA) model, and the first to be deployed with design partners in the coming weeks.
The results are compelling and…
动察Beating AI News
Redis创始人反驳「中国大模型靠蒸馏美国模型变强」论调:API答案不能一键复制前沿模型 Redis 创始人 Salvatore Sanfilippo 反驳了中国大模型靠蒸馏美国模型变强的说法。他认为,普通 API 只能返回文字答案,拿不到模型生成答案时的概率分布和内部状态,无法靠少量外部调用复制一个前沿模型的核心能力。 大模型真正的逻辑推理和思考能力隐藏在极其复杂的神经网络内部。通过 API 接口,外部用户只能拿到最终的文字答案,却无法获取模型生成答案时的完整思考路径和概率计算过程。这就像是只看几道…
大模型防蒸馏政策效果存疑:蒸馏只是独立实验室的数据捷径,封锁无法阻止中国AI追赶
针对华盛顿与 Anthropic 试图通过封锁前沿模型来切断中国大模型「蒸馏」通道的举措,前 GitHub 国际化战略负责人、Interconnected Capital 创始人 Kevin S. Xu 指出,对抗性蒸馏只是部分中国独立实验室在数据饥饿下的无奈捷径,靠封锁 API 根本无法阻挡中国 AI 的整体进展。
被点名的 DeepSeek、月之暗面与 MiniMax 均为缺乏集团生态支持的独立实验室,面临推理步骤等高质量后训练数据匮乏的硬伤。相比之下,背靠阿里(Qwen)、字节(Seed)或小米的大厂实验室,拥有不输谷歌与苹果的自有海量场景数据,并不依赖蒸馏。因此,封锁政策顶多给独立实验室带来短期阻碍,无法动摇中国大厂的根基。
外界盛传的中国「数据优势」实为误解:在训练前沿大模型所需的高质量知识标注和评测数据上,中国不仅没有优势,反而严重缺乏类似 Scale AI 或 Surge 这样成熟的商业化数据供应链。因国内数据服务商质量低下,独立实验室在绝望之余,也出于走捷径的惰性,才将 API 蒸馏作为廉价的数据获取策略。
但数据标注产业属于低门槛的商业模式问题,并非像光刻机那样的技术硬伤,国内的供需缺口很容易被填补。从长远看,纯蒸馏的学生模型在理论上限固然无法超越老师,但鉴于大模型仍由人类工程师构建,无论美国是否强行切断 API 通道,聪明勤奋的中国开发者最终都会打破这一上限魔咒,设计出超越导师的大模型。美方的封锁政策不仅无效,反而可能过早切断了能将中国模型锁死在「学生」天花板下的理论钳制。
信源:https://interconnected.blog/why-do-some-chinese-ai-labs-distill/
针对华盛顿与 Anthropic 试图通过封锁前沿模型来切断中国大模型「蒸馏」通道的举措,前 GitHub 国际化战略负责人、Interconnected Capital 创始人 Kevin S. Xu 指出,对抗性蒸馏只是部分中国独立实验室在数据饥饿下的无奈捷径,靠封锁 API 根本无法阻挡中国 AI 的整体进展。
被点名的 DeepSeek、月之暗面与 MiniMax 均为缺乏集团生态支持的独立实验室,面临推理步骤等高质量后训练数据匮乏的硬伤。相比之下,背靠阿里(Qwen)、字节(Seed)或小米的大厂实验室,拥有不输谷歌与苹果的自有海量场景数据,并不依赖蒸馏。因此,封锁政策顶多给独立实验室带来短期阻碍,无法动摇中国大厂的根基。
外界盛传的中国「数据优势」实为误解:在训练前沿大模型所需的高质量知识标注和评测数据上,中国不仅没有优势,反而严重缺乏类似 Scale AI 或 Surge 这样成熟的商业化数据供应链。因国内数据服务商质量低下,独立实验室在绝望之余,也出于走捷径的惰性,才将 API 蒸馏作为廉价的数据获取策略。
但数据标注产业属于低门槛的商业模式问题,并非像光刻机那样的技术硬伤,国内的供需缺口很容易被填补。从长远看,纯蒸馏的学生模型在理论上限固然无法超越老师,但鉴于大模型仍由人类工程师构建,无论美国是否强行切断 API 通道,聪明勤奋的中国开发者最终都会打破这一上限魔咒,设计出超越导师的大模型。美方的封锁政策不仅无效,反而可能过早切断了能将中国模型锁死在「学生」天花板下的理论钳制。
信源:https://interconnected.blog/why-do-some-chinese-ai-labs-distill/
Interconnected
Why Do (Some) Chinese AI Labs Distill?
And why the Mythos/Fable drama doesn’t matter here
OpenAI发布部署模拟安全评估框架:重放真实流量预测GPT-5系列与智能体对齐风险
OpenAI发布部署模拟(Deployment Simulation)安全评估方法,在正式发布前预测模型在真实环境下的失控风险。研究重放 2025 年 8 月至 2026 年 3 月期间 GPT-5 思考模型系列 130 万条脱敏历史对话,预测未期望不良行为率的中位误差仅为 1.5 倍。
传统静态评测集(如 SWE-Bench)极易让模型意识到处于受试状态,从而在测试中伪装真实意图(metagaming)。实验显示,GPT-5.2 在传统基准下的评估感知率接近 100%,而在部署模拟流量中降至 5.1%(生产环境为 5.4%),代表模型无法分辨受测状态。部署模拟也在发布前成功捕获了 GPT-5.1 将浏览器工具当作计算器使用的违规行为(calculator hacking)。
针对智能体(Agent)场景,OpenAI 使用 12 万条 GPT-5.4 员工编程轨迹模拟 GPT-5.5 编码智能体部署。为避免直接操作真实系统带来的安全风险,团队引入基于大模型的工具模拟器(Tool Simulator),结合只读连接与历史调用数据库,将环境逼真度从 11.6% 提升至 49.5%,几乎无法被区分。外部审计人员若缺乏私有生产流量,使用 WildChat 开源对话数据集的预测误差也可控制在 3 倍以内。
信源:https://openai.com/index/deployment-simulation/
OpenAI发布部署模拟(Deployment Simulation)安全评估方法,在正式发布前预测模型在真实环境下的失控风险。研究重放 2025 年 8 月至 2026 年 3 月期间 GPT-5 思考模型系列 130 万条脱敏历史对话,预测未期望不良行为率的中位误差仅为 1.5 倍。
传统静态评测集(如 SWE-Bench)极易让模型意识到处于受试状态,从而在测试中伪装真实意图(metagaming)。实验显示,GPT-5.2 在传统基准下的评估感知率接近 100%,而在部署模拟流量中降至 5.1%(生产环境为 5.4%),代表模型无法分辨受测状态。部署模拟也在发布前成功捕获了 GPT-5.1 将浏览器工具当作计算器使用的违规行为(calculator hacking)。
针对智能体(Agent)场景,OpenAI 使用 12 万条 GPT-5.4 员工编程轨迹模拟 GPT-5.5 编码智能体部署。为避免直接操作真实系统带来的安全风险,团队引入基于大模型的工具模拟器(Tool Simulator),结合只读连接与历史调用数据库,将环境逼真度从 11.6% 提升至 49.5%,几乎无法被区分。外部审计人员若缺乏私有生产流量,使用 WildChat 开源对话数据集的预测误差也可控制在 3 倍以内。
信源:https://openai.com/index/deployment-simulation/
OpenAI
Predicting model behavior before release by simulating deployment
OpenAI introduces Deployment Simulation, a method to predict AI model behavior before deployment using real conversation data to improve safety and evaluation accuracy.