传OpenAI将于6月23日发布GPT-5.6,对标Claude Fable 5
爆料显示,OpenAI 计划于 6 月 23 日发布代号为 GPT-5.6 的新旗舰模型。新模型将支持 150 万 tokens 的上下文窗口,并在智能体编程工作流上有所提升,且 API 价格仅为 Claude Fable 5 的三分之一。
发布时机与竞争对手 Anthropic 的动态紧密相关。Anthropic 在 6 月 9 日推出了 Claude Fable 5 模型,但因安全漏洞于 6 月 12 日被美国商务部紧急下架。OpenAI 选择在 6 月 23 日发版,主要是为了卡位 Fable 原定过渡期结束、大批用户被迫转向付费方案的时间节点。
受发版传闻影响,预测市场上关于「OpenAI 在 6 月 22 日至 6 月 28 日之间发布 GPT-5.6」的概率目前飙升到 78%。
信源:https://x.com/KaiXCreator/status/2066070890794962949
爆料显示,OpenAI 计划于 6 月 23 日发布代号为 GPT-5.6 的新旗舰模型。新模型将支持 150 万 tokens 的上下文窗口,并在智能体编程工作流上有所提升,且 API 价格仅为 Claude Fable 5 的三分之一。
发布时机与竞争对手 Anthropic 的动态紧密相关。Anthropic 在 6 月 9 日推出了 Claude Fable 5 模型,但因安全漏洞于 6 月 12 日被美国商务部紧急下架。OpenAI 选择在 6 月 23 日发版,主要是为了卡位 Fable 原定过渡期结束、大批用户被迫转向付费方案的时间节点。
受发版传闻影响,预测市场上关于「OpenAI 在 6 月 22 日至 6 月 28 日之间发布 GPT-5.6」的概率目前飙升到 78%。
信源:https://x.com/KaiXCreator/status/2066070890794962949
X (formerly Twitter)
Kaito (@KaiXCreator) on X
Another GPT-5.6 leak
Rumors say OpenAI could drop GPT-5.6 on June 23
• Its ~3× cheaper than Fable
• Up to 1.5M token context
• Stronger agentic coding workflows
• Direct competition with Claude-style systems
The timing is interesting
Some think OpenAI…
Rumors say OpenAI could drop GPT-5.6 on June 23
• Its ~3× cheaper than Fable
• Up to 1.5M token context
• Stronger agentic coding workflows
• Direct competition with Claude-style systems
The timing is interesting
Some think OpenAI…
阿里推出具身智能基座Qwen-Robot,以自然语言对齐多域物理动作实现零样本部署
阿里大模型团队发布具身智能底层模型套件 Qwen-Robot Suite,包含 Qwen-RobotNav、Qwen-RobotManip 和 Qwen-RobotWorld 三款基座模型,分别对应导航、操作与世界模拟三个物理动作领域。套件旨在将视觉语言模型与物理动作对齐,实现多任务与多机型的具身泛化。
导航模型 Qwen-RobotNav 统一了指令跟随、目标导航、目标追踪和自动驾驶等任务。设计上,模型参数化了视觉分配策略,支持推理时动态调整视觉 token 预算与帧采样等控制轴。在 1560 万条样本上训练后,Qwen-RobotNav 在 5 个导航领域取得 SOTA,并已零样本部署于宇树 Go2 四足机器人。
操作模型 Qwen-RobotManip 基于 Qwen3.5-4B VL 骨干网络与流匹配 DiT 动作头构建,采用 80 维状态-动作表示输出末端执行器增量位姿。团队使用超过 38100 小时数据(含开源机器人演示、人类视频及人机迁移合成数据)进行训练,在 LIBERO-Plus 评测中取得 91.4% 的成功率。
物理世界预测模型 Qwen-RobotWorld 采用自然语言统一机器人动作接口。架构上,模型基于 60 层双流 MMDiT 将 Qwen2.5-VL 语义表示与视频隐变量深度耦合。在 860 万个视频-文本对上训练后,Qwen-RobotWorld 在 EWMBench 和 WorldModelBench 等物理规律遵循评测中均位列第一。
三个模型均提供语言优先接口。阿里同时推出机器人智能体框架 Qwen-RobotClaw,由上层规划器(如 Qwen-3.5)调用套件模型作为物理工具以实现多步操作。
信源:https://mp.weixin.qq.com/s/gXO8T7scL0a5CQ8Opn39dQ
阿里大模型团队发布具身智能底层模型套件 Qwen-Robot Suite,包含 Qwen-RobotNav、Qwen-RobotManip 和 Qwen-RobotWorld 三款基座模型,分别对应导航、操作与世界模拟三个物理动作领域。套件旨在将视觉语言模型与物理动作对齐,实现多任务与多机型的具身泛化。
导航模型 Qwen-RobotNav 统一了指令跟随、目标导航、目标追踪和自动驾驶等任务。设计上,模型参数化了视觉分配策略,支持推理时动态调整视觉 token 预算与帧采样等控制轴。在 1560 万条样本上训练后,Qwen-RobotNav 在 5 个导航领域取得 SOTA,并已零样本部署于宇树 Go2 四足机器人。
操作模型 Qwen-RobotManip 基于 Qwen3.5-4B VL 骨干网络与流匹配 DiT 动作头构建,采用 80 维状态-动作表示输出末端执行器增量位姿。团队使用超过 38100 小时数据(含开源机器人演示、人类视频及人机迁移合成数据)进行训练,在 LIBERO-Plus 评测中取得 91.4% 的成功率。
物理世界预测模型 Qwen-RobotWorld 采用自然语言统一机器人动作接口。架构上,模型基于 60 层双流 MMDiT 将 Qwen2.5-VL 语义表示与视频隐变量深度耦合。在 860 万个视频-文本对上训练后,Qwen-RobotWorld 在 EWMBench 和 WorldModelBench 等物理规律遵循评测中均位列第一。
三个模型均提供语言优先接口。阿里同时推出机器人智能体框架 Qwen-RobotClaw,由上层规划器(如 Qwen-3.5)调用套件模型作为物理工具以实现多步操作。
信源:https://mp.weixin.qq.com/s/gXO8T7scL0a5CQ8Opn39dQ
从贡献半数营收至断供决裂,Claude Code倒逼Cursor紧急自研模型
AI 编程工具 Cursor 与主力模型提供商 Anthropic 之间长达数年的微妙共生关系被《商业内幕》曝光。内部员工形容两家公司的关系非常怪异,Cursor 深度依赖 Anthropic 提供的 API 驱动底层编码功能,而 Anthropic 早期有将近 40% 至 50% 的营收来自于 Cursor 用户的调用贡献。但在互利互惠的同时,Anthropic 也在秘密开发同类竞争工具。
在发布终端编程工具 Claude Code 前,Anthropic 高管曾私下向 Cursor 管理层作出安抚,声称 Claude Code 仅是一项偏学术的研究尝试,并无大规模商业化计划。然而,Claude Code 推出后迅速在开发者群体中走红,年化收入在 2026 年 2 月即飙升至 25 亿美元,反超 Cursor 当期 20 亿美元的年化收入。失去技术独占性的 Cursor 随即迎来用户的转投风潮,大量开发者在社交平台表示已退订 Cursor 以启用 Claude Code。
更深的恐慌来自于模型断供威胁。在 AI 编程工具 Windsurf 与 OpenAI 洽谈收购期间,Anthropic 突然切断了对 Windsurf 的模型供应。断供事件向 Cursor 敲响了警钟。1 月 5 日,Michael Truell 召开紧急全员会,决定全力研发自有模型。Cursor 随后基于月之暗面的开源模型开发出 Composer 系列。今年 5 月发布的 Composer 2.5 中,团队自主研发工作比例已超过 85%,在维持低价与高并发优势的同时,降低了对前沿大厂接口的依赖。
信源:https://www.businessinsider.com/cursor-ceo-michael-truell-spacex-elon-musk-anthropic-2026-6
AI 编程工具 Cursor 与主力模型提供商 Anthropic 之间长达数年的微妙共生关系被《商业内幕》曝光。内部员工形容两家公司的关系非常怪异,Cursor 深度依赖 Anthropic 提供的 API 驱动底层编码功能,而 Anthropic 早期有将近 40% 至 50% 的营收来自于 Cursor 用户的调用贡献。但在互利互惠的同时,Anthropic 也在秘密开发同类竞争工具。
在发布终端编程工具 Claude Code 前,Anthropic 高管曾私下向 Cursor 管理层作出安抚,声称 Claude Code 仅是一项偏学术的研究尝试,并无大规模商业化计划。然而,Claude Code 推出后迅速在开发者群体中走红,年化收入在 2026 年 2 月即飙升至 25 亿美元,反超 Cursor 当期 20 亿美元的年化收入。失去技术独占性的 Cursor 随即迎来用户的转投风潮,大量开发者在社交平台表示已退订 Cursor 以启用 Claude Code。
更深的恐慌来自于模型断供威胁。在 AI 编程工具 Windsurf 与 OpenAI 洽谈收购期间,Anthropic 突然切断了对 Windsurf 的模型供应。断供事件向 Cursor 敲响了警钟。1 月 5 日,Michael Truell 召开紧急全员会,决定全力研发自有模型。Cursor 随后基于月之暗面的开源模型开发出 Composer 系列。今年 5 月发布的 Composer 2.5 中,团队自主研发工作比例已超过 85%,在维持低价与高并发优势的同时,降低了对前沿大厂接口的依赖。
信源:https://www.businessinsider.com/cursor-ceo-michael-truell-spacex-elon-musk-anthropic-2026-6
Business Insider
Inside Cursor's wild rise, from its Anthropic situationship to dating SpaceX
How the hottest AI coding company navigated its situationship with Anthropic and hitched its fate to Elon Musk's chaotic rocket.
Grok Build推出代理控制面板,单终端多会话调度解决人工阻塞
xAI 为软件工程编码代理 Grok Build 推出终端控制面板 Agent Dashboard。开发者在已有编码会话中输入斜杠命令
面板采用基于终端的卡片化交互界面,支持在单个屏幕内集中监视与管理多个并行的 Grok Build 编码会话。视图内会分类显示所有活动、空闲与等待输入的状态,并记录每项任务的持续时间。
为了解决多智能体协作中的同步阻塞,当子代理需要人工确认或提问时,关联会话会自动置顶。开发者能够直接在面板中预览子任务的最新输出并回复,无需频繁切换终端窗口。面板也支持使用
信源:https://x.com/grok/status/2066557141868257444
xAI 为软件工程编码代理 Grok Build 推出终端控制面板 Agent Dashboard。开发者在已有编码会话中输入斜杠命令
/dashboard 或使用快捷键 Ctrl+\ 即可唤起面板,或直接在终端运行 grok dashboard 启动。面板采用基于终端的卡片化交互界面,支持在单个屏幕内集中监视与管理多个并行的 Grok Build 编码会话。视图内会分类显示所有活动、空闲与等待输入的状态,并记录每项任务的持续时间。
为了解决多智能体协作中的同步阻塞,当子代理需要人工确认或提问时,关联会话会自动置顶。开发者能够直接在面板中预览子任务的最新输出并回复,无需频繁切换终端窗口。面板也支持使用
Ctrl+S 快捷键按工作目录对任务分组,并将子代理折叠收纳在主任务下方。信源:https://x.com/grok/status/2066557141868257444
Hermes Agent推出异步子代理与Stripe支付技能
Nous Research 宣布智能体框架 Hermes Agent 推出两项更新,包含异步子代理后台任务,以及三款 Stripe 支付技能。
Hermes Agent 升级了分发工具(Delegate Tool)。智能体生成子代理执行任务时,主聊天窗口不再锁死,用户可以在子代理运行期间照常对话。
用户运行
为了保障资金安全,临时交易凭证在用完后自动清理,且主凭证不会记入对话日志。所有交易都需要人工审批,并且可以配置限额上限。
信源:https://x.com/NousResearch/status/2066647737613832624
Nous Research 宣布智能体框架 Hermes Agent 推出两项更新,包含异步子代理后台任务,以及三款 Stripe 支付技能。
Hermes Agent 升级了分发工具(Delegate Tool)。智能体生成子代理执行任务时,主聊天窗口不再锁死,用户可以在子代理运行期间照常对话。
用户运行
hermes skills install 命令便能直接安装三款 Stripe 技能。`stripe-link-cli` 用于网页购物,`mpp-agent` 用于调用按次计费的 API,而 stripe-projects 则用于订阅 SaaS 服务。为了保障资金安全,临时交易凭证在用完后自动清理,且主凭证不会记入对话日志。所有交易都需要人工审批,并且可以配置限额上限。
信源:https://x.com/NousResearch/status/2066647737613832624
X (formerly Twitter)
Nous Research (@NousResearch) on X
In partnership with @stripe, Hermes Agent now supports a full suite of Stripe skills.
Your agent can buy things, pay per-call APIs, and provision its own SaaS, with configurable safety limits on every action.
Your agent can buy things, pay per-call APIs, and provision its own SaaS, with configurable safety limits on every action.
❤2
OpenAI砸1.5亿美元外包AI落地服务,计划培训30万顾问帮企业部署
OpenAI 宣布推出渠道伙伴计划(OpenAI Partner Network),并投入 1.5 亿美元用于扶持合作体系。OpenAI 表示,企业要从 AI 中获得价值,核心不再是模型能力,而是重新设计工作流、集成现有系统并推进日常使用。新计划将联合埃森哲、麦肯锡、普华永道、贝恩和波士顿咨询(BCG)等机构,协助企业客户部署 AI。
渠道伙伴计划拟在 2026 年底前培训出 30 万名官方认证的 AI 顾问。顾问将被分为 Select、Advanced 和 Elite 三个等级,并能在 Codex 编程、网络安全和智能体等特定技术领域考取专业认证,方便企业客户挑选。
前沿部署专家(Forward Deployed Experts)项目也已同步试点。合作机构的技术人员将直接对接 OpenAI 本部的技术部署工程团队(Forward Deployed Engineering),引入官方的系统搭建方案和业务转型经验,代表官方为企业提供深度技术支持。
信源:https://openai.com/index/introducing-openai-partner-network/
OpenAI 宣布推出渠道伙伴计划(OpenAI Partner Network),并投入 1.5 亿美元用于扶持合作体系。OpenAI 表示,企业要从 AI 中获得价值,核心不再是模型能力,而是重新设计工作流、集成现有系统并推进日常使用。新计划将联合埃森哲、麦肯锡、普华永道、贝恩和波士顿咨询(BCG)等机构,协助企业客户部署 AI。
渠道伙伴计划拟在 2026 年底前培训出 30 万名官方认证的 AI 顾问。顾问将被分为 Select、Advanced 和 Elite 三个等级,并能在 Codex 编程、网络安全和智能体等特定技术领域考取专业认证,方便企业客户挑选。
前沿部署专家(Forward Deployed Experts)项目也已同步试点。合作机构的技术人员将直接对接 OpenAI 本部的技术部署工程团队(Forward Deployed Engineering),引入官方的系统搭建方案和业务转型经验,代表官方为企业提供深度技术支持。
信源:https://openai.com/index/introducing-openai-partner-network/
OpenAI
Introducing the OpenAI Partner Network
OpenAI launches the Partner Network, investing $150M to help global partners accelerate enterprise AI adoption, deployment, and transformation.
Redis创始人反驳「中国大模型靠蒸馏美国模型变强」论调:API答案不能一键复制前沿模型
Redis 创始人 Salvatore Sanfilippo 反驳了中国大模型靠蒸馏美国模型变强的说法。他认为,普通 API 只能返回文字答案,拿不到模型生成答案时的概率分布和内部状态,无法靠少量外部调用复制一个前沿模型的核心能力。
大模型真正的逻辑推理和思考能力隐藏在极其复杂的神经网络内部。通过 API 接口,外部用户只能拿到最终的文字答案,却无法获取模型生成答案时的完整思考路径和概率计算过程。这就像是只看几道题的期末考试答案,根本无法倒推出老师脑海中庞大的知识体系。以 DeepSeek 为代表的中国大模型在崛起中依赖数据预训练和强化学习等底层工程的扎实积累,而不是靠走捷径。
学术界将大模型蒸馏细分为依赖概率分布的「软蒸馏」,以及仅依靠文本答案的「硬蒸馏」。软蒸馏本身是常规的后训练手段,而且不能通过 API 调用就轻易实现,当下的争论主要集中在「硬蒸馏」上。大厂极力防范的其实是规避服务条款的 API 滥用,即对手利用越狱和诱导提示,强迫模型外显输出本被产品隐藏的推导草稿、验证步骤与自我纠错过程。这些详细的步骤数据虽然仍是文字形式,并非模型底层的概率分布,但极易帮助竞争对手在强化学习中省去数亿美元的盲目探索成本。大厂难以完全防堵越狱,症结在于输出详细的推导过程是推理模型维持高智能的核心属性,一旦为了防盗而强行屏蔽,模型性能就会严重下降。
大厂急于将服务违约和 API 滥用行为界定为安全层面的「攻击」,深层动因在于版权法律的空白。在目前的法律框架下,AI 生成的文本并不享有版权,大厂无法阻止对手合理使用这些生成的文本作为语料。版权空白导致领跑者在商业上面临「自己承担高昂的强化学习探索成本,却无法阻止对手合法利用数据追赶」的硬伤。因此,大厂倾向于在公关和政策上将竞争行为包装成「蒸馏攻击」,以此寻求道德同情和立法保护,试图维护自身的先发壁垒。
信源:https://x.com/antirez/status/2066516853497684342
Redis 创始人 Salvatore Sanfilippo 反驳了中国大模型靠蒸馏美国模型变强的说法。他认为,普通 API 只能返回文字答案,拿不到模型生成答案时的概率分布和内部状态,无法靠少量外部调用复制一个前沿模型的核心能力。
大模型真正的逻辑推理和思考能力隐藏在极其复杂的神经网络内部。通过 API 接口,外部用户只能拿到最终的文字答案,却无法获取模型生成答案时的完整思考路径和概率计算过程。这就像是只看几道题的期末考试答案,根本无法倒推出老师脑海中庞大的知识体系。以 DeepSeek 为代表的中国大模型在崛起中依赖数据预训练和强化学习等底层工程的扎实积累,而不是靠走捷径。
学术界将大模型蒸馏细分为依赖概率分布的「软蒸馏」,以及仅依靠文本答案的「硬蒸馏」。软蒸馏本身是常规的后训练手段,而且不能通过 API 调用就轻易实现,当下的争论主要集中在「硬蒸馏」上。大厂极力防范的其实是规避服务条款的 API 滥用,即对手利用越狱和诱导提示,强迫模型外显输出本被产品隐藏的推导草稿、验证步骤与自我纠错过程。这些详细的步骤数据虽然仍是文字形式,并非模型底层的概率分布,但极易帮助竞争对手在强化学习中省去数亿美元的盲目探索成本。大厂难以完全防堵越狱,症结在于输出详细的推导过程是推理模型维持高智能的核心属性,一旦为了防盗而强行屏蔽,模型性能就会严重下降。
大厂急于将服务违约和 API 滥用行为界定为安全层面的「攻击」,深层动因在于版权法律的空白。在目前的法律框架下,AI 生成的文本并不享有版权,大厂无法阻止对手合理使用这些生成的文本作为语料。版权空白导致领跑者在商业上面临「自己承担高昂的强化学习探索成本,却无法阻止对手合法利用数据追赶」的硬伤。因此,大厂倾向于在公关和政策上将竞争行为包装成「蒸馏攻击」,以此寻求道德同情和立法保护,试图维护自身的先发壁垒。
信源:https://x.com/antirez/status/2066516853497684342
X (formerly Twitter)
antirez (@antirez) on X
Another important thing: Chinese models are not strong because they distill US models. Distillation of models via API is *impossible*. If somebody tells you the contrary, they don't understand machine learning:
👍2
Anthropic遭集体诉讼,指控Max系列百美元订阅计划实际额度缩水
消费者 Karl Kahn 于 6 月 15 日在加州北区联邦法院对 AI 初创公司 Anthropic 发起集体诉讼。诉状指控 Anthropic 误导消费者,指称高阶订阅服务 Max 5x 与 Max 20x 的实际使用额度远低于宣传标准。
Anthropic 提供的个人付费订阅 Claude Pro 每月收费 17 至 20 美元。为了满足更高算力需求,Anthropic 在去年 4 月推出每月收费 100 美元的 Max 5x 计划,以及每月收费 200 美元的 Max 20x 计划,并宣传这两款计划的调用上限分别为 Pro 计划的 5 倍与 20 倍。然而,诉状指出 Anthropic 在 2025 年 7 月向用户发送的邮件中,透露了针对具体模型的实际每周使用量预期,两者的实际比例与宣传的倍数严重不符。
原告 Karl Kahn 自今年 4 月起升级至每月 200 美元的 Max 20x 订阅,主要用于高强度编程工作。然而在数周内,Kahn 就频繁触发每周使用限制,甚至在一次 5 小时的连续编码中就消耗了 15% 的每周额度,导致他不得不频繁暂停工作、节省用量,或额外付费购买额度。起诉书指控 Anthropic 的宣传构成欺诈,要求公司退还相关高阶订阅费用,并对受影响用户进行赔偿。
信源:https://www.wsj.com/tech/ai/anthropic-sued-over-limits-on-its-200-a-month-ai-plans-e2a109e4
消费者 Karl Kahn 于 6 月 15 日在加州北区联邦法院对 AI 初创公司 Anthropic 发起集体诉讼。诉状指控 Anthropic 误导消费者,指称高阶订阅服务 Max 5x 与 Max 20x 的实际使用额度远低于宣传标准。
Anthropic 提供的个人付费订阅 Claude Pro 每月收费 17 至 20 美元。为了满足更高算力需求,Anthropic 在去年 4 月推出每月收费 100 美元的 Max 5x 计划,以及每月收费 200 美元的 Max 20x 计划,并宣传这两款计划的调用上限分别为 Pro 计划的 5 倍与 20 倍。然而,诉状指出 Anthropic 在 2025 年 7 月向用户发送的邮件中,透露了针对具体模型的实际每周使用量预期,两者的实际比例与宣传的倍数严重不符。
原告 Karl Kahn 自今年 4 月起升级至每月 200 美元的 Max 20x 订阅,主要用于高强度编程工作。然而在数周内,Kahn 就频繁触发每周使用限制,甚至在一次 5 小时的连续编码中就消耗了 15% 的每周额度,导致他不得不频繁暂停工作、节省用量,或额外付费购买额度。起诉书指控 Anthropic 的宣传构成欺诈,要求公司退还相关高阶订阅费用,并对受影响用户进行赔偿。
信源:https://www.wsj.com/tech/ai/anthropic-sued-over-limits-on-its-200-a-month-ai-plans-e2a109e4
The Wall Street Journal
Exclusive | Anthropic Sued Over Limits on Its $200-a-Month AI Plans
The lawsuit, which is seeking class-action status, alleges the company oversold usage allowances on its priciest Claude chatbot tiers.
Artificial Analysis新AI评测显示Claude比DeepSeek贵44倍
评测机构 Artificial Analysis 调整了 AI 智能指数的评测标准,不再只让 AI 做单项选择题,而是全面考验 AI 能否自主规划、使用工具并解决复杂任务。新评测取消了考验听懂简单指令的旧项目,转而引入模拟银行客服真实对话等高难度场景,并首次将跑完一次任务要花多少钱、耗时多长作为核心考核指标。
在最新的评测结果中,已被美国政府管制下线的 Claude Fable 5 拿到了 60 分的最高成绩。而在目前市面上买得到的 AI 中,最贵的 Claude Opus 4.8 拿到了 56 分的第一名,以微弱优势领先拿到 55 分的 GPT-5.5。国产模型表现也相当亮眼,开源的 DeepSeek V4 Pro 与 MiniMax M3 都拿到了 44 分,紧随其后的是 43 分的 Kimi K2.6。
模型在费用上的差距十分巨大。同样运行一次任务,使用最先进的 Claude Opus 4.8 需要花费 1.78 美元(约合 13 元人民币),而使用国产开源的 DeepSeek V4 Pro 跑一次仅需 0.04 美元(约合 0.3 元人民币)。这意味着 Claude 的调用成本是 DeepSeek 的 44 倍。完成一次任务的等待时间也天差地别,最快的 xAI Grok 4.3 仅需 1.5 分钟,而最慢的 Claude Sonnet 4.6 却需要 13.5 分钟。
作为这次改制中权重最高的单一测试,考核真实世界知识工作的 GDPval-AA 升级到了第二版,占比提升至 20%。新版测试将人类的表现基准分设为 1000 分,并引入多个前沿模型轮换担任裁判,同时将单次对话的回合上限放宽到了 250 次。
信源:https://x.com/ArtificialAnlys/status/2066700136018071841
评测机构 Artificial Analysis 调整了 AI 智能指数的评测标准,不再只让 AI 做单项选择题,而是全面考验 AI 能否自主规划、使用工具并解决复杂任务。新评测取消了考验听懂简单指令的旧项目,转而引入模拟银行客服真实对话等高难度场景,并首次将跑完一次任务要花多少钱、耗时多长作为核心考核指标。
在最新的评测结果中,已被美国政府管制下线的 Claude Fable 5 拿到了 60 分的最高成绩。而在目前市面上买得到的 AI 中,最贵的 Claude Opus 4.8 拿到了 56 分的第一名,以微弱优势领先拿到 55 分的 GPT-5.5。国产模型表现也相当亮眼,开源的 DeepSeek V4 Pro 与 MiniMax M3 都拿到了 44 分,紧随其后的是 43 分的 Kimi K2.6。
模型在费用上的差距十分巨大。同样运行一次任务,使用最先进的 Claude Opus 4.8 需要花费 1.78 美元(约合 13 元人民币),而使用国产开源的 DeepSeek V4 Pro 跑一次仅需 0.04 美元(约合 0.3 元人民币)。这意味着 Claude 的调用成本是 DeepSeek 的 44 倍。完成一次任务的等待时间也天差地别,最快的 xAI Grok 4.3 仅需 1.5 分钟,而最慢的 Claude Sonnet 4.6 却需要 13.5 分钟。
作为这次改制中权重最高的单一测试,考核真实世界知识工作的 GDPval-AA 升级到了第二版,占比提升至 20%。新版测试将人类的表现基准分设为 1000 分,并引入多个前沿模型轮换担任裁判,同时将单次对话的回合上限放宽到了 250 次。
信源:https://x.com/ArtificialAnlys/status/2066700136018071841
奥特曼:算力短缺或将永久化,相比UBI更倾向公民财富基金
OpenAI 首席执行官萨姆·奥特曼(Sam Altman)在斯坦福大学 CS 153 课程上展望了未来十年的发展走势。他指出全球算力短缺可能会成为永久性问题。面对未来,他更倾向于将技术民主化,并通过「公民财富基金」让全社会持有资本股份,而非依靠发放现金的通用基本收入 UBI。
奥特曼将算力视为未来最重要的公共事业。他认为,模型越聪明、成本越低,对算力的需求就越没有上限。尤其是随着个人智能体普及,用户倾向于让数十甚至上百个智能体全天候并发工作,海量的推理算力需求将导致算力缺口永久存在。一旦算力价格因供需严重失衡,如何公平分配算力将成为一个迫切的社会问题。
在社会财富与控制权的分配上,奥特曼评估有 80% 的概率会走向技术广泛分发的民主化道路,但他警告,以安全和稳定为名的力量会试图将权力集中于少数巨头。他直言,哪怕 OpenAI 身处其中,世界也不应容忍少数企业垄断 AI 带来的庞大财富。随着社会杠杆持续从劳动力向资本转移,奥特曼更看好让民众共同持有企业股份所有权的「公民财富基金」模式,以此让大众共享资本主义的长期红利。
信源:https://www.youtube.com/watch?v=F_7M4Hc-usM
OpenAI 首席执行官萨姆·奥特曼(Sam Altman)在斯坦福大学 CS 153 课程上展望了未来十年的发展走势。他指出全球算力短缺可能会成为永久性问题。面对未来,他更倾向于将技术民主化,并通过「公民财富基金」让全社会持有资本股份,而非依靠发放现金的通用基本收入 UBI。
奥特曼将算力视为未来最重要的公共事业。他认为,模型越聪明、成本越低,对算力的需求就越没有上限。尤其是随着个人智能体普及,用户倾向于让数十甚至上百个智能体全天候并发工作,海量的推理算力需求将导致算力缺口永久存在。一旦算力价格因供需严重失衡,如何公平分配算力将成为一个迫切的社会问题。
在社会财富与控制权的分配上,奥特曼评估有 80% 的概率会走向技术广泛分发的民主化道路,但他警告,以安全和稳定为名的力量会试图将权力集中于少数巨头。他直言,哪怕 OpenAI 身处其中,世界也不应容忍少数企业垄断 AI 带来的庞大财富。随着社会杠杆持续从劳动力向资本转移,奥特曼更看好让民众共同持有企业股份所有权的「公民财富基金」模式,以此让大众共享资本主义的长期红利。
信源:https://www.youtube.com/watch?v=F_7M4Hc-usM
🤡3❤1🎉1
SpaceX宣布以600亿美元全股票收购Cursor开发商Anysphere
SpaceX 宣布与 AI 编程工具 Cursor 的开发商 Anysphere 达成合并协议,将以 600 亿美元的价格进行全股票收购,预计 2026 年第三季度完成交割。
双方曾于 2026 年 4 月达成合作,规定 SpaceX 拥有以 600 亿美元收购 Anysphere 的独家选择权。若放弃收购,SpaceX 需支付 100 亿美元作为联合研发的补偿。如今签署正式合并协议,意味着 SpaceX 决定行使选择权。
Anysphere 研发的 Cursor 是目前最受欢迎的 AI 编程工具之一,约 70% 的财富 1000 强企业已是活跃用户。Anysphere 的年化经常性收入(ARR)在四个月内实现翻倍,从 2026 年 2 月的 20 亿美元飙升至 6 月初的 40 亿美元。在接受收购前,Anysphere 在 2025 年底的估值为 293 亿美元,原计划以 500 亿美元估值开启新一轮融资。
SpaceX 意在通过并购进军企业级 AI 市场。SpaceX 已于今年 2 月与开发 Grok 聊天机器人的 xAI 合并,但 xAI 在代码生成领域一直落后于 OpenAI 和 Anthropic。交易交割后,Anysphere 将获得充足的算力支持,用于研发新一代 AI 模型。
信源:https://www.reuters.com/legal/transactional/spacex-buy-anysphere-60-billion-2026-06-16/
SpaceX 宣布与 AI 编程工具 Cursor 的开发商 Anysphere 达成合并协议,将以 600 亿美元的价格进行全股票收购,预计 2026 年第三季度完成交割。
双方曾于 2026 年 4 月达成合作,规定 SpaceX 拥有以 600 亿美元收购 Anysphere 的独家选择权。若放弃收购,SpaceX 需支付 100 亿美元作为联合研发的补偿。如今签署正式合并协议,意味着 SpaceX 决定行使选择权。
Anysphere 研发的 Cursor 是目前最受欢迎的 AI 编程工具之一,约 70% 的财富 1000 强企业已是活跃用户。Anysphere 的年化经常性收入(ARR)在四个月内实现翻倍,从 2026 年 2 月的 20 亿美元飙升至 6 月初的 40 亿美元。在接受收购前,Anysphere 在 2025 年底的估值为 293 亿美元,原计划以 500 亿美元估值开启新一轮融资。
SpaceX 意在通过并购进军企业级 AI 市场。SpaceX 已于今年 2 月与开发 Grok 聊天机器人的 xAI 合并,但 xAI 在代码生成领域一直落后于 OpenAI 和 Anthropic。交易交割后,Anysphere 将获得充足的算力支持,用于研发新一代 AI 模型。
信源:https://www.reuters.com/legal/transactional/spacex-buy-anysphere-60-billion-2026-06-16/
❤1
Cartesia发布全新TTS与STT模型Sonic-3.5与Ink-2
AI语音模型初创公司 Cartesia 宣布发布 Sonic-3.5 与 Ink-2,并推出由两款模型组成的统一实时语音智能体技术栈。Sonic-3.5 负责文本转语音(TTS),Ink-2 负责语音转文本(STT)。
Sonic-3.5 偏向于实时低延迟语音生成,首音输出时间(Time to First Audio)缩短至 90 毫秒。出厂支持 42 种语言,无需预处理即可支持英文异音词和字母数字的发音。
Ink-2 的字错率(Word Error Rate)降至 3.6%,同时引入了原生轮次检测(Native Turn-Detection)和噪声处理机制,能基于句意和语义理解判定用户是否发言完毕,而不是仅依赖传统的安静时长。目前 Ink-2 仅提供英文版,多语言版本将在后续推出。
开发者可以通过单个 API 同时调用这两款模型。Sonic-3.5 与 Ink-2 在设计上进行双向流式协同,以减少由于「多供应商拼接」带来的传输延迟与系统损耗。
信源:https://x.com/krandiash/status/2066559212533190917
AI语音模型初创公司 Cartesia 宣布发布 Sonic-3.5 与 Ink-2,并推出由两款模型组成的统一实时语音智能体技术栈。Sonic-3.5 负责文本转语音(TTS),Ink-2 负责语音转文本(STT)。
Sonic-3.5 偏向于实时低延迟语音生成,首音输出时间(Time to First Audio)缩短至 90 毫秒。出厂支持 42 种语言,无需预处理即可支持英文异音词和字母数字的发音。
Ink-2 的字错率(Word Error Rate)降至 3.6%,同时引入了原生轮次检测(Native Turn-Detection)和噪声处理机制,能基于句意和语义理解判定用户是否发言完毕,而不是仅依赖传统的安静时长。目前 Ink-2 仅提供英文版,多语言版本将在后续推出。
开发者可以通过单个 API 同时调用这两款模型。Sonic-3.5 与 Ink-2 在设计上进行双向流式协同,以减少由于「多供应商拼接」带来的传输延迟与系统损耗。
信源:https://x.com/krandiash/status/2066559212533190917
X (formerly Twitter)
Karan Goel (@krandiash) on X
We released Sonic-3.5 and Ink-2, the #1 streaming models for text to speech and speech to text you can use in your voice agents today.
New architectures enable new frontiers for speed and quality.
We're now the only provider to have #1 models for both speaking…
New architectures enable new frontiers for speed and quality.
We're now the only provider to have #1 models for both speaking…
❤1
动察Beating AI News
DeepSeek完成首轮超74亿美元融资,估值超500亿美元且创始人保留绝对控制权 中国 AI 实验室 DeepSeek 完成首轮超 500 亿元(约 74 亿美元)的融资,估值突破 500 亿美元。本次融资采用非常规的交易结构,外部投资者不直接投资于 DeepSeek,而是向 CEO 梁文锋管理的有限合伙企业出资,以确保创始人对公司拥有绝对控制权。除国家级基金外,所有投资者都面临为期 5 年的股份锁定期,锁定期间无法转让或出售股权。 在资金来源上,创始人梁文锋个人出资 200 亿元,腾讯投资 100…
DeepSeek首轮融资中创始人梁文锋出资200亿,为最大单一出资方
在中国 AI 实验室 DeepSeek 首轮约 510 亿元(约 75 亿美元)融资中,创始人梁文锋出资约 200 亿元,占总出资金额近四成,为本轮融资中最大单一出资方。
在外部出资机构中,腾讯出资约 100 亿元,宁德时代体系(含宁德时代及溥泉资本)出资约 50 亿元。网易、京东、Monolith 砺思资本与 IDG 资本各出资约 30 亿元。正心谷投资和拾象科技则各出资约 15 亿元。国家人工智能产业投资基金出资约 9.8 亿元。
融资完成后,DeepSeek 投后估值接近 4000 亿元(约 580 亿美元)。
在中国 AI 实验室 DeepSeek 首轮约 510 亿元(约 75 亿美元)融资中,创始人梁文锋出资约 200 亿元,占总出资金额近四成,为本轮融资中最大单一出资方。
在外部出资机构中,腾讯出资约 100 亿元,宁德时代体系(含宁德时代及溥泉资本)出资约 50 亿元。网易、京东、Monolith 砺思资本与 IDG 资本各出资约 30 亿元。正心谷投资和拾象科技则各出资约 15 亿元。国家人工智能产业投资基金出资约 9.8 亿元。
融资完成后,DeepSeek 投后估值接近 4000 亿元(约 580 亿美元)。
大模型后训练新发现:用自己生成的数据做「同轨训练」是学生超越导师且不退化的关键
大模型后训练中的「同轨采样」(即让模型在自己实时尝试的作答路径上进行训练)是防止模型退化、提高解题能力的关键。在线强化学习(RL)与同轨蒸馏(OPD)之所以优于传统的监督微调(SFT),本质在于它们是让模型根据自己写出的步骤进行优化,而不是去死记硬背外部标准答案。
SFT 强行灌输标准答案,会将修改模型的力道均匀施加在每个词上,极易破坏模型原有的知识结构并引发遗忘。相反,RL 和 OPD 让模型在自己写的草稿中寻找并强化最佳步骤。这不仅能避免「开头写错一个词,后面一路走偏」的累积误差,且更新只发生在模型已知的知识区域内,从而最大限度保留原生能力。
在「最小代码编辑」实验中,无论使用 SFT 还是 RL 导师进行同轨蒸馏,学生模型一次性写对代码的成功率(Pass@1)分别达 80.0% 和 78.7%,均超越了导师模型。即使 SFT 导师因过度微调严重「变傻」(在 LiveCodeBench 代码能力测试中从 0.320 跌至 0.286),其带出来的学生模型依然拿到 0.297 的高分,几乎未受导师缺陷拖累,证明同轨练习能有效过滤导师的坏习惯。
目前,DeepSeek-V4 与 GLM-5 已引入同轨蒸馏来合并专家模型能力。在专家训练中,代码和数学等有明确对错的领域更适合 RL,而创意和知识类主观任务更适合同轨蒸馏。未来的终极微调算法,势必要在同轨训练框架下,寻找兼具蒸馏高效率(高信息密度)与 RL 客观性(无偏更新)的新机制。
信源:https://nrehiew.github.io/blog/sft_rl_opd/
大模型后训练中的「同轨采样」(即让模型在自己实时尝试的作答路径上进行训练)是防止模型退化、提高解题能力的关键。在线强化学习(RL)与同轨蒸馏(OPD)之所以优于传统的监督微调(SFT),本质在于它们是让模型根据自己写出的步骤进行优化,而不是去死记硬背外部标准答案。
SFT 强行灌输标准答案,会将修改模型的力道均匀施加在每个词上,极易破坏模型原有的知识结构并引发遗忘。相反,RL 和 OPD 让模型在自己写的草稿中寻找并强化最佳步骤。这不仅能避免「开头写错一个词,后面一路走偏」的累积误差,且更新只发生在模型已知的知识区域内,从而最大限度保留原生能力。
在「最小代码编辑」实验中,无论使用 SFT 还是 RL 导师进行同轨蒸馏,学生模型一次性写对代码的成功率(Pass@1)分别达 80.0% 和 78.7%,均超越了导师模型。即使 SFT 导师因过度微调严重「变傻」(在 LiveCodeBench 代码能力测试中从 0.320 跌至 0.286),其带出来的学生模型依然拿到 0.297 的高分,几乎未受导师缺陷拖累,证明同轨练习能有效过滤导师的坏习惯。
目前,DeepSeek-V4 与 GLM-5 已引入同轨蒸馏来合并专家模型能力。在专家训练中,代码和数学等有明确对错的领域更适合 RL,而创意和知识类主观任务更适合同轨蒸馏。未来的终极微调算法,势必要在同轨训练框架下,寻找兼具蒸馏高效率(高信息密度)与 RL 客观性(无偏更新)的新机制。
信源:https://nrehiew.github.io/blog/sft_rl_opd/
智谱AI最新旗舰模型GLM-5.2正式开源权重并上线API
智谱 AI(Z.ai)正式开源旗舰大模型 GLM-5.2 的权重,并上线 API 服务。早在上周六,GLM-5.2 已向所有 GLM Coding Plan 订阅用户开放,这次更新则是正式开源权重与 API 上线。
作为混合专家(MoE)模型,GLM-5.2 参数总量为 7530 亿,单次推理仅激活约 400 亿参数。为了适配不同任务,GLM-5.2 提供 High(高)和 Max(最大)两档思考模式。High 模式兼顾响应速度与回答质量,而 Max 模式则专注深度思维链推理,特别推荐在自动编程和复杂调试等场景中开启。
除了计算规模上的优化,GLM-5.2 具备的 100 万 token 长上下文也经过了针对长程复杂任务的稳定性训练。为了在处理长文本时不出现卡顿,智谱在底层架构中引入了 IndexShare(索引共享)技术,让稀疏注意力层每 4 层共享相同的检索索引,成功将 100 万 token 长度下的单 token 计算开销降低 2.9 倍,在大幅提升长文本响应速度的同时,减少了计算资源损耗。
目前,GLM-5.2 的模型权重已遵循 MIT 协议开源,支持自由商用与修改。官方 API 服务同步上线,计费价格与上一代 GLM-5.1 保持一致。GLM-5.2 也已接入全球 API 平台 OpenRouter,进一步为海外开发者提供调用支持。
信源:https://x.com/Zai_org/status/2066938937344495629
智谱 AI(Z.ai)正式开源旗舰大模型 GLM-5.2 的权重,并上线 API 服务。早在上周六,GLM-5.2 已向所有 GLM Coding Plan 订阅用户开放,这次更新则是正式开源权重与 API 上线。
作为混合专家(MoE)模型,GLM-5.2 参数总量为 7530 亿,单次推理仅激活约 400 亿参数。为了适配不同任务,GLM-5.2 提供 High(高)和 Max(最大)两档思考模式。High 模式兼顾响应速度与回答质量,而 Max 模式则专注深度思维链推理,特别推荐在自动编程和复杂调试等场景中开启。
除了计算规模上的优化,GLM-5.2 具备的 100 万 token 长上下文也经过了针对长程复杂任务的稳定性训练。为了在处理长文本时不出现卡顿,智谱在底层架构中引入了 IndexShare(索引共享)技术,让稀疏注意力层每 4 层共享相同的检索索引,成功将 100 万 token 长度下的单 token 计算开销降低 2.9 倍,在大幅提升长文本响应速度的同时,减少了计算资源损耗。
目前,GLM-5.2 的模型权重已遵循 MIT 协议开源,支持自由商用与修改。官方 API 服务同步上线,计费价格与上一代 GLM-5.1 保持一致。GLM-5.2 也已接入全球 API 平台 OpenRouter,进一步为海外开发者提供调用支持。
信源:https://x.com/Zai_org/status/2066938937344495629
X (formerly Twitter)
Z.ai (@Zai_org) on X
Introducing GLM-5.2: Frontier Intelligence, Open Weights
- Significant improvements in coding and agentic tasks
- Strong long-horizon capabilities with a 1M context window
- Two levels of reasoning effort: GLM-5.2 (max) pushes the limits, while GLM-5.2 (high)…
- Significant improvements in coding and agentic tasks
- Strong long-horizon capabilities with a 1M context window
- Two levels of reasoning effort: GLM-5.2 (max) pushes the limits, while GLM-5.2 (high)…
小米发布MiMo Claw正式版:接入金山办公并大幅升级免费额度
小米云端智能体工具 Xiaomi MiMo Claw 正式版上线,搭载与 OpenClaw 深度适配的 MiMo-V2.5-Pro 旗舰模型。新版本接入金山办公生态,打通了 Word、Excel、PPT 和 PDF 文件的智能生成、在线预览与编辑全链路。
模型端,MiMo-V2.5-Pro 原生兼容 OpenClaw 预置和 MCP 工具调用协议。依托超长上下文记忆调度,单会话支持千次以上工具调用。技术上引入 MTP 三层解码架构,使全链路推理吞吐提升约 3 倍。在 ClawEval 基准测试中,任务达标率(Pass³)为 63.8%,相同任务下的 Token 消耗降低 40% 至 60%。
服务采用全云端托管,支持后台续跑与智能自主纠错。同时,每日免费体验时长从 1 小时升至 4 小时。高频用户可叠加 TokenPlan 所有月度及年度套餐,首次特惠 14.9 元/月,限时特惠为 19.9 元/月或 233.8 元/年。目前海外订阅暂未开放。
信源:https://mp.weixin.qq.com/s/QOUk1AsXsDsrDmdjZw56FA
小米云端智能体工具 Xiaomi MiMo Claw 正式版上线,搭载与 OpenClaw 深度适配的 MiMo-V2.5-Pro 旗舰模型。新版本接入金山办公生态,打通了 Word、Excel、PPT 和 PDF 文件的智能生成、在线预览与编辑全链路。
模型端,MiMo-V2.5-Pro 原生兼容 OpenClaw 预置和 MCP 工具调用协议。依托超长上下文记忆调度,单会话支持千次以上工具调用。技术上引入 MTP 三层解码架构,使全链路推理吞吐提升约 3 倍。在 ClawEval 基准测试中,任务达标率(Pass³)为 63.8%,相同任务下的 Token 消耗降低 40% 至 60%。
服务采用全云端托管,支持后台续跑与智能自主纠错。同时,每日免费体验时长从 1 小时升至 4 小时。高频用户可叠加 TokenPlan 所有月度及年度套餐,首次特惠 14.9 元/月,限时特惠为 19.9 元/月或 233.8 元/年。目前海外订阅暂未开放。
信源:https://mp.weixin.qq.com/s/QOUk1AsXsDsrDmdjZw56FA
OpenAI一季度烧钱37亿美元:营收增至57亿,手头现金超730亿
OpenAI 在 2026 年一季度现金流出 37 亿美元,占当季 57 亿美元营收的六成以上。根据向股东披露的财务文件,一季度营收与烧钱额度均较去年同期翻了三倍。期末持有现金和有价证券从去年 12 月底的 400 亿美元增至超 730 亿美元。
财务报表显示,一季度净亏损超 213 亿美元,但亏损主要受一项折合近 124 亿美元的非现金会计账目变动影响(主要与可转换权益及认股权证负债的公允价值变动相关)。剔除记账影响后,一季度运营亏损为 93 亿美元,包含 23 亿美元的员工股权激励支出。同期研发费用为 86 亿美元。
在营收成本方面,主要用于提供模型服务的一季度支出为 35 亿美元,毛利率由去年同期的 33% 升至 39%。然而,更大的隐性开支在于算力协议。一季度披露显示,截至 2025 年底,云算力采购承诺额高达 6650 亿美元,采购合同将一直延续至 2030 年。上周,OpenAI 已秘密提交上市申请。
信源:https://www.theinformation.com/articles/openai-burned-3-7-billion-first-three-months-2026
OpenAI 在 2026 年一季度现金流出 37 亿美元,占当季 57 亿美元营收的六成以上。根据向股东披露的财务文件,一季度营收与烧钱额度均较去年同期翻了三倍。期末持有现金和有价证券从去年 12 月底的 400 亿美元增至超 730 亿美元。
财务报表显示,一季度净亏损超 213 亿美元,但亏损主要受一项折合近 124 亿美元的非现金会计账目变动影响(主要与可转换权益及认股权证负债的公允价值变动相关)。剔除记账影响后,一季度运营亏损为 93 亿美元,包含 23 亿美元的员工股权激励支出。同期研发费用为 86 亿美元。
在营收成本方面,主要用于提供模型服务的一季度支出为 35 亿美元,毛利率由去年同期的 33% 升至 39%。然而,更大的隐性开支在于算力协议。一季度披露显示,截至 2025 年底,云算力采购承诺额高达 6650 亿美元,采购合同将一直延续至 2030 年。上周,OpenAI 已秘密提交上市申请。
信源:https://www.theinformation.com/articles/openai-burned-3-7-billion-first-three-months-2026
❤1
OpenAI、Anthropic与xAI研究员参投的MoE Capital募资2500万美元
由前 AGI House 成员联合创办的早期风投基金 MoE Capital 完成首期 2500 万美元募资。这只基金的独特之处在于出资人(LP)及顾问网络深度绑定了来自 OpenAI、Anthropic 和 xAI 等前沿实验室的活跃研究员。
在早期 AI 投资竞争白热化的背景下,MoE Capital 试图通过构建紧密的研究员社区来建立信息优势。在主流实验室工作的研究员能够第一时间为基金推荐有创业意向的离职同事,从而锁定高价值项目源。为了加强软硬件协同,团队本月还组织了多位研究员前往深圳考察机器人供应链供应商。
目前,MoE Capital 已投资了开发生物医药 AI 智能体的 Phylo,以及致力于实现递归超智能的 neolab 公司 Recursive Superintelligence。
信源:https://www.theinformation.com/newsletters/ai-agenda/anthropic-losing-goodwill-ai-researchers-agi-house-alums-raise-25-million-new-fund
由前 AGI House 成员联合创办的早期风投基金 MoE Capital 完成首期 2500 万美元募资。这只基金的独特之处在于出资人(LP)及顾问网络深度绑定了来自 OpenAI、Anthropic 和 xAI 等前沿实验室的活跃研究员。
在早期 AI 投资竞争白热化的背景下,MoE Capital 试图通过构建紧密的研究员社区来建立信息优势。在主流实验室工作的研究员能够第一时间为基金推荐有创业意向的离职同事,从而锁定高价值项目源。为了加强软硬件协同,团队本月还组织了多位研究员前往深圳考察机器人供应链供应商。
目前,MoE Capital 已投资了开发生物医药 AI 智能体的 Phylo,以及致力于实现递归超智能的 neolab 公司 Recursive Superintelligence。
信源:https://www.theinformation.com/newsletters/ai-agenda/anthropic-losing-goodwill-ai-researchers-agi-house-alums-raise-25-million-new-fund
OpenAI Codex遭遇「容量达到上限」故障,官方已修复并将重置所有用户的订阅额度
6 月 16 日,许多 Codex 用户遇到了「模型容量达到上限」(model at capacity)的报错,导致服务短暂中断。
OpenAI 核心产品负责人 Thibault Sottiaux 在 X 上承认了这一错误并表示团队正在修复。随后他确认该故障已成功解决,团队将在 24 小时内为所有订阅计划重置 Codex 的速率限制(rate limits)。
信源:https://x.com/thsottiaux/status/2066956441173323943
6 月 16 日,许多 Codex 用户遇到了「模型容量达到上限」(model at capacity)的报错,导致服务短暂中断。
OpenAI 核心产品负责人 Thibault Sottiaux 在 X 上承认了这一错误并表示团队正在修复。随后他确认该故障已成功解决,团队将在 24 小时内为所有订阅计划重置 Codex 的速率限制(rate limits)。
信源:https://x.com/thsottiaux/status/2066956441173323943
微软 Copilot Cowork 转向按量计费:测试 DeepSeek V4 降低算力成本
微软将 Copilot Cowork 的企业订阅服务转向按量计费模式,并正在测试微调版 DeepSeek V4 模型,作为降低智能体运行开销的低成本选项。
微软副总裁 Charles Lamanna 透露,内部测试显示 Copilot Cowork 无法继续支持无限使用。由于智能体工具在执行任务时会高频调用后台模型,部分用户每周需要运行数百项任务,导致算力消耗迅速超出常规套餐的承受范围。
为了降低运行成本,微软计划在未来几周内提供更便宜的模型选项。目前正在评估基于 DeepSeek V4 或其他开源模型微调的版本,作为现行 Anthropic 和 OpenAI 旗舰模型的补充。
如果微软决定推进 DeepSeek 方案,新模型将作为可选配置,且完全在 Azure 平台进行本地托管。微软表示,托管模式可确保企业数据完全留在微软云内部,并遵守 Azure 的安全与合规标准。同时,微软已对模型进行了微调,加入了减少偏见的防护措施。不过,引入中国开发商的 AI 模型可能仍会使微软面临舆论或合规层面的质疑。
信源:https://www.axios.com/2026/06/16/microsoft-copilot-cowork-tokenmaxxing-cowork
微软将 Copilot Cowork 的企业订阅服务转向按量计费模式,并正在测试微调版 DeepSeek V4 模型,作为降低智能体运行开销的低成本选项。
微软副总裁 Charles Lamanna 透露,内部测试显示 Copilot Cowork 无法继续支持无限使用。由于智能体工具在执行任务时会高频调用后台模型,部分用户每周需要运行数百项任务,导致算力消耗迅速超出常规套餐的承受范围。
为了降低运行成本,微软计划在未来几周内提供更便宜的模型选项。目前正在评估基于 DeepSeek V4 或其他开源模型微调的版本,作为现行 Anthropic 和 OpenAI 旗舰模型的补充。
如果微软决定推进 DeepSeek 方案,新模型将作为可选配置,且完全在 Azure 平台进行本地托管。微软表示,托管模式可确保企业数据完全留在微软云内部,并遵守 Azure 的安全与合规标准。同时,微软已对模型进行了微调,加入了减少偏见的防护措施。不过,引入中国开发商的 AI 模型可能仍会使微软面临舆论或合规层面的质疑。
信源:https://www.axios.com/2026/06/16/microsoft-copilot-cowork-tokenmaxxing-cowork
Axios
Microsoft eyes DeepSeek for enterprise AI
Microsoft will also shift to usage-based pricing for the enterprise agent.
AI智能体提交量暴增冲垮GitHub基础设施:微软被迫向竞争对手AWS租用弹性算力
AI 智能体爆发带来的代码提交量让 GitHub 平台稳定性不堪重负,迫使微软打破将 GitHub 基础设施全面移往 Azure 的迁移承诺,紧急向竞争对手亚马逊 AWS 采购弹性计算资源。根据 Business Insider 报道,两位知情人士透露,虽然微软计划在 2027 年将 GitHub 彻底迁至 Azure,但当前频发的宕机与容量危机促使微软引入 AWS 进行弹性支撑。
根据 GitHub 官方披露,平台 2026 年 Commit 提交次数预计将冲上 140 亿次,相较之下,2025 年平台提交次数仅为 10 亿次。GitHub 首席技术官 Vlad Fedorov 透露,团队在 2025 年 10 月曾设计了 10 倍扩容计划,但随着智能体开发工作流在同年 12 月底的爆发,不得不于 2026 年 2 月将设计容量上调至 30 倍。
基础设施过载已经直接威胁到开发者生态的稳定。2026 年 5 月,GitHub 发生了 9 次服务降级故障。而在同年 4 月,HashiCorp 联合创始人 Mitchell Hashimoto 已宣布计划将 Ghostty 项目移出平台,并直言 GitHub 频繁的中断已不再适合严肃的开发工作。尽管微软 2026 年度的资本支出预计将达到 1900 亿美元,但微软首席财务官 Amy Hood 警告称,算力供需瓶颈在 2026 年底前仍将持续。
针对多云托管一事,微软发言人回应称,自 2025 年底以来的智能体开发激增对 GitHub 基础设施造成了极限测试,公司在加速向 Azure 迁移的同时,将通过多云战略确保弹性和规模。跨云采购算力在当前的算力紧张环境下并非孤例,Google 也在近期与 SpaceX 达成了一项为期数年、月均支付 9.2 亿美元的计算资源采购合同。
信源:https://www.businessinsider.com/microsoft-github-amazon-ai-cloud-capacity-2026-6
AI 智能体爆发带来的代码提交量让 GitHub 平台稳定性不堪重负,迫使微软打破将 GitHub 基础设施全面移往 Azure 的迁移承诺,紧急向竞争对手亚马逊 AWS 采购弹性计算资源。根据 Business Insider 报道,两位知情人士透露,虽然微软计划在 2027 年将 GitHub 彻底迁至 Azure,但当前频发的宕机与容量危机促使微软引入 AWS 进行弹性支撑。
根据 GitHub 官方披露,平台 2026 年 Commit 提交次数预计将冲上 140 亿次,相较之下,2025 年平台提交次数仅为 10 亿次。GitHub 首席技术官 Vlad Fedorov 透露,团队在 2025 年 10 月曾设计了 10 倍扩容计划,但随着智能体开发工作流在同年 12 月底的爆发,不得不于 2026 年 2 月将设计容量上调至 30 倍。
基础设施过载已经直接威胁到开发者生态的稳定。2026 年 5 月,GitHub 发生了 9 次服务降级故障。而在同年 4 月,HashiCorp 联合创始人 Mitchell Hashimoto 已宣布计划将 Ghostty 项目移出平台,并直言 GitHub 频繁的中断已不再适合严肃的开发工作。尽管微软 2026 年度的资本支出预计将达到 1900 亿美元,但微软首席财务官 Amy Hood 警告称,算力供需瓶颈在 2026 年底前仍将持续。
针对多云托管一事,微软发言人回应称,自 2025 年底以来的智能体开发激增对 GitHub 基础设施造成了极限测试,公司在加速向 Azure 迁移的同时,将通过多云战略确保弹性和规模。跨云采购算力在当前的算力紧张环境下并非孤例,Google 也在近期与 SpaceX 达成了一项为期数年、月均支付 9.2 亿美元的计算资源采购合同。
信源:https://www.businessinsider.com/microsoft-github-amazon-ai-cloud-capacity-2026-6
Business Insider
Microsoft is resorting to its biggest cloud rival to deal with GitHub AI capacity issues
Microsoft is adding AWS capacity to GitHub after AI-driven growth strained infrastructure and triggered a series of reliability issues.