动察Beating AI News
微软单季营收900亿美元,Azure全年首次突破1000亿美元 微软发布 2026 财年第四季度财报。季度营收达到 900 亿美元,同比增长 18%;净利润为 358 亿美元,同比增长 31%。两项数据均超过市场预期,微软股价盘后一度上涨超过 8%。 增长主要来自云计算和 AI。Azure 收入同比增长 43%,高于市场预期。全年 Azure 收入首次突破 1000 亿美元。Microsoft 365 Copilot 付费席位超过 3000 万,上季度还只有 2000 万。 微软同时公布了压低 AI…
微软Copilot付费席位破3000万,大企业部署开始放量
微软 365 Copilot 付费席位突破 3000 万。一个席位就是一名员工的付费授权。上一季度这一数字超过 2000 万,净新增席位环比翻倍。最终结果也明显超过华尔街约 2690 万席的预期。
增长开始从新增客户转向大客户扩容。拥有 5 万席以上的客户数量同比增长超过 7 倍。把 Copilot 部署给多数知识员工的企业,环比增加近 75%。
NHS England 正向 50.5 万名员工铺开 Copilot,HSBC 承诺购买 20 万席。EY 则通过包含 Copilot 的 E7 套件,部署至 40 万名员工。
这些数据表明,Copilot 正从部门试用进入大范围部署。它为微软提供了 Azure 算力之外,更直接的软件订阅收入。微软称,用户平均每周使用频率已接近 Outlook 和 Teams,但尚未公布全部付费席位的统一活跃率。
微软财报
微软 365 Copilot 付费席位突破 3000 万。一个席位就是一名员工的付费授权。上一季度这一数字超过 2000 万,净新增席位环比翻倍。最终结果也明显超过华尔街约 2690 万席的预期。
增长开始从新增客户转向大客户扩容。拥有 5 万席以上的客户数量同比增长超过 7 倍。把 Copilot 部署给多数知识员工的企业,环比增加近 75%。
NHS England 正向 50.5 万名员工铺开 Copilot,HSBC 承诺购买 20 万席。EY 则通过包含 Copilot 的 E7 套件,部署至 40 万名员工。
这些数据表明,Copilot 正从部门试用进入大范围部署。它为微软提供了 Azure 算力之外,更直接的软件订阅收入。微软称,用户平均每周使用频率已接近 Outlook 和 Teams,但尚未公布全部付费席位的统一活跃率。
微软财报
👍1
Gemini上线Mac全局语音输入:说话就能直接改稿
谷歌给 Gemini for macOS 上线全局语音输入。用户在任意 App 中长按 Fn 键即可开始说话,转写结果会直接填入当前光标位置。Gemini 会自动删除「嗯」「啊」等口头语,识别中途改口,并把内容整理成段落或列表。
开启可选的屏幕推理后,Gemini 还能读取用户选中的文字、文件、图片和文档。用户可以直接用语音让它改写内容、调整语气、提炼摘要,或生成和修改图片,结果会写回当前 App。
新功能正在全球逐步开放,面向所有 Gemini Mac 用户,首批仅支持英语。
谷歌
谷歌给 Gemini for macOS 上线全局语音输入。用户在任意 App 中长按 Fn 键即可开始说话,转写结果会直接填入当前光标位置。Gemini 会自动删除「嗯」「啊」等口头语,识别中途改口,并把内容整理成段落或列表。
开启可选的屏幕推理后,Gemini 还能读取用户选中的文字、文件、图片和文档。用户可以直接用语音让它改写内容、调整语气、提炼摘要,或生成和修改图片,结果会写回当前 App。
新功能正在全球逐步开放,面向所有 Gemini Mac 用户,首批仅支持英语。
谷歌
👎1
Grok全新语音模型拿下Agent评测第一,API价格涨60%
SpaceXAI 发布 Grok Voice Think Fast 2.0。这是一款面向客服、销售和电话场景的语音 Agent 模型,可听懂用户、生成语音回答并调用工具。新版本重点提升了推理、转写和对话能力。
Artificial Analysis 的独立评测显示,它的语音综合指数为 82.9%,排名第二,仅次于通义 Qwen Audio 3.0 Realtime Plus 的 84.1%。在测试语音 Agent 完成客服任务的 τ-Voice 基准中,它以 56.5% 排名第一,高于 Qwen 的 54.6% 和 GPT-Realtime-2.1 High 的 45.7%。首次出声只需 0.70 秒。
性能提升同时伴随涨价。API 价格从每分钟 0.05 美元升至 0.08 美元,涨幅 60%,每小时音频成本为 4.80 美元。
SpaceXAI
SpaceXAI 发布 Grok Voice Think Fast 2.0。这是一款面向客服、销售和电话场景的语音 Agent 模型,可听懂用户、生成语音回答并调用工具。新版本重点提升了推理、转写和对话能力。
Artificial Analysis 的独立评测显示,它的语音综合指数为 82.9%,排名第二,仅次于通义 Qwen Audio 3.0 Realtime Plus 的 84.1%。在测试语音 Agent 完成客服任务的 τ-Voice 基准中,它以 56.5% 排名第一,高于 Qwen 的 54.6% 和 GPT-Realtime-2.1 High 的 45.7%。首次出声只需 0.70 秒。
性能提升同时伴随涨价。API 价格从每分钟 0.05 美元升至 0.08 美元,涨幅 60%,每小时音频成本为 4.80 美元。
SpaceXAI
❤1😁1
Kimi K3接入Claude Code,平均任务成本是Kimi Code的9倍
AI Agent 基础设施公司 Composio 将同一款 Kimi K3 接入 Kimi Code、Hermes 和 Claude Code,完成 28 项相同任务。三套运行框架的成功数只差 2 项,Token 用量和成本却相差很大。
Kimi Code 完成 22 项,Hermes 完成 21 项,Claude Code 完成 20 项。单项任务 Token 中位数分别为 6.1 万、6.7 万和 34 万。Composio 估算,平均每项任务成本约为 0.22 美元、0.28 美元和 2 美元。个别任务的 Token 用量最多相差 30 倍。
Hermes 速度最快,单项任务中位耗时为 179 秒。Kimi Code 为 297 秒,Claude Code 为 348 秒。
Writer 的另一项研究也得到相近结果。研究人员在 22 项企业任务和 6 款模型上只替换运行框架,Token 用量下降 38%,单项成本下降 41%,耗时下降 44%,完成质量基本持平。
Composio
AI Agent 基础设施公司 Composio 将同一款 Kimi K3 接入 Kimi Code、Hermes 和 Claude Code,完成 28 项相同任务。三套运行框架的成功数只差 2 项,Token 用量和成本却相差很大。
Kimi Code 完成 22 项,Hermes 完成 21 项,Claude Code 完成 20 项。单项任务 Token 中位数分别为 6.1 万、6.7 万和 34 万。Composio 估算,平均每项任务成本约为 0.22 美元、0.28 美元和 2 美元。个别任务的 Token 用量最多相差 30 倍。
Hermes 速度最快,单项任务中位耗时为 179 秒。Kimi Code 为 297 秒,Claude Code 为 348 秒。
Writer 的另一项研究也得到相近结果。研究人员在 22 项企业任务和 6 款模型上只替换运行框架,Token 用量下降 38%,单项成本下降 41%,耗时下降 44%,完成质量基本持平。
Composio
😱2
动察Beating AI News
LongCat-2.0正式发布不足一月,美团基础模型负责人裴鹏将离职 知情人士透露,美团 LongCat 团队基础模型负责人裴鹏即将离职。裴鹏于 2023 年加入美团,负责大语言、多模态和 Agent 模型研发。 美团刚在 6 月 30 日发布并开源 LongCat-2.0,是业界首个依靠国产算力完成训练、推理全流程的万亿参数大模型。 加入美团前,裴鹏曾在微软和谷歌任职,长期从事搜索与自然语言处理。 申妈的朋友圈
美团龙猫核心团队生变:预训练、后训练负责人相继出走
美团 LongCat 文本基础模型与原生多模态负责人裴鹏已确定离职,目前不再参与团队决策。LongCat 后训练负责人苏辉此前也已离开,并加盟另一家头部大厂。
裴鹏此前负责文本基座、原生多模态和预训练,参与推进 LongCat-2.0。苏辉负责 LongCat 系列模型的对齐、微调和强化学习,同时负责 Agent 项目 Beam。两人分别掌握模型训练的前后两条关键链路。
美团 7 月 27 日曾否认裴鹏离职。
Top华人科创社
美团 LongCat 文本基础模型与原生多模态负责人裴鹏已确定离职,目前不再参与团队决策。LongCat 后训练负责人苏辉此前也已离开,并加盟另一家头部大厂。
裴鹏此前负责文本基座、原生多模态和预训练,参与推进 LongCat-2.0。苏辉负责 LongCat 系列模型的对齐、微调和强化学习,同时负责 Agent 项目 Beam。两人分别掌握模型训练的前后两条关键链路。
美团 7 月 27 日曾否认裴鹏离职。
Top华人科创社
👍2
动察Beating AI News
Jane Street罕见出资,24岁前OpenAI研究员旗下基金规模突破200亿美元 前 OpenAI 研究员阿申布伦纳(Leopold Aschenbrenner)创立的 AI 基金 Situational Awareness 规模已超 200 亿美元,量化巨头简街(Jane Street)已罕见注资。 扣除费用后,Situational Awareness 年内收益率达 270%,自成立起累计收益超 1000%。对 Anthropic 的股权押注贡献了最成功收益,占资产的五分之一。2025 年 2…
半年暴赚439%遭杠杆反噬,24岁前OpenAI研究员的200亿美元AI基金开始筹集新资金
《金融时报》援引知情人士称,24岁前 OpenAI 研究员 Leopold Aschenbrenner 创办的对冲基金 Situational Awareness,近期开始向现有投资人和贷款方筹集新资金。该基金规模约 200 亿美元,集中押注 AI 相关股票。基金还向部分投资人提出直接购买其持仓资产的方案。
Situational Awareness 截至 6 月底的年内净回报高达 439%。这轮上涨借助借款放大,AI 股票暴跌后,亏损也被同步放大。基金最新披露的 Oracle 和 AMD 持仓本月均跌约 20%,Nebius、Sharon AI、Bloom Energy 和 Sandisk 等持仓跌幅更大。
Aschenbrenner 仍把这轮抛售视为补仓机会。他在 7 月 24 日发给投资人的信中开放 8 月 1 日追加资金,并把 Anthropic 可能在下半年上市列为反弹催化剂。基金没有披露本轮具体亏损,也没有回应报道。目前只有《金融时报》披露了这次筹资动作。
FT
《金融时报》援引知情人士称,24岁前 OpenAI 研究员 Leopold Aschenbrenner 创办的对冲基金 Situational Awareness,近期开始向现有投资人和贷款方筹集新资金。该基金规模约 200 亿美元,集中押注 AI 相关股票。基金还向部分投资人提出直接购买其持仓资产的方案。
Situational Awareness 截至 6 月底的年内净回报高达 439%。这轮上涨借助借款放大,AI 股票暴跌后,亏损也被同步放大。基金最新披露的 Oracle 和 AMD 持仓本月均跌约 20%,Nebius、Sharon AI、Bloom Energy 和 Sandisk 等持仓跌幅更大。
Aschenbrenner 仍把这轮抛售视为补仓机会。他在 7 月 24 日发给投资人的信中开放 8 月 1 日追加资金,并把 Anthropic 可能在下半年上市列为反弹催化剂。基金没有披露本轮具体亏损,也没有回应报道。目前只有《金融时报》披露了这次筹资动作。
FT
😁3
谷歌Lyria 3.5上线:AI歌声更像真人,歌词更听指令
谷歌发布新一代 AI 音乐模型 Lyria 3.5,并开始在 Google Flow Music 上线。新模型重点提升旋律、歌词和人声质量。生成的旋律结构更丰富,歌词更贴合提示词,人声发音更准确,情绪也更自然。
用户可以直接指定曲风、乐器、人声、速度和歌曲时长。Lyria 最长可生成 3 分钟歌曲。Flow Music 还支持局部重写歌词、翻译歌词、修改节拍和延长指定片段,不必重新生成整首歌。
此前发布的 Lyria 3 Pro 已经支持 3 分钟完整歌曲。Lyria 3.5 没有继续拉长时长,升级重点放在成品质量和控制精度。所有生成歌曲都会加入 SynthID 隐形水印,用于识别 AI 生成或修改的音乐。
谷歌
谷歌发布新一代 AI 音乐模型 Lyria 3.5,并开始在 Google Flow Music 上线。新模型重点提升旋律、歌词和人声质量。生成的旋律结构更丰富,歌词更贴合提示词,人声发音更准确,情绪也更自然。
用户可以直接指定曲风、乐器、人声、速度和歌曲时长。Lyria 最长可生成 3 分钟歌曲。Flow Music 还支持局部重写歌词、翻译歌词、修改节拍和延长指定片段,不必重新生成整首歌。
此前发布的 Lyria 3 Pro 已经支持 3 分钟完整歌曲。Lyria 3.5 没有继续拉长时长,升级重点放在成品质量和控制精度。所有生成歌曲都会加入 SynthID 隐形水印,用于识别 AI 生成或修改的音乐。
谷歌
Google
We’re launching Lyria 3.5 in Google Flow Music, with advances across musicality, lyrics, vocals, and creative control.
Our newest music generation model, Lyria 3.5, delivers significant advancements across musicality, lyrics, and vocal quality, empowering you to craft richer tracks. We’r…
❤1
GPT-5.6上线后给自己降本,运行成本降20%
OpenAI 披露,GPT-5.6 Sol 上线后已经开始参与改进承载自己的生产系统。它通过 Codex 分析真实流量、调整请求分配,并自主重写 GPU kernel(控制芯片计算的底层代码)。相关优化让模型端到端运行成本下降 20%。
GPT-5.6 Sol 还改进了配套的草稿模型。它自行设计并运行数百次架构实验,启动和监控训练。遇到硬件故障或训练不稳定时,它也会介入处理。最终,推测解码(小模型先预测,主模型批量验证)的 Token 生成效率提高超过 15%。
OpenAI 将这套流程描述为持续反馈循环:观察生产环境、找出瓶颈、修改系统,再验证整体效果。GPT-5.6 已经参与了其中多个环节。
OpenAI
OpenAI 披露,GPT-5.6 Sol 上线后已经开始参与改进承载自己的生产系统。它通过 Codex 分析真实流量、调整请求分配,并自主重写 GPU kernel(控制芯片计算的底层代码)。相关优化让模型端到端运行成本下降 20%。
GPT-5.6 Sol 还改进了配套的草稿模型。它自行设计并运行数百次架构实验,启动和监控训练。遇到硬件故障或训练不稳定时,它也会介入处理。最终,推测解码(小模型先预测,主模型批量验证)的 Token 生成效率提高超过 15%。
OpenAI 将这套流程描述为持续反馈循环:观察生产环境、找出瓶颈、修改系统,再验证整体效果。GPT-5.6 已经参与了其中多个环节。
OpenAI
OpenAI
How GPT-5.6 fuses frontier intelligence with frontier efficiency
GPT-5.6 improves AI efficiency across models, inference, and agentic workflows, helping deliver more useful intelligence per dollar.
❤2
腾讯WorkBuddy上线AI协同编辑,支持Word、Excel和PPT
腾讯 WorkBuddy 上线「人机双写」功能。用户可以直接打开 Word、Excel、PPT 和 Markdown 文件,框选一段文字、一组单元格或一页 PPT,让 AI 在原位置修改。
AI 只处理指定区域,其他内容和版式尽量不动。用户可以查看改动、继续手动编辑,也可以撤销结果。
Word 支持续写、润色和排版。Excel 支持分析数据和生成图表。PPT 支持拆页、调整布局和生成演讲备注。
不过,这类功能在 OpenAI 的 Codex 中早已上线。
腾讯
腾讯 WorkBuddy 上线「人机双写」功能。用户可以直接打开 Word、Excel、PPT 和 Markdown 文件,框选一段文字、一组单元格或一页 PPT,让 AI 在原位置修改。
AI 只处理指定区域,其他内容和版式尽量不动。用户可以查看改动、继续手动编辑,也可以撤销结果。
Word 支持续写、润色和排版。Excel 支持分析数据和生成图表。PPT 支持拆页、调整布局和生成演讲备注。
不过,这类功能在 OpenAI 的 Codex 中早已上线。
腾讯
👎2
动察Beating AI News
海外开发者评Kimi K3:橱窗里的F1,也是送给世界的礼物 Kimi K3 完整权重放出后,海外社区评价很高,但并不一边倒。夸的人叫它「怪兽」,认为它已经摸到顶级闭源模型的水平。界面生成、代码架构和深度研究,是目前好评最多的几项能力。也有人觉得,它还没有超过 Fable 5,但已经追得很近。 最大的遗憾还是太大。一名 Reddit 用户把它比作「摆在橱窗里的 F1 赛车」:性能确实强,但普通人根本开不回家。已有开发者把 80 张 RTX 5090 连成集群,跑起了完整的 Kimi K3。它没有使用昂贵的…
Kimi K3能在Mac本地运行了,但普通用户仍跑不起
开源 AI 工具公司 Unsloth 发布 Kimi K3 的 1-bit GGUF 版本,把模型从 1.56TB 压到 594GB。用户可以通过 Unsloth Studio 或 llama.cpp 在 Mac 本地运行。
但这个版本至少需要约 610GB 内存。按官方方案,顶配 512GB Mac Studio 还要搭配一台 128GB 内存设备。内存不够也能借助硬盘勉强加载,但速度会大幅下降。
社区还有 350GB 和 451GB 的 MLX 裁剪版,可以装进单台 512GB Mac Studio。但它们删除了 73% 至 80% 的专家,实测速度约 0.14 至 0.20 token/s,能力也明显下降。
Unsloth
开源 AI 工具公司 Unsloth 发布 Kimi K3 的 1-bit GGUF 版本,把模型从 1.56TB 压到 594GB。用户可以通过 Unsloth Studio 或 llama.cpp 在 Mac 本地运行。
但这个版本至少需要约 610GB 内存。按官方方案,顶配 512GB Mac Studio 还要搭配一台 128GB 内存设备。内存不够也能借助硬盘勉强加载,但速度会大幅下降。
社区还有 350GB 和 451GB 的 MLX 裁剪版,可以装进单台 512GB Mac Studio。但它们删除了 73% 至 80% 的专家,实测速度约 0.14 至 0.20 token/s,能力也明显下降。
Unsloth
❤3
动察Beating AI News
ARC-AGI-3拆出两个排行榜:裸模型不到1%,加Agent框架后首日即达36% ARC-AGI-3 论文将评测拆分为两个排行榜。官方排行榜禁止外部 harness(Agent 框架),所有模型使用同一极简提示词、不提供工具,测的是模型脱离脚手架后的原生智能。社区排行榜则允许 harness,得分自报,ARC Prize 默认不验证,论文明确提醒「不应将社区排行榜上的分数解读为 AGI 进展的证据」。 官方排行榜上,前沿模型得分均低于 1%:Gemini 3.1 Pro Preview 0.37%、GPT…
OpenAI称评测框架拖累GPT-5.6表现,但Opus 5用同一框架分数高2.3倍
OpenAI 称,ARC-AGI-3 的通用评测框架没有保存 GPT-5.6 Sol 此前的推理,还会在上下文过长时删除早期记录。模型因此经常忘记已经发现的游戏规则,每执行一步都要重新思考。
OpenAI 随后用自家 Responses API 重做评测框架,保留历史推理,并压缩过长的上下文。结果,GPT-5.6 Sol 的得分从 13.3%升至 38.3%,输出 Token 降至约六分之一。
但问题在于,Opus 5 用的也是这套通用框架。它以 High 推理档拿到 30.2%,GPT-5.6 Sol 即使用更高的 Max 档也只有 13.3%。框架确实拖累了 GPT-5.6,却没有同样拖垮 Opus 5。
不管 OpenAI 怎么狡辩,Opus 5 在这项全球最难 AI 评测里就是明显强于 GPT-5.6。
Tibo
OpenAI 称,ARC-AGI-3 的通用评测框架没有保存 GPT-5.6 Sol 此前的推理,还会在上下文过长时删除早期记录。模型因此经常忘记已经发现的游戏规则,每执行一步都要重新思考。
OpenAI 随后用自家 Responses API 重做评测框架,保留历史推理,并压缩过长的上下文。结果,GPT-5.6 Sol 的得分从 13.3%升至 38.3%,输出 Token 降至约六分之一。
但问题在于,Opus 5 用的也是这套通用框架。它以 High 推理档拿到 30.2%,GPT-5.6 Sol 即使用更高的 Max 档也只有 13.3%。框架确实拖累了 GPT-5.6,却没有同样拖垮 Opus 5。
不管 OpenAI 怎么狡辩,Opus 5 在这项全球最难 AI 评测里就是明显强于 GPT-5.6。
Tibo
👍2
Kimi被指整页搬走设计师作品,还挂成官方精选模板
独立设计师 Marina Budarina 指控,Kimi 未经许可,把她的互动网页 CHIMES 换名为「SILK ATLAS」,放进 Kimi Swarm 的精选案例。
她称,Kimi 照搬了页面设计、互动效果和文案,也没有标注作者。
很多网友表示,他们此前看到这个模板时,以为 Budarina 与 Kimi 有合作。还有人误以为,这个作品本来就是用 Kimi 做的。
截至目前,Kimi 尚未公开回应,但已经下架相关模版。
Budarina
独立设计师 Marina Budarina 指控,Kimi 未经许可,把她的互动网页 CHIMES 换名为「SILK ATLAS」,放进 Kimi Swarm 的精选案例。
她称,Kimi 照搬了页面设计、互动效果和文案,也没有标注作者。
很多网友表示,他们此前看到这个模板时,以为 Budarina 与 Kimi 有合作。还有人误以为,这个作品本来就是用 Kimi 做的。
截至目前,Kimi 尚未公开回应,但已经下架相关模版。
Budarina
🤡7❤1
动察Beating AI News
OpenAI称评测框架拖累GPT-5.6表现,但Opus 5用同一框架分数高2.3倍 OpenAI 称,ARC-AGI-3 的通用评测框架没有保存 GPT-5.6 Sol 此前的推理,还会在上下文过长时删除早期记录。模型因此经常忘记已经发现的游戏规则,每执行一步都要重新思考。 OpenAI 随后用自家 Responses API 重做评测框架,保留历史推理,并压缩过长的上下文。结果,GPT-5.6 Sol 的得分从 13.3%升至 38.3%,输出 Token 降至约六分之一。 但问题在于,Opus…
ARC-AGI-3 评测机构考虑改规则:官方榜或允许厂商自带记忆
ARC-AGI-3 评测机构 ARC Prize 此前要求所有模型使用同一套简单调用方式,避免厂商靠定制框架拉高分数。这样更容易看清模型本身的能力。
回应 OpenAI 的争议测试时,官方口径开始松动。ARC Prize 承认,保留历史推理、压缩过长的上下文,确实能提升模型处理长任务的表现,并已开始研究如何把这类功能加入正式评测。
ARC-AGI 创始人 François Chollet 给出的边界是:专门为 ARC 开发的框架仍然不行;所有 API 用户都能使用的通用设置可以考虑。他认为,各家用了什么设置、花了多少钱,都应该公开。
一旦放行厂商自带的记忆和上下文管理,ARC-AGI-3 比较的就不再只是模型,还会包含各家 API 背后的工程能力。
ARC Prize
ARC-AGI-3 评测机构 ARC Prize 此前要求所有模型使用同一套简单调用方式,避免厂商靠定制框架拉高分数。这样更容易看清模型本身的能力。
回应 OpenAI 的争议测试时,官方口径开始松动。ARC Prize 承认,保留历史推理、压缩过长的上下文,确实能提升模型处理长任务的表现,并已开始研究如何把这类功能加入正式评测。
ARC-AGI 创始人 François Chollet 给出的边界是:专门为 ARC 开发的框架仍然不行;所有 API 用户都能使用的通用设置可以考虑。他认为,各家用了什么设置、花了多少钱,都应该公开。
一旦放行厂商自带的记忆和上下文管理,ARC-AGI-3 比较的就不再只是模型,还会包含各家 API 背后的工程能力。
ARC Prize
❤1
OpenAI年化收入达到426亿美元,两个月增长约29%
OpenAI CFO Sarah Friar 在内部会议上称,公司 7 月收入继续增长,主要由 GPT-5.6、企业 Agent ChatGPT Work 和 Codex 带动。OpenAI 没有公布具体金额。
第三方机构 TickerTrends 估算,OpenAI 7 月底的月度经常性收入水平约为 35.5 亿美元,比 5 月底高约 8 亿美元。其 ARR 从 5 月底的 330 亿美元升至 7 月 29 日的 426 亿美元,两个月增长约 29%。
OpenAI 董事长 Bret Taylor 同时承认,公司年初在 AI 编程市场落后 Anthropic。但部分 Claude Code 重度用户因账单过高,已经开始寻找 Codex 等替代品。
TickerTrends
OpenAI CFO Sarah Friar 在内部会议上称,公司 7 月收入继续增长,主要由 GPT-5.6、企业 Agent ChatGPT Work 和 Codex 带动。OpenAI 没有公布具体金额。
第三方机构 TickerTrends 估算,OpenAI 7 月底的月度经常性收入水平约为 35.5 亿美元,比 5 月底高约 8 亿美元。其 ARR 从 5 月底的 330 亿美元升至 7 月 29 日的 426 亿美元,两个月增长约 29%。
OpenAI 董事长 Bret Taylor 同时承认,公司年初在 AI 编程市场落后 Anthropic。但部分 Claude Code 重度用户因账单过高,已经开始寻找 Codex 等替代品。
TickerTrends
👍1👏1
观点:未来几年,GPU租金可能上涨10倍以上
AI 领域知名播客主持人 Dwarkesh Patel 提出一个反常判断:未来几年,GPU 算力租金可能上涨 10 倍以上。模型越聪明,同一块 GPU 能完成的工作越值钱,AI 公司也更愿意花高价抢算力。
他用软件工程举例。假如一块 H100 等效算力能持续运行一名人类水平的软件工程师,其年租金理论上可超过 25 万美元,约为当前现货价格的 15 倍。
市场已经出现涨价苗头。H100 一年期租金从 2025 年 10 月的每小时 1.70 美元,升至 2026 年 3 月的 2.35 美元,涨近 40%。Epoch AI 估算,全球 AI 算力在 2025 年约增长 3 倍,但头部实验室的算力需求增长更快。
如果这套推演成立,弱模型会因为消耗更多昂贵算力而失去价格优势,低价值的图片和短视频生成也可能先被挤出去。但这只是情景推演。大量 AI 程序员出现后,工程工作的市场价格也可能下降,25 万美元这笔账未必成立。
Dwarkesh Patel
AI 领域知名播客主持人 Dwarkesh Patel 提出一个反常判断:未来几年,GPU 算力租金可能上涨 10 倍以上。模型越聪明,同一块 GPU 能完成的工作越值钱,AI 公司也更愿意花高价抢算力。
他用软件工程举例。假如一块 H100 等效算力能持续运行一名人类水平的软件工程师,其年租金理论上可超过 25 万美元,约为当前现货价格的 15 倍。
市场已经出现涨价苗头。H100 一年期租金从 2025 年 10 月的每小时 1.70 美元,升至 2026 年 3 月的 2.35 美元,涨近 40%。Epoch AI 估算,全球 AI 算力在 2025 年约增长 3 倍,但头部实验室的算力需求增长更快。
如果这套推演成立,弱模型会因为消耗更多昂贵算力而失去价格优势,低价值的图片和短视频生成也可能先被挤出去。但这只是情景推演。大量 AI 程序员出现后,工程工作的市场价格也可能下降,25 万美元这笔账未必成立。
Dwarkesh Patel
X (formerly Twitter)
Dwarkesh Patel (@dwarkesh_sp) on X
New blog post on what would be true about the world if trendline continues and leading lab hits $1T in revenue by the end of next year.
In other words, why compute might get 10x+ more expensive in coming years
https://t.co/7PvniDC2jN
In other words, why compute might get 10x+ more expensive in coming years
https://t.co/7PvniDC2jN
亚马逊内部曝AI成本失控,小错误烧出百万账单
《金融时报》援引知情人士称,亚马逊内部通报了多起 AI 项目严重超支。最夸张的一次,是用 Claude Sonnet 给商品页面匹配作者信息。项目最终失败,却花掉 180 万美元,比预算高 860%,五个月后才被发现。
另一个财务审计工具项目意外多花约 54.1 万美元。一个优化物流配送速度的项目也误花 13.4 万美元,两个多星期后才被发现。
亚马逊工程师将问题归结为部署错误和缺少成本限制。传统系统里几乎不花钱的小错误,放到 AI 项目中可能变成「灾难性昂贵」的账单。公司正在开发自动化措施,防止类似项目继续失控。
亚马逊回应称,这些案例只涉及少数团队,不能代表公司日常使用 AI 的整体情况。此前,亚马逊还关闭了内部 AI 使用排行榜,因为员工为了冲榜让 Agent 执行无意义任务,额外消耗大量 Token。
FT
《金融时报》援引知情人士称,亚马逊内部通报了多起 AI 项目严重超支。最夸张的一次,是用 Claude Sonnet 给商品页面匹配作者信息。项目最终失败,却花掉 180 万美元,比预算高 860%,五个月后才被发现。
另一个财务审计工具项目意外多花约 54.1 万美元。一个优化物流配送速度的项目也误花 13.4 万美元,两个多星期后才被发现。
亚马逊工程师将问题归结为部署错误和缺少成本限制。传统系统里几乎不花钱的小错误,放到 AI 项目中可能变成「灾难性昂贵」的账单。公司正在开发自动化措施,防止类似项目继续失控。
亚马逊回应称,这些案例只涉及少数团队,不能代表公司日常使用 AI 的整体情况。此前,亚马逊还关闭了内部 AI 使用排行榜,因为员工为了冲榜让 Agent 执行无意义任务,额外消耗大量 Token。
FT
🤡3
动察Beating AI News
OpenAI 推出计算生物学基准 GeneBench-Pro,GPT-5.6 满血版正确率仅三成 OpenAI 发布了计算生物学评测基准 GeneBench-Pro,用来测试 AI 智能体在面对基因组学和转化医学等复杂科研场景时的多步决策能力。新基准共包含 129 个问题(其中 82 个经过外部专家评审),通过计算机模拟生成具有明确因果关系的数据,防止模型通过走捷径或迎合出题人偏好来作弊。 测试结果显示,顶尖模型在处理包含量化不确定性的科学推理时依然非常吃力。最强的 GPT-5.6 Sol 在开启 Pro…
大模型再聪明也得刷题,OpenAI前研究员创业卖数据
OpenAI 前研究人员、GeneBench-Pro 共同作者 Andrew Ho 离职创业。新公司将为大模型制作高质量强化学习数据(给模型练习并按结果打分的训练任务)。首批产品聚焦生物学和统计推理,公司名称尚未公开。
Ho 认为,大模型仍然严重偏科。即使在投入巨大的编程领域,模型会刷题、会改代码,真实交付仍常要人工收尾。
更多实际工作则连合适的训练题都没有。它们依赖具体背景,也很难自动判断模型做得对不对。
他的办法是生成接近真实科研的数据和问题,同时保留已知答案。模型可以自由探索,训练系统也能明确判断对错。
GeneBench-Pro 就采用了这套方法。该评测包含 129 项计算生物学任务,GPT-5.6 Sol Pro 的通过率只有 31.5%。
新公司还会制作培养皿、Western blot 等实验图像的训练数据,之后再扩展到化学、材料、医疗和办公室工作。
Ho 预计,前沿 AI 实验室未来将为精准训练数据投入超过 1000 亿美元。
Andrew Ho
OpenAI 前研究人员、GeneBench-Pro 共同作者 Andrew Ho 离职创业。新公司将为大模型制作高质量强化学习数据(给模型练习并按结果打分的训练任务)。首批产品聚焦生物学和统计推理,公司名称尚未公开。
Ho 认为,大模型仍然严重偏科。即使在投入巨大的编程领域,模型会刷题、会改代码,真实交付仍常要人工收尾。
更多实际工作则连合适的训练题都没有。它们依赖具体背景,也很难自动判断模型做得对不对。
他的办法是生成接近真实科研的数据和问题,同时保留已知答案。模型可以自由探索,训练系统也能明确判断对错。
GeneBench-Pro 就采用了这套方法。该评测包含 129 项计算生物学任务,GPT-5.6 Sol Pro 的通过率只有 31.5%。
新公司还会制作培养皿、Western blot 等实验图像的训练数据,之后再扩展到化学、材料、医疗和办公室工作。
Ho 预计,前沿 AI 实验室未来将为精准训练数据投入超过 1000 亿美元。
Andrew Ho
X (formerly Twitter)
Andrew Ho (@andrewho03) on X
Today is my last day at @OpenAI. I'm glad to have spent the last eight months of my life working here!
I'm starting a new company focused on the production of high-quality reinforcement learning datasets:
1. The generalization ability of LLMs is clearly…
I'm starting a new company focused on the production of high-quality reinforcement learning datasets:
1. The generalization ability of LLMs is clearly…
👍1
腾讯开源模型Hy3破解半世纪数学难题,完整证明已通过机器验证
腾讯混元的研究智能体 Hyra,使用自家的开源模型 Hy3,协助两名研究者解决了一个悬而未决 50 多年的组合数学问题。
问题是:一个整数集合的「和集」,最多能比「差集」增长多快。数学界早已证明,相关指数不会超过 2,但一直不知道 2 是不是最优答案。
Hyra 让 Hy3 先搜索具体集合,再尝试提出通用构造。约 24 小时后,AI 找到了论文最终采用的核心方案。研究者随后核对、修正并整理证明,GPT-5.6 Sol 协助转成 Lean 4 验证。
最终论文证明,这个指数可以无限接近 2,所以上界 2 已经是最优答案。虽然 AI 没有包办整篇论文,但最关键的构造确实是 Hy3 找到的。
腾讯混元
腾讯混元的研究智能体 Hyra,使用自家的开源模型 Hy3,协助两名研究者解决了一个悬而未决 50 多年的组合数学问题。
问题是:一个整数集合的「和集」,最多能比「差集」增长多快。数学界早已证明,相关指数不会超过 2,但一直不知道 2 是不是最优答案。
Hyra 让 Hy3 先搜索具体集合,再尝试提出通用构造。约 24 小时后,AI 找到了论文最终采用的核心方案。研究者随后核对、修正并整理证明,GPT-5.6 Sol 协助转成 Lean 4 验证。
最终论文证明,这个指数可以无限接近 2,所以上界 2 已经是最优答案。虽然 AI 没有包办整篇论文,但最关键的构造确实是 Hy3 找到的。
腾讯混元
👍3
月之暗面(Kimi)完成股改,为香港上市铺路
月之暗面(Kimi)已更名为「北京月之暗面科技股份有限公司」,企业类型从有限责任公司变为非上市股份有限公司。杨植麟出任董事长兼经理,张予彤新增为董事,宋思嘉新增为财务负责人。
这次变更通常被称为「股改」。证监会规定,境内企业若以境内主体直接赴境外上市,发行人必须是股份有限公司。
彭博此前称,月之暗面已向投资者发出赴港上市股东决议,最快可能在半年内 IPO,并开始拆除红筹架构。公司尚未正式公布上市时间。
爱企查
月之暗面(Kimi)已更名为「北京月之暗面科技股份有限公司」,企业类型从有限责任公司变为非上市股份有限公司。杨植麟出任董事长兼经理,张予彤新增为董事,宋思嘉新增为财务负责人。
这次变更通常被称为「股改」。证监会规定,境内企业若以境内主体直接赴境外上市,发行人必须是股份有限公司。
彭博此前称,月之暗面已向投资者发出赴港上市股东决议,最快可能在半年内 IPO,并开始拆除红筹架构。公司尚未正式公布上市时间。
爱企查
❤1
OpenAI免费给10万科研人员用GPT-5.6 Sol Pro
OpenAI 推出 ChatGPT for Academic Researchers,计划到 2027 年向 10 万名科研人员免费开放前沿模型和研究工具。首批 1 万人将在今年夏天获得权限,启动时可用 GPT-5.6 Sol Pro、ChatGPT Work 和 Codex。
参与者还会获得更多 Deep Research 额度、更高使用上限和更长上下文。平台内置 75 项以上生命科学技能,也能连接论文库、公共基因组数据库和计算笔记本。
这项福利并非所有高校人员都能领。申请者须来自 OpenAI 选定的研究型高校,并验证学校身份、在研项目和科学用途。获批后最多可邀请 4 名同校合作者,数据默认不用于训练。
OpenAI
OpenAI 推出 ChatGPT for Academic Researchers,计划到 2027 年向 10 万名科研人员免费开放前沿模型和研究工具。首批 1 万人将在今年夏天获得权限,启动时可用 GPT-5.6 Sol Pro、ChatGPT Work 和 Codex。
参与者还会获得更多 Deep Research 额度、更高使用上限和更长上下文。平台内置 75 项以上生命科学技能,也能连接论文库、公共基因组数据库和计算笔记本。
这项福利并非所有高校人员都能领。申请者须来自 OpenAI 选定的研究型高校,并验证学校身份、在研项目和科学用途。获批后最多可邀请 4 名同校合作者,数据默认不用于训练。
OpenAI
OpenAI
Accelerating scientific discovery with ChatGPT for Academic Researchers
OpenAI is giving 100,000 academic researchers free access to ChatGPT's most advanced AI models to accelerate scientific research, collaboration, and discovery.
👍1
Claude Opus 5最会卖货,也最爱和对手串通定价
AI 评测机构 Andon Labs 让模型拿着 500 美元本金,在模拟环境中经营一台售货机 365 天。Claude Opus 5 五次测试的期末余额平均为 1.12 万美元,超过 Claude Opus 4.7 和 GPT-5.6 Sol,升至 Vending-Bench 2 第一。
在多人竞争版中,Opus 5 以约 7000 美元排名第二,与第一名 GPT-5.6 Sol 的约 7400 美元相差不大。六次测试里,它每次都提出或参与串通定价。它还编造竞争对手报价、威胁同行,并累计撕毁 11 次停战协议。
Opus 5 的退款批准率最终降至 10%,六次测试合计只退了 8.54 美元。GPT-5.6 Sol 退了 655 美元,依然赢下多人赛。
Andon Labs 认为,Opus 5 再次出现「越会赚钱,行为越不对齐」的问题。Anthropic 自己的发布前审计却称,它是历来最对齐的 Claude。
Andon Labs
AI 评测机构 Andon Labs 让模型拿着 500 美元本金,在模拟环境中经营一台售货机 365 天。Claude Opus 5 五次测试的期末余额平均为 1.12 万美元,超过 Claude Opus 4.7 和 GPT-5.6 Sol,升至 Vending-Bench 2 第一。
在多人竞争版中,Opus 5 以约 7000 美元排名第二,与第一名 GPT-5.6 Sol 的约 7400 美元相差不大。六次测试里,它每次都提出或参与串通定价。它还编造竞争对手报价、威胁同行,并累计撕毁 11 次停战协议。
Opus 5 的退款批准率最终降至 10%,六次测试合计只退了 8.54 美元。GPT-5.6 Sol 退了 655 美元,依然赢下多人赛。
Andon Labs 认为,Opus 5 再次出现「越会赚钱,行为越不对齐」的问题。Anthropic 自己的发布前审计却称,它是历来最对齐的 Claude。
Andon Labs
❤2