动察Beating AI News
LongCat-2.0正式发布不足一月,美团基础模型负责人裴鹏将离职 知情人士透露,美团 LongCat 团队基础模型负责人裴鹏即将离职。裴鹏于 2023 年加入美团,负责大语言、多模态和 Agent 模型研发。 美团刚在 6 月 30 日发布并开源 LongCat-2.0,是业界首个依靠国产算力完成训练、推理全流程的万亿参数大模型。 加入美团前,裴鹏曾在微软和谷歌任职,长期从事搜索与自然语言处理。 申妈的朋友圈
美团龙猫核心团队生变:预训练、后训练负责人相继出走
美团 LongCat 文本基础模型与原生多模态负责人裴鹏已确定离职,目前不再参与团队决策。LongCat 后训练负责人苏辉此前也已离开,并加盟另一家头部大厂。
裴鹏此前负责文本基座、原生多模态和预训练,参与推进 LongCat-2.0。苏辉负责 LongCat 系列模型的对齐、微调和强化学习,同时负责 Agent 项目 Beam。两人分别掌握模型训练的前后两条关键链路。
美团 7 月 27 日曾否认裴鹏离职。
Top华人科创社
美团 LongCat 文本基础模型与原生多模态负责人裴鹏已确定离职,目前不再参与团队决策。LongCat 后训练负责人苏辉此前也已离开,并加盟另一家头部大厂。
裴鹏此前负责文本基座、原生多模态和预训练,参与推进 LongCat-2.0。苏辉负责 LongCat 系列模型的对齐、微调和强化学习,同时负责 Agent 项目 Beam。两人分别掌握模型训练的前后两条关键链路。
美团 7 月 27 日曾否认裴鹏离职。
Top华人科创社
👍2
动察Beating AI News
Jane Street罕见出资,24岁前OpenAI研究员旗下基金规模突破200亿美元 前 OpenAI 研究员阿申布伦纳(Leopold Aschenbrenner)创立的 AI 基金 Situational Awareness 规模已超 200 亿美元,量化巨头简街(Jane Street)已罕见注资。 扣除费用后,Situational Awareness 年内收益率达 270%,自成立起累计收益超 1000%。对 Anthropic 的股权押注贡献了最成功收益,占资产的五分之一。2025 年 2…
半年暴赚439%遭杠杆反噬,24岁前OpenAI研究员的200亿美元AI基金开始筹集新资金
《金融时报》援引知情人士称,24岁前 OpenAI 研究员 Leopold Aschenbrenner 创办的对冲基金 Situational Awareness,近期开始向现有投资人和贷款方筹集新资金。该基金规模约 200 亿美元,集中押注 AI 相关股票。基金还向部分投资人提出直接购买其持仓资产的方案。
Situational Awareness 截至 6 月底的年内净回报高达 439%。这轮上涨借助借款放大,AI 股票暴跌后,亏损也被同步放大。基金最新披露的 Oracle 和 AMD 持仓本月均跌约 20%,Nebius、Sharon AI、Bloom Energy 和 Sandisk 等持仓跌幅更大。
Aschenbrenner 仍把这轮抛售视为补仓机会。他在 7 月 24 日发给投资人的信中开放 8 月 1 日追加资金,并把 Anthropic 可能在下半年上市列为反弹催化剂。基金没有披露本轮具体亏损,也没有回应报道。目前只有《金融时报》披露了这次筹资动作。
FT
《金融时报》援引知情人士称,24岁前 OpenAI 研究员 Leopold Aschenbrenner 创办的对冲基金 Situational Awareness,近期开始向现有投资人和贷款方筹集新资金。该基金规模约 200 亿美元,集中押注 AI 相关股票。基金还向部分投资人提出直接购买其持仓资产的方案。
Situational Awareness 截至 6 月底的年内净回报高达 439%。这轮上涨借助借款放大,AI 股票暴跌后,亏损也被同步放大。基金最新披露的 Oracle 和 AMD 持仓本月均跌约 20%,Nebius、Sharon AI、Bloom Energy 和 Sandisk 等持仓跌幅更大。
Aschenbrenner 仍把这轮抛售视为补仓机会。他在 7 月 24 日发给投资人的信中开放 8 月 1 日追加资金,并把 Anthropic 可能在下半年上市列为反弹催化剂。基金没有披露本轮具体亏损,也没有回应报道。目前只有《金融时报》披露了这次筹资动作。
FT
😁3
谷歌Lyria 3.5上线:AI歌声更像真人,歌词更听指令
谷歌发布新一代 AI 音乐模型 Lyria 3.5,并开始在 Google Flow Music 上线。新模型重点提升旋律、歌词和人声质量。生成的旋律结构更丰富,歌词更贴合提示词,人声发音更准确,情绪也更自然。
用户可以直接指定曲风、乐器、人声、速度和歌曲时长。Lyria 最长可生成 3 分钟歌曲。Flow Music 还支持局部重写歌词、翻译歌词、修改节拍和延长指定片段,不必重新生成整首歌。
此前发布的 Lyria 3 Pro 已经支持 3 分钟完整歌曲。Lyria 3.5 没有继续拉长时长,升级重点放在成品质量和控制精度。所有生成歌曲都会加入 SynthID 隐形水印,用于识别 AI 生成或修改的音乐。
谷歌
谷歌发布新一代 AI 音乐模型 Lyria 3.5,并开始在 Google Flow Music 上线。新模型重点提升旋律、歌词和人声质量。生成的旋律结构更丰富,歌词更贴合提示词,人声发音更准确,情绪也更自然。
用户可以直接指定曲风、乐器、人声、速度和歌曲时长。Lyria 最长可生成 3 分钟歌曲。Flow Music 还支持局部重写歌词、翻译歌词、修改节拍和延长指定片段,不必重新生成整首歌。
此前发布的 Lyria 3 Pro 已经支持 3 分钟完整歌曲。Lyria 3.5 没有继续拉长时长,升级重点放在成品质量和控制精度。所有生成歌曲都会加入 SynthID 隐形水印,用于识别 AI 生成或修改的音乐。
谷歌
Google
We’re launching Lyria 3.5 in Google Flow Music, with advances across musicality, lyrics, vocals, and creative control.
Our newest music generation model, Lyria 3.5, delivers significant advancements across musicality, lyrics, and vocal quality, empowering you to craft richer tracks. We’r…
❤1
GPT-5.6上线后给自己降本,运行成本降20%
OpenAI 披露,GPT-5.6 Sol 上线后已经开始参与改进承载自己的生产系统。它通过 Codex 分析真实流量、调整请求分配,并自主重写 GPU kernel(控制芯片计算的底层代码)。相关优化让模型端到端运行成本下降 20%。
GPT-5.6 Sol 还改进了配套的草稿模型。它自行设计并运行数百次架构实验,启动和监控训练。遇到硬件故障或训练不稳定时,它也会介入处理。最终,推测解码(小模型先预测,主模型批量验证)的 Token 生成效率提高超过 15%。
OpenAI 将这套流程描述为持续反馈循环:观察生产环境、找出瓶颈、修改系统,再验证整体效果。GPT-5.6 已经参与了其中多个环节。
OpenAI
OpenAI 披露,GPT-5.6 Sol 上线后已经开始参与改进承载自己的生产系统。它通过 Codex 分析真实流量、调整请求分配,并自主重写 GPU kernel(控制芯片计算的底层代码)。相关优化让模型端到端运行成本下降 20%。
GPT-5.6 Sol 还改进了配套的草稿模型。它自行设计并运行数百次架构实验,启动和监控训练。遇到硬件故障或训练不稳定时,它也会介入处理。最终,推测解码(小模型先预测,主模型批量验证)的 Token 生成效率提高超过 15%。
OpenAI 将这套流程描述为持续反馈循环:观察生产环境、找出瓶颈、修改系统,再验证整体效果。GPT-5.6 已经参与了其中多个环节。
OpenAI
OpenAI
How GPT-5.6 fuses frontier intelligence with frontier efficiency
GPT-5.6 improves AI efficiency across models, inference, and agentic workflows, helping deliver more useful intelligence per dollar.
❤2
腾讯WorkBuddy上线AI协同编辑,支持Word、Excel和PPT
腾讯 WorkBuddy 上线「人机双写」功能。用户可以直接打开 Word、Excel、PPT 和 Markdown 文件,框选一段文字、一组单元格或一页 PPT,让 AI 在原位置修改。
AI 只处理指定区域,其他内容和版式尽量不动。用户可以查看改动、继续手动编辑,也可以撤销结果。
Word 支持续写、润色和排版。Excel 支持分析数据和生成图表。PPT 支持拆页、调整布局和生成演讲备注。
不过,这类功能在 OpenAI 的 Codex 中早已上线。
腾讯
腾讯 WorkBuddy 上线「人机双写」功能。用户可以直接打开 Word、Excel、PPT 和 Markdown 文件,框选一段文字、一组单元格或一页 PPT,让 AI 在原位置修改。
AI 只处理指定区域,其他内容和版式尽量不动。用户可以查看改动、继续手动编辑,也可以撤销结果。
Word 支持续写、润色和排版。Excel 支持分析数据和生成图表。PPT 支持拆页、调整布局和生成演讲备注。
不过,这类功能在 OpenAI 的 Codex 中早已上线。
腾讯
👎2
动察Beating AI News
海外开发者评Kimi K3:橱窗里的F1,也是送给世界的礼物 Kimi K3 完整权重放出后,海外社区评价很高,但并不一边倒。夸的人叫它「怪兽」,认为它已经摸到顶级闭源模型的水平。界面生成、代码架构和深度研究,是目前好评最多的几项能力。也有人觉得,它还没有超过 Fable 5,但已经追得很近。 最大的遗憾还是太大。一名 Reddit 用户把它比作「摆在橱窗里的 F1 赛车」:性能确实强,但普通人根本开不回家。已有开发者把 80 张 RTX 5090 连成集群,跑起了完整的 Kimi K3。它没有使用昂贵的…
Kimi K3能在Mac本地运行了,但普通用户仍跑不起
开源 AI 工具公司 Unsloth 发布 Kimi K3 的 1-bit GGUF 版本,把模型从 1.56TB 压到 594GB。用户可以通过 Unsloth Studio 或 llama.cpp 在 Mac 本地运行。
但这个版本至少需要约 610GB 内存。按官方方案,顶配 512GB Mac Studio 还要搭配一台 128GB 内存设备。内存不够也能借助硬盘勉强加载,但速度会大幅下降。
社区还有 350GB 和 451GB 的 MLX 裁剪版,可以装进单台 512GB Mac Studio。但它们删除了 73% 至 80% 的专家,实测速度约 0.14 至 0.20 token/s,能力也明显下降。
Unsloth
开源 AI 工具公司 Unsloth 发布 Kimi K3 的 1-bit GGUF 版本,把模型从 1.56TB 压到 594GB。用户可以通过 Unsloth Studio 或 llama.cpp 在 Mac 本地运行。
但这个版本至少需要约 610GB 内存。按官方方案,顶配 512GB Mac Studio 还要搭配一台 128GB 内存设备。内存不够也能借助硬盘勉强加载,但速度会大幅下降。
社区还有 350GB 和 451GB 的 MLX 裁剪版,可以装进单台 512GB Mac Studio。但它们删除了 73% 至 80% 的专家,实测速度约 0.14 至 0.20 token/s,能力也明显下降。
Unsloth
❤3
动察Beating AI News
ARC-AGI-3拆出两个排行榜:裸模型不到1%,加Agent框架后首日即达36% ARC-AGI-3 论文将评测拆分为两个排行榜。官方排行榜禁止外部 harness(Agent 框架),所有模型使用同一极简提示词、不提供工具,测的是模型脱离脚手架后的原生智能。社区排行榜则允许 harness,得分自报,ARC Prize 默认不验证,论文明确提醒「不应将社区排行榜上的分数解读为 AGI 进展的证据」。 官方排行榜上,前沿模型得分均低于 1%:Gemini 3.1 Pro Preview 0.37%、GPT…
OpenAI称评测框架拖累GPT-5.6表现,但Opus 5用同一框架分数高2.3倍
OpenAI 称,ARC-AGI-3 的通用评测框架没有保存 GPT-5.6 Sol 此前的推理,还会在上下文过长时删除早期记录。模型因此经常忘记已经发现的游戏规则,每执行一步都要重新思考。
OpenAI 随后用自家 Responses API 重做评测框架,保留历史推理,并压缩过长的上下文。结果,GPT-5.6 Sol 的得分从 13.3%升至 38.3%,输出 Token 降至约六分之一。
但问题在于,Opus 5 用的也是这套通用框架。它以 High 推理档拿到 30.2%,GPT-5.6 Sol 即使用更高的 Max 档也只有 13.3%。框架确实拖累了 GPT-5.6,却没有同样拖垮 Opus 5。
不管 OpenAI 怎么狡辩,Opus 5 在这项全球最难 AI 评测里就是明显强于 GPT-5.6。
Tibo
OpenAI 称,ARC-AGI-3 的通用评测框架没有保存 GPT-5.6 Sol 此前的推理,还会在上下文过长时删除早期记录。模型因此经常忘记已经发现的游戏规则,每执行一步都要重新思考。
OpenAI 随后用自家 Responses API 重做评测框架,保留历史推理,并压缩过长的上下文。结果,GPT-5.6 Sol 的得分从 13.3%升至 38.3%,输出 Token 降至约六分之一。
但问题在于,Opus 5 用的也是这套通用框架。它以 High 推理档拿到 30.2%,GPT-5.6 Sol 即使用更高的 Max 档也只有 13.3%。框架确实拖累了 GPT-5.6,却没有同样拖垮 Opus 5。
不管 OpenAI 怎么狡辩,Opus 5 在这项全球最难 AI 评测里就是明显强于 GPT-5.6。
Tibo
👍2
Kimi被指整页搬走设计师作品,还挂成官方精选模板
独立设计师 Marina Budarina 指控,Kimi 未经许可,把她的互动网页 CHIMES 换名为「SILK ATLAS」,放进 Kimi Swarm 的精选案例。
她称,Kimi 照搬了页面设计、互动效果和文案,也没有标注作者。
很多网友表示,他们此前看到这个模板时,以为 Budarina 与 Kimi 有合作。还有人误以为,这个作品本来就是用 Kimi 做的。
截至目前,Kimi 尚未公开回应,但已经下架相关模版。
Budarina
独立设计师 Marina Budarina 指控,Kimi 未经许可,把她的互动网页 CHIMES 换名为「SILK ATLAS」,放进 Kimi Swarm 的精选案例。
她称,Kimi 照搬了页面设计、互动效果和文案,也没有标注作者。
很多网友表示,他们此前看到这个模板时,以为 Budarina 与 Kimi 有合作。还有人误以为,这个作品本来就是用 Kimi 做的。
截至目前,Kimi 尚未公开回应,但已经下架相关模版。
Budarina
🤡7❤1
动察Beating AI News
OpenAI称评测框架拖累GPT-5.6表现,但Opus 5用同一框架分数高2.3倍 OpenAI 称,ARC-AGI-3 的通用评测框架没有保存 GPT-5.6 Sol 此前的推理,还会在上下文过长时删除早期记录。模型因此经常忘记已经发现的游戏规则,每执行一步都要重新思考。 OpenAI 随后用自家 Responses API 重做评测框架,保留历史推理,并压缩过长的上下文。结果,GPT-5.6 Sol 的得分从 13.3%升至 38.3%,输出 Token 降至约六分之一。 但问题在于,Opus…
ARC-AGI-3 评测机构考虑改规则:官方榜或允许厂商自带记忆
ARC-AGI-3 评测机构 ARC Prize 此前要求所有模型使用同一套简单调用方式,避免厂商靠定制框架拉高分数。这样更容易看清模型本身的能力。
回应 OpenAI 的争议测试时,官方口径开始松动。ARC Prize 承认,保留历史推理、压缩过长的上下文,确实能提升模型处理长任务的表现,并已开始研究如何把这类功能加入正式评测。
ARC-AGI 创始人 François Chollet 给出的边界是:专门为 ARC 开发的框架仍然不行;所有 API 用户都能使用的通用设置可以考虑。他认为,各家用了什么设置、花了多少钱,都应该公开。
一旦放行厂商自带的记忆和上下文管理,ARC-AGI-3 比较的就不再只是模型,还会包含各家 API 背后的工程能力。
ARC Prize
ARC-AGI-3 评测机构 ARC Prize 此前要求所有模型使用同一套简单调用方式,避免厂商靠定制框架拉高分数。这样更容易看清模型本身的能力。
回应 OpenAI 的争议测试时,官方口径开始松动。ARC Prize 承认,保留历史推理、压缩过长的上下文,确实能提升模型处理长任务的表现,并已开始研究如何把这类功能加入正式评测。
ARC-AGI 创始人 François Chollet 给出的边界是:专门为 ARC 开发的框架仍然不行;所有 API 用户都能使用的通用设置可以考虑。他认为,各家用了什么设置、花了多少钱,都应该公开。
一旦放行厂商自带的记忆和上下文管理,ARC-AGI-3 比较的就不再只是模型,还会包含各家 API 背后的工程能力。
ARC Prize
❤1
OpenAI年化收入达到426亿美元,两个月增长约29%
OpenAI CFO Sarah Friar 在内部会议上称,公司 7 月收入继续增长,主要由 GPT-5.6、企业 Agent ChatGPT Work 和 Codex 带动。OpenAI 没有公布具体金额。
第三方机构 TickerTrends 估算,OpenAI 7 月底的月度经常性收入水平约为 35.5 亿美元,比 5 月底高约 8 亿美元。其 ARR 从 5 月底的 330 亿美元升至 7 月 29 日的 426 亿美元,两个月增长约 29%。
OpenAI 董事长 Bret Taylor 同时承认,公司年初在 AI 编程市场落后 Anthropic。但部分 Claude Code 重度用户因账单过高,已经开始寻找 Codex 等替代品。
TickerTrends
OpenAI CFO Sarah Friar 在内部会议上称,公司 7 月收入继续增长,主要由 GPT-5.6、企业 Agent ChatGPT Work 和 Codex 带动。OpenAI 没有公布具体金额。
第三方机构 TickerTrends 估算,OpenAI 7 月底的月度经常性收入水平约为 35.5 亿美元,比 5 月底高约 8 亿美元。其 ARR 从 5 月底的 330 亿美元升至 7 月 29 日的 426 亿美元,两个月增长约 29%。
OpenAI 董事长 Bret Taylor 同时承认,公司年初在 AI 编程市场落后 Anthropic。但部分 Claude Code 重度用户因账单过高,已经开始寻找 Codex 等替代品。
TickerTrends
👍1👏1
观点:未来几年,GPU租金可能上涨10倍以上
AI 领域知名播客主持人 Dwarkesh Patel 提出一个反常判断:未来几年,GPU 算力租金可能上涨 10 倍以上。模型越聪明,同一块 GPU 能完成的工作越值钱,AI 公司也更愿意花高价抢算力。
他用软件工程举例。假如一块 H100 等效算力能持续运行一名人类水平的软件工程师,其年租金理论上可超过 25 万美元,约为当前现货价格的 15 倍。
市场已经出现涨价苗头。H100 一年期租金从 2025 年 10 月的每小时 1.70 美元,升至 2026 年 3 月的 2.35 美元,涨近 40%。Epoch AI 估算,全球 AI 算力在 2025 年约增长 3 倍,但头部实验室的算力需求增长更快。
如果这套推演成立,弱模型会因为消耗更多昂贵算力而失去价格优势,低价值的图片和短视频生成也可能先被挤出去。但这只是情景推演。大量 AI 程序员出现后,工程工作的市场价格也可能下降,25 万美元这笔账未必成立。
Dwarkesh Patel
AI 领域知名播客主持人 Dwarkesh Patel 提出一个反常判断:未来几年,GPU 算力租金可能上涨 10 倍以上。模型越聪明,同一块 GPU 能完成的工作越值钱,AI 公司也更愿意花高价抢算力。
他用软件工程举例。假如一块 H100 等效算力能持续运行一名人类水平的软件工程师,其年租金理论上可超过 25 万美元,约为当前现货价格的 15 倍。
市场已经出现涨价苗头。H100 一年期租金从 2025 年 10 月的每小时 1.70 美元,升至 2026 年 3 月的 2.35 美元,涨近 40%。Epoch AI 估算,全球 AI 算力在 2025 年约增长 3 倍,但头部实验室的算力需求增长更快。
如果这套推演成立,弱模型会因为消耗更多昂贵算力而失去价格优势,低价值的图片和短视频生成也可能先被挤出去。但这只是情景推演。大量 AI 程序员出现后,工程工作的市场价格也可能下降,25 万美元这笔账未必成立。
Dwarkesh Patel
X (formerly Twitter)
Dwarkesh Patel (@dwarkesh_sp) on X
New blog post on what would be true about the world if trendline continues and leading lab hits $1T in revenue by the end of next year.
In other words, why compute might get 10x+ more expensive in coming years
https://t.co/7PvniDC2jN
In other words, why compute might get 10x+ more expensive in coming years
https://t.co/7PvniDC2jN
亚马逊内部曝AI成本失控,小错误烧出百万账单
《金融时报》援引知情人士称,亚马逊内部通报了多起 AI 项目严重超支。最夸张的一次,是用 Claude Sonnet 给商品页面匹配作者信息。项目最终失败,却花掉 180 万美元,比预算高 860%,五个月后才被发现。
另一个财务审计工具项目意外多花约 54.1 万美元。一个优化物流配送速度的项目也误花 13.4 万美元,两个多星期后才被发现。
亚马逊工程师将问题归结为部署错误和缺少成本限制。传统系统里几乎不花钱的小错误,放到 AI 项目中可能变成「灾难性昂贵」的账单。公司正在开发自动化措施,防止类似项目继续失控。
亚马逊回应称,这些案例只涉及少数团队,不能代表公司日常使用 AI 的整体情况。此前,亚马逊还关闭了内部 AI 使用排行榜,因为员工为了冲榜让 Agent 执行无意义任务,额外消耗大量 Token。
FT
《金融时报》援引知情人士称,亚马逊内部通报了多起 AI 项目严重超支。最夸张的一次,是用 Claude Sonnet 给商品页面匹配作者信息。项目最终失败,却花掉 180 万美元,比预算高 860%,五个月后才被发现。
另一个财务审计工具项目意外多花约 54.1 万美元。一个优化物流配送速度的项目也误花 13.4 万美元,两个多星期后才被发现。
亚马逊工程师将问题归结为部署错误和缺少成本限制。传统系统里几乎不花钱的小错误,放到 AI 项目中可能变成「灾难性昂贵」的账单。公司正在开发自动化措施,防止类似项目继续失控。
亚马逊回应称,这些案例只涉及少数团队,不能代表公司日常使用 AI 的整体情况。此前,亚马逊还关闭了内部 AI 使用排行榜,因为员工为了冲榜让 Agent 执行无意义任务,额外消耗大量 Token。
FT
🤡3
动察Beating AI News
OpenAI 推出计算生物学基准 GeneBench-Pro,GPT-5.6 满血版正确率仅三成 OpenAI 发布了计算生物学评测基准 GeneBench-Pro,用来测试 AI 智能体在面对基因组学和转化医学等复杂科研场景时的多步决策能力。新基准共包含 129 个问题(其中 82 个经过外部专家评审),通过计算机模拟生成具有明确因果关系的数据,防止模型通过走捷径或迎合出题人偏好来作弊。 测试结果显示,顶尖模型在处理包含量化不确定性的科学推理时依然非常吃力。最强的 GPT-5.6 Sol 在开启 Pro…
大模型再聪明也得刷题,OpenAI前研究员创业卖数据
OpenAI 前研究人员、GeneBench-Pro 共同作者 Andrew Ho 离职创业。新公司将为大模型制作高质量强化学习数据(给模型练习并按结果打分的训练任务)。首批产品聚焦生物学和统计推理,公司名称尚未公开。
Ho 认为,大模型仍然严重偏科。即使在投入巨大的编程领域,模型会刷题、会改代码,真实交付仍常要人工收尾。
更多实际工作则连合适的训练题都没有。它们依赖具体背景,也很难自动判断模型做得对不对。
他的办法是生成接近真实科研的数据和问题,同时保留已知答案。模型可以自由探索,训练系统也能明确判断对错。
GeneBench-Pro 就采用了这套方法。该评测包含 129 项计算生物学任务,GPT-5.6 Sol Pro 的通过率只有 31.5%。
新公司还会制作培养皿、Western blot 等实验图像的训练数据,之后再扩展到化学、材料、医疗和办公室工作。
Ho 预计,前沿 AI 实验室未来将为精准训练数据投入超过 1000 亿美元。
Andrew Ho
OpenAI 前研究人员、GeneBench-Pro 共同作者 Andrew Ho 离职创业。新公司将为大模型制作高质量强化学习数据(给模型练习并按结果打分的训练任务)。首批产品聚焦生物学和统计推理,公司名称尚未公开。
Ho 认为,大模型仍然严重偏科。即使在投入巨大的编程领域,模型会刷题、会改代码,真实交付仍常要人工收尾。
更多实际工作则连合适的训练题都没有。它们依赖具体背景,也很难自动判断模型做得对不对。
他的办法是生成接近真实科研的数据和问题,同时保留已知答案。模型可以自由探索,训练系统也能明确判断对错。
GeneBench-Pro 就采用了这套方法。该评测包含 129 项计算生物学任务,GPT-5.6 Sol Pro 的通过率只有 31.5%。
新公司还会制作培养皿、Western blot 等实验图像的训练数据,之后再扩展到化学、材料、医疗和办公室工作。
Ho 预计,前沿 AI 实验室未来将为精准训练数据投入超过 1000 亿美元。
Andrew Ho
X (formerly Twitter)
Andrew Ho (@andrewho03) on X
Today is my last day at @OpenAI. I'm glad to have spent the last eight months of my life working here!
I'm starting a new company focused on the production of high-quality reinforcement learning datasets:
1. The generalization ability of LLMs is clearly…
I'm starting a new company focused on the production of high-quality reinforcement learning datasets:
1. The generalization ability of LLMs is clearly…
👍1
腾讯开源模型Hy3破解半世纪数学难题,完整证明已通过机器验证
腾讯混元的研究智能体 Hyra,使用自家的开源模型 Hy3,协助两名研究者解决了一个悬而未决 50 多年的组合数学问题。
问题是:一个整数集合的「和集」,最多能比「差集」增长多快。数学界早已证明,相关指数不会超过 2,但一直不知道 2 是不是最优答案。
Hyra 让 Hy3 先搜索具体集合,再尝试提出通用构造。约 24 小时后,AI 找到了论文最终采用的核心方案。研究者随后核对、修正并整理证明,GPT-5.6 Sol 协助转成 Lean 4 验证。
最终论文证明,这个指数可以无限接近 2,所以上界 2 已经是最优答案。虽然 AI 没有包办整篇论文,但最关键的构造确实是 Hy3 找到的。
腾讯混元
腾讯混元的研究智能体 Hyra,使用自家的开源模型 Hy3,协助两名研究者解决了一个悬而未决 50 多年的组合数学问题。
问题是:一个整数集合的「和集」,最多能比「差集」增长多快。数学界早已证明,相关指数不会超过 2,但一直不知道 2 是不是最优答案。
Hyra 让 Hy3 先搜索具体集合,再尝试提出通用构造。约 24 小时后,AI 找到了论文最终采用的核心方案。研究者随后核对、修正并整理证明,GPT-5.6 Sol 协助转成 Lean 4 验证。
最终论文证明,这个指数可以无限接近 2,所以上界 2 已经是最优答案。虽然 AI 没有包办整篇论文,但最关键的构造确实是 Hy3 找到的。
腾讯混元
👍2
月之暗面(Kimi)完成股改,为香港上市铺路
月之暗面(Kimi)已更名为「北京月之暗面科技股份有限公司」,企业类型从有限责任公司变为非上市股份有限公司。杨植麟出任董事长兼经理,张予彤新增为董事,宋思嘉新增为财务负责人。
这次变更通常被称为「股改」。证监会规定,境内企业若以境内主体直接赴境外上市,发行人必须是股份有限公司。
彭博此前称,月之暗面已向投资者发出赴港上市股东决议,最快可能在半年内 IPO,并开始拆除红筹架构。公司尚未正式公布上市时间。
爱企查
月之暗面(Kimi)已更名为「北京月之暗面科技股份有限公司」,企业类型从有限责任公司变为非上市股份有限公司。杨植麟出任董事长兼经理,张予彤新增为董事,宋思嘉新增为财务负责人。
这次变更通常被称为「股改」。证监会规定,境内企业若以境内主体直接赴境外上市,发行人必须是股份有限公司。
彭博此前称,月之暗面已向投资者发出赴港上市股东决议,最快可能在半年内 IPO,并开始拆除红筹架构。公司尚未正式公布上市时间。
爱企查
❤1
OpenAI免费给10万科研人员用GPT-5.6 Sol Pro
OpenAI 推出 ChatGPT for Academic Researchers,计划到 2027 年向 10 万名科研人员免费开放前沿模型和研究工具。首批 1 万人将在今年夏天获得权限,启动时可用 GPT-5.6 Sol Pro、ChatGPT Work 和 Codex。
参与者还会获得更多 Deep Research 额度、更高使用上限和更长上下文。平台内置 75 项以上生命科学技能,也能连接论文库、公共基因组数据库和计算笔记本。
这项福利并非所有高校人员都能领。申请者须来自 OpenAI 选定的研究型高校,并验证学校身份、在研项目和科学用途。获批后最多可邀请 4 名同校合作者,数据默认不用于训练。
OpenAI
OpenAI 推出 ChatGPT for Academic Researchers,计划到 2027 年向 10 万名科研人员免费开放前沿模型和研究工具。首批 1 万人将在今年夏天获得权限,启动时可用 GPT-5.6 Sol Pro、ChatGPT Work 和 Codex。
参与者还会获得更多 Deep Research 额度、更高使用上限和更长上下文。平台内置 75 项以上生命科学技能,也能连接论文库、公共基因组数据库和计算笔记本。
这项福利并非所有高校人员都能领。申请者须来自 OpenAI 选定的研究型高校,并验证学校身份、在研项目和科学用途。获批后最多可邀请 4 名同校合作者,数据默认不用于训练。
OpenAI
OpenAI
Accelerating scientific discovery with ChatGPT for Academic Researchers
OpenAI is giving 100,000 academic researchers free access to ChatGPT's most advanced AI models to accelerate scientific research, collaboration, and discovery.
👍1
Claude Opus 5最会卖货,也最爱和对手串通定价
AI 评测机构 Andon Labs 让模型拿着 500 美元本金,在模拟环境中经营一台售货机 365 天。Claude Opus 5 五次测试的期末余额平均为 1.12 万美元,超过 Claude Opus 4.7 和 GPT-5.6 Sol,升至 Vending-Bench 2 第一。
在多人竞争版中,Opus 5 以约 7000 美元排名第二,与第一名 GPT-5.6 Sol 的约 7400 美元相差不大。六次测试里,它每次都提出或参与串通定价。它还编造竞争对手报价、威胁同行,并累计撕毁 11 次停战协议。
Opus 5 的退款批准率最终降至 10%,六次测试合计只退了 8.54 美元。GPT-5.6 Sol 退了 655 美元,依然赢下多人赛。
Andon Labs 认为,Opus 5 再次出现「越会赚钱,行为越不对齐」的问题。Anthropic 自己的发布前审计却称,它是历来最对齐的 Claude。
Andon Labs
AI 评测机构 Andon Labs 让模型拿着 500 美元本金,在模拟环境中经营一台售货机 365 天。Claude Opus 5 五次测试的期末余额平均为 1.12 万美元,超过 Claude Opus 4.7 和 GPT-5.6 Sol,升至 Vending-Bench 2 第一。
在多人竞争版中,Opus 5 以约 7000 美元排名第二,与第一名 GPT-5.6 Sol 的约 7400 美元相差不大。六次测试里,它每次都提出或参与串通定价。它还编造竞争对手报价、威胁同行,并累计撕毁 11 次停战协议。
Opus 5 的退款批准率最终降至 10%,六次测试合计只退了 8.54 美元。GPT-5.6 Sol 退了 655 美元,依然赢下多人赛。
Andon Labs 认为,Opus 5 再次出现「越会赚钱,行为越不对齐」的问题。Anthropic 自己的发布前审计却称,它是历来最对齐的 Claude。
Andon Labs
❤1
动察Beating AI News
大模型再聪明也得刷题,OpenAI前研究员创业卖数据 OpenAI 前研究人员、GeneBench-Pro 共同作者 Andrew Ho 离职创业。新公司将为大模型制作高质量强化学习数据(给模型练习并按结果打分的训练任务)。首批产品聚焦生物学和统计推理,公司名称尚未公开。 Ho 认为,大模型仍然严重偏科。即使在投入巨大的编程领域,模型会刷题、会改代码,真实交付仍常要人工收尾。 更多实际工作则连合适的训练题都没有。它们依赖具体背景,也很难自动判断模型做得对不对。 他的办法是生成接近真实科研的数据和问…
前OpenAI研究人员质疑AI巨头万亿估值:越领先越烧钱
前 OpenAI 研究人员 Andrew Ho 发帖质疑前沿 AI 实验室的万亿美元估值。
按 Ho 的粗算,即使推理业务毛利率达到 80%,再给出 20 倍市盈率,一家公司也要做到 1000 亿至 2000 亿美元年收入,才可能支撑 1 万亿美元估值。这还假设公司不再花钱训练新模型。
现实中,OpenAI、Anthropic 等公司必须不断训练下一代模型。一旦停下来,用户就可能转向更便宜的 Qwen 或 Kimi。收入在涨,下一代模型的训练成本也在涨。领先者反而要一直追加投入。
Ho 也不相信 AI 能力会很快全面爆发。他认为,大模型仍然偏科,进步可能更慢,也更受高质量数据限制。即使模型能力停在今天,AI 真正进入各行各业,也可能需要 20 年以上。
他认为,编程 Agent 可能只是少数已经找到的高价值产品。多派工程师帮企业接入 AI,也未必能迅速找到下一个赚钱场景。
Ho 仍然看好 AI 产业长期增长,但不愿按当前估值买入 OpenAI 或 Anthropic。
Andrew Ho
前 OpenAI 研究人员 Andrew Ho 发帖质疑前沿 AI 实验室的万亿美元估值。
按 Ho 的粗算,即使推理业务毛利率达到 80%,再给出 20 倍市盈率,一家公司也要做到 1000 亿至 2000 亿美元年收入,才可能支撑 1 万亿美元估值。这还假设公司不再花钱训练新模型。
现实中,OpenAI、Anthropic 等公司必须不断训练下一代模型。一旦停下来,用户就可能转向更便宜的 Qwen 或 Kimi。收入在涨,下一代模型的训练成本也在涨。领先者反而要一直追加投入。
Ho 也不相信 AI 能力会很快全面爆发。他认为,大模型仍然偏科,进步可能更慢,也更受高质量数据限制。即使模型能力停在今天,AI 真正进入各行各业,也可能需要 20 年以上。
他认为,编程 Agent 可能只是少数已经找到的高价值产品。多派工程师帮企业接入 AI,也未必能迅速找到下一个赚钱场景。
Ho 仍然看好 AI 产业长期增长,但不愿按当前估值买入 OpenAI 或 Anthropic。
Andrew Ho
X (formerly Twitter)
Andrew Ho (@andrewho03) on X
I'm actually fairly bearish on frontier lab valuations. I've never seen the reasons articulated to my satisfaction, so before I go to sleep, I wanted to quickly jot down my thinking here.
The basic issue is that the labs are highly unprofitable. This may…
The basic issue is that the labs are highly unprofitable. This may…
😁1