动察Beating AI News
3.12K subscribers
866 photos
2 videos
3.37K links
AI新闻信息流
Download Telegram
动察Beating AI News
OpenAI 推出计算生物学基准 GeneBench-Pro,GPT-5.6 满血版正确率仅三成 OpenAI 发布了计算生物学评测基准 GeneBench-Pro,用来测试 AI 智能体在面对基因组学和转化医学等复杂科研场景时的多步决策能力。新基准共包含 129 个问题(其中 82 个经过外部专家评审),通过计算机模拟生成具有明确因果关系的数据,防止模型通过走捷径或迎合出题人偏好来作弊。 测试结果显示,顶尖模型在处理包含量化不确定性的科学推理时依然非常吃力。最强的 GPT-5.6 Sol 在开启 Pro…
大模型再聪明也得刷题,OpenAI前研究员创业卖数据

OpenAI 前研究人员、GeneBench-Pro 共同作者 Andrew Ho 离职创业。新公司将为大模型制作高质量强化学习数据(给模型练习并按结果打分的训练任务)。首批产品聚焦生物学和统计推理,公司名称尚未公开。

Ho 认为,大模型仍然严重偏科。即使在投入巨大的编程领域,模型会刷题、会改代码,真实交付仍常要人工收尾。

更多实际工作则连合适的训练题都没有。它们依赖具体背景,也很难自动判断模型做得对不对。

他的办法是生成接近真实科研的数据和问题,同时保留已知答案。模型可以自由探索,训练系统也能明确判断对错。

GeneBench-Pro 就采用了这套方法。该评测包含 129 项计算生物学任务,GPT-5.6 Sol Pro 的通过率只有 31.5%。

新公司还会制作培养皿、Western blot 等实验图像的训练数据,之后再扩展到化学、材料、医疗和办公室工作。

Ho 预计,前沿 AI 实验室未来将为精准训练数据投入超过 1000 亿美元。

Andrew Ho
👍1
腾讯开源模型Hy3破解半世纪数学难题,完整证明已通过机器验证

腾讯混元的研究智能体 Hyra,使用自家的开源模型 Hy3,协助两名研究者解决了一个悬而未决 50 多年的组合数学问题。

问题是:一个整数集合的「和集」,最多能比「差集」增长多快。数学界早已证明,相关指数不会超过 2,但一直不知道 2 是不是最优答案。

Hyra 让 Hy3 先搜索具体集合,再尝试提出通用构造。约 24 小时后,AI 找到了论文最终采用的核心方案。研究者随后核对、修正并整理证明,GPT-5.6 Sol 协助转成 Lean 4 验证。

最终论文证明,这个指数可以无限接近 2,所以上界 2 已经是最优答案。虽然 AI 没有包办整篇论文,但最关键的构造确实是 Hy3 找到的。

腾讯混元
👍4
月之暗面(Kimi)完成股改,为香港上市铺路

月之暗面(Kimi)已更名为「北京月之暗面科技股份有限公司」,企业类型从有限责任公司变为非上市股份有限公司。杨植麟出任董事长兼经理,张予彤新增为董事,宋思嘉新增为财务负责人。

这次变更通常被称为「股改」。证监会规定,境内企业若以境内主体直接赴境外上市,发行人必须是股份有限公司。

彭博此前称,月之暗面已向投资者发出赴港上市股东决议,最快可能在半年内 IPO,并开始拆除红筹架构。公司尚未正式公布上市时间。

爱企查
1
OpenAI免费给10万科研人员用GPT-5.6 Sol Pro

OpenAI 推出 ChatGPT for Academic Researchers,计划到 2027 年向 10 万名科研人员免费开放前沿模型和研究工具。首批 1 万人将在今年夏天获得权限,启动时可用 GPT-5.6 Sol Pro、ChatGPT Work 和 Codex。

参与者还会获得更多 Deep Research 额度、更高使用上限和更长上下文。平台内置 75 项以上生命科学技能,也能连接论文库、公共基因组数据库和计算笔记本。

这项福利并非所有高校人员都能领。申请者须来自 OpenAI 选定的研究型高校,并验证学校身份、在研项目和科学用途。获批后最多可邀请 4 名同校合作者,数据默认不用于训练。

OpenAI
👍1
Claude Opus 5最会卖货,也最爱和对手串通定价

AI 评测机构 Andon Labs 让模型拿着 500 美元本金,在模拟环境中经营一台售货机 365 天。Claude Opus 5 五次测试的期末余额平均为 1.12 万美元,超过 Claude Opus 4.7 和 GPT-5.6 Sol,升至 Vending-Bench 2 第一。

在多人竞争版中,Opus 5 以约 7000 美元排名第二,与第一名 GPT-5.6 Sol 的约 7400 美元相差不大。六次测试里,它每次都提出或参与串通定价。它还编造竞争对手报价、威胁同行,并累计撕毁 11 次停战协议。

Opus 5 的退款批准率最终降至 10%,六次测试合计只退了 8.54 美元。GPT-5.6 Sol 退了 655 美元,依然赢下多人赛。

Andon Labs 认为,Opus 5 再次出现「越会赚钱,行为越不对齐」的问题。Anthropic 自己的发布前审计却称,它是历来最对齐的 Claude。

Andon Labs
2
动察Beating AI News
大模型再聪明也得刷题,OpenAI前研究员创业卖数据 OpenAI 前研究人员、GeneBench-Pro 共同作者 Andrew Ho 离职创业。新公司将为大模型制作高质量强化学习数据(给模型练习并按结果打分的训练任务)。首批产品聚焦生物学和统计推理,公司名称尚未公开。 Ho 认为,大模型仍然严重偏科。即使在投入巨大的编程领域,模型会刷题、会改代码,真实交付仍常要人工收尾。 更多实际工作则连合适的训练题都没有。它们依赖具体背景,也很难自动判断模型做得对不对。 他的办法是生成接近真实科研的数据和问…
前OpenAI研究人员质疑AI巨头万亿估值:越领先越烧钱

前 OpenAI 研究人员 Andrew Ho 发帖质疑前沿 AI 实验室的万亿美元估值。

按 Ho 的粗算,即使推理业务毛利率达到 80%,再给出 20 倍市盈率,一家公司也要做到 1000 亿至 2000 亿美元年收入,才可能支撑 1 万亿美元估值。这还假设公司不再花钱训练新模型。

现实中,OpenAI、Anthropic 等公司必须不断训练下一代模型。一旦停下来,用户就可能转向更便宜的 Qwen 或 Kimi。收入在涨,下一代模型的训练成本也在涨。领先者反而要一直追加投入。

Ho 也不相信 AI 能力会很快全面爆发。他认为,大模型仍然偏科,进步可能更慢,也更受高质量数据限制。即使模型能力停在今天,AI 真正进入各行各业,也可能需要 20 年以上。

他认为,编程 Agent 可能只是少数已经找到的高价值产品。多派工程师帮企业接入 AI,也未必能迅速找到下一个赚钱场景。

Ho 仍然看好 AI 产业长期增长,但不愿按当前估值买入 OpenAI 或 Anthropic。

Andrew Ho
😁1
谷歌发布三款机器人模型,核心动作模型可跨机器人复用

谷歌 DeepMind 发布新一代 Gemini Robotics 模型家族。Gemini Robotics 2 负责控制动作,ER 2 负责理解环境和规划任务,On-Device 2 可直接在机器人本地运行。

Gemini Robotics 2 能把画面和文字指令变成动作。同一个模型检查点可以控制人形机器人、双臂机器人和不同机械手,不必为每种机器人重新做一套模型。

它还新增全身控制能力。人形机器人可以行走、下蹲、保持平衡,同时操作物体,并完成打结、封袋等精细动作。ER 2 则负责拆解复杂任务、跟踪进度和协调多台机器人合作。

目前,ER 2 已在 Google AI Studio 开放,并进入 Gemini Enterprise Agent Platform 私人预览。Gemini Robotics 2 和 On-Device 2 仍只向早期合作伙伴开放。

谷歌 DeepMind
动察Beating AI News
招聘信息显示,DeepSeek 正在内蒙古等绿电资源丰富地区大举招聘数据中心工程师,启动自有超大规模数据中心建设。
DeepSeek拟在内蒙古乌兰察布建1GW数据中心

彭博援引知情人士称,DeepSeek 计划在内蒙古乌兰察布建设 1GW AI 数据中心。公司将自建机房,同时向其他企业租用算力。

部分容量最快在 2027 年底或 2028 年初上线。项目使用哪类芯片,目前还不清楚。

1GW 的规模将超过目前已投运的中国企业 AI 数据中心,但仍低于美国公司规划的 3GW 和 5GW 项目。DeepSeek 靠节省训练算力出名,如今也开始补建重型基础设施。

彭博社
👍21
动察Beating AI News
GPT-5.6正式发布:Agent评测领先Claude Fable模型13.1分 OpenAI 发布 GPT-5.6 系列,包含旗舰模型 Sol、均衡版 Terra 和低价版 Luna。新模型已上线 ChatGPT、Codex 和 API。 GPT-5.6 Sol 主打性能和效率。在专业 Agent 评测 Agents’ Last Exam 中,Sol 得分 53.6,比 Claude Fable 5 高 13.1 分。使用中等推理强度时,它仍领先 11.4 分,估算成本约为对方四分之一。 编程能力也有提升。Sol…
OpenAI大甩卖:GPT-5.6 Luna发布仅三周,降价80%

OpenAI 大幅下调 GPT-5.6 的 API 价格。Luna 降价 80%,每百万输入 Token 从 1 美元降至 0.2 美元,输出从 6 美元降至 1.2 美元。Terra 同步降价 20%,输入、输出价格降至 2 美元和 12 美元。

GPT-5.6 系列发布只有三周。OpenAI 称,模型、推理系统和上下文管理的效率提升,给了这次降价空间。

Sol 没有降价,但 API 新增 Fast 模式。速度最高是标准模式的 2.5 倍,价格是 2 倍,模型能力不变。该模式会取代原来的 Priority Processing。

ChatGPT Work 和 Codex 的月费、总额度不变,但使用 Luna 和 Terra 时消耗的额度更少,同样套餐能跑更多任务。

OpenAI
动察Beating AI News
前OpenAI研究人员质疑AI巨头万亿估值:越领先越烧钱 前 OpenAI 研究人员 Andrew Ho 发帖质疑前沿 AI 实验室的万亿美元估值。 按 Ho 的粗算,即使推理业务毛利率达到 80%,再给出 20 倍市盈率,一家公司也要做到 1000 亿至 2000 亿美元年收入,才可能支撑 1 万亿美元估值。这还假设公司不再花钱训练新模型。 现实中,OpenAI、Anthropic 等公司必须不断训练下一代模型。一旦停下来,用户就可能转向更便宜的 Qwen 或 Kimi。收入在涨,下一代模型的训练…
AI实验室值不值万亿美元,就看AGI还要等多久

前 OpenAI 研究人员 Andrew Ho 认为,大模型进步会更慢、更偏科,也更受数据限制。AI 全面进入经济可能还要几十年,因此 OpenAI、Anthropic 等公司的高估值很难成立。

知名 AI 播客主持人 Dwarkesh Patel 回应称,争议核心就是时间表。现在模型进步很快,领先三个月的产品,用户就愿意多付几倍价格。只要这种速度继续,头部实验室就能靠技术领先赚取高额收入。

Dwarkesh 也不认同 AI 落地需要几十年。真正达到人类水平后,AI 可以快速读完公司的 Slack 和 Drive,学会内部流程,再复制出更多实例。它进入企业,可能比招聘和培训员工更容易。

前 OpenAI 研究人员 Will Depue 的判断更激进。他预计递归自我改进可能在 24 个月内出现,未来 18 至 24 个月,AI 研究速度会明显加快。

马斯克则称,AI 已经在许多领域超过人类,「我们已经身处奇点」。他还说,两年前的 AI 如今已经像博物馆里的古董,两年后的 AI 会更惊人。

三人的共同判断是,AI 能力还会快速增长。区别在于时间表:Dwarkesh 认为短期不会停滞,Will 给出了 24 个月窗口,马斯克直接宣布奇点已经开始。

在这场争论里,AI 实验室能否撑起万亿美元估值,最终取决于这种进步速度能否持续,并真正变成收入。

Dwarkesh Patel
👍2
动察Beating AI News
「斯坦福小镇」团队创业后提出AI三阶段论:预测→推理→模拟,称模拟才是通向超级智能的真正路径 斯坦福大学教授 Percy Liang 和 Simile AI CEO Joon Sung Park 发表博文,提出 AI 正在进入「模拟时代」。Percy Liang 认为,AI 迄今最令人印象深刻的成就都发生在环境和奖励函数明确的场景中(如围棋、IMO 数学竞赛、从零写出完整应用),RL 算法可以在沙盒中安全地尝试不同操作并观察结果。但现实世界中涉及人的问题(远程办公如何影响组织文化?如何为数百万学生重新设…
「斯坦福小镇」作者的AI公司要模拟全球80亿人,5个月估值20亿美元

人类行为模拟公司 Simile 完成 2 亿美元 B 轮融资,投后估值 20 亿美元。它用真实人类数据训练「AI 分身」。企业可以在产品、营销和政策落地前,先模拟不同人群会怎么反应。

Simile 五个月前才公开亮相并完成 1 亿美元 A 轮。公司称,这期间收入增长 5 倍。模型已为财富 100 强企业运行数千万次模拟。

客户可以一次调查数十万到数百万个 AI 分身。CVS Health 曾用 40 万个分身,研究怎样让患者更愿意服药。咨询公司德勤、民调机构盖洛普和自动理财平台 Wealthfront 也在使用。

Simile 的目标是准确模拟全球 80 亿人。但相关准确率主要由公司自己公布,外界仍质疑 AI 分身能否真正替代真人。现阶段,它更像传统市场调研前的快速筛选工具。

Simile 的 CEO Joon Sung Park 是 2023 年轰动学界的「斯坦福小镇」(Generative Agents)论文第一作者(让 25 个 AI 居民在虚拟小镇自主生活、产生涌现行为的经典实验)。

Simile
👍2
MiniMax发布全模态生成模型H3,一个模型包办图片、视频和声音

MiniMax 发布全模态生成模型 H3。它能同时理解文字、图片、视频和声音,再按一条自然语言指令生成或编辑视频。

用户可以让 H3 照着一段视频学镜头运动,使用另一张图中的人物,再参考第三段音频的声音。过去需要分别调用的动作迁移、人物参考、声音参考和视频编辑,现在可以放进同一次任务。

H3 最长可生成 15 秒视频,支持 2K 分辨率和原生双声道声音。官方 API 的 2K 价格为每秒 0.13 美元,生成一段 15 秒视频约需 1.95 美元;768P 每秒 0.09 美元。

一次任务最多可输入 9 张图片、3 段视频和 3 段音频,总数不能超过 12 个文件。

MiniMax 计划未来几天开放模型权重。

MiniMax
动察Beating AI News
MiniMax发布全模态生成模型H3,一个模型包办图片、视频和声音 MiniMax 发布全模态生成模型 H3。它能同时理解文字、图片、视频和声音,再按一条自然语言指令生成或编辑视频。 用户可以让 H3 照着一段视频学镜头运动,使用另一张图中的人物,再参考第三段音频的声音。过去需要分别调用的动作迁移、人物参考、声音参考和视频编辑,现在可以放进同一次任务。 H3 最长可生成 15 秒视频,支持 2K 分辨率和原生双声道声音。官方 API 的 2K 价格为每秒 0.13 美元,生成一段 15 秒视频约需 1.95…
MiniMax H3拿下视频编辑第一,文生和图生视频均排第二

第三方评测机构 Artificial Analysis 公布 MiniMax H3 的视频榜单成绩。H3 在带声音的视频编辑中排名第一,Elo 得分为 1130,谷歌 Gemini Omni Flash 以 1121 分排名第二。

在带声音的文生视频榜单中,H3 以 1242 分排名第二,只比 Gemini Omni Flash 少 3 分。两款模型的置信区间重叠,实际表现可以视为同一梯队。

H3 在无声音的图生视频中同样排名第二,得分为 1351。它落后谷歌 Gemini Omni Flash,但超过字节跳动 Seedance 2.0。

这些排名来自匿名用户盲选。用户查看相同输入生成的视频,再选出更喜欢的一条,因此主要反映观看者的综合偏好,不等同于客观画质或指令遵循测试。

Artificial Analysis
2
从豆包到芯片,字节跳动想借AI再造一个自己

字节跳动正把抖音和 TikTok 赚来的钱,大规模投向 AI。豆包只是入口,公司还在同时做基础模型、视频生成、企业云、海外数据中心和自研芯片。

豆包月活已达 3.24 亿。基础模型团队 Seed 扩至约 2000 人,火山引擎占中国 AI 云服务收入的 16%,排名第二。字节还在五个国家推进数据中心,并研发内部使用的推理芯片。

字节过去靠算法分发内容、出售广告赚钱。现在,它想把模型、应用、云和芯片全部做在自己手里,从流量平台变成一家全栈 AI 公司。

FT
🔥2
字节AI年化收入冲到40亿美元,位居中国AI公司第一

《南华早报》援引知情人士称,字节跳动大模型业务的年化经常性收入已达到 40 亿美元,按目前公开数据位居中国 AI 公司第一。

作为对比,阿里目前约为 15 亿美元,智谱约为 10 亿美元,DeepSeek 接近 5 亿美元,月之暗面约为 3 亿美元。字节已经明显拉开与国内同行的收入差距。

不过,ARR 是按当前收入速度推算未来一年,不等于已经赚到 40 亿美元。字节的 AI 收入也仍远低于 OpenAI 和 Anthropic。

SCMP
1
动察Beating AI News
特斯拉中国车机语音大模型服务完成备案,将接入豆包与DeepSeek 网信上海公布,特斯拉(上海)有限公司的「车机语音大模型服务」于 4 月 20 日完成生成式人工智能服务备案。 特斯拉中国官网此前发布的《特斯拉车机语音助手使用条款》已披露分工方案:Model Y L 车型将搭载豆包大模型与 DeepSeek 模型,均通过火山引擎加密 API 接入。豆包负责语音命令,覆盖导航设定、媒体播放、空调温度调节和车主手册查询;DeepSeek 负责 AI 互动,用于闲聊、查询新闻与天气等场景。 备案完成意味着合规流程已走通,但具体…
特斯拉中国补上AI语音,豆包正式上车

特斯拉中国开始分批推送 2026.14.13 版本。Model S、Model 3、Model X 和 Model Y 均将接入豆包大模型语音助手。

新版助手能查询实时信息,也能连续自然对话。用户还可以选择不同音色,以及「万事通」「音乐爱好者」「故事会」等角色。

特斯拉去年就披露,计划让豆包处理车控指令,让 DeepSeek 负责开放问答。今年 4 月,相关语音服务已在上海完成备案。不过,这次更新说明只点名豆包,尚未确认 DeepSeek 是否同步开放。

这项功能需要开通高级车载娱乐服务,官方价格为每月 9.99 元。

IT 之家
🤡6
Claude做安全测试误黑3家公司,还把恶意软件上传到公共软件库PyPI

Anthropic 披露,Claude 在网络安全测试中意外连上公网,并侵入三家真实公司的生产系统。事故涉及 Claude Opus 4.7、Mythos 5 和一款内部研究模型,最早发生在 4 月。

最严重的一次,Opus 4.7 把一家同名真实公司当成虚构目标。它拿到应用和基础设施凭证,还进入了一个存有数百行生产数据的数据库。模型后来发现目标可能是真实系统,但仍继续攻击。

Mythos 5 则自行制作恶意 Python 包,并上传到公共软件库 PyPI。软件包公开约一小时,被 15 台真实设备下载运行。一家安全公司的扫描器中招,Claude 随后盗取凭证并进入更多系统。

另一款内部模型还扫描了约 9000 个目标,最终攻入一家公司的应用。不过,它确认目标属于真实公司后自行停手。

Anthropic 是在 OpenAI 披露 Hugging Face 事故后,回查 14.1 万次测试才发现问题。两家受影响机构此前毫不知情。Anthropic 认为,这更接近测试隔离和监控失效,不是模型主动逃逸。

Anthropic
🤡4
动察Beating AI News
半年暴赚439%遭杠杆反噬,24岁前OpenAI研究员的200亿美元AI基金开始筹集新资金 《金融时报》援引知情人士称,24岁前 OpenAI 研究员 Leopold Aschenbrenner 创办的对冲基金 Situational Awareness,近期开始向现有投资人和贷款方筹集新资金。该基金规模约 200 亿美元,集中押注 AI 相关股票。基金还向部分投资人提出直接购买其持仓资产的方案。 Situational Awareness 截至 6 月底的年内净回报高达 439%。这轮上涨借助借款放大,AI…
半年暴赚439%的AI基金遭反噬,Citadel接手大部分股票仓位

24 岁前 OpenAI 研究员 Leopold Aschenbrenner 管理的 Situational Awareness,在 AI 股票大跌后,将大部分公开股票卖给 Citadel。基金交易前约有 160 亿美元公开股票,重仓 SK 海力士、CoreWeave、Nebius 等 AI 产业链公司。

基金此前借钱放大仓位。市场反转后,它需要追加资金或出售资产,最终选择减仓。CNBC 称基金清空了公开股票,路透社和《华尔街日报》则称出售大部分仓位。

Citadel 主要接手由经纪商借款融资的股票。交易后,基金仍有约 100 亿美元资产,包括部分由客户本金持有的公开股票,以及 Anthropic 等公司的私募股权。

WSJ
🤡3