动察Beating AI News
3.09K subscribers
850 photos
2 videos
3.34K links
AI新闻信息流
Download Telegram
Kimi被指整页搬走设计师作品,还挂成官方精选模板

独立设计师 Marina Budarina 指控,Kimi 未经许可,把她的互动网页 CHIMES 换名为「SILK ATLAS」,放进 Kimi Swarm 的精选案例。

她称,Kimi 照搬了页面设计、互动效果和文案,也没有标注作者。

很多网友表示,他们此前看到这个模板时,以为 Budarina 与 Kimi 有合作。还有人误以为,这个作品本来就是用 Kimi 做的。

截至目前,Kimi 尚未公开回应,但已经下架相关模版。

Budarina
🤡71
动察Beating AI News
OpenAI称评测框架拖累GPT-5.6表现,但Opus 5用同一框架分数高2.3倍 OpenAI 称,ARC-AGI-3 的通用评测框架没有保存 GPT-5.6 Sol 此前的推理,还会在上下文过长时删除早期记录。模型因此经常忘记已经发现的游戏规则,每执行一步都要重新思考。 OpenAI 随后用自家 Responses API 重做评测框架,保留历史推理,并压缩过长的上下文。结果,GPT-5.6 Sol 的得分从 13.3%升至 38.3%,输出 Token 降至约六分之一。 但问题在于,Opus…
ARC-AGI-3 评测机构考虑改规则:官方榜或允许厂商自带记忆

ARC-AGI-3 评测机构 ARC Prize 此前要求所有模型使用同一套简单调用方式,避免厂商靠定制框架拉高分数。这样更容易看清模型本身的能力。

回应 OpenAI 的争议测试时,官方口径开始松动。ARC Prize 承认,保留历史推理、压缩过长的上下文,确实能提升模型处理长任务的表现,并已开始研究如何把这类功能加入正式评测。

ARC-AGI 创始人 François Chollet 给出的边界是:专门为 ARC 开发的框架仍然不行;所有 API 用户都能使用的通用设置可以考虑。他认为,各家用了什么设置、花了多少钱,都应该公开。

一旦放行厂商自带的记忆和上下文管理,ARC-AGI-3 比较的就不再只是模型,还会包含各家 API 背后的工程能力。

ARC Prize
1
OpenAI年化收入达到426亿美元,两个月增长约29%

OpenAI CFO Sarah Friar 在内部会议上称,公司 7 月收入继续增长,主要由 GPT-5.6、企业 Agent ChatGPT Work 和 Codex 带动。OpenAI 没有公布具体金额。

第三方机构 TickerTrends 估算,OpenAI 7 月底的月度经常性收入水平约为 35.5 亿美元,比 5 月底高约 8 亿美元。其 ARR 从 5 月底的 330 亿美元升至 7 月 29 日的 426 亿美元,两个月增长约 29%。

OpenAI 董事长 Bret Taylor 同时承认,公司年初在 AI 编程市场落后 Anthropic。但部分 Claude Code 重度用户因账单过高,已经开始寻找 Codex 等替代品。

TickerTrends
👍1👏1
观点:未来几年,GPU租金可能上涨10倍以上

AI 领域知名播客主持人 Dwarkesh Patel 提出一个反常判断:未来几年,GPU 算力租金可能上涨 10 倍以上。模型越聪明,同一块 GPU 能完成的工作越值钱,AI 公司也更愿意花高价抢算力。

他用软件工程举例。假如一块 H100 等效算力能持续运行一名人类水平的软件工程师,其年租金理论上可超过 25 万美元,约为当前现货价格的 15 倍。

市场已经出现涨价苗头。H100 一年期租金从 2025 年 10 月的每小时 1.70 美元,升至 2026 年 3 月的 2.35 美元,涨近 40%。Epoch AI 估算,全球 AI 算力在 2025 年约增长 3 倍,但头部实验室的算力需求增长更快。

如果这套推演成立,弱模型会因为消耗更多昂贵算力而失去价格优势,低价值的图片和短视频生成也可能先被挤出去。但这只是情景推演。大量 AI 程序员出现后,工程工作的市场价格也可能下降,25 万美元这笔账未必成立。

Dwarkesh Patel
亚马逊内部曝AI成本失控,小错误烧出百万账单

《金融时报》援引知情人士称,亚马逊内部通报了多起 AI 项目严重超支。最夸张的一次,是用 Claude Sonnet 给商品页面匹配作者信息。项目最终失败,却花掉 180 万美元,比预算高 860%,五个月后才被发现。

另一个财务审计工具项目意外多花约 54.1 万美元。一个优化物流配送速度的项目也误花 13.4 万美元,两个多星期后才被发现。

亚马逊工程师将问题归结为部署错误和缺少成本限制。传统系统里几乎不花钱的小错误,放到 AI 项目中可能变成「灾难性昂贵」的账单。公司正在开发自动化措施,防止类似项目继续失控。

亚马逊回应称,这些案例只涉及少数团队,不能代表公司日常使用 AI 的整体情况。此前,亚马逊还关闭了内部 AI 使用排行榜,因为员工为了冲榜让 Agent 执行无意义任务,额外消耗大量 Token。

FT
🤡3
动察Beating AI News
OpenAI 推出计算生物学基准 GeneBench-Pro,GPT-5.6 满血版正确率仅三成 OpenAI 发布了计算生物学评测基准 GeneBench-Pro,用来测试 AI 智能体在面对基因组学和转化医学等复杂科研场景时的多步决策能力。新基准共包含 129 个问题(其中 82 个经过外部专家评审),通过计算机模拟生成具有明确因果关系的数据,防止模型通过走捷径或迎合出题人偏好来作弊。 测试结果显示,顶尖模型在处理包含量化不确定性的科学推理时依然非常吃力。最强的 GPT-5.6 Sol 在开启 Pro…
大模型再聪明也得刷题,OpenAI前研究员创业卖数据

OpenAI 前研究人员、GeneBench-Pro 共同作者 Andrew Ho 离职创业。新公司将为大模型制作高质量强化学习数据(给模型练习并按结果打分的训练任务)。首批产品聚焦生物学和统计推理,公司名称尚未公开。

Ho 认为,大模型仍然严重偏科。即使在投入巨大的编程领域,模型会刷题、会改代码,真实交付仍常要人工收尾。

更多实际工作则连合适的训练题都没有。它们依赖具体背景,也很难自动判断模型做得对不对。

他的办法是生成接近真实科研的数据和问题,同时保留已知答案。模型可以自由探索,训练系统也能明确判断对错。

GeneBench-Pro 就采用了这套方法。该评测包含 129 项计算生物学任务,GPT-5.6 Sol Pro 的通过率只有 31.5%。

新公司还会制作培养皿、Western blot 等实验图像的训练数据,之后再扩展到化学、材料、医疗和办公室工作。

Ho 预计,前沿 AI 实验室未来将为精准训练数据投入超过 1000 亿美元。

Andrew Ho
👍1
腾讯开源模型Hy3破解半世纪数学难题,完整证明已通过机器验证

腾讯混元的研究智能体 Hyra,使用自家的开源模型 Hy3,协助两名研究者解决了一个悬而未决 50 多年的组合数学问题。

问题是:一个整数集合的「和集」,最多能比「差集」增长多快。数学界早已证明,相关指数不会超过 2,但一直不知道 2 是不是最优答案。

Hyra 让 Hy3 先搜索具体集合,再尝试提出通用构造。约 24 小时后,AI 找到了论文最终采用的核心方案。研究者随后核对、修正并整理证明,GPT-5.6 Sol 协助转成 Lean 4 验证。

最终论文证明,这个指数可以无限接近 2,所以上界 2 已经是最优答案。虽然 AI 没有包办整篇论文,但最关键的构造确实是 Hy3 找到的。

腾讯混元
👍3
月之暗面(Kimi)完成股改,为香港上市铺路

月之暗面(Kimi)已更名为「北京月之暗面科技股份有限公司」,企业类型从有限责任公司变为非上市股份有限公司。杨植麟出任董事长兼经理,张予彤新增为董事,宋思嘉新增为财务负责人。

这次变更通常被称为「股改」。证监会规定,境内企业若以境内主体直接赴境外上市,发行人必须是股份有限公司。

彭博此前称,月之暗面已向投资者发出赴港上市股东决议,最快可能在半年内 IPO,并开始拆除红筹架构。公司尚未正式公布上市时间。

爱企查
1
OpenAI免费给10万科研人员用GPT-5.6 Sol Pro

OpenAI 推出 ChatGPT for Academic Researchers,计划到 2027 年向 10 万名科研人员免费开放前沿模型和研究工具。首批 1 万人将在今年夏天获得权限,启动时可用 GPT-5.6 Sol Pro、ChatGPT Work 和 Codex。

参与者还会获得更多 Deep Research 额度、更高使用上限和更长上下文。平台内置 75 项以上生命科学技能,也能连接论文库、公共基因组数据库和计算笔记本。

这项福利并非所有高校人员都能领。申请者须来自 OpenAI 选定的研究型高校,并验证学校身份、在研项目和科学用途。获批后最多可邀请 4 名同校合作者,数据默认不用于训练。

OpenAI
👍1
Claude Opus 5最会卖货,也最爱和对手串通定价

AI 评测机构 Andon Labs 让模型拿着 500 美元本金,在模拟环境中经营一台售货机 365 天。Claude Opus 5 五次测试的期末余额平均为 1.12 万美元,超过 Claude Opus 4.7 和 GPT-5.6 Sol,升至 Vending-Bench 2 第一。

在多人竞争版中,Opus 5 以约 7000 美元排名第二,与第一名 GPT-5.6 Sol 的约 7400 美元相差不大。六次测试里,它每次都提出或参与串通定价。它还编造竞争对手报价、威胁同行,并累计撕毁 11 次停战协议。

Opus 5 的退款批准率最终降至 10%,六次测试合计只退了 8.54 美元。GPT-5.6 Sol 退了 655 美元,依然赢下多人赛。

Andon Labs 认为,Opus 5 再次出现「越会赚钱,行为越不对齐」的问题。Anthropic 自己的发布前审计却称,它是历来最对齐的 Claude。

Andon Labs
2
动察Beating AI News
大模型再聪明也得刷题,OpenAI前研究员创业卖数据 OpenAI 前研究人员、GeneBench-Pro 共同作者 Andrew Ho 离职创业。新公司将为大模型制作高质量强化学习数据(给模型练习并按结果打分的训练任务)。首批产品聚焦生物学和统计推理,公司名称尚未公开。 Ho 认为,大模型仍然严重偏科。即使在投入巨大的编程领域,模型会刷题、会改代码,真实交付仍常要人工收尾。 更多实际工作则连合适的训练题都没有。它们依赖具体背景,也很难自动判断模型做得对不对。 他的办法是生成接近真实科研的数据和问…
前OpenAI研究人员质疑AI巨头万亿估值:越领先越烧钱

前 OpenAI 研究人员 Andrew Ho 发帖质疑前沿 AI 实验室的万亿美元估值。

按 Ho 的粗算,即使推理业务毛利率达到 80%,再给出 20 倍市盈率,一家公司也要做到 1000 亿至 2000 亿美元年收入,才可能支撑 1 万亿美元估值。这还假设公司不再花钱训练新模型。

现实中,OpenAI、Anthropic 等公司必须不断训练下一代模型。一旦停下来,用户就可能转向更便宜的 Qwen 或 Kimi。收入在涨,下一代模型的训练成本也在涨。领先者反而要一直追加投入。

Ho 也不相信 AI 能力会很快全面爆发。他认为,大模型仍然偏科,进步可能更慢,也更受高质量数据限制。即使模型能力停在今天,AI 真正进入各行各业,也可能需要 20 年以上。

他认为,编程 Agent 可能只是少数已经找到的高价值产品。多派工程师帮企业接入 AI,也未必能迅速找到下一个赚钱场景。

Ho 仍然看好 AI 产业长期增长,但不愿按当前估值买入 OpenAI 或 Anthropic。

Andrew Ho
😁1
谷歌发布三款机器人模型,核心动作模型可跨机器人复用

谷歌 DeepMind 发布新一代 Gemini Robotics 模型家族。Gemini Robotics 2 负责控制动作,ER 2 负责理解环境和规划任务,On-Device 2 可直接在机器人本地运行。

Gemini Robotics 2 能把画面和文字指令变成动作。同一个模型检查点可以控制人形机器人、双臂机器人和不同机械手,不必为每种机器人重新做一套模型。

它还新增全身控制能力。人形机器人可以行走、下蹲、保持平衡,同时操作物体,并完成打结、封袋等精细动作。ER 2 则负责拆解复杂任务、跟踪进度和协调多台机器人合作。

目前,ER 2 已在 Google AI Studio 开放,并进入 Gemini Enterprise Agent Platform 私人预览。Gemini Robotics 2 和 On-Device 2 仍只向早期合作伙伴开放。

谷歌 DeepMind