动察Beating AI News
3K subscribers
797 photos
2 videos
3.25K links
AI新闻信息流
Download Telegram
腾讯Hy3免费版用量超小米、DeepSeek,登顶OpenRouter周榜

腾讯混元 7 月 6 日正式发布 Hy3,并在 OpenRouter 开启两周免费 API 调用。数据显示,Hy3 免费版已升至 OpenRouter LLM 周使用榜第一,单周处理 6.13 万亿 Token,高于小米 MiMo-V2.5 的 5.95 万亿和 DeepSeek V4 Flash 的 5.22 万亿。

OpenRouter 免费版将于 7 月 21 日结束,付费版价格为输入每百万 Token 0.14 美元、输出 0.58 美元。

信源:https://openrouter.ai/rankings#top-models
🔥2
GPT-5.6 Sol被质疑「降智」,OpenAI称推理预算调整只是排查实验

有用户发现,GPT-5.6 Sol 各档位的内部推理预算明显下降,最高档从 960 降至 128,因此怀疑 OpenAI 为节省算力削弱模型。

OpenAI Codex 负责人 Tibo Sottiaux 回应称,团队曾调整推理强度,用来排查订阅额度为何消耗过快。这项实验已经撤回,官方称并未长期削弱模型。

OpenAI 已确认,37.2 万上下文会导致额度扣除高于预期,因此暂时降回 27.2 万。high 和 xhigh 档的多 Agent 调用也比预期更多,目前正在修复。

此外,OpenAI 完成了推理优化,GPT-5.6 Sol 各档订阅可多获得约 10% 用量。

信源:https://x.com/thsottiaux/status/2076495156757577895
1
传被字节索赔800万的前实习生创业做世界模型,估值2亿美元

NeurIPS 2024 最佳论文一作田柯宇被曝进入世界模型创业。知情人士称,项目由五源资本合伙人孟醒孵化并投资,已融资数千万美元,估值约 2 亿美元。

工商信息显示,田柯宇今年已在北京成立多家 AI 公司。北京蓝炭网络科技有限公司由他持股 60%,业务涉及 AI 硬件、智能机器人和人工智能技术研发。另一家公司北京蓝之炭网络科技有限公司注册资本为 190 万美元。

田柯宇曾在字节跳动实习。字节指控他篡改代码、攻击团队模型训练任务,并于 2024 年起诉索赔 802 万元。案件已获法院受理,但尚未查到公开判决结果。

此后,田柯宇以第一作者身份凭借 VAR 图像生成框架获得 NeurIPS 2024 最佳论文。VAR 采用由粗到细的「下一尺度预测」,论文称其在图像质量、推理速度和数据效率等方面超过扩散 Transformer。

信源:https://mp.weixin.qq.com/s/_VolxhRVvsh7cZSqzdD_Ag
👎1🤣1
Claude Code发布后,美国开发岗位逆势涨15%

Indeed 招聘实验室发现,自 Claude Code 于 2025 年 2 月发布以来,美国软件开发岗位招聘量增长近 15%。同期,Indeed 全部岗位招聘量下降 7%。

增长主要集中在资深和 AI 岗位。2025 年 5 月至 2026 年 5 月,71% 的新增招聘来自高级职位,37% 来自名称中提到 AI 的岗位。

但这不能证明 Claude Code 直接带动了招聘。Indeed 强调,两者只是同期出现。软件开发岗位即使反弹,仍比 2020 年 2 月低 27.5%。

这轮增长更像是需求换了方向。企业正在增加能驾驭 AI 的资深开发者,初级岗位未必同步受益。

信源:https://www.hiringlab.org/2026/07/08/ai-and-job-postings-from-destruction-to-creation/
🥰1
GPT-5.6 Sol登顶单轮前端榜,领先GPT-5.5 18名

Design Arena 公布前端设计榜结果。GPT-5.6 Sol 以 1353 Elo 排名第一,略高于 GLM 5.2 的 1351 分。Claude Fable 5 以 1345 分位居第三。

这次登顶的是「非 Agent」榜。模型不能调用搜索、终端或文件编辑工具,也没有多轮修改机会。它需要读完提示词后,一次生成完整的单文件 HTML 网页。最终效果再由真实用户两两比较。

GPT-5.6 Sol 比 GPT-5.5 高出 60 Elo,排名领先 18 位。Design Arena 还称,它在同等表现的模型中速度最快。

信源:https://x.com/Designarena/status/2076391367446860249
👍1
动察Beating AI News
微软CEO纳德拉大谈AI人机协同转头疯狂裁员,被指说一套做一套 微软掌门人萨提亚·纳德拉在 X 上撰文,探讨企业在 AI 时代如何保持自主权。纳德拉认为,光靠购买通用大模型无法建立长期壁垒,反而会让公司受制于人。企业真正的应对之策是让人类经验与技术相结合,将员工的业务积淀与公司的 AI 能力结合起来,防范行业价值被少数模型巨头完全垄断。 在双重资本框架下,AI 并不会直接取代人类,相反,人的判断力、沟通能力和模式识别在技术普及后会变得更加重要。企业需要做的是在通用模型之上,用内部数据跑出私有的学习闭环…
纳德拉呼吁企业夺回AI学习权:别花钱帮模型厂商积累经验

微软 CEO 萨提亚·纳德拉再次发长文,呼吁企业把 AI 产生的学习成果留在自己手中。他将当前的风险称为「反向信息悖论」:企业不仅要花钱购买 AI,还可能交出最宝贵的内部经验。

模型越想做得准,企业就要提供越多业务信息。员工写下的提示词、调用过的工具、内部评测和纠错记录,都会沉淀为公司独有的知识。但在现有模式下,这些信息也可能反过来帮助模型厂商改进产品。

纳德拉批评,部分模型公司认为自己可以学习互联网上的公开内容,却限制客户利用模型输出训练自己的系统,同时还可能从客户的使用记录中继续学习。知识如果只向供应商一侧流动,企业投入的人力和经验,最后就可能变成模型巨头的资产。

他呼吁企业掌握自己的评测、记忆、运行轨迹和微调权重,并将 Agent 编排层与单一模型分开。即使模型厂商退出或涨价,企业积累的业务能力也不至于随之丢失。

一个月前,纳德拉已经提出「人力资本与 Token 资本」框架,警告企业不能把学习能力外包出去。

信源:https://x.com/satyanadella/status/2076323181154230284
🔥1
近3万元把孩子包装成CEO,AI研学营收割家长焦虑

今年暑期,AI 研学营成了家长圈的新热门。有人收费近 3 万元,让不到 10 岁的孩子挂上 CEO、CTO 胸牌,背着台词参加创业路演。还有机构宣称,孩子能在 6 天内创办一家 AI 公司。

这类课程抓住了家长最直接的恐惧:别人家的孩子已经在学 AI、做产品甚至谈融资,自己的孩子会不会被时代甩下。机构卖的也不只是课程,而是一张「孩子没有落后」的心理安慰券。

但《中国新闻周刊》调查发现,不少项目的「含 AI 量」并不高。所谓大厂和高校研学,可能只是参观、拍照和打卡。孩子答不上技术问题时,由指导老师代答。收费 1.5 万元的「大模型实战营」,最后可能只教用 AI 做 PPT 和文案。

师资同样参差不齐。部分授课老师只接受几天培训,专业背景与 AI 无关。一名从业者称,整个 AI 教育市场「90%以上都是糊弄」。

真正的 AI 教育需要长期训练、专业师资和完整课程。把孩子包装成「8 岁产品经理」「10 岁 CEO」,更像是在向家长展示成果,而不是让孩子真正掌握技术。家长花万元买到的,可能只是一场精心拍摄的儿童创业表演。

信源:https://mp.weixin.qq.com/s/4oLgvsTY30A8nXwanOwI9A
😁1
Prime Intellect重写Verifiers,Agent训练评测可像积木拼装

AI 训练平台 Prime Intellect 发布 verifiers 0.2.0,并在其中开放下一代 Verifiers v1 的架构预览。Verifiers 是给 AI Agent 出题、运行和打分的开源框架,可用于能力评测和强化学习训练。

Prime Intellect 还开源了模型训练框架 prime-rl。简单来说,Verifiers 负责定义任务、工具和评分规则,prime-rl 根据任务结果训练模型。开发者可以自行下载和部署这两套工具。

Prime Intellect 同时运营 Environments Hub 和 Lab。前者用于共享和下载现成的训练环境,后者提供托管训练服务。开发者可以自己部署整套工具,也可以直接使用 Prime Intellect 的环境和算力平台。

旧版 Verifiers 把任务和 Agent 的运行方式绑在一起。v1 将其拆成三块:Taskset 规定做什么、提供哪些工具、如何评分;Harness 决定 Agent 怎样完成任务;Runtime 决定任务在本地、Docker 还是远程沙箱中运行。

同一套任务因此可以换用 Codex、Kimi Code、Terminus 2 等 Agent,也可以在本地、Docker 或远程沙箱中执行。开发者不用每换一个 Agent 或执行环境,就重写任务和评分规则。

v1 还能记录子 Agent 调用、上下文压缩等分支过程,并保存训练所需的 Token ID 和对数概率。新版更适合持续数百轮的长任务,也能直接把 Agent 的运行轨迹用于强化学习。未来的 1.0.0 还计划加入多 Agent 环境,并完善对 OpenEnv、NeMo Gym 和 OpenReward 等环境框架的支持。

信源:https://www.primeintellect.ai/blog/verifiers-v1
WSJ:苹果把OpenAI当成下一个Android,先用官司争时间

苹果起诉 OpenAI,可能不只是在追究商业机密。

《华尔街日报》认为,这场官司延续了苹果当年阻击 Android 的打法。乔布斯曾扬言对 Android 发动「热核战争」,苹果随后与三星等厂商打了八年官司。

这一次,OpenAI 的 AI 硬件还没有发布,苹果已经提前出手。诉讼可能拖慢 OpenAI 招募苹果员工,也会增加其硬件研发的法律风险。

OpenAI 已通过收购 Jony Ive 创办的 io Products 进入硬件市场,希望开发一套减少用户依赖手机屏幕的设备。苹果自己的 AI 产品进展缓慢,因此更需要为下一轮设备竞争争取时间。

但官司只能拖住对手,不能替苹果造出下一代产品。苹果能否守住 iPhone,最终仍要靠产品说话。

信源:https://www.wsj.com/tech/ai/apples-thermonuclear-response-to-the-openai-threat-8d51c814
AI数据中心开始和美国农民抢地、抢水、抢电

美国多地农民和牧场主开始反对 AI 数据中心建设。他们担心项目占用耕地,还会争夺当地的水和电。

美国目前约有 5000 座已建成或在建的数据中心。大型项目通常需要大片平坦土地,并靠近水源和电网,这些条件与农业高度重合。

部分数据中心的耗电量相当于一座中型城市。农民担心,用电需求激增会推高电费。干旱地区的牧场主还担心,供水紧张时,农业会先被要求削减用水。

约有 20 个州正在考虑限制数据中心建设。科技行业则称,许多项目大部分时间使用风冷,耗水远低于农业;数据中心带来的收入,也可能帮助当地冻结或下调电价。

更现实的矛盾是土地。高价收购能让老年农场主直接退休,但一旦优质农田被改成数据中心,很难再恢复农业生产。

信源:https://www.wsj.com/business/energy-oil/a-new-foe-has-emerged-for-data-centers-farmers-4a3eda8f
传Anthropic考虑让Fable 5永久留在订阅

爆料账号 Ali Haider 称,Anthropic 正讨论将 Claude Fable 5 永久保留在付费订阅中。公司担心移除模型会引发大量用户退订,并面临 GPT-5.6 Sol、Grok 4.5 带来的竞争压力。

Anthropic 已将 Fable 5 的订阅访问期再次延至 7 月 19 日。Claude Code 每周额度提高 50% 的活动同步延期。用户仍最多可将每周额度的 50% 用于 Fable 5。

Anthropic 此前只承诺,会在算力允许后将 Fable 5 恢复为订阅的标准功能。目前尚未正式宣布永久保留。

信源:https://x.com/ggg78g89/status/2075962605462761953
👍1
美国NSF拟大面积切断与中国科学家的合作

美国国家科学基金会(NSF)计划出台新规。接受 NSF 资助的美国科学家,将不得在相关项目中与美国限制名单内的机构及其人员合作。这些名单覆盖大量中国高校、实验室和科研机构。

即使中方没有拿到美国资金,只要参与 NSF 资助的研究,也可能被禁止。美国科学家还不能在相关机构任职,或接受对方提供的科研支持。《Science》认为,新规可能让 NSF 项目与中国科学家的大部分合作停摆。

NSF 此前会逐项评估合作风险。新规改为根据机构是否上榜直接禁止。为了保住经费,美国高校很可能主动减少与中国机构的合作,实际影响可能超过政策明文规定的范围。

目前限制只针对 NSF 资助项目,还不是全面禁止中美科研合作。但美国政府正在推动覆盖全部联邦科研经费的更广泛规则。中美科研脱钩可能从芯片和 AI,进一步扩大到材料、物理、气候等基础科学。

信源:https://www.science.org/content/article/new-nsf-policy-would-ban-almost-all-collaborations-chinese-scientists
韩国AI遭Critini分析师泼冷水:创业公司和高校研究都被严重高估

Critini Research 分析师 Jukan 在参加 ICML 后发文称,韩国只是在「假装认真发展 AI」。韩国 AI 创业公司和高校研究被严重高估,与中国相比「几乎什么都不是」。

他建议韩国推出类似中国「千人计划」的人才政策,吸引海外韩裔研究者回国,并主动挖走外国顶尖人才。否则,韩国可能沦为依赖外国 AI 技术的国家。

信源:https://x.com/jukan05/status/2076205112750379183
传字节试水自动驾驶,Seed世界模型团队牵头

36氪从多位产业人士处获悉,字节跳动正探索自动驾驶。项目仍在早期筹备,由 Seed 旗下周畅负责的世界模型团队推进。

字节考虑的场景包括无人物流。公司此前已与多家头部自动驾驶团队交流,并向部分辅助驾驶和自动驾驶人才发出邀约。

世界模型可以学习现实环境的运行规律,预测路况变化,与自动驾驶的技术需求有较多重合。但通用世界模型与智驾专用模型仍有差距,字节还需要补充道路数据和工程能力。

字节回应称,公司正在物理 AI 等前沿方向进行早期研究和探索,但没有开展智能驾驶业务的计划。

信源:https://mp.weixin.qq.com/s/9dtqoS9ofz5EJ1d1EBTLVQ
YC合伙人Tom Blomfield暂别YC,加入Anthropic算力团队

YC 合伙人、Monzo 联合创始人 Tom Blomfield 宣布暂时离开 YC,加入 Anthropic。他将与联合创始人 Tom Brown 共事,负责算力相关工作。

这支团队负责为模型训练和运行争取芯片、云服务与数据中心资源。Blomfield 称,AI 正进入递归自我改进的早期阶段,算力供应将成为最重要的问题之一。

Blomfield 此次是从 YC 请假,尚未宣布正式退出。

信源:https://x.com/t_blom/status/2076580921398931788
👍2
诺奖得主从伯克利转投清华,要用AI把材料研发周期压缩一个数量级

2025 年诺贝尔化学奖得主奥马尔·亚吉已离开加州大学伯克利分校,全职加盟清华大学。清华聘其为讲席教授,并由他牵头建设 AI 材料化学研究中心 AIMATRY。

中心将联合化学、化工、人工智能、计算机和材料等团队,用 AI 改造材料设计与合成。目标是打通从理论计算到研发生产的全链条,把新材料研发周期压缩一个数量级。

亚吉因推动金属有机框架材料(MOF)发展,与另外两名科学家分享 2025 年诺贝尔化学奖。MOF 像分子海绵,可用于捕碳、从空气取水和储氢。

亚吉 2022 年已受聘为清华名誉教授,这次是从长期合作转为全职任职。

《Nature》把这次流动放在美国科研经费收缩、中国争抢顶尖人才的背景下。不过,亚吉没有公开把赴华决定直接归因于美国削减科研资助。

信源:https://www.nature.com/articles/d41586-026-02143-x
👍1😁1
Grok 4.5登顶腾讯混元Agent耐力榜,超六成任务无模型完成

腾讯混元团队联合多所高校发布 LHTB,专门测试 AI Agent 能否在终端里持续完成复杂任务。

基准包含 46 项任务,覆盖软件工程、实验复现、科学计算和多模态分析等领域。每项最长运行 90 分钟,通常需要连续操作数百步。

LHTB 不只看最终成败。任务完成一部分,也会按实际进度给分。隐藏验证器会检查文件、测试结果和程序输出,Agent 自称完成不算。

论文首版测试了 15 个模型。GPT-5.5 完成 7 项,排名第一。每个模型执行一项任务,平均消耗约 990 万 Token,耗时约 85 分钟。

当前公开结果已扩至 20 个模型。Grok 4.5 以平均得分 0.505 登顶,完成 13 项。46 项任务中,仍有 29 项没有任何模型达到完成标准。

多数 Agent 能完成部分步骤,却经常耗尽 90 分钟,或在任务尚未完成时提前收工,无法把复杂任务真正做完。

信源:https://zli12321.github.io/LHTB/leaderboard.html
1
趋境科技半年融资超10亿,万亿级Token工厂已投产

AI Token 生产服务商趋境科技完成 A 轮融资,半年累计融资超过 10 亿元。本轮由河南投资集团汇融基金领投,真知资本、尚势资本、星连资本等老股东继续跟投。公司没有披露本轮单笔融资金额。

趋境科技不训练自己的大模型,也不追求接入尽可能多的模型。它主要为少数头部模型优化推理系统,让同一批算力生成更多、更快、更稳定的 Token。

公司称,目前已有日均万亿级 Token 工厂投产,部分成熟业务已经盈利。2026 年春节以来,平均单台算力的 Token 生产效率提升超过 3 倍,总产能增长超过 30 倍。

所谓 Token 工厂,本质上是把芯片、内存、网络和模型推理软件统一调度。它要同时降低首字等待时间、提高并发量,并减少算力闲置和故障造成的损失。

本轮资金将用于扩充 Token 产能、升级 ATaaS 平台,并推动国产芯片进入大规模推理场景。

信源:https://mp.weixin.qq.com/s/dnj6_u-kL7sfi7OpsmbAqA
👍1
Sakana AI做出会自检的智能砖块,不靠中央电脑也能发现故障

日本 AI 初创公司 Sakana AI 做出一套「会认识自己」的智能砖块。近 200 块砖拼成飞机、桌子、吉他等形状后,每块砖只和旁边的砖通信,却能一起判断整体长什么样。

研究人员拔掉或关闭部分砖块后,剩下的砖还能发现哪里断了,并继续识别整个结构。它们没有摄像头,不知道自己的坐标,也没有中央电脑指挥。

这些砖块更像实体版「细胞」。单个细胞看不到全身,但靠附近细胞传递信息,整个组织依然知道自己长什么样,哪里受了伤。

这套方法以后可能用在建筑、机器人或航天器上。故障不必等人逐个排查,结构自己就能报出哪里出了问题。即使部分零件失灵,整套系统也不至于立刻瘫痪。

信源:https://sakana.ai/smart-cellular-bricks/
理想披露Mach-Mind-4-Flash训练方法:十多个专家合成一个模型

理想汽车发布 Mach-Mind-4-Flash 技术报告。模型此前已经亮相,这次主要补充后训练细节。

团队先分别训练数学、代码、写作、安全、搜索和工具调用等十多个专家模型。随后再用 MOPD(多教师在线策略蒸馏)合并成一个通用模型。每类题目由对应专家指导,减少多项能力在混合训练中互相拖累。

报告也讲清了 Agent 怎么训练。模型不只学习工具名称和调用格式,还会在隔离沙箱中真正读文件、改代码、运行测试和调用工具。操作失败后,它能看到报错和环境变化,再继续修改。工具训练覆盖 190 多个有状态领域和 3500 多个工具接口;编程任务的一条训练轨迹最长可达 300 轮。

这种融合并非完全无损。指令遵循能力基本保住,ClawBench 和 ClawEval 甚至超过单独的 Agent 专家。但 SWE-bench Verified 从专家模型的 73.80 降到 71.10。团队承认,长程编程等高度专门化能力在合并时仍会损失。

报告还披露了如何减少模型「想太多」。HMPO 根据正确答案的中位长度动态设定推理预算,只奖励答对且更短的答案。它将生成长度缩短 19% 至 46%,准确率最多下降 0.7 个百分点。目前这套方法只用于单轮推理,尚未覆盖多轮 Agent 任务。

信源:https://arxiv.org/abs/2607.09375
英伟达真的开始「出卡」,但这次不是显卡

英伟达推出首套《GeForce Trading Cards》集换式卡牌。Series 1 共包含 14 款设计,记录 GeForce 三十多年的显卡、游戏和技术 Demo。

卡牌主角包括 NV1、GeForce 256、GeForce 3、7800 GTX、GTX 1080,以及《赛博朋克 2077》版 RTX 2080 Ti。Bubble、Chameleon 和 Medusa 等经典技术演示也被做成卡牌。

这套卡牌不会公开销售,只能参加「Summer of RTX」线上抽奖,或前往指定活动免费领取。英伟达已在上海 Bilibili World 发放,后续还将出现在 QuakeCon 和 gamescom。

在显卡越来越贵的背景下,玩家对这次「出卡」的评价颇为微妙。PC Gamer 引述网友调侃:「终于有一张我买得起的英伟达卡了。」

信源:https://www.pcgamer.com/hardware/finally-a-card-i-can-afford-nvidia-announces-geforce-themed-trading-cards-which-are-free-but-youll-need-to-travel-or-get-lucky-to-win-some-for-yourself/
😁2