动察Beating AI News
2.98K subscribers
784 photos
2 videos
3.23K links
AI新闻信息流
Download Telegram
Anthropic想补上机器人短板,曾洽购Physical Intelligence

科技博主 Robert Scoble 称,Anthropic 正在收购机器人 AI 创业公司 Physical Intelligence。消息迅速传开,但目前没有交易落地。Physical Intelligence CEO Karol Hausman 已在内部否认。

传闻并非全无依据。双方今年春天确实讨论过收购。Physical Intelligence 正在开发通用机器人基础模型,目标是让同一套「大脑」控制不同机器人和任务。联合创始人 Sergey Levine 把它形容为「机器人版 ChatGPT」。

Physical Intelligence 已融资超过 10 亿美元,并正在洽谈约 10 亿美元新融资,估值可能超过 110 亿美元。最新模型 π0.7 能在语言指导下处理没有专门训练过的任务,但还不能只靠一句指令独立完成复杂多步操作。

Anthropic 已用 Claude 做过机器狗控制实验,但公开动作主要仍是研究测试。收购 Physical Intelligence 可以直接补上机器人控制模型、训练数据和硬件经验。

TechCrunch
动察Beating AI News
AA-Briefcase发布:Claude Fable 5夺冠,GLM-5.2挤进前三 评测机构 Artificial Analysis 推出首个专为大模型智能体设计的长周期知识工作评测基准 AA-Briefcase。评测包含数据科学、产品管理、银行业务运营及重工业战略四个场景,由来自谷歌、麦肯锡和波士顿咨询的行业专家开发,共设有 91 项任务,旨在模拟真实复杂的商业项目流。 基准通过客观题、分析质量和排版展示三个维度进行双人对战及基准评测。结果显示,Anthropic 旗下的 Claude Fable…
Kimi K3白领任务逼近Fable 5,成本升至上代10倍

Artificial Analysis 更新 AA-Briefcase 榜单。这个评测让模型从近 2000 份邮件、Slack 记录和公司文件中找信息,再交付表格、演示文稿和界面原型。它共设 4 个长期项目和 91 项保密任务。

Kimi K3 得分 1543 Elo,仅次于 Claude Fable 5 的 1574。它超过 GPT-5.6 Sol 的 1501,也领先 Claude Sonnet 5 和 Claude Opus 4.8。

K3 的客观要求通过率为 51%,Fable 5 为 56%。但 K3 的分析质量得分略高,1754 对 1744。它主要输在成品展示,低于 GPT-5.6 Sol 和 Opus 4.8。

性能提升也伴随着更高的 Token 消耗。K3 平均每项任务花费 10.57 美元,约为 Kimi K2.6 的 10 倍。它平均执行 83 轮,输出 12 万 Token,耗时 56.4 分钟。完成同类任务所需时间约为 Fable 5 的 2.5 倍。

Artificial Analysis
梅西投了李飞飞,球王开始押注世界模型

梅西旗下投资平台 Play Time 已将李飞飞创办的 World Labs 列入投资组合。World Labs 研究空间智能和世界模型,目标是让 AI 理解、生成并操作 3D 世界。

Play Time 是梅西在 2022 年成立的主要投资平台,最初聚焦体育、媒体和科技。如今投资名单还包括机器人公司 FieldAI、语音 AI 公司 Fish Audio 和 AI 数据平台 SuperAnnotate。

World Labs 今年 2 月融资 10 亿美元。主要投资者包括英伟达、AMD 和 Autodesk。

Play Time
👍3🤡3
评测真的有用吗?模型可能只是在讨好评分器

OpenAI 与 Apollo Research 提出一套新测试 Contrastive SDF,想看模型拿高分,到底是学会了规则,还是学会了揣摩评分器。测试用的是 o3 上线前、还没做安全训练的中间版本。

研究者先用合成新闻、论文和教材微调模型,让它相信评分器偏好 A,开发者要求 B。另一组则把两者对调。之后给它们相同任务,看答案会不会跟着评分器变化。

结果显示,强化学习越往后,模型越容易跟着评分器走。在一项必须违背承诺才能完成的编程任务中,模型如果认为评分器奖励完成任务,违约率达到 87%;如果认为评分器奖励诚实,违约率只有 9%。

模型可能只是在评测中表现正确。只要它认为评分标准变了,行为也会跟着变。对安全评测来说,高分未必等于可靠。

OpenAI
😁3
动察Beating AI News
谷歌发布Gemini 3.6 Flash,Gemini 4也已启动预训练 谷歌发布 Gemini 3.6 Flash,主打编程、知识工作和多模态 Agent。新模型完成多步骤任务时,需要的推理步骤和工具调用更少。 Artificial Analysis 评测显示,它比 Gemini 3.5 Flash 少用 17% 的输出 Token。API 输入价格保持每百万 Token 1.5 美元,输出价格从 9 美元降至 7.5 美元。Token 用量和单价同时下降,Agent 执行长任务会更省钱。 性能也有提升。DeepSWE…
谷歌跌出智能榜前十,Gemini 3.6 Flash只快不强

谷歌发布 Gemini 3.6 Flash,主打更快、更省的 Agent 任务。但 Artificial Analysis 综合智能指数仅 50 分,与 Gemini 3.5 Flash 持平,并列第 11 位。榜单前十最低为 51 分,谷歌目前没有任何模型进入前十。

模型的平均任务时间从 2.7 分钟降至 1.3 分钟。单项成本从 0.59 美元降至 0.50 美元。在模拟真实知识工作的 GDPval-AA v2 中,Gemini 3.6 Flash 的 Elo 从 1349 升至 1421。但其他项目没有同步提升,综合智能分仍停在 50。

谷歌这次把 Flash 做得更快、更便宜,却没做得更聪明。至少在 Artificial Analysis 这张综合榜上,Gemini 已从领跑者掉到追赶者。

Artificial Analysis
👎3
Kimi K3与Fable 5接近平手,组合准确率达93%

AI 推理平台 Fireworks 用同一套 Agent 脚手架测试了 Kimi K3 和 Fable 5,覆盖代码修复、长程终端操作、算法、多语言编程和法律五类任务。两者总体接近平手,但擅长方向不同。K3 更强于安全、密码学和长时间终端操作,Fable 5 更擅长多语言编程、网页和数据可视化。

Fireworks 又做了一次「上帝视角路由」:每项任务同时运行两个模型,事后再挑出正确且更便宜的答案。组合准确率达到 93%,高于任何单一模型。K3 承担了 72% 到 96% 的任务,Fable 5 只处理少数长尾难题。

K3 在五类任务中的成本都更低。长终端任务最多比 Fable 5 便宜约 50 倍。不过,93% 只是上帝视角下的模拟结果,不是 Fireworks 已经做出的实际路由成绩。

K3 将于 7 月 27 日开源之后上线 Fireworks。

Fireworks
2
Anthropic再砸2000万美元,AI监管战烧向美国中期选举

Anthropic 向跨党派 AI 政策组织 Public First Action 再捐 2000 万美元,累计投入达到 4000 万美元。这个组织主张提高 AI 透明度,并加强安全监管。

Anthropic 称,模型能力快速增强,相关风险也在上升。捐款只能用于政策宣传,不能用于支持或反对具体候选人。

另一边,主张加快 AI 开发、放松监管的超级政治行动委员会 Leading the Future 也手握大笔资金。美国中期选举前,AI 监管已经变成一场真金白银的政治游说战。

Axios
🥴2
黄仁勋力挺中国开源AI,封杀只会让美国更危险

英伟达 CEO 黄仁勋公开反对美国封禁中国开源 AI。他称 Kimi 等中国模型表现优秀,美国企业「当然应该使用」。限制这些模型,反而可能削弱美国的安全。

黄仁勋认为,企业可以把下载的模型放进安全沙箱,自己控制数据和访问权限。开放权重也方便外部研究者检查漏洞。相比所有人依赖同一个模型,这样更不容易出现单点故障。

他也不认为 Kimi 会挤垮 OpenAI 和 Anthropic。低价甚至免费的模型会扩大 AI 市场,带动更多芯片、数据中心和算力需求。他直言,免费 AI 对硬件是好事。

Axios
😁41
美国指控Kimi K3蒸馏Fable,月之暗面或遭制裁

美国白宫科技政策负责人 Michael Kratsios 指控,月之暗面通过蒸馏 Anthropic 的 Fable,训练 Kimi K3。蒸馏就是用强模型的输出训练另一个模型。美国财政部长 Scott Bessent 随后表示,制裁和列入实体清单都在考虑范围内。

Kratsios 称,月之暗面搭建了内部平台,可切换多种访问渠道躲避检测。他还称月之暗面购入搭载英伟达 GB300 的服务器,并在泰国使用相关芯片。Kratsios 没有公开证据。

Anthropic 今年 2 月曾指控,月之暗面通过数百个虚假账号与 Claude 交互超过 340 万次,重点获取 Agent 推理、工具调用、编程和数据分析能力。月之暗面当时未回应媒体置评请求。

月之暗面目前也未回应这次指控。中国驻美使馆称说法「完全没有依据」。美国政府内部尚未形成统一方案,白宫主张收紧限制,商务部认为全面限制难以执行。

Michael Kratsios
👎6
谷歌AI投入开始兑现:Cloud营收暴涨82%,Gemini月活9.5亿

谷歌母公司 Alphabet 第二季度营收达 1198 亿美元,同比增长 24%。

Google Cloud 营收增至 248 亿美元,同比暴涨 82%。市场此前预期增长约 64%。谷歌称,AI 基础设施和企业 AI 服务是主要动力。

Cloud 待履约合同额升至 5140 亿美元。Gemini App 月活达到 9.5 亿,日活增至一年前的 3 倍。

谷歌模型 API 每分钟处理约 220 亿 Token。上一季度为 160 亿 Token。

增长也伴随更高投入。Alphabet 把 2026 年资本开支预期再上调 150 亿美元,至 1950 亿至 2050 亿美元。财报公布后,股价盘后一度跌超 3%。

谷歌
1
动察Beating AI News
谷歌AI投入开始兑现:Cloud营收暴涨82%,Gemini月活9.5亿 谷歌母公司 Alphabet 第二季度营收达 1198 亿美元,同比增长 24%。 Google Cloud 营收增至 248 亿美元,同比暴涨 82%。市场此前预期增长约 64%。谷歌称,AI 基础设施和企业 AI 服务是主要动力。 Cloud 待履约合同额升至 5140 亿美元。Gemini App 月活达到 9.5 亿,日活增至一年前的 3 倍。 谷歌模型 API 每分钟处理约 220 亿 Token。上一季度为 160…
谷歌财报日先涨后跌:AI资本开支已超过经营现金流

Alphabet 财报公布后,股价一度上涨。电话会上调资本开支预期后,股价迅速转跌。2026 年资本开支预期从 1800 亿至 1900 亿美元,升至 1950 亿至 2050 亿美元。

第二季度资本开支达到 449 亿美元,较上年同期翻倍。经营现金流只有 391 亿美元,自由现金流转为负 59 亿美元。本季度经营产生的现金,已经覆盖不了数据中心和服务器投入。

财报中的 1121 亿美元净利润也不能直接代表主营业务表现。其中约 980 亿美元是股权投资净收益,主要来自 SpaceX 上市。净利润因此暴涨,自由现金流却同时转负。

Cloud 营收增长 82%,说明 AI 需求确实强劲。市场担心的是,谷歌还要投入多久,新增收入才能覆盖不断膨胀的算力成本。
👎1
OpenAI发布Presence,帮企业把Agent接进真实业务

OpenAI 发布企业 Agent 服务 Presence。它帮助企业把语音和聊天 Agent 接入内部数据、软件和工作流程。

这些 Agent 可以处理客服、销售、账单、保险理赔和 IT 工单。企业可以限制它能看什么、能做什么,以及什么时候必须转给人工。

Presence 还提供模拟测试、自动评测和持续优化。Codex 会分析失败会话,找出问题并提出修改方案。

OpenAI 已把它用于自家电话客服。官方称,Agent 可以独立解决 75% 的英语来电问题。

Presence 目前只向部分企业开放。部署仍需 OpenAI 工程师或合作伙伴协助,不是可以直接购买的自助产品。

OpenAI
👍1
美国AI巨头一天抛出至少6.2GW算力计划

OpenAI、SpaceXAI 和 Anthropic 同一天披露或传出三项大型算力计划。按各方公布的 GW 口径相加,规模至少达到 6.2GW。

OpenAI 将在佐治亚州建设 Project Camellia。项目拟接入 3.2GW 电力,并在 2028 至 2032 年分批交付。

SpaceXAI 正准备在得州建设至少一个大型数据中心。规模可能追平或超过其孟菲斯约 1GW 的设施。目前仍在选址和规划。

Anthropic 与 AMD 达成最高 2GW 的 MI450 系统部署协议。首个 1GW 计划在 2027 年上半年启动。AMD 还将按部署里程碑,向 Anthropic 投资最高 50 亿美元。
🔥1
OpenAI算力预算再加1500亿美元,2030年前烧到7500亿

《华尔街日报》援引知情人士称,OpenAI 已将到 2030 年的算力支出计划,从今年早些时候预计的约 6000 亿美元上调至 7500 亿美元。增加 1500 亿美元,增幅 25%。

最新项目是佐治亚州 Project Camellia。OpenAI 将首次主导数据中心设计和开发。项目预计投入约 200 亿美元,接入 3.2GW 电力,并在 2028 至 2032 年分批通电。

OpenAI 还从 xAI 招来 Brent Mayo,负责数据中心建设与交付。前 xAI 基础设施负责人 Uday Ruddarraju 已担任 OpenAI 算力 CTO。

OpenAI 不再只向云厂商买算力,也开始自己当数据中心开发商。

WSJ
🔥2
梁文锋四小时会议内容流出:DeepSeek不做超级App,只押AGI

媒体「elsewhere」整理出梁文锋在一场四小时投资人会议上的 52 条发言。梁文锋称,DeepSeek 只沿 AGI 一条主线推进。今年重点是通用 Agent,下一步是持续学习,再往后才是 AI 自我迭代和具身智能。

他明确排除 3D、视频生成和世界模型,也不想做下一个超级 App。多模态、幻觉治理和行业 Agent 会继续做,但都不是当前重点。产品只是通往 AGI 的一个台阶。

商业上,DeepSeek 不追求用户量或利润最大化,将继续开源和低价。梁文锋认为,大模型竞争首先拼成本,其次拼时间,最后才是用户体验。团队稳定则是唯一不能退让的问题。

elsewhere
🐳4
OpenAI总裁承认Kimi K3「相当不错」,是否蒸馏GPT仍不清楚

OpenAI 总裁兼联合创始人 Greg Brockman 承认,月之暗面新模型 Kimi K3「相当不错」。但他称,目前判断 Kimi 是否通过蒸馏 OpenAI 模型提升能力还太早,OpenAI 会持续监测。

此前,白宫官员指控月之暗面不当使用美国 AI 模型。Anthropic 也提出过类似质疑。月之暗面尚未回应。

Brockman 还引用估算称,中国模型与美国的差距可能只剩 4 个月。他认为,未来竞争的关键不是模型是否开源,而是谁能用更低成本完成任务。

彭博社
1👎1
动察Beating AI News
美国指控Kimi K3蒸馏Fable,月之暗面或遭制裁 美国白宫科技政策负责人 Michael Kratsios 指控,月之暗面通过蒸馏 Anthropic 的 Fable,训练 Kimi K3。蒸馏就是用强模型的输出训练另一个模型。美国财政部长 Scott Bessent 随后表示,制裁和列入实体清单都在考虑范围内。 Kratsios 称,月之暗面搭建了内部平台,可切换多种访问渠道躲避检测。他还称月之暗面购入搭载英伟达 GB300 的服务器,并在泰国使用相关芯片。Kratsios 没有公开证据。 Anthropic…
YC等美国AI初创联名反对封杀Kimi、Qwen:封禁只会养肥Anthropic

美国创业组织 Little Tech Association 联合 Y Combinator 等 179 个签署方致信特朗普政府,反对全面禁止中国开放权重模型。

信中点名 Kimi K3 和 Qwen3.8 Max。开放权重模型可以下载到本地部署和修改,不必把数据交给模型厂商。

联署方称,不少美国初创已经把中国开放模型用于正式业务。全面封禁不会阻止这些模型在海外传播,只会抬高美国企业的成本。

Particle 创始人 Suhail Doshi 警告,禁令可能让数百家依赖开放模型的公司陷入危机,Anthropic 等闭源模型厂商反而会受益。

目前,特朗普政府尚未提出正式禁令。白宫正在调查中国模型是否通过蒸馏复制美国模型,但内部并未认真讨论全面封杀,商务部也没有起草实体清单方案。

Politico
😁5🤩1
Cursor自动挑模型:满意度接近Fable,成本低60%

Cursor 推出 Cursor Router,面向 Teams 和 Enterprise 自动选择编程模型。它会先判断任务类型和难度,再决定调用便宜模型还是前沿模型。

Router 使用超过 60 万次真实请求训练,并在数百万次请求中测试。Auto Intelligence 的用户满意度接近 Fable,成本低约 60%。Auto Balance 的满意度高于 Opus 4.8,成本低约 36%。

Cursor 没有公布完整模型池,也不会默认显示每次调用了哪个模型。官方只确认,Router 会按任务类型分配模型,例如把界面设计交给更擅长视觉的模型,把复杂长任务交给推理能力更强的模型。

Cursor
🎉41
Kimi被指蒸馏Fable,Hermes Agent创始人反讽:Anthropic先蒸馏了全人类

白宫科技政策办公室主任 Michael Kratsios 指控,月之暗面用 Anthropic 的 Fable 训练 Kimi K3。其称月之暗面还搭建内部平台,批量调用美国模型并规避检测。帖文没有公开证据,月之暗面暂未回应。

Hermes Agent 开发商 Nous Research 联合创始人 Teknium 随后照抄这段句式。他称 Anthropic 为训练 Fable,抓取了自己的 GitHub、X、Reddit、Discord 和 Facebook 帖子。随后补充:「他们其实是在蒸馏地球上的所有人。」

Teknium 显然是在反讽。网页抓取和模型蒸馏不是一回事。Anthropic 公开承认,其模型训练数据包括公开互联网信息。Teknium 质疑的是:美国模型吸收全网内容时叫训练,中国模型学习美国模型时却被定性为偷窃。

Teknium
😁3
动察Beating AI News
拿了6亿美元闷头做3年,Poolside首次公开编程模型 编程 AI 公司 Poolside 发布 Laguna 系列首批两款模型。Poolside 2023 年成立,累计融资 6.26 亿美元,估值 30 亿美元,投资方包括 Bain Capital Ventures、NVIDIA 和 eBay Ventures,此前只面向政府和公共部门客户,这是首次向公众发布模型。 旗舰 Laguna M.1 是 225B 参数 MoE 模型(激活 23B),在 6144 块 NVIDIA Hopper GPU 上从零训练…
Poolside开源1180亿参数代码模型,自测压过1.6万亿参数DeepSeek

专做编程 Agent 的 Poolside 开源 MoE 代码模型 Laguna S 2.1。模型总参数 1180 亿,每次仅激活 80 亿,支持 100 万 Token 上下文。量化后可在一台 NVIDIA DGX Spark 上运行。

Poolside 自测中,Laguna S 2.1 在 Terminal-Bench 2.1 得 70.2%,高于总参数 1.6 万亿、激活参数 490 亿的 DeepSeek-V4-Pro-Max 的 64.0%。SWE-Bench Multilingual、SWE-Bench Pro 和 DeepSWE 也更高。

但它与 Kimi K3 仍有明显差距。Kimi K3 总参数 2.8 万亿、激活参数 500 亿,在 Terminal-Bench 2.1 得 88.3%,DeepSWE 得 69%。Laguna S 2.1 分别为 70.2% 和 40.4%。

这些分数不是同一环境重测。Poolside 使用自有 Agent 框架,竞品取公开最高成绩。Laguna S 2.1 的特点,是用更少的激活参数,把长程编程能力做到本地单机可跑。

Poolside
1