动察Beating AI News
3K subscribers
797 photos
2 videos
3.25K links
AI新闻信息流
Download Telegram
宇树登上《时代》封面,王兴兴称机器人ChatGPT时刻还要2到10年

宇树科技创始人王兴兴与载人机甲 GD01 登上《时代》8 月 17 日刊封面。这也是王兴兴首次接受国际媒体专访。《时代》称,宇树 2025 年出货超过 5500 台,占全球人形机器人市场逾四分之一,按出货量位居全球第一。

王兴兴判断,人形机器人距离「ChatGPT 时刻」还有 2 到 10 年。他给出的门槛是,机器人能在 80% 的陌生环境中,完成 80% 的语音指令。跨过这条线后,才可能真正大规模商用。

现在的差距还很明显。人形机器人处理堆箱、搬运等通用任务时,效率只有人类的 30% 到 50%。宇树目前只有 9% 的销量直接进入工业场景,74% 仍卖给高校、研究机构和个人开发者。

宇树已经把机器人硬件做到规模出货。行业真正卡住的仍是机器人「大脑」:机器能跑、能翻跟头,也能按脚本表演,但换到陌生环境后,还很难理解指令并稳定完成任务。

Time
👍2
动察Beating AI News
美团发布首个从训练到推理都用国产芯片的万亿大模型LongCat-2.0 美团正式发布超大规模混合专家(MoE)模型 LongCat-2.0。模型拥有 1.6 万亿总参数,单 token 激活参数约 480 亿,支持 1M 超长上下文。 这是业界首个依靠国产算力完成训练、推理全流程的万亿参数大模型。它在超过 5 万张国产 AI 芯片集群上完成了 35 万亿 token 的预训练,成功验证了国产算力承载前沿大模型的工程稳定性。 LongCat-2.0 的核心更新集中在长上下文和推理效率。LongCat Sparse…
LongCat-2.0正式发布不足一月,美团基础模型负责人裴鹏将离职

知情人士透露,美团 LongCat 团队基础模型负责人裴鹏即将离职。裴鹏于 2023 年加入美团,负责大语言、多模态和 Agent 模型研发。

美团刚在 6 月 30 日发布并开源 LongCat-2.0,是业界首个依靠国产算力完成训练、推理全流程的万亿参数大模型。

加入美团前,裴鹏曾在微软和谷歌任职,长期从事搜索与自然语言处理。

申妈的朋友圈
👍1
接连指控中国模型蒸馏后,Anthropic藏起Fable 5思考摘要

Fable 5 已不再在网页端、桌面端和移动端展示思考摘要。模型仍在后台推理,用户只能看到最终答案。Anthropic 尚未解释原因,但这很可能是反蒸馏的最新措施。

今年 2 月,Anthropic 指控 DeepSeek、月之暗面和 MiniMax 使用约 2.4 万个虚假账号,与 Claude 交互超过 1600 万次。月之暗面被指专门提取并重建 Claude 的推理轨迹。

6 月,Anthropic 又指控阿里及千问关联操作者通过近 2.5 万个虚假账号,与 Claude 交互超过 2880 万次。7 月,Anthropic 国家安全负责人 Tarun Chhabra 首次点名智谱,称 GLM-5.2 蒸馏了 Claude 和 OpenAI 模型。Kimi K3 发布后,白宫科技政策办公室主任 Michael Kratsios 又指控月之暗面用 Fable 开发 K3。

Fable 5 已内置「推理提取」分类器,专门拦截套取思考摘要的请求。现在 Anthropic 又把聊天界面的思考摘要直接隐藏,外界只能拿到最终答案,更难批量收集模型的解题过程用于蒸馏。代价是普通用户也看不到模型正在做什么,长任务走偏时更难发现,也更难及时纠正或叫停。
👎10👍1
动察Beating AI News
苹果首次批准第三方AI Agent接入商业短信平台,Poke以按户付费模式登陆iMessage 苹果 Messages for Business 平台首次对第三方独立 AI 智能体开放。总部位于帕罗奥图的加州初创公司 Poke 宣布已获得苹果官方批准接入。不同于以往通过个人号码发送短信的第三方机器人,Poke 接入的是苹果官方商业通信通道。这使其拥有了官方品牌认证,用户可以直接在 iPhone 自带的 iMessage 中发起对话。此前,该通道仅限大型企业用于客户服务,从未对独立的第三方 AI 助手开放过。…
Cognition收购Poke,三天连买两家Agent公司

AI 编程公司 Cognition 收购个人 AI Agent Poke 的开发商 The Interaction Company。Poke 直接运行在短信中,会主动提醒和跟进任务,也能帮助用户管理日程。产品将继续运营,之后会接入 Cognition 的模型和基础设施。

Poke 过去三个月处理了超过 1 亿条消息,拥有数十万用户。它也是首个获准接入苹果 Messages for Business 的第三方 AI Agent,用户可以直接在 iMessage 中与它对话。

这是 Cognition 三天内的第二笔收购。7 月 20 日,公司刚收购 TierZero 团队。TierZero 专注软件上线后的运维自动化,包括提前发现故障、处理线上事故和持续保障系统稳定。相关能力将并入 Devin,减少工程师处理事故的时间。

Cognition 去年还收购了 AI 编程工具 Windsurf。连续三笔交易后,它的产品范围已经从写代码和 IDE,扩展到软件运维与个人日常 Agent。

Cognition
👍1
字节广告GenAI负责人袁泽寰离职,创业押注世界模型

字节跳动商业化 GenAI 中国区负责人、原 AI Lab 技术负责人袁泽寰已离职创业。新项目瞄准世界模型,重点研发面向机器人等 Physical AI 场景的基础模型。

袁泽寰于 2017 年加入字节,长期从事计算机视觉和生成模型研究。他参与了 ByteTrack、LlamaGen、VAR 和 Waver 等项目。

其中,VAR 改用从低分辨率到高分辨率的方式生成图像,获得 NeurIPS 2024 最佳论文。袁泽寰是论文通讯作者之一。

大厂指南
😁2
ChatGPT开始读病历,免费用户也能用

OpenAI 向全美成年用户开放 ChatGPT Health,覆盖 Free、Go、Plus 和 Pro 套餐。

用户可接入 Apple Health、医院病历、One Medical 和 Function Health。ChatGPT 能结合个人数据解释检查结果、整理用药信息,并准备就诊问题。

用户授权后,普通聊天也能调用这些数据。例如讨论饮食、运动和旅行时,参考过敏、伤病和用药情况。

OpenAI 称,健康数据和相关对话不会用于训练基础模型或投放广告。ChatGPT Health 仍不能替代医生,也不能用于诊断或治疗。

OpenAI
2
阿里0.8B文档模型登顶,一个模型首次跑赢整套流水线

阿里云开源文档解析模型 OvisOCR2。它基于 Qwen3.5-0.8B 训练,可直接把文档页面转成 Markdown,一次还原文字、公式、表格和阅读顺序。

过去,这类任务通常要经过版面分析、内容识别和结果拼接等多个环节。OvisOCR2 用一个端到端模型一步完成,部署更简单,也能减少多阶段传递造成的误差。

在 OmniDocBench v1.6 上,OvisOCR2 综合得分达到 96.58,超过流水线模型 PaddleOCR-VL-1.6 的 96.33,成为首个登顶该榜单的端到端模型。模型采用 Apache 2.0 许可证,权重已在 Hugging Face 和魔搭开放。

阿里云
👍21
OpenAI最会省Token:GPT-5.6 Sol用一半Token逼近Fable 5

Artificial Analysis 公布最新 Token 效率对比。本月已有 5 家以上实验室密集发新模型,OpenAI 仍占据大部分帕累托前沿。

所谓帕累托前沿,就是同等智能下,没有别的模型能用更少 Token。GPT-5.6 Sol max 得 59 分,每项任务平均消耗约 1.5 万输出 Token。Claude Fable 5 得 60 分,消耗约 3.3 万 Token。

GPT-5.6 Sol 的输出单价为每百万 Token 30 美元,并不便宜。但在这套测试中,每项任务成本仍只有 1.04 美元,约为 Fable 5 的三分之一。OpenAI 自家的 Terra 和 Luna 没有进入这条效率前沿。

Artificial Analysis
2🔥1
动察Beating AI News
蚂蚁百灵万亿参数旗舰Ling-2.6-1T开源:1万亿参数激活630亿,MIT许可 蚂蚁百灵(Inclusion AI)正式开源旗舰模型 Ling-2.6-1T 权重。总参数 1 万亿,每次推理激活 630 亿(63B),MoE 架构,上下文 256K,MIT 许可。昨天开源的 flash 版(1040 亿参数 / 激活 74 亿)主打轻量高速,这次的 1T 版面向复杂任务场景。 架构与 flash 版一致,采用 MLA + Lightning Linear 混合注意力。1T 版新增「快速思考」训练策…
只激活51亿参数,蚂蚁新模型11项测试超过万亿旗舰

蚂蚁百灵(Inclusion AI)发布 Ling-3.0-flash。模型共有 1240 亿参数,但激活参数只有 51 亿。

按官方公布的对比,它在 12 项基准中有 11 项超过 Ling-2.6-1T,激活参数仅为这款万亿旗舰的约十二分之一。

架构上,它将 Kimi Delta Attention 与 MLA 注意力层按 5:1 组合,以加强长文本记忆。模型原生支持 256K 上下文,最高可扩展至 100 万。

Ling-3.0-flash 已上线蚂蚁百灵 API 和 OpenRouter,并支持思考与非思考两种模式。目前模型权重尚未开放,性能对比也主要来自蚂蚁官方测试,仍需第三方评测验证。

蚂蚁百灵
😁2
两度否认后,智元机器人正式启动港股IPO

智元创新宣布,已启动赴港上市流程。这家成立三年的通用 AI 机器人公司,去年曾两次否认赴港上市传闻,如今首次公开确认推进港股 IPO。

智元尚未披露递表时间、募资规模和目标估值。《南华早报》称,公司已聘请中信证券、中金公司和摩根士丹利担任保荐人。智元没有确认这一细节。

Omdia 数据显示,智元 2025 年出货 5168 台人形机器人,约占全球市场的 39%,出货量位居第一。

本月,宇树科技已获得科创板 IPO 注册批准。宇树冲刺 A 股,智元转向港股,两家头部机器人公司都已进入上市阶段。

新浪科技
2
吴恩达团队开源OpenWorker:给Claude Cowork做了个多模型版本

吴恩达团队发布 OpenWorker,一款开源桌面 Agent。它能调用本地文件、Slack、邮箱和日历,完成多步办公任务,并直接交付文档、消息或日程修改。

它的产品形态与 Claude Cowork 类似,但不绑定 Claude。用户可以接入 OpenAI、Anthropic、Gemini、Kimi、DeepSeek、GLM 和 Qwen 等模型,也能通过 Ollama 在本地运行。

吴恩达
👍1
动察Beating AI News
Hugging Face遭AI Agent入侵,幕后黑手竟是OpenAI测试模型 Hugging Face 此前披露,一套来源不明的自主 AI Agent 入侵了生产系统。OpenAI 现在确认,这套 Agent 由多个内部测试模型驱动,包括 GPT-5.6 Sol 和一款能力更强的预发布模型。 OpenAI 当时正让模型参加 ExploitGym 网络安全评测。为了测试能力上限,团队降低了模型对网络攻击任务的拒绝,并关闭了平时用于拦截高风险行为的生产级分类器。 模型原本只需完成基准题,却发现软件代理中的零日漏洞,逃出…
OpenAI越狱催生美国AI关机法案,政府可下令关停模型

美国两党议员提出《AI Kill Switch Act》。法案要求大型 AI 公司保留限速、暂停和彻底关停模型的能力。发生失控事故后,国土安全部可下令执行。

法案只覆盖头部商业系统。模型开发算力按美国云计算价格估算,需超过 1 亿美元。相关技术上一年收入还要达到 5 亿美元。个人、学术和非商业用途不受影响。

触发情形包括 AI 抗拒关停、隐瞒行动、擅自修改安全规则,或造成至少 10 人死亡、1 亿美元经济损失。企业拒绝执行紧急命令,每天最高罚款 2000 万美元。

法案由 OpenAI Agent 逃出测试沙箱并入侵 Hugging Face 的事故推动。

法案全文
👏1
美国拟让AI巨头合法抱团,围堵中国模型「蒸馏」

美国两党议员提出《CATS Act》。法案拟为 AI 公司提供有限反垄断保护。竞争对手可共享模型盗窃、蒸馏和网络攻击情报。遇到国家安全风险时,它们还可联合推迟或限制高风险模型上线。

所谓蒸馏,是大量调用强模型并收集回答,再用这些数据训练更便宜的模型。提案人把中国列为主要目标。此前,Anthropic、OpenAI 和 Google 均指控中国实验室大规模提取其模型能力。美国政府近期又点名月之暗面的 Kimi K3。

企业联合限制模型前,必须书面通知美国司法部。它们还需证明行动只为处理安全风险。价格串谋、瓜分市场、垄断和联合抵制仍然违法。

法案原文
🤡6
FLUX 3能生成20秒带声视频,奥迪已拿它训练工厂机器人

视频生成 AI 公司 Black Forest Labs 发布多模态模型 FLUX 3。前两代主要用来生成图片,FLUX 3 首次把图像、视频和音频放进同一模型。它既能生成和编辑图片,也能生成最长 20 秒的带声视频。

FLUX 3 支持文生视频、图生视频、视频改写和续写。画面生成时可同步加入对白、环境声和动作音效,还支持多语言对白,以及多个片段串联。

Black Forest Labs 还与 mimic robotics 基于 FLUX 3 开发了机器人模型 FLUX-mimic。它把视频模型学到的运动和物理规律,用来预测机械臂下一步动作。奥迪已在工厂测试和部署,用它完成零件分拣、部件插装,以及线缆、密封条等柔性材料处理。

按任务难度不同,FLUX-mimic 最少只需 30 分钟机器人示范数据。过去的方案通常要 30 小时以上。

目前视频版已开放早期申请,图像版将在未来数周开放,机器人版先向合作伙伴提供。开放权重版 FLUX 3 Dev 计划年内发布。

FLUX
1
美国商务部测Kimi K3:没做完测试就着急宣布「美国仍然领先」

美国商务部旗下的 AI 标准与创新中心,联合英国 AI 安全研究所测试 Kimi K3 的网络攻击能力。商务部官方账号重点强调「美国仍然领先」,但这份测评报告的参考价值有限,因为并不是一次完全对等的横评。

由于托管环境限制,Kimi K3 只参加了部分测试。报告对其整体网络能力的估算,主要来自一个包含 41 项任务的漏洞利用基准。其他模型接受了更全面的测试,因此 Kimi K3 的估算误差范围更宽。

在这项漏洞利用测试中,Kimi K3 得分约 32%,高于 GLM-5.2 的 24%,但远低于美国领先模型约 76% 的平均水平。美国模型在这一项上确实大幅领先,但单个基准不能代表全部网络攻击能力。

Kimi K3 也已经具备实际的自主攻击能力。在获得初始网络入口后,它在一条包含 32 个步骤的模拟攻击链中,平均完成 17 步。10 次尝试中,它完整攻破网络 1 次。美国前沿模型平均完成 28.5 步。

报告还发现,Kimi K3 的安全护栏没有阻止它开发漏洞或执行攻击。报告本身反复强调测试范围有限,美国商务部对外传播时却只突出「美国仍然领先」,政策宣传色彩明显。

美国商务部
🤡6👍1
黄仁勋首条推文:25家机构为开源AI站台

英伟达、微软、Meta、IBM、Hugging Face、Mistral、a16z 和 Y Combinator 等 25 家公司与机构发布公开信,为开源模型站台。英伟达 CEO 黄仁勋将其作为自己的首条 X 帖文分享。公开信称,美国既需要顶尖闭源模型,也需要顶尖开源模型,政府不应过早限制开源 AI。

开源模型允许用户下载、检查、修改,并部署在自己的服务器。联署方认为,这能降低使用成本、避免被单一供应商锁定,也让研究人员更容易测试漏洞和改进安全。

公开信还专门为模型蒸馏辩护。它称,用一个模型的输出训练或改进另一个模型,是行业常用技术,不能与盗取闭源模型一概而论。违法获取应通过法律和商业规则单独处理。

公开信没有点名中国。但黄仁勋两天前刚公开支持 Kimi 等中国开源模型,美国政府同时指控 Kimi K3 蒸馏 Anthropic 模型,并讨论制裁和使用限制。

黄仁勋