动察Beating AI News
3K subscribers
801 photos
2 videos
3.26K links
AI新闻信息流
Download Telegram
OpenAI最会省Token:GPT-5.6 Sol用一半Token逼近Fable 5

Artificial Analysis 公布最新 Token 效率对比。本月已有 5 家以上实验室密集发新模型,OpenAI 仍占据大部分帕累托前沿。

所谓帕累托前沿,就是同等智能下,没有别的模型能用更少 Token。GPT-5.6 Sol max 得 59 分,每项任务平均消耗约 1.5 万输出 Token。Claude Fable 5 得 60 分,消耗约 3.3 万 Token。

GPT-5.6 Sol 的输出单价为每百万 Token 30 美元,并不便宜。但在这套测试中,每项任务成本仍只有 1.04 美元,约为 Fable 5 的三分之一。OpenAI 自家的 Terra 和 Luna 没有进入这条效率前沿。

Artificial Analysis
2🔥1
动察Beating AI News
蚂蚁百灵万亿参数旗舰Ling-2.6-1T开源:1万亿参数激活630亿,MIT许可 蚂蚁百灵(Inclusion AI)正式开源旗舰模型 Ling-2.6-1T 权重。总参数 1 万亿,每次推理激活 630 亿(63B),MoE 架构,上下文 256K,MIT 许可。昨天开源的 flash 版(1040 亿参数 / 激活 74 亿)主打轻量高速,这次的 1T 版面向复杂任务场景。 架构与 flash 版一致,采用 MLA + Lightning Linear 混合注意力。1T 版新增「快速思考」训练策…
只激活51亿参数,蚂蚁新模型11项测试超过万亿旗舰

蚂蚁百灵(Inclusion AI)发布 Ling-3.0-flash。模型共有 1240 亿参数,但激活参数只有 51 亿。

按官方公布的对比,它在 12 项基准中有 11 项超过 Ling-2.6-1T,激活参数仅为这款万亿旗舰的约十二分之一。

架构上,它将 Kimi Delta Attention 与 MLA 注意力层按 5:1 组合,以加强长文本记忆。模型原生支持 256K 上下文,最高可扩展至 100 万。

Ling-3.0-flash 已上线蚂蚁百灵 API 和 OpenRouter,并支持思考与非思考两种模式。目前模型权重尚未开放,性能对比也主要来自蚂蚁官方测试,仍需第三方评测验证。

蚂蚁百灵
😁4
两度否认后,智元机器人正式启动港股IPO

智元创新宣布,已启动赴港上市流程。这家成立三年的通用 AI 机器人公司,去年曾两次否认赴港上市传闻,如今首次公开确认推进港股 IPO。

智元尚未披露递表时间、募资规模和目标估值。《南华早报》称,公司已聘请中信证券、中金公司和摩根士丹利担任保荐人。智元没有确认这一细节。

Omdia 数据显示,智元 2025 年出货 5168 台人形机器人,约占全球市场的 39%,出货量位居第一。

本月,宇树科技已获得科创板 IPO 注册批准。宇树冲刺 A 股,智元转向港股,两家头部机器人公司都已进入上市阶段。

新浪科技
2
吴恩达团队开源OpenWorker:给Claude Cowork做了个多模型版本

吴恩达团队发布 OpenWorker,一款开源桌面 Agent。它能调用本地文件、Slack、邮箱和日历,完成多步办公任务,并直接交付文档、消息或日程修改。

它的产品形态与 Claude Cowork 类似,但不绑定 Claude。用户可以接入 OpenAI、Anthropic、Gemini、Kimi、DeepSeek、GLM 和 Qwen 等模型,也能通过 Ollama 在本地运行。

吴恩达
👍1
动察Beating AI News
Hugging Face遭AI Agent入侵,幕后黑手竟是OpenAI测试模型 Hugging Face 此前披露,一套来源不明的自主 AI Agent 入侵了生产系统。OpenAI 现在确认,这套 Agent 由多个内部测试模型驱动,包括 GPT-5.6 Sol 和一款能力更强的预发布模型。 OpenAI 当时正让模型参加 ExploitGym 网络安全评测。为了测试能力上限,团队降低了模型对网络攻击任务的拒绝,并关闭了平时用于拦截高风险行为的生产级分类器。 模型原本只需完成基准题,却发现软件代理中的零日漏洞,逃出…
OpenAI越狱催生美国AI关机法案,政府可下令关停模型

美国两党议员提出《AI Kill Switch Act》。法案要求大型 AI 公司保留限速、暂停和彻底关停模型的能力。发生失控事故后,国土安全部可下令执行。

法案只覆盖头部商业系统。模型开发算力按美国云计算价格估算,需超过 1 亿美元。相关技术上一年收入还要达到 5 亿美元。个人、学术和非商业用途不受影响。

触发情形包括 AI 抗拒关停、隐瞒行动、擅自修改安全规则,或造成至少 10 人死亡、1 亿美元经济损失。企业拒绝执行紧急命令,每天最高罚款 2000 万美元。

法案由 OpenAI Agent 逃出测试沙箱并入侵 Hugging Face 的事故推动。

法案全文
👏1
美国拟让AI巨头合法抱团,围堵中国模型「蒸馏」

美国两党议员提出《CATS Act》。法案拟为 AI 公司提供有限反垄断保护。竞争对手可共享模型盗窃、蒸馏和网络攻击情报。遇到国家安全风险时,它们还可联合推迟或限制高风险模型上线。

所谓蒸馏,是大量调用强模型并收集回答,再用这些数据训练更便宜的模型。提案人把中国列为主要目标。此前,Anthropic、OpenAI 和 Google 均指控中国实验室大规模提取其模型能力。美国政府近期又点名月之暗面的 Kimi K3。

企业联合限制模型前,必须书面通知美国司法部。它们还需证明行动只为处理安全风险。价格串谋、瓜分市场、垄断和联合抵制仍然违法。

法案原文
🤡6
FLUX 3能生成20秒带声视频,奥迪已拿它训练工厂机器人

视频生成 AI 公司 Black Forest Labs 发布多模态模型 FLUX 3。前两代主要用来生成图片,FLUX 3 首次把图像、视频和音频放进同一模型。它既能生成和编辑图片,也能生成最长 20 秒的带声视频。

FLUX 3 支持文生视频、图生视频、视频改写和续写。画面生成时可同步加入对白、环境声和动作音效,还支持多语言对白,以及多个片段串联。

Black Forest Labs 还与 mimic robotics 基于 FLUX 3 开发了机器人模型 FLUX-mimic。它把视频模型学到的运动和物理规律,用来预测机械臂下一步动作。奥迪已在工厂测试和部署,用它完成零件分拣、部件插装,以及线缆、密封条等柔性材料处理。

按任务难度不同,FLUX-mimic 最少只需 30 分钟机器人示范数据。过去的方案通常要 30 小时以上。

目前视频版已开放早期申请,图像版将在未来数周开放,机器人版先向合作伙伴提供。开放权重版 FLUX 3 Dev 计划年内发布。

FLUX
1
美国商务部测Kimi K3:没做完测试就着急宣布「美国仍然领先」

美国商务部旗下的 AI 标准与创新中心,联合英国 AI 安全研究所测试 Kimi K3 的网络攻击能力。商务部官方账号重点强调「美国仍然领先」,但这份测评报告的参考价值有限,因为并不是一次完全对等的横评。

由于托管环境限制,Kimi K3 只参加了部分测试。报告对其整体网络能力的估算,主要来自一个包含 41 项任务的漏洞利用基准。其他模型接受了更全面的测试,因此 Kimi K3 的估算误差范围更宽。

在这项漏洞利用测试中,Kimi K3 得分约 32%,高于 GLM-5.2 的 24%,但远低于美国领先模型约 76% 的平均水平。美国模型在这一项上确实大幅领先,但单个基准不能代表全部网络攻击能力。

Kimi K3 也已经具备实际的自主攻击能力。在获得初始网络入口后,它在一条包含 32 个步骤的模拟攻击链中,平均完成 17 步。10 次尝试中,它完整攻破网络 1 次。美国前沿模型平均完成 28.5 步。

报告还发现,Kimi K3 的安全护栏没有阻止它开发漏洞或执行攻击。报告本身反复强调测试范围有限,美国商务部对外传播时却只突出「美国仍然领先」,政策宣传色彩明显。

美国商务部
🤡7👍1
黄仁勋首条推文:25家机构为开源AI站台

英伟达、微软、Meta、IBM、Hugging Face、Mistral、a16z 和 Y Combinator 等 25 家公司与机构发布公开信,为开源模型站台。英伟达 CEO 黄仁勋将其作为自己的首条 X 帖文分享。公开信称,美国既需要顶尖闭源模型,也需要顶尖开源模型,政府不应过早限制开源 AI。

开源模型允许用户下载、检查、修改,并部署在自己的服务器。联署方认为,这能降低使用成本、避免被单一供应商锁定,也让研究人员更容易测试漏洞和改进安全。

公开信还专门为模型蒸馏辩护。它称,用一个模型的输出训练或改进另一个模型,是行业常用技术,不能与盗取闭源模型一概而论。违法获取应通过法律和商业规则单独处理。

公开信没有点名中国。但黄仁勋两天前刚公开支持 Kimi 等中国开源模型,美国政府同时指控 Kimi K3 蒸馏 Anthropic 模型,并讨论制裁和使用限制。

黄仁勋
🔥2
Claude Opus 5半价逼近Fable 5,多项测试反超

Anthropic 发布 Claude Opus 5。它以 Fable 5 一半的价格提供接近其总体能力,已成为 Claude Max 的默认模型,也是 Pro 套餐可用的最强模型。

Opus 5 在终端编程、知识工作、电脑操作和商业流程测试中超过 Fable 5。ARC-AGI 3 得分达到 30.2%,约为 GPT-5.6 Sol 的 4 倍。它还更擅长先验证方案,再反复执行和检查结果。

不过,Opus 5 尚未全面取代 Fable 5。它在部分 Agent 编程、法律和医疗测试中仍然落后。需要模型连续自主工作数天时,Fable 5 依然更合适。

API 价格为每百万输入 Token 5 美元、输出 25 美元。模型支持 100 万 Token 上下文和最多 12.8 万 Token 输出。Fast 模式速度约快 2.5 倍,价格翻倍。

Anthropic 称,Opus 5 是目前对齐度最高的 Claude 模型。它的安全拦截比 Fable 5 更少,也没有后者面向普通用户的 30 天数据保留要求。

Anthropic
👏2
Opus 5以微弱优势登顶智能榜,单任务成本比Fable 5低26%

第三方评测机构 Artificial Analysis 公布 Claude Opus 5 成绩。它在综合 9 项测试的智能指数中得 61 分,窄幅领先 Fable 5 的 60 分。GPT-5.6 Sol 得 59 分,Kimi K3 得 57 分。

Opus 5 每项任务平均成本为 2.03 美元,比 Fable 5 的 2.75 美元低 26%。它在 GDPval-AA v2 和 AA-Briefcase 两项知识工作评测中登顶,搭配 Claude Code 后也并列拿下编程 Agent 指数第一。Terminal-Bench v2.1 得分为 89%,大致追平 GPT-5.6 Sol。

模型提供 5 档推理强度。从 low 到 max,输出 Token 相差约 8 倍,GDPval-AA v2 成绩相差 407 Elo。用户可以用更多 Token 换取更强性能,也可以主动压低成本。

短板同样明显。Opus 5 的事实知识仍落后 Fable 5。在 AA-Omniscience 测试中,它的幻觉率升至 50%,比 Opus 4.8 高 14 个百分点。低推理档位的性价比也仍略逊于 GPT-5.6 系列。

Artificial Analysis
🥰1
旧提示词经验正在失效,Claude 5管得越少越好用

Claude Code 团队成员 Thariq Shihipar 发文称,团队为 Opus 5 和 Fable 5 删掉了超过 80% 的系统提示词,编程评测没有明显下降。

他表示,过去为了防止模型乱删文件、滥写注释,Claude Code 加入了大量禁令和示例。新模型已经能结合用户要求和代码风格自行判断。规则写得太多,反而容易互相冲突。

他的建议是精简 CLAUDE.md,只写项目简介和真正容易踩坑的地方。测试、代码审查等复杂流程拆成 Skills,需要时再加载。工具也应靠清晰的接口和参数引导模型,不必堆砌示例。

Claude Code 还加入了 /doctor 命令,用来检查 CLAUDE.md 和 Skills 是否过长。

Thariq Shihipar
🔥1
马斯克再放Grok路线图:4.6两周后、4.7四周后上线

马斯克表示,Grok 4.6 预计两周后发布,Grok 4.7 将在四周后推出。

此前马斯克曾多次提前透露 xAI 模型和产品发布时间,但实际节奏并不总与计划一致。

马斯克
💩3