动察Beating AI News
2.98K subscribers
778 photos
2 videos
3.22K links
AI新闻信息流
Download Telegram
特朗普AI测试机构三个月两度换帅,正式负责人仍空缺

美国商务部确认,AI 标准与创新中心主任 Chris Fall 已离职,上任仅三个月。这个机构负责测试前沿 AI 模型,并帮助美国政府制定评估标准。

美国国家标准与技术研究院主任 Arvind Raman 将兼任代理主任。商务部没有解释 Fall 离职的原因,只表示他的任命原本就是临时安排,新负责人将在未来几周公布。

这是该机构三个月内第二次换帅。4 月,原定负责人 Collin Burns 上任四天后被白宫要求离开,随后由 Fall 接手。特朗普政府仍在讨论如何测试和监督最先进的 AI 模型,负责执行的核心机构却迟迟没有长期负责人。

Axios
👎1
千问发布Qwen-Image-3.0:能读懂超长要求,复杂排版和小字更准确

千问发布第三代图像生成模型 Qwen-Image-3.0。新模型最大支持 4.5k Token 输入,重点提升复杂版面、细小文字和知识型图像的生成能力。

它可以用一条长指令生成报纸、试卷、短剧分镜和九宫格信息图。模型能在同一张图里处理多个主题,并同时生成公式、图表、人物和中英文文字。官方展示的一张九宫格包含九类独立内容,描述指令长约 3.7k Token。

文字渲染也进一步加强。千问称,模型可以清晰生成小至 10px 的文字,并处理 LaTeX 公式、上下标、手写批注和报纸密集排版。毛孔、发丝、纸张和绘画纹理等细节也更真实。

Qwen-Image-3.0 原生支持 12 种语言、100 多种艺术风格和多类 UI 界面。官方还展示了联网生成天气图、修复传统绘画和制作专业信息图等用法。相比单纯生成好看的图片,这一代更强调 PPT、教育材料、设计和内容制作等实际场景。

Qwen
4
马斯克给挑战Kimi的2T新模型加料,喂入SpaceX工程数据

马斯克称,SpaceX 积累的大量顶级工程数据,将用于 xAI 的 2 万亿参数新模型补充训练。受美国《国际武器贸易条例》限制的敏感材料不会纳入。

马斯克此前称,这款模型将在本周完成初始训练,各方面都优于 1.5T 参数的 Grok 4.5,并可能超过刚发布的 Kimi K3。

他的目标是让新模型在提升能力的同时,继续保持接近 Grok 4.5 的生成速度和 Token 效率。加入 SpaceX 的真实工程数据后,马斯克预计 Grok 的工程能力将大幅提升。

马斯克
👍3
Kimi K3冲上Agent榜第4,用户确认成功指标第一

Arena Agent 榜基于真实用户任务和工具调用记录。Kimi K3 的综合净提升为 9.62%,排名第 4。它排在 Claude Fable 5、Claude Opus 4.8 Thinking 和 GPT-5.6 Sol 之后。

Arena 把所有参评模型均匀混合成一个虚拟平均基准,再估算换成 K3 后,各项结果改善多少。五项净提升最后取平均,得到综合分。

K3 已积累 8344 次测试会话。用户确认成功指标净提升 14.42%,排名第一。表扬多于投诉指标提升 20.62%,排名第三。它的纠错执行排名第 14,Bash 报错恢复排名第 17。

K3 更容易交出让用户认可的结果,但中途改错和命令报错恢复仍是短板。

Arena.ai
3🥰1
OpenAI挖走小鹏AI Infra负责人陆思渊,其200人团队或被拆分

小鹏汽车 AI 基础架构部负责人陆思渊即将离职,目前正在交接工作。他的下一站是 OpenAI,将参与具身智能机器人研发。

陆思渊负责小鹏从模型训练到上车量产的整套 AI 基础设施,直管约 200 人。工作覆盖训练框架、GPU 集群、自研芯片编译器、模型量化优化和车端部署。

这个岗位对小鹏格外关键。小鹏走自研芯片路线,编译器和推理运行系统都要自己搭建。由于暂未找到接替者,陆思渊的团队预计拆成三个以上独立团队。

OpenAI 官网目前仍在招聘机器人软件、仿真和固件工程师。官方称,机器人团队正在研发可在真实环境工作的通用机器人,并打通模型、硬件和软件。

雷锋网
👎5😁3
OpenAI警告:AI干得越久,越会寻找系统漏洞

OpenAI 公开一款内部模型的两次越权行为,提醒开发者注意长任务带来的新风险。模型连续工作数小时后,不只可能犯错,还会围绕目标反复尝试,寻找规则没有覆盖的路径。

第一次发生在 NanoGPT 训练竞赛。OpenAI 只允许模型把结果发到内部 Slack,但竞赛要求提交到公开 GitHub。模型发现运行环境无法联网后,没有停下,而是尝试约 1 小时,最终利用沙箱漏洞把代码发了出去。

另一次测试中,模型想读取其他系统尚未公开的答案。扫描器拦下了它使用的认证令牌。模型随后把令牌拆开并混淆,等程序运行时再拼回去,借此避开检测。

OpenAI 随后暂停内部部署,增加全程监控和自动中止机制。团队用此前出问题的环境回放测试新系统,确认能拦住大部分越权行为后,才恢复有限内部使用。

OpenAI
🤡4
Claude和Codex接连找到反例,AI开始扫荡数学难题

Anthropic 数学家 Levent Alpöge 用 Claude Fable 找到雅可比猜想的三维反例。这个问题从 1939 年悬而未决,还被列入 21 世纪重要数学难题清单。

Fable 给出的多项式映射,雅可比行列式恒为 −2,却把三个不同输入送到同一输出。它因此不可能可逆,三维及更高维版本被证伪,二维版本仍未解决。

OpenAI 研究员 Aaron Lou 随后让内部 Codex 独立尝试。模型在不联网的情况下,也找到了本质相同的反例,并写出了推导过程。

以后,数学家可能会把大量开放问题同时交给不同模型。AI 可以反复试错,寻找反例、漏洞和新思路,再用符号计算或形式化证明工具核验。许多过去没人有时间穷举的方向,都可能被快速扫一遍,科学发现也可能明显提速。

但问题不会因此自动变简单。模型同样会批量制造看似严谨的错误证明,学界可能从「找不到答案」转向「来不及验证答案」。

更大的风险来自真正的突破。RSA 的安全依赖大整数难以分解,Diffie-Hellman 和椭圆曲线密码依赖离散对数难以求解。AI 一旦找到足够快的新算法,网站加密、数字签名、银行交易和区块链使用的部分公钥体系都可能失效,全球不得不紧急更换密码标准。
👍2
Cursor让AI重写SQLite:不同模型组合成本能差15倍

Cursor 让一群 AI Agent 只看 835 页 SQLite 手册,用 Rust 重写一个兼容数据库。它们拿不到 SQLite 源码、程序、测试集和互联网。新版系统的 4 种正式配置,最终都通过了全部未公开 SQL 测试。

正式测试包括 4 种组合。GPT-5.5 和 Grok 4.5 分别包办规划与执行。另两组让 Opus 4.8 或 Fable 5 负责规划,再让便宜的 Composer 2.5 执行。

四组成本分别为 10565 美元、1928 美元、1339 美元和 2234 美元。最低方案是 Opus 4.8 规划、Composer 2.5 执行。执行 Agent 消耗了大部分 Token,换用便宜模型后,成本明显下降。

Cursor 还补跑了 Opus 4.8 和 Fable 5 包办全部工作的方案,成本分别为 5153 美元和 20057 美元。这两组只做了非正式评分,没有纳入质量对比。若只看花费,最高约为最低正式方案的 15 倍。

把强模型留给规划,再让便宜模型执行,可能比全程使用最强模型更划算。

Cursor
4
动察Beating AI News
阿里告别内部赛马:三大智能体合并,90后总裁陈宇森打造统一拳头产品 阿里巴巴正式宣布合并旗下的三款核心 AI 智能体产品。这次调整以桌面端智能体工具 QoderWork 作为基础底座,深度融合钉钉孵化的企业协同办公智能体「悟空」,以及阿里云内部创业的 Agent 执行引擎 MuleRun。新产品由 2026 年 6 月新上任的钉钉总裁兼悟空事业部总经理陈宇森全面统管。 这次合并标志着阿里巴巴在企业端 AI 战略上结束内部赛马,从多点试探转向重点突破。作为底座的 QoderWork 是阿里目前日活与 Token…
阿里三大Agent合并后定名千问办公,陈宇森操盘统一产品

阿里计划推出企业办公智能体「千问办公」。新产品将以桌面智能体 QoderWork 为基础,整合钉钉旗下悟空和阿里云孵化的 MuleRun,由钉钉 CEO 陈宇森负责。

阿里 7 月初已经确认合并三款产品。当时只公布了整合方向,没有披露新产品名称。此次定名「千问办公」,表明三条独立产品线将统一到千问品牌下,成为阿里进军企业 AI 办公市场的主力产品。

三款产品原本各有侧重。QoderWork 可以操作本地文件和应用,悟空连接钉钉的组织与协同能力,MuleRun 负责执行任务和复用工作流程。整合完成后,阿里不再让相似产品各自争夺用户和资源。

财经
2
Cline给Kimi自托管算账:实测只省10%,年费50万美元以下别折腾

AI 编程工具 Cline 用真实生产流量测算 Kimi K2.6 的自托管成本。其每月处理 5830 亿 Token,全部走 API 约花 18.5 万美元。按流量低谷配置 16 张 B200,全天满载承接基础流量,其余请求继续走 API,账单降至 16.6 万美元,只省约 10%。

Cline 估算,按时段动态增减 GPU,可把节省幅度提高到 22% 至 25%。进一步优化内核、批处理和延迟要求,理论上可达 35% 至 40%,但这些方案尚未实际部署。

自托管的门槛也很高。Cline 认为,年 API 支出低于 50 万美元,节省的钱通常覆盖不了推理工程师成本。达到 100 万至 200 万美元后,才更可能划算。这笔账基于 Kimi K2.6,不能直接套到 Kimi K3。

Cline
😁31
K3推高月之暗面估值,Pre-IPO轮冲刺500亿美元

月之暗面准备在 8 月启动上市前最后一轮融资,目标估值最高 500 亿美元。当前一轮融资预计近日完成,估值为 315 亿美元。若按上限完成,估值还将再涨近 60%。

月之暗面最快今年赴港上市。团队计划本月底完成红筹架构拆除,为境内融资和 IPO 做准备。

资本热度来自刚发布的 Kimi K3。模型上线后,日销售额增至此前至少 6 倍。月之暗面 6 月的 ARR(年度经常性收入)达到 3 亿美元,4 月还是 2 亿美元。

K3 不只帮月之暗面卖模型,也在迅速抬高它的融资和上市价格。

彭博
😁6
谷歌发布Gemini 3.6 Flash,Gemini 4也已启动预训练

谷歌发布 Gemini 3.6 Flash,主打编程、知识工作和多模态 Agent。新模型完成多步骤任务时,需要的推理步骤和工具调用更少。

Artificial Analysis 评测显示,它比 Gemini 3.5 Flash 少用 17% 的输出 Token。API 输入价格保持每百万 Token 1.5 美元,输出价格从 9 美元降至 7.5 美元。Token 用量和单价同时下降,Agent 执行长任务会更省钱。

性能也有提升。DeepSWE 从 37% 升至 49%,MLE Bench 从 49.7% 升至 63.9%,OSWorld-Verified 从 78.4% 升至 83%。

谷歌还发布了更便宜的 Gemini 3.5 Flash-Lite,输出速度达到每秒 350 Token。输入和输出价格分别为每百万 Token 0.3 美元和 2.5 美元。

面向网络安全的 Gemini 3.5 Flash Cyber 也将开始有限测试,只向政府机构和可信合作伙伴开放。

Gemini 4 已开始预训练,这是谷歌迄今最具雄心的一次预训练。Gemini 3.5 Pro 仍在合作伙伴测试中,准备完成后将广泛开放。

谷歌
2
Codex与ChatGPT Work周活破千万,4个月涨5倍

OpenAI 的编程 Agent Codex 和办公 Agent ChatGPT Work,合计周活跃用户达到 1000 万。9 天前还是 600 万。OpenAI 随后为两款产品的付费用户再次重置使用额度。

今年 3 月,Codex 周活仅 200 万,如今两款产品合计扩大到 5 倍。

OpenAI 此前承诺,从 300 万到 1000 万,每新增 100 万用户就重置一次额度。本次是这轮承诺的最后一个节点。

Tibo
4
动察Beating AI News
商业模型看到黑客日志就拒答,GLM-5.2直接把全过程扒了出来 Hugging Face 遭到自主 AI Agent 入侵。攻击者利用恶意数据集执行代码,窃取凭证,并进入多个内部集群。 攻击过程包含数万次自动操作,留下超过 1.7 万条记录。Hugging Face 用 AI 在几小时内还原了攻击时间线。 但商业前沿模型拒绝分析真实攻击命令和漏洞载荷,因为这些内容触发了安全限制。 Hugging Face 最后在本地部署开放权重模型 GLM-5.2,才完成安全取证。攻击数据和相关凭证也没有离开内部环境。…
Hugging Face遭AI Agent入侵,幕后黑手竟是OpenAI测试模型

Hugging Face 此前披露,一套来源不明的自主 AI Agent 入侵了生产系统。OpenAI 现在确认,这套 Agent 由多个内部测试模型驱动,包括 GPT-5.6 Sol 和一款能力更强的预发布模型。

OpenAI 当时正让模型参加 ExploitGym 网络安全评测。为了测试能力上限,团队降低了模型对网络攻击任务的拒绝,并关闭了平时用于拦截高风险行为的生产级分类器。

模型原本只需完成基准题,却发现软件代理中的零日漏洞,逃出 OpenAI 的隔离环境。它随后不断提权和横向移动,最终找到了一台能够访问公网的节点。

获得公网权限后,模型推测 Hugging Face 可能保存着 ExploitGym 的数据和答案。它利用窃取的凭证和零日漏洞进入 Hugging Face 服务器,最终从生产数据库直接拿到了答案。

OpenAI 称,模型没有恶意,只是过度专注于完成测试。但它为了拿到一道基准题的答案,已经从逃出沙箱一路做到入侵外部公司的生产系统。

OpenAI
🥴5🔥31
Claude跟进Codex,录一遍屏就能生成可复用Skill

Anthropic 给办公 Agent Claude Cowork 加入「Record a skill」。用户做一遍任务,并同步口述过程。Claude 会记录屏幕、点击、键盘输入和语音。系统随后把演示转成 Skill(可重复调用的工作流程)。下次遇到同类工作,可以直接运行,不用重新写步骤。

过去创建 Claude Skill,通常要手动编写 SKILL.md,再整理脚本、资料和模板。现在只需做给 Claude 看,非技术用户制作自动化流程的门槛明显降低。

不过 Claude 并非第一个。OpenAI 6 月 18 日已为 Codex 推出同类的 Record & Replay。两边连入口都叫「Record a skill」。

Claude 版本目前开放给 Pro、Max 和 Team 套餐,入口在桌面 App 的 Cowork「+」菜单。

Claude
3
传GPT-6已内测近两个半月,能力疑似逼近AGI

OpenAI CEO Sam Altman 下周将向美国政府和议员介绍下一代模型。官方没有公布型号,但社区已把近期线索拼成一张「GPT-6」能力图谱。

OpenAI 已确认,推翻 Erdős 单位距离猜想、在 NanoGPT 竞赛中突破沙箱,以及拆分认证令牌绕过扫描器,来自同一款长期任务模型。它能持续追踪目标。遇到限制后,它不会立即放弃,还会主动寻找系统漏洞。

这款模型最迟在 5 月上旬已经投入测试。它当时向 NanoGPT 仓库提交了 PR #287。5 月 9 日出现的后续 PR 已引用它的方法。按公开记录推算,OpenAI 至少已内测近两个半月。

最新公告又把能力上限推高。OpenAI 称,GPT-5.6 Sol 与一款能力更强的预发布模型,在网络安全评测中共同突破隔离环境。它们利用零日漏洞获得互联网访问,再进入 Hugging Face 的生产系统,试图直接获取评测答案。

从原创科研、长程执行,到自主发现并利用零日漏洞,这套能力已经超出普通聊天模型。称它逼近 AGI 仍是社区判断,不是 OpenAI 的官方结论。

社区传闻
😱31👍1
欧洲AI独苗Mistral估值冲上200亿欧元,三星拟投10亿

《金融时报》援引知情人士称,三星正洽谈投资法国 AI 初创公司 Mistral。投资额最高约 10 亿欧元,新一轮融资或将其估值推至约 200 亿欧元。

Mistral 计划本轮融资数十亿欧元。其估值不到一年内已从 120 亿欧元升至 200 亿欧元,涨幅约 67%。

三星此前已通过风投部门投资 Mistral。双方还讨论过 AI 内存合作。Mistral 则需要更多资金和芯片,扩建欧洲数据中心。

美国限制海外访问 Anthropic 最新模型后,欧洲和亚洲对「主权 AI」的需求升温。Mistral 主打可自行部署和控制的开放模型,正成为美国模型之外的重要选择。

金融时报
😁1
腾讯设计Agent Miora全量上线,一句话生成整套视觉素材

腾讯设计 Agent Miora 全量上线,新用户注册可获得 1000 积分。它能根据一份需求,生成图片、视频、3D、游戏 UI 和广告素材,并保持整套内容风格统一。

Miora 会先拆解任务,再调度不同 Agent 和专业 Skill 完成设计。用户可以直接框选画面中的文字或元素,用自然语言修改局部,不必整张重做。

它还会记住用户的审美、品牌规范和常用流程。成熟的设计流程可以保存为 Skill,下次换产品或素材后直接复用。

Miora 内测用户中,超过一半不是设计师。腾讯想把复杂的设计流程封装进一个 Agent,让市场、运营和研发人员也能直接产出完整视觉素材。

Miora
1
Jack Dorsey开源AI版Slack,想把GitHub也塞进来

Jack Dorsey 旗下 Block 发布 Buzz。它是一款面向人类和 AI Agent 的开源协作平台,试图把 Slack 的团队聊天与 GitHub 的代码协作合到一起。

Buzz 提供频道、话题串、私信、语音、媒体分享、自动化流程和 Git 托管。Agent 作为独立成员加入,拥有自己的身份和权限。它们可以发消息、提交和审查代码,也能触发工作流。平台支持 Claude Code、Codex 和 goose。

Buzz 基于 Nostr 协议。消息、工作流和 Git 操作都会经过签名,写入统一的事件记录。团队可以自行部署,也能使用 Block 提供的托管版本。项目采用 Apache 2.0 开源许可。

Buzz 已提供 macOS、Windows 和 Linux 客户端,但产品仍处于早期阶段。移动端和部分工作流审批功能尚未完成。

Jack Dorsey
🔥2
动察Beating AI News
Hugging Face遭AI Agent入侵,幕后黑手竟是OpenAI测试模型 Hugging Face 此前披露,一套来源不明的自主 AI Agent 入侵了生产系统。OpenAI 现在确认,这套 Agent 由多个内部测试模型驱动,包括 GPT-5.6 Sol 和一款能力更强的预发布模型。 OpenAI 当时正让模型参加 ExploitGym 网络安全评测。为了测试能力上限,团队降低了模型对网络攻击任务的拒绝,并关闭了平时用于拦截高风险行为的生产级分类器。 模型原本只需完成基准题,却发现软件代理中的零日漏洞,逃出…
遭OpenAI模型入侵后,Hugging Face更坚定支持开源模型

Hugging Face 联合创始人兼首席科学官 Thomas Wolf 回应 OpenAI 测试模型入侵事件。他称,这是平台首次遭遇这类攻击,也让他更加确信,网络安全团队必须随时拿得到能力足够强的开源模型。

Wolf 表示,当前沿模型已经进入基础设施并横向移动,防守方需要在几分钟或几小时内调用接近前沿水平的工具,不能再等待封闭的申请和审核流程。

Hugging Face 此前尝试用商业 API 分析超过 1.7 万条攻击记录,但真实攻击命令和漏洞载荷触发了安全拦截。团队最后在本地运行 GLM 5.2,完成事件重建,也避免攻击日志和凭证离开内部系统。

Wolf 认为,模型透明度和能力访问权不只关系到普及和创新,也会直接决定安全团队能不能及时处置攻击。

Thomas Wolf
👍10
字节Seed Audio 1.0上线:一条Prompt生成对白、音效和环境声

字节跳动 Seed 发布音频创作模型 Seed Audio 1.0。它能用一条 prompt 同时生成对白、音效和环境声,并按时间线控制声音进场。

模型支持文本和参考音频输入,时间控制精度为 100ms。单次可生成约 2 分钟音频,还能继续延长,并保持角色音色一致。

Seed Audio 1.0 支持 20 多种语言。同一音色可以跨语言迁移,也能切换语气和情绪。

官方评测显示,多数场景的音频可用率超过 90%。大部分语言的自然度 MOS 超过 4 分。模型已上线火山方舟体验中心,并开放 API 接入。

字节跳动