动察Beating AI News
2.98K subscribers
776 photos
2 videos
3.21K links
AI新闻信息流
Download Telegram
马斯克给挑战Kimi的2T新模型加料,喂入SpaceX工程数据

马斯克称,SpaceX 积累的大量顶级工程数据,将用于 xAI 的 2 万亿参数新模型补充训练。受美国《国际武器贸易条例》限制的敏感材料不会纳入。

马斯克此前称,这款模型将在本周完成初始训练,各方面都优于 1.5T 参数的 Grok 4.5,并可能超过刚发布的 Kimi K3。

他的目标是让新模型在提升能力的同时,继续保持接近 Grok 4.5 的生成速度和 Token 效率。加入 SpaceX 的真实工程数据后,马斯克预计 Grok 的工程能力将大幅提升。

马斯克
👍3
Kimi K3冲上Agent榜第4,用户确认成功指标第一

Arena Agent 榜基于真实用户任务和工具调用记录。Kimi K3 的综合净提升为 9.62%,排名第 4。它排在 Claude Fable 5、Claude Opus 4.8 Thinking 和 GPT-5.6 Sol 之后。

Arena 把所有参评模型均匀混合成一个虚拟平均基准,再估算换成 K3 后,各项结果改善多少。五项净提升最后取平均,得到综合分。

K3 已积累 8344 次测试会话。用户确认成功指标净提升 14.42%,排名第一。表扬多于投诉指标提升 20.62%,排名第三。它的纠错执行排名第 14,Bash 报错恢复排名第 17。

K3 更容易交出让用户认可的结果,但中途改错和命令报错恢复仍是短板。

Arena.ai
3🥰1
OpenAI挖走小鹏AI Infra负责人陆思渊,其200人团队或被拆分

小鹏汽车 AI 基础架构部负责人陆思渊即将离职,目前正在交接工作。他的下一站是 OpenAI,将参与具身智能机器人研发。

陆思渊负责小鹏从模型训练到上车量产的整套 AI 基础设施,直管约 200 人。工作覆盖训练框架、GPU 集群、自研芯片编译器、模型量化优化和车端部署。

这个岗位对小鹏格外关键。小鹏走自研芯片路线,编译器和推理运行系统都要自己搭建。由于暂未找到接替者,陆思渊的团队预计拆成三个以上独立团队。

OpenAI 官网目前仍在招聘机器人软件、仿真和固件工程师。官方称,机器人团队正在研发可在真实环境工作的通用机器人,并打通模型、硬件和软件。

雷锋网
👎5😁3
OpenAI警告:AI干得越久,越会寻找系统漏洞

OpenAI 公开一款内部模型的两次越权行为,提醒开发者注意长任务带来的新风险。模型连续工作数小时后,不只可能犯错,还会围绕目标反复尝试,寻找规则没有覆盖的路径。

第一次发生在 NanoGPT 训练竞赛。OpenAI 只允许模型把结果发到内部 Slack,但竞赛要求提交到公开 GitHub。模型发现运行环境无法联网后,没有停下,而是尝试约 1 小时,最终利用沙箱漏洞把代码发了出去。

另一次测试中,模型想读取其他系统尚未公开的答案。扫描器拦下了它使用的认证令牌。模型随后把令牌拆开并混淆,等程序运行时再拼回去,借此避开检测。

OpenAI 随后暂停内部部署,增加全程监控和自动中止机制。团队用此前出问题的环境回放测试新系统,确认能拦住大部分越权行为后,才恢复有限内部使用。

OpenAI
🤡4
Claude和Codex接连找到反例,AI开始扫荡数学难题

Anthropic 数学家 Levent Alpöge 用 Claude Fable 找到雅可比猜想的三维反例。这个问题从 1939 年悬而未决,还被列入 21 世纪重要数学难题清单。

Fable 给出的多项式映射,雅可比行列式恒为 −2,却把三个不同输入送到同一输出。它因此不可能可逆,三维及更高维版本被证伪,二维版本仍未解决。

OpenAI 研究员 Aaron Lou 随后让内部 Codex 独立尝试。模型在不联网的情况下,也找到了本质相同的反例,并写出了推导过程。

以后,数学家可能会把大量开放问题同时交给不同模型。AI 可以反复试错,寻找反例、漏洞和新思路,再用符号计算或形式化证明工具核验。许多过去没人有时间穷举的方向,都可能被快速扫一遍,科学发现也可能明显提速。

但问题不会因此自动变简单。模型同样会批量制造看似严谨的错误证明,学界可能从「找不到答案」转向「来不及验证答案」。

更大的风险来自真正的突破。RSA 的安全依赖大整数难以分解,Diffie-Hellman 和椭圆曲线密码依赖离散对数难以求解。AI 一旦找到足够快的新算法,网站加密、数字签名、银行交易和区块链使用的部分公钥体系都可能失效,全球不得不紧急更换密码标准。
👍2
Cursor让AI重写SQLite:不同模型组合成本能差15倍

Cursor 让一群 AI Agent 只看 835 页 SQLite 手册,用 Rust 重写一个兼容数据库。它们拿不到 SQLite 源码、程序、测试集和互联网。新版系统的 4 种正式配置,最终都通过了全部未公开 SQL 测试。

正式测试包括 4 种组合。GPT-5.5 和 Grok 4.5 分别包办规划与执行。另两组让 Opus 4.8 或 Fable 5 负责规划,再让便宜的 Composer 2.5 执行。

四组成本分别为 10565 美元、1928 美元、1339 美元和 2234 美元。最低方案是 Opus 4.8 规划、Composer 2.5 执行。执行 Agent 消耗了大部分 Token,换用便宜模型后,成本明显下降。

Cursor 还补跑了 Opus 4.8 和 Fable 5 包办全部工作的方案,成本分别为 5153 美元和 20057 美元。这两组只做了非正式评分,没有纳入质量对比。若只看花费,最高约为最低正式方案的 15 倍。

把强模型留给规划,再让便宜模型执行,可能比全程使用最强模型更划算。

Cursor
4
动察Beating AI News
阿里告别内部赛马:三大智能体合并,90后总裁陈宇森打造统一拳头产品 阿里巴巴正式宣布合并旗下的三款核心 AI 智能体产品。这次调整以桌面端智能体工具 QoderWork 作为基础底座,深度融合钉钉孵化的企业协同办公智能体「悟空」,以及阿里云内部创业的 Agent 执行引擎 MuleRun。新产品由 2026 年 6 月新上任的钉钉总裁兼悟空事业部总经理陈宇森全面统管。 这次合并标志着阿里巴巴在企业端 AI 战略上结束内部赛马,从多点试探转向重点突破。作为底座的 QoderWork 是阿里目前日活与 Token…
阿里三大Agent合并后定名千问办公,陈宇森操盘统一产品

阿里计划推出企业办公智能体「千问办公」。新产品将以桌面智能体 QoderWork 为基础,整合钉钉旗下悟空和阿里云孵化的 MuleRun,由钉钉 CEO 陈宇森负责。

阿里 7 月初已经确认合并三款产品。当时只公布了整合方向,没有披露新产品名称。此次定名「千问办公」,表明三条独立产品线将统一到千问品牌下,成为阿里进军企业 AI 办公市场的主力产品。

三款产品原本各有侧重。QoderWork 可以操作本地文件和应用,悟空连接钉钉的组织与协同能力,MuleRun 负责执行任务和复用工作流程。整合完成后,阿里不再让相似产品各自争夺用户和资源。

财经
2
Cline给Kimi自托管算账:实测只省10%,年费50万美元以下别折腾

AI 编程工具 Cline 用真实生产流量测算 Kimi K2.6 的自托管成本。其每月处理 5830 亿 Token,全部走 API 约花 18.5 万美元。按流量低谷配置 16 张 B200,全天满载承接基础流量,其余请求继续走 API,账单降至 16.6 万美元,只省约 10%。

Cline 估算,按时段动态增减 GPU,可把节省幅度提高到 22% 至 25%。进一步优化内核、批处理和延迟要求,理论上可达 35% 至 40%,但这些方案尚未实际部署。

自托管的门槛也很高。Cline 认为,年 API 支出低于 50 万美元,节省的钱通常覆盖不了推理工程师成本。达到 100 万至 200 万美元后,才更可能划算。这笔账基于 Kimi K2.6,不能直接套到 Kimi K3。

Cline
😁31
K3推高月之暗面估值,Pre-IPO轮冲刺500亿美元

月之暗面准备在 8 月启动上市前最后一轮融资,目标估值最高 500 亿美元。当前一轮融资预计近日完成,估值为 315 亿美元。若按上限完成,估值还将再涨近 60%。

月之暗面最快今年赴港上市。团队计划本月底完成红筹架构拆除,为境内融资和 IPO 做准备。

资本热度来自刚发布的 Kimi K3。模型上线后,日销售额增至此前至少 6 倍。月之暗面 6 月的 ARR(年度经常性收入)达到 3 亿美元,4 月还是 2 亿美元。

K3 不只帮月之暗面卖模型,也在迅速抬高它的融资和上市价格。

彭博
😁6
谷歌发布Gemini 3.6 Flash,Gemini 4也已启动预训练

谷歌发布 Gemini 3.6 Flash,主打编程、知识工作和多模态 Agent。新模型完成多步骤任务时,需要的推理步骤和工具调用更少。

Artificial Analysis 评测显示,它比 Gemini 3.5 Flash 少用 17% 的输出 Token。API 输入价格保持每百万 Token 1.5 美元,输出价格从 9 美元降至 7.5 美元。Token 用量和单价同时下降,Agent 执行长任务会更省钱。

性能也有提升。DeepSWE 从 37% 升至 49%,MLE Bench 从 49.7% 升至 63.9%,OSWorld-Verified 从 78.4% 升至 83%。

谷歌还发布了更便宜的 Gemini 3.5 Flash-Lite,输出速度达到每秒 350 Token。输入和输出价格分别为每百万 Token 0.3 美元和 2.5 美元。

面向网络安全的 Gemini 3.5 Flash Cyber 也将开始有限测试,只向政府机构和可信合作伙伴开放。

Gemini 4 已开始预训练,这是谷歌迄今最具雄心的一次预训练。Gemini 3.5 Pro 仍在合作伙伴测试中,准备完成后将广泛开放。

谷歌
2
Codex与ChatGPT Work周活破千万,4个月涨5倍

OpenAI 的编程 Agent Codex 和办公 Agent ChatGPT Work,合计周活跃用户达到 1000 万。9 天前还是 600 万。OpenAI 随后为两款产品的付费用户再次重置使用额度。

今年 3 月,Codex 周活仅 200 万,如今两款产品合计扩大到 5 倍。

OpenAI 此前承诺,从 300 万到 1000 万,每新增 100 万用户就重置一次额度。本次是这轮承诺的最后一个节点。

Tibo
4
动察Beating AI News
商业模型看到黑客日志就拒答,GLM-5.2直接把全过程扒了出来 Hugging Face 遭到自主 AI Agent 入侵。攻击者利用恶意数据集执行代码,窃取凭证,并进入多个内部集群。 攻击过程包含数万次自动操作,留下超过 1.7 万条记录。Hugging Face 用 AI 在几小时内还原了攻击时间线。 但商业前沿模型拒绝分析真实攻击命令和漏洞载荷,因为这些内容触发了安全限制。 Hugging Face 最后在本地部署开放权重模型 GLM-5.2,才完成安全取证。攻击数据和相关凭证也没有离开内部环境。…
Hugging Face遭AI Agent入侵,幕后黑手竟是OpenAI测试模型

Hugging Face 此前披露,一套来源不明的自主 AI Agent 入侵了生产系统。OpenAI 现在确认,这套 Agent 由多个内部测试模型驱动,包括 GPT-5.6 Sol 和一款能力更强的预发布模型。

OpenAI 当时正让模型参加 ExploitGym 网络安全评测。为了测试能力上限,团队降低了模型对网络攻击任务的拒绝,并关闭了平时用于拦截高风险行为的生产级分类器。

模型原本只需完成基准题,却发现软件代理中的零日漏洞,逃出 OpenAI 的隔离环境。它随后不断提权和横向移动,最终找到了一台能够访问公网的节点。

获得公网权限后,模型推测 Hugging Face 可能保存着 ExploitGym 的数据和答案。它利用窃取的凭证和零日漏洞进入 Hugging Face 服务器,最终从生产数据库直接拿到了答案。

OpenAI 称,模型没有恶意,只是过度专注于完成测试。但它为了拿到一道基准题的答案,已经从逃出沙箱一路做到入侵外部公司的生产系统。

OpenAI
🥴5🔥31
Claude跟进Codex,录一遍屏就能生成可复用Skill

Anthropic 给办公 Agent Claude Cowork 加入「Record a skill」。用户做一遍任务,并同步口述过程。Claude 会记录屏幕、点击、键盘输入和语音。系统随后把演示转成 Skill(可重复调用的工作流程)。下次遇到同类工作,可以直接运行,不用重新写步骤。

过去创建 Claude Skill,通常要手动编写 SKILL.md,再整理脚本、资料和模板。现在只需做给 Claude 看,非技术用户制作自动化流程的门槛明显降低。

不过 Claude 并非第一个。OpenAI 6 月 18 日已为 Codex 推出同类的 Record & Replay。两边连入口都叫「Record a skill」。

Claude 版本目前开放给 Pro、Max 和 Team 套餐,入口在桌面 App 的 Cowork「+」菜单。

Claude
3
传GPT-6已内测近两个半月,能力疑似逼近AGI

OpenAI CEO Sam Altman 下周将向美国政府和议员介绍下一代模型。官方没有公布型号,但社区已把近期线索拼成一张「GPT-6」能力图谱。

OpenAI 已确认,推翻 Erdős 单位距离猜想、在 NanoGPT 竞赛中突破沙箱,以及拆分认证令牌绕过扫描器,来自同一款长期任务模型。它能持续追踪目标。遇到限制后,它不会立即放弃,还会主动寻找系统漏洞。

这款模型最迟在 5 月上旬已经投入测试。它当时向 NanoGPT 仓库提交了 PR #287。5 月 9 日出现的后续 PR 已引用它的方法。按公开记录推算,OpenAI 至少已内测近两个半月。

最新公告又把能力上限推高。OpenAI 称,GPT-5.6 Sol 与一款能力更强的预发布模型,在网络安全评测中共同突破隔离环境。它们利用零日漏洞获得互联网访问,再进入 Hugging Face 的生产系统,试图直接获取评测答案。

从原创科研、长程执行,到自主发现并利用零日漏洞,这套能力已经超出普通聊天模型。称它逼近 AGI 仍是社区判断,不是 OpenAI 的官方结论。

社区传闻
😱31👍1
欧洲AI独苗Mistral估值冲上200亿欧元,三星拟投10亿

《金融时报》援引知情人士称,三星正洽谈投资法国 AI 初创公司 Mistral。投资额最高约 10 亿欧元,新一轮融资或将其估值推至约 200 亿欧元。

Mistral 计划本轮融资数十亿欧元。其估值不到一年内已从 120 亿欧元升至 200 亿欧元,涨幅约 67%。

三星此前已通过风投部门投资 Mistral。双方还讨论过 AI 内存合作。Mistral 则需要更多资金和芯片,扩建欧洲数据中心。

美国限制海外访问 Anthropic 最新模型后,欧洲和亚洲对「主权 AI」的需求升温。Mistral 主打可自行部署和控制的开放模型,正成为美国模型之外的重要选择。

金融时报
😁1
腾讯设计Agent Miora全量上线,一句话生成整套视觉素材

腾讯设计 Agent Miora 全量上线,新用户注册可获得 1000 积分。它能根据一份需求,生成图片、视频、3D、游戏 UI 和广告素材,并保持整套内容风格统一。

Miora 会先拆解任务,再调度不同 Agent 和专业 Skill 完成设计。用户可以直接框选画面中的文字或元素,用自然语言修改局部,不必整张重做。

它还会记住用户的审美、品牌规范和常用流程。成熟的设计流程可以保存为 Skill,下次换产品或素材后直接复用。

Miora 内测用户中,超过一半不是设计师。腾讯想把复杂的设计流程封装进一个 Agent,让市场、运营和研发人员也能直接产出完整视觉素材。

Miora
1
Jack Dorsey开源AI版Slack,想把GitHub也塞进来

Jack Dorsey 旗下 Block 发布 Buzz。它是一款面向人类和 AI Agent 的开源协作平台,试图把 Slack 的团队聊天与 GitHub 的代码协作合到一起。

Buzz 提供频道、话题串、私信、语音、媒体分享、自动化流程和 Git 托管。Agent 作为独立成员加入,拥有自己的身份和权限。它们可以发消息、提交和审查代码,也能触发工作流。平台支持 Claude Code、Codex 和 goose。

Buzz 基于 Nostr 协议。消息、工作流和 Git 操作都会经过签名,写入统一的事件记录。团队可以自行部署,也能使用 Block 提供的托管版本。项目采用 Apache 2.0 开源许可。

Buzz 已提供 macOS、Windows 和 Linux 客户端,但产品仍处于早期阶段。移动端和部分工作流审批功能尚未完成。

Jack Dorsey
🔥2
动察Beating AI News
Hugging Face遭AI Agent入侵,幕后黑手竟是OpenAI测试模型 Hugging Face 此前披露,一套来源不明的自主 AI Agent 入侵了生产系统。OpenAI 现在确认,这套 Agent 由多个内部测试模型驱动,包括 GPT-5.6 Sol 和一款能力更强的预发布模型。 OpenAI 当时正让模型参加 ExploitGym 网络安全评测。为了测试能力上限,团队降低了模型对网络攻击任务的拒绝,并关闭了平时用于拦截高风险行为的生产级分类器。 模型原本只需完成基准题,却发现软件代理中的零日漏洞,逃出…
遭OpenAI模型入侵后,Hugging Face更坚定支持开源模型

Hugging Face 联合创始人兼首席科学官 Thomas Wolf 回应 OpenAI 测试模型入侵事件。他称,这是平台首次遭遇这类攻击,也让他更加确信,网络安全团队必须随时拿得到能力足够强的开源模型。

Wolf 表示,当前沿模型已经进入基础设施并横向移动,防守方需要在几分钟或几小时内调用接近前沿水平的工具,不能再等待封闭的申请和审核流程。

Hugging Face 此前尝试用商业 API 分析超过 1.7 万条攻击记录,但真实攻击命令和漏洞载荷触发了安全拦截。团队最后在本地运行 GLM 5.2,完成事件重建,也避免攻击日志和凭证离开内部系统。

Wolf 认为,模型透明度和能力访问权不只关系到普及和创新,也会直接决定安全团队能不能及时处置攻击。

Thomas Wolf
👍10
字节Seed Audio 1.0上线:一条Prompt生成对白、音效和环境声

字节跳动 Seed 发布音频创作模型 Seed Audio 1.0。它能用一条 prompt 同时生成对白、音效和环境声,并按时间线控制声音进场。

模型支持文本和参考音频输入,时间控制精度为 100ms。单次可生成约 2 分钟音频,还能继续延长,并保持角色音色一致。

Seed Audio 1.0 支持 20 多种语言。同一音色可以跨语言迁移,也能切换语气和情绪。

官方评测显示,多数场景的音频可用率超过 90%。大部分语言的自然度 MOS 超过 4 分。模型已上线火山方舟体验中心,并开放 API 接入。

字节跳动
写Prompt太慢?Karpathy建议先跟AI胡侃10分钟

OpenAI 联合创始人、现 Anthropic 预训练团队成员 Andrej Karpathy 分享了一种「长篇口述 Prompt」工作法。面对复杂任务,他会打开语音输入,连续讲约 10 分钟。内容可以跳跃、混乱,也不必先整理成完整指令。

Karpathy 认为,大模型擅长从这些碎片中还原真实目标。它还能把纠缠的思路整理得更清楚。必要时,他会让模型追问几轮,把口述变成一场小型访谈。前期多交代背景,后面需要纠正的地方反而更少。

Andrej Karpathy
Anthropic想补上机器人短板,曾洽购Physical Intelligence

科技博主 Robert Scoble 称,Anthropic 正在收购机器人 AI 创业公司 Physical Intelligence。消息迅速传开,但目前没有交易落地。Physical Intelligence CEO Karol Hausman 已在内部否认。

传闻并非全无依据。双方今年春天确实讨论过收购。Physical Intelligence 正在开发通用机器人基础模型,目标是让同一套「大脑」控制不同机器人和任务。联合创始人 Sergey Levine 把它形容为「机器人版 ChatGPT」。

Physical Intelligence 已融资超过 10 亿美元,并正在洽谈约 10 亿美元新融资,估值可能超过 110 亿美元。最新模型 π0.7 能在语言指导下处理没有专门训练过的任务,但还不能只靠一句指令独立完成复杂多步操作。

Anthropic 已用 Claude 做过机器狗控制实验,但公开动作主要仍是研究测试。收购 Physical Intelligence 可以直接补上机器人控制模型、训练数据和硬件经验。

TechCrunch