动察Beating AI News
3.69K subscribers
1.44K photos
4 videos
1 file
4.41K links
AI新闻信息流
Download Telegram
OpenAI发布AI失控追踪框架,披露模型曾试图「自我绕过限制」

OpenAI 周三发布一套新的 AI 模型「失配」(misalignment)事件追踪与调查框架,用于记录、调查并公开披露模型在训练或评估过程中出现的异常行为,同时公布过去 6 个月发现的 6 起相关事件。

OpenAI 表示,目前 AI 行业在对齐和监控方面仍未达到足以长期维持最大速度扩张的水平。新框架允许员工向安全与对齐团队报告相关事件,并根据复杂程度分为「准备披露」「小规模调查」和「大规模调查」三类,即使尚未完全解释或解决相关行为,也可优先公开披露。

OpenAI 披露,一款尚未发布的研究模型曾在自身任务摘要中写入指令,要求未来版本忽略正常限制;在 GPT-5.6 Sol 训练过程中,模型也曾留下用于隐藏错误的指令。另有 AI 智能体被发现搜索公开代码仓库中的泄露 API 密钥、将文件上传至互联网以便后续引用,并利用内部软件仓库在不同训练样本之间传递信息。

此次框架发布之际,AI 行业正围绕「是否应放缓前沿模型开发以等待安全措施跟上」展开讨论。此前还有 OpenAI 模型在研究沙箱外运行时访问 Hugging Face 生产系统的事件,OpenAI 随后暂停部分前沿项目并调配工程师加强安全训练。

信源

动察 Beating 频道 · 动察 Beating 交流群
罗福莉憋了半年,小米把MiMo-V2.6强化学习直接直播了

小米正在公开直播下一代 MiMo-V2.6 的强化学习训练。

负责人罗福莉称,团队沉默近半年,一直在研究强化学习到底还能扩展到多大规模。目前 V2.6 仍在训练,具体技术方案将在未来几周陆续开源。

这次一上来就把规模拉得很高。每一步使用 1568 个 prompt,每个生成 16 条 rollout,总计约 20 亿 Token,全程异步运行。代码、通用、视觉、网络安全和聊天等 Agent 任务,也被混在同一次训练里,并同时使用多套 harness。

外界可以实时看到每一步的任务组成、上下文长度、训练耗时等内部指标。UC Berkeley 博士生 Yichuan Wang 根据面板观察到,代码任务占约三分之二,同时活跃的沙箱超过 4 万个。

信源

动察 Beating 频道 · 动察 Beating 交流群
👍7🤡4🤔1
Claude不分Chat和Cowork了,Anthropic开始让Agent模式隐形

Anthropic 把 Claude Chat 和 Cowork 合成一个入口。以后不用先选「聊天」还是「干活」,直接把需求交给 Claude。它会自己判断是回答问题,还是接手复杂任务。原来 Cowork 里的项目、Skills、Connectors 和上下文都会保留。

有意思的是,Cowork 本来就是 Anthropic 主动拆出来的。今年 1 月推出时,它被定位成「Claude Code for the rest of your work」,专门处理报告、文件等多步骤任务。但用户真正用起来后,还得先判断任务该交给 Chat 还是 Cowork,两个入口里的工作也很难自然接着做。现在 Anthropic 又主动把这层选择删掉。

Claude 还新增了 Docs 和 Slides,可以直接在对话里生成、编辑文档和 PPT,Claude Design 也被接进同一个入口。任务交给 Claude 后,即使关掉电脑也能继续处理,用户可以在手机上查看进度。

Anthropic 从 Cowork 开始推动 Claude 从聊天工具变成干活的 Agent,现在又把 Agent 模式本身藏了起来。用户不用管背后是 Chat、Cowork、Docs 还是 Slides,只管告诉 Claude 自己要什么。

信源

动察 Beating 频道 · 动察 Beating 交流群
👍41
Cosmos Ventures宣布成立,押注AI时代「哲学家型创业者」

9 月 17 日,Cosmos Ventures 宣布正式成立,计划投资于致力于为 AI 时代创建新型机构和基础设施的「哲学家型创业者」。Brendan McCord 与 Matt Mandel 推出规模 7760 万美元的 Fund I,将支持为 AI 时代创立机构的哲学家型建设者。

McCord 为 Cosmos Institute 与 Cosmos Ventures 创始人,Mandel 来自 Union Square Ventures。该基金已投资 AIUC、Prime Intellect、Workshop Labs(已被 Thinking Machines 收购)及一家未公开教育公司,LP 包括 Reid Hoffman、Joe Liemandt、Stand Together、Fred Wilson、Micky Malka 与 Astera Institute。

Cosmos Ventures 认为,AI 正在打破「智能与人类绑定」的传统假设。过去,分析、创意和关键决策通常需要由人类完成,并由具体个人承担责任,而 AI 的发展正在改变这一模式。现有学校、媒体、保险等制度也可能因此面临重新设计的需求。

Cosmos Ventures 表示,其重点关注的创业者需要回答「我们希望建立怎样的社会」以及「哪些决策应该交给 AI、哪些必须由人类掌握」等规范性问题,而不仅是通过用户反馈持续迭代产品。该机构将这一理念概括为「Condere aude」,即「敢于创立」。

信源

动察 Beating 频道 · 动察 Beating 交流群
🤡1
Manus拟融资5亿美元,估值或升至40亿美元

据彭博社报道,中国背景 AI 初创公司 Manus 正计划完成一轮约 5 亿美元融资,估值有望达到 40 亿美元,较此前 20 亿美元估值翻倍。知情人士称,该轮融资已接近完成,但交易仍处于早期阶段,具体条款和投资者名单可能发生变化。

这是 Manus 与 Meta 分拆后首次融资。此前,Meta 曾以约 20 亿美元收购 Manus,但该交易遭中国监管部门阻止,双方随后完成运营分拆并停止数据共享。Manus 本月已恢复独立运营,创始团队将继续负责公司发展。

Manus 现有投资方包括腾讯、HSG 和真格基金。若本轮融资按 40 亿美元估值完成,Manus 将成为中国估值最高的 AI Agent 公司之一。彭博称,公司未来可能效仿月之暗面等 AI 公司,寻求在香港上市。

不过,Manus 也面临基础模型能力快速提升带来的竞争压力,包括 Kimi 和 Claude 等模型正在增强桌面任务处理能力,而 Manus 本身并未从零训练基础模型。

信源

动察 Beating 频道 · 动察 Beating 交流群
地瓜机器人半年融6.7亿美元,不造整机专卖机器人芯片和底座

由地平线孵化的地瓜机器人完成 4 亿美元 C 轮融资,未来资产领投,美团战投等参与。地瓜不造机器人整机,主要提供机器人计算芯片和软硬件开发平台。这已经是它今年第三笔大额融资。3 月和 4 月,公司先后完成 1.2 亿美元 B1 轮和 1.5 亿美元 B2 轮,半年合计融资 6.7 亿美元,累计公开融资约 7.7 亿美元。

公司称,旭日系列芯片累计出货已突破 800 万片,2026 年上半年营收同比增长数倍。面向具身智能的旭日 S600 已进入优必选、自变量、千寻智能等 20 多家客户。7 月披露时,多数项目还处于真机适配和场景测试阶段,这次公司称多数已经进入量产级出货。

地瓜的路线更像机器人行业的「卖铲人」。一套芯片和开发平台同时服务人形、工业轮式、消费机器人等不同产品。这轮融资除了继续扩充旭日芯片,还会建设覆盖数据采集、模型训练、仿真验证到端侧部署的软件平台,把机器人从训练到装机的工具链一起做掉。

信源

动察 Beating 频道 · 动察 Beating 交流群
谷歌让Agent学会「做梦」:复盘过去试错,下一轮自己少走弯路

谷歌研究团队发布 Dream-RSI,让 AI Agent 做完一轮任务后,把过去的成功和失败拿来「做梦」。系统会保存每次尝试和结果,再利用这些旧记录推演不同做法,比如先试哪条路、什么时候放弃、要不要同时多试几个方案。因为结果以前已经跑过,这些推演不用重新执行任务。

系统会从中选出表现更好的做法,直接用到下一轮。新一轮又会留下更多成功和失败,再拿来「做梦」、继续改策略。这样一轮接一轮,就是论文所谓的「递归自我改进」。目前底层模型本身不会变化,真正被改进的是 Agent「下一步怎么做」的方法。

论文在算法、数学优化和 GPU kernel 等 8 个任务上测试了这套方法。以 Gemini 3.1 Pro 的一个算法任务为例,相比固定做法,Agent 调用从 550 次降到 317 次,同时最终找到的程序运行得更快。

信源

动察 Beating 频道 · 动察 Beating 交流群
🤡9
Meta给Muse上裂变拉新:邀1人送10亿Token,最多拿200亿

Meta 的个人 AI Agent Muse 上线邀请码。Alexandr Wang 宣布,朋友注册时使用你的邀请码,双方各得 10 亿 Muse Token,最多可以邀请 20 人。拉满后,邀请者还能提前体验电话等新功能。

这个奖励相当大。Muse 免费版目前每周提供 1 亿 Token,成功邀请 1 人拿到的奖励,数量上等于 10 周免费额度;拉满 20 人就是 200 亿 Token,相当于 200 周的基础免费额度。

Muse 上周刚在美国上线,可以自己浏览网页、连接 App,并代用户发邮件、购物和订行程。上线后一直稳居美国 App Store 总榜前几名。Meta 现在直接用大额 Token 奖励,把首批用户变成拉新渠道。

邀请码:YT6O60

信源

动察 Beating 频道 · 动察 Beating 交流群
💩3
Grok Build也有长期记忆了,/dream自动整理每轮项目经验

Grok Build 上线自动长期记忆。每轮任务结束后,它会在后台记下值得长期保留的项目约定、决定和事实,下次打开同一项目时直接接着用,不用用户重新解释。

这些记忆都以 Markdown 保存。/memory 可以直接查看,/dream 会把近期零散笔记合并成测试、代码风格等不同主题,而且系统也会定期自动执行。

这套思路并不新。Claude Code 今年 2 月就已经加入 Auto Memory,同样会自动记录项目知识,并整理成 MEMORY.md 和主题文件,/memory 也能查看管理。Codex 此后也加入了自动提取和整理历史记忆的机制。

信源

动察 Beating 频道 · 动察 Beating 交流群
👍2🤔1
QuiverAI Arrow2上线:SVG生成更快,还能直接改和做动画

AI 矢量设计公司 QuiverAI 正式上线 Arrow 2 和更强的 Arrow 2 Telos。两款模型专门生成 SVG 矢量图。相比上一代 Arrow 1.1,Arrow 2 重点提升生成速度和成图质量,并新增 SVG 编辑和动画能力。

QuiverAI 称,Arrow 2 会用更少、更精准的控制点画出路径,减少多余节点和重叠,也更会处理间距、留白和对齐。它还能直接修改已有 SVG,并给其中的形状和分组加入微动画。

更强的 Arrow 2 Telos 面向复杂风格、构图和长需求。它的上下文达到 105 万 Token,普通 Arrow 2 为 131,072 Token,相差约 8 倍;API 单价则高 50%。

信源

动察 Beating 频道 · 动察 Beating 交流群
👍1
腾讯AI语音输入工具Chatterfly开启内测

腾讯 AI 语音输入工具 Chatterfly 已经上线官网并开启限时内测,目前开放 Windows 和 macOS 客户端。

用户按 Fn 直接说话,它会把口语整理成可以直接发送的文字,并根据当前场景和上下文调整表达。

Chatterfly 还把 Skills 直接塞进了输入工具。首批包括工作汇报、项目推进、营销文案、VibeCoding 提示词优化、会议纪要等 6 个 Skills。比如口述一段零散的开发需求,它可以整理成目标、约束和验收标准,再直接交给 Agent 执行。用户修改语音识别结果后,Chatterfly 还会自动学习专有名词,也支持手动维护个人词库。

信源

动察 Beating 频道 · 动察 Beating 交流群
🎉2
「不会聊天」的AI可以怎么玩?开发者用Jev接管Agent快速决策

前 OpenAI 研究员 Diogo Almeida 创办的 TypeSafe 昨天刚发布新模型 Jev。它不生成文本,只返回选项、分数和概率。社区很快出现一批开源项目,开始把 Jev 塞进 Agent 和软件流程里。

Browser Use 做的 jev-ultrafast 最直观。浏览器每走一步,Jev 都会从当前页面里判断「下一步做什么、操作哪个元素」,只有需要填写文字时才调用一个小型语言模型。团队用它在 Google Flights 搜索苏黎世到伦敦的航班,一次完整运行只用了 7.1 秒。

Jev Codex Router 让 Jev 先判断每轮编程任务的难度,再决定交给不同档位的模型;jev-mcp 则把它做成 Agent 的事实核验、Prompt Injection 检测和语义排序工具。

这些项目有个很明显的共同点:没人拿 Jev 当聊天机器人,而是把它塞进软件和 Agent 的执行链里,专门负责那些高频、有限选项的判断。

动察 Beating 频道 · 动察 Beating 交流群
👍3
Rene上线「多人Agent」,直接在iMessage里替你和朋友协调时间

薛天禄创办的 AI 创业公司 Second Enlightenment 推出个人 Agent 助手 Rene。它直接运行在 iMessage 里,用户像发短信一样就能让它干活。Rene 能使用浏览器、处理邮件和日历,也能购物、写代码、做网站、演示文稿和图片。

Rene 主打「多人协作」。它可以加入群聊,也能和朋友的 Rene 直接沟通。比如约饭时,双方的 Rene 可以分别查看日历,自动找出都有空的时间,再交给各自用户确认。原本需要几个人来回商量的事,可以先让 Rene 在后台协调。

薛天禄此前在小红书和字节跳动做过产品。他称自己已经用了 Rene 四个月,让它找办公室、准备会议,还会让它收集团队的晚餐意见。

Rene 也会记住过去的信息,并主动提醒和跟进。

信源

动察 Beating 频道 · 动察 Beating 交流群
Kimi推出金融行业方案,Agent直接跑投研、建模和报告

月之暗面推出 Kimi 金融行业解决方案,把金融数据、Skill 和 Agent 能力打包到一起。方案接入 Wind、东方财富、标普全球、财联社、财新数据等 10+ 数据源,并提供财务建模、机构研报、财报点评、组合复盘、持仓早报等 9 项金融 Skill。

Kimi 称,合作案例中,财务建模的人力投入从 5–7 人天降至 0.5–1 人天,深度研究从 10–20 天缩短至约 2 天。

Kimi 还与中信建投共建「风险评估网关」,处理数据分级、个人信息保护、工具授权、内容核验和审计追溯。试点中,单份临时受托报告的人工制作时间从约 30 分钟降至 10 分钟。

最近一周,OpenAI、Anthropic 也相继推出金融行业产品。现在 Kimi 也跟进,把金融数据、专业 Skill 和 Agent 工作流一起推向机构客户。

信源

动察 Beating 频道 · 动察 Beating 交流群
👍4
华为下一代芯片昇腾960发布时间提前9个月,4096卡超节点首上NPO

华为把下一代昇腾960的发布时间提前了9个月。去年官方计划还是2027年Q4推出,今天华为宣布,昇腾960DT将在2027年Q1就绪,提前三个季度;960PR将在Q3跟进。

960DT单芯片提供2 PFLOPS FP8、4 PFLOPS FP4算力,最高搭载288GB HBM,带宽9.6TB/s。

华为同时发布新的昇腾960超节点,单个系统可连接4096张NPU,提供8 EFLOPS FP8算力和1PB HBM。它首次采用NPO(把光引擎放到芯片附近)技术,用5500个Hi-ONE替代原方案约4.8万个800G光模块。华为称,这可以减少超过550千瓦功耗。

华为接下来仍会保持昇腾一年一代,同时用灵衢和光互联继续做大超节点,把单芯片之外的系统算力也往上推。

信源

动察 Beating 频道 · 动察 Beating 交流群
👍2
Grok 4.7最快今晚发布?Google Cloud后台已出现模型名

Grok 4.7 疑似已经进入发布前最后阶段。社区发现 Google Cloud Console 的模型配额页面突然出现了 grok-4.7。

Grok 4.7 原计划更早上线。马斯克上周临时宣布再推迟几天,原因是模型面对困难任务时容易过早放弃,对自己的答案检查得也不够严格。他随后还表示,Grok 4.7 大致会达到 Claude Opus 5 水平,但多模态能力还需要改进;Grok 4.8 会有明显提升,Grok 4.9 才可能达到 Astra 和 Fable 级别。

社区之所以盯着 Google Cloud 配额页,是因为过去一些新模型会在正式上线前后先出现在这里。

信源

动察 Beating 频道 · 动察 Beating 交流群
GLM-5.3开始优化自己的系统,智谱唐杰:RSI最小闭环已经出现

智谱披露,GLM-5.3 驱动的 Infra Agent 已经参与优化 GLM-5.3-Flash 的推理系统。从首次跑通到承接全部生产流量不到两周,端到端吞吐提升到最初的 3.2 倍。

联合创始人兼首席科学家唐杰在复盘中提到,Agent 现在最容易卡住的地方,往往不是不会写代码,而是不知道问题出在哪。比如一次修改让吞吐下降 20%,它知道自己改坏了,却不知道是哪一层出了问题,下一步该查什么。

于是智谱把资深工程师平时的排查方法做成一套 Agent 可以直接使用的工具。Agent 改完代码后,可以自己检查结果对不对、时间耗在哪里、哪种方案更快,再根据结果继续修改。

靠这套方法,Agent 找出了长上下文计算误差、KV 传输阻塞和解码 kernel 重复计算等问题。其中一个 kernel 重写后提速 1.71 倍。

唐杰判断,工程师的角色会越来越像「设计反馈的人」。人负责定目标、设边界和审核高风险修改,Agent 自己提假设、改代码、跑实验。离完整的 RSI 还很远,但「模型优化系统,系统再服务模型」这个最小闭环已经出现。

信源

动察 Beating 频道 · 动察 Beating 交流群
👍4
被指和Anthropic关系太近,METR总裁回应:我们没拿AI公司的钱

这几天,Anthropic 推荐的第三方评估机构 METR 接连遭到质疑。外界发现,它的不少核心成员和 Anthropic、OpenAI 等 AI 公司关系密切。METR 自己也承认,此前一次评估中至少 6 名参与者与 AI 公司员工有密切私人关系,当时甚至还没有正式的利益冲突政策。

METR 总裁 Chris Painter 现在正面回应。他称 METR 靠捐款运营,从未接受前沿 AI 公司及其员工的钱,给 Anthropic、OpenAI 等公司做评估也不收费。这些公司会免费开放模型和 Token,让 METR 做测试。

Painter 强调,METR 的目标不是替 AI 公司证明模型「安全」,而是在发现模型可能失控时,把证据公开给政府和公众。

信源

动察 Beating 频道 · 动察 Beating 交流群
😁1
传OpenAI下周发Codex Bot,直接对标Grok Bot

AI 博主 Mark Kretschmann 爆料,OpenAI 正准备推出一款暂称 Codex Bot 的新产品,基于 OpenClaw 开发。原计划本周发布,目前已推迟到下周。

Sam Altman 今天刚表示,原定本周发布的「主要新东西」延至下周;而 OpenAI 今年 2 月招募 OpenClaw 创始人 Peter Steinberger 时,也称他将负责开发「下一代个人 Agent」。

Mark 称,Codex Bot 会比现有 ChatGPT Work 更像 Grok Bot。后者相当于一组长期在线的「AI 同事」,可以使用自己的工作环境,跨网站和 App 持续干活。

信源

动察 Beating 频道 · 动察 Beating 交流群
👎1🤨1
给Claude Code装上「剪映」,Hypit让Agent直接做完整视频

开源项目 Hypit 最近在 GitHub 快速走红,目前已有约 8300 Star。它相当于给 Claude Code、Codex 这类 Coding Agent 加上一套视频制作工具,让原本主要写代码的 Agent,也能开始做视频。

用户丢进去一条参考视频后,Hypit 会把台词、镜头、字幕、B-roll 和特效拆成一套可以反复修改的制作流程。Agent 再调用 Seedance 等视频模型、图片模型、WhisperX 和 FFmpeg,替换人物、台词和素材,重新生成整条视频。

这套方法特别适合批量做相似视频。比如一条广告效果不错,可以保留原来的节奏和结构,只换产品、人物或文案,再快速做出几十个不同版本。一条视频跑通后,后面主要就是换内容,不用每次从头做一遍。

Hypit 本身免费使用,也不强制绑定某个生成模型。不过它采用带额外限制的开源协议,企业内部可以商用;如果拿它做面向多个客户的 SaaS,则需要另行取得商业授权。

信源

动察 Beating 频道 · 动察 Beating 交流群
🤨2