动察Beating AI News
3.69K subscribers
1.44K photos
4 videos
1 file
4.41K links
AI新闻信息流
Download Telegram
前白宫AI政策顾问转投Anthropic,负责前沿算力战略

前白宫 AI 与新兴技术高级政策顾问 Sihao Huang 宣布加入 Anthropic,担任前沿算力战略负责人。他将直接与联合创始人兼首席算力官 Tom Brown 合作,负责基础设施扩张、外部合作和长期算力规划。

Huang 此前在白宫科技政策办公室领导 AI 团队,工作还涉及国家安全、科研政策和半导体。今年 6 月离开白宫时,《The Information》只报道他将进入私营部门,去向当时并未公开。

Anthropic 今年持续扩充算力,已与 Amazon、Google、Broadcom、SpaceX 等达成合作,并刚签下澳大利亚首个数据中心租赁协议,园区规划容量达 2.16GW。

信源

动察 Beating 频道 · 动察 Beating 交流群
👏1
Arcee AI完成B轮融资筹集至少1.5亿美元,投前估值达10亿美元

开放权重 AI 模型初创公司 Arcee AI 以 10 亿美元投前估值完成 B 轮融资。本轮融资由 Vista Equity Partners、Cambium Capital 和 Emergence Capital 领投,微软旗下 M12、AI10 Ventures、日立、IAG、P7 及 Wipro 参投。公司未披露融资金额,但知情人士称至少达到 1.5 亿美元。

Arcee AI 于 2023 年成立,最初专注于模型后训练。2025 年,在 Meta 收缩开放权重模型投入后,公司决定从零开始训练自有模型,并投入约 2000 万美元,相当于当时账上 3000 万美元资金的 65% 至 70%,共训练 4 款开放权重模型。其中包括 2026 年初发布的 4000 亿参数模型 Trinity Large。

Arcee 表示,其模型在部分基准测试中超过 Meta Llama 3,并达到与 Mistral 及部分中国模型相近的水平。新资金将用于开发开放权重模型和相关产品、扩大与美国能源部的合作,并服务 Vista 投资组合中的企业。创始人 Mark McQuade 表示,公司目标是缩小美国在开放模型领域与中国的差距。

信源

动察 Beating 频道 · 动察 Beating 交流群
DeepMind成立AGI研究院,首席AGI科学家称Astra还不算AGI

Google DeepMind 宣布成立 DeepMind Institute,专门研究 AGI 会怎样影响科学、经济和社会。

DeepMind 联合创始人兼首席 AGI 科学家 Shane Legg 负责研究院内容方向,CEO Demis Hassabis 和 Google 高级副总裁 James Manyika 也参与其中。

Legg 也不认同最近「AGI 已经到来」的说法。OpenAI 总裁 Greg Brockman 和英伟达 CEO 黄仁勋此前都把 GPT-6 Astra 与 AGI 到来联系起来。Legg 认为,Astra 虽然能力很强,但还达不到 OpenAI 自己对 AGI 的定义,也就是高度自主,并在大多数有经济价值的工作上超过人类。

DeepMind Institute 首批发布三篇文章,讨论 AI 安全、经济政策和「新乌托邦主义」。其中一篇由 DeepMind 安全团队的 Rohin Shah 和 Anca Dragan 撰写,批评 Astra 发布时的信息透明度下降,并认为激烈竞争会让 AI 公司越来越不愿公开模型信息。

Anthropic 今年 3 月也成立了类似的 Anthropic Institute,把红队、社会影响和经济研究团队整合到一起。

信源

动察 Beating 频道 · 动察 Beating 交流群
👍5
GPT-6 Astra直接接管机器人「大脑」,模拟成绩超过专用VLA

由香港大学 MMLab 牵头的机器人操作评测项目团队 RoboDojo 做了个反常规实验。他们没有给 GPT-6 Astra 再配一个训练好的机器人策略,而是让这个通用多模态模型直接看相机、读取机器人状态、理解任务,再自己决定下一步怎么动。中间只有一套固定控制工具,把 Astra 给出的目标位置转成机械臂动作。

在 42 项模拟任务里,Astra 拿到 28.97 分、22.48% 平均成功率,超过原公开榜首 DM0.5 的 24.90 分、19.34%。同一套控制方式换成 GPT-5.5,只有 1.13 分、0.88%。

RoboDojo 公开榜过去主要是 VLA、WAM 这类专门训练的机器人策略。现在,原本需要专用模型完成的一部分动作决策,通用大模型已经可以直接接手,而且整体成绩还超过了原榜首。机器人是否还需要单独训练一颗「大脑」,这个问题第一次变得很具体。

但 Astra 还替不了机器人的「小脑」。插入、倒液体、精细接触这些依赖真实物理控制的任务,它明显更弱。真机测试还因为多次出现危险动作并损坏硬件,被团队提前叫停。

随着通用模型能力变强,机器人模型的分工可能会被重新划分:大模型负责看懂环境、判断和规划,专用 VLA 与传统控制器负责把动作做准、做稳。

信源

动察 Beating 频道 · 动察 Beating 交流群
👍6
Media is too big
VIEW IN TELEGRAM
黄仁勋:AI安全是工程问题,不需要新的法律监管

英伟达 CEO 黄仁勋进一步明确了自己对 AI 监管的态度。他在 Salesforce 年度大会 Dreamforce 上表示,AI 安全首先是工程问题,不需要为此增加新的法律和监管。AI 再复杂,归根结底仍是软件和计算系统,应该靠完善测试和产品把关来解决安全问题。

他的原则也很简单:没有把握产品安全,就不要发布。公司可以先停下来把问题解决,再继续往前跑。

黄仁勋认为,市场本身已经能约束企业,没有必要再加一层新的 AI 监管。他也反对把发展速度和安全放在对立面,认为两者完全可以同时做到。企业应该尽可能快地推进,一旦发现产品可能失控或不安全,再停下来处理。

信源

动察 Beating 频道 · 动察 Beating 交流群
😁3
Media is too big
VIEW IN TELEGRAM
Anthropic CEO:就算模型今天停更,现有AI可能也只用了5%–10%的价值

Anthropic CEO Dario Amodei 在 Salesforce 年度大会 Dreamforce 上表示,即使模型能力从今天开始不再进步,人们可能也只开发出了现有 AI 潜在价值的 5%–10%。

他认为,模型能力已经跑在实际应用前面。很多企业和普通用户甚至还不知道现有 AI 已经能做什么,更谈不上把这些能力真正用进日常工作。

Dario 举了 Anthropic 自己的例子。公司内部已经有人让 Claude 直接结合 Salesforce 数据,找出本周最大的交易、最可能丢掉的订单,再分析项目的问题和成单机会。这些能力今天已经能用,但真正把它们用起来的人还很少。

这也补充了他最近关于「放慢前沿 AI」的主张。Dario 想放慢的是最前沿模型继续变强的速度,并不主张放慢 AI 应用。按他的判断,就算模型暂时停在今天,企业把现有能力真正用起来,仍有很大的空间。

信源

动察 Beating 频道 · 动察 Beating 交流群
🤮9
OpenRouter又上神秘模型Union Alpha,专攻Agent编程

OpenRouter 和 OpenCode 上线神秘模型 Union Alpha,开发者身份暂未公开。它是一款面向研究、编程和 Agent 工作流的多模态模型,支持图片、工具调用和约 256K 上下文。OpenRouter 将其描述为具有「前沿级通用性能」。

OpenCode 称 Union Alpha 专门针对 Agent 编程优化,未来一周免费使用,而且不会用用户数据训练模型。

Union Alpha 到底是谁家的,目前没有答案。社区已经开始从输出风格、上下文长度等线索猜模型身份,但暂时没有可靠证据。

信源

动察 Beating 频道 · 动察 Beating 交流群
👍52
Cyces收购AI用户研究平台Looppanel,将加速布局Agentic UX Research

AI 产品工作室 Cyces 宣布已收购 AI 驱动的用户研究平台 Looppanel。交易完成后,Looppanel 将继续服务现有客户,Cyces 计划加快其产品开发,进一步拓展 AI 能力,并推动平台进入更多全球市场。

Looppanel 主要面向 UX 和产品团队,提供多语言转录、AI 辅助分析、主题标签、研究内容搜索及协作等功能,帮助企业从用户研究中提取洞察。Cyces 表示,未来将推动 Looppanel 向「Agentic UX Research」(智能体驱动的用户研究)方向发展。此次收购未披露具体交易金额。

Looppanel 成立于帮助企业更高效地开展定性用户研究,曾入选红杉资本 Spark 早期创业项目,并参与 TechCrunch Disrupt。

信源

动察 Beating 频道 · 动察 Beating 交流群
OpenAI发布AI失控追踪框架,披露模型曾试图「自我绕过限制」

OpenAI 周三发布一套新的 AI 模型「失配」(misalignment)事件追踪与调查框架,用于记录、调查并公开披露模型在训练或评估过程中出现的异常行为,同时公布过去 6 个月发现的 6 起相关事件。

OpenAI 表示,目前 AI 行业在对齐和监控方面仍未达到足以长期维持最大速度扩张的水平。新框架允许员工向安全与对齐团队报告相关事件,并根据复杂程度分为「准备披露」「小规模调查」和「大规模调查」三类,即使尚未完全解释或解决相关行为,也可优先公开披露。

OpenAI 披露,一款尚未发布的研究模型曾在自身任务摘要中写入指令,要求未来版本忽略正常限制;在 GPT-5.6 Sol 训练过程中,模型也曾留下用于隐藏错误的指令。另有 AI 智能体被发现搜索公开代码仓库中的泄露 API 密钥、将文件上传至互联网以便后续引用,并利用内部软件仓库在不同训练样本之间传递信息。

此次框架发布之际,AI 行业正围绕「是否应放缓前沿模型开发以等待安全措施跟上」展开讨论。此前还有 OpenAI 模型在研究沙箱外运行时访问 Hugging Face 生产系统的事件,OpenAI 随后暂停部分前沿项目并调配工程师加强安全训练。

信源

动察 Beating 频道 · 动察 Beating 交流群
罗福莉憋了半年,小米把MiMo-V2.6强化学习直接直播了

小米正在公开直播下一代 MiMo-V2.6 的强化学习训练。

负责人罗福莉称,团队沉默近半年,一直在研究强化学习到底还能扩展到多大规模。目前 V2.6 仍在训练,具体技术方案将在未来几周陆续开源。

这次一上来就把规模拉得很高。每一步使用 1568 个 prompt,每个生成 16 条 rollout,总计约 20 亿 Token,全程异步运行。代码、通用、视觉、网络安全和聊天等 Agent 任务,也被混在同一次训练里,并同时使用多套 harness。

外界可以实时看到每一步的任务组成、上下文长度、训练耗时等内部指标。UC Berkeley 博士生 Yichuan Wang 根据面板观察到,代码任务占约三分之二,同时活跃的沙箱超过 4 万个。

信源

动察 Beating 频道 · 动察 Beating 交流群
👍6🤡4🤔1
Claude不分Chat和Cowork了,Anthropic开始让Agent模式隐形

Anthropic 把 Claude Chat 和 Cowork 合成一个入口。以后不用先选「聊天」还是「干活」,直接把需求交给 Claude。它会自己判断是回答问题,还是接手复杂任务。原来 Cowork 里的项目、Skills、Connectors 和上下文都会保留。

有意思的是,Cowork 本来就是 Anthropic 主动拆出来的。今年 1 月推出时,它被定位成「Claude Code for the rest of your work」,专门处理报告、文件等多步骤任务。但用户真正用起来后,还得先判断任务该交给 Chat 还是 Cowork,两个入口里的工作也很难自然接着做。现在 Anthropic 又主动把这层选择删掉。

Claude 还新增了 Docs 和 Slides,可以直接在对话里生成、编辑文档和 PPT,Claude Design 也被接进同一个入口。任务交给 Claude 后,即使关掉电脑也能继续处理,用户可以在手机上查看进度。

Anthropic 从 Cowork 开始推动 Claude 从聊天工具变成干活的 Agent,现在又把 Agent 模式本身藏了起来。用户不用管背后是 Chat、Cowork、Docs 还是 Slides,只管告诉 Claude 自己要什么。

信源

动察 Beating 频道 · 动察 Beating 交流群
👍41
Cosmos Ventures宣布成立,押注AI时代「哲学家型创业者」

9 月 17 日,Cosmos Ventures 宣布正式成立,计划投资于致力于为 AI 时代创建新型机构和基础设施的「哲学家型创业者」。Brendan McCord 与 Matt Mandel 推出规模 7760 万美元的 Fund I,将支持为 AI 时代创立机构的哲学家型建设者。

McCord 为 Cosmos Institute 与 Cosmos Ventures 创始人,Mandel 来自 Union Square Ventures。该基金已投资 AIUC、Prime Intellect、Workshop Labs(已被 Thinking Machines 收购)及一家未公开教育公司,LP 包括 Reid Hoffman、Joe Liemandt、Stand Together、Fred Wilson、Micky Malka 与 Astera Institute。

Cosmos Ventures 认为,AI 正在打破「智能与人类绑定」的传统假设。过去,分析、创意和关键决策通常需要由人类完成,并由具体个人承担责任,而 AI 的发展正在改变这一模式。现有学校、媒体、保险等制度也可能因此面临重新设计的需求。

Cosmos Ventures 表示,其重点关注的创业者需要回答「我们希望建立怎样的社会」以及「哪些决策应该交给 AI、哪些必须由人类掌握」等规范性问题,而不仅是通过用户反馈持续迭代产品。该机构将这一理念概括为「Condere aude」,即「敢于创立」。

信源

动察 Beating 频道 · 动察 Beating 交流群
🤡1
Manus拟融资5亿美元,估值或升至40亿美元

据彭博社报道,中国背景 AI 初创公司 Manus 正计划完成一轮约 5 亿美元融资,估值有望达到 40 亿美元,较此前 20 亿美元估值翻倍。知情人士称,该轮融资已接近完成,但交易仍处于早期阶段,具体条款和投资者名单可能发生变化。

这是 Manus 与 Meta 分拆后首次融资。此前,Meta 曾以约 20 亿美元收购 Manus,但该交易遭中国监管部门阻止,双方随后完成运营分拆并停止数据共享。Manus 本月已恢复独立运营,创始团队将继续负责公司发展。

Manus 现有投资方包括腾讯、HSG 和真格基金。若本轮融资按 40 亿美元估值完成,Manus 将成为中国估值最高的 AI Agent 公司之一。彭博称,公司未来可能效仿月之暗面等 AI 公司,寻求在香港上市。

不过,Manus 也面临基础模型能力快速提升带来的竞争压力,包括 Kimi 和 Claude 等模型正在增强桌面任务处理能力,而 Manus 本身并未从零训练基础模型。

信源

动察 Beating 频道 · 动察 Beating 交流群
地瓜机器人半年融6.7亿美元,不造整机专卖机器人芯片和底座

由地平线孵化的地瓜机器人完成 4 亿美元 C 轮融资,未来资产领投,美团战投等参与。地瓜不造机器人整机,主要提供机器人计算芯片和软硬件开发平台。这已经是它今年第三笔大额融资。3 月和 4 月,公司先后完成 1.2 亿美元 B1 轮和 1.5 亿美元 B2 轮,半年合计融资 6.7 亿美元,累计公开融资约 7.7 亿美元。

公司称,旭日系列芯片累计出货已突破 800 万片,2026 年上半年营收同比增长数倍。面向具身智能的旭日 S600 已进入优必选、自变量、千寻智能等 20 多家客户。7 月披露时,多数项目还处于真机适配和场景测试阶段,这次公司称多数已经进入量产级出货。

地瓜的路线更像机器人行业的「卖铲人」。一套芯片和开发平台同时服务人形、工业轮式、消费机器人等不同产品。这轮融资除了继续扩充旭日芯片,还会建设覆盖数据采集、模型训练、仿真验证到端侧部署的软件平台,把机器人从训练到装机的工具链一起做掉。

信源

动察 Beating 频道 · 动察 Beating 交流群
谷歌让Agent学会「做梦」:复盘过去试错,下一轮自己少走弯路

谷歌研究团队发布 Dream-RSI,让 AI Agent 做完一轮任务后,把过去的成功和失败拿来「做梦」。系统会保存每次尝试和结果,再利用这些旧记录推演不同做法,比如先试哪条路、什么时候放弃、要不要同时多试几个方案。因为结果以前已经跑过,这些推演不用重新执行任务。

系统会从中选出表现更好的做法,直接用到下一轮。新一轮又会留下更多成功和失败,再拿来「做梦」、继续改策略。这样一轮接一轮,就是论文所谓的「递归自我改进」。目前底层模型本身不会变化,真正被改进的是 Agent「下一步怎么做」的方法。

论文在算法、数学优化和 GPU kernel 等 8 个任务上测试了这套方法。以 Gemini 3.1 Pro 的一个算法任务为例,相比固定做法,Agent 调用从 550 次降到 317 次,同时最终找到的程序运行得更快。

信源

动察 Beating 频道 · 动察 Beating 交流群
🤡7
Meta给Muse上裂变拉新:邀1人送10亿Token,最多拿200亿

Meta 的个人 AI Agent Muse 上线邀请码。Alexandr Wang 宣布,朋友注册时使用你的邀请码,双方各得 10 亿 Muse Token,最多可以邀请 20 人。拉满后,邀请者还能提前体验电话等新功能。

这个奖励相当大。Muse 免费版目前每周提供 1 亿 Token,成功邀请 1 人拿到的奖励,数量上等于 10 周免费额度;拉满 20 人就是 200 亿 Token,相当于 200 周的基础免费额度。

Muse 上周刚在美国上线,可以自己浏览网页、连接 App,并代用户发邮件、购物和订行程。上线后一直稳居美国 App Store 总榜前几名。Meta 现在直接用大额 Token 奖励,把首批用户变成拉新渠道。

邀请码:YT6O60

信源

动察 Beating 频道 · 动察 Beating 交流群
💩3
Grok Build也有长期记忆了,/dream自动整理每轮项目经验

Grok Build 上线自动长期记忆。每轮任务结束后,它会在后台记下值得长期保留的项目约定、决定和事实,下次打开同一项目时直接接着用,不用用户重新解释。

这些记忆都以 Markdown 保存。/memory 可以直接查看,/dream 会把近期零散笔记合并成测试、代码风格等不同主题,而且系统也会定期自动执行。

这套思路并不新。Claude Code 今年 2 月就已经加入 Auto Memory,同样会自动记录项目知识,并整理成 MEMORY.md 和主题文件,/memory 也能查看管理。Codex 此后也加入了自动提取和整理历史记忆的机制。

信源

动察 Beating 频道 · 动察 Beating 交流群
👍1🤔1
QuiverAI Arrow2上线:SVG生成更快,还能直接改和做动画

AI 矢量设计公司 QuiverAI 正式上线 Arrow 2 和更强的 Arrow 2 Telos。两款模型专门生成 SVG 矢量图。相比上一代 Arrow 1.1,Arrow 2 重点提升生成速度和成图质量,并新增 SVG 编辑和动画能力。

QuiverAI 称,Arrow 2 会用更少、更精准的控制点画出路径,减少多余节点和重叠,也更会处理间距、留白和对齐。它还能直接修改已有 SVG,并给其中的形状和分组加入微动画。

更强的 Arrow 2 Telos 面向复杂风格、构图和长需求。它的上下文达到 105 万 Token,普通 Arrow 2 为 131,072 Token,相差约 8 倍;API 单价则高 50%。

信源

动察 Beating 频道 · 动察 Beating 交流群
👍1
腾讯AI语音输入工具Chatterfly开启内测

腾讯 AI 语音输入工具 Chatterfly 已经上线官网并开启限时内测,目前开放 Windows 和 macOS 客户端。

用户按 Fn 直接说话,它会把口语整理成可以直接发送的文字,并根据当前场景和上下文调整表达。

Chatterfly 还把 Skills 直接塞进了输入工具。首批包括工作汇报、项目推进、营销文案、VibeCoding 提示词优化、会议纪要等 6 个 Skills。比如口述一段零散的开发需求,它可以整理成目标、约束和验收标准,再直接交给 Agent 执行。用户修改语音识别结果后,Chatterfly 还会自动学习专有名词,也支持手动维护个人词库。

信源

动察 Beating 频道 · 动察 Beating 交流群
🎉2
「不会聊天」的AI可以怎么玩?开发者用Jev接管Agent快速决策

前 OpenAI 研究员 Diogo Almeida 创办的 TypeSafe 昨天刚发布新模型 Jev。它不生成文本,只返回选项、分数和概率。社区很快出现一批开源项目,开始把 Jev 塞进 Agent 和软件流程里。

Browser Use 做的 jev-ultrafast 最直观。浏览器每走一步,Jev 都会从当前页面里判断「下一步做什么、操作哪个元素」,只有需要填写文字时才调用一个小型语言模型。团队用它在 Google Flights 搜索苏黎世到伦敦的航班,一次完整运行只用了 7.1 秒。

Jev Codex Router 让 Jev 先判断每轮编程任务的难度,再决定交给不同档位的模型;jev-mcp 则把它做成 Agent 的事实核验、Prompt Injection 检测和语义排序工具。

这些项目有个很明显的共同点:没人拿 Jev 当聊天机器人,而是把它塞进软件和 Agent 的执行链里,专门负责那些高频、有限选项的判断。

动察 Beating 频道 · 动察 Beating 交流群
👍2
Rene上线「多人Agent」,直接在iMessage里替你和朋友协调时间

薛天禄创办的 AI 创业公司 Second Enlightenment 推出个人 Agent 助手 Rene。它直接运行在 iMessage 里,用户像发短信一样就能让它干活。Rene 能使用浏览器、处理邮件和日历,也能购物、写代码、做网站、演示文稿和图片。

Rene 主打「多人协作」。它可以加入群聊,也能和朋友的 Rene 直接沟通。比如约饭时,双方的 Rene 可以分别查看日历,自动找出都有空的时间,再交给各自用户确认。原本需要几个人来回商量的事,可以先让 Rene 在后台协调。

薛天禄此前在小红书和字节跳动做过产品。他称自己已经用了 Rene 四个月,让它找办公室、准备会议,还会让它收集团队的晚餐意见。

Rene 也会记住过去的信息,并主动提醒和跟进。

信源

动察 Beating 频道 · 动察 Beating 交流群