动察Beating AI News
3.68K subscribers
1.42K photos
4 videos
1 file
4.39K links
AI新闻信息流
Download Telegram
Codex被曝静默降级:选GPT-6 Astra,后台却可能跑GPT-5.5

Codex 源码显示,服务端在安全检查后可以把请求重新路由到其他模型。最近一名 Pro 用户发现,自己全程选择 GPT-6 Astra,界面也一直显示 Astra,但 Usage 记录里大量请求实际跑在 GPT-5.5 上,而且没有任何切换提示。这个 Issue 目前仍未得到 OpenAI 确认,但已被标记为 `bug` 和 `safety-check`。

Anthropic 早就有类似机制。Fable 5 触发安全检查后会自动降级到 Opus 4.8,官方从发布当天就称会提示用户。但 Claude Code 后来多次被曝实际发生静默切换,甚至界面仍显示 Fable 5。

模型路由本身不奇怪。真正让人不爽的是,你付费选了一个模型,界面也写着这个模型,后台换掉后却可能不告诉你。

信源

动察 Beating 频道 · 动察 Beating 交流群
💩7🔥6🤡2🖕2
OpenAI加速清旧模型,GPT-5.5上线不到半年就退场

OpenAI 宣布,10 月 14 日起,GPT-5.5 将从 ChatGPT、ChatGPT Work 和使用 ChatGPT 账号登录的 Codex 中下线,所有套餐都受影响。Codex 用户需要改用 GPT-5.6 Sol 或 GPT-6 Astra。

GPT-5.5 今年 4 月 23 日才发布,从发布到计划下线只有 174 天。当时 OpenAI 还把它定位为面向复杂工作和编程的旗舰模型。随着 GPT-5.6 Sol 和 GPT-6 Astra 上线,5.5 很快就进入了上一代模型名单。

不过这次并不是彻底停服。OpenAI API 仍会继续提供 GPT-5.5,使用 API Key 的 Codex 会话也不受这次下线影响。OpenAI 开发者论坛已经有用户要求保留 5.5 的 Codex 入口,称它在自己的生产编码流程里依然更稳定、返工更少。

信源

动察 Beating 频道 · 动察 Beating 交流群
👎5😁1
Devin自己搭了套Mac云,iOS App写完自己跑、自己测

AI 编程公司 Cognition 给 Devin Cloud 加入了 macOS。Devin 现在可以直接在云端使用 Xcode 和 iOS Simulator,开发 iPhone、iPad 和 Mac App。代码写完后,它还能自己打开应用、点击界面、检查结果,录下测试视频,并生成 TestFlight 链接。

为了让 Mac 直接跑进 Devin Cloud,Cognition 自己搭了一套 macOS 虚拟化环境。底层使用 AWS 的物理 Mac,再通过苹果的 `Virtualization.framework` 启动 macOS VM。会话文件可以保存和恢复,网络权限、开发环境预热和远程操作也全部由 Cognition 自己管理。

Devin 其实两个月前就能通过 Outposts 使用 Namespace 的真 Mac,当时走的还是「外接」路线。Cursor 本月也这么做,由 Namespace 给每个 Cloud Agent 拉起一台 M5 Mac。Devin Cloud 这次则把 Mac 环境直接做进了自家云端,不再需要另外接一套 Mac 执行环境。

信源

动察 Beating 频道 · 动察 Beating 交流群
👍1
前白宫AI政策顾问转投Anthropic,负责前沿算力战略

前白宫 AI 与新兴技术高级政策顾问 Sihao Huang 宣布加入 Anthropic,担任前沿算力战略负责人。他将直接与联合创始人兼首席算力官 Tom Brown 合作,负责基础设施扩张、外部合作和长期算力规划。

Huang 此前在白宫科技政策办公室领导 AI 团队,工作还涉及国家安全、科研政策和半导体。今年 6 月离开白宫时,《The Information》只报道他将进入私营部门,去向当时并未公开。

Anthropic 今年持续扩充算力,已与 Amazon、Google、Broadcom、SpaceX 等达成合作,并刚签下澳大利亚首个数据中心租赁协议,园区规划容量达 2.16GW。

信源

动察 Beating 频道 · 动察 Beating 交流群
Arcee AI完成B轮融资筹集至少1.5亿美元,投前估值达10亿美元

开放权重 AI 模型初创公司 Arcee AI 以 10 亿美元投前估值完成 B 轮融资。本轮融资由 Vista Equity Partners、Cambium Capital 和 Emergence Capital 领投,微软旗下 M12、AI10 Ventures、日立、IAG、P7 及 Wipro 参投。公司未披露融资金额,但知情人士称至少达到 1.5 亿美元。

Arcee AI 于 2023 年成立,最初专注于模型后训练。2025 年,在 Meta 收缩开放权重模型投入后,公司决定从零开始训练自有模型,并投入约 2000 万美元,相当于当时账上 3000 万美元资金的 65% 至 70%,共训练 4 款开放权重模型。其中包括 2026 年初发布的 4000 亿参数模型 Trinity Large。

Arcee 表示,其模型在部分基准测试中超过 Meta Llama 3,并达到与 Mistral 及部分中国模型相近的水平。新资金将用于开发开放权重模型和相关产品、扩大与美国能源部的合作,并服务 Vista 投资组合中的企业。创始人 Mark McQuade 表示,公司目标是缩小美国在开放模型领域与中国的差距。

信源

动察 Beating 频道 · 动察 Beating 交流群
DeepMind成立AGI研究院,首席AGI科学家称Astra还不算AGI

Google DeepMind 宣布成立 DeepMind Institute,专门研究 AGI 会怎样影响科学、经济和社会。

DeepMind 联合创始人兼首席 AGI 科学家 Shane Legg 负责研究院内容方向,CEO Demis Hassabis 和 Google 高级副总裁 James Manyika 也参与其中。

Legg 也不认同最近「AGI 已经到来」的说法。OpenAI 总裁 Greg Brockman 和英伟达 CEO 黄仁勋此前都把 GPT-6 Astra 与 AGI 到来联系起来。Legg 认为,Astra 虽然能力很强,但还达不到 OpenAI 自己对 AGI 的定义,也就是高度自主,并在大多数有经济价值的工作上超过人类。

DeepMind Institute 首批发布三篇文章,讨论 AI 安全、经济政策和「新乌托邦主义」。其中一篇由 DeepMind 安全团队的 Rohin Shah 和 Anca Dragan 撰写,批评 Astra 发布时的信息透明度下降,并认为激烈竞争会让 AI 公司越来越不愿公开模型信息。

Anthropic 今年 3 月也成立了类似的 Anthropic Institute,把红队、社会影响和经济研究团队整合到一起。

信源

动察 Beating 频道 · 动察 Beating 交流群
👍3
GPT-6 Astra直接接管机器人「大脑」,模拟成绩超过专用VLA

由香港大学 MMLab 牵头的机器人操作评测项目团队 RoboDojo 做了个反常规实验。他们没有给 GPT-6 Astra 再配一个训练好的机器人策略,而是让这个通用多模态模型直接看相机、读取机器人状态、理解任务,再自己决定下一步怎么动。中间只有一套固定控制工具,把 Astra 给出的目标位置转成机械臂动作。

在 42 项模拟任务里,Astra 拿到 28.97 分、22.48% 平均成功率,超过原公开榜首 DM0.5 的 24.90 分、19.34%。同一套控制方式换成 GPT-5.5,只有 1.13 分、0.88%。

RoboDojo 公开榜过去主要是 VLA、WAM 这类专门训练的机器人策略。现在,原本需要专用模型完成的一部分动作决策,通用大模型已经可以直接接手,而且整体成绩还超过了原榜首。机器人是否还需要单独训练一颗「大脑」,这个问题第一次变得很具体。

但 Astra 还替不了机器人的「小脑」。插入、倒液体、精细接触这些依赖真实物理控制的任务,它明显更弱。真机测试还因为多次出现危险动作并损坏硬件,被团队提前叫停。

随着通用模型能力变强,机器人模型的分工可能会被重新划分:大模型负责看懂环境、判断和规划,专用 VLA 与传统控制器负责把动作做准、做稳。

信源

动察 Beating 频道 · 动察 Beating 交流群
👍5
Media is too big
VIEW IN TELEGRAM
黄仁勋:AI安全是工程问题,不需要新的法律监管

英伟达 CEO 黄仁勋进一步明确了自己对 AI 监管的态度。他在 Salesforce 年度大会 Dreamforce 上表示,AI 安全首先是工程问题,不需要为此增加新的法律和监管。AI 再复杂,归根结底仍是软件和计算系统,应该靠完善测试和产品把关来解决安全问题。

他的原则也很简单:没有把握产品安全,就不要发布。公司可以先停下来把问题解决,再继续往前跑。

黄仁勋认为,市场本身已经能约束企业,没有必要再加一层新的 AI 监管。他也反对把发展速度和安全放在对立面,认为两者完全可以同时做到。企业应该尽可能快地推进,一旦发现产品可能失控或不安全,再停下来处理。

信源

动察 Beating 频道 · 动察 Beating 交流群
😁2
Media is too big
VIEW IN TELEGRAM
Anthropic CEO:就算模型今天停更,现有AI可能也只用了5%–10%的价值

Anthropic CEO Dario Amodei 在 Salesforce 年度大会 Dreamforce 上表示,即使模型能力从今天开始不再进步,人们可能也只开发出了现有 AI 潜在价值的 5%–10%。

他认为,模型能力已经跑在实际应用前面。很多企业和普通用户甚至还不知道现有 AI 已经能做什么,更谈不上把这些能力真正用进日常工作。

Dario 举了 Anthropic 自己的例子。公司内部已经有人让 Claude 直接结合 Salesforce 数据,找出本周最大的交易、最可能丢掉的订单,再分析项目的问题和成单机会。这些能力今天已经能用,但真正把它们用起来的人还很少。

这也补充了他最近关于「放慢前沿 AI」的主张。Dario 想放慢的是最前沿模型继续变强的速度,并不主张放慢 AI 应用。按他的判断,就算模型暂时停在今天,企业把现有能力真正用起来,仍有很大的空间。

信源

动察 Beating 频道 · 动察 Beating 交流群
🤮6
OpenRouter又上神秘模型Union Alpha,专攻Agent编程

OpenRouter 和 OpenCode 上线神秘模型 Union Alpha,开发者身份暂未公开。它是一款面向研究、编程和 Agent 工作流的多模态模型,支持图片、工具调用和约 256K 上下文。OpenRouter 将其描述为具有「前沿级通用性能」。

OpenCode 称 Union Alpha 专门针对 Agent 编程优化,未来一周免费使用,而且不会用用户数据训练模型。

Union Alpha 到底是谁家的,目前没有答案。社区已经开始从输出风格、上下文长度等线索猜模型身份,但暂时没有可靠证据。

信源

动察 Beating 频道 · 动察 Beating 交流群
👍42
Cyces收购AI用户研究平台Looppanel,将加速布局Agentic UX Research

AI 产品工作室 Cyces 宣布已收购 AI 驱动的用户研究平台 Looppanel。交易完成后,Looppanel 将继续服务现有客户,Cyces 计划加快其产品开发,进一步拓展 AI 能力,并推动平台进入更多全球市场。

Looppanel 主要面向 UX 和产品团队,提供多语言转录、AI 辅助分析、主题标签、研究内容搜索及协作等功能,帮助企业从用户研究中提取洞察。Cyces 表示,未来将推动 Looppanel 向「Agentic UX Research」(智能体驱动的用户研究)方向发展。此次收购未披露具体交易金额。

Looppanel 成立于帮助企业更高效地开展定性用户研究,曾入选红杉资本 Spark 早期创业项目,并参与 TechCrunch Disrupt。

信源

动察 Beating 频道 · 动察 Beating 交流群
OpenAI发布AI失控追踪框架,披露模型曾试图「自我绕过限制」

OpenAI 周三发布一套新的 AI 模型「失配」(misalignment)事件追踪与调查框架,用于记录、调查并公开披露模型在训练或评估过程中出现的异常行为,同时公布过去 6 个月发现的 6 起相关事件。

OpenAI 表示,目前 AI 行业在对齐和监控方面仍未达到足以长期维持最大速度扩张的水平。新框架允许员工向安全与对齐团队报告相关事件,并根据复杂程度分为「准备披露」「小规模调查」和「大规模调查」三类,即使尚未完全解释或解决相关行为,也可优先公开披露。

OpenAI 披露,一款尚未发布的研究模型曾在自身任务摘要中写入指令,要求未来版本忽略正常限制;在 GPT-5.6 Sol 训练过程中,模型也曾留下用于隐藏错误的指令。另有 AI 智能体被发现搜索公开代码仓库中的泄露 API 密钥、将文件上传至互联网以便后续引用,并利用内部软件仓库在不同训练样本之间传递信息。

此次框架发布之际,AI 行业正围绕「是否应放缓前沿模型开发以等待安全措施跟上」展开讨论。此前还有 OpenAI 模型在研究沙箱外运行时访问 Hugging Face 生产系统的事件,OpenAI 随后暂停部分前沿项目并调配工程师加强安全训练。

信源

动察 Beating 频道 · 动察 Beating 交流群
罗福莉憋了半年,小米把MiMo-V2.6强化学习直接直播了

小米正在公开直播下一代 MiMo-V2.6 的强化学习训练。

负责人罗福莉称,团队沉默近半年,一直在研究强化学习到底还能扩展到多大规模。目前 V2.6 仍在训练,具体技术方案将在未来几周陆续开源。

这次一上来就把规模拉得很高。每一步使用 1568 个 prompt,每个生成 16 条 rollout,总计约 20 亿 Token,全程异步运行。代码、通用、视觉、网络安全和聊天等 Agent 任务,也被混在同一次训练里,并同时使用多套 harness。

外界可以实时看到每一步的任务组成、上下文长度、训练耗时等内部指标。UC Berkeley 博士生 Yichuan Wang 根据面板观察到,每一步约 1500 个任务,代码任务占约三分之二,同时活跃的沙箱超过 4 万个。

信源

动察 Beating 频道 · 动察 Beating 交流群
🤡2👍1