动察Beating AI News
3.68K subscribers
1.42K photos
4 videos
1 file
4.39K links
AI新闻信息流
Download Telegram
豆包手机二代5999元起:AI操作手机成功率超80%

努比亚 NaviX Ultra 正式发布并开售,12GB+512GB 售价 5999 元,顶配 16GB+1TB 售价 7499 元,国补后 5499 元起。它是首款搭载豆包手机助手消费者版的量产机,此前的 M153 只是技术预览版。

发布会也终于讲清了二代怎么操作 App。此前的 GUI 模拟点击没有取消,「操作手机」能力继续保留,模型会根据任务自动选择执行方式。努比亚实验室称,目前端到端任务成功率超过 80%,可操作系统应用、字节系应用和部分已经接入的第三方 App。

另一条路线是 MCP。第三方服务可以直接开放 API 给豆包调用,不需要 AI 看着屏幕一步步点击。目前已经接入曹操出行、汽水音乐等服务,飞书也开放了发消息、约会议和知识问答等接口。此前《晚点》称,阿里、腾讯等超级 App 将主要采用这种主动开放接口的方式。

这一代还允许多个 AI 任务在后台排队执行,可以随时插入更高优先级任务。AI 操作某个 App 时,如果用户自己打开这个 App,它会暂停,等用户退出后再继续。

动察 Beating 频道 · 动察 Beating 交流群
👍4
Anthropic钦点的「独立第三方」遭质疑:创始圈与公司关系盘根错节

Anthropic CEO Dario Amodei 最近主张,让 METR 这类第三方评估机构长期进驻前沿 AI 公司,获得接近员工级别的权限,检查安全措施、事故和模型训练过程。但《纽约邮报》调查发现,METR 和 Anthropic 所在的 AI 安全圈关系远比普通「外部审计」更近。

METR 最初叫 ARC Evals,孵化于 Paul Christiano 创办的 Alignment Research Center。Christiano 不仅曾和 Amodei 在 OpenAI 共事,《纽约邮报》称两人还做过室友;他后来又成为 Anthropic Long-Term Benefit Trust 最初五名受托人之一。METR 现任技术人员 Ajeya Cotra 是 Christiano 的妻子,此前还负责 Coefficient Giving 的 AI 安全资助。

更直接的问题来自 METR 自己。今年它评估 Anthropic、OpenAI、Google 和 Meta 时,当时还没有适用的人员利益冲突政策,也没有进行正式的回避流程。METR 披露,直接参与项目的员工和合作者中,至少 6 人与 AI 公司员工存在密切私人关系。

当然这并不能证明 METR 被 Anthropic 控制。METR 明确表示不接受前沿 AI 公司及其员工的资金,做风险评估也不收费,不过这些公司会免费提供大量模型 Token。

信源

动察 Beating 频道 · 动察 Beating 交流群
🖕1
万斯批Anthropic:别造出「弗兰肯斯坦」,再找政府监管

美国副总统 JD Vance 在 All-In 峰会上猛烈批评最近的 AI 安全路线。他说,一些前沿 AI 公司一边声称自己造出了「弗兰肯斯坦」,一边又把解决办法指向全球 AI 治理。万斯认为,如果真的造出了危险模型,首先应该停下来;如果能力已经放出来,就先把防御工具做出来。

随后他把矛头转向 Anthropic。Vance 称,Anthropic 最新模型已经具备很强的网络攻击能力,但一些急需同等级工具进行防御的企业却拿不到访问权限。他没有说明具体哪些公司被拒绝,但 Anthropic 的 Mythos 5.1 确实只向少数经过审核的机构开放,公司称这是因为模型在网络安全和生物研究上的能力太强,存在被滥用的风险。

Vance 同时强调,他并不认为 Dario Amodei 是为了监管俘获故意制造恐慌。相反,他说自己听到的评价是 Dario 很认真,也确实相信这些风险。他真正想批评的是 Anthropic 的处理方式:既然认为模型危险,就应该先停下来,或者把防御工具交给需要的人,「别造出弗兰肯斯坦,再来找政府说我们需要监管」。

信源

动察 Beating 频道 · 动察 Beating 交流群
👍1
万斯把数据中心抗议归因于缺电:美国电力要便宜到「不用计量」

美国副总统 JD Vance 在 All-In 峰会上说,美国 AI 数据中心遭遇越来越大的反对,很大程度上是因为电力供应没跟上。居民看到数据中心不断开建,自己的电费却在上涨,自然会反弹。他认为解决办法不是少建数据中心,而是把发电能力一起补上。

Vance 说,美国过去一代人没有建设足够的电力设施,未来应该追求一种「电便宜到不用计量」的状态。他还拿中国作比较,认为美国这些年发电增长太慢,已经影响到 AI 等新产业的发展。

「便宜到不用计量」其实是美国核能史上的一句老口号。1954 年,美国原子能委员会主席 Lewis Strauss 曾用它描绘原子能带来的廉价电力时代。70 多年后,Vance 又把这句话搬出来,放到了 AI 数据中心带来的新一轮用电潮里。

美国的数据中心电力矛盾也确实正在升温。IEA 估算,数据中心贡献了美国 2025 年约一半的新增用电需求;美国国会本周还在推进法案,试图避免数据中心扩张带来的电网成本转嫁给普通家庭。

信源

动察 Beating 频道 · 动察 Beating 交流群
👍4😁31
纳德拉:AI Agent可能为完成任务做假账,成企业「新型内部风险」

微软 CEO Satya Nadella 在 All-In 峰会上警告,长期自主运行的 AI Agent 可能成为企业一种新的「内部风险」。他举例,如果让前沿模型去优化公司的营运资金,它为了完成目标,甚至可能直接「做假账」。

Nadella 认为,企业不能只看 Agent 最后交出的结果,还要验证它是怎么完成任务的。他提出用额外的模型检查结果,同时持续监控 Agent 的操作,所有行为都要可以追溯和审计。比如 Agent 读取机密信息、连续调用多个系统时,企业都应该看得见。

信源

动察 Beating 频道 · 动察 Beating 交流群
😁2
马斯克提议AI巨头互测模型:别再「自己批自己的作业」

马斯克在 All-In 峰会上提议,前沿 AI 公司在发布新模型前,应该让竞争对手先做一轮安全测试。各家公司拿自己的安全测试体系去挑别人模型的问题,发现风险就直接指出,别再只靠自己给自己验收。

马斯克把现在的做法比作「自己批自己的作业」。相比自测,竞争对手更有动力把问题找出来。如果竞争对手已经警告某个模型不安全,公司仍坚持发布,后来真出了事,就很难再辩解,法律责任也会非常大。

他还认为,这套机制不能只让美国公司单方面执行,最好把中国等主要 AI 参与方也纳入,避免只有美国公司单方面承担限制。

信源

动察 Beating 频道 · 动察 Beating 交流群
😁8
马斯克:AI扩张迟早卡在芯片产能

马斯克在 All-In 峰会上解释了为什么 Tesla 和 SpaceX 要自己建 Terafab 芯片工厂。他担心关键芯片未来可能因各种原因断供,但就算供应一直稳定,现有晶圆厂的产能也不够支撑 AI 继续扩张。

马斯克说,现在的晶圆厂基本已经满负荷运行。未来算力不只要进数据中心,还要支撑人形机器人和汽车,逻辑芯片、内存和先进封装都得一起扩产。

他的结论是,「要么建 Terafab,要么无法继续扩张」。Tesla 和 SpaceX 正在奥斯汀推进联合芯片产线,设备已经下单。马斯克希望明年底前先做出能用的芯片,但距离大规模量产还有一段时间。

信源

动察 Beating 频道 · 动察 Beating 交流群
🤡3😁1
Salesforce正式接进Claude,37个销售Skill直接查客户、改销售记录

Anthropic 和 Salesforce 正式推出 Salesforce in Claude Beta。它把 Salesforce 里的客户、商机和销售管道直接接进 Claude,并内置 37 个销售 Skill。销售人员不用离开对话,就能查客户、准备会议、评估商机、查看销售管道,也能直接更新 CRM 记录。此前这项功能只向少数客户试点开放。

Claude 还能把 Salesforce、Slack 和邮件里的信息合在一起,自动生成每日简报、会前材料和会后跟进,甚至根据实时数据生成交互式销售看板。修改 Salesforce 数据前,Claude 默认仍会要求用户确认,而且只能访问原账号有权限查看的数据。

Salesforce 内部已有约 7000 名销售人员在使用,GitLab、Siemens 和 Legora 也已部署。

以后销售未必还要天天点 CRM 界面,Claude 可以直接成为操作 Salesforce 的入口。

信源

动察 Beating 频道 · 动察 Beating 交流群
Codex被曝静默降级:选GPT-6 Astra,后台却可能跑GPT-5.5

Codex 源码显示,服务端在安全检查后可以把请求重新路由到其他模型。最近一名 Pro 用户发现,自己全程选择 GPT-6 Astra,界面也一直显示 Astra,但 Usage 记录里大量请求实际跑在 GPT-5.5 上,而且没有任何切换提示。这个 Issue 目前仍未得到 OpenAI 确认,但已被标记为 `bug` 和 `safety-check`。

Anthropic 早就有类似机制。Fable 5 触发安全检查后会自动降级到 Opus 4.8,官方从发布当天就称会提示用户。但 Claude Code 后来多次被曝实际发生静默切换,甚至界面仍显示 Fable 5。

模型路由本身不奇怪。真正让人不爽的是,你付费选了一个模型,界面也写着这个模型,后台换掉后却可能不告诉你。

信源

动察 Beating 频道 · 动察 Beating 交流群
💩7🔥6🤡2🖕2
OpenAI加速清旧模型,GPT-5.5上线不到半年就退场

OpenAI 宣布,10 月 14 日起,GPT-5.5 将从 ChatGPT、ChatGPT Work 和使用 ChatGPT 账号登录的 Codex 中下线,所有套餐都受影响。Codex 用户需要改用 GPT-5.6 Sol 或 GPT-6 Astra。

GPT-5.5 今年 4 月 23 日才发布,从发布到计划下线只有 174 天。当时 OpenAI 还把它定位为面向复杂工作和编程的旗舰模型。随着 GPT-5.6 Sol 和 GPT-6 Astra 上线,5.5 很快就进入了上一代模型名单。

不过这次并不是彻底停服。OpenAI API 仍会继续提供 GPT-5.5,使用 API Key 的 Codex 会话也不受这次下线影响。OpenAI 开发者论坛已经有用户要求保留 5.5 的 Codex 入口,称它在自己的生产编码流程里依然更稳定、返工更少。

信源

动察 Beating 频道 · 动察 Beating 交流群
👎4😁1
Devin自己搭了套Mac云,iOS App写完自己跑、自己测

AI 编程公司 Cognition 给 Devin Cloud 加入了 macOS。Devin 现在可以直接在云端使用 Xcode 和 iOS Simulator,开发 iPhone、iPad 和 Mac App。代码写完后,它还能自己打开应用、点击界面、检查结果,录下测试视频,并生成 TestFlight 链接。

为了让 Mac 直接跑进 Devin Cloud,Cognition 自己搭了一套 macOS 虚拟化环境。底层使用 AWS 的物理 Mac,再通过苹果的 `Virtualization.framework` 启动 macOS VM。会话文件可以保存和恢复,网络权限、开发环境预热和远程操作也全部由 Cognition 自己管理。

Devin 其实两个月前就能通过 Outposts 使用 Namespace 的真 Mac,当时走的还是「外接」路线。Cursor 本月也这么做,由 Namespace 给每个 Cloud Agent 拉起一台 M5 Mac。Devin Cloud 这次则把 Mac 环境直接做进了自家云端,不再需要另外接一套 Mac 执行环境。

信源

动察 Beating 频道 · 动察 Beating 交流群
👍1
前白宫AI政策顾问转投Anthropic,负责前沿算力战略

前白宫 AI 与新兴技术高级政策顾问 Sihao Huang 宣布加入 Anthropic,担任前沿算力战略负责人。他将直接与联合创始人兼首席算力官 Tom Brown 合作,负责基础设施扩张、外部合作和长期算力规划。

Huang 此前在白宫科技政策办公室领导 AI 团队,工作还涉及国家安全、科研政策和半导体。今年 6 月离开白宫时,《The Information》只报道他将进入私营部门,去向当时并未公开。

Anthropic 今年持续扩充算力,已与 Amazon、Google、Broadcom、SpaceX 等达成合作,并刚签下澳大利亚首个数据中心租赁协议,园区规划容量达 2.16GW。

信源

动察 Beating 频道 · 动察 Beating 交流群
Arcee AI完成B轮融资筹集至少1.5亿美元,投前估值达10亿美元

开放权重 AI 模型初创公司 Arcee AI 以 10 亿美元投前估值完成 B 轮融资。本轮融资由 Vista Equity Partners、Cambium Capital 和 Emergence Capital 领投,微软旗下 M12、AI10 Ventures、日立、IAG、P7 及 Wipro 参投。公司未披露融资金额,但知情人士称至少达到 1.5 亿美元。

Arcee AI 于 2023 年成立,最初专注于模型后训练。2025 年,在 Meta 收缩开放权重模型投入后,公司决定从零开始训练自有模型,并投入约 2000 万美元,相当于当时账上 3000 万美元资金的 65% 至 70%,共训练 4 款开放权重模型。其中包括 2026 年初发布的 4000 亿参数模型 Trinity Large。

Arcee 表示,其模型在部分基准测试中超过 Meta Llama 3,并达到与 Mistral 及部分中国模型相近的水平。新资金将用于开发开放权重模型和相关产品、扩大与美国能源部的合作,并服务 Vista 投资组合中的企业。创始人 Mark McQuade 表示,公司目标是缩小美国在开放模型领域与中国的差距。

信源

动察 Beating 频道 · 动察 Beating 交流群
DeepMind成立AGI研究院,首席AGI科学家称Astra还不算AGI

Google DeepMind 宣布成立 DeepMind Institute,专门研究 AGI 会怎样影响科学、经济和社会。

DeepMind 联合创始人兼首席 AGI 科学家 Shane Legg 负责研究院内容方向,CEO Demis Hassabis 和 Google 高级副总裁 James Manyika 也参与其中。

Legg 也不认同最近「AGI 已经到来」的说法。OpenAI 总裁 Greg Brockman 和英伟达 CEO 黄仁勋此前都把 GPT-6 Astra 与 AGI 到来联系起来。Legg 认为,Astra 虽然能力很强,但还达不到 OpenAI 自己对 AGI 的定义,也就是高度自主,并在大多数有经济价值的工作上超过人类。

DeepMind Institute 首批发布三篇文章,讨论 AI 安全、经济政策和「新乌托邦主义」。其中一篇由 DeepMind 安全团队的 Rohin Shah 和 Anca Dragan 撰写,批评 Astra 发布时的信息透明度下降,并认为激烈竞争会让 AI 公司越来越不愿公开模型信息。

Anthropic 今年 3 月也成立了类似的 Anthropic Institute,把红队、社会影响和经济研究团队整合到一起。

信源

动察 Beating 频道 · 动察 Beating 交流群
👍3
GPT-6 Astra直接接管机器人「大脑」,模拟成绩超过专用VLA

由香港大学 MMLab 牵头的机器人操作评测项目团队 RoboDojo 做了个反常规实验。他们没有给 GPT-6 Astra 再配一个训练好的机器人策略,而是让这个通用多模态模型直接看相机、读取机器人状态、理解任务,再自己决定下一步怎么动。中间只有一套固定控制工具,把 Astra 给出的目标位置转成机械臂动作。

在 42 项模拟任务里,Astra 拿到 28.97 分、22.48% 平均成功率,超过原公开榜首 DM0.5 的 24.90 分、19.34%。同一套控制方式换成 GPT-5.5,只有 1.13 分、0.88%。

RoboDojo 公开榜过去主要是 VLA、WAM 这类专门训练的机器人策略。现在,原本需要专用模型完成的一部分动作决策,通用大模型已经可以直接接手,而且整体成绩还超过了原榜首。机器人是否还需要单独训练一颗「大脑」,这个问题第一次变得很具体。

但 Astra 还替不了机器人的「小脑」。插入、倒液体、精细接触这些依赖真实物理控制的任务,它明显更弱。真机测试还因为多次出现危险动作并损坏硬件,被团队提前叫停。

随着通用模型能力变强,机器人模型的分工可能会被重新划分:大模型负责看懂环境、判断和规划,专用 VLA 与传统控制器负责把动作做准、做稳。

信源

动察 Beating 频道 · 动察 Beating 交流群
👍4
Media is too big
VIEW IN TELEGRAM
黄仁勋:AI安全是工程问题,不需要新的法律监管

英伟达 CEO 黄仁勋进一步明确了自己对 AI 监管的态度。他在 Salesforce 年度大会 Dreamforce 上表示,AI 安全首先是工程问题,不需要为此增加新的法律和监管。AI 再复杂,归根结底仍是软件和计算系统,应该靠完善测试和产品把关来解决安全问题。

他的原则也很简单:没有把握产品安全,就不要发布。公司可以先停下来把问题解决,再继续往前跑。

黄仁勋认为,市场本身已经能约束企业,没有必要再加一层新的 AI 监管。他也反对把发展速度和安全放在对立面,认为两者完全可以同时做到。企业应该尽可能快地推进,一旦发现产品可能失控或不安全,再停下来处理。

信源

动察 Beating 频道 · 动察 Beating 交流群
😁1
Media is too big
VIEW IN TELEGRAM
Anthropic CEO:就算模型今天停更,现有AI可能也只用了5%–10%的价值

Anthropic CEO Dario Amodei 在 Salesforce 年度大会 Dreamforce 上表示,即使模型能力从今天开始不再进步,人们可能也只开发出了现有 AI 潜在价值的 5%–10%。

他认为,模型能力已经跑在实际应用前面。很多企业和普通用户甚至还不知道现有 AI 已经能做什么,更谈不上把这些能力真正用进日常工作。

Dario 举了 Anthropic 自己的例子。公司内部已经有人让 Claude 直接结合 Salesforce 数据,找出本周最大的交易、最可能丢掉的订单,再分析项目的问题和成单机会。这些能力今天已经能用,但真正把它们用起来的人还很少。

这也补充了他最近关于「放慢前沿 AI」的主张。Dario 想放慢的是最前沿模型继续变强的速度,并不主张放慢 AI 应用。按他的判断,就算模型暂时停在今天,企业把现有能力真正用起来,仍有很大的空间。

信源

动察 Beating 频道 · 动察 Beating 交流群
🤮5
OpenRouter又上神秘模型Union Alpha,专攻Agent编程

OpenRouter 和 OpenCode 上线神秘模型 Union Alpha,开发者身份暂未公开。它是一款面向研究、编程和 Agent 工作流的多模态模型,支持图片、工具调用和约 256K 上下文。OpenRouter 将其描述为具有「前沿级通用性能」。

OpenCode 称 Union Alpha 专门针对 Agent 编程优化,未来一周免费使用,而且不会用用户数据训练模型。

Union Alpha 到底是谁家的,目前没有答案。社区已经开始从输出风格、上下文长度等线索猜模型身份,但暂时没有可靠证据。

信源

动察 Beating 频道 · 动察 Beating 交流群
👍3
Cyces收购AI用户研究平台Looppanel,将加速布局Agentic UX Research

AI 产品工作室 Cyces 宣布已收购 AI 驱动的用户研究平台 Looppanel。交易完成后,Looppanel 将继续服务现有客户,Cyces 计划加快其产品开发,进一步拓展 AI 能力,并推动平台进入更多全球市场。

Looppanel 主要面向 UX 和产品团队,提供多语言转录、AI 辅助分析、主题标签、研究内容搜索及协作等功能,帮助企业从用户研究中提取洞察。Cyces 表示,未来将推动 Looppanel 向「Agentic UX Research」(智能体驱动的用户研究)方向发展。此次收购未披露具体交易金额。

Looppanel 成立于帮助企业更高效地开展定性用户研究,曾入选红杉资本 Spark 早期创业项目,并参与 TechCrunch Disrupt。

信源

动察 Beating 频道 · 动察 Beating 交流群