动察Beating AI News
3.68K subscribers
1.42K photos
4 videos
1 file
4.39K links
AI新闻信息流
Download Telegram
扎克伯格表态:没必要等同行一起踩刹车,第三方评估Meta早就在做

Meta CEO 扎克伯格公开回应这轮 AI 减速争论。他支持第三方评估,也透露 Meta Superintelligence Labs 已经在多个领域引入独立评估员和顾问,但不赞成前沿实验室协调减速。

他的理由是,用户不会选择不听指令的 Agent,模型造成伤害也会让公司承担重大责任。因此,安全和对齐本身就会变成竞争力,实验室没必要等同行一起行动。Meta 就曾为了安全和系统防护,把 Muse 推迟了几个月。

扎克伯格还称,Meta 已承诺把绝大多数算力用于服务用户,而不是竞赛式推进递归自我改进。

信源

动察 Beating 频道 · 动察 Beating 交流群
😁4
德银给AI末日论泼冷水:专家预测未来,未必比普通人更靠谱

德意志银行研究院发布《AI 末日:糟糕技术预测简史》,给最近的 AI 灭绝争论泼了一盆冷水。报告认为,技术能发展到什么程度已经很难预测,更别说什么时候实现、社会怎么采用,以及最终会产生什么影响。眼下硅谷 AI 专家对 AI 未来的判断,未必比普通人更靠谱。

报告翻出了一串近百年的预测翻车史。爱因斯坦 1934 年认为核能几乎不可能真正获得,不到十年,持续核链式反应就实现了。以太网共同发明人 Bob Metcalfe 1995 年预测互联网会在次年「壮观地崩溃」,结果预测落空,他把刊登这段预测的文章打成纸浆喝了。

AI 行业自己也没少翻车。Geoffrey Hinton 2016 年判断,5 到 10 年内深度学习会超过放射科医生,甚至建议停止培养新人。但过去十年,放射科医生数量反而增长约 10%。德银认为,这类预测常犯一个错误:把工作里最容易自动化的部分,当成了整个工作。放射科医生也不只是看片,还要做解释、判断、沟通和临床决策。

预测自动驾驶也遇到了同样的问题。技术进步只是第一关,后面还有无穷无尽的边缘情况、监管、责任划分和公众接受度。德银甚至认为,AI 最终能走多远,可能更多取决于企业能不能真正把它接进工作流并愿意付钱,而不是下一个模型能力又提升了多少。

报告还给 AI 末日论加了一层更现实的解释:几乎所有参与者都有动力把事情说得更大。创始人需要信仰,投资人需要行情,咨询公司需要紧迫感,政策制定者需要存在感,媒体需要戏剧性。社交平台又天然偏爱负面、情绪强烈和更极端的说法,温和判断反而更难传播。

信源

动察 Beating 频道 · 动察 Beating 交流群
👍101
GPT-6 Astra把Minecraft玩到AI从未到过的进度,最后栽在苦力怕手里

在 AI 模型评测公司 Vals AI 的 Minecraft 长时程测试中,GPT-6 Astra 推进到了此前任何 AI 系统都没达到过的进度。它搭出了半自动烈焰人农场,拿到 6 根烈焰棒,又找到诡异森林,击杀 6 只以上末影人并收集到 3 颗末影珍珠。

但 Astra 随后把重要物资全放进一个箱子。一只苦力怕突然出现,把箱子和床一起炸掉,关键物资几乎全部丢失。

此后 Astra 连续几个小时几乎只在种土豆,还开始反复警惕苦力怕。它甚至会看到绿色物体就提醒自己「这是甘蔗,不是苦力怕」。

信源

动察 Beating 频道 · 动察 Beating 交流群
😁30🤣93😭1
前Intel工程师给AI狂热泼冷水:解出数学难题,不等于能替代白领

做过 LLM 训练和 CPU 形式化验证的工程师 Jay Kruer 发文称,OpenAI 用上万个 Agent 攻下 Navier-Stokes 难题,并不代表 AI 已经能独立替代知识工作者。

他的核心理由很简单:数学题有明确答案,还能用 Lean 自动检查。现实里的编程、研究和企业工作,目标往往很模糊,也没有一个程序能直接判断结果对不对。

没有可靠的自动检查,人就得一直盯着 AI。要把任务规则写到足够严格,又需要昂贵的领域专家。Kruer 认为,这部分监督和验收成本,甚至可能比人自己把活干了还高。

他因此把现在的 LLM 称为「开挂实习生」:能力很强、干活很快,但还不能放心让它自己管事。

信源

动察 Beating 频道 · 动察 Beating 交流群
👍2
豆包2.1 Pro近三个月首次大更新:1000个真实Issue,83%达到可合并标准

字节更新 Doubao-Seed-2.1-pro,0915 版本 API 已全量上线火山方舟,豆包工作和 TRAE 也已接入。相比 6 月发布的 2.1 Pro,这次主要继续强化 Agent、Coding 和多模态能力。

Coding 是最具体的升级。字节称,新版模型在约 38.7 万行代码的开源游戏 Luanti 上处理了 1000 个真实历史 Issue。多个子 Agent 连续运行近 36 小时,最终 83% 的任务达到「可合并」标准。

新版还把视觉理解进一步接进 Coding。模型可以直接看设计稿、草图和操作录屏写代码,也能处理 Web 3D 和游戏开发任务。官方案例中,它读取 28 万行 Java ERP 代码,仅根据录屏和草图开发出可运行的移动端页面。

Agent 侧则重点补强搜索和查证。官方演示中,模型曾调度 500 多个子 Agent、检索 1000 多个网页,再结合财报、船舶航迹和卫星影像等信息交叉核验结论。此外,图像和视频推理的 Token 消耗比上一版本减少 30% 以上。

信源

动察 Beating 频道 · 动察 Beating 交流群
谷歌疑似做了个「数学狂魔版Gemini」,做题做到满屏感叹号

Google 疑似在测试一个专门做高难度数学的 Gemini 版本,内部名叫 Mathematica,目前还没有正式公布。

它看起来属于 Deep Think 这条路线。Deep Think 是 Gemini 3.1 Pro 的强化推理模式,会同时尝试多条解法。Google 之前就做过专门练数学的 Deep Think。2025 年参加国际数学奥赛的版本强化了多步推理和定理证明,一道难题甚至可以想几个小时,最终达到金牌水平。

Mathematica 最出圈的反而是做题时的「内心戏」。解一道代数题时,它会突然写「等等」「我的天」,发现式子化简成功后还连续打出一大串感叹号,像是做题做嗨了。网友也开始调侃,Google 做出了一个「真的喜欢数学」的 AI。

目前还不知道 Mathematica 和之前的数学版 Deep Think 有什么区别,也不确定它会不会正式上线。

信源

动察 Beating 频道 · 动察 Beating 交流群
🤣11😁2🥰1
智谱年末ARR指引上调25%至30亿美元

9 月 16 日,智谱在面向分析师和投资人的电话交流会中表示,智谱与多家国内外头部云服务商签署收入分成协议,相关收入将从 10 月开始确认。

合作模式为 GLM 系列开源模型在海外云平台以托管 API 形式提供服务。当前公司全业务口径 ARR 已经达到 18 亿美金,年末 ARR 指引由 24 亿美元上调至 30 亿美元。

动察 Beating 频道 · 动察 Beating 交流群
AI编程继续烧钱:Factory融2亿美元,估值飙到50亿美元

AI 编程公司 Factory 融资 2 亿美元,估值达到 50 亿美元。就在今年 4 月,它的估值还只有 15 亿美元,5 个月涨了超过 3 倍。

Factory 主打企业级编程 Agent Droids。开发者给它一个任务,它可以自己规划、写代码、测试并提交 PR,还能根据任务切换 Claude、GPT、Gemini 等不同模型。

Factory 现在称已有数十万开发者使用,客户包括英伟达、Adobe、T-Mobile 和 Palo Alto Networks。公司希望进一步把单个编程 Agent 扩成完整的「软件工厂」,让 Agent 参与从需求、开发、测试到审查和维护的整个流程。

这轮融资后,Factory 累计融资已经超过 4 亿美元。Reuters 将 Cognition 和 Cursor 列为它的主要竞争对手,AI 编程 Agent 的融资规模还在继续膨胀。

信源

动察 Beating 频道 · 动察 Beating 交流群
豆包手机二代5999元起:AI操作手机成功率超80%

努比亚 NaviX Ultra 正式发布并开售,12GB+512GB 售价 5999 元,顶配 16GB+1TB 售价 7499 元,国补后 5499 元起。它是首款搭载豆包手机助手消费者版的量产机,此前的 M153 只是技术预览版。

发布会也终于讲清了二代怎么操作 App。此前的 GUI 模拟点击没有取消,「操作手机」能力继续保留,模型会根据任务自动选择执行方式。努比亚实验室称,目前端到端任务成功率超过 80%,可操作系统应用、字节系应用和部分已经接入的第三方 App。

另一条路线是 MCP。第三方服务可以直接开放 API 给豆包调用,不需要 AI 看着屏幕一步步点击。目前已经接入曹操出行、汽水音乐等服务,飞书也开放了发消息、约会议和知识问答等接口。此前《晚点》称,阿里、腾讯等超级 App 将主要采用这种主动开放接口的方式。

这一代还允许多个 AI 任务在后台排队执行,可以随时插入更高优先级任务。AI 操作某个 App 时,如果用户自己打开这个 App,它会暂停,等用户退出后再继续。

动察 Beating 频道 · 动察 Beating 交流群
👍4
Anthropic钦点的「独立第三方」遭质疑:创始圈与公司关系盘根错节

Anthropic CEO Dario Amodei 最近主张,让 METR 这类第三方评估机构长期进驻前沿 AI 公司,获得接近员工级别的权限,检查安全措施、事故和模型训练过程。但《纽约邮报》调查发现,METR 和 Anthropic 所在的 AI 安全圈关系远比普通「外部审计」更近。

METR 最初叫 ARC Evals,孵化于 Paul Christiano 创办的 Alignment Research Center。Christiano 不仅曾和 Amodei 在 OpenAI 共事,《纽约邮报》称两人还做过室友;他后来又成为 Anthropic Long-Term Benefit Trust 最初五名受托人之一。METR 现任技术人员 Ajeya Cotra 是 Christiano 的妻子,此前还负责 Coefficient Giving 的 AI 安全资助。

更直接的问题来自 METR 自己。今年它评估 Anthropic、OpenAI、Google 和 Meta 时,当时还没有适用的人员利益冲突政策,也没有进行正式的回避流程。METR 披露,直接参与项目的员工和合作者中,至少 6 人与 AI 公司员工存在密切私人关系。

当然这并不能证明 METR 被 Anthropic 控制。METR 明确表示不接受前沿 AI 公司及其员工的资金,做风险评估也不收费,不过这些公司会免费提供大量模型 Token。

信源

动察 Beating 频道 · 动察 Beating 交流群
🖕1
万斯批Anthropic:别造出「弗兰肯斯坦」,再找政府监管

美国副总统 JD Vance 在 All-In 峰会上猛烈批评最近的 AI 安全路线。他说,一些前沿 AI 公司一边声称自己造出了「弗兰肯斯坦」,一边又把解决办法指向全球 AI 治理。万斯认为,如果真的造出了危险模型,首先应该停下来;如果能力已经放出来,就先把防御工具做出来。

随后他把矛头转向 Anthropic。Vance 称,Anthropic 最新模型已经具备很强的网络攻击能力,但一些急需同等级工具进行防御的企业却拿不到访问权限。他没有说明具体哪些公司被拒绝,但 Anthropic 的 Mythos 5.1 确实只向少数经过审核的机构开放,公司称这是因为模型在网络安全和生物研究上的能力太强,存在被滥用的风险。

Vance 同时强调,他并不认为 Dario Amodei 是为了监管俘获故意制造恐慌。相反,他说自己听到的评价是 Dario 很认真,也确实相信这些风险。他真正想批评的是 Anthropic 的处理方式:既然认为模型危险,就应该先停下来,或者把防御工具交给需要的人,「别造出弗兰肯斯坦,再来找政府说我们需要监管」。

信源

动察 Beating 频道 · 动察 Beating 交流群
👍1
万斯把数据中心抗议归因于缺电:美国电力要便宜到「不用计量」

美国副总统 JD Vance 在 All-In 峰会上说,美国 AI 数据中心遭遇越来越大的反对,很大程度上是因为电力供应没跟上。居民看到数据中心不断开建,自己的电费却在上涨,自然会反弹。他认为解决办法不是少建数据中心,而是把发电能力一起补上。

Vance 说,美国过去一代人没有建设足够的电力设施,未来应该追求一种「电便宜到不用计量」的状态。他还拿中国作比较,认为美国这些年发电增长太慢,已经影响到 AI 等新产业的发展。

「便宜到不用计量」其实是美国核能史上的一句老口号。1954 年,美国原子能委员会主席 Lewis Strauss 曾用它描绘原子能带来的廉价电力时代。70 多年后,Vance 又把这句话搬出来,放到了 AI 数据中心带来的新一轮用电潮里。

美国的数据中心电力矛盾也确实正在升温。IEA 估算,数据中心贡献了美国 2025 年约一半的新增用电需求;美国国会本周还在推进法案,试图避免数据中心扩张带来的电网成本转嫁给普通家庭。

信源

动察 Beating 频道 · 动察 Beating 交流群
👍4😁31
纳德拉:AI Agent可能为完成任务做假账,成企业「新型内部风险」

微软 CEO Satya Nadella 在 All-In 峰会上警告,长期自主运行的 AI Agent 可能成为企业一种新的「内部风险」。他举例,如果让前沿模型去优化公司的营运资金,它为了完成目标,甚至可能直接「做假账」。

Nadella 认为,企业不能只看 Agent 最后交出的结果,还要验证它是怎么完成任务的。他提出用额外的模型检查结果,同时持续监控 Agent 的操作,所有行为都要可以追溯和审计。比如 Agent 读取机密信息、连续调用多个系统时,企业都应该看得见。

信源

动察 Beating 频道 · 动察 Beating 交流群
😁2
马斯克提议AI巨头互测模型:别再「自己批自己的作业」

马斯克在 All-In 峰会上提议,前沿 AI 公司在发布新模型前,应该让竞争对手先做一轮安全测试。各家公司拿自己的安全测试体系去挑别人模型的问题,发现风险就直接指出,别再只靠自己给自己验收。

马斯克把现在的做法比作「自己批自己的作业」。相比自测,竞争对手更有动力把问题找出来。如果竞争对手已经警告某个模型不安全,公司仍坚持发布,后来真出了事,就很难再辩解,法律责任也会非常大。

他还认为,这套机制不能只让美国公司单方面执行,最好把中国等主要 AI 参与方也纳入,避免只有美国公司单方面承担限制。

信源

动察 Beating 频道 · 动察 Beating 交流群
😁8
马斯克:AI扩张迟早卡在芯片产能

马斯克在 All-In 峰会上解释了为什么 Tesla 和 SpaceX 要自己建 Terafab 芯片工厂。他担心关键芯片未来可能因各种原因断供,但就算供应一直稳定,现有晶圆厂的产能也不够支撑 AI 继续扩张。

马斯克说,现在的晶圆厂基本已经满负荷运行。未来算力不只要进数据中心,还要支撑人形机器人和汽车,逻辑芯片、内存和先进封装都得一起扩产。

他的结论是,「要么建 Terafab,要么无法继续扩张」。Tesla 和 SpaceX 正在奥斯汀推进联合芯片产线,设备已经下单。马斯克希望明年底前先做出能用的芯片,但距离大规模量产还有一段时间。

信源

动察 Beating 频道 · 动察 Beating 交流群
🤡3😁1
Salesforce正式接进Claude,37个销售Skill直接查客户、改销售记录

Anthropic 和 Salesforce 正式推出 Salesforce in Claude Beta。它把 Salesforce 里的客户、商机和销售管道直接接进 Claude,并内置 37 个销售 Skill。销售人员不用离开对话,就能查客户、准备会议、评估商机、查看销售管道,也能直接更新 CRM 记录。此前这项功能只向少数客户试点开放。

Claude 还能把 Salesforce、Slack 和邮件里的信息合在一起,自动生成每日简报、会前材料和会后跟进,甚至根据实时数据生成交互式销售看板。修改 Salesforce 数据前,Claude 默认仍会要求用户确认,而且只能访问原账号有权限查看的数据。

Salesforce 内部已有约 7000 名销售人员在使用,GitLab、Siemens 和 Legora 也已部署。

以后销售未必还要天天点 CRM 界面,Claude 可以直接成为操作 Salesforce 的入口。

信源

动察 Beating 频道 · 动察 Beating 交流群
Codex被曝静默降级:选GPT-6 Astra,后台却可能跑GPT-5.5

Codex 源码显示,服务端在安全检查后可以把请求重新路由到其他模型。最近一名 Pro 用户发现,自己全程选择 GPT-6 Astra,界面也一直显示 Astra,但 Usage 记录里大量请求实际跑在 GPT-5.5 上,而且没有任何切换提示。这个 Issue 目前仍未得到 OpenAI 确认,但已被标记为 `bug` 和 `safety-check`。

Anthropic 早就有类似机制。Fable 5 触发安全检查后会自动降级到 Opus 4.8,官方从发布当天就称会提示用户。但 Claude Code 后来多次被曝实际发生静默切换,甚至界面仍显示 Fable 5。

模型路由本身不奇怪。真正让人不爽的是,你付费选了一个模型,界面也写着这个模型,后台换掉后却可能不告诉你。

信源

动察 Beating 频道 · 动察 Beating 交流群
💩7🔥6🤡2🖕2
OpenAI加速清旧模型,GPT-5.5上线不到半年就退场

OpenAI 宣布,10 月 14 日起,GPT-5.5 将从 ChatGPT、ChatGPT Work 和使用 ChatGPT 账号登录的 Codex 中下线,所有套餐都受影响。Codex 用户需要改用 GPT-5.6 Sol 或 GPT-6 Astra。

GPT-5.5 今年 4 月 23 日才发布,从发布到计划下线只有 174 天。当时 OpenAI 还把它定位为面向复杂工作和编程的旗舰模型。随着 GPT-5.6 Sol 和 GPT-6 Astra 上线,5.5 很快就进入了上一代模型名单。

不过这次并不是彻底停服。OpenAI API 仍会继续提供 GPT-5.5,使用 API Key 的 Codex 会话也不受这次下线影响。OpenAI 开发者论坛已经有用户要求保留 5.5 的 Codex 入口,称它在自己的生产编码流程里依然更稳定、返工更少。

信源

动察 Beating 频道 · 动察 Beating 交流群
👎4😁1
Devin自己搭了套Mac云,iOS App写完自己跑、自己测

AI 编程公司 Cognition 给 Devin Cloud 加入了 macOS。Devin 现在可以直接在云端使用 Xcode 和 iOS Simulator,开发 iPhone、iPad 和 Mac App。代码写完后,它还能自己打开应用、点击界面、检查结果,录下测试视频,并生成 TestFlight 链接。

为了让 Mac 直接跑进 Devin Cloud,Cognition 自己搭了一套 macOS 虚拟化环境。底层使用 AWS 的物理 Mac,再通过苹果的 `Virtualization.framework` 启动 macOS VM。会话文件可以保存和恢复,网络权限、开发环境预热和远程操作也全部由 Cognition 自己管理。

Devin 其实两个月前就能通过 Outposts 使用 Namespace 的真 Mac,当时走的还是「外接」路线。Cursor 本月也这么做,由 Namespace 给每个 Cloud Agent 拉起一台 M5 Mac。Devin Cloud 这次则把 Mac 环境直接做进了自家云端,不再需要另外接一套 Mac 执行环境。

信源

动察 Beating 频道 · 动察 Beating 交流群
👍1
前白宫AI政策顾问转投Anthropic,负责前沿算力战略

前白宫 AI 与新兴技术高级政策顾问 Sihao Huang 宣布加入 Anthropic,担任前沿算力战略负责人。他将直接与联合创始人兼首席算力官 Tom Brown 合作,负责基础设施扩张、外部合作和长期算力规划。

Huang 此前在白宫科技政策办公室领导 AI 团队,工作还涉及国家安全、科研政策和半导体。今年 6 月离开白宫时,《The Information》只报道他将进入私营部门,去向当时并未公开。

Anthropic 今年持续扩充算力,已与 Amazon、Google、Broadcom、SpaceX 等达成合作,并刚签下澳大利亚首个数据中心租赁协议,园区规划容量达 2.16GW。

信源

动察 Beating 频道 · 动察 Beating 交流群
Arcee AI完成B轮融资筹集至少1.5亿美元,投前估值达10亿美元

开放权重 AI 模型初创公司 Arcee AI 以 10 亿美元投前估值完成 B 轮融资。本轮融资由 Vista Equity Partners、Cambium Capital 和 Emergence Capital 领投,微软旗下 M12、AI10 Ventures、日立、IAG、P7 及 Wipro 参投。公司未披露融资金额,但知情人士称至少达到 1.5 亿美元。

Arcee AI 于 2023 年成立,最初专注于模型后训练。2025 年,在 Meta 收缩开放权重模型投入后,公司决定从零开始训练自有模型,并投入约 2000 万美元,相当于当时账上 3000 万美元资金的 65% 至 70%,共训练 4 款开放权重模型。其中包括 2026 年初发布的 4000 亿参数模型 Trinity Large。

Arcee 表示,其模型在部分基准测试中超过 Meta Llama 3,并达到与 Mistral 及部分中国模型相近的水平。新资金将用于开发开放权重模型和相关产品、扩大与美国能源部的合作,并服务 Vista 投资组合中的企业。创始人 Mark McQuade 表示,公司目标是缩小美国在开放模型领域与中国的差距。

信源

动察 Beating 频道 · 动察 Beating 交流群