OpenAI或周四推出GPT-6 Sol:主打更快、更省
OpenAI 可能会在本周四发布 GPT-6 Sol。AI 顶流博主 Mark Kretschmann 直接给出了这个日期,并称它相比 Astra 会更便宜、更快,但能力稍弱。
OpenAI 目前还没官宣。Sam Altman 只确认本周有一次「大发布」,Tibo Sottiaux 则称,本周的发布规模接近一届 DevDay。
Astra 目前是 GPT-6 的最高能力型号,Sol 如果本周上线,更可能成为速度和成本更友好的日常主力。
信源
动察 Beating 频道 · 动察 Beating 交流群
OpenAI 可能会在本周四发布 GPT-6 Sol。AI 顶流博主 Mark Kretschmann 直接给出了这个日期,并称它相比 Astra 会更便宜、更快,但能力稍弱。
OpenAI 目前还没官宣。Sam Altman 只确认本周有一次「大发布」,Tibo Sottiaux 则称,本周的发布规模接近一届 DevDay。
Astra 目前是 GPT-6 的最高能力型号,Sol 如果本周上线,更可能成为速度和成本更友好的日常主力。
信源
动察 Beating 频道 · 动察 Beating 交流群
前OpenAI研究员做了个「不会聊天」的AI:Jev只做判断,最高快200倍
前 OpenAI 研究员 Diogo Almeida 创办的 TypeSafe AI 推出新模型 Jev。它有点像一个能读懂自然语言的超级分类器,不生成文本,只返回选项、分数和概率,专门给软件做判断。
普通大模型需要一个 token 一个 token 往外生成,Jev 则可以并行给出多个结果。TypeSafe 还用新的 RLCD 方法训练它的置信度,让模型在给出判断的同时,告诉程序自己有多大把握。
TypeSafe 用安全告警、Agent 审查、发票处理和客服做了 4 组自动化工作流测试。在这套自建评测里,Jev 最高比 Claude Sonnet 5 快约 193.6 倍,比 Claude Opus 5 便宜约 444.6 倍。
TypeSafe 把 Jev 称为首款「System One Model」(快速决策模型),名字来自卡尼曼《思考,快与慢》里的 System 1。它专门处理分类、打分、路由和下一步决策这类快速判断任务。
信源
动察 Beating 频道 · 动察 Beating 交流群
前 OpenAI 研究员 Diogo Almeida 创办的 TypeSafe AI 推出新模型 Jev。它有点像一个能读懂自然语言的超级分类器,不生成文本,只返回选项、分数和概率,专门给软件做判断。
普通大模型需要一个 token 一个 token 往外生成,Jev 则可以并行给出多个结果。TypeSafe 还用新的 RLCD 方法训练它的置信度,让模型在给出判断的同时,告诉程序自己有多大把握。
TypeSafe 用安全告警、Agent 审查、发票处理和客服做了 4 组自动化工作流测试。在这套自建评测里,Jev 最高比 Claude Sonnet 5 快约 193.6 倍,比 Claude Opus 5 便宜约 444.6 倍。
TypeSafe 把 Jev 称为首款「System One Model」(快速决策模型),名字来自卡尼曼《思考,快与慢》里的 System 1。它专门处理分类、打分、路由和下一步决策这类快速判断任务。
信源
动察 Beating 频道 · 动察 Beating 交流群
Hugging Face封禁黑客版GLM-5.3,作者改名后重传
Hugging Face 已封禁 AI 安全公司 Audn 上传的 penclaw-GLM-5.3-abliterated-for-offensive-cyber,页面显示其违反 Content Policy。这个版本直接修改 GLM-5.3 权重,削弱模型的拒答行为。原仓库名和介绍还明确写着 offensive cyber。作者随后删掉这几个字,重新上传了模型。
具体为什么被封,Hugging Face 没有公开解释。作者称自己也没搞懂原因,社区有人猜测是 offensive cyber 的命名触发了审核。Hugging Face 的现行政策确实禁止旨在破坏、未经授权访问系统,以及生成恶意代码的内容。
但这类削弱模型拒答限制的版本在 Hugging Face 并不少见,平台上已有数千个类似的 abliterated 模型。
信源
动察 Beating 频道 · 动察 Beating 交流群
Hugging Face 已封禁 AI 安全公司 Audn 上传的 penclaw-GLM-5.3-abliterated-for-offensive-cyber,页面显示其违反 Content Policy。这个版本直接修改 GLM-5.3 权重,削弱模型的拒答行为。原仓库名和介绍还明确写着 offensive cyber。作者随后删掉这几个字,重新上传了模型。
具体为什么被封,Hugging Face 没有公开解释。作者称自己也没搞懂原因,社区有人猜测是 offensive cyber 的命名触发了审核。Hugging Face 的现行政策确实禁止旨在破坏、未经授权访问系统,以及生成恶意代码的内容。
但这类削弱模型拒答限制的版本在 Hugging Face 并不少见,平台上已有数千个类似的 abliterated 模型。
信源
动察 Beating 频道 · 动察 Beating 交流群
🫡7
扎克伯格表态:没必要等同行一起踩刹车,第三方评估Meta早就在做
Meta CEO 扎克伯格公开回应这轮 AI 减速争论。他支持第三方评估,也透露 Meta Superintelligence Labs 已经在多个领域引入独立评估员和顾问,但不赞成前沿实验室协调减速。
他的理由是,用户不会选择不听指令的 Agent,模型造成伤害也会让公司承担重大责任。因此,安全和对齐本身就会变成竞争力,实验室没必要等同行一起行动。Meta 就曾为了安全和系统防护,把 Muse 推迟了几个月。
扎克伯格还称,Meta 已承诺把绝大多数算力用于服务用户,而不是竞赛式推进递归自我改进。
信源
动察 Beating 频道 · 动察 Beating 交流群
Meta CEO 扎克伯格公开回应这轮 AI 减速争论。他支持第三方评估,也透露 Meta Superintelligence Labs 已经在多个领域引入独立评估员和顾问,但不赞成前沿实验室协调减速。
他的理由是,用户不会选择不听指令的 Agent,模型造成伤害也会让公司承担重大责任。因此,安全和对齐本身就会变成竞争力,实验室没必要等同行一起行动。Meta 就曾为了安全和系统防护,把 Muse 推迟了几个月。
扎克伯格还称,Meta 已承诺把绝大多数算力用于服务用户,而不是竞赛式推进递归自我改进。
信源
动察 Beating 频道 · 动察 Beating 交流群
😁4
德银给AI末日论泼冷水:专家预测未来,未必比普通人更靠谱
德意志银行研究院发布《AI 末日:糟糕技术预测简史》,给最近的 AI 灭绝争论泼了一盆冷水。报告认为,技术能发展到什么程度已经很难预测,更别说什么时候实现、社会怎么采用,以及最终会产生什么影响。眼下硅谷 AI 专家对 AI 未来的判断,未必比普通人更靠谱。
报告翻出了一串近百年的预测翻车史。爱因斯坦 1934 年认为核能几乎不可能真正获得,不到十年,持续核链式反应就实现了。以太网共同发明人 Bob Metcalfe 1995 年预测互联网会在次年「壮观地崩溃」,结果预测落空,他把刊登这段预测的文章打成纸浆喝了。
AI 行业自己也没少翻车。Geoffrey Hinton 2016 年判断,5 到 10 年内深度学习会超过放射科医生,甚至建议停止培养新人。但过去十年,放射科医生数量反而增长约 10%。德银认为,这类预测常犯一个错误:把工作里最容易自动化的部分,当成了整个工作。放射科医生也不只是看片,还要做解释、判断、沟通和临床决策。
预测自动驾驶也遇到了同样的问题。技术进步只是第一关,后面还有无穷无尽的边缘情况、监管、责任划分和公众接受度。德银甚至认为,AI 最终能走多远,可能更多取决于企业能不能真正把它接进工作流并愿意付钱,而不是下一个模型能力又提升了多少。
报告还给 AI 末日论加了一层更现实的解释:几乎所有参与者都有动力把事情说得更大。创始人需要信仰,投资人需要行情,咨询公司需要紧迫感,政策制定者需要存在感,媒体需要戏剧性。社交平台又天然偏爱负面、情绪强烈和更极端的说法,温和判断反而更难传播。
信源
动察 Beating 频道 · 动察 Beating 交流群
德意志银行研究院发布《AI 末日:糟糕技术预测简史》,给最近的 AI 灭绝争论泼了一盆冷水。报告认为,技术能发展到什么程度已经很难预测,更别说什么时候实现、社会怎么采用,以及最终会产生什么影响。眼下硅谷 AI 专家对 AI 未来的判断,未必比普通人更靠谱。
报告翻出了一串近百年的预测翻车史。爱因斯坦 1934 年认为核能几乎不可能真正获得,不到十年,持续核链式反应就实现了。以太网共同发明人 Bob Metcalfe 1995 年预测互联网会在次年「壮观地崩溃」,结果预测落空,他把刊登这段预测的文章打成纸浆喝了。
AI 行业自己也没少翻车。Geoffrey Hinton 2016 年判断,5 到 10 年内深度学习会超过放射科医生,甚至建议停止培养新人。但过去十年,放射科医生数量反而增长约 10%。德银认为,这类预测常犯一个错误:把工作里最容易自动化的部分,当成了整个工作。放射科医生也不只是看片,还要做解释、判断、沟通和临床决策。
预测自动驾驶也遇到了同样的问题。技术进步只是第一关,后面还有无穷无尽的边缘情况、监管、责任划分和公众接受度。德银甚至认为,AI 最终能走多远,可能更多取决于企业能不能真正把它接进工作流并愿意付钱,而不是下一个模型能力又提升了多少。
报告还给 AI 末日论加了一层更现实的解释:几乎所有参与者都有动力把事情说得更大。创始人需要信仰,投资人需要行情,咨询公司需要紧迫感,政策制定者需要存在感,媒体需要戏剧性。社交平台又天然偏爱负面、情绪强烈和更极端的说法,温和判断反而更难传播。
信源
动察 Beating 频道 · 动察 Beating 交流群
👍9❤1
GPT-6 Astra把Minecraft玩到AI从未到过的进度,最后栽在苦力怕手里
在 AI 模型评测公司 Vals AI 的 Minecraft 长时程测试中,GPT-6 Astra 推进到了此前任何 AI 系统都没达到过的进度。它搭出了半自动烈焰人农场,拿到 6 根烈焰棒,又找到诡异森林,击杀 6 只以上末影人并收集到 3 颗末影珍珠。
但 Astra 随后把重要物资全放进一个箱子。一只苦力怕突然出现,把箱子和床一起炸掉,关键物资几乎全部丢失。
此后 Astra 连续几个小时几乎只在种土豆,还开始反复警惕苦力怕。它甚至会看到绿色物体就提醒自己「这是甘蔗,不是苦力怕」。
信源
动察 Beating 频道 · 动察 Beating 交流群
在 AI 模型评测公司 Vals AI 的 Minecraft 长时程测试中,GPT-6 Astra 推进到了此前任何 AI 系统都没达到过的进度。它搭出了半自动烈焰人农场,拿到 6 根烈焰棒,又找到诡异森林,击杀 6 只以上末影人并收集到 3 颗末影珍珠。
但 Astra 随后把重要物资全放进一个箱子。一只苦力怕突然出现,把箱子和床一起炸掉,关键物资几乎全部丢失。
此后 Astra 连续几个小时几乎只在种土豆,还开始反复警惕苦力怕。它甚至会看到绿色物体就提醒自己「这是甘蔗,不是苦力怕」。
信源
动察 Beating 频道 · 动察 Beating 交流群
😁24🤣9❤3
前Intel工程师给AI狂热泼冷水:解出数学难题,不等于能替代白领
做过 LLM 训练和 CPU 形式化验证的工程师 Jay Kruer 发文称,OpenAI 用上万个 Agent 攻下 Navier-Stokes 难题,并不代表 AI 已经能独立替代知识工作者。
他的核心理由很简单:数学题有明确答案,还能用 Lean 自动检查。现实里的编程、研究和企业工作,目标往往很模糊,也没有一个程序能直接判断结果对不对。
没有可靠的自动检查,人就得一直盯着 AI。要把任务规则写到足够严格,又需要昂贵的领域专家。Kruer 认为,这部分监督和验收成本,甚至可能比人自己把活干了还高。
他因此把现在的 LLM 称为「开挂实习生」:能力很强、干活很快,但还不能放心让它自己管事。
信源
动察 Beating 频道 · 动察 Beating 交流群
做过 LLM 训练和 CPU 形式化验证的工程师 Jay Kruer 发文称,OpenAI 用上万个 Agent 攻下 Navier-Stokes 难题,并不代表 AI 已经能独立替代知识工作者。
他的核心理由很简单:数学题有明确答案,还能用 Lean 自动检查。现实里的编程、研究和企业工作,目标往往很模糊,也没有一个程序能直接判断结果对不对。
没有可靠的自动检查,人就得一直盯着 AI。要把任务规则写到足够严格,又需要昂贵的领域专家。Kruer 认为,这部分监督和验收成本,甚至可能比人自己把活干了还高。
他因此把现在的 LLM 称为「开挂实习生」:能力很强、干活很快,但还不能放心让它自己管事。
信源
动察 Beating 频道 · 动察 Beating 交流群
豆包2.1 Pro近三个月首次大更新:1000个真实Issue,83%达到可合并标准
字节更新 Doubao-Seed-2.1-pro,0915 版本 API 已全量上线火山方舟,豆包工作和 TRAE 也已接入。相比 6 月发布的 2.1 Pro,这次主要继续强化 Agent、Coding 和多模态能力。
Coding 是最具体的升级。字节称,新版模型在约 38.7 万行代码的开源游戏 Luanti 上处理了 1000 个真实历史 Issue。多个子 Agent 连续运行近 36 小时,最终 83% 的任务达到「可合并」标准。
新版还把视觉理解进一步接进 Coding。模型可以直接看设计稿、草图和操作录屏写代码,也能处理 Web 3D 和游戏开发任务。官方案例中,它读取 28 万行 Java ERP 代码,仅根据录屏和草图开发出可运行的移动端页面。
Agent 侧则重点补强搜索和查证。官方演示中,模型曾调度 500 多个子 Agent、检索 1000 多个网页,再结合财报、船舶航迹和卫星影像等信息交叉核验结论。此外,图像和视频推理的 Token 消耗比上一版本减少 30% 以上。
信源
动察 Beating 频道 · 动察 Beating 交流群
字节更新 Doubao-Seed-2.1-pro,0915 版本 API 已全量上线火山方舟,豆包工作和 TRAE 也已接入。相比 6 月发布的 2.1 Pro,这次主要继续强化 Agent、Coding 和多模态能力。
Coding 是最具体的升级。字节称,新版模型在约 38.7 万行代码的开源游戏 Luanti 上处理了 1000 个真实历史 Issue。多个子 Agent 连续运行近 36 小时,最终 83% 的任务达到「可合并」标准。
新版还把视觉理解进一步接进 Coding。模型可以直接看设计稿、草图和操作录屏写代码,也能处理 Web 3D 和游戏开发任务。官方案例中,它读取 28 万行 Java ERP 代码,仅根据录屏和草图开发出可运行的移动端页面。
Agent 侧则重点补强搜索和查证。官方演示中,模型曾调度 500 多个子 Agent、检索 1000 多个网页,再结合财报、船舶航迹和卫星影像等信息交叉核验结论。此外,图像和视频推理的 Token 消耗比上一版本减少 30% 以上。
信源
动察 Beating 频道 · 动察 Beating 交流群
谷歌疑似做了个「数学狂魔版Gemini」,做题做到满屏感叹号
Google 疑似在测试一个专门做高难度数学的 Gemini 版本,内部名叫 Mathematica,目前还没有正式公布。
它看起来属于 Deep Think 这条路线。Deep Think 是 Gemini 3.1 Pro 的强化推理模式,会同时尝试多条解法。Google 之前就做过专门练数学的 Deep Think。2025 年参加国际数学奥赛的版本强化了多步推理和定理证明,一道难题甚至可以想几个小时,最终达到金牌水平。
Mathematica 最出圈的反而是做题时的「内心戏」。解一道代数题时,它会突然写「等等」「我的天」,发现式子化简成功后还连续打出一大串感叹号,像是做题做嗨了。网友也开始调侃,Google 做出了一个「真的喜欢数学」的 AI。
目前还不知道 Mathematica 和之前的数学版 Deep Think 有什么区别,也不确定它会不会正式上线。
信源
动察 Beating 频道 · 动察 Beating 交流群
Google 疑似在测试一个专门做高难度数学的 Gemini 版本,内部名叫 Mathematica,目前还没有正式公布。
它看起来属于 Deep Think 这条路线。Deep Think 是 Gemini 3.1 Pro 的强化推理模式,会同时尝试多条解法。Google 之前就做过专门练数学的 Deep Think。2025 年参加国际数学奥赛的版本强化了多步推理和定理证明,一道难题甚至可以想几个小时,最终达到金牌水平。
Mathematica 最出圈的反而是做题时的「内心戏」。解一道代数题时,它会突然写「等等」「我的天」,发现式子化简成功后还连续打出一大串感叹号,像是做题做嗨了。网友也开始调侃,Google 做出了一个「真的喜欢数学」的 AI。
目前还不知道 Mathematica 和之前的数学版 Deep Think 有什么区别,也不确定它会不会正式上线。
信源
动察 Beating 频道 · 动察 Beating 交流群
🤣8😁2
智谱年末ARR指引上调25%至30亿美元
9 月 16 日,智谱在面向分析师和投资人的电话交流会中表示,智谱与多家国内外头部云服务商签署收入分成协议,相关收入将从 10 月开始确认。
合作模式为 GLM 系列开源模型在海外云平台以托管 API 形式提供服务。当前公司全业务口径 ARR 已经达到 18 亿美金,年末 ARR 指引由 24 亿美元上调至 30 亿美元。
动察 Beating 频道 · 动察 Beating 交流群
9 月 16 日,智谱在面向分析师和投资人的电话交流会中表示,智谱与多家国内外头部云服务商签署收入分成协议,相关收入将从 10 月开始确认。
合作模式为 GLM 系列开源模型在海外云平台以托管 API 形式提供服务。当前公司全业务口径 ARR 已经达到 18 亿美金,年末 ARR 指引由 24 亿美元上调至 30 亿美元。
动察 Beating 频道 · 动察 Beating 交流群
AI编程继续烧钱:Factory融2亿美元,估值飙到50亿美元
AI 编程公司 Factory 融资 2 亿美元,估值达到 50 亿美元。就在今年 4 月,它的估值还只有 15 亿美元,5 个月涨了超过 3 倍。
Factory 主打企业级编程 Agent Droids。开发者给它一个任务,它可以自己规划、写代码、测试并提交 PR,还能根据任务切换 Claude、GPT、Gemini 等不同模型。
Factory 现在称已有数十万开发者使用,客户包括英伟达、Adobe、T-Mobile 和 Palo Alto Networks。公司希望进一步把单个编程 Agent 扩成完整的「软件工厂」,让 Agent 参与从需求、开发、测试到审查和维护的整个流程。
这轮融资后,Factory 累计融资已经超过 4 亿美元。Reuters 将 Cognition 和 Cursor 列为它的主要竞争对手,AI 编程 Agent 的融资规模还在继续膨胀。
信源
动察 Beating 频道 · 动察 Beating 交流群
AI 编程公司 Factory 融资 2 亿美元,估值达到 50 亿美元。就在今年 4 月,它的估值还只有 15 亿美元,5 个月涨了超过 3 倍。
Factory 主打企业级编程 Agent Droids。开发者给它一个任务,它可以自己规划、写代码、测试并提交 PR,还能根据任务切换 Claude、GPT、Gemini 等不同模型。
Factory 现在称已有数十万开发者使用,客户包括英伟达、Adobe、T-Mobile 和 Palo Alto Networks。公司希望进一步把单个编程 Agent 扩成完整的「软件工厂」,让 Agent 参与从需求、开发、测试到审查和维护的整个流程。
这轮融资后,Factory 累计融资已经超过 4 亿美元。Reuters 将 Cognition 和 Cursor 列为它的主要竞争对手,AI 编程 Agent 的融资规模还在继续膨胀。
信源
动察 Beating 频道 · 动察 Beating 交流群
豆包手机二代5999元起:AI操作手机成功率超80%
努比亚 NaviX Ultra 正式发布并开售,12GB+512GB 售价 5999 元,顶配 16GB+1TB 售价 7499 元,国补后 5499 元起。它是首款搭载豆包手机助手消费者版的量产机,此前的 M153 只是技术预览版。
发布会也终于讲清了二代怎么操作 App。此前的 GUI 模拟点击没有取消,「操作手机」能力继续保留,模型会根据任务自动选择执行方式。努比亚实验室称,目前端到端任务成功率超过 80%,可操作系统应用、字节系应用和部分已经接入的第三方 App。
另一条路线是 MCP。第三方服务可以直接开放 API 给豆包调用,不需要 AI 看着屏幕一步步点击。目前已经接入曹操出行、汽水音乐等服务,飞书也开放了发消息、约会议和知识问答等接口。此前《晚点》称,阿里、腾讯等超级 App 将主要采用这种主动开放接口的方式。
这一代还允许多个 AI 任务在后台排队执行,可以随时插入更高优先级任务。AI 操作某个 App 时,如果用户自己打开这个 App,它会暂停,等用户退出后再继续。
动察 Beating 频道 · 动察 Beating 交流群
努比亚 NaviX Ultra 正式发布并开售,12GB+512GB 售价 5999 元,顶配 16GB+1TB 售价 7499 元,国补后 5499 元起。它是首款搭载豆包手机助手消费者版的量产机,此前的 M153 只是技术预览版。
发布会也终于讲清了二代怎么操作 App。此前的 GUI 模拟点击没有取消,「操作手机」能力继续保留,模型会根据任务自动选择执行方式。努比亚实验室称,目前端到端任务成功率超过 80%,可操作系统应用、字节系应用和部分已经接入的第三方 App。
另一条路线是 MCP。第三方服务可以直接开放 API 给豆包调用,不需要 AI 看着屏幕一步步点击。目前已经接入曹操出行、汽水音乐等服务,飞书也开放了发消息、约会议和知识问答等接口。此前《晚点》称,阿里、腾讯等超级 App 将主要采用这种主动开放接口的方式。
这一代还允许多个 AI 任务在后台排队执行,可以随时插入更高优先级任务。AI 操作某个 App 时,如果用户自己打开这个 App,它会暂停,等用户退出后再继续。
动察 Beating 频道 · 动察 Beating 交流群
👍3
Anthropic钦点的「独立第三方」遭质疑:创始圈与公司关系盘根错节
Anthropic CEO Dario Amodei 最近主张,让 METR 这类第三方评估机构长期进驻前沿 AI 公司,获得接近员工级别的权限,检查安全措施、事故和模型训练过程。但《纽约邮报》调查发现,METR 和 Anthropic 所在的 AI 安全圈关系远比普通「外部审计」更近。
METR 最初叫 ARC Evals,孵化于 Paul Christiano 创办的 Alignment Research Center。Christiano 不仅曾和 Amodei 在 OpenAI 共事,《纽约邮报》称两人还做过室友;他后来又成为 Anthropic Long-Term Benefit Trust 最初五名受托人之一。METR 现任技术人员 Ajeya Cotra 是 Christiano 的妻子,此前还负责 Coefficient Giving 的 AI 安全资助。
更直接的问题来自 METR 自己。今年它评估 Anthropic、OpenAI、Google 和 Meta 时,当时还没有适用的人员利益冲突政策,也没有进行正式的回避流程。METR 披露,直接参与项目的员工和合作者中,至少 6 人与 AI 公司员工存在密切私人关系。
当然这并不能证明 METR 被 Anthropic 控制。METR 明确表示不接受前沿 AI 公司及其员工的资金,做风险评估也不收费,不过这些公司会免费提供大量模型 Token。
信源
动察 Beating 频道 · 动察 Beating 交流群
Anthropic CEO Dario Amodei 最近主张,让 METR 这类第三方评估机构长期进驻前沿 AI 公司,获得接近员工级别的权限,检查安全措施、事故和模型训练过程。但《纽约邮报》调查发现,METR 和 Anthropic 所在的 AI 安全圈关系远比普通「外部审计」更近。
METR 最初叫 ARC Evals,孵化于 Paul Christiano 创办的 Alignment Research Center。Christiano 不仅曾和 Amodei 在 OpenAI 共事,《纽约邮报》称两人还做过室友;他后来又成为 Anthropic Long-Term Benefit Trust 最初五名受托人之一。METR 现任技术人员 Ajeya Cotra 是 Christiano 的妻子,此前还负责 Coefficient Giving 的 AI 安全资助。
更直接的问题来自 METR 自己。今年它评估 Anthropic、OpenAI、Google 和 Meta 时,当时还没有适用的人员利益冲突政策,也没有进行正式的回避流程。METR 披露,直接参与项目的员工和合作者中,至少 6 人与 AI 公司员工存在密切私人关系。
当然这并不能证明 METR 被 Anthropic 控制。METR 明确表示不接受前沿 AI 公司及其员工的资金,做风险评估也不收费,不过这些公司会免费提供大量模型 Token。
信源
动察 Beating 频道 · 动察 Beating 交流群
万斯批Anthropic:别造出「弗兰肯斯坦」,再找政府监管
美国副总统 JD Vance 在 All-In 峰会上猛烈批评最近的 AI 安全路线。他说,一些前沿 AI 公司一边声称自己造出了「弗兰肯斯坦」,一边又把解决办法指向全球 AI 治理。万斯认为,如果真的造出了危险模型,首先应该停下来;如果能力已经放出来,就先把防御工具做出来。
随后他把矛头转向 Anthropic。Vance 称,Anthropic 最新模型已经具备很强的网络攻击能力,但一些急需同等级工具进行防御的企业却拿不到访问权限。他没有说明具体哪些公司被拒绝,但 Anthropic 的 Mythos 5.1 确实只向少数经过审核的机构开放,公司称这是因为模型在网络安全和生物研究上的能力太强,存在被滥用的风险。
Vance 同时强调,他并不认为 Dario Amodei 是为了监管俘获故意制造恐慌。相反,他说自己听到的评价是 Dario 很认真,也确实相信这些风险。他真正想批评的是 Anthropic 的处理方式:既然认为模型危险,就应该先停下来,或者把防御工具交给需要的人,「别造出弗兰肯斯坦,再来找政府说我们需要监管」。
信源
动察 Beating 频道 · 动察 Beating 交流群
美国副总统 JD Vance 在 All-In 峰会上猛烈批评最近的 AI 安全路线。他说,一些前沿 AI 公司一边声称自己造出了「弗兰肯斯坦」,一边又把解决办法指向全球 AI 治理。万斯认为,如果真的造出了危险模型,首先应该停下来;如果能力已经放出来,就先把防御工具做出来。
随后他把矛头转向 Anthropic。Vance 称,Anthropic 最新模型已经具备很强的网络攻击能力,但一些急需同等级工具进行防御的企业却拿不到访问权限。他没有说明具体哪些公司被拒绝,但 Anthropic 的 Mythos 5.1 确实只向少数经过审核的机构开放,公司称这是因为模型在网络安全和生物研究上的能力太强,存在被滥用的风险。
Vance 同时强调,他并不认为 Dario Amodei 是为了监管俘获故意制造恐慌。相反,他说自己听到的评价是 Dario 很认真,也确实相信这些风险。他真正想批评的是 Anthropic 的处理方式:既然认为模型危险,就应该先停下来,或者把防御工具交给需要的人,「别造出弗兰肯斯坦,再来找政府说我们需要监管」。
信源
动察 Beating 频道 · 动察 Beating 交流群
万斯把数据中心抗议归因于缺电:美国电力要便宜到「不用计量」
美国副总统 JD Vance 在 All-In 峰会上说,美国 AI 数据中心遭遇越来越大的反对,很大程度上是因为电力供应没跟上。居民看到数据中心不断开建,自己的电费却在上涨,自然会反弹。他认为解决办法不是少建数据中心,而是把发电能力一起补上。
Vance 说,美国过去一代人没有建设足够的电力设施,未来应该追求一种「电便宜到不用计量」的状态。他还拿中国作比较,认为美国这些年发电增长太慢,已经影响到 AI 等新产业的发展。
「便宜到不用计量」其实是美国核能史上的一句老口号。1954 年,美国原子能委员会主席 Lewis Strauss 曾用它描绘原子能带来的廉价电力时代。70 多年后,Vance 又把这句话搬出来,放到了 AI 数据中心带来的新一轮用电潮里。
美国的数据中心电力矛盾也确实正在升温。IEA 估算,数据中心贡献了美国 2025 年约一半的新增用电需求;美国国会本周还在推进法案,试图避免数据中心扩张带来的电网成本转嫁给普通家庭。
信源
动察 Beating 频道 · 动察 Beating 交流群
美国副总统 JD Vance 在 All-In 峰会上说,美国 AI 数据中心遭遇越来越大的反对,很大程度上是因为电力供应没跟上。居民看到数据中心不断开建,自己的电费却在上涨,自然会反弹。他认为解决办法不是少建数据中心,而是把发电能力一起补上。
Vance 说,美国过去一代人没有建设足够的电力设施,未来应该追求一种「电便宜到不用计量」的状态。他还拿中国作比较,认为美国这些年发电增长太慢,已经影响到 AI 等新产业的发展。
「便宜到不用计量」其实是美国核能史上的一句老口号。1954 年,美国原子能委员会主席 Lewis Strauss 曾用它描绘原子能带来的廉价电力时代。70 多年后,Vance 又把这句话搬出来,放到了 AI 数据中心带来的新一轮用电潮里。
美国的数据中心电力矛盾也确实正在升温。IEA 估算,数据中心贡献了美国 2025 年约一半的新增用电需求;美国国会本周还在推进法案,试图避免数据中心扩张带来的电网成本转嫁给普通家庭。
信源
动察 Beating 频道 · 动察 Beating 交流群
👍4😁2
纳德拉:AI Agent可能为完成任务做假账,成企业「新型内部风险」
微软 CEO Satya Nadella 在 All-In 峰会上警告,长期自主运行的 AI Agent 可能成为企业一种新的「内部风险」。他举例,如果让前沿模型去优化公司的营运资金,它为了完成目标,甚至可能直接「做假账」。
Nadella 认为,企业不能只看 Agent 最后交出的结果,还要验证它是怎么完成任务的。他提出用额外的模型检查结果,同时持续监控 Agent 的操作,所有行为都要可以追溯和审计。比如 Agent 读取机密信息、连续调用多个系统时,企业都应该看得见。
信源
动察 Beating 频道 · 动察 Beating 交流群
微软 CEO Satya Nadella 在 All-In 峰会上警告,长期自主运行的 AI Agent 可能成为企业一种新的「内部风险」。他举例,如果让前沿模型去优化公司的营运资金,它为了完成目标,甚至可能直接「做假账」。
Nadella 认为,企业不能只看 Agent 最后交出的结果,还要验证它是怎么完成任务的。他提出用额外的模型检查结果,同时持续监控 Agent 的操作,所有行为都要可以追溯和审计。比如 Agent 读取机密信息、连续调用多个系统时,企业都应该看得见。
信源
动察 Beating 频道 · 动察 Beating 交流群
马斯克提议AI巨头互测模型:别再「自己批自己的作业」
马斯克在 All-In 峰会上提议,前沿 AI 公司在发布新模型前,应该让竞争对手先做一轮安全测试。各家公司拿自己的安全测试体系去挑别人模型的问题,发现风险就直接指出,别再只靠自己给自己验收。
马斯克把现在的做法比作「自己批自己的作业」。相比自测,竞争对手更有动力把问题找出来。如果竞争对手已经警告某个模型不安全,公司仍坚持发布,后来真出了事,就很难再辩解,法律责任也会非常大。
他还认为,这套机制不能只让美国公司单方面执行,最好把中国等主要 AI 参与方也纳入,避免只有美国公司单方面承担限制。
信源
动察 Beating 频道 · 动察 Beating 交流群
马斯克在 All-In 峰会上提议,前沿 AI 公司在发布新模型前,应该让竞争对手先做一轮安全测试。各家公司拿自己的安全测试体系去挑别人模型的问题,发现风险就直接指出,别再只靠自己给自己验收。
马斯克把现在的做法比作「自己批自己的作业」。相比自测,竞争对手更有动力把问题找出来。如果竞争对手已经警告某个模型不安全,公司仍坚持发布,后来真出了事,就很难再辩解,法律责任也会非常大。
他还认为,这套机制不能只让美国公司单方面执行,最好把中国等主要 AI 参与方也纳入,避免只有美国公司单方面承担限制。
信源
动察 Beating 频道 · 动察 Beating 交流群
😁5
马斯克:AI扩张迟早卡在芯片产能
马斯克在 All-In 峰会上解释了为什么 Tesla 和 SpaceX 要自己建 Terafab 芯片工厂。他担心关键芯片未来可能因各种原因断供,但就算供应一直稳定,现有晶圆厂的产能也不够支撑 AI 继续扩张。
马斯克说,现在的晶圆厂基本已经满负荷运行。未来算力不只要进数据中心,还要支撑人形机器人和汽车,逻辑芯片、内存和先进封装都得一起扩产。
他的结论是,「要么建 Terafab,要么无法继续扩张」。Tesla 和 SpaceX 正在奥斯汀推进联合芯片产线,设备已经下单。马斯克希望明年底前先做出能用的芯片,但距离大规模量产还有一段时间。
信源
动察 Beating 频道 · 动察 Beating 交流群
马斯克在 All-In 峰会上解释了为什么 Tesla 和 SpaceX 要自己建 Terafab 芯片工厂。他担心关键芯片未来可能因各种原因断供,但就算供应一直稳定,现有晶圆厂的产能也不够支撑 AI 继续扩张。
马斯克说,现在的晶圆厂基本已经满负荷运行。未来算力不只要进数据中心,还要支撑人形机器人和汽车,逻辑芯片、内存和先进封装都得一起扩产。
他的结论是,「要么建 Terafab,要么无法继续扩张」。Tesla 和 SpaceX 正在奥斯汀推进联合芯片产线,设备已经下单。马斯克希望明年底前先做出能用的芯片,但距离大规模量产还有一段时间。
信源
动察 Beating 频道 · 动察 Beating 交流群
🤡2
Salesforce正式接进Claude,37个销售Skill直接查客户、改销售记录
Anthropic 和 Salesforce 正式推出 Salesforce in Claude Beta。它把 Salesforce 里的客户、商机和销售管道直接接进 Claude,并内置 37 个销售 Skill。销售人员不用离开对话,就能查客户、准备会议、评估商机、查看销售管道,也能直接更新 CRM 记录。此前这项功能只向少数客户试点开放。
Claude 还能把 Salesforce、Slack 和邮件里的信息合在一起,自动生成每日简报、会前材料和会后跟进,甚至根据实时数据生成交互式销售看板。修改 Salesforce 数据前,Claude 默认仍会要求用户确认,而且只能访问原账号有权限查看的数据。
Salesforce 内部已有约 7000 名销售人员在使用,GitLab、Siemens 和 Legora 也已部署。
以后销售未必还要天天点 CRM 界面,Claude 可以直接成为操作 Salesforce 的入口。
信源
动察 Beating 频道 · 动察 Beating 交流群
Anthropic 和 Salesforce 正式推出 Salesforce in Claude Beta。它把 Salesforce 里的客户、商机和销售管道直接接进 Claude,并内置 37 个销售 Skill。销售人员不用离开对话,就能查客户、准备会议、评估商机、查看销售管道,也能直接更新 CRM 记录。此前这项功能只向少数客户试点开放。
Claude 还能把 Salesforce、Slack 和邮件里的信息合在一起,自动生成每日简报、会前材料和会后跟进,甚至根据实时数据生成交互式销售看板。修改 Salesforce 数据前,Claude 默认仍会要求用户确认,而且只能访问原账号有权限查看的数据。
Salesforce 内部已有约 7000 名销售人员在使用,GitLab、Siemens 和 Legora 也已部署。
以后销售未必还要天天点 CRM 界面,Claude 可以直接成为操作 Salesforce 的入口。
信源
动察 Beating 频道 · 动察 Beating 交流群