终端变交互画布:Anthropic推出Claude Code版Artifacts
Anthropic 为 Claude Code(包含 CLI 命令行及桌面应用)推出 Artifacts 预览支持(面向 Claude Team 和 Enterprise 组织开放 Beta 测试)。该功能将 Artifacts 的实时交互体验从 Web 端延伸至本地终端,允许开发者将长期的终端会话进程(如故障排查、服务重构等)一键捕获并转化为实时的交互式网页。
依托包含本地代码库、已连接监控工具(Connectors)以及对话历史在内的完整会话上下文,Claude Code 无需任何配置即可自动整合测试失败、关联函数、错误峰值及根因推理,一键生成诸如 PR 演示、系统依赖图、动态仪表板以及可自动填写的发布清单。
为提升团队协同效率,生成的网页支持原地刷新,团队成员访问同一链接即可实时同步开发进展,并提供完整的版本历史回溯。在安全合规方面,所有生成的 Artifacts 默认仅个人可见,且强制要求组织身份验证,严禁向组织外部公开,企业管理员可设置留存策略并进行审计。
信源:https://x.com/claudeai/status/2067671912038240487
Anthropic 为 Claude Code(包含 CLI 命令行及桌面应用)推出 Artifacts 预览支持(面向 Claude Team 和 Enterprise 组织开放 Beta 测试)。该功能将 Artifacts 的实时交互体验从 Web 端延伸至本地终端,允许开发者将长期的终端会话进程(如故障排查、服务重构等)一键捕获并转化为实时的交互式网页。
依托包含本地代码库、已连接监控工具(Connectors)以及对话历史在内的完整会话上下文,Claude Code 无需任何配置即可自动整合测试失败、关联函数、错误峰值及根因推理,一键生成诸如 PR 演示、系统依赖图、动态仪表板以及可自动填写的发布清单。
为提升团队协同效率,生成的网页支持原地刷新,团队成员访问同一链接即可实时同步开发进展,并提供完整的版本历史回溯。在安全合规方面,所有生成的 Artifacts 默认仅个人可见,且强制要求组织身份验证,严禁向组织外部公开,企业管理员可设置留存策略并进行审计。
信源:https://x.com/claudeai/status/2067671912038240487
X (formerly Twitter)
Claude (@claudeai) on X
New in Claude Code: Artifacts.
Interactive pages built from your session, like a PR walkthrough or a living project dashboard, shared with your team at a private link.
Available in beta on Team and Enterprise plans.
Interactive pages built from your session, like a PR walkthrough or a living project dashboard, shared with your team at a private link.
Available in beta on Team and Enterprise plans.
AA-Briefcase发布:Claude Fable 5夺冠,GLM-5.2挤进前三
评测机构 Artificial Analysis 推出首个专为大模型智能体设计的长周期知识工作评测基准 AA-Briefcase。评测包含数据科学、产品管理、银行业务运营及重工业战略四个场景,由来自谷歌、麦肯锡和波士顿咨询的行业专家开发,共设有 91 项任务,旨在模拟真实复杂的商业项目流。
基准通过客观题、分析质量和排版展示三个维度进行双人对战及基准评测。结果显示,Anthropic 旗下的 Claude Fable 5 取得了最高综合评分 AA-Briefcase Elo,Claude Opus 4.8 (max) 与 GLM-5.2 (max) 分列第二与第三位。即便强如 Claude Fable 5,在严格的单项任务全对标准下,完美率也仅有 3%,且在 91 项任务中有 31 项没有任何模型能取得 50% 以上的分数。
在开源模型方面,智谱 GLM-5.2 (max) 表现突出,综合评分仅比 Claude Opus 4.8 (max) 低 90 分,但运行成本不足 Claude Opus 4.8 (max) 的 25%。运行成本在不同模型间差异悬殊,DeepSeek V4 Flash 单次任务成本仅为 0.04 美元,而最贵的 Claude Fable 5 超过 31 美元。分析显示,视觉检查能力对提升交付成果的排版质量至关重要,领先排版评分的 Claude Fable 5 和 Claude Opus 4.8 (max) 每次任务平均分别调用 21 次和 12 次图像查看工具。
信源:https://artificialanalysis.ai/articles/aa-briefcase
评测机构 Artificial Analysis 推出首个专为大模型智能体设计的长周期知识工作评测基准 AA-Briefcase。评测包含数据科学、产品管理、银行业务运营及重工业战略四个场景,由来自谷歌、麦肯锡和波士顿咨询的行业专家开发,共设有 91 项任务,旨在模拟真实复杂的商业项目流。
基准通过客观题、分析质量和排版展示三个维度进行双人对战及基准评测。结果显示,Anthropic 旗下的 Claude Fable 5 取得了最高综合评分 AA-Briefcase Elo,Claude Opus 4.8 (max) 与 GLM-5.2 (max) 分列第二与第三位。即便强如 Claude Fable 5,在严格的单项任务全对标准下,完美率也仅有 3%,且在 91 项任务中有 31 项没有任何模型能取得 50% 以上的分数。
在开源模型方面,智谱 GLM-5.2 (max) 表现突出,综合评分仅比 Claude Opus 4.8 (max) 低 90 分,但运行成本不足 Claude Opus 4.8 (max) 的 25%。运行成本在不同模型间差异悬殊,DeepSeek V4 Flash 单次任务成本仅为 0.04 美元,而最贵的 Claude Fable 5 超过 31 美元。分析显示,视觉检查能力对提升交付成果的排版质量至关重要,领先排版评分的 Claude Fable 5 和 Claude Opus 4.8 (max) 每次任务平均分别调用 21 次和 12 次图像查看工具。
信源:https://artificialanalysis.ai/articles/aa-briefcase
❤1
只教AI在健康对话里当好人,它连写代码也变老实了?OpenAI证实对齐强泛化
大家都知道 AI 学坏容易,但 AI 变好也能「人传人」吗?OpenAI 发表最新研究,证实了对齐领域中奇妙的「强泛化」现象:研究人员只需在极少数日常场景中把 AI 教成不撒谎、乐于认错的「好人」,AI 在从未学过的全新场景里也会自动变乖。实验证明,正向的对齐人格同样具备跨领域传染力。
研究团队在医疗、教育、科学等场景中重点训练了大模型的诚实和谦虚等特质。测试发现,模型学到好人特质后,在 53 项安全评估中,有 44 项超越了普通模型。最惊人的证据在于跨领域泛化:哪怕训练集里完全不包含医疗和科学对话,模型在医疗评估中依旧变老实了;反过来,只在医疗领域训练 AI 做好人,AI 在完全不相关的代码或日常测试里,也自动学会了防骗和不钻空子。
好人性格在实战中极其稳固。面对诱导 AI 说胡话的对抗性套路,对齐模型不仅顶住了压力,还能继续听懂正常指令。即便用充满错误医疗建议的脏数据对模型进行恶意微调,模型在其他领域的安全性也几乎没有退化。研究团队认为,注入善良的强化学习训练能让对齐特质在模型深层生根发芽,真正起到「以点带面」的防护效果。
信源:https://alignment.openai.com/beneficial-rl/
大家都知道 AI 学坏容易,但 AI 变好也能「人传人」吗?OpenAI 发表最新研究,证实了对齐领域中奇妙的「强泛化」现象:研究人员只需在极少数日常场景中把 AI 教成不撒谎、乐于认错的「好人」,AI 在从未学过的全新场景里也会自动变乖。实验证明,正向的对齐人格同样具备跨领域传染力。
研究团队在医疗、教育、科学等场景中重点训练了大模型的诚实和谦虚等特质。测试发现,模型学到好人特质后,在 53 项安全评估中,有 44 项超越了普通模型。最惊人的证据在于跨领域泛化:哪怕训练集里完全不包含医疗和科学对话,模型在医疗评估中依旧变老实了;反过来,只在医疗领域训练 AI 做好人,AI 在完全不相关的代码或日常测试里,也自动学会了防骗和不钻空子。
好人性格在实战中极其稳固。面对诱导 AI 说胡话的对抗性套路,对齐模型不仅顶住了压力,还能继续听懂正常指令。即便用充满错误医疗建议的脏数据对模型进行恶意微调,模型在其他领域的安全性也几乎没有退化。研究团队认为,注入善良的强化学习训练能让对齐特质在模型深层生根发芽,真正起到「以点带面」的防护效果。
信源:https://alignment.openai.com/beneficial-rl/
OpenAI Alignment Research Blog
Reinforcement learning towards broadly and persistently beneficial models
Training targeting beneficial behavior in realistic scenarios produces broad improvements in alignment that generalize across domains and persist under adversarial pressure.
Perplexity推出智能体内存系统Brain:从任务中自适应学习
Perplexity 为旗下智能体 Computer 推出名为 Brain 的自我改进内存系统。
区别于侧重记录用户姓名、兴趣等个人画像的传统 AI 记忆,Brain 专注于保存智能体自身的动作与任务表现。
智能体每次运行任务,Brain 都会在后台自动构建上下文图谱,记录所用工具、成功与失败的信源、执行结果以及用户修正。上下文图谱会转化为一份动态的 AI 知识库,在智能体下次启动时自动载入沙盒运行环境。
为避免单次任务的局限性,Brain 会在夜间自动完成增量合成,聚合前一天的全部会话、连接应用输出以及反馈数据,对知识库进行剪枝与优化。
预加载历史经验可让智能体在后续任务中主动规避重复错误、预测潜在问题并减少冗余尝试。Perplexity 披露的测试数据显示,在复现任务中,Brain 使智能体回答准确率提升 25%,信息召回率改善 16%,并在依赖历史上下文的任务中降低 13% 的 Token 消耗。
随着使用时间增加,系统累积的性能红利也会更加显著。为保障透明度,Brain 的每条记忆均可追溯至原始会话或文件。目前,新系统已面向 Perplexity Max 与 Enterprise Max 订阅用户开启研究预览。
信源:https://www.perplexity.ai/hub/blog/self-improving-memory-for-agents
Perplexity 为旗下智能体 Computer 推出名为 Brain 的自我改进内存系统。
区别于侧重记录用户姓名、兴趣等个人画像的传统 AI 记忆,Brain 专注于保存智能体自身的动作与任务表现。
智能体每次运行任务,Brain 都会在后台自动构建上下文图谱,记录所用工具、成功与失败的信源、执行结果以及用户修正。上下文图谱会转化为一份动态的 AI 知识库,在智能体下次启动时自动载入沙盒运行环境。
为避免单次任务的局限性,Brain 会在夜间自动完成增量合成,聚合前一天的全部会话、连接应用输出以及反馈数据,对知识库进行剪枝与优化。
预加载历史经验可让智能体在后续任务中主动规避重复错误、预测潜在问题并减少冗余尝试。Perplexity 披露的测试数据显示,在复现任务中,Brain 使智能体回答准确率提升 25%,信息召回率改善 16%,并在依赖历史上下文的任务中降低 13% 的 Token 消耗。
随着使用时间增加,系统累积的性能红利也会更加显著。为保障透明度,Brain 的每条记忆均可追溯至原始会话或文件。目前,新系统已面向 Perplexity Max 与 Enterprise Max 订阅用户开启研究预览。
信源:https://www.perplexity.ai/hub/blog/self-improving-memory-for-agents
Perplexity AI
Perplexity is a free AI-powered answer engine that provides accurate, trusted, and real-time answers to any question.
AI随时可能造反?谷歌DeepMind像防内鬼一样防AI,派监工全程盯防
谷歌 DeepMind 发布 AI Control 路线图,针对内部部署的先进 AI 智能体设计系统级安全框架。路线图将智能体视为潜在的「内部威胁」(类似于公司内的叛变员工),打破单一的模型对齐防线,在系统层面建立起纵深防御。安全系统引入可信 AI 充当监督智能体,实时盯防运行中智能体的推理链、动作与计划,一旦检测到异常或危害企图便直接拦截动作。
整套防御机制借鉴了网络安全行业标准的 MITRE ATT&CK 对抗框架,建立起智能体专用的威胁建模系统。系统将 AI 潜在的异常企图拆解为具体的战术与步骤,使团队能像防范公司内鬼一样追踪风险并运行安全演练。在监控上,监督智能体通过量化监控覆盖率、失效行为召回率和响应时长来评估整体安全度。
防线也需要随着 AI 能力演进同步升级。如果智能体进化出监督意识 (oversight awareness) 或不透明推理 (opaque reasoning) 并尝试隐藏思维过程,单纯读取文本推理链将失效,监控将转向分析行为特征和探测神经网络内部状态。防御级别也与威胁严重性相挂钩:低风险、可逆的普通动作允许采用事后异步审计;一旦涉及网络攻击等高风险操作,监控系统会强制切入同步实时预防,在动作发生前予以拦截。
目前,开发团队已通过原型系统分析了 100 万次任务轨迹。实测数据表明,绝大多数被警告的异常并非出于主观恶意,而是源于智能体误解了指令,或因过度急于达成用户目标而动作过载。积累的经验现已用于为 Gemini Spark 智能体构建起实时监控系统,能够即时干预意外删除数据等失控动作。在技术管控之外,团队还发布了智能体安全三层架构,呼吁政策制定者、学术界与行业多方协同共筑安全防线。
信源:https://deepmind.google/blog/securing-the-future-of-ai-agents/
谷歌 DeepMind 发布 AI Control 路线图,针对内部部署的先进 AI 智能体设计系统级安全框架。路线图将智能体视为潜在的「内部威胁」(类似于公司内的叛变员工),打破单一的模型对齐防线,在系统层面建立起纵深防御。安全系统引入可信 AI 充当监督智能体,实时盯防运行中智能体的推理链、动作与计划,一旦检测到异常或危害企图便直接拦截动作。
整套防御机制借鉴了网络安全行业标准的 MITRE ATT&CK 对抗框架,建立起智能体专用的威胁建模系统。系统将 AI 潜在的异常企图拆解为具体的战术与步骤,使团队能像防范公司内鬼一样追踪风险并运行安全演练。在监控上,监督智能体通过量化监控覆盖率、失效行为召回率和响应时长来评估整体安全度。
防线也需要随着 AI 能力演进同步升级。如果智能体进化出监督意识 (oversight awareness) 或不透明推理 (opaque reasoning) 并尝试隐藏思维过程,单纯读取文本推理链将失效,监控将转向分析行为特征和探测神经网络内部状态。防御级别也与威胁严重性相挂钩:低风险、可逆的普通动作允许采用事后异步审计;一旦涉及网络攻击等高风险操作,监控系统会强制切入同步实时预防,在动作发生前予以拦截。
目前,开发团队已通过原型系统分析了 100 万次任务轨迹。实测数据表明,绝大多数被警告的异常并非出于主观恶意,而是源于智能体误解了指令,或因过度急于达成用户目标而动作过载。积累的经验现已用于为 Gemini Spark 智能体构建起实时监控系统,能够即时干预意外删除数据等失控动作。在技术管控之外,团队还发布了智能体安全三层架构,呼吁政策制定者、学术界与行业多方协同共筑安全防线。
信源:https://deepmind.google/blog/securing-the-future-of-ai-agents/
Google DeepMind
Securing internal systems against increasingly capable and imperfectly aligned AI
Discover our AI Control Roadmap: a defense-in-depth system to securely manage advanced, potentially misaligned AI agents.
动察Beating AI News
彼得·蒂尔神秘学会Dialog遭泄密:马斯克等政商巨头参会,议程涉邪教与三战 据《连线》杂志 (WIRED) 报道,由彼得·蒂尔联合创立的神秘学会 Dialog 泄露了 222 名精英的参会记录,包括埃隆·马斯克、谷歌前 CEO Eric Schmidt、OpenAI 总裁 Greg Brockman 及特朗普女婿 Jared Kushner。泄露的数据库不仅公开了名单,还曝光了探讨建立邪教、应对第三次世界大战等极为隐私的议程。 Dialog 自 2006 年创立以来保密运营了近 20 年,常被称为科技界的「毕德堡会议」,参会费超…
彼得·蒂尔神秘学会暗黑评级曝光:大佬被分三六九等,C级最高A级垫底,价格按名气打折
据《连线》(WIRED)对最新泄露数据的分析,彼得·蒂尔联合创立的神秘学会 Dialog 内部有一套极其冷酷且偏见明显的「分级与淘汰」机制。
Dialog 实行「入门即评级」的隐秘规则。虽然该俱乐部拥有上千名会员,但此次泄露并被 WIRED 获取审查的仅是俱乐部内部建档的 192 份个人档案(包含 130 名正式会员及部分候选人)。它们展示了俱乐部反直觉的鄙视链:C 级才是最高 VIP,B 级是占绝大多数的普通层,而通常被视作最好的 A 级,反而是知名度最低的垫底边缘层。
这套评级直接与成员的钱包挂钩。仅有约 25% 的 VIP「C」级大佬被要求支付全额参会费,而在垫底的「A」级成员中,全额支付数万美元参会费的比例则高达 70%。
比较滑稽的是,Dialog 引入的 AI 筛选机制极度迷信所谓的「国民知名度」。例如「灭霸」演员乔什·布洛林(Josh Brolin)虽从未参会,却凭电影票房与数百万粉丝直接躺赢 VIP「C」级;而学术巨擘泰勒·考恩(Tyler Cowen)却被 AI 判定「在普通人里不够出名」险些被划入普通层,最终靠人工干预才勉强升入 C 级。
而「增值分」则是清退「无用之人」的镰刀,专门衡量成员对俱乐部其他巨头的资源对接和智力贡献。每次聚会后,员工都会像「审查代码」一样复盘成员表现,增值分太低、文化不契合或声量下滑者会被无情移出邀请名单。
此外,泄露的数据库还曝光了其内置的社交与约会配对系统(10% 成员加入单身池),算法在推荐配对的同时还设有「禁止配对名单」。
这套号称客观的评估系统同样塞满了偏见:女性占了成员的三分之一,却只分到了 18% 的 VIP 席位;政治立场上更难逃区别对待,尽管超半数成员自称「左倾」,但「右翼」拿到 VIP 的概率却是左倾者的两倍多,甚至有环保大佬的「左倾」标签被员工在后台强行改写成了「右翼」。
信源:https://www.wired.com/story/how-peter-thiels-private-dialog-club-secretly-ranks-its-members/
据《连线》(WIRED)对最新泄露数据的分析,彼得·蒂尔联合创立的神秘学会 Dialog 内部有一套极其冷酷且偏见明显的「分级与淘汰」机制。
Dialog 实行「入门即评级」的隐秘规则。虽然该俱乐部拥有上千名会员,但此次泄露并被 WIRED 获取审查的仅是俱乐部内部建档的 192 份个人档案(包含 130 名正式会员及部分候选人)。它们展示了俱乐部反直觉的鄙视链:C 级才是最高 VIP,B 级是占绝大多数的普通层,而通常被视作最好的 A 级,反而是知名度最低的垫底边缘层。
这套评级直接与成员的钱包挂钩。仅有约 25% 的 VIP「C」级大佬被要求支付全额参会费,而在垫底的「A」级成员中,全额支付数万美元参会费的比例则高达 70%。
比较滑稽的是,Dialog 引入的 AI 筛选机制极度迷信所谓的「国民知名度」。例如「灭霸」演员乔什·布洛林(Josh Brolin)虽从未参会,却凭电影票房与数百万粉丝直接躺赢 VIP「C」级;而学术巨擘泰勒·考恩(Tyler Cowen)却被 AI 判定「在普通人里不够出名」险些被划入普通层,最终靠人工干预才勉强升入 C 级。
而「增值分」则是清退「无用之人」的镰刀,专门衡量成员对俱乐部其他巨头的资源对接和智力贡献。每次聚会后,员工都会像「审查代码」一样复盘成员表现,增值分太低、文化不契合或声量下滑者会被无情移出邀请名单。
此外,泄露的数据库还曝光了其内置的社交与约会配对系统(10% 成员加入单身池),算法在推荐配对的同时还设有「禁止配对名单」。
这套号称客观的评估系统同样塞满了偏见:女性占了成员的三分之一,却只分到了 18% 的 VIP 席位;政治立场上更难逃区别对待,尽管超半数成员自称「左倾」,但「右翼」拿到 VIP 的概率却是左倾者的两倍多,甚至有环保大佬的「左倾」标签被员工在后台强行改写成了「右翼」。
信源:https://www.wired.com/story/how-peter-thiels-private-dialog-club-secretly-ranks-its-members/
WIRED
How the Peter Thiel-Linked Dialog Club Secretly Ranks Its Members
Leaked files show the invite-only network grades members by their money and fame, shaping who’s in, who’s out, and who pays.
❤1
诺奖得主John Jumper离开DeepMind,谷歌两日内连失两名AI高管
谷歌 DeepMind 副总裁及 AlphaFold 团队负责人 John Jumper 宣布将加盟 Anthropic。John Jumper 在谷歌 DeepMind 任职近 9 年,因主导开发 AlphaFold 与首席执行官 Demis Hassabis 共同获得 2024 年诺贝尔化学奖。
就在前一日,前 Gemini 共同负责人、《Attention Is All You Need》共同作者之一 Noam Shazeer 也已宣布离开谷歌,加盟 OpenAI 担任架构研究负责人。
信源:https://x.com/JohnJumperSci/status/2068001285173834106
谷歌 DeepMind 副总裁及 AlphaFold 团队负责人 John Jumper 宣布将加盟 Anthropic。John Jumper 在谷歌 DeepMind 任职近 9 年,因主导开发 AlphaFold 与首席执行官 Demis Hassabis 共同获得 2024 年诺贝尔化学奖。
就在前一日,前 Gemini 共同负责人、《Attention Is All You Need》共同作者之一 Noam Shazeer 也已宣布离开谷歌,加盟 OpenAI 担任架构研究负责人。
信源:https://x.com/JohnJumperSci/status/2068001285173834106
X (formerly Twitter)
John Jumper (@JohnJumperSci) on X
A bit of news: After nearly 9 years, I have decided to leave Google DeepMind and join Anthropic (after taking some time to recharge). I am incredibly grateful for my time at GDM. @demishassabis took a real chance letting me lead the AlphaFold team just six…
❤1
美前沿AI管制令留缝隙,思科等机构仍可访问Anthropic最强安全模型
美政府针对 Anthropic 颁布的出口管制令未能完全阻断访问,网络安全公司 Dragos 与思科系统已证实,两家公司自身均保留了 Mythos 预览版的访问权限。
Mythos 预览版在测试中表现出强大的漏洞检测能力,可找出主流操作系统与浏览器中的数千个安全漏洞。为防滥用,Anthropic 于 4 月将 Mythos 预览版访问权限制在 Project Glasswing 联盟内部。Project Glasswing 由大约 200 家包含银行与科技公司在内的组织组成。作为替代,Anthropic 向公众发布移除了网络安全任务执行权限的 Fable 5 模型。
随着出口许可审查要求下达,美政府勒令 Anthropic 封锁 Fable 5 和 Mythos 5,防止未经许可的外籍人员使用。Anthropic 随即关停了 Fable 5 公众服务,并暂停向 Project Glasswing 成员推送 Mythos 5。然而,美政府指令并未提及 Mythos 预览版。Anthropic 在官方博客中表示「余下模型」不受影响,但未直接提及 Mythos 预览版。
信源:https://www.bloomberg.com/news/articles/2026-06-19/early-users-of-anthropic-mythos-still-have-access-after-us-order
美政府针对 Anthropic 颁布的出口管制令未能完全阻断访问,网络安全公司 Dragos 与思科系统已证实,两家公司自身均保留了 Mythos 预览版的访问权限。
Mythos 预览版在测试中表现出强大的漏洞检测能力,可找出主流操作系统与浏览器中的数千个安全漏洞。为防滥用,Anthropic 于 4 月将 Mythos 预览版访问权限制在 Project Glasswing 联盟内部。Project Glasswing 由大约 200 家包含银行与科技公司在内的组织组成。作为替代,Anthropic 向公众发布移除了网络安全任务执行权限的 Fable 5 模型。
随着出口许可审查要求下达,美政府勒令 Anthropic 封锁 Fable 5 和 Mythos 5,防止未经许可的外籍人员使用。Anthropic 随即关停了 Fable 5 公众服务,并暂停向 Project Glasswing 成员推送 Mythos 5。然而,美政府指令并未提及 Mythos 预览版。Anthropic 在官方博客中表示「余下模型」不受影响,但未直接提及 Mythos 预览版。
信源:https://www.bloomberg.com/news/articles/2026-06-19/early-users-of-anthropic-mythos-still-have-access-after-us-order
Bloomberg.com
Early Users of Anthropic Mythos Still Have Access After US Order
Some firms chosen early on by Anthropic PBC to test the Mythos AI model ahead of a wider release have preserved their access to a preview of the system, despite a US government order that led to the total shutdown of other versions.
最强模型即将解封?特朗普称G7面谈后不再视Anthropic为威胁
美国总统唐纳德·特朗普在接受 Axios 采访时表明,已不再将人工智能公司 Anthropic 视为国家安全威胁。就在一周前,他曾将 Anthropic 定位为潜在威胁。态度发生反转的契机,源于 G7 峰会午宴期间,特朗普与座次被冷落的 Anthropic 首席执行官达里奥·阿莫代进行的面谈。
双方先前在一周内因 Fable 5 与 Mythos 5 模型的「越狱」安全漏洞严重性产生分歧。因谈判破裂,美国商务部于 6 月 12 日出台出口管制令,拦截了 Claude Fable 5 与 Claude Mythos 5 模型的出口,要求外国技术人员访问必须获批。这导致阿莫代在 G7 午宴上面临尴尬,座次安排在长桌另一端。
危机爆发后,谈判转向技术标准的联合制定。白宫、商务部、国家网络总监与 Anthropic 高层开展多轮沟通,并派遣安全专家前往华盛顿,构建评估大模型漏洞严重性及政府干预边界的技术基准框架。特朗普称,阿莫代对整改要求做出了快速配合。
态度的转变直接扫清了 Anthropic 推进上市与扩张的政策障碍。截至 2026 年 6 月,Anthropic 年化经常性收入已达 470 亿美元,估值达 9650 亿美元,且已提交上市申请。如果持续被定位为安全威胁,Anthropic 推进上市将面临巨大的政策不确定性。
在监管立场上,特朗普重申不希望通过关闭或接管公司限制国内 AI 行业,首要任务是维持对华竞争优势。不过,动用紧急行政权力的强制监管选项并未排除。特朗普表示,目前并不确定是否需要启动《国防生产法》,但必要时仍会动用权力。
信源:https://www.axios.com/2026/06/19/trump-axios-show-interview-transcript-marc-caputo
美国总统唐纳德·特朗普在接受 Axios 采访时表明,已不再将人工智能公司 Anthropic 视为国家安全威胁。就在一周前,他曾将 Anthropic 定位为潜在威胁。态度发生反转的契机,源于 G7 峰会午宴期间,特朗普与座次被冷落的 Anthropic 首席执行官达里奥·阿莫代进行的面谈。
双方先前在一周内因 Fable 5 与 Mythos 5 模型的「越狱」安全漏洞严重性产生分歧。因谈判破裂,美国商务部于 6 月 12 日出台出口管制令,拦截了 Claude Fable 5 与 Claude Mythos 5 模型的出口,要求外国技术人员访问必须获批。这导致阿莫代在 G7 午宴上面临尴尬,座次安排在长桌另一端。
危机爆发后,谈判转向技术标准的联合制定。白宫、商务部、国家网络总监与 Anthropic 高层开展多轮沟通,并派遣安全专家前往华盛顿,构建评估大模型漏洞严重性及政府干预边界的技术基准框架。特朗普称,阿莫代对整改要求做出了快速配合。
态度的转变直接扫清了 Anthropic 推进上市与扩张的政策障碍。截至 2026 年 6 月,Anthropic 年化经常性收入已达 470 亿美元,估值达 9650 亿美元,且已提交上市申请。如果持续被定位为安全威胁,Anthropic 推进上市将面临巨大的政策不确定性。
在监管立场上,特朗普重申不希望通过关闭或接管公司限制国内 AI 行业,首要任务是维持对华竞争优势。不过,动用紧急行政权力的强制监管选项并未排除。特朗普表示,目前并不确定是否需要启动《国防生产法》,但必要时仍会动用权力。
信源:https://www.axios.com/2026/06/19/trump-axios-show-interview-transcript-marc-caputo
Axios
Read the transcript of Trump's interview with "The Axios Show"
Axios' Marc Caputo spoke with Trump at the White House on Thursday, June 18.
❤1
无需Mac中转与自托管,开源智能体Hermes接入iMessage
开源 AI 智能体框架 Hermes Agent 发布 v0.17.0 版本,核心打通了无需 Mac 硬件中转的 iMessage 接入通道。新版本集成基于 Photon Spectrum 托管线路池的 iMessage 平台插件,允许用户通过设备码直接登录,彻底摆脱了必须自托管 Mac 设备或配置 BlueBubbles 等中转网关的限制。
除通信渠道扩展外,新版本引入了异步子智能体设计,支持通过 delegate_task(background=true) 将繁重的研究或构建任务派发至后台运行,主智能体可在任务执行期间与用户继续交互而不被阻塞。在模型支持方面,xAI 订阅授权新增了对最新 grok-composer-2.5-fast 模型(具备 200k 上下文)的支持,用户无需独立 API 密钥即可直接获取 Cursor 同款 Composer 快速编程能力。
桌面端新增了子智能体实时监视窗口 watch-windows,允许用户以独立窗格流式观测后台任务的执行轨迹,并支持直接安装任何 VS Code 插件市场主题。在底层机制上,升级后的 memory 内存工具支持在单次调用中原子化执行添加、替换和删除操作,从而在有限的字符预算内更高效地释放和管理内存,显著降低了多轮对话中因内存空间溢出导致交互失败的概率。
信源:https://github.com/NousResearch/hermes-agent/releases/tag/v2026.6.19
开源 AI 智能体框架 Hermes Agent 发布 v0.17.0 版本,核心打通了无需 Mac 硬件中转的 iMessage 接入通道。新版本集成基于 Photon Spectrum 托管线路池的 iMessage 平台插件,允许用户通过设备码直接登录,彻底摆脱了必须自托管 Mac 设备或配置 BlueBubbles 等中转网关的限制。
除通信渠道扩展外,新版本引入了异步子智能体设计,支持通过 delegate_task(background=true) 将繁重的研究或构建任务派发至后台运行,主智能体可在任务执行期间与用户继续交互而不被阻塞。在模型支持方面,xAI 订阅授权新增了对最新 grok-composer-2.5-fast 模型(具备 200k 上下文)的支持,用户无需独立 API 密钥即可直接获取 Cursor 同款 Composer 快速编程能力。
桌面端新增了子智能体实时监视窗口 watch-windows,允许用户以独立窗格流式观测后台任务的执行轨迹,并支持直接安装任何 VS Code 插件市场主题。在底层机制上,升级后的 memory 内存工具支持在单次调用中原子化执行添加、替换和删除操作,从而在有限的字符预算内更高效地释放和管理内存,显著降低了多轮对话中因内存空间溢出导致交互失败的概率。
信源:https://github.com/NousResearch/hermes-agent/releases/tag/v2026.6.19
GitHub
Release Hermes Agent v0.17.0 (v2026.6.19) · NousResearch/hermes-agent
Hermes Agent v0.17.0 (v2026.6.19)
Release Date: June 19, 2026
Since v0.16.0: ~1,475 commits · ~800 merged PRs · 1,693 files changed · 235,390 insertions · 50,730 deletions · 300+ issues closed · 24...
Release Date: June 19, 2026
Since v0.16.0: ~1,475 commits · ~800 merged PRs · 1,693 files changed · 235,390 insertions · 50,730 deletions · 300+ issues closed · 24...
微信原生AI助手「小微」开启灰度测试,支持一句话生成小程序
微信在主界面左上角灰度上线原生 AI 助手「小微」,支持用户通过文字或语音操作微信原生功能、调起小程序等任务。根据用户测试,「小微」不仅能根据对话生成可播放的音乐歌单,还支持在一句对话中生成包含图表与按钮的专属小工具,或在群聊中生成聊天总结。
腾讯客服回应确认,「小微」是微信团队在小范围内测的原生 AI 助手。助理底层主模型采用腾讯自研的 WeLM 大模型,并由 DeepSeek 提供部分回答兜底。
在具体功能上,「小微」深度整合了微信生态内的连接能力。用户直接发送 PDF 文件,助手可给出结构化内容摘要并展示思考过程。当用户设置 5 分钟提醒时,系统会直接在对话中生成待办提醒。用户还能在「小微」中通过输入文本需求,在几秒内生成包含页面、按钮和统计图表的小工具。目前生成的小工具仅限个人使用,不支持分享给他人。
与独立运行的第三方大模型助手不同,「小微」长在微信主界面左上角,直接与用户的关系链、公众号、视频号、文件和微信支付等原生生态打通。
目前助手仍处于灰度测试阶段,部分功能细节较为粗糙,腾讯尚未公布更大规模的上线计划。
信源:https://mp.weixin.qq.com/s/BDzdeivM7bDya00C1Loj6g
微信在主界面左上角灰度上线原生 AI 助手「小微」,支持用户通过文字或语音操作微信原生功能、调起小程序等任务。根据用户测试,「小微」不仅能根据对话生成可播放的音乐歌单,还支持在一句对话中生成包含图表与按钮的专属小工具,或在群聊中生成聊天总结。
腾讯客服回应确认,「小微」是微信团队在小范围内测的原生 AI 助手。助理底层主模型采用腾讯自研的 WeLM 大模型,并由 DeepSeek 提供部分回答兜底。
在具体功能上,「小微」深度整合了微信生态内的连接能力。用户直接发送 PDF 文件,助手可给出结构化内容摘要并展示思考过程。当用户设置 5 分钟提醒时,系统会直接在对话中生成待办提醒。用户还能在「小微」中通过输入文本需求,在几秒内生成包含页面、按钮和统计图表的小工具。目前生成的小工具仅限个人使用,不支持分享给他人。
与独立运行的第三方大模型助手不同,「小微」长在微信主界面左上角,直接与用户的关系链、公众号、视频号、文件和微信支付等原生生态打通。
目前助手仍处于灰度测试阶段,部分功能细节较为粗糙,腾讯尚未公布更大规模的上线计划。
信源:https://mp.weixin.qq.com/s/BDzdeivM7bDya00C1Loj6g
✍1
桑德斯提案对AI巨头征50%股权税,背后推手为DeepMind科学家之妻
美国参议员伯尼·桑德斯 (Bernie Sanders) 提交法案,提议对年销售额超 2 亿美元的 AI 公司征收 50% 股权税建主权财富基金。法案起草顾问为加州大学戴维斯分校法学教授萨拉·波尔茨 (Sarah Polcz),波尔茨的丈夫亚当·布朗 (Adam Brown) 领衔谷歌 DeepMind 旗下 Blueshift 团队。
根据提案,符合条件的 AI 公司须将半数股权注入基金,由总统提名并经参议院确认的 7 人跨党派委员会管理。委员会不仅有权为 AI 公司任命董事参与重大决策,还将以基金名义每年向全体公民发放约 5% 的股息,预计每人每年可得约 1000 美元。
强制收缴半数股权的要求让风投圈普遍感到焦虑,批评者指出重税会吓跑训练模型所需的私募资本。但波尔茨与合著者杰里米·贝勒-弗伦德 (Jeremy Bearer-Friend) 认为,既然大模型是拿全人类的万亿 Token 数据训练出来的,公众就理应以所有者身份分享价值。法案在部分 AI 开发人员中也得到了支持。前谷歌研究员、前 Deep Genomics 机器学习负责人约尔·绍尔 (Joel Shor) 对此表示赞同,称技术人员内部已在反思大模型的构建方式与财富集中问题。
波尔茨与布朗的社交圈深度融入硅谷中心。谷歌联合创始人谢尔盖·布林 (Sergey Brin) 曾在一场波尔茨家举办的聚会中决定重返谷歌。提案公布后,布朗陪同波尔茨前往被誉为硅谷风险投资大本营的沙丘路,在罗斯伍德酒店开香槟庆祝。
尽管布朗本人拒绝对法案发表评论,波尔茨代布朗澄清,布朗在谷歌 DeepMind 仅专注于提升 AI 的科学与推理能力,对社会如何应对技术冲击没有任何政策立场。
信源:https://www.theinformation.com/articles/law-professor-behind-bernies-ai-sovereign-wealth-fund-idea
美国参议员伯尼·桑德斯 (Bernie Sanders) 提交法案,提议对年销售额超 2 亿美元的 AI 公司征收 50% 股权税建主权财富基金。法案起草顾问为加州大学戴维斯分校法学教授萨拉·波尔茨 (Sarah Polcz),波尔茨的丈夫亚当·布朗 (Adam Brown) 领衔谷歌 DeepMind 旗下 Blueshift 团队。
根据提案,符合条件的 AI 公司须将半数股权注入基金,由总统提名并经参议院确认的 7 人跨党派委员会管理。委员会不仅有权为 AI 公司任命董事参与重大决策,还将以基金名义每年向全体公民发放约 5% 的股息,预计每人每年可得约 1000 美元。
强制收缴半数股权的要求让风投圈普遍感到焦虑,批评者指出重税会吓跑训练模型所需的私募资本。但波尔茨与合著者杰里米·贝勒-弗伦德 (Jeremy Bearer-Friend) 认为,既然大模型是拿全人类的万亿 Token 数据训练出来的,公众就理应以所有者身份分享价值。法案在部分 AI 开发人员中也得到了支持。前谷歌研究员、前 Deep Genomics 机器学习负责人约尔·绍尔 (Joel Shor) 对此表示赞同,称技术人员内部已在反思大模型的构建方式与财富集中问题。
波尔茨与布朗的社交圈深度融入硅谷中心。谷歌联合创始人谢尔盖·布林 (Sergey Brin) 曾在一场波尔茨家举办的聚会中决定重返谷歌。提案公布后,布朗陪同波尔茨前往被誉为硅谷风险投资大本营的沙丘路,在罗斯伍德酒店开香槟庆祝。
尽管布朗本人拒绝对法案发表评论,波尔茨代布朗澄清,布朗在谷歌 DeepMind 仅专注于提升 AI 的科学与推理能力,对社会如何应对技术冲击没有任何政策立场。
信源:https://www.theinformation.com/articles/law-professor-behind-bernies-ai-sovereign-wealth-fund-idea
The Information
The Law Professor Behind Bernie’s AI Sovereign Wealth Fund Idea
A couple of weekends ago, Sarah Polcz, a University of California, Davis, law professor, and her husband, Adam Brown, a top scientist at Google’s DeepMind, hosted a party at their Portola Valley home that had all the trappings of a geeky good time. One guest…
万斯主张国家入股AI巨头,马斯克公开唱反调:直接给民众发钱,未来是大通缩
美国副总统万斯 (JD Vance) 在接受《CEO 日记》采访时表示,特朗普支持美国建立主权财富基金,并持有多家前沿 AI 巨头的股权。万斯认为,绝不能任由大模型企业成长为数万亿美元且不受控的垄断者,否则富人将变得更富,穷人则沦为附庸。他主张通过国家持股,并引入工会集体谈判一类的「预分配」机制,让劳动者在决策桌上占有一席之地,在初次分配中直接分享技术红利,避免穷人最终沦为依赖富人施舍的附庸,而非依靠传统的税收再分配。
马斯克 (Elon Musk) 随后在 X 平台公开唱反调,提出相较于政府入股更优的替代方案,即直接由财政部向民众发钱。马斯克解释,在 AI 与机器人技术支撑下,商品和服务的产出增速将远超货币供应,直接发钱并不会引发通货膨胀,相反,人类未来需要竭力对抗大通缩。
两人的核心分歧在于应对财富分化的路径:万斯倾向于国家入股与劳工谈判的生产端介入,防止资产收益被少数人垄断;马斯克则倾向于货币政策层面的直接干预,反对国家干预生产资料所有权,主张利用技术带来的物质充裕进行消费端发钱兜底。
信源:https://x.com/elonmusk/status/2068427440473452739
美国副总统万斯 (JD Vance) 在接受《CEO 日记》采访时表示,特朗普支持美国建立主权财富基金,并持有多家前沿 AI 巨头的股权。万斯认为,绝不能任由大模型企业成长为数万亿美元且不受控的垄断者,否则富人将变得更富,穷人则沦为附庸。他主张通过国家持股,并引入工会集体谈判一类的「预分配」机制,让劳动者在决策桌上占有一席之地,在初次分配中直接分享技术红利,避免穷人最终沦为依赖富人施舍的附庸,而非依靠传统的税收再分配。
马斯克 (Elon Musk) 随后在 X 平台公开唱反调,提出相较于政府入股更优的替代方案,即直接由财政部向民众发钱。马斯克解释,在 AI 与机器人技术支撑下,商品和服务的产出增速将远超货币供应,直接发钱并不会引发通货膨胀,相反,人类未来需要竭力对抗大通缩。
两人的核心分歧在于应对财富分化的路径:万斯倾向于国家入股与劳工谈判的生产端介入,防止资产收益被少数人垄断;马斯克则倾向于货币政策层面的直接干预,反对国家干预生产资料所有权,主张利用技术带来的物质充裕进行消费端发钱兜底。
信源:https://x.com/elonmusk/status/2068427440473452739
X (formerly Twitter)
Elon Musk (@elonmusk) on X
@SurmountInvest Better just to send money directly to the people from the Treasury.
So long as the increase in goods & services exceeds the increase in the money supply, which will be the case with AI & robots, there will not be inflation.
In fact, my…
So long as the increase in goods & services exceeds the increase in the money supply, which will be the case with AI & robots, there will not be inflation.
In fact, my…
👍3
前OpenAI研究员称中国已掌握美AI巨头所有代码,遭业内群嘲
前 OpenAI 研究员 Will Depue 宣称,中国今天已完全掌握 OpenAI 与 Anthropic 的所有 GitHub 代码库、Slack 聊天记录和内部文档。他还扬言,如果在中国的开源模型中看到「可合理推诿」的被盗架构,自己不会感到惊讶。
由于拿不出任何实锤证据,Depue 辩称这些判断主要源于自己同安全研究人员的交流,指责外界高估了前沿实验室的防线。作为经常在社交平台发布离谱言论的博主,Depue 还曾在愚人节当天发帖宣称自己将加盟 DeepSeek。
这番言论在 AI 社区迅速沦为笑柄。AI 学者 Nathan Lambert 批评前沿实验室频繁发表自利型废话,并指出技术的流转本质上是通过硅谷的人才流动、酒吧聚会以及缺乏竞业限制自发实现的,真正的核心优势是算力和工程资源,而不是 Slack 里的聊天记录。
AI 研究员 Elie Bakouch 则用完全相同的格式反讽道,毫无疑问,今天所有的前沿实验室也全盘掌握了 DeepSeek、Kimi、GLM 和 MiniMax 的技术报告与模型,讽刺美前沿实验室一边天天免费参考中国开源的成果,一边又在整天陷入被迫害幻想。
信源:https://x.com/willdepue/status/2068118253633737077
前 OpenAI 研究员 Will Depue 宣称,中国今天已完全掌握 OpenAI 与 Anthropic 的所有 GitHub 代码库、Slack 聊天记录和内部文档。他还扬言,如果在中国的开源模型中看到「可合理推诿」的被盗架构,自己不会感到惊讶。
由于拿不出任何实锤证据,Depue 辩称这些判断主要源于自己同安全研究人员的交流,指责外界高估了前沿实验室的防线。作为经常在社交平台发布离谱言论的博主,Depue 还曾在愚人节当天发帖宣称自己将加盟 DeepSeek。
这番言论在 AI 社区迅速沦为笑柄。AI 学者 Nathan Lambert 批评前沿实验室频繁发表自利型废话,并指出技术的流转本质上是通过硅谷的人才流动、酒吧聚会以及缺乏竞业限制自发实现的,真正的核心优势是算力和工程资源,而不是 Slack 里的聊天记录。
AI 研究员 Elie Bakouch 则用完全相同的格式反讽道,毫无疑问,今天所有的前沿实验室也全盘掌握了 DeepSeek、Kimi、GLM 和 MiniMax 的技术报告与模型,讽刺美前沿实验室一边天天免费参考中国开源的成果,一边又在整天陷入被迫害幻想。
信源:https://x.com/willdepue/status/2068118253633737077
X (formerly Twitter)
will depue (@willdepue) on X
there is no question, none at all, that china has full access to all of openai & anthropic’s github/slack/docs today
no disrespect to their independent research progress, but i wouldn’t be surprised if we see plausibly-deniable stolen arch methods in chinese…
no disrespect to their independent research progress, but i wouldn’t be surprised if we see plausibly-deniable stolen arch methods in chinese…
特斯拉AI工程师:算法调优不是万能药,数据质量决定AI上限
特斯拉 AI 高级主任工程师蔡云达指出,外界常以为机器学习项目 99% 的工作都在跑训练,实际上真正用于模型参数训练的时间仅占 2%。相比之下,50% 的精力花在评估测试上,40% 花在清洗数据上,另外 8% 是系统集成。
蔡云达强调,数据清洗和评估决定了 AI 能够学到的极限。如果原始数据定义模糊、标注前后矛盾,就会在源头上引入噪声。任何算法魔法或调参技巧都无法消除背景噪声,因为模型无法自己纠正错误的课本,最终的精度上限完全取决于数据本身的有效信息量(即香农编码极限)。
为了从源头确保数据标准统一,蔡云达表示自己每天都在重新审视数据概念的定义与分类体系(即本体论,Ontology),甚至要反复审核历史标签。无论是强化学习的规则设定,还是模型微调的精准标注,决定 AI 表现的始终是数据质量和评测水平,而非模型架构本身。
信源:https://x.com/yunta_tsai/status/2068364559698780520
特斯拉 AI 高级主任工程师蔡云达指出,外界常以为机器学习项目 99% 的工作都在跑训练,实际上真正用于模型参数训练的时间仅占 2%。相比之下,50% 的精力花在评估测试上,40% 花在清洗数据上,另外 8% 是系统集成。
蔡云达强调,数据清洗和评估决定了 AI 能够学到的极限。如果原始数据定义模糊、标注前后矛盾,就会在源头上引入噪声。任何算法魔法或调参技巧都无法消除背景噪声,因为模型无法自己纠正错误的课本,最终的精度上限完全取决于数据本身的有效信息量(即香农编码极限)。
为了从源头确保数据标准统一,蔡云达表示自己每天都在重新审视数据概念的定义与分类体系(即本体论,Ontology),甚至要反复审核历史标签。无论是强化学习的规则设定,还是模型微调的精准标注,决定 AI 表现的始终是数据质量和评测水平,而非模型架构本身。
信源:https://x.com/yunta_tsai/status/2068364559698780520
X (formerly Twitter)
Yun-Ta Tsai (@yunta_tsai) on X
Many people think any given ML project is 99% training.
In reality, it’s 50% evaluation, 40% data cleaning, 8% integration, and 2% training.
The first two set the noise floor for learning. No ML magic matters; the model cannot lower the noise floor, as…
In reality, it’s 50% evaluation, 40% data cleaning, 8% integration, and 2% training.
The first two set the noise floor for learning. No ML magic matters; the model cannot lower the noise floor, as…
❤1👎1
智谱GLM-5.2登顶DeepSWE开源第一:解决44%复杂开发任务,力压主力闭源模型
智谱 AI 开源模型 GLM-5.2 正式进驻长程软件工程基准 DeepSWE。在最大思考力度模式下,复杂开发任务的一次成功率达到 44%,在开源模型中排名第一。对比此前入榜的 Kimi K2.7 Code,成功率高出 13 个百分点。
GLM-5.2 解决每项任务的平均成本为 3.92 美元,略高于 Kimi K2.7 Code 的 2.82 美元,成功率却超越了多款主流闭源模型在特定思考配置下的表现,包括 Claude Sonnet 4.6 [high] (30%)、Gemini 3.5 Flash [medium] (37%),以及 Claude Opus 4.8 [low] (41%)。
评测发起方 Datacurve 设计的 DeepSWE 基准专门测试 AI 智能体解决长任务的能力。测试包含 113 个真实编程问题,覆盖 5 种语言。与只修改单处代码的传统测试不同,DeepSWE 要求 AI 协同修改多个文件,平均修复代码超过 600 行。评测在隔离容器中运行,严格限制 CPU 和内存资源。
信源:https://deepswe.datacurve.ai/
智谱 AI 开源模型 GLM-5.2 正式进驻长程软件工程基准 DeepSWE。在最大思考力度模式下,复杂开发任务的一次成功率达到 44%,在开源模型中排名第一。对比此前入榜的 Kimi K2.7 Code,成功率高出 13 个百分点。
GLM-5.2 解决每项任务的平均成本为 3.92 美元,略高于 Kimi K2.7 Code 的 2.82 美元,成功率却超越了多款主流闭源模型在特定思考配置下的表现,包括 Claude Sonnet 4.6 [high] (30%)、Gemini 3.5 Flash [medium] (37%),以及 Claude Opus 4.8 [low] (41%)。
评测发起方 Datacurve 设计的 DeepSWE 基准专门测试 AI 智能体解决长任务的能力。测试包含 113 个真实编程问题,覆盖 5 种语言。与只修改单处代码的传统测试不同,DeepSWE 要求 AI 协同修改多个文件,平均修复代码超过 600 行。评测在隔离容器中运行,严格限制 CPU 和内存资源。
信源:https://deepswe.datacurve.ai/
字节Seed 2.1 Pro预览版亮相:冲进Code Arena前端前八,直追Claude Opus 4.6
基准测试平台 Arena.ai 官方公布了字节跳动尚未公开的新模型 Seed 2.1 Pro Preview 的评测成绩。在专门评估 AI 构建真实网页应用与多文件协同修改能力的 Code Arena: Frontend 基准测试中,该模型以 1539 分的成绩位列全球第 8 名,与 Anthropic 的旗舰模型 Claude Opus 4.6 表现相当。
该模型在 React 开发和前端 UI 交互设计上展现出极强实力,在 7 个子类别中有 5 个冲进全球前 10(包括 React 排名第 7、HTML 排名第 14、品牌与营销排名第 6、内容创作工具与数据分析排名第 9、基于参考的设计与消费产品排名第 10)。在这些强项中,排名领先于它的只有极少数头部模型,如 Anthropic 的 Claude 系列以及智谱 AI 刚刚开源的 GLM-5.2。
官方透露,Seed 2.1 Pro 将在未来几周内正式对公众发布。这也是继今年 2 月中旬推出 Seed 2.0 Pro 之后,字节跳动在代码生成和智能体构建领域的最新进展。
信源:https://x.com/arena/status/2068864523499638996
基准测试平台 Arena.ai 官方公布了字节跳动尚未公开的新模型 Seed 2.1 Pro Preview 的评测成绩。在专门评估 AI 构建真实网页应用与多文件协同修改能力的 Code Arena: Frontend 基准测试中,该模型以 1539 分的成绩位列全球第 8 名,与 Anthropic 的旗舰模型 Claude Opus 4.6 表现相当。
该模型在 React 开发和前端 UI 交互设计上展现出极强实力,在 7 个子类别中有 5 个冲进全球前 10(包括 React 排名第 7、HTML 排名第 14、品牌与营销排名第 6、内容创作工具与数据分析排名第 9、基于参考的设计与消费产品排名第 10)。在这些强项中,排名领先于它的只有极少数头部模型,如 Anthropic 的 Claude 系列以及智谱 AI 刚刚开源的 GLM-5.2。
官方透露,Seed 2.1 Pro 将在未来几周内正式对公众发布。这也是继今年 2 月中旬推出 Seed 2.0 Pro 之后,字节跳动在代码生成和智能体构建领域的最新进展。
信源:https://x.com/arena/status/2068864523499638996
❤1
传Anthropic已完成新版Mythos训练,Sonnet5发布在即
知名 AI 观察者 Andrew Curran 透露,Anthropic 已经完成了性能更强大的新版 Mythos 模型训练,但目前尚不确定新模型会被命名为 Mythos 5.1 还是 Mythos 6,也可能被 Anthropic 留在内部以加速后续开发。
同时,随着 Anthropic 合作伙伴服务商平台上出现名为
信源:https://x.com/AndrewCurran_/status/2068748019030483365
知名 AI 观察者 Andrew Curran 透露,Anthropic 已经完成了性能更强大的新版 Mythos 模型训练,但目前尚不确定新模型会被命名为 Mythos 5.1 还是 Mythos 6,也可能被 Anthropic 留在内部以加速后续开发。
同时,随着 Anthropic 合作伙伴服务商平台上出现名为
claude-sonnet-5 的模型标识,开发者社区普遍猜测 Sonnet 5 即将在本周正式发布。信源:https://x.com/AndrewCurran_/status/2068748019030483365
X (formerly Twitter)
Andrew Curran (@AndrewCurran_) on X
A new, more capable version of Mythos has emerged from training. I don't know whether it will be called Mythos 5.1 or Mythos 6, or if Anthropic will keep it internal to accelerate further development - but it has arrived.
Stopping models like Fable 5 or…
Stopping models like Fable 5 or…
❤2
豆包APP灰测对话式一键打车,携手曹操出行补齐字节出行业态
对话式一键打车服务已在豆包 APP 开启灰度测试,由曹操出行提供具体运力。获得灰测资格的北京和杭州用户,无需手动输入起讫地址或筛选车型,只需在对话框中口述出行人数、用车偏好和目的地,系统即可自动匹配曹操出行的车型与价格,用户一键确认即可完成派单。
司机端也已完成配套对接。多位曹操出行司机确认,平台已开始推送「豆包服务订单」专属标签,并为提供服务的司机发放每单 2 元的惊喜服务费。功能上线源于双方今年 6 月达成的 AI 出行战略合作。
信源:https://mp.weixin.qq.com/s/KLRjy49Do4JgXk_YE0m5jw
对话式一键打车服务已在豆包 APP 开启灰度测试,由曹操出行提供具体运力。获得灰测资格的北京和杭州用户,无需手动输入起讫地址或筛选车型,只需在对话框中口述出行人数、用车偏好和目的地,系统即可自动匹配曹操出行的车型与价格,用户一键确认即可完成派单。
司机端也已完成配套对接。多位曹操出行司机确认,平台已开始推送「豆包服务订单」专属标签,并为提供服务的司机发放每单 2 元的惊喜服务费。功能上线源于双方今年 6 月达成的 AI 出行战略合作。
信源:https://mp.weixin.qq.com/s/KLRjy49Do4JgXk_YE0m5jw
智谱AI与MiniMax等中国AI企业估值倍数高企,PS比率高出美国同行数十倍
根据投资人 Tommy Shaughnessy 披露的对比数据,已在港股上市的智谱AI与MiniMax等中国大模型企业,其估值与营收的比例(市销率PS)远超美国同行。
其中,智谱AI在港股市值已达1370亿美元左右,但其2025财年营收仅约1.07亿美元,市销率高达1280倍;MiniMax在港股市值约230亿美元,2025财年营收约7900万美元,市销率约290倍。
与此相比,未上市的美国头部大模型企业OpenAI与Anthropic的市销率分别仅为34倍和21倍左右。作为另一参照,包含非AI业务的阿里巴巴(通义千问背后公司)市销率仅为1.6倍。
分析指出,除非中国AI企业营收能在短期内迎来数十倍的爆发式增长,或者通过投资入股美国第三方推理提供商来换取收入分成,否则其当前的高估值倍数将难以为继;而美国前沿 AI 实验室凭借庞大的营收规模,在未来IPO后估值倍数仍有进一步扩张的空间。
信源:https://x.com/Shaughnessy119/status/2068899158442782732
根据投资人 Tommy Shaughnessy 披露的对比数据,已在港股上市的智谱AI与MiniMax等中国大模型企业,其估值与营收的比例(市销率PS)远超美国同行。
其中,智谱AI在港股市值已达1370亿美元左右,但其2025财年营收仅约1.07亿美元,市销率高达1280倍;MiniMax在港股市值约230亿美元,2025财年营收约7900万美元,市销率约290倍。
与此相比,未上市的美国头部大模型企业OpenAI与Anthropic的市销率分别仅为34倍和21倍左右。作为另一参照,包含非AI业务的阿里巴巴(通义千问背后公司)市销率仅为1.6倍。
分析指出,除非中国AI企业营收能在短期内迎来数十倍的爆发式增长,或者通过投资入股美国第三方推理提供商来换取收入分成,否则其当前的高估值倍数将难以为继;而美国前沿 AI 实验室凭借庞大的营收规模,在未来IPO后估值倍数仍有进一步扩张的空间。
信源:https://x.com/Shaughnessy119/status/2068899158442782732
X (formerly Twitter)
Tommy (@Shaughnessy119) on X
Chinese Open Source AI companies capture virtually no revenue and the ratios vs US companies is insane
Zhipu / https://t.co/De7mtjaGr3, the company behind GLM 5.2, is at a $137B market cap on about $107M of FY25 revenue
That means the stock trades at roughly…
Zhipu / https://t.co/De7mtjaGr3, the company behind GLM 5.2, is at a $137B market cap on about $107M of FY25 revenue
That means the stock trades at roughly…
🤡3😁2
传字节跳动推迟上市计划,场外灰市估值逼近1万亿美元
据外媒报道,字节跳动董事会已于 2026 年 5 月初达成共识,决定推迟首次公开募股 IPO 计划。创始人张一鸣认为估值仍有上涨空间,现阶段上市会向后期无风险投资者让渡过多利益。
目前,字节跳动在场外灰市的交易估值已超过 6000 亿美元。美银集团的资深技术投资银行家表示,公司市值有望逼近 1 万亿美元,并树立新的行业标杆。
政策与地缘政治风险有所缓解。在 2026 年年初,甲骨文公司与投资者财团达成协议,共同收购 TikTok 美国实体 80% 的股权,令相关监管压力基本出清。
在 AI 业务方面,豆包 APP 作为国内用户规模最大的聊天助手,正在免费服务基础上增设付费等级。
信源:https://asia.nikkei.com/opinion/bytedance-sidelines-listing-as-china-s-first-1-trillion-valuation-nears
据外媒报道,字节跳动董事会已于 2026 年 5 月初达成共识,决定推迟首次公开募股 IPO 计划。创始人张一鸣认为估值仍有上涨空间,现阶段上市会向后期无风险投资者让渡过多利益。
目前,字节跳动在场外灰市的交易估值已超过 6000 亿美元。美银集团的资深技术投资银行家表示,公司市值有望逼近 1 万亿美元,并树立新的行业标杆。
政策与地缘政治风险有所缓解。在 2026 年年初,甲骨文公司与投资者财团达成协议,共同收购 TikTok 美国实体 80% 的股权,令相关监管压力基本出清。
在 AI 业务方面,豆包 APP 作为国内用户规模最大的聊天助手,正在免费服务基础上增设付费等级。
信源:https://asia.nikkei.com/opinion/bytedance-sidelines-listing-as-china-s-first-1-trillion-valuation-nears
Nikkei Asia
ByteDance sidelines listing as China's first $1 trillion valuation nears
With economy showing resilience, hopes for bullish sentiment for shares are rising
❤3