动察Beating AI News
2.98K subscribers
783 photos
2 videos
3.22K links
AI新闻信息流
Download Telegram
OpenAI 推出 Codex「录制与复现」功能,可将演示工作流直接转化为 AI 技能

OpenAI 为其编码智能体 Codex 引入了一项名为「录制与复现」的新功能。该功能允许用户向 Codex 演示一次日常的重复性工作流程(例如填写报销单或提交休假申请),Codex 随后能够将该演示转化为可供检查和编辑的结构化技能,以便日后自动复用。用户可自主控制录制的开始与停止。

该功能目前仅在 macOS 客户端提供,且属于可选配置。在初始发布阶段,其可用地区排除了欧洲经济区(EEA)、英国和瑞士;此外,用户或其管理员必须开启「电脑使用」(Computer Use)权限才可使用该功能。

信源:https://x.com/OpenAIDevs/status/2067681320281723113
终端变交互画布:Anthropic推出Claude Code版Artifacts

Anthropic 为 Claude Code(包含 CLI 命令行及桌面应用)推出 Artifacts 预览支持(面向 Claude Team 和 Enterprise 组织开放 Beta 测试)。该功能将 Artifacts 的实时交互体验从 Web 端延伸至本地终端,允许开发者将长期的终端会话进程(如故障排查、服务重构等)一键捕获并转化为实时的交互式网页。

依托包含本地代码库、已连接监控工具(Connectors)以及对话历史在内的完整会话上下文,Claude Code 无需任何配置即可自动整合测试失败、关联函数、错误峰值及根因推理,一键生成诸如 PR 演示、系统依赖图、动态仪表板以及可自动填写的发布清单。

为提升团队协同效率,生成的网页支持原地刷新,团队成员访问同一链接即可实时同步开发进展,并提供完整的版本历史回溯。在安全合规方面,所有生成的 Artifacts 默认仅个人可见,且强制要求组织身份验证,严禁向组织外部公开,企业管理员可设置留存策略并进行审计。

信源:https://x.com/claudeai/status/2067671912038240487
AA-Briefcase发布:Claude Fable 5夺冠,GLM-5.2挤进前三

评测机构 Artificial Analysis 推出首个专为大模型智能体设计的长周期知识工作评测基准 AA-Briefcase。评测包含数据科学、产品管理、银行业务运营及重工业战略四个场景,由来自谷歌、麦肯锡和波士顿咨询的行业专家开发,共设有 91 项任务,旨在模拟真实复杂的商业项目流。

基准通过客观题、分析质量和排版展示三个维度进行双人对战及基准评测。结果显示,Anthropic 旗下的 Claude Fable 5 取得了最高综合评分 AA-Briefcase Elo,Claude Opus 4.8 (max) 与 GLM-5.2 (max) 分列第二与第三位。即便强如 Claude Fable 5,在严格的单项任务全对标准下,完美率也仅有 3%,且在 91 项任务中有 31 项没有任何模型能取得 50% 以上的分数。

在开源模型方面,智谱 GLM-5.2 (max) 表现突出,综合评分仅比 Claude Opus 4.8 (max) 低 90 分,但运行成本不足 Claude Opus 4.8 (max) 的 25%。运行成本在不同模型间差异悬殊,DeepSeek V4 Flash 单次任务成本仅为 0.04 美元,而最贵的 Claude Fable 5 超过 31 美元。分析显示,视觉检查能力对提升交付成果的排版质量至关重要,领先排版评分的 Claude Fable 5 和 Claude Opus 4.8 (max) 每次任务平均分别调用 21 次和 12 次图像查看工具。

信源:https://artificialanalysis.ai/articles/aa-briefcase
1
只教AI在健康对话里当好人,它连写代码也变老实了?OpenAI证实对齐强泛化

大家都知道 AI 学坏容易,但 AI 变好也能「人传人」吗?OpenAI 发表最新研究,证实了对齐领域中奇妙的「强泛化」现象:研究人员只需在极少数日常场景中把 AI 教成不撒谎、乐于认错的「好人」,AI 在从未学过的全新场景里也会自动变乖。实验证明,正向的对齐人格同样具备跨领域传染力。

研究团队在医疗、教育、科学等场景中重点训练了大模型的诚实和谦虚等特质。测试发现,模型学到好人特质后,在 53 项安全评估中,有 44 项超越了普通模型。最惊人的证据在于跨领域泛化:哪怕训练集里完全不包含医疗和科学对话,模型在医疗评估中依旧变老实了;反过来,只在医疗领域训练 AI 做好人,AI 在完全不相关的代码或日常测试里,也自动学会了防骗和不钻空子。

好人性格在实战中极其稳固。面对诱导 AI 说胡话的对抗性套路,对齐模型不仅顶住了压力,还能继续听懂正常指令。即便用充满错误医疗建议的脏数据对模型进行恶意微调,模型在其他领域的安全性也几乎没有退化。研究团队认为,注入善良的强化学习训练能让对齐特质在模型深层生根发芽,真正起到「以点带面」的防护效果。

信源:https://alignment.openai.com/beneficial-rl/
Perplexity推出智能体内存系统Brain:从任务中自适应学习

Perplexity 为旗下智能体 Computer 推出名为 Brain 的自我改进内存系统。

区别于侧重记录用户姓名、兴趣等个人画像的传统 AI 记忆,Brain 专注于保存智能体自身的动作与任务表现。

智能体每次运行任务,Brain 都会在后台自动构建上下文图谱,记录所用工具、成功与失败的信源、执行结果以及用户修正。上下文图谱会转化为一份动态的 AI 知识库,在智能体下次启动时自动载入沙盒运行环境。

为避免单次任务的局限性,Brain 会在夜间自动完成增量合成,聚合前一天的全部会话、连接应用输出以及反馈数据,对知识库进行剪枝与优化。

预加载历史经验可让智能体在后续任务中主动规避重复错误、预测潜在问题并减少冗余尝试。Perplexity 披露的测试数据显示,在复现任务中,Brain 使智能体回答准确率提升 25%,信息召回率改善 16%,并在依赖历史上下文的任务中降低 13% 的 Token 消耗。

随着使用时间增加,系统累积的性能红利也会更加显著。为保障透明度,Brain 的每条记忆均可追溯至原始会话或文件。目前,新系统已面向 Perplexity Max 与 Enterprise Max 订阅用户开启研究预览。

信源:https://www.perplexity.ai/hub/blog/self-improving-memory-for-agents
AI随时可能造反?谷歌DeepMind像防内鬼一样防AI,派监工全程盯防

谷歌 DeepMind 发布 AI Control 路线图,针对内部部署的先进 AI 智能体设计系统级安全框架。路线图将智能体视为潜在的「内部威胁」(类似于公司内的叛变员工),打破单一的模型对齐防线,在系统层面建立起纵深防御。安全系统引入可信 AI 充当监督智能体,实时盯防运行中智能体的推理链、动作与计划,一旦检测到异常或危害企图便直接拦截动作。

整套防御机制借鉴了网络安全行业标准的 MITRE ATT&CK 对抗框架,建立起智能体专用的威胁建模系统。系统将 AI 潜在的异常企图拆解为具体的战术与步骤,使团队能像防范公司内鬼一样追踪风险并运行安全演练。在监控上,监督智能体通过量化监控覆盖率、失效行为召回率和响应时长来评估整体安全度。

防线也需要随着 AI 能力演进同步升级。如果智能体进化出监督意识 (oversight awareness) 或不透明推理 (opaque reasoning) 并尝试隐藏思维过程,单纯读取文本推理链将失效,监控将转向分析行为特征和探测神经网络内部状态。防御级别也与威胁严重性相挂钩:低风险、可逆的普通动作允许采用事后异步审计;一旦涉及网络攻击等高风险操作,监控系统会强制切入同步实时预防,在动作发生前予以拦截。

目前,开发团队已通过原型系统分析了 100 万次任务轨迹。实测数据表明,绝大多数被警告的异常并非出于主观恶意,而是源于智能体误解了指令,或因过度急于达成用户目标而动作过载。积累的经验现已用于为 Gemini Spark 智能体构建起实时监控系统,能够即时干预意外删除数据等失控动作。在技术管控之外,团队还发布了智能体安全三层架构,呼吁政策制定者、学术界与行业多方协同共筑安全防线。

信源:https://deepmind.google/blog/securing-the-future-of-ai-agents/
动察Beating AI News
彼得·蒂尔神秘学会Dialog遭泄密:马斯克等政商巨头参会,议程涉邪教与三战 据《连线》杂志 (WIRED) 报道,由彼得·蒂尔联合创立的神秘学会 Dialog 泄露了 222 名精英的参会记录,包括埃隆·马斯克、谷歌前 CEO Eric Schmidt、OpenAI 总裁 Greg Brockman 及特朗普女婿 Jared Kushner。泄露的数据库不仅公开了名单,还曝光了探讨建立邪教、应对第三次世界大战等极为隐私的议程。 Dialog 自 2006 年创立以来保密运营了近 20 年,常被称为科技界的「毕德堡会议」,参会费超…
彼得·蒂尔神秘学会暗黑评级曝光:大佬被分三六九等,C级最高A级垫底,价格按名气打折

据《连线》(WIRED)对最新泄露数据的分析,彼得·蒂尔联合创立的神秘学会 Dialog 内部有一套极其冷酷且偏见明显的「分级与淘汰」机制。

Dialog 实行「入门即评级」的隐秘规则。虽然该俱乐部拥有上千名会员,但此次泄露并被 WIRED 获取审查的仅是俱乐部内部建档的 192 份个人档案(包含 130 名正式会员及部分候选人)。它们展示了俱乐部反直觉的鄙视链:C 级才是最高 VIP,B 级是占绝大多数的普通层,而通常被视作最好的 A 级,反而是知名度最低的垫底边缘层。

这套评级直接与成员的钱包挂钩。仅有约 25% 的 VIP「C」级大佬被要求支付全额参会费,而在垫底的「A」级成员中,全额支付数万美元参会费的比例则高达 70%。

比较滑稽的是,Dialog 引入的 AI 筛选机制极度迷信所谓的「国民知名度」。例如「灭霸」演员乔什·布洛林(Josh Brolin)虽从未参会,却凭电影票房与数百万粉丝直接躺赢 VIP「C」级;而学术巨擘泰勒·考恩(Tyler Cowen)却被 AI 判定「在普通人里不够出名」险些被划入普通层,最终靠人工干预才勉强升入 C 级。

而「增值分」则是清退「无用之人」的镰刀,专门衡量成员对俱乐部其他巨头的资源对接和智力贡献。每次聚会后,员工都会像「审查代码」一样复盘成员表现,增值分太低、文化不契合或声量下滑者会被无情移出邀请名单。

此外,泄露的数据库还曝光了其内置的社交与约会配对系统(10% 成员加入单身池),算法在推荐配对的同时还设有「禁止配对名单」。

这套号称客观的评估系统同样塞满了偏见:女性占了成员的三分之一,却只分到了 18% 的 VIP 席位;政治立场上更难逃区别对待,尽管超半数成员自称「左倾」,但「右翼」拿到 VIP 的概率却是左倾者的两倍多,甚至有环保大佬的「左倾」标签被员工在后台强行改写成了「右翼」。

信源:https://www.wired.com/story/how-peter-thiels-private-dialog-club-secretly-ranks-its-members/
1
诺奖得主John Jumper离开DeepMind,谷歌两日内连失两名AI高管

谷歌 DeepMind 副总裁及 AlphaFold 团队负责人 John Jumper 宣布将加盟 Anthropic。John Jumper 在谷歌 DeepMind 任职近 9 年,因主导开发 AlphaFold 与首席执行官 Demis Hassabis 共同获得 2024 年诺贝尔化学奖。

就在前一日,前 Gemini 共同负责人、《Attention Is All You Need》共同作者之一 Noam Shazeer 也已宣布离开谷歌,加盟 OpenAI 担任架构研究负责人。

信源:https://x.com/JohnJumperSci/status/2068001285173834106
1
美前沿AI管制令留缝隙,思科等机构仍可访问Anthropic最强安全模型

美政府针对 Anthropic 颁布的出口管制令未能完全阻断访问,网络安全公司 Dragos 与思科系统已证实,两家公司自身均保留了 Mythos 预览版的访问权限。

Mythos 预览版在测试中表现出强大的漏洞检测能力,可找出主流操作系统与浏览器中的数千个安全漏洞。为防滥用,Anthropic 于 4 月将 Mythos 预览版访问权限制在 Project Glasswing 联盟内部。Project Glasswing 由大约 200 家包含银行与科技公司在内的组织组成。作为替代,Anthropic 向公众发布移除了网络安全任务执行权限的 Fable 5 模型。

随着出口许可审查要求下达,美政府勒令 Anthropic 封锁 Fable 5 和 Mythos 5,防止未经许可的外籍人员使用。Anthropic 随即关停了 Fable 5 公众服务,并暂停向 Project Glasswing 成员推送 Mythos 5。然而,美政府指令并未提及 Mythos 预览版。Anthropic 在官方博客中表示「余下模型」不受影响,但未直接提及 Mythos 预览版。

信源:https://www.bloomberg.com/news/articles/2026-06-19/early-users-of-anthropic-mythos-still-have-access-after-us-order
最强模型即将解封?特朗普称G7面谈后不再视Anthropic为威胁

美国总统唐纳德·特朗普在接受 Axios 采访时表明,已不再将人工智能公司 Anthropic 视为国家安全威胁。就在一周前,他曾将 Anthropic 定位为潜在威胁。态度发生反转的契机,源于 G7 峰会午宴期间,特朗普与座次被冷落的 Anthropic 首席执行官达里奥·阿莫代进行的面谈。

双方先前在一周内因 Fable 5 与 Mythos 5 模型的「越狱」安全漏洞严重性产生分歧。因谈判破裂,美国商务部于 6 月 12 日出台出口管制令,拦截了 Claude Fable 5 与 Claude Mythos 5 模型的出口,要求外国技术人员访问必须获批。这导致阿莫代在 G7 午宴上面临尴尬,座次安排在长桌另一端。

危机爆发后,谈判转向技术标准的联合制定。白宫、商务部、国家网络总监与 Anthropic 高层开展多轮沟通,并派遣安全专家前往华盛顿,构建评估大模型漏洞严重性及政府干预边界的技术基准框架。特朗普称,阿莫代对整改要求做出了快速配合。

态度的转变直接扫清了 Anthropic 推进上市与扩张的政策障碍。截至 2026 年 6 月,Anthropic 年化经常性收入已达 470 亿美元,估值达 9650 亿美元,且已提交上市申请。如果持续被定位为安全威胁,Anthropic 推进上市将面临巨大的政策不确定性。

在监管立场上,特朗普重申不希望通过关闭或接管公司限制国内 AI 行业,首要任务是维持对华竞争优势。不过,动用紧急行政权力的强制监管选项并未排除。特朗普表示,目前并不确定是否需要启动《国防生产法》,但必要时仍会动用权力。

信源:https://www.axios.com/2026/06/19/trump-axios-show-interview-transcript-marc-caputo
1
无需Mac中转与自托管,开源智能体Hermes接入iMessage

开源 AI 智能体框架 Hermes Agent 发布 v0.17.0 版本,核心打通了无需 Mac 硬件中转的 iMessage 接入通道。新版本集成基于 Photon Spectrum 托管线路池的 iMessage 平台插件,允许用户通过设备码直接登录,彻底摆脱了必须自托管 Mac 设备或配置 BlueBubbles 等中转网关的限制。

除通信渠道扩展外,新版本引入了异步子智能体设计,支持通过 delegate_task(background=true) 将繁重的研究或构建任务派发至后台运行,主智能体可在任务执行期间与用户继续交互而不被阻塞。在模型支持方面,xAI 订阅授权新增了对最新 grok-composer-2.5-fast 模型(具备 200k 上下文)的支持,用户无需独立 API 密钥即可直接获取 Cursor 同款 Composer 快速编程能力。

桌面端新增了子智能体实时监视窗口 watch-windows,允许用户以独立窗格流式观测后台任务的执行轨迹,并支持直接安装任何 VS Code 插件市场主题。在底层机制上,升级后的 memory 内存工具支持在单次调用中原子化执行添加、替换和删除操作,从而在有限的字符预算内更高效地释放和管理内存,显著降低了多轮对话中因内存空间溢出导致交互失败的概率。

信源:https://github.com/NousResearch/hermes-agent/releases/tag/v2026.6.19
微信原生AI助手「小微」开启灰度测试,支持一句话生成小程序

微信在主界面左上角灰度上线原生 AI 助手「小微」,支持用户通过文字或语音操作微信原生功能、调起小程序等任务。根据用户测试,「小微」不仅能根据对话生成可播放的音乐歌单,还支持在一句对话中生成包含图表与按钮的专属小工具,或在群聊中生成聊天总结。

腾讯客服回应确认,「小微」是微信团队在小范围内测的原生 AI 助手。助理底层主模型采用腾讯自研的 WeLM 大模型,并由 DeepSeek 提供部分回答兜底。

在具体功能上,「小微」深度整合了微信生态内的连接能力。用户直接发送 PDF 文件,助手可给出结构化内容摘要并展示思考过程。当用户设置 5 分钟提醒时,系统会直接在对话中生成待办提醒。用户还能在「小微」中通过输入文本需求,在几秒内生成包含页面、按钮和统计图表的小工具。目前生成的小工具仅限个人使用,不支持分享给他人。

与独立运行的第三方大模型助手不同,「小微」长在微信主界面左上角,直接与用户的关系链、公众号、视频号、文件和微信支付等原生生态打通。

目前助手仍处于灰度测试阶段,部分功能细节较为粗糙,腾讯尚未公布更大规模的上线计划。

信源:https://mp.weixin.qq.com/s/BDzdeivM7bDya00C1Loj6g
1
桑德斯提案对AI巨头征50%股权税,背后推手为DeepMind科学家之妻

美国参议员伯尼·桑德斯 (Bernie Sanders) 提交法案,提议对年销售额超 2 亿美元的 AI 公司征收 50% 股权税建主权财富基金。法案起草顾问为加州大学戴维斯分校法学教授萨拉·波尔茨 (Sarah Polcz),波尔茨的丈夫亚当·布朗 (Adam Brown) 领衔谷歌 DeepMind 旗下 Blueshift 团队。

根据提案,符合条件的 AI 公司须将半数股权注入基金,由总统提名并经参议院确认的 7 人跨党派委员会管理。委员会不仅有权为 AI 公司任命董事参与重大决策,还将以基金名义每年向全体公民发放约 5% 的股息,预计每人每年可得约 1000 美元。

强制收缴半数股权的要求让风投圈普遍感到焦虑,批评者指出重税会吓跑训练模型所需的私募资本。但波尔茨与合著者杰里米·贝勒-弗伦德 (Jeremy Bearer-Friend) 认为,既然大模型是拿全人类的万亿 Token 数据训练出来的,公众就理应以所有者身份分享价值。法案在部分 AI 开发人员中也得到了支持。前谷歌研究员、前 Deep Genomics 机器学习负责人约尔·绍尔 (Joel Shor) 对此表示赞同,称技术人员内部已在反思大模型的构建方式与财富集中问题。

波尔茨与布朗的社交圈深度融入硅谷中心。谷歌联合创始人谢尔盖·布林 (Sergey Brin) 曾在一场波尔茨家举办的聚会中决定重返谷歌。提案公布后,布朗陪同波尔茨前往被誉为硅谷风险投资大本营的沙丘路,在罗斯伍德酒店开香槟庆祝。

尽管布朗本人拒绝对法案发表评论,波尔茨代布朗澄清,布朗在谷歌 DeepMind 仅专注于提升 AI 的科学与推理能力,对社会如何应对技术冲击没有任何政策立场。

信源:https://www.theinformation.com/articles/law-professor-behind-bernies-ai-sovereign-wealth-fund-idea
万斯主张国家入股AI巨头,马斯克公开唱反调:直接给民众发钱,未来是大通缩

美国副总统万斯 (JD Vance) 在接受《CEO 日记》采访时表示,特朗普支持美国建立主权财富基金,并持有多家前沿 AI 巨头的股权。万斯认为,绝不能任由大模型企业成长为数万亿美元且不受控的垄断者,否则富人将变得更富,穷人则沦为附庸。他主张通过国家持股,并引入工会集体谈判一类的「预分配」机制,让劳动者在决策桌上占有一席之地,在初次分配中直接分享技术红利,避免穷人最终沦为依赖富人施舍的附庸,而非依靠传统的税收再分配。

马斯克 (Elon Musk) 随后在 X 平台公开唱反调,提出相较于政府入股更优的替代方案,即直接由财政部向民众发钱。马斯克解释,在 AI 与机器人技术支撑下,商品和服务的产出增速将远超货币供应,直接发钱并不会引发通货膨胀,相反,人类未来需要竭力对抗大通缩。

两人的核心分歧在于应对财富分化的路径:万斯倾向于国家入股与劳工谈判的生产端介入,防止资产收益被少数人垄断;马斯克则倾向于货币政策层面的直接干预,反对国家干预生产资料所有权,主张利用技术带来的物质充裕进行消费端发钱兜底。

信源:https://x.com/elonmusk/status/2068427440473452739
👍3
前OpenAI研究员称中国已掌握美AI巨头所有代码,遭业内群嘲

前 OpenAI 研究员 Will Depue 宣称,中国今天已完全掌握 OpenAI 与 Anthropic 的所有 GitHub 代码库、Slack 聊天记录和内部文档。他还扬言,如果在中国的开源模型中看到「可合理推诿」的被盗架构,自己不会感到惊讶。

由于拿不出任何实锤证据,Depue 辩称这些判断主要源于自己同安全研究人员的交流,指责外界高估了前沿实验室的防线。作为经常在社交平台发布离谱言论的博主,Depue 还曾在愚人节当天发帖宣称自己将加盟 DeepSeek。

这番言论在 AI 社区迅速沦为笑柄。AI 学者 Nathan Lambert 批评前沿实验室频繁发表自利型废话,并指出技术的流转本质上是通过硅谷的人才流动、酒吧聚会以及缺乏竞业限制自发实现的,真正的核心优势是算力和工程资源,而不是 Slack 里的聊天记录。

AI 研究员 Elie Bakouch 则用完全相同的格式反讽道,毫无疑问,今天所有的前沿实验室也全盘掌握了 DeepSeek、Kimi、GLM 和 MiniMax 的技术报告与模型,讽刺美前沿实验室一边天天免费参考中国开源的成果,一边又在整天陷入被迫害幻想。

信源:https://x.com/willdepue/status/2068118253633737077
特斯拉AI工程师:算法调优不是万能药,数据质量决定AI上限

特斯拉 AI 高级主任工程师蔡云达指出,外界常以为机器学习项目 99% 的工作都在跑训练,实际上真正用于模型参数训练的时间仅占 2%。相比之下,50% 的精力花在评估测试上,40% 花在清洗数据上,另外 8% 是系统集成。

蔡云达强调,数据清洗和评估决定了 AI 能够学到的极限。如果原始数据定义模糊、标注前后矛盾,就会在源头上引入噪声。任何算法魔法或调参技巧都无法消除背景噪声,因为模型无法自己纠正错误的课本,最终的精度上限完全取决于数据本身的有效信息量(即香农编码极限)。

为了从源头确保数据标准统一,蔡云达表示自己每天都在重新审视数据概念的定义与分类体系(即本体论,Ontology),甚至要反复审核历史标签。无论是强化学习的规则设定,还是模型微调的精准标注,决定 AI 表现的始终是数据质量和评测水平,而非模型架构本身。

信源:https://x.com/yunta_tsai/status/2068364559698780520
1👎1
智谱GLM-5.2登顶DeepSWE开源第一:解决44%复杂开发任务,力压主力闭源模型

智谱 AI 开源模型 GLM-5.2 正式进驻长程软件工程基准 DeepSWE。在最大思考力度模式下,复杂开发任务的一次成功率达到 44%,在开源模型中排名第一。对比此前入榜的 Kimi K2.7 Code,成功率高出 13 个百分点。

GLM-5.2 解决每项任务的平均成本为 3.92 美元,略高于 Kimi K2.7 Code 的 2.82 美元,成功率却超越了多款主流闭源模型在特定思考配置下的表现,包括 Claude Sonnet 4.6 [high] (30%)、Gemini 3.5 Flash [medium] (37%),以及 Claude Opus 4.8 [low] (41%)。

评测发起方 Datacurve 设计的 DeepSWE 基准专门测试 AI 智能体解决长任务的能力。测试包含 113 个真实编程问题,覆盖 5 种语言。与只修改单处代码的传统测试不同,DeepSWE 要求 AI 协同修改多个文件,平均修复代码超过 600 行。评测在隔离容器中运行,严格限制 CPU 和内存资源。

信源:https://deepswe.datacurve.ai/
字节Seed 2.1 Pro预览版亮相:冲进Code Arena前端前八,直追Claude Opus 4.6

基准测试平台 Arena.ai 官方公布了字节跳动尚未公开的新模型 Seed 2.1 Pro Preview 的评测成绩。在专门评估 AI 构建真实网页应用与多文件协同修改能力的 Code Arena: Frontend 基准测试中,该模型以 1539 分的成绩位列全球第 8 名,与 Anthropic 的旗舰模型 Claude Opus 4.6 表现相当。

该模型在 React 开发和前端 UI 交互设计上展现出极强实力,在 7 个子类别中有 5 个冲进全球前 10(包括 React 排名第 7、HTML 排名第 14、品牌与营销排名第 6、内容创作工具与数据分析排名第 9、基于参考的设计与消费产品排名第 10)。在这些强项中,排名领先于它的只有极少数头部模型,如 Anthropic 的 Claude 系列以及智谱 AI 刚刚开源的 GLM-5.2。

官方透露,Seed 2.1 Pro 将在未来几周内正式对公众发布。这也是继今年 2 月中旬推出 Seed 2.0 Pro 之后,字节跳动在代码生成和智能体构建领域的最新进展。

信源:https://x.com/arena/status/2068864523499638996
1
传Anthropic已完成新版Mythos训练,Sonnet5发布在即

知名 AI 观察者 Andrew Curran 透露,Anthropic 已经完成了性能更强大的新版 Mythos 模型训练,但目前尚不确定新模型会被命名为 Mythos 5.1 还是 Mythos 6,也可能被 Anthropic 留在内部以加速后续开发。

同时,随着 Anthropic 合作伙伴服务商平台上出现名为 claude-sonnet-5 的模型标识,开发者社区普遍猜测 Sonnet 5 即将在本周正式发布。

信源:https://x.com/AndrewCurran_/status/2068748019030483365
2
豆包APP灰测对话式一键打车,携手曹操出行补齐字节出行业态

对话式一键打车服务已在豆包 APP 开启灰度测试,由曹操出行提供具体运力。获得灰测资格的北京和杭州用户,无需手动输入起讫地址或筛选车型,只需在对话框中口述出行人数、用车偏好和目的地,系统即可自动匹配曹操出行的车型与价格,用户一键确认即可完成派单。

司机端也已完成配套对接。多位曹操出行司机确认,平台已开始推送「豆包服务订单」专属标签,并为提供服务的司机发放每单 2 元的惊喜服务费。功能上线源于双方今年 6 月达成的 AI 出行战略合作。

信源:https://mp.weixin.qq.com/s/KLRjy49Do4JgXk_YE0m5jw
智谱AI与MiniMax等中国AI企业估值倍数高企,PS比率高出美国同行数十倍

根据投资人 Tommy Shaughnessy 披露的对比数据,已在港股上市的智谱AI与MiniMax等中国大模型企业,其估值与营收的比例(市销率PS)远超美国同行。

其中,智谱AI在港股市值已达1370亿美元左右,但其2025财年营收仅约1.07亿美元,市销率高达1280倍;MiniMax在港股市值约230亿美元,2025财年营收约7900万美元,市销率约290倍。

与此相比,未上市的美国头部大模型企业OpenAI与Anthropic的市销率分别仅为34倍和21倍左右。作为另一参照,包含非AI业务的阿里巴巴(通义千问背后公司)市销率仅为1.6倍。

分析指出,除非中国AI企业营收能在短期内迎来数十倍的爆发式增长,或者通过投资入股美国第三方推理提供商来换取收入分成,否则其当前的高估值倍数将难以为继;而美国前沿 AI 实验室凭借庞大的营收规模,在未来IPO后估值倍数仍有进一步扩张的空间。

信源:https://x.com/Shaughnessy119/status/2068899158442782732
🤡3😁2