动察Beating AI News
3.14K subscribers
871 photos
2 videos
3.38K links
AI新闻信息流
Download Telegram
xAI悄然发布专为Agentic Coding优化的最新代码模型grok-build-0.1

xAI 推出专为智能体编程(Agentic Coding)训练的快速代码模型 `grok-build-0.1`。模型支持文本与图像多模态输入,原生具备工具调用、结构化输出与推理思考能力,现处于早期访问阶段。

grok-build-0.1 的上下文窗口为 256k。API 基础定价为输入 1 美元/1M Tokens,输出 2 美元/1M Tokens。模型开启提示词缓存后,命中部分的输入成本降至 0.20 美元/1M Tokens。

xAI 已经开放 Grok 个人订阅账号的第三方授权。拥有 SuperGrok 或 X Premium 订阅的用户,可通过 OAuth 机制在开源智能体 Hermes Agent 与 OpenClaw 直接复用官方算力配额,支持直接调用 `grok-build-0.1`。

信源:https://docs.x.ai/developers/models/grok-build-0.1
1
AI开支挤压IT预算,康明斯与联邦快递要求缩短SaaS合同并引入重新定价机制

受 Anthropic 与 OpenAI 模型支出增加影响,企业买家开始向传统 SaaS 供应商施压,要求缩短软件合同期限并增加防御条款。传感器组件商 Ralliant 过去签署五年期软件合同,目前已将期限缩短至一到三年,Ralliant 内部开发的 AI 智能体现已接管部分 ERP 系统的分析工作。

IT 服务商 Ibex 将续约周期缩短至一年。康明斯(Cummins)要求获得 90 天的合同修改权限,以便随时评估和替换 AI 工具。

买家同时在续约中引入新的成本控制条款。联邦快递(FedEx)要求加入重新定价触发机制,规定当 AI 使用成本达到特定阈值时必须重新谈判价格。保险公司 National Life Group 要求写入可替换性条款,禁止供应商在推出新 AI 功能时加价,并设定性能未达标即可提前退出合同的选项。

安永(EY-Parthenon)数据显示,传统软件提供商的净留存率在过去半年下降约 15 个百分点,大量客户拒绝在现有供应商上增加长期投入。

信源:https://www.theinformation.com/articles/anthropic-costs-mount-businesses-pressure-software-firms-shorten-contracts
Anthropic预计二季度实现5.59亿美元利润,领跑OpenAI率先达成单季盈利

Anthropic 向投资者透露,2026 年第二季度营收预计达 109 亿美元,较第一季度的 48 亿美元实现翻倍,并将录得 5.59 亿美元运营利润。Anthropic 由此先于 OpenAI 与 xAI,成为首家实现单季盈利的前沿 AI 实验室。

竞争对手目前仍因高昂的模型训练成本深陷亏损。SpaceX 最新招股书披露,与其合并的 xAI 业务已产生 64 亿美元运营亏损。OpenAI 向投资者预计需到 2030 年才能扭亏为盈,并计划在此之前投入超 6000 亿美元扩容算力。

盈利并未减缓 Anthropic 的硬件投资步伐。Anthropic 与 SpaceX 签订了每年 150 亿美元的算力租赁协议,并与 Google 和亚马逊达成规模达数千亿美元的潜在合作。Anthropic 正接近完成一笔 300 亿美元的融资,投后估值将升至 9000 亿美元。Anthropic 已于去年聘请律所 Wilson Sonsini 筹备上市,加速推进年内公开募股。

信源:https://www.ft.com/content/a67248e7-f819-4dba-b0f7-3847df0a75f3?syn-25a6b1a6=1
😁2🤔1
智谱联合提出下一代大模型推理网络架构ZCube,破解PD分离引发的结构性网络拥塞

针对大模型 PD(Prefill-Decode)分离部署中日益严峻的结构性网络拥塞难题,智谱、驭驯网络与清华大学开展联合攻关,提出并在 GLM-5.1 coding 千卡线上生产环境落地了 ZCube 组网架构。

随着长上下文和 PD 分离推理成为主流,KV Cache 的跨节点传输使推理流量呈现出严重的不对称特征,传统 ROFT(Rail-Optimized Fat-Tree)架构极易引发局部热点和链路冲突。ZCube 通过取消 Spine 层交换机,采用全网扁平化拓扑(2跳网络直径),结合单/多轨混合接入机制,在架构层面实现了跨节点全网交换机之间的流量负载均衡。

在实际生产集群的基准测试中,保持 GPU、软件栈及应用不变的前提下,ZCube 架构相比传统架构减少了 33% 的交换机与光模块硬件支出,同时 GPU 平均推理吞吐率提升了 15%,首 Token 时延(TTFT)P99 分位数下降了 40.6%。

信源:https://mp.weixin.qq.com/s/JYyLD4U2235obw9WH45v9g
腾讯混元依托Hy-MT2大模型推出轻量化翻译产品,内置9种语气预设解决场景翻译偏差

腾讯混元团队推出轻量化 AI 翻译产品 Hy翻译。新产品依托自研 Hy-MT2 大模型,在自动识别与语种切换功能外,新增风格预设与个性化设定两大核心模块。

风格预设内置 9 种模板,涵盖学术论文、法律合同、日常口语及商业新闻等场景。这项设计直接为不同情境匹配专属翻译语气模型,解决通用机器翻译语气偏差与术语不当的通病。个性化模块允许用户自定义规则,支持保留特定专业缩写或品牌名不译,并通过快捷输入一键切换社媒文风与地道意译模式。

底层技术上,Hy-MT2 大模型针对跨境沟通与学习办公等高频场景做了专项优化,通过强化多领域术语库覆盖来提升准确率。产品的机制重点从单纯字面对应转向场景化适配。

信源:https://mp.weixin.qq.com/s/piuaCr9-DbyUgvgbEb4IKg
Hermes Agent支持以YAML文件跨团队分发Skill Bundles技能组

Hermes Agent 引入 Skill Bundles(技能包)机制。开发者可将多个独立技能的配置聚合至单个 ~/.hermes/skill-bundles/<slug>.yaml 文件,从而支持跨团队共享或通过 dotfiles 仓库进行统一管理。

系统新增 hermes bundles create 交互式命令以快速构建配置。本地管理环节同步加入了 list`、`show`、`deletereload 系列指令。官方可选技能现已启用类似 official/security/1password 的层级标识符规范。

信源:https://hermes-agent.nousresearch.com/docs/user-guide/features/skills#skill-bundles
前TSY Capital联创崔添翼加盟DeepSeek,带队研发对标Claude Code的Agent

前量化投资机构 TSY Capital 联合创始人、曾在华尔街量化巨头 Jane Street 履职 9 年的崔添翼已于今年 3 月正式加盟 DeepSeek,出任其全新组建的 Harness 团队负责人,挂帅研发直接对标 Anthropic 旗下 Claude Code 的桌面端 Agent 产品。

崔添翼曾在本科期间 6 次斩获 ACM 国际大学生程序设计竞赛亚洲区金牌,其此前创立的 TSY Capital 开发团队人均拥有约 5 枚 ACM 级别金牌。

DeepSeek 内部将核心产品路径定义为「Model + Harness = Agent」,将上下文管理、工具调用、文件读写、终端执行与测试反馈等模型之外的工程动作全部划归 Harness 范畴。在此之前,开发者社区曾自发涌现开源终端项目 DeepSeek-TUI。此次官方亲自下场,旨在收回终端入口主导权,将真实项目中的工程试错轨迹直接注入到底层模型的进化闭环中。

信源:https://www.linkedin.com/feed/update/urn:li:activity:7462155484939079680/
知名开发者揭露谷歌AI内斗:逼走原Gemini CLI团队,新产品Antigravity像素级抄袭Codex

知名开发者 Theo(t3.gg)发布视频,揭露了谷歌 AI 团队内部荒诞的政治斗争。他表示,原 Gemini CLI 团队曾积极听取社区反馈并致力于构建优秀的开源解决方案,但随着谷歌出资将 Windsurf 创始人团队挖来开发新产品「Antigravity」,原团队的心血被彻底废弃,核心人员遭到排挤。更具讽刺意味的是,被谷歌寄予厚望的 Antigravity 客户端不仅模型频繁无效消耗 Token,还在 UI 上像素级抄袭了直接竞品 Codex,甚至在官方演示视频中都不慎露出了名为「Codex」的开发文件夹。Theo 直言,这种内部斗争正在逼走真正优秀的工程师,最终导致谷歌只能产出缺乏诚意的「AI 垃圾」。

在抨击 AI 团队恶性政治之余,Theo 也强烈控诉了谷歌云的极度不可靠。他透露,部署平台 Railway 近期遭遇谷歌云荒谬的内部限流机制导致全面宕机,而谷歌内部甚至无人知晓该限制的存在。他重提了 2024 年大型养老基金 UniSuper 整个云账号遭意外全删的罕见事故,痛批谷歌云相较于 AWS 的稳定与 Azure 的积极响应,完全缺乏商业底线,强烈建议开发者尽快将业务迁出。

信源:https://www.youtube.com/watch?v=1p334v40npw
😁2
谷歌Antigravity紧急整改:永久提升3倍Gemini限额,承认前期决策失误

面对开发者社区对其功能设计与资源消耗的强烈批评,谷歌 Antigravity 团队核心成员(原 Windsurf 创始人)Varun Mohan 今日紧急宣布整改措施。他公开承认团队在部分决策上犯了错,承诺将听取社区反馈并尽快修复存在的问题。

作为首个实质性让步,Antigravity 即日起将所有付费层级的 Gemini 模型速率限制(Rate Limits)永久提升 3 倍,并当即重置了所有用户的本周额度配额。

信源:https://x.com/_mohansolo/status/2057331857755422922
火山引擎上线一站式AIGC短剧创作平台「火山剧创1.0」,制作周期缩短80%

火山引擎正式上线一站式 AIGC 短剧创作平台「火山剧创1.0」。该平台依托自研多智能体(Multi-Agent)架构,并深度适配 Seedance、Seedream 等模型,为用户提供从剧本解析、全剧资产设定、分镜视频生成到成片预览的端到端智能解决方案,号称可将短剧制作周期缩短 80% 以上。

此次 1.0 版本升级的核心在于全面支持企业级工业化协作流程。平台新增了三大核心模块:一是支持多模态参考和智能补全的“分镜提示词编辑器”;二是分为安全合规虚拟人像和授权真人双线覆盖的“IP 人像库”;三是面向专业团队的主子账号灵活积分分配及协作管理功能。

目前,火山剧创已支持电影《古格王朝》完成 AI 先导片创作,大幅降低了传统历史战争场景的调度制作成本。未来,平台计划进一步联动红果短剧、巨量引擎及穿山甲等字节生态链路,推进短剧内容的高效工业化生产。

信源:https://mp.weixin.qq.com/s/CVpzldg_PdHi9aM7i_Subg
Zed上线Terminal Threads,规避Claude Code暴涨ACP接口成本

Zed 1.3.5 版本上线 Terminal Threads 功能,允许开发者在侧边栏直接开启终端线程并运行 Claude Code、Amp 等 CLI 工具。6 月 15 日起,Anthropic 将把 Agent SDK 迁移至受限点数系统,通过传统 ACP(Agent Context Protocol)协议调用 Claude Code 的成本将激增 15 至 30 倍。

新机制让外部工具免改造直接切入编辑器工作流,开发者可借此继续使用现有标准订阅,避开高昂的 API 计费。终端线程完整保留了环境变量与项目目录,并支持跨项目并行运行多 Agent。官方表示后续仍会持续投入 ACP 深度集成,新终端主要提供一个低门槛、无额外接口费用的平行接入路径。

信源:https://zed.dev/blog/terminal-threads
海外版剪映CapCut宣布与谷歌达成合作,用户可在Gemini内直接调用剪辑功能

CapCut 今日宣布与谷歌 Gemini 达成合作,将其原生视频与图像编辑工具整合进 Gemini 应用。用户可以直接在 Gemini 聊天界面内使用自然语言指令,调用 CapCut 完成视频片段裁剪、画幅调整及特效添加,整个工作流无需离开当前对话窗口。

这一动作承接了谷歌在 I/O 2026 大会上发布的 Gemini Spark 个人智能体战略。谷歌没有选择在通用 AI 助手内从头搭建专业特效库,而是让 Gemini 充当大脑去直接调度外部成熟的工具链。目前 CapCut 官方社交平台已确认该功能即将上线,谷歌尚未公布确切的推送时间表。

信源:https://x.com/capcutapp/status/2057340757896216641
👍1
开发者吐槽谷歌AI产品生态碎片化:内部晋升机制导致不断「造新轮子」

科技博主 Gergely Orosz 披露谷歌内部晋升机制存在严重偏差。员工只有开发全新产品才能获得内部晋升与奖励,而维护现有系统或帮助老用户迁移等工作被视为毫无晋升价值。这种激励导向导致谷歌每年都在为同类需求重复发布新产品。

开发者 Nathan Clark 列举了这种机制在谷歌 AI 生态中造成的极度碎片化现状。模型端被强行拆分为 Pro、Ultra 和 Flash 等版本。生态端在 Gemini 和 AI Studio 之间摇摆,且 Workspace 版与个人版 Google One 账号完全割裂。

开发者工具层面的混乱更为严重。谷歌同时推出了智能体开发平台 Spark、编码助手 Jules,并存在新老版本 Antigravity IDE 的迭代冲突。原有的 Gemini CLI 被直接弃用。视频产品 Flow 与 Veo 关系模糊,图像生成工具 Nano banana 被塞入 Gemini 体系,而搜索和研究功能又被拆分进独立的 AI 模式和 NotebookLM 中。

信源:https://x.com/GergelyOrosz/status/2057336026046095508
👍1
腾讯混元开源Hy-MT2系列翻译大模型,并同步上线「腾讯Hy翻译」小程序

腾讯混元官方正式宣布开源 Hy-MT2 系列多语种翻译大模型,发布包含 1.8B、7B 及 30B-A3B(MoE架构)三个规模版本。该系列模型支持 33 种语言及 5 种中国方言互译,相关权重与代码已在 Hugging Face、ModelScope 及 GitHub 同步上线,并在 ARM、高通、Intel、沐曦、天数智芯等多个硬件平台完成适配部署。同时,腾讯混元与 WMT26 官方达成合作,共同主办“视频字幕翻译比赛”。

端侧部署是此次升级的重点。借助混元自研的 AngelSlim/Sherry 框架,1.8B 模型实现了 1.25-bit 的极低精度量化,体积压缩至仅 440MB。该版本在苹果 A15 芯片上的推理速度较前代 4-bit 量化版提升 1.5 倍,完全具备在主流手机端侧流畅进行离线推理的能力。此外,7B 与 30B-A3B 版本在 FLORES-200 榜单上击败了 DeepSeek-V4-Pro,并在真实世界与垂直领域测试中,达到 Gemini 3.1 Pro 约 96% 至 99% 的性能水平。官方还一并开源了翻译指令遵循评估基准 IFMTBench。

基于该模型底座的「腾讯Hy翻译」小程序现已开放体验,主打语音输入、风格预设与个性化定制指令。支持离线端侧推理的 iOS 和安卓 APP 也即将在近期上架。

信源:https://mp.weixin.qq.com/s/a_GPa-brAIB5aqXyd8W4-Q
美股AI初创三巨头,竞相上市

随着科技股新一轮狂欢的到来,SpaceX、OpenAI 与 Anthropic 正掀起一场史诗级的 IPO 浪潮。这三家巨头的总估值预计将超过 3 万亿美元,或将重塑未来科技投资的格局。

SpaceX 已正式提交 IPO 招股书,目标估值高达 1.75 万亿至 2.3 万亿美元,预计最早于 2026 年 6 月 12 日挂牌。尽管文件显示公司整体仍面临数十亿美元亏损,但其星链(Starlink)业务在 2025 年已实现 114 亿美元营收和 44 亿美元营业利润。文件还披露了确保马斯克(Elon Musk)维持绝对控制权的超级投票权结构,以及与“建立可容纳 100 万人口的火星殖民地及太空数据中心”挂钩的巨额期权奖励。据悉,高盛 CEO David Solomon 曾通过社交平台私信马斯克直接争取主承销商资格。

在 AI 赛道,OpenAI 正与高盛、摩根士丹利合作,最快将于本周五秘密提交 IPO 招股书草案,计划在 2026 年底前(或最早 9 月)上市。OpenAI 此前在一级市场已累计融资约 1800 亿美元,此次上市估值区间落在 8500 亿至 1.1 万亿美元。受此消息提振,持有其约 13% 股份的主要股东软银(SoftBank)股价大涨 20%,目前已在该笔投资上录得约 450 亿美元的未实现收益。

作为主要竞争对手,Anthropic 同样已正式委托律师团队推进上市流程,计划在 2026 年下半年申请纳斯达克上市,目标估值高达 9000 亿美元。得益于商业化的迅猛进展,Anthropic 今年一季度营收达 48 亿美元,并预计二季度营收将达到 109 亿美元,有望借此实现公司史上首个单季盈利。

信源:https://www.timesnownews.com/business-economy/markets/spacex-vs-openai-vs-anthropic-the-next-tech-ipo-war-article-154366685
1
AI搜索引擎Exa完成2.5亿美元C轮融资,估值一年翻三倍

专为 AI Agent 构建底层搜索基础设施的 Exa 宣布完成 2.5 亿美元 C 轮融资,由 a16z 领投,投后估值从去年 9 月的 7 亿美元飙升至 22 亿美元。本轮资金将用于扩充专有索引库、训练新一代检索模型,并将底层吞吐量扩容至每秒数十万次并发请求。

Exa 强调其核心护城河是「全栈自建」:拥有独立爬虫、追踪超五千亿 URL 的原生索引系统、自研 embedding 模型及第三代向量数据库,彻底告别业内普遍的「套壳谷歌」方案。这套专为 AI 设计的引擎,支持从 200 毫秒极速响应(Exa Instant)到分钟级的自主深度检索(Deep Max,近期在 DeepSearchQA 取得 SOTA)。最新研究还表明,使用 Exa 替代传统搜索引擎进行 RL 智能体训练,可节省 69% 的 Token 消耗,搜索正从「推理工具」进化为不可或缺的「训练基底」。

目前 Exa 的月查询量已达 10 亿次,一年激增十倍,服务客户包括 Cursor、Cognition 等头部 AI 公司。颇具戏剧性的是,曾立起「10^18 > 10^100」(Exa 大于 Google)挑衅广告牌的 Exa,近期也作为首批伙伴接入了 Google Cloud Vertex AI,为 Gemini 企业客户提供 Grounding 搜索落地服务。

信源:https://x.com/ExaAILabs/status/2057132080317042697
👍1
Manus创始人拟融资10亿美元以撤销Meta收购案并谋求在港上市

智能体 AI 初创公司 Manus 的三位创始人肖弘、季逸超与张涛正探讨回购方案,拟从外部投资者处融资约 10 亿美元,以应对北京监管机构此前要求撤销 Meta 收购案的决定。

知情人士透露,上述回购估值将至少匹配 Meta 收购时支付的 20 亿美元。除计划引入 10 亿美元外部资金外,创始人还可能自掏腰包补齐余款。若谈判达成,Manus 将与这些投资方在华设立合资企业,并谋求在香港上市。

今年 4 月,北京监管机构向当事方发出通知,要求取消这笔在 2025 年 12 月宣布的收购案。监管层明确表示,将全力阻止敏感技术流向美国企业。此前,监管部门已采取类似严厉立场,禁止字节跳动和月之暗面等本土科技巨头在未经批准的情况下接受美资,并收紧了离岸中国企业在港上市的监管路径。

由于大部分交易已经完成,在实际操作中彻底逆转交易面临极大难度。Manus 员工目前已入职 Meta 位于新加坡的办公室,技术已与后者的系统深度整合,腾讯、红杉中国及真格基金等早期投资方也已收到退出资金。目前,相关的回购和拆分方案仍处于初步探讨阶段,估值和条款随时可能发生变化,三位创始人最终也可能选择放弃。

信源:https://www.bloomberg.com/news/articles/2026-05-21/manus-weighs-raising-1-billion-to-unwind-meta-takeover
AMD第六代EPYC处理器Venice在台积电2nm量产,百亿美元投资扩充台湾先进封装

AMD 第六代 EPYC 处理器(代号 Venice)已在台积电台湾晶圆厂的 2nm 节点启动量产。这是业界首款基于台积电 2nm 工艺量产的高性能计算(HPC)产品。面向智能体(Agentic)AI 激增的内存需求,AMD 后续的 Verano 处理器将沿用 2nm 工艺并整合 LPDDR 内存。台积电亚利桑那州工厂也已列入后续量产版图。

AMD 同步在台湾生态圈投资逾 100 亿美元,集中扩建先进封装产能。资金流向日月光(ASE)、硅品(SPIL)和力成科技(PTI)等产业链企业。其中,力成科技已完成业界首个面板级 EFB(Elevated Fanout Bridge)2.5D 互连技术验证,负责拔高 Venice CPU 的互连带宽与能效。

搭载 Venice CPU 与 Instinct MI450X GPU 的 AMD Helios 机架级系统正交由新美亚(Sanmina)、纬颖、纬创与英业达进行系统构建。整套平台预计于 2026 年下半年启动数千兆瓦(multi-gigawatt)规模的部署。

信源:https://ir.amd.com/news-events/press-releases/detail/1287/amd-announces-production-ramp-of-next-generation-amd-epyc-processor-venice-on-tsmc-2nm-process-technology
Meta单日裁员8000人,凌晨4点发解雇邮件且监控留任员工训练AI

Meta 于 2026 年 5 月 20 日裁员 8000 人。多位员工披露解雇邮件在当天凌晨 4 点集中发出,公司此前已要求全员在家办公。被裁名单包含每天睡眠不足 4 小时、常在凌晨 3 点提交代码的 IC4 级别高绩效且无 PIP 记录的骨干工程师。

未被裁员的留任员工电脑已被安装监控软件。内部员工 Marco 指出,公司正在追踪留任者的操作轨迹来训练 AI,目标是利用这些 AI 进一步替代现有岗位。Meta 当前正处于创纪录利润期。前员工 Jeremy Bernier 证实内部仍在执行末位淘汰(Stack Ranking),大量背负房贷的初中级工程师及 H1B 签证持有者在无底线加班后,依然直接成为推高股价的牺牲品。

信源:https://x.com/jeremybernier/status/2057089908175679663
阿里云发布万镜一刻全链路AI视频创作平台

阿里云正式发布全链路 AI 视频创作平台万镜一刻 WonderClip,集成 Happy Horse、Wan、Qwen-image 与 Z-image 等阿里系大模型并向全行业开放。

平台提供三种核心工作流。第一,故事板模式专为剧情视频与 AI 短漫剧设计,用户上传剧本或小说后,编剧、分镜和导演智能体自动协同解析,生成分镜和运镜指令以批量产出人物一致的画面。第二,无限画布模式面向广告创意与短剧,用户在单一画布内即可通过自然语言引导智能体搭建生产流,并支持将创作链路保存为协同模板。第三,Agent 模式通过多智能体协同提供对话式成片能力,近期将开启灰度测试。

针对商业营销中常见的字符渲染难题,万镜一刻引入营销意图理解智能体与专用排版渲染引擎,保证生成的字幕、数字及品牌视觉元素精准无误,解决了大模型在视频中文字生成容易出错的痛点。

在交付与协作层面,平台提供品牌定制、轻量化嵌入及全栈 API 集成,支持企业部署具有独立域名和 UI 的品牌空间,并支持多工作室资产管理与精细权限隔离。针对已拥有智能体架构的企业,平台开放了音视频创作技能与 API 接口,供其无缝集成至现有业务流程。目前,史密斯、钛动科技与天阅剧场等企业已接入万镜一刻,用于生成虚拟品牌官视频及短剧量产。

信源:https://mp.weixin.qq.com/s/gV1jZDiOhqe_79Q_k-ngbw
OpenAI模型推翻80年单位距离猜想,AI首次独立解决核心数学公开难题

OpenAI 内部一款通用推理模型推翻了埃尔德什在 1946 年提出的平面单位距离猜想。根据原猜想,在平面上放置 n 个点,距离刚好为 1 的点对数量不会显著超过 n^{1+o(1)},数学界长期认为类似方格的构造已接近极值。

完成这项证明的模型不是专门的数学系统,也没有使用搜索脚手架针对这道难题定制。模型给出一族新的点集构造,把单位距离点对数量拉高到 n^{1+δ} 级别(δ 为大于 0 的常数),打破了学术界沿用近 80 年的上界预期。

新解法直接跨越了常规的学科边界。模型将代数数论的深层工具引入欧氏平面组合几何。Noga Alon、Tim Gowers 和 Arul Shankar 等外部数学家在检查原始证明后,于 arXiv 发布了配套说明论文,指出推导过程依赖 Ellenberg-Venkatesh 和 Golod-Shafarevich 等复杂的代数数论思想。

菲尔兹奖得主 Tim Gowers 将这一成果视作 AI 数学里程碑。数论学者 Arul Shankar 认为当前模型已具备提出原创想法并推进完整论证的能力。相比于证明结论,更大的技术增量在于通用模型在没有专属工具链的环境下,独立跑通了一条人类专家长期未能触及的反例路线。

信源:https://openai.com/index/model-disproves-discrete-geometry-conjecture/