修复提示词缓存回归漏洞,xAI重置Grok Build所有账户额度
xAI 宣布修复旗下终端编程智能体 Grok Build 的提示词缓存 (Prompt Caching) 回归漏洞,对所有账户的使用额度执行全额重置。
回归漏洞源于 5 月 21 日上线的一项引擎采样重构。为了支持 X 搜索与更快的网页检索,开发团队将引擎采样切换至新代码路径,但新路径未能正确调用系统用于检索提示词缓存的 HTTP 请求头 x-grok-conv-id,导致请求在执行时遭遇缓存大面积失效。
由于缓存失效,智能体在处理长提示词时无法重用已有的 KV 缓存,迫使系统重复计算全部上下文,引发了 Token 消耗加剧与首字延迟 (Time to first token) 变长。面对用户的额度异常损耗,开发团队坦承在追踪缓存命中率方面不够勤勉 (not diligent enough),且由于并发的 API 流量涌入产生不一致的缓存命中表现,干扰了最初的异常排查,导致定位漏洞的时间比以往更长。
目前,开发团队已完成漏洞修复,并部署了专门的告警监控与回归测试。
信源:https://x.com/xai/status/2059375342683636066
xAI 宣布修复旗下终端编程智能体 Grok Build 的提示词缓存 (Prompt Caching) 回归漏洞,对所有账户的使用额度执行全额重置。
回归漏洞源于 5 月 21 日上线的一项引擎采样重构。为了支持 X 搜索与更快的网页检索,开发团队将引擎采样切换至新代码路径,但新路径未能正确调用系统用于检索提示词缓存的 HTTP 请求头 x-grok-conv-id,导致请求在执行时遭遇缓存大面积失效。
由于缓存失效,智能体在处理长提示词时无法重用已有的 KV 缓存,迫使系统重复计算全部上下文,引发了 Token 消耗加剧与首字延迟 (Time to first token) 变长。面对用户的额度异常损耗,开发团队坦承在追踪缓存命中率方面不够勤勉 (not diligent enough),且由于并发的 API 流量涌入产生不一致的缓存命中表现,干扰了最初的异常排查,导致定位漏洞的时间比以往更长。
目前,开发团队已完成漏洞修复,并部署了专门的告警监控与回归测试。
信源:https://x.com/xai/status/2059375342683636066
出走半年后回归字节,分布式专家林海滨重返字节Seed团队
原字节跳动大模型训练负责人林海滨正式回归 Seed 团队,继续统筹分布式训练底座的开发。林海滨去年 12 月离职加盟 OpenAI 前首席科学家伊利亚·苏茨克沃 (Ilya Sutskever) 创立的超级智能公司 SSI (Safe Superintelligence) ,从出走到回归历时不足半年。林海滨作为卡内基梅隆大学 (CMU) 硕士、师从著名数据库专家安迪·帕夫洛 (Andy Pavlo) 教授的 AI 专家,曾主导开源了强化学习训练框架 veRL 与万卡级分布式训练系统 MegaScale ,林海滨的快速回流折射出中美大模型顶级人才流向的变化。
在 2020 年加入字节跳动 AML (应用机器学习) 团队前,林海滨曾在亚马逊 AWS 参与 MXNet 框架研发。在字节跳动期间,林海滨牵头研发了 GPU 推荐训练系统与集合通信库 ByteCCL ,并带队攻克上万张 GPU 并行协同难题以打磨出 MegaScale 训练系统。当前豆包大模型日均调用量处于高位,多模态与智能体研发对训练集群的稳定性要求极高,林海滨此前对字节跳动整套技术体系的熟悉度,能够直接支持底层分布式训练系统的迭代。此外,林海滨主导开发的开源强化学习训练框架 veRL 已被阿里巴巴通义千问与上海 AI 实验室采用。
字节跳动的人员回流规定指出,员工离职满 3 个月且无违规记录可申请重返公司,离职不足 1 年则职级与薪资保持不变。林海滨重返字节跳动,呼应了近期针对大模型核心团队的激励举措。字节跳动向 Seed 部门员工开放了定价为每股 13 美元的「豆包股」特殊期权认购权。目前大模型人才战已升级为「期权+自主权+算力」的综合争夺,此前 Seed 实验室曾有约 70 名成员流向外部大模型厂商,字节跳动正试图通过特殊股权设计逆转人员流失。
信源:https://mp.weixin.qq.com/s/6eaRVAuBktUcYaYcDOt2AQ
原字节跳动大模型训练负责人林海滨正式回归 Seed 团队,继续统筹分布式训练底座的开发。林海滨去年 12 月离职加盟 OpenAI 前首席科学家伊利亚·苏茨克沃 (Ilya Sutskever) 创立的超级智能公司 SSI (Safe Superintelligence) ,从出走到回归历时不足半年。林海滨作为卡内基梅隆大学 (CMU) 硕士、师从著名数据库专家安迪·帕夫洛 (Andy Pavlo) 教授的 AI 专家,曾主导开源了强化学习训练框架 veRL 与万卡级分布式训练系统 MegaScale ,林海滨的快速回流折射出中美大模型顶级人才流向的变化。
在 2020 年加入字节跳动 AML (应用机器学习) 团队前,林海滨曾在亚马逊 AWS 参与 MXNet 框架研发。在字节跳动期间,林海滨牵头研发了 GPU 推荐训练系统与集合通信库 ByteCCL ,并带队攻克上万张 GPU 并行协同难题以打磨出 MegaScale 训练系统。当前豆包大模型日均调用量处于高位,多模态与智能体研发对训练集群的稳定性要求极高,林海滨此前对字节跳动整套技术体系的熟悉度,能够直接支持底层分布式训练系统的迭代。此外,林海滨主导开发的开源强化学习训练框架 veRL 已被阿里巴巴通义千问与上海 AI 实验室采用。
字节跳动的人员回流规定指出,员工离职满 3 个月且无违规记录可申请重返公司,离职不足 1 年则职级与薪资保持不变。林海滨重返字节跳动,呼应了近期针对大模型核心团队的激励举措。字节跳动向 Seed 部门员工开放了定价为每股 13 美元的「豆包股」特殊期权认购权。目前大模型人才战已升级为「期权+自主权+算力」的综合争夺,此前 Seed 实验室曾有约 70 名成员流向外部大模型厂商,字节跳动正试图通过特殊股权设计逆转人员流失。
信源:https://mp.weixin.qq.com/s/6eaRVAuBktUcYaYcDOt2AQ
❤1
MathCode 0.2.0发布,引入前缀缓存整形令API成本骤降九成
Math-AI 团队发布数学形式与定理证明 AI 智能体 MathCode 0.2.0,通过前缀缓存请求整形与策略控制,将 API 成本降低达 90%。新版本针对大模型在长程证明和多轮交互中的高额开销,优化提示词结构稳定性以提升 Prompt 缓存命中率。
在定理证明场景下,模型需频繁读取庞大代码库与公理库。MathCode 0.2.0 引入前缀缓存请求整形诊断与策略控制 Prefix-cache request-shape diagnostics and policy controls 机制。系统屏蔽提示词头部归属以保障结构稳定性,新增多断点缓存 `MATHCODE_CACHE_MULTI_BREAKPOINT`、显式最小前缀网关与空闲感知 TTL 策略,通过底层请求形状对齐最大化 Provider 原生缓存命中率,将长会话账单压至一成。
新版本还强化了任务管理与思考深度控制。为防长程运行超支,系统支持通过
在编译加速与部署方面,新版本支持外接 Project Numina 开发的编译器 Kimina Lean Server 作为子进程常驻运行,并将编译检查请求路由至
信源:https://github.com/math-ai-org/mathcode
Math-AI 团队发布数学形式与定理证明 AI 智能体 MathCode 0.2.0,通过前缀缓存请求整形与策略控制,将 API 成本降低达 90%。新版本针对大模型在长程证明和多轮交互中的高额开销,优化提示词结构稳定性以提升 Prompt 缓存命中率。
在定理证明场景下,模型需频繁读取庞大代码库与公理库。MathCode 0.2.0 引入前缀缓存请求整形诊断与策略控制 Prefix-cache request-shape diagnostics and policy controls 机制。系统屏蔽提示词头部归属以保障结构稳定性,新增多断点缓存 `MATHCODE_CACHE_MULTI_BREAKPOINT`、显式最小前缀网关与空闲感知 TTL 策略,通过底层请求形状对齐最大化 Provider 原生缓存命中率,将长会话账单压至一成。
新版本还强化了任务管理与思考深度控制。为防长程运行超支,系统支持通过
MATHCODE_GOAL_MAX_TOKEN_BUDGET 设定 Token 预算上限,并限制嵌套斜slash命令上限防范无限循环。此外,证明会话支持通过 --effort 或 /effort 动态调整思考深度,提供 low`、`medium`、`high`、`max 等级别,且支持随时退回默认配置。在编译加速与部署方面,新版本支持外接 Project Numina 开发的编译器 Kimina Lean Server 作为子进程常驻运行,并将编译检查请求路由至
/verify 接口。同时,安装脚本 setup.sh 迎来重构,新增 --status`、`--clean 等指令,支持 release 校验和自动验证与复用系统 Lean/Lake environment 环境,降低部署门槛。信源:https://github.com/math-ai-org/mathcode
GitHub
GitHub - math-ai-org/mathcode: MathCode: A Frontier Mathematical Coding Agent
MathCode: A Frontier Mathematical Coding Agent. Contribute to math-ai-org/mathcode development by creating an account on GitHub.
规避美国AI出口禁令,高通携手字节跳动像素级对齐合规芯片代工
高通与字节跳动达成大模型芯片代工与采购协议。高通将协助字节跳动把已完成的自研芯片设计转化为量产芯片,并向字节跳动供应数百万颗定制 ASIC 芯片,以支持旗下 AI 智能体「豆包」的数据中心部署。
为应对严格的地缘政治审查,交易在合规维度进行了精密边界设计。高通委托台积电等代工厂为字节跳动进行流片与制造,只要定制芯片的计算性能控制在合法出口阈值内,相关代工生产便不会违反美国政府现行的 AI 芯片出口管制条例。
大模型与智能体生态的爆发式增长,促使字节跳动大幅拉高数据中心资本开支。行业公开数据显示,字节跳动已将 AI 基础设施预算调高 25 %,达到 2000 亿人民币(约合 294 亿美元)。引入数百万颗高通定制 ASIC 芯片,有助于字节跳动平抑对高端 GPU 的刚性依赖与采购成本。这笔巨额订单不仅是高通从手机处理器向 AI 基础设施跨界转型的里程碑,也让字节跳动成为高通数据中心定制芯片的首批大客户,推动高通股价盘中大涨 8.3 %,创下历史新高。高通首席执行官克里斯蒂亚诺·安蒙 Cristiano Amon 在 4 月的第二财季财报电话会议中曾暗示,高通正在与多家大客户展开 AI 数据中心芯片采购的深度接洽,字节跳动订单的最终落地证实了高通在数据中心芯片业务上的实质性突破。
信源:https://www.bloomberg.com/news/articles/2026-05-26/qualcomm-strikes-ai-chip-deal-with-tiktok-owner-bytedance
高通与字节跳动达成大模型芯片代工与采购协议。高通将协助字节跳动把已完成的自研芯片设计转化为量产芯片,并向字节跳动供应数百万颗定制 ASIC 芯片,以支持旗下 AI 智能体「豆包」的数据中心部署。
为应对严格的地缘政治审查,交易在合规维度进行了精密边界设计。高通委托台积电等代工厂为字节跳动进行流片与制造,只要定制芯片的计算性能控制在合法出口阈值内,相关代工生产便不会违反美国政府现行的 AI 芯片出口管制条例。
大模型与智能体生态的爆发式增长,促使字节跳动大幅拉高数据中心资本开支。行业公开数据显示,字节跳动已将 AI 基础设施预算调高 25 %,达到 2000 亿人民币(约合 294 亿美元)。引入数百万颗高通定制 ASIC 芯片,有助于字节跳动平抑对高端 GPU 的刚性依赖与采购成本。这笔巨额订单不仅是高通从手机处理器向 AI 基础设施跨界转型的里程碑,也让字节跳动成为高通数据中心定制芯片的首批大客户,推动高通股价盘中大涨 8.3 %,创下历史新高。高通首席执行官克里斯蒂亚诺·安蒙 Cristiano Amon 在 4 月的第二财季财报电话会议中曾暗示,高通正在与多家大客户展开 AI 数据中心芯片采购的深度接洽,字节跳动订单的最终落地证实了高通在数据中心芯片业务上的实质性突破。
信源:https://www.bloomberg.com/news/articles/2026-05-26/qualcomm-strikes-ai-chip-deal-with-tiktok-owner-bytedance
Bloomberg.com
Qualcomm Strikes AI Chip Deal With TikTok Owner ByteDance
Qualcomm Inc. reached a deal with TikTok owner ByteDance Ltd. to supply chips for artificial intelligence data centers, according to people familiar with the matter, marking a key win for a company trying to expand from smartphone processors into AI infrastructure.
最后一刻撕毁AI安全令并引入前司法部长,特朗普誓以零监管在AI竞赛中战胜中国
美国人工智能监管政策发生急剧转向。总统特朗普在签字仪式举行前数小时,决定无限期推迟签署原定于 5 月 21 日发布的前沿大模型审查行政命令。随后,特朗普于 5 月 26 日宣布任命前司法部长帕姆·邦迪(Pam Bondi)加入总统科技顾问委员会(PCAST)。从撤回行政令到引入法律派强人,白宫正将科技顾问委员会打造为清扫监管的法律前线。邦迪的诉讼背景配合萨克斯的去监管主张,意在通过法律起诉扫除各州设立的防御性技术壁垒,全面推行放任前沿AI野蛮生长以击败中国的极限路线。
白宫此前起草的安全审查草案聚焦于发布前置审查。虽然条文已将最初设想的类食品药品监督管理局(FDA)强制许可制稀释为「自愿性前置审查框架」,但仍要求开发商在公开发布大模型前,提前最多 90 天向政府共享模型以评估国家安全风险。针对提案设立的审查期限,前沿实验室曾极力游说将时间压缩至发布前 14 天;而特朗普则在最后关头索性将草案全盘撤回,称不满意草案条款,并担忧联邦预审会削弱美国相对于中国的竞争优势,导致国家网络总监办公室(ONCD)等部门的数月努力彻底落空。
白宫去监管政策的急转直下,呼应了顾问委员会联合主席大卫·萨克斯(David Sacks)公开表露的政策立场。针对教皇利奥十四世在 5 月 25 日发布的通谕《伟大的人性》(Magnifica Humanitas)中关于「人工智能革命威胁人类尊严」的警告,萨克斯虽赞同人工智能应服务人类尊严,但极力反对给政府兜底控制权,坚称将模型研发主导权拱手让给政府才是「真正的对齐问题」。萨克斯强调,政府控制极易演变为审查、监视与掌控公民的极权工具,并引用古罗马名言「谁来监督监督者」与「权力导致腐败,绝对权力导致绝对腐败」进行驳斥。萨克斯对前司法部长邦迪履新顾问委员会表示全力支持,标志着白宫将利用司法起诉手段阻击各州出台的冲突法案,以极端的去监管方针,保障美国在与中国的大国 AI 竞赛中维持绝对领先地位。
信源:https://x.com/DavidSacks/status/2059482315219460150
美国人工智能监管政策发生急剧转向。总统特朗普在签字仪式举行前数小时,决定无限期推迟签署原定于 5 月 21 日发布的前沿大模型审查行政命令。随后,特朗普于 5 月 26 日宣布任命前司法部长帕姆·邦迪(Pam Bondi)加入总统科技顾问委员会(PCAST)。从撤回行政令到引入法律派强人,白宫正将科技顾问委员会打造为清扫监管的法律前线。邦迪的诉讼背景配合萨克斯的去监管主张,意在通过法律起诉扫除各州设立的防御性技术壁垒,全面推行放任前沿AI野蛮生长以击败中国的极限路线。
白宫此前起草的安全审查草案聚焦于发布前置审查。虽然条文已将最初设想的类食品药品监督管理局(FDA)强制许可制稀释为「自愿性前置审查框架」,但仍要求开发商在公开发布大模型前,提前最多 90 天向政府共享模型以评估国家安全风险。针对提案设立的审查期限,前沿实验室曾极力游说将时间压缩至发布前 14 天;而特朗普则在最后关头索性将草案全盘撤回,称不满意草案条款,并担忧联邦预审会削弱美国相对于中国的竞争优势,导致国家网络总监办公室(ONCD)等部门的数月努力彻底落空。
白宫去监管政策的急转直下,呼应了顾问委员会联合主席大卫·萨克斯(David Sacks)公开表露的政策立场。针对教皇利奥十四世在 5 月 25 日发布的通谕《伟大的人性》(Magnifica Humanitas)中关于「人工智能革命威胁人类尊严」的警告,萨克斯虽赞同人工智能应服务人类尊严,但极力反对给政府兜底控制权,坚称将模型研发主导权拱手让给政府才是「真正的对齐问题」。萨克斯强调,政府控制极易演变为审查、监视与掌控公民的极权工具,并引用古罗马名言「谁来监督监督者」与「权力导致腐败,绝对权力导致绝对腐败」进行驳斥。萨克斯对前司法部长邦迪履新顾问委员会表示全力支持,标志着白宫将利用司法起诉手段阻击各州出台的冲突法案,以极端的去监管方针,保障美国在与中国的大国 AI 竞赛中维持绝对领先地位。
信源:https://x.com/DavidSacks/status/2059482315219460150
恒指季检效应持续发酵,港股「AI双雄」智谱与MiniMax联袂大涨创历史新高
5 月 27 日,港股大模型板块继续走强,被称为港股「AI双雄」的智谱(02513.HK)与 MiniMax(00100.HK)股价联袂大涨。截至收盘,智谱上涨 5.95% 报 1425.00 港元,盘中最高触及 1468.00 港元,再度创下上市以来新高,总市值达 6353.26 亿港元,全天成交额达 13.79 亿港元;MiniMax 录得 10.53% 的涨幅报 850.00 港元,盘中最高达 856.00 港元,总市值达 2665.90 亿港元,全天成交额达 27.57 亿港元。
恒生指数公司近期公布的季度检讨结果是资金流入的核心诱因。5 月 22 日收市后公布的季度检讨结果显示,智谱与 MiniMax 被正式纳入恒生科技指数,调整将于 6 月 8 日正式生效。市场分析指出,纳入指数的预期直接带动了市场关注度,并提前吸引了被动指数基金与中长线配置资金买入,提供了强劲的流动性支撑。
除了指数纳入效应,两家公司近期在技术与商业化层面的高频进展也巩固了估值底部。智谱于近期推出 GLM-5.1 高速版 API,大幅刷新了行业模型输出速度上限;MiniMax 则连续发布 M3 稀疏注意力(MSA)技术预告与 35 页的 M2 系列完整技术报告,展示了在长文本与智能体(Agent)训练系统上的核心技术增量,且模型全球调用量稳居前列。作为港股唯一的稀缺性大模型核心资产,两家公司在技术红利与资金配置的共振下,估值空间正得到进一步释放。
5 月 27 日,港股大模型板块继续走强,被称为港股「AI双雄」的智谱(02513.HK)与 MiniMax(00100.HK)股价联袂大涨。截至收盘,智谱上涨 5.95% 报 1425.00 港元,盘中最高触及 1468.00 港元,再度创下上市以来新高,总市值达 6353.26 亿港元,全天成交额达 13.79 亿港元;MiniMax 录得 10.53% 的涨幅报 850.00 港元,盘中最高达 856.00 港元,总市值达 2665.90 亿港元,全天成交额达 27.57 亿港元。
恒生指数公司近期公布的季度检讨结果是资金流入的核心诱因。5 月 22 日收市后公布的季度检讨结果显示,智谱与 MiniMax 被正式纳入恒生科技指数,调整将于 6 月 8 日正式生效。市场分析指出,纳入指数的预期直接带动了市场关注度,并提前吸引了被动指数基金与中长线配置资金买入,提供了强劲的流动性支撑。
除了指数纳入效应,两家公司近期在技术与商业化层面的高频进展也巩固了估值底部。智谱于近期推出 GLM-5.1 高速版 API,大幅刷新了行业模型输出速度上限;MiniMax 则连续发布 M3 稀疏注意力(MSA)技术预告与 35 页的 M2 系列完整技术报告,展示了在长文本与智能体(Agent)训练系统上的核心技术增量,且模型全球调用量稳居前列。作为港股唯一的稀缺性大模型核心资产,两家公司在技术红利与资金配置的共振下,估值空间正得到进一步释放。
❤1
字节跳动今年资本支出拟飚至最高700亿美元,明年筹划千亿级别底座决战
字节跳动拟将今年资本支出拉高至最高 700 亿美元以扩建 AI 基础设施。新预算较去年约 250 亿美元翻了近两倍,具体开支约 4000 亿至 5000 亿元人民币(约合 590 亿至 740 亿美元)。这笔投入将由 2025 年约 500 亿美元的利润承托。若商业环境良好,明年开支或进一步升至 1000 亿美元。
字节跳动的扩张规模远超国内同行。相比之下,国内巨头在 AI 基础设施上的投入较为克制。腾讯 2025 年资本支出为 792 亿元人民币,并承诺今年将 AI 投资翻倍至 360 亿元以上。阿里巴巴截至今年 3 月的财年资本支出为 1260 亿元,目前维持三年超 500 亿美元的滚动投资目标。字节跳动单年规划已超越国内对手数倍总和。
受制于高端芯片出口管制,本土低成本成为字节跳动的独特优势。中国数据中心建设与运营成本远低于美国,可用更低资金购入等量基础设施容量。微软、谷歌、亚马逊和 Meta 四大超大规模云厂商今年资本支出总额高达 7250 亿美元,平均每家 1810 亿美元。字节跳动正多元化补充算力,近期与高通达成数百万颗定制 ASIC 芯片采购协议,以支撑月活超 3 亿的豆包大模型及 Seedance 等底层视频与文本模型生态。
目前字节跳动正收拢业务线以聚焦 AI 研发。过去一年中,公司剥离游戏等非核心业务,集中资金主推 AI 与社交大盘。在最新一轮股权交易中,字节跳动估值约 5500 亿美元。尽管开支预算会按季度调整,且最终支出取决于计算硬件与电力供应状况,但字节跳动在大模型、商业化及底层硬件采购上的提速,展现出谋求算力与智能体主导权的决心。
信源:https://www.bloomberg.com/news/articles/2026-05-27/bytedance-weighs-capex-of-as-much-as-70-billion-in-ai-push
字节跳动拟将今年资本支出拉高至最高 700 亿美元以扩建 AI 基础设施。新预算较去年约 250 亿美元翻了近两倍,具体开支约 4000 亿至 5000 亿元人民币(约合 590 亿至 740 亿美元)。这笔投入将由 2025 年约 500 亿美元的利润承托。若商业环境良好,明年开支或进一步升至 1000 亿美元。
字节跳动的扩张规模远超国内同行。相比之下,国内巨头在 AI 基础设施上的投入较为克制。腾讯 2025 年资本支出为 792 亿元人民币,并承诺今年将 AI 投资翻倍至 360 亿元以上。阿里巴巴截至今年 3 月的财年资本支出为 1260 亿元,目前维持三年超 500 亿美元的滚动投资目标。字节跳动单年规划已超越国内对手数倍总和。
受制于高端芯片出口管制,本土低成本成为字节跳动的独特优势。中国数据中心建设与运营成本远低于美国,可用更低资金购入等量基础设施容量。微软、谷歌、亚马逊和 Meta 四大超大规模云厂商今年资本支出总额高达 7250 亿美元,平均每家 1810 亿美元。字节跳动正多元化补充算力,近期与高通达成数百万颗定制 ASIC 芯片采购协议,以支撑月活超 3 亿的豆包大模型及 Seedance 等底层视频与文本模型生态。
目前字节跳动正收拢业务线以聚焦 AI 研发。过去一年中,公司剥离游戏等非核心业务,集中资金主推 AI 与社交大盘。在最新一轮股权交易中,字节跳动估值约 5500 亿美元。尽管开支预算会按季度调整,且最终支出取决于计算硬件与电力供应状况,但字节跳动在大模型、商业化及底层硬件采购上的提速,展现出谋求算力与智能体主导权的决心。
信源:https://www.bloomberg.com/news/articles/2026-05-27/bytedance-weighs-capex-of-as-much-as-70-billion-in-ai-push
Bloomberg.com
ByteDance Weighs Capex of As Much As $70 Billion in AI Push
ByteDance Ltd., the developer of TikTok and a leading force in artificial intelligence, is considering increasing its capital spending to more than double last year’s in a bid to lead the Chinese AI market and challenge the top US players abroad.
❤1
长鑫科技科创板IPO过会,未来业绩波动风险与百亿级员工激励遭现场问询
5 月 27 日,上交所审核通过长鑫科技集团股份有限公司(简称长鑫科技)的科创板 IPO 申请。作为国内唯一具备通用型 DRAM 大规模量产能力的集成电路龙头,长鑫科技首单适用「预先审阅」机制顺利过会。但上市委现场针对未来业绩波动风险及第二期员工股权激励计划提出了核心问询。
在业绩端,招股书披露了极其剧烈的扭亏反转:公司在 2023 与 2024 年累计净亏超 282 亿元,于 2025 年扭亏,并在 2026 年第一季度因全球算力激增实现营收 508.00 亿元(同比暴增 719.13%)、归母净利润 247.62 亿元。长鑫科技预计 2026 年上半年营收将达 1100 亿至 1200 亿元。上市委现场要求长鑫科技结合全球竞争格局、产能扩建、人工智能新技术路线,说明未来业绩是否存在较大波动风险。
在股权激励端,本期员工激励计划因朱一明自愿让渡个人 50% 股份(约 7.68 亿股,市值超 200 亿元)且作出长达 20 年的股份锁定承诺,被称为 A 股史上最大规模的个人股权激励案。方案直接让渡个人持股以避免稀释公众股东权益。上市委现场要求结合实施背景、内外部决策流程,说明决策合规性及股份支付的会计处理是否符合企业会计准则。
目前长鑫科技已完成 DDR4 到 DDR5/LPDDR5X 的代际覆盖,高端芯片达 8000 MT/s 速率与单颗 24Gb 容量。本次 IPO 拟募资 295 亿元投向产线升级与前瞻研发。此外,招股书将前五大供应商以代码形式脱敏以实现供应链保密,且前五大客户销售占比已降至 39.85%。
信源:https://www.sse.com.cn/listing/renewal/ipo/index_listing_detail.shtml?auditId=2170
5 月 27 日,上交所审核通过长鑫科技集团股份有限公司(简称长鑫科技)的科创板 IPO 申请。作为国内唯一具备通用型 DRAM 大规模量产能力的集成电路龙头,长鑫科技首单适用「预先审阅」机制顺利过会。但上市委现场针对未来业绩波动风险及第二期员工股权激励计划提出了核心问询。
在业绩端,招股书披露了极其剧烈的扭亏反转:公司在 2023 与 2024 年累计净亏超 282 亿元,于 2025 年扭亏,并在 2026 年第一季度因全球算力激增实现营收 508.00 亿元(同比暴增 719.13%)、归母净利润 247.62 亿元。长鑫科技预计 2026 年上半年营收将达 1100 亿至 1200 亿元。上市委现场要求长鑫科技结合全球竞争格局、产能扩建、人工智能新技术路线,说明未来业绩是否存在较大波动风险。
在股权激励端,本期员工激励计划因朱一明自愿让渡个人 50% 股份(约 7.68 亿股,市值超 200 亿元)且作出长达 20 年的股份锁定承诺,被称为 A 股史上最大规模的个人股权激励案。方案直接让渡个人持股以避免稀释公众股东权益。上市委现场要求结合实施背景、内外部决策流程,说明决策合规性及股份支付的会计处理是否符合企业会计准则。
目前长鑫科技已完成 DDR4 到 DDR5/LPDDR5X 的代际覆盖,高端芯片达 8000 MT/s 速率与单颗 24Gb 容量。本次 IPO 拟募资 295 亿元投向产线升级与前瞻研发。此外,招股书将前五大供应商以代码形式脱敏以实现供应链保密,且前五大客户销售占比已降至 39.85%。
信源:https://www.sse.com.cn/listing/renewal/ipo/index_listing_detail.shtml?auditId=2170
平息三星式罢工情绪,台积电董事长魏哲家承诺员工分红无天花板且保底增长30%
台积电董事长兼总裁魏哲家于 5 月 27 日紧急召开全公司员工沟通会,平息基层对分红缩水的质疑。针对网络传言公司将大砍 5 月分红逾 10 %,魏哲家澄清表示,若员工绩效考核与去年一致, 2026 年全年分红预估将强劲增长超 30 %,且分配「没有天花板」,以安抚因 AI 繁荣红利不均而反弹的员工情绪。
这场劳资风波始于 5 月中旬 Dcard 与 Facebook 社群爆出的内部抱怨。员工晒出截图称,第一季度分红数额几乎与上一季持平,未能反映公司净利润同比暴增 58 % 的强劲增长,甚至传出 5 月分红将大砍 10 % 至 20 % 。由于适逢韩国三星电子半导体部门刚刚达成历史性协议,即人均分红达近 40 万美元,台积电员工开始密集讨论发起「三星式罢工」或准时上下班等抗争手段,相关抱怨经 TweakTown 等媒体报道后迅速升温。
魏哲家解释称,利润分配必须统筹兼顾员工、股东及社会责任(如 ESG 和绿色能源投资)三方利益。对于员工关切的结构性加薪,管理层表示目前暂无计划,但年度调薪会向基层倾斜,确保基层涨幅高于主管。魏哲家更在现场公开鼓励员工将分红投入购买公司股票,承诺「买台积电股票保证未来生活无忧」,分享公司长期成长的回报。
台积电已于 5 月 27 日开放分红查询系统,分红资金将于 5 月 29 日正式发放。目前公司在全球同时建设约 12 座晶圆厂以攻坚 2nm 与 1.4nm 先进制程,面临庞大的资本开支压力,这与一线倒班员工要求提高分红以分享 AI 利润的诉求构成了直接冲突。
信源:https://www.youtube.com/watch?v=hLmGAcNIq8U
台积电董事长兼总裁魏哲家于 5 月 27 日紧急召开全公司员工沟通会,平息基层对分红缩水的质疑。针对网络传言公司将大砍 5 月分红逾 10 %,魏哲家澄清表示,若员工绩效考核与去年一致, 2026 年全年分红预估将强劲增长超 30 %,且分配「没有天花板」,以安抚因 AI 繁荣红利不均而反弹的员工情绪。
这场劳资风波始于 5 月中旬 Dcard 与 Facebook 社群爆出的内部抱怨。员工晒出截图称,第一季度分红数额几乎与上一季持平,未能反映公司净利润同比暴增 58 % 的强劲增长,甚至传出 5 月分红将大砍 10 % 至 20 % 。由于适逢韩国三星电子半导体部门刚刚达成历史性协议,即人均分红达近 40 万美元,台积电员工开始密集讨论发起「三星式罢工」或准时上下班等抗争手段,相关抱怨经 TweakTown 等媒体报道后迅速升温。
魏哲家解释称,利润分配必须统筹兼顾员工、股东及社会责任(如 ESG 和绿色能源投资)三方利益。对于员工关切的结构性加薪,管理层表示目前暂无计划,但年度调薪会向基层倾斜,确保基层涨幅高于主管。魏哲家更在现场公开鼓励员工将分红投入购买公司股票,承诺「买台积电股票保证未来生活无忧」,分享公司长期成长的回报。
台积电已于 5 月 27 日开放分红查询系统,分红资金将于 5 月 29 日正式发放。目前公司在全球同时建设约 12 座晶圆厂以攻坚 2nm 与 1.4nm 先进制程,面临庞大的资本开支压力,这与一线倒班员工要求提高分红以分享 AI 利润的诉求构成了直接冲突。
信源:https://www.youtube.com/watch?v=hLmGAcNIq8U
打包SpaceX与OpenAI,封闭式基金Powerlaw今晚直接挂牌纳斯达克
封闭式基金 Powerlaw Corp.(股票代码:PWRL)将于当地时间 5 月 27 日通过直接挂牌(Direct Listing)方式在纳斯达克上市。由于基金性质为已持有资产的封闭式基金,本次挂牌不增发新股、不筹集任何新资金,而是直接将存量股份上市交易。基金核心持仓包括马斯克旗下的太空探索技术公司 SpaceX 以及人工智能公司 OpenAI,为散户提供直接配置顶级未上市科技巨头的渠道。
受 SpaceX 估值预期迈向 2 万亿美元以及 OpenAI 估值逼近 1 万亿美元等预期的推动,散户投资者对 Pre-IPO 股权的投资需求在近期急剧升温。相比于高净值的合格投资者,普通人直接投资私募市场的渠道极少,这导致 Destiny Tech100、Robinhood Ventures Fund I 以及 Fundrise Innovation Fund LLC 等上市基金的交易价格长期远超净资产价值。由旧金山风投机构 Akkadian Ventures 关联公司运营的 Powerlaw 旗下持仓包含 18 家私募公司。截至 5 月 13 日,基金净资产总额为 6.041 亿美元,折合每股 13.97 美元。基金最大的两笔持仓为 SpaceX(估值约 1.17 亿美元,增值至初始成本的两倍以上)和 OpenAI(估值约 4690 万美元)。
根据上市招股文件,Powerlaw 发行总股本为 4324 万股。由于是存量股直接上市,首日交易仅释放现有股东手中约 20% 的自由流通股,其余股份将在未来 6 个月内逐步解禁。基金采取积极的主动管理策略,计划适时变现成熟项目并循环投入高成长持仓,目标为现有 600 多名股东实现 10 倍以上的投资回报。基金每年收取 2.5% 的管理费,且不收取任何业绩分成费。由于基金接近 80% 的投资通过特殊目的载体(SPV)持有,多层嵌套可能会引入额外费用。随着人工智能公司 Anthropic 日前警告将作废未经授权的 SPV 持股,代持通道面临合规清退风险。首席执行官迈克·丁斯代尔(Mike Dinsdale)坦言,SPV 在合适的人手里是极佳的工具,但在错误的人手里则是危险的工具。
信源:https://www.bloomberg.com/news/articles/2026-05-27/spacex-investor-powerlaw-to-debut-on-nasdaq-as-ipo-race-heats-up
封闭式基金 Powerlaw Corp.(股票代码:PWRL)将于当地时间 5 月 27 日通过直接挂牌(Direct Listing)方式在纳斯达克上市。由于基金性质为已持有资产的封闭式基金,本次挂牌不增发新股、不筹集任何新资金,而是直接将存量股份上市交易。基金核心持仓包括马斯克旗下的太空探索技术公司 SpaceX 以及人工智能公司 OpenAI,为散户提供直接配置顶级未上市科技巨头的渠道。
受 SpaceX 估值预期迈向 2 万亿美元以及 OpenAI 估值逼近 1 万亿美元等预期的推动,散户投资者对 Pre-IPO 股权的投资需求在近期急剧升温。相比于高净值的合格投资者,普通人直接投资私募市场的渠道极少,这导致 Destiny Tech100、Robinhood Ventures Fund I 以及 Fundrise Innovation Fund LLC 等上市基金的交易价格长期远超净资产价值。由旧金山风投机构 Akkadian Ventures 关联公司运营的 Powerlaw 旗下持仓包含 18 家私募公司。截至 5 月 13 日,基金净资产总额为 6.041 亿美元,折合每股 13.97 美元。基金最大的两笔持仓为 SpaceX(估值约 1.17 亿美元,增值至初始成本的两倍以上)和 OpenAI(估值约 4690 万美元)。
根据上市招股文件,Powerlaw 发行总股本为 4324 万股。由于是存量股直接上市,首日交易仅释放现有股东手中约 20% 的自由流通股,其余股份将在未来 6 个月内逐步解禁。基金采取积极的主动管理策略,计划适时变现成熟项目并循环投入高成长持仓,目标为现有 600 多名股东实现 10 倍以上的投资回报。基金每年收取 2.5% 的管理费,且不收取任何业绩分成费。由于基金接近 80% 的投资通过特殊目的载体(SPV)持有,多层嵌套可能会引入额外费用。随着人工智能公司 Anthropic 日前警告将作废未经授权的 SPV 持股,代持通道面临合规清退风险。首席执行官迈克·丁斯代尔(Mike Dinsdale)坦言,SPV 在合适的人手里是极佳的工具,但在错误的人手里则是危险的工具。
信源:https://www.bloomberg.com/news/articles/2026-05-27/spacex-investor-powerlaw-to-debut-on-nasdaq-as-ipo-race-heats-up
Bloomberg.com
SpaceX Investor Powerlaw Debuts on Nasdaq as IPO Race Heats Up
Powerlaw Corp., a closed-end fund that owns stakes in Elon Musk’s SpaceX and artificial intelligence firm OpenAI, traded well above the value of its underlying investments in its debut on Wednesday, capitalizing on retail investors’ clamor for exposure to…
专为端侧硬件设计,PrismML开源0.93GB图像生成模型Bonsai 4B
PrismML 开源端侧图像生成模型 Bonsai Image 4B,可在笔记本电脑与手机等本地设备上直接进行扩散推理。Bonsai Image 4B 包含 1-bit 与 Ternary(三值化)两个极简压缩版本,核心扩散 Transformer 体积仅为 0.93 GB 与 1.21 GB,在 Apple Silicon 设备上的完整部署包体积则分别为 3.42 GB 与 3.88 GB,并同步推出配套 iOS 应用 Bonsai Studio 实现端侧离线图像生成。
其中,1-bit 版本专门应对低内存硬件,将基于 7.75 GB FLUX.2 Klein 4B 的扩散 Transformer 体积缩小至全精度版本的 8.3 倍,仅占 0.93 GB 空间。Ternary 版本的核心 Transformer 体积为 1.21 GB,相比全精度版本缩小 6.4 倍,但在量化中引入 {-1, 0, +1} 三值化权重以提供更高的表达灵活性,从而在保持低存储占用的同时,提升了画质与提示词保真度。
根据评测,Bonsai Image 4B 在大幅压缩体积后,在物体构图、人眼偏好、美学指标及复杂提示词遵循能力上,依然能够与参数量大得多的主流图像生成模型抗衡。1-bit 与 Ternary 两个版本分别保留了全精度模型 88% 和 95% 的性能。同步推出的移动端应用 Bonsai Studio 允许用户在 iPhone 上实现全离线图像生成,运行过程完全在本地完成,无需订阅且不向云端发送 API 请求。PrismML 现已将 1-bit 与 Ternary 两个版本的模型以 Apache 2.0 开源协议对外发布。
信源:https://prismml.com/news/bonsai-image-4b
PrismML 开源端侧图像生成模型 Bonsai Image 4B,可在笔记本电脑与手机等本地设备上直接进行扩散推理。Bonsai Image 4B 包含 1-bit 与 Ternary(三值化)两个极简压缩版本,核心扩散 Transformer 体积仅为 0.93 GB 与 1.21 GB,在 Apple Silicon 设备上的完整部署包体积则分别为 3.42 GB 与 3.88 GB,并同步推出配套 iOS 应用 Bonsai Studio 实现端侧离线图像生成。
其中,1-bit 版本专门应对低内存硬件,将基于 7.75 GB FLUX.2 Klein 4B 的扩散 Transformer 体积缩小至全精度版本的 8.3 倍,仅占 0.93 GB 空间。Ternary 版本的核心 Transformer 体积为 1.21 GB,相比全精度版本缩小 6.4 倍,但在量化中引入 {-1, 0, +1} 三值化权重以提供更高的表达灵活性,从而在保持低存储占用的同时,提升了画质与提示词保真度。
根据评测,Bonsai Image 4B 在大幅压缩体积后,在物体构图、人眼偏好、美学指标及复杂提示词遵循能力上,依然能够与参数量大得多的主流图像生成模型抗衡。1-bit 与 Ternary 两个版本分别保留了全精度模型 88% 和 95% 的性能。同步推出的移动端应用 Bonsai Studio 允许用户在 iPhone 上实现全离线图像生成,运行过程完全在本地完成,无需订阅且不向云端发送 API 请求。PrismML 现已将 1-bit 与 Ternary 两个版本的模型以 Apache 2.0 开源协议对外发布。
信源:https://prismml.com/news/bonsai-image-4b
年化营收猛增至6亿美元,AI推理服务商Baseten拟以110亿美元估值融资10亿美元
人工智能推理服务商 Baseten 正与投资者接洽,计划以 110 亿美元的投后估值融资 10 亿美元。本次融资计划较公司三个月前公布的 50 亿美元估值翻了一倍多,呼应了开源 AI 生态对底层算力租赁的强劲需求。
截至 2026 年第一季度末,Baseten 的年化营收从季度初的 2 亿美元猛增至约 6 亿美元,达到 2025 年 3 月同期水平的 20 倍。高速增长甚至吸引了部分投资人给出接近 150 亿美元的非正式报价。在推理服务商赛道中,竞争对手 Modal 近期以 46.5 亿美元估值融资,年化营收为 3 亿美元。Together AI 则在 2026 年 spring 季以 75 亿美元估值融资,年化营收已突破 10 亿美元。
Baseten 成立于 2019 年,主要面向开发者出租英伟达 AI 服务器,提供开源大模型的微调、定制与推理运行服务。公司在 2025 年 12 月收购了帮助企业定制开源模型的初创公司 Parsed,进一步拓宽了企业级市场。Baseten 采用按需付费的模式,根据客户调用 API 消耗的 token 数量或租用芯片的时间计费。此前,公司已从英伟达、CapitalG、IVP 与 Spark Capital 等投资者处筹集了 5.85 亿美元资金。
尽管营收增长迅猛,推理服务商仍面临毛利率被挤压的风险。由于 OpenAI 和 Anthropic 等头部开发商对算力的庞大需求拉高了 GPU 现货价格,加上芯片供应紧张,被迫从大云厂商租用 GPU 再转租给开发者的 Baseten 可能会遭遇利润空间缩水。此外,多数大型成熟企业依然倾向于直接使用 OpenAI 或 Anthropic 的闭源大模型,这在一定程度上限制了开源推理市场的成长空间。
信源:https://www.theinformation.com/articles/ai-inference-provider-baseten-talks-raise-1-billion-11-billion-valuation
人工智能推理服务商 Baseten 正与投资者接洽,计划以 110 亿美元的投后估值融资 10 亿美元。本次融资计划较公司三个月前公布的 50 亿美元估值翻了一倍多,呼应了开源 AI 生态对底层算力租赁的强劲需求。
截至 2026 年第一季度末,Baseten 的年化营收从季度初的 2 亿美元猛增至约 6 亿美元,达到 2025 年 3 月同期水平的 20 倍。高速增长甚至吸引了部分投资人给出接近 150 亿美元的非正式报价。在推理服务商赛道中,竞争对手 Modal 近期以 46.5 亿美元估值融资,年化营收为 3 亿美元。Together AI 则在 2026 年 spring 季以 75 亿美元估值融资,年化营收已突破 10 亿美元。
Baseten 成立于 2019 年,主要面向开发者出租英伟达 AI 服务器,提供开源大模型的微调、定制与推理运行服务。公司在 2025 年 12 月收购了帮助企业定制开源模型的初创公司 Parsed,进一步拓宽了企业级市场。Baseten 采用按需付费的模式,根据客户调用 API 消耗的 token 数量或租用芯片的时间计费。此前,公司已从英伟达、CapitalG、IVP 与 Spark Capital 等投资者处筹集了 5.85 亿美元资金。
尽管营收增长迅猛,推理服务商仍面临毛利率被挤压的风险。由于 OpenAI 和 Anthropic 等头部开发商对算力的庞大需求拉高了 GPU 现货价格,加上芯片供应紧张,被迫从大云厂商租用 GPU 再转租给开发者的 Baseten 可能会遭遇利润空间缩水。此外,多数大型成熟企业依然倾向于直接使用 OpenAI 或 Anthropic 的闭源大模型,这在一定程度上限制了开源推理市场的成长空间。
信源:https://www.theinformation.com/articles/ai-inference-provider-baseten-talks-raise-1-billion-11-billion-valuation
The Information
AI Inference Provider Baseten in Talks to Raise $1 Billion at $11 Billion Valuation
AI startup Baseten has recently been in talks with investors to raise $1 billion at an $11 billion valuation including the money, according to a person with knowledge of the fundraise. That would more than double the company’s $5 billion valuation from its…
AI推理服务商Fireworks AI拟以150亿美元估值进行新一轮融资
主打 AI 模型推理加速服务的初创公司 Fireworks AI 正与投资者接洽,计划以 150 亿美元的投后估值进行新一轮融资。本轮融资预计将由曾投资过公司的风投机构 Index Ventures 领投。
Fireworks AI 成立于 2022 年,由前 Meta 工程师团队联合创立,联合创始人兼首席技术官为 Dmytro Dzhulgakov。公司专注于 AI 推理加速,即运行已完成训练的 AI 模型,算力租赁与推理 API 调用市场在当前生成式 AI 繁荣期极受投资者追捧。
在去年 10 月,公司刚完成 2.5 亿美元的融资,当时投后估值为 40 亿美元,由 Lightspeed Venture Partners、Index Ventures 以及 Evantic 联合领投。目前,知名 AI 辅助编程工具 Cursor 也是 Fireworks AI 的核心客户。
在模型推理加速赛道中,Fireworks AI 核心竞争对手的估值在近期同样快速推高。Baseten 正与投资者接洽,计划以 110 亿美元的投后估值融资 10 亿美元。
信源:https://www.bloomberg.com/news/articles/2026-05-27/fireworks-ai-in-talks-for-funding-at-15-billion-valuation
主打 AI 模型推理加速服务的初创公司 Fireworks AI 正与投资者接洽,计划以 150 亿美元的投后估值进行新一轮融资。本轮融资预计将由曾投资过公司的风投机构 Index Ventures 领投。
Fireworks AI 成立于 2022 年,由前 Meta 工程师团队联合创立,联合创始人兼首席技术官为 Dmytro Dzhulgakov。公司专注于 AI 推理加速,即运行已完成训练的 AI 模型,算力租赁与推理 API 调用市场在当前生成式 AI 繁荣期极受投资者追捧。
在去年 10 月,公司刚完成 2.5 亿美元的融资,当时投后估值为 40 亿美元,由 Lightspeed Venture Partners、Index Ventures 以及 Evantic 联合领投。目前,知名 AI 辅助编程工具 Cursor 也是 Fireworks AI 的核心客户。
在模型推理加速赛道中,Fireworks AI 核心竞争对手的估值在近期同样快速推高。Baseten 正与投资者接洽,计划以 110 亿美元的投后估值融资 10 亿美元。
信源:https://www.bloomberg.com/news/articles/2026-05-27/fireworks-ai-in-talks-for-funding-at-15-billion-valuation
Bloomberg.com
Fireworks AI in Talks for Funding at $15 Billion Valuation
Fireworks AI, a startup that helps companies run artificial intelligence models, is in talks to raise a new round of funding that would value the company at $15 billion, according to people familiar with the matter.
超级智能备战时间所剩无几,OpenAI安全政策主管与前幕僚长相继加盟基金会
OpenAI 前沿 AI 安全政策主管 Yo Shavit 宣布离职,全职转入非营利母体 OpenAI 基金会,加盟由联合创始人 Wojciech Zaremba 挂帅的「AI 韧性」项目。在 Shavit 宣布加盟的一周前,OpenAI 前 CTO 幕僚长 Bianca Martin 已率先宣布全职转入基金会。Shavit 离职时表达了极高的急迫感,直言在超级智能到来之前有大量备战工作,但所剩时间无几,呼吁更多安全人才立刻转向协助。
相继加盟基金会的两位核心高管,在 OpenAI 商业实体中长期主导安全与治理业务。Shavit 曾任前沿 AI 安全政策主管,而 Martin 则曾出任前 CTO 幕僚长并在 AGI 准备度团队专攻新兴技术风险。作为 2019 年加入公司的资深员工,Martin 曾主导编写了首份部署战术手册,并协助推出了伴随 GPT-3 的研究员访问计划,为 OpenAI 后续的红队测试工作奠定了基底。随着安全团队的持续流失与洗牌,拥有雄厚资金的非营利母体正成为承接安全研究的新主场。
信源:https://x.com/yonashav/status/2059352141395882409
OpenAI 前沿 AI 安全政策主管 Yo Shavit 宣布离职,全职转入非营利母体 OpenAI 基金会,加盟由联合创始人 Wojciech Zaremba 挂帅的「AI 韧性」项目。在 Shavit 宣布加盟的一周前,OpenAI 前 CTO 幕僚长 Bianca Martin 已率先宣布全职转入基金会。Shavit 离职时表达了极高的急迫感,直言在超级智能到来之前有大量备战工作,但所剩时间无几,呼吁更多安全人才立刻转向协助。
相继加盟基金会的两位核心高管,在 OpenAI 商业实体中长期主导安全与治理业务。Shavit 曾任前沿 AI 安全政策主管,而 Martin 则曾出任前 CTO 幕僚长并在 AGI 准备度团队专攻新兴技术风险。作为 2019 年加入公司的资深员工,Martin 曾主导编写了首份部署战术手册,并协助推出了伴随 GPT-3 的研究员访问计划,为 OpenAI 后续的红队测试工作奠定了基底。随着安全团队的持续流失与洗牌,拥有雄厚资金的非营利母体正成为承接安全研究的新主场。
信源:https://x.com/yonashav/status/2059352141395882409
参考代码量达SWE-Bench五倍,Datacurve开源智能体基准DeepSWE
AI 基础设施初创公司 Datacurve 宣布开源编程智能体基准测试 DeepSWE,针对超长、复杂的真实软件工程任务,评估前沿大模型的自主编程能力。
相较于主流基准 SWE-Bench Pro,DeepSWE 专注于长程轨迹规划与复杂代码库编辑。基准首批包含 113 个涵盖 TypeScript、Go、Python、JavaScript 和 Rust 五种编程语言的真实开发任务。在 DeepSWE 测试中,模型所需的参考解答平均达到 668 行代码,横跨 7 个不同文件,代码规模与文件复杂性达到了 SWE-Bench Pro 的 5.5 倍。为了真实模拟人类开发者的日常委托体验,智能体接收到的提示指令平均仅有 2158 个字符,要求智能体依靠极简指令自主完成深度推理与代码库遍历。
为了解决公共数据集普遍面临的预训练基准污染与模型记忆通病,DeepSWE 全盘采用重新编写的原创任务。在评测过程中,DeepSWE 剥离了各家模型专属的脚手架工具,统一采用开源框架 mini-swe-agent 运行所有模型测试,以确保测试结果客观反映底层能力。同时,基准摒弃了依赖内部细节的传统自动化打分器,改用手工编写的行为验证器测试最终代码的可观测表现,从而提供高保真评测精度。
在首批前沿模型的评测中,各家大模型的能力表现拉开了显著代差。OpenAI 旗舰模型 gpt-5.5 展现出优势,以 70% 的解决率稳居首位,gpt-5.4 则以 56% 位列第二。Anthropic 旗下的 claude-opus-4.7 紧随其后,取得 54% 的成绩,而轻量级命令行工具配备的 claude-sonnet-4.6 仅为 32%。谷歌 gemini-3.5-flash 取得 28% 的解决率,击败了 24% 解决率的 gpt-5.4-mini 与 kimi-k2.6。国产模型 mimo-v2.5-pro 取得 19% 解决率,glm-5.1 取得 18%。追求极致性价比的 deepseek-v4-pro 在长程工程测试中遭遇性能瓶颈,仅取得 8% 的解决率,暴露出在多步骤、大文件编辑场景下的长程规划与自我修正短板。
信源:https://deepswe.datacurve.ai/blog
AI 基础设施初创公司 Datacurve 宣布开源编程智能体基准测试 DeepSWE,针对超长、复杂的真实软件工程任务,评估前沿大模型的自主编程能力。
相较于主流基准 SWE-Bench Pro,DeepSWE 专注于长程轨迹规划与复杂代码库编辑。基准首批包含 113 个涵盖 TypeScript、Go、Python、JavaScript 和 Rust 五种编程语言的真实开发任务。在 DeepSWE 测试中,模型所需的参考解答平均达到 668 行代码,横跨 7 个不同文件,代码规模与文件复杂性达到了 SWE-Bench Pro 的 5.5 倍。为了真实模拟人类开发者的日常委托体验,智能体接收到的提示指令平均仅有 2158 个字符,要求智能体依靠极简指令自主完成深度推理与代码库遍历。
为了解决公共数据集普遍面临的预训练基准污染与模型记忆通病,DeepSWE 全盘采用重新编写的原创任务。在评测过程中,DeepSWE 剥离了各家模型专属的脚手架工具,统一采用开源框架 mini-swe-agent 运行所有模型测试,以确保测试结果客观反映底层能力。同时,基准摒弃了依赖内部细节的传统自动化打分器,改用手工编写的行为验证器测试最终代码的可观测表现,从而提供高保真评测精度。
在首批前沿模型的评测中,各家大模型的能力表现拉开了显著代差。OpenAI 旗舰模型 gpt-5.5 展现出优势,以 70% 的解决率稳居首位,gpt-5.4 则以 56% 位列第二。Anthropic 旗下的 claude-opus-4.7 紧随其后,取得 54% 的成绩,而轻量级命令行工具配备的 claude-sonnet-4.6 仅为 32%。谷歌 gemini-3.5-flash 取得 28% 的解决率,击败了 24% 解决率的 gpt-5.4-mini 与 kimi-k2.6。国产模型 mimo-v2.5-pro 取得 19% 解决率,glm-5.1 取得 18%。追求极致性价比的 deepseek-v4-pro 在长程工程测试中遭遇性能瓶颈,仅取得 8% 的解决率,暴露出在多步骤、大文件编辑场景下的长程规划与自我修正短板。
信源:https://deepswe.datacurve.ai/blog
DeepSWE
DeepSWE measures frontier coding agents on original, long-horizon software engineering tasks.
引入AlphaGo搜索,全新MCTS视频生成框架能生成更长、更一致的视频
xAI 前世界模型负责人 Ethan He 联合英伟达 (NVIDIA) 资深研究员 Linnan Wang、 Ashwath Aithal 以及前英伟达 (NVIDIA) 深度学习实习生 Ritvik Bale,在 ICLR 2026 提交的论文中提出了一种名为 Planning at Inference 的全新推理时缩放 (Test-Time Scaling) 框架,首次将蒙特卡洛树搜索 (MCTS) 作为即插即用的模块化框架引入长视频生成。这套框架将长视频生成任务建模为顺序决策问题,系统在推理阶段引入 MCTS,利用前瞻性回溯 (look-ahead rollouts) 和反向传播奖励评估多种视频延续片段,有效缓解了传统分块或单次生成中普遍面临的语义漂移与误差累积问题。
为了在连续的视频生成空间中实现高效探索,研究团队特别设计了 Multi-Tree MCTS (多树蒙特卡洛树搜索) 变体。相较于在固定算力预算下采用单一搜索树的传统方法,多树架构能够在搜索树超过预设大小后自动开启新树以扩大搜索空间,降低对糟糕初始化状态的敏感性,显著提升探索效率。更重要的是, Planning at Inference 具有极高的模块化特征,属于完全即插即用的推理时优化方案。开发人员无需对底层大模型进行任何重新训练或微调,即可将这套方案直接部署于现有的视频生成底座。
在以英伟达开源视频预测模型 Cosmos-Predict2 为底座的实验中, Planning at Inference 展现出强大的生成表现。在长视频生成评测中,这套方案成功生成了超过 20 秒的高质量连贯视频。测试数据表明,在物体持久性、时间连贯性以及文本-视频对齐度等核心指标上, MCTS 搜索生成质量相比贪婪搜索 (Greedy Search) 、束搜索 (Beam Search) 和 Best-of-N 等传统基线方法实现了大幅提升。相比当前行业领先的闭源大模型,这套方法生成的视频在时长上分别比 Sora 长 18% 和比 Kling 长 47% ,同时在画面精细度与视觉保真度上与两者保持相当。
尽管搜索机制带来了极其优异的画面连贯性,但在推理阶段引入多树搜索也带来了高昂的算力开销。研究人员坦言,当前的 Planning at Inference 框架在生成速度上明显慢于传统的自回归直接生成,这在一定程度上限制了实时部署的可能。然而,随着底层视频生成底座的效率演进与计算硬件算力的不断增长,以计算成本换取画面质量的推理时缩放路线,有望在大模型基础能力突破特定门槛后,成为长视频生成走向工程实用的关键技术路径。
信源:https://openreview.net/forum?id=ilir6A52vh
xAI 前世界模型负责人 Ethan He 联合英伟达 (NVIDIA) 资深研究员 Linnan Wang、 Ashwath Aithal 以及前英伟达 (NVIDIA) 深度学习实习生 Ritvik Bale,在 ICLR 2026 提交的论文中提出了一种名为 Planning at Inference 的全新推理时缩放 (Test-Time Scaling) 框架,首次将蒙特卡洛树搜索 (MCTS) 作为即插即用的模块化框架引入长视频生成。这套框架将长视频生成任务建模为顺序决策问题,系统在推理阶段引入 MCTS,利用前瞻性回溯 (look-ahead rollouts) 和反向传播奖励评估多种视频延续片段,有效缓解了传统分块或单次生成中普遍面临的语义漂移与误差累积问题。
为了在连续的视频生成空间中实现高效探索,研究团队特别设计了 Multi-Tree MCTS (多树蒙特卡洛树搜索) 变体。相较于在固定算力预算下采用单一搜索树的传统方法,多树架构能够在搜索树超过预设大小后自动开启新树以扩大搜索空间,降低对糟糕初始化状态的敏感性,显著提升探索效率。更重要的是, Planning at Inference 具有极高的模块化特征,属于完全即插即用的推理时优化方案。开发人员无需对底层大模型进行任何重新训练或微调,即可将这套方案直接部署于现有的视频生成底座。
在以英伟达开源视频预测模型 Cosmos-Predict2 为底座的实验中, Planning at Inference 展现出强大的生成表现。在长视频生成评测中,这套方案成功生成了超过 20 秒的高质量连贯视频。测试数据表明,在物体持久性、时间连贯性以及文本-视频对齐度等核心指标上, MCTS 搜索生成质量相比贪婪搜索 (Greedy Search) 、束搜索 (Beam Search) 和 Best-of-N 等传统基线方法实现了大幅提升。相比当前行业领先的闭源大模型,这套方法生成的视频在时长上分别比 Sora 长 18% 和比 Kling 长 47% ,同时在画面精细度与视觉保真度上与两者保持相当。
尽管搜索机制带来了极其优异的画面连贯性,但在推理阶段引入多树搜索也带来了高昂的算力开销。研究人员坦言,当前的 Planning at Inference 框架在生成速度上明显慢于传统的自回归直接生成,这在一定程度上限制了实时部署的可能。然而,随着底层视频生成底座的效率演进与计算硬件算力的不断增长,以计算成本换取画面质量的推理时缩放路线,有望在大模型基础能力突破特定门槛后,成为长视频生成走向工程实用的关键技术路径。
信源:https://openreview.net/forum?id=ilir6A52vh
openreview.net
Planning at Inference: MCTS Test-Time Scaling for Long Video...
Generating long videos with consistent content and visual quality remains a ma-
jor challenge, as existing one-shot and chunked methods often suffer from se-
mantic drift and compounding artifacts....
jor challenge, as existing one-shot and chunked methods often suffer from se-
mantic drift and compounding artifacts....
❤1
比cuML最高提速208倍,加州大学伯克利分校等开源经典ML加速库FlashLib
加州大学伯克利分校联合麻省理工学院、加州大学欧文分校与德克萨斯大学奥斯汀分校等发布 GPU 经典 ML 算子库 FlashLib ,覆盖 15 个高层算子,旨在为机器学习工作流与智能体场景提供高性能加速。基于 Triton 与 CuteDSL , FlashLib 在 H200 GPU 上针对 KMeans 、 KNN 等算子,较英伟达 cuML 25.10 实现最高 208 倍的峰值提速。
在 H200 GPU 测试中, Flash-KMeans 效率达到峰值 FLOPs 的 61% , Flash-KNN 则达到 HBM 显存带宽的 85.2% 。相比英伟达 cuML 25.10 , FlashLib 在 KMeans 聚类中提速 26 倍,在 KNN 检索中提速 19 倍,在 HDBSCAN 聚类中提速 40 倍。而在 TruncatedSVD 分解中,在特定计算容差与算法取舍下实现了高达 208 倍的峰值加速。同时对 PCA 主成分分析、 exact t-SNE 及 MultinomialNB 等算子,提速也分别达 47 倍、 147 倍与 49 倍。
随着 AI 步入智能体( Agent )时代,经典 ML 算子已从离线批处理转为在线实时原语。在科学计算智能体等长链推理中,模型需频繁调用聚类、检索及降维算子,使传统离线算子成为系统延迟瓶颈。 FlashLib 特别引入了性能预测 API ,在不触发 GPU 评测的条件下,仅用约 5 微秒的 CPU 耗时即可精准估算出工作流的运行时长与显存开销,为任务规划与智能体决策提供了低成本分析支持。目前, FlashLib 已在 GitHub 开源。
信源:https://flashml-org.github.io/index.html
加州大学伯克利分校联合麻省理工学院、加州大学欧文分校与德克萨斯大学奥斯汀分校等发布 GPU 经典 ML 算子库 FlashLib ,覆盖 15 个高层算子,旨在为机器学习工作流与智能体场景提供高性能加速。基于 Triton 与 CuteDSL , FlashLib 在 H200 GPU 上针对 KMeans 、 KNN 等算子,较英伟达 cuML 25.10 实现最高 208 倍的峰值提速。
在 H200 GPU 测试中, Flash-KMeans 效率达到峰值 FLOPs 的 61% , Flash-KNN 则达到 HBM 显存带宽的 85.2% 。相比英伟达 cuML 25.10 , FlashLib 在 KMeans 聚类中提速 26 倍,在 KNN 检索中提速 19 倍,在 HDBSCAN 聚类中提速 40 倍。而在 TruncatedSVD 分解中,在特定计算容差与算法取舍下实现了高达 208 倍的峰值加速。同时对 PCA 主成分分析、 exact t-SNE 及 MultinomialNB 等算子,提速也分别达 47 倍、 147 倍与 49 倍。
随着 AI 步入智能体( Agent )时代,经典 ML 算子已从离线批处理转为在线实时原语。在科学计算智能体等长链推理中,模型需频繁调用聚类、检索及降维算子,使传统离线算子成为系统延迟瓶颈。 FlashLib 特别引入了性能预测 API ,在不触发 GPU 评测的条件下,仅用约 5 微秒的 CPU 耗时即可精准估算出工作流的运行时长与显存开销,为任务规划与智能体决策提供了低成本分析支持。目前, FlashLib 已在 GitHub 开源。
信源:https://flashml-org.github.io/index.html
flashml-org.github.io
FlashLib: Bringing Flash Magic to Classical Machine Learning Operators
FlashLib is a GPU library for classical machine learning operators on modern hardware, rebuilt for today's ML workloads and emerging agentic AI systems.
支持表情点赞直接审批与音频打断,OpenClaw发布v2026.5.26
开源 AI 助手项目 OpenClaw 发布了 v2026.5.26 版本,在移动端审批流与音频交互上迎来重要更新。新版本在 Signal 、 iMessage 与 WhatsApp 渠道中推出了表情点赞审批支持。用户收到敏感操作审批时,只需对消息做出大拇指点赞表情即可直接授权,告别了输入
为了精简底层依赖并优化网关性能,新版本引入了自主图像处理库 Rastermill ,彻底替换了体积臃肿的 Sharp 引擎与 Jimp 兜底库,免去了开发者额外安装原生图像库的步骤。网关在启动阶段通过跳过插件与会话系统扫描,大幅提升了启动速度。在安全防御上,浏览器快照读取接口引入了服务器端请求伪造( SSRF )过滤策略以严防越界嗅探,而会话排队机制也会自动清洗带有提示词样式的恶意文本,阻止插件标签伪造内部指令。新版还推出了临时活动监视面板( Activity Tab ),允许开发者实时查看工具链调用,且不持久化敏感日志。
信源:https://github.com/openclaw/openclaw/releases/tag/v2026.5.26
开源 AI 助手项目 OpenClaw 发布了 v2026.5.26 版本,在移动端审批流与音频交互上迎来重要更新。新版本在 Signal 、 iMessage 与 WhatsApp 渠道中推出了表情点赞审批支持。用户收到敏感操作审批时,只需对消息做出大拇指点赞表情即可直接授权,告别了输入
/approve 的繁杂操作。在音频交互上,新版在谷歌会议与 Discord 语音中内置了本地音频插话检测,当智能体检测到用户在设备端开口时会自动暂停播放。同时, Talk 实时语音会话支持从 Web 界面或 Discord 直接干预、转向与取消。为了精简底层依赖并优化网关性能,新版本引入了自主图像处理库 Rastermill ,彻底替换了体积臃肿的 Sharp 引擎与 Jimp 兜底库,免去了开发者额外安装原生图像库的步骤。网关在启动阶段通过跳过插件与会话系统扫描,大幅提升了启动速度。在安全防御上,浏览器快照读取接口引入了服务器端请求伪造( SSRF )过滤策略以严防越界嗅探,而会话排队机制也会自动清洗带有提示词样式的恶意文本,阻止插件标签伪造内部指令。新版还推出了临时活动监视面板( Activity Tab ),允许开发者实时查看工具链调用,且不持久化敏感日志。
信源:https://github.com/openclaw/openclaw/releases/tag/v2026.5.26
Altman与Brockman持股Cerebras遭质疑,60余家团体要求加州查OpenAI自我交易
美国 60 余家民间和倡议团体组成的 EyesOnOpenAI 联盟向加利福尼亚州总检察长 罗布·邦塔 (Rob Bonta) 递交联名信,要求对 OpenAI 及其高管被指「自我交易」和利益冲突的关联采购展开调查。联名信指出,包括 CEO 萨姆·奥特曼 (Sam Altman) 、总裁 格雷格·布罗克曼 (Greg Brockman) 、董事 亚当·德安吉洛 (Adam D'Angelo) 及前联合创始人 伊利亚·苏茨克维尔 (Ilya Sutskever) 在内的多位高层,在个人持有半导体初创公司 Cerebras Systems 股权的同时,推动 OpenAI 与 Cerebras 签署了高达数十亿美元的采购协议。 OpenAI 发言人回应表示,相关利益在交易批准前,已通过公司内部的冲突审查流程进行了合规披露与审查。
关联交易指控的直接线索源自埃隆·马斯克 (Elon Musk) 起诉 OpenAI 诉讼案中披露的证词。宣誓证词显示,布罗克曼在积极游说 OpenAI 与 Cerebras 展开业务往来的同时,向马斯克隐瞒了个人在 Cerebras 的持股情况。EyesOnOpenAI 联盟在递交给检察长的信中指控,高管暗中持股并主导巨额交易的行为,可能触犯了加州慈善信托法,特别是针对非营利组织受托人自我交易行为的加州《公司法》第 5233 条。联盟要求检察长强制 OpenAI 提交与 Cerebras 采购合同的完整文件,并全面审计 OpenAI 内部是否履行了利益冲突披露和审批程序。
Cerebras 估值在首次公开募股 (IPO) 前后快速抬升,让采购合同背后的利益输送质疑引起了外界高度关注。依靠来自 OpenAI 等客户的采购订单预期,Cerebras 于 2026 年 5 月 13 日定价完成了 IPO ,每股发行价 185 美元,融资额达 55.5 亿美元,对应完全摊薄估值为 564.3 亿美元。 5 月 14 日交易首日,Cerebras 的开盘价飙升至 350 美元,对应完全摊薄估值达到了 1067.5 亿美元。民间联盟认为,OpenAI 核心管理层通过调动非营利母体控制的采购资金,客观上抬高了个人投资企业的估值,引发了将公共慈善资产转化为私人财富的合规争议。
信源:https://www.sacbee.com/news/politics-government/capitol-alert/article315863564.html
美国 60 余家民间和倡议团体组成的 EyesOnOpenAI 联盟向加利福尼亚州总检察长 罗布·邦塔 (Rob Bonta) 递交联名信,要求对 OpenAI 及其高管被指「自我交易」和利益冲突的关联采购展开调查。联名信指出,包括 CEO 萨姆·奥特曼 (Sam Altman) 、总裁 格雷格·布罗克曼 (Greg Brockman) 、董事 亚当·德安吉洛 (Adam D'Angelo) 及前联合创始人 伊利亚·苏茨克维尔 (Ilya Sutskever) 在内的多位高层,在个人持有半导体初创公司 Cerebras Systems 股权的同时,推动 OpenAI 与 Cerebras 签署了高达数十亿美元的采购协议。 OpenAI 发言人回应表示,相关利益在交易批准前,已通过公司内部的冲突审查流程进行了合规披露与审查。
关联交易指控的直接线索源自埃隆·马斯克 (Elon Musk) 起诉 OpenAI 诉讼案中披露的证词。宣誓证词显示,布罗克曼在积极游说 OpenAI 与 Cerebras 展开业务往来的同时,向马斯克隐瞒了个人在 Cerebras 的持股情况。EyesOnOpenAI 联盟在递交给检察长的信中指控,高管暗中持股并主导巨额交易的行为,可能触犯了加州慈善信托法,特别是针对非营利组织受托人自我交易行为的加州《公司法》第 5233 条。联盟要求检察长强制 OpenAI 提交与 Cerebras 采购合同的完整文件,并全面审计 OpenAI 内部是否履行了利益冲突披露和审批程序。
Cerebras 估值在首次公开募股 (IPO) 前后快速抬升,让采购合同背后的利益输送质疑引起了外界高度关注。依靠来自 OpenAI 等客户的采购订单预期,Cerebras 于 2026 年 5 月 13 日定价完成了 IPO ,每股发行价 185 美元,融资额达 55.5 亿美元,对应完全摊薄估值为 564.3 亿美元。 5 月 14 日交易首日,Cerebras 的开盘价飙升至 350 美元,对应完全摊薄估值达到了 1067.5 亿美元。民间联盟认为,OpenAI 核心管理层通过调动非营利母体控制的采购资金,客观上抬高了个人投资企业的估值,引发了将公共慈善资产转化为私人财富的合规争议。
信源:https://www.sacbee.com/news/politics-government/capitol-alert/article315863564.html
Sacramento Bee
OpenAI skeptics ask AG Bonta to investigate execs’ ties to semiconductor company
Cerebras and OpenAI recently entered into an agreement for OpenAI to buy computing power and hardware from the semiconductor company.
低调上线淘宝并同步App,蚂蚁集团首款AI眼镜Willit以899元开售
蚂蚁集团低调推出首款自研 AI 眼镜 Willit,已正式上线淘宝开售,配套手机应用 Willit AI 亦同步上架应用市场。商品详情页与工商信息显示,Willit 的销售主体为北京蚂蚁佐罗科技有限公司,法定代表人为蚂蚁集团资深副总裁、蚂蚁数科 CEO 赵闻飙。作为蚂蚁集团进军消费级 AI 硬件领域的首次尝试,Willit 避开了高昂的硬件溢价,以 899 元的入门级价格切入市场,墨镜款目前在淘宝平台显示已售出 1000 多副。
在核心功能层面,Willit 包含墨镜款与变色款两种款式,支持拍照录像、通话音乐、实时翻译、录音转写、AI 对话及拍照识图等功能。其中,拍照识图功能集成了卡路里识别等生活化实用场景,旗舰级定位则涵盖 AI 问答、AI 个人助手以及第三方服务支持。店铺客服确认 Willit 目前暂未上线支付功能。虽然缺少直接的支付交互能力,但 Willit 展现出的语音、视觉与大模型联动能力,有利于蚂蚁集团后续抢占下一代主流交互入口,在 AI 时代的入口攻防战中占据主动权。
从资本与运营主体来看,Willit 背后有着清晰的蚂蚁集团技术与生态脉络。天眼查与公开信息显示,北京蚂蚁佐罗科技有限公司由北京领舟科技有限公司 100 % 控股,而北京领舟科技有限公司为蚂蚁集团旗下可信身份认证技术平台 ZOLOZ 的核心载体。适配眼镜的 Willit AI 应用运营商为萨思数字科技(北京)有限公司,萨思数字科技由蚂蚁数动未来(北京)科技有限公司全资控股,两家主体的法定代表人均由赵闻飙出任。赵闻飙作为蚂蚁集团资深副总裁、蚂蚁数科 CEO,亲任 Willit 运营主体的法定代表人和经理,体现出蚂蚁集团对消费级 AI 硬件入口的战略重视。
信源:https://mp.weixin.qq.com/s/j_4P1rcT6dpoguE2bX0feA
蚂蚁集团低调推出首款自研 AI 眼镜 Willit,已正式上线淘宝开售,配套手机应用 Willit AI 亦同步上架应用市场。商品详情页与工商信息显示,Willit 的销售主体为北京蚂蚁佐罗科技有限公司,法定代表人为蚂蚁集团资深副总裁、蚂蚁数科 CEO 赵闻飙。作为蚂蚁集团进军消费级 AI 硬件领域的首次尝试,Willit 避开了高昂的硬件溢价,以 899 元的入门级价格切入市场,墨镜款目前在淘宝平台显示已售出 1000 多副。
在核心功能层面,Willit 包含墨镜款与变色款两种款式,支持拍照录像、通话音乐、实时翻译、录音转写、AI 对话及拍照识图等功能。其中,拍照识图功能集成了卡路里识别等生活化实用场景,旗舰级定位则涵盖 AI 问答、AI 个人助手以及第三方服务支持。店铺客服确认 Willit 目前暂未上线支付功能。虽然缺少直接的支付交互能力,但 Willit 展现出的语音、视觉与大模型联动能力,有利于蚂蚁集团后续抢占下一代主流交互入口,在 AI 时代的入口攻防战中占据主动权。
从资本与运营主体来看,Willit 背后有着清晰的蚂蚁集团技术与生态脉络。天眼查与公开信息显示,北京蚂蚁佐罗科技有限公司由北京领舟科技有限公司 100 % 控股,而北京领舟科技有限公司为蚂蚁集团旗下可信身份认证技术平台 ZOLOZ 的核心载体。适配眼镜的 Willit AI 应用运营商为萨思数字科技(北京)有限公司,萨思数字科技由蚂蚁数动未来(北京)科技有限公司全资控股,两家主体的法定代表人均由赵闻飙出任。赵闻飙作为蚂蚁集团资深副总裁、蚂蚁数科 CEO,亲任 Willit 运营主体的法定代表人和经理,体现出蚂蚁集团对消费级 AI 硬件入口的战略重视。
信源:https://mp.weixin.qq.com/s/j_4P1rcT6dpoguE2bX0feA
罗福莉解密MiMo降本底牌:预填充注意力计算量降至10层全局GQA级别
在自研大模型 MiMo-V2.5 系列实施 API 永久性降价后,小米大模型团队负责人罗福莉在 X 平台公布了算法降本机制。
罗福莉透露,在 API 价格对齐 DeepSeek 后,小米的高负载推理引擎仍能保持盈亏平衡。成本降低主要来自混合注意力架构与层次化 KV 缓存优化。
针对缓存命中(Cache Hit)成本降低 99% 的设计目标,小米推理框架实现了针对滑动窗口注意力 SWA 的层次化 KV 缓存优化。生产测试显示,层次化优化将缓存的 token 容量提升至 5 倍,降低了 80% 的缓存成本。结合全局注意力模块之间的缓存读取重叠(Cache Read Overlap)技术,系统进一步压低了缓存命中的实际开销。
对于基础输入与输出成本削减 60% 至 80% 的原因,罗福莉归功于模型引入的 1:7 层间稀疏比,即全局注意力(GA)与滑动窗口注意力(SWA)的层数比为 1:7 。在长文本预填充(Prefill)阶段,60 层 SWA 仅计算局部滑动窗口,这使得拥有 70 层的 MiMo-V2.5-Pro 模型的整体注意力计算量,仅相当于一个 10 层的传统全局 GQA 模型。超低计算负载降低了原始推理成本,在调价前曾为小米预留了 2 至 3 倍的利润空间。因此,降价属于结构性降本的体现,而非亏本竞争。
罗福莉表示,低成本的推理服务有利于激发终端智能需求。大模型企业应当避免盲目的价格战,通过算法与推理系统的底层协同设计,将实际运行开销控制在盈亏平衡线以下。
信源:https://x.com/_LuoFuli/status/2059618247553745204
在自研大模型 MiMo-V2.5 系列实施 API 永久性降价后,小米大模型团队负责人罗福莉在 X 平台公布了算法降本机制。
罗福莉透露,在 API 价格对齐 DeepSeek 后,小米的高负载推理引擎仍能保持盈亏平衡。成本降低主要来自混合注意力架构与层次化 KV 缓存优化。
针对缓存命中(Cache Hit)成本降低 99% 的设计目标,小米推理框架实现了针对滑动窗口注意力 SWA 的层次化 KV 缓存优化。生产测试显示,层次化优化将缓存的 token 容量提升至 5 倍,降低了 80% 的缓存成本。结合全局注意力模块之间的缓存读取重叠(Cache Read Overlap)技术,系统进一步压低了缓存命中的实际开销。
对于基础输入与输出成本削减 60% 至 80% 的原因,罗福莉归功于模型引入的 1:7 层间稀疏比,即全局注意力(GA)与滑动窗口注意力(SWA)的层数比为 1:7 。在长文本预填充(Prefill)阶段,60 层 SWA 仅计算局部滑动窗口,这使得拥有 70 层的 MiMo-V2.5-Pro 模型的整体注意力计算量,仅相当于一个 10 层的传统全局 GQA 模型。超低计算负载降低了原始推理成本,在调价前曾为小米预留了 2 至 3 倍的利润空间。因此,降价属于结构性降本的体现,而非亏本竞争。
罗福莉表示,低成本的推理服务有利于激发终端智能需求。大模型企业应当避免盲目的价格战,通过算法与推理系统的底层协同设计,将实际运行开销控制在盈亏平衡线以下。
信源:https://x.com/_LuoFuli/status/2059618247553745204