披露三款智能体安全架构演进,Anthropic详解如何以沙箱与虚拟机锁死Claude
Anthropic 发布技术博客,系统公开了旗下 claude.ai 、 Claude Code 与 Claude Cowork 三款智能体产品的安全架构演进与实战漏洞。文章强调,当大模型的能力上限不断突破,传统的用户手动审批不仅会引发审批疲劳,概率性的模型层( Model Layer )拦截也始终存在漏报;要锁死数据外泄,必须以环境层( Environment Layer )的物理容器与虚拟机隔离作为第一道硬性防线。
在命令行工具 Claude Code 中,早期版本依靠开发者手动审批每一轮网络与写入指令。然而内部遥测表明,频繁弹窗引发了极高的审批疲劳,用户平均通过率高达 93 %。为了降低审批成本, Anthropic 引入了操作系统级沙箱( macOS 使用 Seatbelt , Linux 使用 bubblewrap ),默认在工作区内静默运行但彻底拦截网络,成功减少 84 % 的弹窗打扰。即便后续上线的自动模式( auto mode )使用小型分类器代劳,分类器的漏拦率也高达 17 % ,证明物理沙箱仍是安全基底。
在一次内部红队演练中,安全研究员通过钓鱼手段诱导员工在终端运行了一段普通指令,诱骗 Claude 读取本地 ~/.aws/credentials 凭证并外发。测试共进行了 25 次, Claude 在 24 次中成功实现数据外泄,胜率高达 96 %。演练结果证明,如果指令直接来自用户,模型层防御将彻底失效,只有环境层的出站流量拦截( Egress Controls )和文件控制才是底线。在前期版本迭代中, Anthropic 于 2026 年 1 月前修复了 3 处 Claude Code 启动漏洞:恶意仓库可在目录处于未受信任状态时,通过 .claude/settings.json 自动触发预设钩子( Hook );目前系统已修改为在用户确认信任后才解析本地配置。
企业通用办公产品 Claude Cowork 采取了更为极端的安全边界,将运行环境完全置于独立的 Linux 虚拟机中( macOS 平台基于 Apple Virtualization 框架, Windows 平台基于 HCS ),使宿主机的凭证与文件对虚拟机完全不可见。但第三方披露表明,由于出站白名单默认放行了 api.anthropic.com ,恶意工作区文件曾诱导 Claude 读取本地敏感数据,并通过攻击者的 API 密钥直接将文件上传至攻击者的个人账户,实现了对虚拟机出站拦截的绕过。为了彻底堵死借道官方 API 的外泄路径, Anthropic 最终在虚拟机内侧部署了防御型中间人代理( Man-in-the-middle proxy ),强制过滤所有发往官方 API 流量,只放行携带本轮虚拟机 session token 的请求,直接拒绝攻击者嵌入的外部密钥。
信源:https://www.anthropic.com/engineering/how-we-contain-claude
Anthropic 发布技术博客,系统公开了旗下 claude.ai 、 Claude Code 与 Claude Cowork 三款智能体产品的安全架构演进与实战漏洞。文章强调,当大模型的能力上限不断突破,传统的用户手动审批不仅会引发审批疲劳,概率性的模型层( Model Layer )拦截也始终存在漏报;要锁死数据外泄,必须以环境层( Environment Layer )的物理容器与虚拟机隔离作为第一道硬性防线。
在命令行工具 Claude Code 中,早期版本依靠开发者手动审批每一轮网络与写入指令。然而内部遥测表明,频繁弹窗引发了极高的审批疲劳,用户平均通过率高达 93 %。为了降低审批成本, Anthropic 引入了操作系统级沙箱( macOS 使用 Seatbelt , Linux 使用 bubblewrap ),默认在工作区内静默运行但彻底拦截网络,成功减少 84 % 的弹窗打扰。即便后续上线的自动模式( auto mode )使用小型分类器代劳,分类器的漏拦率也高达 17 % ,证明物理沙箱仍是安全基底。
在一次内部红队演练中,安全研究员通过钓鱼手段诱导员工在终端运行了一段普通指令,诱骗 Claude 读取本地 ~/.aws/credentials 凭证并外发。测试共进行了 25 次, Claude 在 24 次中成功实现数据外泄,胜率高达 96 %。演练结果证明,如果指令直接来自用户,模型层防御将彻底失效,只有环境层的出站流量拦截( Egress Controls )和文件控制才是底线。在前期版本迭代中, Anthropic 于 2026 年 1 月前修复了 3 处 Claude Code 启动漏洞:恶意仓库可在目录处于未受信任状态时,通过 .claude/settings.json 自动触发预设钩子( Hook );目前系统已修改为在用户确认信任后才解析本地配置。
企业通用办公产品 Claude Cowork 采取了更为极端的安全边界,将运行环境完全置于独立的 Linux 虚拟机中( macOS 平台基于 Apple Virtualization 框架, Windows 平台基于 HCS ),使宿主机的凭证与文件对虚拟机完全不可见。但第三方披露表明,由于出站白名单默认放行了 api.anthropic.com ,恶意工作区文件曾诱导 Claude 读取本地敏感数据,并通过攻击者的 API 密钥直接将文件上传至攻击者的个人账户,实现了对虚拟机出站拦截的绕过。为了彻底堵死借道官方 API 的外泄路径, Anthropic 最终在虚拟机内侧部署了防御型中间人代理( Man-in-the-middle proxy ),强制过滤所有发往官方 API 流量,只放行携带本轮虚拟机 session token 的请求,直接拒绝攻击者嵌入的外部密钥。
信源:https://www.anthropic.com/engineering/how-we-contain-claude
Anthropic
How we contain Claude across products
Anthropic is an AI safety and research company that's working to build reliable, interpretable, and steerable AI systems.
解密底牌:MiniMax发布M2技术报告,详述MoE底座与Agent训练系统
继预告 M3 稀疏注意力后,MiniMax 在 arXiv 提交了 M2 系列 35 页技术报告《The MiniMax-M2 Series: Mini Activations Unleashing Max Real-World Intelligence》,首次系统归档了旗舰级 MoE 架构设计、数据管线与 Agent 原生基础设施。报告详述了早期 M1 探索混合线性注意力路线后,M2 选择配合 GQA 重回全注意力路线的技术妥协,并展示了如何用 MTP、Sigmoid 路由和 Forge 在推理与训练两端补成本短板,同时首次披露了超长上下文 Agent RL 训练系统 Forge 与 M2.7 的自进化机制。
报告详细公开了应对全注意力架构在极限长文本下开销的技术补偿方案。为了在 192k 原生上下文下降低推理时延,MTP 模块在预训练阶段预测未来 1 个 token,并在微调阶段通过权重复制扩展为并行预测 3 个 token,在推理时直接作为投机解码草稿,无需额外挂载草稿模型。在 MoE 路由端,M2 舍弃传统的 Softmax,改用带有可学习偏差的 Sigmoid 门控评估专家路由,消除了传统 MoE 路由的零和博弈约束,平滑专家激活并平抑训练方差。全稠密 GQA 在极限长文本下的高昂开销,也成为 M3 转向分块索引稀疏注意力(MSA)的技术背景。
除了推理端,长序列强化学习训练也是 Agent 工程的核心瓶颈。报告首次公开了 MiniMax 自研 Agent 原生训练系统 Forge 的架构细节。为解决多轮对话长序列训练中吞吐量与显存的瓶颈,Forge 平台引入「窗口化先进先出调度(Windowed-FIFO Scheduling)」平抑序列长度方差导致的 Pipeline 计算阻塞,并配合「前缀树合并(Prefix Tree Merging)」将多轮 Rollout 中的共享前缀合并为前缀树计算,最高带来 40 倍的训练提速,大幅削减了长序列 Agent 强化学习的训练成本。
作为最终演进版本,M2.7 首次展示了智能体自主进化的完整工程闭环。模型可在内部基础设施上自主执行超过 100 轮「分析失败轨迹、规划修改、改 scaffold 代码、跑评测、比较结果、保留或回退」循环,使内部评测性能提升 30%。同时,报告还披露了 20T tokens 预训练数据集清洗管线以及由
信源:https://arxiv.org/abs/2605.26494
继预告 M3 稀疏注意力后,MiniMax 在 arXiv 提交了 M2 系列 35 页技术报告《The MiniMax-M2 Series: Mini Activations Unleashing Max Real-World Intelligence》,首次系统归档了旗舰级 MoE 架构设计、数据管线与 Agent 原生基础设施。报告详述了早期 M1 探索混合线性注意力路线后,M2 选择配合 GQA 重回全注意力路线的技术妥协,并展示了如何用 MTP、Sigmoid 路由和 Forge 在推理与训练两端补成本短板,同时首次披露了超长上下文 Agent RL 训练系统 Forge 与 M2.7 的自进化机制。
报告详细公开了应对全注意力架构在极限长文本下开销的技术补偿方案。为了在 192k 原生上下文下降低推理时延,MTP 模块在预训练阶段预测未来 1 个 token,并在微调阶段通过权重复制扩展为并行预测 3 个 token,在推理时直接作为投机解码草稿,无需额外挂载草稿模型。在 MoE 路由端,M2 舍弃传统的 Softmax,改用带有可学习偏差的 Sigmoid 门控评估专家路由,消除了传统 MoE 路由的零和博弈约束,平滑专家激活并平抑训练方差。全稠密 GQA 在极限长文本下的高昂开销,也成为 M3 转向分块索引稀疏注意力(MSA)的技术背景。
除了推理端,长序列强化学习训练也是 Agent 工程的核心瓶颈。报告首次公开了 MiniMax 自研 Agent 原生训练系统 Forge 的架构细节。为解决多轮对话长序列训练中吞吐量与显存的瓶颈,Forge 平台引入「窗口化先进先出调度(Windowed-FIFO Scheduling)」平抑序列长度方差导致的 Pipeline 计算阻塞,并配合「前缀树合并(Prefix Tree Merging)」将多轮 Rollout 中的共享前缀合并为前缀树计算,最高带来 40 倍的训练提速,大幅削减了长序列 Agent 强化学习的训练成本。
作为最终演进版本,M2.7 首次展示了智能体自主进化的完整工程闭环。模型可在内部基础设施上自主执行超过 100 轮「分析失败轨迹、规划修改、改 scaffold 代码、跑评测、比较结果、保留或回退」循环,使内部评测性能提升 30%。同时,报告还披露了 20T tokens 预训练数据集清洗管线以及由
8k -> 16k -> 32k -> 192k 的渐进式上下文两阶段预训练课程。得益于算法与系统的协同优化,单 token 激活 9.8B 参数的 M2.7 在软件工程智能体基准 SWE-Pro 上取得 56.22% 的得分,在 Multi-SWE-bench 上达到 52.7%,并在机器学习工程基准 MLE Bench 的测试中取得 66.6% 的平均奖牌率,表现与 Gemini-3.1 持平。信源:https://arxiv.org/abs/2605.26494
arXiv.org
The MiniMax-M2 Series: Mini Activations Unleashing Max Real-World...
We introduce the MiniMax-M2 series, a family of Mixture-of-Experts language models built around the principle that mini activations can unleash maximum real-world intelligence. The flagship M2...
DeepSeek与小米联手开创百万上下文零成本时代
继阿里 Qwen 团队为 Qwen3.7-Max 开启最高减免 80% 输入成本的隐式缓存后,小米宣布永久降价自研 MiMo-V2.5 系列 API,与 DeepSeek V4 全系列定价完全对齐。旗舰型号的输入缓存命中价格同为每百万 tokens 0.0036 美元,未命中为 0.435 美元,输出为 0.87 美元。对齐动作旨在拦截全球开发者流量,全面加速智能体 Agent 场景普及。
在 4 月 24 日发布后的一个月里,DeepSeek V4 Flash 以 7.99 万亿 tokens 的消耗量登顶 OpenRouter 月度榜首,V4 Pro 跻身前十。在 Cursor 与 Claude Code 等高频读取代码库的 Agent 编程场景下,得益于 99% 的前缀缓存率,开发者使用 Pro 模型消耗 8000 万 tokens 仅需 4 元人民币,使用 Flash 模型单日消耗 278 亿 tokens 仅需 160 美元。
作为对比,阿里 Qwen3.7-Max 的自动隐式缓存仅提供 80% 折扣,显式缓存则面临 125% 的首次创建溢价与 5 分钟的生存周期。高额创建溢价与短暂驻留,在技术上暗示了系统缓存构建与保留开销高,单位 token 计算负荷与 KV 缓存占用限制了让利空间。
小米与 DeepSeek 敢于降价,得益于底层的算法红利。在 100 万 tokens 的推理中,DeepSeek V4 依靠压缩稀疏注意力 CSA 与强压缩注意力 HCA,将推理算力 FLOPs 降至上一代的 27%,KV 缓存空间降至 10%,较传统 GQA 模型缩减超百倍。小米 MiMo-V2.5-Pro 则在 1.02T 总参数中仅激活 4.1%(42B),交错堆叠滑动窗口 SWA 与全局注意力 GA,将长上下文 KV 缓存开销降低 7 倍,配合多 token 预测 MTP 将输出吞吐量提升 3 倍。两套方案均在算法层面压榨了资源,宣告了低成本普及时代的到来。
继阿里 Qwen 团队为 Qwen3.7-Max 开启最高减免 80% 输入成本的隐式缓存后,小米宣布永久降价自研 MiMo-V2.5 系列 API,与 DeepSeek V4 全系列定价完全对齐。旗舰型号的输入缓存命中价格同为每百万 tokens 0.0036 美元,未命中为 0.435 美元,输出为 0.87 美元。对齐动作旨在拦截全球开发者流量,全面加速智能体 Agent 场景普及。
在 4 月 24 日发布后的一个月里,DeepSeek V4 Flash 以 7.99 万亿 tokens 的消耗量登顶 OpenRouter 月度榜首,V4 Pro 跻身前十。在 Cursor 与 Claude Code 等高频读取代码库的 Agent 编程场景下,得益于 99% 的前缀缓存率,开发者使用 Pro 模型消耗 8000 万 tokens 仅需 4 元人民币,使用 Flash 模型单日消耗 278 亿 tokens 仅需 160 美元。
作为对比,阿里 Qwen3.7-Max 的自动隐式缓存仅提供 80% 折扣,显式缓存则面临 125% 的首次创建溢价与 5 分钟的生存周期。高额创建溢价与短暂驻留,在技术上暗示了系统缓存构建与保留开销高,单位 token 计算负荷与 KV 缓存占用限制了让利空间。
小米与 DeepSeek 敢于降价,得益于底层的算法红利。在 100 万 tokens 的推理中,DeepSeek V4 依靠压缩稀疏注意力 CSA 与强压缩注意力 HCA,将推理算力 FLOPs 降至上一代的 27%,KV 缓存空间降至 10%,较传统 GQA 模型缩减超百倍。小米 MiMo-V2.5-Pro 则在 1.02T 总参数中仅激活 4.1%(42B),交错堆叠滑动窗口 SWA 与全局注意力 GA,将长上下文 KV 缓存开销降低 7 倍,配合多 token 预测 MTP 将输出吞吐量提升 3 倍。两套方案均在算法层面压榨了资源,宣告了低成本普及时代的到来。
❤2
修复提示词缓存回归漏洞,xAI重置Grok Build所有账户额度
xAI 宣布修复旗下终端编程智能体 Grok Build 的提示词缓存 (Prompt Caching) 回归漏洞,对所有账户的使用额度执行全额重置。
回归漏洞源于 5 月 21 日上线的一项引擎采样重构。为了支持 X 搜索与更快的网页检索,开发团队将引擎采样切换至新代码路径,但新路径未能正确调用系统用于检索提示词缓存的 HTTP 请求头 x-grok-conv-id,导致请求在执行时遭遇缓存大面积失效。
由于缓存失效,智能体在处理长提示词时无法重用已有的 KV 缓存,迫使系统重复计算全部上下文,引发了 Token 消耗加剧与首字延迟 (Time to first token) 变长。面对用户的额度异常损耗,开发团队坦承在追踪缓存命中率方面不够勤勉 (not diligent enough),且由于并发的 API 流量涌入产生不一致的缓存命中表现,干扰了最初的异常排查,导致定位漏洞的时间比以往更长。
目前,开发团队已完成漏洞修复,并部署了专门的告警监控与回归测试。
信源:https://x.com/xai/status/2059375342683636066
xAI 宣布修复旗下终端编程智能体 Grok Build 的提示词缓存 (Prompt Caching) 回归漏洞,对所有账户的使用额度执行全额重置。
回归漏洞源于 5 月 21 日上线的一项引擎采样重构。为了支持 X 搜索与更快的网页检索,开发团队将引擎采样切换至新代码路径,但新路径未能正确调用系统用于检索提示词缓存的 HTTP 请求头 x-grok-conv-id,导致请求在执行时遭遇缓存大面积失效。
由于缓存失效,智能体在处理长提示词时无法重用已有的 KV 缓存,迫使系统重复计算全部上下文,引发了 Token 消耗加剧与首字延迟 (Time to first token) 变长。面对用户的额度异常损耗,开发团队坦承在追踪缓存命中率方面不够勤勉 (not diligent enough),且由于并发的 API 流量涌入产生不一致的缓存命中表现,干扰了最初的异常排查,导致定位漏洞的时间比以往更长。
目前,开发团队已完成漏洞修复,并部署了专门的告警监控与回归测试。
信源:https://x.com/xai/status/2059375342683636066
出走半年后回归字节,分布式专家林海滨重返字节Seed团队
原字节跳动大模型训练负责人林海滨正式回归 Seed 团队,继续统筹分布式训练底座的开发。林海滨去年 12 月离职加盟 OpenAI 前首席科学家伊利亚·苏茨克沃 (Ilya Sutskever) 创立的超级智能公司 SSI (Safe Superintelligence) ,从出走到回归历时不足半年。林海滨作为卡内基梅隆大学 (CMU) 硕士、师从著名数据库专家安迪·帕夫洛 (Andy Pavlo) 教授的 AI 专家,曾主导开源了强化学习训练框架 veRL 与万卡级分布式训练系统 MegaScale ,林海滨的快速回流折射出中美大模型顶级人才流向的变化。
在 2020 年加入字节跳动 AML (应用机器学习) 团队前,林海滨曾在亚马逊 AWS 参与 MXNet 框架研发。在字节跳动期间,林海滨牵头研发了 GPU 推荐训练系统与集合通信库 ByteCCL ,并带队攻克上万张 GPU 并行协同难题以打磨出 MegaScale 训练系统。当前豆包大模型日均调用量处于高位,多模态与智能体研发对训练集群的稳定性要求极高,林海滨此前对字节跳动整套技术体系的熟悉度,能够直接支持底层分布式训练系统的迭代。此外,林海滨主导开发的开源强化学习训练框架 veRL 已被阿里巴巴通义千问与上海 AI 实验室采用。
字节跳动的人员回流规定指出,员工离职满 3 个月且无违规记录可申请重返公司,离职不足 1 年则职级与薪资保持不变。林海滨重返字节跳动,呼应了近期针对大模型核心团队的激励举措。字节跳动向 Seed 部门员工开放了定价为每股 13 美元的「豆包股」特殊期权认购权。目前大模型人才战已升级为「期权+自主权+算力」的综合争夺,此前 Seed 实验室曾有约 70 名成员流向外部大模型厂商,字节跳动正试图通过特殊股权设计逆转人员流失。
信源:https://mp.weixin.qq.com/s/6eaRVAuBktUcYaYcDOt2AQ
原字节跳动大模型训练负责人林海滨正式回归 Seed 团队,继续统筹分布式训练底座的开发。林海滨去年 12 月离职加盟 OpenAI 前首席科学家伊利亚·苏茨克沃 (Ilya Sutskever) 创立的超级智能公司 SSI (Safe Superintelligence) ,从出走到回归历时不足半年。林海滨作为卡内基梅隆大学 (CMU) 硕士、师从著名数据库专家安迪·帕夫洛 (Andy Pavlo) 教授的 AI 专家,曾主导开源了强化学习训练框架 veRL 与万卡级分布式训练系统 MegaScale ,林海滨的快速回流折射出中美大模型顶级人才流向的变化。
在 2020 年加入字节跳动 AML (应用机器学习) 团队前,林海滨曾在亚马逊 AWS 参与 MXNet 框架研发。在字节跳动期间,林海滨牵头研发了 GPU 推荐训练系统与集合通信库 ByteCCL ,并带队攻克上万张 GPU 并行协同难题以打磨出 MegaScale 训练系统。当前豆包大模型日均调用量处于高位,多模态与智能体研发对训练集群的稳定性要求极高,林海滨此前对字节跳动整套技术体系的熟悉度,能够直接支持底层分布式训练系统的迭代。此外,林海滨主导开发的开源强化学习训练框架 veRL 已被阿里巴巴通义千问与上海 AI 实验室采用。
字节跳动的人员回流规定指出,员工离职满 3 个月且无违规记录可申请重返公司,离职不足 1 年则职级与薪资保持不变。林海滨重返字节跳动,呼应了近期针对大模型核心团队的激励举措。字节跳动向 Seed 部门员工开放了定价为每股 13 美元的「豆包股」特殊期权认购权。目前大模型人才战已升级为「期权+自主权+算力」的综合争夺,此前 Seed 实验室曾有约 70 名成员流向外部大模型厂商,字节跳动正试图通过特殊股权设计逆转人员流失。
信源:https://mp.weixin.qq.com/s/6eaRVAuBktUcYaYcDOt2AQ
❤1
MathCode 0.2.0发布,引入前缀缓存整形令API成本骤降九成
Math-AI 团队发布数学形式与定理证明 AI 智能体 MathCode 0.2.0,通过前缀缓存请求整形与策略控制,将 API 成本降低达 90%。新版本针对大模型在长程证明和多轮交互中的高额开销,优化提示词结构稳定性以提升 Prompt 缓存命中率。
在定理证明场景下,模型需频繁读取庞大代码库与公理库。MathCode 0.2.0 引入前缀缓存请求整形诊断与策略控制 Prefix-cache request-shape diagnostics and policy controls 机制。系统屏蔽提示词头部归属以保障结构稳定性,新增多断点缓存 `MATHCODE_CACHE_MULTI_BREAKPOINT`、显式最小前缀网关与空闲感知 TTL 策略,通过底层请求形状对齐最大化 Provider 原生缓存命中率,将长会话账单压至一成。
新版本还强化了任务管理与思考深度控制。为防长程运行超支,系统支持通过
在编译加速与部署方面,新版本支持外接 Project Numina 开发的编译器 Kimina Lean Server 作为子进程常驻运行,并将编译检查请求路由至
信源:https://github.com/math-ai-org/mathcode
Math-AI 团队发布数学形式与定理证明 AI 智能体 MathCode 0.2.0,通过前缀缓存请求整形与策略控制,将 API 成本降低达 90%。新版本针对大模型在长程证明和多轮交互中的高额开销,优化提示词结构稳定性以提升 Prompt 缓存命中率。
在定理证明场景下,模型需频繁读取庞大代码库与公理库。MathCode 0.2.0 引入前缀缓存请求整形诊断与策略控制 Prefix-cache request-shape diagnostics and policy controls 机制。系统屏蔽提示词头部归属以保障结构稳定性,新增多断点缓存 `MATHCODE_CACHE_MULTI_BREAKPOINT`、显式最小前缀网关与空闲感知 TTL 策略,通过底层请求形状对齐最大化 Provider 原生缓存命中率,将长会话账单压至一成。
新版本还强化了任务管理与思考深度控制。为防长程运行超支,系统支持通过
MATHCODE_GOAL_MAX_TOKEN_BUDGET 设定 Token 预算上限,并限制嵌套斜slash命令上限防范无限循环。此外,证明会话支持通过 --effort 或 /effort 动态调整思考深度,提供 low`、`medium`、`high`、`max 等级别,且支持随时退回默认配置。在编译加速与部署方面,新版本支持外接 Project Numina 开发的编译器 Kimina Lean Server 作为子进程常驻运行,并将编译检查请求路由至
/verify 接口。同时,安装脚本 setup.sh 迎来重构,新增 --status`、`--clean 等指令,支持 release 校验和自动验证与复用系统 Lean/Lake environment 环境,降低部署门槛。信源:https://github.com/math-ai-org/mathcode
GitHub
GitHub - math-ai-org/mathcode: MathCode: A Frontier Mathematical Coding Agent
MathCode: A Frontier Mathematical Coding Agent. Contribute to math-ai-org/mathcode development by creating an account on GitHub.
规避美国AI出口禁令,高通携手字节跳动像素级对齐合规芯片代工
高通与字节跳动达成大模型芯片代工与采购协议。高通将协助字节跳动把已完成的自研芯片设计转化为量产芯片,并向字节跳动供应数百万颗定制 ASIC 芯片,以支持旗下 AI 智能体「豆包」的数据中心部署。
为应对严格的地缘政治审查,交易在合规维度进行了精密边界设计。高通委托台积电等代工厂为字节跳动进行流片与制造,只要定制芯片的计算性能控制在合法出口阈值内,相关代工生产便不会违反美国政府现行的 AI 芯片出口管制条例。
大模型与智能体生态的爆发式增长,促使字节跳动大幅拉高数据中心资本开支。行业公开数据显示,字节跳动已将 AI 基础设施预算调高 25 %,达到 2000 亿人民币(约合 294 亿美元)。引入数百万颗高通定制 ASIC 芯片,有助于字节跳动平抑对高端 GPU 的刚性依赖与采购成本。这笔巨额订单不仅是高通从手机处理器向 AI 基础设施跨界转型的里程碑,也让字节跳动成为高通数据中心定制芯片的首批大客户,推动高通股价盘中大涨 8.3 %,创下历史新高。高通首席执行官克里斯蒂亚诺·安蒙 Cristiano Amon 在 4 月的第二财季财报电话会议中曾暗示,高通正在与多家大客户展开 AI 数据中心芯片采购的深度接洽,字节跳动订单的最终落地证实了高通在数据中心芯片业务上的实质性突破。
信源:https://www.bloomberg.com/news/articles/2026-05-26/qualcomm-strikes-ai-chip-deal-with-tiktok-owner-bytedance
高通与字节跳动达成大模型芯片代工与采购协议。高通将协助字节跳动把已完成的自研芯片设计转化为量产芯片,并向字节跳动供应数百万颗定制 ASIC 芯片,以支持旗下 AI 智能体「豆包」的数据中心部署。
为应对严格的地缘政治审查,交易在合规维度进行了精密边界设计。高通委托台积电等代工厂为字节跳动进行流片与制造,只要定制芯片的计算性能控制在合法出口阈值内,相关代工生产便不会违反美国政府现行的 AI 芯片出口管制条例。
大模型与智能体生态的爆发式增长,促使字节跳动大幅拉高数据中心资本开支。行业公开数据显示,字节跳动已将 AI 基础设施预算调高 25 %,达到 2000 亿人民币(约合 294 亿美元)。引入数百万颗高通定制 ASIC 芯片,有助于字节跳动平抑对高端 GPU 的刚性依赖与采购成本。这笔巨额订单不仅是高通从手机处理器向 AI 基础设施跨界转型的里程碑,也让字节跳动成为高通数据中心定制芯片的首批大客户,推动高通股价盘中大涨 8.3 %,创下历史新高。高通首席执行官克里斯蒂亚诺·安蒙 Cristiano Amon 在 4 月的第二财季财报电话会议中曾暗示,高通正在与多家大客户展开 AI 数据中心芯片采购的深度接洽,字节跳动订单的最终落地证实了高通在数据中心芯片业务上的实质性突破。
信源:https://www.bloomberg.com/news/articles/2026-05-26/qualcomm-strikes-ai-chip-deal-with-tiktok-owner-bytedance
Bloomberg.com
Qualcomm Strikes AI Chip Deal With TikTok Owner ByteDance
Qualcomm Inc. reached a deal with TikTok owner ByteDance Ltd. to supply chips for artificial intelligence data centers, according to people familiar with the matter, marking a key win for a company trying to expand from smartphone processors into AI infrastructure.
最后一刻撕毁AI安全令并引入前司法部长,特朗普誓以零监管在AI竞赛中战胜中国
美国人工智能监管政策发生急剧转向。总统特朗普在签字仪式举行前数小时,决定无限期推迟签署原定于 5 月 21 日发布的前沿大模型审查行政命令。随后,特朗普于 5 月 26 日宣布任命前司法部长帕姆·邦迪(Pam Bondi)加入总统科技顾问委员会(PCAST)。从撤回行政令到引入法律派强人,白宫正将科技顾问委员会打造为清扫监管的法律前线。邦迪的诉讼背景配合萨克斯的去监管主张,意在通过法律起诉扫除各州设立的防御性技术壁垒,全面推行放任前沿AI野蛮生长以击败中国的极限路线。
白宫此前起草的安全审查草案聚焦于发布前置审查。虽然条文已将最初设想的类食品药品监督管理局(FDA)强制许可制稀释为「自愿性前置审查框架」,但仍要求开发商在公开发布大模型前,提前最多 90 天向政府共享模型以评估国家安全风险。针对提案设立的审查期限,前沿实验室曾极力游说将时间压缩至发布前 14 天;而特朗普则在最后关头索性将草案全盘撤回,称不满意草案条款,并担忧联邦预审会削弱美国相对于中国的竞争优势,导致国家网络总监办公室(ONCD)等部门的数月努力彻底落空。
白宫去监管政策的急转直下,呼应了顾问委员会联合主席大卫·萨克斯(David Sacks)公开表露的政策立场。针对教皇利奥十四世在 5 月 25 日发布的通谕《伟大的人性》(Magnifica Humanitas)中关于「人工智能革命威胁人类尊严」的警告,萨克斯虽赞同人工智能应服务人类尊严,但极力反对给政府兜底控制权,坚称将模型研发主导权拱手让给政府才是「真正的对齐问题」。萨克斯强调,政府控制极易演变为审查、监视与掌控公民的极权工具,并引用古罗马名言「谁来监督监督者」与「权力导致腐败,绝对权力导致绝对腐败」进行驳斥。萨克斯对前司法部长邦迪履新顾问委员会表示全力支持,标志着白宫将利用司法起诉手段阻击各州出台的冲突法案,以极端的去监管方针,保障美国在与中国的大国 AI 竞赛中维持绝对领先地位。
信源:https://x.com/DavidSacks/status/2059482315219460150
美国人工智能监管政策发生急剧转向。总统特朗普在签字仪式举行前数小时,决定无限期推迟签署原定于 5 月 21 日发布的前沿大模型审查行政命令。随后,特朗普于 5 月 26 日宣布任命前司法部长帕姆·邦迪(Pam Bondi)加入总统科技顾问委员会(PCAST)。从撤回行政令到引入法律派强人,白宫正将科技顾问委员会打造为清扫监管的法律前线。邦迪的诉讼背景配合萨克斯的去监管主张,意在通过法律起诉扫除各州设立的防御性技术壁垒,全面推行放任前沿AI野蛮生长以击败中国的极限路线。
白宫此前起草的安全审查草案聚焦于发布前置审查。虽然条文已将最初设想的类食品药品监督管理局(FDA)强制许可制稀释为「自愿性前置审查框架」,但仍要求开发商在公开发布大模型前,提前最多 90 天向政府共享模型以评估国家安全风险。针对提案设立的审查期限,前沿实验室曾极力游说将时间压缩至发布前 14 天;而特朗普则在最后关头索性将草案全盘撤回,称不满意草案条款,并担忧联邦预审会削弱美国相对于中国的竞争优势,导致国家网络总监办公室(ONCD)等部门的数月努力彻底落空。
白宫去监管政策的急转直下,呼应了顾问委员会联合主席大卫·萨克斯(David Sacks)公开表露的政策立场。针对教皇利奥十四世在 5 月 25 日发布的通谕《伟大的人性》(Magnifica Humanitas)中关于「人工智能革命威胁人类尊严」的警告,萨克斯虽赞同人工智能应服务人类尊严,但极力反对给政府兜底控制权,坚称将模型研发主导权拱手让给政府才是「真正的对齐问题」。萨克斯强调,政府控制极易演变为审查、监视与掌控公民的极权工具,并引用古罗马名言「谁来监督监督者」与「权力导致腐败,绝对权力导致绝对腐败」进行驳斥。萨克斯对前司法部长邦迪履新顾问委员会表示全力支持,标志着白宫将利用司法起诉手段阻击各州出台的冲突法案,以极端的去监管方针,保障美国在与中国的大国 AI 竞赛中维持绝对领先地位。
信源:https://x.com/DavidSacks/status/2059482315219460150
恒指季检效应持续发酵,港股「AI双雄」智谱与MiniMax联袂大涨创历史新高
5 月 27 日,港股大模型板块继续走强,被称为港股「AI双雄」的智谱(02513.HK)与 MiniMax(00100.HK)股价联袂大涨。截至收盘,智谱上涨 5.95% 报 1425.00 港元,盘中最高触及 1468.00 港元,再度创下上市以来新高,总市值达 6353.26 亿港元,全天成交额达 13.79 亿港元;MiniMax 录得 10.53% 的涨幅报 850.00 港元,盘中最高达 856.00 港元,总市值达 2665.90 亿港元,全天成交额达 27.57 亿港元。
恒生指数公司近期公布的季度检讨结果是资金流入的核心诱因。5 月 22 日收市后公布的季度检讨结果显示,智谱与 MiniMax 被正式纳入恒生科技指数,调整将于 6 月 8 日正式生效。市场分析指出,纳入指数的预期直接带动了市场关注度,并提前吸引了被动指数基金与中长线配置资金买入,提供了强劲的流动性支撑。
除了指数纳入效应,两家公司近期在技术与商业化层面的高频进展也巩固了估值底部。智谱于近期推出 GLM-5.1 高速版 API,大幅刷新了行业模型输出速度上限;MiniMax 则连续发布 M3 稀疏注意力(MSA)技术预告与 35 页的 M2 系列完整技术报告,展示了在长文本与智能体(Agent)训练系统上的核心技术增量,且模型全球调用量稳居前列。作为港股唯一的稀缺性大模型核心资产,两家公司在技术红利与资金配置的共振下,估值空间正得到进一步释放。
5 月 27 日,港股大模型板块继续走强,被称为港股「AI双雄」的智谱(02513.HK)与 MiniMax(00100.HK)股价联袂大涨。截至收盘,智谱上涨 5.95% 报 1425.00 港元,盘中最高触及 1468.00 港元,再度创下上市以来新高,总市值达 6353.26 亿港元,全天成交额达 13.79 亿港元;MiniMax 录得 10.53% 的涨幅报 850.00 港元,盘中最高达 856.00 港元,总市值达 2665.90 亿港元,全天成交额达 27.57 亿港元。
恒生指数公司近期公布的季度检讨结果是资金流入的核心诱因。5 月 22 日收市后公布的季度检讨结果显示,智谱与 MiniMax 被正式纳入恒生科技指数,调整将于 6 月 8 日正式生效。市场分析指出,纳入指数的预期直接带动了市场关注度,并提前吸引了被动指数基金与中长线配置资金买入,提供了强劲的流动性支撑。
除了指数纳入效应,两家公司近期在技术与商业化层面的高频进展也巩固了估值底部。智谱于近期推出 GLM-5.1 高速版 API,大幅刷新了行业模型输出速度上限;MiniMax 则连续发布 M3 稀疏注意力(MSA)技术预告与 35 页的 M2 系列完整技术报告,展示了在长文本与智能体(Agent)训练系统上的核心技术增量,且模型全球调用量稳居前列。作为港股唯一的稀缺性大模型核心资产,两家公司在技术红利与资金配置的共振下,估值空间正得到进一步释放。
❤1
字节跳动今年资本支出拟飚至最高700亿美元,明年筹划千亿级别底座决战
字节跳动拟将今年资本支出拉高至最高 700 亿美元以扩建 AI 基础设施。新预算较去年约 250 亿美元翻了近两倍,具体开支约 4000 亿至 5000 亿元人民币(约合 590 亿至 740 亿美元)。这笔投入将由 2025 年约 500 亿美元的利润承托。若商业环境良好,明年开支或进一步升至 1000 亿美元。
字节跳动的扩张规模远超国内同行。相比之下,国内巨头在 AI 基础设施上的投入较为克制。腾讯 2025 年资本支出为 792 亿元人民币,并承诺今年将 AI 投资翻倍至 360 亿元以上。阿里巴巴截至今年 3 月的财年资本支出为 1260 亿元,目前维持三年超 500 亿美元的滚动投资目标。字节跳动单年规划已超越国内对手数倍总和。
受制于高端芯片出口管制,本土低成本成为字节跳动的独特优势。中国数据中心建设与运营成本远低于美国,可用更低资金购入等量基础设施容量。微软、谷歌、亚马逊和 Meta 四大超大规模云厂商今年资本支出总额高达 7250 亿美元,平均每家 1810 亿美元。字节跳动正多元化补充算力,近期与高通达成数百万颗定制 ASIC 芯片采购协议,以支撑月活超 3 亿的豆包大模型及 Seedance 等底层视频与文本模型生态。
目前字节跳动正收拢业务线以聚焦 AI 研发。过去一年中,公司剥离游戏等非核心业务,集中资金主推 AI 与社交大盘。在最新一轮股权交易中,字节跳动估值约 5500 亿美元。尽管开支预算会按季度调整,且最终支出取决于计算硬件与电力供应状况,但字节跳动在大模型、商业化及底层硬件采购上的提速,展现出谋求算力与智能体主导权的决心。
信源:https://www.bloomberg.com/news/articles/2026-05-27/bytedance-weighs-capex-of-as-much-as-70-billion-in-ai-push
字节跳动拟将今年资本支出拉高至最高 700 亿美元以扩建 AI 基础设施。新预算较去年约 250 亿美元翻了近两倍,具体开支约 4000 亿至 5000 亿元人民币(约合 590 亿至 740 亿美元)。这笔投入将由 2025 年约 500 亿美元的利润承托。若商业环境良好,明年开支或进一步升至 1000 亿美元。
字节跳动的扩张规模远超国内同行。相比之下,国内巨头在 AI 基础设施上的投入较为克制。腾讯 2025 年资本支出为 792 亿元人民币,并承诺今年将 AI 投资翻倍至 360 亿元以上。阿里巴巴截至今年 3 月的财年资本支出为 1260 亿元,目前维持三年超 500 亿美元的滚动投资目标。字节跳动单年规划已超越国内对手数倍总和。
受制于高端芯片出口管制,本土低成本成为字节跳动的独特优势。中国数据中心建设与运营成本远低于美国,可用更低资金购入等量基础设施容量。微软、谷歌、亚马逊和 Meta 四大超大规模云厂商今年资本支出总额高达 7250 亿美元,平均每家 1810 亿美元。字节跳动正多元化补充算力,近期与高通达成数百万颗定制 ASIC 芯片采购协议,以支撑月活超 3 亿的豆包大模型及 Seedance 等底层视频与文本模型生态。
目前字节跳动正收拢业务线以聚焦 AI 研发。过去一年中,公司剥离游戏等非核心业务,集中资金主推 AI 与社交大盘。在最新一轮股权交易中,字节跳动估值约 5500 亿美元。尽管开支预算会按季度调整,且最终支出取决于计算硬件与电力供应状况,但字节跳动在大模型、商业化及底层硬件采购上的提速,展现出谋求算力与智能体主导权的决心。
信源:https://www.bloomberg.com/news/articles/2026-05-27/bytedance-weighs-capex-of-as-much-as-70-billion-in-ai-push
Bloomberg.com
ByteDance Weighs Capex of As Much As $70 Billion in AI Push
ByteDance Ltd., the developer of TikTok and a leading force in artificial intelligence, is considering increasing its capital spending to more than double last year’s in a bid to lead the Chinese AI market and challenge the top US players abroad.
❤1
长鑫科技科创板IPO过会,未来业绩波动风险与百亿级员工激励遭现场问询
5 月 27 日,上交所审核通过长鑫科技集团股份有限公司(简称长鑫科技)的科创板 IPO 申请。作为国内唯一具备通用型 DRAM 大规模量产能力的集成电路龙头,长鑫科技首单适用「预先审阅」机制顺利过会。但上市委现场针对未来业绩波动风险及第二期员工股权激励计划提出了核心问询。
在业绩端,招股书披露了极其剧烈的扭亏反转:公司在 2023 与 2024 年累计净亏超 282 亿元,于 2025 年扭亏,并在 2026 年第一季度因全球算力激增实现营收 508.00 亿元(同比暴增 719.13%)、归母净利润 247.62 亿元。长鑫科技预计 2026 年上半年营收将达 1100 亿至 1200 亿元。上市委现场要求长鑫科技结合全球竞争格局、产能扩建、人工智能新技术路线,说明未来业绩是否存在较大波动风险。
在股权激励端,本期员工激励计划因朱一明自愿让渡个人 50% 股份(约 7.68 亿股,市值超 200 亿元)且作出长达 20 年的股份锁定承诺,被称为 A 股史上最大规模的个人股权激励案。方案直接让渡个人持股以避免稀释公众股东权益。上市委现场要求结合实施背景、内外部决策流程,说明决策合规性及股份支付的会计处理是否符合企业会计准则。
目前长鑫科技已完成 DDR4 到 DDR5/LPDDR5X 的代际覆盖,高端芯片达 8000 MT/s 速率与单颗 24Gb 容量。本次 IPO 拟募资 295 亿元投向产线升级与前瞻研发。此外,招股书将前五大供应商以代码形式脱敏以实现供应链保密,且前五大客户销售占比已降至 39.85%。
信源:https://www.sse.com.cn/listing/renewal/ipo/index_listing_detail.shtml?auditId=2170
5 月 27 日,上交所审核通过长鑫科技集团股份有限公司(简称长鑫科技)的科创板 IPO 申请。作为国内唯一具备通用型 DRAM 大规模量产能力的集成电路龙头,长鑫科技首单适用「预先审阅」机制顺利过会。但上市委现场针对未来业绩波动风险及第二期员工股权激励计划提出了核心问询。
在业绩端,招股书披露了极其剧烈的扭亏反转:公司在 2023 与 2024 年累计净亏超 282 亿元,于 2025 年扭亏,并在 2026 年第一季度因全球算力激增实现营收 508.00 亿元(同比暴增 719.13%)、归母净利润 247.62 亿元。长鑫科技预计 2026 年上半年营收将达 1100 亿至 1200 亿元。上市委现场要求长鑫科技结合全球竞争格局、产能扩建、人工智能新技术路线,说明未来业绩是否存在较大波动风险。
在股权激励端,本期员工激励计划因朱一明自愿让渡个人 50% 股份(约 7.68 亿股,市值超 200 亿元)且作出长达 20 年的股份锁定承诺,被称为 A 股史上最大规模的个人股权激励案。方案直接让渡个人持股以避免稀释公众股东权益。上市委现场要求结合实施背景、内外部决策流程,说明决策合规性及股份支付的会计处理是否符合企业会计准则。
目前长鑫科技已完成 DDR4 到 DDR5/LPDDR5X 的代际覆盖,高端芯片达 8000 MT/s 速率与单颗 24Gb 容量。本次 IPO 拟募资 295 亿元投向产线升级与前瞻研发。此外,招股书将前五大供应商以代码形式脱敏以实现供应链保密,且前五大客户销售占比已降至 39.85%。
信源:https://www.sse.com.cn/listing/renewal/ipo/index_listing_detail.shtml?auditId=2170
平息三星式罢工情绪,台积电董事长魏哲家承诺员工分红无天花板且保底增长30%
台积电董事长兼总裁魏哲家于 5 月 27 日紧急召开全公司员工沟通会,平息基层对分红缩水的质疑。针对网络传言公司将大砍 5 月分红逾 10 %,魏哲家澄清表示,若员工绩效考核与去年一致, 2026 年全年分红预估将强劲增长超 30 %,且分配「没有天花板」,以安抚因 AI 繁荣红利不均而反弹的员工情绪。
这场劳资风波始于 5 月中旬 Dcard 与 Facebook 社群爆出的内部抱怨。员工晒出截图称,第一季度分红数额几乎与上一季持平,未能反映公司净利润同比暴增 58 % 的强劲增长,甚至传出 5 月分红将大砍 10 % 至 20 % 。由于适逢韩国三星电子半导体部门刚刚达成历史性协议,即人均分红达近 40 万美元,台积电员工开始密集讨论发起「三星式罢工」或准时上下班等抗争手段,相关抱怨经 TweakTown 等媒体报道后迅速升温。
魏哲家解释称,利润分配必须统筹兼顾员工、股东及社会责任(如 ESG 和绿色能源投资)三方利益。对于员工关切的结构性加薪,管理层表示目前暂无计划,但年度调薪会向基层倾斜,确保基层涨幅高于主管。魏哲家更在现场公开鼓励员工将分红投入购买公司股票,承诺「买台积电股票保证未来生活无忧」,分享公司长期成长的回报。
台积电已于 5 月 27 日开放分红查询系统,分红资金将于 5 月 29 日正式发放。目前公司在全球同时建设约 12 座晶圆厂以攻坚 2nm 与 1.4nm 先进制程,面临庞大的资本开支压力,这与一线倒班员工要求提高分红以分享 AI 利润的诉求构成了直接冲突。
信源:https://www.youtube.com/watch?v=hLmGAcNIq8U
台积电董事长兼总裁魏哲家于 5 月 27 日紧急召开全公司员工沟通会,平息基层对分红缩水的质疑。针对网络传言公司将大砍 5 月分红逾 10 %,魏哲家澄清表示,若员工绩效考核与去年一致, 2026 年全年分红预估将强劲增长超 30 %,且分配「没有天花板」,以安抚因 AI 繁荣红利不均而反弹的员工情绪。
这场劳资风波始于 5 月中旬 Dcard 与 Facebook 社群爆出的内部抱怨。员工晒出截图称,第一季度分红数额几乎与上一季持平,未能反映公司净利润同比暴增 58 % 的强劲增长,甚至传出 5 月分红将大砍 10 % 至 20 % 。由于适逢韩国三星电子半导体部门刚刚达成历史性协议,即人均分红达近 40 万美元,台积电员工开始密集讨论发起「三星式罢工」或准时上下班等抗争手段,相关抱怨经 TweakTown 等媒体报道后迅速升温。
魏哲家解释称,利润分配必须统筹兼顾员工、股东及社会责任(如 ESG 和绿色能源投资)三方利益。对于员工关切的结构性加薪,管理层表示目前暂无计划,但年度调薪会向基层倾斜,确保基层涨幅高于主管。魏哲家更在现场公开鼓励员工将分红投入购买公司股票,承诺「买台积电股票保证未来生活无忧」,分享公司长期成长的回报。
台积电已于 5 月 27 日开放分红查询系统,分红资金将于 5 月 29 日正式发放。目前公司在全球同时建设约 12 座晶圆厂以攻坚 2nm 与 1.4nm 先进制程,面临庞大的资本开支压力,这与一线倒班员工要求提高分红以分享 AI 利润的诉求构成了直接冲突。
信源:https://www.youtube.com/watch?v=hLmGAcNIq8U
打包SpaceX与OpenAI,封闭式基金Powerlaw今晚直接挂牌纳斯达克
封闭式基金 Powerlaw Corp.(股票代码:PWRL)将于当地时间 5 月 27 日通过直接挂牌(Direct Listing)方式在纳斯达克上市。由于基金性质为已持有资产的封闭式基金,本次挂牌不增发新股、不筹集任何新资金,而是直接将存量股份上市交易。基金核心持仓包括马斯克旗下的太空探索技术公司 SpaceX 以及人工智能公司 OpenAI,为散户提供直接配置顶级未上市科技巨头的渠道。
受 SpaceX 估值预期迈向 2 万亿美元以及 OpenAI 估值逼近 1 万亿美元等预期的推动,散户投资者对 Pre-IPO 股权的投资需求在近期急剧升温。相比于高净值的合格投资者,普通人直接投资私募市场的渠道极少,这导致 Destiny Tech100、Robinhood Ventures Fund I 以及 Fundrise Innovation Fund LLC 等上市基金的交易价格长期远超净资产价值。由旧金山风投机构 Akkadian Ventures 关联公司运营的 Powerlaw 旗下持仓包含 18 家私募公司。截至 5 月 13 日,基金净资产总额为 6.041 亿美元,折合每股 13.97 美元。基金最大的两笔持仓为 SpaceX(估值约 1.17 亿美元,增值至初始成本的两倍以上)和 OpenAI(估值约 4690 万美元)。
根据上市招股文件,Powerlaw 发行总股本为 4324 万股。由于是存量股直接上市,首日交易仅释放现有股东手中约 20% 的自由流通股,其余股份将在未来 6 个月内逐步解禁。基金采取积极的主动管理策略,计划适时变现成熟项目并循环投入高成长持仓,目标为现有 600 多名股东实现 10 倍以上的投资回报。基金每年收取 2.5% 的管理费,且不收取任何业绩分成费。由于基金接近 80% 的投资通过特殊目的载体(SPV)持有,多层嵌套可能会引入额外费用。随着人工智能公司 Anthropic 日前警告将作废未经授权的 SPV 持股,代持通道面临合规清退风险。首席执行官迈克·丁斯代尔(Mike Dinsdale)坦言,SPV 在合适的人手里是极佳的工具,但在错误的人手里则是危险的工具。
信源:https://www.bloomberg.com/news/articles/2026-05-27/spacex-investor-powerlaw-to-debut-on-nasdaq-as-ipo-race-heats-up
封闭式基金 Powerlaw Corp.(股票代码:PWRL)将于当地时间 5 月 27 日通过直接挂牌(Direct Listing)方式在纳斯达克上市。由于基金性质为已持有资产的封闭式基金,本次挂牌不增发新股、不筹集任何新资金,而是直接将存量股份上市交易。基金核心持仓包括马斯克旗下的太空探索技术公司 SpaceX 以及人工智能公司 OpenAI,为散户提供直接配置顶级未上市科技巨头的渠道。
受 SpaceX 估值预期迈向 2 万亿美元以及 OpenAI 估值逼近 1 万亿美元等预期的推动,散户投资者对 Pre-IPO 股权的投资需求在近期急剧升温。相比于高净值的合格投资者,普通人直接投资私募市场的渠道极少,这导致 Destiny Tech100、Robinhood Ventures Fund I 以及 Fundrise Innovation Fund LLC 等上市基金的交易价格长期远超净资产价值。由旧金山风投机构 Akkadian Ventures 关联公司运营的 Powerlaw 旗下持仓包含 18 家私募公司。截至 5 月 13 日,基金净资产总额为 6.041 亿美元,折合每股 13.97 美元。基金最大的两笔持仓为 SpaceX(估值约 1.17 亿美元,增值至初始成本的两倍以上)和 OpenAI(估值约 4690 万美元)。
根据上市招股文件,Powerlaw 发行总股本为 4324 万股。由于是存量股直接上市,首日交易仅释放现有股东手中约 20% 的自由流通股,其余股份将在未来 6 个月内逐步解禁。基金采取积极的主动管理策略,计划适时变现成熟项目并循环投入高成长持仓,目标为现有 600 多名股东实现 10 倍以上的投资回报。基金每年收取 2.5% 的管理费,且不收取任何业绩分成费。由于基金接近 80% 的投资通过特殊目的载体(SPV)持有,多层嵌套可能会引入额外费用。随着人工智能公司 Anthropic 日前警告将作废未经授权的 SPV 持股,代持通道面临合规清退风险。首席执行官迈克·丁斯代尔(Mike Dinsdale)坦言,SPV 在合适的人手里是极佳的工具,但在错误的人手里则是危险的工具。
信源:https://www.bloomberg.com/news/articles/2026-05-27/spacex-investor-powerlaw-to-debut-on-nasdaq-as-ipo-race-heats-up
Bloomberg.com
SpaceX Investor Powerlaw Debuts on Nasdaq as IPO Race Heats Up
Powerlaw Corp., a closed-end fund that owns stakes in Elon Musk’s SpaceX and artificial intelligence firm OpenAI, traded well above the value of its underlying investments in its debut on Wednesday, capitalizing on retail investors’ clamor for exposure to…
专为端侧硬件设计,PrismML开源0.93GB图像生成模型Bonsai 4B
PrismML 开源端侧图像生成模型 Bonsai Image 4B,可在笔记本电脑与手机等本地设备上直接进行扩散推理。Bonsai Image 4B 包含 1-bit 与 Ternary(三值化)两个极简压缩版本,核心扩散 Transformer 体积仅为 0.93 GB 与 1.21 GB,在 Apple Silicon 设备上的完整部署包体积则分别为 3.42 GB 与 3.88 GB,并同步推出配套 iOS 应用 Bonsai Studio 实现端侧离线图像生成。
其中,1-bit 版本专门应对低内存硬件,将基于 7.75 GB FLUX.2 Klein 4B 的扩散 Transformer 体积缩小至全精度版本的 8.3 倍,仅占 0.93 GB 空间。Ternary 版本的核心 Transformer 体积为 1.21 GB,相比全精度版本缩小 6.4 倍,但在量化中引入 {-1, 0, +1} 三值化权重以提供更高的表达灵活性,从而在保持低存储占用的同时,提升了画质与提示词保真度。
根据评测,Bonsai Image 4B 在大幅压缩体积后,在物体构图、人眼偏好、美学指标及复杂提示词遵循能力上,依然能够与参数量大得多的主流图像生成模型抗衡。1-bit 与 Ternary 两个版本分别保留了全精度模型 88% 和 95% 的性能。同步推出的移动端应用 Bonsai Studio 允许用户在 iPhone 上实现全离线图像生成,运行过程完全在本地完成,无需订阅且不向云端发送 API 请求。PrismML 现已将 1-bit 与 Ternary 两个版本的模型以 Apache 2.0 开源协议对外发布。
信源:https://prismml.com/news/bonsai-image-4b
PrismML 开源端侧图像生成模型 Bonsai Image 4B,可在笔记本电脑与手机等本地设备上直接进行扩散推理。Bonsai Image 4B 包含 1-bit 与 Ternary(三值化)两个极简压缩版本,核心扩散 Transformer 体积仅为 0.93 GB 与 1.21 GB,在 Apple Silicon 设备上的完整部署包体积则分别为 3.42 GB 与 3.88 GB,并同步推出配套 iOS 应用 Bonsai Studio 实现端侧离线图像生成。
其中,1-bit 版本专门应对低内存硬件,将基于 7.75 GB FLUX.2 Klein 4B 的扩散 Transformer 体积缩小至全精度版本的 8.3 倍,仅占 0.93 GB 空间。Ternary 版本的核心 Transformer 体积为 1.21 GB,相比全精度版本缩小 6.4 倍,但在量化中引入 {-1, 0, +1} 三值化权重以提供更高的表达灵活性,从而在保持低存储占用的同时,提升了画质与提示词保真度。
根据评测,Bonsai Image 4B 在大幅压缩体积后,在物体构图、人眼偏好、美学指标及复杂提示词遵循能力上,依然能够与参数量大得多的主流图像生成模型抗衡。1-bit 与 Ternary 两个版本分别保留了全精度模型 88% 和 95% 的性能。同步推出的移动端应用 Bonsai Studio 允许用户在 iPhone 上实现全离线图像生成,运行过程完全在本地完成,无需订阅且不向云端发送 API 请求。PrismML 现已将 1-bit 与 Ternary 两个版本的模型以 Apache 2.0 开源协议对外发布。
信源:https://prismml.com/news/bonsai-image-4b
年化营收猛增至6亿美元,AI推理服务商Baseten拟以110亿美元估值融资10亿美元
人工智能推理服务商 Baseten 正与投资者接洽,计划以 110 亿美元的投后估值融资 10 亿美元。本次融资计划较公司三个月前公布的 50 亿美元估值翻了一倍多,呼应了开源 AI 生态对底层算力租赁的强劲需求。
截至 2026 年第一季度末,Baseten 的年化营收从季度初的 2 亿美元猛增至约 6 亿美元,达到 2025 年 3 月同期水平的 20 倍。高速增长甚至吸引了部分投资人给出接近 150 亿美元的非正式报价。在推理服务商赛道中,竞争对手 Modal 近期以 46.5 亿美元估值融资,年化营收为 3 亿美元。Together AI 则在 2026 年 spring 季以 75 亿美元估值融资,年化营收已突破 10 亿美元。
Baseten 成立于 2019 年,主要面向开发者出租英伟达 AI 服务器,提供开源大模型的微调、定制与推理运行服务。公司在 2025 年 12 月收购了帮助企业定制开源模型的初创公司 Parsed,进一步拓宽了企业级市场。Baseten 采用按需付费的模式,根据客户调用 API 消耗的 token 数量或租用芯片的时间计费。此前,公司已从英伟达、CapitalG、IVP 与 Spark Capital 等投资者处筹集了 5.85 亿美元资金。
尽管营收增长迅猛,推理服务商仍面临毛利率被挤压的风险。由于 OpenAI 和 Anthropic 等头部开发商对算力的庞大需求拉高了 GPU 现货价格,加上芯片供应紧张,被迫从大云厂商租用 GPU 再转租给开发者的 Baseten 可能会遭遇利润空间缩水。此外,多数大型成熟企业依然倾向于直接使用 OpenAI 或 Anthropic 的闭源大模型,这在一定程度上限制了开源推理市场的成长空间。
信源:https://www.theinformation.com/articles/ai-inference-provider-baseten-talks-raise-1-billion-11-billion-valuation
人工智能推理服务商 Baseten 正与投资者接洽,计划以 110 亿美元的投后估值融资 10 亿美元。本次融资计划较公司三个月前公布的 50 亿美元估值翻了一倍多,呼应了开源 AI 生态对底层算力租赁的强劲需求。
截至 2026 年第一季度末,Baseten 的年化营收从季度初的 2 亿美元猛增至约 6 亿美元,达到 2025 年 3 月同期水平的 20 倍。高速增长甚至吸引了部分投资人给出接近 150 亿美元的非正式报价。在推理服务商赛道中,竞争对手 Modal 近期以 46.5 亿美元估值融资,年化营收为 3 亿美元。Together AI 则在 2026 年 spring 季以 75 亿美元估值融资,年化营收已突破 10 亿美元。
Baseten 成立于 2019 年,主要面向开发者出租英伟达 AI 服务器,提供开源大模型的微调、定制与推理运行服务。公司在 2025 年 12 月收购了帮助企业定制开源模型的初创公司 Parsed,进一步拓宽了企业级市场。Baseten 采用按需付费的模式,根据客户调用 API 消耗的 token 数量或租用芯片的时间计费。此前,公司已从英伟达、CapitalG、IVP 与 Spark Capital 等投资者处筹集了 5.85 亿美元资金。
尽管营收增长迅猛,推理服务商仍面临毛利率被挤压的风险。由于 OpenAI 和 Anthropic 等头部开发商对算力的庞大需求拉高了 GPU 现货价格,加上芯片供应紧张,被迫从大云厂商租用 GPU 再转租给开发者的 Baseten 可能会遭遇利润空间缩水。此外,多数大型成熟企业依然倾向于直接使用 OpenAI 或 Anthropic 的闭源大模型,这在一定程度上限制了开源推理市场的成长空间。
信源:https://www.theinformation.com/articles/ai-inference-provider-baseten-talks-raise-1-billion-11-billion-valuation
The Information
AI Inference Provider Baseten in Talks to Raise $1 Billion at $11 Billion Valuation
AI startup Baseten has recently been in talks with investors to raise $1 billion at an $11 billion valuation including the money, according to a person with knowledge of the fundraise. That would more than double the company’s $5 billion valuation from its…
AI推理服务商Fireworks AI拟以150亿美元估值进行新一轮融资
主打 AI 模型推理加速服务的初创公司 Fireworks AI 正与投资者接洽,计划以 150 亿美元的投后估值进行新一轮融资。本轮融资预计将由曾投资过公司的风投机构 Index Ventures 领投。
Fireworks AI 成立于 2022 年,由前 Meta 工程师团队联合创立,联合创始人兼首席技术官为 Dmytro Dzhulgakov。公司专注于 AI 推理加速,即运行已完成训练的 AI 模型,算力租赁与推理 API 调用市场在当前生成式 AI 繁荣期极受投资者追捧。
在去年 10 月,公司刚完成 2.5 亿美元的融资,当时投后估值为 40 亿美元,由 Lightspeed Venture Partners、Index Ventures 以及 Evantic 联合领投。目前,知名 AI 辅助编程工具 Cursor 也是 Fireworks AI 的核心客户。
在模型推理加速赛道中,Fireworks AI 核心竞争对手的估值在近期同样快速推高。Baseten 正与投资者接洽,计划以 110 亿美元的投后估值融资 10 亿美元。
信源:https://www.bloomberg.com/news/articles/2026-05-27/fireworks-ai-in-talks-for-funding-at-15-billion-valuation
主打 AI 模型推理加速服务的初创公司 Fireworks AI 正与投资者接洽,计划以 150 亿美元的投后估值进行新一轮融资。本轮融资预计将由曾投资过公司的风投机构 Index Ventures 领投。
Fireworks AI 成立于 2022 年,由前 Meta 工程师团队联合创立,联合创始人兼首席技术官为 Dmytro Dzhulgakov。公司专注于 AI 推理加速,即运行已完成训练的 AI 模型,算力租赁与推理 API 调用市场在当前生成式 AI 繁荣期极受投资者追捧。
在去年 10 月,公司刚完成 2.5 亿美元的融资,当时投后估值为 40 亿美元,由 Lightspeed Venture Partners、Index Ventures 以及 Evantic 联合领投。目前,知名 AI 辅助编程工具 Cursor 也是 Fireworks AI 的核心客户。
在模型推理加速赛道中,Fireworks AI 核心竞争对手的估值在近期同样快速推高。Baseten 正与投资者接洽,计划以 110 亿美元的投后估值融资 10 亿美元。
信源:https://www.bloomberg.com/news/articles/2026-05-27/fireworks-ai-in-talks-for-funding-at-15-billion-valuation
Bloomberg.com
Fireworks AI in Talks for Funding at $15 Billion Valuation
Fireworks AI, a startup that helps companies run artificial intelligence models, is in talks to raise a new round of funding that would value the company at $15 billion, according to people familiar with the matter.
超级智能备战时间所剩无几,OpenAI安全政策主管与前幕僚长相继加盟基金会
OpenAI 前沿 AI 安全政策主管 Yo Shavit 宣布离职,全职转入非营利母体 OpenAI 基金会,加盟由联合创始人 Wojciech Zaremba 挂帅的「AI 韧性」项目。在 Shavit 宣布加盟的一周前,OpenAI 前 CTO 幕僚长 Bianca Martin 已率先宣布全职转入基金会。Shavit 离职时表达了极高的急迫感,直言在超级智能到来之前有大量备战工作,但所剩时间无几,呼吁更多安全人才立刻转向协助。
相继加盟基金会的两位核心高管,在 OpenAI 商业实体中长期主导安全与治理业务。Shavit 曾任前沿 AI 安全政策主管,而 Martin 则曾出任前 CTO 幕僚长并在 AGI 准备度团队专攻新兴技术风险。作为 2019 年加入公司的资深员工,Martin 曾主导编写了首份部署战术手册,并协助推出了伴随 GPT-3 的研究员访问计划,为 OpenAI 后续的红队测试工作奠定了基底。随着安全团队的持续流失与洗牌,拥有雄厚资金的非营利母体正成为承接安全研究的新主场。
信源:https://x.com/yonashav/status/2059352141395882409
OpenAI 前沿 AI 安全政策主管 Yo Shavit 宣布离职,全职转入非营利母体 OpenAI 基金会,加盟由联合创始人 Wojciech Zaremba 挂帅的「AI 韧性」项目。在 Shavit 宣布加盟的一周前,OpenAI 前 CTO 幕僚长 Bianca Martin 已率先宣布全职转入基金会。Shavit 离职时表达了极高的急迫感,直言在超级智能到来之前有大量备战工作,但所剩时间无几,呼吁更多安全人才立刻转向协助。
相继加盟基金会的两位核心高管,在 OpenAI 商业实体中长期主导安全与治理业务。Shavit 曾任前沿 AI 安全政策主管,而 Martin 则曾出任前 CTO 幕僚长并在 AGI 准备度团队专攻新兴技术风险。作为 2019 年加入公司的资深员工,Martin 曾主导编写了首份部署战术手册,并协助推出了伴随 GPT-3 的研究员访问计划,为 OpenAI 后续的红队测试工作奠定了基底。随着安全团队的持续流失与洗牌,拥有雄厚资金的非营利母体正成为承接安全研究的新主场。
信源:https://x.com/yonashav/status/2059352141395882409
参考代码量达SWE-Bench五倍,Datacurve开源智能体基准DeepSWE
AI 基础设施初创公司 Datacurve 宣布开源编程智能体基准测试 DeepSWE,针对超长、复杂的真实软件工程任务,评估前沿大模型的自主编程能力。
相较于主流基准 SWE-Bench Pro,DeepSWE 专注于长程轨迹规划与复杂代码库编辑。基准首批包含 113 个涵盖 TypeScript、Go、Python、JavaScript 和 Rust 五种编程语言的真实开发任务。在 DeepSWE 测试中,模型所需的参考解答平均达到 668 行代码,横跨 7 个不同文件,代码规模与文件复杂性达到了 SWE-Bench Pro 的 5.5 倍。为了真实模拟人类开发者的日常委托体验,智能体接收到的提示指令平均仅有 2158 个字符,要求智能体依靠极简指令自主完成深度推理与代码库遍历。
为了解决公共数据集普遍面临的预训练基准污染与模型记忆通病,DeepSWE 全盘采用重新编写的原创任务。在评测过程中,DeepSWE 剥离了各家模型专属的脚手架工具,统一采用开源框架 mini-swe-agent 运行所有模型测试,以确保测试结果客观反映底层能力。同时,基准摒弃了依赖内部细节的传统自动化打分器,改用手工编写的行为验证器测试最终代码的可观测表现,从而提供高保真评测精度。
在首批前沿模型的评测中,各家大模型的能力表现拉开了显著代差。OpenAI 旗舰模型 gpt-5.5 展现出优势,以 70% 的解决率稳居首位,gpt-5.4 则以 56% 位列第二。Anthropic 旗下的 claude-opus-4.7 紧随其后,取得 54% 的成绩,而轻量级命令行工具配备的 claude-sonnet-4.6 仅为 32%。谷歌 gemini-3.5-flash 取得 28% 的解决率,击败了 24% 解决率的 gpt-5.4-mini 与 kimi-k2.6。国产模型 mimo-v2.5-pro 取得 19% 解决率,glm-5.1 取得 18%。追求极致性价比的 deepseek-v4-pro 在长程工程测试中遭遇性能瓶颈,仅取得 8% 的解决率,暴露出在多步骤、大文件编辑场景下的长程规划与自我修正短板。
信源:https://deepswe.datacurve.ai/blog
AI 基础设施初创公司 Datacurve 宣布开源编程智能体基准测试 DeepSWE,针对超长、复杂的真实软件工程任务,评估前沿大模型的自主编程能力。
相较于主流基准 SWE-Bench Pro,DeepSWE 专注于长程轨迹规划与复杂代码库编辑。基准首批包含 113 个涵盖 TypeScript、Go、Python、JavaScript 和 Rust 五种编程语言的真实开发任务。在 DeepSWE 测试中,模型所需的参考解答平均达到 668 行代码,横跨 7 个不同文件,代码规模与文件复杂性达到了 SWE-Bench Pro 的 5.5 倍。为了真实模拟人类开发者的日常委托体验,智能体接收到的提示指令平均仅有 2158 个字符,要求智能体依靠极简指令自主完成深度推理与代码库遍历。
为了解决公共数据集普遍面临的预训练基准污染与模型记忆通病,DeepSWE 全盘采用重新编写的原创任务。在评测过程中,DeepSWE 剥离了各家模型专属的脚手架工具,统一采用开源框架 mini-swe-agent 运行所有模型测试,以确保测试结果客观反映底层能力。同时,基准摒弃了依赖内部细节的传统自动化打分器,改用手工编写的行为验证器测试最终代码的可观测表现,从而提供高保真评测精度。
在首批前沿模型的评测中,各家大模型的能力表现拉开了显著代差。OpenAI 旗舰模型 gpt-5.5 展现出优势,以 70% 的解决率稳居首位,gpt-5.4 则以 56% 位列第二。Anthropic 旗下的 claude-opus-4.7 紧随其后,取得 54% 的成绩,而轻量级命令行工具配备的 claude-sonnet-4.6 仅为 32%。谷歌 gemini-3.5-flash 取得 28% 的解决率,击败了 24% 解决率的 gpt-5.4-mini 与 kimi-k2.6。国产模型 mimo-v2.5-pro 取得 19% 解决率,glm-5.1 取得 18%。追求极致性价比的 deepseek-v4-pro 在长程工程测试中遭遇性能瓶颈,仅取得 8% 的解决率,暴露出在多步骤、大文件编辑场景下的长程规划与自我修正短板。
信源:https://deepswe.datacurve.ai/blog
DeepSWE
DeepSWE measures frontier coding agents on original, long-horizon software engineering tasks.
引入AlphaGo搜索,全新MCTS视频生成框架能生成更长、更一致的视频
xAI 前世界模型负责人 Ethan He 联合英伟达 (NVIDIA) 资深研究员 Linnan Wang、 Ashwath Aithal 以及前英伟达 (NVIDIA) 深度学习实习生 Ritvik Bale,在 ICLR 2026 提交的论文中提出了一种名为 Planning at Inference 的全新推理时缩放 (Test-Time Scaling) 框架,首次将蒙特卡洛树搜索 (MCTS) 作为即插即用的模块化框架引入长视频生成。这套框架将长视频生成任务建模为顺序决策问题,系统在推理阶段引入 MCTS,利用前瞻性回溯 (look-ahead rollouts) 和反向传播奖励评估多种视频延续片段,有效缓解了传统分块或单次生成中普遍面临的语义漂移与误差累积问题。
为了在连续的视频生成空间中实现高效探索,研究团队特别设计了 Multi-Tree MCTS (多树蒙特卡洛树搜索) 变体。相较于在固定算力预算下采用单一搜索树的传统方法,多树架构能够在搜索树超过预设大小后自动开启新树以扩大搜索空间,降低对糟糕初始化状态的敏感性,显著提升探索效率。更重要的是, Planning at Inference 具有极高的模块化特征,属于完全即插即用的推理时优化方案。开发人员无需对底层大模型进行任何重新训练或微调,即可将这套方案直接部署于现有的视频生成底座。
在以英伟达开源视频预测模型 Cosmos-Predict2 为底座的实验中, Planning at Inference 展现出强大的生成表现。在长视频生成评测中,这套方案成功生成了超过 20 秒的高质量连贯视频。测试数据表明,在物体持久性、时间连贯性以及文本-视频对齐度等核心指标上, MCTS 搜索生成质量相比贪婪搜索 (Greedy Search) 、束搜索 (Beam Search) 和 Best-of-N 等传统基线方法实现了大幅提升。相比当前行业领先的闭源大模型,这套方法生成的视频在时长上分别比 Sora 长 18% 和比 Kling 长 47% ,同时在画面精细度与视觉保真度上与两者保持相当。
尽管搜索机制带来了极其优异的画面连贯性,但在推理阶段引入多树搜索也带来了高昂的算力开销。研究人员坦言,当前的 Planning at Inference 框架在生成速度上明显慢于传统的自回归直接生成,这在一定程度上限制了实时部署的可能。然而,随着底层视频生成底座的效率演进与计算硬件算力的不断增长,以计算成本换取画面质量的推理时缩放路线,有望在大模型基础能力突破特定门槛后,成为长视频生成走向工程实用的关键技术路径。
信源:https://openreview.net/forum?id=ilir6A52vh
xAI 前世界模型负责人 Ethan He 联合英伟达 (NVIDIA) 资深研究员 Linnan Wang、 Ashwath Aithal 以及前英伟达 (NVIDIA) 深度学习实习生 Ritvik Bale,在 ICLR 2026 提交的论文中提出了一种名为 Planning at Inference 的全新推理时缩放 (Test-Time Scaling) 框架,首次将蒙特卡洛树搜索 (MCTS) 作为即插即用的模块化框架引入长视频生成。这套框架将长视频生成任务建模为顺序决策问题,系统在推理阶段引入 MCTS,利用前瞻性回溯 (look-ahead rollouts) 和反向传播奖励评估多种视频延续片段,有效缓解了传统分块或单次生成中普遍面临的语义漂移与误差累积问题。
为了在连续的视频生成空间中实现高效探索,研究团队特别设计了 Multi-Tree MCTS (多树蒙特卡洛树搜索) 变体。相较于在固定算力预算下采用单一搜索树的传统方法,多树架构能够在搜索树超过预设大小后自动开启新树以扩大搜索空间,降低对糟糕初始化状态的敏感性,显著提升探索效率。更重要的是, Planning at Inference 具有极高的模块化特征,属于完全即插即用的推理时优化方案。开发人员无需对底层大模型进行任何重新训练或微调,即可将这套方案直接部署于现有的视频生成底座。
在以英伟达开源视频预测模型 Cosmos-Predict2 为底座的实验中, Planning at Inference 展现出强大的生成表现。在长视频生成评测中,这套方案成功生成了超过 20 秒的高质量连贯视频。测试数据表明,在物体持久性、时间连贯性以及文本-视频对齐度等核心指标上, MCTS 搜索生成质量相比贪婪搜索 (Greedy Search) 、束搜索 (Beam Search) 和 Best-of-N 等传统基线方法实现了大幅提升。相比当前行业领先的闭源大模型,这套方法生成的视频在时长上分别比 Sora 长 18% 和比 Kling 长 47% ,同时在画面精细度与视觉保真度上与两者保持相当。
尽管搜索机制带来了极其优异的画面连贯性,但在推理阶段引入多树搜索也带来了高昂的算力开销。研究人员坦言,当前的 Planning at Inference 框架在生成速度上明显慢于传统的自回归直接生成,这在一定程度上限制了实时部署的可能。然而,随着底层视频生成底座的效率演进与计算硬件算力的不断增长,以计算成本换取画面质量的推理时缩放路线,有望在大模型基础能力突破特定门槛后,成为长视频生成走向工程实用的关键技术路径。
信源:https://openreview.net/forum?id=ilir6A52vh
openreview.net
Planning at Inference: MCTS Test-Time Scaling for Long Video...
Generating long videos with consistent content and visual quality remains a ma-
jor challenge, as existing one-shot and chunked methods often suffer from se-
mantic drift and compounding artifacts....
jor challenge, as existing one-shot and chunked methods often suffer from se-
mantic drift and compounding artifacts....
❤1
比cuML最高提速208倍,加州大学伯克利分校等开源经典ML加速库FlashLib
加州大学伯克利分校联合麻省理工学院、加州大学欧文分校与德克萨斯大学奥斯汀分校等发布 GPU 经典 ML 算子库 FlashLib ,覆盖 15 个高层算子,旨在为机器学习工作流与智能体场景提供高性能加速。基于 Triton 与 CuteDSL , FlashLib 在 H200 GPU 上针对 KMeans 、 KNN 等算子,较英伟达 cuML 25.10 实现最高 208 倍的峰值提速。
在 H200 GPU 测试中, Flash-KMeans 效率达到峰值 FLOPs 的 61% , Flash-KNN 则达到 HBM 显存带宽的 85.2% 。相比英伟达 cuML 25.10 , FlashLib 在 KMeans 聚类中提速 26 倍,在 KNN 检索中提速 19 倍,在 HDBSCAN 聚类中提速 40 倍。而在 TruncatedSVD 分解中,在特定计算容差与算法取舍下实现了高达 208 倍的峰值加速。同时对 PCA 主成分分析、 exact t-SNE 及 MultinomialNB 等算子,提速也分别达 47 倍、 147 倍与 49 倍。
随着 AI 步入智能体( Agent )时代,经典 ML 算子已从离线批处理转为在线实时原语。在科学计算智能体等长链推理中,模型需频繁调用聚类、检索及降维算子,使传统离线算子成为系统延迟瓶颈。 FlashLib 特别引入了性能预测 API ,在不触发 GPU 评测的条件下,仅用约 5 微秒的 CPU 耗时即可精准估算出工作流的运行时长与显存开销,为任务规划与智能体决策提供了低成本分析支持。目前, FlashLib 已在 GitHub 开源。
信源:https://flashml-org.github.io/index.html
加州大学伯克利分校联合麻省理工学院、加州大学欧文分校与德克萨斯大学奥斯汀分校等发布 GPU 经典 ML 算子库 FlashLib ,覆盖 15 个高层算子,旨在为机器学习工作流与智能体场景提供高性能加速。基于 Triton 与 CuteDSL , FlashLib 在 H200 GPU 上针对 KMeans 、 KNN 等算子,较英伟达 cuML 25.10 实现最高 208 倍的峰值提速。
在 H200 GPU 测试中, Flash-KMeans 效率达到峰值 FLOPs 的 61% , Flash-KNN 则达到 HBM 显存带宽的 85.2% 。相比英伟达 cuML 25.10 , FlashLib 在 KMeans 聚类中提速 26 倍,在 KNN 检索中提速 19 倍,在 HDBSCAN 聚类中提速 40 倍。而在 TruncatedSVD 分解中,在特定计算容差与算法取舍下实现了高达 208 倍的峰值加速。同时对 PCA 主成分分析、 exact t-SNE 及 MultinomialNB 等算子,提速也分别达 47 倍、 147 倍与 49 倍。
随着 AI 步入智能体( Agent )时代,经典 ML 算子已从离线批处理转为在线实时原语。在科学计算智能体等长链推理中,模型需频繁调用聚类、检索及降维算子,使传统离线算子成为系统延迟瓶颈。 FlashLib 特别引入了性能预测 API ,在不触发 GPU 评测的条件下,仅用约 5 微秒的 CPU 耗时即可精准估算出工作流的运行时长与显存开销,为任务规划与智能体决策提供了低成本分析支持。目前, FlashLib 已在 GitHub 开源。
信源:https://flashml-org.github.io/index.html
flashml-org.github.io
FlashLib: Bringing Flash Magic to Classical Machine Learning Operators
FlashLib is a GPU library for classical machine learning operators on modern hardware, rebuilt for today's ML workloads and emerging agentic AI systems.
支持表情点赞直接审批与音频打断,OpenClaw发布v2026.5.26
开源 AI 助手项目 OpenClaw 发布了 v2026.5.26 版本,在移动端审批流与音频交互上迎来重要更新。新版本在 Signal 、 iMessage 与 WhatsApp 渠道中推出了表情点赞审批支持。用户收到敏感操作审批时,只需对消息做出大拇指点赞表情即可直接授权,告别了输入
为了精简底层依赖并优化网关性能,新版本引入了自主图像处理库 Rastermill ,彻底替换了体积臃肿的 Sharp 引擎与 Jimp 兜底库,免去了开发者额外安装原生图像库的步骤。网关在启动阶段通过跳过插件与会话系统扫描,大幅提升了启动速度。在安全防御上,浏览器快照读取接口引入了服务器端请求伪造( SSRF )过滤策略以严防越界嗅探,而会话排队机制也会自动清洗带有提示词样式的恶意文本,阻止插件标签伪造内部指令。新版还推出了临时活动监视面板( Activity Tab ),允许开发者实时查看工具链调用,且不持久化敏感日志。
信源:https://github.com/openclaw/openclaw/releases/tag/v2026.5.26
开源 AI 助手项目 OpenClaw 发布了 v2026.5.26 版本,在移动端审批流与音频交互上迎来重要更新。新版本在 Signal 、 iMessage 与 WhatsApp 渠道中推出了表情点赞审批支持。用户收到敏感操作审批时,只需对消息做出大拇指点赞表情即可直接授权,告别了输入
/approve 的繁杂操作。在音频交互上,新版在谷歌会议与 Discord 语音中内置了本地音频插话检测,当智能体检测到用户在设备端开口时会自动暂停播放。同时, Talk 实时语音会话支持从 Web 界面或 Discord 直接干预、转向与取消。为了精简底层依赖并优化网关性能,新版本引入了自主图像处理库 Rastermill ,彻底替换了体积臃肿的 Sharp 引擎与 Jimp 兜底库,免去了开发者额外安装原生图像库的步骤。网关在启动阶段通过跳过插件与会话系统扫描,大幅提升了启动速度。在安全防御上,浏览器快照读取接口引入了服务器端请求伪造( SSRF )过滤策略以严防越界嗅探,而会话排队机制也会自动清洗带有提示词样式的恶意文本,阻止插件标签伪造内部指令。新版还推出了临时活动监视面板( Activity Tab ),允许开发者实时查看工具链调用,且不持久化敏感日志。
信源:https://github.com/openclaw/openclaw/releases/tag/v2026.5.26