AI自评全是好评怎么办?Anthropic用GAN思路让Claude连续编程4小时,$124造出一个音乐工作站
Anthropic Labs 工程师 Prithvi Rajasekaran 发文详解团队如何让 Claude 连续数小时自主编写完整应用。他们发现了一个关键瓶颈:让 AI 自己检查自己的代码质量时,它几乎永远觉得自己写得不错,哪怕成品明显有问题也会放行。解法是把「写代码的 AI」和「审代码的 AI」拆成两个独立角色,后者专职挑毛病,比自我审查有效得多。
最终架构由三个 AI 协作:一个负责把用户的一句话需求扩展成完整产品方案,一个负责逐功能写代码,一个负责像真实用户一样点击、操作正在运行的应用并打分。写代码的 AI 和审代码的 AI 每轮开工前先对齐「这轮做什么、怎么算做完」,审代码的 AI 会真的去用这个应用,找出实际 bug 后把修改意见打回去。
对照实验很直观:同样一句「做一个 2D 复古游戏编辑器」,单个 AI 跑 20 分钟花 $9,产出的游戏画面能打开但核心玩法完全跑不通,角色不响应操作;三 AI 协作跑 6 小时花 $200,产出的版本可以正常操控角色、在关卡里移动,审核 AI 还在过程中抓到了填充工具只画端点不填区域、后端路由冲突等具体 bug。
Claude Opus 4.6 让这套架构得以大幅简化。此前 Sonnet 4.5 会在长任务后期「焦虑收尾」,还没做完就急着结束,必须定期清空记忆重新启动。Opus 4.6 基本消除了这个问题,写代码的 AI 可以在单次会话中连贯工作超过 2 小时。用简化后的架构生成浏览器端音乐制作工具,约 4 小时花费 $124.70,审核 AI 仍然捕获了「录音按钮只切状态但没接麦克风」「音频片段无法拖拽」等遗漏。
文章还透露了一个有趣的发现:在前端设计实验中,评分标准里的措辞会直接影响 AI 的审美方向。写上「最好的设计是博物馆级别的」之后,AI 在做一个荷兰艺术博物馆网站时,第十轮迭代自行推翻了前九轮的平面方案,改为用 CSS 渲染的 3D 展厅,让访客通过虚拟门廊在画廊之间穿行。
信源:https://www.anthropic.com/engineering/harness-design-long-running-apps
Anthropic Labs 工程师 Prithvi Rajasekaran 发文详解团队如何让 Claude 连续数小时自主编写完整应用。他们发现了一个关键瓶颈:让 AI 自己检查自己的代码质量时,它几乎永远觉得自己写得不错,哪怕成品明显有问题也会放行。解法是把「写代码的 AI」和「审代码的 AI」拆成两个独立角色,后者专职挑毛病,比自我审查有效得多。
最终架构由三个 AI 协作:一个负责把用户的一句话需求扩展成完整产品方案,一个负责逐功能写代码,一个负责像真实用户一样点击、操作正在运行的应用并打分。写代码的 AI 和审代码的 AI 每轮开工前先对齐「这轮做什么、怎么算做完」,审代码的 AI 会真的去用这个应用,找出实际 bug 后把修改意见打回去。
对照实验很直观:同样一句「做一个 2D 复古游戏编辑器」,单个 AI 跑 20 分钟花 $9,产出的游戏画面能打开但核心玩法完全跑不通,角色不响应操作;三 AI 协作跑 6 小时花 $200,产出的版本可以正常操控角色、在关卡里移动,审核 AI 还在过程中抓到了填充工具只画端点不填区域、后端路由冲突等具体 bug。
Claude Opus 4.6 让这套架构得以大幅简化。此前 Sonnet 4.5 会在长任务后期「焦虑收尾」,还没做完就急着结束,必须定期清空记忆重新启动。Opus 4.6 基本消除了这个问题,写代码的 AI 可以在单次会话中连贯工作超过 2 小时。用简化后的架构生成浏览器端音乐制作工具,约 4 小时花费 $124.70,审核 AI 仍然捕获了「录音按钮只切状态但没接麦克风」「音频片段无法拖拽」等遗漏。
文章还透露了一个有趣的发现:在前端设计实验中,评分标准里的措辞会直接影响 AI 的审美方向。写上「最好的设计是博物馆级别的」之后,AI 在做一个荷兰艺术博物馆网站时,第十轮迭代自行推翻了前九轮的平面方案,改为用 CSS 渲染的 3D 展厅,让访客通过虚拟门廊在画廊之间穿行。
信源:https://www.anthropic.com/engineering/harness-design-long-running-apps
🎉1
可灵AI年化收入2.4亿美元,快手四成新代码由AI生成
快手科技发布 2025 年第四季度及全年业绩。Q4 收入 395.68 亿元,同比增长 11.8%;全年收入 1427.76 亿元,同比增长 12.5%;全年经调整净利润 206.47 亿元,同比增长 16.5%,经调整净利润率升至 14.5%。Q4 日均活跃用户 4.08 亿,月均活跃用户 7.41 亿。
可灵 AI 是本期财报的核心增长叙事。Q4 收入 3.4 亿元,较 Q3 的逾 3 亿元继续增长;2025 年 12 月单月收入突破 2000 万美元,年化收入运行率(ARR)达到 2.4 亿美元。截至年底,可灵 AI 全球用户超 6000 万,累计生成超 6 亿个视频,为超 3 万家企业客户和开发者提供 API 服务。Q4 期间先后推出可灵 O1、可灵 2.6 和可灵 3.0 系列模型,其中可灵 2.6 推出「音画同出」能力,可灵 3.0 基于 All-in-One 理念实现从生成到专业创作调度的升级。
AI 对主营业务的渗透同样值得关注。线上营销方面,生成式推荐大模型和智能出价模型带动国内营销收入提升约 5%,AIGC 营销素材消耗约 40 亿元。电商方面,Q4 GMV 同比增长 12.9% 至 5218 亿元。快手自研 AI 编程工具 CoderFlicker 生成的代码已占新增代码的 40% 以上。全年研发支出同比增长 19%,主要投向 AI 和人力。
公司还宣布派发 2025 年度末期股息每股 0.69 港元,合计 30 亿港元,继去年 8 月上市以来首次特别股息后再次派息。
信源:https://www.bloomberg.com/news/articles/2026-03-25/kuaishou-tech-sales-climb-as-ai-monetization-gains-momentum
快手科技发布 2025 年第四季度及全年业绩。Q4 收入 395.68 亿元,同比增长 11.8%;全年收入 1427.76 亿元,同比增长 12.5%;全年经调整净利润 206.47 亿元,同比增长 16.5%,经调整净利润率升至 14.5%。Q4 日均活跃用户 4.08 亿,月均活跃用户 7.41 亿。
可灵 AI 是本期财报的核心增长叙事。Q4 收入 3.4 亿元,较 Q3 的逾 3 亿元继续增长;2025 年 12 月单月收入突破 2000 万美元,年化收入运行率(ARR)达到 2.4 亿美元。截至年底,可灵 AI 全球用户超 6000 万,累计生成超 6 亿个视频,为超 3 万家企业客户和开发者提供 API 服务。Q4 期间先后推出可灵 O1、可灵 2.6 和可灵 3.0 系列模型,其中可灵 2.6 推出「音画同出」能力,可灵 3.0 基于 All-in-One 理念实现从生成到专业创作调度的升级。
AI 对主营业务的渗透同样值得关注。线上营销方面,生成式推荐大模型和智能出价模型带动国内营销收入提升约 5%,AIGC 营销素材消耗约 40 亿元。电商方面,Q4 GMV 同比增长 12.9% 至 5218 亿元。快手自研 AI 编程工具 CoderFlicker 生成的代码已占新增代码的 40% 以上。全年研发支出同比增长 19%,主要投向 AI 和人力。
公司还宣布派发 2025 年度末期股息每股 0.69 港元,合计 30 亿港元,继去年 8 月上市以来首次特别股息后再次派息。
信源:https://www.bloomberg.com/news/articles/2026-03-25/kuaishou-tech-sales-climb-as-ai-monetization-gains-momentum
Harness Engineering正在成为AI编程的真正战场
AI 编程 IDE Qoder 发布长文梳理了一个正在成形的行业趋势:头部科技公司的 AI 编程竞争焦点已从模型能力本身转向模型之外的一切,即「Harness Engineering」(编排工程)。文章用一个类比概括:模型是 CPU,上下文窗口是内存,Harness 是操作系统,Agent 是应用程序。决定最终产出质量的不是 CPU 有多快,而是操作系统设计得多好。
文章整理了多家公司已公开的实践数据:
1. Stripe 在开源 Agent 框架 Goose 基础上构建了 Blueprint 状态机系统,每周合并超过 1300 个完全由 Agent 编写的 PR
2. Shopify 开源了 Roast 工作流框架,将 AI 步骤与确定性代码交替编排
3. Ramp 基于 OpenCode 构建了 Inspect 系统,在沙箱中并行执行,合并的 PR 中 30% 由 Agent 编写
4. Coinbase 自建 Cloudbot,将 PR 审查周期从 150 小时压缩到 15 小时
5. OpenAI 用 Codex 驱动整个产品迭代,3 名工程师(后扩展至 7 人)在五个月内以零手写代码方式交付了一个百万行级产品
Qoder 认为这些方案有一个共同的结构性限制:Agent 仍然是单体的,一个模型实例、一个上下文窗口、一条执行路径从头跑到尾。任务复杂度上升时会遇到五个瓶颈:上下文窗口变成零和博弈(研究、编码、测试、审查挤在同一窗口里);角色切换的认知开销(一个 Agent 同时当技术负责人、开发、QA 和代码审查员);长链执行中的目标漂移;功能正确性验证不足(代码干净但业务逻辑不对);终端命令执行的不可逆风险。
Qoder 据此推出了 Experts Mode(测试版),将单 Agent 拆成多个专家角色:Leader 负责协调和任务分解,开发、研究、浏览器测试、QA、代码审查各由独立 Agent 承担,每个 Agent 使用不同模型和独立上下文窗口。Qoder 称内部基准测试中,Experts Mode 质量比单 Agent 模式高 67%,比 Claude Code Agent Teams 高 16%,成本不到后者的三分之二。
信源:https://x.com/qoder_ai_ide/status/2036437931867644016
AI 编程 IDE Qoder 发布长文梳理了一个正在成形的行业趋势:头部科技公司的 AI 编程竞争焦点已从模型能力本身转向模型之外的一切,即「Harness Engineering」(编排工程)。文章用一个类比概括:模型是 CPU,上下文窗口是内存,Harness 是操作系统,Agent 是应用程序。决定最终产出质量的不是 CPU 有多快,而是操作系统设计得多好。
文章整理了多家公司已公开的实践数据:
1. Stripe 在开源 Agent 框架 Goose 基础上构建了 Blueprint 状态机系统,每周合并超过 1300 个完全由 Agent 编写的 PR
2. Shopify 开源了 Roast 工作流框架,将 AI 步骤与确定性代码交替编排
3. Ramp 基于 OpenCode 构建了 Inspect 系统,在沙箱中并行执行,合并的 PR 中 30% 由 Agent 编写
4. Coinbase 自建 Cloudbot,将 PR 审查周期从 150 小时压缩到 15 小时
5. OpenAI 用 Codex 驱动整个产品迭代,3 名工程师(后扩展至 7 人)在五个月内以零手写代码方式交付了一个百万行级产品
Qoder 认为这些方案有一个共同的结构性限制:Agent 仍然是单体的,一个模型实例、一个上下文窗口、一条执行路径从头跑到尾。任务复杂度上升时会遇到五个瓶颈:上下文窗口变成零和博弈(研究、编码、测试、审查挤在同一窗口里);角色切换的认知开销(一个 Agent 同时当技术负责人、开发、QA 和代码审查员);长链执行中的目标漂移;功能正确性验证不足(代码干净但业务逻辑不对);终端命令执行的不可逆风险。
Qoder 据此推出了 Experts Mode(测试版),将单 Agent 拆成多个专家角色:Leader 负责协调和任务分解,开发、研究、浏览器测试、QA、代码审查各由独立 Agent 承担,每个 Agent 使用不同模型和独立上下文窗口。Qoder 称内部基准测试中,Experts Mode 质量比单 Agent 模式高 67%,比 Claude Code Agent Teams 高 16%,成本不到后者的三分之二。
信源:https://x.com/qoder_ai_ide/status/2036437931867644016
X (formerly Twitter)
Qoder (@qoder_ai_ide) on X
How Qoder builds Harness Engineering into Experts Mode
Umi.js作者逆向Claude Code源码:Auto Mode背后是Sonnet当安全门卫,四层流水线决定每次操作能不能跑
蚂蚁集团工程师、前端框架 Umi.js 作者陈成逆向了 Claude Code 2.1.81 的源码,完整还原了 auto mode 按下之后发生的事情。核心发现:每一次工具调用都要过一条四层决策流水线,只有前三层都无法判断时,才会调用一个独立的 AI 分类器做安全审查。
四层流水线依次是:第一层检查已有的权限规则,命中直接放行;第二层模拟 acceptEdits 模式(即允许编辑文件的权限级别),如果在该模式下就会通过,说明风险很低,跳过分类器;第三层检查只读工具白名单(Read、Grep、Glob、LSP、WebSearch 等),这些不修改任何状态,无条件放行;以上都不满足时,才进入第四层,发一个独立的 API 请求给 Claude Sonnet 做安全分类。
分类器的几个关键设计细节:始终使用 Sonnet 而非 Opus,是成本和延迟的权衡;temperature 设为 0 以确保输出确定性;分类器被定义为「自主 AI 编程 Agent 的安全监控员」,保护三类风险(提示词注入、范围蔓延、意外损害);用户的 CLAUDE.md 配置文件会被注入分类器上下文,作为判断用户意图的依据。
拦截规则覆盖 22 个以上类别,包括 force push、直推 main 分支、下载并执行外部代码、生产部署、数据外泄、自我修改权限、创建远程代码执行面、凭证泄露等。放行例外有 7 类:测试用的硬编码密钥、工作目录内的本地文件操作、只读 GET 请求、安装已声明的依赖、官方工具链安装、读取配置凭证发送到目标提供商、推送到当前工作分支。
还有一套熔断机制:连续 3 次被拒绝或累计 20 次被拒绝后,系统降级为手动确认;headless 模式下直接中止 Agent。分类器不可用时,由一个 feature flag 控制是「fail-closed」(直接拒绝)还是「fail-open」(降级为手动确认)。
auto mode 下的行为提示词注入也有精细的频率控制:每 5 轮对话注入一次,每 5 次注入周期中第 1 次是完整版(约 800 字,包含「立即执行、减少打断、行动优于计划」等六条指令),其余 4 次是一行精简版,在上下文窗口占用和行为稳定性之间取得平衡。
信源:https://blog.sorrycc.com/claude-code-auto-mode
蚂蚁集团工程师、前端框架 Umi.js 作者陈成逆向了 Claude Code 2.1.81 的源码,完整还原了 auto mode 按下之后发生的事情。核心发现:每一次工具调用都要过一条四层决策流水线,只有前三层都无法判断时,才会调用一个独立的 AI 分类器做安全审查。
四层流水线依次是:第一层检查已有的权限规则,命中直接放行;第二层模拟 acceptEdits 模式(即允许编辑文件的权限级别),如果在该模式下就会通过,说明风险很低,跳过分类器;第三层检查只读工具白名单(Read、Grep、Glob、LSP、WebSearch 等),这些不修改任何状态,无条件放行;以上都不满足时,才进入第四层,发一个独立的 API 请求给 Claude Sonnet 做安全分类。
分类器的几个关键设计细节:始终使用 Sonnet 而非 Opus,是成本和延迟的权衡;temperature 设为 0 以确保输出确定性;分类器被定义为「自主 AI 编程 Agent 的安全监控员」,保护三类风险(提示词注入、范围蔓延、意外损害);用户的 CLAUDE.md 配置文件会被注入分类器上下文,作为判断用户意图的依据。
拦截规则覆盖 22 个以上类别,包括 force push、直推 main 分支、下载并执行外部代码、生产部署、数据外泄、自我修改权限、创建远程代码执行面、凭证泄露等。放行例外有 7 类:测试用的硬编码密钥、工作目录内的本地文件操作、只读 GET 请求、安装已声明的依赖、官方工具链安装、读取配置凭证发送到目标提供商、推送到当前工作分支。
还有一套熔断机制:连续 3 次被拒绝或累计 20 次被拒绝后,系统降级为手动确认;headless 模式下直接中止 Agent。分类器不可用时,由一个 feature flag 控制是「fail-closed」(直接拒绝)还是「fail-open」(降级为手动确认)。
auto mode 下的行为提示词注入也有精细的频率控制:每 5 轮对话注入一次,每 5 次注入周期中第 1 次是完整版(约 800 字,包含「立即执行、减少打断、行动优于计划」等六条指令),其余 4 次是一行精简版,在上下文窗口占用和行为稳定性之间取得平衡。
信源:https://blog.sorrycc.com/claude-code-auto-mode
👍1
DeepSeek一口气放17个岗位全押Agent:要求重度使用Claude Code,全栈岗写明Vibe Coding优先
DeepSeek 集中开放 17 个招聘岗位,核心研发方向从基础模型研究明确转向 Agent 产品化。三个专属 Agent 岗位覆盖算法研究、数据评测和基础设施全链条:算法研究员聚焦强化学习在大模型对齐中的应用(RLHF/RLAIF、过程奖励、偏好学习等方向);数据评测专家负责构建评测数据集,针对 Agent 的规划、工具调用、多轮交互、长期记忆等能力设计测试用例;基础设施工程师负责搭建 Agent 运行底座,包括集成外部工具到内部强化学习基础设施、搭建评测平台。
招聘要求中有两个值得注意的信号。多个岗位在加分项中明确写出「重度使用 Claude Code、Cursor、Copilot 等 AI 编程工具」优先。全栈开发工程师岗位职责中出现了一条不常见的描述:「作为 Vibe Coding 重度用户,持续探索模型能力在产品中的创新应用」,同一岗位的核心工作方向是构建「支撑海量 AI Agent 运行的下一代容器调度与隔离平台」。
模型策略产品经理岗位单独设立了 Agent 方向,要求候选人熟悉 Claude Code、OpenClaw、Manus 等 Agent 产品,需洞察高价值应用场景(包括个人助理、Deep Research、自动化工作流、多模态设备控制),并主导 Agent 评测体系及训练数据方案设计。对比今年 1 月,当时开放的核心岗位集中在「深度学习研究员-AGI」等通用方向,此次招聘重心已明显向 Agent 产品化倾斜。
信源:https://app.mokahr.com/social-recruitment/high-flyer/140576#/
DeepSeek 集中开放 17 个招聘岗位,核心研发方向从基础模型研究明确转向 Agent 产品化。三个专属 Agent 岗位覆盖算法研究、数据评测和基础设施全链条:算法研究员聚焦强化学习在大模型对齐中的应用(RLHF/RLAIF、过程奖励、偏好学习等方向);数据评测专家负责构建评测数据集,针对 Agent 的规划、工具调用、多轮交互、长期记忆等能力设计测试用例;基础设施工程师负责搭建 Agent 运行底座,包括集成外部工具到内部强化学习基础设施、搭建评测平台。
招聘要求中有两个值得注意的信号。多个岗位在加分项中明确写出「重度使用 Claude Code、Cursor、Copilot 等 AI 编程工具」优先。全栈开发工程师岗位职责中出现了一条不常见的描述:「作为 Vibe Coding 重度用户,持续探索模型能力在产品中的创新应用」,同一岗位的核心工作方向是构建「支撑海量 AI Agent 运行的下一代容器调度与隔离平台」。
模型策略产品经理岗位单独设立了 Agent 方向,要求候选人熟悉 Claude Code、OpenClaw、Manus 等 Agent 产品,需洞察高价值应用场景(包括个人助理、Deep Research、自动化工作流、多模态设备控制),并主导 Agent 评测体系及训练数据方案设计。对比今年 1 月,当时开放的核心岗位集中在「深度学习研究员-AGI」等通用方向,此次招聘重心已明显向 Agent 产品化倾斜。
信源:https://app.mokahr.com/social-recruitment/high-flyer/140576#/
豆包手机助手幕后操盘手:36氪创始人刘成城,其团队在字节内部与抖音平级
科技媒体 36 氪创始人刘成城目前担任字节跳动 AI 硬件团队 Ocean 负责人,直接向 AI 产品团队 Flow 负责人朱骏汇报,操盘豆包手机助手及字节全线 AI 硬件业务。刘成城 2019 年以 30 岁年纪带领 36 氪登陆纳斯达克后,秘密创办鲸鲮科技,研发国产操作系统及平板硬件并主要售往海外。该公司后被字节收购,刘成城及创始团队随之进入字节内部。
入职后他推动了字节对开放式耳机品牌 Oladance 的全资收购(约 5000 万美元),随后主导首款 AI 硬件 Ola Friend 上线。AI 眼镜项目因硬件同质化于今年 2 月内部叫停后,Ocean 团队的战略重心已转向豆包手机助手,这款能在系统层跨应用执行复杂任务的产品被视为字节 AI 硬件线真正的突破口。Flow 团队(含 Ocean)在字节内部拥有与抖音团队平级的优先级。
信源:https://mp.weixin.qq.com/s/WhgrPVqoHX8GNgjAZJ6LKw
科技媒体 36 氪创始人刘成城目前担任字节跳动 AI 硬件团队 Ocean 负责人,直接向 AI 产品团队 Flow 负责人朱骏汇报,操盘豆包手机助手及字节全线 AI 硬件业务。刘成城 2019 年以 30 岁年纪带领 36 氪登陆纳斯达克后,秘密创办鲸鲮科技,研发国产操作系统及平板硬件并主要售往海外。该公司后被字节收购,刘成城及创始团队随之进入字节内部。
入职后他推动了字节对开放式耳机品牌 Oladance 的全资收购(约 5000 万美元),随后主导首款 AI 硬件 Ola Friend 上线。AI 眼镜项目因硬件同质化于今年 2 月内部叫停后,Ocean 团队的战略重心已转向豆包手机助手,这款能在系统层跨应用执行复杂任务的产品被视为字节 AI 硬件线真正的突破口。Flow 团队(含 Ocean)在字节内部拥有与抖音团队平级的优先级。
信源:https://mp.weixin.qq.com/s/WhgrPVqoHX8GNgjAZJ6LKw
🎉1
不只是调用:苹果可在自家机房把Gemini蒸馏成iPhone小模型
苹果与谷歌的 AI 合作协议「远比外界此前了解的更深」。苹果在自有数据中心内拥有对 Gemini 大模型的完整访问权限,可将其蒸馏为适配特定任务的小模型,甚至缩小到能直接在苹果设备端运行。
由于拥有完整模型访问权,苹果的蒸馏不仅能模仿 Gemini 输出的答案,还能学习其内部推理计算过程,生成性能接近原始大模型但算力需求大幅降低的小模型。知情人士称苹果获得了「远超预期的自由度」。苹果内部的 Foundation Models 团队仍在自研模型,但目标方向尚不明确。报道同时确认,苹果计划在今年 6 月 WWDC 上发布 Siri 重大升级,包括对话记忆和基于场景的主动建议功能。
信源:https://www.theinformation.com/newsletters/ai-agenda/apple-can-distill-googles-big-gemini-model
苹果与谷歌的 AI 合作协议「远比外界此前了解的更深」。苹果在自有数据中心内拥有对 Gemini 大模型的完整访问权限,可将其蒸馏为适配特定任务的小模型,甚至缩小到能直接在苹果设备端运行。
由于拥有完整模型访问权,苹果的蒸馏不仅能模仿 Gemini 输出的答案,还能学习其内部推理计算过程,生成性能接近原始大模型但算力需求大幅降低的小模型。知情人士称苹果获得了「远超预期的自由度」。苹果内部的 Foundation Models 团队仍在自研模型,但目标方向尚不明确。报道同时确认,苹果计划在今年 6 月 WWDC 上发布 Siri 重大升级,包括对话记忆和基于场景的主动建议功能。
信源:https://www.theinformation.com/newsletters/ai-agenda/apple-can-distill-googles-big-gemini-model
Meta一天内裁员700人:Reality Labs再遭重创,今年已累计裁逾千人
Meta 周三确认裁员约 700 人,波及 Reality Labs、Facebook、招聘、销售和全球运营等多个部门,部分员工将获得内部转岗机会。今年 1 月 Meta 已裁撤 Reality Labs 超 1000 个岗位(约占该部门 10%),两轮裁员集中冲击元宇宙团队,显示 Meta 正系统性将资源从元宇宙转向 AI。
Meta 发言人称各团队「定期进行重组或调整,以确保处于实现目标的最佳位置」。裁员消息与前一日披露的高管巨额期权激励计划形成鲜明对比。截至 2025 年底 Meta 约有 7.9 万名员工,2026 年资本开支指引为 1150 亿至 1350 亿美元,绝大部分用于 AI 基础设施。
信源:https://www.nytimes.com/2026/03/25/technology/meta-layoffs-ai-executives.html
Meta 周三确认裁员约 700 人,波及 Reality Labs、Facebook、招聘、销售和全球运营等多个部门,部分员工将获得内部转岗机会。今年 1 月 Meta 已裁撤 Reality Labs 超 1000 个岗位(约占该部门 10%),两轮裁员集中冲击元宇宙团队,显示 Meta 正系统性将资源从元宇宙转向 AI。
Meta 发言人称各团队「定期进行重组或调整,以确保处于实现目标的最佳位置」。裁员消息与前一日披露的高管巨额期权激励计划形成鲜明对比。截至 2025 年底 Meta 约有 7.9 万名员工,2026 年资本开支指引为 1150 亿至 1350 亿美元,绝大部分用于 AI 基础设施。
信源:https://www.nytimes.com/2026/03/25/technology/meta-layoffs-ai-executives.html
OpenClaw v2026.3.24:Gateway新增OpenAI API兼容端点,微软Teams迁移官方SDK
开源 AI 助手 OpenClaw(龙虾)发布 v2026.3.24 版本。Gateway 新增
微软 Teams 渠道迁移至官方 SDK,新增流式 1:1 回复、欢迎卡片与提示词建议、反馈机制、打字提示和原生 AI 标签,同时支持已发送消息的编辑和删除。其他主要更新:
1. 内置 Skills 新增一键安装引导,CLI 和控制面板在依赖缺失时自动提示安装
2. 新增
3. Agent
4. Slack 交互回复恢复富文本格式,支持自动将尾部选项文本渲染为按钮或下拉菜单
5. Discord 支持 LLM 自动生成线程标题
6. Node.js 最低版本降至 22.14+,继续推荐 Node 24
安全修复方面,本版本封堵了
信源:https://github.com/openclaw/openclaw/releases/tag/v2026.3.24
开源 AI 助手 OpenClaw(龙虾)发布 v2026.3.24 版本。Gateway 新增
/v1/models 和 /v1/embeddings 端点,并在 /v1/chat/completions 和 /v1/responses 中支持转发显式模型指定参数,使用 OpenAI API 格式的第三方客户端和 RAG 应用可直接对接 OpenClaw Gateway。微软 Teams 渠道迁移至官方 SDK,新增流式 1:1 回复、欢迎卡片与提示词建议、反馈机制、打字提示和原生 AI 标签,同时支持已发送消息的编辑和删除。其他主要更新:
1. 内置 Skills 新增一键安装引导,CLI 和控制面板在依赖缺失时自动提示安装
2. 新增
--container 参数,支持在 Docker 或 Podman 容器内执行 OpenClaw 命令3. Agent
/tools 改为展示当前实际可用工具,控制面板新增实时可用状态面板4. Slack 交互回复恢复富文本格式,支持自动将尾部选项文本渲染为按钮或下拉菜单
5. Discord 支持 LLM 自动生成线程标题
6. Node.js 最低版本降至 22.14+,继续推荐 Node 24
安全修复方面,本版本封堵了
mediaUrl`/`fileUrl 别名绕过沙箱媒体目录限制的漏洞,并修复了 Gateway 重启后 Agent 会话可能无法正确恢复到对应 Telegram 话题或 Slack 线程的问题。信源:https://github.com/openclaw/openclaw/releases/tag/v2026.3.24
❤1
奔驰把国产AI放进了迈巴赫:智谱联合清华为S级打造端侧多模态大模型
梅赛德斯-奔驰中国宣布,与清华大学、今年 1 月在港交所上市的 AI 大模型公司智谱联合开发的端侧多模态大模型将落地新一代迈巴赫 S 级及全新 S 级轿车。该模型部署于后排娱乐系统,融合自然语言处理与视觉、音频等多模态理解及生成能力,结合车内摄像头等感知硬件,在本地算力条件下完成推理。据智谱官方表述,奔驰由此成为首个在后排娱乐系统中应用多模态大模型的汽车品牌。
信源:https://mp.weixin.qq.com/s/uqtpVaRjyosw6T7e1qw_oA
梅赛德斯-奔驰中国宣布,与清华大学、今年 1 月在港交所上市的 AI 大模型公司智谱联合开发的端侧多模态大模型将落地新一代迈巴赫 S 级及全新 S 级轿车。该模型部署于后排娱乐系统,融合自然语言处理与视觉、音频等多模态理解及生成能力,结合车内摄像头等感知硬件,在本地算力条件下完成推理。据智谱官方表述,奔驰由此成为首个在后排娱乐系统中应用多模态大模型的汽车品牌。
信源:https://mp.weixin.qq.com/s/uqtpVaRjyosw6T7e1qw_oA
给龙虾发条抖店链接就能出片:创作Agent 2.0接入Seedance 2.0
字节跳动云服务平台火山引擎发布营销视频生成工具创作 Agent 2.0,接入自研视频生成模型 Seedance 2.0,视频时长从短片段扩展至 60 秒,支持多语言口播,覆盖品牌广告、产品评测、卖点演绎、Vlog 等 6 类营销场景。画面一致性也有提升,可保持人脸稳定、商品细节不变形、文字清晰可读。
创作 Agent 2.0 同步上架火山引擎 AI Agent 平台 ArkClaw 的官方 Skill 库。用户向龙虾发送抖店商品链接,即可自动读取商品信息、生成创意分析与分镜脚本,在对话中直接输出营销短视频。
信源:https://mp.weixin.qq.com/s/CDgA_e7rNoqgfKHVwGTsFg
字节跳动云服务平台火山引擎发布营销视频生成工具创作 Agent 2.0,接入自研视频生成模型 Seedance 2.0,视频时长从短片段扩展至 60 秒,支持多语言口播,覆盖品牌广告、产品评测、卖点演绎、Vlog 等 6 类营销场景。画面一致性也有提升,可保持人脸稳定、商品细节不变形、文字清晰可读。
创作 Agent 2.0 同步上架火山引擎 AI Agent 平台 ArkClaw 的官方 Skill 库。用户向龙虾发送抖店商品链接,即可自动读取商品信息、生成创意分析与分镜脚本,在对话中直接输出营销短视频。
信源:https://mp.weixin.qq.com/s/CDgA_e7rNoqgfKHVwGTsFg
手机上也能用AI操作工作软件了:Claude移动端上线Figma、Canva等集成
Anthropic 宣布 Claude 的工具集成(connectors)现已扩展至移动端,iOS 和 Android 用户可在手机上的 Claude 对话中直接浏览 Figma 设计稿、创建 Canva 幻灯片、查看 Amplitude 数据看板。
Connectors 基于 MCP 协议连接第三方应用,目前已覆盖 Slack、Google Drive、Linear 等工具,部分 connector 支持交互模式,可在对话界面中渲染实时操作界面而非纯文本回复。用户需先在桌面端完成 connector 的添加和授权,移动端暂不支持新增或浏览 connector 目录。
信源:https://x.com/claudeai/status/2036850783526719610
Anthropic 宣布 Claude 的工具集成(connectors)现已扩展至移动端,iOS 和 Android 用户可在手机上的 Claude 对话中直接浏览 Figma 设计稿、创建 Canva 幻灯片、查看 Amplitude 数据看板。
Connectors 基于 MCP 协议连接第三方应用,目前已覆盖 Slack、Google Drive、Linear 等工具,部分 connector 支持交互模式,可在对话界面中渲染实时操作界面而非纯文本回复。用户需先在桌面端完成 connector 的添加和授权,移动端暂不支持新增或浏览 connector 目录。
信源:https://x.com/claudeai/status/2036850783526719610
谷歌发布Lyria 3 Pro:AI生成音乐从30秒延长到3分钟,登陆5个平台
谷歌发布音乐生成模型 Lyria 3 Pro,单曲时长从前代 Lyria 3 的 30 秒延长至 3 分钟,支持指定前奏、主歌、副歌、桥段等歌曲结构。模型同时登陆五个平台:
1. Gemini 应用(仅付费用户,免费用户仍可使用 Lyria 3)
2. Vertex AI(企业公共预览)
3. Google AI Studio 及 Gemini API(开发者可用)
4. Google Vids(面向 Workspace 用户本周起滚动上线)
5. ProducerAI(谷歌上月收购的协作音乐创作工具,全球免费和付费用户均可使用)
所有 Lyria 生成的音频均嵌入 SynthID 水印以标识 AI 生成内容。谷歌称训练数据来自「YouTube 和谷歌依据服务条款、合作协议及适用法律有权使用的素材」,模型不会模仿特定艺术家风格。同一周,Spotify 上线了 Artist Profile Protection 功能,要求发行方手动审批艺术家新上架内容,以对抗 AI 克隆假冒。
信源:https://blog.google/innovation-and-ai/technology/ai/lyria-3-pro/
谷歌发布音乐生成模型 Lyria 3 Pro,单曲时长从前代 Lyria 3 的 30 秒延长至 3 分钟,支持指定前奏、主歌、副歌、桥段等歌曲结构。模型同时登陆五个平台:
1. Gemini 应用(仅付费用户,免费用户仍可使用 Lyria 3)
2. Vertex AI(企业公共预览)
3. Google AI Studio 及 Gemini API(开发者可用)
4. Google Vids(面向 Workspace 用户本周起滚动上线)
5. ProducerAI(谷歌上月收购的协作音乐创作工具,全球免费和付费用户均可使用)
所有 Lyria 生成的音频均嵌入 SynthID 水印以标识 AI 生成内容。谷歌称训练数据来自「YouTube 和谷歌依据服务条款、合作协议及适用法律有权使用的素材」,模型不会模仿特定艺术家风格。同一周,Spotify 上线了 Artist Profile Protection 功能,要求发行方手动审批艺术家新上架内容,以对抗 AI 克隆假冒。
信源:https://blog.google/innovation-and-ai/technology/ai/lyria-3-pro/
美团开源LongCat-Next:3B参数统一视觉理解、生成与语音
美团龙猫团队开源 LongCat-Next,一个基于 MoE 架构、激活参数 3B 的原生多模态模型,在单一自回归框架下统一了文本、视觉理解、图像生成、语音理解和语音合成五种能力。模型及配套分词器以 MIT 许可证开源,权重已上线 HuggingFace。
LongCat-Next 的核心设计是 DiNA(离散原生自回归)范式:通过为每种模态设计配对的分词器和解码器,将视觉和音频信号转化为离散 token,与文本共享同一嵌入空间,用统一的 next-token prediction 完成所有任务。视觉侧的关键组件 dNaViT(离散原生分辨率 Vision Transformer)将图像特征提取为「视觉词」,支持动态分词和解码,在 28 倍压缩比下仍保持较强的图像生成质量,尤其在文字渲染方面表现突出。
在同等激活参数量级(A3B)的模型对比中,LongCat-Next 的主要基准表现:
1. 视觉理解:MMMU-Pro 60.3(Qwen3-Omni 57.0,GPT5-minimal 62.7),MathVista 83.1(Qwen3-Omni 75.9,GPT5-minimal 50.9),MathVision 64.7(领先所有对比模型),DocVQA 94.2
2. 图像生成:GenEval 84.44,LongText-EN 93.15(FLUX.1-dev 60.70,Emu-3.5 97.60)
3. 编程:SWE-Bench 43.0(Kimi-Linear-48B 32.8,Qwen3-Next-80B 37.6)
4. Agent 工具调用:Tau2-Retail 73.68(Qwen3-Next 57.3),Tau2-Telecom 62.06(Qwen3-Next 13.2)
在理解与生成统一模型的横向对比中,LongCat-Next 的 MMMU 得分 70.6 领先第二名 NEO-unify(68.9),大幅超过 BAGEL(55.3)和 Ovis-U1(51.1)等此前的统一模型方案。SWE-Bench 43.0 和 Tau2 系列工具调用基准的表现也说明,这一多模态统一架构并未牺牲纯文本和 Agent 能力。
信源:https://longcat.chat/longcat-next/intro
美团龙猫团队开源 LongCat-Next,一个基于 MoE 架构、激活参数 3B 的原生多模态模型,在单一自回归框架下统一了文本、视觉理解、图像生成、语音理解和语音合成五种能力。模型及配套分词器以 MIT 许可证开源,权重已上线 HuggingFace。
LongCat-Next 的核心设计是 DiNA(离散原生自回归)范式:通过为每种模态设计配对的分词器和解码器,将视觉和音频信号转化为离散 token,与文本共享同一嵌入空间,用统一的 next-token prediction 完成所有任务。视觉侧的关键组件 dNaViT(离散原生分辨率 Vision Transformer)将图像特征提取为「视觉词」,支持动态分词和解码,在 28 倍压缩比下仍保持较强的图像生成质量,尤其在文字渲染方面表现突出。
在同等激活参数量级(A3B)的模型对比中,LongCat-Next 的主要基准表现:
1. 视觉理解:MMMU-Pro 60.3(Qwen3-Omni 57.0,GPT5-minimal 62.7),MathVista 83.1(Qwen3-Omni 75.9,GPT5-minimal 50.9),MathVision 64.7(领先所有对比模型),DocVQA 94.2
2. 图像生成:GenEval 84.44,LongText-EN 93.15(FLUX.1-dev 60.70,Emu-3.5 97.60)
3. 编程:SWE-Bench 43.0(Kimi-Linear-48B 32.8,Qwen3-Next-80B 37.6)
4. Agent 工具调用:Tau2-Retail 73.68(Qwen3-Next 57.3),Tau2-Telecom 62.06(Qwen3-Next 13.2)
在理解与生成统一模型的横向对比中,LongCat-Next 的 MMMU 得分 70.6 领先第二名 NEO-unify(68.9),大幅超过 BAGEL(55.3)和 Ovis-U1(51.1)等此前的统一模型方案。SWE-Bench 43.0 和 Tau2 系列工具调用基准的表现也说明,这一多模态统一架构并未牺牲纯文本和 Agent 能力。
信源:https://longcat.chat/longcat-next/intro
GitHub默认用你的代码训练AI:Copilot个人版用户4月24日起需主动关闭
GitHub 宣布更新 Copilot 数据使用政策,4 月 24 日起,Copilot Free、Pro 和 Pro+ 用户的交互数据将默认用于训练和改进 AI 模型,除非用户主动在设置中关闭。Copilot Business 和 Enterprise 用户不受影响。此前已选择退出数据收集的用户,偏好设置将被保留,无需重新操作。
GitHub 将收集的数据范围包括:
1. 用户接受或修改的代码输出
2. 发送给 Copilot 的输入和代码片段
3. 光标周围的代码上下文
4. 注释和文档
5. 文件名、仓库结构与导航模式
6. 与 Copilot 各功能(Chat、内联建议等)的交互记录
7. 用户对建议的评分反馈
虽然 GitHub 称不会使用私有仓库中「静态存储」的内容,但用户在使用 Copilot 时,私有仓库的代码会被实时处理,这部分交互数据同样可能被用于模型训练,除非用户选择退出。
数据可能与微软等关联公司共享,但不会提供给第三方 AI 模型供应商。GitHub 首席产品官 Mario Rodriguez 在博文中表示,此前已使用微软员工的交互数据训练模型,「在多种编程语言中看到了接受率的显著提升」,希望通过更广泛的真实开发数据进一步改善模型表现。用户可在 GitHub 设置的「Privacy」选项中关闭数据共享。
信源:https://github.blog/news-insights/company-news/updates-to-github-copilot-interaction-data-usage-policy/
GitHub 宣布更新 Copilot 数据使用政策,4 月 24 日起,Copilot Free、Pro 和 Pro+ 用户的交互数据将默认用于训练和改进 AI 模型,除非用户主动在设置中关闭。Copilot Business 和 Enterprise 用户不受影响。此前已选择退出数据收集的用户,偏好设置将被保留,无需重新操作。
GitHub 将收集的数据范围包括:
1. 用户接受或修改的代码输出
2. 发送给 Copilot 的输入和代码片段
3. 光标周围的代码上下文
4. 注释和文档
5. 文件名、仓库结构与导航模式
6. 与 Copilot 各功能(Chat、内联建议等)的交互记录
7. 用户对建议的评分反馈
虽然 GitHub 称不会使用私有仓库中「静态存储」的内容,但用户在使用 Copilot 时,私有仓库的代码会被实时处理,这部分交互数据同样可能被用于模型训练,除非用户选择退出。
数据可能与微软等关联公司共享,但不会提供给第三方 AI 模型供应商。GitHub 首席产品官 Mario Rodriguez 在博文中表示,此前已使用微软员工的交互数据训练模型,「在多种编程语言中看到了接受率的显著提升」,希望通过更广泛的真实开发数据进一步改善模型表现。用户可在 GitHub 设置的「Privacy」选项中关闭数据共享。
信源:https://github.blog/news-insights/company-news/updates-to-github-copilot-interaction-data-usage-policy/
Harvey三个月估值从80亿涨到110亿美元:10万律师已在用AI Agent做尽调
法律 AI 公司 Harvey 完成 2 亿美元新一轮融资,由新加坡主权基金 GIC 和 Sequoia 联合领投,估值从去年 12 月的 80 亿美元升至 110 亿美元。Sequoia 已连续领投 Harvey 三轮融资,合伙人 Pat Grady 称这在 Sequoia 历史上极为罕见。公司累计融资总额超过 10 亿美元。
Harvey 成立于 2022 年,由前律师 Winston Weinberg 和前谷歌 DeepMind 及 Meta 研究员 Gabe Pereyra 联合创立,产品覆盖合同分析、合规审查、尽职调查和诉讼支持。目前服务超过 10 万名律师和 1300 家机构,客户包括 AmLaw 100 中的多数律所以及 NBCUniversal、汇丰等企业。1 月年化营收达 1.9 亿美元,较去年 8 月的 1 亿美元接近翻倍。平台上运行着超过 2.5 万个定制 AI Agent。
信源:https://www.cnbc.com/2026/03/25/legal-ai-startup-harvey-raises-200-million-at-11-billion-valuation.html
法律 AI 公司 Harvey 完成 2 亿美元新一轮融资,由新加坡主权基金 GIC 和 Sequoia 联合领投,估值从去年 12 月的 80 亿美元升至 110 亿美元。Sequoia 已连续领投 Harvey 三轮融资,合伙人 Pat Grady 称这在 Sequoia 历史上极为罕见。公司累计融资总额超过 10 亿美元。
Harvey 成立于 2022 年,由前律师 Winston Weinberg 和前谷歌 DeepMind 及 Meta 研究员 Gabe Pereyra 联合创立,产品覆盖合同分析、合规审查、尽职调查和诉讼支持。目前服务超过 10 万名律师和 1300 家机构,客户包括 AmLaw 100 中的多数律所以及 NBCUniversal、汇丰等企业。1 月年化营收达 1.9 亿美元,较去年 8 月的 1 亿美元接近翻倍。平台上运行着超过 2.5 万个定制 AI Agent。
信源:https://www.cnbc.com/2026/03/25/legal-ai-startup-harvey-raises-200-million-at-11-billion-valuation.html
JetBrains关停协作编程工具,押注Agent:「代码生成已不再是瓶颈」
JetBrains 发布 Central,为企业提供统一管理 AI 编程 Agent 的平台,覆盖权限管控与成本审计、云端 Agent 运行环境、以及跨仓库的代码知识共享三大能力。Central 不绑定自家工具,同时支持 Claude Agent、Codex、Gemini CLI 等外部 Agent 接入。配套产品包括浏览器端开发环境 Air(air.dev)和即将推出的人机协作工具 Air Team,早期体验计划预计今年第二季度以设计合作伙伴形式小范围开放。
同日,JetBrains 宣布关停实时协作编程工具 Code With Me。该工具在疫情期间需求见顶,之后持续下滑。2026.1 版本起从 IDE 中解绑为独立插件,公共中继基础设施将于 2027 年第一季度关闭。消息在开发者社区引发不满,有用户留言称「我们是两人远程团队,全天结对编程,这个功能消失对我们的工作流将是毁灭性打击」。
JetBrains Agent 平台负责人 Oleg Koverznev 表示「代码生成已经很廉价,不再是瓶颈」,真正的挑战是管理 Agent 驱动工作带来的运营和经济复杂性。据 JetBrains AI Pulse 调查(2026 年 1 月,1.1 万名开发者),90% 的受访者已在工作中使用 AI,22% 已使用 AI 编程 Agent,66% 的企业计划在 12 个月内部署 Agent,但仅 13% 将 AI 应用到了代码审查或发布管线等完整开发生命周期中。The Register 评论称 AI 浪潮让 JetBrains 传统 IDE 业务承压,一边关停人与人的协作工具,一边押注人与 Agent 的协作平台,转型意图明显。
信源:https://blog.jetbrains.com/blog/2026/03/24/introducing-jetbrains-central-an-open-system-for-agentic-software-development/
JetBrains 发布 Central,为企业提供统一管理 AI 编程 Agent 的平台,覆盖权限管控与成本审计、云端 Agent 运行环境、以及跨仓库的代码知识共享三大能力。Central 不绑定自家工具,同时支持 Claude Agent、Codex、Gemini CLI 等外部 Agent 接入。配套产品包括浏览器端开发环境 Air(air.dev)和即将推出的人机协作工具 Air Team,早期体验计划预计今年第二季度以设计合作伙伴形式小范围开放。
同日,JetBrains 宣布关停实时协作编程工具 Code With Me。该工具在疫情期间需求见顶,之后持续下滑。2026.1 版本起从 IDE 中解绑为独立插件,公共中继基础设施将于 2027 年第一季度关闭。消息在开发者社区引发不满,有用户留言称「我们是两人远程团队,全天结对编程,这个功能消失对我们的工作流将是毁灭性打击」。
JetBrains Agent 平台负责人 Oleg Koverznev 表示「代码生成已经很廉价,不再是瓶颈」,真正的挑战是管理 Agent 驱动工作带来的运营和经济复杂性。据 JetBrains AI Pulse 调查(2026 年 1 月,1.1 万名开发者),90% 的受访者已在工作中使用 AI,22% 已使用 AI 编程 Agent,66% 的企业计划在 12 个月内部署 Agent,但仅 13% 将 AI 应用到了代码审查或发布管线等完整开发生命周期中。The Register 评论称 AI 浪潮让 JetBrains 传统 IDE 业务承压,一边关停人与人的协作工具,一边押注人与 Agent 的协作平台,转型意图明显。
信源:https://blog.jetbrains.com/blog/2026/03/24/introducing-jetbrains-central-an-open-system-for-agentic-software-development/
SK海力士申请赴美上市:拟募最高144亿美元,或为五年来最大美股IPO
韩国存储芯片巨头 SK 海力士已向美国证券监管机构提交秘密上市申请,目标在 2026 年下半年完成美股上市。知情人士透露,公司计划发行约 2%-3% 的总股份,按当前市值计算融资规模在 96 亿至 144 亿美元之间,有望成为五年来最大的美股上市交易,超过 2021 年韩国电商平台 Coupang 的 46 亿美元 IPO。
SK 海力士 CEO Kwak Noh-jung 在年度股东大会上表示,赴美上市是推动公司价值在全球最大股票市场获得重新评估的举措。募集资金将用于韩国龙仁和美国印第安纳州的芯片工厂建设。此举也与美国对非在美投资的芯片厂商施加关税压力的背景相关,美国商务部长 Howard Lutnick 此前表示,未在美国扩产的韩国和中国台湾芯片厂商可能面临最高 100% 的关税。
韩国企业治理论坛对发行新股表示反对,认为此举将稀释现有股东权益,建议公司先回购 10%-15% 的股票再用于美股上市。
信源:https://www.reuters.com/world/asia-pacific/sk-hynix-files-confidentiality-2026-us-listing-2026-03-24/
韩国存储芯片巨头 SK 海力士已向美国证券监管机构提交秘密上市申请,目标在 2026 年下半年完成美股上市。知情人士透露,公司计划发行约 2%-3% 的总股份,按当前市值计算融资规模在 96 亿至 144 亿美元之间,有望成为五年来最大的美股上市交易,超过 2021 年韩国电商平台 Coupang 的 46 亿美元 IPO。
SK 海力士 CEO Kwak Noh-jung 在年度股东大会上表示,赴美上市是推动公司价值在全球最大股票市场获得重新评估的举措。募集资金将用于韩国龙仁和美国印第安纳州的芯片工厂建设。此举也与美国对非在美投资的芯片厂商施加关税压力的背景相关,美国商务部长 Howard Lutnick 此前表示,未在美国扩产的韩国和中国台湾芯片厂商可能面临最高 100% 的关税。
韩国企业治理论坛对发行新股表示反对,认为此举将稀释现有股东权益,建议公司先回购 10%-15% 的股票再用于美股上市。
信源:https://www.reuters.com/world/asia-pacific/sk-hynix-files-confidentiality-2026-us-listing-2026-03-24/
微软或需赔马斯克250亿美元?法官批准关键证词,OpenAI案下月开庭
OpenAI 联合创始人 Elon Musk 诉 OpenAI 及微软「违反慈善信托」案中,主审法官周三裁定,马斯克方损害赔偿专家、经济咨询公司 Berkeley Research Group 经济学家 C. Paul Wazzan 可在庭审中出庭作证。
Wazzan 的计算模型认定,以 OpenAI 估值 5000 亿美元为基准,微软在 OpenAI 的持股减去投资额后价值 1150 亿美元,其中 OpenAI 非营利实体对该持股的贡献高达 29%,马斯克凭借早期捐款和支持应获得该非营利实体最多 75% 的功劳。据此推算,若陪审团认定微软协助 OpenAI 违反慈善宗旨,微软或需赔偿最高 250 亿美元。微软律师辩称该分析未区分哪些收益源于微软的涉嫌不当行为,但法官裁定协助和教唆将使微软对 OpenAI 造成的全部损害承担连带责任,具体哪些投资构成协助行为由陪审团认定。
法官同时裁定,马斯克方 AI 安全专家、加州大学伯克利分校计算机科学教授 Stuart Russell 可就先进 AI 的风险作证,但不得引用他人对 AI 造成灾难性危害的概率估计。马斯克方合计索赔最高 1340 亿美元,另计划追加惩罚性赔偿。马斯克本月在 X 上承诺,若胜诉全部赔偿金将捐出,「不会从中获利分毫」。案件定于 4 月 28 日在奥克兰联邦法院开庭。
信源:https://www.theinformation.com/briefings/judge-approves-testimony-microsoft-owe-elon-musk-25-billion
OpenAI 联合创始人 Elon Musk 诉 OpenAI 及微软「违反慈善信托」案中,主审法官周三裁定,马斯克方损害赔偿专家、经济咨询公司 Berkeley Research Group 经济学家 C. Paul Wazzan 可在庭审中出庭作证。
Wazzan 的计算模型认定,以 OpenAI 估值 5000 亿美元为基准,微软在 OpenAI 的持股减去投资额后价值 1150 亿美元,其中 OpenAI 非营利实体对该持股的贡献高达 29%,马斯克凭借早期捐款和支持应获得该非营利实体最多 75% 的功劳。据此推算,若陪审团认定微软协助 OpenAI 违反慈善宗旨,微软或需赔偿最高 250 亿美元。微软律师辩称该分析未区分哪些收益源于微软的涉嫌不当行为,但法官裁定协助和教唆将使微软对 OpenAI 造成的全部损害承担连带责任,具体哪些投资构成协助行为由陪审团认定。
法官同时裁定,马斯克方 AI 安全专家、加州大学伯克利分校计算机科学教授 Stuart Russell 可就先进 AI 的风险作证,但不得引用他人对 AI 造成灾难性危害的概率估计。马斯克方合计索赔最高 1340 亿美元,另计划追加惩罚性赔偿。马斯克本月在 X 上承诺,若胜诉全部赔偿金将捐出,「不会从中获利分毫」。案件定于 4 月 28 日在奥克兰联邦法院开庭。
信源:https://www.theinformation.com/briefings/judge-approves-testimony-microsoft-owe-elon-musk-25-billion
The Information
Judge Approves Testimony that Microsoft Could Owe Elon Musk $25 Billion
The judge overseeing Elon Musk’s breach of charitable trust lawsuit against OpenAI and Microsoft ruled Wednesday that Musk’s damages expert, an economist at economic consulting firm Berkeley Research Group, is allowed to present his testimony at trial.…
Anthropic公开auto mode安全架构:故意不让分类器看到Agent的「内心独白」
Anthropic 发布 Claude Code auto mode 的工程技术文章,详细披露了分类器的架构设计、威胁模型和性能基准。
auto mode 针对四类威胁源建模:Agent 越权(帮倒忙)、理解错误(误判操作范围)、prompt injection(外部注入劫持 Agent)、以及模型对齐偏移(追求自身目标)。文章列举了真实拦截案例:用户说「清理分支」后 Agent 尝试批量删除远程分支;Agent 系统性扫描环境变量中的 API 密钥;未经确认就删除「最接近」的资源;将脚本发布到公共服务;部署失败后自动加
分类器最核心的设计决策是信息剥离:分类器只看用户消息和待执行的工具调用,故意不看 Agent 的推理文本和工具返回结果。这样做有两层作用,一是防止 Agent 在推理链中编造理由「说服」分类器放行危险操作,二是隔离工具返回结果中可能携带的 prompt injection 指令。分类管线分两阶段,第一阶段用单 token 快速过滤,偏向拦截(误报率 8.5%);被标记的操作进入第二阶段链式推理,误报率降至 0.4%,且第二阶段的提示词几乎完全命中第一阶段的缓存,额外成本很低。
Anthropic 公布了三组基准数据:真实流量 10000 条样本中误报率 0.4%;52 条真实越权行为样本中漏报率 17%;1000 条合成数据外泄测试中漏报率 5.7%。Anthropic 称 17% 的漏报是「诚实的代价」,大多数漏报并非分类器没发现风险,而是错误判断用户授权已覆盖该操作的影响范围。操作被拦截后 Agent 不会暂停等待用户,而是自动重试并寻找更安全的替代方案,连续 3 次或累计 20 次被拒后才降级为手动确认。
信源:https://www.anthropic.com/engineering/claude-code-auto-mode
Anthropic 发布 Claude Code auto mode 的工程技术文章,详细披露了分类器的架构设计、威胁模型和性能基准。
auto mode 针对四类威胁源建模:Agent 越权(帮倒忙)、理解错误(误判操作范围)、prompt injection(外部注入劫持 Agent)、以及模型对齐偏移(追求自身目标)。文章列举了真实拦截案例:用户说「清理分支」后 Agent 尝试批量删除远程分支;Agent 系统性扫描环境变量中的 API 密钥;未经确认就删除「最接近」的资源;将脚本发布到公共服务;部署失败后自动加
--skip-verification 重试。分类器最核心的设计决策是信息剥离:分类器只看用户消息和待执行的工具调用,故意不看 Agent 的推理文本和工具返回结果。这样做有两层作用,一是防止 Agent 在推理链中编造理由「说服」分类器放行危险操作,二是隔离工具返回结果中可能携带的 prompt injection 指令。分类管线分两阶段,第一阶段用单 token 快速过滤,偏向拦截(误报率 8.5%);被标记的操作进入第二阶段链式推理,误报率降至 0.4%,且第二阶段的提示词几乎完全命中第一阶段的缓存,额外成本很低。
Anthropic 公布了三组基准数据:真实流量 10000 条样本中误报率 0.4%;52 条真实越权行为样本中漏报率 17%;1000 条合成数据外泄测试中漏报率 5.7%。Anthropic 称 17% 的漏报是「诚实的代价」,大多数漏报并非分类器没发现风险,而是错误判断用户授权已覆盖该操作的影响范围。操作被拦截后 Agent 不会暂停等待用户,而是自动重试并寻找更安全的替代方案,连续 3 次或累计 20 次被拒后才降级为手动确认。
信源:https://www.anthropic.com/engineering/claude-code-auto-mode
前五角大楼二号人物:中美「完全有可能」就AI规则达成协议
美国前副国防部长 Kathleen Hicks 在 Axios AI+DC 峰会上表示,中美两国在 AI 治理上达成协议是「完全有可能的」。她透露拜登政府曾与中方推进双边对话,并认为当前 AI 领域的激烈竞争反而创造了设定规则的机会,「他们可能更倾向于这样做」。她同时提到联合国等多边场合的持续讨论,称中方可以在这些平台「走上前台」。2023 年已有超过 50 个国家在海牙签署了《负责任军事使用 AI 和自主系统政治宣言》。
信源:https://www.axios.com/2026/03/25/us-china-ai-pentagon-hicks
美国前副国防部长 Kathleen Hicks 在 Axios AI+DC 峰会上表示,中美两国在 AI 治理上达成协议是「完全有可能的」。她透露拜登政府曾与中方推进双边对话,并认为当前 AI 领域的激烈竞争反而创造了设定规则的机会,「他们可能更倾向于这样做」。她同时提到联合国等多边场合的持续讨论,称中方可以在这些平台「走上前台」。2023 年已有超过 50 个国家在海牙签署了《负责任军事使用 AI 和自主系统政治宣言》。
信源:https://www.axios.com/2026/03/25/us-china-ai-pentagon-hicks