只看截图就能操作浏览器:AI2开源80亿参数网页Agent,四项基准超GPT-4o方案
非营利 AI 研究机构 AI2(Allen Institute for AI)发布开源视觉网页智能体 MolmoWeb,基于其 Molmo 2 多模态模型构建,提供 4B 和 8B 两个版本,模型权重、训练数据、代码和评估工具全部公开。
MolmoWeb 的核心设计是纯视觉驱动:通过截图理解网页界面,不依赖 HTML 或无障碍树等结构化页面数据。模型在每一步接收任务指令和当前页面截图,生成推理过程和下一步浏览器操作(点击、输入、滚动等),可完成搜索、表单填写、商品比价等日常任务。单张截图远比序列化的页面结构紧凑,且视觉界面在底层代码变动时仍保持稳定。
在 WebVoyager、Online-Mind2Web、DeepShop、WebTailBench 四个主流基准上,MolmoWeb (8B) 均为开源模型最优:WebVoyager 78.2%、DeepShop 42.3%、WebTailBench 49.5%,全面超越此前最强的开源模型 Fara-7B。4B 版本在 30 步限制下也优于 Fara-7B 的 100 步表现。MolmoWeb 还超越了基于 GPT-4o 等闭源模型构建的网页智能体,后者使用了标注截图和结构化页面数据等更丰富的输入。通过测试时扩展(运行多次独立推理取最优),8B 模型在 WebVoyager 上可达 94.7%(pass@4)。
AI2 同步开源训练数据集 MolmoWebMix,包含 3.6 万条人类操作轨迹(覆盖 1100 多个网站、62.3 万个子任务演示)、由文本智能体生成的合成轨迹,以及 220 万组网页截图问答对。训练过程未使用任何闭源视觉智能体的蒸馏数据。
信源:https://allenai.org/blog/molmoweb
非营利 AI 研究机构 AI2(Allen Institute for AI)发布开源视觉网页智能体 MolmoWeb,基于其 Molmo 2 多模态模型构建,提供 4B 和 8B 两个版本,模型权重、训练数据、代码和评估工具全部公开。
MolmoWeb 的核心设计是纯视觉驱动:通过截图理解网页界面,不依赖 HTML 或无障碍树等结构化页面数据。模型在每一步接收任务指令和当前页面截图,生成推理过程和下一步浏览器操作(点击、输入、滚动等),可完成搜索、表单填写、商品比价等日常任务。单张截图远比序列化的页面结构紧凑,且视觉界面在底层代码变动时仍保持稳定。
在 WebVoyager、Online-Mind2Web、DeepShop、WebTailBench 四个主流基准上,MolmoWeb (8B) 均为开源模型最优:WebVoyager 78.2%、DeepShop 42.3%、WebTailBench 49.5%,全面超越此前最强的开源模型 Fara-7B。4B 版本在 30 步限制下也优于 Fara-7B 的 100 步表现。MolmoWeb 还超越了基于 GPT-4o 等闭源模型构建的网页智能体,后者使用了标注截图和结构化页面数据等更丰富的输入。通过测试时扩展(运行多次独立推理取最优),8B 模型在 WebVoyager 上可达 94.7%(pass@4)。
AI2 同步开源训练数据集 MolmoWebMix,包含 3.6 万条人类操作轨迹(覆盖 1100 多个网站、62.3 万个子任务演示)、由文本智能体生成的合成轨迹,以及 220 万组网页截图问答对。训练过程未使用任何闭源视觉智能体的蒸馏数据。
信源:https://allenai.org/blog/molmoweb
AI Agent也要有域名了:.agent顶级域名社区竞标下月启动,Brave、阿里云等700家公司加入
一个由 3000 多名成员(700 多家公司和 2300 多名开发者)组成的社区正在向 ICANN 申请 .agent 顶级域名,主张这一 AI 命名层应由社区治理,而非被单一公司控制。隐私浏览器 Brave 宣布已注册 .agent 域名并加入该倡议,其他参与方还包括 Ollama、Datadog、Netlify、Sourcegraph、阿里云、Product Hunt 等。
该社区认为,.agent 之于 AI Agent 网络,就像 DNS 之于早期互联网:谁控制了命名层,谁就能决定哪些 Agent 可以被发现、哪些被封锁。社区治理模式旨在确保透明的注册政策、可预期的定价,以及不受任何单一公司董事会左右的准入规则。
ICANN 的申请窗口将于 2026 年 4 月下旬开放,持续 90 天。在有争议的顶级域名分配中,ICANN 采用「社区优先评估」(CPE)机制,由第三方专家小组从社区规模、与域名的关联度、注册政策和社区背书四个维度打分,社区的成员数量和多样性直接影响竞标结果。
信源:https://agentcommunity.org/about
一个由 3000 多名成员(700 多家公司和 2300 多名开发者)组成的社区正在向 ICANN 申请 .agent 顶级域名,主张这一 AI 命名层应由社区治理,而非被单一公司控制。隐私浏览器 Brave 宣布已注册 .agent 域名并加入该倡议,其他参与方还包括 Ollama、Datadog、Netlify、Sourcegraph、阿里云、Product Hunt 等。
该社区认为,.agent 之于 AI Agent 网络,就像 DNS 之于早期互联网:谁控制了命名层,谁就能决定哪些 Agent 可以被发现、哪些被封锁。社区治理模式旨在确保透明的注册政策、可预期的定价,以及不受任何单一公司董事会左右的准入规则。
ICANN 的申请窗口将于 2026 年 4 月下旬开放,持续 90 天。在有争议的顶级域名分配中,ICANN 采用「社区优先评估」(CPE)机制,由第三方专家小组从社区规模、与域名的关联度、注册政策和社区背书四个维度打分,社区的成员数量和多样性直接影响竞标结果。
信源:https://agentcommunity.org/about
阿里云JVS Claw全面开放:无需邀请码即可「养虾」,新增语音和文件空间
阿里云宣布 AI 智能体产品 JVS Claw 全面开放,所有用户无需邀请码,下载客户端即可获得一只云端「龙虾」。此前该产品处于邀请制内测阶段。
新版主要更新:
1. 手机 App 新增语音输入,支持语音下达任务
2. JVS 文件空间提供 5GB 专属存储,可在多轮对话中搜索历史任务
3. 新增 Skill 管控台,支持第三方 Skill 自定义开关
4. Clawbot 支持一键热升级,无需重建
5. 新增定时任务专用入口
6. 支持微博龙虾助手一键接入
阿里云同步发布《JVS 养虾宝典》,列举 20 多种使用场景。
信源:https://mp.weixin.qq.com/s/1UGnrKk9PSIQ0XkWKmiBPw?clicktime=1774418862&enterid=1774418862&scene=126&sessionid=1774418861&subscene=7
阿里云宣布 AI 智能体产品 JVS Claw 全面开放,所有用户无需邀请码,下载客户端即可获得一只云端「龙虾」。此前该产品处于邀请制内测阶段。
新版主要更新:
1. 手机 App 新增语音输入,支持语音下达任务
2. JVS 文件空间提供 5GB 专属存储,可在多轮对话中搜索历史任务
3. 新增 Skill 管控台,支持第三方 Skill 自定义开关
4. Clawbot 支持一键热升级,无需重建
5. 新增定时任务专用入口
6. 支持微博龙虾助手一键接入
阿里云同步发布《JVS 养虾宝典》,列举 20 多种使用场景。
信源:https://mp.weixin.qq.com/s/1UGnrKk9PSIQ0XkWKmiBPw?clicktime=1774418862&enterid=1774418862&scene=126&sessionid=1774418861&subscene=7
Cursor发布Composer2技术报告:RL环境完全模拟真实用户场景,底座模型得分提升70%
Cursor 发布 Composer 2 技术报告,首次披露完整训练方案。底座 Kimi K2.5 为 MoE 架构,总参数 1.04 万亿、激活参数 320 亿。训练分两阶段:先在代码数据上继续预训练以增强编码知识,再通过大规模强化学习提升端到端编码能力。RL 环境完全模拟真实 Cursor 使用场景,包括文件编辑、终端操作、代码搜索等工具调用,让模型在接近生产环境的条件下学习。
报告同步公布了自研基准 CursorBench 的构建方法:从工程团队的真实编码会话中采集任务,而非人工构造。底座 Kimi K2.5 在该基准上仅得 36.0 分,经两阶段训练后 Composer 2 达到 61.3 分,提升 70%。Cursor 称其推理成本显著低于 GPT-5.4 和 Claude Opus 4.6 等前沿模型 API,在准确率与成本之间实现帕累托最优。
信源:https://cursor.com/resources/Composer2.pdf
Cursor 发布 Composer 2 技术报告,首次披露完整训练方案。底座 Kimi K2.5 为 MoE 架构,总参数 1.04 万亿、激活参数 320 亿。训练分两阶段:先在代码数据上继续预训练以增强编码知识,再通过大规模强化学习提升端到端编码能力。RL 环境完全模拟真实 Cursor 使用场景,包括文件编辑、终端操作、代码搜索等工具调用,让模型在接近生产环境的条件下学习。
报告同步公布了自研基准 CursorBench 的构建方法:从工程团队的真实编码会话中采集任务,而非人工构造。底座 Kimi K2.5 在该基准上仅得 36.0 分,经两阶段训练后 Composer 2 达到 61.3 分,提升 70%。Cursor 称其推理成本显著低于 GPT-5.4 和 Claude Opus 4.6 等前沿模型 API,在准确率与成本之间实现帕累托最优。
信源:https://cursor.com/resources/Composer2.pdf
Papers with Code创始团队再出发:OpenReward上线330+强化学习环境,一个API训练AI Agent
Papers with Code 联合创始人 Ross Taylor 创办的伦敦 AI 研发公司 General Reasoning 发布开放平台 OpenReward,提供 330 多个强化学习环境和超 450 万个独立任务,开发者通过单一 API 即可训练和评估 AI 智能体。平台基于团队同步发布的 Open Reward Standard(ORS),一个开源 HTTP 协议,环境代码托管在 GitHub,可与任意训练框架和沙盒提供商对接,平台提供可选的托管基础设施,按实际用量计费。
Taylor 此前在 Meta AI 主导了 Llama 2/3 的研发,也是科学大模型 Galactica 的第一作者。他与 Robert Stojnic 于 2018 年联合创建 Papers with Code,后被 Meta 收购,去年关闭。General Reasoning 成立于 2025 年,去年完成 1090 万美元融资。
首批上线的重点环境包括:
1. 英伟达 Nemotron-Math-Proofs-v1:约 58 万道数学证明题,附带 90 万条推理轨迹
2. Nebius 的 SWE-rebench-V2:覆盖 Python、JavaScript、Go、Rust 的 3.2 万多个软件工程任务
3. Eigent 的 SETA:面向 CLI 操作的训练环境,提供 1000 至 1 万个任务
4. EndlessTerminals:程序化生成的终端任务环境
平台目前为公开测试版,训练功能以早期研究预览形式开放,计算资源有限。
信源:https://www.gr.inc/releases/introducing-openreward
Papers with Code 联合创始人 Ross Taylor 创办的伦敦 AI 研发公司 General Reasoning 发布开放平台 OpenReward,提供 330 多个强化学习环境和超 450 万个独立任务,开发者通过单一 API 即可训练和评估 AI 智能体。平台基于团队同步发布的 Open Reward Standard(ORS),一个开源 HTTP 协议,环境代码托管在 GitHub,可与任意训练框架和沙盒提供商对接,平台提供可选的托管基础设施,按实际用量计费。
Taylor 此前在 Meta AI 主导了 Llama 2/3 的研发,也是科学大模型 Galactica 的第一作者。他与 Robert Stojnic 于 2018 年联合创建 Papers with Code,后被 Meta 收购,去年关闭。General Reasoning 成立于 2025 年,去年完成 1090 万美元融资。
首批上线的重点环境包括:
1. 英伟达 Nemotron-Math-Proofs-v1:约 58 万道数学证明题,附带 90 万条推理轨迹
2. Nebius 的 SWE-rebench-V2:覆盖 Python、JavaScript、Go、Rust 的 3.2 万多个软件工程任务
3. Eigent 的 SETA:面向 CLI 操作的训练环境,提供 1000 至 1 万个任务
4. EndlessTerminals:程序化生成的终端任务环境
平台目前为公开测试版,训练功能以早期研究预览形式开放,计算资源有限。
信源:https://www.gr.inc/releases/introducing-openreward
Figure创始人自掏1亿美元做「个人AI」:前苹果iPhone Air设计师加盟,要造一系列AI硬件
人形机器人公司 Figure CEO Brett Adcock 宣布创办新 AI 实验室 Hark,目标是打造「全球最先进的个人智能」,将自研多模态模型与定制硬件深度整合,构建人与机器之间的通用交互界面。Hark 已秘密运营 8 个月,由 Adcock 个人出资 1 亿美元启动,据福布斯估算其净资产为 191 亿美元。
Adcock 对 Bloomberg 表示,Hark 正在开发「一系列 AI 设备,既有个人用的,也有家庭用的」,形态将有别于现有的手机、可穿戴设备和智能眼镜。首批 AI 模型计划今年夏天发布,硬件随后跟进。
团队方面,前苹果工业设计师 Abidur Chowdhury 出任设计负责人,他在苹果工作七年,参与了 iPhone 和 Mac 产品线设计,包括近期的 iPhone Air。硬件团队还引入了苹果资深员工 David Narajowski 和 Dave Wilkes。AI 研究侧从 Meta 超级智能实验室(Superintelligence Lab)招入多名高级研究员。团队目前约 45 人,预计上半年扩至 100 人,成员还来自谷歌、亚马逊和特斯拉。Hark 已与英伟达达成算力协议,数千块 GPU 将于下月上线用于模型训练。
Adcock 是连续创业者,2022 年创办的 Figure 最近一轮估值 390 亿美元,此前还创办了招聘平台 Vettery(1 亿美元退出)、电动垂直起降飞行器公司 Archer(NYSE: ACHR)和武器检测公司 Cover。Figure 将保持独立运营。
信源:https://x.com/adcock_brett/status/2036461258443202810
人形机器人公司 Figure CEO Brett Adcock 宣布创办新 AI 实验室 Hark,目标是打造「全球最先进的个人智能」,将自研多模态模型与定制硬件深度整合,构建人与机器之间的通用交互界面。Hark 已秘密运营 8 个月,由 Adcock 个人出资 1 亿美元启动,据福布斯估算其净资产为 191 亿美元。
Adcock 对 Bloomberg 表示,Hark 正在开发「一系列 AI 设备,既有个人用的,也有家庭用的」,形态将有别于现有的手机、可穿戴设备和智能眼镜。首批 AI 模型计划今年夏天发布,硬件随后跟进。
团队方面,前苹果工业设计师 Abidur Chowdhury 出任设计负责人,他在苹果工作七年,参与了 iPhone 和 Mac 产品线设计,包括近期的 iPhone Air。硬件团队还引入了苹果资深员工 David Narajowski 和 Dave Wilkes。AI 研究侧从 Meta 超级智能实验室(Superintelligence Lab)招入多名高级研究员。团队目前约 45 人,预计上半年扩至 100 人,成员还来自谷歌、亚马逊和特斯拉。Hark 已与英伟达达成算力协议,数千块 GPU 将于下月上线用于模型训练。
Adcock 是连续创业者,2022 年创办的 Figure 最近一轮估值 390 亿美元,此前还创办了招聘平台 Vettery(1 亿美元退出)、电动垂直起降飞行器公司 Archer(NYSE: ACHR)和武器检测公司 Cover。Figure 将保持独立运营。
信源:https://x.com/adcock_brett/status/2036461258443202810
让AI编程助手直接操控桌面:Zig原生CLI工具usecomputer开源,兼容Claude Code和Codex
开源开发者 Tommaso De Rossi 发布桌面自动化命令行工具 usecomputer,用 Zig 编写原生二进制文件,不依赖 Node.js 运行时,让 AI 编程助手(Claude Code、Codex、OpenCode 等)直接控制桌面的鼠标、键盘和截图。支持 macOS 和 Linux(X11,Wayland 通过 XWayland 兼容)。
usecomputer 提供截图、鼠标移动/点击/拖拽/滚动、键盘输入和快捷键合成等 CLI 命令,附带坐标映射系统(coord-map),将截图中的像素坐标自动转换为实际屏幕坐标。截图输出默认将最长边缩放至 1568 像素以适配模型上下文窗口。工具还支持 Kitty Graphics Protocol,设置环境变量后截图可直接内联到模型上下文中,无需额外读取文件。
De Rossi 此前开发了浏览器自动化工具 Playwriter(3200+ GitHub 星标),usecomputer 从浏览器自动化延伸到桌面自动化。项目从其 kimaki 单仓库中独立拆出,同时提供 CLI 和 Node.js 库两种使用方式,README 中包含 OpenAI computer tool 和 Anthropic computer use 的完整集成示例。
信源:https://github.com/remorses/usecomputer
开源开发者 Tommaso De Rossi 发布桌面自动化命令行工具 usecomputer,用 Zig 编写原生二进制文件,不依赖 Node.js 运行时,让 AI 编程助手(Claude Code、Codex、OpenCode 等)直接控制桌面的鼠标、键盘和截图。支持 macOS 和 Linux(X11,Wayland 通过 XWayland 兼容)。
usecomputer 提供截图、鼠标移动/点击/拖拽/滚动、键盘输入和快捷键合成等 CLI 命令,附带坐标映射系统(coord-map),将截图中的像素坐标自动转换为实际屏幕坐标。截图输出默认将最长边缩放至 1568 像素以适配模型上下文窗口。工具还支持 Kitty Graphics Protocol,设置环境变量后截图可直接内联到模型上下文中,无需额外读取文件。
De Rossi 此前开发了浏览器自动化工具 Playwriter(3200+ GitHub 星标),usecomputer 从浏览器自动化延伸到桌面自动化。项目从其 kimaki 单仓库中独立拆出,同时提供 CLI 和 Node.js 库两种使用方式,README 中包含 OpenAI computer tool 和 Anthropic computer use 的完整集成示例。
信源:https://github.com/remorses/usecomputer
GSM8K团队五年后再出手:25道博士级数学题,所有前沿模型正确率不到10%
AI 数据标注公司 Surge AI 发布数学基准测试 Riemann-bench。Surge AI 五年前与 OpenAI 合作构建了 GSM8K,当时 GPT-3 系列在该测试上正确率不到 20%,如今 GSM8K 已成为行业入门级基准。Riemann-bench 瞄准的是另一个层级:25 道来自常春藤联盟数学教授、博士生和 IMO 奖牌得主自身研究中的问题,出题者本人往往需要数周才能独立解出,示例题目的预估解题时间为 40 至 50 小时。
当前排名:Claude Opus 4.6 和 Gemini 3.1 Pro 并列第一,正确率均为 6%;Kimi K2.5 和 Gemini 3 Pro 并列第三,4%;DeepSeek v3.2 为 3%;GPT-5.2 和 Claude Opus 4.5 均为 2%。GPT-5.4 系列因 API 报错尚未完成测试。
与 FrontierMath 等现有数学基准相比,Riemann-bench 有两个设计差异:一是不限制 Agent 的推理框架和 token 上限,允许模型自由使用工具和多步推理;二是采用双盲验证,每道题由两位独立领域专家从零解题确认答案。题库完全保密,防止模型针对性优化。
信源:https://surgehq.ai/blog/riemann-bench-a-benchmark-for-moonshot-mathematics
AI 数据标注公司 Surge AI 发布数学基准测试 Riemann-bench。Surge AI 五年前与 OpenAI 合作构建了 GSM8K,当时 GPT-3 系列在该测试上正确率不到 20%,如今 GSM8K 已成为行业入门级基准。Riemann-bench 瞄准的是另一个层级:25 道来自常春藤联盟数学教授、博士生和 IMO 奖牌得主自身研究中的问题,出题者本人往往需要数周才能独立解出,示例题目的预估解题时间为 40 至 50 小时。
当前排名:Claude Opus 4.6 和 Gemini 3.1 Pro 并列第一,正确率均为 6%;Kimi K2.5 和 Gemini 3 Pro 并列第三,4%;DeepSeek v3.2 为 3%;GPT-5.2 和 Claude Opus 4.5 均为 2%。GPT-5.4 系列因 API 报错尚未完成测试。
与 FrontierMath 等现有数学基准相比,Riemann-bench 有两个设计差异:一是不限制 Agent 的推理框架和 token 上限,允许模型自由使用工具和多步推理;二是采用双盲验证,每道题由两位独立领域专家从零解题确认答案。题库完全保密,防止模型针对性优化。
信源:https://surgehq.ai/blog/riemann-bench-a-benchmark-for-moonshot-mathematics
马斯克预告Grok Imagine v2:「下一版将是史诗级的」
Elon Musk 发帖称 xAI 图像生成工具 Grok Imagine 的下一个版本「将是史诗级的,我们正在加倍投入」。Grok 官方账号随后回复确认新版本名为 Grok Imagine v2,称将在「创造力和真实感」上大幅提升。未披露具体发布日期和技术细节。
信源:https://x.com/grok/status/2036693952435265941
Elon Musk 发帖称 xAI 图像生成工具 Grok Imagine 的下一个版本「将是史诗级的,我们正在加倍投入」。Grok 官方账号随后回复确认新版本名为 Grok Imagine v2,称将在「创造力和真实感」上大幅提升。未披露具体发布日期和技术细节。
信源:https://x.com/grok/status/2036693952435265941
Anthropic经济指数:老用户成功率高10%,编程任务正从网页端迁移到API
Anthropic 发布第三期经济指数报告,基于 2026 年 2 月 Claude 使用数据分析 AI 对经济的影响。
核心发现是「学习曲线」效应:使用 Claude 超过 6 个月的老用户,对话成功率比新用户高约 10%,即使在控制了任务类型、国家、模型选择等变量后,差距仍有约 4 个百分点。老用户更倾向于与 Claude 协作迭代,而非简单下达指令,用于工作的比例高出 7 个百分点,处理的任务所需教育水平也更高。
使用场景方面,编程仍是最大类别,占 Claude.ai 对话的 35%,但正加速从网页端迁移到 API。Claude Code 的 Agent 架构将编程工作拆分为更小的 API 调用,推动 API 端编程份额持续上升。Claude.ai 上使用场景更加分散,前 10 大任务占比从 24% 降至 19%,个人用途(体育赛事、产品比较、家庭维护等)从 35% 升至 42%。Claude.ai 上任务的平均经济价值(以对应美国职业时薪衡量)从 49.3 美元微降至 47.9 美元。
用户在选择模型时表现出明显的任务匹配行为:付费用户在编程任务中选择 Opus 的比例比平均水平高 4 个百分点,在辅导类任务中低 7 个百分点。API 端这种差异更为明显,任务价值每增加 10 美元时薪,Opus 使用比例上升 2.8 个百分点。
API 端两类新兴自动化工作流增长尤为突出,份额至少翻倍:企业销售外联自动化(线索筛选、客户数据补充、冷邮件撰写)和自动化交易与市场运营(市场监控、投资建议、交易提醒)。
地理分布上,美国各州之间的使用差距继续收窄,但速度放缓,按当前趋势需 5 至 9 年才能趋于均等。国际差距则略有扩大,前 20 个国家的人均使用份额从 45% 升至 48%。报告指出,49% 的职业已有至少四分之一的任务通过 Claude 完成。
信源:https://www.anthropic.com/research/economic-index-march-2026-report
Anthropic 发布第三期经济指数报告,基于 2026 年 2 月 Claude 使用数据分析 AI 对经济的影响。
核心发现是「学习曲线」效应:使用 Claude 超过 6 个月的老用户,对话成功率比新用户高约 10%,即使在控制了任务类型、国家、模型选择等变量后,差距仍有约 4 个百分点。老用户更倾向于与 Claude 协作迭代,而非简单下达指令,用于工作的比例高出 7 个百分点,处理的任务所需教育水平也更高。
使用场景方面,编程仍是最大类别,占 Claude.ai 对话的 35%,但正加速从网页端迁移到 API。Claude Code 的 Agent 架构将编程工作拆分为更小的 API 调用,推动 API 端编程份额持续上升。Claude.ai 上使用场景更加分散,前 10 大任务占比从 24% 降至 19%,个人用途(体育赛事、产品比较、家庭维护等)从 35% 升至 42%。Claude.ai 上任务的平均经济价值(以对应美国职业时薪衡量)从 49.3 美元微降至 47.9 美元。
用户在选择模型时表现出明显的任务匹配行为:付费用户在编程任务中选择 Opus 的比例比平均水平高 4 个百分点,在辅导类任务中低 7 个百分点。API 端这种差异更为明显,任务价值每增加 10 美元时薪,Opus 使用比例上升 2.8 个百分点。
API 端两类新兴自动化工作流增长尤为突出,份额至少翻倍:企业销售外联自动化(线索筛选、客户数据补充、冷邮件撰写)和自动化交易与市场运营(市场监控、投资建议、交易提醒)。
地理分布上,美国各州之间的使用差距继续收窄,但速度放缓,按当前趋势需 5 至 9 年才能趋于均等。国际差距则略有扩大,前 20 个国家的人均使用份额从 45% 升至 48%。报告指出,49% 的职业已有至少四分之一的任务通过 Claude 完成。
信源:https://www.anthropic.com/research/economic-index-march-2026-report
分析:Anthropic年化营收190亿美元同比涨14倍,但和OpenAI的250亿不是一本账
《The Information》分析称,Anthropic 2 月底年化营收突破 190 亿美元,同比增长约 14 倍;同期 OpenAI 年化营收约 250 亿美元,同比增约 4 倍。
两家的年化计算方法几乎一致:取最近四周收入乘以 13(对应一年 52 周)。Anthropic 的细节是 API 收入按四周乘以 13,订阅收入按当日活跃订阅数折算月收入再乘以 12。此前 X 上有声音质疑 Anthropic 的年化算法与 OpenAI 存在重大差异,该报道否定了这一猜测。
但两家在云渠道收入的记账方式上确有实质分歧。微软通过 Azure 向客户转售 OpenAI 模型,OpenAI 仅将自己分到的 20% 计为营收,因为微软被认定为该服务的「委托人」(principal),直接控制交付并拥有 OpenAI 知识产权的独家使用权。Anthropic 则将 AWS、谷歌、微软三家云平台转售 Claude 的全部销售额计为自己的营收,付给云厂商的分成记入销售与营销费用,理由是 Anthropic 自身才是委托人,云厂商只是分销商。两种处理均符合 GAAP,但导致两家的营收数字无法直接对比。
报道认为,比较两家实验室或许自由现金流是更好的指标:Anthropic 预计最早 2028 年转正,比 OpenAI 早两年。其他数据:Anthropic 2025 年全年实际营收约 45 亿美元;OpenAI 约 131 亿美元,预计 2026 年增至约 300 亿美元。
信源:https://www.theinformation.com/newsletters/dealmaker/math-behind-anthropics-mad-revenue-growth
《The Information》分析称,Anthropic 2 月底年化营收突破 190 亿美元,同比增长约 14 倍;同期 OpenAI 年化营收约 250 亿美元,同比增约 4 倍。
两家的年化计算方法几乎一致:取最近四周收入乘以 13(对应一年 52 周)。Anthropic 的细节是 API 收入按四周乘以 13,订阅收入按当日活跃订阅数折算月收入再乘以 12。此前 X 上有声音质疑 Anthropic 的年化算法与 OpenAI 存在重大差异,该报道否定了这一猜测。
但两家在云渠道收入的记账方式上确有实质分歧。微软通过 Azure 向客户转售 OpenAI 模型,OpenAI 仅将自己分到的 20% 计为营收,因为微软被认定为该服务的「委托人」(principal),直接控制交付并拥有 OpenAI 知识产权的独家使用权。Anthropic 则将 AWS、谷歌、微软三家云平台转售 Claude 的全部销售额计为自己的营收,付给云厂商的分成记入销售与营销费用,理由是 Anthropic 自身才是委托人,云厂商只是分销商。两种处理均符合 GAAP,但导致两家的营收数字无法直接对比。
报道认为,比较两家实验室或许自由现金流是更好的指标:Anthropic 预计最早 2028 年转正,比 OpenAI 早两年。其他数据:Anthropic 2025 年全年实际营收约 45 亿美元;OpenAI 约 131 亿美元,预计 2026 年增至约 300 亿美元。
信源:https://www.theinformation.com/newsletters/dealmaker/math-behind-anthropics-mad-revenue-growth
Meta收购Manus案升级:外媒曝肖弘、季逸超被发改委约谈后遭边控,监管从多个方向收紧
英国《金融时报》披露了 Meta 收购 AI Agent 公司 Manus 一案的最新细节。Manus CEO 肖弘和首席科学家季逸超本月被国家发改委召至北京约谈,问询方向为 Manus 所有权变更后,其境内主体是否按规定完成了外商直接投资信息报告。约谈结束后,二人被告知在审查期间不得离境,但可在国内自由活动。此前《纽约时报》已报道高管被限制出境,FT 的报道进一步明确了限制对象为肖弘、季逸超,约谈主体为发改委,边控措施直接与此次约谈相关。
至此,该交易同时面临两条监管线:商务部自 1 月 8 日起对出口管制合规的审查,以及发改委对 FDI 申报违规的问询。多部门同步介入,显示监管层对这笔交易的关切已从单一维度扩展为系统性审视。
目前未启动正式调查,也未提出任何指控。Manus 正在寻找律所和咨询机构协助应对。报道援引知情人士称,即使违规被确认,依据现行法律也不太可能导致严重处罚,但监管方显然在寻找介入交易的切入口。极端情况下可能要求撤销交易,但由于 Meta 已开始将 Manus 的 AI Agent 软件整合入自有平台,强行拆解会非常复杂。外媒普遍认为,此举意在向中国 AI 创业者发出信号:在境内研发核心技术后迁往海外再出售给美国企业的路径,将面临越来越大的监管压力。
Meta 发言人回应称,「该交易完全符合适用法律,我们预期此次问询会得到妥善解决。」
信源:https://www.ft.com/content/d9123d9d-c807-41d6-8a17-80ff1111834a
英国《金融时报》披露了 Meta 收购 AI Agent 公司 Manus 一案的最新细节。Manus CEO 肖弘和首席科学家季逸超本月被国家发改委召至北京约谈,问询方向为 Manus 所有权变更后,其境内主体是否按规定完成了外商直接投资信息报告。约谈结束后,二人被告知在审查期间不得离境,但可在国内自由活动。此前《纽约时报》已报道高管被限制出境,FT 的报道进一步明确了限制对象为肖弘、季逸超,约谈主体为发改委,边控措施直接与此次约谈相关。
至此,该交易同时面临两条监管线:商务部自 1 月 8 日起对出口管制合规的审查,以及发改委对 FDI 申报违规的问询。多部门同步介入,显示监管层对这笔交易的关切已从单一维度扩展为系统性审视。
目前未启动正式调查,也未提出任何指控。Manus 正在寻找律所和咨询机构协助应对。报道援引知情人士称,即使违规被确认,依据现行法律也不太可能导致严重处罚,但监管方显然在寻找介入交易的切入口。极端情况下可能要求撤销交易,但由于 Meta 已开始将 Manus 的 AI Agent 软件整合入自有平台,强行拆解会非常复杂。外媒普遍认为,此举意在向中国 AI 创业者发出信号:在境内研发核心技术后迁往海外再出售给美国企业的路径,将面临越来越大的监管压力。
Meta 发言人回应称,「该交易完全符合适用法律,我们预期此次问询会得到妥善解决。」
信源:https://www.ft.com/content/d9123d9d-c807-41d6-8a17-80ff1111834a
Meta设9万亿美元市值目标留人:IPO以来首发期权,比马斯克方案增幅相当但时间减半
Meta 推出新的股票期权激励计划,高管只有在公司市值于 2031 年前突破 9 万亿美元时才能兑现全部价值,较当前约 1.5 万亿美元需增长 500%。这是 Meta 2012 年 IPO 以来首次向高管授予股票期权。
计划覆盖六位核心高管:CTO Andrew Bosworth、首席产品官 Chris Cox、COO Javier Olivan、CFO Susan Li、首席法务官 C.J. Mahoney 和副董事长 Dina Powell McCormick。CEO 扎克伯格不在其中。期权分多档行权,最低一档要求股价达到 1116.08 美元(较当前涨 88%,对应市值约 2.82 万亿美元),最高档 3727.12 美元(对应市值超 9 万亿美元)。Meta 同时增加了部分高管的 RSU 授予。
Meta 发言人称这是一次「大赌注」,「只有 Meta 实现巨大成功,所有股东都从中受益时,这些薪酬才会兑现」。
作为对比,特斯拉去年秋天通过的马斯克薪酬方案价值最高 1 万亿美元,需在 10 年内将市值从 1.2 万亿推至 8.5 万亿美元。Meta 的计划要求几乎同等增幅,但时间窗口只有一半。AI 人才争夺战正在推高 Meta 的股票薪酬成本:2025 年与员工股票奖励相关的现金支出消耗了公司 96% 的自由现金流,达 420 亿美元;全年回购的 4000 万股中,90% 是为了抵消员工股票奖励带来的稀释。
信源:https://www.wsj.com/tech/meta-targets-9-trillion-valuation-with-new-executive-incentive-program-64460862
Meta 推出新的股票期权激励计划,高管只有在公司市值于 2031 年前突破 9 万亿美元时才能兑现全部价值,较当前约 1.5 万亿美元需增长 500%。这是 Meta 2012 年 IPO 以来首次向高管授予股票期权。
计划覆盖六位核心高管:CTO Andrew Bosworth、首席产品官 Chris Cox、COO Javier Olivan、CFO Susan Li、首席法务官 C.J. Mahoney 和副董事长 Dina Powell McCormick。CEO 扎克伯格不在其中。期权分多档行权,最低一档要求股价达到 1116.08 美元(较当前涨 88%,对应市值约 2.82 万亿美元),最高档 3727.12 美元(对应市值超 9 万亿美元)。Meta 同时增加了部分高管的 RSU 授予。
Meta 发言人称这是一次「大赌注」,「只有 Meta 实现巨大成功,所有股东都从中受益时,这些薪酬才会兑现」。
作为对比,特斯拉去年秋天通过的马斯克薪酬方案价值最高 1 万亿美元,需在 10 年内将市值从 1.2 万亿推至 8.5 万亿美元。Meta 的计划要求几乎同等增幅,但时间窗口只有一半。AI 人才争夺战正在推高 Meta 的股票薪酬成本:2025 年与员工股票奖励相关的现金支出消耗了公司 96% 的自由现金流,达 420 亿美元;全年回购的 4000 万股中,90% 是为了抵消员工股票奖励带来的稀释。
信源:https://www.wsj.com/tech/meta-targets-9-trillion-valuation-with-new-executive-incentive-program-64460862
传蚂蚁集团正开发AI眼镜独立App,「看一下支付」要从插件变入口
微信公众号「读佳」爆料称,蚂蚁集团正在开发「蚂蚁数科AI眼镜」独立 App。
蚂蚁数科去年 9 月发布 AI 眼镜可信连接技术框架 gPass,已与 Rokid、小米等主流 AI 眼镜品牌完成对接,实现「看一下支付」在消费、停车、文旅等场景落地。目前 gPass 以插件形式嵌入各硬件厂商系统。若独立 App 落地,蚂蚁的 AI 眼镜支付能力将不再依附于单一硬件品牌,可跨品牌覆盖用户。
信源:https://mp.weixin.qq.com/s/W6j7dbsIAHvt7i7gtIRe-w
微信公众号「读佳」爆料称,蚂蚁集团正在开发「蚂蚁数科AI眼镜」独立 App。
蚂蚁数科去年 9 月发布 AI 眼镜可信连接技术框架 gPass,已与 Rokid、小米等主流 AI 眼镜品牌完成对接,实现「看一下支付」在消费、停车、文旅等场景落地。目前 gPass 以插件形式嵌入各硬件厂商系统。若独立 App 落地,蚂蚁的 AI 眼镜支付能力将不再依附于单一硬件品牌,可跨品牌覆盖用户。
信源:https://mp.weixin.qq.com/s/W6j7dbsIAHvt7i7gtIRe-w
杨植麟中关村论坛演讲:大模型训练正进入第三阶段,100个Agent并行后执行时间几乎不随复杂度上升
月之暗面创始人杨植麟在 2026 中关村论坛全体会议上以《开源 AI:加速探索智能上限》为题发表演讲,提出大模型训练正经历三个阶段的演进:三年前主要依赖互联网天然数据加少量人工标注;2025 年转向大规模强化学习,由人工筛选高质量任务,编程和数学领域的性能提升主要来自这一路线;从今年起进入第三阶段,AI 将更大程度主导研究本身,每个研究员将配备海量 token,由 AI 自动合成新任务与新环境、定义奖励函数,甚至探索全新网络架构。
杨植麟介绍了 Kimi K2.5 中首创的 Agent 集群(Agent Swarm)技术。他展示的数据显示,单一智能体模式下任务复杂度与执行时间呈指数级增长,而并行启用 100 个智能体协作后,执行时间几乎不再随任务复杂度上升而显著增加。他将此比喻为「从 0 到 1 建造一家千亿美元公司,一个人可能需要 100 年,但 100 个聪明人一起协作,就能在短时间内完成」。
杨植麟还指出,开源模型正成为全球 AI 产业新标准。在英伟达 GTC 2026 大会上,黄仁勋主题演讲多次引用 Kimi 等开源模型作为芯片性能评测基准,「如果你要发布一个新芯片,就必须通过 Kimi 或其他开源模型来评测性能提升」。
信源:https://www.nbd.com.cn/articles/2026-03-25/4307655.html
月之暗面创始人杨植麟在 2026 中关村论坛全体会议上以《开源 AI:加速探索智能上限》为题发表演讲,提出大模型训练正经历三个阶段的演进:三年前主要依赖互联网天然数据加少量人工标注;2025 年转向大规模强化学习,由人工筛选高质量任务,编程和数学领域的性能提升主要来自这一路线;从今年起进入第三阶段,AI 将更大程度主导研究本身,每个研究员将配备海量 token,由 AI 自动合成新任务与新环境、定义奖励函数,甚至探索全新网络架构。
杨植麟介绍了 Kimi K2.5 中首创的 Agent 集群(Agent Swarm)技术。他展示的数据显示,单一智能体模式下任务复杂度与执行时间呈指数级增长,而并行启用 100 个智能体协作后,执行时间几乎不再随任务复杂度上升而显著增加。他将此比喻为「从 0 到 1 建造一家千亿美元公司,一个人可能需要 100 年,但 100 个聪明人一起协作,就能在短时间内完成」。
杨植麟还指出,开源模型正成为全球 AI 产业新标准。在英伟达 GTC 2026 大会上,黄仁勋主题演讲多次引用 Kimi 等开源模型作为芯片性能评测基准,「如果你要发布一个新芯片,就必须通过 Kimi 或其他开源模型来评测性能提升」。
信源:https://www.nbd.com.cn/articles/2026-03-25/4307655.html
一个Transformer同时生成视频和语音:Sand.ai开源150亿参数人像基座模型,单H100两秒出片
视频生成创业公司 Sand.ai 与上海创智学院 GAIR 实验室联合开源音视频联合生成基座模型 daVinci-MagiHuman,150 亿参数,采用单流 Transformer 架构,将文本、视频、音频统一放入同一个 token 序列,仅靠自注意力完成联合建模,不依赖跨注意力或模态专属分支。
模型以人像场景为核心能力,可生成富有表现力的面部表情与自然语音,实现口型、表情与动作的精确同步,支持中文(普通话与粤语)、英文、日文、韩文、德文、法文六种语言。推理侧结合模型蒸馏、隐空间超分辨率和 Turbo VAE 解码器,在单张 H100 GPU 上 2 秒生成 5 秒 256p 视频。
在客观评测中,daVinci-MagiHuman 在开源模型中视觉质量和文本一致性均为最优,语音可懂度词错误率(WER)14.60%,远低于 LTX 2.3 和 Ovi 1.1。2000 组人工盲评中,对 Ovi 1.1 胜率 80%,对 LTX 2.3 胜率 60.9%。完整模型栈(基座模型、蒸馏模型、超分模型、推理代码)全部开源。
Sand.ai 由马尔奖(Marr Prize)得主曹越创立,此前发布了自回归视频生成模型 Magi-1 和主打「AI 演员」的 GAGA-1。上海创智学院 GAIR 实验室由刘鹏飞领导,聚焦生成式 AI 前沿研究。
信源:https://arxiv.org/abs/2603.21986
视频生成创业公司 Sand.ai 与上海创智学院 GAIR 实验室联合开源音视频联合生成基座模型 daVinci-MagiHuman,150 亿参数,采用单流 Transformer 架构,将文本、视频、音频统一放入同一个 token 序列,仅靠自注意力完成联合建模,不依赖跨注意力或模态专属分支。
模型以人像场景为核心能力,可生成富有表现力的面部表情与自然语音,实现口型、表情与动作的精确同步,支持中文(普通话与粤语)、英文、日文、韩文、德文、法文六种语言。推理侧结合模型蒸馏、隐空间超分辨率和 Turbo VAE 解码器,在单张 H100 GPU 上 2 秒生成 5 秒 256p 视频。
在客观评测中,daVinci-MagiHuman 在开源模型中视觉质量和文本一致性均为最优,语音可懂度词错误率(WER)14.60%,远低于 LTX 2.3 和 Ovi 1.1。2000 组人工盲评中,对 Ovi 1.1 胜率 80%,对 LTX 2.3 胜率 60.9%。完整模型栈(基座模型、蒸馏模型、超分模型、推理代码)全部开源。
Sand.ai 由马尔奖(Marr Prize)得主曹越创立,此前发布了自回归视频生成模型 Magi-1 和主打「AI 演员」的 GAGA-1。上海创智学院 GAIR 实验室由刘鹏飞领导,聚焦生成式 AI 前沿研究。
信源:https://arxiv.org/abs/2603.21986
arXiv.org
Speed by Simplicity: A Single-Stream Architecture for Fast...
We present daVinci-MagiHuman, an open-source audio-video generative foundation model for human-centric generation. daVinci-MagiHuman jointly generates synchronized video and audio using a...
WordPress 7.0将于4月9日发布,全球43%网站将原生支持AI Agent接入
WordPress 7.0 定于 4 月 9 日发布,核心变化之一是将 MCP(Model Context Protocol)适配器纳入核心,使任何 WordPress 站点都能作为 MCP 服务器,允许 Claude、ChatGPT 等 AI Agent 直接在站点内发现功能、理解结构并执行操作。
具体而言,7.0 在 AI 基础设施层面引入三个组件:
1. AI Connectors:在设置面板统一管理 AI 服务的 API 密钥,首批支持 Anthropic、OpenAI、谷歌三家,所有插件共享同一套凭证,不再各自存储。
2. Abilities API:6.9 版本引入、7.0 扩展的能力注册接口,插件可以用 AI 能理解的格式声明自身功能(如获取文章、更新页面、运行站点健康检查),标准化输入输出。
3. MCP Adapter:将所有已注册的 Ability 通过 MCP 协议暴露给外部 AI Agent,Agent 可自动发现站点能力并在用户授权下调用。
WordPress.com 已于 3 月 20 日率先上线 MCP 写入权限,覆盖 6 类内容的 19 项写操作(编辑内容、管理评论、创建页面、上传媒体、调整分类和标签等)。所有操作需用户明确确认后才会执行,新内容默认为草稿,删除内容进入回收站保留 30 天。WordPress.com 还默认启用 OAuth 2.1 认证,AI 客户端仅使用有时效的 token,不接触用户凭证。
WordPress 驱动着全球约 43% 的网站。MCP 支持进入核心意味着这些站点将具备标准化的 AI Agent 接入能力,类似于 2016 年 REST API 进入核心后催生了无头 WordPress 和现代主题开发生态。
信源:https://x.com/adityaarsharma/status/2036485004348498180
WordPress 7.0 定于 4 月 9 日发布,核心变化之一是将 MCP(Model Context Protocol)适配器纳入核心,使任何 WordPress 站点都能作为 MCP 服务器,允许 Claude、ChatGPT 等 AI Agent 直接在站点内发现功能、理解结构并执行操作。
具体而言,7.0 在 AI 基础设施层面引入三个组件:
1. AI Connectors:在设置面板统一管理 AI 服务的 API 密钥,首批支持 Anthropic、OpenAI、谷歌三家,所有插件共享同一套凭证,不再各自存储。
2. Abilities API:6.9 版本引入、7.0 扩展的能力注册接口,插件可以用 AI 能理解的格式声明自身功能(如获取文章、更新页面、运行站点健康检查),标准化输入输出。
3. MCP Adapter:将所有已注册的 Ability 通过 MCP 协议暴露给外部 AI Agent,Agent 可自动发现站点能力并在用户授权下调用。
WordPress.com 已于 3 月 20 日率先上线 MCP 写入权限,覆盖 6 类内容的 19 项写操作(编辑内容、管理评论、创建页面、上传媒体、调整分类和标签等)。所有操作需用户明确确认后才会执行,新内容默认为草稿,删除内容进入回收站保留 30 天。WordPress.com 还默认启用 OAuth 2.1 认证,AI 客户端仅使用有时效的 token,不接触用户凭证。
WordPress 驱动着全球约 43% 的网站。MCP 支持进入核心意味着这些站点将具备标准化的 AI Agent 接入能力,类似于 2016 年 REST API 进入核心后催生了无头 WordPress 和现代主题开发生态。
信源:https://x.com/adityaarsharma/status/2036485004348498180
X (formerly Twitter)
Aditya R Sharma (@adityaarsharma) on X
WordPress 7.0 Is the Biggest Thing to Happen Since Gutenberg and Nobody's Talking About It !!
Linear宣布「Issue tracking已死」,全面转向AI Agent驱动的产品系统
项目管理工具 Linear CEO Karri Saarinen 发布公开信,宣布 Linear 正从 issue tracker 转型为「将上下文转化为执行」的共享产品系统,核心论点是传统 issue tracking 为人与人之间的工作交接而设计,而 AI Agent 时代的瓶颈已转向判断力,系统应围绕上下文和 Agent 重建。
Karri 披露了一组数据:目前超过 75% 的 Linear 企业级工作区已安装编程 Agent,过去三个月 Agent 完成的工作量增长了 5 倍,Agent 创建的新 issue 占比接近 25%。
围绕这一转型,Linear 同步上线三项功能:
1. Linear Agent:内置的原生 AI Agent,理解工作区内的路线图、issue 和代码,可在桌面端(Cmd/Ctrl+J)、移动端、Slack 和 Microsoft Teams 中使用,支持综合上下文、提出建议并直接执行操作。
2. Skills:将 Agent 对话中的有效工作流保存为可复用技能,通过斜杠命令手动触发,或由 Linear 自动匹配执行。
3. Automations:从 Triage 开始,issue 进入系统时自动触发 Agent 工作流,智能分类、提炼或处理新增上下文。
此外预告了三项即将推出的能力:Code Intelligence(理解代码库并回答问题)、Code Diffs(人与 Agent 协作审查代码的界面)和 Linear Coding Agent(由 Linear 原生上下文增强的编程 Agent)。
Linear Agent 目前以公测形式向所有计划开放,测试期间免费。Automations 和 Code Intelligence 仅限 Business 和 Enterprise 计划。正式发布后,对话功能预计包含在基础席位价格中,高计算量功能可能转为用量计费。
信源:https://linear.app/next
项目管理工具 Linear CEO Karri Saarinen 发布公开信,宣布 Linear 正从 issue tracker 转型为「将上下文转化为执行」的共享产品系统,核心论点是传统 issue tracking 为人与人之间的工作交接而设计,而 AI Agent 时代的瓶颈已转向判断力,系统应围绕上下文和 Agent 重建。
Karri 披露了一组数据:目前超过 75% 的 Linear 企业级工作区已安装编程 Agent,过去三个月 Agent 完成的工作量增长了 5 倍,Agent 创建的新 issue 占比接近 25%。
围绕这一转型,Linear 同步上线三项功能:
1. Linear Agent:内置的原生 AI Agent,理解工作区内的路线图、issue 和代码,可在桌面端(Cmd/Ctrl+J)、移动端、Slack 和 Microsoft Teams 中使用,支持综合上下文、提出建议并直接执行操作。
2. Skills:将 Agent 对话中的有效工作流保存为可复用技能,通过斜杠命令手动触发,或由 Linear 自动匹配执行。
3. Automations:从 Triage 开始,issue 进入系统时自动触发 Agent 工作流,智能分类、提炼或处理新增上下文。
此外预告了三项即将推出的能力:Code Intelligence(理解代码库并回答问题)、Code Diffs(人与 Agent 协作审查代码的界面)和 Linear Coding Agent(由 Linear 原生上下文增强的编程 Agent)。
Linear Agent 目前以公测形式向所有计划开放,测试期间免费。Automations 和 Code Intelligence 仅限 Business 和 Enterprise 计划。正式发布后,对话功能预计包含在基础席位价格中,高计算量功能可能转为用量计费。
信源:https://linear.app/next
❤1
「TTS基准已死」:Smallest AI发布对话语音模型Lightning V3,对OpenAI胜率76%
语音 AI 公司 Smallest AI 创始人 Sudarshan Kamath 发布对话场景专用 TTS 模型 Lightning V3,核心论点是朗读式 TTS 和对话式 TTS 是两个根本不同的问题,现有基准衡量的是前者,对后者几乎失效。
对话生成的难点在于模型无法等到完整句子再开始合成,必须在不完整上下文下实时逐块输出。Lightning V3 针对这一场景设计了四项能力:通过节奏和停顿微变化模拟「正在思考」的认知信号;根据对话轮次调整语调(澄清与开场语气不同);处理 Hinglish、Spanglish 等真实场景中的句内混语切换;以及维持用户参与度。
在对话生成条件下的评测中(使用 Seed-TTS 语料库,LLM 作为评判者,评测代码已公开),Lightning V3 MOS 评分 3.89,词错误率 5.38%,对 OpenAI gpt-4o-mini-tts 的整体自然度胜率约 76%。但 Kamath 对自己的评测结果也做了诚实限定:「将同一段音频放在不同的播放设备上、给评估者不同的关注引导,排名就会变。这不是数据噪声,这就是数据本身。」他认为 MOS 将巨大的感知差异压缩为一个平均数,当系统跨过「可懂」到「自然」的门槛后,现有基准只能确认系统没有失败,无法衡量它成功了多少。
模型原生输出 44,100 Hz,支持 15 种语言,可降采样至 8/16/24 kHz 适配电话系统。同步发布的 V3.1 新增声音克隆,5 至 15 秒音频即可生成跨语言的生产级语音副本。采用按量付费,无预付或最低消费。
信源:https://x.com/kamath_sutra/status/2036466680076050581
语音 AI 公司 Smallest AI 创始人 Sudarshan Kamath 发布对话场景专用 TTS 模型 Lightning V3,核心论点是朗读式 TTS 和对话式 TTS 是两个根本不同的问题,现有基准衡量的是前者,对后者几乎失效。
对话生成的难点在于模型无法等到完整句子再开始合成,必须在不完整上下文下实时逐块输出。Lightning V3 针对这一场景设计了四项能力:通过节奏和停顿微变化模拟「正在思考」的认知信号;根据对话轮次调整语调(澄清与开场语气不同);处理 Hinglish、Spanglish 等真实场景中的句内混语切换;以及维持用户参与度。
在对话生成条件下的评测中(使用 Seed-TTS 语料库,LLM 作为评判者,评测代码已公开),Lightning V3 MOS 评分 3.89,词错误率 5.38%,对 OpenAI gpt-4o-mini-tts 的整体自然度胜率约 76%。但 Kamath 对自己的评测结果也做了诚实限定:「将同一段音频放在不同的播放设备上、给评估者不同的关注引导,排名就会变。这不是数据噪声,这就是数据本身。」他认为 MOS 将巨大的感知差异压缩为一个平均数,当系统跨过「可懂」到「自然」的门槛后,现有基准只能确认系统没有失败,无法衡量它成功了多少。
模型原生输出 44,100 Hz,支持 15 种语言,可降采样至 8/16/24 kHz 适配电话系统。同步发布的 V3.1 新增声音克隆,5 至 15 秒音频即可生成跨语言的生产级语音副本。采用按量付费,无预付或最低消费。
信源:https://x.com/kamath_sutra/status/2036466680076050581
Hugging Face开源hf-mount:把云端模型和数据集直接挂载为本地文件夹,按需读取不用下载
Hugging Face CEO Clement Delangue 宣布开源 hf-mount,可将 Hugging Face 上的任意模型仓库、数据集或 Buckets 存储桶挂载为本地文件系统,文件在首次读取时才从网络拉取,无需预先下载完整仓库。Delangue 称这对 AI Agent 尤其实用,Agent 可直接用 ls、cat、find、grep 等标准 UNIX 命令操作远端数据,无需学习专用 API。
hf-mount 用 Rust 编写,提供 NFS(推荐,无需 root 权限)和 FUSE 两种后端,支持 Linux 和 macOS。仓库挂载为只读,Buckets 存储桶支持读写。基准测试显示 FUSE 模式顺序读取速度 1.2 GB/s,写入 900 MB/s。Kubernetes 环境可通过配套的 hf-csi-driver 将挂载点暴露给 Pod。项目以 Apache 2.0 协议开源。
信源:https://x.com/ClementDelangue/status/2036452081750409383
Hugging Face CEO Clement Delangue 宣布开源 hf-mount,可将 Hugging Face 上的任意模型仓库、数据集或 Buckets 存储桶挂载为本地文件系统,文件在首次读取时才从网络拉取,无需预先下载完整仓库。Delangue 称这对 AI Agent 尤其实用,Agent 可直接用 ls、cat、find、grep 等标准 UNIX 命令操作远端数据,无需学习专用 API。
hf-mount 用 Rust 编写,提供 NFS(推荐,无需 root 权限)和 FUSE 两种后端,支持 Linux 和 macOS。仓库挂载为只读,Buckets 存储桶支持读写。基准测试显示 FUSE 模式顺序读取速度 1.2 GB/s,写入 900 MB/s。Kubernetes 环境可通过配套的 hf-csi-driver 将挂载点暴露给 Pod。项目以 Apache 2.0 协议开源。
信源:https://x.com/ClementDelangue/status/2036452081750409383
AI自评全是好评怎么办?Anthropic用GAN思路让Claude连续编程4小时,$124造出一个音乐工作站
Anthropic Labs 工程师 Prithvi Rajasekaran 发文详解团队如何让 Claude 连续数小时自主编写完整应用。他们发现了一个关键瓶颈:让 AI 自己检查自己的代码质量时,它几乎永远觉得自己写得不错,哪怕成品明显有问题也会放行。解法是把「写代码的 AI」和「审代码的 AI」拆成两个独立角色,后者专职挑毛病,比自我审查有效得多。
最终架构由三个 AI 协作:一个负责把用户的一句话需求扩展成完整产品方案,一个负责逐功能写代码,一个负责像真实用户一样点击、操作正在运行的应用并打分。写代码的 AI 和审代码的 AI 每轮开工前先对齐「这轮做什么、怎么算做完」,审代码的 AI 会真的去用这个应用,找出实际 bug 后把修改意见打回去。
对照实验很直观:同样一句「做一个 2D 复古游戏编辑器」,单个 AI 跑 20 分钟花 $9,产出的游戏画面能打开但核心玩法完全跑不通,角色不响应操作;三 AI 协作跑 6 小时花 $200,产出的版本可以正常操控角色、在关卡里移动,审核 AI 还在过程中抓到了填充工具只画端点不填区域、后端路由冲突等具体 bug。
Claude Opus 4.6 让这套架构得以大幅简化。此前 Sonnet 4.5 会在长任务后期「焦虑收尾」,还没做完就急着结束,必须定期清空记忆重新启动。Opus 4.6 基本消除了这个问题,写代码的 AI 可以在单次会话中连贯工作超过 2 小时。用简化后的架构生成浏览器端音乐制作工具,约 4 小时花费 $124.70,审核 AI 仍然捕获了「录音按钮只切状态但没接麦克风」「音频片段无法拖拽」等遗漏。
文章还透露了一个有趣的发现:在前端设计实验中,评分标准里的措辞会直接影响 AI 的审美方向。写上「最好的设计是博物馆级别的」之后,AI 在做一个荷兰艺术博物馆网站时,第十轮迭代自行推翻了前九轮的平面方案,改为用 CSS 渲染的 3D 展厅,让访客通过虚拟门廊在画廊之间穿行。
信源:https://www.anthropic.com/engineering/harness-design-long-running-apps
Anthropic Labs 工程师 Prithvi Rajasekaran 发文详解团队如何让 Claude 连续数小时自主编写完整应用。他们发现了一个关键瓶颈:让 AI 自己检查自己的代码质量时,它几乎永远觉得自己写得不错,哪怕成品明显有问题也会放行。解法是把「写代码的 AI」和「审代码的 AI」拆成两个独立角色,后者专职挑毛病,比自我审查有效得多。
最终架构由三个 AI 协作:一个负责把用户的一句话需求扩展成完整产品方案,一个负责逐功能写代码,一个负责像真实用户一样点击、操作正在运行的应用并打分。写代码的 AI 和审代码的 AI 每轮开工前先对齐「这轮做什么、怎么算做完」,审代码的 AI 会真的去用这个应用,找出实际 bug 后把修改意见打回去。
对照实验很直观:同样一句「做一个 2D 复古游戏编辑器」,单个 AI 跑 20 分钟花 $9,产出的游戏画面能打开但核心玩法完全跑不通,角色不响应操作;三 AI 协作跑 6 小时花 $200,产出的版本可以正常操控角色、在关卡里移动,审核 AI 还在过程中抓到了填充工具只画端点不填区域、后端路由冲突等具体 bug。
Claude Opus 4.6 让这套架构得以大幅简化。此前 Sonnet 4.5 会在长任务后期「焦虑收尾」,还没做完就急着结束,必须定期清空记忆重新启动。Opus 4.6 基本消除了这个问题,写代码的 AI 可以在单次会话中连贯工作超过 2 小时。用简化后的架构生成浏览器端音乐制作工具,约 4 小时花费 $124.70,审核 AI 仍然捕获了「录音按钮只切状态但没接麦克风」「音频片段无法拖拽」等遗漏。
文章还透露了一个有趣的发现:在前端设计实验中,评分标准里的措辞会直接影响 AI 的审美方向。写上「最好的设计是博物馆级别的」之后,AI 在做一个荷兰艺术博物馆网站时,第十轮迭代自行推翻了前九轮的平面方案,改为用 CSS 渲染的 3D 展厅,让访客通过虚拟门廊在画廊之间穿行。
信源:https://www.anthropic.com/engineering/harness-design-long-running-apps
🎉1