一个Transformer同时生成视频和语音:Sand.ai开源150亿参数人像基座模型,单H100两秒出片
视频生成创业公司 Sand.ai 与上海创智学院 GAIR 实验室联合开源音视频联合生成基座模型 daVinci-MagiHuman,150 亿参数,采用单流 Transformer 架构,将文本、视频、音频统一放入同一个 token 序列,仅靠自注意力完成联合建模,不依赖跨注意力或模态专属分支。
模型以人像场景为核心能力,可生成富有表现力的面部表情与自然语音,实现口型、表情与动作的精确同步,支持中文(普通话与粤语)、英文、日文、韩文、德文、法文六种语言。推理侧结合模型蒸馏、隐空间超分辨率和 Turbo VAE 解码器,在单张 H100 GPU 上 2 秒生成 5 秒 256p 视频。
在客观评测中,daVinci-MagiHuman 在开源模型中视觉质量和文本一致性均为最优,语音可懂度词错误率(WER)14.60%,远低于 LTX 2.3 和 Ovi 1.1。2000 组人工盲评中,对 Ovi 1.1 胜率 80%,对 LTX 2.3 胜率 60.9%。完整模型栈(基座模型、蒸馏模型、超分模型、推理代码)全部开源。
Sand.ai 由马尔奖(Marr Prize)得主曹越创立,此前发布了自回归视频生成模型 Magi-1 和主打「AI 演员」的 GAGA-1。上海创智学院 GAIR 实验室由刘鹏飞领导,聚焦生成式 AI 前沿研究。
信源:https://arxiv.org/abs/2603.21986
视频生成创业公司 Sand.ai 与上海创智学院 GAIR 实验室联合开源音视频联合生成基座模型 daVinci-MagiHuman,150 亿参数,采用单流 Transformer 架构,将文本、视频、音频统一放入同一个 token 序列,仅靠自注意力完成联合建模,不依赖跨注意力或模态专属分支。
模型以人像场景为核心能力,可生成富有表现力的面部表情与自然语音,实现口型、表情与动作的精确同步,支持中文(普通话与粤语)、英文、日文、韩文、德文、法文六种语言。推理侧结合模型蒸馏、隐空间超分辨率和 Turbo VAE 解码器,在单张 H100 GPU 上 2 秒生成 5 秒 256p 视频。
在客观评测中,daVinci-MagiHuman 在开源模型中视觉质量和文本一致性均为最优,语音可懂度词错误率(WER)14.60%,远低于 LTX 2.3 和 Ovi 1.1。2000 组人工盲评中,对 Ovi 1.1 胜率 80%,对 LTX 2.3 胜率 60.9%。完整模型栈(基座模型、蒸馏模型、超分模型、推理代码)全部开源。
Sand.ai 由马尔奖(Marr Prize)得主曹越创立,此前发布了自回归视频生成模型 Magi-1 和主打「AI 演员」的 GAGA-1。上海创智学院 GAIR 实验室由刘鹏飞领导,聚焦生成式 AI 前沿研究。
信源:https://arxiv.org/abs/2603.21986
arXiv.org
Speed by Simplicity: A Single-Stream Architecture for Fast...
We present daVinci-MagiHuman, an open-source audio-video generative foundation model for human-centric generation. daVinci-MagiHuman jointly generates synchronized video and audio using a...
WordPress 7.0将于4月9日发布,全球43%网站将原生支持AI Agent接入
WordPress 7.0 定于 4 月 9 日发布,核心变化之一是将 MCP(Model Context Protocol)适配器纳入核心,使任何 WordPress 站点都能作为 MCP 服务器,允许 Claude、ChatGPT 等 AI Agent 直接在站点内发现功能、理解结构并执行操作。
具体而言,7.0 在 AI 基础设施层面引入三个组件:
1. AI Connectors:在设置面板统一管理 AI 服务的 API 密钥,首批支持 Anthropic、OpenAI、谷歌三家,所有插件共享同一套凭证,不再各自存储。
2. Abilities API:6.9 版本引入、7.0 扩展的能力注册接口,插件可以用 AI 能理解的格式声明自身功能(如获取文章、更新页面、运行站点健康检查),标准化输入输出。
3. MCP Adapter:将所有已注册的 Ability 通过 MCP 协议暴露给外部 AI Agent,Agent 可自动发现站点能力并在用户授权下调用。
WordPress.com 已于 3 月 20 日率先上线 MCP 写入权限,覆盖 6 类内容的 19 项写操作(编辑内容、管理评论、创建页面、上传媒体、调整分类和标签等)。所有操作需用户明确确认后才会执行,新内容默认为草稿,删除内容进入回收站保留 30 天。WordPress.com 还默认启用 OAuth 2.1 认证,AI 客户端仅使用有时效的 token,不接触用户凭证。
WordPress 驱动着全球约 43% 的网站。MCP 支持进入核心意味着这些站点将具备标准化的 AI Agent 接入能力,类似于 2016 年 REST API 进入核心后催生了无头 WordPress 和现代主题开发生态。
信源:https://x.com/adityaarsharma/status/2036485004348498180
WordPress 7.0 定于 4 月 9 日发布,核心变化之一是将 MCP(Model Context Protocol)适配器纳入核心,使任何 WordPress 站点都能作为 MCP 服务器,允许 Claude、ChatGPT 等 AI Agent 直接在站点内发现功能、理解结构并执行操作。
具体而言,7.0 在 AI 基础设施层面引入三个组件:
1. AI Connectors:在设置面板统一管理 AI 服务的 API 密钥,首批支持 Anthropic、OpenAI、谷歌三家,所有插件共享同一套凭证,不再各自存储。
2. Abilities API:6.9 版本引入、7.0 扩展的能力注册接口,插件可以用 AI 能理解的格式声明自身功能(如获取文章、更新页面、运行站点健康检查),标准化输入输出。
3. MCP Adapter:将所有已注册的 Ability 通过 MCP 协议暴露给外部 AI Agent,Agent 可自动发现站点能力并在用户授权下调用。
WordPress.com 已于 3 月 20 日率先上线 MCP 写入权限,覆盖 6 类内容的 19 项写操作(编辑内容、管理评论、创建页面、上传媒体、调整分类和标签等)。所有操作需用户明确确认后才会执行,新内容默认为草稿,删除内容进入回收站保留 30 天。WordPress.com 还默认启用 OAuth 2.1 认证,AI 客户端仅使用有时效的 token,不接触用户凭证。
WordPress 驱动着全球约 43% 的网站。MCP 支持进入核心意味着这些站点将具备标准化的 AI Agent 接入能力,类似于 2016 年 REST API 进入核心后催生了无头 WordPress 和现代主题开发生态。
信源:https://x.com/adityaarsharma/status/2036485004348498180
X (formerly Twitter)
Aditya R Sharma (@adityaarsharma) on X
WordPress 7.0 Is the Biggest Thing to Happen Since Gutenberg and Nobody's Talking About It !!
Linear宣布「Issue tracking已死」,全面转向AI Agent驱动的产品系统
项目管理工具 Linear CEO Karri Saarinen 发布公开信,宣布 Linear 正从 issue tracker 转型为「将上下文转化为执行」的共享产品系统,核心论点是传统 issue tracking 为人与人之间的工作交接而设计,而 AI Agent 时代的瓶颈已转向判断力,系统应围绕上下文和 Agent 重建。
Karri 披露了一组数据:目前超过 75% 的 Linear 企业级工作区已安装编程 Agent,过去三个月 Agent 完成的工作量增长了 5 倍,Agent 创建的新 issue 占比接近 25%。
围绕这一转型,Linear 同步上线三项功能:
1. Linear Agent:内置的原生 AI Agent,理解工作区内的路线图、issue 和代码,可在桌面端(Cmd/Ctrl+J)、移动端、Slack 和 Microsoft Teams 中使用,支持综合上下文、提出建议并直接执行操作。
2. Skills:将 Agent 对话中的有效工作流保存为可复用技能,通过斜杠命令手动触发,或由 Linear 自动匹配执行。
3. Automations:从 Triage 开始,issue 进入系统时自动触发 Agent 工作流,智能分类、提炼或处理新增上下文。
此外预告了三项即将推出的能力:Code Intelligence(理解代码库并回答问题)、Code Diffs(人与 Agent 协作审查代码的界面)和 Linear Coding Agent(由 Linear 原生上下文增强的编程 Agent)。
Linear Agent 目前以公测形式向所有计划开放,测试期间免费。Automations 和 Code Intelligence 仅限 Business 和 Enterprise 计划。正式发布后,对话功能预计包含在基础席位价格中,高计算量功能可能转为用量计费。
信源:https://linear.app/next
项目管理工具 Linear CEO Karri Saarinen 发布公开信,宣布 Linear 正从 issue tracker 转型为「将上下文转化为执行」的共享产品系统,核心论点是传统 issue tracking 为人与人之间的工作交接而设计,而 AI Agent 时代的瓶颈已转向判断力,系统应围绕上下文和 Agent 重建。
Karri 披露了一组数据:目前超过 75% 的 Linear 企业级工作区已安装编程 Agent,过去三个月 Agent 完成的工作量增长了 5 倍,Agent 创建的新 issue 占比接近 25%。
围绕这一转型,Linear 同步上线三项功能:
1. Linear Agent:内置的原生 AI Agent,理解工作区内的路线图、issue 和代码,可在桌面端(Cmd/Ctrl+J)、移动端、Slack 和 Microsoft Teams 中使用,支持综合上下文、提出建议并直接执行操作。
2. Skills:将 Agent 对话中的有效工作流保存为可复用技能,通过斜杠命令手动触发,或由 Linear 自动匹配执行。
3. Automations:从 Triage 开始,issue 进入系统时自动触发 Agent 工作流,智能分类、提炼或处理新增上下文。
此外预告了三项即将推出的能力:Code Intelligence(理解代码库并回答问题)、Code Diffs(人与 Agent 协作审查代码的界面)和 Linear Coding Agent(由 Linear 原生上下文增强的编程 Agent)。
Linear Agent 目前以公测形式向所有计划开放,测试期间免费。Automations 和 Code Intelligence 仅限 Business 和 Enterprise 计划。正式发布后,对话功能预计包含在基础席位价格中,高计算量功能可能转为用量计费。
信源:https://linear.app/next
❤1
「TTS基准已死」:Smallest AI发布对话语音模型Lightning V3,对OpenAI胜率76%
语音 AI 公司 Smallest AI 创始人 Sudarshan Kamath 发布对话场景专用 TTS 模型 Lightning V3,核心论点是朗读式 TTS 和对话式 TTS 是两个根本不同的问题,现有基准衡量的是前者,对后者几乎失效。
对话生成的难点在于模型无法等到完整句子再开始合成,必须在不完整上下文下实时逐块输出。Lightning V3 针对这一场景设计了四项能力:通过节奏和停顿微变化模拟「正在思考」的认知信号;根据对话轮次调整语调(澄清与开场语气不同);处理 Hinglish、Spanglish 等真实场景中的句内混语切换;以及维持用户参与度。
在对话生成条件下的评测中(使用 Seed-TTS 语料库,LLM 作为评判者,评测代码已公开),Lightning V3 MOS 评分 3.89,词错误率 5.38%,对 OpenAI gpt-4o-mini-tts 的整体自然度胜率约 76%。但 Kamath 对自己的评测结果也做了诚实限定:「将同一段音频放在不同的播放设备上、给评估者不同的关注引导,排名就会变。这不是数据噪声,这就是数据本身。」他认为 MOS 将巨大的感知差异压缩为一个平均数,当系统跨过「可懂」到「自然」的门槛后,现有基准只能确认系统没有失败,无法衡量它成功了多少。
模型原生输出 44,100 Hz,支持 15 种语言,可降采样至 8/16/24 kHz 适配电话系统。同步发布的 V3.1 新增声音克隆,5 至 15 秒音频即可生成跨语言的生产级语音副本。采用按量付费,无预付或最低消费。
信源:https://x.com/kamath_sutra/status/2036466680076050581
语音 AI 公司 Smallest AI 创始人 Sudarshan Kamath 发布对话场景专用 TTS 模型 Lightning V3,核心论点是朗读式 TTS 和对话式 TTS 是两个根本不同的问题,现有基准衡量的是前者,对后者几乎失效。
对话生成的难点在于模型无法等到完整句子再开始合成,必须在不完整上下文下实时逐块输出。Lightning V3 针对这一场景设计了四项能力:通过节奏和停顿微变化模拟「正在思考」的认知信号;根据对话轮次调整语调(澄清与开场语气不同);处理 Hinglish、Spanglish 等真实场景中的句内混语切换;以及维持用户参与度。
在对话生成条件下的评测中(使用 Seed-TTS 语料库,LLM 作为评判者,评测代码已公开),Lightning V3 MOS 评分 3.89,词错误率 5.38%,对 OpenAI gpt-4o-mini-tts 的整体自然度胜率约 76%。但 Kamath 对自己的评测结果也做了诚实限定:「将同一段音频放在不同的播放设备上、给评估者不同的关注引导,排名就会变。这不是数据噪声,这就是数据本身。」他认为 MOS 将巨大的感知差异压缩为一个平均数,当系统跨过「可懂」到「自然」的门槛后,现有基准只能确认系统没有失败,无法衡量它成功了多少。
模型原生输出 44,100 Hz,支持 15 种语言,可降采样至 8/16/24 kHz 适配电话系统。同步发布的 V3.1 新增声音克隆,5 至 15 秒音频即可生成跨语言的生产级语音副本。采用按量付费,无预付或最低消费。
信源:https://x.com/kamath_sutra/status/2036466680076050581
Hugging Face开源hf-mount:把云端模型和数据集直接挂载为本地文件夹,按需读取不用下载
Hugging Face CEO Clement Delangue 宣布开源 hf-mount,可将 Hugging Face 上的任意模型仓库、数据集或 Buckets 存储桶挂载为本地文件系统,文件在首次读取时才从网络拉取,无需预先下载完整仓库。Delangue 称这对 AI Agent 尤其实用,Agent 可直接用 ls、cat、find、grep 等标准 UNIX 命令操作远端数据,无需学习专用 API。
hf-mount 用 Rust 编写,提供 NFS(推荐,无需 root 权限)和 FUSE 两种后端,支持 Linux 和 macOS。仓库挂载为只读,Buckets 存储桶支持读写。基准测试显示 FUSE 模式顺序读取速度 1.2 GB/s,写入 900 MB/s。Kubernetes 环境可通过配套的 hf-csi-driver 将挂载点暴露给 Pod。项目以 Apache 2.0 协议开源。
信源:https://x.com/ClementDelangue/status/2036452081750409383
Hugging Face CEO Clement Delangue 宣布开源 hf-mount,可将 Hugging Face 上的任意模型仓库、数据集或 Buckets 存储桶挂载为本地文件系统,文件在首次读取时才从网络拉取,无需预先下载完整仓库。Delangue 称这对 AI Agent 尤其实用,Agent 可直接用 ls、cat、find、grep 等标准 UNIX 命令操作远端数据,无需学习专用 API。
hf-mount 用 Rust 编写,提供 NFS(推荐,无需 root 权限)和 FUSE 两种后端,支持 Linux 和 macOS。仓库挂载为只读,Buckets 存储桶支持读写。基准测试显示 FUSE 模式顺序读取速度 1.2 GB/s,写入 900 MB/s。Kubernetes 环境可通过配套的 hf-csi-driver 将挂载点暴露给 Pod。项目以 Apache 2.0 协议开源。
信源:https://x.com/ClementDelangue/status/2036452081750409383
AI自评全是好评怎么办?Anthropic用GAN思路让Claude连续编程4小时,$124造出一个音乐工作站
Anthropic Labs 工程师 Prithvi Rajasekaran 发文详解团队如何让 Claude 连续数小时自主编写完整应用。他们发现了一个关键瓶颈:让 AI 自己检查自己的代码质量时,它几乎永远觉得自己写得不错,哪怕成品明显有问题也会放行。解法是把「写代码的 AI」和「审代码的 AI」拆成两个独立角色,后者专职挑毛病,比自我审查有效得多。
最终架构由三个 AI 协作:一个负责把用户的一句话需求扩展成完整产品方案,一个负责逐功能写代码,一个负责像真实用户一样点击、操作正在运行的应用并打分。写代码的 AI 和审代码的 AI 每轮开工前先对齐「这轮做什么、怎么算做完」,审代码的 AI 会真的去用这个应用,找出实际 bug 后把修改意见打回去。
对照实验很直观:同样一句「做一个 2D 复古游戏编辑器」,单个 AI 跑 20 分钟花 $9,产出的游戏画面能打开但核心玩法完全跑不通,角色不响应操作;三 AI 协作跑 6 小时花 $200,产出的版本可以正常操控角色、在关卡里移动,审核 AI 还在过程中抓到了填充工具只画端点不填区域、后端路由冲突等具体 bug。
Claude Opus 4.6 让这套架构得以大幅简化。此前 Sonnet 4.5 会在长任务后期「焦虑收尾」,还没做完就急着结束,必须定期清空记忆重新启动。Opus 4.6 基本消除了这个问题,写代码的 AI 可以在单次会话中连贯工作超过 2 小时。用简化后的架构生成浏览器端音乐制作工具,约 4 小时花费 $124.70,审核 AI 仍然捕获了「录音按钮只切状态但没接麦克风」「音频片段无法拖拽」等遗漏。
文章还透露了一个有趣的发现:在前端设计实验中,评分标准里的措辞会直接影响 AI 的审美方向。写上「最好的设计是博物馆级别的」之后,AI 在做一个荷兰艺术博物馆网站时,第十轮迭代自行推翻了前九轮的平面方案,改为用 CSS 渲染的 3D 展厅,让访客通过虚拟门廊在画廊之间穿行。
信源:https://www.anthropic.com/engineering/harness-design-long-running-apps
Anthropic Labs 工程师 Prithvi Rajasekaran 发文详解团队如何让 Claude 连续数小时自主编写完整应用。他们发现了一个关键瓶颈:让 AI 自己检查自己的代码质量时,它几乎永远觉得自己写得不错,哪怕成品明显有问题也会放行。解法是把「写代码的 AI」和「审代码的 AI」拆成两个独立角色,后者专职挑毛病,比自我审查有效得多。
最终架构由三个 AI 协作:一个负责把用户的一句话需求扩展成完整产品方案,一个负责逐功能写代码,一个负责像真实用户一样点击、操作正在运行的应用并打分。写代码的 AI 和审代码的 AI 每轮开工前先对齐「这轮做什么、怎么算做完」,审代码的 AI 会真的去用这个应用,找出实际 bug 后把修改意见打回去。
对照实验很直观:同样一句「做一个 2D 复古游戏编辑器」,单个 AI 跑 20 分钟花 $9,产出的游戏画面能打开但核心玩法完全跑不通,角色不响应操作;三 AI 协作跑 6 小时花 $200,产出的版本可以正常操控角色、在关卡里移动,审核 AI 还在过程中抓到了填充工具只画端点不填区域、后端路由冲突等具体 bug。
Claude Opus 4.6 让这套架构得以大幅简化。此前 Sonnet 4.5 会在长任务后期「焦虑收尾」,还没做完就急着结束,必须定期清空记忆重新启动。Opus 4.6 基本消除了这个问题,写代码的 AI 可以在单次会话中连贯工作超过 2 小时。用简化后的架构生成浏览器端音乐制作工具,约 4 小时花费 $124.70,审核 AI 仍然捕获了「录音按钮只切状态但没接麦克风」「音频片段无法拖拽」等遗漏。
文章还透露了一个有趣的发现:在前端设计实验中,评分标准里的措辞会直接影响 AI 的审美方向。写上「最好的设计是博物馆级别的」之后,AI 在做一个荷兰艺术博物馆网站时,第十轮迭代自行推翻了前九轮的平面方案,改为用 CSS 渲染的 3D 展厅,让访客通过虚拟门廊在画廊之间穿行。
信源:https://www.anthropic.com/engineering/harness-design-long-running-apps
🎉1
可灵AI年化收入2.4亿美元,快手四成新代码由AI生成
快手科技发布 2025 年第四季度及全年业绩。Q4 收入 395.68 亿元,同比增长 11.8%;全年收入 1427.76 亿元,同比增长 12.5%;全年经调整净利润 206.47 亿元,同比增长 16.5%,经调整净利润率升至 14.5%。Q4 日均活跃用户 4.08 亿,月均活跃用户 7.41 亿。
可灵 AI 是本期财报的核心增长叙事。Q4 收入 3.4 亿元,较 Q3 的逾 3 亿元继续增长;2025 年 12 月单月收入突破 2000 万美元,年化收入运行率(ARR)达到 2.4 亿美元。截至年底,可灵 AI 全球用户超 6000 万,累计生成超 6 亿个视频,为超 3 万家企业客户和开发者提供 API 服务。Q4 期间先后推出可灵 O1、可灵 2.6 和可灵 3.0 系列模型,其中可灵 2.6 推出「音画同出」能力,可灵 3.0 基于 All-in-One 理念实现从生成到专业创作调度的升级。
AI 对主营业务的渗透同样值得关注。线上营销方面,生成式推荐大模型和智能出价模型带动国内营销收入提升约 5%,AIGC 营销素材消耗约 40 亿元。电商方面,Q4 GMV 同比增长 12.9% 至 5218 亿元。快手自研 AI 编程工具 CoderFlicker 生成的代码已占新增代码的 40% 以上。全年研发支出同比增长 19%,主要投向 AI 和人力。
公司还宣布派发 2025 年度末期股息每股 0.69 港元,合计 30 亿港元,继去年 8 月上市以来首次特别股息后再次派息。
信源:https://www.bloomberg.com/news/articles/2026-03-25/kuaishou-tech-sales-climb-as-ai-monetization-gains-momentum
快手科技发布 2025 年第四季度及全年业绩。Q4 收入 395.68 亿元,同比增长 11.8%;全年收入 1427.76 亿元,同比增长 12.5%;全年经调整净利润 206.47 亿元,同比增长 16.5%,经调整净利润率升至 14.5%。Q4 日均活跃用户 4.08 亿,月均活跃用户 7.41 亿。
可灵 AI 是本期财报的核心增长叙事。Q4 收入 3.4 亿元,较 Q3 的逾 3 亿元继续增长;2025 年 12 月单月收入突破 2000 万美元,年化收入运行率(ARR)达到 2.4 亿美元。截至年底,可灵 AI 全球用户超 6000 万,累计生成超 6 亿个视频,为超 3 万家企业客户和开发者提供 API 服务。Q4 期间先后推出可灵 O1、可灵 2.6 和可灵 3.0 系列模型,其中可灵 2.6 推出「音画同出」能力,可灵 3.0 基于 All-in-One 理念实现从生成到专业创作调度的升级。
AI 对主营业务的渗透同样值得关注。线上营销方面,生成式推荐大模型和智能出价模型带动国内营销收入提升约 5%,AIGC 营销素材消耗约 40 亿元。电商方面,Q4 GMV 同比增长 12.9% 至 5218 亿元。快手自研 AI 编程工具 CoderFlicker 生成的代码已占新增代码的 40% 以上。全年研发支出同比增长 19%,主要投向 AI 和人力。
公司还宣布派发 2025 年度末期股息每股 0.69 港元,合计 30 亿港元,继去年 8 月上市以来首次特别股息后再次派息。
信源:https://www.bloomberg.com/news/articles/2026-03-25/kuaishou-tech-sales-climb-as-ai-monetization-gains-momentum
Harness Engineering正在成为AI编程的真正战场
AI 编程 IDE Qoder 发布长文梳理了一个正在成形的行业趋势:头部科技公司的 AI 编程竞争焦点已从模型能力本身转向模型之外的一切,即「Harness Engineering」(编排工程)。文章用一个类比概括:模型是 CPU,上下文窗口是内存,Harness 是操作系统,Agent 是应用程序。决定最终产出质量的不是 CPU 有多快,而是操作系统设计得多好。
文章整理了多家公司已公开的实践数据:
1. Stripe 在开源 Agent 框架 Goose 基础上构建了 Blueprint 状态机系统,每周合并超过 1300 个完全由 Agent 编写的 PR
2. Shopify 开源了 Roast 工作流框架,将 AI 步骤与确定性代码交替编排
3. Ramp 基于 OpenCode 构建了 Inspect 系统,在沙箱中并行执行,合并的 PR 中 30% 由 Agent 编写
4. Coinbase 自建 Cloudbot,将 PR 审查周期从 150 小时压缩到 15 小时
5. OpenAI 用 Codex 驱动整个产品迭代,3 名工程师(后扩展至 7 人)在五个月内以零手写代码方式交付了一个百万行级产品
Qoder 认为这些方案有一个共同的结构性限制:Agent 仍然是单体的,一个模型实例、一个上下文窗口、一条执行路径从头跑到尾。任务复杂度上升时会遇到五个瓶颈:上下文窗口变成零和博弈(研究、编码、测试、审查挤在同一窗口里);角色切换的认知开销(一个 Agent 同时当技术负责人、开发、QA 和代码审查员);长链执行中的目标漂移;功能正确性验证不足(代码干净但业务逻辑不对);终端命令执行的不可逆风险。
Qoder 据此推出了 Experts Mode(测试版),将单 Agent 拆成多个专家角色:Leader 负责协调和任务分解,开发、研究、浏览器测试、QA、代码审查各由独立 Agent 承担,每个 Agent 使用不同模型和独立上下文窗口。Qoder 称内部基准测试中,Experts Mode 质量比单 Agent 模式高 67%,比 Claude Code Agent Teams 高 16%,成本不到后者的三分之二。
信源:https://x.com/qoder_ai_ide/status/2036437931867644016
AI 编程 IDE Qoder 发布长文梳理了一个正在成形的行业趋势:头部科技公司的 AI 编程竞争焦点已从模型能力本身转向模型之外的一切,即「Harness Engineering」(编排工程)。文章用一个类比概括:模型是 CPU,上下文窗口是内存,Harness 是操作系统,Agent 是应用程序。决定最终产出质量的不是 CPU 有多快,而是操作系统设计得多好。
文章整理了多家公司已公开的实践数据:
1. Stripe 在开源 Agent 框架 Goose 基础上构建了 Blueprint 状态机系统,每周合并超过 1300 个完全由 Agent 编写的 PR
2. Shopify 开源了 Roast 工作流框架,将 AI 步骤与确定性代码交替编排
3. Ramp 基于 OpenCode 构建了 Inspect 系统,在沙箱中并行执行,合并的 PR 中 30% 由 Agent 编写
4. Coinbase 自建 Cloudbot,将 PR 审查周期从 150 小时压缩到 15 小时
5. OpenAI 用 Codex 驱动整个产品迭代,3 名工程师(后扩展至 7 人)在五个月内以零手写代码方式交付了一个百万行级产品
Qoder 认为这些方案有一个共同的结构性限制:Agent 仍然是单体的,一个模型实例、一个上下文窗口、一条执行路径从头跑到尾。任务复杂度上升时会遇到五个瓶颈:上下文窗口变成零和博弈(研究、编码、测试、审查挤在同一窗口里);角色切换的认知开销(一个 Agent 同时当技术负责人、开发、QA 和代码审查员);长链执行中的目标漂移;功能正确性验证不足(代码干净但业务逻辑不对);终端命令执行的不可逆风险。
Qoder 据此推出了 Experts Mode(测试版),将单 Agent 拆成多个专家角色:Leader 负责协调和任务分解,开发、研究、浏览器测试、QA、代码审查各由独立 Agent 承担,每个 Agent 使用不同模型和独立上下文窗口。Qoder 称内部基准测试中,Experts Mode 质量比单 Agent 模式高 67%,比 Claude Code Agent Teams 高 16%,成本不到后者的三分之二。
信源:https://x.com/qoder_ai_ide/status/2036437931867644016
X (formerly Twitter)
Qoder (@qoder_ai_ide) on X
How Qoder builds Harness Engineering into Experts Mode
Umi.js作者逆向Claude Code源码:Auto Mode背后是Sonnet当安全门卫,四层流水线决定每次操作能不能跑
蚂蚁集团工程师、前端框架 Umi.js 作者陈成逆向了 Claude Code 2.1.81 的源码,完整还原了 auto mode 按下之后发生的事情。核心发现:每一次工具调用都要过一条四层决策流水线,只有前三层都无法判断时,才会调用一个独立的 AI 分类器做安全审查。
四层流水线依次是:第一层检查已有的权限规则,命中直接放行;第二层模拟 acceptEdits 模式(即允许编辑文件的权限级别),如果在该模式下就会通过,说明风险很低,跳过分类器;第三层检查只读工具白名单(Read、Grep、Glob、LSP、WebSearch 等),这些不修改任何状态,无条件放行;以上都不满足时,才进入第四层,发一个独立的 API 请求给 Claude Sonnet 做安全分类。
分类器的几个关键设计细节:始终使用 Sonnet 而非 Opus,是成本和延迟的权衡;temperature 设为 0 以确保输出确定性;分类器被定义为「自主 AI 编程 Agent 的安全监控员」,保护三类风险(提示词注入、范围蔓延、意外损害);用户的 CLAUDE.md 配置文件会被注入分类器上下文,作为判断用户意图的依据。
拦截规则覆盖 22 个以上类别,包括 force push、直推 main 分支、下载并执行外部代码、生产部署、数据外泄、自我修改权限、创建远程代码执行面、凭证泄露等。放行例外有 7 类:测试用的硬编码密钥、工作目录内的本地文件操作、只读 GET 请求、安装已声明的依赖、官方工具链安装、读取配置凭证发送到目标提供商、推送到当前工作分支。
还有一套熔断机制:连续 3 次被拒绝或累计 20 次被拒绝后,系统降级为手动确认;headless 模式下直接中止 Agent。分类器不可用时,由一个 feature flag 控制是「fail-closed」(直接拒绝)还是「fail-open」(降级为手动确认)。
auto mode 下的行为提示词注入也有精细的频率控制:每 5 轮对话注入一次,每 5 次注入周期中第 1 次是完整版(约 800 字,包含「立即执行、减少打断、行动优于计划」等六条指令),其余 4 次是一行精简版,在上下文窗口占用和行为稳定性之间取得平衡。
信源:https://blog.sorrycc.com/claude-code-auto-mode
蚂蚁集团工程师、前端框架 Umi.js 作者陈成逆向了 Claude Code 2.1.81 的源码,完整还原了 auto mode 按下之后发生的事情。核心发现:每一次工具调用都要过一条四层决策流水线,只有前三层都无法判断时,才会调用一个独立的 AI 分类器做安全审查。
四层流水线依次是:第一层检查已有的权限规则,命中直接放行;第二层模拟 acceptEdits 模式(即允许编辑文件的权限级别),如果在该模式下就会通过,说明风险很低,跳过分类器;第三层检查只读工具白名单(Read、Grep、Glob、LSP、WebSearch 等),这些不修改任何状态,无条件放行;以上都不满足时,才进入第四层,发一个独立的 API 请求给 Claude Sonnet 做安全分类。
分类器的几个关键设计细节:始终使用 Sonnet 而非 Opus,是成本和延迟的权衡;temperature 设为 0 以确保输出确定性;分类器被定义为「自主 AI 编程 Agent 的安全监控员」,保护三类风险(提示词注入、范围蔓延、意外损害);用户的 CLAUDE.md 配置文件会被注入分类器上下文,作为判断用户意图的依据。
拦截规则覆盖 22 个以上类别,包括 force push、直推 main 分支、下载并执行外部代码、生产部署、数据外泄、自我修改权限、创建远程代码执行面、凭证泄露等。放行例外有 7 类:测试用的硬编码密钥、工作目录内的本地文件操作、只读 GET 请求、安装已声明的依赖、官方工具链安装、读取配置凭证发送到目标提供商、推送到当前工作分支。
还有一套熔断机制:连续 3 次被拒绝或累计 20 次被拒绝后,系统降级为手动确认;headless 模式下直接中止 Agent。分类器不可用时,由一个 feature flag 控制是「fail-closed」(直接拒绝)还是「fail-open」(降级为手动确认)。
auto mode 下的行为提示词注入也有精细的频率控制:每 5 轮对话注入一次,每 5 次注入周期中第 1 次是完整版(约 800 字,包含「立即执行、减少打断、行动优于计划」等六条指令),其余 4 次是一行精简版,在上下文窗口占用和行为稳定性之间取得平衡。
信源:https://blog.sorrycc.com/claude-code-auto-mode
👍1
DeepSeek一口气放17个岗位全押Agent:要求重度使用Claude Code,全栈岗写明Vibe Coding优先
DeepSeek 集中开放 17 个招聘岗位,核心研发方向从基础模型研究明确转向 Agent 产品化。三个专属 Agent 岗位覆盖算法研究、数据评测和基础设施全链条:算法研究员聚焦强化学习在大模型对齐中的应用(RLHF/RLAIF、过程奖励、偏好学习等方向);数据评测专家负责构建评测数据集,针对 Agent 的规划、工具调用、多轮交互、长期记忆等能力设计测试用例;基础设施工程师负责搭建 Agent 运行底座,包括集成外部工具到内部强化学习基础设施、搭建评测平台。
招聘要求中有两个值得注意的信号。多个岗位在加分项中明确写出「重度使用 Claude Code、Cursor、Copilot 等 AI 编程工具」优先。全栈开发工程师岗位职责中出现了一条不常见的描述:「作为 Vibe Coding 重度用户,持续探索模型能力在产品中的创新应用」,同一岗位的核心工作方向是构建「支撑海量 AI Agent 运行的下一代容器调度与隔离平台」。
模型策略产品经理岗位单独设立了 Agent 方向,要求候选人熟悉 Claude Code、OpenClaw、Manus 等 Agent 产品,需洞察高价值应用场景(包括个人助理、Deep Research、自动化工作流、多模态设备控制),并主导 Agent 评测体系及训练数据方案设计。对比今年 1 月,当时开放的核心岗位集中在「深度学习研究员-AGI」等通用方向,此次招聘重心已明显向 Agent 产品化倾斜。
信源:https://app.mokahr.com/social-recruitment/high-flyer/140576#/
DeepSeek 集中开放 17 个招聘岗位,核心研发方向从基础模型研究明确转向 Agent 产品化。三个专属 Agent 岗位覆盖算法研究、数据评测和基础设施全链条:算法研究员聚焦强化学习在大模型对齐中的应用(RLHF/RLAIF、过程奖励、偏好学习等方向);数据评测专家负责构建评测数据集,针对 Agent 的规划、工具调用、多轮交互、长期记忆等能力设计测试用例;基础设施工程师负责搭建 Agent 运行底座,包括集成外部工具到内部强化学习基础设施、搭建评测平台。
招聘要求中有两个值得注意的信号。多个岗位在加分项中明确写出「重度使用 Claude Code、Cursor、Copilot 等 AI 编程工具」优先。全栈开发工程师岗位职责中出现了一条不常见的描述:「作为 Vibe Coding 重度用户,持续探索模型能力在产品中的创新应用」,同一岗位的核心工作方向是构建「支撑海量 AI Agent 运行的下一代容器调度与隔离平台」。
模型策略产品经理岗位单独设立了 Agent 方向,要求候选人熟悉 Claude Code、OpenClaw、Manus 等 Agent 产品,需洞察高价值应用场景(包括个人助理、Deep Research、自动化工作流、多模态设备控制),并主导 Agent 评测体系及训练数据方案设计。对比今年 1 月,当时开放的核心岗位集中在「深度学习研究员-AGI」等通用方向,此次招聘重心已明显向 Agent 产品化倾斜。
信源:https://app.mokahr.com/social-recruitment/high-flyer/140576#/
豆包手机助手幕后操盘手:36氪创始人刘成城,其团队在字节内部与抖音平级
科技媒体 36 氪创始人刘成城目前担任字节跳动 AI 硬件团队 Ocean 负责人,直接向 AI 产品团队 Flow 负责人朱骏汇报,操盘豆包手机助手及字节全线 AI 硬件业务。刘成城 2019 年以 30 岁年纪带领 36 氪登陆纳斯达克后,秘密创办鲸鲮科技,研发国产操作系统及平板硬件并主要售往海外。该公司后被字节收购,刘成城及创始团队随之进入字节内部。
入职后他推动了字节对开放式耳机品牌 Oladance 的全资收购(约 5000 万美元),随后主导首款 AI 硬件 Ola Friend 上线。AI 眼镜项目因硬件同质化于今年 2 月内部叫停后,Ocean 团队的战略重心已转向豆包手机助手,这款能在系统层跨应用执行复杂任务的产品被视为字节 AI 硬件线真正的突破口。Flow 团队(含 Ocean)在字节内部拥有与抖音团队平级的优先级。
信源:https://mp.weixin.qq.com/s/WhgrPVqoHX8GNgjAZJ6LKw
科技媒体 36 氪创始人刘成城目前担任字节跳动 AI 硬件团队 Ocean 负责人,直接向 AI 产品团队 Flow 负责人朱骏汇报,操盘豆包手机助手及字节全线 AI 硬件业务。刘成城 2019 年以 30 岁年纪带领 36 氪登陆纳斯达克后,秘密创办鲸鲮科技,研发国产操作系统及平板硬件并主要售往海外。该公司后被字节收购,刘成城及创始团队随之进入字节内部。
入职后他推动了字节对开放式耳机品牌 Oladance 的全资收购(约 5000 万美元),随后主导首款 AI 硬件 Ola Friend 上线。AI 眼镜项目因硬件同质化于今年 2 月内部叫停后,Ocean 团队的战略重心已转向豆包手机助手,这款能在系统层跨应用执行复杂任务的产品被视为字节 AI 硬件线真正的突破口。Flow 团队(含 Ocean)在字节内部拥有与抖音团队平级的优先级。
信源:https://mp.weixin.qq.com/s/WhgrPVqoHX8GNgjAZJ6LKw
🎉1
不只是调用:苹果可在自家机房把Gemini蒸馏成iPhone小模型
苹果与谷歌的 AI 合作协议「远比外界此前了解的更深」。苹果在自有数据中心内拥有对 Gemini 大模型的完整访问权限,可将其蒸馏为适配特定任务的小模型,甚至缩小到能直接在苹果设备端运行。
由于拥有完整模型访问权,苹果的蒸馏不仅能模仿 Gemini 输出的答案,还能学习其内部推理计算过程,生成性能接近原始大模型但算力需求大幅降低的小模型。知情人士称苹果获得了「远超预期的自由度」。苹果内部的 Foundation Models 团队仍在自研模型,但目标方向尚不明确。报道同时确认,苹果计划在今年 6 月 WWDC 上发布 Siri 重大升级,包括对话记忆和基于场景的主动建议功能。
信源:https://www.theinformation.com/newsletters/ai-agenda/apple-can-distill-googles-big-gemini-model
苹果与谷歌的 AI 合作协议「远比外界此前了解的更深」。苹果在自有数据中心内拥有对 Gemini 大模型的完整访问权限,可将其蒸馏为适配特定任务的小模型,甚至缩小到能直接在苹果设备端运行。
由于拥有完整模型访问权,苹果的蒸馏不仅能模仿 Gemini 输出的答案,还能学习其内部推理计算过程,生成性能接近原始大模型但算力需求大幅降低的小模型。知情人士称苹果获得了「远超预期的自由度」。苹果内部的 Foundation Models 团队仍在自研模型,但目标方向尚不明确。报道同时确认,苹果计划在今年 6 月 WWDC 上发布 Siri 重大升级,包括对话记忆和基于场景的主动建议功能。
信源:https://www.theinformation.com/newsletters/ai-agenda/apple-can-distill-googles-big-gemini-model
Meta一天内裁员700人:Reality Labs再遭重创,今年已累计裁逾千人
Meta 周三确认裁员约 700 人,波及 Reality Labs、Facebook、招聘、销售和全球运营等多个部门,部分员工将获得内部转岗机会。今年 1 月 Meta 已裁撤 Reality Labs 超 1000 个岗位(约占该部门 10%),两轮裁员集中冲击元宇宙团队,显示 Meta 正系统性将资源从元宇宙转向 AI。
Meta 发言人称各团队「定期进行重组或调整,以确保处于实现目标的最佳位置」。裁员消息与前一日披露的高管巨额期权激励计划形成鲜明对比。截至 2025 年底 Meta 约有 7.9 万名员工,2026 年资本开支指引为 1150 亿至 1350 亿美元,绝大部分用于 AI 基础设施。
信源:https://www.nytimes.com/2026/03/25/technology/meta-layoffs-ai-executives.html
Meta 周三确认裁员约 700 人,波及 Reality Labs、Facebook、招聘、销售和全球运营等多个部门,部分员工将获得内部转岗机会。今年 1 月 Meta 已裁撤 Reality Labs 超 1000 个岗位(约占该部门 10%),两轮裁员集中冲击元宇宙团队,显示 Meta 正系统性将资源从元宇宙转向 AI。
Meta 发言人称各团队「定期进行重组或调整,以确保处于实现目标的最佳位置」。裁员消息与前一日披露的高管巨额期权激励计划形成鲜明对比。截至 2025 年底 Meta 约有 7.9 万名员工,2026 年资本开支指引为 1150 亿至 1350 亿美元,绝大部分用于 AI 基础设施。
信源:https://www.nytimes.com/2026/03/25/technology/meta-layoffs-ai-executives.html
OpenClaw v2026.3.24:Gateway新增OpenAI API兼容端点,微软Teams迁移官方SDK
开源 AI 助手 OpenClaw(龙虾)发布 v2026.3.24 版本。Gateway 新增
微软 Teams 渠道迁移至官方 SDK,新增流式 1:1 回复、欢迎卡片与提示词建议、反馈机制、打字提示和原生 AI 标签,同时支持已发送消息的编辑和删除。其他主要更新:
1. 内置 Skills 新增一键安装引导,CLI 和控制面板在依赖缺失时自动提示安装
2. 新增
3. Agent
4. Slack 交互回复恢复富文本格式,支持自动将尾部选项文本渲染为按钮或下拉菜单
5. Discord 支持 LLM 自动生成线程标题
6. Node.js 最低版本降至 22.14+,继续推荐 Node 24
安全修复方面,本版本封堵了
信源:https://github.com/openclaw/openclaw/releases/tag/v2026.3.24
开源 AI 助手 OpenClaw(龙虾)发布 v2026.3.24 版本。Gateway 新增
/v1/models 和 /v1/embeddings 端点,并在 /v1/chat/completions 和 /v1/responses 中支持转发显式模型指定参数,使用 OpenAI API 格式的第三方客户端和 RAG 应用可直接对接 OpenClaw Gateway。微软 Teams 渠道迁移至官方 SDK,新增流式 1:1 回复、欢迎卡片与提示词建议、反馈机制、打字提示和原生 AI 标签,同时支持已发送消息的编辑和删除。其他主要更新:
1. 内置 Skills 新增一键安装引导,CLI 和控制面板在依赖缺失时自动提示安装
2. 新增
--container 参数,支持在 Docker 或 Podman 容器内执行 OpenClaw 命令3. Agent
/tools 改为展示当前实际可用工具,控制面板新增实时可用状态面板4. Slack 交互回复恢复富文本格式,支持自动将尾部选项文本渲染为按钮或下拉菜单
5. Discord 支持 LLM 自动生成线程标题
6. Node.js 最低版本降至 22.14+,继续推荐 Node 24
安全修复方面,本版本封堵了
mediaUrl`/`fileUrl 别名绕过沙箱媒体目录限制的漏洞,并修复了 Gateway 重启后 Agent 会话可能无法正确恢复到对应 Telegram 话题或 Slack 线程的问题。信源:https://github.com/openclaw/openclaw/releases/tag/v2026.3.24
❤1
奔驰把国产AI放进了迈巴赫:智谱联合清华为S级打造端侧多模态大模型
梅赛德斯-奔驰中国宣布,与清华大学、今年 1 月在港交所上市的 AI 大模型公司智谱联合开发的端侧多模态大模型将落地新一代迈巴赫 S 级及全新 S 级轿车。该模型部署于后排娱乐系统,融合自然语言处理与视觉、音频等多模态理解及生成能力,结合车内摄像头等感知硬件,在本地算力条件下完成推理。据智谱官方表述,奔驰由此成为首个在后排娱乐系统中应用多模态大模型的汽车品牌。
信源:https://mp.weixin.qq.com/s/uqtpVaRjyosw6T7e1qw_oA
梅赛德斯-奔驰中国宣布,与清华大学、今年 1 月在港交所上市的 AI 大模型公司智谱联合开发的端侧多模态大模型将落地新一代迈巴赫 S 级及全新 S 级轿车。该模型部署于后排娱乐系统,融合自然语言处理与视觉、音频等多模态理解及生成能力,结合车内摄像头等感知硬件,在本地算力条件下完成推理。据智谱官方表述,奔驰由此成为首个在后排娱乐系统中应用多模态大模型的汽车品牌。
信源:https://mp.weixin.qq.com/s/uqtpVaRjyosw6T7e1qw_oA
给龙虾发条抖店链接就能出片:创作Agent 2.0接入Seedance 2.0
字节跳动云服务平台火山引擎发布营销视频生成工具创作 Agent 2.0,接入自研视频生成模型 Seedance 2.0,视频时长从短片段扩展至 60 秒,支持多语言口播,覆盖品牌广告、产品评测、卖点演绎、Vlog 等 6 类营销场景。画面一致性也有提升,可保持人脸稳定、商品细节不变形、文字清晰可读。
创作 Agent 2.0 同步上架火山引擎 AI Agent 平台 ArkClaw 的官方 Skill 库。用户向龙虾发送抖店商品链接,即可自动读取商品信息、生成创意分析与分镜脚本,在对话中直接输出营销短视频。
信源:https://mp.weixin.qq.com/s/CDgA_e7rNoqgfKHVwGTsFg
字节跳动云服务平台火山引擎发布营销视频生成工具创作 Agent 2.0,接入自研视频生成模型 Seedance 2.0,视频时长从短片段扩展至 60 秒,支持多语言口播,覆盖品牌广告、产品评测、卖点演绎、Vlog 等 6 类营销场景。画面一致性也有提升,可保持人脸稳定、商品细节不变形、文字清晰可读。
创作 Agent 2.0 同步上架火山引擎 AI Agent 平台 ArkClaw 的官方 Skill 库。用户向龙虾发送抖店商品链接,即可自动读取商品信息、生成创意分析与分镜脚本,在对话中直接输出营销短视频。
信源:https://mp.weixin.qq.com/s/CDgA_e7rNoqgfKHVwGTsFg
手机上也能用AI操作工作软件了:Claude移动端上线Figma、Canva等集成
Anthropic 宣布 Claude 的工具集成(connectors)现已扩展至移动端,iOS 和 Android 用户可在手机上的 Claude 对话中直接浏览 Figma 设计稿、创建 Canva 幻灯片、查看 Amplitude 数据看板。
Connectors 基于 MCP 协议连接第三方应用,目前已覆盖 Slack、Google Drive、Linear 等工具,部分 connector 支持交互模式,可在对话界面中渲染实时操作界面而非纯文本回复。用户需先在桌面端完成 connector 的添加和授权,移动端暂不支持新增或浏览 connector 目录。
信源:https://x.com/claudeai/status/2036850783526719610
Anthropic 宣布 Claude 的工具集成(connectors)现已扩展至移动端,iOS 和 Android 用户可在手机上的 Claude 对话中直接浏览 Figma 设计稿、创建 Canva 幻灯片、查看 Amplitude 数据看板。
Connectors 基于 MCP 协议连接第三方应用,目前已覆盖 Slack、Google Drive、Linear 等工具,部分 connector 支持交互模式,可在对话界面中渲染实时操作界面而非纯文本回复。用户需先在桌面端完成 connector 的添加和授权,移动端暂不支持新增或浏览 connector 目录。
信源:https://x.com/claudeai/status/2036850783526719610
谷歌发布Lyria 3 Pro:AI生成音乐从30秒延长到3分钟,登陆5个平台
谷歌发布音乐生成模型 Lyria 3 Pro,单曲时长从前代 Lyria 3 的 30 秒延长至 3 分钟,支持指定前奏、主歌、副歌、桥段等歌曲结构。模型同时登陆五个平台:
1. Gemini 应用(仅付费用户,免费用户仍可使用 Lyria 3)
2. Vertex AI(企业公共预览)
3. Google AI Studio 及 Gemini API(开发者可用)
4. Google Vids(面向 Workspace 用户本周起滚动上线)
5. ProducerAI(谷歌上月收购的协作音乐创作工具,全球免费和付费用户均可使用)
所有 Lyria 生成的音频均嵌入 SynthID 水印以标识 AI 生成内容。谷歌称训练数据来自「YouTube 和谷歌依据服务条款、合作协议及适用法律有权使用的素材」,模型不会模仿特定艺术家风格。同一周,Spotify 上线了 Artist Profile Protection 功能,要求发行方手动审批艺术家新上架内容,以对抗 AI 克隆假冒。
信源:https://blog.google/innovation-and-ai/technology/ai/lyria-3-pro/
谷歌发布音乐生成模型 Lyria 3 Pro,单曲时长从前代 Lyria 3 的 30 秒延长至 3 分钟,支持指定前奏、主歌、副歌、桥段等歌曲结构。模型同时登陆五个平台:
1. Gemini 应用(仅付费用户,免费用户仍可使用 Lyria 3)
2. Vertex AI(企业公共预览)
3. Google AI Studio 及 Gemini API(开发者可用)
4. Google Vids(面向 Workspace 用户本周起滚动上线)
5. ProducerAI(谷歌上月收购的协作音乐创作工具,全球免费和付费用户均可使用)
所有 Lyria 生成的音频均嵌入 SynthID 水印以标识 AI 生成内容。谷歌称训练数据来自「YouTube 和谷歌依据服务条款、合作协议及适用法律有权使用的素材」,模型不会模仿特定艺术家风格。同一周,Spotify 上线了 Artist Profile Protection 功能,要求发行方手动审批艺术家新上架内容,以对抗 AI 克隆假冒。
信源:https://blog.google/innovation-and-ai/technology/ai/lyria-3-pro/
美团开源LongCat-Next:3B参数统一视觉理解、生成与语音
美团龙猫团队开源 LongCat-Next,一个基于 MoE 架构、激活参数 3B 的原生多模态模型,在单一自回归框架下统一了文本、视觉理解、图像生成、语音理解和语音合成五种能力。模型及配套分词器以 MIT 许可证开源,权重已上线 HuggingFace。
LongCat-Next 的核心设计是 DiNA(离散原生自回归)范式:通过为每种模态设计配对的分词器和解码器,将视觉和音频信号转化为离散 token,与文本共享同一嵌入空间,用统一的 next-token prediction 完成所有任务。视觉侧的关键组件 dNaViT(离散原生分辨率 Vision Transformer)将图像特征提取为「视觉词」,支持动态分词和解码,在 28 倍压缩比下仍保持较强的图像生成质量,尤其在文字渲染方面表现突出。
在同等激活参数量级(A3B)的模型对比中,LongCat-Next 的主要基准表现:
1. 视觉理解:MMMU-Pro 60.3(Qwen3-Omni 57.0,GPT5-minimal 62.7),MathVista 83.1(Qwen3-Omni 75.9,GPT5-minimal 50.9),MathVision 64.7(领先所有对比模型),DocVQA 94.2
2. 图像生成:GenEval 84.44,LongText-EN 93.15(FLUX.1-dev 60.70,Emu-3.5 97.60)
3. 编程:SWE-Bench 43.0(Kimi-Linear-48B 32.8,Qwen3-Next-80B 37.6)
4. Agent 工具调用:Tau2-Retail 73.68(Qwen3-Next 57.3),Tau2-Telecom 62.06(Qwen3-Next 13.2)
在理解与生成统一模型的横向对比中,LongCat-Next 的 MMMU 得分 70.6 领先第二名 NEO-unify(68.9),大幅超过 BAGEL(55.3)和 Ovis-U1(51.1)等此前的统一模型方案。SWE-Bench 43.0 和 Tau2 系列工具调用基准的表现也说明,这一多模态统一架构并未牺牲纯文本和 Agent 能力。
信源:https://longcat.chat/longcat-next/intro
美团龙猫团队开源 LongCat-Next,一个基于 MoE 架构、激活参数 3B 的原生多模态模型,在单一自回归框架下统一了文本、视觉理解、图像生成、语音理解和语音合成五种能力。模型及配套分词器以 MIT 许可证开源,权重已上线 HuggingFace。
LongCat-Next 的核心设计是 DiNA(离散原生自回归)范式:通过为每种模态设计配对的分词器和解码器,将视觉和音频信号转化为离散 token,与文本共享同一嵌入空间,用统一的 next-token prediction 完成所有任务。视觉侧的关键组件 dNaViT(离散原生分辨率 Vision Transformer)将图像特征提取为「视觉词」,支持动态分词和解码,在 28 倍压缩比下仍保持较强的图像生成质量,尤其在文字渲染方面表现突出。
在同等激活参数量级(A3B)的模型对比中,LongCat-Next 的主要基准表现:
1. 视觉理解:MMMU-Pro 60.3(Qwen3-Omni 57.0,GPT5-minimal 62.7),MathVista 83.1(Qwen3-Omni 75.9,GPT5-minimal 50.9),MathVision 64.7(领先所有对比模型),DocVQA 94.2
2. 图像生成:GenEval 84.44,LongText-EN 93.15(FLUX.1-dev 60.70,Emu-3.5 97.60)
3. 编程:SWE-Bench 43.0(Kimi-Linear-48B 32.8,Qwen3-Next-80B 37.6)
4. Agent 工具调用:Tau2-Retail 73.68(Qwen3-Next 57.3),Tau2-Telecom 62.06(Qwen3-Next 13.2)
在理解与生成统一模型的横向对比中,LongCat-Next 的 MMMU 得分 70.6 领先第二名 NEO-unify(68.9),大幅超过 BAGEL(55.3)和 Ovis-U1(51.1)等此前的统一模型方案。SWE-Bench 43.0 和 Tau2 系列工具调用基准的表现也说明,这一多模态统一架构并未牺牲纯文本和 Agent 能力。
信源:https://longcat.chat/longcat-next/intro
GitHub默认用你的代码训练AI:Copilot个人版用户4月24日起需主动关闭
GitHub 宣布更新 Copilot 数据使用政策,4 月 24 日起,Copilot Free、Pro 和 Pro+ 用户的交互数据将默认用于训练和改进 AI 模型,除非用户主动在设置中关闭。Copilot Business 和 Enterprise 用户不受影响。此前已选择退出数据收集的用户,偏好设置将被保留,无需重新操作。
GitHub 将收集的数据范围包括:
1. 用户接受或修改的代码输出
2. 发送给 Copilot 的输入和代码片段
3. 光标周围的代码上下文
4. 注释和文档
5. 文件名、仓库结构与导航模式
6. 与 Copilot 各功能(Chat、内联建议等)的交互记录
7. 用户对建议的评分反馈
虽然 GitHub 称不会使用私有仓库中「静态存储」的内容,但用户在使用 Copilot 时,私有仓库的代码会被实时处理,这部分交互数据同样可能被用于模型训练,除非用户选择退出。
数据可能与微软等关联公司共享,但不会提供给第三方 AI 模型供应商。GitHub 首席产品官 Mario Rodriguez 在博文中表示,此前已使用微软员工的交互数据训练模型,「在多种编程语言中看到了接受率的显著提升」,希望通过更广泛的真实开发数据进一步改善模型表现。用户可在 GitHub 设置的「Privacy」选项中关闭数据共享。
信源:https://github.blog/news-insights/company-news/updates-to-github-copilot-interaction-data-usage-policy/
GitHub 宣布更新 Copilot 数据使用政策,4 月 24 日起,Copilot Free、Pro 和 Pro+ 用户的交互数据将默认用于训练和改进 AI 模型,除非用户主动在设置中关闭。Copilot Business 和 Enterprise 用户不受影响。此前已选择退出数据收集的用户,偏好设置将被保留,无需重新操作。
GitHub 将收集的数据范围包括:
1. 用户接受或修改的代码输出
2. 发送给 Copilot 的输入和代码片段
3. 光标周围的代码上下文
4. 注释和文档
5. 文件名、仓库结构与导航模式
6. 与 Copilot 各功能(Chat、内联建议等)的交互记录
7. 用户对建议的评分反馈
虽然 GitHub 称不会使用私有仓库中「静态存储」的内容,但用户在使用 Copilot 时,私有仓库的代码会被实时处理,这部分交互数据同样可能被用于模型训练,除非用户选择退出。
数据可能与微软等关联公司共享,但不会提供给第三方 AI 模型供应商。GitHub 首席产品官 Mario Rodriguez 在博文中表示,此前已使用微软员工的交互数据训练模型,「在多种编程语言中看到了接受率的显著提升」,希望通过更广泛的真实开发数据进一步改善模型表现。用户可在 GitHub 设置的「Privacy」选项中关闭数据共享。
信源:https://github.blog/news-insights/company-news/updates-to-github-copilot-interaction-data-usage-policy/
Harvey三个月估值从80亿涨到110亿美元:10万律师已在用AI Agent做尽调
法律 AI 公司 Harvey 完成 2 亿美元新一轮融资,由新加坡主权基金 GIC 和 Sequoia 联合领投,估值从去年 12 月的 80 亿美元升至 110 亿美元。Sequoia 已连续领投 Harvey 三轮融资,合伙人 Pat Grady 称这在 Sequoia 历史上极为罕见。公司累计融资总额超过 10 亿美元。
Harvey 成立于 2022 年,由前律师 Winston Weinberg 和前谷歌 DeepMind 及 Meta 研究员 Gabe Pereyra 联合创立,产品覆盖合同分析、合规审查、尽职调查和诉讼支持。目前服务超过 10 万名律师和 1300 家机构,客户包括 AmLaw 100 中的多数律所以及 NBCUniversal、汇丰等企业。1 月年化营收达 1.9 亿美元,较去年 8 月的 1 亿美元接近翻倍。平台上运行着超过 2.5 万个定制 AI Agent。
信源:https://www.cnbc.com/2026/03/25/legal-ai-startup-harvey-raises-200-million-at-11-billion-valuation.html
法律 AI 公司 Harvey 完成 2 亿美元新一轮融资,由新加坡主权基金 GIC 和 Sequoia 联合领投,估值从去年 12 月的 80 亿美元升至 110 亿美元。Sequoia 已连续领投 Harvey 三轮融资,合伙人 Pat Grady 称这在 Sequoia 历史上极为罕见。公司累计融资总额超过 10 亿美元。
Harvey 成立于 2022 年,由前律师 Winston Weinberg 和前谷歌 DeepMind 及 Meta 研究员 Gabe Pereyra 联合创立,产品覆盖合同分析、合规审查、尽职调查和诉讼支持。目前服务超过 10 万名律师和 1300 家机构,客户包括 AmLaw 100 中的多数律所以及 NBCUniversal、汇丰等企业。1 月年化营收达 1.9 亿美元,较去年 8 月的 1 亿美元接近翻倍。平台上运行着超过 2.5 万个定制 AI Agent。
信源:https://www.cnbc.com/2026/03/25/legal-ai-startup-harvey-raises-200-million-at-11-billion-valuation.html