动察Beating AI News
3.14K subscribers
873 photos
2 videos
3.38K links
AI新闻信息流
Download Telegram
一个Transformer同时生成视频和语音:Sand.ai开源150亿参数人像基座模型,单H100两秒出片

视频生成创业公司 Sand.ai 与上海创智学院 GAIR 实验室联合开源音视频联合生成基座模型 daVinci-MagiHuman,150 亿参数,采用单流 Transformer 架构,将文本、视频、音频统一放入同一个 token 序列,仅靠自注意力完成联合建模,不依赖跨注意力或模态专属分支。

模型以人像场景为核心能力,可生成富有表现力的面部表情与自然语音,实现口型、表情与动作的精确同步,支持中文(普通话与粤语)、英文、日文、韩文、德文、法文六种语言。推理侧结合模型蒸馏、隐空间超分辨率和 Turbo VAE 解码器,在单张 H100 GPU 上 2 秒生成 5 秒 256p 视频。

在客观评测中,daVinci-MagiHuman 在开源模型中视觉质量和文本一致性均为最优,语音可懂度词错误率(WER)14.60%,远低于 LTX 2.3 和 Ovi 1.1。2000 组人工盲评中,对 Ovi 1.1 胜率 80%,对 LTX 2.3 胜率 60.9%。完整模型栈(基座模型、蒸馏模型、超分模型、推理代码)全部开源。

Sand.ai 由马尔奖(Marr Prize)得主曹越创立,此前发布了自回归视频生成模型 Magi-1 和主打「AI 演员」的 GAGA-1。上海创智学院 GAIR 实验室由刘鹏飞领导,聚焦生成式 AI 前沿研究。

信源:https://arxiv.org/abs/2603.21986
WordPress 7.0将于4月9日发布,全球43%网站将原生支持AI Agent接入

WordPress 7.0 定于 4 月 9 日发布,核心变化之一是将 MCP(Model Context Protocol)适配器纳入核心,使任何 WordPress 站点都能作为 MCP 服务器,允许 Claude、ChatGPT 等 AI Agent 直接在站点内发现功能、理解结构并执行操作。

具体而言,7.0 在 AI 基础设施层面引入三个组件:

1. AI Connectors:在设置面板统一管理 AI 服务的 API 密钥,首批支持 Anthropic、OpenAI、谷歌三家,所有插件共享同一套凭证,不再各自存储。
2. Abilities API:6.9 版本引入、7.0 扩展的能力注册接口,插件可以用 AI 能理解的格式声明自身功能(如获取文章、更新页面、运行站点健康检查),标准化输入输出。
3. MCP Adapter:将所有已注册的 Ability 通过 MCP 协议暴露给外部 AI Agent,Agent 可自动发现站点能力并在用户授权下调用。

WordPress.com 已于 3 月 20 日率先上线 MCP 写入权限,覆盖 6 类内容的 19 项写操作(编辑内容、管理评论、创建页面、上传媒体、调整分类和标签等)。所有操作需用户明确确认后才会执行,新内容默认为草稿,删除内容进入回收站保留 30 天。WordPress.com 还默认启用 OAuth 2.1 认证,AI 客户端仅使用有时效的 token,不接触用户凭证。

WordPress 驱动着全球约 43% 的网站。MCP 支持进入核心意味着这些站点将具备标准化的 AI Agent 接入能力,类似于 2016 年 REST API 进入核心后催生了无头 WordPress 和现代主题开发生态。

信源:https://x.com/adityaarsharma/status/2036485004348498180
Linear宣布「Issue tracking已死」,全面转向AI Agent驱动的产品系统

项目管理工具 Linear CEO Karri Saarinen 发布公开信,宣布 Linear 正从 issue tracker 转型为「将上下文转化为执行」的共享产品系统,核心论点是传统 issue tracking 为人与人之间的工作交接而设计,而 AI Agent 时代的瓶颈已转向判断力,系统应围绕上下文和 Agent 重建。

Karri 披露了一组数据:目前超过 75% 的 Linear 企业级工作区已安装编程 Agent,过去三个月 Agent 完成的工作量增长了 5 倍,Agent 创建的新 issue 占比接近 25%。

围绕这一转型,Linear 同步上线三项功能:

1. Linear Agent:内置的原生 AI Agent,理解工作区内的路线图、issue 和代码,可在桌面端(Cmd/Ctrl+J)、移动端、Slack 和 Microsoft Teams 中使用,支持综合上下文、提出建议并直接执行操作。
2. Skills:将 Agent 对话中的有效工作流保存为可复用技能,通过斜杠命令手动触发,或由 Linear 自动匹配执行。
3. Automations:从 Triage 开始,issue 进入系统时自动触发 Agent 工作流,智能分类、提炼或处理新增上下文。

此外预告了三项即将推出的能力:Code Intelligence(理解代码库并回答问题)、Code Diffs(人与 Agent 协作审查代码的界面)和 Linear Coding Agent(由 Linear 原生上下文增强的编程 Agent)。

Linear Agent 目前以公测形式向所有计划开放,测试期间免费。Automations 和 Code Intelligence 仅限 Business 和 Enterprise 计划。正式发布后,对话功能预计包含在基础席位价格中,高计算量功能可能转为用量计费。

信源:https://linear.app/next
1
「TTS基准已死」:Smallest AI发布对话语音模型Lightning V3,对OpenAI胜率76%

语音 AI 公司 Smallest AI 创始人 Sudarshan Kamath 发布对话场景专用 TTS 模型 Lightning V3,核心论点是朗读式 TTS 和对话式 TTS 是两个根本不同的问题,现有基准衡量的是前者,对后者几乎失效。

对话生成的难点在于模型无法等到完整句子再开始合成,必须在不完整上下文下实时逐块输出。Lightning V3 针对这一场景设计了四项能力:通过节奏和停顿微变化模拟「正在思考」的认知信号;根据对话轮次调整语调(澄清与开场语气不同);处理 Hinglish、Spanglish 等真实场景中的句内混语切换;以及维持用户参与度。

在对话生成条件下的评测中(使用 Seed-TTS 语料库,LLM 作为评判者,评测代码已公开),Lightning V3 MOS 评分 3.89,词错误率 5.38%,对 OpenAI gpt-4o-mini-tts 的整体自然度胜率约 76%。但 Kamath 对自己的评测结果也做了诚实限定:「将同一段音频放在不同的播放设备上、给评估者不同的关注引导,排名就会变。这不是数据噪声,这就是数据本身。」他认为 MOS 将巨大的感知差异压缩为一个平均数,当系统跨过「可懂」到「自然」的门槛后,现有基准只能确认系统没有失败,无法衡量它成功了多少。

模型原生输出 44,100 Hz,支持 15 种语言,可降采样至 8/16/24 kHz 适配电话系统。同步发布的 V3.1 新增声音克隆,5 至 15 秒音频即可生成跨语言的生产级语音副本。采用按量付费,无预付或最低消费。

信源:https://x.com/kamath_sutra/status/2036466680076050581
Hugging Face开源hf-mount:把云端模型和数据集直接挂载为本地文件夹,按需读取不用下载

Hugging Face CEO Clement Delangue 宣布开源 hf-mount,可将 Hugging Face 上的任意模型仓库、数据集或 Buckets 存储桶挂载为本地文件系统,文件在首次读取时才从网络拉取,无需预先下载完整仓库。Delangue 称这对 AI Agent 尤其实用,Agent 可直接用 ls、cat、find、grep 等标准 UNIX 命令操作远端数据,无需学习专用 API。

hf-mount 用 Rust 编写,提供 NFS(推荐,无需 root 权限)和 FUSE 两种后端,支持 Linux 和 macOS。仓库挂载为只读,Buckets 存储桶支持读写。基准测试显示 FUSE 模式顺序读取速度 1.2 GB/s,写入 900 MB/s。Kubernetes 环境可通过配套的 hf-csi-driver 将挂载点暴露给 Pod。项目以 Apache 2.0 协议开源。

信源:https://x.com/ClementDelangue/status/2036452081750409383
AI自评全是好评怎么办?Anthropic用GAN思路让Claude连续编程4小时,$124造出一个音乐工作站

Anthropic Labs 工程师 Prithvi Rajasekaran 发文详解团队如何让 Claude 连续数小时自主编写完整应用。他们发现了一个关键瓶颈:让 AI 自己检查自己的代码质量时,它几乎永远觉得自己写得不错,哪怕成品明显有问题也会放行。解法是把「写代码的 AI」和「审代码的 AI」拆成两个独立角色,后者专职挑毛病,比自我审查有效得多。

最终架构由三个 AI 协作:一个负责把用户的一句话需求扩展成完整产品方案,一个负责逐功能写代码,一个负责像真实用户一样点击、操作正在运行的应用并打分。写代码的 AI 和审代码的 AI 每轮开工前先对齐「这轮做什么、怎么算做完」,审代码的 AI 会真的去用这个应用,找出实际 bug 后把修改意见打回去。

对照实验很直观:同样一句「做一个 2D 复古游戏编辑器」,单个 AI 跑 20 分钟花 $9,产出的游戏画面能打开但核心玩法完全跑不通,角色不响应操作;三 AI 协作跑 6 小时花 $200,产出的版本可以正常操控角色、在关卡里移动,审核 AI 还在过程中抓到了填充工具只画端点不填区域、后端路由冲突等具体 bug。

Claude Opus 4.6 让这套架构得以大幅简化。此前 Sonnet 4.5 会在长任务后期「焦虑收尾」,还没做完就急着结束,必须定期清空记忆重新启动。Opus 4.6 基本消除了这个问题,写代码的 AI 可以在单次会话中连贯工作超过 2 小时。用简化后的架构生成浏览器端音乐制作工具,约 4 小时花费 $124.70,审核 AI 仍然捕获了「录音按钮只切状态但没接麦克风」「音频片段无法拖拽」等遗漏。

文章还透露了一个有趣的发现:在前端设计实验中,评分标准里的措辞会直接影响 AI 的审美方向。写上「最好的设计是博物馆级别的」之后,AI 在做一个荷兰艺术博物馆网站时,第十轮迭代自行推翻了前九轮的平面方案,改为用 CSS 渲染的 3D 展厅,让访客通过虚拟门廊在画廊之间穿行。


信源:https://www.anthropic.com/engineering/harness-design-long-running-apps
🎉1
可灵AI年化收入2.4亿美元,快手四成新代码由AI生成

快手科技发布 2025 年第四季度及全年业绩。Q4 收入 395.68 亿元,同比增长 11.8%;全年收入 1427.76 亿元,同比增长 12.5%;全年经调整净利润 206.47 亿元,同比增长 16.5%,经调整净利润率升至 14.5%。Q4 日均活跃用户 4.08 亿,月均活跃用户 7.41 亿。

可灵 AI 是本期财报的核心增长叙事。Q4 收入 3.4 亿元,较 Q3 的逾 3 亿元继续增长;2025 年 12 月单月收入突破 2000 万美元,年化收入运行率(ARR)达到 2.4 亿美元。截至年底,可灵 AI 全球用户超 6000 万,累计生成超 6 亿个视频,为超 3 万家企业客户和开发者提供 API 服务。Q4 期间先后推出可灵 O1、可灵 2.6 和可灵 3.0 系列模型,其中可灵 2.6 推出「音画同出」能力,可灵 3.0 基于 All-in-One 理念实现从生成到专业创作调度的升级。

AI 对主营业务的渗透同样值得关注。线上营销方面,生成式推荐大模型和智能出价模型带动国内营销收入提升约 5%,AIGC 营销素材消耗约 40 亿元。电商方面,Q4 GMV 同比增长 12.9% 至 5218 亿元。快手自研 AI 编程工具 CoderFlicker 生成的代码已占新增代码的 40% 以上。全年研发支出同比增长 19%,主要投向 AI 和人力。

公司还宣布派发 2025 年度末期股息每股 0.69 港元,合计 30 亿港元,继去年 8 月上市以来首次特别股息后再次派息。

信源:https://www.bloomberg.com/news/articles/2026-03-25/kuaishou-tech-sales-climb-as-ai-monetization-gains-momentum
Harness Engineering正在成为AI编程的真正战场

AI 编程 IDE Qoder 发布长文梳理了一个正在成形的行业趋势:头部科技公司的 AI 编程竞争焦点已从模型能力本身转向模型之外的一切,即「Harness Engineering」(编排工程)。文章用一个类比概括:模型是 CPU,上下文窗口是内存,Harness 是操作系统,Agent 是应用程序。决定最终产出质量的不是 CPU 有多快,而是操作系统设计得多好。

文章整理了多家公司已公开的实践数据:

1. Stripe 在开源 Agent 框架 Goose 基础上构建了 Blueprint 状态机系统,每周合并超过 1300 个完全由 Agent 编写的 PR
2. Shopify 开源了 Roast 工作流框架,将 AI 步骤与确定性代码交替编排
3. Ramp 基于 OpenCode 构建了 Inspect 系统,在沙箱中并行执行,合并的 PR 中 30% 由 Agent 编写
4. Coinbase 自建 Cloudbot,将 PR 审查周期从 150 小时压缩到 15 小时
5. OpenAI 用 Codex 驱动整个产品迭代,3 名工程师(后扩展至 7 人)在五个月内以零手写代码方式交付了一个百万行级产品

Qoder 认为这些方案有一个共同的结构性限制:Agent 仍然是单体的,一个模型实例、一个上下文窗口、一条执行路径从头跑到尾。任务复杂度上升时会遇到五个瓶颈:上下文窗口变成零和博弈(研究、编码、测试、审查挤在同一窗口里);角色切换的认知开销(一个 Agent 同时当技术负责人、开发、QA 和代码审查员);长链执行中的目标漂移;功能正确性验证不足(代码干净但业务逻辑不对);终端命令执行的不可逆风险。

Qoder 据此推出了 Experts Mode(测试版),将单 Agent 拆成多个专家角色:Leader 负责协调和任务分解,开发、研究、浏览器测试、QA、代码审查各由独立 Agent 承担,每个 Agent 使用不同模型和独立上下文窗口。Qoder 称内部基准测试中,Experts Mode 质量比单 Agent 模式高 67%,比 Claude Code Agent Teams 高 16%,成本不到后者的三分之二。

信源:https://x.com/qoder_ai_ide/status/2036437931867644016
Umi.js作者逆向Claude Code源码:Auto Mode背后是Sonnet当安全门卫,四层流水线决定每次操作能不能跑

蚂蚁集团工程师、前端框架 Umi.js 作者陈成逆向了 Claude Code 2.1.81 的源码,完整还原了 auto mode 按下之后发生的事情。核心发现:每一次工具调用都要过一条四层决策流水线,只有前三层都无法判断时,才会调用一个独立的 AI 分类器做安全审查。

四层流水线依次是:第一层检查已有的权限规则,命中直接放行;第二层模拟 acceptEdits 模式(即允许编辑文件的权限级别),如果在该模式下就会通过,说明风险很低,跳过分类器;第三层检查只读工具白名单(Read、Grep、Glob、LSP、WebSearch 等),这些不修改任何状态,无条件放行;以上都不满足时,才进入第四层,发一个独立的 API 请求给 Claude Sonnet 做安全分类。

分类器的几个关键设计细节:始终使用 Sonnet 而非 Opus,是成本和延迟的权衡;temperature 设为 0 以确保输出确定性;分类器被定义为「自主 AI 编程 Agent 的安全监控员」,保护三类风险(提示词注入、范围蔓延、意外损害);用户的 CLAUDE.md 配置文件会被注入分类器上下文,作为判断用户意图的依据。

拦截规则覆盖 22 个以上类别,包括 force push、直推 main 分支、下载并执行外部代码、生产部署、数据外泄、自我修改权限、创建远程代码执行面、凭证泄露等。放行例外有 7 类:测试用的硬编码密钥、工作目录内的本地文件操作、只读 GET 请求、安装已声明的依赖、官方工具链安装、读取配置凭证发送到目标提供商、推送到当前工作分支。

还有一套熔断机制:连续 3 次被拒绝或累计 20 次被拒绝后,系统降级为手动确认;headless 模式下直接中止 Agent。分类器不可用时,由一个 feature flag 控制是「fail-closed」(直接拒绝)还是「fail-open」(降级为手动确认)。

auto mode 下的行为提示词注入也有精细的频率控制:每 5 轮对话注入一次,每 5 次注入周期中第 1 次是完整版(约 800 字,包含「立即执行、减少打断、行动优于计划」等六条指令),其余 4 次是一行精简版,在上下文窗口占用和行为稳定性之间取得平衡。

信源:https://blog.sorrycc.com/claude-code-auto-mode
👍1
DeepSeek一口气放17个岗位全押Agent:要求重度使用Claude Code,全栈岗写明Vibe Coding优先

DeepSeek 集中开放 17 个招聘岗位,核心研发方向从基础模型研究明确转向 Agent 产品化。三个专属 Agent 岗位覆盖算法研究、数据评测和基础设施全链条:算法研究员聚焦强化学习在大模型对齐中的应用(RLHF/RLAIF、过程奖励、偏好学习等方向);数据评测专家负责构建评测数据集,针对 Agent 的规划、工具调用、多轮交互、长期记忆等能力设计测试用例;基础设施工程师负责搭建 Agent 运行底座,包括集成外部工具到内部强化学习基础设施、搭建评测平台。

招聘要求中有两个值得注意的信号。多个岗位在加分项中明确写出「重度使用 Claude Code、Cursor、Copilot 等 AI 编程工具」优先。全栈开发工程师岗位职责中出现了一条不常见的描述:「作为 Vibe Coding 重度用户,持续探索模型能力在产品中的创新应用」,同一岗位的核心工作方向是构建「支撑海量 AI Agent 运行的下一代容器调度与隔离平台」。

模型策略产品经理岗位单独设立了 Agent 方向,要求候选人熟悉 Claude Code、OpenClaw、Manus 等 Agent 产品,需洞察高价值应用场景(包括个人助理、Deep Research、自动化工作流、多模态设备控制),并主导 Agent 评测体系及训练数据方案设计。对比今年 1 月,当时开放的核心岗位集中在「深度学习研究员-AGI」等通用方向,此次招聘重心已明显向 Agent 产品化倾斜。

信源:https://app.mokahr.com/social-recruitment/high-flyer/140576#/
豆包手机助手幕后操盘手:36氪创始人刘成城,其团队在字节内部与抖音平级

科技媒体 36 氪创始人刘成城目前担任字节跳动 AI 硬件团队 Ocean 负责人,直接向 AI 产品团队 Flow 负责人朱骏汇报,操盘豆包手机助手及字节全线 AI 硬件业务。刘成城 2019 年以 30 岁年纪带领 36 氪登陆纳斯达克后,秘密创办鲸鲮科技,研发国产操作系统及平板硬件并主要售往海外。该公司后被字节收购,刘成城及创始团队随之进入字节内部。

入职后他推动了字节对开放式耳机品牌 Oladance 的全资收购(约 5000 万美元),随后主导首款 AI 硬件 Ola Friend 上线。AI 眼镜项目因硬件同质化于今年 2 月内部叫停后,Ocean 团队的战略重心已转向豆包手机助手,这款能在系统层跨应用执行复杂任务的产品被视为字节 AI 硬件线真正的突破口。Flow 团队(含 Ocean)在字节内部拥有与抖音团队平级的优先级。

信源:https://mp.weixin.qq.com/s/WhgrPVqoHX8GNgjAZJ6LKw
🎉1
不只是调用:苹果可在自家机房把Gemini蒸馏成iPhone小模型

苹果与谷歌的 AI 合作协议「远比外界此前了解的更深」。苹果在自有数据中心内拥有对 Gemini 大模型的完整访问权限,可将其蒸馏为适配特定任务的小模型,甚至缩小到能直接在苹果设备端运行。

由于拥有完整模型访问权,苹果的蒸馏不仅能模仿 Gemini 输出的答案,还能学习其内部推理计算过程,生成性能接近原始大模型但算力需求大幅降低的小模型。知情人士称苹果获得了「远超预期的自由度」。苹果内部的 Foundation Models 团队仍在自研模型,但目标方向尚不明确。报道同时确认,苹果计划在今年 6 月 WWDC 上发布 Siri 重大升级,包括对话记忆和基于场景的主动建议功能。

信源:https://www.theinformation.com/newsletters/ai-agenda/apple-can-distill-googles-big-gemini-model
Meta一天内裁员700人:Reality Labs再遭重创,今年已累计裁逾千人

Meta 周三确认裁员约 700 人,波及 Reality Labs、Facebook、招聘、销售和全球运营等多个部门,部分员工将获得内部转岗机会。今年 1 月 Meta 已裁撤 Reality Labs 超 1000 个岗位(约占该部门 10%),两轮裁员集中冲击元宇宙团队,显示 Meta 正系统性将资源从元宇宙转向 AI。

Meta 发言人称各团队「定期进行重组或调整,以确保处于实现目标的最佳位置」。裁员消息与前一日披露的高管巨额期权激励计划形成鲜明对比。截至 2025 年底 Meta 约有 7.9 万名员工,2026 年资本开支指引为 1150 亿至 1350 亿美元,绝大部分用于 AI 基础设施。

信源:https://www.nytimes.com/2026/03/25/technology/meta-layoffs-ai-executives.html
OpenClaw v2026.3.24:Gateway新增OpenAI API兼容端点,微软Teams迁移官方SDK

开源 AI 助手 OpenClaw(龙虾)发布 v2026.3.24 版本。Gateway 新增 /v1/models/v1/embeddings 端点,并在 /v1/chat/completions/v1/responses 中支持转发显式模型指定参数,使用 OpenAI API 格式的第三方客户端和 RAG 应用可直接对接 OpenClaw Gateway。

微软 Teams 渠道迁移至官方 SDK,新增流式 1:1 回复、欢迎卡片与提示词建议、反馈机制、打字提示和原生 AI 标签,同时支持已发送消息的编辑和删除。其他主要更新:

1. 内置 Skills 新增一键安装引导,CLI 和控制面板在依赖缺失时自动提示安装
2. 新增 --container 参数,支持在 Docker 或 Podman 容器内执行 OpenClaw 命令
3. Agent /tools 改为展示当前实际可用工具,控制面板新增实时可用状态面板
4. Slack 交互回复恢复富文本格式,支持自动将尾部选项文本渲染为按钮或下拉菜单
5. Discord 支持 LLM 自动生成线程标题
6. Node.js 最低版本降至 22.14+,继续推荐 Node 24

安全修复方面,本版本封堵了 mediaUrl`/`fileUrl 别名绕过沙箱媒体目录限制的漏洞,并修复了 Gateway 重启后 Agent 会话可能无法正确恢复到对应 Telegram 话题或 Slack 线程的问题。

信源:https://github.com/openclaw/openclaw/releases/tag/v2026.3.24
1
奔驰把国产AI放进了迈巴赫:智谱联合清华为S级打造端侧多模态大模型

梅赛德斯-奔驰中国宣布,与清华大学、今年 1 月在港交所上市的 AI 大模型公司智谱联合开发的端侧多模态大模型将落地新一代迈巴赫 S 级及全新 S 级轿车。该模型部署于后排娱乐系统,融合自然语言处理与视觉、音频等多模态理解及生成能力,结合车内摄像头等感知硬件,在本地算力条件下完成推理。据智谱官方表述,奔驰由此成为首个在后排娱乐系统中应用多模态大模型的汽车品牌。

信源:https://mp.weixin.qq.com/s/uqtpVaRjyosw6T7e1qw_oA
给龙虾发条抖店链接就能出片:创作Agent 2.0接入Seedance 2.0

字节跳动云服务平台火山引擎发布营销视频生成工具创作 Agent 2.0,接入自研视频生成模型 Seedance 2.0,视频时长从短片段扩展至 60 秒,支持多语言口播,覆盖品牌广告、产品评测、卖点演绎、Vlog 等 6 类营销场景。画面一致性也有提升,可保持人脸稳定、商品细节不变形、文字清晰可读。

创作 Agent 2.0 同步上架火山引擎 AI Agent 平台 ArkClaw 的官方 Skill 库。用户向龙虾发送抖店商品链接,即可自动读取商品信息、生成创意分析与分镜脚本,在对话中直接输出营销短视频。

信源:https://mp.weixin.qq.com/s/CDgA_e7rNoqgfKHVwGTsFg
手机上也能用AI操作工作软件了:Claude移动端上线Figma、Canva等集成

Anthropic 宣布 Claude 的工具集成(connectors)现已扩展至移动端,iOS 和 Android 用户可在手机上的 Claude 对话中直接浏览 Figma 设计稿、创建 Canva 幻灯片、查看 Amplitude 数据看板。

Connectors 基于 MCP 协议连接第三方应用,目前已覆盖 Slack、Google Drive、Linear 等工具,部分 connector 支持交互模式,可在对话界面中渲染实时操作界面而非纯文本回复。用户需先在桌面端完成 connector 的添加和授权,移动端暂不支持新增或浏览 connector 目录。

信源:https://x.com/claudeai/status/2036850783526719610
谷歌发布Lyria 3 Pro:AI生成音乐从30秒延长到3分钟,登陆5个平台

谷歌发布音乐生成模型 Lyria 3 Pro,单曲时长从前代 Lyria 3 的 30 秒延长至 3 分钟,支持指定前奏、主歌、副歌、桥段等歌曲结构。模型同时登陆五个平台:

1. Gemini 应用(仅付费用户,免费用户仍可使用 Lyria 3)
2. Vertex AI(企业公共预览)
3. Google AI Studio 及 Gemini API(开发者可用)
4. Google Vids(面向 Workspace 用户本周起滚动上线)
5. ProducerAI(谷歌上月收购的协作音乐创作工具,全球免费和付费用户均可使用)

所有 Lyria 生成的音频均嵌入 SynthID 水印以标识 AI 生成内容。谷歌称训练数据来自「YouTube 和谷歌依据服务条款、合作协议及适用法律有权使用的素材」,模型不会模仿特定艺术家风格。同一周,Spotify 上线了 Artist Profile Protection 功能,要求发行方手动审批艺术家新上架内容,以对抗 AI 克隆假冒。

信源:https://blog.google/innovation-and-ai/technology/ai/lyria-3-pro/
美团开源LongCat-Next:3B参数统一视觉理解、生成与语音

美团龙猫团队开源 LongCat-Next,一个基于 MoE 架构、激活参数 3B 的原生多模态模型,在单一自回归框架下统一了文本、视觉理解、图像生成、语音理解和语音合成五种能力。模型及配套分词器以 MIT 许可证开源,权重已上线 HuggingFace。

LongCat-Next 的核心设计是 DiNA(离散原生自回归)范式:通过为每种模态设计配对的分词器和解码器,将视觉和音频信号转化为离散 token,与文本共享同一嵌入空间,用统一的 next-token prediction 完成所有任务。视觉侧的关键组件 dNaViT(离散原生分辨率 Vision Transformer)将图像特征提取为「视觉词」,支持动态分词和解码,在 28 倍压缩比下仍保持较强的图像生成质量,尤其在文字渲染方面表现突出。

在同等激活参数量级(A3B)的模型对比中,LongCat-Next 的主要基准表现:

1. 视觉理解:MMMU-Pro 60.3(Qwen3-Omni 57.0,GPT5-minimal 62.7),MathVista 83.1(Qwen3-Omni 75.9,GPT5-minimal 50.9),MathVision 64.7(领先所有对比模型),DocVQA 94.2
2. 图像生成:GenEval 84.44,LongText-EN 93.15(FLUX.1-dev 60.70,Emu-3.5 97.60)
3. 编程:SWE-Bench 43.0(Kimi-Linear-48B 32.8,Qwen3-Next-80B 37.6)
4. Agent 工具调用:Tau2-Retail 73.68(Qwen3-Next 57.3),Tau2-Telecom 62.06(Qwen3-Next 13.2)

在理解与生成统一模型的横向对比中,LongCat-Next 的 MMMU 得分 70.6 领先第二名 NEO-unify(68.9),大幅超过 BAGEL(55.3)和 Ovis-U1(51.1)等此前的统一模型方案。SWE-Bench 43.0 和 Tau2 系列工具调用基准的表现也说明,这一多模态统一架构并未牺牲纯文本和 Agent 能力。

信源:https://longcat.chat/longcat-next/intro
GitHub默认用你的代码训练AI:Copilot个人版用户4月24日起需主动关闭

GitHub 宣布更新 Copilot 数据使用政策,4 月 24 日起,Copilot Free、Pro 和 Pro+ 用户的交互数据将默认用于训练和改进 AI 模型,除非用户主动在设置中关闭。Copilot Business 和 Enterprise 用户不受影响。此前已选择退出数据收集的用户,偏好设置将被保留,无需重新操作。

GitHub 将收集的数据范围包括:

1. 用户接受或修改的代码输出
2. 发送给 Copilot 的输入和代码片段
3. 光标周围的代码上下文
4. 注释和文档
5. 文件名、仓库结构与导航模式
6. 与 Copilot 各功能(Chat、内联建议等)的交互记录
7. 用户对建议的评分反馈

虽然 GitHub 称不会使用私有仓库中「静态存储」的内容,但用户在使用 Copilot 时,私有仓库的代码会被实时处理,这部分交互数据同样可能被用于模型训练,除非用户选择退出。

数据可能与微软等关联公司共享,但不会提供给第三方 AI 模型供应商。GitHub 首席产品官 Mario Rodriguez 在博文中表示,此前已使用微软员工的交互数据训练模型,「在多种编程语言中看到了接受率的显著提升」,希望通过更广泛的真实开发数据进一步改善模型表现。用户可在 GitHub 设置的「Privacy」选项中关闭数据共享。

信源:https://github.blog/news-insights/company-news/updates-to-github-copilot-interaction-data-usage-policy/
Harvey三个月估值从80亿涨到110亿美元:10万律师已在用AI Agent做尽调

法律 AI 公司 Harvey 完成 2 亿美元新一轮融资,由新加坡主权基金 GIC 和 Sequoia 联合领投,估值从去年 12 月的 80 亿美元升至 110 亿美元。Sequoia 已连续领投 Harvey 三轮融资,合伙人 Pat Grady 称这在 Sequoia 历史上极为罕见。公司累计融资总额超过 10 亿美元。

Harvey 成立于 2022 年,由前律师 Winston Weinberg 和前谷歌 DeepMind 及 Meta 研究员 Gabe Pereyra 联合创立,产品覆盖合同分析、合规审查、尽职调查和诉讼支持。目前服务超过 10 万名律师和 1300 家机构,客户包括 AmLaw 100 中的多数律所以及 NBCUniversal、汇丰等企业。1 月年化营收达 1.9 亿美元,较去年 8 月的 1 亿美元接近翻倍。平台上运行着超过 2.5 万个定制 AI Agent。

信源:https://www.cnbc.com/2026/03/25/legal-ai-startup-harvey-raises-200-million-at-11-billion-valuation.html