动察Beating AI News
3.18K subscribers
902 photos
2 videos
1 file
3.44K links
AI新闻信息流
Download Telegram
Lovable发布桌面客户端,浏览器里的vibe coding工具开始接入本地工具链

AI 全栈开发工具 Lovable 发布原生桌面应用,目前支持 macOS(Apple Silicon 和 Intel),Windows 版即将推出。所有套餐用户(含免费版)均可直接下载使用,无额外费用。

桌面版在网页版全部功能基础上新增三项能力:

1. 本地 MCP 服务器支持:可连接运行在本机的工具,包括 Figma Desktop 和设计工具 Paper,也支持手动添加任意自定义本地 MCP 服务器
2. 多项目标签页:用 Cmd+T 新建标签页,Cmd+1 到 Cmd+9 快速切换,同时管理多个项目
3. 原生键盘快捷键:Cmd+K 打开命令菜单,Cmd+Shift+O 在浏览器中打开当前页面

本地 MCP 是这次更新的核心卖点。Lovable 此前只有网页版,所有操作都在云端完成,无法访问用户本机运行的工具。桌面客户端补上了这块短板:设计师在 Figma 里画好界面,Lovable 通过本地 MCP 直接读取设计稿,再据此生成代码,不需要手动截图或导出。这让 Lovable 从一个纯云端的原型生成器,向能接入本地开发工具链的方向迈了一步。

信源:https://docs.lovable.dev/integrations/desktop-app
10个样本扩展到242种语言,Adaption Labs要从数据层解决AI多语言短板

AI 数据平台 Adaption Labs 发布 Adaptive Data 新功能「Expand Your World」,从单一语言的最少 10 个样本出发,可生成覆盖 242 种语言和地区变体的最多 2,420 个高质量训练样本,无需额外标注流程或数据管道。该功能已对所有 Adaptive Data 用户开放。

多语言覆盖是 AI 训练数据的主要短板之一。大多数数据集集中在少数高资源语言上,模型对小语种和地区方言的处理能力显著偏弱,后期微调难以完全弥补。Adaption Labs 的思路是把语言覆盖前置到数据层,在训练数据生成阶段就解决分布偏差。

Adaption Labs 由前 Cohere 研究副总裁 Sara Hooker 和前谷歌 AI 基础设施工程师 Sudip Roy 联合创办,今年 2 月获 Emergence Capital 领投的 5000 万美元种子轮融资,估值 10 亿美元。公司的核心押注是用高效的自适应系统替代暴力扩展,让模型能持续学习和演化。

信源:https://www.adaptionlabs.ai/blog/expand-your-world
Midjourney V8.1上线:找回标志性画风,原生2K渲染速度提升3倍、成本降至三分之一

AI 图像生成工具 Midjourney 发布 V8.1,官方称恢复了 Midjourney 标志性的视觉风格,同时原生支持 2K 高清渲染,速度较 V8 提升 3 倍,成本降低至 V8 的三分之一。V8.1 的 1K 标准模式在全质量输出下,速度甚至超过 V7 的草稿模式。

V8 在 Alpha 测试期间因画风大幅偏离 Midjourney 此前几代积累的辨识度而引发用户不满。V8.1 的发布公告将「标志性美学回归」放在最前面,是对这一争议的直接回应。除画风修正外,V8.1 还恢复了 V8 Alpha 期间暂停的图片提示词(image prompts)功能,上线了新版「Describe」(上传图片反向生成提示词),并更新了 moodboard 和风格参考(sref)系统。

Midjourney 由 David Holz 于 2021 年创立,至今未接受任何外部风险投资,完全自筹资金运营。

信源:https://x.com/midjourney/status/2044166948674769196
谷歌向AI政策研究追加1500万美元,两天内连推两项社会影响计划

Google.org 宣布向 Digital Futures Fund 追加 1500 万美元,资助新一批智库和学术机构研究 AI 对经济、安全和治理的影响。该基金 2023 年启动,累计资助总额现已超过 3500 万美元。

2026 年新入选的机构包括保守派经济智库 American Compass、战略与国际研究中心(CSIS)、城市研究所(Urban Institute)和智利国家人工智能中心(CENIA),研究方向覆盖三个领域:AI 对劳动力市场的冲击与政策应对、AI 基础设施与能源需求、AI 安全与治理框架。

这是谷歌两天内第二次在 AI 社会影响领域集中出手。前一天谷歌刚在华盛顿召集政府和产业界讨论 AI 就业问题,同步宣布为 4 万名工人提供 AI 技能培训。两项举措的时间点一致:美国国会正在推进多项 AI 就业立法,谷歌选择在立法窗口期同时铺开研究资助和劳动力培训,把自己的政策框架提前摆到决策者面前。

信源:https://blog.google/company-news/outreach-and-initiatives/google-org/digital-futures-fund-2026/
为AI Agent写的框架Pi被AI垃圾淹没,创建者启用先关后审贡献机制

开源 AI Agent 框架 Pi 的创建者 Mario Zechner 在 X 上宣布启用新的贡献管理机制:所有 issue 和 PR 提交后自动关闭,除非提交者此前已获维护者批准。Zechner 称他每天收到 30-50 条 issue,约 75% 是 AI Agent 生成的垃圾。Pi 是驱动 OpenClaw 的核心编程代理框架,GitHub 星标约 3.6 万,由 Zechner 和 Flask 创建者 Armin Ronacher 共同维护。

自动关闭后的 issue 由 Zechner 每天人工筛选,分三档处理:

1. 符合贡献指南且有价值的 issue 会被重新打开
2. 写得特别好的 issue 获得维护者的「lgtmi」标记,此后该用户所有 issue 不再被自动关闭
3. 写得好且附带 PR 的获得「lgtm」标记,此后该用户的 issue 和 PR 均不再被自动关闭

反复用 AI Agent 向仓库提交垃圾内容的账户将被永久封禁,覆盖 Zechner 名下所有仓库,不可撤销。他用处理到哪条就在哪条贴「last read」标签的方式标记进度,标签以下未被打开的 issue 即未达到质量标准。

Zechner 同时提到,OpenClaw 创始人 Peter Steinberger 提交了一个修复 OpenAI Responses 提供商缓存亲和性的 PR,有望改善 prompt caching 效果。他称之为「bespoke slop PR」(定制垃圾 PR),用自嘲口吻将这个正经贡献与日常收到的 AI 垃圾并列。

一个为 AI Agent 打造的框架,正在被 AI Agent 的用户用 AI 生成的低质量贡献淹没。Zechner 的应对方式是回到最原始的人工把关,用维护者的判断力当过滤器。这也不只是 Pi 一家的问题,开源社区正在普遍面对 AI 编程工具带来的贡献质量危机,而目前几乎没有比「人工逐条看」更好的解决办法。

信源:https://x.com/badlogicgames/status/2044168670486622429
OpenRouter上线重排序模型,开发者用同一接口即可给RAG加精排

AI 模型聚合平台 OpenRouter 新增重排序(Reranker)模型类别,首批接入 Cohere 三款模型。重排序是 RAG 流程中提升回答质量的关键步骤:向量搜索从知识库中召回相关片段后,重排序模型按相关度精确排序,筛掉噪音,让大模型拿到最有价值的上下文。

三款模型定位不同:

1. Rerank 4 Pro,精度最高(SOTA),32K 上下文
2. Rerank 4 Fast,延迟最低,32K 上下文
3. Rerank v3.5,支持多维度和半结构化数据排序,4K 上下文

三款均支持超过 100 种语言,无需数据预处理。定价按搜索次数而非 token 计费,Rerank 4 Pro 为 $0.0025/次。OpenRouter 此前聚合文本、图像、嵌入、音频、视频五类模型,重排序是新增的第六类。对已在用 OpenRouter 的开发者来说,给 RAG 流程加上重排序只需多调一个 /api/v1/rerank 端点,用同一个 API key 即可调用,不用单独接入 Cohere SDK。

信源:https://x.com/OpenRouter/status/2044070463723204730
Windsurf用RL训练了一个专门抓bug的小模型,分内评测已追平Claude Opus 4.6

AI 编程工具 Windsurf 的母公司 Cognition AI 与 AI 训练公司 Applied Compute 合作,通过强化学习训练了一个专门用于代码 bug 检测的模型 SWE-Check。该模型分析用户当前的代码变更(diff),自动标记可能引入的 bug 并给出修复建议。

在与训练数据同分布的评测中,SWE-Check 的 F1 分数已追平 Claude Opus 4.6(差距从 0.09 降至 0);在跨分布评测中差距从 0.49 缩小至 0.29,仍落后于前沿模型但已有明显进步。关键优势在速度和成本:SWE-Check 的运行速度比前沿模型快一个数量级,推理成本也大幅降低,因此可以在 IDE 中做到即时、免费的 bug 检测,这是直接调用 Opus 4.6 等大模型做不到的。

训练方法有两个值得关注的设计:

1. 奖励线性化(reward linearization):团队希望优化的是全局 F-beta 指标,但该指标无法直接拆解到单个样本。他们通过一阶近似将全局指标转化为可逐样本计算的奖励函数,使训练过程能有效爬升全局指标。早期版本误报率过高,团队将 beta 从 1 调至 0.5 以强调精确率。
2. 两阶段后训练:第一阶段纯粹最大化 bug 检测能力,不惩罚延迟;第二阶段引入延迟惩罚,依据是真实用户在触发检测后多久会切走的统计分布。这种分阶段方式优于同时优化两个目标,后者容易陷入局部最优,比如学会极快但分析浅薄。

SWE-Check 的预览版已在 Windsurf Next 中上线(快捷键 cmd+U),后续将进入 Windsurf 正式版。

信源:https://cognition.ai/blog/swe-check
👍1
Cursor多智能体三周优化235个英伟达GPU算子,最佳成绩逼近硬件极限

AI 编程工具 Cursor 披露其多智能体系统与英伟达的合作实验。该系统在 27 块 Blackwell B200 GPU 上自主运行三周,针对从 DeepSeek、Qwen、Gemma 等超过 124 个生产级开源模型中提取的 235 个真实算子优化问题,从零编写并优化 GPU 算子代码,整体实现 38% 的几何平均加速。

GPU 算子优化是软件工程中门槛最高的领域之一,要求工程师精通芯片架构、汇编级指令和内存调度,一个高性能算子通常需要资深专家数月甚至数年打磨。Cursor 的多智能体系统一次性处理全部 235 题:一个规划智能体分配任务并根据性能指标动态调度,多个工作智能体并行优化,系统自行调用英伟达的 SOL-ExecBench 基准测试管道形成「测试、调试、优化」自动循环,全程无人干预。系统分别用 CUDA C(含内联 PTX 汇编)和 CuTe DSL 两种语言各跑了一轮,前者测试最底层硬件推理能力,后者测试学习公开训练数据中几乎没有的新 API 的能力。

235 题中,系统在 149 题(63%)上超越基线,其中 45 题(19%)加速超过 2 倍。三个代表性结果:

1. BF16 分组查询注意力(提取自 Llama 3.1 8B 推理场景):较人工优化的 FlashInfer 库快 84%,SOL 得分 0.9722,接近硬件理论极限(满分 1.0)
2. BF16 矩阵乘法:从零生成的算子达到英伟达 cuBLAS 手工调优性能的 86%,在 LLM 推理解码常用的小 M 场景下反超基线最多 9%
3. NVFP4 混合专家层线性运算(提取自 Qwen3 等 MoE 模型):系统自主识别 4 位浮点量化瓶颈并做针对性融合优化,加速 39%

Cursor 坦承整体中位 SOL 得分仅 0.56,仍有大幅提升空间,主因是 GPU 资源有限(235 题共用 27 块 GPU)。Cursor 称这些多智能体技术「将很快融入核心产品」。一家 IDE 公司的 AI 智能体已经能在汇编级别的 GPU 优化上逼近人类顶尖专家,这比「帮你写应用代码」的故事大得多。

信源:https://cursor.com/blog/multi-agent-kernels
CMU教授开源Agent框架Motus,多模型编排SWE-bench跑到79%且成本减半

卡内基梅隆大学计算机科学系教授 Dimitrios Skarlatos(CEO)和 Zhihao Jia(CTO)创办的 AI 基础设施公司 Lithos AI 开源了 Agent 服务框架 Motus,Apache 2.0 许可证。团队由 CMU 和斯坦福研究人员组成,成员有 AWS、谷歌、Meta 和英伟达的生产基础设施经验。

Motus 的核心思路:不同任务适合不同模型,与其始终用最贵的前沿模型跑所有步骤,不如让系统从生产运行的轨迹中学习,自动把不同子任务路由到最合适的模型。当前 Agent 部署后是静态的,提示框架、模型和上下文策略固定不变,Motus 则从每次运行中提取任务成功率、延迟和成本信号,持续优化。

据 Lithos AI 官网数据,在 SWE-bench Verified 上,Motus 多模型编排达到 79% 准确率,高于 Claude Opus 4.6 的 75.8% 和 GPT-5.3-Codex 的 72.6%,成本不到单用 Opus 的一半。在 Terminal-Bench 2.0 上,准确率从 Opus 的 64% 提至 80.1%,成本同样约减半。框架还会根据具体工作负载调整上下文记忆策略,并自动检测可并行执行的步骤来降低延迟。

Motus 不绑定模型提供商,支持 OpenAI Agents SDK、Anthropic SDK、Google ADK 及纯 Python 构建的 Agent,提供 Claude Code、Codex 和 Cursor 插件,一条命令本地部署或推送至云端。早期预览阶段免费提供算力。

信源:https://github.com/lithos-ai/motus
EvoMap逐模块举证指控Hermes Agent架构抄袭,Nous Research只回了句「删号」

AI Agent 自进化引擎 Evolver 的开发团队 EvoMap 于 4 月 14 日发布一篇技术对比文章,指控 Nous Research 旗下开源项目 Hermes Agent 在架构层面系统性复制了 Evolver 的设计,且在全部公开材料中未做任何引用。Hermes Agent 目前拥有 8.8 万 GitHub Star,Evolver 约 2000。Nous Research 创始人 Teknium 在 X 上回应称「从来没听说过这个人和这个项目」,认为对比文章「完全没脑子」。Nous Research 官方账号的回应更为简短:「我们的仓库 2025 年 7 月就建了。我们是 YaRN 等现代 Agent 框架底层技术的先驱。删掉你的账号。」

EvoMap 的文章逐模块列举了十余处架构对应:

1. 三层记忆系统(持久事实 + 程序性知识 + 历史搜索),每层功能角色精确对应
2. 任务完成后自动提取可复用经验资产的闭环(Evolver 称 Gene/Capsule,Hermes 称 SKILL.md)
3. 周期性反思机制(Evolver 每 5 个进化周期触发,Hermes 每 15 次工具调用触发)
4. 运行时技能发现与按需加载
5. 10 步编排的进化循环
6. 多维加权评分、约束门控、原子写入等工程模式

时间线上,Evolver 的核心协议 GEP 于 2 月 1-16 日全部公开,累计 136 次发版。Hermes 的技能系统 3 月 12 日才发布(v0.2.0),自进化仓库 3 月 9 日才创建,间隔 24-39 天。

但文章也列出了对 Hermes 有利的事实:Hermes Agent 仓库创建于 2025 年 7 月,早于 Evolver 半年,只是一直私有至 2 月底才公开;Hermes 的自进化模块使用斯坦福/伯克利的学术框架 GEPA(ICLR 2026 Oral),与 GEP 无关;Anthropic 2025 年 12 月发布的 Agent Skills 标准早于两者。两项目语言不同(JavaScript vs Python),未发现代码级复制。

单看任何一个维度,独立趋同都完全可能:三层记忆、经验提取、周期反思在 AI Agent 领域已有广泛讨论。EvoMap 的论点建立在「十余个维度同时对应超出巧合范围」的概率推理上,这种论证有力但不具备排他性。Teknium 选择否认知情而非回应技术细节,也没有给出更多解释。这场争论短期内不太可能有定论,但它反映了一个持续存在的问题:在影响力悬殊的开源项目之间,较小一方要主张架构层面的优先性,无论举证还是传播都极为困难。

信源:https://x.com/Teknium/status/2044344547334062510
OpenClaw维护者回应负面攻击:我们不帮人拉盘,开源的中立方反遭抹黑

OpenClaw 官方维护者 Onur Solmaz 针对近期围绕该开源 AI 代理项目的负面言论作出强硬回应。他直言 OpenClaw 之所以频遭攻击,根源在于其「不帮任何人拉盘」的公益属性——与市场上其他追求盈利的 AI 代理产品不同,OpenClaw 在行业和地缘政治上始终保持中立第三方立场,「其他公司只有在我们失败时才能赚钱,所以才拼命抹黑」。Solmaz 称,项目创始人 Peter Steinberger 是成功退出创业者,不为投资人赚取回报,纯粹出于「玩得开心 + 民主化 AI」的初衷发起该项目,这也正是社区喜爱 OpenClaw 的原因。

针对具体指控,Solmaz 逐一反驳:

关于臃肿一说,团队从 3 月初便启动核心瘦身计划,将功能模块拆分为插件 SDK 架构,插件多不等于臃肿,这套做法已被同行抄走;

关于不安全的质疑,Solmaz 反指 OpenClaw 因被最多人审视,安全问题一旦发现即被迅速修复,在被狂喷的压力下反而淬炼成最安全的 AI 代理;

至于被 OpenAI 收购的传闻,Solmaz 调侃道「我的银行账户还是空的啊兄弟」,并强调所有维护者均为无偿贡献,白天全职工作、夜晚双倍加班维护项目。

最终 Solmaz 以「人民的 AI」定义 OpenClaw,呼吁社区直接使用代码、积极贡献,成为维护者,共同书写开源 AI 历史。

信源:https://x.com/onusoz/status/2044337339518828727?s=46
谷歌Gemini Mac原生应用正式上线,Option+Space随时唤起,可读取当前屏幕内容

谷歌正式发布 Gemini macOS 原生应用,免费面向全球所有 Gemini 用户开放,需 macOS Sequoia(15.0)及以上版本,仅支持 Apple Silicon 芯片。此前 3 月下旬 Bloomberg 曾报道该应用进入小范围内测。

核心功能是屏幕共享:用户可将任意窗口共享给 Gemini,获取基于当前屏幕内容的上下文回答,包括本地文件。按 Option + Space 可从任意界面直接唤起 Gemini 迷你对话框,无需切换窗口。应用还集成了图片生成(Nano Banana)和视频生成(Veo)。

ChatGPT 和 Claude 的 Mac 客户端已上线近两年,谷歌是三家主要 AI 公司中最后推出桌面端的。谷歌在博客中称这只是「起步」,正在打造「真正个性化、主动且强大的桌面助手」,更多功能将在未来几个月公布。对用户而言,三家产品现在都能在桌面端随时唤起,竞争焦点将转向谁能更深地融入操作系统工作流。

信源:https://blog.google/innovation-and-ai/products/gemini-app/gemini-app-now-on-mac-os/
OpenAI Agents SDK更新,代理可在沙箱中操作文件和运行代码

OpenAI 发布 Agents SDK 重大更新,核心变化是给代理一个真正的工作环境:代理现在可以在受控沙箱中读写文件、安装依赖、运行代码和调用工具,而非仅限于对话。

SDK 的代理执行框架(harness)新增可配置记忆、沙箱感知编排,以及与 Codex 同源的文件系统工具(shell 命令执行和 apply patch 代码编辑)。框架同时集成了多个正在成为行业标准的代理协议:MCP 工具调用、AGENTS.md 自定义指令、Skills 渐进式能力声明。开发者不再需要自行拼装这些基础设施。

沙箱执行是此次更新的另一重点。SDK 内置对 7 家沙箱提供商的支持:Blaxel、Cloudflare、Daytona、E2B、Modal、Runloop 和 Vercel,开发者也可接入自有沙箱。新引入的 Manifest 抽象统一描述代理的工作空间,可挂载本地文件、定义输出目录,并对接 AWS S3、Google Cloud Storage、Azure Blob Storage 和 Cloudflare R2 等存储服务,从本地原型到生产部署使用同一套配置。

架构上,SDK 将代理调度逻辑与计算环境分离。好处有三:凭证不会进入模型生成代码的执行环境,降低提示注入和数据外泄风险;代理状态外部化后支持快照和恢复,沙箱容器崩溃不会丢失进度;多个子代理可并行在不同容器中执行任务。

新功能已面向所有 API 用户开放,按标准 token 和工具调用计费。目前仅支持 Python,TypeScript 版本将在后续发布。

信源:https://openai.com/index/the-next-evolution-of-the-agents-sdk/
英伟达开源Lyra 2.0,一张照片生成可走动的3D世界,直接导入机器人仿真器

英伟达发布 Lyra 2.0,一个从单张图片生成可探索 3D 世界的开源框架。用户给一张照片,Lyra 2.0 先生成受镜头轨迹控制的漫游视频,再将视频重建为 3D 高斯溅射(Gaussian Splats)和网格模型,可直接导入游戏引擎和仿真器实时渲染。模型权重和代码以 Apache 2.0 许可证在 Hugging Face 和 GitHub 开源,允许商用。

核心技术突破在于解决长距离漫游的两个退化问题。第一个是「空间遗忘」:当镜头走远后再折返,此前看过的区域已超出模型的时间窗口,模型只能凭空生成,导致场景前后不一致。Lyra 2.0 为每一帧维护 3D 几何信息,折返时检索相关历史帧并建立密集对应关系,让模型「记住」之前看过的东西。第二个是「时间漂移」:自回归生成逐帧累积误差,场景逐渐变形。Lyra 2.0 用自增强训练让模型在训练阶段就接触自身的退化输出,学会纠错而非传播错误。底层基于万影 Wan 2.1-14B 扩散 Transformer,输出分辨率 832×480。

对开发者和研究者而言,最直接的应用场景是机器人仿真。英伟达在演示中将 Lyra 2.0 生成的 3D 场景导入自家物理仿真器 Isaac Sim,机器人可在其中导航和交互。此前训练具身智能(embodied AI)的一大瓶颈是 3D 环境制作成本高、种类有限,Lyra 2.0 提供了一条从照片批量生成训练环境的路径。去年 9 月发布的 Lyra 1.0 仅支持短距离生成,2.0 版将其扩展到长距离持续探索。谷歌此前发布的 Genie 3 具备类似能力但未开源,Lyra 2.0 是目前该方向最完整的开源方案。

信源:https://research.nvidia.com/labs/sil/projects/lyra2/
1
谷歌发布Gemini 3.1 Flash TTS,开发者可像导演一样用自然语言指挥AI怎么说话

谷歌发布新一代文本转语音模型 Gemini 3.1 Flash TTS,核心卖点不是「更像真人」,而是开发者可以精确控制 AI 语音的风格、语速和情绪表达。模型已通过 Gemini API、Google AI Studio(开发者预览)、Vertex AI(企业预览)和 Google Vids(Workspace 用户)上线。

这套控制能力的关键是「audio tags」(音频标签):开发者在输入文本中嵌入自然语言指令,就能调整 AI 语音的语调、节奏和口音,甚至在一句话中间切换表达风格。谷歌在 Google AI Studio 中提供了一套「导演椅」式的配置界面,包含三层控制:

1. 场景指导:设定环境和对话指令,让角色在多轮对话中保持一致性格
2. 角色级调参:为每个角色分配独立的音频配置,单独控制语速、语调和口音
3. 一键导出:调好的参数可直接导出为 Gemini API 代码,在不同项目和平台上复用

在第三方评测机构 Artificial Analysis 的 TTS 排行榜上,Gemini 3.1 Flash TTS 以 1211 分的 Elo 评分登顶,该排行榜基于数千次人类盲听偏好测试。Artificial Analysis 同时将其列入「最具吸引力象限」,即语音质量高且成本低。模型支持 70 多种语言和原生多角色对话,所有生成音频均内嵌 SynthID 水印用于 AI 内容识别。

对开发者来说,这意味着 TTS 从一个「把文字读出来」的工具变成了一个可编程的语音表演引擎。过去要做有情感的 AI 语音,要么靠后期处理,要么靠 SSML 标记语言逐字标注,现在用一句自然语言就能搞定。结合一键导出功能,同一套语音风格可以跨产品线复用,这对需要统一品牌声音的企业尤其实用。

信源:https://blog.google/innovation-and-ai/models-and-research/gemini-models/gemini-3-1-flash-tts/
2
OpenClaw贡献者:把AI工作流建在Claude Cowork上,就是选择当十年「租户」

开源 AI Agent 框架 OpenClaw 贡献者 Onur Solmaz 在 X 上发帖,以 Anthropic 刚转正式版的 Claude Cowork 为例,论证企业不应将 AI 工作流建在专有平台之上。

核心论点是基础设施的粘性效应:企业一旦围绕某个专有产品搭建工作流,迁移成本会随时间急剧上升,如同企业锁定 AWS 后难以切换到 Hetzner,最终沦为「租户」,被平台方「在未来 10 年尽可能地榨取」。

Solmaz 算了一笔账:同时订阅 OpenAI 和 Anthropic 的 Pro 或 Max 计划,每年花费 2400 至 4800 美元,且这些订阅目前可能以亏损定价,未来大概率涨价。而华硕今年发布的桌面 AI 超算 Ascent GX10 搭载英伟达 GB10 Grace Blackwell 处理器,支持运行最高 2000 亿参数模型,一次性购入后可用多年。他承认开源模型编程能力尚不及闭源,但认为许多场景已够用,「已经有不少人开始为此购买 GPU」。相比之下,OpenClaw 等开源框架允许企业随时更换模型供应商或切换到本地硬件,不受单一平台制约。

Anthropic 上周将 Claude Cowork 从预览转为正式版,面向全部付费用户开放,新增角色权限控制、用量分析等企业功能。OpenClaw 在 GitHub 上已积累超 35 万星。专有 AI Agent 平台加速向企业渗透的同时,开源替代方案也在快速成熟,两条路线的竞争正在进入正面交锋。

信源:https://x.com/onusoz/status/2044457293069062530
OpenRouter上线视频生成API,一个接口调用Sora 2、Veo 3.1、Seedance等主流模型

AI 模型聚合平台 OpenRouter 正式上线视频生成 API,首批支持文生视频和图生视频,接入 Seedance 2.0/1.5、Veo 3.1、Wan 2.7/2.6 和 Sora 2 Pro,后续将继续扩充。

视频生成领域的 API 碎片化比文本模型严重得多:各家请求格式不同、参数命名不同、计费单位不同,甚至同一模型家族的不同能力(文生视频、图生视频、参考角色生成)往往对应不同端点。OpenRouter 的做法是在上层建一套统一 schema,根据请求参数自动路由到正确端点。附带了图片就走图生视频,指定了参考角色就走角色一致性端点,开发者不需要关心底层差异。

参数归一化也覆盖了容易踩坑的细节。比如 Veo 3.1 支持 4、6、8 秒片段,Wan 2.6 支持 5 或 10 秒,传错时长直接报错。OpenRouter 提供模型能力查询端点 `/api/v1/videos/models`,返回每个模型支持的分辨率、时长、宽高比、定价和模型特有参数,开发者或编程代理调用前查一次就能避免试错。由于视频生成耗时以分钟计,API 采用异步模式:提交提示词后返回任务 ID,完成后取回视频。

OpenRouter 同时开源了一个多模态工作流演示应用,展示 LLM 生成详细提示词、图像模型生成角色、视频模型生成场景的串联流程。这也是视频生成接入统一路由后最直接的价值:开发者在同一个 API 下组合文本、图像和视频模型,不用分别对接各家 SDK。

信源:https://openrouter.ai/announcements
腾讯开源混元世界模型2.0,一句话生成可走进去的3D世界,直接导入Unity和UE

腾讯正式发布并开源混元 3D 世界模型 2.0(HY-World 2.0)。这是一个多模态世界模型框架,支持文本、单张图片、多视角图片和视频输入,输出不是视频,而是可编辑的 3D 资产(网格模型、3D 高斯溅射、点云),可直接导入 Unity、Unreal Engine 和英伟达 Isaac Sim。模型权重和代码在 GitHub 与 Hugging Face 开源。

和 Genie 3、Cosmos 等视频世界模型的根本区别在于:视频世界模型生成的是像素级视频,播完即消失,无法编辑;HY-World 2.0 生成的是持久存在的 3D 资产,支持自由行走、物理碰撞和二次编辑。腾讯在技术报告中将这个差异总结为「看一段视频然后它消失了」与「建一个世界永久保留」。用消费级 GPU 就能实时渲染,推理只需一次,不像视频世界模型每帧都要跑一遍生成。

技术上分四个阶段:先用 HY-Pano 2.0 从输入生成 360 度全景图,再用 WorldNav 进行轨迹规划,然后用 WorldStereo 2.0 沿轨迹扩展世界,最后用 WorldMirror 2.0 将所有生成片段重建为统一的 3D 场景。在开源方案中,HY-World 2.0 称其为首个达到 SOTA 水平的 3D 世界模型,效果与闭源商业产品 Marble 可比。不过目前只开源了 WorldMirror 2.0(3D 重建模块,约 12 亿参数)的代码和权重,全景生成、轨迹规划和世界扩展三个模块的代码和权重标注为「即将发布」。

对游戏开发者来说,这意味着可以用一句话快速生成关卡原型和地图,省掉大量手工建模时间。对具身智能研究者而言,从照片批量生成仿真训练环境的成本大幅降低。腾讯同时上线了在线体验入口,用户可以操纵角色在生成的街道和建筑中自由探索。

信源:https://3d-models.hunyuan.tencent.com/world/
一个黑客加上Mythos等于一支特种部队:Bloomberg还原Anthropic封锁决策内幕

Anthropic 内部研究员今年 2 月首次拿到 Mythos 时,几小时内就判定它构成国家安全风险。Bloomberg 周三发表长篇调查报道,通过对红队研究员、高管及美国政府官员的具名采访,还原了从发现到封锁的完整决策过程。

AI 安全研究员 Nicholas Carlini 2 月在巴厘岛参加婚礼间隙打开笔记本测试刚开放内部评审的 Mythos,几小时内就发现多条入侵路径,目标涉及全球广泛使用的基础设施。回到旧金山后他发现 Mythos 能自主创建针对 Linux 的入侵工具。前沿红队负责人 Logan Graham 说:「拿到模型几小时内,我们就知道它不一样了。」关键区别在于,前一代旗舰 Opus 4.6 能辅助人类利用漏洞,Mythos 则能独立完成整个利用过程。Graham 向管理层发出警告:这是国家安全风险。

联合创始人兼首席科学官 Jared Kaplan 称他从训练阶段就在「非常仔细地」监控 Mythos,1 月开始意识到这个模型的漏洞发现能力有多强,需要判断这些能力只是技术上的新鲜事,还是「与互联网基础设施高度相关的东西」,最终结论是后者。2 月底至 3 月初,他与联合创始人 Sam McCandlish 向包括 CEO Dario Amodei、总裁 Daniela Amodei 在内的管理层汇报,建议不公开发布但允许外部公司甚至竞争对手试用。3 月第一周,公司正式批准将 Mythos 定位为网络防御工具。

报道还披露了新的测试细节。在一次早期版本测试中,模型自行设计了多步骤攻击方案,突破运行环境限制获取互联网访问权限,然后开始在网上发布内容。在有指令引导的测试中,Mythos 编写了一个串联四个漏洞的浏览器攻击链,这对人类黑客也是极高难度操作。

摩根大通在 Mythos 公开前就已用大模型辅助查找自身软件漏洞,重点扫描供应链和开源组件。据知情人士透露,此前需要数天到数周才能完成的零日漏洞发现和利用代码编写,现在最快只需数分钟。CEO Jamie Dimon 在财报电话会上说,Mythos「说明还有更多漏洞需要修复」。思科首席安全与信任官 Anthony Grieco 则担心攻击者利用 AI 对已停止维护的终端网络设备发起攻击,因为这些设备不会再收到安全补丁。

一名了解美国国防评估的知情人士表示,让单个黑客使用 Mythos 或类似工具,相当于把普通士兵升级为特种部队;犯罪黑客组织可借此达到小型国家情报机构的水平,小国则可能获得大国级别的网络攻击能力。前 NSA 网络安全主管 Rob Joyce 说:「我相信 AI 最终会让我们更安全,但从现在到那天之间有一段黑暗期,攻击方占据绝对优势,基础没打好的组织会被攻破。」

信源:https://www.bloomberg.com/news/features/2026-04-16/how-anthropic-discovered-mythos-ai-was-too-dangerous-for-release
Gemini CLI上线子代理,用Markdown文件就能造一个专属AI编程专家团

谷歌为其开源命令行编程工具 Gemini CLI 正式推出子代理(subagents)功能。每个子代理拥有独立的上下文窗口、系统指令和工具集,主代理在处理复杂任务时自动将子任务分派给最合适的子代理执行,执行结果压缩为摘要返回,不污染主会话上下文。

Gemini CLI 内置三个子代理:generalist(通用代理,适合批量重构等高工具调用量任务)、cli_help(Gemini CLI 自身的使用指南专家)、codebase_investigator(代码库探索、架构梳理和 bug 溯源)。用户也可以用 @agent 语法显式指定由哪个子代理接手,如 `@codebase_investigator 梳理认证流程`。

自定义子代理的创建门槛很低:在 .gemini/agents/ 目录下放一个带 YAML 前置元数据的 Markdown 文件即可,文件中定义角色描述、可用工具和系统指令。放在 ~/.gemini/agents 下的全局生效,放在项目目录下的随代码仓库共享给团队。子代理还可以打包进 Gemini CLI 扩展分发。

子代理支持并行执行,多个子代理可同时处理不同子任务。不过谷歌提醒,涉及代码编辑的并行任务可能产生写入冲突,需谨慎使用。

前一天 Anthropic 也发布了 Claude Code 桌面版重设计,核心同样是多代理并行。AI 编程工具正集体从「单代理对话」转向「主代理调度 + 专家代理执行」的架构,核心驱动力是上下文窗口管理:随着编程任务变复杂,把所有中间步骤塞进一个上下文会导致性能下降和成本上升,拆分成多个隔离代理是目前的工程共识。

信源:https://developers.googleblog.com/subagents-have-arrived-in-gemini-cli/
1
过半美国人认为AI弊大于利,1560亿美元数据中心项目在反对声中搁浅

多项民调显示美国公众对 AI 的态度正在集体转向负面。NBC News 3 月调查发现,57% 的登记选民认为 AI 的风险大于收益;昆尼皮亚克大学民调显示 55% 的受访者预期 AI 对日常生活弊大于利;皮尤研究中心的调查同样发现多数美国人对 AI 普及感到担忧而非兴奋。AI 预计将成为今年中期选举的核心议题之一。

负面情绪已经在转化为政治行动。数据中心监测机构 Data Center Watch 的报告显示,2025 年全美至少 1560 亿美元的数据中心项目因地方反对和诉讼被叫停或搁置。缅因州刚通过法案,将成为全美首个在全州范围内禁建数据中心的州,法案已送交州长签署。密苏里州圣路易斯郊区的选民则因数据中心选址争议,投票罢免了支持该项目的市议员。与此同时,亚马逊、谷歌、微软、Meta 今年合计承诺约 7000 亿美元用于建设 AI 数据中心,行业押注与地方抵制正在迎面对撞。

对 OpenAI 和 Anthropic 而言,民意转向的时机尤其微妙。两家公司都在筹备 IPO,OpenAI 的估值高度依赖数据中心的持续扩建。其 CFO Sarah Friar 此前表示公司计划为散户投资者预留 IPO 份额:「我希望每个人都想拥有 ChatGPT 的一部分。当你是一个消费品牌时,这很有帮助。」但散户的购买意愿与公众对 AI 的好感度直接挂钩,而三份民调给出的答案是一致的:过半美国人认为这项技术弊大于利。

信源:https://www.cnbc.com/2026/04/15/public-opinion-ai-data-centers-anthropic-openai-ipo.html