动察Beating AI News
3.01K subscribers
802 photos
2 videos
3.26K links
AI新闻信息流
Download Telegram
马斯克大战奥特曼背景:OpenAI当初用来约束自己的三把锁,全拆了

OpenAI 2019 年从纯非营利转为「限利润」结构时设了三重保护:利润上限、AGI 触发终止授权、微软独占绑定。到马斯克案开庭这天,三条全部被改写或取消。这正是马斯克诉讼的核心:OpenAI 系统性地拆除了自己当初向捐助人做出的非营利承诺。

利润上限:2019 年规定投资者回报不超出资额 100 倍,超出归非营利。2025 年 5 月转制为 PBC 时取消,改为普通股票、回报无上限。Altman 员工信称「限利润」结构在只有一家 AGI 公司时合理,多家竞争时「不再适用」。上一轮 66 亿美元融资以取消上限为前提。

AGI 触发:2019 年协议规定 OpenAI 董事会认定达成 AGI 后,微软商业授权自动终止。2025 年 10 月 PBC 转制协议改写:AGI 认定改由独立专家小组验证,微软 IP 授权延至 2032 年、明确覆盖 AGI 后模型,微软获准独立追求 AGI。原来的「达成即终止」变成「达成后继续」。

独占与分成:此前微软独占 OpenAI IP 授权,分成持续到 AGI 被认定为止。4 月 27 日修订取消独占,分成改为固定到 2030 年、与「OpenAI 技术进度」脱钩,AGI 是否达成不再触发任何商业条款变更。

三次修订分别在 2025 年 5 月、10 月和 2026 年 4 月 27 日完成。最后一次恰在陪审团遴选当天公布。马斯克一方将论证这是蓄意拆除保护机制,OpenAI 一方将论证这是竞争环境下的必要调整。
谷歌军事AI抗议重演:600多名员工联名要求Pichai拒绝五角大楼机密合同

超过 600 名谷歌员工联名致信 CEO Sundar Pichai,要求公司拒绝将 AI 模型部署到五角大楼的机密网络。组织者称签署者中有大量 Google DeepMind 研究人员,以及超过 20 名总监、副总裁级别高管。

信中称:「确保谷歌不与此类伤害产生关联的唯一方式,是拒绝一切机密工作负载。否则这些用途可能在我们不知情、也无力阻止的情况下发生。」员工的核心担忧是:机密网络与公网隔离(air-gapped),谷歌无法监控模型实际用途,无法执行任何技术防护。

联名信的直接导火索是《The Information》此前报道的一则消息:谷歌正在与五角大楼谈判,准备将 Gemini 部署到机密环境,合同条款允许五角大楼「用于一切合法用途」。谷歌目前已通过 genAI.mil 平台向五角大楼 300 万人提供非机密级别的 Gemini 服务。国防部研究与工程副部长 Emil Michael 今年 3 月对彭博称,非机密使用只是起步,「接下来会进入机密和绝密级别」。

这是谷歌在 AI 军事化问题上的第二轮大规模内部抗议。2018 年超过 4000 名员工联名反对 Project Maven(为五角大楼用 AI 分析无人机影像),数十人辞职,谷歌最终放弃续约并确立了禁止将 AI 用于武器和监控的原则。但 2025 年 2 月谷歌悄然删除了这些禁令条款,DeepMind CEO Demis Hassabis 同日发文称「民主国家应在 AI 发展中领先,支持国家安全」。此后谷歌拿下 90 亿美元 JWCC 军用云合同的一部分。与此同时,Anthropic 因拒绝放松军方使用 Claude 的限制,已被五角大楼列为「供应链风险」并面临法律诉讼。

信源:https://www.washingtonpost.com/technology/2026/04/27/google-employees-letter-ai-pentagon/
DeepSeek V4-Pro API 2.5折优惠期延长至5月31日

DeepSeek 将 V4-Pro API 的 2.5 折优惠截止时间从原定北京时间 5 月 5 日 23:59 延长至 5 月 31 日 23:59,折扣幅度和价格不变。折扣后每百万 token 价格:输入缓存命中 0.03625 美元、缓存未命中 0.435 美元、输出 0.87 美元。

信源:https://api-docs.deepseek.com/zh-cn/quick_start/pricing
Codex负责人重置全线付费用户频率限制,鼓励多用GPT-5.5

OpenAI Codex 工程负责人 Thibault Sottiaux 宣布,已重置所有付费计划的 Codex 频率限制(rate limit),让已耗尽本周期配额的用户立即恢复可用额度。他表示这是为了庆祝「好的一周」,鼓励大家「多用 GPT-5.5 写代码」,同时调侃重置频率限制「要花钱的」。

GPT-5.5 于 4 月 23 日上线 Codex,覆盖 Plus、Pro、Business 和 Enterprise 四档用户。

信源:https://x.com/thsottiaux/status/2048997818673537399
OpenAI披露Symphony内部效果:部分团队三周PR落地量增长500%

OpenAI 发布博客详述 agent 编排工具 Symphony 的内部使用效果。Symphony 于 3 月初开源,将 Linear 任务板作为编程 agent 的调度中心,为每个待办任务自动分配独立 agent 和隔离工作区,agent 持续运行直到任务完成或进入人工审核状态。部分 OpenAI 内部团队使用后,三周内合并 PR 数量增长 500%。

博客披露了几个此前未公开的用法细节。产品经理和设计师可以直接在 Symphony 中提交功能请求,无需接触代码仓库或管理 Codex 会话,提交后收到的审核包中包含功能在真实产品中运行的视频演示。agent 能自行拆解复杂任务为多阶段依赖树,只在前置任务完成后才启动后续工作,例如先完成 Vite 迁移再启动 React 升级。agent 在实现过程中发现的改进机会会自动创建新任务,由人工评估后再决定是否排期。

Symphony 本质上是一份 SPEC.md 规范文件。为验证规范的完备性,团队让 Codex 分别用 TypeScript、Go、Rust、Java、Python 各实现了一遍,每种语言均成功。参考实现选择 Elixir,因其并发原语适合编排场景,团队称「当代码实际上免费时,终于可以按语言优势而非生态惯性选型」。

OpenAI 表示不打算将 Symphony 作为独立产品维护,定位为参考实现,鼓励开发者用自己的编程 agent 基于 spec 构建适合自身环境的版本。

信源:https://openai.com/index/open-source-codex-orchestration-symphony/
TIME评2026十大最具影响力AI公司,字节智谱阿里占三席

《时代》周刊发布 AI 行业十大最具影响力公司榜单,为该刊首次按行业单独评选。入选十家:字节跳动、亚马逊、智谱 AI、OpenAI、Alphabet、Meta、Anthropic、阿里巴巴、Mistral、Hugging Face。中国公司占三席。

字节跳动以 AI 助手豆包入选,周活超 1.55 亿,春节期间日活突破 1 亿。CEO 梁汝波称「AI 发展仍处于早期阶段,目前只是马拉松的前 500 米」。字节 2025 年资本开支预算超 200 亿美元,主要投向 AI 基础设施,2026 年计划再采购 140 亿美元英伟达芯片,取决于美国出口审批。

智谱 AI 被《时代》冠以「不需要西方芯片」标签。智谱今年 1 月在港交所上市,IPO 融资 5.58 亿美元,是首家上市的中国大模型公司。2 月发布的 GLM-5 全程使用华为处理器训练,7440 亿参数,开源许可,在部分基准测试上超过 Gemini 3 Pro,接近 Claude Opus 4.5 和 GPT-5.2 的编程和 agent 能力。年收入 7.24 亿元人民币(约 1.07 亿美元),同比增长 132%。

阿里巴巴凭 Qwen 系列入选。Qwen 累计下载量突破 10 亿次、衍生模型超 20 万个,榜单称其为「全球最受欢迎的开源模型家族」。Airbnb 用 Qwen 做 AI 客服,Pinterest 用 Qwen 分析视觉内容。CEO 吴泳铭提出五年内云和 AI 外部收入合计突破 1000 亿美元。

其余七家:亚马逊(Trainium 芯片集群、同时投资 Anthropic 和 OpenAI)、OpenAI(周活超 9 亿、月营收 20 亿美元)、Alphabet(年营收首破 4000 亿美元)、Meta(AI 驱动广告收入创纪录)、Anthropic(拒绝五角大楼放宽限制要求后客户反增)、Mistral(年化收入 4 亿美元、法国军方已签框架协议)、Hugging Face(托管超 200 万模型和 50 万数据集)。

信源:https://time.com/article/2026/04/27/time100-companies-ai/
动察Beating AI News
谷歌军事AI抗议重演:600多名员工联名要求Pichai拒绝五角大楼机密合同 超过 600 名谷歌员工联名致信 CEO Sundar Pichai,要求公司拒绝将 AI 模型部署到五角大楼的机密网络。组织者称签署者中有大量 Google DeepMind 研究人员,以及超过 20 名总监、副总裁级别高管。 信中称:「确保谷歌不与此类伤害产生关联的唯一方式,是拒绝一切机密工作负载。否则这些用途可能在我们不知情、也无力阻止的情况下发生。」员工的核心担忧是:机密网络与公网隔离(air-gapped),谷歌无…
更新:谷歌签下五角大楼机密AI合同,安全条款被指不具法律约束力

《The Information》独家报道称,谷歌与美国国防部签署协议,允许军方将谷歌 AI 用于机密工作,条款为「一切合法政府用途」。签约时间与 600 多名员工致信 Pichai 要求拒绝该协议同日。谷歌公共部门发言人确认该协议是对去年 11 月非机密合同的修订。

合同包含一段关于安全底线的表述:双方同意 AI「不应用于」(is not intended for, and should not be used for)大规模国内监控或无人操控自主武器。但法律与 AI 研究所高级研究员 Charlie Bullock 直言,「不应用于」在法律上没有任何约束力,只表明双方认为这种用途不可取,但不构成违约。合同还写明:「本协议不赋予控制或否决合法政府行动决策的权利。」

与 OpenAI 2 月签的协议相比,谷歌条款更为宽松。OpenAI 保留了「对安全体系的完全裁量权」,谷歌则同意应政府要求协助调整 AI 安全设置和过滤器。谷歌发言人称这些过滤器是为消费者设计的,谷歌通常会为企业客户做调整。谷歌是继 xAI 和 OpenAI 之后第三家与五角大楼签署机密 AI 协议的公司。此前 Anthropic 因拒绝放宽安全限制,已被五角大楼列为「供应链风险」并正在法庭抗争。

信源:https://www.theinformation.com/articles/google-signs-classified-ai-deal-pentagon-amid-employee-opposition
1
Devin出本地版:跑在终端里,支持Opus4.7和GPT-5.5,忙不过来丢给云端

Cognition 发布 Devin for Terminal,将原本只在云端运行的 AI 编程 agent Devin 做成本地版本,直接在终端中运行。本地模式下 Devin 可完整访问代码库、开发工具和本地环境,支持切换多家前沿模型,包括 Claude Opus 4.7、GPT-5.5 和 Cognition 自研的 SWE-1.6。当本地任务超出笔记本算力时,可通过 CLI 将会话交接到云端,合上电脑后 Devin 继续工作。

终端 UI 用 Rust 写了自定义渲染库。团队称还在一台 1978 年的 VT-100(带屏幕和键盘的独立设备,今天各种终端 App 的硬件原型)上跑通了 Devin。

信源:https://x.com/cognition/status/2048821234281181302
1
Gemini App悄悄上线文件生成:对话里直接建TXT、PDF、CSV,打包ZIP下载

谷歌 Gemini App 新增文件生成能力,用户可在对话中直接创建 TXT、Markdown、PDF、CSV、配置文件等多种格式,还能将多个文件打包成 ZIP 一次下载。谷歌尚未正式公布,用户自行测试发现后在社交媒体传开。

从用户截图看,Gemini 在后台通过 Python 沙盒执行代码来生成文件,执行路径为 `/home/bard/`。沙盒内拥有独立工作目录,文件可跨多轮对话保留和引用,用户可以先让 Gemini 生成 5 个文件,再下一轮要求打包成 ZIP,Gemini 能识别并处理之前创建的文件。此外 Gemini 还支持直接生成 Google Docs 和 Google Sheets,Slides 暂未上线。

此前 Gemini 的代码执行功能(code execution)仅限于在沙盒中运行 Python 脚本并返回文本或 Matplotlib 图表,无法导出文件。此次更新让 Gemini 可以把代码执行的产物作为独立文件交付给用户,补上了 Claude/ChatGPT 已有而 Gemini 一直缺失的文件处理能力。

信源:https://nokiapoweruser.com/gemini-file-generation-docs-sheets-zip-pdf-update/
万字分析:Stargate正在杀死甲骨文

科技评论人 Ed Zitron 发布万字长文「How OpenAI Kills Oracle」,拆解甲骨文在 Stargate 中的财务困局。

Zitron 的核心论点:Stargate 所有数据中心只为一个租户而建,这个租户是预计到 2028 年底亏损超 1670 亿美元的 OpenAI(引用 The Information 数据)。OpenAI 同时还欠着亚马逊、微软、CoreWeave、Cerebras 等合计超过 4300 亿美元的算力账单。甲骨文把全部增长押在了一个无法证明自己付得起钱的客户身上。

他提出几个此前较少被讨论的问题。第一,Stargate 宣布 15 个月,Stargate LLC 从未正式成立,SoftBank 和 OpenAI 未向项目注入任何资金,所有建设开支由甲骨文及其金融合作方承担。第二,甲骨文以项目融资(project financing)方式将超过 1000 亿美元债务移至表外,实际杠杆远高于财报呈现。第三,即便 OpenAI 按约付款,英伟达每年一代的芯片换代意味着数据中心里的 GPU 在甲骨文还完贷款前就会过时。他引用 TD Cowen 分析师估算,甲骨文 7.1GW 总容量建设成本约 3400 亿美元,建成后年收入约 750 亿美元。

Zitron 还指出一个极端尾部风险:甲骨文创始人 Ellison 以超过 600 亿美元甲骨文股票为抵押借了超过 200 亿美元个人贷款,一旦 OpenAI 违约导致甲骨文股价崩盘,追缴将连锁反应。

信源:https://wheresyoured.at/how-openai-kills-oracle/
网信办一次查处字节三款AI产品:剪映、猫箱、即梦均未标识AI生成内容

国家互联网信息办公室通报,剪映 App、猫箱 App 及即梦 AI 网站未有效落实人工智能生成合成内容标识规定,违反《网络安全法》《生成式人工智能服务管理暂行办法》《人工智能生成合成内容标识办法》。三款产品均为字节跳动旗下:剪映是视频编辑工具,猫箱是基于豆包大模型的 AI 角色互动应用,即梦 AI 是 AI 图像和视频生成平台。网信办已对上述平台采取约谈、责令改正、警告、从严处理责任人等措施。

信源:https://mp.weixin.qq.com/s/yBRnC7pRlKFtQMXQ9i8LFg
彭博CTO:AI聊天界面将取代传统终端,12.5万用户已在内测

彭博正在测试名为 ASKB 的聊天机器人式界面,计划全面替代传统彭博终端的操作方式。ASKB 基于多个语言模型,用户可用自然语言直接提问投资论点,例如「伊朗战争和油价变化如何影响我的投资组合」,系统在几分钟内综合多维数据给出分析。beta 版已向约三分之一终端用户开放,即约 12.5 万人。

彭博 CTO Shawn Edwards 在接受《连线》采访时明确表示:「这将是新的终端,大多数交互的主要方式。」他说图形界面不会消失,但分析和工作流将从 ASKB 开始。ASKB 支持创建工作流模板并设置定时或条件触发,例如财报季自动拉取目标公司的同行对比、基本面、华尔街预期,生成多空摘要。

Edwards 承认系统「永远不能说完美」,但强调彭博从不给买卖信号,用户始终自主决策。防幻觉方面,彭博在每一步都加入验证:摘要事实回查原文段落、语义反转检测、引用链接校验。被问及「vibe coding 能否替代彭博终端」时,Edwards 回应:「你不会靠 vibe coding 做关键决策系统。」

信源:https://www.wired.com/story/the-bloomberg-terminal-is-getting-an-ai-makeover-like-it-or-not/
微软World-R1:用强化学习教视频模型「看懂」3D,不改架构PSNR涨10dB

微软研究院与浙江大学团队提出 World-R1,用强化学习让文生视频模型学会 3D 几何一致性,不修改模型架构、不依赖 3D 数据集。核心思路:生成视频后,用预训练 3D 基础模型 Depth Anything 3 重建场景的 3D 高斯(3DGS),再从新视角渲染并与原视频比对,把重建误差、轨迹偏差和新视角语义可信度(由 Qwen3-VL 评分)组合成奖励信号,通过 Flow-GRPO(一种适配流匹配模型的强化学习算法)反馈给视频模型。

基座模型为开源的万相 Wan 2.1(1.3B 和 14B),分别训练出 World-R1-Small 和 World-R1-Large。训练数据仅约 3000 条纯文本 prompt,由 Gemini 生成,不使用任何 3D 资产。训练时每 100 步插入一轮「动态微调」,暂时关闭 3D 奖励、只保留画质奖励,防止模型为追求几何刚性而压制人物运动等非刚体动态。

3D 一致性指标上,World-R1-Large 的 PSNR(峰值信噪比)比基座 Wan 2.1 14B 提升 7.91dB,Small 版提升 10.23dB。VBench 通用视频质量不降反升。25 人盲测中,几何一致性胜率 92%,整体偏好 86%。代码已在 GitHub 开源,许可为 CC BY-NC-SA 4.0。

信源:https://arxiv.org/abs/2604.24764
腾讯云CodeBuddy企业版涨价154%,年内第三次提价

腾讯云宣布旗下 AI 编程助手 CodeBuddy 和 AI 办公智能体工作台 WorkBuddy 将于 5 月 15 日起涨价。企业旗舰版(将更名为「SaaS 企业版」)从 78 元/人/月涨至 198 元/人/月,涨幅约 154%;企业专享版(将更名为「专有云企业版」)从 158 元/人/月涨至 316 元/人/月,涨幅 100%。各档加量包同步涨约 25%。

涨价搭配权益调整:企业用户一个账号可同时使用 CodeBuddy 和 WorkBuddy,不再需要分别订阅;新增 CloudAgent 云端智能体平台,企业可自建 agent 并一键分享给团队成员,每人获得独立沙箱实例;企业管理员可按成员配置可用模型范围。5 月 15 日至 8 月 14 日购买企业旗舰版的客户,首月每人额外获赠 2000 Credits。

这是腾讯云年内第三次涨价。3 月 11 日,腾讯云对混元系列模型大幅调价,混元 HY2.0 Instruct 输入价格涨超 400%,同时多款第三方模型结束免费公测转入收费。4 月 9 日,再次宣布 AI 算力、容器服务及弹性 MapReduce 相关产品刊例价统一上调 5%。

信源:https://cloud.tencent.com/announce/detail/2270
GPT-1作者Alec Radford新作:只喂1930年前的书训练LLM,不懂代码却能写Python

GPT-1/GPT-2 及 CLIP 的作者 Alec Radford 与多伦多大学教授 David Duvenaud、Nick Levine 发布 talkie-1930-13b,一个 130 亿参数的「复古语言模型」,训练数据全部来自 1930 年 12 月 31 日之前的英文文本,包括书籍、报纸、期刊、专利和判例法,共 2600 亿 token。这是目前已知最大的此类模型,权重已开源。

talkie 的后训练不使用任何现代聊天数据。团队从礼仪手册、百科全书、书信写作指南等历史文献中提取指令-回答对做微调,再用 Claude Sonnet 4.6 做偏好优化的评判模型。由于训练数据中没有任何计算机代码,talkie 天然不存在基准测试污染问题。团队在 HumanEval 编程测试中给它几个 Python 示例,它能写出简单的单行程序,比如看到旋转密码的编码函数后自行写出解码函数(把加法改成减法),显示出对逆函数概念的理解。

团队还用《纽约时报》「历史上的今天」近 5000 条事件描述测试模型的「未来预测」能力:1930 年后的事件对模型来说明显更令人意外(困惑度更高),到 1950-60 年代达到峰值后趋于平稳。下一步计划训练 GPT-3 级别的复古模型,语料可扩展到超万亿 token,目标达到初代 ChatGPT 水平,预计今年夏天发布。Anthropic 提供了算力支持。

信源:https://talkie-lm.com
YouTube上线AI对话搜索:问问题返回视频+文字摘要,Premium用户先用

谷歌在 YouTube 测试名为「Ask YouTube」的 AI 对话式搜索功能。用户在搜索栏点击「Ask YouTube」按钮后,可以用自然语言提问,YouTube 返回由 AI 生成的文字摘要,并搭配长视频、Shorts 和分类推荐,整合在同一个结果页中。页面底部还提供后续问题建议和追问输入框,支持多轮对话。

该功能目前限定美国地区 18 岁以上的 YouTube Premium 订阅用户,通过 YouTube 实验室页面开启。YouTube 官方表示已在推进向非 Premium 用户开放。

《The Verge》记者实测发现 AI 生成的文字摘要存在事实错误:在介绍 Valve 旧款 Steam 手柄时,AI 称该手柄没有摇杆,实际上旧款有一个摇杆。这与谷歌搜索的 AI Mode 类似,生成内容仍需用户自行核实。

信源:https://www.theverge.com/streaming/919441/google-ask-youtube-ai-chatbot-search
Kimi K2.6上线一周登顶OpenRouter,用量超Claude Sonnet 4.6近40%

月之暗面旗舰模型 Kimi K2.6 在 OpenRouter 本周 LLM 排行榜以 1.88T token 用量登顶第一,周环比暴涨 7683%。该模型 4 月 20 日上架 OpenRouter,一周内即超越此前长期占据前两位的 Claude Sonnet 4.6(1.35T)和 DeepSeek V3.2(1.24T)。

前十名中,Anthropic 占三席:Claude Sonnet 4.6 第二(1.35T,↓3%)、Claude Opus 4.7 第四(1.17T,↑180%)、Claude Opus 4.6 第九(662B,↓42%)。Opus 4.7 是本周第二大增长模型,用量近乎翻三倍。谷歌 Gemini 3 Flash Preview 排第五(1.03T,↓11%),阶跃星辰 Step 3.5 Flash(762B,↑78%)和英伟达 Nemotron 3 Super free(656B,↑25%)涨幅也较明显。

OpenRouter 排行榜按各模型在平台上的实际 token 消耗量排名,反映开发者在 API 层面的真实调用偏好。

信源:https://openrouter.ai/rankings
OpenAI开源React语音控件:用gpt-realtime-1.5让用户开口操控App

OpenAI 开源了 realtime-voice-component,一套 React 组件库,让开发者把语音操控能力嵌入现有 Web 应用。用户对着麦克风说话,模型通过开发者预定义的工具(tool)直接调用 App 功能,而非生成自由文本回复。该库基于 OpenAI Realtime API,搭配旗舰语音模型 gpt-realtime-1.5 使用,采用 Apache-2.0 许可。

核心设计是「App 拥有状态,语音只是调用者」。开发者用 defineVoiceTool() 把 App 动作注册为语音工具,`createVoiceControlController()` 管理会话和连接生命周期,`VoiceControlWidget` 提供启动按钮,可选的 `GhostCursorOverlay`(幽灵光标)在屏幕上显示 AI 正在操作的位置,给用户视觉确认。仓库附带一个教学用 demo,包含主题切换、多步表单和国际象棋对弈三个场景。

该库定位为参考实现和教学用途,未发布到 npm,README 明确标注「不是生产级 UI 框架的承诺」。

信源:https://github.com/openai/realtime-voice-component/
让AI用人类看不懂的符号思考,答题一样准但快12倍

论文「Thinking Without Words」提出 Abstract-CoT:给模型的词表里塞进 64 个全新的「抽象符号」,这些符号不对应任何人类语言,模型在回答问题前先输出一小串这种符号当草稿纸,然后直接给答案,跳过传统的长篇自然语言推理过程。

效果:在 MATH-500 数学题上,推理过程从几百个 token 压缩到几十个,token 用量减少最高 11.6 倍,答对率不变。AlpacaEval 指令跟随测试上分数反而更高。实验覆盖 Qwen3-8B、Qwen3-4B 和 IBM Granite 4.0 Micro 三个模型家族,效果一致。

更有意思的是,这 64 个符号在训练过程中自发形成了类似自然语言的使用规律:少数符号被高频复用,多数符号偶尔出现,分布曲线和人类语言中「的、是、了」远多于生僻字的规律一致。把符号顺序打乱后答题准确率明显下降,说明模型确实学会了用这套「密码」做有结构的推理,而非随便输出占位符。

信源:https://arxiv.org/abs/2604.22709
美团悄悄发布全新大模型:没有公告,没有开源

美团在 LongCat API 平台上线了新模型 LongCat-2.0-Preview,更新日志日期为 4 月 20 日,但美团至今未发布任何官方公告或技术报告。此前 LongCat 系列每款模型(Flash-Chat、Flash-Thinking、Flash-Lite、Flash-Omni、Next)发布时均配有官方博客、技术报告,并同步在 Hugging Face 和 GitHub 开源。2.0-Preview 的更新日志中没有任何开源链接,仅通过 API 提供服务。

更新日志仅列出三项能力:面向 agent 开发,原生支持工具调用、多步推理和长上下文任务;擅长代码生成、自动化工作流和复杂指令执行;深度集成 Claude Code、OpenClaw、OpenCode 和 Kilo Code。

4 月 24 日,多家媒体援引知情人士报道了更多细节:该模型总参数突破万亿,采用 MoE 架构,支持 1M 上下文窗口,参数量与同日发布的 DeepSeek V4 基本一致。知情人士称 LongCat-2.0-Preview 训练推理全程基于国产算力集群完成,动用 5 到 6 万张国产加速卡,是迄今国产算力完成的最大规模训练任务。测试期间每日提供 1000 万 token 免费额度。

信源:https://longcat.chat/platform/docs/ChangeLog.html
英伟达Nemotron 3 Nano Omni开源:单模型统一视觉音频文本,吞吐比同类高9倍

英伟达发布 Nemotron 3 Nano Omni,一个开源多模态模型,将视觉、音频和文本理解统一进单个模型,替代传统 agent 系统中视觉、语音、语言各跑一个模型的做法。模型采用 30B-A3B 混合 MoE(混合专家,按任务激活所需专家模块)架构,开放权重、数据集和训练方法。

在文档智能、视频和音频理解方面,Nemotron 3 Nano Omni 登顶 6 项排行榜,包括 MMlongbench-Doc、OCRBenchV2、WorldSense、DailyOmni 和 VoiceBench。在保持相同用户交互响应速度的前提下,视频推理场景系统吞吐约为同类开源 omni 模型的 9.2 倍,多文档推理约为 7.4 倍。

模型支持 FP8 和 NVFP4 量化,可部署在从 Jetson 边缘设备到数据中心的全链路硬件上。已有 H Company、富士康、Palantir 等公司采用或评估。Nemotron 3 家族过去一年下载量超 5000 万次。

信源:https://blogs.nvidia.com/blog/nemotron-3-nano-omni-multimodal-ai-agents/
1