动察Beating AI News
3.13K subscribers
870 photos
2 videos
3.38K links
AI新闻信息流
Download Telegram
更新即崩:谷歌Antigravity全线模型容量告急,三月以来投诉不断

谷歌 AI 编程工具 Antigravity 近期更新后,用户反映所有模型频繁出现「high traffic」容量错误,复杂任务无法完成。Reddit r/google_antigravity 社区和 Google AI 开发者论坛近日出现大量类似投诉,付费订阅用户同样受影响。

这是 Antigravity 三月以来持续容量困境的延续。v1.20.5(3 月 9 日)修复了一个 token 计量 bug,但同期引入的 AI Credits 计费系统导致积分消耗异常,部分用户配额被锁定长达 7 天。3 月中旬谷歌将 Antigravity 从免费转向积分付费模式后,开发者社区不满持续发酵。目前社区中流传的临时方案包括在设置中关闭 AI Credits、回退至 v1.19.6 等。

信源:https://www.reddit.com/r/google_antigravity/comments/1s7kn9a/all_models_capacity_issues_after_latest_ag_update/
😁1
Kimi K2.5上线一个月后ARR破1亿美元,API额度紧到客户愿预付千万美元抢单

月之暗面在 3 月初、Kimi K2.5 发布一个月后,ARR(年度经常性收入)突破 1 亿美元。知情人士还称,K2.5 上线后,API 供应的 TPM(每分钟令牌数)配额迅速趋紧,有客户开出千万美元级别的消费承诺和预付担保,以争取优先供应。

信源:https://www.jiemian.com/article/14183113.html
前特斯拉总裁:Altman正按「反马斯克」路线行事,Anthropic也不认同其伦理观

前特斯拉总裁、DVx Ventures 联合创始人 Jon McNeill 接受 Axios 采访时称,OpenAI CEO Sam Altman 与马斯克的关系已经「坏到极点」,「如果 Elon 做一件事,Sam 看着他,就会说,我要反着来」。McNeill 还表示,他感觉 Anthropic CEO Dario Amodei 「几乎不尊重马斯克的伦理观,甚至完全没有尊重」。

McNeill 认为,AI 公司高层正把马斯克的做事方式视为威胁,而不只是商业竞争。

信源:https://www.axios.com/2026/03/30/elon-musk-openai-altman-anthropic
微软开源三档Harrier文本嵌入模型,27B版登上多语言MTEB v2榜首

微软在 Hugging Face 开源多语言文本嵌入模型家族 harrier-oss-v1,包含 270M、0.6B 和 27B 三档。模型卡显示,这一系列采用 decoder-only 架构、last-token pooling 和 L2 归一化,最长支持 32768 token,可用于检索、聚类、语义相似度、分类、双语挖掘和重排序。

Multilingual MTEB v2 是业内常用的多语言文本嵌入基准,主要测试检索、分类、聚类和语义相似度等任务。微软模型卡称,三档模型在该基准上的分数分别为 66.5、69.0 和 74.3,其中 27B 版在发布当日登上榜首。270M 和 0.6B 版本还额外使用更大嵌入模型进行知识蒸馏,三款模型均以 MIT 许可证发布。

信源:https://huggingface.co/microsoft/harrier-oss-v1-27b
通义把Vibe Coding塞进全模态,Qwen3.5-Omni称拿下215项SOTA

通义实验室发布全模态模型 Qwen3.5-Omni,支持文本、图片、音频和音视频输入,并可生成带时间戳的细粒度音视频 Caption。官方称,Qwen3.5-Omni-Plus 在音频及音视频分析、推理、对话、翻译等任务上拿下 215 项 SOTA,相关能力超过 Gemini-3.1-Pro。

这次最特别的增量不是榜单,而是「自然涌现的 Audio-Visual Vibe Coding 能力」。通义称,模型未经过专门训练,已经能根据音视频指令直接生成可运行代码。官方还称,该模型支持 256K 上下文、113 种语言识别,可处理 10 小时音频或 1 小时视频,并原生支持 WebSearch 和复杂 Function Call。

Qwen3.5-Omni 延续 Thinker-Talker 分工架构,两部分都升级为 Hybrid-Attention MoE。通义已通过阿里云百炼提供 Plus、Flash、Light 三种尺寸,并上线实时版本 Qwen3.5-Omni-Plus-Realtime。

信源:https://mp.weixin.qq.com/s/or9knvrcnxqJIY2cqoT71w?clicktime=1774877693
国行版Apple Intelligence误上线后撤回,短期无正式上线安排

彭博社记者 Mark Gurman 在 X 上称,苹果的 AI 功能 Apple Intelligence 此次在中国市场短暂开放是一次误上线,相关功能虽然「已经准备好多月」,但苹果仍未获得监管批准,现已下线。

根据爆料账号 @L0vetodream 晒出的截图显示,iPhone 设置中一度出现「Apple 智能与 Siri」页面。Mark Gurman 还称,这次误上线与 iOS 26.5 beta 无关,苹果短期内没有正式上线安排。

信源:https://x.com/markgurman/status/2038701276699967554?s=61&t=a-bloX1n-TZ50ofqhetO1A
Qwen 3.6 Plus Preview登陆OpenRouter:100万上下文,限时免费

模型聚合平台 OpenRouter 已上线 Qwen 3.6 Plus Preview 的免费预览版,模型页显示上下文窗口为 100 万 token,输入和输出价格均为 0 美元/百万 token。OpenRouter 在 X 上称,这是千问旗舰模型的早期预览版,重点强化 Agent 编程、前端编程和通用推理,定位为 Qwen 3.5-Plus 的更稳定后继版本。平台同时提示,免费开放期间,用户的提示词和补全内容会被收集,并可能用于改进模型。OpenRouter 随后更正称,该模型目前还不是视觉语言模型。

信源:https://openrouter.ai/qwen/qwen3.6-plus-preview:free
OpenAI把Codex接进Claude Code:可直接审查或委派任务

OpenAI 开发者体验负责人 Romain Huet 在 X 上表示,OpenAI 已开源一款 Claude Code 插件,用户可直接在 Claude Code 中调用 Codex,使用 ChatGPT 订阅完成代码审查,或把任务委派给 Codex。

插件作者 Dominik Kundel 写道,这款插件可让 Codex 审查代码改动,也可在 Claude Code 内将任务交给 Codex 处理。GitHub README 显示,插件提供 /codex:review`、`/codex:adversarial-review`、`/codex:rescue`、`/codex:status`、`/codex:result/codex:cancel 等命令,既支持只读评审,也支持后台委派任务。

README 还写明,插件可通过 Claude Code 插件市场安装,要求 ChatGPT 订阅(含 Free)或 OpenAI API key,以及 Node.js 18.18 或更高版本。

信源:https://x.com/romainhuet/status/2038677236304245087
Claude Code用量限制消耗异常快,Anthropic称正在紧急排查

Anthropic 工程师 Lydia Hallie 在 X 上表示,团队已注意到用户在 Claude Code 中触达用量限制的速度「远快于预期」,正在积极调查。她随后更新称,这是团队当前的最高优先级事项,「我知道这阻碍了很多人的工作,有进展会第一时间分享」。

信源:https://x.com/lydiahallie/status/2038686571676008625
美团开源语音克隆模型LongCat-AudioDiT,效果超字节Seed-TTS

美团 LongCat 团队开源了语音合成模型 LongCat-AudioDiT,提供 1B 和 3.5B 两个版本,代码和权重均采用 MIT 协议。该模型的核心能力是零样本声音克隆,即只需一段参考录音,就能用该说话人的音色朗读任意新文本。

技术路线上,传统语音合成通常需要先把文本转为频谱图(一种声音的「图像表示」),再从频谱图还原为波形。LongCat-AudioDiT 跳过了频谱图这一中间步骤,直接在波形的压缩表示上做扩散生成,减少了中间环节累积的误差,整条流程只需两个组件。

在 Seed 基准测试(语音克隆领域的主流评测)上,3.5B 版本的中文说话人相似度达到 0.818,超过字节 Seed-TTS 系列中此前最优的 Seed-DiT(0.809);中文困难子集相似度达到 0.797,超过阿里 CosyVoice3.5(0.786)。论文还报告了一个反直觉发现:中间压缩环节的还原质量越高,最终合成效果反而不一定更好。

信源:https://huggingface.co/meituan-longcat/LongCat-AudioDiT-3.5B
狂点版本号就能白嫖AI:小米新输入法明文暴露字节豆包模型密钥

小米 MiClaw 团队新推出的系统输入法存在严重安全疏忽。网友测试发现,只需疯狂点击输入法的版本号即可打开调试页面,页面中直接暴露了 AI 服务的 API 调用地址、API Key、模型提供商和模型名称,均以明文写入代码。

泄露的 API 地址指向字节跳动旗下云服务平台火山引擎的 Ark 接口,使用的模型为豆包系列的 doubao-seed-1-6-lite-251015。从提示词来看,该 AI 功能用于语音输入后处理,负责修正语音识别文本中的错别字、语法错误并添加标点。网友测试确认密钥真实有效,可在外部平台直接调用,目前小米疑似已更换密钥。

反编译代码还暴露了工程质量问题:开发者用 if ("固定字符串".length() > 0) 的方式判断一个永远为真的硬编码字符串是否非空,这种写法不会出现在任何正常的代码审查流程中。

此外,小米在 GitHub 开源项目 mone 的代码提交中也被发现明文写入了 AI 公司月之暗面(Moonshot)的 API 密钥,提交时间为 2025 年 1 月,此后未见变动记录。

信源:https://www.nodeseek.com/post-669430-1
逆向拆解Claude Code发现两个缓存Bug,可无声推高API成本10-20倍

一名开发者通过 Ghidra、MITM 代理和 radare2 逆向拆解了 Claude Code 独立安装版的 228MB 二进制文件,发现两个独立的缓存 Bug,可在用户不知情的情况下将 API 成本推高 10-20 倍。相关分析已提交至 GitHub(issue #40524),被 Anthropic 标记为回归 Bug 并指派处理。

第一个 Bug 存在于独立安装版使用的定制 Bun 运行时中。每次 API 请求时,运行时会在请求体中查找一个计费标识符并替换,但替换逻辑命中的是请求体中的第一个匹配项。如果对话历史恰好包含该字符串(比如讨论过 Claude Code 内部计费机制),替换就会命中消息内容而非系统提示词,导致每次请求都触发缓存全量重建。临时规避方法是改用 npx @anthropic-ai/claude-code 运行,npm 包版本不含这段替换逻辑。

第二个 Bug 影响所有使用 --resume--continue 恢复会话的用户,自 v2.1.69 起引入。恢复会话时,系统附加信息的注入位置与新建会话不同,导致缓存前缀完全不匹配,整段对话历史从缓存读取变为全量重写。后续轮次恢复正常,但恢复操作本身已产生大量额外开销,目前无外部规避方案。

该开发者估算,对于约 50 万 token 的长对话,Bug 1 每次请求额外消耗约 0.04 美元,Bug 2 每次恢复额外消耗约 0.15 美元,两者叠加单次请求成本可超 0.20 美元。此前 Anthropic 工程师 Lydia Hallie 已确认用户触达用量限制的速度「远快于预期」,Reddit 评论区多名用户认为这两个缓存 Bug 可能是用量异常消耗的根本原因之一。

信源:https://www.reddit.com/r/ClaudeAI/comments/1s7mkn3/psa_claude_code_has_two_cache_bugs_that_can/
Hermes Agent v0.6.0:新增飞书和企业微信,可作为MCP服务器接入IDE

开源 AI 模型机构 Nous Research 发布多平台 AI Agent 框架 Hermes Agent v0.6.0,GitHub 仓库已有 1.88 万星。该框架可将 AI Agent 接入 Telegram、Discord、Slack、WhatsApp、飞书、企业微信等多个即时通讯平台,支持 CLI 和网关两种运行模式。

本次更新的主要新功能:

1. 多实例配置(Profiles):同一安装可运行多个隔离的 Agent 实例,各自拥有独立的配置、记忆、会话和技能,凭证锁机制防止两个实例共用同一 bot 账号
2. MCP 服务器模式:通过 hermes mcp serve 将会话和消息暴露给任何 MCP 兼容客户端(Claude Desktop、Cursor、VS Code 等),支持 stdio 和 Streamable HTTP 两种传输方式
3. 飞书/Lark 适配器:支持事件订阅、消息卡片、群聊、图片/文件附件和交互式卡片回调
4. 企业微信适配器:支持文本、图片、语音消息和群聊
5. 推理服务商自动故障转移:配置多个服务商后,主服务商出错时自动切换到下一个
6. Slack 多工作区 OAuth:单个网关实例可同时连接多个 Slack 工作区
7. Telegram Webhook 模式:替代轮询方式,适合生产环境部署
8. 官方 Docker 容器:支持 CLI 和网关模式

release notes 显示,此次更新合并了 95 个 PR,解决了 16 个 issue,开发周期为 2 天。

信源:https://github.com/NousResearch/hermes-agent/releases/tag/v2026.3.30
从拦更新到直接下架:苹果把Anything踢出App Store

《The Information》援引 Anything 方面的说法称,苹果已将 AI 应用生成平台 Anything 从 App Store 下架。这比苹果此前对同类 vibe coding 应用主要拦截更新更进一步,动作已从「不让更新」升级为「直接移除已上架应用」。

苹果给出的理由是违反 App Store 审核规则 2.5.2。苹果官方规则显示,应用必须保持「自包含」,不得下载、安装或执行会引入或改变应用功能的代码。

Replit 和 Bitrig 仍留在 App Store,但更新继续被拦。Anything 方面还表示,如果无法与苹果解决分歧,公司可能转向安卓。

信源:https://www.theinformation.com/articles/apple-kicks-vibe-coding-app-app-store-escalating-crackdown?rc=p2bxcy
千万美元广告费收不回token成本:Amp取消AI编程免费层广告

Sourcegraph 旗下 AI 编程 Agent Amp 宣布,Free 版用户将不再看到广告,每天 $10 的免费使用额度大多数用户保留,部分低活跃用户的额度将被暂停。

Amp 的免费层结构是:用户每天获得 $10 的 frontier token 额度,同时看广告,广告收入用于覆盖这笔 token 成本。广告于 2025 年 10 月引入,年化营收很快超过 1000 万美元,但 2025 年 11 月下旬 Gemini 3 Pro、Opus 4.5、GPT-5.2 Codex 相继发布后,用户 token 消耗持续走高,广告收入已无法覆盖这笔成本,Amp 称消耗「只会继续增加」。竞争层面,OpenAI 的 $20/月订阅据其官方说法可获得价值超 1000 美元的 token,也让广告支撑免费层的吸引力进一步下降。

未来,免费额度将向使用最新版本和推荐工作流的活跃用户倾斜,Amp 表示会在调整前提前告知。

结果是:活跃免费用户反而占了便宜,$10/天的额度保留,广告消失。Amp 放弃了广告这条收入来源,转而用免费额度筛选潜在付费用户。

信源:https://ampcode.com/news/amp-free-is-ad-free
B站内测AI视频创作工具 Updream,支持技能调用与项目管理,需邀请码注册

哔哩哔哩正在内测名为 Updream 的 AI 视频创作工具,专为视频内容创作打造。目前处于邀请码阶段,UP 主须完成官方问卷并通过审核后获得邀请码和积分,产品尚未对外公开。

工具已有网页版,登录后核心界面以「灵感从这里开始」为提示,支持输入创意想法并调用 Skill,另设技能社区及项目管理功能。由于仍处内测,产品具体情况以官方公布为准。

Updream 的出现是哔哩哔哩董事长兼 CEO 陈睿兑现承诺的最新进展。2025 年第三季度财报会上,陈睿表示公司将专注做视频 AI 解决方案,利用 AI 辅助创作者产出更多更好的内容,并称「中国最好的讲 AI 的 UP 主和最对 AI 感兴趣的用户都聚集在 B 站」。当季每月有近 10 万个 AI 相关 UP 主在站内活跃,AI 内容日均投稿量同比增长 83%。

信源:https://mp.weixin.qq.com/s/fsFOHhb1UphULhE6r8dgIA
马斯克称Grok Imagine对xAI毛利为正,视频是通往AGI的关键工具

马斯克在 X 上发文称,AI 的未来主要在于视频理解和生成,「因为光子是迄今为止带宽最高的通信形式,这些是通往 AGI 的关键工具」,并称 xAI 旗下图像生成工具 Grok Imagine「毛利为正,不是亏钱项目」。

这一表态的背景是 OpenAI 上周宣布关停 AI 视频平台 Sora。据 WSJ 和多家媒体报道,Sora 自去年 9 月上线以来累计收入约 210 万美元,日均运营亏损据报约 100 万美元,OpenAI 同时终止了与迪士尼价值 10 亿美元的合作协议。

马斯克未披露 Grok Imagine 的具体收入数字。他此前在 3 月 25 日曾表示「下一版 Grok Imagine 会非常出色,我们正在加倍投入」,并称其「是一个比人们意识到的更重要的工具」。

信源:https://x.com/elonmusk/status/2038756516048916578
axios遭供应链攻击:两个新版本引入恶意依赖,建议立即回滚

供应链安全公司 Socket 研究团队今日披露,被广泛使用的 JavaScript HTTP 请求库 axios 遭遇供应链攻击。两个新发布的版本(v1.14.1 和 v0.30.4)均包含恶意依赖,且这两个版本未出现在 axios 官方 GitHub Release 历史中,偏离了该项目的正常发布流程。

两个版本均引入了恶意包 `plain-crypto-js@4.2.1`。该恶意包于 3 月 30 日 23:59:12 UTC 发布,Socket 的自动化检测在约 6 分钟后将其标记。Socket 指出,这一时间与 axios 新版本发布高度吻合,表明恶意依赖是配合 axios 发布协调投放的。恶意包关联的 npm 账号为 `jasonsaayman`,Socket 称这引发了对「未经授权发布或账号遭入侵」的担忧。

Socket 建议开发者立即检查项目依赖和 lockfile 中是否包含 axios@1.14.1`、`axios@0.30.4 或 `plain-crypto-js@4.2.1`,如有发现立即回滚至已知安全版本。事件仍在持续调查中。

信源:https://socket.dev/blog/axios-npm-package-compromised
AI自动优化执行框架让Haiku4.5终端成绩排第一:林俊旸称这正是他预判的「环境设计」转折

斯坦福、MIT 和韩国游戏公司 KRAFTON 的研究者发布 Meta-Harness,一套让 AI 自动优化执行框架(harness,即包裹模型、驱动 Agent 行动的执行脚手架,涵盖提示词设计、工具调用和上下文管理)的方法。不同于人工手写的执行框架,Meta-Harness 让一个编码 Agent 读取历次候选框架的代码、执行日志和评分,自动迭代优化。

在终端操作基准 TerminalBench-2 上,Meta-Harness 将 Claude Haiku 4.5 的通过率做到 37.6%,超过 Goose(35.5%)和 Claude Code(27.5%),在所有已报告的 Haiku 4.5 执行框架中排第一。在 Claude Opus 4.6 上通过率 76.4%,排第二。

前通义千问技术负责人林俊旸转发论文作者的帖子并评论:「模型加执行框架」已超过「只看模型」,Agent 表现会被框架的设计和质量显著影响,「我确实认为这是一个正确的方向」。林俊旸在 3 月 27 日发布的长文(目前已删除)中就预判,环境设计将从副项目变成真正的创业品类。Meta-Harness 用实验数据印证了这个判断:同一模型,换一套 AI 优化过的执行框架,成绩差距可达 10 个百分点。

信源:https://x.com/JustinLin610/status/2038783276937310582
RL微调让4B模型金融问答超越235B:Snorkel AI开源FinQA训练环境

Snorkel AI 发布 FinQA,一个基于真实 SEC 10-K 财务文件构建的强化学习训练环境,现已开源于 Meta PyTorch 与 Hugging Face 联合维护的 OpenEnv 平台。FinQA 覆盖 22 家上市公司(包括 Alphabet、亚马逊、苹果、美国银行、波音)的 290 道专家标注财务问答,向 Agent 提供 4 个 MCP 工具:列出可用财务表、获取表结构、执行 SQL 查询、提交答案。SQL 强制要求过滤条件且禁止 `SELECT *`,迫使 Agent 只取所需数据,而非倾倒整张表。

Snorkel AI 与加州大学伯克利分校 rLLM 团队合作,用 FinQA 对 Qwen3-4B 进行强化学习微调,结果在金融问答基准 SnorkelFinance 上得分 59.7%,超过同系列 Qwen3-235B(51.37%),参数量约为后者的 1/60,推理成本降约 90%。关键发现:大模型能推理,但会产生幻觉列名、无视 SQL 约束;RL 训练后的小模型反而能精准调用工具,「工具纪律」而非规模才是瓶颈。

FinQA 是 Snorkel AI 在 OpenEnv 发布的首个开源环境,后续将推出覆盖医疗、保险、法律等行业的多轮次企业环境。

信源:https://snorkel.ai/blog/building-finqa-an-open-rl-environment-for-financial-reasoning-agents/
微软Researcher在Perplexity自研基准上胜出:双模型评审进Frontier,Cowork同步开放长任务代理

微软通过 Frontier(企业用户预发布尝鲜计划,参与者可提前试用尚未正式上线的 Copilot 功能)同步开放两项 Microsoft 365 Copilot 新能力。

Researcher(Copilot 内置的深度研究 Agent)新增 Critique 和 Council 两种多模型协作模式。Critique 由 Anthropic 与 OpenAI 旗下模型协作:一个负责规划、检索和起草,另一个专门审核与精修,选中 Auto 时默认启用;Council 同样并行运行两家模型,各自生成完整报告,再由单独的评审模型汇总异同。微软使用 GPT-5.2 作为评判模型(原论文三种评判方法中最严格的一种),在 DRACO 基准(由 Perplexity 研究者发布的 100 道复杂研究题,覆盖 10 个领域)上测试 Critique,综合得分较基准中最优系统 Perplexity Deep Research(使用 Claude Opus 4.6)高 7.0 分,相对提升 13.88%。DRACO 原论文未收录 Critique,这是微软按相同评测协议自行测试所得的数据。

Copilot Cowork 面向更长的多步骤工作:先根据目标生成计划,再跨工具和文件逐步推进,过程中显示进度,用户可随时介入。微软以 Capital Group 为早期试用案例,称其已用于项目规划、排期、制作交付物和准备高管复盘。

信源:https://techcommunity.microsoft.com/blog/microsoft365copilotblog/introducing-multi-model-intelligence-in-researcher/4506011