动察Beating AI News
3.14K subscribers
872 photos
2 videos
3.38K links
AI新闻信息流
Download Telegram
微软开源三档Harrier文本嵌入模型,27B版登上多语言MTEB v2榜首

微软在 Hugging Face 开源多语言文本嵌入模型家族 harrier-oss-v1,包含 270M、0.6B 和 27B 三档。模型卡显示,这一系列采用 decoder-only 架构、last-token pooling 和 L2 归一化,最长支持 32768 token,可用于检索、聚类、语义相似度、分类、双语挖掘和重排序。

Multilingual MTEB v2 是业内常用的多语言文本嵌入基准,主要测试检索、分类、聚类和语义相似度等任务。微软模型卡称,三档模型在该基准上的分数分别为 66.5、69.0 和 74.3,其中 27B 版在发布当日登上榜首。270M 和 0.6B 版本还额外使用更大嵌入模型进行知识蒸馏,三款模型均以 MIT 许可证发布。

信源:https://huggingface.co/microsoft/harrier-oss-v1-27b
通义把Vibe Coding塞进全模态,Qwen3.5-Omni称拿下215项SOTA

通义实验室发布全模态模型 Qwen3.5-Omni,支持文本、图片、音频和音视频输入,并可生成带时间戳的细粒度音视频 Caption。官方称,Qwen3.5-Omni-Plus 在音频及音视频分析、推理、对话、翻译等任务上拿下 215 项 SOTA,相关能力超过 Gemini-3.1-Pro。

这次最特别的增量不是榜单,而是「自然涌现的 Audio-Visual Vibe Coding 能力」。通义称,模型未经过专门训练,已经能根据音视频指令直接生成可运行代码。官方还称,该模型支持 256K 上下文、113 种语言识别,可处理 10 小时音频或 1 小时视频,并原生支持 WebSearch 和复杂 Function Call。

Qwen3.5-Omni 延续 Thinker-Talker 分工架构,两部分都升级为 Hybrid-Attention MoE。通义已通过阿里云百炼提供 Plus、Flash、Light 三种尺寸,并上线实时版本 Qwen3.5-Omni-Plus-Realtime。

信源:https://mp.weixin.qq.com/s/or9knvrcnxqJIY2cqoT71w?clicktime=1774877693
国行版Apple Intelligence误上线后撤回,短期无正式上线安排

彭博社记者 Mark Gurman 在 X 上称,苹果的 AI 功能 Apple Intelligence 此次在中国市场短暂开放是一次误上线,相关功能虽然「已经准备好多月」,但苹果仍未获得监管批准,现已下线。

根据爆料账号 @L0vetodream 晒出的截图显示,iPhone 设置中一度出现「Apple 智能与 Siri」页面。Mark Gurman 还称,这次误上线与 iOS 26.5 beta 无关,苹果短期内没有正式上线安排。

信源:https://x.com/markgurman/status/2038701276699967554?s=61&t=a-bloX1n-TZ50ofqhetO1A
Qwen 3.6 Plus Preview登陆OpenRouter:100万上下文,限时免费

模型聚合平台 OpenRouter 已上线 Qwen 3.6 Plus Preview 的免费预览版,模型页显示上下文窗口为 100 万 token,输入和输出价格均为 0 美元/百万 token。OpenRouter 在 X 上称,这是千问旗舰模型的早期预览版,重点强化 Agent 编程、前端编程和通用推理,定位为 Qwen 3.5-Plus 的更稳定后继版本。平台同时提示,免费开放期间,用户的提示词和补全内容会被收集,并可能用于改进模型。OpenRouter 随后更正称,该模型目前还不是视觉语言模型。

信源:https://openrouter.ai/qwen/qwen3.6-plus-preview:free
OpenAI把Codex接进Claude Code:可直接审查或委派任务

OpenAI 开发者体验负责人 Romain Huet 在 X 上表示,OpenAI 已开源一款 Claude Code 插件,用户可直接在 Claude Code 中调用 Codex,使用 ChatGPT 订阅完成代码审查,或把任务委派给 Codex。

插件作者 Dominik Kundel 写道,这款插件可让 Codex 审查代码改动,也可在 Claude Code 内将任务交给 Codex 处理。GitHub README 显示,插件提供 /codex:review`、`/codex:adversarial-review`、`/codex:rescue`、`/codex:status`、`/codex:result/codex:cancel 等命令,既支持只读评审,也支持后台委派任务。

README 还写明,插件可通过 Claude Code 插件市场安装,要求 ChatGPT 订阅(含 Free)或 OpenAI API key,以及 Node.js 18.18 或更高版本。

信源:https://x.com/romainhuet/status/2038677236304245087
Claude Code用量限制消耗异常快,Anthropic称正在紧急排查

Anthropic 工程师 Lydia Hallie 在 X 上表示,团队已注意到用户在 Claude Code 中触达用量限制的速度「远快于预期」,正在积极调查。她随后更新称,这是团队当前的最高优先级事项,「我知道这阻碍了很多人的工作,有进展会第一时间分享」。

信源:https://x.com/lydiahallie/status/2038686571676008625
美团开源语音克隆模型LongCat-AudioDiT,效果超字节Seed-TTS

美团 LongCat 团队开源了语音合成模型 LongCat-AudioDiT,提供 1B 和 3.5B 两个版本,代码和权重均采用 MIT 协议。该模型的核心能力是零样本声音克隆,即只需一段参考录音,就能用该说话人的音色朗读任意新文本。

技术路线上,传统语音合成通常需要先把文本转为频谱图(一种声音的「图像表示」),再从频谱图还原为波形。LongCat-AudioDiT 跳过了频谱图这一中间步骤,直接在波形的压缩表示上做扩散生成,减少了中间环节累积的误差,整条流程只需两个组件。

在 Seed 基准测试(语音克隆领域的主流评测)上,3.5B 版本的中文说话人相似度达到 0.818,超过字节 Seed-TTS 系列中此前最优的 Seed-DiT(0.809);中文困难子集相似度达到 0.797,超过阿里 CosyVoice3.5(0.786)。论文还报告了一个反直觉发现:中间压缩环节的还原质量越高,最终合成效果反而不一定更好。

信源:https://huggingface.co/meituan-longcat/LongCat-AudioDiT-3.5B
狂点版本号就能白嫖AI:小米新输入法明文暴露字节豆包模型密钥

小米 MiClaw 团队新推出的系统输入法存在严重安全疏忽。网友测试发现,只需疯狂点击输入法的版本号即可打开调试页面,页面中直接暴露了 AI 服务的 API 调用地址、API Key、模型提供商和模型名称,均以明文写入代码。

泄露的 API 地址指向字节跳动旗下云服务平台火山引擎的 Ark 接口,使用的模型为豆包系列的 doubao-seed-1-6-lite-251015。从提示词来看,该 AI 功能用于语音输入后处理,负责修正语音识别文本中的错别字、语法错误并添加标点。网友测试确认密钥真实有效,可在外部平台直接调用,目前小米疑似已更换密钥。

反编译代码还暴露了工程质量问题:开发者用 if ("固定字符串".length() > 0) 的方式判断一个永远为真的硬编码字符串是否非空,这种写法不会出现在任何正常的代码审查流程中。

此外,小米在 GitHub 开源项目 mone 的代码提交中也被发现明文写入了 AI 公司月之暗面(Moonshot)的 API 密钥,提交时间为 2025 年 1 月,此后未见变动记录。

信源:https://www.nodeseek.com/post-669430-1
逆向拆解Claude Code发现两个缓存Bug,可无声推高API成本10-20倍

一名开发者通过 Ghidra、MITM 代理和 radare2 逆向拆解了 Claude Code 独立安装版的 228MB 二进制文件,发现两个独立的缓存 Bug,可在用户不知情的情况下将 API 成本推高 10-20 倍。相关分析已提交至 GitHub(issue #40524),被 Anthropic 标记为回归 Bug 并指派处理。

第一个 Bug 存在于独立安装版使用的定制 Bun 运行时中。每次 API 请求时,运行时会在请求体中查找一个计费标识符并替换,但替换逻辑命中的是请求体中的第一个匹配项。如果对话历史恰好包含该字符串(比如讨论过 Claude Code 内部计费机制),替换就会命中消息内容而非系统提示词,导致每次请求都触发缓存全量重建。临时规避方法是改用 npx @anthropic-ai/claude-code 运行,npm 包版本不含这段替换逻辑。

第二个 Bug 影响所有使用 --resume--continue 恢复会话的用户,自 v2.1.69 起引入。恢复会话时,系统附加信息的注入位置与新建会话不同,导致缓存前缀完全不匹配,整段对话历史从缓存读取变为全量重写。后续轮次恢复正常,但恢复操作本身已产生大量额外开销,目前无外部规避方案。

该开发者估算,对于约 50 万 token 的长对话,Bug 1 每次请求额外消耗约 0.04 美元,Bug 2 每次恢复额外消耗约 0.15 美元,两者叠加单次请求成本可超 0.20 美元。此前 Anthropic 工程师 Lydia Hallie 已确认用户触达用量限制的速度「远快于预期」,Reddit 评论区多名用户认为这两个缓存 Bug 可能是用量异常消耗的根本原因之一。

信源:https://www.reddit.com/r/ClaudeAI/comments/1s7mkn3/psa_claude_code_has_two_cache_bugs_that_can/
Hermes Agent v0.6.0:新增飞书和企业微信,可作为MCP服务器接入IDE

开源 AI 模型机构 Nous Research 发布多平台 AI Agent 框架 Hermes Agent v0.6.0,GitHub 仓库已有 1.88 万星。该框架可将 AI Agent 接入 Telegram、Discord、Slack、WhatsApp、飞书、企业微信等多个即时通讯平台,支持 CLI 和网关两种运行模式。

本次更新的主要新功能:

1. 多实例配置(Profiles):同一安装可运行多个隔离的 Agent 实例,各自拥有独立的配置、记忆、会话和技能,凭证锁机制防止两个实例共用同一 bot 账号
2. MCP 服务器模式:通过 hermes mcp serve 将会话和消息暴露给任何 MCP 兼容客户端(Claude Desktop、Cursor、VS Code 等),支持 stdio 和 Streamable HTTP 两种传输方式
3. 飞书/Lark 适配器:支持事件订阅、消息卡片、群聊、图片/文件附件和交互式卡片回调
4. 企业微信适配器:支持文本、图片、语音消息和群聊
5. 推理服务商自动故障转移:配置多个服务商后,主服务商出错时自动切换到下一个
6. Slack 多工作区 OAuth:单个网关实例可同时连接多个 Slack 工作区
7. Telegram Webhook 模式:替代轮询方式,适合生产环境部署
8. 官方 Docker 容器:支持 CLI 和网关模式

release notes 显示,此次更新合并了 95 个 PR,解决了 16 个 issue,开发周期为 2 天。

信源:https://github.com/NousResearch/hermes-agent/releases/tag/v2026.3.30
从拦更新到直接下架:苹果把Anything踢出App Store

《The Information》援引 Anything 方面的说法称,苹果已将 AI 应用生成平台 Anything 从 App Store 下架。这比苹果此前对同类 vibe coding 应用主要拦截更新更进一步,动作已从「不让更新」升级为「直接移除已上架应用」。

苹果给出的理由是违反 App Store 审核规则 2.5.2。苹果官方规则显示,应用必须保持「自包含」,不得下载、安装或执行会引入或改变应用功能的代码。

Replit 和 Bitrig 仍留在 App Store,但更新继续被拦。Anything 方面还表示,如果无法与苹果解决分歧,公司可能转向安卓。

信源:https://www.theinformation.com/articles/apple-kicks-vibe-coding-app-app-store-escalating-crackdown?rc=p2bxcy
千万美元广告费收不回token成本:Amp取消AI编程免费层广告

Sourcegraph 旗下 AI 编程 Agent Amp 宣布,Free 版用户将不再看到广告,每天 $10 的免费使用额度大多数用户保留,部分低活跃用户的额度将被暂停。

Amp 的免费层结构是:用户每天获得 $10 的 frontier token 额度,同时看广告,广告收入用于覆盖这笔 token 成本。广告于 2025 年 10 月引入,年化营收很快超过 1000 万美元,但 2025 年 11 月下旬 Gemini 3 Pro、Opus 4.5、GPT-5.2 Codex 相继发布后,用户 token 消耗持续走高,广告收入已无法覆盖这笔成本,Amp 称消耗「只会继续增加」。竞争层面,OpenAI 的 $20/月订阅据其官方说法可获得价值超 1000 美元的 token,也让广告支撑免费层的吸引力进一步下降。

未来,免费额度将向使用最新版本和推荐工作流的活跃用户倾斜,Amp 表示会在调整前提前告知。

结果是:活跃免费用户反而占了便宜,$10/天的额度保留,广告消失。Amp 放弃了广告这条收入来源,转而用免费额度筛选潜在付费用户。

信源:https://ampcode.com/news/amp-free-is-ad-free
B站内测AI视频创作工具 Updream,支持技能调用与项目管理,需邀请码注册

哔哩哔哩正在内测名为 Updream 的 AI 视频创作工具,专为视频内容创作打造。目前处于邀请码阶段,UP 主须完成官方问卷并通过审核后获得邀请码和积分,产品尚未对外公开。

工具已有网页版,登录后核心界面以「灵感从这里开始」为提示,支持输入创意想法并调用 Skill,另设技能社区及项目管理功能。由于仍处内测,产品具体情况以官方公布为准。

Updream 的出现是哔哩哔哩董事长兼 CEO 陈睿兑现承诺的最新进展。2025 年第三季度财报会上,陈睿表示公司将专注做视频 AI 解决方案,利用 AI 辅助创作者产出更多更好的内容,并称「中国最好的讲 AI 的 UP 主和最对 AI 感兴趣的用户都聚集在 B 站」。当季每月有近 10 万个 AI 相关 UP 主在站内活跃,AI 内容日均投稿量同比增长 83%。

信源:https://mp.weixin.qq.com/s/fsFOHhb1UphULhE6r8dgIA
马斯克称Grok Imagine对xAI毛利为正,视频是通往AGI的关键工具

马斯克在 X 上发文称,AI 的未来主要在于视频理解和生成,「因为光子是迄今为止带宽最高的通信形式,这些是通往 AGI 的关键工具」,并称 xAI 旗下图像生成工具 Grok Imagine「毛利为正,不是亏钱项目」。

这一表态的背景是 OpenAI 上周宣布关停 AI 视频平台 Sora。据 WSJ 和多家媒体报道,Sora 自去年 9 月上线以来累计收入约 210 万美元,日均运营亏损据报约 100 万美元,OpenAI 同时终止了与迪士尼价值 10 亿美元的合作协议。

马斯克未披露 Grok Imagine 的具体收入数字。他此前在 3 月 25 日曾表示「下一版 Grok Imagine 会非常出色,我们正在加倍投入」,并称其「是一个比人们意识到的更重要的工具」。

信源:https://x.com/elonmusk/status/2038756516048916578
axios遭供应链攻击:两个新版本引入恶意依赖,建议立即回滚

供应链安全公司 Socket 研究团队今日披露,被广泛使用的 JavaScript HTTP 请求库 axios 遭遇供应链攻击。两个新发布的版本(v1.14.1 和 v0.30.4)均包含恶意依赖,且这两个版本未出现在 axios 官方 GitHub Release 历史中,偏离了该项目的正常发布流程。

两个版本均引入了恶意包 `plain-crypto-js@4.2.1`。该恶意包于 3 月 30 日 23:59:12 UTC 发布,Socket 的自动化检测在约 6 分钟后将其标记。Socket 指出,这一时间与 axios 新版本发布高度吻合,表明恶意依赖是配合 axios 发布协调投放的。恶意包关联的 npm 账号为 `jasonsaayman`,Socket 称这引发了对「未经授权发布或账号遭入侵」的担忧。

Socket 建议开发者立即检查项目依赖和 lockfile 中是否包含 axios@1.14.1`、`axios@0.30.4 或 `plain-crypto-js@4.2.1`,如有发现立即回滚至已知安全版本。事件仍在持续调查中。

信源:https://socket.dev/blog/axios-npm-package-compromised
AI自动优化执行框架让Haiku4.5终端成绩排第一:林俊旸称这正是他预判的「环境设计」转折

斯坦福、MIT 和韩国游戏公司 KRAFTON 的研究者发布 Meta-Harness,一套让 AI 自动优化执行框架(harness,即包裹模型、驱动 Agent 行动的执行脚手架,涵盖提示词设计、工具调用和上下文管理)的方法。不同于人工手写的执行框架,Meta-Harness 让一个编码 Agent 读取历次候选框架的代码、执行日志和评分,自动迭代优化。

在终端操作基准 TerminalBench-2 上,Meta-Harness 将 Claude Haiku 4.5 的通过率做到 37.6%,超过 Goose(35.5%)和 Claude Code(27.5%),在所有已报告的 Haiku 4.5 执行框架中排第一。在 Claude Opus 4.6 上通过率 76.4%,排第二。

前通义千问技术负责人林俊旸转发论文作者的帖子并评论:「模型加执行框架」已超过「只看模型」,Agent 表现会被框架的设计和质量显著影响,「我确实认为这是一个正确的方向」。林俊旸在 3 月 27 日发布的长文(目前已删除)中就预判,环境设计将从副项目变成真正的创业品类。Meta-Harness 用实验数据印证了这个判断:同一模型,换一套 AI 优化过的执行框架,成绩差距可达 10 个百分点。

信源:https://x.com/JustinLin610/status/2038783276937310582
RL微调让4B模型金融问答超越235B:Snorkel AI开源FinQA训练环境

Snorkel AI 发布 FinQA,一个基于真实 SEC 10-K 财务文件构建的强化学习训练环境,现已开源于 Meta PyTorch 与 Hugging Face 联合维护的 OpenEnv 平台。FinQA 覆盖 22 家上市公司(包括 Alphabet、亚马逊、苹果、美国银行、波音)的 290 道专家标注财务问答,向 Agent 提供 4 个 MCP 工具:列出可用财务表、获取表结构、执行 SQL 查询、提交答案。SQL 强制要求过滤条件且禁止 `SELECT *`,迫使 Agent 只取所需数据,而非倾倒整张表。

Snorkel AI 与加州大学伯克利分校 rLLM 团队合作,用 FinQA 对 Qwen3-4B 进行强化学习微调,结果在金融问答基准 SnorkelFinance 上得分 59.7%,超过同系列 Qwen3-235B(51.37%),参数量约为后者的 1/60,推理成本降约 90%。关键发现:大模型能推理,但会产生幻觉列名、无视 SQL 约束;RL 训练后的小模型反而能精准调用工具,「工具纪律」而非规模才是瓶颈。

FinQA 是 Snorkel AI 在 OpenEnv 发布的首个开源环境,后续将推出覆盖医疗、保险、法律等行业的多轮次企业环境。

信源:https://snorkel.ai/blog/building-finqa-an-open-rl-environment-for-financial-reasoning-agents/
微软Researcher在Perplexity自研基准上胜出:双模型评审进Frontier,Cowork同步开放长任务代理

微软通过 Frontier(企业用户预发布尝鲜计划,参与者可提前试用尚未正式上线的 Copilot 功能)同步开放两项 Microsoft 365 Copilot 新能力。

Researcher(Copilot 内置的深度研究 Agent)新增 Critique 和 Council 两种多模型协作模式。Critique 由 Anthropic 与 OpenAI 旗下模型协作:一个负责规划、检索和起草,另一个专门审核与精修,选中 Auto 时默认启用;Council 同样并行运行两家模型,各自生成完整报告,再由单独的评审模型汇总异同。微软使用 GPT-5.2 作为评判模型(原论文三种评判方法中最严格的一种),在 DRACO 基准(由 Perplexity 研究者发布的 100 道复杂研究题,覆盖 10 个领域)上测试 Critique,综合得分较基准中最优系统 Perplexity Deep Research(使用 Claude Opus 4.6)高 7.0 分,相对提升 13.88%。DRACO 原论文未收录 Critique,这是微软按相同评测协议自行测试所得的数据。

Copilot Cowork 面向更长的多步骤工作:先根据目标生成计划,再跨工具和文件逐步推进,过程中显示进度,用户可随时介入。微软以 Capital Group 为早期试用案例,称其已用于项目规划、排期、制作交付物和准备高管复盘。

信源:https://techcommunity.microsoft.com/blog/microsoft365copilotblog/introducing-multi-model-intelligence-in-researcher/4506011
Ollama以MLX重建Apple Silicon推理引擎:decode速度近翻倍,已适配Claude Code

Ollama 发布 0.19 预览版,以苹果机器学习框架 MLX 重建了 Apple Silicon 上的推理引擎,利用统一内存架构提升性能,并在 M5/M5 Pro/M5 Max 芯片上调用 GPU 神经网络加速器同时优化首 token 延迟和生成速度。

3 月 29 日的基准测试在 M5 系列芯片上运行 Qwen3.5-35B-A3B 模型(英伟达 NVFP4 量化),与 Ollama 0.18 相比:prefill 速度从 1154 tokens/s 提升至 1810 tokens/s,decode 速度从 58 tokens/s 提升至 112 tokens/s,接近翻倍。改用 int4 精度时,prefill 可进一步达到 1851 tokens/s,decode 达 134 tokens/s。

0.19 版同步新增对英伟达 NVFP4 量化格式的支持。NVFP4 是一种在降低内存带宽和存储占用的同时保持模型精度的量化方式,与英伟达 Model Optimizer 优化的模型兼容,也与主流云端推理服务商的生产环境保持格式一致。缓存系统同步升级,支持跨会话复用(使用 Claude Code 等工具时,共享系统提示词可获得更多缓存命中)、在提示词关键位置存储快照以减少重复处理,以及更智能的缓存淘汰策略。

此预览版需要 32GB 以上统一内存的 Mac,当前专为编程任务调优的模型为 Qwen3.5-35B-A3B,可通过 ollama launch claude --model qwen3.5:35b-a3b-coding-nvfp4 接入 Claude Code。

信源:https://ollama.com/blog/mlx
英国AI推理芯片初创Fractile寻求融资逾2亿美元,估值10亿美元

FT 援引知情人士称,伦敦芯片初创公司 Fractile 正与风险投资机构 Accel 等投资方洽谈新一轮融资,目标融资额逾2亿美元,估值约10亿美元。

Fractile 成立于2022年,CEO Walter Goodwin 持牛津大学博士学位,团队汇聚英伟达、Imagination Technologies 及 Graphcore 的前工程师。公司此前完成约1500万美元种子轮,投资方包括北约创新基金和前英特尔 CEO Pat Gelsinger。与英伟达 GPU 不同,Fractile 的 AI 芯片采用静态随机存取存储器(SRAM),主打 AI 推理场景的速度与成本优化,软硬件并举。公司上月宣布未来三年在伦敦和布里斯托投入1亿英镑,新建工业硬件工程设施。

英国 AI 芯片领域近来融资密集:一个月前,英国 AI 芯片初创 Olix 完成2.2亿美元融资。

信源:https://www.ft.com/content/07590da1-ee27-421f-b60a-387f8c6f4b61
字节AI编程工具Trae旗下SOLO上线桌面端和网页端,今日启动内测

字节跳动旗下 AI 编程工具 Trae 的 Agent 产品 SOLO,今日推出桌面端和网页端,启动内测。

SOLO 提供双模式智能体:Code 模式专注编程开发场景,MTC 模式支持写方案、数据分析等通用任务,可供研发、产品、数据、运营等多角色使用。新版本采用三栏工作区,依托云端算力支持多个任务同时并行运行,SOLO 自动拆解任务并调用工具完成执行,用户只需提交需求和验收结果。支持处理 JSON、Python、PPTX、CSV 等多种文件格式,产出直接在工具面板展示。桌面端目前仅支持 macOS。中国版可在 trae.cn 下载,国际版网页端入口为 solo.trae.ai,两版均需邀请码,限时免费开放。

信源:https://mp.weixin.qq.com/s/iN0LUDIGsYeetq_wn1Q8FA
1