动察Beating AI News
3.16K subscribers
890 photos
2 videos
1 file
3.41K links
AI新闻信息流
Download Telegram
谷歌把 Gemini in Chrome 推到亚太 7 国,代理浏览功能仍只给美国付费用户

谷歌把浏览器内置助手 Gemini in Chrome 开放给澳大利亚、印度尼西亚、日本、菲律宾、新加坡、韩国、越南 7 个新市场。除日本外,其余 6 国同时覆盖桌面端和 iOS。该功能今年 1 月在美国首发,3 月扩至印度、加拿大、新西兰,这次是第三轮扩区。

Gemini in Chrome 以侧边栏形式常驻浏览器,可跨多个打开的标签页回答问题。今年早些时候加入的 Personal Intelligence 模块能接入 Gmail 和 Google Photos 的数据做个性化回答,也能调用 Calendar 安排日程、Maps 查地点、Gmail 起草并发送邮件。侧边栏里还能用 Nano Banana 2 改图。

这次扩区不覆盖 Gemini in Chrome 的代理功能(agentic)。谷歌把能替用户操作浏览器、自动完成多步任务的这部分仍留在测试阶段,只对美国 AI Pro 和 AI Ultra 两档付费订阅用户开放。7 国新增用户拿到的是问答与账号助手形态,不是能自己点按钮、自己填表单的那一版。

信源:https://x.com/Google/status/2046393908629004443
Meta从Thinking Machines再挖两位创始成员,累计七人出走

Thinking Machines Lab(TML)是 OpenAI 前 CTO Mira Murati 去年创办的 AI 初创公司,估值 120 亿美元、完成过 20 亿美元融资,员工扩至 130 人。Business Insider 4 月 20 日独家披露,TML 又有三名员工转投 Meta:创始团队成员 Mark Jen 和 Yinghai Lu,以及研究员 Tianyi Zhang。Jen 是软件工程师,此前就在 Meta 工作过;Lu 先后待过 Meta 和 OpenAI,研究方向是 inference,直接决定聊天机器人的多步推理能不能跑起来;Zhang 不属于创始团队,署名过多篇被广泛引用的论文。三人都未在 LinkedIn 更新雇主,BI 通过两位知情人士确认此事。

算上这三人,BI 已确认至少七名 TML 创始团队成员跳到 Meta,其中包括构建并发布了 TML 旗舰产品 Tinker 的 Joshua Gross。OpenAI 也挖走了创始成员、安全工程师 Jolene Parish。

流入与流出方向正好相反。现任 CTO Soumith Chintala 是开源项目 PyTorch 的创造者,去年从 Meta 跳槽加入 TML。TML 同期还低调招入了在编程奥林匹克拿过三枚金牌的 Neal Wu。顶级研究人员仍愿意加入 TML,但创始团队里把研究做成产品的那批工程骨干被 Meta 反向挖走得最快。

信源:https://www.businessinsider.com/meta-attracts-more-thinking-machines-lab-talent-in-ai-shakeup-2026-4
Sierra 开源真实客服语音评测 μ-Bench,普通话错误率可达英语的 5 倍

客服 AI 公司 Sierra 开源多语言语音识别(ASR)评测集 μ-Bench,数据来自 250 通真实电话客服录音、4270 条人工标注语音,采样率 8kHz、单声道。过去公开的 ASR 评测要么只做英语,要么用录音棚里朗读的语料,对打算把语音 agent 接进多语言客服场景的团队几乎不可参考。μ-Bench 直接用真实通话填这个空档。

这次公开的是 Sierra 内部一整套评测的子集。内部覆盖 42 种语言、79 个地区变体和 13 家以上供应商,这次开源的是其中英语、西班牙语、土耳其语、越南语和普通话五个地区,以及 Deepgram Nova-3、Google Chirp-3、Microsoft Azure Speech、ElevenLabs Scribe v2、OpenAI GPT-4o Mini Transcribe 五家厂商的跑分。代码、数据集(挂在 Hugging Face)和一个开放榜单一并公开,欢迎其他厂商提交。

评测里真正有新信息的是指标。Sierra 提出一个新指标 UER(Utterance Error Rate,话语级错误率),把会改变原意的错误和无关紧要的错误分开算。传统的 WER(字错误率)把漏掉一声「呃」和听错一位电话号码算成同一种错,但对一个照着转写去执行动作的语音 agent,后者才会让流程出岔。Sierra 称两家 WER 相近的厂商,UER 可能差得很远,因为他们犯的错误种类就不同。

结果层面,Google Chirp-3 准确率领先但推理较慢;Deepgram Nova-3 的 p50 延迟快将近 8 倍,多语言准确率却垫底。普通话识别错误率可以达到英语的 5 倍,越南语在不同厂商间的差距也很大,这些差距只看英语基准是看不到的。

信源:https://sierra.ai/blog/mu-bench-an-open-multilingual-transcription-benchmark
贝索斯AI实验室据称接近380亿美元估值

《金融时报》援引知情人士称,杰夫·贝索斯参与运营的 AI 实验室 Project Prometheus 正接近完成新一轮融资。规模约 100 亿美元,投后估值约 380 亿美元。摩根大通和贝莱德参与了本轮融资。交易尚未最终敲定。

Project Prometheus 不是做通用聊天机器人。它主打能理解物理世界的 AI。目标是把模型用进工程、设计和制造流程。Axios 上月援引知情人士称,这家公司更想先切原型设计、材料和前期工程这类环节,不是直接用机器人替代工厂工人。

信源:https://www.ft.com/content/87ea0ced-bf3c-4822-8dda-437241570ded
Vercel安全事件更新:npm 包未被污染,新建环境变量默认即「敏感」

Vercel 官方账号 4 月 21 日上午宣布,称与 GitHub、Microsoft、npm、Socket 四方联合排查后,Vercel 在 npm 上发布的任何包均未被篡改,供应链「仍然安全」。Vercel 在 npm 上维护 Next.js、Turbopack、SWR 等开源库,合计每月下载量以亿次计,若被攻击者借员工账号投毒,影响会远超 Vercel 自身客户。这次核查排除了事件里最大的一项连带风险。

同日官方安全公告同步更新三处细节。受影响范围首次明确到字段级别。公告称,遭泄露的是未被标记为「敏感」的那部分客户环境变量,其在后台解密后以明文存储。是否有更多数据被带走,Vercel 仍在调查。给客户的建议里多了一条「删除 Vercel 项目或账号本身不能消除风险」。必须先轮换所有未标记为敏感的密钥,再考虑删除动作,攻击者拿到的凭证仍可直连生产系统。

产品侧改了默认值。新建环境变量现在默认即是「敏感」(sensitive: on)。老账号过去新增变量默认是普通类型,要手动勾选才启用敏感。这正是本次攻击者能读到明文变量的直接入口。Dashboard 同步上线了更密集的活动日志界面和团队级环境变量管理;所有安全建议里「启用双因素认证」被顶到最前。

信源:https://vercel.com/kb/bulletin/vercel-april-2026-security-incident
Claude Cowork 上线 Live Artifacts,仪表盘每次打开都会拉取当前数据重新渲染

Claude Cowork 现在可以生成 Live Artifacts:接到用户的应用和本地文件的仪表盘与追踪器,随时打开都会拉取一次当前数据重新渲染。每个产物自动保存到新的「Live Artifacts」标签页并带版本历史,换设备或在另一段对话里也能从原位置接着用。所有付费档可用。

信源:https://x.com/claudeai/status/2046328619249684989
腾讯 QClaw 海外版开启内测,通过 WhatsApp、Telegram 调用本地 Agent

QClaw 海外版开启内测,官网为 qclawsg.qq.com。首批上线美国、加拿大、新加坡、韩国,支持中、英、法、西、韩等多语言。内测期间每日赠送 4000 万 token,官方称价值约 700 美元。同时开放 20000 个「创始龙虾(Founding Claw)」名额,先到先得。

腾讯披露,海外版基于国内版 80 多项功能迭代,5 天完成开发,约 99% 的代码由 QClaw 自己写。所有数据在用户设备上本地处理;国内版已跑通的「龙虾管家(The Gateway)」安全模块同步移植到海外版,对 prompt、skills、执行脚本做实时拦截。海外版另开放 QClaw Playground(专家广场),预置健身教练、金融顾问、语言教师等角色,用户点选即用,不必从零写指令。

信源:https://mp.weixin.qq.com/s/c_H4s_0WMmyutfrwkaWhcw
谷歌DeepMind Inception组招5人,把SIMA、Genie从研究原型推向游戏产品

谷歌DeepMind Inception团队总监Alexandre Moufarek在X上放出5个招聘岗位:游戏设计师、高级产品经理、QA工程师、高级软件工程师和研究工程师(Staff级),链接统一指向Google Careers。Moufarek加入DeepMind前在育碧做过《幽灵行动:未来战士》和《看门狗》两款3A游戏,之后在软银负责Pepper家用机器人的产品。进入DeepMind后,他参与过Project Astra、SIMA、Genie和Gemini四条线。

关键在Inception这个团队的定位。DeepMind把它描述成「和研究团队并肩工作的创意、设计、工程团队」,目标是探索「以前没有AI时做不出来的游戏体验」。它不是研究组,而是把研究成果做成可玩原型的产品团队。

再看岗位构成。5个里有产品经理、游戏设计师和QA工程师,这三个位置过去不会出现在纯研究团队。DeepMind之前演示过SIMA 2和Genie 3的组合:前者是2025年11月发布的基于Gemini的3D虚拟世界agent,后者是可实时生成3D世界的世界模型,DeepMind把两者接起来,让agent在新生成的世界里执行指令。但SIMA 2至今只是「有限研究预览」,只向少数学者和游戏开发者开放。这轮招聘要补的,就是把研究演示做成能交付给外部开发者的产品。

信源:https://x.com/amoufarek/status/2046370200644173831
Anthropic招募STEM驻场研究员,暑期在旧金山测Claude做科研

Anthropic 挂出「Anthropic STEM Fellow」岗位。这是一项面向 STEM 研究者的暑期驻场研究员计划。项目从 6 月 15 日到 9 月 15 日,5 月 15 日截止申请。入选者需要全职在旧金山办公室工作,补贴约为每周 3800 美元。

Anthropic 希望这些驻场研究员和内部团队一起做三类事:给 Claude 设计更不容易刷分的科研评测,看它能不能规划实验、解读数据、理解具体机制;补数据和方法,专门盯能力缺口;把科学软件接进来,让模型在真实研究流程里跑。官方举的例子包括材料科学和气候科学。

岗位简介把目标写成「AI scientist」,也就是能自己推进科研的 AI 系统。

信源:https://job-boards.greenhouse.io/anthropic/jobs/5189848008
阿里云百炼上线 Token Plan 团队版,最低每月 198 元/坐席订阅多家模型

阿里云百炼上线 Token Plan 团队版,面向 AI 编程工具与 Agent 工具按坐席包月。套餐分三档:标准坐席 198 元/月 25,000 Credits、高级坐席 698 元/月 100,000 Credits、尊享坐席 1,398 元/月 250,000 Credits。超出额度时可加购共享用量包,每包 5,000 元换 625,000 Credits,有效期一个月。目前仅开放华北 2(北京)地域。

一个订阅下能切换的模型来自四家厂商:文本生成支持 qwen3.6-plus、智谱 glm-5、MiniMax-M2.5、DeepSeek-V3.2;图像生成支持 qwen-image-2.0 与 wan2.7-image 系列。所有调用以 Credits 统一抵扣,不再按模型分别计费。官方示例显示,qwen3.6-plus 一次总量约 5 万 token 的请求约消耗 4 Credits。

兼容主流 AI 编程工具:OpenAI 兼容端点可接 Codex、OpenCode,Anthropic 兼容端点可接 Claude Code、OpenClaw,DeepSeek V3.2 仅走 OpenAI 协议。图像生成模型需借助各工具的 Slash Command、Skill 等扩展机制调用。

使用范围有明确限制:只能在编程工具或 OpenClaw 类 Agent 中交互式使用。Dify、n8n、Coze 等自动化平台、应用后端和批量调用都不允许,违规会被暂停订阅或封 API Key。套餐订阅人专享,禁止多人共享,不支持退款。

信源:https://help.aliyun.com/zh/model-studio/token-plan-overview
前Stability AI创始人新公司Intelligent Internet推出Logos推理工具

前 Stability AI 创始人 Emad Mostaque 新公司 Intelligent Internet 发布 Logos,这是一套还在早期开发的推理工具。官网说,Logos 想做的,是帮人把复杂问题按最基本的规则一步步往下推,再把过程公开给人检查。公司这次先公开的是物理方向,数学、生物和经济学还没放出完整内容。

同时放出的第一份结果叫《Only One Postulate Needed》。团队拿狭义相对论做样例,声称只靠「相对性原理」这一条前提,就能推出必须存在一个固定的最高速度。实验要做的,只是测出这个速度到底是多少,不用再额外加一条「光速不变」的前提。

信源:https://ii.inc/web/blog/post/logos
DeepMind CEO哈萨比斯公开称赞Anthropic CEO Dario是其他AI实验室领导里最好的

当地时间 4 月 20 日晚,DeepMind 首席执行官 Demis Hassabis 与传记作者 Sebastian Mallaby 在旧金山对谈。活动由 City Arts & Lectures 主办,配合 Mallaby 今年 3 月出版的 Hassabis 传记《The Infinity Machine》造势。

Hassabis 直接评价竞争对手,称 Anthropic CEO Dario Amodei 是「其他实验室领导里最好的」(原话 best of all the other lab leaders)。

Mallaby 还估计 OpenAI 在未来 18 个月内破产的概率是 50%。他本职是金融史学者、美国外交关系委员会研究员,不是 AI 圈分析师。OpenAI 此前披露 2026 年预计亏损 140 亿美元,美国媒体据此推算公司可能在 2027 年现金告急。

关于 AI 末日风险 p(doom),Hassabis 不愿给出具体数字,但坚持它非零。他批评 a16z 联创 Marc Andreessen 和 Meta 首席 AI 科学家 Yann LeCun 坚持 p(doom) 为 0 的立场「离谱」。p(doom) 是 AI 圈行话,指一个人对「AI 最终导致人类灾难」的主观概率估计。

信源:https://x.com/deedydas/status/2046443025975652484?s=46
Exa推出Agentic搜索接口Deep Max,同准确率下比对手快数十倍

Exa 推出面向 LLM 代理的高端搜索接口 Deep Max。一次查询会并发发起几十次 Exa 搜索,每次从不同角度切入同一个问题,再合并成答案。Agentic 搜索指 LLM 自主规划多轮搜索再综合回答,是 Perplexity、You.com、Parallel 等搜索 API 公司近一年的主要产品形态。

三项评测由 Exa 自测,与竞品同题对比。Deep Search QA:Deep Max 90%/64 秒,You.com Frontier 84%/5908 秒,Parallel Ultra 8x 82%/1703 秒。FRAMES:Deep Max 94%/11 秒,Parallel Ultra 88%/1457 秒。HLE-Search:Deep Max 80%/25 秒,与 GPT 5.4 准确率持平但耗时减半。被对比的原生搜索工具还包括 Gemini 3.1 Pro、Claude Opus 4.7。Exa 称「最多比最接近的竞品快 20 倍」。

速度归因于并行工具调用、压缩过的页面正文,以及 Exa 自研搜索栈单次调用 1 秒内返回。Deep Max 目前仅对接触销售的客户开放,正式发布时间和价格未公布。

信源:https://exa.ai/blog/deep-max
Intel放出阿里Wan 2.2的三款INT4量化版

Intel 首席 AI 工程师 Haihao Shen 宣布,Intel 已在 Hugging Face 上传阿里 Wan 2.2 视频模型的三款 INT4 量化版本:T2V-A14B(文生视频)、I2V-A14B(图生视频)和 TI2V-5B(文图混合生视频),全部用 AutoRound 压到 W4A16。Shen 自己就是 AutoRound 这套量化工具的主要作者。INT4 把每个权重从 BF16 的 2 字节压到 0.5 字节,权重体积约为原版四分之一。

A14B 两款原本用 MoE 架构,总参数 27B、每步激活 14B,官方文档称单卡跑 720P 至少要 80GB 显存;TI2V-5B 是稠密模型,原版就能在 4090 上跑 720P@24fps。量化后的实测显存和画质对比 Intel 没公布,需等第三方复现。三款模型的推理链路也没走主线 vLLM,README 指向 Intel 自家的 vllm-omni 分支(feats/ar-w4a16-wan22),要装这个分支才能起服务。

信源:https://x.com/HaihaoShen/status/2046353772625137879
腾讯云开源CubeSandbox,兼容E2B、单机跑2000个沙箱

腾讯云开源了 AI Agent 沙盒 Cube Sandbox,Rust 编写,Apache 2.0 协议。

沙盒是 Agent 跑代码的隔离环境,防止模型生成的代码误删文件、越权访问主机。目前 OpenAI Agents SDK、Manus、Perplexity、Hugging Face 等产品都在用类似架构,接口事实标准是 E2B。Cube 兼容 E2B 接口,业务代码不用改,只改一个环境变量,就能把 Agent 从 E2B 自家服务切到自部署的 Cube。

腾讯云公布了两组性能数据。单并发冷启动低于 60ms,50 并发时平均 67ms、P95 90ms、P99 137ms。单实例常驻内存低于 5MB(沙盒规格不超过 32GB 时测得),一台 96 核服务器可同时跑 2000 多个沙箱。同场景下 Docker 容器启动约 200ms、共享主机内核;传统虚拟机启动以秒计、单实例内存 20MB 起。

Cube 的做法是给每个 Agent 开一套独立的 Guest OS 内核,走硬件级隔离,同时把启动时间压到百毫秒内。加速靠资源池预置、快照克隆、底层锁优化;压内存靠 Rust 重写、CoW 内存复用、reflink 磁盘共享。项目还附带 CubeVS,用 eBPF 做沙盒之间的网络隔离。

规模化验证给了两个案例。Cube 原本跑在腾讯云 Serverless 体系里,承载过百亿级调用。元宝 AI 编程场景迁到 Cube 后,资源核时消耗降了 95.8%。外部客户里,MiniMax 在 Agentic RL 训练中靠 Cube 做到分钟级调度数十万沙箱实例。下一步规划是把事件级快照回滚也开源出去,提供百毫秒级状态回滚。

信源:https://mp.weixin.qq.com/s/5rWKipAQdibiBmmQBHXVWg
删除AI模型训练数据被诉,北京首次将训练系统纳入刑法保护

北京市人民检察院发布《北京市检察机关知识产权检察白皮书(2025 年)》,其中披露 2025 年全市检察机关办理涉人工智能、数据要素产业的知识产权案件 113 件。白皮书重点列出两宗 AI 领域首例案件。

东城区检察院办理了北京首例非法删除 AI 模型训练数据案。一名员工故意删除公司用于训练 AI 模型的大量数据,训练系统因此结构性破坏,经济损失重大。检察机关以破坏计算机信息系统罪提起公诉。白皮书称,该案推动把 AI 模型训练系统认定为刑法意义上的「计算机信息系统」。这一罪名过去主要针对服务器、数据库等传统信息系统遭入侵或破坏的情形,AI 训练数据与训练系统的刑事定位此前并不清晰。

通州区检察院办理了北京首例利用 AI 生成模型侵犯著作权案。四名被告人未经授权以 AI 技术复制他人作品牟利,均以侵犯著作权罪被判刑。

2025 年全年,北京检察机关共办理知识产权案件 1195 件,同比上升 10.34%。

信源:https://www.21jingji.com/article/20260421/herald/7f400f89fae259a65973e06b6cc25ae9.html
Supabase推出@supabase/server简化SSR鉴权样板

Supabase 推出 npm 工具包 @supabase/server,版本 0.1.4,MIT 许可证。这个包把服务端渲染、API 路由、边缘函数场景下的 Supabase 客户端创建、cookie 同步、鉴权会话维护统一做掉,开发者不用再自己拼。

用法上提供一个叫 withSupabase 的高阶函数。开发者传入访问策略(示例里是 allow: 'user',只放登录用户过),返回的处理函数会把配好的 Supabase 客户端挂到 ctx.supabase 上,业务代码直接 ctx.supabase.from('todos').select() 查库即可。

Supabase 联合创始人 Paul Copplestone 在 X 公布消息时提到,这是早期版本,正在征集测试者和反馈,团队另在做各框架的适配器。

此前在 Next.js 等 SSR 框架里集成 Supabase,开发者要自己写 cookie 读取、会话刷新、客户端传递,这些样板代码是社区长期吐槽的点。

信源:https://www.npmjs.com/package/@supabase/server
Meta联合CBRE办免费培训补数据中心光纤技工缺口

Meta 联合 CBRE 推出 LevelUp 光纤技工培养计划(LevelUp Fiber Technician Pathway),一个面向美国人的免费 4 周培训项目,目标是为自家数据中心工地和后续运营岗位输送光纤技工。项目由全球房地产与关键基础设施服务商 CBRE 承接运营,首批学员今年夏天开班。

课程组合课堂讨论、实操实验和团队练习,毕业生可通过 Meta 的承包商网络进入 Meta 在美的建设工地。Meta 目前在美运营或在建 27 座数据中心,官方披露这些项目自 2010 年以来累计提供超过 30,000 个建设期技工岗位和超过 5,000 个永久运营岗位(场站经理、工程师等)。

美国光纤技工乃至整个建筑行业正处于全国性短缺,而各家 AI 公司和云厂商的数据中心项目处于历史高位。Meta 这次直接自己下场办培训,为数据中心扩张自备技工供给。

信源:https://about.fb.com/news/2026/04/meta-cbre-invest-in-american-jobs-new-fiber-technician-training-program/
1
微软联合NABTU为北美数百万建筑技工开免费AI课

微软与北美建筑业工会联合会 NABTU(North America's Building Trades Unions)扩大合作,向分布在全北美的数百万熟练技工免费开放 AI 通识课程和行业认证证书。项目同时联手非营利机构 TradesFutures,后者在全美 34 个州把求职者接入建筑工会的学徒项目和岗位。

双方此前已有合作,这次在既有基础上把覆盖范围扩到整个工会技工群体。微软目前还与美国劳工联合会产业工会联合会 AFL-CIO、美国教师联合会 AFT 维持类似合作。

美国多个州和联邦层面正推进数据中心暂停建设的法案,焦点是数据中心的耗电和用水压力。微软这次拉工会入场,一头为社区接受度找本地代言人,一头为 AI 基建配套锁定技工供给。

信源:https://www.axios.com/2026/04/21/microsoft-construction-unions-partner-ai-boom
1
MCP协议曝设计级RCE漏洞,Anthropic拒绝改架构

安全公司 OX Security 近日披露,Anthropic 主导的开放协议 MCP(Model Context Protocol,AI 代理调用外部工具的事实标准)存在设计层面的远程代码执行漏洞。攻击者可在任何运行有漏洞 MCP 实现的系统上执行任意命令,拿到用户数据、内部数据库、API 密钥和聊天记录。漏洞不出在实现者的编码失误,而在 Anthropic 官方 SDK 处理 STDIO 传输时的默认行为,Python、TypeScript、Java、Rust 四个语言版本都中招。

STDIO 是 MCP 的一种传输方式,让本地进程通过标准输入输出通信。官方 SDK 里的 StdioServerParameters 会按配置里的命令参数直接启动子进程,开发者如果没额外做输入清洗,任何能走到这一步的用户输入就会变成系统命令。OX Security 把攻击面归成四类:配置界面直接注入命令;拿白名单里允许的命令加行标志绕过清洗(例如 `npx -c <命令>`);在 IDE 里用提示注入改写 MCP 配置文件,让 Windsurf 这类工具无需用户交互就跑起恶意 STDIO 服务;以及借 MCP 市场的 HTTP 请求偷偷塞进 STDIO 配置。

OX Security 给的数字:受影响软件包累计下载超 1.5 亿次,公开可访问的 MCP 服务器超 7000 台,合计暴露最多 20 万个实例、涉及 200 多个开源项目。团队累计提交 30 余份责任披露、拿到 10 个以上高危或严重级 CVE,覆盖 LiteLLM、LangFlow、Flowise、Windsurf、GPT Researcher、Agent Zero、DocsGPT 等 AI 框架与 IDE;测试过的 11 家 MCP 包仓库里有 9 家能被这种手法塞进恶意配置。

披露后,Anthropic 回应称这是「预期行为」(by design),STDIO 的执行模型属于「安全的默认设计」,并把输入清洗的责任划给开发者,拒绝在协议或官方 SDK 层面改动。DocsGPT、LettaAI 等厂商已自行发补丁,Anthropic 参考实现的默认行为未变。

MCP 已是 AI 代理接外部工具的事实标准,OpenAI、Google、微软都在跟进。根子没修的情况下,任何沿用官方 SDK 默认方式接 STDIO 的 MCP 服务,即使自己没写错一行代码,也可能成为攻击入口。

信源:https://thehackernews.com/2026/04/anthropic-mcp-design-vulnerability.html
Moondream推出微调服务Lens,企业出数据即可得定制VLM

Moondream 上线商业化微调服务 Lens,把强化学习和监督微调封装成按量付费 API。客户只需提交自己业务场景的标注图像,后台自动完成训练,产出一个贴合该场景的专属 VLM(视觉语言模型,能读图并用文字回答的 AI 模型);官方称十几张图的样本就足以看到效果。训练好的模型可直接通过 Moondream 云端调用,也能用自家推理引擎 Photon 本地部署。

这是 Moondream「开源小模型打底、商业服务做增值」路线的关键一环。通用 VLM 到了体育直播、医疗影像、工厂质检这类细分场景就容易水土不服,Lens 把「搭 RL 训练流水线」这件事从客户那边接过来,门槛压到几十张标注图加几十美元训练费。

公司公开了三组对比数据。NBA 直播画面中检测持球球员,基础模型经常给出大量误检框;RL 微调后 F1 从 28% 提升至 79%,误报框从 61 降到 2,训练耗时 54 分钟、费用 16.89 美元。街景照片识别所在国家的任务里,每国 25 张微调样本让准确率达到 71.1%,超过 GPT-5.4 的 69.8%。医学影像方面,微调后模型对青光眼严重程度分级的准确度是 GPT-5.4 的 2 倍,训练 47 分钟、花费 15.68 美元。

首个合作方是做网络遥控云台摄像机的厂商 PTZOptics,用 Moondream 实现追踪特定目标(例如「穿红衣服的人」)、画面内容清点和异常告警。Moondream 此前发布过推理引擎 Photon,官方数字是 H100 上 20 毫秒推理延迟。Lens 主攻准确度、Photon 主攻速度,加上可本地运行的开源模型本体,Moondream 把 VLM 落地的速度、精度、部署三条线凑齐了。

信源:https://moondream.ai/blog/lens-moondreams-finetune-service