狂点版本号就能白嫖AI:小米新输入法明文暴露字节豆包模型密钥
小米 MiClaw 团队新推出的系统输入法存在严重安全疏忽。网友测试发现,只需疯狂点击输入法的版本号即可打开调试页面,页面中直接暴露了 AI 服务的 API 调用地址、API Key、模型提供商和模型名称,均以明文写入代码。
泄露的 API 地址指向字节跳动旗下云服务平台火山引擎的 Ark 接口,使用的模型为豆包系列的 doubao-seed-1-6-lite-251015。从提示词来看,该 AI 功能用于语音输入后处理,负责修正语音识别文本中的错别字、语法错误并添加标点。网友测试确认密钥真实有效,可在外部平台直接调用,目前小米疑似已更换密钥。
反编译代码还暴露了工程质量问题:开发者用
此外,小米在 GitHub 开源项目 mone 的代码提交中也被发现明文写入了 AI 公司月之暗面(Moonshot)的 API 密钥,提交时间为 2025 年 1 月,此后未见变动记录。
信源:https://www.nodeseek.com/post-669430-1
小米 MiClaw 团队新推出的系统输入法存在严重安全疏忽。网友测试发现,只需疯狂点击输入法的版本号即可打开调试页面,页面中直接暴露了 AI 服务的 API 调用地址、API Key、模型提供商和模型名称,均以明文写入代码。
泄露的 API 地址指向字节跳动旗下云服务平台火山引擎的 Ark 接口,使用的模型为豆包系列的 doubao-seed-1-6-lite-251015。从提示词来看,该 AI 功能用于语音输入后处理,负责修正语音识别文本中的错别字、语法错误并添加标点。网友测试确认密钥真实有效,可在外部平台直接调用,目前小米疑似已更换密钥。
反编译代码还暴露了工程质量问题:开发者用
if ("固定字符串".length() > 0) 的方式判断一个永远为真的硬编码字符串是否非空,这种写法不会出现在任何正常的代码审查流程中。此外,小米在 GitHub 开源项目 mone 的代码提交中也被发现明文写入了 AI 公司月之暗面(Moonshot)的 API 密钥,提交时间为 2025 年 1 月,此后未见变动记录。
信源:https://www.nodeseek.com/post-669430-1
逆向拆解Claude Code发现两个缓存Bug,可无声推高API成本10-20倍
一名开发者通过 Ghidra、MITM 代理和 radare2 逆向拆解了 Claude Code 独立安装版的 228MB 二进制文件,发现两个独立的缓存 Bug,可在用户不知情的情况下将 API 成本推高 10-20 倍。相关分析已提交至 GitHub(issue #40524),被 Anthropic 标记为回归 Bug 并指派处理。
第一个 Bug 存在于独立安装版使用的定制 Bun 运行时中。每次 API 请求时,运行时会在请求体中查找一个计费标识符并替换,但替换逻辑命中的是请求体中的第一个匹配项。如果对话历史恰好包含该字符串(比如讨论过 Claude Code 内部计费机制),替换就会命中消息内容而非系统提示词,导致每次请求都触发缓存全量重建。临时规避方法是改用
第二个 Bug 影响所有使用
该开发者估算,对于约 50 万 token 的长对话,Bug 1 每次请求额外消耗约 0.04 美元,Bug 2 每次恢复额外消耗约 0.15 美元,两者叠加单次请求成本可超 0.20 美元。此前 Anthropic 工程师 Lydia Hallie 已确认用户触达用量限制的速度「远快于预期」,Reddit 评论区多名用户认为这两个缓存 Bug 可能是用量异常消耗的根本原因之一。
信源:https://www.reddit.com/r/ClaudeAI/comments/1s7mkn3/psa_claude_code_has_two_cache_bugs_that_can/
一名开发者通过 Ghidra、MITM 代理和 radare2 逆向拆解了 Claude Code 独立安装版的 228MB 二进制文件,发现两个独立的缓存 Bug,可在用户不知情的情况下将 API 成本推高 10-20 倍。相关分析已提交至 GitHub(issue #40524),被 Anthropic 标记为回归 Bug 并指派处理。
第一个 Bug 存在于独立安装版使用的定制 Bun 运行时中。每次 API 请求时,运行时会在请求体中查找一个计费标识符并替换,但替换逻辑命中的是请求体中的第一个匹配项。如果对话历史恰好包含该字符串(比如讨论过 Claude Code 内部计费机制),替换就会命中消息内容而非系统提示词,导致每次请求都触发缓存全量重建。临时规避方法是改用
npx @anthropic-ai/claude-code 运行,npm 包版本不含这段替换逻辑。第二个 Bug 影响所有使用
--resume 或 --continue 恢复会话的用户,自 v2.1.69 起引入。恢复会话时,系统附加信息的注入位置与新建会话不同,导致缓存前缀完全不匹配,整段对话历史从缓存读取变为全量重写。后续轮次恢复正常,但恢复操作本身已产生大量额外开销,目前无外部规避方案。该开发者估算,对于约 50 万 token 的长对话,Bug 1 每次请求额外消耗约 0.04 美元,Bug 2 每次恢复额外消耗约 0.15 美元,两者叠加单次请求成本可超 0.20 美元。此前 Anthropic 工程师 Lydia Hallie 已确认用户触达用量限制的速度「远快于预期」,Reddit 评论区多名用户认为这两个缓存 Bug 可能是用量异常消耗的根本原因之一。
信源:https://www.reddit.com/r/ClaudeAI/comments/1s7mkn3/psa_claude_code_has_two_cache_bugs_that_can/
Hermes Agent v0.6.0:新增飞书和企业微信,可作为MCP服务器接入IDE
开源 AI 模型机构 Nous Research 发布多平台 AI Agent 框架 Hermes Agent v0.6.0,GitHub 仓库已有 1.88 万星。该框架可将 AI Agent 接入 Telegram、Discord、Slack、WhatsApp、飞书、企业微信等多个即时通讯平台,支持 CLI 和网关两种运行模式。
本次更新的主要新功能:
1. 多实例配置(Profiles):同一安装可运行多个隔离的 Agent 实例,各自拥有独立的配置、记忆、会话和技能,凭证锁机制防止两个实例共用同一 bot 账号
2. MCP 服务器模式:通过
3. 飞书/Lark 适配器:支持事件订阅、消息卡片、群聊、图片/文件附件和交互式卡片回调
4. 企业微信适配器:支持文本、图片、语音消息和群聊
5. 推理服务商自动故障转移:配置多个服务商后,主服务商出错时自动切换到下一个
6. Slack 多工作区 OAuth:单个网关实例可同时连接多个 Slack 工作区
7. Telegram Webhook 模式:替代轮询方式,适合生产环境部署
8. 官方 Docker 容器:支持 CLI 和网关模式
release notes 显示,此次更新合并了 95 个 PR,解决了 16 个 issue,开发周期为 2 天。
信源:https://github.com/NousResearch/hermes-agent/releases/tag/v2026.3.30
开源 AI 模型机构 Nous Research 发布多平台 AI Agent 框架 Hermes Agent v0.6.0,GitHub 仓库已有 1.88 万星。该框架可将 AI Agent 接入 Telegram、Discord、Slack、WhatsApp、飞书、企业微信等多个即时通讯平台,支持 CLI 和网关两种运行模式。
本次更新的主要新功能:
1. 多实例配置(Profiles):同一安装可运行多个隔离的 Agent 实例,各自拥有独立的配置、记忆、会话和技能,凭证锁机制防止两个实例共用同一 bot 账号
2. MCP 服务器模式:通过
hermes mcp serve 将会话和消息暴露给任何 MCP 兼容客户端(Claude Desktop、Cursor、VS Code 等),支持 stdio 和 Streamable HTTP 两种传输方式3. 飞书/Lark 适配器:支持事件订阅、消息卡片、群聊、图片/文件附件和交互式卡片回调
4. 企业微信适配器:支持文本、图片、语音消息和群聊
5. 推理服务商自动故障转移:配置多个服务商后,主服务商出错时自动切换到下一个
6. Slack 多工作区 OAuth:单个网关实例可同时连接多个 Slack 工作区
7. Telegram Webhook 模式:替代轮询方式,适合生产环境部署
8. 官方 Docker 容器:支持 CLI 和网关模式
release notes 显示,此次更新合并了 95 个 PR,解决了 16 个 issue,开发周期为 2 天。
信源:https://github.com/NousResearch/hermes-agent/releases/tag/v2026.3.30
从拦更新到直接下架:苹果把Anything踢出App Store
《The Information》援引 Anything 方面的说法称,苹果已将 AI 应用生成平台 Anything 从 App Store 下架。这比苹果此前对同类 vibe coding 应用主要拦截更新更进一步,动作已从「不让更新」升级为「直接移除已上架应用」。
苹果给出的理由是违反 App Store 审核规则 2.5.2。苹果官方规则显示,应用必须保持「自包含」,不得下载、安装或执行会引入或改变应用功能的代码。
Replit 和 Bitrig 仍留在 App Store,但更新继续被拦。Anything 方面还表示,如果无法与苹果解决分歧,公司可能转向安卓。
信源:https://www.theinformation.com/articles/apple-kicks-vibe-coding-app-app-store-escalating-crackdown?rc=p2bxcy
《The Information》援引 Anything 方面的说法称,苹果已将 AI 应用生成平台 Anything 从 App Store 下架。这比苹果此前对同类 vibe coding 应用主要拦截更新更进一步,动作已从「不让更新」升级为「直接移除已上架应用」。
苹果给出的理由是违反 App Store 审核规则 2.5.2。苹果官方规则显示,应用必须保持「自包含」,不得下载、安装或执行会引入或改变应用功能的代码。
Replit 和 Bitrig 仍留在 App Store,但更新继续被拦。Anything 方面还表示,如果无法与苹果解决分歧,公司可能转向安卓。
信源:https://www.theinformation.com/articles/apple-kicks-vibe-coding-app-app-store-escalating-crackdown?rc=p2bxcy
千万美元广告费收不回token成本:Amp取消AI编程免费层广告
Sourcegraph 旗下 AI 编程 Agent Amp 宣布,Free 版用户将不再看到广告,每天 $10 的免费使用额度大多数用户保留,部分低活跃用户的额度将被暂停。
Amp 的免费层结构是:用户每天获得 $10 的 frontier token 额度,同时看广告,广告收入用于覆盖这笔 token 成本。广告于 2025 年 10 月引入,年化营收很快超过 1000 万美元,但 2025 年 11 月下旬 Gemini 3 Pro、Opus 4.5、GPT-5.2 Codex 相继发布后,用户 token 消耗持续走高,广告收入已无法覆盖这笔成本,Amp 称消耗「只会继续增加」。竞争层面,OpenAI 的 $20/月订阅据其官方说法可获得价值超 1000 美元的 token,也让广告支撑免费层的吸引力进一步下降。
未来,免费额度将向使用最新版本和推荐工作流的活跃用户倾斜,Amp 表示会在调整前提前告知。
结果是:活跃免费用户反而占了便宜,$10/天的额度保留,广告消失。Amp 放弃了广告这条收入来源,转而用免费额度筛选潜在付费用户。
信源:https://ampcode.com/news/amp-free-is-ad-free
Sourcegraph 旗下 AI 编程 Agent Amp 宣布,Free 版用户将不再看到广告,每天 $10 的免费使用额度大多数用户保留,部分低活跃用户的额度将被暂停。
Amp 的免费层结构是:用户每天获得 $10 的 frontier token 额度,同时看广告,广告收入用于覆盖这笔 token 成本。广告于 2025 年 10 月引入,年化营收很快超过 1000 万美元,但 2025 年 11 月下旬 Gemini 3 Pro、Opus 4.5、GPT-5.2 Codex 相继发布后,用户 token 消耗持续走高,广告收入已无法覆盖这笔成本,Amp 称消耗「只会继续增加」。竞争层面,OpenAI 的 $20/月订阅据其官方说法可获得价值超 1000 美元的 token,也让广告支撑免费层的吸引力进一步下降。
未来,免费额度将向使用最新版本和推荐工作流的活跃用户倾斜,Amp 表示会在调整前提前告知。
结果是:活跃免费用户反而占了便宜,$10/天的额度保留,广告消失。Amp 放弃了广告这条收入来源,转而用免费额度筛选潜在付费用户。
信源:https://ampcode.com/news/amp-free-is-ad-free
B站内测AI视频创作工具 Updream,支持技能调用与项目管理,需邀请码注册
哔哩哔哩正在内测名为 Updream 的 AI 视频创作工具,专为视频内容创作打造。目前处于邀请码阶段,UP 主须完成官方问卷并通过审核后获得邀请码和积分,产品尚未对外公开。
工具已有网页版,登录后核心界面以「灵感从这里开始」为提示,支持输入创意想法并调用 Skill,另设技能社区及项目管理功能。由于仍处内测,产品具体情况以官方公布为准。
Updream 的出现是哔哩哔哩董事长兼 CEO 陈睿兑现承诺的最新进展。2025 年第三季度财报会上,陈睿表示公司将专注做视频 AI 解决方案,利用 AI 辅助创作者产出更多更好的内容,并称「中国最好的讲 AI 的 UP 主和最对 AI 感兴趣的用户都聚集在 B 站」。当季每月有近 10 万个 AI 相关 UP 主在站内活跃,AI 内容日均投稿量同比增长 83%。
信源:https://mp.weixin.qq.com/s/fsFOHhb1UphULhE6r8dgIA
哔哩哔哩正在内测名为 Updream 的 AI 视频创作工具,专为视频内容创作打造。目前处于邀请码阶段,UP 主须完成官方问卷并通过审核后获得邀请码和积分,产品尚未对外公开。
工具已有网页版,登录后核心界面以「灵感从这里开始」为提示,支持输入创意想法并调用 Skill,另设技能社区及项目管理功能。由于仍处内测,产品具体情况以官方公布为准。
Updream 的出现是哔哩哔哩董事长兼 CEO 陈睿兑现承诺的最新进展。2025 年第三季度财报会上,陈睿表示公司将专注做视频 AI 解决方案,利用 AI 辅助创作者产出更多更好的内容,并称「中国最好的讲 AI 的 UP 主和最对 AI 感兴趣的用户都聚集在 B 站」。当季每月有近 10 万个 AI 相关 UP 主在站内活跃,AI 内容日均投稿量同比增长 83%。
信源:https://mp.weixin.qq.com/s/fsFOHhb1UphULhE6r8dgIA
马斯克称Grok Imagine对xAI毛利为正,视频是通往AGI的关键工具
马斯克在 X 上发文称,AI 的未来主要在于视频理解和生成,「因为光子是迄今为止带宽最高的通信形式,这些是通往 AGI 的关键工具」,并称 xAI 旗下图像生成工具 Grok Imagine「毛利为正,不是亏钱项目」。
这一表态的背景是 OpenAI 上周宣布关停 AI 视频平台 Sora。据 WSJ 和多家媒体报道,Sora 自去年 9 月上线以来累计收入约 210 万美元,日均运营亏损据报约 100 万美元,OpenAI 同时终止了与迪士尼价值 10 亿美元的合作协议。
马斯克未披露 Grok Imagine 的具体收入数字。他此前在 3 月 25 日曾表示「下一版 Grok Imagine 会非常出色,我们正在加倍投入」,并称其「是一个比人们意识到的更重要的工具」。
信源:https://x.com/elonmusk/status/2038756516048916578
马斯克在 X 上发文称,AI 的未来主要在于视频理解和生成,「因为光子是迄今为止带宽最高的通信形式,这些是通往 AGI 的关键工具」,并称 xAI 旗下图像生成工具 Grok Imagine「毛利为正,不是亏钱项目」。
这一表态的背景是 OpenAI 上周宣布关停 AI 视频平台 Sora。据 WSJ 和多家媒体报道,Sora 自去年 9 月上线以来累计收入约 210 万美元,日均运营亏损据报约 100 万美元,OpenAI 同时终止了与迪士尼价值 10 亿美元的合作协议。
马斯克未披露 Grok Imagine 的具体收入数字。他此前在 3 月 25 日曾表示「下一版 Grok Imagine 会非常出色,我们正在加倍投入」,并称其「是一个比人们意识到的更重要的工具」。
信源:https://x.com/elonmusk/status/2038756516048916578
axios遭供应链攻击:两个新版本引入恶意依赖,建议立即回滚
供应链安全公司 Socket 研究团队今日披露,被广泛使用的 JavaScript HTTP 请求库 axios 遭遇供应链攻击。两个新发布的版本(v1.14.1 和 v0.30.4)均包含恶意依赖,且这两个版本未出现在 axios 官方 GitHub Release 历史中,偏离了该项目的正常发布流程。
两个版本均引入了恶意包 `plain-crypto-js@4.2.1`。该恶意包于 3 月 30 日 23:59:12 UTC 发布,Socket 的自动化检测在约 6 分钟后将其标记。Socket 指出,这一时间与 axios 新版本发布高度吻合,表明恶意依赖是配合 axios 发布协调投放的。恶意包关联的 npm 账号为 `jasonsaayman`,Socket 称这引发了对「未经授权发布或账号遭入侵」的担忧。
Socket 建议开发者立即检查项目依赖和 lockfile 中是否包含
信源:https://socket.dev/blog/axios-npm-package-compromised
供应链安全公司 Socket 研究团队今日披露,被广泛使用的 JavaScript HTTP 请求库 axios 遭遇供应链攻击。两个新发布的版本(v1.14.1 和 v0.30.4)均包含恶意依赖,且这两个版本未出现在 axios 官方 GitHub Release 历史中,偏离了该项目的正常发布流程。
两个版本均引入了恶意包 `plain-crypto-js@4.2.1`。该恶意包于 3 月 30 日 23:59:12 UTC 发布,Socket 的自动化检测在约 6 分钟后将其标记。Socket 指出,这一时间与 axios 新版本发布高度吻合,表明恶意依赖是配合 axios 发布协调投放的。恶意包关联的 npm 账号为 `jasonsaayman`,Socket 称这引发了对「未经授权发布或账号遭入侵」的担忧。
Socket 建议开发者立即检查项目依赖和 lockfile 中是否包含
axios@1.14.1`、`axios@0.30.4 或 `plain-crypto-js@4.2.1`,如有发现立即回滚至已知安全版本。事件仍在持续调查中。信源:https://socket.dev/blog/axios-npm-package-compromised
AI自动优化执行框架让Haiku4.5终端成绩排第一:林俊旸称这正是他预判的「环境设计」转折
斯坦福、MIT 和韩国游戏公司 KRAFTON 的研究者发布 Meta-Harness,一套让 AI 自动优化执行框架(harness,即包裹模型、驱动 Agent 行动的执行脚手架,涵盖提示词设计、工具调用和上下文管理)的方法。不同于人工手写的执行框架,Meta-Harness 让一个编码 Agent 读取历次候选框架的代码、执行日志和评分,自动迭代优化。
在终端操作基准 TerminalBench-2 上,Meta-Harness 将 Claude Haiku 4.5 的通过率做到 37.6%,超过 Goose(35.5%)和 Claude Code(27.5%),在所有已报告的 Haiku 4.5 执行框架中排第一。在 Claude Opus 4.6 上通过率 76.4%,排第二。
前通义千问技术负责人林俊旸转发论文作者的帖子并评论:「模型加执行框架」已超过「只看模型」,Agent 表现会被框架的设计和质量显著影响,「我确实认为这是一个正确的方向」。林俊旸在 3 月 27 日发布的长文(目前已删除)中就预判,环境设计将从副项目变成真正的创业品类。Meta-Harness 用实验数据印证了这个判断:同一模型,换一套 AI 优化过的执行框架,成绩差距可达 10 个百分点。
信源:https://x.com/JustinLin610/status/2038783276937310582
斯坦福、MIT 和韩国游戏公司 KRAFTON 的研究者发布 Meta-Harness,一套让 AI 自动优化执行框架(harness,即包裹模型、驱动 Agent 行动的执行脚手架,涵盖提示词设计、工具调用和上下文管理)的方法。不同于人工手写的执行框架,Meta-Harness 让一个编码 Agent 读取历次候选框架的代码、执行日志和评分,自动迭代优化。
在终端操作基准 TerminalBench-2 上,Meta-Harness 将 Claude Haiku 4.5 的通过率做到 37.6%,超过 Goose(35.5%)和 Claude Code(27.5%),在所有已报告的 Haiku 4.5 执行框架中排第一。在 Claude Opus 4.6 上通过率 76.4%,排第二。
前通义千问技术负责人林俊旸转发论文作者的帖子并评论:「模型加执行框架」已超过「只看模型」,Agent 表现会被框架的设计和质量显著影响,「我确实认为这是一个正确的方向」。林俊旸在 3 月 27 日发布的长文(目前已删除)中就预判,环境设计将从副项目变成真正的创业品类。Meta-Harness 用实验数据印证了这个判断:同一模型,换一套 AI 优化过的执行框架,成绩差距可达 10 个百分点。
信源:https://x.com/JustinLin610/status/2038783276937310582
RL微调让4B模型金融问答超越235B:Snorkel AI开源FinQA训练环境
Snorkel AI 发布 FinQA,一个基于真实 SEC 10-K 财务文件构建的强化学习训练环境,现已开源于 Meta PyTorch 与 Hugging Face 联合维护的 OpenEnv 平台。FinQA 覆盖 22 家上市公司(包括 Alphabet、亚马逊、苹果、美国银行、波音)的 290 道专家标注财务问答,向 Agent 提供 4 个 MCP 工具:列出可用财务表、获取表结构、执行 SQL 查询、提交答案。SQL 强制要求过滤条件且禁止 `SELECT *`,迫使 Agent 只取所需数据,而非倾倒整张表。
Snorkel AI 与加州大学伯克利分校 rLLM 团队合作,用 FinQA 对 Qwen3-4B 进行强化学习微调,结果在金融问答基准 SnorkelFinance 上得分 59.7%,超过同系列 Qwen3-235B(51.37%),参数量约为后者的 1/60,推理成本降约 90%。关键发现:大模型能推理,但会产生幻觉列名、无视 SQL 约束;RL 训练后的小模型反而能精准调用工具,「工具纪律」而非规模才是瓶颈。
FinQA 是 Snorkel AI 在 OpenEnv 发布的首个开源环境,后续将推出覆盖医疗、保险、法律等行业的多轮次企业环境。
信源:https://snorkel.ai/blog/building-finqa-an-open-rl-environment-for-financial-reasoning-agents/
Snorkel AI 发布 FinQA,一个基于真实 SEC 10-K 财务文件构建的强化学习训练环境,现已开源于 Meta PyTorch 与 Hugging Face 联合维护的 OpenEnv 平台。FinQA 覆盖 22 家上市公司(包括 Alphabet、亚马逊、苹果、美国银行、波音)的 290 道专家标注财务问答,向 Agent 提供 4 个 MCP 工具:列出可用财务表、获取表结构、执行 SQL 查询、提交答案。SQL 强制要求过滤条件且禁止 `SELECT *`,迫使 Agent 只取所需数据,而非倾倒整张表。
Snorkel AI 与加州大学伯克利分校 rLLM 团队合作,用 FinQA 对 Qwen3-4B 进行强化学习微调,结果在金融问答基准 SnorkelFinance 上得分 59.7%,超过同系列 Qwen3-235B(51.37%),参数量约为后者的 1/60,推理成本降约 90%。关键发现:大模型能推理,但会产生幻觉列名、无视 SQL 约束;RL 训练后的小模型反而能精准调用工具,「工具纪律」而非规模才是瓶颈。
FinQA 是 Snorkel AI 在 OpenEnv 发布的首个开源环境,后续将推出覆盖医疗、保险、法律等行业的多轮次企业环境。
信源:https://snorkel.ai/blog/building-finqa-an-open-rl-environment-for-financial-reasoning-agents/
微软Researcher在Perplexity自研基准上胜出:双模型评审进Frontier,Cowork同步开放长任务代理
微软通过 Frontier(企业用户预发布尝鲜计划,参与者可提前试用尚未正式上线的 Copilot 功能)同步开放两项 Microsoft 365 Copilot 新能力。
Researcher(Copilot 内置的深度研究 Agent)新增 Critique 和 Council 两种多模型协作模式。Critique 由 Anthropic 与 OpenAI 旗下模型协作:一个负责规划、检索和起草,另一个专门审核与精修,选中 Auto 时默认启用;Council 同样并行运行两家模型,各自生成完整报告,再由单独的评审模型汇总异同。微软使用 GPT-5.2 作为评判模型(原论文三种评判方法中最严格的一种),在 DRACO 基准(由 Perplexity 研究者发布的 100 道复杂研究题,覆盖 10 个领域)上测试 Critique,综合得分较基准中最优系统 Perplexity Deep Research(使用 Claude Opus 4.6)高 7.0 分,相对提升 13.88%。DRACO 原论文未收录 Critique,这是微软按相同评测协议自行测试所得的数据。
Copilot Cowork 面向更长的多步骤工作:先根据目标生成计划,再跨工具和文件逐步推进,过程中显示进度,用户可随时介入。微软以 Capital Group 为早期试用案例,称其已用于项目规划、排期、制作交付物和准备高管复盘。
信源:https://techcommunity.microsoft.com/blog/microsoft365copilotblog/introducing-multi-model-intelligence-in-researcher/4506011
微软通过 Frontier(企业用户预发布尝鲜计划,参与者可提前试用尚未正式上线的 Copilot 功能)同步开放两项 Microsoft 365 Copilot 新能力。
Researcher(Copilot 内置的深度研究 Agent)新增 Critique 和 Council 两种多模型协作模式。Critique 由 Anthropic 与 OpenAI 旗下模型协作:一个负责规划、检索和起草,另一个专门审核与精修,选中 Auto 时默认启用;Council 同样并行运行两家模型,各自生成完整报告,再由单独的评审模型汇总异同。微软使用 GPT-5.2 作为评判模型(原论文三种评判方法中最严格的一种),在 DRACO 基准(由 Perplexity 研究者发布的 100 道复杂研究题,覆盖 10 个领域)上测试 Critique,综合得分较基准中最优系统 Perplexity Deep Research(使用 Claude Opus 4.6)高 7.0 分,相对提升 13.88%。DRACO 原论文未收录 Critique,这是微软按相同评测协议自行测试所得的数据。
Copilot Cowork 面向更长的多步骤工作:先根据目标生成计划,再跨工具和文件逐步推进,过程中显示进度,用户可随时介入。微软以 Capital Group 为早期试用案例,称其已用于项目规划、排期、制作交付物和准备高管复盘。
信源:https://techcommunity.microsoft.com/blog/microsoft365copilotblog/introducing-multi-model-intelligence-in-researcher/4506011
Ollama以MLX重建Apple Silicon推理引擎:decode速度近翻倍,已适配Claude Code
Ollama 发布 0.19 预览版,以苹果机器学习框架 MLX 重建了 Apple Silicon 上的推理引擎,利用统一内存架构提升性能,并在 M5/M5 Pro/M5 Max 芯片上调用 GPU 神经网络加速器同时优化首 token 延迟和生成速度。
3 月 29 日的基准测试在 M5 系列芯片上运行 Qwen3.5-35B-A3B 模型(英伟达 NVFP4 量化),与 Ollama 0.18 相比:prefill 速度从 1154 tokens/s 提升至 1810 tokens/s,decode 速度从 58 tokens/s 提升至 112 tokens/s,接近翻倍。改用 int4 精度时,prefill 可进一步达到 1851 tokens/s,decode 达 134 tokens/s。
0.19 版同步新增对英伟达 NVFP4 量化格式的支持。NVFP4 是一种在降低内存带宽和存储占用的同时保持模型精度的量化方式,与英伟达 Model Optimizer 优化的模型兼容,也与主流云端推理服务商的生产环境保持格式一致。缓存系统同步升级,支持跨会话复用(使用 Claude Code 等工具时,共享系统提示词可获得更多缓存命中)、在提示词关键位置存储快照以减少重复处理,以及更智能的缓存淘汰策略。
此预览版需要 32GB 以上统一内存的 Mac,当前专为编程任务调优的模型为 Qwen3.5-35B-A3B,可通过
信源:https://ollama.com/blog/mlx
Ollama 发布 0.19 预览版,以苹果机器学习框架 MLX 重建了 Apple Silicon 上的推理引擎,利用统一内存架构提升性能,并在 M5/M5 Pro/M5 Max 芯片上调用 GPU 神经网络加速器同时优化首 token 延迟和生成速度。
3 月 29 日的基准测试在 M5 系列芯片上运行 Qwen3.5-35B-A3B 模型(英伟达 NVFP4 量化),与 Ollama 0.18 相比:prefill 速度从 1154 tokens/s 提升至 1810 tokens/s,decode 速度从 58 tokens/s 提升至 112 tokens/s,接近翻倍。改用 int4 精度时,prefill 可进一步达到 1851 tokens/s,decode 达 134 tokens/s。
0.19 版同步新增对英伟达 NVFP4 量化格式的支持。NVFP4 是一种在降低内存带宽和存储占用的同时保持模型精度的量化方式,与英伟达 Model Optimizer 优化的模型兼容,也与主流云端推理服务商的生产环境保持格式一致。缓存系统同步升级,支持跨会话复用(使用 Claude Code 等工具时,共享系统提示词可获得更多缓存命中)、在提示词关键位置存储快照以减少重复处理,以及更智能的缓存淘汰策略。
此预览版需要 32GB 以上统一内存的 Mac,当前专为编程任务调优的模型为 Qwen3.5-35B-A3B,可通过
ollama launch claude --model qwen3.5:35b-a3b-coding-nvfp4 接入 Claude Code。信源:https://ollama.com/blog/mlx
英国AI推理芯片初创Fractile寻求融资逾2亿美元,估值10亿美元
FT 援引知情人士称,伦敦芯片初创公司 Fractile 正与风险投资机构 Accel 等投资方洽谈新一轮融资,目标融资额逾2亿美元,估值约10亿美元。
Fractile 成立于2022年,CEO Walter Goodwin 持牛津大学博士学位,团队汇聚英伟达、Imagination Technologies 及 Graphcore 的前工程师。公司此前完成约1500万美元种子轮,投资方包括北约创新基金和前英特尔 CEO Pat Gelsinger。与英伟达 GPU 不同,Fractile 的 AI 芯片采用静态随机存取存储器(SRAM),主打 AI 推理场景的速度与成本优化,软硬件并举。公司上月宣布未来三年在伦敦和布里斯托投入1亿英镑,新建工业硬件工程设施。
英国 AI 芯片领域近来融资密集:一个月前,英国 AI 芯片初创 Olix 完成2.2亿美元融资。
信源:https://www.ft.com/content/07590da1-ee27-421f-b60a-387f8c6f4b61
FT 援引知情人士称,伦敦芯片初创公司 Fractile 正与风险投资机构 Accel 等投资方洽谈新一轮融资,目标融资额逾2亿美元,估值约10亿美元。
Fractile 成立于2022年,CEO Walter Goodwin 持牛津大学博士学位,团队汇聚英伟达、Imagination Technologies 及 Graphcore 的前工程师。公司此前完成约1500万美元种子轮,投资方包括北约创新基金和前英特尔 CEO Pat Gelsinger。与英伟达 GPU 不同,Fractile 的 AI 芯片采用静态随机存取存储器(SRAM),主打 AI 推理场景的速度与成本优化,软硬件并举。公司上月宣布未来三年在伦敦和布里斯托投入1亿英镑,新建工业硬件工程设施。
英国 AI 芯片领域近来融资密集:一个月前,英国 AI 芯片初创 Olix 完成2.2亿美元融资。
信源:https://www.ft.com/content/07590da1-ee27-421f-b60a-387f8c6f4b61
字节AI编程工具Trae旗下SOLO上线桌面端和网页端,今日启动内测
字节跳动旗下 AI 编程工具 Trae 的 Agent 产品 SOLO,今日推出桌面端和网页端,启动内测。
SOLO 提供双模式智能体:Code 模式专注编程开发场景,MTC 模式支持写方案、数据分析等通用任务,可供研发、产品、数据、运营等多角色使用。新版本采用三栏工作区,依托云端算力支持多个任务同时并行运行,SOLO 自动拆解任务并调用工具完成执行,用户只需提交需求和验收结果。支持处理 JSON、Python、PPTX、CSV 等多种文件格式,产出直接在工具面板展示。桌面端目前仅支持 macOS。中国版可在 trae.cn 下载,国际版网页端入口为 solo.trae.ai,两版均需邀请码,限时免费开放。
信源:https://mp.weixin.qq.com/s/iN0LUDIGsYeetq_wn1Q8FA
字节跳动旗下 AI 编程工具 Trae 的 Agent 产品 SOLO,今日推出桌面端和网页端,启动内测。
SOLO 提供双模式智能体:Code 模式专注编程开发场景,MTC 模式支持写方案、数据分析等通用任务,可供研发、产品、数据、运营等多角色使用。新版本采用三栏工作区,依托云端算力支持多个任务同时并行运行,SOLO 自动拆解任务并调用工具完成执行,用户只需提交需求和验收结果。支持处理 JSON、Python、PPTX、CSV 等多种文件格式,产出直接在工具面板展示。桌面端目前仅支持 macOS。中国版可在 trae.cn 下载,国际版网页端入口为 solo.trae.ai,两版均需邀请码,限时免费开放。
信源:https://mp.weixin.qq.com/s/iN0LUDIGsYeetq_wn1Q8FA
❤1
Vercel工程师:CI绿灯不再等于生产安全,Agent代码的「假自信」正在扩大风险
Vercel 软件工程师 Matthew Binshtok 将一篇内部演讲整理后公开发布,核心论点是:Agent 生成的代码外表无懈可击,附带完整的 PR 描述、通过静态分析、符合代码规范,看起来出自有经验的工程师之手。但 Agent 对生产环境一无所知,不了解你的流量模式、故障模式,不知道 Redis 实例快满了,也不知道某个 feature flag 上线会改变下游系统的负载分布。CI 通过,只是说明 Agent 说服了你的流水线,不等于代码在规模化生产中安全。
他把 Agent 使用分为两类:「依赖」是假设 Agent 写的代码只要测试通过就可以发布,作者从不建立对改动的心智模型,结果是大量隐含假设塞满 PR,没人真正理解代码在做什么;「利用」是用 Agent 快速迭代,同时对输出完全负责,清楚代码在高负载下如何表现。判断标准只有一个:如果这个 PR 引发了线上事故,你愿不愿意承担责任?
他的解法不是少用 Agent,而是把基础设施本身建得足够严格,让「快速发布」默认就是安全的:
- 自动化金丝雀发布:出现退化自动回滚,不依赖工程师盯仪表盘
- 持续验证:负载测试、混沌实验、灾备演练持续运行,而非只在部署时跑一次
- 可执行的操作规范:把
Binshtok 还披露 Vercel 正在落地的具体措施:部署流水线每个阶段加入运行时校验、PR 阶段加强 feature flag 的静态检查、用只读 Agent 持续审查生成性 Agent 的假设,以及用「缺陷提交率 vs 缺陷逃逸率」等指标量化风险变化。
信源:https://vercel.com/blog/agent-responsibly
Vercel 软件工程师 Matthew Binshtok 将一篇内部演讲整理后公开发布,核心论点是:Agent 生成的代码外表无懈可击,附带完整的 PR 描述、通过静态分析、符合代码规范,看起来出自有经验的工程师之手。但 Agent 对生产环境一无所知,不了解你的流量模式、故障模式,不知道 Redis 实例快满了,也不知道某个 feature flag 上线会改变下游系统的负载分布。CI 通过,只是说明 Agent 说服了你的流水线,不等于代码在规模化生产中安全。
他把 Agent 使用分为两类:「依赖」是假设 Agent 写的代码只要测试通过就可以发布,作者从不建立对改动的心智模型,结果是大量隐含假设塞满 PR,没人真正理解代码在做什么;「利用」是用 Agent 快速迭代,同时对输出完全负责,清楚代码在高负载下如何表现。判断标准只有一个:如果这个 PR 引发了线上事故,你愿不愿意承担责任?
他的解法不是少用 Agent,而是把基础设施本身建得足够严格,让「快速发布」默认就是安全的:
- 自动化金丝雀发布:出现退化自动回滚,不依赖工程师盯仪表盘
- 持续验证:负载测试、混沌实验、灾备演练持续运行,而非只在部署时跑一次
- 可执行的操作规范:把
safe-rollout 这类知识写成可运行的工具,而非 Notion 文档,Agent 可自主调用Binshtok 还披露 Vercel 正在落地的具体措施:部署流水线每个阶段加入运行时校验、PR 阶段加强 feature flag 的静态检查、用只读 Agent 持续审查生成性 Agent 的假设,以及用「缺陷提交率 vs 缺陷逃逸率」等指标量化风险变化。
信源:https://vercel.com/blog/agent-responsibly
破解比特币只需9分钟?谷歌量子团队将攻击门槛降低20倍,用零知识证明隐藏方法
谷歌量子 AI 团队发布白皮书,展示了对 Shor 算法的重大优化。Shor 算法能破解比特币和以太坊所使用的椭圆曲线加密,一旦量子计算机足够强大,攻击者就能从公钥反推出私钥并窃取资金。团队编译了两套攻击电路,分别需要不到 1200 和不到 1450 个逻辑量子比特(由数百个物理量子比特经纠错组成的计算单元)。在超导量子计算机上,两套电路均可在不到 50 万个物理量子比特的条件下于数分钟内完成计算。此前学界的主流估计约为 1000 万个物理量子比特,这一突破将门槛降低了约 20 倍。
攻击者可以提前完成大部分准备计算,在比特币交易广播后约 9 分钟内破解私钥。比特币平均出块时间约 10 分钟,攻击者有约 41% 的概率抢在交易确认前劫持资金。目前约 690 万枚比特币(约占总供应量的三分之一)因公钥已暴露而面临潜在风险,其中约 170 万枚来自网络早期。谷歌还指出,2021 年的 Taproot 升级默认暴露公钥,可能进一步扩大脆弱钱包的范围。
团队没有公开攻击电路的具体实现,而是发布了零知识证明,允许第三方验证结论正确性而不泄露攻击方法。谷歌量子算法研究总监 Ryan Babbush 和谷歌量子 AI 工程副总裁 Hartmut Neven 表示,团队在发布前已与美国政府沟通,目前正与 Coinbase、斯坦福区块链研究院和以太坊基金会协作推进后量子迁移。谷歌此前已设定 2029 年为其自身认证服务向抗量子加密迁移的期限。Castle Island Ventures 联合创始人 Nic Carter 称这篇论文「非常令人警醒」,并写道:「椭圆曲线加密正处于过时的边缘。无论是 3 年还是 10 年,它已经结束了,我们需要接受这一点。」
信源:https://research.google/blog/safeguarding-cryptocurrency-by-disclosing-quantum-vulnerabilities-responsibly/
谷歌量子 AI 团队发布白皮书,展示了对 Shor 算法的重大优化。Shor 算法能破解比特币和以太坊所使用的椭圆曲线加密,一旦量子计算机足够强大,攻击者就能从公钥反推出私钥并窃取资金。团队编译了两套攻击电路,分别需要不到 1200 和不到 1450 个逻辑量子比特(由数百个物理量子比特经纠错组成的计算单元)。在超导量子计算机上,两套电路均可在不到 50 万个物理量子比特的条件下于数分钟内完成计算。此前学界的主流估计约为 1000 万个物理量子比特,这一突破将门槛降低了约 20 倍。
攻击者可以提前完成大部分准备计算,在比特币交易广播后约 9 分钟内破解私钥。比特币平均出块时间约 10 分钟,攻击者有约 41% 的概率抢在交易确认前劫持资金。目前约 690 万枚比特币(约占总供应量的三分之一)因公钥已暴露而面临潜在风险,其中约 170 万枚来自网络早期。谷歌还指出,2021 年的 Taproot 升级默认暴露公钥,可能进一步扩大脆弱钱包的范围。
团队没有公开攻击电路的具体实现,而是发布了零知识证明,允许第三方验证结论正确性而不泄露攻击方法。谷歌量子算法研究总监 Ryan Babbush 和谷歌量子 AI 工程副总裁 Hartmut Neven 表示,团队在发布前已与美国政府沟通,目前正与 Coinbase、斯坦福区块链研究院和以太坊基金会协作推进后量子迁移。谷歌此前已设定 2029 年为其自身认证服务向抗量子加密迁移的期限。Castle Island Ventures 联合创始人 Nic Carter 称这篇论文「非常令人警醒」,并写道:「椭圆曲线加密正处于过时的边缘。无论是 3 年还是 10 年,它已经结束了,我们需要接受这一点。」
信源:https://research.google/blog/safeguarding-cryptocurrency-by-disclosing-quantum-vulnerabilities-responsibly/
仅需1万个量子比特,690万枚休眠比特币面临「开盒」倒计时
谷歌量子 AI 白皮书发布同日,中性原子量子计算初创公司 Oratomic 在 arXiv 上发表论文,称仅需约 1 万个可重构原子量子比特即可在密码学相关规模上运行 Shor 算法。这篇论文直接以谷歌优化后的低深度 Shor 电路为输入,在此基础上优化了量子计算栈的另一层:谷歌压缩的是算法所需的逻辑量子比特数(从数千降到约 1200 个),Oratomic 压缩的是每个逻辑量子比特所需的物理量子比特数。两层优化叠加,共同把破解加密所需的硬件规模推向了前所未有的低点。
Oratomic 的关键手段是用高编码率的 qLDPC 码替代传统的表面码。表面码是目前主流的量子纠错方案,谷歌的超导方案就用它,但编码效率低,每个逻辑量子比特需要约 400 个物理量子比特,总计约 50 万个。qLDPC 码的编码率约 30%,能用远更少的物理量子比特保护同样数量的逻辑量子比特,将总需求从百万量级压缩了约两个数量级。
论文给出了多组架构方案(假设稳定子测量周期为 1 毫秒):
1. 约 1 万个物理量子比特可运行 Shor 算法破解 256 位椭圆曲线加密(比特币和以太坊使用的加密方案),运行时间取决于并行度
2. 约 26,000 个物理量子比特配置下,破解椭圆曲线加密的运行时间约 10 天
3. 约 102,000 个物理量子比特配置下,破解 RSA-2048 的运行时间约 97 天
代价是速度:中性原子的时钟频率远低于超导方案,破解一次需要数天而非数分钟。但这并不意味着威胁更小。谷歌的超导方案(50 万量子比特,9 分钟)适合劫持正在广播的实时交易;Oratomic 的中性原子方案(1-2.6 万量子比特,数天)适合攻击公钥已暴露的休眠钱包,而这类攻击不需要抢时间。谷歌白皮书估计约 690 万枚比特币属于这一类。
硬件差距正在收窄。论文指出,中性原子实验已演示超过 6,100 个量子比特的物理捕获阵列,不过这些阵列尚未实现量子计算;具备容错计算能力的中性原子系统目前约为 500 个量子比特。从 500 个到论文所需的 1 万个,差距约 20 倍,远小于谷歌超导路线的约 5000 倍(当前约 100 个 vs 需要 50 万个)。论文作者来自 Oratomic,同时挂靠加州理工学院,成员包括量子计算权威 John Preskill 和 Manuel Endres,通讯作者为 Dolev Bluvstein。论文结尾称,后续硬件提速与纠错改进有望将运行时间再缩短一个数量级以上,甚至降至小时或分钟级别。
信源:https://arxiv.org/abs/2603.28627
谷歌量子 AI 白皮书发布同日,中性原子量子计算初创公司 Oratomic 在 arXiv 上发表论文,称仅需约 1 万个可重构原子量子比特即可在密码学相关规模上运行 Shor 算法。这篇论文直接以谷歌优化后的低深度 Shor 电路为输入,在此基础上优化了量子计算栈的另一层:谷歌压缩的是算法所需的逻辑量子比特数(从数千降到约 1200 个),Oratomic 压缩的是每个逻辑量子比特所需的物理量子比特数。两层优化叠加,共同把破解加密所需的硬件规模推向了前所未有的低点。
Oratomic 的关键手段是用高编码率的 qLDPC 码替代传统的表面码。表面码是目前主流的量子纠错方案,谷歌的超导方案就用它,但编码效率低,每个逻辑量子比特需要约 400 个物理量子比特,总计约 50 万个。qLDPC 码的编码率约 30%,能用远更少的物理量子比特保护同样数量的逻辑量子比特,将总需求从百万量级压缩了约两个数量级。
论文给出了多组架构方案(假设稳定子测量周期为 1 毫秒):
1. 约 1 万个物理量子比特可运行 Shor 算法破解 256 位椭圆曲线加密(比特币和以太坊使用的加密方案),运行时间取决于并行度
2. 约 26,000 个物理量子比特配置下,破解椭圆曲线加密的运行时间约 10 天
3. 约 102,000 个物理量子比特配置下,破解 RSA-2048 的运行时间约 97 天
代价是速度:中性原子的时钟频率远低于超导方案,破解一次需要数天而非数分钟。但这并不意味着威胁更小。谷歌的超导方案(50 万量子比特,9 分钟)适合劫持正在广播的实时交易;Oratomic 的中性原子方案(1-2.6 万量子比特,数天)适合攻击公钥已暴露的休眠钱包,而这类攻击不需要抢时间。谷歌白皮书估计约 690 万枚比特币属于这一类。
硬件差距正在收窄。论文指出,中性原子实验已演示超过 6,100 个量子比特的物理捕获阵列,不过这些阵列尚未实现量子计算;具备容错计算能力的中性原子系统目前约为 500 个量子比特。从 500 个到论文所需的 1 万个,差距约 20 倍,远小于谷歌超导路线的约 5000 倍(当前约 100 个 vs 需要 50 万个)。论文作者来自 Oratomic,同时挂靠加州理工学院,成员包括量子计算权威 John Preskill 和 Manuel Endres,通讯作者为 Dolev Bluvstein。论文结尾称,后续硬件提速与纠错改进有望将运行时间再缩短一个数量级以上,甚至降至小时或分钟级别。
信源:https://arxiv.org/abs/2603.28627
增速不减反增:Claude.ai3月访问量较2月增长86%
网站流量分析平台 Similarweb 数据显示,Claude.ai 3 月前 28 天的全球总访问量较整个 2 月增长 86%。图表显示 2 月总访问量约 2.8 亿次,3 月 1-28 日约 5.2 亿次,且月底三天数据尚未计入。
增长曲线仍在加速。此前美国银行 3 月初援引 Similarweb 数据称,Claude.ai 2 月访问量环比增长 63%,已是当月主流 AI 产品中增速最高的。3 月的 86% 意味着 Anthropic 的用户获取势头不仅未放缓,反而在提速。
信源:https://x.com/Similarweb/status/2038896001210097951
网站流量分析平台 Similarweb 数据显示,Claude.ai 3 月前 28 天的全球总访问量较整个 2 月增长 86%。图表显示 2 月总访问量约 2.8 亿次,3 月 1-28 日约 5.2 亿次,且月底三天数据尚未计入。
增长曲线仍在加速。此前美国银行 3 月初援引 Similarweb 数据称,Claude.ai 2 月访问量环比增长 63%,已是当月主流 AI 产品中增速最高的。3 月的 86% 意味着 Anthropic 的用户获取势头不仅未放缓,反而在提速。
信源:https://x.com/Similarweb/status/2038896001210097951
阿里云百炼负责人:日耗亿Token用户数以万计,自建GPU没必要
阿里云百炼技术负责人于文渊在播客「十字路口」中透露,百炼平台上每天消耗超过 1 亿 Token 的用户已「数以万计」,Token 消耗基本以月翻倍的速度增长。他称 Qwen 3.5 在除夕当天发布后,仅两周多峰值请求量就跃升至「历史上所有文本模型都未曾见过的高度」,而「现在仅仅是一个开始」。
于文渊发表自称「暴论」的观点:没有任何场景需要企业自建 GPU。他认为企业自建的三个常见理由(成本可控、数据安全、灵活性),恰恰是应该使用 MaaS(模型即服务)的理由:推理优化迭代快,自养 Infra 工程师持续跟进很难;自持 GPU 利用率难保证;模型架构变化不确定,而 MaaS 用户只需面对一个 API。安全方面,阿里云在推行「机密计算」,用户的模型文件和请求内容端到端加密,密钥掌握在用户自己手里。
他还给出一个反直觉判断:AI 最先替代的不是前端工程师,而是写操作系统内核、数据库内核、文件系统的系统工程师。理由是这些领域代码库质量高、测试用例清晰、问题像「可以被精准定义的数学题」;而与产品和用户交互紧密的岗位,需要难以形式化的 know-how,反而更难替代。他引用了存储会议 FAST 上的一篇论文:只要规范写得够清楚,32B 模型就能写出文件系统级别的代码。
于文渊还对 AI 编程提出警告:把「AI 生成代码比例」当 KPI「非常危险」,AI 代码用于原型没问题,但用于生产环境「还差一点」。他建议计算机专业学生少用 AI 写代码,先建立自己的判断力,「努力成为能识别出 AI 做不到的那 1% 的人」。
信源:https://mp.weixin.qq.com/s/QOrMNGZztCm-eu6pTMKEfw
阿里云百炼技术负责人于文渊在播客「十字路口」中透露,百炼平台上每天消耗超过 1 亿 Token 的用户已「数以万计」,Token 消耗基本以月翻倍的速度增长。他称 Qwen 3.5 在除夕当天发布后,仅两周多峰值请求量就跃升至「历史上所有文本模型都未曾见过的高度」,而「现在仅仅是一个开始」。
于文渊发表自称「暴论」的观点:没有任何场景需要企业自建 GPU。他认为企业自建的三个常见理由(成本可控、数据安全、灵活性),恰恰是应该使用 MaaS(模型即服务)的理由:推理优化迭代快,自养 Infra 工程师持续跟进很难;自持 GPU 利用率难保证;模型架构变化不确定,而 MaaS 用户只需面对一个 API。安全方面,阿里云在推行「机密计算」,用户的模型文件和请求内容端到端加密,密钥掌握在用户自己手里。
他还给出一个反直觉判断:AI 最先替代的不是前端工程师,而是写操作系统内核、数据库内核、文件系统的系统工程师。理由是这些领域代码库质量高、测试用例清晰、问题像「可以被精准定义的数学题」;而与产品和用户交互紧密的岗位,需要难以形式化的 know-how,反而更难替代。他引用了存储会议 FAST 上的一篇论文:只要规范写得够清楚,32B 模型就能写出文件系统级别的代码。
于文渊还对 AI 编程提出警告:把「AI 生成代码比例」当 KPI「非常危险」,AI 代码用于原型没问题,但用于生产环境「还差一点」。他建议计算机专业学生少用 AI 写代码,先建立自己的判断力,「努力成为能识别出 AI 做不到的那 1% 的人」。
信源:https://mp.weixin.qq.com/s/QOrMNGZztCm-eu6pTMKEfw
Claude Code最新版npm包意外打入60MB source map,时隔一年源码再次泄露
Solayer 创始人 Chaofan Shou 在 X 上指出,Anthropic 旗下 AI 编程工具 Claude Code 的 npm 包中包含完整的 source map 文件(cli.js.map,约 60MB),可从中还原出全部 TypeScript 源代码。经验证,该文件出现在 3 月 30 日发布的 v2.1.88 中,前一版 v2.1.87(3 月 29 日)并不包含,包体积也从 17MB 骤增至 31MB(解压后约 60MB),属于最新一次构建意外引入。
还原后的 source map 内含 1,906 个 Claude Code 自有源文件的完整文本,涵盖内部 API 设计、遥测系统、加密工具、进程间通信协议等实现细节(不含 package.json 等构建配置,无法直接编译运行)。Source map 是 JavaScript 开发中用于将压缩代码映射回原始源代码的调试文件,不应出现在生产发布包中。
2025 年 2 月 Claude Code 首次发布时也曾因包含 source map 被公开讨论,此后该文件从 npm 包中消失,但提取源码的行为并未停止。目前 GitHub 上仍有多个公开仓库整理了还原后的源代码,其中 ghuntley/claude-code-source-code-deobfuscation 获得近千颗星。此次泄露的是 Claude Code CLI 客户端实现代码,不涉及模型权重或用户数据,对普通用户没有直接安全风险。
信源:https://x.com/Fried_rice/status/2038894956459290963
Solayer 创始人 Chaofan Shou 在 X 上指出,Anthropic 旗下 AI 编程工具 Claude Code 的 npm 包中包含完整的 source map 文件(cli.js.map,约 60MB),可从中还原出全部 TypeScript 源代码。经验证,该文件出现在 3 月 30 日发布的 v2.1.88 中,前一版 v2.1.87(3 月 29 日)并不包含,包体积也从 17MB 骤增至 31MB(解压后约 60MB),属于最新一次构建意外引入。
还原后的 source map 内含 1,906 个 Claude Code 自有源文件的完整文本,涵盖内部 API 设计、遥测系统、加密工具、进程间通信协议等实现细节(不含 package.json 等构建配置,无法直接编译运行)。Source map 是 JavaScript 开发中用于将压缩代码映射回原始源代码的调试文件,不应出现在生产发布包中。
2025 年 2 月 Claude Code 首次发布时也曾因包含 source map 被公开讨论,此后该文件从 npm 包中消失,但提取源码的行为并未停止。目前 GitHub 上仍有多个公开仓库整理了还原后的源代码,其中 ghuntley/claude-code-source-code-deobfuscation 获得近千颗星。此次泄露的是 Claude Code CLI 客户端实现代码,不涉及模型权重或用户数据,对普通用户没有直接安全风险。
信源:https://x.com/Fried_rice/status/2038894956459290963
X (formerly Twitter)
Chaofan Shou (@Fried_rice) on X
Claude code source code has been leaked via a map file in their npm registry!
Code: https://t.co/jBiMoOzt8G
Code: https://t.co/jBiMoOzt8G
微软HyperP:在208M模型上调一次学习率,全尺度都能用
微软研究团队提出 HyperP(Hypersphere Parameterization),首个在超球面优化下实现学习率跨模型宽度、深度、训练数据量和 MoE 粒度全维度迁移的框架。核心做法是将权重矩阵约束在固定范数的超球面上,配合 Muon 优化器,只需在最小规模(2.08 亿参数)上调一次基础学习率,即可直接迁移至所有更大的计算预算。
论文有两个关键理论发现。第一,在 Frobenius 球面约束下,权重衰减(weight decay)在一阶近似上完全无效,可以直接删除,将超参数搜索空间从学习率和权重衰减的联合平面压缩到只剩学习率一个维度。第二,最优学习率随训练数据量的缩放遵循幂律关系,指数为 0.32,与此前在 AdamW 优化器上观察到的「magic exponent」完全一致,暗示这可能是梯度优化的普遍性质,与具体优化器无关。
实验结果上,在 6×10²¹ FLOPs 的计算预算下,HyperP 对 dense 模型的计算效率较强 Muon 基线(配合 μP++ 和权重衰减缩放)提升 1.58 倍,且优势随规模单调递增;配合论文提出的 SqrtGate 机制(一种保持输出 RMS 跨 MoE 粒度不变的门控方式)的 MoE 模型,效率进一步达到 dense 模型的 3.38 倍。稳定性方面,HyperP 实现了「可迁移的稳定性」:从 9.13 亿到 133 亿参数的 MoE 模型,所有六项训练不稳定指标(Z 值、输出 RMS、激活异常值比例等)均保持有界且不随规模增长。论文还反驳了 MuonH 原作者关于该优化器天然具备深度迁移性的说法,证明残差连接的累积角漂移使得 Depth-μP 仍然必要。代码已开源。
信源:https://arxiv.org/abs/2603.28743
微软研究团队提出 HyperP(Hypersphere Parameterization),首个在超球面优化下实现学习率跨模型宽度、深度、训练数据量和 MoE 粒度全维度迁移的框架。核心做法是将权重矩阵约束在固定范数的超球面上,配合 Muon 优化器,只需在最小规模(2.08 亿参数)上调一次基础学习率,即可直接迁移至所有更大的计算预算。
论文有两个关键理论发现。第一,在 Frobenius 球面约束下,权重衰减(weight decay)在一阶近似上完全无效,可以直接删除,将超参数搜索空间从学习率和权重衰减的联合平面压缩到只剩学习率一个维度。第二,最优学习率随训练数据量的缩放遵循幂律关系,指数为 0.32,与此前在 AdamW 优化器上观察到的「magic exponent」完全一致,暗示这可能是梯度优化的普遍性质,与具体优化器无关。
实验结果上,在 6×10²¹ FLOPs 的计算预算下,HyperP 对 dense 模型的计算效率较强 Muon 基线(配合 μP++ 和权重衰减缩放)提升 1.58 倍,且优势随规模单调递增;配合论文提出的 SqrtGate 机制(一种保持输出 RMS 跨 MoE 粒度不变的门控方式)的 MoE 模型,效率进一步达到 dense 模型的 3.38 倍。稳定性方面,HyperP 实现了「可迁移的稳定性」:从 9.13 亿到 133 亿参数的 MoE 模型,所有六项训练不稳定指标(Z 值、输出 RMS、激活异常值比例等)均保持有界且不随规模增长。论文还反驳了 MuonH 原作者关于该优化器天然具备深度迁移性的说法,证明残差连接的累积角漂移使得 Depth-μP 仍然必要。代码已开源。
信源:https://arxiv.org/abs/2603.28743