动察Beating AI News
3.14K subscribers
877 photos
2 videos
3.39K links
AI新闻信息流
Download Telegram
GSM8K团队五年后再出手:25道博士级数学题,所有前沿模型正确率不到10%

AI 数据标注公司 Surge AI 发布数学基准测试 Riemann-bench。Surge AI 五年前与 OpenAI 合作构建了 GSM8K,当时 GPT-3 系列在该测试上正确率不到 20%,如今 GSM8K 已成为行业入门级基准。Riemann-bench 瞄准的是另一个层级:25 道来自常春藤联盟数学教授、博士生和 IMO 奖牌得主自身研究中的问题,出题者本人往往需要数周才能独立解出,示例题目的预估解题时间为 40 至 50 小时。

当前排名:Claude Opus 4.6 和 Gemini 3.1 Pro 并列第一,正确率均为 6%;Kimi K2.5 和 Gemini 3 Pro 并列第三,4%;DeepSeek v3.2 为 3%;GPT-5.2 和 Claude Opus 4.5 均为 2%。GPT-5.4 系列因 API 报错尚未完成测试。

与 FrontierMath 等现有数学基准相比,Riemann-bench 有两个设计差异:一是不限制 Agent 的推理框架和 token 上限,允许模型自由使用工具和多步推理;二是采用双盲验证,每道题由两位独立领域专家从零解题确认答案。题库完全保密,防止模型针对性优化。

信源:https://surgehq.ai/blog/riemann-bench-a-benchmark-for-moonshot-mathematics
马斯克预告Grok Imagine v2:「下一版将是史诗级的」

Elon Musk 发帖称 xAI 图像生成工具 Grok Imagine 的下一个版本「将是史诗级的,我们正在加倍投入」。Grok 官方账号随后回复确认新版本名为 Grok Imagine v2,称将在「创造力和真实感」上大幅提升。未披露具体发布日期和技术细节。

信源:https://x.com/grok/status/2036693952435265941
Anthropic经济指数:老用户成功率高10%,编程任务正从网页端迁移到API

Anthropic 发布第三期经济指数报告,基于 2026 年 2 月 Claude 使用数据分析 AI 对经济的影响。

核心发现是「学习曲线」效应:使用 Claude 超过 6 个月的老用户,对话成功率比新用户高约 10%,即使在控制了任务类型、国家、模型选择等变量后,差距仍有约 4 个百分点。老用户更倾向于与 Claude 协作迭代,而非简单下达指令,用于工作的比例高出 7 个百分点,处理的任务所需教育水平也更高。

使用场景方面,编程仍是最大类别,占 Claude.ai 对话的 35%,但正加速从网页端迁移到 API。Claude Code 的 Agent 架构将编程工作拆分为更小的 API 调用,推动 API 端编程份额持续上升。Claude.ai 上使用场景更加分散,前 10 大任务占比从 24% 降至 19%,个人用途(体育赛事、产品比较、家庭维护等)从 35% 升至 42%。Claude.ai 上任务的平均经济价值(以对应美国职业时薪衡量)从 49.3 美元微降至 47.9 美元。

用户在选择模型时表现出明显的任务匹配行为:付费用户在编程任务中选择 Opus 的比例比平均水平高 4 个百分点,在辅导类任务中低 7 个百分点。API 端这种差异更为明显,任务价值每增加 10 美元时薪,Opus 使用比例上升 2.8 个百分点。

API 端两类新兴自动化工作流增长尤为突出,份额至少翻倍:企业销售外联自动化(线索筛选、客户数据补充、冷邮件撰写)和自动化交易与市场运营(市场监控、投资建议、交易提醒)。

地理分布上,美国各州之间的使用差距继续收窄,但速度放缓,按当前趋势需 5 至 9 年才能趋于均等。国际差距则略有扩大,前 20 个国家的人均使用份额从 45% 升至 48%。报告指出,49% 的职业已有至少四分之一的任务通过 Claude 完成。

信源:https://www.anthropic.com/research/economic-index-march-2026-report
分析:Anthropic年化营收190亿美元同比涨14倍,但和OpenAI的250亿不是一本账

《The Information》分析称,Anthropic 2 月底年化营收突破 190 亿美元,同比增长约 14 倍;同期 OpenAI 年化营收约 250 亿美元,同比增约 4 倍。

两家的年化计算方法几乎一致:取最近四周收入乘以 13(对应一年 52 周)。Anthropic 的细节是 API 收入按四周乘以 13,订阅收入按当日活跃订阅数折算月收入再乘以 12。此前 X 上有声音质疑 Anthropic 的年化算法与 OpenAI 存在重大差异,该报道否定了这一猜测。

但两家在云渠道收入的记账方式上确有实质分歧。微软通过 Azure 向客户转售 OpenAI 模型,OpenAI 仅将自己分到的 20% 计为营收,因为微软被认定为该服务的「委托人」(principal),直接控制交付并拥有 OpenAI 知识产权的独家使用权。Anthropic 则将 AWS、谷歌、微软三家云平台转售 Claude 的全部销售额计为自己的营收,付给云厂商的分成记入销售与营销费用,理由是 Anthropic 自身才是委托人,云厂商只是分销商。两种处理均符合 GAAP,但导致两家的营收数字无法直接对比。

报道认为,比较两家实验室或许自由现金流是更好的指标:Anthropic 预计最早 2028 年转正,比 OpenAI 早两年。其他数据:Anthropic 2025 年全年实际营收约 45 亿美元;OpenAI 约 131 亿美元,预计 2026 年增至约 300 亿美元。

信源:https://www.theinformation.com/newsletters/dealmaker/math-behind-anthropics-mad-revenue-growth
Meta收购Manus案升级:外媒曝肖弘、季逸超被发改委约谈后遭边控,监管从多个方向收紧

英国《金融时报》披露了 Meta 收购 AI Agent 公司 Manus 一案的最新细节。Manus CEO 肖弘和首席科学家季逸超本月被国家发改委召至北京约谈,问询方向为 Manus 所有权变更后,其境内主体是否按规定完成了外商直接投资信息报告。约谈结束后,二人被告知在审查期间不得离境,但可在国内自由活动。此前《纽约时报》已报道高管被限制出境,FT 的报道进一步明确了限制对象为肖弘、季逸超,约谈主体为发改委,边控措施直接与此次约谈相关。

至此,该交易同时面临两条监管线:商务部自 1 月 8 日起对出口管制合规的审查,以及发改委对 FDI 申报违规的问询。多部门同步介入,显示监管层对这笔交易的关切已从单一维度扩展为系统性审视。

目前未启动正式调查,也未提出任何指控。Manus 正在寻找律所和咨询机构协助应对。报道援引知情人士称,即使违规被确认,依据现行法律也不太可能导致严重处罚,但监管方显然在寻找介入交易的切入口。极端情况下可能要求撤销交易,但由于 Meta 已开始将 Manus 的 AI Agent 软件整合入自有平台,强行拆解会非常复杂。外媒普遍认为,此举意在向中国 AI 创业者发出信号:在境内研发核心技术后迁往海外再出售给美国企业的路径,将面临越来越大的监管压力。

Meta 发言人回应称,「该交易完全符合适用法律,我们预期此次问询会得到妥善解决。」

信源:https://www.ft.com/content/d9123d9d-c807-41d6-8a17-80ff1111834a
Meta设9万亿美元市值目标留人:IPO以来首发期权,比马斯克方案增幅相当但时间减半

Meta 推出新的股票期权激励计划,高管只有在公司市值于 2031 年前突破 9 万亿美元时才能兑现全部价值,较当前约 1.5 万亿美元需增长 500%。这是 Meta 2012 年 IPO 以来首次向高管授予股票期权。

计划覆盖六位核心高管:CTO Andrew Bosworth、首席产品官 Chris Cox、COO Javier Olivan、CFO Susan Li、首席法务官 C.J. Mahoney 和副董事长 Dina Powell McCormick。CEO 扎克伯格不在其中。期权分多档行权,最低一档要求股价达到 1116.08 美元(较当前涨 88%,对应市值约 2.82 万亿美元),最高档 3727.12 美元(对应市值超 9 万亿美元)。Meta 同时增加了部分高管的 RSU 授予。

Meta 发言人称这是一次「大赌注」,「只有 Meta 实现巨大成功,所有股东都从中受益时,这些薪酬才会兑现」。

作为对比,特斯拉去年秋天通过的马斯克薪酬方案价值最高 1 万亿美元,需在 10 年内将市值从 1.2 万亿推至 8.5 万亿美元。Meta 的计划要求几乎同等增幅,但时间窗口只有一半。AI 人才争夺战正在推高 Meta 的股票薪酬成本:2025 年与员工股票奖励相关的现金支出消耗了公司 96% 的自由现金流,达 420 亿美元;全年回购的 4000 万股中,90% 是为了抵消员工股票奖励带来的稀释。

信源:https://www.wsj.com/tech/meta-targets-9-trillion-valuation-with-new-executive-incentive-program-64460862
传蚂蚁集团正开发AI眼镜独立App,「看一下支付」要从插件变入口

微信公众号「读佳」爆料称,蚂蚁集团正在开发「蚂蚁数科AI眼镜」独立 App。

蚂蚁数科去年 9 月发布 AI 眼镜可信连接技术框架 gPass,已与 Rokid、小米等主流 AI 眼镜品牌完成对接,实现「看一下支付」在消费、停车、文旅等场景落地。目前 gPass 以插件形式嵌入各硬件厂商系统。若独立 App 落地,蚂蚁的 AI 眼镜支付能力将不再依附于单一硬件品牌,可跨品牌覆盖用户。

信源:https://mp.weixin.qq.com/s/W6j7dbsIAHvt7i7gtIRe-w
杨植麟中关村论坛演讲:大模型训练正进入第三阶段,100个Agent并行后执行时间几乎不随复杂度上升

月之暗面创始人杨植麟在 2026 中关村论坛全体会议上以《开源 AI:加速探索智能上限》为题发表演讲,提出大模型训练正经历三个阶段的演进:三年前主要依赖互联网天然数据加少量人工标注;2025 年转向大规模强化学习,由人工筛选高质量任务,编程和数学领域的性能提升主要来自这一路线;从今年起进入第三阶段,AI 将更大程度主导研究本身,每个研究员将配备海量 token,由 AI 自动合成新任务与新环境、定义奖励函数,甚至探索全新网络架构。

杨植麟介绍了 Kimi K2.5 中首创的 Agent 集群(Agent Swarm)技术。他展示的数据显示,单一智能体模式下任务复杂度与执行时间呈指数级增长,而并行启用 100 个智能体协作后,执行时间几乎不再随任务复杂度上升而显著增加。他将此比喻为「从 0 到 1 建造一家千亿美元公司,一个人可能需要 100 年,但 100 个聪明人一起协作,就能在短时间内完成」。

杨植麟还指出,开源模型正成为全球 AI 产业新标准。在英伟达 GTC 2026 大会上,黄仁勋主题演讲多次引用 Kimi 等开源模型作为芯片性能评测基准,「如果你要发布一个新芯片,就必须通过 Kimi 或其他开源模型来评测性能提升」。

信源:https://www.nbd.com.cn/articles/2026-03-25/4307655.html
一个Transformer同时生成视频和语音:Sand.ai开源150亿参数人像基座模型,单H100两秒出片

视频生成创业公司 Sand.ai 与上海创智学院 GAIR 实验室联合开源音视频联合生成基座模型 daVinci-MagiHuman,150 亿参数,采用单流 Transformer 架构,将文本、视频、音频统一放入同一个 token 序列,仅靠自注意力完成联合建模,不依赖跨注意力或模态专属分支。

模型以人像场景为核心能力,可生成富有表现力的面部表情与自然语音,实现口型、表情与动作的精确同步,支持中文(普通话与粤语)、英文、日文、韩文、德文、法文六种语言。推理侧结合模型蒸馏、隐空间超分辨率和 Turbo VAE 解码器,在单张 H100 GPU 上 2 秒生成 5 秒 256p 视频。

在客观评测中,daVinci-MagiHuman 在开源模型中视觉质量和文本一致性均为最优,语音可懂度词错误率(WER)14.60%,远低于 LTX 2.3 和 Ovi 1.1。2000 组人工盲评中,对 Ovi 1.1 胜率 80%,对 LTX 2.3 胜率 60.9%。完整模型栈(基座模型、蒸馏模型、超分模型、推理代码)全部开源。

Sand.ai 由马尔奖(Marr Prize)得主曹越创立,此前发布了自回归视频生成模型 Magi-1 和主打「AI 演员」的 GAGA-1。上海创智学院 GAIR 实验室由刘鹏飞领导,聚焦生成式 AI 前沿研究。

信源:https://arxiv.org/abs/2603.21986
WordPress 7.0将于4月9日发布,全球43%网站将原生支持AI Agent接入

WordPress 7.0 定于 4 月 9 日发布,核心变化之一是将 MCP(Model Context Protocol)适配器纳入核心,使任何 WordPress 站点都能作为 MCP 服务器,允许 Claude、ChatGPT 等 AI Agent 直接在站点内发现功能、理解结构并执行操作。

具体而言,7.0 在 AI 基础设施层面引入三个组件:

1. AI Connectors:在设置面板统一管理 AI 服务的 API 密钥,首批支持 Anthropic、OpenAI、谷歌三家,所有插件共享同一套凭证,不再各自存储。
2. Abilities API:6.9 版本引入、7.0 扩展的能力注册接口,插件可以用 AI 能理解的格式声明自身功能(如获取文章、更新页面、运行站点健康检查),标准化输入输出。
3. MCP Adapter:将所有已注册的 Ability 通过 MCP 协议暴露给外部 AI Agent,Agent 可自动发现站点能力并在用户授权下调用。

WordPress.com 已于 3 月 20 日率先上线 MCP 写入权限,覆盖 6 类内容的 19 项写操作(编辑内容、管理评论、创建页面、上传媒体、调整分类和标签等)。所有操作需用户明确确认后才会执行,新内容默认为草稿,删除内容进入回收站保留 30 天。WordPress.com 还默认启用 OAuth 2.1 认证,AI 客户端仅使用有时效的 token,不接触用户凭证。

WordPress 驱动着全球约 43% 的网站。MCP 支持进入核心意味着这些站点将具备标准化的 AI Agent 接入能力,类似于 2016 年 REST API 进入核心后催生了无头 WordPress 和现代主题开发生态。

信源:https://x.com/adityaarsharma/status/2036485004348498180
Linear宣布「Issue tracking已死」,全面转向AI Agent驱动的产品系统

项目管理工具 Linear CEO Karri Saarinen 发布公开信,宣布 Linear 正从 issue tracker 转型为「将上下文转化为执行」的共享产品系统,核心论点是传统 issue tracking 为人与人之间的工作交接而设计,而 AI Agent 时代的瓶颈已转向判断力,系统应围绕上下文和 Agent 重建。

Karri 披露了一组数据:目前超过 75% 的 Linear 企业级工作区已安装编程 Agent,过去三个月 Agent 完成的工作量增长了 5 倍,Agent 创建的新 issue 占比接近 25%。

围绕这一转型,Linear 同步上线三项功能:

1. Linear Agent:内置的原生 AI Agent,理解工作区内的路线图、issue 和代码,可在桌面端(Cmd/Ctrl+J)、移动端、Slack 和 Microsoft Teams 中使用,支持综合上下文、提出建议并直接执行操作。
2. Skills:将 Agent 对话中的有效工作流保存为可复用技能,通过斜杠命令手动触发,或由 Linear 自动匹配执行。
3. Automations:从 Triage 开始,issue 进入系统时自动触发 Agent 工作流,智能分类、提炼或处理新增上下文。

此外预告了三项即将推出的能力:Code Intelligence(理解代码库并回答问题)、Code Diffs(人与 Agent 协作审查代码的界面)和 Linear Coding Agent(由 Linear 原生上下文增强的编程 Agent)。

Linear Agent 目前以公测形式向所有计划开放,测试期间免费。Automations 和 Code Intelligence 仅限 Business 和 Enterprise 计划。正式发布后,对话功能预计包含在基础席位价格中,高计算量功能可能转为用量计费。

信源:https://linear.app/next
1
「TTS基准已死」:Smallest AI发布对话语音模型Lightning V3,对OpenAI胜率76%

语音 AI 公司 Smallest AI 创始人 Sudarshan Kamath 发布对话场景专用 TTS 模型 Lightning V3,核心论点是朗读式 TTS 和对话式 TTS 是两个根本不同的问题,现有基准衡量的是前者,对后者几乎失效。

对话生成的难点在于模型无法等到完整句子再开始合成,必须在不完整上下文下实时逐块输出。Lightning V3 针对这一场景设计了四项能力:通过节奏和停顿微变化模拟「正在思考」的认知信号;根据对话轮次调整语调(澄清与开场语气不同);处理 Hinglish、Spanglish 等真实场景中的句内混语切换;以及维持用户参与度。

在对话生成条件下的评测中(使用 Seed-TTS 语料库,LLM 作为评判者,评测代码已公开),Lightning V3 MOS 评分 3.89,词错误率 5.38%,对 OpenAI gpt-4o-mini-tts 的整体自然度胜率约 76%。但 Kamath 对自己的评测结果也做了诚实限定:「将同一段音频放在不同的播放设备上、给评估者不同的关注引导,排名就会变。这不是数据噪声,这就是数据本身。」他认为 MOS 将巨大的感知差异压缩为一个平均数,当系统跨过「可懂」到「自然」的门槛后,现有基准只能确认系统没有失败,无法衡量它成功了多少。

模型原生输出 44,100 Hz,支持 15 种语言,可降采样至 8/16/24 kHz 适配电话系统。同步发布的 V3.1 新增声音克隆,5 至 15 秒音频即可生成跨语言的生产级语音副本。采用按量付费,无预付或最低消费。

信源:https://x.com/kamath_sutra/status/2036466680076050581
Hugging Face开源hf-mount:把云端模型和数据集直接挂载为本地文件夹,按需读取不用下载

Hugging Face CEO Clement Delangue 宣布开源 hf-mount,可将 Hugging Face 上的任意模型仓库、数据集或 Buckets 存储桶挂载为本地文件系统,文件在首次读取时才从网络拉取,无需预先下载完整仓库。Delangue 称这对 AI Agent 尤其实用,Agent 可直接用 ls、cat、find、grep 等标准 UNIX 命令操作远端数据,无需学习专用 API。

hf-mount 用 Rust 编写,提供 NFS(推荐,无需 root 权限)和 FUSE 两种后端,支持 Linux 和 macOS。仓库挂载为只读,Buckets 存储桶支持读写。基准测试显示 FUSE 模式顺序读取速度 1.2 GB/s,写入 900 MB/s。Kubernetes 环境可通过配套的 hf-csi-driver 将挂载点暴露给 Pod。项目以 Apache 2.0 协议开源。

信源:https://x.com/ClementDelangue/status/2036452081750409383
AI自评全是好评怎么办?Anthropic用GAN思路让Claude连续编程4小时,$124造出一个音乐工作站

Anthropic Labs 工程师 Prithvi Rajasekaran 发文详解团队如何让 Claude 连续数小时自主编写完整应用。他们发现了一个关键瓶颈:让 AI 自己检查自己的代码质量时,它几乎永远觉得自己写得不错,哪怕成品明显有问题也会放行。解法是把「写代码的 AI」和「审代码的 AI」拆成两个独立角色,后者专职挑毛病,比自我审查有效得多。

最终架构由三个 AI 协作:一个负责把用户的一句话需求扩展成完整产品方案,一个负责逐功能写代码,一个负责像真实用户一样点击、操作正在运行的应用并打分。写代码的 AI 和审代码的 AI 每轮开工前先对齐「这轮做什么、怎么算做完」,审代码的 AI 会真的去用这个应用,找出实际 bug 后把修改意见打回去。

对照实验很直观:同样一句「做一个 2D 复古游戏编辑器」,单个 AI 跑 20 分钟花 $9,产出的游戏画面能打开但核心玩法完全跑不通,角色不响应操作;三 AI 协作跑 6 小时花 $200,产出的版本可以正常操控角色、在关卡里移动,审核 AI 还在过程中抓到了填充工具只画端点不填区域、后端路由冲突等具体 bug。

Claude Opus 4.6 让这套架构得以大幅简化。此前 Sonnet 4.5 会在长任务后期「焦虑收尾」,还没做完就急着结束,必须定期清空记忆重新启动。Opus 4.6 基本消除了这个问题,写代码的 AI 可以在单次会话中连贯工作超过 2 小时。用简化后的架构生成浏览器端音乐制作工具,约 4 小时花费 $124.70,审核 AI 仍然捕获了「录音按钮只切状态但没接麦克风」「音频片段无法拖拽」等遗漏。

文章还透露了一个有趣的发现:在前端设计实验中,评分标准里的措辞会直接影响 AI 的审美方向。写上「最好的设计是博物馆级别的」之后,AI 在做一个荷兰艺术博物馆网站时,第十轮迭代自行推翻了前九轮的平面方案,改为用 CSS 渲染的 3D 展厅,让访客通过虚拟门廊在画廊之间穿行。


信源:https://www.anthropic.com/engineering/harness-design-long-running-apps
🎉1
可灵AI年化收入2.4亿美元,快手四成新代码由AI生成

快手科技发布 2025 年第四季度及全年业绩。Q4 收入 395.68 亿元,同比增长 11.8%;全年收入 1427.76 亿元,同比增长 12.5%;全年经调整净利润 206.47 亿元,同比增长 16.5%,经调整净利润率升至 14.5%。Q4 日均活跃用户 4.08 亿,月均活跃用户 7.41 亿。

可灵 AI 是本期财报的核心增长叙事。Q4 收入 3.4 亿元,较 Q3 的逾 3 亿元继续增长;2025 年 12 月单月收入突破 2000 万美元,年化收入运行率(ARR)达到 2.4 亿美元。截至年底,可灵 AI 全球用户超 6000 万,累计生成超 6 亿个视频,为超 3 万家企业客户和开发者提供 API 服务。Q4 期间先后推出可灵 O1、可灵 2.6 和可灵 3.0 系列模型,其中可灵 2.6 推出「音画同出」能力,可灵 3.0 基于 All-in-One 理念实现从生成到专业创作调度的升级。

AI 对主营业务的渗透同样值得关注。线上营销方面,生成式推荐大模型和智能出价模型带动国内营销收入提升约 5%,AIGC 营销素材消耗约 40 亿元。电商方面,Q4 GMV 同比增长 12.9% 至 5218 亿元。快手自研 AI 编程工具 CoderFlicker 生成的代码已占新增代码的 40% 以上。全年研发支出同比增长 19%,主要投向 AI 和人力。

公司还宣布派发 2025 年度末期股息每股 0.69 港元,合计 30 亿港元,继去年 8 月上市以来首次特别股息后再次派息。

信源:https://www.bloomberg.com/news/articles/2026-03-25/kuaishou-tech-sales-climb-as-ai-monetization-gains-momentum
Harness Engineering正在成为AI编程的真正战场

AI 编程 IDE Qoder 发布长文梳理了一个正在成形的行业趋势:头部科技公司的 AI 编程竞争焦点已从模型能力本身转向模型之外的一切,即「Harness Engineering」(编排工程)。文章用一个类比概括:模型是 CPU,上下文窗口是内存,Harness 是操作系统,Agent 是应用程序。决定最终产出质量的不是 CPU 有多快,而是操作系统设计得多好。

文章整理了多家公司已公开的实践数据:

1. Stripe 在开源 Agent 框架 Goose 基础上构建了 Blueprint 状态机系统,每周合并超过 1300 个完全由 Agent 编写的 PR
2. Shopify 开源了 Roast 工作流框架,将 AI 步骤与确定性代码交替编排
3. Ramp 基于 OpenCode 构建了 Inspect 系统,在沙箱中并行执行,合并的 PR 中 30% 由 Agent 编写
4. Coinbase 自建 Cloudbot,将 PR 审查周期从 150 小时压缩到 15 小时
5. OpenAI 用 Codex 驱动整个产品迭代,3 名工程师(后扩展至 7 人)在五个月内以零手写代码方式交付了一个百万行级产品

Qoder 认为这些方案有一个共同的结构性限制:Agent 仍然是单体的,一个模型实例、一个上下文窗口、一条执行路径从头跑到尾。任务复杂度上升时会遇到五个瓶颈:上下文窗口变成零和博弈(研究、编码、测试、审查挤在同一窗口里);角色切换的认知开销(一个 Agent 同时当技术负责人、开发、QA 和代码审查员);长链执行中的目标漂移;功能正确性验证不足(代码干净但业务逻辑不对);终端命令执行的不可逆风险。

Qoder 据此推出了 Experts Mode(测试版),将单 Agent 拆成多个专家角色:Leader 负责协调和任务分解,开发、研究、浏览器测试、QA、代码审查各由独立 Agent 承担,每个 Agent 使用不同模型和独立上下文窗口。Qoder 称内部基准测试中,Experts Mode 质量比单 Agent 模式高 67%,比 Claude Code Agent Teams 高 16%,成本不到后者的三分之二。

信源:https://x.com/qoder_ai_ide/status/2036437931867644016
Umi.js作者逆向Claude Code源码:Auto Mode背后是Sonnet当安全门卫,四层流水线决定每次操作能不能跑

蚂蚁集团工程师、前端框架 Umi.js 作者陈成逆向了 Claude Code 2.1.81 的源码,完整还原了 auto mode 按下之后发生的事情。核心发现:每一次工具调用都要过一条四层决策流水线,只有前三层都无法判断时,才会调用一个独立的 AI 分类器做安全审查。

四层流水线依次是:第一层检查已有的权限规则,命中直接放行;第二层模拟 acceptEdits 模式(即允许编辑文件的权限级别),如果在该模式下就会通过,说明风险很低,跳过分类器;第三层检查只读工具白名单(Read、Grep、Glob、LSP、WebSearch 等),这些不修改任何状态,无条件放行;以上都不满足时,才进入第四层,发一个独立的 API 请求给 Claude Sonnet 做安全分类。

分类器的几个关键设计细节:始终使用 Sonnet 而非 Opus,是成本和延迟的权衡;temperature 设为 0 以确保输出确定性;分类器被定义为「自主 AI 编程 Agent 的安全监控员」,保护三类风险(提示词注入、范围蔓延、意外损害);用户的 CLAUDE.md 配置文件会被注入分类器上下文,作为判断用户意图的依据。

拦截规则覆盖 22 个以上类别,包括 force push、直推 main 分支、下载并执行外部代码、生产部署、数据外泄、自我修改权限、创建远程代码执行面、凭证泄露等。放行例外有 7 类:测试用的硬编码密钥、工作目录内的本地文件操作、只读 GET 请求、安装已声明的依赖、官方工具链安装、读取配置凭证发送到目标提供商、推送到当前工作分支。

还有一套熔断机制:连续 3 次被拒绝或累计 20 次被拒绝后,系统降级为手动确认;headless 模式下直接中止 Agent。分类器不可用时,由一个 feature flag 控制是「fail-closed」(直接拒绝)还是「fail-open」(降级为手动确认)。

auto mode 下的行为提示词注入也有精细的频率控制:每 5 轮对话注入一次,每 5 次注入周期中第 1 次是完整版(约 800 字,包含「立即执行、减少打断、行动优于计划」等六条指令),其余 4 次是一行精简版,在上下文窗口占用和行为稳定性之间取得平衡。

信源:https://blog.sorrycc.com/claude-code-auto-mode
👍1
DeepSeek一口气放17个岗位全押Agent:要求重度使用Claude Code,全栈岗写明Vibe Coding优先

DeepSeek 集中开放 17 个招聘岗位,核心研发方向从基础模型研究明确转向 Agent 产品化。三个专属 Agent 岗位覆盖算法研究、数据评测和基础设施全链条:算法研究员聚焦强化学习在大模型对齐中的应用(RLHF/RLAIF、过程奖励、偏好学习等方向);数据评测专家负责构建评测数据集,针对 Agent 的规划、工具调用、多轮交互、长期记忆等能力设计测试用例;基础设施工程师负责搭建 Agent 运行底座,包括集成外部工具到内部强化学习基础设施、搭建评测平台。

招聘要求中有两个值得注意的信号。多个岗位在加分项中明确写出「重度使用 Claude Code、Cursor、Copilot 等 AI 编程工具」优先。全栈开发工程师岗位职责中出现了一条不常见的描述:「作为 Vibe Coding 重度用户,持续探索模型能力在产品中的创新应用」,同一岗位的核心工作方向是构建「支撑海量 AI Agent 运行的下一代容器调度与隔离平台」。

模型策略产品经理岗位单独设立了 Agent 方向,要求候选人熟悉 Claude Code、OpenClaw、Manus 等 Agent 产品,需洞察高价值应用场景(包括个人助理、Deep Research、自动化工作流、多模态设备控制),并主导 Agent 评测体系及训练数据方案设计。对比今年 1 月,当时开放的核心岗位集中在「深度学习研究员-AGI」等通用方向,此次招聘重心已明显向 Agent 产品化倾斜。

信源:https://app.mokahr.com/social-recruitment/high-flyer/140576#/
豆包手机助手幕后操盘手:36氪创始人刘成城,其团队在字节内部与抖音平级

科技媒体 36 氪创始人刘成城目前担任字节跳动 AI 硬件团队 Ocean 负责人,直接向 AI 产品团队 Flow 负责人朱骏汇报,操盘豆包手机助手及字节全线 AI 硬件业务。刘成城 2019 年以 30 岁年纪带领 36 氪登陆纳斯达克后,秘密创办鲸鲮科技,研发国产操作系统及平板硬件并主要售往海外。该公司后被字节收购,刘成城及创始团队随之进入字节内部。

入职后他推动了字节对开放式耳机品牌 Oladance 的全资收购(约 5000 万美元),随后主导首款 AI 硬件 Ola Friend 上线。AI 眼镜项目因硬件同质化于今年 2 月内部叫停后,Ocean 团队的战略重心已转向豆包手机助手,这款能在系统层跨应用执行复杂任务的产品被视为字节 AI 硬件线真正的突破口。Flow 团队(含 Ocean)在字节内部拥有与抖音团队平级的优先级。

信源:https://mp.weixin.qq.com/s/WhgrPVqoHX8GNgjAZJ6LKw
🎉1
不只是调用:苹果可在自家机房把Gemini蒸馏成iPhone小模型

苹果与谷歌的 AI 合作协议「远比外界此前了解的更深」。苹果在自有数据中心内拥有对 Gemini 大模型的完整访问权限,可将其蒸馏为适配特定任务的小模型,甚至缩小到能直接在苹果设备端运行。

由于拥有完整模型访问权,苹果的蒸馏不仅能模仿 Gemini 输出的答案,还能学习其内部推理计算过程,生成性能接近原始大模型但算力需求大幅降低的小模型。知情人士称苹果获得了「远超预期的自由度」。苹果内部的 Foundation Models 团队仍在自研模型,但目标方向尚不明确。报道同时确认,苹果计划在今年 6 月 WWDC 上发布 Siri 重大升级,包括对话记忆和基于场景的主动建议功能。

信源:https://www.theinformation.com/newsletters/ai-agenda/apple-can-distill-googles-big-gemini-model
Meta一天内裁员700人:Reality Labs再遭重创,今年已累计裁逾千人

Meta 周三确认裁员约 700 人,波及 Reality Labs、Facebook、招聘、销售和全球运营等多个部门,部分员工将获得内部转岗机会。今年 1 月 Meta 已裁撤 Reality Labs 超 1000 个岗位(约占该部门 10%),两轮裁员集中冲击元宇宙团队,显示 Meta 正系统性将资源从元宇宙转向 AI。

Meta 发言人称各团队「定期进行重组或调整,以确保处于实现目标的最佳位置」。裁员消息与前一日披露的高管巨额期权激励计划形成鲜明对比。截至 2025 年底 Meta 约有 7.9 万名员工,2026 年资本开支指引为 1150 亿至 1350 亿美元,绝大部分用于 AI 基础设施。

信源:https://www.nytimes.com/2026/03/25/technology/meta-layoffs-ai-executives.html