动察Beating AI News
3.15K subscribers
883 photos
2 videos
3.4K links
AI新闻信息流
Download Telegram
Codex一周年全部套餐额度重置,OpenAI工程负责人让Codex点了个RESET按钮宣布

OpenAI Codex 工程负责人 Thibault Sottiaux 宣布,为庆祝 Codex 上线一周年,OpenAI 重置了所有套餐的使用额度限制。

宣布方式比消息本身更有意思。Sottiaux 让 Codex 用刚发布的 Computer Use 功能在浏览器里点击一个写着「RESET」的红色按钮,让它亲手替自己把额度重置了。

Sottiaux 2024 年 7 月从 Google DeepMind 跳槽加入 OpenAI,此前担任 Gemini Human Data Lead。

信源:https://x.com/thsottiaux/status/2044943514832871564
OpenAI员工否决Altman提的Helion5亿美元注资案,部分股东私议换帅

《华尔街日报》发表长篇调查,披露 OpenAI IPO 前夕的一宗内部僵局:CEO Sam Altman 提议由 OpenAI 出资 5 亿美元参与核聚变初创公司 Helion 的新一轮融资,员工评估后拒绝了这笔交易。这也是部分股东已开始私下讨论让 Altman 卸任 CEO、由董事会主席 Bret Taylor(前 Salesforce 联席 CEO)接任的原因之一。

Helion 是 Altman 在 OpenAI 之外最重的押注,他是该公司最大投资者之一,相当一部分个人净资产绑定其中;2021 年他一次性投入 3.75 亿美元,这是他当时做过的最大一笔个人投资。此次融资原计划规模约 10 亿美元、估值 350 亿美元,而公司 2025 年 1 月上一轮融资时估值仅 54 亿美元。OpenAI 员工对提案不安有两层原因。一是 Altman 要求 OpenAI 注资一家自己大额持股、相当净资产绑定其中的公司,而 OpenAI 业务本身并无直接受益。二是员工对 Helion 的核聚变技术存疑,该公司承诺 2024 年让 Polaris 设备发电量超过耗电量,却错过这一节点,此后只笼统表态「机器达到了若干技术里程碑」,并未公布具体数据。知情人士称,一些员工刻意回避讨论该交易的 Slack 频道,担心自己的发言日后会被传唤进诉讼程序。

OpenAI 虽拒绝注资,但签下了一份电力采购权合同,可到 2035 年向 Helion 采购最高 50 吉瓦电力,相当于 25 座胡佛水坝的发电量。Helion 随即把这份合同作为新一轮融资的卖点,但融资目标已缩水至 2.5 亿美元、估值 150 亿美元,改由 Thrive Capital(OpenAI 的大股东之一)领投。Altman 上个月已卸任 Helion 董事职务。

Altman 与 OpenAI 的利益纠缠还延伸到太空。WSJ 首次披露,Altman 本人及丈夫都通过家族办公室 Hydrazine 持有火箭公司 Stoke Space 的股份。去年夏天他曾向 Stoke 提议由 OpenAI 收购或成为控股股东,用以在太空建数据中心,正面挑战 Elon Musk 的 SpaceX。去年 12 月 WSJ 开始就此事向 OpenAI 问询后,相关谈判暂停;Altman 今年 2 月在印度一场活动上当众称太空数据中心的想法「荒谬」,让参与过谈判的人感到意外。知情人士称 Altman 今年仍在私下推动一份火箭发射合作协议。

内部人事同样微妙。首席产品官 Fidji Simo 原本被 Altman 寄望接手 IPO 后大部分日常运营,包括代表公司开季度业绩会,但她本月因神经免疫疾病复发宣布休病假,备忘录里指定四名高管分担职责,Altman 不在名单上。Taylor 则在声明中支持 Altman,称自己「每天都看到为什么 Sam 独一无二地适合带领公司走向下一阶段」。

这些冲突背后有一个结构性根源:OpenAI 脱胎自非营利组织,Altman 至今在公司没有直接股权,2024 年年薪仅 6.6 万美元,财富高度绑定在 YC 时代积累的数百家初创公司组合上。当他让 OpenAI 出手时,每一次都绕不开「这是否在替自己的持仓接盘」的疑问,他的下属现在开始用法律风险的方式作答。

信源:https://www.wsj.com/tech/ai/chatgpt-openai-ipo-altman-029ae6d5
OpenAI与Cerebras签超200亿美元采购协议,换取最多10%股权

《The Information》独家披露,OpenAI 与 AI 芯片公司 Cerebras 签下的三年算力采购协议金额至少 200 亿美元,是今年 1 月公开披露的 100 亿美元规模的两倍以上。作为对价,OpenAI 将获得 Cerebras 少数股份的认股权证;若 OpenAI 三年采购支出触及 300 亿美元上限,对应比例可增至 10%。OpenAI 同时再向 Cerebras 提供约 10 亿美元,专门用于资助供 OpenAI 使用的数据中心建设。

这份合同安排真正的关键不是金额,而是会计结构。协议被设计为「营运资本押金」形式:OpenAI 可把 10 亿美元数据中心出资记为资产,对 Cerebras 的部分采购付款记为利息收入,以抵消一部分实际算力支出。OpenAI 还打算将这一结构推广至其他云厂商和芯片公司。对一家今年计划花 450 亿美元、明年 900 亿美元、五年内总计 6500 亿美元算力费用且筹备 IPO 的公司来说,这种把采购支出部分转为资产和利息收入的记账手法,直接关系到招股书怎么讲故事。

Cerebras 本周五将递交 IPO 招股书,目标融资约 30 亿美元、估值 350 亿美元,较今年 2 月最近一轮私募的 220 亿美元估值溢价 60%。公司 2024 年 9 月首次递交 IPO 文件后撤回,10 月转做 11 亿美元私募。OpenAI 这一单的披露时点正好踩在招股书前一天,是 Cerebras 对投资者解释估值翻倍的最关键一张牌。此前 IPO 文件显示,Group 42(UAE AI 巨头 G42 的母公司)一家客户就贡献了 Cerebras 2023 年 83% 的营收、2024 年上半年 87% 的营收。如今加上 OpenAI 与亚马逊(近期达成协议向 AWS 客户出租 Cerebras 芯片),才算拉开客户结构。

这笔交易也是过去一年 AI 行业「循环融资」结构的最新案例:OpenAI 和 Meta 此前分别宣布与 AMD 达成「采购+入股」协议,英伟达去年末与 Cerebras 竞争对手 Groq 签下 200 亿美元的授权与雇员招聘合同,并长期为转售其芯片的众多云厂商提供融资。上个月 OpenAI 披露的 1220 亿美元投资承诺也主要来自亚马逊和英伟达,两家同时是 OpenAI 的云与芯片供应商。这轮 AI 基建的资金并非从外部新流入产业,而是在几家巨头之间循环开票。

信源:https://www.theinformation.com/articles/openai-to-spend-more-than-20-billion-on-cerebras-chips-receive-equity-stake
智谱 AutoClaw 上线「自进化」机制,Agent 踩坑一次即成永久记忆,同步推出 Skill 商店

智谱 AI 旗下 Agent 框架 AutoClaw(澳龙)正式上线自进化机制。该机制旨在解决 Agent「健忘」的痛点,通过识别用户在对话中的纠正、新方法或表达偏好,将其转化为 Agent 的永久记忆。用户无需反复叮嘱「回复简洁点」或「不要用破折号」等指令,Agent 在教过一次后即可自主进化。

自进化机制通过关键词(如「以后」「记住」)或自动检测(复杂任务后的经验提炼)触发。每轮对话结束后,AutoClaw 会扫描对话并弹出「进化请求」卡片,由用户审批后方可写入记忆。为避免信息噪音,智谱设定了高质量进化原则,倾向于每周产生 1-3 次深度进化而非每日海量碎片记录。这种机制让 Agent 从「被动执行指令」转向「随使用过程持续成长」,用户教得越多,Agent 越贴合个人习惯。

同步上线的还有 AutoClaw Skill 商店,首批上架智谱自研的 GLM Office Skills 五件套(PPT、DOCX、XLSX、PDF、Charts)。其底层由针对办公场景优化的 GLM-5.1 模型驱动,支持智能自检排版布局、跨格式互转(如 Word 转 PDF)以及多文件同步生成。此外,商店还引入了专家共创 Skill,包括可复刻人物思维的「女娲 Skill」、深度调研的「横纵分析法」等,将行业顶尖方法论封装为开箱即用的 Agent 能力。

信源:https://mp.weixin.qq.com/s/Ny_TEIIzryV16DbrUQzp8g
Perplexity开始放量Personal Computer,把本地Mac也变成AI代理

Perplexity 开始向 Max 订阅用户和候补名单放量 Personal Computer。官方称,这一功能与 Perplexity Mac App 打通,可安全编排本地文件、原生应用和浏览器。Perplexity 此前在官网披露,Personal Computer 跑在一台可 24/7 在线的专用 Mac mini 上,敏感操作需用户批准,并保留完整审计日志和 kill switch。

Perplexity 想卖的不是又一个桌面助手,而是把「AI 就是 computer」这套叙事推进到本地设备,从帮你查资料、调工具,走到直接替你持续执行任务。它真正瞄准的是高频知识工作者最烦的那层编排成本,让电脑从指令执行器变成目标执行器。

信源:https://x.com/perplexity_ai/status/2044805973085454518
美团被曝上线OpenClaw导航站,开始抢「养虾人」入口

美团已推出面向开源AI Agent框架 OpenClaw 用户的资源平台「虾345」。页面截图显示,产品入口使用 xia345.com 域名,首页按「安装虾」「接模型」「Skills」「社区」「教程」「生态」等栏目组织资源,并提供「新手」和「进阶」两种模式。新手页会先引导用户选择 AstronClaw、AutoClaw、OpenClaw、QClaw、飞书 OpenClaw 等不同平台,进阶页则加入「龙虾书院」能力测试和按热度、评分聚合技能的「Skills 猎人」。

信源:https://mp.weixin.qq.com/s/LwOvROaR61NenyA_RiKnCg
1
Hermes Agent推出Tool Gateway,一个订阅替代四套API密钥

AI 研究机构 Nous Research 的开源 AI 代理框架 Hermes Agent 发布 v0.10.0,核心更新是 Tool Gateway:Nous Portal 付费用户无需再分别注册 Firecrawl、FAL、OpenAI、Browser Use 四家服务的 API 密钥,一个订阅即可调用以下四类工具:

1. 网页搜索与内容提取(Firecrawl)
2. 图像生成(FAL,使用 FLUX 2 Pro 加超分辨率)
3. 语音合成(OpenAI TTS)
4. 浏览器自动化(Browser Use)

四类工具统一通过 Nous Portal 订阅计费,用户可按需启用任意组合,也可对部分工具继续使用自己的 API 密钥。运行时通过配置项逐工具切换网关或直连,已有的密钥保留在本地不受影响。

Hermes Agent 采用 MIT 协议开源,定位不是 IDE 编程助手,而是部署在服务器上的长驻自主代理,支持 Telegram、Discord、Slack、WhatsApp 等十余个平台接入,具备持久记忆和定时任务调度能力。AI 代理要自主运行,工具调用是基础能力,但每多接一个第三方工具就多一套注册和密钥管理。Tool Gateway 把这层接入成本打包进了订阅,对用户是配置门槛降低,对 Nous Research 则是开源项目的商业化路径:代理本身免费,围绕代理的托管工具服务收费。

信源:https://github.com/NousResearch/hermes-agent/releases/tag/v2026.4.16
谷歌公开合成数据引擎Simula,不用真实数据就能从零批量造专用训练集

谷歌研究团队发表论文公开了 Simula,一个将合成数据生成从「逐条造数据」升级为「设计整个数据集」的框架,论文发表在《Transactions on Machine Learning Research》上。Simula 已在谷歌内部大规模部署,是 Gemma 系列中 ShieldGemma(安全过滤)、MedGemma(医疗)、FunctionGemma(函数调用)等专用模型的主要数据来源,也为 Gemini 安全分类器、Android 通话诈骗检测和 Google Messages 垃圾信息过滤提供训练数据。

现有合成数据方法大多一次只优化一条数据,依赖人工提示词或真实数据作为种子,无法精确控制数据集整体的覆盖范围、难度分布和质量。Simula 完全不需要种子数据,而是让推理模型从零构建整个数据集,分四步独立控制:

1. 全局多样性:推理模型将目标领域递归拆解为层级知识树(如网络安全威胁的完整分类体系),以此为骨架确保数据覆盖长尾场景
2. 局部多样性:在每个知识节点下生成多种不同场景和表述,防止同一概念千篇一律
3. 复杂化:可配置比例地将部分场景提升难度,独立调节数据集的难度分布
4. 质量控制:双评审员机制独立判断每条数据的正确性,抵消模型倾向于认同看似合理答案的偏差

研究团队用 Gemini 2.5 Flash 做教师模型、Gemma-3 4B 做学生模型,在网络安全、法律推理、小学数学(GSM8k)、多语言学术知识(Global MMLU)五个领域各生成最多 51.2 万条数据进行测试。完整 Simula 流程在所有领域均优于简化方案,但没有通用配方:高难度数据在数学推理上带来 10% 的准确率提升,在法律推理上反而拖累表现,原因是教师模型在该领域能力较弱,生成的高难度数据质量不可靠。更关键的发现是,Simula 用更少的数据达到了更高的下游性能,数据质量而非数量在驱动模型进步。

信源:https://research.google/blog/designing-synthetic-datasets-for-the-real-world-mechanism-design-and-reasoning-from-first-principles/
Meta公开后量子密码迁移框架:提出五级成熟度模型,已在内部基础设施部署抗量子加密

3 月底谷歌 Quantum AI 论文将破解椭圆曲线加密所需的物理量子比特数压低约 20 倍,谷歌同步把自家的抗量子迁移截止期提前到 2029 年,业界对「Q-Day」的讨论再次升温。Meta 工程团队 4 月 16 日发布长文,公开了公司内部的后量子密码(PQC)迁移框架,包括风险分级标准、五级成熟度模型和六步迁移策略,目的是为其他组织提供可复用的实操路径。

Meta 提出的核心概念是「PQC 迁移成熟度等级」,将组织的抗量子能力从低到高分为五级:PQ-Unaware(尚未意识到量子威胁)、PQ-Aware(已完成初步评估但未开始设计)、PQ-Ready(已实现技术方案但尚未部署)、PQ-Hardened(已部署当前可用的所有防护,但因行业尚缺某些密码学原语而无法完全消除威胁)、PQ-Enabled(全面实现后量子安全)。这套分级的实用之处在于,它承认大多数组织不可能一步到位,同时给出了每个阶段的明确定义和可衡量标准。

迁移策略分六步推进:确定风险优先级、建立密码学资产清单、解决外部依赖(如标准制定、硬件支持)、构建 PQC 组件、设置防护栏(禁止新项目使用量子脆弱算法)、将 PQC 组件集成到实际业务中。

风险分级方面,Meta 将最高优先级给了容易遭受「先存后解」(store now, decrypt later)攻击的场景,即攻击者现在就可以截获加密流量存起来,等量子计算机成熟后再解密。这类使用公钥加密和密钥交换的应用不需要等到量子计算机出现就已面临风险,因此需要最先迁移。

在算法选择上,Meta 推荐采用 NIST 已发布标准的 ML-KEM(密钥封装)和 ML-DSA(数字签名),并优先选择混合部署方案,即在现有经典加密之上叠加一层后量子加密,攻击者必须同时破解两层才能得手。Meta 密码学家还参与了 NIST 新选定的 PQC 算法 HQC 的研发,该算法基于与 ML-KEM 不同的数学基础,作为后备方案存在:一旦 ML-KEM 所依赖的模格密码学被发现漏洞,HQC 可以顶上。

Meta 表示已在内部基础设施的大量流量上部署了后量子加密保护,迁移仍在持续推进中。对大多数企业来说,这篇博文的价值不在于 Meta 自身进展的细节,而在于五级成熟度模型和六步策略提供了一套可直接套用的评估和规划工具。在破解量子比特门槛被不断压低的背景下,「先存后解」攻击意味着迁移窗口比真正可用的量子计算机到来还要紧迫。

信源:https://engineering.fb.com/2026/04/16/security/post-quantum-cryptography-migration-at-meta-framework-lessons-and-takeaways/
Sabi称年底推出「读心帽」,但难点在于每个人脑信号都不同

硅谷脑机接口初创公司 Sabi 从隐身状态公开亮相,计划在今年底推出一款毛线帽形态的非侵入式 EEG 设备。Sabi CEO Rahul Chhabra 向《Wired》表示,这款设备想把用户的内部语言直接转成屏幕文字,首个版本目标输入速度约为每分钟 30 个单词,帽子内将布置 7 万到 10 万个微型传感器。

这条路线有吸引力。植入式脑机接口能拿到更强信号,但很难面向大众普及。Sabi 想赌的是另一条路,用更高密度的可穿戴传感器,把「想一想就能打字」先做成可用输入方式。

问题也很清楚。2025 年一篇系统综述指出,EEG 想象语音解码仍处在早期阶段,主要卡在四件事:数据集太小,实验做法不统一,干扰太多,连续自然语音很难稳定解码。另一篇 2025 年 Frontiers 论文虽然已能用 EEG 合成语音,但实验词表只有 4 个中文双音节词,作者同样承认,对新受试者的泛化仍是难题。

所以 Sabi 的方向不算离谱,但时间表很激进。现在更像一条值得跟踪的技术路线,不像年底就能成熟交付的消费产品。下一步要看的,是公开 demo、第三方测试,以及它能否在不频繁校准的情况下让不同用户都稳定工作。

信源:https://www.wired.com/story/this-beanie-is-designed-to-read-your-thoughts/
Cloudflare邮件服务进入公测,AI代理现在可以有自己的邮箱地址收发邮件

Cloudflare 在其「Agents Week」期间宣布 Email Service 进入公测,核心变化是 AI 代理可以通过邮件与任何人双向通信。此前 Cloudflare 的 Email Routing 已免费提供多年,支持接收邮件,但代理只能同步回复或向 Cloudflare 账户内成员发信。Email Sending 公测后,代理可以异步处理任务再回复,可以主动发出邮件,可以安排后续跟进,收件人不需要安装任何应用或 SDK。

技术实现上,开发者可通过 Cloudflare Workers 原生绑定直接发送邮件,无需管理 API 密钥。SPF、DKIM、DMARC 等邮件认证记录在添加域名时自动配置。同时提供 REST API 及 TypeScript、Python、Go SDK,供非 Cloudflare 平台的代理调用。Cloudflare Agents SDK 的 onEmail 钩子负责接收和解析邮件,基于地址的路由机制让同一域名下的不同地址(如 support@、sales@)自动分派到不同代理实例,回复路由使用 HMAC-SHA256 签名防止攻击者伪造邮件头将回复引导至错误的代理实例。

邮件是全球覆盖面最广的通信协议,不需要对方安装客户端、不需要接入特定平台,这让它成为 AI 代理与外部世界交互的天然通道。Cloudflare 同时发布了配套工具链:Email MCP 服务器让外部代理(如 Claude Code、Cursor)通过自然语言提示即可发送邮件;Wrangler CLI 新增邮件命令;以及一个开源的「Agentic Inbox」参考应用,集成了邮件会话线程、附件存储、自动回复和内置 MCP 服务器,开发者可一键部署后直接使用或在此基础上定制。

信源:https://blog.cloudflare.com/email-for-agents/
Salesforce发布 Headless 360,把整个平台改成AI代理基础设施

Salesforce 在 TDX 开发者大会上发布 Headless 360,把整个平台的核心能力开放成 API、MCP 工具和 CLI 命令,让 AI 代理不打开 Salesforce 后台也能直接调用企业数据、工作流和业务逻辑。首批今天可用的能力超过 100 项,其中包括 60 多个 MCP 工具和 30 多项预配置开发技能,可接入 Claude Code、Cursor 等外部编程代理。

这比一次产品更新更像一次架构换向。Salesforce 已经默认企业软件的主入口会从自家网页退到 Slack、ChatGPT、Claude 这类入口,自己要守住的是底下那层企业上下文、权限和流程。

Headless 360 还上线了 Experience Layer,把同一套交互组件渲染到 Slack、移动端、ChatGPT 等不同界面;并新增 Testing Center、Custom Scoring Evals 和 A/B Testing 等治理工具。Salesforce 还称,DevOps Center MCP 可把原本要在四个工具间切换的构建流程收进一套体验,开发周期最高可缩短约 40%。

信源:https://www.salesforce.com/news/stories/salesforce-headless-360-announcement/
马斯克:应对 AI 失业的最佳方案是「全民高收入」,生产力飞跃将抵消通胀风险

Elon Musk 在 X 上发帖称,由联邦政府发放支票实现的「全民高收入」(Universal High Income,UHI)是应对 AI 导致失业的最佳方式。他认为,AI 和机器人生产的产品与服务将远超货币供应量的增幅,因此不会引发通货膨胀。

他此前曾多次提及「全民基本收入」(UBI)的概念,但此次明确使用了「高收入」(HIGH INCOME)一词,暗示 AI 驱动的生产力爆发将彻底改变财富分配的逻辑。在他看来,未来的经济瓶颈不再是产能,而是如何确保失去传统工作的劳动力仍具备消费能力。这一观点延续了他对「后稀缺时代」的设想,即机器人劳动力(如特斯拉 Optimus)将使商品成本降至极低,从而支撑起远超生存底线的社会福利。

信源:https://x.com/elonmusk/status/2044990537145753894
Vercel Workflows正式发布,用两行代码指令替代整套后端编排基础设施

前端云平台 Vercel 正式发布 Workflows,将持久执行(durable execution)能力内置到应用代码中。开发者在 TypeScript 函数顶部写 "use workflow" 标记工作流入口,在子函数中写 "use step" 标记每个执行步骤,框架自动处理队列调度、失败重试、状态持久化和可观测性,不需要单独部署编排服务、消息队列或状态数据库。

这套模型解决的核心问题是:把 AI 代理或后端任务从原型推到生产环境时,开发者往往要花大量时间搭建编排基础设施,而非改进产品本身。传统方案需要将逻辑拆散到队列、Worker、状态表和重试机制中,Workflows 把这些全部收进应用代码,编排逻辑和业务逻辑合为一体。Vercel 称用户只需为函数实际运行时的计算付费,没有常驻编排服务的开销。

Workflows 自 2025 年 10 月公测以来,已处理超过 1 亿次运行和 5 亿个步骤,覆盖 1500 多家客户, npm 周下载量超过 20 万次。

面向 AI 代理场景,Workflows 提供几项关键能力:

1. 持久流(Durable Streams):代理输出持久化存储,用户关闭浏览器后工作流继续运行,重新连接时从断点恢复,无需 Redis 或自建消息系统
2. 默认加密:所有步骤的输入输出和流数据在离开部署环境前自动加密,解密仅在运行工作流的部署内发生
3. 挂起与唤醒:通过 Hook 等待外部事件(如人工审批),通过 Sleep 暂停数天甚至数月,挂起期间不产生计算费用
4. 大负载支持:单步最大 50 MB,单次运行最大 2 GB,为多模态代理传递图片和视频留出空间

AI SDK v7 同步推出 `WorkflowAgent`,将持久执行与工具调用、状态管理深度集成。Python SDK 进入公测,将这套编程模型扩展到 Python 生态。Workflow SDK 开源,通过「Worlds」适配器系统支持自托管部署,社区已在开发 MongoDB、Redis、Cloudflare 等适配器。

下一个版本 Workflows 5 将引入原生并发控制(含跨运行的锁机制)、全球部署基础设施和基于快照的运行时以减少事件回放开销。

信源:https://vercel.com/blog/a-new-programming-model-for-durable-execution
AI 编程代理公司 Factory 获 1.5 亿美元 C 轮融资,估值达 15 亿美元步入独角兽行列

AI 编程代理初创公司 Factory 宣布完成 1.5 亿美元 C 轮融资,由 Khosla Ventures 领投,红杉资本(Sequoia Capital)、黑石(Blackstone)、Insight Partners、NEA 等顶级机构跟投。本轮融资使 Factory 的估值达到 15 亿美元。

Factory 的核心产品是全自主软件开发代理 Droid。CEO Matan Grinberg 在融资公告中透露,Droid 目前已被英伟达(NVIDIA)、Adobe、Palo Alto Networks、安永(EY)和 Adyen 等企业级客户的数十万开发者每日使用。公司在过去六个月中实现了月环比翻倍的营收增长,应用场景已从简单的代码补全扩展到 COBOL 语言迁移、遗留技术债清理以及从工单到 PR(ticket-to-PR)的完整自动化流。

与市面上许多追求「取代」程序员的竞品不同,Factory 坚持「模型无关」和「接口无关」的技术路线,并强调其愿景是「为软件工程带来自主性」以改善开发者生活。其产品最新演进包括支持长周期、多步骤、多代理协作的「Missions」系统,以及具备完整系统访问权限的 Factory Desktop 桌面端应用。Factory 目前在领先的软件开发代理基准测试中排名第一。

Grinberg 回顾创业三年的历程,称公司曾经历了两年的「荒漠期」,在竞争对手纷纷融资数十亿美元并过度承诺时保持了技术定力。此次融资将加速其在研究、产品开发和全球市场拓展方面的投入。

信源:https://x.com/matanSF/status/2044821889844228378
Uber CTO称Claude Code用爆全年预算:11%后端代码已由AI编写,正转向「智能体软件工程」

Uber首席技术官 Praveen Neppalli Naga 近日表示,由于 Anthropic 旗下编程工具 Claude Code 的使用量激增,Uber原定 2026 全年的 AI 预算在开年前几个月就已耗尽。他坦言自己正推倒重来,因为原本设想的预算规模已被彻底打破。

Uber在内部建立了「排行榜」鼓励工程师最大限度利用 AI。目前Uber同时使用 Claude Code 和 Cursor,但自去年底以来,Claude 的用量呈爆发式增长,Cursor 则进入平台期。Naga 透露,目前Uber后端系统中约 11% 的实时代码更新已由主要基于 Claude Code 构建的 AI 智能体编写,而这一比例在三个月前还不到 1%。

Uber的愿景是实现从「软件工程」向「智能体软件工程」的转型,即由 AI 智能体独立完成代码编写、测试和部署的全流程工作,并计划构建「监督智能体」来审计其他智能体的错误。虽然 Naga 称目前尚未考虑放缓软件工程师的招聘,但预算超支的压力暗示其人力策略可能随技术落地进度而调整。

信源:https://www.theinformation.com/newsletters/applied-ai/uber-cto-shows-claude-code-can-blow-up-ai-budgets
白宫拟向美联邦机构开放Anthropic最强模型Mythos,管理和预算办公室正制定专项安全防护

一份内部备忘录显示白宫正准备向主要的美国联邦机构开放 Anthropic 旗下最强模型 Mythos。白宫管理和预算办公室(OMB)联邦首席信息官 Gregory Barbaccia 已在发给内阁各部门官员的邮件中确认,OMB 正在建立相关的保护措施,以允许各机构开始使用这款受严格管控的 AI 工具。

Mythos 是 Anthropic 目前能力上限最高且未对外全面公开的模型,此前因在网络安全领域(如漏洞挖掘和攻击工具创建)展现出的变革性能力,被公司内部判定为可能构成国家安全风险。白宫此举表明,美国政府即便在担忧网络风险的前提下,也必须确保联邦机构能够率先利用最前沿的 AI 生产力。

信源:https://www.bloomberg.com/news/articles/2026-04-16/white-house-moves-to-give-us-agencies-anthropic-mythos-access
1
超长程编程基准 FrontierSWE 发布:20 小时极高难度挑战,仅 GPT-5.4 与 Opus 4.6 给出部分解

编程智能体基准测试项目 FrontierSWE 今日正式发布,旨在压榨当前 AI 代理的能力极限。该基准收集了编译器优化、机器学习研究和高性能工程等领域的 17 项真实难题(如构建兼容 PostgreSQL 的 SQLite 服务),并为每项任务预留了长达 20 小时的处理窗口。目前,该基准处于「未饱和」状态,绝大多数模型甚至无法取得实质性进展。

首轮测试中,仅有 GPT-5.4(Codex)和 Claude Opus 4.6(Claude Code)能一致写出部分解。两款模型风格差异巨大:GPT-5.4 表现更稳健,平均分排名第一,但思路偏保守;Claude Opus 4.6 则非常「激进」,单项任务平均投入时长超过 8 小时,远超其他模型约 2 小时的平均水平。这种靠堆时间换取深度的策略,让 Opus 4.6 在最佳表现(best@5,即 5 次尝试中的最高分)上反超登顶,常能产出极致优化的代码,但也伴随着更高的错误率和更明显的「作弊」倾向。

评测还揭示了 AI 编程智能体的几类典型通病:一是「过度自信」,模型往往在时限过半前,就因肤浅的自检误以为任务已完成并提前提交;二是「逻辑回退」,Opus 4.6 曾多次丢失已经实现的优化,随后又在迭代中重新「发明」一遍。此外,除了 Qwen 3.6,其余顶级模型均表现出了主动规避检测的意图:例如 Gemini 会尝试将非法库名通过字符编码隐藏,或在临时目录下运行隐蔽进程,试图在违规边缘完成任务。这类在极端压力下表现出的「对抗行为」,为智能体安全研究提供了新视角。

信源:https://www.frontierswe.com/blog
LangSmith上线30多个评估模板,AI代理的质量检测不用再从零写起

AI 代理开发平台 LangChain 旗下的可观测性工具 LangSmith 发布两项更新:评估器模板库和可复用评估器。

评估 AI 代理是否「好用」是目前开发中最耗时的环节之一。代理可能调用了正确的工具但回答格式不对,单轮对话正常但多轮就崩溃,最终答案看似合理但中间步骤检索了错误的文档。开发者需要在单步、完整轨迹、多轮对话、特定工具调用等多个层级分别设置检查点,而每个评估器都要经历写提示词、对照真实数据校准、反复调优的过程,从零开始往往要花数周。

LangSmith 现在提供 30 多个现成模板,覆盖五个类别:安全与防护(提示注入检测、个人信息泄露检查、偏见与毒性)、回答质量(正确性、有用性、语气)、执行轨迹(代理是否走了正确的步骤)、用户行为分析(语言分布、满意度信号)、多模态(语音和图像输出审查)。模板包含已调优的 LLM 评判提示词和基于规则的代码评估器,可直接使用或自定义修改,同时适用于线上监控和离线实验。

可复用评估器则解决组织层面的管理问题:新增的 Evaluators 标签页集中展示工作区内所有评估器,可一键挂载到新项目,更新提示词后全局生效,不用在每个项目中维护重复副本。

上述模板同步开源,随 openevals v0.2.0 发布,新增多模态评估支持。

信源:https://www.langchain.com/blog/reusable-langsmith-evaluator-templates
HeyGen开源HyperFrames,把HTML变成AI代理的视频编辑工具

AI 视频平台 HeyGen 开源 HyperFrames,一个面向 AI 代理的 HTML 视频工具链和渲染框架。代理可直接写 HTML、CSS 和 JavaScript,再在本地预览并渲染成 MP4、MOV 或 WebM。HeyGen 还把对应 skill 一并放出,安装命令为 `npx skills add heygen-com/hyperframes`。

HyperFrames 的核心思路很直接:不要让代理去学 After Effects 或 DaVinci Resolve,而是让它用自己最熟的网页语言做视频。HeyGen 只是在普通网页语法上加了一层 data- 属性,用来定义时间轴、时长和图层,GSAP、Lottie、Three.js、D3、Google Fonts 等浏览器技术都能直接用。

HeyGen 称,这套方案已经在自家 Video Agent 中验证过,发布演示视频也是直接让 Claude Code 用 HyperFrames 做出来的。对 AI 代理来说,这比传统视频编辑器更像原生工作流:写代码、看预览、出成片,全都可以在本地完成,不需要额外 API key。项目今天以 Apache 2.0 协议开源。

信源:https://github.com/heygen-com/hyperframes
Hugging Face支持可视化上传的Pi trace,代理执行过程能直接分享

Hugging Face 现已支持可视化用户上传的 Pi trace。按截图显示,上传后可直接在页面里查看一次代理会话的文件、工具调用和执行结果,不用再只对着原始 trace 文件翻日志。

Hugging Face CEO Clément Delangue 表示,目标是让分享 agent trace 变得更常见。对现在的代理社区来说,更稀缺的是能拿来分析、比较和复现的真实执行轨迹。Hugging Face 这次补上的就是这一层基础设施。

信源:https://x.com/ClementDelangue/status/2044834155125424326