动察Beating AI News
3.15K subscribers
883 photos
2 videos
3.4K links
AI新闻信息流
Download Telegram
OpenAI Codex大更新:可直接操控Mac桌面,能跨天自动醒来继续干活

OpenAI 发布 Codex 重大更新,目前每周有超过 300 万开发者使用这款产品。此次更新的核心变化是 Codex 不再局限于写代码,开始介入软件开发的全流程。

最大的功能跃迁是「后台电脑操控」:Codex 现在可以直接在 Mac 上看屏幕、点鼠标、敲键盘,操作任何应用程序,且多个代理可并行工作,各用各的光标,不干扰用户正在做的事情。对开发者来说,这意味着迭代前端界面、测试应用或操作没有 API 的工具时,不用再手动截图描述,代理自己看着办。

应用内新增浏览器,用户可以直接在页面上标注评论给代理下指令,适合前端和游戏开发中的快速迭代。图片生成方面集成了 gpt-image-1.5,可在同一工作流中生成产品概念图、UI 设计稿和游戏素材。新增超过 90 个插件,覆盖 Atlassian Rovo(JIRA 管理)、CircleCI、CodeRabbit、GitLab Issues、Microsoft Suite、Neon by Databricks 等开发工具链。

自动化能力的扩展更值得关注。Codex 现在可以复用已有对话线程保留上下文,自行安排未来任务并自动唤醒继续执行,时间跨度可达数天甚至数周。同时推出记忆功能预览版,能记住用户的偏好、纠正和历史操作中积累的信息,让后续任务完成得更快。Codex 还会基于项目上下文、已连接的插件和记忆,主动建议用户从哪里开始一天的工作或接续之前的项目,比如识别 Google Docs 中待处理的评论,拉取 Slack、Notion 和代码库的相关上下文,生成优先级排序的行动清单。

开发者工作流方面新增 GitHub PR 评审评论处理、多终端标签页、通过 SSH 连接远程 devbox(alpha 阶段),以及侧边栏文件预览(支持 PDF、电子表格、幻灯片和文档)。

这些更新正在向已登录 ChatGPT 的 Codex 桌面端用户逐步推送。记忆和主动建议功能将稍后面向企业版、教育版及欧盟/英国用户开放,电脑操控目前仅支持 macOS。

信源:https://openai.com/index/codex-for-almost-everything/
👍1
Anthropic被曝筹备AI设计工具,Instagram联合创始人退出Figma董事会避嫌

Anthropic 首席产品官 Mike Krieger 4 月 14 日辞去界面设计公司 Figma 的董事席位,Figma 当日向美国证券交易委员会(SEC)披露了这一变动。同一天,《The Information》独家报道称 Anthropic 正在筹备 AI 设计工具,将与 Figma 的核心产品直接竞争。Krieger 加入 Figma 董事会不到一年。

Krieger 此前联合创办了 Instagram 和 AI 新闻应用 Artifact,2024 年出任 Anthropic 首席产品官。Figma 是全球最主流的 UI/UX 设计工具,此前与 Anthropic 深度合作,将 Claude 模型集成到自家产品中作为设计助手。如今合作方变成了竞争对手,Anthropic 不再满足于做嵌入他人产品的基础设施层,开始向应用层扩张。

这是今年投资者口中「SaaS 末日论」(SaaSpocalypse)的最新案例:头部 AI 实验室凭借基础模型优势亲自下场做应用,挤压传统软件公司的空间。iShares 主要软件 ETF(IGV)年内已跌近 18%。不过 Figma 股价在消息公布后反而上涨约 5%,市场尚未认定 AI 实验室能真正复制成熟设计工具多年积累的专业工作流和客户关系。

信源:https://techcrunch.com/2026/04/16/anthropic-cpo-leaves-figmas-board-after-reports-he-will-offer-a-competing-product/
OpenAI网络安全联盟首批名单公布:华尔街六大行集体加入,1000万美元资助开源安全

OpenAI 公布「网络安全可信访问」(Trusted Access for Cyber)计划的首批合作机构。14 家机构中,华尔街占了近一半:美国银行、贝莱德、纽约梅隆银行、花旗、高盛、摩根大通、摩根士丹利,加上网络安全公司 CrowdStrike、Zscaler、SpecterOps、iVerify,以及思科、英伟达、甲骨文。这些机构将获得 GPT-5.4-Cyber 的访问权限,用于各自数字基础设施的安全防御。

金融机构扎堆并不意外。银行是全球遭受网络攻击最密集的行业之一,安全团队规模大、预算充足、对新工具的采纳速度快,也最有动力在 AI 安全工具的早期阶段就参与进来争取影响力。纽约梅隆银行首席信息官 Leigh-Ann Russell 在声明中称,该行正与「推动这些努力的前沿力量」密切合作。

同时,OpenAI 宣布通过「网络安全资助计划」投入 1000 万美元 API 额度,面向开源安全和漏洞研究团队。首批受资助方包括软件供应链安全公司 Socket 和 Semgrep,以及漏洞研究机构 Calif 和 Trail of Bits。OpenAI 在博文中提到,并非每个组织都有全天候安全团队能在漏洞「周五晚间披露」时及时响应,这正是资助计划想解决的问题。

OpenAI 还向美国 AI 标准与创新中心(CAISI)和英国 AI 安全研究所(UK AISI)提供了 GPT-5.4-Cyber 访问权限,供两家机构评估模型的网络安全能力和安全防护措施。

信源:https://openai.com/index/accelerating-cyber-defense-ecosystem/
Claude Code配合Opus 4.7用法大改:别当结对编程搭档用,把整个任务一次交出去

Claude Code 之父 Boris Cherny 发布 Claude Code 配合 Opus 4.7 的使用指南,核心建议是改变交互方式:把 Claude 当作你委派任务的工程师,而非逐行指导的结对编程搭档。因为 Opus 4.7 在每次用户发言后会进行更多推理以提升连贯性和指令遵循能力,但副作用是每多一轮对话都会增加 token 开销。最高效的用法是在第一轮就把任务意图、约束条件、验收标准和相关文件位置说清楚,然后放手让模型执行。

Opus 4.7 不再支持固定思考预算(Extended Thinking with fixed budget),取而代之的是「自适应思考」,即模型自行判断每一步是否需要深度推理,简单查询快速回复,复杂问题才投入思考 token。用户仍可通过提示词调节思考深度,如「这个问题比看起来难,请逐步思考」或「优先快速回复,不必深度推理」。

Opus 4.7 默认调用工具更少、启动子代理更保守、回复长度随任务复杂度自动调节(简单问题比 Opus 4.6 更简短)。这些变化在多数场景下能产生更好的结果,但如果工作流依赖频繁的文件搜索或并行子代理,需要在提示词中明确指示。Claude Code 的默认推理等级已从 high 提升至新增的 xhigh(介于 high 和 max 之间),Anthropic 建议大多数编程和代理任务使用该等级。
信源:https://claude.com/blog/best-practices-for-using-claude-opus-4-7-with-claude-code
谷歌与五角大楼谈机密Gemini部署,条款复刻Anthropic拒绝的OpenAI模板

谷歌正与美国国防部谈判,拟允许五角大楼在机密环境中部署 Gemini AI 模型。两名直接了解谈判的知情人士向《The Information》透露,双方已接近达成协议。这是谷歌自 2018 年因员工抗议退出 Project Maven(军方将 AI 用于无人机目标识别的项目)以来对军方立场的重大逆转。

协议允许将谷歌 AI 用于「所有合法用途」,但谷歌提议加入额外条款,禁止用于国内大规模监控或自主武器(包括没有『适当』人类监督和控制的目标识别)。这套措辞几乎复刻了 OpenAI 今年早些时候与五角大楼签署的协议。OpenAI CEO Sam Altman 当时曾要求五角大楼对所有 AI 公司给予相同条款。

OpenAI 合同生效时就有律师指出其结构性漏洞:看似禁止全自主致命武器和国内大规模监控的措辞,会被同样写入合同的「所有合法用途」覆盖。谷歌提议的条款面临同样问题。

而这两项安全承诺,正是今年 2 月 Anthropic 与五角大楼公开决裂的核心。Anthropic CEO Dario Amodei 拒绝放弃对全自主致命武器和国内大规模监控的禁令,五角大楼随后将 Anthropic 列为「供应链风险」,经六个月过渡期后将其排除出军方新合同。Anthropic 已就该指定发起两起诉讼,供应链风险状态目前仍然生效。多位国防部官员对 Amodei 抱有敌意,相比之下谷歌在五角大楼的口碑正在回暖。

机密部署谈判不是孤立事件。2025 年初特朗普二任上台后,谷歌改写了 AI 原则,删除了对武器和监控的明确禁令。此后军方订单陆续到账:2025 年 7 月拿下五角大楼首席数字与 AI 办公室最高 2 亿美元的 AI 试点合同,12 月 Gemini 成为军方非机密 AI 平台 GenAI.mil 接入的首个模型,今年 3 月宣布为五角大楼提供 AI agents 产品自动化非机密工作。机密部署是这条路线图最后一块拼图。

内部的张力从未消失。谷歌首席 AI 科学家 Jeff Dean 此前在 X 上公开反对将 AI 用于大规模监控或自主武器,200 多名谷歌员工曾联署致信他,Dean 与近 40 名谷歌和 OpenAI 员工还在 Anthropic 起诉五角大楼的案件中签署了支持 Anthropic 的法庭之友简报。

信源:https://www.theinformation.com/articles/google-pentagon-discuss-classified-ai-deal-company-rebuilds-military-ties
OpenClaw新版把Claude默认模型升到Opus 4.7,Google插件补上Gemini语音合成

开源 AI Agent 框架 OpenClaw 发布 v2026.4.15,真正值得用户关注的变化只有两处:把 Anthropic 一侧的默认模型指向昨天才发布的 Claude Opus 4.7,以及给 Google 插件补上 Gemini 文本转语音能力。

修复里有一条和安全相关的值得拎出来:本地 MEDIA: 工具结果的信任放通此前只认工具名,客户端只要声明一个与内置工具同名的工具定义,就能借机继承本地媒体的信任权限。v2026.4.15 把放通严格绑定到本次运行中已注册的内置工具原始名,并拒绝任何与内置或同请求内其他客户端工具重名的定义,HTTP 与 SSE 路径均返回 `400 invalid_request_error`。

其余修复还包括:CLI 升级时清理过期的 dist chunk、遗留 openai-codex 条目自动修复到正确的 Codex 传输路径、BlueBubbles 插件在 Node 22+ 下恢复入站图片附件下载、默认启动与 skills 提示预算下调以降低长会话上下文占用。

信源:https://github.com/openclaw/openclaw/releases/tag/v2026.4.15
Anthropic修复Opus 4.7限额BUG重置订阅配额,节制用户反而吃亏

Anthropic 开发者账号 @ClaudeDevs 在 X 上宣布修复一个 BUG:Claude 订阅的 5 小时与每周用量限额在处理 Opus 4.7 长上下文请求时统计有偏差,作为补偿已重置这两项限额。

修复呼应了近期用户的持续抱怨。Opus 4.6 支持 1M 上下文以来,GitHub 上积累了多条 Max/Pro 订阅用户的 BUG 报告,反映配额余量明显充足时,切换到 1M 上下文模式仍会立即弹出「Rate limit reached」。Opus 4.7 昨日发布又引入了新分词器,Anthropic 在迁移说明中承认相同输入可能消耗 1.0 至 1.35 倍 token,叠加计费偏差,实际扣掉的配额比用户感知的要多。

但补偿动作在一部分重度用户那里引发了反向不满。Claude 的每周限额以 7 天为一个周期,归零日期取决于账户各自的起始日而非统一周一。X 用户 Scott(@Dorizzdt)在推文中展示了这种错位带来的荒诞:他本周已刻意把使用率压在 43-47%,距离自然归零还剩约 24 小时,原本计划今天集中冲刺消耗剩余的 57%,再衔接下周满血启动。强制重置把已消耗的 43% 一笔勾销的同时,新的 7 天计时也从此刻立即重启,他今天再使用的任何额度都会一直挂在未来 7 天的窗口里。

换算下来,他本可以在 8 天内跑完「本周剩余 57% + 下周满血 100%」合计约 157% 的用量,现在被压缩成未来 7 天最多 100%。对一直满额消耗的用户,这次重置是纯福利;对像他这样刻意节制、等着攒到最后一天或换周再冲刺的用户,Anthropic 所谓的「补偿」反而抢走了他们攒出来的周差价。

这条插曲暴露了 Claude 订阅限额机制一个反直觉的特征:7 天周期对节制用户不友好,官方统一重置等同于「清零历史使用 + 重启计时器」,对挤爆配额的用户是恩惠,对克制用户则是强行预支未来额度。最稳妥的策略反而是:把当期配额尽快用完,不要攒。

信源:https://x.com/ClaudeDevs/status/2044868953206612154
Codex一周年全部套餐额度重置,OpenAI工程负责人让Codex点了个RESET按钮宣布

OpenAI Codex 工程负责人 Thibault Sottiaux 宣布,为庆祝 Codex 上线一周年,OpenAI 重置了所有套餐的使用额度限制。

宣布方式比消息本身更有意思。Sottiaux 让 Codex 用刚发布的 Computer Use 功能在浏览器里点击一个写着「RESET」的红色按钮,让它亲手替自己把额度重置了。

Sottiaux 2024 年 7 月从 Google DeepMind 跳槽加入 OpenAI,此前担任 Gemini Human Data Lead。

信源:https://x.com/thsottiaux/status/2044943514832871564
OpenAI员工否决Altman提的Helion5亿美元注资案,部分股东私议换帅

《华尔街日报》发表长篇调查,披露 OpenAI IPO 前夕的一宗内部僵局:CEO Sam Altman 提议由 OpenAI 出资 5 亿美元参与核聚变初创公司 Helion 的新一轮融资,员工评估后拒绝了这笔交易。这也是部分股东已开始私下讨论让 Altman 卸任 CEO、由董事会主席 Bret Taylor(前 Salesforce 联席 CEO)接任的原因之一。

Helion 是 Altman 在 OpenAI 之外最重的押注,他是该公司最大投资者之一,相当一部分个人净资产绑定其中;2021 年他一次性投入 3.75 亿美元,这是他当时做过的最大一笔个人投资。此次融资原计划规模约 10 亿美元、估值 350 亿美元,而公司 2025 年 1 月上一轮融资时估值仅 54 亿美元。OpenAI 员工对提案不安有两层原因。一是 Altman 要求 OpenAI 注资一家自己大额持股、相当净资产绑定其中的公司,而 OpenAI 业务本身并无直接受益。二是员工对 Helion 的核聚变技术存疑,该公司承诺 2024 年让 Polaris 设备发电量超过耗电量,却错过这一节点,此后只笼统表态「机器达到了若干技术里程碑」,并未公布具体数据。知情人士称,一些员工刻意回避讨论该交易的 Slack 频道,担心自己的发言日后会被传唤进诉讼程序。

OpenAI 虽拒绝注资,但签下了一份电力采购权合同,可到 2035 年向 Helion 采购最高 50 吉瓦电力,相当于 25 座胡佛水坝的发电量。Helion 随即把这份合同作为新一轮融资的卖点,但融资目标已缩水至 2.5 亿美元、估值 150 亿美元,改由 Thrive Capital(OpenAI 的大股东之一)领投。Altman 上个月已卸任 Helion 董事职务。

Altman 与 OpenAI 的利益纠缠还延伸到太空。WSJ 首次披露,Altman 本人及丈夫都通过家族办公室 Hydrazine 持有火箭公司 Stoke Space 的股份。去年夏天他曾向 Stoke 提议由 OpenAI 收购或成为控股股东,用以在太空建数据中心,正面挑战 Elon Musk 的 SpaceX。去年 12 月 WSJ 开始就此事向 OpenAI 问询后,相关谈判暂停;Altman 今年 2 月在印度一场活动上当众称太空数据中心的想法「荒谬」,让参与过谈判的人感到意外。知情人士称 Altman 今年仍在私下推动一份火箭发射合作协议。

内部人事同样微妙。首席产品官 Fidji Simo 原本被 Altman 寄望接手 IPO 后大部分日常运营,包括代表公司开季度业绩会,但她本月因神经免疫疾病复发宣布休病假,备忘录里指定四名高管分担职责,Altman 不在名单上。Taylor 则在声明中支持 Altman,称自己「每天都看到为什么 Sam 独一无二地适合带领公司走向下一阶段」。

这些冲突背后有一个结构性根源:OpenAI 脱胎自非营利组织,Altman 至今在公司没有直接股权,2024 年年薪仅 6.6 万美元,财富高度绑定在 YC 时代积累的数百家初创公司组合上。当他让 OpenAI 出手时,每一次都绕不开「这是否在替自己的持仓接盘」的疑问,他的下属现在开始用法律风险的方式作答。

信源:https://www.wsj.com/tech/ai/chatgpt-openai-ipo-altman-029ae6d5
OpenAI与Cerebras签超200亿美元采购协议,换取最多10%股权

《The Information》独家披露,OpenAI 与 AI 芯片公司 Cerebras 签下的三年算力采购协议金额至少 200 亿美元,是今年 1 月公开披露的 100 亿美元规模的两倍以上。作为对价,OpenAI 将获得 Cerebras 少数股份的认股权证;若 OpenAI 三年采购支出触及 300 亿美元上限,对应比例可增至 10%。OpenAI 同时再向 Cerebras 提供约 10 亿美元,专门用于资助供 OpenAI 使用的数据中心建设。

这份合同安排真正的关键不是金额,而是会计结构。协议被设计为「营运资本押金」形式:OpenAI 可把 10 亿美元数据中心出资记为资产,对 Cerebras 的部分采购付款记为利息收入,以抵消一部分实际算力支出。OpenAI 还打算将这一结构推广至其他云厂商和芯片公司。对一家今年计划花 450 亿美元、明年 900 亿美元、五年内总计 6500 亿美元算力费用且筹备 IPO 的公司来说,这种把采购支出部分转为资产和利息收入的记账手法,直接关系到招股书怎么讲故事。

Cerebras 本周五将递交 IPO 招股书,目标融资约 30 亿美元、估值 350 亿美元,较今年 2 月最近一轮私募的 220 亿美元估值溢价 60%。公司 2024 年 9 月首次递交 IPO 文件后撤回,10 月转做 11 亿美元私募。OpenAI 这一单的披露时点正好踩在招股书前一天,是 Cerebras 对投资者解释估值翻倍的最关键一张牌。此前 IPO 文件显示,Group 42(UAE AI 巨头 G42 的母公司)一家客户就贡献了 Cerebras 2023 年 83% 的营收、2024 年上半年 87% 的营收。如今加上 OpenAI 与亚马逊(近期达成协议向 AWS 客户出租 Cerebras 芯片),才算拉开客户结构。

这笔交易也是过去一年 AI 行业「循环融资」结构的最新案例:OpenAI 和 Meta 此前分别宣布与 AMD 达成「采购+入股」协议,英伟达去年末与 Cerebras 竞争对手 Groq 签下 200 亿美元的授权与雇员招聘合同,并长期为转售其芯片的众多云厂商提供融资。上个月 OpenAI 披露的 1220 亿美元投资承诺也主要来自亚马逊和英伟达,两家同时是 OpenAI 的云与芯片供应商。这轮 AI 基建的资金并非从外部新流入产业,而是在几家巨头之间循环开票。

信源:https://www.theinformation.com/articles/openai-to-spend-more-than-20-billion-on-cerebras-chips-receive-equity-stake
智谱 AutoClaw 上线「自进化」机制,Agent 踩坑一次即成永久记忆,同步推出 Skill 商店

智谱 AI 旗下 Agent 框架 AutoClaw(澳龙)正式上线自进化机制。该机制旨在解决 Agent「健忘」的痛点,通过识别用户在对话中的纠正、新方法或表达偏好,将其转化为 Agent 的永久记忆。用户无需反复叮嘱「回复简洁点」或「不要用破折号」等指令,Agent 在教过一次后即可自主进化。

自进化机制通过关键词(如「以后」「记住」)或自动检测(复杂任务后的经验提炼)触发。每轮对话结束后,AutoClaw 会扫描对话并弹出「进化请求」卡片,由用户审批后方可写入记忆。为避免信息噪音,智谱设定了高质量进化原则,倾向于每周产生 1-3 次深度进化而非每日海量碎片记录。这种机制让 Agent 从「被动执行指令」转向「随使用过程持续成长」,用户教得越多,Agent 越贴合个人习惯。

同步上线的还有 AutoClaw Skill 商店,首批上架智谱自研的 GLM Office Skills 五件套(PPT、DOCX、XLSX、PDF、Charts)。其底层由针对办公场景优化的 GLM-5.1 模型驱动,支持智能自检排版布局、跨格式互转(如 Word 转 PDF)以及多文件同步生成。此外,商店还引入了专家共创 Skill,包括可复刻人物思维的「女娲 Skill」、深度调研的「横纵分析法」等,将行业顶尖方法论封装为开箱即用的 Agent 能力。

信源:https://mp.weixin.qq.com/s/Ny_TEIIzryV16DbrUQzp8g
Perplexity开始放量Personal Computer,把本地Mac也变成AI代理

Perplexity 开始向 Max 订阅用户和候补名单放量 Personal Computer。官方称,这一功能与 Perplexity Mac App 打通,可安全编排本地文件、原生应用和浏览器。Perplexity 此前在官网披露,Personal Computer 跑在一台可 24/7 在线的专用 Mac mini 上,敏感操作需用户批准,并保留完整审计日志和 kill switch。

Perplexity 想卖的不是又一个桌面助手,而是把「AI 就是 computer」这套叙事推进到本地设备,从帮你查资料、调工具,走到直接替你持续执行任务。它真正瞄准的是高频知识工作者最烦的那层编排成本,让电脑从指令执行器变成目标执行器。

信源:https://x.com/perplexity_ai/status/2044805973085454518
美团被曝上线OpenClaw导航站,开始抢「养虾人」入口

美团已推出面向开源AI Agent框架 OpenClaw 用户的资源平台「虾345」。页面截图显示,产品入口使用 xia345.com 域名,首页按「安装虾」「接模型」「Skills」「社区」「教程」「生态」等栏目组织资源,并提供「新手」和「进阶」两种模式。新手页会先引导用户选择 AstronClaw、AutoClaw、OpenClaw、QClaw、飞书 OpenClaw 等不同平台,进阶页则加入「龙虾书院」能力测试和按热度、评分聚合技能的「Skills 猎人」。

信源:https://mp.weixin.qq.com/s/LwOvROaR61NenyA_RiKnCg
1
Hermes Agent推出Tool Gateway,一个订阅替代四套API密钥

AI 研究机构 Nous Research 的开源 AI 代理框架 Hermes Agent 发布 v0.10.0,核心更新是 Tool Gateway:Nous Portal 付费用户无需再分别注册 Firecrawl、FAL、OpenAI、Browser Use 四家服务的 API 密钥,一个订阅即可调用以下四类工具:

1. 网页搜索与内容提取(Firecrawl)
2. 图像生成(FAL,使用 FLUX 2 Pro 加超分辨率)
3. 语音合成(OpenAI TTS)
4. 浏览器自动化(Browser Use)

四类工具统一通过 Nous Portal 订阅计费,用户可按需启用任意组合,也可对部分工具继续使用自己的 API 密钥。运行时通过配置项逐工具切换网关或直连,已有的密钥保留在本地不受影响。

Hermes Agent 采用 MIT 协议开源,定位不是 IDE 编程助手,而是部署在服务器上的长驻自主代理,支持 Telegram、Discord、Slack、WhatsApp 等十余个平台接入,具备持久记忆和定时任务调度能力。AI 代理要自主运行,工具调用是基础能力,但每多接一个第三方工具就多一套注册和密钥管理。Tool Gateway 把这层接入成本打包进了订阅,对用户是配置门槛降低,对 Nous Research 则是开源项目的商业化路径:代理本身免费,围绕代理的托管工具服务收费。

信源:https://github.com/NousResearch/hermes-agent/releases/tag/v2026.4.16
谷歌公开合成数据引擎Simula,不用真实数据就能从零批量造专用训练集

谷歌研究团队发表论文公开了 Simula,一个将合成数据生成从「逐条造数据」升级为「设计整个数据集」的框架,论文发表在《Transactions on Machine Learning Research》上。Simula 已在谷歌内部大规模部署,是 Gemma 系列中 ShieldGemma(安全过滤)、MedGemma(医疗)、FunctionGemma(函数调用)等专用模型的主要数据来源,也为 Gemini 安全分类器、Android 通话诈骗检测和 Google Messages 垃圾信息过滤提供训练数据。

现有合成数据方法大多一次只优化一条数据,依赖人工提示词或真实数据作为种子,无法精确控制数据集整体的覆盖范围、难度分布和质量。Simula 完全不需要种子数据,而是让推理模型从零构建整个数据集,分四步独立控制:

1. 全局多样性:推理模型将目标领域递归拆解为层级知识树(如网络安全威胁的完整分类体系),以此为骨架确保数据覆盖长尾场景
2. 局部多样性:在每个知识节点下生成多种不同场景和表述,防止同一概念千篇一律
3. 复杂化:可配置比例地将部分场景提升难度,独立调节数据集的难度分布
4. 质量控制:双评审员机制独立判断每条数据的正确性,抵消模型倾向于认同看似合理答案的偏差

研究团队用 Gemini 2.5 Flash 做教师模型、Gemma-3 4B 做学生模型,在网络安全、法律推理、小学数学(GSM8k)、多语言学术知识(Global MMLU)五个领域各生成最多 51.2 万条数据进行测试。完整 Simula 流程在所有领域均优于简化方案,但没有通用配方:高难度数据在数学推理上带来 10% 的准确率提升,在法律推理上反而拖累表现,原因是教师模型在该领域能力较弱,生成的高难度数据质量不可靠。更关键的发现是,Simula 用更少的数据达到了更高的下游性能,数据质量而非数量在驱动模型进步。

信源:https://research.google/blog/designing-synthetic-datasets-for-the-real-world-mechanism-design-and-reasoning-from-first-principles/
Meta公开后量子密码迁移框架:提出五级成熟度模型,已在内部基础设施部署抗量子加密

3 月底谷歌 Quantum AI 论文将破解椭圆曲线加密所需的物理量子比特数压低约 20 倍,谷歌同步把自家的抗量子迁移截止期提前到 2029 年,业界对「Q-Day」的讨论再次升温。Meta 工程团队 4 月 16 日发布长文,公开了公司内部的后量子密码(PQC)迁移框架,包括风险分级标准、五级成熟度模型和六步迁移策略,目的是为其他组织提供可复用的实操路径。

Meta 提出的核心概念是「PQC 迁移成熟度等级」,将组织的抗量子能力从低到高分为五级:PQ-Unaware(尚未意识到量子威胁)、PQ-Aware(已完成初步评估但未开始设计)、PQ-Ready(已实现技术方案但尚未部署)、PQ-Hardened(已部署当前可用的所有防护,但因行业尚缺某些密码学原语而无法完全消除威胁)、PQ-Enabled(全面实现后量子安全)。这套分级的实用之处在于,它承认大多数组织不可能一步到位,同时给出了每个阶段的明确定义和可衡量标准。

迁移策略分六步推进:确定风险优先级、建立密码学资产清单、解决外部依赖(如标准制定、硬件支持)、构建 PQC 组件、设置防护栏(禁止新项目使用量子脆弱算法)、将 PQC 组件集成到实际业务中。

风险分级方面,Meta 将最高优先级给了容易遭受「先存后解」(store now, decrypt later)攻击的场景,即攻击者现在就可以截获加密流量存起来,等量子计算机成熟后再解密。这类使用公钥加密和密钥交换的应用不需要等到量子计算机出现就已面临风险,因此需要最先迁移。

在算法选择上,Meta 推荐采用 NIST 已发布标准的 ML-KEM(密钥封装)和 ML-DSA(数字签名),并优先选择混合部署方案,即在现有经典加密之上叠加一层后量子加密,攻击者必须同时破解两层才能得手。Meta 密码学家还参与了 NIST 新选定的 PQC 算法 HQC 的研发,该算法基于与 ML-KEM 不同的数学基础,作为后备方案存在:一旦 ML-KEM 所依赖的模格密码学被发现漏洞,HQC 可以顶上。

Meta 表示已在内部基础设施的大量流量上部署了后量子加密保护,迁移仍在持续推进中。对大多数企业来说,这篇博文的价值不在于 Meta 自身进展的细节,而在于五级成熟度模型和六步策略提供了一套可直接套用的评估和规划工具。在破解量子比特门槛被不断压低的背景下,「先存后解」攻击意味着迁移窗口比真正可用的量子计算机到来还要紧迫。

信源:https://engineering.fb.com/2026/04/16/security/post-quantum-cryptography-migration-at-meta-framework-lessons-and-takeaways/
Sabi称年底推出「读心帽」,但难点在于每个人脑信号都不同

硅谷脑机接口初创公司 Sabi 从隐身状态公开亮相,计划在今年底推出一款毛线帽形态的非侵入式 EEG 设备。Sabi CEO Rahul Chhabra 向《Wired》表示,这款设备想把用户的内部语言直接转成屏幕文字,首个版本目标输入速度约为每分钟 30 个单词,帽子内将布置 7 万到 10 万个微型传感器。

这条路线有吸引力。植入式脑机接口能拿到更强信号,但很难面向大众普及。Sabi 想赌的是另一条路,用更高密度的可穿戴传感器,把「想一想就能打字」先做成可用输入方式。

问题也很清楚。2025 年一篇系统综述指出,EEG 想象语音解码仍处在早期阶段,主要卡在四件事:数据集太小,实验做法不统一,干扰太多,连续自然语音很难稳定解码。另一篇 2025 年 Frontiers 论文虽然已能用 EEG 合成语音,但实验词表只有 4 个中文双音节词,作者同样承认,对新受试者的泛化仍是难题。

所以 Sabi 的方向不算离谱,但时间表很激进。现在更像一条值得跟踪的技术路线,不像年底就能成熟交付的消费产品。下一步要看的,是公开 demo、第三方测试,以及它能否在不频繁校准的情况下让不同用户都稳定工作。

信源:https://www.wired.com/story/this-beanie-is-designed-to-read-your-thoughts/
Cloudflare邮件服务进入公测,AI代理现在可以有自己的邮箱地址收发邮件

Cloudflare 在其「Agents Week」期间宣布 Email Service 进入公测,核心变化是 AI 代理可以通过邮件与任何人双向通信。此前 Cloudflare 的 Email Routing 已免费提供多年,支持接收邮件,但代理只能同步回复或向 Cloudflare 账户内成员发信。Email Sending 公测后,代理可以异步处理任务再回复,可以主动发出邮件,可以安排后续跟进,收件人不需要安装任何应用或 SDK。

技术实现上,开发者可通过 Cloudflare Workers 原生绑定直接发送邮件,无需管理 API 密钥。SPF、DKIM、DMARC 等邮件认证记录在添加域名时自动配置。同时提供 REST API 及 TypeScript、Python、Go SDK,供非 Cloudflare 平台的代理调用。Cloudflare Agents SDK 的 onEmail 钩子负责接收和解析邮件,基于地址的路由机制让同一域名下的不同地址(如 support@、sales@)自动分派到不同代理实例,回复路由使用 HMAC-SHA256 签名防止攻击者伪造邮件头将回复引导至错误的代理实例。

邮件是全球覆盖面最广的通信协议,不需要对方安装客户端、不需要接入特定平台,这让它成为 AI 代理与外部世界交互的天然通道。Cloudflare 同时发布了配套工具链:Email MCP 服务器让外部代理(如 Claude Code、Cursor)通过自然语言提示即可发送邮件;Wrangler CLI 新增邮件命令;以及一个开源的「Agentic Inbox」参考应用,集成了邮件会话线程、附件存储、自动回复和内置 MCP 服务器,开发者可一键部署后直接使用或在此基础上定制。

信源:https://blog.cloudflare.com/email-for-agents/
Salesforce发布 Headless 360,把整个平台改成AI代理基础设施

Salesforce 在 TDX 开发者大会上发布 Headless 360,把整个平台的核心能力开放成 API、MCP 工具和 CLI 命令,让 AI 代理不打开 Salesforce 后台也能直接调用企业数据、工作流和业务逻辑。首批今天可用的能力超过 100 项,其中包括 60 多个 MCP 工具和 30 多项预配置开发技能,可接入 Claude Code、Cursor 等外部编程代理。

这比一次产品更新更像一次架构换向。Salesforce 已经默认企业软件的主入口会从自家网页退到 Slack、ChatGPT、Claude 这类入口,自己要守住的是底下那层企业上下文、权限和流程。

Headless 360 还上线了 Experience Layer,把同一套交互组件渲染到 Slack、移动端、ChatGPT 等不同界面;并新增 Testing Center、Custom Scoring Evals 和 A/B Testing 等治理工具。Salesforce 还称,DevOps Center MCP 可把原本要在四个工具间切换的构建流程收进一套体验,开发周期最高可缩短约 40%。

信源:https://www.salesforce.com/news/stories/salesforce-headless-360-announcement/
马斯克:应对 AI 失业的最佳方案是「全民高收入」,生产力飞跃将抵消通胀风险

Elon Musk 在 X 上发帖称,由联邦政府发放支票实现的「全民高收入」(Universal High Income,UHI)是应对 AI 导致失业的最佳方式。他认为,AI 和机器人生产的产品与服务将远超货币供应量的增幅,因此不会引发通货膨胀。

他此前曾多次提及「全民基本收入」(UBI)的概念,但此次明确使用了「高收入」(HIGH INCOME)一词,暗示 AI 驱动的生产力爆发将彻底改变财富分配的逻辑。在他看来,未来的经济瓶颈不再是产能,而是如何确保失去传统工作的劳动力仍具备消费能力。这一观点延续了他对「后稀缺时代」的设想,即机器人劳动力(如特斯拉 Optimus)将使商品成本降至极低,从而支撑起远超生存底线的社会福利。

信源:https://x.com/elonmusk/status/2044990537145753894
Vercel Workflows正式发布,用两行代码指令替代整套后端编排基础设施

前端云平台 Vercel 正式发布 Workflows,将持久执行(durable execution)能力内置到应用代码中。开发者在 TypeScript 函数顶部写 "use workflow" 标记工作流入口,在子函数中写 "use step" 标记每个执行步骤,框架自动处理队列调度、失败重试、状态持久化和可观测性,不需要单独部署编排服务、消息队列或状态数据库。

这套模型解决的核心问题是:把 AI 代理或后端任务从原型推到生产环境时,开发者往往要花大量时间搭建编排基础设施,而非改进产品本身。传统方案需要将逻辑拆散到队列、Worker、状态表和重试机制中,Workflows 把这些全部收进应用代码,编排逻辑和业务逻辑合为一体。Vercel 称用户只需为函数实际运行时的计算付费,没有常驻编排服务的开销。

Workflows 自 2025 年 10 月公测以来,已处理超过 1 亿次运行和 5 亿个步骤,覆盖 1500 多家客户, npm 周下载量超过 20 万次。

面向 AI 代理场景,Workflows 提供几项关键能力:

1. 持久流(Durable Streams):代理输出持久化存储,用户关闭浏览器后工作流继续运行,重新连接时从断点恢复,无需 Redis 或自建消息系统
2. 默认加密:所有步骤的输入输出和流数据在离开部署环境前自动加密,解密仅在运行工作流的部署内发生
3. 挂起与唤醒:通过 Hook 等待外部事件(如人工审批),通过 Sleep 暂停数天甚至数月,挂起期间不产生计算费用
4. 大负载支持:单步最大 50 MB,单次运行最大 2 GB,为多模态代理传递图片和视频留出空间

AI SDK v7 同步推出 `WorkflowAgent`,将持久执行与工具调用、状态管理深度集成。Python SDK 进入公测,将这套编程模型扩展到 Python 生态。Workflow SDK 开源,通过「Worlds」适配器系统支持自托管部署,社区已在开发 MongoDB、Redis、Cloudflare 等适配器。

下一个版本 Workflows 5 将引入原生并发控制(含跨运行的锁机制)、全球部署基础设施和基于快照的运行时以减少事件回放开销。

信源:https://vercel.com/blog/a-new-programming-model-for-durable-execution