动察Beating AI News
3.15K subscribers
883 photos
2 videos
3.4K links
AI新闻信息流
Download Telegram
AI编程初创公司Augment推出Intent工作站,引入「规格驱动」多智能体编排模式

AI 编程初创公司 Augment Code 宣布推出全新开发者工作站 Intent,将 AI 编程从单纯的对话辅助升级为多智能体协同模式。该产品引入了「规格驱动开发(Spec-Driven Development)」概念,通过一个协调者智能体(Coordinator)自动将复杂任务拆解为动态更新的 living spec,并分发给多个并行的专家智能体(如测试、文档、后端专家)执行。

Intent 工作站不仅集成了浏览器、终端和 Git 管理,还支持「可恢复会话」功能,允许开发者在跨天工作时完整保留所有智能体状态与上下文。此外,Intent 采取开放策略,开发者无需 Augment 订阅即可直接在工作站中使用 Claude Code、OpenAI Codex 等第三方智能体工具。

信源:https://www.augmentcode.com/product/intent
郭达雅近亿元年薪入职字节Seed任agent负责人,阿里腾讯曾同时争抢

晚点LatePost 独家报道证实,前 DeepSeek 研究员郭达雅已加入字节跳动大模型研发团队 Seed,担任 agent 负责人之一,职级 L8。他的薪资总包由现金、字节期权和豆包股组成,需满足一定条件才能全额兑现。据晚点估算,若豆包股价格持续增长,四年归属期满后总收益可达数亿元,折合年均近亿元。

阿里、腾讯、字节三家先后接触郭达雅,阿里甚至开出了后训练负责人的职位。他最终选择字节,主要因为研究方向契合:他去年 10 月就已计划离开 DeepSeek,原因之一是看好 agent 方向,而 DeepSeek 内部当时对 agent 的优先级不高。

此前拿到这一级别待遇的是被腾讯请去临危受命、统管全局的姚顺雨,而郭达雅仅作为 agent 负责人「之一」就获得同等待遇,说明 agent 方向在大厂内部的战略权重已大幅提升。伴随他的加入,Seed 内部正启动针对 agent 和 Coding 的组织整合。晚点援引接近团队的员工称,2025 年底字节每次训练 Code 模型,「上面都说是最后一次了」。今年 1 月底字节跳动 CEO 梁汝波在全员会上将 AI 模型能力列为 2026 年「重中之重」,近亿元引进郭达雅是这一转向的直接体现。

信源:https://mp.weixin.qq.com/s/vAE8KmnM2Mhbq4Y4Xacenw
字节回应「近亿元挖来DeepSeek核心员工」:近期没有招聘到近亿元年薪员工

针对字节跳动花费近亿元挖来前 DeepSeek 研究员郭达雅的消息,抖音副总裁李亮回应称,字节跳动招聘的所有 Seed 团队技术人员的薪资体系都是一样的,包括现金、字节期权和豆包期权,期权是四年期全部归属,没有所谓「需要满足一定条件才能拿全」的情况,近期更没有招聘到近亿元年薪的员工。Seed 员工的字节和豆包期权未来收益根据期权价格有波动,假如业务发展的很好,不排除有些 Seed 技术人员四年后收益会达到数亿元。

信源:https://m.yicai.com/brief/103136827.html
通义千问开源Qwen3.6首个模型,35B总参数仅激活3B,编程能力追平27B稠密模型

阿里巴巴通义实验室开源 Qwen3.6-35B-A3B,这是 Qwen3.6 系列的首个模型,采用稀疏混合专家(MoE)架构,总参数 350 亿,每次推理仅激活 30 亿参数。

模型主打编程场景。在 SWE-bench、Terminal-Bench 等智能体编程基准上,Qwen3.6-35B-A3B 大幅超越前代 Qwen3.5-35B-A3B,并追平 Qwen3.5-27B、Gemma-31B 等参数量大数倍的稠密模型。换句话说,跑这个模型的算力成本只有同等性能稠密模型的零头,对本地部署和 API 调用场景都意味着显著降本。

模型同时具备原生多模态能力,支持图文理解、文档解析和空间智能任务,在 RefCOCO 目标定位基准上得分 92.0。

实际使用层面,模型已上架 Hugging Face 和 ModelScope,可本地部署。API 即将在阿里云百炼上线(模型名 qwen3.6-flash),同时兼容 OpenAI 和 Anthropic 两套 API 协议,可直接接入 Claude Code、OpenClaw、Qwen Code 等编程助手。通义实验室表示后续将继续扩展 Qwen3.6 开源家族。

信源:https://mp.weixin.qq.com/s/4VCtPRFaj2i2gpapCpLBwQ
Anthropic发布Opus 4.7,刻意削弱网络攻击能力,为全面开放最强模型Mythos铺路

Anthropic 发布新一代旗舰模型 Claude Opus 4.7,已在所有 Claude 产品、API 及 Amazon Bedrock、Google Cloud Vertex AI、Microsoft Foundry 上线,定价与 Opus 4.6 相同(输入 5 美元/百万 token,输出 25 美元/百万 token)。

编程是本次升级的重点。Anthropic 称用户现在可以放心地把最难的编程任务交给 Opus 4.7,无需密切监督。多家早期测试方给出了具体数据:AI 编程工具 Cursor 的内部基准测试中,Opus 4.7 完成率 70%,Opus 4.6 为 58%;协作工具 Notion 报告代理任务成功率提升 14%,工具调用错误降至三分之一;日本电商平台乐天在其 SWE-Bench 上测得 Opus 4.7 解决的生产级任务数量是 Opus 4.6 的 3 倍。代码审查工具 CodeRabbit 称其召回率提升超 10%,速度略快于 GPT-5.4 xhigh。

视觉能力升级幅度同样显著。Opus 4.7 支持长边最高 2576 像素(约 375 万像素)的图片输入,像素总量是此前 Claude 模型的 3 倍以上。自动化渗透测试公司 XBOW 测得其视觉精度基准从 Opus 4.6 的 54.5% 跃升至 98.5%。更高分辨率意味着模型可以处理密集截图、复杂图表等此前力不从心的视觉任务,但也会消耗更多 token。

比起性能提升,更值得关注的是 Anthropic 在这款模型上的安全实验。上周 Anthropic 发布了 Project Glasswing 计划,讨论 AI 模型在网络安全领域的风险与收益,并表示将其最强模型 Claude Mythos Preview 的发布范围保持有限,先在能力较弱的模型上测试新的网络安全防护措施。Opus 4.7 是第一个试验田:Anthropic 称在训练过程中尝试了选择性削弱模型的网络攻击能力,同时保留其他能力,并在部署时加入了自动检测和拦截高风险网络安全用途的机制。需要将模型用于合法安全工作(如漏洞研究、渗透测试)的专业人士,可申请加入新设立的 Cyber Verification Program。这意味着 Opus 4.7 不只是一次常规升级,更是 Anthropic 测试「能力与安全可以分别调控」这一假设的关键实验,其结果将直接决定 Mythos 级别模型何时能全面开放。

其他更新:API 新增介于 high 和 max 之间的 xhigh 推理等级,以及公测阶段的任务预算功能;Claude Code 新增 /ultrareview 代码审查命令,auto mode 扩展至 Max 用户。迁移方面,Opus 4.7 使用了新分词器,相同输入可能消耗约 1.0 至 1.35 倍的 token。

信源:https://www.anthropic.com/news/claude-opus-4-7
2
OpenAI首个行业专用模型GPT-Rosalind瞄准制药,RNA预测超过95%人类专家

OpenAI 发布 GPT-Rosalind,这是该公司首个针对特定行业构建的前沿推理模型,面向生物学、药物发现和转化医学。模型以对揭示 DNA 结构做出关键贡献的科学家 Rosalind Franklin 命名,目前作为研究预览版在 ChatGPT、Codex 和 API 上线,仅面向通过资质审核的美国企业客户开放,预览期间不消耗现有额度。

选择生命科学作为第一个垂直行业,本身就是一个战略信号。OpenAI 给出的理由是:一款新药从靶点发现到获批上市平均需要 10 至 15 年,AI 在早期发现阶段的提速会向下游复利式传导,更好的靶点选择、更强的生物学假设、更高质量的实验设计,最终提高整条管线的成功率。

性能方面,GPT-Rosalind 在生物信息学基准 BixBench 上取得已公开模型中的最高分。在涵盖文献检索、序列操作、实验方案设计等 11 项研究任务的 LABBench2 基准上,6 项超过 GPT-5.4,提升最显著的是分子克隆实验设计(CloningQA)。与 AI 基因治疗公司 Dyno Therapeutics 合作的评测使用了未公开、未被训练数据污染的 RNA 序列,模型十次提交中的最优结果在序列功能预测上排在人类专家历史成绩的第 95 百分位以上,序列生成排在第 84 百分位左右。

OpenAI 同时在 GitHub 开源了 Codex 生命科学研究插件,接入超过 50 个公共多组学数据库、文献源和生物工具,覆盖人类遗传学、功能基因组学、蛋白质结构、生物化学等领域。插件所有用户均可免费使用,不限于 GPT-Rosalind,也可搭配通用模型。Amgen、Moderna、Allen Institute、Thermo Fisher Scientific 等已参与早期合作,OpenAI 还与洛斯阿拉莫斯国家实验室探索 AI 引导的蛋白质和催化剂设计。GPT-Rosalind 是其生命科学模型系列的首个版本,后续将持续扩展生化推理能力。

信源:https://openai.com/index/introducing-gpt-rosalind/
OpenAI Codex大更新:可直接操控Mac桌面,能跨天自动醒来继续干活

OpenAI 发布 Codex 重大更新,目前每周有超过 300 万开发者使用这款产品。此次更新的核心变化是 Codex 不再局限于写代码,开始介入软件开发的全流程。

最大的功能跃迁是「后台电脑操控」:Codex 现在可以直接在 Mac 上看屏幕、点鼠标、敲键盘,操作任何应用程序,且多个代理可并行工作,各用各的光标,不干扰用户正在做的事情。对开发者来说,这意味着迭代前端界面、测试应用或操作没有 API 的工具时,不用再手动截图描述,代理自己看着办。

应用内新增浏览器,用户可以直接在页面上标注评论给代理下指令,适合前端和游戏开发中的快速迭代。图片生成方面集成了 gpt-image-1.5,可在同一工作流中生成产品概念图、UI 设计稿和游戏素材。新增超过 90 个插件,覆盖 Atlassian Rovo(JIRA 管理)、CircleCI、CodeRabbit、GitLab Issues、Microsoft Suite、Neon by Databricks 等开发工具链。

自动化能力的扩展更值得关注。Codex 现在可以复用已有对话线程保留上下文,自行安排未来任务并自动唤醒继续执行,时间跨度可达数天甚至数周。同时推出记忆功能预览版,能记住用户的偏好、纠正和历史操作中积累的信息,让后续任务完成得更快。Codex 还会基于项目上下文、已连接的插件和记忆,主动建议用户从哪里开始一天的工作或接续之前的项目,比如识别 Google Docs 中待处理的评论,拉取 Slack、Notion 和代码库的相关上下文,生成优先级排序的行动清单。

开发者工作流方面新增 GitHub PR 评审评论处理、多终端标签页、通过 SSH 连接远程 devbox(alpha 阶段),以及侧边栏文件预览(支持 PDF、电子表格、幻灯片和文档)。

这些更新正在向已登录 ChatGPT 的 Codex 桌面端用户逐步推送。记忆和主动建议功能将稍后面向企业版、教育版及欧盟/英国用户开放,电脑操控目前仅支持 macOS。

信源:https://openai.com/index/codex-for-almost-everything/
👍1
Anthropic被曝筹备AI设计工具,Instagram联合创始人退出Figma董事会避嫌

Anthropic 首席产品官 Mike Krieger 4 月 14 日辞去界面设计公司 Figma 的董事席位,Figma 当日向美国证券交易委员会(SEC)披露了这一变动。同一天,《The Information》独家报道称 Anthropic 正在筹备 AI 设计工具,将与 Figma 的核心产品直接竞争。Krieger 加入 Figma 董事会不到一年。

Krieger 此前联合创办了 Instagram 和 AI 新闻应用 Artifact,2024 年出任 Anthropic 首席产品官。Figma 是全球最主流的 UI/UX 设计工具,此前与 Anthropic 深度合作,将 Claude 模型集成到自家产品中作为设计助手。如今合作方变成了竞争对手,Anthropic 不再满足于做嵌入他人产品的基础设施层,开始向应用层扩张。

这是今年投资者口中「SaaS 末日论」(SaaSpocalypse)的最新案例:头部 AI 实验室凭借基础模型优势亲自下场做应用,挤压传统软件公司的空间。iShares 主要软件 ETF(IGV)年内已跌近 18%。不过 Figma 股价在消息公布后反而上涨约 5%,市场尚未认定 AI 实验室能真正复制成熟设计工具多年积累的专业工作流和客户关系。

信源:https://techcrunch.com/2026/04/16/anthropic-cpo-leaves-figmas-board-after-reports-he-will-offer-a-competing-product/
OpenAI网络安全联盟首批名单公布:华尔街六大行集体加入,1000万美元资助开源安全

OpenAI 公布「网络安全可信访问」(Trusted Access for Cyber)计划的首批合作机构。14 家机构中,华尔街占了近一半:美国银行、贝莱德、纽约梅隆银行、花旗、高盛、摩根大通、摩根士丹利,加上网络安全公司 CrowdStrike、Zscaler、SpecterOps、iVerify,以及思科、英伟达、甲骨文。这些机构将获得 GPT-5.4-Cyber 的访问权限,用于各自数字基础设施的安全防御。

金融机构扎堆并不意外。银行是全球遭受网络攻击最密集的行业之一,安全团队规模大、预算充足、对新工具的采纳速度快,也最有动力在 AI 安全工具的早期阶段就参与进来争取影响力。纽约梅隆银行首席信息官 Leigh-Ann Russell 在声明中称,该行正与「推动这些努力的前沿力量」密切合作。

同时,OpenAI 宣布通过「网络安全资助计划」投入 1000 万美元 API 额度,面向开源安全和漏洞研究团队。首批受资助方包括软件供应链安全公司 Socket 和 Semgrep,以及漏洞研究机构 Calif 和 Trail of Bits。OpenAI 在博文中提到,并非每个组织都有全天候安全团队能在漏洞「周五晚间披露」时及时响应,这正是资助计划想解决的问题。

OpenAI 还向美国 AI 标准与创新中心(CAISI)和英国 AI 安全研究所(UK AISI)提供了 GPT-5.4-Cyber 访问权限,供两家机构评估模型的网络安全能力和安全防护措施。

信源:https://openai.com/index/accelerating-cyber-defense-ecosystem/
Claude Code配合Opus 4.7用法大改:别当结对编程搭档用,把整个任务一次交出去

Claude Code 之父 Boris Cherny 发布 Claude Code 配合 Opus 4.7 的使用指南,核心建议是改变交互方式:把 Claude 当作你委派任务的工程师,而非逐行指导的结对编程搭档。因为 Opus 4.7 在每次用户发言后会进行更多推理以提升连贯性和指令遵循能力,但副作用是每多一轮对话都会增加 token 开销。最高效的用法是在第一轮就把任务意图、约束条件、验收标准和相关文件位置说清楚,然后放手让模型执行。

Opus 4.7 不再支持固定思考预算(Extended Thinking with fixed budget),取而代之的是「自适应思考」,即模型自行判断每一步是否需要深度推理,简单查询快速回复,复杂问题才投入思考 token。用户仍可通过提示词调节思考深度,如「这个问题比看起来难,请逐步思考」或「优先快速回复,不必深度推理」。

Opus 4.7 默认调用工具更少、启动子代理更保守、回复长度随任务复杂度自动调节(简单问题比 Opus 4.6 更简短)。这些变化在多数场景下能产生更好的结果,但如果工作流依赖频繁的文件搜索或并行子代理,需要在提示词中明确指示。Claude Code 的默认推理等级已从 high 提升至新增的 xhigh(介于 high 和 max 之间),Anthropic 建议大多数编程和代理任务使用该等级。
信源:https://claude.com/blog/best-practices-for-using-claude-opus-4-7-with-claude-code
谷歌与五角大楼谈机密Gemini部署,条款复刻Anthropic拒绝的OpenAI模板

谷歌正与美国国防部谈判,拟允许五角大楼在机密环境中部署 Gemini AI 模型。两名直接了解谈判的知情人士向《The Information》透露,双方已接近达成协议。这是谷歌自 2018 年因员工抗议退出 Project Maven(军方将 AI 用于无人机目标识别的项目)以来对军方立场的重大逆转。

协议允许将谷歌 AI 用于「所有合法用途」,但谷歌提议加入额外条款,禁止用于国内大规模监控或自主武器(包括没有『适当』人类监督和控制的目标识别)。这套措辞几乎复刻了 OpenAI 今年早些时候与五角大楼签署的协议。OpenAI CEO Sam Altman 当时曾要求五角大楼对所有 AI 公司给予相同条款。

OpenAI 合同生效时就有律师指出其结构性漏洞:看似禁止全自主致命武器和国内大规模监控的措辞,会被同样写入合同的「所有合法用途」覆盖。谷歌提议的条款面临同样问题。

而这两项安全承诺,正是今年 2 月 Anthropic 与五角大楼公开决裂的核心。Anthropic CEO Dario Amodei 拒绝放弃对全自主致命武器和国内大规模监控的禁令,五角大楼随后将 Anthropic 列为「供应链风险」,经六个月过渡期后将其排除出军方新合同。Anthropic 已就该指定发起两起诉讼,供应链风险状态目前仍然生效。多位国防部官员对 Amodei 抱有敌意,相比之下谷歌在五角大楼的口碑正在回暖。

机密部署谈判不是孤立事件。2025 年初特朗普二任上台后,谷歌改写了 AI 原则,删除了对武器和监控的明确禁令。此后军方订单陆续到账:2025 年 7 月拿下五角大楼首席数字与 AI 办公室最高 2 亿美元的 AI 试点合同,12 月 Gemini 成为军方非机密 AI 平台 GenAI.mil 接入的首个模型,今年 3 月宣布为五角大楼提供 AI agents 产品自动化非机密工作。机密部署是这条路线图最后一块拼图。

内部的张力从未消失。谷歌首席 AI 科学家 Jeff Dean 此前在 X 上公开反对将 AI 用于大规模监控或自主武器,200 多名谷歌员工曾联署致信他,Dean 与近 40 名谷歌和 OpenAI 员工还在 Anthropic 起诉五角大楼的案件中签署了支持 Anthropic 的法庭之友简报。

信源:https://www.theinformation.com/articles/google-pentagon-discuss-classified-ai-deal-company-rebuilds-military-ties
OpenClaw新版把Claude默认模型升到Opus 4.7,Google插件补上Gemini语音合成

开源 AI Agent 框架 OpenClaw 发布 v2026.4.15,真正值得用户关注的变化只有两处:把 Anthropic 一侧的默认模型指向昨天才发布的 Claude Opus 4.7,以及给 Google 插件补上 Gemini 文本转语音能力。

修复里有一条和安全相关的值得拎出来:本地 MEDIA: 工具结果的信任放通此前只认工具名,客户端只要声明一个与内置工具同名的工具定义,就能借机继承本地媒体的信任权限。v2026.4.15 把放通严格绑定到本次运行中已注册的内置工具原始名,并拒绝任何与内置或同请求内其他客户端工具重名的定义,HTTP 与 SSE 路径均返回 `400 invalid_request_error`。

其余修复还包括:CLI 升级时清理过期的 dist chunk、遗留 openai-codex 条目自动修复到正确的 Codex 传输路径、BlueBubbles 插件在 Node 22+ 下恢复入站图片附件下载、默认启动与 skills 提示预算下调以降低长会话上下文占用。

信源:https://github.com/openclaw/openclaw/releases/tag/v2026.4.15
Anthropic修复Opus 4.7限额BUG重置订阅配额,节制用户反而吃亏

Anthropic 开发者账号 @ClaudeDevs 在 X 上宣布修复一个 BUG:Claude 订阅的 5 小时与每周用量限额在处理 Opus 4.7 长上下文请求时统计有偏差,作为补偿已重置这两项限额。

修复呼应了近期用户的持续抱怨。Opus 4.6 支持 1M 上下文以来,GitHub 上积累了多条 Max/Pro 订阅用户的 BUG 报告,反映配额余量明显充足时,切换到 1M 上下文模式仍会立即弹出「Rate limit reached」。Opus 4.7 昨日发布又引入了新分词器,Anthropic 在迁移说明中承认相同输入可能消耗 1.0 至 1.35 倍 token,叠加计费偏差,实际扣掉的配额比用户感知的要多。

但补偿动作在一部分重度用户那里引发了反向不满。Claude 的每周限额以 7 天为一个周期,归零日期取决于账户各自的起始日而非统一周一。X 用户 Scott(@Dorizzdt)在推文中展示了这种错位带来的荒诞:他本周已刻意把使用率压在 43-47%,距离自然归零还剩约 24 小时,原本计划今天集中冲刺消耗剩余的 57%,再衔接下周满血启动。强制重置把已消耗的 43% 一笔勾销的同时,新的 7 天计时也从此刻立即重启,他今天再使用的任何额度都会一直挂在未来 7 天的窗口里。

换算下来,他本可以在 8 天内跑完「本周剩余 57% + 下周满血 100%」合计约 157% 的用量,现在被压缩成未来 7 天最多 100%。对一直满额消耗的用户,这次重置是纯福利;对像他这样刻意节制、等着攒到最后一天或换周再冲刺的用户,Anthropic 所谓的「补偿」反而抢走了他们攒出来的周差价。

这条插曲暴露了 Claude 订阅限额机制一个反直觉的特征:7 天周期对节制用户不友好,官方统一重置等同于「清零历史使用 + 重启计时器」,对挤爆配额的用户是恩惠,对克制用户则是强行预支未来额度。最稳妥的策略反而是:把当期配额尽快用完,不要攒。

信源:https://x.com/ClaudeDevs/status/2044868953206612154
Codex一周年全部套餐额度重置,OpenAI工程负责人让Codex点了个RESET按钮宣布

OpenAI Codex 工程负责人 Thibault Sottiaux 宣布,为庆祝 Codex 上线一周年,OpenAI 重置了所有套餐的使用额度限制。

宣布方式比消息本身更有意思。Sottiaux 让 Codex 用刚发布的 Computer Use 功能在浏览器里点击一个写着「RESET」的红色按钮,让它亲手替自己把额度重置了。

Sottiaux 2024 年 7 月从 Google DeepMind 跳槽加入 OpenAI,此前担任 Gemini Human Data Lead。

信源:https://x.com/thsottiaux/status/2044943514832871564
OpenAI员工否决Altman提的Helion5亿美元注资案,部分股东私议换帅

《华尔街日报》发表长篇调查,披露 OpenAI IPO 前夕的一宗内部僵局:CEO Sam Altman 提议由 OpenAI 出资 5 亿美元参与核聚变初创公司 Helion 的新一轮融资,员工评估后拒绝了这笔交易。这也是部分股东已开始私下讨论让 Altman 卸任 CEO、由董事会主席 Bret Taylor(前 Salesforce 联席 CEO)接任的原因之一。

Helion 是 Altman 在 OpenAI 之外最重的押注,他是该公司最大投资者之一,相当一部分个人净资产绑定其中;2021 年他一次性投入 3.75 亿美元,这是他当时做过的最大一笔个人投资。此次融资原计划规模约 10 亿美元、估值 350 亿美元,而公司 2025 年 1 月上一轮融资时估值仅 54 亿美元。OpenAI 员工对提案不安有两层原因。一是 Altman 要求 OpenAI 注资一家自己大额持股、相当净资产绑定其中的公司,而 OpenAI 业务本身并无直接受益。二是员工对 Helion 的核聚变技术存疑,该公司承诺 2024 年让 Polaris 设备发电量超过耗电量,却错过这一节点,此后只笼统表态「机器达到了若干技术里程碑」,并未公布具体数据。知情人士称,一些员工刻意回避讨论该交易的 Slack 频道,担心自己的发言日后会被传唤进诉讼程序。

OpenAI 虽拒绝注资,但签下了一份电力采购权合同,可到 2035 年向 Helion 采购最高 50 吉瓦电力,相当于 25 座胡佛水坝的发电量。Helion 随即把这份合同作为新一轮融资的卖点,但融资目标已缩水至 2.5 亿美元、估值 150 亿美元,改由 Thrive Capital(OpenAI 的大股东之一)领投。Altman 上个月已卸任 Helion 董事职务。

Altman 与 OpenAI 的利益纠缠还延伸到太空。WSJ 首次披露,Altman 本人及丈夫都通过家族办公室 Hydrazine 持有火箭公司 Stoke Space 的股份。去年夏天他曾向 Stoke 提议由 OpenAI 收购或成为控股股东,用以在太空建数据中心,正面挑战 Elon Musk 的 SpaceX。去年 12 月 WSJ 开始就此事向 OpenAI 问询后,相关谈判暂停;Altman 今年 2 月在印度一场活动上当众称太空数据中心的想法「荒谬」,让参与过谈判的人感到意外。知情人士称 Altman 今年仍在私下推动一份火箭发射合作协议。

内部人事同样微妙。首席产品官 Fidji Simo 原本被 Altman 寄望接手 IPO 后大部分日常运营,包括代表公司开季度业绩会,但她本月因神经免疫疾病复发宣布休病假,备忘录里指定四名高管分担职责,Altman 不在名单上。Taylor 则在声明中支持 Altman,称自己「每天都看到为什么 Sam 独一无二地适合带领公司走向下一阶段」。

这些冲突背后有一个结构性根源:OpenAI 脱胎自非营利组织,Altman 至今在公司没有直接股权,2024 年年薪仅 6.6 万美元,财富高度绑定在 YC 时代积累的数百家初创公司组合上。当他让 OpenAI 出手时,每一次都绕不开「这是否在替自己的持仓接盘」的疑问,他的下属现在开始用法律风险的方式作答。

信源:https://www.wsj.com/tech/ai/chatgpt-openai-ipo-altman-029ae6d5
OpenAI与Cerebras签超200亿美元采购协议,换取最多10%股权

《The Information》独家披露,OpenAI 与 AI 芯片公司 Cerebras 签下的三年算力采购协议金额至少 200 亿美元,是今年 1 月公开披露的 100 亿美元规模的两倍以上。作为对价,OpenAI 将获得 Cerebras 少数股份的认股权证;若 OpenAI 三年采购支出触及 300 亿美元上限,对应比例可增至 10%。OpenAI 同时再向 Cerebras 提供约 10 亿美元,专门用于资助供 OpenAI 使用的数据中心建设。

这份合同安排真正的关键不是金额,而是会计结构。协议被设计为「营运资本押金」形式:OpenAI 可把 10 亿美元数据中心出资记为资产,对 Cerebras 的部分采购付款记为利息收入,以抵消一部分实际算力支出。OpenAI 还打算将这一结构推广至其他云厂商和芯片公司。对一家今年计划花 450 亿美元、明年 900 亿美元、五年内总计 6500 亿美元算力费用且筹备 IPO 的公司来说,这种把采购支出部分转为资产和利息收入的记账手法,直接关系到招股书怎么讲故事。

Cerebras 本周五将递交 IPO 招股书,目标融资约 30 亿美元、估值 350 亿美元,较今年 2 月最近一轮私募的 220 亿美元估值溢价 60%。公司 2024 年 9 月首次递交 IPO 文件后撤回,10 月转做 11 亿美元私募。OpenAI 这一单的披露时点正好踩在招股书前一天,是 Cerebras 对投资者解释估值翻倍的最关键一张牌。此前 IPO 文件显示,Group 42(UAE AI 巨头 G42 的母公司)一家客户就贡献了 Cerebras 2023 年 83% 的营收、2024 年上半年 87% 的营收。如今加上 OpenAI 与亚马逊(近期达成协议向 AWS 客户出租 Cerebras 芯片),才算拉开客户结构。

这笔交易也是过去一年 AI 行业「循环融资」结构的最新案例:OpenAI 和 Meta 此前分别宣布与 AMD 达成「采购+入股」协议,英伟达去年末与 Cerebras 竞争对手 Groq 签下 200 亿美元的授权与雇员招聘合同,并长期为转售其芯片的众多云厂商提供融资。上个月 OpenAI 披露的 1220 亿美元投资承诺也主要来自亚马逊和英伟达,两家同时是 OpenAI 的云与芯片供应商。这轮 AI 基建的资金并非从外部新流入产业,而是在几家巨头之间循环开票。

信源:https://www.theinformation.com/articles/openai-to-spend-more-than-20-billion-on-cerebras-chips-receive-equity-stake
智谱 AutoClaw 上线「自进化」机制,Agent 踩坑一次即成永久记忆,同步推出 Skill 商店

智谱 AI 旗下 Agent 框架 AutoClaw(澳龙)正式上线自进化机制。该机制旨在解决 Agent「健忘」的痛点,通过识别用户在对话中的纠正、新方法或表达偏好,将其转化为 Agent 的永久记忆。用户无需反复叮嘱「回复简洁点」或「不要用破折号」等指令,Agent 在教过一次后即可自主进化。

自进化机制通过关键词(如「以后」「记住」)或自动检测(复杂任务后的经验提炼)触发。每轮对话结束后,AutoClaw 会扫描对话并弹出「进化请求」卡片,由用户审批后方可写入记忆。为避免信息噪音,智谱设定了高质量进化原则,倾向于每周产生 1-3 次深度进化而非每日海量碎片记录。这种机制让 Agent 从「被动执行指令」转向「随使用过程持续成长」,用户教得越多,Agent 越贴合个人习惯。

同步上线的还有 AutoClaw Skill 商店,首批上架智谱自研的 GLM Office Skills 五件套(PPT、DOCX、XLSX、PDF、Charts)。其底层由针对办公场景优化的 GLM-5.1 模型驱动,支持智能自检排版布局、跨格式互转(如 Word 转 PDF)以及多文件同步生成。此外,商店还引入了专家共创 Skill,包括可复刻人物思维的「女娲 Skill」、深度调研的「横纵分析法」等,将行业顶尖方法论封装为开箱即用的 Agent 能力。

信源:https://mp.weixin.qq.com/s/Ny_TEIIzryV16DbrUQzp8g
Perplexity开始放量Personal Computer,把本地Mac也变成AI代理

Perplexity 开始向 Max 订阅用户和候补名单放量 Personal Computer。官方称,这一功能与 Perplexity Mac App 打通,可安全编排本地文件、原生应用和浏览器。Perplexity 此前在官网披露,Personal Computer 跑在一台可 24/7 在线的专用 Mac mini 上,敏感操作需用户批准,并保留完整审计日志和 kill switch。

Perplexity 想卖的不是又一个桌面助手,而是把「AI 就是 computer」这套叙事推进到本地设备,从帮你查资料、调工具,走到直接替你持续执行任务。它真正瞄准的是高频知识工作者最烦的那层编排成本,让电脑从指令执行器变成目标执行器。

信源:https://x.com/perplexity_ai/status/2044805973085454518
美团被曝上线OpenClaw导航站,开始抢「养虾人」入口

美团已推出面向开源AI Agent框架 OpenClaw 用户的资源平台「虾345」。页面截图显示,产品入口使用 xia345.com 域名,首页按「安装虾」「接模型」「Skills」「社区」「教程」「生态」等栏目组织资源,并提供「新手」和「进阶」两种模式。新手页会先引导用户选择 AstronClaw、AutoClaw、OpenClaw、QClaw、飞书 OpenClaw 等不同平台,进阶页则加入「龙虾书院」能力测试和按热度、评分聚合技能的「Skills 猎人」。

信源:https://mp.weixin.qq.com/s/LwOvROaR61NenyA_RiKnCg
1
Hermes Agent推出Tool Gateway,一个订阅替代四套API密钥

AI 研究机构 Nous Research 的开源 AI 代理框架 Hermes Agent 发布 v0.10.0,核心更新是 Tool Gateway:Nous Portal 付费用户无需再分别注册 Firecrawl、FAL、OpenAI、Browser Use 四家服务的 API 密钥,一个订阅即可调用以下四类工具:

1. 网页搜索与内容提取(Firecrawl)
2. 图像生成(FAL,使用 FLUX 2 Pro 加超分辨率)
3. 语音合成(OpenAI TTS)
4. 浏览器自动化(Browser Use)

四类工具统一通过 Nous Portal 订阅计费,用户可按需启用任意组合,也可对部分工具继续使用自己的 API 密钥。运行时通过配置项逐工具切换网关或直连,已有的密钥保留在本地不受影响。

Hermes Agent 采用 MIT 协议开源,定位不是 IDE 编程助手,而是部署在服务器上的长驻自主代理,支持 Telegram、Discord、Slack、WhatsApp 等十余个平台接入,具备持久记忆和定时任务调度能力。AI 代理要自主运行,工具调用是基础能力,但每多接一个第三方工具就多一套注册和密钥管理。Tool Gateway 把这层接入成本打包进了订阅,对用户是配置门槛降低,对 Nous Research 则是开源项目的商业化路径:代理本身免费,围绕代理的托管工具服务收费。

信源:https://github.com/NousResearch/hermes-agent/releases/tag/v2026.4.16
谷歌公开合成数据引擎Simula,不用真实数据就能从零批量造专用训练集

谷歌研究团队发表论文公开了 Simula,一个将合成数据生成从「逐条造数据」升级为「设计整个数据集」的框架,论文发表在《Transactions on Machine Learning Research》上。Simula 已在谷歌内部大规模部署,是 Gemma 系列中 ShieldGemma(安全过滤)、MedGemma(医疗)、FunctionGemma(函数调用)等专用模型的主要数据来源,也为 Gemini 安全分类器、Android 通话诈骗检测和 Google Messages 垃圾信息过滤提供训练数据。

现有合成数据方法大多一次只优化一条数据,依赖人工提示词或真实数据作为种子,无法精确控制数据集整体的覆盖范围、难度分布和质量。Simula 完全不需要种子数据,而是让推理模型从零构建整个数据集,分四步独立控制:

1. 全局多样性:推理模型将目标领域递归拆解为层级知识树(如网络安全威胁的完整分类体系),以此为骨架确保数据覆盖长尾场景
2. 局部多样性:在每个知识节点下生成多种不同场景和表述,防止同一概念千篇一律
3. 复杂化:可配置比例地将部分场景提升难度,独立调节数据集的难度分布
4. 质量控制:双评审员机制独立判断每条数据的正确性,抵消模型倾向于认同看似合理答案的偏差

研究团队用 Gemini 2.5 Flash 做教师模型、Gemma-3 4B 做学生模型,在网络安全、法律推理、小学数学(GSM8k)、多语言学术知识(Global MMLU)五个领域各生成最多 51.2 万条数据进行测试。完整 Simula 流程在所有领域均优于简化方案,但没有通用配方:高难度数据在数学推理上带来 10% 的准确率提升,在法律推理上反而拖累表现,原因是教师模型在该领域能力较弱,生成的高难度数据质量不可靠。更关键的发现是,Simula 用更少的数据达到了更高的下游性能,数据质量而非数量在驱动模型进步。

信源:https://research.google/blog/designing-synthetic-datasets-for-the-real-world-mechanism-design-and-reasoning-from-first-principles/