动察Beating AI News
3.15K subscribers
883 photos
2 videos
3.4K links
AI新闻信息流
Download Telegram
METR更新AI代理能力基准,Gemini 3.1 Pro可靠性超越所有前沿模型登顶

AI 安全评估机构 METR 更新「时间地平线」(Time Horizon)基准,新增谷歌 Gemini 3.1 Pro 的测试数据。该基准追踪前沿 AI 代理独立完成编程任务的能力上限,自今年 2 月上线以来已成为衡量 AI 代理能力增长的重要参考。

测量方式是让人类软件工程专家(平均约 5 年经验)和 AI 代理完成同一组超过一百项软件任务,用人类耗时衡量任务难度。核心指标有两个:50% 时间地平线(AI 有一半概率完成的最高任务难度)和 80% 时间地平线(AI 有八成概率完成的最高任务难度)。

Gemini 3.1 Pro 在两个指标上的排名出现反转。50% 时间地平线排第二,仅次于大幅领先的 Claude Opus 4.6:

1. Claude Opus 4.6:约 12.0 小时
2. Gemini 3.1 Pro:约 6.4 小时
3. GPT-5.2:约 5.9 小时
4. GPT-5.4:约 5.7 小时

但在更严格的 80% 时间地平线上,Gemini 3.1 Pro 反超登顶:

1. Gemini 3.1 Pro:约 1.5 小时
2. Claude Opus 4.6:约 1.2 小时
3. GPT-5.2:约 1.1 小时

Claude Opus 4.6 能挑战更难的任务但成功率波动大,Gemini 3.1 Pro 天花板低一些但在能力范围内更稳定。对需要可预测结果的生产场景,后者可能更实用。

相比上一代 Gemini 3 Pro(50% 时间地平线约 3.7 小时),Gemini 3.1 Pro 提升约 71%。从更长的时间线看,METR 的数据显示前沿模型的时间地平线从 2019 年 GPT-2 的几秒钟增长到如今的十余小时,约每 4.3 个月翻一番,METR 称「没有看到指数增长放缓的迹象」。

需注意,METR 的任务覆盖软件工程、机器学习和网络安全,且均为定义清晰、可自动评分的独立任务。METR 在后续研究中发现,当评分方式从算法判定改为人类整体评判时,AI 表现显著下降。12 小时的时间地平线不等于 AI 能替代人类半天的实际工作。

信源:https://metr.org/time-horizons/
ChatGPT流量份额一年从77%跌至57%,Gemini翻四倍升至25%

Similarweb 发布截至 2026 年 3 月的生成式 AI 网站流量份额数据。过去 12 个月,ChatGPT 从 77.43% 降至 56.72%,丢掉超过 20 个百分点;Gemini 从 6.00% 升至 25.46%,翻了四倍多,吃下了流失份额的大头。

各产品 3 月份额:
1. ChatGPT:56.72%
2. Gemini:25.46%
3. Claude:6.02%
4. DeepSeek:3.74%
5. Grok:3.44%
6. Copilot:1.99%
7. Perplexity:1.64%

短期变动最剧烈的是 Claude:一年前仅 1.40%,1 月还在 2.22%,3 月突破 6%,其中 2 月到 3 月单月接近翻倍。Grok 从一年前的第二名(7.03%)跌至第五(3.44%),被 DeepSeek 反超。Copilot 的上升部分源于统计口径调整,Similarweb 将微软 m365.cloud.microsoft/chat 纳入了 Copilot 流量。

一年前 ChatGPT 以 77% 的份额近乎垄断,如今前两名合计 82%(ChatGPT 57% + Gemini 25%),格局从一家独大变为两强主导。两种增长的形态截然不同:Gemini 逐季匀速爬升,Claude 则在前 10 个月几乎没动、最近两个月突然从 2% 拉到 6%。Grok 跌幅最深,一年前排第二,如今已被三家超过。

信源:https://x.com/Similarweb/status/2044682637860573534
苹果把近200名Siri程序员送回「编程学校」,距新版Siri发布仅两个月

苹果计划将近 200 名 Siri 程序员送去参加为期数周的 AI 编程培训班,学习使用 AI 工具写代码。此时距新版 Siri 预计在 6 月 WWDC 上亮相仅剩两个月。Siri 团队总人数达数百人,培训结束后核心开发组仅保留约 60 人,另有约 60 人转入评估组,负责测试 Siri 的指令处理和安全合规。

苹果软件工程等部门已大规模采用 Claude Code 等 AI 编程工具,部分团队为此分配了大笔预算,但 Siri 团队未能跟上。这支团队在苹果内部以「落后者」著称,15 年来人员臃肿、内部政治分裂,在 ChatGPT 等大语言模型崛起后更难以保持竞争力。苹果近年多次重组 Siri:去年初将团队从 AI 部门负责人 John Giannandrea 手中划出,交由软件主管 Craig Federighi 管辖,Vision Pro 负责人 Mike Rockwell 直接负责 Siri 产品。此前苹果曾计划 2025 年初发布新版 Siri,但遭遇延期。Giannandrea 去年 12 月宣布退休,据 Bloomberg 报道,本周将是他在苹果担任顾问的最后一天。

新版 Siri 将由谷歌 Gemini 驱动,支持更自然的对话、直接回答问题、提供情感支持和完成预订等任务。苹果正与谷歌讨论由后者托管运行新 Siri 的服务器,目前仍有大量工作待完成。一家以自研芯片和操作系统著称的公司,语音助手要靠竞争对手的模型和服务器来运行,Siri 团队要靠培训班来学会用 AI 写代码,这本身就是苹果在生成式 AI 浪潮中处境的缩影。

信源:https://www.theinformation.com/articles/apple-sends-siri-staffers-coding-bootcamp-latest-shakeup-organization?rc=h8czej
谷歌AI编程工具Antigravity连续多日宕机,付费用户被锁最长7天,官方至今未回应

谷歌 AI 编程 IDE Antigravity 近一周持续出现大面积服务中断。4 月 14 日至 15 日的一次宕机超过 9 小时,所有模型(包括 Gemini 3.1 Pro、Gemini 3.1 Flash 和通过 Antigravity 接入的 Claude)均无法使用,返回 HTTP 503 错误和「Our servers are experiencing high traffic right now」提示。谷歌官方开发者论坛上相关帖子在一天内涌入 120 条回复、80 名用户报告相同问题。

问题不只是临时宕机。月付 20 美元的 Pro 用户反映,原本宣传的 5 小时配额重置周期实际变成了 5 到 7 天的完全锁定,期间无法使用任何模型。谷歌的应对是弹窗建议升级到月付 200 美元的 Ultra 计划。但 Ultra 用户同样报告配额被无声削减、服务不可用。一名 Ultra 订阅者在论坛警告:「别升级了,Ultra 现在也一样,配额被静默砍掉,没有客服,没有公告。」更讽刺的是,Antigravity 内置的 bug 反馈工具本身也无法提交,用户只能涌向论坛。

这不是偶发故障。论坛上最早的配额异常投诉帖可追溯到今年 1 月 25 日,至今已累积超过 639 条回复和 2.65 万次浏览,问题持续近三个月未解决。过去一周集中爆发了多个新帖:「Antigravity 完全无法使用」「Pro 账户被锁 7 天请求手动重置配额」「点击重试反而锁定整个账户」。部分用户已卸载 Antigravity 转向 Cursor 和 Claude Code,论坛上「bye bye antigravity hi cursor」的留言获得高赞。

Antigravity 是谷歌在 AI 编程工具赛道的核心产品,集成多模型调用、浏览器操控、CLI 执行和推理模式切换,今年初上线时被定位为 Cursor 和 Claude Code 的直接竞品。但从用户反馈看,产品的基础可靠性远未达到生产级别。付费用户被锁在门外数天、官方零沟通、连 bug 反馈通道都是坏的,这对一款需要开发者将日常工作流迁移上来的工具来说是致命的。AI 编程工具的竞争已进入拼稳定性和信任的阶段,宕机本身不罕见,但持续三个月的配额混乱加上完全缺位的官方响应,正在把早期用户推向竞品。

信源:https://discuss.ai.google.dev/t/antigravity-servers-down-for-over-7-hours/139906
🤔1
马斯克:Grok Build下周发Beta,编程能力5月才能接近Opus 4.6

Elon Musk 宣布 xAI 的编程工具 Grok Build 将于下周发布 Beta 版,同时提供应用(app)和终端(terminal)两种形态。这是 Grok Build 首次获得明确的上线时间。

Grok Build 对标 Anthropic 的 Claude Code 和 OpenAI 的 Codex。此前对平台代码的拆解显示,该工具可通过命令行在本地运行,也可通过网页界面远程操作。区别于竞品的一个功能是 Model Arena 模式,多个 AI 代理同时处理同一编程任务,用户对比结果后选择最优方案。计费上,xAI 正在搭建积分制体系,订阅用户每月获得固定额度,超出按需购买,与 Claude Code 和 Codex 的模式一致。

不过 Musk 自己也清楚差距。他 4 月 12 日在 X 上说,Grok 的编程能力「要到 5 月才能接近 Opus 4.6,6 月才可能追平甚至超越」,并称「按正常标准很短,但在 AI 领域算很长」。Opus 4.6 是 Anthropic 当前最强的 Claude 模型。

下周的 Beta 版在编程能力上大概率还不是同类最强,但 xAI 急于在 AI 编程工具市场卡位,先把产品形态和商业基础设施铺出来。

信源:https://x.com/elonmusk/status/2044681781816025139
DeepSeek开源GPU算子库DeepGEMM大版本更新,新增Mega MoE将MoE五步运算融合为单个kernel

DeepSeek 今天发布 DeepGEMM 开源以来最大一次更新。这个去年 2 月「开源周」期间发布的 GPU 算子库,原本只做 FP8 矩阵乘法,现在扩展为覆盖大模型推理关键环节的完整算子库,支持 FP8、FP4、BF16 多种精度的矩阵运算,以及 MoE 和注意力评分等专用算子。

核心新增是 Mega MoE。MoE(混合专家)架构是 DeepSeek V3 等模型的基础,推理时需要依次执行五个步骤:EP 分发、第一层线性变换、SwiGLU 激活、第二层线性变换、EP 合并。传统做法是五个独立 kernel 依次调用,每次调用都要等上一步完成、数据在显存里搬来搬去。Mega MoE 把这五步融合成一个 kernel,让 NVLink 通信和 Tensor Core 计算同时进行,省去中间的等待和数据搬运。目前仅支持 FP8×FP4 精度组合,需要 PyTorch 2.9 及以上版本,团队表示仍在优化中,性能对比数据将稍后公布。

其他新增包括:FP8×FP4 混合精度矩阵乘法、支持更大 MTP 的 FP4 注意力评分算子(Indexer)、PDL(程序化依赖启动,一种减少 kernel 启动延迟的 GPU 调度优化)、更快的 JIT 编译速度,以及对 MoE 矩阵运算的多项优化。此次更新还适配了 DeepEPv2 的 MoE 数据布局。

PR 说明中特别注明:「本次发布仅与 DeepGEMM 开发相关,与内部模型发布无关。」

信源:https://github.com/deepseek-ai/DeepGEMM/pull/304
3
OpenAI想靠ChatGPT广告2027年赚110亿美元,但试点CPM只卖到15美元

OpenAI 即将为 ChatGPT 广告引入按点击计费(CPC)模式,并在探索以转化为导向的广告形式(促成购买或应用下载),但后者尚无明确时间表。

广告业务的现状与野心差距明显。OpenAI 今年 2 月开始在免费版和最低价付费版 ChatGPT 中向美国登录用户展示广告,最初目标 CPM(千次展示成本)高达 60 美元,对标流媒体电视等高端广告位。但部分广告主实际成交 CPM 仅为 15 至 25 美元,可能反映出竞标广告位的买家太少。试点期也被迫延长:广告展示频次不够高,早期广告主的预算到 3 月底仍未花完。OpenAI 3 月底在博客中称试点广告 6 周内突破 1 亿美元 ARR,但未说明计算口径。

OpenAI 一季度向投资者表示,预计今年广告收入达 24 亿美元,2027 年达 110 亿美元。后一个目标若实现,其广告规模将远超 Snap 和 Pinterest。

广告主的核心不满是缺乏效果追踪。Meta 和谷歌提供详细的受众画像和转化归因,OpenAI 目前只给聚合数据(展示量、点击量、花费)。营销机构 Brainlabs 程序化业务负责人 Ben Kahan 说:「很多有预算想试新渠道的客户都在观望,因为他们觉得拿不到想要的效果数据。」

OpenAI 正加速补课。近几周已向部分广告主开放自助管理后台,此前投放全靠电子表格和电话沟通;与广告技术公司 Criteo 合作代售;新签约广告主月度最低承诺降至 3 万至 5 万美元,早期最低预付为 20 万美元。但定向能力仍是短板,广告主只能提供宽泛关键词作为投放指引,无法按特定提示词或用户类型精准投放。广告格式也仅有短标题加小图,营销机构 Jellyfish 首席解决方案官 Jai Amin 称目前的格式「相当老派」。

OpenAI 做广告的真正挑战不是技术,而是广告主的预期管理。传统数字广告经过二十年迭代,已形成一套从曝光到转化的完整归因体系,广告主习惯了按效果付费和精准定向。ChatGPT 的对话式交互天然难以套用这套逻辑:每次回答都是动态生成的,没有固定页面可以锚定广告位,也无法像搜索广告那样按关键词竞价。从 CPM 转向 CPC 和转化计费是正确方向,但要真正与 Meta 和谷歌竞争,OpenAI 需要解决的不只是计费模式,还有整个广告测量和定向基础设施。

信源:https://www.theinformation.com/articles/openai-plans-new-pricing-chatgpt-ads-explores-upgrades
Skild AI收购斑马技术机器人业务,「一个大脑控制所有机器人」路线开始落地

机器人基础模型公司 Skild AI 宣布收购斑马技术(Zebra Technologies)的机器人自动化业务,包括已在多个大型物流仓库部署的 Symmetry Fulfillment 调度平台。该业务前身为仓储移动机器人公司 Fetch Robotics。交易条款未披露。

Skild AI 2023 年成立于匹兹堡,核心产品「Skild Brain」是一套通用机器人 AI,不需要针对每种机器人单独训练,同一个模型能直接控制人形机器人、四足机器人、机械臂、自主移动机器人等不同硬件。公司投资方包括软银、英伟达风投、贝佐斯、红杉资本、Lightspeed、Coatue 等,估值超 140 亿美元。新闻稿还披露,Skild AI 2025 年在几个月内从零做到约 3000 万美元营收。

这笔收购的意义在于从「卖大脑」到「管仓库」。上个月 Skild AI 刚与 ABB 机器人和 Universal Robots 达成合作,将 Skild Brain 部署到工业机器人上,但那本质上还是卖软件。这次收购直接拿到了斑马技术在仓储领域的调度基础设施和客户关系。Symmetry 平台能实时协调不同类型的机器人与佩戴斑马可穿戴设备的一线工人。收购完成后,Skild AI 将能提供完整的仓库自动化方案:人形机器人负责拣选,机械臂打包,AMR 搬运,Symmetry 统一调度,Skild Brain 统一控制。

当前仓库自动化高度碎片化,每类机器人对应一套专用软件,换一种机器人几乎要从头开发。Skild AI CEO Deepak Pathak 称,拆掉现有仓库再围着预编程机器人重建在经济上不可行,将斑马的人机协作调度平台与 Skild AI 的通用大脑结合,才能改变现有仓库的自动化方式。

信源:https://www.businesswire.com/news/home/20260415518240/en/Skild-AI-Acquires-Zebra-Technologies-Robotics-Automation-Business
苹果前高管及Nuvia团队再创业,AICPU初创公司Nuvacore获红杉资本投资

苹果前低功耗芯片架构负责人、Nuvia创始人Gerard Williams III宣布再次创业,推出AICPU初创公司Nuvacore。该公司已获得红杉资本(Sequoia Capital)领投的种子轮融资,旨在为AI时代重新设计通用CPU核心。

Nuvacore创始团队极具竞争力,除Williams外,联合创始人还包括同样来自苹果和Nuvia的核心成员John Bruno与Ram Srinivasan。Williams此前创立的Nuvia于2021年被高通以14亿美元收购,其技术成果Oryon架构目前已成为高通PC和手机芯片的核心竞争力。

与追求渐进式改进的传统厂商不同,Nuvacore主张从零开始重写硅片规则。其核心产品是针对AI工作负载和「智能体计算」(agentic computing)高度优化的通用CPU。公司称其设计在实现最高性能的同时具备极高的面积效率,可应用于从核心基础设施到先进AI系统的各类场景。

信源:https://www.nuvacore.ai/?p=1
AI编程初创公司Augment推出Intent工作站,引入「规格驱动」多智能体编排模式

AI 编程初创公司 Augment Code 宣布推出全新开发者工作站 Intent,将 AI 编程从单纯的对话辅助升级为多智能体协同模式。该产品引入了「规格驱动开发(Spec-Driven Development)」概念,通过一个协调者智能体(Coordinator)自动将复杂任务拆解为动态更新的 living spec,并分发给多个并行的专家智能体(如测试、文档、后端专家)执行。

Intent 工作站不仅集成了浏览器、终端和 Git 管理,还支持「可恢复会话」功能,允许开发者在跨天工作时完整保留所有智能体状态与上下文。此外,Intent 采取开放策略,开发者无需 Augment 订阅即可直接在工作站中使用 Claude Code、OpenAI Codex 等第三方智能体工具。

信源:https://www.augmentcode.com/product/intent
郭达雅近亿元年薪入职字节Seed任agent负责人,阿里腾讯曾同时争抢

晚点LatePost 独家报道证实,前 DeepSeek 研究员郭达雅已加入字节跳动大模型研发团队 Seed,担任 agent 负责人之一,职级 L8。他的薪资总包由现金、字节期权和豆包股组成,需满足一定条件才能全额兑现。据晚点估算,若豆包股价格持续增长,四年归属期满后总收益可达数亿元,折合年均近亿元。

阿里、腾讯、字节三家先后接触郭达雅,阿里甚至开出了后训练负责人的职位。他最终选择字节,主要因为研究方向契合:他去年 10 月就已计划离开 DeepSeek,原因之一是看好 agent 方向,而 DeepSeek 内部当时对 agent 的优先级不高。

此前拿到这一级别待遇的是被腾讯请去临危受命、统管全局的姚顺雨,而郭达雅仅作为 agent 负责人「之一」就获得同等待遇,说明 agent 方向在大厂内部的战略权重已大幅提升。伴随他的加入,Seed 内部正启动针对 agent 和 Coding 的组织整合。晚点援引接近团队的员工称,2025 年底字节每次训练 Code 模型,「上面都说是最后一次了」。今年 1 月底字节跳动 CEO 梁汝波在全员会上将 AI 模型能力列为 2026 年「重中之重」,近亿元引进郭达雅是这一转向的直接体现。

信源:https://mp.weixin.qq.com/s/vAE8KmnM2Mhbq4Y4Xacenw
字节回应「近亿元挖来DeepSeek核心员工」:近期没有招聘到近亿元年薪员工

针对字节跳动花费近亿元挖来前 DeepSeek 研究员郭达雅的消息,抖音副总裁李亮回应称,字节跳动招聘的所有 Seed 团队技术人员的薪资体系都是一样的,包括现金、字节期权和豆包期权,期权是四年期全部归属,没有所谓「需要满足一定条件才能拿全」的情况,近期更没有招聘到近亿元年薪的员工。Seed 员工的字节和豆包期权未来收益根据期权价格有波动,假如业务发展的很好,不排除有些 Seed 技术人员四年后收益会达到数亿元。

信源:https://m.yicai.com/brief/103136827.html
通义千问开源Qwen3.6首个模型,35B总参数仅激活3B,编程能力追平27B稠密模型

阿里巴巴通义实验室开源 Qwen3.6-35B-A3B,这是 Qwen3.6 系列的首个模型,采用稀疏混合专家(MoE)架构,总参数 350 亿,每次推理仅激活 30 亿参数。

模型主打编程场景。在 SWE-bench、Terminal-Bench 等智能体编程基准上,Qwen3.6-35B-A3B 大幅超越前代 Qwen3.5-35B-A3B,并追平 Qwen3.5-27B、Gemma-31B 等参数量大数倍的稠密模型。换句话说,跑这个模型的算力成本只有同等性能稠密模型的零头,对本地部署和 API 调用场景都意味着显著降本。

模型同时具备原生多模态能力,支持图文理解、文档解析和空间智能任务,在 RefCOCO 目标定位基准上得分 92.0。

实际使用层面,模型已上架 Hugging Face 和 ModelScope,可本地部署。API 即将在阿里云百炼上线(模型名 qwen3.6-flash),同时兼容 OpenAI 和 Anthropic 两套 API 协议,可直接接入 Claude Code、OpenClaw、Qwen Code 等编程助手。通义实验室表示后续将继续扩展 Qwen3.6 开源家族。

信源:https://mp.weixin.qq.com/s/4VCtPRFaj2i2gpapCpLBwQ
Anthropic发布Opus 4.7,刻意削弱网络攻击能力,为全面开放最强模型Mythos铺路

Anthropic 发布新一代旗舰模型 Claude Opus 4.7,已在所有 Claude 产品、API 及 Amazon Bedrock、Google Cloud Vertex AI、Microsoft Foundry 上线,定价与 Opus 4.6 相同(输入 5 美元/百万 token,输出 25 美元/百万 token)。

编程是本次升级的重点。Anthropic 称用户现在可以放心地把最难的编程任务交给 Opus 4.7,无需密切监督。多家早期测试方给出了具体数据:AI 编程工具 Cursor 的内部基准测试中,Opus 4.7 完成率 70%,Opus 4.6 为 58%;协作工具 Notion 报告代理任务成功率提升 14%,工具调用错误降至三分之一;日本电商平台乐天在其 SWE-Bench 上测得 Opus 4.7 解决的生产级任务数量是 Opus 4.6 的 3 倍。代码审查工具 CodeRabbit 称其召回率提升超 10%,速度略快于 GPT-5.4 xhigh。

视觉能力升级幅度同样显著。Opus 4.7 支持长边最高 2576 像素(约 375 万像素)的图片输入,像素总量是此前 Claude 模型的 3 倍以上。自动化渗透测试公司 XBOW 测得其视觉精度基准从 Opus 4.6 的 54.5% 跃升至 98.5%。更高分辨率意味着模型可以处理密集截图、复杂图表等此前力不从心的视觉任务,但也会消耗更多 token。

比起性能提升,更值得关注的是 Anthropic 在这款模型上的安全实验。上周 Anthropic 发布了 Project Glasswing 计划,讨论 AI 模型在网络安全领域的风险与收益,并表示将其最强模型 Claude Mythos Preview 的发布范围保持有限,先在能力较弱的模型上测试新的网络安全防护措施。Opus 4.7 是第一个试验田:Anthropic 称在训练过程中尝试了选择性削弱模型的网络攻击能力,同时保留其他能力,并在部署时加入了自动检测和拦截高风险网络安全用途的机制。需要将模型用于合法安全工作(如漏洞研究、渗透测试)的专业人士,可申请加入新设立的 Cyber Verification Program。这意味着 Opus 4.7 不只是一次常规升级,更是 Anthropic 测试「能力与安全可以分别调控」这一假设的关键实验,其结果将直接决定 Mythos 级别模型何时能全面开放。

其他更新:API 新增介于 high 和 max 之间的 xhigh 推理等级,以及公测阶段的任务预算功能;Claude Code 新增 /ultrareview 代码审查命令,auto mode 扩展至 Max 用户。迁移方面,Opus 4.7 使用了新分词器,相同输入可能消耗约 1.0 至 1.35 倍的 token。

信源:https://www.anthropic.com/news/claude-opus-4-7
2
OpenAI首个行业专用模型GPT-Rosalind瞄准制药,RNA预测超过95%人类专家

OpenAI 发布 GPT-Rosalind,这是该公司首个针对特定行业构建的前沿推理模型,面向生物学、药物发现和转化医学。模型以对揭示 DNA 结构做出关键贡献的科学家 Rosalind Franklin 命名,目前作为研究预览版在 ChatGPT、Codex 和 API 上线,仅面向通过资质审核的美国企业客户开放,预览期间不消耗现有额度。

选择生命科学作为第一个垂直行业,本身就是一个战略信号。OpenAI 给出的理由是:一款新药从靶点发现到获批上市平均需要 10 至 15 年,AI 在早期发现阶段的提速会向下游复利式传导,更好的靶点选择、更强的生物学假设、更高质量的实验设计,最终提高整条管线的成功率。

性能方面,GPT-Rosalind 在生物信息学基准 BixBench 上取得已公开模型中的最高分。在涵盖文献检索、序列操作、实验方案设计等 11 项研究任务的 LABBench2 基准上,6 项超过 GPT-5.4,提升最显著的是分子克隆实验设计(CloningQA)。与 AI 基因治疗公司 Dyno Therapeutics 合作的评测使用了未公开、未被训练数据污染的 RNA 序列,模型十次提交中的最优结果在序列功能预测上排在人类专家历史成绩的第 95 百分位以上,序列生成排在第 84 百分位左右。

OpenAI 同时在 GitHub 开源了 Codex 生命科学研究插件,接入超过 50 个公共多组学数据库、文献源和生物工具,覆盖人类遗传学、功能基因组学、蛋白质结构、生物化学等领域。插件所有用户均可免费使用,不限于 GPT-Rosalind,也可搭配通用模型。Amgen、Moderna、Allen Institute、Thermo Fisher Scientific 等已参与早期合作,OpenAI 还与洛斯阿拉莫斯国家实验室探索 AI 引导的蛋白质和催化剂设计。GPT-Rosalind 是其生命科学模型系列的首个版本,后续将持续扩展生化推理能力。

信源:https://openai.com/index/introducing-gpt-rosalind/
OpenAI Codex大更新:可直接操控Mac桌面,能跨天自动醒来继续干活

OpenAI 发布 Codex 重大更新,目前每周有超过 300 万开发者使用这款产品。此次更新的核心变化是 Codex 不再局限于写代码,开始介入软件开发的全流程。

最大的功能跃迁是「后台电脑操控」:Codex 现在可以直接在 Mac 上看屏幕、点鼠标、敲键盘,操作任何应用程序,且多个代理可并行工作,各用各的光标,不干扰用户正在做的事情。对开发者来说,这意味着迭代前端界面、测试应用或操作没有 API 的工具时,不用再手动截图描述,代理自己看着办。

应用内新增浏览器,用户可以直接在页面上标注评论给代理下指令,适合前端和游戏开发中的快速迭代。图片生成方面集成了 gpt-image-1.5,可在同一工作流中生成产品概念图、UI 设计稿和游戏素材。新增超过 90 个插件,覆盖 Atlassian Rovo(JIRA 管理)、CircleCI、CodeRabbit、GitLab Issues、Microsoft Suite、Neon by Databricks 等开发工具链。

自动化能力的扩展更值得关注。Codex 现在可以复用已有对话线程保留上下文,自行安排未来任务并自动唤醒继续执行,时间跨度可达数天甚至数周。同时推出记忆功能预览版,能记住用户的偏好、纠正和历史操作中积累的信息,让后续任务完成得更快。Codex 还会基于项目上下文、已连接的插件和记忆,主动建议用户从哪里开始一天的工作或接续之前的项目,比如识别 Google Docs 中待处理的评论,拉取 Slack、Notion 和代码库的相关上下文,生成优先级排序的行动清单。

开发者工作流方面新增 GitHub PR 评审评论处理、多终端标签页、通过 SSH 连接远程 devbox(alpha 阶段),以及侧边栏文件预览(支持 PDF、电子表格、幻灯片和文档)。

这些更新正在向已登录 ChatGPT 的 Codex 桌面端用户逐步推送。记忆和主动建议功能将稍后面向企业版、教育版及欧盟/英国用户开放,电脑操控目前仅支持 macOS。

信源:https://openai.com/index/codex-for-almost-everything/
👍1
Anthropic被曝筹备AI设计工具,Instagram联合创始人退出Figma董事会避嫌

Anthropic 首席产品官 Mike Krieger 4 月 14 日辞去界面设计公司 Figma 的董事席位,Figma 当日向美国证券交易委员会(SEC)披露了这一变动。同一天,《The Information》独家报道称 Anthropic 正在筹备 AI 设计工具,将与 Figma 的核心产品直接竞争。Krieger 加入 Figma 董事会不到一年。

Krieger 此前联合创办了 Instagram 和 AI 新闻应用 Artifact,2024 年出任 Anthropic 首席产品官。Figma 是全球最主流的 UI/UX 设计工具,此前与 Anthropic 深度合作,将 Claude 模型集成到自家产品中作为设计助手。如今合作方变成了竞争对手,Anthropic 不再满足于做嵌入他人产品的基础设施层,开始向应用层扩张。

这是今年投资者口中「SaaS 末日论」(SaaSpocalypse)的最新案例:头部 AI 实验室凭借基础模型优势亲自下场做应用,挤压传统软件公司的空间。iShares 主要软件 ETF(IGV)年内已跌近 18%。不过 Figma 股价在消息公布后反而上涨约 5%,市场尚未认定 AI 实验室能真正复制成熟设计工具多年积累的专业工作流和客户关系。

信源:https://techcrunch.com/2026/04/16/anthropic-cpo-leaves-figmas-board-after-reports-he-will-offer-a-competing-product/
OpenAI网络安全联盟首批名单公布:华尔街六大行集体加入,1000万美元资助开源安全

OpenAI 公布「网络安全可信访问」(Trusted Access for Cyber)计划的首批合作机构。14 家机构中,华尔街占了近一半:美国银行、贝莱德、纽约梅隆银行、花旗、高盛、摩根大通、摩根士丹利,加上网络安全公司 CrowdStrike、Zscaler、SpecterOps、iVerify,以及思科、英伟达、甲骨文。这些机构将获得 GPT-5.4-Cyber 的访问权限,用于各自数字基础设施的安全防御。

金融机构扎堆并不意外。银行是全球遭受网络攻击最密集的行业之一,安全团队规模大、预算充足、对新工具的采纳速度快,也最有动力在 AI 安全工具的早期阶段就参与进来争取影响力。纽约梅隆银行首席信息官 Leigh-Ann Russell 在声明中称,该行正与「推动这些努力的前沿力量」密切合作。

同时,OpenAI 宣布通过「网络安全资助计划」投入 1000 万美元 API 额度,面向开源安全和漏洞研究团队。首批受资助方包括软件供应链安全公司 Socket 和 Semgrep,以及漏洞研究机构 Calif 和 Trail of Bits。OpenAI 在博文中提到,并非每个组织都有全天候安全团队能在漏洞「周五晚间披露」时及时响应,这正是资助计划想解决的问题。

OpenAI 还向美国 AI 标准与创新中心(CAISI)和英国 AI 安全研究所(UK AISI)提供了 GPT-5.4-Cyber 访问权限,供两家机构评估模型的网络安全能力和安全防护措施。

信源:https://openai.com/index/accelerating-cyber-defense-ecosystem/
Claude Code配合Opus 4.7用法大改:别当结对编程搭档用,把整个任务一次交出去

Claude Code 之父 Boris Cherny 发布 Claude Code 配合 Opus 4.7 的使用指南,核心建议是改变交互方式:把 Claude 当作你委派任务的工程师,而非逐行指导的结对编程搭档。因为 Opus 4.7 在每次用户发言后会进行更多推理以提升连贯性和指令遵循能力,但副作用是每多一轮对话都会增加 token 开销。最高效的用法是在第一轮就把任务意图、约束条件、验收标准和相关文件位置说清楚,然后放手让模型执行。

Opus 4.7 不再支持固定思考预算(Extended Thinking with fixed budget),取而代之的是「自适应思考」,即模型自行判断每一步是否需要深度推理,简单查询快速回复,复杂问题才投入思考 token。用户仍可通过提示词调节思考深度,如「这个问题比看起来难,请逐步思考」或「优先快速回复,不必深度推理」。

Opus 4.7 默认调用工具更少、启动子代理更保守、回复长度随任务复杂度自动调节(简单问题比 Opus 4.6 更简短)。这些变化在多数场景下能产生更好的结果,但如果工作流依赖频繁的文件搜索或并行子代理,需要在提示词中明确指示。Claude Code 的默认推理等级已从 high 提升至新增的 xhigh(介于 high 和 max 之间),Anthropic 建议大多数编程和代理任务使用该等级。
信源:https://claude.com/blog/best-practices-for-using-claude-opus-4-7-with-claude-code
谷歌与五角大楼谈机密Gemini部署,条款复刻Anthropic拒绝的OpenAI模板

谷歌正与美国国防部谈判,拟允许五角大楼在机密环境中部署 Gemini AI 模型。两名直接了解谈判的知情人士向《The Information》透露,双方已接近达成协议。这是谷歌自 2018 年因员工抗议退出 Project Maven(军方将 AI 用于无人机目标识别的项目)以来对军方立场的重大逆转。

协议允许将谷歌 AI 用于「所有合法用途」,但谷歌提议加入额外条款,禁止用于国内大规模监控或自主武器(包括没有『适当』人类监督和控制的目标识别)。这套措辞几乎复刻了 OpenAI 今年早些时候与五角大楼签署的协议。OpenAI CEO Sam Altman 当时曾要求五角大楼对所有 AI 公司给予相同条款。

OpenAI 合同生效时就有律师指出其结构性漏洞:看似禁止全自主致命武器和国内大规模监控的措辞,会被同样写入合同的「所有合法用途」覆盖。谷歌提议的条款面临同样问题。

而这两项安全承诺,正是今年 2 月 Anthropic 与五角大楼公开决裂的核心。Anthropic CEO Dario Amodei 拒绝放弃对全自主致命武器和国内大规模监控的禁令,五角大楼随后将 Anthropic 列为「供应链风险」,经六个月过渡期后将其排除出军方新合同。Anthropic 已就该指定发起两起诉讼,供应链风险状态目前仍然生效。多位国防部官员对 Amodei 抱有敌意,相比之下谷歌在五角大楼的口碑正在回暖。

机密部署谈判不是孤立事件。2025 年初特朗普二任上台后,谷歌改写了 AI 原则,删除了对武器和监控的明确禁令。此后军方订单陆续到账:2025 年 7 月拿下五角大楼首席数字与 AI 办公室最高 2 亿美元的 AI 试点合同,12 月 Gemini 成为军方非机密 AI 平台 GenAI.mil 接入的首个模型,今年 3 月宣布为五角大楼提供 AI agents 产品自动化非机密工作。机密部署是这条路线图最后一块拼图。

内部的张力从未消失。谷歌首席 AI 科学家 Jeff Dean 此前在 X 上公开反对将 AI 用于大规模监控或自主武器,200 多名谷歌员工曾联署致信他,Dean 与近 40 名谷歌和 OpenAI 员工还在 Anthropic 起诉五角大楼的案件中签署了支持 Anthropic 的法庭之友简报。

信源:https://www.theinformation.com/articles/google-pentagon-discuss-classified-ai-deal-company-rebuilds-military-ties
OpenClaw新版把Claude默认模型升到Opus 4.7,Google插件补上Gemini语音合成

开源 AI Agent 框架 OpenClaw 发布 v2026.4.15,真正值得用户关注的变化只有两处:把 Anthropic 一侧的默认模型指向昨天才发布的 Claude Opus 4.7,以及给 Google 插件补上 Gemini 文本转语音能力。

修复里有一条和安全相关的值得拎出来:本地 MEDIA: 工具结果的信任放通此前只认工具名,客户端只要声明一个与内置工具同名的工具定义,就能借机继承本地媒体的信任权限。v2026.4.15 把放通严格绑定到本次运行中已注册的内置工具原始名,并拒绝任何与内置或同请求内其他客户端工具重名的定义,HTTP 与 SSE 路径均返回 `400 invalid_request_error`。

其余修复还包括:CLI 升级时清理过期的 dist chunk、遗留 openai-codex 条目自动修复到正确的 Codex 传输路径、BlueBubbles 插件在 Node 22+ 下恢复入站图片附件下载、默认启动与 skills 提示预算下调以降低长会话上下文占用。

信源:https://github.com/openclaw/openclaw/releases/tag/v2026.4.15