动察Beating AI News
3.16K subscribers
888 photos
2 videos
1 file
3.41K links
AI新闻信息流
Download Telegram
开车可以问ChatGPT了:率先接入CarPlay,苹果开放语音AI类应用后首家到位

OpenAI 于 3 月 31 日更新 ChatGPT,新增 CarPlay 支持,成为主要 AI 工具中首个推出专属 CarPlay 应用的。使用须将 iPhone 升级至 iOS 26.4 或更高版本,该系统版本上周发布,首次将「语音对话类应用」纳入 CarPlay 允许的应用类别,并要求开发者申请苹果专项授权后方可接入。

CarPlay 版 ChatGPT 完全以语音为主要交互方式,不显示文字或图像,符合苹果针对驾驶场景的安全设计规范。界面仅有「结束」和静音两个按钮,支持查看历史语音对话列表。目前没有唤醒词,需手动在 CarPlay 界面打开应用才能使用;ChatGPT 也不能控制车辆功能或 iPhone 操作。

对驾驶途中想免持提问的用户来说,这是 Siri 之外的新选择。苹果同样的接入规则对所有第三方语音 AI 应用开放,ChatGPT 只是率先到位。

信源:https://9to5mac.com/2026/03/31/chatgpt-app-launches-for-carplay-on-ios-26-4/
Claude Code新增/web-setup:复用本地GitHub凭据接入网页版

Claude Code 产品负责人 Cat Wu 宣布,claude.ai/code 的 GitHub 配置流程已大幅简化。用户现在可以在本地 claude 会话中运行 /web-setup 命令,将本地已有的 GitHub 凭据直接同步至网页端,跳过在浏览器中重新完成 OAuth 授权的步骤。

信源:https://x.com/_catwu/status/2039027712288075812
谷歌将axios供应链攻击归因朝鲜组织UNC1069

谷歌威胁情报团队(GTIG)和 Mandiant 将昨日 axios 供应链攻击归因于 UNC1069,一个自 2018 年起活跃、以金融动机为主的朝鲜背景黑客组织,历史攻击目标以加密货币和 AI 行业为主。归因依据是此次部署的 WAVESHAPER.V2 后门与 UNC1069 历史使用版本的直接代码传承,以及 C2 基础设施(sfrclak[.]com / 142.11.206.73)与其过往活动记录的重叠。

感染影响已在野确认。Huntress 检测到恶意包上线 89 秒后出现首次感染,确认至少 135 个客户系统在约 3 小时暴露期内遭入侵;Wiz 遥测显示安装了受影响版本的环境中约 3% 出现 RAT 执行记录。

调查同时披露了攻击为何能绕过 OIDC 和 2FA:axios 项目已将发布流程迁移至 OIDC Trusted Publishing,但发布配置中同时保留了旧式长期 npm token;npm 在两者并存时默认优先使用旧 token,攻击者只需窃取这个 legacy token 即可绕过所有现代安全措施。axios 主维护者事后发文:「我对几乎所有账号都启用了 2FA/MFA。」这一凭证遗留问题在过去 7 个月内已连续引发三次主要 npm 供应链攻击。

信源:https://cloud.google.com/blog/topics/threat-intelligence/north-korea-threat-actor-targets-axios-npm-package/
Nothing明年上半年发AI眼镜,CEO裴宇此前明确抵制

Web3智能手机制造商 Nothing 正在开发 AI 智能眼镜,计划于 2027 年上半年发布。彭博援引知情人士称,眼镜将配备摄像头、麦克风和扬声器,不设屏幕,AI 处理依赖智能手机和云端,与 Meta Ray-Ban 的技术路线相近。

有趣的是,CEO 裴宇此前明确抵制这一方向。知情人士称他此后改变想法,近期告知员工公司正专注于向手机和音频产品以外扩展更多品类。Nothing 目前产品线仅涵盖 Android 手机和音频设备。

此次入局时机敏感,三星和谷歌均在 Android XR 生态下规划各自的智能眼镜,Meta Ray-Ban 已率先确立市场标杆。Nothing 以独特工业设计著称,如何在同质化硬件规格下做出差异化,是这款产品能否立足的关键问题。

信源:https://www.bloomberg.com/news/articles/2026-03-31/device-startup-nothing-technology-plans-to-release-ai-glasses-next-year
Mercury Edit 2发布:扩散模型预测下一处改动,代码修改接受率提升48%

AI 基础模型公司 Inception Labs 发布 Mercury Edit 2,一款专为代码编辑器「下一处改动预测」设计的扩散语言模型(dLLM)。与传统自回归模型逐 token 生成不同,Mercury Edit 2 用扩散机制并行生成所有 token,速度足以在用户思考时同步完成预测,按 Tab 键接受。

模型结合编辑历史和代码库上下文预测用户下一步改动。训练上,Inception Labs 采用 KTO(一种无配对强化学习方法),以用户接受或拒绝建议的行为作为偏好数据进行对齐。对齐后,模型改动接受率提升 48%,主动出示建议的频率降低 27%,改动更集中、干扰更少。

在涵盖行补全、变量重命名、重构、特性实现等场景的三个开源基准(Instinct、FIM、NEP)及一个内部基准上,Mercury Edit 2 的质量和速度均优于对照的定制下一处改动模型和速度优化前沿模型。代码编辑器 Zed 联合创始人 Max Brunsfeld 称,Mercury Edit 2 带来了「一种有实质差异的扩散式生成路径」。

Mercury Edit 2 现已通过 Inception Platform 开放 API 接入,集成至 Zed 和 ProxyAI。定价为输入 $0.25/百万 token,输出 $0.75/百万 token,缓存输入 $0.025/百万 token;新账号自动获赠 1000 万免费 token;Zed 用户使用官方提供的 API Key 可免费体验一个月。

信源:https://www.inceptionlabs.ai/blog/introducing-mercury-edit-2
甲骨文凌晨6点一封邮件裁掉数千人,要为AI数据中心挤出百亿美元

甲骨文(Oracle)周二启动大规模裁员。CNBC 援引两名知情人士确认裁员规模达数千人;一名甲骨文员工告诉 BBC,据公司内部 Slack 活跃人数变化推算,约 1 万人已受影响。TD Cowen 分析师今年 1 月估计,甲骨文裁减 2 万至 3 万人可带来 80 亿至 100 亿美元增量自由现金流。截至 2025 年 5 月,甲骨文全球员工约 16.2 万人。

多名员工在社交媒体上描述了裁员过程:凌晨 6 点(美东时间),署名「Oracle Leadership」的解雇邮件到达收件箱,告知当天即为最后工作日,此前没有任何来自主管或人力部门的预告。签署 DocuSign 离职文件后可获一个月遣散金,未归属的限制性股票单位立即作废。甲骨文高级经理 Michael Shepherd 在 LinkedIn 发帖称,被裁人员涵盖高级工程师、架构师、运维负责人、项目经理和技术专家,裁员与绩效无关。

裁员直接服务于甲骨文对 AI 基础设施的激进投入。公司今年 1 月宣布通过债务和股权融资 500 亿美元用于数据中心建设,也是 Stargate 计划(与 OpenAI、软银合作,总投资 5000 亿美元)的参与方。联席 CEO Clayton Magouyrk 本月财报电话会上称,「AI 基础设施的需求,无论 GPU 还是 CPU,都持续超过供应」,公司待确认合同金额已达 5530 亿美元。甲骨文股价今年已下跌 25%,跌幅超过所有科技巨头,但裁员消息公布后当天股价反涨约 5%。甲骨文拒绝置评。

信源:https://www.bbc.com/news/articles/cm296jzzl9yo
2
TII开源两款Falcon视觉模型:0.6B分割超SAM 3,语言越复杂优势越大

阿联酋 Falcon LLM 系列研发机构技术创新研究所(TII)在 Hugging Face 发布 Falcon Perception 和 Falcon OCR 两款视觉模型。两款模型均采用「早期融合」单一 Transformer 骨干:图像块与文本 token 共享参数空间,图像 token 使用双向注意力,文本 token 使用因果注意力,省去传统「视觉编码器 + 文本解码器」的级联设计。这使模型能真正读懂自然语言里的空间限定和对象关系,而不只是对视觉特征做语义检索。

Falcon Perception 参数量 0.6B,定位开放词汇图像分割与定位。在 SA-Co 基准上取得 Macro-F1 68.0,高于 Meta SAM 3 的 62.3。TII 同步发布诊断基准 PBench,按能力维度分层评测。Falcon Perception 在需要语言理解的任务上领先最为明显:

1. L2(OCR 引导识别,如找「标有 168 字样的酒瓶」):38.0 vs SAM 3 的 24.6(+13.4)
2. L3(空间关系,如「左边的黑色汽车」「从左数第三扇窗」):53.5 vs SAM 3 的 31.6(+21.9)
3. L4(交互关系,如「拿着雨伞的人」「使用手机的人」):49.1 vs SAM 3 的 33.3(+15.8)
4. 密集场景(数百实例共存):72.6 vs SAM 3 的 58.4(+14.2)

简单对象(L0)差距仅 +0.8,印证了差距随语言复杂度增大的规律。实例存在性校准(是否存在目标)方面,SAM 3 仍占优:MCC 0.82 vs 0.64。

Falcon OCR 参数量 0.3B,复用相同骨干但从零训练,专为文档理解设计。olmOCR 基准得分 80.3(距榜首 1.7 分),多栏版面(87.1%)和表格提取(90.3%)领跑所有测试模型;OmniDocBench 得分 88.64,超过参数量更大或依赖专有基础设施的 DeepSeek OCR v2、GPT 5.2 和 Mistral OCR 3。据 TII 官方表述,Falcon OCR 是开源 OCR 模型中吞吐量最高的,在单张 A100-80GB 上高并发实测达 5,825 token/秒(全流程约 2.9 张图/秒)。

两款模型均已在 Hugging Face 开源,Falcon Perception 提供在线 Playground。

信源:https://huggingface.co/blog/tiiuae/falcon-perception
不用离线训练草稿模型了:Together AI开源Aurora,推测解码边推理边自学

AI 云平台 Together AI 开源 Aurora,一个基于强化学习的推测解码(speculative decoding)自适应框架。推测解码是当前加速大模型推理的主流手段:用一个小型「草稿模型」快速预测 token 序列,再由大模型并行验证,命中的直接采用,未命中的丢弃重来。问题在于,草稿模型是离线训练的静态产物,生产流量一旦漂移(模型升级、用户群变化、任务类型切换),预测准确率就持续下降,而重新离线训练既昂贵又滞后。

Aurora 把推测解码重新建模为强化学习问题:草稿模型是策略,大模型验证器是环境,被接受的 token 是正奖励,被拒绝的是负反馈。系统分推理服务器和训练服务器两个解耦组件,推理端正常处理请求并将验证结果流式写入缓冲区,训练端异步拉取数据更新草稿模型权重后热替换回推理端,全程不中断服务。

在 4 万条跨 5 个领域(数学推理、Text-to-SQL、代码生成、金融、通用对话)的模拟流量测试中,Aurora 在流量域突变后约 1 万条请求内恢复接受长度,比训练充分的静态草稿模型额外提速 1.25 倍。更值得注意的结果是,从零开始在线训练的 Aurora 接受长度达到 3.08,超过静态基线的 2.63 和「先预训练再微调」基线的 2.99,吞吐量稳定在 302.3 tokens/秒,直接挑战了「推测解码必须依赖大规模离线预训练」的既有认知。

端到端实测中,在 Qwen3-Coder-Next(FP8)上 batch size 为 1 时推测解码带来 1.92 倍加速,MiniMax M2.5(FP8)上为 1.63 倍。Aurora 去年发布的前身 ATLAS 奠定了自适应推测器的基础,此次升级为完全自主的闭环系统。代码已在 GitHub 开源。

信源:https://www.together.ai/blog/aurora
英伟达20亿美元入股Marvell,把定制芯片对手收编进自家生态

英伟达宣布向半导体公司 Marvell Technology 投资 20 亿美元,同时通过 NVLink Fusion 平台向 Marvell 开放 AI 服务器架构,允许其将定制 AI 芯片和网络设备集成到英伟达系统中。双方还将在硅光子(用光代替铜线传输数据,可大幅提速并降低能耗)和 5G/6G 电信网络 AI 化方面展开合作。

Marvell 的核心业务之一是帮助亚马逊等云计算巨头设计定制 AI 加速芯片,这些芯片本质上是英伟达 GPU 的替代方案。英伟达此举相当于主动拥抱定制芯片趋势:与其让客户在英伟达 GPU 和定制芯片之间二选一,不如让定制芯片也运行在英伟达的基础设施生态中。按照合作分工,Marvell 提供定制加速芯片(XPU)和兼容 NVLink Fusion 的扩展网络,英伟达提供 Vera CPU、网卡、DPU、交换机和机柜级 AI 算力。

黄仁勋在声明中称:「推理拐点已经到来,token 生成需求激增,全世界都在竞相建造 AI 工厂。」Marvell 董事长兼 CEO Matt Murphy 在 CNBC 采访中表示他不认为这是零和博弈,两家公司正在共同扩大整个市场。

这是英伟达近年来沿 AI 供应链的又一笔数十亿美元级投资。去年 5 月黄仁勋宣布开放 AI 服务器架构允许多家合作伙伴(包括 Marvell)部署定制芯片,此次入股是这一开放战略的实质性落地。硅光子合作同样值得关注,Marvell 去年 12 月已收购硅光子初创公司 Celestial AI。消息公布后 Marvell 股价大涨 13% 至 99.05 美元,创三周多以来最大单日涨幅;英伟达涨 5.6% 至 174.40 美元。

信源:https://nvidianews.nvidia.com/news/nvidia-ai-ecosystem-expands-as-marvell-joins-forces-through-nvlink-fusion
Claude新宠物功能上线不到一天就被破解:社区开源重抽工具,白板秒变闪光传说

Claude Code 新宠物功能 /buddy 上线数小时,开发者社区就从泄露源码中找到了重抽方法,开源工具和教程已在 Linux.do、V2EX、GitHub 等平台传播。

目前至少有两种重抽路径。一种针对宠物生成算法中的固定盐值(salt),该值以 15 个字符硬编码在 Claude Code 的编译产物中,通过同长度替换即可改变随机种子,暴力枚举后找到对应目标宠物的值写入即可。另一种利用认证路径差异:订阅用户正常登录时,服务端下发的 accountUuid 作为宠物种子且无法篡改,但通过环境变量认证时该值不被写入本地配置,系统退而求其次读取可自由编辑的 userID 字段。

改 salt 的方法最脆弱,下次 Claude Code 更新就会被覆盖。改 userID 对订阅用户来说也有保质期,Anthropic 补上环境变量路径的 accountUuid 写入逻辑即可封堵。API 用户(使用自有 API Key 认证)天然没有 accountUuid,可直接修改 userID,窗口相对更长,但 Anthropic 同样可以通过 API Key 哈希生成稳定标识来封堵。骨架数据不存本地,每次启动实时计算,任何服务端补丁都能立刻生效。

另外,userID 不只服务于宠物系统。泄露源码显示遥测上报和 A/B 测试分组同样读取该值,修改后可能导致实验功能异常或使用数据断裂。

信源:https://linux.do/t/topic/1871870
6亿美元OpenAI股份无人接盘,买家带20亿美元现金排队抢Anthropic

OpenAI 刚以 8520 亿美元估值完成 1220 亿美元融资,但二级市场讲的是另一个故事。二级交易公司 Next Round Capital 创始人 Ken Smythe 称,近几周约有六家机构投资者(包括对冲基金和风投)找到他想出售总计约 6 亿美元的 OpenAI 股份,去年这些股份几天内就会被抢光,现在无人问津。「我们在数百家机构投资者中找不到任何一家愿意接手,」他说,该公司已累计撮合 25 亿美元交易。与此同时,「买家已表示有 20 亿美元现金准备投入 Anthropic。」

二级平台 Augment 和 Hiive 同样录得 Anthropic 创纪录需求。Augment 联合创始人 Adam Crawley 称,OpenAI 8520 亿与 Anthropic 3800 亿的估值差距正推动投资者抢购后者:「现在就是更好的风险回报。人们押注 Anthropic 估值会追上 OpenAI,但买 OpenAI 的近期回报不太明朗。」Next Round 和 Augment 的报价均将 Anthropic 估值推至约 6000 亿美元,较上一轮融资溢价超过 50%;Hiive 联合创始人 Prab Rattan 称平台上 Anthropic 需求已超 16 亿美元,同样带有溢价。Crawley 称这一需求「本质上是无上限的」。

OpenAI 方面,Next Round 录得的买入报价对应估值约 7650 亿美元,较此前 8500 亿折价约 10%。高盛和摩根士丹利已开始向财富客户分销 OpenAI 股份且不收取附带权益费(carry),而高盛对 Anthropic 仍收取常规的约 15%-20% 利润分成。一级市场融资和二级市场交易的逻辑并不相同:一级融资中,现有股东常被邀请跟投以维持持股比例,与其拒绝(创始人可能不愿看到),不如先买入再到二级市场减持部分敞口。

部分投资者对 OpenAI 高企的运营成本持谨慎态度。该公司未来数年在基础设施上的承诺支出远超 Anthropic,且消费端收入占比约六成,企业客户拓展偏慢;Anthropic 则已占据利润率更高的企业市场,Crawley 认为其增长曲线因此更强。两家公司均不允许投资者未经许可在二级市场交易股份,但通过特殊目的载体(SPV)等机制,这些股份在多个平台上仍可获得。OpenAI 发言人回应称,公司「近期已通过银行建立了授权渠道供个人参与,且零手续费,以对抗高费率经纪商模式」,并提醒「对任何声称持有 OpenAI 股权(包括通过 SPV)的公司保持高度警惕」。

信源:https://www.bloomberg.com/news/articles/2026-04-01/openai-demand-sinks-on-secondary-market-as-anthropic-runs-hot
智谱发布其首个多模态编程基座模型GLM-5V-Turbo

智谱 AI 发布 GLM-5V-Turbo,定位为其首个多模态编程基座模型。该模型原生处理图像、视频和文本输入,支持 200K 上下文窗口和最大 128K 输出 token,专为视觉编程任务设计。

此前的编程模型只能处理文本代码,遇到设计稿转代码、根据截图定位 bug 等需要「看见」界面的任务时无法胜任。GLM-5V-Turbo 补上了这块短板,深度适配 Agent 工作流,可与 Claude Code 和 OpenClaw 配合完成「理解环境 → 制定计划 → 执行任务」的完整闭环。

技术上,模型采用新的 CogViT 视觉编码器和推理友好的 MTP(多 token 预测)架构,从预训练到后训练持续强化视觉与文本的对齐。训练阶段使用 30 余种任务联合强化学习,涵盖 STEM 推理、视觉定位、视频理解、GUI Agent 和编程 Agent,避免了视觉能力提升导致编程能力下降的跷跷板效应。

典型应用场景包括:

1. 输入设计稿或参考图片,直接生成可运行的前端项目,高保真设计稿可逼近像素级还原
2. 配合 Claude Code 自主浏览目标网站、采集页面跳转和交互细节,再据此生成代码
3. 输入 bug 页面截图,自动识别布局错位、组件重叠、色彩不匹配等渲染问题并生成修复代码

在多模态编程和 Agent 任务基准测试中,GLM-5V-Turbo 以较小的模型参数量在设计稿转代码、视觉代码生成、GUI 环境操作(AndroidWorld、WebVoyager)等方向取得领先成绩。纯文本编程基准 CC-Bench-V2 的后端、前端和仓库探索三项核心测试中同样表现稳健,视觉能力的加入未损害文本编程能力。模型同时发布图像描述、视觉定位、文档写作、简历筛选、提示词生成 5 个官方 Skill,已上线 ClawHub。

信源:https://docs.z.ai/guides/vlm/glm-5v-turbo
Claude Code上线全屏渲染模式,彻底解决闪烁和内存膨胀

Claude Code 之父 Boris Cherny 宣布推出实验性的 NO_FLICKER 全屏渲染模式。该模式将界面绘制在终端的备用屏幕缓冲区上(类似 vim 或 htop 的工作方式),只渲染当前可见的消息,从根本上解决了长对话中的屏幕闪烁、画面跳动和内存持续增长问题。

启用方式为在启动时设置环境变量 `CLAUDE_CODE_NO_FLICKER=1 claude`,需要 v2.1.88 或更高版本。

全屏模式同时引入了鼠标支持:点击输入框可定位光标,点击折叠的工具输出可展开查看,点击 URL 或文件路径可直接打开,拖拽选择文本松开即自动复制到剪贴板。滚动方面支持鼠标滚轮和 PgUp/PgDn 键盘快捷键,滚动速度可通过 CLAUDE_CODE_SCROLL_SPEED 调节。

代价是原生的 Cmd+F 搜索和原生复制粘贴不再直接可用。替代方案是按 Ctrl+O 进入类似 less 的转录模式,用 / 搜索,用 [ 将完整对话写回原生滚动缓冲区供 Cmd+F 使用。如果鼠标捕获造成干扰(尤其在 SSH 或 tmux 环境下),可额外设置 CLAUDE_CODE_DISABLE_MOUSE=1 关闭鼠标功能但保留无闪烁渲染。该模式目前为研究预览阶段。

信源:https://x.com/bcherny/status/2039421575422980329
Claude Code v2.1.90修复缓存回归和auto越界

Anthropic AI 编程工具 Claude Code 发布 v2.1.90,距源码泄露善后版 v2.1.89 仅隔一天。

最值得关注的修复涉及 auto 模式的信任边界:此前即使用户明确指定了「别推代码」(don't push)或「先完成 X 再做 Y」(wait for X before Y)等限制条件,auto 模式在判定该操作属于已授权范围时仍会无视用户的显式禁令直接执行。对于一个可以执行 git push、修改文件、运行系统命令的自主 Agent,不尊重用户设定的行为边界是信任层面的问题,而非普通 bug。

另一个隐藏已久的回归 bug 同样代价不菲:自 v2.1.69 起,使用 --resume 恢复会话时,如果用户配置了延迟加载工具(deferred tools)、MCP 服务器或自定义 Agent,首次请求会触发完整的 prompt cache miss,也就是本应命中缓存的请求一直在按全价计费。这个回归横跨约 20 个版本,到 v2.1.90 才被修复。

性能方面修了两处二次复杂度问题:SSE 传输处理大型流式帧从 O(n²) 降到 O(n),SDK 长会话的 transcript 写入同样从二次降到线性,重度用户的长会话响应速度会有明显改善。

新功能 /powerup 是内置的交互式教学系统,通过动画演示逐步教用户使用 Claude Code 的各项功能,降低上手门槛。此外收紧了 PowerShell 工具的权限检查,修复了尾部 & 后台任务绕过权限、`-ErrorAction Break` 导致调试器挂起等安全问题,并从自动允许列表中移除了 DNS 缓存查看命令(隐私考量)。

信源:https://github.com/anthropics/claude-code/blob/main/CHANGELOG.md#2190
大版本隔天紧急稳定:OpenClaw 2026.4.1推40项修复,「永久允许」此前只生效一次

开源 AI Agent 平台 OpenClaw(GitHub 345k 星)发布 2026.4.1 版,距前一天的 2026.3.31 仅隔一天。2026.3.31 是一个包含 6 项 breaking changes、约 30 项新功能和 60 项修复的大版本,此次 2026.4.1 紧随其后推出 40 项修复,其中多项直接指向 2026.3.31 引入的回归。如果你在 2026.3.31 上遇到了网关挂起、LINE 启动失败或 Anthropic 长会话报错,升级到 2026.4.1 可以解决。

回归修复集中在两个方向。2026.3.31 刚引入的 SQLite 后台任务系统出现网关启动约一分钟后因同步压力挂起、维护扫描覆盖活跃任务状态、已完成任务在状态面板残留等问题,均已修复,同时新增 /tasks 命令,可在聊天界面直接查看后台任务看板。2026.3.31 的插件架构外部化导致打包安装和 Docker 构建中内置插件运行时依赖丢失,LINE 渠道在全局 npm 安装后无法启动,也已修复。

执行审批(exec approvals)的安全修复同样密集,但这不是 2026.3.31 引入的新问题,而是两个版本持续修补的跨版本积欠。2026.3.31 已修复 macOS 上 arch`/`xcrun 包装器的信任绑定和 Discord/Telegram 审批者推断等问题,2026.4.1 进一步堵上更深层的漏洞:`allow-always`(永久允许)实际表现为 allow-once`(仅允许一次),用户每次都需要重新授权;静态白名单条目可绕过 `ask: "always" 的强制审批设置;Windows 上无法构建白名单执行计划时远程执行直接卡死。对于一个可以执行系统命令的 Agent 平台,审批逻辑的正确性直接关系安全边界,连续两版密集修补说明此前的实现离预期还有距离。

其他修复中值得注意的是 Anthropic 模型的思考块(thinking blocks)和签名在上下文压缩后丢失,导致开启 extended thinking 的长会话在后续轮次报错。新功能方面,macOS 新增 Voice Wake 语音唤醒;内置 SearXNG 搜索插件,支持自托管搜索引擎;飞书渠道新增文档评论协作流程;Z.AI 供应商目录加入 GLM-5.1 和 GLM-5V-Turbo。

信源:https://github.com/openclaw/openclaw/releases/tag/v2026.4.1
Agent能力紧追Opus4.6,价格只要4%:Arcee开源Trinity Large Thinking

美国 AI 模型公司 Arcee 发布 Trinity-Large-Thinking,一款面向长时间 Agent 任务的开源推理模型。模型采用稀疏混合专家(MoE)架构,总参数 400B,激活参数仅 13B,以 Apache 2.0 许可证在 Hugging Face 开放权重下载。

与前代 Trinity-Large-Preview(纯指令微调)不同,Trinity-Large-Thinking 在回答前先执行推理思考,多轮工具调用、长上下文连贯性和指令遵循能力均有提升,核心设计目标是在长时间 Agent 循环中保持稳定输出。

在 Kilo 开发的 Agent 能力基准 PinchBench 上得分 91.9,排名第二,仅次于 Opus 4.6 的 93.3;在 Agent 任务基准 Tau2-Airline 上得分 88.0,为所有对比模型中最高。不过通用推理基准表现一般:GPQA-D 得分 76.3,低于 Kimi-K2.5(86.9)和 Opus 4.6(89.2);MMLU-Pro 得分 83.4,同样排在末位。据 Arcee 官方表述,该模型在「许多维度上是中国以外最强的开源模型」。

Arcee API 定价为输出 $0.90/百万 token,据 Arcee 称较 Opus 4.6 便宜约 96%。模型同步上线 AI 模型路由平台 OpenRouter,前 5 天在 OpenClaw 中免费使用。前代 Preview 自 1 月底发布以来在 OpenRouter 上已服务超过 3.37 万亿 token,是 OpenClaw 收录的美国使用量第一、全球第四的开源模型,Preview 将继续在 OpenRouter 免费提供。

信源:https://arcee.ai/blog/trinity-large-thinking
2小时5万星、一天破10万:Claude Code泄露催生GitHub史上最快项目,从零重写躲过DMCA

Claude Code 源码泄露后不到 24 小时,一个名为 Claw Code 的项目在 GitHub 上以创纪录的速度积累了超过 10 万颗星,据项目自述为 GitHub 历史上最快突破这一里程碑的仓库。截至发稿,该项目已获得 12.4 万星和 10.2 万次 fork。与直接搬运泄露源码的数千个仓库不同,Claw Code 的做法是只看架构不抄代码,完全从零实现一遍,工程和法律上称为「净室实现」(clean-room implementation)。

项目作者 Sigrid Jin 在 README 中讲述了这段经历:3 月 31 日凌晨 4 点,泄露消息引爆了他的手机通知,他在韩国的女友担心「仅仅因为电脑上存有这些代码就可能面临法律风险」。他做了一个工程师在压力下会做的决定:坐下来,从零开始用 Python 重写核心功能,天亮前推上 GitHub。整个过程使用 Yeachan Heo 开发的 AI 编码工作流工具 oh-my-codex(OmX)辅助完成。

这正是 Claw Code 未被 Anthropic DMCA 下架的关键。Anthropic 对直接镜像泄露源码的 8100 个仓库发起了版权保护通知,但 Claw Code 的代码库里没有一行原始 TypeScript,先用 Python 重写,后转向 Rust,目前代码库 92.9% 为 Rust。项目包含 7 个 Rust crate,覆盖 API 客户端、运行时状态管理、MCP 编排、工具执行框架、插件系统、命令体系和交互式 CLI。

Sigrid Jin 并非无名开发者。《华尔街日报》3 月 21 日报道「The Trillion Dollar Race to Automate Our Entire Lives」中将其描绘为全球最活跃的 Claude Code 重度用户之一,称其去年单人使用了 250 亿 Claude Code token,并曾飞赴旧金山参加 Claude Code 一周年聚会。

此前 GitHub 上最快达到 10 万星的项目据报道是 OpenClaw,用时数周。Claw Code 将这一时间压缩到一天以内,但 GitHub 不公布官方增长排名,这一记录来自项目自述和多家科技媒体引用。值得注意的是,该项目 fork 数(10.2 万)与 star 数(12.4 万)之比超过 80%,远高于正常开源项目 10%-20% 的水平,这些 star 更多来自泄露事件驱动的收藏行为,而非项目本身的产品使用。

信源:https://github.com/ultraworkers/claw-code
Claude Code Dispatch补上权限短板:远程编码任务终于可选权限模式

Anthropic AI 编程工具 Claude Code 的 Dispatch 功能新增权限模式设置。Dispatch 允许用户通过手机向本地桌面端的 Claude Code 远程分派编码任务,此前编码任务的权限控制选项有限,现在用户可以在发起任务时选择具体的权限模式。

Claude Code 产品经理 Noah Zweben 在 X 上发文介绍了这一更新。他推荐使用 Auto 模式,称其是「最安全且最流畅的 Dispatch 体验」。Auto 模式由 AI 分类器实时评估每个操作的风险等级,安全操作自动放行,高风险操作自动拦截,介于逐一确认和完全跳过权限之间。用户也可以选择其他已授权的权限模式。如果选择 Bypass Permissions(跳过权限检查),则需要在会话启动时手动批准。

信源:https://x.com/noahzweben/status/2039407002913513477
Codex先行,几个月内成型:Brockman首次详述OpenAI超级应用路线图

OpenAI 总裁兼联合创始人 Greg Brockman 在 Big Technology Podcast 的采访中首次详细描述了超级应用的具体形态和实施路径。这款应用将把 ChatGPT、AI 编程平台 Codex 和 AI 浏览器 Atlas 合并为一个统一入口,目标是让用户「任何想让电脑做的事都可以直接开口要求」。

Brockman 将其定位为「个人 AGI」,一个了解用户偏好、与用户目标对齐、能代表用户处理数字世界事务的个人助手。他透露第一步是扩展现有的 Codex 应用,使其不仅面向程序员,而是支持通用知识工作。他称这项工作是从 Codex 已有的通用 Agent 底座出发,接入电子表格、文档等工具:「Codex 应用本质上是两个东西合一:一个通用 Agent 底座加上一个会写代码的 Agent。那个通用底座可以用在太多地方了。」

OpenAI 内部已经出现了大量自发使用 Codex 处理非编程工作的案例,比如通信团队用它接入 Slack 和邮件来综合反馈。整个超级应用计划将在未来几个月分步推出,不会一次性发布,ChatGPT 独立移动端应用保留不变,合并仅针对桌面端。

这一战略也暗含资源博弈。Brockman 坦言 OpenAI 目前的算力「连个人助手和 Codex 两条线都不够用」,无法同时支撑更多应用线,这是关停 Sora、收缩产品线的根本原因。他形容这是「对技术成熟和即将到来的巨大影响力的认知」,而非简单的从消费端转向企业端。

信源:https://youtu.be/J6vYvk7R190
关停产品不等于放弃研究:Brockman称Sora世界模型技术已转入机器人方向

Greg Brockman 在同一采访中透露,Sora 背后的研究计划并未随产品关停而终止,而是被并入机器人方向继续推进。他表示 Sora 的世界模型与核心 GPT 推理系列属于「技术树的两个不同分支」,在算力有限的情况下同时推进两条分支「对我们来说非常困难」,因此 Sora 的消费级应用被砍掉,但研究团队的工作转向了「一项非常明确会带来变革的应用:机器人」。

Brockman 解释了为何机器人方向仍属研究阶段而非产品优先级:「机器人还没有真正成熟到可以规模化部署的程度,我们将在明年看到知识工作领域的真正起飞,而不是机器人。」这与 OpenAI 将全部产品化资源集中在 GPT 推理系列上的逻辑一致。他同时强调 GPT 系列并非只做文本,语音交互、图像生成等能力都基于同一模型架构的不同调优,不构成独立分支。

他还回应了谷歌 DeepMind 负责人 Demis Hassabis 此前称图像/视频生成最接近 AGI 的观点,坦言「绝对有可能,是的」,OpenAI 选择押注 GPT 推理路线意味着「你必须做选择、下注」,并引用 OpenAI 早期的一个信条:「随机向量之和为零,但如果你对齐向量,就能往一个方向走。」

信源:https://youtu.be/J6vYvk7R190
「两年研究的结晶」:Brockman首谈Spud模型,回应Dario「在赌命」批评

Greg Brockman 在采访中首次以技术视角谈及 OpenAI 内部代号为 Spud 的新一代预训练基础模型。他将 Spud 描述为「大约两年研究的结晶」,是 OpenAI 所有后续能力提升的基底。他解释了模型生产流程:先做预训练产出基础模型,再经过强化学习让模型在多种场景中练习解题,最后做行为和可用性层面的后训练微调。他过去 18 个月的主要精力集中在 GPU 基础设施和训练框架的扩展上。

关于 Spud 的能力,Brockman 给出了定性而非定量的预期:模型将能解决更难的问题,对指令的理解更精准、对上下文的把握更深入,减少那种「大模型味」(big model smell)。他以一位密切合作的工程师为例:在 GPT-5.2 和 GPT-5.3 之间,这位工程师从「完全没法用 AI 做底层系统工程」变成了「给它一份设计文档,它能实现功能、加上监控指标和可观测性、跑性能分析器再优化,产出正好是他想要的东西」。

采访人引述了 Anthropic CEO Dario Amodei 此前的说法:「有些玩家在赌命(yoloing),把风险拉得太高,我非常担心」,并提到 Amodei 称如果预测稍有偏差,公司可能破产。Brockman 直接回应:「我不同意。我们一直非常深思熟虑,非常清楚地看到了即将到来的趋势。」他认为 OpenAI 是最早认识到算力瓶颈的公司,而其他公司「大概去年底才意识到这一点,开始抢购算力,但已经买不到了」。对于破产风险,他认为「实际上有更多退出坡道」,并将这个赌注归结为对整个行业而非单一公司的判断:「你相不相信这项技术能产出并交付我们看到的那种巨大价值?」

信源:https://youtu.be/J6vYvk7R190