动察Beating AI News
3.14K subscribers
876 photos
2 videos
3.39K links
AI新闻信息流
Download Telegram
逃离一年半后重返前线!Karpathy加盟Anthropic,曾于3月透露防漂移动机

5 月 19 日,前 Tesla 自动驾驶负责人、OpenAI 联合创始人 Andrej Karpathy 在 X 平台官宣,已正式加入前沿 AI 实验室 Anthropic 重回研发一线,距离他去年 2 月从 OpenAI 再次离职已过去近一年半。

这次备受瞩目的重返并非毫无预兆,其深层动机早在两个月前便已公开。在 3 月 20 日发布的 No Priors 播客访谈中,Karpathy 曾坦言自己对游离在前沿实验室之外感到神经紧张,因为闭源巨头筑起的黑盒壁垒,正导致外部研究员的技术直觉与判断力开始不可避免地出现漂移。

当时他透露,自己极度警惕完全被单一闭源实体所掌控,并对集中化权力天生怀疑。原因很简单,他绝不希望世界智能被紧闭大门后的两三个巨头垄断。因此在播客中,Karpathy 描绘了一种理想的「挂职」状态,即通过去前沿实验室做一段时间的研发,既能连接最新的技术,又不至于完全丧失独立性,而这次正式加盟 Anthropic 显然兑现了这一防漂移的挂职设想。

信源:https://x.com/karpathy/status/2056753169888334312
支持3500个语言对!阿里发布首个视觉增强同传大模型Qwen3.5-LiveTranslate

同传系统正在从单调的语音翻译,进化为能看懂画面、会克隆人声的全模态数字译员。5 月 19 日,阿里通义实验室正式宣布推出新一代实时音视频同传大模型 Qwen3.5-LiveTranslate,将实时同传能力大幅升级至 3500 多个语言对,并首次支持实时声音克隆、热词自定义与视觉理解。

新模型基于 Qwen3.5-Omni 架构,现已支持 60 种语言的理解与写作,以及 29 种语言的语音输出。

不同于传统只听声音的同传软件,新模型引入了实时视觉上下文以消除语义歧义。例如当视频画面中出现特定口罩时,系统能结合视觉特征,在英文中精准区分出医疗口罩与化妆舞会面具,以此弥补声音信息的缺失。

为了消除噪音与口音带来的转录偏差,新模型还引入了热词动态注入机制。原因很简单,用户能在翻译流中直接指定特定人名、品牌或行业术语,强行锁定正确翻译,避免专有名词在同传中发生漂移。

在跨语种同传时,模型还支持实时人声克隆,能够在同传流中实时复现说话人原声的音色与语气。

目前,新模型已在体验平台 Qwen Omni 开放,未来 API 将登录阿里云百炼平台。

信源:https://qwen.ai/blog?id=qwen3.5-livetranslate
Qwen3.7-Max正式发布:35小时自主写代码1158次,在国产芯片上炼出10倍加速算子

阿里通义千问正式发布新一代智能体旗舰基底 Qwen3.7-Max。官方公布的实战数据显示,在完全没有芯片架构文档与性能分析数据的情况下,新模型在一项长达 35 小时、跨越 1158 次工具调用的全自主内核优化任务中,将国产平头哥真武 M890 处理器的 Triton 算子性能强行提升了 10.0 倍。

在优化过程中,模型历经了五个核心演进阶段。它首先通过 Split-K 分区将前缀 KV-cache 沿 token 维度划分以填满 36 个 SM 核心;随后将主机与设备间同步的 cudaMalloc 替换为预分配的 PyTorch 变量,并通过使用 tensor 元数据完全抹去了查询前缀长度时的同步 cudaMemcpy 动作,彻底移除了主机与设备间的通信开销;在最后阶段,模型重构算子以在单个线程块中同时处理全部 4 个 query token,共享加载以分摊访存开销,完成了关键的架构级特化重构。

算子优化实测显示,Qwen3.7-Max 取得 10.0x 几何平均加速比,显著超越 GLM 5.1(7.3x)与 Kimi K2.6(5.0x)。而 DeepSeek V4 Pro 仅为 3.3x 且在后半程因连续五轮未发出任何工具调用而提前主动结束任务。

为了在多变环境里掌握通用的解题策略,Qwen3.7-Max 在训练中将任务、运行框架与验证器进行了解耦,并通过跨框架强化学习训练避免了针对特定基准的捷径过拟合。在通用的智能体基准 MCP-Mark(60.8 分)与 SpreadSheetBench(87.0 分)上,Qwen3.7-Max 展现了极强的泛化性,综合性能表现已紧逼 Claude-4.6-Opus-Max。

信源:https://mp.weixin.qq.com/s/aAWHw7itcNx9pIEinZIOPA
OpenClaw 原生打通 Grok 订阅,C 端会员权益直通本地

开源本地助理 OpenClaw 在 v2026.5.16-beta.3 的版本更新中,正式引入了 xAI Grok 的 OAuth 登录支持。拥有 SuperGrok 或 X Premium 订阅的用户,现在可以直接在系统中调用全线 xai 模型。

用户只需在终端执行 `openclaw onboard --auth-choice xai-device-code`,控制台就会打出一串短码。用任何浏览器完成网页端身份确认后,本地设备就能合法复用 X 平台的订阅配额。

信源:https://x.ai/news/grok-openclaw
Altman断言全球将陷算力荒,OpenAI推出1-3年算力长约并打折

大模型竞争正演变为对底层物理算力的直接抢夺。OpenAI 推出「算力保证」服务,企业只要承诺 1 到 3 年的资金消费,就能锁定算力访问权,并根据承诺金额获得 Token 阶梯折扣。

CEO Sam Altman 预警,随着大模型越来越强,未来全球算力将长期受限。钱的问题压过来,这套长约本质上是一场双向互利:企业花钱锁定了 AI 智能体和生产系统的稳定算力,而 OpenAI 提前拿到资金,也能更稳妥地规划并扩建下一代基础设施。

这项计划的额度有着明确的物理上限。Sam Altman 明确表示,当前分配的额度卖完就停,且底层必须留足算力,优先保证 ChatGPT 和 Codex 等自有核心产品的正常运转。

信源:https://x.com/sama/status/2056827105401614656
Altman重返YC投Token换股权:表面生态合谋,实则对早期风投降维收割

大模型巨头正通过资源倾销,直接收割最源头的 AI 生态。OpenAI 首席执行官 Sam Altman 以「前任掌门人」身份在 Y Combinator 活动现场宣布,将向本期所有 YC 孵化项目提供每家 200 万美元的 OpenAI Token 额度,直接用来换取这些初创公司的早期股权。

这场无差别投资被外界视为 2011 年尤里·米尔纳普惠投资的历史重演,并在创投圈引发震动。对 YC 而言,这场合作意味着初创公司不必拿珍贵的 50 万美元现金去支付 API 账单。资金的变相「解套」直接拉升了团队存活率,让 YC 持有的早期股权实现了价值躺赢。

但在双赢表象之下,这本质上是 OpenAI 对早期风投圈的降维抢食。OpenAI 正凭借算力霸权,用边际成本极低的虚拟 Token 去兑换极度稀缺的优质初创股权。当算力彻底「法币化」,这种变相的「Token 铸币税」不仅大幅降低了初创公司对传统风投的现金需求,更从物理源头上彻底封死了 Anthropic 或开源生态在下一代软件中的蔓延通道。

信源:https://x.com/sama/status/2056933166875857290
11分钟VS Code毒插件放倒员工电脑,GitHub承认3800个内部仓库遭窃取

GitHub 官方发布安全调查公告,确认因一名员工设备感染了被投毒的 VS Code 插件,导致其内部代码仓库遭遇未经授权的访问。攻击者声称已打包窃取了 GitHub 约 3800 个内部仓库,官方承认此说法与目前的调查结果在方向上一致。

涉事恶意插件为 5 月 18 日在微软 Visual Studio Code 市场短暂上架的知名扩展 Nx Console(v18.95.0 版本)。攻击者通过窃取贡献者 Token 获得了发布权限,将包含凭证窃取器的恶意版本推送到应用市场。

虽然 Nx 团队在 11 分钟内就检测到异常并撤下了此版本,但依然有 GitHub 员工在此期间下载并中招。此恶意载荷在后台会自动读取主机的 Git 凭证、VS Code 扩展存储、AWS 密钥及 1Password 敏感数据。这套凭证让外部攻击者得以绕过外围的安全阻隔,直接打包窃取了 GitHub 内部的代码库。

GitHub 表示已在 5 月 19 日检测并控制了这起设备入侵。为了降低风险,安全团队在昨天及夜间加急轮换了所有关键密钥,并对高价值凭证进行了优先处理。目前团队正持续分析日志并监控后续活动,完整报告将在调查结束后公布。

信源:https://x.com/github/status/2056949168208552080
黑客疑用Anthropic Mythos击穿GitHub,Copilot源码惨遭一锅端

慢雾(SlowMist)安全团队披露,网络犯罪论坛的最新爆料显示,攻击者疑似使用 Anthropic 的安全 AI 模型「Mythos」精准撕开了 GitHub 的内部防线。

在被窃取的约 4000 个 GitHub 内部代码库中,包含了 Copilot 源码、CodeQL 算法、Actions 运行时以及计费系统的代码。慢雾团队提示,一旦黑客深度分析这些代码,可能对开源社区产生后续的安全影响。原因很简单,这些系统承载着大量开发者的核心工作流。

信源:https://x.com/im23pds/status/2056953434222592372
DeepSeek亲自下场做Claude Code竞品,内部证实正组建Harness团队

DeepSeek 资深研究员陈德里在社交媒体证实,公司内部正在组建全新的 Harness 团队,直接对标 Anthropic 的 Claude Code,重点研发「DeepSeek Code Harness」。

官方招聘页面显示,DeepSeek 目前在北京海淀区开放了 Harness 产品经理与研发工程师两个关键岗位,明确说明新入职成员将参与「DeepSeek 桌面端 Agent 产品」的研发全过程。

招聘描述将核心路径定义为「Model + Harness = Agent」。DeepSeek 将上下文管理、工具调用、文件读写、终端执行与测试反馈等模型之外的工程动作,全部划归 Harness 范畴。

在此之前,开发者社区已经自发推出过对标 Claude Code 的开源终端项目 DeepSeek-TUI。此次官方亲自下场组建 Harness 团队,意味着 DeepSeek 正在收回终端入口的主导权,试图将真实项目里的代码测试反馈直接注入到底层模型的进化闭环中。

信源:http://xhslink.com/o/2s3bdToHerC
1
X全面接入Agent:官方发教程指导AI怎么刷推回帖

X 开发者团队发布了一份完整配置指南,教导用户如何为 Nous Research 开发的开源终端 AI 智能体 Hermes 接入 xurl 技能。装载这项技能后,用户能直接用日常口语命令智能体代管 X 账号,一句话让它去执行发帖、搜索、拉取书签或管理列表。

为了跑通这条全自动刷推链路,用户需要前往 X 开发者平台注册应用,拿到 OAuth 2.0 凭证并在本地完成授权;同时,底层推理如果是由 xAI 提供的模型支撑,用户必须拥有激活的 SuperGrok 订阅以调用 Grok 系列模型。

xurl 本身是一个独立的 X API 命令行客户端。当用户在终端敲下「提取所有的书签」时,Hermes 会在后台把这句话转译成 xurl 命令去跑,然后把 API 吐出来的生硬 JSON 代码拦截下来,洗成一份有数据有出处的干爽文本交还给用户。借助智能体特性,它还能把动作连续打包:用户可以直接让它先搜特定话题、做个归纳,接着拟好回复发出去,这些动作全都能在一次对话里一口气跑完。

信源:https://x.com/XDevelopers/status/2056871280599847054
1
Copilot CLI远程控制全量上线,手机可随时介入本地任务

GitHub 宣布 Copilot CLI 远程控制功能正式在移动端与网页端全量上线。从现在起,用户在本地终端、VS Code 或 JetBrains 里敲下命令启动的 AI 任务,其执行画面和状态将实时流式同步到手机端。

这直接改变了长耗时任务的执行模式。当系统在后台自动执行代码生成或重构时,用户完全可以离开工位。一旦 Copilot 走到需要确认权限、索要输入参数的卡点,它会把请求推送到 GitHub Mobile App。用户能在手机上查看它即将执行的计划,直接点击批准、强行中止,或者排队发送下一条指令。

本次更新彻底拔掉了强制绑定托管仓库的物理限制。即使用户操作的是完全未关联 GitHub 的纯本地目录,也能在网页端的专属代理面板看到任务进度。对于被安全策略限制的企业版用户,这项跨端接管能力默认处于冻结状态,必须由系统管理员在后台放行相关策略后才能激活。

信源:https://github.blog/changelog/2026-05-18-remote-control-for-copilot-cli-sessions-now-generally-available-on-mobile-web-and-vs-code/
ECHO登场:让CLI Agent边敲命令边学会预判报错

命令行智能体训练多了一条更省数据的路线。微软研究团队发布 ECHO,让 CLI Agent 在强化学习时不只学习「下一步该敲什么命令」,也学习「这条命令敲完后,终端会返回什么」。

过去训练这类 Agent,终端返回的报错、日志、文件内容、测试结果,通常只会进入上下文,帮助模型决定下一步动作。但训练损失主要算在 Agent 自己生成的命令上,终端返回内容本身不直接参与训练。

ECHO 改的就是这里:同一次训练过程中,它会额外要求模型预测终端输出。比如 Agent 运行测试失败,传统训练只知道这条轨迹最后没通过;ECHO 还会让模型学习这次失败具体返回了什么错误、文件里暴露了什么线索、命令造成了什么后果。

这相当于把失败轨迹也榨出训练价值。论文实验显示,在 TerminalBench-2.0 上,Qwen3-8B 的 pass@1 从 2.70% 提升到 5.17%,Qwen3-14B 从 5.17% 提升到 10.79%,相对 GRPO-only 训练接近翻倍。

训练效率上,ECHO 在部分 8B 实验中达到同等内部分数最多少用约 2.3 倍训练步数。它还减少了对专家演示数据的依赖:基于 Qwen3-8B 的 ECHO 智能体,在内部评测中追平了使用约 1.5 万条专家轨迹微调后的 OpenThoughts-Agent。

不过 ECHO 不是万能替代奖励信号。无验证器自我改进只在反馈清晰的任务上效果明显,例如 PyTerm 提升 10.0 个百分点,ITD 提升 5.2 个百分点;在更复杂的 TBLite 上反而下降 3.9 个百分点。它真正证明的是:终端里的报错、日志和测试输出,不只是上下文,也可以直接变成 Agent 训练数据。

信源:https://github.com/anadim/anadim.github.io/blob/master/papers/echo.pdf
Anthropic为Claude装上「外置良心」:调用道德工具后违规行为显著下降

大模型的对齐方式,正从单向被动的规则灌输,走向探索构建更具韧性的「道德性格」。Anthropic 宣布针对 AI 系统的道德性格培养展开专项研究,并在近期实验中赋予 Claude 一项新功能:一个可在执行任务中途调用的道德提醒工具。

实验结果显示,Claude 经常在采取关键行动前主动触发这个工具,并会明确指出自身面临的利益冲突。引入这一机制后,Claude 在多项内部对齐评估中的不对齐行为率出现显著下降。Anthropic 目前仍在拆解背后的技术归因:不对齐行为的减少,究竟是得益于道德提醒的具体内容,还是模型执行「停顿反思」这一物理动作本身。

这次实验的灵感来源于人类社会的道德导师机制。过去数月,Anthropic 组织了一轮跨宗教与跨文化的深度对话,邀请超 15 个群体的神经科学家、哲学家和神职人员参与,探讨如何将人类在遇到违背价值观压力时向「安全他者」求助的机制,尝试接入到 Claude 的决策流程中。

下一步,Anthropic 将把外部讨论范围扩大至法律学者、心理学家和公民机构,议题也将从单纯的模型道德培养,延伸至 AI 将如何重塑当前的工作形态与权力分配体系。

信源:https://www.anthropic.com/news/widening-conversation-ai
阿里发布为Agent而生官网「千问云」:全站Skill与CLI化重构,智能体一键调用

未来模型服务平台的使用主力不再是人类,而是智能体本身。今天,阿里云在峰会发布了首个专门为 Agent 而生的 AI 产品官网「千问云」(www.qianwenai.com),提供 150 多款主流模型的 API 服务。此官网最大的重构在于,通过将模型服务链路全面进行 Skill 化、MCP(模型上下文协议)化与客户端(CLI)化重构,让 Agent 能够直接「读懂」并一键自主调用网站的全部能力。

不同于以往为人设计的控制台交互,千问云彻底摒弃了人类开发者繁琐阅读文档、手写集成代码以及调试 API 参数的传统流程。原因很简单,传统的模型接口是为人点击和手动对接设计的,而 Agent 需要的是极度敏捷的瞬态调用。通过这一全新的架构重构,诸如 OpenClaw、Hermes Agent、Claude Code 等智能体仅需一句简单的指令,就能自主「学会」官网的所有核心功能。

在技术实现上,千问云 Skills 封装了模型选型、调用、认证及用量查询的全链路能力。Agent 在此架构下,可根据具体任务自主进行动态路由:遇到图片则自动调用视觉大模型处理,需要插画则自动转接生图大模型,实现多模型的自动化编排。而千问云 CLI 客户端工具则全量覆盖了登录认证、状态查询和环境诊断等任务,支持 Agent 直接以命令行或脚本在后台自动化流转全部工作流。目前,这两套核心工具包已在 GitHub 开源。

除了接口的系统级重构,千问云还让 Agent 深度介入了模型费用的后台管理。智能体可实时拉取高频调用的用量数据,分析消费趋势并识别异常,自主为用户输出成本优化建议。为应对高频 AI 编程和多智能体协作等新型用量特征,千问云在常规按量付费之外,特别推出了 Token Plan 订阅模式,旨在显著降低 Agent 场景下的 Token 消耗成本。

信源:https://mp.weixin.qq.com/s/ERTLfMCEPQA7j00LYmMhsw
个人通道6月18日关闭,谷歌下线旧版Gemini CLI强推Antigravity

谷歌开发者官网发布公告,公布命令行工具 Gemini CLI 向 Antigravity CLI 迁移的详细时间表。因为底层框架全面变更,个人及免费用户必须在 2026 年 6 月 18 日前手动迁出,届时旧版工具将停止响应请求。

此次停服主要影响个人及独立开发者。自 6 月 18 日起,使用 Google AI Pro、Ultra 以及个人免费版 Gemini Code Assist 的账户将无法调用旧版 CLI。GitHub 组织的 Gemini Code Assist 插件也将于同日停止新装,并在随后数周内全面切断 API 响应。谷歌现已上线迁移文档(antigravity.google/docs/gcli-migration)以供参考。

企业通道则不受停服影响:购买 Gemini Code Assist 授权的组织,既能继续调用旧版以保障老业务稳定性,也能直接将全新的 Antigravity CLI 接入现有项目进行尝鲜。个人或独立开发者若想保留旧版访问权限,则须手动切换为付费的 API 密钥。

新发布的 Antigravity CLI 采用 Go 语言编写,运行响应更加轻快。它全量集成了旧版的 Agent Skills、Hooks 与 Subagents 机制,但在运行逻辑上彻底转向后台异步流转。用户可在终端并行启动大型重构或多源技术调研,不再锁定当前会话。同时,新工具与 Antigravity 2.0 桌面端共享相同的智能体管理内核,无论使用命令行还是桌面端,核心智能体的优化和改动都会自动同步生效。

信源:https://developers.googleblog.com/an-important-update-transitioning-gemini-cli-to-antigravity-cli/?utm_source=social
OpenAI联手对手谷歌:ChatGPT全线接入DeepMind隐形水印,并推出图片真伪验证工具

OpenAI 宣布与昔日对手谷歌 DeepMind 展开合作,在 ChatGPT 、 Codex 以及 API 生成的图像中全面接入 SynthID 隐形水印,并正式成为 C2PA 图像凭证标准合规产品,同时上线了图片真伪验证工具的公众预览版。

作为行业标准的 C2PA 元数据依靠密码学签名记录来源,但在用户下载、截图或转换图片格式时,这些元数据极易丢失。

为了修补这一漏洞, OpenAI 引入了谷歌 DeepMind 开发的 SynthID 隐形水印技术,直接在图像像素中嵌入肉眼不可见的标识。

即使图片经过截图等二次处理, SynthID 依然能够留存。双层防御机制将元数据的丰富上下文与隐形水印的持久性结合在一起。

配合这次更新, OpenAI 还上线了一个查真伪的官方网站( openai.com/research/verify ),目前已面向公众开放预览。

用户可以直接在网页端上传图片,由这一工具检测其中是否含有 OpenAI 的 Content Credentials 凭证或 SynthID 隐形水印。

不过, OpenAI 在检测结论上表现得十分谨慎。由于水印和元数据在极端情况下仍有被强行剥离的可能,即使工具查不出任何防伪信号,也无法武断地断定图片一定不是由 AI 生成的。

信源:https://openai.com/index/advancing-content-provenance/
扎克伯格解释追踪员工键鼠原因:外包太笨,而你们很聪明

美国劳工媒体 More Perfect Union 曝光了一段 Meta 内部大会录音,首席执行官马克· 扎克伯格在 4 月 30 日的全员会议中,承认公司已实施名为「模型能力计划」 (MCI) 的内部追踪项目,通过在员工电脑上运行监控工具,记录其鼠标移动轨迹、点击位置、键盘按键以及屏幕截图。

面对内部抵触,扎克伯格在录音中极力辩护:目前行业大模型训练数据高度依赖外包,而 Meta 员工的平均智力远高于普通外包人员。

在他眼中,数千名精英工程师解决编程任务、构建工具时的日常轨迹,是极其稀缺的高质量训练素材。Meta 试图借此让旗下模型的代码进化速度彻底甩开同行。

除了写代码,这套系统还必须学会像人类一样「使用电脑」。要让 AI 智能体掌握导航下拉菜单、使用快捷键等连环操作,最直接的路径就是让它持续观察聪明人的电脑使用过程。

面对员工关于暗中监视的质问,扎克伯格保证,没有任何人类会查看这些记录,敏感内容会在数据流出前被尽可能剥离,且数据绝不用于绩效考核或员工监控。

由于 Meta 正面临裁员,不少员工对被迫交出个人电脑数据、甚至用它来训练「能替代自己的 AI」感到十分抗拒。扎克伯格在会议中承认前期沟通不够,但强调项目必须保密:AI 竞争太残酷,这种能拉开身位的独家套路一旦公开,对手会立刻照抄。

而且这只是个开始。扎克伯格直言,只要证明这套路能提升模型能力,Meta 接下来就会在全公司推广,把高水平员工的电脑操作痕迹全面变成 AI 模型的训练养料。

信源:https://x.com/i/status/2056842597117636890
谷歌重构AI会员体系!上线百元级Ultra方案并降价,加码免单YouTube会员

谷歌在 I/O 2026 大会上宣布对旗下 Google AI 订阅体系(Plus、Pro、Ultra)进行重大重构,正式推出起售价 100 美元/月的全新 AI Ultra 级别以主打开发者与极客,将顶配 Ultra 月费降至 200 美元,并全面将 YouTube 会员、AI 智能体等高价值生态权益下放至各档会员中。

新增的 100 美元/月 AI Ultra 档位主要面向开发者与技术骨干,提供 20TB 云存储空间,并在 Gemini 应用和 Google Antigravity 平台中享有比 Pro 级别高出 5 倍的算力额度,且附赠 YouTube Premium 个人版会员。与此同时,顶配的 AI Ultra 订阅月费由原本的 250 美元降至 200 美元,算力配额依然为 Pro 的 20 倍,且独占三维世界构建原型 Project Genie 等前沿研究功能的优先体验权。两档 Ultra 用户均将在下周首批体验锁屏状态下自动跑任务的 24/7 云端智能体 Gemini Spark。

为了扩大市场覆盖,谷歌将核心技术与生活福利大范围向下延展。所有订阅档位(Plus、Pro、Ultra)将全量接入新一代大模型 Gemini Omni 与 Gemini 3.5 Flash,并在美区逐步上线能提取待办、拟定回复的 AI Inbox 邮箱管家和每日晨报智能体 Daily Brief。在非 AI 福利上,原本仅限高档会员的 YouTube 免广告服务也实现下放:价格为 19.99 美元/月的 Pro 付费订阅将免费获赠价值 8.99 美元/月的 YouTube Premium Lite 轻量版会员。

信源:https://blog.google/products-and-platforms/products/google-one/google-ai-subscriptions/
谷歌开放智能体底层基建:支持单次调用云端Linux沙盒,Markdown手写即可起AI

智能体开发正在告别繁琐的服务器运维与沙盒搭建,直接转变为定义配置文件的云端瞬态调用。谷歌在 I/O 2026 大会上正式推出 Gemini API 托管智能体(Managed Agents)预览版,向开发者开放其智能体底层基建。开发者只需一次 API 调用,便能瞬间在云端拉起一个由谷歌托管的隔离、临时 Linux 环境,运行由新一代中端模型 Gemini 3.5 Flash 驱动的 Antigravity 智能体。

托管智能体免去了复杂的编排代码与环境搭建工作。开发者无需编写冗长的胶水代码,只需在项目中编写 AGENTS.mdSKILL.md 这两个 Markdown 格式的版本化配置文件,即可直接定义智能体的系统角色与特定技能,并注册为自定义的托管智能体。

这一云端临时 Linux 环境赋予了智能体极高的物理活动边界。智能体不仅能在沙盒内进行多步推理、任务规划与工具调用,还能独立执行代码、读写文件以及调用外部网络抓取实时数据。每次交互都会自动保存或还原当前沙盒的环境状态,方便后续的 API 调用无缝恢复会话,确保所有文件与运行时状态完好如初。

这套托管思路与 Anthropic 在 4 月份发布的 Claude Managed Agents 如出一辙。两家大模型巨头在智能体基建上走向了合流,都在试图从单纯的 API 模型供应商,升格为打理智能体安全沙盒与会话状态的容器云平台。

目前,托管智能体已在 Gemini API 开启预览测试,开发者可通过 Google AI Studio 游乐场(Playground)中的定制模板快速启动。同时,谷歌为编码智能体专门设计了一项全新的 Gemini API 智能体技能,帮助智能体自行构建与管理自定义智能体。面向企业用户,Gemini 智能体平台(Gemini Enterprise Agent Platform)也已同步开启私密预览。

信源:https://blog.google/innovation-and-ai/technology/developers-tools/managed-agents-gemini-api/
万亿参数开源模型跑出981词/秒,Cerebras测试KimiK2.6提速29倍

晶圆级芯片公司 Cerebras 宣布在企业测试中上线万亿参数大模型 Kimi K2.6,通过跨多张 12 英寸硅晶圆分配权重并流式传输激活值,消除了传统板级通信的互联延迟。

第三方评测机构 Artificial Analysis 实测显示,其生成速度达到 981 tokens/s,比主流 GPU 云服务快 6.7 倍。在 10000 输入、500 输出 token 的长文本任务中,总响应耗时从 Kimi 官方接口的 163.7 秒缩短至 5.6 秒,提速达 29 倍。

由于万亿参数模型超出了单张硅晶圆的容纳极限,系统将其权重分配到多块晶圆中流式传输激活值。在晶圆内部,其层间通信完全运行在片上网络织网上,物理通信带宽达到英伟达 NVL72 架构中 NVLink 的 200 倍以上。配合分布式计算优化,Kimi K2.6 以原始的 4-bit(4 位)权重进行低损存储,计算时使用 16-bit(16 位)浮点数维持精度,并采用定制算子内核与推测性解码最终达成实时化运行。

信源:https://www.cerebras.ai/blog/cerebras-kimi-k2-Enterprise
Opus 4.7低思考度压过Sonnet 4.6最大值,Anthropic发布首份智能体操控调优指南

Anthropic 发布首份官方开发指南,深入披露了 Claude 4.6 与 Opus 4.7 在电脑和浏览器操控场景下的分辨率上限、思考深度配比及缓存降本机制。

屏幕分辨率直接决定了智能体点击的精准度。Claude 4.6 解析截图的长边上限为 1568 像素,Opus 4.7 为 2576 像素。一旦截图超出限制,API 服务端会自动等比缩小图片,这会导致模型生成的点击坐标与客户端原图产生错位漂移。因此,开发者必须提前在客户端将截图缩放至 1280x720 (Claude 4.6 推荐) 或 1080p (Opus 4.7 推荐)。

界面操控主要依赖视觉感知与元素定位,对长链条逻辑推理要求不高。测试表明,Opus 4.7 在低思考深度 (low) 下的操控表现便能追平 Sonnet 4.6 的最大思考深度 (max),且 token 成本仅为后者的十分之一。官方建议将思考选项设为 high,相比 max 深度不仅 token 消耗减半,成功率也完全持平,应避免开启 max 以防模型过度思考导致账单翻倍。

由于单张截图在上下文中最高消耗 1800 个 token,官方给出了三层降本方案:常驻 1 个系统级缓存断点,并将另 3 个断点动态分配给最近几轮工具的执行结果;在客户端进行滚动剪枝,仅在上下文中保留最近 3 张截图,其余用占位符替代;在上下文深度逼近 90% 时触发总结压缩。

此外,API 引入了批量工具 computer_batch,支持单次调用打包执行多项无视觉依赖的操作;并提供智能体顾问机制 (Advisor Tool),允许主模型在后台直接召唤高阶的 Opus 模型来审计执行步骤。开发者还可通过录制引导模式 (Teach Mode,即录制用户的真实操作轨迹并在回放时作为指令参考) 来大幅提升任务成功率。

信源:https://claude.com/blog/best-practices-for-computer-and-browser-use-with-claude