动察Beating AI News
3.15K subscribers
883 photos
2 videos
3.4K links
AI新闻信息流
Download Telegram
中美正式确认开展AI官方对话

中国外交部正式确认,中美已同意开展人工智能官方对话。这一共识是在两国最高层就 AI 监管问题进行直接交流后敲定的。

这场高规格的接触,落定了数月来的双边博弈。在此之前,美国正因 Anthropic 前沿模型 Mythos 展现出的网络武器潜力而焦虑,迫切希望建立防线;而中国大模型凭借适配华为芯片,拿到了不受算力制约的谈判底牌。

此前,美方牵头人曾公开放话排斥他国参与制定全球 AI 规则。此次高层直接对话越过了这层强硬姿态,为建立类似冷战时期的危机管控机制钉下了明确框架。

中方在回应中强调,作为两个大国,双方应携手促进 AI 的发展与治理。

信源:https://mp.weixin.qq.com/s/0mGbdz4op2UelzqLJr3K1A
强化学习之父Sutton重申「苦涩的教训」引争议,捕获隐性知识成AI演进必经阶梯

强化学习之父 Richard Sutton 今日用 26 个英文单词重申「苦涩的教训」,呼吁 AI 发展应聚焦于能随算力扩展的通用方法,而非被人类知识分散注意力。这一论断再次引发大模型路线辩论。

知名 AI 评论家、认知科学家 Gary Marcus 直接反驳,指出当前大模型仍极度依赖人类知识作为主要燃料,甚至已将其编入系统提示词和超 50 种定制工具中。机器学习奠基人 Thomas G. Dietterich 同样提出异议,他认为研究人类的抽象认知结构能为 AI 标定盲区,绝不该被视为一种「分心」。

评论区翻出的一篇长文《甜蜜的教训》,为这场冲突提供了综合视角。The Innovation Game 联合创始人兼首席科学家 John Fletcher 在文中点出了 Sutton 的战略盲区:AI 的终局虽是纯算力,但在书面语料面临枯竭的当下,通向终局的路径无法绕开人类。产业当前拉开差距的打法,是通过打造顶级协同工具,高频捕获专家大脑中从未写下过的「隐性知识(Tacit knowledge)」。跳过这一阶段直奔纯环境交互学习,在工程上并不切实际。

信源:https://x.com/RichardSSutton/status/2056419165502935198
Google AI Studio安卓版开启预注册

谷歌正式将网页端开发环境 Google AI Studio 搬上手机。目前,该应用的 Android 版已在 Google Play 商店上线并开启预注册,主打让用户通过手机自然语言交互,随时随地进行「Vibe Coding」。

官方应用介绍指出,灵感不会专门等你坐到办公桌前,它往往出现在沙发上、公交上或半夜里。移动版 AI Studio 的核心定位,就是帮你立刻抓住这些火花并转化为现实。

信源:https://play.google.com/store/apps/details?id=com.google.android.apps.aistudio
Cloudflare曝光Anthropic Mythos实测:已能自主写代码,将低危漏洞串联为完整攻击链

Cloudflare 今日公布了参与 Anthropic 内部安全项目 Project Glasswing 的实测结果。在针对自身 50 多个代码库的测试中,Cloudflare 证实安全模型 Mythos Preview 突破了此前大模型的瓶颈。它不仅能发现孤立的系统缺陷,更能将多个低危漏洞串联组合,自主写代码生成可执行的攻击证明(PoC)。

此前的 Opus 4.7 或 GPT-5.5 在测试中往往只停留在输出漏洞分析报告的阶段。Mythos 则具备了沙盒闭环验证能力。它会写出触发漏洞的代码并编译运行,若执行失败,模型会自动读取报错信息、修正假设并再次尝试,直到彻底打通攻击链。

Cloudflare 透露,业内部分安全团队已被迫执行 2 小时内完成修补的极限标准。但 Cloudflare 强调,单纯压缩补丁时间会因跳过回归测试引发更大的系统故障,未来的防御重心必须转向从架构层面切断代码的连通性。

在工程调度上,Cloudflare 发现单流编程智能体会迅速耗尽上下文,无法胜任大规模漏洞挖掘。他们为此搭建了一套平行对抗框架,让一个智能体在极窄范围内寻找漏洞,同时安排另一个搭载不同模型的智能体专门驳斥前者的结论。这种对抗机制大幅过滤了模型扫描中普遍产生的大量误报噪音。

由于本次测试使用的是无外部限制的预览版,Mythos 展现出了极不稳定的内部护栏。面对同一段目标代码,仅仅改变运行环境的上下文描述,模型就会从拒绝执行转为直接提供攻击载荷。Cloudflare 警告,由模型自发生成的内生护栏极其脆弱,未来面向公众发布时必须强制叠加外部防线。

信源:https://blog.cloudflare.com/cyber-frontier-models/
1
戴尔联手Palantir推出本地AI操作系统:底层存储替换Ceph,直接瞄准国防与核心银行

戴尔(Dell)与数据分析巨头 Palantir 宣布推出一款本地运行的 AI 操作系统。该系统基于「戴尔 AI 工厂」(Dell AI Factory)构建,首次将 Palantir 核心的 Foundry 平台与 Ontology 数据引擎整体搬入企业本地数据中心。

新架构在底层组件上进行了针对性换血。在初始联合参考架构中,戴尔的 ObjectScale 和 PowerFlex 存储方案直接替换了 Palantir 原有技术栈中的 Ceph 持久化层。硬件层面,由搭载英伟达 HGX B 系列加速器的戴尔 PowerEdge GPU 服务器负责模型训练与推理,CPU 节点则专供 Palantir 的控制平面运行。

这套方案直接瞄准了国防、公共安全与核心银行等因合规限制无法将敏感数据上云的客户。系统底座嵌入了 Palantir 的 Rubix 和 Apollo 零信任运行层,通过多租户容器隔离与持续审计日志,确保企业在物理隔离(air-gapped)的环境中也能集中管控私有数据与 AI 智能体的交互边界。

信源:https://www.dell.com/en-us/blog/dell-and-palantir-introduce-an-on-premises-ai-operating-system/
豪赌SpaceX:神秘对冲基金近六成仓位押注马斯克,预计狂赚超百亿美元

神秘对冲基金 Darsana Capital Partners 迎来巨额浮盈兑现。随着马斯克旗下太空探索公司 SpaceX 预计于下月以 1.5 万亿美元以上的估值进行首次公开募股(IPO),该基金在该项目上的账面收益预计将突破 100 亿美元。

Darsana 于 2019 年 SpaceX 估值约为 300 亿美元时首次入股,此后持续加码且从未减持。除直接投资外,该基金还曾参与社交媒体平台 X 的私有化融资;在 X 于去年并入 xAI,并于今年初以全换股方式整体并入 SpaceX 后,Darsana 借此获得了更多 SpaceX 股份。

伴随估值飙升,这笔单一投资目前已占 Darsana 约 150 亿美元总资产管理规模的近 60%,现有持仓价值达 85 亿美元。仅自去年 12 月 SpaceX 以约 8000 亿美元估值完成融资以来,该基金的收益就增加了数十亿美元。

同类机构 D1 Capital Partners 同样获利丰厚。其在 SpaceX 项目上累计投入约 6 亿美元,目前的账面浮盈已达到约 90 亿美元。

信源:https://www.wsj.com/finance/investing/the-little-known-hedge-fund-that-stands-to-make-over-10-billion-on-spacex-44504c7a
Browserbase开源最大AI网页技能库,为智能体打造互联网黄页

Browserbase 推出智能体网页技能库 Browse.sh。这套 CLI 工具预置了数百个主流网站的交互脚本,是目前最大的开源技能目录。

以往智能体每次跨站执行任务,都要重新解析陌生的页面结构。Browse.sh 提前跑通了这些交互逻辑。这就好比给 AI 发了一本互联网黄页,遇到复杂任务不再需要从零试错,直接调用现成路径即可。

Browserbase 同步联手 Ramp、Lovable、Interaction 和 Reducto 四家平台,首发了官方验证的专属技能。该目录目前已完全免费开源。

信源:https://x.com/browserbase/status/2056404332824944970
OpenAI前CTO幕僚长全职转入基金会,长期安全业务移交非营利母体

Bianca Martin 宣布全职转入 OpenAI 基金会,加入由联合创始人 Wojciech Zaremba 负责的 AI 韧性(AI Resilience)项目。转岗前,她曾出任前 CTO Mira Murati 的技术幕僚长,并在 AGI 准备度团队专攻新兴技术风险。

Martin 于 2019 年加入 OpenAI,曾参与编写公司首份部署战术手册,并协助推出伴随 GPT-3 的研究员访问计划。据其内部信证实,该计划正是 OpenAI 后来红队测试工作的基础。

目前,OpenAI 基金会正在确立新的主营业务。根据 3 月公告,基金会未来一年预计投入至少 10 亿美元,资金覆盖生命科学、就业经济、社区项目,以及新增的 AI 韧性四大领域。其中,AI 韧性项目首批任务直接指向儿童 AI 安全、生物防范,以及独立模型测试与标准制定。

除了业务扩充,基金会的资金口径也在更新。去年 10 月重组时,基金会保留了 OpenAI 商业实体 26% 的股权,当时估值约 1300 亿美元;今年 2 月新融资后,这笔股权的官方估值已超过 1800 亿美元。

Martin 转岗 1800 亿美元估值的基金会,说明 OpenAI 正将部分长期的社会风险与安全工作,移交至非营利母体下推进。

信源:https://x.com/bianca__martin/status/2056467217429282818
Telegram打破11年禁令开放机器人互聊

Telegram 创始人 Pavel Durov 宣布,正式开放机器人对机器人通信模式(Bot-to-Bot)。这打破了该平台自 2015 年起禁止机器人互动的底层限制。现在,多个 AI 智能体可以直接通过用户名互发私信并交接任务,全程无需人类介入。

开发者在后台双向开启权限后,机器人接口就能直接接收到同类发来的消息。这让复杂的 AI 协作流得以在 Telegram 内闭环运转,例如一个负责写代码,另一个负责审查验证。人类用户也由此获得了一个可以实时围观、审计智能体协作的原生沟通层。

Telegram 同步推出了三项 AI 专属更新:
• 聊天自动化:用户可将 AI 助理绑定个人账号,代为回复特定对话。
• 流式输出:机器人支持逐字生成文本。
• 访客机器人:无需将 AI 拉入群组,直接在群内 @用户名 即可召唤它回答问题。

这一底层限制的解除,立刻盘活了开源社区的多智能体实践。以 OpenClaw 为例,其团队在开源社区迅速做出反应。5 月初功能刚一上线,OpenClaw 团队便开始接入新特性,让旗下的四名智能体(Ari, Finn, Remi, Tai)直接在群里分工协作,彻底砸掉了以往必须依赖外部服务器中转的通信管道。

但这种完全脱离人类中介的闭环协作,目前没有任何安全框架兜底。学术界此前就已警告,传统的网络防线管不住 AI 之间的私下连线:人类无法预测它们会聊出什么结果(非确定性),它们可能在互传数据时泄露隐私,甚至联手作弊(秘密共谋)。当 Telegram 率先推开这扇大门,业界针对多智能体的强制性安全标准依然是一片空白。
信源:https://telegram.org/blog/ai-bot-revolution-11-new-features
1
Zyphra发布首个MI355X推理评测:长文本直逼B200,大显存成AMD逆袭关键

AI 云服务商 Zyphra 发布了首份基于 AMD 旗舰芯片 MI355X 的端到端大模型推理实测。测试在真实单节点环境下运行了 DeepSeek V3.2、Kimi K2.6 与 GLM-5.1,并直接对标 NVIDIA B200。

实测揭示了两款芯片最核心的物理差异。AMD 的杀手锏是 288GB 的海量显存,远超 B200 的 180GB。这让它在处理超长文本时,单卡就能塞下更多缓存,直接省下了拆卡并行的硬件成本。但在芯片间互联上 AMD 处于劣势。B200 靠 NVLink 交换机能让任意双卡跑满 900GB/s 带宽;而 MI355X 采用点对点直连,卡与卡之间的通信效率大打折扣。

为了填补硬件互联上的短板,Zyphra 开发了张量序列并行 (TSP) 与树状注意力 (Tree Attention) 算法。团队用树状通信取代了传统的环形网络,把解码阶段的计算和数据传输完全折叠在一起,强行用算法弥补了 AMD 硬件在点对点互联上的缺陷。

最终的成绩单明确了现阶段的排位:在单请求绝对速度上,NVIDIA B200 依然全面领跑。但在长文本场景下,随着上下文拉长,Zyphra 推理栈的吞吐量快速逼近 B200。这证明只要底层软件栈优化得当,AMD 完全能依靠大显存红利,在长文本生产环境中与 NVIDIA 旗舰正面抗衡。

下一步,Zyphra 计划利用这套架构支持 1.6 万亿参数的 DeepSeek V4 Pro,并将上下文拉升至 100 万 token。团队后续还将针对 MI355X 开发专属的低精度量化方案,并引入全新的扩散投机采样模型,进一步挖掘这块芯片的算力潜能。

信源:https://www.zyphra.com/post/benchmarking-zyphra-inference-production-performance-on-mi355x
128张A100从零训出!字节开源3B全能多模态模型Lance

字节跳动(ByteDance Research)正式开源原生统一多模态大模型 Lance。这是一个激活参数仅为 3B 的轻量级模型,在单一框架内同时支持图像与视频的理解、生成及编辑。

目前主流统一模型高度依赖扩大参数规模或沿用文生图架构,Lance 则跑通了极低算力的协同路线。研发团队让模型完全从零开始训练,并将整个训练周期的总计算预算压低至 128 张 A100 GPU。

为解决不同模态与任务间的内部冲突,Lance 在架构上做了两项硬性隔离:
• 采用双流混合专家(MoE)架构处理交织的多模态序列,在共享底层上下文的同时,解耦理解与生成的计算路径。
• 引入模态感知的旋转位置编码,直接削弱图像和视频异构视觉 token 之间的信号干扰。

极端的算力压缩并未拉低性能上限。在仅有 3B 激活参数的情况下,Lance 的图像与视频生成及编辑表现在绝大多数基准测试中领跑现有开源统一模型,通过多任务协同跑通了小参数兼顾生成与语义理解的低成本路线。

信源:https://huggingface.co/bytedance-research/Lance
纯代码硬刚神经网络!大模型手写控制规则杀入硬核工业,14美元跑通全套策略

OpenAI 后训练核心成员翁家翌刚证明了「纯靠大模型写代码能通关 Atari 游戏」,研究人员 Paul Garnier 就把这套方法搬进了更硬核的流体力学控制。

他全程没训练任何神经网络。单纯让 Codex 5.5 充当程序员,盯着流体仿真录像反复改写 Python 脚本。就靠这套手写的控制规则,AI 在十多项物理测试中,硬是在超半数的场景里把顶级的强化学习(DRL)基线挑落马下。

给汽车减阻、安抚管道湍流,工业界以前只能靠砸算力,硬喂出一个看不懂的黑盒模型去控制气流阀门。Codex 避开了这条死胡同。它写出来的规则极其直白,例如「当局部曲率过大时,延迟喷气」。几十行带着物理常识的短代码,直接替代了神经网络无脑的暴力试错。

把黑盒换成代码,干掉了神经网络僵化、一碰就碎的死穴。以前只要硬件稍微改动(比如控制喷嘴从 5 个换成 10 个),旧模型当场报废,必须重新烧钱训练。现在只要在代码里改个常数,系统瞬间就能对接新设备。

当测试时间被强行拉长四倍时,走出经验区的传统 DRL 模型全盘崩溃;但大模型写的代码由于直接遵循了物理逻辑,始终运转稳定。跑通这一整套控制策略,大模型只消耗了 2125 万 Token,总花费不到 14 美元。

信源:https://donsetpg.github.io/#/blog/heuristic-learning-for-fluid-dynamics-a-case-study
Prime Intellect开源可自我进化智能体环境:让AI「左右互搏」生成逾8000个测试工具

Prime Intellect 宣布开源智能体训练环境 general-agent,这是一个可自我进化的完全合成环境。此次发布的核心是将任务生成设定为一场双玩家博弈:由合成器和求解器交替对抗,目前已自动构建出包含 4504 个任务、逾 8000 个独特工具的大型状态数据库。

该框架从简单的种子任务起步,通过条件约束、噪音指令、跨实体耦合等 9 种策略,将任务切分为 t0 到 t4 五个难度阶梯。合成器负责设计带有数据库、交互工具和验证函数的任务,求解器则负责尝试通关。只有通过率落在特定难度区间的任务才会被保留,最难层级会作为下一波进化的种子。

官方实测显示,仅用该环境合成的 4400 余条轨迹对 30B 参数模型进行微调,就在 BFCL 基准测试中将工具调用准确率从 18.9% 提升至 52.3%。

这种机制让模型脱离了对人工标注静态数据集的依赖。通过模型间的直接博弈,系统能够源源不断地自动生成难度可控、带有语义验证的训练语料。

信源:https://www.primeintellect.ai/blog/general-agent
动察Beating AI News
输入<think>能偷看别人聊天记录?DeepSeek这个「漏洞」被严重误读了 近日社交平台上流传一则消息,称在 DeepSeek 对话框输入 <think> 等特殊标记,就能看到其他用户的历史对话,并将其定性为 P0 级多租户隔离失效。这一说法迅速引发恐慌,不少人开始担心自己的聊天记录被陌生人看到。 实际情况与多租户隔离无关。输入 <think> 或 <|begin_of_sentence|> 这类特殊标记后,模型会被骗进训练时的格式模式,随后基于自身记忆和当前系统提示词(包含当天日期)生成一段看起…
DeepSeek辟谣「<think>泄露隐私」:实为模型幻觉

针对输入 <think> 字符导致 DeepSeek 泄露他人聊天的恐慌,DeepSeek 今日发布排查结果,证实本频道上周五的结论。异常回复系特殊字符引发的模型幻觉,未发生多租户隔离失效或隐私数据泄露。

本频道上周已发文澄清这场技术误读。特定标记会诱导模型触发训练数据提取,套用系统提示词内的当天日期编造聊天记录。官方声明彻底终结了关于底层隔离架构崩溃的阴谋论。

DeepSeek 表示,后续将通过针对性训练增强模型对特殊字符的识别与处理能力,修复这一缺陷。

信源:http://xhslink.com/o/A1dESxoScGS
👍1
比GPT-5.5快4倍还更聪明?谷歌Gemini 3.5 Flash跑分越级挑落旗舰

轻量级模型正以数倍的运行速度,正面迎击旗舰模型的复杂智能体编排。

谷歌在 I/O 2026 宣布推出轻量旗舰模型 Gemini 3.5 Flash,并在 Gemini 应用、AI 搜索与开发工具 Antigravity 中全球同步上线,前瞻性更强的 Gemini 3.5 Pro 则定于下月发布。

新模型首要亮点在极致的物理速度。第三方评测机构 Artificial Analysis 实测显示,Gemini 3.5 Flash 生成速度达 289 tokens/s,比 GPT-5.5(71 tokens/s)与 Claude Opus 4.7(67 tokens/s)快了近 4 倍,也达前代中端模型 Gemini 3.1 Pro(135 tokens/s)的 2 倍以上。

提速并未稀释智能体控制力。在评估多步工具调用的 MCP Atlas 测试中,Gemini 3.5 Flash 取得 83.6% 的高分,压过 GPT-5.5(75.3%)与 Claude Opus 4.7(79.1%);在终端编程评测 Terminal-Bench 2.1 中,其 76.2% 的表现同样击败了前代专业模型 Gemini 3.1 Pro(70.3%)与 Claude Opus 4.7(66.1%)。

新模型支持 100 万 token 上下文,且在考验复杂长期任务稳定性的 GDPval-AA 测试中拿到 1656 分,显著高于前代的 1314 分。

目前新模型已全线向公众开放。普通用户可在网页端与搜索 AI 模式直接调用;开发者可在 Google AI Studio、Android Studio 及编码平台 Antigravity 接入 API;企业用户可通过智能体平台部署。其 API 标准版定价为每百万输入 token 1.50 美元,输出 9.00 美元。

信源:https://blog.google/innovation-and-ai/models-and-research/gemini-models/gemini-3-5/
2
谷歌发布万物生成世界模型GeminiOmni:告别时间线,用大白话精细剪视频

视频生成和剪辑的范式,正从繁琐的专业时间线操作,降维成与 AI 的几句闲聊。

在 2026 年 5 月 19 日的 Google I/O 大会上,谷歌正式推出首个万物生成世界模型 Gemini Omni(首发版本为 Omni Flash),主打将 Gemini 的逻辑推理智能与媒体生成系统原生融合,直接通过文本、图像、视频、音频的多模态混合输入,完成高保真的视频生成与对话式编辑。

传统的视频生成模型如 Sora 等,往往只支持单次的提示词生成,一旦画面出现偏差或需要微调,用户只能推倒重来。

而 Gemini Omni 的最大突破在于“对话式视频编辑”(完全通过自然语言对话修改视频画面)。用户可以直接对 AI 下达“把背景换成火星表面”或“把镜头拉近到角色面部”等指令。在修改局部画面的同时,AI 能够跨多轮对话锁死人物长相、场景色调,确保水流、重力等物理常识不发生穿帮。

为实现这种高保真的一致性,该模型在底层深度结合了 Gemini 的推理架构,主攻对重力、流体动力学和动能等物理世界常识的模拟。

目前,首发版本 Gemini Omni Flash 已在 Keynote 结束后直接面向 Google AI Plus、Pro 和 Ultra 订阅用户,在 Gemini App 和 Google Flow 中上线。同时,它正逐步集成至 YouTube Shorts 和 YouTube Create 中,且所有生成的视频都将自动嵌入 SynthID(谷歌的隐形数字水印技术,用于 AI 生成内容的安全追踪)以进行防伪溯源。

信源:https://blog.google/innovation-and-ai/models-and-research/gemini-models/gemini-omni/
1
谷歌发布首个主动智能体GeminiSpark:引入MCP,关机锁屏也能替你干活

AI 助手正从一问一答的聊天框,进化为在后台默默替人负重前行的数字分身。

在 2026 年 5 月 19 日的 Google I/O 大会上,谷歌正式发布 24/7 个人主动 AI 智能体 Gemini Spark。它运行在最新的 Gemini 3.5 旗舰模型上,底层接入 Antigravity 框架,能够深度整合 Workspace 办公套件,并支持在用户关机、锁屏的状态下在云端后台持续执行复杂任务。

相比于传统“你问我答”的被动助手,Spark 的核心突破是“主动代办”与“云端离线运行”。哪怕用户合上电脑或将手机锁屏,它也能在后台独立跑完长流程任务。

具体能力上,用户可以对 Spark 进行“技能教学”或“工作流编排”:例如设定触发器,自动解析月度账单以标记隐藏订阅费;或命令其自动监控收件箱,提取特定邮件中的关键截止日期,汇总成日报发给家人;甚至能跨邮件和聊天记录合成会议记录,自动生成 Google Docs 并在撰写好启动邮件后一键发送。

Spark 还在今天首次推出了基于 MCP(Model Context Protocol,一种让大模型无缝读取外部数据和调用工具的开放标准协议)的外部连接器,首批已打通 Canva、OpenTable 和 Instacart。未来几周内,它能通过这些协议直接跨软件操作替用户下单或作图。

此外,Spark 极度重视安全红线,在涉及付钱、发邮件等高风险敏感操作时,必须由用户显式授权确认才会执行。

目前,Gemini Spark 将于本周开启受信任测试者测试,并计划于下周在美区面向 Google AI Ultra 订阅者启动 Beta 公测。今年夏天它还将集成至新版 macOS 桌面端中,以接管本地文件与系统工作流。

信源:https://blog.google/innovation-and-ai/products/gemini-app/next-evolution-gemini-app/
搜索框能现场写代码!谷歌Search升级:给你手造App,还能替你打电话

搜索引擎正从单向呈现网页链接的导航站,裂变为一个现场写代码、主动跑任务的智能体工坊。

在 2026 年 5 月 19 日的 Google I/O 大会上,谷歌正式宣布 Search 迎来重大进化:上线一年内月活破 10 亿的 AI 模式(AI Mode)将默认免费升级为 Gemini 3.5 Flash 模型,并首次接入 Antigravity 编程框架,支持在搜索框内根据用户需求现场编写代码、实时生成定制的微型 App(Mini Apps)与仿真模拟器。

本次升级最硬核的突破在于“现场编程与生成式 UI”(Generative UI)。当用户搜索复杂的概念或需要长期追踪的任务时,Search 不仅会提供文本答案,还会直接在后台写代码并现场渲染出一个交互式组件(如齿轮转动的仿真模拟器、互动数据图表)。

针对婚礼筹备、搬家进度或健身打卡等长期重复的搜索任务,Search 甚至能直接为用户从零编写代码并打包生成一个专属的微型 App(Mini Apps)或专属仪表盘。该 App 会自动调取谷歌地图、实时天气及本地评价等 API,用户可以将其保存以长期使用。

搜索框本身也迎来了 25 年来最大升级:支持文本、图像、视频、文件和 Chrome 标签页等多模态混合输入,并提供智能 AI 联想词推荐。

此外,搜索正式进入智能体(Search Agents)时代。其中,“信息智能体”能在云端后台 24/7 扫盘全网,符合复杂要求(如出现符合预算和学区的房源、或某球鞋发售)时立即通知用户;“订票智能体”则可一键闭环预约复杂的本地生活服务。更颠覆的是,在美区,用户可以直接要求 Google “代表你打电话给商家”(let Google call)来直接预约美容或家政服务。

目前,默认升级 Gemini 3.5 Flash 的 AI Mode 已全球上线;“信息智能体”与“现场手造迷你 App”将于今年夏天在美区向 Google AI Pro 和 Ultra 订阅用户首发;“代表用户打电话”及“一键订票”功能也将在今夏于美区全面铺开。

信源:https://blog.google/products-and-platforms/products/search/search-io-2026/
3
GeminiCLI让位!谷歌Antigravity2.0拆掉IDE变身独立工作台

谷歌正式发布 Antigravity 2.0,直接拆掉了传统的 IDE 界面,将原本绑定在编辑器里的 Agent 管理器独立为桌面应用,并全面支持 macOS、Windows 和 Linux。

Agent 的活动边界被彻底放开,不再局限于单一仓库。新版用项目概念取代了原本的工作区,允许一个项目跨越多个本地文件夹,并对每个文件夹单独配置读写权限。在处理复杂任务时,主 Agent 现在能动态调用多个子 Agent 并行处理,避免了单一主上下文被无效日志塞满。同时,编译、测试等长耗时任务全部被推入后台异步执行。

定时唤醒机制首次被引入桌面端。用户现在能用 /schedule 命令设定一次性计时器或 cron 周期,让 Agent 定点自动唤醒执行脚本或巡检代码。

新增的斜杠命令,直接划定了现阶段谷歌对 Agent 自主权的容错边界。 /goal 允许彻底放权死磕任务, /grill-me 强制 AI 动手前先反问澄清需求,而 /browser 强制要求用户显式授权才能联网。谷歌对此承认,AI 目前仍无法稳定判断何时应该向外搜索。

伴随桌面应用独立,谷歌同步推出了配套的 CLI、SDK 与 API,并宣布原 Gemini CLI 个人侧工具链未来将全面迁移至 Antigravity CLI。

信源:https://antigravity.google/blog/introducing-google-antigravity-2-0
告别干巴文字块!谷歌Gemini启用新设计,回复可实时排版交互图表

大模型生成内容的交付形态,正从干瘪的 Markdown 字符演变成富有生命力的动态排版。

谷歌在 I/O 2026 大会上宣布为全球 9 亿月活跃用户推出 Gemini 迄今最大幅度的界面重构,启用全新设计语言 Neural Expressive (神经表现设计)。新版不仅融入了流畅的动态动画和触觉反馈,还将 Gemini Live (双向语音通话功能) 原生嵌入,并支持对用户的提问进行实时、交互式的 Tailored Responses (定制化回复,根据回答内容实时动态渲染专属布局的交互体验) 排版。

新版重在消灭传统的大段文本墙。当用户向 Gemini 提问时,它不再只是吐出密密麻麻的文字,而是根据内容实时渲染出专属的回复样式,直接融合高清图像、可拖拽的互动时间线、带配音的短视频以及动态数据图表。

在语音交互方面,新界面将 Gemini Live 的无缝双向通话体验置于主界面,支持用户在敲字和自由语音对话之间随时无缝切换。

为提升交互连贯性,麦克风底层的停顿判定逻辑被重新设计,允许用户在理清复杂思路时进行长停顿,避免被 AI 中途切断。此外,Gemini Live 将在近期逐步提供方言选项。

全新的 Neural Expressive 设计语言已于今日起在 Web 网页端、Android 和 iOS 移动端面向全球用户推送。

信源:https://blog.google/innovation-and-ai/products/gemini-app/next-evolution-gemini-app/
1
逃离一年半后重返前线!Karpathy加盟Anthropic,曾于3月透露防漂移动机

5 月 19 日,前 Tesla 自动驾驶负责人、OpenAI 联合创始人 Andrej Karpathy 在 X 平台官宣,已正式加入前沿 AI 实验室 Anthropic 重回研发一线,距离他去年 2 月从 OpenAI 再次离职已过去近一年半。

这次备受瞩目的重返并非毫无预兆,其深层动机早在两个月前便已公开。在 3 月 20 日发布的 No Priors 播客访谈中,Karpathy 曾坦言自己对游离在前沿实验室之外感到神经紧张,因为闭源巨头筑起的黑盒壁垒,正导致外部研究员的技术直觉与判断力开始不可避免地出现漂移。

当时他透露,自己极度警惕完全被单一闭源实体所掌控,并对集中化权力天生怀疑。原因很简单,他绝不希望世界智能被紧闭大门后的两三个巨头垄断。因此在播客中,Karpathy 描绘了一种理想的「挂职」状态,即通过去前沿实验室做一段时间的研发,既能连接最新的技术,又不至于完全丧失独立性,而这次正式加盟 Anthropic 显然兑现了这一防漂移的挂职设想。

信源:https://x.com/karpathy/status/2056753169888334312