动察Beating AI News
3.15K subscribers
883 photos
2 videos
3.4K links
AI新闻信息流
Download Telegram
20小时工作只需21美元!SemiAnalysis实测AI代工:最高ROI近94倍

知名半导体与 AI 行业研究机构 SemiAnalysis 公开了其分析师团队的 AI 代工实测数据。该团队持续追踪了涵盖公司研究、财报速递、会议纪要挖掘和财务数据拉取的 9 个真实工作流,用 Token 消耗与人工成本的硬核对比证明 AI 回报是真实且结构性的。实测显示,所有任务的投资回报率(ROI)均超过 10 倍,大部分集中在 60 至 90 倍之间,其中一项公司研究任务仅耗费 21.33 美元 Token 便替代了 20 小时的人工,ROI 高达 93.8 倍。

为了展示 AI 工具在实际业务中的具体效益,SemiAnalysis 披露了多项代表性任务的实测数据。
• 针对惠普企业(Hewlett Packard Enterprise,简称 HPE)的深度公司研究,Token 成本仅 21.33 美元,即可替代价值 2000 美元的人工(耗时 20 小时),ROI 达 93.8 倍。
• 财务数据拉取与 Excel 邮件发送,Token 成本仅 1.87 美元,即可替代价值 150 美元的人工(耗时 3 小时),ROI 达 80.2 倍。
• 针对迈威尔科技(Marvell)的财报速递,Token 成本仅 2.82 美元,即可替代价值 200 美元的人工(耗时 4 小时),ROI 达 70.9 倍。
• 构建代币经济学披露 Slack 机器人,Token 成本为 58.02 美元,即可替代价值 1000 美元的人工(耗时 20 小时),ROI 达 17.2 倍。

除了内部实测,SemiAnalysis 还通过外部 AI 编程工具的爆发式数据,印证了整个行业被 AI 渗透的极速扩张。该机构每日追踪 AI 编程智能体 Claude Code 的 GitHub 提交记录(GitHub Commits),数据显示在 2026 年 2 月,该工具的日提交量已突破 13.4 万次,占 GitHub 公开提交总量的约 4.0%,在 13 个月内实现了 42896 倍的爆发式增长。其最新的内部追踪数据显示,这一增长曲线目前仍在持续向上攀升。

SemiAnalysis 认为,一旦体验过将 20 小时繁琐任务压缩至 21 美元 Token 消耗的效率飞跃,分析师的工作流便再难退回手动时代。不过,随着合规与 IT 限制导致银行等大型机构尚未大规模接入,AI 在企业级市场的真正爆发才刚拉开序幕。

信源:https://x.com/SemiAnalysis_/status/2056480113357729977
直接买下OpenAI的SDK代工厂!Anthropic溢价一倍收购Stainless

Anthropic 宣布正式收购开发者工具初创公司 Stainless。这家公司专门用 AI 把复杂的 API 自动打包成跨语言的 SDK。交易完成后,Stainless 团队将整体并入 Anthropic,专门去帮 Claude 打通外部工具与数据。

这笔交易等于让 Anthropic 直接控制了竞争对手的底层工具链。由于自己维护多语言 SDK 太耗费工程资源,OpenAI 此前干脆放弃内部开发,全面转投了 Stainless。虽然市面上还有 Speakeasy、LibLab 等平替方案,但目前最头部的三家大模型厂商(OpenAI、谷歌、Anthropic)全在用 Stainless 生成 SDK。

官方并未公开具体成交额。但据 The Information 此前披露,收购对价至少为 3 亿美元,等于在 Stainless 去年 12 月 1.5 亿美元估值的基础上直接翻倍。

除了服务三大模型厂,Stainless 此前还专门为 Anthropic 发布过的 MCP(模型上下文协议)开发过配套工具。这也是 Anthropic 半年内的第四次扫货:继去年买下 JavaScript 运行时 Bun 后,它又接连吞并了计算机操作厂商 Vercept 与 AI 生物科技公司 Coefficient Bio。

信源:https://www.anthropic.com/news/anthropic-acquires-stainless
1
1000美元一天从零训出1B基础模型!Sapient开源层级推理架构HRM-Text

Sapient Intelligence 开源了 10 亿参数(1B)的文本生成基础模型 HRM-Text。这是一款基于层级推理模型(HRM)架构的纯预训练模型。它通过在架构底层引入潜在空间推理,将基础模型预训练的算力消耗缩减了 130 至 600 倍。

具体而言,HRM-Text 仅使用 400 亿(40B)个结构化 Token 便完成了预训练,数据量约为同级别常规模型的千分之一。官方实测显示,使用两台 8 卡 H100 服务器,耗时约 46 小时即可从零训完 1B 版本,计算成本约 1472 美元;而 0.6B 版本只需单节点跑 50 小时,硬件成本约 800 美元。包含数据提取、序列打包与 PyTorch 分布式训练在内的完整工程框架均已同步开源。

极限降本的支撑在于独特的双时间尺度循环(Dual-timescale recurrent)设计。模型内置了快(低层)与慢(高层)两套 Transformer 模块。这两套模块在同一批输入上交替迭代,并通过状态相加来交换信息。这种设计允许模型在物理参数总量固定的前提下,通过增加循环次数来动态拓展计算深度。

预训练门槛的断崖式下降,让许多过去因算力昂贵而被搁置的模型理论,重新获得了低成本验证的机会。需要特别注意的是,本次释放的仅为未对齐的纯预训练权重,模型只能执行前缀续写任务,无法直接作为问答助手使用。

信源:https://github.com/sapientinc/HRM-Text
Odyssey两天连发,世界模型开始像游戏引擎了

AI 初创公司 Odyssey 在两天内连发两款模型:Starchild-1 和 Agora-1。

Starchild-1 解决了实时的视听交互。以 DeepMind 的视频模型 Veo 为例,这类模型通常是离线生成。按下生成键后,视频的时长和轨迹就已固定,用户无法再中途干预。

Starchild-1 通过因果蒸馏和异步 KV 缓存,分开了音频和视频的上下文保存节奏。用户可以随时输入语音、文本或做动作,模型会立刻响应并改变接下来的画面和环境音。

紧接着发布的 Agora-1 把实时交互扩展到了多人场景。它支持最多 4 名真人或 AI 玩家,在同一局《黄金眼 007》的射击战场里对战。

之前让多个智能体互动的方案不够稳定。Multiverse 用的是分屏式状态表示,Solaris 则把所有参与者强行拼进单个 Transformer 的序列里。一旦人多起来,上下文会变得极长;玩家一旦散开,眼前的世界状态就容易对不上。

Agora-1 直接把底层规则和画面渲染分开了。它先在内部算出玩家的具体位置和血量,维持一个绝对一致的共享状态;然后再交由 DiT 模型读取状态,给每名玩家单独渲染第一人称画面。

连着两款模型发布,Odyssey 的方向很明确:把世界模型从单向生成的视频,做成能听能看、多人联机的交互引擎。

TechCrunch 此前报道,Odyssey 由两位有自动驾驶背景的创始人创办,目前累计融资已达 2700 万美元。

信源:https://odyssey.ml/introducing-agora-1
1
Anthropic上线自托管沙盒:云端大脑编排,企业内网执行代理工具

Anthropic 为 Claude Managed Agents 推出自托管沙盒(Self-hosted sandboxes)与 MCP 隧道(MCP tunnels)两项新功能。AI 代理的计算与执行环境被一分为二。

代理循环(任务编排、上下文管理与错误恢复)继续在 Anthropic 云端运行。所有的工具调用和代码执行转移到企业自己的基础设施,或 Cloudflare、Daytona、Modal、Vercel 等托管沙盒中。

企业可以自行分配沙盒的 CPU、内存与运行时镜像。需要长时间构建或生成图像的代理,可以直接调用企业本地算力。

同步推出的 MCP 隧道功能,通过在企业内网部署单向连接的轻量级网关,打通了代理与本地服务的加密通道。

无需开放入站防火墙,Claude 代理就能直接调用内网的数据库、私有 API 和知识库。敏感文件与凭证全程不离开企业安全边界。

目前,自托管沙盒处于公测阶段,MCP 隧道开放研究预览申请。

信源:https://claude.com/blog/claude-managed-agents-updates
中美正式确认开展AI官方对话

中国外交部正式确认,中美已同意开展人工智能官方对话。这一共识是在两国最高层就 AI 监管问题进行直接交流后敲定的。

这场高规格的接触,落定了数月来的双边博弈。在此之前,美国正因 Anthropic 前沿模型 Mythos 展现出的网络武器潜力而焦虑,迫切希望建立防线;而中国大模型凭借适配华为芯片,拿到了不受算力制约的谈判底牌。

此前,美方牵头人曾公开放话排斥他国参与制定全球 AI 规则。此次高层直接对话越过了这层强硬姿态,为建立类似冷战时期的危机管控机制钉下了明确框架。

中方在回应中强调,作为两个大国,双方应携手促进 AI 的发展与治理。

信源:https://mp.weixin.qq.com/s/0mGbdz4op2UelzqLJr3K1A
强化学习之父Sutton重申「苦涩的教训」引争议,捕获隐性知识成AI演进必经阶梯

强化学习之父 Richard Sutton 今日用 26 个英文单词重申「苦涩的教训」,呼吁 AI 发展应聚焦于能随算力扩展的通用方法,而非被人类知识分散注意力。这一论断再次引发大模型路线辩论。

知名 AI 评论家、认知科学家 Gary Marcus 直接反驳,指出当前大模型仍极度依赖人类知识作为主要燃料,甚至已将其编入系统提示词和超 50 种定制工具中。机器学习奠基人 Thomas G. Dietterich 同样提出异议,他认为研究人类的抽象认知结构能为 AI 标定盲区,绝不该被视为一种「分心」。

评论区翻出的一篇长文《甜蜜的教训》,为这场冲突提供了综合视角。The Innovation Game 联合创始人兼首席科学家 John Fletcher 在文中点出了 Sutton 的战略盲区:AI 的终局虽是纯算力,但在书面语料面临枯竭的当下,通向终局的路径无法绕开人类。产业当前拉开差距的打法,是通过打造顶级协同工具,高频捕获专家大脑中从未写下过的「隐性知识(Tacit knowledge)」。跳过这一阶段直奔纯环境交互学习,在工程上并不切实际。

信源:https://x.com/RichardSSutton/status/2056419165502935198
Google AI Studio安卓版开启预注册

谷歌正式将网页端开发环境 Google AI Studio 搬上手机。目前,该应用的 Android 版已在 Google Play 商店上线并开启预注册,主打让用户通过手机自然语言交互,随时随地进行「Vibe Coding」。

官方应用介绍指出,灵感不会专门等你坐到办公桌前,它往往出现在沙发上、公交上或半夜里。移动版 AI Studio 的核心定位,就是帮你立刻抓住这些火花并转化为现实。

信源:https://play.google.com/store/apps/details?id=com.google.android.apps.aistudio
Cloudflare曝光Anthropic Mythos实测:已能自主写代码,将低危漏洞串联为完整攻击链

Cloudflare 今日公布了参与 Anthropic 内部安全项目 Project Glasswing 的实测结果。在针对自身 50 多个代码库的测试中,Cloudflare 证实安全模型 Mythos Preview 突破了此前大模型的瓶颈。它不仅能发现孤立的系统缺陷,更能将多个低危漏洞串联组合,自主写代码生成可执行的攻击证明(PoC)。

此前的 Opus 4.7 或 GPT-5.5 在测试中往往只停留在输出漏洞分析报告的阶段。Mythos 则具备了沙盒闭环验证能力。它会写出触发漏洞的代码并编译运行,若执行失败,模型会自动读取报错信息、修正假设并再次尝试,直到彻底打通攻击链。

Cloudflare 透露,业内部分安全团队已被迫执行 2 小时内完成修补的极限标准。但 Cloudflare 强调,单纯压缩补丁时间会因跳过回归测试引发更大的系统故障,未来的防御重心必须转向从架构层面切断代码的连通性。

在工程调度上,Cloudflare 发现单流编程智能体会迅速耗尽上下文,无法胜任大规模漏洞挖掘。他们为此搭建了一套平行对抗框架,让一个智能体在极窄范围内寻找漏洞,同时安排另一个搭载不同模型的智能体专门驳斥前者的结论。这种对抗机制大幅过滤了模型扫描中普遍产生的大量误报噪音。

由于本次测试使用的是无外部限制的预览版,Mythos 展现出了极不稳定的内部护栏。面对同一段目标代码,仅仅改变运行环境的上下文描述,模型就会从拒绝执行转为直接提供攻击载荷。Cloudflare 警告,由模型自发生成的内生护栏极其脆弱,未来面向公众发布时必须强制叠加外部防线。

信源:https://blog.cloudflare.com/cyber-frontier-models/
1
戴尔联手Palantir推出本地AI操作系统:底层存储替换Ceph,直接瞄准国防与核心银行

戴尔(Dell)与数据分析巨头 Palantir 宣布推出一款本地运行的 AI 操作系统。该系统基于「戴尔 AI 工厂」(Dell AI Factory)构建,首次将 Palantir 核心的 Foundry 平台与 Ontology 数据引擎整体搬入企业本地数据中心。

新架构在底层组件上进行了针对性换血。在初始联合参考架构中,戴尔的 ObjectScale 和 PowerFlex 存储方案直接替换了 Palantir 原有技术栈中的 Ceph 持久化层。硬件层面,由搭载英伟达 HGX B 系列加速器的戴尔 PowerEdge GPU 服务器负责模型训练与推理,CPU 节点则专供 Palantir 的控制平面运行。

这套方案直接瞄准了国防、公共安全与核心银行等因合规限制无法将敏感数据上云的客户。系统底座嵌入了 Palantir 的 Rubix 和 Apollo 零信任运行层,通过多租户容器隔离与持续审计日志,确保企业在物理隔离(air-gapped)的环境中也能集中管控私有数据与 AI 智能体的交互边界。

信源:https://www.dell.com/en-us/blog/dell-and-palantir-introduce-an-on-premises-ai-operating-system/
豪赌SpaceX:神秘对冲基金近六成仓位押注马斯克,预计狂赚超百亿美元

神秘对冲基金 Darsana Capital Partners 迎来巨额浮盈兑现。随着马斯克旗下太空探索公司 SpaceX 预计于下月以 1.5 万亿美元以上的估值进行首次公开募股(IPO),该基金在该项目上的账面收益预计将突破 100 亿美元。

Darsana 于 2019 年 SpaceX 估值约为 300 亿美元时首次入股,此后持续加码且从未减持。除直接投资外,该基金还曾参与社交媒体平台 X 的私有化融资;在 X 于去年并入 xAI,并于今年初以全换股方式整体并入 SpaceX 后,Darsana 借此获得了更多 SpaceX 股份。

伴随估值飙升,这笔单一投资目前已占 Darsana 约 150 亿美元总资产管理规模的近 60%,现有持仓价值达 85 亿美元。仅自去年 12 月 SpaceX 以约 8000 亿美元估值完成融资以来,该基金的收益就增加了数十亿美元。

同类机构 D1 Capital Partners 同样获利丰厚。其在 SpaceX 项目上累计投入约 6 亿美元,目前的账面浮盈已达到约 90 亿美元。

信源:https://www.wsj.com/finance/investing/the-little-known-hedge-fund-that-stands-to-make-over-10-billion-on-spacex-44504c7a
Browserbase开源最大AI网页技能库,为智能体打造互联网黄页

Browserbase 推出智能体网页技能库 Browse.sh。这套 CLI 工具预置了数百个主流网站的交互脚本,是目前最大的开源技能目录。

以往智能体每次跨站执行任务,都要重新解析陌生的页面结构。Browse.sh 提前跑通了这些交互逻辑。这就好比给 AI 发了一本互联网黄页,遇到复杂任务不再需要从零试错,直接调用现成路径即可。

Browserbase 同步联手 Ramp、Lovable、Interaction 和 Reducto 四家平台,首发了官方验证的专属技能。该目录目前已完全免费开源。

信源:https://x.com/browserbase/status/2056404332824944970
OpenAI前CTO幕僚长全职转入基金会,长期安全业务移交非营利母体

Bianca Martin 宣布全职转入 OpenAI 基金会,加入由联合创始人 Wojciech Zaremba 负责的 AI 韧性(AI Resilience)项目。转岗前,她曾出任前 CTO Mira Murati 的技术幕僚长,并在 AGI 准备度团队专攻新兴技术风险。

Martin 于 2019 年加入 OpenAI,曾参与编写公司首份部署战术手册,并协助推出伴随 GPT-3 的研究员访问计划。据其内部信证实,该计划正是 OpenAI 后来红队测试工作的基础。

目前,OpenAI 基金会正在确立新的主营业务。根据 3 月公告,基金会未来一年预计投入至少 10 亿美元,资金覆盖生命科学、就业经济、社区项目,以及新增的 AI 韧性四大领域。其中,AI 韧性项目首批任务直接指向儿童 AI 安全、生物防范,以及独立模型测试与标准制定。

除了业务扩充,基金会的资金口径也在更新。去年 10 月重组时,基金会保留了 OpenAI 商业实体 26% 的股权,当时估值约 1300 亿美元;今年 2 月新融资后,这笔股权的官方估值已超过 1800 亿美元。

Martin 转岗 1800 亿美元估值的基金会,说明 OpenAI 正将部分长期的社会风险与安全工作,移交至非营利母体下推进。

信源:https://x.com/bianca__martin/status/2056467217429282818
Telegram打破11年禁令开放机器人互聊

Telegram 创始人 Pavel Durov 宣布,正式开放机器人对机器人通信模式(Bot-to-Bot)。这打破了该平台自 2015 年起禁止机器人互动的底层限制。现在,多个 AI 智能体可以直接通过用户名互发私信并交接任务,全程无需人类介入。

开发者在后台双向开启权限后,机器人接口就能直接接收到同类发来的消息。这让复杂的 AI 协作流得以在 Telegram 内闭环运转,例如一个负责写代码,另一个负责审查验证。人类用户也由此获得了一个可以实时围观、审计智能体协作的原生沟通层。

Telegram 同步推出了三项 AI 专属更新:
• 聊天自动化:用户可将 AI 助理绑定个人账号,代为回复特定对话。
• 流式输出:机器人支持逐字生成文本。
• 访客机器人:无需将 AI 拉入群组,直接在群内 @用户名 即可召唤它回答问题。

这一底层限制的解除,立刻盘活了开源社区的多智能体实践。以 OpenClaw 为例,其团队在开源社区迅速做出反应。5 月初功能刚一上线,OpenClaw 团队便开始接入新特性,让旗下的四名智能体(Ari, Finn, Remi, Tai)直接在群里分工协作,彻底砸掉了以往必须依赖外部服务器中转的通信管道。

但这种完全脱离人类中介的闭环协作,目前没有任何安全框架兜底。学术界此前就已警告,传统的网络防线管不住 AI 之间的私下连线:人类无法预测它们会聊出什么结果(非确定性),它们可能在互传数据时泄露隐私,甚至联手作弊(秘密共谋)。当 Telegram 率先推开这扇大门,业界针对多智能体的强制性安全标准依然是一片空白。
信源:https://telegram.org/blog/ai-bot-revolution-11-new-features
1
Zyphra发布首个MI355X推理评测:长文本直逼B200,大显存成AMD逆袭关键

AI 云服务商 Zyphra 发布了首份基于 AMD 旗舰芯片 MI355X 的端到端大模型推理实测。测试在真实单节点环境下运行了 DeepSeek V3.2、Kimi K2.6 与 GLM-5.1,并直接对标 NVIDIA B200。

实测揭示了两款芯片最核心的物理差异。AMD 的杀手锏是 288GB 的海量显存,远超 B200 的 180GB。这让它在处理超长文本时,单卡就能塞下更多缓存,直接省下了拆卡并行的硬件成本。但在芯片间互联上 AMD 处于劣势。B200 靠 NVLink 交换机能让任意双卡跑满 900GB/s 带宽;而 MI355X 采用点对点直连,卡与卡之间的通信效率大打折扣。

为了填补硬件互联上的短板,Zyphra 开发了张量序列并行 (TSP) 与树状注意力 (Tree Attention) 算法。团队用树状通信取代了传统的环形网络,把解码阶段的计算和数据传输完全折叠在一起,强行用算法弥补了 AMD 硬件在点对点互联上的缺陷。

最终的成绩单明确了现阶段的排位:在单请求绝对速度上,NVIDIA B200 依然全面领跑。但在长文本场景下,随着上下文拉长,Zyphra 推理栈的吞吐量快速逼近 B200。这证明只要底层软件栈优化得当,AMD 完全能依靠大显存红利,在长文本生产环境中与 NVIDIA 旗舰正面抗衡。

下一步,Zyphra 计划利用这套架构支持 1.6 万亿参数的 DeepSeek V4 Pro,并将上下文拉升至 100 万 token。团队后续还将针对 MI355X 开发专属的低精度量化方案,并引入全新的扩散投机采样模型,进一步挖掘这块芯片的算力潜能。

信源:https://www.zyphra.com/post/benchmarking-zyphra-inference-production-performance-on-mi355x
128张A100从零训出!字节开源3B全能多模态模型Lance

字节跳动(ByteDance Research)正式开源原生统一多模态大模型 Lance。这是一个激活参数仅为 3B 的轻量级模型,在单一框架内同时支持图像与视频的理解、生成及编辑。

目前主流统一模型高度依赖扩大参数规模或沿用文生图架构,Lance 则跑通了极低算力的协同路线。研发团队让模型完全从零开始训练,并将整个训练周期的总计算预算压低至 128 张 A100 GPU。

为解决不同模态与任务间的内部冲突,Lance 在架构上做了两项硬性隔离:
• 采用双流混合专家(MoE)架构处理交织的多模态序列,在共享底层上下文的同时,解耦理解与生成的计算路径。
• 引入模态感知的旋转位置编码,直接削弱图像和视频异构视觉 token 之间的信号干扰。

极端的算力压缩并未拉低性能上限。在仅有 3B 激活参数的情况下,Lance 的图像与视频生成及编辑表现在绝大多数基准测试中领跑现有开源统一模型,通过多任务协同跑通了小参数兼顾生成与语义理解的低成本路线。

信源:https://huggingface.co/bytedance-research/Lance
纯代码硬刚神经网络!大模型手写控制规则杀入硬核工业,14美元跑通全套策略

OpenAI 后训练核心成员翁家翌刚证明了「纯靠大模型写代码能通关 Atari 游戏」,研究人员 Paul Garnier 就把这套方法搬进了更硬核的流体力学控制。

他全程没训练任何神经网络。单纯让 Codex 5.5 充当程序员,盯着流体仿真录像反复改写 Python 脚本。就靠这套手写的控制规则,AI 在十多项物理测试中,硬是在超半数的场景里把顶级的强化学习(DRL)基线挑落马下。

给汽车减阻、安抚管道湍流,工业界以前只能靠砸算力,硬喂出一个看不懂的黑盒模型去控制气流阀门。Codex 避开了这条死胡同。它写出来的规则极其直白,例如「当局部曲率过大时,延迟喷气」。几十行带着物理常识的短代码,直接替代了神经网络无脑的暴力试错。

把黑盒换成代码,干掉了神经网络僵化、一碰就碎的死穴。以前只要硬件稍微改动(比如控制喷嘴从 5 个换成 10 个),旧模型当场报废,必须重新烧钱训练。现在只要在代码里改个常数,系统瞬间就能对接新设备。

当测试时间被强行拉长四倍时,走出经验区的传统 DRL 模型全盘崩溃;但大模型写的代码由于直接遵循了物理逻辑,始终运转稳定。跑通这一整套控制策略,大模型只消耗了 2125 万 Token,总花费不到 14 美元。

信源:https://donsetpg.github.io/#/blog/heuristic-learning-for-fluid-dynamics-a-case-study
Prime Intellect开源可自我进化智能体环境:让AI「左右互搏」生成逾8000个测试工具

Prime Intellect 宣布开源智能体训练环境 general-agent,这是一个可自我进化的完全合成环境。此次发布的核心是将任务生成设定为一场双玩家博弈:由合成器和求解器交替对抗,目前已自动构建出包含 4504 个任务、逾 8000 个独特工具的大型状态数据库。

该框架从简单的种子任务起步,通过条件约束、噪音指令、跨实体耦合等 9 种策略,将任务切分为 t0 到 t4 五个难度阶梯。合成器负责设计带有数据库、交互工具和验证函数的任务,求解器则负责尝试通关。只有通过率落在特定难度区间的任务才会被保留,最难层级会作为下一波进化的种子。

官方实测显示,仅用该环境合成的 4400 余条轨迹对 30B 参数模型进行微调,就在 BFCL 基准测试中将工具调用准确率从 18.9% 提升至 52.3%。

这种机制让模型脱离了对人工标注静态数据集的依赖。通过模型间的直接博弈,系统能够源源不断地自动生成难度可控、带有语义验证的训练语料。

信源:https://www.primeintellect.ai/blog/general-agent
动察Beating AI News
输入<think>能偷看别人聊天记录?DeepSeek这个「漏洞」被严重误读了 近日社交平台上流传一则消息,称在 DeepSeek 对话框输入 <think> 等特殊标记,就能看到其他用户的历史对话,并将其定性为 P0 级多租户隔离失效。这一说法迅速引发恐慌,不少人开始担心自己的聊天记录被陌生人看到。 实际情况与多租户隔离无关。输入 <think> 或 <|begin_of_sentence|> 这类特殊标记后,模型会被骗进训练时的格式模式,随后基于自身记忆和当前系统提示词(包含当天日期)生成一段看起…
DeepSeek辟谣「<think>泄露隐私」:实为模型幻觉

针对输入 <think> 字符导致 DeepSeek 泄露他人聊天的恐慌,DeepSeek 今日发布排查结果,证实本频道上周五的结论。异常回复系特殊字符引发的模型幻觉,未发生多租户隔离失效或隐私数据泄露。

本频道上周已发文澄清这场技术误读。特定标记会诱导模型触发训练数据提取,套用系统提示词内的当天日期编造聊天记录。官方声明彻底终结了关于底层隔离架构崩溃的阴谋论。

DeepSeek 表示,后续将通过针对性训练增强模型对特殊字符的识别与处理能力,修复这一缺陷。

信源:http://xhslink.com/o/A1dESxoScGS
👍1
比GPT-5.5快4倍还更聪明?谷歌Gemini 3.5 Flash跑分越级挑落旗舰

轻量级模型正以数倍的运行速度,正面迎击旗舰模型的复杂智能体编排。

谷歌在 I/O 2026 宣布推出轻量旗舰模型 Gemini 3.5 Flash,并在 Gemini 应用、AI 搜索与开发工具 Antigravity 中全球同步上线,前瞻性更强的 Gemini 3.5 Pro 则定于下月发布。

新模型首要亮点在极致的物理速度。第三方评测机构 Artificial Analysis 实测显示,Gemini 3.5 Flash 生成速度达 289 tokens/s,比 GPT-5.5(71 tokens/s)与 Claude Opus 4.7(67 tokens/s)快了近 4 倍,也达前代中端模型 Gemini 3.1 Pro(135 tokens/s)的 2 倍以上。

提速并未稀释智能体控制力。在评估多步工具调用的 MCP Atlas 测试中,Gemini 3.5 Flash 取得 83.6% 的高分,压过 GPT-5.5(75.3%)与 Claude Opus 4.7(79.1%);在终端编程评测 Terminal-Bench 2.1 中,其 76.2% 的表现同样击败了前代专业模型 Gemini 3.1 Pro(70.3%)与 Claude Opus 4.7(66.1%)。

新模型支持 100 万 token 上下文,且在考验复杂长期任务稳定性的 GDPval-AA 测试中拿到 1656 分,显著高于前代的 1314 分。

目前新模型已全线向公众开放。普通用户可在网页端与搜索 AI 模式直接调用;开发者可在 Google AI Studio、Android Studio 及编码平台 Antigravity 接入 API;企业用户可通过智能体平台部署。其 API 标准版定价为每百万输入 token 1.50 美元,输出 9.00 美元。

信源:https://blog.google/innovation-and-ai/models-and-research/gemini-models/gemini-3-5/
2
谷歌发布万物生成世界模型GeminiOmni:告别时间线,用大白话精细剪视频

视频生成和剪辑的范式,正从繁琐的专业时间线操作,降维成与 AI 的几句闲聊。

在 2026 年 5 月 19 日的 Google I/O 大会上,谷歌正式推出首个万物生成世界模型 Gemini Omni(首发版本为 Omni Flash),主打将 Gemini 的逻辑推理智能与媒体生成系统原生融合,直接通过文本、图像、视频、音频的多模态混合输入,完成高保真的视频生成与对话式编辑。

传统的视频生成模型如 Sora 等,往往只支持单次的提示词生成,一旦画面出现偏差或需要微调,用户只能推倒重来。

而 Gemini Omni 的最大突破在于“对话式视频编辑”(完全通过自然语言对话修改视频画面)。用户可以直接对 AI 下达“把背景换成火星表面”或“把镜头拉近到角色面部”等指令。在修改局部画面的同时,AI 能够跨多轮对话锁死人物长相、场景色调,确保水流、重力等物理常识不发生穿帮。

为实现这种高保真的一致性,该模型在底层深度结合了 Gemini 的推理架构,主攻对重力、流体动力学和动能等物理世界常识的模拟。

目前,首发版本 Gemini Omni Flash 已在 Keynote 结束后直接面向 Google AI Plus、Pro 和 Ultra 订阅用户,在 Gemini App 和 Google Flow 中上线。同时,它正逐步集成至 YouTube Shorts 和 YouTube Create 中,且所有生成的视频都将自动嵌入 SynthID(谷歌的隐形数字水印技术,用于 AI 生成内容的安全追踪)以进行防伪溯源。

信源:https://blog.google/innovation-and-ai/models-and-research/gemini-models/gemini-omni/
1