动察Beating AI News
3.16K subscribers
890 photos
2 videos
1 file
3.42K links
AI新闻信息流
Download Telegram
QuarqLabs开源四层持久记忆智能体架构Quarq Agent,并宣布公司全面转向机器人基础设施

初创公司 QuarqLabs 开源其核心项目 Quarq Agent 的 v0.4.0 版本。该项目旨在为 AI 智能体提供「持续学习」的长期记忆架构,解决智能体容易遗忘、难以进行长跨度时间推理以及容易产生幻觉的痛点。同时,QuarqLabs 宣布其战略重心全面转向机器人基础设施(Robotics Infrastructure),该项目将被归档作为开源研究资产,公司不再提供主动维护。

Quarq Agent 创新性地提出了一套包含「查询、存储、推理、学习」的四层模块化长期记忆体系。在「查询层」,系统在后台将提问扩展为多视角检索假设,并结合本地 FAISS 向量与关键词进行混合搜索;在「存储层」,记忆被分类为语义(偏好与事实)、情景(事件历史)和程序(行为指令与格式规则)三类,前两者由本地向量库与 JSON 支撑,后者则由规则集独立维护;在「推理层」,系统通过严格区分事件与存储时间、隔离实体关联以及在信息不足时主动坦承缺失等显式护栏阻断幻觉;在「学习层」,系统在后台异步运行独立模型,完成记忆的增删、更新与去重合并,不增加交互延迟。

在生态与落地层面,Quarq Agent 专注于极简的本地化部署,内置了 Gmail、Google Calendar 以及 PDF 结构化报告生成等多项开箱即用技能,支持开发者通过 Python 脚本在 tools 目录中动态扩展。作为完全开源且设计完备的「记忆优先(Memory-First)」智能体参考实现,为构建长期伴随式智能体提供了极高工程价值的底座。

信源:https://x.com/quarqlabs/status/2059320863070286177
Sakana AI推出DiffusionBlocks,独立分块训练使显存降至B分之一

大模型训练一直面临着显存消耗巨大的难题。传统方法要求整个模型在反向传播中保持激活状态,显存需求随着模型层数变深而急剧攀升。为了降低开发门槛, Sakana AI 联合东京大学在 ICLR 2026 大会上推出了全新训练框架 DiffusionBlocks 。新框架将神经网络划分为多个模块,通过将分块更新重新解释为扩散模型的逆向去噪过程,实现各模块的独立训练。

分块训练彻底打破了显存随模型层数线性增长的瓶颈。在训练时,算法每次只需随机抽取一个区块进行加载与更新,非抽样区块无需载入显存或参与计算,使显存消耗直接降至原先的 B 分之一。多项实验表明,分块训练不仅显存极低,在视觉 Transformer 、 DiT 图像生成以及文本生成任务中均能匹配甚至超越传统的端到端训练效果。

针对循环深度模型( Looped Transformer ),新框架同样展现出独特的优化价值。循环深度模型通常依赖开销极高的跨时间步反向传播( BPTT )进行训练,而 DiffusionBlocks 通过模拟逐步逼近目标的动态过程,在训练阶段只需进行单次前向传播便可完成参数更新,并在推理时完全保留原有的 K 次迭代机制,大幅削减了训练阶段的计算开支。

信源:https://pub.sakana.ai/diffusionblocks/
内置通用向量嵌入并集成视频生成,OpenClaw发布v2026.5.27

开源 AI 助手项目 OpenClaw 发布了 v2026.5.27 版本,将支持本地与托管端点的 OpenAI 兼容向量嵌入( Embedding )服务收归为内置核心引擎,并废弃了原有的插件兼容注册模式。新版本还集成了 Pixverse 视频生成服务,支持 API 区域选择与外部插件封装,为智能体生态原生补齐了 AI 视频创作能力。同时,新版打通了 vLLM 深度思考( Thinking )参数对接,并允许直接路由裸直连的 Anthropic 模型标识符。

安全防御与通道交付方面,新版实施了更为严密的安全隔离。系统将群组 Prompt 文本完全隔离在系统 Prompt 之外以防范恶意提示词注入,并拦截了具有副作用的命令包装器与非安全的 Node 运行期环境变量覆盖。为防范未授权的 Tailscale 网络暴露,节点与设备角色审批权限已收归管理员。在即时通讯信道上, Telegram 消息发送机制变更为持久化投递队列,提升了跨网络波动的发送成功率。

信源:https://github.com/openclaw/openclaw/releases/tag/v2026.5.27
Anthropic官宣H轮融资650亿美元,估值达9650亿美元,年化营收冲破470亿美元

Anthropic 官方宣布完成 H 轮融资,金额高达 650 亿美元,投后估值达到 9650 亿美元。本轮融资由 Altimeter Capital 、 Dragoneer 、 Greenoaks 以及 Sequoia 领投。大额资金的注入使这家大模型企业超越竞争对手 OpenAI ,成为全球估值最高的人工智能初创公司。

除了大规模的资本扩张,业务端的强劲增长也提供了关键支撑。就在本月上旬,年化营收运行率已经越过 470 亿美元大关。企业级客户的爆发式采购成为拉动营收的核心引擎,越来越多的机构将智能体部署在核心业务流程中。所得资金将主要用于推进前沿研究与扩展算力中心,以支撑全球用户对旗下 Claude 模型快速飙升的使用需求。

信源:https://www.anthropic.com/news/series-h-funding
Anthropic发布Opus 4.8,全面升级智能体编码与推理

Anthropic 宣布推出最新旗舰模型 Claude Opus 4.8。新模型在保留前代价格的同时,大幅精进了软件开发、智能体操作、复杂推理及知识工作的能力上限。网页端 claude.ai 同步上线「努力程度控制(Effort Control)」功能,允许用户手动调整特定任务的探索深度上限。

基准测试数据佐证了新模型的性能跨越。在软件开发基准 SWE-Bench Pro 评测中,Opus 4.8 取得 69.2% 的成绩,大幅超越前代(64.3%),并抛离竞争对手 GPT-5.5(58.6%)与 Gemini 3.1 Pro(54.2%)。多学科前沿推理测试 Humanity's Last Exam 结果显示,新模型在工具辅助下得分飙升至 57.9%,无工具状态下为 49.8%,均居行业首位。另外,网络智能体测试 OSWorld-Verified 录得 83.4%,并在浏览器智能体测试 Online-Mind2Web 中以 84.0% 的成绩创下业界最高分。

同步推出的「快速模式」将运行速度拉升至 2.5 倍,而 API 计费价格则降至前代的三分之一。早期测试反馈表明,Opus 4.8 能够主动标记输入或输出数据中的潜在瑕疵,在长会话中展现出极佳的自我纠错与长程协作能力,改善了开发环境的信噪比。

信源:https://www.anthropic.com/news/claude-opus-4-8
原生协调数百并行子智能体,Claude Code上线动态工作流

Anthropic 宣布在终端编程智能体 Claude Code(含 CLI、Desktop 以及 VS Code 插件)中上线「动态工作流」的预览版。全新工作流专为全局性研发难题设计,旨在自主解决跨服务代码库的复杂 Bug 追踪、数百个文件的整体重构与框架迁移,以及上线前全方位的对抗性测试。开发团队指出,原本需要数个季度规划的大型迁移项目,如今能在数天内完成。

机制层面,动态工作流摒弃了传统的单线程模式。当用户发起长程任务时,主智能体会自主编写编排脚本,将目标拆解并分发给数十至数百个并行子智能体。在合并代码前,系统会指派独立子智能体进行多视角对抗测试,并引入两轮代码审查(Reviewer Agents),直至多方结果收敛。为支持长达数天甚至数周的持续运行,系统支持增量自动存档与断点续传。

Bun 创始人 Jarred Sumner 率先披露了极限重构实战。在短短 11 天内,动态工作流协助团队将 Bun 核心从 Zig 语言移植到 Rust 语言,生成近 75 万行 Rust 代码,且通过了原测试套件中 99.8% 的用例。目前,动态工作流已向 Max、Team 以及 API 用户默认开放。开发人员可通过在 effort 菜单中开启全新的 ultracode 设定以激活新特性,在新配置下 Claude Code 的努力程度会被拉满至极高,并由大模型自主裁决何时启动动态工作流。

信源:https://claude.com/blog/introducing-dynamic-workflows-in-claude-code
安全机制取得关键突破,Anthropic最快数周内公开下一代Mythos级模型

Anthropic 在最新发布的旗舰模型 Claude Opus 4.8 官方公告中确认,开发团队在安全防御与保障机制上取得了突破性进展,预计最快将在未来几周内向所有客户推出拥有超旗舰智能的下一代 Mythos 级模型。而在五月二十二日发布的 Glasswing 软件安全项目报告中,研究团队曾强调,在开发出更强效的安全保障机制前不会向公众开放 Mythos 级模型。

作为拥有端到端攻破靶场等极强网络攻防实力的前沿模型,Mythos 级模型的公开化曾长期受制于「发现漏洞仅需数秒,修补漏洞需要数周」的严重攻防时间差。为防范模型被滥用并造成严重危害,Anthropic 团队目前正加速开发更强效的安全防御机制。同时,官方已开始向符合条件的安全团队定向提供扫描编排套件等工具,帮助防御侧建立不对称优势。

信源:https://www.anthropic.com/news/claude-opus-4-8
阶跃开源Step 3.7 Flash,主打生产级Agent的多模态MoE模型

阶跃星辰正式发布并开源新一代 Flash 大模型 Step 3.7 Flash,系统优化了生产级 Agent、代码、联网搜索与多模态工作流。模型采用 Apache 2.0 协议开源,采用 196B 语言主干与 1.8B 视觉 Transformer(ViT)组成的稀疏 MoE 架构,总参数量达 198B,激活参数仅为 11B。在支持 256K 上下文与 3 档推理的同时,最高速度达 400 Tokens/s,并针对 Mac Studio M4 Max、DGX Spark 与 AMD AI Max + 395 等本地硬件进行了适配。

作为生产级 Agent 底座,Step 3.7 Flash 具备原生多模态理解与执行能力,可自主框选、裁剪并重读 UI 界面或图表,且在信息不确定时能主动检索验证。Step 3.7 Flash 在 ClawEval-1.1 自主任务执行评测中以 67.1% 夺冠,并在 SimpleVQA Search(79.2%)、V* Python(95.3%)与 SWE-Bench Pro(56.3%,位列全球第二)等测试中展现出极强的工程推理能力。在多工具协同与任务执行方面,模型在 Toolathlon 上达到 49.5%,在横跨 44 种职业的 GDPval 上达到 45.8%,并在 τ²-bench 通信全部难度测试中取得 98% 以上的通过率。

阶跃星辰针对 Claude Code、OpenClaw、KiloCode、RooCode、Hermes Agent 等框架与 MCP 协议深度兼容,同步开源 Hugging Face、ModelScope 接口与端侧 GGUF 版本,并与 OpenRouter、ZenMux 及 Fireworks AI 等平台完成适配。

信源:https://mp.weixin.qq.com/s/W1qyqwE19w-k4eKWRIEZuQ
苹果重构Siri并端侧蒸馏Gemini,云端拟采用英伟达机密计算保障隐私

苹果计划在下月 WWDC 上确立端侧 AI 架构,将大模型与自研芯片深度绑定。针对基础任务,苹果正通过端侧蒸馏谷歌万亿参数级 Gemini,训练轻量模型以降低网络延迟;高复杂度推理任务则路由至云端处理。

为保障云端隐私,苹果批准在 Google Cloud 中采用 NVIDIA 机密计算技术对 GPU 处理的数据与模型加密。采用第三方云改变了苹果此前宣称的「所有非本地 AI 请求均在自研芯片服务器 Private Cloud Compute 中处理」的承诺,不过苹果仍将保留 Private Cloud Compute 品牌。同时,苹果正寻求收购专注于本地运行的初创公司,已将 Liquid AI 列为潜在收购对象。

系统层面的具体功能显示,iOS 27 将对 Siri 进行深度重构。Siri 将集成至 Dynamic Island,并提供全新的「Search or Ask」下拉界面。系统还将上线独立的 Siri 聊天应用以提供类似 Perplexity 的复杂工作流处理能力。此外,用户可以在「Extensions」设置中选择谷歌 Gemini、OpenAI 旗下 ChatGPT 或 Anthropic 旗下 Claude 等第三方智能体。

相机应用将新增专用 Siri 模式以取代「视觉智能」功能,支持用户拍摄物体并调用谷歌反向图像搜索,同时提供可自定义的快捷组件面板以供调整曝光、焦距与夜间模式。照片应用将引入「Extend」与「Reframe」等生成式 AI 工具。系统还包含语法检查、Image Playground 生成式壁纸,并针对折叠屏多任务进行底层优化。系统开发将侧重于漏洞修复与效率提升。

信源:https://www.bloomberg.com/news/features/2026-05-28/apple-ios-27-photos-screenshots-revamped-siri-pro-camera-app-new-ai-features
腾讯混元发布Hy-Memory:以六层双系统演化链架构打造Agent超强第二大脑

腾讯混元发布专为 OpenClaw 等长期协作型智能体设计的高效记忆插件 Hy-Memory。系统通过 6 层记忆框架、System 1 与 System 2 双系统及演化链设计,解决传统记忆系统在长周期协作中的记忆碎片化、注意力稀释和幻觉痛点,让 Agent 在跨天及跨会话运行时真正实现记得住、记得对、记得轻、更懂你。

技术架构上,Hy-Memory 摒弃单一向量表,首创六层记忆框架,将记忆精细划分为事实、画像、心智模型和前瞻意图。为兼顾响应速度与深度认知,系统复刻人脑双系统机制:实时响应的 System 1 毫秒级抽离 L1–L4 即时事实与会话摘要;后台运行的 System 2 则在秒至分钟级提炼 L5–L6 用户心智模型与知识网络,确保主对话零延迟。

针对用户偏好与事实的持续变动,系统引入演化链,通过 supersedes 指针将新旧记忆串联,检索时可自动展开整条链条。这既保证 Agent 获取最新结论,又完整保留了用户决策的因果路径(如从有氧跑步、HIIT 膝盖受伤到混合训练的完整演变),避免重复推荐已被否决的方案。

在长期记忆评测 LongMemEval 中,Hy-Memory 取得 85.2 的成绩,在偏好、时序推理和知识更新等演化指标上均领先;在长期真实对话评测 PersonaMem 中同样居首。性能方面,Hy-Memory 写入速度是 Graphiti 的 8 倍,记忆条数仅为 mem0 的 1/3、Graphiti 的 1/4 左右,单条记忆信息密度提升 45% 以上。在长上下文处理中,Token 消耗降低 35%,记忆更新速度提升 20%。

Hy-Memory 提供 Lite、Pro 和 Ultra 三档配置,支持一行命令集成。系统默认采用 Chroma 本地嵌入式向量库,无需部署 Qdrant 或 Docker 等外部服务,共用同一 SDK 支持无缝升级。

信源:https://mp.weixin.qq.com/s/dH5PGpxqArFZkSq3-QxWYA
用1B激活参数跑本地思考,Liquid AI开源端侧MoE模型LFM2.5-8B-A1B

前沿端侧 AI 研发公司 Liquid AI 发布并开源了新一代端侧混合专家模型 LFM2.5-8B-A1B。新模型专为手机、电脑和机器人打造,虽然拥有 8B 总参数,但每次运行只需调用 1B 激活参数(Active 1B),运行极其轻快。发布采用 LFM 开放权重许可,支持在个人设备或单张消费级显卡上本地微调与离线运行。

另据《The Information》独家披露,正极力重回端侧路线的苹果已将 Liquid AI 列为潜在收购对象,以支撑后续 iOS 系统的本地离线智能服务。

作为主打本地运行的模型,LFM2.5-8B-A1B 已转型为「先思考、后回答」的纯推理模型,在给出最终答案前会先展示完整的思维链。得益于每次运行只需 1B 激活参数,推理时的思考成本极低,在不牺牲手机、电脑运行速度的前提下大幅提升了回答质量。一次性处理信息的容量从 32K 单词量飙升至 128K,相当于能轻松吞下一整本书或长篇开发代码。为了让非英语用户使用更顺畅,词表翻倍至 128K,使得处理泰语和印地语的效率分别提升了 238.2% 与 120.4%,阿拉伯语也获得了 38.8% 的效率提升。

针对本地小模型极其容易陷入的死循环毛病,Liquid 团队进行了专项优化,彻底让模型摆脱了在思考时反复倒退的「鬼打墙」现象。为了解决小模型经常胡言乱语的幻觉问题,开发人员在安全防线上加入靶向强化学习,让模型在遇到超出自身知识边界的问题时,能老老实实主动说「不知道」,使回答准确率(无幻觉率)从前代的 7.46% 跃升至 63.47%。在复杂任务和工具调用测试中,得分大幅领先竞品。生态上,LFM2.5-8B-A1B 首日兼容 llama.cpp`、`MLX 等主流本地运行框架,在苹果 M5 Max 电脑芯片上能跑到每秒 253 个词元的极致速度,即便是手机端也能流畅离线运行。

信源:http://liquid.ai/blog/lfm2-5-8b-a1b
前苹果Vision Pro主管创立,世界模型公司Reactor融资5900万美元

由前 Apple Vision Pro 开发主管创立的世界模型公司 Reactor 正式宣布走出隐身模式,完成了高达 5900 万美元的种子轮与 A 轮融资。资金由光速创投(Lightspeed Venture Partners)领投,Amplify Partners、WndrCo、云九资本以及 FPV Ventures 参投。资金将主要用于加速世界模型基础设施的研发与全球化部署,帮助开发者在 10 行代码内,将前沿世界模型实时流式传输至应用程序中。

主流 AI 视频通常偏重生成速度,Reactor 则主攻交互速度与超低延迟,目标是将画面延迟压缩至 50 毫秒以内。通过提供统一的开发接口与工具包,开发者不用操心复杂的底层服务器架构,就能做出实时响应的交互式 AI 应用。画面像素、音频和物理动作均在眨眼间按需生成,不再需要预先渲染,这也为媒体娱乐、具身智能和机器人带来了实时反应的全新可能。

Reactor 的两位联合创始人背景亮眼:CEO Alberto Taiuti 曾是知名 3D 与视频生成工具 Luma AI 的联合创始人兼前 CTO,而 CTO Bryce Schmidtchen 曾与 Alberto 共同在苹果担任 Apple Vision Pro 的技术主管。过去半年来,团队吸引了来自苹果、Meta、谷歌、Luma AI、Netflix 和 Replicate 等顶尖机构的成员加入。

信源:https://x.com/reactorworld/status/2060015607928819876
Hermes Agent发布v0.15.0,大幅瘦身代码并升级多智能体平台

NousResearch 团队正式发布开源智能体项目 Hermes Agent v0.15.0 版本。运行核心 run_agent.py 代码量从原先的 16083 行大幅精减 76% 至 3821 行,并完全重构为 14 个高内聚模块,消除了编辑器加载卡顿。在冷启动与搜索性能上,开发团队通过延迟引入 OpenAI 依赖包与优化高频函数调用,将 Termux 终端 cold-start 时间压缩至 0.8 秒, hermes --version 速度提升 63% 至 258 毫秒。重组后的会话搜索工具 session_search 摒弃了大模型调用,改用免配置的本地过滤,让搜索耗时缩短至 20 毫秒,实现了 4500 倍的提速与完全零成本运行。

看板工具升级为完整的多智能体协作平台。开发者只需输入 hermes kanban swarm 即可一键初始化包含协调者、并行工作者、独立校验与合成节点的 Swarm 工作流,并新增了单任务模型覆盖与定时启动支持。安全防御方面,新版本引入了针对 Brainworm 攻击的主动威胁防御,在工具输出、召回记忆与外部技能加载等三个关键卡口实施流量过滤与边界标记,防止智能体被恶意文件或网络服务夺取控制权。

生态系统与第三方集成也迎来深度升级。系统支持基于 Bitwarden 统一托管所有云端 API 密钥,上线了可单命令加载多技能的工具包,并新增了 Nous 官方 MCP 服务目录交互式安装面板。 xAI 生态整合新增了 xAI Web Search 网络搜索插件,在 hermes proxy 代理中打通了 Grok 专属执行引导,且 hermes doctor 诊断流程能对已线模型自动预警,支持一键热迁移。为了修复版本首发时的阻碍级故障,官方在数小时内紧急推出了 v0.15.1 补丁版本,彻底消除了面板在 loopback 模式下面临的 401 无限重载循环,同时修复了 Docker 容器内 npx 等裸命令路径解析失效、 Kanban 工作线程在 SIGTERM 信号下无法被正常终止等缺陷。

信源:https://github.com/NousResearch/hermes-agent/releases/tag/v2026.5.28
1
ChatGPT市占率降至六成,消费级AI步入三足鼎立时代

SimilarWeb 最新流量数据显示,消费级 AI 市场已正式告别 ChatGPT 的「一马当先」格局,步入由 OpenAI、Google 与 Anthropic 主导的三足鼎立时代。过去半年中,ChatGPT 的全球用户流量份额从 80% 大幅滑落至 60%。同时,Gemini 独立访客流量相对 ChatGPT 翻倍,比例从 20% 攀升至 50%,Claude 的相对比例则从 3% 激增至 20%。

在全球前 100 大网站中,Claude 上季度以 255% 的环比增速(升至全球第 36 位)成为增长最快的网站,而 DeepSeek 则以 105% 的增速位居第 78 位。结合官方活跃用户数据(ChatGPT 周活跃 900M,Gemini 月活跃 900M)换算表明,ChatGPT 网页与移动端周活跃(WAU)约 900M、月活跃(MAU)达 1.5B,Gemini 维持约 500M WAU 与 900M MAU,Claude 约 150M 至 200M WAU,以及 250M 至 300M MAU。

地缘分布显示,Gemini 在非英语地区的流量已追赶至 ChatGPT 的 65% 至 70%,包括印度、巴西、日本、印尼、韩国与越南,而 Claude 在中国市场录得了非常亮眼的增长。

信源:https://x.com/deedydas/status/2060013445291094348
开源神作遭大厂「官方收割」?王牌插件OMO贴脸炮轰Anthropic、FactoryAI像素级抄袭其Agent编排架构

在 Anthropic 随 Opus 4.8 推出 Claude Code 动态工作流与 ultracode 模式仅数小时后,开源框架 OMO 团队在 X 上发起猛烈攻势,公开指责 Anthropic 像素级抄袭了其多模型编排架构。

OMO 作为 16.7 万星开源终端 Agent 项目 OpenCode 官方认定的 No.1 插件,由 23 岁韩国黑客 Q 开发,并由运营团队 Sisyphus Labs 宣发,目前已斩获 6 万星,在开发者社区极具声量。

这场风波直接撕开了大厂「先封杀、后吸收」的掠夺路径。今年 1 月,Q 在 OMO 中推出了用于多模型动态编排的 ultrawork 工作流以及负责合并审查的协调大脑 atlas。由于这套编排机制在运行多智能体递归循环时会吞噬天量 Token,被 OpenCode 联合创始人 Dax Raad 吐槽为「Token 燃烧器」,高能耗调用直接促使 Anthropic 在 4 月份痛下杀手,强行封禁了第三方客户端使用订阅额度的通道。

仅仅三个月后,Anthropic 官方就将这套已被开源验证的动态编排逻辑收编,化身为自家 Claude Code 的闭源收费主打功能。

除了死磕 Anthropic,OMO 团队与 FactoryAI 在今年 2 月也存在旧怨。FactoryAI 此前高调宣传的 Missions 多天自主任务流,被指直接搬运了 OMO 的三层 Agent 架构:OMO 的规划器 Prometheus 变成了 Factory 的计划审批流,协调大脑 Atlas 被改名包装为 orchestrator Droid,执行器 Sisyphus Junior 变成了 Worker Droid,甚至连原装的技能过滤机制都被简化挪用。

面对 OMO 团队晒出的历史开发记录,以及要求大厂公开致谢并承认原创贡献的喊话,两家大厂至今装聋作哑。开源团队则继续在推特上进行多维度反击。

一方面,Sisyphus Labs 强调 OMO 框架是完全模型无关的,用户不需要高昂的官方配额,用本地或便宜的 GPT、Gemini 甚至 Kimi 模型同样能跑起 ultrawork 工作流,并透露正在开发基于 GPT-5.5 的 Codex 适配版本。

另一方面,Q 亲身试用后对新模型打出了毒舌评价,认为新模型不过是一款不错的 GPT-5.5 中量级模型。此外,Q 还反手给出了一个幽默的嘲讽:他直接用 Anthropic 的官方新工具,命令它把 OMO 原创的编排逻辑重写一遍,做成一个可以反向挂载到 Claude Code 上的兼容插件。Q 调侃道,这就当是帮大厂做个兼容实验,毕竟开源团队的创意被直接拿走,大家早都习以为常了。

信源:https://x.com/q_yeon_gyu_kim/status/2060215394334552103
伊利诺伊州通过监管法案,美AI监管陷联邦与地方对立博弈

伊利诺伊州众议院通过一项地方法案,要求头部 AI 企业提交模型安全计划以接受第三方审计并设立举报人保护。伊利诺伊州也成为继加利福尼亚州和纽约州后,又一出台 AI 安全法案的地区。联邦层面的监管政策则呈现相反方向。总统特朗普曾表达阻止州级 AI 监管的意图,坚称预审等限制会削弱美国对华竞争优势。

特朗普无限期推迟签署大模型审查行政命令,并在签字前数小时全盘撤回安全审查草案。白宫原本起草的行政令草案要求开发商在公开发布前,提前最多 90 天向政府共享模型。为了防止各州立法形成阻碍,白宫于 5 月 26 日任命前司法部长帕姆·邦迪 Pam Bondi 加入科技顾问委员会 PCAST,意图利用司法起诉手段阻击与联邦冲突的地方法规。

虽然进步商会等行业团体以审计体系尚不成熟为由对地方法案表示反对,计算机与通信工业协会 CCIA 也表示目前尚无独立审计的标准生态,但 OpenAI 与 Anthropic 均公开表达对伊利诺伊州审计法案的支持。

信源:https://x.com/OpenAINewsroom/status/2059833892316856598
产品线瘦身,OpenAI将从ChatGPT中退役经典推理模型OpenAI o3与GPT-4.5

OpenAI 在最新发布的 ChatGPT 更新日志(Release Notes)中宣布,为了进一步优化资源配置,将从 ChatGPT 网页及移动端界面中退役 OpenAI o3 与 GPT-4.5 两款模型。

此举旨在清理使用率较低 of the 旧款模型,从而将更多计算资源与工程力量集中在最新且更具实力的 GPT-5.5 旗舰系列(包括 GPT-5.5 Instant、GPT-5.5 Thinking 和 GPT-5.5 Pro)上。

具体退役日程表如下:
• GPT-4.5:进入为期 30 天的过渡期,定于 2026 年 6 月 27 日 正式下线;
• OpenAI o3:进入为期 90 天的过渡期,定于 2026 年 8 月 26 日 正式下线。

在各自的下线期限截止前,ChatGPT 付费用户仍可在模型设置中手动选择使用它们。此外,OpenAI 的 API 服务暂时不受此调整影响,开发者仍可通过 API 继续调用 OpenAI o3 和 GPT-4.5 模型。

信源:https://help.openai.com/en/articles/6825453-chatgpt-release-notes#retiring-openai-o3-and-gpt-45
回应额度消耗过快,谷歌Gemini推出免费使用Flash-Lite等六项优化

针对用户普遍反映的谷歌 Gemini App 使用限额消耗过快且缺乏预测性的问题,谷歌 Gemini 产品副总裁 Josh Woodward 宣布团队正在紧急上线六项额度优化措施。

具体调整包括:
1. 免费使用 Flash-Lite:用户向轻量级模型 Flash-Lite 发送的所有提示词将完全免费,不再扣除任何日常使用限额。
2. 修复视频扣额并翻倍:修复了在多模态视频场景下仅生成一两个视频便耗尽额度的 Bug,并将 Gemini Ultra 订阅用户的 Omni 视频生成限额即刻提升至双倍。
3. 复杂 Pro 提示词设限:针对携带庞大文件附件或超长提示词的单个 Pro 模型请求设立扣除上限,确保用户获取更连贯的调用次数。
4. 错误与失败请求免扣额:多模态交互过程中的网络延迟与系统错误均不再计费,用户仅需为顺利返回的成功结果支付限额。
5. 重度任务用量透明化:对于消耗庞大算力的 Deep Research 等重度任务,正在设计更详尽的用量仪表盘与限额透支预警,以便提升高负载操作的可控性。
6. 自动记忆模型选择:系统将自动锁定并记忆用户手动选定的具体模型,除非遭遇限额限制触发自动降级或手动调整,否则不会在后续会话中强制切换至轻量版本。

信源:https://x.com/joshwoodward/status/2060171610922058142
QQ浏览器接入元宝助手,底层大模型升级至混元3预览版

腾讯宣布QQ浏览器全面接入AI助手「元宝」(Mac版本现已更新,其他版本陆续推出)。与以往需要单独寻找侧边栏或浮窗入口不同,本次更新将元宝深度嵌入到了浏览器的侧边栏、搜索栏与地址栏中。

本次更新的主要变化包括:
1. 随时唤起与搜索直达:在浏览网页、阅读文件或查阅英文资料时,可随时唤起元宝进行提问、总结、对话或划词翻译。用户在地址栏或搜索栏输入常规词后,搜索结果首条会直接呈现由元宝整理的结构化答案,并支持追问。
2. 跨网页与文件联合问答:支持导入多个网页或文件。用户点击「+网页/文件」即可将不同来源的内容导入,由元宝进行跨内容的综合对比、分析与信息提炼。
3. 新增写作与生图功能:集成了元宝的AI功能,支持从零撰写、仿写、续写或润色文案,并可根据描述生成配图;学习模块则支持拍照搜题并整理为电子错题本。
4. 底层模型升级:浏览器底层大模型同步升级为混元3预览版(Hy3 preview),官方问答准确率从91%提升至94%,并优化了长篇解答的逻辑和易读性。原有网页总结、思维导图与阅读模式等高频功能的回答完整度也有所提升。

信源:https://mp.weixin.qq.com/s/ozQqAYFPMwmIFY3lrbo33g
阿里T2I评测Qwen-Image-Bench开源,GPT Image 2夺冠且五项全能

阿里巴巴 Qwen 团队宣布开源全新的绘图评测基准 Qwen-Image-Bench,专门用于评估大模型从文本生成图像(简称 T2I,即输入文字自动画图)的能力。同步推出的还有基于 Qwen3.6-27B 深度训练的统一视觉裁判模型 Q-Judger。评测基准模拟专业艺术创作工作流,包含画质、美学、文字与画面对齐以及新增的真实世界保真度与创意生成 5 大维度,下设 23 个子能力与 56 个细分指标。

Qwen-Image-Bench 包含 1000 个中英双语分层提示词,长短描述各占 500 个,平均同时考核 4 个以上维度。虽然评估的范围和角度极广,但最终所有维度的图像打分均由视觉裁判模型 Q-Judger 自动判别完成。为了训练裁判模型,研发团队邀请了来自艺术院校的 80 名专业评审,在盲审与三审制度下标注了超 13 万个双语数据对,使模型输出的 56 个维度得分与人类专家打分的吻合度高达 92%。

首批 18 个主流图像生成模型评估结果显示,GPT Image 2 以 64.69 的综合得分夺魁,并在所有 5 大维度上均列第一。Nano Banana 2.0 得分为 59.82,GPT Image 1.5 得分为 59.65,Nano Banana Pro 得分为 59.45,分列二三四名,阿里自研的 Qwen Image 2.0 Pro 以 57.84 排名第五,GLM Image 则以 48.19 垫底。数据表明,真实世界保真度与创意生成是拉开模型梯队的关键指标。评测还揭示了当前行业共同的技术瓶颈,在画人手骨骼、表现重力和光影等物理规律、以及处理物体间穿模等细节上,AI 绘画模型普遍容易出错,顶尖模型在这些维度的得分也均低于 44 分。

信源:https://arxiv.org/abs/2605.28091
智谱AI拟进军「AI早教机」:自研硬件拿牌照、合作早教代工厂

一向主攻底层大模型和 B 端服务的智谱 AI 正在秘密自研多款消费级硬件,内部型号包括 ZAI-P1、ZAI-M2、ZAI-N1 等。其中,型号为 ZAI-P1 的设备已于 2026 年 2 月悄然拿到了工信部颁发的电信设备进网试用证,申请和生产单位都是智谱的全资子公司成都智谱华章。这意味着该设备已经拿到了接入国内公用电信网的「准生证」,具备了合法使用 4G 蜂窝通信功能的资格,这也是产品在国内公开销售的前提条件。

不过,拿到试用证并不等同于马上能买到。按照国内电信设备的上市流程,试用证只说明产品的通信性能检测达标,后续还要经过试运行核验,才能申请正式的进网许可证,因此距离真正的量产上市还有一段时间。更有意思的是,这款设备的代工厂是深圳市拓步教育电子多媒体有限公司。这家代工厂的主业是开发和销售 0-6 岁儿童智能早教产品,主力产品包括电子学习机、学生平板电脑、故事机、移动家教机和智能手表等。

从合作代工厂的背景来看,智谱 AI 的第一款物理硬件大概率会避开竞争惨烈的智能手机和 AI 硬件大单品,转而切入早教或儿童教育这一垂直赛道,推出「AI 早教机」或「AI 学习平板」等终端产品。这也标志着智谱 AI 正式吹响了进军消费级硬件的号角,尝试把自家的大模型从云端服务直接「装进」实体硬件中。

信源:https://mp.weixin.qq.com/s/m06yIsnYFaGyx6MNlrnk2Q