动察Beating AI News
3.18K subscribers
902 photos
2 videos
1 file
3.44K links
AI新闻信息流
Download Telegram
腾讯混元发布Hy-Memory:以六层双系统演化链架构打造Agent超强第二大脑

腾讯混元发布专为 OpenClaw 等长期协作型智能体设计的高效记忆插件 Hy-Memory。系统通过 6 层记忆框架、System 1 与 System 2 双系统及演化链设计,解决传统记忆系统在长周期协作中的记忆碎片化、注意力稀释和幻觉痛点,让 Agent 在跨天及跨会话运行时真正实现记得住、记得对、记得轻、更懂你。

技术架构上,Hy-Memory 摒弃单一向量表,首创六层记忆框架,将记忆精细划分为事实、画像、心智模型和前瞻意图。为兼顾响应速度与深度认知,系统复刻人脑双系统机制:实时响应的 System 1 毫秒级抽离 L1–L4 即时事实与会话摘要;后台运行的 System 2 则在秒至分钟级提炼 L5–L6 用户心智模型与知识网络,确保主对话零延迟。

针对用户偏好与事实的持续变动,系统引入演化链,通过 supersedes 指针将新旧记忆串联,检索时可自动展开整条链条。这既保证 Agent 获取最新结论,又完整保留了用户决策的因果路径(如从有氧跑步、HIIT 膝盖受伤到混合训练的完整演变),避免重复推荐已被否决的方案。

在长期记忆评测 LongMemEval 中,Hy-Memory 取得 85.2 的成绩,在偏好、时序推理和知识更新等演化指标上均领先;在长期真实对话评测 PersonaMem 中同样居首。性能方面,Hy-Memory 写入速度是 Graphiti 的 8 倍,记忆条数仅为 mem0 的 1/3、Graphiti 的 1/4 左右,单条记忆信息密度提升 45% 以上。在长上下文处理中,Token 消耗降低 35%,记忆更新速度提升 20%。

Hy-Memory 提供 Lite、Pro 和 Ultra 三档配置,支持一行命令集成。系统默认采用 Chroma 本地嵌入式向量库,无需部署 Qdrant 或 Docker 等外部服务,共用同一 SDK 支持无缝升级。

信源:https://mp.weixin.qq.com/s/dH5PGpxqArFZkSq3-QxWYA
用1B激活参数跑本地思考,Liquid AI开源端侧MoE模型LFM2.5-8B-A1B

前沿端侧 AI 研发公司 Liquid AI 发布并开源了新一代端侧混合专家模型 LFM2.5-8B-A1B。新模型专为手机、电脑和机器人打造,虽然拥有 8B 总参数,但每次运行只需调用 1B 激活参数(Active 1B),运行极其轻快。发布采用 LFM 开放权重许可,支持在个人设备或单张消费级显卡上本地微调与离线运行。

另据《The Information》独家披露,正极力重回端侧路线的苹果已将 Liquid AI 列为潜在收购对象,以支撑后续 iOS 系统的本地离线智能服务。

作为主打本地运行的模型,LFM2.5-8B-A1B 已转型为「先思考、后回答」的纯推理模型,在给出最终答案前会先展示完整的思维链。得益于每次运行只需 1B 激活参数,推理时的思考成本极低,在不牺牲手机、电脑运行速度的前提下大幅提升了回答质量。一次性处理信息的容量从 32K 单词量飙升至 128K,相当于能轻松吞下一整本书或长篇开发代码。为了让非英语用户使用更顺畅,词表翻倍至 128K,使得处理泰语和印地语的效率分别提升了 238.2% 与 120.4%,阿拉伯语也获得了 38.8% 的效率提升。

针对本地小模型极其容易陷入的死循环毛病,Liquid 团队进行了专项优化,彻底让模型摆脱了在思考时反复倒退的「鬼打墙」现象。为了解决小模型经常胡言乱语的幻觉问题,开发人员在安全防线上加入靶向强化学习,让模型在遇到超出自身知识边界的问题时,能老老实实主动说「不知道」,使回答准确率(无幻觉率)从前代的 7.46% 跃升至 63.47%。在复杂任务和工具调用测试中,得分大幅领先竞品。生态上,LFM2.5-8B-A1B 首日兼容 llama.cpp`、`MLX 等主流本地运行框架,在苹果 M5 Max 电脑芯片上能跑到每秒 253 个词元的极致速度,即便是手机端也能流畅离线运行。

信源:http://liquid.ai/blog/lfm2-5-8b-a1b
前苹果Vision Pro主管创立,世界模型公司Reactor融资5900万美元

由前 Apple Vision Pro 开发主管创立的世界模型公司 Reactor 正式宣布走出隐身模式,完成了高达 5900 万美元的种子轮与 A 轮融资。资金由光速创投(Lightspeed Venture Partners)领投,Amplify Partners、WndrCo、云九资本以及 FPV Ventures 参投。资金将主要用于加速世界模型基础设施的研发与全球化部署,帮助开发者在 10 行代码内,将前沿世界模型实时流式传输至应用程序中。

主流 AI 视频通常偏重生成速度,Reactor 则主攻交互速度与超低延迟,目标是将画面延迟压缩至 50 毫秒以内。通过提供统一的开发接口与工具包,开发者不用操心复杂的底层服务器架构,就能做出实时响应的交互式 AI 应用。画面像素、音频和物理动作均在眨眼间按需生成,不再需要预先渲染,这也为媒体娱乐、具身智能和机器人带来了实时反应的全新可能。

Reactor 的两位联合创始人背景亮眼:CEO Alberto Taiuti 曾是知名 3D 与视频生成工具 Luma AI 的联合创始人兼前 CTO,而 CTO Bryce Schmidtchen 曾与 Alberto 共同在苹果担任 Apple Vision Pro 的技术主管。过去半年来,团队吸引了来自苹果、Meta、谷歌、Luma AI、Netflix 和 Replicate 等顶尖机构的成员加入。

信源:https://x.com/reactorworld/status/2060015607928819876
Hermes Agent发布v0.15.0,大幅瘦身代码并升级多智能体平台

NousResearch 团队正式发布开源智能体项目 Hermes Agent v0.15.0 版本。运行核心 run_agent.py 代码量从原先的 16083 行大幅精减 76% 至 3821 行,并完全重构为 14 个高内聚模块,消除了编辑器加载卡顿。在冷启动与搜索性能上,开发团队通过延迟引入 OpenAI 依赖包与优化高频函数调用,将 Termux 终端 cold-start 时间压缩至 0.8 秒, hermes --version 速度提升 63% 至 258 毫秒。重组后的会话搜索工具 session_search 摒弃了大模型调用,改用免配置的本地过滤,让搜索耗时缩短至 20 毫秒,实现了 4500 倍的提速与完全零成本运行。

看板工具升级为完整的多智能体协作平台。开发者只需输入 hermes kanban swarm 即可一键初始化包含协调者、并行工作者、独立校验与合成节点的 Swarm 工作流,并新增了单任务模型覆盖与定时启动支持。安全防御方面,新版本引入了针对 Brainworm 攻击的主动威胁防御,在工具输出、召回记忆与外部技能加载等三个关键卡口实施流量过滤与边界标记,防止智能体被恶意文件或网络服务夺取控制权。

生态系统与第三方集成也迎来深度升级。系统支持基于 Bitwarden 统一托管所有云端 API 密钥,上线了可单命令加载多技能的工具包,并新增了 Nous 官方 MCP 服务目录交互式安装面板。 xAI 生态整合新增了 xAI Web Search 网络搜索插件,在 hermes proxy 代理中打通了 Grok 专属执行引导,且 hermes doctor 诊断流程能对已线模型自动预警,支持一键热迁移。为了修复版本首发时的阻碍级故障,官方在数小时内紧急推出了 v0.15.1 补丁版本,彻底消除了面板在 loopback 模式下面临的 401 无限重载循环,同时修复了 Docker 容器内 npx 等裸命令路径解析失效、 Kanban 工作线程在 SIGTERM 信号下无法被正常终止等缺陷。

信源:https://github.com/NousResearch/hermes-agent/releases/tag/v2026.5.28
1
ChatGPT市占率降至六成,消费级AI步入三足鼎立时代

SimilarWeb 最新流量数据显示,消费级 AI 市场已正式告别 ChatGPT 的「一马当先」格局,步入由 OpenAI、Google 与 Anthropic 主导的三足鼎立时代。过去半年中,ChatGPT 的全球用户流量份额从 80% 大幅滑落至 60%。同时,Gemini 独立访客流量相对 ChatGPT 翻倍,比例从 20% 攀升至 50%,Claude 的相对比例则从 3% 激增至 20%。

在全球前 100 大网站中,Claude 上季度以 255% 的环比增速(升至全球第 36 位)成为增长最快的网站,而 DeepSeek 则以 105% 的增速位居第 78 位。结合官方活跃用户数据(ChatGPT 周活跃 900M,Gemini 月活跃 900M)换算表明,ChatGPT 网页与移动端周活跃(WAU)约 900M、月活跃(MAU)达 1.5B,Gemini 维持约 500M WAU 与 900M MAU,Claude 约 150M 至 200M WAU,以及 250M 至 300M MAU。

地缘分布显示,Gemini 在非英语地区的流量已追赶至 ChatGPT 的 65% 至 70%,包括印度、巴西、日本、印尼、韩国与越南,而 Claude 在中国市场录得了非常亮眼的增长。

信源:https://x.com/deedydas/status/2060013445291094348
开源神作遭大厂「官方收割」?王牌插件OMO贴脸炮轰Anthropic、FactoryAI像素级抄袭其Agent编排架构

在 Anthropic 随 Opus 4.8 推出 Claude Code 动态工作流与 ultracode 模式仅数小时后,开源框架 OMO 团队在 X 上发起猛烈攻势,公开指责 Anthropic 像素级抄袭了其多模型编排架构。

OMO 作为 16.7 万星开源终端 Agent 项目 OpenCode 官方认定的 No.1 插件,由 23 岁韩国黑客 Q 开发,并由运营团队 Sisyphus Labs 宣发,目前已斩获 6 万星,在开发者社区极具声量。

这场风波直接撕开了大厂「先封杀、后吸收」的掠夺路径。今年 1 月,Q 在 OMO 中推出了用于多模型动态编排的 ultrawork 工作流以及负责合并审查的协调大脑 atlas。由于这套编排机制在运行多智能体递归循环时会吞噬天量 Token,被 OpenCode 联合创始人 Dax Raad 吐槽为「Token 燃烧器」,高能耗调用直接促使 Anthropic 在 4 月份痛下杀手,强行封禁了第三方客户端使用订阅额度的通道。

仅仅三个月后,Anthropic 官方就将这套已被开源验证的动态编排逻辑收编,化身为自家 Claude Code 的闭源收费主打功能。

除了死磕 Anthropic,OMO 团队与 FactoryAI 在今年 2 月也存在旧怨。FactoryAI 此前高调宣传的 Missions 多天自主任务流,被指直接搬运了 OMO 的三层 Agent 架构:OMO 的规划器 Prometheus 变成了 Factory 的计划审批流,协调大脑 Atlas 被改名包装为 orchestrator Droid,执行器 Sisyphus Junior 变成了 Worker Droid,甚至连原装的技能过滤机制都被简化挪用。

面对 OMO 团队晒出的历史开发记录,以及要求大厂公开致谢并承认原创贡献的喊话,两家大厂至今装聋作哑。开源团队则继续在推特上进行多维度反击。

一方面,Sisyphus Labs 强调 OMO 框架是完全模型无关的,用户不需要高昂的官方配额,用本地或便宜的 GPT、Gemini 甚至 Kimi 模型同样能跑起 ultrawork 工作流,并透露正在开发基于 GPT-5.5 的 Codex 适配版本。

另一方面,Q 亲身试用后对新模型打出了毒舌评价,认为新模型不过是一款不错的 GPT-5.5 中量级模型。此外,Q 还反手给出了一个幽默的嘲讽:他直接用 Anthropic 的官方新工具,命令它把 OMO 原创的编排逻辑重写一遍,做成一个可以反向挂载到 Claude Code 上的兼容插件。Q 调侃道,这就当是帮大厂做个兼容实验,毕竟开源团队的创意被直接拿走,大家早都习以为常了。

信源:https://x.com/q_yeon_gyu_kim/status/2060215394334552103
伊利诺伊州通过监管法案,美AI监管陷联邦与地方对立博弈

伊利诺伊州众议院通过一项地方法案,要求头部 AI 企业提交模型安全计划以接受第三方审计并设立举报人保护。伊利诺伊州也成为继加利福尼亚州和纽约州后,又一出台 AI 安全法案的地区。联邦层面的监管政策则呈现相反方向。总统特朗普曾表达阻止州级 AI 监管的意图,坚称预审等限制会削弱美国对华竞争优势。

特朗普无限期推迟签署大模型审查行政命令,并在签字前数小时全盘撤回安全审查草案。白宫原本起草的行政令草案要求开发商在公开发布前,提前最多 90 天向政府共享模型。为了防止各州立法形成阻碍,白宫于 5 月 26 日任命前司法部长帕姆·邦迪 Pam Bondi 加入科技顾问委员会 PCAST,意图利用司法起诉手段阻击与联邦冲突的地方法规。

虽然进步商会等行业团体以审计体系尚不成熟为由对地方法案表示反对,计算机与通信工业协会 CCIA 也表示目前尚无独立审计的标准生态,但 OpenAI 与 Anthropic 均公开表达对伊利诺伊州审计法案的支持。

信源:https://x.com/OpenAINewsroom/status/2059833892316856598
产品线瘦身,OpenAI将从ChatGPT中退役经典推理模型OpenAI o3与GPT-4.5

OpenAI 在最新发布的 ChatGPT 更新日志(Release Notes)中宣布,为了进一步优化资源配置,将从 ChatGPT 网页及移动端界面中退役 OpenAI o3 与 GPT-4.5 两款模型。

此举旨在清理使用率较低 of the 旧款模型,从而将更多计算资源与工程力量集中在最新且更具实力的 GPT-5.5 旗舰系列(包括 GPT-5.5 Instant、GPT-5.5 Thinking 和 GPT-5.5 Pro)上。

具体退役日程表如下:
• GPT-4.5:进入为期 30 天的过渡期,定于 2026 年 6 月 27 日 正式下线;
• OpenAI o3:进入为期 90 天的过渡期,定于 2026 年 8 月 26 日 正式下线。

在各自的下线期限截止前,ChatGPT 付费用户仍可在模型设置中手动选择使用它们。此外,OpenAI 的 API 服务暂时不受此调整影响,开发者仍可通过 API 继续调用 OpenAI o3 和 GPT-4.5 模型。

信源:https://help.openai.com/en/articles/6825453-chatgpt-release-notes#retiring-openai-o3-and-gpt-45
回应额度消耗过快,谷歌Gemini推出免费使用Flash-Lite等六项优化

针对用户普遍反映的谷歌 Gemini App 使用限额消耗过快且缺乏预测性的问题,谷歌 Gemini 产品副总裁 Josh Woodward 宣布团队正在紧急上线六项额度优化措施。

具体调整包括:
1. 免费使用 Flash-Lite:用户向轻量级模型 Flash-Lite 发送的所有提示词将完全免费,不再扣除任何日常使用限额。
2. 修复视频扣额并翻倍:修复了在多模态视频场景下仅生成一两个视频便耗尽额度的 Bug,并将 Gemini Ultra 订阅用户的 Omni 视频生成限额即刻提升至双倍。
3. 复杂 Pro 提示词设限:针对携带庞大文件附件或超长提示词的单个 Pro 模型请求设立扣除上限,确保用户获取更连贯的调用次数。
4. 错误与失败请求免扣额:多模态交互过程中的网络延迟与系统错误均不再计费,用户仅需为顺利返回的成功结果支付限额。
5. 重度任务用量透明化:对于消耗庞大算力的 Deep Research 等重度任务,正在设计更详尽的用量仪表盘与限额透支预警,以便提升高负载操作的可控性。
6. 自动记忆模型选择:系统将自动锁定并记忆用户手动选定的具体模型,除非遭遇限额限制触发自动降级或手动调整,否则不会在后续会话中强制切换至轻量版本。

信源:https://x.com/joshwoodward/status/2060171610922058142
QQ浏览器接入元宝助手,底层大模型升级至混元3预览版

腾讯宣布QQ浏览器全面接入AI助手「元宝」(Mac版本现已更新,其他版本陆续推出)。与以往需要单独寻找侧边栏或浮窗入口不同,本次更新将元宝深度嵌入到了浏览器的侧边栏、搜索栏与地址栏中。

本次更新的主要变化包括:
1. 随时唤起与搜索直达:在浏览网页、阅读文件或查阅英文资料时,可随时唤起元宝进行提问、总结、对话或划词翻译。用户在地址栏或搜索栏输入常规词后,搜索结果首条会直接呈现由元宝整理的结构化答案,并支持追问。
2. 跨网页与文件联合问答:支持导入多个网页或文件。用户点击「+网页/文件」即可将不同来源的内容导入,由元宝进行跨内容的综合对比、分析与信息提炼。
3. 新增写作与生图功能:集成了元宝的AI功能,支持从零撰写、仿写、续写或润色文案,并可根据描述生成配图;学习模块则支持拍照搜题并整理为电子错题本。
4. 底层模型升级:浏览器底层大模型同步升级为混元3预览版(Hy3 preview),官方问答准确率从91%提升至94%,并优化了长篇解答的逻辑和易读性。原有网页总结、思维导图与阅读模式等高频功能的回答完整度也有所提升。

信源:https://mp.weixin.qq.com/s/ozQqAYFPMwmIFY3lrbo33g
阿里T2I评测Qwen-Image-Bench开源,GPT Image 2夺冠且五项全能

阿里巴巴 Qwen 团队宣布开源全新的绘图评测基准 Qwen-Image-Bench,专门用于评估大模型从文本生成图像(简称 T2I,即输入文字自动画图)的能力。同步推出的还有基于 Qwen3.6-27B 深度训练的统一视觉裁判模型 Q-Judger。评测基准模拟专业艺术创作工作流,包含画质、美学、文字与画面对齐以及新增的真实世界保真度与创意生成 5 大维度,下设 23 个子能力与 56 个细分指标。

Qwen-Image-Bench 包含 1000 个中英双语分层提示词,长短描述各占 500 个,平均同时考核 4 个以上维度。虽然评估的范围和角度极广,但最终所有维度的图像打分均由视觉裁判模型 Q-Judger 自动判别完成。为了训练裁判模型,研发团队邀请了来自艺术院校的 80 名专业评审,在盲审与三审制度下标注了超 13 万个双语数据对,使模型输出的 56 个维度得分与人类专家打分的吻合度高达 92%。

首批 18 个主流图像生成模型评估结果显示,GPT Image 2 以 64.69 的综合得分夺魁,并在所有 5 大维度上均列第一。Nano Banana 2.0 得分为 59.82,GPT Image 1.5 得分为 59.65,Nano Banana Pro 得分为 59.45,分列二三四名,阿里自研的 Qwen Image 2.0 Pro 以 57.84 排名第五,GLM Image 则以 48.19 垫底。数据表明,真实世界保真度与创意生成是拉开模型梯队的关键指标。评测还揭示了当前行业共同的技术瓶颈,在画人手骨骼、表现重力和光影等物理规律、以及处理物体间穿模等细节上,AI 绘画模型普遍容易出错,顶尖模型在这些维度的得分也均低于 44 分。

信源:https://arxiv.org/abs/2605.28091
智谱AI拟进军「AI早教机」:自研硬件拿牌照、合作早教代工厂

一向主攻底层大模型和 B 端服务的智谱 AI 正在秘密自研多款消费级硬件,内部型号包括 ZAI-P1、ZAI-M2、ZAI-N1 等。其中,型号为 ZAI-P1 的设备已于 2026 年 2 月悄然拿到了工信部颁发的电信设备进网试用证,申请和生产单位都是智谱的全资子公司成都智谱华章。这意味着该设备已经拿到了接入国内公用电信网的「准生证」,具备了合法使用 4G 蜂窝通信功能的资格,这也是产品在国内公开销售的前提条件。

不过,拿到试用证并不等同于马上能买到。按照国内电信设备的上市流程,试用证只说明产品的通信性能检测达标,后续还要经过试运行核验,才能申请正式的进网许可证,因此距离真正的量产上市还有一段时间。更有意思的是,这款设备的代工厂是深圳市拓步教育电子多媒体有限公司。这家代工厂的主业是开发和销售 0-6 岁儿童智能早教产品,主力产品包括电子学习机、学生平板电脑、故事机、移动家教机和智能手表等。

从合作代工厂的背景来看,智谱 AI 的第一款物理硬件大概率会避开竞争惨烈的智能手机和 AI 硬件大单品,转而切入早教或儿童教育这一垂直赛道,推出「AI 早教机」或「AI 学习平板」等终端产品。这也标志着智谱 AI 正式吹响了进军消费级硬件的号角,尝试把自家的大模型从云端服务直接「装进」实体硬件中。

信源:https://mp.weixin.qq.com/s/m06yIsnYFaGyx6MNlrnk2Q
传字节Seed AI4S团队考虑独立分拆,核心成员肖文之与顾全全出走创办AI制药公司

字节跳动旗下 AI 研发部门 Seed 的 AI for Science(简称 AI4S)团队正在讨论新一轮组织调整,甚至考虑从字节分拆。目前讨论的一个方案是, AI4S 团队从机器学习系统团队( AML )负责人项亮体系转至杨震原麾下,但方案仍在讨论,接近字节人士透露杨震原对划转安排并不积极。

自吴永辉接掌 Seed 以来, AI Lab 旗下的具身智能( Seed Robotics )、人工智能科学计算( AI4S )以及 Responsible AI 三大团队已陆续并入 Seed 。 AI4S 团队的汇报线经历多次变动。原属于 AML 的肖文之团队去年并入李航负责的 AI for Science 团队,肖文之由向项亮汇报转为向李航汇报。李航退休后,团队又重归项亮体系。

比组织架构变动更引人关注的是核心技术骨架的流失。担任 Seed 大模型预训练与扩展方向共同负责人的 UCLA 计算机科学副教授顾全全,以及主导 Protenix 项目的计算生物学负责人肖文之等多位核心成员已陆续离职创业。创业方向聚焦于 AI 制药、蛋白质设计及药物发现平台,并已获得头部美元机构的多轮加注。

团队最核心的成果是 AlphaFold 3 的开源复现工作 Protenix ,以及在蛋白 binder 设计上超越 AlphaProteo 的 PXDesign 。 PXDesign 在 6 个不同蛋白靶点中的 5 个上实现了 20% 到 73% 的纳摩尔级结合命中率。然而, AI 制药的逻辑与互联网业务不同,模型预测成果必须通过湿实验、动物实验、新药临床试验申请( IND )及商务拓展( BD )等多重验证,面临极长的反馈与变现链条,这也是倒逼科学家团队走向资产生成与独立创业的深层动因。

信源:https://mp.weixin.qq.com/s/aFz19pPkUqh5XeDoRpZJNw
All-In Podcast:AI军备竞赛陷入曼哈顿工程后遗症,美放弃大模型预审防止力量失衡

在科技与投资领域顶级播客 All-In Podcast 第 274 期中,嘉宾们将当前的 AI 竞争直接比作二战后的曼哈顿工程后遗症。在二战结束、苏联获得核机密后,核武器扩散便陷入了无法逆转的博弈论轨道。科学家群体当时出于防止单边霸权的担忧而泄露机密,促成了核大国之间通过核威慑达成力量平衡。当前的前沿 AI 研发正处于类似的扩散期。如果美国因为政府监管、税收限制或安全预审而强行放慢模型研发速度,非对称的力量均势就会被打破,别国将迅速反超,从而使全球陷入极度危险的失衡状态。

在当前的博弈论逻辑下,强行减速在工程与地缘上都不可行。大模型技术一旦开启扩散,就面临如同冷战后半叶氢弹军备竞赛般的死局,唯有达成对等的技术实力,才能促使双方坐回谈判桌。中美前沿大模型目前保持在 9 个月以内的微弱技术代差,反而在客观上成为了双方寻求缓和与避免修昔底德陷阱的底层动力。

一旦向政府让渡前沿技术的控制权,就会形成无法收回的单向集权陷阱,而利用传统司法体系和产品责任诉讼(如人身伤害或过失致死)进行事后追责,反而是比事前预审更弹性的技术约束机制。在大国博弈的决定论轨道下,维持绝对的研发速度与均势,是防止冲突、寻求技术丰饶的最优解。

信源:https://www.youtube.com/watch?v=HGbA6ze0_3M
无中心规划器协作,AI科学家系统AutoScientists开源

由哈佛医学院、Kempner 研究所、Broad 研究所等机构的高尚华 Shanghua Gao、Ada Fang 和 Marinka Zitnik 组成的联合团队,开源了科学发现智能体系统 AutoScientists。系统基于 AI 智能体社交协作平台 ClawInstitute,没有中央规划器或中央编排智能体,模拟真实人类科研的去中心化协作。

先前如 Autoresearch 等系统采用单线程爬山式搜索,只有改动能立竿见影提升效果时才予保留,容易在几轮后陷入瓶颈。AutoScientists 则引入去中心化论坛机制,多个由 Claude Code 封装的子智能体在实际消耗算力前,会通过发帖互相撰写审稿意见,避免重复测试失败路径。多个智能体还能自发围绕有潜力的方向组建课题组进行多路探索,解决单兵搜索的盲目性。在语言模型 GPT nanochat 训练优化中,系统实现 1.9 倍的实验速度提升;即使从单兵系统无法进一步优化的强起点开始测试,AutoScientists 依然完成了 7 次改进,而先前基线的改进数为 0。

在涵盖医学成像、药物研发、蛋白质工程和单细胞组学的生物医药大模型基准 BioML-Bench 测试中,系统在 24 项任务中取得了 74.4% 的平均 Leaderboard 百分位数,比先前最强智能体记录提高 8.3 个百分点。在 ACE2-Spike 蛋白结合预测上,系统发现的 Kermut 扩展方法将 Spearman 相关系数提升 12.5%。相同方法在不作修改的情况下迁移到全部 217 个 ProteinGym 评估后,将官方平均 Spearman 相关系数从 0.657 提升至 0.700,升幅为 6.5%,超过先前 ProteinGym 监督基准的整体最好成绩。

信源:https://arxiv.org/abs/2605.28655
🎉1
小米开源视频配音模型ControlFoley,声音想怎么配由你决定

小米大模型应用团队发布并开源视频音效生成框架 ControlFoley。以往 AI 视频配音主要由模型根据画面推测声音,创作者很难精确控制声音风格。ControlFoley 的重点是「可控性」:它既能根据画面配音,也能接受文字描述或参考音频,让声音按创作者意图生成。比如把敲门声改成「金属敲击声」,或用打鼓音色去匹配网球击打动作,模型都能在保持音画同步的同时贴合指定风格。底层上,ControlFoley 采用基于 CAV-MAE 改造的时空音视频编码器,并引入「时间-音色解耦」策略,把声音发生时间交给视频,把音色风格交给参考音频。

在论文设定的多任务评估中,ControlFoley 在多个常规视频配音测试上达到开源 SOTA 水平。即使文字指令与画面内容发生强冲突,模型仍能兼顾文本遵循和时间同步。相比商业闭源系统 Kling-Foley,ControlFoley 在语义对齐、同步和感知质量等多项指标上有竞争力;但在 Kling-Audio-Eval 和 MovieGen-Audio-Bench 的部分 KL 散度匹配指标上仍有差距。目前,项目的技术报告、代码、模型权重和 Demo 均已开放。

信源:https://arxiv.org/abs/2604.15086
腾讯开源网页视觉差异基准DiffSpot,最强模型漏判六成微小CSS改动

腾讯在 Hugging Face 放出网页视觉差异基准 DiffSpot,用来测试多模态大模型能不能发现网页界面里的细小变化。它不是让模型对比两张明显不同的图片,而是在 HTML 页面里只改一个目标元素的 CSS 属性,再让模型判断哪里变了。

DiffSpot 共包含 4400 对网页截图,其中 3900 对存在真实变化,覆盖 13 类 CSS 修改和 3 档难度;另有 500 对完全相同的截图,用来测试模型会不会无中生有。数据集只保留像素变化落在目标元素内部的样本,以减少标注噪声。

结果并不好看。13 款前沿 VLM 零样本测试中,表现最好的 Gemini 3.1 Pro 综合准确率只有 47.2%,对真实变化的召回率为 40.7%,约六成变化被漏掉。困难档任务里,所有模型召回率都低于 23%。

开源模型里,Kimi K2.5 综合准确率 42.2%,高于 GPT-5.4 的 38.3% 和 Claude Opus 4.7 的 38.9%。Qwen3.5-VL-397B 以 37.6% 位列开源第二。

DiffSpot 还发现,网页差异并不一定「越明显越容易被看见」。在不同 CSS 属性下,像素变化量和 CLIP 特征距离都不能稳定预测模型召回率。换句话说,模型漏判不只是因为变化太小,也和它是否真正理解网页元素、样式属性和局部视觉变化有关。

部分模型则走向另一种极端:为了避免误报,直接变得过度保守。Qwen3-VL-235B-Instruct 在 500 组无变化样本中没有出现误报,但真实变化召回率只有 5.1%,说明它更倾向于判定「没有变化」,而不是主动寻找细微差异。

信源:https://huggingface.co/datasets/tencent/DiffSpot
MiniMax启动A股IPO:港股大模型双雄有望会师

中国大模型独角兽正加速走向二级市场。据中国证监会官网披露,大模型企业 MiniMax 已于 2026 年 5 月 29 日同中信证券签署上市辅导协议,正式启动 A 股 IPO 进程。这标志着 MiniMax 与另一家大模型独角兽智谱 AI 有望在 A 股会师。智谱 AI 已于今年 2 月同国泰海通和中金公司签署辅导协议,共同参与科创板上市的辅导工作。

在业务快速增长的推动下,MiniMax 披露了最新数据。截至目前,服务全球企业和开发者客户数已超过 100 万,相比半年前增长了 5 倍,全球用户规模达 3 亿。最近两个月里,年化经常性收入实现超 100% 的增长。根据 2025 年财报,总收入达到 7903.8 万美元,同比增长 158.9%,其中超过 70% 的收入源于国际市场。毛利润为 2007.9 万美元,同比大幅增长 437.2%,毛利率上升 13.2 个百分点至 25.4%。全年经调整净亏损为 2.5 亿美元,亏损率同比显著收窄。

公司战略方向上,创始人兼首席执行官闫俊杰在 5 月 28 日出席国新办「十五五民企勇担当」记者交流会时指出,人工智能正加速与半导体芯片、软件及云平台等产业链环节紧密结合,且技术正从简单应用转向与实体产业深度渗透。闫俊杰表示,未来 3 年的技术进步将延续过去 3 年的高速态势,需要通过开放与普惠让成本更低,以造福大众。在 2026 年,团队计划从单一的大模型研发商向平台型公司转型,深化全球商业化布局,并持续提高基础设施的 token 吞吐和可扩展基建能力。

信源:http://eid.csrc.gov.cn/mnt/storage/stock/pre_ipo/2026/5/30/PREIPO_F0101_V01_20260530_35176_Q/85E1FFB38FDA4B0B961DB586D4AB30C7/%E5%85%B3%E4%BA%8EMiniMax%20Group%20Inc.%E9%A6%96%E6%AC%A1%E5%85%AC%E5%BC%80%E5%8F%91%E8%A1%8C%E8%82%A1%E7%A5%A8%E5%B9%B6%E4%B8%8A%E5%B8%82%E8%BE%85%E5%AF%BC%E5%A4%87%E6%A1%88%E6%8A%A5%E5%91%8A.pdf
OpenAI启动生物防御计划:资助GPT-Rosalind前沿模型访问,加速疫苗与筛查研发

为了防范合成与天然生物威胁,OpenAI 于 2026 年 5 月 29 日宣布推出 Rosalind 生物防御计划,旨在为通过审核的开发者与政府合作伙伴提供 GPT-Rosalind 前沿推理模型访问。GPT-Rosalind 命名自英国化学家 Rosalind Franklin,专注于生命科学领域。考虑到模型在分子生物、基因工程和疾病传播推理上的强大能力,为了防止生物安全风险和技术滥用,OpenAI 实施了严格的访问授权限制。

整个计划设立了两个方向。开发者方向主要面向非营利组织、学术机构和中小型团队,项目涵盖流行病学建模、早期病原体检测、基因筛查与非药物干预措施开发。政府方向面向美国政府和盟国合作伙伴,支持疫情暴发应急响应规划、医疗对策制定以及早期预警系统构建等高影响力工作。为了降低技术开发门槛,OpenAI 将直接资助模型的运行费用。

首批合作伙伴已涵盖多家顶尖科研机构与行业联盟。劳伦斯利弗莫尔国家实验室正通过模型评估医疗防御对策。约翰斯霍普金斯大学应用物理实验室则将模型整合至蛋白质工程平台,用于筛选治疗药物。流行病防范创新联盟也已引入模型以加速疫苗研发的 100 天任务。在应用安全侧,SecureDNA 与 Fourth Eon 等团队则将模型引入了 DNA 筛查与生物安全防线建设。

信源:https://openai.com/index/strengthening-societal-resilience-with-rosalind-biodefense/
Codex App在Windows端上线计算机控制与跨设备远控功能

OpenAI 旗下 Agent 工具 Codex App 在 Windows 环境下正式解锁了计算机使用(Computer Use)能力,能够通过屏幕视觉、鼠标点击与键盘输入,直接物理操控 Windows 桌面应用程序,用于编写代码并执行调试。

为了配合跨平台协作,系统上线了跨设备远程控制(Remote Control)功能。开发者能够直接在 Mac 电脑或手机的 ChatGPT 界面下向 Windows 运行设备派发任务,并实时查看执行进度。

此外,全新的 Profile 面板整合了 Token 消耗的实时审计图表与用量自限机制,帮助用户直观掌握调用频次并防止超支。

信源:https://developers.openai.com/codex/changelog
ChatGPT上线对话目录导航功能:满5次回复自动生成,解决长会话翻阅难题

为了解决长对话翻阅与定位的难题,ChatGPT 正式上线了对话目录导航功能。在对话回复数达到 5 次及以上的聊天中,系统会自动提炼并生成章节导航目录,帮助用户快速跳转至不同讨论主题。

在网页端交互上,生成的章节目录主要悬浮于浏览器滚动条侧边。用户除了直接点击目录跳转外,还可以使用 Shift 键配合上下方向键,在不同段落主题间实现快速跳转。目录导航机制能够将原本零散的多轮问答自动整理为结构化项目,降低了信息回溯与知识管理的成本。

信源:https://x.com/ChatGPTapp/status/2060467129066070182