产品线瘦身,OpenAI将从ChatGPT中退役经典推理模型OpenAI o3与GPT-4.5
OpenAI 在最新发布的 ChatGPT 更新日志(Release Notes)中宣布,为了进一步优化资源配置,将从 ChatGPT 网页及移动端界面中退役 OpenAI o3 与 GPT-4.5 两款模型。
此举旨在清理使用率较低 of the 旧款模型,从而将更多计算资源与工程力量集中在最新且更具实力的 GPT-5.5 旗舰系列(包括 GPT-5.5 Instant、GPT-5.5 Thinking 和 GPT-5.5 Pro)上。
具体退役日程表如下:
• GPT-4.5:进入为期 30 天的过渡期,定于 2026 年 6 月 27 日 正式下线;
• OpenAI o3:进入为期 90 天的过渡期,定于 2026 年 8 月 26 日 正式下线。
在各自的下线期限截止前,ChatGPT 付费用户仍可在模型设置中手动选择使用它们。此外,OpenAI 的 API 服务暂时不受此调整影响,开发者仍可通过 API 继续调用 OpenAI o3 和 GPT-4.5 模型。
信源:https://help.openai.com/en/articles/6825453-chatgpt-release-notes#retiring-openai-o3-and-gpt-45
OpenAI 在最新发布的 ChatGPT 更新日志(Release Notes)中宣布,为了进一步优化资源配置,将从 ChatGPT 网页及移动端界面中退役 OpenAI o3 与 GPT-4.5 两款模型。
此举旨在清理使用率较低 of the 旧款模型,从而将更多计算资源与工程力量集中在最新且更具实力的 GPT-5.5 旗舰系列(包括 GPT-5.5 Instant、GPT-5.5 Thinking 和 GPT-5.5 Pro)上。
具体退役日程表如下:
• GPT-4.5:进入为期 30 天的过渡期,定于 2026 年 6 月 27 日 正式下线;
• OpenAI o3:进入为期 90 天的过渡期,定于 2026 年 8 月 26 日 正式下线。
在各自的下线期限截止前,ChatGPT 付费用户仍可在模型设置中手动选择使用它们。此外,OpenAI 的 API 服务暂时不受此调整影响,开发者仍可通过 API 继续调用 OpenAI o3 和 GPT-4.5 模型。
信源:https://help.openai.com/en/articles/6825453-chatgpt-release-notes#retiring-openai-o3-and-gpt-45
回应额度消耗过快,谷歌Gemini推出免费使用Flash-Lite等六项优化
针对用户普遍反映的谷歌 Gemini App 使用限额消耗过快且缺乏预测性的问题,谷歌 Gemini 产品副总裁 Josh Woodward 宣布团队正在紧急上线六项额度优化措施。
具体调整包括:
1. 免费使用 Flash-Lite:用户向轻量级模型 Flash-Lite 发送的所有提示词将完全免费,不再扣除任何日常使用限额。
2. 修复视频扣额并翻倍:修复了在多模态视频场景下仅生成一两个视频便耗尽额度的 Bug,并将 Gemini Ultra 订阅用户的 Omni 视频生成限额即刻提升至双倍。
3. 复杂 Pro 提示词设限:针对携带庞大文件附件或超长提示词的单个 Pro 模型请求设立扣除上限,确保用户获取更连贯的调用次数。
4. 错误与失败请求免扣额:多模态交互过程中的网络延迟与系统错误均不再计费,用户仅需为顺利返回的成功结果支付限额。
5. 重度任务用量透明化:对于消耗庞大算力的 Deep Research 等重度任务,正在设计更详尽的用量仪表盘与限额透支预警,以便提升高负载操作的可控性。
6. 自动记忆模型选择:系统将自动锁定并记忆用户手动选定的具体模型,除非遭遇限额限制触发自动降级或手动调整,否则不会在后续会话中强制切换至轻量版本。
信源:https://x.com/joshwoodward/status/2060171610922058142
针对用户普遍反映的谷歌 Gemini App 使用限额消耗过快且缺乏预测性的问题,谷歌 Gemini 产品副总裁 Josh Woodward 宣布团队正在紧急上线六项额度优化措施。
具体调整包括:
1. 免费使用 Flash-Lite:用户向轻量级模型 Flash-Lite 发送的所有提示词将完全免费,不再扣除任何日常使用限额。
2. 修复视频扣额并翻倍:修复了在多模态视频场景下仅生成一两个视频便耗尽额度的 Bug,并将 Gemini Ultra 订阅用户的 Omni 视频生成限额即刻提升至双倍。
3. 复杂 Pro 提示词设限:针对携带庞大文件附件或超长提示词的单个 Pro 模型请求设立扣除上限,确保用户获取更连贯的调用次数。
4. 错误与失败请求免扣额:多模态交互过程中的网络延迟与系统错误均不再计费,用户仅需为顺利返回的成功结果支付限额。
5. 重度任务用量透明化:对于消耗庞大算力的 Deep Research 等重度任务,正在设计更详尽的用量仪表盘与限额透支预警,以便提升高负载操作的可控性。
6. 自动记忆模型选择:系统将自动锁定并记忆用户手动选定的具体模型,除非遭遇限额限制触发自动降级或手动调整,否则不会在后续会话中强制切换至轻量版本。
信源:https://x.com/joshwoodward/status/2060171610922058142
X (formerly Twitter)
Josh Woodward (@joshwoodward) on X
We’ve heard your feedback about hitting limits too quickly on @GeminiApp. We're rolling out several fixes to make your quota stretch further and feel more predictable… 🧵
QQ浏览器接入元宝助手,底层大模型升级至混元3预览版
腾讯宣布QQ浏览器全面接入AI助手「元宝」(Mac版本现已更新,其他版本陆续推出)。与以往需要单独寻找侧边栏或浮窗入口不同,本次更新将元宝深度嵌入到了浏览器的侧边栏、搜索栏与地址栏中。
本次更新的主要变化包括:
1. 随时唤起与搜索直达:在浏览网页、阅读文件或查阅英文资料时,可随时唤起元宝进行提问、总结、对话或划词翻译。用户在地址栏或搜索栏输入常规词后,搜索结果首条会直接呈现由元宝整理的结构化答案,并支持追问。
2. 跨网页与文件联合问答:支持导入多个网页或文件。用户点击「+网页/文件」即可将不同来源的内容导入,由元宝进行跨内容的综合对比、分析与信息提炼。
3. 新增写作与生图功能:集成了元宝的AI功能,支持从零撰写、仿写、续写或润色文案,并可根据描述生成配图;学习模块则支持拍照搜题并整理为电子错题本。
4. 底层模型升级:浏览器底层大模型同步升级为混元3预览版(Hy3 preview),官方问答准确率从91%提升至94%,并优化了长篇解答的逻辑和易读性。原有网页总结、思维导图与阅读模式等高频功能的回答完整度也有所提升。
信源:https://mp.weixin.qq.com/s/ozQqAYFPMwmIFY3lrbo33g
腾讯宣布QQ浏览器全面接入AI助手「元宝」(Mac版本现已更新,其他版本陆续推出)。与以往需要单独寻找侧边栏或浮窗入口不同,本次更新将元宝深度嵌入到了浏览器的侧边栏、搜索栏与地址栏中。
本次更新的主要变化包括:
1. 随时唤起与搜索直达:在浏览网页、阅读文件或查阅英文资料时,可随时唤起元宝进行提问、总结、对话或划词翻译。用户在地址栏或搜索栏输入常规词后,搜索结果首条会直接呈现由元宝整理的结构化答案,并支持追问。
2. 跨网页与文件联合问答:支持导入多个网页或文件。用户点击「+网页/文件」即可将不同来源的内容导入,由元宝进行跨内容的综合对比、分析与信息提炼。
3. 新增写作与生图功能:集成了元宝的AI功能,支持从零撰写、仿写、续写或润色文案,并可根据描述生成配图;学习模块则支持拍照搜题并整理为电子错题本。
4. 底层模型升级:浏览器底层大模型同步升级为混元3预览版(Hy3 preview),官方问答准确率从91%提升至94%,并优化了长篇解答的逻辑和易读性。原有网页总结、思维导图与阅读模式等高频功能的回答完整度也有所提升。
信源:https://mp.weixin.qq.com/s/ozQqAYFPMwmIFY3lrbo33g
阿里T2I评测Qwen-Image-Bench开源,GPT Image 2夺冠且五项全能
阿里巴巴 Qwen 团队宣布开源全新的绘图评测基准 Qwen-Image-Bench,专门用于评估大模型从文本生成图像(简称 T2I,即输入文字自动画图)的能力。同步推出的还有基于 Qwen3.6-27B 深度训练的统一视觉裁判模型 Q-Judger。评测基准模拟专业艺术创作工作流,包含画质、美学、文字与画面对齐以及新增的真实世界保真度与创意生成 5 大维度,下设 23 个子能力与 56 个细分指标。
Qwen-Image-Bench 包含 1000 个中英双语分层提示词,长短描述各占 500 个,平均同时考核 4 个以上维度。虽然评估的范围和角度极广,但最终所有维度的图像打分均由视觉裁判模型 Q-Judger 自动判别完成。为了训练裁判模型,研发团队邀请了来自艺术院校的 80 名专业评审,在盲审与三审制度下标注了超 13 万个双语数据对,使模型输出的 56 个维度得分与人类专家打分的吻合度高达 92%。
首批 18 个主流图像生成模型评估结果显示,GPT Image 2 以 64.69 的综合得分夺魁,并在所有 5 大维度上均列第一。Nano Banana 2.0 得分为 59.82,GPT Image 1.5 得分为 59.65,Nano Banana Pro 得分为 59.45,分列二三四名,阿里自研的 Qwen Image 2.0 Pro 以 57.84 排名第五,GLM Image 则以 48.19 垫底。数据表明,真实世界保真度与创意生成是拉开模型梯队的关键指标。评测还揭示了当前行业共同的技术瓶颈,在画人手骨骼、表现重力和光影等物理规律、以及处理物体间穿模等细节上,AI 绘画模型普遍容易出错,顶尖模型在这些维度的得分也均低于 44 分。
信源:https://arxiv.org/abs/2605.28091
阿里巴巴 Qwen 团队宣布开源全新的绘图评测基准 Qwen-Image-Bench,专门用于评估大模型从文本生成图像(简称 T2I,即输入文字自动画图)的能力。同步推出的还有基于 Qwen3.6-27B 深度训练的统一视觉裁判模型 Q-Judger。评测基准模拟专业艺术创作工作流,包含画质、美学、文字与画面对齐以及新增的真实世界保真度与创意生成 5 大维度,下设 23 个子能力与 56 个细分指标。
Qwen-Image-Bench 包含 1000 个中英双语分层提示词,长短描述各占 500 个,平均同时考核 4 个以上维度。虽然评估的范围和角度极广,但最终所有维度的图像打分均由视觉裁判模型 Q-Judger 自动判别完成。为了训练裁判模型,研发团队邀请了来自艺术院校的 80 名专业评审,在盲审与三审制度下标注了超 13 万个双语数据对,使模型输出的 56 个维度得分与人类专家打分的吻合度高达 92%。
首批 18 个主流图像生成模型评估结果显示,GPT Image 2 以 64.69 的综合得分夺魁,并在所有 5 大维度上均列第一。Nano Banana 2.0 得分为 59.82,GPT Image 1.5 得分为 59.65,Nano Banana Pro 得分为 59.45,分列二三四名,阿里自研的 Qwen Image 2.0 Pro 以 57.84 排名第五,GLM Image 则以 48.19 垫底。数据表明,真实世界保真度与创意生成是拉开模型梯队的关键指标。评测还揭示了当前行业共同的技术瓶颈,在画人手骨骼、表现重力和光影等物理规律、以及处理物体间穿模等细节上,AI 绘画模型普遍容易出错,顶尖模型在这些维度的得分也均低于 44 分。
信源:https://arxiv.org/abs/2605.28091
arXiv.org
Qwen-Image-Bench: From Generation to Creation in Text-to-Image Evaluation
Text-to-Image generation has evolved from basic image synthesis into a frequently used core capability in professional creative workflows, where simple text-image alignment can no longer satisfy...
智谱AI拟进军「AI早教机」:自研硬件拿牌照、合作早教代工厂
一向主攻底层大模型和 B 端服务的智谱 AI 正在秘密自研多款消费级硬件,内部型号包括 ZAI-P1、ZAI-M2、ZAI-N1 等。其中,型号为 ZAI-P1 的设备已于 2026 年 2 月悄然拿到了工信部颁发的电信设备进网试用证,申请和生产单位都是智谱的全资子公司成都智谱华章。这意味着该设备已经拿到了接入国内公用电信网的「准生证」,具备了合法使用 4G 蜂窝通信功能的资格,这也是产品在国内公开销售的前提条件。
不过,拿到试用证并不等同于马上能买到。按照国内电信设备的上市流程,试用证只说明产品的通信性能检测达标,后续还要经过试运行核验,才能申请正式的进网许可证,因此距离真正的量产上市还有一段时间。更有意思的是,这款设备的代工厂是深圳市拓步教育电子多媒体有限公司。这家代工厂的主业是开发和销售 0-6 岁儿童智能早教产品,主力产品包括电子学习机、学生平板电脑、故事机、移动家教机和智能手表等。
从合作代工厂的背景来看,智谱 AI 的第一款物理硬件大概率会避开竞争惨烈的智能手机和 AI 硬件大单品,转而切入早教或儿童教育这一垂直赛道,推出「AI 早教机」或「AI 学习平板」等终端产品。这也标志着智谱 AI 正式吹响了进军消费级硬件的号角,尝试把自家的大模型从云端服务直接「装进」实体硬件中。
信源:https://mp.weixin.qq.com/s/m06yIsnYFaGyx6MNlrnk2Q
一向主攻底层大模型和 B 端服务的智谱 AI 正在秘密自研多款消费级硬件,内部型号包括 ZAI-P1、ZAI-M2、ZAI-N1 等。其中,型号为 ZAI-P1 的设备已于 2026 年 2 月悄然拿到了工信部颁发的电信设备进网试用证,申请和生产单位都是智谱的全资子公司成都智谱华章。这意味着该设备已经拿到了接入国内公用电信网的「准生证」,具备了合法使用 4G 蜂窝通信功能的资格,这也是产品在国内公开销售的前提条件。
不过,拿到试用证并不等同于马上能买到。按照国内电信设备的上市流程,试用证只说明产品的通信性能检测达标,后续还要经过试运行核验,才能申请正式的进网许可证,因此距离真正的量产上市还有一段时间。更有意思的是,这款设备的代工厂是深圳市拓步教育电子多媒体有限公司。这家代工厂的主业是开发和销售 0-6 岁儿童智能早教产品,主力产品包括电子学习机、学生平板电脑、故事机、移动家教机和智能手表等。
从合作代工厂的背景来看,智谱 AI 的第一款物理硬件大概率会避开竞争惨烈的智能手机和 AI 硬件大单品,转而切入早教或儿童教育这一垂直赛道,推出「AI 早教机」或「AI 学习平板」等终端产品。这也标志着智谱 AI 正式吹响了进军消费级硬件的号角,尝试把自家的大模型从云端服务直接「装进」实体硬件中。
信源:https://mp.weixin.qq.com/s/m06yIsnYFaGyx6MNlrnk2Q
传字节Seed AI4S团队考虑独立分拆,核心成员肖文之与顾全全出走创办AI制药公司
字节跳动旗下 AI 研发部门 Seed 的 AI for Science(简称 AI4S)团队正在讨论新一轮组织调整,甚至考虑从字节分拆。目前讨论的一个方案是, AI4S 团队从机器学习系统团队( AML )负责人项亮体系转至杨震原麾下,但方案仍在讨论,接近字节人士透露杨震原对划转安排并不积极。
自吴永辉接掌 Seed 以来, AI Lab 旗下的具身智能( Seed Robotics )、人工智能科学计算( AI4S )以及 Responsible AI 三大团队已陆续并入 Seed 。 AI4S 团队的汇报线经历多次变动。原属于 AML 的肖文之团队去年并入李航负责的 AI for Science 团队,肖文之由向项亮汇报转为向李航汇报。李航退休后,团队又重归项亮体系。
比组织架构变动更引人关注的是核心技术骨架的流失。担任 Seed 大模型预训练与扩展方向共同负责人的 UCLA 计算机科学副教授顾全全,以及主导 Protenix 项目的计算生物学负责人肖文之等多位核心成员已陆续离职创业。创业方向聚焦于 AI 制药、蛋白质设计及药物发现平台,并已获得头部美元机构的多轮加注。
团队最核心的成果是 AlphaFold 3 的开源复现工作 Protenix ,以及在蛋白 binder 设计上超越 AlphaProteo 的 PXDesign 。 PXDesign 在 6 个不同蛋白靶点中的 5 个上实现了 20% 到 73% 的纳摩尔级结合命中率。然而, AI 制药的逻辑与互联网业务不同,模型预测成果必须通过湿实验、动物实验、新药临床试验申请( IND )及商务拓展( BD )等多重验证,面临极长的反馈与变现链条,这也是倒逼科学家团队走向资产生成与独立创业的深层动因。
信源:https://mp.weixin.qq.com/s/aFz19pPkUqh5XeDoRpZJNw
字节跳动旗下 AI 研发部门 Seed 的 AI for Science(简称 AI4S)团队正在讨论新一轮组织调整,甚至考虑从字节分拆。目前讨论的一个方案是, AI4S 团队从机器学习系统团队( AML )负责人项亮体系转至杨震原麾下,但方案仍在讨论,接近字节人士透露杨震原对划转安排并不积极。
自吴永辉接掌 Seed 以来, AI Lab 旗下的具身智能( Seed Robotics )、人工智能科学计算( AI4S )以及 Responsible AI 三大团队已陆续并入 Seed 。 AI4S 团队的汇报线经历多次变动。原属于 AML 的肖文之团队去年并入李航负责的 AI for Science 团队,肖文之由向项亮汇报转为向李航汇报。李航退休后,团队又重归项亮体系。
比组织架构变动更引人关注的是核心技术骨架的流失。担任 Seed 大模型预训练与扩展方向共同负责人的 UCLA 计算机科学副教授顾全全,以及主导 Protenix 项目的计算生物学负责人肖文之等多位核心成员已陆续离职创业。创业方向聚焦于 AI 制药、蛋白质设计及药物发现平台,并已获得头部美元机构的多轮加注。
团队最核心的成果是 AlphaFold 3 的开源复现工作 Protenix ,以及在蛋白 binder 设计上超越 AlphaProteo 的 PXDesign 。 PXDesign 在 6 个不同蛋白靶点中的 5 个上实现了 20% 到 73% 的纳摩尔级结合命中率。然而, AI 制药的逻辑与互联网业务不同,模型预测成果必须通过湿实验、动物实验、新药临床试验申请( IND )及商务拓展( BD )等多重验证,面临极长的反馈与变现链条,这也是倒逼科学家团队走向资产生成与独立创业的深层动因。
信源:https://mp.weixin.qq.com/s/aFz19pPkUqh5XeDoRpZJNw
All-In Podcast:AI军备竞赛陷入曼哈顿工程后遗症,美放弃大模型预审防止力量失衡
在科技与投资领域顶级播客 All-In Podcast 第 274 期中,嘉宾们将当前的 AI 竞争直接比作二战后的曼哈顿工程后遗症。在二战结束、苏联获得核机密后,核武器扩散便陷入了无法逆转的博弈论轨道。科学家群体当时出于防止单边霸权的担忧而泄露机密,促成了核大国之间通过核威慑达成力量平衡。当前的前沿 AI 研发正处于类似的扩散期。如果美国因为政府监管、税收限制或安全预审而强行放慢模型研发速度,非对称的力量均势就会被打破,别国将迅速反超,从而使全球陷入极度危险的失衡状态。
在当前的博弈论逻辑下,强行减速在工程与地缘上都不可行。大模型技术一旦开启扩散,就面临如同冷战后半叶氢弹军备竞赛般的死局,唯有达成对等的技术实力,才能促使双方坐回谈判桌。中美前沿大模型目前保持在 9 个月以内的微弱技术代差,反而在客观上成为了双方寻求缓和与避免修昔底德陷阱的底层动力。
一旦向政府让渡前沿技术的控制权,就会形成无法收回的单向集权陷阱,而利用传统司法体系和产品责任诉讼(如人身伤害或过失致死)进行事后追责,反而是比事前预审更弹性的技术约束机制。在大国博弈的决定论轨道下,维持绝对的研发速度与均势,是防止冲突、寻求技术丰饶的最优解。
信源:https://www.youtube.com/watch?v=HGbA6ze0_3M
在科技与投资领域顶级播客 All-In Podcast 第 274 期中,嘉宾们将当前的 AI 竞争直接比作二战后的曼哈顿工程后遗症。在二战结束、苏联获得核机密后,核武器扩散便陷入了无法逆转的博弈论轨道。科学家群体当时出于防止单边霸权的担忧而泄露机密,促成了核大国之间通过核威慑达成力量平衡。当前的前沿 AI 研发正处于类似的扩散期。如果美国因为政府监管、税收限制或安全预审而强行放慢模型研发速度,非对称的力量均势就会被打破,别国将迅速反超,从而使全球陷入极度危险的失衡状态。
在当前的博弈论逻辑下,强行减速在工程与地缘上都不可行。大模型技术一旦开启扩散,就面临如同冷战后半叶氢弹军备竞赛般的死局,唯有达成对等的技术实力,才能促使双方坐回谈判桌。中美前沿大模型目前保持在 9 个月以内的微弱技术代差,反而在客观上成为了双方寻求缓和与避免修昔底德陷阱的底层动力。
一旦向政府让渡前沿技术的控制权,就会形成无法收回的单向集权陷阱,而利用传统司法体系和产品责任诉讼(如人身伤害或过失致死)进行事后追责,反而是比事前预审更弹性的技术约束机制。在大国博弈的决定论轨道下,维持绝对的研发速度与均势,是防止冲突、寻求技术丰饶的最优解。
信源:https://www.youtube.com/watch?v=HGbA6ze0_3M
YouTube
SpaceX’s $2T Case, Nvidia’s Shock Selloff, America Turns on AI, Trump Pulls AI Order, Bond Crisis?
(0:00) Gavin Baker joins the show!
(0:30) Andrej Karpathy joins Anthropic; hypergrowth and profitability
(12:42) Why Americans have turned on AI, anti-human perception
(27:22) Trump pulls AI EO, US-China AI relationship, dystopian AI layoffs
(45:19) SpaceX…
(0:30) Andrej Karpathy joins Anthropic; hypergrowth and profitability
(12:42) Why Americans have turned on AI, anti-human perception
(27:22) Trump pulls AI EO, US-China AI relationship, dystopian AI layoffs
(45:19) SpaceX…
无中心规划器协作,AI科学家系统AutoScientists开源
由哈佛医学院、Kempner 研究所、Broad 研究所等机构的高尚华 Shanghua Gao、Ada Fang 和 Marinka Zitnik 组成的联合团队,开源了科学发现智能体系统 AutoScientists。系统基于 AI 智能体社交协作平台 ClawInstitute,没有中央规划器或中央编排智能体,模拟真实人类科研的去中心化协作。
先前如 Autoresearch 等系统采用单线程爬山式搜索,只有改动能立竿见影提升效果时才予保留,容易在几轮后陷入瓶颈。AutoScientists 则引入去中心化论坛机制,多个由 Claude Code 封装的子智能体在实际消耗算力前,会通过发帖互相撰写审稿意见,避免重复测试失败路径。多个智能体还能自发围绕有潜力的方向组建课题组进行多路探索,解决单兵搜索的盲目性。在语言模型 GPT nanochat 训练优化中,系统实现 1.9 倍的实验速度提升;即使从单兵系统无法进一步优化的强起点开始测试,AutoScientists 依然完成了 7 次改进,而先前基线的改进数为 0。
在涵盖医学成像、药物研发、蛋白质工程和单细胞组学的生物医药大模型基准 BioML-Bench 测试中,系统在 24 项任务中取得了 74.4% 的平均 Leaderboard 百分位数,比先前最强智能体记录提高 8.3 个百分点。在 ACE2-Spike 蛋白结合预测上,系统发现的 Kermut 扩展方法将 Spearman 相关系数提升 12.5%。相同方法在不作修改的情况下迁移到全部 217 个 ProteinGym 评估后,将官方平均 Spearman 相关系数从 0.657 提升至 0.700,升幅为 6.5%,超过先前 ProteinGym 监督基准的整体最好成绩。
信源:https://arxiv.org/abs/2605.28655
由哈佛医学院、Kempner 研究所、Broad 研究所等机构的高尚华 Shanghua Gao、Ada Fang 和 Marinka Zitnik 组成的联合团队,开源了科学发现智能体系统 AutoScientists。系统基于 AI 智能体社交协作平台 ClawInstitute,没有中央规划器或中央编排智能体,模拟真实人类科研的去中心化协作。
先前如 Autoresearch 等系统采用单线程爬山式搜索,只有改动能立竿见影提升效果时才予保留,容易在几轮后陷入瓶颈。AutoScientists 则引入去中心化论坛机制,多个由 Claude Code 封装的子智能体在实际消耗算力前,会通过发帖互相撰写审稿意见,避免重复测试失败路径。多个智能体还能自发围绕有潜力的方向组建课题组进行多路探索,解决单兵搜索的盲目性。在语言模型 GPT nanochat 训练优化中,系统实现 1.9 倍的实验速度提升;即使从单兵系统无法进一步优化的强起点开始测试,AutoScientists 依然完成了 7 次改进,而先前基线的改进数为 0。
在涵盖医学成像、药物研发、蛋白质工程和单细胞组学的生物医药大模型基准 BioML-Bench 测试中,系统在 24 项任务中取得了 74.4% 的平均 Leaderboard 百分位数,比先前最强智能体记录提高 8.3 个百分点。在 ACE2-Spike 蛋白结合预测上,系统发现的 Kermut 扩展方法将 Spearman 相关系数提升 12.5%。相同方法在不作修改的情况下迁移到全部 217 个 ProteinGym 评估后,将官方平均 Spearman 相关系数从 0.657 提升至 0.700,升幅为 6.5%,超过先前 ProteinGym 监督基准的整体最好成绩。
信源:https://arxiv.org/abs/2605.28655
arXiv.org
AutoScientists: Self-Organizing Agent Teams for Long-Running...
Scientific research proceeds through iterative cycles of hypothesis generation, experiment design, execution, and revision. AI agents can automate parts of this process, but existing approaches...
🎉1
小米开源视频配音模型ControlFoley,声音想怎么配由你决定
小米大模型应用团队发布并开源视频音效生成框架 ControlFoley。以往 AI 视频配音主要由模型根据画面推测声音,创作者很难精确控制声音风格。ControlFoley 的重点是「可控性」:它既能根据画面配音,也能接受文字描述或参考音频,让声音按创作者意图生成。比如把敲门声改成「金属敲击声」,或用打鼓音色去匹配网球击打动作,模型都能在保持音画同步的同时贴合指定风格。底层上,ControlFoley 采用基于 CAV-MAE 改造的时空音视频编码器,并引入「时间-音色解耦」策略,把声音发生时间交给视频,把音色风格交给参考音频。
在论文设定的多任务评估中,ControlFoley 在多个常规视频配音测试上达到开源 SOTA 水平。即使文字指令与画面内容发生强冲突,模型仍能兼顾文本遵循和时间同步。相比商业闭源系统 Kling-Foley,ControlFoley 在语义对齐、同步和感知质量等多项指标上有竞争力;但在 Kling-Audio-Eval 和 MovieGen-Audio-Bench 的部分 KL 散度匹配指标上仍有差距。目前,项目的技术报告、代码、模型权重和 Demo 均已开放。
信源:https://arxiv.org/abs/2604.15086
小米大模型应用团队发布并开源视频音效生成框架 ControlFoley。以往 AI 视频配音主要由模型根据画面推测声音,创作者很难精确控制声音风格。ControlFoley 的重点是「可控性」:它既能根据画面配音,也能接受文字描述或参考音频,让声音按创作者意图生成。比如把敲门声改成「金属敲击声」,或用打鼓音色去匹配网球击打动作,模型都能在保持音画同步的同时贴合指定风格。底层上,ControlFoley 采用基于 CAV-MAE 改造的时空音视频编码器,并引入「时间-音色解耦」策略,把声音发生时间交给视频,把音色风格交给参考音频。
在论文设定的多任务评估中,ControlFoley 在多个常规视频配音测试上达到开源 SOTA 水平。即使文字指令与画面内容发生强冲突,模型仍能兼顾文本遵循和时间同步。相比商业闭源系统 Kling-Foley,ControlFoley 在语义对齐、同步和感知质量等多项指标上有竞争力;但在 Kling-Audio-Eval 和 MovieGen-Audio-Bench 的部分 KL 散度匹配指标上仍有差距。目前,项目的技术报告、代码、模型权重和 Demo 均已开放。
信源:https://arxiv.org/abs/2604.15086
arXiv.org
ControlFoley: Unified and Controllable Video-to-Audio Generation...
Recent advances in video-to-audio (V2A) generation enable high-quality audio synthesis from visual content, yet achieving robust and fine-grained controllability remains challenging. Existing...
腾讯开源网页视觉差异基准DiffSpot,最强模型漏判六成微小CSS改动
腾讯在 Hugging Face 放出网页视觉差异基准 DiffSpot,用来测试多模态大模型能不能发现网页界面里的细小变化。它不是让模型对比两张明显不同的图片,而是在 HTML 页面里只改一个目标元素的 CSS 属性,再让模型判断哪里变了。
DiffSpot 共包含 4400 对网页截图,其中 3900 对存在真实变化,覆盖 13 类 CSS 修改和 3 档难度;另有 500 对完全相同的截图,用来测试模型会不会无中生有。数据集只保留像素变化落在目标元素内部的样本,以减少标注噪声。
结果并不好看。13 款前沿 VLM 零样本测试中,表现最好的 Gemini 3.1 Pro 综合准确率只有 47.2%,对真实变化的召回率为 40.7%,约六成变化被漏掉。困难档任务里,所有模型召回率都低于 23%。
开源模型里,Kimi K2.5 综合准确率 42.2%,高于 GPT-5.4 的 38.3% 和 Claude Opus 4.7 的 38.9%。Qwen3.5-VL-397B 以 37.6% 位列开源第二。
DiffSpot 还发现,网页差异并不一定「越明显越容易被看见」。在不同 CSS 属性下,像素变化量和 CLIP 特征距离都不能稳定预测模型召回率。换句话说,模型漏判不只是因为变化太小,也和它是否真正理解网页元素、样式属性和局部视觉变化有关。
部分模型则走向另一种极端:为了避免误报,直接变得过度保守。Qwen3-VL-235B-Instruct 在 500 组无变化样本中没有出现误报,但真实变化召回率只有 5.1%,说明它更倾向于判定「没有变化」,而不是主动寻找细微差异。
信源:https://huggingface.co/datasets/tencent/DiffSpot
腾讯在 Hugging Face 放出网页视觉差异基准 DiffSpot,用来测试多模态大模型能不能发现网页界面里的细小变化。它不是让模型对比两张明显不同的图片,而是在 HTML 页面里只改一个目标元素的 CSS 属性,再让模型判断哪里变了。
DiffSpot 共包含 4400 对网页截图,其中 3900 对存在真实变化,覆盖 13 类 CSS 修改和 3 档难度;另有 500 对完全相同的截图,用来测试模型会不会无中生有。数据集只保留像素变化落在目标元素内部的样本,以减少标注噪声。
结果并不好看。13 款前沿 VLM 零样本测试中,表现最好的 Gemini 3.1 Pro 综合准确率只有 47.2%,对真实变化的召回率为 40.7%,约六成变化被漏掉。困难档任务里,所有模型召回率都低于 23%。
开源模型里,Kimi K2.5 综合准确率 42.2%,高于 GPT-5.4 的 38.3% 和 Claude Opus 4.7 的 38.9%。Qwen3.5-VL-397B 以 37.6% 位列开源第二。
DiffSpot 还发现,网页差异并不一定「越明显越容易被看见」。在不同 CSS 属性下,像素变化量和 CLIP 特征距离都不能稳定预测模型召回率。换句话说,模型漏判不只是因为变化太小,也和它是否真正理解网页元素、样式属性和局部视觉变化有关。
部分模型则走向另一种极端:为了避免误报,直接变得过度保守。Qwen3-VL-235B-Instruct 在 500 组无变化样本中没有出现误报,但真实变化召回率只有 5.1%,说明它更倾向于判定「没有变化」,而不是主动寻找细微差异。
信源:https://huggingface.co/datasets/tencent/DiffSpot
huggingface.co
tencent/DiffSpot · Datasets at Hugging Face
We’re on a journey to advance and democratize artificial intelligence through open source and open science.
MiniMax启动A股IPO:港股大模型双雄有望会师
中国大模型独角兽正加速走向二级市场。据中国证监会官网披露,大模型企业 MiniMax 已于 2026 年 5 月 29 日同中信证券签署上市辅导协议,正式启动 A 股 IPO 进程。这标志着 MiniMax 与另一家大模型独角兽智谱 AI 有望在 A 股会师。智谱 AI 已于今年 2 月同国泰海通和中金公司签署辅导协议,共同参与科创板上市的辅导工作。
在业务快速增长的推动下,MiniMax 披露了最新数据。截至目前,服务全球企业和开发者客户数已超过 100 万,相比半年前增长了 5 倍,全球用户规模达 3 亿。最近两个月里,年化经常性收入实现超 100% 的增长。根据 2025 年财报,总收入达到 7903.8 万美元,同比增长 158.9%,其中超过 70% 的收入源于国际市场。毛利润为 2007.9 万美元,同比大幅增长 437.2%,毛利率上升 13.2 个百分点至 25.4%。全年经调整净亏损为 2.5 亿美元,亏损率同比显著收窄。
公司战略方向上,创始人兼首席执行官闫俊杰在 5 月 28 日出席国新办「十五五民企勇担当」记者交流会时指出,人工智能正加速与半导体芯片、软件及云平台等产业链环节紧密结合,且技术正从简单应用转向与实体产业深度渗透。闫俊杰表示,未来 3 年的技术进步将延续过去 3 年的高速态势,需要通过开放与普惠让成本更低,以造福大众。在 2026 年,团队计划从单一的大模型研发商向平台型公司转型,深化全球商业化布局,并持续提高基础设施的 token 吞吐和可扩展基建能力。
信源:http://eid.csrc.gov.cn/mnt/storage/stock/pre_ipo/2026/5/30/PREIPO_F0101_V01_20260530_35176_Q/85E1FFB38FDA4B0B961DB586D4AB30C7/%E5%85%B3%E4%BA%8EMiniMax%20Group%20Inc.%E9%A6%96%E6%AC%A1%E5%85%AC%E5%BC%80%E5%8F%91%E8%A1%8C%E8%82%A1%E7%A5%A8%E5%B9%B6%E4%B8%8A%E5%B8%82%E8%BE%85%E5%AF%BC%E5%A4%87%E6%A1%88%E6%8A%A5%E5%91%8A.pdf
中国大模型独角兽正加速走向二级市场。据中国证监会官网披露,大模型企业 MiniMax 已于 2026 年 5 月 29 日同中信证券签署上市辅导协议,正式启动 A 股 IPO 进程。这标志着 MiniMax 与另一家大模型独角兽智谱 AI 有望在 A 股会师。智谱 AI 已于今年 2 月同国泰海通和中金公司签署辅导协议,共同参与科创板上市的辅导工作。
在业务快速增长的推动下,MiniMax 披露了最新数据。截至目前,服务全球企业和开发者客户数已超过 100 万,相比半年前增长了 5 倍,全球用户规模达 3 亿。最近两个月里,年化经常性收入实现超 100% 的增长。根据 2025 年财报,总收入达到 7903.8 万美元,同比增长 158.9%,其中超过 70% 的收入源于国际市场。毛利润为 2007.9 万美元,同比大幅增长 437.2%,毛利率上升 13.2 个百分点至 25.4%。全年经调整净亏损为 2.5 亿美元,亏损率同比显著收窄。
公司战略方向上,创始人兼首席执行官闫俊杰在 5 月 28 日出席国新办「十五五民企勇担当」记者交流会时指出,人工智能正加速与半导体芯片、软件及云平台等产业链环节紧密结合,且技术正从简单应用转向与实体产业深度渗透。闫俊杰表示,未来 3 年的技术进步将延续过去 3 年的高速态势,需要通过开放与普惠让成本更低,以造福大众。在 2026 年,团队计划从单一的大模型研发商向平台型公司转型,深化全球商业化布局,并持续提高基础设施的 token 吞吐和可扩展基建能力。
信源:http://eid.csrc.gov.cn/mnt/storage/stock/pre_ipo/2026/5/30/PREIPO_F0101_V01_20260530_35176_Q/85E1FFB38FDA4B0B961DB586D4AB30C7/%E5%85%B3%E4%BA%8EMiniMax%20Group%20Inc.%E9%A6%96%E6%AC%A1%E5%85%AC%E5%BC%80%E5%8F%91%E8%A1%8C%E8%82%A1%E7%A5%A8%E5%B9%B6%E4%B8%8A%E5%B8%82%E8%BE%85%E5%AF%BC%E5%A4%87%E6%A1%88%E6%8A%A5%E5%91%8A.pdf
OpenAI启动生物防御计划:资助GPT-Rosalind前沿模型访问,加速疫苗与筛查研发
为了防范合成与天然生物威胁,OpenAI 于 2026 年 5 月 29 日宣布推出 Rosalind 生物防御计划,旨在为通过审核的开发者与政府合作伙伴提供 GPT-Rosalind 前沿推理模型访问。GPT-Rosalind 命名自英国化学家 Rosalind Franklin,专注于生命科学领域。考虑到模型在分子生物、基因工程和疾病传播推理上的强大能力,为了防止生物安全风险和技术滥用,OpenAI 实施了严格的访问授权限制。
整个计划设立了两个方向。开发者方向主要面向非营利组织、学术机构和中小型团队,项目涵盖流行病学建模、早期病原体检测、基因筛查与非药物干预措施开发。政府方向面向美国政府和盟国合作伙伴,支持疫情暴发应急响应规划、医疗对策制定以及早期预警系统构建等高影响力工作。为了降低技术开发门槛,OpenAI 将直接资助模型的运行费用。
首批合作伙伴已涵盖多家顶尖科研机构与行业联盟。劳伦斯利弗莫尔国家实验室正通过模型评估医疗防御对策。约翰斯霍普金斯大学应用物理实验室则将模型整合至蛋白质工程平台,用于筛选治疗药物。流行病防范创新联盟也已引入模型以加速疫苗研发的 100 天任务。在应用安全侧,SecureDNA 与 Fourth Eon 等团队则将模型引入了 DNA 筛查与生物安全防线建设。
信源:https://openai.com/index/strengthening-societal-resilience-with-rosalind-biodefense/
为了防范合成与天然生物威胁,OpenAI 于 2026 年 5 月 29 日宣布推出 Rosalind 生物防御计划,旨在为通过审核的开发者与政府合作伙伴提供 GPT-Rosalind 前沿推理模型访问。GPT-Rosalind 命名自英国化学家 Rosalind Franklin,专注于生命科学领域。考虑到模型在分子生物、基因工程和疾病传播推理上的强大能力,为了防止生物安全风险和技术滥用,OpenAI 实施了严格的访问授权限制。
整个计划设立了两个方向。开发者方向主要面向非营利组织、学术机构和中小型团队,项目涵盖流行病学建模、早期病原体检测、基因筛查与非药物干预措施开发。政府方向面向美国政府和盟国合作伙伴,支持疫情暴发应急响应规划、医疗对策制定以及早期预警系统构建等高影响力工作。为了降低技术开发门槛,OpenAI 将直接资助模型的运行费用。
首批合作伙伴已涵盖多家顶尖科研机构与行业联盟。劳伦斯利弗莫尔国家实验室正通过模型评估医疗防御对策。约翰斯霍普金斯大学应用物理实验室则将模型整合至蛋白质工程平台,用于筛选治疗药物。流行病防范创新联盟也已引入模型以加速疫苗研发的 100 天任务。在应用安全侧,SecureDNA 与 Fourth Eon 等团队则将模型引入了 DNA 筛查与生物安全防线建设。
信源:https://openai.com/index/strengthening-societal-resilience-with-rosalind-biodefense/
Codex App在Windows端上线计算机控制与跨设备远控功能
OpenAI 旗下 Agent 工具 Codex App 在 Windows 环境下正式解锁了计算机使用(Computer Use)能力,能够通过屏幕视觉、鼠标点击与键盘输入,直接物理操控 Windows 桌面应用程序,用于编写代码并执行调试。
为了配合跨平台协作,系统上线了跨设备远程控制(Remote Control)功能。开发者能够直接在 Mac 电脑或手机的 ChatGPT 界面下向 Windows 运行设备派发任务,并实时查看执行进度。
此外,全新的 Profile 面板整合了 Token 消耗的实时审计图表与用量自限机制,帮助用户直观掌握调用频次并防止超支。
信源:https://developers.openai.com/codex/changelog
OpenAI 旗下 Agent 工具 Codex App 在 Windows 环境下正式解锁了计算机使用(Computer Use)能力,能够通过屏幕视觉、鼠标点击与键盘输入,直接物理操控 Windows 桌面应用程序,用于编写代码并执行调试。
为了配合跨平台协作,系统上线了跨设备远程控制(Remote Control)功能。开发者能够直接在 Mac 电脑或手机的 ChatGPT 界面下向 Windows 运行设备派发任务,并实时查看执行进度。
此外,全新的 Profile 面板整合了 Token 消耗的实时审计图表与用量自限机制,帮助用户直观掌握调用频次并防止超支。
信源:https://developers.openai.com/codex/changelog
ChatGPT上线对话目录导航功能:满5次回复自动生成,解决长会话翻阅难题
为了解决长对话翻阅与定位的难题,ChatGPT 正式上线了对话目录导航功能。在对话回复数达到 5 次及以上的聊天中,系统会自动提炼并生成章节导航目录,帮助用户快速跳转至不同讨论主题。
在网页端交互上,生成的章节目录主要悬浮于浏览器滚动条侧边。用户除了直接点击目录跳转外,还可以使用 Shift 键配合上下方向键,在不同段落主题间实现快速跳转。目录导航机制能够将原本零散的多轮问答自动整理为结构化项目,降低了信息回溯与知识管理的成本。
信源:https://x.com/ChatGPTapp/status/2060467129066070182
为了解决长对话翻阅与定位的难题,ChatGPT 正式上线了对话目录导航功能。在对话回复数达到 5 次及以上的聊天中,系统会自动提炼并生成章节导航目录,帮助用户快速跳转至不同讨论主题。
在网页端交互上,生成的章节目录主要悬浮于浏览器滚动条侧边。用户除了直接点击目录跳转外,还可以使用 Shift 键配合上下方向键,在不同段落主题间实现快速跳转。目录导航机制能够将原本零散的多轮问答自动整理为结构化项目,降低了信息回溯与知识管理的成本。
信源:https://x.com/ChatGPTapp/status/2060467129066070182
胡彦斌Vibe Coding成果落地:自研粉丝App「彦火」正式上线
由歌手胡彦斌独立开发的粉丝专属互动社区 APP「彦火」已于今日正式在苹果 App Store 上架。
胡彦斌在小红书分享了这一阶段性的开发心得。他透露,这是自己第一次亲手制作一款 APP,从零开始学习 vibe coding,一点点搭建和打磨。整个过程虽然曲折但极具成就感,「像游戏通关,也有点像做音乐,反复打磨」。他还表示,开发该应用是为了给粉丝建造一个「隔着屏幕也能好好说话、好好倾听」的专属空间,接下来会根据用户反馈进行持续更新。
此前,该项目因「明星跨界当程序员」、「出差途中用 Claude Code 修 Bug」而在科技与开发者圈引发热议。作为一款由 AI 辅助开发的完整应用,「彦火」并非粗糙的试验品,而是包含了动态分享、演出通告、专属聊天、虚拟成长体系以及由其亲自设定角色的定制 AI 助手「小 tiger」等核心功能。
由歌手胡彦斌独立开发的粉丝专属互动社区 APP「彦火」已于今日正式在苹果 App Store 上架。
胡彦斌在小红书分享了这一阶段性的开发心得。他透露,这是自己第一次亲手制作一款 APP,从零开始学习 vibe coding,一点点搭建和打磨。整个过程虽然曲折但极具成就感,「像游戏通关,也有点像做音乐,反复打磨」。他还表示,开发该应用是为了给粉丝建造一个「隔着屏幕也能好好说话、好好倾听」的专属空间,接下来会根据用户反馈进行持续更新。
此前,该项目因「明星跨界当程序员」、「出差途中用 Claude Code 修 Bug」而在科技与开发者圈引发热议。作为一款由 AI 辅助开发的完整应用,「彦火」并非粗糙的试验品,而是包含了动态分享、演出通告、专属聊天、虚拟成长体系以及由其亲自设定角色的定制 AI 助手「小 tiger」等核心功能。
💩5
考普斯总统奖得主苏炜杰加盟 OpenAI 参与模型训练,并晋升宾大正教授
北京大学数学科学学院 2007 级校友、斯坦福大学统计学博士、宾夕法尼亚大学沃顿商学院正教授苏炜杰(Weijie Su)在社交平台 X (原 Twitter)上官宣,已于沃顿商学院休假期间正式加入 OpenAI。苏炜杰表示,时隔十年重回湾区,将参与 AI 模型训练。同时,经过十年的学术耕耘,苏炜杰已正式晋升为宾夕法尼亚大学沃顿商学院统计与数据科学系正教授(Full Professor)。
苏炜杰在统计学、机器学习优化以及大语言模型(LLM)理论安全领域贡献卓越。他在 2026 年获得考普斯会长奖(COPSS Presidents' Award),是国际统计学领域的最高荣誉之一。COPSS 官方在颁奖词中高度评价了他在建立生成式 AI 统计学基础(包括 LLM 的水印机制、人类偏好对齐和排序理论)、推进 2020 年美国人口普查中的差异隐私(Differential Privacy)数据分析方法,以及对深度学习理论、凸优化与高维统计推断方面的奠基性贡献。
学术研究上,苏炜杰在大模型统计学底层重塑上取得了多项进展。在大模型水印检测上,他将水印技术公式化为统计假设检验问题,提出「截断拟合优度检验」(Tr-GoF)。Tr-GoF 能够在不依赖人类编辑过程先验知识或精确概率的情况下,提高对修改与剪裁文本的水印检测鲁棒性。在偏好对齐(RLHF)上,苏炜杰指出传统 RLHF 因基于排序的优化机制极易导致「偏好崩塌」(Preference Collapse),即忽略少数群体偏好,使不同提示词的奖励分布趋于单一。为了保留回复多样性,团队通过求解常微分方程(ODE)推导出「偏好匹配」(Preference Matching)正则化方案,在最大化人类奖励的同时避免回复单一化,并探索博弈论视角的「基于人类反馈的纳什学习」(NLHF)以替代传统标量奖励对齐。
苏炜杰本科毕业于北京大学数学科学学院,属于媒体和学者所称的北大数院「黄金二代」(或「白金一代」)。相较于以纯数学研究见长的 2000 级「黄金一代」(如恽之玮、张伟、许晨阳等),以苏炜杰为代表的 2007 级学者展现出更宽广的跨学科特征,将数学边界拓宽至统计学、数据科学与人工智能领域。
信源:https://x.com/weijie444/status/2060604060362014803
北京大学数学科学学院 2007 级校友、斯坦福大学统计学博士、宾夕法尼亚大学沃顿商学院正教授苏炜杰(Weijie Su)在社交平台 X (原 Twitter)上官宣,已于沃顿商学院休假期间正式加入 OpenAI。苏炜杰表示,时隔十年重回湾区,将参与 AI 模型训练。同时,经过十年的学术耕耘,苏炜杰已正式晋升为宾夕法尼亚大学沃顿商学院统计与数据科学系正教授(Full Professor)。
苏炜杰在统计学、机器学习优化以及大语言模型(LLM)理论安全领域贡献卓越。他在 2026 年获得考普斯会长奖(COPSS Presidents' Award),是国际统计学领域的最高荣誉之一。COPSS 官方在颁奖词中高度评价了他在建立生成式 AI 统计学基础(包括 LLM 的水印机制、人类偏好对齐和排序理论)、推进 2020 年美国人口普查中的差异隐私(Differential Privacy)数据分析方法,以及对深度学习理论、凸优化与高维统计推断方面的奠基性贡献。
学术研究上,苏炜杰在大模型统计学底层重塑上取得了多项进展。在大模型水印检测上,他将水印技术公式化为统计假设检验问题,提出「截断拟合优度检验」(Tr-GoF)。Tr-GoF 能够在不依赖人类编辑过程先验知识或精确概率的情况下,提高对修改与剪裁文本的水印检测鲁棒性。在偏好对齐(RLHF)上,苏炜杰指出传统 RLHF 因基于排序的优化机制极易导致「偏好崩塌」(Preference Collapse),即忽略少数群体偏好,使不同提示词的奖励分布趋于单一。为了保留回复多样性,团队通过求解常微分方程(ODE)推导出「偏好匹配」(Preference Matching)正则化方案,在最大化人类奖励的同时避免回复单一化,并探索博弈论视角的「基于人类反馈的纳什学习」(NLHF)以替代传统标量奖励对齐。
苏炜杰本科毕业于北京大学数学科学学院,属于媒体和学者所称的北大数院「黄金二代」(或「白金一代」)。相较于以纯数学研究见长的 2000 级「黄金一代」(如恽之玮、张伟、许晨阳等),以苏炜杰为代表的 2007 级学者展现出更宽广的跨学科特征,将数学边界拓宽至统计学、数据科学与人工智能领域。
信源:https://x.com/weijie444/status/2060604060362014803
❤1
大模型实现小时级自我进化,开源SkyRL并发训练栈带来2.8倍效率跃升
Trajectory 联合 UC 伯克利 Sky Computing Lab、Anyscale 宣布推出开源多 LoRA 强化学习训练平台 SkyRL,并发布支持大模型持续学习的并发训练架构 Multi-LoRA Training。在传统的大模型微调实验中,为了测试不同的训练策略,开发者必须为每个微调任务单独调度 GPU 节点,在服务器上频繁加载和卸载同一个巨型大模型。例如训练一个拥有 3970 亿参数的巨型大模型,传统模式需要多组算力节点来回载入几百 GB 的权重文件,造成了计算时间与算力资源的极大浪费。
Multi-LoRA 架构彻底告别了反复冷启动的困境。系统选择在 GPU 显存中常驻一个在线运行的「共享模型底座」,并将多个不同的微调实验作为轻量级「适配器模块」统一管理。在训练阶段,系统通过在 CPU 与 GPU 之间快速换入和换出(Swap-in/Swap-out)各个适配器的状态来串行执行前向与反向传播,省去了重复加载巨型底座模型的冷启动开销。结合推理阶段的并发处理,多任务的整体实验吞吐量得到大幅提升。
测试数据显示,在保证大模型性能没有衰退的前提下,端到端实验吞吐量最高提升了 2.81 倍,单节点绝对时间内的吞吐量则提升了约 3.25 倍。目前,训练代码已在 SkyRL 仓库中开源,旨在帮助开发者以极低显存成本让大模型通过实时生产数据完成小时级自我进化。
信源:https://trajectory.ai/field-notes/multi-lora-training-for-continual-learning
Trajectory 联合 UC 伯克利 Sky Computing Lab、Anyscale 宣布推出开源多 LoRA 强化学习训练平台 SkyRL,并发布支持大模型持续学习的并发训练架构 Multi-LoRA Training。在传统的大模型微调实验中,为了测试不同的训练策略,开发者必须为每个微调任务单独调度 GPU 节点,在服务器上频繁加载和卸载同一个巨型大模型。例如训练一个拥有 3970 亿参数的巨型大模型,传统模式需要多组算力节点来回载入几百 GB 的权重文件,造成了计算时间与算力资源的极大浪费。
Multi-LoRA 架构彻底告别了反复冷启动的困境。系统选择在 GPU 显存中常驻一个在线运行的「共享模型底座」,并将多个不同的微调实验作为轻量级「适配器模块」统一管理。在训练阶段,系统通过在 CPU 与 GPU 之间快速换入和换出(Swap-in/Swap-out)各个适配器的状态来串行执行前向与反向传播,省去了重复加载巨型底座模型的冷启动开销。结合推理阶段的并发处理,多任务的整体实验吞吐量得到大幅提升。
测试数据显示,在保证大模型性能没有衰退的前提下,端到端实验吞吐量最高提升了 2.81 倍,单节点绝对时间内的吞吐量则提升了约 3.25 倍。目前,训练代码已在 SkyRL 仓库中开源,旨在帮助开发者以极低显存成本让大模型通过实时生产数据完成小时级自我进化。
信源:https://trajectory.ai/field-notes/multi-lora-training-for-continual-learning
trajectory.ai
Multi-LoRA Training for Continual Learning - Trajectory
Research lab and product company building the platform for continual learning.
❤1
Anthropic创始人与OpenAI总裁旧日恩怨:Dario曾因「插手项目排挤研究员」禁止Brockman参与ChatGPT前身开发
《华尔街日报》披露,在 Anthropic 骨干集体出走前,OpenAI 总裁格雷格·布罗克曼(Greg Brockman)与阿莫代兄妹(Dario Amodei 与 Daniela Amodei)已在内部产生重大人际冲突。作为技术天才的布罗克曼在公司内部以强硬、越权的「大脚」(bigfooting)管理风格闻名。他极力避免行政会议,试图将 80% 的时间用于写代码,却经常在不了解背景的情况下强行介入团队项目,践踏他人工作,招致大量同事的抱怨。
管理摩擦在 OpenAI 早期达到顶点。布罗克曼因过度干涉项目让一位顶尖研究员备受排挤,彻底激怒了当时的项目负责人、后来的 Anthropic 创始人达里奥·阿莫代(Dario Amodei)。阿莫代随即采取极端防范措施,直接禁止布罗克曼插手导致 ChatGPT 诞生的前身项目开发。这段职场裂痕不仅促成了阿莫代团队日后出走创立 Anthropic,也为后来的权力斗争埋下了伏笔。2023 年感恩节董事会「政变」中,联合创始人伊利亚·苏茨克维尔(Ilya Sutskever)罢免萨姆·奥特曼时,给出的核心理由之一便是奥特曼「管不住布罗克曼」。
双方的私人关系同样充满戏剧性。2018 年,布罗克曼与 Anna 一见钟情并开始约会。如今的 Anthropic 总裁达妮埃拉·阿莫代(Daniela Amodei)当时坚信两人走不远,直接与布罗克曼打赌 100 美元,坚称 Anna 绝非他的终身伴侣。一年后两人结婚,在 OpenAI 总部举行婚礼,由机械臂充当伴郎并递送婚戒,达妮埃拉则在现场如约呈上一张 100 美元支票。
巨头决裂后,往日的亲密关系最终彻底破裂。随着 2024 年底苏茨克维尔(曾与布罗克曼形影不离)正式离开 OpenAI,双方为了挽留彼此进行了极其痛苦的谈判。最终,布罗克曼的妻子 Anna 为苏茨克维尔送去了一盆仙人掌,作为最后的告别礼,象征着一个时代的终结。
信源:https://www.wsj.com/tech/openai-who-is-greg-brockman-e699816c
《华尔街日报》披露,在 Anthropic 骨干集体出走前,OpenAI 总裁格雷格·布罗克曼(Greg Brockman)与阿莫代兄妹(Dario Amodei 与 Daniela Amodei)已在内部产生重大人际冲突。作为技术天才的布罗克曼在公司内部以强硬、越权的「大脚」(bigfooting)管理风格闻名。他极力避免行政会议,试图将 80% 的时间用于写代码,却经常在不了解背景的情况下强行介入团队项目,践踏他人工作,招致大量同事的抱怨。
管理摩擦在 OpenAI 早期达到顶点。布罗克曼因过度干涉项目让一位顶尖研究员备受排挤,彻底激怒了当时的项目负责人、后来的 Anthropic 创始人达里奥·阿莫代(Dario Amodei)。阿莫代随即采取极端防范措施,直接禁止布罗克曼插手导致 ChatGPT 诞生的前身项目开发。这段职场裂痕不仅促成了阿莫代团队日后出走创立 Anthropic,也为后来的权力斗争埋下了伏笔。2023 年感恩节董事会「政变」中,联合创始人伊利亚·苏茨克维尔(Ilya Sutskever)罢免萨姆·奥特曼时,给出的核心理由之一便是奥特曼「管不住布罗克曼」。
双方的私人关系同样充满戏剧性。2018 年,布罗克曼与 Anna 一见钟情并开始约会。如今的 Anthropic 总裁达妮埃拉·阿莫代(Daniela Amodei)当时坚信两人走不远,直接与布罗克曼打赌 100 美元,坚称 Anna 绝非他的终身伴侣。一年后两人结婚,在 OpenAI 总部举行婚礼,由机械臂充当伴郎并递送婚戒,达妮埃拉则在现场如约呈上一张 100 美元支票。
巨头决裂后,往日的亲密关系最终彻底破裂。随着 2024 年底苏茨克维尔(曾与布罗克曼形影不离)正式离开 OpenAI,双方为了挽留彼此进行了极其痛苦的谈判。最终,布罗克曼的妻子 Anna 为苏茨克维尔送去了一盆仙人掌,作为最后的告别礼,象征着一个时代的终结。
信源:https://www.wsj.com/tech/openai-who-is-greg-brockman-e699816c
The Wall Street Journal
The Billionaire Coding Genius Making the Tough Decisions at OpenAI
After years in the shadow of better-known co-founders, Greg Brockman is stepping into the spotlight. He and his wife, Anna, are also Silicon Valley superdonors.
OpenClaw v2026.5.28发布,强化Codex恢复并上线iOS Pro UI
开源 AI 个人助手 OpenClaw 发布 v2026.5.28 版本,重点重构了 Codex 与 Agent 运行时的弹性恢复机制,并上线全新 iOS 开发版 Pro UI。
在新版本中,子智能体 (Subagent) 的运行路径与工作空间实现了严格物理隔离,以防止沙箱污染。系统级钩子 (Hooks) 上下文被限制在提示词局部,并在执行超时或主动终止时自动释放会话锁,同时保留框架级别的存活锁。为了应对底层服务崩溃,新版调整了 Codex 应用服务器的容错逻辑,确保辅助进程故障不会拖垮共享的运行时状态,并彻底杜绝了历史重启残留导致的事件循环自锁问题。
移动端与聊天交互界面迎来重要更新。作为将 iPhone 硬件能力接入 Gateway 网关的移动节点客户端,iOS 开发版应用 (iOS node app) 本次全面重构,推出全新的 Pro 界面,将专业命令、智能体管理、实时诊断与全局设置进行一体化整合。新版 iOS 应用支持通过 WKWebView 渲染远程画布 (Canvas) 与自适应交互界面 (A2UI),并实现基于网关会话的实时 Talk 语音双向播放。为了在断网或后台唤醒等移动场景下维持通信,系统优化了网关聊天传输协议与 WebChat 重连状态保持,并且官方发行版默认启用了基于托管型外部推送中继 (ios-push-relay.openclaw.ai) 的 APNs 唤醒机制,在保证生产证书安全的同时实现了秒级后台唤醒。
在生态兼容与底层能力方面,新版扩展了模型与文档支持边界。系统原生接入了 Claude Opus 4.8,并支持 Fal Krea 图像模式架构、NVIDIA 推荐模型目录与 MiniMax 音乐流式响应。在安全防御上,CLI 与诊断模块引入了更严苛的 dotenv 安全策略。系统在执行诊断或运行 CLI 时,将严格忽略工作空间目录下的 .env 环境变量文件,从而防止恶意开源项目通过本地注入窃取开发者的云端服务凭证。此外,文件提取模块正式启用 ClawPDF 引擎,首次实现了对加密 PDF 文档的结构化文本提取,并支持直接在智能体工具结果中输出结构化 MCP 内容。
信源:https://github.com/openclaw/openclaw/releases/tag/v2026.5.28
开源 AI 个人助手 OpenClaw 发布 v2026.5.28 版本,重点重构了 Codex 与 Agent 运行时的弹性恢复机制,并上线全新 iOS 开发版 Pro UI。
在新版本中,子智能体 (Subagent) 的运行路径与工作空间实现了严格物理隔离,以防止沙箱污染。系统级钩子 (Hooks) 上下文被限制在提示词局部,并在执行超时或主动终止时自动释放会话锁,同时保留框架级别的存活锁。为了应对底层服务崩溃,新版调整了 Codex 应用服务器的容错逻辑,确保辅助进程故障不会拖垮共享的运行时状态,并彻底杜绝了历史重启残留导致的事件循环自锁问题。
移动端与聊天交互界面迎来重要更新。作为将 iPhone 硬件能力接入 Gateway 网关的移动节点客户端,iOS 开发版应用 (iOS node app) 本次全面重构,推出全新的 Pro 界面,将专业命令、智能体管理、实时诊断与全局设置进行一体化整合。新版 iOS 应用支持通过 WKWebView 渲染远程画布 (Canvas) 与自适应交互界面 (A2UI),并实现基于网关会话的实时 Talk 语音双向播放。为了在断网或后台唤醒等移动场景下维持通信,系统优化了网关聊天传输协议与 WebChat 重连状态保持,并且官方发行版默认启用了基于托管型外部推送中继 (ios-push-relay.openclaw.ai) 的 APNs 唤醒机制,在保证生产证书安全的同时实现了秒级后台唤醒。
在生态兼容与底层能力方面,新版扩展了模型与文档支持边界。系统原生接入了 Claude Opus 4.8,并支持 Fal Krea 图像模式架构、NVIDIA 推荐模型目录与 MiniMax 音乐流式响应。在安全防御上,CLI 与诊断模块引入了更严苛的 dotenv 安全策略。系统在执行诊断或运行 CLI 时,将严格忽略工作空间目录下的 .env 环境变量文件,从而防止恶意开源项目通过本地注入窃取开发者的云端服务凭证。此外,文件提取模块正式启用 ClawPDF 引擎,首次实现了对加密 PDF 文档的结构化文本提取,并支持直接在智能体工具结果中输出结构化 MCP 内容。
信源:https://github.com/openclaw/openclaw/releases/tag/v2026.5.28
GitHub
Release openclaw 2026.5.28 · openclaw/openclaw
Highlights
Agent and Codex runtime recovery is steadier: subagents keep cwd/workspace separation, hook context stays prompt-local, session locks release on timeout abort while live OpenClaw locks ...
Agent and Codex runtime recovery is steadier: subagents keep cwd/workspace separation, hook context stays prompt-local, session locks release on timeout abort while live OpenClaw locks ...
微软下周将发自研编程模型,反击Cursor与Claude对Copilot的蚕食
微软计划下周在旧金山举办的年度 Build 开发者大会上发布多款自研 AI 模型。为了夺回被竞争对手蚕食的 AI 编码市场,微软重点推出自研编程模型,用以提升 GitHub Copilot 的竞争力,反击 Cursor 和 Claude Code 带来的市场侵蚀。
除了编程模型外,微软同时筹划推出多种参数规格的自研大模型,涵盖转录、推理(reasoning)、语音和图像等垂直任务。微软 AI 首席执行官 Mustafa Suleyman 旗下的研发团队在过去两年中尚未有模型登顶行业主流榜单,本次发布将成为团队自研能力的首次大考。此前,由于与 OpenAI 签署的独家排他协议限制了微软在 2026 年 4 月前研发人类水平 AI 的权限,自研工作一度受限;直到今年 4 月两家公司重新修改合作条款,微软才重获研发自由度。
在软件服务中,微软长期依赖 OpenAI 免费授权至 2032 年的技术,以及付费采购的 Anthropic 模型来驱动 GitHub Copilot 和 365 Copilot。高昂的外部采购成本已迫使微软调高了 GitHub Copilot 部分套餐售价,并对 Anthropic 模型的使用量实施额度限制。通过 Azure 云平台分发更低成本的自研模型,微软能够为开发者提供低廉的 Claude 替代品,进而拉低 Office 办公软件中 AI 功能的日常运行成本。更重要的是,在约 6 年后与 OpenAI 免费授权到期时,自研大模型将成为微软摆脱高价供应商、维持核心独立性的关键筹码。
信源:https://www.theinformation.com/newsletters/ai-agenda/microsoft-release-new-coding-model-next-week-comeback-attempt
微软计划下周在旧金山举办的年度 Build 开发者大会上发布多款自研 AI 模型。为了夺回被竞争对手蚕食的 AI 编码市场,微软重点推出自研编程模型,用以提升 GitHub Copilot 的竞争力,反击 Cursor 和 Claude Code 带来的市场侵蚀。
除了编程模型外,微软同时筹划推出多种参数规格的自研大模型,涵盖转录、推理(reasoning)、语音和图像等垂直任务。微软 AI 首席执行官 Mustafa Suleyman 旗下的研发团队在过去两年中尚未有模型登顶行业主流榜单,本次发布将成为团队自研能力的首次大考。此前,由于与 OpenAI 签署的独家排他协议限制了微软在 2026 年 4 月前研发人类水平 AI 的权限,自研工作一度受限;直到今年 4 月两家公司重新修改合作条款,微软才重获研发自由度。
在软件服务中,微软长期依赖 OpenAI 免费授权至 2032 年的技术,以及付费采购的 Anthropic 模型来驱动 GitHub Copilot 和 365 Copilot。高昂的外部采购成本已迫使微软调高了 GitHub Copilot 部分套餐售价,并对 Anthropic 模型的使用量实施额度限制。通过 Azure 云平台分发更低成本的自研模型,微软能够为开发者提供低廉的 Claude 替代品,进而拉低 Office 办公软件中 AI 功能的日常运行成本。更重要的是,在约 6 年后与 OpenAI 免费授权到期时,自研大模型将成为微软摆脱高价供应商、维持核心独立性的关键筹码。
信源:https://www.theinformation.com/newsletters/ai-agenda/microsoft-release-new-coding-model-next-week-comeback-attempt
The Information
Microsoft to Release New Coding Model Next Week in Comeback Attempt
Microsoft next week will unveil a suite of new homegrown AI models at its annual Build conference for app developers in San Francisco. The question is whether it can win over these people.The company plans to unveil a coding model to boost the competitiveness…
❤2
OpenAI首席营收官大幅扩权,率Salesforce军团对决Anthropic
OpenAI 首席营收官 Denise Dresser 自去年 12 月加入公司半年来,正以强悍的姿态推进企业级商业化扩张,目前已接管前首席运营官 Brad Lightcap 负责的合作伙伴与广告谈判业务。在外部竞争方面,对手 Anthropic 在周四以 9000 亿美元的估值完成新一轮融资,估值规模首次超越 OpenAI 目前的 7300 亿美元,使两家大模型巨头在企业级市场的争夺进入白热化。
为了加速抢占企业预算,Dresser 正在 OpenAI 内部快速组建一支庞大的「Salesforce 与 Slack 帮」。前 Slack 首席客户官 Peter Doolan 于今年 4 月加盟出任 AI 转型全球负责人,前 ServiceNow 首席营销官兼 Salesforce 前高级副总裁 Colin Fleming 也在本月入职担任商用业务首席营销官。此外,团队还引入了前 Google 渠道副总裁 Colleen Kapase 等至少六位资深销售与渠道高管。在 Dresser 的主导下,OpenAI 成功理顺了与 Databricks 合作中混乱的联合销售流程,并在今年联合签下了汽车租赁巨头 Hertz 与咨询巨头 KPMG 等标杆客户。
两家大模型厂商的交锋不仅是估值对决,更是商业模式与基础设施的肉搏。财务预测显示,OpenAI 期望在 2026 年底将企业级收入占比从年初的 40% 提升至 50%;相比之下,Anthropic 超过 80% 的收入均来自企业客户,通过重点优化数据库连接及长文本解析等商用场景,赢得了极高的企业忠诚度。Dresser 在一封内部备忘录中对竞争对手发起猛烈攻势,指责 Anthropic 限制算力购买是一个「战略失误」,导致产品频繁出现调用限流和稳定性下降,并批评对方的营销故事「建立在恐惧与限制之上」。
信源:https://www.theinformation.com/articles/openais-revenue-chief-barnstorms-business-customers
OpenAI 首席营收官 Denise Dresser 自去年 12 月加入公司半年来,正以强悍的姿态推进企业级商业化扩张,目前已接管前首席运营官 Brad Lightcap 负责的合作伙伴与广告谈判业务。在外部竞争方面,对手 Anthropic 在周四以 9000 亿美元的估值完成新一轮融资,估值规模首次超越 OpenAI 目前的 7300 亿美元,使两家大模型巨头在企业级市场的争夺进入白热化。
为了加速抢占企业预算,Dresser 正在 OpenAI 内部快速组建一支庞大的「Salesforce 与 Slack 帮」。前 Slack 首席客户官 Peter Doolan 于今年 4 月加盟出任 AI 转型全球负责人,前 ServiceNow 首席营销官兼 Salesforce 前高级副总裁 Colin Fleming 也在本月入职担任商用业务首席营销官。此外,团队还引入了前 Google 渠道副总裁 Colleen Kapase 等至少六位资深销售与渠道高管。在 Dresser 的主导下,OpenAI 成功理顺了与 Databricks 合作中混乱的联合销售流程,并在今年联合签下了汽车租赁巨头 Hertz 与咨询巨头 KPMG 等标杆客户。
两家大模型厂商的交锋不仅是估值对决,更是商业模式与基础设施的肉搏。财务预测显示,OpenAI 期望在 2026 年底将企业级收入占比从年初的 40% 提升至 50%;相比之下,Anthropic 超过 80% 的收入均来自企业客户,通过重点优化数据库连接及长文本解析等商用场景,赢得了极高的企业忠诚度。Dresser 在一封内部备忘录中对竞争对手发起猛烈攻势,指责 Anthropic 限制算力购买是一个「战略失误」,导致产品频繁出现调用限流和稳定性下降,并批评对方的营销故事「建立在恐惧与限制之上」。
信源:https://www.theinformation.com/articles/openais-revenue-chief-barnstorms-business-customers
The Information
OpenAI’s Revenue Chief Barnstorms for Business Customers
Before former Slack CEO Denise Dresser joined OpenAI in December as its chief revenue officer, the company’s efforts to sell its products to business customers were sometimes clunky. Earlier in 2025, for example, the company had struck an agreement with Databricks…