谷歌发布ReasoningBank,智能体从成败经验中提炼推理策略
谷歌研究院发布智能体记忆框架 ReasoningBank,让大模型驱动的智能体在部署后持续学习。核心做法是把过往任务的成功和失败经验都提炼成通用的推理策略存入记忆库,下次遇到类似任务先检索再执行。相关论文在 ICLR 发表,代码已在 GitHub 开源。
此前两类主流方案各有缺陷:Synapse 记录完整行动轨迹,粒度太细难迁移;Agent Workflow Memory 只从成功案例提炼工作流。ReasoningBank 改了两处:存储对象从「动作序列」换成「推理模式」,每条记忆含标题、描述、内容三段结构化字段;失败轨迹也纳入学习。模型调用另一个大模型对执行轨迹自评,失败经验被拆成防踩坑规则,例如从「看见 Load More 按钮就点」升级为「先核对当前页面标识,避免陷入无限滚动,再点击加载更多」。
论文另提出 Memory-aware Test-time Scaling(MaTTS),在推理时投入更多算力反复尝试,并把探索过程存入记忆库。并行扩展让智能体对同一任务跑多条不同轨迹,通过自对比提炼更稳健的策略;顺序扩展在单条轨迹内反复精修,把中间推理记入记忆库。
在 WebArena 浏览器任务和 SWE-Bench-Verified 代码任务两个基准上,用 Gemini 2.5 Flash 做 ReAct 智能体,ReasoningBank 相比无记忆基线在 WebArena 上成功率高 8.3%,SWE-Bench-Verified 上高 4.6%,每项任务平均少走约 3 步;叠加 MaTTS 并行扩展(k=5)后,WebArena 成功率再提 3 个百分点,步数再少 0.4 步。
信源:https://research.google/blog/reasoningbank-enabling-agents-to-learn-from-experience/
谷歌研究院发布智能体记忆框架 ReasoningBank,让大模型驱动的智能体在部署后持续学习。核心做法是把过往任务的成功和失败经验都提炼成通用的推理策略存入记忆库,下次遇到类似任务先检索再执行。相关论文在 ICLR 发表,代码已在 GitHub 开源。
此前两类主流方案各有缺陷:Synapse 记录完整行动轨迹,粒度太细难迁移;Agent Workflow Memory 只从成功案例提炼工作流。ReasoningBank 改了两处:存储对象从「动作序列」换成「推理模式」,每条记忆含标题、描述、内容三段结构化字段;失败轨迹也纳入学习。模型调用另一个大模型对执行轨迹自评,失败经验被拆成防踩坑规则,例如从「看见 Load More 按钮就点」升级为「先核对当前页面标识,避免陷入无限滚动,再点击加载更多」。
论文另提出 Memory-aware Test-time Scaling(MaTTS),在推理时投入更多算力反复尝试,并把探索过程存入记忆库。并行扩展让智能体对同一任务跑多条不同轨迹,通过自对比提炼更稳健的策略;顺序扩展在单条轨迹内反复精修,把中间推理记入记忆库。
在 WebArena 浏览器任务和 SWE-Bench-Verified 代码任务两个基准上,用 Gemini 2.5 Flash 做 ReAct 智能体,ReasoningBank 相比无记忆基线在 WebArena 上成功率高 8.3%,SWE-Bench-Verified 上高 4.6%,每项任务平均少走约 3 步;叠加 MaTTS 并行扩展(k=5)后,WebArena 成功率再提 3 个百分点,步数再少 0.4 步。
信源:https://research.google/blog/reasoningbank-enabling-agents-to-learn-from-experience/
OpenAI拟向私募股权合资公司DeployCo投入最多15亿美元
OpenAI 正与多家私募股权机构组建合资公司 DeployCo,注册于特拉华州,OpenAI 持多数股权和超级投票权股份。OpenAI 先注入 5 亿美元股权,后续有权追加 10 亿美元;TPG、贝恩资本、Advent International、博枫(Brookfield)和 Goanna Capital 另外注入 40 亿美元。DeployCo 预计 5 月初完成融资,估值 100 亿美元。
DeployCo 目前由 OpenAI 前 COO Brad Lightcap 管理,已开始招聘自有员工,OpenAI 同时派人借调。Lightcap 此前主导招募了数十名「前线部署工程师」(forward deployed engineers),嵌入客户公司内部帮助落地技术,该模式最早由 Palantir 开创。
DeployCo 的商业模式是向 PE 机构旗下被投企业收费,帮它们将 AI 嵌入业务流程。PE 投资者锁定 5 年,OpenAI 保证每年至少 17.5% 的回报率,知情人士称「这是底线,实际预期远高于此」。DeployCo 持有的 OpenAI 股权未来还可用于收购技术和知识产权。
OpenAI 高管将当前局面描述为 AI 的「能力过剩」(capability overhang):模型能力远超实际使用程度。首席营收官 Denise Dresser 本月在内部销售邮件中称,企业用 AI 的最大瓶颈不是技术,而是「能不能部署下去」。OpenAI 还在同步与麦肯锡和埃森哲合作推动企业采用。Anthropic 也在与黑石和 Hellman & Friedman 谈判类似的合资方案,计划组建 AI 部署咨询公司。
信源:https://www.ft.com/content/87727c4e-05c4-4d84-a9de-4190a9d681a6
OpenAI 正与多家私募股权机构组建合资公司 DeployCo,注册于特拉华州,OpenAI 持多数股权和超级投票权股份。OpenAI 先注入 5 亿美元股权,后续有权追加 10 亿美元;TPG、贝恩资本、Advent International、博枫(Brookfield)和 Goanna Capital 另外注入 40 亿美元。DeployCo 预计 5 月初完成融资,估值 100 亿美元。
DeployCo 目前由 OpenAI 前 COO Brad Lightcap 管理,已开始招聘自有员工,OpenAI 同时派人借调。Lightcap 此前主导招募了数十名「前线部署工程师」(forward deployed engineers),嵌入客户公司内部帮助落地技术,该模式最早由 Palantir 开创。
DeployCo 的商业模式是向 PE 机构旗下被投企业收费,帮它们将 AI 嵌入业务流程。PE 投资者锁定 5 年,OpenAI 保证每年至少 17.5% 的回报率,知情人士称「这是底线,实际预期远高于此」。DeployCo 持有的 OpenAI 股权未来还可用于收购技术和知识产权。
OpenAI 高管将当前局面描述为 AI 的「能力过剩」(capability overhang):模型能力远超实际使用程度。首席营收官 Denise Dresser 本月在内部销售邮件中称,企业用 AI 的最大瓶颈不是技术,而是「能不能部署下去」。OpenAI 还在同步与麦肯锡和埃森哲合作推动企业采用。Anthropic 也在与黑石和 Hellman & Friedman 谈判类似的合资方案,计划组建 AI 部署咨询公司。
信源:https://www.ft.com/content/87727c4e-05c4-4d84-a9de-4190a9d681a6
Hugging Face开源ml-intern,自动读论文、选数据、跑训练的ML研究代理
Hugging Face 开源 ml-intern,一个能自主完成「读论文、整理数据集、启动 GPU 训练、评估结果、迭代改进」全流程的 ML 研究代理。项目基于自家 smolagents 框架构建,提供 CLI 和网页端两种入口,代码在 GitHub 开源。
ml-intern 的工具链围绕 Hugging Face 生态搭建:在 arXiv 和 HF Papers 上检索论文并沿引用链深读;浏览 HF Hub 上的数据集,检查质量后重新格式化再投入训练;本地没有 GPU 时可调用 HF Jobs 启动云端训练任务,训练结束后自动读取评估输出、诊断失败原因并重跑。默认调用 Claude Sonnet 4.5 驱动决策循环,单次最多迭代 300 轮,上下文超过 170k token 自动压缩。
Hugging Face 在发布帖中给出三个案例。科学推理任务中,代理从基准论文的引用链里找到 OpenScience 和 NemoTron-CrossThink 数据集,从 ARC、SciQ、MMLU 中按难度过滤出 7 个变体,在 Qwen3-1.7B 上跑了 12 轮 SFT,GPQA 得分从 10% 提到 32%,耗时不到 10 小时。医疗场景中,代理判断现有数据集质量不够,自行编写脚本生成 1100 条合成数据并扩增 50 倍用于训练,在 HealthBench 上超过 Codex 60%。竞赛数学场景中,代理自行编写 GRPO 训练脚本并在 A100 上通过 HF Spaces 启动训练,观测到奖励塌缩后跑消融实验排查原因。
信源:https://github.com/huggingface/ml-intern
Hugging Face 开源 ml-intern,一个能自主完成「读论文、整理数据集、启动 GPU 训练、评估结果、迭代改进」全流程的 ML 研究代理。项目基于自家 smolagents 框架构建,提供 CLI 和网页端两种入口,代码在 GitHub 开源。
ml-intern 的工具链围绕 Hugging Face 生态搭建:在 arXiv 和 HF Papers 上检索论文并沿引用链深读;浏览 HF Hub 上的数据集,检查质量后重新格式化再投入训练;本地没有 GPU 时可调用 HF Jobs 启动云端训练任务,训练结束后自动读取评估输出、诊断失败原因并重跑。默认调用 Claude Sonnet 4.5 驱动决策循环,单次最多迭代 300 轮,上下文超过 170k token 自动压缩。
Hugging Face 在发布帖中给出三个案例。科学推理任务中,代理从基准论文的引用链里找到 OpenScience 和 NemoTron-CrossThink 数据集,从 ARC、SciQ、MMLU 中按难度过滤出 7 个变体,在 Qwen3-1.7B 上跑了 12 轮 SFT,GPQA 得分从 10% 提到 32%,耗时不到 10 小时。医疗场景中,代理判断现有数据集质量不够,自行编写脚本生成 1100 条合成数据并扩增 50 倍用于训练,在 HealthBench 上超过 Codex 60%。竞赛数学场景中,代理自行编写 GRPO 训练脚本并在 A100 上通过 HF Spaces 启动训练,观测到奖励塌缩后跑消融实验排查原因。
信源:https://github.com/huggingface/ml-intern
GitHub
GitHub - huggingface/ml-intern: 🤗 ml-intern: an open-source ML engineer that reads papers, trains models, and ships ML models
🤗 ml-intern: an open-source ML engineer that reads papers, trains models, and ships ML models - huggingface/ml-intern
✍1
AirJelly上线桌面端主动式AI助手,以Enter键为锚点捕捉用户意图
前字节跳动产品经理柏特创立的持续低熵(Low Entropy AI)发布桌面 AI 助手 AirJelly,已获五源资本融资。柏特此前在字节主导了上下文工程产品 MineContext,随后带着原团队离职创业,团队共 11 人,均在北京线下办公。
AirJelly 不做全量屏幕录制,而是以 Enter 键为锚点:用户每次按下 Enter 时截取屏幕,同时通过 Accessibility 权限获取当前应用、输入框类型和上下文,将这些信息建模为 Event,再由 AI 归纳成 Task。相比此前 MineContext 每天约 1500 张截图的全量方案,Enter 机制将截图量压缩到约 300 张,成本降至五分之一,同时减少了无关截图带来的误判。
记忆系统分两层:静态信息建模为 Entity(人物、项目等),动态信息建模为 Task,每个 Task 包含标题、摘要、进度、下一步和关联 Event。召回时综合向量检索、关键词检索和时间衰减权重,数据全部存在本地。在此基础上,AirJelly 会判断 Task 更新是否达到推送阈值,主动向用户推荐下一步操作,团队称之为 Proactive 触发。
底层 agent 执行能力接入了 OpenClaw 的 Pi 框架,结合 MineContext 的屏幕理解能力。产品目前支持 macOS,Windows 和 Linux 版本在开发中,可在 airjelly.ai 免费下载。团队下一步计划推出「Next Enter Prediction」功能,基于历史行为轨迹预测用户下一次 Enter 要输入的内容,以及支持多人协作的团队版。
信源:https://x.com/airjellyAI/status/2046621478662402498
前字节跳动产品经理柏特创立的持续低熵(Low Entropy AI)发布桌面 AI 助手 AirJelly,已获五源资本融资。柏特此前在字节主导了上下文工程产品 MineContext,随后带着原团队离职创业,团队共 11 人,均在北京线下办公。
AirJelly 不做全量屏幕录制,而是以 Enter 键为锚点:用户每次按下 Enter 时截取屏幕,同时通过 Accessibility 权限获取当前应用、输入框类型和上下文,将这些信息建模为 Event,再由 AI 归纳成 Task。相比此前 MineContext 每天约 1500 张截图的全量方案,Enter 机制将截图量压缩到约 300 张,成本降至五分之一,同时减少了无关截图带来的误判。
记忆系统分两层:静态信息建模为 Entity(人物、项目等),动态信息建模为 Task,每个 Task 包含标题、摘要、进度、下一步和关联 Event。召回时综合向量检索、关键词检索和时间衰减权重,数据全部存在本地。在此基础上,AirJelly 会判断 Task 更新是否达到推送阈值,主动向用户推荐下一步操作,团队称之为 Proactive 触发。
底层 agent 执行能力接入了 OpenClaw 的 Pi 框架,结合 MineContext 的屏幕理解能力。产品目前支持 macOS,Windows 和 Linux 版本在开发中,可在 airjelly.ai 免费下载。团队下一步计划推出「Next Enter Prediction」功能,基于历史行为轨迹预测用户下一次 Enter 要输入的内容,以及支持多人协作的团队版。
信源:https://x.com/airjellyAI/status/2046621478662402498
X (formerly Twitter)
AirJelly (@airjellyAI) on X
🚨The world just started talking about AI Screen Context.
We've been building something deeper — AirJelly can see your screen and remembers not just what you did, but who you are.
No intent missed. No task overdue.
🪼Introducing AirJelly today, the world's…
We've been building something deeper — AirJelly can see your screen and remembers not just what you did, but who you are.
No intent missed. No task overdue.
🪼Introducing AirJelly today, the world's…
分析:SpaceX与Cursor的600亿期权实为编码数据对赌
AI 模型评估公司 PatronusAI 联合创始人 Anand Kannappan 在 X 发文,认为外界把 SpaceX 与 Cursor 的交易当成并购是误读,核心是一场实验:开发者行为数据到底是不是编码模型的真正瓶颈。
按他的分析,xAI 的 Grok 在编码能力上一直追不上 Claude Code 和 Codex,而 Cursor 手握全球规模最大的开发者操作轨迹。交易让 Cursor 在 SpaceX 的 Colossus 超算上训练自家 Composer 模型,xAI 同时用相同数据训练 Grok,双方一起验证 Cursor 的数据能否拉开差距。
他认为期权结构正是为这种不确定性定价:数据有用,SpaceX 以 600 亿美元买下 Cursor 和整条管线;没用,付 100 亿美元当实验费。他总结称,一家准上市公司刚为「开发者轨迹是否是编码 Agent 的稀缺资源」标了价,100 亿是实验成本,600 亿是答案为「是」时的估值。
信源:https://x.com/anandnk24/status/2046784367456841969
AI 模型评估公司 PatronusAI 联合创始人 Anand Kannappan 在 X 发文,认为外界把 SpaceX 与 Cursor 的交易当成并购是误读,核心是一场实验:开发者行为数据到底是不是编码模型的真正瓶颈。
按他的分析,xAI 的 Grok 在编码能力上一直追不上 Claude Code 和 Codex,而 Cursor 手握全球规模最大的开发者操作轨迹。交易让 Cursor 在 SpaceX 的 Colossus 超算上训练自家 Composer 模型,xAI 同时用相同数据训练 Grok,双方一起验证 Cursor 的数据能否拉开差距。
他认为期权结构正是为这种不确定性定价:数据有用,SpaceX 以 600 亿美元买下 Cursor 和整条管线;没用,付 100 亿美元当实验费。他总结称,一家准上市公司刚为「开发者轨迹是否是编码 Agent 的稀缺资源」标了价,100 亿是实验成本,600 亿是答案为「是」时的估值。
信源:https://x.com/anandnk24/status/2046784367456841969
Altman首谈家宅连续遇袭:头天晚上还说「至少没人想杀我」
Sam Altman 在 Core Memory 播客中首次回应了此前的家宅连续遇袭事件。他说事发前一晚,几位同事在家里吃饭,谈起媒体的密集负面报道,有人安慰他「压力这么大,但某种意义上也算好事」。Altman 当时回了一句:「至少没人想杀我。」第二天燃烧弹就扔到了他家。
Altman 称这件事「让一切都有了参照」:别人在网上说什么难听的话,只要仅限于说,就不算大事。他没有展开描述袭击细节,只说「还会有更多类似的事」,然后把话题转回工作。
Altman 的住宅在 4 月 10 日和 12 日连遭两次袭击。第一起是 20 岁男子 Daniel Moreno-Gama 向住宅大门投掷燃烧弹,安保人员迅速扑灭,无人受伤。Moreno-Gama 随后在 OpenAI 总部附近被捕,身上携带反 AI 宣言,面临企图谋杀、纵火等多项重罪指控,联邦探员后在其得州住所搜出更多材料。两天后的 4 月 12 日凌晨,一辆本田轿车驶过 Altman 住宅时,车内乘客开了一枪,两名嫌疑人 Amanda Tom 和 Muhamad Tarik Hussein 因疑似过失开枪被捕,警方搜到三把枪支。警方表示两起事件的嫌疑人之间没有关联。
信源:https://www.corememory.com/p/the-great-reset-at-openai-ep-67-sam-altman-greg-brockman
Sam Altman 在 Core Memory 播客中首次回应了此前的家宅连续遇袭事件。他说事发前一晚,几位同事在家里吃饭,谈起媒体的密集负面报道,有人安慰他「压力这么大,但某种意义上也算好事」。Altman 当时回了一句:「至少没人想杀我。」第二天燃烧弹就扔到了他家。
Altman 称这件事「让一切都有了参照」:别人在网上说什么难听的话,只要仅限于说,就不算大事。他没有展开描述袭击细节,只说「还会有更多类似的事」,然后把话题转回工作。
Altman 的住宅在 4 月 10 日和 12 日连遭两次袭击。第一起是 20 岁男子 Daniel Moreno-Gama 向住宅大门投掷燃烧弹,安保人员迅速扑灭,无人受伤。Moreno-Gama 随后在 OpenAI 总部附近被捕,身上携带反 AI 宣言,面临企图谋杀、纵火等多项重罪指控,联邦探员后在其得州住所搜出更多材料。两天后的 4 月 12 日凌晨,一辆本田轿车驶过 Altman 住宅时,车内乘客开了一枪,两名嫌疑人 Amanda Tom 和 Muhamad Tarik Hussein 因疑似过失开枪被捕,警方搜到三把枪支。警方表示两起事件的嫌疑人之间没有关联。
信源:https://www.corememory.com/p/the-great-reset-at-openai-ep-67-sam-altman-greg-brockman
Corememory
The Great Reset At OpenAI — EP 67 Sam Altman And Greg Brockman
The last two standing - on everything
❤1
Brockman接管OpenAI产品整合,Sora因「技术树分叉」被砍
OpenAI 总裁 Greg Brockman 在同一期 Core Memory 播客中透露,他已接手公司整体产品和配套研究的整合工作,上任约「几周」。CEO Altman 称这项变动让公司内部「明显开心了很多」。
Brockman 给出三条产品主线。第一是 Agent 平台,「执行非常顺利」,未来几周有新发布。第二是「计算机工作」,他刻意不用「知识工作」一词,称「没人觉得自己是知识工作者」,核心是把 Codex 从面向工程师扩展为面向所有人。第三是「个人 AGI」,让 ChatGPT 变成有用户上下文、能自主行动的代理,例子是 AI 发现你喜欢的音乐人来本地演出,直接帮你买票。
整合的代价是砍支线。Brockman 确认 Sora 被降级,原因有二:底层模型与 GPT 主线不同,属于「技术树的另一个分支」;创意视频表达不在三条主线之内。他补充称 Sora 团队工作「很出色」,技术「会在其他应用里延续」。同理,他还回顾了 2018 年被砍的机械手项目:用跟打电竞相同的强化学习算法训练,但腱绳 20 小时就断,工程师得半夜赶来修,「那支团队后来去做了 GitHub Copilot」。
信源:https://www.corememory.com/p/the-great-reset-at-openai-ep-67-sam-altman-greg-brockman
OpenAI 总裁 Greg Brockman 在同一期 Core Memory 播客中透露,他已接手公司整体产品和配套研究的整合工作,上任约「几周」。CEO Altman 称这项变动让公司内部「明显开心了很多」。
Brockman 给出三条产品主线。第一是 Agent 平台,「执行非常顺利」,未来几周有新发布。第二是「计算机工作」,他刻意不用「知识工作」一词,称「没人觉得自己是知识工作者」,核心是把 Codex 从面向工程师扩展为面向所有人。第三是「个人 AGI」,让 ChatGPT 变成有用户上下文、能自主行动的代理,例子是 AI 发现你喜欢的音乐人来本地演出,直接帮你买票。
整合的代价是砍支线。Brockman 确认 Sora 被降级,原因有二:底层模型与 GPT 主线不同,属于「技术树的另一个分支」;创意视频表达不在三条主线之内。他补充称 Sora 团队工作「很出色」,技术「会在其他应用里延续」。同理,他还回顾了 2018 年被砍的机械手项目:用跟打电竞相同的强化学习算法训练,但腱绳 20 小时就断,工程师得半夜赶来修,「那支团队后来去做了 GitHub Copilot」。
信源:https://www.corememory.com/p/the-great-reset-at-openai-ep-67-sam-altman-greg-brockman
Corememory
The Great Reset At OpenAI — EP 67 Sam Altman And Greg Brockman
The last two standing - on everything
Altman亲述与Musk谈判破裂:逐步让步到「绝对控制权」
Altman 在 Core Memory 播客中详细描述了早期与 Elon Musk 的谈判过程。他称四位核心成员,他本人、Brockman、Ilya Sutskever 和 Musk,都同意 OpenAI 需要转为营利性公司。谈判一度接近达成:Musk 要求占多数股权,他们让步了;Musk 要求当 CEO「让所有人知道他说了算」,他们也答应了。但 Musk 最终要求「对 OpenAI 的绝对控制权」,这成为破裂点。原话:「不应该有一个人掌控整个未来,不管那个人是谁。」
Altman 称这个版本「多年来从未对外讲过」,即将开庭的诉讼「让我们别无选择」。他把庭审视为「讲故事的机会」,同时担心 Musk 在开庭前撤诉,「那我们就没机会把这些都讲清楚了」。双方诉讼定于 4 月 27 日开庭,Musk 索赔 790 亿到 1340 亿美元。
信源:https://www.corememory.com/p/the-great-reset-at-openai-ep-67-sam-altman-greg-brockman
Altman 在 Core Memory 播客中详细描述了早期与 Elon Musk 的谈判过程。他称四位核心成员,他本人、Brockman、Ilya Sutskever 和 Musk,都同意 OpenAI 需要转为营利性公司。谈判一度接近达成:Musk 要求占多数股权,他们让步了;Musk 要求当 CEO「让所有人知道他说了算」,他们也答应了。但 Musk 最终要求「对 OpenAI 的绝对控制权」,这成为破裂点。原话:「不应该有一个人掌控整个未来,不管那个人是谁。」
Altman 称这个版本「多年来从未对外讲过」,即将开庭的诉讼「让我们别无选择」。他把庭审视为「讲故事的机会」,同时担心 Musk 在开庭前撤诉,「那我们就没机会把这些都讲清楚了」。双方诉讼定于 4 月 27 日开庭,Musk 索赔 790 亿到 1340 亿美元。
信源:https://www.corememory.com/p/the-great-reset-at-openai-ep-67-sam-altman-greg-brockman
Corememory
The Great Reset At OpenAI — EP 67 Sam Altman And Greg Brockman
The last two standing - on everything
Brockman称GPT-5.4 Pro已解出新Erdős问题,预告新模型将补齐写作短板
Brockman 在 Core Memory 播客中透露了两个具体产品进展。一是 GPT-5.4 Pro 已被用户用于解出一个新的 Erdős 问题,他称这「看起来真的很重要」。他对比说,两年前 OpenAI 要让模型拿计算奥林匹克铜牌,需要 20 人团队花两周加大量算力专门训练;现在「一个很随意训练的模型」就能做到,「如果把这个能力指向药物发现会怎样?没有人在定价这件事。」
二是针对主持人 Ashley Vance 批评大模型写作「没有灵魂」,Altman 承认「我们在个性化上还没到位」,Brockman 随即补了一句:「我们在这个维度上也有新模型要出,播客上线之后你可以试试,告诉我们有没有变好。」
信源:https://www.corememory.com/p/the-great-reset-at-openai-ep-67-sam-altman-greg-brockman
Brockman 在 Core Memory 播客中透露了两个具体产品进展。一是 GPT-5.4 Pro 已被用户用于解出一个新的 Erdős 问题,他称这「看起来真的很重要」。他对比说,两年前 OpenAI 要让模型拿计算奥林匹克铜牌,需要 20 人团队花两周加大量算力专门训练;现在「一个很随意训练的模型」就能做到,「如果把这个能力指向药物发现会怎样?没有人在定价这件事。」
二是针对主持人 Ashley Vance 批评大模型写作「没有灵魂」,Altman 承认「我们在个性化上还没到位」,Brockman 随即补了一句:「我们在这个维度上也有新模型要出,播客上线之后你可以试试,告诉我们有没有变好。」
信源:https://www.corememory.com/p/the-great-reset-at-openai-ep-67-sam-altman-greg-brockman
Corememory
The Great Reset At OpenAI — EP 67 Sam Altman And Greg Brockman
The last two standing - on everything
NeoCognition获4000万美元种子轮,做能在岗学习的专业化AI智能体
AI 研究实验室 NeoCognition 宣布完成 4000 万美元种子轮融资,走出隐身模式。公司总部在加州帕洛阿尔托,由俄亥俄州立大学副教授 Yu Su 与 Xiang Deng、Yu Gu 联合创立。本轮超额认购,Cambium Capital 和 Walden Catalyst Ventures 联合领投,Vista Equity Partners 参投。天使投资人包括英特尔 CEO Lip-Bu Tan、Databricks 联合创始人兼执行董事长 Ion Stoica,以及 AI 研究者 Dawn Song、Ruslan Salakhutdinov 和 Luke Zettlemoyer。
NeoCognition 要解决的问题是智能体的可靠性。创始人 Yu Su 称,当前 AI 智能体按预期完成任务的成功率只有约 50%,每次执行都像掷骰子。公司的做法是让智能体通过实际使用自主构建所在领域的「世界模型」,捕捉具体业务环境中的规则、关系和约束,在岗位上快速专业化,而不是依赖通用预训练。Yu Su 在 ChatGPT 之前就在俄亥俄州立大学建立了 LLM 智能体研究实验室,团队此前的代表工作包括 Mind2Web、MMMU 和 SeeAct。
商业路线面向企业端,主要服务 SaaS 公司,帮它们在自有产品和运营流程里嵌入能持续改进的 AI 员工。Vista Equity Partners 持有大量企业软件公司,参投也被视为分销渠道。团队约 15 人,多数持有博士学位,目前尚无公开产品。
信源:https://thenextweb.com/news/neocognition-40m-seed-self-learning-ai-agents
AI 研究实验室 NeoCognition 宣布完成 4000 万美元种子轮融资,走出隐身模式。公司总部在加州帕洛阿尔托,由俄亥俄州立大学副教授 Yu Su 与 Xiang Deng、Yu Gu 联合创立。本轮超额认购,Cambium Capital 和 Walden Catalyst Ventures 联合领投,Vista Equity Partners 参投。天使投资人包括英特尔 CEO Lip-Bu Tan、Databricks 联合创始人兼执行董事长 Ion Stoica,以及 AI 研究者 Dawn Song、Ruslan Salakhutdinov 和 Luke Zettlemoyer。
NeoCognition 要解决的问题是智能体的可靠性。创始人 Yu Su 称,当前 AI 智能体按预期完成任务的成功率只有约 50%,每次执行都像掷骰子。公司的做法是让智能体通过实际使用自主构建所在领域的「世界模型」,捕捉具体业务环境中的规则、关系和约束,在岗位上快速专业化,而不是依赖通用预训练。Yu Su 在 ChatGPT 之前就在俄亥俄州立大学建立了 LLM 智能体研究实验室,团队此前的代表工作包括 Mind2Web、MMMU 和 SeeAct。
商业路线面向企业端,主要服务 SaaS 公司,帮它们在自有产品和运营流程里嵌入能持续改进的 AI 员工。Vista Equity Partners 持有大量企业软件公司,参投也被视为分销渠道。团队约 15 人,多数持有博士学位,目前尚无公开产品。
信源:https://thenextweb.com/news/neocognition-40m-seed-self-learning-ai-agents
TNW
NeoCognition raises $40M seed to build AI agents that specialise through experience rather than pre-training
NeoCognition raises $40M from Cambium Capital, Walden Catalyst, Vista, Intel CEO Lip-Bu Tan and Databricks to build self-learning AI agents for enterprise.
微软搭建AI智能体时代的商业交易基础设施
微软 AI 变现副总裁 Tim Frank 宣布一组面向「智能体网络」(agentic web)的商业基础设施更新,目标是让出版商、商家和广告主在 AI 智能体代替用户做决策的场景里继续被发现、被引用、被交易。
核心分三块。第一是出版商内容市场(Publisher Content Marketplace,PCM),去年 Axios 首次报道,现在扩大规模。PCM 帮出版商在 AI 平台引用其付费内容时获得补偿,覆盖地图数据、商品目录、新闻、健康信息等非免费信息。Copilot 是首个接入的需求方,微软正与其他 AI 平台谈判接入。与当前出版商和 AI 平台之间一次性打包付费的 RAG 授权协议不同,PCM 走的是持续交易的市场化路线。
第二是商业协议支持。微软在 Merchant Center 正式上线 Universal Commerce Protocol(UCP)数据源,这是谷歌联合 Shopify 等公司制定的开放标准,让 AI 智能体能直接读取结构化商品信息。同时将 Shopify 的 Global Catalog 接入 Copilot,超过 50 万商家的商品可在 Copilot 里被检索和交易。微软称,Shopify 头部商家接入后在 Copilot 中的曝光份额增长了约 90%。Copilot Checkout 扩展至移动端,并接入 Target 等零售商的会员体系。
第三是广告和洞察工具。Microsoft Clarity 的 AI Visibility 功能扩大开放,帮品牌看到自家网页在 AI 回答中被引用的频率、竞品引用对比和内容缺口建议。新推出 AI Max 搜索广告(5 月公测)、Offer Highlights(在 Copilot 对话中展示商品卖点)和 Audience generation(用自然语言描述目标人群,AI 自动生成受众定向)。
微软表示不会抽取交易佣金,只收技术服务费,费率会保持低位。Frank 称公司 51 年来以企业服务为主,没有作为平台与客户竞争的利益冲突。
信源:https://about.ads.microsoft.com/en/blog/post/april-2026/win-across-all-three-eras-of-the-web
微软 AI 变现副总裁 Tim Frank 宣布一组面向「智能体网络」(agentic web)的商业基础设施更新,目标是让出版商、商家和广告主在 AI 智能体代替用户做决策的场景里继续被发现、被引用、被交易。
核心分三块。第一是出版商内容市场(Publisher Content Marketplace,PCM),去年 Axios 首次报道,现在扩大规模。PCM 帮出版商在 AI 平台引用其付费内容时获得补偿,覆盖地图数据、商品目录、新闻、健康信息等非免费信息。Copilot 是首个接入的需求方,微软正与其他 AI 平台谈判接入。与当前出版商和 AI 平台之间一次性打包付费的 RAG 授权协议不同,PCM 走的是持续交易的市场化路线。
第二是商业协议支持。微软在 Merchant Center 正式上线 Universal Commerce Protocol(UCP)数据源,这是谷歌联合 Shopify 等公司制定的开放标准,让 AI 智能体能直接读取结构化商品信息。同时将 Shopify 的 Global Catalog 接入 Copilot,超过 50 万商家的商品可在 Copilot 里被检索和交易。微软称,Shopify 头部商家接入后在 Copilot 中的曝光份额增长了约 90%。Copilot Checkout 扩展至移动端,并接入 Target 等零售商的会员体系。
第三是广告和洞察工具。Microsoft Clarity 的 AI Visibility 功能扩大开放,帮品牌看到自家网页在 AI 回答中被引用的频率、竞品引用对比和内容缺口建议。新推出 AI Max 搜索广告(5 月公测)、Offer Highlights(在 Copilot 对话中展示商品卖点)和 Audience generation(用自然语言描述目标人群,AI 自动生成受众定向)。
微软表示不会抽取交易佣金,只收技术服务费,费率会保持低位。Frank 称公司 51 年来以企业服务为主,没有作为平台与客户竞争的利益冲突。
信源:https://about.ads.microsoft.com/en/blog/post/april-2026/win-across-all-three-eras-of-the-web
Anthropic上线Prompt Caching Dashboard,可视化缓存命中与成本
Claude Developer Console 上线 Prompt Caching Dashboard,入口在 platform.claude.com/usage/cache。
仪表盘按工作区、模型和时间段筛选,主要展示三项数据:缓存读取率(cache read ratio),即请求中命中已有缓存的比例;缓存用量构成,把输入 token 拆成未缓存、5 分钟缓存写入、1 小时缓存写入和缓存读取四类,以堆叠条形图呈现;写入摊销倍数(write amortization),衡量一次缓存写入被后续读取复用了多少次。截图示例中 Claude Opus 4.6 在 7 天内处理了 27.4 亿输入 token,读取率 85.4%,写入摊销 8.65 倍。底部还有按 1 小时到 24 小时粒度的缓存读取率时序图。
Anthropic 的提示缓存机制允许 API 用户把系统提示、长上下文等固定内容标记为可缓存,首次写入收取额外费用,后续命中则按标准输入价的约一折计费。缓存默认保留 5 分钟,付费可延至 1 小时。此前用户只能从 API 返回的 token 计数字段间接判断缓存效果,没有可视化工具。
信源:https://x.com/ClaudeDevs/status/2046710816884625509
Claude Developer Console 上线 Prompt Caching Dashboard,入口在 platform.claude.com/usage/cache。
仪表盘按工作区、模型和时间段筛选,主要展示三项数据:缓存读取率(cache read ratio),即请求中命中已有缓存的比例;缓存用量构成,把输入 token 拆成未缓存、5 分钟缓存写入、1 小时缓存写入和缓存读取四类,以堆叠条形图呈现;写入摊销倍数(write amortization),衡量一次缓存写入被后续读取复用了多少次。截图示例中 Claude Opus 4.6 在 7 天内处理了 27.4 亿输入 token,读取率 85.4%,写入摊销 8.65 倍。底部还有按 1 小时到 24 小时粒度的缓存读取率时序图。
Anthropic 的提示缓存机制允许 API 用户把系统提示、长上下文等固定内容标记为可缓存,首次写入收取额外费用,后续命中则按标准输入价的约一折计费。缓存默认保留 5 分钟,付费可延至 1 小时。此前用户只能从 API 返回的 token 计数字段间接判断缓存效果,没有可视化工具。
信源:https://x.com/ClaudeDevs/status/2046710816884625509
Claude Platform
Caching | Claude Platform
Build on the Claude Platform
General Reasoning开源Firehorse,用强模型给开源模型「录课」生成训练数据
AI 基础设施公司 General Reasoning 开源 Python 工具 Firehorse,用途是让 Claude、Gemini 等强模型在真实编程任务环境里完整「表演」一遍解题过程,把每一步的思考、工具调用、环境反馈和奖励分数录成结构化数据,再拿这些数据去微调开源模型。简单说,强模型当老师,开源模型当学生,Firehorse 负责录课和批作业。
此前要做这件事,每换一个 agent 执行器(如 Claude Code、Codex、Gemini CLI)就要手动对接一遍环境工具集。Firehorse 把适配层统一掉,一行命令指定执行器、模型和任务环境即可并发运行,输出的 JSONL 轨迹可直接用于微调,也可实时推送到 General Reasoning 的 OpenReward 平台。
除了生成训练数据,Firehorse 也可以直接做评测。仓库自带两类示例:Terminal-Bench-2-Verified(89 道涵盖编译、密码学、系统管理等的终端任务)用于测模型能力;Nebius 提供的 SWE-rebench-V2(32000+ 道跨 Python、JavaScript、Go、Rust 的真实工程任务)用于大规模生成训练数据。
信源:https://www.gr.inc/releases/introducing-firehorse
AI 基础设施公司 General Reasoning 开源 Python 工具 Firehorse,用途是让 Claude、Gemini 等强模型在真实编程任务环境里完整「表演」一遍解题过程,把每一步的思考、工具调用、环境反馈和奖励分数录成结构化数据,再拿这些数据去微调开源模型。简单说,强模型当老师,开源模型当学生,Firehorse 负责录课和批作业。
此前要做这件事,每换一个 agent 执行器(如 Claude Code、Codex、Gemini CLI)就要手动对接一遍环境工具集。Firehorse 把适配层统一掉,一行命令指定执行器、模型和任务环境即可并发运行,输出的 JSONL 轨迹可直接用于微调,也可实时推送到 General Reasoning 的 OpenReward 平台。
除了生成训练数据,Firehorse 也可以直接做评测。仓库自带两类示例:Terminal-Bench-2-Verified(89 道涵盖编译、密码学、系统管理等的终端任务)用于测模型能力;Nebius 提供的 SWE-rebench-V2(32000+ 道跨 Python、JavaScript、Go、Rust 的真实工程任务)用于大规模生成训练数据。
信源:https://www.gr.inc/releases/introducing-firehorse
www.gr.inc
Introducing Firehorse | General Reasoning
Firehorse is a Python library of agent harnesses for sampling trajectories from OpenReward environments.
Odyssey发布世界模型Odyssey-2 Max,物理仿真得分领先同类模型
世界模型公司 Odyssey 发布 Odyssey-2 Max,参数量为前代 Odyssey-2 Pro 的 3 倍,训练计算量 10 倍,是该公司迄今最大的通用世界模型。与 Sora、Veo 等双向视频模型不同,Odyssey-2 Max 采用因果自回归架构,逐帧预测下一状态并接受实时交互输入,能持续生成 120 秒以上的模拟画面而不崩溃。
在物理仿真准确度上,Odyssey-2 Max 在 VBench 2 物理子项得分 58.52,高于 Odyssey-2 Pro 的 49.67 和英伟达 Cosmos-Predict2.5-14B 的 44.92;在 PAI-Bench 物理子项得分 93.02。模型基于自回归扩散 Transformer(AR DiT)架构,使用连续流匹配生成,并通过少步去噪蒸馏实现实时推理。训练在数百张英伟达 B200 GPU 上完成,分三阶段进行:大规模视频预训练、交互与任务条件化、长时序稳定性训练。
Odyssey 由自动驾驶行业出身的 Oliver Cameron(CEO)和 Jeff Hawke(CTO)创办,此前累计融资 2700 万美元。Odyssey-2 Max 现已向机器人、游戏、仿真、国防和交互系统领域的合作伙伴开放 Private Beta。
信源:https://odyssey.ml/introducing-odyssey-2-max
世界模型公司 Odyssey 发布 Odyssey-2 Max,参数量为前代 Odyssey-2 Pro 的 3 倍,训练计算量 10 倍,是该公司迄今最大的通用世界模型。与 Sora、Veo 等双向视频模型不同,Odyssey-2 Max 采用因果自回归架构,逐帧预测下一状态并接受实时交互输入,能持续生成 120 秒以上的模拟画面而不崩溃。
在物理仿真准确度上,Odyssey-2 Max 在 VBench 2 物理子项得分 58.52,高于 Odyssey-2 Pro 的 49.67 和英伟达 Cosmos-Predict2.5-14B 的 44.92;在 PAI-Bench 物理子项得分 93.02。模型基于自回归扩散 Transformer(AR DiT)架构,使用连续流匹配生成,并通过少步去噪蒸馏实现实时推理。训练在数百张英伟达 B200 GPU 上完成,分三阶段进行:大规模视频预训练、交互与任务条件化、长时序稳定性训练。
Odyssey 由自动驾驶行业出身的 Oliver Cameron(CEO)和 Jeff Hawke(CTO)创办,此前累计融资 2700 万美元。Odyssey-2 Max 现已向机器人、游戏、仿真、国防和交互系统领域的合作伙伴开放 Private Beta。
信源:https://odyssey.ml/introducing-odyssey-2-max
odyssey.ml
Introducing Odyssey-2 Max: Scaled World Simulation
Today we’re introducing Odyssey-2 Max, our largest, most powerful general purpose world model yet. Odyssey-2 Max materially advances the state-of-the-art in physical accuracy of world models.
动察Beating AI News
OpenClaw创始人回应Claude CLI「解禁」传闻:口头允许但实际仍被封 有人把 OpenClaw 最新文档里那句「Anthropic 允许 OpenClaw 风格的 Claude CLI 使用」截图发到 Hacker News,帖子被顶上首页,又在 X 被连带转起来。OpenClaw 创始人 Peter Steinberger 先后在两边回应,给出目前最清楚的版本:口头允许是真的,实际封锁也是真的。 按 Steinberger 的说法,Claude Code 负责人 Boris Cherny…
「Claude CLI解禁OpenClaw」乌龙事件实为Peter单方面误读
昨天 OpenClaw 用户围绕「Anthropic 是不是又允许了 Claude CLI」的讨论,把事实线捋一遍就清楚:Anthropic 从未松动政策,变化的只是 OpenClaw 创始人 Peter Steinberger 对 Claude Code 负责人 Boris Cherny 一句表态的理解,这个理解 Anthropic 服务端的分类器用实际行为否认了两次。
Boris 4 月 6 日那条回复发在 Steinberger 实验推文下方。实验本身很简单:用官方 Claude CLI 的
但 Peter 在 v2026.4.7 直接把 Claude CLI 恢复为新用户默认后端,文档里写「OpenClaw 将
这就是今天 Steinberger 表态承认的「理论上应当可用,实际上并不通」。换个说法:他以为拿到的允许覆盖 OpenClaw,事实证明没有。所谓「灰色地带」不是 Anthropic 态度暧昧,而是一次被模糊措辞掩盖的分歧:Boris 想修的是分类器的误伤边界,Peter 听成了「边界里有 OpenClaw」。
昨天 OpenClaw 用户围绕「Anthropic 是不是又允许了 Claude CLI」的讨论,把事实线捋一遍就清楚:Anthropic 从未松动政策,变化的只是 OpenClaw 创始人 Peter Steinberger 对 Claude Code 负责人 Boris Cherny 一句表态的理解,这个理解 Anthropic 服务端的分类器用实际行为否认了两次。
Boris 4 月 6 日那条回复发在 Steinberger 实验推文下方。实验本身很简单:用官方 Claude CLI 的
-p 参数发请求,仅在系统提示词里写了句「running inside OpenClaw」,就被判第三方应用并从 Extra Usage 扣费。Boris 承认这是滥用分类器反应过度,承诺完善 -p 的使用条款。这句话针对的是「拿官方 CLI 跑脚本的开发者个人不该被误扫」,不是「OpenClaw 这类工具从此被豁免」。但 Peter 在 v2026.4.7 直接把 Claude CLI 恢复为新用户默认后端,文档里写「OpenClaw 将
claude -p 复用视为已获默许」,还主动关掉 heartbeat 等高消耗功能以示合规。这一步是他自己把「CLI use is allowed」延伸成「OpenClaw 底层就是 claude -p 所以也算 CLI 使用」。Anthropic 从未公开认可过这种延伸。服务端分类器按 OpenClaw 特征(目前公开确认的主要是系统提示指纹)继续拒绝,因为 OpenClaw 注入的那段 prompt 在它眼里就是「第三方工具在驱动 CLI」的最强信号。底层调的是官方 CLI,但真正发起请求的主体仍然是 OpenClaw,所以仍然按第三方计费。这就是今天 Steinberger 表态承认的「理论上应当可用,实际上并不通」。换个说法:他以为拿到的允许覆盖 OpenClaw,事实证明没有。所谓「灰色地带」不是 Anthropic 态度暧昧,而是一次被模糊措辞掩盖的分歧:Boris 想修的是分类器的误伤边界,Peter 听成了「边界里有 OpenClaw」。
传腾讯阿里洽谈投资DeepSeek,估值目标升至200亿美元以上
《The Information》援引四名知情人士称,腾讯和阿里巴巴正在洽谈投资 DeepSeek。DeepSeek 由量化对冲基金幻方量化持有,此前从未接受外部资金。《The Information》上周五率先报道 DeepSeek 启动首轮融资,目标为至少 3 亿美元、估值不低于 100 亿美元;由于意向投资者反响强烈,估值目标已升至 200 亿美元以上。
谈判仍在进行,估值和融资金额均可能变动。知情人士称,200 亿美元的定价部分参照月之暗面正在敲定的新一轮 180 亿美元估值。竞争对手 MiniMax 和智谱今年 1 月在港股上市时估值均不到 100 亿美元,目前智谱市值超 500 亿美元,MiniMax 超 300 亿美元。但 DeepSeek 尚未产生有意义的收入,模型持续开源,聊天机器人免费开放。
创始人梁文锋多年不引入外部资金,转变的背景是多重压力:下一代旗舰模型 V4 原定 2 月发布,因工程难题多次推迟;近几个月有核心研究人员流失至中国科技巨头;V4 目前在英伟达 Blackwell 芯片上训练,该芯片已被美国禁止向中国出口,团队同时花了数月将模型适配华为和寒武纪的芯片。腾讯和阿里此前已投资智谱、MiniMax、月之暗面等中国头部 AI 公司。
信源:https://www.theinformation.com/articles/tencent-alibaba-in-talks-to-invest-in-deepseek-at-20-billion-plus-valuation
《The Information》援引四名知情人士称,腾讯和阿里巴巴正在洽谈投资 DeepSeek。DeepSeek 由量化对冲基金幻方量化持有,此前从未接受外部资金。《The Information》上周五率先报道 DeepSeek 启动首轮融资,目标为至少 3 亿美元、估值不低于 100 亿美元;由于意向投资者反响强烈,估值目标已升至 200 亿美元以上。
谈判仍在进行,估值和融资金额均可能变动。知情人士称,200 亿美元的定价部分参照月之暗面正在敲定的新一轮 180 亿美元估值。竞争对手 MiniMax 和智谱今年 1 月在港股上市时估值均不到 100 亿美元,目前智谱市值超 500 亿美元,MiniMax 超 300 亿美元。但 DeepSeek 尚未产生有意义的收入,模型持续开源,聊天机器人免费开放。
创始人梁文锋多年不引入外部资金,转变的背景是多重压力:下一代旗舰模型 V4 原定 2 月发布,因工程难题多次推迟;近几个月有核心研究人员流失至中国科技巨头;V4 目前在英伟达 Blackwell 芯片上训练,该芯片已被美国禁止向中国出口,团队同时花了数月将模型适配华为和寒武纪的芯片。腾讯和阿里此前已投资智谱、MiniMax、月之暗面等中国头部 AI 公司。
信源:https://www.theinformation.com/articles/tencent-alibaba-in-talks-to-invest-in-deepseek-at-20-billion-plus-valuation
✍1
美国农业部与Palantir签署3亿美元协议,推进农场安全与数字化服务
美国农业部(USDA)与 Palantir 签署 3 亿美元总括采购协议(BPA),用于支持国家农场安全行动计划(NFSAP)和「One Farmer, One File」数字化改革。协议覆盖两个方向:将农场安全纳入国家安全框架,包括监控农地所有权变动、供应链韧性和项目反欺诈;加速面向农民的服务交付。
底层平台为 Palantir 驱动的 Landmark,负责将 USDA 分散的遗留系统整合为统一数据基座。Landmark 今年 2 月已支撑了 110 亿美元的 Farmer Bridge 援助计划上线,开放注册 62 分钟即打破 USDA 历史线上注册纪录,头 5 天向农民直接发放超 44 亿美元,农民无需前往县办公室即可完成登记。
新协议在此基础上扩展两类工具:一是农民端自助服务,可在线上报耕地面积、申请灾后恢复,减少往返田间办公室的时间;二是田间工作人员的移动端工具,用于加快审核和放款流程。
信源:https://www.businesswire.com/news/home/20260422128086/en/USDA-and-Palantir-Launch-Partnership-to-Deliver-Faster-Modernized-Support-for-Farmers
美国农业部(USDA)与 Palantir 签署 3 亿美元总括采购协议(BPA),用于支持国家农场安全行动计划(NFSAP)和「One Farmer, One File」数字化改革。协议覆盖两个方向:将农场安全纳入国家安全框架,包括监控农地所有权变动、供应链韧性和项目反欺诈;加速面向农民的服务交付。
底层平台为 Palantir 驱动的 Landmark,负责将 USDA 分散的遗留系统整合为统一数据基座。Landmark 今年 2 月已支撑了 110 亿美元的 Farmer Bridge 援助计划上线,开放注册 62 分钟即打破 USDA 历史线上注册纪录,头 5 天向农民直接发放超 44 亿美元,农民无需前往县办公室即可完成登记。
新协议在此基础上扩展两类工具:一是农民端自助服务,可在线上报耕地面积、申请灾后恢复,减少往返田间办公室的时间;二是田间工作人员的移动端工具,用于加快审核和放款流程。
信源:https://www.businesswire.com/news/home/20260422128086/en/USDA-and-Palantir-Launch-Partnership-to-Deliver-Faster-Modernized-Support-for-Farmers
Businesswire
USDA and Palantir Launch Partnership to Deliver Faster, Modernized Support for Farmers
The U.S. Department of Agriculture (USDA) and Palantir Technologies Inc. (NASDAQ: PLTR) announced the signing of a $300 million Blanket Purchase Agreement (B...
通义千问开源Qwen3.6-27B,27B稠密模型编码能力超上代397B旗舰
阿里通义千问团队开源 Qwen3.6-27B,一个 270 亿参数的稠密多模态模型,主打编码 agent 能力。这是继 API 版 Qwen3.6-Plus 和小激活量 MoE 版 Qwen3.6-35B-A3B 之后,Qwen3.6 系列的第三个成员,权重已在 Hugging Face 和 ModelScope 发布。
核心卖点是用 27B 稠密架构全面超越上一代开源旗舰 Qwen3.5-397B-A17B(397B 总参、17B 激活的 MoE 模型)。在编码 agent 基准上,SWE-bench Verified 77.2 对 76.2,SWE-bench Pro 53.5 对 50.9,Terminal-Bench 2.0 59.3 对 52.5,SkillsBench 48.2 对 30.0。推理任务上 GPQA Diamond 得分 87.8,接近数倍参数量的模型。视觉 agent 方面 AndroidWorld 得分 70.3,高于 Qwen3.5-27B 的 64.2。
模型原生支持图像和视频输入,思考模式和非思考模式共用同一组权重。稠密架构不涉及 MoE 路由,部署比 397B MoE 简单。官方文档显示可直接接入 OpenClaw、Claude Code 和 Qwen Code 三款终端编码工具。API 将在阿里云百炼平台上线。
信源:https://huggingface.co/Qwen/Qwen3.6-27B
阿里通义千问团队开源 Qwen3.6-27B,一个 270 亿参数的稠密多模态模型,主打编码 agent 能力。这是继 API 版 Qwen3.6-Plus 和小激活量 MoE 版 Qwen3.6-35B-A3B 之后,Qwen3.6 系列的第三个成员,权重已在 Hugging Face 和 ModelScope 发布。
核心卖点是用 27B 稠密架构全面超越上一代开源旗舰 Qwen3.5-397B-A17B(397B 总参、17B 激活的 MoE 模型)。在编码 agent 基准上,SWE-bench Verified 77.2 对 76.2,SWE-bench Pro 53.5 对 50.9,Terminal-Bench 2.0 59.3 对 52.5,SkillsBench 48.2 对 30.0。推理任务上 GPQA Diamond 得分 87.8,接近数倍参数量的模型。视觉 agent 方面 AndroidWorld 得分 70.3,高于 Qwen3.5-27B 的 64.2。
模型原生支持图像和视频输入,思考模式和非思考模式共用同一组权重。稠密架构不涉及 MoE 路由,部署比 397B MoE 简单。官方文档显示可直接接入 OpenClaw、Claude Code 和 Qwen Code 三款终端编码工具。API 将在阿里云百炼平台上线。
信源:https://huggingface.co/Qwen/Qwen3.6-27B
huggingface.co
Qwen/Qwen3.6-27B · Hugging Face
We’re on a journey to advance and democratize artificial intelligence through open source and open science.
Yifan Zhang披露DeepSeek V4完整技术规格:1.6T参数、384专家激活6个
普林斯顿博士生 Yifan Zhang 在 X 更新了 DeepSeek V4 的技术细节。他 4 月 19 日预告「V4 下周」并列出三个架构组件名称,今晚给出了完整参数表,同时首次披露存在一个 285B 参数的轻量版 V4-Lite。
V4 总参 1.6T。注意力机制为 DSA2,组合了 DeepSeek 此前在 V3.2 中使用的 DSA(DeepSeek Sparse Attention)和今年初论文提出的 NSA(Native Sparse Attention)两种稀疏注意力方案,head-dim 512,配合 Sparse MQA 和 SWA(滑动窗口注意力)。MoE 层共 384 个专家,每次激活 6 个,使用 Fused MoE Mega-Kernel。残差连接沿用 Hyper-Connections。
训练端首次披露的细节包括:优化器用 Muon(一种将 Newton-Schulz 正交化应用于动量更新的矩阵级优化器),预训练上下文长度 32K,强化学习阶段用 GRPO 并加入 KL 散度校正。最终上下文长度扩展至 1M。模态为纯文本。
Zhang 不在 DeepSeek 任职,DeepSeek 官方未对上述信息做出回应。
信源:https://x.com/yifan_zhang_/status/2046937210813808962
普林斯顿博士生 Yifan Zhang 在 X 更新了 DeepSeek V4 的技术细节。他 4 月 19 日预告「V4 下周」并列出三个架构组件名称,今晚给出了完整参数表,同时首次披露存在一个 285B 参数的轻量版 V4-Lite。
V4 总参 1.6T。注意力机制为 DSA2,组合了 DeepSeek 此前在 V3.2 中使用的 DSA(DeepSeek Sparse Attention)和今年初论文提出的 NSA(Native Sparse Attention)两种稀疏注意力方案,head-dim 512,配合 Sparse MQA 和 SWA(滑动窗口注意力)。MoE 层共 384 个专家,每次激活 6 个,使用 Fused MoE Mega-Kernel。残差连接沿用 Hyper-Connections。
训练端首次披露的细节包括:优化器用 Muon(一种将 Newton-Schulz 正交化应用于动量更新的矩阵级优化器),预训练上下文长度 32K,强化学习阶段用 GRPO 并加入 KL 散度校正。最终上下文长度扩展至 1M。模态为纯文本。
Zhang 不在 DeepSeek 任职,DeepSeek 官方未对上述信息做出回应。
信源:https://x.com/yifan_zhang_/status/2046937210813808962
Anthropic确认调查Mythos未授权访问,称源头为第三方承包商
Anthropic 发表声明称正在调查一份关于 Mythos 模型未授权访问的报告,将源头指向一家第三方承包商,目前没有证据表明访问范围超出该供应商。此前彭博社报道一小批用户通过私人论坛获取了 Mythos 访问权。
Anthropic 测试发现 Mythos 具备高强度计算机安全能力,能找出数千个软件漏洞,因此无限期搁置公开发布,仅向约 50 家维护关键基础设施和软件的公司及机构定向开放,名单包括亚马逊、谷歌和 Linux 基金会,目的是让它们抢在黑客之前修补漏洞。
上周 Anthropic CEO Dario Amodei 与特朗普政府高级官员会面,讨论如何应对 Mythos 带来的网络安全威胁,白宫称会议「富有成效且具建设性」。Anthropic 同时在与政府机构洽谈 Mythos 的提前访问事宜。这次接触可能有助于缓和双方关系,Anthropic 目前因五角大楼模型使用条款争议在两个法院与美国政府对簿公堂。
信源:https://www.wsj.com/tech/ai/anthropic-probes-possible-unauthorized-access-to-mythos-ai-model-3da1ee20
Anthropic 发表声明称正在调查一份关于 Mythos 模型未授权访问的报告,将源头指向一家第三方承包商,目前没有证据表明访问范围超出该供应商。此前彭博社报道一小批用户通过私人论坛获取了 Mythos 访问权。
Anthropic 测试发现 Mythos 具备高强度计算机安全能力,能找出数千个软件漏洞,因此无限期搁置公开发布,仅向约 50 家维护关键基础设施和软件的公司及机构定向开放,名单包括亚马逊、谷歌和 Linux 基金会,目的是让它们抢在黑客之前修补漏洞。
上周 Anthropic CEO Dario Amodei 与特朗普政府高级官员会面,讨论如何应对 Mythos 带来的网络安全威胁,白宫称会议「富有成效且具建设性」。Anthropic 同时在与政府机构洽谈 Mythos 的提前访问事宜。这次接触可能有助于缓和双方关系,Anthropic 目前因五角大楼模型使用条款争议在两个法院与美国政府对簿公堂。
信源:https://www.wsj.com/tech/ai/anthropic-probes-possible-unauthorized-access-to-mythos-ai-model-3da1ee20
The Wall Street Journal
Anthropic Probes Possible Unauthorized Access to Mythos AI Model
The incident could complicate efforts to keep a tight lid on a tool that has spooked the White House and businesses.
谷歌发布第八代TPU,训练推理首次分为两颗独立芯片
谷歌 CEO Sundar Pichai 在 Cloud Next 2026 上发布第八代 TPU,首次将训练和推理拆成两颗独立芯片。
TPU 8t 面向训练。单个超级节点可连接 9600 颗 TPU,提供 121 ExaFlops 算力和 2PB 共享高带宽内存,处理性能为上一代 Ironwood 的 3 倍,能效提升最高 2 倍。芯片间互联带宽翻倍,配合新推出的 Virgo 网络拓扑,最多可将 100 万颗芯片组成单个逻辑集群,实现近线性扩展。谷歌称目标是将前沿模型的开发周期从数月缩短到数周。
TPU 8i 面向推理。单 pod 连接 1152 颗 TPU,配备 288GB 高带宽内存和 384MB 片上 SRAM,后者为 Ironwood 的 3 倍,用于将活跃模型数据尽量留在芯片上。新的 Boardfly 网络拓扑大幅降低延迟,谷歌称同等成本下可服务近两倍的客户量,目标是支撑数百万个 agent 同时运行。
两款芯片均托管在谷歌自研 Arm 架构 Axion CPU 上,配合第四代液冷散热。计划 2026 年晚些时候在 Google Cloud AI Hypercomputer 平台上正式供应,与英伟达 GPU 实例并列提供。
信源:https://blog.google/innovation-and-ai/infrastructure-and-cloud/google-cloud/eighth-generation-tpu-agentic-era/
谷歌 CEO Sundar Pichai 在 Cloud Next 2026 上发布第八代 TPU,首次将训练和推理拆成两颗独立芯片。
TPU 8t 面向训练。单个超级节点可连接 9600 颗 TPU,提供 121 ExaFlops 算力和 2PB 共享高带宽内存,处理性能为上一代 Ironwood 的 3 倍,能效提升最高 2 倍。芯片间互联带宽翻倍,配合新推出的 Virgo 网络拓扑,最多可将 100 万颗芯片组成单个逻辑集群,实现近线性扩展。谷歌称目标是将前沿模型的开发周期从数月缩短到数周。
TPU 8i 面向推理。单 pod 连接 1152 颗 TPU,配备 288GB 高带宽内存和 384MB 片上 SRAM,后者为 Ironwood 的 3 倍,用于将活跃模型数据尽量留在芯片上。新的 Boardfly 网络拓扑大幅降低延迟,谷歌称同等成本下可服务近两倍的客户量,目标是支撑数百万个 agent 同时运行。
两款芯片均托管在谷歌自研 Arm 架构 Axion CPU 上,配合第四代液冷散热。计划 2026 年晚些时候在 Google Cloud AI Hypercomputer 平台上正式供应,与英伟达 GPU 实例并列提供。
信源:https://blog.google/innovation-and-ai/infrastructure-and-cloud/google-cloud/eighth-generation-tpu-agentic-era/
Google
Cloud Next ‘26: Momentum and innovation at Google scale
Google CEO Sundar Pichai discusses the top announcements at Cloud Next 2026.