微软Power Apps上线MCP服务器,业务应用可直接被AI代理调用
微软为低代码开发平台 Power Apps 发布一组 AI 更新,核心是 Power Apps MCP 服务器(5 月 4 日正式上线):企业用 Power Apps 搭建的业务应用,可将数据录入、查询、可视化等能力通过 MCP 协议对外暴露,供 Copilot 和自定义代理直接调用,调用时遵循与人类用户相同的权限和业务规则。
这实现了应用与 AI 的双向打通。向内,Microsoft 365 Copilot 已在 Power Apps 模型驱动应用中正式上线(canvas 应用进入公开预览),用户在应用内可用自然语言搜索数据、自动将邮件转为表单字段、生成活动历史摘要。向外,应用的业务逻辑通过 MCP 输出为代理可调用的工具。微软举例,一个积累了多年招聘政策的 Power Apps 应用,现在可以驱动一个遵守同样规则和权限的 AI 招聘代理,不用从零重写逻辑。
同期推出的「代理动态流」(Agent Feed,5 月正式上线)解决代理监管问题:管理员设定审批阈值,低风险操作后台自动完成,高影响操作(如发送邮件)弹出人工确认,审批界面嵌在业务应用内部,不需要单独的监控工具。MCP 协议此前主要在开发者工具和 AI 编程助手中应用,微软将其引入企业业务软件,是该协议向更广泛企业场景扩展的一步。
信源:https://www.microsoft.com/en-us/power-platform/blog/2026/04/15/making-business-apps-smarter-with-ai-copilot-and-agents-in-power-apps/
微软为低代码开发平台 Power Apps 发布一组 AI 更新,核心是 Power Apps MCP 服务器(5 月 4 日正式上线):企业用 Power Apps 搭建的业务应用,可将数据录入、查询、可视化等能力通过 MCP 协议对外暴露,供 Copilot 和自定义代理直接调用,调用时遵循与人类用户相同的权限和业务规则。
这实现了应用与 AI 的双向打通。向内,Microsoft 365 Copilot 已在 Power Apps 模型驱动应用中正式上线(canvas 应用进入公开预览),用户在应用内可用自然语言搜索数据、自动将邮件转为表单字段、生成活动历史摘要。向外,应用的业务逻辑通过 MCP 输出为代理可调用的工具。微软举例,一个积累了多年招聘政策的 Power Apps 应用,现在可以驱动一个遵守同样规则和权限的 AI 招聘代理,不用从零重写逻辑。
同期推出的「代理动态流」(Agent Feed,5 月正式上线)解决代理监管问题:管理员设定审批阈值,低风险操作后台自动完成,高影响操作(如发送邮件)弹出人工确认,审批界面嵌在业务应用内部,不需要单独的监控工具。MCP 协议此前主要在开发者工具和 AI 编程助手中应用,微软将其引入企业业务软件,是该协议向更广泛企业场景扩展的一步。
信源:https://www.microsoft.com/en-us/power-platform/blog/2026/04/15/making-business-apps-smarter-with-ai-copilot-and-agents-in-power-apps/
✍1
阿里巴巴推出世界模型Happy Oyster,用户可实时下令改写AI正在生成的场景
阿里巴巴推出世界模型产品 Happy Oyster,定位不是 AI 视频生成工具,而是实时可交互的世界引擎。与现有 AI 视频工具「写提示词、等渲染、收成片」的一次性流程不同,Happy Oyster 在生成过程中持续接收指令,场景实时响应并继续演化。
产品分两个模式。「导演」模式让用户充当实时导演:生成内容是维持光照、重力、角色运动和场景因果关系的持续物理世界,用户可随时用文字、语音或图片切换镜头角度、指挥角色、改变故事走向,世界立即响应并继续展开。「漫游」模式让用户以第一人称自由移动,支持键盘和摄像机控制,走出初始画框后世界持续生成并保持连贯。技术参数:导演模式最长 3 分钟、最高 720p;漫游模式上限 1 分钟、480p;两者均支持多模态输入并同步输出音频。
对影视和游戏行业来说,Happy Oyster 把 AI 视频生成从「批量生产素材」推向了「实时虚拟制片」。导演可以在生成过程中调整视觉风格,不需要每次改动都重新完整渲染;游戏开发者则可以用文字描述生成可行走的关卡原型。阿里巴巴近期密集发布新模型、重组组织架构聚焦 AI 商业化,Happy Oyster 是其中定位最偏向内容创作者和游戏开发者的一款。
信源:https://www.happyoyster.cn/docs
阿里巴巴推出世界模型产品 Happy Oyster,定位不是 AI 视频生成工具,而是实时可交互的世界引擎。与现有 AI 视频工具「写提示词、等渲染、收成片」的一次性流程不同,Happy Oyster 在生成过程中持续接收指令,场景实时响应并继续演化。
产品分两个模式。「导演」模式让用户充当实时导演:生成内容是维持光照、重力、角色运动和场景因果关系的持续物理世界,用户可随时用文字、语音或图片切换镜头角度、指挥角色、改变故事走向,世界立即响应并继续展开。「漫游」模式让用户以第一人称自由移动,支持键盘和摄像机控制,走出初始画框后世界持续生成并保持连贯。技术参数:导演模式最长 3 分钟、最高 720p;漫游模式上限 1 分钟、480p;两者均支持多模态输入并同步输出音频。
对影视和游戏行业来说,Happy Oyster 把 AI 视频生成从「批量生产素材」推向了「实时虚拟制片」。导演可以在生成过程中调整视觉风格,不需要每次改动都重新完整渲染;游戏开发者则可以用文字描述生成可行走的关卡原型。阿里巴巴近期密集发布新模型、重组组织架构聚焦 AI 商业化,Happy Oyster 是其中定位最偏向内容创作者和游戏开发者的一款。
信源:https://www.happyoyster.cn/docs
Happy Oyster
Happy Oyster - Real-Time World Model for Interactive Creation
Happy Oyster is an open-ended world model for real-time world creation and interaction. Direct scenes or explore infinite worlds with text, voice, or images — with continuous audio-video generation.
Claude Opus 4.7提前现身谷歌Vertex AI,发布或在本周
多名用户在谷歌云控制台和 Vertex AI 后台发现了 Claude Opus 4.7 的模型标识符(`anthropic-claude-opus-4-7`),完整字段已出现在模型筛选列表中,表明该模型已写入谷歌云基础设施。Anthropic 尚未官方宣布发布。
此前已有多家科技媒体报道 Anthropic 正准备在本周发布 Claude Opus 4.7,并同步推出一款 AI 设计工具。据报道,Opus 4.7 是对 Opus 4.6 的增量升级,在多步推理、长时任务处理和代理协调方面有所提升。
Anthropic 目前采用双轨策略:持续向商业用户推送 Opus 系列更新,同时将能力更强的 Claude Mythos 严格管控不对外发布。Vertex AI 后台提前现身是常见的「软发布」信号:模型基础设施和 API 端点往往在官方公告前数小时到数天就已就位,正式发布窗口很可能在本周之内。
多名用户在谷歌云控制台和 Vertex AI 后台发现了 Claude Opus 4.7 的模型标识符(`anthropic-claude-opus-4-7`),完整字段已出现在模型筛选列表中,表明该模型已写入谷歌云基础设施。Anthropic 尚未官方宣布发布。
此前已有多家科技媒体报道 Anthropic 正准备在本周发布 Claude Opus 4.7,并同步推出一款 AI 设计工具。据报道,Opus 4.7 是对 Opus 4.6 的增量升级,在多步推理、长时任务处理和代理协调方面有所提升。
Anthropic 目前采用双轨策略:持续向商业用户推送 Opus 系列更新,同时将能力更强的 Claude Mythos 严格管控不对外发布。Vertex AI 后台提前现身是常见的「软发布」信号:模型基础设施和 API 端点往往在官方公告前数小时到数天就已就位,正式发布窗口很可能在本周之内。
Claude Code团队详解百万token上下文管理:模型在压缩摘要时智力最低,rewind才是最该养成的习惯
Anthropic Claude Code 团队工程师 Thariq Shihipar 发布长帖,系统讲解 Claude Code 升级到 100 万 token 上下文窗口后如何管理会话,同时宣布更新了 /usage 面板,帮助用户了解自己的使用模式。
帖子的核心概念是「上下文腐烂」(context rot):随着对话变长,模型注意力被分散到越来越多的 token 上,旧的、无关内容开始干扰当前任务,模型表现因此下降。百万上下文让任务跨度更长,但并不意味着可以无限堆积对话。
Shihipar 认为用户最该养成的习惯是 rewind(双击 Esc 键)。当 Claude 尝试了一种方案但失败时,多数人的本能是发一句「这个不行,试试 X」,但更好的做法是回退到方案执行前,把失败经验写进新提示词重新来过,而不是让失败的中间过程留在上下文里占用注意力。
关于上下文压缩(compaction),他指出一个反直觉的问题:模型在最需要聪明的时候反而最笨。压缩发生在上下文即将撑满的时刻,此时上下文腐烂最严重,模型判断力最差,容易丢掉关键信息。典型场景是一轮长时间的调试后触发自动压缩,模型把摘要聚焦在调试过程上,而用户下一步想处理的其他问题被丢弃了。百万上下文给了用户更多余裕,可以在手动输入 /compact 时附加指令(如「只保留 auth 重构相关内容」),主动引导压缩方向。
他还建议将子代理(subagents)视为上下文管理工具:把会产生大量中间输出、但只需要最终结论的任务交给子代理,在独立的上下文窗口中完成,只将结果带回主会话。判断标准是「我需要的是过程还是结论」。
用户在每一轮对话结束后实际上面临五个选择:继续对话、rewind 回退重试、/clear 清空重新开始、/compact 压缩继续、或派出子代理。新任务开新会话,相关任务(如刚写完功能接着写文档)可以留在同一会话以复用已读取的文件。
信源:https://x.com/trq212/status/2044548257058328723
Anthropic Claude Code 团队工程师 Thariq Shihipar 发布长帖,系统讲解 Claude Code 升级到 100 万 token 上下文窗口后如何管理会话,同时宣布更新了 /usage 面板,帮助用户了解自己的使用模式。
帖子的核心概念是「上下文腐烂」(context rot):随着对话变长,模型注意力被分散到越来越多的 token 上,旧的、无关内容开始干扰当前任务,模型表现因此下降。百万上下文让任务跨度更长,但并不意味着可以无限堆积对话。
Shihipar 认为用户最该养成的习惯是 rewind(双击 Esc 键)。当 Claude 尝试了一种方案但失败时,多数人的本能是发一句「这个不行,试试 X」,但更好的做法是回退到方案执行前,把失败经验写进新提示词重新来过,而不是让失败的中间过程留在上下文里占用注意力。
关于上下文压缩(compaction),他指出一个反直觉的问题:模型在最需要聪明的时候反而最笨。压缩发生在上下文即将撑满的时刻,此时上下文腐烂最严重,模型判断力最差,容易丢掉关键信息。典型场景是一轮长时间的调试后触发自动压缩,模型把摘要聚焦在调试过程上,而用户下一步想处理的其他问题被丢弃了。百万上下文给了用户更多余裕,可以在手动输入 /compact 时附加指令(如「只保留 auth 重构相关内容」),主动引导压缩方向。
他还建议将子代理(subagents)视为上下文管理工具:把会产生大量中间输出、但只需要最终结论的任务交给子代理,在独立的上下文窗口中完成,只将结果带回主会话。判断标准是「我需要的是过程还是结论」。
用户在每一轮对话结束后实际上面临五个选择:继续对话、rewind 回退重试、/clear 清空重新开始、/compact 压缩继续、或派出子代理。新任务开新会话,相关任务(如刚写完功能接着写文档)可以留在同一会话以复用已读取的文件。
信源:https://x.com/trq212/status/2044548257058328723
X (formerly Twitter)
Thariq (@trq212) on X
Using Claude Code: Session Management & 1M Context
❤1
美众议员提案将模型蒸馏定性为工业间谍,DeepSeek等中国AI公司拟被列入制裁名单
美国众议院共和党议员 Bill Huizenga 提出《遏制美国AI模型被盗法案》,要求政府识别中国和俄罗斯利用「查询复制」技术从美国AI模型中提取能力的主体,并授权商务部将其列入实体清单,或援引1977年《国际紧急经济权力法》对其实施制裁。该法案由众议院中国问题特别委员会主席 John Moolenaar 联署,预计下周在众议院外交委员会审议。
所谓「对抗性蒸馏」,是指用成熟的大模型(「教师」)大规模查询训练新模型(「学生」),以极低成本复制前者的能力。这一技术本身在一定范围内被容忍,但未经授权复制领先AI模型则违反服务条款。OpenAI今年早些时候向众议院中国委员会披露,DeepSeek曾未经授权大规模查询 ChatGPT 以训练自身模型,且在 OpenAI 反制后持续改变手法绕过限制。谷歌和 Anthropic 随后也发布公开报告,证实在各自平台上观察到类似异常访问行为。
众议院中国委员会的配套报告将进一步点名 DeepSeek、Moonshot AI、MiniMax,建议司法部对上述行为提起诉讼,并要求商务部评估将三家公司列入实体清单。报告还识别出两个公开代码工具和三个中间商,称它们为阿里巴巴、腾讯、百度以及清华大学、北京大学等机构提供了绕过限制访问美国闭源AI模型的渠道。
Huizenga 在声明中点名 Anthropic 的 Mythos:「美国AI模型正展现出变革性的网络能力,防止中国盗取这些技术进展至关重要。」OpenAI、Anthropic、谷歌已开始互相共享信息以检测异常蒸馏行为。本次立法试图将这种私下协作升格为政府主导的执法机制——中国AI公司面临的不再是账号封禁,而是实体清单和经济制裁。
信源:https://bloomberg.com/news/articles/2026-04-16/us-house-to-weigh-penalties-on-ai-model-copying-by-chinese-firms
美国众议院共和党议员 Bill Huizenga 提出《遏制美国AI模型被盗法案》,要求政府识别中国和俄罗斯利用「查询复制」技术从美国AI模型中提取能力的主体,并授权商务部将其列入实体清单,或援引1977年《国际紧急经济权力法》对其实施制裁。该法案由众议院中国问题特别委员会主席 John Moolenaar 联署,预计下周在众议院外交委员会审议。
所谓「对抗性蒸馏」,是指用成熟的大模型(「教师」)大规模查询训练新模型(「学生」),以极低成本复制前者的能力。这一技术本身在一定范围内被容忍,但未经授权复制领先AI模型则违反服务条款。OpenAI今年早些时候向众议院中国委员会披露,DeepSeek曾未经授权大规模查询 ChatGPT 以训练自身模型,且在 OpenAI 反制后持续改变手法绕过限制。谷歌和 Anthropic 随后也发布公开报告,证实在各自平台上观察到类似异常访问行为。
众议院中国委员会的配套报告将进一步点名 DeepSeek、Moonshot AI、MiniMax,建议司法部对上述行为提起诉讼,并要求商务部评估将三家公司列入实体清单。报告还识别出两个公开代码工具和三个中间商,称它们为阿里巴巴、腾讯、百度以及清华大学、北京大学等机构提供了绕过限制访问美国闭源AI模型的渠道。
Huizenga 在声明中点名 Anthropic 的 Mythos:「美国AI模型正展现出变革性的网络能力,防止中国盗取这些技术进展至关重要。」OpenAI、Anthropic、谷歌已开始互相共享信息以检测异常蒸馏行为。本次立法试图将这种私下协作升格为政府主导的执法机制——中国AI公司面临的不再是账号封禁,而是实体清单和经济制裁。
信源:https://bloomberg.com/news/articles/2026-04-16/us-house-to-weigh-penalties-on-ai-model-copying-by-chinese-firms
Bloomberg.com
US House to Weigh Penalties on AI Model Copying by Chinese Firms
House Republicans are calling for US sanctions against Chinese entities that improperly extract results from leading US artificial intelligence models to develop their own competing systems, part of a widening effort by Congress to counter China in the global…
OpenAI发布政策报告游说AI进入生命科学,但至今没有一款AI发现的药物通过三期临床
OpenAI 政策、研究与科学团队发布报告,主张扩大 AI 在生命科学领域的应用,并向 Axios 独家提前分享。报告呼吁三件事:开放更多医疗和科学数据的访问权限、将先进 AI 视为「国家级研究资源」、加大对算力、实验室和能源等「物理基础设施」的投资。
报告称 AI 能加速药物发现、自主设计研究工具、将实验室流程从数月压缩到数天。其中一项分析估计,AI 工具可将临床试验阶段的时间线缩短 20% 以上。OpenAI 还特别提到 GPT-5 Pro 能为尚无有效疗法的疾病寻找已获 FDA 批准药物的新用途。
但现实与愿景之间差距明显。目前仅有极少数 AI 发现或 AI 设计的药物进入临床试验阶段,没有任何一款完成三期临床。2025 年年中发表在 Nature Medicine 上的一篇论文显示,AI 发现的药物在二期临床的失败率与传统方式发现的药物相当。该论文研究者写道:「AI 能否对药物研发产生有意义的、持续性的颠覆,这个问题仍未得到回答。」
报告的政策诉求也值得留意。OpenAI 希望政府开放医疗数据、在国家层面为 AI 研发提供特殊地位和资源倾斜,这本质上是在为自身产品争取更大的市场准入。在美国,一款新药从研究到获批通常需要 12 至 15 年,AI 承诺缩短这一周期的叙事对制药业和监管机构都有吸引力,但目前的临床证据尚不足以支撑这些承诺。同一周内,亚马逊也推出了 AI 药物分子生成工具 Bio Discovery,大型科技公司争相进入这一领域。
信源:https://www.axios.com/2026/04/15/exclusive-openai-ai-life-science
OpenAI 政策、研究与科学团队发布报告,主张扩大 AI 在生命科学领域的应用,并向 Axios 独家提前分享。报告呼吁三件事:开放更多医疗和科学数据的访问权限、将先进 AI 视为「国家级研究资源」、加大对算力、实验室和能源等「物理基础设施」的投资。
报告称 AI 能加速药物发现、自主设计研究工具、将实验室流程从数月压缩到数天。其中一项分析估计,AI 工具可将临床试验阶段的时间线缩短 20% 以上。OpenAI 还特别提到 GPT-5 Pro 能为尚无有效疗法的疾病寻找已获 FDA 批准药物的新用途。
但现实与愿景之间差距明显。目前仅有极少数 AI 发现或 AI 设计的药物进入临床试验阶段,没有任何一款完成三期临床。2025 年年中发表在 Nature Medicine 上的一篇论文显示,AI 发现的药物在二期临床的失败率与传统方式发现的药物相当。该论文研究者写道:「AI 能否对药物研发产生有意义的、持续性的颠覆,这个问题仍未得到回答。」
报告的政策诉求也值得留意。OpenAI 希望政府开放医疗数据、在国家层面为 AI 研发提供特殊地位和资源倾斜,这本质上是在为自身产品争取更大的市场准入。在美国,一款新药从研究到获批通常需要 12 至 15 年,AI 承诺缩短这一周期的叙事对制药业和监管机构都有吸引力,但目前的临床证据尚不足以支撑这些承诺。同一周内,亚马逊也推出了 AI 药物分子生成工具 Bio Discovery,大型科技公司争相进入这一领域。
信源:https://www.axios.com/2026/04/15/exclusive-openai-ai-life-science
Axios
Exclusive: OpenAI lobbies for expanded AI role in life sciences
Progress in life sciences has slowed dramatically — even as the toughest diseases remain unsolved.
Cursor Agent现在可以造仪表盘:Canvas让AI输出从文字变成可交互界面
Cursor 3.1 推出 Canvas 功能。Agent 处理完任务后,输出不再只是代码或 markdown 文字,可以直接生成一个可交互的 React 界面,里面有图表、表格、diff 视图或自定义逻辑。Canvas 作为持久工件存在于 Agents Window,与终端、浏览器、版本控制并排显示。
核心变化在于信息密度。以事故响应为例:此前 Agent 把 Datadog、Databricks、Sentry 的时序数据整理成 markdown 表格,难以解读,还要自己再做可视化。现在 Agent 直接把多来源数据合并进同一张 Canvas 图表里。PR 审查同理:Agent 可以按重要性对变更分组、为复杂算法生成伪代码,而不是把所有 diff 平铺出来。
Cursor 团队自己在 Eval 分析中也用了 Canvas。此前工程师要逐条翻 request ID 查失败模式,一度考虑单独开发一个 web app,最终改为直接在 Cursor 里建一个 Skill,让 Agent 读取所有 rollout、归类失败原因、生成可交互的分析界面,这套流程帮助团队在近期两次新模型上线中显著减少了排查时间。
Canvas 支持自定义扩展:在 Cursor Marketplace 发布的 Docs Canvas Skill 可以让 Agent 为任意代码仓库生成交互式架构图。用户也可以自己编写 Skill 来定义 Agent 生成哪种类型的 Canvas。
信源:https://cursor.com/blog/canvas
Cursor 3.1 推出 Canvas 功能。Agent 处理完任务后,输出不再只是代码或 markdown 文字,可以直接生成一个可交互的 React 界面,里面有图表、表格、diff 视图或自定义逻辑。Canvas 作为持久工件存在于 Agents Window,与终端、浏览器、版本控制并排显示。
核心变化在于信息密度。以事故响应为例:此前 Agent 把 Datadog、Databricks、Sentry 的时序数据整理成 markdown 表格,难以解读,还要自己再做可视化。现在 Agent 直接把多来源数据合并进同一张 Canvas 图表里。PR 审查同理:Agent 可以按重要性对变更分组、为复杂算法生成伪代码,而不是把所有 diff 平铺出来。
Cursor 团队自己在 Eval 分析中也用了 Canvas。此前工程师要逐条翻 request ID 查失败模式,一度考虑单独开发一个 web app,最终改为直接在 Cursor 里建一个 Skill,让 Agent 读取所有 rollout、归类失败原因、生成可交互的分析界面,这套流程帮助团队在近期两次新模型上线中显著减少了排查时间。
Canvas 支持自定义扩展:在 Cursor Marketplace 发布的 Docs Canvas Skill 可以让 Agent 为任意代码仓库生成交互式架构图。用户也可以自己编写 Skill 来定义 Agent 生成哪种类型的 Canvas。
信源:https://cursor.com/blog/canvas
Cursor
Interact with agent-created visualizations in canvases · Cursor
Agents can now create interactive canvases to visually represent information.
Windsurf 2.0把IDE变成代理调度中心,Devin云端代理免费内置
Cognition AI 发布 Windsurf 2.0,核心更新是「代理指挥中心」(Agent Command Center)和 Devin 云端代理直接内置。IDE 不再只是写代码的地方,变成了管理一支 AI 代理团队的调度台。
代理指挥中心用看板(Kanban)视图展示所有正在运行的代理,本地和云端统一管理,按状态分列。设计意图很明确:当工程师同时跑几十个代理处理同一项目的不同部分时,瓶颈不是代码能力,是人的注意力和工作记忆。看板让工程师一眼看清哪个代理在干活、哪个卡住了、哪个等待审查。
「空间」(Spaces)是新增的工作组织单元。一个空间把一项任务相关的所有东西打包在一起:代理会话、PR、文件和上下文。在空间内新建代理会话时,自动继承该空间已有的项目上下文,不需要每次重新描述需求。切换空间就是切换任务,每个任务背后有一组代理在运行。
Devin 是 Cognition 此前独立运营的自主编程代理,拥有自己的云端虚拟机、桌面环境和浏览器,能端到端完成调试、部署、测试等任务。现在直接内置进 Windsurf:用户可以在本地代理上制定方案,一键派给 Devin 在云端执行,合上笔记本也不中断。Devin 完成后提交 PR,用户在 Windsurf 里直接审查 diff、跑测试或交给本地代理修缮。Devin 对所有 Windsurf 套餐用户开放,正在分批上线。
信源:https://windsurf.com/blog/windsurf-2-0
Cognition AI 发布 Windsurf 2.0,核心更新是「代理指挥中心」(Agent Command Center)和 Devin 云端代理直接内置。IDE 不再只是写代码的地方,变成了管理一支 AI 代理团队的调度台。
代理指挥中心用看板(Kanban)视图展示所有正在运行的代理,本地和云端统一管理,按状态分列。设计意图很明确:当工程师同时跑几十个代理处理同一项目的不同部分时,瓶颈不是代码能力,是人的注意力和工作记忆。看板让工程师一眼看清哪个代理在干活、哪个卡住了、哪个等待审查。
「空间」(Spaces)是新增的工作组织单元。一个空间把一项任务相关的所有东西打包在一起:代理会话、PR、文件和上下文。在空间内新建代理会话时,自动继承该空间已有的项目上下文,不需要每次重新描述需求。切换空间就是切换任务,每个任务背后有一组代理在运行。
Devin 是 Cognition 此前独立运营的自主编程代理,拥有自己的云端虚拟机、桌面环境和浏览器,能端到端完成调试、部署、测试等任务。现在直接内置进 Windsurf:用户可以在本地代理上制定方案,一键派给 Devin 在云端执行,合上笔记本也不中断。Devin 完成后提交 PR,用户在 Windsurf 里直接审查 diff、跑测试或交给本地代理修缮。Devin 对所有 Windsurf 套餐用户开放,正在分批上线。
信源:https://windsurf.com/blog/windsurf-2-0
devin.ai
Windsurf 2.0: Introducing the Agent Command Center and Devin in Windsurf
Ship more with local and cloud agents working together.
Cloudflare发布Project Think,要让AI代理像网站一样部署到云端:崩溃自恢复、闲时零成本
Cloudflare 发布 Project Think,为其开源 Agents SDK 新增一整套构建长期运行 AI 代理的基础设施:持久化执行、子代理、沙箱代码执行和持久会话。开发者可以单独使用这些组件,也可以直接用 Think 基类快速搭建完整的代理应用,用
Project Think 要解决的核心问题是:当前的编程代理(Claude Code、Codex、OpenClaw 等)只能跑在本地笔记本或昂贵的 VPS 上,笔记本合盖就断,无法多人协作,闲置时仍在烧钱。Cloudflare 的方案基于 Durable Objects(持久化对象),每个代理是一个独立的 actor,自带 SQLite 数据库,无事可做时休眠,收到请求时被唤醒,闲时计算成本为零。按 Cloudflare 的计算,1 万个代理各自仅 1% 时间活跃,传统容器方案需要 1 万个常驻实例,Durable Objects 任意时刻只有约 100 个在运行。
技术上有几个值得关注的设计:
1. 持久化执行(Fibers):代理运行中如果环境崩溃(部署更新、平台重启、资源耗尽),SDK 在 SQLite 中记录了检查点,重启后从断点恢复,不丢失进度
2. 代码模式(codemode):不让模型逐个调用工具再逐个读取结果,而是让模型直接写一段程序一次性完成任务。Cloudflare 用自家 API 的 MCP 服务器举例:暴露全部 API 端点需要约 117 万 token 描述工具,改用 codemode 只需两个工具(search 和 execute)约 1000 token,减少 99.9%
3. 五级执行阶梯:从最轻量的虚拟文件系统(Tier 0)到完整的沙箱环境(Tier 4,支持 git clone、npm test 等),代理按需逐级升级能力,不必一开始就启动重量级容器
4. 自编写扩展:代理可以在运行时自己编写 TypeScript 扩展并注册为新工具,扩展在沙箱中运行,权限受控。比如用户让代理管理 GitHub PR,代理可以当场写一个 GitHub 集成扩展,下次直接调用
Cloudflare 在博客中将 AI 代理分为三个阶段:第一波是无状态聊天机器人,第二波是本地运行的编程代理,第三波是作为云基础设施运行的持久化代理。Project Think 是 Cloudflare 对第三波的押注。对开发者而言,这套方案的吸引力在于将代理的运维成本从「按实例计费」变成「按实际使用计费」,如果代理大部分时间在等待用户指令,成本接近于零。
信源:https://blog.cloudflare.com/project-think/
Cloudflare 发布 Project Think,为其开源 Agents SDK 新增一整套构建长期运行 AI 代理的基础设施:持久化执行、子代理、沙箱代码执行和持久会话。开发者可以单独使用这些组件,也可以直接用 Think 基类快速搭建完整的代理应用,用
npx wrangler deploy 一键部署到 Cloudflare 全球网络。目前为预览版。Project Think 要解决的核心问题是:当前的编程代理(Claude Code、Codex、OpenClaw 等)只能跑在本地笔记本或昂贵的 VPS 上,笔记本合盖就断,无法多人协作,闲置时仍在烧钱。Cloudflare 的方案基于 Durable Objects(持久化对象),每个代理是一个独立的 actor,自带 SQLite 数据库,无事可做时休眠,收到请求时被唤醒,闲时计算成本为零。按 Cloudflare 的计算,1 万个代理各自仅 1% 时间活跃,传统容器方案需要 1 万个常驻实例,Durable Objects 任意时刻只有约 100 个在运行。
技术上有几个值得关注的设计:
1. 持久化执行(Fibers):代理运行中如果环境崩溃(部署更新、平台重启、资源耗尽),SDK 在 SQLite 中记录了检查点,重启后从断点恢复,不丢失进度
2. 代码模式(codemode):不让模型逐个调用工具再逐个读取结果,而是让模型直接写一段程序一次性完成任务。Cloudflare 用自家 API 的 MCP 服务器举例:暴露全部 API 端点需要约 117 万 token 描述工具,改用 codemode 只需两个工具(search 和 execute)约 1000 token,减少 99.9%
3. 五级执行阶梯:从最轻量的虚拟文件系统(Tier 0)到完整的沙箱环境(Tier 4,支持 git clone、npm test 等),代理按需逐级升级能力,不必一开始就启动重量级容器
4. 自编写扩展:代理可以在运行时自己编写 TypeScript 扩展并注册为新工具,扩展在沙箱中运行,权限受控。比如用户让代理管理 GitHub PR,代理可以当场写一个 GitHub 集成扩展,下次直接调用
Cloudflare 在博客中将 AI 代理分为三个阶段:第一波是无状态聊天机器人,第二波是本地运行的编程代理,第三波是作为云基础设施运行的持久化代理。Project Think 是 Cloudflare 对第三波的押注。对开发者而言,这套方案的吸引力在于将代理的运维成本从「按实例计费」变成「按实际使用计费」,如果代理大部分时间在等待用户指令,成本接近于零。
信源:https://blog.cloudflare.com/project-think/
The Cloudflare Blog
Project Think: building the next generation of AI agents on Cloudflare
Announcing a preview of the next edition of the Agents SDK — from lightweight primitives to a batteries-included platform for AI agents that think, act, and persist.
阶跃StepAudio 2.5 TTS上线,情绪控制精细到「克制的悲伤、没有哭腔」
阶跃星辰正式发布 StepAudio 2.5 TTS。与需要预设情绪标签的传统 TTS 不同,这一代支持用自然语言描述控制语音的每一处细节:标签只能表达「悲伤」,自然语言可以进一步描述「克制的悲伤、没有哭腔、轻轻发颤」,AI 据此合成对应音色。
控制分三层。全局语境控制设定整段语音的情绪基调和场景氛围,让多轮对话中的角色表达保持连贯;文中语境控制在句子层面调节语气、节奏、停顿、重音和呼吸感,甚至可以刻画角色的心理活动和潜台词;零样本音色复刻(Zeroshot TTS)无需重新训练,任意参考录音即可仿出音色,情感和风格可独立调节。三项功能已全量上线阶跃星辰开放平台和 Step Plan。
同一天,谷歌也发布了 Gemini 3.1 Flash TTS,同样以自然语言指令替代 SSML 标签实现精细控制,并在第三方评测中登顶。两家在同日用相同思路发版,说明 TTS 的控制范式正在集体从「选标签」转向「说需求」。对有声内容创作者和配音导演来说,以前调情绪要靠反复录制,现在用一句话描述就能定义音色的细腻层次。
信源:https://mp.weixin.qq.com/s/8SKwa5105umsFeIiUz-eEg
阶跃星辰正式发布 StepAudio 2.5 TTS。与需要预设情绪标签的传统 TTS 不同,这一代支持用自然语言描述控制语音的每一处细节:标签只能表达「悲伤」,自然语言可以进一步描述「克制的悲伤、没有哭腔、轻轻发颤」,AI 据此合成对应音色。
控制分三层。全局语境控制设定整段语音的情绪基调和场景氛围,让多轮对话中的角色表达保持连贯;文中语境控制在句子层面调节语气、节奏、停顿、重音和呼吸感,甚至可以刻画角色的心理活动和潜台词;零样本音色复刻(Zeroshot TTS)无需重新训练,任意参考录音即可仿出音色,情感和风格可独立调节。三项功能已全量上线阶跃星辰开放平台和 Step Plan。
同一天,谷歌也发布了 Gemini 3.1 Flash TTS,同样以自然语言指令替代 SSML 标签实现精细控制,并在第三方评测中登顶。两家在同日用相同思路发版,说明 TTS 的控制范式正在集体从「选标签」转向「说需求」。对有声内容创作者和配音导演来说,以前调情绪要靠反复录制,现在用一句话描述就能定义音色的细腻层次。
信源:https://mp.weixin.qq.com/s/8SKwa5105umsFeIiUz-eEg
MiniMax推出云端Hermes助手MaxHermes:完成任务后自动提炼技能,越用越懂你
MiniMax 今日正式上线 MaxHermes,将 Hermes Agent 打包为官方云端 AI 助手。核心差异在于零部署门槛:无需自备服务器或 API Key,已打通飞书、钉钉、企业微信三个 IM 渠道,7×24 小时在线,费用可用 Token Plan 抵扣。
重点卖点是自我进化机制。每完成一项复杂任务,MaxHermes 自动从中提炼可复用技能,保存为独立文档,后续任务按需调用并根据反馈持续改进。MiniMax 将此与 OpenClaw 作对比:OpenClaw 的技能依赖人工预设,部署后即固定;MaxHermes 的技能由 Agent 自主生成和迭代。叠加跨会话持久记忆、自然语言设定定时任务和多子代理并行机制,底层模型为 MiniMax M2.7。
Hermes Agent 此前需要用户自行部署,MaxHermes 是 MiniMax 将其打包为自家托管产品的首次落地。后续计划接入 Skillhub 社区,MaxClaw 用户可一键迁移已有的技能和人设配置。
信源:https://mp.weixin.qq.com/s/gTUk7CpQYstYcAMzqClAow
MiniMax 今日正式上线 MaxHermes,将 Hermes Agent 打包为官方云端 AI 助手。核心差异在于零部署门槛:无需自备服务器或 API Key,已打通飞书、钉钉、企业微信三个 IM 渠道,7×24 小时在线,费用可用 Token Plan 抵扣。
重点卖点是自我进化机制。每完成一项复杂任务,MaxHermes 自动从中提炼可复用技能,保存为独立文档,后续任务按需调用并根据反馈持续改进。MiniMax 将此与 OpenClaw 作对比:OpenClaw 的技能依赖人工预设,部署后即固定;MaxHermes 的技能由 Agent 自主生成和迭代。叠加跨会话持久记忆、自然语言设定定时任务和多子代理并行机制,底层模型为 MiniMax M2.7。
Hermes Agent 此前需要用户自行部署,MaxHermes 是 MiniMax 将其打包为自家托管产品的首次落地。后续计划接入 Skillhub 社区,MaxClaw 用户可一键迁移已有的技能和人设配置。
信源:https://mp.weixin.qq.com/s/gTUk7CpQYstYcAMzqClAow
黄仁勋:Anthropic用谷歌TPU是当初投资换来的,没早点投Anthropic是我的失误
英伟达 CEO 黄仁勋在接受播客主持人 Dwarkesh Patel 采访时坦承,未能在 Anthropic 创立早期参与投资是一个失误,同时首次公开解释了 Anthropic 算力主要依赖谷歌 TPU 和亚马逊 Trainium 的原因。
谷歌和 AWS 在 Anthropic 早期投入了数十亿美元,作为交换,Anthropic 的算力主要使用这两家公司的平台。黄仁勋说,当时英伟达没有做出同样规模投资的能力和意识:「我没有深刻意识到,VC 根本不可能给一家 AI 实验室投入 50 亿到 100 亿美元。他们没有其他选项,这是我的失误。」他说如果可以重来、且英伟达当时有今天的体量,「我会非常乐意做这件事」。
他明确否定了「专用芯片正在替代 GPU」的市场叙事:「Anthropic 是一个特例,不是趋势。没有 Anthropic,TPU 的增长从哪里来?完全来自 Anthropic。没有 Anthropic,Trainium 的增长从哪里来?完全来自 Anthropic。」在他看来,Anthropic 用专用芯片反映的是投资协议的约束,不是性能或成本层面的技术判断。
英伟达此后通过后期大额投资弥补了这一缺位。今年 2 月,英伟达向 OpenAI 投资 300 亿美元(主要以 GPU 算力和基础设施承诺的形式),黄仁勋称这可能是 OpenAI 上市前「最后一次」投资。去年 11 月,英伟达与微软联合向 Anthropic 投资,英伟达出资最高 100 亿美元,推动 Anthropic 估值升至约 3500 亿美元。黄仁勋在采访中说,这两笔投资的逻辑一样:「世界需要他们存在。」
信源:https://www.youtube.com/watch?v=Hrbq66XqtCo
英伟达 CEO 黄仁勋在接受播客主持人 Dwarkesh Patel 采访时坦承,未能在 Anthropic 创立早期参与投资是一个失误,同时首次公开解释了 Anthropic 算力主要依赖谷歌 TPU 和亚马逊 Trainium 的原因。
谷歌和 AWS 在 Anthropic 早期投入了数十亿美元,作为交换,Anthropic 的算力主要使用这两家公司的平台。黄仁勋说,当时英伟达没有做出同样规模投资的能力和意识:「我没有深刻意识到,VC 根本不可能给一家 AI 实验室投入 50 亿到 100 亿美元。他们没有其他选项,这是我的失误。」他说如果可以重来、且英伟达当时有今天的体量,「我会非常乐意做这件事」。
他明确否定了「专用芯片正在替代 GPU」的市场叙事:「Anthropic 是一个特例,不是趋势。没有 Anthropic,TPU 的增长从哪里来?完全来自 Anthropic。没有 Anthropic,Trainium 的增长从哪里来?完全来自 Anthropic。」在他看来,Anthropic 用专用芯片反映的是投资协议的约束,不是性能或成本层面的技术判断。
英伟达此后通过后期大额投资弥补了这一缺位。今年 2 月,英伟达向 OpenAI 投资 300 亿美元(主要以 GPU 算力和基础设施承诺的形式),黄仁勋称这可能是 OpenAI 上市前「最后一次」投资。去年 11 月,英伟达与微软联合向 Anthropic 投资,英伟达出资最高 100 亿美元,推动 Anthropic 估值升至约 3500 亿美元。黄仁勋在采访中说,这两笔投资的逻辑一样:「世界需要他们存在。」
信源:https://www.youtube.com/watch?v=Hrbq66XqtCo
YouTube
Jensen Huang – Will Nvidia’s moat persist?
I asked Jensen about TPU competition, Nvidia’s lock on the ever more bottlenecked supply chain needed to make advanced chips, whether we should be selling AI chips to China, why Nvidia doesn’t just become a hyperscaler, how it makes its investments, and much…
❤1
黄仁勋:中国早已越过训练Mythos级模型的算力门槛,限制出口只会加速华为崛起
英伟达 CEO 黄仁勋在 Dwarkesh Patel 采访中强烈反对 AI 芯片出口管制政策,认为这不仅无法阻断中国的 AI 能力,还在过去几年已经制造了适得其反的结果。
黄仁勋的核心论点是:中国已越过临界点。他说,中国拥有大量 7nm 芯片产能和充裕的廉价能源,而 AI 训练是并行计算问题,更多的旧芯片可以弥补单芯片的性能差距。「你们担心的那个能力门槛,中国早就达到了,而且已经超过了。」Anthropic 的 Mythos 是在「相当普通的算力规模」上训练出来的,而这种算力在中国已大量存在。黄仁勋称华为刚刚实现了公司历史上最高的单年业绩,出货了数以百万计的芯片,「远多于 Anthropic 所拥有的」。不过华为 2025 年报显示其营收为 8809 亿元,实为历史次高,低于 2020 年的 8914 亿元峰值。
他还指出,中国拥有全球约 50% 的 AI 研究者,算法创新往往比算力堆叠更能决定模型能力的上限,DeepSeek 是他举出的具体证据:「DeepSeek 不是一个可以忽视的进步。如果未来某天 DeepSeek 级别的模型率先在华为芯片上发布,那对我们的国家将是一个可怕的结果。」这一假设场景可能即将成为现实:据 The Information 报道,DeepSeek 正准备在华为 Ascend 芯片上发布 V4 模型,预计 4 月下旬上线,将成为首个不依赖英伟达硬件的前沿 AI 模型。阿里巴巴、字节跳动、腾讯等中国大厂也在大量采购华为芯片,价格数周内上涨了约 20%。
出口管制已带来反效果。限制措施加速了中国本土芯片产业的崛起,迫使中国 AI 生态转向为本土硬件优化。黄仁勋认为这对美国才是真正的威胁:「如果未来 AI 模型在别人的技术栈上运行最好,那才是美国的噩耗。」中国占全球技术产业约 40%,放弃这一市场将损害美国芯片层面的长期竞争力。
他明确区分了两个可以并行的目标:国内保持算力领先,同时在全球市场竞争。「我们不应该主动放弃市场。如果最终输了就输了,但为什么要拱手相让?」
信源:https://www.youtube.com/watch?v=Hrbq66XqtCo
英伟达 CEO 黄仁勋在 Dwarkesh Patel 采访中强烈反对 AI 芯片出口管制政策,认为这不仅无法阻断中国的 AI 能力,还在过去几年已经制造了适得其反的结果。
黄仁勋的核心论点是:中国已越过临界点。他说,中国拥有大量 7nm 芯片产能和充裕的廉价能源,而 AI 训练是并行计算问题,更多的旧芯片可以弥补单芯片的性能差距。「你们担心的那个能力门槛,中国早就达到了,而且已经超过了。」Anthropic 的 Mythos 是在「相当普通的算力规模」上训练出来的,而这种算力在中国已大量存在。黄仁勋称华为刚刚实现了公司历史上最高的单年业绩,出货了数以百万计的芯片,「远多于 Anthropic 所拥有的」。不过华为 2025 年报显示其营收为 8809 亿元,实为历史次高,低于 2020 年的 8914 亿元峰值。
他还指出,中国拥有全球约 50% 的 AI 研究者,算法创新往往比算力堆叠更能决定模型能力的上限,DeepSeek 是他举出的具体证据:「DeepSeek 不是一个可以忽视的进步。如果未来某天 DeepSeek 级别的模型率先在华为芯片上发布,那对我们的国家将是一个可怕的结果。」这一假设场景可能即将成为现实:据 The Information 报道,DeepSeek 正准备在华为 Ascend 芯片上发布 V4 模型,预计 4 月下旬上线,将成为首个不依赖英伟达硬件的前沿 AI 模型。阿里巴巴、字节跳动、腾讯等中国大厂也在大量采购华为芯片,价格数周内上涨了约 20%。
出口管制已带来反效果。限制措施加速了中国本土芯片产业的崛起,迫使中国 AI 生态转向为本土硬件优化。黄仁勋认为这对美国才是真正的威胁:「如果未来 AI 模型在别人的技术栈上运行最好,那才是美国的噩耗。」中国占全球技术产业约 40%,放弃这一市场将损害美国芯片层面的长期竞争力。
他明确区分了两个可以并行的目标:国内保持算力领先,同时在全球市场竞争。「我们不应该主动放弃市场。如果最终输了就输了,但为什么要拱手相让?」
信源:https://www.youtube.com/watch?v=Hrbq66XqtCo
YouTube
Jensen Huang – Will Nvidia’s moat persist?
I asked Jensen about TPU competition, Nvidia’s lock on the ever more bottlenecked supply chain needed to make advanced chips, whether we should be selling AI chips to China, why Nvidia doesn’t just become a hyperscaler, how it makes its investments, and much…
黄仁勋公开挑战TPU和Trainium跑推理基准:「没有一家敢来」
黄仁勋在 Dwarkesh Patel 采访中直接点名挑战谷歌 TPU 和亚马逊 Trainium 参加公开推理基准测试,称两者至今未应战。
「英伟达的计算栈是全球性能 TCO 比最高的平台,没有例外。世界上没有任何一家公司能向我证明他们的平台更好,一家都没有。」他提到 SemiAnalysis 分析师 Dylan Patel 推出的 InferenceMAX 推理基准,称该测试已公开,「TPU 不来,Trainium 不来。我非常欢迎 Trainium 来验证他们总在声称的 40% 成本优势。我也很想看看 TPU 的成本优势到底在哪,在我看来从第一性原理上就完全说不通。」
他将英伟达 GPU 类比为 F1 赛车,CPU 为凯迪拉克轿车:「人人都能开到 100 英里时速,但要推到极限需要极高的专业能力。」英伟达为各大 AI 实验室配备了大量工程师优化技术栈,「通常优化完毕后,他们的模型速度提升 2 倍、3 倍,50% 是常事。在他们现有的 Hopper 和 Blackwell 集群上,这直接意味着收入翻倍。」
对于超大规模云厂商自建内核削弱 CUDA 的担忧,黄仁勋指出英伟达自身向 Triton 等第三方框架贡献了大量底层技术,「Triton 的后端有大量英伟达技术」。CUDA 生态目前有数亿 GPU 装机量,覆盖所有主流云服务商。「如果你是一家 AI 初创公司,你会选最普及的架构、最大的装机量和最丰富的生态。三者都是英伟达。」他还补充了一个常被忽视的维度:英伟达是唯一一家能保证每年交付下一代架构的公司。Vera Rubin 今年上线,Vera Rubin Ultra 明年,Feynman 后年,之后还有一代尚未公布代号的产品。「找一个 ASIC 团队,看你能不能把整个业务押在他们每年都会准时交付上。」
信源:https://www.youtube.com/watch?v=Hrbq66XqtCo
黄仁勋在 Dwarkesh Patel 采访中直接点名挑战谷歌 TPU 和亚马逊 Trainium 参加公开推理基准测试,称两者至今未应战。
「英伟达的计算栈是全球性能 TCO 比最高的平台,没有例外。世界上没有任何一家公司能向我证明他们的平台更好,一家都没有。」他提到 SemiAnalysis 分析师 Dylan Patel 推出的 InferenceMAX 推理基准,称该测试已公开,「TPU 不来,Trainium 不来。我非常欢迎 Trainium 来验证他们总在声称的 40% 成本优势。我也很想看看 TPU 的成本优势到底在哪,在我看来从第一性原理上就完全说不通。」
他将英伟达 GPU 类比为 F1 赛车,CPU 为凯迪拉克轿车:「人人都能开到 100 英里时速,但要推到极限需要极高的专业能力。」英伟达为各大 AI 实验室配备了大量工程师优化技术栈,「通常优化完毕后,他们的模型速度提升 2 倍、3 倍,50% 是常事。在他们现有的 Hopper 和 Blackwell 集群上,这直接意味着收入翻倍。」
对于超大规模云厂商自建内核削弱 CUDA 的担忧,黄仁勋指出英伟达自身向 Triton 等第三方框架贡献了大量底层技术,「Triton 的后端有大量英伟达技术」。CUDA 生态目前有数亿 GPU 装机量,覆盖所有主流云服务商。「如果你是一家 AI 初创公司,你会选最普及的架构、最大的装机量和最丰富的生态。三者都是英伟达。」他还补充了一个常被忽视的维度:英伟达是唯一一家能保证每年交付下一代架构的公司。Vera Rubin 今年上线,Vera Rubin Ultra 明年,Feynman 后年,之后还有一代尚未公布代号的产品。「找一个 ASIC 团队,看你能不能把整个业务押在他们每年都会准时交付上。」
信源:https://www.youtube.com/watch?v=Hrbq66XqtCo
YouTube
Jensen Huang – Will Nvidia’s moat persist?
I asked Jensen about TPU competition, Nvidia’s lock on the ever more bottlenecked supply chain needed to make advanced chips, whether we should be selling AI chips to China, why Nvidia doesn’t just become a hyperscaler, how it makes its investments, and much…
黄仁勋:AI不会消灭软件公司,代理将让工具使用量指数级增长
黄仁勋在采访中反驳了「AI 将令软件公司估值崩溃」的流行叙事,提出相反判断:AI 代理将大幅推高传统软件工具的使用量,对软件公司而言是需求倍增而非替代。
「我看到的和大多数人看到的恰恰相反。代理的数量会指数级增长,工具使用者的数量也会指数级增长。」他举例:Synopsys 的芯片设计编译器、Cadence 的版图工具、设计规则检查器,这些工具的实例数量将随代理数量急剧增加。「今天我们受限于工程师的数量。明天,这些工程师将被一批代理支持。我们会以前所未有的方式探索设计空间,用的还是今天的工具。」
他承认代理目前还不够擅长使用工具,这是市场尚未反映这一逻辑的原因:「要么软件公司自己建代理,要么代理变得足够聪明来使用这些工具。我认为两者都会发生。」
这个判断的背景是,近期大量企业软件公司(尤其是 EDA、CAD 等工程工具领域)因市场预期 AI 将替代工程工作而遭遇估值下调。黄仁勋提供了一个不同的框架:AI 不是 SaaS 的终结者,而是 SaaS 需求的倍增器。区别在于,多数市场分析关注的是 AI 替代人类工程师的那部分产出,而黄仁勋关注的是代理自身也需要调用工具来完成工作。
信源:https://www.youtube.com/watch?v=Hrbq66XqtCo
黄仁勋在采访中反驳了「AI 将令软件公司估值崩溃」的流行叙事,提出相反判断:AI 代理将大幅推高传统软件工具的使用量,对软件公司而言是需求倍增而非替代。
「我看到的和大多数人看到的恰恰相反。代理的数量会指数级增长,工具使用者的数量也会指数级增长。」他举例:Synopsys 的芯片设计编译器、Cadence 的版图工具、设计规则检查器,这些工具的实例数量将随代理数量急剧增加。「今天我们受限于工程师的数量。明天,这些工程师将被一批代理支持。我们会以前所未有的方式探索设计空间,用的还是今天的工具。」
他承认代理目前还不够擅长使用工具,这是市场尚未反映这一逻辑的原因:「要么软件公司自己建代理,要么代理变得足够聪明来使用这些工具。我认为两者都会发生。」
这个判断的背景是,近期大量企业软件公司(尤其是 EDA、CAD 等工程工具领域)因市场预期 AI 将替代工程工作而遭遇估值下调。黄仁勋提供了一个不同的框架:AI 不是 SaaS 的终结者,而是 SaaS 需求的倍增器。区别在于,多数市场分析关注的是 AI 替代人类工程师的那部分产出,而黄仁勋关注的是代理自身也需要调用工具来完成工作。
信源:https://www.youtube.com/watch?v=Hrbq66XqtCo
YouTube
Jensen Huang – Will Nvidia’s moat persist?
I asked Jensen about TPU competition, Nvidia’s lock on the ever more bottlenecked supply chain needed to make advanced chips, whether we should be selling AI chips to China, why Nvidia doesn’t just become a hyperscaler, how it makes its investments, and much…
英伟达200亿美元收购Groq后首谈战略:推理token要按质论价,低延迟高单价是新赛道
黄仁勋在采访中首次详细解释了英伟达收购 Groq 的战略逻辑。英伟达去年 12 月以 200 亿美元收购了 Groq 的推理芯片业务,Groq 创始人 Jonathan Ross 及核心团队加入英伟达,Groq 作为独立公司继续运营。今年 3 月 GTC 大会上,英伟达发布了合并后首款芯片 Groq 3 LPU,由三星 4nm 工艺制造,英伟达称其在万亿参数模型上的每兆瓦推理吞吐量是 Blackwell NVL72 的 35 倍。
黄仁勋说,收购 Groq 的驱动力是推理市场的分层。此前推理优化只有一个方向:提高吞吐量。但 token 的商业价值已大幅上升,不同用户愿意为不同响应速度付不同价格。「如果我能给软件工程师提供响应更快的 token,让他们比现在更高效,我愿意为此付费。但这个市场直到最近才出现。」
他将这描述为推理市场帕累托前沿的扩展:在现有高吞吐量方案之外,新增一个低延迟、高单价的市场段。同一个模型,根据响应时间差异化定价,「虽然吞吐量更低,但单价能弥补」。Groq 的 LPU 架构以确定性低延迟著称,与英伟达 GPU 的高吞吐量路线互补,收购补上了英伟达在推理产品线上缺失的一块。
信源:https://www.youtube.com/watch?v=Hrbq66XqtCo
黄仁勋在采访中首次详细解释了英伟达收购 Groq 的战略逻辑。英伟达去年 12 月以 200 亿美元收购了 Groq 的推理芯片业务,Groq 创始人 Jonathan Ross 及核心团队加入英伟达,Groq 作为独立公司继续运营。今年 3 月 GTC 大会上,英伟达发布了合并后首款芯片 Groq 3 LPU,由三星 4nm 工艺制造,英伟达称其在万亿参数模型上的每兆瓦推理吞吐量是 Blackwell NVL72 的 35 倍。
黄仁勋说,收购 Groq 的驱动力是推理市场的分层。此前推理优化只有一个方向:提高吞吐量。但 token 的商业价值已大幅上升,不同用户愿意为不同响应速度付不同价格。「如果我能给软件工程师提供响应更快的 token,让他们比现在更高效,我愿意为此付费。但这个市场直到最近才出现。」
他将这描述为推理市场帕累托前沿的扩展:在现有高吞吐量方案之外,新增一个低延迟、高单价的市场段。同一个模型,根据响应时间差异化定价,「虽然吞吐量更低,但单价能弥补」。Groq 的 LPU 架构以确定性低延迟著称,与英伟达 GPU 的高吞吐量路线互补,收购补上了英伟达在推理产品线上缺失的一块。
信源:https://www.youtube.com/watch?v=Hrbq66XqtCo
YouTube
Jensen Huang – Will Nvidia’s moat persist?
I asked Jensen about TPU competition, Nvidia’s lock on the ever more bottlenecked supply chain needed to make advanced chips, whether we should be selling AI chips to China, why Nvidia doesn’t just become a hyperscaler, how it makes its investments, and much…
Claude Opus 4.6已在向用户自报「claude-opus-4-7」,Anthropic疑似静默切换模型
多名用户今日发现,在 claude.ai 上选择 Opus 4.6 对话时,直接询问模型的 model slug,得到的回答是「claude-opus-4-7」。界面仍显示「Opus 4.6」,但模型自报的内部标识符已变。X 用户 @evanM_FP 的截图显示,模型明确回复「Claude Opus 4.6, with the model string claude-opus-4-7」。
这不是 Opus 4.7 标识符首次被发现。3 月 31 日,Anthropic 在 Claude Code 的 npm 包中意外附带了一份 60MB 的 source map 文件,安全研究者从中解包出约 1900 个 TypeScript 源文件,其中包含
多名用户今日发现,在 claude.ai 上选择 Opus 4.6 对话时,直接询问模型的 model slug,得到的回答是「claude-opus-4-7」。界面仍显示「Opus 4.6」,但模型自报的内部标识符已变。X 用户 @evanM_FP 的截图显示,模型明确回复「Claude Opus 4.6, with the model string claude-opus-4-7」。
这不是 Opus 4.7 标识符首次被发现。3 月 31 日,Anthropic 在 Claude Code 的 npm 包中意外附带了一份 60MB 的 source map 文件,安全研究者从中解包出约 1900 个 TypeScript 源文件,其中包含
claude-opus-4.7 和 claude-sonnet-4.8 等内部模型标识符。4 月 12 日,该标识符又在 Anthropic 的内部 API 系统中被人发现。4 月 14 日,《The Information》援引知情人士报道称 Anthropic 最快本周发布 Opus 4.7。现在用户端的模型自报将这条线索链推到了最后一步:模型可能已经在线上运行。❤1
Nucleus-Image开源,17B参数推理仅激活2B,无后训练基准超Imagen4
Nucleus AI 团队发布文生图模型 Nucleus-Image,同步开源模型权重、训练代码和训练数据集,许可证为 Apache 2.0,可商用。模型采用稀疏混合专家(MoE)扩散变换器架构,总参数量 17B,分布在每层 64 个路由专家中,每次推理仅激活约 2B 参数,推理成本显著低于同参数量级的密集模型。
在三项标准基准上,Nucleus-Image 与闭源头部模型持平甚至超越:GenEval 得分 0.87,与千问图像模型持平,空间位置子项(0.85)居所有对比模型之首;DPG-Bench 得分 88.79,综合排名第一;OneIG-Bench 得分 0.522,超过谷歌 Imagen4(0.515)和 Recraft V3(0.502)。以上成绩全部来自纯预训练,未做 DPO、强化学习或人类偏好调优。Nucleus AI 官方称这是「该质量级别上首个全开源 MoE 扩散模型」。
训练数据从网络大规模爬取,经多轮过滤、去重和美学评分后保留 7 亿张图片,生成 15 亿图文对;训练分三阶段从 256 到 1024 分辨率逐步推进,共 170 万步。文本编码器使用 Qwen3-VL-8B-Instruct,通过 diffusers 库调用,并内置跨去噪步骤的文本 KV 缓存,进一步降低推理开销。
对需要在本地部署图像生成的开发者来说,17B 参数但只需激活 2B 的设计意味着消费级 GPU 也有运行空间。完整开源(权重 + 训练代码 + 数据集)相对罕见——多数开源图像模型只放权重,数据集和训练细节仍封闭,这也是文生图领域可复现研究的主要瓶颈之一。
信源:https://arxiv.org/abs/2604.12163
Nucleus AI 团队发布文生图模型 Nucleus-Image,同步开源模型权重、训练代码和训练数据集,许可证为 Apache 2.0,可商用。模型采用稀疏混合专家(MoE)扩散变换器架构,总参数量 17B,分布在每层 64 个路由专家中,每次推理仅激活约 2B 参数,推理成本显著低于同参数量级的密集模型。
在三项标准基准上,Nucleus-Image 与闭源头部模型持平甚至超越:GenEval 得分 0.87,与千问图像模型持平,空间位置子项(0.85)居所有对比模型之首;DPG-Bench 得分 88.79,综合排名第一;OneIG-Bench 得分 0.522,超过谷歌 Imagen4(0.515)和 Recraft V3(0.502)。以上成绩全部来自纯预训练,未做 DPO、强化学习或人类偏好调优。Nucleus AI 官方称这是「该质量级别上首个全开源 MoE 扩散模型」。
训练数据从网络大规模爬取,经多轮过滤、去重和美学评分后保留 7 亿张图片,生成 15 亿图文对;训练分三阶段从 256 到 1024 分辨率逐步推进,共 170 万步。文本编码器使用 Qwen3-VL-8B-Instruct,通过 diffusers 库调用,并内置跨去噪步骤的文本 KV 缓存,进一步降低推理开销。
对需要在本地部署图像生成的开发者来说,17B 参数但只需激活 2B 的设计意味着消费级 GPU 也有运行空间。完整开源(权重 + 训练代码 + 数据集)相对罕见——多数开源图像模型只放权重,数据集和训练细节仍封闭,这也是文生图领域可复现研究的主要瓶颈之一。
信源:https://arxiv.org/abs/2604.12163
METR更新AI代理能力基准,Gemini 3.1 Pro可靠性超越所有前沿模型登顶
AI 安全评估机构 METR 更新「时间地平线」(Time Horizon)基准,新增谷歌 Gemini 3.1 Pro 的测试数据。该基准追踪前沿 AI 代理独立完成编程任务的能力上限,自今年 2 月上线以来已成为衡量 AI 代理能力增长的重要参考。
测量方式是让人类软件工程专家(平均约 5 年经验)和 AI 代理完成同一组超过一百项软件任务,用人类耗时衡量任务难度。核心指标有两个:50% 时间地平线(AI 有一半概率完成的最高任务难度)和 80% 时间地平线(AI 有八成概率完成的最高任务难度)。
Gemini 3.1 Pro 在两个指标上的排名出现反转。50% 时间地平线排第二,仅次于大幅领先的 Claude Opus 4.6:
1. Claude Opus 4.6:约 12.0 小时
2. Gemini 3.1 Pro:约 6.4 小时
3. GPT-5.2:约 5.9 小时
4. GPT-5.4:约 5.7 小时
但在更严格的 80% 时间地平线上,Gemini 3.1 Pro 反超登顶:
1. Gemini 3.1 Pro:约 1.5 小时
2. Claude Opus 4.6:约 1.2 小时
3. GPT-5.2:约 1.1 小时
Claude Opus 4.6 能挑战更难的任务但成功率波动大,Gemini 3.1 Pro 天花板低一些但在能力范围内更稳定。对需要可预测结果的生产场景,后者可能更实用。
相比上一代 Gemini 3 Pro(50% 时间地平线约 3.7 小时),Gemini 3.1 Pro 提升约 71%。从更长的时间线看,METR 的数据显示前沿模型的时间地平线从 2019 年 GPT-2 的几秒钟增长到如今的十余小时,约每 4.3 个月翻一番,METR 称「没有看到指数增长放缓的迹象」。
需注意,METR 的任务覆盖软件工程、机器学习和网络安全,且均为定义清晰、可自动评分的独立任务。METR 在后续研究中发现,当评分方式从算法判定改为人类整体评判时,AI 表现显著下降。12 小时的时间地平线不等于 AI 能替代人类半天的实际工作。
信源:https://metr.org/time-horizons/
AI 安全评估机构 METR 更新「时间地平线」(Time Horizon)基准,新增谷歌 Gemini 3.1 Pro 的测试数据。该基准追踪前沿 AI 代理独立完成编程任务的能力上限,自今年 2 月上线以来已成为衡量 AI 代理能力增长的重要参考。
测量方式是让人类软件工程专家(平均约 5 年经验)和 AI 代理完成同一组超过一百项软件任务,用人类耗时衡量任务难度。核心指标有两个:50% 时间地平线(AI 有一半概率完成的最高任务难度)和 80% 时间地平线(AI 有八成概率完成的最高任务难度)。
Gemini 3.1 Pro 在两个指标上的排名出现反转。50% 时间地平线排第二,仅次于大幅领先的 Claude Opus 4.6:
1. Claude Opus 4.6:约 12.0 小时
2. Gemini 3.1 Pro:约 6.4 小时
3. GPT-5.2:约 5.9 小时
4. GPT-5.4:约 5.7 小时
但在更严格的 80% 时间地平线上,Gemini 3.1 Pro 反超登顶:
1. Gemini 3.1 Pro:约 1.5 小时
2. Claude Opus 4.6:约 1.2 小时
3. GPT-5.2:约 1.1 小时
Claude Opus 4.6 能挑战更难的任务但成功率波动大,Gemini 3.1 Pro 天花板低一些但在能力范围内更稳定。对需要可预测结果的生产场景,后者可能更实用。
相比上一代 Gemini 3 Pro(50% 时间地平线约 3.7 小时),Gemini 3.1 Pro 提升约 71%。从更长的时间线看,METR 的数据显示前沿模型的时间地平线从 2019 年 GPT-2 的几秒钟增长到如今的十余小时,约每 4.3 个月翻一番,METR 称「没有看到指数增长放缓的迹象」。
需注意,METR 的任务覆盖软件工程、机器学习和网络安全,且均为定义清晰、可自动评分的独立任务。METR 在后续研究中发现,当评分方式从算法判定改为人类整体评判时,AI 表现显著下降。12 小时的时间地平线不等于 AI 能替代人类半天的实际工作。
信源:https://metr.org/time-horizons/
metr.org
Task-Completion Time Horizons of Frontier AI Models
Our most up-to-date measurements of the time horizons for public frontier language models.
ChatGPT流量份额一年从77%跌至57%,Gemini翻四倍升至25%
Similarweb 发布截至 2026 年 3 月的生成式 AI 网站流量份额数据。过去 12 个月,ChatGPT 从 77.43% 降至 56.72%,丢掉超过 20 个百分点;Gemini 从 6.00% 升至 25.46%,翻了四倍多,吃下了流失份额的大头。
各产品 3 月份额:
1. ChatGPT:56.72%
2. Gemini:25.46%
3. Claude:6.02%
4. DeepSeek:3.74%
5. Grok:3.44%
6. Copilot:1.99%
7. Perplexity:1.64%
短期变动最剧烈的是 Claude:一年前仅 1.40%,1 月还在 2.22%,3 月突破 6%,其中 2 月到 3 月单月接近翻倍。Grok 从一年前的第二名(7.03%)跌至第五(3.44%),被 DeepSeek 反超。Copilot 的上升部分源于统计口径调整,Similarweb 将微软 m365.cloud.microsoft/chat 纳入了 Copilot 流量。
一年前 ChatGPT 以 77% 的份额近乎垄断,如今前两名合计 82%(ChatGPT 57% + Gemini 25%),格局从一家独大变为两强主导。两种增长的形态截然不同:Gemini 逐季匀速爬升,Claude 则在前 10 个月几乎没动、最近两个月突然从 2% 拉到 6%。Grok 跌幅最深,一年前排第二,如今已被三家超过。
信源:https://x.com/Similarweb/status/2044682637860573534
Similarweb 发布截至 2026 年 3 月的生成式 AI 网站流量份额数据。过去 12 个月,ChatGPT 从 77.43% 降至 56.72%,丢掉超过 20 个百分点;Gemini 从 6.00% 升至 25.46%,翻了四倍多,吃下了流失份额的大头。
各产品 3 月份额:
1. ChatGPT:56.72%
2. Gemini:25.46%
3. Claude:6.02%
4. DeepSeek:3.74%
5. Grok:3.44%
6. Copilot:1.99%
7. Perplexity:1.64%
短期变动最剧烈的是 Claude:一年前仅 1.40%,1 月还在 2.22%,3 月突破 6%,其中 2 月到 3 月单月接近翻倍。Grok 从一年前的第二名(7.03%)跌至第五(3.44%),被 DeepSeek 反超。Copilot 的上升部分源于统计口径调整,Similarweb 将微软 m365.cloud.microsoft/chat 纳入了 Copilot 流量。
一年前 ChatGPT 以 77% 的份额近乎垄断,如今前两名合计 82%(ChatGPT 57% + Gemini 25%),格局从一家独大变为两强主导。两种增长的形态截然不同:Gemini 逐季匀速爬升,Claude 则在前 10 个月几乎没动、最近两个月突然从 2% 拉到 6%。Grok 跌幅最深,一年前排第二,如今已被三家超过。
信源:https://x.com/Similarweb/status/2044682637860573534
苹果把近200名Siri程序员送回「编程学校」,距新版Siri发布仅两个月
苹果计划将近 200 名 Siri 程序员送去参加为期数周的 AI 编程培训班,学习使用 AI 工具写代码。此时距新版 Siri 预计在 6 月 WWDC 上亮相仅剩两个月。Siri 团队总人数达数百人,培训结束后核心开发组仅保留约 60 人,另有约 60 人转入评估组,负责测试 Siri 的指令处理和安全合规。
苹果软件工程等部门已大规模采用 Claude Code 等 AI 编程工具,部分团队为此分配了大笔预算,但 Siri 团队未能跟上。这支团队在苹果内部以「落后者」著称,15 年来人员臃肿、内部政治分裂,在 ChatGPT 等大语言模型崛起后更难以保持竞争力。苹果近年多次重组 Siri:去年初将团队从 AI 部门负责人 John Giannandrea 手中划出,交由软件主管 Craig Federighi 管辖,Vision Pro 负责人 Mike Rockwell 直接负责 Siri 产品。此前苹果曾计划 2025 年初发布新版 Siri,但遭遇延期。Giannandrea 去年 12 月宣布退休,据 Bloomberg 报道,本周将是他在苹果担任顾问的最后一天。
新版 Siri 将由谷歌 Gemini 驱动,支持更自然的对话、直接回答问题、提供情感支持和完成预订等任务。苹果正与谷歌讨论由后者托管运行新 Siri 的服务器,目前仍有大量工作待完成。一家以自研芯片和操作系统著称的公司,语音助手要靠竞争对手的模型和服务器来运行,Siri 团队要靠培训班来学会用 AI 写代码,这本身就是苹果在生成式 AI 浪潮中处境的缩影。
信源:https://www.theinformation.com/articles/apple-sends-siri-staffers-coding-bootcamp-latest-shakeup-organization?rc=h8czej
苹果计划将近 200 名 Siri 程序员送去参加为期数周的 AI 编程培训班,学习使用 AI 工具写代码。此时距新版 Siri 预计在 6 月 WWDC 上亮相仅剩两个月。Siri 团队总人数达数百人,培训结束后核心开发组仅保留约 60 人,另有约 60 人转入评估组,负责测试 Siri 的指令处理和安全合规。
苹果软件工程等部门已大规模采用 Claude Code 等 AI 编程工具,部分团队为此分配了大笔预算,但 Siri 团队未能跟上。这支团队在苹果内部以「落后者」著称,15 年来人员臃肿、内部政治分裂,在 ChatGPT 等大语言模型崛起后更难以保持竞争力。苹果近年多次重组 Siri:去年初将团队从 AI 部门负责人 John Giannandrea 手中划出,交由软件主管 Craig Federighi 管辖,Vision Pro 负责人 Mike Rockwell 直接负责 Siri 产品。此前苹果曾计划 2025 年初发布新版 Siri,但遭遇延期。Giannandrea 去年 12 月宣布退休,据 Bloomberg 报道,本周将是他在苹果担任顾问的最后一天。
新版 Siri 将由谷歌 Gemini 驱动,支持更自然的对话、直接回答问题、提供情感支持和完成预订等任务。苹果正与谷歌讨论由后者托管运行新 Siri 的服务器,目前仍有大量工作待完成。一家以自研芯片和操作系统著称的公司,语音助手要靠竞争对手的模型和服务器来运行,Siri 团队要靠培训班来学会用 AI 写代码,这本身就是苹果在生成式 AI 浪潮中处境的缩影。
信源:https://www.theinformation.com/articles/apple-sends-siri-staffers-coding-bootcamp-latest-shakeup-organization?rc=h8czej
The Information
Apple Sends Siri Staffers to Coding ‘Bootcamp’ in Latest Shakeup For Organization
Apple is sending a portion of its Siri programmers back to coding school just two months before the company is expected to unveil a major, AI-powered revamp of the voice assistant, people familiar with the team said. The company plans to send a significant…