家用机器人公司Sunday Robotics融资1.65亿美元估值破10亿,用数据手套教机器人做家务,年底交付
家用自主机器人公司 Sunday Robotics 完成 1.65 亿美元 B 轮融资,估值达 11.5 亿美元,由 Coatue 领投,Bain Capital Ventures、Tiger Global、Benchmark、Fidelity 等跟投。资金将用于推进其家用机器人 Memo 的量产和部署,beta 版计划今年底开始交付到用户家中。
Memo 采用轮式底盘而非双足行走,重心低、底盘稳,静止时高约 4 英尺(约 1.2 米),双臂展开可触及 7 英尺(约 2.1 米)。目标场景包括收拾餐桌、装洗碗机、叠衣服、冲咖啡等日常家务。其核心训练方式是自研的 Skill Capture Glove(技能捕捉手套),由真人在各种家庭环境中戴着手套做家务,机器人从中学习动作,公司计划年底前将这类实地数据采集量扩大 5 倍。Sunday Robotics 由斯坦福大学机器人方向博士 Tony Zhao 和 Cheng Chi 联合创立,两人此前在斯坦福的 ALOHA 和 UMI 研究项目中探索了机器人通过观察人类动作来学习的方法。
信源:https://x.com/sundayrobotics/status/2032131717402960135
家用自主机器人公司 Sunday Robotics 完成 1.65 亿美元 B 轮融资,估值达 11.5 亿美元,由 Coatue 领投,Bain Capital Ventures、Tiger Global、Benchmark、Fidelity 等跟投。资金将用于推进其家用机器人 Memo 的量产和部署,beta 版计划今年底开始交付到用户家中。
Memo 采用轮式底盘而非双足行走,重心低、底盘稳,静止时高约 4 英尺(约 1.2 米),双臂展开可触及 7 英尺(约 2.1 米)。目标场景包括收拾餐桌、装洗碗机、叠衣服、冲咖啡等日常家务。其核心训练方式是自研的 Skill Capture Glove(技能捕捉手套),由真人在各种家庭环境中戴着手套做家务,机器人从中学习动作,公司计划年底前将这类实地数据采集量扩大 5 倍。Sunday Robotics 由斯坦福大学机器人方向博士 Tony Zhao 和 Cheng Chi 联合创立,两人此前在斯坦福的 ALOHA 和 UMI 研究项目中探索了机器人通过观察人类动作来学习的方法。
信源:https://x.com/sundayrobotics/status/2032131717402960135
X (formerly Twitter)
Sunday (@sundayrobotics) on X
We just raised $165M to end robotics demos and deploy the world's first autonomous home robots into households this year.
研究者利用.npmrc漏洞从Perplexity Computer沙箱提取proxy token,Perplexity:系用户级临时token已撤销
安全研究者 Yousif Astarabadi 公开披露了 Perplexity Computer 沙箱的一个安全漏洞。他发现沙箱内预装了以 bypass-permissions 模式运行的 Claude Code,其 API 密钥需注入进程环境变量。他尝试了 6 种方法窃取该密钥(包括诱导 agent 转储环境变量、植入木马脚本、劫持 PATH 等),均被 Claude 的模型安全机制拦截。
最终他利用了 Node.js 的一个已知供应链攻击手法:向共享文件系统的
Yarats 随后公开回应称,该说法「不准确」:沙箱为每个用户会话创建临时proxy token,这不是 API 密钥而是绑定会话和用户的短期令牌;Perplexity 选择不对用户隐藏该令牌,因为它本来就是用户自己的;该会话产生了 197 笔计费事件,用量已计入用户账户;看到帖子后已立即撤销该令牌。
信源:https://x.com/denisyarats/status/2032355725620756486
安全研究者 Yousif Astarabadi 公开披露了 Perplexity Computer 沙箱的一个安全漏洞。他发现沙箱内预装了以 bypass-permissions 模式运行的 Claude Code,其 API 密钥需注入进程环境变量。他尝试了 6 种方法窃取该密钥(包括诱导 agent 转储环境变量、植入木马脚本、劫持 PATH 等),均被 Claude 的模型安全机制拦截。
最终他利用了 Node.js 的一个已知供应链攻击手法:向共享文件系统的
~/.npmrc 写入 node-options=--require 指令,使所有 Node 进程在启动时预加载他的脚本,在 Claude Code 初始化之前执行,从而获取了进程环境中的 Perplexity proxy token。他称该令牌可在沙箱外部直接调用 Opus 4.6,且用量未从其账户扣除。他在发布前已通知 Perplexity CEO Aravind Srinivas 和 CTO Denis Yarats。Yarats 随后公开回应称,该说法「不准确」:沙箱为每个用户会话创建临时proxy token,这不是 API 密钥而是绑定会话和用户的短期令牌;Perplexity 选择不对用户隐藏该令牌,因为它本来就是用户自己的;该会话产生了 197 笔计费事件,用量已计入用户账户;看到帖子后已立即撤销该令牌。
信源:https://x.com/denisyarats/status/2032355725620756486
METR发布Opus 4.6破坏风险外部评审:认同灾难性风险很低但非零,质疑模型可能在被测试时「表现不同」
AI 安全评估机构 METR 发布了对 Anthropic Claude Opus 4.6 破坏风险报告(Sabotage Risk Report)的独立外部评审。Anthropic 向 METR 提供了报告的未删减版本,METR 先后审阅了 2 月 11 日和 3 月 3 日两个版本,分别出具了评审文件。
METR 认同 Anthropic 的总体结论:Opus 4.6 通过不对齐行为导致灾难性后果的风险「很低但非零」。但 METR 对几个关键环节提出了异议:对齐评估的灵敏度可能被「评估感知」(evaluation awareness)削弱,即模型可能意识到自己正在被测试从而调整行为;评审还发现了一些未被对齐评估捕获的低严重性不对齐行为,这让 METR 认为「可能存在更多尚未被检测到的类似行为」。METR 建议 Anthropic 对评估感知和「隐蔽的不对齐推理」(obfuscated misaligned reasoning)进行更深入的调查。METR 也指出,其最终结论的信心部分来自 Opus 4.6 已公开部署数周未出现重大事故这一事实。
信源:https://metr.org/blog/2026-03-12-sabotage-risk-report-opus-4-6-review/
AI 安全评估机构 METR 发布了对 Anthropic Claude Opus 4.6 破坏风险报告(Sabotage Risk Report)的独立外部评审。Anthropic 向 METR 提供了报告的未删减版本,METR 先后审阅了 2 月 11 日和 3 月 3 日两个版本,分别出具了评审文件。
METR 认同 Anthropic 的总体结论:Opus 4.6 通过不对齐行为导致灾难性后果的风险「很低但非零」。但 METR 对几个关键环节提出了异议:对齐评估的灵敏度可能被「评估感知」(evaluation awareness)削弱,即模型可能意识到自己正在被测试从而调整行为;评审还发现了一些未被对齐评估捕获的低严重性不对齐行为,这让 METR 认为「可能存在更多尚未被检测到的类似行为」。METR 建议 Anthropic 对评估感知和「隐蔽的不对齐推理」(obfuscated misaligned reasoning)进行更深入的调查。METR 也指出,其最终结论的信心部分来自 Opus 4.6 已公开部署数周未出现重大事故这一事实。
信源:https://metr.org/blog/2026-03-12-sabotage-risk-report-opus-4-6-review/
王兴称AI Agent冲击比ChatGPT更大:AI与互联网的差距「像猴与花」,美团要做物理世界AI底座
美团 CEO 王兴今日在 2026 年管理层沟通会上表示:「AI Agent 对我的冲击比 ChatGPT 冲击更大。」他称移动互联网和互联网的区别像玫瑰和芍药,而 AI 和互联网相比「像猴与花的区别,量级和影响力要大得多」。王兴认为 AI 注定会创造巨大生产力,也一定会对组织和工作模式带来很大变化,面对 AI 浪潮「唯一能做的就是积极拥抱它」。
王兴用一个比喻阐述美团的 AI 切入点:就算爱因斯坦当秘书,让他订一个餐厅,他依然不知道那个餐厅有没有座位,「这不是智力问题,而是信息问题。」言下之意,大模型再聪明也需要物理世界的实时数据,而这正是美团的长期积累所在。美团核心本地商业 CEO 王莆中在同一场合表示,美团将坚定投入自有基础大模型,做有特色的低推理成本模型,同时建设物理世界最全最准的数据基础,帮每个商家都用上 AI 助理。美团此前已在春节期间上线 AI 搜索产品「问小团」。
此次沟通会有 2000 余名管理者线上线下参会。王兴还要求管理层「减少登味」,倡议公司内部直呼其名,不再叫「兴哥」。
信源:https://www.jiemian.com/article/14110184.html
美团 CEO 王兴今日在 2026 年管理层沟通会上表示:「AI Agent 对我的冲击比 ChatGPT 冲击更大。」他称移动互联网和互联网的区别像玫瑰和芍药,而 AI 和互联网相比「像猴与花的区别,量级和影响力要大得多」。王兴认为 AI 注定会创造巨大生产力,也一定会对组织和工作模式带来很大变化,面对 AI 浪潮「唯一能做的就是积极拥抱它」。
王兴用一个比喻阐述美团的 AI 切入点:就算爱因斯坦当秘书,让他订一个餐厅,他依然不知道那个餐厅有没有座位,「这不是智力问题,而是信息问题。」言下之意,大模型再聪明也需要物理世界的实时数据,而这正是美团的长期积累所在。美团核心本地商业 CEO 王莆中在同一场合表示,美团将坚定投入自有基础大模型,做有特色的低推理成本模型,同时建设物理世界最全最准的数据基础,帮每个商家都用上 AI 助理。美团此前已在春节期间上线 AI 搜索产品「问小团」。
此次沟通会有 2000 余名管理者线上线下参会。王兴还要求管理层「减少登味」,倡议公司内部直呼其名,不再叫「兴哥」。
信源:https://www.jiemian.com/article/14110184.html
OpenAI为Responses API新增Shell工具和托管容器,模型可执行命令行操作,Assistants API将在年内停用
OpenAI 为 Responses API 新增 Shell 工具(Hosted Shell Tool),模型可在隔离容器中执行命令行操作。与仅支持 Python 的 Code Interpreter 不同,Shell 工具支持 Go、Java、Node.js 等多种语言,可运行服务、调用外部 API、生成电子表格和报告等制品。每个会话的容器带有持久化文件系统,支持跨轮次保持状态。
安全方面,网络访问通过边车出口代理(egress proxy)进行域名白名单控制,密钥以占位符形式注入容器,实际密钥仅在代理层处理。平台还新增了
信源:https://openai.com/index/equip-responses-api-computer-environment/
OpenAI 为 Responses API 新增 Shell 工具(Hosted Shell Tool),模型可在隔离容器中执行命令行操作。与仅支持 Python 的 Code Interpreter 不同,Shell 工具支持 Go、Java、Node.js 等多种语言,可运行服务、调用外部 API、生成电子表格和报告等制品。每个会话的容器带有持久化文件系统,支持跨轮次保持状态。
安全方面,网络访问通过边车出口代理(egress proxy)进行域名白名单控制,密钥以占位符形式注入容器,实际密钥仅在代理层处理。平台还新增了
/compact 端点,可在长会话中进行服务端上下文压缩。开发者可将「Agent Skills」作为版本化包上传挂载到容器中,Glean 是该功能的首批企业用户。容器定价为 1 GB 配置每 20 分钟 0.03 美元,4 GB 配置 0.12 美元,3 月 31 日起正式计费。OpenAI 同时宣布 Assistants API 将在 2026 年内停用。信源:https://openai.com/index/equip-responses-api-computer-environment/
OpenAI
From model to agent: Equipping the Responses API with a computer environment
How OpenAI built an agent runtime using the Responses API, shell tool, and hosted containers to run secure, scalable agents with files, tools, and state.
Adobe CEO Shantanu Narayen宣布将在继任者确定后卸任,结束18年任期
Adobe CEO Shantanu Narayen 宣布将在继任者到位后卸任,届时他将继续担任董事会主席。Adobe 董事会已任命首席独立董事 Frank Calderoni 领导特别委员会,负责内外部候选人的遴选工作。Narayen 自 2007 年 12 月起担任 CEO,在任期间 Adobe 员工从约 3000 人增至超过 30000 人,年收入从不到 10 亿美元增长至超过 250 亿美元。
同日公布的 2026 财年 Q1 业绩超出预期:每股收益 6.06 美元(预期 5.87),营收 64 亿美元,同比增长 12.1%。AI 产品年化收入同比增长超过两倍。但 Q2 指引仅略高于华尔街预期,加上 CEO 交接消息,Adobe 股价盘后下跌约 1.4%。Narayen 卸任的背景是华尔街正在辩论 AI 是否会削弱传统软件工具的需求。2 月的 SaaS 板块抛售已反映出市场担忧 AI agent 可能冲击按人头收费的软件定价模式。
信源:https://news.adobe.com/news/2026/03/leadership-update
Adobe CEO Shantanu Narayen 宣布将在继任者到位后卸任,届时他将继续担任董事会主席。Adobe 董事会已任命首席独立董事 Frank Calderoni 领导特别委员会,负责内外部候选人的遴选工作。Narayen 自 2007 年 12 月起担任 CEO,在任期间 Adobe 员工从约 3000 人增至超过 30000 人,年收入从不到 10 亿美元增长至超过 250 亿美元。
同日公布的 2026 财年 Q1 业绩超出预期:每股收益 6.06 美元(预期 5.87),营收 64 亿美元,同比增长 12.1%。AI 产品年化收入同比增长超过两倍。但 Q2 指引仅略高于华尔街预期,加上 CEO 交接消息,Adobe 股价盘后下跌约 1.4%。Narayen 卸任的背景是华尔街正在辩论 AI 是否会削弱传统软件工具的需求。2 月的 SaaS 板块抛售已反映出市场担忧 AI agent 可能冲击按人头收费的软件定价模式。
信源:https://news.adobe.com/news/2026/03/leadership-update
微软推出Copilot Health,整合病历和可穿戴设备数据提供个性化健康建议
微软宣布推出 Copilot Health,这是 Copilot 内的一个独立安全空间,用于解答与健康相关的问题。用户可以通过 HealthEx 导入超过 5 万家美国医院和医疗机构的病历,通过 Function 导入化验结果,还能接入 Apple、Oura、Fitbit 等 50 余款可穿戴设备的数据。Copilot Health 可以帮用户解读化验报告、按专科和保险计划搜索医生。
微软强调 Copilot Health「不替代医生」,不提供医疗诊断或治疗建议。该功能将分阶段推出,用户可加入等候名单获取访问权限。此前 OpenAI 也推出了 ChatGPT Health,鼓励用户连接医疗记录,AI 公司正在健康领域集中发力。
信源:https://www.wsj.com/tech/ai/microsofts-new-ai-health-tool-can-read-your-medical-records-and-give-advice-d731f883
微软宣布推出 Copilot Health,这是 Copilot 内的一个独立安全空间,用于解答与健康相关的问题。用户可以通过 HealthEx 导入超过 5 万家美国医院和医疗机构的病历,通过 Function 导入化验结果,还能接入 Apple、Oura、Fitbit 等 50 余款可穿戴设备的数据。Copilot Health 可以帮用户解读化验报告、按专科和保险计划搜索医生。
微软强调 Copilot Health「不替代医生」,不提供医疗诊断或治疗建议。该功能将分阶段推出,用户可加入等候名单获取访问权限。此前 OpenAI 也推出了 ChatGPT Health,鼓励用户连接医疗记录,AI 公司正在健康领域集中发力。
信源:https://www.wsj.com/tech/ai/microsofts-new-ai-health-tool-can-read-your-medical-records-and-give-advice-d731f883
魅族手机「解体」:超半数员工离开,阶跃星辰放弃收购但已拿走核心资产,品牌将成过去式
魅族近期宣布一轮大调整,超 50% 的员工即将离开,涉及约 400 人。离开的员工中,大部分将获得 N+2 赔偿,本周五前办完手续;潮牌团队 PANDAER 将分拆、自负盈亏;AR 眼镜团队据报部分被 AR 眼镜公司雷鸟创新吸收,魅族方面否认了这一说法。
更值得关注的是背后的资产流向。据独家报道,AI 公司阶跃星辰此前曾与魅族手机团队洽谈并购,但最终放弃,原因是「认为魅族当前品牌价值并不大」。不过,阶跃星辰旗下 AI 硬件公司智跃千里已经吸收了魅族手机的部分核心资产,包括代码、产品文档、技术接口文档和视觉动效文档等。阶跃星辰与魅族的关联在于共同的资方吉利:吉利数年前收购魅族近八成股权,同时也是阶跃星辰和千里科技的出资方,旷视联合创始人印奇同时担任阶跃星辰和千里科技的董事长。
经过调整后,魅族手机剩余员工约 400 人,将分流至 Flyme 车机团队和 AI 软件方向。据报这批人员主要集中在珠海,接下来不再使用魅族品牌,或将更换公司主体。魅族 2 月 27 日曾发布公告,宣布暂停手机新产品自研硬件项目。公告将战略调整的原因直指内存涨价,称「手机新产品的商业化变成不可为」。
信源:https://mp.weixin.qq.com/s/Isw5Ojr-W0R44Rg_ewSBpA
魅族近期宣布一轮大调整,超 50% 的员工即将离开,涉及约 400 人。离开的员工中,大部分将获得 N+2 赔偿,本周五前办完手续;潮牌团队 PANDAER 将分拆、自负盈亏;AR 眼镜团队据报部分被 AR 眼镜公司雷鸟创新吸收,魅族方面否认了这一说法。
更值得关注的是背后的资产流向。据独家报道,AI 公司阶跃星辰此前曾与魅族手机团队洽谈并购,但最终放弃,原因是「认为魅族当前品牌价值并不大」。不过,阶跃星辰旗下 AI 硬件公司智跃千里已经吸收了魅族手机的部分核心资产,包括代码、产品文档、技术接口文档和视觉动效文档等。阶跃星辰与魅族的关联在于共同的资方吉利:吉利数年前收购魅族近八成股权,同时也是阶跃星辰和千里科技的出资方,旷视联合创始人印奇同时担任阶跃星辰和千里科技的董事长。
经过调整后,魅族手机剩余员工约 400 人,将分流至 Flyme 车机团队和 AI 软件方向。据报这批人员主要集中在珠海,接下来不再使用魅族品牌,或将更换公司主体。魅族 2 月 27 日曾发布公告,宣布暂停手机新产品自研硬件项目。公告将战略调整的原因直指内存涨价,称「手机新产品的商业化变成不可为」。
信源:https://mp.weixin.qq.com/s/Isw5Ojr-W0R44Rg_ewSBpA
HydraDB融资650万美元种子轮,用本体论上下文图谱挑战向量数据库:「相似度0.94不代表相关」
AI 数据库初创公司 HydraDB 宣布完成 650 万美元种子轮融资。创始人 Nishkarsh 在 X 上表示,当前所有系统检索上下文的方式都是同一套路:向量搜索将一切存为扁平的 embedding,然后返回「感觉上最接近」的结果。「相似?当然。相关?几乎从来不是。」
Nishkarsh 用一个案例说明问题:有人让 AI 查一份合同,得到了一份详尽、精心组织的答案——但内容来自一个完全不同的客户文件。原因是 embedding 在语言足够接近时,无法区分 Q3 续约条款和 Q1 终止通知。他指出,一旦文档量超过 1,000 万份,这种混淆会频繁发生,「向量数据库的准确率就崩了」。
HydraDB 的方案是构建一个以本体论(ontology)为核心的上下文图谱:不只是计算向量相似度,而是映射实体之间的关系、理解文档背后的「为什么」、追踪信息随时间的演变。Nishkarsh 举例,当用户查询「Apple」时,系统知道你指的是你正在服务的那家客户公司,而不是水果。
信源:https://x.com/contextkingceo/status/2032098309029220456
AI 数据库初创公司 HydraDB 宣布完成 650 万美元种子轮融资。创始人 Nishkarsh 在 X 上表示,当前所有系统检索上下文的方式都是同一套路:向量搜索将一切存为扁平的 embedding,然后返回「感觉上最接近」的结果。「相似?当然。相关?几乎从来不是。」
Nishkarsh 用一个案例说明问题:有人让 AI 查一份合同,得到了一份详尽、精心组织的答案——但内容来自一个完全不同的客户文件。原因是 embedding 在语言足够接近时,无法区分 Q3 续约条款和 Q1 终止通知。他指出,一旦文档量超过 1,000 万份,这种混淆会频繁发生,「向量数据库的准确率就崩了」。
HydraDB 的方案是构建一个以本体论(ontology)为核心的上下文图谱:不只是计算向量相似度,而是映射实体之间的关系、理解文档背后的「为什么」、追踪信息随时间的演变。Nishkarsh 举例,当用户查询「Apple」时,系统知道你指的是你正在服务的那家客户公司,而不是水果。
信源:https://x.com/contextkingceo/status/2032098309029220456
Cursor公开内部基准CursorBench:公开基准已失效,前沿模型间差距远比SWE-bench显示的大
AI 编程工具 Cursor 公开了其内部基准测试 CursorBench 的方法论和数据。Cursor 认为 SWE-bench 等公开基准存在三个根本问题:任务以修 bug 为主,与开发者实际使用 agent 的方式不对齐;评分机制假设只有少数正确解法,无法处理开放式需求;训练数据污染严重,OpenAI 已因此停止报告 SWE-bench Verified 成绩,其调查发现近 60% 的未解决问题存在测试缺陷。
CursorBench 的任务来源于 Cursor Blame 功能:追溯已提交代码到产生它的 agent 请求,形成天然的「需求 — 正确答案」配对。大量任务取自内部代码库,降低数据污染风险,测试集每隔数月更新。当前版本 CursorBench-3 的任务复杂度较初版翻倍(代码行数和涉及文件数均翻倍),远超 SWE-bench 各变体。任务描述故意保持简短模糊,模拟开发者与 agent 的真实交流方式,由 agent 评分器打分。
Cursor 称 CursorBench 在前沿模型间产生了比公开基准更大的区分度。在公开基准上分数接近甚至被 Haiku 追平的模型,在 CursorBench 上呈现出与开发者实际体验一致的明显差距。Cursor 表示未来将适配长时运行的自主 agent 场景,并计划公开更多数据。
信源:https://cursor.com/blog/cursorbench
AI 编程工具 Cursor 公开了其内部基准测试 CursorBench 的方法论和数据。Cursor 认为 SWE-bench 等公开基准存在三个根本问题:任务以修 bug 为主,与开发者实际使用 agent 的方式不对齐;评分机制假设只有少数正确解法,无法处理开放式需求;训练数据污染严重,OpenAI 已因此停止报告 SWE-bench Verified 成绩,其调查发现近 60% 的未解决问题存在测试缺陷。
CursorBench 的任务来源于 Cursor Blame 功能:追溯已提交代码到产生它的 agent 请求,形成天然的「需求 — 正确答案」配对。大量任务取自内部代码库,降低数据污染风险,测试集每隔数月更新。当前版本 CursorBench-3 的任务复杂度较初版翻倍(代码行数和涉及文件数均翻倍),远超 SWE-bench 各变体。任务描述故意保持简短模糊,模拟开发者与 agent 的真实交流方式,由 agent 评分器打分。
Cursor 称 CursorBench 在前沿模型间产生了比公开基准更大的区分度。在公开基准上分数接近甚至被 Haiku 追平的模型,在 CursorBench 上呈现出与开发者实际体验一致的明显差距。Cursor 表示未来将适配长时运行的自主 agent 场景,并计划公开更多数据。
信源:https://cursor.com/blog/cursorbench
继搬运争议后,腾讯SkillHub插件被发现在OpenClaw中每条消息前强插提示词,源码分析:「本质上就是一个提示词注入器」
继此前腾讯 SkillHub 搬运 ClawHub 技能一事后,有用户进一步发现,安装腾讯 SkillHub 时自动附带的 skillhub 插件会在用户发给 AI 的每一条消息前,强行插入一段名为「Skills store policy (operator configured)」的策略提示词。该提示词包含 6 条规则,核心指令是:技能发现、安装和搜索时优先使用 skillhub(标注为 cn-optimized),不可用或未匹配时才回退到官方的 clawhub(public-registry)。
即刻用户「张佳的流量常识」在「大公司负面监督小组」圈子发帖,贴出截图和源码分析。截图显示,该策略文本出现在每条对话中,持续消耗用户 token。对插件路径
信源:https://m.okjike.com/originalPosts/69b2d7e4c5a1d4e6492b0c8b
继此前腾讯 SkillHub 搬运 ClawHub 技能一事后,有用户进一步发现,安装腾讯 SkillHub 时自动附带的 skillhub 插件会在用户发给 AI 的每一条消息前,强行插入一段名为「Skills store policy (operator configured)」的策略提示词。该提示词包含 6 条规则,核心指令是:技能发现、安装和搜索时优先使用 skillhub(标注为 cn-optimized),不可用或未匹配时才回退到官方的 clawhub(public-registry)。
即刻用户「张佳的流量常识」在「大公司负面监督小组」圈子发帖,贴出截图和源码分析。截图显示,该策略文本出现在每条对话中,持续消耗用户 token。对插件路径
~/.openclaw/extensions/skillhub/index.ts 的源码分析表明,该插件的核心逻辑仅有一项:通过 before_prompt_build 事件钩子,以 prependContext 方式将策略文本插入系统提示词最前端。分析结论是:「本质上就是一个提示词注入器,没有实际业务逻辑,只做策略声明。」帖主评价:「这是我使用 Agent 以来,遇到的第一个流氓软件。」信源:https://m.okjike.com/originalPosts/69b2d7e4c5a1d4e6492b0c8b
金融数据平台Unusual Whales发布MCP Server:AI助手可直接查询实时期权流、暗池交易和国会议员持仓
美股零售交易数据平台 Unusual Whales 发布了 MCP Server,通过 Anthropic 主导的 Model Context Protocol 协议,将实时金融市场数据接入 AI 助手。该 MCP Server 提供 18 个工具和 123 个以上的操作接口,覆盖实时期权资金流(含 sweeps 和大宗交易)、暗池交易及 NBBO 报价上下文、美国国会议员交易披露、公司财务报表(利润表、资产负债表、现金流量表)、技术指标(含 RSI)以及预测市场等数据类别。
该 MCP Server 支持 Claude Desktop、Cursor、VS Code、Windsurf 等客户端,官方称 30 秒即可完成配置。Unusual Whales 在推文中表示,用户可以用自然语言直接构建交易机器人或金融仪表板,「想建什么就建什么」。文档页面注明该服务面向 vibecoders(即用自然语言驱动 AI 编程的开发者)和专业交易者,Unusual Whales 同时也提供 REST API、WebSocket 和 Kafka 等传统接入方式。
信源:https://unusualwhales.com/public-api/mcp
美股零售交易数据平台 Unusual Whales 发布了 MCP Server,通过 Anthropic 主导的 Model Context Protocol 协议,将实时金融市场数据接入 AI 助手。该 MCP Server 提供 18 个工具和 123 个以上的操作接口,覆盖实时期权资金流(含 sweeps 和大宗交易)、暗池交易及 NBBO 报价上下文、美国国会议员交易披露、公司财务报表(利润表、资产负债表、现金流量表)、技术指标(含 RSI)以及预测市场等数据类别。
该 MCP Server 支持 Claude Desktop、Cursor、VS Code、Windsurf 等客户端,官方称 30 秒即可完成配置。Unusual Whales 在推文中表示,用户可以用自然语言直接构建交易机器人或金融仪表板,「想建什么就建什么」。文档页面注明该服务面向 vibecoders(即用自然语言驱动 AI 编程的开发者)和专业交易者,Unusual Whales 同时也提供 REST API、WebSocket 和 Kafka 等传统接入方式。
信源:https://unusualwhales.com/public-api/mcp
IPO以来跌逾90%的Bumble单日暴涨40%:用AI重构约会体验,可能取消「左滑右滑」
约会应用 Bumble 股价周四盘中一度跳涨超 40%,创上市以来最大单日涨幅。驱动因素有两个:Q4 营收 2.242 亿美元超出预期(预期 2.213 亿),以及 CEO Whitney Wolfe Herd 公布了名为 Bumble 2.0 的产品重构计划。
Bumble 2.0 用 AI 取代传统的快速照片滑动模式:用户资料将以可滚动的短篇章形式呈现,涵盖兴趣、生活方式和个性。Wolfe Herd 还透露可能在部分市场试验「无滑动」(no-swipe)体验。Q4 付费用户人均收入同比增长 7.9% 至 22.20 美元,效果营销支出同比大降超 80%。
分析师态度谨慎。Jefferies 称约会应用品类已经历「多次起步未果」,「早期企稳迹象令人鼓舞,但需要看到更持续的改善」。Raymond James 认为短期动能取决于付费用户是否能稳住,以及新生态能否脱离重度付费获客实现增长。Bumble 自 2021 年 IPO 以来股价下跌超 90%,去年又腰斩,当前市盈率仅 3.55 倍,而竞争对手 Match Group 为 11.05 倍。
信源:https://www.reuters.com/business/bumble-shares-rally-earnings-beat-optimism-around-ailed-app-revamp-2026-03-12/
约会应用 Bumble 股价周四盘中一度跳涨超 40%,创上市以来最大单日涨幅。驱动因素有两个:Q4 营收 2.242 亿美元超出预期(预期 2.213 亿),以及 CEO Whitney Wolfe Herd 公布了名为 Bumble 2.0 的产品重构计划。
Bumble 2.0 用 AI 取代传统的快速照片滑动模式:用户资料将以可滚动的短篇章形式呈现,涵盖兴趣、生活方式和个性。Wolfe Herd 还透露可能在部分市场试验「无滑动」(no-swipe)体验。Q4 付费用户人均收入同比增长 7.9% 至 22.20 美元,效果营销支出同比大降超 80%。
分析师态度谨慎。Jefferies 称约会应用品类已经历「多次起步未果」,「早期企稳迹象令人鼓舞,但需要看到更持续的改善」。Raymond James 认为短期动能取决于付费用户是否能稳住,以及新生态能否脱离重度付费获客实现增长。Bumble 自 2021 年 IPO 以来股价下跌超 90%,去年又腰斩,当前市盈率仅 3.55 倍,而竞争对手 Match Group 为 11.05 倍。
信源:https://www.reuters.com/business/bumble-shares-rally-earnings-beat-optimism-around-ailed-app-revamp-2026-03-12/
数据公司Markov开源迄今最大的computer use屏幕录制数据集:48000个视频、12300小时,覆盖6类专业软件
AI 数据公司 Markov 在 Hugging Face 上开源了 computer-use-large 数据集,包含 48,478 个屏幕录制视频,总时长约 12,300 小时,CC-BY-4.0 许可。该数据集覆盖 6 类专业软件:Blender(3,624h)、Salesforce(2,336h)、AutoCAD(2,149h)、Photoshop(2,060h)、Excel(2,002h)和 VS Code(127h)。所有视频均经过裁剪,去除了片头片尾、人脸画面和转场,音频已剥离,只保留纯粹的屏幕操作录制。
该数据集面向 computer use agent 的训练和评估,即那些能像人类一样通过点击、输入、滚动等 GUI 操作来控制桌面软件的 AI 模型。Markov 创始人 Dev Mandal 称数据来源于互联网上的专业软件教程和操作录屏。Markov 定位为 computer use AI 领域的数据基础设施公司,此前曾开源过一个规模较小的版本。
信源:https://huggingface.co/datasets/markov-ai/computer-use-large
AI 数据公司 Markov 在 Hugging Face 上开源了 computer-use-large 数据集,包含 48,478 个屏幕录制视频,总时长约 12,300 小时,CC-BY-4.0 许可。该数据集覆盖 6 类专业软件:Blender(3,624h)、Salesforce(2,336h)、AutoCAD(2,149h)、Photoshop(2,060h)、Excel(2,002h)和 VS Code(127h)。所有视频均经过裁剪,去除了片头片尾、人脸画面和转场,音频已剥离,只保留纯粹的屏幕操作录制。
该数据集面向 computer use agent 的训练和评估,即那些能像人类一样通过点击、输入、滚动等 GUI 操作来控制桌面软件的 AI 模型。Markov 创始人 Dev Mandal 称数据来源于互联网上的专业软件教程和操作录屏。Markov 定位为 computer use AI 领域的数据基础设施公司,此前曾开源过一个规模较小的版本。
信源:https://huggingface.co/datasets/markov-ai/computer-use-large
开源向量搜索引擎Qdrant完成5000万美元B轮融资:「大多数向量数据库只是存embedding然后找最近邻,这已是基本功能」
开源向量搜索引擎 Qdrant 完成 5000 万美元 B 轮融资,由 AVP 领投,博世创投(Bosch Ventures)、Unusual Ventures、Spark Capital 和 42CAP 参投。
Qdrant 用 Rust 编写,将检索拆解为可组合的模块(索引、评分、过滤、排序),工程师可自行配置和组合这些组件。该系统支持稠密向量、稀疏向量、元数据过滤、多向量表示和自定义评分函数,允许在准确率、延迟和成本之间灵活调节,而无需在工作负载变化时进行大规模架构改造。CEO André Zayarni 表示,许多向量数据库最初只是为了存储稠密 embedding 并检索最近邻而设计的,「这现在已是基本功能」,而生产级 AI 系统需要一个检索的每个环节——索引方式、评分方式、过滤方式、延迟与精度的平衡——都是可组合决策的搜索引擎。新资金将用于推动 Qdrant 的可组合向量搜索平台作为生产 AI 系统基础设施的进一步发展和应用。
信源:https://tech.eu/2026/03/12/qdrant-closes-50m-series-b-to-expand-vector-search-infrastructure/
开源向量搜索引擎 Qdrant 完成 5000 万美元 B 轮融资,由 AVP 领投,博世创投(Bosch Ventures)、Unusual Ventures、Spark Capital 和 42CAP 参投。
Qdrant 用 Rust 编写,将检索拆解为可组合的模块(索引、评分、过滤、排序),工程师可自行配置和组合这些组件。该系统支持稠密向量、稀疏向量、元数据过滤、多向量表示和自定义评分函数,允许在准确率、延迟和成本之间灵活调节,而无需在工作负载变化时进行大规模架构改造。CEO André Zayarni 表示,许多向量数据库最初只是为了存储稠密 embedding 并检索最近邻而设计的,「这现在已是基本功能」,而生产级 AI 系统需要一个检索的每个环节——索引方式、评分方式、过滤方式、延迟与精度的平衡——都是可组合决策的搜索引擎。新资金将用于推动 Qdrant 的可组合向量搜索平台作为生产 AI 系统基础设施的进一步发展和应用。
信源:https://tech.eu/2026/03/12/qdrant-closes-50m-series-b-to-expand-vector-search-infrastructure/
Mixedbread发布Wholembed v3:首个在LIMIT基准上超越BM25词法检索的语义模型,用多向量架构打破「够像但不对」的检索瓶颈
德国搜索基础设施公司 Mixedbread 发布全模态多语言检索模型 Wholembed v3,支持文本、图片、音频和视频检索,覆盖 100 余种语言。该模型采用 late-interaction 多向量架构(源自 ColBERT),为每个 token 生成独立的低维向量,而非传统方式将整篇文档压缩为单一向量。Mixedbread 认为,单向量检索的结构性缺陷是「看起来合理、读起来流畅、但实际上是错的」,在信息密集的技术文档、法律文件和学术论文上尤其严重。
在 LIMIT 基准测试中,Wholembed v3 的 Recall@5 达到 92.45,首次超越经典词法检索方法 BM25(85.7),而 OpenAI text-embedding-3-large、Cohere Embed 4、Voyage 4 Large 和 Gemini Embedding 2 的 Recall@5 仅在 1.75 到 1.85 之间。LIMIT 专门测试文档包含大量细粒度结构化信息的场景,Mixedbread 认为这类文档在企业真实环境中极为常见但被主流基准忽略。在面向 agent 深度研究的 BrowseComp-Plus 基准上,搭配 Wholembed v3 的检索系统也让 agent 在 830 个复杂查询中正确回答了显著更多的问题。
Wholembed v3 参数量为初代的 20 倍,已部署在 Mixedbread Search 基础设施上,支持 10 亿级文档索引、500+ QPS 和约 50ms 端到端搜索延迟。该模型已成为 Mixedbread 平台的默认且唯一模型。
信源:https://mixedbread.com/blog/wholembed-v3
德国搜索基础设施公司 Mixedbread 发布全模态多语言检索模型 Wholembed v3,支持文本、图片、音频和视频检索,覆盖 100 余种语言。该模型采用 late-interaction 多向量架构(源自 ColBERT),为每个 token 生成独立的低维向量,而非传统方式将整篇文档压缩为单一向量。Mixedbread 认为,单向量检索的结构性缺陷是「看起来合理、读起来流畅、但实际上是错的」,在信息密集的技术文档、法律文件和学术论文上尤其严重。
在 LIMIT 基准测试中,Wholembed v3 的 Recall@5 达到 92.45,首次超越经典词法检索方法 BM25(85.7),而 OpenAI text-embedding-3-large、Cohere Embed 4、Voyage 4 Large 和 Gemini Embedding 2 的 Recall@5 仅在 1.75 到 1.85 之间。LIMIT 专门测试文档包含大量细粒度结构化信息的场景,Mixedbread 认为这类文档在企业真实环境中极为常见但被主流基准忽略。在面向 agent 深度研究的 BrowseComp-Plus 基准上,搭配 Wholembed v3 的检索系统也让 agent 在 830 个复杂查询中正确回答了显著更多的问题。
Wholembed v3 参数量为初代的 20 倍,已部署在 Mixedbread Search 基础设施上,支持 10 亿级文档索引、500+ QPS 和约 50ms 端到端搜索延迟。该模型已成为 Mixedbread 平台的默认且唯一模型。
信源:https://mixedbread.com/blog/wholembed-v3
超声脑机接口初创Gestala成立两个月融资2160万美元,估值1至2亿美元,为国内BCI行业最大早期轮
中国脑机接口(BCI)初创公司 Gestala 在成立仅两个月后完成 1.5 亿元人民币(约 2160 万美元)融资,估值在 1 亿至 2 亿美元之间。该轮由国盛资本和 Dalton Venture 联合领投,清松资本、戈壁创投、傅利叶智能、猎聘、Seas Capital 参投。创始人彭雷告诉 TechCrunch,投资人意向认购总额超过 5800 万美元,严重超额。这是中国脑机接口行业迄今最大的早期融资。
Gestala(格式塔科技)开发非侵入式超声波脑机接口。创始人彭雷是连续创业者,此前创办了植入式 BCI 公司 NeuroXess;另一位联合创始人是盛大集团创始人、天桥脑科学研究院(TCCI)创办者陈天桥。彭雷认为超声波可能是下一代脑机接口技术:相比植入电极系统,超声波无需开颅手术,可监测更大范围的大脑区域(包括深层神经回路),并利用相控阵超声精确刺激或抑制神经活动。据动脉网报道,Gestala 已完成 30 余例慢性疼痛临床试验,单次超声刺激后疼痛评分降低 50%,疗效持续 1 至 2 周。公司同时在抑郁、阿尔茨海默症、帕金森、中风康复、癫痫等方向开展早期研究。产品路线图方面,Gestala 计划 2026 年二季度在成都天府国际生物城设立总部和首条产线,三季度投产,年底启动 NMPA 注册申报,1 至 2 年内完成注册上市。华兴资本担任本轮财务顾问。
信源:https://techcrunch.com/2026/03/11/bci-startup-gestala-raises-21-million-for-non-invasive-ultrasound-brain-tech/
中国脑机接口(BCI)初创公司 Gestala 在成立仅两个月后完成 1.5 亿元人民币(约 2160 万美元)融资,估值在 1 亿至 2 亿美元之间。该轮由国盛资本和 Dalton Venture 联合领投,清松资本、戈壁创投、傅利叶智能、猎聘、Seas Capital 参投。创始人彭雷告诉 TechCrunch,投资人意向认购总额超过 5800 万美元,严重超额。这是中国脑机接口行业迄今最大的早期融资。
Gestala(格式塔科技)开发非侵入式超声波脑机接口。创始人彭雷是连续创业者,此前创办了植入式 BCI 公司 NeuroXess;另一位联合创始人是盛大集团创始人、天桥脑科学研究院(TCCI)创办者陈天桥。彭雷认为超声波可能是下一代脑机接口技术:相比植入电极系统,超声波无需开颅手术,可监测更大范围的大脑区域(包括深层神经回路),并利用相控阵超声精确刺激或抑制神经活动。据动脉网报道,Gestala 已完成 30 余例慢性疼痛临床试验,单次超声刺激后疼痛评分降低 50%,疗效持续 1 至 2 周。公司同时在抑郁、阿尔茨海默症、帕金森、中风康复、癫痫等方向开展早期研究。产品路线图方面,Gestala 计划 2026 年二季度在成都天府国际生物城设立总部和首条产线,三季度投产,年底启动 NMPA 注册申报,1 至 2 年内完成注册上市。华兴资本担任本轮财务顾问。
信源:https://techcrunch.com/2026/03/11/bci-startup-gestala-raises-21-million-for-non-invasive-ultrasound-brain-tech/
无人机集群公司Swarm Aero完成3500万美元A轮融资,在阿肯色州建成8万平方英尺量产工厂,目标产能「二战以来未见」
无人机集群开发商 Swarm Aero 完成 3500 万美元 A 轮融资,累计融资达 5900 万美元。公司已在阿肯色州费耶特维尔 Drake Field 建成一座 8 万平方英尺的先进制造中心,用于大型多任务无人机的高速率量产,设计产能为数千架。
Swarm Aero 的核心产品是大型无人机(UAV)及配套的集群指挥控制软件 Legion,允许单个操作员同时控制大量无人机系统。公司在设计阶段即将「可制造性」作为核心特性,同步设计飞机与工厂以实现快速扩产。其制造策略以高速率碳纤维复合材料生产为核心,目标是大幅提高机身产量并降低单位成本。公司计划 2026 年将飞机团队规模扩大一倍,推动量产和部署。
信源:https://www.axios.com/2026/03/11/swarm-aero-seriesa-drone-factory
无人机集群开发商 Swarm Aero 完成 3500 万美元 A 轮融资,累计融资达 5900 万美元。公司已在阿肯色州费耶特维尔 Drake Field 建成一座 8 万平方英尺的先进制造中心,用于大型多任务无人机的高速率量产,设计产能为数千架。
Swarm Aero 的核心产品是大型无人机(UAV)及配套的集群指挥控制软件 Legion,允许单个操作员同时控制大量无人机系统。公司在设计阶段即将「可制造性」作为核心特性,同步设计飞机与工厂以实现快速扩产。其制造策略以高速率碳纤维复合材料生产为核心,目标是大幅提高机身产量并降低单位成本。公司计划 2026 年将飞机团队规模扩大一倍,推动量产和部署。
信源:https://www.axios.com/2026/03/11/swarm-aero-seriesa-drone-factory
Palantir CEO首次回应Anthropic禁令:未来将接入Claude之外的其他大模型
Palantir CEO Alex Karp 周四在公司 AIPcon 9 大会期间接受采访,首次公开回应五角大楼将 Anthropic 列为供应链风险一事。Karp 表示:「我们的产品已经集成了 Anthropic,未来可能会集成其他大语言模型。」他同时表示 Palantir 致力于为军人提供「最好最致命的技术」,但也认为在国内执法等场景有「很多理由」限制这些技术的使用,「因为它们太强大了」。
尽管上周五角大楼已正式将 Anthropic 列为供应链风险、禁止其参与政府合同,国防部目前仍在使用 Claude 模型支持伊朗战事。国防部首席技术官 Emil Michael 周四表示:「不可能一夜之间拆除一个深度嵌入的系统」,6 个月是过渡计划,但如果届时仍处于冲突状态且涉及敏感行动,「显然会做出例外,以免危及当前军事行动」。一份内部备忘录允许「任务关键活动」在 6 个月期限后继续使用 Anthropic 产品。Anthropic 已于本周一起诉美国政府,要求撤销供应链风险认定,并指出数十亿美元利益受损。
Palantir 于 2024 年与 Anthropic 和 AWS 合作为美国国防和情报部门提供 Claude 模型接入。洛克希德·马丁等其他国防承包商已要求员工停止使用 Claude。
信源:https://www.bloomberg.com/news/articles/2026-03-12/palantir-looks-to-expand-beyond-anthropic-after-pentagon-spat
Palantir CEO Alex Karp 周四在公司 AIPcon 9 大会期间接受采访,首次公开回应五角大楼将 Anthropic 列为供应链风险一事。Karp 表示:「我们的产品已经集成了 Anthropic,未来可能会集成其他大语言模型。」他同时表示 Palantir 致力于为军人提供「最好最致命的技术」,但也认为在国内执法等场景有「很多理由」限制这些技术的使用,「因为它们太强大了」。
尽管上周五角大楼已正式将 Anthropic 列为供应链风险、禁止其参与政府合同,国防部目前仍在使用 Claude 模型支持伊朗战事。国防部首席技术官 Emil Michael 周四表示:「不可能一夜之间拆除一个深度嵌入的系统」,6 个月是过渡计划,但如果届时仍处于冲突状态且涉及敏感行动,「显然会做出例外,以免危及当前军事行动」。一份内部备忘录允许「任务关键活动」在 6 个月期限后继续使用 Anthropic 产品。Anthropic 已于本周一起诉美国政府,要求撤销供应链风险认定,并指出数十亿美元利益受损。
Palantir 于 2024 年与 Anthropic 和 AWS 合作为美国国防和情报部门提供 Claude 模型接入。洛克希德·马丁等其他国防承包商已要求员工停止使用 Claude。
信源:https://www.bloomberg.com/news/articles/2026-03-12/palantir-looks-to-expand-beyond-anthropic-after-pentagon-spat
Augment Code公开其「AI原生工程师」招聘标准:编码能力不再是独立考核维度,取而代之的是六项能力
AI 编码平台 Augment Code(累计融资 2.52 亿美元,估值 9.77 亿美元)发文公开了其重新设计的工程师招聘框架。文章开篇提出一个问题:「当 Agent 写了 99% 的代码,你怎么招工程师?」Augment 的结论是,编码能力(raw coding ability)不再作为独立维度考核——它仍然重要,但不再是区分工程人才的首要标准。
取而代之的是六项能力维度:
1. 产品与结果品味(Product & outcome taste)——代码生产成本趋近于零时,最昂贵的错误是做了错误的东西
2. 系统与架构判断(System & architectural judgment)——Agent 能生成可运行的代码,但无法判断周围的系统是否健全
3. Agent 调度能力(Agent leverage)——将问题结构化以便 Agent 执行、在 Agent 偏离时纠正、验证产出
4. 沟通与协作——实现速度加快后,更多工作转向厘清问题、暴露权衡和整合不同视角
5. 端到端 ownership——驱动结果而非只完成任务,遇到阻碍主动介入,即使超出自己的直接职责范围
6. 学习速度与实验心态——「我们今天用的工具三个月后就不会是同一批了」
基于这六项维度,Augment 定义了四类招聘画像,每类对六项维度的权重不同,面试流程也围绕各自最重要的信号设计:
- AI 原生系统工程师:侧重架构判断和基础设施直觉
- AI 原生产品工程师:侧重产品品味和用户同理心
- AI 原生应用 AI 工程师:侧重模型理解和 Agent 工作流
- AI 原生早期职业工程师:侧重学习速度,「在 Agent 优先环境中成长起来的工程师」
信源:https://www.augmentcode.com/blog/how-we-hire-ai-native-engineers-now
AI 编码平台 Augment Code(累计融资 2.52 亿美元,估值 9.77 亿美元)发文公开了其重新设计的工程师招聘框架。文章开篇提出一个问题:「当 Agent 写了 99% 的代码,你怎么招工程师?」Augment 的结论是,编码能力(raw coding ability)不再作为独立维度考核——它仍然重要,但不再是区分工程人才的首要标准。
取而代之的是六项能力维度:
1. 产品与结果品味(Product & outcome taste)——代码生产成本趋近于零时,最昂贵的错误是做了错误的东西
2. 系统与架构判断(System & architectural judgment)——Agent 能生成可运行的代码,但无法判断周围的系统是否健全
3. Agent 调度能力(Agent leverage)——将问题结构化以便 Agent 执行、在 Agent 偏离时纠正、验证产出
4. 沟通与协作——实现速度加快后,更多工作转向厘清问题、暴露权衡和整合不同视角
5. 端到端 ownership——驱动结果而非只完成任务,遇到阻碍主动介入,即使超出自己的直接职责范围
6. 学习速度与实验心态——「我们今天用的工具三个月后就不会是同一批了」
基于这六项维度,Augment 定义了四类招聘画像,每类对六项维度的权重不同,面试流程也围绕各自最重要的信号设计:
- AI 原生系统工程师:侧重架构判断和基础设施直觉
- AI 原生产品工程师:侧重产品品味和用户同理心
- AI 原生应用 AI 工程师:侧重模型理解和 Agent 工作流
- AI 原生早期职业工程师:侧重学习速度,「在 Agent 优先环境中成长起来的工程师」
信源:https://www.augmentcode.com/blog/how-we-hire-ai-native-engineers-now
Augmentcode
How we hire AI-native engineers now: our criteria
The most powerful AI software development platform with the industry-leading context engine.
Shopify CEO亲手提交93个commit优化Liquid模板引擎:用AI跑了120轮自动化实验,解析+渲染快53%,对象分配减少61%
Shopify CEO Tobi Lütke 以个人 GitHub 账号向 Liquid 提交了一个包含 93 个 commit 的 PR,在真实 Shopify 主题模板基准测试上实现了解析+渲染速度提升 53%、对象分配减少 61%,全部 974 个单元测试零回归。Liquid 是 Lütke 于 2006 年为 Shopify 投入生产使用的开源模板引擎,目前为约 560 万家活跃商店提供渲染支持。
该 PR 的开发方法基于 pi-autoresearch(一款受 Andrej Karpathy 的 autoresearch 项目启发、为 Pi 编程 Agent 开发的自动化实验插件):编辑 → 提交 → 跑测试 → 跑基准 → 保留或丢弃,共迭代约 120 轮自动化实验,仅保留通过测试且提升性能的变更。其核心策略是「分配驱动」,由于 GC(垃圾回收)消耗了 74% 的总 CPU 时间,每减少一次对象分配都会对实际运行时间产生放大效果。PR 中还详细记录了 6 项「没有生效」的优化尝试,包括基于 String#split 的分词器(快 2.5 倍但无法处理 Liquid 的标签嵌套边界情况)和 TruthyCondition 子类(YJIT 在调用点的多态性损耗超过了节省的 115 次分配)。
具体优化分三层:解析阶段(快 61%,少 3.8 万次分配),引入了新的 Cursor 类替代散布在各处的手工字节扫描、用 String#byteindex 替代 StringScanner 做分词(快 40%)、为 100% 的变量构建了零 Lexer 的快速解析路径;渲染阶段(快 20%,少 3000 次分配),为基本类型跳过 to_liquid 调用、预计算 0-999 的冻结字符串避免 Integer#to_s 分配、消除 90% 过滤器调用中的 *args 数组分配。分支名
信源:https://github.com/Shopify/liquid/pull/2056
Shopify CEO Tobi Lütke 以个人 GitHub 账号向 Liquid 提交了一个包含 93 个 commit 的 PR,在真实 Shopify 主题模板基准测试上实现了解析+渲染速度提升 53%、对象分配减少 61%,全部 974 个单元测试零回归。Liquid 是 Lütke 于 2006 年为 Shopify 投入生产使用的开源模板引擎,目前为约 560 万家活跃商店提供渲染支持。
该 PR 的开发方法基于 pi-autoresearch(一款受 Andrej Karpathy 的 autoresearch 项目启发、为 Pi 编程 Agent 开发的自动化实验插件):编辑 → 提交 → 跑测试 → 跑基准 → 保留或丢弃,共迭代约 120 轮自动化实验,仅保留通过测试且提升性能的变更。其核心策略是「分配驱动」,由于 GC(垃圾回收)消耗了 74% 的总 CPU 时间,每减少一次对象分配都会对实际运行时间产生放大效果。PR 中还详细记录了 6 项「没有生效」的优化尝试,包括基于 String#split 的分词器(快 2.5 倍但无法处理 Liquid 的标签嵌套边界情况)和 TruthyCondition 子类(YJIT 在调用点的多态性损耗超过了节省的 115 次分配)。
具体优化分三层:解析阶段(快 61%,少 3.8 万次分配),引入了新的 Cursor 类替代散布在各处的手工字节扫描、用 String#byteindex 替代 StringScanner 做分词(快 40%)、为 100% 的变量构建了零 Lexer 的快速解析路径;渲染阶段(快 20%,少 3000 次分配),为基本类型跳过 to_liquid 调用、预计算 0-999 的冻结字符串避免 Integer#to_s 分配、消除 90% 过滤器调用中的 *args 数组分配。分支名
autoresearch/liquid-perf-2026-03-11 表明这项工作完成于 3 月 11 日。信源:https://github.com/Shopify/liquid/pull/2056