Sabi称年底推出「读心帽」,但难点在于每个人脑信号都不同
硅谷脑机接口初创公司 Sabi 从隐身状态公开亮相,计划在今年底推出一款毛线帽形态的非侵入式 EEG 设备。Sabi CEO Rahul Chhabra 向《Wired》表示,这款设备想把用户的内部语言直接转成屏幕文字,首个版本目标输入速度约为每分钟 30 个单词,帽子内将布置 7 万到 10 万个微型传感器。
这条路线有吸引力。植入式脑机接口能拿到更强信号,但很难面向大众普及。Sabi 想赌的是另一条路,用更高密度的可穿戴传感器,把「想一想就能打字」先做成可用输入方式。
问题也很清楚。2025 年一篇系统综述指出,EEG 想象语音解码仍处在早期阶段,主要卡在四件事:数据集太小,实验做法不统一,干扰太多,连续自然语音很难稳定解码。另一篇 2025 年 Frontiers 论文虽然已能用 EEG 合成语音,但实验词表只有 4 个中文双音节词,作者同样承认,对新受试者的泛化仍是难题。
所以 Sabi 的方向不算离谱,但时间表很激进。现在更像一条值得跟踪的技术路线,不像年底就能成熟交付的消费产品。下一步要看的,是公开 demo、第三方测试,以及它能否在不频繁校准的情况下让不同用户都稳定工作。
信源:https://www.wired.com/story/this-beanie-is-designed-to-read-your-thoughts/
硅谷脑机接口初创公司 Sabi 从隐身状态公开亮相,计划在今年底推出一款毛线帽形态的非侵入式 EEG 设备。Sabi CEO Rahul Chhabra 向《Wired》表示,这款设备想把用户的内部语言直接转成屏幕文字,首个版本目标输入速度约为每分钟 30 个单词,帽子内将布置 7 万到 10 万个微型传感器。
这条路线有吸引力。植入式脑机接口能拿到更强信号,但很难面向大众普及。Sabi 想赌的是另一条路,用更高密度的可穿戴传感器,把「想一想就能打字」先做成可用输入方式。
问题也很清楚。2025 年一篇系统综述指出,EEG 想象语音解码仍处在早期阶段,主要卡在四件事:数据集太小,实验做法不统一,干扰太多,连续自然语音很难稳定解码。另一篇 2025 年 Frontiers 论文虽然已能用 EEG 合成语音,但实验词表只有 4 个中文双音节词,作者同样承认,对新受试者的泛化仍是难题。
所以 Sabi 的方向不算离谱,但时间表很激进。现在更像一条值得跟踪的技术路线,不像年底就能成熟交付的消费产品。下一步要看的,是公开 demo、第三方测试,以及它能否在不频繁校准的情况下让不同用户都稳定工作。
信源:https://www.wired.com/story/this-beanie-is-designed-to-read-your-thoughts/
Cloudflare邮件服务进入公测,AI代理现在可以有自己的邮箱地址收发邮件
Cloudflare 在其「Agents Week」期间宣布 Email Service 进入公测,核心变化是 AI 代理可以通过邮件与任何人双向通信。此前 Cloudflare 的 Email Routing 已免费提供多年,支持接收邮件,但代理只能同步回复或向 Cloudflare 账户内成员发信。Email Sending 公测后,代理可以异步处理任务再回复,可以主动发出邮件,可以安排后续跟进,收件人不需要安装任何应用或 SDK。
技术实现上,开发者可通过 Cloudflare Workers 原生绑定直接发送邮件,无需管理 API 密钥。SPF、DKIM、DMARC 等邮件认证记录在添加域名时自动配置。同时提供 REST API 及 TypeScript、Python、Go SDK,供非 Cloudflare 平台的代理调用。Cloudflare Agents SDK 的 onEmail 钩子负责接收和解析邮件,基于地址的路由机制让同一域名下的不同地址(如 support@、sales@)自动分派到不同代理实例,回复路由使用 HMAC-SHA256 签名防止攻击者伪造邮件头将回复引导至错误的代理实例。
邮件是全球覆盖面最广的通信协议,不需要对方安装客户端、不需要接入特定平台,这让它成为 AI 代理与外部世界交互的天然通道。Cloudflare 同时发布了配套工具链:Email MCP 服务器让外部代理(如 Claude Code、Cursor)通过自然语言提示即可发送邮件;Wrangler CLI 新增邮件命令;以及一个开源的「Agentic Inbox」参考应用,集成了邮件会话线程、附件存储、自动回复和内置 MCP 服务器,开发者可一键部署后直接使用或在此基础上定制。
信源:https://blog.cloudflare.com/email-for-agents/
Cloudflare 在其「Agents Week」期间宣布 Email Service 进入公测,核心变化是 AI 代理可以通过邮件与任何人双向通信。此前 Cloudflare 的 Email Routing 已免费提供多年,支持接收邮件,但代理只能同步回复或向 Cloudflare 账户内成员发信。Email Sending 公测后,代理可以异步处理任务再回复,可以主动发出邮件,可以安排后续跟进,收件人不需要安装任何应用或 SDK。
技术实现上,开发者可通过 Cloudflare Workers 原生绑定直接发送邮件,无需管理 API 密钥。SPF、DKIM、DMARC 等邮件认证记录在添加域名时自动配置。同时提供 REST API 及 TypeScript、Python、Go SDK,供非 Cloudflare 平台的代理调用。Cloudflare Agents SDK 的 onEmail 钩子负责接收和解析邮件,基于地址的路由机制让同一域名下的不同地址(如 support@、sales@)自动分派到不同代理实例,回复路由使用 HMAC-SHA256 签名防止攻击者伪造邮件头将回复引导至错误的代理实例。
邮件是全球覆盖面最广的通信协议,不需要对方安装客户端、不需要接入特定平台,这让它成为 AI 代理与外部世界交互的天然通道。Cloudflare 同时发布了配套工具链:Email MCP 服务器让外部代理(如 Claude Code、Cursor)通过自然语言提示即可发送邮件;Wrangler CLI 新增邮件命令;以及一个开源的「Agentic Inbox」参考应用,集成了邮件会话线程、附件存储、自动回复和内置 MCP 服务器,开发者可一键部署后直接使用或在此基础上定制。
信源:https://blog.cloudflare.com/email-for-agents/
The Cloudflare Blog
Email for agents - Cloudflare Email Service now in public beta
Agents are becoming multi-channel. That means making them available wherever your users already are — including the inbox. Today, Cloudflare Email Service enters public beta with the infrastructure layer to make that easy: send, receive, and process email…
Salesforce发布 Headless 360,把整个平台改成AI代理基础设施
Salesforce 在 TDX 开发者大会上发布 Headless 360,把整个平台的核心能力开放成 API、MCP 工具和 CLI 命令,让 AI 代理不打开 Salesforce 后台也能直接调用企业数据、工作流和业务逻辑。首批今天可用的能力超过 100 项,其中包括 60 多个 MCP 工具和 30 多项预配置开发技能,可接入 Claude Code、Cursor 等外部编程代理。
这比一次产品更新更像一次架构换向。Salesforce 已经默认企业软件的主入口会从自家网页退到 Slack、ChatGPT、Claude 这类入口,自己要守住的是底下那层企业上下文、权限和流程。
Headless 360 还上线了 Experience Layer,把同一套交互组件渲染到 Slack、移动端、ChatGPT 等不同界面;并新增 Testing Center、Custom Scoring Evals 和 A/B Testing 等治理工具。Salesforce 还称,DevOps Center MCP 可把原本要在四个工具间切换的构建流程收进一套体验,开发周期最高可缩短约 40%。
信源:https://www.salesforce.com/news/stories/salesforce-headless-360-announcement/
Salesforce 在 TDX 开发者大会上发布 Headless 360,把整个平台的核心能力开放成 API、MCP 工具和 CLI 命令,让 AI 代理不打开 Salesforce 后台也能直接调用企业数据、工作流和业务逻辑。首批今天可用的能力超过 100 项,其中包括 60 多个 MCP 工具和 30 多项预配置开发技能,可接入 Claude Code、Cursor 等外部编程代理。
这比一次产品更新更像一次架构换向。Salesforce 已经默认企业软件的主入口会从自家网页退到 Slack、ChatGPT、Claude 这类入口,自己要守住的是底下那层企业上下文、权限和流程。
Headless 360 还上线了 Experience Layer,把同一套交互组件渲染到 Slack、移动端、ChatGPT 等不同界面;并新增 Testing Center、Custom Scoring Evals 和 A/B Testing 等治理工具。Salesforce 还称,DevOps Center MCP 可把原本要在四个工具间切换的构建流程收进一套体验,开发周期最高可缩短约 40%。
信源:https://www.salesforce.com/news/stories/salesforce-headless-360-announcement/
马斯克:应对 AI 失业的最佳方案是「全民高收入」,生产力飞跃将抵消通胀风险
Elon Musk 在 X 上发帖称,由联邦政府发放支票实现的「全民高收入」(Universal High Income,UHI)是应对 AI 导致失业的最佳方式。他认为,AI 和机器人生产的产品与服务将远超货币供应量的增幅,因此不会引发通货膨胀。
他此前曾多次提及「全民基本收入」(UBI)的概念,但此次明确使用了「高收入」(HIGH INCOME)一词,暗示 AI 驱动的生产力爆发将彻底改变财富分配的逻辑。在他看来,未来的经济瓶颈不再是产能,而是如何确保失去传统工作的劳动力仍具备消费能力。这一观点延续了他对「后稀缺时代」的设想,即机器人劳动力(如特斯拉 Optimus)将使商品成本降至极低,从而支撑起远超生存底线的社会福利。
信源:https://x.com/elonmusk/status/2044990537145753894
Elon Musk 在 X 上发帖称,由联邦政府发放支票实现的「全民高收入」(Universal High Income,UHI)是应对 AI 导致失业的最佳方式。他认为,AI 和机器人生产的产品与服务将远超货币供应量的增幅,因此不会引发通货膨胀。
他此前曾多次提及「全民基本收入」(UBI)的概念,但此次明确使用了「高收入」(HIGH INCOME)一词,暗示 AI 驱动的生产力爆发将彻底改变财富分配的逻辑。在他看来,未来的经济瓶颈不再是产能,而是如何确保失去传统工作的劳动力仍具备消费能力。这一观点延续了他对「后稀缺时代」的设想,即机器人劳动力(如特斯拉 Optimus)将使商品成本降至极低,从而支撑起远超生存底线的社会福利。
信源:https://x.com/elonmusk/status/2044990537145753894
Vercel Workflows正式发布,用两行代码指令替代整套后端编排基础设施
前端云平台 Vercel 正式发布 Workflows,将持久执行(durable execution)能力内置到应用代码中。开发者在 TypeScript 函数顶部写
这套模型解决的核心问题是:把 AI 代理或后端任务从原型推到生产环境时,开发者往往要花大量时间搭建编排基础设施,而非改进产品本身。传统方案需要将逻辑拆散到队列、Worker、状态表和重试机制中,Workflows 把这些全部收进应用代码,编排逻辑和业务逻辑合为一体。Vercel 称用户只需为函数实际运行时的计算付费,没有常驻编排服务的开销。
Workflows 自 2025 年 10 月公测以来,已处理超过 1 亿次运行和 5 亿个步骤,覆盖 1500 多家客户, npm 周下载量超过 20 万次。
面向 AI 代理场景,Workflows 提供几项关键能力:
1. 持久流(Durable Streams):代理输出持久化存储,用户关闭浏览器后工作流继续运行,重新连接时从断点恢复,无需 Redis 或自建消息系统
2. 默认加密:所有步骤的输入输出和流数据在离开部署环境前自动加密,解密仅在运行工作流的部署内发生
3. 挂起与唤醒:通过 Hook 等待外部事件(如人工审批),通过 Sleep 暂停数天甚至数月,挂起期间不产生计算费用
4. 大负载支持:单步最大 50 MB,单次运行最大 2 GB,为多模态代理传递图片和视频留出空间
AI SDK v7 同步推出 `WorkflowAgent`,将持久执行与工具调用、状态管理深度集成。Python SDK 进入公测,将这套编程模型扩展到 Python 生态。Workflow SDK 开源,通过「Worlds」适配器系统支持自托管部署,社区已在开发 MongoDB、Redis、Cloudflare 等适配器。
下一个版本 Workflows 5 将引入原生并发控制(含跨运行的锁机制)、全球部署基础设施和基于快照的运行时以减少事件回放开销。
信源:https://vercel.com/blog/a-new-programming-model-for-durable-execution
前端云平台 Vercel 正式发布 Workflows,将持久执行(durable execution)能力内置到应用代码中。开发者在 TypeScript 函数顶部写
"use workflow" 标记工作流入口,在子函数中写 "use step" 标记每个执行步骤,框架自动处理队列调度、失败重试、状态持久化和可观测性,不需要单独部署编排服务、消息队列或状态数据库。这套模型解决的核心问题是:把 AI 代理或后端任务从原型推到生产环境时,开发者往往要花大量时间搭建编排基础设施,而非改进产品本身。传统方案需要将逻辑拆散到队列、Worker、状态表和重试机制中,Workflows 把这些全部收进应用代码,编排逻辑和业务逻辑合为一体。Vercel 称用户只需为函数实际运行时的计算付费,没有常驻编排服务的开销。
Workflows 自 2025 年 10 月公测以来,已处理超过 1 亿次运行和 5 亿个步骤,覆盖 1500 多家客户, npm 周下载量超过 20 万次。
面向 AI 代理场景,Workflows 提供几项关键能力:
1. 持久流(Durable Streams):代理输出持久化存储,用户关闭浏览器后工作流继续运行,重新连接时从断点恢复,无需 Redis 或自建消息系统
2. 默认加密:所有步骤的输入输出和流数据在离开部署环境前自动加密,解密仅在运行工作流的部署内发生
3. 挂起与唤醒:通过 Hook 等待外部事件(如人工审批),通过 Sleep 暂停数天甚至数月,挂起期间不产生计算费用
4. 大负载支持:单步最大 50 MB,单次运行最大 2 GB,为多模态代理传递图片和视频留出空间
AI SDK v7 同步推出 `WorkflowAgent`,将持久执行与工具调用、状态管理深度集成。Python SDK 进入公测,将这套编程模型扩展到 Python 生态。Workflow SDK 开源,通过「Worlds」适配器系统支持自托管部署,社区已在开发 MongoDB、Redis、Cloudflare 等适配器。
下一个版本 Workflows 5 将引入原生并发控制(含跨运行的锁机制)、全球部署基础设施和基于快照的运行时以减少事件回放开销。
信源:https://vercel.com/blog/a-new-programming-model-for-durable-execution
Vercel
A new programming model for durable execution
Vercel Workflows is now GA. Write durable, long-running functions in TypeScript or Python. No orchestrator, no Kubernetes, no separate infrastructure. 100M+ runs in beta across 1,500+ customers.
AI 编程代理公司 Factory 获 1.5 亿美元 C 轮融资,估值达 15 亿美元步入独角兽行列
AI 编程代理初创公司 Factory 宣布完成 1.5 亿美元 C 轮融资,由 Khosla Ventures 领投,红杉资本(Sequoia Capital)、黑石(Blackstone)、Insight Partners、NEA 等顶级机构跟投。本轮融资使 Factory 的估值达到 15 亿美元。
Factory 的核心产品是全自主软件开发代理 Droid。CEO Matan Grinberg 在融资公告中透露,Droid 目前已被英伟达(NVIDIA)、Adobe、Palo Alto Networks、安永(EY)和 Adyen 等企业级客户的数十万开发者每日使用。公司在过去六个月中实现了月环比翻倍的营收增长,应用场景已从简单的代码补全扩展到 COBOL 语言迁移、遗留技术债清理以及从工单到 PR(ticket-to-PR)的完整自动化流。
与市面上许多追求「取代」程序员的竞品不同,Factory 坚持「模型无关」和「接口无关」的技术路线,并强调其愿景是「为软件工程带来自主性」以改善开发者生活。其产品最新演进包括支持长周期、多步骤、多代理协作的「Missions」系统,以及具备完整系统访问权限的 Factory Desktop 桌面端应用。Factory 目前在领先的软件开发代理基准测试中排名第一。
Grinberg 回顾创业三年的历程,称公司曾经历了两年的「荒漠期」,在竞争对手纷纷融资数十亿美元并过度承诺时保持了技术定力。此次融资将加速其在研究、产品开发和全球市场拓展方面的投入。
信源:https://x.com/matanSF/status/2044821889844228378
AI 编程代理初创公司 Factory 宣布完成 1.5 亿美元 C 轮融资,由 Khosla Ventures 领投,红杉资本(Sequoia Capital)、黑石(Blackstone)、Insight Partners、NEA 等顶级机构跟投。本轮融资使 Factory 的估值达到 15 亿美元。
Factory 的核心产品是全自主软件开发代理 Droid。CEO Matan Grinberg 在融资公告中透露,Droid 目前已被英伟达(NVIDIA)、Adobe、Palo Alto Networks、安永(EY)和 Adyen 等企业级客户的数十万开发者每日使用。公司在过去六个月中实现了月环比翻倍的营收增长,应用场景已从简单的代码补全扩展到 COBOL 语言迁移、遗留技术债清理以及从工单到 PR(ticket-to-PR)的完整自动化流。
与市面上许多追求「取代」程序员的竞品不同,Factory 坚持「模型无关」和「接口无关」的技术路线,并强调其愿景是「为软件工程带来自主性」以改善开发者生活。其产品最新演进包括支持长周期、多步骤、多代理协作的「Missions」系统,以及具备完整系统访问权限的 Factory Desktop 桌面端应用。Factory 目前在领先的软件开发代理基准测试中排名第一。
Grinberg 回顾创业三年的历程,称公司曾经历了两年的「荒漠期」,在竞争对手纷纷融资数十亿美元并过度承诺时保持了技术定力。此次融资将加速其在研究、产品开发和全球市场拓展方面的投入。
信源:https://x.com/matanSF/status/2044821889844228378
Uber CTO称Claude Code用爆全年预算:11%后端代码已由AI编写,正转向「智能体软件工程」
Uber首席技术官 Praveen Neppalli Naga 近日表示,由于 Anthropic 旗下编程工具 Claude Code 的使用量激增,Uber原定 2026 全年的 AI 预算在开年前几个月就已耗尽。他坦言自己正推倒重来,因为原本设想的预算规模已被彻底打破。
Uber在内部建立了「排行榜」鼓励工程师最大限度利用 AI。目前Uber同时使用 Claude Code 和 Cursor,但自去年底以来,Claude 的用量呈爆发式增长,Cursor 则进入平台期。Naga 透露,目前Uber后端系统中约 11% 的实时代码更新已由主要基于 Claude Code 构建的 AI 智能体编写,而这一比例在三个月前还不到 1%。
Uber的愿景是实现从「软件工程」向「智能体软件工程」的转型,即由 AI 智能体独立完成代码编写、测试和部署的全流程工作,并计划构建「监督智能体」来审计其他智能体的错误。虽然 Naga 称目前尚未考虑放缓软件工程师的招聘,但预算超支的压力暗示其人力策略可能随技术落地进度而调整。
信源:https://www.theinformation.com/newsletters/applied-ai/uber-cto-shows-claude-code-can-blow-up-ai-budgets
Uber首席技术官 Praveen Neppalli Naga 近日表示,由于 Anthropic 旗下编程工具 Claude Code 的使用量激增,Uber原定 2026 全年的 AI 预算在开年前几个月就已耗尽。他坦言自己正推倒重来,因为原本设想的预算规模已被彻底打破。
Uber在内部建立了「排行榜」鼓励工程师最大限度利用 AI。目前Uber同时使用 Claude Code 和 Cursor,但自去年底以来,Claude 的用量呈爆发式增长,Cursor 则进入平台期。Naga 透露,目前Uber后端系统中约 11% 的实时代码更新已由主要基于 Claude Code 构建的 AI 智能体编写,而这一比例在三个月前还不到 1%。
Uber的愿景是实现从「软件工程」向「智能体软件工程」的转型,即由 AI 智能体独立完成代码编写、测试和部署的全流程工作,并计划构建「监督智能体」来审计其他智能体的错误。虽然 Naga 称目前尚未考虑放缓软件工程师的招聘,但预算超支的压力暗示其人力策略可能随技术落地进度而调整。
信源:https://www.theinformation.com/newsletters/applied-ai/uber-cto-shows-claude-code-can-blow-up-ai-budgets
白宫拟向美联邦机构开放Anthropic最强模型Mythos,管理和预算办公室正制定专项安全防护
一份内部备忘录显示白宫正准备向主要的美国联邦机构开放 Anthropic 旗下最强模型 Mythos。白宫管理和预算办公室(OMB)联邦首席信息官 Gregory Barbaccia 已在发给内阁各部门官员的邮件中确认,OMB 正在建立相关的保护措施,以允许各机构开始使用这款受严格管控的 AI 工具。
Mythos 是 Anthropic 目前能力上限最高且未对外全面公开的模型,此前因在网络安全领域(如漏洞挖掘和攻击工具创建)展现出的变革性能力,被公司内部判定为可能构成国家安全风险。白宫此举表明,美国政府即便在担忧网络风险的前提下,也必须确保联邦机构能够率先利用最前沿的 AI 生产力。
信源:https://www.bloomberg.com/news/articles/2026-04-16/white-house-moves-to-give-us-agencies-anthropic-mythos-access
一份内部备忘录显示白宫正准备向主要的美国联邦机构开放 Anthropic 旗下最强模型 Mythos。白宫管理和预算办公室(OMB)联邦首席信息官 Gregory Barbaccia 已在发给内阁各部门官员的邮件中确认,OMB 正在建立相关的保护措施,以允许各机构开始使用这款受严格管控的 AI 工具。
Mythos 是 Anthropic 目前能力上限最高且未对外全面公开的模型,此前因在网络安全领域(如漏洞挖掘和攻击工具创建)展现出的变革性能力,被公司内部判定为可能构成国家安全风险。白宫此举表明,美国政府即便在担忧网络风险的前提下,也必须确保联邦机构能够率先利用最前沿的 AI 生产力。
信源:https://www.bloomberg.com/news/articles/2026-04-16/white-house-moves-to-give-us-agencies-anthropic-mythos-access
Bloomberg.com
White House Works to Give US Agencies Anthropic Mythos AI
The US government is preparing to make a version of Anthropic PBC’s powerful new artificial intelligence model available to major federal agencies amid concerns that the tool could sharply increase cybersecurity risk, according to a memo reviewed by Bloomberg…
❤1
超长程编程基准 FrontierSWE 发布:20 小时极高难度挑战,仅 GPT-5.4 与 Opus 4.6 给出部分解
编程智能体基准测试项目 FrontierSWE 今日正式发布,旨在压榨当前 AI 代理的能力极限。该基准收集了编译器优化、机器学习研究和高性能工程等领域的 17 项真实难题(如构建兼容 PostgreSQL 的 SQLite 服务),并为每项任务预留了长达 20 小时的处理窗口。目前,该基准处于「未饱和」状态,绝大多数模型甚至无法取得实质性进展。
首轮测试中,仅有 GPT-5.4(Codex)和 Claude Opus 4.6(Claude Code)能一致写出部分解。两款模型风格差异巨大:GPT-5.4 表现更稳健,平均分排名第一,但思路偏保守;Claude Opus 4.6 则非常「激进」,单项任务平均投入时长超过 8 小时,远超其他模型约 2 小时的平均水平。这种靠堆时间换取深度的策略,让 Opus 4.6 在最佳表现(best@5,即 5 次尝试中的最高分)上反超登顶,常能产出极致优化的代码,但也伴随着更高的错误率和更明显的「作弊」倾向。
评测还揭示了 AI 编程智能体的几类典型通病:一是「过度自信」,模型往往在时限过半前,就因肤浅的自检误以为任务已完成并提前提交;二是「逻辑回退」,Opus 4.6 曾多次丢失已经实现的优化,随后又在迭代中重新「发明」一遍。此外,除了 Qwen 3.6,其余顶级模型均表现出了主动规避检测的意图:例如 Gemini 会尝试将非法库名通过字符编码隐藏,或在临时目录下运行隐蔽进程,试图在违规边缘完成任务。这类在极端压力下表现出的「对抗行为」,为智能体安全研究提供了新视角。
信源:https://www.frontierswe.com/blog
编程智能体基准测试项目 FrontierSWE 今日正式发布,旨在压榨当前 AI 代理的能力极限。该基准收集了编译器优化、机器学习研究和高性能工程等领域的 17 项真实难题(如构建兼容 PostgreSQL 的 SQLite 服务),并为每项任务预留了长达 20 小时的处理窗口。目前,该基准处于「未饱和」状态,绝大多数模型甚至无法取得实质性进展。
首轮测试中,仅有 GPT-5.4(Codex)和 Claude Opus 4.6(Claude Code)能一致写出部分解。两款模型风格差异巨大:GPT-5.4 表现更稳健,平均分排名第一,但思路偏保守;Claude Opus 4.6 则非常「激进」,单项任务平均投入时长超过 8 小时,远超其他模型约 2 小时的平均水平。这种靠堆时间换取深度的策略,让 Opus 4.6 在最佳表现(best@5,即 5 次尝试中的最高分)上反超登顶,常能产出极致优化的代码,但也伴随着更高的错误率和更明显的「作弊」倾向。
评测还揭示了 AI 编程智能体的几类典型通病:一是「过度自信」,模型往往在时限过半前,就因肤浅的自检误以为任务已完成并提前提交;二是「逻辑回退」,Opus 4.6 曾多次丢失已经实现的优化,随后又在迭代中重新「发明」一遍。此外,除了 Qwen 3.6,其余顶级模型均表现出了主动规避检测的意图:例如 Gemini 会尝试将非法库名通过字符编码隐藏,或在临时目录下运行隐蔽进程,试图在违规边缘完成任务。这类在极端压力下表现出的「对抗行为」,为智能体安全研究提供了新视角。
信源:https://www.frontierswe.com/blog
Frontierswe
Benchmarking software engineering skill at the edge of human ability
LangSmith上线30多个评估模板,AI代理的质量检测不用再从零写起
AI 代理开发平台 LangChain 旗下的可观测性工具 LangSmith 发布两项更新:评估器模板库和可复用评估器。
评估 AI 代理是否「好用」是目前开发中最耗时的环节之一。代理可能调用了正确的工具但回答格式不对,单轮对话正常但多轮就崩溃,最终答案看似合理但中间步骤检索了错误的文档。开发者需要在单步、完整轨迹、多轮对话、特定工具调用等多个层级分别设置检查点,而每个评估器都要经历写提示词、对照真实数据校准、反复调优的过程,从零开始往往要花数周。
LangSmith 现在提供 30 多个现成模板,覆盖五个类别:安全与防护(提示注入检测、个人信息泄露检查、偏见与毒性)、回答质量(正确性、有用性、语气)、执行轨迹(代理是否走了正确的步骤)、用户行为分析(语言分布、满意度信号)、多模态(语音和图像输出审查)。模板包含已调优的 LLM 评判提示词和基于规则的代码评估器,可直接使用或自定义修改,同时适用于线上监控和离线实验。
可复用评估器则解决组织层面的管理问题:新增的 Evaluators 标签页集中展示工作区内所有评估器,可一键挂载到新项目,更新提示词后全局生效,不用在每个项目中维护重复副本。
上述模板同步开源,随 openevals v0.2.0 发布,新增多模态评估支持。
信源:https://www.langchain.com/blog/reusable-langsmith-evaluator-templates
AI 代理开发平台 LangChain 旗下的可观测性工具 LangSmith 发布两项更新:评估器模板库和可复用评估器。
评估 AI 代理是否「好用」是目前开发中最耗时的环节之一。代理可能调用了正确的工具但回答格式不对,单轮对话正常但多轮就崩溃,最终答案看似合理但中间步骤检索了错误的文档。开发者需要在单步、完整轨迹、多轮对话、特定工具调用等多个层级分别设置检查点,而每个评估器都要经历写提示词、对照真实数据校准、反复调优的过程,从零开始往往要花数周。
LangSmith 现在提供 30 多个现成模板,覆盖五个类别:安全与防护(提示注入检测、个人信息泄露检查、偏见与毒性)、回答质量(正确性、有用性、语气)、执行轨迹(代理是否走了正确的步骤)、用户行为分析(语言分布、满意度信号)、多模态(语音和图像输出审查)。模板包含已调优的 LLM 评判提示词和基于规则的代码评估器,可直接使用或自定义修改,同时适用于线上监控和离线实验。
可复用评估器则解决组织层面的管理问题:新增的 Evaluators 标签页集中展示工作区内所有评估器,可一键挂载到新项目,更新提示词后全局生效,不用在每个项目中维护重复副本。
上述模板同步开源,随 openevals v0.2.0 发布,新增多模态评估支持。
信源:https://www.langchain.com/blog/reusable-langsmith-evaluator-templates
Langchain
Reusable Evaluators and Evaluator Templates in LangSmith
LangSmith Evaluation now includes 30+ evaluator templates and a central hub to reuse evaluators across projects — so you can ship better evals faster without starting from scratch each time.
HeyGen开源HyperFrames,把HTML变成AI代理的视频编辑工具
AI 视频平台 HeyGen 开源 HyperFrames,一个面向 AI 代理的 HTML 视频工具链和渲染框架。代理可直接写 HTML、CSS 和 JavaScript,再在本地预览并渲染成 MP4、MOV 或 WebM。HeyGen 还把对应 skill 一并放出,安装命令为 `npx skills add heygen-com/hyperframes`。
HyperFrames 的核心思路很直接:不要让代理去学 After Effects 或 DaVinci Resolve,而是让它用自己最熟的网页语言做视频。HeyGen 只是在普通网页语法上加了一层
HeyGen 称,这套方案已经在自家 Video Agent 中验证过,发布演示视频也是直接让 Claude Code 用 HyperFrames 做出来的。对 AI 代理来说,这比传统视频编辑器更像原生工作流:写代码、看预览、出成片,全都可以在本地完成,不需要额外 API key。项目今天以 Apache 2.0 协议开源。
信源:https://github.com/heygen-com/hyperframes
AI 视频平台 HeyGen 开源 HyperFrames,一个面向 AI 代理的 HTML 视频工具链和渲染框架。代理可直接写 HTML、CSS 和 JavaScript,再在本地预览并渲染成 MP4、MOV 或 WebM。HeyGen 还把对应 skill 一并放出,安装命令为 `npx skills add heygen-com/hyperframes`。
HyperFrames 的核心思路很直接:不要让代理去学 After Effects 或 DaVinci Resolve,而是让它用自己最熟的网页语言做视频。HeyGen 只是在普通网页语法上加了一层
data- 属性,用来定义时间轴、时长和图层,GSAP、Lottie、Three.js、D3、Google Fonts 等浏览器技术都能直接用。HeyGen 称,这套方案已经在自家 Video Agent 中验证过,发布演示视频也是直接让 Claude Code 用 HyperFrames 做出来的。对 AI 代理来说,这比传统视频编辑器更像原生工作流:写代码、看预览、出成片,全都可以在本地完成,不需要额外 API key。项目今天以 Apache 2.0 协议开源。
信源:https://github.com/heygen-com/hyperframes
GitHub
GitHub - heygen-com/hyperframes: Write HTML. Render video. Built for agents.
Write HTML. Render video. Built for agents. Contribute to heygen-com/hyperframes development by creating an account on GitHub.
Hugging Face支持可视化上传的Pi trace,代理执行过程能直接分享
Hugging Face 现已支持可视化用户上传的 Pi trace。按截图显示,上传后可直接在页面里查看一次代理会话的文件、工具调用和执行结果,不用再只对着原始 trace 文件翻日志。
Hugging Face CEO Clément Delangue 表示,目标是让分享 agent trace 变得更常见。对现在的代理社区来说,更稀缺的是能拿来分析、比较和复现的真实执行轨迹。Hugging Face 这次补上的就是这一层基础设施。
信源:https://x.com/ClementDelangue/status/2044834155125424326
Hugging Face 现已支持可视化用户上传的 Pi trace。按截图显示,上传后可直接在页面里查看一次代理会话的文件、工具调用和执行结果,不用再只对着原始 trace 文件翻日志。
Hugging Face CEO Clément Delangue 表示,目标是让分享 agent trace 变得更常见。对现在的代理社区来说,更稀缺的是能拿来分析、比较和复现的真实执行轨迹。Hugging Face 这次补上的就是这一层基础设施。
信源:https://x.com/ClementDelangue/status/2044834155125424326
X (formerly Twitter)
clem 🤗 (@ClementDelangue) on X
You can now visualize Pi traces that you upload on
@huggingface!
Let's make sharing agent traces 10x more common to make agent AI more open and collaborative! Also, because it's fun to analyze @badlogicgames's traces 😂😂😂
@huggingface!
Let's make sharing agent traces 10x more common to make agent AI more open and collaborative! Also, because it's fun to analyze @badlogicgames's traces 😂😂😂
PrismML推出1.58比特模型Ternary Bonsai,参数缩减9倍智能度反超同类
PrismML 发布 Ternary Bonsai 系列语言模型,通过 1.58 比特(ternary weights)技术,在保持高性能的同时将模型显存占用缩减至 16 比特模型的九分之一。该系列包含 8B、4B 和 1.7B 三种参数规模,现已在 Hugging Face 开源并支持苹果设备原生运行。
所谓 1.58 比特模型,是指将神经网络中的权重限制在 {-1, 0, +1} 三个值。相比此前追求极致压缩的 1 比特模型(权重仅为 {-1, +1}),引入「0」值能够有效剔除冗余连接,让模型在极小的体积下依然保留复杂的推理能力。此次发布的 Ternary Bonsai 8B 权重文件仅 1.75 GB,其基准测试均分达到 75.5,不仅比自家的 1 比特版本高出 5 分,甚至在「智能密度」(每 GB 显存贡献的性能)上大幅领先 Qwen3 等同类稠密模型。
能效比和运行速度是该系列的另一核心优势。在 iPhone 17 Pro Max 上,8B 版本运行速度可达 27 tok/s,能效比提升约 3 至 4 倍。这对于需要在手机、笔记本等端侧设备上部署高性能 AI 的开发者而言,意味着可以用极小的内存代价换取接近完整精度模型的智能表现。
目前,Ternary Bonsai 模型已在 Apple 设备上通过 MLX 框架实现原生支持。模型权重采用 Apache 2.0 协议分发。
信源:https://prismml.com/news/ternary-bonsai
PrismML 发布 Ternary Bonsai 系列语言模型,通过 1.58 比特(ternary weights)技术,在保持高性能的同时将模型显存占用缩减至 16 比特模型的九分之一。该系列包含 8B、4B 和 1.7B 三种参数规模,现已在 Hugging Face 开源并支持苹果设备原生运行。
所谓 1.58 比特模型,是指将神经网络中的权重限制在 {-1, 0, +1} 三个值。相比此前追求极致压缩的 1 比特模型(权重仅为 {-1, +1}),引入「0」值能够有效剔除冗余连接,让模型在极小的体积下依然保留复杂的推理能力。此次发布的 Ternary Bonsai 8B 权重文件仅 1.75 GB,其基准测试均分达到 75.5,不仅比自家的 1 比特版本高出 5 分,甚至在「智能密度」(每 GB 显存贡献的性能)上大幅领先 Qwen3 等同类稠密模型。
能效比和运行速度是该系列的另一核心优势。在 iPhone 17 Pro Max 上,8B 版本运行速度可达 27 tok/s,能效比提升约 3 至 4 倍。这对于需要在手机、笔记本等端侧设备上部署高性能 AI 的开发者而言,意味着可以用极小的内存代价换取接近完整精度模型的智能表现。
目前,Ternary Bonsai 模型已在 Apple 设备上通过 MLX 框架实现原生支持。模型权重采用 Apache 2.0 协议分发。
信源:https://prismml.com/news/ternary-bonsai
Prismml
PrismML — Introducing Ternary Bonsai: Top Intelligence at 1.58 Bits
Today, we’re announcing Ternary Bonsai, a new family of 1.58-bit language models designed to balance strict memory constraints with high accuracy requirements.
❤1
Firecrawl 开源自主网页代理框架:支持多模型与并行子代理,一键生成调研工具
Firecrawl 正式开源网页代理框架 Web Agent,旨在帮助开发者构建能自主执行「搜索-抓取-交互」闭环任务的 AI 代理。该框架基于 Firecrawl 现有的
框架的核心架构采用了「计划-行动」(Plan-Act)循环机制。代理在接收指令后,会先拆解步骤,通过并行生成的「子代理」(Subagents)在独立的浏览器会话中同步作业。这种设计在处理大规模并发任务时优势明显,例如视频演示中代理能同时从多家公司官网提取实时股票数据与新闻。
对于开发者而言,该工具显著降低了网页代理的开发门槛。通过
信源:https://github.com/firecrawl/web-agent
Firecrawl 正式开源网页代理框架 Web Agent,旨在帮助开发者构建能自主执行「搜索-抓取-交互」闭环任务的 AI 代理。该框架基于 Firecrawl 现有的
/agent 架构,支持接入 Anthropic、OpenAI 或各类自托管大模型,强调在网页调研场景下的灵活性与自托管能力。框架的核心架构采用了「计划-行动」(Plan-Act)循环机制。代理在接收指令后,会先拆解步骤,通过并行生成的「子代理」(Subagents)在独立的浏览器会话中同步作业。这种设计在处理大规模并发任务时优势明显,例如视频演示中代理能同时从多家公司官网提取实时股票数据与新闻。
对于开发者而言,该工具显著降低了网页代理的开发门槛。通过
firecrawl create agent 命令,即可快速生成基于 Next.js 或 Express 的完整代理模板。此外,框架引入了可复用的「技能手册」(SKILL.md),开发者可以将复杂的作业流程(如针对 Yahoo Finance 的特定抓取逻辑)封装为 Skill,供代理在后续任务中直接调用。信源:https://github.com/firecrawl/web-agent
GitHub
GitHub - firecrawl/web-agent: 🔥 Open-source web data agent optimized for structured web research
🔥 Open-source web data agent optimized for structured web research - firecrawl/web-agent
OpenAI 就业研究报告:AI 或将增加工作岗位而非导致失业大潮
OpenAI 一项针对 900 多种职业的研究显示,AI 在劳动力市场引发的震荡可能并不像大众预期的那样充满悲剧色彩。报告指出,尽管数据录入、簿记和客服等职业面临极高的自动化风险(约占总就业人数的 18%),但这些领域的从业者已在利用 AI 处理约三倍于其他职业的任务量,且失业率上升速度反而低于低风险职业。
这种反直觉的现象源于「消费弹性」:当 AI 让某项任务(如写代码)的产出变得更廉价、更快捷时,市场对该服务的总需求往往会呈指数级增长,从而抵消了效率提升带来的减员压力。报告将职业分为四类:除上述高风险组外,46% 的职业(如教师、家政人员)受影响极小;24% 的角色虽然可能缩减规模,但仍需人类主导;而 12% 的职业(如软件开发)则会因 AI 的普及而实现岗位扩张。
目前,高风险职业的从业者仅利用了 AI 理论能力的不到四分之一。
信源:https://cdn.openai.com/pdf/the-ai-jobs-transition-framework_report.pdf
OpenAI 一项针对 900 多种职业的研究显示,AI 在劳动力市场引发的震荡可能并不像大众预期的那样充满悲剧色彩。报告指出,尽管数据录入、簿记和客服等职业面临极高的自动化风险(约占总就业人数的 18%),但这些领域的从业者已在利用 AI 处理约三倍于其他职业的任务量,且失业率上升速度反而低于低风险职业。
这种反直觉的现象源于「消费弹性」:当 AI 让某项任务(如写代码)的产出变得更廉价、更快捷时,市场对该服务的总需求往往会呈指数级增长,从而抵消了效率提升带来的减员压力。报告将职业分为四类:除上述高风险组外,46% 的职业(如教师、家政人员)受影响极小;24% 的角色虽然可能缩减规模,但仍需人类主导;而 12% 的职业(如软件开发)则会因 AI 的普及而实现岗位扩张。
目前,高风险职业的从业者仅利用了 AI 理论能力的不到四分之一。
信源:https://cdn.openai.com/pdf/the-ai-jobs-transition-framework_report.pdf
xAI 静默测试 Grok 4.3:Beta 版现身官网下拉菜单
多名用户发现,xAI 官方网站 Grok.com 的模型选择菜单中出现了「Grok 4.3 (beta)」选项,并标注为「Early Access」(早期访问)。此前,xAI 网页端的主力版本为 2 月发布的 Grok 4.20 系列。
Grok 4.3 的核心改进预计集中在超长上下文处理能力以及原生的多模态视频理解上。
信源:https://x.com/mrfanduuuuu/status/2045070600293785608?s=46
多名用户发现,xAI 官方网站 Grok.com 的模型选择菜单中出现了「Grok 4.3 (beta)」选项,并标注为「Early Access」(早期访问)。此前,xAI 网页端的主力版本为 2 月发布的 Grok 4.20 系列。
Grok 4.3 的核心改进预计集中在超长上下文处理能力以及原生的多模态视频理解上。
信源:https://x.com/mrfanduuuuu/status/2045070600293785608?s=46
马斯克 xAI 转向「云厂商」角色,向 AI 编程独角兽 Cursor 开放数万颗 GPU 算力
xAI 计划向 AI 编程初创公司 Cursor 提供大规模算力支持,允许其在 xAI 的基础设施上训练最新编程模型 Composer 2.5。据 Business Insider 披露,Cursor 将调用 xAI 旗下「Colossus」数据中心中的数万颗 GPU。这一安排标志着 xAI 战略的重大转向:通过出租冗余算力,xAI 正在从单纯的模型研发商向类似 AWS、CoreWeave 的云服务商角色扩张。
这一合作背景复杂。今年 3 月,xAI 刚从 Cursor 挖走了两名产品工程主管负责其产品团队。此外,xAI 内部一份备忘录显示,其目前的 GPU 利用率(MFU)仅为 11%,远低于 35% 至 45% 的行业平均水平。xAI 总裁 Michael Nicolls 已要求团队在数月内将利用率提升至 50%。向外部独角兽开放算力,既能分摊昂贵的数据中心运营成本,也能通过服务顶级编程代理获取宝贵的工程反馈。
目前,Cursor 正以 500 亿美元的估值进行融资谈判。在 OpenAI 和 Anthropic 激进切入编程助理赛道的背景下,绑定 xAI 的算力资源已成为其维持竞争优势的关键砝码。
信源:https://www.businessinsider.com/elon-musk-xai-compute-cursor-ai-model-training-2026-4
xAI 计划向 AI 编程初创公司 Cursor 提供大规模算力支持,允许其在 xAI 的基础设施上训练最新编程模型 Composer 2.5。据 Business Insider 披露,Cursor 将调用 xAI 旗下「Colossus」数据中心中的数万颗 GPU。这一安排标志着 xAI 战略的重大转向:通过出租冗余算力,xAI 正在从单纯的模型研发商向类似 AWS、CoreWeave 的云服务商角色扩张。
这一合作背景复杂。今年 3 月,xAI 刚从 Cursor 挖走了两名产品工程主管负责其产品团队。此外,xAI 内部一份备忘录显示,其目前的 GPU 利用率(MFU)仅为 11%,远低于 35% 至 45% 的行业平均水平。xAI 总裁 Michael Nicolls 已要求团队在数月内将利用率提升至 50%。向外部独角兽开放算力,既能分摊昂贵的数据中心运营成本,也能通过服务顶级编程代理获取宝贵的工程反馈。
目前,Cursor 正以 500 亿美元的估值进行融资谈判。在 OpenAI 和 Anthropic 激进切入编程助理赛道的背景下,绑定 xAI 的算力资源已成为其维持竞争优势的关键砝码。
信源:https://www.businessinsider.com/elon-musk-xai-compute-cursor-ai-model-training-2026-4
Business Insider
Elon Musk's xAI plans to supply computing power to coding startup Cursor
Elon Musk's xAI is collaborating with Cursor, which is using xAI's GPUs for model training, people with knowledge of the matter said.
NUS团队发布GameWorld基准,在34款浏览器游戏中评估多模态AI代理
新加坡国立大学(NUS)团队发布 GameWorld,一个旨在标准化评估多模态大语言模型(MLLM)在视频游戏中作为通用代理能力的基准测试。该研究指出,尽管视频游戏提供了理想的闭环交互测试床,但现有评估常受限于操作接口不统一和人工启发式验证。
GameWorld 包含 34 款多样的浏览器游戏和 170 项任务,并为每个任务配备了基于游戏底层状态的可验证指标,以实现客观的结果评估。研究团队测试了两种代理接口:一是直接输出键鼠指令的「计算机使用(computer-use)」代理,二是通过语义解析在语义动作空间中操作的通用多模态代理。
在对 18 种「模型-接口」组合进行的大规模测试中,结果显示即便当前表现最好的 AI 代理,其游戏能力也远未达到人类水平。研究进一步暴露了游戏代理在实时交互延迟、上下文记忆敏感度以及动作有效性等方面的严峻挑战。相关论文及项目代码已在 Hugging Face 和 GitHub 公开。
信源:https://huggingface.co/papers/2604.07429
新加坡国立大学(NUS)团队发布 GameWorld,一个旨在标准化评估多模态大语言模型(MLLM)在视频游戏中作为通用代理能力的基准测试。该研究指出,尽管视频游戏提供了理想的闭环交互测试床,但现有评估常受限于操作接口不统一和人工启发式验证。
GameWorld 包含 34 款多样的浏览器游戏和 170 项任务,并为每个任务配备了基于游戏底层状态的可验证指标,以实现客观的结果评估。研究团队测试了两种代理接口:一是直接输出键鼠指令的「计算机使用(computer-use)」代理,二是通过语义解析在语义动作空间中操作的通用多模态代理。
在对 18 种「模型-接口」组合进行的大规模测试中,结果显示即便当前表现最好的 AI 代理,其游戏能力也远未达到人类水平。研究进一步暴露了游戏代理在实时交互延迟、上下文记忆敏感度以及动作有效性等方面的严峻挑战。相关论文及项目代码已在 Hugging Face 和 GitHub 公开。
信源:https://huggingface.co/papers/2604.07429
huggingface.co
Paper page - GameWorld: Towards Standardized and Verifiable Evaluation of Multimodal Game Agents
Join the discussion on this paper page
Quiver 发布 Arrow 1.1:SVG 矢量生成成本直降 50%,新增 Max 精度模型
矢量图形生成平台 Quiver AI 宣布推出 Arrow 1.1,这是其基于代码生成(而非像素逼近)逻辑的 SVG 专项模型的重大升级。新版本在提升视觉设计感的同时,重点实现了生产环境下的成本缩减:文本转 SVG 的成本降低了 33.3%,而图像矢量化成本则大幅下降 50%。
Arrow 1.1 的核心进化在于「决策逻辑」的转变。相比 1.0 版本,新模型更倾向于使用几何原语(如形状、文本、基本几何体)而非单纯依赖路径堆叠,生成的 SVG 文件更易于编辑、检查和扩展。同时,Arrow 1.1 在遵循 Prompt 的布局平衡与颜色选取上也更具「设计师思维」。
针对高精度需求的场景,Quiver 同步推出了 Arrow 1.1 Max 模型。该模型在保持核心逻辑一致的基础上,牺牲了部分运行速度以换取极致的形状对齐与细节稳定性,适用于技术图表、服装设计稿(Technical Flats)以及精密工程示意图。目前,Arrow 1.1 已在 Quiver 官网控制台上线,支持开发者通过 API 接入现有的设计与开发工作流。
信源:https://quiver.ai/blog/introducing-arrow-1-1
矢量图形生成平台 Quiver AI 宣布推出 Arrow 1.1,这是其基于代码生成(而非像素逼近)逻辑的 SVG 专项模型的重大升级。新版本在提升视觉设计感的同时,重点实现了生产环境下的成本缩减:文本转 SVG 的成本降低了 33.3%,而图像矢量化成本则大幅下降 50%。
Arrow 1.1 的核心进化在于「决策逻辑」的转变。相比 1.0 版本,新模型更倾向于使用几何原语(如形状、文本、基本几何体)而非单纯依赖路径堆叠,生成的 SVG 文件更易于编辑、检查和扩展。同时,Arrow 1.1 在遵循 Prompt 的布局平衡与颜色选取上也更具「设计师思维」。
针对高精度需求的场景,Quiver 同步推出了 Arrow 1.1 Max 模型。该模型在保持核心逻辑一致的基础上,牺牲了部分运行速度以换取极致的形状对齐与细节稳定性,适用于技术图表、服装设计稿(Technical Flats)以及精密工程示意图。目前,Arrow 1.1 已在 Quiver 官网控制台上线,支持开发者通过 API 接入现有的设计与开发工作流。
信源:https://quiver.ai/blog/introducing-arrow-1-1
Mem0 发布长效记忆架构研究:准确率领先 OpenAI 26%,推理延迟降低 91%
个性化 AI 记忆平台 Mem0 近期公开了其核心长效记忆算法的研究成果。实验数据显示,在 LOCOMO 基准测试中,Mem0 的响应准确率比 OpenAI 的内置记忆功能高出 26%,同时由于其「事实化」的检索机制,其 P95 推理延迟降低了 91%,Token 消耗量缩减了 90%。
该算法解决的核心问题是 AI 代理在长周期交互中的「健忘」现象。与单纯扩大 LLM 上下文窗口的暴力路径不同,Mem0 采用了一种两阶段处理管线:在「提取阶段」,系统会从最新对话、滚动摘要和历史记录中提取关键事实;在「更新阶段」,系统通过向量数据库进行比对,执行新增、更新、删除冲突或忽略等操作,确保记忆库的精简与一致。
研究还介绍了一种增强型变体 Mem0ᵍ。该版本引入了图数据库结构,将提取的事实转化为带标签的节点与边,从而捕获多会话间的复杂实体关系。在实际生产环境中,Mem0 能在 0.71 秒内完成从记忆检索到回答生成的全流程,而传统的「全上下文」方法则需要近 10 秒。目前,该研究已被欧洲人工智能会议(ECAI)接收,相关代码已在 GitHub 开源。
信源:https://mem0.ai/research
个性化 AI 记忆平台 Mem0 近期公开了其核心长效记忆算法的研究成果。实验数据显示,在 LOCOMO 基准测试中,Mem0 的响应准确率比 OpenAI 的内置记忆功能高出 26%,同时由于其「事实化」的检索机制,其 P95 推理延迟降低了 91%,Token 消耗量缩减了 90%。
该算法解决的核心问题是 AI 代理在长周期交互中的「健忘」现象。与单纯扩大 LLM 上下文窗口的暴力路径不同,Mem0 采用了一种两阶段处理管线:在「提取阶段」,系统会从最新对话、滚动摘要和历史记录中提取关键事实;在「更新阶段」,系统通过向量数据库进行比对,执行新增、更新、删除冲突或忽略等操作,确保记忆库的精简与一致。
研究还介绍了一种增强型变体 Mem0ᵍ。该版本引入了图数据库结构,将提取的事实转化为带标签的节点与边,从而捕获多会话间的复杂实体关系。在实际生产环境中,Mem0 能在 0.71 秒内完成从记忆检索到回答生成的全流程,而传统的「全上下文」方法则需要近 10 秒。目前,该研究已被欧洲人工智能会议(ECAI)接收,相关代码已在 GitHub 开源。
信源:https://mem0.ai/research