动察Beating AI News
3.18K subscribers
902 photos
2 videos
1 file
3.44K links
AI新闻信息流
Download Telegram
Exa开源WebCode基准:专测编程Agent搜索质量,揭示模型「背答案」与真正检索的差距

AI 搜索引擎公司 Exa 开源了 WebCode,一套专门评估编程 Agent 网页搜索质量的基准测试,已在 GitHub 上以 MIT 协议发布。

Exa 称,现有公开基准存在训练数据污染问题,模型可能凭参数记忆而非真正检索来回答问题。OpenAI 近期因此弃用了 SWE-bench Verified 基准。WebCode 针对这一缺陷,将评估拆分为「正确性」(模型最终答案是否正确)和「扎根性」(检索到的内容是否真正包含答案)两个独立维度。测试结果显示,各搜索供应商在正确性上聚集在约 86% 的水平,差异不大,这主要反映的是模型自身的记忆能力;而扎根性得分差距显著,才是区分搜索质量的有效指标。

WebCode 包含四个评估维度:

1. 内容提取质量:基于 250 个 URL,衡量搜索供应商从网页中提取干净内容的能力
2. 高亮检索:给定 URL 和查询,衡量能否定位到页面中回答问题的相关段落
3. RAG 检索:317 组问答对,来源涵盖 GNU、W3C、IETF RFC 及 Python、Rust、Go 等语言官方文档
4. 端到端编程任务:33 个沙盒编程任务,覆盖 Go、Python、TypeScript 等 9 种语言,均针对 2025 年 8 月后的库更新版本,确保模型无法从训练数据中获取答案

Exa 成立于 2021 年,定位为「面向 AI 的搜索引擎」,2025 年 9 月完成由 Benchmark 领投的 8500 万美元 B 轮融资,估值 7 亿美元。

信源:https://exa.ai/blog/webcode
阿里达摩院发布玄铁C950:RISC-V架构首次原生跑通千亿参数大模型,SPECint2006破70分创全球纪录

阿里巴巴达摩院在上海举行的 2026 玄铁 RISC-V 生态大会上发布新一代旗舰 CPU 玄铁 C950。该芯片采用开源 RISC-V 架构和 5nm 制程,频率达 3.2GHz,单核性能在 SPECint2006 基准测试中突破 70 分,刷新全球 RISC-V CPU 性能纪录,综合性能为上一代玄铁 C920 的 3 倍以上,访存带宽提升超 4 倍。

玄铁 C950 在硬件层面集成自研 AI 加速引擎,首次实现 RISC-V 架构对 Qwen3、DeepSeek V3 等千亿参数级大模型的原生支持。目标应用场景覆盖云计算、生成式 AI、高端机器人和边缘计算,定位为 AI Agent 时代的新型高端 CPU。芯片还原生支持机密计算安全隔离和数据保护。

达摩院是 RISC-V 领域的全球领军力量之一,已发布 10 余款玄铁系列 CPU,落地近千款终端产品,覆盖服务器、机器人、新能源汽车、AI 智能终端和存储控制器等领域。玄铁 C950 历时两年研发。

信源:https://mp.weixin.qq.com/s/hrLaunWcE2x2NjLdgh5qGQ
ripgrep搜15秒的大仓库,Cursor给Agent建了本地索引,查询降至毫秒级

Cursor 发布技术博客,介绍其为 AI Agent 构建的本地正则搜索索引 Instant Grep。Agent 编码时高度依赖 ripgrep 搜索代码,但在大型单体仓库中单次搜索常耗时超过 15 秒,严重拖慢交互节奏。

Instant Grep 采用稀疏 n-gram(Sparse N-grams)索引方案。传统方案提取所有连续 3 字符片段作为索引键,稀疏方案则基于字符对的频率权重,确定性地提取长度不等的 n-gram。权重函数来自对数 TB 开源代码的字符对频率统计,罕见组合获得更高权重,查询时只需查找极少量 n-gram 即可精准定位候选文件,再对候选集做全文匹配。

索引完全在用户本地构建和查询,不经过服务器。索引基于 Git 提交状态生成,用户和 Agent 的实时修改作为增量层叠加其上,确保 Agent 能立即搜到自己刚写的代码。存储分为两个文件:倒排列表文件和排序查找表,后者通过 mmap 映射到编辑器进程内存,查询时做二分搜索后按偏移量直接读磁盘,内存占用极低。

Cursor 展示了在 Chromium 等大型代码库上的对比:开启 Instant Grep 后,Agent 调查 Bug 和重构任务的搜索等待时间几乎归零,整体耗时显著缩短。该功能配合 Cursor 新模型 Composer 2 使用。

信源:https://cursor.com/blog/fast-regex-search
美国国务院正式启动「新兴威胁局」:AI和量子武器化列为重点,设五个专职办公室

美国国务院正式启动新兴威胁局(Bureau of Emerging Threats),负责应对伊朗、中国、俄罗斯、朝鲜及外国恐怖组织利用先进技术对美国国家安全构成的威胁。国务卿 Marco Rubio 近一年前在国务院重组方案中宣布成立该机构,但具体职能此前未公开。

国务院首席副发言人 Tommy Pigott 表示:「该局将应对我们今天在网络空间、外太空、关键基础设施以及 AI 和量子等颠覆性技术被滥用方面面临的威胁,以及未来数十年将面临的威胁。」

新兴威胁局设五个下属部门:

1. 网络安全办公室
2. 关键基础设施安全办公室
3. 颠覆性技术办公室
4. 太空安全办公室
5. 威胁评估办公室

该局由 Anny Vu 领导,她此前担任特朗普政府驻华临时代办。该局于 3 月 20 日正式通知国会成立,与白宫同日发布 AI 国家政策框架。背景方面,网络安全公司 CrowdStrike 称,自今年 2 月底美国和以色列对伊朗采取军事行动以来,亲伊朗黑客活动明显增加。美国网络安全与基础设施安全局(CISA)正在调查至少一起被认为由亲伊朗黑客实施的重大攻击,受害方为美国医疗器械公司 Stryker。

信源:https://abcnews.com/Politics/state-department-launches-effort-counter-cyberattacks-ai-risks/story?id=131265350
上线72小时就崩了:OpenClaw一次更新「背刺」微信龙虾插件

微信上周末推出的官方 OpenClaw 插件 ClawBot 上线仅 72 小时,就因 OpenClaw 2026.3.22 版本的一次插件系统重构而全面失效。

OpenClaw 在这次更新中删除了原有的统一入口 `openclaw/plugin-sdk`,强制插件使用细分路径(如 `openclaw/plugin-sdk/core`)按需加载,且不提供任何兼容过渡方案。官方称此举是为了提升启动速度、降低内存占用,并封堵旧接口可能被恶意插件利用的跨包逃逸漏洞。

微信 ClawBot 插件因代码中写死了旧版路径,更新后直接报错「Cannot find module 'openclaw/plugin-sdk'」,无法加载。企业微信、飞书等聊天应用插件同样受到影响,OpenClaw 还对这些插件弹出「WARNING: Dangerous Code Patterns」警告,提示存在环境变量访问与网络发送组合的潜在凭据收割风险。QQ Bot 插件暂未受影响,仍可正常使用。

微信方面回应称会尽快更新修复,目前只有升级到最新版 OpenClaw 的用户受影响。社区对此事看法分化:有人批评微信不熟悉开源生态的迭代节奏,也有人指出 OpenClaw 的 API 设计本身不够稳定,通常负责任的做法是先标记旧接口为「已废弃」,保留过渡期后再删除。

信源:https://weibo.com/7876775013/5279951579774992
纳瓦尔:AI编程Agent已能一键生成手机App,「iPhone统治的终结开始了」

著名天使投资人、AngelList 联合创始人 Naval Ravikant 在 X 上发帖称,AI 编程 Agent 现在已能将一键生成的定制应用直接交付到用户手机上,「这是 iPhone 统治地位终结的开始。」

目前已有多款产品实现类似功能,如 Vibra Code、OneShot 等允许用户在手机端通过自然语言描述即时生成并运行应用。Naval 此前多次表达类似观点,称「vibe coding 是新的产品管理」「写应用就像开播客一样普及」。

信源:https://x.com/naval/status/2036285641462595898
OpenAI给私募「保底17.5%回报+新模型优先体验」抢企业市场,Anthropic拿不出同等条件

OpenAI 正向私募股权公司提供优先股权,保底最低回报 17.5%,同时附带最新 AI 模型的优先访问权和优先于其他合资伙伴的偿付顺序。OpenAI 正与 TPG、Advent International 洽谈加入其合资企业,目标融资约 40 亿美元,投前估值约 100 亿美元。

Anthropic 也在用类似策略争夺私募合作伙伴,正接触 Blackstone、Hellman & Friedman、Permira,但其方案未提供类似保底回报。至少两家私募选择不参与 OpenAI 方案,其中全球最大软件收购基金之一 Thoma Bravo 在 managing partner Orlando Bravo 主导的内部讨论后放弃,理由是其投资组合公司已在部署 AI 工具,质疑合资企业的长期盈利前景。

两家公司都在为潜在的 IPO 做准备。合资结构可吸收部署工程师定制模型的高昂前期成本,减轻上市前的财务压力,同时为 IPO 提供更清晰的分部收入叙事。

信源:https://www.reuters.com/business/openai-sweetens-private-equity-pitch-amid-enterprise-turf-war-with-anthropic-2026-03-23/
美参议员沃伦致信国防部长和Altman:将Anthropic列为「供应链风险」似为政治报复,要求公开OpenAI合同全文

美国参议员 Elizabeth Warren 致信国防部长 Pete Hegseth,称国防部将 Anthropic 列为「供应链风险」的决定「似为报复」。Warren 指出,国防部本可选择终止合同或继续在非机密系统中使用 Anthropic 技术,却采取了更严厉的供应链风险标签。

Warren 同日致信 OpenAI CEO Sam Altman,要求提供与国防部协议的具体条款。她写道:「我特别担忧国防部正试图迫使美国企业提供工具,用于监控美国公民和部署缺乏充分保障的全自主武器。」她指出在看到完整合同之前无法评估其中可能存在的安全条款,而国防部和 OpenAI 均未公开合同全文。

此前 Anthropic 被列入黑名单后数小时,OpenAI 即宣布与国防部达成协议。Anthropic 已对特朗普政府提起诉讼,初步听证会定于当地时间本周二在旧金山联邦法院举行。多家科技公司(包括 OpenAI、谷歌、微软)及法律权利组织已提交法庭之友意见书支持 Anthropic。

信源:https://www.cnbc.com/2026/03/23/sen-warren-dod-anthropic-blacklist-hegseth.html
1
苹果WWDC26定档6月8日,AI升级兑现与否成最大悬念

苹果宣布 WWDC26 将于 6 月 8 日至 12 日在线举行,Keynote 和 Platforms State of the Union 安排在首日。苹果全球开发者关系副总裁 Susan Prescott 称本次大会将「聚焦 AI 进展以及令人兴奋的新软件和开发者工具」。6 月 8 日在 Apple Park 同步举办线下活动,开发者和学生可申请参加,名额有限。

今年新版操作系统将采用 2027 品牌命名。外界最关注的是 Apple Intelligence 多项尚未兑现的功能,尤其是多次延期的新版 Siri。此前彭博社记者 Mark Gurman 报道称,苹果新智能家居设备(smart home hub、HomePod、Apple TV)也一直在等新版 Siri 就绪后才发布。

信源:https://www.apple.com/newsroom/2026/03/apples-worldwide-developers-conference-returns-the-week-of-june-8/
Reddit CEO称应届生比前辈「更AI原生」,将加大校招力度

Reddit 联合创始人兼 CEO Steve Huffman 在播客 Sourcery with Molly O'Shea 中表示,公司将「大力」招聘应届毕业生,因为他们「远比老一辈更原生于 AI」。

「现在从大学出来的年轻人是跟着 AI 学编程的,他们真的很擅长,」Huffman 称,「像我这样的老人不愿放弃手写代码,我最终放弃了。年轻人没有这个包袱,他们直接用 AI 写。」他明确表示 AI 不会减少公司工程团队人数。

Huffman 警告不招应届生将是代价高昂的错误:「如果你不在他们毕业时招进来,你就再也见不到他们了。他们太有价值了,不会再出现在求职市场上。」雇主需要第一时间抢人,否则未来要付 100 倍的价钱。Reddit 目前市值 267 亿美元。

信源:https://www.youtube.com/watch?v=iV-nhcDTvdw
中国日均Token调用量突破140万亿,两年增长超千倍

国家数据局披露,中国日均词元(Token)调用量今年 3 月已突破 140 万亿。2024 年初这一数字为 1000 亿,2025 年底跃升至 100 万亿,两年增长超千倍。

信源:https://mp.weixin.qq.com/s/94O37VWj79bybLbytg-3ew
Luma 150人团队发布Uni-1图像模型,多项基准超越谷歌和OpenAI

AI 视频公司 Luma Labs 发布图像生成模型 Uni-1,采用自回归 Transformer 架构,在单一模型内同时完成推理和像素生成,与 Midjourney、Stable Diffusion 等主流扩散模型的技术路线完全不同。模型不依赖「先理解再交给另一个模型画」的两段式流程,而是在生成过程中持续推理,分解指令、解析约束、规划构图后再渲染。

在专门评估推理能力的 RISEBench 基准中,Uni-1 总分 0.51,超过谷歌 Nano Banana 2(0.50)和 OpenAI GPT Image 1.5(0.46)。空间推理得分 0.58,领先 Nano Banana 2 的 0.47;逻辑推理得分 0.32,是 GPT Image 1.5(0.15)的两倍以上。在目标检测基准 ODinW-13 上,Uni-1 得分 46.2 mAP,几乎追平谷歌 Gemini 3 Pro(46.3)。Luma 称,同一模型去掉生成训练后理解能力下降 2.3 分,证明学会画图反过来提升了模型的视觉理解。人类偏好 Elo 评分中,Uni-1 在总体质量、风格编辑和参考图生成三项排名第一,仅文本生图排第二。

定价方面,2K 分辨率文本生图约 $0.09/张,低于 Nano Banana 2 的 $0.101 和 Nano Banana Pro 的 $0.134,高分辨率下便宜约 10% 至 30%。模型已在 lumalabs.ai 免费开放试用,API 接入通过候补名单逐步开放。

Luma Labs 总部位于旧金山,团队约 150 人,此前以视频生成工具 Dream Machine 知名。CEO Amit Jain 此前透露,Uni-1 驱动的 Luma Agents 创意平台已与阳狮集团(Publicis Groupe)、阿迪达斯、马自达等品牌合作,曾将一个原本预算 1500 万美元、耗时一年的广告项目压缩至 40 小时完成,费用不到 2 万美元。

信源:https://lumalabs.ai/uni-1
美中经济安全审查委员会:中国开源AI与制造业形成「双循环」,构成最严峻长期挑战

美中经济与安全审查委员会发布报告「Two Loops」,核心论点:中国推广开源 AI 模型与利用制造业优势形成相互强化的反馈循环。

报告指出,尽管受美国芯片出口管制限制,中国拥抱低成本开源模型并优化后大规模部署,中国实验室已缩小与西方顶尖大语言模型的性能差距。阿里巴巴千问系列模型在 Hugging Face 上全球累计下载已超越 Meta 的 Llama,据估算约 80% 的美国 AI 初创公司正在使用中国开源模型。美国模型保持「微弱领先」,但「面临失去全球用户基础以及制定技术标准和规范能力的风险」。

报告特别警告,随着 AI 前沿从大语言模型转向 Agent 和具身智能(embodied AI),中国凭借制造业、物流和机器人领域的大规模部署所积累的真实世界数据,可能在下一阶段占据更有利位置。委员会副主席 Michael Kuiken 对路透社表示:「美中之间在具身 AI 部署上存在差距,这种差距会随时间复合增长,我们正在看到这种复合效应。」北京已将具身智能列为核心未来战略产业,多家中国头部人形机器人公司计划今年上市。

中美路线分歧明显:美国聚焦技术突破,中国优先推动快速广泛应用。西门子 CEO Roland Busch 同日表示,使用中国开源 AI 训练西门子的工业自动化专用模型「没有劣势」,理由是成本优势和参数定制的便利性。报告称「正是这两个循环的交汇,赋予了中国开放战略复合力量,构成对美国 AI 领导力最严峻的长期挑战」。

信源:https://www.reuters.com/business/autos-transportation/chinas-open-source-dominance-threatens-us-ai-lead-us-advisory-body-warns-2026-03-23/
估值66亿美元的vibe coding公司Lovable启动收购:146人团队,ARR已达4亿美元

AI 应用构建平台 Lovable 宣布启动收购战略。联合创始人兼 CEO Anton Osika 在 X 上发帖称正在寻找「更多优秀的团队和初创公司加入 Lovable」,强调公司建立了让创始人型人才自主行动的内部文化。M&A 由 Theo Daniellot 负责。

Lovable 目前 ARR 为 4 亿美元(2025 年底为 2 亿美元),每天平台上创建超过 20 万个 vibe-coding 项目,团队仅 146 人。公司在 2025 年 12 月以 66 亿美元估值完成 3.3 亿美元融资,此前曾于 2024 年 11 月收购云服务商 Molnett。增长负责人 Elena Verna 此前表示担忧来自 OpenAI、Anthropic 等大型 AI 实验室的竞争。

信源:https://x.com/antonosika/status/2036031346834104547
好莱坞逼停一周后,字节Seedance 2.0悄然恢复全球上线,代价是封死真人面部

字节跳动 AI 视频生成模型 Seedance 2.0 和图像模型 Seedream 5.0 Lite 已通过海外 AI 创意平台 Dreamina(dreamina.capcut.com)面向全球开放。CapCut 移动端、桌面端和网页版同步上线,首批覆盖印度尼西亚、菲律宾、泰国、越南、马来西亚、巴西和墨西哥,后续扩展至更多地区。

Seedance 2.0 支持文本、图像、音频、视频多模态输入,可生成最长 15 秒的 1080p 视频,具备原生音视频同步能力。在 Artificial Analysis 的独立盲测中,Seedance 2.0 以 Elo 1269 分排名文本生视频类别第一,图生视频表现也超过谷歌 Veo3、OpenAI Sora 和快手可灵。

上线附带了明确的安全限制。Dreamina 官方账号在 X 上回应用户时确认:目前不支持上传真人图片。此前 2 月 Seedance 2.0 在中国市场首发后,用户生成的 Tom Cruise 等明星视频在社交媒体疯传,迪士尼指责字节跳动「对迪士尼 IP 的虚拟抢劫」并发出停止侵权函,派拉蒙、Netflix 等片方跟进。The Information 3 月 15 日报道称字节跳动已暂停原定 3 月中旬的全球上线计划,工程和法务团队需先解决合规问题。从暂停到恢复上线间隔约一周,封禁真人面部是最直观的妥协。

信源:https://x.com/dreamina_ai
Ramp让AI Agent自己看管代码:10个手写监控变1000个,首周抓出40个bug

企业支出管理平台 Ramp 公开了其内部产品 Ramp Sheets 的自动维护系统架构。该系统用 AI Agent 替代人工编写监控,将 Datadog 监控器从 10 个手写扩展到 1000 多个自动生成,平均每 75 行代码对应一个监控器,上线首周即捕获 40 个真实 bug,每个在触发后数分钟内被发现。

系统经历了两次迭代。第一版是每晚运行的 QA Agent,扫描整个代码库寻找潜在问题;第二版改为事件驱动架构,由 Datadog webhook 在监控告警时触发 Agent,并将告警上下文直接传入。Agent 在沙盒开发环境中复现问题后再推送修复。

关键设计是分诊环节:Agent 判断告警是真实问题还是噪音,真实问题生成修复代码,噪音则调整或删除对应监控器,形成自我校准的闭环。Ramp 团队还分享了一个模型选择发现:GPT-5 在调试环节更彻底,Claude Opus 4.6 在分诊和噪音过滤上更准确。所有代码修改仍需工程师审核后方可合并。

信源:https://x.com/RampLabs/status/2036165188899012655
软银在美国前核武器铀浓缩工厂建10GW数据中心,42亿美元电网升级由日美财团支撑

软银旗下 SB Energy 租赁美国能源部位于俄亥俄州 Piketon 的联邦土地,建设 10GW 数据中心园区,命名为 PORTS Technology Campus。该场地为前朴次茅斯气体扩散工厂,曾用于生产核武器所需浓缩铀。

SB Energy 将同步建设 10GW 新发电能力,其中至少 9.2GW 为天然气发电,并与 American Electric Power Ohio 达成 42 亿美元协议升级俄亥俄南部电力输送基础设施,预计 2029 年电力接入。SB Energy 承诺资助加速清理场地遗留核污染。

项目由日美财团共同支撑,参与方包括日立、三菱电机、东芝、TDK、三井住友银行、Bechtel、摩根士丹利、高盛和摩根大通。同一场地上,核能开发商 Oklo 与 Centrus Energy 合资建铀加工设施,Meta 也选择此地规划核电园区,目标最高 1.2GW。

信源:https://www.theregister.com/2026/03/23/softbank_to_put_mega_server/
中国「百虾大战」已集齐31款Claw变体,OpenClaw创始人点名最爱有道龙虾

OpenClaw 维护者 Frank Yang 3 月 23 日在 X 上分享了一份中国 Claw 变体清单的截图,其中列出 31 款国产龙虾类 AI Agent 产品。仅腾讯一家就占 5 席(WorkBuddy、QClaw、龙虾管家、云保安、乐享知识库龙虾版),阿里云 3 席(CoPaw、JVSClaw、QoderWork),百度 2 席(红手指 Operator、DuClaw),此外字节跳动、智谱、月之暗面、科大讯飞、MiniMax、小米、快手、京东、美图、360、商汤、华为均有产品上榜,末尾省略号暗示名单仍在增长。

OpenClaw 创始人 Peter Steinberger 随即在该帖下回复「Love LobsterAI」,点名网易有道旗下桌面级 Agent 产品有道龙虾。LobsterAI 2 月 11 日上线,目前已接入微信、企业微信、QQ、钉钉、飞书,是少数实现国内主流即时通讯平台全覆盖的龙虾类产品。

信源:https://x.com/steipete/status/2035759150291206395
Cloudflare正式进军大模型推理,首发Kimi K2.5:内部安全Agent日耗70亿token,成本降77%

Cloudflare 近日宣布 Workers AI 平台开始支持大模型推理,首个上线的模型是月之暗面的 Kimi K2.5,支持 256K 上下文窗口、多轮工具调用、视觉输入和结构化输出。Agents SDK 模板已将 Kimi K2.5 设为默认模型。

Cloudflare 内部已将 Kimi K2.5 用于日常开发。工程师在 OpenCode 环境中将其作为编程 Agent 的主力模型,还将其接入了自动代码审查流水线。其中一个安全审计 Agent 每天处理超过 70 亿 token,在单个代码库中发现了 15 个以上已确认的安全问题。Cloudflare 估算,若使用中档商业模型运行同一任务,年成本约 240 万美元,切换到 Kimi K2.5 后成本降低 77%。

平台同步推出三项改进:

1. 前缀缓存折扣:多轮对话中已处理的输入 token 不再重复计费,缓存命中的 token 享受折扣价
2. Session affinity header:新增 x-session-affinity 请求头,将同一会话路由至同一模型实例以提高缓存命中率
3. 异步批量推理 API:超出同步速率限制的请求可异步排队执行,内部测试通常在 5 分钟内完成,适合代码扫描、研究类非实时 Agent

信源:https://blog.cloudflare.com/workers-ai-large-models/
Meta开源自我改进Agent框架Hyperagents

Meta FAIR 和超级智能实验室联合英属哥伦比亚大学、爱丁堡大学、纽约大学等机构发布论文 Hyperagents,提出自引用 Agent 框架 DGM-H(Darwin Gödel Machine-Hyperagents)。该框架将执行任务的 Agent 和负责改进的 meta Agent 合并为一个可编辑程序,关键突破在于 meta 层的改进机制本身也可被修改,即 Agent 不仅能优化解题策略,还能优化「如何生成更好策略」的方法,论文称之为「元认知自我修改」(metacognitive self-modification)。

此前的自我改进系统 Darwin Gödel Machine(DGM)依赖固定的人工设计改进逻辑,且仅在编程领域有效,因为编程能力的提升恰好等于自我修改能力的提升,其他领域不成立。Hyperagents 打破了这一领域限制。在机器人奖励函数设计任务中,DGM-H 将得分从 0.060 提升至 0.372,自主发现了跳跃这一比站立更优的策略;在论文评审任务中,测试集表现从 0.0 提升至 0.710,超越静态基线,系统从简单的行为指令进化出多阶段评估流水线,包含显式检查清单和决策规则。

更值得关注的是跨领域迁移能力。在论文评审和机器人任务上训练的 Hyperagent 直接迁移到奥林匹克数学评分领域后,50 步内实现 0.630 的性能提升(imp@50 指标),而人工设计的 meta Agent 在同一任务上提升为零。

研究团队还观察到 Hyperagent 在无人指示的情况下自发涌现出工程基础设施:

1. 持久化记忆系统,记录跨代洞察和因果假设,供后续迭代复用
2. 性能追踪器,识别哪些改动带来持续提升、哪些导致回退
3. 算力感知的规划逻辑,实验预算充裕时做大架构改动,预算紧张时做保守微调

代码已在 GitHub 开源。

信源:https://arxiv.org/abs/2603.19461
OpenClaw发布v2026.3.23维护更新,修复约25个问题

OpenClaw 发布 v2026.3.23 版本,为纯维护更新,包含约 25 项修复,无新功能。其中一项修复了创始人 Peter Steinberger 在前一天发布 v2026.3.22 时遗漏的问题:npm 发布包中未打入 Web 控制台(Control UI)的前端资源和部分内置插件。本次更新补上了缺失的资源,并在发布流程中新增检查步骤,打包产物缺失时发布将直接失败,防止同类问题再次发生。

其他主要修复包括:Chrome MCP 浏览器连接在 macOS 上的超时和重复授权问题、ClawHub 认证在 macOS 默认路径和 XDG 路径下的失效、多个插件(Discord、Telegram、飞书、Matrix)的消息发送异常、Mistral 模型 token 上限配置导致的 422 错误,以及网关在 launchd/systemd 下的锁冲突崩溃循环。本次更新由 7 名社区贡献者参与。

信源:https://github.com/openclaw/openclaw/releases/tag/v2026.3.23