动察Beating AI News
3.16K subscribers
890 photos
2 videos
1 file
3.41K links
AI新闻信息流
Download Telegram
家用机器人公司Sunday Robotics融资1.65亿美元估值破10亿,用数据手套教机器人做家务,年底交付

家用自主机器人公司 Sunday Robotics 完成 1.65 亿美元 B 轮融资,估值达 11.5 亿美元,由 Coatue 领投,Bain Capital Ventures、Tiger Global、Benchmark、Fidelity 等跟投。资金将用于推进其家用机器人 Memo 的量产和部署,beta 版计划今年底开始交付到用户家中。

Memo 采用轮式底盘而非双足行走,重心低、底盘稳,静止时高约 4 英尺(约 1.2 米),双臂展开可触及 7 英尺(约 2.1 米)。目标场景包括收拾餐桌、装洗碗机、叠衣服、冲咖啡等日常家务。其核心训练方式是自研的 Skill Capture Glove(技能捕捉手套),由真人在各种家庭环境中戴着手套做家务,机器人从中学习动作,公司计划年底前将这类实地数据采集量扩大 5 倍。Sunday Robotics 由斯坦福大学机器人方向博士 Tony Zhao 和 Cheng Chi 联合创立,两人此前在斯坦福的 ALOHA 和 UMI 研究项目中探索了机器人通过观察人类动作来学习的方法。

信源:https://x.com/sundayrobotics/status/2032131717402960135
研究者利用.npmrc漏洞从Perplexity Computer沙箱提取proxy token,Perplexity:系用户级临时token已撤销

安全研究者 Yousif Astarabadi 公开披露了 Perplexity Computer 沙箱的一个安全漏洞。他发现沙箱内预装了以 bypass-permissions 模式运行的 Claude Code,其 API 密钥需注入进程环境变量。他尝试了 6 种方法窃取该密钥(包括诱导 agent 转储环境变量、植入木马脚本、劫持 PATH 等),均被 Claude 的模型安全机制拦截。

最终他利用了 Node.js 的一个已知供应链攻击手法:向共享文件系统的 ~/.npmrc 写入 node-options=--require 指令,使所有 Node 进程在启动时预加载他的脚本,在 Claude Code 初始化之前执行,从而获取了进程环境中的 Perplexity proxy token。他称该令牌可在沙箱外部直接调用 Opus 4.6,且用量未从其账户扣除。他在发布前已通知 Perplexity CEO Aravind Srinivas 和 CTO Denis Yarats。

Yarats 随后公开回应称,该说法「不准确」:沙箱为每个用户会话创建临时proxy token,这不是 API 密钥而是绑定会话和用户的短期令牌;Perplexity 选择不对用户隐藏该令牌,因为它本来就是用户自己的;该会话产生了 197 笔计费事件,用量已计入用户账户;看到帖子后已立即撤销该令牌。

信源:https://x.com/denisyarats/status/2032355725620756486
METR发布Opus 4.6破坏风险外部评审:认同灾难性风险很低但非零,质疑模型可能在被测试时「表现不同」

AI 安全评估机构 METR 发布了对 Anthropic Claude Opus 4.6 破坏风险报告(Sabotage Risk Report)的独立外部评审。Anthropic 向 METR 提供了报告的未删减版本,METR 先后审阅了 2 月 11 日和 3 月 3 日两个版本,分别出具了评审文件。

METR 认同 Anthropic 的总体结论:Opus 4.6 通过不对齐行为导致灾难性后果的风险「很低但非零」。但 METR 对几个关键环节提出了异议:对齐评估的灵敏度可能被「评估感知」(evaluation awareness)削弱,即模型可能意识到自己正在被测试从而调整行为;评审还发现了一些未被对齐评估捕获的低严重性不对齐行为,这让 METR 认为「可能存在更多尚未被检测到的类似行为」。METR 建议 Anthropic 对评估感知和「隐蔽的不对齐推理」(obfuscated misaligned reasoning)进行更深入的调查。METR 也指出,其最终结论的信心部分来自 Opus 4.6 已公开部署数周未出现重大事故这一事实。

信源:https://metr.org/blog/2026-03-12-sabotage-risk-report-opus-4-6-review/
王兴称AI Agent冲击比ChatGPT更大:AI与互联网的差距「像猴与花」,美团要做物理世界AI底座

美团 CEO 王兴今日在 2026 年管理层沟通会上表示:「AI Agent 对我的冲击比 ChatGPT 冲击更大。」他称移动互联网和互联网的区别像玫瑰和芍药,而 AI 和互联网相比「像猴与花的区别,量级和影响力要大得多」。王兴认为 AI 注定会创造巨大生产力,也一定会对组织和工作模式带来很大变化,面对 AI 浪潮「唯一能做的就是积极拥抱它」。

王兴用一个比喻阐述美团的 AI 切入点:就算爱因斯坦当秘书,让他订一个餐厅,他依然不知道那个餐厅有没有座位,「这不是智力问题,而是信息问题。」言下之意,大模型再聪明也需要物理世界的实时数据,而这正是美团的长期积累所在。美团核心本地商业 CEO 王莆中在同一场合表示,美团将坚定投入自有基础大模型,做有特色的低推理成本模型,同时建设物理世界最全最准的数据基础,帮每个商家都用上 AI 助理。美团此前已在春节期间上线 AI 搜索产品「问小团」。

此次沟通会有 2000 余名管理者线上线下参会。王兴还要求管理层「减少登味」,倡议公司内部直呼其名,不再叫「兴哥」。

信源:https://www.jiemian.com/article/14110184.html
OpenAI为Responses API新增Shell工具和托管容器,模型可执行命令行操作,Assistants API将在年内停用

OpenAI 为 Responses API 新增 Shell 工具(Hosted Shell Tool),模型可在隔离容器中执行命令行操作。与仅支持 Python 的 Code Interpreter 不同,Shell 工具支持 Go、Java、Node.js 等多种语言,可运行服务、调用外部 API、生成电子表格和报告等制品。每个会话的容器带有持久化文件系统,支持跨轮次保持状态。

安全方面,网络访问通过边车出口代理(egress proxy)进行域名白名单控制,密钥以占位符形式注入容器,实际密钥仅在代理层处理。平台还新增了 /compact 端点,可在长会话中进行服务端上下文压缩。开发者可将「Agent Skills」作为版本化包上传挂载到容器中,Glean 是该功能的首批企业用户。容器定价为 1 GB 配置每 20 分钟 0.03 美元,4 GB 配置 0.12 美元,3 月 31 日起正式计费。OpenAI 同时宣布 Assistants API 将在 2026 年内停用。

信源:https://openai.com/index/equip-responses-api-computer-environment/
Adobe CEO Shantanu Narayen宣布将在继任者确定后卸任,结束18年任期

Adobe CEO Shantanu Narayen 宣布将在继任者到位后卸任,届时他将继续担任董事会主席。Adobe 董事会已任命首席独立董事 Frank Calderoni 领导特别委员会,负责内外部候选人的遴选工作。Narayen 自 2007 年 12 月起担任 CEO,在任期间 Adobe 员工从约 3000 人增至超过 30000 人,年收入从不到 10 亿美元增长至超过 250 亿美元。

同日公布的 2026 财年 Q1 业绩超出预期:每股收益 6.06 美元(预期 5.87),营收 64 亿美元,同比增长 12.1%。AI 产品年化收入同比增长超过两倍。但 Q2 指引仅略高于华尔街预期,加上 CEO 交接消息,Adobe 股价盘后下跌约 1.4%。Narayen 卸任的背景是华尔街正在辩论 AI 是否会削弱传统软件工具的需求。2 月的 SaaS 板块抛售已反映出市场担忧 AI agent 可能冲击按人头收费的软件定价模式。

信源:https://news.adobe.com/news/2026/03/leadership-update
微软推出Copilot Health,整合病历和可穿戴设备数据提供个性化健康建议

微软宣布推出 Copilot Health,这是 Copilot 内的一个独立安全空间,用于解答与健康相关的问题。用户可以通过 HealthEx 导入超过 5 万家美国医院和医疗机构的病历,通过 Function 导入化验结果,还能接入 Apple、Oura、Fitbit 等 50 余款可穿戴设备的数据。Copilot Health 可以帮用户解读化验报告、按专科和保险计划搜索医生。

微软强调 Copilot Health「不替代医生」,不提供医疗诊断或治疗建议。该功能将分阶段推出,用户可加入等候名单获取访问权限。此前 OpenAI 也推出了 ChatGPT Health,鼓励用户连接医疗记录,AI 公司正在健康领域集中发力。

信源:https://www.wsj.com/tech/ai/microsofts-new-ai-health-tool-can-read-your-medical-records-and-give-advice-d731f883
魅族手机「解体」:超半数员工离开,阶跃星辰放弃收购但已拿走核心资产,品牌将成过去式

魅族近期宣布一轮大调整,超 50% 的员工即将离开,涉及约 400 人。离开的员工中,大部分将获得 N+2 赔偿,本周五前办完手续;潮牌团队 PANDAER 将分拆、自负盈亏;AR 眼镜团队据报部分被 AR 眼镜公司雷鸟创新吸收,魅族方面否认了这一说法。

更值得关注的是背后的资产流向。据独家报道,AI 公司阶跃星辰此前曾与魅族手机团队洽谈并购,但最终放弃,原因是「认为魅族当前品牌价值并不大」。不过,阶跃星辰旗下 AI 硬件公司智跃千里已经吸收了魅族手机的部分核心资产,包括代码、产品文档、技术接口文档和视觉动效文档等。阶跃星辰与魅族的关联在于共同的资方吉利:吉利数年前收购魅族近八成股权,同时也是阶跃星辰和千里科技的出资方,旷视联合创始人印奇同时担任阶跃星辰和千里科技的董事长。

经过调整后,魅族手机剩余员工约 400 人,将分流至 Flyme 车机团队和 AI 软件方向。据报这批人员主要集中在珠海,接下来不再使用魅族品牌,或将更换公司主体。魅族 2 月 27 日曾发布公告,宣布暂停手机新产品自研硬件项目。公告将战略调整的原因直指内存涨价,称「手机新产品的商业化变成不可为」。

信源:https://mp.weixin.qq.com/s/Isw5Ojr-W0R44Rg_ewSBpA
HydraDB融资650万美元种子轮,用本体论上下文图谱挑战向量数据库:「相似度0.94不代表相关」

AI 数据库初创公司 HydraDB 宣布完成 650 万美元种子轮融资。创始人 Nishkarsh 在 X 上表示,当前所有系统检索上下文的方式都是同一套路:向量搜索将一切存为扁平的 embedding,然后返回「感觉上最接近」的结果。「相似?当然。相关?几乎从来不是。」

Nishkarsh 用一个案例说明问题:有人让 AI 查一份合同,得到了一份详尽、精心组织的答案——但内容来自一个完全不同的客户文件。原因是 embedding 在语言足够接近时,无法区分 Q3 续约条款和 Q1 终止通知。他指出,一旦文档量超过 1,000 万份,这种混淆会频繁发生,「向量数据库的准确率就崩了」。

HydraDB 的方案是构建一个以本体论(ontology)为核心的上下文图谱:不只是计算向量相似度,而是映射实体之间的关系、理解文档背后的「为什么」、追踪信息随时间的演变。Nishkarsh 举例,当用户查询「Apple」时,系统知道你指的是你正在服务的那家客户公司,而不是水果。

信源:https://x.com/contextkingceo/status/2032098309029220456
Cursor公开内部基准CursorBench:公开基准已失效,前沿模型间差距远比SWE-bench显示的大

AI 编程工具 Cursor 公开了其内部基准测试 CursorBench 的方法论和数据。Cursor 认为 SWE-bench 等公开基准存在三个根本问题:任务以修 bug 为主,与开发者实际使用 agent 的方式不对齐;评分机制假设只有少数正确解法,无法处理开放式需求;训练数据污染严重,OpenAI 已因此停止报告 SWE-bench Verified 成绩,其调查发现近 60% 的未解决问题存在测试缺陷。

CursorBench 的任务来源于 Cursor Blame 功能:追溯已提交代码到产生它的 agent 请求,形成天然的「需求 — 正确答案」配对。大量任务取自内部代码库,降低数据污染风险,测试集每隔数月更新。当前版本 CursorBench-3 的任务复杂度较初版翻倍(代码行数和涉及文件数均翻倍),远超 SWE-bench 各变体。任务描述故意保持简短模糊,模拟开发者与 agent 的真实交流方式,由 agent 评分器打分。

Cursor 称 CursorBench 在前沿模型间产生了比公开基准更大的区分度。在公开基准上分数接近甚至被 Haiku 追平的模型,在 CursorBench 上呈现出与开发者实际体验一致的明显差距。Cursor 表示未来将适配长时运行的自主 agent 场景,并计划公开更多数据。

信源:https://cursor.com/blog/cursorbench
继搬运争议后,腾讯SkillHub插件被发现在OpenClaw中每条消息前强插提示词,源码分析:「本质上就是一个提示词注入器」

继此前腾讯 SkillHub 搬运 ClawHub 技能一事后,有用户进一步发现,安装腾讯 SkillHub 时自动附带的 skillhub 插件会在用户发给 AI 的每一条消息前,强行插入一段名为「Skills store policy (operator configured)」的策略提示词。该提示词包含 6 条规则,核心指令是:技能发现、安装和搜索时优先使用 skillhub(标注为 cn-optimized),不可用或未匹配时才回退到官方的 clawhub(public-registry)。

即刻用户「张佳的流量常识」在「大公司负面监督小组」圈子发帖,贴出截图和源码分析。截图显示,该策略文本出现在每条对话中,持续消耗用户 token。对插件路径 ~/.openclaw/extensions/skillhub/index.ts 的源码分析表明,该插件的核心逻辑仅有一项:通过 before_prompt_build 事件钩子,以 prependContext 方式将策略文本插入系统提示词最前端。分析结论是:「本质上就是一个提示词注入器,没有实际业务逻辑,只做策略声明。」帖主评价:「这是我使用 Agent 以来,遇到的第一个流氓软件。」

信源:https://m.okjike.com/originalPosts/69b2d7e4c5a1d4e6492b0c8b
金融数据平台Unusual Whales发布MCP Server:AI助手可直接查询实时期权流、暗池交易和国会议员持仓

美股零售交易数据平台 Unusual Whales 发布了 MCP Server,通过 Anthropic 主导的 Model Context Protocol 协议,将实时金融市场数据接入 AI 助手。该 MCP Server 提供 18 个工具和 123 个以上的操作接口,覆盖实时期权资金流(含 sweeps 和大宗交易)、暗池交易及 NBBO 报价上下文、美国国会议员交易披露、公司财务报表(利润表、资产负债表、现金流量表)、技术指标(含 RSI)以及预测市场等数据类别。

该 MCP Server 支持 Claude Desktop、Cursor、VS Code、Windsurf 等客户端,官方称 30 秒即可完成配置。Unusual Whales 在推文中表示,用户可以用自然语言直接构建交易机器人或金融仪表板,「想建什么就建什么」。文档页面注明该服务面向 vibecoders(即用自然语言驱动 AI 编程的开发者)和专业交易者,Unusual Whales 同时也提供 REST API、WebSocket 和 Kafka 等传统接入方式。

信源:https://unusualwhales.com/public-api/mcp
IPO以来跌逾90%的Bumble单日暴涨40%:用AI重构约会体验,可能取消「左滑右滑」

约会应用 Bumble 股价周四盘中一度跳涨超 40%,创上市以来最大单日涨幅。驱动因素有两个:Q4 营收 2.242 亿美元超出预期(预期 2.213 亿),以及 CEO Whitney Wolfe Herd 公布了名为 Bumble 2.0 的产品重构计划。

Bumble 2.0 用 AI 取代传统的快速照片滑动模式:用户资料将以可滚动的短篇章形式呈现,涵盖兴趣、生活方式和个性。Wolfe Herd 还透露可能在部分市场试验「无滑动」(no-swipe)体验。Q4 付费用户人均收入同比增长 7.9% 至 22.20 美元,效果营销支出同比大降超 80%。

分析师态度谨慎。Jefferies 称约会应用品类已经历「多次起步未果」,「早期企稳迹象令人鼓舞,但需要看到更持续的改善」。Raymond James 认为短期动能取决于付费用户是否能稳住,以及新生态能否脱离重度付费获客实现增长。Bumble 自 2021 年 IPO 以来股价下跌超 90%,去年又腰斩,当前市盈率仅 3.55 倍,而竞争对手 Match Group 为 11.05 倍。

信源:https://www.reuters.com/business/bumble-shares-rally-earnings-beat-optimism-around-ailed-app-revamp-2026-03-12/
数据公司Markov开源迄今最大的computer use屏幕录制数据集:48000个视频、12300小时,覆盖6类专业软件

AI 数据公司 Markov 在 Hugging Face 上开源了 computer-use-large 数据集,包含 48,478 个屏幕录制视频,总时长约 12,300 小时,CC-BY-4.0 许可。该数据集覆盖 6 类专业软件:Blender(3,624h)、Salesforce(2,336h)、AutoCAD(2,149h)、Photoshop(2,060h)、Excel(2,002h)和 VS Code(127h)。所有视频均经过裁剪,去除了片头片尾、人脸画面和转场,音频已剥离,只保留纯粹的屏幕操作录制。

该数据集面向 computer use agent 的训练和评估,即那些能像人类一样通过点击、输入、滚动等 GUI 操作来控制桌面软件的 AI 模型。Markov 创始人 Dev Mandal 称数据来源于互联网上的专业软件教程和操作录屏。Markov 定位为 computer use AI 领域的数据基础设施公司,此前曾开源过一个规模较小的版本。

信源:https://huggingface.co/datasets/markov-ai/computer-use-large
开源向量搜索引擎Qdrant完成5000万美元B轮融资:「大多数向量数据库只是存embedding然后找最近邻,这已是基本功能」

开源向量搜索引擎 Qdrant 完成 5000 万美元 B 轮融资,由 AVP 领投,博世创投(Bosch Ventures)、Unusual Ventures、Spark Capital 和 42CAP 参投。

Qdrant 用 Rust 编写,将检索拆解为可组合的模块(索引、评分、过滤、排序),工程师可自行配置和组合这些组件。该系统支持稠密向量、稀疏向量、元数据过滤、多向量表示和自定义评分函数,允许在准确率、延迟和成本之间灵活调节,而无需在工作负载变化时进行大规模架构改造。CEO André Zayarni 表示,许多向量数据库最初只是为了存储稠密 embedding 并检索最近邻而设计的,「这现在已是基本功能」,而生产级 AI 系统需要一个检索的每个环节——索引方式、评分方式、过滤方式、延迟与精度的平衡——都是可组合决策的搜索引擎。新资金将用于推动 Qdrant 的可组合向量搜索平台作为生产 AI 系统基础设施的进一步发展和应用。

信源:https://tech.eu/2026/03/12/qdrant-closes-50m-series-b-to-expand-vector-search-infrastructure/
Mixedbread发布Wholembed v3:首个在LIMIT基准上超越BM25词法检索的语义模型,用多向量架构打破「够像但不对」的检索瓶颈

德国搜索基础设施公司 Mixedbread 发布全模态多语言检索模型 Wholembed v3,支持文本、图片、音频和视频检索,覆盖 100 余种语言。该模型采用 late-interaction 多向量架构(源自 ColBERT),为每个 token 生成独立的低维向量,而非传统方式将整篇文档压缩为单一向量。Mixedbread 认为,单向量检索的结构性缺陷是「看起来合理、读起来流畅、但实际上是错的」,在信息密集的技术文档、法律文件和学术论文上尤其严重。

在 LIMIT 基准测试中,Wholembed v3 的 Recall@5 达到 92.45,首次超越经典词法检索方法 BM25(85.7),而 OpenAI text-embedding-3-large、Cohere Embed 4、Voyage 4 Large 和 Gemini Embedding 2 的 Recall@5 仅在 1.75 到 1.85 之间。LIMIT 专门测试文档包含大量细粒度结构化信息的场景,Mixedbread 认为这类文档在企业真实环境中极为常见但被主流基准忽略。在面向 agent 深度研究的 BrowseComp-Plus 基准上,搭配 Wholembed v3 的检索系统也让 agent 在 830 个复杂查询中正确回答了显著更多的问题。

Wholembed v3 参数量为初代的 20 倍,已部署在 Mixedbread Search 基础设施上,支持 10 亿级文档索引、500+ QPS 和约 50ms 端到端搜索延迟。该模型已成为 Mixedbread 平台的默认且唯一模型。

信源:https://mixedbread.com/blog/wholembed-v3
超声脑机接口初创Gestala成立两个月融资2160万美元,估值1至2亿美元,为国内BCI行业最大早期轮

中国脑机接口(BCI)初创公司 Gestala 在成立仅两个月后完成 1.5 亿元人民币(约 2160 万美元)融资,估值在 1 亿至 2 亿美元之间。该轮由国盛资本和 Dalton Venture 联合领投,清松资本、戈壁创投、傅利叶智能、猎聘、Seas Capital 参投。创始人彭雷告诉 TechCrunch,投资人意向认购总额超过 5800 万美元,严重超额。这是中国脑机接口行业迄今最大的早期融资。

Gestala(格式塔科技)开发非侵入式超声波脑机接口。创始人彭雷是连续创业者,此前创办了植入式 BCI 公司 NeuroXess;另一位联合创始人是盛大集团创始人、天桥脑科学研究院(TCCI)创办者陈天桥。彭雷认为超声波可能是下一代脑机接口技术:相比植入电极系统,超声波无需开颅手术,可监测更大范围的大脑区域(包括深层神经回路),并利用相控阵超声精确刺激或抑制神经活动。据动脉网报道,Gestala 已完成 30 余例慢性疼痛临床试验,单次超声刺激后疼痛评分降低 50%,疗效持续 1 至 2 周。公司同时在抑郁、阿尔茨海默症、帕金森、中风康复、癫痫等方向开展早期研究。产品路线图方面,Gestala 计划 2026 年二季度在成都天府国际生物城设立总部和首条产线,三季度投产,年底启动 NMPA 注册申报,1 至 2 年内完成注册上市。华兴资本担任本轮财务顾问。

信源:https://techcrunch.com/2026/03/11/bci-startup-gestala-raises-21-million-for-non-invasive-ultrasound-brain-tech/
无人机集群公司Swarm Aero完成3500万美元A轮融资,在阿肯色州建成8万平方英尺量产工厂,目标产能「二战以来未见」

无人机集群开发商 Swarm Aero 完成 3500 万美元 A 轮融资,累计融资达 5900 万美元。公司已在阿肯色州费耶特维尔 Drake Field 建成一座 8 万平方英尺的先进制造中心,用于大型多任务无人机的高速率量产,设计产能为数千架。

Swarm Aero 的核心产品是大型无人机(UAV)及配套的集群指挥控制软件 Legion,允许单个操作员同时控制大量无人机系统。公司在设计阶段即将「可制造性」作为核心特性,同步设计飞机与工厂以实现快速扩产。其制造策略以高速率碳纤维复合材料生产为核心,目标是大幅提高机身产量并降低单位成本。公司计划 2026 年将飞机团队规模扩大一倍,推动量产和部署。

信源:https://www.axios.com/2026/03/11/swarm-aero-seriesa-drone-factory
Palantir CEO首次回应Anthropic禁令:未来将接入Claude之外的其他大模型

Palantir CEO Alex Karp 周四在公司 AIPcon 9 大会期间接受采访,首次公开回应五角大楼将 Anthropic 列为供应链风险一事。Karp 表示:「我们的产品已经集成了 Anthropic,未来可能会集成其他大语言模型。」他同时表示 Palantir 致力于为军人提供「最好最致命的技术」,但也认为在国内执法等场景有「很多理由」限制这些技术的使用,「因为它们太强大了」。

尽管上周五角大楼已正式将 Anthropic 列为供应链风险、禁止其参与政府合同,国防部目前仍在使用 Claude 模型支持伊朗战事。国防部首席技术官 Emil Michael 周四表示:「不可能一夜之间拆除一个深度嵌入的系统」,6 个月是过渡计划,但如果届时仍处于冲突状态且涉及敏感行动,「显然会做出例外,以免危及当前军事行动」。一份内部备忘录允许「任务关键活动」在 6 个月期限后继续使用 Anthropic 产品。Anthropic 已于本周一起诉美国政府,要求撤销供应链风险认定,并指出数十亿美元利益受损。

Palantir 于 2024 年与 Anthropic 和 AWS 合作为美国国防和情报部门提供 Claude 模型接入。洛克希德·马丁等其他国防承包商已要求员工停止使用 Claude。

信源:https://www.bloomberg.com/news/articles/2026-03-12/palantir-looks-to-expand-beyond-anthropic-after-pentagon-spat
Augment Code公开其「AI原生工程师」招聘标准:编码能力不再是独立考核维度,取而代之的是六项能力

AI 编码平台 Augment Code(累计融资 2.52 亿美元,估值 9.77 亿美元)发文公开了其重新设计的工程师招聘框架。文章开篇提出一个问题:「当 Agent 写了 99% 的代码,你怎么招工程师?」Augment 的结论是,编码能力(raw coding ability)不再作为独立维度考核——它仍然重要,但不再是区分工程人才的首要标准。

取而代之的是六项能力维度:

1. 产品与结果品味(Product & outcome taste)——代码生产成本趋近于零时,最昂贵的错误是做了错误的东西
2. 系统与架构判断(System & architectural judgment)——Agent 能生成可运行的代码,但无法判断周围的系统是否健全
3. Agent 调度能力(Agent leverage)——将问题结构化以便 Agent 执行、在 Agent 偏离时纠正、验证产出
4. 沟通与协作——实现速度加快后,更多工作转向厘清问题、暴露权衡和整合不同视角
5. 端到端 ownership——驱动结果而非只完成任务,遇到阻碍主动介入,即使超出自己的直接职责范围
6. 学习速度与实验心态——「我们今天用的工具三个月后就不会是同一批了」

基于这六项维度,Augment 定义了四类招聘画像,每类对六项维度的权重不同,面试流程也围绕各自最重要的信号设计:

- AI 原生系统工程师:侧重架构判断和基础设施直觉
- AI 原生产品工程师:侧重产品品味和用户同理心
- AI 原生应用 AI 工程师:侧重模型理解和 Agent 工作流
- AI 原生早期职业工程师:侧重学习速度,「在 Agent 优先环境中成长起来的工程师」

信源:https://www.augmentcode.com/blog/how-we-hire-ai-native-engineers-now
Shopify CEO亲手提交93个commit优化Liquid模板引擎:用AI跑了120轮自动化实验,解析+渲染快53%,对象分配减少61%

Shopify CEO Tobi Lütke 以个人 GitHub 账号向 Liquid 提交了一个包含 93 个 commit 的 PR,在真实 Shopify 主题模板基准测试上实现了解析+渲染速度提升 53%、对象分配减少 61%,全部 974 个单元测试零回归。Liquid 是 Lütke 于 2006 年为 Shopify 投入生产使用的开源模板引擎,目前为约 560 万家活跃商店提供渲染支持。

该 PR 的开发方法基于 pi-autoresearch(一款受 Andrej Karpathy 的 autoresearch 项目启发、为 Pi 编程 Agent 开发的自动化实验插件):编辑 → 提交 → 跑测试 → 跑基准 → 保留或丢弃,共迭代约 120 轮自动化实验,仅保留通过测试且提升性能的变更。其核心策略是「分配驱动」,由于 GC(垃圾回收)消耗了 74% 的总 CPU 时间,每减少一次对象分配都会对实际运行时间产生放大效果。PR 中还详细记录了 6 项「没有生效」的优化尝试,包括基于 String#split 的分词器(快 2.5 倍但无法处理 Liquid 的标签嵌套边界情况)和 TruthyCondition 子类(YJIT 在调用点的多态性损耗超过了节省的 115 次分配)。

具体优化分三层:解析阶段(快 61%,少 3.8 万次分配),引入了新的 Cursor 类替代散布在各处的手工字节扫描、用 String#byteindex 替代 StringScanner 做分词(快 40%)、为 100% 的变量构建了零 Lexer 的快速解析路径;渲染阶段(快 20%,少 3000 次分配),为基本类型跳过 to_liquid 调用、预计算 0-999 的冻结字符串避免 Integer#to_s 分配、消除 90% 过滤器调用中的 *args 数组分配。分支名 autoresearch/liquid-perf-2026-03-11 表明这项工作完成于 3 月 11 日。

信源:https://github.com/Shopify/liquid/pull/2056