AI Agent 学会“及时停手”:华盛顿大学提出上下文工程方法CONVOLVE
华盛顿大学研究团队提出Agentic Abstention框架,专门研究AI Agent何时应该停止行动,并设计了一种名为CONVOLVE的上下文工程方法,以提升Agent的“弃答”能力。研究发现,大多数Agent难以判断何时任务已不可行,常常在无效任务中继续搜索和调用工具。CONVOLVE方法无需更新模型参数,而是将交互轨迹中的弃答经验提炼成可复用的“停止规则”,作为上下文提示帮助模型更早做出判断。实验在超过2.8万个任务上评估了13种Agent系统,结果显示,模型能力、推理方式和Agent框架都会影响弃答表现,而CONVOLVE能显著提升弃答能力,且具有良好迁移性,小模型总结的规则同样能提升大模型的表现。研究同时指出,弃答并非越多越好,过度弃答会削弱Agent的实用性,需要结合任务成功率一起评估。 #AI #Agent #华盛顿大学 #CONVOLVE #上下文工程 #机器学习 #人工智能研究
华盛顿大学研究团队提出Agentic Abstention框架,专门研究AI Agent何时应该停止行动,并设计了一种名为CONVOLVE的上下文工程方法,以提升Agent的“弃答”能力。研究发现,大多数Agent难以判断何时任务已不可行,常常在无效任务中继续搜索和调用工具。CONVOLVE方法无需更新模型参数,而是将交互轨迹中的弃答经验提炼成可复用的“停止规则”,作为上下文提示帮助模型更早做出判断。实验在超过2.8万个任务上评估了13种Agent系统,结果显示,模型能力、推理方式和Agent框架都会影响弃答表现,而CONVOLVE能显著提升弃答能力,且具有良好迁移性,小模型总结的规则同样能提升大模型的表现。研究同时指出,弃答并非越多越好,过度弃答会削弱Agent的实用性,需要结合任务成功率一起评估。 #AI #Agent #华盛顿大学 #CONVOLVE #上下文工程 #机器学习 #人工智能研究
Edge AI 早报:Claude 5 强势登场,AI 算力与安全危机并存
今日 AI 头条聚焦于 Claude 5 在编码领域的巨大突破,其 SWE-bench 得分高达 95%,轻松超越前代,但开发速度提升背后,80% 的 AI 生成内容仍需人工修正,引发“决策疲劳”和工程师角色重塑的讨论。与此同时,OpenAI 在英国“Stargate”项目中承诺的 300 亿英镑投资,实际仅 100 亿有依据,受制于高昂电价和电网瓶颈,项目陷入停滞。Anthropic 则跨界涉足药物研发,从工具提供者转向亲自“挖矿”,暴露了 AI 制药行业的数据与监管挑战。安全方面,AI 发现漏洞的速度(6 月达 1500 个)远超人类修复能力,引发结构性危机;Meta 数据中心排放的耐金属细菌导致再生水系统瘫痪,凸显环保监管缺口。在教育领域,一项研究追踪 2.6 万学生发现,AI 辅助虽然减少了作业时间并提高了分数,却导致考试成绩大幅下滑,揭示了“学会”与“看起来学会”之间的认知鸿沟。此外,多模态提示正成为 AI 智能体的新“母语”,Mistral 发布了仅 6B 参数的证明模型性能超越 671B 模型,而欧盟正计划通过法案禁止未成年人接触战利品箱,可能重塑游戏商业模式。 #AI #人工智能 #Claude5 #安全 #教育 #监管 #科技 #能源
今日 AI 头条聚焦于 Claude 5 在编码领域的巨大突破,其 SWE-bench 得分高达 95%,轻松超越前代,但开发速度提升背后,80% 的 AI 生成内容仍需人工修正,引发“决策疲劳”和工程师角色重塑的讨论。与此同时,OpenAI 在英国“Stargate”项目中承诺的 300 亿英镑投资,实际仅 100 亿有依据,受制于高昂电价和电网瓶颈,项目陷入停滞。Anthropic 则跨界涉足药物研发,从工具提供者转向亲自“挖矿”,暴露了 AI 制药行业的数据与监管挑战。安全方面,AI 发现漏洞的速度(6 月达 1500 个)远超人类修复能力,引发结构性危机;Meta 数据中心排放的耐金属细菌导致再生水系统瘫痪,凸显环保监管缺口。在教育领域,一项研究追踪 2.6 万学生发现,AI 辅助虽然减少了作业时间并提高了分数,却导致考试成绩大幅下滑,揭示了“学会”与“看起来学会”之间的认知鸿沟。此外,多模态提示正成为 AI 智能体的新“母语”,Mistral 发布了仅 6B 参数的证明模型性能超越 671B 模型,而欧盟正计划通过法案禁止未成年人接触战利品箱,可能重塑游戏商业模式。 #AI #人工智能 #Claude5 #安全 #教育 #监管 #科技 #能源
SigMap 发布最新版本,AI 编码上下文 Token 消耗降低 97%
该工具通过创新的确定性上下文选择机制,在 21 个代码库、90 个真实编码任务中实现两项重大突破:文件检索命中率高达 86.7%,且每次编码任务所需的提示次数从平均 2.84 次降至 1.46 次,降幅达 48.8%。SigMap v8.5 版本新增确定性查询扩展功能,能够自动匹配代码领域中的常见同义词和缩写,进一步提升了检索准确度。该工具支持 TypeScript、Python、Go、Rust 等 33 种编程语言,无需原生依赖,完全离线运行,可与 GitHub Copilot、Claude Code、Cursor 等主流 IDE 和 AI 编码助手无缝集成,并提供 MCP 协议支持。开发者可通过简单的五步流程完成从上下文生成到答案可信度验证的全流程操作,包括生成签名映射、查询相关文件、验证覆盖率和评估答案的准确性。 #AI编程 #代码生成 #开发者工具 #效率工具 #开源 #大模型 #编程语言
该工具通过创新的确定性上下文选择机制,在 21 个代码库、90 个真实编码任务中实现两项重大突破:文件检索命中率高达 86.7%,且每次编码任务所需的提示次数从平均 2.84 次降至 1.46 次,降幅达 48.8%。SigMap v8.5 版本新增确定性查询扩展功能,能够自动匹配代码领域中的常见同义词和缩写,进一步提升了检索准确度。该工具支持 TypeScript、Python、Go、Rust 等 33 种编程语言,无需原生依赖,完全离线运行,可与 GitHub Copilot、Claude Code、Cursor 等主流 IDE 和 AI 编码助手无缝集成,并提供 MCP 协议支持。开发者可通过简单的五步流程完成从上下文生成到答案可信度验证的全流程操作,包括生成签名映射、查询相关文件、验证覆盖率和评估答案的准确性。 #AI编程 #代码生成 #开发者工具 #效率工具 #开源 #大模型 #编程语言
Vercel 推出 AI 技能包,一行命令让智能体学会新能力
Vercel 创始人 Guillermo Rauch 于1月17日发布命令行工具 Skills,为 AI 编程工具带来类似 npm 的包管理体验。用户只需一行命令 npx skills add,即可将预制的技能包安装到 Claude Code、Cursor、Codex 等超过68个智能体中,让 AI 自动遵循项目的代码规范、设计准则和架构约定。该工具发布五个月即获得2.4万 GitHub 星标,配套技能目录 榜首的 find-skills 安装量已达230万次。然而,安全研究显示超三成技能包存在安全缺陷,包括恶意软件分发和提示词注入风险,其中13.4%属于严重级别。Vercel 此举旨在将 AI 能力从提示词工程推向能力工程,复用行业经验的同时也带来了新的安全挑战。 #AI #Vercel #技能包 #AI编程 #安全 #GitHub
Vercel 创始人 Guillermo Rauch 于1月17日发布命令行工具 Skills,为 AI 编程工具带来类似 npm 的包管理体验。用户只需一行命令 npx skills add,即可将预制的技能包安装到 Claude Code、Cursor、Codex 等超过68个智能体中,让 AI 自动遵循项目的代码规范、设计准则和架构约定。该工具发布五个月即获得2.4万 GitHub 星标,配套技能目录 榜首的 find-skills 安装量已达230万次。然而,安全研究显示超三成技能包存在安全缺陷,包括恶意软件分发和提示词注入风险,其中13.4%属于严重级别。Vercel 此举旨在将 AI 能力从提示词工程推向能力工程,复用行业经验的同时也带来了新的安全挑战。 #AI #Vercel #技能包 #AI编程 #安全 #GitHub
Meta 计划开放 GPU 算力,小扎的 Plan B 是卖铲子
Meta 自研模型进展不及预期,员工士气跌入低谷,但 CEO 扎克伯格找到了新方向:将庞大的人工智能基础设施开放给外部客户,推出 Meta Compute 服务。据 SemiAnalysis 报道,Meta 今年前六个月已签约超 5GW 的算力容量,在建的数据中心园区总规模达 2.5GW。若按高算力租赁合同计算,每 GW 年收入可达约 500 亿美元。Meta 还可能与 Anthropic 达成协议,在自家平台上部署 Claude 等第三方模型,类似亚马逊 Bedrock 服务。消息传出后,Meta 股价大涨近 9%,但计划尚未动摇其自研模型雄心,下一代模型 Watermelon 号称已赶上 GPT-5.5 水平。 #Meta #AI #GPU #算力 #数据中心 #扎克伯格 #科技新闻
Meta 自研模型进展不及预期,员工士气跌入低谷,但 CEO 扎克伯格找到了新方向:将庞大的人工智能基础设施开放给外部客户,推出 Meta Compute 服务。据 SemiAnalysis 报道,Meta 今年前六个月已签约超 5GW 的算力容量,在建的数据中心园区总规模达 2.5GW。若按高算力租赁合同计算,每 GW 年收入可达约 500 亿美元。Meta 还可能与 Anthropic 达成协议,在自家平台上部署 Claude 等第三方模型,类似亚马逊 Bedrock 服务。消息传出后,Meta 股价大涨近 9%,但计划尚未动摇其自研模型雄心,下一代模型 Watermelon 号称已赶上 GPT-5.5 水平。 #Meta #AI #GPU #算力 #数据中心 #扎克伯格 #科技新闻
AI路由策略
在AI工作转向更便宜模型后,成本问题往往并未真正解决,因为决策仅存在于个人脑中,缺乏可读性记录,更无人将架构选择文档化。AI路由策略正是第二阶段委托生命周期的缺失产物:它记录每个任务类应使用哪种执行路径(从廉价模型到前沿模型再到纯代码),定义"足够好"的输出标准,并明确决策责任人。你需要的能力其实已经具备:编写验收标准。该策略并非临时选择更便宜模型,而是书面的、可复现的团队决策,将每类任务分配给成本最低的充分执行路径:模型、人工审查、确定性代码或无自动化。配合最小化路由日志,可生成财务部门最终需要的按任务类分类支出记录。你可在20分钟内起草前三行。迟早,CFO会问AI使用到底带来什么回报,“节省时间”将无法通过那次会议。第一波AI采纳奖励会编写提示词的实践者,第二波则奖励更罕见能力:将个人AI使用转化为可留存知识、可解释可控支出、可信任输出的组织决策者,这正是你和团队多年来在更难问题上不断实践的过程设计变革。 #AI #模型成本 #路由策略 #财务 #接受标准 #人工智能
在AI工作转向更便宜模型后,成本问题往往并未真正解决,因为决策仅存在于个人脑中,缺乏可读性记录,更无人将架构选择文档化。AI路由策略正是第二阶段委托生命周期的缺失产物:它记录每个任务类应使用哪种执行路径(从廉价模型到前沿模型再到纯代码),定义"足够好"的输出标准,并明确决策责任人。你需要的能力其实已经具备:编写验收标准。该策略并非临时选择更便宜模型,而是书面的、可复现的团队决策,将每类任务分配给成本最低的充分执行路径:模型、人工审查、确定性代码或无自动化。配合最小化路由日志,可生成财务部门最终需要的按任务类分类支出记录。你可在20分钟内起草前三行。迟早,CFO会问AI使用到底带来什么回报,“节省时间”将无法通过那次会议。第一波AI采纳奖励会编写提示词的实践者,第二波则奖励更罕见能力:将个人AI使用转化为可留存知识、可解释可控支出、可信任输出的组织决策者,这正是你和团队多年来在更难问题上不断实践的过程设计变革。 #AI #模型成本 #路由策略 #财务 #接受标准 #人工智能
美团LongCat-2.0大模型问世,国产算力驱动万亿参数
美团近日正式发布LongCat-2.0大模型,这是业界首个基于国产算力完成从训练到推理全流程的万亿参数模型。该模型采用MoE(混合专家)架构,总参数达1.6万亿,原生支持1M超长上下文。尽管在智能体核心能力上略逊于Claude Opus 4.8,但凭借全流程国产算力支撑引发关注。截至6月底,其预览版在OpenRouter平台总调用量跻身全球前三,尤其在Claude Code等Agent场景表现突出。该模型通过零计算专家机制优化效率,可动态分配计算资源。美团CEO王兴强调AI战略为进攻性布局,旨在打造本地生活领域的AI超级入口。LongCat-2.0的推出验证了国产算力有能力独立支撑前沿模型全生命周期训练,对激活存量国产芯片意义重大。 #美团 #大模型 #国产算力 #AI #科技新闻 #LongCat2.0 #华为昇腾
美团近日正式发布LongCat-2.0大模型,这是业界首个基于国产算力完成从训练到推理全流程的万亿参数模型。该模型采用MoE(混合专家)架构,总参数达1.6万亿,原生支持1M超长上下文。尽管在智能体核心能力上略逊于Claude Opus 4.8,但凭借全流程国产算力支撑引发关注。截至6月底,其预览版在OpenRouter平台总调用量跻身全球前三,尤其在Claude Code等Agent场景表现突出。该模型通过零计算专家机制优化效率,可动态分配计算资源。美团CEO王兴强调AI战略为进攻性布局,旨在打造本地生活领域的AI超级入口。LongCat-2.0的推出验证了国产算力有能力独立支撑前沿模型全生命周期训练,对激活存量国产芯片意义重大。 #美团 #大模型 #国产算力 #AI #科技新闻 #LongCat2.0 #华为昇腾
Keurig 如何拯救——又毁掉—
在 Keurig 出现之前,办公室里提供的咖啡几乎毫无悬念地难喝:陈旧的、焦糊的、由随意估量而非精确冲泡的人制作,总之一塌糊涂。而 Keurig 单杯咖啡机问世后,你可以按需即时冲泡一杯新鲜咖啡,精准解决这一普遍问题。然而,这家曾以便捷革新而闻名的公司,如今因高昂的专利咖啡杯、电子锁定机制和环保问题饱受争议。咖啡胶囊的塑料废弃物堆积如山,而用户也被迫支付远超散装咖啡的价格。Keurig 的初衷是提升咖啡体验,但过度商业化却让许多人感到被“绑架”——一杯好咖啡的代价不仅是金钱,还有环境与选择的自由。 #Keurig #咖啡 #科技 #环保 #商业 #用户体验 #消费主义 #单杯咖啡
在 Keurig 出现之前,办公室里提供的咖啡几乎毫无悬念地难喝:陈旧的、焦糊的、由随意估量而非精确冲泡的人制作,总之一塌糊涂。而 Keurig 单杯咖啡机问世后,你可以按需即时冲泡一杯新鲜咖啡,精准解决这一普遍问题。然而,这家曾以便捷革新而闻名的公司,如今因高昂的专利咖啡杯、电子锁定机制和环保问题饱受争议。咖啡胶囊的塑料废弃物堆积如山,而用户也被迫支付远超散装咖啡的价格。Keurig 的初衷是提升咖啡体验,但过度商业化却让许多人感到被“绑架”——一杯好咖啡的代价不仅是金钱,还有环境与选择的自由。 #Keurig #咖啡 #科技 #环保 #商业 #用户体验 #消费主义 #单杯咖啡