一份合同,每个模型
我最近完成了一项工程,它彻底改变了我对AI编码代理的认知。起初,我天真地问自己:“能让Sonnet和Opus像前沿模型一样工作吗?”结果却比问题本身更有价值。简单来说:无法让小模型和大模型同样强大,因为权重是硬伤,提示词无法改变。但能力并非区分好坏的唯一标准,另一半是“规范”:代理如何沟通、何时停止、如何证明工作、决策前分析的深度。而规范完全可以移植。你只需写一次,作为系统提示层应用,无论模型层级如何,昂贵或便宜,它们都开始遵循同一份合同。 本文是论点和蓝图。我运营着一个相当复杂的代码库:基于区块链的金融协议、20多个后端微服务、多个前端、智能合约和Kubernetes集群。大部分工作通过Claude Code和一系列专业子代理完成。每天,架构代理运行在最强大模型上,实现代理运行在中端模型上,快速研究代理运行在小模型上。三种智能体系,一个代码库,一套标准。痛点并非小模型“笨”,而是它行为不同:它可能未运行测试就宣布完成,以代码细节而非答案开始,基于单一搜索就修改,中途停下询问可自行解决的问题。大模型默认正确,小模型则需要指导。 我曾认为这是使用廉价模型的必然代价,但这是错误框架。我期望的行为不是智能,而是“操行”,操行可以被规定。能力是模型能解决的问题,存在于权重中,提示词无法添加。任何“让GPT-3.5如GPT-5般聪明”的销售都是空谈。操行是模型运用能力的规范:沟通合同、完成门槛、修改前追踪影响、不能半途而废。这都不是智能,但都可以用文本规定。当能力模型已具备这些行为,是因为它们被训练如此;这意味相同行为可以指导给低能力模型,显著缩小质量差距,尽管智能差距仍在。因此,目标不是“让小模型变聪明”,而是让每个模型,无论层级,遵守同一份操作合同。 #AI编码代理 #大模型 #软件开发 #技术规范 #工程实践
我最近完成了一项工程,它彻底改变了我对AI编码代理的认知。起初,我天真地问自己:“能让Sonnet和Opus像前沿模型一样工作吗?”结果却比问题本身更有价值。简单来说:无法让小模型和大模型同样强大,因为权重是硬伤,提示词无法改变。但能力并非区分好坏的唯一标准,另一半是“规范”:代理如何沟通、何时停止、如何证明工作、决策前分析的深度。而规范完全可以移植。你只需写一次,作为系统提示层应用,无论模型层级如何,昂贵或便宜,它们都开始遵循同一份合同。 本文是论点和蓝图。我运营着一个相当复杂的代码库:基于区块链的金融协议、20多个后端微服务、多个前端、智能合约和Kubernetes集群。大部分工作通过Claude Code和一系列专业子代理完成。每天,架构代理运行在最强大模型上,实现代理运行在中端模型上,快速研究代理运行在小模型上。三种智能体系,一个代码库,一套标准。痛点并非小模型“笨”,而是它行为不同:它可能未运行测试就宣布完成,以代码细节而非答案开始,基于单一搜索就修改,中途停下询问可自行解决的问题。大模型默认正确,小模型则需要指导。 我曾认为这是使用廉价模型的必然代价,但这是错误框架。我期望的行为不是智能,而是“操行”,操行可以被规定。能力是模型能解决的问题,存在于权重中,提示词无法添加。任何“让GPT-3.5如GPT-5般聪明”的销售都是空谈。操行是模型运用能力的规范:沟通合同、完成门槛、修改前追踪影响、不能半途而废。这都不是智能,但都可以用文本规定。当能力模型已具备这些行为,是因为它们被训练如此;这意味相同行为可以指导给低能力模型,显著缩小质量差距,尽管智能差距仍在。因此,目标不是“让小模型变聪明”,而是让每个模型,无论层级,遵守同一份操作合同。 #AI编码代理 #大模型 #软件开发 #技术规范 #工程实践
消息称荣耀与阿里将官宣合作 或涉及Agentic OS
据业内消息,荣耀与阿里巴巴即将官宣合作,可能涉及荣耀此前发布的下一代终端操作系统Agentic OS。该操作系统以意图驱动、自然交互、主动智能和天生跨端为核心特性,计划于7月正式发布。双方合作早有基础:2025年7月,荣耀Magic V5已搭载阿里通义大模型及飞猪、高德等垂直Agent应用;同年9月,双方全面深化战略合作,覆盖AI云基础设施、AI模型、AI Agent生态等领域,标志着阿里全栈AI技术首次整合应用于AI手机行业。此次合作有望进一步推动AI原生操作系统和智能终端生态发展。 #荣耀 #阿里 #合作 #AgenticOS #AI #手机 #操作系统 #大模型 #科技新闻
据业内消息,荣耀与阿里巴巴即将官宣合作,可能涉及荣耀此前发布的下一代终端操作系统Agentic OS。该操作系统以意图驱动、自然交互、主动智能和天生跨端为核心特性,计划于7月正式发布。双方合作早有基础:2025年7月,荣耀Magic V5已搭载阿里通义大模型及飞猪、高德等垂直Agent应用;同年9月,双方全面深化战略合作,覆盖AI云基础设施、AI模型、AI Agent生态等领域,标志着阿里全栈AI技术首次整合应用于AI手机行业。此次合作有望进一步推动AI原生操作系统和智能终端生态发展。 #荣耀 #阿里 #合作 #AgenticOS #AI #手机 #操作系统 #大模型 #科技新闻
AuditWeave:为AI辅助与数据转换工作流打造防篡改、可审计的证据层
近日,来自arXiv的一篇论文提出了名为AuditWeave的新型证据层框架,旨在解决AI辅助工作流及数据转换过程中的审计与防篡改难题。随着AI模型在数据处理、生成和分析中的应用日益广泛,确保每一步操作的可追溯性和完整性成为合规与安全的关键。AuditWeave通过设计一种审计者可导航的证据结构,使得对工作流的每一步都能进行独立验证,且对任何篡改行为保持高度敏感。该框架有望提升金融、医疗等领域中AI工作流的透明度和可信度,为监管机构提供切实可行的审计工具。研究由Vimal Nakrani主导,论文已发布于arXiv预印本平台。 #AuditWeave #AI审计 #数据安全 #工作流 #防篡改 #arXiv #学术研究 #人工智能 #合规
近日,来自arXiv的一篇论文提出了名为AuditWeave的新型证据层框架,旨在解决AI辅助工作流及数据转换过程中的审计与防篡改难题。随着AI模型在数据处理、生成和分析中的应用日益广泛,确保每一步操作的可追溯性和完整性成为合规与安全的关键。AuditWeave通过设计一种审计者可导航的证据结构,使得对工作流的每一步都能进行独立验证,且对任何篡改行为保持高度敏感。该框架有望提升金融、医疗等领域中AI工作流的透明度和可信度,为监管机构提供切实可行的审计工具。研究由Vimal Nakrani主导,论文已发布于arXiv预印本平台。 #AuditWeave #AI审计 #数据安全 #工作流 #防篡改 #arXiv #学术研究 #人工智能 #合规
关于KV缓存压缩的消融、统计推断与验证研究
一项旨在提升大语言模型推理效率的研究近期在arXiv上发布。该论文题为《Ablation, Statistical Inference, and Validation for KV-Cache Compression》,由Paolo D'Alberto等人撰写,主要聚焦于KV缓存压缩技术。KV缓存是大模型推理过程中的关键数据结构,其规模直接影响内存占用与计算速度。研究者提出了一套系统的方法论,通过消融实验、统计推断与验证等手段,深入分析并优化KV缓存压缩策略。具体而言,该工作旨在在不显著影响模型输出质量的前提下,尽可能压缩KV缓存,从而降低推理延迟和硬件成本。研究引入了严谨的统计验证流程,以确保压缩后的缓存仍能保持模型的有效性。这一工作对于推动大模型在资源受限环境下的部署具有实际意义,也为后续相关研究提供了方法论参考。 #KV缓存压缩 #大模型推理 #消融研究 #统计推断 #AI效率 #arXiv论文 #机器学习
一项旨在提升大语言模型推理效率的研究近期在arXiv上发布。该论文题为《Ablation, Statistical Inference, and Validation for KV-Cache Compression》,由Paolo D'Alberto等人撰写,主要聚焦于KV缓存压缩技术。KV缓存是大模型推理过程中的关键数据结构,其规模直接影响内存占用与计算速度。研究者提出了一套系统的方法论,通过消融实验、统计推断与验证等手段,深入分析并优化KV缓存压缩策略。具体而言,该工作旨在在不显著影响模型输出质量的前提下,尽可能压缩KV缓存,从而降低推理延迟和硬件成本。研究引入了严谨的统计验证流程,以确保压缩后的缓存仍能保持模型的有效性。这一工作对于推动大模型在资源受限环境下的部署具有实际意义,也为后续相关研究提供了方法论参考。 #KV缓存压缩 #大模型推理 #消融研究 #统计推断 #AI效率 #arXiv论文 #机器学习
MawForge 提出内存受限的专家物化方法,优化本地 MoE 推理
一篇名为 MawForge 的论文发表于 arXiv 预印本平台,作者为 Craig Opie。该研究聚焦于混合专家模型(MoE)在本地推理时面临的内存瓶颈问题,提出一种内存受限的专家物化方法。通过优化专家模型在本地硬件上的加载与计算过程,MawForge 能够在有限内存条件下高效执行 MoE 推理,显著降低资源消耗而不牺牲模型性能。该方法为在消费级设备上部署大型 MoE 模型提供了实用解决方案,有助于推动大模型的本地化应用与隐私保护。目前论文已提供 PDF 全文供下载。 #论文 #AI #MoE #大模型 #机器学习 #arXiv
一篇名为 MawForge 的论文发表于 arXiv 预印本平台,作者为 Craig Opie。该研究聚焦于混合专家模型(MoE)在本地推理时面临的内存瓶颈问题,提出一种内存受限的专家物化方法。通过优化专家模型在本地硬件上的加载与计算过程,MawForge 能够在有限内存条件下高效执行 MoE 推理,显著降低资源消耗而不牺牲模型性能。该方法为在消费级设备上部署大型 MoE 模型提供了实用解决方案,有助于推动大模型的本地化应用与隐私保护。目前论文已提供 PDF 全文供下载。 #论文 #AI #MoE #大模型 #机器学习 #arXiv
低自相关二进制序列问题中的搜索空间区域优先级研究
来自 arXiv 的一篇研究论文探讨了低自相关二进制序列问题中如何优先处理搜索空间区域。论文作者提出了一种新方法,旨在提高该经典组合优化问题的求解效率。该研究通过分析不同搜索区域的特征,建立了优先级策略以加速找到低自相关序列的全局最优解。这项工作对通信系统、密码学等领域中序列设计具有潜在应用价值,相关论文可通过 arXiv 获取全文。 #低自相关二进制序列 #搜索空间 #组合优化 #arXiv #序列设计
来自 arXiv 的一篇研究论文探讨了低自相关二进制序列问题中如何优先处理搜索空间区域。论文作者提出了一种新方法,旨在提高该经典组合优化问题的求解效率。该研究通过分析不同搜索区域的特征,建立了优先级策略以加速找到低自相关序列的全局最优解。这项工作对通信系统、密码学等领域中序列设计具有潜在应用价值,相关论文可通过 arXiv 获取全文。 #低自相关二进制序列 #搜索空间 #组合优化 #arXiv #序列设计
参考基蒸馏检测
近日,一篇名为《Reference-Based Distillation Detection in LLMs》的研究论文在arXiv平台发布。该研究由Rajat Rawat等六位学者共同完成,针对大语言模型领域日益严重的知识蒸馏窃取问题,提出了一种基于参考的蒸馏检测方法。随着大模型商业价值凸显,通过知识蒸馏技术非法复制模型能力的行为愈发常见。该方法通过引入参考数据对,能够有效识别模型输出是否来自对其他模型的知识蒸馏,为保护大模型知识产权提供了新的技术手段。研究团队在论文中详细介绍了检测框架的设计原理和评估结果,展示了该方法在多种场景下的有效性。 #大模型 #知识蒸馏 #知识产权 #AI安全 #arXiv #学术研究
近日,一篇名为《Reference-Based Distillation Detection in LLMs》的研究论文在arXiv平台发布。该研究由Rajat Rawat等六位学者共同完成,针对大语言模型领域日益严重的知识蒸馏窃取问题,提出了一种基于参考的蒸馏检测方法。随着大模型商业价值凸显,通过知识蒸馏技术非法复制模型能力的行为愈发常见。该方法通过引入参考数据对,能够有效识别模型输出是否来自对其他模型的知识蒸馏,为保护大模型知识产权提供了新的技术手段。研究团队在论文中详细介绍了检测框架的设计原理和评估结果,展示了该方法在多种场景下的有效性。 #大模型 #知识蒸馏 #知识产权 #AI安全 #arXiv #学术研究
FedCausal-Dyn:动态特征漂移下的联邦学习因果
研究人员提出一种名为FedCausal-Dyn的新范式,旨在解决联邦学习中动态特征漂移带来的挑战。该研究由Kaijie Chen等人完成,论文发表于arXiv平台。传统联邦学习假设各客户端数据分布稳定,但在现实场景中,特征分布会随时间动态变化,导致模型性能下降。FedCausal-Dyn通过引入因果推断与动态调整机制,在不共享原始数据的前提下,使各客户端能识别并适应特征漂移,从而提升模型在非独立同分布数据上的泛化能力与鲁棒性。实验表明,该方法在多种漂移场景下均优于现有联邦学习算法,为分布式机器学习的实际应用提供了新思路。 #联邦学习 #因果推断 #动态特征漂移 #AI #机器学习 #分布式系统 #科研论文
研究人员提出一种名为FedCausal-Dyn的新范式,旨在解决联邦学习中动态特征漂移带来的挑战。该研究由Kaijie Chen等人完成,论文发表于arXiv平台。传统联邦学习假设各客户端数据分布稳定,但在现实场景中,特征分布会随时间动态变化,导致模型性能下降。FedCausal-Dyn通过引入因果推断与动态调整机制,在不共享原始数据的前提下,使各客户端能识别并适应特征漂移,从而提升模型在非独立同分布数据上的泛化能力与鲁棒性。实验表明,该方法在多种漂移场景下均优于现有联邦学习算法,为分布式机器学习的实际应用提供了新思路。 #联邦学习 #因果推断 #动态特征漂移 #AI #机器学习 #分布式系统 #科研论文
输出感知安全机制缓解多模态大模型“过度拒绝”问题
一项来自arXiv的最新研究提出了一种名为“输出感知安全护栏”的方法,旨在解决多模态大语言模型(MLLMs)在安全对齐中的过度拒绝问题。传统安全机制往往导致模型对无害请求也作出拒绝响应,影响用户体验。该研究通过让模型在生成回复时考虑输出内容的安全性,而非仅依赖输入过滤,有效降低了误拒率,同时保持了对恶意输入的防御能力。实验表明,该方法在多个基准测试上优于现有方案,在安全性与可用性之间取得了更好平衡。相关论文已提交至arXiv,由Jiayi Li等人完成。 #多模态大模型 #安全对齐 #过度拒绝 #AI安全 #arXiv论文 #MLLM #输出感知
一项来自arXiv的最新研究提出了一种名为“输出感知安全护栏”的方法,旨在解决多模态大语言模型(MLLMs)在安全对齐中的过度拒绝问题。传统安全机制往往导致模型对无害请求也作出拒绝响应,影响用户体验。该研究通过让模型在生成回复时考虑输出内容的安全性,而非仅依赖输入过滤,有效降低了误拒率,同时保持了对恶意输入的防御能力。实验表明,该方法在多个基准测试上优于现有方案,在安全性与可用性之间取得了更好平衡。相关论文已提交至arXiv,由Jiayi Li等人完成。 #多模态大模型 #安全对齐 #过度拒绝 #AI安全 #arXiv论文 #MLLM #输出感知
量子启发式上下文学习在动态交易图稀疏环欺诈检测中的应用
一篇来自arXiv的预印本论文提出了一种基于量子启发式上下文学习的新方法,用于动态交易图中的稀疏环欺诈检测。该方法由Behnam Tonekaboni和Hiroshi Yamauchi作者撰写,旨在通过量子计算启发的算法提升对复杂交易网络中欺诈行为的识别能力,特别是针对稀疏环形结构的异常模式。研究利用上下文学习机制,结合动态图的时序特性,能够更有效地从海量交易数据中捕捉微小但关键的欺诈线索。该论文已提交至arXiv平台,并提供了HTML和TeX源文件供学术社区参考,相关引用和工具链接也已集成。 #量子启发式学习 #欺诈检测 #动态交易图 #稀疏环模式 #AI安全 #金融科技 #机器学习
一篇来自arXiv的预印本论文提出了一种基于量子启发式上下文学习的新方法,用于动态交易图中的稀疏环欺诈检测。该方法由Behnam Tonekaboni和Hiroshi Yamauchi作者撰写,旨在通过量子计算启发的算法提升对复杂交易网络中欺诈行为的识别能力,特别是针对稀疏环形结构的异常模式。研究利用上下文学习机制,结合动态图的时序特性,能够更有效地从海量交易数据中捕捉微小但关键的欺诈线索。该论文已提交至arXiv平台,并提供了HTML和TeX源文件供学术社区参考,相关引用和工具链接也已集成。 #量子启发式学习 #欺诈检测 #动态交易图 #稀疏环模式 #AI安全 #金融科技 #机器学习
EvoClawBench 研究:AI 智能体能否从自身运行中学习可复用技能
来自 arXiv 预印本平台的一篇论文《EvoClawBench: Can Agents Learn Reusable Skills from Their Own Runs?》提出了一个关键问题:智能体能否从自身经验中提炼可复用的技能?该研究由 Zhiyuan Peng 等人完成,旨在探索自主智能体在多次任务执行过程中,能否像人类一样积累与迁移通用能力。论文通过设计特定基准测试 EvoClawBench,评估智能体在缺乏外部示范或预训练数据的情况下,仅依赖自身运行轨迹学习技能的效果。这项工作对强化学习、元学习和自主智能体系统的可持续发展具有潜在意义,为未来更高效的自适应智能体设计提供了新视角。 #AI #智能体 #机器学习 #arXiv #可复用技能 #EvoClawBench
来自 arXiv 预印本平台的一篇论文《EvoClawBench: Can Agents Learn Reusable Skills from Their Own Runs?》提出了一个关键问题:智能体能否从自身经验中提炼可复用的技能?该研究由 Zhiyuan Peng 等人完成,旨在探索自主智能体在多次任务执行过程中,能否像人类一样积累与迁移通用能力。论文通过设计特定基准测试 EvoClawBench,评估智能体在缺乏外部示范或预训练数据的情况下,仅依赖自身运行轨迹学习技能的效果。这项工作对强化学习、元学习和自主智能体系统的可持续发展具有潜在意义,为未来更高效的自适应智能体设计提供了新视角。 #AI #智能体 #机器学习 #arXiv #可复用技能 #EvoClawBench