AI知识库 @ai521
342 subscribers
22.9K photos
42 videos
20 files
880 links
@ai521 专注分享最实用的AI内容

🤖 AI教程(新手到进阶)
🧠 AI知识科普(大模型 / 提示词 / 自动化)
📰 AI资讯更新(每日最新AI动态)
📚 AI实战技巧(写作 / 绘画 / 编程 / 赚钱)
🔧 最新AI工具推荐

每天更新AI干货
长期做一个真正有价值的AI频道
Download Telegram
Telegram必备的搜索引擎,极搜JISOU帮你精准找到,想要的群组、频道、视频、音乐

👉 t.me/jisou2?start=a_8247614025
一份合同,每个模型

我最近完成了一项工程,它彻底改变了我对AI编码代理的认知。起初,我天真地问自己:“能让Sonnet和Opus像前沿模型一样工作吗?”结果却比问题本身更有价值。简单来说:无法让小模型和大模型同样强大,因为权重是硬伤,提示词无法改变。但能力并非区分好坏的唯一标准,另一半是“规范”:代理如何沟通、何时停止、如何证明工作、决策前分析的深度。而规范完全可以移植。你只需写一次,作为系统提示层应用,无论模型层级如何,昂贵或便宜,它们都开始遵循同一份合同。 本文是论点和蓝图。我运营着一个相当复杂的代码库:基于区块链的金融协议、20多个后端微服务、多个前端、智能合约和Kubernetes集群。大部分工作通过Claude Code和一系列专业子代理完成。每天,架构代理运行在最强大模型上,实现代理运行在中端模型上,快速研究代理运行在小模型上。三种智能体系,一个代码库,一套标准。痛点并非小模型“笨”,而是它行为不同:它可能未运行测试就宣布完成,以代码细节而非答案开始,基于单一搜索就修改,中途停下询问可自行解决的问题。大模型默认正确,小模型则需要指导。 我曾认为这是使用廉价模型的必然代价,但这是错误框架。我期望的行为不是智能,而是“操行”,操行可以被规定。能力是模型能解决的问题,存在于权重中,提示词无法添加。任何“让GPT-3.5如GPT-5般聪明”的销售都是空谈。操行是模型运用能力的规范:沟通合同、完成门槛、修改前追踪影响、不能半途而废。这都不是智能,但都可以用文本规定。当能力模型已具备这些行为,是因为它们被训练如此;这意味相同行为可以指导给低能力模型,显著缩小质量差距,尽管智能差距仍在。因此,目标不是“让小模型变聪明”,而是让每个模型,无论层级,遵守同一份操作合同。 #AI编码代理 #大模型 #软件开发 #技术规范 #工程实践
消息称荣耀与阿里将官宣合作 或涉及Agentic OS

据业内消息,荣耀与阿里巴巴即将官宣合作,可能涉及荣耀此前发布的下一代终端操作系统Agentic OS。该操作系统以意图驱动、自然交互、主动智能和天生跨端为核心特性,计划于7月正式发布。双方合作早有基础:2025年7月,荣耀Magic V5已搭载阿里通义大模型及飞猪、高德等垂直Agent应用;同年9月,双方全面深化战略合作,覆盖AI云基础设施、AI模型、AI Agent生态等领域,标志着阿里全栈AI技术首次整合应用于AI手机行业。此次合作有望进一步推动AI原生操作系统和智能终端生态发展。 #荣耀 #阿里 #合作 #AgenticOS #AI #手机 #操作系统 #大模型 #科技新闻
知识图谱与图神经网络融合综述

一篇题为《知识图谱遇上图神经网络:全面综述》的学术论文近期发布。该综述系统梳理了知识图谱与图神经网络交叉领域的研究进展,由Chengcheng Sun等八位作者合作完成。文章深入探讨了如何将图神经网络应用于知识图谱的表示学习、推理与补全任务,并分析了两种技术的互补优势。综述涵盖了从基础理论到实际应用的多个维度,包括模型架构、训练策略以及在大规模数据集上的表现评估。 #知识图谱 #图神经网络 #机器学习 #综述 #AI #数据科学 #推荐算法
每一条“地面真相”都是人类建构,而非客观真理

一篇题为《观点:每一条“地面真相”都是人类建构,而非客观真理》的学术论文在arXiv预印本平台发布。作者Charlotte Högberg等人指出,在人工智能研究中,训练数据所使用的“地面真相”标注并非绝对客观,而是受到人类认知、文化背景与主观判断的影响。论文强调,这些被用作模型评估标准的标签实际上是一种社会建构,可能导致偏见与错误的传播。该研究呼吁研究者重新审视数据集构建过程中的主观性,避免盲目依赖所谓的“客观基准”。这一观点对当前AI系统的可靠性评估提出了重要反思。 #人工智能 #数据偏见 #地面真相 #学术观点 #arXiv #AI伦理
AuditWeave:为AI辅助与数据转换工作流打造防篡改、可审计的证据层

近日,来自arXiv的一篇论文提出了名为AuditWeave的新型证据层框架,旨在解决AI辅助工作流及数据转换过程中的审计与防篡改难题。随着AI模型在数据处理、生成和分析中的应用日益广泛,确保每一步操作的可追溯性和完整性成为合规与安全的关键。AuditWeave通过设计一种审计者可导航的证据结构,使得对工作流的每一步都能进行独立验证,且对任何篡改行为保持高度敏感。该框架有望提升金融、医疗等领域中AI工作流的透明度和可信度,为监管机构提供切实可行的审计工具。研究由Vimal Nakrani主导,论文已发布于arXiv预印本平台。 #AuditWeave #AI审计 #数据安全 #工作流 #防篡改 #arXiv #学术研究 #人工智能 #合规
关于KV缓存压缩的消融、统计推断与验证研究

一项旨在提升大语言模型推理效率的研究近期在arXiv上发布。该论文题为《Ablation, Statistical Inference, and Validation for KV-Cache Compression》,由Paolo D'Alberto等人撰写,主要聚焦于KV缓存压缩技术。KV缓存是大模型推理过程中的关键数据结构,其规模直接影响内存占用与计算速度。研究者提出了一套系统的方法论,通过消融实验、统计推断与验证等手段,深入分析并优化KV缓存压缩策略。具体而言,该工作旨在在不显著影响模型输出质量的前提下,尽可能压缩KV缓存,从而降低推理延迟和硬件成本。研究引入了严谨的统计验证流程,以确保压缩后的缓存仍能保持模型的有效性。这一工作对于推动大模型在资源受限环境下的部署具有实际意义,也为后续相关研究提供了方法论参考。 #KV缓存压缩 #大模型推理 #消融研究 #统计推断 #AI效率 #arXiv论文 #机器学习
SciML在现实场景中的诊断研究

一项发表于arXiv的研究对科学机器学习(SciML)中结构性先验的作用进行了系统诊断。来自Raj Dandekar团队的研究者通过广泛实验,分析了在真实应用场景中,结构性先验对模型性能的双重影响。研究发现,在某些情况下,结构性先验能有效提升模型的泛化能力和样本效率,帮助模型更好地捕捉物理规律;但在其他场景中,过于强加的先验假设反而会限制模型灵活性,导致预测偏差或性能下降。该工作为SciML领域提供了实用指南,帮助研究者根据具体问题判断是否引入结构性先验。 #SciML #机器学习 #结构性先验 #AI研究 #科学计算
MawForge 提出内存受限的专家物化方法,优化本地 MoE 推理

一篇名为 MawForge 的论文发表于 arXiv 预印本平台,作者为 Craig Opie。该研究聚焦于混合专家模型(MoE)在本地推理时面临的内存瓶颈问题,提出一种内存受限的专家物化方法。通过优化专家模型在本地硬件上的加载与计算过程,MawForge 能够在有限内存条件下高效执行 MoE 推理,显著降低资源消耗而不牺牲模型性能。该方法为在消费级设备上部署大型 MoE 模型提供了实用解决方案,有助于推动大模型的本地化应用与隐私保护。目前论文已提供 PDF 全文供下载。 #论文 #AI #MoE #大模型 #机器学习 #arXiv
低自相关二进制序列问题中的搜索空间区域优先级研究

来自 arXiv 的一篇研究论文探讨了低自相关二进制序列问题中如何优先处理搜索空间区域。论文作者提出了一种新方法,旨在提高该经典组合优化问题的求解效率。该研究通过分析不同搜索区域的特征,建立了优先级策略以加速找到低自相关序列的全局最优解。这项工作对通信系统、密码学等领域中序列设计具有潜在应用价值,相关论文可通过 arXiv 获取全文。 #低自相关二进制序列 #搜索空间 #组合优化 #arXiv #序列设计
编码代理究竟需要哪些上下文信息来行动

一篇发表在 arXiv 上的新研究论文探讨了编码代理在执行任务时所需的上下文信息。研究指出,编码代理在理解代码库、生成代码补全或修复错误时,需要依赖特定类型的上下文,如代码周围的语法环境、变量作用域、以及相关函数和类的定义。作者 Brian Sam-Bodden 通过实验分析了不同类型的上下文对代理性能的影响,发现仅提供局部上下文往往不足,而结合全局代码结构和语义信息能显著提升代理的准确性和效率。该工作为设计更智能的编码工具提供了理论依据。 #编码代理 #AI编程 #上下文 #arXiv #研究论文
参考基蒸馏检测

近日,一篇名为《Reference-Based Distillation Detection in LLMs》的研究论文在arXiv平台发布。该研究由Rajat Rawat等六位学者共同完成,针对大语言模型领域日益严重的知识蒸馏窃取问题,提出了一种基于参考的蒸馏检测方法。随着大模型商业价值凸显,通过知识蒸馏技术非法复制模型能力的行为愈发常见。该方法通过引入参考数据对,能够有效识别模型输出是否来自对其他模型的知识蒸馏,为保护大模型知识产权提供了新的技术手段。研究团队在论文中详细介绍了检测框架的设计原理和评估结果,展示了该方法在多种场景下的有效性。 #大模型 #知识蒸馏 #知识产权 #AI安全 #arXiv #学术研究
深度

一篇来自 arXiv 的新论文提出了一种名为“深度-熵引导采样”的方法,旨在提升大语言模型(LLM)在无需额外训练时的推理能力。该方法通过利用模型内部的深度信息与熵值,引导采样过程,从而更高效地生成高质量推理路径。实验表明,该技术可在不更新模型参数的情况下,显著改善复杂推理任务的准确率。论文由 Zibin Meng 等人撰写,已提交至 arXiv 平台,并提供了 PDF 及 HTML 格式的全文链接。相关研究涉及人工智能、自然语言处理及无训练推理等前沿领域。 #人工智能 #大语言模型 #推理 #无训练方法 #arXiv #学术论文 #AI
低秩注意力残差

来自arXiv的最新论文显示,Jonathan Su提交了题为“Low-Rank Attention Residuals”的研究成果。该论文于2026年6月19日发布,探讨了在Transformer架构中引入低秩注意力残差的技术思路。低秩方法旨在降低注意力机制的计算复杂度与内存占用,同时保持模型表达力。通过将注意力权重分解为低秩矩阵并添加残差连接,模型可在不显著损失性能的前提下实现更高效的推理。该工作可能对长序列处理、大模型训练等场景具有实用价值,为注意力机制优化提供了新的方向。 #低秩注意力 #残差连接 #Transformer #深度学习 #arXiv #论文 #AI研究
FedCausal-Dyn:动态特征漂移下的联邦学习因果

研究人员提出一种名为FedCausal-Dyn的新范式,旨在解决联邦学习中动态特征漂移带来的挑战。该研究由Kaijie Chen等人完成,论文发表于arXiv平台。传统联邦学习假设各客户端数据分布稳定,但在现实场景中,特征分布会随时间动态变化,导致模型性能下降。FedCausal-Dyn通过引入因果推断与动态调整机制,在不共享原始数据的前提下,使各客户端能识别并适应特征漂移,从而提升模型在非独立同分布数据上的泛化能力与鲁棒性。实验表明,该方法在多种漂移场景下均优于现有联邦学习算法,为分布式机器学习的实际应用提供了新思路。 #联邦学习 #因果推断 #动态特征漂移 #AI #机器学习 #分布式系统 #科研论文
新研究提出缓解CTR模型早期训练崩溃的方法

一篇来自arXiv的论文提出了一种缓解点击率(CTR)模型早期训练崩溃的方法。该研究由Ergun Biçici和Erkan Çetinyamaç完成,旨在解决CTR模型在训练初期常见的梯度消失或崩溃问题,提升模型训练的稳定性和收敛效率。论文详细分析了早期训练崩溃的成因,并给出相应的解决方案,对推荐系统、广告点击率预测等领域具有参考价值。 #CTR #推荐系统 #机器学习 #模型训练 #论文 #arXiv
输出感知安全机制缓解多模态大模型“过度拒绝”问题

一项来自arXiv的最新研究提出了一种名为“输出感知安全护栏”的方法,旨在解决多模态大语言模型(MLLMs)在安全对齐中的过度拒绝问题。传统安全机制往往导致模型对无害请求也作出拒绝响应,影响用户体验。该研究通过让模型在生成回复时考虑输出内容的安全性,而非仅依赖输入过滤,有效降低了误拒率,同时保持了对恶意输入的防御能力。实验表明,该方法在多个基准测试上优于现有方案,在安全性与可用性之间取得了更好平衡。相关论文已提交至arXiv,由Jiayi Li等人完成。 #多模态大模型 #安全对齐 #过度拒绝 #AI安全 #arXiv论文 #MLLM #输出感知
量子启发式上下文学习在动态交易图稀疏环欺诈检测中的应用

一篇来自arXiv的预印本论文提出了一种基于量子启发式上下文学习的新方法,用于动态交易图中的稀疏环欺诈检测。该方法由Behnam Tonekaboni和Hiroshi Yamauchi作者撰写,旨在通过量子计算启发的算法提升对复杂交易网络中欺诈行为的识别能力,特别是针对稀疏环形结构的异常模式。研究利用上下文学习机制,结合动态图的时序特性,能够更有效地从海量交易数据中捕捉微小但关键的欺诈线索。该论文已提交至arXiv平台,并提供了HTML和TeX源文件供学术社区参考,相关引用和工具链接也已集成。 #量子启发式学习 #欺诈检测 #动态交易图 #稀疏环模式 #AI安全 #金融科技 #机器学习
流形约束下表格深度神经网络研究取得新进展

一项关于表格数据深度神经网络的研究近日提交至arXiv预印本平台。论文提出了一种流形约束方法,旨在解决传统深度神经网络在处理表格数据时面临的挑战。该方法通过引入流形结构约束,改善了模型对表格数据中复杂特征关系的学习能力,提高了预测性能和泛化性。研究团队表示,这一框架有望在金融、医疗等表格数据领域发挥重要作用,为深度神经网络在结构化数据上的应用提供新思路。论文提供了完整的数学推导和实验验证,并已开放代码资源。 #深度学习 #表格数据 #神经网络 #arXiv #机器学习
EvoClawBench 研究:AI 智能体能否从自身运行中学习可复用技能

来自 arXiv 预印本平台的一篇论文《EvoClawBench: Can Agents Learn Reusable Skills from Their Own Runs?》提出了一个关键问题:智能体能否从自身经验中提炼可复用的技能?该研究由 Zhiyuan Peng 等人完成,旨在探索自主智能体在多次任务执行过程中,能否像人类一样积累与迁移通用能力。论文通过设计特定基准测试 EvoClawBench,评估智能体在缺乏外部示范或预训练数据的情况下,仅依赖自身运行轨迹学习技能的效果。这项工作对强化学习、元学习和自主智能体系统的可持续发展具有潜在意义,为未来更高效的自适应智能体设计提供了新视角。 #AI #智能体 #机器学习 #arXiv #可复用技能 #EvoClawBench
ERP数据供应财务控制测试论文上线

一篇由Anitha Samudrala撰写的学术论文已提交至arXiv预印本平台,标题为《ERP数据供应财务控制测试》。该论文主要探讨企业资源规划系统中的数据供应与财务控制测试方法,旨在提升财务流程的数据准确性与合规性。论文提交日期为2026年6月23日,属于计算机科学领域(cs)范畴。用户可通过arXiv直接查看PDF全文、引用文献及相关学术工具,如BibTeX、Google Scholar等。目前论文尚未正式出版,仅供预印本查阅。 #ERP #财务控制 #数据供应 #学术论文 #arXiv #计算机科学