AI知识库 @ai521
296 subscribers
21.3K photos
41 videos
19 files
813 links
@ai521 专注分享最实用的AI内容

🤖 AI教程(新手到进阶)
🧠 AI知识科普(大模型 / 提示词 / 自动化)
📰 AI资讯更新(每日最新AI动态)
📚 AI实战技巧(写作 / 绘画 / 编程 / 赚钱)
🔧 最新AI工具推荐

每天更新AI干货
长期做一个真正有价值的AI频道
Download Telegram
AgentCompass

来自研究团队的论文提出名为AgentCompass的评估基础设施,旨在统一衡量智能体(Agent)的各项能力。该论文由Zichen Ding等23位作者共同完成,于2026年7月15日提交至arXiv预印本平台。AgentCompass提供标准化评测框架,可系统评估智能体在复杂任务中的表现,涵盖多模态理解、推理决策等核心维度。这一基础设施有望解决当前智能体评估碎片化、缺乏统一基准的痛点,为AI智能体的研发与对比提供可靠参考。论文已开放PDF及HTML版本,并收录相关代码与数据链接。 #AgentCompass #智能体 #AI评估 #人工智能 #论文 #科技前沿 #arXiv
机器人加入团队

该研究探讨了自动化机器人(Bots)在开源软件项目中的采用及其对项目制度结构的影响。研究指出,随着协作规模的扩大,开源项目越来越多地引入机器人来执行持续集成、代码审查等重复性任务。然而,机器人的部署并非单纯的技术升级,而是深刻改变了项目的沟通模式、决策流程和权力分配。通过分析大量GitHub项目数据,作者发现机器人的采用显著影响了贡献者的参与行为、项目治理结构以及社区规范的演化。研究还揭示了机器人可能带来的挑战,如减少人际互动、引发新的协调成本等。该工作为理解技术自动化如何重塑在线协作组织的制度基础提供了重要视角。 #开源软件 #机器人 #自动化 #协作 #技术社会学 #项目治理 #组织制度
用归纳逻辑编程解释强化学习智能体

该研究提出了一种基于归纳逻辑编程(ILP)的方法,用于解释强化学习(RL)智能体的决策过程。传统强化学习模型常被视为“黑箱”,而归纳逻辑编程能够从智能体的交互经验中自动学习出符号化的逻辑规则,从而生成人类可理解的决策解释。论文详细阐述了如何将RL智能体的状态-动作轨迹转化为逻辑事实,并通过ILP系统归纳出覆盖行为模式的规则集。实验在多个经典基准环境中进行,结果表明该方法生成的解释在准确性和可读性上均优于现有基线。这项工作为可解释人工智能(XAI)提供了新的思路,尤其适用于需要透明性和安全性的RL应用场景。 #归纳逻辑编程 #强化学习 #可解释人工智能 #XAI #AI可解释性 #论文 #科研 #机器学习 #符号推理
UESF-Bench 提出统一具身智能体“寻找与跟随”基准测试

来自中科院等机构的研究团队发布了一项名为 UESF-Bench 的新型基准测试,旨在统一评估具身智能体在“寻找”与“跟随”两大类任务中的能力。该基准涵盖多种复杂场景,要求智能体在未知环境中自主定位目标并持续跟踪动态对象。研究通过多维度探针实验揭示了当前视觉语言模型在该任务上的表现与局限,为具身 AI 的泛化性研究提供了重要参考。 #UESFBench #具身智能 #基准测试 #AI #机器人 #视觉语言模型 #论文
Telegram必备的搜索引擎,极搜JISOU帮你精准找到,想要的群组、频道、视频、音乐

👉 t.me/jisou2?start=a_8247614025
STOCKTAKE:用公平Oracle衡量LLM智能体感知与行动之间的差距

近日,一篇名为《STOCKTAKE: Measuring the Gap Between Perception and Action in LLM Agents with a Fair Oracle》的论文在arXiv平台发布。该研究由Sagar Deb和Ashwanth Krishnan共同完成,聚焦于大型语言模型(LLM)智能体的核心问题:其感知(理解环境)与行动(执行任务)之间存在的差距。传统评估方法常受限于任务偏好或环境偏差,难以公正衡量这一差距。为此,作者设计了一种名为“公平Oracle”的评估框架,旨在消除这些偏差,更准确地测量LLM智能体从感知到行动的转化效率。该工作为理解LLM智能体的行为一致性提供了新视角,对提升智能体在复杂任务中的自主决策能力具有参考价值。论文提交于2026年7月,相关代码与数据已公开。 #LLM #AI #智能体 #论文 #arXiv #机器学习 #自主决策
大语言模型驱动智能体实现生物系统常微分方程自动发现

一篇发表在arXiv上的论文提出了一种利用大型语言模型(LLM)驱动的智能体系统,用于自动发现生物系统的常微分方程。该方法旨在将LLM的推理能力与自动化搜索相结合,以简化生物建模中常微分方程的推导过程。论文由David Krongauz等人撰写,目前处于提交状态,为生物系统建模提供了新的自动化手段。 #AI #大模型 #生物系统 #常微分方程 #自动发现 #arXiv #科研 #智能体
SAFETY SENTRY:上下文感知的人类干预机制——EXECUTE-ASK

在最新提交的arXiv论文中,Tianyu Chen等人提出了SAFETY SENTRY框架,旨在通过EXECUTE-ASK-REFUSE三类路由策略实现上下文感知的人工干预,提升AI系统的安全性。该框架允许系统根据当前语境和风险等级,自动决定是执行任务、向人类询问确认,还是直接拒绝请求,从而在自动化效率与安全控制之间取得平衡。论文探讨了如何将人类反馈无缝集成到AI决策流程中,尤其适用于高风险场景(如医疗、自动驾驶等)。这一研究为构建更可靠、可干预的智能系统提供了新思路,有望推动人机协作安全标准的完善。 #AI安全 #论文 #路由机制 #人机交互 #上下文感知 #SAFETYSENTRY #人工智能 #arXiv
AI建议抑制人们说“我不知道”的意愿,即使建议错误且准确率被激励

一项最新发表在arXiv上的研究揭示了AI建议对人类判断的负面影响。来自意大利的研究团队通过实验发现,当人们在完成任务时接收AI的建议(即使是错误的建议)时,他们更不愿意承认自己不知道答案。这种现象在实验中对准确率实施了激励措施后仍然存在。研究指出,AI的“权威性”可能削弱了人们自我反思和承认知识边界的能力。这一发现对AI辅助决策系统(如教育、医疗等领域)的设计提出了警示:过度依赖AI建议可能阻碍人类主动学习和批判性思维,且简单的经济激励无法抵消这种效应。 #AI #人工智能 #人类决策 #认知偏差 #arXiv #学术研究 #科技伦理
面向城市区域画像的多智能体协同推理方法发布

来自arXiv平台的最新论文预印本显示,研究人员提出了一种名为“多智能体协同推理与工具增强证据”的新方法,用于城市区域画像。该工作由Xixuan Hao等六位作者共同完成,论文于2026年7月15日提交。该方法创新性地利用多个智能体协同工作,并借助工具增强外部证据,以更准确、全面地刻画城市区域的特征与功能。这一研究有望提升城市规划、智能交通、商业选址等应用的数据分析能力,为城市计算领域提供新的技术思路。 #多智能体 #协同推理 #城市计算 #区域画像 #AI #学术论文 #人工智能 #智能城市
根因分析在真实遥测数据上的极限探索

一篇题为《根因分析在真实遥测数据上的极限》的学术论文在 arXiv 预印本平台发布。该研究由 Athira Gopal 和 Ashwanth Krishnan 共同完成,旨在评估根因分析(RCA)技术在真实世界遥测数据中的表现边界。论文聚焦于实际工业场景中复杂的指标波动和故障传播链,探讨了现有方法在数据噪声、依赖关系和因果推断方面的能力上限。研究结果可能对运维监控、故障诊断及自动化异常定位领域产生重要影响。 #根因分析 #遥测数据 #故障诊断 #机器学习 #论文 #arXiv #运维监控
LAPO: 多轮搜索推理中的自生成过程奖励留一轮归因方法

来自arXiv的一篇新论文提出了一种名为LAPO(留一轮归因)的方法,用于在多轮搜索推理中为自生成过程分配奖励。该方法通过剔除特定轮次的影响,评估每轮推理对最终结果的贡献,从而更精准地优化强化学习中的过程奖励模型。该研究旨在提升大语言模型在复杂任务中的多步推理能力和搜索效率,相关代码及预印本已公开。 #AI #强化学习 #多轮推理 #过程奖励 #arXiv #LAPO #大语言模型
受约束智能体的转换行为测试

一篇题为《受约束智能体的转换行为测试》的论文在预印本平台arXiv上发布。该论文由Ziwei Ye撰写,于2026年7月15日提交。论文标题表明其聚焦于设计一种专门用于评估受约束智能体(如特定环境下的AI系统)的转换行为测试,旨在衡量智能体在不同任务或规则之间切换时的表现。目前该论文可通过arXiv获取PDF全文。 #AI #智能体 #行为测试 #arXiv #预印本 #转换行为 #论文 #人工智能
EZSMT 版本 3

据 arXiv 论文提交记录显示,由 Yuliya Lierler 撰写的论文《EZSMT Version 3, Matured》于 2026 年 7 月 15 日正式提交。该论文介绍了 EZSMT 系统的第三个成熟版本,标志着该工具在可满足性模理论求解领域的重要进展。论文详细阐述了版本 3 的改进与优化,但具体技术细节和实验结果需查阅全文 PDF 了解。当前论文的 arXiv 编号尚在注册中,作者已开放 PDF 及 HTML 版本的访问权限。 #EZSMT #SMT #论文 #arXiv #YuliyaLierler #版本发布 #计算机科学
理论级自动形式化

一篇题为《理论级自动形式化:从孤立陈述到统一形式知识库》的学术论文在arXiv预印本平台发布。该研究由Marcus J. Min等八位作者完成,旨在解决数学与计算机科学中形式化知识的碎片化问题。传统上,将自然语言数学定理转化为机器可验证的形式化证明(如Lean、Coq等证明助理)需要大量人工劳动。该论文提出一种理论级自动形式化方法,不仅针对单个陈述,而是系统性地将多个互相关联的数学理论自动转化为统一、一致的形式化知识库。这一突破有望大幅降低形式化验证的门槛,加速大规模数学知识的数字化与验证进程,为人工智能辅助数学证明及可靠知识推理提供基础设施。论文已提供HTML预览和TeX源码,相关代码与数据可在学术社区获取。 #自动形式化 #形式化验证 #AI数学 #arXiv #数学证明 #知识库 #机器学习 #计算机科学
Harness Handbook:让演化中的代理工具更可读、可导航、可编辑

研究人员在arXiv上发表了一篇题为《Harness Handbook: Making Evolving Agent Harnesses Readable, Navigable, and Editable》的论文。该研究聚焦于如何提升演化中代理工具(Agent Harnesses)的可读性、导航性和可编辑性,旨在解决复杂代理系统在开发与维护过程中面临的文档混乱与交互困难问题。论文作者包括Ruhan Wang等10位研究者,提交于2026年7月14日。目前论文以PDF格式公开,并附有HTML预览和TeX源码。该工作可能对AI代理框架的实用化与社区协作产生积极影响,尤其适用于需要频繁调整和迭代代理行为的场景。 #arXiv #AI代理 #论文 #可读性 #可编辑性 #开源工具 #研究
交通运输管理基础模型部署成本优化组合研究

来自arXiv的一篇论文提出了面向交通运输管理的基础模型部署成本优化组合方案。研究团队由Xi Cheng等五位作者完成,旨在解决在交通运输场景下,如何以最低成本高效部署多种基础模型的问题。论文提出了一个组合优化框架,综合考虑不同模型的计算开销、推理速度与精度,为交通管理系统在实时调度、路线规划等任务中智能选择模型组合提供了理论支持。该研究有望降低智能交通系统的运营成本,提升模型部署的灵活性与经济性。 #论文 #交通运输 #人工智能 #基础模型 #成本优化 #arXiv #智能交通
AI原生保险:为自主AI系统提供定价、承保与全流程自动化

一篇题为《AI-Native Insurance for Agentic AI: Pricing, Underwriting, and End-to-End Automation》的学术论文近日在arXiv上公开。该研究由Quanyan Zhu撰写,聚焦于为自主AI(Agentic AI)系统设计原生保险方案,涵盖风险定价、承保逻辑以及端到端自动化流程。论文指出,随着AI代理在金融、医疗、自动驾驶等关键领域的部署日益增多,传统保险框架已难以覆盖其动态行为、决策偏差及系统性风险。作者提出了一套基于AI模型自身特征的精算与承保机制,利用自动化技术实现实时风险评估与保费动态调整,旨在为自主AI系统的运行提供可量化的风险保障。 #AI保险 #自主AI #风险管理 #学术论文 #arXiv #人工智能 #保险科技
网络化智能

一项发表于arXiv的新研究提出“主动共享上下文图”概念,旨在提升人类与AI团队在科学协作中的智能协同效率。论文由Sutanay Choudhury等18位作者共同完成,于2026年7月14日提交。该方法通过构建动态图谱来实时整合人类专家与AI模型的知识与推理过程,使双方能共享不断演化的上下文信息。研究认为,传统的静态知识图谱难以适应科学探索中快速变化的需求,而主动更新的上下文图可以更灵活地捕捉协作中的关键概念与关系,从而加速假设生成、实验设计和数据解读。这项技术有望在跨学科团队科学中发挥重要作用,为下一代人机协作研究工具提供理论基础。 #人机协作 #科学协作 #知识图谱 #AI #团队科学 #网络智能
CayleyR

一篇题为“CayleyR: Solving the TopSpin puzzle via cycle intersection”的论文发表在arXiv上,作者Yuri Baramykov提出了一种基于循环交集的新算法,用于求解经典的TopSpin谜题。TopSpin是一种滑块拼图,玩家需要通过旋转和交换数字滑块来恢复顺序。传统解法通常依赖穷举搜索或启发式策略,而该研究通过分析循环结构及环间交叉关系,显著提升了求解效率。论文展示了该算法在多种初始状态下的性能,验证了其有效性和速度优势。这一工作为组合谜题的自动化求解提供了新思路,对算法设计与群论应用具有参考价值。 #arXiv #论文 #算法 #TopSpin #谜题 #组合数学 #计算机科学
通过世界模型从人类偏好和理由中学习安全智能体行为

一篇发表在arXiv上的研究论文提出了一种新方法,通过世界模型结合人类偏好与合理性解释来训练智能体的安全行为。该方法旨在解决强化学习中智能体可能产生不安全行为的问题,利用人类提供的偏好反馈和理由说明,引导智能体构建更安全、更可解释的策略。研究者认为,将人类价值观与模型内省相结合,有助于提升AI系统的可信度和安全性。该工作为安全强化学习提供了新的思路,但目前尚处于预印本阶段,具体实验细节和评估结果有待后续公开。 #AI安全 #强化学习 #世界模型 #人类偏好 #智能体 #arXiv #论文预印本