IdeaTrail:科学创意全流程智能体轨迹研究登上arXiv
据arXiv预印本显示,一篇题为《IdeaTrail: Full-Process Agent Trajectories for Scientific Ideation》的论文于2026年7月正式提交。该论文由研究者Hengquan Guo撰写,提出了IdeaTrail框架,旨在系统记录和分析科学创意生成过程中智能体的完整运行轨迹。该工作聚焦于追踪从问题定义到假设形成等关键阶段的行为路径,以揭示高效科研创意的产生机制,为优化AI驱动的科学发现流程提供新视角。论文已在arXiv公开,并提供PDF与HTML版本,供学界查阅。 #IdeaTrail #科学创意 #智能体轨迹 #AI科研 #arXiv #论文 #科研自动化
据arXiv预印本显示,一篇题为《IdeaTrail: Full-Process Agent Trajectories for Scientific Ideation》的论文于2026年7月正式提交。该论文由研究者Hengquan Guo撰写,提出了IdeaTrail框架,旨在系统记录和分析科学创意生成过程中智能体的完整运行轨迹。该工作聚焦于追踪从问题定义到假设形成等关键阶段的行为路径,以揭示高效科研创意的产生机制,为优化AI驱动的科学发现流程提供新视角。论文已在arXiv公开,并提供PDF与HTML版本,供学界查阅。 #IdeaTrail #科学创意 #智能体轨迹 #AI科研 #arXiv #论文 #科研自动化
动态代理技能生命周期调查论文发布
近日,一篇题为“Dynamic Agent Skills: A Lifecycle Survey and Taxonomy of Evolving Skill Libraries”的论文在arXiv上公开,并被《Transactions on Machine Learning Research》期刊(2026年)接收。该论文由Yubo Li撰写,聚焦于智能代理的技能库演化问题,系统梳理了现有研究,提出了一套涵盖技能获取、适应、组合与废弃等阶段的生命周期分类法。这一框架有助于理解动态环境中代理如何自主更新和优化技能集,为自主系统、机器人及多智能体领域的进一步研究提供了结构化视角。 #AI #机器学习 #代理技能 #生命周期 #分类法 #arXiv #TMLR #智能体 #综述
近日,一篇题为“Dynamic Agent Skills: A Lifecycle Survey and Taxonomy of Evolving Skill Libraries”的论文在arXiv上公开,并被《Transactions on Machine Learning Research》期刊(2026年)接收。该论文由Yubo Li撰写,聚焦于智能代理的技能库演化问题,系统梳理了现有研究,提出了一套涵盖技能获取、适应、组合与废弃等阶段的生命周期分类法。这一框架有助于理解动态环境中代理如何自主更新和优化技能集,为自主系统、机器人及多智能体领域的进一步研究提供了结构化视角。 #AI #机器学习 #代理技能 #生命周期 #分类法 #arXiv #TMLR #智能体 #综述
MAG:面向Web Agent的多模态动作与指南生成基准测试框架
来自arXiv的最新论文显示,由Chengguang Gan等五位研究者提出了MAG(Multimodal Action and Guide Generation),这是一个面向Web Agent的基准测试与工具框架。随着大语言模型和多模态技术的成熟,智能代理在网页交互中的应用需求日益增长,但缺乏统一的评估标准。MAG通过设计多样化的任务集合和标准化接口,系统评估代理在多模态动作执行与指南生成方面的能力,涵盖从内容理解到多步操作的全流程。该工作为开发者提供了可复现的测试环境和基线模型,有望推动更高效、更可靠网络代理的发展。论文于2026年7月提交,目前正在登记DOI。 #MAG #WebAgent #多模态 #基准测试 #AI #论文 #arXiv #ChengguangGan
来自arXiv的最新论文显示,由Chengguang Gan等五位研究者提出了MAG(Multimodal Action and Guide Generation),这是一个面向Web Agent的基准测试与工具框架。随着大语言模型和多模态技术的成熟,智能代理在网页交互中的应用需求日益增长,但缺乏统一的评估标准。MAG通过设计多样化的任务集合和标准化接口,系统评估代理在多模态动作执行与指南生成方面的能力,涵盖从内容理解到多步操作的全流程。该工作为开发者提供了可复现的测试环境和基线模型,有望推动更高效、更可靠网络代理的发展。论文于2026年7月提交,目前正在登记DOI。 #MAG #WebAgent #多模态 #基准测试 #AI #论文 #arXiv #ChengguangGan
AgentAbstain论文亮相arXiv
由Xun Liu等八位学者合作的研究论文《AgentAbstain: Do LLM Agents Know When Not to Act?》近日在预印本平台arXiv提交。论文聚焦大语言模型代理在自主决策中的关键问题——是否具备在不确定性或高风险下主动放弃执行动作的认知能力。随着LLM代理在复杂任务中广泛应用,盲目行动可能导致不可逆后果。该研究提出AgentAbstain概念,旨在为代理构建"行动节制"机制,以提升系统的安全性与可靠性。论文虽未公开完整细节,但已引发关于AI行为边界的广泛讨论。 #AgentAbstain #LLM #自主决策 #AI安全 #大模型 #arXiv #论文 #机器学习
由Xun Liu等八位学者合作的研究论文《AgentAbstain: Do LLM Agents Know When Not to Act?》近日在预印本平台arXiv提交。论文聚焦大语言模型代理在自主决策中的关键问题——是否具备在不确定性或高风险下主动放弃执行动作的认知能力。随着LLM代理在复杂任务中广泛应用,盲目行动可能导致不可逆后果。该研究提出AgentAbstain概念,旨在为代理构建"行动节制"机制,以提升系统的安全性与可靠性。论文虽未公开完整细节,但已引发关于AI行为边界的广泛讨论。 #AgentAbstain #LLM #自主决策 #AI安全 #大模型 #arXiv #论文 #机器学习
符号化神经CPU实现量化模拟写回与可解释程序执行
一篇来自arXiv的学术论文提出了一种创新的符号化神经中央处理器架构,旨在通过量化模拟写回机制与可解释程序执行,弥合神经网络与经典计算机体系结构之间的鸿沟。该研究由Jose Luis Lima de Jesus Silva完成,论文详细描述了如何将符号推理与神经计算相结合,使得CPU能模拟量化操作中的写入回传过程,并在执行程序时保留可追踪的中间状态。这一设计不仅提升了神经网络的硬件兼容性,还让程序执行变得更加透明,便于开发者理解模型内部的决策逻辑。论文已在arXiv预印本平台公开,并获得了2026年7月的浏览标签,目前暂未正式注册DOI编号。 #神经CPU #量化模拟 #可解释AI #程序执行 #arXiv #计算机体系结构 #符号推理
一篇来自arXiv的学术论文提出了一种创新的符号化神经中央处理器架构,旨在通过量化模拟写回机制与可解释程序执行,弥合神经网络与经典计算机体系结构之间的鸿沟。该研究由Jose Luis Lima de Jesus Silva完成,论文详细描述了如何将符号推理与神经计算相结合,使得CPU能模拟量化操作中的写入回传过程,并在执行程序时保留可追踪的中间状态。这一设计不仅提升了神经网络的硬件兼容性,还让程序执行变得更加透明,便于开发者理解模型内部的决策逻辑。论文已在arXiv预印本平台公开,并获得了2026年7月的浏览标签,目前暂未正式注册DOI编号。 #神经CPU #量化模拟 #可解释AI #程序执行 #arXiv #计算机体系结构 #符号推理
研究揭示大语言模型归因AI代理故障的局限性
来自arXiv平台的一篇名为《Who&When Pro: 大语言模型能否真正归因AI代理失败?》的研究论文正式发布。该研究由Jiale Liu等作者完成,主要探讨大语言模型在分析AI代理系统故障时的归因能力。研究提出了一种新框架,旨在评估LLMs能否准确识别代理行为中的错误源头及时间点,挑战了当前对模型自我诊断能力的假设。实验结果显示,尽管LLMs在部分简单场景下表现良好,但在复杂、多步推理的代理任务中,其归因准确率显著下降,存在将失败错误地归咎于正确组件或错误时间节点的情况。这一发现对依赖LLMs进行自动化调试与安全监控的AI系统开发具有重要警示意义,提示业界需谨慎对待模型的自解释能力。 #AI #大模型 #LLM #代理系统 #故障归因 #研究论文 #arXiv
来自arXiv平台的一篇名为《Who&When Pro: 大语言模型能否真正归因AI代理失败?》的研究论文正式发布。该研究由Jiale Liu等作者完成,主要探讨大语言模型在分析AI代理系统故障时的归因能力。研究提出了一种新框架,旨在评估LLMs能否准确识别代理行为中的错误源头及时间点,挑战了当前对模型自我诊断能力的假设。实验结果显示,尽管LLMs在部分简单场景下表现良好,但在复杂、多步推理的代理任务中,其归因准确率显著下降,存在将失败错误地归咎于正确组件或错误时间节点的情况。这一发现对依赖LLMs进行自动化调试与安全监控的AI系统开发具有重要警示意义,提示业界需谨慎对待模型的自解释能力。 #AI #大模型 #LLM #代理系统 #故障归因 #研究论文 #arXiv
TopoExplore
arXiv 上发布了一篇题为“TopoExplore: Topological Discrimination for Archive-Based Exploration”的研究论文,作者为 Jason Carlson。该论文提出了一种名为 TopoExplore 的新方法,利用拓扑学原理对存档数据进行区分,以增强基于存档的探索过程。该方法通过拓扑学分析识别数据中的结构差异,从而提升探索效率。论文全文以 PDF 格式提供,并附有 HTML 预览、TeX 源码及许可信息,目前可通过 arXiv 平台浏览和引用。该工作涉及计算机科学领域,可借助 NASA ADS、Google Scholar 等工具进行参考与搜索。 #人工智能 #机器学习 #拓扑学 #数据探索 #计算机科学 #学术研究 #arXiv
arXiv 上发布了一篇题为“TopoExplore: Topological Discrimination for Archive-Based Exploration”的研究论文,作者为 Jason Carlson。该论文提出了一种名为 TopoExplore 的新方法,利用拓扑学原理对存档数据进行区分,以增强基于存档的探索过程。该方法通过拓扑学分析识别数据中的结构差异,从而提升探索效率。论文全文以 PDF 格式提供,并附有 HTML 预览、TeX 源码及许可信息,目前可通过 arXiv 平台浏览和引用。该工作涉及计算机科学领域,可借助 NASA ADS、Google Scholar 等工具进行参考与搜索。 #人工智能 #机器学习 #拓扑学 #数据探索 #计算机科学 #学术研究 #arXiv
探索利用代理工作流生成高质量数学视觉教具
一篇题为《Exploring Agentic Workflows for Generating High Quality Math Visual Aids》的预印本论文近日在arXiv平台发布。该研究由Rizwaan Malik等四位学者共同完成,核心聚焦于如何利用智能代理工作流(Agentic Workflows)来自动创建高质量的数学教学视觉辅助工具。论文提出,通过多代理协作框架,可以有效提升数学概念的可视化表达与教学材料生成的效率与质量,为教育技术领域带来新的探索方向。研究尚处于早期阶段,但为未来自动化教具生成提供了有价值的思路。 #arXiv #论文 #AI代理 #数学教育 #视觉辅助 #工作流 #机器学习 #教育技术
一篇题为《Exploring Agentic Workflows for Generating High Quality Math Visual Aids》的预印本论文近日在arXiv平台发布。该研究由Rizwaan Malik等四位学者共同完成,核心聚焦于如何利用智能代理工作流(Agentic Workflows)来自动创建高质量的数学教学视觉辅助工具。论文提出,通过多代理协作框架,可以有效提升数学概念的可视化表达与教学材料生成的效率与质量,为教育技术领域带来新的探索方向。研究尚处于早期阶段,但为未来自动化教具生成提供了有价值的思路。 #arXiv #论文 #AI代理 #数学教育 #视觉辅助 #工作流 #机器学习 #教育技术
AI 新研究提出“自我发现规范”提升代理上下文学习能力
据 arXiv 预印本平台显示,一篇题为《Agentic Context Learning with Self-Discovered Specification》的论文于 2026 年 7 月 9 日提交,由 Jike Zhong 等 11 位作者共同完成,归属计算机科学领域。该论文聚焦于提升智能代理在复杂环境中的上下文学习能力,核心思路是让代理在交互中自主发现并遵循任务规范,从而更高效地适应动态场景。与传统的固定规范或人工预设不同,该方法强调规范的自我生成与动态调整,有望在少样本学习、任务规划和自主决策等方向带来突破。目前论文尚未分配正式 DOI,但已在 arXiv 上提供 PDF 和 HTML 版本供研究者查阅,相关引用工具和讨论平台也已开放。这一工作为自主智能系统的上下文理解提供了新的探索路径。 #arXiv #论文 #AI #机器学习 #代理学习 #上下文学习 #自主智能 #大模型
据 arXiv 预印本平台显示,一篇题为《Agentic Context Learning with Self-Discovered Specification》的论文于 2026 年 7 月 9 日提交,由 Jike Zhong 等 11 位作者共同完成,归属计算机科学领域。该论文聚焦于提升智能代理在复杂环境中的上下文学习能力,核心思路是让代理在交互中自主发现并遵循任务规范,从而更高效地适应动态场景。与传统的固定规范或人工预设不同,该方法强调规范的自我生成与动态调整,有望在少样本学习、任务规划和自主决策等方向带来突破。目前论文尚未分配正式 DOI,但已在 arXiv 上提供 PDF 和 HTML 版本供研究者查阅,相关引用工具和讨论平台也已开放。这一工作为自主智能系统的上下文理解提供了新的探索路径。 #arXiv #论文 #AI #机器学习 #代理学习 #上下文学习 #自主智能 #大模型
PHITSBench基准发布:使用自然语言生成辐射传输输入,AI性能通过执行评分
研究人员Xianglin Ji与Svetlana V. Boriskina在arXiv上提交了一项新工作——PHITSBench,这是一个面向AI辅助的PHITS辐射传输输入生成的执行评分基准。PHITS(粒子与重离子传输系统)是核科学与辐射领域广泛使用的蒙特卡罗模拟工具,但其输入文件编写复杂且耗时。PHITSBench旨在评估大型语言模型等AI系统通过自然语言描述自动生成正确输入的能力。与传统的静态匹配不同,该基准采用执行评分策略:将AI生成的输入送入PHITS实际运行,根据模拟能否成功执行以及结果是否符合物理预期来打分。该基准包含一系列从简单到复杂的辐射传输问题,并提供了数据集与评估框架。这一工作为AI在科学计算代码自动生成领域的应用提供了标准化测试平台,有望降低辐射模拟的使用门槛,提升科研效率。 #PHITSBench #AI #辐射传输 #基准测试 #自然语言 #科学计算 #arXiv #蒙特卡罗 #核科学
研究人员Xianglin Ji与Svetlana V. Boriskina在arXiv上提交了一项新工作——PHITSBench,这是一个面向AI辅助的PHITS辐射传输输入生成的执行评分基准。PHITS(粒子与重离子传输系统)是核科学与辐射领域广泛使用的蒙特卡罗模拟工具,但其输入文件编写复杂且耗时。PHITSBench旨在评估大型语言模型等AI系统通过自然语言描述自动生成正确输入的能力。与传统的静态匹配不同,该基准采用执行评分策略:将AI生成的输入送入PHITS实际运行,根据模拟能否成功执行以及结果是否符合物理预期来打分。该基准包含一系列从简单到复杂的辐射传输问题,并提供了数据集与评估框架。这一工作为AI在科学计算代码自动生成领域的应用提供了标准化测试平台,有望降低辐射模拟的使用门槛,提升科研效率。 #PHITSBench #AI #辐射传输 #基准测试 #自然语言 #科学计算 #arXiv #蒙特卡罗 #核科学
长度惩罚使思维链推理可监控性下降
近日,arXiv上出现一篇题为《Length Penalties Make Chain-of-Thought Less Monitorable》的论文。该论文由Bryce Little撰写,关注大语言模型推理过程中的安全性与透明度问题。论文指出,在链式思维推理中应用长度惩罚技术,会显著降低模型推理过程的可监控性。长度惩罚本用于鼓励模型输出更简洁的推理步骤,但研究发现这一做法可能导致模型的内部决策过程更加不透明,增加了AI系统审计的难度。这一发现对负责任AI的发展提出了新的警示,提醒研究者在追求效率的同时,不能忽视模型行为的可解释性和安全性。该论文于2026年7月提交至arXiv平台。 #长度惩罚 #思维链 #可监控性 #AI安全 #大语言模型 #论文 #arXiv
近日,arXiv上出现一篇题为《Length Penalties Make Chain-of-Thought Less Monitorable》的论文。该论文由Bryce Little撰写,关注大语言模型推理过程中的安全性与透明度问题。论文指出,在链式思维推理中应用长度惩罚技术,会显著降低模型推理过程的可监控性。长度惩罚本用于鼓励模型输出更简洁的推理步骤,但研究发现这一做法可能导致模型的内部决策过程更加不透明,增加了AI系统审计的难度。这一发现对负责任AI的发展提出了新的警示,提醒研究者在追求效率的同时,不能忽视模型行为的可解释性和安全性。该论文于2026年7月提交至arXiv平台。 #长度惩罚 #思维链 #可监控性 #AI安全 #大语言模型 #论文 #arXiv
EvoCUA-1.5:面向多轮计算机操作智能体的在线强化学习框架
一篇题为《EvoCUA-1.5:面向多轮计算机操作智能体的在线强化学习》的论文在arXiv上发布。该研究由Mianqiu Huang等15位作者共同完成,提出了一种名为EvoCUA-1.5的新型代理框架,专注于通过在线强化学习提升多轮计算机操作任务的性能。该框架旨在让智能体能够在复杂的图形用户界面环境中,通过连续交互完成长序列操作任务。论文详细阐述了如何利用强化学习算法优化智能体的决策过程,以使其在面对多步骤、需要协调操作的任务时表现更优。这一研究为开发更智能、更自主的计算机操作助手提供了新的技术路线,有望在自动化测试、流程自动化等领域发挥重要作用。 #arXiv #EvoCUA15 #强化学习 #计算机操作 #智能体 #AI #机器学习
一篇题为《EvoCUA-1.5:面向多轮计算机操作智能体的在线强化学习》的论文在arXiv上发布。该研究由Mianqiu Huang等15位作者共同完成,提出了一种名为EvoCUA-1.5的新型代理框架,专注于通过在线强化学习提升多轮计算机操作任务的性能。该框架旨在让智能体能够在复杂的图形用户界面环境中,通过连续交互完成长序列操作任务。论文详细阐述了如何利用强化学习算法优化智能体的决策过程,以使其在面对多步骤、需要协调操作的任务时表现更优。这一研究为开发更智能、更自主的计算机操作助手提供了新的技术路线,有望在自动化测试、流程自动化等领域发挥重要作用。 #arXiv #EvoCUA15 #强化学习 #计算机操作 #智能体 #AI #机器学习
验证自适应智能控制器的新方法
一篇来自arXiv的学术论文提出了一种名为“有限规则修正”的新方法,用于验证自适应智能控制器的行为。该方法旨在解决智能系统在动态环境中因规则调整而导致的不可预测性问题。论文作者Roberto Garrone详细阐述了该技术如何通过限制规则修正的范围和次数,来确保控制器在适应新环境时仍能保持既定安全性和性能约束。研究指出,这种方法尤其适用于对可靠性要求极高的自动化系统,如自动驾驶和工业机器人。该研究于2026年7月提交,当前可在arXiv上获取全文,并提供了HTML和TeX源文件等多种阅读格式。 #AI #自适应控制 #规则修正 #自动化 #学术论文 #arXiv #智能系统
一篇来自arXiv的学术论文提出了一种名为“有限规则修正”的新方法,用于验证自适应智能控制器的行为。该方法旨在解决智能系统在动态环境中因规则调整而导致的不可预测性问题。论文作者Roberto Garrone详细阐述了该技术如何通过限制规则修正的范围和次数,来确保控制器在适应新环境时仍能保持既定安全性和性能约束。研究指出,这种方法尤其适用于对可靠性要求极高的自动化系统,如自动驾驶和工业机器人。该研究于2026年7月提交,当前可在arXiv上获取全文,并提供了HTML和TeX源文件等多种阅读格式。 #AI #自适应控制 #规则修正 #自动化 #学术论文 #arXiv #智能系统
AI代理规范执行
多智能体系统(MAS)的行为规范问题一直是人工智能研究的关键挑战。近日,Yaowen Ye与Jacob Steinhardt在arXiv发表论文,提出一种针对AI代理的规范执行机制,旨在通过奖惩与引导策略,使多个代理在复杂环境中稳健地遵循预设社会规范。研究指出,在多代理系统中,独立代理可能因自私目标而导致冲突或效率损失,而规范执行框架能够有效协调行为、提升整体系统鲁棒性与安全性。论文通过理论分析与实验验证,展示了该机制在不同场景下对代理行为的塑造效果,为自动驾驶、分布式机器人协作、金融交易等领域的规则落地提供了新思路。 #AI #多智能体系统 #规范执行 #论文 #arXiv #行为塑造 #人工智能 #代理 #研究
多智能体系统(MAS)的行为规范问题一直是人工智能研究的关键挑战。近日,Yaowen Ye与Jacob Steinhardt在arXiv发表论文,提出一种针对AI代理的规范执行机制,旨在通过奖惩与引导策略,使多个代理在复杂环境中稳健地遵循预设社会规范。研究指出,在多代理系统中,独立代理可能因自私目标而导致冲突或效率损失,而规范执行框架能够有效协调行为、提升整体系统鲁棒性与安全性。论文通过理论分析与实验验证,展示了该机制在不同场景下对代理行为的塑造效果,为自动驾驶、分布式机器人协作、金融交易等领域的规则落地提供了新思路。 #AI #多智能体系统 #规范执行 #论文 #arXiv #行为塑造 #人工智能 #代理 #研究
弱智体集群中强校正器的最优配置
一篇题为《正确性代价几何?弱多智能体集群中强校正器的预算配置》的学术论文近日在arXiv平台发布。该研究探讨了在由多个弱人工智能体构成的集群系统中,如何以有限预算成本配置少量高性能的“强校正器”,以提升整个系统的决策与行为正确性。论文提出了一个针对校正器数量与部署位置的优化框架,旨在平衡纠错效果与成本开销。通过理论分析与数值模拟,作者揭示了在资源约束下,对关键故障节点进行精准投入能够显著改善集群整体表现,但校正器配置方案的边际效益随数量增加而递减。这项研究为设计可靠且经济的分布式智能系统提供了新的理论指导。 #多智能体 #机器学习 #AI系统 #预算优化 #纠错 #学术论文 #arXiv
一篇题为《正确性代价几何?弱多智能体集群中强校正器的预算配置》的学术论文近日在arXiv平台发布。该研究探讨了在由多个弱人工智能体构成的集群系统中,如何以有限预算成本配置少量高性能的“强校正器”,以提升整个系统的决策与行为正确性。论文提出了一个针对校正器数量与部署位置的优化框架,旨在平衡纠错效果与成本开销。通过理论分析与数值模拟,作者揭示了在资源约束下,对关键故障节点进行精准投入能够显著改善集群整体表现,但校正器配置方案的边际效益随数量增加而递减。这项研究为设计可靠且经济的分布式智能系统提供了新的理论指导。 #多智能体 #机器学习 #AI系统 #预算优化 #纠错 #学术论文 #arXiv