面向长期任务的智能体兼容上下文管理方法研究
近日,一篇题为《Learning Agent-Compatible Context Management for Long-Horizon Tasks》的论文在arXiv上发布。该研究由Lu Yi等作者共同完成,聚焦于智能体在长期任务中的上下文管理难题。传统方法在处理长时间跨度任务时,常因上下文信息冗余或遗漏导致性能下降。论文提出了一种学习智能体兼容上下文管理的方法,通过动态选择和组织与任务相关的上下文信息,使智能体更高效地利用历史交互。实验结果显示,该方法在多个长期任务基准上显著提升了智能体的决策质量和任务完成率,为构建更鲁棒的自主智能体系统提供了新思路。 #AI #智能体 #上下文管理 #长期任务 #机器学习 #arXiv #论文
近日,一篇题为《Learning Agent-Compatible Context Management for Long-Horizon Tasks》的论文在arXiv上发布。该研究由Lu Yi等作者共同完成,聚焦于智能体在长期任务中的上下文管理难题。传统方法在处理长时间跨度任务时,常因上下文信息冗余或遗漏导致性能下降。论文提出了一种学习智能体兼容上下文管理的方法,通过动态选择和组织与任务相关的上下文信息,使智能体更高效地利用历史交互。实验结果显示,该方法在多个长期任务基准上显著提升了智能体的决策质量和任务完成率,为构建更鲁棒的自主智能体系统提供了新思路。 #AI #智能体 #上下文管理 #长期任务 #机器学习 #arXiv #论文
MAVEN 研究提出新方法,提升智能体工具调用的泛化能力
一篇题为《MAVEN: Improving Generalization in Agentic Tool Calling》的学术论文近日在 arXiv 上发布。该研究由 Omkar Ghugarkar 等三位作者完成,旨在解决智能体在工具调用场景中的泛化问题。论文提出了一种名为 MAVEN 的新方法,通过改进模型对未见工具和复杂任务序列的适应能力,显著提升了智能体在动态环境中的表现。实验结果表明,该方法在多个基准测试中均优于现有方案,为构建更通用、更可靠的智能体系统提供了新思路。该研究于 2026 年 5 月 29 日提交,目前可通过 arXiv 获取全文。 #AI #智能体 #工具调用 #泛化 #机器学习 #学术论文 #arXiv
一篇题为《MAVEN: Improving Generalization in Agentic Tool Calling》的学术论文近日在 arXiv 上发布。该研究由 Omkar Ghugarkar 等三位作者完成,旨在解决智能体在工具调用场景中的泛化问题。论文提出了一种名为 MAVEN 的新方法,通过改进模型对未见工具和复杂任务序列的适应能力,显著提升了智能体在动态环境中的表现。实验结果表明,该方法在多个基准测试中均优于现有方案,为构建更通用、更可靠的智能体系统提供了新思路。该研究于 2026 年 5 月 29 日提交,目前可通过 arXiv 获取全文。 #AI #智能体 #工具调用 #泛化 #机器学习 #学术论文 #arXiv
Structure-Induced Information for Rerooting Levin Tree Search
Jake Tuero 等人在 arXiv 上提交了一篇题为“Structure-Induced Information for Rerooting Levin Tree Search”的论文。该论文主要研究如何利用结构诱导信息来改进 Levin 树搜索中的重新根植过程。Levin 树搜索是一种用于组合优化问题的算法,重新根植技术可提升搜索效率。论文于 2026 年 5 月 28 日提交,提供了 PDF 和 HTML 版本,目前暂未标注 DOI。该研究可能对人工智能和算法优化领域具有参考价值。 #论文 #arXiv #LevinTreeSearch #算法 #人工智能 #优化
Jake Tuero 等人在 arXiv 上提交了一篇题为“Structure-Induced Information for Rerooting Levin Tree Search”的论文。该论文主要研究如何利用结构诱导信息来改进 Levin 树搜索中的重新根植过程。Levin 树搜索是一种用于组合优化问题的算法,重新根植技术可提升搜索效率。论文于 2026 年 5 月 28 日提交,提供了 PDF 和 HTML 版本,目前暂未标注 DOI。该研究可能对人工智能和算法优化领域具有参考价值。 #论文 #arXiv #LevinTreeSearch #算法 #人工智能 #优化
EHRBench:基于电子健康记录的LLM临床决策自动化可靠基准
来自arXiv的论文显示,研究人员提出了EHRBench,这是一个基于电子健康记录(EHR)的自动化、可靠基准,用于评估大型语言模型(LLMs)在临床决策中的表现。该基准利用真实EHR数据,通过标准化流程自动生成测试案例,涵盖诊断、治疗建议等关键临床任务。研究团队表示,EHRBench旨在解决现有评估方法依赖人工标注、可重复性差的问题,为LLM在医疗领域的应用提供更客观的衡量标准。初步实验表明,该基准能有效区分不同模型的临床推理能力,有望推动AI辅助诊断的规范化发展。 #EHRBench #临床决策 #大语言模型 #电子健康记录 #AI医疗 #基准测试 #arXiv
来自arXiv的论文显示,研究人员提出了EHRBench,这是一个基于电子健康记录(EHR)的自动化、可靠基准,用于评估大型语言模型(LLMs)在临床决策中的表现。该基准利用真实EHR数据,通过标准化流程自动生成测试案例,涵盖诊断、治疗建议等关键临床任务。研究团队表示,EHRBench旨在解决现有评估方法依赖人工标注、可重复性差的问题,为LLM在医疗领域的应用提供更客观的衡量标准。初步实验表明,该基准能有效区分不同模型的临床推理能力,有望推动AI辅助诊断的规范化发展。 #EHRBench #临床决策 #大语言模型 #电子健康记录 #AI医疗 #基准测试 #arXiv
使用 Map-Elites 算法程序化生成第一人称射击游戏地图
该论文提出了一种基于 Map-Elites 进化算法的程序化内容生成方法,用于自动生成第一人称射击游戏(FPS)地图。Map-Elites 是一种多目标优化算法,能够在地图设计空间中搜索并保留多样化的高质量解决方案。研究团队通过定义地图的几何特征、玩家路径和战术区域等关键维度,利用该算法生成了大量具有不同风格和难度等级的地图。实验结果表明,该方法不仅能生成符合游戏设计规范的地图,还能在可玩性、平衡性和多样性方面达到甚至超越手工设计的水平。该工作为游戏开发中的自动化地图生成提供了新的思路,有望降低开发成本并丰富玩家体验。 #程序化生成 #FPS #MapElites #游戏地图 #进化算法 #AI #游戏开发 #论文
该论文提出了一种基于 Map-Elites 进化算法的程序化内容生成方法,用于自动生成第一人称射击游戏(FPS)地图。Map-Elites 是一种多目标优化算法,能够在地图设计空间中搜索并保留多样化的高质量解决方案。研究团队通过定义地图的几何特征、玩家路径和战术区域等关键维度,利用该算法生成了大量具有不同风格和难度等级的地图。实验结果表明,该方法不仅能生成符合游戏设计规范的地图,还能在可玩性、平衡性和多样性方面达到甚至超越手工设计的水平。该工作为游戏开发中的自动化地图生成提供了新的思路,有望降低开发成本并丰富玩家体验。 #程序化生成 #FPS #MapElites #游戏地图 #进化算法 #AI #游戏开发 #论文
研究揭示FTS转换与编码对SAT求解的影响
一篇来自arXiv的预印本论文《Transforming and Encoding FTS for SAT Solving: What Helps, What Hurts (Extended Version)》由João Filipe等作者撰写。该研究系统分析了在将FTS(特征转换系统)转换为SAT(布尔可满足性问题)求解器可处理的形式时,不同转换与编码策略的有效性。通过大量实验,作者识别出哪些方法能显著提升求解效率,哪些反而会降低性能,为相关领域的研究者提供了实用指导。论文已提交至arXiv,目前处于待注册状态,并提供了PDF全文链接。 #SAT求解 #FTS #编码策略 #学术论文 #arXiv #人工智能 #形式化方法
一篇来自arXiv的预印本论文《Transforming and Encoding FTS for SAT Solving: What Helps, What Hurts (Extended Version)》由João Filipe等作者撰写。该研究系统分析了在将FTS(特征转换系统)转换为SAT(布尔可满足性问题)求解器可处理的形式时,不同转换与编码策略的有效性。通过大量实验,作者识别出哪些方法能显著提升求解效率,哪些反而会降低性能,为相关领域的研究者提供了实用指导。论文已提交至arXiv,目前处于待注册状态,并提供了PDF全文链接。 #SAT求解 #FTS #编码策略 #学术论文 #arXiv #人工智能 #形式化方法
物理可行的世界模型
一篇题为《Physically Viable World Models: A Case for Query-Conditioned Embodied AI》的学术论文近日在arXiv预印本平台发布。该论文由Adam J. Thorpe等九位研究者共同完成,聚焦于具身人工智能领域中的世界模型构建问题。研究提出了一种基于查询条件化的新方法,旨在使智能体在物理世界中生成更可靠、更符合物理规律的环境表征。传统世界模型往往难以兼顾泛化性与物理一致性,而该工作通过将外部查询作为条件输入,引导模型聚焦于任务相关的物理约束,从而提升推理的准确性与可解释性。这一方向有望为机器人导航、操作等具身任务提供更稳健的底层支持,推动AI系统在真实物理环境中的部署。 #具身AI #世界模型 #物理可行性 #查询条件化 #机器人 #人工智能 #arXiv #学术论文
一篇题为《Physically Viable World Models: A Case for Query-Conditioned Embodied AI》的学术论文近日在arXiv预印本平台发布。该论文由Adam J. Thorpe等九位研究者共同完成,聚焦于具身人工智能领域中的世界模型构建问题。研究提出了一种基于查询条件化的新方法,旨在使智能体在物理世界中生成更可靠、更符合物理规律的环境表征。传统世界模型往往难以兼顾泛化性与物理一致性,而该工作通过将外部查询作为条件输入,引导模型聚焦于任务相关的物理约束,从而提升推理的准确性与可解释性。这一方向有望为机器人导航、操作等具身任务提供更稳健的底层支持,推动AI系统在真实物理环境中的部署。 #具身AI #世界模型 #物理可行性 #查询条件化 #机器人 #人工智能 #arXiv #学术论文
PhyDrawGen
一篇题为《PhyDrawGen: Physically Grounded Diagram Generation from Natural Language》的论文近日在arXiv上发布。该研究由Nafiul Haque等三位作者完成,提出了一种从自然语言描述生成符合物理规律的图表的新方法。传统图表生成往往忽略物理约束,而PhyDrawGen通过引入物理知识,使生成的图表在几何、力学等方面更加真实可靠。该工作有望在教育、科学可视化、自动插图等领域发挥重要作用,为自然语言与物理世界的连接提供了新思路。 #论文 #AI #自然语言处理 #图表生成 #物理 #arXiv #研究 #科学可视化
一篇题为《PhyDrawGen: Physically Grounded Diagram Generation from Natural Language》的论文近日在arXiv上发布。该研究由Nafiul Haque等三位作者完成,提出了一种从自然语言描述生成符合物理规律的图表的新方法。传统图表生成往往忽略物理约束,而PhyDrawGen通过引入物理知识,使生成的图表在几何、力学等方面更加真实可靠。该工作有望在教育、科学可视化、自动插图等领域发挥重要作用,为自然语言与物理世界的连接提供了新思路。 #论文 #AI #自然语言处理 #图表生成 #物理 #arXiv #研究 #科学可视化
学习-延迟框架新进展
近日,一篇题为《Learning-to-Defer with Expert-Conditional Advice》的论文在arXiv上发布。该研究聚焦于学习-延迟(Learning to Defer)问题,即机器学习模型在不确定时可将决策权委托给人类专家。论文提出了一种基于专家条件建议的新方法,允许模型根据专家提供的条件性信息动态决定是否延迟决策,从而在保证准确性的同时降低人工干预成本。该方法有望在医疗诊断、金融风控等高风险领域提升人机协作效率。论文由Yannis Montreuil等五位作者共同完成,目前提供PDF全文及HTML预览。 #机器学习 #学习延迟 #人机协作 #AI #论文 #arXiv #专家系统
近日,一篇题为《Learning-to-Defer with Expert-Conditional Advice》的论文在arXiv上发布。该研究聚焦于学习-延迟(Learning to Defer)问题,即机器学习模型在不确定时可将决策权委托给人类专家。论文提出了一种基于专家条件建议的新方法,允许模型根据专家提供的条件性信息动态决定是否延迟决策,从而在保证准确性的同时降低人工干预成本。该方法有望在医疗诊断、金融风控等高风险领域提升人机协作效率。论文由Yannis Montreuil等五位作者共同完成,目前提供PDF全文及HTML预览。 #机器学习 #学习延迟 #人机协作 #AI #论文 #arXiv #专家系统
记忆有益还是有害?先验信息设定阈值
一篇由Chen Cheng和Rina Foygel Barber共同撰写的论文《Is Memorization Helpful or Harmful? Prior Information Sets the Threshold》在arXiv平台发布。该研究聚焦于机器学习中记忆现象的双重作用,探讨在先验信息不同条件下,模型记忆对性能的影响如何从有益转向有害。作者通过理论分析,揭示了先验知识如何决定记忆的临界点,为理解模型泛化与过拟合之间的平衡提供了新视角。该工作对深度学习、统计学习理论等领域具有参考价值,有助于指导在实际应用中如何调控记忆程度以优化模型表现。 #机器学习 #记忆 #泛化 #先验信息 #统计学习 #AI研究 #论文
一篇由Chen Cheng和Rina Foygel Barber共同撰写的论文《Is Memorization Helpful or Harmful? Prior Information Sets the Threshold》在arXiv平台发布。该研究聚焦于机器学习中记忆现象的双重作用,探讨在先验信息不同条件下,模型记忆对性能的影响如何从有益转向有害。作者通过理论分析,揭示了先验知识如何决定记忆的临界点,为理解模型泛化与过拟合之间的平衡提供了新视角。该工作对深度学习、统计学习理论等领域具有参考价值,有助于指导在实际应用中如何调控记忆程度以优化模型表现。 #机器学习 #记忆 #泛化 #先验信息 #统计学习 #AI研究 #论文
条件共形预测诊断
近期,一篇题为《条件覆盖诊断用于共形预测》的学术论文在arXiv上发布。该研究由Sacha Braun等人撰写,聚焦于共形预测中条件覆盖性能的评估与诊断。共形预测是一种提供预测区间的不确定性量化方法,其关键属性是覆盖概率。然而,传统方法对条件覆盖的检验存在局限。论文提出了系统性的诊断框架,通过统计工具和可视化手段,帮助识别预测条件覆盖的偏差与不平衡。该工作共发布两个版本,更新于2026年5月,并附有完整代码及实验支持。研究为机器学习模型的可靠性评估提供了新手段,对高风险场景的决策尤为重要。 #机器学习 #共形预测 #不确定性量化 #统计诊断 #arXiv #学术论文 #预测区间 #可靠性
近期,一篇题为《条件覆盖诊断用于共形预测》的学术论文在arXiv上发布。该研究由Sacha Braun等人撰写,聚焦于共形预测中条件覆盖性能的评估与诊断。共形预测是一种提供预测区间的不确定性量化方法,其关键属性是覆盖概率。然而,传统方法对条件覆盖的检验存在局限。论文提出了系统性的诊断框架,通过统计工具和可视化手段,帮助识别预测条件覆盖的偏差与不平衡。该工作共发布两个版本,更新于2026年5月,并附有完整代码及实验支持。研究为机器学习模型的可靠性评估提供了新手段,对高风险场景的决策尤为重要。 #机器学习 #共形预测 #不确定性量化 #统计诊断 #arXiv #学术论文 #预测区间 #可靠性
线性统计模型的快速随机草图化序贯最小二乘估计器
近日,一篇题为《线性统计模型的快速随机草图化序贯最小二乘估计器》的论文在arXiv预印本平台发布。该研究由Guan-Yu Chen等三位作者完成,提出了一种结合快速随机草图化技术的序贯最小二乘估计方法。随机草图化是一种高效的降维手段,能够在保持估计精度的同时显著降低计算复杂度,特别适用于大规模数据流或在线学习场景。论文通过理论分析和实验验证,展示了该方法在处理高维线性模型时的优越性能,为统计推断和机器学习中的实时参数估计提供了新的思路。该工作有望推动大数据环境下高效算法的进一步发展。 #机器学习 #统计学习 #随机算法 #最小二乘 #线性模型 #arXiv #论文 #计算效率 #序贯估计 #草图化
近日,一篇题为《线性统计模型的快速随机草图化序贯最小二乘估计器》的论文在arXiv预印本平台发布。该研究由Guan-Yu Chen等三位作者完成,提出了一种结合快速随机草图化技术的序贯最小二乘估计方法。随机草图化是一种高效的降维手段,能够在保持估计精度的同时显著降低计算复杂度,特别适用于大规模数据流或在线学习场景。论文通过理论分析和实验验证,展示了该方法在处理高维线性模型时的优越性能,为统计推断和机器学习中的实时参数估计提供了新的思路。该工作有望推动大数据环境下高效算法的进一步发展。 #机器学习 #统计学习 #随机算法 #最小二乘 #线性模型 #arXiv #论文 #计算效率 #序贯估计 #草图化
随机梯度在干扰下的研究论文发布
一篇题为《Stochastic Gradients under Nuisances》的学术论文日前在预印本平台arXiv上发布。该论文由Facheng Yu、Ronak Mehta、Alex Luedtke和Zaid Harchaoui共同撰写,聚焦于在存在干扰变量(nuisances)时随机梯度的理论与应用问题。研究旨在解决实际数据中噪声与混淆因素对梯度估计的影响,为统计学习和优化算法提供更稳健的基础。论文自2025年8月首次提交,后经修订,目前可通过arXiv全文访问。该工作对机器学习、统计推断等领域具有潜在参考价值,相关学者可据此探索更高效的算法设计。 #随机梯度 #干扰 #统计学习 #机器学习 #arXiv #学术论文 #优化算法
一篇题为《Stochastic Gradients under Nuisances》的学术论文日前在预印本平台arXiv上发布。该论文由Facheng Yu、Ronak Mehta、Alex Luedtke和Zaid Harchaoui共同撰写,聚焦于在存在干扰变量(nuisances)时随机梯度的理论与应用问题。研究旨在解决实际数据中噪声与混淆因素对梯度估计的影响,为统计学习和优化算法提供更稳健的基础。论文自2025年8月首次提交,后经修订,目前可通过arXiv全文访问。该工作对机器学习、统计推断等领域具有潜在参考价值,相关学者可据此探索更高效的算法设计。 #随机梯度 #干扰 #统计学习 #机器学习 #arXiv #学术论文 #优化算法