BilliardPhys-Bench
多模态大语言模型(MLLMs)在视觉理解与语言生成上取得显著进展,但其对物理世界动态与因果推理的能力仍缺乏系统评估。为此,研究团队提出BilliardPhys-Bench基准,专门测试MLLMs在台球物理场景中的推理与视觉动态理解能力。该基准包含多种涉及碰撞、轨迹预测、动量守恒等物理现象的视觉问答任务,要求模型不仅能识别物体,还需理解隐含的物理规律。实验表明,当前主流MLLMs在该基准上表现远低于人类水平,尤其在复杂多步推理和反事实推断方面存在明显短板。该工作为评估MLLMs的物理常识提供了标准化工具,并指出未来改进方向。相关论文已提交arXiv,代码与数据将开源。 #多模态大模型 #物理推理 #基准测试 #AI #计算机视觉 #台球 #arXiv #机器学习
多模态大语言模型(MLLMs)在视觉理解与语言生成上取得显著进展,但其对物理世界动态与因果推理的能力仍缺乏系统评估。为此,研究团队提出BilliardPhys-Bench基准,专门测试MLLMs在台球物理场景中的推理与视觉动态理解能力。该基准包含多种涉及碰撞、轨迹预测、动量守恒等物理现象的视觉问答任务,要求模型不仅能识别物体,还需理解隐含的物理规律。实验表明,当前主流MLLMs在该基准上表现远低于人类水平,尤其在复杂多步推理和反事实推断方面存在明显短板。该工作为评估MLLMs的物理常识提供了标准化工具,并指出未来改进方向。相关论文已提交arXiv,代码与数据将开源。 #多模态大模型 #物理推理 #基准测试 #AI #计算机视觉 #台球 #arXiv #机器学习
UniScale:通过在线联合优化模型路由与测试时缩放实现自适应统一推理缩放
该论文提出了一种名为UniScale的自适应统一推理缩放框架,旨在通过在线联合优化模型路由和测试时缩放来提升大语言模型的推理效率与性能。传统方法通常单独处理模型选择或推理计算量分配,而UniScale将两者结合,在推理过程中动态调整模型路由策略和测试时计算预算,从而在保证输出质量的前提下降低计算成本。实验表明,该方法在多个基准测试上优于固定路由或固定缩放策略,实现了更优的精度-效率权衡。该研究为大规模模型的高效部署提供了新思路,尤其适用于资源受限或延迟敏感的应用场景。 #AI #机器学习 #大模型 #推理优化 #模型路由 #测试时缩放 #arXiv
该论文提出了一种名为UniScale的自适应统一推理缩放框架,旨在通过在线联合优化模型路由和测试时缩放来提升大语言模型的推理效率与性能。传统方法通常单独处理模型选择或推理计算量分配,而UniScale将两者结合,在推理过程中动态调整模型路由策略和测试时计算预算,从而在保证输出质量的前提下降低计算成本。实验表明,该方法在多个基准测试上优于固定路由或固定缩放策略,实现了更优的精度-效率权衡。该研究为大规模模型的高效部署提供了新思路,尤其适用于资源受限或延迟敏感的应用场景。 #AI #机器学习 #大模型 #推理优化 #模型路由 #测试时缩放 #arXiv
蒸馏大语言模型反馈用于Lean定理证明
一篇题为《Distilling LLM Feedback for Lean Theorem Proving》的论文近日在arXiv上发布。该研究由Gaetan Narozniak等五位作者完成,旨在探索如何利用大语言模型(LLM)的反馈来提升形式化定理证明的效率。传统定理证明依赖人工编写的策略或搜索算法,而LLM虽能生成证明步骤,但往往缺乏可靠性。论文提出一种蒸馏方法,将LLM对证明路径的评估反馈转化为可学习的信号,从而训练更高效的证明器。实验基于Lean证明助手,结果表明该方法能显著提高证明成功率,并减少搜索空间。这一工作为结合大模型与形式化验证提供了新思路,有望推动自动定理证明在数学和软件验证领域的实际应用。 #arXiv #论文 #LLM #定理证明 #Lean #AI #机器学习 #形式化验证
一篇题为《Distilling LLM Feedback for Lean Theorem Proving》的论文近日在arXiv上发布。该研究由Gaetan Narozniak等五位作者完成,旨在探索如何利用大语言模型(LLM)的反馈来提升形式化定理证明的效率。传统定理证明依赖人工编写的策略或搜索算法,而LLM虽能生成证明步骤,但往往缺乏可靠性。论文提出一种蒸馏方法,将LLM对证明路径的评估反馈转化为可学习的信号,从而训练更高效的证明器。实验基于Lean证明助手,结果表明该方法能显著提高证明成功率,并减少搜索空间。这一工作为结合大模型与形式化验证提供了新思路,有望推动自动定理证明在数学和软件验证领域的实际应用。 #arXiv #论文 #LLM #定理证明 #Lean #AI #机器学习 #形式化验证
以规划者为中心的深度研究强化学习与结构感知奖励
一篇题为《Planner-Centric Reinforcement Learning for Deep Research with Structure-Aware Reward》的学术论文在arXiv预印本平台发布。该论文由Mustafa Anis Hussain等研究者撰写,提出了一种以规划者为中心的强化学习框架,旨在提升深度研究任务中的智能体探索效率。传统强化学习方法在复杂、长时程的研究场景中常面临奖励稀疏和探索低效的问题,而该研究通过引入结构感知奖励机制,使智能体能够更好地理解任务的结构化特征,从而制定更合理的规划策略。论文详细阐述了方法的设计原理、实验设置及性能评估,展示了在多个基准任务上的显著改进。这一工作为强化学习在科学研究、自动化实验设计等领域的应用提供了新思路。 #arXiv #强化学习 #深度研究 #结构感知奖励 #AI #论文 #学术前沿
一篇题为《Planner-Centric Reinforcement Learning for Deep Research with Structure-Aware Reward》的学术论文在arXiv预印本平台发布。该论文由Mustafa Anis Hussain等研究者撰写,提出了一种以规划者为中心的强化学习框架,旨在提升深度研究任务中的智能体探索效率。传统强化学习方法在复杂、长时程的研究场景中常面临奖励稀疏和探索低效的问题,而该研究通过引入结构感知奖励机制,使智能体能够更好地理解任务的结构化特征,从而制定更合理的规划策略。论文详细阐述了方法的设计原理、实验设置及性能评估,展示了在多个基准任务上的显著改进。这一工作为强化学习在科学研究、自动化实验设计等领域的应用提供了新思路。 #arXiv #强化学习 #深度研究 #结构感知奖励 #AI #论文 #学术前沿
PReMISE
近日,一篇题为《PReMISE: Policy Rubrics as Measurement Specifications for LLM Judges》的论文在arXiv上发布。该研究由Swastik Roy等学者提出,旨在解决大语言模型(LLM)作为评判者时缺乏统一测量标准的问题。PReMISE方法通过定义明确的策略评分标准(Policy Rubrics),为LLM评判者提供可量化的测量规范,从而提升评估的准确性、一致性和可解释性。这一框架有望在AI安全、模型对齐、内容审核等领域发挥重要作用,为构建更可靠的自动评估系统提供新思路。 #AI #大模型 #LLM #论文 #arXiv #评测 #策略评分 #AI安全
近日,一篇题为《PReMISE: Policy Rubrics as Measurement Specifications for LLM Judges》的论文在arXiv上发布。该研究由Swastik Roy等学者提出,旨在解决大语言模型(LLM)作为评判者时缺乏统一测量标准的问题。PReMISE方法通过定义明确的策略评分标准(Policy Rubrics),为LLM评判者提供可量化的测量规范,从而提升评估的准确性、一致性和可解释性。这一框架有望在AI安全、模型对齐、内容审核等领域发挥重要作用,为构建更可靠的自动评估系统提供新思路。 #AI #大模型 #LLM #论文 #arXiv #评测 #策略评分 #AI安全
面向长期任务的智能体兼容上下文管理方法研究
近日,一篇题为《Learning Agent-Compatible Context Management for Long-Horizon Tasks》的论文在arXiv上发布。该研究由Lu Yi等作者共同完成,聚焦于智能体在长期任务中的上下文管理难题。传统方法在处理长时间跨度任务时,常因上下文信息冗余或遗漏导致性能下降。论文提出了一种学习智能体兼容上下文管理的方法,通过动态选择和组织与任务相关的上下文信息,使智能体更高效地利用历史交互。实验结果显示,该方法在多个长期任务基准上显著提升了智能体的决策质量和任务完成率,为构建更鲁棒的自主智能体系统提供了新思路。 #AI #智能体 #上下文管理 #长期任务 #机器学习 #arXiv #论文
近日,一篇题为《Learning Agent-Compatible Context Management for Long-Horizon Tasks》的论文在arXiv上发布。该研究由Lu Yi等作者共同完成,聚焦于智能体在长期任务中的上下文管理难题。传统方法在处理长时间跨度任务时,常因上下文信息冗余或遗漏导致性能下降。论文提出了一种学习智能体兼容上下文管理的方法,通过动态选择和组织与任务相关的上下文信息,使智能体更高效地利用历史交互。实验结果显示,该方法在多个长期任务基准上显著提升了智能体的决策质量和任务完成率,为构建更鲁棒的自主智能体系统提供了新思路。 #AI #智能体 #上下文管理 #长期任务 #机器学习 #arXiv #论文
MAVEN 研究提出新方法,提升智能体工具调用的泛化能力
一篇题为《MAVEN: Improving Generalization in Agentic Tool Calling》的学术论文近日在 arXiv 上发布。该研究由 Omkar Ghugarkar 等三位作者完成,旨在解决智能体在工具调用场景中的泛化问题。论文提出了一种名为 MAVEN 的新方法,通过改进模型对未见工具和复杂任务序列的适应能力,显著提升了智能体在动态环境中的表现。实验结果表明,该方法在多个基准测试中均优于现有方案,为构建更通用、更可靠的智能体系统提供了新思路。该研究于 2026 年 5 月 29 日提交,目前可通过 arXiv 获取全文。 #AI #智能体 #工具调用 #泛化 #机器学习 #学术论文 #arXiv
一篇题为《MAVEN: Improving Generalization in Agentic Tool Calling》的学术论文近日在 arXiv 上发布。该研究由 Omkar Ghugarkar 等三位作者完成,旨在解决智能体在工具调用场景中的泛化问题。论文提出了一种名为 MAVEN 的新方法,通过改进模型对未见工具和复杂任务序列的适应能力,显著提升了智能体在动态环境中的表现。实验结果表明,该方法在多个基准测试中均优于现有方案,为构建更通用、更可靠的智能体系统提供了新思路。该研究于 2026 年 5 月 29 日提交,目前可通过 arXiv 获取全文。 #AI #智能体 #工具调用 #泛化 #机器学习 #学术论文 #arXiv
Structure-Induced Information for Rerooting Levin Tree Search
Jake Tuero 等人在 arXiv 上提交了一篇题为“Structure-Induced Information for Rerooting Levin Tree Search”的论文。该论文主要研究如何利用结构诱导信息来改进 Levin 树搜索中的重新根植过程。Levin 树搜索是一种用于组合优化问题的算法,重新根植技术可提升搜索效率。论文于 2026 年 5 月 28 日提交,提供了 PDF 和 HTML 版本,目前暂未标注 DOI。该研究可能对人工智能和算法优化领域具有参考价值。 #论文 #arXiv #LevinTreeSearch #算法 #人工智能 #优化
Jake Tuero 等人在 arXiv 上提交了一篇题为“Structure-Induced Information for Rerooting Levin Tree Search”的论文。该论文主要研究如何利用结构诱导信息来改进 Levin 树搜索中的重新根植过程。Levin 树搜索是一种用于组合优化问题的算法,重新根植技术可提升搜索效率。论文于 2026 年 5 月 28 日提交,提供了 PDF 和 HTML 版本,目前暂未标注 DOI。该研究可能对人工智能和算法优化领域具有参考价值。 #论文 #arXiv #LevinTreeSearch #算法 #人工智能 #优化
EHRBench:基于电子健康记录的LLM临床决策自动化可靠基准
来自arXiv的论文显示,研究人员提出了EHRBench,这是一个基于电子健康记录(EHR)的自动化、可靠基准,用于评估大型语言模型(LLMs)在临床决策中的表现。该基准利用真实EHR数据,通过标准化流程自动生成测试案例,涵盖诊断、治疗建议等关键临床任务。研究团队表示,EHRBench旨在解决现有评估方法依赖人工标注、可重复性差的问题,为LLM在医疗领域的应用提供更客观的衡量标准。初步实验表明,该基准能有效区分不同模型的临床推理能力,有望推动AI辅助诊断的规范化发展。 #EHRBench #临床决策 #大语言模型 #电子健康记录 #AI医疗 #基准测试 #arXiv
来自arXiv的论文显示,研究人员提出了EHRBench,这是一个基于电子健康记录(EHR)的自动化、可靠基准,用于评估大型语言模型(LLMs)在临床决策中的表现。该基准利用真实EHR数据,通过标准化流程自动生成测试案例,涵盖诊断、治疗建议等关键临床任务。研究团队表示,EHRBench旨在解决现有评估方法依赖人工标注、可重复性差的问题,为LLM在医疗领域的应用提供更客观的衡量标准。初步实验表明,该基准能有效区分不同模型的临床推理能力,有望推动AI辅助诊断的规范化发展。 #EHRBench #临床决策 #大语言模型 #电子健康记录 #AI医疗 #基准测试 #arXiv
使用 Map-Elites 算法程序化生成第一人称射击游戏地图
该论文提出了一种基于 Map-Elites 进化算法的程序化内容生成方法,用于自动生成第一人称射击游戏(FPS)地图。Map-Elites 是一种多目标优化算法,能够在地图设计空间中搜索并保留多样化的高质量解决方案。研究团队通过定义地图的几何特征、玩家路径和战术区域等关键维度,利用该算法生成了大量具有不同风格和难度等级的地图。实验结果表明,该方法不仅能生成符合游戏设计规范的地图,还能在可玩性、平衡性和多样性方面达到甚至超越手工设计的水平。该工作为游戏开发中的自动化地图生成提供了新的思路,有望降低开发成本并丰富玩家体验。 #程序化生成 #FPS #MapElites #游戏地图 #进化算法 #AI #游戏开发 #论文
该论文提出了一种基于 Map-Elites 进化算法的程序化内容生成方法,用于自动生成第一人称射击游戏(FPS)地图。Map-Elites 是一种多目标优化算法,能够在地图设计空间中搜索并保留多样化的高质量解决方案。研究团队通过定义地图的几何特征、玩家路径和战术区域等关键维度,利用该算法生成了大量具有不同风格和难度等级的地图。实验结果表明,该方法不仅能生成符合游戏设计规范的地图,还能在可玩性、平衡性和多样性方面达到甚至超越手工设计的水平。该工作为游戏开发中的自动化地图生成提供了新的思路,有望降低开发成本并丰富玩家体验。 #程序化生成 #FPS #MapElites #游戏地图 #进化算法 #AI #游戏开发 #论文
研究揭示FTS转换与编码对SAT求解的影响
一篇来自arXiv的预印本论文《Transforming and Encoding FTS for SAT Solving: What Helps, What Hurts (Extended Version)》由João Filipe等作者撰写。该研究系统分析了在将FTS(特征转换系统)转换为SAT(布尔可满足性问题)求解器可处理的形式时,不同转换与编码策略的有效性。通过大量实验,作者识别出哪些方法能显著提升求解效率,哪些反而会降低性能,为相关领域的研究者提供了实用指导。论文已提交至arXiv,目前处于待注册状态,并提供了PDF全文链接。 #SAT求解 #FTS #编码策略 #学术论文 #arXiv #人工智能 #形式化方法
一篇来自arXiv的预印本论文《Transforming and Encoding FTS for SAT Solving: What Helps, What Hurts (Extended Version)》由João Filipe等作者撰写。该研究系统分析了在将FTS(特征转换系统)转换为SAT(布尔可满足性问题)求解器可处理的形式时,不同转换与编码策略的有效性。通过大量实验,作者识别出哪些方法能显著提升求解效率,哪些反而会降低性能,为相关领域的研究者提供了实用指导。论文已提交至arXiv,目前处于待注册状态,并提供了PDF全文链接。 #SAT求解 #FTS #编码策略 #学术论文 #arXiv #人工智能 #形式化方法
物理可行的世界模型
一篇题为《Physically Viable World Models: A Case for Query-Conditioned Embodied AI》的学术论文近日在arXiv预印本平台发布。该论文由Adam J. Thorpe等九位研究者共同完成,聚焦于具身人工智能领域中的世界模型构建问题。研究提出了一种基于查询条件化的新方法,旨在使智能体在物理世界中生成更可靠、更符合物理规律的环境表征。传统世界模型往往难以兼顾泛化性与物理一致性,而该工作通过将外部查询作为条件输入,引导模型聚焦于任务相关的物理约束,从而提升推理的准确性与可解释性。这一方向有望为机器人导航、操作等具身任务提供更稳健的底层支持,推动AI系统在真实物理环境中的部署。 #具身AI #世界模型 #物理可行性 #查询条件化 #机器人 #人工智能 #arXiv #学术论文
一篇题为《Physically Viable World Models: A Case for Query-Conditioned Embodied AI》的学术论文近日在arXiv预印本平台发布。该论文由Adam J. Thorpe等九位研究者共同完成,聚焦于具身人工智能领域中的世界模型构建问题。研究提出了一种基于查询条件化的新方法,旨在使智能体在物理世界中生成更可靠、更符合物理规律的环境表征。传统世界模型往往难以兼顾泛化性与物理一致性,而该工作通过将外部查询作为条件输入,引导模型聚焦于任务相关的物理约束,从而提升推理的准确性与可解释性。这一方向有望为机器人导航、操作等具身任务提供更稳健的底层支持,推动AI系统在真实物理环境中的部署。 #具身AI #世界模型 #物理可行性 #查询条件化 #机器人 #人工智能 #arXiv #学术论文
PhyDrawGen
一篇题为《PhyDrawGen: Physically Grounded Diagram Generation from Natural Language》的论文近日在arXiv上发布。该研究由Nafiul Haque等三位作者完成,提出了一种从自然语言描述生成符合物理规律的图表的新方法。传统图表生成往往忽略物理约束,而PhyDrawGen通过引入物理知识,使生成的图表在几何、力学等方面更加真实可靠。该工作有望在教育、科学可视化、自动插图等领域发挥重要作用,为自然语言与物理世界的连接提供了新思路。 #论文 #AI #自然语言处理 #图表生成 #物理 #arXiv #研究 #科学可视化
一篇题为《PhyDrawGen: Physically Grounded Diagram Generation from Natural Language》的论文近日在arXiv上发布。该研究由Nafiul Haque等三位作者完成,提出了一种从自然语言描述生成符合物理规律的图表的新方法。传统图表生成往往忽略物理约束,而PhyDrawGen通过引入物理知识,使生成的图表在几何、力学等方面更加真实可靠。该工作有望在教育、科学可视化、自动插图等领域发挥重要作用,为自然语言与物理世界的连接提供了新思路。 #论文 #AI #自然语言处理 #图表生成 #物理 #arXiv #研究 #科学可视化
学习-延迟框架新进展
近日,一篇题为《Learning-to-Defer with Expert-Conditional Advice》的论文在arXiv上发布。该研究聚焦于学习-延迟(Learning to Defer)问题,即机器学习模型在不确定时可将决策权委托给人类专家。论文提出了一种基于专家条件建议的新方法,允许模型根据专家提供的条件性信息动态决定是否延迟决策,从而在保证准确性的同时降低人工干预成本。该方法有望在医疗诊断、金融风控等高风险领域提升人机协作效率。论文由Yannis Montreuil等五位作者共同完成,目前提供PDF全文及HTML预览。 #机器学习 #学习延迟 #人机协作 #AI #论文 #arXiv #专家系统
近日,一篇题为《Learning-to-Defer with Expert-Conditional Advice》的论文在arXiv上发布。该研究聚焦于学习-延迟(Learning to Defer)问题,即机器学习模型在不确定时可将决策权委托给人类专家。论文提出了一种基于专家条件建议的新方法,允许模型根据专家提供的条件性信息动态决定是否延迟决策,从而在保证准确性的同时降低人工干预成本。该方法有望在医疗诊断、金融风控等高风险领域提升人机协作效率。论文由Yannis Montreuil等五位作者共同完成,目前提供PDF全文及HTML预览。 #机器学习 #学习延迟 #人机协作 #AI #论文 #arXiv #专家系统