罕见事件因果路径的形式化与证伪
一项新研究尝试对罕见事件的因果路径进行形式化建模与验证。由Anahita Haghighat等学者完成的论文《Formalizing and falsifying causal pathways of rare events》于2026年5月29日提交至arXiv预印本平台。该工作旨在解决因果推断中罕见事件路径难以被严格检验的问题,通过引入形式化语言和可证伪性标准,为复杂系统中的稀有现象提供更可靠的因果归因框架。研究有望在机器学习、流行病学等领域产生应用价值,帮助研究人员从有限数据中识别真正具有因果意义的路径,避免虚假关联。目前论文可通过arXiv获取全文及HTML版本。 #因果推断 #罕见事件 #形式化方法 #机器学习 #论文 #arXiv #因果路径
一项新研究尝试对罕见事件的因果路径进行形式化建模与验证。由Anahita Haghighat等学者完成的论文《Formalizing and falsifying causal pathways of rare events》于2026年5月29日提交至arXiv预印本平台。该工作旨在解决因果推断中罕见事件路径难以被严格检验的问题,通过引入形式化语言和可证伪性标准,为复杂系统中的稀有现象提供更可靠的因果归因框架。研究有望在机器学习、流行病学等领域产生应用价值,帮助研究人员从有限数据中识别真正具有因果意义的路径,避免虚假关联。目前论文可通过arXiv获取全文及HTML版本。 #因果推断 #罕见事件 #形式化方法 #机器学习 #论文 #arXiv #因果路径
英伟达Vera Rubin全面量产,黄仁勋感谢台湾供应链
英伟达CEO黄仁勋在GTCTaipei主题演讲中宣布新一代AI平台Vera Rubin全面量产,称其为“史上最具野心的工程计划”,并特别感谢中国台湾供应链的深度参与。Vera Rubin并非单一芯片,而是覆盖计算、网络、存储、安全与软件的完整AI基础设施系统,旨在应对代理式AI(Agentic AI)带来的分布式异构运算需求。黄仁勋提出“算力即营收”新逻辑,指出全球AI工厂投资规模巨大,单座1GW等级工厂投资已达500至1000亿美元。Vera Rubin供应链规模是上一代Grace Blackwell的两倍,制造效率大幅提升,组装时间从两小时缩短至五分钟。台湾半导体、服务器、散热等全产业链预计将迎来新一轮商机。 #英伟达 #VeraRubin #黄仁勋 #AI基础设施 #算力即营收 #台湾供应链 #AI工厂 #芯片 #科技新闻
英伟达CEO黄仁勋在GTCTaipei主题演讲中宣布新一代AI平台Vera Rubin全面量产,称其为“史上最具野心的工程计划”,并特别感谢中国台湾供应链的深度参与。Vera Rubin并非单一芯片,而是覆盖计算、网络、存储、安全与软件的完整AI基础设施系统,旨在应对代理式AI(Agentic AI)带来的分布式异构运算需求。黄仁勋提出“算力即营收”新逻辑,指出全球AI工厂投资规模巨大,单座1GW等级工厂投资已达500至1000亿美元。Vera Rubin供应链规模是上一代Grace Blackwell的两倍,制造效率大幅提升,组装时间从两小时缩短至五分钟。台湾半导体、服务器、散热等全产业链预计将迎来新一轮商机。 #英伟达 #VeraRubin #黄仁勋 #AI基础设施 #算力即营收 #台湾供应链 #AI工厂 #芯片 #科技新闻
HADT:异构多智能体差分Transformer助力自主地球观测卫星集群
近日,一篇题为《HADT: A Heterogeneous Multi-Agent Differential Transformer for Autonomous Earth Observation Satellite Cluster》的论文在arXiv预印本平台发布。该研究由Mohamad A. Hady等学者提出,旨在解决地球观测卫星集群在自主任务规划中的协同决策难题。HADT模型采用异构多智能体架构,结合差分Transformer机制,使各卫星能够根据自身能力和环境动态调整策略,提升集群的整体观测效率与鲁棒性。这一工作为未来大规模卫星星座的自主运行提供了新的技术路径,有望在遥感、灾害监测等领域发挥重要作用。 #论文 #arXiv #卫星 #多智能体 #Transformer #地球观测 #AI #机器学习 #自主系统
近日,一篇题为《HADT: A Heterogeneous Multi-Agent Differential Transformer for Autonomous Earth Observation Satellite Cluster》的论文在arXiv预印本平台发布。该研究由Mohamad A. Hady等学者提出,旨在解决地球观测卫星集群在自主任务规划中的协同决策难题。HADT模型采用异构多智能体架构,结合差分Transformer机制,使各卫星能够根据自身能力和环境动态调整策略,提升集群的整体观测效率与鲁棒性。这一工作为未来大规模卫星星座的自主运行提供了新的技术路径,有望在遥感、灾害监测等领域发挥重要作用。 #论文 #arXiv #卫星 #多智能体 #Transformer #地球观测 #AI #机器学习 #自主系统
BilliardPhys-Bench
多模态大语言模型(MLLMs)在视觉理解与语言生成上取得显著进展,但其对物理世界动态与因果推理的能力仍缺乏系统评估。为此,研究团队提出BilliardPhys-Bench基准,专门测试MLLMs在台球物理场景中的推理与视觉动态理解能力。该基准包含多种涉及碰撞、轨迹预测、动量守恒等物理现象的视觉问答任务,要求模型不仅能识别物体,还需理解隐含的物理规律。实验表明,当前主流MLLMs在该基准上表现远低于人类水平,尤其在复杂多步推理和反事实推断方面存在明显短板。该工作为评估MLLMs的物理常识提供了标准化工具,并指出未来改进方向。相关论文已提交arXiv,代码与数据将开源。 #多模态大模型 #物理推理 #基准测试 #AI #计算机视觉 #台球 #arXiv #机器学习
多模态大语言模型(MLLMs)在视觉理解与语言生成上取得显著进展,但其对物理世界动态与因果推理的能力仍缺乏系统评估。为此,研究团队提出BilliardPhys-Bench基准,专门测试MLLMs在台球物理场景中的推理与视觉动态理解能力。该基准包含多种涉及碰撞、轨迹预测、动量守恒等物理现象的视觉问答任务,要求模型不仅能识别物体,还需理解隐含的物理规律。实验表明,当前主流MLLMs在该基准上表现远低于人类水平,尤其在复杂多步推理和反事实推断方面存在明显短板。该工作为评估MLLMs的物理常识提供了标准化工具,并指出未来改进方向。相关论文已提交arXiv,代码与数据将开源。 #多模态大模型 #物理推理 #基准测试 #AI #计算机视觉 #台球 #arXiv #机器学习
UniScale:通过在线联合优化模型路由与测试时缩放实现自适应统一推理缩放
该论文提出了一种名为UniScale的自适应统一推理缩放框架,旨在通过在线联合优化模型路由和测试时缩放来提升大语言模型的推理效率与性能。传统方法通常单独处理模型选择或推理计算量分配,而UniScale将两者结合,在推理过程中动态调整模型路由策略和测试时计算预算,从而在保证输出质量的前提下降低计算成本。实验表明,该方法在多个基准测试上优于固定路由或固定缩放策略,实现了更优的精度-效率权衡。该研究为大规模模型的高效部署提供了新思路,尤其适用于资源受限或延迟敏感的应用场景。 #AI #机器学习 #大模型 #推理优化 #模型路由 #测试时缩放 #arXiv
该论文提出了一种名为UniScale的自适应统一推理缩放框架,旨在通过在线联合优化模型路由和测试时缩放来提升大语言模型的推理效率与性能。传统方法通常单独处理模型选择或推理计算量分配,而UniScale将两者结合,在推理过程中动态调整模型路由策略和测试时计算预算,从而在保证输出质量的前提下降低计算成本。实验表明,该方法在多个基准测试上优于固定路由或固定缩放策略,实现了更优的精度-效率权衡。该研究为大规模模型的高效部署提供了新思路,尤其适用于资源受限或延迟敏感的应用场景。 #AI #机器学习 #大模型 #推理优化 #模型路由 #测试时缩放 #arXiv
蒸馏大语言模型反馈用于Lean定理证明
一篇题为《Distilling LLM Feedback for Lean Theorem Proving》的论文近日在arXiv上发布。该研究由Gaetan Narozniak等五位作者完成,旨在探索如何利用大语言模型(LLM)的反馈来提升形式化定理证明的效率。传统定理证明依赖人工编写的策略或搜索算法,而LLM虽能生成证明步骤,但往往缺乏可靠性。论文提出一种蒸馏方法,将LLM对证明路径的评估反馈转化为可学习的信号,从而训练更高效的证明器。实验基于Lean证明助手,结果表明该方法能显著提高证明成功率,并减少搜索空间。这一工作为结合大模型与形式化验证提供了新思路,有望推动自动定理证明在数学和软件验证领域的实际应用。 #arXiv #论文 #LLM #定理证明 #Lean #AI #机器学习 #形式化验证
一篇题为《Distilling LLM Feedback for Lean Theorem Proving》的论文近日在arXiv上发布。该研究由Gaetan Narozniak等五位作者完成,旨在探索如何利用大语言模型(LLM)的反馈来提升形式化定理证明的效率。传统定理证明依赖人工编写的策略或搜索算法,而LLM虽能生成证明步骤,但往往缺乏可靠性。论文提出一种蒸馏方法,将LLM对证明路径的评估反馈转化为可学习的信号,从而训练更高效的证明器。实验基于Lean证明助手,结果表明该方法能显著提高证明成功率,并减少搜索空间。这一工作为结合大模型与形式化验证提供了新思路,有望推动自动定理证明在数学和软件验证领域的实际应用。 #arXiv #论文 #LLM #定理证明 #Lean #AI #机器学习 #形式化验证
以规划者为中心的深度研究强化学习与结构感知奖励
一篇题为《Planner-Centric Reinforcement Learning for Deep Research with Structure-Aware Reward》的学术论文在arXiv预印本平台发布。该论文由Mustafa Anis Hussain等研究者撰写,提出了一种以规划者为中心的强化学习框架,旨在提升深度研究任务中的智能体探索效率。传统强化学习方法在复杂、长时程的研究场景中常面临奖励稀疏和探索低效的问题,而该研究通过引入结构感知奖励机制,使智能体能够更好地理解任务的结构化特征,从而制定更合理的规划策略。论文详细阐述了方法的设计原理、实验设置及性能评估,展示了在多个基准任务上的显著改进。这一工作为强化学习在科学研究、自动化实验设计等领域的应用提供了新思路。 #arXiv #强化学习 #深度研究 #结构感知奖励 #AI #论文 #学术前沿
一篇题为《Planner-Centric Reinforcement Learning for Deep Research with Structure-Aware Reward》的学术论文在arXiv预印本平台发布。该论文由Mustafa Anis Hussain等研究者撰写,提出了一种以规划者为中心的强化学习框架,旨在提升深度研究任务中的智能体探索效率。传统强化学习方法在复杂、长时程的研究场景中常面临奖励稀疏和探索低效的问题,而该研究通过引入结构感知奖励机制,使智能体能够更好地理解任务的结构化特征,从而制定更合理的规划策略。论文详细阐述了方法的设计原理、实验设置及性能评估,展示了在多个基准任务上的显著改进。这一工作为强化学习在科学研究、自动化实验设计等领域的应用提供了新思路。 #arXiv #强化学习 #深度研究 #结构感知奖励 #AI #论文 #学术前沿
PReMISE
近日,一篇题为《PReMISE: Policy Rubrics as Measurement Specifications for LLM Judges》的论文在arXiv上发布。该研究由Swastik Roy等学者提出,旨在解决大语言模型(LLM)作为评判者时缺乏统一测量标准的问题。PReMISE方法通过定义明确的策略评分标准(Policy Rubrics),为LLM评判者提供可量化的测量规范,从而提升评估的准确性、一致性和可解释性。这一框架有望在AI安全、模型对齐、内容审核等领域发挥重要作用,为构建更可靠的自动评估系统提供新思路。 #AI #大模型 #LLM #论文 #arXiv #评测 #策略评分 #AI安全
近日,一篇题为《PReMISE: Policy Rubrics as Measurement Specifications for LLM Judges》的论文在arXiv上发布。该研究由Swastik Roy等学者提出,旨在解决大语言模型(LLM)作为评判者时缺乏统一测量标准的问题。PReMISE方法通过定义明确的策略评分标准(Policy Rubrics),为LLM评判者提供可量化的测量规范,从而提升评估的准确性、一致性和可解释性。这一框架有望在AI安全、模型对齐、内容审核等领域发挥重要作用,为构建更可靠的自动评估系统提供新思路。 #AI #大模型 #LLM #论文 #arXiv #评测 #策略评分 #AI安全
面向长期任务的智能体兼容上下文管理方法研究
近日,一篇题为《Learning Agent-Compatible Context Management for Long-Horizon Tasks》的论文在arXiv上发布。该研究由Lu Yi等作者共同完成,聚焦于智能体在长期任务中的上下文管理难题。传统方法在处理长时间跨度任务时,常因上下文信息冗余或遗漏导致性能下降。论文提出了一种学习智能体兼容上下文管理的方法,通过动态选择和组织与任务相关的上下文信息,使智能体更高效地利用历史交互。实验结果显示,该方法在多个长期任务基准上显著提升了智能体的决策质量和任务完成率,为构建更鲁棒的自主智能体系统提供了新思路。 #AI #智能体 #上下文管理 #长期任务 #机器学习 #arXiv #论文
近日,一篇题为《Learning Agent-Compatible Context Management for Long-Horizon Tasks》的论文在arXiv上发布。该研究由Lu Yi等作者共同完成,聚焦于智能体在长期任务中的上下文管理难题。传统方法在处理长时间跨度任务时,常因上下文信息冗余或遗漏导致性能下降。论文提出了一种学习智能体兼容上下文管理的方法,通过动态选择和组织与任务相关的上下文信息,使智能体更高效地利用历史交互。实验结果显示,该方法在多个长期任务基准上显著提升了智能体的决策质量和任务完成率,为构建更鲁棒的自主智能体系统提供了新思路。 #AI #智能体 #上下文管理 #长期任务 #机器学习 #arXiv #论文
MAVEN 研究提出新方法,提升智能体工具调用的泛化能力
一篇题为《MAVEN: Improving Generalization in Agentic Tool Calling》的学术论文近日在 arXiv 上发布。该研究由 Omkar Ghugarkar 等三位作者完成,旨在解决智能体在工具调用场景中的泛化问题。论文提出了一种名为 MAVEN 的新方法,通过改进模型对未见工具和复杂任务序列的适应能力,显著提升了智能体在动态环境中的表现。实验结果表明,该方法在多个基准测试中均优于现有方案,为构建更通用、更可靠的智能体系统提供了新思路。该研究于 2026 年 5 月 29 日提交,目前可通过 arXiv 获取全文。 #AI #智能体 #工具调用 #泛化 #机器学习 #学术论文 #arXiv
一篇题为《MAVEN: Improving Generalization in Agentic Tool Calling》的学术论文近日在 arXiv 上发布。该研究由 Omkar Ghugarkar 等三位作者完成,旨在解决智能体在工具调用场景中的泛化问题。论文提出了一种名为 MAVEN 的新方法,通过改进模型对未见工具和复杂任务序列的适应能力,显著提升了智能体在动态环境中的表现。实验结果表明,该方法在多个基准测试中均优于现有方案,为构建更通用、更可靠的智能体系统提供了新思路。该研究于 2026 年 5 月 29 日提交,目前可通过 arXiv 获取全文。 #AI #智能体 #工具调用 #泛化 #机器学习 #学术论文 #arXiv