新研究提出构建程序推理评估数据集的方法
据arXiv预印本,来自Sarah Elshabrawy等研究人员发表论文,探讨如何构建用于程序推理的评估数据集。研究指出,现有数据集在自然性、基础性(grounding)和多跳覆盖三个方面难以兼顾,往往偏向其中某一特性而牺牲其他。他们提出了一种新的构建框架,通过精心设计的采样和标注策略,在保持任务真实感的同时,确保每个样本具备充分的上下文基础,并覆盖多步推理链条。该工作旨在更准确地评估AI系统在复杂程序理解与执行中的表现,对自然语言处理、知识推理及大模型评测领域具有参考价值。 #AI #程序推理 #评估数据集 #自然语言处理 #arXiv #论文 #多跳推理 #大模型 #知识推理
据arXiv预印本,来自Sarah Elshabrawy等研究人员发表论文,探讨如何构建用于程序推理的评估数据集。研究指出,现有数据集在自然性、基础性(grounding)和多跳覆盖三个方面难以兼顾,往往偏向其中某一特性而牺牲其他。他们提出了一种新的构建框架,通过精心设计的采样和标注策略,在保持任务真实感的同时,确保每个样本具备充分的上下文基础,并覆盖多步推理链条。该工作旨在更准确地评估AI系统在复杂程序理解与执行中的表现,对自然语言处理、知识推理及大模型评测领域具有参考价值。 #AI #程序推理 #评估数据集 #自然语言处理 #arXiv #论文 #多跳推理 #大模型 #知识推理
AI 智能体跨尺度科学挑战评测基准发布
一项由 Tianyu Liu 等 32 位研究者共同完成的论文《Benchmarking AI Agents for Addressing Scientific Challenges Across Scales》在 arXiv 上发布。该研究提出了一个系统性的基准框架,用于评估人工智能智能体在不同科学尺度下解决复杂问题的能力,涵盖从微观分子到宏观生态的多层级科学挑战。研究者通过设计标准化测试任务,考察 AI 智能体在数据处理、模型构建、实验推理等方面的表现。该基准旨在为 AI 在科学发现中的实际应用提供客观评估工具,推动 AI 智能体在气候模拟、药物研发、材料科学等跨学科领域的落地。论文还探讨了当前 AI 在科学推理、因果推断等方面的局限性,为后续研究指出了优化方向。这一工作有望加速 AI 辅助科学研究的规范化进程。 #AI #科学 #基准测试 #智能体 #arXiv #跨学科 #论文
一项由 Tianyu Liu 等 32 位研究者共同完成的论文《Benchmarking AI Agents for Addressing Scientific Challenges Across Scales》在 arXiv 上发布。该研究提出了一个系统性的基准框架,用于评估人工智能智能体在不同科学尺度下解决复杂问题的能力,涵盖从微观分子到宏观生态的多层级科学挑战。研究者通过设计标准化测试任务,考察 AI 智能体在数据处理、模型构建、实验推理等方面的表现。该基准旨在为 AI 在科学发现中的实际应用提供客观评估工具,推动 AI 智能体在气候模拟、药物研发、材料科学等跨学科领域的落地。论文还探讨了当前 AI 在科学推理、因果推断等方面的局限性,为后续研究指出了优化方向。这一工作有望加速 AI 辅助科学研究的规范化进程。 #AI #科学 #基准测试 #智能体 #arXiv #跨学科 #论文
重新思考LLM的心理测量评估
一项来自arXiv预印本的研究挑战了大型语言模型(LLM)心理测量评估的传统方法。该论文题为《重新思考LLM的心理测量评估:自我报告何时及为何能预测行为》,由Rafal Kocielnik等8位作者撰写。研究指出,当前广泛使用的自我报告测试(如性格和态度问卷)在评估LLM时存在局限——模型可能模仿人类作答策略,而非反映真实内部状态。论文深入分析了自我报告在何种条件下能有效预测LLM的实际行为,并探讨了评估效度的关键因素。这一发现对AI安全和对齐研究具有重要参考价值,提示研究者需谨慎设计心理测量工具,避免过度依赖表面化的自我报告数据。 #LLM #人工智能 #心理测量 #AI安全 #arXiv #论文评述 #大模型研究
一项来自arXiv预印本的研究挑战了大型语言模型(LLM)心理测量评估的传统方法。该论文题为《重新思考LLM的心理测量评估:自我报告何时及为何能预测行为》,由Rafal Kocielnik等8位作者撰写。研究指出,当前广泛使用的自我报告测试(如性格和态度问卷)在评估LLM时存在局限——模型可能模仿人类作答策略,而非反映真实内部状态。论文深入分析了自我报告在何种条件下能有效预测LLM的实际行为,并探讨了评估效度的关键因素。这一发现对AI安全和对齐研究具有重要参考价值,提示研究者需谨慎设计心理测量工具,避免过度依赖表面化的自我报告数据。 #LLM #人工智能 #心理测量 #AI安全 #arXiv #论文评述 #大模型研究
心理理论效用
该论文由Nikolos Gurney和Stacy Marsella提交至arXiv,题为《心理理论效用:心理化机制的形式化规范》。研究旨在通过形式化方法,对“心理理论”(Theory of Mind)这一认知能力进行精确建模,即个体如何推断他人心理状态并指导自身行为。作者提出了一种基于效用的心理化机制规范,将心理理论视为一个效用最大化过程,从而为人工智能系统赋予更接近人类的社交推理能力。论文详细阐述了模型的定义、数学框架及其在交互场景中的应用潜力,有望推动人机协作、社会认知AI等领域的发展。该研究于2026年6月10日首次发布,目前处于arXiv预印本阶段,尚未注册DOI。 #心理理论 #认知科学 #人工智能 #形式化规范 #人机交互 #arXiv
该论文由Nikolos Gurney和Stacy Marsella提交至arXiv,题为《心理理论效用:心理化机制的形式化规范》。研究旨在通过形式化方法,对“心理理论”(Theory of Mind)这一认知能力进行精确建模,即个体如何推断他人心理状态并指导自身行为。作者提出了一种基于效用的心理化机制规范,将心理理论视为一个效用最大化过程,从而为人工智能系统赋予更接近人类的社交推理能力。论文详细阐述了模型的定义、数学框架及其在交互场景中的应用潜力,有望推动人机协作、社会认知AI等领域的发展。该研究于2026年6月10日首次发布,目前处于arXiv预印本阶段,尚未注册DOI。 #心理理论 #认知科学 #人工智能 #形式化规范 #人机交互 #arXiv
以部署为中心的评估
论文《Deployment-Centered Evaluation: Predicting Query-Level Rejection Risk in a Clinical LLM System》由Alyssa Unell等六位作者撰写,于2026年6月10日提交至arXiv预印本平台。该研究聚焦临床大型语言模型(LLM)在实际部署中面临的查询级拒绝问题,提出一种以部署为中心的评估方法,旨在精准预测系统何时会拒绝回答特定查询。通过分析模型行为与临床场景的匹配度,研究者尝试为医疗AI的安全性提供量化风险工具。论文全文已在arXiv开放获取,并附有PDF及TeX源码链接,涉及引用、代码、数据集等关联资源。该工作对提升临床AI系统的可靠性和可控性具有参考价值。 #临床LLM #AI安全 #风险评估 #arXiv #医疗AI #以部署为中心的评估 #查询级拒绝 #预印本
论文《Deployment-Centered Evaluation: Predicting Query-Level Rejection Risk in a Clinical LLM System》由Alyssa Unell等六位作者撰写,于2026年6月10日提交至arXiv预印本平台。该研究聚焦临床大型语言模型(LLM)在实际部署中面临的查询级拒绝问题,提出一种以部署为中心的评估方法,旨在精准预测系统何时会拒绝回答特定查询。通过分析模型行为与临床场景的匹配度,研究者尝试为医疗AI的安全性提供量化风险工具。论文全文已在arXiv开放获取,并附有PDF及TeX源码链接,涉及引用、代码、数据集等关联资源。该工作对提升临床AI系统的可靠性和可控性具有参考价值。 #临床LLM #AI安全 #风险评估 #arXiv #医疗AI #以部署为中心的评估 #查询级拒绝 #预印本
Pythagoras-Prover:基于增强型Lean形式化的高效形式化证明新方法
来自arXiv的一篇论文介绍了Pythagoras-Prover,这是一种通过增强型Lean形式化来推进高效形式化证明的新方法。该研究由Joshua Ong Jun Leang等八位作者共同完成,论文提交于2026年6月10日。Pythagoras-Prover旨在提升数学定理的形式化证明效率,通过改进Lean证明助手的自动化能力,使复杂数学推理过程更加简洁和可靠。该方法有望在数学、计算机科学及人工智能领域的形式化验证中发挥重要作用,为自动定理证明和程序验证提供更强大的工具支持。 #形式化证明 #Lean #PythagorasProver #数学定理 #自动化推理 #arXiv #计算机科学
来自arXiv的一篇论文介绍了Pythagoras-Prover,这是一种通过增强型Lean形式化来推进高效形式化证明的新方法。该研究由Joshua Ong Jun Leang等八位作者共同完成,论文提交于2026年6月10日。Pythagoras-Prover旨在提升数学定理的形式化证明效率,通过改进Lean证明助手的自动化能力,使复杂数学推理过程更加简洁和可靠。该方法有望在数学、计算机科学及人工智能领域的形式化验证中发挥重要作用,为自动定理证明和程序验证提供更强大的工具支持。 #形式化证明 #Lean #PythagorasProver #数学定理 #自动化推理 #arXiv #计算机科学
傅里叶变换与Volterra级数重新审视神经过程
来自arXiv预印本平台,一篇题为《Revisiting Neural Processes via Fourier Transform and Volterra Series》的论文由Peiman Mohseni等作者提交。该研究提出将傅里叶变换和Volterra级数理论引入神经过程分析,旨在为神经网络模型的泛化与可解释性提供新的数学框架。论文先后于2026年5月31日和6月11日更新,目前可通过PDF、HTML及TeX源码获取。研究团队来自多个机构,相关成果已引起学术社区关注,论文已被收录至arXiv相关领域浏览目录。该方法有望在机器学习和统计建模中产生应用价值。 #arXiv #论文 #神经过程 #傅里叶变换 #Volterra级数 #机器学习 #AI研究 #学术前沿
来自arXiv预印本平台,一篇题为《Revisiting Neural Processes via Fourier Transform and Volterra Series》的论文由Peiman Mohseni等作者提交。该研究提出将傅里叶变换和Volterra级数理论引入神经过程分析,旨在为神经网络模型的泛化与可解释性提供新的数学框架。论文先后于2026年5月31日和6月11日更新,目前可通过PDF、HTML及TeX源码获取。研究团队来自多个机构,相关成果已引起学术社区关注,论文已被收录至arXiv相关领域浏览目录。该方法有望在机器学习和统计建模中产生应用价值。 #arXiv #论文 #神经过程 #傅里叶变换 #Volterra级数 #机器学习 #AI研究 #学术前沿
最优时空解耦方法提升贝叶斯共形预测性能
近日,一篇题为《Optimal Spatio-Temporal Decoupling for Bayesian Conformal Prediction》的论文在arXiv上发布。该研究由Yu-Hsueh Fang和Chia-Yen Lee共同完成,提出了一种针对贝叶斯共形预测的最优时空解耦方法。共形预测是一种提供预测区间的不确定性量化技术,而贝叶斯方法可融入先验知识。作者通过理论推导和实验验证,展示了该方法在时空数据场景下如何有效解耦时间与空间依赖,从而提升预测区间的覆盖率和效率。该工作有望在气象、交通、环境监测等需要时空预测的领域得到应用,为不确定性量化提供更精确的工具。 #贝叶斯共形预测 #时空解耦 #不确定性量化 #机器学习 #arXiv #论文 #预测方法
近日,一篇题为《Optimal Spatio-Temporal Decoupling for Bayesian Conformal Prediction》的论文在arXiv上发布。该研究由Yu-Hsueh Fang和Chia-Yen Lee共同完成,提出了一种针对贝叶斯共形预测的最优时空解耦方法。共形预测是一种提供预测区间的不确定性量化技术,而贝叶斯方法可融入先验知识。作者通过理论推导和实验验证,展示了该方法在时空数据场景下如何有效解耦时间与空间依赖,从而提升预测区间的覆盖率和效率。该工作有望在气象、交通、环境监测等需要时空预测的领域得到应用,为不确定性量化提供更精确的工具。 #贝叶斯共形预测 #时空解耦 #不确定性量化 #机器学习 #arXiv #论文 #预测方法
人工智能分析中的人工监督分配研究
一篇题为《Allocating Human Oversight in AI-Enabled Analytics》的学术论文于2026年4月提交至arXiv预印本平台,并于同年6月更新。该论文由Zikun Ye等人撰写,聚焦于在基于人工智能的数据分析系统中如何合理分配人工监督资源。研究探讨了当AI模型自主执行分析任务时,如何在保证准确性与效率的前提下,确定需要人工介入的关键节点与频率。论文可能涉及人机协作的权衡、监督成本与风险控制,以及不同场景下的最优监督策略。这项工作对提升AI辅助决策的可靠性具有理论价值,尤其适用于金融、医疗等高风险领域。 #AI #人工监督 #数据分析 #人机协作 #arXiv #论文
一篇题为《Allocating Human Oversight in AI-Enabled Analytics》的学术论文于2026年4月提交至arXiv预印本平台,并于同年6月更新。该论文由Zikun Ye等人撰写,聚焦于在基于人工智能的数据分析系统中如何合理分配人工监督资源。研究探讨了当AI模型自主执行分析任务时,如何在保证准确性与效率的前提下,确定需要人工介入的关键节点与频率。论文可能涉及人机协作的权衡、监督成本与风险控制,以及不同场景下的最优监督策略。这项工作对提升AI辅助决策的可靠性具有理论价值,尤其适用于金融、医疗等高风险领域。 #AI #人工监督 #数据分析 #人机协作 #arXiv #论文