世界模型与物理AI教程
一篇题为《世界模型与物理AI教程》的论文由作者Il-Seok Oh提交至arXiv预印本平台。该教程系统介绍了世界模型(World Models)在物理人工智能(Physical AI)领域中的基础理论与应用方法。世界模型作为AI系统理解环境动态的核心技术,通过构建内部表征实现预测与规划,而物理AI则强调机器人在真实物理世界中的感知、决策与行动能力。该教程涵盖了世界模型的构建、强化学习整合、仿真环境交互等关键议题,为研究人员和开发者提供了从理论到实践的指导。论文提交于2026年6月,目前可通过arXiv获取全文。 #世界模型 #物理AI #人工智能 #教程 #arXiv #论文 #机器学习 #机器人
一篇题为《世界模型与物理AI教程》的论文由作者Il-Seok Oh提交至arXiv预印本平台。该教程系统介绍了世界模型(World Models)在物理人工智能(Physical AI)领域中的基础理论与应用方法。世界模型作为AI系统理解环境动态的核心技术,通过构建内部表征实现预测与规划,而物理AI则强调机器人在真实物理世界中的感知、决策与行动能力。该教程涵盖了世界模型的构建、强化学习整合、仿真环境交互等关键议题,为研究人员和开发者提供了从理论到实践的指导。论文提交于2026年6月,目前可通过arXiv获取全文。 #世界模型 #物理AI #人工智能 #教程 #arXiv #论文 #机器学习 #机器人
新研究提出构建程序推理评估数据集的方法
据arXiv预印本,来自Sarah Elshabrawy等研究人员发表论文,探讨如何构建用于程序推理的评估数据集。研究指出,现有数据集在自然性、基础性(grounding)和多跳覆盖三个方面难以兼顾,往往偏向其中某一特性而牺牲其他。他们提出了一种新的构建框架,通过精心设计的采样和标注策略,在保持任务真实感的同时,确保每个样本具备充分的上下文基础,并覆盖多步推理链条。该工作旨在更准确地评估AI系统在复杂程序理解与执行中的表现,对自然语言处理、知识推理及大模型评测领域具有参考价值。 #AI #程序推理 #评估数据集 #自然语言处理 #arXiv #论文 #多跳推理 #大模型 #知识推理
据arXiv预印本,来自Sarah Elshabrawy等研究人员发表论文,探讨如何构建用于程序推理的评估数据集。研究指出,现有数据集在自然性、基础性(grounding)和多跳覆盖三个方面难以兼顾,往往偏向其中某一特性而牺牲其他。他们提出了一种新的构建框架,通过精心设计的采样和标注策略,在保持任务真实感的同时,确保每个样本具备充分的上下文基础,并覆盖多步推理链条。该工作旨在更准确地评估AI系统在复杂程序理解与执行中的表现,对自然语言处理、知识推理及大模型评测领域具有参考价值。 #AI #程序推理 #评估数据集 #自然语言处理 #arXiv #论文 #多跳推理 #大模型 #知识推理
AI 智能体跨尺度科学挑战评测基准发布
一项由 Tianyu Liu 等 32 位研究者共同完成的论文《Benchmarking AI Agents for Addressing Scientific Challenges Across Scales》在 arXiv 上发布。该研究提出了一个系统性的基准框架,用于评估人工智能智能体在不同科学尺度下解决复杂问题的能力,涵盖从微观分子到宏观生态的多层级科学挑战。研究者通过设计标准化测试任务,考察 AI 智能体在数据处理、模型构建、实验推理等方面的表现。该基准旨在为 AI 在科学发现中的实际应用提供客观评估工具,推动 AI 智能体在气候模拟、药物研发、材料科学等跨学科领域的落地。论文还探讨了当前 AI 在科学推理、因果推断等方面的局限性,为后续研究指出了优化方向。这一工作有望加速 AI 辅助科学研究的规范化进程。 #AI #科学 #基准测试 #智能体 #arXiv #跨学科 #论文
一项由 Tianyu Liu 等 32 位研究者共同完成的论文《Benchmarking AI Agents for Addressing Scientific Challenges Across Scales》在 arXiv 上发布。该研究提出了一个系统性的基准框架,用于评估人工智能智能体在不同科学尺度下解决复杂问题的能力,涵盖从微观分子到宏观生态的多层级科学挑战。研究者通过设计标准化测试任务,考察 AI 智能体在数据处理、模型构建、实验推理等方面的表现。该基准旨在为 AI 在科学发现中的实际应用提供客观评估工具,推动 AI 智能体在气候模拟、药物研发、材料科学等跨学科领域的落地。论文还探讨了当前 AI 在科学推理、因果推断等方面的局限性,为后续研究指出了优化方向。这一工作有望加速 AI 辅助科学研究的规范化进程。 #AI #科学 #基准测试 #智能体 #arXiv #跨学科 #论文
重新思考LLM的心理测量评估
一项来自arXiv预印本的研究挑战了大型语言模型(LLM)心理测量评估的传统方法。该论文题为《重新思考LLM的心理测量评估:自我报告何时及为何能预测行为》,由Rafal Kocielnik等8位作者撰写。研究指出,当前广泛使用的自我报告测试(如性格和态度问卷)在评估LLM时存在局限——模型可能模仿人类作答策略,而非反映真实内部状态。论文深入分析了自我报告在何种条件下能有效预测LLM的实际行为,并探讨了评估效度的关键因素。这一发现对AI安全和对齐研究具有重要参考价值,提示研究者需谨慎设计心理测量工具,避免过度依赖表面化的自我报告数据。 #LLM #人工智能 #心理测量 #AI安全 #arXiv #论文评述 #大模型研究
一项来自arXiv预印本的研究挑战了大型语言模型(LLM)心理测量评估的传统方法。该论文题为《重新思考LLM的心理测量评估:自我报告何时及为何能预测行为》,由Rafal Kocielnik等8位作者撰写。研究指出,当前广泛使用的自我报告测试(如性格和态度问卷)在评估LLM时存在局限——模型可能模仿人类作答策略,而非反映真实内部状态。论文深入分析了自我报告在何种条件下能有效预测LLM的实际行为,并探讨了评估效度的关键因素。这一发现对AI安全和对齐研究具有重要参考价值,提示研究者需谨慎设计心理测量工具,避免过度依赖表面化的自我报告数据。 #LLM #人工智能 #心理测量 #AI安全 #arXiv #论文评述 #大模型研究
心理理论效用
该论文由Nikolos Gurney和Stacy Marsella提交至arXiv,题为《心理理论效用:心理化机制的形式化规范》。研究旨在通过形式化方法,对“心理理论”(Theory of Mind)这一认知能力进行精确建模,即个体如何推断他人心理状态并指导自身行为。作者提出了一种基于效用的心理化机制规范,将心理理论视为一个效用最大化过程,从而为人工智能系统赋予更接近人类的社交推理能力。论文详细阐述了模型的定义、数学框架及其在交互场景中的应用潜力,有望推动人机协作、社会认知AI等领域的发展。该研究于2026年6月10日首次发布,目前处于arXiv预印本阶段,尚未注册DOI。 #心理理论 #认知科学 #人工智能 #形式化规范 #人机交互 #arXiv
该论文由Nikolos Gurney和Stacy Marsella提交至arXiv,题为《心理理论效用:心理化机制的形式化规范》。研究旨在通过形式化方法,对“心理理论”(Theory of Mind)这一认知能力进行精确建模,即个体如何推断他人心理状态并指导自身行为。作者提出了一种基于效用的心理化机制规范,将心理理论视为一个效用最大化过程,从而为人工智能系统赋予更接近人类的社交推理能力。论文详细阐述了模型的定义、数学框架及其在交互场景中的应用潜力,有望推动人机协作、社会认知AI等领域的发展。该研究于2026年6月10日首次发布,目前处于arXiv预印本阶段,尚未注册DOI。 #心理理论 #认知科学 #人工智能 #形式化规范 #人机交互 #arXiv
以部署为中心的评估
论文《Deployment-Centered Evaluation: Predicting Query-Level Rejection Risk in a Clinical LLM System》由Alyssa Unell等六位作者撰写,于2026年6月10日提交至arXiv预印本平台。该研究聚焦临床大型语言模型(LLM)在实际部署中面临的查询级拒绝问题,提出一种以部署为中心的评估方法,旨在精准预测系统何时会拒绝回答特定查询。通过分析模型行为与临床场景的匹配度,研究者尝试为医疗AI的安全性提供量化风险工具。论文全文已在arXiv开放获取,并附有PDF及TeX源码链接,涉及引用、代码、数据集等关联资源。该工作对提升临床AI系统的可靠性和可控性具有参考价值。 #临床LLM #AI安全 #风险评估 #arXiv #医疗AI #以部署为中心的评估 #查询级拒绝 #预印本
论文《Deployment-Centered Evaluation: Predicting Query-Level Rejection Risk in a Clinical LLM System》由Alyssa Unell等六位作者撰写,于2026年6月10日提交至arXiv预印本平台。该研究聚焦临床大型语言模型(LLM)在实际部署中面临的查询级拒绝问题,提出一种以部署为中心的评估方法,旨在精准预测系统何时会拒绝回答特定查询。通过分析模型行为与临床场景的匹配度,研究者尝试为医疗AI的安全性提供量化风险工具。论文全文已在arXiv开放获取,并附有PDF及TeX源码链接,涉及引用、代码、数据集等关联资源。该工作对提升临床AI系统的可靠性和可控性具有参考价值。 #临床LLM #AI安全 #风险评估 #arXiv #医疗AI #以部署为中心的评估 #查询级拒绝 #预印本
Pythagoras-Prover:基于增强型Lean形式化的高效形式化证明新方法
来自arXiv的一篇论文介绍了Pythagoras-Prover,这是一种通过增强型Lean形式化来推进高效形式化证明的新方法。该研究由Joshua Ong Jun Leang等八位作者共同完成,论文提交于2026年6月10日。Pythagoras-Prover旨在提升数学定理的形式化证明效率,通过改进Lean证明助手的自动化能力,使复杂数学推理过程更加简洁和可靠。该方法有望在数学、计算机科学及人工智能领域的形式化验证中发挥重要作用,为自动定理证明和程序验证提供更强大的工具支持。 #形式化证明 #Lean #PythagorasProver #数学定理 #自动化推理 #arXiv #计算机科学
来自arXiv的一篇论文介绍了Pythagoras-Prover,这是一种通过增强型Lean形式化来推进高效形式化证明的新方法。该研究由Joshua Ong Jun Leang等八位作者共同完成,论文提交于2026年6月10日。Pythagoras-Prover旨在提升数学定理的形式化证明效率,通过改进Lean证明助手的自动化能力,使复杂数学推理过程更加简洁和可靠。该方法有望在数学、计算机科学及人工智能领域的形式化验证中发挥重要作用,为自动定理证明和程序验证提供更强大的工具支持。 #形式化证明 #Lean #PythagorasProver #数学定理 #自动化推理 #arXiv #计算机科学
傅里叶变换与Volterra级数重新审视神经过程
来自arXiv预印本平台,一篇题为《Revisiting Neural Processes via Fourier Transform and Volterra Series》的论文由Peiman Mohseni等作者提交。该研究提出将傅里叶变换和Volterra级数理论引入神经过程分析,旨在为神经网络模型的泛化与可解释性提供新的数学框架。论文先后于2026年5月31日和6月11日更新,目前可通过PDF、HTML及TeX源码获取。研究团队来自多个机构,相关成果已引起学术社区关注,论文已被收录至arXiv相关领域浏览目录。该方法有望在机器学习和统计建模中产生应用价值。 #arXiv #论文 #神经过程 #傅里叶变换 #Volterra级数 #机器学习 #AI研究 #学术前沿
来自arXiv预印本平台,一篇题为《Revisiting Neural Processes via Fourier Transform and Volterra Series》的论文由Peiman Mohseni等作者提交。该研究提出将傅里叶变换和Volterra级数理论引入神经过程分析,旨在为神经网络模型的泛化与可解释性提供新的数学框架。论文先后于2026年5月31日和6月11日更新,目前可通过PDF、HTML及TeX源码获取。研究团队来自多个机构,相关成果已引起学术社区关注,论文已被收录至arXiv相关领域浏览目录。该方法有望在机器学习和统计建模中产生应用价值。 #arXiv #论文 #神经过程 #傅里叶变换 #Volterra级数 #机器学习 #AI研究 #学术前沿