通过游戏回放重建分区实现关卡随时间表示与生成
一篇由Emily Halina和Matthew Guzdial共同撰写的论文《Representing and Generating Levels Over Time through Playtrace Reconstructive Partitioning》在arXiv上发表。该研究提出一种基于玩家游戏回放数据(playtrace)来重建并分区游戏关卡的方法,能够捕获关卡在不同时间点的状态变化,进而生成随时间演变的关卡。这一方法为程序化内容生成和动态游戏设计提供了新思路,有望提升游戏的可玩性与自适应能力。论文已开放预印本,并附带相关代码和数据链接。 #游戏AI #程序化内容生成 #关卡设计 #机器学习 #学术论文 #arXiv
一篇由Emily Halina和Matthew Guzdial共同撰写的论文《Representing and Generating Levels Over Time through Playtrace Reconstructive Partitioning》在arXiv上发表。该研究提出一种基于玩家游戏回放数据(playtrace)来重建并分区游戏关卡的方法,能够捕获关卡在不同时间点的状态变化,进而生成随时间演变的关卡。这一方法为程序化内容生成和动态游戏设计提供了新思路,有望提升游戏的可玩性与自适应能力。论文已开放预印本,并附带相关代码和数据链接。 #游戏AI #程序化内容生成 #关卡设计 #机器学习 #学术论文 #arXiv
地理空间基础模型新范式
一篇题为《The Emerging Paradigm of Geospatial Foundation Models: From Pre-Training to Agentic Reasoning》的学术论文近期在arXiv上发布。该论文由Shelley Cazares撰写,将发表在《Lecture Notes in Computer Science》第16446卷(2026年)。论文系统梳理了地理空间基础模型的最新进展,指出该领域正从传统的预训练模式向具有智能推理能力的Agent范式转变。研究分析了当前模型在遥感影像理解、地理空间知识融合及动态决策等方面的瓶颈,并提出下一代地理空间基础模型应具备自主感知、推理与行动的能力。该工作为构建更智能的地理空间AI系统提供了理论框架和实践方向。 #地理空间AI #基础模型 #预训练 #智能推理 #地理信息科学 #AI研究 #arXiv论文
一篇题为《The Emerging Paradigm of Geospatial Foundation Models: From Pre-Training to Agentic Reasoning》的学术论文近期在arXiv上发布。该论文由Shelley Cazares撰写,将发表在《Lecture Notes in Computer Science》第16446卷(2026年)。论文系统梳理了地理空间基础模型的最新进展,指出该领域正从传统的预训练模式向具有智能推理能力的Agent范式转变。研究分析了当前模型在遥感影像理解、地理空间知识融合及动态决策等方面的瓶颈,并提出下一代地理空间基础模型应具备自主感知、推理与行动的能力。该工作为构建更智能的地理空间AI系统提供了理论框架和实践方向。 #地理空间AI #基础模型 #预训练 #智能推理 #地理信息科学 #AI研究 #arXiv论文
因果图与随机微分方程:新论文引入马尔可夫性质与do
一篇题为《随机微分方程的因果图、马尔可夫性质与do-演算》的学术论文于2026年7月13日提交至arXiv预印本平台。该论文由Philip Boeken等人撰写,旨在将因果推断中的图模型方法(如有向无环图)拓展至随机微分方程(SDE)领域。研究重点在于建立SDE下的因果图表示、验证马尔可夫性质,并推导适用于连续时间随机过程的do-演算规则。这项工作为分析动态系统中的因果效应提供了新的理论工具,有望推动计量经济学、流行病学及机器学习等领域对时序因果模型的深入应用。论文目前以PDF形式开放访问,并提供了TeX源码及相关参考文献链接。 #因果推断 #随机微分方程 #do-演算 #马尔可夫性质 #arXiv #学术论文 #因果图
一篇题为《随机微分方程的因果图、马尔可夫性质与do-演算》的学术论文于2026年7月13日提交至arXiv预印本平台。该论文由Philip Boeken等人撰写,旨在将因果推断中的图模型方法(如有向无环图)拓展至随机微分方程(SDE)领域。研究重点在于建立SDE下的因果图表示、验证马尔可夫性质,并推导适用于连续时间随机过程的do-演算规则。这项工作为分析动态系统中的因果效应提供了新的理论工具,有望推动计量经济学、流行病学及机器学习等领域对时序因果模型的深入应用。论文目前以PDF形式开放访问,并提供了TeX源码及相关参考文献链接。 #因果推断 #随机微分方程 #do-演算 #马尔可夫性质 #arXiv #学术论文 #因果图
Ivan Bercovich 提交论文《Good Benchmarks》至 arXiv
一篇题为《Good Benchmarks》的学术论文日前在预印本平台 arXiv 上线。该论文由研究者 Ivan Bercovich 单独撰写,于 2026 年 7 月 13 日提交。目前页面仅显示了论文的元数据、作者信息及各类学术工具链接,尚未公开完整的摘要或全文内容。从标题推断,论文可能聚焦于机器学习或人工智能领域基准测试的设计原则与评估方法,探讨如何构建或选择更有效的基准来推动算法进步。由于预印本的性质,该研究尚待同行评审,但其上线已引起特定学术社区的关注,相关引用与讨论或将陆续展开。 #学术论文 #arXiv #基准测试 #机器学习 #预印本
一篇题为《Good Benchmarks》的学术论文日前在预印本平台 arXiv 上线。该论文由研究者 Ivan Bercovich 单独撰写,于 2026 年 7 月 13 日提交。目前页面仅显示了论文的元数据、作者信息及各类学术工具链接,尚未公开完整的摘要或全文内容。从标题推断,论文可能聚焦于机器学习或人工智能领域基准测试的设计原则与评估方法,探讨如何构建或选择更有效的基准来推动算法进步。由于预印本的性质,该研究尚待同行评审,但其上线已引起特定学术社区的关注,相关引用与讨论或将陆续展开。 #学术论文 #arXiv #基准测试 #机器学习 #预印本
重新思考智能体工具演变评估
一篇来自arXiv的学术论文《Rethinking the Evaluation of Harness Evolution for Agents》由Yike Wang等10位作者共同撰写,于2026年7月14日提交。该研究聚焦于智能体(Agent)领域中“工具演变”(Harness Evolution)的评估方法问题。随着大型语言模型驱动的智能体越来越多地依赖外部工具(如API、代码执行环境等),如何科学地评估智能体在工具使用过程中的进化能力成为关键挑战。论文对现有评估框架进行了批判性审视,提出了新的评估思路,旨在更准确地衡量智能体在动态环境中的适应性与进化表现。目前该论文已通过arXiv预印本发布,提供PDF和HTML版本供学术社区查阅。 #机器学习 #智能体 #大模型 #评估方法 #学术论文 #arXiv #AI研究 #工具使用
一篇来自arXiv的学术论文《Rethinking the Evaluation of Harness Evolution for Agents》由Yike Wang等10位作者共同撰写,于2026年7月14日提交。该研究聚焦于智能体(Agent)领域中“工具演变”(Harness Evolution)的评估方法问题。随着大型语言模型驱动的智能体越来越多地依赖外部工具(如API、代码执行环境等),如何科学地评估智能体在工具使用过程中的进化能力成为关键挑战。论文对现有评估框架进行了批判性审视,提出了新的评估思路,旨在更准确地衡量智能体在动态环境中的适应性与进化表现。目前该论文已通过arXiv预印本发布,提供PDF和HTML版本供学术社区查阅。 #机器学习 #智能体 #大模型 #评估方法 #学术论文 #arXiv #AI研究 #工具使用
4B参数设备端深度研究
一篇题为《On-Device Deep Research at 4B: Exposure Bounds Faithfulness, Retrieval Bounds Coverage》的研究论文在arXiv上发布。该研究聚焦于在资源受限的设备端部署仅有4B参数的小型模型,进行深度研究任务。论文提出两个关键理论界限:模型暴露程度(即输出信息的详细程度)决定了回答的忠实性,而检索能力则限制了答案的覆盖范围。这一发现为在手机、边缘设备上运行可靠且全面的AI深度研究代理提供了理论基础,意味着未来设备端AI可在不依赖云端的情况下,做到既精准又全面。 #人工智能 #大模型 #边缘计算 #设备端AI #arXiv #深度学习 #研究前沿
一篇题为《On-Device Deep Research at 4B: Exposure Bounds Faithfulness, Retrieval Bounds Coverage》的研究论文在arXiv上发布。该研究聚焦于在资源受限的设备端部署仅有4B参数的小型模型,进行深度研究任务。论文提出两个关键理论界限:模型暴露程度(即输出信息的详细程度)决定了回答的忠实性,而检索能力则限制了答案的覆盖范围。这一发现为在手机、边缘设备上运行可靠且全面的AI深度研究代理提供了理论基础,意味着未来设备端AI可在不依赖云端的情况下,做到既精准又全面。 #人工智能 #大模型 #边缘计算 #设备端AI #arXiv #深度学习 #研究前沿
可移除缺陷
近日,一篇题为《可移除缺陷:故意缺陷的经济学与限度》的学术论文在 arXiv 预印本平台发布。该研究由学者 Cheng Qian 完成,探讨了在产品或系统中故意保留缺陷背后的经济逻辑与理论边界。论文从跨学科视角出发,结合经济学、计算机科学和统计学,分析了制造商或开发者为何会主动选择不修复某些可被轻易移除的缺陷,以及这种行为在市场竞争、成本效益和用户行为中的内在机制。研究同时揭示了故意缺陷策略的局限性,指出过度依赖此模式可能导致系统脆弱性或信任危机。该论文已提供 PDF 及 HTML 格式全文访问,并开放 BibTeX 引用。这一工作为理解现实世界中“不完美设计”的合理性提供了新的分析框架,对软件工程、工业生产和决策理论具有潜在参考价值。 #经济学 #缺陷 #科研 #论文 #arXiv #计算机科学 #统计学
近日,一篇题为《可移除缺陷:故意缺陷的经济学与限度》的学术论文在 arXiv 预印本平台发布。该研究由学者 Cheng Qian 完成,探讨了在产品或系统中故意保留缺陷背后的经济逻辑与理论边界。论文从跨学科视角出发,结合经济学、计算机科学和统计学,分析了制造商或开发者为何会主动选择不修复某些可被轻易移除的缺陷,以及这种行为在市场竞争、成本效益和用户行为中的内在机制。研究同时揭示了故意缺陷策略的局限性,指出过度依赖此模式可能导致系统脆弱性或信任危机。该论文已提供 PDF 及 HTML 格式全文访问,并开放 BibTeX 引用。这一工作为理解现实世界中“不完美设计”的合理性提供了新的分析框架,对软件工程、工业生产和决策理论具有潜在参考价值。 #经济学 #缺陷 #科研 #论文 #arXiv #计算机科学 #统计学
LLM Agent 基准测试需要多少任务才算足够?重放分析揭示关键结论
一篇由 Wei-Jung Huang 提交至 arXiv 的预印本研究,通过重放分析公开的 LLM Agent 基准测试,探讨了在评估 Agent 性能时所需的最小任务数量。研究发现,当前许多基准测试存在任务冗余或不足的问题,导致评估结果不稳定。研究者通过对多个公共基准进行多次重放实验,确定了任务数量与决策可靠性之间的阈值关系,并提出一套量化建议,以提升 Agent 评测的可重现性和公平性。该工作为未来构建更科学、高效的 Agent 基准提供了方法论指导。 #LLM #Agent #基准测试 #重放分析 #AI #科研 #arXiv #评估方法
一篇由 Wei-Jung Huang 提交至 arXiv 的预印本研究,通过重放分析公开的 LLM Agent 基准测试,探讨了在评估 Agent 性能时所需的最小任务数量。研究发现,当前许多基准测试存在任务冗余或不足的问题,导致评估结果不稳定。研究者通过对多个公共基准进行多次重放实验,确定了任务数量与决策可靠性之间的阈值关系,并提出一套量化建议,以提升 Agent 评测的可重现性和公平性。该工作为未来构建更科学、高效的 Agent 基准提供了方法论指导。 #LLM #Agent #基准测试 #重放分析 #AI #科研 #arXiv #评估方法
PM-Bench
来自 arXiv 的最新论文显示,研究人员提出了一套名为 PM-Bench 的基准测试,专门用于评估大语言模型(LLM)代理的前瞻性记忆能力。所谓前瞻性记忆,是指代理在执行任务时记住在未来特定时机执行预定操作的能力。该基准涵盖多种需要延迟响应的场景,如定时提醒、条件触发等,以检验模型对复杂时间逻辑和异步任务的处理水平。通过对多个主流模型的测试,PM-Bench 揭示了当前 LLM 在主动记忆与动态规划上的短板,并为后续优化提供了量化评价工具。该研究由 Genglin Liu 等人主导,论文已在 arXiv 预印本平台公开。 #LLM #AI代理 #前瞻性记忆 #基准测试 #人工智能 #论文 #arXiv
来自 arXiv 的最新论文显示,研究人员提出了一套名为 PM-Bench 的基准测试,专门用于评估大语言模型(LLM)代理的前瞻性记忆能力。所谓前瞻性记忆,是指代理在执行任务时记住在未来特定时机执行预定操作的能力。该基准涵盖多种需要延迟响应的场景,如定时提醒、条件触发等,以检验模型对复杂时间逻辑和异步任务的处理水平。通过对多个主流模型的测试,PM-Bench 揭示了当前 LLM 在主动记忆与动态规划上的短板,并为后续优化提供了量化评价工具。该研究由 Genglin Liu 等人主导,论文已在 arXiv 预印本平台公开。 #LLM #AI代理 #前瞻性记忆 #基准测试 #人工智能 #论文 #arXiv
集成控制流滤波用于隐式数据同化
近日,Zhuoyuan Li 等人在 arXiv 上发表了一篇题为《Ensemble Controlled-Flow Filtering for Implicit Data Assimilation》的论文。该研究提出了一种新颖的集成控制流滤波方法,旨在解决隐式数据同化中的关键难题。数据同化广泛应用于气象、海洋、地球物理等领域,用于将观测数据与模型预测相结合以提高预报精度。传统滤波方法在处理高维非线性系统时面临计算复杂性和隐式约束的挑战。新方法通过引入控制流机制,在集成框架下实现了对隐式数据同化过程的有效滤波,有望提升同化效率与准确性。论文提交于2026年7月,目前可通过arXiv获取全文,并提供了HTML、TeX源码等多种阅读方式。该工作为数据同化领域提供了新的理论工具,对数值天气预报、气候模拟等应用具有潜在价值。 #数据同化 #滤波 #集成方法 #机器学习 #arXiv #论文 #隐式模型 #控制流 #科学计算
近日,Zhuoyuan Li 等人在 arXiv 上发表了一篇题为《Ensemble Controlled-Flow Filtering for Implicit Data Assimilation》的论文。该研究提出了一种新颖的集成控制流滤波方法,旨在解决隐式数据同化中的关键难题。数据同化广泛应用于气象、海洋、地球物理等领域,用于将观测数据与模型预测相结合以提高预报精度。传统滤波方法在处理高维非线性系统时面临计算复杂性和隐式约束的挑战。新方法通过引入控制流机制,在集成框架下实现了对隐式数据同化过程的有效滤波,有望提升同化效率与准确性。论文提交于2026年7月,目前可通过arXiv获取全文,并提供了HTML、TeX源码等多种阅读方式。该工作为数据同化领域提供了新的理论工具,对数值天气预报、气候模拟等应用具有潜在价值。 #数据同化 #滤波 #集成方法 #机器学习 #arXiv #论文 #隐式模型 #控制流 #科学计算
加速随机哈密顿蒙特卡洛方法的混合时间研究
arXiv上公开了一篇题为《加速随机哈密顿蒙特卡洛方法的混合时间》的研究论文,由Siddharth Mitra等四位学者合作完成。该论文聚焦于随机哈密顿蒙特卡洛(RHMC)采样算法的理论性能,提出了在特定条件下可显著缩短其混合时间的新结果。混合时间是衡量马尔可夫链蒙特卡洛方法收敛速度的关键指标,更快的混合意味着在复杂概率分布上更高效的采样,对统计计算和机器学习领域具有重要意义。论文通过理论分析证明了所提出的加速策略的有效性,并给出了相应的数学保证。该研究于2026年7月14日提交至arXiv。 #随机哈密顿蒙特卡洛 #混合时间 #采样算法 #机器学习 #统计计算 #学术论文 #arXiv
arXiv上公开了一篇题为《加速随机哈密顿蒙特卡洛方法的混合时间》的研究论文,由Siddharth Mitra等四位学者合作完成。该论文聚焦于随机哈密顿蒙特卡洛(RHMC)采样算法的理论性能,提出了在特定条件下可显著缩短其混合时间的新结果。混合时间是衡量马尔可夫链蒙特卡洛方法收敛速度的关键指标,更快的混合意味着在复杂概率分布上更高效的采样,对统计计算和机器学习领域具有重要意义。论文通过理论分析证明了所提出的加速策略的有效性,并给出了相应的数学保证。该研究于2026年7月14日提交至arXiv。 #随机哈密顿蒙特卡洛 #混合时间 #采样算法 #机器学习 #统计计算 #学术论文 #arXiv
ANGLE
一篇由Rajdeep Pathak等作者提交至arXiv的论文提出了一种名为ANGLE(Angular Neural Generative Learning via Engression)的新型生成学习方法。该方法利用角度距离与Engression技术,在神经生成模型中引入角度度量,旨在提升高维数据分布的学习与采样效率。与传统生成对抗网络或变分自编码器不同,ANGLE通过角度约束优化生成过程,有望在图像生成、数据增强等任务中展现更稳定的训练与更好的样本质量。该研究目前处于预印本阶段,尚未正式发表。 #机器学习 #生成模型 #神经网络 #角度距离 #Engression #arXiv #AI #深度学习
一篇由Rajdeep Pathak等作者提交至arXiv的论文提出了一种名为ANGLE(Angular Neural Generative Learning via Engression)的新型生成学习方法。该方法利用角度距离与Engression技术,在神经生成模型中引入角度度量,旨在提升高维数据分布的学习与采样效率。与传统生成对抗网络或变分自编码器不同,ANGLE通过角度约束优化生成过程,有望在图像生成、数据增强等任务中展现更稳定的训练与更好的样本质量。该研究目前处于预印本阶段,尚未正式发表。 #机器学习 #生成模型 #神经网络 #角度距离 #Engression #arXiv #AI #深度学习
Thompson Sampling 被证明具有 2 倍最优竞争比
来自 arXiv 的一篇最新论文揭示了 Thompson Sampling 算法在错误次数上的理论保证。该研究由 Mark Sellke 等人完成,证明了 Thompson Sampling 在对抗性环境下具有 2 倍最优竞争比(即 2-competitive),这意味着该算法犯错误的最坏情况不会超过最优策略的两倍。这项成果为贝叶斯方法在在线学习中的稳健性提供了重要理论支撑,有助于进一步理解 Thompson Sampling 在实际应用中的性能边界。论文已在 arXiv 预印本平台公开。 #学术论文 #机器学习 #在线学习 #算法 #ThompsonSampling
来自 arXiv 的一篇最新论文揭示了 Thompson Sampling 算法在错误次数上的理论保证。该研究由 Mark Sellke 等人完成,证明了 Thompson Sampling 在对抗性环境下具有 2 倍最优竞争比(即 2-competitive),这意味着该算法犯错误的最坏情况不会超过最优策略的两倍。这项成果为贝叶斯方法在在线学习中的稳健性提供了重要理论支撑,有助于进一步理解 Thompson Sampling 在实际应用中的性能边界。论文已在 arXiv 预印本平台公开。 #学术论文 #机器学习 #在线学习 #算法 #ThompsonSampling
用异常事件证伪因果图
近日,一篇预印本论文《Falsifying Causal Graphs With Outlier Events》在arXiv平台公开。研究由William Roy Orchard等人完成,于2026年7月13日提交。该论文提出了一种利用异常事件来验证或反驳因果图结构的新方法。传统因果推断往往依赖常规数据分布,而本文创新性地引入罕见但信息量大的异常事件作为“自然实验”,通过分析这些事件对因果链条的冲击,更严格地检验预设因果模型的有效性。实验表明,该方法能够有效识别出低概率情况下因果边界的错误,弥补了基于频率统计的不足。这一工作为因果发现与验证提供了新的视角,有望在流行病学、经济学、机器学习可解释性等领域得到应用。 #因果推断 #异常事件 #因果图 #机器学习 #arXiv #论文 #方法创新
近日,一篇预印本论文《Falsifying Causal Graphs With Outlier Events》在arXiv平台公开。研究由William Roy Orchard等人完成,于2026年7月13日提交。该论文提出了一种利用异常事件来验证或反驳因果图结构的新方法。传统因果推断往往依赖常规数据分布,而本文创新性地引入罕见但信息量大的异常事件作为“自然实验”,通过分析这些事件对因果链条的冲击,更严格地检验预设因果模型的有效性。实验表明,该方法能够有效识别出低概率情况下因果边界的错误,弥补了基于频率统计的不足。这一工作为因果发现与验证提供了新的视角,有望在流行病学、经济学、机器学习可解释性等领域得到应用。 #因果推断 #异常事件 #因果图 #机器学习 #arXiv #论文 #方法创新