新研究提出主权企业语言模型的本体增强蒸馏与情境审计方法
一项发表于arXiv预印本的研究针对企业级主权语言模型提出了一种名为“本体增强蒸馏与情境审计”的组合机制。该工作采用机制证明与否定结果方法相结合的实验设计,旨在解决企业部署大型语言模型时的可解释性、安全性与合规性问题。研究者通过本体论增强知识蒸馏技术,提升模型对领域知识的理解,同时引入情境审计框架以评估模型输出中的上下文相关性及潜在偏差。初步实验揭示了该方法在特定任务中的有效性与局限性,为后续构建可信任的私有化企业语言模型提供了新的审计思路和实证支持。 #AI #大模型 #企业语言模型 #本体蒸馏 #情境审计 #预印本 #arXiv #人工智能 #安全审计
一项发表于arXiv预印本的研究针对企业级主权语言模型提出了一种名为“本体增强蒸馏与情境审计”的组合机制。该工作采用机制证明与否定结果方法相结合的实验设计,旨在解决企业部署大型语言模型时的可解释性、安全性与合规性问题。研究者通过本体论增强知识蒸馏技术,提升模型对领域知识的理解,同时引入情境审计框架以评估模型输出中的上下文相关性及潜在偏差。初步实验揭示了该方法在特定任务中的有效性与局限性,为后续构建可信任的私有化企业语言模型提供了新的审计思路和实证支持。 #AI #大模型 #企业语言模型 #本体蒸馏 #情境审计 #预印本 #arXiv #人工智能 #安全审计
Optimization Is Not All You Need
一篇题为《Optimization Is Not All You Need》的学术论文于2026年7月13日提交至arXiv预印本平台。该论文由Minh Hua和Rita Raley共同撰写,从标题即可看出对当前机器学习领域“优化至上”范式的直接挑战。论文认为,仅依靠优化算法无法解决所有复杂问题,需要更全面的方法论视角。目前该论文以PDF和HTML格式开放获取,并提供TeX源码,相关引用和工具链接也已上线。arXiv平台将该论文归类于计算机科学领域,并提供了多种文献管理工具。该论文的发布引发了学术界对优化局限性的重新思考。 #arXiv #学术论文 #优化 #机器学习 #AI #MinhHua
一篇题为《Optimization Is Not All You Need》的学术论文于2026年7月13日提交至arXiv预印本平台。该论文由Minh Hua和Rita Raley共同撰写,从标题即可看出对当前机器学习领域“优化至上”范式的直接挑战。论文认为,仅依靠优化算法无法解决所有复杂问题,需要更全面的方法论视角。目前该论文以PDF和HTML格式开放获取,并提供TeX源码,相关引用和工具链接也已上线。arXiv平台将该论文归类于计算机科学领域,并提供了多种文献管理工具。该论文的发布引发了学术界对优化局限性的重新思考。 #arXiv #学术论文 #优化 #机器学习 #AI #MinhHua
LP2Graph 线性规划挖掘技术助力铁路调度优化
近日,arXiv 上发布了一篇题为《LP Mining with LP2Graph: A Use Case for Railway Rescheduling》的研究论文。该研究由 Jörn Maurischat 等人完成,提出了一种名为 LP2Graph 的方法,用于从线性规划(LP)模型中提取结构知识,并将其应用于铁路时刻表重新调度场景。线性规划是运筹学中解决资源分配问题的核心工具,但在铁路调度这类动态环境中,传统 LP 模型的可解释性和重用性有限。LP2Graph 通过将 LP 模型转化为图结构,挖掘其中的关键模式,从而辅助调度系统更快地应对延误、故障等突发情况。该研究展示了图分析在交通运输优化中的新应用潜力,也为 AI 辅助决策提供了新的思路。 #arXiv #论文 #线性规划 #铁路调度 #LP2Graph #运筹学 #AI #交通运输
近日,arXiv 上发布了一篇题为《LP Mining with LP2Graph: A Use Case for Railway Rescheduling》的研究论文。该研究由 Jörn Maurischat 等人完成,提出了一种名为 LP2Graph 的方法,用于从线性规划(LP)模型中提取结构知识,并将其应用于铁路时刻表重新调度场景。线性规划是运筹学中解决资源分配问题的核心工具,但在铁路调度这类动态环境中,传统 LP 模型的可解释性和重用性有限。LP2Graph 通过将 LP 模型转化为图结构,挖掘其中的关键模式,从而辅助调度系统更快地应对延误、故障等突发情况。该研究展示了图分析在交通运输优化中的新应用潜力,也为 AI 辅助决策提供了新的思路。 #arXiv #论文 #线性规划 #铁路调度 #LP2Graph #运筹学 #AI #交通运输
面向AI网页代理的网站设计框架
一项新研究提出了一种专门为AI网页代理设计的网站架构框架。随着大语言模型驱动的智能代理在网页自动化任务中广泛应用,现有网站往往缺乏对机器读取和交互的优化,导致代理执行效率低下。该框架从机器可读性、可操作性和决策可靠性三个维度出发,定义了网站应如何结构化自身内容、表单与链接,以便AI代理能够高效解析、执行操作并做出可靠决策。研究人员指出,当前互联网生态亟需从“人类中心”转向“人机共读”,该框架为开发者提供了具体的设计指南,有望显著提升网页自动化、数据抓取和智能服务的效率。相关论文已提交至arXiv预印本平台,作者来自学术界与企业界。 #AI #网页代理 #网站设计 #机器可读性 #自动化 #大语言模型 #人机交互 #学术论文 #框架
一项新研究提出了一种专门为AI网页代理设计的网站架构框架。随着大语言模型驱动的智能代理在网页自动化任务中广泛应用,现有网站往往缺乏对机器读取和交互的优化,导致代理执行效率低下。该框架从机器可读性、可操作性和决策可靠性三个维度出发,定义了网站应如何结构化自身内容、表单与链接,以便AI代理能够高效解析、执行操作并做出可靠决策。研究人员指出,当前互联网生态亟需从“人类中心”转向“人机共读”,该框架为开发者提供了具体的设计指南,有望显著提升网页自动化、数据抓取和智能服务的效率。相关论文已提交至arXiv预印本平台,作者来自学术界与企业界。 #AI #网页代理 #网站设计 #机器可读性 #自动化 #大语言模型 #人机交互 #学术论文 #框架
通过游戏回放重建分区实现关卡随时间表示与生成
一篇由Emily Halina和Matthew Guzdial共同撰写的论文《Representing and Generating Levels Over Time through Playtrace Reconstructive Partitioning》在arXiv上发表。该研究提出一种基于玩家游戏回放数据(playtrace)来重建并分区游戏关卡的方法,能够捕获关卡在不同时间点的状态变化,进而生成随时间演变的关卡。这一方法为程序化内容生成和动态游戏设计提供了新思路,有望提升游戏的可玩性与自适应能力。论文已开放预印本,并附带相关代码和数据链接。 #游戏AI #程序化内容生成 #关卡设计 #机器学习 #学术论文 #arXiv
一篇由Emily Halina和Matthew Guzdial共同撰写的论文《Representing and Generating Levels Over Time through Playtrace Reconstructive Partitioning》在arXiv上发表。该研究提出一种基于玩家游戏回放数据(playtrace)来重建并分区游戏关卡的方法,能够捕获关卡在不同时间点的状态变化,进而生成随时间演变的关卡。这一方法为程序化内容生成和动态游戏设计提供了新思路,有望提升游戏的可玩性与自适应能力。论文已开放预印本,并附带相关代码和数据链接。 #游戏AI #程序化内容生成 #关卡设计 #机器学习 #学术论文 #arXiv
地理空间基础模型新范式
一篇题为《The Emerging Paradigm of Geospatial Foundation Models: From Pre-Training to Agentic Reasoning》的学术论文近期在arXiv上发布。该论文由Shelley Cazares撰写,将发表在《Lecture Notes in Computer Science》第16446卷(2026年)。论文系统梳理了地理空间基础模型的最新进展,指出该领域正从传统的预训练模式向具有智能推理能力的Agent范式转变。研究分析了当前模型在遥感影像理解、地理空间知识融合及动态决策等方面的瓶颈,并提出下一代地理空间基础模型应具备自主感知、推理与行动的能力。该工作为构建更智能的地理空间AI系统提供了理论框架和实践方向。 #地理空间AI #基础模型 #预训练 #智能推理 #地理信息科学 #AI研究 #arXiv论文
一篇题为《The Emerging Paradigm of Geospatial Foundation Models: From Pre-Training to Agentic Reasoning》的学术论文近期在arXiv上发布。该论文由Shelley Cazares撰写,将发表在《Lecture Notes in Computer Science》第16446卷(2026年)。论文系统梳理了地理空间基础模型的最新进展,指出该领域正从传统的预训练模式向具有智能推理能力的Agent范式转变。研究分析了当前模型在遥感影像理解、地理空间知识融合及动态决策等方面的瓶颈,并提出下一代地理空间基础模型应具备自主感知、推理与行动的能力。该工作为构建更智能的地理空间AI系统提供了理论框架和实践方向。 #地理空间AI #基础模型 #预训练 #智能推理 #地理信息科学 #AI研究 #arXiv论文
因果图与随机微分方程:新论文引入马尔可夫性质与do
一篇题为《随机微分方程的因果图、马尔可夫性质与do-演算》的学术论文于2026年7月13日提交至arXiv预印本平台。该论文由Philip Boeken等人撰写,旨在将因果推断中的图模型方法(如有向无环图)拓展至随机微分方程(SDE)领域。研究重点在于建立SDE下的因果图表示、验证马尔可夫性质,并推导适用于连续时间随机过程的do-演算规则。这项工作为分析动态系统中的因果效应提供了新的理论工具,有望推动计量经济学、流行病学及机器学习等领域对时序因果模型的深入应用。论文目前以PDF形式开放访问,并提供了TeX源码及相关参考文献链接。 #因果推断 #随机微分方程 #do-演算 #马尔可夫性质 #arXiv #学术论文 #因果图
一篇题为《随机微分方程的因果图、马尔可夫性质与do-演算》的学术论文于2026年7月13日提交至arXiv预印本平台。该论文由Philip Boeken等人撰写,旨在将因果推断中的图模型方法(如有向无环图)拓展至随机微分方程(SDE)领域。研究重点在于建立SDE下的因果图表示、验证马尔可夫性质,并推导适用于连续时间随机过程的do-演算规则。这项工作为分析动态系统中的因果效应提供了新的理论工具,有望推动计量经济学、流行病学及机器学习等领域对时序因果模型的深入应用。论文目前以PDF形式开放访问,并提供了TeX源码及相关参考文献链接。 #因果推断 #随机微分方程 #do-演算 #马尔可夫性质 #arXiv #学术论文 #因果图
Ivan Bercovich 提交论文《Good Benchmarks》至 arXiv
一篇题为《Good Benchmarks》的学术论文日前在预印本平台 arXiv 上线。该论文由研究者 Ivan Bercovich 单独撰写,于 2026 年 7 月 13 日提交。目前页面仅显示了论文的元数据、作者信息及各类学术工具链接,尚未公开完整的摘要或全文内容。从标题推断,论文可能聚焦于机器学习或人工智能领域基准测试的设计原则与评估方法,探讨如何构建或选择更有效的基准来推动算法进步。由于预印本的性质,该研究尚待同行评审,但其上线已引起特定学术社区的关注,相关引用与讨论或将陆续展开。 #学术论文 #arXiv #基准测试 #机器学习 #预印本
一篇题为《Good Benchmarks》的学术论文日前在预印本平台 arXiv 上线。该论文由研究者 Ivan Bercovich 单独撰写,于 2026 年 7 月 13 日提交。目前页面仅显示了论文的元数据、作者信息及各类学术工具链接,尚未公开完整的摘要或全文内容。从标题推断,论文可能聚焦于机器学习或人工智能领域基准测试的设计原则与评估方法,探讨如何构建或选择更有效的基准来推动算法进步。由于预印本的性质,该研究尚待同行评审,但其上线已引起特定学术社区的关注,相关引用与讨论或将陆续展开。 #学术论文 #arXiv #基准测试 #机器学习 #预印本
重新思考智能体工具演变评估
一篇来自arXiv的学术论文《Rethinking the Evaluation of Harness Evolution for Agents》由Yike Wang等10位作者共同撰写,于2026年7月14日提交。该研究聚焦于智能体(Agent)领域中“工具演变”(Harness Evolution)的评估方法问题。随着大型语言模型驱动的智能体越来越多地依赖外部工具(如API、代码执行环境等),如何科学地评估智能体在工具使用过程中的进化能力成为关键挑战。论文对现有评估框架进行了批判性审视,提出了新的评估思路,旨在更准确地衡量智能体在动态环境中的适应性与进化表现。目前该论文已通过arXiv预印本发布,提供PDF和HTML版本供学术社区查阅。 #机器学习 #智能体 #大模型 #评估方法 #学术论文 #arXiv #AI研究 #工具使用
一篇来自arXiv的学术论文《Rethinking the Evaluation of Harness Evolution for Agents》由Yike Wang等10位作者共同撰写,于2026年7月14日提交。该研究聚焦于智能体(Agent)领域中“工具演变”(Harness Evolution)的评估方法问题。随着大型语言模型驱动的智能体越来越多地依赖外部工具(如API、代码执行环境等),如何科学地评估智能体在工具使用过程中的进化能力成为关键挑战。论文对现有评估框架进行了批判性审视,提出了新的评估思路,旨在更准确地衡量智能体在动态环境中的适应性与进化表现。目前该论文已通过arXiv预印本发布,提供PDF和HTML版本供学术社区查阅。 #机器学习 #智能体 #大模型 #评估方法 #学术论文 #arXiv #AI研究 #工具使用
4B参数设备端深度研究
一篇题为《On-Device Deep Research at 4B: Exposure Bounds Faithfulness, Retrieval Bounds Coverage》的研究论文在arXiv上发布。该研究聚焦于在资源受限的设备端部署仅有4B参数的小型模型,进行深度研究任务。论文提出两个关键理论界限:模型暴露程度(即输出信息的详细程度)决定了回答的忠实性,而检索能力则限制了答案的覆盖范围。这一发现为在手机、边缘设备上运行可靠且全面的AI深度研究代理提供了理论基础,意味着未来设备端AI可在不依赖云端的情况下,做到既精准又全面。 #人工智能 #大模型 #边缘计算 #设备端AI #arXiv #深度学习 #研究前沿
一篇题为《On-Device Deep Research at 4B: Exposure Bounds Faithfulness, Retrieval Bounds Coverage》的研究论文在arXiv上发布。该研究聚焦于在资源受限的设备端部署仅有4B参数的小型模型,进行深度研究任务。论文提出两个关键理论界限:模型暴露程度(即输出信息的详细程度)决定了回答的忠实性,而检索能力则限制了答案的覆盖范围。这一发现为在手机、边缘设备上运行可靠且全面的AI深度研究代理提供了理论基础,意味着未来设备端AI可在不依赖云端的情况下,做到既精准又全面。 #人工智能 #大模型 #边缘计算 #设备端AI #arXiv #深度学习 #研究前沿
可移除缺陷
近日,一篇题为《可移除缺陷:故意缺陷的经济学与限度》的学术论文在 arXiv 预印本平台发布。该研究由学者 Cheng Qian 完成,探讨了在产品或系统中故意保留缺陷背后的经济逻辑与理论边界。论文从跨学科视角出发,结合经济学、计算机科学和统计学,分析了制造商或开发者为何会主动选择不修复某些可被轻易移除的缺陷,以及这种行为在市场竞争、成本效益和用户行为中的内在机制。研究同时揭示了故意缺陷策略的局限性,指出过度依赖此模式可能导致系统脆弱性或信任危机。该论文已提供 PDF 及 HTML 格式全文访问,并开放 BibTeX 引用。这一工作为理解现实世界中“不完美设计”的合理性提供了新的分析框架,对软件工程、工业生产和决策理论具有潜在参考价值。 #经济学 #缺陷 #科研 #论文 #arXiv #计算机科学 #统计学
近日,一篇题为《可移除缺陷:故意缺陷的经济学与限度》的学术论文在 arXiv 预印本平台发布。该研究由学者 Cheng Qian 完成,探讨了在产品或系统中故意保留缺陷背后的经济逻辑与理论边界。论文从跨学科视角出发,结合经济学、计算机科学和统计学,分析了制造商或开发者为何会主动选择不修复某些可被轻易移除的缺陷,以及这种行为在市场竞争、成本效益和用户行为中的内在机制。研究同时揭示了故意缺陷策略的局限性,指出过度依赖此模式可能导致系统脆弱性或信任危机。该论文已提供 PDF 及 HTML 格式全文访问,并开放 BibTeX 引用。这一工作为理解现实世界中“不完美设计”的合理性提供了新的分析框架,对软件工程、工业生产和决策理论具有潜在参考价值。 #经济学 #缺陷 #科研 #论文 #arXiv #计算机科学 #统计学
LLM Agent 基准测试需要多少任务才算足够?重放分析揭示关键结论
一篇由 Wei-Jung Huang 提交至 arXiv 的预印本研究,通过重放分析公开的 LLM Agent 基准测试,探讨了在评估 Agent 性能时所需的最小任务数量。研究发现,当前许多基准测试存在任务冗余或不足的问题,导致评估结果不稳定。研究者通过对多个公共基准进行多次重放实验,确定了任务数量与决策可靠性之间的阈值关系,并提出一套量化建议,以提升 Agent 评测的可重现性和公平性。该工作为未来构建更科学、高效的 Agent 基准提供了方法论指导。 #LLM #Agent #基准测试 #重放分析 #AI #科研 #arXiv #评估方法
一篇由 Wei-Jung Huang 提交至 arXiv 的预印本研究,通过重放分析公开的 LLM Agent 基准测试,探讨了在评估 Agent 性能时所需的最小任务数量。研究发现,当前许多基准测试存在任务冗余或不足的问题,导致评估结果不稳定。研究者通过对多个公共基准进行多次重放实验,确定了任务数量与决策可靠性之间的阈值关系,并提出一套量化建议,以提升 Agent 评测的可重现性和公平性。该工作为未来构建更科学、高效的 Agent 基准提供了方法论指导。 #LLM #Agent #基准测试 #重放分析 #AI #科研 #arXiv #评估方法