新论文提出LLM评估新标准:固定预算与集群感知结合多跳RAG压力测试
2026年5月27日,研究人员Camilo Chacón Sartori和José H. García在学术平台arXiv上发布了一篇研究论文,提出了一种针对大语言模型(LLM)评估的创新标准。该标准名为“固定预算、集群感知的LLM-as-a-Judge评估”,旨在解决现有评估方法中可能存在的公平性和效率问题。论文通过引入固定预算限制来控制评估成本,并利用集群感知技术优化模型在不同数据分组上的表现分析。作者还设计了多跳RAG压力测试,对标准进行了严格验证,以检验其在复杂、多步骤推理任务中的鲁棒性。这项研究为AI模型评估领域提供了新的基准框架,可能推动未来LLM开发的优化,并促进评估方法在学术界和工业界的更广泛应用。 #LLM #AI #评估标准 #RAG #压力测试 #学术论文 #大语言模型 #机器学习 #研究发布 #技术前沿
2026年5月27日,研究人员Camilo Chacón Sartori和José H. García在学术平台arXiv上发布了一篇研究论文,提出了一种针对大语言模型(LLM)评估的创新标准。该标准名为“固定预算、集群感知的LLM-as-a-Judge评估”,旨在解决现有评估方法中可能存在的公平性和效率问题。论文通过引入固定预算限制来控制评估成本,并利用集群感知技术优化模型在不同数据分组上的表现分析。作者还设计了多跳RAG压力测试,对标准进行了严格验证,以检验其在复杂、多步骤推理任务中的鲁棒性。这项研究为AI模型评估领域提供了新的基准框架,可能推动未来LLM开发的优化,并促进评估方法在学术界和工业界的更广泛应用。 #LLM #AI #评估标准 #RAG #压力测试 #学术论文 #大语言模型 #机器学习 #研究发布 #技术前沿
Kenny Daniel 提交“代理查询引擎”论文至学术平台 arXiv
2026年5月27日,研究人员 Kenny Daniel 在知名学术预印本服务器 arXiv 上提交了一篇题为《A Query Engine for the Agents》的论文。该论文聚焦于为代理系统设计一个高效的查询引擎,旨在优化代理与数据源的交互及处理能力,属于人工智能或计算机科学领域的技术研究。论文文件大小为15KB,目前可通过PDF、HTML及TeX源码等多种格式访问,表明其内容已进入初步传播阶段。作为学术社区的重要平台,arXiv 通过 arXivLabs 实验项目支持研究者协作开发新功能,推动开放科学实践。此论文的发布可能为代理技术、数据查询系统等领域提供新的工具和方法,促进相关研究的进一步发展。 #arXiv #论文 #代理系统 #查询引擎 #AI #学术研究 #科技新闻 #计算机科学
2026年5月27日,研究人员 Kenny Daniel 在知名学术预印本服务器 arXiv 上提交了一篇题为《A Query Engine for the Agents》的论文。该论文聚焦于为代理系统设计一个高效的查询引擎,旨在优化代理与数据源的交互及处理能力,属于人工智能或计算机科学领域的技术研究。论文文件大小为15KB,目前可通过PDF、HTML及TeX源码等多种格式访问,表明其内容已进入初步传播阶段。作为学术社区的重要平台,arXiv 通过 arXivLabs 实验项目支持研究者协作开发新功能,推动开放科学实践。此论文的发布可能为代理技术、数据查询系统等领域提供新的工具和方法,促进相关研究的进一步发展。 #arXiv #论文 #代理系统 #查询引擎 #AI #学术研究 #科技新闻 #计算机科学
新论文提出可审计决策模型,集成学习式弃权与实时转向能力
近日,一篇题为“具有学习式弃权和实时转向的可审计决策模型”的学术论文在arXiv平台正式发布。该研究由Sankaranarayanan Palamadai Chandrasekaran等人提出,于2026年5月26日提交。论文聚焦于人工智能决策系统的透明度和可控性,创新性地引入学习式弃权机制,使模型在面临不确定性时能够主动弃权以提升可靠性,并结合实时转向功能,允许在运行中动态调整决策策略。这一方法旨在增强AI模型的可审计性,为其在医疗诊断、自动驾驶等高风险领域的应用提供更安全的基础。论文提供了PDF下载和实验性HTML版本,供学术界参考与验证。该成果有望推动可解释AI和负责任人工智能的发展,为未来智能系统的设计开辟新路径。 #人工智能 #机器学习 #决策模型 #学术研究 #arXiv #AI安全 #可解释AI
近日,一篇题为“具有学习式弃权和实时转向的可审计决策模型”的学术论文在arXiv平台正式发布。该研究由Sankaranarayanan Palamadai Chandrasekaran等人提出,于2026年5月26日提交。论文聚焦于人工智能决策系统的透明度和可控性,创新性地引入学习式弃权机制,使模型在面临不确定性时能够主动弃权以提升可靠性,并结合实时转向功能,允许在运行中动态调整决策策略。这一方法旨在增强AI模型的可审计性,为其在医疗诊断、自动驾驶等高风险领域的应用提供更安全的基础。论文提供了PDF下载和实验性HTML版本,供学术界参考与验证。该成果有望推动可解释AI和负责任人工智能的发展,为未来智能系统的设计开辟新路径。 #人工智能 #机器学习 #决策模型 #学术研究 #arXiv #AI安全 #可解释AI
新研究提出SkillGrad方法,借鉴梯度下降优化智能体技能
一篇题为《SkillGrad: Optimizing Agent Skills Like Gradient Descent》的学术论文近日在预印本平台arXiv发布。该研究由Hanyu Wang等人提出,其核心思想是将梯度下降这一经典优化算法,创新性地应用于智能体技能的学习与优化过程。这种方法旨在为智能体提供一种系统化的技能改进框架,使其能够像神经网络调整参数一样,更高效地习得和提升复杂技能。 该研究的主要意义在于,它为强化学习及多智能体系统中的技能学习问题提供了一个新的理论视角和潜在的高效优化路径,有望推动智能体在复杂环境中的自适应能力与发展。 #人工智能 #智能体 #机器学习 #学术论文 #技术研究 #SkillGrad #优化方法 #多智能体
一篇题为《SkillGrad: Optimizing Agent Skills Like Gradient Descent》的学术论文近日在预印本平台arXiv发布。该研究由Hanyu Wang等人提出,其核心思想是将梯度下降这一经典优化算法,创新性地应用于智能体技能的学习与优化过程。这种方法旨在为智能体提供一种系统化的技能改进框架,使其能够像神经网络调整参数一样,更高效地习得和提升复杂技能。 该研究的主要意义在于,它为强化学习及多智能体系统中的技能学习问题提供了一个新的理论视角和潜在的高效优化路径,有望推动智能体在复杂环境中的自适应能力与发展。 #人工智能 #智能体 #机器学习 #学术论文 #技术研究 #SkillGrad #优化方法 #多智能体
MiniMax全球企业和开发者客户突破百万,ARR收入近两月翻番
5月28日,生成式人工智能公司MiniMax披露最新业务数据,宣布其服务的全球企业和开发者客户数量正式突破100万,全球用户基数约3亿。这一进展表明B端企业客户群较半年前增长五倍,公司商业化引擎已全面进入垂直加速阶段。当前,全球大模型行业正从技术涌现转向商业落地,MiniMax的核心数据激增,不仅证明了其M2系列模型在企业级应用中的高适应性和技术粘性,也反映了全球开发者对高性价比、高稳定性AI基础设施的蓬勃需求。作为中国人工智能公司,MiniMax致力于通用人工智能探索,其商业化路径的成功为大模型行业如何从技术投资走向高质量商业变现提供了具有参考价值的行业模型。 #MiniMax #人工智能 #大模型 #商业 #科技新闻 #AI #生成式AI #客户增长
5月28日,生成式人工智能公司MiniMax披露最新业务数据,宣布其服务的全球企业和开发者客户数量正式突破100万,全球用户基数约3亿。这一进展表明B端企业客户群较半年前增长五倍,公司商业化引擎已全面进入垂直加速阶段。当前,全球大模型行业正从技术涌现转向商业落地,MiniMax的核心数据激增,不仅证明了其M2系列模型在企业级应用中的高适应性和技术粘性,也反映了全球开发者对高性价比、高稳定性AI基础设施的蓬勃需求。作为中国人工智能公司,MiniMax致力于通用人工智能探索,其商业化路径的成功为大模型行业如何从技术投资走向高质量商业变现提供了具有参考价值的行业模型。 #MiniMax #人工智能 #大模型 #商业 #科技新闻 #AI #生成式AI #客户增长
教皇发布通谕反思人工智能,强调人类有限性与尊严
梵蒂冈近日发布由教皇利奥十四世签署的250页通谕《光辉的人性》(Magnifica Humanitas),这是首份正式探讨人工智能的官方天主教文件。通谕的核心并非仅仅警示AI的风险,而是旨在捍卫人性,反对那些对人类共同本质感到厌倦的观点,并警告社会不要将人类的能力——如理性、创造力、同情心——轻易外包给计算机。教皇提出一个关键洞见:人类的许多美好正源于其有限性而非无限性,这种接纳自身脆弱、苦难与失败的状态,是认识自我与他人尊严的基础。 这份文件延续了基督教批判炫目技术的传统,类比工业革命带来生产力提升的同时也催生了新的剥削形式。在硅谷部分声音质疑人类价值的当下,通谕明确反对将人类的有限性视为缺陷。文中虽未点名,但回应了像彼得·蒂尔等科技投资者所倾向的、将道德等决策完全交由超级智能AI的观点。通谕认为,正是人类的局限激发了同情与反思,并赋予伟大艺术以美感,这是机器生成的文学所缺乏的。该文件是对当前技术发展潮流的一次重要人文主义介入。 #人工智能 #梵蒂冈 #教宗通谕 #科技伦理 #人文主义 #宗教与科技 #AI争议 #新闻
梵蒂冈近日发布由教皇利奥十四世签署的250页通谕《光辉的人性》(Magnifica Humanitas),这是首份正式探讨人工智能的官方天主教文件。通谕的核心并非仅仅警示AI的风险,而是旨在捍卫人性,反对那些对人类共同本质感到厌倦的观点,并警告社会不要将人类的能力——如理性、创造力、同情心——轻易外包给计算机。教皇提出一个关键洞见:人类的许多美好正源于其有限性而非无限性,这种接纳自身脆弱、苦难与失败的状态,是认识自我与他人尊严的基础。 这份文件延续了基督教批判炫目技术的传统,类比工业革命带来生产力提升的同时也催生了新的剥削形式。在硅谷部分声音质疑人类价值的当下,通谕明确反对将人类的有限性视为缺陷。文中虽未点名,但回应了像彼得·蒂尔等科技投资者所倾向的、将道德等决策完全交由超级智能AI的观点。通谕认为,正是人类的局限激发了同情与反思,并赋予伟大艺术以美感,这是机器生成的文学所缺乏的。该文件是对当前技术发展潮流的一次重要人文主义介入。 #人工智能 #梵蒂冈 #教宗通谕 #科技伦理 #人文主义 #宗教与科技 #AI争议 #新闻
前谷歌、苹果研究员创立Trajectory,构建AI持续学习平台
一群曾任职于谷歌DeepMind、苹果、OpenAI及Meta超级智能实验室的AI研究人员宣布成立新创公司Trajectory,旨在构建一个能让AI通过真实用户交互持续学习的平台。目前,即使是最先进的AI模型在完成训练后也会停止进化,无法从错误中实时学习,而持续学习能力被业界公认为实现更强大AI的关键障碍。图灵奖得主Richard Sutton等人亦强调其重要性。 Trajectory已完成由Conviction领投的1500万美元种子轮融资,估值达1.15亿美元,投资方还包括谷歌DeepMind首席科学家Jeff Dean及斯坦福教授李飞飞等知名人士。公司联合创始人及CEO Ronak Malde指出,一些领先的AI编程产品已通过利用用户交互数据进行后训练和持续改进取得了成功,Trajectory希望将这一模式应用于编程之外的更广泛领域。不过,他也承认将此逻辑应用于其他行业存在挑战,因为不同领域对于“成功”的定义可能更模糊,而公司的平台旨在帮助企业针对其特定需求优化AI模型。
一群曾任职于谷歌DeepMind、苹果、OpenAI及Meta超级智能实验室的AI研究人员宣布成立新创公司Trajectory,旨在构建一个能让AI通过真实用户交互持续学习的平台。目前,即使是最先进的AI模型在完成训练后也会停止进化,无法从错误中实时学习,而持续学习能力被业界公认为实现更强大AI的关键障碍。图灵奖得主Richard Sutton等人亦强调其重要性。 Trajectory已完成由Conviction领投的1500万美元种子轮融资,估值达1.15亿美元,投资方还包括谷歌DeepMind首席科学家Jeff Dean及斯坦福教授李飞飞等知名人士。公司联合创始人及CEO Ronak Malde指出,一些领先的AI编程产品已通过利用用户交互数据进行后训练和持续改进取得了成功,Trajectory希望将这一模式应用于编程之外的更广泛领域。不过,他也承认将此逻辑应用于其他行业存在挑战,因为不同领域对于“成功”的定义可能更模糊,而公司的平台旨在帮助企业针对其特定需求优化AI模型。
研究揭示LLM置信度校准中协议敏感性的重要性
近日,一篇题为《仅有询问是不够的:LLM置信度校准中的协议敏感性》的学术论文在arXiv平台发布。该研究由Hankyeol Kim和Pilsung Kang于2026年5月提交,探讨了在评估大型语言模型置信度时,评估协议的敏感性如何显著影响校准结果。研究指出,传统上仅通过直接询问来校准LLM置信度的方法存在局限性,因为协议的细微变化可能导致模型输出可靠性的评估出现偏差。这一发现强调了在AI模型评估中需要更精细地设计协议,以提高校准的准确性和稳健性。该研究为大语言模型的开发和评估提供了新的理论视角,可能推动相关领域制定更标准化的评估流程,从而增强AI系统在实际应用中的安全性和可靠性。 #AI #大模型 #LLM #置信度校准 #学术研究 #arXiv #计算机科学 #人工智能 #机器学习
近日,一篇题为《仅有询问是不够的:LLM置信度校准中的协议敏感性》的学术论文在arXiv平台发布。该研究由Hankyeol Kim和Pilsung Kang于2026年5月提交,探讨了在评估大型语言模型置信度时,评估协议的敏感性如何显著影响校准结果。研究指出,传统上仅通过直接询问来校准LLM置信度的方法存在局限性,因为协议的细微变化可能导致模型输出可靠性的评估出现偏差。这一发现强调了在AI模型评估中需要更精细地设计协议,以提高校准的准确性和稳健性。该研究为大语言模型的开发和评估提供了新的理论视角,可能推动相关领域制定更标准化的评估流程,从而增强AI系统在实际应用中的安全性和可靠性。 #AI #大模型 #LLM #置信度校准 #学术研究 #arXiv #计算机科学 #人工智能 #机器学习
新研究提出前缀安全贝叶斯信念跟踪,优化大语言模型推理可靠性
近日,研究人员Zhenghan Song及其团队在学术平台arXiv上提交了一项新研究,提出了“前缀安全贝叶斯信念跟踪”方法,旨在解决大语言模型在推理过程中的可靠性问题。该方法专注于分离模型的校准与排名,通过贝叶斯统计框架动态跟踪推理中的信念更新,以减少预测错误和提升一致性。背景在于当前大语言模型虽在生成文本方面表现突出,但在复杂推理任务中常面临校准不准或排名偏差的挑战。该研究的进展可能为人工智能领域的模型优化提供新路径,有助于增强LLM在实际应用中的可信度和实用性。 #AI #大语言模型 #机器学习 #推理可靠性 #贝叶斯方法 #科技新闻 #学术研究 #arXiv
近日,研究人员Zhenghan Song及其团队在学术平台arXiv上提交了一项新研究,提出了“前缀安全贝叶斯信念跟踪”方法,旨在解决大语言模型在推理过程中的可靠性问题。该方法专注于分离模型的校准与排名,通过贝叶斯统计框架动态跟踪推理中的信念更新,以减少预测错误和提升一致性。背景在于当前大语言模型虽在生成文本方面表现突出,但在复杂推理任务中常面临校准不准或排名偏差的挑战。该研究的进展可能为人工智能领域的模型优化提供新路径,有助于增强LLM在实际应用中的可信度和实用性。 #AI #大语言模型 #机器学习 #推理可靠性 #贝叶斯方法 #科技新闻 #学术研究 #arXiv
针对资源受限智能体语言模型提出分层提示控制新方法
一篇题为《Hierarchical Prompt-Domain Control and Learning for Resource-Constrained Agentic Language Models》的新论文已发布于arXiv预印本平台。该研究由Joan Vendrell Gallart等作者完成,主要关注在计算资源受限的环境下,如何对智能体语言模型进行更高效的提示工程与控制。论文提出了一种分层的提示-领域控制与学习方法,旨在优化模型在特定任务领域的性能,同时降低对计算资源的需求,为智能体模型在实际部署中的资源约束问题提供了新的解决思路。 #人工智能 #语言模型 #智能体 #提示工程 #资源优化 #机器学习 #AI研究
一篇题为《Hierarchical Prompt-Domain Control and Learning for Resource-Constrained Agentic Language Models》的新论文已发布于arXiv预印本平台。该研究由Joan Vendrell Gallart等作者完成,主要关注在计算资源受限的环境下,如何对智能体语言模型进行更高效的提示工程与控制。论文提出了一种分层的提示-领域控制与学习方法,旨在优化模型在特定任务领域的性能,同时降低对计算资源的需求,为智能体模型在实际部署中的资源约束问题提供了新的解决思路。 #人工智能 #语言模型 #智能体 #提示工程 #资源优化 #机器学习 #AI研究
自主AI系统治理研究新进展
2026年5月26日,研究者斯里尼·拉马斯瓦米在预印本平台arXiv上发布了一篇题为《智能作为受管理的自主性:自主AI系统的失败、升级与治理》的学术论文。该研究针对当前自主AI系统在运行过程中可能面临的失败风险、意外升级行为以及相关治理挑战进行了深入分析,提出了“受管理自主性”这一核心概念。论文通过理论框架探讨了如何在AI系统设计中嵌入管理机制,以平衡自主决策与安全控制,从而提升系统的可靠性和可控性。这一研究为人工智能领域的安全治理和风险防控提供了新的学术视角,有望推动行业对自主AI系统标准化和监管框架的讨论。 #AI #自主系统 #治理 #学术研究 #arXiv #人工智能 #科技论文 #风险管理
2026年5月26日,研究者斯里尼·拉马斯瓦米在预印本平台arXiv上发布了一篇题为《智能作为受管理的自主性:自主AI系统的失败、升级与治理》的学术论文。该研究针对当前自主AI系统在运行过程中可能面临的失败风险、意外升级行为以及相关治理挑战进行了深入分析,提出了“受管理自主性”这一核心概念。论文通过理论框架探讨了如何在AI系统设计中嵌入管理机制,以平衡自主决策与安全控制,从而提升系统的可靠性和可控性。这一研究为人工智能领域的安全治理和风险防控提供了新的学术视角,有望推动行业对自主AI系统标准化和监管框架的讨论。 #AI #自主系统 #治理 #学术研究 #arXiv #人工智能 #科技论文 #风险管理
Laguna M.1/XS.2 Technical Report
Focus to learn more arXiv-issued DOI via DataCite (pending registration) Submission history From: Pengming Wang [ view email ] [v1] Tue, 26 May 2026 19:23:24 UTC (2,020 KB) Full-text links: Access Paper: View a PDF of the paper titled Laguna M.1/XS.2 Technical Report, by Julien Abadji and 95 other authors View PDF TeX Source view license Current browse context: < prev | next > new | recent | 2026-05 Change to browse by: cs References & Citations NASA ADS Google Scholar Semantic Scholar export BibTeX citation Loading... BibTeX formatted citation × loading... Data provided by: Bookmark Bibliographic Tools Bibliographic and Citation Tools Bibliographic Explorer Toggle Bibliographic Explorer ( What is the Explorer? ) Connected Papers Toggle Connected Papers ( What is Connected Papers? ) Litmaps Toggle Litmaps ( What is Litmaps? ) Toggle scit
Focus to learn more arXiv-issued DOI via DataCite (pending registration) Submission history From: Pengming Wang [ view email ] [v1] Tue, 26 May 2026 19:23:24 UTC (2,020 KB) Full-text links: Access Paper: View a PDF of the paper titled Laguna M.1/XS.2 Technical Report, by Julien Abadji and 95 other authors View PDF TeX Source view license Current browse context: < prev | next > new | recent | 2026-05 Change to browse by: cs References & Citations NASA ADS Google Scholar Semantic Scholar export BibTeX citation Loading... BibTeX formatted citation × loading... Data provided by: Bookmark Bibliographic Tools Bibliographic and Citation Tools Bibliographic Explorer Toggle Bibliographic Explorer ( What is the Explorer? ) Connected Papers Toggle Connected Papers ( What is Connected Papers? ) Litmaps Toggle Litmaps ( What is Litmaps? ) Toggle scit