JAXBench 发布
来自 Arya Tschand 等研究者的论文《JAXBench: Benchmarking Autonomous TPU Kernel Optimization》正式发布。该研究提出了一个名为 JAXBench 的基准测试框架,旨在评估和推动 TPU(张量处理单元)内核的自主优化能力。JAXBench 通过标准化测试场景,衡量自动优化算法在 TPU 上生成高效内核的性能,涵盖计算效率、内存访问和并行化等关键指标。该框架为机器学习硬件加速领域提供了新的评估工具,有助于推动 TPU 内核优化的自动化研究,提升深度学习模型的运行效率。论文已在 arXiv 预印本平台公开,并附有 PDF 和 HTML 版本供查阅。 #JAXBench #TPU #内核优化 #机器学习 #硬件加速 #arXiv #AI
来自 Arya Tschand 等研究者的论文《JAXBench: Benchmarking Autonomous TPU Kernel Optimization》正式发布。该研究提出了一个名为 JAXBench 的基准测试框架,旨在评估和推动 TPU(张量处理单元)内核的自主优化能力。JAXBench 通过标准化测试场景,衡量自动优化算法在 TPU 上生成高效内核的性能,涵盖计算效率、内存访问和并行化等关键指标。该框架为机器学习硬件加速领域提供了新的评估工具,有助于推动 TPU 内核优化的自动化研究,提升深度学习模型的运行效率。论文已在 arXiv 预印本平台公开,并附有 PDF 和 HTML 版本供查阅。 #JAXBench #TPU #内核优化 #机器学习 #硬件加速 #arXiv #AI
InferenceBench:面向AI代理的开放式LLM推理优化基准
arXiv上发布了一篇题为《InferenceBench: A Benchmark for Open-Ended LLM Inference Optimization by AI Agents》的研究论文。该论文由Jehyeok Yeon等作者提交,旨在为AI代理在开放式大语言模型推理优化方面提供标准化评估基准。InferenceBench专注于衡量AI代理在优化LLM推理过程中的性能,涵盖代码、数据及多种工具集成。论文提供了PDF和HTML版本,并附有BibTeX引用信息。该基准的提出有望推动LLM推理效率的提升,为相关研究提供可复现的评估框架。 #arXiv #LLM #推理优化 #AI代理 #基准测试 #论文
arXiv上发布了一篇题为《InferenceBench: A Benchmark for Open-Ended LLM Inference Optimization by AI Agents》的研究论文。该论文由Jehyeok Yeon等作者提交,旨在为AI代理在开放式大语言模型推理优化方面提供标准化评估基准。InferenceBench专注于衡量AI代理在优化LLM推理过程中的性能,涵盖代码、数据及多种工具集成。论文提供了PDF和HTML版本,并附有BibTeX引用信息。该基准的提出有望推动LLM推理效率的提升,为相关研究提供可复现的评估框架。 #arXiv #LLM #推理优化 #AI代理 #基准测试 #论文
大型语言模型个性化能力基准测试研究发布
近日,一篇题为《Benchmarking the Personalization Capabilities of Large Language Models》的论文在arXiv预印本平台发布。该论文由Ashutosh Srivastava等七位作者共同完成,提交于2026年5月23日。论文聚焦于大型语言模型(LLM)的个性化能力评估,提出了相应的基准测试方法。随着大模型在对话系统、推荐算法等领域的广泛应用,个性化能力成为关键指标。该研究为系统评估LLM在理解用户偏好、生成个性化响应等方面的表现提供了标准化参考,对推动相关技术的发展具有积极意义。 #大型语言模型 #个性化 #基准测试 #arXiv #AI #LLM #论文 #学术研究
近日,一篇题为《Benchmarking the Personalization Capabilities of Large Language Models》的论文在arXiv预印本平台发布。该论文由Ashutosh Srivastava等七位作者共同完成,提交于2026年5月23日。论文聚焦于大型语言模型(LLM)的个性化能力评估,提出了相应的基准测试方法。随着大模型在对话系统、推荐算法等领域的广泛应用,个性化能力成为关键指标。该研究为系统评估LLM在理解用户偏好、生成个性化响应等方面的表现提供了标准化参考,对推动相关技术的发展具有积极意义。 #大型语言模型 #个性化 #基准测试 #arXiv #AI #LLM #论文 #学术研究
稳健批评者
一篇来自arXiv的最新研究论文提出名为“稳健批评者”的新方法,旨在防御大型语言模型在多轮对话中遭遇的恶意攻击。该研究由Roman Belaire、Arunesh Sinha和Pradeep Varakantham共同完成。多轮对话攻击通过逐步引导模型泄露敏感信息或生成有害内容,对AI安全构成挑战。“稳健批评者”通过引入批判性审核机制,在每一轮交互中评估并阻断潜在攻击路径,从而提升模型鲁棒性。实验表明,该方法在多种攻击场景下显著降低模型被攻破的概率,且不影响正常对话质量。该研究为构建更安全、可信的对话式AI系统提供了新思路。 #LLM #安全 #多轮攻击 #AI防御 #论文 #arXiv #人工智能
一篇来自arXiv的最新研究论文提出名为“稳健批评者”的新方法,旨在防御大型语言模型在多轮对话中遭遇的恶意攻击。该研究由Roman Belaire、Arunesh Sinha和Pradeep Varakantham共同完成。多轮对话攻击通过逐步引导模型泄露敏感信息或生成有害内容,对AI安全构成挑战。“稳健批评者”通过引入批判性审核机制,在每一轮交互中评估并阻断潜在攻击路径,从而提升模型鲁棒性。实验表明,该方法在多种攻击场景下显著降低模型被攻破的概率,且不影响正常对话质量。该研究为构建更安全、可信的对话式AI系统提供了新思路。 #LLM #安全 #多轮攻击 #AI防御 #论文 #arXiv #人工智能
VeriSimpl:基于简化验证的自然语言鲁棒优化建模方法
来自arXiv的一篇预印本论文提出了VeriSimpl方法,旨在从自然语言描述中构建鲁棒优化模型。该方法通过基于简化的验证技术,将非专业用户的自然语言需求自动转化为数学优化问题,并确保模型在不确定性条件下的鲁棒性。研究团队设计了从语言输入到优化模型的转换流程,包括简化规则和验证机制,以提升建模的准确性与可靠性。该方法有望降低优化建模的门槛,使非专家用户也能利用鲁棒优化技术解决实际问题。论文作者包括Sumaya Abdul Rahman等四位研究人员,于2026年5月提交。 #arXiv #鲁棒优化 #自然语言处理 #建模 #AI #学术论文 #验证
来自arXiv的一篇预印本论文提出了VeriSimpl方法,旨在从自然语言描述中构建鲁棒优化模型。该方法通过基于简化的验证技术,将非专业用户的自然语言需求自动转化为数学优化问题,并确保模型在不确定性条件下的鲁棒性。研究团队设计了从语言输入到优化模型的转换流程,包括简化规则和验证机制,以提升建模的准确性与可靠性。该方法有望降低优化建模的门槛,使非专家用户也能利用鲁棒优化技术解决实际问题。论文作者包括Sumaya Abdul Rahman等四位研究人员,于2026年5月提交。 #arXiv #鲁棒优化 #自然语言处理 #建模 #AI #学术论文 #验证
SonicSampler论文提出统一Tile感知内核,优化LLM采样与推测验证
日前,一篇题为《SonicSampler: Unified Tile-Aware Kernels for LLM Sampling and Speculative Verification》的论文提交至arXiv预印本平台。该论文由Pragaash Ponnusamy与其他三位作者共同完成,提出了一种统一的Tile感知内核设计,专门针对大语言模型(LLM)推理过程中的两大核心环节——随机采样和推测验证进行加速。采样与推测验证在文本生成中占据关键计算比重,直接影响模型响应速度和部署成本。SonicSampler通过将分散的计算步骤整合为统一内核,并利用Tile级别的数据局部性优化,减少内存访问开销,提升整体吞吐量。该工作为LLM推理效率的提升提供了新的思路,有望推动大模型在实时应用中的落地与普及。 #SonicSampler #LLM #采样 #推测验证 #Tile感知 #内核优化 #AI #大模型 #arXiv
日前,一篇题为《SonicSampler: Unified Tile-Aware Kernels for LLM Sampling and Speculative Verification》的论文提交至arXiv预印本平台。该论文由Pragaash Ponnusamy与其他三位作者共同完成,提出了一种统一的Tile感知内核设计,专门针对大语言模型(LLM)推理过程中的两大核心环节——随机采样和推测验证进行加速。采样与推测验证在文本生成中占据关键计算比重,直接影响模型响应速度和部署成本。SonicSampler通过将分散的计算步骤整合为统一内核,并利用Tile级别的数据局部性优化,减少内存访问开销,提升整体吞吐量。该工作为LLM推理效率的提升提供了新的思路,有望推动大模型在实时应用中的落地与普及。 #SonicSampler #LLM #采样 #推测验证 #Tile感知 #内核优化 #AI #大模型 #arXiv
大语言模型多传感器物理危害评估基准测试研究发布
近日,一篇题为《Benchmarking Large Language Models on Multi-Sensor Physical Hazard Assessment》的论文在arXiv预印本平台发布。该论文由Faizan Iqbal等人提交,提交时间为2026年5月25日。研究旨在系统评估大语言模型在多传感器物理危害评估任务中的表现,通过设计一系列基准测试,检验模型对灾害场景的理解与判断能力。这项工作为将AI技术应用于物理安全、灾害预警等关键领域提供了重要参考,也为后续模型优化和评估标准建立奠定了基础。 #大语言模型 #物理危害评估 #多传感器 #基准测试 #arXiv #AI安全 #灾害预警 #机器学习
近日,一篇题为《Benchmarking Large Language Models on Multi-Sensor Physical Hazard Assessment》的论文在arXiv预印本平台发布。该论文由Faizan Iqbal等人提交,提交时间为2026年5月25日。研究旨在系统评估大语言模型在多传感器物理危害评估任务中的表现,通过设计一系列基准测试,检验模型对灾害场景的理解与判断能力。这项工作为将AI技术应用于物理安全、灾害预警等关键领域提供了重要参考,也为后续模型优化和评估标准建立奠定了基础。 #大语言模型 #物理危害评估 #多传感器 #基准测试 #arXiv #AI安全 #灾害预警 #机器学习
半监督文本属性图蒸馏新研究登上arXiv
一篇题为《Semi-Supervised Text-Attributed Graph Distillation》的论文近日在arXiv预印本平台公开,由Yurui Lai等三位学者完成,提交于2026年5月27日。该研究聚焦半监督学习场景下的文本属性图知识蒸馏问题,旨在通过蒸馏技术优化图表示学习在有限标注数据下的性能。文本属性图融合了图结构与节点文本特征,广泛存在于社交网络、学术图谱等应用中,该工作有望在降低标注成本的同时提升模型鲁棒性。目前论文PDF已开放访问,具体技术细节有待进一步查阅。 #SemiSupervisedLearning #TextAttributedGraph #KnowledgeDistillation #GraphNeuralNetworks #arXiv #MachineLearning #DeepLearning #YuruiLai
一篇题为《Semi-Supervised Text-Attributed Graph Distillation》的论文近日在arXiv预印本平台公开,由Yurui Lai等三位学者完成,提交于2026年5月27日。该研究聚焦半监督学习场景下的文本属性图知识蒸馏问题,旨在通过蒸馏技术优化图表示学习在有限标注数据下的性能。文本属性图融合了图结构与节点文本特征,广泛存在于社交网络、学术图谱等应用中,该工作有望在降低标注成本的同时提升模型鲁棒性。目前论文PDF已开放访问,具体技术细节有待进一步查阅。 #SemiSupervisedLearning #TextAttributedGraph #KnowledgeDistillation #GraphNeuralNetworks #arXiv #MachineLearning #DeepLearning #YuruiLai
超越“说谎者基准”:谎言类型、深度与稀疏性对LLM谎言检测的影响
一篇来自arXiv的预印本论文《Beyond Liars' Bench: The Impact of Lie Typology, Depth, and Sparsity on Deception Detection in LLMs》由Amr Moustafa等人撰写。该研究系统探讨了谎言的不同类型、深度和稀疏性如何影响大型语言模型(LLM)的谎言检测能力。传统基准“Liars' Bench”可能无法全面评估模型的防欺骗性能,而该工作通过引入更细致的谎言分类和量化维度(如谎言层次、稀疏分布),揭示了现有检测方法的局限性,指出不同谎言类型对模型检测难度差异显著。该研究为提升LLM的诚实性与安全性提供了新的评估视角和方法论基础,对AI安全领域具有参考价值。 #LLM #谎言检测 #AI安全 #arXiv #预印本 #自然语言处理 #欺骗检测 #大模型安全
一篇来自arXiv的预印本论文《Beyond Liars' Bench: The Impact of Lie Typology, Depth, and Sparsity on Deception Detection in LLMs》由Amr Moustafa等人撰写。该研究系统探讨了谎言的不同类型、深度和稀疏性如何影响大型语言模型(LLM)的谎言检测能力。传统基准“Liars' Bench”可能无法全面评估模型的防欺骗性能,而该工作通过引入更细致的谎言分类和量化维度(如谎言层次、稀疏分布),揭示了现有检测方法的局限性,指出不同谎言类型对模型检测难度差异显著。该研究为提升LLM的诚实性与安全性提供了新的评估视角和方法论基础,对AI安全领域具有参考价值。 #LLM #谎言检测 #AI安全 #arXiv #预印本 #自然语言处理 #欺骗检测 #大模型安全
通过约束多源推断实现配电系统可扩展拓扑推断
2026年5月30日,一篇关于配电系统拓扑推断的论文在arXiv平台提交。该论文由Haoran Li、Lihao Mai等人撰写,提出一种基于约束多源推断的可扩展方法,用于解决大规模配电网络中拓扑推断面临的效率与精度瓶颈。传统方法在处理复杂分布式系统时往往受限于数据稀疏和结构动态,新方法通过融合多源量测数据并施加物理约束,显著提升了模型在大规模场景下的推断能力与鲁棒性。该研究为智能电网的实时监测与运行优化提供了新的技术路径,相关论文尚未正式注册DOI,但已开放预览。 #配电系统 #拓扑推断 #约束多源推断 #可扩展性 #论文 #arXiv #智能电网 #电力系统 #人工智能
2026年5月30日,一篇关于配电系统拓扑推断的论文在arXiv平台提交。该论文由Haoran Li、Lihao Mai等人撰写,提出一种基于约束多源推断的可扩展方法,用于解决大规模配电网络中拓扑推断面临的效率与精度瓶颈。传统方法在处理复杂分布式系统时往往受限于数据稀疏和结构动态,新方法通过融合多源量测数据并施加物理约束,显著提升了模型在大规模场景下的推断能力与鲁棒性。该研究为智能电网的实时监测与运行优化提供了新的技术路径,相关论文尚未正式注册DOI,但已开放预览。 #配电系统 #拓扑推断 #约束多源推断 #可扩展性 #论文 #arXiv #智能电网 #电力系统 #人工智能
Routing Without Training: Controllable-Ratio LLM Offloading via Reliability Gating
Focus to learn more arXiv-issued DOI via DataCite (pending registration) Submission history From: Evan Chen [ view email ] [v1] Sat, 30 May 2026 06:42:55 UTC (4,153 KB) Full-text links: Access Paper: View a PDF of the paper titled Routing Without Training: Controllable-Ratio LLM Offloading via Reliability Gating, by Evan Chen and 4 other authors View PDF HTML (experimental) TeX Source view license Current browse context: < prev | next > new | recent | 2026-07 Change to browse by: cs References & Citations NASA ADS Google Scholar Semantic Scholar export BibTeX citation Loading... BibTeX formatted citation × loading... Data provided by: Bookmark Bibliographic Tools Bibliographic and Citation Tools Bibliographic Explorer Toggle Bibliographic Explorer ( What is the Explorer? ) Connected Paper
Focus to learn more arXiv-issued DOI via DataCite (pending registration) Submission history From: Evan Chen [ view email ] [v1] Sat, 30 May 2026 06:42:55 UTC (4,153 KB) Full-text links: Access Paper: View a PDF of the paper titled Routing Without Training: Controllable-Ratio LLM Offloading via Reliability Gating, by Evan Chen and 4 other authors View PDF HTML (experimental) TeX Source view license Current browse context: < prev | next > new | recent | 2026-07 Change to browse by: cs References & Citations NASA ADS Google Scholar Semantic Scholar export BibTeX citation Loading... BibTeX formatted citation × loading... Data provided by: Bookmark Bibliographic Tools Bibliographic and Citation Tools Bibliographic Explorer Toggle Bibliographic Explorer ( What is the Explorer? ) Connected Paper
s Toggle Connected Papers ( What is Connected Papers? ) Litmaps Toggle Litmaps ( What is Litmaps? ) Toggle scite Smart Citations ( What are Smart Citations? ) Code, Data, Media Code, Data and Media Associated with this Article alphaXiv Toggle alphaXiv ( What is alphaXiv? ) Links to Code Toggle CatalyzeX Code Finder for Papers ( What is CatalyzeX? ) DagsHub Toggle DagsHub ( What is DagsHub? ) GotitPub Toggle ( What is GotitPub? ) Huggingface Toggle Hugging Face ( What is Huggingface? ) ScienceCast Toggle ScienceCast ( What is ScienceCast? ) Demos Demos Replicate Toggle Replicate ( What is Replicate? ) Spaces Toggle Hugging Face Spaces ( What is Spaces? ) Spaces Toggle ( What is ? ) Related Papers Recommenders and Search Tools Link to Influence Flower Influence Flower ( What are Influence Flowers? ) Core recommender toggle CORE Recommender ( What is CORE? ) Author Venue Institution Topic About arXivLabs arXivLabs: experimental projects with community collaborators arXivLabs is a framework that allows collaborators to develop and share new arXiv features directly on our website. Both individuals and organizations that work with arXivLabs have embraced and accepted our values of openness, community, excellence, and user data privacy. arXiv is committed to these values and only works with partners that adhere to them. Have an idea for a project that will add value for arXiv's community? Learn more about arXivLabs .
PersonaTrail:通过浏览轨迹评估个性化网页代理的新基准
arXiv上发布了一篇名为《PersonaTrail: Benchmarking Personalized Web Agents through Browsing Trails》的论文。该研究由Seungbin Yang等人提出,针对现有网页代理缺乏个性化能力的问题,创建了一个新基准。PersonaTrail通过模拟用户在真实网站上的浏览轨迹,测试代理能否根据用户历史行为、偏好和任务目标,自主完成网页操作。该方法不仅评估代理的导航和交互能力,更关注其理解用户意图的个性化水平。该基准有望推动更智能、更贴合用户需求的网页代理开发,为AI在浏览器自动化领域的应用提供标准化测试框架。 #AI #网页代理 #个性化 #基准测试 #arXiv #科技新闻 #人机交互
arXiv上发布了一篇名为《PersonaTrail: Benchmarking Personalized Web Agents through Browsing Trails》的论文。该研究由Seungbin Yang等人提出,针对现有网页代理缺乏个性化能力的问题,创建了一个新基准。PersonaTrail通过模拟用户在真实网站上的浏览轨迹,测试代理能否根据用户历史行为、偏好和任务目标,自主完成网页操作。该方法不仅评估代理的导航和交互能力,更关注其理解用户意图的个性化水平。该基准有望推动更智能、更贴合用户需求的网页代理开发,为AI在浏览器自动化领域的应用提供标准化测试框架。 #AI #网页代理 #个性化 #基准测试 #arXiv #科技新闻 #人机交互
自回归语言模型可处理层次控制研究提出新框架
一篇题为“Tractable Hierarchical Control of Autoregressive Language Models”(自回归语言模型的可处理层次控制)的论文于2026年6月1日提交至arXiv预印本平台。该研究由Maximilian Scribner(Max Scribner)与其他两位作者合作完成,目前论文的PDF和HTML版本已开放预览。论文聚焦自回归语言模型
一篇题为“Tractable Hierarchical Control of Autoregressive Language Models”(自回归语言模型的可处理层次控制)的论文于2026年6月1日提交至arXiv预印本平台。该研究由Maximilian Scribner(Max Scribner)与其他两位作者合作完成,目前论文的PDF和HTML版本已开放预览。论文聚焦自回归语言模型
语言模型期望对齐
近日,一篇名为《Expectation Alignment of Language Models for Real-World User Expectations》的论文在预印本平台arXiv提交。该论文由Miaomiao Li等六位研究者完成,主要探讨如何让语言模型更好地与真实用户的期望保持一致。研究指出,当前模型虽在各类基准上表现优异,但实际应用中常出现与用户预期偏差的问题。为此,作者提出“期望对齐”这一概念,从数据、训练和
近日,一篇名为《Expectation Alignment of Language Models for Real-World User Expectations》的论文在预印本平台arXiv提交。该论文由Miaomiao Li等六位研究者完成,主要探讨如何让语言模型更好地与真实用户的期望保持一致。研究指出,当前模型虽在各类基准上表现优异,但实际应用中常出现与用户预期偏差的问题。为此,作者提出“期望对齐”这一概念,从数据、训练和
OPTScientist:多智能体自动发现Transformer预训练优化器程序
一篇发表在arXiv上的论文提出了一种名为OPTScientist的新方法,利用多智能体系统自动发现针对Transformer预训练的类型化优化器程序。该方法通过多个智能体协同搜索,在优化器程序空间中进行探索,旨在提升大规模语言模型预训练的效率与性能。研究团队表示,这种方法能够自动生成比传统手工设计优化器更优的程序,并已在多个预训练任务上验证了其有效性。这项研究为自动化机器学习在优化器发现领域提供了新的思路,有望减少人工调参成本并加速Transformer模型的训练过程。 #arXiv #机器学习 #Transformer #优化器 #多智能体 #预训练 #AutoML #AI研究
一篇发表在arXiv上的论文提出了一种名为OPTScientist的新方法,利用多智能体系统自动发现针对Transformer预训练的类型化优化器程序。该方法通过多个智能体协同搜索,在优化器程序空间中进行探索,旨在提升大规模语言模型预训练的效率与性能。研究团队表示,这种方法能够自动生成比传统手工设计优化器更优的程序,并已在多个预训练任务上验证了其有效性。这项研究为自动化机器学习在优化器发现领域提供了新的思路,有望减少人工调参成本并加速Transformer模型的训练过程。 #arXiv #机器学习 #Transformer #优化器 #多智能体 #预训练 #AutoML #AI研究