ClickGuard 新研究
一项名为 ClickGuard 的研究提出利用信息量指标与大语言模型来检测和“剧透”标题党新闻。该研究由 Wojciech Michaluk 等学者完成,论文已提交至 arXiv 预印本平台。研究团队开发了一种方法,通过分析新闻标题与正文之间的信息量差异,识别出那些夸大或误导性的标题党内容,并利用大语言模型自动生成能够揭示真实内容的“剧透”摘要。这一方法旨在帮助读者快速判断新闻价值,避免被夸张标题欺骗。ClickGuard 系统结合了传统信息量度量与先进的大语言模型能力,为应对网络信息环境中的标题党问题提供了新的技术路径。该研究目前处于预印本阶段,尚未正式发表。 #标题党 #大语言模型 #信息检测 #arXiv #学术研究 #新闻伦理
一项名为 ClickGuard 的研究提出利用信息量指标与大语言模型来检测和“剧透”标题党新闻。该研究由 Wojciech Michaluk 等学者完成,论文已提交至 arXiv 预印本平台。研究团队开发了一种方法,通过分析新闻标题与正文之间的信息量差异,识别出那些夸大或误导性的标题党内容,并利用大语言模型自动生成能够揭示真实内容的“剧透”摘要。这一方法旨在帮助读者快速判断新闻价值,避免被夸张标题欺骗。ClickGuard 系统结合了传统信息量度量与先进的大语言模型能力,为应对网络信息环境中的标题党问题提供了新的技术路径。该研究目前处于预印本阶段,尚未正式发表。 #标题党 #大语言模型 #信息检测 #arXiv #学术研究 #新闻伦理
随机采样存在认知浅层性
一项最新研究指出,大型语言模型(LLMs)中常用的随机采样方法在认知层面存在根本性局限。该研究题为《随机采样存在认知浅层性:温度变化与模型多样性之间的维度差距》,由研究者Izhar Ali提交至arXiv预印本平台。论文核心观点认为,通过调整温度参数来改变模型输出的随机性,并不能真正实现认知层面的多样性。温度变化仅能影响输出结果的统计分布,而无法触及模型内在的认知维度,导致生成的文本在语义和逻辑结构上仍高度同质化。这一发现对当前依赖随机采样提升模型创造力的做法提出了质疑,暗示需要探索更根本的多样性生成机制。 #AI #大模型 #随机采样 #认知科学 #arXiv #机器学习 #自然语言处理
一项最新研究指出,大型语言模型(LLMs)中常用的随机采样方法在认知层面存在根本性局限。该研究题为《随机采样存在认知浅层性:温度变化与模型多样性之间的维度差距》,由研究者Izhar Ali提交至arXiv预印本平台。论文核心观点认为,通过调整温度参数来改变模型输出的随机性,并不能真正实现认知层面的多样性。温度变化仅能影响输出结果的统计分布,而无法触及模型内在的认知维度,导致生成的文本在语义和逻辑结构上仍高度同质化。这一发现对当前依赖随机采样提升模型创造力的做法提出了质疑,暗示需要探索更根本的多样性生成机制。 #AI #大模型 #随机采样 #认知科学 #arXiv #机器学习 #自然语言处理
JAXBench 发布
来自 Arya Tschand 等研究者的论文《JAXBench: Benchmarking Autonomous TPU Kernel Optimization》正式发布。该研究提出了一个名为 JAXBench 的基准测试框架,旨在评估和推动 TPU(张量处理单元)内核的自主优化能力。JAXBench 通过标准化测试场景,衡量自动优化算法在 TPU 上生成高效内核的性能,涵盖计算效率、内存访问和并行化等关键指标。该框架为机器学习硬件加速领域提供了新的评估工具,有助于推动 TPU 内核优化的自动化研究,提升深度学习模型的运行效率。论文已在 arXiv 预印本平台公开,并附有 PDF 和 HTML 版本供查阅。 #JAXBench #TPU #内核优化 #机器学习 #硬件加速 #arXiv #AI
来自 Arya Tschand 等研究者的论文《JAXBench: Benchmarking Autonomous TPU Kernel Optimization》正式发布。该研究提出了一个名为 JAXBench 的基准测试框架,旨在评估和推动 TPU(张量处理单元)内核的自主优化能力。JAXBench 通过标准化测试场景,衡量自动优化算法在 TPU 上生成高效内核的性能,涵盖计算效率、内存访问和并行化等关键指标。该框架为机器学习硬件加速领域提供了新的评估工具,有助于推动 TPU 内核优化的自动化研究,提升深度学习模型的运行效率。论文已在 arXiv 预印本平台公开,并附有 PDF 和 HTML 版本供查阅。 #JAXBench #TPU #内核优化 #机器学习 #硬件加速 #arXiv #AI
InferenceBench:面向AI代理的开放式LLM推理优化基准
arXiv上发布了一篇题为《InferenceBench: A Benchmark for Open-Ended LLM Inference Optimization by AI Agents》的研究论文。该论文由Jehyeok Yeon等作者提交,旨在为AI代理在开放式大语言模型推理优化方面提供标准化评估基准。InferenceBench专注于衡量AI代理在优化LLM推理过程中的性能,涵盖代码、数据及多种工具集成。论文提供了PDF和HTML版本,并附有BibTeX引用信息。该基准的提出有望推动LLM推理效率的提升,为相关研究提供可复现的评估框架。 #arXiv #LLM #推理优化 #AI代理 #基准测试 #论文
arXiv上发布了一篇题为《InferenceBench: A Benchmark for Open-Ended LLM Inference Optimization by AI Agents》的研究论文。该论文由Jehyeok Yeon等作者提交,旨在为AI代理在开放式大语言模型推理优化方面提供标准化评估基准。InferenceBench专注于衡量AI代理在优化LLM推理过程中的性能,涵盖代码、数据及多种工具集成。论文提供了PDF和HTML版本,并附有BibTeX引用信息。该基准的提出有望推动LLM推理效率的提升,为相关研究提供可复现的评估框架。 #arXiv #LLM #推理优化 #AI代理 #基准测试 #论文
大型语言模型个性化能力基准测试研究发布
近日,一篇题为《Benchmarking the Personalization Capabilities of Large Language Models》的论文在arXiv预印本平台发布。该论文由Ashutosh Srivastava等七位作者共同完成,提交于2026年5月23日。论文聚焦于大型语言模型(LLM)的个性化能力评估,提出了相应的基准测试方法。随着大模型在对话系统、推荐算法等领域的广泛应用,个性化能力成为关键指标。该研究为系统评估LLM在理解用户偏好、生成个性化响应等方面的表现提供了标准化参考,对推动相关技术的发展具有积极意义。 #大型语言模型 #个性化 #基准测试 #arXiv #AI #LLM #论文 #学术研究
近日,一篇题为《Benchmarking the Personalization Capabilities of Large Language Models》的论文在arXiv预印本平台发布。该论文由Ashutosh Srivastava等七位作者共同完成,提交于2026年5月23日。论文聚焦于大型语言模型(LLM)的个性化能力评估,提出了相应的基准测试方法。随着大模型在对话系统、推荐算法等领域的广泛应用,个性化能力成为关键指标。该研究为系统评估LLM在理解用户偏好、生成个性化响应等方面的表现提供了标准化参考,对推动相关技术的发展具有积极意义。 #大型语言模型 #个性化 #基准测试 #arXiv #AI #LLM #论文 #学术研究
稳健批评者
一篇来自arXiv的最新研究论文提出名为“稳健批评者”的新方法,旨在防御大型语言模型在多轮对话中遭遇的恶意攻击。该研究由Roman Belaire、Arunesh Sinha和Pradeep Varakantham共同完成。多轮对话攻击通过逐步引导模型泄露敏感信息或生成有害内容,对AI安全构成挑战。“稳健批评者”通过引入批判性审核机制,在每一轮交互中评估并阻断潜在攻击路径,从而提升模型鲁棒性。实验表明,该方法在多种攻击场景下显著降低模型被攻破的概率,且不影响正常对话质量。该研究为构建更安全、可信的对话式AI系统提供了新思路。 #LLM #安全 #多轮攻击 #AI防御 #论文 #arXiv #人工智能
一篇来自arXiv的最新研究论文提出名为“稳健批评者”的新方法,旨在防御大型语言模型在多轮对话中遭遇的恶意攻击。该研究由Roman Belaire、Arunesh Sinha和Pradeep Varakantham共同完成。多轮对话攻击通过逐步引导模型泄露敏感信息或生成有害内容,对AI安全构成挑战。“稳健批评者”通过引入批判性审核机制,在每一轮交互中评估并阻断潜在攻击路径,从而提升模型鲁棒性。实验表明,该方法在多种攻击场景下显著降低模型被攻破的概率,且不影响正常对话质量。该研究为构建更安全、可信的对话式AI系统提供了新思路。 #LLM #安全 #多轮攻击 #AI防御 #论文 #arXiv #人工智能
VeriSimpl:基于简化验证的自然语言鲁棒优化建模方法
来自arXiv的一篇预印本论文提出了VeriSimpl方法,旨在从自然语言描述中构建鲁棒优化模型。该方法通过基于简化的验证技术,将非专业用户的自然语言需求自动转化为数学优化问题,并确保模型在不确定性条件下的鲁棒性。研究团队设计了从语言输入到优化模型的转换流程,包括简化规则和验证机制,以提升建模的准确性与可靠性。该方法有望降低优化建模的门槛,使非专家用户也能利用鲁棒优化技术解决实际问题。论文作者包括Sumaya Abdul Rahman等四位研究人员,于2026年5月提交。 #arXiv #鲁棒优化 #自然语言处理 #建模 #AI #学术论文 #验证
来自arXiv的一篇预印本论文提出了VeriSimpl方法,旨在从自然语言描述中构建鲁棒优化模型。该方法通过基于简化的验证技术,将非专业用户的自然语言需求自动转化为数学优化问题,并确保模型在不确定性条件下的鲁棒性。研究团队设计了从语言输入到优化模型的转换流程,包括简化规则和验证机制,以提升建模的准确性与可靠性。该方法有望降低优化建模的门槛,使非专家用户也能利用鲁棒优化技术解决实际问题。论文作者包括Sumaya Abdul Rahman等四位研究人员,于2026年5月提交。 #arXiv #鲁棒优化 #自然语言处理 #建模 #AI #学术论文 #验证
SonicSampler论文提出统一Tile感知内核,优化LLM采样与推测验证
日前,一篇题为《SonicSampler: Unified Tile-Aware Kernels for LLM Sampling and Speculative Verification》的论文提交至arXiv预印本平台。该论文由Pragaash Ponnusamy与其他三位作者共同完成,提出了一种统一的Tile感知内核设计,专门针对大语言模型(LLM)推理过程中的两大核心环节——随机采样和推测验证进行加速。采样与推测验证在文本生成中占据关键计算比重,直接影响模型响应速度和部署成本。SonicSampler通过将分散的计算步骤整合为统一内核,并利用Tile级别的数据局部性优化,减少内存访问开销,提升整体吞吐量。该工作为LLM推理效率的提升提供了新的思路,有望推动大模型在实时应用中的落地与普及。 #SonicSampler #LLM #采样 #推测验证 #Tile感知 #内核优化 #AI #大模型 #arXiv
日前,一篇题为《SonicSampler: Unified Tile-Aware Kernels for LLM Sampling and Speculative Verification》的论文提交至arXiv预印本平台。该论文由Pragaash Ponnusamy与其他三位作者共同完成,提出了一种统一的Tile感知内核设计,专门针对大语言模型(LLM)推理过程中的两大核心环节——随机采样和推测验证进行加速。采样与推测验证在文本生成中占据关键计算比重,直接影响模型响应速度和部署成本。SonicSampler通过将分散的计算步骤整合为统一内核,并利用Tile级别的数据局部性优化,减少内存访问开销,提升整体吞吐量。该工作为LLM推理效率的提升提供了新的思路,有望推动大模型在实时应用中的落地与普及。 #SonicSampler #LLM #采样 #推测验证 #Tile感知 #内核优化 #AI #大模型 #arXiv
大语言模型多传感器物理危害评估基准测试研究发布
近日,一篇题为《Benchmarking Large Language Models on Multi-Sensor Physical Hazard Assessment》的论文在arXiv预印本平台发布。该论文由Faizan Iqbal等人提交,提交时间为2026年5月25日。研究旨在系统评估大语言模型在多传感器物理危害评估任务中的表现,通过设计一系列基准测试,检验模型对灾害场景的理解与判断能力。这项工作为将AI技术应用于物理安全、灾害预警等关键领域提供了重要参考,也为后续模型优化和评估标准建立奠定了基础。 #大语言模型 #物理危害评估 #多传感器 #基准测试 #arXiv #AI安全 #灾害预警 #机器学习
近日,一篇题为《Benchmarking Large Language Models on Multi-Sensor Physical Hazard Assessment》的论文在arXiv预印本平台发布。该论文由Faizan Iqbal等人提交,提交时间为2026年5月25日。研究旨在系统评估大语言模型在多传感器物理危害评估任务中的表现,通过设计一系列基准测试,检验模型对灾害场景的理解与判断能力。这项工作为将AI技术应用于物理安全、灾害预警等关键领域提供了重要参考,也为后续模型优化和评估标准建立奠定了基础。 #大语言模型 #物理危害评估 #多传感器 #基准测试 #arXiv #AI安全 #灾害预警 #机器学习
半监督文本属性图蒸馏新研究登上arXiv
一篇题为《Semi-Supervised Text-Attributed Graph Distillation》的论文近日在arXiv预印本平台公开,由Yurui Lai等三位学者完成,提交于2026年5月27日。该研究聚焦半监督学习场景下的文本属性图知识蒸馏问题,旨在通过蒸馏技术优化图表示学习在有限标注数据下的性能。文本属性图融合了图结构与节点文本特征,广泛存在于社交网络、学术图谱等应用中,该工作有望在降低标注成本的同时提升模型鲁棒性。目前论文PDF已开放访问,具体技术细节有待进一步查阅。 #SemiSupervisedLearning #TextAttributedGraph #KnowledgeDistillation #GraphNeuralNetworks #arXiv #MachineLearning #DeepLearning #YuruiLai
一篇题为《Semi-Supervised Text-Attributed Graph Distillation》的论文近日在arXiv预印本平台公开,由Yurui Lai等三位学者完成,提交于2026年5月27日。该研究聚焦半监督学习场景下的文本属性图知识蒸馏问题,旨在通过蒸馏技术优化图表示学习在有限标注数据下的性能。文本属性图融合了图结构与节点文本特征,广泛存在于社交网络、学术图谱等应用中,该工作有望在降低标注成本的同时提升模型鲁棒性。目前论文PDF已开放访问,具体技术细节有待进一步查阅。 #SemiSupervisedLearning #TextAttributedGraph #KnowledgeDistillation #GraphNeuralNetworks #arXiv #MachineLearning #DeepLearning #YuruiLai
超越“说谎者基准”:谎言类型、深度与稀疏性对LLM谎言检测的影响
一篇来自arXiv的预印本论文《Beyond Liars' Bench: The Impact of Lie Typology, Depth, and Sparsity on Deception Detection in LLMs》由Amr Moustafa等人撰写。该研究系统探讨了谎言的不同类型、深度和稀疏性如何影响大型语言模型(LLM)的谎言检测能力。传统基准“Liars' Bench”可能无法全面评估模型的防欺骗性能,而该工作通过引入更细致的谎言分类和量化维度(如谎言层次、稀疏分布),揭示了现有检测方法的局限性,指出不同谎言类型对模型检测难度差异显著。该研究为提升LLM的诚实性与安全性提供了新的评估视角和方法论基础,对AI安全领域具有参考价值。 #LLM #谎言检测 #AI安全 #arXiv #预印本 #自然语言处理 #欺骗检测 #大模型安全
一篇来自arXiv的预印本论文《Beyond Liars' Bench: The Impact of Lie Typology, Depth, and Sparsity on Deception Detection in LLMs》由Amr Moustafa等人撰写。该研究系统探讨了谎言的不同类型、深度和稀疏性如何影响大型语言模型(LLM)的谎言检测能力。传统基准“Liars' Bench”可能无法全面评估模型的防欺骗性能,而该工作通过引入更细致的谎言分类和量化维度(如谎言层次、稀疏分布),揭示了现有检测方法的局限性,指出不同谎言类型对模型检测难度差异显著。该研究为提升LLM的诚实性与安全性提供了新的评估视角和方法论基础,对AI安全领域具有参考价值。 #LLM #谎言检测 #AI安全 #arXiv #预印本 #自然语言处理 #欺骗检测 #大模型安全
通过约束多源推断实现配电系统可扩展拓扑推断
2026年5月30日,一篇关于配电系统拓扑推断的论文在arXiv平台提交。该论文由Haoran Li、Lihao Mai等人撰写,提出一种基于约束多源推断的可扩展方法,用于解决大规模配电网络中拓扑推断面临的效率与精度瓶颈。传统方法在处理复杂分布式系统时往往受限于数据稀疏和结构动态,新方法通过融合多源量测数据并施加物理约束,显著提升了模型在大规模场景下的推断能力与鲁棒性。该研究为智能电网的实时监测与运行优化提供了新的技术路径,相关论文尚未正式注册DOI,但已开放预览。 #配电系统 #拓扑推断 #约束多源推断 #可扩展性 #论文 #arXiv #智能电网 #电力系统 #人工智能
2026年5月30日,一篇关于配电系统拓扑推断的论文在arXiv平台提交。该论文由Haoran Li、Lihao Mai等人撰写,提出一种基于约束多源推断的可扩展方法,用于解决大规模配电网络中拓扑推断面临的效率与精度瓶颈。传统方法在处理复杂分布式系统时往往受限于数据稀疏和结构动态,新方法通过融合多源量测数据并施加物理约束,显著提升了模型在大规模场景下的推断能力与鲁棒性。该研究为智能电网的实时监测与运行优化提供了新的技术路径,相关论文尚未正式注册DOI,但已开放预览。 #配电系统 #拓扑推断 #约束多源推断 #可扩展性 #论文 #arXiv #智能电网 #电力系统 #人工智能
Routing Without Training: Controllable-Ratio LLM Offloading via Reliability Gating
Focus to learn more arXiv-issued DOI via DataCite (pending registration) Submission history From: Evan Chen [ view email ] [v1] Sat, 30 May 2026 06:42:55 UTC (4,153 KB) Full-text links: Access Paper: View a PDF of the paper titled Routing Without Training: Controllable-Ratio LLM Offloading via Reliability Gating, by Evan Chen and 4 other authors View PDF HTML (experimental) TeX Source view license Current browse context: < prev | next > new | recent | 2026-07 Change to browse by: cs References & Citations NASA ADS Google Scholar Semantic Scholar export BibTeX citation Loading... BibTeX formatted citation × loading... Data provided by: Bookmark Bibliographic Tools Bibliographic and Citation Tools Bibliographic Explorer Toggle Bibliographic Explorer ( What is the Explorer? ) Connected Paper
Focus to learn more arXiv-issued DOI via DataCite (pending registration) Submission history From: Evan Chen [ view email ] [v1] Sat, 30 May 2026 06:42:55 UTC (4,153 KB) Full-text links: Access Paper: View a PDF of the paper titled Routing Without Training: Controllable-Ratio LLM Offloading via Reliability Gating, by Evan Chen and 4 other authors View PDF HTML (experimental) TeX Source view license Current browse context: < prev | next > new | recent | 2026-07 Change to browse by: cs References & Citations NASA ADS Google Scholar Semantic Scholar export BibTeX citation Loading... BibTeX formatted citation × loading... Data provided by: Bookmark Bibliographic Tools Bibliographic and Citation Tools Bibliographic Explorer Toggle Bibliographic Explorer ( What is the Explorer? ) Connected Paper
s Toggle Connected Papers ( What is Connected Papers? ) Litmaps Toggle Litmaps ( What is Litmaps? ) Toggle scite Smart Citations ( What are Smart Citations? ) Code, Data, Media Code, Data and Media Associated with this Article alphaXiv Toggle alphaXiv ( What is alphaXiv? ) Links to Code Toggle CatalyzeX Code Finder for Papers ( What is CatalyzeX? ) DagsHub Toggle DagsHub ( What is DagsHub? ) GotitPub Toggle ( What is GotitPub? ) Huggingface Toggle Hugging Face ( What is Huggingface? ) ScienceCast Toggle ScienceCast ( What is ScienceCast? ) Demos Demos Replicate Toggle Replicate ( What is Replicate? ) Spaces Toggle Hugging Face Spaces ( What is Spaces? ) Spaces Toggle ( What is ? ) Related Papers Recommenders and Search Tools Link to Influence Flower Influence Flower ( What are Influence Flowers? ) Core recommender toggle CORE Recommender ( What is CORE? ) Author Venue Institution Topic About arXivLabs arXivLabs: experimental projects with community collaborators arXivLabs is a framework that allows collaborators to develop and share new arXiv features directly on our website. Both individuals and organizations that work with arXivLabs have embraced and accepted our values of openness, community, excellence, and user data privacy. arXiv is committed to these values and only works with partners that adhere to them. Have an idea for a project that will add value for arXiv's community? Learn more about arXivLabs .
PersonaTrail:通过浏览轨迹评估个性化网页代理的新基准
arXiv上发布了一篇名为《PersonaTrail: Benchmarking Personalized Web Agents through Browsing Trails》的论文。该研究由Seungbin Yang等人提出,针对现有网页代理缺乏个性化能力的问题,创建了一个新基准。PersonaTrail通过模拟用户在真实网站上的浏览轨迹,测试代理能否根据用户历史行为、偏好和任务目标,自主完成网页操作。该方法不仅评估代理的导航和交互能力,更关注其理解用户意图的个性化水平。该基准有望推动更智能、更贴合用户需求的网页代理开发,为AI在浏览器自动化领域的应用提供标准化测试框架。 #AI #网页代理 #个性化 #基准测试 #arXiv #科技新闻 #人机交互
arXiv上发布了一篇名为《PersonaTrail: Benchmarking Personalized Web Agents through Browsing Trails》的论文。该研究由Seungbin Yang等人提出,针对现有网页代理缺乏个性化能力的问题,创建了一个新基准。PersonaTrail通过模拟用户在真实网站上的浏览轨迹,测试代理能否根据用户历史行为、偏好和任务目标,自主完成网页操作。该方法不仅评估代理的导航和交互能力,更关注其理解用户意图的个性化水平。该基准有望推动更智能、更贴合用户需求的网页代理开发,为AI在浏览器自动化领域的应用提供标准化测试框架。 #AI #网页代理 #个性化 #基准测试 #arXiv #科技新闻 #人机交互