AI知识库 @ai521
363 subscribers
24.2K photos
45 videos
20 files
925 links
@ai521 专注分享最实用的AI内容

🤖 AI教程(新手到进阶)
🧠 AI知识科普(大模型 / 提示词 / 自动化)
📰 AI资讯更新(每日最新AI动态)
📚 AI实战技巧(写作 / 绘画 / 编程 / 赚钱)
🔧 最新AI工具推荐

每天更新AI干货
长期做一个真正有价值的AI频道
Download Telegram
JAXBench 发布

来自 Arya Tschand 等研究者的论文《JAXBench: Benchmarking Autonomous TPU Kernel Optimization》正式发布。该研究提出了一个名为 JAXBench 的基准测试框架,旨在评估和推动 TPU(张量处理单元)内核的自主优化能力。JAXBench 通过标准化测试场景,衡量自动优化算法在 TPU 上生成高效内核的性能,涵盖计算效率、内存访问和并行化等关键指标。该框架为机器学习硬件加速领域提供了新的评估工具,有助于推动 TPU 内核优化的自动化研究,提升深度学习模型的运行效率。论文已在 arXiv 预印本平台公开,并附有 PDF 和 HTML 版本供查阅。 #JAXBench #TPU #内核优化 #机器学习 #硬件加速 #arXiv #AI
DC-Leap

扩散语言模型(dLLMs)在文本生成中需多步迭代,推理效率较低。针对这一瓶颈,研究团队提出DC-Leap方法,通过草稿引导的连续跳跃解码,在不进行额外训练的前提下显著提升推理速度。该方法利用草稿序列动态指导解码路径,实现连续跳跃,从而减少迭代步数,同时保持生成质量。该研究由Yanhua Jiao等9位作者共同完成,相关论文已提交至arXiv平台。 #DCLeap #扩散语言模型 #加速 #推理 #无需训练 #AI #大模型 #arXiv #论文
InferenceBench:面向AI代理的开放式LLM推理优化基准

arXiv上发布了一篇题为《InferenceBench: A Benchmark for Open-Ended LLM Inference Optimization by AI Agents》的研究论文。该论文由Jehyeok Yeon等作者提交,旨在为AI代理在开放式大语言模型推理优化方面提供标准化评估基准。InferenceBench专注于衡量AI代理在优化LLM推理过程中的性能,涵盖代码、数据及多种工具集成。论文提供了PDF和HTML版本,并附有BibTeX引用信息。该基准的提出有望推动LLM推理效率的提升,为相关研究提供可复现的评估框架。 #arXiv #LLM #推理优化 #AI代理 #基准测试 #论文
DecodeShare

一篇题为《DecodeShare: Tracing the Shared Subspace of LLM Decode-Time Decisions》的学术论文在arXiv平台发布。该研究由Zishan Shao等13位作者共同完成,旨在探索大型语言模型在解码阶段决策过程中的共享子空间。论文通过分析模型生成文本时的内部表示,揭示了不同解码路径中存在的共同模式,为理解LLM的推理机制提供了新视角。研究团队还提供了论文的PDF、HTML及TeX源码,并开放了相关代码和数据链接,便于其他研究者复现和验证。 #LLM #大模型 #解码 #共享子空间 #AI研究 #arXiv
PlanE:面向抽取式大语言模型的数据、调优与推理元规划

一篇题为《PlanE:面向抽取式大语言模型的数据、调优与推理元规划》的学术论文在arXiv上发布。该研究由Jiacheng Wang等人撰写,提出了一种名为PlanE的元规划框架,旨在系统性地优化抽取式大语言模型在数据准备、模型调优和推理阶段的表现。论文探讨了如何通过全局规划策略,提升模型在信息提取等任务中的准确性和效率,为相关领域的研究提供了新的方法论。该工作已获得DOI编号,并可通过arXiv平台获取全文。 #arXiv #大语言模型 #抽取式模型 #元规划 #AI研究 #自然语言处理
大型语言模型个性化能力基准测试研究发布

近日,一篇题为《Benchmarking the Personalization Capabilities of Large Language Models》的论文在arXiv预印本平台发布。该论文由Ashutosh Srivastava等七位作者共同完成,提交于2026年5月23日。论文聚焦于大型语言模型(LLM)的个性化能力评估,提出了相应的基准测试方法。随着大模型在对话系统、推荐算法等领域的广泛应用,个性化能力成为关键指标。该研究为系统评估LLM在理解用户偏好、生成个性化响应等方面的表现提供了标准化参考,对推动相关技术的发展具有积极意义。 #大型语言模型 #个性化 #基准测试 #arXiv #AI #LLM #论文 #学术研究
稳健批评者

一篇来自arXiv的最新研究论文提出名为“稳健批评者”的新方法,旨在防御大型语言模型在多轮对话中遭遇的恶意攻击。该研究由Roman Belaire、Arunesh Sinha和Pradeep Varakantham共同完成。多轮对话攻击通过逐步引导模型泄露敏感信息或生成有害内容,对AI安全构成挑战。“稳健批评者”通过引入批判性审核机制,在每一轮交互中评估并阻断潜在攻击路径,从而提升模型鲁棒性。实验表明,该方法在多种攻击场景下显著降低模型被攻破的概率,且不影响正常对话质量。该研究为构建更安全、可信的对话式AI系统提供了新思路。 #LLM #安全 #多轮攻击 #AI防御 #论文 #arXiv #人工智能
不完整提示越狱攻击

据arXiv预印本平台显示,一篇题为《Incomplete Prompt Jailbreaks in Large Language Models》的论文由Yeonjea Kim等作者提交。该研究聚焦大语言模型中的“不完整提示越狱”现象,探讨攻击者如何利用部分缺失或模糊提示绕过模型安全限制,对模型安全性构成潜在威胁。论文提交于2026年5月24日,属于计算机科学领域,目前提供PDF版本预览。 #大模型 #AI安全 #越狱攻击 #预印本 #arXiv #计算机科学
VeriSimpl:基于简化验证的自然语言鲁棒优化建模方法

来自arXiv的一篇预印本论文提出了VeriSimpl方法,旨在从自然语言描述中构建鲁棒优化模型。该方法通过基于简化的验证技术,将非专业用户的自然语言需求自动转化为数学优化问题,并确保模型在不确定性条件下的鲁棒性。研究团队设计了从语言输入到优化模型的转换流程,包括简化规则和验证机制,以提升建模的准确性与可靠性。该方法有望降低优化建模的门槛,使非专家用户也能利用鲁棒优化技术解决实际问题。论文作者包括Sumaya Abdul Rahman等四位研究人员,于2026年5月提交。 #arXiv #鲁棒优化 #自然语言处理 #建模 #AI #学术论文 #验证
SonicSampler论文提出统一Tile感知内核,优化LLM采样与推测验证

日前,一篇题为《SonicSampler: Unified Tile-Aware Kernels for LLM Sampling and Speculative Verification》的论文提交至arXiv预印本平台。该论文由Pragaash Ponnusamy与其他三位作者共同完成,提出了一种统一的Tile感知内核设计,专门针对大语言模型(LLM)推理过程中的两大核心环节——随机采样和推测验证进行加速。采样与推测验证在文本生成中占据关键计算比重,直接影响模型响应速度和部署成本。SonicSampler通过将分散的计算步骤整合为统一内核,并利用Tile级别的数据局部性优化,减少内存访问开销,提升整体吞吐量。该工作为LLM推理效率的提升提供了新的思路,有望推动大模型在实时应用中的落地与普及。 #SonicSampler #LLM #采样 #推测验证 #Tile感知 #内核优化 #AI #大模型 #arXiv
大语言模型多传感器物理危害评估基准测试研究发布

近日,一篇题为《Benchmarking Large Language Models on Multi-Sensor Physical Hazard Assessment》的论文在arXiv预印本平台发布。该论文由Faizan Iqbal等人提交,提交时间为2026年5月25日。研究旨在系统评估大语言模型在多传感器物理危害评估任务中的表现,通过设计一系列基准测试,检验模型对灾害场景的理解与判断能力。这项工作为将AI技术应用于物理安全、灾害预警等关键领域提供了重要参考,也为后续模型优化和评估标准建立奠定了基础。 #大语言模型 #物理危害评估 #多传感器 #基准测试 #arXiv #AI安全 #灾害预警 #机器学习
半监督文本属性图蒸馏新研究登上arXiv

一篇题为《Semi-Supervised Text-Attributed Graph Distillation》的论文近日在arXiv预印本平台公开,由Yurui Lai等三位学者完成,提交于2026年5月27日。该研究聚焦半监督学习场景下的文本属性图知识蒸馏问题,旨在通过蒸馏技术优化图表示学习在有限标注数据下的性能。文本属性图融合了图结构与节点文本特征,广泛存在于社交网络、学术图谱等应用中,该工作有望在降低标注成本的同时提升模型鲁棒性。目前论文PDF已开放访问,具体技术细节有待进一步查阅。 #SemiSupervisedLearning #TextAttributedGraph #KnowledgeDistillation #GraphNeuralNetworks #arXiv #MachineLearning #DeepLearning #YuruiLai
超越“说谎者基准”:谎言类型、深度与稀疏性对LLM谎言检测的影响

一篇来自arXiv的预印本论文《Beyond Liars' Bench: The Impact of Lie Typology, Depth, and Sparsity on Deception Detection in LLMs》由Amr Moustafa等人撰写。该研究系统探讨了谎言的不同类型、深度和稀疏性如何影响大型语言模型(LLM)的谎言检测能力。传统基准“Liars' Bench”可能无法全面评估模型的防欺骗性能,而该工作通过引入更细致的谎言分类和量化维度(如谎言层次、稀疏分布),揭示了现有检测方法的局限性,指出不同谎言类型对模型检测难度差异显著。该研究为提升LLM的诚实性与安全性提供了新的评估视角和方法论基础,对AI安全领域具有参考价值。 #LLM #谎言检测 #AI安全 #arXiv #预印本 #自然语言处理 #欺骗检测 #大模型安全
通过约束多源推断实现配电系统可扩展拓扑推断

2026年5月30日,一篇关于配电系统拓扑推断的论文在arXiv平台提交。该论文由Haoran Li、Lihao Mai等人撰写,提出一种基于约束多源推断的可扩展方法,用于解决大规模配电网络中拓扑推断面临的效率与精度瓶颈。传统方法在处理复杂分布式系统时往往受限于数据稀疏和结构动态,新方法通过融合多源量测数据并施加物理约束,显著提升了模型在大规模场景下的推断能力与鲁棒性。该研究为智能电网的实时监测与运行优化提供了新的技术路径,相关论文尚未正式注册DOI,但已开放预览。 #配电系统 #拓扑推断 #约束多源推断 #可扩展性 #论文 #arXiv #智能电网 #电力系统 #人工智能
Routing Without Training: Controllable-Ratio LLM Offloading via Reliability Gating

Focus to learn more arXiv-issued DOI via DataCite (pending registration) Submission history From: Evan Chen [ view email ] [v1] Sat, 30 May 2026 06:42:55 UTC (4,153 KB) Full-text links: Access Paper: View a PDF of the paper titled Routing Without Training: Controllable-Ratio LLM Offloading via Reliability Gating, by Evan Chen and 4 other authors View PDF HTML (experimental) TeX Source view license Current browse context: < prev | next > new | recent | 2026-07 Change to browse by: cs References & Citations NASA ADS Google Scholar Semantic Scholar export BibTeX citation Loading... BibTeX formatted citation × loading... Data provided by: Bookmark Bibliographic Tools Bibliographic and Citation Tools Bibliographic Explorer Toggle Bibliographic Explorer ( What is the Explorer? ) Connected Paper
s Toggle Connected Papers ( What is Connected Papers? ) Litmaps Toggle Litmaps ( What is Litmaps? ) Toggle scite Smart Citations ( What are Smart Citations? ) Code, Data, Media Code, Data and Media Associated with this Article alphaXiv Toggle alphaXiv ( What is alphaXiv? ) Links to Code Toggle CatalyzeX Code Finder for Papers ( What is CatalyzeX? ) DagsHub Toggle DagsHub ( What is DagsHub? ) GotitPub Toggle ( What is GotitPub? ) Huggingface Toggle Hugging Face ( What is Huggingface? ) ScienceCast Toggle ScienceCast ( What is ScienceCast? ) Demos Demos Replicate Toggle Replicate ( What is Replicate? ) Spaces Toggle Hugging Face Spaces ( What is Spaces? ) Spaces Toggle ( What is ? ) Related Papers Recommenders and Search Tools Link to Influence Flower Influence Flower ( What are Influence Flowers? ) Core recommender toggle CORE Recommender ( What is CORE? ) Author Venue Institution Topic About arXivLabs arXivLabs: experimental projects with community collaborators arXivLabs is a framework that allows collaborators to develop and share new arXiv features directly on our website. Both individuals and organizations that work with arXivLabs have embraced and accepted our values of openness, community, excellence, and user data privacy. arXiv is committed to these values and only works with partners that adhere to them. Have an idea for a project that will add value for arXiv's community? Learn more about arXivLabs .
PersonaTrail:通过浏览轨迹评估个性化网页代理的新基准

arXiv上发布了一篇名为《PersonaTrail: Benchmarking Personalized Web Agents through Browsing Trails》的论文。该研究由Seungbin Yang等人提出,针对现有网页代理缺乏个性化能力的问题,创建了一个新基准。PersonaTrail通过模拟用户在真实网站上的浏览轨迹,测试代理能否根据用户历史行为、偏好和任务目标,自主完成网页操作。该方法不仅评估代理的导航和交互能力,更关注其理解用户意图的个性化水平。该基准有望推动更智能、更贴合用户需求的网页代理开发,为AI在浏览器自动化领域的应用提供标准化测试框架。 #AI #网页代理 #个性化 #基准测试 #arXiv #科技新闻 #人机交互
自回归语言模型可处理层次控制研究提出新框架

一篇题为“Tractable Hierarchical Control of Autoregressive Language Models”(自回归语言模型的可处理层次控制)的论文于2026年6月1日提交至arXiv预印本平台。该研究由Maximilian Scribner(Max Scribner)与其他两位作者合作完成,目前论文的PDF和HTML版本已开放预览。论文聚焦自回归语言模型
拓扑正则化侧路径

来自arXiv的最新论文提出了一种新颖的拓扑正则化侧路径技术,旨在解决大语言模型训练中常见的表示坍缩问题。研究团队发现,标准训练方法会导致模型潜在表示空间的退化,即不同输入产生高度相似的隐层特征,严重限制模型表达能力。该方法通过在主网络旁附加一条拓扑约束的侧路径,利用谱分析对表示流形进行正则化,强制保持拓扑多样性。实验表明,该技术显著提升了模型在多任务上的泛化能力,避免了信息丢失,且几乎不增加推理计算开销。这项研究为改进大语言模型的可拓展性与鲁棒性提供了新的理论视角与实用工具。 #大语言模型 #表示坍缩 #拓扑正则化 #AI研究 #arXiv论文
语言模型期望对齐

近日,一篇名为《Expectation Alignment of Language Models for Real-World User Expectations》的论文在预印本平台arXiv提交。该论文由Miaomiao Li等六位研究者完成,主要探讨如何让语言模型更好地与真实用户的期望保持一致。研究指出,当前模型虽在各类基准上表现优异,但实际应用中常出现与用户预期偏差的问题。为此,作者提出“期望对齐”这一概念,从数据、训练和
OPTScientist:多智能体自动发现Transformer预训练优化器程序

一篇发表在arXiv上的论文提出了一种名为OPTScientist的新方法,利用多智能体系统自动发现针对Transformer预训练的类型化优化器程序。该方法通过多个智能体协同搜索,在优化器程序空间中进行探索,旨在提升大规模语言模型预训练的效率与性能。研究团队表示,这种方法能够自动生成比传统手工设计优化器更优的程序,并已在多个预训练任务上验证了其有效性。这项研究为自动化机器学习在优化器发现领域提供了新的思路,有望减少人工调参成本并加速Transformer模型的训练过程。 #arXiv #机器学习 #Transformer #优化器 #多智能体 #预训练 #AutoML #AI研究