表格大模型崛起
一种名为“表格大模型”(tabular LLMs)的新型预测模型正在颠覆传统数据分析方式。这类模型无需针对用户数据进行训练,即可像语言模型补全文本一样,零样本预测表格中缺失的列。在TabArena排行榜上,所有单模型超越最优化梯度提升树的记录均来自此类模型。作者在自有硬件上独立复现了最强开放权重模型TabICLv2,使用51个数据集的标准协议,耗时2.1小时(成本约2美元)完成验证。结果显示其性能与官方数据高度吻合,中位数相对差异仅0.08%,证实了排行榜的有效性。表格基础模型本质上是经过预训练的Transformer,通过上下文学习(in-context learning)工作:将已知标签的行作为上下文,模型通过注意力机制计算与待预测行的相似度并给出加权答案。近年来该家族快速壮大,包括TabPFN、TabICL系列、TabDPT及谷歌的TabFM等。尽管被称为“表格LLM”,但这些模型并非处理语言,而是直接处理表格中的单元格、列和行,使用无固定词汇表的数值与类别数据。 #表格大模型 #TabLLM #基础模型 #零样本预测 #机器学习 #AI #TabArena #TabICLv2
一种名为“表格大模型”(tabular LLMs)的新型预测模型正在颠覆传统数据分析方式。这类模型无需针对用户数据进行训练,即可像语言模型补全文本一样,零样本预测表格中缺失的列。在TabArena排行榜上,所有单模型超越最优化梯度提升树的记录均来自此类模型。作者在自有硬件上独立复现了最强开放权重模型TabICLv2,使用51个数据集的标准协议,耗时2.1小时(成本约2美元)完成验证。结果显示其性能与官方数据高度吻合,中位数相对差异仅0.08%,证实了排行榜的有效性。表格基础模型本质上是经过预训练的Transformer,通过上下文学习(in-context learning)工作:将已知标签的行作为上下文,模型通过注意力机制计算与待预测行的相似度并给出加权答案。近年来该家族快速壮大,包括TabPFN、TabICL系列、TabDPT及谷歌的TabFM等。尽管被称为“表格LLM”,但这些模型并非处理语言,而是直接处理表格中的单元格、列和行,使用无固定词汇表的数值与类别数据。 #表格大模型 #TabLLM #基础模型 #零样本预测 #机器学习 #AI #TabArena #TabICLv2
多代理系统负载感知缓存研究论文提交至arXiv
近日,一篇题为《Workload-Aware Caching for Multi-Agent Systems》的研究论文被提交至arXiv预印本平台。该论文由Anas Mohamed等六位作者共同完成,于2026年6月14日发布。论文聚焦于多代理系统中的缓存优化问题,提出了一种负载感知的缓存策略,通过动态感知各代理的工作负载来调整缓存分配,旨在提升系统整体效率和响应速度。该工作属于计算机科学领域,目前论文全文已开放访问,为分布式AI和物联网等场景中的代理协作提供了新的研究思路。 #多代理系统 #负载感知 #缓存 #人工智能 #arXiv #计算机科学 #研究论文
近日,一篇题为《Workload-Aware Caching for Multi-Agent Systems》的研究论文被提交至arXiv预印本平台。该论文由Anas Mohamed等六位作者共同完成,于2026年6月14日发布。论文聚焦于多代理系统中的缓存优化问题,提出了一种负载感知的缓存策略,通过动态感知各代理的工作负载来调整缓存分配,旨在提升系统整体效率和响应速度。该工作属于计算机科学领域,目前论文全文已开放访问,为分布式AI和物联网等场景中的代理协作提供了新的研究思路。 #多代理系统 #负载感知 #缓存 #人工智能 #arXiv #计算机科学 #研究论文
AISE-Bench:面向学术知识图谱信息检索的全周期基准测试
近日,一篇发表于ACM SIGKDD 2026的论文提出了AISE-Bench,这是一个专为学术知识图谱上的信息检索任务设计的全周期策划基准。该基准由Fanjin Zhang等10位作者共同完成,旨在系统评估模型在学术知识图谱中查找、推理和整合信息的能力。AISE-Bench覆盖了从查询理解到答案生成的完整流程,包含精心构建的测试集和评估指标,为相关研究提供了标准化评测平台。研究团队已在arXiv上公开论文全文及数据资源,以推动学术知识图谱信息检索领域的进展。 #学术知识图谱 #信息检索 #基准测试 #KDD2026 #AI #知识图谱 #科研工具
近日,一篇发表于ACM SIGKDD 2026的论文提出了AISE-Bench,这是一个专为学术知识图谱上的信息检索任务设计的全周期策划基准。该基准由Fanjin Zhang等10位作者共同完成,旨在系统评估模型在学术知识图谱中查找、推理和整合信息的能力。AISE-Bench覆盖了从查询理解到答案生成的完整流程,包含精心构建的测试集和评估指标,为相关研究提供了标准化评测平台。研究团队已在arXiv上公开论文全文及数据资源,以推动学术知识图谱信息检索领域的进展。 #学术知识图谱 #信息检索 #基准测试 #KDD2026 #AI #知识图谱 #科研工具
新论文提出FlowEdit
近日,一篇题为《FlowEdit: Information-Theoretic Control of LLM Reasoning Flows for Ill-posed Problems Involving Conflicts》的学术论文在arXiv平台发布。该研究由Sizhe Tang等六位作者共同完成,针对大语言模型(LLM)在处理涉及冲突的不当问题(ill-posed problems)时推理能力不足的挑战,提出了一种名为FlowEdit的新方法。FlowEdit从信息论角度入手,通过控制LLM的推理流(reasoning flows),引导模型在矛盾信息中做出更合理、稳健的判断。实验表明,该方法能有效提升LLM在复杂冲突场景下的推理准确性和鲁棒性,为未来构建更可靠、能应对真实世界模糊问题的AI系统提供了新的理论框架与技术路径。 #AI #大模型 #LLM #推理 #信息论 #论文 #FlowEdit #arXiv
近日,一篇题为《FlowEdit: Information-Theoretic Control of LLM Reasoning Flows for Ill-posed Problems Involving Conflicts》的学术论文在arXiv平台发布。该研究由Sizhe Tang等六位作者共同完成,针对大语言模型(LLM)在处理涉及冲突的不当问题(ill-posed problems)时推理能力不足的挑战,提出了一种名为FlowEdit的新方法。FlowEdit从信息论角度入手,通过控制LLM的推理流(reasoning flows),引导模型在矛盾信息中做出更合理、稳健的判断。实验表明,该方法能有效提升LLM在复杂冲突场景下的推理准确性和鲁棒性,为未来构建更可靠、能应对真实世界模糊问题的AI系统提供了新的理论框架与技术路径。 #AI #大模型 #LLM #推理 #信息论 #论文 #FlowEdit #arXiv
MKEvolve
近日,一篇题为《MKEvolve: A Modular Multi-Agent Framework for Kernel Code Generation》的论文在arXiv平台发布。该论文由Jinsoo Yoo等人撰写,提出了一种模块化多智能体框架,旨在自动化操作系统内核代码的生成过程。传统内核开发高度依赖人工编写,任务复杂且易错;MKEvolve通过将代码生成任务拆解,并让多个专用智能体协作完成模块构建与整合,有望提升开发效率与代码可靠性。这一研究将多智能体协作机制引入系统底层软件生成领域,为操作系统自动构建与内核编程工具的发展提供了新思路。 #MKEvolve #内核代码生成 #多智能体框架 #模块化设计 #AI #代码自动化 #操作系统 #arXiv #论文
近日,一篇题为《MKEvolve: A Modular Multi-Agent Framework for Kernel Code Generation》的论文在arXiv平台发布。该论文由Jinsoo Yoo等人撰写,提出了一种模块化多智能体框架,旨在自动化操作系统内核代码的生成过程。传统内核开发高度依赖人工编写,任务复杂且易错;MKEvolve通过将代码生成任务拆解,并让多个专用智能体协作完成模块构建与整合,有望提升开发效率与代码可靠性。这一研究将多智能体协作机制引入系统底层软件生成领域,为操作系统自动构建与内核编程工具的发展提供了新思路。 #MKEvolve #内核代码生成 #多智能体框架 #模块化设计 #AI #代码自动化 #操作系统 #arXiv #论文
因子化概率分布可比性研究论文在arXiv发表
据arXiv平台信息,一篇题为《Inducing Comparability of Factorised Probability Distributions》的学术论文于2026年6月提交,作者包括Jan Speller、Malte Luttermann、Marcel Gehrke和Tanya Braun。该论文聚焦于因子化概率分布的可比性问题,这类分布是概率图模型与机器学习中的核心工具,但不同分布间的直接比较长期缺乏有效手段。研究提出一种系统性方法,通过数学结构诱导分布间的可比性,有望提升概率推理、不确定建模及决策分析等任务的效率与一致性。目前论文提供PDF与HTML全文下载,并配有多种学术工具链接。 #因子化概率分布 #可比性 #机器学习 #概率推理 #arXiv #计算机科学 #学术论文
据arXiv平台信息,一篇题为《Inducing Comparability of Factorised Probability Distributions》的学术论文于2026年6月提交,作者包括Jan Speller、Malte Luttermann、Marcel Gehrke和Tanya Braun。该论文聚焦于因子化概率分布的可比性问题,这类分布是概率图模型与机器学习中的核心工具,但不同分布间的直接比较长期缺乏有效手段。研究提出一种系统性方法,通过数学结构诱导分布间的可比性,有望提升概率推理、不确定建模及决策分析等任务的效率与一致性。目前论文提供PDF与HTML全文下载,并配有多种学术工具链接。 #因子化概率分布 #可比性 #机器学习 #概率推理 #arXiv #计算机科学 #学术论文
优化超图RAG:arXiv新论文聚焦事实提取与分块检索
一篇题为《Optimizing Hypergraph-Based RAG: Toward Better Fact Extraction and Chunk Retrieval》的论文于2026年7月2日提交至arXiv预印本平台。该论文由Houda Khrouf等研究人员撰写,聚焦于基于超图结构的检索增强生成(RAG)优化问题。针对传统RAG在事实提取与分块检索中存在的精度和效率瓶颈,作者提出通过超图对文本中的实体、关系及上下文连接进行高阶建模,从而改善检索质量与知识对齐效果。论文虽尚未完成DataCite注册,但已提供PDF全文预览。这一研究有望为RAG框架在知识密集型任务中的应用提供新的方法论支持,对提升大模型外部知识融合能力具有参考价值。 #arXiv #论文 #RAG #超图 #事实提取 #分块检索 #AI #大模型 #知识检索 #优化
一篇题为《Optimizing Hypergraph-Based RAG: Toward Better Fact Extraction and Chunk Retrieval》的论文于2026年7月2日提交至arXiv预印本平台。该论文由Houda Khrouf等研究人员撰写,聚焦于基于超图结构的检索增强生成(RAG)优化问题。针对传统RAG在事实提取与分块检索中存在的精度和效率瓶颈,作者提出通过超图对文本中的实体、关系及上下文连接进行高阶建模,从而改善检索质量与知识对齐效果。论文虽尚未完成DataCite注册,但已提供PDF全文预览。这一研究有望为RAG框架在知识密集型任务中的应用提供新的方法论支持,对提升大模型外部知识融合能力具有参考价值。 #arXiv #论文 #RAG #超图 #事实提取 #分块检索 #AI #大模型 #知识检索 #优化
MiniCache论文提出利用小型模型接口缓存加速LLM推理
一篇由Jingquan Chen等人撰写的论文《MiniCache: Reusable Program Caching with Small Model Interfaces for Efficient LLM Inference》于2026年7月3日提交至arXiv。该论文聚焦大语言模型(LLM)推理效率优化,提出一种基于小型模型接口的可重用程序缓存机制。通过缓存程序执行结果并复用,该方法旨在减少LLM推理过程中的重复计算,从而降低延迟与计算资源消耗,为高效部署LLM提供新思路。论文已在arXiv平台公开,并提供PDF全文下载。 #MiniCache #LLM #推理效率 #程序缓存 #模型优化 #arXiv #论文
一篇由Jingquan Chen等人撰写的论文《MiniCache: Reusable Program Caching with Small Model Interfaces for Efficient LLM Inference》于2026年7月3日提交至arXiv。该论文聚焦大语言模型(LLM)推理效率优化,提出一种基于小型模型接口的可重用程序缓存机制。通过缓存程序执行结果并复用,该方法旨在减少LLM推理过程中的重复计算,从而降低延迟与计算资源消耗,为高效部署LLM提供新思路。论文已在arXiv平台公开,并提供PDF全文下载。 #MiniCache #LLM #推理效率 #程序缓存 #模型优化 #arXiv #论文
SiGMA:符号引导的多模态持续指令微调合并与适应方法
近日,一篇题为《SiGMA: Sign-Guided Merging and Adaptation for Multimodal Continual Instruction Tuning》的论文提交至arXiv。该研究由Keonhee Park和Gunhee Kim完成,针对多模态模型在持续指令微调场景中面临的知识遗忘与适应难题,提出了一种符号引导的合并与适应方法(SiGMA)。该方法利用训练过程中的符号信息对模型参数进行动态合并与调整,使模型能在连续执行多项指令任务时兼顾旧知识保留与新知识吸收,从而提升持续学习的稳定性与效率。这一工作为多模态大模型在动态任务环境中的部署提供了新的技术路径。 #SiGMA #多模态 #持续学习 #指令微调 #AI #大模型 #arXiv #论文
近日,一篇题为《SiGMA: Sign-Guided Merging and Adaptation for Multimodal Continual Instruction Tuning》的论文提交至arXiv。该研究由Keonhee Park和Gunhee Kim完成,针对多模态模型在持续指令微调场景中面临的知识遗忘与适应难题,提出了一种符号引导的合并与适应方法(SiGMA)。该方法利用训练过程中的符号信息对模型参数进行动态合并与调整,使模型能在连续执行多项指令任务时兼顾旧知识保留与新知识吸收,从而提升持续学习的稳定性与效率。这一工作为多模态大模型在动态任务环境中的部署提供了新的技术路径。 #SiGMA #多模态 #持续学习 #指令微调 #AI #大模型 #arXiv #论文
Research on Reliability-Aware LLM Alignment from Inconsistent Human Feedback
一篇题为“Reliability-Aware LLM Alignment from Inconsistent Human Feedback”的论文于2026年7月7日提交至arXiv预印本平台。该论文由Jingyi Huang等六位学者完成,属于计算机科学(cs)领域。研究聚焦大语言模型对齐中的关键难题:人类反馈常常存在不一致性,这会影响对齐过程的有效性和可靠性。作者由此提出“可靠性感知”的对齐方法,旨在系统应对反馈不一致带来的挑战,从而提升模型与人类意图对齐的稳健性。该工作为构建更可靠、可信任的AI系统提供了新的思路和理论支持。 #LLM #对齐 #人类反馈 #可靠性 #AI #论文 #arXiv #计算机科学
一篇题为“Reliability-Aware LLM Alignment from Inconsistent Human Feedback”的论文于2026年7月7日提交至arXiv预印本平台。该论文由Jingyi Huang等六位学者完成,属于计算机科学(cs)领域。研究聚焦大语言模型对齐中的关键难题:人类反馈常常存在不一致性,这会影响对齐过程的有效性和可靠性。作者由此提出“可靠性感知”的对齐方法,旨在系统应对反馈不一致带来的挑战,从而提升模型与人类意图对齐的稳健性。该工作为构建更可靠、可信任的AI系统提供了新的思路和理论支持。 #LLM #对齐 #人类反馈 #可靠性 #AI #论文 #arXiv #计算机科学
CANN Bench:在真实NPU上评估AI代理生成内核性能
据arXiv预印本,由Xue-Jian Gao等15位作者提出的CANN Bench基准测试,旨在系统评估AI代理自动生成的核(kernel)在神经网络处理单元(NPU)上的实际表现,并与理论算法极限进行对比。该研究于2026年7月发布,通过一系列标准化任务度量生成内核的计算效率、资源利用率及距离理论极限的差距。初步结果表明,某些AI生成内核已接近甚至超越手工优化版本,但在复杂场景下仍有优化空间。CANN Bench为自动化内核生成技术提供了标准化评估框架,有望推动AI芯片软件生态的发展。 #CANNBench #AI #NPU #内核生成 #基准测试 #机器学习系统 #学术论文 #arXiv
据arXiv预印本,由Xue-Jian Gao等15位作者提出的CANN Bench基准测试,旨在系统评估AI代理自动生成的核(kernel)在神经网络处理单元(NPU)上的实际表现,并与理论算法极限进行对比。该研究于2026年7月发布,通过一系列标准化任务度量生成内核的计算效率、资源利用率及距离理论极限的差距。初步结果表明,某些AI生成内核已接近甚至超越手工优化版本,但在复杂场景下仍有优化空间。CANN Bench为自动化内核生成技术提供了标准化评估框架,有望推动AI芯片软件生态的发展。 #CANNBench #AI #NPU #内核生成 #基准测试 #机器学习系统 #学术论文 #arXiv
大语言模型数学推理鲁棒性研究登上arXiv
一篇题为“Representation Robustness Under Executable Reasoning Constraints in Large Language Models for Mathematical Problem Solving”的学术论文于2026年7月8日提交至arXiv预印本平台。该论文由Sagnik Nath等人撰写,重点研究大语言模型在数学问题求解过程中,面对可执行推理约束时的表示鲁棒性问题。研究团队通过设计特定的约束条件,系统评估模型在数学推理中的稳定性与可靠性,旨在揭示模型在复杂推理任务中可能存在的脆弱性。这一成果对于提升大语言模型在教育、科学计算等领域的应用安全性具有重要参考价值。 #大模型 #数学推理 #鲁棒性 #AI安全 #arXiv #学术研究 #机器学习 #自然语言处理
一篇题为“Representation Robustness Under Executable Reasoning Constraints in Large Language Models for Mathematical Problem Solving”的学术论文于2026年7月8日提交至arXiv预印本平台。该论文由Sagnik Nath等人撰写,重点研究大语言模型在数学问题求解过程中,面对可执行推理约束时的表示鲁棒性问题。研究团队通过设计特定的约束条件,系统评估模型在数学推理中的稳定性与可靠性,旨在揭示模型在复杂推理任务中可能存在的脆弱性。这一成果对于提升大语言模型在教育、科学计算等领域的应用安全性具有重要参考价值。 #大模型 #数学推理 #鲁棒性 #AI安全 #arXiv #学术研究 #机器学习 #自然语言处理
注意力退化与功能标记锚定
一篇来自arXiv的论文“Attention Degradation, Function Token Anchoring, and the Limits of Attention-Based Intervention in Large Language Models”探讨了大语言模型内部注意力机制的关键问题。研究首次提出“注意力退化”与“功能标记锚定”两个概念,揭示了模型在复杂推理任务中注意力分布失效的现象,以及特定功能标记如何不合理地锚定模型关注点。论文进一步分析了当前基于注意力机制的干预方法(如注意力编辑)的局限性,指出这些方法在修正模型行为时存在根本性瓶颈,无法有效应对深层注意力退化带来的影响。该工作由Sagar Dangal等研究者完成,为大语言模型的可解释性研究提供了新的理论视角。 #AttentionDegradation #FunctionTokenAnchoring #大语言模型 #注意力机制 #可解释性 #AI #论文
一篇来自arXiv的论文“Attention Degradation, Function Token Anchoring, and the Limits of Attention-Based Intervention in Large Language Models”探讨了大语言模型内部注意力机制的关键问题。研究首次提出“注意力退化”与“功能标记锚定”两个概念,揭示了模型在复杂推理任务中注意力分布失效的现象,以及特定功能标记如何不合理地锚定模型关注点。论文进一步分析了当前基于注意力机制的干预方法(如注意力编辑)的局限性,指出这些方法在修正模型行为时存在根本性瓶颈,无法有效应对深层注意力退化带来的影响。该工作由Sagar Dangal等研究者完成,为大语言模型的可解释性研究提供了新的理论视角。 #AttentionDegradation #FunctionTokenAnchoring #大语言模型 #注意力机制 #可解释性 #AI #论文
GPT-5.5 Pro 自动否证实数域上的和积猜想
一篇来自预印本平台 arXiv 的论文提出,研究者利用 OpenAI 最新大模型 GPT-5.5 Pro 在实数域上自动构建了和积猜想(sum-product conjecture)的反例,从而完成了对该猜想的自动否证。和积猜想是组合数论中的经典问题,此前在有限域上已有大量研究,但在实数域上的自动推理仍属前沿尝试。该工作展示了大型语言模型在高等数学领域进行自主推理与反例构造的潜力,或为 AI 辅助数学研究开辟新路径。论文作者为 Yichen Huang,提交于 2026 年 7 月 9 日。 #数学 #AI #大模型 #GPT5.5 #arXiv #和积猜想 #自动推理
一篇来自预印本平台 arXiv 的论文提出,研究者利用 OpenAI 最新大模型 GPT-5.5 Pro 在实数域上自动构建了和积猜想(sum-product conjecture)的反例,从而完成了对该猜想的自动否证。和积猜想是组合数论中的经典问题,此前在有限域上已有大量研究,但在实数域上的自动推理仍属前沿尝试。该工作展示了大型语言模型在高等数学领域进行自主推理与反例构造的潜力,或为 AI 辅助数学研究开辟新路径。论文作者为 Yichen Huang,提交于 2026 年 7 月 9 日。 #数学 #AI #大模型 #GPT5.5 #arXiv #和积猜想 #自动推理