KGCache:面向大语言模型知识图谱推理的摊销子图检索方法
一篇题为《KGCache: Amortized Subgraph Retrieval for KG Reasoning with LLMs》的学术论文近日在arXiv上发布。该研究由Uros Stanic等人提出,旨在解决大语言模型在知识图谱推理中面临的子图检索效率问题。KGCache方法通过摊销计算策略,将子图检索过程进行优化,从而提升LLM在复杂知识推理任务中的性能与速度。论文展示了该方法在多个基准上的有效性,为知识图谱与大模型的结合提供了新的技术路径。 #KGCache #知识图谱 #大语言模型 #子图检索 #AI推理 #arXiv #学术论文
一篇题为《KGCache: Amortized Subgraph Retrieval for KG Reasoning with LLMs》的学术论文近日在arXiv上发布。该研究由Uros Stanic等人提出,旨在解决大语言模型在知识图谱推理中面临的子图检索效率问题。KGCache方法通过摊销计算策略,将子图检索过程进行优化,从而提升LLM在复杂知识推理任务中的性能与速度。论文展示了该方法在多个基准上的有效性,为知识图谱与大模型的结合提供了新的技术路径。 #KGCache #知识图谱 #大语言模型 #子图检索 #AI推理 #arXiv #学术论文
多页面视觉丰富文档理解中的失败定位
近日,一篇题为《Locating Failure in Multi-Page Visually Rich Document Understanding: An Empirical Attribution》的论文在arXiv上发布,作者为Lewei Xu及另外7位研究者。该研究聚焦于多页面视觉丰富文档理解任务中的失败现象,旨在通过实证归因的方法,系统定位模型在处理复杂文档时出错的根源。视觉丰富文档通常包含布局、表格、图像等多种信息,多页面场景进一步增加了理解难度,模型在此类任务中的失败机制尚缺乏深入分析。论文通过归因手段考察失败案例,尝试揭示不同因素对错误结果的影响,为提升文档理解模型的鲁棒性和可解释性提供了新的研究视角。该工作或对文档智能、信息抽取等应用领域产生参考价值。 #arXiv #论文 #文档理解 #多页面 #视觉丰富 #实证归因 #AI #NLP
近日,一篇题为《Locating Failure in Multi-Page Visually Rich Document Understanding: An Empirical Attribution》的论文在arXiv上发布,作者为Lewei Xu及另外7位研究者。该研究聚焦于多页面视觉丰富文档理解任务中的失败现象,旨在通过实证归因的方法,系统定位模型在处理复杂文档时出错的根源。视觉丰富文档通常包含布局、表格、图像等多种信息,多页面场景进一步增加了理解难度,模型在此类任务中的失败机制尚缺乏深入分析。论文通过归因手段考察失败案例,尝试揭示不同因素对错误结果的影响,为提升文档理解模型的鲁棒性和可解释性提供了新的研究视角。该工作或对文档智能、信息抽取等应用领域产生参考价值。 #arXiv #论文 #文档理解 #多页面 #视觉丰富 #实证归因 #AI #NLP
TongGuOCR:面向中文历史文档的布局感知与标记增强OCR框架问世
近日,一篇题为《TongGuOCR: A Layout-Aware and Token-Augmented OCR Framework for Chinese Historical Documents》的论文在arXiv平台发布。该研究由Zhongheng Zhou等人共同完成,提出了一种专为中文历史文献设计的OCR框架。传统OCR在识别古籍、手写档案等复杂版面时,常因排版混乱、文字残缺或字符生僻而效果不佳。TongGuOCR通过引入版面感知机制与标记增强技术,在识别过程中同时利用文档的空间布局信息和语义标记信息,从而提升对历史文档的字符识别准确率与段落还原能力。该框架有望为历史文献数字化、古籍整理及档案检索提供更可靠的技术支撑。目前论文已提供PDF及HTML全文链接,相关代码与数据资源也有待进一步公开。 #OCR #中文历史文档 #古籍数字化 #布局感知 #标记增强 #论文 #arXiv #人工智能 #自然语言处理
近日,一篇题为《TongGuOCR: A Layout-Aware and Token-Augmented OCR Framework for Chinese Historical Documents》的论文在arXiv平台发布。该研究由Zhongheng Zhou等人共同完成,提出了一种专为中文历史文献设计的OCR框架。传统OCR在识别古籍、手写档案等复杂版面时,常因排版混乱、文字残缺或字符生僻而效果不佳。TongGuOCR通过引入版面感知机制与标记增强技术,在识别过程中同时利用文档的空间布局信息和语义标记信息,从而提升对历史文档的字符识别准确率与段落还原能力。该框架有望为历史文献数字化、古籍整理及档案检索提供更可靠的技术支撑。目前论文已提供PDF及HTML全文链接,相关代码与数据资源也有待进一步公开。 #OCR #中文历史文档 #古籍数字化 #布局感知 #标记增强 #论文 #arXiv #人工智能 #自然语言处理
基准污染检测的极限
一篇题为《基准污染何时可检测?信息极限与功效校准审计》的学术论文近日在arXiv预印本平台发布,作者为Ibne Farabi Shihab等人。该研究聚焦机器学习基准测试中的数据污染问题,探讨在何种信息条件下,基准污染能够被可靠检测。论文引入信息论视角,分析了检测污染的统计极限,并提出一种基于统计功效校准的审计方法,帮助研究者在有限样本下更准确地判断模型评测结果是否受到污染影响。研究指出,并非所有污染都必然可探测,检测能力取决于数据重叠程度、模型行为差异及审计策略等因素。该成果为AI评测的透明性和可信度提供了理论支持,对未来大模型基准设计具有参考价值。 #论文 #arXiv #机器学习 #基准污染 #AI评测 #数据审计 #统计功效 #学术研究
一篇题为《基准污染何时可检测?信息极限与功效校准审计》的学术论文近日在arXiv预印本平台发布,作者为Ibne Farabi Shihab等人。该研究聚焦机器学习基准测试中的数据污染问题,探讨在何种信息条件下,基准污染能够被可靠检测。论文引入信息论视角,分析了检测污染的统计极限,并提出一种基于统计功效校准的审计方法,帮助研究者在有限样本下更准确地判断模型评测结果是否受到污染影响。研究指出,并非所有污染都必然可探测,检测能力取决于数据重叠程度、模型行为差异及审计策略等因素。该成果为AI评测的透明性和可信度提供了理论支持,对未来大模型基准设计具有参考价值。 #论文 #arXiv #机器学习 #基准污染 #AI评测 #数据审计 #统计功效 #学术研究
GRACE 论文提出基于大语言模型的语义度量空间,用于可扩展混合数据聚类
一篇题为《GRACE: LLM-Grounded Semantic Metric Spaces for Scalable Mixed-Data Clustering》的研究论文已提交至 arXiv。该研究针对混合数据聚类中数值、类别等异构属性难以统一处理的痛点,提出 GRACE 框架,利用大语言模型的语义理解能力,将不同类型的数据映射到统一的语义度量空间,从而提升聚类性能与可扩展性。论文已上线并提供 PDF 与 HTML 版本,相关代码、数据及工具链接也已同步发布。该方法有望为大规模真实场景中的混合数据挖掘提供更高效的技术路径。 #GRACE #大模型 #混合数据聚类 #语义度量空间 #arXiv #AI #机器学习
一篇题为《GRACE: LLM-Grounded Semantic Metric Spaces for Scalable Mixed-Data Clustering》的研究论文已提交至 arXiv。该研究针对混合数据聚类中数值、类别等异构属性难以统一处理的痛点,提出 GRACE 框架,利用大语言模型的语义理解能力,将不同类型的数据映射到统一的语义度量空间,从而提升聚类性能与可扩展性。论文已上线并提供 PDF 与 HTML 版本,相关代码、数据及工具链接也已同步发布。该方法有望为大规模真实场景中的混合数据挖掘提供更高效的技术路径。 #GRACE #大模型 #混合数据聚类 #语义度量空间 #arXiv #AI #机器学习
新研究提出SurgLAT方法,用于深度感知机器人腹腔镜控制
一项发表于arXiv的预印本研究提出了一种名为SurgLAT(Surgical Latent Attention Tracking)的新型手术机器人腹腔镜控制方法。该方法结合潜在注意力跟踪机制与深度感知技术,旨在提升腹腔镜在手术过程中的自动跟踪与操作精度。论文由Rulin Zhou等13位研究人员共同完成,于2026年8月8日提交至arXiv平台。该研究为智能手术机器人的自动化控制提供了新思路,未来有望改善微创手术的稳定性和安全性。 #SurgLAT #手术机器人 #腹腔镜 #深度学习 #arXiv #医学AI #机器人控制 #深度感知
一项发表于arXiv的预印本研究提出了一种名为SurgLAT(Surgical Latent Attention Tracking)的新型手术机器人腹腔镜控制方法。该方法结合潜在注意力跟踪机制与深度感知技术,旨在提升腹腔镜在手术过程中的自动跟踪与操作精度。论文由Rulin Zhou等13位研究人员共同完成,于2026年8月8日提交至arXiv平台。该研究为智能手术机器人的自动化控制提供了新思路,未来有望改善微创手术的稳定性和安全性。 #SurgLAT #手术机器人 #腹腔镜 #深度学习 #arXiv #医学AI #机器人控制 #深度感知
论文提出“工作簿时间机器”方法,用于改进电子表格创建基准测试
一篇题为《Back to the Future: A workbook time machine for spread sheet creation benchmarks》的论文近期出现在arXiv预印本平台,作者包括Mansi Uniyal等8人。该研究针对电子表格创建任务中基准数据集的构建难题,提出了一种类似“时间机器”的工作簿生成方法,可回溯并重构历史电子表格状态,为模型评估提供更真实、多样的训练与测试样本。论文已提供PDF、HTML及源码等访问方式,并支持引用管理工具。 #论文 #arXiv #电子表格 #基准测试 #AI #人工智能 #研究
一篇题为《Back to the Future: A workbook time machine for spread sheet creation benchmarks》的论文近期出现在arXiv预印本平台,作者包括Mansi Uniyal等8人。该研究针对电子表格创建任务中基准数据集的构建难题,提出了一种类似“时间机器”的工作簿生成方法,可回溯并重构历史电子表格状态,为模型评估提供更真实、多样的训练与测试样本。论文已提供PDF、HTML及源码等访问方式,并支持引用管理工具。 #论文 #arXiv #电子表格 #基准测试 #AI #人工智能 #研究