AI知识库 @ai521
734 subscribers
30.2K photos
59 videos
27 files
1.25K links
@ai521 专注分享最实用的AI内容

🤖 AI教程(新手到进阶)
🧠 AI知识科普(大模型 / 提示词 / 自动化)
📰 AI资讯更新(每日最新AI动态)
📚 AI实战技巧(写作 / 绘画 / 编程 / 赚钱)
🔧 最新AI工具推荐

每天更新AI干货
长期做一个真正有价值的AI频道
Download Telegram
ZhuLong:面向EDA脚本编写的执行接地LLM代理

一项名为“ZhuLong”的研究成果在arXiv上公开发布。该研究提出了一种面向电子设计自动化(EDA)脚本编写场景的大语言模型(LLM)代理方法,通过“执行接地”与“离线API自我探索”机制,提升模型对EDA工具接口的调用能力与脚本生成准确性。研究团队由杨刘等16位作者组成,论文于2026年8月提交,目前提供PDF、HTML及TeX源码等访问形式。该工作旨在突破传统LLM在专业工程脚本任务中依赖在线反馈的局限,为复杂芯片设计自动化流程提供更可靠的智能辅助方案。 #EDA #LLM #AI代理 #电子设计自动化 #论文 #arXiv
TongGuOCR:面向中文历史文档的布局感知与标记增强OCR框架问世

近日,一篇题为《TongGuOCR: A Layout-Aware and Token-Augmented OCR Framework for Chinese Historical Documents》的论文在arXiv平台发布。该研究由Zhongheng Zhou等人共同完成,提出了一种专为中文历史文献设计的OCR框架。传统OCR在识别古籍、手写档案等复杂版面时,常因排版混乱、文字残缺或字符生僻而效果不佳。TongGuOCR通过引入版面感知机制与标记增强技术,在识别过程中同时利用文档的空间布局信息和语义标记信息,从而提升对历史文档的字符识别准确率与段落还原能力。该框架有望为历史文献数字化、古籍整理及档案检索提供更可靠的技术支撑。目前论文已提供PDF及HTML全文链接,相关代码与数据资源也有待进一步公开。 #OCR #中文历史文档 #古籍数字化 #布局感知 #标记增强 #论文 #arXiv #人工智能 #自然语言处理
基准污染检测的极限

一篇题为《基准污染何时可检测?信息极限与功效校准审计》的学术论文近日在arXiv预印本平台发布,作者为Ibne Farabi Shihab等人。该研究聚焦机器学习基准测试中的数据污染问题,探讨在何种信息条件下,基准污染能够被可靠检测。论文引入信息论视角,分析了检测污染的统计极限,并提出一种基于统计功效校准的审计方法,帮助研究者在有限样本下更准确地判断模型评测结果是否受到污染影响。研究指出,并非所有污染都必然可探测,检测能力取决于数据重叠程度、模型行为差异及审计策略等因素。该成果为AI评测的透明性和可信度提供了理论支持,对未来大模型基准设计具有参考价值。 #论文 #arXiv #机器学习 #基准污染 #AI评测 #数据审计 #统计功效 #学术研究
GraphThink:图增强大模型思考,破解长时程具身任务规划

据arXiv平台显示,一篇题为《GraphThink: 图增强的LLM思考用于长时程具身任务规划》的研究论文正式发布。该论文由Chen Li等七位作者共同完成,于2026年8月8日提交。研究聚焦大语言模型在具身智能领域的应用,提出利用图结构增强模型的思考过程,以应对长时程任务规划中的复杂推理挑战。论文已提供PDF与HTML版本,并附有代码、数据等相关资源链接,供学界参考使用。 #arXiv #大模型 #具身智能 #任务规划 #图增强 #AI
TelemetrySuffBench

据 arXiv 收录的一篇论文,研究者 Yuxuan Zhu 等人提出 TelemetrySuffBench 基准,聚焦于评估智能体(Agent)遥测信息是否足以支撑故障根源诊断。该研究围绕智能体运行过程中产生的日志、状态追踪等遥测数据,系统检验其在故障定位场景中的充分性与可靠性。论文通过构建标准化测试任务,分析当前遥测手段在复杂多步操作中暴露的盲区,为提升智能体可观测性和调试效率提供参考。该工作已在 arXiv 平台公开,并附有 PDF 及 HTML 版本供学术社区进一步查阅。 #arXiv #论文 #智能体 #遥测 #故障诊断 #AI安全 #可观测性
宽推理而非深推理

这篇由Agamdeep Singh等人提交的arXiv预印本论文,提出了一种名为“Reason Wide, Not Deep”的推理策略。论文主张在推理过程中不再单纯追求更深的链式思考,而是通过将推理过程中衍生的中间技能进行蒸馏和复用,将高昂的推理成本从单次深度计算摊薄到可迁移的技能库中,从而提升多任务下的推理效率。该研究旨在探索如何让模型在保持较强推理能力的同时,降低实时计算开销,相关方法与实验细节尚未在页面展示,但为AI推理效率优化提供了新的思路。 #AI #机器学习 #推理优化 #技能蒸馏 #arXiv #预印本
GRACE 论文提出基于大语言模型的语义度量空间,用于可扩展混合数据聚类

一篇题为《GRACE: LLM-Grounded Semantic Metric Spaces for Scalable Mixed-Data Clustering》的研究论文已提交至 arXiv。该研究针对混合数据聚类中数值、类别等异构属性难以统一处理的痛点,提出 GRACE 框架,利用大语言模型的语义理解能力,将不同类型的数据映射到统一的语义度量空间,从而提升聚类性能与可扩展性。论文已上线并提供 PDF 与 HTML 版本,相关代码、数据及工具链接也已同步发布。该方法有望为大规模真实场景中的混合数据挖掘提供更高效的技术路径。 #GRACE #大模型 #混合数据聚类 #语义度量空间 #arXiv #AI #机器学习
新研究提出SurgLAT方法,用于深度感知机器人腹腔镜控制

一项发表于arXiv的预印本研究提出了一种名为SurgLAT(Surgical Latent Attention Tracking)的新型手术机器人腹腔镜控制方法。该方法结合潜在注意力跟踪机制与深度感知技术,旨在提升腹腔镜在手术过程中的自动跟踪与操作精度。论文由Rulin Zhou等13位研究人员共同完成,于2026年8月8日提交至arXiv平台。该研究为智能手术机器人的自动化控制提供了新思路,未来有望改善微创手术的稳定性和安全性。 #SurgLAT #手术机器人 #腹腔镜 #深度学习 #arXiv #医学AI #机器人控制 #深度感知
论文提出“工作簿时间机器”方法,用于改进电子表格创建基准测试

一篇题为《Back to the Future: A workbook time machine for spread sheet creation benchmarks》的论文近期出现在arXiv预印本平台,作者包括Mansi Uniyal等8人。该研究针对电子表格创建任务中基准数据集的构建难题,提出了一种类似“时间机器”的工作簿生成方法,可回溯并重构历史电子表格状态,为模型评估提供更真实、多样的训练与测试样本。论文已提供PDF、HTML及源码等访问方式,并支持引用管理工具。 #论文 #arXiv #电子表格 #基准测试 #AI #人工智能 #研究
反事实基准与训练:提升大模型在异构知识上的事实一致性与顺序鲁棒推理

一篇由Shibo Chu等七位研究者共同完成的论文提出,通过反事实基准测试与训练方法,增强大语言模型在面对异构知识时的事实一致性与顺序鲁棒性。研究指出,现有模型在推理时容易受知识来源顺序和表述方式影响,导致事实性偏差。为此,团队设计了反事实场景下的评估基准,并引入针对性的训练策略,使模型在知识冲突或信息顺序变化时仍能保持稳定的推理能力。实验结果表明,该方法能显著提升模型在复杂知识环境下的可靠性与一致性,为多源知识融合的推理任务提供了新的解决思路。 #大语言模型 #反事实推理 #事实一致性 #异构知识 #AI研究 #论文
Telegram必备的搜索引擎,极搜JISOU帮你精准找到,想要的群组、频道、视频、音乐

👉 t.me/jisou2?start=a_8247614025
当裁判不应裁决:新研究提出证据锁定机制限制LLM裁判在推理流水线中的失败

一项由Yiyao Zhang等五位研究者提交至arXiv的论文,聚焦于大语言模型(LLM)作为裁判在推理流水线中的可靠性问题。研究指出,LLM裁判在评估推理结果时容易产生系统性失败,而传统的补偿性评分方式可能掩盖这些错误。为此,论文提出一种“证据锁定、非补偿性选择”的框架,明确界定裁判不应作出决定的场景,通过限制其决策范围来降低失败率。该研究为构建更稳健的自动化评估体系提供了新思路,相关论文已通过DataCite获取DOI,并于2026年8月7日发布。 #arXiv #LLM #AI评审 #推理流水线 #论文 #机器学习
CausalNav 提出因果世界模型,应对物理参数偏移下的可靠控制

来自 arXiv 的一篇新论文提出了 CausalNav 框架,旨在解决物理参数偏移场景下的控制问题。该研究由 Yiyao Zhang 等人完成,重点构建具备可靠性认证的因果世界模型,以增强控制系统在环境物理特性变化时的鲁棒性。相关成果已在 arXiv 平台发布,并附有 PDF 及 HTML 版本供研究者查阅。 #CausalNav #因果世界模型 #可靠性认证 #控制 #物理参数偏移 #arXiv #机器人 #AI
CliniCARE-Bench 提出电子健康记录医学推理评估新基准

一项名为 CliniCARE-Bench 的研究近日提交至 arXiv。该研究由 Veronica Chatrath 与其他 18 位作者共同完成,聚焦于电子健康记录(EHR)场景下的临床推理能力审计。论文提出了一种“临床校准”的评估方法,旨在系统检验医学推理模型在真实 EHR 数据上的表现,为临床决策支持系统的可靠性提供更精细的度量基准。 #医学AI #EHR #临床推理 #基准测试 #arXiv #医疗大模型
新研究提出用频谱指纹追踪大模型血统

一篇发表于 arXiv 的论文提出,可通过分析大语言模型权重空间的频谱特征,追溯其构建来源与衍生关系。该方法利用权重矩阵的特征谱作为“指纹”,在不依赖训练数据或模型内部信息的情况下,识别模型是否由另一模型微调或蒸馏而来。研究团队由陈一苇等人组成,论文已上线 arXiv,相关 DOI 尚待注册。该技术有助于提升开源模型的透明度与可追溯性,对 AI 治理、版权归属及模型安全审查具有重要意义。 #大模型 #AI安全 #模型溯源 #频谱指纹 #arXiv #机器学习
新论文提出“能力阶梯”框架,应对AI时代劳动力准备挑战

一篇题为《The Capability Ladder: A Curriculum-Modernization Framework for Workforce Readiness in the AI Era》的学术论文近日上传至arXiv预印本平台。该论文由Majid Memari与另一位合作者共同完成,于2026年8月7日首次提交,并已获得arXiv官方DOI编号。研究提出一种名为“能力阶梯”的课程现代化框架,旨在帮助教育机构和企业系统性地升级课程内容,使劳动力更好地适应人工智能时代所需的新技能。论文同时提供PDF和HTML版本,供研究人员免费查阅。尽管页面未展示完整摘要,但从标题来看,该框架强调分阶段、递进式的能力培养路径,以弥合当前教育与未来职业需求之间的鸿沟。这一研究或为AI浪潮下的职业培训和高等教育改革提供参考。 #AI #人工智能 #arXiv #劳动力技能 #课程现代化 #能力阶梯 #职业教育 #科技论文
AndroidReality

一项题为《AndroidReality: How Far Are Mobile Agents from the Real World?》的研究论文于2026年8月7日提交至arXiv预印本平台,作者为Xiaoou Liu等五人。论文围绕移动智能体在真实世界环境中的实际表现展开,提出AndroidReality这一研究框架,试图量化当前移动智能体技术从理想测试场景走向日常真实操作时存在的差距。研究关注点在于移动智能体能否有效应对现实设备的复杂界面、动态任务和不确定性,并据此评估其成熟度与落地潜力。目前该论文尚未完成DOI注册,完整PDF与相关材料已可在arXiv上查看。 #移动智能体 #AndroidReality #arXiv #AI研究 #科技论文
大模型评估基准谁来验证?新论文提出去中心化信任机制

一篇题为《Who Verifies the Benchmark? Decentralizing Trust in Large Language Model Evaluation》的论文近期在arXiv平台发布,作者为Sahil Pardasani等人。该研究聚焦大语言模型评估基准的可信度问题:当前基准测试多由少数机构或团队制定和评判,其公正性与透明度难以得到独立验证。论文主张引入去中心化机制,让多方共同参与基准的设计、审核与结果验证,以此减少单一主体的信任依赖,提升评估结果的可信度与可复现性。这一方向与学界对AI评测体系标准化、透明化的讨论密切相关,也为未来大模型能力比较提供了新的治理思路。 #大模型 #AI评测 #去中心化 #arXiv #论文 #科技新闻
arXiv 新论文提出跨地点与服务类的自适应容量预算两级分配方法

近日,一篇题为《Adaptive Two-Level Allocation of a Conserved Capacity Budget Across Locations and Service Classes》的研究论文提交至 arXiv,作者为 Simone Mainardi 等三人。论文聚焦于在多个地点和服务类别之间,如何对一个总量受限的容量预算进行动态分配。研究者提出一种自适应两级分配机制,旨在应对需求变化和环境不确定性带来的资源配置挑战。该方法或能为运营管理、网络资源调度及服务系统规划等领域提供新的优化思路。目前该论文已提供 PDF 与 HTML 全文链接,并附有 BibTeX 引用信息,供相关领域研究者参考。 #arXiv #论文 #资源分配 #自适应优化 #容量预算 #运营管理
QuantumMind:基于约束的智能体推理方法助力量子计算加速分析

近日,一篇题为「QuantumMind: Constraint-Grounded Agentic Reasoning for Speedup Analysis in Quantum Computing」的研究论文在arXiv平台预发布。该研究由Yijing Zuo等五位作者共同完成,提出了一种名为QuantumMind的约束感知智能体推理框架,旨在针对量子计算中的加速效应进行系统分析。论文将智能体推理与约束条件相结合,为量子算法的性能评估与优化提供了一种新的技术路径。该工作尚处于预印本阶段,相关代码与数据资源也已同步开放,便于研究者复现与拓展。 #量子计算 #arXiv #AgenticReasoning #QuantumMind #科技论文
临床基础模型隐私保护研究

一篇题为《Protecting patient privacy in clinical foundation models: Technical and legal perspectives》的学术论文近期在arXiv上发布,由Sana Tonekaboni等七位作者共同撰写。该研究聚焦于临床基础模型(如医疗大模型)在应用过程中面临的患者隐私泄露风险,并从技术与法律两个维度提出系统性保护框架。技术层面,作者探讨了差分隐私、联邦学习、数据去标识化及模型训练中的隐私防护机制;法律层面,则分析了现行医疗数据法规(如HIPAA、GDPR)对临床AI模型的约束与适配问题。研究指出,仅靠单一技术手段或单纯法律规范均难以有效保障患者数据安全,需构建“技术+合规”协同治理体系,以平衡临床模型性能与隐私保护需求。该论文的发表为医疗AI安全落地提供了重要参考。 #医疗AI #患者隐私 #临床大模型 #人工智能 #数据安全 #arXiv