AI知识库 @ai521
819 subscribers
30.3K photos
59 videos
27 files
1.26K links
@ai521 专注分享最实用的AI内容

🤖 AI教程(新手到进阶)
🧠 AI知识科普(大模型 / 提示词 / 自动化)
📰 AI资讯更新(每日最新AI动态)
📚 AI实战技巧(写作 / 绘画 / 编程 / 赚钱)
🔧 最新AI工具推荐

每天更新AI干货
长期做一个真正有价值的AI频道
Download Telegram
LLM-FACETS:保护隐私的大模型透明度与问责性评估框架

研究人员提出了一种名为LLM-FACETS的隐私保护框架,旨在系统评估大语言模型的透明度和问责性。该框架通过设计隐私安全的评估指标,在不泄露敏感数据的前提下,衡量模型在可解释性、决策可追溯性和责任归属等方面的表现。这为AI审计和监管提供了新的技术路径,尤其适用于需要保护用户隐私的商业部署场景。论文已在arXiv上发布,其方法有望推动大模型治理的标准化进程。 #大模型 #隐私保护 #AI透明度 #问责性 #LLM #隐私计算 #AI治理 #arXiv
跨模型局部等距一致性实现向量链接

据arXiv预印本网站显示,研究人员近日提交了一篇题为《Vector Linking via Cross-Model Local Isometric Consistency》的论文。该研究提出一种通过跨模型局部等距一致性进行向量链接的方法,旨在提升不同模型间向量表示的匹配与对齐能力。论文作者包括Ziying Chen等,目前论文以PDF和HTML格式公开,尚待数据正式注册。 #arXiv #论文 #向量链接 #跨模型 #等距一致性 #AI #机器学习 #科技
英伟达Vera Rubin全面量产,黄仁勋感谢台湾供应链

英伟达CEO黄仁勋在GTCTaipei主题演讲中宣布新一代AI平台Vera Rubin全面量产,称其为“史上最具野心的工程计划”,并特别感谢中国台湾供应链的深度参与。Vera Rubin并非单一芯片,而是覆盖计算、网络、存储、安全与软件的完整AI基础设施系统,旨在应对代理式AI(Agentic AI)带来的分布式异构运算需求。黄仁勋提出“算力即营收”新逻辑,指出全球AI工厂投资规模巨大,单座1GW等级工厂投资已达500至1000亿美元。Vera Rubin供应链规模是上一代Grace Blackwell的两倍,制造效率大幅提升,组装时间从两小时缩短至五分钟。台湾半导体、服务器、散热等全产业链预计将迎来新一轮商机。 #英伟达 #VeraRubin #黄仁勋 #AI基础设施 #算力即营收 #台湾供应链 #AI工厂 #芯片 #科技新闻
Telegram必备的搜索引擎,极搜JISOU帮你精准找到,想要的群组、频道、视频、音乐

👉 t.me/jisou2?start=a_8247614025
GraphARC

近日,研究人员在arXiv上发布了名为GraphARC的综合性基准测试,旨在评估人工智能系统在图结构数据上的抽象推理能力。该基准由Saku Peltonen等四位作者共同提出,专注于测试模型在图形化抽象推理任务中的表现,涵盖多模态理解与复杂逻辑推理。GraphARC的推出填补了现有基准在基于图的抽象推理领域的空白,有望推动AI在科学问题解决、代码生成等场景中的进步。目前论文已开放访问,并提供PDF及HTML版本供研究者参考。 #GraphARC #抽象推理 #图神经网络 #AI基准 #arXiv #人工智能 #科研进展
HADT:异构多智能体差分Transformer助力自主地球观测卫星集群

近日,一篇题为《HADT: A Heterogeneous Multi-Agent Differential Transformer for Autonomous Earth Observation Satellite Cluster》的论文在arXiv预印本平台发布。该研究由Mohamad A. Hady等学者提出,旨在解决地球观测卫星集群在自主任务规划中的协同决策难题。HADT模型采用异构多智能体架构,结合差分Transformer机制,使各卫星能够根据自身能力和环境动态调整策略,提升集群的整体观测效率与鲁棒性。这一工作为未来大规模卫星星座的自主运行提供了新的技术路径,有望在遥感、灾害监测等领域发挥重要作用。 #论文 #arXiv #卫星 #多智能体 #Transformer #地球观测 #AI #机器学习 #自主系统
基于角色的生成式AI多元对齐评估框架

一篇来自arXiv的预印本论文提出了一种基于角色的评估框架,用于衡量生成式AI在多元对齐方面的表现。该研究由Atahan Karagöz等人完成,旨在解决当前AI系统在价值观对齐中难以兼顾不同用户群体偏好的问题。框架通过模拟多种用户角色,评估模型在伦理、文化、社会观点等方面的响应差异,从而更全面地检验AI的多元包容性。这一方法有望为AI安全评估提供更细致的工具,推动生成式AI在复杂社会场景中的负责任部署。 #AI #生成式AI #多元对齐 #评估框架 #arXiv #人工智能安全 #角色模拟
BilliardPhys-Bench

多模态大语言模型(MLLMs)在视觉理解与语言生成上取得显著进展,但其对物理世界动态与因果推理的能力仍缺乏系统评估。为此,研究团队提出BilliardPhys-Bench基准,专门测试MLLMs在台球物理场景中的推理与视觉动态理解能力。该基准包含多种涉及碰撞、轨迹预测、动量守恒等物理现象的视觉问答任务,要求模型不仅能识别物体,还需理解隐含的物理规律。实验表明,当前主流MLLMs在该基准上表现远低于人类水平,尤其在复杂多步推理和反事实推断方面存在明显短板。该工作为评估MLLMs的物理常识提供了标准化工具,并指出未来改进方向。相关论文已提交arXiv,代码与数据将开源。 #多模态大模型 #物理推理 #基准测试 #AI #计算机视觉 #台球 #arXiv #机器学习
UniScale:通过在线联合优化模型路由与测试时缩放实现自适应统一推理缩放

该论文提出了一种名为UniScale的自适应统一推理缩放框架,旨在通过在线联合优化模型路由和测试时缩放来提升大语言模型的推理效率与性能。传统方法通常单独处理模型选择或推理计算量分配,而UniScale将两者结合,在推理过程中动态调整模型路由策略和测试时计算预算,从而在保证输出质量的前提下降低计算成本。实验表明,该方法在多个基准测试上优于固定路由或固定缩放策略,实现了更优的精度-效率权衡。该研究为大规模模型的高效部署提供了新思路,尤其适用于资源受限或延迟敏感的应用场景。 #AI #机器学习 #大模型 #推理优化 #模型路由 #测试时缩放 #arXiv
蒸馏大语言模型反馈用于Lean定理证明

一篇题为《Distilling LLM Feedback for Lean Theorem Proving》的论文近日在arXiv上发布。该研究由Gaetan Narozniak等五位作者完成,旨在探索如何利用大语言模型(LLM)的反馈来提升形式化定理证明的效率。传统定理证明依赖人工编写的策略或搜索算法,而LLM虽能生成证明步骤,但往往缺乏可靠性。论文提出一种蒸馏方法,将LLM对证明路径的评估反馈转化为可学习的信号,从而训练更高效的证明器。实验基于Lean证明助手,结果表明该方法能显著提高证明成功率,并减少搜索空间。这一工作为结合大模型与形式化验证提供了新思路,有望推动自动定理证明在数学和软件验证领域的实际应用。 #arXiv #论文 #LLM #定理证明 #Lean #AI #机器学习 #形式化验证
COMPASS: 认知MCTS引导的过程对齐方法确保搜索智能体安全

研究人员提出COMPASS框架,将认知蒙特卡洛树搜索(MCTS)与过程对齐技术相结合,旨在提升搜索智能体的安全性。该方法通过模拟人类认知推理过程,引导智能体在复杂搜索任务中做出更安全、更可控的决策,避免有害行为。该研究由Wenkai Shen等七位学者共同完成,相关论文已提交至arXiv预印本平台,目前处于DataCite注册流程中。 #AI安全 #搜索智能体 #蒙特卡洛树搜索 #过程对齐 #认知计算 #arXiv #论文
SLAT

arXiv上近日公开了一篇题为《SLAT: Segment-Level Adaptive Trimming for Efficient CoT Reasoning》的论文,作者为Jian Yao等人。该论文提出了一种名为SLAT的段级自适应修剪技术,旨在优化链式思维推理过程的效率。通过识别并裁剪推理链中冗余的中间步骤,SLAT能够在保持推理准确性的同时显著减少计算开销。目前该论文已提交至arXiv平台,尚未正式发表,但已引起相关领域研究者的关注。 #SLAT #CoT推理 #自适应修剪 #大模型 #AI效率 #arXiv论文 #人工智能
以规划者为中心的深度研究强化学习与结构感知奖励

一篇题为《Planner-Centric Reinforcement Learning for Deep Research with Structure-Aware Reward》的学术论文在arXiv预印本平台发布。该论文由Mustafa Anis Hussain等研究者撰写,提出了一种以规划者为中心的强化学习框架,旨在提升深度研究任务中的智能体探索效率。传统强化学习方法在复杂、长时程的研究场景中常面临奖励稀疏和探索低效的问题,而该研究通过引入结构感知奖励机制,使智能体能够更好地理解任务的结构化特征,从而制定更合理的规划策略。论文详细阐述了方法的设计原理、实验设置及性能评估,展示了在多个基准任务上的显著改进。这一工作为强化学习在科学研究、自动化实验设计等领域的应用提供了新思路。 #arXiv #强化学习 #深度研究 #结构感知奖励 #AI #论文 #学术前沿
PReMISE

近日,一篇题为《PReMISE: Policy Rubrics as Measurement Specifications for LLM Judges》的论文在arXiv上发布。该研究由Swastik Roy等学者提出,旨在解决大语言模型(LLM)作为评判者时缺乏统一测量标准的问题。PReMISE方法通过定义明确的策略评分标准(Policy Rubrics),为LLM评判者提供可量化的测量规范,从而提升评估的准确性、一致性和可解释性。这一框架有望在AI安全、模型对齐、内容审核等领域发挥重要作用,为构建更可靠的自动评估系统提供新思路。 #AI #大模型 #LLM #论文 #arXiv #评测 #策略评分 #AI安全
面向长期任务的智能体兼容上下文管理方法研究

近日,一篇题为《Learning Agent-Compatible Context Management for Long-Horizon Tasks》的论文在arXiv上发布。该研究由Lu Yi等作者共同完成,聚焦于智能体在长期任务中的上下文管理难题。传统方法在处理长时间跨度任务时,常因上下文信息冗余或遗漏导致性能下降。论文提出了一种学习智能体兼容上下文管理的方法,通过动态选择和组织与任务相关的上下文信息,使智能体更高效地利用历史交互。实验结果显示,该方法在多个长期任务基准上显著提升了智能体的决策质量和任务完成率,为构建更鲁棒的自主智能体系统提供了新思路。 #AI #智能体 #上下文管理 #长期任务 #机器学习 #arXiv #论文
扩散模型生成图状规则,赋能知识图谱推理

一篇来自Haoxiang Cheng等学者的论文提出了一种利用扩散模型生成图状规则的新方法,用于知识图谱推理。传统知识图谱推理多依赖手工或预定义规则,难以捕捉复杂语义结构。该研究创新性地引入扩散模型,通过逐步去噪过程生成符合知识图谱拓扑的图状规则,从而提升推理的准确性和泛化能力。实验表明,该方法在多个基准数据集上优于现有基于规则和嵌入的推理模型,尤其擅长处理长尾关系和稀疏子图。该工作为知识图谱推理提供了生成式建模的新视角,有望推动问答系统、推荐引擎等应用的认知深度发展。 #知识图谱 #推理 #扩散模型 #图规则 #AI #机器学习 #知识推理 #生成模型
MAVEN 研究提出新方法,提升智能体工具调用的泛化能力

一篇题为《MAVEN: Improving Generalization in Agentic Tool Calling》的学术论文近日在 arXiv 上发布。该研究由 Omkar Ghugarkar 等三位作者完成,旨在解决智能体在工具调用场景中的泛化问题。论文提出了一种名为 MAVEN 的新方法,通过改进模型对未见工具和复杂任务序列的适应能力,显著提升了智能体在动态环境中的表现。实验结果表明,该方法在多个基准测试中均优于现有方案,为构建更通用、更可靠的智能体系统提供了新思路。该研究于 2026 年 5 月 29 日提交,目前可通过 arXiv 获取全文。 #AI #智能体 #工具调用 #泛化 #机器学习 #学术论文 #arXiv
Policy-as

一项来自arXiv的最新研究提出,利用“政策即代码”(Policy-as-Code)搜索框架,在战略供应商响应环境下设计更优的医疗机制。该方法通过将医疗政策编码为可执行程序,结合博弈论模型,自动搜索能够平衡多方利益、抑制策略性博弈的机制方案。研究由Zihan Wang等人完成,有望为医疗资源配置、服务定价等复杂政策制定提供自动化工具,降低人为设计偏差,提升系统效率与公平性。 #医疗机制 #政策即代码 #AI #博弈论 #arXiv #学术研究
Structure-Induced Information for Rerooting Levin Tree Search

Jake Tuero 等人在 arXiv 上提交了一篇题为“Structure-Induced Information for Rerooting Levin Tree Search”的论文。该论文主要研究如何利用结构诱导信息来改进 Levin 树搜索中的重新根植过程。Levin 树搜索是一种用于组合优化问题的算法,重新根植技术可提升搜索效率。论文于 2026 年 5 月 28 日提交,提供了 PDF 和 HTML 版本,目前暂未标注 DOI。该研究可能对人工智能和算法优化领域具有参考价值。 #论文 #arXiv #LevinTreeSearch #算法 #人工智能 #优化
EHRBench:基于电子健康记录的LLM临床决策自动化可靠基准

来自arXiv的论文显示,研究人员提出了EHRBench,这是一个基于电子健康记录(EHR)的自动化、可靠基准,用于评估大型语言模型(LLMs)在临床决策中的表现。该基准利用真实EHR数据,通过标准化流程自动生成测试案例,涵盖诊断、治疗建议等关键临床任务。研究团队表示,EHRBench旨在解决现有评估方法依赖人工标注、可重复性差的问题,为LLM在医疗领域的应用提供更客观的衡量标准。初步实验表明,该基准能有效区分不同模型的临床推理能力,有望推动AI辅助诊断的规范化发展。 #EHRBench #临床决策 #大语言模型 #电子健康记录 #AI医疗 #基准测试 #arXiv