AI知识库 @ai521
331 subscribers
22.3K photos
42 videos
19 files
855 links
@ai521 专注分享最实用的AI内容

🤖 AI教程(新手到进阶)
🧠 AI知识科普(大模型 / 提示词 / 自动化)
📰 AI资讯更新(每日最新AI动态)
📚 AI实战技巧(写作 / 绘画 / 编程 / 赚钱)
🔧 最新AI工具推荐

每天更新AI干货
长期做一个真正有价值的AI频道
Download Telegram
MCPEvol-Bench:评估LLM Agent在动态MCP服务器演化中的表现

近日,研究团队发布了MCPEvol-Bench基准测试,旨在系统评估大语言模型智能体(LLM Agent)在MCP服务器动态演化环境下的性能。该基准由Huanxi Liu等八位研究者共同提出,相关论文已提交至arXiv预印本平台。MCPEvol-Bench通过模拟MCP服务器在功能、接口、数据分布等方面的持续变化,测试LLM Agent的适应能力、鲁棒性和任务完成效率。这一工作填补了现有基准在动态演进场景下的评估空白,为开发更灵活、可靠的LLM Agent提供了标准化测试框架,有望推动智能体在真实复杂环境中的部署与优化。 #LLMAgent #基准测试 #MCP #人工智能 #论文 #动态环境 #鲁棒性 #机器学习 #arXiv
分析性溯因:新论文提出人机协调因果分解与受控承诺框架

一篇题为《分析性溯因:用于人机协调的因果分解与受控承诺》的学术论文在arXiv预印本平台上发布。该论文由Remo Pareschi教授提交,于2026年7月16日上线。论文聚焦于人类与人工智能系统之间的协调问题,提出了一种名为“分析性溯因”的推理框架,通过因果分解与受控承诺机制,使AI能更有效地理解人类意图并做出可解释的决策。研究内容涉及因果推理、溯因推理以及多智能体系统中的协调策略。论文当前可在arXiv上获取PDF及HTML版本,并提供了相关引用工具与资源链接。 #人工智能 #人机协调 #溯因推理 #因果推理 #多智能体系统 #arXiv论文 #AI安全 #可解释AI
Action QFormer: 通过动作监督塑造视觉-语言

来自arXiv的一篇新论文提出了Action QFormer模型,旨在视觉-语言-动作(VLA)模型中通过动作监督实现结构化表示的塑造。该研究由Yufeng Ji等五位作者完成,论文详细介绍了如何利用动作信息引导模型学习更具结构化的特征表示,从而提升多模态理解与动作执行能力。该工作已通过arXiv平台发布,并提供了PDF和HTML版本供学术参考。 #arXiv #论文 #VLA #多模态 #AI #深度学习 #动作监督
视觉语言模型能否进行物理策略规划?新研究提出SportD基准

一项由国际研究团队合作的新研究提出了名为SportD的基准,旨在评估视觉语言模型(VLM)在物理策略规划方面的能力。该研究通过构建一系列需要结合视觉感知与物理常识的体育类任务,测试当前主流VLMs能否像人类一样基于物理规律做出决策。初步实验结果显示,尽管VLMs在图像理解方面表现优异,但在涉及复杂物理交互和策略推理时仍存在明显局限。该工作揭示了现有模型在具身智能场景中的不足,为未来多模态AI研究提供了新的评估方向。 #视觉语言模型 #物理策略 #AI基准 #具身智能 #多模态
MathCoPilot

一篇发表于arXiv的论文《MathCoPilot: An Interactive System for Human-AI Symbiotic Paradigm of Mathematical Research》提出了一种新型交互系统,旨在实现数学研究中人类与人工智能的深度协作。该系统通过构建人机共生范式,允许数学家与AI在推理、证明、探索等环节实时互动,从而提升数学研究的效率与创造力。论文由Junjie Zhang等14位作者共同完成,目前已在arXiv平台公开,供学界参考与实验验证。 #数学 #AI #人机协作 #MathCoPilot #学术论文 #人工智能 #科研 #arXiv
多LLM协作生成脑肿瘤MRI报告,实现视觉指令微调

韩国研究者近日在arXiv上提交了一项新研究,提出了一种多大型语言模型(LLM)协作框架,用于脑肿瘤MRI报告生成。该方法通过整合多个LLM的互补能力,并引入视觉指令微调技术,使模型能够更好地理解医学影像与自然语言之间的关联。研究旨在提升脑肿瘤诊断报告的自动化水平,减轻放射科医生的工作负担,同时保证报告的准确性和临床可用性。该工作展示了多智能体协作在医学影像报告生成领域的潜力,为未来智能化临床决策支持系统提供了新思路。 #arXiv #多LLM #脑肿瘤 #MRI报告 #医学影像 #视觉指令微调 #AI #科研
多LLM智能体在网络化社会实验中的协作空间学习

研究人员提出了一种基于多大型语言模型(LLM)智能体的协作空间学习方法,并将其应用于网络化社会实验。该方法通过构建多个智能体在网络环境中的交互机制,模拟它们在空间任务中的协作行为,从而探索群体智能在复杂社会情境下的演进规律。研究涵盖了智能体之间的信息共享、决策协调以及空间感知能力的协同提升,旨在揭示LLM智能体在网络化社会实验中如何实现高效学习。该工作为理解和设计多智能体系统的社会性行为提供了新框架,并有望推动人工智能在社会科学研究中的深入应用。 #LLM #多智能体 #协作学习 #空间学习 #社会实验 #网络化 #AI #人工智能
Alipay-PIBench

支付宝团队近日在arXiv预印本平台发布面向代码智能体的支付集成基准测试Alipay-PIBench。该基准旨在评估AI编码工具在真实支付场景中的集成能力,涵盖接口调用、异常处理、安全验证等关键环节。研究团队基于支付宝实际业务构建了包含多种支付流程的测试集,可有效检验大模型驱动的代码生成、调试与维护能力。该工作有助于推动AI在金融科技领域的应用,为自动化支付开发提供标准化评估框架。 #支付宝 #AI编码 #支付集成 #基准测试 #arXiv #金融科技 #大模型 #代码智能体
Democratizing Agent Deployment Safety: A Structural Monitoring Approach

一项新研究提出了一种结构监控方法,旨在降低AI智能体部署的安全门槛。该论文指出,随着AI智能体在各行业的广泛应用,如何确保其安全部署成为关键挑战。作者提出通过系统化的监控框架,实时检测和缓解部署过程中的风险,使更多开发者和组织(即使缺乏安全专家)也能安全地运行AI智能体。该方法有望推动智能体部署安全的民主化,减少安全隐患,加速AI技术的负责任落地。 #AI安全 #智能体部署 #结构监控 #学术论文 #arXiv #人工智能 #安全
Seeing the End at Step Zero: 利用MLP稀疏性感知截断加速扩散多模态大模型

一项新研究提出名为“零步见终”的方法,旨在加速扩散多模态大语言模型的推理过程。该方法通过识别并截断多层感知机中的稀疏激活,在推理初始阶段即可预测最终输出,大幅减少迭代步数。实验表明,该技术能在保持生成质量的同时显著提升模型运行效率,为多模态AI的高效部署提供了新思路。 #论文 #AI #多模态 #大模型 #加速 #Diffusion #MLP #稀疏性
Telegram必备的搜索引擎,极搜JISOU帮你精准找到,想要的群组、频道、视频、音乐

👉 t.me/jisou2?start=a_8247614025
面向自主工业系统的意图抽象层研究

一篇题为《面向自主工业系统的意图抽象层》的学术论文于2026年7月16日提交至arXiv预印本平台。该论文由Artan Markaj等三位作者共同完成,旨在提出一种用于自主工业系统的意图抽象层架构。研究聚焦于如何通过抽象层将人类的高层意图转化为工业系统可执行的指令,从而提升系统的自主性和灵活性。该工作有望为人机协作、工业自动化中的任务规划与决策提供新的理论框架。论文目前提供PDF和HTML格式预览,相关代码和数据链接可在页面获取。 #自主工业系统 #意图抽象层 #arXiv #学术论文 #人工智能 #工业自动化 #人机协作 #系统架构 #智能控制 #研究前沿
LLM生成的GPU内核能否投入生产?一项跟踪驱动的基准测试与优化代理研究

来自arXiv的一篇论文对当前大语言模型(LLM)自动生成GPU内核的能力进行了系统性评估。研究团队构建了一个基于实际生产环境跟踪数据的基准测试框架,并开发了专门的优化代理,用以衡量LLM生成代码的性能、正确性和稳定性。实验发现,虽然LLM在简单场景下能生成可用内核,但在复杂计算模式、内存访问优化和硬件适配方面仍存在显著不足,生成的代码往往无法直接用于生产环境。该优化代理通过自动识别瓶颈并施加针对性修改,可将部分生成内核的性能提升至接近人工优化的水平。这项工作为评估LLM在底层系统编程中的实用性提供了重要基准,并指出当前模型在高性能计算领域仍需突破。 #LLM #GPU内核 #生产就绪 #基准测试 #优化代理 #高性能计算 #arXiv
WrAFT

研究人员提出了一种名为WrAFT的模块化自动写作评估系统,专门用于评估议论文质量。该系统采用模块化架构,能够对议论文的论点、结构、论据和语言表达等维度进行自动化分析与评分。WrAFT的设计旨在帮助教师和学生高效评估写作水平,减少人工评阅工作量。论文由Adnan Labib等六位作者共同完成,目前已在arXiv预印本平台发布,提供PDF和HTML版本供学术交流。 #自动写作评估 #议论文 #模块化系统 #教育技术 #自然语言处理 #学术论文 #arXiv
RetroAgent:利用大语言模型搜索结构化记忆实现智能体逆合成规划

该论文提出RetroAgent框架,利用大语言模型(LLMs)结合结构化记忆进行智能体逆合成规划。逆合成是化学合成中的核心问题,传统方法依赖规则或搜索算法,效率较低。RetroAgent通过LLM驱动搜索,将已知化学反应知识存储为结构化记忆,使模型能高效检索并利用这些信息,从而提升规划路径的准确性与成功率。实验结果表明,该方法在多个逆合成基准任务上显著优于现有基线模型,展示了LLM在化学领域深入应用的潜力。该研究为AI辅助药物分子设计和有机合成提供了新的技术路径。 #逆合成 #大语言模型 #RetroAgent #化学合成 #AI #结构化记忆 #智能体 #论文 #有机化学 #药物设计
VLT:面向工业智能的视觉-语言

arXiv上最新发布了一篇题为《VLT: A Vision-Language-Time Series Multimodal Foundation Model for Industrial Intelligence》的论文。该研究由Haiteng Wang等四位作者共同完成,提出了一种名为VLT的多模态基础模型,旨在融合视觉、语言和时间序列三种数据类型,以应对工业智能领域的复杂需求。传统工业分析往往依赖单一模态数据,难以全面捕捉设备状态、生产流程及环境变化。VLT通过统一的架构同时处理图像、文本和时序数据,从而实现更精准的故障诊断、预测性维护及生产优化。实验表明,该模型在多个工业场景下显著优于单模态和简单多模态方法,为工业数字化与智能化提供了新的技术路径。论文已在arXiv上公开,并提供PDF及HTML预览。 #VLT #多模态 #基础模型 #工业智能 #arXiv #时间序列 #视觉语言 #故障诊断
多轮动态交互情境下视觉语言模型评估新方法

一篇题为《多轮动态交互情境下视觉语言模型评估》的学术论文在arXiv预印本平台发布。该研究提出了一种基于动态多轮交互的视觉语言模型上下文评估方法,旨在解决传统静态评测无法准确反映模型在真实对话场景中表现的问题。研究人员通过构建多轮交互任务,模拟用户与模型的连续对话,评估模型在多模态理解、推理和长期记忆等方面的能力。实验表明,该方法能更全面地揭示模型在动态情境中的优缺点,为视觉语言模型的实际应用部署提供更可靠的性能参考。 #视觉语言模型 #多轮交互 #评估方法 #上下文理解 #AI评测 #学术论文 #多模态
SAGA: Schema-Aware Grounding for Agentic Text-to

该论文提出了一种名为SAGA(Schema-Aware Grounding for Agentic Text-to-SPARQL Generation)的新方法,旨在提升自然语言到SPARQL查询生成的准确性与可靠性。传统文本到SPARQL方法在处理复杂知识图谱模式时容易出错,SAGA通过引入模式感知的基础机制,使生成过程能更好地理解并利用知识图谱的语义结构。该方法采用代理型生成框架,结合检索增强与模式引导,显著改善了查询的语法与语义正确性。实验表明,SAGA在多个基准数据集上取得了优于现有方法的效果,尤其适用于需要细粒度语义匹配的复杂查询场景。该研究为知识图谱问答系统提供了更高效的实现路径,有望推动自然语言与结构化数据交互的实用化发展。 #论文 #知识图谱 #SPARQL #自然语言处理 #人工智能 #语义检索 #代码生成 #知识问答 #机器学习
Step-Level Preference Learning for Generative Agents in Social Simulations

一篇发表于arXiv的论文提出了一种名为“步骤级偏好学习”的方法,旨在提升生成式智能体在社会模拟中的行为真实性。该方法通过细粒度地学习智能体在每一步交互中的偏好,使其能够更接近人类的社会决策过程。论文由Wenchang Gao等9位作者共同完成,并详细阐述了模型框架与训练策略。这一研究为构建更可信的社交模拟系统提供了新思路,有望推动多智能体系统、计算社会学等领域的发展。 #论文 #社会模拟 #生成式智能体 #偏好学习 #多智能体 #AI #arXiv #计算机科学
Tactile

一篇题为《Tactile: Giving Computer-Using Agents Hands and Feet》的学术论文近日在arXiv预印本平台发布。该论文由Yong Liu等人撰写,旨在探索如何让依赖视觉与语言模型操控计算机的AI代理获得更全面的交互能力——即不仅在屏幕上“看”和“点击”,还能实现类似“手”与“脚”的物理或虚拟操作。研究团队可能提出了一种新的框架或训练方法,使AI代理能够执行更复杂的任务,如拖拽文件、滚动页面、多窗口协作,甚至模拟触觉反馈。这一方向有望提升当前AI代理在自动化办公、软件测试、游戏控制等场景中的表现。论文目前提供PDF全文和HTML预览,并附有相关代码与数据链接。该工作尚处于技术报告阶段,但已引起学术界对增强AI代理具身交互能力的关注。 #AI #计算机代理 #触觉交互 #arXiv #具身智能 #自动化 #论文 #研究前沿
深度循环Transformer实现逐Token定点收敛

来自arXiv的一篇论文提出,深度循环Transformer模型能够在每个token级别达到定点收敛。作者Joe Logan的研究表明,通过特定的循环架构设计,模型在深层递归过程中可稳定收敛至固定点,从而提升推理效率与性能。该方法有望为高效Transformer变体提供新思路,相关代码与数据已公开。 #arXiv #深度学习 #Transformer #定点收敛 #AI研究