AI知识库 @ai521
300 subscribers
21.3K photos
41 videos
19 files
814 links
@ai521 专注分享最实用的AI内容

🤖 AI教程(新手到进阶)
🧠 AI知识科普(大模型 / 提示词 / 自动化)
📰 AI资讯更新(每日最新AI动态)
📚 AI实战技巧(写作 / 绘画 / 编程 / 赚钱)
🔧 最新AI工具推荐

每天更新AI干货
长期做一个真正有价值的AI频道
Download Telegram
精神科AI诊断安全新基准:Safe

近日,一项名为 Safe-Psych 的研究在 arXiv 预印本平台发布。该研究由 Oriana Presacan 等学者提出,旨在为大语言模型在精神科领域的应用建立一个顺序评估基准。传统评估往往只关注诊断准确性,而 Safe-Psych 强调模型在给出诊断前必须主动提出适当的问题,以模拟真实临床中医生与患者的交互流程。该基准包含多轮对话测试,要求模型在信息不完整时先提问而非直接下结论,从而避免过早诊断带来的风险。研究团队通过实验发现,当前主流大模型在遵循“先问再诊”的安全规范方面仍有显著不足,可能导致误诊或忽略关键症状。Safe-Psych 的提出为精神科 AI 系统的安全性评估提供了新的标准化工具,有望推动该领域更负责任地使用人工智能技术。 #AI安全 #精神科 #大语言模型 #基准测试 #医疗AI #arXiv #安全评估
FixItFlow

来自arXiv的一篇预印本论文介绍了一项名为FixItFlow的新方法,旨在从云平台事件中自动生成故障排除指南。该方法由Srihari Unnikrishnan等三位研究者共同提出,旨在解决云运维中因手动编写故障处理文档而导致的效率低下问题。FixItFlow能够分析历史故障记录和运维日志,自动提取关键步骤并生成结构化、可复用的排查流程,从而帮助运维人员快速定位和修复问题。该研究有望显著缩短云服务故障的平均修复时间,提升系统的可靠性和自动化运维水平。论文已提交至arXiv,并提供了PDF和HTML版本供学术社区审阅。 #FixItFlow #云计算 #故障排查 #自动化运维 #arXiv #论文 #AI运维
Deep Interaction

来自arXiv预印本的一篇论文提出了一种名为“Deep Interaction”的人机交互新方法,专门针对大型推理模型设计。该方法旨在提升人类与AI在复杂推理任务中的协作效率,通过更自然的交互机制让模型更好地理解人类意图。论文作者包括Hefeng Zhou等七位研究人员,研究聚焦于如何在保持模型推理能力的同时,减少不必要的交互成本,使AI助手能更精准地适应用户需求。这项研究为下一代智能系统的交互设计提供了新思路。 #arXiv #大推理模型 #人机交互 #AI #预印本 #深度学习 #推理模型
Earthquaker-AI框架

研究人员提出名为"Earthquaker-AI"的检索增强生成框架,结合评分规则评估,专为小学地震教育设计。该框架通过检索增强技术为小学生提供精准的地震知识问答,并利用规则化评估确保教学内容的准确性和适应性。论文由Xanthi Kokkinou等学者撰写,旨在通过AI技术提升地震科普教育的互动性和有效性,为灾害教育提供创新工具。 #AI教育 #地震科普 #小学教育 #检索增强生成 #评分规则 #教育技术
AI加速的端到端框架助力快速职业提升

据arXiv预印本平台显示,研究人员提出了一种基于AI加速的端到端框架,旨在实现快速专业的职业提升。该框架由Tam Nguyen等学者共同开发,利用人工智能技术整合学习路径、技能评估与个性化培训,大幅缩短传统职业再培训周期。论文详细阐述了框架的设计原理、实现方法及初步验证结果,展示了AI在职业发展领域的应用潜力。该研究已提交arXiv,目前处于登记状态。 #AI #职业培训 #端到端框架 #arXiv #机器学习 #技能提升
智能体优化器能否复合?Terminal

一篇发布于arXiv的预印本论文《Do Agent Optimizers Compound? A Continual-Learning Evaluation on Terminal-Bench 2.0》由Wenxiao Wang等三位作者完成。该研究针对智能体优化器(Agent Optimizers)在持续学习场景中的表现进行了系统评估,提出了新的基准测试Terminal-Bench 2.0。论文探讨了多个优化器组合是否能够通过持续学习实现性能叠加,以及它们在不同任务迁移中的鲁棒性。实验结果显示,某些优化器组合在特定条件下确实可以产生复合增益,但随着任务序列增长,收益会逐渐衰减。该工作为智能体系统的长期学习能力提供了重要的实证分析,并对未来多任务持续学习架构的设计具有指导意义。 #智能体 #持续学习 #优化器 #AI #机器学习 #论文
自我进化智能体

该论文提出了一种名为“自我进化智能体”的架构,用于解决长期个人健康管理中的动态适应性难题。传统健康管理系统依赖静态规则或固定模型,难以应对个体健康状况的持续变化。该智能体通过持续学习用户健康数据、生活习惯与环境反馈,自主优化健康管理策略,实现从被动响应到主动预防的转变。实验表明,该智能体在血糖控制、运动计划调整等场景中效果显著,为个性化、长效健康管理提供了新路径。 #AI #健康管理 #智能体 #自我进化 #医学AI #个性化医疗 #科技论文
AIMO 可解释性挑战

一篇题为"AIMO Interpretability Challenge"的学术论文于2026年7月15日提交至arXiv预印本平台。该论文由Michal Štefánik与其他13位作者共同撰写,聚焦于人工智能模型的可解释性挑战。论文详细介绍了AIMO挑战赛的相关内容,旨在推动AI系统决策过程透明化与理解性研究。该工作为AI可解释性领域提供了新的基准与评估方法,有望促进更安全、更可信的人工智能系统开发。相关代码与数据已通过配套链接公开,供研究者复现与进一步探索。 #AI可解释性 #AIMO挑战 #机器学习 #学术论文 #人工智能安全
经验记忆图

来自 arXiv 的一份预印本论文提出了一种名为“经验记忆图”(Experience Memory Graph)的创新方法,用于智能体进行单次错误修正。该研究由 Wenjun Wang、Yuchen Fang、Fengrui Liu、Zibo Liang 和 Kai Zheng 共同完成,论文于 2026 年 7 月 15 日提交。该方法通过构建经验记忆图,使智能体能够从一次错误示例中快速学习并自动纠正行为,无需大量数据迭代。研究旨在提升智能体在复杂动态环境中的适应性和鲁棒性,对机器人、自动驾驶和 AI 助手等领域的可靠性提升具有潜在价值。 #AI #智能体 #错误修正 #经验记忆图 #arXiv #机器学习 #研究论文 #2026
CAVA:面向智能体AI系统运行时治理的规范动作验证与认证

近日,一篇题为“CAVA: Canonical Action Verification and Attestation for Runtime Governance of Agentic AI Systems”的论文在arXiv平台上发布。该论文由Zexun Wang撰写,于2026年7月15日提交,主要针对智能体AI系统的运行时治理问题,提出了一套规范动作验证与认证框架。研究旨在通过形式化的验证与认证机制,确保AI系统在运行过程中采取的动作符合预设规范,从而提升系统的安全性、可控性和可审计性。目前该论文的PDF和HTML版本均已开放获取,供相关研究者参考和引用。 #AI安全 #智能体 #运行时治理 #CAVA #arXiv #论文 #AI治理 #形式化验证
AgentCompass

来自研究团队的论文提出名为AgentCompass的评估基础设施,旨在统一衡量智能体(Agent)的各项能力。该论文由Zichen Ding等23位作者共同完成,于2026年7月15日提交至arXiv预印本平台。AgentCompass提供标准化评测框架,可系统评估智能体在复杂任务中的表现,涵盖多模态理解、推理决策等核心维度。这一基础设施有望解决当前智能体评估碎片化、缺乏统一基准的痛点,为AI智能体的研发与对比提供可靠参考。论文已开放PDF及HTML版本,并收录相关代码与数据链接。 #AgentCompass #智能体 #AI评估 #人工智能 #论文 #科技前沿 #arXiv
机器人加入团队

该研究探讨了自动化机器人(Bots)在开源软件项目中的采用及其对项目制度结构的影响。研究指出,随着协作规模的扩大,开源项目越来越多地引入机器人来执行持续集成、代码审查等重复性任务。然而,机器人的部署并非单纯的技术升级,而是深刻改变了项目的沟通模式、决策流程和权力分配。通过分析大量GitHub项目数据,作者发现机器人的采用显著影响了贡献者的参与行为、项目治理结构以及社区规范的演化。研究还揭示了机器人可能带来的挑战,如减少人际互动、引发新的协调成本等。该工作为理解技术自动化如何重塑在线协作组织的制度基础提供了重要视角。 #开源软件 #机器人 #自动化 #协作 #技术社会学 #项目治理 #组织制度
用归纳逻辑编程解释强化学习智能体

该研究提出了一种基于归纳逻辑编程(ILP)的方法,用于解释强化学习(RL)智能体的决策过程。传统强化学习模型常被视为“黑箱”,而归纳逻辑编程能够从智能体的交互经验中自动学习出符号化的逻辑规则,从而生成人类可理解的决策解释。论文详细阐述了如何将RL智能体的状态-动作轨迹转化为逻辑事实,并通过ILP系统归纳出覆盖行为模式的规则集。实验在多个经典基准环境中进行,结果表明该方法生成的解释在准确性和可读性上均优于现有基线。这项工作为可解释人工智能(XAI)提供了新的思路,尤其适用于需要透明性和安全性的RL应用场景。 #归纳逻辑编程 #强化学习 #可解释人工智能 #XAI #AI可解释性 #论文 #科研 #机器学习 #符号推理
UESF-Bench 提出统一具身智能体“寻找与跟随”基准测试

来自中科院等机构的研究团队发布了一项名为 UESF-Bench 的新型基准测试,旨在统一评估具身智能体在“寻找”与“跟随”两大类任务中的能力。该基准涵盖多种复杂场景,要求智能体在未知环境中自主定位目标并持续跟踪动态对象。研究通过多维度探针实验揭示了当前视觉语言模型在该任务上的表现与局限,为具身 AI 的泛化性研究提供了重要参考。 #UESFBench #具身智能 #基准测试 #AI #机器人 #视觉语言模型 #论文
Telegram必备的搜索引擎,极搜JISOU帮你精准找到,想要的群组、频道、视频、音乐

👉 t.me/jisou2?start=a_8247614025
STOCKTAKE:用公平Oracle衡量LLM智能体感知与行动之间的差距

近日,一篇名为《STOCKTAKE: Measuring the Gap Between Perception and Action in LLM Agents with a Fair Oracle》的论文在arXiv平台发布。该研究由Sagar Deb和Ashwanth Krishnan共同完成,聚焦于大型语言模型(LLM)智能体的核心问题:其感知(理解环境)与行动(执行任务)之间存在的差距。传统评估方法常受限于任务偏好或环境偏差,难以公正衡量这一差距。为此,作者设计了一种名为“公平Oracle”的评估框架,旨在消除这些偏差,更准确地测量LLM智能体从感知到行动的转化效率。该工作为理解LLM智能体的行为一致性提供了新视角,对提升智能体在复杂任务中的自主决策能力具有参考价值。论文提交于2026年7月,相关代码与数据已公开。 #LLM #AI #智能体 #论文 #arXiv #机器学习 #自主决策
大语言模型驱动智能体实现生物系统常微分方程自动发现

一篇发表在arXiv上的论文提出了一种利用大型语言模型(LLM)驱动的智能体系统,用于自动发现生物系统的常微分方程。该方法旨在将LLM的推理能力与自动化搜索相结合,以简化生物建模中常微分方程的推导过程。论文由David Krongauz等人撰写,目前处于提交状态,为生物系统建模提供了新的自动化手段。 #AI #大模型 #生物系统 #常微分方程 #自动发现 #arXiv #科研 #智能体
SAFETY SENTRY:上下文感知的人类干预机制——EXECUTE-ASK

在最新提交的arXiv论文中,Tianyu Chen等人提出了SAFETY SENTRY框架,旨在通过EXECUTE-ASK-REFUSE三类路由策略实现上下文感知的人工干预,提升AI系统的安全性。该框架允许系统根据当前语境和风险等级,自动决定是执行任务、向人类询问确认,还是直接拒绝请求,从而在自动化效率与安全控制之间取得平衡。论文探讨了如何将人类反馈无缝集成到AI决策流程中,尤其适用于高风险场景(如医疗、自动驾驶等)。这一研究为构建更可靠、可干预的智能系统提供了新思路,有望推动人机协作安全标准的完善。 #AI安全 #论文 #路由机制 #人机交互 #上下文感知 #SAFETYSENTRY #人工智能 #arXiv
AI建议抑制人们说“我不知道”的意愿,即使建议错误且准确率被激励

一项最新发表在arXiv上的研究揭示了AI建议对人类判断的负面影响。来自意大利的研究团队通过实验发现,当人们在完成任务时接收AI的建议(即使是错误的建议)时,他们更不愿意承认自己不知道答案。这种现象在实验中对准确率实施了激励措施后仍然存在。研究指出,AI的“权威性”可能削弱了人们自我反思和承认知识边界的能力。这一发现对AI辅助决策系统(如教育、医疗等领域)的设计提出了警示:过度依赖AI建议可能阻碍人类主动学习和批判性思维,且简单的经济激励无法抵消这种效应。 #AI #人工智能 #人类决策 #认知偏差 #arXiv #学术研究 #科技伦理
面向城市区域画像的多智能体协同推理方法发布

来自arXiv平台的最新论文预印本显示,研究人员提出了一种名为“多智能体协同推理与工具增强证据”的新方法,用于城市区域画像。该工作由Xixuan Hao等六位作者共同完成,论文于2026年7月15日提交。该方法创新性地利用多个智能体协同工作,并借助工具增强外部证据,以更准确、全面地刻画城市区域的特征与功能。这一研究有望提升城市规划、智能交通、商业选址等应用的数据分析能力,为城市计算领域提供新的技术思路。 #多智能体 #协同推理 #城市计算 #区域画像 #AI #学术论文 #人工智能 #智能城市
根因分析在真实遥测数据上的极限探索

一篇题为《根因分析在真实遥测数据上的极限》的学术论文在 arXiv 预印本平台发布。该研究由 Athira Gopal 和 Ashwanth Krishnan 共同完成,旨在评估根因分析(RCA)技术在真实世界遥测数据中的表现边界。论文聚焦于实际工业场景中复杂的指标波动和故障传播链,探讨了现有方法在数据噪声、依赖关系和因果推断方面的能力上限。研究结果可能对运维监控、故障诊断及自动化异常定位领域产生重要影响。 #根因分析 #遥测数据 #故障诊断 #机器学习 #论文 #arXiv #运维监控