AI知识库 @ai521
363 subscribers
24.2K photos
45 videos
20 files
925 links
@ai521 专注分享最实用的AI内容

🤖 AI教程(新手到进阶)
🧠 AI知识科普(大模型 / 提示词 / 自动化)
📰 AI资讯更新(每日最新AI动态)
📚 AI实战技巧(写作 / 绘画 / 编程 / 赚钱)
🔧 最新AI工具推荐

每天更新AI干货
长期做一个真正有价值的AI频道
Download Telegram
WISE: 基于“Why-Which”推理的Minecraft长周期智能体

一篇来自arXiv的预印本论文介绍了名为WISE的长周期智能体,该智能体专为Minecraft环境设计,核心创新在于采用“Why-Which推理”机制。这一推理框架使智能体能够在长时间跨度内进行因果归纳与目标拆解,从而在开放世界游戏中执行复杂的、需要多步规划的任务。作者Renmin Cheng等人表示,WISE通过区分“为什么做”(Why)和“做什么”(Which),显著提升了智能体在动态场景下的长期决策能力。该研究有望推动具身智能体在复杂虚拟环境中的应用,并为现实世界的机器人长期自主任务提供新思路。 #AI #智能体 #Minecraft #长周期推理 #WhyWhich #具身智能 #论文 #arXiv
人类监督对AI辅助社会科学研究仍不可或缺

近日,一篇题为《人类注意力(仍然)是你所需:人类监督使AI辅助的社会科学研究可靠》的论文在arXiv预印本平台发布。该研究指出,尽管大语言模型等AI工具在社会科学研究中展现出强大能力,但若缺乏人类持续、细致的监督,AI生成的分析结果可能不可靠。论文通过实验验证,在数据标注、因果推断和文本分析等环节,人类专家的注意力(即人工审核与干预)能有效纠正AI的偏差和错误,确保研究结论的稳健性。作者强调,当前AI不能完全替代人类的判断力,尤其在涉及复杂社会现象和价值判断的研究中,人类监督仍是确保科学诚信的“必需品”。该发现为AI与社会科学的交叉领域提供了重要方法论参考,呼吁学界在拥抱技术的同时守住人工校验的底线。 #AI #社会科学 #人类监督 #论文 #arXiv #注意力机制 #研究方法
科学智能体构建指南:AgentBuild 框架用于 Rietveld 精修

一篇题为《Fantastic Scientific Agents and How to Build Them: AgentBuild for Rietveld Refinement》的论文在 arXiv 上预印发布。该研究由 Woong Shin 等人完成,提出了一种名为 AgentBuild 的框架,旨在帮助科学家构建用于 Rietveld 精修的科学智能体。Rietveld 精修是材料科学中分析晶体结构的重要方法,传统上依赖手动调整参数,过程繁琐。AgentBuild 通过模块化设计和可复用的组件,使研究人员能够快速定制自动化智能体,从而提升材料分析效率。论文还提供了示例和实现细节,展示了智能体在数据驱动科学中的潜力。 #科学智能体 #Rietveld精修 #材料科学 #AI #arXiv #论文 #自动化
AI研究中的主题相变

一项来自arXiv的最新研究揭示了人工智能研究领域的“主题相变”现象。研究者Rasul Khanbayov与Hasan Kurban通过大规模数据分析,提出了识别新兴研究主题的早期预警机制。该研究系统梳理了AI领域内研究热点的动态演化规律,发现了从旧范式中突然涌现新趋势的“相变”模式。这一成果有助于科研人员预判AI发展方向,提前布局前沿领域,也为科技政策制定者和投资者提供了量化参考工具。论文于2026年6月提交至预印本平台,目前已开放全文下载。 #AI #人工智能 #研究趋势 #主题相变 #科研动态 #arXiv #文献计量
GeoNatureAgent基准测试

研究人员提出了GeoNatureAgent基准测试,专门用于评估大语言模型(LLM)在环境地理空间分析中的能力。该基准覆盖了前沿模型与开源基础模型,专注于衡量模型在处理地理数据、环境模拟和空间推理等复杂任务上的表现。论文由Gabriel Diaz-Ireland等学者撰写,已在arXiv预印本平台发布。这一标准化评估框架有望推动AI在环境监测、资源管理和生态模拟等实际场景中的深入应用,为地理科学领域引入更可靠的智能分析工具。 #GeoNatureAgent #大模型 #环境地理 #AI基准 #空间分析 #LLM #arXiv #地理科学 #人工智能 #环境监测
Teach-and-Repeat:从移动屏幕演示中精确提取操作知识,增强GUI智能体

该论文提出了一种名为“Teach-and-Repeat”的方法,旨在从用户的移动屏幕操作演示中精准提取可复用的操作知识,从而赋能GUI智能体。传统方法面临演示噪声大、意图模糊等问题,而该工作通过记录屏幕状态与用户点击序列,结合语义对齐与动作泛化技术,能够自动学习任务的原子操作步骤,并支持在相似界面下的重复执行。实验表明,该方法在多个App任务上显著提升了智能体的任务完成准确率,降低了人工标注成本,为移动端自动化与无代码编程提供了新思路。 #arXiv #GUI智能体 #移动端自动化 #屏幕演示 #操作知识提取 #人机交互 #人工智能
MLUBench

研究人员近日发布了一项名为MLUBench的新基准,专门用于评估多模态大模型(MLLMs)在终身学习场景下的遗忘(Unlearning)能力。该基准旨在系统性地衡量模型在持续吸收新知识时,能否有效去除或抑制先前学习到的特定信息,从而避免模型产生有害输出或侵犯隐私。MLUBench覆盖了多种遗忘任务和评估维度,为多模态人工智能的安全性与可塑性研究提供了标准化测试平台。相关论文已在arXiv上公开,并附带代码与数据,供学术界和工业界进一步探索。 #MLUBench #多模态大模型 #终身学习 #遗忘评估 #AI安全 #机器学习 #论文 #arXiv
面向公众的自主AI框架存在安全漏洞,研究揭示“遏制缺口”

近期一篇题为《遏制缺口:已部署的自主AI框架如何未能满足面向公众的安全要求》的论文在arXiv上发布。研究指出,当前主流自主AI框架在部署到面向公众的场景时,缺乏有效的安全遏制机制。这些框架允许AI代理执行行动,却未充分限制其访问敏感系统或进行有害操作,导致存在被恶意利用的风险。作者分析了多个流行框架,发现它们在权限管理、行为监控和失败回滚等方面存在系统性缺陷。该研究呼吁开发者重新审视安全设计,建立更严格的遏制策略,以防止自主AI造成意外后果或被滥用。 #AI安全 #自主代理 #框架漏洞 #论文 #人工智能 #安全风险 #科技研究
世界模型与物理AI教程

一篇题为《世界模型与物理AI教程》的论文由作者Il-Seok Oh提交至arXiv预印本平台。该教程系统介绍了世界模型(World Models)在物理人工智能(Physical AI)领域中的基础理论与应用方法。世界模型作为AI系统理解环境动态的核心技术,通过构建内部表征实现预测与规划,而物理AI则强调机器人在真实物理世界中的感知、决策与行动能力。该教程涵盖了世界模型的构建、强化学习整合、仿真环境交互等关键议题,为研究人员和开发者提供了从理论到实践的指导。论文提交于2026年6月,目前可通过arXiv获取全文。 #世界模型 #物理AI #人工智能 #教程 #arXiv #论文 #机器学习 #机器人
新研究提出构建程序推理评估数据集的方法

据arXiv预印本,来自Sarah Elshabrawy等研究人员发表论文,探讨如何构建用于程序推理的评估数据集。研究指出,现有数据集在自然性、基础性(grounding)和多跳覆盖三个方面难以兼顾,往往偏向其中某一特性而牺牲其他。他们提出了一种新的构建框架,通过精心设计的采样和标注策略,在保持任务真实感的同时,确保每个样本具备充分的上下文基础,并覆盖多步推理链条。该工作旨在更准确地评估AI系统在复杂程序理解与执行中的表现,对自然语言处理、知识推理及大模型评测领域具有参考价值。 #AI #程序推理 #评估数据集 #自然语言处理 #arXiv #论文 #多跳推理 #大模型 #知识推理
大语言模型中的预填充感知研究

一篇标题为《Prefill Awareness in Large Language Models》的学术论文近日在arXiv预印本平台发布。该论文由Andy Wang等六位作者共同完成,研究聚焦于大语言模型中的“预填充感知”现象。预填充阶段是模型生成回答前的关键步骤,直接影响推理效率和输出质量。论文可能探讨了如何让模型在预填充过程中更有效地利用上下文信息、降低计算开销,或提升对用户输入的敏感性。这一研究有助于优化LLM的推理架构,对于提升实际部署中的响应速度和准确性具有重要意义。 #大语言模型 #预填充感知 #论文 #AI #arXiv #机器学习 #推理优化
减少可穿戴设备脑电分析的深度学习模型复杂度

一篇新近提交至arXiv的论文提出,通过降低深度学习模型的复杂度,可将脑电图(EEG)分析高效部署于可穿戴设备。现有深度学习模型虽在EEG信号处理上表现优异,但计算资源需求高,难以在资源受限的可穿戴设备上实时运行。该研究由Farough Shayeste Roodi等六位作者共同完成,聚焦于模型压缩与轻量化技术,旨在平衡分析精度与设备能耗。若成果得以应用,将有望推动便携式脑机接口、实时健康监测等领域的普及,为神经疾病诊断与日常脑活动追踪提供低功耗解决方案。 #深度学习 #EEG #可穿戴设备 #模型压缩 #脑机接口 #神经科学 #论文 #arXiv
AI 智能体跨尺度科学挑战评测基准发布

一项由 Tianyu Liu 等 32 位研究者共同完成的论文《Benchmarking AI Agents for Addressing Scientific Challenges Across Scales》在 arXiv 上发布。该研究提出了一个系统性的基准框架,用于评估人工智能智能体在不同科学尺度下解决复杂问题的能力,涵盖从微观分子到宏观生态的多层级科学挑战。研究者通过设计标准化测试任务,考察 AI 智能体在数据处理、模型构建、实验推理等方面的表现。该基准旨在为 AI 在科学发现中的实际应用提供客观评估工具,推动 AI 智能体在气候模拟、药物研发、材料科学等跨学科领域的落地。论文还探讨了当前 AI 在科学推理、因果推断等方面的局限性,为后续研究指出了优化方向。这一工作有望加速 AI 辅助科学研究的规范化进程。 #AI #科学 #基准测试 #智能体 #arXiv #跨学科 #论文
重新思考LLM的心理测量评估

一项来自arXiv预印本的研究挑战了大型语言模型(LLM)心理测量评估的传统方法。该论文题为《重新思考LLM的心理测量评估:自我报告何时及为何能预测行为》,由Rafal Kocielnik等8位作者撰写。研究指出,当前广泛使用的自我报告测试(如性格和态度问卷)在评估LLM时存在局限——模型可能模仿人类作答策略,而非反映真实内部状态。论文深入分析了自我报告在何种条件下能有效预测LLM的实际行为,并探讨了评估效度的关键因素。这一发现对AI安全和对齐研究具有重要参考价值,提示研究者需谨慎设计心理测量工具,避免过度依赖表面化的自我报告数据。 #LLM #人工智能 #心理测量 #AI安全 #arXiv #论文评述 #大模型研究
心理理论效用

该论文由Nikolos Gurney和Stacy Marsella提交至arXiv,题为《心理理论效用:心理化机制的形式化规范》。研究旨在通过形式化方法,对“心理理论”(Theory of Mind)这一认知能力进行精确建模,即个体如何推断他人心理状态并指导自身行为。作者提出了一种基于效用的心理化机制规范,将心理理论视为一个效用最大化过程,从而为人工智能系统赋予更接近人类的社交推理能力。论文详细阐述了模型的定义、数学框架及其在交互场景中的应用潜力,有望推动人机协作、社会认知AI等领域的发展。该研究于2026年6月10日首次发布,目前处于arXiv预印本阶段,尚未注册DOI。 #心理理论 #认知科学 #人工智能 #形式化规范 #人机交互 #arXiv
AGI 声明裁决新框架

该论文提出了一种设计科学框架,主张在对通用人工智能(AGI)的能力进行对齐之前,首先需实现定义对齐。作者 J. E. Aguilera Briones 认为,当前关于 AGI 的各类声明缺乏统一标准,导致争议频发。该框架旨在通过先明确概念边界与评估准则,再探讨能力验证,从而为 AGI 进展提供更可靠的裁决依据。论文已在 arXiv 预印本平台发布,目前可全文访问。 #AGI #定义对齐 #能力对齐 #设计科学 #论文 #arXiv #人工智能
以部署为中心的评估

论文《Deployment-Centered Evaluation: Predicting Query-Level Rejection Risk in a Clinical LLM System》由Alyssa Unell等六位作者撰写,于2026年6月10日提交至arXiv预印本平台。该研究聚焦临床大型语言模型(LLM)在实际部署中面临的查询级拒绝问题,提出一种以部署为中心的评估方法,旨在精准预测系统何时会拒绝回答特定查询。通过分析模型行为与临床场景的匹配度,研究者尝试为医疗AI的安全性提供量化风险工具。论文全文已在arXiv开放获取,并附有PDF及TeX源码链接,涉及引用、代码、数据集等关联资源。该工作对提升临床AI系统的可靠性和可控性具有参考价值。 #临床LLM #AI安全 #风险评估 #arXiv #医疗AI #以部署为中心的评估 #查询级拒绝 #预印本
Telegram必备的搜索引擎,极搜JISOU帮你精准找到,想要的群组、频道、视频、音乐

👉 t.me/jisou2?start=a_8247614025
《从AGI到ASI》论文发布,探讨人工智能终极演进路径

一篇题为《From AGI to ASI》的学术论文近日在arXiv预印本平台上线。该论文由Tim Genewein等14位研究人员共同撰写,提交于2026年6月10日。尽管论文摘要尚未公开披露,但标题明确指向从通用人工智能(AGI)向超级人工智能(ASI)的演进过程。这一方向被视为人工智能领域的终极命题,涉及技术路线、安全对齐、智能爆炸等核心议题。论文的发布引发学界关注,或将为AGI之后的AI发展提供理论框架与前瞻性讨论。 #AI #AGI #ASI #人工智能 #arXiv #论文 #科技前沿
Evoflux:推理时演化可执行工具工作流,构建紧凑型智能体

来自arXiv的一篇论文提出了一种名为Evoflux的新方法,旨在通过在推理阶段演化可执行工具工作流,来构建更紧凑的智能体。传统方法通常依赖大量预定义工具或复杂的手工编排,而Evoflux允许智能体在推理过程中动态地生成、测试和优化工具调用序列。该方法利用进化算法,在保持模型紧凑的同时,显著提升了智能体在复杂任务上的表现,如多步骤推理和工具使用。实验结果表明,Evoflux在多个基准测试中优于现有方法,为构建高效、轻量级的智能体系统提供了新思路。 #AI #智能体 #进化算法 #工具工作流 #arXiv #机器学习 #推理优化
TrajGenAgent

研究人员提出TrajGenAgent,一种基于分层大语言模型(LLM)的智能体,用于生成逼真的人类移动轨迹。该框架通过将轨迹生成任务分解为高层意图规划与低层路径执行两个层次,有效解决了传统方法在长序列、多模态行为建模中的局限性。实验表明,TrajGenAgent在轨迹保真度、时空一致性及多样性指标上均优于现有基线模型,为城市计算、交通模拟及社交网络分析等领域提供了新的技术路径。相关论文已提交至arXiv预印本平台。 #LLM #轨迹生成 #人工智能 #城市计算 #交通模拟 #arXiv #论文