Agentic Data Environments 论文发表,探索智能体数据管理新范式
一篇题为《Agentic Data Environments》的学术论文近期在 arXiv 预印本平台发布,并已被 IEEE Data Bulletin 第50卷第1期(2026年)收录。该论文由 Elaine Ang 等16位作者共同撰写,深入探讨了智能体(Agent)在数据环境中的角色与设计。研究指出,随着自动化与人工智能的发展,数据环境需要具备更强的自主性与适应性,以支持动态决策、实时分析和协作任务。论文提出了新的系统架构与交互模式,旨在让数据环境能够主动感知、推理并执行操作,从而提升复杂数据工作流的效率。该成果预计将对数据科学、数据库系统及AI应用领域产生重要影响。 #论文 #AI #智能体 #数据管理 #IEEE #DataBulletin #学术研究
一篇题为《Agentic Data Environments》的学术论文近期在 arXiv 预印本平台发布,并已被 IEEE Data Bulletin 第50卷第1期(2026年)收录。该论文由 Elaine Ang 等16位作者共同撰写,深入探讨了智能体(Agent)在数据环境中的角色与设计。研究指出,随着自动化与人工智能的发展,数据环境需要具备更强的自主性与适应性,以支持动态决策、实时分析和协作任务。论文提出了新的系统架构与交互模式,旨在让数据环境能够主动感知、推理并执行操作,从而提升复杂数据工作流的效率。该成果预计将对数据科学、数据库系统及AI应用领域产生重要影响。 #论文 #AI #智能体 #数据管理 #IEEE #DataBulletin #学术研究
Physics-Audited Agentic Discovery 论文公开,科学机器学习新范式
近日,一篇题为《Physics-Audited Agentic Discovery in Scientific Machine Learning》的论文在arXiv上公开。该论文由Diab W. Abueidda等四位作者完成,提交于2026年7月8日。研究提出一种“物理审计”框架,将物理约束与智能体驱动的自动发现过程相结合,旨在解决科学机器学习中模型可解释性与物理一致性不足的问题。该方法通过让智能体在探索数据驱动模型时接受物理定律的审计与校正,从而提升发现新物理规律或材料特性的可靠性。论文提供了完整的PDF和HTML版本,目前已在学术社区引发关注。 #科学机器学习 #物理审计 #智能体发现 #arXiv #AI #学术论文
近日,一篇题为《Physics-Audited Agentic Discovery in Scientific Machine Learning》的论文在arXiv上公开。该论文由Diab W. Abueidda等四位作者完成,提交于2026年7月8日。研究提出一种“物理审计”框架,将物理约束与智能体驱动的自动发现过程相结合,旨在解决科学机器学习中模型可解释性与物理一致性不足的问题。该方法通过让智能体在探索数据驱动模型时接受物理定律的审计与校正,从而提升发现新物理规律或材料特性的可靠性。论文提供了完整的PDF和HTML版本,目前已在学术社区引发关注。 #科学机器学习 #物理审计 #智能体发现 #arXiv #AI #学术论文
arXiv新研究:从原子动作到标准操作程序,迭代工具优化推动LLM智能体自我进化
一项发表在arXiv上的新研究提出了一种让大语言模型(LLM)智能体实现自我进化的迭代工具优化方法。该论文题为《From Atomic Actions to Standard Operating Procedures: Iterative Tool Optimization for Self-Evolving LLM Agents》,由Haipeng Ding等人撰写。研究核心是引导智能体从最基础的原子动作出发,通过反复试错与优化,自主构建标准操作程序(SOP)。这一过程使得智能体能够不断改进自身的工具使用策略,从而适应更复杂的任务场景。该框架打破了传统智能体依赖固定工具集的局限,显著提升了任务的执行效率与灵活性。这一成果为开发能够自主学习和进化的AI智能体提供了新的理论支持与实践路径,有望推动智能体在自动化工作流、科研辅助等领域更广泛的应用。 #AI #LLM #大模型 #原子动作 #SOP #工具优化 #自我进化 #智能体 #arXiv
一项发表在arXiv上的新研究提出了一种让大语言模型(LLM)智能体实现自我进化的迭代工具优化方法。该论文题为《From Atomic Actions to Standard Operating Procedures: Iterative Tool Optimization for Self-Evolving LLM Agents》,由Haipeng Ding等人撰写。研究核心是引导智能体从最基础的原子动作出发,通过反复试错与优化,自主构建标准操作程序(SOP)。这一过程使得智能体能够不断改进自身的工具使用策略,从而适应更复杂的任务场景。该框架打破了传统智能体依赖固定工具集的局限,显著提升了任务的执行效率与灵活性。这一成果为开发能够自主学习和进化的AI智能体提供了新的理论支持与实践路径,有望推动智能体在自动化工作流、科研辅助等领域更广泛的应用。 #AI #LLM #大模型 #原子动作 #SOP #工具优化 #自我进化 #智能体 #arXiv
研究提出推理一致性扫描框架,用于审计AI安全评估中的思维链有效性
近日,一篇题为《推理一致性扫描:审计AI安全评估中思维链有效性的框架》的论文在arXiv平台发布。该论文由Silvia Santano等人撰写,提出了一种名为“推理一致性扫描”(RCS)的新框架,旨在系统性地审计大语言模型在安全评估中的思维链(Chain-of-Thought)推理过程的有效性与可靠性。研究指出,随着AI模型在复杂任务中广泛使用思维链提示,其推理过程可能存在隐蔽的不一致或错误,传统评估方法难以检测。RCS框架通过扫描模型输出中的逻辑连贯性、步骤间的因果一致性等指标,帮助识别潜在的推理漏洞与对抗性操控。这一工作为提升AI安全评估的严谨性提供了新的工具与思路,尤其适用于高风险场景下的模型审计。 #推理一致性 #思维链 #AI安全 #模型审计 #arXiv #大语言模型 #AI安全评估 #SilviaSantano
近日,一篇题为《推理一致性扫描:审计AI安全评估中思维链有效性的框架》的论文在arXiv平台发布。该论文由Silvia Santano等人撰写,提出了一种名为“推理一致性扫描”(RCS)的新框架,旨在系统性地审计大语言模型在安全评估中的思维链(Chain-of-Thought)推理过程的有效性与可靠性。研究指出,随着AI模型在复杂任务中广泛使用思维链提示,其推理过程可能存在隐蔽的不一致或错误,传统评估方法难以检测。RCS框架通过扫描模型输出中的逻辑连贯性、步骤间的因果一致性等指标,帮助识别潜在的推理漏洞与对抗性操控。这一工作为提升AI安全评估的严谨性提供了新的工具与思路,尤其适用于高风险场景下的模型审计。 #推理一致性 #思维链 #AI安全 #模型审计 #arXiv #大语言模型 #AI安全评估 #SilviaSantano
AI 能否理解成像?新论文系统性基准测试代理型 AI 在计算成像任务中的表现
一篇题为《Does AI Understand Imaging? A Systematic Benchmark of Agentic AI for Computational Imaging Tasks》的论文于2026年7月8日在 arXiv 上提交。该研究由 Ethan Chung 等六位学者共同完成,首次围绕“AI 是否真正理解成像”这一核心问题,对代理型人工智能在计算成像任务中的表现进行了系统性基准测试。论文通过设计涵盖图像形成、重建与分析等多个环节的成像任务,系统评估了当前主流 AI 模型的理解能力与局限性,为后续构建更可靠的成像 AI 系统提供了重要的参考基准。 #AI #代理型AI #计算成像 #基准测试 #arXiv #学术研究
一篇题为《Does AI Understand Imaging? A Systematic Benchmark of Agentic AI for Computational Imaging Tasks》的论文于2026年7月8日在 arXiv 上提交。该研究由 Ethan Chung 等六位学者共同完成,首次围绕“AI 是否真正理解成像”这一核心问题,对代理型人工智能在计算成像任务中的表现进行了系统性基准测试。论文通过设计涵盖图像形成、重建与分析等多个环节的成像任务,系统评估了当前主流 AI 模型的理解能力与局限性,为后续构建更可靠的成像 AI 系统提供了重要的参考基准。 #AI #代理型AI #计算成像 #基准测试 #arXiv #学术研究
多智能体LLM安全研究获新进展
一篇题为《Operational Reframing and Approval-Framed Delegation in Multi-Agent LLM Safety》的论文于2026年7月8日提交至arXiv预印本平台。该研究由Lifei Liu等六位作者共同完成,聚焦多智能体大语言模型(LLM)系统的安全挑战。论文提出操作重构(Operational Reframing)与基于批准的委托(Approval-Framed Delegation)两种机制,旨在通过优化决策流程与授权控制,提升多智能体协作环境下的可靠性与风险管控能力。研究为AI安全领域提供了新的解决思路,尤其适用于复杂多智能体系统的部署与监管。 #多智能体 #LLM #AI安全 #arXiv #论文 #安全框架 #大模型
一篇题为《Operational Reframing and Approval-Framed Delegation in Multi-Agent LLM Safety》的论文于2026年7月8日提交至arXiv预印本平台。该研究由Lifei Liu等六位作者共同完成,聚焦多智能体大语言模型(LLM)系统的安全挑战。论文提出操作重构(Operational Reframing)与基于批准的委托(Approval-Framed Delegation)两种机制,旨在通过优化决策流程与授权控制,提升多智能体协作环境下的可靠性与风险管控能力。研究为AI安全领域提供了新的解决思路,尤其适用于复杂多智能体系统的部署与监管。 #多智能体 #LLM #AI安全 #arXiv #论文 #安全框架 #大模型
Measuring Intelligence Beyond Human Scale
Focus to learn more arXiv-issued DOI via DataCite (pending registration) Submission history From: Elad Hazan [ view email ] [v1] Wed, 8 Jul 2026 06:19:10 UTC (40 KB) Full-text links: Access Paper: View a PDF of the paper titled Measuring Intelligence Beyond Human Scale, by Jerry Han and 7 other authors View PDF TeX Source view license Current browse context: < prev | next > new | recent | 2026-07 Change to browse by: cs References & Citations NASA ADS Google Scholar Semantic Scholar export BibTeX citation Loading... BibTeX formatted citation × loading... Data provided by: Bookmark Bibliographic Tools Bibliographic and Citation Tools Bibliographic Explorer Toggle Bibliographic Explorer ( What is the Explorer? ) Connected Papers Toggle Connected Papers ( What is Connected Papers? ) Litmaps Toggle Litmaps ( What is Litmaps? ) Toggl
Focus to learn more arXiv-issued DOI via DataCite (pending registration) Submission history From: Elad Hazan [ view email ] [v1] Wed, 8 Jul 2026 06:19:10 UTC (40 KB) Full-text links: Access Paper: View a PDF of the paper titled Measuring Intelligence Beyond Human Scale, by Jerry Han and 7 other authors View PDF TeX Source view license Current browse context: < prev | next > new | recent | 2026-07 Change to browse by: cs References & Citations NASA ADS Google Scholar Semantic Scholar export BibTeX citation Loading... BibTeX formatted citation × loading... Data provided by: Bookmark Bibliographic Tools Bibliographic and Citation Tools Bibliographic Explorer Toggle Bibliographic Explorer ( What is the Explorer? ) Connected Papers Toggle Connected Papers ( What is Connected Papers? ) Litmaps Toggle Litmaps ( What is Litmaps? ) Toggl
e scite Smart Citations ( What are Smart Citations? ) Code, Data, Media Code, Data and Media Associated with this Article alphaXiv Toggle alphaXiv ( What is alphaXiv? ) Links to Code Toggle CatalyzeX Code Finder for Papers ( What is CatalyzeX? ) DagsHub Toggle DagsHub ( What is DagsHub? ) GotitPub Toggle ( What is GotitPub? ) Huggingface Toggle Hugging Face ( What is Huggingface? ) ScienceCast Toggle ScienceCast ( What is ScienceCast? ) Demos Demos Replicate Toggle Replicate ( What is Replicate? ) Spaces Toggle Hugging Face Spaces ( What is Spaces? ) Spaces Toggle ( What is ? ) Related Papers Recommenders and Search Tools Link to Influence Flower Influence Flower ( What are Influence Flowers? ) Core recommender toggle CORE Recommender ( What is CORE? ) Author Venue Institution Topic About arXivLabs arXivLabs: experimental projects with community collaborators arXivLabs is a framework that allows collaborators to develop and share new arXiv features directly on our website. Both individuals and organizations that work with arXivLabs have embraced and accepted our values of openness, community, excellence, and user data privacy. arXiv is committed to these values and only works with partners that adhere to them. Have an idea for a project that will add value for arXiv's community? Learn more about arXivLabs .
学习社会规范可提升动态人机协调的兼容性
近日,一篇题为《Learning social norms enhances compatibility in dynamic human-AI coordination》的论文在arXiv预印本平台发布。该论文由Yi Yang等学者撰写,指出在动态人机协作环境中,AI系统通过学习并遵循社会规范,能够显著提升与人类合作的兼容性和效率。研究认为,社会规范的学习有助于智能体更好地理解人类意图、预测行为变化,从而在复杂交互中做出更协调的决策。这一成果对自动驾驶、智能机器人以及多智能体系统等领域具有潜在应用价值。论文目前已在arXiv上公开,供相关领域研究者参考。 #人机协调 #社会规范 #AI #论文 #arXiv #动态协作 #多智能体
近日,一篇题为《Learning social norms enhances compatibility in dynamic human-AI coordination》的论文在arXiv预印本平台发布。该论文由Yi Yang等学者撰写,指出在动态人机协作环境中,AI系统通过学习并遵循社会规范,能够显著提升与人类合作的兼容性和效率。研究认为,社会规范的学习有助于智能体更好地理解人类意图、预测行为变化,从而在复杂交互中做出更协调的决策。这一成果对自动驾驶、智能机器人以及多智能体系统等领域具有潜在应用价值。论文目前已在arXiv上公开,供相关领域研究者参考。 #人机协调 #社会规范 #AI #论文 #arXiv #动态协作 #多智能体
Large Behavior Model: A Promptable Digital Twin of the Retail Customer
Focus to learn more arXiv-issued DOI via DataCite (pending registration) Submission history From: Krittin Pachtrachai PhD [ view email ] [v1] Wed, 8 Jul 2026 04:31:18 UTC (242 KB) Full-text links: Access Paper: View a PDF of the paper titled Large Behavior Model: A Promptable Digital Twin of the Retail Customer, by Wachiravit Modecrua and 2 other authors View PDF HTML (experimental) TeX Source view license Current browse context: < prev | next > new | recent | 2026-07 Change to browse by: cs References & Citations NASA ADS Google Scholar Semantic Scholar export BibTeX citation Loading... BibTeX formatted citation × loading... Data provided by: Bookmark Bibliographic Tools Bibliographic and Citation Tools Bibliographic Explorer Toggle Bibliographic Explorer ( What is the Explorer? ) Connected Papers T
Focus to learn more arXiv-issued DOI via DataCite (pending registration) Submission history From: Krittin Pachtrachai PhD [ view email ] [v1] Wed, 8 Jul 2026 04:31:18 UTC (242 KB) Full-text links: Access Paper: View a PDF of the paper titled Large Behavior Model: A Promptable Digital Twin of the Retail Customer, by Wachiravit Modecrua and 2 other authors View PDF HTML (experimental) TeX Source view license Current browse context: < prev | next > new | recent | 2026-07 Change to browse by: cs References & Citations NASA ADS Google Scholar Semantic Scholar export BibTeX citation Loading... BibTeX formatted citation × loading... Data provided by: Bookmark Bibliographic Tools Bibliographic and Citation Tools Bibliographic Explorer Toggle Bibliographic Explorer ( What is the Explorer? ) Connected Papers T
oggle Connected Papers ( What is Connected Papers? ) Litmaps Toggle Litmaps ( What is Litmaps? ) Toggle scite Smart Citations ( What are Smart Citations? ) Code, Data, Media Code, Data and Media Associated with this Article alphaXiv Toggle alphaXiv ( What is alphaXiv? ) Links to Code Toggle CatalyzeX Code Finder for Papers ( What is CatalyzeX? ) DagsHub Toggle DagsHub ( What is DagsHub? ) GotitPub Toggle ( What is GotitPub? ) Huggingface Toggle Hugging Face ( What is Huggingface? ) ScienceCast Toggle ScienceCast ( What is ScienceCast? ) Demos Demos Replicate Toggle Replicate ( What is Replicate? ) Spaces Toggle Hugging Face Spaces ( What is Spaces? ) Spaces Toggle ( What is ? ) Related Papers Recommenders and Search Tools Link to Influence Flower Influence Flower ( What are Influence Flowers? ) Core recommender toggle CORE Recommender ( What is CORE? ) Author Venue Institution Topic About arXivLabs arXivLabs: experimental projects with community collaborators arXivLabs is a framework that allows collaborators to develop and share new arXiv features directly on our website. Both individuals and organizations that work with arXivLabs have embraced and accepted our values of openness, community, excellence, and user data privacy. arXiv is committed to these values and only works with partners that adhere to them. Have an idea for a project that will add value for arXiv's community? Learn more about arXivLabs .
紧凑世界模型中的空间关系基础化
来自Yufeng Wang等作者的研究论文《Grounding Spatial Relations in a Compact World Model: Instruction Leakage and a Goal-Free Dynamics Fix》于2026年7月8日提交至arXiv预印本平台。该工作深入探讨了在紧凑世界模型中如何实现空间关系的有效基础化,并重点分析了指令泄漏问题——即模型在训练过程中意外依赖与任务无关的指令信息。为克服这一缺陷,作者提出了一种无目标动力学修复方法,旨在让模型在不依赖明确目标信号的情况下,仅通过动力学特征习得稳固的空间表征。研究属于计算机科学领域,相关工作有望提升AI系统在复杂环境中的空间推理与导航能力,为构建更鲁棒的世界模型提供了新思路。 #空间关系 #紧凑世界模型 #指令泄漏 #无目标动力学 #人工智能 #计算机科学 #arXiv #研究论文
来自Yufeng Wang等作者的研究论文《Grounding Spatial Relations in a Compact World Model: Instruction Leakage and a Goal-Free Dynamics Fix》于2026年7月8日提交至arXiv预印本平台。该工作深入探讨了在紧凑世界模型中如何实现空间关系的有效基础化,并重点分析了指令泄漏问题——即模型在训练过程中意外依赖与任务无关的指令信息。为克服这一缺陷,作者提出了一种无目标动力学修复方法,旨在让模型在不依赖明确目标信号的情况下,仅通过动力学特征习得稳固的空间表征。研究属于计算机科学领域,相关工作有望提升AI系统在复杂环境中的空间推理与导航能力,为构建更鲁棒的世界模型提供了新思路。 #空间关系 #紧凑世界模型 #指令泄漏 #无目标动力学 #人工智能 #计算机科学 #arXiv #研究论文
新论文揭示"驾驭效应":编排设计决定企业代理AI的Token经济学
一篇名为《The Harness Effect: How Orchestration Design Sets the Token Economics of Enterprise Agentic AI》的学术论文于2026年7月8日提交至预印本平台arXiv。该论文由Muayad Sayed Ali等32位研究者共同撰写,深入探讨了在企业级多智能体系统中,编排设计(即任务分配与流程协调机制)如何从根本上影响Token的消耗与经济效益。论文提出了“Harness Effect”(驾驭效应)概念,指出不同的编排策略会显著改变AI代理的Token使用模式,进而影响企业AI部署的成本与效率。这一研究成果为优化企业级AI代理的经济模型提供了关键理论指导,有望推动更高效、更经济的AI系统设计。 #论文 #AI代理 #Token经济学 #编排设计 #企业AI #arXiv #多智能体
一篇名为《The Harness Effect: How Orchestration Design Sets the Token Economics of Enterprise Agentic AI》的学术论文于2026年7月8日提交至预印本平台arXiv。该论文由Muayad Sayed Ali等32位研究者共同撰写,深入探讨了在企业级多智能体系统中,编排设计(即任务分配与流程协调机制)如何从根本上影响Token的消耗与经济效益。论文提出了“Harness Effect”(驾驭效应)概念,指出不同的编排策略会显著改变AI代理的Token使用模式,进而影响企业AI部署的成本与效率。这一研究成果为优化企业级AI代理的经济模型提供了关键理论指导,有望推动更高效、更经济的AI系统设计。 #论文 #AI代理 #Token经济学 #编排设计 #企业AI #arXiv #多智能体
SageMath 增强 LLM 智能体
一项预印本研究在 arXiv 公开,标题为《Evaluating SageMath-Augmented LLM Agents for Computational and Experimental Mathematics》。该工作由 Pavel Snopov 等人完成,旨在系统评估将开源数学软件 SageMath 与大语言模型(LLM)相结合所形成的智能体,在计算与实验数学任务上的表现。研究通过设计基准测试,分析了此类增强智能体在符号计算、代数推导与数学实验等场景中的能力与局限性,探讨了利用专业数学工具补齐 LLM 在精确计算与形式化验证方面短板的可能性,为未来 AI 辅助数学研究提供了新的思路与参考。 #arXiv #SageMath #LLM #大模型 #计算数学 #实验数学 #AI #机器学习 #预印本
一项预印本研究在 arXiv 公开,标题为《Evaluating SageMath-Augmented LLM Agents for Computational and Experimental Mathematics》。该工作由 Pavel Snopov 等人完成,旨在系统评估将开源数学软件 SageMath 与大语言模型(LLM)相结合所形成的智能体,在计算与实验数学任务上的表现。研究通过设计基准测试,分析了此类增强智能体在符号计算、代数推导与数学实验等场景中的能力与局限性,探讨了利用专业数学工具补齐 LLM 在精确计算与形式化验证方面短板的可能性,为未来 AI 辅助数学研究提供了新的思路与参考。 #arXiv #SageMath #LLM #大模型 #计算数学 #实验数学 #AI #机器学习 #预印本
成本效益代理工具助力ARC-AGI
近日,Kabir Moghe等人在arXiv预印本平台提交了一篇题为《Cost-Effective Agent Harnesses for Abstract Reasoning and Generalization on ARC-AGI-1》的论文。该研究聚焦ARC-AGI-1这一衡量AI抽象推理能力的关键基准,提出了一种高性价比的代理工具,旨在以较低计算成本提升模型的推理与泛化性能。通过优化代理架构与策略,研究团队在资源受限条件下实现了更高效的抽象问题解决,为人工智能向通用智能发展提供了新思路,并展示了降低大模型依赖度的可能性。 #人工智能 #抽象推理 #泛化 #ARCAGI #成本效益 #代理工具 #预印本 #AI研究
近日,Kabir Moghe等人在arXiv预印本平台提交了一篇题为《Cost-Effective Agent Harnesses for Abstract Reasoning and Generalization on ARC-AGI-1》的论文。该研究聚焦ARC-AGI-1这一衡量AI抽象推理能力的关键基准,提出了一种高性价比的代理工具,旨在以较低计算成本提升模型的推理与泛化性能。通过优化代理架构与策略,研究团队在资源受限条件下实现了更高效的抽象问题解决,为人工智能向通用智能发展提供了新思路,并展示了降低大模型依赖度的可能性。 #人工智能 #抽象推理 #泛化 #ARCAGI #成本效益 #代理工具 #预印本 #AI研究