openJiuwen亮相开放原子生态大会,发布AgentOS标杆架构
在开放原子开源生态大会上,openJiuwen社区展示了其开源成果,由陈海波教授解读了AI Agent落地的四大挑战,包括复杂任务成功率、行业知识沉淀等,并提出智能体护城河在于工程能力与协同范式。openJiuwen构建了从系统服务、分布式运行时到智能体框架的三层AgentOS架构,强调多智能体协同比单点能力更重要。目前,该社区已在金融、制造、科研等领域实现商用落地,如邮储银行基于openJiuwen打造智能体中台,华为制造采用其框架实现多智能体协同生产管理。此外,社区还表彰了产业先锋与技术贡献者,并联合CCF举办大数据与计算智能大赛,推动Agent生态繁荣。 #openJiuwen #AgentOS #开源 #AI #智能体 #产业落地 #多智能体协同 #智能制造 #金融科技
在开放原子开源生态大会上,openJiuwen社区展示了其开源成果,由陈海波教授解读了AI Agent落地的四大挑战,包括复杂任务成功率、行业知识沉淀等,并提出智能体护城河在于工程能力与协同范式。openJiuwen构建了从系统服务、分布式运行时到智能体框架的三层AgentOS架构,强调多智能体协同比单点能力更重要。目前,该社区已在金融、制造、科研等领域实现商用落地,如邮储银行基于openJiuwen打造智能体中台,华为制造采用其框架实现多智能体协同生产管理。此外,社区还表彰了产业先锋与技术贡献者,并联合CCF举办大数据与计算智能大赛,推动Agent生态繁荣。 #openJiuwen #AgentOS #开源 #AI #智能体 #产业落地 #多智能体协同 #智能制造 #金融科技
人工智能时代记忆机制综述论文发表
一篇题为《Memory in the Age of AI Agents》的综述论文在预印本平台arXiv上线,作者团队包括胡玉阳(音译)等46位研究人员。该论文于2025年12月首次提交,后于2026年1月更新,全面梳理了智能体系统中记忆机制的研究进展。论文深入探讨了AI智能体如何存储、检索和应用知识,分析了当前方法的优劣,并对未来发展方向提出展望。随着AI智能体在多领域广泛应用,记忆能力成为决定其性能的关键因素,但如何设计高效、可扩展的记忆系统仍是重大挑战。这份综述为后续研究提供了系统性参考,有望推动智能体架构的进一步优化。 #AI智能体 #记忆机制 #综述论文 #arXiv #人工智能 #机器学习 #智能系统
一篇题为《Memory in the Age of AI Agents》的综述论文在预印本平台arXiv上线,作者团队包括胡玉阳(音译)等46位研究人员。该论文于2025年12月首次提交,后于2026年1月更新,全面梳理了智能体系统中记忆机制的研究进展。论文深入探讨了AI智能体如何存储、检索和应用知识,分析了当前方法的优劣,并对未来发展方向提出展望。随着AI智能体在多领域广泛应用,记忆能力成为决定其性能的关键因素,但如何设计高效、可扩展的记忆系统仍是重大挑战。这份综述为后续研究提供了系统性参考,有望推动智能体架构的进一步优化。 #AI智能体 #记忆机制 #综述论文 #arXiv #人工智能 #机器学习 #智能系统
研究揭示Lean定理证明基准测试存在数据集缺陷与评估失败
一篇题为《Faults in Our Formal Benchmarking: Dataset Defects and Evaluation Failures in Lean Theorem Proving》的论文指出,当前用于衡量Lean定理证明器性能的基准测试存在系统性缺陷。研究人员通过深入分析发现,现有数据集包含大量噪声、错误标注和不合理假设,导致评估结果失真。例如,某些问题本身在形式化上存在矛盾,或者数据集构造时引入了偏差,使得模型能通过“取巧”而非真正推理通过测试。该研究还揭示了评价指标设计上的漏洞,如过度依赖过拟合敏感的度量标准。这项工作对推动形式化验证领域的基准建设具有警示意义,呼吁社区重新审视并改进评估方法,以确保AI辅助定理证明的进展更加可靠。 #定理证明 #Lean #基准测试 #形式化验证 #AI #数据集缺陷 #评估失败 #研究论文
一篇题为《Faults in Our Formal Benchmarking: Dataset Defects and Evaluation Failures in Lean Theorem Proving》的论文指出,当前用于衡量Lean定理证明器性能的基准测试存在系统性缺陷。研究人员通过深入分析发现,现有数据集包含大量噪声、错误标注和不合理假设,导致评估结果失真。例如,某些问题本身在形式化上存在矛盾,或者数据集构造时引入了偏差,使得模型能通过“取巧”而非真正推理通过测试。该研究还揭示了评价指标设计上的漏洞,如过度依赖过拟合敏感的度量标准。这项工作对推动形式化验证领域的基准建设具有警示意义,呼吁社区重新审视并改进评估方法,以确保AI辅助定理证明的进展更加可靠。 #定理证明 #Lean #基准测试 #形式化验证 #AI #数据集缺陷 #评估失败 #研究论文
投标前应做多少尽职调查?研究揭示复杂收购拍卖中的学习策略
一篇来自arXiv的论文探讨了在难以处理的收购拍卖中,竞标者应如何进行尽职调查。研究名为《How Much Due Diligence Before You Bid? Learning in Intractable Takeover Auctions》,作者Zain Naboulsi指出,在复杂的收购拍卖环境下,竞标者面临信息不对称和不确定性,需要权衡尽职调查的成本与收益。论文通过模型分析,揭示了竞标者如何通过动态学习来优化投标策略,从而在有限信息下做出更优决策。该研究对于理解企业并购中的博弈行为具有理论意义,并为实际拍卖设计提供了参考。 #论文 #收购拍卖 #尽职调查 #学习策略 #博弈论 #arXiv #研究
一篇来自arXiv的论文探讨了在难以处理的收购拍卖中,竞标者应如何进行尽职调查。研究名为《How Much Due Diligence Before You Bid? Learning in Intractable Takeover Auctions》,作者Zain Naboulsi指出,在复杂的收购拍卖环境下,竞标者面临信息不对称和不确定性,需要权衡尽职调查的成本与收益。论文通过模型分析,揭示了竞标者如何通过动态学习来优化投标策略,从而在有限信息下做出更优决策。该研究对于理解企业并购中的博弈行为具有理论意义,并为实际拍卖设计提供了参考。 #论文 #收购拍卖 #尽职调查 #学习策略 #博弈论 #arXiv #研究
FADE:通过降低语言先验主导性缓解大型视觉语言模型幻觉
一篇题为《FADE: Mitigating Hallucinations by Reducing Language-Prior Dominance in Large Vision-Language Models》的学术论文近日在arXiv预印本平台发布。该研究由Yichen Guo等学者提出,旨在解决大型视觉语言模型(LVLMs)中常见的“幻觉”问题——即模型生成与视觉输入不一致的描述。作者指出,现有模型过度依赖语言先验知识,导致对视觉信息的关注不足。FADE方法通过调整模型内部注意力机制,削弱语言先验的主导地位,增强视觉特征的影响,从而显著降低幻觉发生率。实验表明,该方法在多个基准测试上有效提升了模型输出的准确性和可靠性,为多模态AI的稳健性研究提供了新思路。 #AI #大模型 #视觉语言模型 #幻觉 #FADE #多模态 #arXiv #论文
一篇题为《FADE: Mitigating Hallucinations by Reducing Language-Prior Dominance in Large Vision-Language Models》的学术论文近日在arXiv预印本平台发布。该研究由Yichen Guo等学者提出,旨在解决大型视觉语言模型(LVLMs)中常见的“幻觉”问题——即模型生成与视觉输入不一致的描述。作者指出,现有模型过度依赖语言先验知识,导致对视觉信息的关注不足。FADE方法通过调整模型内部注意力机制,削弱语言先验的主导地位,增强视觉特征的影响,从而显著降低幻觉发生率。实验表明,该方法在多个基准测试上有效提升了模型输出的准确性和可靠性,为多模态AI的稳健性研究提供了新思路。 #AI #大模型 #视觉语言模型 #幻觉 #FADE #多模态 #arXiv #论文
LLM引导规划实现多模态核监管文档多跳推理
来自arXiv的一篇研究论文提出了一种基于大语言模型(LLM)引导的规划方法,用于解决多模态核监管文档中的多跳推理问题。核监管文档通常包含文本、图表、表格等多种模态数据,且需要跨文档进行多步骤逻辑推理。传统方法在处理这类复杂任务时面临知识碎片化和推理链断裂等挑战。该研究利用大语言模型的规划能力,自动生成推理路径并整合多模态信息,从而提升对核安全文档中深层语义的理解与溯源能力。实验结果表明,该方法在多个基准测试上显著优于现有基线,为核能领域的安全合规审查与信息检索提供了新的技术路径。 #LLM #多跳推理 #多模态 #核监管 #文档理解 #人工智能 #arXiv #规划方法
来自arXiv的一篇研究论文提出了一种基于大语言模型(LLM)引导的规划方法,用于解决多模态核监管文档中的多跳推理问题。核监管文档通常包含文本、图表、表格等多种模态数据,且需要跨文档进行多步骤逻辑推理。传统方法在处理这类复杂任务时面临知识碎片化和推理链断裂等挑战。该研究利用大语言模型的规划能力,自动生成推理路径并整合多模态信息,从而提升对核安全文档中深层语义的理解与溯源能力。实验结果表明,该方法在多个基准测试上显著优于现有基线,为核能领域的安全合规审查与信息检索提供了新的技术路径。 #LLM #多跳推理 #多模态 #核监管 #文档理解 #人工智能 #arXiv #规划方法
预算约束下的RAG事实错误诊断与修复研究
一篇名为《Diagnosing and Repairing Factual Errors in RAG under Budget Constraints》的学术论文在arXiv上发布。该研究聚焦于检索增强生成(RAG)系统中常见的事实错误问题,并首次提出在预算限制条件下进行错误诊断与修复的解决方案。作者指出,现有方法往往忽视修复成本,而实际应用中计算资源或调用次数有限。论文设计了一套权衡准确性与资源消耗的算法,能够在给定预算内优先定位关键错误并生成修正建议。这项工作对于提升RAG系统在实际部署中的可靠性具有重要价值,尤其适用于实时问答、知识库查询等对成本敏感的场景。研究团队通过实验验证了方法在多个基准测试上的有效性,表明在有限预算下仍能显著降低事实错误率。 #RAG #事实错误 #预算约束 #自然语言处理 #AI #机器学习 #论文 #arXiv #知识库
一篇名为《Diagnosing and Repairing Factual Errors in RAG under Budget Constraints》的学术论文在arXiv上发布。该研究聚焦于检索增强生成(RAG)系统中常见的事实错误问题,并首次提出在预算限制条件下进行错误诊断与修复的解决方案。作者指出,现有方法往往忽视修复成本,而实际应用中计算资源或调用次数有限。论文设计了一套权衡准确性与资源消耗的算法,能够在给定预算内优先定位关键错误并生成修正建议。这项工作对于提升RAG系统在实际部署中的可靠性具有重要价值,尤其适用于实时问答、知识库查询等对成本敏感的场景。研究团队通过实验验证了方法在多个基准测试上的有效性,表明在有限预算下仍能显著降低事实错误率。 #RAG #事实错误 #预算约束 #自然语言处理 #AI #机器学习 #论文 #arXiv #知识库
PHF: Privileged Hidden Flow for On-Policy Self
近日,Yuhan Li等三位作者在arXiv预印本平台提交了一篇题为“PHF: Privileged Hidden Flow for On-Policy Self-Distillation”的研究论文。该论文提出了一种名为PHF的新型在线自蒸馏方法,核心思想是在训练过程中利用教师网络中的特权隐藏信息流,来指导学生网络的学习,从而提升蒸馏效率和模型性能。与传统离线蒸馏不同,PHF无需预先训练固定的教师模型,而是在策略上动态生成并传递隐藏特征。论文详细阐述了PHF的理论框架和实现细节,并可能通过实验验证了其在图像分类、目标检测等任务上的有效性。目前该论文已公开上线,可通过arXiv获取PDF全文及相关代码资源。 #arXiv #自蒸馏 #论文 #机器学习 #计算机视觉 #YuhanLi #PHF #深度学习
近日,Yuhan Li等三位作者在arXiv预印本平台提交了一篇题为“PHF: Privileged Hidden Flow for On-Policy Self-Distillation”的研究论文。该论文提出了一种名为PHF的新型在线自蒸馏方法,核心思想是在训练过程中利用教师网络中的特权隐藏信息流,来指导学生网络的学习,从而提升蒸馏效率和模型性能。与传统离线蒸馏不同,PHF无需预先训练固定的教师模型,而是在策略上动态生成并传递隐藏特征。论文详细阐述了PHF的理论框架和实现细节,并可能通过实验验证了其在图像分类、目标检测等任务上的有效性。目前该论文已公开上线,可通过arXiv获取PDF全文及相关代码资源。 #arXiv #自蒸馏 #论文 #机器学习 #计算机视觉 #YuhanLi #PHF #深度学习
Hierarchical Experimentalist Agents
近日,一篇题为《Hierarchical Experimentalist Agents》的论文在arXiv预印本平台发布。该研究由Abhranil Chandra等四位作者共同完成,论文提出了一种基于分层架构的智能实验代理系统,旨在通过层次化任务分解与策略协调,提升自主实验设计与执行的效率。研究聚焦于如何让智能体在科学实验场景中更灵活地规划、实施和优化实验流程,从而推动自动化科学发现的发展。论文目前已提供PDF及HTML全文,并可供社区评议与引用。 #arXiv #论文 #AI #分层架构 #实验代理 #智能体 #自动化科学 #机器学习
近日,一篇题为《Hierarchical Experimentalist Agents》的论文在arXiv预印本平台发布。该研究由Abhranil Chandra等四位作者共同完成,论文提出了一种基于分层架构的智能实验代理系统,旨在通过层次化任务分解与策略协调,提升自主实验设计与执行的效率。研究聚焦于如何让智能体在科学实验场景中更灵活地规划、实施和优化实验流程,从而推动自动化科学发现的发展。论文目前已提供PDF及HTML全文,并可供社区评议与引用。 #arXiv #论文 #AI #分层架构 #实验代理 #智能体 #自动化科学 #机器学习
过程优势信号塑造:一种范式无关的中间件,用于大语言模型推理器的过程监督强化学习
一篇来自arXiv的论文提出了一种名为“过程优势信号塑造”(Process Advantage Signal Shaping)的中间件技术,旨在为大语言模型(LLM)推理器中的过程监督强化学习提供范式无关的解决方案。该研究由Chao Wang等五位作者共同完成,论文详细介绍了如何通过塑造过程优势信号,在不依赖特定推理范式的前提下,有效提升模型在复杂推理任务中的表现。该方法有望解决现有过程监督方法对特定模型架构的依赖问题,为LLM推理能力的泛化与增强开辟新路径。论文已提交至arXiv平台,并提供了PDF全文及HTML预览。 #大语言模型 #强化学习 #过程监督 #中间件 #AI推理 #arXiv #论文
一篇来自arXiv的论文提出了一种名为“过程优势信号塑造”(Process Advantage Signal Shaping)的中间件技术,旨在为大语言模型(LLM)推理器中的过程监督强化学习提供范式无关的解决方案。该研究由Chao Wang等五位作者共同完成,论文详细介绍了如何通过塑造过程优势信号,在不依赖特定推理范式的前提下,有效提升模型在复杂推理任务中的表现。该方法有望解决现有过程监督方法对特定模型架构的依赖问题,为LLM推理能力的泛化与增强开辟新路径。论文已提交至arXiv平台,并提供了PDF全文及HTML预览。 #大语言模型 #强化学习 #过程监督 #中间件 #AI推理 #arXiv #论文
SurgVLA-Bench:面向腹腔镜手术机器人的视觉-语言
近日,一篇题为《SurgVLA-Bench: Towards Evaluating Vision-Language-Action Models for Laparoscopic Surgical Robotics》的论文在arXiv预印本平台发布。该研究由Jiashuo Sun等七位作者共同完成,旨在构建一个专门用于评估视觉-语言-动作模型在腹腔镜手术机器人中性能的基准测试平台。随着AI在医疗领域的深入应用,VLA模型有望提升手术机器人的自主决策与操作能力,但缺乏统一评估标准。SurgVLA-Bench填补了这一空白,为后续研究提供了标准化测试框架,有望推动智能手术机器人技术的发展。 #AI #医疗机器人 #腹腔镜手术 #视觉语言动作模型 #基准测试 #arXiv #论文
近日,一篇题为《SurgVLA-Bench: Towards Evaluating Vision-Language-Action Models for Laparoscopic Surgical Robotics》的论文在arXiv预印本平台发布。该研究由Jiashuo Sun等七位作者共同完成,旨在构建一个专门用于评估视觉-语言-动作模型在腹腔镜手术机器人中性能的基准测试平台。随着AI在医疗领域的深入应用,VLA模型有望提升手术机器人的自主决策与操作能力,但缺乏统一评估标准。SurgVLA-Bench填补了这一空白,为后续研究提供了标准化测试框架,有望推动智能手术机器人技术的发展。 #AI #医疗机器人 #腹腔镜手术 #视觉语言动作模型 #基准测试 #arXiv #论文
PolicyGuard:基于对话的子代理验证器,确保LLM代理遵守策略
arXiv上发布了一篇题为《PolicyGuard: A Dialogue-Grounded Sub-Agent Verifier for Policy Adherence in LLM Agents》的论文。该研究提出了一种名为PolicyGuard的新型验证框架,旨在解决大型语言模型(LLM)代理在执行任务时可能偏离预设策略的问题。PolicyGuard通过引入一个基于对话的子代理验证器,在代理与用户交互过程中实时监控其行为,确保其输出符合既定政策。该方法利用对话上下文进行细粒度验证,能够在不显著增加计算开销的前提下,有效检测并纠正策略违规行为。实验表明,PolicyGuard在多个基准测试中显著提升了代理的策略遵守率,为LLM代理的安全部署提供了重要保障。 #AI安全 #LLM代理 #策略验证 #对话系统 #arXiv论文 #人工智能 #机器学习
arXiv上发布了一篇题为《PolicyGuard: A Dialogue-Grounded Sub-Agent Verifier for Policy Adherence in LLM Agents》的论文。该研究提出了一种名为PolicyGuard的新型验证框架,旨在解决大型语言模型(LLM)代理在执行任务时可能偏离预设策略的问题。PolicyGuard通过引入一个基于对话的子代理验证器,在代理与用户交互过程中实时监控其行为,确保其输出符合既定政策。该方法利用对话上下文进行细粒度验证,能够在不显著增加计算开销的前提下,有效检测并纠正策略违规行为。实验表明,PolicyGuard在多个基准测试中显著提升了代理的策略遵守率,为LLM代理的安全部署提供了重要保障。 #AI安全 #LLM代理 #策略验证 #对话系统 #arXiv论文 #人工智能 #机器学习
Evidence-Informed LLM Beliefs for Continual Scientific Discovery
一篇题为"Evidence-Informed LLM Beliefs for Continual Scientific Discovery"的论文在arXiv上发布,作者包括Dhruv Agarwal等六人。该研究聚焦于如何让大语言模型在持续的科学发现过程中,基于新证据动态更新其内部信念,从而提升模型在复杂科学推理任务中的准确性与适应性。论文提出了一个框架,使LLM能够像科学家一样不断吸收新数据,修正已有认知,以支持长期、开放的科学研究。该方法有望加速跨学科知识发现,并推动AI在科研自动化领域的应用。论文目前以预印本形式公开,提供PDF和HTML版本,并附有引用工具和相关资源链接。 #AI #大模型 #科学发现 #arXiv #论文 #持续学习 #LLM #证据推理
一篇题为"Evidence-Informed LLM Beliefs for Continual Scientific Discovery"的论文在arXiv上发布,作者包括Dhruv Agarwal等六人。该研究聚焦于如何让大语言模型在持续的科学发现过程中,基于新证据动态更新其内部信念,从而提升模型在复杂科学推理任务中的准确性与适应性。论文提出了一个框架,使LLM能够像科学家一样不断吸收新数据,修正已有认知,以支持长期、开放的科学研究。该方法有望加速跨学科知识发现,并推动AI在科研自动化领域的应用。论文目前以预印本形式公开,提供PDF和HTML版本,并附有引用工具和相关资源链接。 #AI #大模型 #科学发现 #arXiv #论文 #持续学习 #LLM #证据推理