GTBench:基于课程的大语言模型图论数学研究助手评估基准
研究人员提出了一种名为GTBench的基准测试,该基准基于课程设计理念,专门用于评估大语言模型作为图论数学研究助手的能力。通过设置从基础到复杂的分层问题集,GTBench系统性地测试了LLM在图论领域的推理、证明和问题解决能力。研究团队利用该基准对多个主流大模型进行了评估,结果显示模型在基础概念理解上表现良好,但在复杂定理证明和创造性问题解决方面仍存在显著不足。这项工作为衡量和提升LLM在专业数学研究领域的应用提供了一个标准化的评估框架,有望推动AI辅助数学研究的发展。 #大语言模型 #图论 #数学研究 #基准测试 #AI #科研 #LLM #人工智能
研究人员提出了一种名为GTBench的基准测试,该基准基于课程设计理念,专门用于评估大语言模型作为图论数学研究助手的能力。通过设置从基础到复杂的分层问题集,GTBench系统性地测试了LLM在图论领域的推理、证明和问题解决能力。研究团队利用该基准对多个主流大模型进行了评估,结果显示模型在基础概念理解上表现良好,但在复杂定理证明和创造性问题解决方面仍存在显著不足。这项工作为衡量和提升LLM在专业数学研究领域的应用提供了一个标准化的评估框架,有望推动AI辅助数学研究的发展。 #大语言模型 #图论 #数学研究 #基准测试 #AI #科研 #LLM #人工智能
新研究提出“先思后语”多智能体社会模拟框架
近日,一篇提交至arXiv的论文《Think-Before-Speak: From Internal Evaluation to Public Expression in Multi-Agent Social Simulation》提出了一种新型多智能体社会模拟框架。该研究由Kaiqi Yang等人完成,核心思想是让智能体在公开发表言论前先进行内部评估,从而更真实地模拟人类社会的沟通与协作过程。传统多智能体系统往往让每个智能体直接输出回复,忽略了“思考后再表达”的认知环节。新方法引入内部评价机制,智能体在形成初步判断后,会进行自我审视和逻辑校验,再决定是否以及如何表达观点。实验表明,这一机制能显著提升模拟对话的合理性与推理深度,减少错误信息的传播,并增强群体决策的稳定性。该研究为人机协作、社交机器人及复杂系统仿真提供了新的设计思路,未来可望应用于在线讨论、民主协商模拟等领域。 #多智能体 #社会模拟 #先思后语 #AI推理 #arXiv #研究论文 #认知科学 #人机协作
近日,一篇提交至arXiv的论文《Think-Before-Speak: From Internal Evaluation to Public Expression in Multi-Agent Social Simulation》提出了一种新型多智能体社会模拟框架。该研究由Kaiqi Yang等人完成,核心思想是让智能体在公开发表言论前先进行内部评估,从而更真实地模拟人类社会的沟通与协作过程。传统多智能体系统往往让每个智能体直接输出回复,忽略了“思考后再表达”的认知环节。新方法引入内部评价机制,智能体在形成初步判断后,会进行自我审视和逻辑校验,再决定是否以及如何表达观点。实验表明,这一机制能显著提升模拟对话的合理性与推理深度,减少错误信息的传播,并增强群体决策的稳定性。该研究为人机协作、社交机器人及复杂系统仿真提供了新的设计思路,未来可望应用于在线讨论、民主协商模拟等领域。 #多智能体 #社会模拟 #先思后语 #AI推理 #arXiv #研究论文 #认知科学 #人机协作
EvoTrainer:协同进化LLM策略与训练框架,实现自主智能体强化学习
近日,一篇题为《EvoTrainer: Co-Evolving LLM Policies and Training Harnesses for Autonomous Agentic Reinforcement Learning》的论文引起关注。该研究提出了EvoTrainer框架,通过让大语言模型(LLM)的策略与训练框架协同进化,解决了传统强化学习中人工设计奖励函数和训练流程的瓶颈。EvoTrainer允许智能体在动态环境中自主调整学习策略,同时训练框架本身也能根据智能体表现进行优化,形成闭环进化。这一方法有望推动自主智能体在复杂任务中的泛化能力,减少人工干预,为下一代通用人工智能的发展提供新思路。论文已提交至arXiv平台,相关代码和数据可供研究者复现。 #EvoTrainer #强化学习 #LLM #自主智能体 #协同进化 #人工智能 #arXiv #AI前沿
近日,一篇题为《EvoTrainer: Co-Evolving LLM Policies and Training Harnesses for Autonomous Agentic Reinforcement Learning》的论文引起关注。该研究提出了EvoTrainer框架,通过让大语言模型(LLM)的策略与训练框架协同进化,解决了传统强化学习中人工设计奖励函数和训练流程的瓶颈。EvoTrainer允许智能体在动态环境中自主调整学习策略,同时训练框架本身也能根据智能体表现进行优化,形成闭环进化。这一方法有望推动自主智能体在复杂任务中的泛化能力,减少人工干预,为下一代通用人工智能的发展提供新思路。论文已提交至arXiv平台,相关代码和数据可供研究者复现。 #EvoTrainer #强化学习 #LLM #自主智能体 #协同进化 #人工智能 #arXiv #AI前沿
上海人工智能实验室领军科学家胡侠确认出席AICon上海站,分享智能体安全实践
AICon 2026上海站将于6月26日至27日举行,聚焦“构建可信赖、可规模化、可商业化的Agentic操作系统”。大会集结清华、复旦等高校教授及阿里、腾讯、华为等数十家头部公司技术专家,设置13大专题、近60场议题,深度探讨Agent工程化落地。上海人工智能实验室领军科学家胡侠确认出席“Agent安全、评测与可信治理”专题,分享《面向智能体的“安全即服务”模式探索:书安智能体操作系统的实践与思考》。他将介绍如何将安全能力内嵌于智能体运行全流程,构建系统隔离、流程治理、行为约束与持续演化的安全机制,支撑智能体在复杂业务中的稳定运行。胡侠曾任美国莱斯大学教授,发表论文200余篇,被引超4万次,主导开发AutoKeras等知名系统。 #AICon #上海人工智能实验室 #胡侠 #智能体 #Agent #安全即服务 #书安智能体操作系统 #AI工程化
AICon 2026上海站将于6月26日至27日举行,聚焦“构建可信赖、可规模化、可商业化的Agentic操作系统”。大会集结清华、复旦等高校教授及阿里、腾讯、华为等数十家头部公司技术专家,设置13大专题、近60场议题,深度探讨Agent工程化落地。上海人工智能实验室领军科学家胡侠确认出席“Agent安全、评测与可信治理”专题,分享《面向智能体的“安全即服务”模式探索:书安智能体操作系统的实践与思考》。他将介绍如何将安全能力内嵌于智能体运行全流程,构建系统隔离、流程治理、行为约束与持续演化的安全机制,支撑智能体在复杂业务中的稳定运行。胡侠曾任美国莱斯大学教授,发表论文200余篇,被引超4万次,主导开发AutoKeras等知名系统。 #AICon #上海人工智能实验室 #胡侠 #智能体 #Agent #安全即服务 #书安智能体操作系统 #AI工程化
DeskCraft 发布:桌面代理在专业工作流与人机协同中的基准测试
近日,一篇题为《DeskCraft: Benchmarking Desktop Agents on Professional Workflows and Human-in-the-Loop Collaboration》的学术论文在arXiv预印本平台公开。该研究由Wenkai Wang等8位作者共同完成,主要针对桌面代理在专业工作流场景下的性能以及人机协作效果提出了新的基准测试框架。DeskCraft旨在评估AI代理在执行复杂桌面任务时的准确率、效率和协作能力,涵盖文档处理、数据分析等典型企业级应用。研究团队设计了多种交互模式和评价指标,为未来桌面自动化与人工智能辅助办公的发展提供了参考标准。这一成果有望推动桌面代理在实际工作环境中的落地应用。 #桌面代理 #人机协作 #基准测试 #AI #专业工作流 #arXiv #研究论文
近日,一篇题为《DeskCraft: Benchmarking Desktop Agents on Professional Workflows and Human-in-the-Loop Collaboration》的学术论文在arXiv预印本平台公开。该研究由Wenkai Wang等8位作者共同完成,主要针对桌面代理在专业工作流场景下的性能以及人机协作效果提出了新的基准测试框架。DeskCraft旨在评估AI代理在执行复杂桌面任务时的准确率、效率和协作能力,涵盖文档处理、数据分析等典型企业级应用。研究团队设计了多种交互模式和评价指标,为未来桌面自动化与人工智能辅助办公的发展提供了参考标准。这一成果有望推动桌面代理在实际工作环境中的落地应用。 #桌面代理 #人机协作 #基准测试 #AI #专业工作流 #arXiv #研究论文
从长新闻到精准预测:重要性感知融合与PRM引导反射的时间序列预测方法
一篇题为《From Long News to Accurate Forecast: Importance-Aware Fusion and PRM-Guided Reflection for Time Series Forecasting》的学术论文引发关注。该研究由Mingyang Liu等九位作者共同完成,提出了一种结合重要性感知融合与过程奖励模型(PRM)引导反射的新框架,旨在从长篇新闻文本中提取关键信息,提升时间序列预测的准确性。论文通过多源数据融合与迭代推理优化,显著增强了模型对复杂动态事件的理解能力,为金融、气象等领域的精准预测提供了新思路。目前该论文已提交至arXiv平台,正在等待数据引用注册。 #时间序列预测 #新闻融合 #PRM #重要性感知 #深度学习 #AI #学术论文 #arXiv
一篇题为《From Long News to Accurate Forecast: Importance-Aware Fusion and PRM-Guided Reflection for Time Series Forecasting》的学术论文引发关注。该研究由Mingyang Liu等九位作者共同完成,提出了一种结合重要性感知融合与过程奖励模型(PRM)引导反射的新框架,旨在从长篇新闻文本中提取关键信息,提升时间序列预测的准确性。论文通过多源数据融合与迭代推理优化,显著增强了模型对复杂动态事件的理解能力,为金融、气象等领域的精准预测提供了新思路。目前该论文已提交至arXiv平台,正在等待数据引用注册。 #时间序列预测 #新闻融合 #PRM #重要性感知 #深度学习 #AI #学术论文 #arXiv
DELTAMEM:基于残差树的LLM代理增量经验记忆方法
近日,arXiv上预印本论文《DELTAMEM: Incremental Experience Memory for LLM Agents via Residual Trees》由Haoran Tan等四位作者提交。该研究针对大语言模型(LLM)代理在持续交互中需要存储和利用历史经验的问题,提出了一种名为DELTAMEM的增量经验记忆方法。该方法创新性地利用残差树(Residual Trees)结构,在维护代理记忆时仅记录与先前状态的关键差异,从而减少存储冗余并提高检索效率。实验表明,DELTAMEM在多个长期任务基准上显著优于现有记忆机制,使LLM代理能够更高效地积累和复用经验。这一工作为构建具备长期记忆能力的智能代理提供了新思路,有望推动对话系统、个人助手等场景的持续学习与自适应能力提升。 #LLM #代理 #增量记忆 #残差树 #人工智能 #论文 #arXiv
近日,arXiv上预印本论文《DELTAMEM: Incremental Experience Memory for LLM Agents via Residual Trees》由Haoran Tan等四位作者提交。该研究针对大语言模型(LLM)代理在持续交互中需要存储和利用历史经验的问题,提出了一种名为DELTAMEM的增量经验记忆方法。该方法创新性地利用残差树(Residual Trees)结构,在维护代理记忆时仅记录与先前状态的关键差异,从而减少存储冗余并提高检索效率。实验表明,DELTAMEM在多个长期任务基准上显著优于现有记忆机制,使LLM代理能够更高效地积累和复用经验。这一工作为构建具备长期记忆能力的智能代理提供了新思路,有望推动对话系统、个人助手等场景的持续学习与自适应能力提升。 #LLM #代理 #增量记忆 #残差树 #人工智能 #论文 #arXiv
CORE
近日,由 Jinjie Shen 等七位研究人员共同撰写的论文《CORE: Conflict-Oriented Reasoning for General Multimodal Manipulation Detection》提交至 arXiv 预印本平台。该论文提出了一种名为 CORE 的通用多模态篡改检测方法,核心思路是通过冲突导向推理来识别图像、文本等多模态内容中的篡改痕迹。研究团队旨在解决现有检测方法在跨模态场景下泛化能力不足的问题,为数字内容安全领域提供新的技术路径。目前论文全文已以 PDF 和 HTML 形式公开,并附有 TeX 源码,供学术界进一步研究参考。 #论文 #多模态 #篡改检测 #AI安全 #arXiv #CORE #冲突推理
近日,由 Jinjie Shen 等七位研究人员共同撰写的论文《CORE: Conflict-Oriented Reasoning for General Multimodal Manipulation Detection》提交至 arXiv 预印本平台。该论文提出了一种名为 CORE 的通用多模态篡改检测方法,核心思路是通过冲突导向推理来识别图像、文本等多模态内容中的篡改痕迹。研究团队旨在解决现有检测方法在跨模态场景下泛化能力不足的问题,为数字内容安全领域提供新的技术路径。目前论文全文已以 PDF 和 HTML 形式公开,并附有 TeX 源码,供学术界进一步研究参考。 #论文 #多模态 #篡改检测 #AI安全 #arXiv #CORE #冲突推理
SkillDAG: 自演进类型化技能图,实现LLM大规模技能选择
来自arXiv的最新论文提出SkillDAG,一种自演进的类型化技能图框架,用于大规模语言模型(LLM)的技能选择。该框架通过构建结构化的技能图谱,使LLM能够动态识别、组织和调用不同维度的技能,从而在复杂任务中实现更高效、更精准的推理。与传统静态技能库不同,SkillDAG支持技能图的自主演化,随着模型应用场景的扩展持续优化。实验表明,该方法显著提升了LLM在多任务场景下的技能调用准确率和响应效率,为构建通用型AI系统提供了新的技术路径。论文详述了图的构建、维护及选择机制,并展示了在多个基准测试中的优越性能。 #AI #LLM #技能图谱 #自演进 #机器学习 #arXiv #论文 #自然语言处理
来自arXiv的最新论文提出SkillDAG,一种自演进的类型化技能图框架,用于大规模语言模型(LLM)的技能选择。该框架通过构建结构化的技能图谱,使LLM能够动态识别、组织和调用不同维度的技能,从而在复杂任务中实现更高效、更精准的推理。与传统静态技能库不同,SkillDAG支持技能图的自主演化,随着模型应用场景的扩展持续优化。实验表明,该方法显著提升了LLM在多任务场景下的技能调用准确率和响应效率,为构建通用型AI系统提供了新的技术路径。论文详述了图的构建、维护及选择机制,并展示了在多个基准测试中的优越性能。 #AI #LLM #技能图谱 #自演进 #机器学习 #arXiv #论文 #自然语言处理
ToolGate:面向工具增强视觉语言代理的令牌高效预调用控制方法
据arXiv最新论文,由Anjie Liu等五位研究者共同署名的论文《ToolGate: Token-Efficient Pre-Call Control for Tool-Augmented Vision-Language Agents》正式提交。该论文提出了ToolGate方法,旨在解决工具增强型视觉语言代理在调用外部工具时令牌消耗过高的问题。ToolGate通过引入预调用控制机制,在代理决定是否调用工具之前进行高效评估,从而减少不必要的令牌消耗,提升整体效率。该研究为提升视觉语言代理在复杂任务中的实用性和经济性提供了新思路。论文目前已在arXiv上公开,并附有PDF和HTML版本供读者查阅。 #ToolGate #工具增强 #视觉语言代理 #令牌效率 #预调用控制 #arXiv #AI #机器学习
据arXiv最新论文,由Anjie Liu等五位研究者共同署名的论文《ToolGate: Token-Efficient Pre-Call Control for Tool-Augmented Vision-Language Agents》正式提交。该论文提出了ToolGate方法,旨在解决工具增强型视觉语言代理在调用外部工具时令牌消耗过高的问题。ToolGate通过引入预调用控制机制,在代理决定是否调用工具之前进行高效评估,从而减少不必要的令牌消耗,提升整体效率。该研究为提升视觉语言代理在复杂任务中的实用性和经济性提供了新思路。论文目前已在arXiv上公开,并附有PDF和HTML版本供读者查阅。 #ToolGate #工具增强 #视觉语言代理 #令牌效率 #预调用控制 #arXiv #AI #机器学习
TriEval:用于LLM偏见、毒性与真实性评估的资源高效流水线
据arXiv预印本论文显示,研究人员提出了一种名为TriEval的资源高效评估流水线,专门用于检测大语言模型(LLM)在偏见、毒性和真实性方面的表现。该流水线通过优化计算资源消耗,解决了现有评估框架成本高、部署复杂的问题,能够快速、全面地测评模型质量。TriEval整合了多种评估指标,在保持高准确率的同时显著降低开销,适用于不同规模的LLM。该工具旨在帮助开发者在模型发布前识别潜在风险,从而提升AI系统的安全性和可信度。研究由Akshatha Srikantha等人完成,论文于2026年6月提交至arXiv。 #TriEval #LLM #偏见评估 #毒性检测 #真实性 #AI安全 #资源高效 #arXiv
据arXiv预印本论文显示,研究人员提出了一种名为TriEval的资源高效评估流水线,专门用于检测大语言模型(LLM)在偏见、毒性和真实性方面的表现。该流水线通过优化计算资源消耗,解决了现有评估框架成本高、部署复杂的问题,能够快速、全面地测评模型质量。TriEval整合了多种评估指标,在保持高准确率的同时显著降低开销,适用于不同规模的LLM。该工具旨在帮助开发者在模型发布前识别潜在风险,从而提升AI系统的安全性和可信度。研究由Akshatha Srikantha等人完成,论文于2026年6月提交至arXiv。 #TriEval #LLM #偏见评估 #毒性检测 #真实性 #AI安全 #资源高效 #arXiv
AUDITFLOW
近日,一项名为AUDITFLOW的研究成果在arXiv上发布,提出了一种用于结构化财务报告验证的可执行符号环境。该研究由Yan Wang等10位学者共同完成,旨在通过符号推理与自动化验证技术,提升财务报告的准确性和可靠性。AUDITFLOW通过构建可执行符号模型,能够对复杂的财务数据进行结构化分析与一致性检查,有效识别报告中的潜在错误与不一致之处。这一方法有望在金融审计、合规监管等领域发挥重要作用,降低人工核查成本,提高审计效率。研究团队表示,该环境支持多种财务报告标准,并能与现有审计工具集成,未来可能推动财务报告自动化验证的标准化进程。 #AUDITFLOW #财务报告验证 #符号环境 #自动化审计 #AI审计 #金融科技 #学术论文
近日,一项名为AUDITFLOW的研究成果在arXiv上发布,提出了一种用于结构化财务报告验证的可执行符号环境。该研究由Yan Wang等10位学者共同完成,旨在通过符号推理与自动化验证技术,提升财务报告的准确性和可靠性。AUDITFLOW通过构建可执行符号模型,能够对复杂的财务数据进行结构化分析与一致性检查,有效识别报告中的潜在错误与不一致之处。这一方法有望在金融审计、合规监管等领域发挥重要作用,降低人工核查成本,提高审计效率。研究团队表示,该环境支持多种财务报告标准,并能与现有审计工具集成,未来可能推动财务报告自动化验证的标准化进程。 #AUDITFLOW #财务报告验证 #符号环境 #自动化审计 #AI审计 #金融科技 #学术论文
从智能体轨迹中归纳推理原语
一篇题为《Inducing Reasoning Primitives from Agent Traces》的学术论文在arXiv平台发布。该论文由Zhihan Lei等四位作者共同完成,提出了一种从智能体执行轨迹中自动提取通用推理原语的方法。研究团队通过分析智能体在复杂任务中的行为序列,识别出可复用的逻辑步骤与决策模式,从而构建更高效、更具泛化性的推理模块。这项工作有望降低大语言模型在工具使用、多步推理等场景下的开发成本,并为可解释人工智能提供新的分析工具。目前论文已提供PDF、HTML及TeX源码等访问方式,相关代码与数据资源正在陆续开放。 #arXiv #智能体 #推理原语 #AI #机器学习 #论文 #大语言模型 #可解释性 #自动化推理
一篇题为《Inducing Reasoning Primitives from Agent Traces》的学术论文在arXiv平台发布。该论文由Zhihan Lei等四位作者共同完成,提出了一种从智能体执行轨迹中自动提取通用推理原语的方法。研究团队通过分析智能体在复杂任务中的行为序列,识别出可复用的逻辑步骤与决策模式,从而构建更高效、更具泛化性的推理模块。这项工作有望降低大语言模型在工具使用、多步推理等场景下的开发成本,并为可解释人工智能提供新的分析工具。目前论文已提供PDF、HTML及TeX源码等访问方式,相关代码与数据资源正在陆续开放。 #arXiv #智能体 #推理原语 #AI #机器学习 #论文 #大语言模型 #可解释性 #自动化推理
WISE-HAR:基于WiFi的人体活动识别通用集成深度学习框架
研究人员提出了一种名为WISE-HAR的通用集成深度学习框架,用于基于WiFi信号的人体活动识别。该框架通过整合多种深度学习模型,有效提升了在不同环境下对日常活动(如行走、坐下、跌倒等)的识别准确率和泛化能力。WiFi感知技术利用无线信号受人体运动影响而产生的变化来推断活动类型,无需穿戴设备,隐私性强。WISE-HAR的设计解决了传统单一模型在跨场景、跨用户时性能下降的问题,为智能家居、健康监测和安防等领域提供了更可靠、可扩展的解决方案。该研究由多位学者共同完成,论文已在arXiv预印本平台发布。 #WiFi感知 #人体活动识别 #深度学习 #集成学习 #智能家居 #健康监测 #arXiv #AI
研究人员提出了一种名为WISE-HAR的通用集成深度学习框架,用于基于WiFi信号的人体活动识别。该框架通过整合多种深度学习模型,有效提升了在不同环境下对日常活动(如行走、坐下、跌倒等)的识别准确率和泛化能力。WiFi感知技术利用无线信号受人体运动影响而产生的变化来推断活动类型,无需穿戴设备,隐私性强。WISE-HAR的设计解决了传统单一模型在跨场景、跨用户时性能下降的问题,为智能家居、健康监测和安防等领域提供了更可靠、可扩展的解决方案。该研究由多位学者共同完成,论文已在arXiv预印本平台发布。 #WiFi感知 #人体活动识别 #深度学习 #集成学习 #智能家居 #健康监测 #arXiv #AI