MedRealMM
来自上海交通大学等机构的研究团队正式发布了MedRealMM,这是首个面向中文在线医疗咨询的真实世界多模态基准数据集。该数据集旨在填补现有医疗AI评估过于依赖理想化合成数据的缺陷,聚焦真实医患对话中的图像与文本交互场景。研究团队收集并标注了大量包含医学影像、病历截图与文字描述的咨询案例,覆盖多科室常见疾病。实验表明,当前主流的多模态大模型在该基准上的表现仍有显著提升空间,尤其是在复杂体征识别和跨模态信息融合方面。MedRealMM的推出将为评估和优化中文医疗AI系统提供更贴近临床实际的标准化测试平台。 #医疗AI #多模态 #中文在线医疗 #基准测试 #大模型 #人工智能 #医学影像 #自然语言处理
来自上海交通大学等机构的研究团队正式发布了MedRealMM,这是首个面向中文在线医疗咨询的真实世界多模态基准数据集。该数据集旨在填补现有医疗AI评估过于依赖理想化合成数据的缺陷,聚焦真实医患对话中的图像与文本交互场景。研究团队收集并标注了大量包含医学影像、病历截图与文字描述的咨询案例,覆盖多科室常见疾病。实验表明,当前主流的多模态大模型在该基准上的表现仍有显著提升空间,尤其是在复杂体征识别和跨模态信息融合方面。MedRealMM的推出将为评估和优化中文医疗AI系统提供更贴近临床实际的标准化测试平台。 #医疗AI #多模态 #中文在线医疗 #基准测试 #大模型 #人工智能 #医学影像 #自然语言处理
面向分布偏移的可靠长时程智能体上下文演化之范围验证
arXiv 于 2026 年 7 月 10 日发布了一篇题为《面向分布偏移的可靠长时程智能体上下文演化之范围验证》的论文。该研究由 Dan C. Hsu 等人完成,主要探讨在数据分布发生偏移的情况下,如何通过范围验证机制确保智能体在长期任务中实现可靠的上下文演化。论文提出了一种针对长时程智能体系统的验证方法,旨在提升其在现实环境中的稳定性和准确性。目前该论文已通过 arXiv 平台发布,提供 PDF 及 HTML 格式访问,并支持 BibTeX 引用及相关工具集成。 #arXiv #智能体 #分布偏移 #上下文演化 #验证 #长时程 #AI #机器学习
arXiv 于 2026 年 7 月 10 日发布了一篇题为《面向分布偏移的可靠长时程智能体上下文演化之范围验证》的论文。该研究由 Dan C. Hsu 等人完成,主要探讨在数据分布发生偏移的情况下,如何通过范围验证机制确保智能体在长期任务中实现可靠的上下文演化。论文提出了一种针对长时程智能体系统的验证方法,旨在提升其在现实环境中的稳定性和准确性。目前该论文已通过 arXiv 平台发布,提供 PDF 及 HTML 格式访问,并支持 BibTeX 引用及相关工具集成。 #arXiv #智能体 #分布偏移 #上下文演化 #验证 #长时程 #AI #机器学习
OpenProver: 基于Agent的Lean 4交互式定理证明系统
arXiv上发布了一篇名为《OpenProver: Agentic and Interactive Theorem Proving with Lean 4》的论文。该论文介绍了一个名为OpenProver的交互式定理证明系统,它基于Agent架构,并利用Lean 4证明助手实现。系统旨在通过智能体与用户的协作,提升形式化定理证明的效率和自动化水平。论文详细阐述了OpenProver的设计原理、实现方法以及在实际数学问题上的应用效果,为形式化验证和人工智能研究提供了新工具。 #定理证明 #Lean4 #人工智能 #形式化方法 #数学推理 #arXiv
arXiv上发布了一篇名为《OpenProver: Agentic and Interactive Theorem Proving with Lean 4》的论文。该论文介绍了一个名为OpenProver的交互式定理证明系统,它基于Agent架构,并利用Lean 4证明助手实现。系统旨在通过智能体与用户的协作,提升形式化定理证明的效率和自动化水平。论文详细阐述了OpenProver的设计原理、实现方法以及在实际数学问题上的应用效果,为形式化验证和人工智能研究提供了新工具。 #定理证明 #Lean4 #人工智能 #形式化方法 #数学推理 #arXiv
LongMedBench:面向长周期临床决策的医学智能体基准测试
该研究提出了LongMedBench,一个专为评估长周期临床决策能力而设计的医学智能体基准测试。研究团队指出,现有医学评估多聚焦于单一诊断或简单问答,难以衡量智能体在复杂、多步临床路径中的表现。LongMedBench模拟真实临床场景,涵盖病史采集、检查检验、诊断、治疗方案制定及疗效随访等完整环节,要求智能体进行长达数十步的推理与决策。初步实验表明,当前主流大语言模型在该基准上表现不佳,尤其在信息整合、动态调整和长期规划方面存在显著短板。该基准为评估和改进医学AI的临床实用能力提供了新工具。 #医学AI #临床决策 #人工智能 #大语言模型 #基准测试
该研究提出了LongMedBench,一个专为评估长周期临床决策能力而设计的医学智能体基准测试。研究团队指出,现有医学评估多聚焦于单一诊断或简单问答,难以衡量智能体在复杂、多步临床路径中的表现。LongMedBench模拟真实临床场景,涵盖病史采集、检查检验、诊断、治疗方案制定及疗效随访等完整环节,要求智能体进行长达数十步的推理与决策。初步实验表明,当前主流大语言模型在该基准上表现不佳,尤其在信息整合、动态调整和长期规划方面存在显著短板。该基准为评估和改进医学AI的临床实用能力提供了新工具。 #医学AI #临床决策 #人工智能 #大语言模型 #基准测试
面向异构LLM具身智能体的算力网络通信高效数字孪生协调框架
来自北京邮电大学与新加坡科技设计大学的研究团队提出了一种面向异构大语言模型具身智能体的通信高效数字孪生协调框架。该框架针对在算力网络环境中部署多类型LLM驱动的具身智能体时面临的通信瓶颈与资源协调难题,创新性地引入数字孪生技术构建虚拟映射层,通过预同步状态与行为预测机制,大幅减少实体智能体间的实时通信开销。实验表明,在保持任务完成质量的前提下,该方案可降低约60%的通信数据量,并显著提升跨节点协作效率。该研究为未来大规模分布式智能体系统的算力资源优化调度提供了新思路,相关论文已提交至预印本平台arXiv。 #大模型 #数字孪生 #具身智能 #算力网络 #AI #边缘计算 #分布式系统
来自北京邮电大学与新加坡科技设计大学的研究团队提出了一种面向异构大语言模型具身智能体的通信高效数字孪生协调框架。该框架针对在算力网络环境中部署多类型LLM驱动的具身智能体时面临的通信瓶颈与资源协调难题,创新性地引入数字孪生技术构建虚拟映射层,通过预同步状态与行为预测机制,大幅减少实体智能体间的实时通信开销。实验表明,在保持任务完成质量的前提下,该方案可降低约60%的通信数据量,并显著提升跨节点协作效率。该研究为未来大规模分布式智能体系统的算力资源优化调度提供了新思路,相关论文已提交至预印本平台arXiv。 #大模型 #数字孪生 #具身智能 #算力网络 #AI #边缘计算 #分布式系统
AI Is Not a Real Object,论文提出语义抽象新视角
一篇题为《Ceci n'est pas une pipe: AI systems as semantic abstractions》的学术论文于2026年7月提交至arXiv预印本平台。作者Jade Alglave与Patrick Cousot在论文中提出,人工智能系统不应被视为真实存在的物理对象,而应被理解为一种语义抽象。论文借鉴了超现实主义画家马格利特名作《这不是一支烟斗》的隐喻,探讨AI系统作为抽象概念而非实体的本质。研究团队认为,当前对AI的讨论往往混淆了系统的物理实现与语义功能,这一框架有助于更精确地理解AI能力与局限。论文提供了PDF、HTML及TeX源码等多种格式,并获得了多个学术平台及工具的支持。 #AI #语义抽象 #哲学 #马格利特 #学术论文 #arXiv
一篇题为《Ceci n'est pas une pipe: AI systems as semantic abstractions》的学术论文于2026年7月提交至arXiv预印本平台。作者Jade Alglave与Patrick Cousot在论文中提出,人工智能系统不应被视为真实存在的物理对象,而应被理解为一种语义抽象。论文借鉴了超现实主义画家马格利特名作《这不是一支烟斗》的隐喻,探讨AI系统作为抽象概念而非实体的本质。研究团队认为,当前对AI的讨论往往混淆了系统的物理实现与语义功能,这一框架有助于更精确地理解AI能力与局限。论文提供了PDF、HTML及TeX源码等多种格式,并获得了多个学术平台及工具的支持。 #AI #语义抽象 #哲学 #马格利特 #学术论文 #arXiv
TrustX 提出智能体AI风险分类框架,划分内部系统风险等级
一项由Hannah M. Liu等学者提交至arXiv的论文提出了TrustX Agent风险分类框架(ARC),旨在为企业内部创建的自主AI系统提供风险分级管理方法。该框架针对生成式AI与自主决策系统在内部应用中可能产生的安全、伦理与合规风险,设计了从低风险到高风险的多层级分类体系。研究指出,随着企业内部AI代理系统日益复杂,缺乏统一风险标准可能导致监管漏洞或资源错配。ARC框架不仅帮助组织识别高风险场景(如财务决策或敏感数据处理),还为不同风险等级推荐相应的管控措施与审计要求。该论文目前正在等待arXiv注册数据引用,尚未正式发表。 #AI风险 #智能体 #自主系统 #合规管理 #arXiv #人工智能安全
一项由Hannah M. Liu等学者提交至arXiv的论文提出了TrustX Agent风险分类框架(ARC),旨在为企业内部创建的自主AI系统提供风险分级管理方法。该框架针对生成式AI与自主决策系统在内部应用中可能产生的安全、伦理与合规风险,设计了从低风险到高风险的多层级分类体系。研究指出,随着企业内部AI代理系统日益复杂,缺乏统一风险标准可能导致监管漏洞或资源错配。ARC框架不仅帮助组织识别高风险场景(如财务决策或敏感数据处理),还为不同风险等级推荐相应的管控措施与审计要求。该论文目前正在等待arXiv注册数据引用,尚未正式发表。 #AI风险 #智能体 #自主系统 #合规管理 #arXiv #人工智能安全
Agora
来自arXiv预印本的一项新研究提出了Agora框架,通过拍卖机制有效分配大语言模型智能体间的子任务,显著提升了复杂推理能力。传统LLM智能体在解决多步推理问题时,常因任务分配不均导致效率低下或错误累积。Agora引入了一种动态竞价系统,每个智能体根据自身能力与当前任务负载对子任务进行出价,从而优化资源分配。实验表明,该方法在数学推理、代码生成等基准测试中表现优于固定分工和随机分配策略,推理准确率提升超15%。研究团队指出,该机制不仅增强了智能体的协作效率,还为构建更自主、高效的多智能体系统提供了新思路。 #arXiv #LLM #多智能体 #推理增强 #AI研究 #拍卖机制 #Agora
来自arXiv预印本的一项新研究提出了Agora框架,通过拍卖机制有效分配大语言模型智能体间的子任务,显著提升了复杂推理能力。传统LLM智能体在解决多步推理问题时,常因任务分配不均导致效率低下或错误累积。Agora引入了一种动态竞价系统,每个智能体根据自身能力与当前任务负载对子任务进行出价,从而优化资源分配。实验表明,该方法在数学推理、代码生成等基准测试中表现优于固定分工和随机分配策略,推理准确率提升超15%。研究团队指出,该机制不仅增强了智能体的协作效率,还为构建更自主、高效的多智能体系统提供了新思路。 #arXiv #LLM #多智能体 #推理增强 #AI研究 #拍卖机制 #Agora
GPT-5.6一小时破解50年图论难题,AI数学推理获重大突破
OpenAI研究员Ethan Knight宣布,最新发布的GPT-5.6模型在不到一小时内成功证明存在近50年的图论难题——循环双覆盖猜想。该猜想被视为图论核心未解问题之一,长期困扰数学界。研究团队通过特定提示工程与推理策略,结合700词提示驾驭64个子智能体,实现了这一突破性进展。尽管成果尚未正式发表或经同行评审,但已引发广泛关注,凸显大模型在复杂逻辑推理与数学发现中的巨大潜力。若验证属实,或将推动AI辅助数学研究的新范式,为科学探索开辟新路径。 #GPT5.6 #AI数学 #图论 #循环双覆盖猜想 #大模型 #数学发现 #OpenAI #科技突破
OpenAI研究员Ethan Knight宣布,最新发布的GPT-5.6模型在不到一小时内成功证明存在近50年的图论难题——循环双覆盖猜想。该猜想被视为图论核心未解问题之一,长期困扰数学界。研究团队通过特定提示工程与推理策略,结合700词提示驾驭64个子智能体,实现了这一突破性进展。尽管成果尚未正式发表或经同行评审,但已引发广泛关注,凸显大模型在复杂逻辑推理与数学发现中的巨大潜力。若验证属实,或将推动AI辅助数学研究的新范式,为科学探索开辟新路径。 #GPT5.6 #AI数学 #图论 #循环双覆盖猜想 #大模型 #数学发现 #OpenAI #科技突破