SidConArena:评估智能体在开放式双赢谈判游戏中的新环境
研究人员发布了一篇题为《SidConArena: An Environment Evaluating Agents in Open-Ended, Positive-Sum Bargaining Game》的论文,介绍了一种用于评估人工智能智能体在开放式、正和博弈(即双赢)谈判游戏中的全新环境。该环境旨在测试智能体在复杂互动中的合作、策略与协商能力,弥补现有基准在动态、长期合作场景中的不足。通过模拟现实世界中的多轮谈判博弈,SidConArena 可衡量智能体在共赢目标下的决策质量与学习效率。这一研究有望推动多智能体系统、博弈论与人工智能对齐领域的发展,为构建更智能、更协作的 AI 系统提供新的评估框架。 #AI #博弈论 #智能体 #多智能体系统 #论文 #人工智能 #研究 #合作博弈
研究人员发布了一篇题为《SidConArena: An Environment Evaluating Agents in Open-Ended, Positive-Sum Bargaining Game》的论文,介绍了一种用于评估人工智能智能体在开放式、正和博弈(即双赢)谈判游戏中的全新环境。该环境旨在测试智能体在复杂互动中的合作、策略与协商能力,弥补现有基准在动态、长期合作场景中的不足。通过模拟现实世界中的多轮谈判博弈,SidConArena 可衡量智能体在共赢目标下的决策质量与学习效率。这一研究有望推动多智能体系统、博弈论与人工智能对齐领域的发展,为构建更智能、更协作的 AI 系统提供新的评估框架。 #AI #博弈论 #智能体 #多智能体系统 #论文 #人工智能 #研究 #合作博弈
亚马逊云科技:Agentic AI时代数据库从存储底座进化为决策引擎
在2026年亚马逊云科技中国峰会上,数据库服务副总裁Ganapathy“G2”Krishnamoorthy指出,Agentic AI的爆发正倒逼数据库角色深刻变革——从被动的存储系统进化为主动释放数据价值的智能引擎。他强调,Agentic AI依赖“上下文”与“记忆”,数据既要能被实时调用,也要持久化存储。为此,亚马逊云科技已让旗下所有数据库引擎支持MCP服务器协议,并提供向量检索与混合搜索能力,确保Agentic框架无缝访问。G2认为,未来推理将成为最大工作负载,Serverless架构与弹性扩展成为刚需,数据库必须易于创建、自动伸缩、自我优化,无需人工运维。针对不同客户,他建议传统商业数据库用户迁移至开源引擎以降低成本;封装应用用户优先释放现有数据价值;全新项目直接采用开源底座(如MySQL/PostgreSQL、Apache Iceberg)。此外,亚马逊云科技新发布的S3 Files和S3 Tables让数据直接服务AI和ML场景,开放数据架构整合分析、数据库、AI、搜索与流处理层。亚马逊全球副总裁储瑞松补充表示,数据是企业AI竞争不可复制的护城河,大量AI项目失败源于数据未就绪,私有数据与知识体系才是差异化优势。 #亚马逊云科技 #数据库 #AgenticAI #AI #大数据 #Serverless #向量检索 #开源 #科技新闻
在2026年亚马逊云科技中国峰会上,数据库服务副总裁Ganapathy“G2”Krishnamoorthy指出,Agentic AI的爆发正倒逼数据库角色深刻变革——从被动的存储系统进化为主动释放数据价值的智能引擎。他强调,Agentic AI依赖“上下文”与“记忆”,数据既要能被实时调用,也要持久化存储。为此,亚马逊云科技已让旗下所有数据库引擎支持MCP服务器协议,并提供向量检索与混合搜索能力,确保Agentic框架无缝访问。G2认为,未来推理将成为最大工作负载,Serverless架构与弹性扩展成为刚需,数据库必须易于创建、自动伸缩、自我优化,无需人工运维。针对不同客户,他建议传统商业数据库用户迁移至开源引擎以降低成本;封装应用用户优先释放现有数据价值;全新项目直接采用开源底座(如MySQL/PostgreSQL、Apache Iceberg)。此外,亚马逊云科技新发布的S3 Files和S3 Tables让数据直接服务AI和ML场景,开放数据架构整合分析、数据库、AI、搜索与流处理层。亚马逊全球副总裁储瑞松补充表示,数据是企业AI竞争不可复制的护城河,大量AI项目失败源于数据未就绪,私有数据与知识体系才是差异化优势。 #亚马逊云科技 #数据库 #AgenticAI #AI #大数据 #Serverless #向量检索 #开源 #科技新闻
代理式出版协议
一篇题为"Agentic Publication Protocol: An Attempt to Modernize Scientific Publication"的论文在arXiv预印本平台发布,作者为Sirui Lu和Xiao-Liang Qi。该研究针对传统科学出版流程效率低、审稿周期长、信息壁垒高等痛点,提出了一套基于代理机制的出版协议。协议设想通过自动化智能代理协调论文提交、同行评审、版本控制及数据传播等环节,结合去中心化架构与临时任务分配,减少人工干预,提升透明度与时效性。论文还探讨了如何利用现有预印本生态与智能合约技术,构建更灵活、开放的学术交流体系,为科学出版领域的数字化转型提供了新思路。 #科研 #论文 #出版 #arXiv #科学传播 #自动化 #去中心化 #学术改革
一篇题为"Agentic Publication Protocol: An Attempt to Modernize Scientific Publication"的论文在arXiv预印本平台发布,作者为Sirui Lu和Xiao-Liang Qi。该研究针对传统科学出版流程效率低、审稿周期长、信息壁垒高等痛点,提出了一套基于代理机制的出版协议。协议设想通过自动化智能代理协调论文提交、同行评审、版本控制及数据传播等环节,结合去中心化架构与临时任务分配,减少人工干预,提升透明度与时效性。论文还探讨了如何利用现有预印本生态与智能合约技术,构建更灵活、开放的学术交流体系,为科学出版领域的数字化转型提供了新思路。 #科研 #论文 #出版 #arXiv #科学传播 #自动化 #去中心化 #学术改革
CalBrief 基准发布:评估大语言模型在科学简报中的证据校准能力
由 Yu Fu 等研究者提出的 CalBrief 基准近日在 arXiv 上公开。该基准旨在诊断大语言模型在生成科学简报时,能否准确校准并引用证据。研究团队设计了一套标准化测试,评估模型在摘要、解释和引用科学文献时的忠实度与准确性。初步实验显示,现有主流大模型在证据校准方面存在显著不足,容易产生未基于真实来源的表述。CalBrief 为提升 AI 在科研辅助中的可信度提供了重要评测工具,有望推动更可靠的自动科学简报系统发展。 #大模型 #科学简报 #证据校准 #基准测试 #ArXiv #AI评测 #科研工具 #LLM #可信AI
由 Yu Fu 等研究者提出的 CalBrief 基准近日在 arXiv 上公开。该基准旨在诊断大语言模型在生成科学简报时,能否准确校准并引用证据。研究团队设计了一套标准化测试,评估模型在摘要、解释和引用科学文献时的忠实度与准确性。初步实验显示,现有主流大模型在证据校准方面存在显著不足,容易产生未基于真实来源的表述。CalBrief 为提升 AI 在科研辅助中的可信度提供了重要评测工具,有望推动更可靠的自动科学简报系统发展。 #大模型 #科学简报 #证据校准 #基准测试 #ArXiv #AI评测 #科研工具 #LLM #可信AI
“机器遗忘”术语在大语言模型中被过度使用
一篇来自arXiv的学术论文指出,当前大语言模型(LLM)领域对“机器遗忘”(Machine Unlearning)这一术语的使用存在过度泛化现象。该论文由Sangyeon Yoon等三位作者撰写,系统分析了现有研究中对“机器遗忘”概念的定义与应用,认为许多工作实际上并未真正实现模型对特定知识的“遗忘”,而是通过微调、参数屏蔽或数据过滤等方式达到类似效果。作者呼吁研究者更严谨地界定术语,避免概念滥用导致研究方向偏离。该论文已以PDF和HTML形式公开,并附有BibTeX引用信息,供学术界参考讨论。 #机器遗忘 #大语言模型 #术语滥用 #AI研究 #学术论文 #arXiv
一篇来自arXiv的学术论文指出,当前大语言模型(LLM)领域对“机器遗忘”(Machine Unlearning)这一术语的使用存在过度泛化现象。该论文由Sangyeon Yoon等三位作者撰写,系统分析了现有研究中对“机器遗忘”概念的定义与应用,认为许多工作实际上并未真正实现模型对特定知识的“遗忘”,而是通过微调、参数屏蔽或数据过滤等方式达到类似效果。作者呼吁研究者更严谨地界定术语,避免概念滥用导致研究方向偏离。该论文已以PDF和HTML形式公开,并附有BibTeX引用信息,供学术界参考讨论。 #机器遗忘 #大语言模型 #术语滥用 #AI研究 #学术论文 #arXiv
DataStates-LLM: 新型可扩展检查点技术助力Transformer模型训练
研究人员在arXiv上提交了一篇题为《DataStates-LLM: Scalable Checkpointing for Transformer Models Using Composable State Providers》的论文,提出了一种针对Transformer模型的可扩展检查点方法。该方法通过组合状态提供者(Composable State Providers)来优化大型语言模型训练过程中的状态保存与恢复,旨在解决传统检查点技术在处理超大规模模型时面临的存储开销和性能瓶颈。该技术的应用有望提升训练效率与容错能力,为大模型开发提供更可靠的底层支撑。论文作者包括Avinash Maurya等。 #arXiv #Transformer #检查点 #可扩展性 #大模型 #AI #论文
研究人员在arXiv上提交了一篇题为《DataStates-LLM: Scalable Checkpointing for Transformer Models Using Composable State Providers》的论文,提出了一种针对Transformer模型的可扩展检查点方法。该方法通过组合状态提供者(Composable State Providers)来优化大型语言模型训练过程中的状态保存与恢复,旨在解决传统检查点技术在处理超大规模模型时面临的存储开销和性能瓶颈。该技术的应用有望提升训练效率与容错能力,为大模型开发提供更可靠的底层支撑。论文作者包括Avinash Maurya等。 #arXiv #Transformer #检查点 #可扩展性 #大模型 #AI #论文
Agent-Native免疫系统
一篇来自arXiv的论文提出了名为“Agent-Native Immune System”的全新架构,旨在为自主智能体提供原生免疫防护。该研究由Bo Shen等作者完成,系统性地定义了智能体免疫系统的架构层次、分类标准及工程实现路径。论文借鉴生物免疫系统的分层防御机制,设计了一套可嵌入智能体运行环境的自适应安全框架,能够实时检测并防御针对大模型智能体的恶意攻击、数据投毒和异常行为。研究还构建了相应的分类体系,将威胁类型与免疫策略匹配,并给出了具体的工程化指南。这一工作为提升大语言模型驱动的自主智能体的鲁棒性和安全性提供了新思路,有望推动智能体在金融、医疗等高风险场景的可靠部署。 #AI安全 #智能体 #免疫系统 #大模型 #论文 #arXiv #网络安全
一篇来自arXiv的论文提出了名为“Agent-Native Immune System”的全新架构,旨在为自主智能体提供原生免疫防护。该研究由Bo Shen等作者完成,系统性地定义了智能体免疫系统的架构层次、分类标准及工程实现路径。论文借鉴生物免疫系统的分层防御机制,设计了一套可嵌入智能体运行环境的自适应安全框架,能够实时检测并防御针对大模型智能体的恶意攻击、数据投毒和异常行为。研究还构建了相应的分类体系,将威胁类型与免疫策略匹配,并给出了具体的工程化指南。这一工作为提升大语言模型驱动的自主智能体的鲁棒性和安全性提供了新思路,有望推动智能体在金融、医疗等高风险场景的可靠部署。 #AI安全 #智能体 #免疫系统 #大模型 #论文 #arXiv #网络安全
串联强化学习与可验证奖励
近日,一篇题为《Tandem Reinforcement Learning with Verifiable Rewards》的论文在arXiv预印本平台发布。该研究由Difan Jiao等学者共同完成,提出了一种名为“串联强化学习”的新框架。与传统强化学习依赖单一奖励信号不同,该方法引入可验证的奖励机制,通过将奖励生成过程与策略学习解耦,提高了奖励信号的可靠性和学习效率。实验表明,该框架在多个标准测试任务中取得了更优的收敛速度和最终性能,为强化学习在复杂场景下的应用提供了新思路。相关代码和数据已公开,便于学术社区复现与拓展。 #强化学习 #可验证奖励 #AI #机器学习 #学术前沿 #arXiv #论文速递
近日,一篇题为《Tandem Reinforcement Learning with Verifiable Rewards》的论文在arXiv预印本平台发布。该研究由Difan Jiao等学者共同完成,提出了一种名为“串联强化学习”的新框架。与传统强化学习依赖单一奖励信号不同,该方法引入可验证的奖励机制,通过将奖励生成过程与策略学习解耦,提高了奖励信号的可靠性和学习效率。实验表明,该框架在多个标准测试任务中取得了更优的收敛速度和最终性能,为强化学习在复杂场景下的应用提供了新思路。相关代码和数据已公开,便于学术社区复现与拓展。 #强化学习 #可验证奖励 #AI #机器学习 #学术前沿 #arXiv #论文速递
京东发布Oxygen AIIC V1工业级商品智能中心,利用大模型与视觉语言模型革新商品管理
京东研究团队在arXiv上提交论文,正式公开了其自主研发的“京东氧气AI商品中心(Oxygen AIIC V1)”。该系统是一个以大规模语言模型(LLM)和视觉语言模型(VLM)为核心的工业级解决方案,旨在全面革新电商场景下的商品理解、管理及应用。Oxygen AIIC V1能够从海量商品数据中高效提取和理解视觉与文本特征,支撑商品搜索、推荐、内容生成等核心业务环节。论文由Oxygen AIIC团队与54位作者共同完成,体现了京东在工业界大规模AI应用上的深厚积累。该方案的发布标志着大模型技术在电商领域从实验室走向大规模工程化部署的重要进展,有望显著提升商品运营效率与用户体验。 #京东 #OxygenAIIC #大模型 #VLM #商品管理 #工业级AI #电商技术 #arXiv
京东研究团队在arXiv上提交论文,正式公开了其自主研发的“京东氧气AI商品中心(Oxygen AIIC V1)”。该系统是一个以大规模语言模型(LLM)和视觉语言模型(VLM)为核心的工业级解决方案,旨在全面革新电商场景下的商品理解、管理及应用。Oxygen AIIC V1能够从海量商品数据中高效提取和理解视觉与文本特征,支撑商品搜索、推荐、内容生成等核心业务环节。论文由Oxygen AIIC团队与54位作者共同完成,体现了京东在工业界大规模AI应用上的深厚积累。该方案的发布标志着大模型技术在电商领域从实验室走向大规模工程化部署的重要进展,有望显著提升商品运营效率与用户体验。 #京东 #OxygenAIIC #大模型 #VLM #商品管理 #工业级AI #电商技术 #arXiv
Lifted Causal Inference 论文在 arXiv 预印本平台发布
近日,Malte Luttermann 等四位研究者在 arXiv 上提交了一篇题为《Lifted Causal Inference》的论文。该论文于2026年6月26日提交,提供PDF、HTML及TeX源码等多种格式。页面集成了参考文献、引用导出、相关论文推荐以及多项实验性工具如Connected Papers、Litmaps、Scite等,为读者提供了丰富的文献探索功能。论文当前处于提交状态,DOI尚在注册中,尚未正式出版。 #arXiv #因果推断 #论文 #预印本 #学术 #MalteLuttermann
近日,Malte Luttermann 等四位研究者在 arXiv 上提交了一篇题为《Lifted Causal Inference》的论文。该论文于2026年6月26日提交,提供PDF、HTML及TeX源码等多种格式。页面集成了参考文献、引用导出、相关论文推荐以及多项实验性工具如Connected Papers、Litmaps、Scite等,为读者提供了丰富的文献探索功能。论文当前处于提交状态,DOI尚在注册中,尚未正式出版。 #arXiv #因果推断 #论文 #预印本 #学术 #MalteLuttermann
RelBall:基于四元数旋转的关系球知识图谱补全方法
来自arXiv的一篇研究论文提出了名为RelBall的知识图谱补全方法。该方法创新性地将知识图谱中的关系建模为“关系球”,并利用四元数旋转机制进行实体和关系的嵌入表示。相比传统的平移或旋转模型,RelBall能够更有效地捕捉复杂关系模式,尤其在处理对称、非对称及组合关系时表现出优势。论文由Yike Liu等三位作者共同撰写,已提交至arXiv预印本平台。该研究为知识图谱嵌入领域提供了新的几何解释和计算框架,有望推动链接预测和关系推理等下游任务的发展。 #知识图谱 #关系补全 #四元数 #RelBall #论文 #AI #机器学习 #深度学习
来自arXiv的一篇研究论文提出了名为RelBall的知识图谱补全方法。该方法创新性地将知识图谱中的关系建模为“关系球”,并利用四元数旋转机制进行实体和关系的嵌入表示。相比传统的平移或旋转模型,RelBall能够更有效地捕捉复杂关系模式,尤其在处理对称、非对称及组合关系时表现出优势。论文由Yike Liu等三位作者共同撰写,已提交至arXiv预印本平台。该研究为知识图谱嵌入领域提供了新的几何解释和计算框架,有望推动链接预测和关系推理等下游任务的发展。 #知识图谱 #关系补全 #四元数 #RelBall #论文 #AI #机器学习 #深度学习
新论文提出ATOD方法:退火轮次感知在线蒸馏提升多轮自主智能体性能
近日,一篇题为《ATOD: Annealed Turn-aware On-policy Distillation for Multi-turn Autonomous Agents》的学术论文在arXiv上发布。该研究由Qitai Tan等四位作者共同完成,聚焦于多轮自主智能体的训练优化。论文提出一种名为ATOD的退火轮次感知在线蒸馏方法,通过引入轮次感知机制和退火策略,改进传统策略蒸馏在多轮交互场景下的性能。该方法旨在让智能体更高效地从专家演示或历史轨迹中学习,从而在复杂多轮任务中做出更连贯、更合理的决策。虽然具体实验数据尚未公布,但该工作为多轮对话、任务型智能体等领域的训练范式提供了新思路,有望推动自主智能体在长期交互中的表现提升。 #AI #机器学习 #多轮对话 #知识蒸馏 #自主智能体 #论文 #arXiv #深度学习
近日,一篇题为《ATOD: Annealed Turn-aware On-policy Distillation for Multi-turn Autonomous Agents》的学术论文在arXiv上发布。该研究由Qitai Tan等四位作者共同完成,聚焦于多轮自主智能体的训练优化。论文提出一种名为ATOD的退火轮次感知在线蒸馏方法,通过引入轮次感知机制和退火策略,改进传统策略蒸馏在多轮交互场景下的性能。该方法旨在让智能体更高效地从专家演示或历史轨迹中学习,从而在复杂多轮任务中做出更连贯、更合理的决策。虽然具体实验数据尚未公布,但该工作为多轮对话、任务型智能体等领域的训练范式提供了新思路,有望推动自主智能体在长期交互中的表现提升。 #AI #机器学习 #多轮对话 #知识蒸馏 #自主智能体 #论文 #arXiv #深度学习