AI知识库 @ai521
355 subscribers
24.1K photos
45 videos
20 files
922 links
@ai521 专注分享最实用的AI内容

🤖 AI教程(新手到进阶)
🧠 AI知识科普(大模型 / 提示词 / 自动化)
📰 AI资讯更新(每日最新AI动态)
📚 AI实战技巧(写作 / 绘画 / 编程 / 赚钱)
🔧 最新AI工具推荐

每天更新AI干货
长期做一个真正有价值的AI频道
Download Telegram
评估编码大语言模型中的隐式软件世界模型

一篇题为《Towards Evaluation of Implicit Software World Models in Coding LLMs》的论文在arXiv上公开。该研究聚焦于评估编码大语言模型在理解软件系统隐含状态与行为方面的能力,提出了一套系统化的评估框架。研究者认为,当前编码模型虽能生成正确代码,但往往缺乏对程序运行时世界模型的深层理解。该工作旨在通过构建特定任务与基准,量化模型在隐式软件世界建模上的表现,为提升代码生成的可解释性与鲁棒性提供新视角。 #编码LLM #软件世界模型 #评估方法 #AI #机器学习
基于CNN和ResNet的MRI图像脑肿瘤自动检测研究

一项由Annapurna V K等研究者提交至arXiv的论文提出,利用卷积神经网络(CNN)和残差网络(ResNet)架构对MRI图像进行自动化脑肿瘤检测。该方法通过深度学习模型学习肿瘤特征,旨在提高诊断准确率和效率。研究者在2026年6月25日发布的预印本中展示了模型架构及初步结果,为医学影像分析提供了新的技术路径。该工作依托arXiv平台公开,并获得了相关学术资源工具的支持,有望推动脑肿瘤早期筛查与辅助诊断的发展。 #脑肿瘤检测 #MRI #CNN #ResNet #深度学习 #医学影像 #人工智能 #arXiv
SidConArena:评估智能体在开放式双赢谈判游戏中的新环境

研究人员发布了一篇题为《SidConArena: An Environment Evaluating Agents in Open-Ended, Positive-Sum Bargaining Game》的论文,介绍了一种用于评估人工智能智能体在开放式、正和博弈(即双赢)谈判游戏中的全新环境。该环境旨在测试智能体在复杂互动中的合作、策略与协商能力,弥补现有基准在动态、长期合作场景中的不足。通过模拟现实世界中的多轮谈判博弈,SidConArena 可衡量智能体在共赢目标下的决策质量与学习效率。这一研究有望推动多智能体系统、博弈论与人工智能对齐领域的发展,为构建更智能、更协作的 AI 系统提供新的评估框架。 #AI #博弈论 #智能体 #多智能体系统 #论文 #人工智能 #研究 #合作博弈
亚马逊云科技:Agentic AI时代数据库从存储底座进化为决策引擎

在2026年亚马逊云科技中国峰会上,数据库服务副总裁Ganapathy“G2”Krishnamoorthy指出,Agentic AI的爆发正倒逼数据库角色深刻变革——从被动的存储系统进化为主动释放数据价值的智能引擎。他强调,Agentic AI依赖“上下文”与“记忆”,数据既要能被实时调用,也要持久化存储。为此,亚马逊云科技已让旗下所有数据库引擎支持MCP服务器协议,并提供向量检索与混合搜索能力,确保Agentic框架无缝访问。G2认为,未来推理将成为最大工作负载,Serverless架构与弹性扩展成为刚需,数据库必须易于创建、自动伸缩、自我优化,无需人工运维。针对不同客户,他建议传统商业数据库用户迁移至开源引擎以降低成本;封装应用用户优先释放现有数据价值;全新项目直接采用开源底座(如MySQL/PostgreSQL、Apache Iceberg)。此外,亚马逊云科技新发布的S3 Files和S3 Tables让数据直接服务AI和ML场景,开放数据架构整合分析、数据库、AI、搜索与流处理层。亚马逊全球副总裁储瑞松补充表示,数据是企业AI竞争不可复制的护城河,大量AI项目失败源于数据未就绪,私有数据与知识体系才是差异化优势。 #亚马逊云科技 #数据库 #AgenticAI #AI #大数据 #Serverless #向量检索 #开源 #科技新闻
代理式出版协议

一篇题为"Agentic Publication Protocol: An Attempt to Modernize Scientific Publication"的论文在arXiv预印本平台发布,作者为Sirui Lu和Xiao-Liang Qi。该研究针对传统科学出版流程效率低、审稿周期长、信息壁垒高等痛点,提出了一套基于代理机制的出版协议。协议设想通过自动化智能代理协调论文提交、同行评审、版本控制及数据传播等环节,结合去中心化架构与临时任务分配,减少人工干预,提升透明度与时效性。论文还探讨了如何利用现有预印本生态与智能合约技术,构建更灵活、开放的学术交流体系,为科学出版领域的数字化转型提供了新思路。 #科研 #论文 #出版 #arXiv #科学传播 #自动化 #去中心化 #学术改革
Telegram必备的搜索引擎,极搜JISOU帮你精准找到,想要的群组、频道、视频、音乐

👉 t.me/jisou2?start=a_8247614025
CalBrief 基准发布:评估大语言模型在科学简报中的证据校准能力

由 Yu Fu 等研究者提出的 CalBrief 基准近日在 arXiv 上公开。该基准旨在诊断大语言模型在生成科学简报时,能否准确校准并引用证据。研究团队设计了一套标准化测试,评估模型在摘要、解释和引用科学文献时的忠实度与准确性。初步实验显示,现有主流大模型在证据校准方面存在显著不足,容易产生未基于真实来源的表述。CalBrief 为提升 AI 在科研辅助中的可信度提供了重要评测工具,有望推动更可靠的自动科学简报系统发展。 #大模型 #科学简报 #证据校准 #基准测试 #ArXiv #AI评测 #科研工具 #LLM #可信AI
“机器遗忘”术语在大语言模型中被过度使用

一篇来自arXiv的学术论文指出,当前大语言模型(LLM)领域对“机器遗忘”(Machine Unlearning)这一术语的使用存在过度泛化现象。该论文由Sangyeon Yoon等三位作者撰写,系统分析了现有研究中对“机器遗忘”概念的定义与应用,认为许多工作实际上并未真正实现模型对特定知识的“遗忘”,而是通过微调、参数屏蔽或数据过滤等方式达到类似效果。作者呼吁研究者更严谨地界定术语,避免概念滥用导致研究方向偏离。该论文已以PDF和HTML形式公开,并附有BibTeX引用信息,供学术界参考讨论。 #机器遗忘 #大语言模型 #术语滥用 #AI研究 #学术论文 #arXiv
DataStates-LLM: 新型可扩展检查点技术助力Transformer模型训练

研究人员在arXiv上提交了一篇题为《DataStates-LLM: Scalable Checkpointing for Transformer Models Using Composable State Providers》的论文,提出了一种针对Transformer模型的可扩展检查点方法。该方法通过组合状态提供者(Composable State Providers)来优化大型语言模型训练过程中的状态保存与恢复,旨在解决传统检查点技术在处理超大规模模型时面临的存储开销和性能瓶颈。该技术的应用有望提升训练效率与容错能力,为大模型开发提供更可靠的底层支撑。论文作者包括Avinash Maurya等。 #arXiv #Transformer #检查点 #可扩展性 #大模型 #AI #论文
Agent-Native免疫系统

一篇来自arXiv的论文提出了名为“Agent-Native Immune System”的全新架构,旨在为自主智能体提供原生免疫防护。该研究由Bo Shen等作者完成,系统性地定义了智能体免疫系统的架构层次、分类标准及工程实现路径。论文借鉴生物免疫系统的分层防御机制,设计了一套可嵌入智能体运行环境的自适应安全框架,能够实时检测并防御针对大模型智能体的恶意攻击、数据投毒和异常行为。研究还构建了相应的分类体系,将威胁类型与免疫策略匹配,并给出了具体的工程化指南。这一工作为提升大语言模型驱动的自主智能体的鲁棒性和安全性提供了新思路,有望推动智能体在金融、医疗等高风险场景的可靠部署。 #AI安全 #智能体 #免疫系统 #大模型 #论文 #arXiv #网络安全
串联强化学习与可验证奖励

近日,一篇题为《Tandem Reinforcement Learning with Verifiable Rewards》的论文在arXiv预印本平台发布。该研究由Difan Jiao等学者共同完成,提出了一种名为“串联强化学习”的新框架。与传统强化学习依赖单一奖励信号不同,该方法引入可验证的奖励机制,通过将奖励生成过程与策略学习解耦,提高了奖励信号的可靠性和学习效率。实验表明,该框架在多个标准测试任务中取得了更优的收敛速度和最终性能,为强化学习在复杂场景下的应用提供了新思路。相关代码和数据已公开,便于学术社区复现与拓展。 #强化学习 #可验证奖励 #AI #机器学习 #学术前沿 #arXiv #论文速递
AI驱动系统设计合成方法论文发布,探索自动化创新

近日,一篇题为《AI-Driven Synthesis for High-Tech System Design: Automating Innovation》的论文在arXiv预印本平台发布。该论文由Luuk Oerlemans等研究者撰写,提出了一种利用人工智能驱动的方法,旨在自动化高科技系统的设计合成过程。研究聚焦于通过AI技术加速系统架构探索与优化,有望显著提升复杂系统设计的效率与创新能力,为自动化创新提供新思路。论文已公开PDF全文供学术界下载参考。 #AI #系统设计 #自动化创新 #高科技 #论文 #arXiv #人工智能
本体引导证据路径推理方法,助力多跳知识图谱问答

一篇题为《本体引导证据路径推理用于多跳知识图谱问答》的论文在arXiv预印本平台发布。该研究由Yongxue Shan等五位学者共同完成,针对多跳知识图谱问答中复杂推理路径的挑战,提出了一种本体引导的证据路径推理方法。通过引入本体知识,该方法能够有效约束推理空间,提升路径选择的准确性与可解释性,在多个基准数据集上取得了优于现有方法的性能。该工作为知识图谱问答领域提供了新思路,尤其适用于需要多步逻辑推理的复杂问题场景。 #知识图谱 #问答系统 #本体推理 #多跳推理 #AI #机器学习 #自然语言处理 #论文
京东发布Oxygen AIIC V1工业级商品智能中心,利用大模型与视觉语言模型革新商品管理

京东研究团队在arXiv上提交论文,正式公开了其自主研发的“京东氧气AI商品中心(Oxygen AIIC V1)”。该系统是一个以大规模语言模型(LLM)和视觉语言模型(VLM)为核心的工业级解决方案,旨在全面革新电商场景下的商品理解、管理及应用。Oxygen AIIC V1能够从海量商品数据中高效提取和理解视觉与文本特征,支撑商品搜索、推荐、内容生成等核心业务环节。论文由Oxygen AIIC团队与54位作者共同完成,体现了京东在工业界大规模AI应用上的深厚积累。该方案的发布标志着大模型技术在电商领域从实验室走向大规模工程化部署的重要进展,有望显著提升商品运营效率与用户体验。 #京东 #OxygenAIIC #大模型 #VLM #商品管理 #工业级AI #电商技术 #arXiv
Lifted Causal Inference 论文在 arXiv 预印本平台发布

近日,Malte Luttermann 等四位研究者在 arXiv 上提交了一篇题为《Lifted Causal Inference》的论文。该论文于2026年6月26日提交,提供PDF、HTML及TeX源码等多种格式。页面集成了参考文献、引用导出、相关论文推荐以及多项实验性工具如Connected Papers、Litmaps、Scite等,为读者提供了丰富的文献探索功能。论文当前处于提交状态,DOI尚在注册中,尚未正式出版。 #arXiv #因果推断 #论文 #预印本 #学术 #MalteLuttermann
RelBall:基于四元数旋转的关系球知识图谱补全方法

来自arXiv的一篇研究论文提出了名为RelBall的知识图谱补全方法。该方法创新性地将知识图谱中的关系建模为“关系球”,并利用四元数旋转机制进行实体和关系的嵌入表示。相比传统的平移或旋转模型,RelBall能够更有效地捕捉复杂关系模式,尤其在处理对称、非对称及组合关系时表现出优势。论文由Yike Liu等三位作者共同撰写,已提交至arXiv预印本平台。该研究为知识图谱嵌入领域提供了新的几何解释和计算框架,有望推动链接预测和关系推理等下游任务的发展。 #知识图谱 #关系补全 #四元数 #RelBall #论文 #AI #机器学习 #深度学习
可验证几何问题求解

这篇arXiv论文提出了一种新颖的几何问题求解方法,通过将求解器与自动形式化机制结合,实现了几何定理的自动提出与验证。传统几何问题求解往往依赖人工推理或预设规则,而该方法利用求解器驱动的方式,自动将几何问题转化为形式化表述,并在此过程中探索和证明新的定理。研究团队展示了该方法在处理复杂几何关系时的有效性,显著提升了自动推理的准确性和可解释性。这项研究为数学教育和人工智能推理领域提供了新的思路,有助于推动几何定理的自动化发现与验证。 #几何推理 #自动形式化 #定理提出 #AI求解 #机器学习 #数学教育 #arXiv论文
NormAct:面向具身规划中隐性社会规范遵循的基准测试

来自arXiv预印本的最新研究显示,研究人员提出了NormAct基准,旨在评估具身智能体在规划过程中对隐性社会规范的遵循能力。该基准通过设计一系列需要理解并遵守未明确表述的社会规则的任务场景,测试AI系统在复杂环境中的行为合理性。研究团队指出,现有具身规划模型往往忽略这些隐含的社会约束,导致行为不符合人类预期。NormAct的发布为衡量AI的社会智能提供了标准化测试平台,有助于推动更安全、更符合人类价值观的自主系统发展。 #具身智能 #社会规范 #AI基准 #具身规划 #arXiv #人工智能
新论文提出ATOD方法:退火轮次感知在线蒸馏提升多轮自主智能体性能

近日,一篇题为《ATOD: Annealed Turn-aware On-policy Distillation for Multi-turn Autonomous Agents》的学术论文在arXiv上发布。该研究由Qitai Tan等四位作者共同完成,聚焦于多轮自主智能体的训练优化。论文提出一种名为ATOD的退火轮次感知在线蒸馏方法,通过引入轮次感知机制和退火策略,改进传统策略蒸馏在多轮交互场景下的性能。该方法旨在让智能体更高效地从专家演示或历史轨迹中学习,从而在复杂多轮任务中做出更连贯、更合理的决策。虽然具体实验数据尚未公布,但该工作为多轮对话、任务型智能体等领域的训练范式提供了新思路,有望推动自主智能体在长期交互中的表现提升。 #AI #机器学习 #多轮对话 #知识蒸馏 #自主智能体 #论文 #arXiv #深度学习
基于参数化世界模型的接地的迭代语言规划

研究人员提出了一种名为“接地的迭代语言规划”的新方法,通过引入参数化世界模型来减少大型语言模型代理中的幻觉传播。该方法使代理在规划过程中能够基于现实世界的参数化模型进行迭代修正,从而避免错误信息的级联扩散。实验表明,该技术显著提升了代理在复杂任务中的推理准确性和一致性,为构建更可靠的AI系统提供了新思路。 #AI #LLM #幻觉 #世界模型 #NLP #论文 #arXiv #语言规划 #研究
理解图世界模型中的展开误差

一篇题为《理解图世界模型中的展开误差》的论文在arXiv上发布,作者为Xinyuan Song等人。该研究聚焦于图世界模型中一个关键问题——展开误差,即模型在递归预测时误差累积的现象。论文通过理论分析和实验验证,深入探讨了展开误差的产生机制及其对模型性能的影响。研究指出,图世界模型在处理动态图数据时,展开误差会显著降低长期预测的准确性。作者提出了新的评估框架和缓解策略,为改进图世界模型的设计提供了重要理论依据。该工作对图神经网络、强化学习和机器人规划等领域具有潜在应用价值。 #图世界模型 #展开误差 #图神经网络 #机器学习 #AI研究 #arXiv