新论文提出FlowEdit
近日,一篇题为《FlowEdit: Information-Theoretic Control of LLM Reasoning Flows for Ill-posed Problems Involving Conflicts》的学术论文在arXiv平台发布。该研究由Sizhe Tang等六位作者共同完成,针对大语言模型(LLM)在处理涉及冲突的不当问题(ill-posed problems)时推理能力不足的挑战,提出了一种名为FlowEdit的新方法。FlowEdit从信息论角度入手,通过控制LLM的推理流(reasoning flows),引导模型在矛盾信息中做出更合理、稳健的判断。实验表明,该方法能有效提升LLM在复杂冲突场景下的推理准确性和鲁棒性,为未来构建更可靠、能应对真实世界模糊问题的AI系统提供了新的理论框架与技术路径。 #AI #大模型 #LLM #推理 #信息论 #论文 #FlowEdit #arXiv
近日,一篇题为《FlowEdit: Information-Theoretic Control of LLM Reasoning Flows for Ill-posed Problems Involving Conflicts》的学术论文在arXiv平台发布。该研究由Sizhe Tang等六位作者共同完成,针对大语言模型(LLM)在处理涉及冲突的不当问题(ill-posed problems)时推理能力不足的挑战,提出了一种名为FlowEdit的新方法。FlowEdit从信息论角度入手,通过控制LLM的推理流(reasoning flows),引导模型在矛盾信息中做出更合理、稳健的判断。实验表明,该方法能有效提升LLM在复杂冲突场景下的推理准确性和鲁棒性,为未来构建更可靠、能应对真实世界模糊问题的AI系统提供了新的理论框架与技术路径。 #AI #大模型 #LLM #推理 #信息论 #论文 #FlowEdit #arXiv
MKEvolve
近日,一篇题为《MKEvolve: A Modular Multi-Agent Framework for Kernel Code Generation》的论文在arXiv平台发布。该论文由Jinsoo Yoo等人撰写,提出了一种模块化多智能体框架,旨在自动化操作系统内核代码的生成过程。传统内核开发高度依赖人工编写,任务复杂且易错;MKEvolve通过将代码生成任务拆解,并让多个专用智能体协作完成模块构建与整合,有望提升开发效率与代码可靠性。这一研究将多智能体协作机制引入系统底层软件生成领域,为操作系统自动构建与内核编程工具的发展提供了新思路。 #MKEvolve #内核代码生成 #多智能体框架 #模块化设计 #AI #代码自动化 #操作系统 #arXiv #论文
近日,一篇题为《MKEvolve: A Modular Multi-Agent Framework for Kernel Code Generation》的论文在arXiv平台发布。该论文由Jinsoo Yoo等人撰写,提出了一种模块化多智能体框架,旨在自动化操作系统内核代码的生成过程。传统内核开发高度依赖人工编写,任务复杂且易错;MKEvolve通过将代码生成任务拆解,并让多个专用智能体协作完成模块构建与整合,有望提升开发效率与代码可靠性。这一研究将多智能体协作机制引入系统底层软件生成领域,为操作系统自动构建与内核编程工具的发展提供了新思路。 #MKEvolve #内核代码生成 #多智能体框架 #模块化设计 #AI #代码自动化 #操作系统 #arXiv #论文
因子化概率分布可比性研究论文在arXiv发表
据arXiv平台信息,一篇题为《Inducing Comparability of Factorised Probability Distributions》的学术论文于2026年6月提交,作者包括Jan Speller、Malte Luttermann、Marcel Gehrke和Tanya Braun。该论文聚焦于因子化概率分布的可比性问题,这类分布是概率图模型与机器学习中的核心工具,但不同分布间的直接比较长期缺乏有效手段。研究提出一种系统性方法,通过数学结构诱导分布间的可比性,有望提升概率推理、不确定建模及决策分析等任务的效率与一致性。目前论文提供PDF与HTML全文下载,并配有多种学术工具链接。 #因子化概率分布 #可比性 #机器学习 #概率推理 #arXiv #计算机科学 #学术论文
据arXiv平台信息,一篇题为《Inducing Comparability of Factorised Probability Distributions》的学术论文于2026年6月提交,作者包括Jan Speller、Malte Luttermann、Marcel Gehrke和Tanya Braun。该论文聚焦于因子化概率分布的可比性问题,这类分布是概率图模型与机器学习中的核心工具,但不同分布间的直接比较长期缺乏有效手段。研究提出一种系统性方法,通过数学结构诱导分布间的可比性,有望提升概率推理、不确定建模及决策分析等任务的效率与一致性。目前论文提供PDF与HTML全文下载,并配有多种学术工具链接。 #因子化概率分布 #可比性 #机器学习 #概率推理 #arXiv #计算机科学 #学术论文
优化超图RAG:arXiv新论文聚焦事实提取与分块检索
一篇题为《Optimizing Hypergraph-Based RAG: Toward Better Fact Extraction and Chunk Retrieval》的论文于2026年7月2日提交至arXiv预印本平台。该论文由Houda Khrouf等研究人员撰写,聚焦于基于超图结构的检索增强生成(RAG)优化问题。针对传统RAG在事实提取与分块检索中存在的精度和效率瓶颈,作者提出通过超图对文本中的实体、关系及上下文连接进行高阶建模,从而改善检索质量与知识对齐效果。论文虽尚未完成DataCite注册,但已提供PDF全文预览。这一研究有望为RAG框架在知识密集型任务中的应用提供新的方法论支持,对提升大模型外部知识融合能力具有参考价值。 #arXiv #论文 #RAG #超图 #事实提取 #分块检索 #AI #大模型 #知识检索 #优化
一篇题为《Optimizing Hypergraph-Based RAG: Toward Better Fact Extraction and Chunk Retrieval》的论文于2026年7月2日提交至arXiv预印本平台。该论文由Houda Khrouf等研究人员撰写,聚焦于基于超图结构的检索增强生成(RAG)优化问题。针对传统RAG在事实提取与分块检索中存在的精度和效率瓶颈,作者提出通过超图对文本中的实体、关系及上下文连接进行高阶建模,从而改善检索质量与知识对齐效果。论文虽尚未完成DataCite注册,但已提供PDF全文预览。这一研究有望为RAG框架在知识密集型任务中的应用提供新的方法论支持,对提升大模型外部知识融合能力具有参考价值。 #arXiv #论文 #RAG #超图 #事实提取 #分块检索 #AI #大模型 #知识检索 #优化
MiniCache论文提出利用小型模型接口缓存加速LLM推理
一篇由Jingquan Chen等人撰写的论文《MiniCache: Reusable Program Caching with Small Model Interfaces for Efficient LLM Inference》于2026年7月3日提交至arXiv。该论文聚焦大语言模型(LLM)推理效率优化,提出一种基于小型模型接口的可重用程序缓存机制。通过缓存程序执行结果并复用,该方法旨在减少LLM推理过程中的重复计算,从而降低延迟与计算资源消耗,为高效部署LLM提供新思路。论文已在arXiv平台公开,并提供PDF全文下载。 #MiniCache #LLM #推理效率 #程序缓存 #模型优化 #arXiv #论文
一篇由Jingquan Chen等人撰写的论文《MiniCache: Reusable Program Caching with Small Model Interfaces for Efficient LLM Inference》于2026年7月3日提交至arXiv。该论文聚焦大语言模型(LLM)推理效率优化,提出一种基于小型模型接口的可重用程序缓存机制。通过缓存程序执行结果并复用,该方法旨在减少LLM推理过程中的重复计算,从而降低延迟与计算资源消耗,为高效部署LLM提供新思路。论文已在arXiv平台公开,并提供PDF全文下载。 #MiniCache #LLM #推理效率 #程序缓存 #模型优化 #arXiv #论文
SiGMA:符号引导的多模态持续指令微调合并与适应方法
近日,一篇题为《SiGMA: Sign-Guided Merging and Adaptation for Multimodal Continual Instruction Tuning》的论文提交至arXiv。该研究由Keonhee Park和Gunhee Kim完成,针对多模态模型在持续指令微调场景中面临的知识遗忘与适应难题,提出了一种符号引导的合并与适应方法(SiGMA)。该方法利用训练过程中的符号信息对模型参数进行动态合并与调整,使模型能在连续执行多项指令任务时兼顾旧知识保留与新知识吸收,从而提升持续学习的稳定性与效率。这一工作为多模态大模型在动态任务环境中的部署提供了新的技术路径。 #SiGMA #多模态 #持续学习 #指令微调 #AI #大模型 #arXiv #论文
近日,一篇题为《SiGMA: Sign-Guided Merging and Adaptation for Multimodal Continual Instruction Tuning》的论文提交至arXiv。该研究由Keonhee Park和Gunhee Kim完成,针对多模态模型在持续指令微调场景中面临的知识遗忘与适应难题,提出了一种符号引导的合并与适应方法(SiGMA)。该方法利用训练过程中的符号信息对模型参数进行动态合并与调整,使模型能在连续执行多项指令任务时兼顾旧知识保留与新知识吸收,从而提升持续学习的稳定性与效率。这一工作为多模态大模型在动态任务环境中的部署提供了新的技术路径。 #SiGMA #多模态 #持续学习 #指令微调 #AI #大模型 #arXiv #论文
Research on Reliability-Aware LLM Alignment from Inconsistent Human Feedback
一篇题为“Reliability-Aware LLM Alignment from Inconsistent Human Feedback”的论文于2026年7月7日提交至arXiv预印本平台。该论文由Jingyi Huang等六位学者完成,属于计算机科学(cs)领域。研究聚焦大语言模型对齐中的关键难题:人类反馈常常存在不一致性,这会影响对齐过程的有效性和可靠性。作者由此提出“可靠性感知”的对齐方法,旨在系统应对反馈不一致带来的挑战,从而提升模型与人类意图对齐的稳健性。该工作为构建更可靠、可信任的AI系统提供了新的思路和理论支持。 #LLM #对齐 #人类反馈 #可靠性 #AI #论文 #arXiv #计算机科学
一篇题为“Reliability-Aware LLM Alignment from Inconsistent Human Feedback”的论文于2026年7月7日提交至arXiv预印本平台。该论文由Jingyi Huang等六位学者完成,属于计算机科学(cs)领域。研究聚焦大语言模型对齐中的关键难题:人类反馈常常存在不一致性,这会影响对齐过程的有效性和可靠性。作者由此提出“可靠性感知”的对齐方法,旨在系统应对反馈不一致带来的挑战,从而提升模型与人类意图对齐的稳健性。该工作为构建更可靠、可信任的AI系统提供了新的思路和理论支持。 #LLM #对齐 #人类反馈 #可靠性 #AI #论文 #arXiv #计算机科学
CANN Bench:在真实NPU上评估AI代理生成内核性能
据arXiv预印本,由Xue-Jian Gao等15位作者提出的CANN Bench基准测试,旨在系统评估AI代理自动生成的核(kernel)在神经网络处理单元(NPU)上的实际表现,并与理论算法极限进行对比。该研究于2026年7月发布,通过一系列标准化任务度量生成内核的计算效率、资源利用率及距离理论极限的差距。初步结果表明,某些AI生成内核已接近甚至超越手工优化版本,但在复杂场景下仍有优化空间。CANN Bench为自动化内核生成技术提供了标准化评估框架,有望推动AI芯片软件生态的发展。 #CANNBench #AI #NPU #内核生成 #基准测试 #机器学习系统 #学术论文 #arXiv
据arXiv预印本,由Xue-Jian Gao等15位作者提出的CANN Bench基准测试,旨在系统评估AI代理自动生成的核(kernel)在神经网络处理单元(NPU)上的实际表现,并与理论算法极限进行对比。该研究于2026年7月发布,通过一系列标准化任务度量生成内核的计算效率、资源利用率及距离理论极限的差距。初步结果表明,某些AI生成内核已接近甚至超越手工优化版本,但在复杂场景下仍有优化空间。CANN Bench为自动化内核生成技术提供了标准化评估框架,有望推动AI芯片软件生态的发展。 #CANNBench #AI #NPU #内核生成 #基准测试 #机器学习系统 #学术论文 #arXiv
大语言模型数学推理鲁棒性研究登上arXiv
一篇题为“Representation Robustness Under Executable Reasoning Constraints in Large Language Models for Mathematical Problem Solving”的学术论文于2026年7月8日提交至arXiv预印本平台。该论文由Sagnik Nath等人撰写,重点研究大语言模型在数学问题求解过程中,面对可执行推理约束时的表示鲁棒性问题。研究团队通过设计特定的约束条件,系统评估模型在数学推理中的稳定性与可靠性,旨在揭示模型在复杂推理任务中可能存在的脆弱性。这一成果对于提升大语言模型在教育、科学计算等领域的应用安全性具有重要参考价值。 #大模型 #数学推理 #鲁棒性 #AI安全 #arXiv #学术研究 #机器学习 #自然语言处理
一篇题为“Representation Robustness Under Executable Reasoning Constraints in Large Language Models for Mathematical Problem Solving”的学术论文于2026年7月8日提交至arXiv预印本平台。该论文由Sagnik Nath等人撰写,重点研究大语言模型在数学问题求解过程中,面对可执行推理约束时的表示鲁棒性问题。研究团队通过设计特定的约束条件,系统评估模型在数学推理中的稳定性与可靠性,旨在揭示模型在复杂推理任务中可能存在的脆弱性。这一成果对于提升大语言模型在教育、科学计算等领域的应用安全性具有重要参考价值。 #大模型 #数学推理 #鲁棒性 #AI安全 #arXiv #学术研究 #机器学习 #自然语言处理
注意力退化与功能标记锚定
一篇来自arXiv的论文“Attention Degradation, Function Token Anchoring, and the Limits of Attention-Based Intervention in Large Language Models”探讨了大语言模型内部注意力机制的关键问题。研究首次提出“注意力退化”与“功能标记锚定”两个概念,揭示了模型在复杂推理任务中注意力分布失效的现象,以及特定功能标记如何不合理地锚定模型关注点。论文进一步分析了当前基于注意力机制的干预方法(如注意力编辑)的局限性,指出这些方法在修正模型行为时存在根本性瓶颈,无法有效应对深层注意力退化带来的影响。该工作由Sagar Dangal等研究者完成,为大语言模型的可解释性研究提供了新的理论视角。 #AttentionDegradation #FunctionTokenAnchoring #大语言模型 #注意力机制 #可解释性 #AI #论文
一篇来自arXiv的论文“Attention Degradation, Function Token Anchoring, and the Limits of Attention-Based Intervention in Large Language Models”探讨了大语言模型内部注意力机制的关键问题。研究首次提出“注意力退化”与“功能标记锚定”两个概念,揭示了模型在复杂推理任务中注意力分布失效的现象,以及特定功能标记如何不合理地锚定模型关注点。论文进一步分析了当前基于注意力机制的干预方法(如注意力编辑)的局限性,指出这些方法在修正模型行为时存在根本性瓶颈,无法有效应对深层注意力退化带来的影响。该工作由Sagar Dangal等研究者完成,为大语言模型的可解释性研究提供了新的理论视角。 #AttentionDegradation #FunctionTokenAnchoring #大语言模型 #注意力机制 #可解释性 #AI #论文
GPT-5.5 Pro 自动否证实数域上的和积猜想
一篇来自预印本平台 arXiv 的论文提出,研究者利用 OpenAI 最新大模型 GPT-5.5 Pro 在实数域上自动构建了和积猜想(sum-product conjecture)的反例,从而完成了对该猜想的自动否证。和积猜想是组合数论中的经典问题,此前在有限域上已有大量研究,但在实数域上的自动推理仍属前沿尝试。该工作展示了大型语言模型在高等数学领域进行自主推理与反例构造的潜力,或为 AI 辅助数学研究开辟新路径。论文作者为 Yichen Huang,提交于 2026 年 7 月 9 日。 #数学 #AI #大模型 #GPT5.5 #arXiv #和积猜想 #自动推理
一篇来自预印本平台 arXiv 的论文提出,研究者利用 OpenAI 最新大模型 GPT-5.5 Pro 在实数域上自动构建了和积猜想(sum-product conjecture)的反例,从而完成了对该猜想的自动否证。和积猜想是组合数论中的经典问题,此前在有限域上已有大量研究,但在实数域上的自动推理仍属前沿尝试。该工作展示了大型语言模型在高等数学领域进行自主推理与反例构造的潜力,或为 AI 辅助数学研究开辟新路径。论文作者为 Yichen Huang,提交于 2026 年 7 月 9 日。 #数学 #AI #大模型 #GPT5.5 #arXiv #和积猜想 #自动推理
智能科学合成引用忠实性评估与保护方法提出
近日,arXiv预印本平台上出现一篇题为《Evaluating and Guarding Citation Faithfulness in Agentic Scientific Synthesis》的论文,由Taewan Goo等六位研究者提交。该研究聚焦于智能体科学合成(即人工智能辅助生成科学文本)中引用信息的准确性问题,系统评估了当前合成系统中引用不忠实的现状,并提出一套评估与防护框架,旨在提升生成内容的引用可信度。该工作对推动AI在科研写作领域的可靠应用具有参考意义。论文以预印本形式发布,全文可通过arXiv获取。 #arXiv #论文 #智能科学合成 #引用忠实性 #AI #科学研究 #预印本 #可信度
近日,arXiv预印本平台上出现一篇题为《Evaluating and Guarding Citation Faithfulness in Agentic Scientific Synthesis》的论文,由Taewan Goo等六位研究者提交。该研究聚焦于智能体科学合成(即人工智能辅助生成科学文本)中引用信息的准确性问题,系统评估了当前合成系统中引用不忠实的现状,并提出一套评估与防护框架,旨在提升生成内容的引用可信度。该工作对推动AI在科研写作领域的可靠应用具有参考意义。论文以预印本形式发布,全文可通过arXiv获取。 #arXiv #论文 #智能科学合成 #引用忠实性 #AI #科学研究 #预印本 #可信度
Anthropic发布Claude Opus 5
Anthropic周五推出新一代旗舰模型Claude Opus 5,输入定价为每百万Token 5美元。公司声称该模型在综合表现上已接近更高价的Claude Fable 5,但成本仅为其一半。Opus 5被定位为“为日常工作打造”的旗舰模型,而非单纯追求测试分数。该模型将成为Claude Max订阅用户的默认模型,Pro用户也可使用,价格与上一代Opus 4.8一致。在面向知识工作的GDPval-AA v2测试中,Opus 5以1,861分领先Fable 5的1,747分和OpenAI GPT-5.6 Sol的1,736分。合作企业测试中评价其接近Fable级别的智能且保持Opus级别的速度与价格。Opus 5是Anthropic在不到两个月内交付的第四款Claude模型,快速迭代发生在公司与美国监管部门关系紧张之际。Anthropic已提交保密IPO申请,该发布被视为上市前夕展示技术势能的关键一步。 #Anthropic #Claude #Opus5 #AI #大模型 #旗舰模型 #Fable5 #IPO #科技新闻
Anthropic周五推出新一代旗舰模型Claude Opus 5,输入定价为每百万Token 5美元。公司声称该模型在综合表现上已接近更高价的Claude Fable 5,但成本仅为其一半。Opus 5被定位为“为日常工作打造”的旗舰模型,而非单纯追求测试分数。该模型将成为Claude Max订阅用户的默认模型,Pro用户也可使用,价格与上一代Opus 4.8一致。在面向知识工作的GDPval-AA v2测试中,Opus 5以1,861分领先Fable 5的1,747分和OpenAI GPT-5.6 Sol的1,736分。合作企业测试中评价其接近Fable级别的智能且保持Opus级别的速度与价格。Opus 5是Anthropic在不到两个月内交付的第四款Claude模型,快速迭代发生在公司与美国监管部门关系紧张之际。Anthropic已提交保密IPO申请,该发布被视为上市前夕展示技术势能的关键一步。 #Anthropic #Claude #Opus5 #AI #大模型 #旗舰模型 #Fable5 #IPO #科技新闻
华泰证券:AI Agent推动推理算力与存力扩容,自主可控加速
华泰证券最新研报指出,2026年AI产业正从大模型预训练阶段切换至AI Agent商业化落地,推理算力需求进入加速增长通道。研报看好三条主线:一是AI链方向,国产算力闭环加速形成,超节点互联与存储升级共振,推理需求拐点明确,折叠机、AI眼镜等AI端侧新品周期将至;二是功率与被动元件方向,AI功耗驱动MLCC、电感、电容、功率半导体量价齐升,涨价周期与国产替代形成共振;三是自主可控方向,上游制造、设备及零部件国产化进程加速,先进封装价值量系统性提升。 #华泰证券 #AI Agent #推理算力 #存力 #自主可控 #国产算力 #功率半导体 #先进封装 #AI端侧 #研报
华泰证券最新研报指出,2026年AI产业正从大模型预训练阶段切换至AI Agent商业化落地,推理算力需求进入加速增长通道。研报看好三条主线:一是AI链方向,国产算力闭环加速形成,超节点互联与存储升级共振,推理需求拐点明确,折叠机、AI眼镜等AI端侧新品周期将至;二是功率与被动元件方向,AI功耗驱动MLCC、电感、电容、功率半导体量价齐升,涨价周期与国产替代形成共振;三是自主可控方向,上游制造、设备及零部件国产化进程加速,先进封装价值量系统性提升。 #华泰证券 #AI Agent #推理算力 #存力 #自主可控 #国产算力 #功率半导体 #先进封装 #AI端侧 #研报
PhantomFill
一篇发表于 arXiv 的论文《PhantomFill: When the Form Demands an Answer, Language Models Invent One》揭示了大型语言模型的一个新问题:当用户填写表单时,如果模型被强制要求提供回答,它倾向于编造看似合理但实际错误的信息。研究团队通过实验发现,模型在缺乏足够上下文或无法获得真实数据的情况下,会主动“填空”以完成表单提交,这种现象被称为“PhantomFill”。该研究指出,这种虚构行为可能加剧虚假信息传播,尤其是在自动填写表格、问卷或数据录入系统中。作者呼吁开发者对模型的输出进行更严格的验证,并建议在表单设计中增加“不确定”选项以避免模型强行作答。这一发现对AI在关键领域(如医疗、金融)的应用提出了新的安全挑战。 #AI #语言模型 #虚假信息 #研究 #论文 #arXiv #安全 #表单 #PhantomFill
一篇发表于 arXiv 的论文《PhantomFill: When the Form Demands an Answer, Language Models Invent One》揭示了大型语言模型的一个新问题:当用户填写表单时,如果模型被强制要求提供回答,它倾向于编造看似合理但实际错误的信息。研究团队通过实验发现,模型在缺乏足够上下文或无法获得真实数据的情况下,会主动“填空”以完成表单提交,这种现象被称为“PhantomFill”。该研究指出,这种虚构行为可能加剧虚假信息传播,尤其是在自动填写表格、问卷或数据录入系统中。作者呼吁开发者对模型的输出进行更严格的验证,并建议在表单设计中增加“不确定”选项以避免模型强行作答。这一发现对AI在关键领域(如医疗、金融)的应用提出了新的安全挑战。 #AI #语言模型 #虚假信息 #研究 #论文 #arXiv #安全 #表单 #PhantomFill
Muon 的 Grokking 现象中的关键活性成分
近日,一篇由 Yufeng Wang 提交至 arXiv 的论文《The Active Ingredient in Muon's Grokking》探讨了神经网络训练中 Muon 优化器触发 Grokking(延迟泛化)现象的核心机制。研究通过分析优化器内部结构,识别出导致模型从记忆数据突然转变为泛化的关键活性成分。该发现为理解深度学习中的相变行为提供了新视角,并可能指导更高效训练方法的开发。论文采用多项实验验证,揭示了 Muon 优化器与传统优化器在数据处理上的本质差异。 #arXiv #Grokking #Muon #优化器 #深度学习 #神经网络 #AI研究 #泛化
近日,一篇由 Yufeng Wang 提交至 arXiv 的论文《The Active Ingredient in Muon's Grokking》探讨了神经网络训练中 Muon 优化器触发 Grokking(延迟泛化)现象的核心机制。研究通过分析优化器内部结构,识别出导致模型从记忆数据突然转变为泛化的关键活性成分。该发现为理解深度学习中的相变行为提供了新视角,并可能指导更高效训练方法的开发。论文采用多项实验验证,揭示了 Muon 优化器与传统优化器在数据处理上的本质差异。 #arXiv #Grokking #Muon #优化器 #深度学习 #神经网络 #AI研究 #泛化