最后一层足以量化不确定性吗?学者提出质疑
一篇题为《最后一层足以量化不确定性吗?》(Is the Last Layer Sufficient for Uncertainty Quantification?)的研究论文近日在arXiv预印本平台发布。该论文由Joseph Wilson等人撰写,聚焦深度神经网络中的不确定性量化问题。在当前的机器学习实践中,许多模型仅依赖网络最后一层(如softmax输出)来估计预测的不确定性。然而,这种简化方法可能忽略了中间层所蕴含的丰富信息,导致对模型置信度的错误评估。研究团队通过实验和理论分析,系统比较了仅使用最后一层与其他更全面的不确定性量化方法(如贝叶斯神经网络、集成方法等)之间的差异。初步结果表明,仅依靠最后一层往往无法准确捕捉模型在多场景下的认知不确定性,尤其在分布外样本或小数据场景下缺陷更为明显。这项工作为改进模型安全性和可解释性提供了重要参考,对自动驾驶、医疗诊断等高风险应用具有潜在影响。论文目前已开放浏览,并附有代码和数据链接。 #论文 #机器学习 #不确定性量化 #深度学习 #arXiv #AI #模型可解释性 #贝叶斯方法
一篇题为《最后一层足以量化不确定性吗?》(Is the Last Layer Sufficient for Uncertainty Quantification?)的研究论文近日在arXiv预印本平台发布。该论文由Joseph Wilson等人撰写,聚焦深度神经网络中的不确定性量化问题。在当前的机器学习实践中,许多模型仅依赖网络最后一层(如softmax输出)来估计预测的不确定性。然而,这种简化方法可能忽略了中间层所蕴含的丰富信息,导致对模型置信度的错误评估。研究团队通过实验和理论分析,系统比较了仅使用最后一层与其他更全面的不确定性量化方法(如贝叶斯神经网络、集成方法等)之间的差异。初步结果表明,仅依靠最后一层往往无法准确捕捉模型在多场景下的认知不确定性,尤其在分布外样本或小数据场景下缺陷更为明显。这项工作为改进模型安全性和可解释性提供了重要参考,对自动驾驶、医疗诊断等高风险应用具有潜在影响。论文目前已开放浏览,并附有代码和数据链接。 #论文 #机器学习 #不确定性量化 #深度学习 #arXiv #AI #模型可解释性 #贝叶斯方法
新方法LARK提升推理蒸馏效率
arXiv上最新发布的研究论文《LARK: Learnability-Grounded Trajectory Selection for Efficient Reasoning Distillation》提出了一种基于可学习性的轨迹选择方法,用于高效推理蒸馏。该方法通过评估不同推理轨迹的“可学习性”,筛选出最有利于模型蒸馏的训练样本,从而显著降低计算成本并提升蒸馏效果。研究团队来自多家机构,实验表明LARK在多个推理任务上优于传统随机或固定策略,为大型语言模型的推理能力迁移提供了更高效的技术路径。 #AI #推理蒸馏 #大模型 #机器学习 #论文 #LARK #arXiv
arXiv上最新发布的研究论文《LARK: Learnability-Grounded Trajectory Selection for Efficient Reasoning Distillation》提出了一种基于可学习性的轨迹选择方法,用于高效推理蒸馏。该方法通过评估不同推理轨迹的“可学习性”,筛选出最有利于模型蒸馏的训练样本,从而显著降低计算成本并提升蒸馏效果。研究团队来自多家机构,实验表明LARK在多个推理任务上优于传统随机或固定策略,为大型语言模型的推理能力迁移提供了更高效的技术路径。 #AI #推理蒸馏 #大模型 #机器学习 #论文 #LARK #arXiv
非均匀光滑性下最速下降与Adam优化算法的收敛性研究
一篇题为《Convergence of Steepest Descent and Adam under Non-Uniform Smoothness》的学术论文近日在arXiv预印本平台发布。该研究由Sharan Vaswani等学者完成,主要探讨在最优化领域广泛使用的两种算法——最速下降法和Adam优化器——在非均匀光滑性条件下的收敛性能。传统理论通常假设目标函数具有全局均匀的光滑性,但实际应用中梯度变化往往不均匀。论文针对这一现实挑战,提出了新的理论分析框架,证明了在更弱的非均匀光滑性假设下,两种算法仍能保持有效的收敛速率,为深度学习模型训练中的优化器选择提供了理论依据。 #arXiv #论文 #机器学习 #优化算法 #收敛性 #非均匀光滑
一篇题为《Convergence of Steepest Descent and Adam under Non-Uniform Smoothness》的学术论文近日在arXiv预印本平台发布。该研究由Sharan Vaswani等学者完成,主要探讨在最优化领域广泛使用的两种算法——最速下降法和Adam优化器——在非均匀光滑性条件下的收敛性能。传统理论通常假设目标函数具有全局均匀的光滑性,但实际应用中梯度变化往往不均匀。论文针对这一现实挑战,提出了新的理论分析框架,证明了在更弱的非均匀光滑性假设下,两种算法仍能保持有效的收敛速率,为深度学习模型训练中的优化器选择提供了理论依据。 #arXiv #论文 #机器学习 #优化算法 #收敛性 #非均匀光滑
扩散模型“偏爱”记忆原型样本,或解释为何生成内容常显低质
一篇来自研究者Marta Aparicio Rodriguez等人的论文揭示了扩散模型的行为特性:这类模型倾向于优先记忆训练数据中的原型样本(即典型、模式化的例子),而非多样性细节。这种“原型记忆偏好”可能导致生成的图像或内容呈现出同质化、重复或低质量的“slop”现象。研究通过实验分析了模型记忆机制,指出该特性源于训练数据分布的不平衡与模型学习策略的偏向。这一发现有助于理解扩散模型在艺术创作、内容生成等应用中频繁产生的“模板化”问题,为改进模型训练方法、提升生成质量提供了理论依据。 #扩散模型 #AI #机器学习 #原型记忆 #生成质量 #arXiv论文
一篇来自研究者Marta Aparicio Rodriguez等人的论文揭示了扩散模型的行为特性:这类模型倾向于优先记忆训练数据中的原型样本(即典型、模式化的例子),而非多样性细节。这种“原型记忆偏好”可能导致生成的图像或内容呈现出同质化、重复或低质量的“slop”现象。研究通过实验分析了模型记忆机制,指出该特性源于训练数据分布的不平衡与模型学习策略的偏向。这一发现有助于理解扩散模型在艺术创作、内容生成等应用中频繁产生的“模板化”问题,为改进模型训练方法、提升生成质量提供了理论依据。 #扩散模型 #AI #机器学习 #原型记忆 #生成质量 #arXiv论文
CSULoRA
一篇题为《CSULoRA: Closest Safe Update Low-Rank Adaptation》的论文近日在arXiv上发布。该研究针对大模型微调中的低秩适应(LoRA)技术进行改进,提出一种名为“最接近安全更新”的新策略。传统LoRA通过低秩矩阵更新模型参数,但可能引入不稳定性或偏离原始模型过远。CSULoRA旨在在保持更新效率的同时,确保更新方向与原始模型尽可能接近,从而提升微调过程的安全性和可靠性。该方法有望在保持模型性能的前提下,降低微调带来的风险,尤其适用于对模型稳定性要求较高的应用场景。论文作者来自多个机构,目前尚未公开代码,但已提供PDF预览。 #CSULoRA #低秩适应 #模型微调 #AI安全 #机器学习 #arXiv #大模型
一篇题为《CSULoRA: Closest Safe Update Low-Rank Adaptation》的论文近日在arXiv上发布。该研究针对大模型微调中的低秩适应(LoRA)技术进行改进,提出一种名为“最接近安全更新”的新策略。传统LoRA通过低秩矩阵更新模型参数,但可能引入不稳定性或偏离原始模型过远。CSULoRA旨在在保持更新效率的同时,确保更新方向与原始模型尽可能接近,从而提升微调过程的安全性和可靠性。该方法有望在保持模型性能的前提下,降低微调带来的风险,尤其适用于对模型稳定性要求较高的应用场景。论文作者来自多个机构,目前尚未公开代码,但已提供PDF预览。 #CSULoRA #低秩适应 #模型微调 #AI安全 #机器学习 #arXiv #大模型
分数广播与去相关
一篇题为《Score Broadcast and Decorrelation: A General Framework for Broadcast-Based Credit Assignment》的研究论文于2026年5月28日提交至arXiv预印本平台。该论文由Mustafa Uzun等四位研究者共同完成,提出了一种名为“分数广播与去相关”的通用框架,旨在解决深度强化学习和神经网络训练中的信用分配问题。信用分配是指如何将全局奖励信号准确归因于各步骤或各参数的贡献,传统方法往往面临高方差或计算瓶颈。该框架通过广播机制分发“分数”信号,并利用去相关技术消除冗余信息,从而更高效地评估每个决策或参数的影响。实验表明,该方法在多个基准任务上显著提升了训练稳定性和收敛速度,为多智能体系统和复杂序列决策提供了新的理论工具。 #论文 #AI #强化学习 #信用分配 #深度神经网络 #arXiv #学术研究
一篇题为《Score Broadcast and Decorrelation: A General Framework for Broadcast-Based Credit Assignment》的研究论文于2026年5月28日提交至arXiv预印本平台。该论文由Mustafa Uzun等四位研究者共同完成,提出了一种名为“分数广播与去相关”的通用框架,旨在解决深度强化学习和神经网络训练中的信用分配问题。信用分配是指如何将全局奖励信号准确归因于各步骤或各参数的贡献,传统方法往往面临高方差或计算瓶颈。该框架通过广播机制分发“分数”信号,并利用去相关技术消除冗余信息,从而更高效地评估每个决策或参数的影响。实验表明,该方法在多个基准任务上显著提升了训练稳定性和收敛速度,为多智能体系统和复杂序列决策提供了新的理论工具。 #论文 #AI #强化学习 #信用分配 #深度神经网络 #arXiv #学术研究
CellBRIDGE
该论文提出了一种名为CellBRIDGE的新方法,旨在通过学习细胞间的交互作用来重建细胞动态轨迹。细胞轨迹分析对于理解发育、疾病进展和细胞分化至关重要,但传统方法往往忽略了细胞之间的相互作用信息。CellBRIDGE通过交互感知对齐技术,将单细胞数据中的时间序列与细胞间通信信号相结合,从而更准确地推断细胞状态变化路径。实验表明,该方法在多个真实数据集上优于现有基线,能够揭示更精细的细胞命运决定机制。该研究已被ICML 2026接收,为单细胞生物学和再生医学提供了新的计算工具。 #CellBRIDGE #细胞轨迹 #交互感知 #单细胞 #机器学习 #ICML2026 #生物信息学 #计算生物学 #AI
该论文提出了一种名为CellBRIDGE的新方法,旨在通过学习细胞间的交互作用来重建细胞动态轨迹。细胞轨迹分析对于理解发育、疾病进展和细胞分化至关重要,但传统方法往往忽略了细胞之间的相互作用信息。CellBRIDGE通过交互感知对齐技术,将单细胞数据中的时间序列与细胞间通信信号相结合,从而更准确地推断细胞状态变化路径。实验表明,该方法在多个真实数据集上优于现有基线,能够揭示更精细的细胞命运决定机制。该研究已被ICML 2026接收,为单细胞生物学和再生医学提供了新的计算工具。 #CellBRIDGE #细胞轨迹 #交互感知 #单细胞 #机器学习 #ICML2026 #生物信息学 #计算生物学 #AI
Active Timepoint Selection for Learning Measure-Valued Trajectories
该论文由Nicolas Huynh等人于2026年5月28日提交至arXiv预印本平台,标题为《Active Timepoint Selection for Learning Measure-Valued Trajectories》。研究聚焦于如何通过主动选择关键时间点,高效学习随时间演化的测度值轨迹。这类轨迹常见于动态系统建模、人口迁移、粒子流等场景,传统方法往往依赖均匀采样或被动观测,数据利用率较低。论文提出一种主动时间点选择策略,旨在以更少的采样点获取更准确的轨迹学习结果,从而降低数据采集成本并提升模型性能。该工作可能对时序数据分析、主动学习及科学计算等领域产生积极影响。 #arXiv #主动学习 #测度值轨迹 #时间序列 #机器学习 #动态系统 #数据效率 #NicolasHuynh
该论文由Nicolas Huynh等人于2026年5月28日提交至arXiv预印本平台,标题为《Active Timepoint Selection for Learning Measure-Valued Trajectories》。研究聚焦于如何通过主动选择关键时间点,高效学习随时间演化的测度值轨迹。这类轨迹常见于动态系统建模、人口迁移、粒子流等场景,传统方法往往依赖均匀采样或被动观测,数据利用率较低。论文提出一种主动时间点选择策略,旨在以更少的采样点获取更准确的轨迹学习结果,从而降低数据采集成本并提升模型性能。该工作可能对时序数据分析、主动学习及科学计算等领域产生积极影响。 #arXiv #主动学习 #测度值轨迹 #时间序列 #机器学习 #动态系统 #数据效率 #NicolasHuynh
改进二分类选择性分类的成对查询方法
来自 arXiv 的一篇研究论文提出了通过成对查询改进二分类任务中选择性分类的新方法。选择性分类允许模型在置信度不足时拒绝预测,从而提高系统可靠性。传统方法通常依赖单一样本的置信度阈值,而该研究创新性地引入成对查询机制,通过比较两个样本的相对置信度来做出更精准的拒绝决策。该方法在理论分析上证明了其有效性,并在多个标准二分类数据集上进行了实验验证,结果显示相比基线方法,在保持较高覆盖率的情况下显著降低了错误率。这项研究为高可靠性机器学习系统的构建提供了新思路,尤其适用于医疗诊断、金融风控等对错误敏感的场景。 #论文 #机器学习 #分类 #选择性分类 #二分类 #成对查询 #AI #研究 #arXiv
来自 arXiv 的一篇研究论文提出了通过成对查询改进二分类任务中选择性分类的新方法。选择性分类允许模型在置信度不足时拒绝预测,从而提高系统可靠性。传统方法通常依赖单一样本的置信度阈值,而该研究创新性地引入成对查询机制,通过比较两个样本的相对置信度来做出更精准的拒绝决策。该方法在理论分析上证明了其有效性,并在多个标准二分类数据集上进行了实验验证,结果显示相比基线方法,在保持较高覆盖率的情况下显著降低了错误率。这项研究为高可靠性机器学习系统的构建提供了新思路,尤其适用于医疗诊断、金融风控等对错误敏感的场景。 #论文 #机器学习 #分类 #选择性分类 #二分类 #成对查询 #AI #研究 #arXiv
分子设计中的约束流优化
一篇发表于arXiv的论文提出了一种名为“Constrained Flow Optimization via Sequential Fine Tuning”的新方法,用于分子设计。该方法通过序列微调技术,在满足特定约束条件(如化学性质、结构稳定性等)的前提下,优化分子生成流模型。研究团队由Sven Gutjahr等五位作者组成,论文于2026年5月28日提交。该工作旨在解决传统分子生成模型难以同时兼顾多样性与约束满足的问题,通过逐步微调策略提升生成分子的有效性和可优化性,为药物发现和材料科学提供了新的计算工具。 #分子设计 #流模型 #序列微调 #约束优化 #arXiv #计算化学 #药物发现
一篇发表于arXiv的论文提出了一种名为“Constrained Flow Optimization via Sequential Fine Tuning”的新方法,用于分子设计。该方法通过序列微调技术,在满足特定约束条件(如化学性质、结构稳定性等)的前提下,优化分子生成流模型。研究团队由Sven Gutjahr等五位作者组成,论文于2026年5月28日提交。该工作旨在解决传统分子生成模型难以同时兼顾多样性与约束满足的问题,通过逐步微调策略提升生成分子的有效性和可优化性,为药物发现和材料科学提供了新的计算工具。 #分子设计 #流模型 #序列微调 #约束优化 #arXiv #计算化学 #药物发现
AMNESIA
近日,arXiv 上公开了一篇题为《AMNESIA: A Large Scale Medical Unlearning Benchmark Suite with Disease-Informed Analysis》的论文。该研究由 Saeedeh Davoudi 等人提出,旨在构建一个大规模、病种信息驱动的医学遗忘学习基准测试套件。遗忘学习是机器学习领域的重要方向,旨在让模型“忘记”特定训练数据,以应对隐私保护和模型更新等需求。医学数据因其高度敏感性,对遗忘学习技术的要求尤为严格。AMNESIA 基准套件通过整合多种疾病信息,提供了标准化的评估框架,用于测试和比较不同遗忘学习算法在医学场景下的表现。该工作有望推动医学人工智能在隐私合规、数据去敏和模型鲁棒性方面的研究进展。 #医学AI #遗忘学习 #基准测试 #AMNESIA #arXiv #论文 #AI隐私
近日,arXiv 上公开了一篇题为《AMNESIA: A Large Scale Medical Unlearning Benchmark Suite with Disease-Informed Analysis》的论文。该研究由 Saeedeh Davoudi 等人提出,旨在构建一个大规模、病种信息驱动的医学遗忘学习基准测试套件。遗忘学习是机器学习领域的重要方向,旨在让模型“忘记”特定训练数据,以应对隐私保护和模型更新等需求。医学数据因其高度敏感性,对遗忘学习技术的要求尤为严格。AMNESIA 基准套件通过整合多种疾病信息,提供了标准化的评估框架,用于测试和比较不同遗忘学习算法在医学场景下的表现。该工作有望推动医学人工智能在隐私合规、数据去敏和模型鲁棒性方面的研究进展。 #医学AI #遗忘学习 #基准测试 #AMNESIA #arXiv #论文 #AI隐私
ScaleMAP
来自乔治亚理工学院的研究人员Rajas Poorna与Marcus T. Cicerone在arXiv上提交了题为“ScaleMAP: Preserving Local Density and Neighborhood Structure in Low-Dimensional Embeddings”的论文。该工作针对现有降维方法在低维映射中常扭曲局部密度和邻域结构的问题,提出了一种名为ScaleMAP的新算法。ScaleMAP通过优化嵌入过程中的尺度信息,在保持全局结构的同时更精确地保留数据的局部密度特征和邻域关系。实验表明,该方法在合成与真实数据集上均优于t-SNE和UMAP等经典技术,尤其适用于需要高保真局部层次结构的可视化与聚类任务。该成果有望提升单细胞测序、网络分析等领域的可解释性。 #论文 #降维 #局部密度 #邻域结构 #数据可视化 #机器学习 #ScaleMAP #arXiv
来自乔治亚理工学院的研究人员Rajas Poorna与Marcus T. Cicerone在arXiv上提交了题为“ScaleMAP: Preserving Local Density and Neighborhood Structure in Low-Dimensional Embeddings”的论文。该工作针对现有降维方法在低维映射中常扭曲局部密度和邻域结构的问题,提出了一种名为ScaleMAP的新算法。ScaleMAP通过优化嵌入过程中的尺度信息,在保持全局结构的同时更精确地保留数据的局部密度特征和邻域关系。实验表明,该方法在合成与真实数据集上均优于t-SNE和UMAP等经典技术,尤其适用于需要高保真局部层次结构的可视化与聚类任务。该成果有望提升单细胞测序、网络分析等领域的可解释性。 #论文 #降维 #局部密度 #邻域结构 #数据可视化 #机器学习 #ScaleMAP #arXiv
科学机器学习在发动机健康管理与剩余使用寿命预测中的应用
一篇题为《科学机器学习在发动机健康管理与剩余使用寿命预测中的应用》的论文在arXiv预印本平台提交。该研究聚焦于利用科学机器学习方法,结合物理模型与数据驱动技术,对发动机运行状态进行实时监测,并准确预测其剩余使用寿命。发动机健康管理是航空、汽车等工业领域的关键环节,准确的剩余寿命预测有助于优化维护计划、降低运营成本并提升安全性。论文作者来自相关研究机构,论文详细介绍了所提出的框架、实验设置及性能评估结果,展示了科学机器学习在复杂工程系统预测维护中的潜力。 #科学机器学习 #发动机健康管理 #剩余使用寿命预测 #arXiv #论文 #机器学习 #预测维护 #工程应用
一篇题为《科学机器学习在发动机健康管理与剩余使用寿命预测中的应用》的论文在arXiv预印本平台提交。该研究聚焦于利用科学机器学习方法,结合物理模型与数据驱动技术,对发动机运行状态进行实时监测,并准确预测其剩余使用寿命。发动机健康管理是航空、汽车等工业领域的关键环节,准确的剩余寿命预测有助于优化维护计划、降低运营成本并提升安全性。论文作者来自相关研究机构,论文详细介绍了所提出的框架、实验设置及性能评估结果,展示了科学机器学习在复杂工程系统预测维护中的潜力。 #科学机器学习 #发动机健康管理 #剩余使用寿命预测 #arXiv #论文 #机器学习 #预测维护 #工程应用
学习可迁移的可预测性表示
来自arXiv的一篇预印本论文《Learning Transferable Predictability Representations》由Diyali Goswami和Auroop R. Ganguly共同撰写。该研究聚焦于如何从数据中学习能够跨任务或领域迁移的可预测性表示,旨在提升模型在不同场景下对时间序列或序列数据未来状态的预测能力。论文提出了一种新的表示学习方法,通过捕捉数据内在的可预测性结构,使得学到的特征能够有效迁移到其他相关但分布不同的任务中,从而减少对大量标注数据的依赖。这项工作有望在天气预报、金融分析、工业监控等需要时序预测的领域产生应用价值,为迁移学习与可预测性建模的结合提供了新思路。 #机器学习 #表示学习 #可预测性 #迁移学习 #时间序列 #AI #论文 #arXiv
来自arXiv的一篇预印本论文《Learning Transferable Predictability Representations》由Diyali Goswami和Auroop R. Ganguly共同撰写。该研究聚焦于如何从数据中学习能够跨任务或领域迁移的可预测性表示,旨在提升模型在不同场景下对时间序列或序列数据未来状态的预测能力。论文提出了一种新的表示学习方法,通过捕捉数据内在的可预测性结构,使得学到的特征能够有效迁移到其他相关但分布不同的任务中,从而减少对大量标注数据的依赖。这项工作有望在天气预报、金融分析、工业监控等需要时序预测的领域产生应用价值,为迁移学习与可预测性建模的结合提供了新思路。 #机器学习 #表示学习 #可预测性 #迁移学习 #时间序列 #AI #论文 #arXiv
反事实评估揭示临床大语言模型与智能体的隐藏能力轮廓
一项最新研究通过反事实评估方法,系统揭示了临床大语言模型(LLMs)及其智能体在医疗场景中的隐藏能力轮廓。研究团队设计了一系列反事实测试,模拟患者病史、症状描述或治疗方案的细微变化,以检验模型在不同临床决策中的鲁棒性和潜在偏差。结果表明,当前主流临床LLMs在面对反事实扰动时表现出显著的能力波动,部分模型在标准测试中表现良好,但在反事实情境下暴露出推理漏洞或偏见。该发现强调了传统评估指标的局限性,并指出反事实评估能更真实地反映模型在复杂临床环境中的实际表现。研究为未来临床AI系统的安全部署和可靠性验证提供了新思路,有助于避免因模型隐藏缺陷导致的医疗误判。 #反事实评估 #临床大语言模型 #AI安全 #医疗AI #模型鲁棒性 #arXiv论文
一项最新研究通过反事实评估方法,系统揭示了临床大语言模型(LLMs)及其智能体在医疗场景中的隐藏能力轮廓。研究团队设计了一系列反事实测试,模拟患者病史、症状描述或治疗方案的细微变化,以检验模型在不同临床决策中的鲁棒性和潜在偏差。结果表明,当前主流临床LLMs在面对反事实扰动时表现出显著的能力波动,部分模型在标准测试中表现良好,但在反事实情境下暴露出推理漏洞或偏见。该发现强调了传统评估指标的局限性,并指出反事实评估能更真实地反映模型在复杂临床环境中的实际表现。研究为未来临床AI系统的安全部署和可靠性验证提供了新思路,有助于避免因模型隐藏缺陷导致的医疗误判。 #反事实评估 #临床大语言模型 #AI安全 #医疗AI #模型鲁棒性 #arXiv论文