Set Diffusion: 插值自回归与扩散的Token排序,实现快速灵活解码
一篇发表在arXiv上的论文《Set Diffusion》提出了一种新颖的生成模型方法,通过在自回归(AR)和扩散模型(DM)之间插值token的排序顺序,实现更快且更灵活的解码。自回归模型逐token生成,速度瓶颈明显;扩散模型并行生成但质量与效率难以平衡。该工作引入“set diffusion”框架,将生成过程视为对一组无序token的概率建模,并允许在生成过程中动态调整排序策略,从而在解码速度与生成质量之间取得折中。实验验证了该方法在多种文本和序列生成任务上的有效性,相比纯自回归或扩散基线,在保持高保真度的同时显著提升了推理效率。这项研究为未来生成模型的设计提供了新的混合范式。 #AI #深度学习 #生成模型 #自回归 #扩散模型 #论文 #机器学习 #自然语言处理
一篇发表在arXiv上的论文《Set Diffusion》提出了一种新颖的生成模型方法,通过在自回归(AR)和扩散模型(DM)之间插值token的排序顺序,实现更快且更灵活的解码。自回归模型逐token生成,速度瓶颈明显;扩散模型并行生成但质量与效率难以平衡。该工作引入“set diffusion”框架,将生成过程视为对一组无序token的概率建模,并允许在生成过程中动态调整排序策略,从而在解码速度与生成质量之间取得折中。实验验证了该方法在多种文本和序列生成任务上的有效性,相比纯自回归或扩散基线,在保持高保真度的同时显著提升了推理效率。这项研究为未来生成模型的设计提供了新的混合范式。 #AI #深度学习 #生成模型 #自回归 #扩散模型 #论文 #机器学习 #自然语言处理
研究揭示持续后训练中在线自蒸馏的密度并非越高越好
来自arXiv的一篇论文《Denser ≠ Better: Limits of On-Policy Self-Distillation for Continual Post-Training》由Meng Wang等作者提出。该研究针对持续后训练场景下的在线自蒸馏方法进行深入分析,发现增加蒸馏密度并不总是带来性能提升,反而存在性能上限和潜在退化。实验表明,过度密集的蒸馏可能导致模型过拟合或遗忘先前知识,从而限制了持续学习的效果。这一发现为优化大模型的后训练策略提供了重要参考,提示研究者需谨慎选择蒸馏密度。 #论文 #持续学习 #自蒸馏 #机器学习 #AI #大模型 #后训练 #研究 #arXiv
来自arXiv的一篇论文《Denser ≠ Better: Limits of On-Policy Self-Distillation for Continual Post-Training》由Meng Wang等作者提出。该研究针对持续后训练场景下的在线自蒸馏方法进行深入分析,发现增加蒸馏密度并不总是带来性能提升,反而存在性能上限和潜在退化。实验表明,过度密集的蒸馏可能导致模型过拟合或遗忘先前知识,从而限制了持续学习的效果。这一发现为优化大模型的后训练策略提供了重要参考,提示研究者需谨慎选择蒸馏密度。 #论文 #持续学习 #自蒸馏 #机器学习 #AI #大模型 #后训练 #研究 #arXiv
新论文提出角色感知神经凸散度头用于非对称表示学习
据arXiv预印本平台显示,一篇由He Huang等四位作者共同撰写的论文《Role-Aware Neural Convex Divergence Heads for Asymmetric Representation Learning》于2026年7月2日提交。该研究针对非对称表示学习场景,提出一种名为“角色感知神经凸散度头”的新方法,通过引入角色区分机制与凸散度优化头,旨在提升模型在不对称数据分布下的表征能力。论文涉及计算机科学和统计学领域,当前浏览上下文标记为cs和stat类别,并已提供PDF、HTML及TeX源文件。该工作获得了NASA ADS、Google Scholar等学术工具的引用支持,并关联了代码、数据及媒体资源。这一方法有望为机器学习中的不对称问题提供新的解决思路,尤其在对抗性学习、推荐系统等需要角色建模的应用中具有潜在价值。 #机器学习 #表示学习 #arXiv #论文 #AI #非对称学习 #角色感知 #凸散度 #深度学习
据arXiv预印本平台显示,一篇由He Huang等四位作者共同撰写的论文《Role-Aware Neural Convex Divergence Heads for Asymmetric Representation Learning》于2026年7月2日提交。该研究针对非对称表示学习场景,提出一种名为“角色感知神经凸散度头”的新方法,通过引入角色区分机制与凸散度优化头,旨在提升模型在不对称数据分布下的表征能力。论文涉及计算机科学和统计学领域,当前浏览上下文标记为cs和stat类别,并已提供PDF、HTML及TeX源文件。该工作获得了NASA ADS、Google Scholar等学术工具的引用支持,并关联了代码、数据及媒体资源。这一方法有望为机器学习中的不对称问题提供新的解决思路,尤其在对抗性学习、推荐系统等需要角色建模的应用中具有潜在价值。 #机器学习 #表示学习 #arXiv #论文 #AI #非对称学习 #角色感知 #凸散度 #深度学习
潜在世界模型闭环性能预测:面向非马尔可夫奖励的离线检查点选择方法
该研究提出一种预测潜在世界模型闭环性能的方法,用于在非马尔可夫奖励场景下进行模型预测控制(MPC)和基于模型的强化学习中的离线检查点选择。研究以LunarLander环境为测试平台,通过分析不同训练阶段的模型检查点,评估其在闭环控制中的实际表现。作者Nikolai Smolyanskiy在arXiv上提交的论文详细阐述了如何利用离线指标预测模型在真实交互中的性能,从而避免昂贵的在线评估。该方法有望提升模型选择效率,推动潜在世界模型在复杂控制任务中的应用。 #机器学习 #强化学习 #世界模型 #MPC #LunarLander #非马尔可夫奖励 #离线检查点 #arXiv #论文
该研究提出一种预测潜在世界模型闭环性能的方法,用于在非马尔可夫奖励场景下进行模型预测控制(MPC)和基于模型的强化学习中的离线检查点选择。研究以LunarLander环境为测试平台,通过分析不同训练阶段的模型检查点,评估其在闭环控制中的实际表现。作者Nikolai Smolyanskiy在arXiv上提交的论文详细阐述了如何利用离线指标预测模型在真实交互中的性能,从而避免昂贵的在线评估。该方法有望提升模型选择效率,推动潜在世界模型在复杂控制任务中的应用。 #机器学习 #强化学习 #世界模型 #MPC #LunarLander #非马尔可夫奖励 #离线检查点 #arXiv #论文
编程示例中的固定集鲁棒性
一篇题为《编程示例中的固定集鲁棒性:示例破坏与语义分区恢复》的学术论文已通过arXiv平台发布。该研究由Yuan Si等人完成,主要探讨在编程示例(Programming by Example)场景下,当输入示例受到破坏或干扰时,如何保持系统的鲁棒性。论文提出了一种通过语义分区恢复的方法,旨在应对示例数据中的噪声和错误,从而提升编程示例系统的稳定性和准确性。该研究对于理解机器学习中示例数据的脆弱性以及设计更可靠的自动化编程工具具有重要意义。论文全文可通过arXiv获取,并支持HTML、TeX源码等多种查看方式。 #编程示例 #鲁棒性 #语义分区 #机器学习 #arXiv #学术论文 #计算机科学
一篇题为《编程示例中的固定集鲁棒性:示例破坏与语义分区恢复》的学术论文已通过arXiv平台发布。该研究由Yuan Si等人完成,主要探讨在编程示例(Programming by Example)场景下,当输入示例受到破坏或干扰时,如何保持系统的鲁棒性。论文提出了一种通过语义分区恢复的方法,旨在应对示例数据中的噪声和错误,从而提升编程示例系统的稳定性和准确性。该研究对于理解机器学习中示例数据的脆弱性以及设计更可靠的自动化编程工具具有重要意义。论文全文可通过arXiv获取,并支持HTML、TeX源码等多种查看方式。 #编程示例 #鲁棒性 #语义分区 #机器学习 #arXiv #学术论文 #计算机科学
基于领域知识的时空图卷积网络用于心电图识别研究发布
一篇题为《基于领域知识的时空图卷积网络用于心电图识别》的论文近日在arXiv预印本平台公开。该研究由Wenting Ma等8位作者完成,已被国际会议ICONIP 2024收录,并将发表于Springer LNCS系列丛书。论文提出了一种融合医学领域知识的时空图卷积网络(Temporal-Spatial Graph Convolution Network),通过同时建模心电图信号的时间动态与空间导联关系,并结合临床先验知识,显著提升了心电异常识别的准确率。该方法为心电信号自动分析提供了新的技术路径,有望辅助临床诊断。 #ECG #心电图 #图卷积网络 #时空图 #领域知识 #ICONIP2024 #人工智能 #医疗AI #论文
一篇题为《基于领域知识的时空图卷积网络用于心电图识别》的论文近日在arXiv预印本平台公开。该研究由Wenting Ma等8位作者完成,已被国际会议ICONIP 2024收录,并将发表于Springer LNCS系列丛书。论文提出了一种融合医学领域知识的时空图卷积网络(Temporal-Spatial Graph Convolution Network),通过同时建模心电图信号的时间动态与空间导联关系,并结合临床先验知识,显著提升了心电异常识别的准确率。该方法为心电信号自动分析提供了新的技术路径,有望辅助临床诊断。 #ECG #心电图 #图卷积网络 #时空图 #领域知识 #ICONIP2024 #人工智能 #医疗AI #论文
黑盒推断LLM架构属性
一篇题为《Black-Box Inference of LLM Architectural Properties with Restrictive API Access》的论文引发关注。研究团队提出一种方法,仅通过受限的API访问(如仅能获取文本输出),即可推断出大语言模型的内部架构属性,包括层数、隐藏维度、注意力头数等关键参数。该方法利用模型输出中的统计特征与计算模式,无需访问模型权重或内部状态。这一发现对AI安全与透明度具有重要意义:一方面,它可能帮助用户验证模型声称的架构;另一方面,也暴露了模型供应商面临的信息泄露风险。研究已在arXiv上发布,并提供了完整论文与代码链接。 #LLM #AI安全 #模型逆向 #黑盒推断 #arXiv #人工智能 #大模型
一篇题为《Black-Box Inference of LLM Architectural Properties with Restrictive API Access》的论文引发关注。研究团队提出一种方法,仅通过受限的API访问(如仅能获取文本输出),即可推断出大语言模型的内部架构属性,包括层数、隐藏维度、注意力头数等关键参数。该方法利用模型输出中的统计特征与计算模式,无需访问模型权重或内部状态。这一发现对AI安全与透明度具有重要意义:一方面,它可能帮助用户验证模型声称的架构;另一方面,也暴露了模型供应商面临的信息泄露风险。研究已在arXiv上发布,并提供了完整论文与代码链接。 #LLM #AI安全 #模型逆向 #黑盒推断 #arXiv #人工智能 #大模型
Transformer 如何编码电子健康记录中的数值
一篇题为《How Should Transformers Encode Numeric Values in Electronic Health Records?》的学术论文在 arXiv 上发布。该研究聚焦于 Transformer 模型在处理电子健康记录(EHR)时,如何有效编码其中的数值型数据。数值编码方式直接影响模型对患者生命体征、实验室检查结果等关键信息的理解与预测能力。论文系统比较了多种编码策略(如直接输入、分箱、归一化、位置编码等),并评估了不同方法在临床预测任务中的表现。研究旨在为医疗 AI 领域提供数值编码的最佳实践,提升 Transformer 在 EHR 数据上的建模效果与可解释性。 #Transformer #电子健康记录 #数值编码 #AI #医疗 #论文 #arXiv #深度学习
一篇题为《How Should Transformers Encode Numeric Values in Electronic Health Records?》的学术论文在 arXiv 上发布。该研究聚焦于 Transformer 模型在处理电子健康记录(EHR)时,如何有效编码其中的数值型数据。数值编码方式直接影响模型对患者生命体征、实验室检查结果等关键信息的理解与预测能力。论文系统比较了多种编码策略(如直接输入、分箱、归一化、位置编码等),并评估了不同方法在临床预测任务中的表现。研究旨在为医疗 AI 领域提供数值编码的最佳实践,提升 Transformer 在 EHR 数据上的建模效果与可解释性。 #Transformer #电子健康记录 #数值编码 #AI #医疗 #论文 #arXiv #深度学习
NeuroBridge:融合多任务MRI知识诊断神经退行性疾病
近日,一篇题为《NeuroBridge: Bridging Multi-Task MRI Knowledge for Neurodegenerative Disease Diagnosis》的论文由Mengyu Li等人提交至arXiv预印本平台。该研究提出了一种名为NeuroBridge的框架,旨在通过多任务磁共振成像(MRI)知识融合,提升对阿尔茨海默病等神经退行性疾病的诊断准确性。传统单一模态MRI难以全面捕捉病变特征,而NeuroBridge通过多任务学习整合不同MRI序列的互补信息,增强了模型对脑结构异常的表征能力。实验结果显示,该方法在多个公开数据集上取得了更优的诊断性能,有望为临床早期筛查和精准诊断提供新的辅助工具。 #NeuroBridge #多任务学习 #MRI #神经退行性疾病 #医学影像 #人工智能 #arXiv #诊断 #深度学习
近日,一篇题为《NeuroBridge: Bridging Multi-Task MRI Knowledge for Neurodegenerative Disease Diagnosis》的论文由Mengyu Li等人提交至arXiv预印本平台。该研究提出了一种名为NeuroBridge的框架,旨在通过多任务磁共振成像(MRI)知识融合,提升对阿尔茨海默病等神经退行性疾病的诊断准确性。传统单一模态MRI难以全面捕捉病变特征,而NeuroBridge通过多任务学习整合不同MRI序列的互补信息,增强了模型对脑结构异常的表征能力。实验结果显示,该方法在多个公开数据集上取得了更优的诊断性能,有望为临床早期筛查和精准诊断提供新的辅助工具。 #NeuroBridge #多任务学习 #MRI #神经退行性疾病 #医学影像 #人工智能 #arXiv #诊断 #深度学习