基于多臂老虎机的深度神经网络结构化神经元剪枝
一篇题为《基于多臂老虎机的深度神经网络结构化神经元剪枝》的学术论文近日在arXiv预印本平台发布。该研究由Salem Ameen等人完成,提出了一种利用多臂老虎机算法对深度神经网络进行结构化神经元剪枝的新方法。该方法旨在通过强化学习策略,在保持模型性能的同时,有效减少网络中的冗余神经元,从而降低计算复杂度和存储需求。论文详细阐述了算法的设计原理、实现过程,并通过实验验证了其在多种神经网络架构上的有效性。该研究为深度学习模型的压缩与加速提供了新的思路,有望推动边缘计算和移动设备上高效AI模型的部署。 #深度学习 #神经网络剪枝 #多臂老虎机 #模型压缩 #AI #arXiv #学术论文
一篇题为《基于多臂老虎机的深度神经网络结构化神经元剪枝》的学术论文近日在arXiv预印本平台发布。该研究由Salem Ameen等人完成,提出了一种利用多臂老虎机算法对深度神经网络进行结构化神经元剪枝的新方法。该方法旨在通过强化学习策略,在保持模型性能的同时,有效减少网络中的冗余神经元,从而降低计算复杂度和存储需求。论文详细阐述了算法的设计原理、实现过程,并通过实验验证了其在多种神经网络架构上的有效性。该研究为深度学习模型的压缩与加速提供了新的思路,有望推动边缘计算和移动设备上高效AI模型的部署。 #深度学习 #神经网络剪枝 #多臂老虎机 #模型压缩 #AI #arXiv #学术论文
Query Lens
一篇题为《Query Lens: Interpreting Sparse Key-Value Features with Indirect Effects》的学术论文近日在arXiv上发布。该研究由Hwiyeong Lee等四位作者共同完成,提出了一种名为“Query Lens”的可解释性框架,旨在通过间接效应分析,更清晰地揭示大语言模型中稀疏键值特征的语义含义。传统方法在解析注意力机制时往往忽略特征间的间接影响,而Query Lens通过建模因果路径,能够识别出哪些稀疏特征对模型输出具有实质贡献。这一方法有助于提升对Transformer内部运作的理解,为模型安全、调试和可控生成提供新工具。论文已开放PDF全文及实验代码,相关结果可复现。 #人工智能 #大模型 #可解释性 #QueryLens #稀疏特征 #间接效应 #Transformer #AI安全
一篇题为《Query Lens: Interpreting Sparse Key-Value Features with Indirect Effects》的学术论文近日在arXiv上发布。该研究由Hwiyeong Lee等四位作者共同完成,提出了一种名为“Query Lens”的可解释性框架,旨在通过间接效应分析,更清晰地揭示大语言模型中稀疏键值特征的语义含义。传统方法在解析注意力机制时往往忽略特征间的间接影响,而Query Lens通过建模因果路径,能够识别出哪些稀疏特征对模型输出具有实质贡献。这一方法有助于提升对Transformer内部运作的理解,为模型安全、调试和可控生成提供新工具。论文已开放PDF全文及实验代码,相关结果可复现。 #人工智能 #大模型 #可解释性 #QueryLens #稀疏特征 #间接效应 #Transformer #AI安全
图神经网络预测有限群可解性研究取得新进展
近日,一篇题为《Graph Neural Networks for Predicting Solvability of Finite Groups》的论文在arXiv上发布。该研究由Tal Weissblat完成,探索利用图神经网络(GNN)预测有限群的可解性。有限群的可解性是群论中的经典问题,传统方法依赖代数结构分析,计算复杂度较高。论文提出将群结构表示为图,并训练GNN模型进行二分类预测,旨在通过机器学习方法加速群论中的判定任务。实验表明,该方法在特定数据集上取得了较高准确率,为代数与深度学习的交叉研究提供了新思路。该工作有望推动群论在密码学、量子计算等领域的应用。 #图神经网络 #有限群 #可解性 #群论 #机器学习 #AI #数学 #arXiv
近日,一篇题为《Graph Neural Networks for Predicting Solvability of Finite Groups》的论文在arXiv上发布。该研究由Tal Weissblat完成,探索利用图神经网络(GNN)预测有限群的可解性。有限群的可解性是群论中的经典问题,传统方法依赖代数结构分析,计算复杂度较高。论文提出将群结构表示为图,并训练GNN模型进行二分类预测,旨在通过机器学习方法加速群论中的判定任务。实验表明,该方法在特定数据集上取得了较高准确率,为代数与深度学习的交叉研究提供了新思路。该工作有望推动群论在密码学、量子计算等领域的应用。 #图神经网络 #有限群 #可解性 #群论 #机器学习 #AI #数学 #arXiv
HASA:面向计算受限的异构模型联邦学习子网分配方案
一篇题为《HASA:面向计算受限的异构模型联邦学习子网分配》的学术论文在arXiv平台发布。该研究由Amir Hossein Shahdadian等五位作者共同完成,主要针对联邦学习中客户端计算资源异构且模型结构不同的场景,提出了一种子网分配策略。该方法旨在解决在计算受限条件下,如何高效地为各客户端分配子网络,以平衡模型训练性能与资源消耗。论文通过理论分析与实验验证,展示了HASA方案在提升联邦学习收敛速度和模型精度方面的有效性,为异构联邦学习的实际部署提供了新思路。 #联邦学习 #异构计算 #子网分配 #机器学习 #AI #学术论文 #arXiv
一篇题为《HASA:面向计算受限的异构模型联邦学习子网分配》的学术论文在arXiv平台发布。该研究由Amir Hossein Shahdadian等五位作者共同完成,主要针对联邦学习中客户端计算资源异构且模型结构不同的场景,提出了一种子网分配策略。该方法旨在解决在计算受限条件下,如何高效地为各客户端分配子网络,以平衡模型训练性能与资源消耗。论文通过理论分析与实验验证,展示了HASA方案在提升联邦学习收敛速度和模型精度方面的有效性,为异构联邦学习的实际部署提供了新思路。 #联邦学习 #异构计算 #子网分配 #机器学习 #AI #学术论文 #arXiv
大语言模型的序贯统计推断
该研究由Yao Xie提交至arXiv预印本平台,探讨面向大语言模型(LLM)的序贯统计推断方法。论文聚焦于三个核心维度:模型表示、推断有效性和实时监控技术,旨在为LLM的输出提供一种动态、可靠的统计评估框架。序贯统计推断能够在不依赖完整数据集的情况下,逐步更新估计并做出决策,这对于需要持续反馈和自适应调节的LLM应用场景尤为关键。研究者可能提出了新的理论或算法,以提升模型在推理过程中的稳定性和准确性。该工作尚处于预印本阶段,后续将经过同行评审及数据库注册。论文的进一步发布有望推动LLM在统计推断领域的规范化和实用化。 #大语言模型 #统计推断 #序贯分析 #机器学习 #AI #论文预印本 #模型监控 #表示学习
该研究由Yao Xie提交至arXiv预印本平台,探讨面向大语言模型(LLM)的序贯统计推断方法。论文聚焦于三个核心维度:模型表示、推断有效性和实时监控技术,旨在为LLM的输出提供一种动态、可靠的统计评估框架。序贯统计推断能够在不依赖完整数据集的情况下,逐步更新估计并做出决策,这对于需要持续反馈和自适应调节的LLM应用场景尤为关键。研究者可能提出了新的理论或算法,以提升模型在推理过程中的稳定性和准确性。该工作尚处于预印本阶段,后续将经过同行评审及数据库注册。论文的进一步发布有望推动LLM在统计推断领域的规范化和实用化。 #大语言模型 #统计推断 #序贯分析 #机器学习 #AI #论文预印本 #模型监控 #表示学习
学习迁移
该研究提出了一种基于范畴论中Kan扩展的数学框架,用于实现神经网络中的不变性学习与知识迁移。论文作者Luciano Melodia通过形式化方法,将神经网络的特征表示与范畴论中的Kan扩展概念相结合,构建了一种能够自动发现和迁移数据中隐藏结构不变性的新模型。该方法在理论上证明了神经网络可以通过Kan扩展实现跨任务的知识迁移,而不需要重新训练整个网络。研究还展示了该框架在图像识别、自然语言处理等领域的潜在应用价值,为开发更高效、更具泛化能力的深度学习模型提供了新的数学基础。该论文已提交至arXiv预印本平台,目前正在等待DataCite的DOI注册确认。 #机器学习 #范畴论 #神经网络 #知识迁移 #AI研究 #深度学习
该研究提出了一种基于范畴论中Kan扩展的数学框架,用于实现神经网络中的不变性学习与知识迁移。论文作者Luciano Melodia通过形式化方法,将神经网络的特征表示与范畴论中的Kan扩展概念相结合,构建了一种能够自动发现和迁移数据中隐藏结构不变性的新模型。该方法在理论上证明了神经网络可以通过Kan扩展实现跨任务的知识迁移,而不需要重新训练整个网络。研究还展示了该框架在图像识别、自然语言处理等领域的潜在应用价值,为开发更高效、更具泛化能力的深度学习模型提供了新的数学基础。该论文已提交至arXiv预印本平台,目前正在等待DataCite的DOI注册确认。 #机器学习 #范畴论 #神经网络 #知识迁移 #AI研究 #深度学习
监督微调中的突发不对齐问题
一篇来自arXiv的论文提出了“特质空间监控”方法,用于监测监督微调过程中可能出现的突发性不对齐(Emergent Misalignment)。该研究由Huy Nghiem等学者完成,论文于2026年5月31日提交,并已获得DataCite的DOI。研究聚焦于大模型在微调阶段,尤其是监督学习过程中,模型行为可能突然偏离预期对齐目标的潜在风险。作者引入特质空间的概念,通过在高维特征空间中追踪模型内部表征的演变,从而提前预警不对齐现象。这一方法有望提升AI对齐的稳定性和安全性,为模型微调提供更可靠的监控工具。目前论文已以PDF和HTML形式开放获取,并附带相关的代码和数据链接。 #AI安全 #大模型对齐 #监督微调 #特质空间 #arXiv论文
一篇来自arXiv的论文提出了“特质空间监控”方法,用于监测监督微调过程中可能出现的突发性不对齐(Emergent Misalignment)。该研究由Huy Nghiem等学者完成,论文于2026年5月31日提交,并已获得DataCite的DOI。研究聚焦于大模型在微调阶段,尤其是监督学习过程中,模型行为可能突然偏离预期对齐目标的潜在风险。作者引入特质空间的概念,通过在高维特征空间中追踪模型内部表征的演变,从而提前预警不对齐现象。这一方法有望提升AI对齐的稳定性和安全性,为模型微调提供更可靠的监控工具。目前论文已以PDF和HTML形式开放获取,并附带相关的代码和数据链接。 #AI安全 #大模型对齐 #监督微调 #特质空间 #arXiv论文
KITE:三模态Transformer融合文本、图像与知识图谱实现假新闻检测
一篇题为《KITE:面向假新闻检测的三模态Transformer》的学术论文近日在arXiv预印本平台发布。该研究由Kevin Patel等人提出,旨在通过整合文本、图像与知识图谱三种模态信息,提升假新闻检测的准确性与鲁棒性。KITE模型基于Transformer架构,能够同时处理新闻中的文字内容、视觉元素以及外部知识库中的结构化信息,从而更全面地捕捉虚假信息的特征。实验结果表明,该模型在多个基准数据集上表现优于传统单模态或双模态方法,为社交媒体时代的谣言识别提供了新的技术路径。论文已提交至相关会议,并附有代码与数据链接供研究者复现。 #假新闻检测 #多模态 #Transformer #知识图谱 #AI #学术论文 #arXiv
一篇题为《KITE:面向假新闻检测的三模态Transformer》的学术论文近日在arXiv预印本平台发布。该研究由Kevin Patel等人提出,旨在通过整合文本、图像与知识图谱三种模态信息,提升假新闻检测的准确性与鲁棒性。KITE模型基于Transformer架构,能够同时处理新闻中的文字内容、视觉元素以及外部知识库中的结构化信息,从而更全面地捕捉虚假信息的特征。实验结果表明,该模型在多个基准数据集上表现优于传统单模态或双模态方法,为社交媒体时代的谣言识别提供了新的技术路径。论文已提交至相关会议,并附有代码与数据链接供研究者复现。 #假新闻检测 #多模态 #Transformer #知识图谱 #AI #学术论文 #arXiv