MAG: 流形引导的半监督多模态上下文学习新方法
来自 arXiv 预印本平台,Zirui Cheng 等研究者提出了一种名为 MAG(MAnifold Guided)的半监督多模态上下文学习框架。该方法旨在利用少量标注样本和大量未标注数据,通过流形结构引导模型在多模态任务中实现更高效的上下文学习。与传统全监督方法不同,MAG 在保留上下文学习灵活性的同时,显著降低了对人工标注的依赖。实验表明,该框架在多个多模态基准上取得了与全监督方法相当的性能,尤其在数据稀缺场景下优势明显。相关论文已提交 arXiv,代码与数据待公开。 #MAG #半监督学习 #多模态 #上下文学习 #流形引导 #机器学习 #AI #论文
来自 arXiv 预印本平台,Zirui Cheng 等研究者提出了一种名为 MAG(MAnifold Guided)的半监督多模态上下文学习框架。该方法旨在利用少量标注样本和大量未标注数据,通过流形结构引导模型在多模态任务中实现更高效的上下文学习。与传统全监督方法不同,MAG 在保留上下文学习灵活性的同时,显著降低了对人工标注的依赖。实验表明,该框架在多个多模态基准上取得了与全监督方法相当的性能,尤其在数据稀缺场景下优势明显。相关论文已提交 arXiv,代码与数据待公开。 #MAG #半监督学习 #多模态 #上下文学习 #流形引导 #机器学习 #AI #论文
PRISM方法:扰动映射揭示语言模型与中风失语症的命名错误分离
一项新研究提出了一种名为PRISM(基于扰动的减法映射区域可解释性)的方法,用于探索语言模型和后中风失语症患者中的命名错误分离现象。该方法通过扰动模型特定区域并观察输出变化,构建减法映射,从而定位与命名错误相关的神经区域。研究团队将PRISM应用于多种语言模型,并与中风后失语症患者的脑损伤数据对比,发现模型与人类在命名错误类型上存在相似但非完全一致的分离模式。这一工作为理解语言加工机制和开发临床评估工具提供了新视角,有助于推动可解释AI在神经语言学中的应用。 #PRISM #语言模型 #失语症 #神经科学 #可解释AI #中风 #命名错误 #认知科学
一项新研究提出了一种名为PRISM(基于扰动的减法映射区域可解释性)的方法,用于探索语言模型和后中风失语症患者中的命名错误分离现象。该方法通过扰动模型特定区域并观察输出变化,构建减法映射,从而定位与命名错误相关的神经区域。研究团队将PRISM应用于多种语言模型,并与中风后失语症患者的脑损伤数据对比,发现模型与人类在命名错误类型上存在相似但非完全一致的分离模式。这一工作为理解语言加工机制和开发临床评估工具提供了新视角,有助于推动可解释AI在神经语言学中的应用。 #PRISM #语言模型 #失语症 #神经科学 #可解释AI #中风 #命名错误 #认知科学
LLM生成GPU内核验证器及Blackwell反向传播新方法问世
来自arXiv的一篇论文提出了一种合约级验证器,用于检验大语言模型 (LLM) 生成的GPU内核的正确性,同时还为门控线性递归系列 (Gated-Linear-Recurrence) 设计了原生Blackwell反向传播算法。该研究由Rishi Shah等人完成,旨在解决AI生成代码在生产环境中的可靠性问题。合约级验证器通过形式化方法确保内核行为符合预期,而新型反向传播则针对特定架构优化了计算效率。这项工作有望推动GPU编程的自动化,降低人工审查成本,同时提升AI模型训练和推理的稳定性。 #LLM #GPU #代码生成 #验证器 #AI #机器学习 #arXiv #论文 #深度学习 #高性能计算
来自arXiv的一篇论文提出了一种合约级验证器,用于检验大语言模型 (LLM) 生成的GPU内核的正确性,同时还为门控线性递归系列 (Gated-Linear-Recurrence) 设计了原生Blackwell反向传播算法。该研究由Rishi Shah等人完成,旨在解决AI生成代码在生产环境中的可靠性问题。合约级验证器通过形式化方法确保内核行为符合预期,而新型反向传播则针对特定架构优化了计算效率。这项工作有望推动GPU编程的自动化,降低人工审查成本,同时提升AI模型训练和推理的稳定性。 #LLM #GPU #代码生成 #验证器 #AI #机器学习 #arXiv #论文 #深度学习 #高性能计算
大规模需求转移估计
一篇来自arXiv的论文提出了一种基于受限Logit模型的大规模需求转移估计方法。研究团队由Lakshya Garg等7位作者组成,于2026年8月提交。该工作旨在解决电商、零售等领域中,当产品价格、特征或上架状态变化时,消费者需求在不同商品间转移的精确量化难题。传统方法在大规模商品集合中计算成本过高,且难以捕捉复杂的替代模式。论文通过引入受限Logit模型,对选择概率矩阵施加结构化约束,显著降低了估计复杂度,同时保持了模型的可解释性。实验表明,该方法在真实数据集上能够高效、准确地估计需求转移矩阵,为定价优化、库存管理和品类规划提供了有力工具。该研究对推动大规模推荐系统和动态定价策略的发展具有潜在价值。 #arXiv #需求转移 #Logit模型 #机器学习 #电商 #定价优化 #库存管理 #论文研究
一篇来自arXiv的论文提出了一种基于受限Logit模型的大规模需求转移估计方法。研究团队由Lakshya Garg等7位作者组成,于2026年8月提交。该工作旨在解决电商、零售等领域中,当产品价格、特征或上架状态变化时,消费者需求在不同商品间转移的精确量化难题。传统方法在大规模商品集合中计算成本过高,且难以捕捉复杂的替代模式。论文通过引入受限Logit模型,对选择概率矩阵施加结构化约束,显著降低了估计复杂度,同时保持了模型的可解释性。实验表明,该方法在真实数据集上能够高效、准确地估计需求转移矩阵,为定价优化、库存管理和品类规划提供了有力工具。该研究对推动大规模推荐系统和动态定价策略的发展具有潜在价值。 #arXiv #需求转移 #Logit模型 #机器学习 #电商 #定价优化 #库存管理 #论文研究
CAKE: 编译器与智能体协同设计推动前沿内核进化
一篇题为《CAKE: Compiler-Agent Co-Design for Frontier Kernel Evolution》的学术论文近日在arXiv上发布。该论文由Zihao Ye等14位研究者共同完成,提出了一种编译器与智能体协同设计的新方法,旨在解决前沿计算内核(如深度学习、科学计算中的高性能算子)的自动化优化难题。传统方法依赖人工专家或单纯编译器优化,效率有限。CAKE框架通过引入智能体(Agent)与编译器深度协作,实现内核的自动探索与演化,有望显著提升特定硬件上的执行效率。该研究为高性能计算与AI系统优化提供了新思路,未来可能加速芯片设计、大模型推理等领域的性能突破。 #AI #编译器 #高性能计算 #论文 #学术研究 #深度学习 #系统优化 #arXiv
一篇题为《CAKE: Compiler-Agent Co-Design for Frontier Kernel Evolution》的学术论文近日在arXiv上发布。该论文由Zihao Ye等14位研究者共同完成,提出了一种编译器与智能体协同设计的新方法,旨在解决前沿计算内核(如深度学习、科学计算中的高性能算子)的自动化优化难题。传统方法依赖人工专家或单纯编译器优化,效率有限。CAKE框架通过引入智能体(Agent)与编译器深度协作,实现内核的自动探索与演化,有望显著提升特定硬件上的执行效率。该研究为高性能计算与AI系统优化提供了新思路,未来可能加速芯片设计、大模型推理等领域的性能突破。 #AI #编译器 #高性能计算 #论文 #学术研究 #深度学习 #系统优化 #arXiv
GENERIC动力学结构保持不确定性量化方法研究
Zequn He等人在arXiv上提交了一篇题为“Structure-preserving uncertainty quantification for GENERIC dynamics”的论文。该研究针对GENERIC(通用方程可逆不可逆共轭)动力学框架,提出了一种保持系统几何结构的不确定性量化方法。GENERIC框架广泛应用于多物理场热力学建模,但传统不确定性量化手段往往破坏其内在的对称性和守恒律。作者通过开发结构保持的数值算法,在量化不确定性的同时确保了系统的热力学一致性和物理可解释性。该工作为复杂多物理系统的可靠数值模拟提供了新思路,对能源、材料等领域具有理论价值。 #论文 #GENERIC #不确定性量化 #结构保持 #arXiv #动力学 #热力学 #数值模拟 #多物理场
Zequn He等人在arXiv上提交了一篇题为“Structure-preserving uncertainty quantification for GENERIC dynamics”的论文。该研究针对GENERIC(通用方程可逆不可逆共轭)动力学框架,提出了一种保持系统几何结构的不确定性量化方法。GENERIC框架广泛应用于多物理场热力学建模,但传统不确定性量化手段往往破坏其内在的对称性和守恒律。作者通过开发结构保持的数值算法,在量化不确定性的同时确保了系统的热力学一致性和物理可解释性。该工作为复杂多物理系统的可靠数值模拟提供了新思路,对能源、材料等领域具有理论价值。 #论文 #GENERIC #不确定性量化 #结构保持 #arXiv #动力学 #热力学 #数值模拟 #多物理场
ReLU 激活函数的布尔能力研究
一篇题为《The Boolean Power of ReLU》的学术论文近期在 arXiv 上发布,由 Pablo Barceló、Floris Geerts、Matthias Lanzinger、Klara Pakhomenko 和 Jan Van den Bussche 共同撰写。该论文深入探讨了 ReLU(修正线性单元)激活函数在布尔逻辑表达中的能力,分析了 ReLU 网络如何表示和计算布尔函数,并揭示了其相较于传统激活函数的独特优势。研究为理解深度学习中 ReLU 的理论基础提供了新视角,对神经网络的可解释性及架构设计具有潜在影响。论文目前可通过 arXiv 获取全文。 #ReLU #深度学习 #神经网络 #布尔函数 #AI理论 #arXiv #学术论文
一篇题为《The Boolean Power of ReLU》的学术论文近期在 arXiv 上发布,由 Pablo Barceló、Floris Geerts、Matthias Lanzinger、Klara Pakhomenko 和 Jan Van den Bussche 共同撰写。该论文深入探讨了 ReLU(修正线性单元)激活函数在布尔逻辑表达中的能力,分析了 ReLU 网络如何表示和计算布尔函数,并揭示了其相较于传统激活函数的独特优势。研究为理解深度学习中 ReLU 的理论基础提供了新视角,对神经网络的可解释性及架构设计具有潜在影响。论文目前可通过 arXiv 获取全文。 #ReLU #深度学习 #神经网络 #布尔函数 #AI理论 #arXiv #学术论文
研究提出“先表征再生成”方法,解决多模态条件下不规则缺失时序数据生成问题
来自arXiv的一篇论文提出了一种名为“Represent, Then Generate”的新框架,旨在解决多模态条件下不规则缺失时间序列数据的生成难题。该工作由Haochen Zhang等人完成,针对现实场景中传感器数据常存在随机缺失、采样不规则以及多模态信息并存的问题,提出先通过自监督学习对缺失模式进行鲁棒表征,再基于该表征条件生成完整的时间序列。该方法在多个基准数据集上有效提升了生成质量,尤其在高缺失率下表现优异,为医疗监测、工业物联网等领域的时序数据补全与生成提供了新思路。 #多模态 #时间序列 #生成模型 #缺失数据 #AI #论文 #arXiv #机器学习 #时序数据
来自arXiv的一篇论文提出了一种名为“Represent, Then Generate”的新框架,旨在解决多模态条件下不规则缺失时间序列数据的生成难题。该工作由Haochen Zhang等人完成,针对现实场景中传感器数据常存在随机缺失、采样不规则以及多模态信息并存的问题,提出先通过自监督学习对缺失模式进行鲁棒表征,再基于该表征条件生成完整的时间序列。该方法在多个基准数据集上有效提升了生成质量,尤其在高缺失率下表现优异,为医疗监测、工业物联网等领域的时序数据补全与生成提供了新思路。 #多模态 #时间序列 #生成模型 #缺失数据 #AI #论文 #arXiv #机器学习 #时序数据
基于世界模型扩展自动研究代理,新论文探索AI科研自动化
一篇名为《Scaling Automatic Research Agents via World Models》的论文近期在arXiv上提交。该研究由杨希源等十位作者共同完成,核心探索如何通过构建世界模型来扩展自动研究代理的能力。论文提出,将世界模型集成到自动研究代理中,可以帮助代理在复杂科研环境中进行推理、规划与决策,从而提升自主研究效率。该方法有望在文献分析、实验设计、假设生成等环节实现更高水平的自动化,推动AI在科学研究领域的应用。目前该论文已开放PDF和HTML版本供下载。 #AI #自动研究 #世界模型 #论文 #科研自动化 #arXiv #机器学习
一篇名为《Scaling Automatic Research Agents via World Models》的论文近期在arXiv上提交。该研究由杨希源等十位作者共同完成,核心探索如何通过构建世界模型来扩展自动研究代理的能力。论文提出,将世界模型集成到自动研究代理中,可以帮助代理在复杂科研环境中进行推理、规划与决策,从而提升自主研究效率。该方法有望在文献分析、实验设计、假设生成等环节实现更高水平的自动化,推动AI在科学研究领域的应用。目前该论文已开放PDF和HTML版本供下载。 #AI #自动研究 #世界模型 #论文 #科研自动化 #arXiv #机器学习
GENADA
近日,一篇题为《GENADA: efficient generative time series adversarial attack framework》的论文在arXiv预印本平台上线。该论文由Michael Baronov等四位作者共同完成,提交于2026年8月12日。研究提出了一种名为GENADA的生成式框架,旨在高效地对时间序列数据实施对抗攻击。传统对抗攻击方法在处理时间序列时往往面临计算成本高、攻击效率低等问题,GENADA通过生成式模型设计,能够更快速、更隐蔽地生成对抗样本,从而测试和提升时间序列模型(如金融预测、传感器数据分析等)的鲁棒性。该框架的发布为时间序列领域的安全研究提供了新工具,并可能推动相关防御机制的发展。 #论文 #AI #时间序列 #对抗攻击 #生成模型 #安全 #arXiv
近日,一篇题为《GENADA: efficient generative time series adversarial attack framework》的论文在arXiv预印本平台上线。该论文由Michael Baronov等四位作者共同完成,提交于2026年8月12日。研究提出了一种名为GENADA的生成式框架,旨在高效地对时间序列数据实施对抗攻击。传统对抗攻击方法在处理时间序列时往往面临计算成本高、攻击效率低等问题,GENADA通过生成式模型设计,能够更快速、更隐蔽地生成对抗样本,从而测试和提升时间序列模型(如金融预测、传感器数据分析等)的鲁棒性。该框架的发布为时间序列领域的安全研究提供了新工具,并可能推动相关防御机制的发展。 #论文 #AI #时间序列 #对抗攻击 #生成模型 #安全 #arXiv
利用Householder矩阵探索图神经网络过度平滑问题
arXiv上最新论文《Exploring Oversmoothing with Householder Matrices》由Bhaskar Karol提交。该研究聚焦于图神经网络(GNN)中常见的过度平滑问题,即随着网络层数加深,节点表示趋于一致,导致模型性能下降。作者提出利用Householder矩阵(一种正交矩阵)来建模和缓解这一现象,通过保持节点特征的多样性来提升深层GNN的表达能力。论文于2026年8月12日提交至arXiv,为深层图网络的设计提供了新的理论视角和潜在方法,相关实验与分析有待正式发布后进一步验证。 #图神经网络 #过度平滑 #Householder矩阵 #深度学习 #AI #arXiv #论文
arXiv上最新论文《Exploring Oversmoothing with Householder Matrices》由Bhaskar Karol提交。该研究聚焦于图神经网络(GNN)中常见的过度平滑问题,即随着网络层数加深,节点表示趋于一致,导致模型性能下降。作者提出利用Householder矩阵(一种正交矩阵)来建模和缓解这一现象,通过保持节点特征的多样性来提升深层GNN的表达能力。论文于2026年8月12日提交至arXiv,为深层图网络的设计提供了新的理论视角和潜在方法,相关实验与分析有待正式发布后进一步验证。 #图神经网络 #过度平滑 #Householder矩阵 #深度学习 #AI #arXiv #论文