Grokking表示度量尚未收敛
近日,arXiv上预印本论文《At-Grok Is Not Converged: A Measurement-Validity Audit for Grokking Representation Metrics》对当前用于衡量神经网络“Grokking”(突现泛化)现象的表示度量方法进行了系统性审计。研究发现,这些常用度量在训练过程中并未达到收敛状态,其测量结果存在显著不一致性,从而对现有度量的有效性提出根本性质疑。通过设计系列实验,作者揭示了度量不稳定性的具体表现及其对结论可靠性的影响,为理解深度学习中的突现行为提供了重要警示。这一工作有助于推动研究者更谨慎地使用和解释Grokking相关表示度量,避免因工具缺陷导致误导性结论。 #机器学习 #深度学习 #神经网络 #Grokking #度量审计 #AI研究 #论文 #表示学习
近日,arXiv上预印本论文《At-Grok Is Not Converged: A Measurement-Validity Audit for Grokking Representation Metrics》对当前用于衡量神经网络“Grokking”(突现泛化)现象的表示度量方法进行了系统性审计。研究发现,这些常用度量在训练过程中并未达到收敛状态,其测量结果存在显著不一致性,从而对现有度量的有效性提出根本性质疑。通过设计系列实验,作者揭示了度量不稳定性的具体表现及其对结论可靠性的影响,为理解深度学习中的突现行为提供了重要警示。这一工作有助于推动研究者更谨慎地使用和解释Grokking相关表示度量,避免因工具缺陷导致误导性结论。 #机器学习 #深度学习 #神经网络 #Grokking #度量审计 #AI研究 #论文 #表示学习
UASPL: 不确定性感知自步学习与证据神经网络研究论文发布
近日,一项题为《UASPL: Uncertainty-Aware Self-Paced Learning with Evidential Neural Networks》的研究论文在arXiv平台上发布。该论文由Yifan Zhang等五位作者共同完成,提出了一种融合不确定性感知与自步学习的新型框架,并基于证据神经网络实现。该方法旨在提升模型在含噪数据或不确定场景下的学习效率和鲁棒性,通过动态调整样本学习顺序,优先处理高置信度样本,逐步纳入低置信度样本,从而优化训练过程。该研究为机器学习领域提供了一种新的自步学习范式,有望在图像识别、自然语言处理等任务中应用,尤其在数据质量参差不齐的现实场景中具有重要潜力。 #机器学习 #自步学习 #不确定性感知 #证据神经网络 #arXiv #论文
近日,一项题为《UASPL: Uncertainty-Aware Self-Paced Learning with Evidential Neural Networks》的研究论文在arXiv平台上发布。该论文由Yifan Zhang等五位作者共同完成,提出了一种融合不确定性感知与自步学习的新型框架,并基于证据神经网络实现。该方法旨在提升模型在含噪数据或不确定场景下的学习效率和鲁棒性,通过动态调整样本学习顺序,优先处理高置信度样本,逐步纳入低置信度样本,从而优化训练过程。该研究为机器学习领域提供了一种新的自步学习范式,有望在图像识别、自然语言处理等任务中应用,尤其在数据质量参差不齐的现实场景中具有重要潜力。 #机器学习 #自步学习 #不确定性感知 #证据神经网络 #arXiv #论文
需求响应或因对抗性数据修改加剧网络攻击风险
一篇由Clemens Kortmann等人撰写的研究论文《Does Demand Response Increase Vulnerability to Cyber Attacks by Adversarial Data Modifications?》近日在arXiv平台发布。该论文探讨了需求响应机制在面对恶意数据篡改时是否会放大系统的网络攻击脆弱性。需求响应是智能电网中平衡供需的关键技术,但攻击者可能通过注入虚假数据干扰决策,导致电网运行异常。研究通过建模分析指出,不当设计的需求响应策略会为攻击者提供更多入口,增加系统被操控的风险。该发现对电网安全具有警示意义,并呼吁在部署需求响应时加强数据验证与防御措施。 #网络安全 #需求响应 #智能电网 #对抗性攻击 #数据篡改 #学术论文 #能源安全
一篇由Clemens Kortmann等人撰写的研究论文《Does Demand Response Increase Vulnerability to Cyber Attacks by Adversarial Data Modifications?》近日在arXiv平台发布。该论文探讨了需求响应机制在面对恶意数据篡改时是否会放大系统的网络攻击脆弱性。需求响应是智能电网中平衡供需的关键技术,但攻击者可能通过注入虚假数据干扰决策,导致电网运行异常。研究通过建模分析指出,不当设计的需求响应策略会为攻击者提供更多入口,增加系统被操控的风险。该发现对电网安全具有警示意义,并呼吁在部署需求响应时加强数据验证与防御措施。 #网络安全 #需求响应 #智能电网 #对抗性攻击 #数据篡改 #学术论文 #能源安全
证书失效时
一篇题为"When Certificates Fail: A Unified Safety Framework for Embedded Neural Interface Models"的论文近日在arXiv上发布。作者Jasmeet Singh Bindra针对嵌入式神经接口模型的安全性问题提出了一个统一的框架。该研究指出,传统证书机制在保障这类模型安全方面存在失效风险,新框架通过整合多种安全策略,旨在提升模型在动态环境中的鲁棒性与可靠性。论文提供了详细的数学建模与理论分析,为嵌入式AI系统的安全设计提供了新思路。 #嵌入式系统 #神经接口 #安全框架 #AI安全 #arXiv论文 #机器学习 #嵌入式AI
一篇题为"When Certificates Fail: A Unified Safety Framework for Embedded Neural Interface Models"的论文近日在arXiv上发布。作者Jasmeet Singh Bindra针对嵌入式神经接口模型的安全性问题提出了一个统一的框架。该研究指出,传统证书机制在保障这类模型安全方面存在失效风险,新框架通过整合多种安全策略,旨在提升模型在动态环境中的鲁棒性与可靠性。论文提供了详细的数学建模与理论分析,为嵌入式AI系统的安全设计提供了新思路。 #嵌入式系统 #神经接口 #安全框架 #AI安全 #arXiv论文 #机器学习 #嵌入式AI
STST-JEPA 新架构发布,EEG自监督学习迎来突破
近日,研究团队在arXiv上提交了一篇题为《STST-JEPA: Shallow-Target Spatio-Temporal Joint Embedding Prediction Architecture For EEG Self-Supervised Learning》的论文。该研究提出了一种名为STST-JEPA的新型深度学习架构,专门用于脑电图(EEG)信号的自监督学习。传统EEG分析依赖大量人工标注,而自监督学习能利用无标签数据提取有效特征。STST-JEPA的核心创新在于采用“浅层目标”与“时空联合嵌入预测”相结合的策略,在捕捉EEG信号时域与空域复杂依赖关系的同时,降低了计算成本。实验表明,该架构在多个EEG下游任务上取得了显著性能提升,为脑机接口、神经疾病诊断等领域的无监督或半监督学习提供了新思路。该工作由Roy Segal等人完成,目前论文已开放预览。 #STSTJEPA #EEG #自监督学习 #深度学习 #脑机接口 #人工智能 #arXiv论文
近日,研究团队在arXiv上提交了一篇题为《STST-JEPA: Shallow-Target Spatio-Temporal Joint Embedding Prediction Architecture For EEG Self-Supervised Learning》的论文。该研究提出了一种名为STST-JEPA的新型深度学习架构,专门用于脑电图(EEG)信号的自监督学习。传统EEG分析依赖大量人工标注,而自监督学习能利用无标签数据提取有效特征。STST-JEPA的核心创新在于采用“浅层目标”与“时空联合嵌入预测”相结合的策略,在捕捉EEG信号时域与空域复杂依赖关系的同时,降低了计算成本。实验表明,该架构在多个EEG下游任务上取得了显著性能提升,为脑机接口、神经疾病诊断等领域的无监督或半监督学习提供了新思路。该工作由Roy Segal等人完成,目前论文已开放预览。 #STSTJEPA #EEG #自监督学习 #深度学习 #脑机接口 #人工智能 #arXiv论文
指纹而非蓝图:位置编码方案设定注意力机制的默认谱代数
来自固体物理研究所的Hengyu Li等研究者发表了一篇论文,探讨了Transformer注意力机制中位置编码方案的本质作用。传统观点认为位置编码为模型提供空间信息,但该研究提出,位置方案实际上不是“蓝图”——即不会强制改变注意力的操作结构,而是“指纹”——定义了注意力矩阵的默认谱代数性质。通过理论分析,作者发现不同位置编码方案(如绝对位置、相对位置、旋转位置等)会预设注意力矩阵的特定谱分布和代数结构,进而影响模型的学习偏向与表达能力。这一发现为理解Transformer的内在归纳偏置提供了新视角,有助于指导更高效的位置编码设计,对自然语言处理和计算机视觉等领域的大模型发展具有重要意义。 #机器学习 #深度学习 #Transformer #注意力机制 #位置编码 #AI #论文 #基础研究
来自固体物理研究所的Hengyu Li等研究者发表了一篇论文,探讨了Transformer注意力机制中位置编码方案的本质作用。传统观点认为位置编码为模型提供空间信息,但该研究提出,位置方案实际上不是“蓝图”——即不会强制改变注意力的操作结构,而是“指纹”——定义了注意力矩阵的默认谱代数性质。通过理论分析,作者发现不同位置编码方案(如绝对位置、相对位置、旋转位置等)会预设注意力矩阵的特定谱分布和代数结构,进而影响模型的学习偏向与表达能力。这一发现为理解Transformer的内在归纳偏置提供了新视角,有助于指导更高效的位置编码设计,对自然语言处理和计算机视觉等领域的大模型发展具有重要意义。 #机器学习 #深度学习 #Transformer #注意力机制 #位置编码 #AI #论文 #基础研究
论文提出混合学习方法处理分类未观测混杂因子的因果推断
一项最新研究提出利用混合学习技术解决因果推断中分类未观测混杂因子的问题。该论文由Aytijhya Saha等作者完成,于2026年5月提交至arXiv预印本平台。研究聚焦于传统因果推断方法在面对未观测混杂变量时存在的偏差问题,通过引入混合学习框架,能够有效分离并处理分类形式的未观测混杂因子,从而提升因果效应估计的准确性。该方法在理论推导和实验验证上均表现出对复杂混杂结构的鲁棒性,为流行病学、社会科学等领域的因果分析提供了新工具。论文还公开了相关代码,便于研究者复现和扩展。 #因果推断 #混合学习 #未观测混杂因子 #统计方法 #机器学习 #arXiv #学术论文
一项最新研究提出利用混合学习技术解决因果推断中分类未观测混杂因子的问题。该论文由Aytijhya Saha等作者完成,于2026年5月提交至arXiv预印本平台。研究聚焦于传统因果推断方法在面对未观测混杂变量时存在的偏差问题,通过引入混合学习框架,能够有效分离并处理分类形式的未观测混杂因子,从而提升因果效应估计的准确性。该方法在理论推导和实验验证上均表现出对复杂混杂结构的鲁棒性,为流行病学、社会科学等领域的因果分析提供了新工具。论文还公开了相关代码,便于研究者复现和扩展。 #因果推断 #混合学习 #未观测混杂因子 #统计方法 #机器学习 #arXiv #学术论文
统计力学视角下的高斯混合与非参数似然研究
一篇题为《统计力学视角下的高斯混合与非参数似然》的论文近日在arXiv预印本平台发布。该论文由Subhroshkhar Ghosh等四位作者联合撰写,旨在从统计力学的理论框架出发,重新审视高斯混合模型与非参数似然估计之间的关系。研究通过引入统计力学中的概念,如自由能和配分函数,为非参数似然问题提供了新的数学工具和解释。作者提出了一个统一的框架,将高斯混合的密度估计与最大似然估计的非参数形式联系起来,并探讨了该框架在数据稀疏或维度较高时的表现。这项研究不仅深化了对经典统计模型的理论理解,还为机器学习中的聚类、密度估计等任务提供了新的方法论基础,预计将对相关领域的研究产生积极影响。 #统计力学 #高斯混合模型 #非参数似然 #论文 #机器学习 #人工智能 #arXiv #数学 #统计学
一篇题为《统计力学视角下的高斯混合与非参数似然》的论文近日在arXiv预印本平台发布。该论文由Subhroshkhar Ghosh等四位作者联合撰写,旨在从统计力学的理论框架出发,重新审视高斯混合模型与非参数似然估计之间的关系。研究通过引入统计力学中的概念,如自由能和配分函数,为非参数似然问题提供了新的数学工具和解释。作者提出了一个统一的框架,将高斯混合的密度估计与最大似然估计的非参数形式联系起来,并探讨了该框架在数据稀疏或维度较高时的表现。这项研究不仅深化了对经典统计模型的理论理解,还为机器学习中的聚类、密度估计等任务提供了新的方法论基础,预计将对相关领域的研究产生积极影响。 #统计力学 #高斯混合模型 #非参数似然 #论文 #机器学习 #人工智能 #arXiv #数学 #统计学
高斯混合模型总变差与Hellinger距离间的尖锐不等式获证
在机器学习与概率论领域,高斯混合模型是一种广泛应用的概率分布表示。总变差距离与Hellinger距离是衡量两个分布差异的重要指标,但两者之间的精确关系此前缺乏严格刻画。近日,由Joonhyuk Jung和Chao Gao共同撰写的论文在2026年国际机器学习大会(ICML)上发表,系统推导了高斯混合模型下总变差与Hellinger距离之间的尖锐不等式。该研究给出了两者相互控制的显式界,填补了相关理论空白,有望为模型选择、密度估计和生成对抗网络等实际应用提供更精确的数学工具。 #机器学习 #ICML #高斯混合模型 #总变差 #Hellinger距离 #概率论 #不等式 #数学理论
在机器学习与概率论领域,高斯混合模型是一种广泛应用的概率分布表示。总变差距离与Hellinger距离是衡量两个分布差异的重要指标,但两者之间的精确关系此前缺乏严格刻画。近日,由Joonhyuk Jung和Chao Gao共同撰写的论文在2026年国际机器学习大会(ICML)上发表,系统推导了高斯混合模型下总变差与Hellinger距离之间的尖锐不等式。该研究给出了两者相互控制的显式界,填补了相关理论空白,有望为模型选择、密度估计和生成对抗网络等实际应用提供更精确的数学工具。 #机器学习 #ICML #高斯混合模型 #总变差 #Hellinger距离 #概率论 #不等式 #数学理论
网络动力学框架助力理解深度神经网络
一项最新研究提出了基于网络动力学的框架,用于深入理解深度神经网络的工作机制。该论文由Yuchen Lin等四位作者合作完成,即将发表于《中国科学:物理学 力学 天文学》(Sci. China Phys. Mech. Astron.)第69卷,文章编号270511(2026年)。论文自2025年1月起在arXiv预印本平台提交,历经多个版本修订,最终版本于2026年7月上传。该研究为解释深度神经网络的复杂行为提供了新的理论视角,有望推动人工智能基础理论的发展。 #网络动力学 #深度神经网络 #AI基础研究 #arXiv #中国科学 #物理学 #力学 #天文学 #神经网络解释
一项最新研究提出了基于网络动力学的框架,用于深入理解深度神经网络的工作机制。该论文由Yuchen Lin等四位作者合作完成,即将发表于《中国科学:物理学 力学 天文学》(Sci. China Phys. Mech. Astron.)第69卷,文章编号270511(2026年)。论文自2025年1月起在arXiv预印本平台提交,历经多个版本修订,最终版本于2026年7月上传。该研究为解释深度神经网络的复杂行为提供了新的理论视角,有望推动人工智能基础理论的发展。 #网络动力学 #深度神经网络 #AI基础研究 #arXiv #中国科学 #物理学 #力学 #天文学 #神经网络解释
Approximate full conformal prediction in an RKHS
Focus to learn more arXiv-issued DOI via DataCite Submission history From: Davidson Lova Razafindrakoto [ view email ] [v1] Mon, 19 Jan 2026 14:40:49 UTC (639 KB) [v2] Sat, 24 Jan 2026 13:51:10 UTC (689 KB) [v3] Wed, 8 Jul 2026 08:19:49 UTC (689 KB) Full-text links: Access Paper: View a PDF of the paper titled Approximate full conformal prediction in an RKHS, by Davidson Lova Razafindrakoto and 1 other authors View PDF HTML (experimental) TeX Source view license Current browse context: < prev | next > new | recent | 2026-01 Change to browse by: cs math stat References & Citations NASA ADS Google Scholar Semantic Scholar export BibTeX citation Loading... BibTeX formatted citation × loading... Data provided by: Bookmark Bibliographic Tools Bibliographic and Citation Tools Bibliographic Explorer Toggle Bibliographic Explorer
Focus to learn more arXiv-issued DOI via DataCite Submission history From: Davidson Lova Razafindrakoto [ view email ] [v1] Mon, 19 Jan 2026 14:40:49 UTC (639 KB) [v2] Sat, 24 Jan 2026 13:51:10 UTC (689 KB) [v3] Wed, 8 Jul 2026 08:19:49 UTC (689 KB) Full-text links: Access Paper: View a PDF of the paper titled Approximate full conformal prediction in an RKHS, by Davidson Lova Razafindrakoto and 1 other authors View PDF HTML (experimental) TeX Source view license Current browse context: < prev | next > new | recent | 2026-01 Change to browse by: cs math stat References & Citations NASA ADS Google Scholar Semantic Scholar export BibTeX citation Loading... BibTeX formatted citation × loading... Data provided by: Bookmark Bibliographic Tools Bibliographic and Citation Tools Bibliographic Explorer Toggle Bibliographic Explorer
( What is the Explorer? ) Connected Papers Toggle Connected Papers ( What is Connected Papers? ) Litmaps Toggle Litmaps ( What is Litmaps? ) Toggle scite Smart Citations ( What are Smart Citations? ) Code, Data, Media Code, Data and Media Associated with this Article alphaXiv Toggle alphaXiv ( What is alphaXiv? ) Links to Code Toggle CatalyzeX Code Finder for Papers ( What is CatalyzeX? ) DagsHub Toggle DagsHub ( What is DagsHub? ) GotitPub Toggle ( What is GotitPub? ) Huggingface Toggle Hugging Face ( What is Huggingface? ) ScienceCast Toggle ScienceCast ( What is ScienceCast? ) Demos Demos Replicate Toggle Replicate ( What is Replicate? ) Spaces Toggle Hugging Face Spaces ( What is Spaces? ) Spaces Toggle ( What is ? ) Related Papers Recommenders and Search Tools Link to Influence Flower Influence Flower ( What are Influence Flowers? ) Core recommender toggle CORE Recommender ( What is CORE? ) Author Venue Institution Topic About arXivLabs arXivLabs: experimental projects with community collaborators arXivLabs is a framework that allows collaborators to develop and share new arXiv features directly on our website. Both individuals and organizations that work with arXivLabs have embraced and accepted our values of openness, community, excellence, and user data privacy. arXiv is committed to these values and only works with partners that adhere to them. Have an idea for a project that will add value for arXiv's community? Learn more about arXivLabs .
Diffusion Models in Simulation-Based Inference
Focus to learn more arXiv-issued DOI via DataCite Submission history From: Jonas Arruda [ view email ] [v1] Mon, 22 Dec 2025 15:10:35 UTC (8,821 KB) [v2] Thu, 29 Jan 2026 14:33:29 UTC (8,870 KB) [v3] Wed, 8 Jul 2026 15:20:55 UTC (9,510 KB) Full-text links: Access Paper: View a PDF of the paper titled Diffusion Models in Simulation-Based Inference: A Tutorial Review, by Jonas Arruda and Niels Bracher and Ullrich K\"othe and Jan Hasenauer and Stefan T. Radev View PDF HTML (experimental) TeX Source view license Current browse context: < prev | next > new | recent | 2025-12 Change to browse by: cs stat References & Citations NASA ADS Google Scholar Semantic Scholar export BibTeX citation Loading... BibTeX formatted citation × loading... Data provided by: Bookmark Bibliographic Tools Bibliographic and Citation Tools Bibliog
Focus to learn more arXiv-issued DOI via DataCite Submission history From: Jonas Arruda [ view email ] [v1] Mon, 22 Dec 2025 15:10:35 UTC (8,821 KB) [v2] Thu, 29 Jan 2026 14:33:29 UTC (8,870 KB) [v3] Wed, 8 Jul 2026 15:20:55 UTC (9,510 KB) Full-text links: Access Paper: View a PDF of the paper titled Diffusion Models in Simulation-Based Inference: A Tutorial Review, by Jonas Arruda and Niels Bracher and Ullrich K\"othe and Jan Hasenauer and Stefan T. Radev View PDF HTML (experimental) TeX Source view license Current browse context: < prev | next > new | recent | 2025-12 Change to browse by: cs stat References & Citations NASA ADS Google Scholar Semantic Scholar export BibTeX citation Loading... BibTeX formatted citation × loading... Data provided by: Bookmark Bibliographic Tools Bibliographic and Citation Tools Bibliog
raphic Explorer Toggle Bibliographic Explorer ( What is the Explorer? ) Connected Papers Toggle Connected Papers ( What is Connected Papers? ) Litmaps Toggle Litmaps ( What is Litmaps? ) Toggle scite Smart Citations ( What are Smart Citations? ) Code, Data, Media Code, Data and Media Associated with this Article alphaXiv Toggle alphaXiv ( What is alphaXiv? ) Links to Code Toggle CatalyzeX Code Finder for Papers ( What is CatalyzeX? ) DagsHub Toggle DagsHub ( What is DagsHub? ) GotitPub Toggle ( What is GotitPub? ) Huggingface Toggle Hugging Face ( What is Huggingface? ) ScienceCast Toggle ScienceCast ( What is ScienceCast? ) Demos Demos Replicate Toggle Replicate ( What is Replicate? ) Spaces Toggle Hugging Face Spaces ( What is Spaces? ) Spaces Toggle ( What is ? ) Related Papers Recommenders and Search Tools Link to Influence Flower Influence Flower ( What are Influence Flowers? ) Core recommender toggle CORE Recommender ( What is CORE? ) Author Venue Institution Topic About arXivLabs arXivLabs: experimental projects with community collaborators arXivLabs is a framework that allows collaborators to develop and share new arXiv features directly on our website. Both individuals and organizations that work with arXivLabs have embraced and accepted our values of openness, community, excellence, and user data privacy. arXiv is committed to these values and only works with partners that adhere to them. Have an idea for a project that will add value for arXiv's community? Learn more about arXivLabs .
Fast segmentation of watermarked texts from large language models through an epidemic change
Focus to learn more arXiv-issued DOI via DataCite Submission history From: Subhrajyoty Roy [ view email ] [v1] Thu, 25 Sep 2025 13:44:34 UTC (768 KB) [v2] Wed, 8 Jul 2026 16:16:06 UTC (2,347 KB) Full-text links: Access Paper: View a PDF of the paper titled Fast segmentation of watermarked texts from large language models through an epidemic change-point framework, by Soham Bonnerjee and 1 other authors View PDF TeX Source view license Current browse context: < prev | next > new | recent | 2025-09 Change to browse by: cs stat References & Citations NASA ADS Google Scholar Semantic Scholar export BibTeX citation Loading... BibTeX formatted citation × loading... Data provided by: Bookmark Bibliographic Tools Bibliographic and Citation Tools Bibliographic Explorer Toggle Bibliograph
Focus to learn more arXiv-issued DOI via DataCite Submission history From: Subhrajyoty Roy [ view email ] [v1] Thu, 25 Sep 2025 13:44:34 UTC (768 KB) [v2] Wed, 8 Jul 2026 16:16:06 UTC (2,347 KB) Full-text links: Access Paper: View a PDF of the paper titled Fast segmentation of watermarked texts from large language models through an epidemic change-point framework, by Soham Bonnerjee and 1 other authors View PDF TeX Source view license Current browse context: < prev | next > new | recent | 2025-09 Change to browse by: cs stat References & Citations NASA ADS Google Scholar Semantic Scholar export BibTeX citation Loading... BibTeX formatted citation × loading... Data provided by: Bookmark Bibliographic Tools Bibliographic and Citation Tools Bibliographic Explorer Toggle Bibliograph