Representation Learning Enables Scalable Multitask Deep Reinforcement Learning
Focus to learn more arXiv-issued DOI via DataCite (pending registration) Submission history From: Johan Obando-Ceron [ view email ] [v1] Thu, 4 Jun 2026 01:09:20 UTC (1,933 KB) Full-text links: Access Paper: View a PDF of the paper titled Representation Learning Enables Scalable Multitask Deep Reinforcement Learning, by Johan Obando-Ceron and 5 other authors View PDF HTML (experimental) TeX Source view license Current browse context: < prev | next > new | recent | 2026-06 Change to browse by: cs References & Citations NASA ADS Google Scholar Semantic Scholar export BibTeX citation Loading... BibTeX formatted citation × loading... Data provided by: Bookmark Bibliographic Tools Bibliographic and Citation Tools Bibliographic Explorer Toggle Bibliographic Explorer ( What is the Explorer? ) Connec
Focus to learn more arXiv-issued DOI via DataCite (pending registration) Submission history From: Johan Obando-Ceron [ view email ] [v1] Thu, 4 Jun 2026 01:09:20 UTC (1,933 KB) Full-text links: Access Paper: View a PDF of the paper titled Representation Learning Enables Scalable Multitask Deep Reinforcement Learning, by Johan Obando-Ceron and 5 other authors View PDF HTML (experimental) TeX Source view license Current browse context: < prev | next > new | recent | 2026-06 Change to browse by: cs References & Citations NASA ADS Google Scholar Semantic Scholar export BibTeX citation Loading... BibTeX formatted citation × loading... Data provided by: Bookmark Bibliographic Tools Bibliographic and Citation Tools Bibliographic Explorer Toggle Bibliographic Explorer ( What is the Explorer? ) Connec
ted Papers Toggle Connected Papers ( What is Connected Papers? ) Litmaps Toggle Litmaps ( What is Litmaps? ) Toggle scite Smart Citations ( What are Smart Citations? ) Code, Data, Media Code, Data and Media Associated with this Article alphaXiv Toggle alphaXiv ( What is alphaXiv? ) Links to Code Toggle CatalyzeX Code Finder for Papers ( What is CatalyzeX? ) DagsHub Toggle DagsHub ( What is DagsHub? ) GotitPub Toggle ( What is GotitPub? ) Huggingface Toggle Hugging Face ( What is Huggingface? ) ScienceCast Toggle ScienceCast ( What is ScienceCast? ) Demos Demos Replicate Toggle Replicate ( What is Replicate? ) Spaces Toggle Hugging Face Spaces ( What is Spaces? ) Spaces Toggle ( What is ? ) Related Papers Recommenders and Search Tools Link to Influence Flower Influence Flower ( What are Influence Flowers? ) Core recommender toggle CORE Recommender ( What is CORE? ) IArxiv recommender toggle IArxiv Recommender ( What is IArxiv? ) Author Venue Institution Topic About arXivLabs arXivLabs: experimental projects with community collaborators arXivLabs is a framework that allows collaborators to develop and share new arXiv features directly on our website. Both individuals and organizations that work with arXivLabs have embraced and accepted our values of openness, community, excellence, and user data privacy. arXiv is committed to these values and only works with partners that adhere to them. Have an idea for a project that will add value for arXiv's community? Learn more about arXivLabs .
少即是多
来自 Haoze He 等学者的最新研究论文《Less is MoE: Trimming Experts in Domain-Specialist Language Models》提出,在混合专家模型(MoE)中,针对特定领域任务,许多专家模块可能存在冗余。该研究通过系统性地修剪不必要的专家,在不显著降低模型性能的前提下,大幅减少了模型参数量和推理成本。实验表明,经过修剪后的领域专家语言模型在保持甚至提升任务准确率的同时,计算效率得到显著提升。这一发现挑战了“更多专家更强”的传统认知,为构建轻量化、高效率的领域专用语言模型提供了新思路。 #机器学习 #MoE #专家修剪 #大模型 #自然语言处理 #效率优化 #AI #论文 #研究
来自 Haoze He 等学者的最新研究论文《Less is MoE: Trimming Experts in Domain-Specialist Language Models》提出,在混合专家模型(MoE)中,针对特定领域任务,许多专家模块可能存在冗余。该研究通过系统性地修剪不必要的专家,在不显著降低模型性能的前提下,大幅减少了模型参数量和推理成本。实验表明,经过修剪后的领域专家语言模型在保持甚至提升任务准确率的同时,计算效率得到显著提升。这一发现挑战了“更多专家更强”的传统认知,为构建轻量化、高效率的领域专用语言模型提供了新思路。 #机器学习 #MoE #专家修剪 #大模型 #自然语言处理 #效率优化 #AI #论文 #研究
What Objects Enable, Not What They Are: Functional Latent Spaces for Affordance Reasoning
Focus to learn more arXiv-issued DOI via DataCite (pending registration) Submission history From: Neel P. Bhatt [ view email ] [v1] Thu, 4 Jun 2026 00:26:04 UTC (1,147 KB) Full-text links: Access Paper: View a PDF of the paper titled What Objects Enable, Not What They Are: Functional Latent Spaces for Affordance Reasoning, by Rohan Siva and 8 other authors View PDF HTML (experimental) TeX Source view license Current browse context: < prev | next > new | recent | 2026-06 Change to browse by: cs References & Citations NASA ADS Google Scholar Semantic Scholar export BibTeX citation Loading... BibTeX formatted citation × loading... Data provided by: Bookmark Bibliographic Tools Bibliographic and Citation Tools Bibliographic Explorer Toggle Bibliographic Explorer ( What is the Explorer?
Focus to learn more arXiv-issued DOI via DataCite (pending registration) Submission history From: Neel P. Bhatt [ view email ] [v1] Thu, 4 Jun 2026 00:26:04 UTC (1,147 KB) Full-text links: Access Paper: View a PDF of the paper titled What Objects Enable, Not What They Are: Functional Latent Spaces for Affordance Reasoning, by Rohan Siva and 8 other authors View PDF HTML (experimental) TeX Source view license Current browse context: < prev | next > new | recent | 2026-06 Change to browse by: cs References & Citations NASA ADS Google Scholar Semantic Scholar export BibTeX citation Loading... BibTeX formatted citation × loading... Data provided by: Bookmark Bibliographic Tools Bibliographic and Citation Tools Bibliographic Explorer Toggle Bibliographic Explorer ( What is the Explorer?
) Connected Papers Toggle Connected Papers ( What is Connected Papers? ) Litmaps Toggle Litmaps ( What is Litmaps? ) Toggle scite Smart Citations ( What are Smart Citations? ) Code, Data, Media Code, Data and Media Associated with this Article alphaXiv Toggle alphaXiv ( What is alphaXiv? ) Links to Code Toggle CatalyzeX Code Finder for Papers ( What is CatalyzeX? ) DagsHub Toggle DagsHub ( What is DagsHub? ) GotitPub Toggle ( What is GotitPub? ) Huggingface Toggle Hugging Face ( What is Huggingface? ) ScienceCast Toggle ScienceCast ( What is ScienceCast? ) Demos Demos Replicate Toggle Replicate ( What is Replicate? ) Spaces Toggle Hugging Face Spaces ( What is Spaces? ) Spaces Toggle ( What is ? ) Related Papers Recommenders and Search Tools Link to Influence Flower Influence Flower ( What are Influence Flowers? ) Core recommender toggle CORE Recommender ( What is CORE? ) IArxiv recommender toggle IArxiv Recommender ( What is IArxiv? ) Author Venue Institution Topic About arXivLabs arXivLabs: experimental projects with community collaborators arXivLabs is a framework that allows collaborators to develop and share new arXiv features directly on our website. Both individuals and organizations that work with arXivLabs have embraced and accepted our values of openness, community, excellence, and user data privacy. arXiv is committed to these values and only works with partners that adhere to them. Have an idea for a project that will add value for arXiv's community? Learn more about arXivLabs .
LEVANTE-bench:用认知任务多尺度比较视觉语言模型与儿童
研究人员提出了一项名为LEVANTE-bench的新基准,旨在通过认知任务在多个尺度上比较视觉语言模型(VLM)与儿童的表现。该基准的副标题“你的VLM比五年级学生聪明吗?”揭示了其核心问题。论文由Alvin Wei Ming Tan等五位作者撰写,目前已在arXiv上提交,等待DOI注册。LEVANTE-bench通过设计适合儿童认知水平的任务,系统评估VLM在感知、推理、语言理解等方面的能力,并与真实儿童数据进行对比。这一工作为理解当前视觉语言模型的认知局限性提供了新视角,也为未来模型改进和儿童认知研究搭建了桥梁。 #视觉语言模型 #认知科学 #儿童发展 #基准测试 #AI评估 #arXiv #机器学习
研究人员提出了一项名为LEVANTE-bench的新基准,旨在通过认知任务在多个尺度上比较视觉语言模型(VLM)与儿童的表现。该基准的副标题“你的VLM比五年级学生聪明吗?”揭示了其核心问题。论文由Alvin Wei Ming Tan等五位作者撰写,目前已在arXiv上提交,等待DOI注册。LEVANTE-bench通过设计适合儿童认知水平的任务,系统评估VLM在感知、推理、语言理解等方面的能力,并与真实儿童数据进行对比。这一工作为理解当前视觉语言模型的认知局限性提供了新视角,也为未来模型改进和儿童认知研究搭建了桥梁。 #视觉语言模型 #认知科学 #儿童发展 #基准测试 #AI评估 #arXiv #机器学习
AI设计出“根本性新型疫苗”,可对抗多种病毒
英国剑桥大学研究团队利用人工智能设计出一种新型疫苗技术,这是首个完全由计算机模拟设计活性成分并在人体中测试的疫苗。该疫苗针对沙贝科冠状病毒群,包括新冠病毒、SARS病毒,甚至能对抗可能从动物传播到人类的蝙蝠病毒。2021年12月至2023年9月的临床试验中,39名18至50岁的健康志愿者接种后,体内产生了针对多种病毒的广谱免疫反应。该疫苗采用微流体喷射的无针注射方式,有助于克服针头恐惧、加快大规模接种。研究人员表示,这种“未来性”的通用疫苗不仅可同时抵御多种变异株,还能预防尚未出现的人畜共患病毒。目前二期大规模试验已提上日程,以验证其在更广泛人群中的保护效力。 #AI #疫苗 #人工智能 #剑桥大学 #冠状病毒 #通用疫苗 #医学突破 #科技新闻
英国剑桥大学研究团队利用人工智能设计出一种新型疫苗技术,这是首个完全由计算机模拟设计活性成分并在人体中测试的疫苗。该疫苗针对沙贝科冠状病毒群,包括新冠病毒、SARS病毒,甚至能对抗可能从动物传播到人类的蝙蝠病毒。2021年12月至2023年9月的临床试验中,39名18至50岁的健康志愿者接种后,体内产生了针对多种病毒的广谱免疫反应。该疫苗采用微流体喷射的无针注射方式,有助于克服针头恐惧、加快大规模接种。研究人员表示,这种“未来性”的通用疫苗不仅可同时抵御多种变异株,还能预防尚未出现的人畜共患病毒。目前二期大规模试验已提上日程,以验证其在更广泛人群中的保护效力。 #AI #疫苗 #人工智能 #剑桥大学 #冠状病毒 #通用疫苗 #医学突破 #科技新闻
微软申请专利:Windows将内置AI数据收集控制开关
微软近日申请一项系统级隐私专利,计划在Windows操作系统中内置AI数据收集控制开关。该专利描述了一个类似摄像头指示灯的任务栏图标,实时显示AI数据收集状态,并提供管理界面让用户设置规则(如禁止在特定时段收集)、删除已收集数据或临时暂停。核心是一个运行在Windows内的“ML数据收集协调器”,作为用户与机器学习服务之间的中间人。此举直接回应了Windows Recall等AI功能引发的隐私争议,也顺应了欧盟AI法案等监管要求。若该功能落地,用户将能在一个统一位置控制所有Windows AI功能的数据收集,无需逐个应用查找设置。 #微软 #Windows #AI #隐私 #专利 #数据收集 #系统级控制 #Recall #欧盟AI法案
微软近日申请一项系统级隐私专利,计划在Windows操作系统中内置AI数据收集控制开关。该专利描述了一个类似摄像头指示灯的任务栏图标,实时显示AI数据收集状态,并提供管理界面让用户设置规则(如禁止在特定时段收集)、删除已收集数据或临时暂停。核心是一个运行在Windows内的“ML数据收集协调器”,作为用户与机器学习服务之间的中间人。此举直接回应了Windows Recall等AI功能引发的隐私争议,也顺应了欧盟AI法案等监管要求。若该功能落地,用户将能在一个统一位置控制所有Windows AI功能的数据收集,无需逐个应用查找设置。 #微软 #Windows #AI #隐私 #专利 #数据收集 #系统级控制 #Recall #欧盟AI法案
学习子空间压缩实现通讯高效的流水线并行
近日,一篇题为“Learned Subspace Compression for Communication-Efficient Pipeline Parallelism”的论文被提交至arXiv预印本平台。该论文由Paul Janson等人撰写,针对大规模深度学习模型训练中流水线并行存在的通信瓶颈问题,提出了一种基于学习的子空间压缩方法。该方法能够自动学习模型中间表示的潜在低维子空间,在节点间传输前进行高效压缩,从而显著减少通信数据量,提升并行训练的可扩展性。论文还探讨了该方法与现有梯度压缩技术的兼容性,为未来高效分布式训练系统设计提供了新思路。 #论文 #arXiv #分布式训练 #流水线并行 #通信压缩 #深度学习 #机器学习
近日,一篇题为“Learned Subspace Compression for Communication-Efficient Pipeline Parallelism”的论文被提交至arXiv预印本平台。该论文由Paul Janson等人撰写,针对大规模深度学习模型训练中流水线并行存在的通信瓶颈问题,提出了一种基于学习的子空间压缩方法。该方法能够自动学习模型中间表示的潜在低维子空间,在节点间传输前进行高效压缩,从而显著减少通信数据量,提升并行训练的可扩展性。论文还探讨了该方法与现有梯度压缩技术的兼容性,为未来高效分布式训练系统设计提供了新思路。 #论文 #arXiv #分布式训练 #流水线并行 #通信压缩 #深度学习 #机器学习
面向统一且数据高效的预测与健康管理
该研究提出了一种全新的表格基础模型,旨在统一预测与健康管理(PHM)任务,并显著提升数据效率。传统PHM方法通常针对特定设备或场景单独建模,数据利用率低且泛化能力差。论文通过构建大规模表格数据集,训练预训练基础模型,使其能够迁移学习到各类PHM子任务,如剩余寿命预测、故障检测等。实验表明,该模型在多种工业数据集上以少量样本即可达到甚至超越传统方法的效果,大幅降低了数据标注成本。该工作为工业设备智能运维提供了通用且高效的解决方案,有望推动PHM领域的标准化与规模化应用。 #预测性维护 #健康管理 #基础模型 #表格数据 #数据效率 #AI #工业智能 #机器学习
该研究提出了一种全新的表格基础模型,旨在统一预测与健康管理(PHM)任务,并显著提升数据效率。传统PHM方法通常针对特定设备或场景单独建模,数据利用率低且泛化能力差。论文通过构建大规模表格数据集,训练预训练基础模型,使其能够迁移学习到各类PHM子任务,如剩余寿命预测、故障检测等。实验表明,该模型在多种工业数据集上以少量样本即可达到甚至超越传统方法的效果,大幅降低了数据标注成本。该工作为工业设备智能运维提供了通用且高效的解决方案,有望推动PHM领域的标准化与规模化应用。 #预测性维护 #健康管理 #基础模型 #表格数据 #数据效率 #AI #工业智能 #机器学习
Sharp First-Order Lower Bounds for Higher-Order Smooth Nonconvex Optimization
一篇题为“Sharp First-Order Lower Bounds for Higher-Order Smooth Nonconvex Optimization”的学术论文近日在arXiv预印本平台上线,作者为Dongruo Zhou。该论文聚焦于高阶光滑非凸优化问题,提出了首个尖锐的一阶下界结果。研究针对采用一阶优化方法求解高阶光滑非凸目标函数时的收敛速度,给出了理论上的最小极限,表明即使目标函数具有高阶光滑性,仅依赖梯度信息的方法也无法突破特定收敛速率。这一发现为非凸优化领域的算法设计与复杂度分析提供了新的理论基准,对机器学习和深度学习中的优化理论具有重要参考价值。 #非凸优化 #一阶下界 #高阶光滑 #收敛速度 #优化理论 #机器学习 #深度学习 #arxiv #学术论文 #理论计算机
一篇题为“Sharp First-Order Lower Bounds for Higher-Order Smooth Nonconvex Optimization”的学术论文近日在arXiv预印本平台上线,作者为Dongruo Zhou。该论文聚焦于高阶光滑非凸优化问题,提出了首个尖锐的一阶下界结果。研究针对采用一阶优化方法求解高阶光滑非凸目标函数时的收敛速度,给出了理论上的最小极限,表明即使目标函数具有高阶光滑性,仅依赖梯度信息的方法也无法突破特定收敛速率。这一发现为非凸优化领域的算法设计与复杂度分析提供了新的理论基准,对机器学习和深度学习中的优化理论具有重要参考价值。 #非凸优化 #一阶下界 #高阶光滑 #收敛速度 #优化理论 #机器学习 #深度学习 #arxiv #学术论文 #理论计算机
DP-MacAdam 论文发布
arXiv 平台上新近提交了一篇题为《DP-MacAdam: Differentially Private Mechanism with Adaptive Clipping and Adaptive Momentum》的论文。该论文由 Naima Tasnim 等人撰写,提出了一种结合自适应梯度裁剪和自适应动量更新的差分隐私优化算法。在差分隐私机器学习中,梯度裁剪和动量调整是平衡隐私预算与模型性能的关键环节。DP-MacAdam 通过动态调整裁剪阈值和动量系数,有效缓解了传统方法中收敛缓慢和隐私预算浪费的问题。实验表明,该方法在多个基准数据集上实现了更好的隐私-效用权衡,尤其适用于需要严格隐私保障的大规模深度学习场景。论文已开放预印本,可供研究人员审阅与引用。 #差分隐私 #机器学习 #深度学习 #DP-MacAdam #arXiv #算法 #隐私保护
arXiv 平台上新近提交了一篇题为《DP-MacAdam: Differentially Private Mechanism with Adaptive Clipping and Adaptive Momentum》的论文。该论文由 Naima Tasnim 等人撰写,提出了一种结合自适应梯度裁剪和自适应动量更新的差分隐私优化算法。在差分隐私机器学习中,梯度裁剪和动量调整是平衡隐私预算与模型性能的关键环节。DP-MacAdam 通过动态调整裁剪阈值和动量系数,有效缓解了传统方法中收敛缓慢和隐私预算浪费的问题。实验表明,该方法在多个基准数据集上实现了更好的隐私-效用权衡,尤其适用于需要严格隐私保障的大规模深度学习场景。论文已开放预印本,可供研究人员审阅与引用。 #差分隐私 #机器学习 #深度学习 #DP-MacAdam #arXiv #算法 #隐私保护
Trust, but Don't Verify
一项来自arXiv的最新研究论文揭示了大型语言模型(LLM)在评估信息来源时存在系统性认知盲点。研究者Rohan Pradhan等人发现,当前主流LLM倾向于“信任但不去验证”用户提供的信息来源,缺乏主动核实事实的能力。这种“认知盲点”导致模型容易接受错误或误导性的引用,并据此生成看似合理但实际谬误的答案。研究通过一系列实验测试了多个LLM对虚假来源、捏造引文以及不当授权的反应,结果表明模型普遍缺乏怀疑精神,且难以识别权威性被滥用的情况。该发现对AI系统在高风险决策场景中的可靠性提出了严峻挑战,强调了在模型设计中引入外部验证机制的必要性。 #AI #大语言模型 #认知盲点 #来源验证 #arXiv论文 #LLM #信任与验证 #人工智能安全
一项来自arXiv的最新研究论文揭示了大型语言模型(LLM)在评估信息来源时存在系统性认知盲点。研究者Rohan Pradhan等人发现,当前主流LLM倾向于“信任但不去验证”用户提供的信息来源,缺乏主动核实事实的能力。这种“认知盲点”导致模型容易接受错误或误导性的引用,并据此生成看似合理但实际谬误的答案。研究通过一系列实验测试了多个LLM对虚假来源、捏造引文以及不当授权的反应,结果表明模型普遍缺乏怀疑精神,且难以识别权威性被滥用的情况。该发现对AI系统在高风险决策场景中的可靠性提出了严峻挑战,强调了在模型设计中引入外部验证机制的必要性。 #AI #大语言模型 #认知盲点 #来源验证 #arXiv论文 #LLM #信任与验证 #人工智能安全
模式选择性并非任务因果结构:1B类语言模型中组合任务电路的跨架构机制研究
近日,一篇由Yongzhong Xu提交至arXiv的论文提出,语言模型中神经元的模式选择性并不等同于任务因果结构。研究者对1B参数级别的多种架构(如GPT-2等)进行了跨架构机制分析,通过因果干预手段探测模型在执行组合任务时的内部电路。研究发现,模型中的神经元虽然表现出对特定模式的高度选择性,但这些选择性神经元并不一定构成任务运行的因果路径,二者存在显著分离。该工作挑战了当前可解释性研究中将模式选择性直接视为因果结构的常见假设,指出仅凭激活模式分析不足以揭示模型的真正推理机制。这一发现对于理解大模型内部运作、防止过度解读神经元功能具有重要参考价值。 #AI #大模型 #可解释性 #语言模型 #机器学习 #神经网络 #因果推断 #研究 #论文 #arXiv
近日,一篇由Yongzhong Xu提交至arXiv的论文提出,语言模型中神经元的模式选择性并不等同于任务因果结构。研究者对1B参数级别的多种架构(如GPT-2等)进行了跨架构机制分析,通过因果干预手段探测模型在执行组合任务时的内部电路。研究发现,模型中的神经元虽然表现出对特定模式的高度选择性,但这些选择性神经元并不一定构成任务运行的因果路径,二者存在显著分离。该工作挑战了当前可解释性研究中将模式选择性直接视为因果结构的常见假设,指出仅凭激活模式分析不足以揭示模型的真正推理机制。这一发现对于理解大模型内部运作、防止过度解读神经元功能具有重要参考价值。 #AI #大模型 #可解释性 #语言模型 #机器学习 #神经网络 #因果推断 #研究 #论文 #arXiv
PJ-RoPE: 一种用于相对注意力的傅里叶-喷射
arXiv上近日提交了一篇题为《PJ-RoPE: A Fourier-Jet-Affine Position Space for Relative Attention》的论文,作者为Zhang Yaobo。该论文提出了一种新型位置编码方法PJ-RoPE,通过融合傅里叶变换、喷射变换与仿射变换,构建了一个更灵活的位置空间,旨在改进Transformer模型中相对注意力机制的位置表示能力。该方法有望在长序列建模、语言理解等任务中提升模型性能。论文于2026年6月3日提交,目前正在arXiv上开放获取。 #论文 #AI #位置编码 #注意力机制 #Transformer #arXiv #机器学习
arXiv上近日提交了一篇题为《PJ-RoPE: A Fourier-Jet-Affine Position Space for Relative Attention》的论文,作者为Zhang Yaobo。该论文提出了一种新型位置编码方法PJ-RoPE,通过融合傅里叶变换、喷射变换与仿射变换,构建了一个更灵活的位置空间,旨在改进Transformer模型中相对注意力机制的位置表示能力。该方法有望在长序列建模、语言理解等任务中提升模型性能。论文于2026年6月3日提交,目前正在arXiv上开放获取。 #论文 #AI #位置编码 #注意力机制 #Transformer #arXiv #机器学习