布线胜过混合:Transformer 不同规模间的知识迁移研究
近日,一篇题为“Wiring Beats Blending: What Transfers Between Transformer Sizes — and What Doesn't”的论文在 arXiv 上预印发布。该论文由 Ravi Satya Durga Prasad Yenugula 撰写,主要探讨了在不同规模的 Transformer 模型之间,哪些知识能够有效迁移,哪些则不能。研究通过对比“布线”(wiring)与“混合”(blending)两种迁移策略,揭示了模型规模变化对知识转移效果的影响。这一发现对于理解大模型的可扩展性、优化模型训练策略以及跨尺度知识复用具有重要参考价值。论文已提供 PDF 及 HTML 版本供公开查阅。 #AI #Transformer #知识迁移 #论文 #arXiv #大模型 #机器学习 #深度学习
近日,一篇题为“Wiring Beats Blending: What Transfers Between Transformer Sizes — and What Doesn't”的论文在 arXiv 上预印发布。该论文由 Ravi Satya Durga Prasad Yenugula 撰写,主要探讨了在不同规模的 Transformer 模型之间,哪些知识能够有效迁移,哪些则不能。研究通过对比“布线”(wiring)与“混合”(blending)两种迁移策略,揭示了模型规模变化对知识转移效果的影响。这一发现对于理解大模型的可扩展性、优化模型训练策略以及跨尺度知识复用具有重要参考价值。论文已提供 PDF 及 HTML 版本供公开查阅。 #AI #Transformer #知识迁移 #论文 #arXiv #大模型 #机器学习 #深度学习
预测编码网络中的拓扑简化研究
近日,研究人员在arXiv上提交了一篇题为《Topological Simplification in Predictive Coding Networks》的预印本论文。该论文由Adam Shaw等五位作者共同完成,聚焦于预测编码网络中的拓扑简化问题。预测编码是一种源自神经科学的计算框架,常用于机器学习中的自监督学习和生成模型。拓扑简化旨在通过减少网络结构的冗余连接,提升计算效率与泛化能力。研究团队可能提出了新的算法或理论分析,以实现在保持预测编码性能的同时,对网络拓扑进行精简。这一工作有望推动高效脑启发计算模型的发展,并为理解生物神经网络中的信息处理机制提供新视角。论文目前已在arXiv平台公开,并可获取PDF全文。 #预测编码 #拓扑简化 #神经网络 #机器学习 #arXiv #预印本 #脑科学 #计算神经科学 #AI #高效计算
近日,研究人员在arXiv上提交了一篇题为《Topological Simplification in Predictive Coding Networks》的预印本论文。该论文由Adam Shaw等五位作者共同完成,聚焦于预测编码网络中的拓扑简化问题。预测编码是一种源自神经科学的计算框架,常用于机器学习中的自监督学习和生成模型。拓扑简化旨在通过减少网络结构的冗余连接,提升计算效率与泛化能力。研究团队可能提出了新的算法或理论分析,以实现在保持预测编码性能的同时,对网络拓扑进行精简。这一工作有望推动高效脑启发计算模型的发展,并为理解生物神经网络中的信息处理机制提供新视角。论文目前已在arXiv平台公开,并可获取PDF全文。 #预测编码 #拓扑简化 #神经网络 #机器学习 #arXiv #预印本 #脑科学 #计算神经科学 #AI #高效计算
评估盲点:无声测量失败如何从训练到部署破坏AI系统
独立研究员Priyanka Bajaj在arXiv上发布了一篇题为《评估盲点:无声测量失败如何从训练到部署破坏AI系统》的论文。该研究指出,AI系统从训练到部署的整个生命周期中,存在一种被忽视的“评估盲点”——即测量指标失败或评估方法缺陷导致的系统错误。这些无声的失败可能源于数据偏差、评估指标不匹配或测试环境与真实场景的差异,进而导致模型性能被高估、安全漏洞被掩盖,甚至引发部署后的严重后果。论文系统分析了评估盲点的成因、表现及影响,并呼吁社区建立更鲁棒的评估框架,以提升AI系统的可靠性和安全性。 #AI安全 #评估盲点 #论文 #arXiv #机器学习 #模型评估 #AI风险
独立研究员Priyanka Bajaj在arXiv上发布了一篇题为《评估盲点:无声测量失败如何从训练到部署破坏AI系统》的论文。该研究指出,AI系统从训练到部署的整个生命周期中,存在一种被忽视的“评估盲点”——即测量指标失败或评估方法缺陷导致的系统错误。这些无声的失败可能源于数据偏差、评估指标不匹配或测试环境与真实场景的差异,进而导致模型性能被高估、安全漏洞被掩盖,甚至引发部署后的严重后果。论文系统分析了评估盲点的成因、表现及影响,并呼吁社区建立更鲁棒的评估框架,以提升AI系统的可靠性和安全性。 #AI安全 #评估盲点 #论文 #arXiv #机器学习 #模型评估 #AI风险
神经网络局部收敛输入实现高效期权定价建模
一篇发表在arXiv上的研究论文提出了一种基于局部收敛输入的神经网络方法,用于提升期权定价模型的效率。传统期权定价模型如Black-Scholes在计算复杂度和实时性上存在局限,而深度学习模型常因输入维度高、收敛慢而难以实用。该研究通过设计局部收敛的输入结构,使神经网络能够更聚焦于关键定价参数,从而加速训练并提高预测精度。实验表明,新方法在多个期权数据集上均优于现有基线模型,显著降低了计算成本,为金融衍生品定价提供了更高效的解决方案。该工作由Harris Cobb等三位研究者完成,目前论文已可在arXiv预印本平台获取。 #神经网络 #期权定价 #金融科技 #深度学习 #arXiv #计算金融 #高效模型
一篇发表在arXiv上的研究论文提出了一种基于局部收敛输入的神经网络方法,用于提升期权定价模型的效率。传统期权定价模型如Black-Scholes在计算复杂度和实时性上存在局限,而深度学习模型常因输入维度高、收敛慢而难以实用。该研究通过设计局部收敛的输入结构,使神经网络能够更聚焦于关键定价参数,从而加速训练并提高预测精度。实验表明,新方法在多个期权数据集上均优于现有基线模型,显著降低了计算成本,为金融衍生品定价提供了更高效的解决方案。该工作由Harris Cobb等三位研究者完成,目前论文已可在arXiv预印本平台获取。 #神经网络 #期权定价 #金融科技 #深度学习 #arXiv #计算金融 #高效模型
AI代理文件协议实现跨模型协作共识
一个名为“agent-talk”的开源项目提出了一种新颖的AI代理协作方式:两个代理通过共享一个Markdown文件轮流编辑,无需服务器或框架,直到达成共识。该协议定义了一套简单规则:一个代理启动会话,另一个加入,双方交替修改同一份文档,最终收敛为最终答案。它支持Claude Code、Codex、Grok等任何能读写文件的模型,并具备超时机制避免死循环。与传统的对话日志不同,整个会话过程实时演变为一份可交付的文档,而非累积的聊天记录。项目已在生产环境中用于处理代码分支分歧、任务交接等场景,并采用MIT许可证开源。 #AI代理 #文件协议 #开源 #协作 #大模型 #consensus #agent-talk #Markdown #跨模型
一个名为“agent-talk”的开源项目提出了一种新颖的AI代理协作方式:两个代理通过共享一个Markdown文件轮流编辑,无需服务器或框架,直到达成共识。该协议定义了一套简单规则:一个代理启动会话,另一个加入,双方交替修改同一份文档,最终收敛为最终答案。它支持Claude Code、Codex、Grok等任何能读写文件的模型,并具备超时机制避免死循环。与传统的对话日志不同,整个会话过程实时演变为一份可交付的文档,而非累积的聊天记录。项目已在生产环境中用于处理代码分支分歧、任务交接等场景,并采用MIT许可证开源。 #AI代理 #文件协议 #开源 #协作 #大模型 #consensus #agent-talk #Markdown #跨模型
Rust 项目采用 LLM 使用政策,规范 AI 辅助贡献
Rust 项目下五个团队近日通过了一项由作者起草的 LLM 使用政策,规范在 rust-lang/rust 单仓库中贡献时如何使用大语言模型。该政策并非官方立场,也非全项目适用,而是针对特定目的制定。随着 LLM 被用于生成代码、翻译消息、分析 RFC 等,社区出现了虚假贡献信号、PR 数量激增、评审负担加重等问题。原有的非正式渠道和审核规则缺乏透明度,新政策将规则公开化,使新贡献者明确合规方式,同时为评审者提供关闭不合规 PR 的明确依据。政策强调,LLM 生成的精美代码不再代表贡献者的实际投入和理解,也削弱了长期留存的可能性。目前 rust-lang/rust 有超过 1281 个未关闭 PR,评审压力巨大,新政策旨在平衡效率与社区协作质量。 #Rust #LLM #开源 #政策 #AI #编程语言 #代码审查 #社区治理
Rust 项目下五个团队近日通过了一项由作者起草的 LLM 使用政策,规范在 rust-lang/rust 单仓库中贡献时如何使用大语言模型。该政策并非官方立场,也非全项目适用,而是针对特定目的制定。随着 LLM 被用于生成代码、翻译消息、分析 RFC 等,社区出现了虚假贡献信号、PR 数量激增、评审负担加重等问题。原有的非正式渠道和审核规则缺乏透明度,新政策将规则公开化,使新贡献者明确合规方式,同时为评审者提供关闭不合规 PR 的明确依据。政策强调,LLM 生成的精美代码不再代表贡献者的实际投入和理解,也削弱了长期留存的可能性。目前 rust-lang/rust 有超过 1281 个未关闭 PR,评审压力巨大,新政策旨在平衡效率与社区协作质量。 #Rust #LLM #开源 #政策 #AI #编程语言 #代码审查 #社区治理
2026 中国 AGI 创新影响力机构 TOP 30 榜单发布
近日,智源社区发布“2026 中国 AGI 创新影响力机构 TOP 30”榜单。过去一年,AI 行业重心回归模型创新,DeepSeek 从 R1 升级至 V4,开源与闭源模型能力差距显著缩小;智谱、MiniMax 登陆港交所,成为全球首批上市大模型公司;Kimi 发布 2.8 万亿参数 K3,Qwen 持续多尺寸多模态开源。行业变革已超越模型层,Coding Agent 大规模落地,vibe coding 等新范式兴起,AI 正加速向工程化、产品化和场景化纵深发展,技术价值日益体现在实际生产力提升与生态协同中。 #AGI #人工智能 #大模型 #智源社区 #DeepSeek #智谱 #MiniMax #Kimi #Qwen #行业榜单
近日,智源社区发布“2026 中国 AGI 创新影响力机构 TOP 30”榜单。过去一年,AI 行业重心回归模型创新,DeepSeek 从 R1 升级至 V4,开源与闭源模型能力差距显著缩小;智谱、MiniMax 登陆港交所,成为全球首批上市大模型公司;Kimi 发布 2.8 万亿参数 K3,Qwen 持续多尺寸多模态开源。行业变革已超越模型层,Coding Agent 大规模落地,vibe coding 等新范式兴起,AI 正加速向工程化、产品化和场景化纵深发展,技术价值日益体现在实际生产力提升与生态协同中。 #AGI #人工智能 #大模型 #智源社区 #DeepSeek #智谱 #MiniMax #Kimi #Qwen #行业榜单
NANQ:面向模拟存内计算的噪声感知混合精度非均匀量化方法
arXiv上近日公开了一篇题为《NANQ: Noise-Floor-Aware Mixed-Precision Non-Uniform Quantization for Analog Compute-in-Memory》的论文。该研究由Yizhe Chen等人完成,提出了一种针对模拟存内计算(CIM)硬件的新型量化技术。模拟CIM由于噪声底限的存在,传统均匀量化精度受限。NANQ方法通过感知噪声底限,采用混合精度非均匀量化策略,在保持模型精度的同时显著降低硬件开销。实验表明,该方法在多个神经网络任务上优于现有量化方案,为模拟存内计算的实际部署提供了有效路径。 #论文 #AI #量化 #模拟计算 #存内计算 #神经网络 #芯片 #硬件
arXiv上近日公开了一篇题为《NANQ: Noise-Floor-Aware Mixed-Precision Non-Uniform Quantization for Analog Compute-in-Memory》的论文。该研究由Yizhe Chen等人完成,提出了一种针对模拟存内计算(CIM)硬件的新型量化技术。模拟CIM由于噪声底限的存在,传统均匀量化精度受限。NANQ方法通过感知噪声底限,采用混合精度非均匀量化策略,在保持模型精度的同时显著降低硬件开销。实验表明,该方法在多个神经网络任务上优于现有量化方案,为模拟存内计算的实际部署提供了有效路径。 #论文 #AI #量化 #模拟计算 #存内计算 #神经网络 #芯片 #硬件
基于归因可分离性的解释器稳定性测量方法论文发布
近期,一篇题为《Measuring Explainer Stability via Attribution Separability》的论文在arXiv预印本平台上线,作者为Eddie Conti等。该论文聚焦于机器学习模型可解释性领域,提出了一种通过归因可分离性(Attribution Separability)来量化解释器稳定性的新方法。解释器稳定性是评估模型解释结果可靠性的关键指标,现有方法往往难以准确衡量。该研究通过引入归因可分离性概念,为解释器稳定性提供了更鲁棒的测量手段,有助于提升AI模型的可信度与透明度。论文已通过DataCite获得arXiv编号,处于待注册状态,并提供PDF及HTML版本供学术社区查阅。 #arXiv #可解释性AI #归因可分离性 #解释器稳定性 #机器学习 #AI安全 #论文
近期,一篇题为《Measuring Explainer Stability via Attribution Separability》的论文在arXiv预印本平台上线,作者为Eddie Conti等。该论文聚焦于机器学习模型可解释性领域,提出了一种通过归因可分离性(Attribution Separability)来量化解释器稳定性的新方法。解释器稳定性是评估模型解释结果可靠性的关键指标,现有方法往往难以准确衡量。该研究通过引入归因可分离性概念,为解释器稳定性提供了更鲁棒的测量手段,有助于提升AI模型的可信度与透明度。论文已通过DataCite获得arXiv编号,处于待注册状态,并提供PDF及HTML版本供学术社区查阅。 #arXiv #可解释性AI #归因可分离性 #解释器稳定性 #机器学习 #AI安全 #论文
PatTree:自动创建多模态图结构患者表示的新方法助力医学分类
近日,一篇题为《PatTree:一种用于医学分类任务的自动创建多模态、图结构患者表示的新方法》的论文在arXiv预印本平台发布。该研究由Julia Gehrmann等作者提出,旨在解决医学领域多模态数据整合与分类的难题。PatTree方法通过自动化构建基于图的患者表示,将影像、文本、基因等多模态信息融合为结构化图模型,从而提升疾病诊断、预后预测等医学分类任务的准确性与可解释性。该方法有望为临床决策支持系统提供更高效、更可靠的技术工具,推动医疗人工智能向实用化迈进一步。 #医学AI #多模态学习 #图神经网络 #患者表示 #论文 #arXiv #医疗分类
近日,一篇题为《PatTree:一种用于医学分类任务的自动创建多模态、图结构患者表示的新方法》的论文在arXiv预印本平台发布。该研究由Julia Gehrmann等作者提出,旨在解决医学领域多模态数据整合与分类的难题。PatTree方法通过自动化构建基于图的患者表示,将影像、文本、基因等多模态信息融合为结构化图模型,从而提升疾病诊断、预后预测等医学分类任务的准确性与可解释性。该方法有望为临床决策支持系统提供更高效、更可靠的技术工具,推动医疗人工智能向实用化迈进一步。 #医学AI #多模态学习 #图神经网络 #患者表示 #论文 #arXiv #医疗分类
输出感知旋转:INT2 KV
近日,一篇题为《Output-Aware Rotation for INT2 KV-Cache Quantization》的论文在arXiv上发布。该研究由Vincent-Daniel Yun等六位作者共同完成,提出了一种针对大语言模型推理过程中KV-Cache的INT2量化新方法——输出感知旋转。传统量化方法在极低比特(如INT2)下会导致严重的精度损失,而该方法通过引入输出感知的旋转操作,有效降低了量化误差,在不显著牺牲模型性能的前提下大幅压缩了KV-Cache的内存占用。实验表明,该技术能够在保持模型输出质量的同时,实现更高效的内存利用,为大型语言模型的部署与推理优化提供了新的思路。 #论文 #量化 #KV-Cache #LLM #AI #压缩技术 #INT2 #机器学习
近日,一篇题为《Output-Aware Rotation for INT2 KV-Cache Quantization》的论文在arXiv上发布。该研究由Vincent-Daniel Yun等六位作者共同完成,提出了一种针对大语言模型推理过程中KV-Cache的INT2量化新方法——输出感知旋转。传统量化方法在极低比特(如INT2)下会导致严重的精度损失,而该方法通过引入输出感知的旋转操作,有效降低了量化误差,在不显著牺牲模型性能的前提下大幅压缩了KV-Cache的内存占用。实验表明,该技术能够在保持模型输出质量的同时,实现更高效的内存利用,为大型语言模型的部署与推理优化提供了新的思路。 #论文 #量化 #KV-Cache #LLM #AI #压缩技术 #INT2 #机器学习
GLOBE:轨迹对齐梯度匹配与结构化稀疏优化实现核心集高效选择
arXiv 上最新发布的一篇论文提出了 GLOBE 方法,用于解决机器学习中的核心集选择问题。核心集选择旨在从大规模数据中筛选出最具代表性的子集,以降低训练开销而不损失模型性能。现有方法常忽略数据间的结构化稀疏特性,导致所选子集信息冗余。GLOBE 通过引入轨迹对齐的梯度匹配机制,确保所选子集在训练过程中能模拟全量数据的梯度变化,同时结合结构化稀疏优化,进一步剔除冗余样本。实验表明,在多个基准数据集上,GLOBE 在保持分类精度的前提下,将训练数据量压缩至原来的 10% 以下,且在模型收敛速度和泛化能力上优于现有方法。该研究为高效训练大模型提供了新的数据筛选思路。 #核心集选择 #机器学习 #GLOBE #梯度匹配 #结构化稀疏 #数据筛选 #arXiv论文 #AI研究
arXiv 上最新发布的一篇论文提出了 GLOBE 方法,用于解决机器学习中的核心集选择问题。核心集选择旨在从大规模数据中筛选出最具代表性的子集,以降低训练开销而不损失模型性能。现有方法常忽略数据间的结构化稀疏特性,导致所选子集信息冗余。GLOBE 通过引入轨迹对齐的梯度匹配机制,确保所选子集在训练过程中能模拟全量数据的梯度变化,同时结合结构化稀疏优化,进一步剔除冗余样本。实验表明,在多个基准数据集上,GLOBE 在保持分类精度的前提下,将训练数据量压缩至原来的 10% 以下,且在模型收敛速度和泛化能力上优于现有方法。该研究为高效训练大模型提供了新的数据筛选思路。 #核心集选择 #机器学习 #GLOBE #梯度匹配 #结构化稀疏 #数据筛选 #arXiv论文 #AI研究