AI知识库 @ai521
696 subscribers
30.2K photos
59 videos
27 files
1.25K links
@ai521 专注分享最实用的AI内容

🤖 AI教程(新手到进阶)
🧠 AI知识科普(大模型 / 提示词 / 自动化)
📰 AI资讯更新(每日最新AI动态)
📚 AI实战技巧(写作 / 绘画 / 编程 / 赚钱)
🔧 最新AI工具推荐

每天更新AI干货
长期做一个真正有价值的AI频道
Download Telegram
onnected Papers? ) Litmaps Toggle Litmaps ( What is Litmaps? ) Toggle scite Smart Citations ( What are Smart Citations? ) Code, Data, Media Code, Data and Media Associated with this Article alphaXiv Toggle alphaXiv ( What is alphaXiv? ) Links to Code Toggle CatalyzeX Code Finder for Papers ( What is CatalyzeX? ) DagsHub Toggle DagsHub ( What is DagsHub? ) GotitPub Toggle ( What is GotitPub? ) Huggingface Toggle Hugging Face ( What is Huggingface? ) ScienceCast Toggle ScienceCast ( What is ScienceCast? ) Demos Demos Replicate Toggle Replicate ( What is Replicate? ) Spaces Toggle Hugging Face Spaces ( What is Spaces? ) Spaces Toggle ( What is ? ) Related Papers Recommenders and Search Tools Link to Influence Flower Influence Flower ( What are Influence Flowers? ) Core recommender toggle CORE Recommender ( What is CORE? ) IArxiv recommender toggle IArxiv Recommender ( What is IArxiv? ) Author Venue Institution Topic About arXivLabs arXivLabs: experimental projects with community collaborators arXivLabs is a framework that allows collaborators to develop and share new arXiv features directly on our website. Both individuals and organizations that work with arXivLabs have embraced and accepted our values of openness, community, excellence, and user data privacy. arXiv is committed to these values and only works with partners that adhere to them. Have an idea for a project that will add value for arXiv's community? Learn more about arXivLabs .
布线胜过混合:Transformer 不同规模间的知识迁移研究

近日,一篇题为“Wiring Beats Blending: What Transfers Between Transformer Sizes — and What Doesn't”的论文在 arXiv 上预印发布。该论文由 Ravi Satya Durga Prasad Yenugula 撰写,主要探讨了在不同规模的 Transformer 模型之间,哪些知识能够有效迁移,哪些则不能。研究通过对比“布线”(wiring)与“混合”(blending)两种迁移策略,揭示了模型规模变化对知识转移效果的影响。这一发现对于理解大模型的可扩展性、优化模型训练策略以及跨尺度知识复用具有重要参考价值。论文已提供 PDF 及 HTML 版本供公开查阅。 #AI #Transformer #知识迁移 #论文 #arXiv #大模型 #机器学习 #深度学习
预测编码网络中的拓扑简化研究

近日,研究人员在arXiv上提交了一篇题为《Topological Simplification in Predictive Coding Networks》的预印本论文。该论文由Adam Shaw等五位作者共同完成,聚焦于预测编码网络中的拓扑简化问题。预测编码是一种源自神经科学的计算框架,常用于机器学习中的自监督学习和生成模型。拓扑简化旨在通过减少网络结构的冗余连接,提升计算效率与泛化能力。研究团队可能提出了新的算法或理论分析,以实现在保持预测编码性能的同时,对网络拓扑进行精简。这一工作有望推动高效脑启发计算模型的发展,并为理解生物神经网络中的信息处理机制提供新视角。论文目前已在arXiv平台公开,并可获取PDF全文。 #预测编码 #拓扑简化 #神经网络 #机器学习 #arXiv #预印本 #脑科学 #计算神经科学 #AI #高效计算
评估盲点:无声测量失败如何从训练到部署破坏AI系统

独立研究员Priyanka Bajaj在arXiv上发布了一篇题为《评估盲点:无声测量失败如何从训练到部署破坏AI系统》的论文。该研究指出,AI系统从训练到部署的整个生命周期中,存在一种被忽视的“评估盲点”——即测量指标失败或评估方法缺陷导致的系统错误。这些无声的失败可能源于数据偏差、评估指标不匹配或测试环境与真实场景的差异,进而导致模型性能被高估、安全漏洞被掩盖,甚至引发部署后的严重后果。论文系统分析了评估盲点的成因、表现及影响,并呼吁社区建立更鲁棒的评估框架,以提升AI系统的可靠性和安全性。 #AI安全 #评估盲点 #论文 #arXiv #机器学习 #模型评估 #AI风险
神经网络局部收敛输入实现高效期权定价建模

一篇发表在arXiv上的研究论文提出了一种基于局部收敛输入的神经网络方法,用于提升期权定价模型的效率。传统期权定价模型如Black-Scholes在计算复杂度和实时性上存在局限,而深度学习模型常因输入维度高、收敛慢而难以实用。该研究通过设计局部收敛的输入结构,使神经网络能够更聚焦于关键定价参数,从而加速训练并提高预测精度。实验表明,新方法在多个期权数据集上均优于现有基线模型,显著降低了计算成本,为金融衍生品定价提供了更高效的解决方案。该工作由Harris Cobb等三位研究者完成,目前论文已可在arXiv预印本平台获取。 #神经网络 #期权定价 #金融科技 #深度学习 #arXiv #计算金融 #高效模型
设计良好的虚拟节点:面向消息传递架构的可寻址与基数保持全局内存

该论文提出了一种用于消息传递架构的新型全局内存设计,名为“虚拟节点”。该设计不仅实现了内存的可寻址性,还保证了基数保持特性,即每个虚拟节点能准确映射并维护其内部数据的数量关系。研究团队通过理论分析和实验验证,展示了该方案在提升并行计算效率、减少通信开销方面的显著优势。这一工作为高性能计算和分布式系统中内存管理提供了新思路,有望简化开发并优化资源利用率,尤其适用于大规模消息传递应用场景。 #计算机科学 #并行计算 #虚拟节点 #全局内存 #消息传递 #高性能计算 #架构设计 #论文
AI方法助力生产级加密库验证

来自Chuyue Sun等8位作者的研究团队在arXiv上发表了一篇论文,提出了一种利用人工智能技术验证生产级加密库的新方法。该方法旨在通过AI辅助的形式化验证,确保加密库实现的正确性与安全性,从而降低因代码缺陷引发的安全风险。研究聚焦于自动验证加密库的数学正确性,以应对日益复杂的密码学安全需求。该工作为密码学软件的安全实践提供了新的技术路径,有望提升加密库部署的可靠性。 #AI #加密库 #形式化验证 #密码学 #arXiv #安全 #技术论文
AI代理文件协议实现跨模型协作共识

一个名为“agent-talk”的开源项目提出了一种新颖的AI代理协作方式:两个代理通过共享一个Markdown文件轮流编辑,无需服务器或框架,直到达成共识。该协议定义了一套简单规则:一个代理启动会话,另一个加入,双方交替修改同一份文档,最终收敛为最终答案。它支持Claude Code、Codex、Grok等任何能读写文件的模型,并具备超时机制避免死循环。与传统的对话日志不同,整个会话过程实时演变为一份可交付的文档,而非累积的聊天记录。项目已在生产环境中用于处理代码分支分歧、任务交接等场景,并采用MIT许可证开源。 #AI代理 #文件协议 #开源 #协作 #大模型 #consensus #agent-talk #Markdown #跨模型
Rust 项目采用 LLM 使用政策,规范 AI 辅助贡献

Rust 项目下五个团队近日通过了一项由作者起草的 LLM 使用政策,规范在 rust-lang/rust 单仓库中贡献时如何使用大语言模型。该政策并非官方立场,也非全项目适用,而是针对特定目的制定。随着 LLM 被用于生成代码、翻译消息、分析 RFC 等,社区出现了虚假贡献信号、PR 数量激增、评审负担加重等问题。原有的非正式渠道和审核规则缺乏透明度,新政策将规则公开化,使新贡献者明确合规方式,同时为评审者提供关闭不合规 PR 的明确依据。政策强调,LLM 生成的精美代码不再代表贡献者的实际投入和理解,也削弱了长期留存的可能性。目前 rust-lang/rust 有超过 1281 个未关闭 PR,评审压力巨大,新政策旨在平衡效率与社区协作质量。 #Rust #LLM #开源 #政策 #AI #编程语言 #代码审查 #社区治理
2026 中国 AGI 创新影响力机构 TOP 30 榜单发布

近日,智源社区发布“2026 中国 AGI 创新影响力机构 TOP 30”榜单。过去一年,AI 行业重心回归模型创新,DeepSeek 从 R1 升级至 V4,开源与闭源模型能力差距显著缩小;智谱、MiniMax 登陆港交所,成为全球首批上市大模型公司;Kimi 发布 2.8 万亿参数 K3,Qwen 持续多尺寸多模态开源。行业变革已超越模型层,Coding Agent 大规模落地,vibe coding 等新范式兴起,AI 正加速向工程化、产品化和场景化纵深发展,技术价值日益体现在实际生产力提升与生态协同中。 #AGI #人工智能 #大模型 #智源社区 #DeepSeek #智谱 #MiniMax #Kimi #Qwen #行业榜单
NANQ:面向模拟存内计算的噪声感知混合精度非均匀量化方法

arXiv上近日公开了一篇题为《NANQ: Noise-Floor-Aware Mixed-Precision Non-Uniform Quantization for Analog Compute-in-Memory》的论文。该研究由Yizhe Chen等人完成,提出了一种针对模拟存内计算(CIM)硬件的新型量化技术。模拟CIM由于噪声底限的存在,传统均匀量化精度受限。NANQ方法通过感知噪声底限,采用混合精度非均匀量化策略,在保持模型精度的同时显著降低硬件开销。实验表明,该方法在多个神经网络任务上优于现有量化方案,为模拟存内计算的实际部署提供了有效路径。 #论文 #AI #量化 #模拟计算 #存内计算 #神经网络 #芯片 #硬件
基于归因可分离性的解释器稳定性测量方法论文发布

近期,一篇题为《Measuring Explainer Stability via Attribution Separability》的论文在arXiv预印本平台上线,作者为Eddie Conti等。该论文聚焦于机器学习模型可解释性领域,提出了一种通过归因可分离性(Attribution Separability)来量化解释器稳定性的新方法。解释器稳定性是评估模型解释结果可靠性的关键指标,现有方法往往难以准确衡量。该研究通过引入归因可分离性概念,为解释器稳定性提供了更鲁棒的测量手段,有助于提升AI模型的可信度与透明度。论文已通过DataCite获得arXiv编号,处于待注册状态,并提供PDF及HTML版本供学术社区查阅。 #arXiv #可解释性AI #归因可分离性 #解释器稳定性 #机器学习 #AI安全 #论文
PatTree:自动创建多模态图结构患者表示的新方法助力医学分类

近日,一篇题为《PatTree:一种用于医学分类任务的自动创建多模态、图结构患者表示的新方法》的论文在arXiv预印本平台发布。该研究由Julia Gehrmann等作者提出,旨在解决医学领域多模态数据整合与分类的难题。PatTree方法通过自动化构建基于图的患者表示,将影像、文本、基因等多模态信息融合为结构化图模型,从而提升疾病诊断、预后预测等医学分类任务的准确性与可解释性。该方法有望为临床决策支持系统提供更高效、更可靠的技术工具,推动医疗人工智能向实用化迈进一步。 #医学AI #多模态学习 #图神经网络 #患者表示 #论文 #arXiv #医疗分类
输出感知旋转:INT2 KV

近日,一篇题为《Output-Aware Rotation for INT2 KV-Cache Quantization》的论文在arXiv上发布。该研究由Vincent-Daniel Yun等六位作者共同完成,提出了一种针对大语言模型推理过程中KV-Cache的INT2量化新方法——输出感知旋转。传统量化方法在极低比特(如INT2)下会导致严重的精度损失,而该方法通过引入输出感知的旋转操作,有效降低了量化误差,在不显著牺牲模型性能的前提下大幅压缩了KV-Cache的内存占用。实验表明,该技术能够在保持模型输出质量的同时,实现更高效的内存利用,为大型语言模型的部署与推理优化提供了新的思路。 #论文 #量化 #KV-Cache #LLM #AI #压缩技术 #INT2 #机器学习
GLOBE:轨迹对齐梯度匹配与结构化稀疏优化实现核心集高效选择

arXiv 上最新发布的一篇论文提出了 GLOBE 方法,用于解决机器学习中的核心集选择问题。核心集选择旨在从大规模数据中筛选出最具代表性的子集,以降低训练开销而不损失模型性能。现有方法常忽略数据间的结构化稀疏特性,导致所选子集信息冗余。GLOBE 通过引入轨迹对齐的梯度匹配机制,确保所选子集在训练过程中能模拟全量数据的梯度变化,同时结合结构化稀疏优化,进一步剔除冗余样本。实验表明,在多个基准数据集上,GLOBE 在保持分类精度的前提下,将训练数据量压缩至原来的 10% 以下,且在模型收敛速度和泛化能力上优于现有方法。该研究为高效训练大模型提供了新的数据筛选思路。 #核心集选择 #机器学习 #GLOBE #梯度匹配 #结构化稀疏 #数据筛选 #arXiv论文 #AI研究