AI知识库 @ai521
746 subscribers
30.2K photos
59 videos
27 files
1.25K links
@ai521 专注分享最实用的AI内容

🤖 AI教程(新手到进阶)
🧠 AI知识科普(大模型 / 提示词 / 自动化)
📰 AI资讯更新(每日最新AI动态)
📚 AI实战技巧(写作 / 绘画 / 编程 / 赚钱)
🔧 最新AI工具推荐

每天更新AI干货
长期做一个真正有价值的AI频道
Download Telegram
校准偏好学习

近日,一篇题为《Calibrated Preference Learning: The Case of Label Ranking》的论文在arXiv上公开。该研究由Santo M. A. R. Thies等五位学者共同完成,聚焦于“校准偏好学习”问题,并以标签排序(Label Ranking)为具体案例进行深入探讨。偏好学习是机器学习中关于从用户偏好数据中学习排序模型的重要分支,而校准则旨在提升模型输出概率或得分的可靠性。论文可能提出了一种新的校准策略,用于改进标签排序任务的预测质量与置信度评估。该工作预计将对推荐系统、信息检索及决策支持等领域产生积极影响。目前全文以PDF和HTML格式开放获取。 #arXiv #机器学习 #偏好学习 #标签排序 #校准 #学术论文 #AI
NumLeak:公共数值基准测试在基础模型中成为潜在标签

一篇题为《NumLeak: Public Numeric Benchmarks as Latent Labels in Foundation Models》的论文揭示了重大隐患:基础模型在训练过程中可能隐式“记住”并利用公开的数值基准测试数据,从而将其作为潜在标签来提升测试成绩。研究指出,许多广泛使用的基准(如数学推理、代码评测等)的数据被包含在训练语料中,导致模型在评估时出现虚假高分,而真实世界泛化能力被严重高估。该发现警示AI社区需重新审视基准测试的独立性设计,并推动开发去污染的训练与评估协议,以确保模型能力的可信度量。 #NumLeak #基准测试污染 #基础模型 #AI安全 #数据泄露 #arXiv
新方法利用小波变换和频谱流匹配生成fMRI时间序列,助力脑疾病识别

近日,一项发表于arXiv的研究提出了一种基于小波图像变换和频谱流匹配的生成模型,用于合成功能性磁共振成像(fMRI)时间序列数据。该模型旨在解决脑疾病识别中fMRI数据稀缺、采集成本高的问题。研究团队通过小波变换对原始脑影像进行多尺度分解,再结合频谱流匹配技术,从噪声中学习数据分布,从而生成逼真的fMRI时序信号。实验表明,生成的数据在保留脑功能连接模式的同时,能有效提升下游分类模型在阿尔茨海默病等脑疾病诊断中的性能。这一方法有望为神经影像数据增强和精准医疗提供新工具。 #fMRI #小波变换 #频谱流匹配 #脑疾病 #人工智能 #医学影像 #时间序列生成 #数据增强 #神经科学
VeriGate

来自arXiv预印本,由Aakriti Agrawal等人于2026年5月28日提交的论文《VeriGate: Verifier-Gated Step-Level Supervision for GRPO》提出了一种新方法。该方法通过引入验证器门控机制,为GRPO(群体相对策略优化)框架提供步级监督信号,旨在解决强化学习中奖励稀疏与信用分配难题。VeriGate利用验证器自动判断中间步骤的正确性,从而更精细地指导策略优化,提升多步决策任务的学习效率。目前论文全文已在arXiv开放获取。 #arXiv #论文 #强化学习 #GRPO #VeriGate #验证器 #步级监督
Telegram必备的搜索引擎,极搜JISOU帮你精准找到,想要的群组、频道、视频、音乐

👉 t.me/jisou2?start=a_8247614025
黑盒大模型蒸馏新方法

arXiv上近日发布了一篇题为《Bounded Behavioral Indistinguishability for Black-Box LLM Distillation》的论文。该论文由Munawar Hasan撰写,提出了一种名为“有界行为不可区分性”的新概念,用于黑盒大语言模型蒸馏。该方法旨在解决在黑盒环境下(即无法获取模型内部参数)高效蒸馏大模型的问题,通过确保学生模型在与教师模型的行为在一定边界内不可区分,从而在保持性能的同时降低计算成本。该研究对推动大模型的高效部署和隐私保护具有重要意义。 #大模型蒸馏 #黑盒蒸馏 #有界行为 #LLM #AI #论文 #arXiv
LongDS-Bench

来自中国科学院等机构的研究团队发表论文,提出新基准LongDS-Bench,系统评估了当前大语言模型驱动的智能体在长时程数据分析任务中的表现。研究发现,现有主流模型(如GPT-4、Claude等)在需要多步推理、长期依赖记忆和自适应策略调整的复杂分析场景中普遍失败,平均成功率不足30%。该基准包含多领域真实数据集的扩展任务链,揭示出模型在信息遗忘、步骤回溯和错误累积等关键瓶颈。这一工作为开发更鲁棒的长期自主数据分析智能体提供了重要评估框架。 #AI #数据分析 #大模型 #智能体 #基准测试 #论文 #机器学习
基于AIS的海洋异常检测新评估指标MADQI

一篇来自arXiv的论文提出了一种名为MADQI的新型评估指标,专门用于基于自动识别系统(AIS)的海洋异常检测中的无监督学习。该指标旨在解决当前无监督异常检测方法缺乏统一、可靠评估标准的问题。研究团队通过理论分析和实验验证,展示了MADQI在衡量检测性能、鲁棒性及可解释性方面的优势。这一成果有望提升海事监控系统的智能化水平,为船舶行为分析、海上安全预警等领域提供更科学的评估工具。 #海洋异常检测 #AIS #无监督学习 #评估指标 #MADQI #海事安全 #人工智能
无需深度神经网络的大语言模型

一篇发表于arXiv的论文提出了一种不依赖深度神经网络的大语言模型新架构。该研究由Vincent Granville完成,详细阐述了这种替代方案的设计原理、性能优势及实际案例。与传统基于深度神经网络的LLM不同,新架构在计算效率、可解释性和资源需求上展现出显著改进,有望降低大模型训练与部署的门槛。论文通过具体案例验证了该架构在文本生成、推理等任务中的可行性,为未来大语言模型的发展提供了全新思路。 #大语言模型 #新架构 #深度学习 #AI #论文 #arXiv #机器学习 #自然语言处理
大语言模型学会持续犯错

一项最新研究探讨了大语言模型在合成欺骗任务中的表现。研究人员通过多模型对比,分析了模型内部线性表征与欺骗行为的关系,发现模型会持续且一致地产生错误。该研究揭示了LLM在特定情境下系统性犯错的机制,对理解模型可靠性和安全性具有重要意义。 #大语言模型 #LLM #欺骗 #线性表征 #AI安全 #多模型研究 #arXiv
Unicorn

近日,一篇题为 "Unicorn: Scaling High-Dimensional Time Series Forecasting via Universal Correlation Modeling" 的论文在 arXiv 上发布。该研究由 Haochen Yuan 等四位作者共同完成,提出了一种名为 Unicorn 的新框架,旨在通过通用相关建模实现高维时间序列预测的可扩展性。论文探讨了如何利用统一的模型结构捕捉变量间的复杂相关性,从而提升预测性能。该工作有望应用于金融、气象、能源等众多需要处理大量时序数据的领域。目前论文已提供 PDF 和 HTML 版本供研究社区查阅。 #论文 #时间序列预测 #机器学习 #AI #arXiv #高维数据 #相关性建模
Gait2Hip-60:基于多节奏步态运动学预测髋部肌肉力与关节力矩的统一深度学习基准

来自Jiaqi Zhang等研究者的论文《Gait2Hip-60》在arXiv预印本平台发布。该研究提出了一个统一的深度学习基准,旨在从多节奏步态运动学数据中预测髋部肌肉力和关节力矩。传统方法依赖复杂的肌肉骨骼模型或昂贵的实验设备,而该基准通过端到端的深度学习框架,利用公开数据集构建标准化评估体系,有望简化步态分析流程,提升康复医学、运动科学及人机交互领域的预测效率与可重复性。论文提供了完整的代码与数据链接,为后续研究奠定基础。 #深度学习 #步态分析 #生物力学 #髋关节 #肌肉力预测 #arXiv #AI医疗
QASM-Eval数据集发布,助力LLM理解量子电路指令

arXiv平台近日公开了一篇预印本论文,介绍了名为QASM-Eval的新数据集。该数据集由Zhenxiao Fu等研究者创建,专门设计用于训练和评估大语言模型在OpenQASM-3量子电路编程语言上的表现。与传统量子电路数据集不同,QASM-Eval覆盖了超越典型电路描述的多样化任务,旨在提升LLM对量子指令的解读与生成能力。研究团队希望通过这一基准,推动量子计算与大语言模型的交叉融合,为未来自动量子程序编写和验证奠定基础。论文已提供PDF全文,并可通过arXiv获取。 #QASM-Eval #量子计算 #LLM #OpenQASM3 #AI #数据集 #arXiv #科技前沿
英伟达发布Vera BlueField-4 STX,片上安全技术护航代理式AI存储

英伟达近日推出Vera BlueField-4 STX,这是一款集成片上安全技术的智能网卡,专为代理式AI工作负载设计。通过增强的DOCA安全功能,该产品能在硅芯片层面直接保护AI代理、上下文内存及基于文件的数据访问,有效防止敏感信息泄露。Vera BlueField-4 STX的发布标志着英伟达在AI基础设施安全领域的重要进展,尤其适用于需要高安全性的AI推理和存储场景,有望加速企业AI部署并降低数据安全风险。 #英伟达 #VeraBlueField #AI安全 #存储处理 #片上安全 #代理式AI #科技新闻
英伟达GTC 2026:黄仁勋发布DSX平台与Vera Rubin芯片,进军PC市场

北京时间6月1日,英伟达CEO黄仁勋在台北GTC主题演讲中宣布多项重磅发布。公司正式推出“NVIDIA DSX平台”,用于在数字孪生环境中模拟和验证AI工厂建设,以应对高达每GW千亿美元的建厂成本。同时,Vera Rubin芯片实现全面量产,该芯片专为代理式AI设计,延迟降至纳秒级,可将两小时任务缩短至五分钟。黄仁勋还发布了基于混合架构的开源模型Nemotron 3 Ultra,成本降低30%,速度提升5倍。此外,英伟达正式进军PC芯片市场,推出与联发科合作的RTX Spark超级芯片,戴尔、联想等品牌将于秋季推出搭载该芯片的笔记本和台式机。黄仁勋强调,代理式AI时代已到来,AI并未减少工作机会,全球软件开发者数量反而在增长。 #英伟达 #GTC2026 #黄仁勋 #AI #DSX平台 #VeraRubin #Nemotron #PC芯片 #代理式AI
英伟达全面转向“代理式人工智能”,AI从聊天时代进入Agent时代

在GTC 2026台北演讲中,英伟达正式宣布全面转向“代理式人工智能”(Agent AI),标志着AI技术从传统的对话式交互迈入自主执行任务的Agent时代。英伟达认为,未来的AI将不再局限于被动回答用户提问,而是能够主动理解环境、制定计划并执行复杂操作,从而在工业自动化、智能客服、机器人等领域实现突破性应用。这一战略转型将推动AI从“工具”向“数字员工”演进,重塑人机协作模式。英伟达同时展示了相关硬件与软件生态的最新进展,强调其GPU和CUDA平台将为Agent AI提供算力支撑。业界分析认为,此举将加速AI落地场景的拓展,并可能引发新一轮行业竞争。 #英伟达 #代理式人工智能 #Agent #GTC2026 #AI #科技新闻 #台北演讲 #人工智能转型