AI知识库 @ai521
341 subscribers
23.3K photos
42 videos
20 files
892 links
@ai521 专注分享最实用的AI内容

🤖 AI教程(新手到进阶)
🧠 AI知识科普(大模型 / 提示词 / 自动化)
📰 AI资讯更新(每日最新AI动态)
📚 AI实战技巧(写作 / 绘画 / 编程 / 赚钱)
🔧 最新AI工具推荐

每天更新AI干货
长期做一个真正有价值的AI频道
Download Telegram
论文提出“规范化评判者”

一篇 arXiv 预印本论文提出了名为“Codifying the Judge”(规范化评判者)的新方法,旨在通过程序蒸馏技术实现大规模、可扩展的模型评估。研究团队由 Tzu-Heng Huang 等人组成,该方法将评估标准转化为可执行的程序,从而替代传统的人工或模型评判,提升评估效率与一致性。论文聚焦于如何从现有评估数据中蒸馏出既符合人类偏好又具备泛化能力的评判规则,为大规模语言模型的自动化测试提供了新思路。相关工作已公开在 arXiv,并附带代码与数据支持。 #arXiv #AI评估 #程序蒸馏 #机器学习 #学术论文
MIITA:内存诱导的推理时自适应方法助力小语言模型持续学习

一项名为MIITA(Memory-Induced Inference-Time Adaptation)的研究提出面向小语言模型的持续学习新框架。该方法利用推理阶段的内存引导自适应机制,使模型在学习新任务时有效保留旧知识,缓解灾难性遗忘。研究由Dong Li等人完成,相关论文已提交至arXiv预印本平台。MIITA通过整合外部记忆存储与动态推理调整,显著提升了小语言模型在连续任务场景下的表现,为资源受限环境下的持续学习提供了新思路。该工作有望推动对话系统、边缘计算等领域的模型更新效率。 #持续学习 #小语言模型 #推理时自适应 #MIITA #人工智能 #机器学习 #arXiv #论文
DeepLens诊断Agent:小型推理模型借助智能工作流媲美前沿大模型

在一篇提交至arXiv的研究论文中,研究人员提出了DeepLens诊断Agent框架。该框架通过精心设计的智能体工作流程,使小规模推理模型在特定任务上能够与顶级大语言模型竞争。核心思路是利用模块化、迭代式的代理流程,让模型在诊断任务中分步推理、调用工具并自主更正错误,从而弥补参数规模上的不足。实验表明,该框架在医学图像分析等场景中显著提升了小模型的准确率与可靠性,为资源受限环境下的高性能AI应用开辟了新路径。 #AI #机器学习 #智能体 #推理模型 #arXiv #前沿科技
Telegram必备的搜索引擎,极搜JISOU帮你精准找到,想要的群组、频道、视频、音乐

👉 t.me/jisou2?start=a_8247614025
标题:评估LLM可靠性新方法

一项来自arXiv的研究论文《Same Question, Different Answers: Evaluating LLM Reliability Beyond Accuracy》提出,传统的准确率指标已不足以全面评估大语言模型的可靠性。研究发现,在多次询问同一问题时,同一模型可能给出不一致的答案,这揭示了模型在事实一致性方面的缺陷。该研究由Kazem Faghih等六位作者共同完成,通过引入新的评估方法,关注模型在面对相同输入时的输出稳定性,而非仅依赖单次回答的正确性。这项工作为AI安全性评估提供了新视角,强调需从多维度衡量LLM的可靠表现,推动模型在关键应用场景中更值得信赖。 #LLM #AI可靠性 #大模型 #论文 #arXiv #人工智能 #模型评估
QFoldAgent:自主量子优化多智能体系统用于蛋白质结构预测

据arXiv预印本平台信息,研究人员Winson Chen及其团队提交了一篇题为《QFoldAgent: An Autonomous Quantum Optimization Multi-Agent System for Protein Structure Prediction》的论文。该研究提出了一种名为QFoldAgent的新型框架,将量子优化与多智能体系统相结合,自主协同完成蛋白质结构预测任务。蛋白质结构预测是生物信息学中的关键难题,传统算法常受限于计算复杂度和搜索空间。QFoldAgent通过引入量子计算资源,有望提升优化效率与预测精度。目前该论文以预印本形式发布,尚未公开源代码,但已引发学界关注,预示着量子人工智能在分子模拟领域的潜在突破。 #蛋白质结构预测 #量子优化 #多智能体系统 #人工智能 #生物信息学 #arXiv #计算生物学
SeT-Diff:面向HPC遥测与时序数据的语义基础模型

研究人员提出了一种名为SeT-Diff的新型语义基础模型,专门用于高性能计算(HPC)遥测数据和时序数据的处理与分析。该模型旨在解决传统时序分析方法在HPC环境中面临的语义理解不足、泛化能力有限等挑战。通过引入语义嵌入和扩散模型架构,SeT-Diff能够从复杂的HPC遥测数据中提取具有物理意义的时间序列特征,并支持多任务学习,包括异常检测、趋势预测和系统状态评估。初步实验结果显示,该模型在多个基准数据集上的表现优于现有方法,为HPC系统的自动化运维和性能优化提供了新的理论框架与技术路径。相关工作已以预印本形式发表在arXiv上,并附有完整的代码与数据资源链接。 #HPC #基础模型 #时序数据 #人工智能 #数据分析 #遥测技术 #预印本
基于扩散模型的概念化视觉反事实解释新方法

近日,一篇题为《基于扩散模型的概念化视觉反事实解释》的学术论文在arXiv平台发布。该研究由Yassine Oueslati及其合作者共同完成,提出了一种利用扩散模型生成视觉反事实解释的新方法。视觉反事实解释旨在通过修改图像中的关键概念特征来揭示模型决策原因,提升AI系统的可解释性。研究展示了该方法在生成高质量、语义一致的反事实图像方面的潜力,为理解和调试视觉模型提供了有力工具。论文包含PDF、HTML及TeX源码,并附带相关代码和数据链接,供研究者复现与拓展。 #视觉反事实 #扩散模型 #可解释性 #AI #机器学习 #计算机视觉 #论文
AMD 发布 平台,AI 原生开发体验加速性能提升

在 Advancing AI 2026 大会上,AMD 正式推出 ,这是一套面向 AMD 平台的 AI 原生软件开发体验。该平台整合了 ROCm CLI、AMD Skills 以及 AI 驱动的软件优化能力(包括开源 Agentic AI 系统 Hyperloom),支持开发者通过自然语言和主流 AI 编程助手(如 Claude、Codex、Cursor)完成 AI 工作负载的安装、部署、故障排查与性能优化。AMD 表示,在相同硬件上,借助 ,最新版 ROCm 相比 ROCm 7 可实现平均 3.3 倍的推理性能提升和 2.4 倍的训练性能提升。该平台旨在降低开发者使用 ROCm 的门槛,将 AMD 专业知识直接融入开发流程,加速从构想到生产的转化。 计划于 2026 年 8 月投入使用。 #AMD #ROCm #AI开发 #GPU #大模型 #科技新闻 #AI原生 #性能提升
微软发布首个AI安全模型MAI-Cyber-1

微软CEO纳德拉于7月28日宣布推出首个网络安全AI模型MAI-Cyber-1-Flash。该模型在CyberGym基准测试中达到95.95%的成功率,远超Anthropic和OpenAI的同类系统(最高仅85.6%)。MAI-Cyber-1-Flash被集成至多智能体安全系统MDASH中,可高效处理约90%的网络安全任务,其余10%复杂任务则调用更大模型(如GPT-5.4)。成本方面,该组合方案比现有MDASH配置降低近50%。微软表示,其每日处理超100万亿条安全信号,模型经过红队评估、自动化测试及第三方验证,将漏洞、攻击等数据纳入强化学习流程。 #微软 #AI安全 #MAICyber1Flash #网络安全 #大模型 #科技新闻
TaiXu-Admin V0.1.2 发布

TaiXu-Admin 推出 V0.1.2 版本,将大模型对话、检索增强生成(RAG)与智能体协同整合至统一后台。此次更新重点包括新增 LLM Wiki 解析与搜索功能,强化了文档处理能力;同时引入热编译替换机制,支持代码改动后无需重启即可生效。该项目致力于整合分散的大模型应用能力,为开发者构建一套集中化的管理与调度框架,旨在提升多模型场景下的运维效率与协作体验。 #TaiXuAdmin #大模型 #RAG #Agent #AI管理 #开源项目
AMD AI软件战略取得重大突破,有望撼动Nvidia CUDA护城河

AMD在AI加速器领域的软件生态曾被认为是致命短板,最初被分析师给予0%的追赶成功概率。但经过近两年的战略调整,AMD在CEO苏姿丰的强力推动下,彻底改变了“委员会式”决策风格,积极采纳外部建议并重建工程文化。公司已成功赢得Anthropic的2GW芯片部署订单,并促使微软重新转向AMD,计划部署MI455X Helios,业内推测OpenAI将成为Azure上该机架的主要终端客户。此外,AMD与Cerebras达成推理分离合作,试图实现超快速交互推理。然而,AMD面临两大风险:其首个机架级系统Helios因未采用无电缆托盘设计导致量产缓慢,且SerDes设计薄弱导致单个机架需要超过550个Broadcom以太网重定时器。如果AMD能解决这些问题,将极大威胁Nvidia在AI软件领域的统治地位,但Nvidia仍然会在快速增长的AI芯片市场中获得巨大营收增长。 #AMD #Nvidia #CUDA #AI加速器 #软件生态 #Anthropic #微软 #Helios #SerDes #半导体
微软推出首款网络安全专属AI模型与自主防御平台

微软正式发布了其首个专门用于网络安全领域的人工智能模型及配套的自主防御平台。该模型旨在帮助安全团队更高效地检测、调查和应对网络威胁,特别是在应对日益复杂的恶意软件、零日漏洞以及钓鱼攻击方面。这款名为“安全副驾”的系统整合了微软庞大的威胁情报数据,能够自动分析安全警报、生成事件报告,并提出修复建议。微软表示,此AI模型将赋能安全分析师,使处理海量安全信息的速度得到显著提升,从而帮助企业在面对网络攻击时实现更快速、更智能的响应。此举标志着微软在利用人工智能重塑现代网络安全防御体系上迈出了关键一步。 #微软 #网络安全 #人工智能 #AI #网络防御 #科技新闻 #威胁情报
微软发布网络安全模型MAI-Cyber-1-Flash,在漏洞猎捕测试中击败Claude和GPT

微软近日发布其首个专用网络安全模型MAI-Cyber-1-Flash,并将其集成至漏洞猎捕系统MDASH中。据微软官方声明,该系统的性能在多项网络安全测试中超越了Anthropic的Claude Mythos 5和OpenAI的GPT-5.6 Sol,展现出在自动化漏洞发现与响应方面的显著优势。此举标志着微软在AI安全领域的重要布局,旨在提升企业级威胁检测与防御能力,同时也加剧了科技巨头在网络安全AI赛道的竞争。 #微软 #网络安全 #AI #漏洞猎捕 #MAI-Cyber #MDASH #Claude #GPT5
AI 军备竞赛白热化:Anthropic 发布 Fable 5.1,OpenAI 连夜汇报 GPT

据科技媒体报道,AI 领域两大巨头 Anthropic 和 OpenAI 在八月展开新一轮激烈竞争。Anthropic 率先推出了其新一代模型 Fable 5.1,据称在推理能力和安全性方面有显著突破。面对这一挑战,OpenAI CEO 山姆·奥特曼紧急召开内部汇报会议,展示了正在开发中的 GPT-6 模型的部分进展。业内人士分析,这场技术竞赛正从单一代际升级转向多维度能力比拼,双方都在争分夺秒地抢占市场先机。目前,Fable 5.1 已开放部分 API 接口,而 GPT-6 的公开部署时间尚未明确。这场竞赛不仅推动了 AI 技术加速迭代,也引发了业界对模型安全和伦理风险的广泛讨论。 #AI竞技 #Anthropic #OpenAI #Fable51 #GPT6 #大模型 #科技新闻