标题:评估LLM可靠性新方法
一项来自arXiv的研究论文《Same Question, Different Answers: Evaluating LLM Reliability Beyond Accuracy》提出,传统的准确率指标已不足以全面评估大语言模型的可靠性。研究发现,在多次询问同一问题时,同一模型可能给出不一致的答案,这揭示了模型在事实一致性方面的缺陷。该研究由Kazem Faghih等六位作者共同完成,通过引入新的评估方法,关注模型在面对相同输入时的输出稳定性,而非仅依赖单次回答的正确性。这项工作为AI安全性评估提供了新视角,强调需从多维度衡量LLM的可靠表现,推动模型在关键应用场景中更值得信赖。 #LLM #AI可靠性 #大模型 #论文 #arXiv #人工智能 #模型评估
一项来自arXiv的研究论文《Same Question, Different Answers: Evaluating LLM Reliability Beyond Accuracy》提出,传统的准确率指标已不足以全面评估大语言模型的可靠性。研究发现,在多次询问同一问题时,同一模型可能给出不一致的答案,这揭示了模型在事实一致性方面的缺陷。该研究由Kazem Faghih等六位作者共同完成,通过引入新的评估方法,关注模型在面对相同输入时的输出稳定性,而非仅依赖单次回答的正确性。这项工作为AI安全性评估提供了新视角,强调需从多维度衡量LLM的可靠表现,推动模型在关键应用场景中更值得信赖。 #LLM #AI可靠性 #大模型 #论文 #arXiv #人工智能 #模型评估
QFoldAgent:自主量子优化多智能体系统用于蛋白质结构预测
据arXiv预印本平台信息,研究人员Winson Chen及其团队提交了一篇题为《QFoldAgent: An Autonomous Quantum Optimization Multi-Agent System for Protein Structure Prediction》的论文。该研究提出了一种名为QFoldAgent的新型框架,将量子优化与多智能体系统相结合,自主协同完成蛋白质结构预测任务。蛋白质结构预测是生物信息学中的关键难题,传统算法常受限于计算复杂度和搜索空间。QFoldAgent通过引入量子计算资源,有望提升优化效率与预测精度。目前该论文以预印本形式发布,尚未公开源代码,但已引发学界关注,预示着量子人工智能在分子模拟领域的潜在突破。 #蛋白质结构预测 #量子优化 #多智能体系统 #人工智能 #生物信息学 #arXiv #计算生物学
据arXiv预印本平台信息,研究人员Winson Chen及其团队提交了一篇题为《QFoldAgent: An Autonomous Quantum Optimization Multi-Agent System for Protein Structure Prediction》的论文。该研究提出了一种名为QFoldAgent的新型框架,将量子优化与多智能体系统相结合,自主协同完成蛋白质结构预测任务。蛋白质结构预测是生物信息学中的关键难题,传统算法常受限于计算复杂度和搜索空间。QFoldAgent通过引入量子计算资源,有望提升优化效率与预测精度。目前该论文以预印本形式发布,尚未公开源代码,但已引发学界关注,预示着量子人工智能在分子模拟领域的潜在突破。 #蛋白质结构预测 #量子优化 #多智能体系统 #人工智能 #生物信息学 #arXiv #计算生物学
SeT-Diff:面向HPC遥测与时序数据的语义基础模型
研究人员提出了一种名为SeT-Diff的新型语义基础模型,专门用于高性能计算(HPC)遥测数据和时序数据的处理与分析。该模型旨在解决传统时序分析方法在HPC环境中面临的语义理解不足、泛化能力有限等挑战。通过引入语义嵌入和扩散模型架构,SeT-Diff能够从复杂的HPC遥测数据中提取具有物理意义的时间序列特征,并支持多任务学习,包括异常检测、趋势预测和系统状态评估。初步实验结果显示,该模型在多个基准数据集上的表现优于现有方法,为HPC系统的自动化运维和性能优化提供了新的理论框架与技术路径。相关工作已以预印本形式发表在arXiv上,并附有完整的代码与数据资源链接。 #HPC #基础模型 #时序数据 #人工智能 #数据分析 #遥测技术 #预印本
研究人员提出了一种名为SeT-Diff的新型语义基础模型,专门用于高性能计算(HPC)遥测数据和时序数据的处理与分析。该模型旨在解决传统时序分析方法在HPC环境中面临的语义理解不足、泛化能力有限等挑战。通过引入语义嵌入和扩散模型架构,SeT-Diff能够从复杂的HPC遥测数据中提取具有物理意义的时间序列特征,并支持多任务学习,包括异常检测、趋势预测和系统状态评估。初步实验结果显示,该模型在多个基准数据集上的表现优于现有方法,为HPC系统的自动化运维和性能优化提供了新的理论框架与技术路径。相关工作已以预印本形式发表在arXiv上,并附有完整的代码与数据资源链接。 #HPC #基础模型 #时序数据 #人工智能 #数据分析 #遥测技术 #预印本
AMD 发布 平台,AI 原生开发体验加速性能提升
在 Advancing AI 2026 大会上,AMD 正式推出 ,这是一套面向 AMD 平台的 AI 原生软件开发体验。该平台整合了 ROCm CLI、AMD Skills 以及 AI 驱动的软件优化能力(包括开源 Agentic AI 系统 Hyperloom),支持开发者通过自然语言和主流 AI 编程助手(如 Claude、Codex、Cursor)完成 AI 工作负载的安装、部署、故障排查与性能优化。AMD 表示,在相同硬件上,借助 ,最新版 ROCm 相比 ROCm 7 可实现平均 3.3 倍的推理性能提升和 2.4 倍的训练性能提升。该平台旨在降低开发者使用 ROCm 的门槛,将 AMD 专业知识直接融入开发流程,加速从构想到生产的转化。 计划于 2026 年 8 月投入使用。 #AMD #ROCm #AI开发 #GPU #大模型 #科技新闻 #AI原生 #性能提升
在 Advancing AI 2026 大会上,AMD 正式推出 ,这是一套面向 AMD 平台的 AI 原生软件开发体验。该平台整合了 ROCm CLI、AMD Skills 以及 AI 驱动的软件优化能力(包括开源 Agentic AI 系统 Hyperloom),支持开发者通过自然语言和主流 AI 编程助手(如 Claude、Codex、Cursor)完成 AI 工作负载的安装、部署、故障排查与性能优化。AMD 表示,在相同硬件上,借助 ,最新版 ROCm 相比 ROCm 7 可实现平均 3.3 倍的推理性能提升和 2.4 倍的训练性能提升。该平台旨在降低开发者使用 ROCm 的门槛,将 AMD 专业知识直接融入开发流程,加速从构想到生产的转化。 计划于 2026 年 8 月投入使用。 #AMD #ROCm #AI开发 #GPU #大模型 #科技新闻 #AI原生 #性能提升
微软发布首个AI安全模型MAI-Cyber-1
微软CEO纳德拉于7月28日宣布推出首个网络安全AI模型MAI-Cyber-1-Flash。该模型在CyberGym基准测试中达到95.95%的成功率,远超Anthropic和OpenAI的同类系统(最高仅85.6%)。MAI-Cyber-1-Flash被集成至多智能体安全系统MDASH中,可高效处理约90%的网络安全任务,其余10%复杂任务则调用更大模型(如GPT-5.4)。成本方面,该组合方案比现有MDASH配置降低近50%。微软表示,其每日处理超100万亿条安全信号,模型经过红队评估、自动化测试及第三方验证,将漏洞、攻击等数据纳入强化学习流程。 #微软 #AI安全 #MAICyber1Flash #网络安全 #大模型 #科技新闻
微软CEO纳德拉于7月28日宣布推出首个网络安全AI模型MAI-Cyber-1-Flash。该模型在CyberGym基准测试中达到95.95%的成功率,远超Anthropic和OpenAI的同类系统(最高仅85.6%)。MAI-Cyber-1-Flash被集成至多智能体安全系统MDASH中,可高效处理约90%的网络安全任务,其余10%复杂任务则调用更大模型(如GPT-5.4)。成本方面,该组合方案比现有MDASH配置降低近50%。微软表示,其每日处理超100万亿条安全信号,模型经过红队评估、自动化测试及第三方验证,将漏洞、攻击等数据纳入强化学习流程。 #微软 #AI安全 #MAICyber1Flash #网络安全 #大模型 #科技新闻
AMD AI软件战略取得重大突破,有望撼动Nvidia CUDA护城河
AMD在AI加速器领域的软件生态曾被认为是致命短板,最初被分析师给予0%的追赶成功概率。但经过近两年的战略调整,AMD在CEO苏姿丰的强力推动下,彻底改变了“委员会式”决策风格,积极采纳外部建议并重建工程文化。公司已成功赢得Anthropic的2GW芯片部署订单,并促使微软重新转向AMD,计划部署MI455X Helios,业内推测OpenAI将成为Azure上该机架的主要终端客户。此外,AMD与Cerebras达成推理分离合作,试图实现超快速交互推理。然而,AMD面临两大风险:其首个机架级系统Helios因未采用无电缆托盘设计导致量产缓慢,且SerDes设计薄弱导致单个机架需要超过550个Broadcom以太网重定时器。如果AMD能解决这些问题,将极大威胁Nvidia在AI软件领域的统治地位,但Nvidia仍然会在快速增长的AI芯片市场中获得巨大营收增长。 #AMD #Nvidia #CUDA #AI加速器 #软件生态 #Anthropic #微软 #Helios #SerDes #半导体
AMD在AI加速器领域的软件生态曾被认为是致命短板,最初被分析师给予0%的追赶成功概率。但经过近两年的战略调整,AMD在CEO苏姿丰的强力推动下,彻底改变了“委员会式”决策风格,积极采纳外部建议并重建工程文化。公司已成功赢得Anthropic的2GW芯片部署订单,并促使微软重新转向AMD,计划部署MI455X Helios,业内推测OpenAI将成为Azure上该机架的主要终端客户。此外,AMD与Cerebras达成推理分离合作,试图实现超快速交互推理。然而,AMD面临两大风险:其首个机架级系统Helios因未采用无电缆托盘设计导致量产缓慢,且SerDes设计薄弱导致单个机架需要超过550个Broadcom以太网重定时器。如果AMD能解决这些问题,将极大威胁Nvidia在AI软件领域的统治地位,但Nvidia仍然会在快速增长的AI芯片市场中获得巨大营收增长。 #AMD #Nvidia #CUDA #AI加速器 #软件生态 #Anthropic #微软 #Helios #SerDes #半导体
微软推出首款网络安全专属AI模型与自主防御平台
微软正式发布了其首个专门用于网络安全领域的人工智能模型及配套的自主防御平台。该模型旨在帮助安全团队更高效地检测、调查和应对网络威胁,特别是在应对日益复杂的恶意软件、零日漏洞以及钓鱼攻击方面。这款名为“安全副驾”的系统整合了微软庞大的威胁情报数据,能够自动分析安全警报、生成事件报告,并提出修复建议。微软表示,此AI模型将赋能安全分析师,使处理海量安全信息的速度得到显著提升,从而帮助企业在面对网络攻击时实现更快速、更智能的响应。此举标志着微软在利用人工智能重塑现代网络安全防御体系上迈出了关键一步。 #微软 #网络安全 #人工智能 #AI #网络防御 #科技新闻 #威胁情报
微软正式发布了其首个专门用于网络安全领域的人工智能模型及配套的自主防御平台。该模型旨在帮助安全团队更高效地检测、调查和应对网络威胁,特别是在应对日益复杂的恶意软件、零日漏洞以及钓鱼攻击方面。这款名为“安全副驾”的系统整合了微软庞大的威胁情报数据,能够自动分析安全警报、生成事件报告,并提出修复建议。微软表示,此AI模型将赋能安全分析师,使处理海量安全信息的速度得到显著提升,从而帮助企业在面对网络攻击时实现更快速、更智能的响应。此举标志着微软在利用人工智能重塑现代网络安全防御体系上迈出了关键一步。 #微软 #网络安全 #人工智能 #AI #网络防御 #科技新闻 #威胁情报
微软发布网络安全模型MAI-Cyber-1-Flash,在漏洞猎捕测试中击败Claude和GPT
微软近日发布其首个专用网络安全模型MAI-Cyber-1-Flash,并将其集成至漏洞猎捕系统MDASH中。据微软官方声明,该系统的性能在多项网络安全测试中超越了Anthropic的Claude Mythos 5和OpenAI的GPT-5.6 Sol,展现出在自动化漏洞发现与响应方面的显著优势。此举标志着微软在AI安全领域的重要布局,旨在提升企业级威胁检测与防御能力,同时也加剧了科技巨头在网络安全AI赛道的竞争。 #微软 #网络安全 #AI #漏洞猎捕 #MAI-Cyber #MDASH #Claude #GPT5
微软近日发布其首个专用网络安全模型MAI-Cyber-1-Flash,并将其集成至漏洞猎捕系统MDASH中。据微软官方声明,该系统的性能在多项网络安全测试中超越了Anthropic的Claude Mythos 5和OpenAI的GPT-5.6 Sol,展现出在自动化漏洞发现与响应方面的显著优势。此举标志着微软在AI安全领域的重要布局,旨在提升企业级威胁检测与防御能力,同时也加剧了科技巨头在网络安全AI赛道的竞争。 #微软 #网络安全 #AI #漏洞猎捕 #MAI-Cyber #MDASH #Claude #GPT5
AI 军备竞赛白热化:Anthropic 发布 Fable 5.1,OpenAI 连夜汇报 GPT
据科技媒体报道,AI 领域两大巨头 Anthropic 和 OpenAI 在八月展开新一轮激烈竞争。Anthropic 率先推出了其新一代模型 Fable 5.1,据称在推理能力和安全性方面有显著突破。面对这一挑战,OpenAI CEO 山姆·奥特曼紧急召开内部汇报会议,展示了正在开发中的 GPT-6 模型的部分进展。业内人士分析,这场技术竞赛正从单一代际升级转向多维度能力比拼,双方都在争分夺秒地抢占市场先机。目前,Fable 5.1 已开放部分 API 接口,而 GPT-6 的公开部署时间尚未明确。这场竞赛不仅推动了 AI 技术加速迭代,也引发了业界对模型安全和伦理风险的广泛讨论。 #AI竞技 #Anthropic #OpenAI #Fable51 #GPT6 #大模型 #科技新闻
据科技媒体报道,AI 领域两大巨头 Anthropic 和 OpenAI 在八月展开新一轮激烈竞争。Anthropic 率先推出了其新一代模型 Fable 5.1,据称在推理能力和安全性方面有显著突破。面对这一挑战,OpenAI CEO 山姆·奥特曼紧急召开内部汇报会议,展示了正在开发中的 GPT-6 模型的部分进展。业内人士分析,这场技术竞赛正从单一代际升级转向多维度能力比拼,双方都在争分夺秒地抢占市场先机。目前,Fable 5.1 已开放部分 API 接口,而 GPT-6 的公开部署时间尚未明确。这场竞赛不仅推动了 AI 技术加速迭代,也引发了业界对模型安全和伦理风险的广泛讨论。 #AI竞技 #Anthropic #OpenAI #Fable51 #GPT6 #大模型 #科技新闻