Koopman Dreamer 提出谱约束潜动态,实现稳定世界模型想象
一篇题为《Koopman Dreamer: Spectrally Constrained Latent Dynamics for Stable World-Model Imagination》的论文近日在arXiv上发布。该研究由Jiaqi Li等六位作者共同完成,提出了一种名为Koopman Dreamer的新型世界模型框架。核心创新在于利用谱约束(spectral constraint)对潜在动态进行正则化,以解决传统世界模型在长期想象中容易出现的发散和不稳定问题。通过引入Koopman算子理论,模型能够学习线性化的潜在动态,从而在预测未来状态时保持数值稳定性。实验表明,该方法在多个强化学习基准任务中显著提升了模型的想象质量和规划性能,为构建更可靠的智能体世界模型提供了新思路。 #KoopmanDreamer #世界模型 #强化学习 #谱约束 #AI #arXiv #论文
一篇题为《Koopman Dreamer: Spectrally Constrained Latent Dynamics for Stable World-Model Imagination》的论文近日在arXiv上发布。该研究由Jiaqi Li等六位作者共同完成,提出了一种名为Koopman Dreamer的新型世界模型框架。核心创新在于利用谱约束(spectral constraint)对潜在动态进行正则化,以解决传统世界模型在长期想象中容易出现的发散和不稳定问题。通过引入Koopman算子理论,模型能够学习线性化的潜在动态,从而在预测未来状态时保持数值稳定性。实验表明,该方法在多个强化学习基准任务中显著提升了模型的想象质量和规划性能,为构建更可靠的智能体世界模型提供了新思路。 #KoopmanDreamer #世界模型 #强化学习 #谱约束 #AI #arXiv #论文
FineServe
来自arXiv的一篇论文介绍了FineServe,这是一个针对全球大语言模型服务负载的细粒度数据集。该研究由Tiancheng Zhang等六位作者共同完成,旨在深入刻画和分析LLM在实际服务环境中的工作负载特征。数据集提供了详细的请求级信息,涵盖多种模型和部署场景,有助于研究人员和工程师更好地理解LLM服务的性能瓶颈、资源消耗模式以及用户行为。论文还展示了基于该数据集的特征分析结果,揭示了不同时间、地域和模型类型下的负载差异。该工作为优化LLM服务系统的效率、可靠性和成本提供了重要参考,相关数据已通过arXiv平台开放获取。 #LLM #大模型 #数据集 #服务负载 #AI #论文 #arXiv
来自arXiv的一篇论文介绍了FineServe,这是一个针对全球大语言模型服务负载的细粒度数据集。该研究由Tiancheng Zhang等六位作者共同完成,旨在深入刻画和分析LLM在实际服务环境中的工作负载特征。数据集提供了详细的请求级信息,涵盖多种模型和部署场景,有助于研究人员和工程师更好地理解LLM服务的性能瓶颈、资源消耗模式以及用户行为。论文还展示了基于该数据集的特征分析结果,揭示了不同时间、地域和模型类型下的负载差异。该工作为优化LLM服务系统的效率、可靠性和成本提供了重要参考,相关数据已通过arXiv平台开放获取。 #LLM #大模型 #数据集 #服务负载 #AI #论文 #arXiv
混合LSTM-图神经网络框架实现金融欺诈检测与抗攻击鲁棒性
arXiv平台发布了一项关于金融欺诈检测的研究成果。该研究提出了一种混合LSTM-图神经网络框架,旨在提升金融交易中欺诈检测的鲁棒性与抗对抗攻击能力。传统检测模型在面对精心设计的对抗样本时容易失效,而该框架通过结合长短期记忆网络对时序特征的捕捉能力与图神经网络对交易关系结构的建模优势,显著增强了模型对复杂欺诈模式的识别精度。实验表明,该混合架构在多个真实金融数据集上不仅保持了较高的检测准确率,还能有效抵御多种类型的对抗攻击,为金融安全领域提供了更具韧性的解决方案。 #金融安全 #欺诈检测 #LSTM #图神经网络 #对抗攻击 #AI #机器学习 #arXiv
arXiv平台发布了一项关于金融欺诈检测的研究成果。该研究提出了一种混合LSTM-图神经网络框架,旨在提升金融交易中欺诈检测的鲁棒性与抗对抗攻击能力。传统检测模型在面对精心设计的对抗样本时容易失效,而该框架通过结合长短期记忆网络对时序特征的捕捉能力与图神经网络对交易关系结构的建模优势,显著增强了模型对复杂欺诈模式的识别精度。实验表明,该混合架构在多个真实金融数据集上不仅保持了较高的检测准确率,还能有效抵御多种类型的对抗攻击,为金融安全领域提供了更具韧性的解决方案。 #金融安全 #欺诈检测 #LSTM #图神经网络 #对抗攻击 #AI #机器学习 #arXiv
OpenEvoShield:面向开放世界多智能体系统攻击的双重非平稳持续防御框架
一篇题为《OpenEvoShield: Dual Non-Stationary Continual Defense for Open-World Multi-Agent System Attacks》的学术论文在arXiv平台发布。该研究由Litian Zhang等人提出,聚焦于开放环境下多智能体系统面临的安全威胁,设计了一种名为OpenEvoShield的双重非平稳持续防御机制。该方法通过动态演化与持续学习策略,使多智能体系统能够适应不断变化的攻击模式,提升在开放世界中的鲁棒性与安全性。论文详细阐述了防御框架的理论基础与实验验证,为多智能体系统的安全防护提供了新思路。 #多智能体系统 #安全防御 #持续学习 #AI安全 #arXiv #论文 #开放世界
一篇题为《OpenEvoShield: Dual Non-Stationary Continual Defense for Open-World Multi-Agent System Attacks》的学术论文在arXiv平台发布。该研究由Litian Zhang等人提出,聚焦于开放环境下多智能体系统面临的安全威胁,设计了一种名为OpenEvoShield的双重非平稳持续防御机制。该方法通过动态演化与持续学习策略,使多智能体系统能够适应不断变化的攻击模式,提升在开放世界中的鲁棒性与安全性。论文详细阐述了防御框架的理论基础与实验验证,为多智能体系统的安全防护提供了新思路。 #多智能体系统 #安全防御 #持续学习 #AI安全 #arXiv #论文 #开放世界
NVIDIA H100 在 Intel TDX 下的机密推理性能基准测试
一篇题为《Benchmarking Confidential GPU Inference on NVIDIA H100 under Intel TDX》的学术论文于2026年5月发布在arXiv上。该研究由Wei Wang等人撰写,重点评估了在英特尔信任域扩展(Intel TDX)安全环境下,NVIDIA H100 GPU执行机密推理任务时的性能表现。论文通过实验数据分析了机密计算对推理延迟、吞吐量及资源开销的影响,为混合云场景下的隐私保护AI部署提供了量化参考。目前该论文可通过arXiv平台获取全文及代码资源。 #NVIDIA #H100 #IntelTDX #机密计算 #GPU推理 #AI安全 #学术论文
一篇题为《Benchmarking Confidential GPU Inference on NVIDIA H100 under Intel TDX》的学术论文于2026年5月发布在arXiv上。该研究由Wei Wang等人撰写,重点评估了在英特尔信任域扩展(Intel TDX)安全环境下,NVIDIA H100 GPU执行机密推理任务时的性能表现。论文通过实验数据分析了机密计算对推理延迟、吞吐量及资源开销的影响,为混合云场景下的隐私保护AI部署提供了量化参考。目前该论文可通过arXiv平台获取全文及代码资源。 #NVIDIA #H100 #IntelTDX #机密计算 #GPU推理 #AI安全 #学术论文
NEXUS: 为工具型LLM代理提供结构化运行时安全
一篇题为《NEXUS: Structured Runtime Safety for Tool-Using LLM Agents》的学术论文近日在arXiv预印本平台发布。该研究由Elias Hossain等五位作者共同完成,聚焦于大型语言模型(LLM)代理在使用外部工具时的运行时安全问题。论文提出了一种名为NEXUS的结构化安全框架,旨在通过系统化的运行时监控与约束机制,防止LLM代理在执行工具调用时产生有害或不可预测的行为。研究团队认为,随着LLM代理在代码执行、数据库查询等场景中广泛应用,确保其在运行时遵循安全边界至关重要。NEXUS框架通过定义明确的权限与行为规则,为代理的自主操作提供了可验证的安全保障。该工作为提升AI代理在实际部署中的可靠性提供了新的思路。 #NEXUS #LLM #AI安全 #工具代理 #学术论文 #arXiv #人工智能
一篇题为《NEXUS: Structured Runtime Safety for Tool-Using LLM Agents》的学术论文近日在arXiv预印本平台发布。该研究由Elias Hossain等五位作者共同完成,聚焦于大型语言模型(LLM)代理在使用外部工具时的运行时安全问题。论文提出了一种名为NEXUS的结构化安全框架,旨在通过系统化的运行时监控与约束机制,防止LLM代理在执行工具调用时产生有害或不可预测的行为。研究团队认为,随着LLM代理在代码执行、数据库查询等场景中广泛应用,确保其在运行时遵循安全边界至关重要。NEXUS框架通过定义明确的权限与行为规则,为代理的自主操作提供了可验证的安全保障。该工作为提升AI代理在实际部署中的可靠性提供了新的思路。 #NEXUS #LLM #AI安全 #工具代理 #学术论文 #arXiv #人工智能
LISA:线性索引稀疏注意力机制实现高效长文本推理
arXiv 上发布了一篇题为《LISA: Linear-Indexed Sparse Attention for Efficient Long-Context Reasoning》的研究论文。该论文由 Yu Zhao 等作者提出了一种名为 LISA 的新型注意力机制,旨在解决大语言模型在处理超长上下文时计算成本过高的问题。LISA 通过引入线性索引和稀疏注意力模式,显著降低了长文本推理过程中的计算复杂度,同时保持了模型对关键信息的捕捉能力。这一方法有望提升 AI 模型在文档分析、代码理解等需要处理大量上下文场景中的效率与性能。 #AI #大模型 #注意力机制 #长文本推理 #arXiv #论文 #机器学习
arXiv 上发布了一篇题为《LISA: Linear-Indexed Sparse Attention for Efficient Long-Context Reasoning》的研究论文。该论文由 Yu Zhao 等作者提出了一种名为 LISA 的新型注意力机制,旨在解决大语言模型在处理超长上下文时计算成本过高的问题。LISA 通过引入线性索引和稀疏注意力模式,显著降低了长文本推理过程中的计算复杂度,同时保持了模型对关键信息的捕捉能力。这一方法有望提升 AI 模型在文档分析、代码理解等需要处理大量上下文场景中的效率与性能。 #AI #大模型 #注意力机制 #长文本推理 #arXiv #论文 #机器学习
数据科学背后的悲伤故事
近日,一则关于乘客因航班超售被拒载的帖子在社交媒体上引发热议。如果你常坐飞机,或许也遇到过类似情况。这看似是操作失误,实则不然。在航空业,这类“错误”往往是航空公司为最大化利润而有意为之的风险决策。从数据科学角度看,这是一个基于概率和数学的统计权衡。以一家虚构的“数据科学航空公司”为例,他们为容量300人的航班售出304张机票。根据历史数据,乘客实际登机的概率为95%。假设每位乘客独立登机(忽略家庭或团体同行的复杂情况),那么实际登机人数服从二项分布。通过计算,当超过300人登机时,航班就会超售。这一模型揭示了航空公司如何在概率计算与利润最大化之间做出抉择。 #数据科学 #航空超售 #概率论 #二项分布 #商业决策 #数学建模
近日,一则关于乘客因航班超售被拒载的帖子在社交媒体上引发热议。如果你常坐飞机,或许也遇到过类似情况。这看似是操作失误,实则不然。在航空业,这类“错误”往往是航空公司为最大化利润而有意为之的风险决策。从数据科学角度看,这是一个基于概率和数学的统计权衡。以一家虚构的“数据科学航空公司”为例,他们为容量300人的航班售出304张机票。根据历史数据,乘客实际登机的概率为95%。假设每位乘客独立登机(忽略家庭或团体同行的复杂情况),那么实际登机人数服从二项分布。通过计算,当超过300人登机时,航班就会超售。这一模型揭示了航空公司如何在概率计算与利润最大化之间做出抉择。 #数据科学 #航空超售 #概率论 #二项分布 #商业决策 #数学建模
RAG 幻觉多是提取错误
并非所有问题都期待相同形式的答案。有的需要带引用的单一数字,有的需要每行一个条目的列表,还有的需要带条件的“是”或“否”。若强行通过一次生成调用处理所有形状,每种形状都会相互干扰。解决方案是采用一小套生成模式,每种答案形状对应一种模式。本文是《企业文档智能》系列的配套内容,该系列哲学在《放大专家》中阐述,聚焦于四砖架构中的第四块(生成),并反驳团队在RAG答案错误时常用的词汇。严格意义上的“幻觉”是模型参数记忆中的捏造:大语言模型凭空编造事实,毫无输入依据。在RAG中,模型读取上下文;答案错误时,原因在上游的提取链(解析、问题、检索或生成契约本身)。将每次失败都称为“幻觉”会关闭行动方向的讨论,而命名真正原因则重新开启讨论。主流叙事将生成视为“发送检索块+问题给LLM,返回答案字符串”,我们拒绝这一框架。答案不是字符串,而是带引用、保真度标志和自我评估字段的类型化Pydantic对象。LLM是函数,而非神谕。模式即契约,验证器在用户看到任何内容前运行。七种模式包括:答案模式是契约,结构化检索输入,类型化Pydantic对象输出,带引用、保真度标志和管道反馈字段,绝不仅是“答案字符串”。例如,“保费金额是多少?”基线返回句子:“保费为每月124美元,按合同。”下游需从散文中解析数字,且无来源或置信度信息。系列返回行:Amount(value=124.0, currency="USD", unit="month", evidence=[Span(line_start=42, line_end=42, quote="premium of $124 / month")], answer_found=True, confidence=0.95)。值已类型化,证据指向精确行,自我评估字段伴随。调用者读取结构化值,而非需重读的文本。 #RAG #大模型 #幻觉 #生成契约 #Pydantic #AI #企业文档智能 #技术架构
并非所有问题都期待相同形式的答案。有的需要带引用的单一数字,有的需要每行一个条目的列表,还有的需要带条件的“是”或“否”。若强行通过一次生成调用处理所有形状,每种形状都会相互干扰。解决方案是采用一小套生成模式,每种答案形状对应一种模式。本文是《企业文档智能》系列的配套内容,该系列哲学在《放大专家》中阐述,聚焦于四砖架构中的第四块(生成),并反驳团队在RAG答案错误时常用的词汇。严格意义上的“幻觉”是模型参数记忆中的捏造:大语言模型凭空编造事实,毫无输入依据。在RAG中,模型读取上下文;答案错误时,原因在上游的提取链(解析、问题、检索或生成契约本身)。将每次失败都称为“幻觉”会关闭行动方向的讨论,而命名真正原因则重新开启讨论。主流叙事将生成视为“发送检索块+问题给LLM,返回答案字符串”,我们拒绝这一框架。答案不是字符串,而是带引用、保真度标志和自我评估字段的类型化Pydantic对象。LLM是函数,而非神谕。模式即契约,验证器在用户看到任何内容前运行。七种模式包括:答案模式是契约,结构化检索输入,类型化Pydantic对象输出,带引用、保真度标志和管道反馈字段,绝不仅是“答案字符串”。例如,“保费金额是多少?”基线返回句子:“保费为每月124美元,按合同。”下游需从散文中解析数字,且无来源或置信度信息。系列返回行:Amount(value=124.0, currency="USD", unit="month", evidence=[Span(line_start=42, line_end=42, quote="premium of $124 / month")], answer_found=True, confidence=0.95)。值已类型化,证据指向精确行,自我评估字段伴随。调用者读取结构化值,而非需重读的文本。 #RAG #大模型 #幻觉 #生成契约 #Pydantic #AI #企业文档智能 #技术架构