LLM生成的GPU内核能否投入生产?一项跟踪驱动的基准测试与优化代理研究
来自arXiv的一篇论文对当前大语言模型(LLM)自动生成GPU内核的能力进行了系统性评估。研究团队构建了一个基于实际生产环境跟踪数据的基准测试框架,并开发了专门的优化代理,用以衡量LLM生成代码的性能、正确性和稳定性。实验发现,虽然LLM在简单场景下能生成可用内核,但在复杂计算模式、内存访问优化和硬件适配方面仍存在显著不足,生成的代码往往无法直接用于生产环境。该优化代理通过自动识别瓶颈并施加针对性修改,可将部分生成内核的性能提升至接近人工优化的水平。这项工作为评估LLM在底层系统编程中的实用性提供了重要基准,并指出当前模型在高性能计算领域仍需突破。 #LLM #GPU内核 #生产就绪 #基准测试 #优化代理 #高性能计算 #arXiv
来自arXiv的一篇论文对当前大语言模型(LLM)自动生成GPU内核的能力进行了系统性评估。研究团队构建了一个基于实际生产环境跟踪数据的基准测试框架,并开发了专门的优化代理,用以衡量LLM生成代码的性能、正确性和稳定性。实验发现,虽然LLM在简单场景下能生成可用内核,但在复杂计算模式、内存访问优化和硬件适配方面仍存在显著不足,生成的代码往往无法直接用于生产环境。该优化代理通过自动识别瓶颈并施加针对性修改,可将部分生成内核的性能提升至接近人工优化的水平。这项工作为评估LLM在底层系统编程中的实用性提供了重要基准,并指出当前模型在高性能计算领域仍需突破。 #LLM #GPU内核 #生产就绪 #基准测试 #优化代理 #高性能计算 #arXiv
RetroAgent:利用大语言模型搜索结构化记忆实现智能体逆合成规划
该论文提出RetroAgent框架,利用大语言模型(LLMs)结合结构化记忆进行智能体逆合成规划。逆合成是化学合成中的核心问题,传统方法依赖规则或搜索算法,效率较低。RetroAgent通过LLM驱动搜索,将已知化学反应知识存储为结构化记忆,使模型能高效检索并利用这些信息,从而提升规划路径的准确性与成功率。实验结果表明,该方法在多个逆合成基准任务上显著优于现有基线模型,展示了LLM在化学领域深入应用的潜力。该研究为AI辅助药物分子设计和有机合成提供了新的技术路径。 #逆合成 #大语言模型 #RetroAgent #化学合成 #AI #结构化记忆 #智能体 #论文 #有机化学 #药物设计
该论文提出RetroAgent框架,利用大语言模型(LLMs)结合结构化记忆进行智能体逆合成规划。逆合成是化学合成中的核心问题,传统方法依赖规则或搜索算法,效率较低。RetroAgent通过LLM驱动搜索,将已知化学反应知识存储为结构化记忆,使模型能高效检索并利用这些信息,从而提升规划路径的准确性与成功率。实验结果表明,该方法在多个逆合成基准任务上显著优于现有基线模型,展示了LLM在化学领域深入应用的潜力。该研究为AI辅助药物分子设计和有机合成提供了新的技术路径。 #逆合成 #大语言模型 #RetroAgent #化学合成 #AI #结构化记忆 #智能体 #论文 #有机化学 #药物设计
VLT:面向工业智能的视觉-语言
arXiv上最新发布了一篇题为《VLT: A Vision-Language-Time Series Multimodal Foundation Model for Industrial Intelligence》的论文。该研究由Haiteng Wang等四位作者共同完成,提出了一种名为VLT的多模态基础模型,旨在融合视觉、语言和时间序列三种数据类型,以应对工业智能领域的复杂需求。传统工业分析往往依赖单一模态数据,难以全面捕捉设备状态、生产流程及环境变化。VLT通过统一的架构同时处理图像、文本和时序数据,从而实现更精准的故障诊断、预测性维护及生产优化。实验表明,该模型在多个工业场景下显著优于单模态和简单多模态方法,为工业数字化与智能化提供了新的技术路径。论文已在arXiv上公开,并提供PDF及HTML预览。 #VLT #多模态 #基础模型 #工业智能 #arXiv #时间序列 #视觉语言 #故障诊断
arXiv上最新发布了一篇题为《VLT: A Vision-Language-Time Series Multimodal Foundation Model for Industrial Intelligence》的论文。该研究由Haiteng Wang等四位作者共同完成,提出了一种名为VLT的多模态基础模型,旨在融合视觉、语言和时间序列三种数据类型,以应对工业智能领域的复杂需求。传统工业分析往往依赖单一模态数据,难以全面捕捉设备状态、生产流程及环境变化。VLT通过统一的架构同时处理图像、文本和时序数据,从而实现更精准的故障诊断、预测性维护及生产优化。实验表明,该模型在多个工业场景下显著优于单模态和简单多模态方法,为工业数字化与智能化提供了新的技术路径。论文已在arXiv上公开,并提供PDF及HTML预览。 #VLT #多模态 #基础模型 #工业智能 #arXiv #时间序列 #视觉语言 #故障诊断
SAGA: Schema-Aware Grounding for Agentic Text-to
该论文提出了一种名为SAGA(Schema-Aware Grounding for Agentic Text-to-SPARQL Generation)的新方法,旨在提升自然语言到SPARQL查询生成的准确性与可靠性。传统文本到SPARQL方法在处理复杂知识图谱模式时容易出错,SAGA通过引入模式感知的基础机制,使生成过程能更好地理解并利用知识图谱的语义结构。该方法采用代理型生成框架,结合检索增强与模式引导,显著改善了查询的语法与语义正确性。实验表明,SAGA在多个基准数据集上取得了优于现有方法的效果,尤其适用于需要细粒度语义匹配的复杂查询场景。该研究为知识图谱问答系统提供了更高效的实现路径,有望推动自然语言与结构化数据交互的实用化发展。 #论文 #知识图谱 #SPARQL #自然语言处理 #人工智能 #语义检索 #代码生成 #知识问答 #机器学习
该论文提出了一种名为SAGA(Schema-Aware Grounding for Agentic Text-to-SPARQL Generation)的新方法,旨在提升自然语言到SPARQL查询生成的准确性与可靠性。传统文本到SPARQL方法在处理复杂知识图谱模式时容易出错,SAGA通过引入模式感知的基础机制,使生成过程能更好地理解并利用知识图谱的语义结构。该方法采用代理型生成框架,结合检索增强与模式引导,显著改善了查询的语法与语义正确性。实验表明,SAGA在多个基准数据集上取得了优于现有方法的效果,尤其适用于需要细粒度语义匹配的复杂查询场景。该研究为知识图谱问答系统提供了更高效的实现路径,有望推动自然语言与结构化数据交互的实用化发展。 #论文 #知识图谱 #SPARQL #自然语言处理 #人工智能 #语义检索 #代码生成 #知识问答 #机器学习
Step-Level Preference Learning for Generative Agents in Social Simulations
一篇发表于arXiv的论文提出了一种名为“步骤级偏好学习”的方法,旨在提升生成式智能体在社会模拟中的行为真实性。该方法通过细粒度地学习智能体在每一步交互中的偏好,使其能够更接近人类的社会决策过程。论文由Wenchang Gao等9位作者共同完成,并详细阐述了模型框架与训练策略。这一研究为构建更可信的社交模拟系统提供了新思路,有望推动多智能体系统、计算社会学等领域的发展。 #论文 #社会模拟 #生成式智能体 #偏好学习 #多智能体 #AI #arXiv #计算机科学
一篇发表于arXiv的论文提出了一种名为“步骤级偏好学习”的方法,旨在提升生成式智能体在社会模拟中的行为真实性。该方法通过细粒度地学习智能体在每一步交互中的偏好,使其能够更接近人类的社会决策过程。论文由Wenchang Gao等9位作者共同完成,并详细阐述了模型框架与训练策略。这一研究为构建更可信的社交模拟系统提供了新思路,有望推动多智能体系统、计算社会学等领域的发展。 #论文 #社会模拟 #生成式智能体 #偏好学习 #多智能体 #AI #arXiv #计算机科学
Tactile
一篇题为《Tactile: Giving Computer-Using Agents Hands and Feet》的学术论文近日在arXiv预印本平台发布。该论文由Yong Liu等人撰写,旨在探索如何让依赖视觉与语言模型操控计算机的AI代理获得更全面的交互能力——即不仅在屏幕上“看”和“点击”,还能实现类似“手”与“脚”的物理或虚拟操作。研究团队可能提出了一种新的框架或训练方法,使AI代理能够执行更复杂的任务,如拖拽文件、滚动页面、多窗口协作,甚至模拟触觉反馈。这一方向有望提升当前AI代理在自动化办公、软件测试、游戏控制等场景中的表现。论文目前提供PDF全文和HTML预览,并附有相关代码与数据链接。该工作尚处于技术报告阶段,但已引起学术界对增强AI代理具身交互能力的关注。 #AI #计算机代理 #触觉交互 #arXiv #具身智能 #自动化 #论文 #研究前沿
一篇题为《Tactile: Giving Computer-Using Agents Hands and Feet》的学术论文近日在arXiv预印本平台发布。该论文由Yong Liu等人撰写,旨在探索如何让依赖视觉与语言模型操控计算机的AI代理获得更全面的交互能力——即不仅在屏幕上“看”和“点击”,还能实现类似“手”与“脚”的物理或虚拟操作。研究团队可能提出了一种新的框架或训练方法,使AI代理能够执行更复杂的任务,如拖拽文件、滚动页面、多窗口协作,甚至模拟触觉反馈。这一方向有望提升当前AI代理在自动化办公、软件测试、游戏控制等场景中的表现。论文目前提供PDF全文和HTML预览,并附有相关代码与数据链接。该工作尚处于技术报告阶段,但已引起学术界对增强AI代理具身交互能力的关注。 #AI #计算机代理 #触觉交互 #arXiv #具身智能 #自动化 #论文 #研究前沿
深度循环Transformer实现逐Token定点收敛
来自arXiv的一篇论文提出,深度循环Transformer模型能够在每个token级别达到定点收敛。作者Joe Logan的研究表明,通过特定的循环架构设计,模型在深层递归过程中可稳定收敛至固定点,从而提升推理效率与性能。该方法有望为高效Transformer变体提供新思路,相关代码与数据已公开。 #arXiv #深度学习 #Transformer #定点收敛 #AI研究
来自arXiv的一篇论文提出,深度循环Transformer模型能够在每个token级别达到定点收敛。作者Joe Logan的研究表明,通过特定的循环架构设计,模型在深层递归过程中可稳定收敛至固定点,从而提升推理效率与性能。该方法有望为高效Transformer变体提供新思路,相关代码与数据已公开。 #arXiv #深度学习 #Transformer #定点收敛 #AI研究
CausalGraphX:反事实图神经网络框架实现可解释系统性风险评估
来自arXiv的最新论文显示,研究人员Rabimba Karanjai等人提出了一种名为CausalGraphX的反事实图神经网络框架,旨在提升系统性风险评估的可解释性。该框架通过结合因果推理与图神经网络,能够模拟不同干预措施下的金融风险传播路径,从而揭示风险传导机制。研究团队表示,CausalGraphX在多个数据集上的实验表明,其不仅能准确预测系统性风险事件,还能提供引人入胜的因果解释,帮助监管机构理解风险根源。该工作已被arXiv收录,论文全文可通过链接获取,相关代码和数据亦将公开。这一方法有望为金融机构的风险管理提供更透明、可信的决策支持。 #CausalGraphX #图神经网络 #反事实推理 #系统性风险 #可解释AI #金融科技 #风险评估 #因果推理 #人工智能
来自arXiv的最新论文显示,研究人员Rabimba Karanjai等人提出了一种名为CausalGraphX的反事实图神经网络框架,旨在提升系统性风险评估的可解释性。该框架通过结合因果推理与图神经网络,能够模拟不同干预措施下的金融风险传播路径,从而揭示风险传导机制。研究团队表示,CausalGraphX在多个数据集上的实验表明,其不仅能准确预测系统性风险事件,还能提供引人入胜的因果解释,帮助监管机构理解风险根源。该工作已被arXiv收录,论文全文可通过链接获取,相关代码和数据亦将公开。这一方法有望为金融机构的风险管理提供更透明、可信的决策支持。 #CausalGraphX #图神经网络 #反事实推理 #系统性风险 #可解释AI #金融科技 #风险评估 #因果推理 #人工智能
CatalogAgent:面向生成式AI模型的监督者中介自学习上下文工程系统
来自arXiv的一项研究提出了一种名为CatalogAgent的新型系统,旨在通过监督者中介的自我学习机制,实现生成式AI模型的上下文工程。该系统由Zhu Cheng等16位研究者共同开发,于2026年7月提交。其核心思想是引入一个监督者角色,在模型自我学习过程中指导上下文构建与优化,从而提升生成式AI在复杂任务中的表现。该方法突破了传统静态上下文设计的限制,使模型能够动态调整上下文信息,适应多样化的应用场景。研究团队表示,CatalogAgent为生成式AI的实用化部署提供了新的技术路径,有望在对话系统、代码生成和知识推理等领域发挥重要作用。 #AI #生成式AI #上下文工程 #自我学习 #arXiv #机器学习 #大模型
来自arXiv的一项研究提出了一种名为CatalogAgent的新型系统,旨在通过监督者中介的自我学习机制,实现生成式AI模型的上下文工程。该系统由Zhu Cheng等16位研究者共同开发,于2026年7月提交。其核心思想是引入一个监督者角色,在模型自我学习过程中指导上下文构建与优化,从而提升生成式AI在复杂任务中的表现。该方法突破了传统静态上下文设计的限制,使模型能够动态调整上下文信息,适应多样化的应用场景。研究团队表示,CatalogAgent为生成式AI的实用化部署提供了新的技术路径,有望在对话系统、代码生成和知识推理等领域发挥重要作用。 #AI #生成式AI #上下文工程 #自我学习 #arXiv #机器学习 #大模型
Traccia:基于OpenTelemetry的AI系统治理平台
近日,一篇题为《Traccia: An OpenTelemetry-Based Governance Platform for AI Systems》的论文在arXiv预印本平台发布。该论文由Nutan Kumar Naik等五位作者共同完成,提出了一种名为Traccia的AI系统治理平台。Traccia基于OpenTelemetry标准构建,旨在为AI系统提供可观测性、合规性与治理能力。通过集成OpenTelemetry的遥测数据收集与追踪机制,Traccia能够实时监控AI模型的行为、资源消耗及决策过程,从而帮助开发者和运维团队确保系统的透明度与可控性。该平台还支持细粒度的策略管理,可针对不同场景设定治理规则。论文的发布标志着AI治理领域向标准化、可插拔方向迈出重要一步,有望推动企业级AI系统的安全合规部署。 #arXiv #AI治理 #OpenTelemetry #可观测性 #论文 #人工智能 #系统安全
近日,一篇题为《Traccia: An OpenTelemetry-Based Governance Platform for AI Systems》的论文在arXiv预印本平台发布。该论文由Nutan Kumar Naik等五位作者共同完成,提出了一种名为Traccia的AI系统治理平台。Traccia基于OpenTelemetry标准构建,旨在为AI系统提供可观测性、合规性与治理能力。通过集成OpenTelemetry的遥测数据收集与追踪机制,Traccia能够实时监控AI模型的行为、资源消耗及决策过程,从而帮助开发者和运维团队确保系统的透明度与可控性。该平台还支持细粒度的策略管理,可针对不同场景设定治理规则。论文的发布标志着AI治理领域向标准化、可插拔方向迈出重要一步,有望推动企业级AI系统的安全合规部署。 #arXiv #AI治理 #OpenTelemetry #可观测性 #论文 #人工智能 #系统安全