大语言模型能见烟不见火
一篇发表于arXiv的论文《LLMs Can See the Smoke but not the Fire: Evaluating Abductive Reasoning with Elenchos》系统评估了大语言模型在反绎推理任务上的表现。研究团队设计了名为Elenchos的测试框架,要求模型根据不完整线索推断潜在原因。结果显示,虽然模型能识别表面线索(“烟雾”),但在涉及多步逻辑推理、排除干扰项并找出根本原因(“火焰”)时表现不佳,尤其在需要因果链推理和反事实思考的场景中错误率显著上升。该研究揭示了当前大语言模型在高级推理能力上的结构性短板,为未来模型改进提供了明确方向。 #大语言模型 #反绎推理 #AI研究 #推理能力 #论文 #arXiv #机器学习
一篇发表于arXiv的论文《LLMs Can See the Smoke but not the Fire: Evaluating Abductive Reasoning with Elenchos》系统评估了大语言模型在反绎推理任务上的表现。研究团队设计了名为Elenchos的测试框架,要求模型根据不完整线索推断潜在原因。结果显示,虽然模型能识别表面线索(“烟雾”),但在涉及多步逻辑推理、排除干扰项并找出根本原因(“火焰”)时表现不佳,尤其在需要因果链推理和反事实思考的场景中错误率显著上升。该研究揭示了当前大语言模型在高级推理能力上的结构性短板,为未来模型改进提供了明确方向。 #大语言模型 #反绎推理 #AI研究 #推理能力 #论文 #arXiv #机器学习
MaxSAT-Based Feedback for Guiding Vision-Language Models in Sudoku
该论文提出了一种基于MaxSAT(最大可满足性)的反馈机制,用于引导视觉语言模型(VLM)解决数独难题。研究者利用MaxSAT求解器对VLM生成的推理步骤进行约束求解,并输出可解释的反例作为反馈,帮助模型纠正逻辑错误。实验表明,该方法显著提升了VLM在复杂数独任务上的准确率,尤其在需要多步推理的场景下表现突出。这一工作结合了符号推理与神经网络的优点,为增强大模型在结构化问题上的可靠性提供了新思路。 #MaxSAT #视觉语言模型 #数独 #AI推理 #符号推理 #计算机视觉 #自然语言处理 #arXiv论文 #人工智能 #反馈学习
该论文提出了一种基于MaxSAT(最大可满足性)的反馈机制,用于引导视觉语言模型(VLM)解决数独难题。研究者利用MaxSAT求解器对VLM生成的推理步骤进行约束求解,并输出可解释的反例作为反馈,帮助模型纠正逻辑错误。实验表明,该方法显著提升了VLM在复杂数独任务上的准确率,尤其在需要多步推理的场景下表现突出。这一工作结合了符号推理与神经网络的优点,为增强大模型在结构化问题上的可靠性提供了新思路。 #MaxSAT #视觉语言模型 #数独 #AI推理 #符号推理 #计算机视觉 #自然语言处理 #arXiv论文 #人工智能 #反馈学习
Internet of Agentic Things
一篇题为《Internet of Agentic Things: Networked AI Agents for Closed-Loop IoT Orchestration》的学术论文近日在arXiv预印本平台发布。该论文由Quanyan Zhu撰写,提出了一种将AI代理网络化以用于闭环物联网编排的新框架。传统物联网系统在动态环境下面临设备异构、数据孤岛等挑战,该研究通过引入自主决策的Agentic AI代理,使物联网设备能够协同感知、推理与执行,实现自动化的闭环控制。论文探讨了Agentic Things的体系结构、通信协议及安全机制,有望推动智能家居、工业自动化、智慧城市等领域的下一代物联网系统演进。 #AI代理 #物联网 #闭环编排 #IoT #AgenticThings #arXiv #人工智能
一篇题为《Internet of Agentic Things: Networked AI Agents for Closed-Loop IoT Orchestration》的学术论文近日在arXiv预印本平台发布。该论文由Quanyan Zhu撰写,提出了一种将AI代理网络化以用于闭环物联网编排的新框架。传统物联网系统在动态环境下面临设备异构、数据孤岛等挑战,该研究通过引入自主决策的Agentic AI代理,使物联网设备能够协同感知、推理与执行,实现自动化的闭环控制。论文探讨了Agentic Things的体系结构、通信协议及安全机制,有望推动智能家居、工业自动化、智慧城市等领域的下一代物联网系统演进。 #AI代理 #物联网 #闭环编排 #IoT #AgenticThings #arXiv #人工智能
Agentic Service-Oriented Computing 宣言发布,定义服务计算新前沿
一篇题为《Agentic Service-Oriented Computing: A Manifesto for the Next Frontier of Service-Oriented Computing》的论文于2026年7月在arXiv平台发布。该论文由Amin Beheshti等10位作者联合撰写,提出了一种面向服务计算的新范式——代理型面向服务计算。宣言认为,随着AI智能体技术的成熟,传统面向服务计算应演进为以自主代理为核心的服务架构,使服务系统具备更高自主性、适应性和协作能力。该论文目前提供PDF和HTML版本,并支持相关文献引用工具。 #论文 #arXiv #服务计算 #AI智能体 #前沿技术
一篇题为《Agentic Service-Oriented Computing: A Manifesto for the Next Frontier of Service-Oriented Computing》的论文于2026年7月在arXiv平台发布。该论文由Amin Beheshti等10位作者联合撰写,提出了一种面向服务计算的新范式——代理型面向服务计算。宣言认为,随着AI智能体技术的成熟,传统面向服务计算应演进为以自主代理为核心的服务架构,使服务系统具备更高自主性、适应性和协作能力。该论文目前提供PDF和HTML版本,并支持相关文献引用工具。 #论文 #arXiv #服务计算 #AI智能体 #前沿技术
欧盟AI法案下高风险AI系统垂直标准化
近日,一篇题为《Vertical Standardisation for High-Risk AI Systems under the EU AI Act: A Domain-Specific Framework for Algorithmic Hiring》的论文在arXiv平台发布。该研究由Anna Gatzioura等学者完成,聚焦于欧盟《人工智能法案》中高风险AI系统的垂直标准化问题,并专门针对算法招聘领域提出了一个领域特定框架。论文探讨了如何在法律合规框架下,为招聘场景中的AI系统制定标准化要求,以平衡技术效率与伦理风险。这一研究为企业在研发和使用招聘算法时提供了实践指引,有助于推动AI在人力资源领域的合规应用,同时也为监管部门细化高风险AI系统标准提供了参考。 #AI合规 #欧盟AI法案 #算法招聘 #高风险AI #标准化 #学术研究
近日,一篇题为《Vertical Standardisation for High-Risk AI Systems under the EU AI Act: A Domain-Specific Framework for Algorithmic Hiring》的论文在arXiv平台发布。该研究由Anna Gatzioura等学者完成,聚焦于欧盟《人工智能法案》中高风险AI系统的垂直标准化问题,并专门针对算法招聘领域提出了一个领域特定框架。论文探讨了如何在法律合规框架下,为招聘场景中的AI系统制定标准化要求,以平衡技术效率与伦理风险。这一研究为企业在研发和使用招聘算法时提供了实践指引,有助于推动AI在人力资源领域的合规应用,同时也为监管部门细化高风险AI系统标准提供了参考。 #AI合规 #欧盟AI法案 #算法招聘 #高风险AI #标准化 #学术研究
大模型更懂项目而非你:NameRank 衡量 LLM 的项目识别能力
该论文提出了一种名为 NameRank 的新评估方法,用于衡量大语言模型(LLM)对特定项目(如代码仓库、研究课题、开源项目)的识别能力,而非对作者本人的识别。研究发现,当前 LLM 在提及项目名称时表现良好,但在关联具体作者时存在偏差。NameRank 通过将项目名称作为查询,统计模型输出中项目出现的概率,从而量化模型对项目的“知识”,而非对个人的“记忆”。实验表明,LLM 对知名项目(如大型开源库)的识别准确率较高,但对小众或新兴项目认知有限。该研究为理解 LLM 在知识边界上的偏差提供了新视角,有助于改进模型在项目检索、自动摘要等场景中的可靠性。 #大模型 #LLM #项目识别 #NameRank #AI #自然语言处理 #arXiv论文 #模型评估
该论文提出了一种名为 NameRank 的新评估方法,用于衡量大语言模型(LLM)对特定项目(如代码仓库、研究课题、开源项目)的识别能力,而非对作者本人的识别。研究发现,当前 LLM 在提及项目名称时表现良好,但在关联具体作者时存在偏差。NameRank 通过将项目名称作为查询,统计模型输出中项目出现的概率,从而量化模型对项目的“知识”,而非对个人的“记忆”。实验表明,LLM 对知名项目(如大型开源库)的识别准确率较高,但对小众或新兴项目认知有限。该研究为理解 LLM 在知识边界上的偏差提供了新视角,有助于改进模型在项目检索、自动摘要等场景中的可靠性。 #大模型 #LLM #项目识别 #NameRank #AI #自然语言处理 #arXiv论文 #模型评估
研究表明交通预测中Transformer并非必需
一项来自Qihang Zhang等人的最新研究对Transformer模型在交通预测中的必要性提出质疑。传统观点认为,Transformer凭借其自注意力机制能够有效提取全局空间信息,但该论文通过实验对比发现,在多项交通预测任务中,采用更轻量级的架构(如卷积网络或改进的图神经网络)同样能够达到甚至超越Transformer的性能。研究指出,Transformer的全局建模能力在交通数据中可能存在冗余,而简单模型在计算效率和效果上更具优势。这一发现为未来交通预测模型的选型提供了新思路,有助于降低计算成本并提升实际部署效率。 #交通预测 #Transformer #深度学习 #模型效率 #机器学习 #时空数据 #论文解读
一项来自Qihang Zhang等人的最新研究对Transformer模型在交通预测中的必要性提出质疑。传统观点认为,Transformer凭借其自注意力机制能够有效提取全局空间信息,但该论文通过实验对比发现,在多项交通预测任务中,采用更轻量级的架构(如卷积网络或改进的图神经网络)同样能够达到甚至超越Transformer的性能。研究指出,Transformer的全局建模能力在交通数据中可能存在冗余,而简单模型在计算效率和效果上更具优势。这一发现为未来交通预测模型的选型提供了新思路,有助于降低计算成本并提升实际部署效率。 #交通预测 #Transformer #深度学习 #模型效率 #机器学习 #时空数据 #论文解读
隔离作为LLM-Agent系统安全的一等原则
一篇由Huihao Jing等13位作者联合提交的arXiv论文提出,将隔离作为确保LLM-Agent(大语言模型智能体)系统安全的一等原则。该研究系统梳理了隔离策略在LLM-Agent安全中的核心概念、分类体系、面临的挑战及未来研究方向。论文指出,随着大模型智能体在复杂任务中的广泛应用,安全风险日益突出,而隔离机制通过限制智能体的行动边界、数据访问和外部交互,可有效降低潜在危害。研究团队从系统层级、虚拟化、能力控制等多个维度构建了隔离策略的分类框架,并分析了部署隔离的工程难题,如性能开销、灵活性与安全性的平衡等。该工作为构建更安全的LLM-Agent系统提供了理论指导,有望推动该领域的安全实践标准化。 #大模型安全 #LLMAgent #隔离机制 #AI安全 # arXiv论文 #人工智能 #系统安全 #分类框架
一篇由Huihao Jing等13位作者联合提交的arXiv论文提出,将隔离作为确保LLM-Agent(大语言模型智能体)系统安全的一等原则。该研究系统梳理了隔离策略在LLM-Agent安全中的核心概念、分类体系、面临的挑战及未来研究方向。论文指出,随着大模型智能体在复杂任务中的广泛应用,安全风险日益突出,而隔离机制通过限制智能体的行动边界、数据访问和外部交互,可有效降低潜在危害。研究团队从系统层级、虚拟化、能力控制等多个维度构建了隔离策略的分类框架,并分析了部署隔离的工程难题,如性能开销、灵活性与安全性的平衡等。该工作为构建更安全的LLM-Agent系统提供了理论指导,有望推动该领域的安全实践标准化。 #大模型安全 #LLMAgent #隔离机制 #AI安全 # arXiv论文 #人工智能 #系统安全 #分类框架
论文提出“批评经验银行”方法,提升LLM代理步级置信度估计
研究人员在arXiv预印本平台发表新论文,提出“Critic Experience Bank”(批评经验银行)方法,旨在实现大型语言模型(LLM)代理的自我演进步级置信度估计。该方法通过构建经验银行机制,使代理能够在执行复杂任务时不断积累和利用历史批评信息,逐步提升每一步决策的置信度评估能力,从而减少对外部监督的依赖,增强推理的可靠性和自主性。该研究由Yaopei Zeng等五位作者完成,论文已在arXiv开放获取。这一工作有望为LLM代理在推理、规划和自主决策等场景中的稳健表现提供新思路。 #arXiv #LLM #AI代理 #置信度估计 #自我演进 #论文 #机器学习 #自然语言处理 #人工智能 #推理
研究人员在arXiv预印本平台发表新论文,提出“Critic Experience Bank”(批评经验银行)方法,旨在实现大型语言模型(LLM)代理的自我演进步级置信度估计。该方法通过构建经验银行机制,使代理能够在执行复杂任务时不断积累和利用历史批评信息,逐步提升每一步决策的置信度评估能力,从而减少对外部监督的依赖,增强推理的可靠性和自主性。该研究由Yaopei Zeng等五位作者完成,论文已在arXiv开放获取。这一工作有望为LLM代理在推理、规划和自主决策等场景中的稳健表现提供新思路。 #arXiv #LLM #AI代理 #置信度估计 #自我演进 #论文 #机器学习 #自然语言处理 #人工智能 #推理
Millboard 三层架构:如何让 AI 生成数据分析而不触碰 UI
Millfolio 团队在博客中介绍了其个人财务管理应用中的 Millwright 功能,该功能通过三层数据契约实现模型生成分析结果的同时确保 UI 安全。第一层为 Widget:模型程序只返回版本化 JSON 类型数据(如表格、KPI、饼图等),绝不返回 HTML 或 Markdown,所有数值以 {raw, text} 格式传递,客户端据此渲染图表。浏览器 chrome 负责交互(如将货币单元格转化为深层链接),模型程序无法注入链接或脚本。第二层为 Board:版面的规格文档包含有序组件列表,每次编辑(调整大小、修改程序、删除组件)都会生成内容寻址的新版本并追加至日志,撤销只需移动指针;所有变更(无论是手动还是模型生成)必须通过验证器检查:组件 ID 唯一且路径安全、引用程序存在、拒绝远程 URL、强制结构限制。模型提议,验证器处置。第三层为 Pages:组件组可提升为页面,但页面导航是增量只增的——模型可以添加页面,但绝不能重命名或移除内置标签页,确保用户检查 AI 行为的界面不被模型篡改。 #AI #UI安全 #前端架构 #数据分析 #本地AI #应用开发 #数据契约
Millfolio 团队在博客中介绍了其个人财务管理应用中的 Millwright 功能,该功能通过三层数据契约实现模型生成分析结果的同时确保 UI 安全。第一层为 Widget:模型程序只返回版本化 JSON 类型数据(如表格、KPI、饼图等),绝不返回 HTML 或 Markdown,所有数值以 {raw, text} 格式传递,客户端据此渲染图表。浏览器 chrome 负责交互(如将货币单元格转化为深层链接),模型程序无法注入链接或脚本。第二层为 Board:版面的规格文档包含有序组件列表,每次编辑(调整大小、修改程序、删除组件)都会生成内容寻址的新版本并追加至日志,撤销只需移动指针;所有变更(无论是手动还是模型生成)必须通过验证器检查:组件 ID 唯一且路径安全、引用程序存在、拒绝远程 URL、强制结构限制。模型提议,验证器处置。第三层为 Pages:组件组可提升为页面,但页面导航是增量只增的——模型可以添加页面,但绝不能重命名或移除内置标签页,确保用户检查 AI 行为的界面不被模型篡改。 #AI #UI安全 #前端架构 #数据分析 #本地AI #应用开发 #数据契约