生成式AI的认识论可信度
一篇题为《生成式AI的认识论可信度:高风险工作流中合理依赖的规范性框架》的学术论文近日在arXiv预印本平台发布,作者为Nimisha Karnatak等人。该研究聚焦生成式AI在医疗、金融、司法等高影响场景中的可信赖问题,提出一个规范性框架,用以界定在何种条件下用户对AI输出的依赖是“有根据的”。论文从认识论角度出发,区分了可信性与可信度,主张仅凭模型性能或用户信任不足以支撑高风险决策,需要考察AI系统的证据基础、透明度与问责机制。该框架旨在帮助实践者评估何时应采纳AI建议,何时应保留人工判断,从而减少盲目依赖或过度怀疑。研究为AI治理与安全应用提供了理论依据。 #AI #生成式AI #可信度 #认识论 #arXiv #高风险工作流 #人工智能 #安全
一篇题为《生成式AI的认识论可信度:高风险工作流中合理依赖的规范性框架》的学术论文近日在arXiv预印本平台发布,作者为Nimisha Karnatak等人。该研究聚焦生成式AI在医疗、金融、司法等高影响场景中的可信赖问题,提出一个规范性框架,用以界定在何种条件下用户对AI输出的依赖是“有根据的”。论文从认识论角度出发,区分了可信性与可信度,主张仅凭模型性能或用户信任不足以支撑高风险决策,需要考察AI系统的证据基础、透明度与问责机制。该框架旨在帮助实践者评估何时应采纳AI建议,何时应保留人工判断,从而减少盲目依赖或过度怀疑。研究为AI治理与安全应用提供了理论依据。 #AI #生成式AI #可信度 #认识论 #arXiv #高风险工作流 #人工智能 #安全
StepReflect:面向移动GUI智能体的结构化界面转换反思新方法
一项名为StepReflect的学术研究近日亮相,提出了一种针对移动图形用户界面(GUI)智能体的结构化UI转换反思方法。该研究由Linqiang Guo等人共同完成,论文已提交至arXiv平台。研究聚焦于移动端自动化操作中的界面状态变化问题,通过将每次UI转换过程进行结构化建模,帮助智能体更准确地理解操作前后的界面差异,从而提升任务执行的成功率与鲁棒性。该方法有望改善当前移动GUI智能体在多步操作中易受界面动态变化干扰的短板,为手机自动化测试、智能助手等领域提供新的技术思路。目前该论文已提供PDF及HTML全文供研究者查阅。 #移动智能体 #GUI #人工智能 #arXiv #人机交互 #自动化测试
一项名为StepReflect的学术研究近日亮相,提出了一种针对移动图形用户界面(GUI)智能体的结构化UI转换反思方法。该研究由Linqiang Guo等人共同完成,论文已提交至arXiv平台。研究聚焦于移动端自动化操作中的界面状态变化问题,通过将每次UI转换过程进行结构化建模,帮助智能体更准确地理解操作前后的界面差异,从而提升任务执行的成功率与鲁棒性。该方法有望改善当前移动GUI智能体在多步操作中易受界面动态变化干扰的短板,为手机自动化测试、智能助手等领域提供新的技术思路。目前该论文已提供PDF及HTML全文供研究者查阅。 #移动智能体 #GUI #人工智能 #arXiv #人机交互 #自动化测试
SkillTV-Bench:评估评判者在技能增强型智能体执行中的表现
一篇来自arXiv的论文提出了SkillTV-Bench基准测试,旨在系统评估评判者(Judge)在技能增强型智能体执行任务中的表现。该研究由Zhi Han等五位作者完成,论文详细介绍了如何通过该基准衡量评判者对智能体执行过程的判断准确性。SkillTV-Bench聚焦于智能体在执行复杂任务时,评判者能否正确识别技能使用、执行步骤和结果质量。这一基准的提出为智能体系统的评估提供了新视角,有助于推动更可靠的自主智能体开发。论文已提交arXiv,目前处于注册状态。 #arXiv #SkillTVBench #智能体 #AI评估 #论文 #人工智能 #基准测试
一篇来自arXiv的论文提出了SkillTV-Bench基准测试,旨在系统评估评判者(Judge)在技能增强型智能体执行任务中的表现。该研究由Zhi Han等五位作者完成,论文详细介绍了如何通过该基准衡量评判者对智能体执行过程的判断准确性。SkillTV-Bench聚焦于智能体在执行复杂任务时,评判者能否正确识别技能使用、执行步骤和结果质量。这一基准的提出为智能体系统的评估提供了新视角,有助于推动更可靠的自主智能体开发。论文已提交arXiv,目前处于注册状态。 #arXiv #SkillTVBench #智能体 #AI评估 #论文 #人工智能 #基准测试
原创文章被AI检测误判为100% AI生成,作者质疑黑箱算法
一位非英语母语作家反映,自己耗时数小时撰写并反复修改的文章,被AI检测工具评分为100% AI生成,且结果被当成绝对事实,既无解释也无申诉途径。虽然他表示自己清楚原文是原创,因此不太在意工具结论,但他批评此类工具以黑箱评分方式插入作者与读者之间的沟通流程,擅自充当“内容是否低质”的仲裁者,用户无法获知评分依据或触发检测的具体原因。他还结合自身机器学习背景指出,可观测性问题长期困扰该领域,而模型规模、架构复杂度和代理的分布式特性又让问题更加恶化。他认为,公众和决策者仍盲目相信算法,忽视系统性风险;“电脑说不”式的决策外包正在被常态化,并已影响更多人,甚至可能对少数群体造成致命后果。 #AI #AI检测 #算法 #机器学习 #原创保护 #科技 #黑箱决策 #误判
一位非英语母语作家反映,自己耗时数小时撰写并反复修改的文章,被AI检测工具评分为100% AI生成,且结果被当成绝对事实,既无解释也无申诉途径。虽然他表示自己清楚原文是原创,因此不太在意工具结论,但他批评此类工具以黑箱评分方式插入作者与读者之间的沟通流程,擅自充当“内容是否低质”的仲裁者,用户无法获知评分依据或触发检测的具体原因。他还结合自身机器学习背景指出,可观测性问题长期困扰该领域,而模型规模、架构复杂度和代理的分布式特性又让问题更加恶化。他认为,公众和决策者仍盲目相信算法,忽视系统性风险;“电脑说不”式的决策外包正在被常态化,并已影响更多人,甚至可能对少数群体造成致命后果。 #AI #AI检测 #算法 #机器学习 #原创保护 #科技 #黑箱决策 #误判
AI生成的漏洞补丁仍需专家人工审查
根据1Password安全研究团队Off-by-1 Labs的最新研究,大型语言模型(LLM)在生成复杂漏洞补丁时,有53.9%的概率会产生带有缺陷的伪补丁(FLAWED)。研究针对六个近期披露的复杂漏洞(包括Linux权限提升、ActiveMQ远程代码执行、Chrome文件系统API释放后使用等),使用前沿推理模型生成了6080个补丁。结果显示,完全解决漏洞且不改变应用行为的成功率仅为26.0%,另有20.1%的补丁虽解决了漏洞但改变了应用行为。超过一半的补丁要么未解决漏洞,要么引入了新漏洞。研究强调,尽管AI在漏洞发现方面取得进展,但自动生成的补丁仍需专家人工审查,以确保安全性和正确性。 #AI安全 #漏洞补丁 #LLM #网络安全 #研究 #1Password #FLAWED
根据1Password安全研究团队Off-by-1 Labs的最新研究,大型语言模型(LLM)在生成复杂漏洞补丁时,有53.9%的概率会产生带有缺陷的伪补丁(FLAWED)。研究针对六个近期披露的复杂漏洞(包括Linux权限提升、ActiveMQ远程代码执行、Chrome文件系统API释放后使用等),使用前沿推理模型生成了6080个补丁。结果显示,完全解决漏洞且不改变应用行为的成功率仅为26.0%,另有20.1%的补丁虽解决了漏洞但改变了应用行为。超过一半的补丁要么未解决漏洞,要么引入了新漏洞。研究强调,尽管AI在漏洞发现方面取得进展,但自动生成的补丁仍需专家人工审查,以确保安全性和正确性。 #AI安全 #漏洞补丁 #LLM #网络安全 #研究 #1Password #FLAWED
Hyper-ES:利用下降方向合并的进化策略提升大语言模型推理能力
来自arXiv预印本平台的一篇新论文提出了一种名为Hyper-ES的方法,通过下降方向合并来改进进化策略,从而增强大语言模型(LLM)的推理能力。该研究由Yu Gu等六位作者共同完成,于2026年8月6日提交至arXiv。论文指出,传统进化策略在优化LLM推理路径时效率有限,Hyper-ES将进化算法与下降方向合并相结合,有望更有效地引导模型搜索高质量推理结果。目前该论文已开放PDF及HTML预览,并处于DOI注册阶段,相关技术细节和实验数据尚未完全公开,后续进展值得关注。 #arXiv #论文 #大语言模型 #LLM #进化策略 #AI #机器学习 #推理优化
来自arXiv预印本平台的一篇新论文提出了一种名为Hyper-ES的方法,通过下降方向合并来改进进化策略,从而增强大语言模型(LLM)的推理能力。该研究由Yu Gu等六位作者共同完成,于2026年8月6日提交至arXiv。论文指出,传统进化策略在优化LLM推理路径时效率有限,Hyper-ES将进化算法与下降方向合并相结合,有望更有效地引导模型搜索高质量推理结果。目前该论文已开放PDF及HTML预览,并处于DOI注册阶段,相关技术细节和实验数据尚未完全公开,后续进展值得关注。 #arXiv #论文 #大语言模型 #LLM #进化策略 #AI #机器学习 #推理优化
递归合成方法攻克长时域终端任务难题
近日,一篇题为《Recursive Synthesis for Long-Horizon Terminal Tasks》的论文在arXiv预印本平台发布。该论文由Zhongzhi Li等11位作者共同完成,提交于2026年8月5日。论文聚焦于人工智能领域中的长时域终端任务,提出了一种递归合成方法,旨在提升智能体在复杂、长期目标下的决策与规划能力。该方法通过将大任务递归分解为可管理的子任务,并逐层合成解决方案,有望在机器人控制、自动驾驶、游戏AI等需要长期推理的场景中发挥重要作用。目前论文已提供PDF全文及HTML预览,供研究人员下载参考。 #arXiv #论文 #递归合成 #长时域任务 #人工智能 #机器学习 #决策规划
近日,一篇题为《Recursive Synthesis for Long-Horizon Terminal Tasks》的论文在arXiv预印本平台发布。该论文由Zhongzhi Li等11位作者共同完成,提交于2026年8月5日。论文聚焦于人工智能领域中的长时域终端任务,提出了一种递归合成方法,旨在提升智能体在复杂、长期目标下的决策与规划能力。该方法通过将大任务递归分解为可管理的子任务,并逐层合成解决方案,有望在机器人控制、自动驾驶、游戏AI等需要长期推理的场景中发挥重要作用。目前论文已提供PDF全文及HTML预览,供研究人员下载参考。 #arXiv #论文 #递归合成 #长时域任务 #人工智能 #机器学习 #决策规划
新论文揭示教学排序关键
一篇题为《Stochasticity Is Not the Hard Part: Reduction and Complexity in Instructional Sequencing over Prerequisite DAGs》的研究近日提交至arXiv。该论文由Zonglin Han等人合作完成,聚焦于在具有前置依赖关系的有向无环图(DAG)上如何优化教学排序的问题。研究指出,随机性并非该问题的核心难点,真正的挑战在于计算复杂度以及不同问题间的归约关系。作者通过理论分析,揭示了教学排序问题的复杂度本质,并探讨了多种排序策略的可行性边界。该成果有望为自适应学习系统、智能辅导平台等教育技术提供更坚实的理论基础,助力个性化教学路径的高效设计。 #arXiv #教学排序 #计算复杂度 #DAG #人工智能 #教育技术 #论文 #计算机科学
一篇题为《Stochasticity Is Not the Hard Part: Reduction and Complexity in Instructional Sequencing over Prerequisite DAGs》的研究近日提交至arXiv。该论文由Zonglin Han等人合作完成,聚焦于在具有前置依赖关系的有向无环图(DAG)上如何优化教学排序的问题。研究指出,随机性并非该问题的核心难点,真正的挑战在于计算复杂度以及不同问题间的归约关系。作者通过理论分析,揭示了教学排序问题的复杂度本质,并探讨了多种排序策略的可行性边界。该成果有望为自适应学习系统、智能辅导平台等教育技术提供更坚实的理论基础,助力个性化教学路径的高效设计。 #arXiv #教学排序 #计算复杂度 #DAG #人工智能 #教育技术 #论文 #计算机科学
AI警务风险边界
一项题为《通过混合利益相关者审议协商AI警务中的风险边界》的研究近日在arXiv平台发布,作者为Mackenzie Jorgensen及其他三位合作者。该论文聚焦人工智能在警务场景中应用所引发的风险与治理难题,提出采用混合利益相关者共同参与的审议机制,来协商并界定AI系统的风险边界。研究认为,单纯依赖技术专家或政策制定者难以全面覆盖警务AI带来的伦理、法律与社会影响,需要引入多元主体展开对话,以平衡安全、隐私与公平等价值冲突。论文已提供PDF及HTML版本,并附有参考文献与引用工具,供相关领域研究者进一步探讨。该工作为AI治理与公共安全交叉领域提供了新的理论视角和实践路径。 #AI #警务 #风险治理 #利益相关者 #审议 #arXiv #人工智能伦理
一项题为《通过混合利益相关者审议协商AI警务中的风险边界》的研究近日在arXiv平台发布,作者为Mackenzie Jorgensen及其他三位合作者。该论文聚焦人工智能在警务场景中应用所引发的风险与治理难题,提出采用混合利益相关者共同参与的审议机制,来协商并界定AI系统的风险边界。研究认为,单纯依赖技术专家或政策制定者难以全面覆盖警务AI带来的伦理、法律与社会影响,需要引入多元主体展开对话,以平衡安全、隐私与公平等价值冲突。论文已提供PDF及HTML版本,并附有参考文献与引用工具,供相关领域研究者进一步探讨。该工作为AI治理与公共安全交叉领域提供了新的理论视角和实践路径。 #AI #警务 #风险治理 #利益相关者 #审议 #arXiv #人工智能伦理
基于教学适宜性指数的LLM AI导师教学契合度评估新方法
一篇题为《Evaluating and Improving Pedagogical Fit in LLM-Based AI Tutors with the Pedagogical Suitability Index》的学术论文近日在arXiv预印本平台发布。该研究由Benjamin Barlog等人完成,针对大语言模型驱动的AI辅导系统在教学场景中普遍存在“教学契合度不足”的问题,提出了一种名为“教学适宜性指数”的量化评估框架。该指数可用于系统化衡量AI导师在教学目标、内容呈现、学习引导与反馈方式等方面是否真正适配学习者的需求和教学情境,并据此指导模型调优与交互策略改进。研究旨在弥补当前AI教育工具重“知识回答”轻“教学法匹配”的短板,为构建更高效、更负责任的智能辅导系统提供理论工具与实践路径。 #AI教育 #大语言模型 #智能导师 #教学适宜性 #arXiv #教育科技
一篇题为《Evaluating and Improving Pedagogical Fit in LLM-Based AI Tutors with the Pedagogical Suitability Index》的学术论文近日在arXiv预印本平台发布。该研究由Benjamin Barlog等人完成,针对大语言模型驱动的AI辅导系统在教学场景中普遍存在“教学契合度不足”的问题,提出了一种名为“教学适宜性指数”的量化评估框架。该指数可用于系统化衡量AI导师在教学目标、内容呈现、学习引导与反馈方式等方面是否真正适配学习者的需求和教学情境,并据此指导模型调优与交互策略改进。研究旨在弥补当前AI教育工具重“知识回答”轻“教学法匹配”的短板,为构建更高效、更负责任的智能辅导系统提供理论工具与实践路径。 #AI教育 #大语言模型 #智能导师 #教学适宜性 #arXiv #教育科技
自适应竞技场式可争议论证专家网络,助力开放式护理计划协调
一篇题为《Adaptive Arena-based Contestable Argumentative Network-of-Experts for Open-Ended Care Plan Coordination》的学术论文近日在arXiv平台上线。该论文由Truong Thanh Hung Nguyen及另外五位作者共同撰写,于2026年8月5日提交。从标题来看,研究提出了一种自适应竞技场式的可争议论证专家网络,用于开放式护理计划协调,以多专家协同和论证博弈方式应对复杂医疗决策场景。论文页面已获得arXiv分配的DataCite DOI,目前处于待注册状态,并提供PDF、HTML、TeX源文件等多种访问方式。相关工具和引用文献链接也已同步上线,便于学术追踪与参考。 #arXiv #学术论文 #AI #医疗护理 #专家系统 #多智能体 #论证机制 #护理计划
一篇题为《Adaptive Arena-based Contestable Argumentative Network-of-Experts for Open-Ended Care Plan Coordination》的学术论文近日在arXiv平台上线。该论文由Truong Thanh Hung Nguyen及另外五位作者共同撰写,于2026年8月5日提交。从标题来看,研究提出了一种自适应竞技场式的可争议论证专家网络,用于开放式护理计划协调,以多专家协同和论证博弈方式应对复杂医疗决策场景。论文页面已获得arXiv分配的DataCite DOI,目前处于待注册状态,并提供PDF、HTML、TeX源文件等多种访问方式。相关工具和引用文献链接也已同步上线,便于学术追踪与参考。 #arXiv #学术论文 #AI #医疗护理 #专家系统 #多智能体 #论证机制 #护理计划
C³PO:评估全模态模型的跨模态组合与反事实性能
近日,一篇题为《C³PO: Evaluating Cross-Modal Composition and Counterfactual Performance in Omnimodal Models》的论文在arXiv预印本平台发布。该论文由Swapnanil Mukherjee等三位作者共同完成,于2026年8月5日提交。论文主要关注全模态模型在跨模态组合任务与反事实推理场景下的表现评估,旨在为多模态人工智能研究提供更全面的评测基准。目前,论文全文可通过arXiv获取PDF及HTML版本,并附有相关引用工具与代码链接,但具体摘要内容尚未在页面中详细展示。 #arXiv #论文 #多模态 #AI #跨模态 #反事实 #全模态模型 #评测
近日,一篇题为《C³PO: Evaluating Cross-Modal Composition and Counterfactual Performance in Omnimodal Models》的论文在arXiv预印本平台发布。该论文由Swapnanil Mukherjee等三位作者共同完成,于2026年8月5日提交。论文主要关注全模态模型在跨模态组合任务与反事实推理场景下的表现评估,旨在为多模态人工智能研究提供更全面的评测基准。目前,论文全文可通过arXiv获取PDF及HTML版本,并附有相关引用工具与代码链接,但具体摘要内容尚未在页面中详细展示。 #arXiv #论文 #多模态 #AI #跨模态 #反事实 #全模态模型 #评测
DoctorAgents:面向小型临床时序数据的AutoML流水线迭代优化框架
一篇来自arXiv的论文提出了一种名为DoctorAgents的智能体框架,旨在针对小型临床时间序列数据,对AutoML流水线进行迭代优化。该研究由Ruilin Wang与其他8位作者共同完成,论文已发布于预印本平台。当前,临床数据往往规模有限且具有时序特性,传统自动化机器学习方法在应对此类数据时可能面临优化不足或适配性欠佳的问题。DoctorAgents通过智能体协作方式,尝试动态调整和逐步精化AutoML流程,以提高模型在该类数据上的表现。 #AI #AutoML #arXiv #临床数据 #时序数据 #机器学习 #医疗人工智能
一篇来自arXiv的论文提出了一种名为DoctorAgents的智能体框架,旨在针对小型临床时间序列数据,对AutoML流水线进行迭代优化。该研究由Ruilin Wang与其他8位作者共同完成,论文已发布于预印本平台。当前,临床数据往往规模有限且具有时序特性,传统自动化机器学习方法在应对此类数据时可能面临优化不足或适配性欠佳的问题。DoctorAgents通过智能体协作方式,尝试动态调整和逐步精化AutoML流程,以提高模型在该类数据上的表现。 #AI #AutoML #arXiv #临床数据 #时序数据 #机器学习 #医疗人工智能