可审计代理式AI助力甲状腺超声诊断与报告
来自arXiv的一项研究提出了一种可审计的代理式人工智能系统,专用于甲状腺超声诊断与报告生成。该系统能够基于临床证据进行推理,并记录每一步决策过程,确保诊断结果可追溯、可审计。研究团队由Haifan Gong等14位作者组成,该工作旨在提升AI在医疗影像诊断中的透明度与可信度,尤其适用于需要严格合规要求的甲状腺结节评估场景。通过将代理式AI与证据锚定机制结合,系统不仅生成诊断结论,还提供支持性证据链,便于医生复核与验证。这一方法有望推动AI辅助诊断从“黑箱”走向可解释、可审计的临床实践。 #AI #医疗 #甲状腺超声 #可审计AI #代理式AI #论文 #arXiv #医学影像
来自arXiv的一项研究提出了一种可审计的代理式人工智能系统,专用于甲状腺超声诊断与报告生成。该系统能够基于临床证据进行推理,并记录每一步决策过程,确保诊断结果可追溯、可审计。研究团队由Haifan Gong等14位作者组成,该工作旨在提升AI在医疗影像诊断中的透明度与可信度,尤其适用于需要严格合规要求的甲状腺结节评估场景。通过将代理式AI与证据锚定机制结合,系统不仅生成诊断结论,还提供支持性证据链,便于医生复核与验证。这一方法有望推动AI辅助诊断从“黑箱”走向可解释、可审计的临床实践。 #AI #医疗 #甲状腺超声 #可审计AI #代理式AI #论文 #arXiv #医学影像
推理陪审团
近期,一篇名为《推理陪审团:多模型共识评估推理轨迹》的论文出现在arXiv预印本平台上。该研究由Congchao Wang等六位作者完成,提出了一种新颖的评估方法,通过集成多个大语言模型的推理结果,形成共识以评判推理过程的质量。传统上,推理轨迹的评估往往依赖单一模型或人工标注,存在主观性强、覆盖不全等问题。该方法模拟“陪审团”机制,综合不同模型的判断,旨在提高评估的客观性和鲁棒性。论文详细介绍了共识形成算法,并展示了在多个推理任务上的实验效果,表明多模型共识能够更准确地识别出合理与错误的推理步骤。这一工作为自动评估复杂推理链提供了新思路,有望推动大模型推理能力的进一步优化。 #arXiv #推理评估 #多模型共识 #大语言模型 #AI研究 #论文
近期,一篇名为《推理陪审团:多模型共识评估推理轨迹》的论文出现在arXiv预印本平台上。该研究由Congchao Wang等六位作者完成,提出了一种新颖的评估方法,通过集成多个大语言模型的推理结果,形成共识以评判推理过程的质量。传统上,推理轨迹的评估往往依赖单一模型或人工标注,存在主观性强、覆盖不全等问题。该方法模拟“陪审团”机制,综合不同模型的判断,旨在提高评估的客观性和鲁棒性。论文详细介绍了共识形成算法,并展示了在多个推理任务上的实验效果,表明多模型共识能够更准确地识别出合理与错误的推理步骤。这一工作为自动评估复杂推理链提供了新思路,有望推动大模型推理能力的进一步优化。 #arXiv #推理评估 #多模型共识 #大语言模型 #AI研究 #论文
面向大规模有限集合约束解码的Trie自动机方法
近日,一篇题为《Trie Automata for Constrained Decoding over Large Finite Sets》的学术论文在arXiv平台发布。该研究由Xingzi Xu等人提出,针对大规模有限集合下的约束解码问题,设计了一种基于Trie自动机的新型解码方法。传统约束解码在处理庞大目标集合时面临计算效率瓶颈,而该方法通过构建Trie树结构,将搜索空间转化为前缀树,有效减少了无效分支的探索,显著提升了解码速度与准确性。论文实验表明,该方法在多个自然语言处理任务中均优于现有方案,为大规模序列生成中的约束解码提供了高效解决方案。相关工作已公开可访问,包括代码、数据及实验复现链接。 #论文 #AI #约束解码 #Trie自动机 #自然语言处理 #机器学习 #arXiv #算法
近日,一篇题为《Trie Automata for Constrained Decoding over Large Finite Sets》的学术论文在arXiv平台发布。该研究由Xingzi Xu等人提出,针对大规模有限集合下的约束解码问题,设计了一种基于Trie自动机的新型解码方法。传统约束解码在处理庞大目标集合时面临计算效率瓶颈,而该方法通过构建Trie树结构,将搜索空间转化为前缀树,有效减少了无效分支的探索,显著提升了解码速度与准确性。论文实验表明,该方法在多个自然语言处理任务中均优于现有方案,为大规模序列生成中的约束解码提供了高效解决方案。相关工作已公开可访问,包括代码、数据及实验复现链接。 #论文 #AI #约束解码 #Trie自动机 #自然语言处理 #机器学习 #arXiv #算法
论文提出因果归因分数CAS,用于可解释人工智能
近日,一篇题为《CAS: A Causal Attribution Score for Local and Global Explainable Artificial Intelligence》的论文在arXiv预印本平台发布。该论文由Michael Georgiades等人撰写,提出了一种新的因果归因分数(Causal Attribution Score),旨在同时支持局部和全局的可解释人工智能。该方法通过引入因果推理框架,能够更准确地衡量模型输入特征对输出的贡献程度,从而提升模型解释的可靠性与透明度。论文的提交日期为2026年8月12日,目前尚未正式发表,但已引起学术界的关注。该研究有望推动可解释AI领域的发展,为深度学习模型的可信应用提供新工具。 #可解释人工智能 #因果归因 #论文 #AI #机器学习 #arXiv #因果推理
近日,一篇题为《CAS: A Causal Attribution Score for Local and Global Explainable Artificial Intelligence》的论文在arXiv预印本平台发布。该论文由Michael Georgiades等人撰写,提出了一种新的因果归因分数(Causal Attribution Score),旨在同时支持局部和全局的可解释人工智能。该方法通过引入因果推理框架,能够更准确地衡量模型输入特征对输出的贡献程度,从而提升模型解释的可靠性与透明度。论文的提交日期为2026年8月12日,目前尚未正式发表,但已引起学术界的关注。该研究有望推动可解释AI领域的发展,为深度学习模型的可信应用提供新工具。 #可解释人工智能 #因果归因 #论文 #AI #机器学习 #arXiv #因果推理
新研究提出ε-MemEvo方法,赋能LLM程序进化中的跨任务记忆迁移
一篇题为“ε-MemEvo: Adaptive Cross-Task Memory Transfer for LLM Program Evolution”的论文近日在arXiv上预印发布。该论文由Aofan Liu等作者提交,提出了一种名为ε-MemEvo的自适应跨任务记忆转移框架,旨在优化大型语言模型在程序进化任务中的表现。通过在不同任务间高效迁移知识,该方法能够提升模型对新问题的适应能力和泛化性能,为LLM在代码生成、程序修复等领域的应用提供了新的思路。论文目前以PDF和HTML形式公开,相关代码和工具链接也已同步上线,便于社区复现和进一步研究。 #论文 #arXiv #LLM #程序进化 #记忆迁移 #AI #机器学习 #代码生成
一篇题为“ε-MemEvo: Adaptive Cross-Task Memory Transfer for LLM Program Evolution”的论文近日在arXiv上预印发布。该论文由Aofan Liu等作者提交,提出了一种名为ε-MemEvo的自适应跨任务记忆转移框架,旨在优化大型语言模型在程序进化任务中的表现。通过在不同任务间高效迁移知识,该方法能够提升模型对新问题的适应能力和泛化性能,为LLM在代码生成、程序修复等领域的应用提供了新的思路。论文目前以PDF和HTML形式公开,相关代码和工具链接也已同步上线,便于社区复现和进一步研究。 #论文 #arXiv #LLM #程序进化 #记忆迁移 #AI #机器学习 #代码生成
受控持久内存:面向长时程智能体的源绑定状态语义与故障关闭释放机制
一篇题为《受控持久内存:面向长时程智能体的源绑定状态语义与故障关闭释放机制》的论文近日在arXiv预印本平台发布,作者为Guodong Xu。该研究针对长时程人工智能代理在持续运行中的状态管理难题,提出了一种新型的受控持久内存架构。论文核心引入了“源绑定状态语义”,确保智能体的状态信息始终与其来源绑定,避免状态漂移;同时设计了“故障关闭释放”机制,在系统异常或任务终止时能够安全、确定性地回收内存资源,防止数据泄露或状态污染。该工作为构建可靠、安全的长时程自主智能体提供了理论基础,有望推动AI代理在复杂任务和连续交互场景中的应用。 #AI #智能体 #持久内存 #状态管理 #arXiv #论文 #安全
一篇题为《受控持久内存:面向长时程智能体的源绑定状态语义与故障关闭释放机制》的论文近日在arXiv预印本平台发布,作者为Guodong Xu。该研究针对长时程人工智能代理在持续运行中的状态管理难题,提出了一种新型的受控持久内存架构。论文核心引入了“源绑定状态语义”,确保智能体的状态信息始终与其来源绑定,避免状态漂移;同时设计了“故障关闭释放”机制,在系统异常或任务终止时能够安全、确定性地回收内存资源,防止数据泄露或状态污染。该工作为构建可靠、安全的长时程自主智能体提供了理论基础,有望推动AI代理在复杂任务和连续交互场景中的应用。 #AI #智能体 #持久内存 #状态管理 #arXiv #论文 #安全
MindMemOS:为AI智能体打造的可移植自进化记忆操作层
arXiv上的一篇论文提出了一种名为MindMemOS的新型记忆操作系统层,专为AI智能体设计。该研究由梁凯超等16位作者共同完成,目前仍在arXiv上待注册。MindMemOS旨在解决AI智能体在长期记忆管理和自适应进化方面的挑战,通过提供可移植的记忆操作接口,使智能体能够跨环境持续学习并优化自身行为。该方案强调自进化能力,允许智能体根据经验动态调整记忆存储与检索策略,从而提升任务执行效率。论文尚处于预印本阶段,其具体技术细节和实验评估有待后续披露。 #AI #智能体 #记忆系统 #自进化 #论文 #arXiv #机器学习 #人工智能
arXiv上的一篇论文提出了一种名为MindMemOS的新型记忆操作系统层,专为AI智能体设计。该研究由梁凯超等16位作者共同完成,目前仍在arXiv上待注册。MindMemOS旨在解决AI智能体在长期记忆管理和自适应进化方面的挑战,通过提供可移植的记忆操作接口,使智能体能够跨环境持续学习并优化自身行为。该方案强调自进化能力,允许智能体根据经验动态调整记忆存储与检索策略,从而提升任务执行效率。论文尚处于预印本阶段,其具体技术细节和实验评估有待后续披露。 #AI #智能体 #记忆系统 #自进化 #论文 #arXiv #机器学习 #人工智能
阿斯利康发布研发智能体系统“Research Assistant”
阿斯利康研究团队近日在arXiv预印本平台提交了一篇论文,题为“Research Assistant: AstraZeneca's Agentic System for R&D”,作者包括Piotr Grabowski等18人。该论文详细介绍了一个为研发场景设计的智能体系统,旨在利用人工智能代理技术提升科研效率。该系统可能整合了大型语言模型、自动化工具和知识管理能力,以辅助药物发现和研发流程。论文的提交表明阿斯利康正积极将前沿AI技术应用于制药研发,探索智能化研发的新范式。 #阿斯利康 #研发 #智能体 #AI #药物研发 #arXiv #科技论文 #人工智能
阿斯利康研究团队近日在arXiv预印本平台提交了一篇论文,题为“Research Assistant: AstraZeneca's Agentic System for R&D”,作者包括Piotr Grabowski等18人。该论文详细介绍了一个为研发场景设计的智能体系统,旨在利用人工智能代理技术提升科研效率。该系统可能整合了大型语言模型、自动化工具和知识管理能力,以辅助药物发现和研发流程。论文的提交表明阿斯利康正积极将前沿AI技术应用于制药研发,探索智能化研发的新范式。 #阿斯利康 #研发 #智能体 #AI #药物研发 #arXiv #科技论文 #人工智能
双流Transformer
来自arXiv的最新研究提出了一种名为“双流Transformer”的架构创新,旨在将模型推理过程中的主要预填充路径与额外的解码计算进行解耦。传统Transformer在处理长序列时,预填充阶段和解码阶段存在计算冗余,影响效率。该论文通过设计独立的计算路径,使预填充阶段专注于处理初始输入,而解码阶段仅处理新增的令牌,从而减少重复计算,提升推理速度。这项研究由Liming Liu、Mingze Wang和Tuo Zhao共同完成,论文已提交至arXiv平台,可能为大型语言模型的高效部署提供新思路。 #Transformer #深度学习 #AI #论文 #arXiv #大模型 #推理优化
来自arXiv的最新研究提出了一种名为“双流Transformer”的架构创新,旨在将模型推理过程中的主要预填充路径与额外的解码计算进行解耦。传统Transformer在处理长序列时,预填充阶段和解码阶段存在计算冗余,影响效率。该论文通过设计独立的计算路径,使预填充阶段专注于处理初始输入,而解码阶段仅处理新增的令牌,从而减少重复计算,提升推理速度。这项研究由Liming Liu、Mingze Wang和Tuo Zhao共同完成,论文已提交至arXiv平台,可能为大型语言模型的高效部署提供新思路。 #Transformer #深度学习 #AI #论文 #arXiv #大模型 #推理优化
我们需要实用的AI对齐方法以镜像人类推理
一篇题为《Position: We Need Practical AI Alignment Methods to Mirror Human Reasoning》的论文近日在arXiv预印本平台发布。该论文由Vijay Keswani等5位作者提交,提交日期为2026年7月20日。论文主张,当前AI对齐领域应转向更实用的方法,以更好地模拟人类的推理过程,从而提升AI系统的可靠性与可解释性。作者认为,现有对齐技术往往过于理论化,缺乏对真实人类思维模式的映射,亟需开发能够直接应用于实际系统的对齐手段。论文已提供PDF等格式全文供学界参考。 #AI安全 #AI对齐 #人类推理 #arXiv #论文 #科技前沿
一篇题为《Position: We Need Practical AI Alignment Methods to Mirror Human Reasoning》的论文近日在arXiv预印本平台发布。该论文由Vijay Keswani等5位作者提交,提交日期为2026年7月20日。论文主张,当前AI对齐领域应转向更实用的方法,以更好地模拟人类的推理过程,从而提升AI系统的可靠性与可解释性。作者认为,现有对齐技术往往过于理论化,缺乏对真实人类思维模式的映射,亟需开发能够直接应用于实际系统的对齐手段。论文已提供PDF等格式全文供学界参考。 #AI安全 #AI对齐 #人类推理 #arXiv #论文 #科技前沿
研究揭示:LLM与人类道德判断“一致”不等于“对齐”
一项新研究指出,大型语言模型(LLM)在道德判断上与人类看似高度一致,但其背后的道德基础却截然不同。论文《Agreement Is Not Alignment》通过对比人类与LLM在伦理决策中的表现发现,尽管模型在多数情境下能给出与人类相似的答案,但支撑这些判断的底层道德原则和推理路径存在显著分歧。这种“表面一致”可能掩盖了真正的对齐问题,即模型并未真正理解或内化人类的道德价值观。研究警告,仅以行为一致性作为对齐标准是危险的,需深入审视模型内部的道德根基,以确保AI系统在复杂伦理场景中做出可靠决策。 #AI伦理 #大模型 #道德判断 #人工智能 #研究 #LLM #对齐
一项新研究指出,大型语言模型(LLM)在道德判断上与人类看似高度一致,但其背后的道德基础却截然不同。论文《Agreement Is Not Alignment》通过对比人类与LLM在伦理决策中的表现发现,尽管模型在多数情境下能给出与人类相似的答案,但支撑这些判断的底层道德原则和推理路径存在显著分歧。这种“表面一致”可能掩盖了真正的对齐问题,即模型并未真正理解或内化人类的道德价值观。研究警告,仅以行为一致性作为对齐标准是危险的,需深入审视模型内部的道德根基,以确保AI系统在复杂伦理场景中做出可靠决策。 #AI伦理 #大模型 #道德判断 #人工智能 #研究 #LLM #对齐
AI对齐研究可能无意中助长审查工具
近日,一篇发表于第43届国际机器学习大会(ICML 2026)的论文引发关注。该论文标题为“立场:对齐社区无意中在构建审查工具包”,作者Sarah Ball和Phil Hackemann指出,当前AI安全与对齐研究领域可能在不经意间为内容审查系统提供了技术基础。论文认为,旨在使AI系统与人类价值观对齐的技术,如偏好优化、价值观嵌入等,若被滥用或误用,可能转化为压制特定言论的审查工具。研究团队呼吁对齐社区反思自身工作的潜在社会影响,避免技术成果被用作控制信息流通的手段。该论文已在arXiv上公开,并提供了PDF版本供下载。 #AI对齐 #审查 #ICML2026 #机器学习 #AI安全 #技术伦理 #论文
近日,一篇发表于第43届国际机器学习大会(ICML 2026)的论文引发关注。该论文标题为“立场:对齐社区无意中在构建审查工具包”,作者Sarah Ball和Phil Hackemann指出,当前AI安全与对齐研究领域可能在不经意间为内容审查系统提供了技术基础。论文认为,旨在使AI系统与人类价值观对齐的技术,如偏好优化、价值观嵌入等,若被滥用或误用,可能转化为压制特定言论的审查工具。研究团队呼吁对齐社区反思自身工作的潜在社会影响,避免技术成果被用作控制信息流通的手段。该论文已在arXiv上公开,并提供了PDF版本供下载。 #AI对齐 #审查 #ICML2026 #机器学习 #AI安全 #技术伦理 #论文
LLM作为科研伙伴
一项发表于arXiv的研究提出了一种评估大型语言模型(LLM)作为“共同科学家”时研究诚信的诊断框架。该框架由Yash Tripathi等五位学者共同开发,旨在系统性地检测LLM在科研协作中可能出现的虚假信息、数据偏见或逻辑漏洞。研究团队认为,随着LLM越来越多地参与论文撰写、实验设计甚至数据分析,传统的科研诚信审查机制已不足以应对其带来的新型风险。该诊断基础通过多维度测试,模拟LLM在科研场景下的行为,从而判断其是否具备可信赖的研究伙伴素质。这一工作为AI辅助科研的伦理与质量控制提供了重要参考,也为未来制定相关规范奠定了基础。 #LLM #科研诚信 #AI伦理 #诊断框架 #学术论文 #人工智能 #科研合作
一项发表于arXiv的研究提出了一种评估大型语言模型(LLM)作为“共同科学家”时研究诚信的诊断框架。该框架由Yash Tripathi等五位学者共同开发,旨在系统性地检测LLM在科研协作中可能出现的虚假信息、数据偏见或逻辑漏洞。研究团队认为,随着LLM越来越多地参与论文撰写、实验设计甚至数据分析,传统的科研诚信审查机制已不足以应对其带来的新型风险。该诊断基础通过多维度测试,模拟LLM在科研场景下的行为,从而判断其是否具备可信赖的研究伙伴素质。这一工作为AI辅助科研的伦理与质量控制提供了重要参考,也为未来制定相关规范奠定了基础。 #LLM #科研诚信 #AI伦理 #诊断框架 #学术论文 #人工智能 #科研合作
推理是可学习的基于规则的过程
一篇题为《Position: Reasoning is a Learnable Rule-Based Process》的论文在arXiv上发布,并已被第43届国际机器学习大会(ICML 2026,韩国首尔)接收。论文作者Rachel Lawrence和Jacqueline Maasch提出,推理本质上是一种可学习的、基于规则的过程,而非纯粹直觉或不可训练的认知能力。该观点挑战了当前AI领域对推理机制的固有理解,暗示通过系统化规则学习,机器和人类均可提升推理能力。论文的发表引发了学术界对推理本质与AI训练方法的新一轮讨论。 #AI #机器学习 #推理 #ICML2026 #学术论文 #认知科学 #arXiv
一篇题为《Position: Reasoning is a Learnable Rule-Based Process》的论文在arXiv上发布,并已被第43届国际机器学习大会(ICML 2026,韩国首尔)接收。论文作者Rachel Lawrence和Jacqueline Maasch提出,推理本质上是一种可学习的、基于规则的过程,而非纯粹直觉或不可训练的认知能力。该观点挑战了当前AI领域对推理机制的固有理解,暗示通过系统化规则学习,机器和人类均可提升推理能力。论文的发表引发了学术界对推理本质与AI训练方法的新一轮讨论。 #AI #机器学习 #推理 #ICML2026 #学术论文 #认知科学 #arXiv
AI自动设计芯片引热议,EDA三巨头加速布局Agentic AI
上个月,国内大模型企业Kimi完成K3模型自主设计芯片实验,全程未用商业EDA软件,引发行业讨论。但分析指出,该芯片性能仅相当于20年前技术水平,距替代人类工程师尚远。尽管如此,AI正深刻改变芯片设计流程。全球三大EDA厂商在DAC大会上展示Agentic AI布局:Synopsys侧重设计验证深度,推出自主验证智能体,提出L1-L5自主等级,目前处于L3阶段;Cadence强调端到端覆盖,推出AuraStack AI Super Agent,覆盖芯片到系统,获NVIDIA、高通等客户认可;Siemens EDA则提出“可信的自主”,用物理引擎验证AI决策,降低幻觉风险。三家方案均依赖NVIDIA算力支持。中国EDA厂商有望借助差异化AI方案迎来黄金窗口期。 #AI #芯片设计 #EDA #新思科技 #Cadence #西门子 #NVIDIA #中国芯片 #科技新闻 #AgenticAI
上个月,国内大模型企业Kimi完成K3模型自主设计芯片实验,全程未用商业EDA软件,引发行业讨论。但分析指出,该芯片性能仅相当于20年前技术水平,距替代人类工程师尚远。尽管如此,AI正深刻改变芯片设计流程。全球三大EDA厂商在DAC大会上展示Agentic AI布局:Synopsys侧重设计验证深度,推出自主验证智能体,提出L1-L5自主等级,目前处于L3阶段;Cadence强调端到端覆盖,推出AuraStack AI Super Agent,覆盖芯片到系统,获NVIDIA、高通等客户认可;Siemens EDA则提出“可信的自主”,用物理引擎验证AI决策,降低幻觉风险。三家方案均依赖NVIDIA算力支持。中国EDA厂商有望借助差异化AI方案迎来黄金窗口期。 #AI #芯片设计 #EDA #新思科技 #Cadence #西门子 #NVIDIA #中国芯片 #科技新闻 #AgenticAI
超越 Cursor:DeepSeek Harness 推动 AI Agent Runtime 架构革新
近期,技术社区围绕 DeepSeek Harness 展开热议,认为其有望超越 Cursor 等现有工具,成为下一代 AI Agent Runtime 架构的关键突破。DeepSeek Harness 通过优化模型执行环境与任务调度机制,显著提升了 Agent 的自主推理与工具调用能力。分析人士指出,该架构在降低延迟、增强多步骤任务连贯性方面表现突出,或将重新定义 AI 辅助编程与自动化工作流的底层逻辑。这一进展标志着 AI Agent 从简单对话迈向复杂任务执行的重要一步。 #AI #Agent #DeepSeek #Runtime #架构
近期,技术社区围绕 DeepSeek Harness 展开热议,认为其有望超越 Cursor 等现有工具,成为下一代 AI Agent Runtime 架构的关键突破。DeepSeek Harness 通过优化模型执行环境与任务调度机制,显著提升了 Agent 的自主推理与工具调用能力。分析人士指出,该架构在降低延迟、增强多步骤任务连贯性方面表现突出,或将重新定义 AI 辅助编程与自动化工作流的底层逻辑。这一进展标志着 AI Agent 从简单对话迈向复杂任务执行的重要一步。 #AI #Agent #DeepSeek #Runtime #架构