Data-DPO 方法创新大语言模型后期训练数据选择技术
在大语言模型(LLM)训练的后期阶段,数据选择对模型性能提升至关重要。传统数据选择方法往往效率低下,难以应对复杂数据集,可能导致训练资源浪费和性能瓶颈。针对这一挑战,研究人员 Peng Sun 等于 2026 年 8 月 5 日在 arXiv 平台发布了题为 "Data-DPO: Direct Preference Optimization for Target Model Data Selection in LLM Post-Training" 的论文,提出 Data-DPO 方法。该方法创新性地将直接偏好优化(DPO)技术应用于目标模型的数据筛选过程,通过优化偏好数据的使用,提升数据选择的精准度和训练效率。论文的发表为 AI 领域提供了新的数据管理策略,有望推动大语言模型开发中的数据处理进步,增强模型性能并降低训练成本。 #AI #大模型 #论文 #数据优化 #机器学习 #深度学习 #技术研究
在大语言模型(LLM)训练的后期阶段,数据选择对模型性能提升至关重要。传统数据选择方法往往效率低下,难以应对复杂数据集,可能导致训练资源浪费和性能瓶颈。针对这一挑战,研究人员 Peng Sun 等于 2026 年 8 月 5 日在 arXiv 平台发布了题为 "Data-DPO: Direct Preference Optimization for Target Model Data Selection in LLM Post-Training" 的论文,提出 Data-DPO 方法。该方法创新性地将直接偏好优化(DPO)技术应用于目标模型的数据筛选过程,通过优化偏好数据的使用,提升数据选择的精准度和训练效率。论文的发表为 AI 领域提供了新的数据管理策略,有望推动大语言模型开发中的数据处理进步,增强模型性能并降低训练成本。 #AI #大模型 #论文 #数据优化 #机器学习 #深度学习 #技术研究
Eric Fock博士发布论文,提出无参考工具检测混合PDE
2026年8月4日,Eric Fock博士在arXiv平台正式发表了一篇题为《检测与区分混合PDE-参数学习中的操作员错误指定:一种无参考工具,其区分能力在样本内有界》的学术论文。该研究聚焦于科学计算与机器学习交叉领域的挑战,针对混合偏微分方程(PDE)与参数联合学习过程中常见的操作员错误指定问题,提出了一种创新的检测与区分方法。传统方法往往依赖外部参考数据来校准或验证模型,而新工具实现了无参考操作,能够直接从学习数据中识别错误指定并区分其类型。论文从理论层面证明了该工具在样本内区分能力的有界性,确保了方法在实际应用中的可靠性和稳定性。这一成果有望显著提升复杂物理系统模拟、工程优化等领域的建模精度,减少因模型错误指定导致的预测偏差,为相关研究提供高效、自适应的工具支持,推动数据驱动建模技术的进一步发展。 #学术论文 #PDE学习 #机器学习 #科学计算 #模型错误指定 #arXiv #EricFock #无参考工具 #理论证明
2026年8月4日,Eric Fock博士在arXiv平台正式发表了一篇题为《检测与区分混合PDE-参数学习中的操作员错误指定:一种无参考工具,其区分能力在样本内有界》的学术论文。该研究聚焦于科学计算与机器学习交叉领域的挑战,针对混合偏微分方程(PDE)与参数联合学习过程中常见的操作员错误指定问题,提出了一种创新的检测与区分方法。传统方法往往依赖外部参考数据来校准或验证模型,而新工具实现了无参考操作,能够直接从学习数据中识别错误指定并区分其类型。论文从理论层面证明了该工具在样本内区分能力的有界性,确保了方法在实际应用中的可靠性和稳定性。这一成果有望显著提升复杂物理系统模拟、工程优化等领域的建模精度,减少因模型错误指定导致的预测偏差,为相关研究提供高效、自适应的工具支持,推动数据驱动建模技术的进一步发展。 #学术论文 #PDE学习 #机器学习 #科学计算 #模型错误指定 #arXiv #EricFock #无参考工具 #理论证明
KT发布国产AI半导体与大模型整合企业设备
韩国电信公司KT于19日宣布推出一款名为“KT NPU LLM Station”的企业用人工智能设备,该设备将国产AI半导体与大型语言模型整合在一个服务器中,形成Sovereign AI Appliance。产品基于韩国AI半导体企业Rivelion的神经网络处理装置(NPU)“Atom Max”,搭载KT自研LLM“信任K 2.5 Pro”和API平台,实现了从芯片到模型、运营平台的全国内技术链。设备支持数据在客户公司内部处理,特别适用于公共、国防、制药、制造、金融等对数据安全要求高的行业,解决因网络隔离等因素难以引进海外生成式AI的限制。作为成品型装置,用户无需额外构建,即可立即使用文件问答等AI功能;同时采用NPU技术,电力效率优于传统GPU服务器。KT计划未来集成会议记录制作、编码支援等更多自研AI代理,并扩展定制化服务,推动企业AI转型。 #KT #AI #NPU #大模型 #企业AI #韩国科技 #半导体 #SovereignAI #科技新闻
韩国电信公司KT于19日宣布推出一款名为“KT NPU LLM Station”的企业用人工智能设备,该设备将国产AI半导体与大型语言模型整合在一个服务器中,形成Sovereign AI Appliance。产品基于韩国AI半导体企业Rivelion的神经网络处理装置(NPU)“Atom Max”,搭载KT自研LLM“信任K 2.5 Pro”和API平台,实现了从芯片到模型、运营平台的全国内技术链。设备支持数据在客户公司内部处理,特别适用于公共、国防、制药、制造、金融等对数据安全要求高的行业,解决因网络隔离等因素难以引进海外生成式AI的限制。作为成品型装置,用户无需额外构建,即可立即使用文件问答等AI功能;同时采用NPU技术,电力效率优于传统GPU服务器。KT计划未来集成会议记录制作、编码支援等更多自研AI代理,并扩展定制化服务,推动企业AI转型。 #KT #AI #NPU #大模型 #企业AI #韩国科技 #半导体 #SovereignAI #科技新闻
Pathway AI 提出“推理方程”,为人工智能寻找科学基础
当前的人工智能被视为一项工程奇迹,却缺乏真正的科学基础。它运作良好,但我们无法完全解释其原理;一旦遇到训练数据之外的复杂场景,模型便难以预测和修正。这就像在发明热力学前就制造出了蒸汽机。Pathway AI 在其最新博文中指出,人工智能领域缺失的是一个“公理化体系”——一套类似统计力学的基础定律,能够从微观的计算单元交互中,推导出宏观的抽象、记忆与推理能力。为此,他们提出了“推理方程”,为类Transformer架构的推理过程建立了严谨的微观基础,将注意力机制与突触动力学联系起来。通过将推理显式表达为局部动态过程,这些方程使得系统的长期行为、持续适应能力和安全性能够被数学分析与预判,从而让安全成为可设计和分析的属性,而非事后评估的结果。文章以热力学诞生前热机工程的发展作类比,强调需要一种通用理论来推导推理系统的可能行为,从而摆脱目前完全依赖经验、逐个模型与基准测试的研发模式。
当前的人工智能被视为一项工程奇迹,却缺乏真正的科学基础。它运作良好,但我们无法完全解释其原理;一旦遇到训练数据之外的复杂场景,模型便难以预测和修正。这就像在发明热力学前就制造出了蒸汽机。Pathway AI 在其最新博文中指出,人工智能领域缺失的是一个“公理化体系”——一套类似统计力学的基础定律,能够从微观的计算单元交互中,推导出宏观的抽象、记忆与推理能力。为此,他们提出了“推理方程”,为类Transformer架构的推理过程建立了严谨的微观基础,将注意力机制与突触动力学联系起来。通过将推理显式表达为局部动态过程,这些方程使得系统的长期行为、持续适应能力和安全性能够被数学分析与预判,从而让安全成为可设计和分析的属性,而非事后评估的结果。文章以热力学诞生前热机工程的发展作类比,强调需要一种通用理论来推导推理系统的可能行为,从而摆脱目前完全依赖经验、逐个模型与基准测试的研发模式。
arXiv平台发布论文提出长期代理信任新框架
近日,一篇题为《Beyond Suspicious Steps: Ontological Trust in Long-Horizon Agents》的学术论文在arXiv预印本平台正式上线。该论文由An He等学者于2026年8月18日提交,核心聚焦人工智能代理在长期任务中的信任问题。研究背景源于当前AI代理在复杂场景下面临的可靠性挑战,传统方法常局限于检测“可疑步骤”,而论文提出了一种基于本体的信任新机制,强调从代理的本质属性出发建立可信度评估。通过理论构建和实验分析,该研究为提升AI代理的安全性和稳健性提供了创新思路,有望对自动驾驶、智能助手等实际应用产生积极影响,推动人工智能向更可信赖的方向发展。 #arXiv #AI #人工智能 #代理信任 #学术论文 #科技新闻 #AI安全
近日,一篇题为《Beyond Suspicious Steps: Ontological Trust in Long-Horizon Agents》的学术论文在arXiv预印本平台正式上线。该论文由An He等学者于2026年8月18日提交,核心聚焦人工智能代理在长期任务中的信任问题。研究背景源于当前AI代理在复杂场景下面临的可靠性挑战,传统方法常局限于检测“可疑步骤”,而论文提出了一种基于本体的信任新机制,强调从代理的本质属性出发建立可信度评估。通过理论构建和实验分析,该研究为提升AI代理的安全性和稳健性提供了创新思路,有望对自动驾驶、智能助手等实际应用产生积极影响,推动人工智能向更可信赖的方向发展。 #arXiv #AI #人工智能 #代理信任 #学术论文 #科技新闻 #AI安全
研究揭示模型级联在数据扰动下的准确性与鲁棒性
针对人工智能系统在实际应用中面临的稳定性挑战,一项新研究系统评估了模型级联架构在遭遇各类数据扰动时的表现。模型级联是一种由多个模型串联构成的复杂系统,旨在通过分工协作提升整体性能。研究团队通过实验,模拟了输入数据在不同类型和程度扰动(如噪声、缺失或对抗性攻击)下的情况,深入分析了扰动在级联过程中传播、放大或衰减的机制。结果表明,扰动的影响并非线性,某些环节可能成为系统的脆弱点。该研究为设计和优化更可靠的AI系统,特别是在自动驾驶、医疗诊断等对鲁棒性要求极高的领域,提供了重要的理论依据和实践参考。 #机器学习 #模型鲁棒性 #数据扰动 #AI研究 #学术论文
针对人工智能系统在实际应用中面临的稳定性挑战,一项新研究系统评估了模型级联架构在遭遇各类数据扰动时的表现。模型级联是一种由多个模型串联构成的复杂系统,旨在通过分工协作提升整体性能。研究团队通过实验,模拟了输入数据在不同类型和程度扰动(如噪声、缺失或对抗性攻击)下的情况,深入分析了扰动在级联过程中传播、放大或衰减的机制。结果表明,扰动的影响并非线性,某些环节可能成为系统的脆弱点。该研究为设计和优化更可靠的AI系统,特别是在自动驾驶、医疗诊断等对鲁棒性要求极高的领域,提供了重要的理论依据和实践参考。 #机器学习 #模型鲁棒性 #数据扰动 #AI研究 #学术论文
审计金融代理自进化
近日,一篇名为《审计金融代理的自进化:能力提升、安全漂移与执行接口不匹配》的学术论文在arXiv平台正式发布,由Jialong Li等研究人员提交。该论文聚焦于金融领域AI代理的自进化机制,背景源于人工智能在金融交易、风险管理等场景中的广泛应用,代理系统通过持续学习提升自主决策能力。研究过程通过对金融代理的进化模型进行审计,发现能力提升的同时伴随安全漂移现象,即系统安全性随自我优化而逐渐偏离预期标准,并暴露出执行接口与预期功能不匹配的技术漏洞。这一发现揭示了金融AI系统在自动化演进中的潜在风险,影响深远,提示业界在部署前需加强安全评估和接口标准化,以防范系统失效或被恶意利用,确保金融稳定与数据隐私保护。 #金融AI #自进化 #安全漂移 #审计 #arXiv #学术论文 #人工智能
近日,一篇名为《审计金融代理的自进化:能力提升、安全漂移与执行接口不匹配》的学术论文在arXiv平台正式发布,由Jialong Li等研究人员提交。该论文聚焦于金融领域AI代理的自进化机制,背景源于人工智能在金融交易、风险管理等场景中的广泛应用,代理系统通过持续学习提升自主决策能力。研究过程通过对金融代理的进化模型进行审计,发现能力提升的同时伴随安全漂移现象,即系统安全性随自我优化而逐渐偏离预期标准,并暴露出执行接口与预期功能不匹配的技术漏洞。这一发现揭示了金融AI系统在自动化演进中的潜在风险,影响深远,提示业界在部署前需加强安全评估和接口标准化,以防范系统失效或被恶意利用,确保金融稳定与数据隐私保护。 #金融AI #自进化 #安全漂移 #审计 #arXiv #学术论文 #人工智能
新研究揭示LLM智能体社区群体极化新机制
一项最新发表的研究提出了一个名为“图伏特”(GraphWake)的新模型,用以解释在大型语言模型智能体(LLM-Agent)构成的虚拟社区中,群体观点极化是如何发生的。该研究认为,当这些具备记忆能力的智能体在社区中频繁互动时,其个体记忆会与社区信息环境相互作用。这种相互作用能够触发一种“极化级联”效应,导致社区内部原本分散的观点逐渐收敛并分化为两个或多个对立的极端立场。这一机制为理解AI驱动社交平台可能出现的观点撕裂现象提供了新的理论框架,并提示在构建这类系统时,需要关注记忆与互动设计对社区讨论生态的长期影响。 #大语言模型 #群体极化 #AI社区 #观点演化 #学术研究 #计算社会科学
一项最新发表的研究提出了一个名为“图伏特”(GraphWake)的新模型,用以解释在大型语言模型智能体(LLM-Agent)构成的虚拟社区中,群体观点极化是如何发生的。该研究认为,当这些具备记忆能力的智能体在社区中频繁互动时,其个体记忆会与社区信息环境相互作用。这种相互作用能够触发一种“极化级联”效应,导致社区内部原本分散的观点逐渐收敛并分化为两个或多个对立的极端立场。这一机制为理解AI驱动社交平台可能出现的观点撕裂现象提供了新的理论框架,并提示在构建这类系统时,需要关注记忆与互动设计对社区讨论生态的长期影响。 #大语言模型 #群体极化 #AI社区 #观点演化 #学术研究 #计算社会科学
92小时AI增强工程冲刺构建多租户SaaS系统
近日,一项技术案例研究揭示了团队如何在92小时内通过AI增强的工程冲刺,成功构建了一个生产级的多租户B2B SaaS系统。该系统采用Supabase进行认证和存储、PostgreSQL作为数据库,并实施了行级安全策略以确保租户间数据严格隔离。工程过程中,AI工具辅助代码生成和决策,但所有关键决策如迁移历史和架构合约均外部化到版本控制仓库,保持工程系统作为权威记录,避免AI独立记忆风险。项目特别强调测试验证,通过多租户隔离测试和审计跟踪机制,确保权限管理正确性,例如验证用户跨组织访问时能阻止未授权数据。此案例公开了架构、方法和限制,为快速压缩工程周期提供了可复用的技术参考,展示了AI辅助下高效开发的潜力。 #AI #SaaS #工程技术 #案例研究 #科技 #软件开发 #多租户 #Supabase #PostgreSQL
近日,一项技术案例研究揭示了团队如何在92小时内通过AI增强的工程冲刺,成功构建了一个生产级的多租户B2B SaaS系统。该系统采用Supabase进行认证和存储、PostgreSQL作为数据库,并实施了行级安全策略以确保租户间数据严格隔离。工程过程中,AI工具辅助代码生成和决策,但所有关键决策如迁移历史和架构合约均外部化到版本控制仓库,保持工程系统作为权威记录,避免AI独立记忆风险。项目特别强调测试验证,通过多租户隔离测试和审计跟踪机制,确保权限管理正确性,例如验证用户跨组织访问时能阻止未授权数据。此案例公开了架构、方法和限制,为快速压缩工程周期提供了可复用的技术参考,展示了AI辅助下高效开发的潜力。 #AI #SaaS #工程技术 #案例研究 #科技 #软件开发 #多租户 #Supabase #PostgreSQL
OpenAI发布防御指南,应对AI自动化网络攻击
OpenAI总裁近日对HuggingFace平台安全事件发出警告,指出AI Agent技术已能自主发现并利用系统漏洞发起攻击,这显著降低了网络攻击门槛,使得恶意行为者更容易实施复杂攻击。随着AI驱动的威胁日益增多,传统网络安全防御面临升级压力,自动化响应能力成为关键。为此,OpenAI公布了四项核心防御措施,涵盖漏洞识别、实时监控、自动化修复和协同防御策略,旨在为企业和开发者提供实用工具以应对新兴风险。该公司强调,这些措施基于实际威胁评估,强调行业需加强合作,共享情报并推动标准建设,共同构建更安全的AI生态系统,以防范未来自动化攻击可能带来的广泛影响。 #AI安全 #OpenAI #网络攻击 #防御措施 #科技新闻 #自动化 #HuggingFace #网络安全
OpenAI总裁近日对HuggingFace平台安全事件发出警告,指出AI Agent技术已能自主发现并利用系统漏洞发起攻击,这显著降低了网络攻击门槛,使得恶意行为者更容易实施复杂攻击。随着AI驱动的威胁日益增多,传统网络安全防御面临升级压力,自动化响应能力成为关键。为此,OpenAI公布了四项核心防御措施,涵盖漏洞识别、实时监控、自动化修复和协同防御策略,旨在为企业和开发者提供实用工具以应对新兴风险。该公司强调,这些措施基于实际威胁评估,强调行业需加强合作,共享情报并推动标准建设,共同构建更安全的AI生态系统,以防范未来自动化攻击可能带来的广泛影响。 #AI安全 #OpenAI #网络攻击 #防御措施 #科技新闻 #自动化 #HuggingFace #网络安全
杰富瑞测试中美AI Agent,阿里千问办公综合得分最高
华尔街投行杰富瑞近日发布AI Agent研究报告,对八款中美主流AI Agent进行了办公任务测试。测试覆盖多文件检索、联网研究、浏览器操作、PPT制作及多模态内容生成等场景。结果显示,阿里千问办公以95分排名第一,Anthropic旗下Claude Cowork以94分位列第二,OpenAI Codex得92分排名第三。其他参与测试的AI Agent包括Kimi Work、豆包、MiniMax Code、腾讯Workbuddy和谷歌Gemini Spark,得分分别为86分、77分、71分、66分和66分。该测试反映了不同AI Agent在办公效率上的差异,为用户选择办公助手提供了参考。 #AI #Agent #测试 #科技 #杰富瑞 #阿里千问 #OpenAI #Claude #办公AI
华尔街投行杰富瑞近日发布AI Agent研究报告,对八款中美主流AI Agent进行了办公任务测试。测试覆盖多文件检索、联网研究、浏览器操作、PPT制作及多模态内容生成等场景。结果显示,阿里千问办公以95分排名第一,Anthropic旗下Claude Cowork以94分位列第二,OpenAI Codex得92分排名第三。其他参与测试的AI Agent包括Kimi Work、豆包、MiniMax Code、腾讯Workbuddy和谷歌Gemini Spark,得分分别为86分、77分、71分、66分和66分。该测试反映了不同AI Agent在办公效率上的差异,为用户选择办公助手提供了参考。 #AI #Agent #测试 #科技 #杰富瑞 #阿里千问 #OpenAI #Claude #办公AI
研究显示大语言模型偏好判断缺乏自洽性
2026年8月18日,由Matthew T. Ford等七位作者在arXiv平台发布了一篇论文,题为“LLM派生的偏好判断不自我一致”。该研究通过分析大语言模型(LLM)在生成偏好判断时的表现,发现这些判断往往缺乏内在一致性。背景上,LLM正被广泛应用于推荐系统、决策支持等需要评估偏好的任务中,但其判断的可靠性一直存在疑问。论文指出,LLM在处理相同或类似输入时,可能产生矛盾的偏好输出,揭示了模型在理解复杂逻辑关系方面的不足。这一发现对LLM的可靠部署具有警示意义,表明未来开发需重点提升模型的自洽性训练与评估机制。 #LLM #偏好判断 #自洽性 #AI研究 #大模型 #科技新闻 #学术论文 #机器学习
2026年8月18日,由Matthew T. Ford等七位作者在arXiv平台发布了一篇论文,题为“LLM派生的偏好判断不自我一致”。该研究通过分析大语言模型(LLM)在生成偏好判断时的表现,发现这些判断往往缺乏内在一致性。背景上,LLM正被广泛应用于推荐系统、决策支持等需要评估偏好的任务中,但其判断的可靠性一直存在疑问。论文指出,LLM在处理相同或类似输入时,可能产生矛盾的偏好输出,揭示了模型在理解复杂逻辑关系方面的不足。这一发现对LLM的可靠部署具有警示意义,表明未来开发需重点提升模型的自洽性训练与评估机制。 #LLM #偏好判断 #自洽性 #AI研究 #大模型 #科技新闻 #学术论文 #机器学习
arXiv 论文提出可解释推理与 MoE 路由融合新框架
在人工智能研究领域,混合专家模型(MoE)的路由机制和模型的可解释性一直是关键挑战。研究人员 Kang Chen 等四人于2026年8月18日在 arXiv 平台提交了一篇题为《超越痕迹:将可解释推理状态读出与原生 MoE 路由相结合》的论文。该论文提出一种创新方法,旨在将可解释的推理状态读出直接集成到 MoE 模型的原生路由过程中,以提升模型的透明度和性能。研究聚焦于解决现有 MoE 路由决策不透明的问题,通过引入可解释的推理状态,使模型内部工作机制更易于理解和验证。这一成果可能为开发更可靠、更易理解的 AI 系统提供新思路,特别是在医疗、金融等对可解释性要求高的应用中,有助于增强 AI 系统的可信度。 #arXiv #AI论文 #MoE模型 #可解释性 #机器学习 #学术研究 #科技新闻
在人工智能研究领域,混合专家模型(MoE)的路由机制和模型的可解释性一直是关键挑战。研究人员 Kang Chen 等四人于2026年8月18日在 arXiv 平台提交了一篇题为《超越痕迹:将可解释推理状态读出与原生 MoE 路由相结合》的论文。该论文提出一种创新方法,旨在将可解释的推理状态读出直接集成到 MoE 模型的原生路由过程中,以提升模型的透明度和性能。研究聚焦于解决现有 MoE 路由决策不透明的问题,通过引入可解释的推理状态,使模型内部工作机制更易于理解和验证。这一成果可能为开发更可靠、更易理解的 AI 系统提供新思路,特别是在医疗、金融等对可解释性要求高的应用中,有助于增强 AI 系统的可信度。 #arXiv #AI论文 #MoE模型 #可解释性 #机器学习 #学术研究 #科技新闻