AI模型大乱斗:长任务与低成本成新焦点,记忆能力定胜负
全球AI头部企业开启新一轮密集发布潮,Anthropic的Fable 5、OpenAI的GPT-5.6(含Sol、Terra、Luna三档)、马斯克的Grok 4.5、谷歌Gemini 3.5 Pro及DeepSeek V4等五款模型将在三周内集中亮相。竞争核心已从跑分比拼转向长任务连续作业能力和更低的token成本:GPT-5.6的Ultra模式默认协调四个Agent工作,可跨应用持续数小时推进项目;Fable 5同样强调连续作业能力。同时,OpenAI强调Sol与Fable 5表现相当但成本降低一半,Terra和Luna成本更低;谷歌重构Gemini以压缩推理开销,DeepSeek推出峰谷定价。深层分析指出,长任务与低成本均依赖AI的“记忆”能力——模型需避免上下文丢失,减少全量重传以降低token用量。当前行业多采用外挂向量库方案,但存在信息价值判断缺陷。红熊AI等企业正探索原生记忆架构,提出五层记忆模型,实现长时记忆召回率96.2%、多轮对话一致性98.7%、幻觉率低于0.2%。未来竞争将从比智商转向比记忆力。 #AI #大模型 #GPT5 #长任务 #低成本 #记忆力 #Agent #红熊AI
全球AI头部企业开启新一轮密集发布潮,Anthropic的Fable 5、OpenAI的GPT-5.6(含Sol、Terra、Luna三档)、马斯克的Grok 4.5、谷歌Gemini 3.5 Pro及DeepSeek V4等五款模型将在三周内集中亮相。竞争核心已从跑分比拼转向长任务连续作业能力和更低的token成本:GPT-5.6的Ultra模式默认协调四个Agent工作,可跨应用持续数小时推进项目;Fable 5同样强调连续作业能力。同时,OpenAI强调Sol与Fable 5表现相当但成本降低一半,Terra和Luna成本更低;谷歌重构Gemini以压缩推理开销,DeepSeek推出峰谷定价。深层分析指出,长任务与低成本均依赖AI的“记忆”能力——模型需避免上下文丢失,减少全量重传以降低token用量。当前行业多采用外挂向量库方案,但存在信息价值判断缺陷。红熊AI等企业正探索原生记忆架构,提出五层记忆模型,实现长时记忆召回率96.2%、多轮对话一致性98.7%、幻觉率低于0.2%。未来竞争将从比智商转向比记忆力。 #AI #大模型 #GPT5 #长任务 #低成本 #记忆力 #Agent #红熊AI
Circle 创始人提出「代理经济」理论,AI 与区块链将重塑未来经济
Circle 创始人 Jeremy Allaire 近日发布长达 89 页的研究论文《代理经济》,系统阐述 AI 代理与区块链链上经济的融合将如何重构未来十年的经济形态。Allaire 指出,AI 将思考与工作成本推向零,区块链将交易成本推向零,两者并非并行趋势,而是同一个经济体系的一体两面。论文提出七大关键要素:企业结构将被 AI 代理解构,使“一人公司”成为可能;链上信任需要身份问责层,确保每个自主代理背后有可追溯的实体;代理经济必须以稳定币等完全背书、具备最终结算性的货币运转;链上数据可催生针对 AI 代理的信贷新模式,风险因任务可预测性远低于人类信贷;该经济体系天然全球化,默认无边界将成为常态;软件定价将从订阅转向按工作单位支付,价值流向拥有客户和上下文的代理层;所有权集中是核心挑战,需通过链上机制设计避免不平等加剧。 #Circle #代理经济 #AI #区块链 #JeremyAllaire #稳定币 #链上经济 #未来经济
Circle 创始人 Jeremy Allaire 近日发布长达 89 页的研究论文《代理经济》,系统阐述 AI 代理与区块链链上经济的融合将如何重构未来十年的经济形态。Allaire 指出,AI 将思考与工作成本推向零,区块链将交易成本推向零,两者并非并行趋势,而是同一个经济体系的一体两面。论文提出七大关键要素:企业结构将被 AI 代理解构,使“一人公司”成为可能;链上信任需要身份问责层,确保每个自主代理背后有可追溯的实体;代理经济必须以稳定币等完全背书、具备最终结算性的货币运转;链上数据可催生针对 AI 代理的信贷新模式,风险因任务可预测性远低于人类信贷;该经济体系天然全球化,默认无边界将成为常态;软件定价将从订阅转向按工作单位支付,价值流向拥有客户和上下文的代理层;所有权集中是核心挑战,需通过链上机制设计避免不平等加剧。 #Circle #代理经济 #AI #区块链 #JeremyAllaire #稳定币 #链上经济 #未来经济
OpenAI 智能体产品用量一周增长 2.5 倍
OpenAI 首席执行官萨姆·奥尔特曼近日在 X 平台透露,旗下智能体 AI 产品(包括 Codex 和 ChatGPT Work)的 Tokens 用量在上周增长了 2.5 倍。这一增长得益于 OpenAI 于 7 月 10 日上线 GPT-5.6 系列模型,该模型在 ChatGPT、Codex 及 API 中推出。奥尔特曼在接受 CNBC 采访时表示,GPT-5.6 Sol 模型在编程任务中表现优异,Tokens 效率提高 54%。此外,OpenAI 此前报告显示,截至今年 6 月,98% 的员工使用 Codex 智能体,其研究应用量在七个月内增长 56 倍。 #OpenAI #智能体 #大模型 #AI #科技新闻 #GPT5
OpenAI 首席执行官萨姆·奥尔特曼近日在 X 平台透露,旗下智能体 AI 产品(包括 Codex 和 ChatGPT Work)的 Tokens 用量在上周增长了 2.5 倍。这一增长得益于 OpenAI 于 7 月 10 日上线 GPT-5.6 系列模型,该模型在 ChatGPT、Codex 及 API 中推出。奥尔特曼在接受 CNBC 采访时表示,GPT-5.6 Sol 模型在编程任务中表现优异,Tokens 效率提高 54%。此外,OpenAI 此前报告显示,截至今年 6 月,98% 的员工使用 Codex 智能体,其研究应用量在七个月内增长 56 倍。 #OpenAI #智能体 #大模型 #AI #科技新闻 #GPT5
非平稳环境下的上下文强化学习综述论文发布
近日,一篇题为《非平稳环境下的上下文强化学习:综述》的学术论文在arXiv预印本平台发布。该论文由A Run和Ziluo Ding等作者撰写,系统回顾了在非平稳动态环境下如何应用上下文强化学习(In-Context Reinforcement Learning)的研究进展。综述涵盖了上下文学习、元强化学习以及应对环境变化的相关方法,分析了现有技术在非平稳场景中的局限性,并探讨了未来可能的研究方向,包括如何提升模型在持续变化环境中的鲁棒性和泛化能力。该工作为强化学习在机器人控制、自适应系统等复杂动态场景中的实际应用提供了重要的理论参考,有助于推动该领域的深入研究。 #AI #强化学习 #上下文学习 #非平稳环境 #学术论文 #综述 #arXiv #机器学习 #元学习
近日,一篇题为《非平稳环境下的上下文强化学习:综述》的学术论文在arXiv预印本平台发布。该论文由A Run和Ziluo Ding等作者撰写,系统回顾了在非平稳动态环境下如何应用上下文强化学习(In-Context Reinforcement Learning)的研究进展。综述涵盖了上下文学习、元强化学习以及应对环境变化的相关方法,分析了现有技术在非平稳场景中的局限性,并探讨了未来可能的研究方向,包括如何提升模型在持续变化环境中的鲁棒性和泛化能力。该工作为强化学习在机器人控制、自适应系统等复杂动态场景中的实际应用提供了重要的理论参考,有助于推动该领域的深入研究。 #AI #强化学习 #上下文学习 #非平稳环境 #学术论文 #综述 #arXiv #机器学习 #元学习
新研究提出主权企业语言模型的本体增强蒸馏与情境审计方法
一项发表于arXiv预印本的研究针对企业级主权语言模型提出了一种名为“本体增强蒸馏与情境审计”的组合机制。该工作采用机制证明与否定结果方法相结合的实验设计,旨在解决企业部署大型语言模型时的可解释性、安全性与合规性问题。研究者通过本体论增强知识蒸馏技术,提升模型对领域知识的理解,同时引入情境审计框架以评估模型输出中的上下文相关性及潜在偏差。初步实验揭示了该方法在特定任务中的有效性与局限性,为后续构建可信任的私有化企业语言模型提供了新的审计思路和实证支持。 #AI #大模型 #企业语言模型 #本体蒸馏 #情境审计 #预印本 #arXiv #人工智能 #安全审计
一项发表于arXiv预印本的研究针对企业级主权语言模型提出了一种名为“本体增强蒸馏与情境审计”的组合机制。该工作采用机制证明与否定结果方法相结合的实验设计,旨在解决企业部署大型语言模型时的可解释性、安全性与合规性问题。研究者通过本体论增强知识蒸馏技术,提升模型对领域知识的理解,同时引入情境审计框架以评估模型输出中的上下文相关性及潜在偏差。初步实验揭示了该方法在特定任务中的有效性与局限性,为后续构建可信任的私有化企业语言模型提供了新的审计思路和实证支持。 #AI #大模型 #企业语言模型 #本体蒸馏 #情境审计 #预印本 #arXiv #人工智能 #安全审计
Optimization Is Not All You Need
一篇题为《Optimization Is Not All You Need》的学术论文于2026年7月13日提交至arXiv预印本平台。该论文由Minh Hua和Rita Raley共同撰写,从标题即可看出对当前机器学习领域“优化至上”范式的直接挑战。论文认为,仅依靠优化算法无法解决所有复杂问题,需要更全面的方法论视角。目前该论文以PDF和HTML格式开放获取,并提供TeX源码,相关引用和工具链接也已上线。arXiv平台将该论文归类于计算机科学领域,并提供了多种文献管理工具。该论文的发布引发了学术界对优化局限性的重新思考。 #arXiv #学术论文 #优化 #机器学习 #AI #MinhHua
一篇题为《Optimization Is Not All You Need》的学术论文于2026年7月13日提交至arXiv预印本平台。该论文由Minh Hua和Rita Raley共同撰写,从标题即可看出对当前机器学习领域“优化至上”范式的直接挑战。论文认为,仅依靠优化算法无法解决所有复杂问题,需要更全面的方法论视角。目前该论文以PDF和HTML格式开放获取,并提供TeX源码,相关引用和工具链接也已上线。arXiv平台将该论文归类于计算机科学领域,并提供了多种文献管理工具。该论文的发布引发了学术界对优化局限性的重新思考。 #arXiv #学术论文 #优化 #机器学习 #AI #MinhHua
LP2Graph 线性规划挖掘技术助力铁路调度优化
近日,arXiv 上发布了一篇题为《LP Mining with LP2Graph: A Use Case for Railway Rescheduling》的研究论文。该研究由 Jörn Maurischat 等人完成,提出了一种名为 LP2Graph 的方法,用于从线性规划(LP)模型中提取结构知识,并将其应用于铁路时刻表重新调度场景。线性规划是运筹学中解决资源分配问题的核心工具,但在铁路调度这类动态环境中,传统 LP 模型的可解释性和重用性有限。LP2Graph 通过将 LP 模型转化为图结构,挖掘其中的关键模式,从而辅助调度系统更快地应对延误、故障等突发情况。该研究展示了图分析在交通运输优化中的新应用潜力,也为 AI 辅助决策提供了新的思路。 #arXiv #论文 #线性规划 #铁路调度 #LP2Graph #运筹学 #AI #交通运输
近日,arXiv 上发布了一篇题为《LP Mining with LP2Graph: A Use Case for Railway Rescheduling》的研究论文。该研究由 Jörn Maurischat 等人完成,提出了一种名为 LP2Graph 的方法,用于从线性规划(LP)模型中提取结构知识,并将其应用于铁路时刻表重新调度场景。线性规划是运筹学中解决资源分配问题的核心工具,但在铁路调度这类动态环境中,传统 LP 模型的可解释性和重用性有限。LP2Graph 通过将 LP 模型转化为图结构,挖掘其中的关键模式,从而辅助调度系统更快地应对延误、故障等突发情况。该研究展示了图分析在交通运输优化中的新应用潜力,也为 AI 辅助决策提供了新的思路。 #arXiv #论文 #线性规划 #铁路调度 #LP2Graph #运筹学 #AI #交通运输
面向AI网页代理的网站设计框架
一项新研究提出了一种专门为AI网页代理设计的网站架构框架。随着大语言模型驱动的智能代理在网页自动化任务中广泛应用,现有网站往往缺乏对机器读取和交互的优化,导致代理执行效率低下。该框架从机器可读性、可操作性和决策可靠性三个维度出发,定义了网站应如何结构化自身内容、表单与链接,以便AI代理能够高效解析、执行操作并做出可靠决策。研究人员指出,当前互联网生态亟需从“人类中心”转向“人机共读”,该框架为开发者提供了具体的设计指南,有望显著提升网页自动化、数据抓取和智能服务的效率。相关论文已提交至arXiv预印本平台,作者来自学术界与企业界。 #AI #网页代理 #网站设计 #机器可读性 #自动化 #大语言模型 #人机交互 #学术论文 #框架
一项新研究提出了一种专门为AI网页代理设计的网站架构框架。随着大语言模型驱动的智能代理在网页自动化任务中广泛应用,现有网站往往缺乏对机器读取和交互的优化,导致代理执行效率低下。该框架从机器可读性、可操作性和决策可靠性三个维度出发,定义了网站应如何结构化自身内容、表单与链接,以便AI代理能够高效解析、执行操作并做出可靠决策。研究人员指出,当前互联网生态亟需从“人类中心”转向“人机共读”,该框架为开发者提供了具体的设计指南,有望显著提升网页自动化、数据抓取和智能服务的效率。相关论文已提交至arXiv预印本平台,作者来自学术界与企业界。 #AI #网页代理 #网站设计 #机器可读性 #自动化 #大语言模型 #人机交互 #学术论文 #框架