OpenAI 发布 GPT
OpenAI 于 2026 年 7 月 9 日发布 GPT-5.6 模型,创新性地分为 Sol、Terra、Luna 三个能力层级,各自独立定价和性能。这种分层架构允许 OpenAI 独立更新每个层级,并为开发者提供了基于成本的路由选择。为测试各层级表现,开发者选择客服工单分类任务作为基准,对比了吞吐量、首 token 时间和成本。结果显示,Luna 速度最快且成本最低,Terra 首 token 响应最快,而最高价的 Sol 在两项速度指标上均垫底,表明其旗舰定位侧重于推理复杂度而非速度。值得注意的是,Terra 被定位为 GPT-5.5 现有生产工作负载的迁移目标,成本约降低一半;而 Luna 在多项基准测试中仍接近 GPT-5.5 质量。开发者通过 iamspeed 工具实测,Luna 达 155.6 tok/s,Terra 首 token 最快仅 1931ms,Sol 则以 42.1 tok/s 和 4383ms 首 token 时间垫底。 #OpenAI #GPT56 #大模型 #AI #科技新闻 #性能评测 #开发者工具
OpenAI 于 2026 年 7 月 9 日发布 GPT-5.6 模型,创新性地分为 Sol、Terra、Luna 三个能力层级,各自独立定价和性能。这种分层架构允许 OpenAI 独立更新每个层级,并为开发者提供了基于成本的路由选择。为测试各层级表现,开发者选择客服工单分类任务作为基准,对比了吞吐量、首 token 时间和成本。结果显示,Luna 速度最快且成本最低,Terra 首 token 响应最快,而最高价的 Sol 在两项速度指标上均垫底,表明其旗舰定位侧重于推理复杂度而非速度。值得注意的是,Terra 被定位为 GPT-5.5 现有生产工作负载的迁移目标,成本约降低一半;而 Luna 在多项基准测试中仍接近 GPT-5.5 质量。开发者通过 iamspeed 工具实测,Luna 达 155.6 tok/s,Terra 首 token 最快仅 1931ms,Sol 则以 42.1 tok/s 和 4383ms 首 token 时间垫底。 #OpenAI #GPT56 #大模型 #AI #科技新闻 #性能评测 #开发者工具
Anthropic Claude Code首轮请求Token高达8.5万,未提问先占上下文
据外媒报道,AI咨询公司Systima对比测试了Anthropic旗下的AI编程工具Claude Code与开源工具OpenCode。测试发现,即便没有用户输入,Claude Code在首个请求中就会向模型发送约3.28万Token,远超OpenCode的6900 Token。这主要源于Claude Code随系统提示词附带27种工具说明(约2.4万Token),以及更长的系统提示词(约6500 Token)。在真实开发环境中,加上项目指示文件、MCP服务器等配置后,Claude Code首轮请求规模将升至7.5万至8.5万Token,相当于占用Claude Sonnet 20万Token上下文窗口的约六分之一。虽然启用提示词缓存可降低重复传输费用,但上下文占用不会减少。不过,在文件生成与执行测试中,Claude Code通过多工具打包调用,总请求数仅3次(12.1万Token),反而低于OpenCode的9次(13.2万Token)。但在使用子代理时,成本飙升,总输入Token从12.1万涨至51.3万。Systima建议在实际部署中监控实际Token用量。 #AI编程 #ClaudeCode #Anthropic #OpenCode #Token消耗 #上下文窗口 #成本优化
据外媒报道,AI咨询公司Systima对比测试了Anthropic旗下的AI编程工具Claude Code与开源工具OpenCode。测试发现,即便没有用户输入,Claude Code在首个请求中就会向模型发送约3.28万Token,远超OpenCode的6900 Token。这主要源于Claude Code随系统提示词附带27种工具说明(约2.4万Token),以及更长的系统提示词(约6500 Token)。在真实开发环境中,加上项目指示文件、MCP服务器等配置后,Claude Code首轮请求规模将升至7.5万至8.5万Token,相当于占用Claude Sonnet 20万Token上下文窗口的约六分之一。虽然启用提示词缓存可降低重复传输费用,但上下文占用不会减少。不过,在文件生成与执行测试中,Claude Code通过多工具打包调用,总请求数仅3次(12.1万Token),反而低于OpenCode的9次(13.2万Token)。但在使用子代理时,成本飙升,总输入Token从12.1万涨至51.3万。Systima建议在实际部署中监控实际Token用量。 #AI编程 #ClaudeCode #Anthropic #OpenCode #Token消耗 #上下文窗口 #成本优化
AI非人类,停止将其拟人化
近期,人工智能公司Anthropic公布了一项研究成果,其大语言模型Claude能够在“头脑中默默执行推理步骤”,这一描述引发公众对AI是否具备内在意识的担忧。然而,Anthropic团队实际发现的机制远没有那么耸人听闻:Claude拥有可针对特定提示进行调用和部署的代码,但不会将这一逻辑过程以人类可见的文字形式呈现。例如,当被问及“太阳系第四颗行星是什么颜色”时,模型可能直接回答“红色”,而从未在输出中提及“火星”这一名称。但Claude内部确实存在对应“火星”概念的数字编码,这一编码同样会在回答“哪颗行星以罗马战神命名”时被激活。文章指出,人们倾向于将机器拟人化,根源在于对自身人性的机械化理解。正如Spencer Klavan所言:“当人们开始将人类视作机器时,他们便开始将机器视作人类。”这一发现提醒我们,AI的强大能力并不等同于意识或情感,切勿以拟人化的语言模糊技术与人性之间的界限。 #AI #人工智能 #Claude #拟人化 #科技反思 #Anthropic #大模型
近期,人工智能公司Anthropic公布了一项研究成果,其大语言模型Claude能够在“头脑中默默执行推理步骤”,这一描述引发公众对AI是否具备内在意识的担忧。然而,Anthropic团队实际发现的机制远没有那么耸人听闻:Claude拥有可针对特定提示进行调用和部署的代码,但不会将这一逻辑过程以人类可见的文字形式呈现。例如,当被问及“太阳系第四颗行星是什么颜色”时,模型可能直接回答“红色”,而从未在输出中提及“火星”这一名称。但Claude内部确实存在对应“火星”概念的数字编码,这一编码同样会在回答“哪颗行星以罗马战神命名”时被激活。文章指出,人们倾向于将机器拟人化,根源在于对自身人性的机械化理解。正如Spencer Klavan所言:“当人们开始将人类视作机器时,他们便开始将机器视作人类。”这一发现提醒我们,AI的强大能力并不等同于意识或情感,切勿以拟人化的语言模糊技术与人性之间的界限。 #AI #人工智能 #Claude #拟人化 #科技反思 #Anthropic #大模型
对话韩芃睿:拆开AI大脑,看见与人脑相似的功能分工
近日,在与韩芃睿的访谈中,揭示了人工智能模型内部功能组织与人脑结构的惊人相似性。研究人员通过分析AI神经网络的活动模式,发现其在不同区域承担了类似人类大脑的特定认知任务,如语言处理、逻辑推理和视觉感知。这一发现挑战了传统AI“黑箱”认知,为理解智能本质提供了新视角。韩芃睿指出,这种功能分区可能是高效学习与适应的自然结果,未来或可借鉴人脑机制优化AI架构,促进可解释性AI的发展。但同时,他提醒需警惕简单类比的局限性,强调两者底层机制的差异。该研究不仅深化了对AI行为的理解,也为神经科学与计算模型的交叉研究开辟了新路径。 #人工智能 #脑科学 #神经网络 #功能分区 #认知科学 #韩芃睿 #智能研究
近日,在与韩芃睿的访谈中,揭示了人工智能模型内部功能组织与人脑结构的惊人相似性。研究人员通过分析AI神经网络的活动模式,发现其在不同区域承担了类似人类大脑的特定认知任务,如语言处理、逻辑推理和视觉感知。这一发现挑战了传统AI“黑箱”认知,为理解智能本质提供了新视角。韩芃睿指出,这种功能分区可能是高效学习与适应的自然结果,未来或可借鉴人脑机制优化AI架构,促进可解释性AI的发展。但同时,他提醒需警惕简单类比的局限性,强调两者底层机制的差异。该研究不仅深化了对AI行为的理解,也为神经科学与计算模型的交叉研究开辟了新路径。 #人工智能 #脑科学 #神经网络 #功能分区 #认知科学 #韩芃睿 #智能研究
Android 安全补丁政策重大调整
由于人工智能漏洞发现能力激增,Google 大幅调整了 Android 安全补丁策略。过去,中低严重性及多数隐私漏洞需升级至最新版本才能修复,而高严重性和严重漏洞则会回溯到前三个主要版本。如今,Android 安全支持大幅收紧:只有被判定为紧急风险的严重漏洞才会被回溯到最新两个版本(Android 16 和 17)。外部报告的漏洞仍按原有政策回溯约三年,但 Android 安全公告已不再列入中低严重性补丁,且公告通常在漏洞披露后 2-4 个月才发布,仅 Pixel、三星旗舰机及 GrapheneOS 能提前获得。大部分漏洞现由 Google 内部通过 AI 发现,老旧版本的最低安全支持已宣告结束。Android 17 是目前唯一拥有全部中低严重性补丁的版本,一旦 Android 18 发布,它将成为唯一获得当前高和严重补丁的版本。Linux 内核漏洞多数未被涵盖,补丁回溯极为缓慢。GrapheneOS 团队表示将与摩托罗拉和高通合作,为设备提供严肃补丁,并计划在发布新机型后持续移植最新 Linux LTS 分支。Google 被 AI 模型发现的海量漏洞压垮,已多次裁员,其安全公告体系也显得敷衍,社区正逆向工程二进制补丁,呼吁 Google 恢复开源安全预览补丁。 #Android #安全补丁 #AI漏洞 #GrapheneOS #手机安全 #科技新闻
由于人工智能漏洞发现能力激增,Google 大幅调整了 Android 安全补丁策略。过去,中低严重性及多数隐私漏洞需升级至最新版本才能修复,而高严重性和严重漏洞则会回溯到前三个主要版本。如今,Android 安全支持大幅收紧:只有被判定为紧急风险的严重漏洞才会被回溯到最新两个版本(Android 16 和 17)。外部报告的漏洞仍按原有政策回溯约三年,但 Android 安全公告已不再列入中低严重性补丁,且公告通常在漏洞披露后 2-4 个月才发布,仅 Pixel、三星旗舰机及 GrapheneOS 能提前获得。大部分漏洞现由 Google 内部通过 AI 发现,老旧版本的最低安全支持已宣告结束。Android 17 是目前唯一拥有全部中低严重性补丁的版本,一旦 Android 18 发布,它将成为唯一获得当前高和严重补丁的版本。Linux 内核漏洞多数未被涵盖,补丁回溯极为缓慢。GrapheneOS 团队表示将与摩托罗拉和高通合作,为设备提供严肃补丁,并计划在发布新机型后持续移植最新 Linux LTS 分支。Google 被 AI 模型发现的海量漏洞压垮,已多次裁员,其安全公告体系也显得敷衍,社区正逆向工程二进制补丁,呼吁 Google 恢复开源安全预览补丁。 #Android #安全补丁 #AI漏洞 #GrapheneOS #手机安全 #科技新闻
❤1
一份合同,每个模型
我最近完成了一项工程,它彻底改变了我对AI编码代理的认知。起初,我天真地问自己:“能让Sonnet和Opus像前沿模型一样工作吗?”结果却比问题本身更有价值。简单来说:无法让小模型和大模型同样强大,因为权重是硬伤,提示词无法改变。但能力并非区分好坏的唯一标准,另一半是“规范”:代理如何沟通、何时停止、如何证明工作、决策前分析的深度。而规范完全可以移植。你只需写一次,作为系统提示层应用,无论模型层级如何,昂贵或便宜,它们都开始遵循同一份合同。 本文是论点和蓝图。我运营着一个相当复杂的代码库:基于区块链的金融协议、20多个后端微服务、多个前端、智能合约和Kubernetes集群。大部分工作通过Claude Code和一系列专业子代理完成。每天,架构代理运行在最强大模型上,实现代理运行在中端模型上,快速研究代理运行在小模型上。三种智能体系,一个代码库,一套标准。痛点并非小模型“笨”,而是它行为不同:它可能未运行测试就宣布完成,以代码细节而非答案开始,基于单一搜索就修改,中途停下询问可自行解决的问题。大模型默认正确,小模型则需要指导。 我曾认为这是使用廉价模型的必然代价,但这是错误框架。我期望的行为不是智能,而是“操行”,操行可以被规定。能力是模型能解决的问题,存在于权重中,提示词无法添加。任何“让GPT-3.5如GPT-5般聪明”的销售都是空谈。操行是模型运用能力的规范:沟通合同、完成门槛、修改前追踪影响、不能半途而废。这都不是智能,但都可以用文本规定。当能力模型已具备这些行为,是因为它们被训练如此;这意味相同行为可以指导给低能力模型,显著缩小质量差距,尽管智能差距仍在。因此,目标不是“让小模型变聪明”,而是让每个模型,无论层级,遵守同一份操作合同。 #AI编码代理 #大模型 #软件开发 #技术规范 #工程实践
我最近完成了一项工程,它彻底改变了我对AI编码代理的认知。起初,我天真地问自己:“能让Sonnet和Opus像前沿模型一样工作吗?”结果却比问题本身更有价值。简单来说:无法让小模型和大模型同样强大,因为权重是硬伤,提示词无法改变。但能力并非区分好坏的唯一标准,另一半是“规范”:代理如何沟通、何时停止、如何证明工作、决策前分析的深度。而规范完全可以移植。你只需写一次,作为系统提示层应用,无论模型层级如何,昂贵或便宜,它们都开始遵循同一份合同。 本文是论点和蓝图。我运营着一个相当复杂的代码库:基于区块链的金融协议、20多个后端微服务、多个前端、智能合约和Kubernetes集群。大部分工作通过Claude Code和一系列专业子代理完成。每天,架构代理运行在最强大模型上,实现代理运行在中端模型上,快速研究代理运行在小模型上。三种智能体系,一个代码库,一套标准。痛点并非小模型“笨”,而是它行为不同:它可能未运行测试就宣布完成,以代码细节而非答案开始,基于单一搜索就修改,中途停下询问可自行解决的问题。大模型默认正确,小模型则需要指导。 我曾认为这是使用廉价模型的必然代价,但这是错误框架。我期望的行为不是智能,而是“操行”,操行可以被规定。能力是模型能解决的问题,存在于权重中,提示词无法添加。任何“让GPT-3.5如GPT-5般聪明”的销售都是空谈。操行是模型运用能力的规范:沟通合同、完成门槛、修改前追踪影响、不能半途而废。这都不是智能,但都可以用文本规定。当能力模型已具备这些行为,是因为它们被训练如此;这意味相同行为可以指导给低能力模型,显著缩小质量差距,尽管智能差距仍在。因此,目标不是“让小模型变聪明”,而是让每个模型,无论层级,遵守同一份操作合同。 #AI编码代理 #大模型 #软件开发 #技术规范 #工程实践
消息称荣耀与阿里将官宣合作 或涉及Agentic OS
据业内消息,荣耀与阿里巴巴即将官宣合作,可能涉及荣耀此前发布的下一代终端操作系统Agentic OS。该操作系统以意图驱动、自然交互、主动智能和天生跨端为核心特性,计划于7月正式发布。双方合作早有基础:2025年7月,荣耀Magic V5已搭载阿里通义大模型及飞猪、高德等垂直Agent应用;同年9月,双方全面深化战略合作,覆盖AI云基础设施、AI模型、AI Agent生态等领域,标志着阿里全栈AI技术首次整合应用于AI手机行业。此次合作有望进一步推动AI原生操作系统和智能终端生态发展。 #荣耀 #阿里 #合作 #AgenticOS #AI #手机 #操作系统 #大模型 #科技新闻
据业内消息,荣耀与阿里巴巴即将官宣合作,可能涉及荣耀此前发布的下一代终端操作系统Agentic OS。该操作系统以意图驱动、自然交互、主动智能和天生跨端为核心特性,计划于7月正式发布。双方合作早有基础:2025年7月,荣耀Magic V5已搭载阿里通义大模型及飞猪、高德等垂直Agent应用;同年9月,双方全面深化战略合作,覆盖AI云基础设施、AI模型、AI Agent生态等领域,标志着阿里全栈AI技术首次整合应用于AI手机行业。此次合作有望进一步推动AI原生操作系统和智能终端生态发展。 #荣耀 #阿里 #合作 #AgenticOS #AI #手机 #操作系统 #大模型 #科技新闻
AuditWeave:为AI辅助与数据转换工作流打造防篡改、可审计的证据层
近日,来自arXiv的一篇论文提出了名为AuditWeave的新型证据层框架,旨在解决AI辅助工作流及数据转换过程中的审计与防篡改难题。随着AI模型在数据处理、生成和分析中的应用日益广泛,确保每一步操作的可追溯性和完整性成为合规与安全的关键。AuditWeave通过设计一种审计者可导航的证据结构,使得对工作流的每一步都能进行独立验证,且对任何篡改行为保持高度敏感。该框架有望提升金融、医疗等领域中AI工作流的透明度和可信度,为监管机构提供切实可行的审计工具。研究由Vimal Nakrani主导,论文已发布于arXiv预印本平台。 #AuditWeave #AI审计 #数据安全 #工作流 #防篡改 #arXiv #学术研究 #人工智能 #合规
近日,来自arXiv的一篇论文提出了名为AuditWeave的新型证据层框架,旨在解决AI辅助工作流及数据转换过程中的审计与防篡改难题。随着AI模型在数据处理、生成和分析中的应用日益广泛,确保每一步操作的可追溯性和完整性成为合规与安全的关键。AuditWeave通过设计一种审计者可导航的证据结构,使得对工作流的每一步都能进行独立验证,且对任何篡改行为保持高度敏感。该框架有望提升金融、医疗等领域中AI工作流的透明度和可信度,为监管机构提供切实可行的审计工具。研究由Vimal Nakrani主导,论文已发布于arXiv预印本平台。 #AuditWeave #AI审计 #数据安全 #工作流 #防篡改 #arXiv #学术研究 #人工智能 #合规
关于KV缓存压缩的消融、统计推断与验证研究
一项旨在提升大语言模型推理效率的研究近期在arXiv上发布。该论文题为《Ablation, Statistical Inference, and Validation for KV-Cache Compression》,由Paolo D'Alberto等人撰写,主要聚焦于KV缓存压缩技术。KV缓存是大模型推理过程中的关键数据结构,其规模直接影响内存占用与计算速度。研究者提出了一套系统的方法论,通过消融实验、统计推断与验证等手段,深入分析并优化KV缓存压缩策略。具体而言,该工作旨在在不显著影响模型输出质量的前提下,尽可能压缩KV缓存,从而降低推理延迟和硬件成本。研究引入了严谨的统计验证流程,以确保压缩后的缓存仍能保持模型的有效性。这一工作对于推动大模型在资源受限环境下的部署具有实际意义,也为后续相关研究提供了方法论参考。 #KV缓存压缩 #大模型推理 #消融研究 #统计推断 #AI效率 #arXiv论文 #机器学习
一项旨在提升大语言模型推理效率的研究近期在arXiv上发布。该论文题为《Ablation, Statistical Inference, and Validation for KV-Cache Compression》,由Paolo D'Alberto等人撰写,主要聚焦于KV缓存压缩技术。KV缓存是大模型推理过程中的关键数据结构,其规模直接影响内存占用与计算速度。研究者提出了一套系统的方法论,通过消融实验、统计推断与验证等手段,深入分析并优化KV缓存压缩策略。具体而言,该工作旨在在不显著影响模型输出质量的前提下,尽可能压缩KV缓存,从而降低推理延迟和硬件成本。研究引入了严谨的统计验证流程,以确保压缩后的缓存仍能保持模型的有效性。这一工作对于推动大模型在资源受限环境下的部署具有实际意义,也为后续相关研究提供了方法论参考。 #KV缓存压缩 #大模型推理 #消融研究 #统计推断 #AI效率 #arXiv论文 #机器学习