LLM Token 成本深度解析
据技术分析文章披露,在大型语言模型的成本构成中,提示缓存占据主导地位。以一次长达31小时的Claude Code会话为例,总成本172.58美元中,缓存读取费用高达114.98美元,占总账单的66%。这意味着如果缺乏对缓存机制的精确理解,优化成本将无从谈起。文章以Claude为模型详细拆解了缓存的工作方式:每次发送消息时,客户端都会重新发送整个对话历史,但通过缓存控制标记,系统会将静态的提示前缀标记为可缓存,只有最后一条新消息需要全额计费。然而,缓存条目仅有5分钟生存时间,如果用户回复间隔超过5分钟,缓存会过期,后续消息必须重新写入缓存,从而产生高昂费用。不同模型在缓存策略上存在差异:GPT对超过约1K词元的提示自动启用缓存,Gemini则需显式创建缓存对象且前缀超过约32K词元。理解这一机制是优化AI使用成本的关键。 #LLM #成本 #PromptCaching #Claude #AI #大模型 #缓存机制 #技术分析
据技术分析文章披露,在大型语言模型的成本构成中,提示缓存占据主导地位。以一次长达31小时的Claude Code会话为例,总成本172.58美元中,缓存读取费用高达114.98美元,占总账单的66%。这意味着如果缺乏对缓存机制的精确理解,优化成本将无从谈起。文章以Claude为模型详细拆解了缓存的工作方式:每次发送消息时,客户端都会重新发送整个对话历史,但通过缓存控制标记,系统会将静态的提示前缀标记为可缓存,只有最后一条新消息需要全额计费。然而,缓存条目仅有5分钟生存时间,如果用户回复间隔超过5分钟,缓存会过期,后续消息必须重新写入缓存,从而产生高昂费用。不同模型在缓存策略上存在差异:GPT对超过约1K词元的提示自动启用缓存,Gemini则需显式创建缓存对象且前缀超过约32K词元。理解这一机制是优化AI使用成本的关键。 #LLM #成本 #PromptCaching #Claude #AI #大模型 #缓存机制 #技术分析
AI生成海报泛滥英国社区,千篇一律缺乏灵魂
英国各地社区中心、公园跳蚤市场、酒吧开放麦等活动的宣传海报,正被一种千篇一律的AI生成风格所占领。这些海报通常背景拥挤,堆满鲜花、笑脸儿童或可爱动物(但常有六条腿的狗或巨型鸭子等诡异错误),角落装饰彩旗,字体简陋,信息被强行叠加在木板或古旧卷轴上,整体呈现一种毫无生气的黄褐色调。调查发现,这种风格已成为ChatGPT的默认输出,从康沃尔到卡莱尔,视觉语言高度同质化。原因在于,时间紧张的志愿者或商家可以免费快速生成“过得去”的海报,但这一趋势挤压了专业设计师的生存空间,也让社区活动失去了人情味和独特性。 #AI #人工智能 #海报设计 #社区活动 #视觉污染 #ChatGPT #科技影响 #设计行业 #英国
英国各地社区中心、公园跳蚤市场、酒吧开放麦等活动的宣传海报,正被一种千篇一律的AI生成风格所占领。这些海报通常背景拥挤,堆满鲜花、笑脸儿童或可爱动物(但常有六条腿的狗或巨型鸭子等诡异错误),角落装饰彩旗,字体简陋,信息被强行叠加在木板或古旧卷轴上,整体呈现一种毫无生气的黄褐色调。调查发现,这种风格已成为ChatGPT的默认输出,从康沃尔到卡莱尔,视觉语言高度同质化。原因在于,时间紧张的志愿者或商家可以免费快速生成“过得去”的海报,但这一趋势挤压了专业设计师的生存空间,也让社区活动失去了人情味和独特性。 #AI #人工智能 #海报设计 #社区活动 #视觉污染 #ChatGPT #科技影响 #设计行业 #英国
Gemma 4 E4B 成 Mac 本地 AI 模型新宠,替代 Qwen 部署
Prime Intellect 研究工程师 Florian Brand 宣布,已将 Google DeepMind 的 Gemma 4 E4B 6-bit 量化模型作为其 Mac 上的首选本地大语言模型,并通过 LM Studio 实现全天候加载。该模型替换了他已连续使用九个月的 Qwen 系列模型。Brand 称赞 Gemma 4 性能惊人,在有限硬件上运行速度极快且输出质量接近 GPT-4o 级别。其 Mac 配置为 M4 Max 芯片、64GB 内存,模型运行时仅占用约 7GB 显存。用户社群对此反响热烈,认为 Gemma 4 在本地部署实用性上表现突出。 #AI #大模型 #Gemma #Mac本地 #量化模型 #GoogleDeepMind
Prime Intellect 研究工程师 Florian Brand 宣布,已将 Google DeepMind 的 Gemma 4 E4B 6-bit 量化模型作为其 Mac 上的首选本地大语言模型,并通过 LM Studio 实现全天候加载。该模型替换了他已连续使用九个月的 Qwen 系列模型。Brand 称赞 Gemma 4 性能惊人,在有限硬件上运行速度极快且输出质量接近 GPT-4o 级别。其 Mac 配置为 M4 Max 芯片、64GB 内存,模型运行时仅占用约 7GB 显存。用户社群对此反响热烈,认为 Gemma 4 在本地部署实用性上表现突出。 #AI #大模型 #Gemma #Mac本地 #量化模型 #GoogleDeepMind