阿里通义发布 Qwen3.8-Flash 模型,称其性能比肩 Opus 4.6 和 V4-Flash
阿里通义发布多模态 MoE 模型 Qwen3.8-Flash,并开源作为 Qwen4 架构预览的 Qwen3.8-Flash-Next。模型 125B 参数、每 token 仅激活 6B,上下文原生 262K、可扩展至 1M。阿里称其性能可比肩 Anthropic Opus 4.6 和 DeepSeek V4-Flash。
相比 Qwen3.7-Plus,训练成本仅约九分之一,编码与办公任务表现更优。每百万输入 tokens 定价 0.16 美元、输出 0.47 美元。
Qwen | Qwen | Bloomberg
阿里通义发布多模态 MoE 模型 Qwen3.8-Flash,并开源作为 Qwen4 架构预览的 Qwen3.8-Flash-Next。模型 125B 参数、每 token 仅激活 6B,上下文原生 262K、可扩展至 1M。阿里称其性能可比肩 Anthropic Opus 4.6 和 DeepSeek V4-Flash。
相比 Qwen3.7-Plus,训练成本仅约九分之一,编码与办公任务表现更优。每百万输入 tokens 定价 0.16 美元、输出 0.47 美元。
Qwen | Qwen | Bloomberg
Z.ai 发布 GLM-5.3-Flash,18B 激活参数价格仅上代十分之一,限时价格低至每百万 Tokens 输入 0.075 美元
Z.ai 发布 GLM-5 系列首个原生多模态模型 GLM-5.3-Flash,总参数 320B、激活参数仅 18B。其在多项编程和智能体基准上超过 GLM-5.2,价格降至约十分之一,并接近 Claude Opus 4.8。限时优惠期间,API输入价格为每百万Tokens 0.075美元,缓存输入为0.015美元,输出为0.25美元,缓存存储暂时免费;原价分别为0.15美元、0.03美元和0.50美元。
该模型采用稀疏与线性注意力混合架构,匿名测试期间成为本周最受欢迎模型,且全部流量由国产 AI 芯片服务;官方称在国产芯片上端到端推理性能提升 3 倍,成本可比肩主流英伟达 GPU。
Z.ai
Z.ai 发布 GLM-5 系列首个原生多模态模型 GLM-5.3-Flash,总参数 320B、激活参数仅 18B。其在多项编程和智能体基准上超过 GLM-5.2,价格降至约十分之一,并接近 Claude Opus 4.8。限时优惠期间,API输入价格为每百万Tokens 0.075美元,缓存输入为0.015美元,输出为0.25美元,缓存存储暂时免费;原价分别为0.15美元、0.03美元和0.50美元。
该模型采用稀疏与线性注意力混合架构,匿名测试期间成为本周最受欢迎模型,且全部流量由国产 AI 芯片服务;官方称在国产芯片上端到端推理性能提升 3 倍,成本可比肩主流英伟达 GPU。
Z.ai
Telegram 推出欢迎消息等功能,消息按钮与礼物签名同步上线
Telegram 发布更新,群组和频道新增仅新成员可见的欢迎消息,支持多条消息、媒体和富文本。
开发者可在单条消息内加入多个按钮,用于问卷、游戏和商品浏览等互动;富文本编辑器支持插入文档、文件和音乐,礼物市场支持为购买的礼物添加签名和评论。
Telegram
Telegram 发布更新,群组和频道新增仅新成员可见的欢迎消息,支持多条消息、媒体和富文本。
开发者可在单条消息内加入多个按钮,用于问卷、游戏和商品浏览等互动;富文本编辑器支持插入文档、文件和音乐,礼物市场支持为购买的礼物添加签名和评论。
Telegram
英伟达洽购 Hugging Face,估值超 130 亿美元
据知情人士透露,英伟达近期与开源 AI 平台 Hugging Face 进行收购洽谈,交易估值可能超过 130 亿美元。双方尚未达成协议,谈判仍可能破裂。微软也曾接触,但目前谈判已停止。
英伟达已是 Hugging Face 股东,曾参与其 2023 年 2.35 亿美元融资(当时估值 45 亿美元)。去年 Hugging Face 还拒绝了英伟达 5 亿美元的投资要约。
Business Insider
据知情人士透露,英伟达近期与开源 AI 平台 Hugging Face 进行收购洽谈,交易估值可能超过 130 亿美元。双方尚未达成协议,谈判仍可能破裂。微软也曾接触,但目前谈判已停止。
英伟达已是 Hugging Face 股东,曾参与其 2023 年 2.35 亿美元融资(当时估值 45 亿美元)。去年 Hugging Face 还拒绝了英伟达 5 亿美元的投资要约。
Business Insider
GLM-5.3-Flash 还有个更猛的细节。
它匿名叫 Ox Alpha 的这一周,OpenCode 和 OpenRouter 的推理流量全部由国产 AI 芯片承载。
仅 OpenRouter 前 6 个完整日就跑了 23.2T Token;OpenCode 当时给出的供应能力更是每天 100T Token。
智谱称,他们在相同中国国产硬件上把端到端推理性能优化到了最初的 3 倍,现在硬件效率和单 Token 成本已经能做到接近主流英伟达 GPU。
SemiAnalysis 特意把这一点挑了出来。此前外界看到每天 100 万亿 Token 的供给能力,还在猜这种规模是不是只有顶级实验室和英伟达 GPU 扛得住。结果这次从头到尾用的都是中国国产芯片!
它匿名叫 Ox Alpha 的这一周,OpenCode 和 OpenRouter 的推理流量全部由国产 AI 芯片承载。
仅 OpenRouter 前 6 个完整日就跑了 23.2T Token;OpenCode 当时给出的供应能力更是每天 100T Token。
智谱称,他们在相同中国国产硬件上把端到端推理性能优化到了最初的 3 倍,现在硬件效率和单 Token 成本已经能做到接近主流英伟达 GPU。
SemiAnalysis 特意把这一点挑了出来。此前外界看到每天 100 万亿 Token 的供给能力,还在猜这种规模是不是只有顶级实验室和英伟达 GPU 扛得住。结果这次从头到尾用的都是中国国产芯片!
AI新闻
Ox Alpha 今日于 OpenRouter 处理量逼近 6 万亿 token 据 OpenRouter 介绍,Ox Alpha 今日于此平台处理量有望达到近 6 万亿 token。用户现可通过 ori 在编程代理中试用,运行命令 ori[your favorite harness] --model stealth/ox-alpha。 OpenRouter(@OpenRouter)
Ox Alpha 已揭晓为 GLM-5.3-Flash,但令人震惊的是,每日 100T 令牌的处理量是由中国芯片提供的。
每天 100 万亿个 token 的免费 token,人们却在说只有前沿实验室才有这么多的计算资源。
但是所有流量都运行在中国芯片上,实现了与 Nvidia GPU 相当的硬件效率和每个 token 成本。
cuda 护城河再次受到考验。
每天 100 万亿个 token 的免费 token,人们却在说只有前沿实验室才有这么多的计算资源。
但是所有流量都运行在中国芯片上,实现了与 Nvidia GPU 相当的硬件效率和每个 token 成本。
cuda 护城河再次受到考验。
👍1
英伟达凭首批H200芯片销售重返中国市场
英伟达公司表示,在最近一个季度向中国客户销售了少量的 H200 芯片。英伟达公司周三在其财报中表示,在截至7月26日的三个月里,向中国买家销售 H200 的收入占这家芯片制造商数据中心收入的不到1%。
该公司补充称,由于北京当局的反对,公司未能向中国销售一月份获批的美国政府许可证所允许的全部 H200 数量。由于该产品需求减弱,该公司在过去六个月中针对过剩的 H200 库存计提了 4 亿美元的费用。这些芯片销售,连同其他非AI产品线,包括与电脑游戏相关的硬件,助力来自中国的销售额达到78.8亿美元,较上年同期几乎翻倍。
—— 彭博社
英伟达公司表示,在最近一个季度向中国客户销售了少量的 H200 芯片。英伟达公司周三在其财报中表示,在截至7月26日的三个月里,向中国买家销售 H200 的收入占这家芯片制造商数据中心收入的不到1%。
该公司补充称,由于北京当局的反对,公司未能向中国销售一月份获批的美国政府许可证所允许的全部 H200 数量。由于该产品需求减弱,该公司在过去六个月中针对过剩的 H200 库存计提了 4 亿美元的费用。这些芯片销售,连同其他非AI产品线,包括与电脑游戏相关的硬件,助力来自中国的销售额达到78.8亿美元,较上年同期几乎翻倍。
—— 彭博社