「牛来」模型Ox Alpha就是 GLM-5.3 Flash?预测市场超九成认定智谱
神秘模型 Ox Alpha 的身份竞猜已经明显倒向智谱。Polymarket 上,Z.ai 的概率目前超过 90%,第二名 Google 只有约 5%。Ox Alpha 是最近突然出现在 OpenRouter 上的匿名推理模型,主打编程和长时间 Agent 任务。
最硬的线索来自后端。社区开发者故意向 OpenCode 的 Ox Alpha 接口发送错误参数,服务器吐出了 com.wd.paas.api.domain.v4.chat.ChatCompletionRequest。其中的 paas/v4/chat 与 Z.ai 官方 API 路径直接对上。继续发送非法 role 时,Ox Alpha 又返回 1214 Incorrect role information,和 Z.ai 自己托管的 GLM 一致。换成 DeepInfra 托管同一 GLM 权重,报错格式就变了。
模型本身的指纹也对上了。一份公开取证跑了 600 多次请求、约 1350 万输入 Token,44 组分词器测试全部匹配 GLM-5 这一代。
动察 Beating 频道 · 动察 Beating 交流群
神秘模型 Ox Alpha 的身份竞猜已经明显倒向智谱。Polymarket 上,Z.ai 的概率目前超过 90%,第二名 Google 只有约 5%。Ox Alpha 是最近突然出现在 OpenRouter 上的匿名推理模型,主打编程和长时间 Agent 任务。
最硬的线索来自后端。社区开发者故意向 OpenCode 的 Ox Alpha 接口发送错误参数,服务器吐出了 com.wd.paas.api.domain.v4.chat.ChatCompletionRequest。其中的 paas/v4/chat 与 Z.ai 官方 API 路径直接对上。继续发送非法 role 时,Ox Alpha 又返回 1214 Incorrect role information,和 Z.ai 自己托管的 GLM 一致。换成 DeepInfra 托管同一 GLM 权重,报错格式就变了。
模型本身的指纹也对上了。一份公开取证跑了 600 多次请求、约 1350 万输入 Token,44 组分词器测试全部匹配 GLM-5 这一代。
动察 Beating 频道 · 动察 Beating 交流群
😁6🤡3
让AI迁移整个代码库,94.6%没过关:20项任务13项无人做成
AI Agent 公司 Einsia 发布 SWE Refactor Bench,专门测 Coding Agent 能不能自己迁移整个代码库。20 个任务来自 SQLite、zlib、libsodium、GraphHopper 等真实项目,包括 C 改 Rust、Maven 改 Gradle、SQLite 移植到 WASI。每项给 Agent 6~30 小时。
评测第一关检查旧技术栈是不是真的被替掉,防止 Agent 留着旧代码混过去;第二关跑超过 13 万项固定检查;最后再派 6 个独立 Coding Agent,各花 1 小时专门找隐藏 bug。
8 个前沿模型、26 种配置一共跑了 520 次。340 次确实完成迁移,88 次把预先准备的测试全部跑绿,但其中 60 次又被最后一轮找出了隐藏 bug。最终只有 28 次完全过关,通过率 5.4%;20 个任务里有 13 个没人做成。Claude Opus 5 的 xhigh 配置最好,20 个任务完整通过 5 个。
现在的 Coding Agent 已经能大规模改代码,但要做到「整个系统改完还能完全不出错」,还差得很远。
信源
动察 Beating 频道 · 动察 Beating 交流群
AI Agent 公司 Einsia 发布 SWE Refactor Bench,专门测 Coding Agent 能不能自己迁移整个代码库。20 个任务来自 SQLite、zlib、libsodium、GraphHopper 等真实项目,包括 C 改 Rust、Maven 改 Gradle、SQLite 移植到 WASI。每项给 Agent 6~30 小时。
评测第一关检查旧技术栈是不是真的被替掉,防止 Agent 留着旧代码混过去;第二关跑超过 13 万项固定检查;最后再派 6 个独立 Coding Agent,各花 1 小时专门找隐藏 bug。
8 个前沿模型、26 种配置一共跑了 520 次。340 次确实完成迁移,88 次把预先准备的测试全部跑绿,但其中 60 次又被最后一轮找出了隐藏 bug。最终只有 28 次完全过关,通过率 5.4%;20 个任务里有 13 个没人做成。Claude Opus 5 的 xhigh 配置最好,20 个任务完整通过 5 个。
现在的 Coding Agent 已经能大规模改代码,但要做到「整个系统改完还能完全不出错」,还差得很远。
信源
动察 Beating 频道 · 动察 Beating 交流群
👍1
AI算力「挤爆」内存供应链!亚马逊等科技巨头集体涨价,内存荒或持续至2027年
AI 算力需求激增正持续推高存储芯片价格,上游成本压力开始向消费电子及硬件终端传导。近期,亚马逊上调多款硬件产品售价,其中销量最大的入门款 Echo 智能音箱由 49.99 美元涨至 79.99 美元,涨幅约 60%;16GB 基础版电子书阅读器由 109.99 美元涨至 149.99 美元,涨幅约 36%。
在亚马逊之前,苹果、微软、戴尔等科技企业也已通过提高产品售价、削减硬件标配内存等方式应对存储成本上涨。机构 IDC 此前警告,全球内存供应紧张或持续至 2027 年,行业预计存储芯片价格可能在 2028 年触顶后逐步回落。
信源
动察 Beating 频道 · 动察 Beating 交流群
AI 算力需求激增正持续推高存储芯片价格,上游成本压力开始向消费电子及硬件终端传导。近期,亚马逊上调多款硬件产品售价,其中销量最大的入门款 Echo 智能音箱由 49.99 美元涨至 79.99 美元,涨幅约 60%;16GB 基础版电子书阅读器由 109.99 美元涨至 149.99 美元,涨幅约 36%。
在亚马逊之前,苹果、微软、戴尔等科技企业也已通过提高产品售价、削减硬件标配内存等方式应对存储成本上涨。机构 IDC 此前警告,全球内存供应紧张或持续至 2027 年,行业预计存储芯片价格可能在 2028 年触顶后逐步回落。
信源
动察 Beating 频道 · 动察 Beating 交流群
🫡1
SemiAnalysis创始人:2028年AI大部分算力只属于两家公司
SemiAnalysis 创始人 Dylan Patel 在最新播客中预测,到 2028 年,OpenAI 与 Anthropic 或将占据全球 70% 至 80% 的新增 AI 算力,合计算力规模可能超过 100GW。Patel 称,两家公司目前已占全球年度新增算力约 30%,且这一比例仍在快速上升。
Patel 指出,前沿 AI 实验室的商业模式正在发生变化,AI 算力产出效率大幅提升,Anthropic 当前每兆瓦算力对应的收入已达约 5000 万美元,并可能进一步升至 1 亿美元。这使 OpenAI、Anthropic 能够以每兆瓦 2500 万至 5000 万美元的高价采购或租赁算力。
更值得关注的是,Patel 预计 2024 年至 2029 年全球 AI 相关资本开支将达到约 11 万亿美元,其中超过 5 万亿美元需要通过债务融资完成。由于 AI 基础设施的潜在回报率远高于传统行业,科技巨头可能接受更高融资成本,从而推升整体信贷利率,并对传统资产估值及高负债经济体形成挤压。
此外,Patel 认为,未来新增算力未必主要用于对外提供模型推理服务,而可能更多流向 AI 实验室内部研发和模型自我改进。
信源
动察 Beating 频道 · 动察 Beating 交流群
SemiAnalysis 创始人 Dylan Patel 在最新播客中预测,到 2028 年,OpenAI 与 Anthropic 或将占据全球 70% 至 80% 的新增 AI 算力,合计算力规模可能超过 100GW。Patel 称,两家公司目前已占全球年度新增算力约 30%,且这一比例仍在快速上升。
Patel 指出,前沿 AI 实验室的商业模式正在发生变化,AI 算力产出效率大幅提升,Anthropic 当前每兆瓦算力对应的收入已达约 5000 万美元,并可能进一步升至 1 亿美元。这使 OpenAI、Anthropic 能够以每兆瓦 2500 万至 5000 万美元的高价采购或租赁算力。
更值得关注的是,Patel 预计 2024 年至 2029 年全球 AI 相关资本开支将达到约 11 万亿美元,其中超过 5 万亿美元需要通过债务融资完成。由于 AI 基础设施的潜在回报率远高于传统行业,科技巨头可能接受更高融资成本,从而推升整体信贷利率,并对传统资产估值及高负债经济体形成挤压。
此外,Patel 认为,未来新增算力未必主要用于对外提供模型推理服务,而可能更多流向 AI 实验室内部研发和模型自我改进。
信源
动察 Beating 频道 · 动察 Beating 交流群
Skild AI发布新机器人基础模型S1:看一段视频就能学会新任务
机器人通用大脑公司 Skild AI 发布新一代机器人基础模型 S1。它最大的变化是,教机器人干新活不用重新微调模型,只要给它看一段人类示范视频,就能直接照着学。官方展示的任务最长超过 10 分钟,包括煎饼翻面、手冲咖啡、给植物换盆等此前没训练过的任务。
S1 会把示范视频直接当成 Prompt,再输出机器人动作。换盆实验中,从开始录制人类示范,到机器人自己开始执行,只用了 11 分钟。即使中途被打断或出错,它也会根据当前环境继续调整,而不是机械重播视频里的动作。
Skild 的内部评测中,两种模型都使用相同的 10 万小时数据预训练。面对没见过的新任务,S1 平均单步成功率达到 66%,传统语言指令 VLA 只有 9%。后者大约需要再收集 380 次任务示范并微调,才能追到 S1 看一次视频后的水平。
S1 目前已开始向少量工业客户部署,未来几个月会继续扩大范围。
信源
动察 Beating 频道 · 动察 Beating 交流群
机器人通用大脑公司 Skild AI 发布新一代机器人基础模型 S1。它最大的变化是,教机器人干新活不用重新微调模型,只要给它看一段人类示范视频,就能直接照着学。官方展示的任务最长超过 10 分钟,包括煎饼翻面、手冲咖啡、给植物换盆等此前没训练过的任务。
S1 会把示范视频直接当成 Prompt,再输出机器人动作。换盆实验中,从开始录制人类示范,到机器人自己开始执行,只用了 11 分钟。即使中途被打断或出错,它也会根据当前环境继续调整,而不是机械重播视频里的动作。
Skild 的内部评测中,两种模型都使用相同的 10 万小时数据预训练。面对没见过的新任务,S1 平均单步成功率达到 66%,传统语言指令 VLA 只有 9%。后者大约需要再收集 380 次任务示范并微调,才能追到 S1 看一次视频后的水平。
S1 目前已开始向少量工业客户部署,未来几个月会继续扩大范围。
信源
动察 Beating 频道 · 动察 Beating 交流群
智谱认领Ox Alpha:GLM新版本直接支持图片视频,今晚开源
智谱确认 Ox Alpha 是 GLM 系列的一个新版本,今晚就会公开模型权重。
此前社区已经从 API 报错、分词器等线索把它指向智谱,现在终于实锤。
Ox Alpha 上周末匿名登陆 OpenRouter,主打编程和长时间 Agent 任务,同时支持文本、图片和视频输入。上线后很快冲到 OpenRouter 用量第一,使用量已经超过 DeepSeek 两倍。OpenRouter 称,这是平台历史上规模最大的一次模型发布。
多模态也是这次值得关注的变化。智谱过去一直把主 GLM 和 GLM-V 视觉模型分开,像 GLM-5 只支持文本,图片和视频则交给 GLM-5V-Turbo 等模型。这次 Ox Alpha 被直接确认为新的 GLM 版本,却同时能处理图片和视频。如果最终正式型号不再带「V」,相当于智谱开始把两条模型线往一起合。
Ox Alpha 还会继续免费一周,之后如何收费暂未公布。
信源
动察 Beating 频道 · 动察 Beating 交流群
智谱确认 Ox Alpha 是 GLM 系列的一个新版本,今晚就会公开模型权重。
此前社区已经从 API 报错、分词器等线索把它指向智谱,现在终于实锤。
Ox Alpha 上周末匿名登陆 OpenRouter,主打编程和长时间 Agent 任务,同时支持文本、图片和视频输入。上线后很快冲到 OpenRouter 用量第一,使用量已经超过 DeepSeek 两倍。OpenRouter 称,这是平台历史上规模最大的一次模型发布。
多模态也是这次值得关注的变化。智谱过去一直把主 GLM 和 GLM-V 视觉模型分开,像 GLM-5 只支持文本,图片和视频则交给 GLM-5V-Turbo 等模型。这次 Ox Alpha 被直接确认为新的 GLM 版本,却同时能处理图片和视频。如果最终正式型号不再带「V」,相当于智谱开始把两条模型线往一起合。
Ox Alpha 还会继续免费一周,之后如何收费暂未公布。
信源
动察 Beating 频道 · 动察 Beating 交流群
👍5
MiniMax半年收入已超去年全年:企业和开发者调用模型撑起六成
MiniMax 上半年收入 1.17 亿美元,同比增长 283.1%,半年已经超过去年全年。
增长最快的,是企业和开发者调用 MiniMax 模型的生意。这部分收入从 920 万美元涨到 7393 万美元,同比增长 703.1%,已经占总收入的 63.4%。增长主要来自付费用户和企业客户增加、API 调用量上升,以及 Token 套餐普及。
海螺 AI 等 AI 产品收入也翻了一倍,达到 4264 万美元,但占比已经降到 36.6%。海外仍是主要市场,中国内地以外收入占 60.8%。
赚钱效率有所改善。毛利率从 12.1% 升到 17.9%,销售推广开支还下降了 17.9%。但研发依然很烧钱,上半年研发开支达到 2.97 亿美元,约是同期收入的 2.5 倍。
账面净亏损同比收窄 11% 至 3.58 亿美元,但这主要受上市后金融负债公允价值亏损大幅减少影响。剔除这类项目后,经调整净亏损反而扩大 111.2% 至 2.93 亿美元。
信源
动察 Beating 频道 · 动察 Beating 交流群
MiniMax 上半年收入 1.17 亿美元,同比增长 283.1%,半年已经超过去年全年。
增长最快的,是企业和开发者调用 MiniMax 模型的生意。这部分收入从 920 万美元涨到 7393 万美元,同比增长 703.1%,已经占总收入的 63.4%。增长主要来自付费用户和企业客户增加、API 调用量上升,以及 Token 套餐普及。
海螺 AI 等 AI 产品收入也翻了一倍,达到 4264 万美元,但占比已经降到 36.6%。海外仍是主要市场,中国内地以外收入占 60.8%。
赚钱效率有所改善。毛利率从 12.1% 升到 17.9%,销售推广开支还下降了 17.9%。但研发依然很烧钱,上半年研发开支达到 2.97 亿美元,约是同期收入的 2.5 倍。
账面净亏损同比收窄 11% 至 3.58 亿美元,但这主要受上市后金融负债公允价值亏损大幅减少影响。剔除这类项目后,经调整净亏损反而扩大 111.2% 至 2.93 亿美元。
信源
动察 Beating 频道 · 动察 Beating 交流群
Perplexity发布Portable Computer:跑本地模型,订阅费照收
Perplexity 发布 Portable Computer,把整个 Computer Agent 搬到本地运行。模型、规划、工具调用、任务队列和文件搜索都在自己的电脑上完成,本地任务不再消耗 Perplexity credits。
首发支持 NVIDIA DGX Spark,可跑 Qwen 3.8 27B 和 Perplexity 后训练的 PPLX 27B。需要联网搜索、浏览器操作或更强推理时,再经用户同意调用云端 15+ 个前沿模型。
即使模型和算力都是用户自己的,Portable Computer 仍然只对 Pro 和 Max 订阅用户开放。社区已经有人吐槽:自己买机器跑本地模型,为什么还要给 Perplexity 交月费?
信源
动察 Beating 频道 · 动察 Beating 交流群
Perplexity 发布 Portable Computer,把整个 Computer Agent 搬到本地运行。模型、规划、工具调用、任务队列和文件搜索都在自己的电脑上完成,本地任务不再消耗 Perplexity credits。
首发支持 NVIDIA DGX Spark,可跑 Qwen 3.8 27B 和 Perplexity 后训练的 PPLX 27B。需要联网搜索、浏览器操作或更强推理时,再经用户同意调用云端 15+ 个前沿模型。
即使模型和算力都是用户自己的,Portable Computer 仍然只对 Pro 和 Max 订阅用户开放。社区已经有人吐槽:自己买机器跑本地模型,为什么还要给 Perplexity 交月费?
信源
动察 Beating 频道 · 动察 Beating 交流群
💩6👎2
前Yandex高管融资2600万美元,要把1000亿网页喂给AI Agent
AI 搜索公司 Keenable 结束隐身,拿到 2600 万美元种子轮融资,由 Accel 领投、Conviction 参投。公司自建了超过 1000 亿篇网页的独立索引,Agent 可通过 API 或 MCP 搜索,并直接拿到整理后的网页正文。
创始人 Andrey Styskin 曾负责 Yandex 搜索和广告业务,后来又在 Amazon AGI 做 Web 基础设施。
Styskin 还宣布上线 Web Query Language(WQL)。简单说,它想让 Agent 不再一个个搜网页,而是直接把整个 Web 当数据库查。哪怕答案分散在不同网站,也能一次筛出来再拼到一起。可以把它理解成「给互联网加了一层类似 SQL 的查询接口」。Search API 和 WQL 免费开放到 9 月底。
Keenable 不是第一个做 Agent 搜索的。Exa 也自己维护约 1000 亿篇网页的索引。Keenable 现在一个直接优势是价格:每 1000 次搜索 4 美元,Exa 是 7 美元,便宜约 43%。
信源
动察 Beating 频道 · 动察 Beating 交流群
AI 搜索公司 Keenable 结束隐身,拿到 2600 万美元种子轮融资,由 Accel 领投、Conviction 参投。公司自建了超过 1000 亿篇网页的独立索引,Agent 可通过 API 或 MCP 搜索,并直接拿到整理后的网页正文。
创始人 Andrey Styskin 曾负责 Yandex 搜索和广告业务,后来又在 Amazon AGI 做 Web 基础设施。
Styskin 还宣布上线 Web Query Language(WQL)。简单说,它想让 Agent 不再一个个搜网页,而是直接把整个 Web 当数据库查。哪怕答案分散在不同网站,也能一次筛出来再拼到一起。可以把它理解成「给互联网加了一层类似 SQL 的查询接口」。Search API 和 WQL 免费开放到 9 月底。
Keenable 不是第一个做 Agent 搜索的。Exa 也自己维护约 1000 亿篇网页的索引。Keenable 现在一个直接优势是价格:每 1000 次搜索 4 美元,Exa 是 7 美元,便宜约 43%。
信源
动察 Beating 频道 · 动察 Beating 交流群
✍1
Qwen3.8-Flash开源:6B激活,多项Agent评测超Opus4.6
阿里千问发布 Qwen3.8-Flash,并同步开源模型权重 Qwen3.8-Flash-Next。开源版多了一个 Next,代表它率先用了下一代 Qwen4 架构。
这是一个多模态 MoE 模型,主模型有 125B 参数,激活参数只有 6B。另外还增加了 51B N-gram Embedding,相当于一套大型「查表记忆」,用更多存储换更少计算。
官方评测中,SWE-bench Pro 比 Claude Opus4.6 高 9.1 分,JobBench 高近 20 分;AndroidWorld 高 22.5 分,MathVision 高 25.1 分。模型原生支持 262K 上下文,可扩展到 1M。
价格也压得很低。生产版同时上线 Qwen Cloud,默认支持 1M 上下文和工具调用。每百万 Token 输入 1 元,输出 3 元。
官方称,Qwen3.8-Flash 做到接近 Qwen3.7-Plus 的整体能力,但训练成本只有约 1/9。千问试图用更少的计算,把接近旗舰模型的能力做得更便宜。
信源
动察 Beating 频道 · 动察 Beating 交流群
阿里千问发布 Qwen3.8-Flash,并同步开源模型权重 Qwen3.8-Flash-Next。开源版多了一个 Next,代表它率先用了下一代 Qwen4 架构。
这是一个多模态 MoE 模型,主模型有 125B 参数,激活参数只有 6B。另外还增加了 51B N-gram Embedding,相当于一套大型「查表记忆」,用更多存储换更少计算。
官方评测中,SWE-bench Pro 比 Claude Opus4.6 高 9.1 分,JobBench 高近 20 分;AndroidWorld 高 22.5 分,MathVision 高 25.1 分。模型原生支持 262K 上下文,可扩展到 1M。
价格也压得很低。生产版同时上线 Qwen Cloud,默认支持 1M 上下文和工具调用。每百万 Token 输入 1 元,输出 3 元。
官方称,Qwen3.8-Flash 做到接近 Qwen3.7-Plus 的整体能力,但训练成本只有约 1/9。千问试图用更少的计算,把接近旗舰模型的能力做得更便宜。
信源
动察 Beating 频道 · 动察 Beating 交流群
❤3
动察Beating AI News
MiniMax半年收入已超去年全年:企业和开发者调用模型撑起六成 MiniMax 上半年收入 1.17 亿美元,同比增长 283.1%,半年已经超过去年全年。 增长最快的,是企业和开发者调用 MiniMax 模型的生意。这部分收入从 920 万美元涨到 7393 万美元,同比增长 703.1%,已经占总收入的 63.4%。增长主要来自付费用户和企业客户增加、API 调用量上升,以及 Token 套餐普及。 海螺 AI 等 AI 产品收入也翻了一倍,达到 4264 万美元,但占比已经降到 36.6%。…
MiniMax年化收入冲破8亿美元
MiniMax 在中期业绩会上披露,8 月 ARR 已超过 8 亿美元。ARR 可以简单理解为按照当前收入水平折算的一年收入,不代表今年已经赚了 8 亿美元。
增长还在继续加速。MiniMax 第二季度收入比第一季度增长 81.8%;7 月平台 Token 消耗量已经达到 1 月的 20 倍。公司还透露,目前企业和开发者业务贡献了超过 80% 的 ARR。
MiniMax 此前给出的目标是年底达到 10 亿美元 ARR,现在 8 月已经完成八成以上。
MiniMax 在中期业绩会上披露,8 月 ARR 已超过 8 亿美元。ARR 可以简单理解为按照当前收入水平折算的一年收入,不代表今年已经赚了 8 亿美元。
增长还在继续加速。MiniMax 第二季度收入比第一季度增长 81.8%;7 月平台 Token 消耗量已经达到 1 月的 20 倍。公司还透露,目前企业和开发者业务贡献了超过 80% 的 ARR。
MiniMax 此前给出的目标是年底达到 10 亿美元 ARR,现在 8 月已经完成八成以上。
腾讯替千问先做了Qwen3.5 Embedding:2B打过Qwen3-VL 8B
腾讯微信视觉团队开源 WeMM-Embedding,一口气放出 2B、4B、9B 三个多模态 Embedding 模型。它们基于 Qwen3.5,可以把文字、图片、视频、视觉文档统一转成向量,用于搜索、推荐和内容匹配。模型全部采用 Apache 2.0 许可开源。
有意思的是,千问自己目前还没推出 Qwen3.5-Embedding。官方现有的还是 Qwen3-Embedding 和 Qwen3-VL-Embedding,腾讯反而先拿 Qwen3.5 做出了新一代 Embedding。
成绩也挺夸张。WeMM-Embedding 2B 在 MMEB-v2 上拿到 77.9 分,已经略高于 Qwen3-VL-Embedding 8B 的 77.8 分。9B 版进一步做到 80.6 分。两者都能做文字搜视频、图片搜文字等跨模态检索,但 WeMM 换上 Qwen3.5 底座后,用更小模型做到了更高成绩。
这套模型也已经在微信内部实际使用。腾讯称,它已用于微信公众号、视频号、电商推荐和微信搜索,搜索范围还包括朋友圈。
信源
动察 Beating 频道 · 动察 Beating 交流群
腾讯微信视觉团队开源 WeMM-Embedding,一口气放出 2B、4B、9B 三个多模态 Embedding 模型。它们基于 Qwen3.5,可以把文字、图片、视频、视觉文档统一转成向量,用于搜索、推荐和内容匹配。模型全部采用 Apache 2.0 许可开源。
有意思的是,千问自己目前还没推出 Qwen3.5-Embedding。官方现有的还是 Qwen3-Embedding 和 Qwen3-VL-Embedding,腾讯反而先拿 Qwen3.5 做出了新一代 Embedding。
成绩也挺夸张。WeMM-Embedding 2B 在 MMEB-v2 上拿到 77.9 分,已经略高于 Qwen3-VL-Embedding 8B 的 77.8 分。9B 版进一步做到 80.6 分。两者都能做文字搜视频、图片搜文字等跨模态检索,但 WeMM 换上 Qwen3.5 底座后,用更小模型做到了更高成绩。
这套模型也已经在微信内部实际使用。腾讯称,它已用于微信公众号、视频号、电商推荐和微信搜索,搜索范围还包括朋友圈。
信源
动察 Beating 频道 · 动察 Beating 交流群
🤡2
选GPT-5.6却给你5.5-mini,OpenAI承认是Bug
最近 ChatGPT 付费用户发现,明明选了 GPT-5.6 Sol 的 Thinking 或 Pro,回答却突然变快、质量下降。有人抓取网络请求后发现,前端请求的是 GPT-5.6,服务器实际返回的却是 gpt-5-5-mini。
OpenAI ChatGPT 产品负责人 Adam Fry 现已确认,这是一个路由 Bug。约 3% 的 Pro 和 Thinking 请求被错误切到了 GPT-5.5-mini,目前已经修复。
信源
动察 Beating 频道 · 动察 Beating 交流群
最近 ChatGPT 付费用户发现,明明选了 GPT-5.6 Sol 的 Thinking 或 Pro,回答却突然变快、质量下降。有人抓取网络请求后发现,前端请求的是 GPT-5.6,服务器实际返回的却是 gpt-5-5-mini。
OpenAI ChatGPT 产品负责人 Adam Fry 现已确认,这是一个路由 Bug。约 3% 的 Pro 和 Thinking 请求被错误切到了 GPT-5.5-mini,目前已经修复。
信源
动察 Beating 频道 · 动察 Beating 交流群
🤡6💩3
「牛来」模型GLM-5.3-Flash正式开源:320B 参数仅激活 18B,价格只有GLM-5.2十分之一
白天认领 Ox Alpha 后,智谱晚上正式开源 GLM-5.3-Flash,模型权重已经上线 Hugging Face,采用 MIT 许可。它总参数 320B,但每次只激活 18B,原生支持文字、图片和视频,也是 GLM-5 系列首个原生多模态模型。
官方称,GLM-5.3-Flash 整体性能超过 GLM-5.2,编程和 Agent 评测已经接近 Claude Opus 4.8,但价格只有 GLM-5.2 的十分之一。它还换了一套新的基础模型,首次在 GLM 主系列引入稀疏注意力和线性注意力混合架构,并用 30T Token 多模态数据预训练。
此前社区对 Ox Alpha 的 DeepSWE 小样本测试一度跑出 80%,但那只有 10 道题。扩大样本后成绩回落到约 63%,测试者也主动纠正了最初的说法。这个成绩依然属于第一梯队,但没有最初 80% 那么夸张。
权重开源后,开发者可以直接用 vLLM、SGLang、KTransformers 等框架自己部署,不需要再走匿名模型的 API。
信源
动察 Beating 频道 · 动察 Beating 交流群
白天认领 Ox Alpha 后,智谱晚上正式开源 GLM-5.3-Flash,模型权重已经上线 Hugging Face,采用 MIT 许可。它总参数 320B,但每次只激活 18B,原生支持文字、图片和视频,也是 GLM-5 系列首个原生多模态模型。
官方称,GLM-5.3-Flash 整体性能超过 GLM-5.2,编程和 Agent 评测已经接近 Claude Opus 4.8,但价格只有 GLM-5.2 的十分之一。它还换了一套新的基础模型,首次在 GLM 主系列引入稀疏注意力和线性注意力混合架构,并用 30T Token 多模态数据预训练。
此前社区对 Ox Alpha 的 DeepSWE 小样本测试一度跑出 80%,但那只有 10 道题。扩大样本后成绩回落到约 63%,测试者也主动纠正了最初的说法。这个成绩依然属于第一梯队,但没有最初 80% 那么夸张。
权重开源后,开发者可以直接用 vLLM、SGLang、KTransformers 等框架自己部署,不需要再走匿名模型的 API。
信源
动察 Beating 频道 · 动察 Beating 交流群
👍3🥰1
GLM-5.3 Flash再砍一刀:API五折两周,输出每百万Token仅0.25美元
GLM-5.3 Flash 刚刚正式开源,智谱又给 API 限时打五折,活动持续两周。折后每百万 Token 输入 0.075 美元、输出 0.25 美元,缓存输入只要 0.015 美元。
这个价格比智谱自己的 GLM-5.2 还低一个数量级。GLM-5.2 每百万 Token 输入 1.4 美元、输出 4.4 美元。折后 GLM-5.3-Flash 的输入和输出价格都只有前者约十八分之一。
五折优惠除了 Z.ai 官方 API,也会同步到第三方模型聚合平台。两周结束后价格恢复为输入 0.15 美元、输出 0.5 美元、缓存输入 0.03 美元。
信源
动察 Beating 频道 · 动察 Beating 交流群
GLM-5.3 Flash 刚刚正式开源,智谱又给 API 限时打五折,活动持续两周。折后每百万 Token 输入 0.075 美元、输出 0.25 美元,缓存输入只要 0.015 美元。
这个价格比智谱自己的 GLM-5.2 还低一个数量级。GLM-5.2 每百万 Token 输入 1.4 美元、输出 4.4 美元。折后 GLM-5.3-Flash 的输入和输出价格都只有前者约十八分之一。
五折优惠除了 Z.ai 官方 API,也会同步到第三方模型聚合平台。两周结束后价格恢复为输入 0.15 美元、输出 0.5 美元、缓存输入 0.03 美元。
信源
动察 Beating 频道 · 动察 Beating 交流群
GLM-5.3-Flash斩杀DeepSeek-V4-Flash:跑分更高,还便宜近3倍
智谱刚开源的 GLM-5.3 Flash,直接对上了 DeepSeek-V4-Flash。两个模型都主打低价、Coding 和 Agent,但从目前公开的重合评测看,智谱更强。
Terminal-Bench 2.1 上,GLM-5.3 Flash 拿到 84.3 分,DeepSeek-V4-Flash 是 82.7 分;DeepSWE 则是 63.4 对 54.4,领先 9 分。前者还原生支持图片和视频输入。
价格也被压住了。GLM-5.3-Flash 限时五折后,每百万 Token 普通输入 0.075 美元、输出 0.25 美元。DeepSeek V4 Flash 即使在最便宜的低谷时段,也要 0.22 和 0.66 美元。GLM 输入便宜近 3 倍,输出便宜 2.6 倍。
两周优惠结束后,GLM 恢复到 0.15 美元输入、0.5 美元输出,依然低于 DeepSeek 的低谷价。DeepSeek 目前只在缓存命中价格上更便宜。
动察 Beating 频道 · 动察 Beating 交流群
智谱刚开源的 GLM-5.3 Flash,直接对上了 DeepSeek-V4-Flash。两个模型都主打低价、Coding 和 Agent,但从目前公开的重合评测看,智谱更强。
Terminal-Bench 2.1 上,GLM-5.3 Flash 拿到 84.3 分,DeepSeek-V4-Flash 是 82.7 分;DeepSWE 则是 63.4 对 54.4,领先 9 分。前者还原生支持图片和视频输入。
价格也被压住了。GLM-5.3-Flash 限时五折后,每百万 Token 普通输入 0.075 美元、输出 0.25 美元。DeepSeek V4 Flash 即使在最便宜的低谷时段,也要 0.22 和 0.66 美元。GLM 输入便宜近 3 倍,输出便宜 2.6 倍。
两周优惠结束后,GLM 恢复到 0.15 美元输入、0.5 美元输出,依然低于 DeepSeek 的低谷价。DeepSeek 目前只在缓存命中价格上更便宜。
动察 Beating 频道 · 动察 Beating 交流群
🔥7
英伟达护城河又挨一刀:「牛来」模型GLM-5.3 Flash爆量23万亿Token,全部跑在国产芯片上
GLM-5.3 Flash 发布后,智谱确认了一个此前没公开的细节:Ox Alpha 匿名测试期间的流量,全部由中国国产 AI 芯片提供推理算力。
Ox Alpha 在 OpenRouter 上线 6 个完整自然日就处理了 23.2 万亿 Token,是同期 DeepSeek-V4-Flash 的 2 倍多。OpenCode 此前甚至称,后台有能力提供每天 100 万亿 Token 的免费额度。
智谱称,他们在相同中国国产硬件上把端到端推理性能优化到了最初的 3 倍,现在硬件效率和单 Token 成本已经能做到接近主流英伟达 GPU。
SemiAnalysis 特意把这一点挑了出来。此前外界看到每天 100 万亿 Token 的供给能力,还在猜这种规模是不是只有顶级实验室和英伟达 GPU 扛得住。结果这次从头到尾用的都是中国国产芯片。
信源
动察 Beating 频道 · 动察 Beating 交流群
GLM-5.3 Flash 发布后,智谱确认了一个此前没公开的细节:Ox Alpha 匿名测试期间的流量,全部由中国国产 AI 芯片提供推理算力。
Ox Alpha 在 OpenRouter 上线 6 个完整自然日就处理了 23.2 万亿 Token,是同期 DeepSeek-V4-Flash 的 2 倍多。OpenCode 此前甚至称,后台有能力提供每天 100 万亿 Token 的免费额度。
智谱称,他们在相同中国国产硬件上把端到端推理性能优化到了最初的 3 倍,现在硬件效率和单 Token 成本已经能做到接近主流英伟达 GPU。
SemiAnalysis 特意把这一点挑了出来。此前外界看到每天 100 万亿 Token 的供给能力,还在猜这种规模是不是只有顶级实验室和英伟达 GPU 扛得住。结果这次从头到尾用的都是中国国产芯片。
信源
动察 Beating 频道 · 动察 Beating 交流群
👍7💩1
废铜「到货秒没」!AI与电网需求撑起铜价狂飙,供应缺口成核心矛盾
传统铜消费淡季的 7 月至 8 月,浙江台州废铜市场却异常火热,部分优质废铜价格已突破 9 万元/吨,甚至达到 10 万元/吨,市场需求较此前增加两三倍,部分货物尚未拆解便已被客户提前预订。
再生铜企业同样处于高负荷状态。浙江巨东股份今年计划将再生铜产能提升至 10 万吨,目前基本满负荷生产,订单已排至约一个月。数据显示,今年上半年上海有色金属交易中心铜现货价格指数上涨 31%;2 月至 8 月,COMEX 和 LME 铜期货分别上涨 52% 和 58%。
业内认为,本轮铜价上涨的核心仍是供需错配:海外铜矿产出收缩、原料成本上升导致供应增速放缓,而 AI 算力中心、电网及新能源基建持续释放新增铜需求。9 月至 10 月进入传统消费旺季后,供需矛盾能否进一步强化仍受关注。
不过,分析人士提醒,当前铜价快速上涨已对下游加工企业形成较大压力,需求传导并不顺畅,本轮上涨动能或已进入中后段。中长期来看,全球铜矿复产进度与 AI 需求兑现速度,将成为决定铜价走势的两条主线。
信源
动察 Beating 频道 · 动察 Beating 交流群
传统铜消费淡季的 7 月至 8 月,浙江台州废铜市场却异常火热,部分优质废铜价格已突破 9 万元/吨,甚至达到 10 万元/吨,市场需求较此前增加两三倍,部分货物尚未拆解便已被客户提前预订。
再生铜企业同样处于高负荷状态。浙江巨东股份今年计划将再生铜产能提升至 10 万吨,目前基本满负荷生产,订单已排至约一个月。数据显示,今年上半年上海有色金属交易中心铜现货价格指数上涨 31%;2 月至 8 月,COMEX 和 LME 铜期货分别上涨 52% 和 58%。
业内认为,本轮铜价上涨的核心仍是供需错配:海外铜矿产出收缩、原料成本上升导致供应增速放缓,而 AI 算力中心、电网及新能源基建持续释放新增铜需求。9 月至 10 月进入传统消费旺季后,供需矛盾能否进一步强化仍受关注。
不过,分析人士提醒,当前铜价快速上涨已对下游加工企业形成较大压力,需求传导并不顺畅,本轮上涨动能或已进入中后段。中长期来看,全球铜矿复产进度与 AI 需求兑现速度,将成为决定铜价走势的两条主线。
信源
动察 Beating 频道 · 动察 Beating 交流群
高通发布IMSDK 2.0:打通生成式AI与多媒体,推动边缘AI应用开发提速
高通发布 Qualcomm Intelligent Multimedia SDK(IMSDK)2.0,推出面向 Qualcomm Dragonwing 及 Linux 边缘平台的统一 AI 与多媒体开发框架,旨在简化摄像头、音视频、传感器、AI 推理及云端连接等功能的集成,加速智能相机、机器人、无人机及工业 AI 等产品落地。
IMSDK 2.0 新增 Python 和 C++ Pipeline API 及应用构建器、生成式 AI 推理、容器化微服务、AI 编程代理技能以及「文档即代码」等功能。其中,开发者可通过 QAIRT、ONNX Runtime 和 TFLite 等多种推理运行时,在不重构整体多媒体管线的情况下切换 AI 模型。
高通表示,IMSDK 2.0 基于 GStreamer 架构,并结合硬件加速插件、零拷贝数据传输和多流、多模型管线能力,可支持视觉 AI、LLM/VLM、音频 AI 及文生图等应用。其容器化微服务还覆盖推理、分析和平台服务,并支持 Kafka、MQTT、AWS IoT 及 Azure IoT 等企业级连接。
此外,IMSDK 2.0 引入 AI 编程代理技能,可通过自然语言辅助开发者完成管线配置、模型接入、编译、调试及部署。高通称,该 SDK 已被三星、亚马逊和 Bose 等企业用于相关产品开发。
信源
动察 Beating 频道 · 动察 Beating 交流群
高通发布 Qualcomm Intelligent Multimedia SDK(IMSDK)2.0,推出面向 Qualcomm Dragonwing 及 Linux 边缘平台的统一 AI 与多媒体开发框架,旨在简化摄像头、音视频、传感器、AI 推理及云端连接等功能的集成,加速智能相机、机器人、无人机及工业 AI 等产品落地。
IMSDK 2.0 新增 Python 和 C++ Pipeline API 及应用构建器、生成式 AI 推理、容器化微服务、AI 编程代理技能以及「文档即代码」等功能。其中,开发者可通过 QAIRT、ONNX Runtime 和 TFLite 等多种推理运行时,在不重构整体多媒体管线的情况下切换 AI 模型。
高通表示,IMSDK 2.0 基于 GStreamer 架构,并结合硬件加速插件、零拷贝数据传输和多流、多模型管线能力,可支持视觉 AI、LLM/VLM、音频 AI 及文生图等应用。其容器化微服务还覆盖推理、分析和平台服务,并支持 Kafka、MQTT、AWS IoT 及 Azure IoT 等企业级连接。
此外,IMSDK 2.0 引入 AI 编程代理技能,可通过自然语言辅助开发者完成管线配置、模型接入、编译、调试及部署。高通称,该 SDK 已被三星、亚马逊和 Bose 等企业用于相关产品开发。
信源
动察 Beating 频道 · 动察 Beating 交流群
英伟达:Qwen3.8-Flash-Next可在GB300NVL72上实现超1.6万Token/秒单卡吞吐
英伟达发布文章称,阿里巴巴最新预览模型 Qwen3.8-Flash-Next 已获得英伟达 GB300 NVL72 平台支持。该模型总参数规模达 1760 亿,每 Token 激活约 60 亿参数,原生支持 26.2 万 Token 上下文,并可通过 YaRN 扩展至 100 万 Token,主要面向智能编程、文档处理及工具调用等长上下文 Agent 应用。
英伟达表示,Qwen3.8-Flash-Next 采用 Gated DeltaNet(GDN)与 Qwen Sparse Attention(QSA)混合架构,以降低长上下文场景下的计算和 KV 缓存开销。测试显示,在 GB300 NVL72 上,该模型单 GPU 吞吐量超过 1.6 万 Token/秒,单用户吞吐超过 200 Token/秒;同时支持 SGLang、vLLM 及 TensorRT-LLM 等推理框架。
动察 Beating 频道 · 动察 Beating 交流群
英伟达发布文章称,阿里巴巴最新预览模型 Qwen3.8-Flash-Next 已获得英伟达 GB300 NVL72 平台支持。该模型总参数规模达 1760 亿,每 Token 激活约 60 亿参数,原生支持 26.2 万 Token 上下文,并可通过 YaRN 扩展至 100 万 Token,主要面向智能编程、文档处理及工具调用等长上下文 Agent 应用。
英伟达表示,Qwen3.8-Flash-Next 采用 Gated DeltaNet(GDN)与 Qwen Sparse Attention(QSA)混合架构,以降低长上下文场景下的计算和 KV 缓存开销。测试显示,在 GB300 NVL72 上,该模型单 GPU 吞吐量超过 1.6 万 Token/秒,单用户吞吐超过 200 Token/秒;同时支持 SGLang、vLLM 及 TensorRT-LLM 等推理框架。
动察 Beating 频道 · 动察 Beating 交流群
Anthropic与Nscale达成450亿美元AI算力协议
Anthropic 已同意未来 6 年向 Nscale 支付 450 亿美元,租用其西弗吉尼亚州 Monarch 数据中心约 460 兆瓦的 AI 算力。
据知情人士透露,Nscale 将采用英伟达 (NVDA.O)Vera Rubin 芯片,预计明年底开始上线。整个 Monarch 园区规划容量约 1.35 吉瓦,总投资约 710 亿美元,其中约 470 亿美元用于 AI 芯片,其余建筑将于 2028 年开始提供算力。
该项目原计划由微软租用,但微软今年夏季退出,Anthropic 随后成为租户。Anthropic 近月还分别与 Fluidstack、Volta Infra 和 SpaceX 达成 500 亿、100 亿和 450 亿美元算力协议,以在 IPO 前进一步锁定计算资源。
动察 Beating 频道 · 动察 Beating 交流群
Anthropic 已同意未来 6 年向 Nscale 支付 450 亿美元,租用其西弗吉尼亚州 Monarch 数据中心约 460 兆瓦的 AI 算力。
据知情人士透露,Nscale 将采用英伟达 (NVDA.O)Vera Rubin 芯片,预计明年底开始上线。整个 Monarch 园区规划容量约 1.35 吉瓦,总投资约 710 亿美元,其中约 470 亿美元用于 AI 芯片,其余建筑将于 2028 年开始提供算力。
该项目原计划由微软租用,但微软今年夏季退出,Anthropic 随后成为租户。Anthropic 近月还分别与 Fluidstack、Volta Infra 和 SpaceX 达成 500 亿、100 亿和 450 亿美元算力协议,以在 IPO 前进一步锁定计算资源。
动察 Beating 频道 · 动察 Beating 交流群