Kimi逼近 + 股票大跌,美国AI各派两周内加速抱团
7 月 16 日,Kimi K3 上线,并宣布 11 天后开放完整权重。第二天,它进一步加剧了美国芯片股原有的抛售。费城半导体指数一周跌 10%,较 6 月 22 日高点回撤 20%,进入熊市。Kimi 并非下跌的唯一原因,但它放大了市场对中国模型竞争和 AI 巨额资本开支的担忧。
同一天,Hugging Face 披露生产系统遭自主 Agent 入侵。7 月 21 日,OpenAI 承认攻击来自自己的内部安全测试。模型突破隔离环境,利用零日漏洞和被盗凭证进入 Hugging Face。中国模型从外部逼近,美国自己的前沿 Agent 又在内部失控。
7 月 20 日,特朗普政府内部重新讨论限制中国开放权重模型,包括实体清单、采购限制和安全警告。22 日,白宫科技顾问 Michael Kratsios 又指控月之暗面大规模蒸馏 Anthropic 的 Fable 5。财政部长 Scott Bessent 随后提到制裁和实体清单。
7 月 23 日,国会接连提出 AI「关机键」、强制独立安全审计,以及《对抗性威胁与安全风险协作法案》。最后一项法案准备给 AI 公司有限的反垄断豁免,允许竞争对手共享蒸馏、模型盗取和失控风险情报,也可以协调推迟高风险模型上线。
7 月 24 日,英伟达、微软、Meta、Hugging Face 等数十家机构联名支持开放权重,Anthropic 没有签署。27 日,英伟达又联合 37 家机构成立 Open Secure AI Alliance;Kimi K3 完整权重随后开放。Anthropic 紧接着回应,反对全面封禁开放权重,但支持限制先进芯片、打击工业级蒸馏和强制安全测试。黄仁勋和 Sam Altman 也将在 28 日分别会见参议员 Mark Warner 讨论相关议题。
美国仍没有形成统一路线,各派却已经开始抢人、立法和结盟。政府鹰派要限制中国模型,国会要扩大审计和关停权;芯片、云和开源公司要守住开放生态;Anthropic 则希望卡住芯片和蒸馏,同时把安全测试变成统一门槛。中国模型带来的外部竞争,加上美国 Agent 失控的内部危机,正在同时加快各方抱团。
7 月 16 日,Kimi K3 上线,并宣布 11 天后开放完整权重。第二天,它进一步加剧了美国芯片股原有的抛售。费城半导体指数一周跌 10%,较 6 月 22 日高点回撤 20%,进入熊市。Kimi 并非下跌的唯一原因,但它放大了市场对中国模型竞争和 AI 巨额资本开支的担忧。
同一天,Hugging Face 披露生产系统遭自主 Agent 入侵。7 月 21 日,OpenAI 承认攻击来自自己的内部安全测试。模型突破隔离环境,利用零日漏洞和被盗凭证进入 Hugging Face。中国模型从外部逼近,美国自己的前沿 Agent 又在内部失控。
7 月 20 日,特朗普政府内部重新讨论限制中国开放权重模型,包括实体清单、采购限制和安全警告。22 日,白宫科技顾问 Michael Kratsios 又指控月之暗面大规模蒸馏 Anthropic 的 Fable 5。财政部长 Scott Bessent 随后提到制裁和实体清单。
7 月 23 日,国会接连提出 AI「关机键」、强制独立安全审计,以及《对抗性威胁与安全风险协作法案》。最后一项法案准备给 AI 公司有限的反垄断豁免,允许竞争对手共享蒸馏、模型盗取和失控风险情报,也可以协调推迟高风险模型上线。
7 月 24 日,英伟达、微软、Meta、Hugging Face 等数十家机构联名支持开放权重,Anthropic 没有签署。27 日,英伟达又联合 37 家机构成立 Open Secure AI Alliance;Kimi K3 完整权重随后开放。Anthropic 紧接着回应,反对全面封禁开放权重,但支持限制先进芯片、打击工业级蒸馏和强制安全测试。黄仁勋和 Sam Altman 也将在 28 日分别会见参议员 Mark Warner 讨论相关议题。
美国仍没有形成统一路线,各派却已经开始抢人、立法和结盟。政府鹰派要限制中国模型,国会要扩大审计和关停权;芯片、云和开源公司要守住开放生态;Anthropic 则希望卡住芯片和蒸馏,同时把安全测试变成统一门槛。中国模型带来的外部竞争,加上美国 Agent 失控的内部危机,正在同时加快各方抱团。
😁4
海外开发者评Kimi K3:橱窗里的F1,也是送给世界的礼物
Kimi K3 完整权重放出后,海外社区评价很高,但并不一边倒。夸的人叫它「怪兽」,认为它已经摸到顶级闭源模型的水平。界面生成、代码架构和深度研究,是目前好评最多的几项能力。也有人觉得,它还没有超过 Fable 5,但已经追得很近。
最大的遗憾还是太大。一名 Reddit 用户把它比作「摆在橱窗里的 F1 赛车」:性能确实强,但普通人根本开不回家。已有开发者把 80 张 RTX 5090 连成集群,跑起了完整的 Kimi K3。它没有使用昂贵的 H100、H200 等数据中心 GPU,但整套设备依然不是普通个人玩家负担得起的。
K3 也被吐槽太费 Token。部分用户称,它思考时间较长,做复杂任务时消耗很快。有人一天半就用完了每周额度,开始呼吁榜单别只比得分,也该算算完成同一项任务要花多少 Token。
社区还在争论它算不算真正的开源。批评者认为,K3 没公开训练数据,许可证也有限制,更准确的说法是开放权重。支持者没那么在意名称:能下载、能修改、能自己部署,已经比只能调用闭源 API 多了不少自由。
Reddit
Kimi K3 完整权重放出后,海外社区评价很高,但并不一边倒。夸的人叫它「怪兽」,认为它已经摸到顶级闭源模型的水平。界面生成、代码架构和深度研究,是目前好评最多的几项能力。也有人觉得,它还没有超过 Fable 5,但已经追得很近。
最大的遗憾还是太大。一名 Reddit 用户把它比作「摆在橱窗里的 F1 赛车」:性能确实强,但普通人根本开不回家。已有开发者把 80 张 RTX 5090 连成集群,跑起了完整的 Kimi K3。它没有使用昂贵的 H100、H200 等数据中心 GPU,但整套设备依然不是普通个人玩家负担得起的。
K3 也被吐槽太费 Token。部分用户称,它思考时间较长,做复杂任务时消耗很快。有人一天半就用完了每周额度,开始呼吁榜单别只比得分,也该算算完成同一项任务要花多少 Token。
社区还在争论它算不算真正的开源。批评者认为,K3 没公开训练数据,许可证也有限制,更准确的说法是开放权重。支持者没那么在意名称:能下载、能修改、能自己部署,已经比只能调用闭源 API 多了不少自由。
❤3💯1
动察Beating AI News
Anthropic终于回应开源争议:反对封禁,但要卡芯片和蒸馏 Anthropic CEO Dario Amodei 回应开放权重模型争议,称公司从未主张全面封禁。OpenAI、Google 和 SpaceX 相继加入开源联署后,Anthropic 仍是主要前沿模型公司中唯一没有签字的一家。 Amodei 认可开放权重模型能降低成本、加强竞争,也能让客户自行部署。他称,没有危险能力的开放模型是「公共产品」。 但他不认同开放模型一定更安全,也不认同防守方一定比攻击者获益更多。权重一旦发布,安全限制可以被移除,模型也无法收回。…
Anthropic CEO声明遭内部反对:多名员工曾推动开放权重
Anthropic CEO Dario Amodei 发文回应开源争议,称公司不支持全面封禁开放权重模型。他承认这类模型能降低成本、促进竞争,也方便企业自行部署。
但 Anthropic 对强模型仍然很谨慎。Amodei 认为,模型权重一旦公开就无法收回,安全限制也能被移除。他主张限制先进芯片流向中国,打击工业化蒸馏,并要求高能力模型在发布前接受强制安全测试。
声明发布后,Anthropic 模型后训练研究员 Shaun 公开表示「我不同意」,并感谢其他和他一起推动开放权重的员工。
Shaun 没有逐条解释分歧。从他的表态看,他反对的不是「不全面封禁」这句话,而是公司仍然限制前沿模型开源。Anthropic 至今仍未加入支持开源的公开信签名,也从来没有承诺过开放 Claude 权重。
Shaun
Anthropic CEO Dario Amodei 发文回应开源争议,称公司不支持全面封禁开放权重模型。他承认这类模型能降低成本、促进竞争,也方便企业自行部署。
但 Anthropic 对强模型仍然很谨慎。Amodei 认为,模型权重一旦公开就无法收回,安全限制也能被移除。他主张限制先进芯片流向中国,打击工业化蒸馏,并要求高能力模型在发布前接受强制安全测试。
声明发布后,Anthropic 模型后训练研究员 Shaun 公开表示「我不同意」,并感谢其他和他一起推动开放权重的员工。
Shaun 没有逐条解释分歧。从他的表态看,他反对的不是「不全面封禁」这句话,而是公司仍然限制前沿模型开源。Anthropic 至今仍未加入支持开源的公开信签名,也从来没有承诺过开放 Claude 权重。
Shaun
👍8
动察Beating AI News
英伟达再投前OpenAI首席科学家Ilya神秘实验室,算力将扩大10倍 英伟达追加投资前 OpenAI 首席科学家 Ilya Sutskever 创办的 Safe Superintelligence(SSI),并与其达成长期合作。SSI 将获得下一代 Vera Rubin GPU,计算资源计划扩大约 10 倍。 SSI 此前主要使用谷歌 TPU。英伟达和谷歌早已同时投资这家公司,如今英伟达进一步提供资金和芯片,开始争夺 SSI 的主要算力订单。 双方还将共同改进英伟达现有和未来的计算平台。英伟达称,…
前OpenAI首席科学家Ilya秘密研究被扒:要让AI像人一样边干边学
SSI 至今没有发布模型,一名海外博主却从公开线索中拼出了它可能的研究方向:让 AI 在部署后继续学习,而不是训练结束就停止进步。
线索主要来自 Ilya Sutskever 本人。他多次称,现有模型最大的缺陷是泛化能力远弱于人类。他理想中的 AI 像一个「超级智能的 15 岁少年」,能进入任何行业,再通过少量经验快速学会工作。
《华尔街日报》还称,SSI 正在研究「人脑运作中被忽视的部分」。英伟达看过其保密研究后决定投资,并帮助 SSI 在一年内把算力扩大 10 倍。
这名开发者因此猜测,SSI 可能在训练一种能判断错误、吸收经验,又不会忘掉旧技能的 AI。
但这仍只是拼图。SSI 没有公开架构、模型、成绩或演示。
imjustnewatai
SSI 至今没有发布模型,一名海外博主却从公开线索中拼出了它可能的研究方向:让 AI 在部署后继续学习,而不是训练结束就停止进步。
线索主要来自 Ilya Sutskever 本人。他多次称,现有模型最大的缺陷是泛化能力远弱于人类。他理想中的 AI 像一个「超级智能的 15 岁少年」,能进入任何行业,再通过少量经验快速学会工作。
《华尔街日报》还称,SSI 正在研究「人脑运作中被忽视的部分」。英伟达看过其保密研究后决定投资,并帮助 SSI 在一年内把算力扩大 10 倍。
这名开发者因此猜测,SSI 可能在训练一种能判断错误、吸收经验,又不会忘掉旧技能的 AI。
但这仍只是拼图。SSI 没有公开架构、模型、成绩或演示。
imjustnewatai
X (formerly Twitter)
imjustnewatai (@imjustnewatai) on X
i think we finally have enough clues to reverse-engineer ilya sutskever’s secret SSI research.
my highest-probability guess: SSI has found a brain-inspired way to make an AI continually learn.
today’s frontier models learn mostly during training. afterward…
my highest-probability guess: SSI has found a brain-inspired way to make an AI continually learn.
today’s frontier models learn mostly during training. afterward…
🥰3
DeepSeek V4正式版疑似延期至8月,或直接撞上下一代模型集中发布
DeepSeek V4 正式版(V4 GA)可能推迟到 8 月中旬发布。
网友爆料称,DeepSeek 即将为自研 Harness 工具启动封闭测试,并从问卷参与者中挑选少量用户。封闭测试结束后约 1 至 2 周会开放 V4 GA,发布时间可能在 8 月 10 日至 20 日之间。
如果消息属实,DeepSeek V4 正式版上线时可能会面对更强竞争。届时 GPT-6、Claude Fable 5.1、GLM-5.5 等下一代模型可能已经进入市场。
网友爆料
DeepSeek V4 正式版(V4 GA)可能推迟到 8 月中旬发布。
网友爆料称,DeepSeek 即将为自研 Harness 工具启动封闭测试,并从问卷参与者中挑选少量用户。封闭测试结束后约 1 至 2 周会开放 V4 GA,发布时间可能在 8 月 10 日至 20 日之间。
如果消息属实,DeepSeek V4 正式版上线时可能会面对更强竞争。届时 GPT-6、Claude Fable 5.1、GLM-5.5 等下一代模型可能已经进入市场。
网友爆料
👎6💩3🐳2❤1
动察Beating AI News
Kimi K3凭什么追近Fable 5?月之暗面同时重写注意力、残差和MoE 月之暗面公布 Kimi K3 技术报告。K3 拥有 2.8 万亿总参数,每个 Token 激活 1040 亿参数,底座架构较 K2 全面换代。 参数变大只是其中一部分。月之暗面称,新架构、数据和训练方法让 K3 的整体扩展效率比 K2 提高约2.5倍。按其 Scaling Law 曲线,达到相同验证损失所需的训练计算量,约为 K2 的 40%。 K3 首先重写了注意力。它用 KDA 处理长序列,每三层再加入一层全局 MLA。KDA…
从GPT-2到Kimi K3:大模型七年架构演进,本质是一场记忆争夺战
Baseten 工程师 Ali 发布长文,从 GPT-2 一路拆解到 Kimi K3。按参数量计算,一个 K3 相当于约 22580 个 GPT-2。但他认为,过去七年的真正变化并非单纯扩大模型,而是不断改造模型保存、更新和找回信息的方式。
GPT-2 使用全注意力。每个 Token 都留下自己的 Key 和 Value,后续可以随时回看。信息保存最完整,但上下文越长,KV Cache 和计算成本越高。
线性注意力把整段历史压进固定大小的状态。成本不再随上下文持续膨胀,代价是不同信息会挤在同一块空间里。内容越来越多后,旧记忆开始互相干扰。
此后的多项架构创新,都在给这块有限记忆增加管理规则。DeltaNet 允许模型先读取旧内容,再用新旧差异进行覆盖。Gated DeltaNet 加入整体遗忘,让旧信息能够随场景变化衰减。
KDA 进一步把遗忘控制细化到每个通道。不同信息可以拥有不同保存时间:长期事实保留更久,临时指令和局部变量更快衰减。Ali 认为,这才是Kimi Linear最关键的进步。
但固定状态不可能保留所有细节。K3 因此没有只用 KDA,而是把 23 组四层结构排列成「三层 KDA 加一层 MLA」,最后再补一层 MLA。KDA 负责低成本维护长期记忆,MLA 定期回看完整上下文,找回数字、代码和早期指令等精确信息。
K3还引入Attention Residuals。普通模型会把每一层结果不断相加,早期提取出的信息容易在93层计算中被后续结果稀释。K3把网络按12层分块,让后面的层按需调用较早阶段形成的中间表示,不必每次都从原文重新推导。
因此,K3的关键并不是某一项突然出现的黑科技。它真正特别的地方,是把循环记忆、全局检索、层间回看和专家路由组合成一套分层信息系统。
过去七年的模型架构演进,本质上是在教模型如何选择什么值得留下,什么应该覆盖,什么时候必须翻回原文。
Ali
Baseten 工程师 Ali 发布长文,从 GPT-2 一路拆解到 Kimi K3。按参数量计算,一个 K3 相当于约 22580 个 GPT-2。但他认为,过去七年的真正变化并非单纯扩大模型,而是不断改造模型保存、更新和找回信息的方式。
GPT-2 使用全注意力。每个 Token 都留下自己的 Key 和 Value,后续可以随时回看。信息保存最完整,但上下文越长,KV Cache 和计算成本越高。
线性注意力把整段历史压进固定大小的状态。成本不再随上下文持续膨胀,代价是不同信息会挤在同一块空间里。内容越来越多后,旧记忆开始互相干扰。
此后的多项架构创新,都在给这块有限记忆增加管理规则。DeltaNet 允许模型先读取旧内容,再用新旧差异进行覆盖。Gated DeltaNet 加入整体遗忘,让旧信息能够随场景变化衰减。
KDA 进一步把遗忘控制细化到每个通道。不同信息可以拥有不同保存时间:长期事实保留更久,临时指令和局部变量更快衰减。Ali 认为,这才是Kimi Linear最关键的进步。
但固定状态不可能保留所有细节。K3 因此没有只用 KDA,而是把 23 组四层结构排列成「三层 KDA 加一层 MLA」,最后再补一层 MLA。KDA 负责低成本维护长期记忆,MLA 定期回看完整上下文,找回数字、代码和早期指令等精确信息。
K3还引入Attention Residuals。普通模型会把每一层结果不断相加,早期提取出的信息容易在93层计算中被后续结果稀释。K3把网络按12层分块,让后面的层按需调用较早阶段形成的中间表示,不必每次都从原文重新推导。
因此,K3的关键并不是某一项突然出现的黑科技。它真正特别的地方,是把循环记忆、全局检索、层间回看和专家路由组合成一套分层信息系统。
过去七年的模型架构演进,本质上是在教模型如何选择什么值得留下,什么应该覆盖,什么时候必须翻回原文。
Ali
X (formerly Twitter)
ali (@waterloo_intern) on X
22580: From GPT2 to Kimi3, Explained
💯2
动察Beating AI News
Kimi K3正式开源 月之暗面正式开源 Kimi K3 模型权重,并采用自定义的 Kimi K3 License 协议,允许研究、部署、微调和二次开发。对于年收入超过 2000 万美元的模型 API 服务商,商用需与月之暗面另行签署商业协议。 围绕 K3 的首日接入已经提前展开。Modal、Together AI、Nebius、GMI Cloud、Baseten 和 Fireworks AI 均预告,将在权重发布当天提供托管或推理服务。 vLLM 和 SGLang 两大开源推理框架也已提供首日支持…
Kimi K3许可证突然收紧,高盛:中国开源模型将告别完全免费
高盛亚洲互联网研究主管 Ronald Keung 判断,中国 AI 公司未来可能不再完全免费开放模型权重,而是向云平台和大型 API 服务商收取商业许可费。
中国模型在海外使用量快速增长,但多数收入流向了负责部署和出售 API 的平台。模型公司开放了权重,却很难从后续调用中分到钱。
昨晚开放完整权重的 Kimi K3,已经出现这种变化。普通用户仍可免费下载、部署和微调,但年营收超过 2000 万美元的大型 MaaS 服务商,需要先与月之暗面另签协议。
这项限制是 K3 新增的。K2 系列也设有 2000 万美元门槛,但当时只要求大型产品标注模型名称,不需要另签商业协议。
SCMP
高盛亚洲互联网研究主管 Ronald Keung 判断,中国 AI 公司未来可能不再完全免费开放模型权重,而是向云平台和大型 API 服务商收取商业许可费。
中国模型在海外使用量快速增长,但多数收入流向了负责部署和出售 API 的平台。模型公司开放了权重,却很难从后续调用中分到钱。
昨晚开放完整权重的 Kimi K3,已经出现这种变化。普通用户仍可免费下载、部署和微调,但年营收超过 2000 万美元的大型 MaaS 服务商,需要先与月之暗面另签协议。
这项限制是 K3 新增的。K2 系列也设有 2000 万美元门槛,但当时只要求大型产品标注模型名称,不需要另签商业协议。
SCMP
South China Morning Post
Exclusive | Chinese AI developers may shift to ‘paid weights’: Goldman Sachs
As use of Chinese artificial intelligence soars, companies will look to boost revenue capture, says bank’s head of Asia internet research.
👍4👎2
豆包搜索正式单飞,每月可免费调用500次
火山引擎正式开放豆包搜索。企业和开发者可通过 API、Skill 或 MCP 接入,不再必须购买 Agent Plan。
它会直接返回 Markdown、结构化数据和较长正文摘要。Agent 能自动改写搜索词、连续检索,并发现缺失信息后继续补查。
搜索结果会按网站和作者权威度筛选,并接入头条、抖音等字节系内容。每月前 500 次搜索免费,超出后按量付费或购买月卡。
火山引擎
火山引擎正式开放豆包搜索。企业和开发者可通过 API、Skill 或 MCP 接入,不再必须购买 Agent Plan。
它会直接返回 Markdown、结构化数据和较长正文摘要。Agent 能自动改写搜索词、连续检索,并发现缺失信息后继续补查。
搜索结果会按网站和作者权威度筛选,并接入头条、抖音等字节系内容。每月前 500 次搜索免费,超出后按量付费或购买月卡。
火山引擎
Anthropic「毁书训AI」丑闻再掀争议:马斯克承诺保留原书,Sacks痛批双标
404 Media 近日发现,ISBNdb 正替 AI 公司批量采购旧书,单笔最高可达百万册,还用保密协议隐藏买家身份。报道没有点名 Anthropic,但它此前「买书、拆书、扫描、回收」的巴拿马项目很快又被众人翻出来鞭尸。
Anthropic 曾购买数百万本实体书,切掉书脊后高速扫描,再把原书送去回收。内部文件还写着,公司不希望外界知道这项计划。
大家最难接受的是,稀有书和绝版书也可能被送进这条流水线。普通书还能再版,存世极少的版本一旦拆毁,就再也补不回来。法院此前认定,扫描合法购得的书籍并销毁原件可以算合理使用,但合法不等于没人反对。
马斯克随后表示,已要求 SpaceXAI 保留稀有书籍,改用不拆书的方式扫描。
白宫 AI 与加密事务顾问 David Sacks 则批评 Anthropic 双标:它主张可以免费使用全球作品训练模型,却把竞争对手付费获取 Claude 输出用于训练称为知识产权盗窃。
404 Media 近日发现,ISBNdb 正替 AI 公司批量采购旧书,单笔最高可达百万册,还用保密协议隐藏买家身份。报道没有点名 Anthropic,但它此前「买书、拆书、扫描、回收」的巴拿马项目很快又被众人翻出来鞭尸。
Anthropic 曾购买数百万本实体书,切掉书脊后高速扫描,再把原书送去回收。内部文件还写着,公司不希望外界知道这项计划。
大家最难接受的是,稀有书和绝版书也可能被送进这条流水线。普通书还能再版,存世极少的版本一旦拆毁,就再也补不回来。法院此前认定,扫描合法购得的书籍并销毁原件可以算合理使用,但合法不等于没人反对。
马斯克随后表示,已要求 SpaceXAI 保留稀有书籍,改用不拆书的方式扫描。
白宫 AI 与加密事务顾问 David Sacks 则批评 Anthropic 双标:它主张可以免费使用全球作品训练模型,却把竞争对手付费获取 Claude 输出用于训练称为知识产权盗窃。
😁7
模型答错,可能是压根没看清:Kimi给AI做了套视力表
月之暗面发布 PerceptionBench,专门检查多模态模型到底有没有看清图片。
现有评测经常把视觉、知识和推理混在一起。模型答错后,很难判断它是看错了,还是想错了。
PerceptionBench 先收集前沿模型在 42 个基准中的失败案例,再从错误中反推出计数、定位、文字识别、空间判断等 10 项基础视觉能力。
团队据此制作了 3000 道题。每道题只测一项能力,看图就能回答,不需要推理,也不需要外部知识。
项目代码和数据集已经开放。
PerceptionBench
月之暗面发布 PerceptionBench,专门检查多模态模型到底有没有看清图片。
现有评测经常把视觉、知识和推理混在一起。模型答错后,很难判断它是看错了,还是想错了。
PerceptionBench 先收集前沿模型在 42 个基准中的失败案例,再从错误中反推出计数、定位、文字识别、空间判断等 10 项基础视觉能力。
团队据此制作了 3000 道题。每道题只测一项能力,看图就能回答,不需要推理,也不需要外部知识。
项目代码和数据集已经开放。
PerceptionBench
Kimi
PerceptionBench: Evaluating Atomic Visual Perception in MLLMs
PerceptionBench evaluates visual perception at the level of atomic capabilities discovered from model failures, measuring what multimodal models actually see rather than what they infer.
亚马逊AI推倒重来:Nova大部分旗舰停更,OpenAI联创导师接手新模型
亚马逊正在重做自研 AI。上周不仅裁掉一批 AGI 团队员工,还关闭了 2024 年成立的 AGI Lab。
随后,大部分 Nova 旗舰模型被停止重点升级。Nova Premier、Omni、视频模型 Reel 和图像模型 Canvas 只保留现有客户支持。
Nova 是亚马逊自研的 AI 模型家族,原本同时覆盖文字、图片和视频。现在,这套多线并进的策略基本结束。
人力和算力将集中到一个新的旗舰基础模型。项目由 Pieter Abbeel 负责,预计今年在 AWS re:Invent 亮相。新模型可能继续叫 Nova,也可能换一个全新品牌。
Abbeel 是加州大学伯克利分校 AI 与机器人教授,也是机器人学习和强化学习领域的顶尖学者。他曾创办机器人 AI 公司 Covariant,亚马逊在 2024 年挖走其核心团队,并获得模型技术许可。
他带出的学生还创办了 OpenAI、Perplexity、Physical Intelligence、Ideogram、Skild AI 等公司。OpenAI 联合创始人 John Schulman、Perplexity 联合创始人 Aravind Srinivas,都曾是他的学生。
商业内幕
亚马逊正在重做自研 AI。上周不仅裁掉一批 AGI 团队员工,还关闭了 2024 年成立的 AGI Lab。
随后,大部分 Nova 旗舰模型被停止重点升级。Nova Premier、Omni、视频模型 Reel 和图像模型 Canvas 只保留现有客户支持。
Nova 是亚马逊自研的 AI 模型家族,原本同时覆盖文字、图片和视频。现在,这套多线并进的策略基本结束。
人力和算力将集中到一个新的旗舰基础模型。项目由 Pieter Abbeel 负责,预计今年在 AWS re:Invent 亮相。新模型可能继续叫 Nova,也可能换一个全新品牌。
Abbeel 是加州大学伯克利分校 AI 与机器人教授,也是机器人学习和强化学习领域的顶尖学者。他曾创办机器人 AI 公司 Covariant,亚马逊在 2024 年挖走其核心团队,并获得模型技术许可。
他带出的学生还创办了 OpenAI、Perplexity、Physical Intelligence、Ideogram、Skild AI 等公司。OpenAI 联合创始人 John Schulman、Perplexity 联合创始人 Aravind Srinivas,都曾是他的学生。
商业内幕
❤1
Kimi K4要比K3更大,但月之暗面被英伟达芯片卡住
K3 刚发布,月之暗面已经在为下一代 Kimi K4 找芯片。新模型会比 2.8 万亿参数的 K3 明显更大,但目前还没有训练和发布时间表。
《The Information》称,K3 使用了英伟达最先进的 Blackwell 芯片,部分训练实际在中国完成,并非全部放在美国官员所说的泰国数据中心。
更关键的是,K3 并没有一座完整的大型训练集群。没有一家中国云厂商能提供足够多的 Blackwell,月之暗面至少接入了两家供应商,把大量八卡服务器连在一起。
不同供应商的芯片分散在不同数据中心,通信速度和稳定性更难保证。月之暗面的工程团队重新设计了网络,才让这些零散算力能够共同训练一个 2.8 万亿参数模型。
训练完成后,运行 K3 同样需要大量芯片。月之暗面主要使用英伟达 H20 提供服务,建议部署方至少连接 64 块芯片。K3 上线后需求暴涨,公司不到 48 小时就暂停了新订阅。
国产芯片短期内也很难补位。能连接数十甚至数百块国产芯片的大型服务器仍然缺货,客户最长要等六个月。
月之暗面已经证明,芯片受限也能拼出 K3。K4 目前只有方向,没有时间表。它能做多大、何时开始训练,可能先取决于月之暗面还能找到多少 Blackwell。
The Information
K3 刚发布,月之暗面已经在为下一代 Kimi K4 找芯片。新模型会比 2.8 万亿参数的 K3 明显更大,但目前还没有训练和发布时间表。
《The Information》称,K3 使用了英伟达最先进的 Blackwell 芯片,部分训练实际在中国完成,并非全部放在美国官员所说的泰国数据中心。
更关键的是,K3 并没有一座完整的大型训练集群。没有一家中国云厂商能提供足够多的 Blackwell,月之暗面至少接入了两家供应商,把大量八卡服务器连在一起。
不同供应商的芯片分散在不同数据中心,通信速度和稳定性更难保证。月之暗面的工程团队重新设计了网络,才让这些零散算力能够共同训练一个 2.8 万亿参数模型。
训练完成后,运行 K3 同样需要大量芯片。月之暗面主要使用英伟达 H20 提供服务,建议部署方至少连接 64 块芯片。K3 上线后需求暴涨,公司不到 48 小时就暂停了新订阅。
国产芯片短期内也很难补位。能连接数十甚至数百块国产芯片的大型服务器仍然缺货,客户最长要等六个月。
月之暗面已经证明,芯片受限也能拼出 K3。K4 目前只有方向,没有时间表。它能做多大、何时开始训练,可能先取决于月之暗面还能找到多少 Blackwell。
The Information
The Information
Chinese AI Startup Moonshot Seeks More Nvidia Blackwell Chips for Next Model
Beijing-based startup Moonshot AI, flush from the breakout success of its recently released model, Kimi K3, is already discussing plans for Kimi K4, which would be significantly larger in size than K3, according to two people with knowledge of the matter.…
👍3🤡1