动察Beating AI News
谷歌发布Gemini 3.6 Flash,Gemini 4也已启动预训练 谷歌发布 Gemini 3.6 Flash,主打编程、知识工作和多模态 Agent。新模型完成多步骤任务时,需要的推理步骤和工具调用更少。 Artificial Analysis 评测显示,它比 Gemini 3.5 Flash 少用 17% 的输出 Token。API 输入价格保持每百万 Token 1.5 美元,输出价格从 9 美元降至 7.5 美元。Token 用量和单价同时下降,Agent 执行长任务会更省钱。 性能也有提升。DeepSWE…
谷歌跌出智能榜前十,Gemini 3.6 Flash只快不强
谷歌发布 Gemini 3.6 Flash,主打更快、更省的 Agent 任务。但 Artificial Analysis 综合智能指数仅 50 分,与 Gemini 3.5 Flash 持平,并列第 11 位。榜单前十最低为 51 分,谷歌目前没有任何模型进入前十。
模型的平均任务时间从 2.7 分钟降至 1.3 分钟。单项成本从 0.59 美元降至 0.50 美元。在模拟真实知识工作的 GDPval-AA v2 中,Gemini 3.6 Flash 的 Elo 从 1349 升至 1421。但其他项目没有同步提升,综合智能分仍停在 50。
谷歌这次把 Flash 做得更快、更便宜,却没做得更聪明。至少在 Artificial Analysis 这张综合榜上,Gemini 已从领跑者掉到追赶者。
Artificial Analysis
谷歌发布 Gemini 3.6 Flash,主打更快、更省的 Agent 任务。但 Artificial Analysis 综合智能指数仅 50 分,与 Gemini 3.5 Flash 持平,并列第 11 位。榜单前十最低为 51 分,谷歌目前没有任何模型进入前十。
模型的平均任务时间从 2.7 分钟降至 1.3 分钟。单项成本从 0.59 美元降至 0.50 美元。在模拟真实知识工作的 GDPval-AA v2 中,Gemini 3.6 Flash 的 Elo 从 1349 升至 1421。但其他项目没有同步提升,综合智能分仍停在 50。
谷歌这次把 Flash 做得更快、更便宜,却没做得更聪明。至少在 Artificial Analysis 这张综合榜上,Gemini 已从领跑者掉到追赶者。
Artificial Analysis
👎3
Kimi K3与Fable 5接近平手,组合准确率达93%
AI 推理平台 Fireworks 用同一套 Agent 脚手架测试了 Kimi K3 和 Fable 5,覆盖代码修复、长程终端操作、算法、多语言编程和法律五类任务。两者总体接近平手,但擅长方向不同。K3 更强于安全、密码学和长时间终端操作,Fable 5 更擅长多语言编程、网页和数据可视化。
Fireworks 又做了一次「上帝视角路由」:每项任务同时运行两个模型,事后再挑出正确且更便宜的答案。组合准确率达到 93%,高于任何单一模型。K3 承担了 72% 到 96% 的任务,Fable 5 只处理少数长尾难题。
K3 在五类任务中的成本都更低。长终端任务最多比 Fable 5 便宜约 50 倍。不过,93% 只是上帝视角下的模拟结果,不是 Fireworks 已经做出的实际路由成绩。
K3 将于 7 月 27 日开源之后上线 Fireworks。
Fireworks
AI 推理平台 Fireworks 用同一套 Agent 脚手架测试了 Kimi K3 和 Fable 5,覆盖代码修复、长程终端操作、算法、多语言编程和法律五类任务。两者总体接近平手,但擅长方向不同。K3 更强于安全、密码学和长时间终端操作,Fable 5 更擅长多语言编程、网页和数据可视化。
Fireworks 又做了一次「上帝视角路由」:每项任务同时运行两个模型,事后再挑出正确且更便宜的答案。组合准确率达到 93%,高于任何单一模型。K3 承担了 72% 到 96% 的任务,Fable 5 只处理少数长尾难题。
K3 在五类任务中的成本都更低。长终端任务最多比 Fable 5 便宜约 50 倍。不过,93% 只是上帝视角下的模拟结果,不是 Fireworks 已经做出的实际路由成绩。
K3 将于 7 月 27 日开源之后上线 Fireworks。
Fireworks
❤2
Anthropic再砸2000万美元,AI监管战烧向美国中期选举
Anthropic 向跨党派 AI 政策组织 Public First Action 再捐 2000 万美元,累计投入达到 4000 万美元。这个组织主张提高 AI 透明度,并加强安全监管。
Anthropic 称,模型能力快速增强,相关风险也在上升。捐款只能用于政策宣传,不能用于支持或反对具体候选人。
另一边,主张加快 AI 开发、放松监管的超级政治行动委员会 Leading the Future 也手握大笔资金。美国中期选举前,AI 监管已经变成一场真金白银的政治游说战。
Axios
Anthropic 向跨党派 AI 政策组织 Public First Action 再捐 2000 万美元,累计投入达到 4000 万美元。这个组织主张提高 AI 透明度,并加强安全监管。
Anthropic 称,模型能力快速增强,相关风险也在上升。捐款只能用于政策宣传,不能用于支持或反对具体候选人。
另一边,主张加快 AI 开发、放松监管的超级政治行动委员会 Leading the Future 也手握大笔资金。美国中期选举前,AI 监管已经变成一场真金白银的政治游说战。
Axios
Axios
Anthropic doubles funding for AI policy fight ahead of elections
Anthropic is donating another $20 million to Public First Action.
🥴2
黄仁勋力挺中国开源AI,封杀只会让美国更危险
英伟达 CEO 黄仁勋公开反对美国封禁中国开源 AI。他称 Kimi 等中国模型表现优秀,美国企业「当然应该使用」。限制这些模型,反而可能削弱美国的安全。
黄仁勋认为,企业可以把下载的模型放进安全沙箱,自己控制数据和访问权限。开放权重也方便外部研究者检查漏洞。相比所有人依赖同一个模型,这样更不容易出现单点故障。
他也不认为 Kimi 会挤垮 OpenAI 和 Anthropic。低价甚至免费的模型会扩大 AI 市场,带动更多芯片、数据中心和算力需求。他直言,免费 AI 对硬件是好事。
Axios
英伟达 CEO 黄仁勋公开反对美国封禁中国开源 AI。他称 Kimi 等中国模型表现优秀,美国企业「当然应该使用」。限制这些模型,反而可能削弱美国的安全。
黄仁勋认为,企业可以把下载的模型放进安全沙箱,自己控制数据和访问权限。开放权重也方便外部研究者检查漏洞。相比所有人依赖同一个模型,这样更不容易出现单点故障。
他也不认为 Kimi 会挤垮 OpenAI 和 Anthropic。低价甚至免费的模型会扩大 AI 市场,带动更多芯片、数据中心和算力需求。他直言,免费 AI 对硬件是好事。
Axios
Axios
Exclusive: Nvidia's Jensen Huang defends Chinese AI amid Kimi panic
Huang told Axios that American companies should "absolutely" be allowed to use Chinese models.
😁4❤1
美国指控Kimi K3蒸馏Fable,月之暗面或遭制裁
美国白宫科技政策负责人 Michael Kratsios 指控,月之暗面通过蒸馏 Anthropic 的 Fable,训练 Kimi K3。蒸馏就是用强模型的输出训练另一个模型。美国财政部长 Scott Bessent 随后表示,制裁和列入实体清单都在考虑范围内。
Kratsios 称,月之暗面搭建了内部平台,可切换多种访问渠道躲避检测。他还称月之暗面购入搭载英伟达 GB300 的服务器,并在泰国使用相关芯片。Kratsios 没有公开证据。
Anthropic 今年 2 月曾指控,月之暗面通过数百个虚假账号与 Claude 交互超过 340 万次,重点获取 Agent 推理、工具调用、编程和数据分析能力。月之暗面当时未回应媒体置评请求。
月之暗面目前也未回应这次指控。中国驻美使馆称说法「完全没有依据」。美国政府内部尚未形成统一方案,白宫主张收紧限制,商务部认为全面限制难以执行。
Michael Kratsios
美国白宫科技政策负责人 Michael Kratsios 指控,月之暗面通过蒸馏 Anthropic 的 Fable,训练 Kimi K3。蒸馏就是用强模型的输出训练另一个模型。美国财政部长 Scott Bessent 随后表示,制裁和列入实体清单都在考虑范围内。
Kratsios 称,月之暗面搭建了内部平台,可切换多种访问渠道躲避检测。他还称月之暗面购入搭载英伟达 GB300 的服务器,并在泰国使用相关芯片。Kratsios 没有公开证据。
Anthropic 今年 2 月曾指控,月之暗面通过数百个虚假账号与 Claude 交互超过 340 万次,重点获取 Agent 推理、工具调用、编程和数据分析能力。月之暗面当时未回应媒体置评请求。
月之暗面目前也未回应这次指控。中国驻美使馆称说法「完全没有依据」。美国政府内部尚未形成统一方案,白宫主张收紧限制,商务部认为全面限制难以执行。
Michael Kratsios
👎6
谷歌AI投入开始兑现:Cloud营收暴涨82%,Gemini月活9.5亿
谷歌母公司 Alphabet 第二季度营收达 1198 亿美元,同比增长 24%。
Google Cloud 营收增至 248 亿美元,同比暴涨 82%。市场此前预期增长约 64%。谷歌称,AI 基础设施和企业 AI 服务是主要动力。
Cloud 待履约合同额升至 5140 亿美元。Gemini App 月活达到 9.5 亿,日活增至一年前的 3 倍。
谷歌模型 API 每分钟处理约 220 亿 Token。上一季度为 160 亿 Token。
增长也伴随更高投入。Alphabet 把 2026 年资本开支预期再上调 150 亿美元,至 1950 亿至 2050 亿美元。财报公布后,股价盘后一度跌超 3%。
谷歌
谷歌母公司 Alphabet 第二季度营收达 1198 亿美元,同比增长 24%。
Google Cloud 营收增至 248 亿美元,同比暴涨 82%。市场此前预期增长约 64%。谷歌称,AI 基础设施和企业 AI 服务是主要动力。
Cloud 待履约合同额升至 5140 亿美元。Gemini App 月活达到 9.5 亿,日活增至一年前的 3 倍。
谷歌模型 API 每分钟处理约 220 亿 Token。上一季度为 160 亿 Token。
增长也伴随更高投入。Alphabet 把 2026 年资本开支预期再上调 150 亿美元,至 1950 亿至 2050 亿美元。财报公布后,股价盘后一度跌超 3%。
谷歌
❤1
动察Beating AI News
谷歌AI投入开始兑现:Cloud营收暴涨82%,Gemini月活9.5亿 谷歌母公司 Alphabet 第二季度营收达 1198 亿美元,同比增长 24%。 Google Cloud 营收增至 248 亿美元,同比暴涨 82%。市场此前预期增长约 64%。谷歌称,AI 基础设施和企业 AI 服务是主要动力。 Cloud 待履约合同额升至 5140 亿美元。Gemini App 月活达到 9.5 亿,日活增至一年前的 3 倍。 谷歌模型 API 每分钟处理约 220 亿 Token。上一季度为 160…
谷歌财报日先涨后跌:AI资本开支已超过经营现金流
Alphabet 财报公布后,股价一度上涨。电话会上调资本开支预期后,股价迅速转跌。2026 年资本开支预期从 1800 亿至 1900 亿美元,升至 1950 亿至 2050 亿美元。
第二季度资本开支达到 449 亿美元,较上年同期翻倍。经营现金流只有 391 亿美元,自由现金流转为负 59 亿美元。本季度经营产生的现金,已经覆盖不了数据中心和服务器投入。
财报中的 1121 亿美元净利润也不能直接代表主营业务表现。其中约 980 亿美元是股权投资净收益,主要来自 SpaceX 上市。净利润因此暴涨,自由现金流却同时转负。
Cloud 营收增长 82%,说明 AI 需求确实强劲。市场担心的是,谷歌还要投入多久,新增收入才能覆盖不断膨胀的算力成本。
Alphabet 财报公布后,股价一度上涨。电话会上调资本开支预期后,股价迅速转跌。2026 年资本开支预期从 1800 亿至 1900 亿美元,升至 1950 亿至 2050 亿美元。
第二季度资本开支达到 449 亿美元,较上年同期翻倍。经营现金流只有 391 亿美元,自由现金流转为负 59 亿美元。本季度经营产生的现金,已经覆盖不了数据中心和服务器投入。
财报中的 1121 亿美元净利润也不能直接代表主营业务表现。其中约 980 亿美元是股权投资净收益,主要来自 SpaceX 上市。净利润因此暴涨,自由现金流却同时转负。
Cloud 营收增长 82%,说明 AI 需求确实强劲。市场担心的是,谷歌还要投入多久,新增收入才能覆盖不断膨胀的算力成本。
👎1
OpenAI发布Presence,帮企业把Agent接进真实业务
OpenAI 发布企业 Agent 服务 Presence。它帮助企业把语音和聊天 Agent 接入内部数据、软件和工作流程。
这些 Agent 可以处理客服、销售、账单、保险理赔和 IT 工单。企业可以限制它能看什么、能做什么,以及什么时候必须转给人工。
Presence 还提供模拟测试、自动评测和持续优化。Codex 会分析失败会话,找出问题并提出修改方案。
OpenAI 已把它用于自家电话客服。官方称,Agent 可以独立解决 75% 的英语来电问题。
Presence 目前只向部分企业开放。部署仍需 OpenAI 工程师或合作伙伴协助,不是可以直接购买的自助产品。
OpenAI
OpenAI 发布企业 Agent 服务 Presence。它帮助企业把语音和聊天 Agent 接入内部数据、软件和工作流程。
这些 Agent 可以处理客服、销售、账单、保险理赔和 IT 工单。企业可以限制它能看什么、能做什么,以及什么时候必须转给人工。
Presence 还提供模拟测试、自动评测和持续优化。Codex 会分析失败会话,找出问题并提出修改方案。
OpenAI 已把它用于自家电话客服。官方称,Agent 可以独立解决 75% 的英语来电问题。
Presence 目前只向部分企业开放。部署仍需 OpenAI 工程师或合作伙伴协助,不是可以直接购买的自助产品。
OpenAI
👍1
美国AI巨头一天抛出至少6.2GW算力计划
OpenAI、SpaceXAI 和 Anthropic 同一天披露或传出三项大型算力计划。按各方公布的 GW 口径相加,规模至少达到 6.2GW。
OpenAI 将在佐治亚州建设 Project Camellia。项目拟接入 3.2GW 电力,并在 2028 至 2032 年分批交付。
SpaceXAI 正准备在得州建设至少一个大型数据中心。规模可能追平或超过其孟菲斯约 1GW 的设施。目前仍在选址和规划。
Anthropic 与 AMD 达成最高 2GW 的 MI450 系统部署协议。首个 1GW 计划在 2027 年上半年启动。AMD 还将按部署里程碑,向 Anthropic 投资最高 50 亿美元。
OpenAI、SpaceXAI 和 Anthropic 同一天披露或传出三项大型算力计划。按各方公布的 GW 口径相加,规模至少达到 6.2GW。
OpenAI 将在佐治亚州建设 Project Camellia。项目拟接入 3.2GW 电力,并在 2028 至 2032 年分批交付。
SpaceXAI 正准备在得州建设至少一个大型数据中心。规模可能追平或超过其孟菲斯约 1GW 的设施。目前仍在选址和规划。
Anthropic 与 AMD 达成最高 2GW 的 MI450 系统部署协议。首个 1GW 计划在 2027 年上半年启动。AMD 还将按部署里程碑,向 Anthropic 投资最高 50 亿美元。
🔥1
OpenAI算力预算再加1500亿美元,2030年前烧到7500亿
《华尔街日报》援引知情人士称,OpenAI 已将到 2030 年的算力支出计划,从今年早些时候预计的约 6000 亿美元上调至 7500 亿美元。增加 1500 亿美元,增幅 25%。
最新项目是佐治亚州 Project Camellia。OpenAI 将首次主导数据中心设计和开发。项目预计投入约 200 亿美元,接入 3.2GW 电力,并在 2028 至 2032 年分批通电。
OpenAI 还从 xAI 招来 Brent Mayo,负责数据中心建设与交付。前 xAI 基础设施负责人 Uday Ruddarraju 已担任 OpenAI 算力 CTO。
OpenAI 不再只向云厂商买算力,也开始自己当数据中心开发商。
WSJ
《华尔街日报》援引知情人士称,OpenAI 已将到 2030 年的算力支出计划,从今年早些时候预计的约 6000 亿美元上调至 7500 亿美元。增加 1500 亿美元,增幅 25%。
最新项目是佐治亚州 Project Camellia。OpenAI 将首次主导数据中心设计和开发。项目预计投入约 200 亿美元,接入 3.2GW 电力,并在 2028 至 2032 年分批通电。
OpenAI 还从 xAI 招来 Brent Mayo,负责数据中心建设与交付。前 xAI 基础设施负责人 Uday Ruddarraju 已担任 OpenAI 算力 CTO。
OpenAI 不再只向云厂商买算力,也开始自己当数据中心开发商。
WSJ
The Wall Street Journal
Exclusive | OpenAI’s Planned Cloud Spending Hits $750 Billion as Computing Efforts Ramp Up
The AI giant has committed $20 billion to a new data-center project in Georgia and hired an architect of Elon Musk’s computing build-out.
🔥2
动察Beating AI News
美国指控Kimi K3蒸馏Fable,月之暗面或遭制裁 美国白宫科技政策负责人 Michael Kratsios 指控,月之暗面通过蒸馏 Anthropic 的 Fable,训练 Kimi K3。蒸馏就是用强模型的输出训练另一个模型。美国财政部长 Scott Bessent 随后表示,制裁和列入实体清单都在考虑范围内。 Kratsios 称,月之暗面搭建了内部平台,可切换多种访问渠道躲避检测。他还称月之暗面购入搭载英伟达 GB300 的服务器,并在泰国使用相关芯片。Kratsios 没有公开证据。 Anthropic…
月之暗面员工反讽白宫:15天训练出K3,够申报吉尼斯
月之暗面团队成员 Randy 回应美国指控称,Fable 于 7 月 1 日公开,Kimi K3 于 7 月 15 日上线。
他反讽称,若月之暗面真靠 Fable 训练 K3,那就在 15 天内造出了一个全新的前沿模型,足以申报吉尼斯世界纪录。
Randy
月之暗面团队成员 Randy 回应美国指控称,Fable 于 7 月 1 日公开,Kimi K3 于 7 月 15 日上线。
他反讽称,若月之暗面真靠 Fable 训练 K3,那就在 15 天内造出了一个全新的前沿模型,足以申报吉尼斯世界纪录。
Randy
😁9
梁文锋四小时会议内容流出:DeepSeek不做超级App,只押AGI
媒体「elsewhere」整理出梁文锋在一场四小时投资人会议上的 52 条发言。梁文锋称,DeepSeek 只沿 AGI 一条主线推进。今年重点是通用 Agent,下一步是持续学习,再往后才是 AI 自我迭代和具身智能。
他明确排除 3D、视频生成和世界模型,也不想做下一个超级 App。多模态、幻觉治理和行业 Agent 会继续做,但都不是当前重点。产品只是通往 AGI 的一个台阶。
商业上,DeepSeek 不追求用户量或利润最大化,将继续开源和低价。梁文锋认为,大模型竞争首先拼成本,其次拼时间,最后才是用户体验。团队稳定则是唯一不能退让的问题。
elsewhere
媒体「elsewhere」整理出梁文锋在一场四小时投资人会议上的 52 条发言。梁文锋称,DeepSeek 只沿 AGI 一条主线推进。今年重点是通用 Agent,下一步是持续学习,再往后才是 AI 自我迭代和具身智能。
他明确排除 3D、视频生成和世界模型,也不想做下一个超级 App。多模态、幻觉治理和行业 Agent 会继续做,但都不是当前重点。产品只是通往 AGI 的一个台阶。
商业上,DeepSeek 不追求用户量或利润最大化,将继续开源和低价。梁文锋认为,大模型竞争首先拼成本,其次拼时间,最后才是用户体验。团队稳定则是唯一不能退让的问题。
elsewhere
🐳4
OpenAI总裁承认Kimi K3「相当不错」,是否蒸馏GPT仍不清楚
OpenAI 总裁兼联合创始人 Greg Brockman 承认,月之暗面新模型 Kimi K3「相当不错」。但他称,目前判断 Kimi 是否通过蒸馏 OpenAI 模型提升能力还太早,OpenAI 会持续监测。
此前,白宫官员指控月之暗面不当使用美国 AI 模型。Anthropic 也提出过类似质疑。月之暗面尚未回应。
Brockman 还引用估算称,中国模型与美国的差距可能只剩 4 个月。他认为,未来竞争的关键不是模型是否开源,而是谁能用更低成本完成任务。
彭博社
OpenAI 总裁兼联合创始人 Greg Brockman 承认,月之暗面新模型 Kimi K3「相当不错」。但他称,目前判断 Kimi 是否通过蒸馏 OpenAI 模型提升能力还太早,OpenAI 会持续监测。
此前,白宫官员指控月之暗面不当使用美国 AI 模型。Anthropic 也提出过类似质疑。月之暗面尚未回应。
Brockman 还引用估算称,中国模型与美国的差距可能只剩 4 个月。他认为,未来竞争的关键不是模型是否开源,而是谁能用更低成本完成任务。
彭博社
Bloomberg.com
OpenAI President Says Kimi K3 ‘Pretty Good,’ Unsure If Distilled From GPT Models
OpenAI President Greg Brockman acknowledged that Moonshot AI had developed a competitive new artificial intelligence model and said he wasn’t sure whether the Chinese firm had piggybacked on the ChatGPT maker’s technology.
❤1👎1
动察Beating AI News
美国指控Kimi K3蒸馏Fable,月之暗面或遭制裁 美国白宫科技政策负责人 Michael Kratsios 指控,月之暗面通过蒸馏 Anthropic 的 Fable,训练 Kimi K3。蒸馏就是用强模型的输出训练另一个模型。美国财政部长 Scott Bessent 随后表示,制裁和列入实体清单都在考虑范围内。 Kratsios 称,月之暗面搭建了内部平台,可切换多种访问渠道躲避检测。他还称月之暗面购入搭载英伟达 GB300 的服务器,并在泰国使用相关芯片。Kratsios 没有公开证据。 Anthropic…
YC等美国AI初创联名反对封杀Kimi、Qwen:封禁只会养肥Anthropic
美国创业组织 Little Tech Association 联合 Y Combinator 等 179 个签署方致信特朗普政府,反对全面禁止中国开放权重模型。
信中点名 Kimi K3 和 Qwen3.8 Max。开放权重模型可以下载到本地部署和修改,不必把数据交给模型厂商。
联署方称,不少美国初创已经把中国开放模型用于正式业务。全面封禁不会阻止这些模型在海外传播,只会抬高美国企业的成本。
Particle 创始人 Suhail Doshi 警告,禁令可能让数百家依赖开放模型的公司陷入危机,Anthropic 等闭源模型厂商反而会受益。
目前,特朗普政府尚未提出正式禁令。白宫正在调查中国模型是否通过蒸馏复制美国模型,但内部并未认真讨论全面封杀,商务部也没有起草实体清单方案。
Politico
美国创业组织 Little Tech Association 联合 Y Combinator 等 179 个签署方致信特朗普政府,反对全面禁止中国开放权重模型。
信中点名 Kimi K3 和 Qwen3.8 Max。开放权重模型可以下载到本地部署和修改,不必把数据交给模型厂商。
联署方称,不少美国初创已经把中国开放模型用于正式业务。全面封禁不会阻止这些模型在海外传播,只会抬高美国企业的成本。
Particle 创始人 Suhail Doshi 警告,禁令可能让数百家依赖开放模型的公司陷入危机,Anthropic 等闭源模型厂商反而会受益。
目前,特朗普政府尚未提出正式禁令。白宫正在调查中国模型是否通过蒸馏复制美国模型,但内部并未认真讨论全面封杀,商务部也没有起草实体清单方案。
Politico
POLITICO
Startup founders urge Trump not to shut off Chinese open weight AI
As the Trump administration escalates its scrutiny of Chinese AI companies, startup founders are urging officials not to block access to the open weight models many young companies depend on.
😁5🤩1
Cursor自动挑模型:满意度接近Fable,成本低60%
Cursor 推出 Cursor Router,面向 Teams 和 Enterprise 自动选择编程模型。它会先判断任务类型和难度,再决定调用便宜模型还是前沿模型。
Router 使用超过 60 万次真实请求训练,并在数百万次请求中测试。Auto Intelligence 的用户满意度接近 Fable,成本低约 60%。Auto Balance 的满意度高于 Opus 4.8,成本低约 36%。
Cursor 没有公布完整模型池,也不会默认显示每次调用了哪个模型。官方只确认,Router 会按任务类型分配模型,例如把界面设计交给更擅长视觉的模型,把复杂长任务交给推理能力更强的模型。
Cursor
Cursor 推出 Cursor Router,面向 Teams 和 Enterprise 自动选择编程模型。它会先判断任务类型和难度,再决定调用便宜模型还是前沿模型。
Router 使用超过 60 万次真实请求训练,并在数百万次请求中测试。Auto Intelligence 的用户满意度接近 Fable,成本低约 60%。Auto Balance 的满意度高于 Opus 4.8,成本低约 36%。
Cursor 没有公布完整模型池,也不会默认显示每次调用了哪个模型。官方只确认,Router 会按任务类型分配模型,例如把界面设计交给更擅长视觉的模型,把复杂长任务交给推理能力更强的模型。
Cursor
🎉4❤1
Kimi被指蒸馏Fable,Hermes Agent创始人反讽:Anthropic先蒸馏了全人类
白宫科技政策办公室主任 Michael Kratsios 指控,月之暗面用 Anthropic 的 Fable 训练 Kimi K3。其称月之暗面还搭建内部平台,批量调用美国模型并规避检测。帖文没有公开证据,月之暗面暂未回应。
Hermes Agent 开发商 Nous Research 联合创始人 Teknium 随后照抄这段句式。他称 Anthropic 为训练 Fable,抓取了自己的 GitHub、X、Reddit、Discord 和 Facebook 帖子。随后补充:「他们其实是在蒸馏地球上的所有人。」
Teknium 显然是在反讽。网页抓取和模型蒸馏不是一回事。Anthropic 公开承认,其模型训练数据包括公开互联网信息。Teknium 质疑的是:美国模型吸收全网内容时叫训练,中国模型学习美国模型时却被定性为偷窃。
Teknium
白宫科技政策办公室主任 Michael Kratsios 指控,月之暗面用 Anthropic 的 Fable 训练 Kimi K3。其称月之暗面还搭建内部平台,批量调用美国模型并规避检测。帖文没有公开证据,月之暗面暂未回应。
Hermes Agent 开发商 Nous Research 联合创始人 Teknium 随后照抄这段句式。他称 Anthropic 为训练 Fable,抓取了自己的 GitHub、X、Reddit、Discord 和 Facebook 帖子。随后补充:「他们其实是在蒸馏地球上的所有人。」
Teknium 显然是在反讽。网页抓取和模型蒸馏不是一回事。Anthropic 公开承认,其模型训练数据包括公开互联网信息。Teknium 质疑的是:美国模型吸收全网内容时叫训练,中国模型学习美国模型时却被定性为偷窃。
Teknium
😁3
动察Beating AI News
拿了6亿美元闷头做3年,Poolside首次公开编程模型 编程 AI 公司 Poolside 发布 Laguna 系列首批两款模型。Poolside 2023 年成立,累计融资 6.26 亿美元,估值 30 亿美元,投资方包括 Bain Capital Ventures、NVIDIA 和 eBay Ventures,此前只面向政府和公共部门客户,这是首次向公众发布模型。 旗舰 Laguna M.1 是 225B 参数 MoE 模型(激活 23B),在 6144 块 NVIDIA Hopper GPU 上从零训练…
Poolside开源1180亿参数代码模型,自测压过1.6万亿参数DeepSeek
专做编程 Agent 的 Poolside 开源 MoE 代码模型 Laguna S 2.1。模型总参数 1180 亿,每次仅激活 80 亿,支持 100 万 Token 上下文。量化后可在一台 NVIDIA DGX Spark 上运行。
Poolside 自测中,Laguna S 2.1 在 Terminal-Bench 2.1 得 70.2%,高于总参数 1.6 万亿、激活参数 490 亿的 DeepSeek-V4-Pro-Max 的 64.0%。SWE-Bench Multilingual、SWE-Bench Pro 和 DeepSWE 也更高。
但它与 Kimi K3 仍有明显差距。Kimi K3 总参数 2.8 万亿、激活参数 500 亿,在 Terminal-Bench 2.1 得 88.3%,DeepSWE 得 69%。Laguna S 2.1 分别为 70.2% 和 40.4%。
这些分数不是同一环境重测。Poolside 使用自有 Agent 框架,竞品取公开最高成绩。Laguna S 2.1 的特点,是用更少的激活参数,把长程编程能力做到本地单机可跑。
Poolside
专做编程 Agent 的 Poolside 开源 MoE 代码模型 Laguna S 2.1。模型总参数 1180 亿,每次仅激活 80 亿,支持 100 万 Token 上下文。量化后可在一台 NVIDIA DGX Spark 上运行。
Poolside 自测中,Laguna S 2.1 在 Terminal-Bench 2.1 得 70.2%,高于总参数 1.6 万亿、激活参数 490 亿的 DeepSeek-V4-Pro-Max 的 64.0%。SWE-Bench Multilingual、SWE-Bench Pro 和 DeepSWE 也更高。
但它与 Kimi K3 仍有明显差距。Kimi K3 总参数 2.8 万亿、激活参数 500 亿,在 Terminal-Bench 2.1 得 88.3%,DeepSWE 得 69%。Laguna S 2.1 分别为 70.2% 和 40.4%。
这些分数不是同一环境重测。Poolside 使用自有 Agent 框架,竞品取公开最高成绩。Laguna S 2.1 的特点,是用更少的激活参数,把长程编程能力做到本地单机可跑。
Poolside
Poolside
Introducing Laguna S 2.1
Today we’re releasing Laguna S 2.1, a significant step forward in our development of models that pursue longer horizon work and make effective use of reasoning.
❤1
字节Seed招募100名学者:给算力和薪酬,用AI做真实科研
字节跳动 Seed 启动 STEM 科学家计划,拟邀请 100 位前沿科学领域学者。参与者将与 Seed 团队合作约 6 个月,用 AI 解决真实科研问题。
参与方式分为科学家顾问和博士实习生。前者面向高校学者和行业专家,后者面向 STEM 领域在读博士。申请者需在科研中深度使用 AI,熟练编程者优先。
Seed 将提供算力、AI 团队协作和薪酬。项目需到北京海淀现场参与,申请截至 2026 年 9 月 30 日。
字节跳动
字节跳动 Seed 启动 STEM 科学家计划,拟邀请 100 位前沿科学领域学者。参与者将与 Seed 团队合作约 6 个月,用 AI 解决真实科研问题。
参与方式分为科学家顾问和博士实习生。前者面向高校学者和行业专家,后者面向 STEM 领域在读博士。申请者需在科研中深度使用 AI,熟练编程者优先。
Seed 将提供算力、AI 团队协作和薪酬。项目需到北京海淀现场参与,申请截至 2026 年 9 月 30 日。
字节跳动
🔥4
北京发布智能体新政,想把AI创业者和订单都留在本地
北京四部门发布智能体新政。相比此前的算力、模型和创业补贴,这次把技术研发、产品落地和商业模式放进了同一套政策。
最直接的支持是帮企业找订单。北京将面向科研、医疗、教育、政务、制造和文化,发布真实业务需求清单。模型厂商还可以派前沿部署工程师驻场,与客户共同开发智能体。
新政还提出发展「Token经济」。北京将支持Token即服务、智能体即服务和结果即服务,探索从按Token收费转向按实际价值收费。各区还可发放Token券和智能体服务券。
个人和小团队也是重点争取对象。北京将建设OPC社区,简化「一人公司」注册,并帮助创业者对接头部企业。公共算力也将向中小企业低价开放。
消费端同样有补贴。符合条件的智能手机、眼镜、耳机、机器人和汽车,可纳入数码产品购新和以旧换新范围。
北京想让创业者在本地用算力、接订单、卖产品,把模型能力变成真实营收。
政策原文
北京四部门发布智能体新政。相比此前的算力、模型和创业补贴,这次把技术研发、产品落地和商业模式放进了同一套政策。
最直接的支持是帮企业找订单。北京将面向科研、医疗、教育、政务、制造和文化,发布真实业务需求清单。模型厂商还可以派前沿部署工程师驻场,与客户共同开发智能体。
新政还提出发展「Token经济」。北京将支持Token即服务、智能体即服务和结果即服务,探索从按Token收费转向按实际价值收费。各区还可发放Token券和智能体服务券。
个人和小团队也是重点争取对象。北京将建设OPC社区,简化「一人公司」注册,并帮助创业者对接头部企业。公共算力也将向中小企业低价开放。
消费端同样有补贴。符合条件的智能手机、眼镜、耳机、机器人和汽车,可纳入数码产品购新和以旧换新范围。
北京想让创业者在本地用算力、接订单、卖产品,把模型能力变成真实营收。
政策原文
fgw.beijing.gov.cn
北京市发展和改革委员会 中共北京市委网络安全和信息化委员会办公室 北京市科学技术委员会、中关村科技园区管理委员会 北京市经济和信息化局 关于印发北京市加快智能体引领发展若干措施的通知-本委其他文件-北京市发展和改革委员会
北京市发展和改革委员会 中共北京市委网络安全和信...
👍2
Kimi K3用27分钟复现Redis高危漏洞,研究员称此前没有模型做到
此前发现 Claude Code 源码意外泄露的安全研究员 Chaofan Shou 称,他让 Kimi K3 对 Redis 8.6.x 做授权安全测试。模型调动 32 个 Agent,只用 27 分钟就写出可运行的攻击程序。
他的提示词允许模型最多调用 64 个子 Agent。任务包括克隆 Redis 源码,寻找缓冲区溢出、内存释放后继续使用等漏洞。模型还可以自己写模糊测试工具、加入监控代码,再用 GDB 调试。
Shou 称,Kimi K3 是第一个「既有能力,也愿意写漏洞利用程序」的大模型。这里的「愿意」,指模型没有因为安全限制直接拒绝,而是在明确属于授权测试的前提下继续执行。
Kimi 最终写出了完整攻击代码,可以让 Redis 所在的服务器执行指定命令。公开 PoC 已适配 Redis 6.2.22、7.4.9 和 8.6.4。
不过,这不是一次与公开信息隔离的盲测。Shou 后来确认,Agent 可以访问网页、PR 和代码历史。Redis 在今年 4 月已经公开合并 PR #15081,其中直接写明了同一条漏洞路径和修复方法。
因此,更合理的解释是:Kimi 可能先从公开补丁中找到漏洞线索,再反推旧版代码并写成完整利用程序。
Chaofan Shou
此前发现 Claude Code 源码意外泄露的安全研究员 Chaofan Shou 称,他让 Kimi K3 对 Redis 8.6.x 做授权安全测试。模型调动 32 个 Agent,只用 27 分钟就写出可运行的攻击程序。
他的提示词允许模型最多调用 64 个子 Agent。任务包括克隆 Redis 源码,寻找缓冲区溢出、内存释放后继续使用等漏洞。模型还可以自己写模糊测试工具、加入监控代码,再用 GDB 调试。
Shou 称,Kimi K3 是第一个「既有能力,也愿意写漏洞利用程序」的大模型。这里的「愿意」,指模型没有因为安全限制直接拒绝,而是在明确属于授权测试的前提下继续执行。
Kimi 最终写出了完整攻击代码,可以让 Redis 所在的服务器执行指定命令。公开 PoC 已适配 Redis 6.2.22、7.4.9 和 8.6.4。
不过,这不是一次与公开信息隔离的盲测。Shou 后来确认,Agent 可以访问网页、PR 和代码历史。Redis 在今年 4 月已经公开合并 PR #15081,其中直接写明了同一条漏洞路径和修复方法。
因此,更合理的解释是:Kimi 可能先从公开补丁中找到漏洞线索,再反推旧版代码并写成完整利用程序。
Chaofan Shou
😱3
开发者把ChatGPT Work玩成临时VPS:9核云环境可SSH接入
ChatGPT Work 是 OpenAI 新推出的通用 Agent,可在云端连续数小时处理文件和执行任务。有开发者发现,它背后运行着 Linux 云环境,并成功从本地电脑远程接入。
Pro 会员的云环境有 9 个 CPU 核心、约 21GB 内存和 63GB 磁盘。接入后,用户可用终端、VS Code 和 Cursor 直接编辑文件或安装软件。
不过,这不是一台固定分配的服务器。OpenAI 没有公布环境存活时间、文件保留规则或服务保障。会话结束或环境被替换后,进程可能消失,文件也无法保证完整保留。
Maximilian Jendrall
ChatGPT Work 是 OpenAI 新推出的通用 Agent,可在云端连续数小时处理文件和执行任务。有开发者发现,它背后运行着 Linux 云环境,并成功从本地电脑远程接入。
Pro 会员的云环境有 9 个 CPU 核心、约 21GB 内存和 63GB 磁盘。接入后,用户可用终端、VS Code 和 Cursor 直接编辑文件或安装软件。
不过,这不是一台固定分配的服务器。OpenAI 没有公布环境存活时间、文件保留规则或服务保障。会话结束或环境被替换后,进程可能消失,文件也无法保证完整保留。
Maximilian Jendrall
😁3❤1