动察Beating AI News
2.97K subscribers
747 photos
2 videos
3.16K links
AI新闻信息流
Download Telegram
Kimi K3在DeepSWE得分69%,仅差Claude Fable 5一个百分点

AI 数据公司 Datacurve 将 Kimi K3 加入长程软件工程基准 DeepSWE。这个基准测试模型能否独立完成真实、复杂的长期开发任务。

Kimi K3 的任务通过率为 69%。GPT-5.6 Sol 和 Claude Fable 5 分别为 73% 和 70%。

Datacurve 称,Kimi K3 是首个在 DeepSWE 达到前沿闭源模型水平的开放权重模型。

DeepSWE 包含 113 项原创任务,来自 91 个活跃开源项目,覆盖 5 种编程语言。所有模型使用同一套工具。任务也不直接改编自已有代码提交,以减少训练数据污染。

Kimi K3 每项任务平均成本为 4.65 美元。GPT-5.6 Sol 为 8.39 美元,Claude Fable 5 为 21.63 美元。

Datacurve
👍2
华尔街投资人:Kimi K3或成AI转折点,利好模型巨头之外的产业链

Atreides Management 管理合伙人兼 CIO Gavin Baker 称,Kimi K3 可能成为 AI 行业的转折点。它对 OpenAI 和 Anthropic 不利,却利好几乎所有其他公司。

他的判断是,前沿模型如果长期由两三家实验室垄断,这些公司会拿走大部分利润,并向芯片、云计算和软件层扩张。

K3 增加了模型层竞争。模型利润被压低后,更多价值会留给电力、芯片、数据中心、云服务和软件公司。

不过,K3 目前还不够省 token。Artificial Analysis 的测试显示,它每项任务成本约为 0.94 美元,高于 GPT-5.6 Terra 的 0.55 美元,但略低于 GPT-5.6 Sol 的 1.04 美元。

Baker 认为,真正的行业转折点,还需要一个同样强、但更省 token 的开放模型。OpenAI 和 Anthropic 仍可能依靠产品、工具链和内部模型守住领先。

Gavin Baker
🔥1
前沿模型八天便宜近三分之二,Kimi K3跻身前三

Artificial Analysis 最新榜单显示,8 天内有 4 款前沿模型发布。Grok 4.5、GPT-5.6、Muse Spark 1.1 和 Kimi K3,先后进入第一梯队。

目前,智能指数超过 50 分的模型团队已有 6 家。6 月初,这一门槛还只有 OpenAI 和 Anthropic 达到。

Kimi K3 得分 57,排名第三。它仅次于 Claude Fable 5 的 60 分和 GPT-5.6 Sol 的 59 分,并超过 Claude Opus 4.8 的 56 分。

价格竞争更加明显。按统一基准和官方价格测算,Kimi K3 每项任务成本为 0.94 美元,约为 Opus 4.8 的一半。

GPT-5.6 Sol 只比榜首低 1 分,每项成本为 1.04 美元。Claude Fable 5 则需要 2.75 美元。

Grok 4.5 得分 54,每项成本仅为 0.31 美元。短短 8 天,接近前沿水平的模型,成本已降至此前的约二分之一到三分之一。

Artificial Analysis
4
Claude Fable 5不下线了,正式留在高阶订阅

Anthropic 宣布,从 7 月 20 日起,Claude Fable 5 正式纳入 Max 和 Team Premium 套餐。用户最多可将 50% 的套餐额度用于 Fable 5,不再设置临时截止日期。

Pro 和 Team Standard 用户仍需通过按量额度使用 Fable 5。Anthropic 将向这些用户一次性赠送 100 美元额度。

Fable 5 发布时,Anthropic 只承诺免费提供到 6 月 22 日。模型随后因美国出口管制暂停,7 月 1 日恢复后,套餐访问期限又从 7 月 7 日延至 12 日和 19 日。Anthropic 一直称需求难以预测,需要逐步增加算力。

这个时间点很难不让人联想到 Kimi K3。K3 刚在多项编程和 Agent 评测中逼近 Fable 5,部分项目甚至超过它。竞争压力可能加快了 Anthropic 的决定,但目前没有直接证据。

Claude
😁2🕊1
Kimi K3刚发布,马斯克称2T新模型下周训完,目标超过Kimi

Kimi K3 发布后,马斯克公开了 SpaceXAI 下一款大模型的进度。他称,这个 2T 参数模型将在下周完成初始训练,各方面都优于 1.5T 参数的 Grok 4.5。

马斯克预计,新模型可能超过 Kimi,同时保持接近 Grok 4.5 的生成速度和 token 效率。

Artificial Analysis 的测试显示,Kimi K3 和 Grok 4.5 的智能指数分别为 57 和 54。两者每项任务成本约为 0.94 美元和 0.31 美元。Grok 4.5 目前略弱,但成本只有 Kimi K3 的约三分之一。马斯克想让 2T 模型在保持效率的同时,补上能力差距。

马斯克
4
动察Beating AI News
英伟达 CEO 黄仁勋拍卖标志性汤姆·福特皮衣,估价达 6 万美元 英伟达首席执行官黄仁勋的一件标志性黑色汤姆·福特皮衣即将登上苏富比拍卖行。 这次拍卖由风投 Long Journey Ventures 发起,竞拍将于 2026 年 7 月 7 日至 17 日进行,拍卖行估价在 4 万至 6 万美元之间。这件皮衣不仅有黄仁勋的亲笔签名,还经过了专业机构的图像比对认证,确认是他在 2023 年 10 月 18 日参加台北鸿海科技日(Hon Hai Tech Day)时所穿的那件。拍卖所得将全部捐赠给非营利机构…
黄仁勋亲穿皮衣拍出96万美元,超最高估价16倍

黄仁勋亲穿并签名的一件 Tom Ford 黑色皮衣,在苏富比慈善拍卖中以 96 万美元成交。此前估价为 4 万至 6 万美元,最终价格达到最高估价的 16 倍。

黄仁勋曾在 2023 年鸿海科技日穿着这件皮衣。鉴定机构通过现场照片确认了衣物来源,皮衣内侧的签名也通过专业认证。

黑色皮衣已经成为黄仁勋最醒目的个人标志。这次拍卖由风投机构 Long Journey Ventures 发起,所得款项将捐给非营利机构 Edge Institute,用于资助年轻创业者和研究人员。
Kimi K3强到让OpenAI战略负责人开始讨论美国如何设防

前白宫 AI 顾问、OpenAI 战略负责人 Dean W. Ball 称,Kimi K3 是一款很强的模型。它在 Agent 编程中的表现,已经接近 2026 年第一季度最好的公开模型。这样的能力不能简单用蒸馏解释。

但他这么说,并不只是为了夸 Kimi K3。

Ball 真正想讨论的是,中国为什么还愿意把这种级别的模型开放出来,以及这会怎样影响美国 AI 产业。

在他看来,中国开源模型带来的压力,不只是多了一个便宜的竞争对手。只要开放模型足够强,开发者就不必持续为闭源模型支付高价。模型厂商的利润会被压低,投资者也会更谨慎。美国企业投入数千亿美元训练下一代模型的动力,可能随之减弱。

开放权重能让技术更快扩散,却可能让训练前沿模型越来越难赚钱。最终,模型研发只能依靠其他业务补贴,或者由政府出资,将 AI 变成类似电网和道路的公共基础设施。

Ball 猜测,中国愿意这样做,一部分是因为没有充分重视先进 AI 的风险。另一部分原因是,美国限制先进芯片出口后,中国缺少为全球用户提供推理服务的算力。既然难以靠 API 垄断用户,开放权重反而成了扩大影响力的办法。

他还预测,美国政府迟早会设法阻止中国模型进入本国企业。美国不必直接禁止开源模型,只需要不断提示后门、数据安全和合规风险,银行等受监管行业就会主动避开。

Ball 甚至认为,这些警告不需要特别充分的证据。只要制造足够的不确定性,就能让企业不敢采用,同时又不至于逼迫所有开发者转向更难监管的海外服务商。

Dean W. Ball
👎71👍1
苹果曾邀Kimi创始人杨植麟加入,但他坚持回国创业

Kimi K3 发布后,有网友追问杨植麟为什么没留在美国。他的博士导师 Russ Salakhutdinov 回应称,杨植麟不是留不下来,而是自己决定回国创业。

Russ 表示,杨植麟当时有很多机会留在美国。他曾与一名直接向 Tim Cook 汇报的苹果高管邮件沟通。对方询问杨植麟是否愿意加入苹果。

Russ 告诉对方,杨植麟想回到中国。苹果随后表示,如果他愿意,也可以加入北京办公室。

但杨植麟已经决定回国创业。他曾告诉 Russ,如果连创办自己公司的机会都不尝试,自己会后悔一辈子。

Russ 称,他尊重杨植麟的选择,「事实证明,他是对的」。他也承认,美国的移民程序充满不确定性,即使对卡内基梅隆大学最优秀的博士毕业生也是如此。

Russ Salakhutdinov
8😁1
老外为 Kimi K3 吵翻,质问美国为什么没有留住杨植麟

Kimi K3 发布后,外网的关注很快从模型转向杨植麟。媒体开始回顾他的经历:本科就读清华,博士毕业于卡内基梅隆大学,曾在 Google Brain 和 Meta 工作,最后回到中国创办月之暗面。K3 在编程和 Agent 任务上逼近美国前沿模型,让不少人开始追问:「美国为什么没留下他?」

一派把责任推给美国移民制度。Khosla Ventures 创始人 Vinod Khosla 称,美国正在用移民政策吓走全球顶尖人才。YC 合伙人 Ankit Gupta 更直言,美国不给每位 AI 博士直接发绿卡,简直愚蠢。

但杨植麟的导师 Russ Salakhutdinov 随后澄清,这个解释不适用于杨植麟。他当时有很多机会留在美国,苹果高管也曾主动邀请他加入。杨植麟仍坚持回国创业,因为他觉得不尝试一次,会后悔一辈子。

另一边,部分排外账号把矛头转向 Russ 和美国高校。有人称美国学术界「辜负了美国人」,甚至拿他学生的族裔构成说事。也有学者为 Russ 辩护,认为他只是为学生的成就感到骄傲,不该因此遭到民族主义围攻。

卡内基梅隆大学教授 Jian Ma 随后表示,杨植麟的成功当然罕见,但美国高校还有许多同样出色的国际学生。不断增加的移民和国际交流不确定性,只会让美国更难吸引这些人才。

Business Insider
1
DeepSeek V4强得像Fable 5,社区怀疑API偷偷换了模型

爆料博主 leo 质疑,DeepSeek V4 Pro 的官方 API 会把部分复杂编程请求转给 Claude Fable 5。目的可能是收集输出,用于模型蒸馏,也就是用强模型的答案训练另一个模型。

测试者通过 OpenCode 让模型生成 3D 游戏。部分结果与 Fable 5 高度相似,推理方式也突然改变。加入网络安全和生物问题后,游戏质量明显下降,知识范围也退回 DeepSeek 原本的水平。

这个测试利用了 Fable 5 的真实机制。Anthropic 会把部分网络安全、生物和蒸馏请求转给 Opus 4.8。测试者因此怀疑,请求先被转给 Fable 5,触发分类器后才回退到 DeepSeek。

但现有证据只够证明 API 行为异常。它无法确认实际回答者,也无法证明这些输出进入了训练数据。混合 prompt、未公开更新或 DeepSeek 自己的模型路由,都可能造成类似差异。

leo
🤣11
阿里Qwen3.8参数冲到2.4万亿,正式版即将开放权重

阿里千问预告将发布 Qwen3.8,并开放模型权重。Qwen3.8-Max-Preview 已率先上线 Token Plan、Qoder 和 QoderWork,参数规模达到 2.4 万亿。

新模型相比 Qwen3.7-Max 重点提升代码工程和专业办公能力。它面向全栈开发、数据分析和 Office 工作流等长程任务。目前官方尚未公布技术报告和完整基准成绩。

千问称,Qwen3.8 可与领先前沿模型竞争,能力仅次于 Fable 5。

千问
👍41
月之暗面(Kimi)冲刺港股IPO,最新估值或超300亿美元

彭博援引知情人士称,月之暗面已向投资人发送股东决议文件,寻求批准赴港上市。相关通知流程已经启动,最快可能在半年内上市。

月之暗面还在完成新一轮融资,估值可能超过 300 亿美元。其年化经常性收入(按当前收入推算未来 12 个月)6 月达到 3 亿美元,4 月为 2 亿美元。

上市准备早于 Kimi K3 发布,并非模型上线后临时决定。但 Kimi K3 确实放大了市场关注。它拥有 2.8 万亿参数,发布后美股芯片股和港股 AI 股同步下跌。

月之暗面已开始拆除红筹架构,并与中金和高盛讨论潜在承销安排。公司尚未回应 IPO 计划。

彭博社
👍3
Qwen3.8夜间额度消耗低至2%,阿里Token Plan个人版39元起

阿里正式推出 Token Plan 个人版,用户可在 Claude Code、Cursor、Qwen Code 等工具中调用 Qwen3.8-Max-Preview。个人版 Lite、Standard 和 Pro 限时定价分别为每月 39 元、139 元和 499 元。

团队版同步降价。标准席位、高级席位和尊享席位分别为每席位每月 150 元、550 元和 1398 元。

Qwen3.8-Max-Preview 的额度消耗也在打折。白天仅按正常用量的 10% 扣除 Credits。个人版夜间在此基础上再打 2 折,相当于只扣正常用量的 2%。

一项原本消耗 100 Credits 的任务,白天约扣 10 Credits,夜间约扣 2 Credits。同样的套餐额度,夜间理论上最多可以多用 50 倍。

折扣针对 Credits 消耗。月费和按 token 计费的 API 单价仍按各自规则计算。单次任务实际消耗多少 Credits,还会受到模型、token 用量和任务复杂度影响。

除 Token Plan 外,Qoder 和 QoderWork 也已接入 Qwen3.8-Max-Preview,千问 PC 端可免费体验。

阿里云
10条规则让Claude少说废话,这个「ADHD插件」火了

一个名为 i-have-adhd 的第三方 Claude Code Skill 正在开发者社区走红。它用 10 条规则约束 Claude 的回复方式,让答案更直接、更容易执行。

具体包括:

1. 第一行直接给出动作
2. 多步任务使用编号
3. 每轮说明当前进度
4. 给出具体时间和数量
5. 一次最多列出 5 项
6. 只保留当前需要的信息
7. 主动压制跑题和扩展建议
8. 明确告诉用户下一步做什么
9. 删除客套开场和重复总结
10. 避免「希望有帮助」等无效收尾

项目目前在 GitHub 已获约 1100 个 Star。它不会提升 Claude 的推理能力,本质上是一套更严格的输出规范。

GitHub
🤩5👍2
Kimi K3上线48小时逼近算力极限,个人会员暂停开放

Kimi 宣布即日起暂停个人新用户订阅。Kimi K3 发布后,过去 48 小时的请求量大幅超出预估,现有算力集群已接近承载极限。

现有会员权益不受影响。Kimi 会把当前算力优先留给已订阅用户,并加快扩容。新算力到位后,再逐步放开会员名额。

Kimi 还会调整会员体系。新用户今后需分别购买 Kimi 主产品权益和 Kimi Code 权益。
😭2👍1
Kimi把Code拆出来单卖,网页加编程最低年费门槛涨228%

Kimi 重做个人会员体系。原本同时包含网页、App 和 Kimi Code 的会员,被拆成通用会员与 Coding Plan。两类功能都要用,今后需要分别付费。

按年付计算,旧 Andante 为 468 元,同时包含网页端权益和基础 Code 额度。新体系最低组合是 Go 加 Starter,共 1536 元。入门门槛变为原来的 3.28 倍,上涨 228%。

纯编程用户的变化更复杂。新 Starter 与旧 Moderato 都是每月 99 元,但不再包含网页和 App 权益。需要高速版和 100 万上下文时,月付门槛则从旧 Allegretto 的 199 元升至新 Explorer 的 299 元,上涨约 50%。

Kimi 称,新 Code 套餐取消月总额度上限,同价位可用 Token 更多。但官方没有公开可直接比较的新旧绝对额度。目前无法判断增加的额度,能否抵消被移除的通用权益和部分档位涨价。

老套餐不会被强制迁移。现有用户可以继续使用和自动续订。对仍持有旧套餐的人,暂时没有明显理由主动切换。
👎6😁3
Kimi紧急安抚新老用户:旧套餐可恢复续费,新套餐重新调整

Kimi 在用户群进一步回应套餐调整争议。老用户除了可以继续使用和自动续费,今后即使曾手动关闭续费,也能重新订阅旧套餐。

旧套餐还将支持内部升级。例如,199 元档用户可以升至 699 元档。不过,恢复续费和旧套餐升级功能仍在开发,暂时还不能直接操作。

新套餐则继续暂停销售。Kimi 承认此前解释不清,产品界面也不完善,将根据用户反馈重新调整方案。受算力限制,具体开放时间仍未确定。
1
商业模型看到黑客日志就拒答,GLM-5.2直接把全过程扒了出来

Hugging Face 遭到自主 AI Agent 入侵。攻击者利用恶意数据集执行代码,窃取凭证,并进入多个内部集群。

攻击过程包含数万次自动操作,留下超过 1.7 万条记录。Hugging Face 用 AI 在几小时内还原了攻击时间线。

但商业前沿模型拒绝分析真实攻击命令和漏洞载荷,因为这些内容触发了安全限制。

Hugging Face 最后在本地部署开放权重模型 GLM-5.2,才完成安全取证。攻击数据和相关凭证也没有离开内部环境。

目前漏洞已修复,受影响凭证也已撤销。公开模型、数据集和 Spaces 暂未发现被篡改,客户数据是否受影响仍在调查。

Hugging Face
🔥6
把图片变成3D的Meshy完成近4亿美元融资,估值突破百亿人民币

AI 3D 公司 Meshy 已完成近 4 亿美元 B 轮融资,投后估值超过 100 亿元人民币。Meshy 能把文字或图片生成可编辑、可打印的 3D 模型。

本轮由 IDG 资本、经纬中国、Monolith 砺思资本等参与。Granite Asia、红杉中国、BAI 资本和源码资本等老股东继续跟投。

融资背后已有收入支撑。36氪此前披露,Meshy 4 月的年度经常性收入已超过 4000 万美元。官网显示,平台用户超过 1000 万,累计生成 3D 模型超过 1 亿个。

Meshy 下一步准备从「生成 3D 资产」扩展到「实时生成玩法」。公司已成立 Meshy Labs,并展示首款 AI 原生游戏《Black Box: Infinite Arsenal》。玩家组合道具后,AI 会实时生成新的武器和技能,再交给传统游戏引擎执行。

极客公园
🆒1
Gary Marcus:没政府救场,OpenAI和Anthropic可能都要完

知名 AI 专家、认知科学家 Gary Marcus 再度唱空 OpenAI 和 Anthropic。他称,如果没有政府干预,两家公司「大概率都要完」。如果它们无法稳定盈利,纳税人没有义务出钱救场。

这并非 Marcus 第一次做出类似判断。他早在 2024 年就预言生成式 AI 泡沫即将破裂,但对破裂时间的预测至今没有兑现。

Marcus 这次把压力归因于中国模型崛起、企业开始控制 token 消耗,以及两家公司难以用现有盈利能力支撑近万亿美元估值。

他的担忧并非毫无依据。OpenAI 第一季度收入 57 亿美元,却消耗了 37 亿美元现金。与此同时,Kimi K3 等中国模型正以更低价格逼近美国顶级闭源模型。

Gary Marcus
👎2
动察Beating AI News
DeepSeek V4正式版定档7月中旬上线,引入峰谷双倍定价 DeepSeek 官方宣布 DeepSeek V4 正式版计划于 7 月中旬上线,并同步引入峰谷定价机制。在北京时间每日 9:00 至 12:00 以及 14:00 至 18:00 的高峰时段,API 计费价格将调整为平日的 2 倍。 在新定价机制下,高性能模型 deepseek-v4-pro 的平日每百万 tokens 输入缓存命中价格为 0.025 元,缓存未命中为 3.00 元,输出为 6.00 元。高峰时段,三项价格将分别上调至 0.05…
DeepSeek版Claude Code要来了,Harness将与V4正式版同步发布

网友提供的群聊截图显示,DeepSeek Harness 团队计划把首款 Harness 产品与 V4 正式版一同发布。它是一款代码智能体产品,内部对标 Claude Code,负责让模型读写文件、调用工具、执行命令,并持续完成工程任务。

DeepSeek 此前宣布,V4 正式版计划于 7 月中旬上线,并同步启用峰谷定价。现在已是 7 月 20 日,原定时间窗口已经过去。如果计划没有再次调整,V4 和 Harness 都已进入发布倒计时。

DeepSeek 过去主要让开发者把 V4 接入 Claude Code、OpenCode 等第三方工具,这次终于要自己下场抢代码 Agent 的产品入口。
👍5