动察Beating AI News
DeepSeek V4正式版疑似延期至8月,或直接撞上下一代模型集中发布 DeepSeek V4 正式版(V4 GA)可能推迟到 8 月中旬发布。 网友爆料称,DeepSeek 即将为自研 Harness 工具启动封闭测试,并从问卷参与者中挑选少量用户。封闭测试结束后约 1 至 2 周会开放 V4 GA,发布时间可能在 8 月 10 日至 20 日之间。 如果消息属实,DeepSeek V4 正式版上线时可能会面对更强竞争。届时 GPT-6、Claude Fable 5.1、GLM-5.5 等下一代模型可能已经进入市场。…
DeepSeek-V4-Flash正式版发布,V4-Pro还得等
DeepSeek 发布 V4-Flash 正式版 API,重点提升编程、工具调用和长任务执行能力。官方称,多项 Agent 基准成绩大幅超过此前的 V4-Pro-Preview。
新版本原生支持 Responses API,并针对 Codex 做了适配。模型结构和参数规模没有变化,主要重新进行了后训练。
本次只升级 API 接口,DeepSeek App 和网页端没有更新。V4-Pro 正式版仍未发布,官方称将尽快上线。
DeepSeek
DeepSeek 发布 V4-Flash 正式版 API,重点提升编程、工具调用和长任务执行能力。官方称,多项 Agent 基准成绩大幅超过此前的 V4-Pro-Preview。
新版本原生支持 Responses API,并针对 Codex 做了适配。模型结构和参数规模没有变化,主要重新进行了后训练。
本次只升级 API 接口,DeepSeek App 和网页端没有更新。V4-Pro 正式版仍未发布,官方称将尽快上线。
DeepSeek
🐳12❤1
动察Beating AI News
DeepSeek-V4-Flash正式版发布,V4-Pro还得等 DeepSeek 发布 V4-Flash 正式版 API,重点提升编程、工具调用和长任务执行能力。官方称,多项 Agent 基准成绩大幅超过此前的 V4-Pro-Preview。 新版本原生支持 Responses API,并针对 Codex 做了适配。模型结构和参数规模没有变化,主要重新进行了后训练。 本次只升级 API 接口,DeepSeek App 和网页端没有更新。V4-Pro 正式版仍未发布,官方称将尽快上线。 DeepSeek
旧Pro仅8分,DeepSeek-V4-Flash在DeepSWE冲到54.4分接近Opus 4.8
在长程软件工程基准 DeepSWE 上,DeepSeek-V4-Flash 正式版拿到 54.4 分,接近 Claude Opus 4.8 的 59 分,远高于 V4-Pro-Preview 此前的 8 分。
这个成绩低于 Kimi K3 的 69 分,但高于 GLM-5.2 的 44 分,已进入国产模型第一梯队。
不过,这不是完全相同条件下的模型裸测。正式版 V4-Flash 使用 DeepSeek 自己尚未发布的 Harness 极简模式,Agent 成绩会同时受到模型和执行框架影响。
在长程软件工程基准 DeepSWE 上,DeepSeek-V4-Flash 正式版拿到 54.4 分,接近 Claude Opus 4.8 的 59 分,远高于 V4-Pro-Preview 此前的 8 分。
这个成绩低于 Kimi K3 的 69 分,但高于 GLM-5.2 的 44 分,已进入国产模型第一梯队。
不过,这不是完全相同条件下的模型裸测。正式版 V4-Flash 使用 DeepSeek 自己尚未发布的 Harness 极简模式,Agent 成绩会同时受到模型和执行框架影响。
🐳6👍2🤔1
智谱Coding Plan改成积分制,新用户月费最高涨261%
智谱上线新版 GLM Coding Plan,并放开全量订阅。
此前旧版套餐由于供不应求一直限售,仅每天上午 10 点限量放出名额。
新版 Lite、Pro、Max 月费分别为 118 元、538 元和 1078 元。旧版 V2 分别为 49 元、149 元和 469 元。按月费计算,三档分别上涨约 141%、261% 和 130%。
涨价是否伴随额度提升仍无法知晓。旧版按每 5 小时和每周的 prompt 次数限额;新版把输入、输出、缓存命中 Token 和 MCP 调用统一折算成积分,三档每周分别提供 1 万、6 万和 14 万积分。
V2 个人套餐和团队套餐继续按原价使用、续订和升档。V1 用户可在套餐到期前,按旧版 V2 价格购买,购买入口预计 8 月中旬上线。
智谱
智谱上线新版 GLM Coding Plan,并放开全量订阅。
此前旧版套餐由于供不应求一直限售,仅每天上午 10 点限量放出名额。
新版 Lite、Pro、Max 月费分别为 118 元、538 元和 1078 元。旧版 V2 分别为 49 元、149 元和 469 元。按月费计算,三档分别上涨约 141%、261% 和 130%。
涨价是否伴随额度提升仍无法知晓。旧版按每 5 小时和每周的 prompt 次数限额;新版把输入、输出、缓存命中 Token 和 MCP 调用统一折算成积分,三档每周分别提供 1 万、6 万和 14 万积分。
V2 个人套餐和团队套餐继续按原价使用、续订和升档。V1 用户可在套餐到期前,按旧版 V2 价格购买,购买入口预计 8 月中旬上线。
智谱
🤡11😁2
蔡浩宇AI创业生变:陪伴产品停运,身份改为独立Agent开发者
米哈游联合创始人蔡浩宇更新领英,将在 AI 公司 Anuttacon 的履历截止到今年 7 月。新身份是「独立大模型与 Agent 开发者」,工作地点仍在新加坡。
同期,Anuttacon 旗下 AI 陪伴产品 AnuNeko 已永久停运。团队称规模有限,需要把资源投入其他方向。
此前媒体报道称,Anuttacon 已压缩音频和视频团队,裁撤北美大模型团队,将研发重心转向国内的大模型和 Agent。多名核心研究人员也已加入 OpenAI、Microsoft AI 和通义实验室。
不过,Anuttacon 尚未宣布关闭,官网、招聘页面和 AI 游戏《Whispers from the Star》仍在运行。
蔡浩宇领英
米哈游联合创始人蔡浩宇更新领英,将在 AI 公司 Anuttacon 的履历截止到今年 7 月。新身份是「独立大模型与 Agent 开发者」,工作地点仍在新加坡。
同期,Anuttacon 旗下 AI 陪伴产品 AnuNeko 已永久停运。团队称规模有限,需要把资源投入其他方向。
此前媒体报道称,Anuttacon 已压缩音频和视频团队,裁撤北美大模型团队,将研发重心转向国内的大模型和 Agent。多名核心研究人员也已加入 OpenAI、Microsoft AI 和通义实验室。
不过,Anuttacon 尚未宣布关闭,官网、招聘页面和 AI 游戏《Whispers from the Star》仍在运行。
蔡浩宇领英
👎1
动察Beating AI News
OpenAI前CTO新公司开源首个模型Inkling,架构借鉴DeepSeek-V3 OpenAI 前 CTO Mira Murati 创办的 Thinking Machines Lab,发布首个通用模型 Inkling。模型总参数 9750 亿,每次激活 410 亿,支持文本、图像和音频,最长上下文为 100 万 token。 Inkling 从零训练,但 MoE 架构主要参考 DeepSeek-V3。后训练初期还使用了 Kimi K2.5 等开放模型生成的数据。完整权重已上架 Hugging Face,采用…
前OpenAI CTO新模型Inkling-Small开源:参数不到Inkling三成,性能只差1分
OpenAI 前 CTO Mira Murati 创办的 Thinking Machines Lab 发布 Inkling-Small,并开放完整权重。这是一款多模态推理模型,支持文字、图片和音频输入。和 Inkling 一样,模型采用 Apache 2.0 许可证。
Inkling-Small 共有 2760 亿参数,每次激活 120 亿。Inkling 则有 9750 亿总参数,激活 410 亿。Artificial Analysis 的智能指数中,两者分别为 40 分和 41 分。
更小的模型在部分任务上反而更强。官方公布的测试中,它在 SWE-bench Verified、HLE 等编程和推理评测超过 Inkling。不过,Inkling 的知识覆盖和事实准确性更好。
Inkling-Small 的输出价为每 100 万 Token 1.20 美元,比 Inkling 便宜约 70%。完整权重已上传 Hugging Face,但官方量化权重仍有 171GB,普通消费级显卡无法完整装下。
Thinking Machines
OpenAI 前 CTO Mira Murati 创办的 Thinking Machines Lab 发布 Inkling-Small,并开放完整权重。这是一款多模态推理模型,支持文字、图片和音频输入。和 Inkling 一样,模型采用 Apache 2.0 许可证。
Inkling-Small 共有 2760 亿参数,每次激活 120 亿。Inkling 则有 9750 亿总参数,激活 410 亿。Artificial Analysis 的智能指数中,两者分别为 40 分和 41 分。
更小的模型在部分任务上反而更强。官方公布的测试中,它在 SWE-bench Verified、HLE 等编程和推理评测超过 Inkling。不过,Inkling 的知识覆盖和事实准确性更好。
Inkling-Small 的输出价为每 100 万 Token 1.20 美元,比 Inkling 便宜约 70%。完整权重已上传 Hugging Face,但官方量化权重仍有 171GB,普通消费级显卡无法完整装下。
Thinking Machines
Thinking Machines Lab
Introducing Inkling-Small
An open-weights model that matches Inkling at a quarter of the size: multimodal, Mixture-of-Experts, with controllable reasoning effort. Fine-tune it on Tinker.
AI写论文终于不能瞎编了,谷歌给每个结论都配上证据
谷歌推出 Science One,一套让 AI 自动做科研并保留完整证据的系统。它能查论文、设计方案、运行实验和撰写论文。
现在的 AI 科研系统经常会编造引用,论文里写的方法也可能和实际代码不一致。Science One 会给每个结论绑定出处、代码和实验记录。证据对不上,这句话就会被修改或删除。
谷歌让 5 套系统使用同一个 Gemini 3.1 Pro,在 5 项任务上共写了 75 篇论文。Science One 生成的 337 条引用全部真实,12 项可复现实验的结果全部对上,15 篇论文中有 14 篇与实际代码一致。其他系统的虚构引用率最高达到 20.9%。
谷歌
谷歌推出 Science One,一套让 AI 自动做科研并保留完整证据的系统。它能查论文、设计方案、运行实验和撰写论文。
现在的 AI 科研系统经常会编造引用,论文里写的方法也可能和实际代码不一致。Science One 会给每个结论绑定出处、代码和实验记录。证据对不上,这句话就会被修改或删除。
谷歌让 5 套系统使用同一个 Gemini 3.1 Pro,在 5 项任务上共写了 75 篇论文。Science One 生成的 337 条引用全部真实,12 项可复现实验的结果全部对上,15 篇论文中有 14 篇与实际代码一致。其他系统的虚构引用率最高达到 20.9%。
谷歌
Google Research
Science One Framework: A verifiable autonomous research framework via Chain-of-Evidence
Introducing the Science One Framework, an experimental research prototype designed to eliminate hallucinations by natively building verifiable evidence chains, and CoE Audit, an automated protocol to evaluate the integrity of AI-generated papers.
❤1
动察Beating AI News
旧Pro仅8分,DeepSeek-V4-Flash在DeepSWE冲到54.4分接近Opus 4.8 在长程软件工程基准 DeepSWE 上,DeepSeek-V4-Flash 正式版拿到 54.4 分,接近 Claude Opus 4.8 的 59 分,远高于 V4-Pro-Preview 此前的 8 分。 这个成绩低于 Kimi K3 的 69 分,但高于 GLM-5.2 的 44 分,已进入国产模型第一梯队。 不过,这不是完全相同条件下的模型裸测。正式版 V4-Flash 使用 DeepSeek…
DeepSeek-V4-Flash单题约3美分,冲上模型性价比前沿
Artificial Analysis 最新评测中,DeepSeek-V4-Flash 正式版的智能指数达到约 50 分。按 DeepSeek 官方 API 和约 99% 的缓存命中率计算,平均每项任务成本约为 0.03 美元。
它因此进入智能与成本的「帕累托前沿」:在所有测试模型中,几乎找不到一个既比它更强、又比它更便宜的模型。
想获得更高能力,成本通常会明显上涨。想把价格压得更低,模型能力又会下降。DeepSeek-V4-Flash 目前正卡在两者最划算的交界线上。
Artificial Analysis
Artificial Analysis 最新评测中,DeepSeek-V4-Flash 正式版的智能指数达到约 50 分。按 DeepSeek 官方 API 和约 99% 的缓存命中率计算,平均每项任务成本约为 0.03 美元。
它因此进入智能与成本的「帕累托前沿」:在所有测试模型中,几乎找不到一个既比它更强、又比它更便宜的模型。
想获得更高能力,成本通常会明显上涨。想把价格压得更低,模型能力又会下降。DeepSeek-V4-Flash 目前正卡在两者最划算的交界线上。
Artificial Analysis
👍6❤2
推理引擎WASTE开源:把Kimi K3完整跑进64GB MacBook
边缘数据库公司 SQLite AI 开源推理引擎 WASTE。它让保留全部层和专家的 Kimi K3,能在一台 64GB MacBook Pro 上运行。转换后的模型约占 1TB,速度为每秒 0.49 至 0.54 个 Token。
WASTE 把约 27GB 的模型主干留在内存。8 万多个专家放在内置 SSD。每生成一个 Token,只从硬盘读取当前调用的专家。
这个版本没有蒸馏、裁剪或删除专家。WASTE 将原本采用 MXFP4 的专家权重重新量化到 3-bit,并把模型主干压成 4-bit 和 8-bit。
GitHub 仓库
边缘数据库公司 SQLite AI 开源推理引擎 WASTE。它让保留全部层和专家的 Kimi K3,能在一台 64GB MacBook Pro 上运行。转换后的模型约占 1TB,速度为每秒 0.49 至 0.54 个 Token。
WASTE 把约 27GB 的模型主干留在内存。8 万多个专家放在内置 SSD。每生成一个 Token,只从硬盘读取当前调用的专家。
这个版本没有蒸馏、裁剪或删除专家。WASTE 将原本采用 MXFP4 的专家权重重新量化到 3-bit,并把模型主干压成 4-bit 和 8-bit。
GitHub 仓库
GitHub
GitHub - sqliteai/waste: Run the full 2.78-trillion-parameter Kimi K3 model beyond available RAM by streaming activated weights…
Run the full 2.78-trillion-parameter Kimi K3 model beyond available RAM by streaming activated weights directly from NVMe. A dependency-free, embeddable C inference engine. - sqliteai/waste
❤5
模型自称Claude不等于蒸馏,1000条回答就能让Qwen认错自己
研究者 Ziqian Zhong 让 Claude、GPT-4o 等模型回答 1000 个普通问题,再删掉其中所有模型名和公司名。他随后用这些问答材料微调 Qwen、DeepSeek 等开源模型。
训练后,部分模型开始认错自己的身份。Qwen3.5-397B-A17B 原本只有 0.6% 的回答自称 Claude。用 Claude 的回答训练一轮后,这一比例升至 40.3%。
Ziqian Zhong 的解释是,这些模型在预训练时看过大量 Claude 的对话和介绍,已经把某些表达习惯与「Claude」联系起来。微调让 Qwen 学会了这种说话方式,被问到身份时,也更容易回答自己是 Claude。
为验证这一点,他用 GPT-4.1-mini 把 Claude 的回答改成粗糙的简单句,回答内容基本不变,但语气和排版不再像 Claude。再用这批材料微调后,3 个模型中有 2 个几乎不再自称 Claude,说明语言风格是身份转移的主要原因。
类似现象此前已经有论文研究过。2025 年的《Subliminal Learning》发现,模型会从训练数据中继承另一个模型的偏好和行为。
因此,模型自称 Claude,并不能直接证明它接受过 Claude 蒸馏。它也可能只是学会了 Claude 的表达方式,再把这种风格和「自己是谁」联系到了一起。
Ziqian Zhong
研究者 Ziqian Zhong 让 Claude、GPT-4o 等模型回答 1000 个普通问题,再删掉其中所有模型名和公司名。他随后用这些问答材料微调 Qwen、DeepSeek 等开源模型。
训练后,部分模型开始认错自己的身份。Qwen3.5-397B-A17B 原本只有 0.6% 的回答自称 Claude。用 Claude 的回答训练一轮后,这一比例升至 40.3%。
Ziqian Zhong 的解释是,这些模型在预训练时看过大量 Claude 的对话和介绍,已经把某些表达习惯与「Claude」联系起来。微调让 Qwen 学会了这种说话方式,被问到身份时,也更容易回答自己是 Claude。
为验证这一点,他用 GPT-4.1-mini 把 Claude 的回答改成粗糙的简单句,回答内容基本不变,但语气和排版不再像 Claude。再用这批材料微调后,3 个模型中有 2 个几乎不再自称 Claude,说明语言风格是身份转移的主要原因。
类似现象此前已经有论文研究过。2025 年的《Subliminal Learning》发现,模型会从训练数据中继承另一个模型的偏好和行为。
因此,模型自称 Claude,并不能直接证明它接受过 Claude 蒸馏。它也可能只是学会了 Claude 的表达方式,再把这种风格和「自己是谁」联系到了一起。
Ziqian Zhong
👍3❤1😁1
千问新语音识别模型发布:医疗术语召回率达95.36%
阿里发布 Qwen-Audio-3.0-ASR-Flash 语音识别模型。它能结合上下文理解讲话内容,重点提升医学、工业等专业术语的识别能力。
用户可以添加自定义热词,帮助模型听准药品名、设备名和行业缩写。模型还能修正口语表达,自动整理出带标点和结构的文字稿。
官方内部测试中,医疗术语召回率达到 95.36%,工业术语达到 93.24%。该系列提供实时流式、录音文件和非实时识别三种接口。
Qwen
阿里发布 Qwen-Audio-3.0-ASR-Flash 语音识别模型。它能结合上下文理解讲话内容,重点提升医学、工业等专业术语的识别能力。
用户可以添加自定义热词,帮助模型听准药品名、设备名和行业缩写。模型还能修正口语表达,自动整理出带标点和结构的文字稿。
官方内部测试中,医疗术语召回率达到 95.36%,工业术语达到 93.24%。该系列提供实时流式、录音文件和非实时识别三种接口。
Qwen
动察Beating AI News
半年暴赚439%的AI基金遭反噬,Citadel接手大部分股票仓位 24 岁前 OpenAI 研究员 Leopold Aschenbrenner 管理的 Situational Awareness,在 AI 股票大跌后,将大部分公开股票卖给 Citadel。基金交易前约有 160 亿美元公开股票,重仓 SK 海力士、CoreWeave、Nebius 等 AI 产业链公司。 基金此前借钱放大仓位。市场反转后,它需要追加资金或出售资产,最终选择减仓。CNBC 称基金清空了公开股票,路透社和《华尔街日报》则称出售大部分仓位。…
刚刚上百亿美元被清仓的24岁AI股神Leopold本周末结婚,未婚妻是Anthropic CEO幕僚长
CNBC 援引两名知情人士称,24 岁前 OpenAI 研究员 Leopold Aschenbrenner 将于本周末结婚。未婚妻 Avital Balwit 现任 Anthropic CEO Dario Amodei 的幕僚长。
两人曾在 SBF 创办的 FTX Future Fund 共事。FTX 崩塌后,Leopold 加入 OpenAI,Avital 后来进入 Anthropic。
婚礼前夕,Leopold 的基金刚把大部分股票仓位卖给 Citadel。网友因此调侃,Leopold 忙着结婚,已经离婚的 Citadel 创始人 Ken Griffin 忙着赚钱。
CNBC
CNBC 援引两名知情人士称,24 岁前 OpenAI 研究员 Leopold Aschenbrenner 将于本周末结婚。未婚妻 Avital Balwit 现任 Anthropic CEO Dario Amodei 的幕僚长。
两人曾在 SBF 创办的 FTX Future Fund 共事。FTX 崩塌后,Leopold 加入 OpenAI,Avital 后来进入 Anthropic。
婚礼前夕,Leopold 的基金刚把大部分股票仓位卖给 Citadel。网友因此调侃,Leopold 忙着结婚,已经离婚的 Citadel 创始人 Ken Griffin 忙着赚钱。
CNBC
🤡3