动察Beating AI News
3.12K subscribers
865 photos
2 videos
3.36K links
AI新闻信息流
Download Telegram
动察Beating AI News
MiniMax发布全模态生成模型H3,一个模型包办图片、视频和声音 MiniMax 发布全模态生成模型 H3。它能同时理解文字、图片、视频和声音,再按一条自然语言指令生成或编辑视频。 用户可以让 H3 照着一段视频学镜头运动,使用另一张图中的人物,再参考第三段音频的声音。过去需要分别调用的动作迁移、人物参考、声音参考和视频编辑,现在可以放进同一次任务。 H3 最长可生成 15 秒视频,支持 2K 分辨率和原生双声道声音。官方 API 的 2K 价格为每秒 0.13 美元,生成一段 15 秒视频约需 1.95…
MiniMax H3拿下视频编辑第一,文生和图生视频均排第二

第三方评测机构 Artificial Analysis 公布 MiniMax H3 的视频榜单成绩。H3 在带声音的视频编辑中排名第一,Elo 得分为 1130,谷歌 Gemini Omni Flash 以 1121 分排名第二。

在带声音的文生视频榜单中,H3 以 1242 分排名第二,只比 Gemini Omni Flash 少 3 分。两款模型的置信区间重叠,实际表现可以视为同一梯队。

H3 在无声音的图生视频中同样排名第二,得分为 1351。它落后谷歌 Gemini Omni Flash,但超过字节跳动 Seedance 2.0。

这些排名来自匿名用户盲选。用户查看相同输入生成的视频,再选出更喜欢的一条,因此主要反映观看者的综合偏好,不等同于客观画质或指令遵循测试。

Artificial Analysis
2
从豆包到芯片,字节跳动想借AI再造一个自己

字节跳动正把抖音和 TikTok 赚来的钱,大规模投向 AI。豆包只是入口,公司还在同时做基础模型、视频生成、企业云、海外数据中心和自研芯片。

豆包月活已达 3.24 亿。基础模型团队 Seed 扩至约 2000 人,火山引擎占中国 AI 云服务收入的 16%,排名第二。字节还在五个国家推进数据中心,并研发内部使用的推理芯片。

字节过去靠算法分发内容、出售广告赚钱。现在,它想把模型、应用、云和芯片全部做在自己手里,从流量平台变成一家全栈 AI 公司。

FT
🔥2
字节AI年化收入冲到40亿美元,位居中国AI公司第一

《南华早报》援引知情人士称,字节跳动大模型业务的年化经常性收入已达到 40 亿美元,按目前公开数据位居中国 AI 公司第一。

作为对比,阿里目前约为 15 亿美元,智谱约为 10 亿美元,DeepSeek 接近 5 亿美元,月之暗面约为 3 亿美元。字节已经明显拉开与国内同行的收入差距。

不过,ARR 是按当前收入速度推算未来一年,不等于已经赚到 40 亿美元。字节的 AI 收入也仍远低于 OpenAI 和 Anthropic。

SCMP
1
动察Beating AI News
特斯拉中国车机语音大模型服务完成备案,将接入豆包与DeepSeek 网信上海公布,特斯拉(上海)有限公司的「车机语音大模型服务」于 4 月 20 日完成生成式人工智能服务备案。 特斯拉中国官网此前发布的《特斯拉车机语音助手使用条款》已披露分工方案:Model Y L 车型将搭载豆包大模型与 DeepSeek 模型,均通过火山引擎加密 API 接入。豆包负责语音命令,覆盖导航设定、媒体播放、空调温度调节和车主手册查询;DeepSeek 负责 AI 互动,用于闲聊、查询新闻与天气等场景。 备案完成意味着合规流程已走通,但具体…
特斯拉中国补上AI语音,豆包正式上车

特斯拉中国开始分批推送 2026.14.13 版本。Model S、Model 3、Model X 和 Model Y 均将接入豆包大模型语音助手。

新版助手能查询实时信息,也能连续自然对话。用户还可以选择不同音色,以及「万事通」「音乐爱好者」「故事会」等角色。

特斯拉去年就披露,计划让豆包处理车控指令,让 DeepSeek 负责开放问答。今年 4 月,相关语音服务已在上海完成备案。不过,这次更新说明只点名豆包,尚未确认 DeepSeek 是否同步开放。

这项功能需要开通高级车载娱乐服务,官方价格为每月 9.99 元。

IT 之家
🤡6
Claude做安全测试误黑3家公司,还把恶意软件上传到公共软件库PyPI

Anthropic 披露,Claude 在网络安全测试中意外连上公网,并侵入三家真实公司的生产系统。事故涉及 Claude Opus 4.7、Mythos 5 和一款内部研究模型,最早发生在 4 月。

最严重的一次,Opus 4.7 把一家同名真实公司当成虚构目标。它拿到应用和基础设施凭证,还进入了一个存有数百行生产数据的数据库。模型后来发现目标可能是真实系统,但仍继续攻击。

Mythos 5 则自行制作恶意 Python 包,并上传到公共软件库 PyPI。软件包公开约一小时,被 15 台真实设备下载运行。一家安全公司的扫描器中招,Claude 随后盗取凭证并进入更多系统。

另一款内部模型还扫描了约 9000 个目标,最终攻入一家公司的应用。不过,它确认目标属于真实公司后自行停手。

Anthropic 是在 OpenAI 披露 Hugging Face 事故后,回查 14.1 万次测试才发现问题。两家受影响机构此前毫不知情。Anthropic 认为,这更接近测试隔离和监控失效,不是模型主动逃逸。

Anthropic
🤡4
动察Beating AI News
半年暴赚439%遭杠杆反噬,24岁前OpenAI研究员的200亿美元AI基金开始筹集新资金 《金融时报》援引知情人士称,24岁前 OpenAI 研究员 Leopold Aschenbrenner 创办的对冲基金 Situational Awareness,近期开始向现有投资人和贷款方筹集新资金。该基金规模约 200 亿美元,集中押注 AI 相关股票。基金还向部分投资人提出直接购买其持仓资产的方案。 Situational Awareness 截至 6 月底的年内净回报高达 439%。这轮上涨借助借款放大,AI…
半年暴赚439%的AI基金遭反噬,Citadel接手大部分股票仓位

24 岁前 OpenAI 研究员 Leopold Aschenbrenner 管理的 Situational Awareness,在 AI 股票大跌后,将大部分公开股票卖给 Citadel。基金交易前约有 160 亿美元公开股票,重仓 SK 海力士、CoreWeave、Nebius 等 AI 产业链公司。

基金此前借钱放大仓位。市场反转后,它需要追加资金或出售资产,最终选择减仓。CNBC 称基金清空了公开股票,路透社和《华尔街日报》则称出售大部分仓位。

Citadel 主要接手由经纪商借款融资的股票。交易后,基金仍有约 100 亿美元资产,包括部分由客户本金持有的公开股票,以及 Anthropic 等公司的私募股权。

WSJ
🤡3
亚马逊营收破2000亿美元,AWS增速创18季新高

亚马逊发布 2026 年第二季度财报。季度营收达到 2006 亿美元,同比增长 20%;营业利润为 275 亿美元,同比增长 43%。营收超过市场预期。

AWS 营收达到 422 亿美元,同比增长 37%,创 18 个季度以来最快增速。市场此前预计增长约 31%。AWS 营业利润增长 64% 至 166 亿美元。

亚马逊净利润增至 626 亿美元,但其中包含 534 亿美元税前投资收益,主要来自 Anthropic 持股升值。

亚马逊还把今年资本开支计划从 2000 亿美元上调至 2200 亿美元。过去 12 个月自由现金流从正 182 亿美元降至负 76 亿美元,主要因为 AI 相关设备投入增加。财报发布后,亚马逊股价盘后一度上涨近 9%。

亚马逊
🤡2
四大科技巨头今年最多砸7450亿美元,AI开始比谁先赚钱

按最新指引上限计算,微软、谷歌、亚马逊和 Meta 今年的资本开支合计可达 7450 亿美元。资金主要投向芯片、服务器、数据中心和网络,AI 竞争正从模型能力转向算力规模和商业回报。

最先见到收入的是云服务。Azure、AWS 和 Google Cloud 收入分别增长 43%、37% 和 82%。亚马逊称,生成式 AI 服务和自研芯片业务的年化收入都已超过 250 亿美元。

微软还把 AI 卖成了企业软件。Microsoft 365 Copilot 付费席位超过 3000 万,净新增席位环比翻倍。Meta 的广告收入增长 27%,但季度资本开支达到 311 亿美元,自由现金流只剩 7.84 亿美元。它的 AI 投入目前仍主要依靠广告业务回收。

市场并不反对科技巨头继续加码 AI,但开始细看投入后的现金回报。微软和亚马逊财报后股价上涨;Alphabet 虽然云业务大幅增长,但资本开支和现金流引发担忧;Meta 则同时面对利润下滑、现金流锐减和 AI 支出上升,财报后跌幅更大。
👍1
动察Beating AI News
Seedance 2.5定档7月初,单视频生成长度可达30秒 字节跳动在 6 月 23 日的火山引擎 FORCE 大会上展示了视频生成模型 Seedance 2.5。Seedance 2.5 预计 7 月初正式发布,最主要的升级是单段原生视频直出时长翻倍到了 30 秒,并支持同时导入 50 个全模态参考素材,以解决视频生成中角色和产品细节容易走样变形的痛点。Seedance 2.5 还支持局部画面微调,在修改细节时不会影响视频的其余部分。 在 Seedance 2.5 中,火山引擎还与专业导演共创,在…
字节紧随MiniMax H3发布Seedance 2.5:单次生成30秒,最多塞进50份参考素材

字节跳动 Seed 团队发布视频模型 Seedance 2.5。它延续文字、图片、视频和声音联合输入的架构,单次生成时长从 15 秒提高到 30 秒,并支持继续延长视频。

模型可以在 30 秒内安排多个镜头和完整情节。用户还能基于已有结果反复续写,并尽量保持人物、场景、声音和叙事节奏一致,最终拼成数分钟视频。

Seedance 2.5 一次最多可输入 30 张图片、10 段视频和 10 段音频。

新模型还支持按时间戳控制和修改视频。用户可以指定某几秒出现什么动作、切换什么镜头,也能只调整人物、声音或运镜,不必整段重做。

Seedance 2.5 正在陆续上线即梦 AI 和豆包专业版,API 将在近期接入火山方舟。

字节跳动
动察Beating AI News
DeepSeek V4正式版疑似延期至8月,或直接撞上下一代模型集中发布 DeepSeek V4 正式版(V4 GA)可能推迟到 8 月中旬发布。 网友爆料称,DeepSeek 即将为自研 Harness 工具启动封闭测试,并从问卷参与者中挑选少量用户。封闭测试结束后约 1 至 2 周会开放 V4 GA,发布时间可能在 8 月 10 日至 20 日之间。 如果消息属实,DeepSeek V4 正式版上线时可能会面对更强竞争。届时 GPT-6、Claude Fable 5.1、GLM-5.5 等下一代模型可能已经进入市场。…
DeepSeek-V4-Flash正式版发布,V4-Pro还得等

DeepSeek 发布 V4-Flash 正式版 API,重点提升编程、工具调用和长任务执行能力。官方称,多项 Agent 基准成绩大幅超过此前的 V4-Pro-Preview。

新版本原生支持 Responses API,并针对 Codex 做了适配。模型结构和参数规模没有变化,主要重新进行了后训练。

本次只升级 API 接口,DeepSeek App 和网页端没有更新。V4-Pro 正式版仍未发布,官方称将尽快上线。

DeepSeek
🐳121
动察Beating AI News
DeepSeek-V4-Flash正式版发布,V4-Pro还得等 DeepSeek 发布 V4-Flash 正式版 API,重点提升编程、工具调用和长任务执行能力。官方称,多项 Agent 基准成绩大幅超过此前的 V4-Pro-Preview。 新版本原生支持 Responses API,并针对 Codex 做了适配。模型结构和参数规模没有变化,主要重新进行了后训练。 本次只升级 API 接口,DeepSeek App 和网页端没有更新。V4-Pro 正式版仍未发布,官方称将尽快上线。 DeepSeek
旧Pro仅8分,DeepSeek-V4-Flash在DeepSWE冲到54.4分接近Opus 4.8

在长程软件工程基准 DeepSWE 上,DeepSeek-V4-Flash 正式版拿到 54.4 分,接近 Claude Opus 4.8 的 59 分,远高于 V4-Pro-Preview 此前的 8 分。

这个成绩低于 Kimi K3 的 69 分,但高于 GLM-5.2 的 44 分,已进入国产模型第一梯队。

不过,这不是完全相同条件下的模型裸测。正式版 V4-Flash 使用 DeepSeek 自己尚未发布的 Harness 极简模式,Agent 成绩会同时受到模型和执行框架影响。
🐳6👍2🤔1
智谱Coding Plan改成积分制,新用户月费最高涨261%

智谱上线新版 GLM Coding Plan,并放开全量订阅。

此前旧版套餐由于供不应求一直限售,仅每天上午 10 点限量放出名额。

新版 Lite、Pro、Max 月费分别为 118 元、538 元和 1078 元。旧版 V2 分别为 49 元、149 元和 469 元。按月费计算,三档分别上涨约 141%、261% 和 130%。

涨价是否伴随额度提升仍无法知晓。旧版按每 5 小时和每周的 prompt 次数限额;新版把输入、输出、缓存命中 Token 和 MCP 调用统一折算成积分,三档每周分别提供 1 万、6 万和 14 万积分。

V2 个人套餐和团队套餐继续按原价使用、续订和升档。V1 用户可在套餐到期前,按旧版 V2 价格购买,购买入口预计 8 月中旬上线。

智谱
🤡11😁2
蔡浩宇AI创业生变:陪伴产品停运,身份改为独立Agent开发者

米哈游联合创始人蔡浩宇更新领英,将在 AI 公司 Anuttacon 的履历截止到今年 7 月。新身份是「独立大模型与 Agent 开发者」,工作地点仍在新加坡。

同期,Anuttacon 旗下 AI 陪伴产品 AnuNeko 已永久停运。团队称规模有限,需要把资源投入其他方向。

此前媒体报道称,Anuttacon 已压缩音频和视频团队,裁撤北美大模型团队,将研发重心转向国内的大模型和 Agent。多名核心研究人员也已加入 OpenAI、Microsoft AI 和通义实验室。

不过,Anuttacon 尚未宣布关闭,官网、招聘页面和 AI 游戏《Whispers from the Star》仍在运行。

蔡浩宇领英
👎1
动察Beating AI News
OpenAI前CTO新公司开源首个模型Inkling,架构借鉴DeepSeek-V3 OpenAI 前 CTO Mira Murati 创办的 Thinking Machines Lab,发布首个通用模型 Inkling。模型总参数 9750 亿,每次激活 410 亿,支持文本、图像和音频,最长上下文为 100 万 token。 Inkling 从零训练,但 MoE 架构主要参考 DeepSeek-V3。后训练初期还使用了 Kimi K2.5 等开放模型生成的数据。完整权重已上架 Hugging Face,采用…
前OpenAI CTO新模型Inkling-Small开源:参数不到Inkling三成,性能只差1分

OpenAI 前 CTO Mira Murati 创办的 Thinking Machines Lab 发布 Inkling-Small,并开放完整权重。这是一款多模态推理模型,支持文字、图片和音频输入。和 Inkling 一样,模型采用 Apache 2.0 许可证。

Inkling-Small 共有 2760 亿参数,每次激活 120 亿。Inkling 则有 9750 亿总参数,激活 410 亿。Artificial Analysis 的智能指数中,两者分别为 40 分和 41 分。

更小的模型在部分任务上反而更强。官方公布的测试中,它在 SWE-bench Verified、HLE 等编程和推理评测超过 Inkling。不过,Inkling 的知识覆盖和事实准确性更好。

Inkling-Small 的输出价为每 100 万 Token 1.20 美元,比 Inkling 便宜约 70%。完整权重已上传 Hugging Face,但官方量化权重仍有 171GB,普通消费级显卡无法完整装下。

Thinking Machines
AI写论文终于不能瞎编了,谷歌给每个结论都配上证据

谷歌推出 Science One,一套让 AI 自动做科研并保留完整证据的系统。它能查论文、设计方案、运行实验和撰写论文。

现在的 AI 科研系统经常会编造引用,论文里写的方法也可能和实际代码不一致。Science One 会给每个结论绑定出处、代码和实验记录。证据对不上,这句话就会被修改或删除。

谷歌让 5 套系统使用同一个 Gemini 3.1 Pro,在 5 项任务上共写了 75 篇论文。Science One 生成的 337 条引用全部真实,12 项可复现实验的结果全部对上,15 篇论文中有 14 篇与实际代码一致。其他系统的虚构引用率最高达到 20.9%。

谷歌
1
动察Beating AI News
旧Pro仅8分,DeepSeek-V4-Flash在DeepSWE冲到54.4分接近Opus 4.8 在长程软件工程基准 DeepSWE 上,DeepSeek-V4-Flash 正式版拿到 54.4 分,接近 Claude Opus 4.8 的 59 分,远高于 V4-Pro-Preview 此前的 8 分。 这个成绩低于 Kimi K3 的 69 分,但高于 GLM-5.2 的 44 分,已进入国产模型第一梯队。 不过,这不是完全相同条件下的模型裸测。正式版 V4-Flash 使用 DeepSeek…
DeepSeek-V4-Flash单题约3美分,冲上模型性价比前沿

Artificial Analysis 最新评测中,DeepSeek-V4-Flash 正式版的智能指数达到约 50 分。按 DeepSeek 官方 API 和约 99% 的缓存命中率计算,平均每项任务成本约为 0.03 美元。

它因此进入智能与成本的「帕累托前沿」:在所有测试模型中,几乎找不到一个既比它更强、又比它更便宜的模型。

想获得更高能力,成本通常会明显上涨。想把价格压得更低,模型能力又会下降。DeepSeek-V4-Flash 目前正卡在两者最划算的交界线上。

Artificial Analysis
👍62
推理引擎WASTE开源:把Kimi K3完整跑进64GB MacBook

边缘数据库公司 SQLite AI 开源推理引擎 WASTE。它让保留全部层和专家的 Kimi K3,能在一台 64GB MacBook Pro 上运行。转换后的模型约占 1TB,速度为每秒 0.49 至 0.54 个 Token。

WASTE 把约 27GB 的模型主干留在内存。8 万多个专家放在内置 SSD。每生成一个 Token,只从硬盘读取当前调用的专家。

这个版本没有蒸馏、裁剪或删除专家。WASTE 将原本采用 MXFP4 的专家权重重新量化到 3-bit,并把模型主干压成 4-bit 和 8-bit。

GitHub 仓库
5
模型自称Claude不等于蒸馏,1000条回答就能让Qwen认错自己

研究者 Ziqian Zhong 让 Claude、GPT-4o 等模型回答 1000 个普通问题,再删掉其中所有模型名和公司名。他随后用这些问答材料微调 Qwen、DeepSeek 等开源模型。

训练后,部分模型开始认错自己的身份。Qwen3.5-397B-A17B 原本只有 0.6% 的回答自称 Claude。用 Claude 的回答训练一轮后,这一比例升至 40.3%。

Ziqian Zhong 的解释是,这些模型在预训练时看过大量 Claude 的对话和介绍,已经把某些表达习惯与「Claude」联系起来。微调让 Qwen 学会了这种说话方式,被问到身份时,也更容易回答自己是 Claude。

为验证这一点,他用 GPT-4.1-mini 把 Claude 的回答改成粗糙的简单句,回答内容基本不变,但语气和排版不再像 Claude。再用这批材料微调后,3 个模型中有 2 个几乎不再自称 Claude,说明语言风格是身份转移的主要原因。

类似现象此前已经有论文研究过。2025 年的《Subliminal Learning》发现,模型会从训练数据中继承另一个模型的偏好和行为。

因此,模型自称 Claude,并不能直接证明它接受过 Claude 蒸馏。它也可能只是学会了 Claude 的表达方式,再把这种风格和「自己是谁」联系到了一起。

Ziqian Zhong
👍31😁1
千问新语音识别模型发布:医疗术语召回率达95.36%

阿里发布 Qwen-Audio-3.0-ASR-Flash 语音识别模型。它能结合上下文理解讲话内容,重点提升医学、工业等专业术语的识别能力。

用户可以添加自定义热词,帮助模型听准药品名、设备名和行业缩写。模型还能修正口语表达,自动整理出带标点和结构的文字稿。

官方内部测试中,医疗术语召回率达到 95.36%,工业术语达到 93.24%。该系列提供实时流式、录音文件和非实时识别三种接口。

Qwen