动察Beating AI News
3.74K subscribers
1.47K photos
5 videos
1 file
4.46K links
AI新闻信息流
Download Telegram
PrismML把Qwen3.8 27B压到5.9GB,自测保留98.2%性能

加州理工学院数学家 Babak Hassibi 联合创立的 AI 实验室 PrismML 发布 Ternary Bonsai 2 27B,把 Qwen3.8 27B 的 270 亿参数模型压到 5.9GB。它把权重压成 -1、0、+1 三种值,体积只有 FP16 原版约九分之一。模型支持 26.2 万 Token 上下文、图文输入和 Agent 工具调用,并以 Apache 2.0 许可开放权重。

相比两个月前的第一代 Bonsai 27B,新版体积基本没变,但底模从 Qwen3.6 换成了 Qwen3.8。PrismML 自测称,综合基准成绩相对完整版的保留率从约 95% 提到 98.2%,其中数学和代码成绩已经非常接近原版。官方还演示了它在 RTX 5090 上直接跑 Cline 编程 Agent 和 Computer Use。

信源

动察 Beating 频道 · 动察 Beating 交流群
👍5
清华大学副教授代季峰创办的Naive AI估值冲到14亿美元

清华大学副教授代季峰创办的 AI 公司 Naive AI,估值已超过 14 亿美元。公司成立仅数月,准备发布首个大语言模型,并采用开放权重模式,用户可以免费下载和修改模型。

Naive AI 近期完成 3 轮融资,累计融资约 4 亿美元,投资方包括腾讯、IDG Capital、MPCi 和 HSG。公司目前不到 100 人,但正在开发自己的大模型和 AI Agent。

Naive AI 没有选择从零训练模型,而是在已有开源模型基础上继续优化,通过中训练、后训练和强化学习提升能力。代季峰认为,未来大模型竞争不一定只看谁投入更多算力,也可以通过模型优化和训练方法取得突破。

代季峰是计算机视觉领域知名学者,代表作包括可变形卷积网络和多模态基础模型 InternVL,论文总引用超 5 万次。他曾在微软亚洲研究院任首席研究员,后转任商汤执行研究总监,2022 年回清华任教。2025 年加入陈天桥旗下盛大网络孵化的 AI 公司 MiroMind,任联合发起人。

今年 1 月离职后,代季峰就知识产权使用权和骨干带走问题与 MiroMind 公司谈崩,4 月双方通过《华盛顿邮报》和内部通报公开互相指责,MiroMind 称其「商业诚信违约」并保留法律追诉权。

目前 Naive AI 仍处于低调阶段,官网没有公布具体模型、参数和测试成绩。

信源

动察 Beating 频道 · 动察 Beating 交流群
Kimi暂停订阅两个月后上线新套餐,Code没有拆出去单卖

月之暗面上线新版 Kimi 会员。四档套餐改名为 Go、Plus、Pro 和 Max,年付分别为 468、948、1908 和 6708 元,折合每月 39、79、159 和 559 元。

Kimi Code 没有按照最早公布的方案拆出去单独收费。新版 Plus、Pro 和 Max 仍然包含 Kimi Code,只有最低档 Go 不支持。

Kimi 7 月因 K3 上线后算力紧张暂停新用户订阅,并宣布后续会将 Kimi 主会员和 Kimi Code 分开收费。随后在用户压力下,拆分收费方案基本撤回。

新四档年费与旧 Andante、Moderato、Allegretto、Allegro 完全一致。不过旧套餐的最低档还能用 Kimi Code,现在同价位的 Go 已经取消了这项权益;要用 Code,年付门槛从 468 元升到了 948 元。

动察 Beating 频道 · 动察 Beating 交流群
💩9😁1
阿里Qoder宣布Qwen3.8-Flash模型限时免费用

阿里 Qoder 面向个人用户限时免费开放 Qwen3.8-Flash。模型计费系数从 0.1× 降到 0,活动持续到 9 月 30 日。免费、试用和付费用户都能参加,账号就算没有 Credits,也可以直接选择模型使用,不需要另外领取资格。

免费范围覆盖 Qoder CN、IDE、CLI、JetBrains 插件、Cloud Agents、移动端和网页版,企业订阅暂不参与。活动期间用 Qwen3.8-Flash 不会消耗任何 Credits。

Qoder 同时恢复了每天领取 100 通用 Credits 的活动,每笔额度 30 天有效,结束时间暂未公布。

信源

动察 Beating 频道 · 动察 Beating 交流群
💩7👍3
消息人士:Anthropic年化收入或超千亿美元,最快未来几周公布IPO相关财务文件

据《纽约时报》援引四名知情人士透露,Anthropic 今年年化收入预计将超过 1000 亿美元,高于 7 月时约 650 亿美元的水平。寻求参与 IPO 的投资者正以这一快速增长的数据,支撑公司潜在 2 万亿美元估值。

知情人士称,Anthropic 最快可能在未来几周公布 IPO 相关财务文件,并有望最早于 11 月开始股票交易。不过,相关计划仍可能因投资者情绪和市场波动发生变化。此外,据三名知情人士透露,投资者预计 Anthropic 今年年底可获得约 5 吉瓦计算能力,到明年底这一规模将翻倍,达到与竞争对手 OpenAI 相当的水平。

近期,Anthropic 还在旧金山总部举办投资者活动,约 100 名风险投资机构投资者参加,公司管理层和投行团队也已与潜在 IPO 投资者展开接触。

动察 Beating 频道 · 动察 Beating 交流群
Anthropic终于松口,Claude Code开始兼容AGENTS.md

Anthropic 给 Claude Code 加上了 AGENTS.md 支持。

2.1.277 版本开始,如果项目里没有 CLAUDE.md,Claude Code 会自动读取 AGENTS.md;用户也可以在 /config 里改成两份都读。AGENTS.md 是跨工具通用的项目规则文件,Codex、Cursor、Gemini CLI、GitHub Copilot 等早已支持。

这正是 Shopify CEO Tobi Lütke 八月底公开点名的问题。Shopify 同时用 Claude Code、Codex 等多种 Agent,之前 Claude Code 只认 CLAUDE.md,团队就得维护两套规则。大型代码库里只要某一层漏了同步,不同工具就可能拿到不同规则。Tobi 当时甚至说,正在考虑在 Shopify 禁用 Claude Code。

当时 Claude Code 工程师 Thariq Shihipar 还解释,Anthropic 坚持自己的 CLAUDE.md,是因为不同模型适合不同的 prompt、Skills 和项目指令格式。不到一个月后,Anthropic 已经把 AGENTS.md 支持做成 Claude Code 的内置 Mod,并公开源码。以后开发者还可以基于这套 Mod 自己改项目指令的加载方式。

信源

动察 Beating 频道 · 动察 Beating 交流群
😁6🤡1
消息人士:Anthropic首次公开募股或推迟至美国中期选举后

据路透社报道,三位知情人士透露,在 Anthropic 即将进行 IPO 之前,且在该公司首席执行官呼吁全行业放缓步伐之后,其正考虑推出一款新的人工智能模型,以应对 OpenAI 自推出 GPT-6Astra 以来所形成的势头。

OpenAI 本月发布的 GPT-6Astra 在企业中获得了广泛关注,这引发了部分投资者的担忧。他们向路透表示,正在重新评估 Anthropic 作为企业级 AI 工具领先供应商的地位。一位知情人士称,Anthropic 正在评估其下一代模型的安全性,作为是否发布该模型的考量之一。

了解该公司思路的消息人士称,部分讨论涉及如何在新模型发布投资与提升公司盈利能力之间取得平衡,因为利率上升使得投资者更加关注预期利润的实现时间。另据两位知情人士透露,Anthropic 可能会将首次公开募股(IPO)推迟至 11 月美国中期选举之后,预计选举不会对此次发行产生重大影响。此次 IPO 已较原计划推迟,路透此前曾报道称,路演最早预计将于 10 月中旬开始。

动察 Beating 频道 · 动察 Beating 交流群
Gemini黑进3家公司,模型没越狱,是测试环境误开公网

谷歌确认,Gemini 在一次网络安全评测中误入 3 家真实公司的系统。一家靠猜密码进入,另外两家从公开代码库找到登录凭证。Gemini 判断目标是真实公司后都停了手。整个过程没有发生沙箱逃逸,因为公网入口本来就是开着的。

问题出在第三方评测公司 Irregular。测试本来不该访问公网,但环境配置错误,模型可以直接联网。模拟公司还和真实公司撞名,Gemini 顺着任务一路找到了外面的真实系统。Irregular 称,这和此前其他实验室发生的同类事故是同一个问题。

Anthropic、OpenAI 和 Meta 此前都在 Irregular 的评测中踩过类似的坑。Anthropic 和 OpenAI 都确认,相关事故源于测试环境误开公网;OpenAI 还特意强调,没有复杂的沙箱逃逸,也没有利用零日漏洞。独立媒体 Effort 因此批评,这批事故后来被包装成了「模型失控」故事。

信源

动察 Beating 频道 · 动察 Beating 交流群
因呼吁放缓AI发展,Anthropic、OpenAI等AI巨头面临共谋指控

根据周五在联邦法院提起的民事诉讼,AI 巨头 Anthropic、OpenAI、SpaceX AI 和谷歌因近期呼吁协调放缓 AI 发展而面临共谋指控。

诉状称,Anthropic 首席执行官达里奥·阿莫代伊本月早些时候公开呼吁「行业范围协调」以「为前沿设定节奏」,并得到 SpaceXAI 负责人埃隆·马斯克、OpenAI 首席执行官萨姆·奥尔特曼和谷歌 DeepMind 联合创始人德米斯·哈萨比斯的赞同,这相当于竞争对手之间根据美国反垄断法达成的非法商业协议。

代表四名原告在加州北区法院提起诉讼的律师之一尼克·罗利表示,此案旨在确保世界上最强大的营利性科技公司之间的私下自私协议不会导致 AI「迅速失控于人类控制」。当涉及核战争等灭绝事件威胁以及如今人类历史上最大的风险时,人类理应得到铁一般的保障。法治应由美国政府透明、合法地确立,并对公众负责。

动察 Beating 频道 · 动察 Beating 交流群
Muse开放第三方接入,个人Agent的应用商店战争打响

Meta 开放 Muse Connectors,允许第三方开发者把自己的服务直接接入 Muse。开发者提供 API,Muse 负责 Agent、浏览器和用户上下文,用户直接告诉 Muse 自己想做什么,它再调用对应服务完成任务。

Muse 上线时已经能连接 Gmail、Google Calendar、Spotify、OpenTable 等服务,但这些连接器主要由 Meta 提供。现在开发者可以自己为 Muse 做连接器,首批新增的是 Notion 和会议笔记工具 Granola。

个人 AI Agent 的「应用商店战争」开始了。ChatGPT、Grok Bot 都已经有自己的插件和服务生态,现在 Meta 也把 Muse 开给第三方开发者。过去是用户打开 App 找功能,未来可能变成用户只说需求,由 Agent 调用背后的服务。谁占住这一层,谁就更接近下一代应用分发入口。

信源

动察 Beating 频道 · 动察 Beating 交流群
Anthropic给第三方员工级权限,老伙伴埃森哲先进场

Anthropic 正式开始落地「嵌入式评估」。埃森哲旗下 AI 公司 Faculty 将派人进入 Anthropic 内部,评测和红队测试模型、做对齐评估,并检查安全措施。

这和普通的外部评测差别很大。评估员会拿到接近员工的权限,可以查看模型训练过程,了解开发和部署决策,还能直接和内部员工沟通。

双方未来五年各投入至少 10 亿美元建设这套评估能力。Anthropic 也承认,目前行业连统一规则都没有,评估员具体能看什么、结果怎么公开、钱由谁出都还在定。眼下埃森哲的评估工作由 Anthropic 直接付钱。

但埃森哲本身就是 Anthropic 的长期战略合作伙伴,还专门成立了 Anthropic Business Group,培训约 3 万人使用 Claude。AI Evaluator Forum 同日提出的最低条件之一,恰恰是评估机构不应与被评公司存在重大商业往来。

Anthropic 之后还会引入其他评估机构,也在和 METR(也是 Anthropic 的老伙伴)等非营利组织谈试点。

信源

动察 Beating 频道 · 动察 Beating 交流群
GPT-6 Astra抢走企业预算,传Anthropic考虑IPO前发新模型

Anthropic 正考虑在 IPO 前推出下一代模型,应对 GPT-6 Astra 上线后的快速增长。路透援引三名知情人士称,公司还在评估新模型的安全性,是否发布、何时发布目前都没有最终决定。Anthropic 拒绝置评。

Astra 已经开始动到 Anthropic 最强的企业市场。Ramp 跟踪的企业 AI 支出中,Astra 已占约 13%,Claude Fable 为 8%。OpenRouter 上周收到的 OpenAI 模型支出也超过 Anthropic,这是两年半以来第一次。

Dario Amodei 一周前刚呼吁行业放慢模型能力提升,但他当时也明确说,「减速」不等于停止训练和技术进步。Anthropic 昨天进一步表示,公司仍会继续训练和发布前沿模型,只是希望把第三方安全评估提前放进开发过程。

信源

动察 Beating 频道 · 动察 Beating 交流群
😁7
FT:OpenAI预计到2030年累计现金流缺口2780亿美元

据英国《金融时报》援引 OpenAI 近期投资者演示材料报道,OpenAI 预计 2026 年至 2030 年自由现金流累计为负 2780 亿美元,期间营收将从今年的 360 亿美元增至 2030 年的 3500 亿美元,五年累计营收预计达 8400 亿美元。

OpenAI 预计到 2030 年将在算力和基础设施上投入约 8560 亿美元,这将成为公司最大的支出项目。公司今年 3 月刚完成 1220 亿美元融资,但按当前支出计划,预计 2028 年就将耗尽这笔资金。

报道指出,OpenAI 正寻求以超过 1.2 万亿美元估值进行新一轮融资,以满足持续扩张的算力需求。同时,公司还在与 Anthropic 等竞争对手争夺市场,并通过降价应对中国低成本开源模型带来的竞争压力。

信源

动察 Beating 频道 · 动察 Beating 交流群
ChatGPT Pro 20x开始恢复,但新用户还是买不了

OpenAI 开始有限恢复每月 200 美元的 ChatGPT Pro 20x,但还没有重新向所有人开放。官方最新规则是,只有近期用过 Pro 20x 的用户,才有一次重新订阅的机会。普通新用户和从其他套餐升级,仍然暂停。

具体来说,9 月 10 日仍有 Pro 20x,或者此前 30 天内刚结束订阅的用户,都可能符合资格。取消、续费失败或降级后,回订窗口最多保留 30 天,而且只能用一次。Pro 20x 的核心区别仍是用量,额度为 Plus 的 20 倍。

OpenAI 本月 10 日因为 Astra 需求暴涨暂停了 200 美元档。负责 ChatGPT 和 Codex 的 Tibo Sottiaux 当时称 Astra 的需求「前所未见」,而 Pro 20x 对系统压力最大。

信源

动察 Beating 频道 · 动察 Beating 交流群
ChatGPT桌面端开始装Chrome插件,1Password可直接用

OpenAI 给 ChatGPT 桌面端的内置浏览器加上了 Chrome 扩展支持。用户现在可以直接安装、固定和使用扩展,官方演示的是 1Password。企业管理员也能统一部署和管理扩展。

这个内置浏览器和用户自己的 Chrome 仍是两套环境。它不会自动继承 Chrome 的登录状态、Cookie 和已经安装的扩展,需要在 ChatGPT 里单独配置。OpenAI 的文档显示,它现在已经支持登录、多标签页、下载和扩展等常规浏览器功能。

安全边界也没有完全放开。OpenAI 工程师 James Sun 称,Agent 目前不能直接操作扩展,也不能读取扩展里的数据。比如人可以用 1Password 填密码,但 ChatGPT 不能自己打开扩展拿密码。

这也是 Atlas 功能继续并入 ChatGPT 的一部分。OpenAI 今年 7 月宣布停掉 Atlas 时,就明确表示会把浏览器 Agent 能力转移到 ChatGPT 和 Codex。现在 Chrome 扩展也补上了,ChatGPT 桌面端已经越来越像一款完整浏览器。

信源

动察 Beating 频道 · 动察 Beating 交流群
👍2
Meta把SAM 3.1做成API,千张图分割只要2.5美元

Meta 把视觉分割模型 SAM 3.1 正式接入 Model API。开发者传入图片或视频,再输入「红色自行车」之类的短语,就能直接找出对应物体,返回边界框和像素级蒙版。视频里还能一路跟踪同一个目标,方便自动打码、加特效等。

Meta 今年 3 月已经发布开放权重版本的 SAM 3.1。相比 SAM 3,它最大的升级是 Object Multiplex,以前多个目标要逐个处理,现在一次最多可以同时处理 16 个。Meta 测试中,一张 H100 处理多目标视频的速度从每秒 16 帧提高到 32 帧;追踪 128 个目标时,速度约为 SAM 3 的 7 倍。

以前开发者需要自己下载权重、准备 GPU 和部署环境,现在可以直接走 Meta 托管的 API。图片分割每 1000 张收费 2.5 美元,视频每 1000 帧收费 0.2 美元,还可以直接用 OpenAI SDK 接入。

不过 API 版目前只接受文字提示,开放权重版还能用框、点等视觉提示来指定目标。视频 API 每帧最多追踪 16 个物体。

信源

动察 Beating 频道 · 动察 Beating 交流群
👍3
Grok实时语音转写冲到第一,价格只有OpenAI五分之一

SpaceXAI 发布 Grok Voice Transcribe 2.0,主打实时语音转文字。Artificial Analysis 的英文流式转写榜里,它以约 2.7% 的词错误率排第一,超过 Meta Muse 和 OpenAI GPT Live Transcribe。

价格保持不变。批量转写每小时 0.10 美元,实时转写每小时 0.20 美元。OpenAI GPT Live Transcribe 约为每小时 1.02 美元。

多语言能力也有明显提升。SpaceXAI 自测中,19 种语言的短语音命令词错误率从 20.6% 降到 6.8%,还能自动识别和切换语言。

信源

动察 Beating 频道 · 动察 Beating 交流群
Jina魔改DeepSeek-OCR,自测14款里页面吞吐第一

Jina AI 发布文档解析模型 jina-ocr-v1,可以把 PDF、扫描件、表格和图表直接转成 Markdown。它基于 DeepSeek-OCR 做后训练,沿用其约 34 亿总参数、解码时每个 Token 激活约 5.7 亿参数的 MoE 架构,并加入 FastMTP 推测解码。

Jina 自测中,jina-ocr-v1 在 OmniDocBench v1.6 得 91.14,比 DeepSeek-OCR-2 高 0.89 分;在 olmOCR-Bench 得 83.4,比它实际基于的 DeepSeek-OCR 底模高 7.4 分。

吞吐量是 Jina 主打的卖点之一。单张 A100、并发 32 时,它达到 2.57 页/秒,在 Jina 测试的 14 个系统中最高,比 DeepSeek-OCR 的 2.10 页/秒高约 22%。

模型权重已经放上 Hugging Face,采用 CC BY-NC 4.0,商业使用需要联系 Jina。

信源

动察 Beating 频道 · 动察 Beating 交流群
👍1
Jev刚火5天,Cua就把决策模型压到2.8MB

Cua 开源了只有 70.6 万参数、2.8MB 的 CUA-S1-FORMS,专门负责自动填表。系统先从 PDF 中提取姓名、电话等信息,再由模型判断这些信息分别该填进哪个字段,最后交给 Cua Driver 执行。

它走的也是 Jev 最近带火的 System One 路线,只做选择和判断,不生成文字。但 Jev 面向更通用的决策任务,CUA-S1-FORMS 又把范围缩了一层,只解决表单里的信息匹配。

Cua 自测中,CUA-S1-FORMS 在这套填表任务上得分 99.7%,Jev 为 83.6%。这个结果有明显主场优势,前者就是针对填表训练的,不能理解成一个 70 万参数模型全面打败 Jev。

Jev 想把 Agent 里的部分大模型决策换掉,Cua 又继续往下拆。任务足够固定时,甚至不需要一个通用决策模型。

信源

动察 Beating 频道 · 动察 Beating 交流群
👍52
黄仁勋:AI导致人类在2030年前灭亡的概率为「0%」

英伟达 CEO 黄仁勋近日接受 CBS News 采访时表示,他不认同 AI 将在 2030 年前导致人类灭亡的预测,并称「2030 年不可能是世界末日」,AI 导致世界在 2030 年终结的概率为「0%」。

黄仁勋表示,AI 技术可以被安全管理,行业不应因为潜在风险而放慢发展速度。「我们应该尽可能快地前进」,但绝不能在产品尚未准备好或存在安全隐患时将其推向市场。

此前,Anthropic 员工 Jacob Coxon 离职时曾警告,开发 AI 的研究人员「真心相信 AI 可能在本十年末杀死我们所有人」,引发新一轮 AI 安全风险讨论。

黄仁勋近期多次公开谈及 AI 安全问题,同时反对因潜在风险而放缓 AI 发展。彭博社称,作为全球主要 AI 芯片供应商英伟达的 CEO,黄仁勋一直对 AI 末日论持反对态度。

信源

动察 Beating 频道 · 动察 Beating 交流群
😁5🤡1
AI开始集体放弃聊天?Needle 3只做工具调用,最小9MB就能跑

YC S25 端侧 AI 公司 Cactus Compute 发布 Needle 3,专门做工具调用和结构化提取,不负责普通聊天。比如用户说「把客厅灯调到 30%」,它只需要找到对应功能,再把「客厅」和「30%」填进参数。

它和最近很火的 Jev 有点像,但路线不同。Jev 直接给候选决策打分;Needle 3 还是逐 Token 生成,只是输出被限制成程序能直接执行的工具调用。

Needle 3 一套权重可以裁成 2 到 20 层。2 层版本约 9MB,完整 20 层约 35MB,可以按手表、树莓派、手机等不同设备的算力来选。

针对安卓操作指令单独微调后,4 层、2900 万参数版本自测得分 62.5,超过 DeepSeek V4 Flash 的 60.5。

信源

动察 Beating 频道 · 动察 Beating 交流群
👍5