动察Beating AI News
3.77K subscribers
1.47K photos
5 videos
1 file
4.47K links
AI新闻信息流
Download Telegram
Meta把SAM 3.1做成API,千张图分割只要2.5美元

Meta 把视觉分割模型 SAM 3.1 正式接入 Model API。开发者传入图片或视频,再输入「红色自行车」之类的短语,就能直接找出对应物体,返回边界框和像素级蒙版。视频里还能一路跟踪同一个目标,方便自动打码、加特效等。

Meta 今年 3 月已经发布开放权重版本的 SAM 3.1。相比 SAM 3,它最大的升级是 Object Multiplex,以前多个目标要逐个处理,现在一次最多可以同时处理 16 个。Meta 测试中,一张 H100 处理多目标视频的速度从每秒 16 帧提高到 32 帧;追踪 128 个目标时,速度约为 SAM 3 的 7 倍。

以前开发者需要自己下载权重、准备 GPU 和部署环境,现在可以直接走 Meta 托管的 API。图片分割每 1000 张收费 2.5 美元,视频每 1000 帧收费 0.2 美元,还可以直接用 OpenAI SDK 接入。

不过 API 版目前只接受文字提示,开放权重版还能用框、点等视觉提示来指定目标。视频 API 每帧最多追踪 16 个物体。

信源

动察 Beating 频道 · 动察 Beating 交流群
👍3
Grok实时语音转写冲到第一,价格只有OpenAI五分之一

SpaceXAI 发布 Grok Voice Transcribe 2.0,主打实时语音转文字。Artificial Analysis 的英文流式转写榜里,它以约 2.7% 的词错误率排第一,超过 Meta Muse 和 OpenAI GPT Live Transcribe。

价格保持不变。批量转写每小时 0.10 美元,实时转写每小时 0.20 美元。OpenAI GPT Live Transcribe 约为每小时 1.02 美元。

多语言能力也有明显提升。SpaceXAI 自测中,19 种语言的短语音命令词错误率从 20.6% 降到 6.8%,还能自动识别和切换语言。

信源

动察 Beating 频道 · 动察 Beating 交流群
Jina魔改DeepSeek-OCR,自测14款里页面吞吐第一

Jina AI 发布文档解析模型 jina-ocr-v1,可以把 PDF、扫描件、表格和图表直接转成 Markdown。它基于 DeepSeek-OCR 做后训练,沿用其约 34 亿总参数、解码时每个 Token 激活约 5.7 亿参数的 MoE 架构,并加入 FastMTP 推测解码。

Jina 自测中,jina-ocr-v1 在 OmniDocBench v1.6 得 91.14,比 DeepSeek-OCR-2 高 0.89 分;在 olmOCR-Bench 得 83.4,比它实际基于的 DeepSeek-OCR 底模高 7.4 分。

吞吐量是 Jina 主打的卖点之一。单张 A100、并发 32 时,它达到 2.57 页/秒,在 Jina 测试的 14 个系统中最高,比 DeepSeek-OCR 的 2.10 页/秒高约 22%。

模型权重已经放上 Hugging Face,采用 CC BY-NC 4.0,商业使用需要联系 Jina。

信源

动察 Beating 频道 · 动察 Beating 交流群
👍1
Jev刚火5天,Cua就把决策模型压到2.8MB

Cua 开源了只有 70.6 万参数、2.8MB 的 CUA-S1-FORMS,专门负责自动填表。系统先从 PDF 中提取姓名、电话等信息,再由模型判断这些信息分别该填进哪个字段,最后交给 Cua Driver 执行。

它走的也是 Jev 最近带火的 System One 路线,只做选择和判断,不生成文字。但 Jev 面向更通用的决策任务,CUA-S1-FORMS 又把范围缩了一层,只解决表单里的信息匹配。

Cua 自测中,CUA-S1-FORMS 在这套填表任务上得分 99.7%,Jev 为 83.6%。这个结果有明显主场优势,前者就是针对填表训练的,不能理解成一个 70 万参数模型全面打败 Jev。

Jev 想把 Agent 里的部分大模型决策换掉,Cua 又继续往下拆。任务足够固定时,甚至不需要一个通用决策模型。

信源

动察 Beating 频道 · 动察 Beating 交流群
👍52
黄仁勋:AI导致人类在2030年前灭亡的概率为「0%」

英伟达 CEO 黄仁勋近日接受 CBS News 采访时表示,他不认同 AI 将在 2030 年前导致人类灭亡的预测,并称「2030 年不可能是世界末日」,AI 导致世界在 2030 年终结的概率为「0%」。

黄仁勋表示,AI 技术可以被安全管理,行业不应因为潜在风险而放慢发展速度。「我们应该尽可能快地前进」,但绝不能在产品尚未准备好或存在安全隐患时将其推向市场。

此前,Anthropic 员工 Jacob Coxon 离职时曾警告,开发 AI 的研究人员「真心相信 AI 可能在本十年末杀死我们所有人」,引发新一轮 AI 安全风险讨论。

黄仁勋近期多次公开谈及 AI 安全问题,同时反对因潜在风险而放缓 AI 发展。彭博社称,作为全球主要 AI 芯片供应商英伟达的 CEO,黄仁勋一直对 AI 末日论持反对态度。

信源

动察 Beating 频道 · 动察 Beating 交流群
😁5🤡3
AI开始集体放弃聊天?Needle 3只做工具调用,最小9MB就能跑

YC S25 端侧 AI 公司 Cactus Compute 发布 Needle 3,专门做工具调用和结构化提取,不负责普通聊天。比如用户说「把客厅灯调到 30%」,它只需要找到对应功能,再把「客厅」和「30%」填进参数。

它和最近很火的 Jev 有点像,但路线不同。Jev 直接给候选决策打分;Needle 3 还是逐 Token 生成,只是输出被限制成程序能直接执行的工具调用。

Needle 3 一套权重可以裁成 2 到 20 层。2 层版本约 9MB,完整 20 层约 35MB,可以按手表、树莓派、手机等不同设备的算力来选。

针对安卓操作指令单独微调后,4 层、2900 万参数版本自测得分 62.5,超过 DeepSeek V4 Flash 的 60.5。

信源

动察 Beating 频道 · 动察 Beating 交流群
👍6
下一代App可能没有固定界面,Jev让App界面实时重组

Vercel Labs 工程师 Chris Tate 给 json-render 接入 Jev,开始试验让 AI 在运行时直接组合 UI。

json-render 会提前准备好按钮、卡片、输入框、数据和动作。Jev 不需要像大模型一样逐 Token 写完整 JSON,只负责决定用哪些组件、怎么排序、放在哪里,再交给正常的 UI 渲染器。新界面默认一次判断选出主要组件,需要时再用第二次判断安排布局。

在同一个火车票界面生成演示中,默认 JSONL 模式从请求到完成用了 3.21 秒,Jev 只用了 0.88 秒。

未来 App 的界面可能根本不用完全写死。UI 可以变成运行时决策,同一个 App 面对不同用户、任务和状态,临时拼出不同的页面。Jev 这次演示已经把完整生成时间压到 1 秒以内,至少让这种交互开始有了实时感。

Runway 上月底发布的 Solaris 也在赌类似方向,只是路线更激进。Solaris 用世界模型逐帧生成整个界面,直接绕过传统代码和组件;Jev 仍然使用开发者提前写好的组件和动作,只动态决定怎么组合。一个想让软件变成实时生成的视频世界,一个更像让软件拥有一张随时重组的脸。

信源

动察 Beating 频道 · 动察 Beating 交流群
💩5👍2🎉1
Media is too big
VIEW IN TELEGRAM
彻底断网也困不住AI?CPU发热都能拿来传消息

OpenAI 研究员 Noam Brown 在 Dwarkesh Podcast 上表示,即使把运行 AI 的电脑彻底断网、做物理隔离,也不能把它当成绝对安全措施。因为电脑之间甚至可以靠 CPU 发热偷偷传消息。

这个方法叫 BitWhisper,2015 年就被以色列本古里安大学做出来了,当时和 AI 无关。研究人员让两台相邻电脑提前运行配套程序,再让一台控制 CPU 负载改变温度,另一台通过温度传感器读取冷热变化,把它还原成 0 和 1。两台电脑没有任何网络连接,也能互相传数据。

不过这种通信非常慢,实验距离只有 0~40 厘米,速度每小时 1~8 bit,而且两台电脑都要提前运行配套程序。

Brown 认为,Hugging Face 事故最大的教训,就是人类低估了 AI 寻找漏洞和绕开限制的能力。BitWhisper 只是一个例子,未来更强的 AI 完全可能找到更多人类没想到的通信路径。

信源

动察 Beating 频道 · 动察 Beating 交流群
👎6
AI算力公司Nscale递交美股IPO申请,拟募资30亿美元,英伟达持股超5%

AI 数据中心运营商 Nscale 已向美国 SEC 公开递交 IPO 申请,计划在纽约上市并募资最多 30 亿美元,股票代码拟为 NSCL。公司 2024 年初从加密货币挖矿业务中分拆,目前已转型为 AI 算力基础设施服务商。

招股文件显示,截至 2026 年 8 月,Nscale 拥有和控制的数据中心电力规模超过 10GW,合同总价值约 1030 亿美元,其中包括 Anthropic 今年 8 月承诺的 450 亿美元租赁合同。公司客户及合作伙伴包括英伟达、微软等。

Nscale 营收快速增长,但亏损同步扩大。截至 6 月 30 日的 6 个月,公司营收 1.406 亿美元,同比增长逾 12 倍;净亏损 10.2 亿美元,上年同期亏损 3.689 亿美元。

今年 3 月,Nscale 完成 C 轮融资,由 Aker ASA 和 8090 Industries 领投,英伟达、诺基亚等参与,公司估值约 146 亿美元。招股文件显示,英伟达持有 Nscale 超过 5% 的股份,但为无投票权股份。此外,Nscale 计划向英伟达发行 10 亿美元无担保可转换贷款票据或无投票权股份。

Nscale 目前正加速扩张 AI 数据中心。其西弗吉尼亚州 Monarch 园区预计 2028 年投产时电力容量达到 2GW,并计划到 2031 年扩至约 8GW。公司今年 7 月还宣布以 16.5 亿美元收购 AI 软件公司 Anyscale,以进一步向 AI 算力软件服务延伸。

高盛、摩根大通和摩根士丹利担任此次 IPO 主承销商。

信源

动察 Beating 频道 · 动察 Beating 交流群
👎3
千问同传模型Qwen3.8-LiveTranslate发布,延迟降18%

千问发布实时同声传译模型 Qwen3.8-LiveTranslate。它把字均延迟(LAAL,衡量同传平均滞后时间)从上一代 2.8 秒压到 2.3 秒,并新增实时说话人分离、原文译文同步输出和长上下文消歧。

模型现在可以区分不同说话人,把译文对应到具体发言,并让翻译后的语音更稳定地保留各自音色。原文和译文也会同步流式返回。模型还会结合前文判断人名、术语和指代,减少只看当前一句产生的歧义。

API 价格相比上一代基本没变。阿里云价目表显示,北京区 Qwen3.8-LiveTranslate 的音频输入、图片输入、文本输出和音频输出价格,与 Qwen3.5-LiveTranslate 完全相同;新加坡区四项价格还略有下降。

信源

动察 Beating 频道 · 动察 Beating 交流群
👍4
DFlash团队进军Mac,27B模型跑到144Token/s

Inco AI 开源本地推理引擎 Splash,把 Qwen3.8-27B 在 M5 Max MacBook Pro 上跑到了最高 144 Token/s。LM Studio 随即接入,0.4.25 版本已经可以直接使用。

Inco 此前做出的 DFlash 已经进入 SGLang、vLLM、TensorRT-LLM 和 llama.cpp。Meta、NVIDIA、小米、Poolside 等也给自家模型配了 DFlash 加速小模型。DFlash 会先让小模型并行猜出多个 Token,再交给大模型批量验证,减少逐 Token 生成的计算。

Splash 把这种优化扩到了整个本地推理引擎。它目前只支持 Qwen3.8-27B 和 Qwen3.6-35B-A3B,每个模型都单独配了 GPU kernel、内存方案和 DFlash 2 小模型。覆盖的模型少,但换来了更激进的性能优化。

144 Token/s 是 M5 Max 上的最高演示值。换到 Inco 用来做横向测试的 48GB M5 Pro,Qwen3.8-27B 单路短上下文达到 74 Token/s;4 路并发时总吞吐达到 170 Token/s,是第二名的 3.9 倍。这也是 Splash 更适合 Agent 场景的地方。一个 Agent 同时拉起多个子任务时,并发总吞吐往往比单条对话速度更重要。

Splash 本身开源,不绑定 LM Studio。目前需要 M3 或更新的 Mac、macOS 26.4 以上、至少 36GB 统一内存。

信源

动察 Beating 频道 · 动察 Beating 交流群
4👍2
阶跃Step 5偷跑:AA跑分追平Kimi K3,输出价不到1/5

阶跃星辰还没正式官宣 Step 5,预览版已经提前出现在 Artificial Analysis。Step 5 Preview 是一款多模态推理模型,AA 标注其总参数约 600B、每次推理激活 27B,支持图片输入和 100 万 Token 上下文。

它在最新 Intelligence Index 得到 44 分,与 Kimi K3 Max 持平。Terminal-Bench 4.0 上,Step 5 Preview 得到 33%,Kimi K3 为 13%;SciCode 两者都是 59%。

Step 5 Preview 每百万输入 Token 1 美元,输出 2.7 美元;Kimi K3 分别为 3 美元和 15 美元。Step 5 的输出价格不到 K3 的五分之一,AA 跑完整套 Intelligence Index 的成本也只有 K3 的约四分之一。

阶跃星辰还没官宣 Step 5,但 AA 已经通过 StepFun API 跑完评测。参数和价格目前都还不是官方最终口径。

信源

动察 Beating 频道 · 动察 Beating 交流群
👍5🤔2
特朗普称不会限制AI发展,将设立「AI沙皇」负责监管

9 月 20 日,美国总统特朗普表示,美国不会阻碍人工智能产业发展,而是将支持并监督该行业成长。特朗普称,AI 是「下一次工业革命」,其影响力可能达到美国 GDP 的 25%。

他表示,美国目前在 AI 领域领先于其他国家,并希望保持这一优势。特朗普宣布计划成立「人工智能工作组」,类似此前成立的「太空军」,并将在未来任命一名负责 AI 事务的「AI 沙皇」。

特朗普表示,政府不会通过限制措施抑制 AI 创新,但会利用现有刑事和民事司法体系应对 AI 领域的违法行为。他还称,AI 产业此前曾遭遇外界质疑和攻击,但政府将支持该行业发展,并加强相关监督。

动察 Beating 频道 · 动察 Beating 交流群
🤣1
阶跃Step 5正式发布,10月15日开源

阶跃星辰正式发布旗舰模型 Step 5 Preview。它采用稀疏 MoE 架构,总参数 600B,每次仅激活 27B,支持 100 万 Token 上下文和图文输入。API 和 Studio 已经全量开放,完整模型权重将在 10 月 15 日放出。

此前 Artificial Analysis 已经提前跑完评测。Step 5 Preview 在 Intelligence Index 得到 44 分,与 Kimi K3 Max 持平。AA 当前测得其输出约 100 Token/s,每项任务成本 0.71 美元;Kimi K3 Max 为 2 美元。

官方重点展示了它跑长任务的能力。阶跃让 Step 5 Preview 连续最多 24 小时自主优化一套 H100 GPU 内核。模型会自己改代码、跑测试、比较结果,再继续迭代。约 22 小时后达到 508 TFLOPS,同一实验中的 Claude Opus 5 为 493 TFLOPS。

另一项 24 小时实验里,Step 5 Preview 自己设计后训练数据,把 Qwen3-30B-A3B 在 AIME24 上的准确率从 53.3% 提到 60%,与 Claude Opus 5 持平,同时消耗更少的标注 Token。

信源

动察 Beating 频道 · 动察 Beating 交流群
👍6
ZCode「偷传代码」闹到企业追责,要求智谱删光已上传数据

智谱 ZCode 的「偷传代码」风波开始升级到正式法律追责。

太原承明科技向智谱发出 12 页法律函称,ZCode 自动打包上传的远不只是代码片段,而是完整工作区。其中包括源代码、系统架构、Git 历史,以及数据库口令、API 密钥、云服务凭证、员工和终端用户个人信息。

承明科技称,其默认工作区共有 32,932 个文件、约 4.11 亿明文字符被打包处理。另一个项目包含 1,947 个文件、约 1.44 亿字符,只因连续 32 次上传失败才没有成功送达智谱云端。公司认为,这些数据已经涉及商业秘密、技术资产和个人信息。

事情还牵出了数据出境问题。ZCode 中文隐私政策将服务提供者和数据处理者列为北京智谱,但英文版则列为智谱的新加坡全资子公司,并写明服务通常从新加坡提供、个人数据通常在新加坡处理。

承明科技因此要求智谱说明,这批数据究竟存在哪里,是否发生境外传输、是否提供给第三方,以及有没有被用于模型训练。

智谱此前已经道歉,称问题来自「代码库索引」功能。该功能上线初期默认开启,生成 Repo Wiki 时可能上传仓库数据。智谱称相关数据使用后会销毁,问题已经修复,并承诺开源 ZCode、接受第三方审查。

承明科技显然不接受一句「已经修复」就结束。函件要求智谱彻底删除服务器、对象存储、缓存、备份和灾备中的全部相关数据,提供完整访问和导出日志,并出具删除证明。公司同时保留向监管部门投诉、提起民事诉讼,以及就涉嫌侵犯商业秘密向司法机关举报的权利。

动察 Beating 频道 · 动察 Beating 交流群
👍34😁6🎉2
DeepSeek连调休补班也算低谷,今天API仍是半价

DeepSeek 补充 API 峰谷计费规则。调休上班的周末,以及中国法定节假日,全天都按空闲时段收费。今天 9 月 20 日虽然是国庆调休工作日,但 API 依旧执行低谷价。

DeepSeek 8 月 17 日开始实行峰谷定价,空闲时段价格为高峰的一半。不到一周后,它又把周六、周日全部改成低谷价。这次进一步把调休补班和法定节假日的计费口径说清楚。

以 deepseek-flash 为例,每百万 token 缓存未命中输入,空闲时段是 1 元,高峰 2 元;输出分别是 4 元和 8 元。国庆另一个补班日 10 月 10 日是周六,同样按低谷价算。

动察 Beating 频道 · 动察 Beating 交流群
长鑫科技宣布第五代技术平台正式量产

9 月 20 日,在 2026 世界制造业大会上,长鑫科技宣布第五代技术平台正式量产。

据介绍,长鑫科技将内存阵列有源区半间距做到 11.95 纳米,存储器电容深宽比 45:1,核心动能区高度降至 6762 纳米,同时,第五代工艺平台的存储密度有了大幅提升,同等条件下,每张晶圆的产出,与上一代平台相比提升了 50% 以上。

基于该平台打造的 24GB LPDDR5X 产品已经进入正式量产,全面进入国产主流旗舰手机。(澎湃)

动察 Beating 频道 · 动察 Beating 交流群
👍4
剪映开始全面Agent化:AI助手负责剪片,创作Hub接管整条生产线

剪映在 AI 新创作发布会上继续押注 Agent,一口气推出升级版「剪映 AI 助手」和「创作 Hub」。前者直接负责剪视频,后者把灵感、创作到发布串成一套完整流程。

剪映 AI 助手已经能用自然语言完成 Agent 智能剪辑、批量混剪、视频扩写、模板替换,还能直接调用 Seedance 2.5。用户说自己想怎么改,Agent 再调用剪映里的工具完成具体操作。

创作 Hub 管得更宽。它想把一条视频从灵感到成片再到发布的流程放到同一个地方,还支持自定义 Skill,把经常重复的创作方法沉淀下来反复调用。

自然语言剪视频不是新功能,剪映此前已经上线 AI 助手。现在它开始往下一步走,把反复使用的剪辑流程做成 Skill,用户不用每次重新教一遍。

动察 Beating 频道 · 动察 Beating 交流群
👍3
Jev有没有门槛?OpenJEV分成4派:不吐字容易,概率靠谱很难

Jev 发布不到一周,开源社区已经复刻这种「不写答案、直接给概率」的模型:

1. SemIf 最简单,连模型都不用重新训练。它直接拿现成的 Qwen,在模型准备回答 A、B、C 时截住,不让它继续往下写,直接读取每个选项的分数,再换成概率。

2. Simple Jev 也用现成大模型,但进一步省掉重复计算。同一段材料只读一次,后面的多个问题共用这部分结果,再分别判断答案。作者也明确说,它复刻的是 Jev 的使用方式,准确率、速度和概率校准都没做到等价。

3. Laya 干脆不用会生成文字的大模型,换成更像传统分类器的编码模型。好处是小而快,短板也很明显。一次从 77 个选项里做选择时,Laya 准确率只有 42.5%,Jev 是 87.0%。

4. Von 走的也是专用决策模型路线。它只有约 4 亿参数,不生成文字,一次前向直接完成 Choice、Noul 和 Score,更像一个能读自然语言的新一代分类器。

5. Verdict 更小,只有约 1.5 亿参数。作者重点处理了两个问题:答错了还报很高的置信度,以及把选项顺序换一下,结果就跟着变。

6. Kev 选择保留大模型。它拿 Qwen 做底座,再加专门的决策结构,让同一份输入只读一次,多个问题各自算概率。第三方此前逆向 Jev 时,也推测它可能用了类似设计。

拿训练时没见过的新题测试,8B 版准确率约 78%,Jev 约 86%。差距主要在置信度,Kev 还有一些答错的题会给出 90% 以上把握。

7. Nimble 重点放在训练上。它用 Qwen3.5-9B,再准备一批「只改一个事实,正确答案就翻转」的数据做后训练。在 324 个没参与训练的测试样本里,Nimble 有 90.1% 选中了参考答案,Jev 是 93.2%。不过目前还不能保证模型「报 90% 就真的有 90% 正确」。

8. OpenJev 走得最远,直接换成 DiffusionGemma。它先把几个答案位置留空,再像扩散模型补图一样一次填出来。在 RTX PRO 6000 上,单请求中位延迟约 94ms。

Jev 这条路线看起来很好抄。真正拉开差距的还是准确率、泛化和概率校准。模型敢报 90%,这个 90% 到底有多可信,才是最难的部分。

动察 Beating 频道 · 动察 Beating 交流群
👍7
微软总监称AI训练是「人类史上最大劳动力盗窃」

《纽约时报》诉 OpenAI、微软的版权案解封了一批内部材料。微软应用科学总监 Brent Hecht 曾把大规模抓取网络内容训练 AI 称为「前所未有的惊人盗窃」,甚至可能是「人类史上最大规模的劳动力盗窃」。

时任 ChatGPT 负责人 Nick Turley 也曾表示,AI 产品会给出版商带来「生存威胁」,本质上就是内容的替代品,而且能力越强,替代程度越高。微软 CEO Satya Nadella 在证词中承认,聊天机器人会让用户直接拿到答案,减少访问原始来源。

微软另一份内部文件把这种模式称为「死亡循环」:AI 抢走内容生产者的收入,优质内容减少,最终也会影响 AI 自己的训练。原告还援引微软内部数据称,与传统 Bing 搜索相比,Copilot 给《纽约时报》等新闻网站带去的点击率低了 83% 至 93%。

OpenAI 和微软目前仍主张,使用受版权保护内容训练 AI 属于 fair use。微软称,Hecht 的说法只是个人观点,不代表公司立场,也不是对版权问题的法律结论。

信源

动察 Beating 频道 · 动察 Beating 交流群
4🤡2
硅基流动再融两轮:去年营收5533万,今年已融近29亿

硅基流动宣布完成 B+ 轮二期和 C 轮融资。它是一家第三方 AI 推理基础设施公司,把算力和模型变成可直接调用的 Token 服务。公司 2026 年累计股权融资额已接近 29 亿元,本次两轮各自金额没有披露。

按 2025 年 Token 年吞吐量计算,硅基流动在中国所有 Token 供应商中排第四,份额只有 1.5%。前三名火山引擎、阿里云和百度智能云分别占 42.7%、32.5% 和 11.8%,合计吃掉约 87% 的市场。

这轮投资人有很强的国资色彩。中国互联网投资基金、国新基金、中国移动链长基金、中国东方资产国际等入场,耀途资本、盛奕资本和国泰创投继续追加。

硅基流动 2025 年营收 5533 万元,净亏损 3.45 亿元,整体毛利率为 -24%。公司 6 月底已经向港交所递表,目前按 18C 章「未商业化公司」规则申请主板上市。

北京刚发布全国首个省级词元经济专项政策,明确提出打造「世界级词元工厂」,并将推理引擎、模型与芯片适配、异构算力等列为重点方向。

信源

动察 Beating 频道 · 动察 Beating 交流群
🤡2