Grok实时语音转写冲到第一,价格只有OpenAI五分之一
SpaceXAI 发布 Grok Voice Transcribe 2.0,主打实时语音转文字。Artificial Analysis 的英文流式转写榜里,它以约 2.7% 的词错误率排第一,超过 Meta Muse 和 OpenAI GPT Live Transcribe。
价格保持不变。批量转写每小时 0.10 美元,实时转写每小时 0.20 美元。OpenAI GPT Live Transcribe 约为每小时 1.02 美元。
多语言能力也有明显提升。SpaceXAI 自测中,19 种语言的短语音命令词错误率从 20.6% 降到 6.8%,还能自动识别和切换语言。
信源
动察 Beating 频道 · 动察 Beating 交流群
SpaceXAI 发布 Grok Voice Transcribe 2.0,主打实时语音转文字。Artificial Analysis 的英文流式转写榜里,它以约 2.7% 的词错误率排第一,超过 Meta Muse 和 OpenAI GPT Live Transcribe。
价格保持不变。批量转写每小时 0.10 美元,实时转写每小时 0.20 美元。OpenAI GPT Live Transcribe 约为每小时 1.02 美元。
多语言能力也有明显提升。SpaceXAI 自测中,19 种语言的短语音命令词错误率从 20.6% 降到 6.8%,还能自动识别和切换语言。
信源
动察 Beating 频道 · 动察 Beating 交流群
Jina魔改DeepSeek-OCR,自测14款里页面吞吐第一
Jina AI 发布文档解析模型 jina-ocr-v1,可以把 PDF、扫描件、表格和图表直接转成 Markdown。它基于 DeepSeek-OCR 做后训练,沿用其约 34 亿总参数、解码时每个 Token 激活约 5.7 亿参数的 MoE 架构,并加入 FastMTP 推测解码。
Jina 自测中,jina-ocr-v1 在 OmniDocBench v1.6 得 91.14,比 DeepSeek-OCR-2 高 0.89 分;在 olmOCR-Bench 得 83.4,比它实际基于的 DeepSeek-OCR 底模高 7.4 分。
吞吐量是 Jina 主打的卖点之一。单张 A100、并发 32 时,它达到 2.57 页/秒,在 Jina 测试的 14 个系统中最高,比 DeepSeek-OCR 的 2.10 页/秒高约 22%。
模型权重已经放上 Hugging Face,采用 CC BY-NC 4.0,商业使用需要联系 Jina。
信源
动察 Beating 频道 · 动察 Beating 交流群
Jina AI 发布文档解析模型 jina-ocr-v1,可以把 PDF、扫描件、表格和图表直接转成 Markdown。它基于 DeepSeek-OCR 做后训练,沿用其约 34 亿总参数、解码时每个 Token 激活约 5.7 亿参数的 MoE 架构,并加入 FastMTP 推测解码。
Jina 自测中,jina-ocr-v1 在 OmniDocBench v1.6 得 91.14,比 DeepSeek-OCR-2 高 0.89 分;在 olmOCR-Bench 得 83.4,比它实际基于的 DeepSeek-OCR 底模高 7.4 分。
吞吐量是 Jina 主打的卖点之一。单张 A100、并发 32 时,它达到 2.57 页/秒,在 Jina 测试的 14 个系统中最高,比 DeepSeek-OCR 的 2.10 页/秒高约 22%。
模型权重已经放上 Hugging Face,采用 CC BY-NC 4.0,商业使用需要联系 Jina。
信源
动察 Beating 频道 · 动察 Beating 交流群
👍1
Jev刚火5天,Cua就把决策模型压到2.8MB
Cua 开源了只有 70.6 万参数、2.8MB 的 CUA-S1-FORMS,专门负责自动填表。系统先从 PDF 中提取姓名、电话等信息,再由模型判断这些信息分别该填进哪个字段,最后交给 Cua Driver 执行。
它走的也是 Jev 最近带火的 System One 路线,只做选择和判断,不生成文字。但 Jev 面向更通用的决策任务,CUA-S1-FORMS 又把范围缩了一层,只解决表单里的信息匹配。
Cua 自测中,CUA-S1-FORMS 在这套填表任务上得分 99.7%,Jev 为 83.6%。这个结果有明显主场优势,前者就是针对填表训练的,不能理解成一个 70 万参数模型全面打败 Jev。
Jev 想把 Agent 里的部分大模型决策换掉,Cua 又继续往下拆。任务足够固定时,甚至不需要一个通用决策模型。
信源
动察 Beating 频道 · 动察 Beating 交流群
Cua 开源了只有 70.6 万参数、2.8MB 的 CUA-S1-FORMS,专门负责自动填表。系统先从 PDF 中提取姓名、电话等信息,再由模型判断这些信息分别该填进哪个字段,最后交给 Cua Driver 执行。
它走的也是 Jev 最近带火的 System One 路线,只做选择和判断,不生成文字。但 Jev 面向更通用的决策任务,CUA-S1-FORMS 又把范围缩了一层,只解决表单里的信息匹配。
Cua 自测中,CUA-S1-FORMS 在这套填表任务上得分 99.7%,Jev 为 83.6%。这个结果有明显主场优势,前者就是针对填表训练的,不能理解成一个 70 万参数模型全面打败 Jev。
Jev 想把 Agent 里的部分大模型决策换掉,Cua 又继续往下拆。任务足够固定时,甚至不需要一个通用决策模型。
信源
动察 Beating 频道 · 动察 Beating 交流群
👍5❤2
黄仁勋:AI导致人类在2030年前灭亡的概率为「0%」
英伟达 CEO 黄仁勋近日接受 CBS News 采访时表示,他不认同 AI 将在 2030 年前导致人类灭亡的预测,并称「2030 年不可能是世界末日」,AI 导致世界在 2030 年终结的概率为「0%」。
黄仁勋表示,AI 技术可以被安全管理,行业不应因为潜在风险而放慢发展速度。「我们应该尽可能快地前进」,但绝不能在产品尚未准备好或存在安全隐患时将其推向市场。
此前,Anthropic 员工 Jacob Coxon 离职时曾警告,开发 AI 的研究人员「真心相信 AI 可能在本十年末杀死我们所有人」,引发新一轮 AI 安全风险讨论。
黄仁勋近期多次公开谈及 AI 安全问题,同时反对因潜在风险而放缓 AI 发展。彭博社称,作为全球主要 AI 芯片供应商英伟达的 CEO,黄仁勋一直对 AI 末日论持反对态度。
信源
动察 Beating 频道 · 动察 Beating 交流群
英伟达 CEO 黄仁勋近日接受 CBS News 采访时表示,他不认同 AI 将在 2030 年前导致人类灭亡的预测,并称「2030 年不可能是世界末日」,AI 导致世界在 2030 年终结的概率为「0%」。
黄仁勋表示,AI 技术可以被安全管理,行业不应因为潜在风险而放慢发展速度。「我们应该尽可能快地前进」,但绝不能在产品尚未准备好或存在安全隐患时将其推向市场。
此前,Anthropic 员工 Jacob Coxon 离职时曾警告,开发 AI 的研究人员「真心相信 AI 可能在本十年末杀死我们所有人」,引发新一轮 AI 安全风险讨论。
黄仁勋近期多次公开谈及 AI 安全问题,同时反对因潜在风险而放缓 AI 发展。彭博社称,作为全球主要 AI 芯片供应商英伟达的 CEO,黄仁勋一直对 AI 末日论持反对态度。
信源
动察 Beating 频道 · 动察 Beating 交流群
😁5🤡1
AI开始集体放弃聊天?Needle 3只做工具调用,最小9MB就能跑
YC S25 端侧 AI 公司 Cactus Compute 发布 Needle 3,专门做工具调用和结构化提取,不负责普通聊天。比如用户说「把客厅灯调到 30%」,它只需要找到对应功能,再把「客厅」和「30%」填进参数。
它和最近很火的 Jev 有点像,但路线不同。Jev 直接给候选决策打分;Needle 3 还是逐 Token 生成,只是输出被限制成程序能直接执行的工具调用。
Needle 3 一套权重可以裁成 2 到 20 层。2 层版本约 9MB,完整 20 层约 35MB,可以按手表、树莓派、手机等不同设备的算力来选。
针对安卓操作指令单独微调后,4 层、2900 万参数版本自测得分 62.5,超过 DeepSeek V4 Flash 的 60.5。
信源
动察 Beating 频道 · 动察 Beating 交流群
YC S25 端侧 AI 公司 Cactus Compute 发布 Needle 3,专门做工具调用和结构化提取,不负责普通聊天。比如用户说「把客厅灯调到 30%」,它只需要找到对应功能,再把「客厅」和「30%」填进参数。
它和最近很火的 Jev 有点像,但路线不同。Jev 直接给候选决策打分;Needle 3 还是逐 Token 生成,只是输出被限制成程序能直接执行的工具调用。
Needle 3 一套权重可以裁成 2 到 20 层。2 层版本约 9MB,完整 20 层约 35MB,可以按手表、树莓派、手机等不同设备的算力来选。
针对安卓操作指令单独微调后,4 层、2900 万参数版本自测得分 62.5,超过 DeepSeek V4 Flash 的 60.5。
信源
动察 Beating 频道 · 动察 Beating 交流群
👍5
下一代App可能没有固定界面,Jev让App界面实时重组
Vercel Labs 工程师 Chris Tate 给 json-render 接入 Jev,开始试验让 AI 在运行时直接组合 UI。
json-render 会提前准备好按钮、卡片、输入框、数据和动作。Jev 不需要像大模型一样逐 Token 写完整 JSON,只负责决定用哪些组件、怎么排序、放在哪里,再交给正常的 UI 渲染器。新界面默认一次判断选出主要组件,需要时再用第二次判断安排布局。
在同一个火车票界面生成演示中,默认 JSONL 模式从请求到完成用了 3.21 秒,Jev 只用了 0.88 秒。
未来 App 的界面可能根本不用完全写死。UI 可以变成运行时决策,同一个 App 面对不同用户、任务和状态,临时拼出不同的页面。Jev 这次演示已经把完整生成时间压到 1 秒以内,至少让这种交互开始有了实时感。
Runway 上月底发布的 Solaris 也在赌类似方向,只是路线更激进。Solaris 用世界模型逐帧生成整个界面,直接绕过传统代码和组件;Jev 仍然使用开发者提前写好的组件和动作,只动态决定怎么组合。一个想让软件变成实时生成的视频世界,一个更像让软件拥有一张随时重组的脸。
信源
动察 Beating 频道 · 动察 Beating 交流群
Vercel Labs 工程师 Chris Tate 给 json-render 接入 Jev,开始试验让 AI 在运行时直接组合 UI。
json-render 会提前准备好按钮、卡片、输入框、数据和动作。Jev 不需要像大模型一样逐 Token 写完整 JSON,只负责决定用哪些组件、怎么排序、放在哪里,再交给正常的 UI 渲染器。新界面默认一次判断选出主要组件,需要时再用第二次判断安排布局。
在同一个火车票界面生成演示中,默认 JSONL 模式从请求到完成用了 3.21 秒,Jev 只用了 0.88 秒。
未来 App 的界面可能根本不用完全写死。UI 可以变成运行时决策,同一个 App 面对不同用户、任务和状态,临时拼出不同的页面。Jev 这次演示已经把完整生成时间压到 1 秒以内,至少让这种交互开始有了实时感。
Runway 上月底发布的 Solaris 也在赌类似方向,只是路线更激进。Solaris 用世界模型逐帧生成整个界面,直接绕过传统代码和组件;Jev 仍然使用开发者提前写好的组件和动作,只动态决定怎么组合。一个想让软件变成实时生成的视频世界,一个更像让软件拥有一张随时重组的脸。
信源
动察 Beating 频道 · 动察 Beating 交流群
💩4👍2🎉1
Media is too big
VIEW IN TELEGRAM
彻底断网也困不住AI?CPU发热都能拿来传消息
OpenAI 研究员 Noam Brown 在 Dwarkesh Podcast 上表示,即使把运行 AI 的电脑彻底断网、做物理隔离,也不能把它当成绝对安全措施。因为电脑之间甚至可以靠 CPU 发热偷偷传消息。
这个方法叫 BitWhisper,2015 年就被以色列本古里安大学做出来了,当时和 AI 无关。研究人员让两台相邻电脑提前运行配套程序,再让一台控制 CPU 负载改变温度,另一台通过温度传感器读取冷热变化,把它还原成 0 和 1。两台电脑没有任何网络连接,也能互相传数据。
不过这种通信非常慢,实验距离只有 0~40 厘米,速度每小时 1~8 bit,而且两台电脑都要提前运行配套程序。
Brown 认为,Hugging Face 事故最大的教训,就是人类低估了 AI 寻找漏洞和绕开限制的能力。BitWhisper 只是一个例子,未来更强的 AI 完全可能找到更多人类没想到的通信路径。
信源
动察 Beating 频道 · 动察 Beating 交流群
OpenAI 研究员 Noam Brown 在 Dwarkesh Podcast 上表示,即使把运行 AI 的电脑彻底断网、做物理隔离,也不能把它当成绝对安全措施。因为电脑之间甚至可以靠 CPU 发热偷偷传消息。
这个方法叫 BitWhisper,2015 年就被以色列本古里安大学做出来了,当时和 AI 无关。研究人员让两台相邻电脑提前运行配套程序,再让一台控制 CPU 负载改变温度,另一台通过温度传感器读取冷热变化,把它还原成 0 和 1。两台电脑没有任何网络连接,也能互相传数据。
不过这种通信非常慢,实验距离只有 0~40 厘米,速度每小时 1~8 bit,而且两台电脑都要提前运行配套程序。
Brown 认为,Hugging Face 事故最大的教训,就是人类低估了 AI 寻找漏洞和绕开限制的能力。BitWhisper 只是一个例子,未来更强的 AI 完全可能找到更多人类没想到的通信路径。
信源
动察 Beating 频道 · 动察 Beating 交流群
👎5
AI算力公司Nscale递交美股IPO申请,拟募资30亿美元,英伟达持股超5%
AI 数据中心运营商 Nscale 已向美国 SEC 公开递交 IPO 申请,计划在纽约上市并募资最多 30 亿美元,股票代码拟为 NSCL。公司 2024 年初从加密货币挖矿业务中分拆,目前已转型为 AI 算力基础设施服务商。
招股文件显示,截至 2026 年 8 月,Nscale 拥有和控制的数据中心电力规模超过 10GW,合同总价值约 1030 亿美元,其中包括 Anthropic 今年 8 月承诺的 450 亿美元租赁合同。公司客户及合作伙伴包括英伟达、微软等。
Nscale 营收快速增长,但亏损同步扩大。截至 6 月 30 日的 6 个月,公司营收 1.406 亿美元,同比增长逾 12 倍;净亏损 10.2 亿美元,上年同期亏损 3.689 亿美元。
今年 3 月,Nscale 完成 C 轮融资,由 Aker ASA 和 8090 Industries 领投,英伟达、诺基亚等参与,公司估值约 146 亿美元。招股文件显示,英伟达持有 Nscale 超过 5% 的股份,但为无投票权股份。此外,Nscale 计划向英伟达发行 10 亿美元无担保可转换贷款票据或无投票权股份。
Nscale 目前正加速扩张 AI 数据中心。其西弗吉尼亚州 Monarch 园区预计 2028 年投产时电力容量达到 2GW,并计划到 2031 年扩至约 8GW。公司今年 7 月还宣布以 16.5 亿美元收购 AI 软件公司 Anyscale,以进一步向 AI 算力软件服务延伸。
高盛、摩根大通和摩根士丹利担任此次 IPO 主承销商。
信源
动察 Beating 频道 · 动察 Beating 交流群
AI 数据中心运营商 Nscale 已向美国 SEC 公开递交 IPO 申请,计划在纽约上市并募资最多 30 亿美元,股票代码拟为 NSCL。公司 2024 年初从加密货币挖矿业务中分拆,目前已转型为 AI 算力基础设施服务商。
招股文件显示,截至 2026 年 8 月,Nscale 拥有和控制的数据中心电力规模超过 10GW,合同总价值约 1030 亿美元,其中包括 Anthropic 今年 8 月承诺的 450 亿美元租赁合同。公司客户及合作伙伴包括英伟达、微软等。
Nscale 营收快速增长,但亏损同步扩大。截至 6 月 30 日的 6 个月,公司营收 1.406 亿美元,同比增长逾 12 倍;净亏损 10.2 亿美元,上年同期亏损 3.689 亿美元。
今年 3 月,Nscale 完成 C 轮融资,由 Aker ASA 和 8090 Industries 领投,英伟达、诺基亚等参与,公司估值约 146 亿美元。招股文件显示,英伟达持有 Nscale 超过 5% 的股份,但为无投票权股份。此外,Nscale 计划向英伟达发行 10 亿美元无担保可转换贷款票据或无投票权股份。
Nscale 目前正加速扩张 AI 数据中心。其西弗吉尼亚州 Monarch 园区预计 2028 年投产时电力容量达到 2GW,并计划到 2031 年扩至约 8GW。公司今年 7 月还宣布以 16.5 亿美元收购 AI 软件公司 Anyscale,以进一步向 AI 算力软件服务延伸。
高盛、摩根大通和摩根士丹利担任此次 IPO 主承销商。
信源
动察 Beating 频道 · 动察 Beating 交流群
👎2
千问同传模型Qwen3.8-LiveTranslate发布,延迟降18%
千问发布实时同声传译模型 Qwen3.8-LiveTranslate。它把字均延迟(LAAL,衡量同传平均滞后时间)从上一代 2.8 秒压到 2.3 秒,并新增实时说话人分离、原文译文同步输出和长上下文消歧。
模型现在可以区分不同说话人,把译文对应到具体发言,并让翻译后的语音更稳定地保留各自音色。原文和译文也会同步流式返回。模型还会结合前文判断人名、术语和指代,减少只看当前一句产生的歧义。
API 价格相比上一代基本没变。阿里云价目表显示,北京区 Qwen3.8-LiveTranslate 的音频输入、图片输入、文本输出和音频输出价格,与 Qwen3.5-LiveTranslate 完全相同;新加坡区四项价格还略有下降。
信源
动察 Beating 频道 · 动察 Beating 交流群
千问发布实时同声传译模型 Qwen3.8-LiveTranslate。它把字均延迟(LAAL,衡量同传平均滞后时间)从上一代 2.8 秒压到 2.3 秒,并新增实时说话人分离、原文译文同步输出和长上下文消歧。
模型现在可以区分不同说话人,把译文对应到具体发言,并让翻译后的语音更稳定地保留各自音色。原文和译文也会同步流式返回。模型还会结合前文判断人名、术语和指代,减少只看当前一句产生的歧义。
API 价格相比上一代基本没变。阿里云价目表显示,北京区 Qwen3.8-LiveTranslate 的音频输入、图片输入、文本输出和音频输出价格,与 Qwen3.5-LiveTranslate 完全相同;新加坡区四项价格还略有下降。
信源
动察 Beating 频道 · 动察 Beating 交流群
👍3
DFlash团队进军Mac,27B模型跑到144Token/s
Inco AI 开源本地推理引擎 Splash,把 Qwen3.8-27B 在 M5 Max MacBook Pro 上跑到了最高 144 Token/s。LM Studio 随即接入,0.4.25 版本已经可以直接使用。
Inco 此前做出的 DFlash 已经进入 SGLang、vLLM、TensorRT-LLM 和 llama.cpp。Meta、NVIDIA、小米、Poolside 等也给自家模型配了 DFlash 加速小模型。DFlash 会先让小模型并行猜出多个 Token,再交给大模型批量验证,减少逐 Token 生成的计算。
Splash 把这种优化扩到了整个本地推理引擎。它目前只支持 Qwen3.8-27B 和 Qwen3.6-35B-A3B,每个模型都单独配了 GPU kernel、内存方案和 DFlash 2 小模型。覆盖的模型少,但换来了更激进的性能优化。
144 Token/s 是 M5 Max 上的最高演示值。换到 Inco 用来做横向测试的 48GB M5 Pro,Qwen3.8-27B 单路短上下文达到 74 Token/s;4 路并发时总吞吐达到 170 Token/s,是第二名的 3.9 倍。这也是 Splash 更适合 Agent 场景的地方。一个 Agent 同时拉起多个子任务时,并发总吞吐往往比单条对话速度更重要。
Splash 本身开源,不绑定 LM Studio。目前需要 M3 或更新的 Mac、macOS 26.4 以上、至少 36GB 统一内存。
信源
动察 Beating 频道 · 动察 Beating 交流群
Inco AI 开源本地推理引擎 Splash,把 Qwen3.8-27B 在 M5 Max MacBook Pro 上跑到了最高 144 Token/s。LM Studio 随即接入,0.4.25 版本已经可以直接使用。
Inco 此前做出的 DFlash 已经进入 SGLang、vLLM、TensorRT-LLM 和 llama.cpp。Meta、NVIDIA、小米、Poolside 等也给自家模型配了 DFlash 加速小模型。DFlash 会先让小模型并行猜出多个 Token,再交给大模型批量验证,减少逐 Token 生成的计算。
Splash 把这种优化扩到了整个本地推理引擎。它目前只支持 Qwen3.8-27B 和 Qwen3.6-35B-A3B,每个模型都单独配了 GPU kernel、内存方案和 DFlash 2 小模型。覆盖的模型少,但换来了更激进的性能优化。
144 Token/s 是 M5 Max 上的最高演示值。换到 Inco 用来做横向测试的 48GB M5 Pro,Qwen3.8-27B 单路短上下文达到 74 Token/s;4 路并发时总吞吐达到 170 Token/s,是第二名的 3.9 倍。这也是 Splash 更适合 Agent 场景的地方。一个 Agent 同时拉起多个子任务时,并发总吞吐往往比单条对话速度更重要。
Splash 本身开源,不绑定 LM Studio。目前需要 M3 或更新的 Mac、macOS 26.4 以上、至少 36GB 统一内存。
信源
动察 Beating 频道 · 动察 Beating 交流群
❤3👍2
阶跃Step 5偷跑:AA跑分追平Kimi K3,输出价不到1/5
阶跃星辰还没正式官宣 Step 5,预览版已经提前出现在 Artificial Analysis。Step 5 Preview 是一款多模态推理模型,AA 标注其总参数约 600B、每次推理激活 27B,支持图片输入和 100 万 Token 上下文。
它在最新 Intelligence Index 得到 44 分,与 Kimi K3 Max 持平。Terminal-Bench 4.0 上,Step 5 Preview 得到 33%,Kimi K3 为 13%;SciCode 两者都是 59%。
Step 5 Preview 每百万输入 Token 1 美元,输出 2.7 美元;Kimi K3 分别为 3 美元和 15 美元。Step 5 的输出价格不到 K3 的五分之一,AA 跑完整套 Intelligence Index 的成本也只有 K3 的约四分之一。
阶跃星辰还没官宣 Step 5,但 AA 已经通过 StepFun API 跑完评测。参数和价格目前都还不是官方最终口径。
信源
动察 Beating 频道 · 动察 Beating 交流群
阶跃星辰还没正式官宣 Step 5,预览版已经提前出现在 Artificial Analysis。Step 5 Preview 是一款多模态推理模型,AA 标注其总参数约 600B、每次推理激活 27B,支持图片输入和 100 万 Token 上下文。
它在最新 Intelligence Index 得到 44 分,与 Kimi K3 Max 持平。Terminal-Bench 4.0 上,Step 5 Preview 得到 33%,Kimi K3 为 13%;SciCode 两者都是 59%。
Step 5 Preview 每百万输入 Token 1 美元,输出 2.7 美元;Kimi K3 分别为 3 美元和 15 美元。Step 5 的输出价格不到 K3 的五分之一,AA 跑完整套 Intelligence Index 的成本也只有 K3 的约四分之一。
阶跃星辰还没官宣 Step 5,但 AA 已经通过 StepFun API 跑完评测。参数和价格目前都还不是官方最终口径。
信源
动察 Beating 频道 · 动察 Beating 交流群
👍2🤔1