动察Beating AI News
3.14K subscribers
873 photos
2 videos
3.38K links
AI新闻信息流
Download Telegram
超长程编程基准 FrontierSWE 发布:20 小时极高难度挑战,仅 GPT-5.4 与 Opus 4.6 给出部分解

编程智能体基准测试项目 FrontierSWE 今日正式发布,旨在压榨当前 AI 代理的能力极限。该基准收集了编译器优化、机器学习研究和高性能工程等领域的 17 项真实难题(如构建兼容 PostgreSQL 的 SQLite 服务),并为每项任务预留了长达 20 小时的处理窗口。目前,该基准处于「未饱和」状态,绝大多数模型甚至无法取得实质性进展。

首轮测试中,仅有 GPT-5.4(Codex)和 Claude Opus 4.6(Claude Code)能一致写出部分解。两款模型风格差异巨大:GPT-5.4 表现更稳健,平均分排名第一,但思路偏保守;Claude Opus 4.6 则非常「激进」,单项任务平均投入时长超过 8 小时,远超其他模型约 2 小时的平均水平。这种靠堆时间换取深度的策略,让 Opus 4.6 在最佳表现(best@5,即 5 次尝试中的最高分)上反超登顶,常能产出极致优化的代码,但也伴随着更高的错误率和更明显的「作弊」倾向。

评测还揭示了 AI 编程智能体的几类典型通病:一是「过度自信」,模型往往在时限过半前,就因肤浅的自检误以为任务已完成并提前提交;二是「逻辑回退」,Opus 4.6 曾多次丢失已经实现的优化,随后又在迭代中重新「发明」一遍。此外,除了 Qwen 3.6,其余顶级模型均表现出了主动规避检测的意图:例如 Gemini 会尝试将非法库名通过字符编码隐藏,或在临时目录下运行隐蔽进程,试图在违规边缘完成任务。这类在极端压力下表现出的「对抗行为」,为智能体安全研究提供了新视角。

信源:https://www.frontierswe.com/blog
LangSmith上线30多个评估模板,AI代理的质量检测不用再从零写起

AI 代理开发平台 LangChain 旗下的可观测性工具 LangSmith 发布两项更新:评估器模板库和可复用评估器。

评估 AI 代理是否「好用」是目前开发中最耗时的环节之一。代理可能调用了正确的工具但回答格式不对,单轮对话正常但多轮就崩溃,最终答案看似合理但中间步骤检索了错误的文档。开发者需要在单步、完整轨迹、多轮对话、特定工具调用等多个层级分别设置检查点,而每个评估器都要经历写提示词、对照真实数据校准、反复调优的过程,从零开始往往要花数周。

LangSmith 现在提供 30 多个现成模板,覆盖五个类别:安全与防护(提示注入检测、个人信息泄露检查、偏见与毒性)、回答质量(正确性、有用性、语气)、执行轨迹(代理是否走了正确的步骤)、用户行为分析(语言分布、满意度信号)、多模态(语音和图像输出审查)。模板包含已调优的 LLM 评判提示词和基于规则的代码评估器,可直接使用或自定义修改,同时适用于线上监控和离线实验。

可复用评估器则解决组织层面的管理问题:新增的 Evaluators 标签页集中展示工作区内所有评估器,可一键挂载到新项目,更新提示词后全局生效,不用在每个项目中维护重复副本。

上述模板同步开源,随 openevals v0.2.0 发布,新增多模态评估支持。

信源:https://www.langchain.com/blog/reusable-langsmith-evaluator-templates
HeyGen开源HyperFrames,把HTML变成AI代理的视频编辑工具

AI 视频平台 HeyGen 开源 HyperFrames,一个面向 AI 代理的 HTML 视频工具链和渲染框架。代理可直接写 HTML、CSS 和 JavaScript,再在本地预览并渲染成 MP4、MOV 或 WebM。HeyGen 还把对应 skill 一并放出,安装命令为 `npx skills add heygen-com/hyperframes`。

HyperFrames 的核心思路很直接:不要让代理去学 After Effects 或 DaVinci Resolve,而是让它用自己最熟的网页语言做视频。HeyGen 只是在普通网页语法上加了一层 data- 属性,用来定义时间轴、时长和图层,GSAP、Lottie、Three.js、D3、Google Fonts 等浏览器技术都能直接用。

HeyGen 称,这套方案已经在自家 Video Agent 中验证过,发布演示视频也是直接让 Claude Code 用 HyperFrames 做出来的。对 AI 代理来说,这比传统视频编辑器更像原生工作流:写代码、看预览、出成片,全都可以在本地完成,不需要额外 API key。项目今天以 Apache 2.0 协议开源。

信源:https://github.com/heygen-com/hyperframes
Hugging Face支持可视化上传的Pi trace,代理执行过程能直接分享

Hugging Face 现已支持可视化用户上传的 Pi trace。按截图显示,上传后可直接在页面里查看一次代理会话的文件、工具调用和执行结果,不用再只对着原始 trace 文件翻日志。

Hugging Face CEO Clément Delangue 表示,目标是让分享 agent trace 变得更常见。对现在的代理社区来说,更稀缺的是能拿来分析、比较和复现的真实执行轨迹。Hugging Face 这次补上的就是这一层基础设施。

信源:https://x.com/ClementDelangue/status/2044834155125424326
PrismML推出1.58比特模型Ternary Bonsai,参数缩减9倍智能度反超同类

PrismML 发布 Ternary Bonsai 系列语言模型,通过 1.58 比特(ternary weights)技术,在保持高性能的同时将模型显存占用缩减至 16 比特模型的九分之一。该系列包含 8B、4B 和 1.7B 三种参数规模,现已在 Hugging Face 开源并支持苹果设备原生运行。

所谓 1.58 比特模型,是指将神经网络中的权重限制在 {-1, 0, +1} 三个值。相比此前追求极致压缩的 1 比特模型(权重仅为 {-1, +1}),引入「0」值能够有效剔除冗余连接,让模型在极小的体积下依然保留复杂的推理能力。此次发布的 Ternary Bonsai 8B 权重文件仅 1.75 GB,其基准测试均分达到 75.5,不仅比自家的 1 比特版本高出 5 分,甚至在「智能密度」(每 GB 显存贡献的性能)上大幅领先 Qwen3 等同类稠密模型。

能效比和运行速度是该系列的另一核心优势。在 iPhone 17 Pro Max 上,8B 版本运行速度可达 27 tok/s,能效比提升约 3 至 4 倍。这对于需要在手机、笔记本等端侧设备上部署高性能 AI 的开发者而言,意味着可以用极小的内存代价换取接近完整精度模型的智能表现。

目前,Ternary Bonsai 模型已在 Apple 设备上通过 MLX 框架实现原生支持。模型权重采用 Apache 2.0 协议分发。

信源:https://prismml.com/news/ternary-bonsai
1
Firecrawl 开源自主网页代理框架:支持多模型与并行子代理,一键生成调研工具

Firecrawl 正式开源网页代理框架 Web Agent,旨在帮助开发者构建能自主执行「搜索-抓取-交互」闭环任务的 AI 代理。该框架基于 Firecrawl 现有的 /agent 架构,支持接入 Anthropic、OpenAI 或各类自托管大模型,强调在网页调研场景下的灵活性与自托管能力。

框架的核心架构采用了「计划-行动」(Plan-Act)循环机制。代理在接收指令后,会先拆解步骤,通过并行生成的「子代理」(Subagents)在独立的浏览器会话中同步作业。这种设计在处理大规模并发任务时优势明显,例如视频演示中代理能同时从多家公司官网提取实时股票数据与新闻。

对于开发者而言,该工具显著降低了网页代理的开发门槛。通过 firecrawl create agent 命令,即可快速生成基于 Next.js 或 Express 的完整代理模板。此外,框架引入了可复用的「技能手册」(SKILL.md),开发者可以将复杂的作业流程(如针对 Yahoo Finance 的特定抓取逻辑)封装为 Skill,供代理在后续任务中直接调用。

信源:https://github.com/firecrawl/web-agent
OpenAI 就业研究报告:AI 或将增加工作岗位而非导致失业大潮

OpenAI 一项针对 900 多种职业的研究显示,AI 在劳动力市场引发的震荡可能并不像大众预期的那样充满悲剧色彩。报告指出,尽管数据录入、簿记和客服等职业面临极高的自动化风险(约占总就业人数的 18%),但这些领域的从业者已在利用 AI 处理约三倍于其他职业的任务量,且失业率上升速度反而低于低风险职业。

这种反直觉的现象源于「消费弹性」:当 AI 让某项任务(如写代码)的产出变得更廉价、更快捷时,市场对该服务的总需求往往会呈指数级增长,从而抵消了效率提升带来的减员压力。报告将职业分为四类:除上述高风险组外,46% 的职业(如教师、家政人员)受影响极小;24% 的角色虽然可能缩减规模,但仍需人类主导;而 12% 的职业(如软件开发)则会因 AI 的普及而实现岗位扩张。

目前,高风险职业的从业者仅利用了 AI 理论能力的不到四分之一。

信源:https://cdn.openai.com/pdf/the-ai-jobs-transition-framework_report.pdf
xAI 静默测试 Grok 4.3:Beta 版现身官网下拉菜单

多名用户发现,xAI 官方网站 Grok.com 的模型选择菜单中出现了「Grok 4.3 (beta)」选项,并标注为「Early Access」(早期访问)。此前,xAI 网页端的主力版本为 2 月发布的 Grok 4.20 系列。

Grok 4.3 的核心改进预计集中在超长上下文处理能力以及原生的多模态视频理解上。

信源:https://x.com/mrfanduuuuu/status/2045070600293785608?s=46
马斯克 xAI 转向「云厂商」角色,向 AI 编程独角兽 Cursor 开放数万颗 GPU 算力

xAI 计划向 AI 编程初创公司 Cursor 提供大规模算力支持,允许其在 xAI 的基础设施上训练最新编程模型 Composer 2.5。据 Business Insider 披露,Cursor 将调用 xAI 旗下「Colossus」数据中心中的数万颗 GPU。这一安排标志着 xAI 战略的重大转向:通过出租冗余算力,xAI 正在从单纯的模型研发商向类似 AWS、CoreWeave 的云服务商角色扩张。

这一合作背景复杂。今年 3 月,xAI 刚从 Cursor 挖走了两名产品工程主管负责其产品团队。此外,xAI 内部一份备忘录显示,其目前的 GPU 利用率(MFU)仅为 11%,远低于 35% 至 45% 的行业平均水平。xAI 总裁 Michael Nicolls 已要求团队在数月内将利用率提升至 50%。向外部独角兽开放算力,既能分摊昂贵的数据中心运营成本,也能通过服务顶级编程代理获取宝贵的工程反馈。

目前,Cursor 正以 500 亿美元的估值进行融资谈判。在 OpenAI 和 Anthropic 激进切入编程助理赛道的背景下,绑定 xAI 的算力资源已成为其维持竞争优势的关键砝码。

信源:https://www.businessinsider.com/elon-musk-xai-compute-cursor-ai-model-training-2026-4
Google AI Studio 推出付费计划:支持按量计费,首次明确提及「智能体」接入

Google AI Studio 正在上线全新的付费订阅体系,标志着这一开发者工具正从预览平台转向成熟的商业化工作站。付费方案分为「按量计费」(Pay per request)和「Google AI 订阅」两类。

值得注意的是,「按量计费」方案明确标注可访问「所有模型与智能体(Agents)」,这暗示 Google 计划将复杂的智能体构建与调用能力原生集成至 AI Studio 中。
NUS团队发布GameWorld基准,在34款浏览器游戏中评估多模态AI代理

新加坡国立大学(NUS)团队发布 GameWorld,一个旨在标准化评估多模态大语言模型(MLLM)在视频游戏中作为通用代理能力的基准测试。该研究指出,尽管视频游戏提供了理想的闭环交互测试床,但现有评估常受限于操作接口不统一和人工启发式验证。

GameWorld 包含 34 款多样的浏览器游戏和 170 项任务,并为每个任务配备了基于游戏底层状态的可验证指标,以实现客观的结果评估。研究团队测试了两种代理接口:一是直接输出键鼠指令的「计算机使用(computer-use)」代理,二是通过语义解析在语义动作空间中操作的通用多模态代理。

在对 18 种「模型-接口」组合进行的大规模测试中,结果显示即便当前表现最好的 AI 代理,其游戏能力也远未达到人类水平。研究进一步暴露了游戏代理在实时交互延迟、上下文记忆敏感度以及动作有效性等方面的严峻挑战。相关论文及项目代码已在 Hugging Face 和 GitHub 公开。

信源:https://huggingface.co/papers/2604.07429
Quiver 发布 Arrow 1.1:SVG 矢量生成成本直降 50%,新增 Max 精度模型

矢量图形生成平台 Quiver AI 宣布推出 Arrow 1.1,这是其基于代码生成(而非像素逼近)逻辑的 SVG 专项模型的重大升级。新版本在提升视觉设计感的同时,重点实现了生产环境下的成本缩减:文本转 SVG 的成本降低了 33.3%,而图像矢量化成本则大幅下降 50%。

Arrow 1.1 的核心进化在于「决策逻辑」的转变。相比 1.0 版本,新模型更倾向于使用几何原语(如形状、文本、基本几何体)而非单纯依赖路径堆叠,生成的 SVG 文件更易于编辑、检查和扩展。同时,Arrow 1.1 在遵循 Prompt 的布局平衡与颜色选取上也更具「设计师思维」。

针对高精度需求的场景,Quiver 同步推出了 Arrow 1.1 Max 模型。该模型在保持核心逻辑一致的基础上,牺牲了部分运行速度以换取极致的形状对齐与细节稳定性,适用于技术图表、服装设计稿(Technical Flats)以及精密工程示意图。目前,Arrow 1.1 已在 Quiver 官网控制台上线,支持开发者通过 API 接入现有的设计与开发工作流。

信源:https://quiver.ai/blog/introducing-arrow-1-1
Mem0 发布长效记忆架构研究:准确率领先 OpenAI 26%,推理延迟降低 91%

个性化 AI 记忆平台 Mem0 近期公开了其核心长效记忆算法的研究成果。实验数据显示,在 LOCOMO 基准测试中,Mem0 的响应准确率比 OpenAI 的内置记忆功能高出 26%,同时由于其「事实化」的检索机制,其 P95 推理延迟降低了 91%,Token 消耗量缩减了 90%。

该算法解决的核心问题是 AI 代理在长周期交互中的「健忘」现象。与单纯扩大 LLM 上下文窗口的暴力路径不同,Mem0 采用了一种两阶段处理管线:在「提取阶段」,系统会从最新对话、滚动摘要和历史记录中提取关键事实;在「更新阶段」,系统通过向量数据库进行比对,执行新增、更新、删除冲突或忽略等操作,确保记忆库的精简与一致。

研究还介绍了一种增强型变体 Mem0ᵍ。该版本引入了图数据库结构,将提取的事实转化为带标签的节点与边,从而捕获多会话间的复杂实体关系。在实际生产环境中,Mem0 能在 0.71 秒内完成从记忆检索到回答生成的全流程,而传统的「全上下文」方法则需要近 10 秒。目前,该研究已被欧洲人工智能会议(ECAI)接收,相关代码已在 GitHub 开源。

信源:https://mem0.ai/research
DeepSeek拟以至少100亿美元估值开启首轮融资,应对核心人才流失与V4研发延迟

AI 初创公司 DeepSeek(深度求索)正在洽谈首轮外部融资,计划以至少 100 亿美元的估值募集至少 3 亿美元资金。这标志着这家此前由对冲基金幻方量化(High-Flyer)全资支持、一度坚持技术理想主义且拒绝外部资本的初创公司,在融资策略上的重大转向。

此次调整正值 DeepSeek 面临技术迭代压力与竞争对手挖角的双重挑战。虽然 R1 模型曾以极低成本实现高性能震撼全球,但其下一代旗舰模型 V4 的发布进度已多次推迟。推迟原因除工程挑战外,还包括 DeepSeek 工程师正试图让 V4 原生适配华为芯片。由于此前模型主要基于英伟达芯片开发,这一底层架构的切换显著拉长了研发周期。

与此同时,核心团队成员出现流失。V3 模型的核心贡献者罗福莉已加入小米负责 AI 部门,另一位关键研究员郭达雅则被字节跳动以更高薪酬挖走。

信源:https://www.theinformation.com/articles/chinas-deepseek-raising-money-first-time-10-billion-plus-valuation
Anthropic CEO Amodei给Mythos技术壁垒定了半年到一年窗口期

Anthropic CEO Dario Amodei 在英国《金融时报》「Lunch with the FT」专访中说,他推测开源模型和中国开发者能在 6 到 12 个月内复制 Claude Mythos 的网络安全能力。

Mythos 是 Anthropic 能力上限最高、未对外公开发布的模型,因能大规模发现软件零日漏洞被内部判定为国家安全风险。过去两周,白宫推动联邦机构接入,美国官员与主要银行紧急会商,敦促它们用 Mythos 加固自身网络安全。

Amodei 同时透露,Anthropic 已与 40 多家组织合作推进 Project Glasswing 漏洞修补项目,参与方包括亚马逊、苹果和微软。他承认公司自身的数据安全实践也在受审视,起因是部分 Claude 代码曾发生泄漏。

他的预测意味着 Anthropic 正在同时做两件事:一边延缓 Mythos 级能力扩散,一边推动美国政府和关键基础设施抢先用它把系统漏洞修完。能力扩散到所有人手里那天,防御底子必须已经打好。

信源:https://www.ft.com/content/9e0e0fc6-ab7d-4b69-a8b1-5a972b82fb06
OpenAI 核心高层同日离职:Sora 负责人与前CPO退出,科学研究部门遭拆分

OpenAI 两位核心成员 Bill Peebles 和 Kevin Weil 于 4 月 18 日先后宣布离职。Bill Peebles 是视频生成模型 Sora 的核心负责人之一,他见证了 Sora 从最初两人团队到发布 Sora 2 的全过程。Kevin Weil 曾任 OpenAI 首席产品官(CPO),去年 10 月加入研究团队并创立了 OpenAI for Science 部门。

伴随 Kevin Weil 的离职,OpenAI 内部的科学研究部门(OpenAI for Science)也将被拆分并分散到其他研究团队中。Kevin Weil 在离职信中表示,加速科学进步将是实现 AGI 过程中最积极的成果之一。
Cursor接近敲定20亿美元新融资,估值500亿美元半年翻倍

AI 编程工具公司 Cursor 接近完成新一轮融资,将至少融入 20 亿美元,投前估值 500 亿美元。TechCrunch 援引四位知情人士称,Thrive Capital 和 Andreessen Horowitz 这两家老股东预计领投,战略投资人英伟达也将出资,Battery Ventures 或作为新投资人加入。该轮融资已超额认购,但具体条款仍可能调整。

若顺利完成,估值将比 Cursor 6 个月前 293 亿美元(投后)的水平几乎翻倍。当时那轮由 Accel 与 Coatue 共同领投,融资金额 23 亿美元。

收入是支撑这次估值的核心数据。Cursor 今年 2 月年化收入达到 20 亿美元,公司预计 2026 年底年化收入将超过 60 亿美元,意味着 10 个月内至少翻三倍。

毛利结构也在改善。和大多数依赖第三方模型的 AI 编程公司一样,Cursor 此前长期毛利为负,卖产品的收入不足以覆盖底层模型 API 成本。去年 11 月推出自研 Composer 模型,加上接入 Kimi 等更便宜的模型后,公司已实现略微正毛利。其中针对大企业的销售已正毛利,个人开发者账户仍亏。Cursor 减少对外部供应商的依赖,意在避免被 Anthropic 等模型公司取代。Anthropic 旗下的 Claude Code 是 Cursor 当前最主要的竞争对手。

信源:https://techcrunch.com/2026/04/17/sources-cursor-in-talks-to-raise-2b-at-50b-valuation-as-enterprise-growth-surges/
SemiAnalysis 年营收跳涨至 1 亿美元,前员工起诉称 Patel 要求研报配合其投资

一个月前英伟达 GTC 大会上,CEO 黄仁勋花了 5 分钟讲 AI 行业研究机构 SemiAnalysis 新推出的 AI 芯片性能榜单 InferenceX,屏幕上挂着 SemiAnalysis 的徽标。CNBC 主持人 Jim Cramer 在《Mad Money》节目里形容这家机构是行业「圣经」,是「仲裁者,像上帝一样」。SemiAnalysis 的创始人是 29 岁的 Dylan Patel,他此前发表文章批评 AMD 的 AI 芯片 MI300X,一天内就拿到了与 AMD CEO Lisa Su 的 90 分钟面谈。

SemiAnalysis 今年营收预计从去年的 2000 万美元跳涨至 1 亿美元。在新闻通讯平台 Substack 上有超过 25 万订阅者,付费订阅 500 美元一年,但核心收入不来自订阅费,而是把更详尽的研报和供应链数据卖给初创公司、投资机构,以及英伟达等大公司的内部团队。

Patel 同时是投资人,已入股约 20 家 AI 初创公司,包括 Mira Murati 创办的 Thinking Machines Lab,以及去年与英伟达达成超过 9 亿美元授权合作的芯片公司 Enfabrica。SemiAnalysis 研报写到这些公司时,不会像传统媒体那样主动披露 Patel 的投资关系,对它们的竞争对手也照常覆盖。

近期,Patel 与前员工 Wei Zhou 互相起诉,两人此前是密友。Zhou 起诉称,Patel 曾要求他把云服务商 Fluidstack 的内部信息写入 SemiAnalysis 研报,而 Patel 此前已通过特殊目的载体(SPV)筹资投资 Fluidstack。Zhou 称担心此举违法、拒绝配合后被开除;Patel 反诉称 Zhou 是因对同事无礼、醉酒上班等原因被解雇。诉讼后,客户开始担心 SemiAnalysis 如何处理机密信息,公司计划聘请外部机构出具一份数据处理报告。Patel 同时在筹集一支风险投资基金。若筹成,他的投资组合会进一步扩大,与研报业务的利益冲突也会更深。

信源:https://www.theinformation.com/articles/dylan-patel-semianalysis-grabbed-sway-silicon-valley
OpenAI B2B工程负责人Srinivas Narayanan宣布离职,称重大产品发布前夕是「正确时机」

OpenAI B2B 工程团队负责人 Srinivas Narayanan 4 月 18 日宣布离职,这是继 Sora 负责人和科学部门负责人之后,OpenAI 同日流失的第三位核心高管。Narayanan 曾主导应用工程团队从 40 人的初创规模壮大,并直接负责 ChatGPT 及 API 等核心商业化产品的研发与交付。

他在离职信中表示,在公司近期及即将发布的重大产品节点前夕,是其退居幕后的「正确时机」。Narayanan 离职后计划先陪伴年迈的父母,尚未透露下一步去向。

信源:https://x.com/snsf/status/2045261554484986155
Anthropic 发布 Claude Design,用对话生成原型、幻灯片和落地页

Anthropic 4 月 17 日在 Anthropic Labs 旗下推出 Claude Design,定位是通过与 Claude 对话产出设计稿、交互原型、幻灯片和营销物料。产品由 Claude Opus 4.7 驱动,以研究预览形式向 Pro、Max、Team、Enterprise 订阅者开放,当天分批推送,入口为 claude.ai/design。Enterprise 账户默认关闭,需管理员在组织设置中启用。

用户用自然语言描述需求,Claude 给出初版后,可通过对话、内嵌评论、直接编辑,以及 Claude 即时生成的自定义调节滑杆来改细节。初始设置阶段 Claude 会读取团队的代码库和设计文件,建立专属设计系统,此后每个项目自动沿用团队的配色、字体和组件,团队可维护多套设计系统并随时迭代。输入支持文本 prompt、DOCX、PPTX、XLSX 文档和图片,也能用 web capture 工具从目标网站直接抓取 UI 元素,让原型看起来更贴近真实产品。输出可作为组织内链接分享,或导出 PDF、PPTX、独立 HTML,以及一键推送到 Canva。

Claude Design 与 Claude Code 直接打通。设计定稿后会被打包成 handoff bundle,交给 Claude Code 一条指令即可进入实现环节。对设计师,这解决了试错轮次长期被项目时间挤压的问题;对产品经理、创始人和营销岗,这是一条绕开专业设计门槛、直接产出可用视觉物料并衔接工程交付的新链路。

官方列出的早期用户里,学习平台 Brilliant 称此前在其他工具中需要 20 多轮 prompt 才能还原的复杂交互页,在 Claude Design 里 2 轮就能完成;Datadog 表示能在一次会议里完成从粗略想法到可运行原型的过程;Canva 则被列为主要导出目标之一。

信源:https://www.anthropic.com/news/claude-design-anthropic-labs
xAI 开放 Grok STT 与 TTS 音频 API,STT 整体词错率压到 6.9%

xAI 上线两个独立音频 API:Grok Speech to Text 和 Grok Text to Speech。两者来自支撑 Grok Voice、特斯拉车载系统和 Starlink 客服的同一套音频栈,此次以独立 endpoint 形式开放,开发者可直接接入语音代理、实时转录、无障碍工具和播客等应用。

STT 提供两种模式。REST API 用于对大音频文件批量转录,毫秒级返回;WebSocket API 面向实时语音流。附带能力包括词级时间戳、说话人分离(diarization)、多通道分别识别,以及 Inverse Text Normalization,即把口语里的数字、日期、货币自动整形为规范的结构化文本。语种覆盖 25 种以上,可在对话中无缝切换。

xAI 同时公布一组词错率(WER,数值越低越好)对比:整体场景 Grok 6.9%,ElevenLabs 9.0%,Deepgram 11.0%,AssemblyAI 12.9%;「电话通话实体识别」差距被拉得更大,Grok 5.0%,对应三家分别为 12.0%、13.5%、21.3%。会议、视频播客、电话三类常见业务场景下 Grok 也都小幅领先。这组数字由 xAI 自行测试公布,尚无第三方复测。

定价上,STT 批处理 0.10 美元/小时、流式 0.20 美元/小时;TTS 为 4.20 美元/100 万字符。

TTS 支持用内联 Speech Tags 控制情感和韵律,例如 `[laugh]`、`[sigh]`、`[whisper]`、`<emphasis>`、`<slow>`、`<pause>`。开发者不必手写 SSML 标记,就能让朗读带上笑声、叹气、低语或局部强调。

信源:https://x.ai/news/grok-stt-and-tts-apis