动察Beating AI News
3.13K subscribers
869 photos
2 videos
3.38K links
AI新闻信息流
Download Telegram
情感语音AI公司Hume AI首次开源TTS模型TADA:1000+测试样本零内容幻觉,比同级LLM语音合成快5倍

情感语音 AI 公司 Hume AI 首次开源了TTS(文本转语音)模型 TADA(Text-Acoustic Dual Alignment)。该模型的核心创新是将文本 token 与声学特征做 1:1 对齐,在单一同步流中同时生成文本和语音,从根本上消除了传统 LLM TTS 中因音频序列远长于文本序列而导致的幻觉问题。

官方公布的性能数据:在 1000+ 测试样本中实现零内容幻觉(传统系统常出现漏词、多词等问题),推理速度比同级 LLM TTS 快 5 倍。在相同的 2048 个 token 预算下,TADA 可覆盖约 700 秒音频,而传统系统仅覆盖约 70 秒,同时附带免费文本转录且不增加延迟。代码和预训练模型已在 PyPI 上开放下载。

Hume AI 由心理学博士 Alan Cowen 创立,专注于理解和生成具有情感表达能力的语音 AI。今年 1 月,Cowen 和约 7 名核心工程师被谷歌 DeepMind 以 IP 授权模式引入(非收购),用于增强 Gemini 的情感语音能力。Hume AI 在新任 CEO Andrew Ettinger 领导下继续独立运营。

信源:https://www.hume.ai/blog/opensource-tada
Codex又挂了:工程负责人承认需求增速超出预期,同期ChatGPT文件上传下载也出现故障

OpenAI 状态页显示 Codex 再次无响应,截至发稿已持续超过 1 天,官方表示仍在实施修复方案。同时 ChatGPT 也出现文件上传错误(持续 7 小时,已进入监控恢复阶段)和文件下载错误(持续 5 小时,已确认问题)。

Codex 工程负责人 Thibault Sottiaux 在 X 上表示:「我们正在尽快为 Codex 增加算力,但需求增速超出预期,部分用户的服务可能会有些卡顿。团队在幕后全力工作。」这是 Codex 连续两天出现服务中断。昨日故障修复后,团队曾按惯例重置了所有用户的速率限制作为补偿。

信源:https://x.com/thsottiaux/status/2031411642618228935
1720亿token实测35个模型:上下文越长幻觉越多,200K时所有模型捏造率均超10%

研究者 JV Roig 发布论文,使用名为 RIKER 的确定性评估方法(无需人工标注或 LLM 裁判),对 35 个开源模型在文档问答场景中的幻觉率进行了迄今最大规模的系统测试:覆盖 3 种上下文长度(32K、128K、200K token)、4 种温度设置和 3 种硬件平台(NVIDIA H200、AMD MI300X、Intel Gaudi 3),总评估量超过 1720 亿 token,比此前同类研究高出一个数量级。

核心发现:

(1)即使是表现最好的模型,在 32K 上下文时仍有 1.19% 的捏造率,顶级模型区间为 5% 到 7%。上下文扩展到 128K 时捏造率接近翻三倍,200K 时所有模型均超过 10%。

(2)模型选择是影响准确率的最大因素,不同模型间准确率差距达 72 个百分点,且模型家族对抗幻觉的能力差异大于模型参数量的影响。

(3)温度的影响比预期复杂。T=0.0 在约 60% 的情况下整体准确率最高,但更高温度反而降低了多数模型的捏造率,并大幅减少「死循环生成」(coherence loss)现象,T=0.0 下的死循环发生率最高可达 T=1.0 的 48 倍。

(4)「找到事实」和「不捏造事实」是两种独立能力。擅长定位文档中信息的模型,可能同样会编造文档中不存在的信息。

(5)不同硬件平台上的结果一致,部署决策无需考虑硬件差异。

信源:https://arxiv.org/abs/2603.08274
更新:Codex恢复稳定,速率限制再次重置,工程负责人此前称「GPU集群快要熔化」

Codex 工程负责人 Thibault Sottiaux 确认 Codex 已恢复稳定,并再次按下了速率限制重置按钮。此前他曾发文称「Codex 的 GPU 集群快要熔化了(GPU fleet is still melting),团队日夜赶工以跟上需求」。这是连续第二天出现故障后重置速率限制的循环。

信源:https://x.com/thsottiaux/status/2031605592352313567
Kimi创始人杨植麟将首次在美国公开亮相,于英伟达GTC分享K2.5大规模训练细节

月之暗面(Moonshot AI)创始人兼 CEO 杨植麟将于 3 月 17 日在英伟达 GTC 大会上发表演讲,主题为「How We Scaled Kimi K2.5」,归属 Open Models Session,时间为太平洋时间上午 11:00—11:40。Kimi 官方称这是杨植麟首次在美国的公开亮相。

信源:https://x.com/Kimi_Moonshot/status/2031571459118911534
ChatGPT新增交互式数理可视化:拖动三角形边长实时看勾股定理变化,覆盖70+高中和大学核心概念

OpenAI 为 ChatGPT 推出「动态可视化解释」(dynamic visual explanations)功能。用户提出数学或科学问题时,ChatGPT 不再仅给出文字回答,还会生成可交互操作的可视化模块:图表、几何图形和公式模型均可直接在对话中拖动调整变量,实时观察结果变化。例如提问勾股定理时,可以拖动三角形的边长,立即看到斜边随之更新。

该功能目前覆盖 70 余个数学和科学核心概念,包括二项式平方、查理定律、圆面积、复利、库仑定律、指数衰减、胡克定律、动能、线性方程和欧姆定律等,主要面向高中和大学阶段学习者。OpenAI 称每周有 1.4 亿用户使用 ChatGPT 获取数学和科学帮助。该功能对所有已登录 ChatGPT 用户开放,后续将扩展更多主题。

信源:https://openai.com/index/new-ways-to-learn-math-and-science-in-chatgpt/
分析:疯传的「每用户亏5000美元」是Cursor的账单不是Anthropic的成本,被挤压的恰恰是Cursor自己

Forbes 报道称 Cursor 内部分析发现,Anthropic 的 200 美元/月 Claude Code Max 订阅可消耗约 5000 美元计算量。这个数字在社交媒体上被当作 Anthropic 大幅烧钱的证据广泛转发,但科技博客作者 Martin Alderson(catchmetrics.io 联合创始人)撰文指出:5000 美元是按 Anthropic API 零售价算的,而非实际推理成本。在 OpenRouter 等开放推理市场上,同等规模开源模型的竞争性定价约为 Anthropic API 价格的十分之一,这些供应商需要覆盖 GPU 成本并盈利才能持续经营。按此推算,最重度用户的实际推理成本约 500 美元,而 Anthropic 官方数据显示平均用户每日 API 等价消费仅约 6 美元(月均约 180 美元),以十分之一实际成本计算,每月服务成本约 18 美元,对应 20 至 200 美元订阅价,平均用户已可盈利。

关键在于:5000 美元对 Cursor 是真实的,因为 Cursor 必须按 Anthropic 的零售 API 价格采购模型。Forbes 原文证实 Cursor 消费端订阅确实是负毛利。Cursor 正试图摆脱这一困境:约 20 名 AI 研究员在基于 DeepSeek、Kimi、Qwen 等中国开源模型训练自研 Composer 系列,Composer 1.5 已成为平台第二热门模型,运行成本远低于 Anthropic 大模型。但开发者偏好仍在 Anthropic 一边,Claude Code 年化收入已达 25 亿美元,超越 Cursor 的 20 亿美元。

信源:https://martinalderson.com/posts/no-it-doesnt-cost-anthropic-5k-per-claude-code-user/
腾讯云智能体开发平台集体涨价:三款第三方模型结束免费,混元HY2.0涨超4倍

腾讯云智能体开发平台今日发布公告,宣布自 3 月 13 日起对部分模型计费策略进行调整,涉及两类变更。

第一类是模型结束免费公测:GLM 5(智谱)、MiniMax 2.5、Kimi 2.5(月之暗面)三款第三方模型将转为正式商用,按量计费。非套餐用户需在 3 月 13 日前手动开启后付费设置,套餐用户则通过 PU 资源抵扣。

第二类是自研模型涨价:混元系列 Tencent HY2.0 Instruct 输入价格从每千 tokens 0.0008 元调至 0.004505 元,输出从 0.002 元调至 0.01113 元;HY2.0 Think 输入从 0.001 元调至 0.0053 元,输出从 0.004 元调至 0.0212 元,涨幅约 4.3 至 4.6 倍。

信源:https://cloud.tencent.com/announce/detail/2227
Claude移动端今日推送更新:新增MCP连接,改进语音模式、LaTeX渲染和长Prompt性能

Anthropic 移动端产品经理 Robert Bye 宣布 Claude iOS/Android 应用今日推送一批更新,改进项包括语音模式、语音转录、LaTeX 渲染、Artifact 展示、长 Prompt 处理性能、MCP 服务器连接和附件上传。其中 MCP 连接意味着移动端用户也可接入外部工具和数据源。

信源:https://x.com/RobertJBye/status/2031508037161120045
Devv.AI创始人透露正在开发「AI原生阅读器」,此前曾打造开发者AI搜索引擎

Devv.AI 创始人兼 CEO 张佳圆(Jiayuan Zhang)今日发帖称正在开发「可能是有史以来最好用的 AI native 阅读器」,并附上了一张类似书籍阅读界面的截图。张佳圆曾任 TikTok 美国工程师,2022 年创立 Devv,最初以面向开发者的 AI 搜索引擎起步,2024 年月收入达 3 万美元,后转型为全栈 AI 编程 Agent。此次透露的阅读器产品尚未公布具体功能和发布时间。

信源:https://x.com/jiayuan_jy/status/2031596141004075488
深圳龙华区跟进龙岗「龙虾十条」:发布AI智能体十大行动,开放100个场景,单项最高资助2000万元

继龙岗区率先发布「龙虾十条」后,深圳龙华区 3 月 10 日也发布了《关于支持AI智能体与OPC协同发展十大行动(征求意见稿)》,从算力基建、场景开放、基地打造、赛事举办、企业培育、基金设立、平台构建、体系赋能、人才引育、素养提升十个维度,构建技术研发到市场开拓的全链条赋能体系。

资助力度上,龙华提出开放 100 个 AI 智能体应用场景,最高资助 400 万元;算力券补贴最高 300 万元;智能体核心技术攻关给予研发费用 50%、最高 100 万元资助。高额奖励集中在两项:开发的算法纳入国家网信办《境内深度合成服务算法备案清单》的企业最高奖 500 万元,公共服务平台建设项目最高资助 2000 万元。针对 OPC(一人公司),龙华通过组建产业专项基金,对获得机构投资的科技企业最高给予 200 万元资助。龙华目前已集聚 AI 相关企业 607 家,其中规上企业 300 家,2025 年产业增加值 41.53 亿元。

信源:https://www.yicai.com/news/103080918.html
Sora独立App排名从榜首跌至165:OpenAI计划将视频生成整合进ChatGPT,试图复制吉卜力时刻

OpenAI 计划将 Sora AI 视频生成功能整合进 ChatGPT。Sora 独立 App 去年 9 月上线后一度登上 App Store 榜首,但用户活跃迅速下滑,目前排名已跌至第 165 位。Altman 此前在全员会上承认,仅有少量 Sora 用户会在 App 内公开分享视频。

将 Sora 接入 ChatGPT 有望提升周活用户数,目前约 9.2 亿,距离去年定下的 10 亿目标仍有差距。OpenAI 可能希望复制去年 3 月吉卜力风格照片引爆全网、将算力推至极限的那一刻。ChatGPT 此后已成为个人和企业用户(包括家具和服装设计师)的主要 AI 图像生成工具。Sora 独立 App 将继续运营,但长期规划尚不明确。

谷歌 Gemini 已通过 Veo AI 提供视频生成功能。OpenAI 近期也撤回了在 ChatGPT 内直接内置购物的计划。OpenAI 预计从现在到 2030 年推理成本将超过 2250 亿美元,并已为病毒式功能引发的用量峰值储备算力。

信源:https://www.theinformation.com/articles/openai-plans-launch-sora-video-ai-chatgpt-strategy-shift
Shopify CEO亲自开发的本地文档搜索引擎qmd发布2.0:新增稳定SDK,面向AI Agent场景设计

Shopify CEO Tobi Lütke 今日宣布其个人开源项目 qmd(Query Markup Documents)发布 2.0 版本。qmd 是一款完全本地运行的文档搜索引擎,可索引 Markdown 笔记、会议纪要和知识库,融合 BM25 全文检索、向量语义搜索和 LLM 重排序三路混合检索,通过 node-llama-cpp 加载 GGUF 模型在设备端完成全部计算。

2.0 的核心变化是声明了稳定的 SDK/Library API(npm 包 `@tobilu/qmd`),开发者可直接在 Node.js 或 Bun 项目中以库的形式集成,无需依赖 CLI。MCP server 被完全重写为 SDK 的消费者,CLI 和 MCP 模块拆分到独立子目录,整体架构更简洁。qmd 原生支持 MCP 协议,可直接接入 Claude Desktop 和 Claude Code 等 AI Agent 客户端。Lütke 此前曾在内部备忘录中将 AI 熟练度列为 Shopify 全员的「基本要求」。

信源:https://x.com/tobi/status/2031397006594253237
Perplexity用AI Agent向OpenClaw提交PR作为产品演示,因代码错误被创始人封禁账号

Perplexity 官方账号昨日发帖演示其 Perplexity Computer 产品,展示了一个全自动开发流程:针对 OpenClaw 仓库的一个 open issue,Perplexity Computer 自动 fork 仓库、制定修复方案、调用 Claude Code 编写代码并通过 GitHub CLI 提交 PR。

然而社区迅速指出该 PR 存在根本性错误——混淆了 `groupAllowFrom`(群组发送者白名单)和 `channels.telegram.groups`(群聊白名单),维护者将 PR 关闭且未接受。OpenClaw 创建者 Peter Steinberger 对此直接回应:「Big no for spamming our repo with a slop PR. Account banned.」(不允许用垃圾 PR 骚扰我们的仓库,账号已封禁。)

有用户质疑用 AI 生成营销邮件和用 AI 提交 PR 有何区别,Steinberger 回答:「Both is shit and I'd ban/block.」

信源:https://x.com/steipete/status/2031548802688049567
OpenCode联创公开内部备忘录:Coding Agent没让我们更快,却让我们丧失了延迟满足的能力

开源 AI 编程工具 OpenCode 联合创始人 Dax Raad 今日公开了一份发给团队的内部备忘录,列出 LLM 驱动的 Coding Agent 给团队带来的三个挑战。他认为这些问题本身并非全新,但被 LLM 大幅放大了。

首先是发布门槛在下降。用 prompt 催生新功能太容易,不值得发布的功能也在发布。Raad 强调门槛应该保持高标准,「原型不比花时间做产品思考更有价值」。

其次是重构意愿在萎缩。当原始设计出偏需要 hack 修复时,以前开发者会痛苦地推动重构,现在 LLM 可以承受 hackiness,团队便不再较真。

第三是清理时间被挤压。LLM 一直拉着团队去做下一个功能,但修好现有功能和改进构建流程的价值是新功能的 100 倍。

Raad 认为最糟糕的一点是,这些取舍并没有换来速度。「我认为我们的推进速度和正常节奏一样。」他说过去六个月团队从几乎不用 Coding Agent 变成事事依赖,「侵蚀了我们延迟满足的能力」,需要找到平衡。

信源:https://x.com/thdxr/status/2031377117007454421
动察Beating AI News
OpenCode联创公开内部备忘录:Coding Agent没让我们更快,却让我们丧失了延迟满足的能力 开源 AI 编程工具 OpenCode 联合创始人 Dax Raad 今日公开了一份发给团队的内部备忘录,列出 LLM 驱动的 Coding Agent 给团队带来的三个挑战。他认为这些问题本身并非全新,但被 LLM 大幅放大了。 首先是发布门槛在下降。用 prompt 催生新功能太容易,不值得发布的功能也在发布。Raad 强调门槛应该保持高标准,「原型不比花时间做产品思考更有价值」。 其次是重构意愿在萎缩。当原始设计出偏需要…
Linear CEO转发响应:能做不等于该做,构建的力量越大,思考的需求越高而非越低

研发项目管理工具 Linear CEO Karri Saarinen 转发 OpenCode 联合创始人 Dax Raad 关于 Coding Agent 侵蚀团队延迟满足能力的帖子后,发表了更系统的论述。他认为当前产品建设正在失去判断力和节制感,「当你把某个东西变成普遍推崇的指标,无论是 token 消耗量、原型数量还是 Agent 写代码的比例,你就开始看不到真正重要的东西。」

Saarinen 列出五个危险信号:

1. 排行榜和采纳率指标可以作为方向参考,但它们不能告诉你正在造的东西是否好、是否该存在。
2. 用户不关心代码有多少比例由 Agent 写成,他们只关心结果,更快通常并不等于更好。
3. LLM 生成的原型就像深夜白板讨论,当下很兴奋,几天后才发现想法肤浅或根本方向不对。
4. 增加功能的危险性并没有因为开发成本降低而消失,每一项新增都带来复杂性、维护成本和用户困惑。
5. 不是所有东西都需要做成 Agent 形态,一个简单的定时任务不需要完整的 LLM 沙箱。

他总结为两句话:能做,不等于该做。构建的力量越大,思考的需求应该越高而非越低。

信源:https://x.com/karrisaarinen/status/2031461244093571093
LangChain CEO长文:Coding Agent时代,PRD已死但产品文档长存,瓶颈从实现转向评审

LLM 应用开发框架 LangChain 联合创始人兼 CEO Harrison Chase 发表长文,系统分析 Coding Agent 如何重塑软件公司的工程、产品、设计(EPD)三大职能。

Chase 认为 EPD 的全部产出归根结底就是代码,而 Coding Agent 让写代码变得极其廉价,这从根本上改变了 EPD 的运作方式。他提出三个结构性变化:

1. PRD 已死,但产品文档长存。 传统流程是产品写 PRD、设计出 mock、工程实现。Coding Agent 可以直接从想法生成可运行原型,这套瀑布流程不再成立。但原型仍然需要配套的产品需求文档才能进入评审,「未来的 PRD 可能就是结构化的、有版本管理的 prompt。」
2. 瓶颈从实现转向评审。 任何人都能写代码,意味着原型数量激增,但工程、产品、设计三方的评审带宽没有同步扩展。评审正在成为所有职能的共同瓶颈。
3. 团队分化为两类角色:Builder 和 Reviewer。 Builder 具备产品思维、能用 Coding Agent、有基础设计直觉,可以独立将小功能从想法做到上线。Reviewer 是资深的系统思考者,负责确保架构合理、产品方向正确、设计好用。

Chase 还指出几个角色层面的影响:通才比以往更有价值,因为省去了跨职能沟通的开销;不使用 Coding Agent 的人将被使用的人替代;糟糕的 PM 比以往更有害,因为他们现在可以拿着不该存在的原型要求合并(「It already exists! Let's just merge it!」),浪费全团队的评审时间。

信源:https://x.com/hwchase17/status/2031051115169808685
a16z合伙人预言电子表格终结:全球10亿用户一直在用最差的IDE写程序,AI代码生成让这个妥协不再必要

风投机构 a16z 合伙人 Andrew Chen 发文预测,AI 代码生成将终结电子表格的统治地位。他认为电子表格本质上是「被困在网格里的业务逻辑」,定价模型、财务预测、库存跟踪、营销归因,这些都是程序,只不过一直在用最差的 IDE 编写,没有版本控制,没有测试,没有模块化,只有一张插入一行就可能崩溃的脆弱单元格引用网。

Chen 指出,电子表格之所以赢,唯一的原因是写真正软件的门槛太高。一个财务分析师能在一下午学会 VLOOKUP,但学不会 Python。AI 代码生成彻底扭转了这个等式:同一个分析师用自然语言描述需求,就能得到一个带数据库、UI 和错误处理的真正应用。从「电子表格」到「软件」的边际成本接近于零。

他预测,全球约 10 亿电子表格用户中大多数人「在不知不觉中编写着劣质软件」。即使只有 10% 的用例迁移到真正的代码,也会催生大量形态全新的微型应用。那些寄生在共享 Google Sheet 里的内部工具将变成真正的产品,那些支撑着半个公司运营的「影子 IT」电子表格终于能获得正规的基础设施。电子表格曾是让非技术人员也能造东西的伟大均衡器,AI 代码生成是下一个,但天花板高 100 倍。

信源:https://x.com/andrewchen/status/2031532980032909640
JetBrains发布Air和Junie CLI:用停产Fleet的技术重建,让Codex、Claude Agent、Gemini CLI在同一界面并行跑任务

老牌 IDE 厂商 JetBrains 近日发布两款新产品并进入公开预览。Air 是一个 Agentic Development Environment(Agent 开发环境),允许开发者在同一界面管理多个 AI 编程 Agent,包括 OpenAI Codex、Anthropic Claude Agent、谷歌 Gemini CLI 和 JetBrains 自研的 Junie。每个 Agent 执行独立的任务循环,互不干扰。

Air 的核心卖点是精确的上下文控制。用户可以通过引用特定代码行、Git 提交、类或方法来为 Agent 定义任务,而非仅靠自然语言描述。任务完成后,Air 会在完整代码库的上下文中展示变更,并内置终端、Git 客户端和预览功能。Agent 可在本地运行,也可隔离在 Docker 容器或 Git worktree 中实现沙箱化。

同步发布的 Junie CLI 是一个独立的 LLM 无关 Coding Agent,支持 Anthropic、OpenAI、谷歌和 Grok 的模型,可在终端、任意 IDE、CI/CD 流水线或 GitHub/GitLab 中使用。两款产品均支持 Agent Client Protocol(ACP)开放标准,允许接入更多第三方 Agent。

Air 基于此前已停产的 Fleet IDE 技术构建,目前仅支持 macOS,免费使用需 JetBrains AI Pro/Ultimate 订阅或自带 API Key。

信源:https://air.dev/
华为推出「鸿蒙版龙虾」小艺Claw Beta:OpenClaw直接跑在鸿蒙系统层,多端协同、预设四种人格

华为终端 BG CEO 何刚今日在微博展示基于鸿蒙系统的小艺 Claw Beta 版。小艺 Claw 将 OpenClaw 智能体能力嵌入鸿蒙系统的小艺助手,切换至 Claw 模式后可处理文档编辑、写 PPT、自动回复邮件等办公任务,支持手机、平板、PC 多设备协同,预设「信息猎手」「知心朋友」等四种初始人格。何刚称「用了几天,很惊喜,挺好用的,能帮我干不少事儿」。华为客服回复用户称该功能目前小范围内测中,正式上线时间未定。

此前 3 月 6 日,小米率先发布国内首个移动端 Agent 产品 Xiaomi miclaw,基于 MiMo 大模型构建,雷军称之为「手机龙虾」。华为小艺 Claw 的跟进意味着国产手机厂商的 AI 智能体竞争正从独立应用层下沉到操作系统层。

信源:https://www.guancha.cn/economy/2026_03_11_809603.shtml
荣耀在Magic V6发布会官宣「龙虾宇宙」:YOYO接入OpenClaw,手机/平板/PC一键养虾,近期开放内测

荣耀在昨日 Magic V6 旗舰新品发布会尾声官宣「龙虾宇宙」,产品经理韩恩泽介绍三大能力:YOYO 龙虾(通过 YOYO 助手在荣耀手机上直接与 OpenClaw 交互)、生态养虾(手机/平板/PC 一键部署,兼容所有生态设备接入)、安全养虾(可控开放手机智能体能力供 OpenClaw 调用)。相关功能将在近期陆续开放内测。

此前本月初在海外发布的荣耀 MagicPad 4 号称「行业首款小龙虾平板」,搭载骁龙 8 Gen5、12.3 英寸 3K OLED 165Hz 屏幕,599 欧元起。加上华为今日推出小艺 Claw、小米此前发布 miclaw,国产手机三强均已在系统层接入 OpenClaw 生态。

信源:https://m.sohu.com/a/994806507_114760