动察Beating AI News
3.12K subscribers
865 photos
2 videos
3.37K links
AI新闻信息流
Download Telegram
黄仁勋发长文提出AI「五层蛋糕」框架:能源→芯片→基础设施→模型→应用,称AI基建规模将达数万亿美元

英伟达 CEO 黄仁勋周二以个人署名在公司官方博客发表长文《AI Is a 5-Layer Cake》,从第一性原理出发,将 AI 产业拆解为五层结构:能源、芯片、基础设施、模型和应用。他认为 AI 不是一个聪明的应用程序或某个单一模型,而是「像电力和互联网一样重要的基础设施」,每一个成功的 AI 应用都会向下牵动整条产业链,直到最底层为它供电的发电厂。

黄仁勋指出,传统软件是「预制」的——人类描述算法,计算机执行指令;而 AI 打破了这一模式,首次实现了「实时生成智能」。正因为智能是实时生成的,支撑它的整个计算技术栈都必须被重新发明。他将目前的投入描述为「不过几千亿美元」,认为未来仍需建设数万亿美元级别的基础设施,「正在成为人类历史上最大规模的基础设施建设之一」。

在就业问题上,黄仁勋直接回应了近期关于 AI 取代工作的焦虑。他强调 AI 工厂建设需要大量电工、水管工、钢结构工人、网络技术人员等技术工种,「这些都是技术性强、薪资优厚的岗位,而且目前极度短缺。参与这场转型,并不一定需要计算机科学博士学位。」他以放射科为例说明,AI 辅助影像判读后放射科医生的需求反而在增长,因为「生产率创造能力,能力创造增长」。他还肯定了开源模型的作用,称 DeepSeek-R1 通过让强大的推理模型广泛可用,推动了应用层快速增长,同时也增加了对训练算力和基础设施的需求。

更多详细信息请阅读 BlockBeats 最新翻译的全文:《英伟达黄仁勋最新文章:AI的「五层蛋糕」》(https://www.theblockbeats.info/news/61503)
1
Claude Code 新增 /btw 命令:Agent 干活时可以「插嘴」提问,不打断当前任务

Anthropic 工程师 Thariq Shihipar 宣布 Claude Code 新增 /btw 命令,允许用户在 Claude 正在执行任务(如编辑文件、重构代码)时发起「旁路对话」(side chain conversation),向 Claude 提问而不中断当前工作流。

演示视频显示,当 Claude 正在重构 src/api/retry.ts 文件时,用户输入 `/btw what does the retry logic do?`,Claude 在继续执行编辑操作的同时,以内联方式回答了问题:「fetchWithRetry() 最多重试 3 次,使用指数退避(250ms → 1s),仅对 5xx 错误重试。」回答以浮动提示形式出现,按空格、回车或 Esc 即可关闭,不会污染主对话上下文。

该功能解决了 AI 编程 Agent 的一个常见痛点:当 Agent 正在执行长时间任务时,用户想了解代码细节或确认上下文,此前只能等任务完成或另开一个会话。`/btw` 让用户可以在不中断 Agent 工作的情况下随时「插嘴」。

信源:https://x.com/trq212/status/2031506296697131352
业余项目做成了求职信:Codex Monitor 开发者加入 OpenAI,将参与 Codex 开发者体验团队

法国独立开发者 Thomas Ricouard(@Dimillian)宣布将于本月底加入 OpenAI,专注于 Codex 相关工作。Ricouard 此前在 Medium 担任资深 iOS 工程师,更为人知的身份是开源 Mastodon 客户端 IceCubesApp 的作者,此前还曾在 Google 和电子书平台 Glose 工作。

真正促成这次加入的,是他业余时间开发的开源项目 Codex Monitor。在 OpenAI 2 月初正式推出官方 Codex macOS 桌面应用之前,Ricouard 就已独立构建了这款基于 Tauri(Rust + React)的第三方桌面客户端。Codex Monitor 通过 Codex CLI 的 app-server 协议连接底层 Agent,提供了多工作区编排、线程管理、Git worktree 隔离和 GitHub 集成等功能——与 OpenAI 后来发布的官方 app 在产品理念上高度重合:两者都定位为 Agent 的「指挥中心」,都支持多 Agent 并行、worktree 隔离和 diff review。Ricouard 本人已将 Codex Monitor 作为日常主力开发环境,取代了传统 IDE。

Ricouard 表示,他将加入 Codex 的开发者体验团队,与 OpenAI 开发者关系负责人 Romain Huet 合作,并期待将自己的 iOS 和 macOS 开发经验带入 Codex 在这些平台上的体验优化。他确认 Codex Monitor 将继续保持开源。这也契合 OpenAI 近期的招募模式——去年 9 月,OpenAI 以类似路径将 AI Xcode 工具 Alex 的团队纳入 Codex 部门。

信源:https://x.com/Dimillian/status/2031418688813830223
Claude Code之父回应「写代码的AI为什么还需要另一个AI找Bug」:投入越多token结果越好,独立上下文窗口是关键

Claude Code 昨日上线了 Code Review 功能,当 PR 被打开时自动派出一组 Agent 审查代码、搜寻 Bug。有用户质疑:如果 Claude Code 写代码这么厉害,为什么还需要单独的功能来找 Bug?

Claude Code 创始人兼负责人 Boris Cherny 在推特回复了这个问题。他的核心观点是:往一个编程问题上投入越多 token,结果就越好,这就是「测试时计算」(test time compute)。而让结果更好的一个关键方法是使用独立的上下文窗口,这正是 subagent 的工作原理,也解释了为什么同一个模型,一个 Agent 写出了 Bug,另一个 Agent 却能找到它。「这跟工程师之间的关系类似,如果我写了一个 Bug,我的同事做 code review 时可能比我自己更容易发现它。」他认为终极状态下 Agent 能写出近乎无 Bug 的代码,但在达到那个水平之前,「多个不相关的上下文窗口」是目前最好的补偿策略。

信源:https://x.com/bcherny/status/2031151689219321886
「斯坦福小镇」团队创业后提出AI三阶段论:预测→推理→模拟,称模拟才是通向超级智能的真正路径

斯坦福大学教授 Percy Liang 和 Simile AI CEO Joon Sung Park 发表博文,提出 AI 正在进入「模拟时代」。Percy Liang 认为,AI 迄今最令人印象深刻的成就都发生在环境和奖励函数明确的场景中(如围棋、IMO 数学竞赛、从零写出完整应用),RL 算法可以在沙盒中安全地尝试不同操作并观察结果。但现实世界中涉及人的问题(远程办公如何影响组织文化?如何为数百万学生重新设计三年级数学课程?)奖励模糊、风险高、无法直接实验,这恰恰是 AI 下一个最大的机会所在。

博文将 AI 的演进划分为三个阶段:预测时代(训练通用模型对文本和图像做高精度分类)、推理时代(让模型解决数学和编程等复杂多步问题)、模拟时代(理解人类和环境到足以推演任意「如果…会怎样」场景的程度)。Percy Liang 认为,模拟本质上是因果模型,不仅能预测未来,还能评估干预效果和回答反事实问题,「预测模型能生成最优行动但无法解释原因,推理模型能讲故事但不一定扎根于现实,模拟则为世界上最复杂的问题提供完整可审计的推演轨迹」,并称这是「通向稳健超级智能的真正路径」。

Joon Sung Park 是 2023 年轰动学界的「斯坦福小镇」(Generative Agents)论文第一作者(让 25 个 AI 居民在虚拟小镇自主生活、产生涌现行为的经典实验)。两人共同创办的 Simile AI 于上月完成 1 亿美元 A 轮融资,Index Ventures 领投,李飞飞和 Andrej Karpathy 参投,目标是将模拟从数千个 Agent 扩展到数百万乃至全球 80 亿人口规模。

信源:https://www.simile.ai/blog/simulation-next-frontier
谷歌Workspace全线接入Gemini:Docs从邮件和云盘自动起草文档,Sheets表格生成速度提升9倍,Slides一句话出品牌风格幻灯片

谷歌 CEO Sundar Pichai 宣布 Workspace 套件全线深度集成 Gemini,今日起以 Beta 形式向 Google AI Ultra 和 Pro 付费用户开放(英文版全球可用,Drive 功能暂限美国)。

Docs 新增「Help me create」功能:用户用自然语言描述需求,Gemini 会从 Gmail、Drive 和 Google Chat 中提取相关信息,自动生成格式完整的初稿。考虑到超过三分之一的新文档是通过复制已有文件创建的,谷歌还新增了「Match doc format」(复制参考文档的版式)和「Match writing style」(统一多人协作文档的语气风格)两个编辑功能。Sheets 的升级幅度最大:Gemini 可以从自然语言描述直接生成包含公式和格式的完整电子表格,谷歌称复杂表格的生成速度较此前提升 9 倍。Slides 新增 AI 布局生成,用户描述内容后 Gemini 会自动生成符合品牌风格的幻灯片。Drive 则在搜索结果顶部新增 AI 摘要功能,直接给出答案而无需翻找文件夹。

信源:https://x.com/sundarpichai/status/2031380361696129261
情感语音AI公司Hume AI首次开源TTS模型TADA:1000+测试样本零内容幻觉,比同级LLM语音合成快5倍

情感语音 AI 公司 Hume AI 首次开源了TTS(文本转语音)模型 TADA(Text-Acoustic Dual Alignment)。该模型的核心创新是将文本 token 与声学特征做 1:1 对齐,在单一同步流中同时生成文本和语音,从根本上消除了传统 LLM TTS 中因音频序列远长于文本序列而导致的幻觉问题。

官方公布的性能数据:在 1000+ 测试样本中实现零内容幻觉(传统系统常出现漏词、多词等问题),推理速度比同级 LLM TTS 快 5 倍。在相同的 2048 个 token 预算下,TADA 可覆盖约 700 秒音频,而传统系统仅覆盖约 70 秒,同时附带免费文本转录且不增加延迟。代码和预训练模型已在 PyPI 上开放下载。

Hume AI 由心理学博士 Alan Cowen 创立,专注于理解和生成具有情感表达能力的语音 AI。今年 1 月,Cowen 和约 7 名核心工程师被谷歌 DeepMind 以 IP 授权模式引入(非收购),用于增强 Gemini 的情感语音能力。Hume AI 在新任 CEO Andrew Ettinger 领导下继续独立运营。

信源:https://www.hume.ai/blog/opensource-tada
Codex又挂了:工程负责人承认需求增速超出预期,同期ChatGPT文件上传下载也出现故障

OpenAI 状态页显示 Codex 再次无响应,截至发稿已持续超过 1 天,官方表示仍在实施修复方案。同时 ChatGPT 也出现文件上传错误(持续 7 小时,已进入监控恢复阶段)和文件下载错误(持续 5 小时,已确认问题)。

Codex 工程负责人 Thibault Sottiaux 在 X 上表示:「我们正在尽快为 Codex 增加算力,但需求增速超出预期,部分用户的服务可能会有些卡顿。团队在幕后全力工作。」这是 Codex 连续两天出现服务中断。昨日故障修复后,团队曾按惯例重置了所有用户的速率限制作为补偿。

信源:https://x.com/thsottiaux/status/2031411642618228935
1720亿token实测35个模型:上下文越长幻觉越多,200K时所有模型捏造率均超10%

研究者 JV Roig 发布论文,使用名为 RIKER 的确定性评估方法(无需人工标注或 LLM 裁判),对 35 个开源模型在文档问答场景中的幻觉率进行了迄今最大规模的系统测试:覆盖 3 种上下文长度(32K、128K、200K token)、4 种温度设置和 3 种硬件平台(NVIDIA H200、AMD MI300X、Intel Gaudi 3),总评估量超过 1720 亿 token,比此前同类研究高出一个数量级。

核心发现:

(1)即使是表现最好的模型,在 32K 上下文时仍有 1.19% 的捏造率,顶级模型区间为 5% 到 7%。上下文扩展到 128K 时捏造率接近翻三倍,200K 时所有模型均超过 10%。

(2)模型选择是影响准确率的最大因素,不同模型间准确率差距达 72 个百分点,且模型家族对抗幻觉的能力差异大于模型参数量的影响。

(3)温度的影响比预期复杂。T=0.0 在约 60% 的情况下整体准确率最高,但更高温度反而降低了多数模型的捏造率,并大幅减少「死循环生成」(coherence loss)现象,T=0.0 下的死循环发生率最高可达 T=1.0 的 48 倍。

(4)「找到事实」和「不捏造事实」是两种独立能力。擅长定位文档中信息的模型,可能同样会编造文档中不存在的信息。

(5)不同硬件平台上的结果一致,部署决策无需考虑硬件差异。

信源:https://arxiv.org/abs/2603.08274
更新:Codex恢复稳定,速率限制再次重置,工程负责人此前称「GPU集群快要熔化」

Codex 工程负责人 Thibault Sottiaux 确认 Codex 已恢复稳定,并再次按下了速率限制重置按钮。此前他曾发文称「Codex 的 GPU 集群快要熔化了(GPU fleet is still melting),团队日夜赶工以跟上需求」。这是连续第二天出现故障后重置速率限制的循环。

信源:https://x.com/thsottiaux/status/2031605592352313567
Kimi创始人杨植麟将首次在美国公开亮相,于英伟达GTC分享K2.5大规模训练细节

月之暗面(Moonshot AI)创始人兼 CEO 杨植麟将于 3 月 17 日在英伟达 GTC 大会上发表演讲,主题为「How We Scaled Kimi K2.5」,归属 Open Models Session,时间为太平洋时间上午 11:00—11:40。Kimi 官方称这是杨植麟首次在美国的公开亮相。

信源:https://x.com/Kimi_Moonshot/status/2031571459118911534
ChatGPT新增交互式数理可视化:拖动三角形边长实时看勾股定理变化,覆盖70+高中和大学核心概念

OpenAI 为 ChatGPT 推出「动态可视化解释」(dynamic visual explanations)功能。用户提出数学或科学问题时,ChatGPT 不再仅给出文字回答,还会生成可交互操作的可视化模块:图表、几何图形和公式模型均可直接在对话中拖动调整变量,实时观察结果变化。例如提问勾股定理时,可以拖动三角形的边长,立即看到斜边随之更新。

该功能目前覆盖 70 余个数学和科学核心概念,包括二项式平方、查理定律、圆面积、复利、库仑定律、指数衰减、胡克定律、动能、线性方程和欧姆定律等,主要面向高中和大学阶段学习者。OpenAI 称每周有 1.4 亿用户使用 ChatGPT 获取数学和科学帮助。该功能对所有已登录 ChatGPT 用户开放,后续将扩展更多主题。

信源:https://openai.com/index/new-ways-to-learn-math-and-science-in-chatgpt/
分析:疯传的「每用户亏5000美元」是Cursor的账单不是Anthropic的成本,被挤压的恰恰是Cursor自己

Forbes 报道称 Cursor 内部分析发现,Anthropic 的 200 美元/月 Claude Code Max 订阅可消耗约 5000 美元计算量。这个数字在社交媒体上被当作 Anthropic 大幅烧钱的证据广泛转发,但科技博客作者 Martin Alderson(catchmetrics.io 联合创始人)撰文指出:5000 美元是按 Anthropic API 零售价算的,而非实际推理成本。在 OpenRouter 等开放推理市场上,同等规模开源模型的竞争性定价约为 Anthropic API 价格的十分之一,这些供应商需要覆盖 GPU 成本并盈利才能持续经营。按此推算,最重度用户的实际推理成本约 500 美元,而 Anthropic 官方数据显示平均用户每日 API 等价消费仅约 6 美元(月均约 180 美元),以十分之一实际成本计算,每月服务成本约 18 美元,对应 20 至 200 美元订阅价,平均用户已可盈利。

关键在于:5000 美元对 Cursor 是真实的,因为 Cursor 必须按 Anthropic 的零售 API 价格采购模型。Forbes 原文证实 Cursor 消费端订阅确实是负毛利。Cursor 正试图摆脱这一困境:约 20 名 AI 研究员在基于 DeepSeek、Kimi、Qwen 等中国开源模型训练自研 Composer 系列,Composer 1.5 已成为平台第二热门模型,运行成本远低于 Anthropic 大模型。但开发者偏好仍在 Anthropic 一边,Claude Code 年化收入已达 25 亿美元,超越 Cursor 的 20 亿美元。

信源:https://martinalderson.com/posts/no-it-doesnt-cost-anthropic-5k-per-claude-code-user/
腾讯云智能体开发平台集体涨价:三款第三方模型结束免费,混元HY2.0涨超4倍

腾讯云智能体开发平台今日发布公告,宣布自 3 月 13 日起对部分模型计费策略进行调整,涉及两类变更。

第一类是模型结束免费公测:GLM 5(智谱)、MiniMax 2.5、Kimi 2.5(月之暗面)三款第三方模型将转为正式商用,按量计费。非套餐用户需在 3 月 13 日前手动开启后付费设置,套餐用户则通过 PU 资源抵扣。

第二类是自研模型涨价:混元系列 Tencent HY2.0 Instruct 输入价格从每千 tokens 0.0008 元调至 0.004505 元,输出从 0.002 元调至 0.01113 元;HY2.0 Think 输入从 0.001 元调至 0.0053 元,输出从 0.004 元调至 0.0212 元,涨幅约 4.3 至 4.6 倍。

信源:https://cloud.tencent.com/announce/detail/2227
Claude移动端今日推送更新:新增MCP连接,改进语音模式、LaTeX渲染和长Prompt性能

Anthropic 移动端产品经理 Robert Bye 宣布 Claude iOS/Android 应用今日推送一批更新,改进项包括语音模式、语音转录、LaTeX 渲染、Artifact 展示、长 Prompt 处理性能、MCP 服务器连接和附件上传。其中 MCP 连接意味着移动端用户也可接入外部工具和数据源。

信源:https://x.com/RobertJBye/status/2031508037161120045
Devv.AI创始人透露正在开发「AI原生阅读器」,此前曾打造开发者AI搜索引擎

Devv.AI 创始人兼 CEO 张佳圆(Jiayuan Zhang)今日发帖称正在开发「可能是有史以来最好用的 AI native 阅读器」,并附上了一张类似书籍阅读界面的截图。张佳圆曾任 TikTok 美国工程师,2022 年创立 Devv,最初以面向开发者的 AI 搜索引擎起步,2024 年月收入达 3 万美元,后转型为全栈 AI 编程 Agent。此次透露的阅读器产品尚未公布具体功能和发布时间。

信源:https://x.com/jiayuan_jy/status/2031596141004075488
深圳龙华区跟进龙岗「龙虾十条」:发布AI智能体十大行动,开放100个场景,单项最高资助2000万元

继龙岗区率先发布「龙虾十条」后,深圳龙华区 3 月 10 日也发布了《关于支持AI智能体与OPC协同发展十大行动(征求意见稿)》,从算力基建、场景开放、基地打造、赛事举办、企业培育、基金设立、平台构建、体系赋能、人才引育、素养提升十个维度,构建技术研发到市场开拓的全链条赋能体系。

资助力度上,龙华提出开放 100 个 AI 智能体应用场景,最高资助 400 万元;算力券补贴最高 300 万元;智能体核心技术攻关给予研发费用 50%、最高 100 万元资助。高额奖励集中在两项:开发的算法纳入国家网信办《境内深度合成服务算法备案清单》的企业最高奖 500 万元,公共服务平台建设项目最高资助 2000 万元。针对 OPC(一人公司),龙华通过组建产业专项基金,对获得机构投资的科技企业最高给予 200 万元资助。龙华目前已集聚 AI 相关企业 607 家,其中规上企业 300 家,2025 年产业增加值 41.53 亿元。

信源:https://www.yicai.com/news/103080918.html
Sora独立App排名从榜首跌至165:OpenAI计划将视频生成整合进ChatGPT,试图复制吉卜力时刻

OpenAI 计划将 Sora AI 视频生成功能整合进 ChatGPT。Sora 独立 App 去年 9 月上线后一度登上 App Store 榜首,但用户活跃迅速下滑,目前排名已跌至第 165 位。Altman 此前在全员会上承认,仅有少量 Sora 用户会在 App 内公开分享视频。

将 Sora 接入 ChatGPT 有望提升周活用户数,目前约 9.2 亿,距离去年定下的 10 亿目标仍有差距。OpenAI 可能希望复制去年 3 月吉卜力风格照片引爆全网、将算力推至极限的那一刻。ChatGPT 此后已成为个人和企业用户(包括家具和服装设计师)的主要 AI 图像生成工具。Sora 独立 App 将继续运营,但长期规划尚不明确。

谷歌 Gemini 已通过 Veo AI 提供视频生成功能。OpenAI 近期也撤回了在 ChatGPT 内直接内置购物的计划。OpenAI 预计从现在到 2030 年推理成本将超过 2250 亿美元,并已为病毒式功能引发的用量峰值储备算力。

信源:https://www.theinformation.com/articles/openai-plans-launch-sora-video-ai-chatgpt-strategy-shift
Shopify CEO亲自开发的本地文档搜索引擎qmd发布2.0:新增稳定SDK,面向AI Agent场景设计

Shopify CEO Tobi Lütke 今日宣布其个人开源项目 qmd(Query Markup Documents)发布 2.0 版本。qmd 是一款完全本地运行的文档搜索引擎,可索引 Markdown 笔记、会议纪要和知识库,融合 BM25 全文检索、向量语义搜索和 LLM 重排序三路混合检索,通过 node-llama-cpp 加载 GGUF 模型在设备端完成全部计算。

2.0 的核心变化是声明了稳定的 SDK/Library API(npm 包 `@tobilu/qmd`),开发者可直接在 Node.js 或 Bun 项目中以库的形式集成,无需依赖 CLI。MCP server 被完全重写为 SDK 的消费者,CLI 和 MCP 模块拆分到独立子目录,整体架构更简洁。qmd 原生支持 MCP 协议,可直接接入 Claude Desktop 和 Claude Code 等 AI Agent 客户端。Lütke 此前曾在内部备忘录中将 AI 熟练度列为 Shopify 全员的「基本要求」。

信源:https://x.com/tobi/status/2031397006594253237
Perplexity用AI Agent向OpenClaw提交PR作为产品演示,因代码错误被创始人封禁账号

Perplexity 官方账号昨日发帖演示其 Perplexity Computer 产品,展示了一个全自动开发流程:针对 OpenClaw 仓库的一个 open issue,Perplexity Computer 自动 fork 仓库、制定修复方案、调用 Claude Code 编写代码并通过 GitHub CLI 提交 PR。

然而社区迅速指出该 PR 存在根本性错误——混淆了 `groupAllowFrom`(群组发送者白名单)和 `channels.telegram.groups`(群聊白名单),维护者将 PR 关闭且未接受。OpenClaw 创建者 Peter Steinberger 对此直接回应:「Big no for spamming our repo with a slop PR. Account banned.」(不允许用垃圾 PR 骚扰我们的仓库,账号已封禁。)

有用户质疑用 AI 生成营销邮件和用 AI 提交 PR 有何区别,Steinberger 回答:「Both is shit and I'd ban/block.」

信源:https://x.com/steipete/status/2031548802688049567
OpenCode联创公开内部备忘录:Coding Agent没让我们更快,却让我们丧失了延迟满足的能力

开源 AI 编程工具 OpenCode 联合创始人 Dax Raad 今日公开了一份发给团队的内部备忘录,列出 LLM 驱动的 Coding Agent 给团队带来的三个挑战。他认为这些问题本身并非全新,但被 LLM 大幅放大了。

首先是发布门槛在下降。用 prompt 催生新功能太容易,不值得发布的功能也在发布。Raad 强调门槛应该保持高标准,「原型不比花时间做产品思考更有价值」。

其次是重构意愿在萎缩。当原始设计出偏需要 hack 修复时,以前开发者会痛苦地推动重构,现在 LLM 可以承受 hackiness,团队便不再较真。

第三是清理时间被挤压。LLM 一直拉着团队去做下一个功能,但修好现有功能和改进构建流程的价值是新功能的 100 倍。

Raad 认为最糟糕的一点是,这些取舍并没有换来速度。「我认为我们的推进速度和正常节奏一样。」他说过去六个月团队从几乎不用 Coding Agent 变成事事依赖,「侵蚀了我们延迟满足的能力」,需要找到平衡。

信源:https://x.com/thdxr/status/2031377117007454421