上市两个月市值超百度:MiniMax今日收涨超22%,港股市值达3826亿港元,2月ARR已突破1.5亿美元
MiniMax(00100.HK)今日收涨超 22%,总市值达 3826.4 亿港元,首次超越百度(百度当日收涨 2.90%,市值 3322.2 亿港元)。MiniMax 于 2026 年 1 月 9 日以 165 港元发行价登陆港交所,上市仅两个月即完成对这家成立 25 年的搜索巨头的市值超越。
基本面上,MiniMax 3 月 2 日发布的上市后首份年报显示,2025 年全年收入 7904 万美元,同比增长 158.9%,毛利率从 12.2% 提升至 25.4%,经调整净亏损 2.51 亿美元(账面净亏损 18.72 亿美元主要来自优先股公允价值变动的非现金损失)。增长仍在加速——2026 年 2 月 ARR 已突破 1.5 亿美元,M2 系列文本模型日均 Token 消耗量是去年 12 月的 6 倍以上。创始人闫俊杰在业绩电话会上称,战略目标已从「大模型公司」转向「AI 时代的平台型公司」。MiniMax 是港股市场极少数纯 AI 原生标的之一,其股价走势被市场视为中国 AI 估值重定价的风向标。
信源:https://mp.weixin.qq.com/s/5f90YzfE7v-MMWohO2Xedw
MiniMax(00100.HK)今日收涨超 22%,总市值达 3826.4 亿港元,首次超越百度(百度当日收涨 2.90%,市值 3322.2 亿港元)。MiniMax 于 2026 年 1 月 9 日以 165 港元发行价登陆港交所,上市仅两个月即完成对这家成立 25 年的搜索巨头的市值超越。
基本面上,MiniMax 3 月 2 日发布的上市后首份年报显示,2025 年全年收入 7904 万美元,同比增长 158.9%,毛利率从 12.2% 提升至 25.4%,经调整净亏损 2.51 亿美元(账面净亏损 18.72 亿美元主要来自优先股公允价值变动的非现金损失)。增长仍在加速——2026 年 2 月 ARR 已突破 1.5 亿美元,M2 系列文本模型日均 Token 消耗量是去年 12 月的 6 倍以上。创始人闫俊杰在业绩电话会上称,战略目标已从「大模型公司」转向「AI 时代的平台型公司」。MiniMax 是港股市场极少数纯 AI 原生标的之一,其股价走势被市场视为中国 AI 估值重定价的风向标。
信源:https://mp.weixin.qq.com/s/5f90YzfE7v-MMWohO2Xedw
腾讯云上线Coding Plan订阅服务:支持OpenClaw、Claude Code等主流编程工具,新用户Lite套餐首月7.9元
腾讯云今日上线全新大模型 Coding Plan 订阅服务,首发支持 CodeBuddy、OpenClaw、Claude Code、Cline、Cursor 等主流 AI 编程工具,接入 Tencent HY 2.0 Instruct、GLM-5、Kimi-K2.5、MiniMax-M2.5 等多款大模型,更多模型持续接入中。定价分两档:Lite 套餐提供 18000 次请求,新用户首月价 7.9 元/月(刊例价 40 元/月);Pro 套餐提供 90000 次请求,新用户首月价 39.9 元/月(刊例价 200 元/月)。优惠截至 4 月 19 日,名额有限售罄即止。
信源:https://www.ithome.com/0/927/699.htm
腾讯云今日上线全新大模型 Coding Plan 订阅服务,首发支持 CodeBuddy、OpenClaw、Claude Code、Cline、Cursor 等主流 AI 编程工具,接入 Tencent HY 2.0 Instruct、GLM-5、Kimi-K2.5、MiniMax-M2.5 等多款大模型,更多模型持续接入中。定价分两档:Lite 套餐提供 18000 次请求,新用户首月价 7.9 元/月(刊例价 40 元/月);Pro 套餐提供 90000 次请求,新用户首月价 39.9 元/月(刊例价 200 元/月)。优惠截至 4 月 19 日,名额有限售罄即止。
信源:https://www.ithome.com/0/927/699.htm
Ithome
腾讯云上线全新 Coding Plan:支持 OpenClaw、Claude Code 等工具,新用户 Lite 套餐 7.9 元 / 月 - IT之家
腾讯云大模型 Coding Plan 订阅服务上新,支持多主流大模型和编程工具。新用户享优惠,Lite 首月 7.9 元,Pro 39.9 元,优惠至 4 月 19 日 00:00。#腾讯云 CodingPlan #编程服务优惠 ##
中央网信办通报「清朗·春节」专项行动:处置近4万个账号,重点整治AI生成传播「数字泔水」等问题
据「网信中国」公众号消息,中央网信办近期部署开展「清朗·2026 年营造喜庆祥和春节网络环境」专项行动。截至目前,已依法依约处置账号 3.9 万余个,清理违法违规信息 70.8 万余条。通报列出四类典型违规行为:恶意挑动负面情绪(炫富攀比、性别对立)、为赌球和色情活动引流、利用 AI 批量生成「数字泔水」低质内容(如逻辑混乱的搞笑视频、AI 魔改经典名著生成血腥恐怖画面并标注「儿童动画」标签)、炮制发布不实信息。网信部门表示将继续保持高压严管态势。
信源:https://mp.weixin.qq.com/s/Y1ZCbKbgptp10ksHvgz-MA?clicktime=1773137794&enterid=1773137794&scene=126&sessionid=1773137793&subscene=7
据「网信中国」公众号消息,中央网信办近期部署开展「清朗·2026 年营造喜庆祥和春节网络环境」专项行动。截至目前,已依法依约处置账号 3.9 万余个,清理违法违规信息 70.8 万余条。通报列出四类典型违规行为:恶意挑动负面情绪(炫富攀比、性别对立)、为赌球和色情活动引流、利用 AI 批量生成「数字泔水」低质内容(如逻辑混乱的搞笑视频、AI 魔改经典名著生成血腥恐怖画面并标注「儿童动画」标签)、炮制发布不实信息。网信部门表示将继续保持高压严管态势。
信源:https://mp.weixin.qq.com/s/Y1ZCbKbgptp10ksHvgz-MA?clicktime=1773137794&enterid=1773137794&scene=126&sessionid=1773137793&subscene=7
抖音公告严打AI生成色情低俗内容:今年已处置4.2万条违规内容、1.4万个账号,黑产团伙4人被刑拘
抖音黑板报今日发布公告称,严厉打击各类色情低俗内容,持续从严治理利用 AI 技术生成的相关违规内容。今年以来,平台已处置 AI 生成色情低俗类违规内容 4.2 万条,对 1.4 万个账号处以限制推荐、禁言、封禁等梯度处罚。
公告披露三类典型案例:一是黑产团伙利用 AI 生成「单亲妈妈陪读」人设图片,通过性暗示文案诱导用户跳转第三方平台下载色情 App,该团伙 4 人已被刑事拘留;二是 339 个账号将直播间封面设为 AI 生成美女图片,通过头像引导用户查看收藏页为色情网站导流;三是 8421 个账号持续发布 AI 生成着装暴露女性形象的擦边内容。抖音此举与中央网信办同日通报的「清朗·春节」专项行动、小红书封禁 AI 托管账号形成多平台联动治理态势。
信源:https://mp.weixin.qq.com/s/kTmZaCQnM-8Ljl7zFViwfw?clicktime=1773137739&enterid=1773137739&scene=126&sessionid=1773137737&subscene=7
抖音黑板报今日发布公告称,严厉打击各类色情低俗内容,持续从严治理利用 AI 技术生成的相关违规内容。今年以来,平台已处置 AI 生成色情低俗类违规内容 4.2 万条,对 1.4 万个账号处以限制推荐、禁言、封禁等梯度处罚。
公告披露三类典型案例:一是黑产团伙利用 AI 生成「单亲妈妈陪读」人设图片,通过性暗示文案诱导用户跳转第三方平台下载色情 App,该团伙 4 人已被刑事拘留;二是 339 个账号将直播间封面设为 AI 生成美女图片,通过头像引导用户查看收藏页为色情网站导流;三是 8421 个账号持续发布 AI 生成着装暴露女性形象的擦边内容。抖音此举与中央网信办同日通报的「清朗·春节」专项行动、小红书封禁 AI 托管账号形成多平台联动治理态势。
信源:https://mp.weixin.qq.com/s/kTmZaCQnM-8Ljl7zFViwfw?clicktime=1773137739&enterid=1773137739&scene=126&sessionid=1773137737&subscene=7
30岁前带公司上市的哈佛辍学生再创业:AI医疗后台平台Nitra完成5000万美元B轮,ARR年增8倍
AI 医疗运营平台 Nitra 宣布完成 5000 万美元 B 轮融资,累计融资总额达 2.05 亿美元。截至 2025 年 12 月,Nitra 平台年化处理量突破 10 亿美元,年经常性收入(ARR)达 3300 万美元,同比增长约 8 倍,已有超过 700 家诊所上线。创始人 Tim Hwang 预计年底年化处理量将增至约 40 亿美元,并称「我认为 Nitra 将成为一家百亿美元估值的公司」。
Nitra 的切入点是一张医生专用信用卡,Hwang 称之为「特洛伊木马」。医生刷卡采购医疗器械和药品后,平台自动完成会计分类、库存管理和账务核对,进而扩展到保险理赔、排班、患者沟通等全流程后台工作,由 AI 智能体端到端执行。Hwang 曾在 2008 年奥巴马竞选团队工作,后在 30 岁前将政策数据公司 FiscalNote 带上市。他将 Nitra 定义为「一个 20 年的项目」,瞄准的是美国最大的雇主行业——医疗保健。CityMD 创始人 Richard Park 加入 Nitra 董事会。
信源:https://fortune.com/2026/03/10/tim-hwang-nitra-funding-ai-healthcare-platform/
AI 医疗运营平台 Nitra 宣布完成 5000 万美元 B 轮融资,累计融资总额达 2.05 亿美元。截至 2025 年 12 月,Nitra 平台年化处理量突破 10 亿美元,年经常性收入(ARR)达 3300 万美元,同比增长约 8 倍,已有超过 700 家诊所上线。创始人 Tim Hwang 预计年底年化处理量将增至约 40 亿美元,并称「我认为 Nitra 将成为一家百亿美元估值的公司」。
Nitra 的切入点是一张医生专用信用卡,Hwang 称之为「特洛伊木马」。医生刷卡采购医疗器械和药品后,平台自动完成会计分类、库存管理和账务核对,进而扩展到保险理赔、排班、患者沟通等全流程后台工作,由 AI 智能体端到端执行。Hwang 曾在 2008 年奥巴马竞选团队工作,后在 30 岁前将政策数据公司 FiscalNote 带上市。他将 Nitra 定义为「一个 20 年的项目」,瞄准的是美国最大的雇主行业——医疗保健。CityMD 创始人 Richard Park 加入 Nitra 董事会。
信源:https://fortune.com/2026/03/10/tim-hwang-nitra-funding-ai-healthcare-platform/
三年砸600亿研发:美的发布家居智能体MevoX,一句话调度全屋家电,支持与手机和车企Agent跨空间协同
美的集团今日在上海举办 2026 全屋智能战略发布会,AI 研究院院长徐翼发布家居智能体 MevoX(小美),具备感知、推理、执行、记忆、优化、链接六大核心能力,可理解用户的多轮复杂指令并一句话调度全屋家电。徐翼称推理和记忆是当前智能家居系统亟待加强的两个方面:高阶推理用于复杂世界的实时理解,持续记忆用于用户动态的长期建模。MevoX 基于美的自研美言大模型 3.0 驱动,目前赋能设备 1.4 亿个,底层交互数据 200 亿条,在中国电研威凯认证中获得家居智能体自学习能力五星级评定。
发布会同时公布「三个一」全屋智能战略:1 张覆盖全品类的智能家电网络、1 个全屋智能大脑(家庭智航系统 MIA 1.0)、1 个开放平台。在 MIA 1.0 系统中,MevoX 可通过 A2A 协议与手机厂商、车企、生活服务类厂商的外部智能体跨空间协同,例如在用户到家前提前开启车辆座椅通风和空调,离家后自动启动扫地机器人。高端品牌 COLMO 同步发布全屋智能新品,其 AI 管家支持连接最多 1200 种家电家居设备、1000 多台设备同时在线。
美的集团副总裁兼智能家居事业群总裁赵磊宣布,美的未来三年将投入 600 亿元研发,相当于过去 5 年的研发投入总和。目前美的海外业务收入占比超 41%,覆盖 200 多个国家和地区,全球研发人员超 2.3 万人,智能联网设备 1.4 亿台,用户 1.5 亿,推理 Token 数据量达 13.6 万亿。
信源:https://zhidx.com/p/538899.html
美的集团今日在上海举办 2026 全屋智能战略发布会,AI 研究院院长徐翼发布家居智能体 MevoX(小美),具备感知、推理、执行、记忆、优化、链接六大核心能力,可理解用户的多轮复杂指令并一句话调度全屋家电。徐翼称推理和记忆是当前智能家居系统亟待加强的两个方面:高阶推理用于复杂世界的实时理解,持续记忆用于用户动态的长期建模。MevoX 基于美的自研美言大模型 3.0 驱动,目前赋能设备 1.4 亿个,底层交互数据 200 亿条,在中国电研威凯认证中获得家居智能体自学习能力五星级评定。
发布会同时公布「三个一」全屋智能战略:1 张覆盖全品类的智能家电网络、1 个全屋智能大脑(家庭智航系统 MIA 1.0)、1 个开放平台。在 MIA 1.0 系统中,MevoX 可通过 A2A 协议与手机厂商、车企、生活服务类厂商的外部智能体跨空间协同,例如在用户到家前提前开启车辆座椅通风和空调,离家后自动启动扫地机器人。高端品牌 COLMO 同步发布全屋智能新品,其 AI 管家支持连接最多 1200 种家电家居设备、1000 多台设备同时在线。
美的集团副总裁兼智能家居事业群总裁赵磊宣布,美的未来三年将投入 600 亿元研发,相当于过去 5 年的研发投入总和。目前美的海外业务收入占比超 41%,覆盖 200 多个国家和地区,全球研发人员超 2.3 万人,智能联网设备 1.4 亿台,用户 1.5 亿,推理 Token 数据量达 13.6 万亿。
信源:https://zhidx.com/p/538899.html
Binance创始人赵长鹏公开推荐Kimi为OpenClaw最佳模型,Kimi官方账号转发
Binance创始人赵长鹏(CZ)今日在 X 上发帖称:「试了很多 AI 模型跑 OpenClaw,我发现 Kimi AI 是最省 token 的,编程能力好,配置也最简单。」
Kimi.ai 官方 X 账号随即转发。
信源:https://x.com/cz_binance/status/2031313379235606989
Binance创始人赵长鹏(CZ)今日在 X 上发帖称:「试了很多 AI 模型跑 OpenClaw,我发现 Kimi AI 是最省 token 的,编程能力好,配置也最简单。」
Kimi.ai 官方 X 账号随即转发。
信源:https://x.com/cz_binance/status/2031313379235606989
五种模态共享一个向量空间:谷歌发布Gemini Embedding 2
谷歌发布 Gemini Embedding 2,这是谷歌首个原生多模态嵌入模型,已通过 Gemini API 和 Vertex AI 提供公开预览。
该模型可将文本、图像、视频、音频和文档映射到同一嵌入空间,支持超过 100 种语言。此前开发者若需同时检索不同模态内容,通常要分别使用多个模型生成向量再做对齐,Gemini Embedding 2 将这一流程统一为单一模型。具体支持:文本最多 8192 个 token,每次请求最多 6 张图片(PNG/JPEG),视频最长 120 秒(MP4/MOV),音频原生支持无需中间转录,PDF 文档最多 6 页。模型还支持在同一请求中混合传入多种模态,综合不同媒体间的语义关系生成向量。
默认输出 3072 维向量,可按需缩减至 1536 或 768 维以降低存储成本。基准测试方面,MTEB 多语言基准得分 69.9,高于 Amazon Nova 2(63.8)和 Voyage 3.5(58.5);代码语义理解得分 84.0,较上一代提升 8 分;TextCaps 跨模态检索中,文本到图像 89.6,图像到文本 97.4,均大幅领先同类模型。该模型支持 LangChain、LlamaIndex、Weaviate、ChromaDB 等主流框架集成。
信源:https://blog.google/innovation-and-ai/models-and-research/gemini-models/gemini-embedding-2/
谷歌发布 Gemini Embedding 2,这是谷歌首个原生多模态嵌入模型,已通过 Gemini API 和 Vertex AI 提供公开预览。
该模型可将文本、图像、视频、音频和文档映射到同一嵌入空间,支持超过 100 种语言。此前开发者若需同时检索不同模态内容,通常要分别使用多个模型生成向量再做对齐,Gemini Embedding 2 将这一流程统一为单一模型。具体支持:文本最多 8192 个 token,每次请求最多 6 张图片(PNG/JPEG),视频最长 120 秒(MP4/MOV),音频原生支持无需中间转录,PDF 文档最多 6 页。模型还支持在同一请求中混合传入多种模态,综合不同媒体间的语义关系生成向量。
默认输出 3072 维向量,可按需缩减至 1536 或 768 维以降低存储成本。基准测试方面,MTEB 多语言基准得分 69.9,高于 Amazon Nova 2(63.8)和 Voyage 3.5(58.5);代码语义理解得分 84.0,较上一代提升 8 分;TextCaps 跨模态检索中,文本到图像 89.6,图像到文本 97.4,均大幅领先同类模型。该模型支持 LangChain、LlamaIndex、Weaviate、ChromaDB 等主流框架集成。
信源:https://blog.google/innovation-and-ai/models-and-research/gemini-models/gemini-embedding-2/
Anthropic五个月亚太连开四城:落地悉尼,澳大利亚Claude人均使用量全球第四
Anthropic 宣布将在数周内于悉尼开设办公室,服务澳大利亚和新西兰市场。这是继去年 10 月以来该公司在亚太地区设立的第四个办公室,此前已在东京、班加罗尔和首尔设立了办事处。目前尚未任命本地负责人。
按人口比例计算,澳大利亚和新西兰分别位列全球 Claude.ai 使用量第四和第八位,用户主要将 Claude 用于编程、计算机任务、教育和研究。悉尼办公室初期将聚焦企业、初创公司和研究客户,已与在线设计平台 Canva、数据分析公司 Quantium 和澳大利亚联邦银行建立合作。
Anthropic 国际业务董事总经理 Chris Ciauri 表示,在当地设立办事处将帮助发展澳新地区的合作关系,确保 Claude「在尊重该地区独特目标、机遇和挑战的基础上构建」。Ciauri 此前曾任谷歌云 EMEA 总裁和 Salesforce EMEA 执行副总裁。
Anthropic 还在探索通过第三方合作伙伴在澳大利亚扩展本地算力,以满足企业和政府机构的数据驻留需求。公司高管团队将于 3 月底访问澳大利亚,与客户和政策制定者会面。
信源:https://www.anthropic.com/news/sydney-fourth-office-asia-pacific
Anthropic 宣布将在数周内于悉尼开设办公室,服务澳大利亚和新西兰市场。这是继去年 10 月以来该公司在亚太地区设立的第四个办公室,此前已在东京、班加罗尔和首尔设立了办事处。目前尚未任命本地负责人。
按人口比例计算,澳大利亚和新西兰分别位列全球 Claude.ai 使用量第四和第八位,用户主要将 Claude 用于编程、计算机任务、教育和研究。悉尼办公室初期将聚焦企业、初创公司和研究客户,已与在线设计平台 Canva、数据分析公司 Quantium 和澳大利亚联邦银行建立合作。
Anthropic 国际业务董事总经理 Chris Ciauri 表示,在当地设立办事处将帮助发展澳新地区的合作关系,确保 Claude「在尊重该地区独特目标、机遇和挑战的基础上构建」。Ciauri 此前曾任谷歌云 EMEA 总裁和 Salesforce EMEA 执行副总裁。
Anthropic 还在探索通过第三方合作伙伴在澳大利亚扩展本地算力,以满足企业和政府机构的数据驻留需求。公司高管团队将于 3 月底访问澳大利亚,与客户和政策制定者会面。
信源:https://www.anthropic.com/news/sydney-fourth-office-asia-pacific
Anthropic
Sydney will become Anthropic’s fourth office in Asia-Pacific
Anthropic is an AI safety and research company that's working to build reliable, interpretable, and steerable AI systems.
一周四起最高级别故障,亚马逊电商召开紧急复盘会:内部文件曾点名AI编程工具,会前被删
亚马逊电商部门当地时间周二召集大量工程师参加内部「深度复盘」会议,审视近期一系列网站故障。电商基础架构高级副总裁、前微软工程高管 Dave Treadwell 在发给员工的邮件中写道:「各位,正如你们可能已经知道的,网站及相关基础设施的可用性最近不太好。」他表示过去一周内发生了四起 Sev1 级别事故(即导致关键系统中断或性能严重下降的最高严重性事件),需要通过深度复盘「恢复我们的高可用性状态」。
会前分发的内部简报文件将「GenAI 辅助变更」列为近几个月事故趋势的因素之一,称存在「尚未充分建立最佳实践和防护措施的新型 GenAI 使用」,事故呈现「高影响范围」特征。但在媒体报道发出后、会议召开前,该文件中对 GenAI 的引用被删除。亚马逊随后表示,只有一起事故与 AI 有关,且没有任何事故涉及 AI 编写的代码。
上周四亚马逊网站和购物 App 宕机近 6 小时,用户无法完成结账、查看账户信息或商品价格,公司称故障源于一次「软件代码部署」。Treadwell 在简报中承认 GenAI 使用的最佳实践和防护措施「尚未完全建立」,宣布将实施临时安全措施,为零售体验最关键部分的变更引入「受控摩擦」,同时投资「包括确定性和 Agent 式防护在内的更持久方案」,并要求低级和中级工程师的 AI 辅助变更须经高级工程师签批。
亚马逊云服务 AWS 近月也发生至少两起与 AI 编程助手相关的事故。去年 12 月,工程师允许 AWS 旗下 AI 编程工具 Kiro 执行变更后,该工具选择「删除并重建环境」,导致一项客户成本计算功能中断 13 小时。亚马逊今年 1 月裁减约 16,000 个企业岗位,去年 10 月裁员约 14,000 人,内部工程师此前向媒体反映裁员后每日需处理的紧急事故数量增多。
信源:https://www.cnbc.com/2026/03/10/amazon-plans-deep-dive-internal-meeting-address-ai-related-outages.html
亚马逊电商部门当地时间周二召集大量工程师参加内部「深度复盘」会议,审视近期一系列网站故障。电商基础架构高级副总裁、前微软工程高管 Dave Treadwell 在发给员工的邮件中写道:「各位,正如你们可能已经知道的,网站及相关基础设施的可用性最近不太好。」他表示过去一周内发生了四起 Sev1 级别事故(即导致关键系统中断或性能严重下降的最高严重性事件),需要通过深度复盘「恢复我们的高可用性状态」。
会前分发的内部简报文件将「GenAI 辅助变更」列为近几个月事故趋势的因素之一,称存在「尚未充分建立最佳实践和防护措施的新型 GenAI 使用」,事故呈现「高影响范围」特征。但在媒体报道发出后、会议召开前,该文件中对 GenAI 的引用被删除。亚马逊随后表示,只有一起事故与 AI 有关,且没有任何事故涉及 AI 编写的代码。
上周四亚马逊网站和购物 App 宕机近 6 小时,用户无法完成结账、查看账户信息或商品价格,公司称故障源于一次「软件代码部署」。Treadwell 在简报中承认 GenAI 使用的最佳实践和防护措施「尚未完全建立」,宣布将实施临时安全措施,为零售体验最关键部分的变更引入「受控摩擦」,同时投资「包括确定性和 Agent 式防护在内的更持久方案」,并要求低级和中级工程师的 AI 辅助变更须经高级工程师签批。
亚马逊云服务 AWS 近月也发生至少两起与 AI 编程助手相关的事故。去年 12 月,工程师允许 AWS 旗下 AI 编程工具 Kiro 执行变更后,该工具选择「删除并重建环境」,导致一项客户成本计算功能中断 13 小时。亚马逊今年 1 月裁减约 16,000 个企业岗位,去年 10 月裁员约 14,000 人,内部工程师此前向媒体反映裁员后每日需处理的紧急事故数量增多。
信源:https://www.cnbc.com/2026/03/10/amazon-plans-deep-dive-internal-meeting-address-ai-related-outages.html
😁1
马化腾朋友圈亲自「数虾」:自研虾、本地虾、云端虾、企业虾、云桌面虾……腾讯一口气凑齐龙虾全家桶
腾讯创始人马化腾今日在微信朋友圈发文,逐一列举腾讯旗下 OpenClaw 相关产品线:「自研龙虾、本地虾、云端虾、企业虾、云桌面虾,安全隔离虾房、云保安、知识库……还有一批产品陆续赶来。」配文转发了腾讯公众号文章「腾讯全系龙虾产品矩阵来了,个人可直接调用」。
这是马化腾一周内第二次在朋友圈为 OpenClaw 站台。3 月 8 日,马化腾在朋友圈转发腾讯免费安装开源 AI 智能体 OpenClaw 的相关报道,留言「没有想到会这么火」。此次则直接进入「产品经理」模式,用一串排比式命名把腾讯的 Agent 产品线从头到尾数了一遍。
腾讯正式发布的全系产品矩阵包括:面向个人用户的免部署工具 WorkBuddy 和正在内测的 QClaw(基于 OpenClaw 的本地 AI 助手,支持 Mac 和 Windows 一键安装,可通过微信对话远程操控本地电脑,内置超 5000 个 Skills),面向开发者和企业的腾讯云 Lighthouse 云端方案、智能体开发平台 ADP、腾讯云桌面,以及配套的安全隔离「龙虾管家」(腾讯电脑管家 18.0 内置)和 AI Agent 安全中心。技能生态方面,腾讯上线了内置 1.3 万个本土化技能的 SkillHub 社区。
腾讯创始人马化腾今日在微信朋友圈发文,逐一列举腾讯旗下 OpenClaw 相关产品线:「自研龙虾、本地虾、云端虾、企业虾、云桌面虾,安全隔离虾房、云保安、知识库……还有一批产品陆续赶来。」配文转发了腾讯公众号文章「腾讯全系龙虾产品矩阵来了,个人可直接调用」。
这是马化腾一周内第二次在朋友圈为 OpenClaw 站台。3 月 8 日,马化腾在朋友圈转发腾讯免费安装开源 AI 智能体 OpenClaw 的相关报道,留言「没有想到会这么火」。此次则直接进入「产品经理」模式,用一串排比式命名把腾讯的 Agent 产品线从头到尾数了一遍。
腾讯正式发布的全系产品矩阵包括:面向个人用户的免部署工具 WorkBuddy 和正在内测的 QClaw(基于 OpenClaw 的本地 AI 助手,支持 Mac 和 Windows 一键安装,可通过微信对话远程操控本地电脑,内置超 5000 个 Skills),面向开发者和企业的腾讯云 Lighthouse 云端方案、智能体开发平台 ADP、腾讯云桌面,以及配套的安全隔离「龙虾管家」(腾讯电脑管家 18.0 内置)和 AI Agent 安全中心。技能生态方面,腾讯上线了内置 1.3 万个本土化技能的 SkillHub 社区。
开发者逆向腾讯QClaw「拆出」微信网关协议:任何AI Agent都能接入微信了
开发者从腾讯 AI 桌面助手 QClaw 的 Electron 应用包(app.asar,未加密)中提取了微信接入 API 的服务类代码,将其封装为独立的 TypeScript 模块并在 GitHub 开源(项目名 qclaw-wechat-client,目前获得 354 个 Star)。QClaw 是腾讯基于 OpenClaw 协议开发的本地 AI 助手,目前仍在内测阶段,通过微信认证服务号的客服功能实现消息收发。
该逆向项目完整实现了 QClaw 的微信 OAuth2 二维码登录流程和 AGP(Agent Gateway Protocol)WebSocket 实时通信协议,支持 API 密钥管理、会话管理、设备控制、自动重连(指数退避)、心跳监测和消息去重。借助该模块,第三方 AI Agent 也可以通过微信与用户对话,不再局限于腾讯官方客户端。
项目声明仅供学习和研究使用。由于代码通过逆向工程获取,存在版权风险,项目方称后续可能被删除。QClaw 仍处于开发阶段,腾讯后端的任何配置更新都可能导致该项目失效。
信源:https://github.com/photon-hq/qclaw-wechat-client
开发者从腾讯 AI 桌面助手 QClaw 的 Electron 应用包(app.asar,未加密)中提取了微信接入 API 的服务类代码,将其封装为独立的 TypeScript 模块并在 GitHub 开源(项目名 qclaw-wechat-client,目前获得 354 个 Star)。QClaw 是腾讯基于 OpenClaw 协议开发的本地 AI 助手,目前仍在内测阶段,通过微信认证服务号的客服功能实现消息收发。
该逆向项目完整实现了 QClaw 的微信 OAuth2 二维码登录流程和 AGP(Agent Gateway Protocol)WebSocket 实时通信协议,支持 API 密钥管理、会话管理、设备控制、自动重连(指数退避)、心跳监测和消息去重。借助该模块,第三方 AI Agent 也可以通过微信与用户对话,不再局限于腾讯官方客户端。
项目声明仅供学习和研究使用。由于代码通过逆向工程获取,存在版权风险,项目方称后续可能被删除。QClaw 仍处于开发阶段,腾讯后端的任何配置更新都可能导致该项目失效。
信源:https://github.com/photon-hq/qclaw-wechat-client
GitHub
GitHub - photon-hq/qclaw-wechat-client: Reverse-engineered TypeScript client for QClaw's WeChat Access API.
Reverse-engineered TypeScript client for QClaw's WeChat Access API. - photon-hq/qclaw-wechat-client
黄仁勋发长文提出AI「五层蛋糕」框架:能源→芯片→基础设施→模型→应用,称AI基建规模将达数万亿美元
英伟达 CEO 黄仁勋周二以个人署名在公司官方博客发表长文《AI Is a 5-Layer Cake》,从第一性原理出发,将 AI 产业拆解为五层结构:能源、芯片、基础设施、模型和应用。他认为 AI 不是一个聪明的应用程序或某个单一模型,而是「像电力和互联网一样重要的基础设施」,每一个成功的 AI 应用都会向下牵动整条产业链,直到最底层为它供电的发电厂。
黄仁勋指出,传统软件是「预制」的——人类描述算法,计算机执行指令;而 AI 打破了这一模式,首次实现了「实时生成智能」。正因为智能是实时生成的,支撑它的整个计算技术栈都必须被重新发明。他将目前的投入描述为「不过几千亿美元」,认为未来仍需建设数万亿美元级别的基础设施,「正在成为人类历史上最大规模的基础设施建设之一」。
在就业问题上,黄仁勋直接回应了近期关于 AI 取代工作的焦虑。他强调 AI 工厂建设需要大量电工、水管工、钢结构工人、网络技术人员等技术工种,「这些都是技术性强、薪资优厚的岗位,而且目前极度短缺。参与这场转型,并不一定需要计算机科学博士学位。」他以放射科为例说明,AI 辅助影像判读后放射科医生的需求反而在增长,因为「生产率创造能力,能力创造增长」。他还肯定了开源模型的作用,称 DeepSeek-R1 通过让强大的推理模型广泛可用,推动了应用层快速增长,同时也增加了对训练算力和基础设施的需求。
更多详细信息请阅读 BlockBeats 最新翻译的全文:《英伟达黄仁勋最新文章:AI的「五层蛋糕」》(https://www.theblockbeats.info/news/61503)
英伟达 CEO 黄仁勋周二以个人署名在公司官方博客发表长文《AI Is a 5-Layer Cake》,从第一性原理出发,将 AI 产业拆解为五层结构:能源、芯片、基础设施、模型和应用。他认为 AI 不是一个聪明的应用程序或某个单一模型,而是「像电力和互联网一样重要的基础设施」,每一个成功的 AI 应用都会向下牵动整条产业链,直到最底层为它供电的发电厂。
黄仁勋指出,传统软件是「预制」的——人类描述算法,计算机执行指令;而 AI 打破了这一模式,首次实现了「实时生成智能」。正因为智能是实时生成的,支撑它的整个计算技术栈都必须被重新发明。他将目前的投入描述为「不过几千亿美元」,认为未来仍需建设数万亿美元级别的基础设施,「正在成为人类历史上最大规模的基础设施建设之一」。
在就业问题上,黄仁勋直接回应了近期关于 AI 取代工作的焦虑。他强调 AI 工厂建设需要大量电工、水管工、钢结构工人、网络技术人员等技术工种,「这些都是技术性强、薪资优厚的岗位,而且目前极度短缺。参与这场转型,并不一定需要计算机科学博士学位。」他以放射科为例说明,AI 辅助影像判读后放射科医生的需求反而在增长,因为「生产率创造能力,能力创造增长」。他还肯定了开源模型的作用,称 DeepSeek-R1 通过让强大的推理模型广泛可用,推动了应用层快速增长,同时也增加了对训练算力和基础设施的需求。
更多详细信息请阅读 BlockBeats 最新翻译的全文:《英伟达黄仁勋最新文章:AI的「五层蛋糕」》(https://www.theblockbeats.info/news/61503)
BlockBeats
英伟达黄仁勋最新文章:AI的「五层蛋糕」
英伟达将AI拆解为能源、芯片、基础设施、模型与应用五层体系,并指出每一个成功的 AI 应用都会向下牵动整条从算力到电力的产业链
❤1
Claude Code 新增 /btw 命令:Agent 干活时可以「插嘴」提问,不打断当前任务
Anthropic 工程师 Thariq Shihipar 宣布 Claude Code 新增
演示视频显示,当 Claude 正在重构
该功能解决了 AI 编程 Agent 的一个常见痛点:当 Agent 正在执行长时间任务时,用户想了解代码细节或确认上下文,此前只能等任务完成或另开一个会话。`/btw` 让用户可以在不中断 Agent 工作的情况下随时「插嘴」。
信源:https://x.com/trq212/status/2031506296697131352
Anthropic 工程师 Thariq Shihipar 宣布 Claude Code 新增
/btw 命令,允许用户在 Claude 正在执行任务(如编辑文件、重构代码)时发起「旁路对话」(side chain conversation),向 Claude 提问而不中断当前工作流。演示视频显示,当 Claude 正在重构
src/api/retry.ts 文件时,用户输入 `/btw what does the retry logic do?`,Claude 在继续执行编辑操作的同时,以内联方式回答了问题:「fetchWithRetry() 最多重试 3 次,使用指数退避(250ms → 1s),仅对 5xx 错误重试。」回答以浮动提示形式出现,按空格、回车或 Esc 即可关闭,不会污染主对话上下文。该功能解决了 AI 编程 Agent 的一个常见痛点:当 Agent 正在执行长时间任务时,用户想了解代码细节或确认上下文,此前只能等任务完成或另开一个会话。`/btw` 让用户可以在不中断 Agent 工作的情况下随时「插嘴」。
信源:https://x.com/trq212/status/2031506296697131352
业余项目做成了求职信:Codex Monitor 开发者加入 OpenAI,将参与 Codex 开发者体验团队
法国独立开发者 Thomas Ricouard(@Dimillian)宣布将于本月底加入 OpenAI,专注于 Codex 相关工作。Ricouard 此前在 Medium 担任资深 iOS 工程师,更为人知的身份是开源 Mastodon 客户端 IceCubesApp 的作者,此前还曾在 Google 和电子书平台 Glose 工作。
真正促成这次加入的,是他业余时间开发的开源项目 Codex Monitor。在 OpenAI 2 月初正式推出官方 Codex macOS 桌面应用之前,Ricouard 就已独立构建了这款基于 Tauri(Rust + React)的第三方桌面客户端。Codex Monitor 通过 Codex CLI 的 app-server 协议连接底层 Agent,提供了多工作区编排、线程管理、Git worktree 隔离和 GitHub 集成等功能——与 OpenAI 后来发布的官方 app 在产品理念上高度重合:两者都定位为 Agent 的「指挥中心」,都支持多 Agent 并行、worktree 隔离和 diff review。Ricouard 本人已将 Codex Monitor 作为日常主力开发环境,取代了传统 IDE。
Ricouard 表示,他将加入 Codex 的开发者体验团队,与 OpenAI 开发者关系负责人 Romain Huet 合作,并期待将自己的 iOS 和 macOS 开发经验带入 Codex 在这些平台上的体验优化。他确认 Codex Monitor 将继续保持开源。这也契合 OpenAI 近期的招募模式——去年 9 月,OpenAI 以类似路径将 AI Xcode 工具 Alex 的团队纳入 Codex 部门。
信源:https://x.com/Dimillian/status/2031418688813830223
法国独立开发者 Thomas Ricouard(@Dimillian)宣布将于本月底加入 OpenAI,专注于 Codex 相关工作。Ricouard 此前在 Medium 担任资深 iOS 工程师,更为人知的身份是开源 Mastodon 客户端 IceCubesApp 的作者,此前还曾在 Google 和电子书平台 Glose 工作。
真正促成这次加入的,是他业余时间开发的开源项目 Codex Monitor。在 OpenAI 2 月初正式推出官方 Codex macOS 桌面应用之前,Ricouard 就已独立构建了这款基于 Tauri(Rust + React)的第三方桌面客户端。Codex Monitor 通过 Codex CLI 的 app-server 协议连接底层 Agent,提供了多工作区编排、线程管理、Git worktree 隔离和 GitHub 集成等功能——与 OpenAI 后来发布的官方 app 在产品理念上高度重合:两者都定位为 Agent 的「指挥中心」,都支持多 Agent 并行、worktree 隔离和 diff review。Ricouard 本人已将 Codex Monitor 作为日常主力开发环境,取代了传统 IDE。
Ricouard 表示,他将加入 Codex 的开发者体验团队,与 OpenAI 开发者关系负责人 Romain Huet 合作,并期待将自己的 iOS 和 macOS 开发经验带入 Codex 在这些平台上的体验优化。他确认 Codex Monitor 将继续保持开源。这也契合 OpenAI 近期的招募模式——去年 9 月,OpenAI 以类似路径将 AI Xcode 工具 Alex 的团队纳入 Codex 部门。
信源:https://x.com/Dimillian/status/2031418688813830223
Claude Code之父回应「写代码的AI为什么还需要另一个AI找Bug」:投入越多token结果越好,独立上下文窗口是关键
Claude Code 昨日上线了 Code Review 功能,当 PR 被打开时自动派出一组 Agent 审查代码、搜寻 Bug。有用户质疑:如果 Claude Code 写代码这么厉害,为什么还需要单独的功能来找 Bug?
Claude Code 创始人兼负责人 Boris Cherny 在推特回复了这个问题。他的核心观点是:往一个编程问题上投入越多 token,结果就越好,这就是「测试时计算」(test time compute)。而让结果更好的一个关键方法是使用独立的上下文窗口,这正是 subagent 的工作原理,也解释了为什么同一个模型,一个 Agent 写出了 Bug,另一个 Agent 却能找到它。「这跟工程师之间的关系类似,如果我写了一个 Bug,我的同事做 code review 时可能比我自己更容易发现它。」他认为终极状态下 Agent 能写出近乎无 Bug 的代码,但在达到那个水平之前,「多个不相关的上下文窗口」是目前最好的补偿策略。
信源:https://x.com/bcherny/status/2031151689219321886
Claude Code 昨日上线了 Code Review 功能,当 PR 被打开时自动派出一组 Agent 审查代码、搜寻 Bug。有用户质疑:如果 Claude Code 写代码这么厉害,为什么还需要单独的功能来找 Bug?
Claude Code 创始人兼负责人 Boris Cherny 在推特回复了这个问题。他的核心观点是:往一个编程问题上投入越多 token,结果就越好,这就是「测试时计算」(test time compute)。而让结果更好的一个关键方法是使用独立的上下文窗口,这正是 subagent 的工作原理,也解释了为什么同一个模型,一个 Agent 写出了 Bug,另一个 Agent 却能找到它。「这跟工程师之间的关系类似,如果我写了一个 Bug,我的同事做 code review 时可能比我自己更容易发现它。」他认为终极状态下 Agent 能写出近乎无 Bug 的代码,但在达到那个水平之前,「多个不相关的上下文窗口」是目前最好的补偿策略。
信源:https://x.com/bcherny/status/2031151689219321886
「斯坦福小镇」团队创业后提出AI三阶段论:预测→推理→模拟,称模拟才是通向超级智能的真正路径
斯坦福大学教授 Percy Liang 和 Simile AI CEO Joon Sung Park 发表博文,提出 AI 正在进入「模拟时代」。Percy Liang 认为,AI 迄今最令人印象深刻的成就都发生在环境和奖励函数明确的场景中(如围棋、IMO 数学竞赛、从零写出完整应用),RL 算法可以在沙盒中安全地尝试不同操作并观察结果。但现实世界中涉及人的问题(远程办公如何影响组织文化?如何为数百万学生重新设计三年级数学课程?)奖励模糊、风险高、无法直接实验,这恰恰是 AI 下一个最大的机会所在。
博文将 AI 的演进划分为三个阶段:预测时代(训练通用模型对文本和图像做高精度分类)、推理时代(让模型解决数学和编程等复杂多步问题)、模拟时代(理解人类和环境到足以推演任意「如果…会怎样」场景的程度)。Percy Liang 认为,模拟本质上是因果模型,不仅能预测未来,还能评估干预效果和回答反事实问题,「预测模型能生成最优行动但无法解释原因,推理模型能讲故事但不一定扎根于现实,模拟则为世界上最复杂的问题提供完整可审计的推演轨迹」,并称这是「通向稳健超级智能的真正路径」。
Joon Sung Park 是 2023 年轰动学界的「斯坦福小镇」(Generative Agents)论文第一作者(让 25 个 AI 居民在虚拟小镇自主生活、产生涌现行为的经典实验)。两人共同创办的 Simile AI 于上月完成 1 亿美元 A 轮融资,Index Ventures 领投,李飞飞和 Andrej Karpathy 参投,目标是将模拟从数千个 Agent 扩展到数百万乃至全球 80 亿人口规模。
信源:https://www.simile.ai/blog/simulation-next-frontier
斯坦福大学教授 Percy Liang 和 Simile AI CEO Joon Sung Park 发表博文,提出 AI 正在进入「模拟时代」。Percy Liang 认为,AI 迄今最令人印象深刻的成就都发生在环境和奖励函数明确的场景中(如围棋、IMO 数学竞赛、从零写出完整应用),RL 算法可以在沙盒中安全地尝试不同操作并观察结果。但现实世界中涉及人的问题(远程办公如何影响组织文化?如何为数百万学生重新设计三年级数学课程?)奖励模糊、风险高、无法直接实验,这恰恰是 AI 下一个最大的机会所在。
博文将 AI 的演进划分为三个阶段:预测时代(训练通用模型对文本和图像做高精度分类)、推理时代(让模型解决数学和编程等复杂多步问题)、模拟时代(理解人类和环境到足以推演任意「如果…会怎样」场景的程度)。Percy Liang 认为,模拟本质上是因果模型,不仅能预测未来,还能评估干预效果和回答反事实问题,「预测模型能生成最优行动但无法解释原因,推理模型能讲故事但不一定扎根于现实,模拟则为世界上最复杂的问题提供完整可审计的推演轨迹」,并称这是「通向稳健超级智能的真正路径」。
Joon Sung Park 是 2023 年轰动学界的「斯坦福小镇」(Generative Agents)论文第一作者(让 25 个 AI 居民在虚拟小镇自主生活、产生涌现行为的经典实验)。两人共同创办的 Simile AI 于上月完成 1 亿美元 A 轮融资,Index Ventures 领投,李飞飞和 Andrej Karpathy 参投,目标是将模拟从数千个 Agent 扩展到数百万乃至全球 80 亿人口规模。
信源:https://www.simile.ai/blog/simulation-next-frontier
Simile
Simulation: The Next Frontier for AI
Simulation goes beyond prediction and reasoning, enabling us to answer much more ambitious questions.
谷歌Workspace全线接入Gemini:Docs从邮件和云盘自动起草文档,Sheets表格生成速度提升9倍,Slides一句话出品牌风格幻灯片
谷歌 CEO Sundar Pichai 宣布 Workspace 套件全线深度集成 Gemini,今日起以 Beta 形式向 Google AI Ultra 和 Pro 付费用户开放(英文版全球可用,Drive 功能暂限美国)。
Docs 新增「Help me create」功能:用户用自然语言描述需求,Gemini 会从 Gmail、Drive 和 Google Chat 中提取相关信息,自动生成格式完整的初稿。考虑到超过三分之一的新文档是通过复制已有文件创建的,谷歌还新增了「Match doc format」(复制参考文档的版式)和「Match writing style」(统一多人协作文档的语气风格)两个编辑功能。Sheets 的升级幅度最大:Gemini 可以从自然语言描述直接生成包含公式和格式的完整电子表格,谷歌称复杂表格的生成速度较此前提升 9 倍。Slides 新增 AI 布局生成,用户描述内容后 Gemini 会自动生成符合品牌风格的幻灯片。Drive 则在搜索结果顶部新增 AI 摘要功能,直接给出答案而无需翻找文件夹。
信源:https://x.com/sundarpichai/status/2031380361696129261
谷歌 CEO Sundar Pichai 宣布 Workspace 套件全线深度集成 Gemini,今日起以 Beta 形式向 Google AI Ultra 和 Pro 付费用户开放(英文版全球可用,Drive 功能暂限美国)。
Docs 新增「Help me create」功能:用户用自然语言描述需求,Gemini 会从 Gmail、Drive 和 Google Chat 中提取相关信息,自动生成格式完整的初稿。考虑到超过三分之一的新文档是通过复制已有文件创建的,谷歌还新增了「Match doc format」(复制参考文档的版式)和「Match writing style」(统一多人协作文档的语气风格)两个编辑功能。Sheets 的升级幅度最大:Gemini 可以从自然语言描述直接生成包含公式和格式的完整电子表格,谷歌称复杂表格的生成速度较此前提升 9 倍。Slides 新增 AI 布局生成,用户描述内容后 Gemini 会自动生成符合品牌风格的幻灯片。Drive 则在搜索结果顶部新增 AI 摘要功能,直接给出答案而无需翻找文件夹。
信源:https://x.com/sundarpichai/status/2031380361696129261
情感语音AI公司Hume AI首次开源TTS模型TADA:1000+测试样本零内容幻觉,比同级LLM语音合成快5倍
情感语音 AI 公司 Hume AI 首次开源了TTS(文本转语音)模型 TADA(Text-Acoustic Dual Alignment)。该模型的核心创新是将文本 token 与声学特征做 1:1 对齐,在单一同步流中同时生成文本和语音,从根本上消除了传统 LLM TTS 中因音频序列远长于文本序列而导致的幻觉问题。
官方公布的性能数据:在 1000+ 测试样本中实现零内容幻觉(传统系统常出现漏词、多词等问题),推理速度比同级 LLM TTS 快 5 倍。在相同的 2048 个 token 预算下,TADA 可覆盖约 700 秒音频,而传统系统仅覆盖约 70 秒,同时附带免费文本转录且不增加延迟。代码和预训练模型已在 PyPI 上开放下载。
Hume AI 由心理学博士 Alan Cowen 创立,专注于理解和生成具有情感表达能力的语音 AI。今年 1 月,Cowen 和约 7 名核心工程师被谷歌 DeepMind 以 IP 授权模式引入(非收购),用于增强 Gemini 的情感语音能力。Hume AI 在新任 CEO Andrew Ettinger 领导下继续独立运营。
信源:https://www.hume.ai/blog/opensource-tada
情感语音 AI 公司 Hume AI 首次开源了TTS(文本转语音)模型 TADA(Text-Acoustic Dual Alignment)。该模型的核心创新是将文本 token 与声学特征做 1:1 对齐,在单一同步流中同时生成文本和语音,从根本上消除了传统 LLM TTS 中因音频序列远长于文本序列而导致的幻觉问题。
官方公布的性能数据:在 1000+ 测试样本中实现零内容幻觉(传统系统常出现漏词、多词等问题),推理速度比同级 LLM TTS 快 5 倍。在相同的 2048 个 token 预算下,TADA 可覆盖约 700 秒音频,而传统系统仅覆盖约 70 秒,同时附带免费文本转录且不增加延迟。代码和预训练模型已在 PyPI 上开放下载。
Hume AI 由心理学博士 Alan Cowen 创立,专注于理解和生成具有情感表达能力的语音 AI。今年 1 月,Cowen 和约 7 名核心工程师被谷歌 DeepMind 以 IP 授权模式引入(非收购),用于增强 Gemini 的情感语音能力。Hume AI 在新任 CEO Andrew Ettinger 领导下继续独立运营。
信源:https://www.hume.ai/blog/opensource-tada
www.hume.ai
Opensourcing TADA: Fast, Reliable Speech Generation Through Text-Acoustic Synchronization
TADA (Text-Acoustic Dual Alignment) is Hume AI's open-source speech-language model that synchronizes text and audio one-to-one.
Codex又挂了:工程负责人承认需求增速超出预期,同期ChatGPT文件上传下载也出现故障
OpenAI 状态页显示 Codex 再次无响应,截至发稿已持续超过 1 天,官方表示仍在实施修复方案。同时 ChatGPT 也出现文件上传错误(持续 7 小时,已进入监控恢复阶段)和文件下载错误(持续 5 小时,已确认问题)。
Codex 工程负责人 Thibault Sottiaux 在 X 上表示:「我们正在尽快为 Codex 增加算力,但需求增速超出预期,部分用户的服务可能会有些卡顿。团队在幕后全力工作。」这是 Codex 连续两天出现服务中断。昨日故障修复后,团队曾按惯例重置了所有用户的速率限制作为补偿。
信源:https://x.com/thsottiaux/status/2031411642618228935
OpenAI 状态页显示 Codex 再次无响应,截至发稿已持续超过 1 天,官方表示仍在实施修复方案。同时 ChatGPT 也出现文件上传错误(持续 7 小时,已进入监控恢复阶段)和文件下载错误(持续 5 小时,已确认问题)。
Codex 工程负责人 Thibault Sottiaux 在 X 上表示:「我们正在尽快为 Codex 增加算力,但需求增速超出预期,部分用户的服务可能会有些卡顿。团队在幕后全力工作。」这是 Codex 连续两天出现服务中断。昨日故障修复后,团队曾按惯例重置了所有用户的速率限制作为补偿。
信源:https://x.com/thsottiaux/status/2031411642618228935
1720亿token实测35个模型:上下文越长幻觉越多,200K时所有模型捏造率均超10%
研究者 JV Roig 发布论文,使用名为 RIKER 的确定性评估方法(无需人工标注或 LLM 裁判),对 35 个开源模型在文档问答场景中的幻觉率进行了迄今最大规模的系统测试:覆盖 3 种上下文长度(32K、128K、200K token)、4 种温度设置和 3 种硬件平台(NVIDIA H200、AMD MI300X、Intel Gaudi 3),总评估量超过 1720 亿 token,比此前同类研究高出一个数量级。
核心发现:
(1)即使是表现最好的模型,在 32K 上下文时仍有 1.19% 的捏造率,顶级模型区间为 5% 到 7%。上下文扩展到 128K 时捏造率接近翻三倍,200K 时所有模型均超过 10%。
(2)模型选择是影响准确率的最大因素,不同模型间准确率差距达 72 个百分点,且模型家族对抗幻觉的能力差异大于模型参数量的影响。
(3)温度的影响比预期复杂。T=0.0 在约 60% 的情况下整体准确率最高,但更高温度反而降低了多数模型的捏造率,并大幅减少「死循环生成」(coherence loss)现象,T=0.0 下的死循环发生率最高可达 T=1.0 的 48 倍。
(4)「找到事实」和「不捏造事实」是两种独立能力。擅长定位文档中信息的模型,可能同样会编造文档中不存在的信息。
(5)不同硬件平台上的结果一致,部署决策无需考虑硬件差异。
信源:https://arxiv.org/abs/2603.08274
研究者 JV Roig 发布论文,使用名为 RIKER 的确定性评估方法(无需人工标注或 LLM 裁判),对 35 个开源模型在文档问答场景中的幻觉率进行了迄今最大规模的系统测试:覆盖 3 种上下文长度(32K、128K、200K token)、4 种温度设置和 3 种硬件平台(NVIDIA H200、AMD MI300X、Intel Gaudi 3),总评估量超过 1720 亿 token,比此前同类研究高出一个数量级。
核心发现:
(1)即使是表现最好的模型,在 32K 上下文时仍有 1.19% 的捏造率,顶级模型区间为 5% 到 7%。上下文扩展到 128K 时捏造率接近翻三倍,200K 时所有模型均超过 10%。
(2)模型选择是影响准确率的最大因素,不同模型间准确率差距达 72 个百分点,且模型家族对抗幻觉的能力差异大于模型参数量的影响。
(3)温度的影响比预期复杂。T=0.0 在约 60% 的情况下整体准确率最高,但更高温度反而降低了多数模型的捏造率,并大幅减少「死循环生成」(coherence loss)现象,T=0.0 下的死循环发生率最高可达 T=1.0 的 48 倍。
(4)「找到事实」和「不捏造事实」是两种独立能力。擅长定位文档中信息的模型,可能同样会编造文档中不存在的信息。
(5)不同硬件平台上的结果一致,部署决策无需考虑硬件差异。
信源:https://arxiv.org/abs/2603.08274
arXiv.org
How Much Do LLMs Hallucinate in Document Q&A Scenarios? A...
How much do large language models actually hallucinate when answering questions grounded in provided documents? Despite the critical importance of this question for enterprise AI deployments,...