动察Beating AI News
3.24K subscribers
939 photos
2 videos
1 file
3.5K links
AI新闻信息流
Download Telegram
Hugging Face CEO:中国开源正在成为塑造全球AI技术栈的最大力量

Hugging Face 联合创始人兼 CEO Clément Delangue 就 Cursor Composer 2 以 Kimi K2.5 为基座一事发表评论,称此事印证了三点判断:

- 开源始终是竞争最大的推动力
- 中国开源「如今是塑造全球 AI 技术栈的最大力量」
- 前沿竞争不再只是谁从头训练,而是谁适配、微调、产品化得最快(他以 OpenClaw 为例)

信源:https://x.com/clementdelangue/status/2035042945884463538?s=46
Claude Code上线云端定时任务:自动审PR、升级依赖,无需本地运行

Anthropic 旗下 AI 编程工具 Claude Code 新增云端定时任务功能。用户可指定代码仓库、执行计划和提示词,Claude 将通过云端基础设施按计划自动执行,无需保持本地 Claude Code 运行。

从产品界面看,用户可通过 Web 端配置定时任务,也可在已有会话中输入 /schedule 命令创建。示例任务包括每日自动审查所有开放 PR、标记超过两天无人处理的 PR、每周一自动升级补丁级依赖并提交 PR、每晚重跑失败的 CI 任务并为反复失败的用例建 ticket。

信源:https://x.com/noahzweben/status/2035122989533163971?s=46
智谱预告GLM-5.1将开源

智谱 Z.ai 全球负责人李子玄在 X 上发文:「Don't panic. GLM-5.1 will be open source.」(别慌,GLM-5.1 将会开源。)未透露发布时间及模型细节。

信源:https://x.com/zixuanli_/status/2035039071894933546?s=46
OpenAI发布GPT-5.4前端设计指南及Codex专用Skill:低推理反而出更好设计

OpenAI 发布开发者博客,介绍如何用 GPT-5.4 生成高质量前端界面,并同步开源 frontend-skill 供 Codex 用户安装使用。博客披露了 GPT-5.4 在前端方向的三项针对性训练改进:

1. 原生集成图片搜索与图片生成工具,可在设计流程中先生成情绪板(mood board)再选定视觉资产
2. 长任务完成度更高,复杂游戏和交互体验可在一到两轮对话内实现
3. 作为 OpenAI 首个原生支持 Computer Use 的主线模型,可配合 Playwright 自主检查渲染结果、测试多视口、验证交互行为

博客提出一个反直觉建议:前端任务中,低到中等推理等级的效果往往优于高推理,模型更专注、不易过度思考。`frontend-skill` 内置了详细的设计约束规则,覆盖排版、配色、动效、卡片使用限制等,引导模型产出更克制、更有设计感的界面。

信源:https://developers.openai.com/blog/designing-delightful-frontends-with-gpt-5-4
Karpathy:12月以来没写过一行代码,Agent用不好?「那是你菜」

「vibe coding」概念提出者、OpenAI 创始成员 Andrej Karpathy 在 No Priors 播客中透露,去年 12 月是他工作方式的分水岭。此前他自己写代码与委托 Agent 的比例约为 80:20,12 月之后反转为 20:80,「到现在可能已经不止了」,「我大概从 12 月起就没打过一行代码」。

他将这种状态称为「AI 精神病」(AI psychosis):Agent 的能力边界尚未被充分探索,「一切皆有可能,而一切失败归根结底都是技能问题(skill issue)」。他开始像 PhD 时期看 GPU 利用率一样关注 Token 吞吐量,「订阅额度没用完就意味着你没有最大化产出」。他还描述了 Agent 的「锯齿感」:「我同时感觉在和一个极其聪明的、做了一辈子系统编程的博士生对话,又在和一个十岁小孩对话。」

信源:https://youtu.be/kwSVtQ7dziU?is=3sOtdOW0ZZMVk_xt
1
Karpathy提出类区块链AI研究网络:去中心化Agent集群可能跑赢前沿实验室

Andrej Karpathy 在 No Priors 播客中详述了他近期开源的 autoresearch 项目的实际效果:在已经手动调优多年的 nanoGPT 代码库上,autoresearch 跑了一夜后发现了他本人遗漏的优化点,包括 value embeddings 的 weight decay 和未充分调优的 Adam betas。「代码库已经调得很好了,它还是找到了改进,而这只是单次循环。」

他进一步提出一个更大胆的设想:一个类似区块链的去中心化 Agent 网络。不可信的计算节点通过「提交 commit 替代出块、实验验证替代工作量证明」的方式协作改进模型,验证成本远低于生成成本,类似 Folding@home 的结构。「一群互联网上的 Agent 集群有可能在改进 LLM 这件事上绕着前沿实验室跑圈,」他说,「前沿实验室有大量可信算力,但地球比它们大得多。」

信源:https://youtu.be/kwSVtQ7dziU?is=3sOtdOW0ZZMVk_xt
Karpathy:大多数App不该存在,3个提示词让AI接管整个智能家居

Andrej Karpathy 在 No Priors 播客中称,应用商店里的大多数智能家居 App「根本不该存在,一切都该是 API 端点,Agent 才是智能粘合层」。他分享了今年 1 月构建的家庭 Agent「Dobby the elf claw」:只用三个提示词,Agent 自行扫描局域网发现了 Sonos 音响,逆向工程其协议后接管播放控制。如今 Dobby 通过 WhatsApp 对话统一控制灯光、空调、窗帘、泳池、安防系统,取代了此前六个独立 App。他还接入了视觉模型监控安防摄像头,有人到访时自动推送图片消息到 WhatsApp。

「这在一两年内应该是免费的,不涉及任何 vibe coding,这是基本功,」Karpathy 说,「客户不再是人类了,而是代替人类行事的 Agent。这场重构的规模将相当可观。」

信源:https://youtu.be/kwSVtQ7dziU?is=3sOtdOW0ZZMVk_xt
1
美团开源560B参数定理证明模型:72次推理通过率97.1%,刷新开源模型SOTA

美团 LongCat 团队开源 LongCat-Flash-Prover,一个 5600 亿参数的 MoE 模型,专攻形式化定理证明语言 Lean4 的数学推理任务。模型权重以 MIT 协议发布,已上线 GitHub、Hugging Face 和 ModelScope。

模型将形式化推理拆解为三项独立能力:自动形式化(将自然语言数学问题转化为 Lean4 形式语句)、草图生成(产出引理风格的证明框架)和完整证明生成。三项能力均通过 Agent 工具集成推理(TIR)与 Lean4 编译器实时交互验证。训练方面,团队提出 Hybrid-Experts Iteration Framework 生成冷启动数据,并在强化学习阶段引入 HisPO 算法稳定 MoE 模型的长程任务训练,同时加入定理一致性和合法性检测机制防止 reward hacking。

基准测试显示,LongCat-Flash-Prover 在开源权重模型中刷新了自动形式化和定理证明两项 SOTA。MiniF2F-Test 上仅用 72 次推理即达 97.1% 通过率,ProverBench 和 PutnamBench 分别达到 70.8% 和 41.5%,每题推理次数不超过 220 次。

信源:https://x.com/meituan_longcat/status/2034993254358516152?s=46
xAI派工程师驻场客户办公室抢企业订单,但拿下的第一个大客户是马斯克盟友的公司

xAI 正将工程师直接派往潜在企业客户的办公室,提供驻场定制服务,试图从 OpenAI 和 Anthropic 手中争夺商业客户。这种「白手套」策略已帮助 xAI 拿下支付公司 Shift4 Payments 的一份数百万美元合同。

Shift4 CEO Taylor Lauber 接受彭博社采访时称,经过 xAI 工程师驻场优化后,公司计划逐步淘汰 ChatGPT,在日常业务中全面转向 Grok,但编程任务仍继续使用 Anthropic 的 Claude。xAI 团队于 2025 年底开始与 Shift4 合作,核心任务包括分析支付用户健康状况和预测客户流失原因。Lauber 称 xAI 平台的独特优势在于能从 X 社交网络获取「社交信号」数据,用于评估客户情绪。Shift4 计划未来三个月将业务扩展至 15 个国家。

不过,Shift4 并非一个纯粹的市场化客户赢单。该公司创始人 Jared Isaacman 是马斯克盟友,曾搭乘 SpaceX 飞船完成全球首次商业太空行走,目前担任 NASA 局长。SpaceX 旗下 Starlink 也是 Shift4 的客户。在 xAI 成立的三年中,其客户主要集中在马斯克旗下的特斯拉、SpaceX 等关联企业及政府机构。

彭博社指出,xAI 的驻场策略反映了 AI 行业的普遍趋势:OpenAI 和 Anthropic 同样在积极外派工程师协助客户部署,OpenAI 还在与私募股权公司合作组建专门的「部署部门」。

信源:https://www.bloomberg.com/news/articles/2026-03-20/xai-sends-engineers-to-client-sites-to-win-business-from-openai
1
Macrohard落地第一步?Grok源代码泄露电脑操控智能体开关,马斯克确认即将推出

X 平台用户在 Grok 网页端源代码中发现了名为 enable_grok_computer 的功能开关,推测 xAI 正在准备上线一款电脑操控智能体,相当于此前公布的 Macrohard 项目的「尝鲜版」。xAI 创始人 Elon Musk 随后转发相关帖子确认「即将推出」。

Macrohard 是特斯拉和 xAI 联合开发的 AI 自动化系统,以 Grok 作为高层推理引擎,搭配 AI 智能体实时处理屏幕画面与键鼠操作。此前有报道称该项目数据采集工作在上月暂停。

信源:https://x.com/elonmusk/status/2035301707522187300?s=46
MiniMax将Coding Plan升级为Token Plan:一个Key可调用编程、视频、语音、音乐、图像全模态模型

MiniMax 宣布将原有的 Coding Plan 全面升级为 Token Plan,在 M2.7 编程模型的基础上,新增对 Hailuo 视频模型、Speech 语音模型、Music 音乐模型和 Image 图像生成模型的调用支持。用户通过一个 Token Plan Key 即可覆盖从代码编写到视频生成的全部模态。

Plus 及以上套餐用户将获得多模态模型的赠送额度,不占用原有编程模型用量,套餐赠额内调用无需额外付费。编程模型的用量和使用体验与原 Coding Plan 保持一致。

针对 M2.7 上线后调用量快速增长带来的算力压力,MiniMax 同步引入流量管控措施:工作日 15:00 至 17:30 高峰时段实施动态限流,并设置单周额度上限(为「5 小时用量」的 10 倍)。有超高并发或批量任务需求的开发者和企业用户,可选择「按量付费」模式获取通用 API Key,该模式不受动态限流管控。此外,MiniMax 还推出语音资源包和视频资源包,支持旗舰语音模型 Speech 2.8 及视频模型 Hailuo 2.3/2.3-Fast,据称价格较单独调用可节省最多 20%。

信源:https://mp.weixin.qq.com/s/o4KGGgtp32vRMecOYCbVmA
MiniMax M2.7将在约两周内开源权重,上线以来仍在持续迭代

MiniMax 工程负责人 Skyler Miao 在 X 上透露,M2.7 模型将在约两周内开放权重(open weights)。他表示团队仍在积极迭代,昨天刚更新了一个新版本,「在 OpenClaw 上明显更好用了」。

M2.7 是 MiniMax 3 月 18 日发布的新一代 Agent 旗舰模型,主打自我进化能力,上线后迅速成为开发者社区热门的编程模型之一。此前 MiniMax 的 M2 系列均提供了开源权重版本。

信源:https://x.com/skylermiao7/status/2035713902714171583?s=46
腾讯AI Lab撤销内幕:俞栋离职引发连锁反应,姚顺雨定下200B模型6月进入国内第一梯队目标

《雷峰网》独家报道披露了腾讯 AI Lab 撤销的幕后经过。AI Lab 原副主任、语音技术负责人俞栋的离职被认为是最大导火索。俞栋离职后,其语音团队被全线并入多模态部负责人薄列峰的体系。报道援引接近俞栋的人士称,俞栋团队的调整可能早于他正式离职,这或许是其离开的核心原因。

此前支持蒋杰接任 AI Lab 主任的刘威于 2024 年离职创业,今年 2 月,成立不到半年的 R4 团队合伙人、曾负责「王者绝悟」项目的叶德珩也离开腾讯,团队同样并入薄列峰的多模态体系。短时间内连失三名核心骨干,促使腾讯总办层面做出撤销 AI Lab 的决定。

3 月 19 日,混元大模型负责人姚顺雨主持了 AI Lab 全员会。他明确表示「这次变化就是为了打破部门墙」,并定下目标:2026 年 6 月,混元要在 200B 中等模型尺寸领域进入国内第一梯队。原 AI Lab 人员涌入后,混元现有的预训练、后训练等四大板块之外,或将新设 Frontier 板块,专注前沿探索。

信源:https://mp.weixin.qq.com/s/Ns869XXbf_50phxD7QN7QQ
扎克伯格给自己造了个「CEO Agent」,跳过层层汇报直取答案

《华尔街日报》援引知情人士报道称,Meta CEO Mark Zuckerberg 正在开发一款辅助自己履行 CEO 职责的 AI Agent。该 Agent 仍在开发中,目前核心功能是帮他更快获取信息,取代通常需要层层传递才能拿到的答案。

这一项目是 Meta 内部更广泛 AI 工具部署的缩影。报道称公司还在测试名为「Second Brain」的内部工具,可从公司文档和聊天记录中检索信息,同时测试能索引项目文件供员工提问的工具,以及能代替用户扫描工作日志、主动联系同事的个人 Agent。

扎克伯格近期也在花更多时间亲自写代码。他在今年 1 月财报电话会上表示:「我们在投资 AI 原生工具,让 Meta 的每个人都能做更多事。我们在提升个人贡献者的地位、压平团队层级。」对这家拥有 7.8 万名员工的公司而言,全面拥抱内部 AI 工具被视为与人数远少于自己的 AI 原生初创公司保持竞争力的关键。

信源:https://www.wsj.com/tech/ai/mark-zuckerberg-is-building-an-ai-agent-to-help-him-be-ceo-eddab2d5
1
阶跃星辰推出Step Plan:$6.99/月起接入OpenClaw,逐档对标OpenAI订阅

阶跃星辰(StepFun)上线面向 AI Agent 和编程场景的 Step Plan 订阅计划,提供四档月付方案:

1. Flash Mini:$6.99/月,每 5 小时 100 次调用,据其官方表述相当于 2 倍 OpenAI Go 用量
2. Flash Plus:$9.99/月,每 5 小时 400 次调用,称 4 倍 OpenAI Plus 用量
3. Flash Pro:$29/月,每 5 小时 1500 次调用,称 4 倍 OpenAI Pro 用量
4. Flash Max:$99/月,每 5 小时 5000 次调用,称 10 倍 OpenAI Pro 用量

所有套餐均包含其旗舰开源模型 Step 3.5 Flash,支持多设备登录和并发 Agent 运行。图像编辑模型 Step 1x Edit 和语音合成模型 Step tts 2 标注为即将上线。

Step Plan 兼容 Claude Code、OpenClaw、Cline、RooCode、Kilo Code、OpenCode、Zed、CherryStudio、goose 共 9 款 AI 编程和 Agent 工具,通过 OpenAI 兼容 API 接入。据官方页面显示,已有超过 1 万名开发者使用该服务。

信源:https://platform.stepfun.ai/step-plan
腾讯内测「腾讯AI问股」小程序,以大模型服务证券咨询

腾讯正在内测一款名为「腾讯AI问股」的微信小程序,通过 AI 大模型回答用户证券业务相关问题。该产品目前仅对受邀用户开放,需申请成为内测体验官。腾讯此前已有腾讯自选股、腾讯微证券、理财通等理财类产品。

信源:https://mp.weixin.qq.com/s/JdwMZQiiY2_lRGZxux_Fkw
百度DuMate全量上线:国内首个企业级OpenClaw产品,主打安全沙箱隔离

百度智能云 DuMate 正式面向全部用户开放,定位国内首个国产企业级 OpenClaw 产品,支持本地部署。

安全是 DuMate 的核心卖点。产品预装安全沙箱,代码和任务在隔离环境中闭环执行,不影响本地系统。文件删除、系统修改、数据外发等高风险操作须经用户明确授权后才执行,同时提供文件夹级权限管控和操作全程审计能力。

功能方面,DuMate 原生支持 Word、Excel、PPT 等主流办公软件,内置百度搜索等技能,也支持用户按需扩展。百度目前已形成覆盖云端、手机、桌面及家用等场景的 OpenClaw 产品矩阵。

信源:https://mp.weixin.qq.com/s/SPAbERDHmNnQoMwtoJ1dlQ
不到5人突击开发的小米miclaw将于4月公测,PC端龙虾也在路上

小米将于 4 月晚些时候开启手机端 OpenClaw 产品 miclaw 的公测。miclaw 是国内首个由手机厂商推出并运行在手机端的 Agent 产品,3 月 6 日首次对外展示并开启小规模封测。

接近小米的人士透露,miclaw 由小米手机团队软件部(澎湃 OS 研发部门)的一支实验性小团队突击开发,初期工程师不足 5 人。该部门在小米属于三级部门,而此前被视为核心 AI 产品的超级小爱隶属集团技术委员会,属二级部门。目前超级小爱已开始尝试与 miclaw 合作,不排除未来两个团队合并。

miclaw 已将手机核心能力封装为超过 50 种系统级工具接口和生态服务,推理由小米自研 MiMo 模型在云端执行。超级小爱团队正在推进 PC 端 OpenClaw 产品的开发,手机版超级小爱也将改版。雷军在 3 月 19 日发布会后表示:「我们把手机龙虾当成 AIOS 的雏形,它是个内置 MiMo 基座大模型的 OS。」他同时称小米集团未来 3 年将在 AI 领域投入 600 亿元。

信源:https://mp.weixin.qq.com/s/oYMMpdkJLYZGpbMEi5a2Tw
Palantir获准访问英国金融监管局敏感数据,以AI打击金融犯罪引发隐私争议

美国 AI 公司 Palantir 获得英国金融行为监管局(FCA)合同,将使用其 AI 系统 Foundry 分析 FCA 内部情报数据,协助打击欺诈、洗钱和内幕交易等金融犯罪。合同为三个月试用期,每周费用超过 3 万英镑。

Palantir 将接触的数据包括:标注为高度敏感的案件情报文件、问题公司信息、银行提交的已证实和疑似欺诈报告、消费者向金融监察员提交的投诉,以及电话录音、电子邮件和社交媒体帖子。FCA 曾考虑使用虚拟数据或匿名化处理,但最终决定只有使用真实数据才有测试价值。

隐私担忧随即浮现。金融犯罪辩护律师 Christopher Houssemayne du Boulay 指出,将大量个人信息导入 AI 系统存在「非常显著的隐私问题」。FCA 内部人士也质疑:「一旦 Palantir 了解了我们如何检测洗钱威胁,如何确保他们不会分享这些信息?」FCA 回应称 Palantir 仅为「数据处理者」,数据仅在英国存储,合同结束后必须销毁。Palantir 在英国公共部门已有超过 5 亿英镑合同,涵盖 NHS、军方和警方。

信源:https://www.theguardian.com/technology/2026/mar/22/palantir-extends-reach-into-british-state-as-it-gets-access-to-sensitive-fca-data
ChatGPT广告CPM高达60美元比肩NFL直播,但试点过半预算仅花出15%到20%

OpenAI 为 ChatGPT 广告试点设定的 CPM(每千次展示费用)高达 60 美元,与 NFL 橄榄球直播广告位处于同一价位。《The Information》报道称,首批广告客户须承诺至少 20 万美元预算,购买流程极其原始,全靠电话、电子表格和电子邮件推进,没有自助投放平台。

试点运行至今,效果令广告主失望。两家代理商高管表示无法证明 ChatGPT 广告带来了可衡量的商业回报。更突出的问题是消耗速度:试点过半,广告主承诺预算中仅花出 15% 至 20%,部分广告主担心到 3 月底试点结束时预算都花不完。未使用的部分虽会退还,但该季度内无法调配到其他渠道。

ChatGPT 拥有 9.2 亿周活跃用户,其中约 5% 为付费用户。OpenAI 正在测试自助广告管理平台,同时与广告技术公司 Criteo 合作推出购物广告,Criteo 的广告客户承诺金额在 5 万至 10 万美元之间。但 OpenAI 仅向广告技术合作伙伴提供有限的用户定向数据,且没有推出程序化广告竞价的计划。OpenAI 回应称慢推进是有意为之,目标是先为消费者优化体验再扩大规模。

信源:https://www.theinformation.com/articles/openais-first-advertisers-prove-chatgpt-ads-work
苹果Apple TV、HomePod全球库存告急,古尔曼:苹果可能不再等AI功能就绪即推新品

彭博社记者 Mark Gurman 在最新一期《Power On》中报道,苹果零售店中 HomePod、HomePod mini 和 Apple TV 三款产品的线下库存正在告急。

Gurman 指出,苹果至少从去年起就已准备好新版 Apple TV 和 HomePod mini,但一直推迟发布,原因是在等待新版 Siri 和其他 Apple Intelligence 功能升级。他认为苹果可能已决定不再等待,「如果新硬件真的很快到来,很可能意味着苹果不想再等了」。

下一代 Apple TV 4K 预计从现款 A15 芯片升级至 A17 Pro 以支持 Apple Intelligence,HomePod mini 则会从 S5 芯片升级为新款芯片并推出全新配色。大号 HomePod 虽然更新时间较近,库存同样在减少,Gurman 称如果苹果推出新款以与 HomePod mini 保持同步,他也不会意外。

信源:https://www.bloomberg.com/news/newsletters/2026-03-22/apple-s-airpods-max-2-blurs-the-lines-between-marketing-and-innovation-mn1pfx3h?embedded-checkout=true