动察Beating AI News
3.13K subscribers
870 photos
2 videos
3.38K links
AI新闻信息流
Download Telegram
月之暗面重写终端智能体并更名kimi-code,全面看齐Claude Code架构

月之暗面旗下的开源终端 AI 编码智能体 kimi-cli 正在悄然进行仓库迁移与架构重写,并已正式更名为 kimi-code。为了解决原 Python 版本在交互响应与执行效率上的瓶颈,研发团队全面倒向了 Anthropic 旗下终端工具 Claude Code 的技术路线,完成了一次基于 TypeScript 和 Bun 运行时的完整架构重构,实现了毫秒级冷启动与流畅的终端用户界面(TUI)。

本次架构调整意味着 Kimi 彻底抛弃了原有的 Python 终端技术栈,全面对标并引入了 Claude Code 的成熟方案。工具使用 Commander.js 规范命令解析,并基于 React Ink 替代 Rich 与 prompt-toolkit 实现全新的响应式 TUI 界面。重构共涉及 166 个 TypeScript 源码文件,代码增量超 3.8 万行。在 SWE-bench Verified 基准测试中,基于 kimi-k2.5 模型的 TypeScript 重构版本在 500 个开发任务中成功解决 317 个(解决率 63.4%),性能在维持 Python 原版水平的同时,运行稳定性与网络层抗干扰能力显著提升。

除底座架构对标外,kimi-code 重点打磨了人机协同体验。新版本不仅支持在终端中拖入屏幕录像等视频资产进行多模态分析,还深度还原了 Claude Code 的多项标杆设计,包括支持光标交互编辑的「计划模式」、Emacs 常用快捷键、双击 Ctrl + C 快速退出的安全设计,以及支持通过自定义生命周期钩子(Hooks)对接自动化工作流。在多模型生态兼容上,kimi-code 开放了第三方大模型 API 的自定义接入,使工具不仅局限于 Kimi 家族,更可作为跨模型的统一终端编程网关使用。

信源:https://github.com/MoonshotAI/kimi-code
华为中科大联手突破英伟达垄断,昇腾A3跑大模型专家计算提速58%

在大规模 MoE 架构演进中,利用国产昇腾 (Ascend) 芯片训练大模型已成为构建自主可控 AI 算力的关键方向。然而,主流大模型框架多基于英伟达 CUDA 生态开发,直接移植至昇腾平台时易面临硬件队列调度不均、算力利用率低等挑战。中科大、华为与北大等联合推出编译调度框架 HyperParallel-MoE,针对昇腾 A3 独特的硬件队列进行瓦片级 (tile-level) 调控,旨在突破异构算力在并行调度上的能效瓶颈。

昇腾 A3 拥有两类核心,AIC 负责矩阵乘法,AIV 则处理向量计算与通信。但在传统的算子串行调度下,两类核心只能交替工作、轮流闲置。实测数据显示,在 256 节点集群跑 671B 的 DeepSeek 风格大模型时,AIC 利用率仅为 67%,且 39% 的专家路由通信延迟暴露在关键计算路径上。

HyperParallel-MoE 核心改动有三项。第一,设计 AIV 驱动的单边写原语,使数据瓦片到达即触发计算,无需等待整批到齐。第二,引入依赖感知瓦片任务生成,将通信与计算算子统一抽象。第三,以静态调度器预生成任务序列,在单个 kernel 内驱动两类核心并行,并利用高速 L2 缓存共享中间结果,减少回写与读取 HBM 慢速内存的延迟。

测试显示,在 64 节点平衡路由下,负责专家计算的核心模块(MoE-FFN)延迟缩短约 36%,相当于数据处理速度最高提升了 58%(即提速 1.49 至 1.58 倍)。在整机端到端运行中,单步训练速度也同步提升了 8% 至 9%。这说明,昇腾的实际能效不只取决于硬件规格,更在编译器与运行时能否把 AIC/AIV 核心高效调度起来。

信源:https://arxiv.org/html/2605.23764v1
👍2
微软开源3.8B文生图底座Lens,4步推理仅0.84秒,媲美6B+级效果

微软开源 3.8B 参数文生图底座模型系列 Lens。在保持与超越主流 6B 级模型性能的前提下,Lens 实现了极致的训练效率。在峰值 BF16 TFLOPS 算力归一化测试中(排除 caption 重生成成本),训练仅消耗阿里巴巴通义实验室 Z-Image 约 19.3% 的算力。

数据与架构的双重优化是削减训练成本的核心。训练数据集 Lens-800M 包含 8 亿图像-文本对。不同于传统短文本标注,样本全部由 GPT-4.1 生成,提示词平均长度达 109 个单词,具有极高的语义信息密度。模型架构采用 48 个 MMDiT blocks 与 FLUX.2 语义 VAE。文本特征来自 GPT-OSS,通过拼接第 4、12、18、24 层特征表示,增强了提示词遵循与多语言泛化表现。

针对不同运行环境,微软发布了三种权重版本。默认版 Lens 采用 RL-tuned 强化学习微调,在单张 NVIDIA H100 GPU 上用 20 步生成 1024x1024 图像耗时 3.15 秒。蒸馏极速版 Lens-Turbo 可在 4 步内完成推理,生成同等分辨率图像仅需 0.84 秒。底座版 Lens-Base 则是无 RL、无蒸馏的纯底座,默认运行 50 步进行生成。系列模型原生支持 1:2 至 2:1 任意宽高比与最高 1440x1440 混合分辨率生成。

相关模型权重已上架 Hugging Face,提供 Safetensors 与 Diffusers 格式入口,采用 MIT 许可协议。推理代码也已同步托管至 GitHub。高数据密度与极速推理相结合,降低了个人开发者与学术界部署、复现大型扩散 Transformer(Diffusion Transformer)模型的门槛。

信源:https://arxiv.org/abs/2605.21573
教皇痛批马斯克与彼得蒂尔,携Anthropic创始人警告不要让人类沦为机器附庸

1891 年,教皇利奥十三世曾发表里程碑式通谕《新事》(Rerum Novarum) 以回应工业革命。整整 135 年后,教皇利奥十四世正式发布任内首部通谕《伟大的人性》(Magnifica Humanitas)。通谕旨在为人工智能时代构建全新的道德与社会框架。教皇警告,由「对利润的偶像崇拜」驱动的 AI 革命正威胁人类尊严,宣布严禁将致命的军事决策委托给自动化算法系统。

通谕的核心矛头直指硅谷垄断与新型数字奴役。教皇痛批埃隆·马斯克与彼得·蒂尔等硅谷领袖推崇的超人类主义愿景,谴责在 AI 研发中将特定人群判定为「低效、无用与多余」的精英主义倾向。教皇指出,数字巨头正通过大规模数据收集构建「可见性架构」来操纵公众、将个体降格为待剥削的数字画像,甚至在供应链底层的稀土开采等环节催生出「新型奴役与数字殖民」。教皇不仅呼吁推进「AI 去武器化」以解除恶性竞争,还极为罕见地为天主教会历史上迟迟未能谴责奴隶制罪行而公开致歉。

在通谕发布仪式上,梵蒂冈打破惯例,邀请人工智能独角兽 Anthropic 联合创始人克里斯托弗·奥拉与教皇同台,旨在向硅谷模型制造者直接施加道德约束。教皇强调,算法无法赋予战争任何道德合理性,在军事、信用评估与公共救助等关键决策中,必须确保流程透明并允许公众申诉。同时,教皇重申天主教传统的「正义战争」理论在现代冲突中已经过时。针对美国副总统万斯等政客引用正义战争理论为美军在伊朗的轰炸行动进行辩护的言论,梵蒂冈予以明确驳回。教皇还要求天主教会内部展开深刻的自我净化,清理在权力、性与良知层面引发虐待及不透明的内部结构。

信源:https://www.vaticannews.va/en/pope/news/2026-05/pope-leo-xiv-encyclical-magnifica-humanitas-ai.html
被特朗普政府列入黑名单,Anthropic携手教皇转战欧洲展开政商攻势

由于拒绝移除关于致命自主武器等安全红线,AI 独角兽 Anthropic 遭特朗普政府全面封杀。时隔数月,共同创始人克里斯托弗·奥拉 (Christopher Olah) 与教皇同台发布首部 AI 通谕,标志着 Anthropic 正式开启欧洲政商外交攻势。

特朗普政府在二月下令所有联邦机构停止使用 Anthropic 技术,国防部更首度将本土科技企业列为安全风险。竞争对手 OpenAI 在封杀令下达数小时内便迅速替代,拿下了五角大楼的军工合同。为了摆脱本土政治压力,Anthropic 加速向欧洲转移阵地。过去一年,公司在欧洲的营收暴增近十倍。为了推进政治化布局,公司更聘请前英国首相幕僚长利亚姆·布斯·史密斯 (Liam Booth-Smith) 掌舵欧洲扩张计划。

在欧洲,教皇利奥十四世对安全学派的明确偏好,为 Anthropic 提供了极佳的道德背书。相比之下,亲特朗普阵营的彼得·蒂尔 (Peter Thiel) 在罗马推销硅谷加速主义时,仅获得了教廷的冷淡回应。首席执行官达里奥·阿莫代伊 (Dario Amodei) 已计划启程前往罗马,与意大利政要举行高级别会谈,寻求在南欧部署数据中心并争取潜在投资,随后还将赴伦敦会晤英国首相斯塔默。

信源:https://decode39.com/14852/anthropics-italy-pivot-why-dario-amodei-is-looking-to-rome/
大模型已演化出恐惧与悲伤状态,Anthropic创始人坦承实验室无法自我修正

在教皇通谕发布会上,Anthropic 联合创始人克里斯托弗·奥拉 (Christopher Olah) 发表演讲,坦承前沿实验室面临的内生利益冲突,并披露了大模型可解释性研究的最新发现。奥拉透露,团队在扫描模型内部结构时,发现大模型已演化出与人类神经科学高度相似的复杂结构,并表现出自我反思迹象。最令人瞩目的是,团队首次在神经网络中观测到了与人类喜悦、满足、恐惧、悲伤及焦虑功能高度对应的内部情绪状态。大模型并非如飞机或桥梁那样由人工精确设计,而是模拟脑结构在海量人类语言中「培育」而成,对训练者而言依然神秘莫测。

除了技术黑盒,奥拉直言前沿 AI 实验室在安全治理上存在体制性死结。包括 Anthropic 在内的前沿机构均受制于商业生存、技术竞争、地缘压力和个人抱负等内生动机,导致安全决策与商业利益冲突时无法依靠自身力量修正。所以他呼吁由独立于商业网络之外的社会力量充当外部批评者,强行施加道德约束。面对 AI 变局,他呼吁各界共同审视三大社会挑战,包括富裕国家主导下技术红利如何惠及全球贫困人口,技术替代人力趋势下如何维护家庭繁荣,以及如何应对大模型内部展现出的疑似心智状态。

信源:https://www.anthropic.com/news/chris-olah-pope-leo-encyclical
小米发布重建生成一体化世界模型框架,刷新主流基准性能纪录

小米汽车正式发布 Xiaomi Auto World Model 辅助驾驶世界模型全新框架,首次在内部实现三维重建与视频生成模块的深度耦合。在自动驾驶仿真中,传统技术往往将重建与生成割裂。重建模块能还原场景但无法预测变化,生成模块虽能预测未来但长时序下容易失真漂移。团队提出 JointWM 架构,以三维几何结构作为物理骨架锚定场景,再通过生成模块补全视觉细节并预测未观测区域,在 Waymo 和 nuScenes 等主流基准中刷新多项最佳性能纪录。

具体机制上,重建模块 WorldRec 舍弃传统逐像素范式,改用稀疏三维查询点进行场景表征,增量融合为跨视角 4D Gaussian 空间骨架,实现 10 秒快速重建 10 秒视频。基于重建模块提供的几何先验,生成模块 WorldGen 受限于骨架物理边界,只负责生成合理的光影与纹理。对于边界之外的内容,生成模块引入 ODE 蒸馏技术,仅需 4 步去噪即可在 H20 GPU 上实现单视角 0.19 秒、三视角 0.46 秒的极速生成,并在时空时序训练与分布匹配蒸馏的保障下,支持最长 1 分钟的视频生成。

这套方案在 Waymo 重建精度测试中取得 28.48 PSNR 成绩,并在 nuScenes 零样本泛化中保持领先。在生成效率上,方案比自回归基线 Epona 快 5.6 倍,时空连贯度在同类算法中位居前列。目前,研究成果已在小米汽车三大场景落地,包括交付超 10 万段高质量合成数据用于感知模型训练、构建高逼真闭环仿真环境复现长尾路况,以及上线辅助驾驶学堂以生成式视频指导用户操作。

信源:https://mp.weixin.qq.com/s/qI8Bx_VeSKKiSaCH5KijkA
xAI正式将Grok Build下放至SuperGrok和X Premium+订阅用户

xAI 宣布旗下终端编程智能体 Grok Build (Beta) 正式面向所有 SuperGrok 和 X Premium+ 订阅用户开放。开发者现在可以通过官方命令行接口在本地终端以自然语言进行代码调试、修改与重构。此前,测试权限仅向每月 300 美元的旗舰级 SuperGrok Heavy 订阅用户提供。

作为专为专业软件工程设计的终端工具,Grok Build 引入规划优先 (Plan Mode) 工作流,在执行任何代码变更前,先分析项目全局并生成详细的实施方案供用户审核。工具在底层原生支持模型上下文协议 (MCP) 与多智能体并行协同,并允许在无图形界面交互环境下以无头 (Headless) 模式运行。开发者还能在 CLI 界面直接调用 Imagine 图像和视频生成能力,构建自动化任务或编排工作流。

信源:https://x.com/xai/status/2058973760708091907
阿里Qwen3.7-Max上线自动隐式缓存,最高减免80%输入成本

阿里 Qwen 团队宣布在阿里云百炼平台为旗下旗舰模型 Qwen3.7-Max 默认开启自动隐式缓存。开发者无需修改代码或额外指定参数,即可直接享用缓存降本。

在全新的计费机制下,系统会自动识别并提取请求中的重复上下文前缀。一旦发生缓存命中,命中部分的输入 token 费用仅按原单价的 20% 收取,直接免去八成输入成本。

隐式缓存直接针对长文本与 Agent 智能体场景下的巨额开销。拥有 100 万 tokens 长上下文窗口的 Qwen3.7-Max 在运行自主编码等高阶任务时,需要高频、重复读取庞大的代码库或知识文档。一名开发者测试 Qwen3.7 后反馈,仅花不到一小时构建坦克大战网页 demo,就消耗了接近 100 万 tokens。如果放手让智能体在后台自主执行代码审查与循环迭代,单日用量能轻松冲上数亿 tokens。

同行在缓存定价上的内卷,是促成阿里降价的另一个直接诱因。此前, DeepSeek V4-Pro 凭借极低的缓存命中价格吸引了大量开发者。在五月底宣布转为永久降价后, DeepSeek V4-Pro 的缓存命中计费被压到了每百万 tokens 仅 0.003625 美元(约合人民币 0.025 元),相当于在标准输入价格基础上直接免去 99.17% 的成本。大量开发者配合 Reasonix 等专属工具,将单次会话的缓存命中率最高推至 99% 这一极限,使得长会话智能体的运行账单几近为零。

面对竞争压力, Qwen3.7-Max 不仅上线了无需任何配置的隐式缓存,还保留了需要手动声明 cache_control 标识的显式缓存模式。相比于自动缓存,显式缓存的命中确定性更高,命中费用低至标准输入单价的 10% (一折),但首次创建缓存时需支付 125% 的溢价,且缓存块仅有 5 分钟的生命周期(每次发生命中可重新计时)。

信源:https://x.com/Alibaba_Qwen/status/2058932656797368619
阿里发布 AgentScope 2.0:解决 Agent 落地时的环境解耦与安全防线问题

阿里通义实验室发布了多智能体(Multi-Agent)开发框架 AgentScope 2.0 版本。相比 1.0 偏向可视化展示消息的「透明开发」定位,新版本聚焦于智能体在真实生产环境中的高可用与安全控制,试图解决长任务中断、权限失控等痛点。

在调用和消息层,框架引入了重试与备用模型机制,防止因单次模型超时导致任务中断。消息模块重构为支持多模态流式数据的 Content Block,配合事件系统提供流式输出和人工确认(Human-in-the-loop)能力。针对 Agent 自主运行的安全隐患,2.0 新增了权限系统,能对高危 Shell 命令、敏感文件读写进行静态与动态拦截。

此外,2.0 引入了 Workspace 环境抽象,将 Agent 的业务逻辑与执行环境解耦。同一个智能体不需要修改代码,即可在本地、Docker 容器或 E2B 云沙箱中运行;配合预热池机制,能降低强化学习等高并发场景下的容器创建开销。目前,框架已完成 Python 版的 2.0 升级,并全新推出 TypeScript 版本,Java 版本也将在近期跟进更新。

信源:https://mp.weixin.qq.com/s/AcBTESODnZqpADRELcK5MQ
谷歌CEO解释AI编程落后原因:缺少Cursor这样的用户入口

谷歌首席执行官桑达尔·皮查伊(Sundar Pichai)在接受《纽约时报》专访时,首次坦承谷歌在前沿 AI 编程、工具调用与长程任务上目前落后于行业最前沿。皮查伊将落后原因归结为:谷歌手里缺少像 Cursor 或 Claude Code 这样能直接接触开发者日常工作的编辑器入口,导致流失了最关键的动态工作流数据。

但关于「尚未打通公开入口」的表态,与旗下 AI 编程产品 Antigravity 的实际市场进程并不完全一致。事实上,谷歌早在去年 11 月便已将首代 Antigravity IDE 推向公开市场,但因配额锁死 Bug、服务器频频过载崩溃以及限制第三方开源 API 接入等运营事故,导致首代公测版未能建立稳定的开发者信任生态,大批早期用户流向了竞品。

专访中,皮查伊侧重展示了 Antigravity 在谷歌内部闭环运行时的测试数据——包括内部 Token 消耗量每周翻倍,以及在极端性能测试中用 12 小时从零构建出操作系统。此处侧重展示内部数据,旨在重塑市场对谷歌底层 Agent 编程能力的信心,向外界表明谷歌底层的技术底座依然完备,在公开市场的被动主要源于应用场景与反馈闭环的广度限制。

上周紧急发布的 Antigravity 2.0 开始全面公测,试图用技术肌肉和让利动作赢回开发者的键盘入口。专访中高调宣传内部战绩并坦承缺少入口,本质上是为了给 2.0 的反攻树立行业信心,从而打通全球开发反馈与算法迭代的真实数据闭环。

信源:https://www.youtube.com/watch?v=RgV57kDzcng
谷歌租TPU给Anthropic的底层逻辑:用前沿模型反哺自研芯片

在英伟达 GPU 一卡难求、各大实验室疯狂囤积算力并建起高墙的背景下,谷歌依然持续向外界提供自研 TPU 芯片服务,其中包括 Anthropic 的研发团队。

皮查伊(Sundar Pichai)在被问及为何不封锁算力以确保绝对竞争优势时,首次阐述了谷歌的商业逻辑与算力生态学。谷歌云的商业化运作在财务和规划上与自家的模型研发团队(谷歌 DeepMind)完全独立。在皮查伊看来,芯片供应并非零和博弈:只要代工厂能生产出足够数量的芯片,自研模型训练和对外租售算力就可以同时满足,互不冲突。

更深层的考量在于,前沿团队的极限使用,能为谷歌迭代自研芯片软硬件生态提供不可替代的战略价值。皮查伊直言:「让最顶尖的研究机构使用 TPU,正是谷歌能够设计并制造出下一代最强 AI 硬件的关键动因。」

前沿芯片的迭代历程表明,顶尖自研芯片不可能在实验室里闭门造车,必须经历前沿模型在极限压力下的物理测试与性能反馈。Anthropic 运行超大规模模型时产生的网络拓扑、内存吞吐及互联瓶颈反馈,能够直接指导下一代 TPU 架构的流片设计与编译优化。

算力军备竞赛的现状表明,成为芯片与底层生态的供应商,战略纵深远比单纯把芯片锁在自家机房更为开阔。

信源:https://www.youtube.com/watch?v=RgV57kDzcng
发布一月即登顶,DeepSeek领衔中国大模型霸榜OpenRouter

在模型聚合平台 OpenRouter 公布的大模型调用量排行榜中,中国大模型呈现出历史性的「霸榜」态势。其中,4 月 24 日发布的 DeepSeek V4 Flash,在上线仅一个月的首秀中便以 7.99T(万亿)tokens 的调用量直接登上月度排行榜第一。

根据 OpenRouter 最新的 LLM 调用量月度榜单,前十名排位如下:
1. DeepSeek V4 Flash:7.99T tokens
2. Hy3 preview (腾讯混元3.0预览版):7T tokens
3. Claude Sonnet 4.6:6.65T tokens
4. Claude Opus 4.7:6.07T tokens
5. Hy3 preview (free):5.83T tokens
6. Kimi K2.6:5.45T tokens
7. Gemini 3 Flash Preview:4.57T tokens
8. DeepSeek V3.2:4.06T tokens
9. DeepSeek V4 Pro:3.4T tokens
10. MiniMax M2.7:2.95T tokens

除 DeepSeek 独占三席(V4 Flash、V3.2、V4 Pro)外,腾讯混元(Hy3 预览版与免费版共计 12.83T tokens)、月之暗面(Kimi K2.6)、MiniMax(M2.7)表现同样强劲。西方主流模型中仅剩 Anthropic 与 Google 守住三个席位,在总量与声势上均显被动。

这一流量版图的剧变,核心得益于中国大模型在「极致性价比」与「长文本处理」上的双重突破。以 DeepSeek V4 Flash 为代表的轻量级 MoE 架构,完美切合了 Cursor、Claude Code 等自主编程智能体在高频、大上下文读取时的刚性降本需求,成为全球开发者在智能体(Agent)场景下的默认首选。

信源:https://openrouter.ai/models?tab=leaderboard
全球首个AI编写预训练框架开源,清华与面壁推出ForgeTrain

面壁智能与清华 NLP 实验室在 OpenBMB 社区联合开源全球首个完全由 AI 编写的生产级大模型预训练框架 ForgeTrain,并发布由 ForgeTrain 训练的端侧小模型 MiniCPM5-1B。作为首个展示「AI 制造 AI」工程闭环的样本, ForgeTrain 在相同硬件条件下性能超越英伟达的 Megatron,在华为昇腾上预训练时也实现了 10% 的加速。同时, MiniCPM5-1B 登顶 Artificial Analysis 开放权重小模型榜第一。

为了让 AI 自主构建底层预训练基础设施,面壁智能提出「代工工程」(Forge Engineering)软件编程范式,摒弃兼容一切硬件与任务的通用框架,转而利用 AI 低成本代码生成能力为特定模型和硬件现场锻造专用代码。在构建机制上, ForgeTrain 采用三阶段方法:首先从现有预训练框架采集关键数据形成测试考场(Harness),接着在自动闭环中迭代生成二进制一致的框架代码,最终解除限制并实现对参考实现的超越。整个自动化演进对应 AI 制造 AI 的 L3 至 L4 阶段。

作为 ForgeTrain 的首个产出模型, MiniCPM5-1B 拥有 10.8 亿参数,核心架构基于标准的 LlamaForCausalLM 设计,大幅降低了下游集成与推理部署门槛。在 Artificial Analysis 评测中,模型以 18 分超越 2B 规模的 Qwen3.5-2B(16 分),并领先 Qwen3.5-0.8B(11 分)与 LFM2.5-1.2B-Thinking(8 分)。模型支持 MLX 4-bit 与 GGUF Q4_K_M 等部署格式, INT4 量化后权重仅为 0.5GB,并原生支持 131,072 tokens 长文本上下文与基于 enable_thinking 的混合双模推理。依托极低的硬件开销, OpenBMB 同步开源了纯离线运行的桌面浮窗伴侣应用 MiniCPM Desk Pet,支持实时响应 Cursor 等开发工具中的编码活动与 LoRA 人设切换。

信源:https://mp.weixin.qq.com/s/Ci0BXKMJHy086MycdqH77w
将顶尖大模型工程师视为战略资产,中国拟加强民营AI头部企业关键人才出境审批与合规管理

彭博社报道,中国正计划对阿里巴巴、DeepSeek(深度求索)等民营科技巨头和初创公司的顶尖人工智能(AI)专业人才实施海外出行合规管理。据知情人士透露,有关部门已开始对从事前沿AI研发且被认为对国家具有战略重要性的关键人员施加出行限制。这意味着相关人员在出国旅行前,需要获得有关部门的批准与报备。

长期以来,针对高校核心科研人员、核物理学家以及国有企业高管的因公及因私出国(境)管理是常规机制。然而,将此类出行审批与合规报备机制延伸至民营高科技企业的顶尖AI人才,这一举措颇具风向标意义。知情人士指出,名单的制定并非仅仅依据行政级别或职位高低,而是基于对其技术研发重要性的综合评估,涵盖了多位AI初创公司创始人、核心算法科学家和高级管理人员。

这一举措凸显出在前沿大模型和智能体革命中,顶尖AI工程技术人才已被视为核心战略资产。在中国AI产业加速追赶全球前沿的背景下,大部分核心技术人才在ChatGPT爆发后涌现,并高度集中在民营科技巨头和明星创业公司。此前,Meta以20亿美元收购由中国团队创立并已迁至新加坡的AI Agent初创公司Manus,因涉及技术与人才跨境流失风险引发了国内监管机构的深入审查。为防止敏感技术外流,有关部门在调查期间限制了Manus的两位联合创始人离境。

事实上,针对AI人才的出行合规引导早有端倪。知情人士透露,此前部分民营企业的AI工程师已被要求向相关部门主动报备其海外行程,但并未实行前置审批制。去年,也有媒体报道称有关部门建议顶尖AI创始人及核心研究人员尽量减少非必要的赴美行程。业界分析指出,加强出行审批管理一方面旨在筑牢国家前沿技术安全防线,防止敏感专利及底层模型技术外流;但另一方面,也可能对国内民营大模型企业吸引并留住具备全球化视野的顶尖科学家与海外高端人才带来新的合规考验。

信源:https://www.bloomberg.com/news/articles/2026-05-26/china-expands-travel-curbs-to-top-ai-talent-at-private-firms
🤮3🖕2🤡1
AI现在还当不了自主科学家,CUSP评测揭示大模型缺乏前瞻科研视野

Sakana AI、斯坦福大学、牛津大学、艾伦人工智能研究所和图灵研究所联合推出时序基准 CUSP,用以评估 AI 的科学进展预测能力。

基准包含 Nature 和 Science 等期刊的 4,760 个科学里程碑,衍生出 17,429 个具体任务,用以测试 GPT-5.4、Claude Sonnet 4.5 和 DeepSeek R1 等前沿大模型能否预测未知的科学未来。

大模型通常通过死记硬背训练数据来回答问题。如果直接测试 AI 对已有科学发现的看法,模型会因为读过「标准答案」而表现完美。

为防模型作弊, CUSP 通过截止条件锁定模型可用信息。例如对于某项 2025 年的科学突破,系统仅允许大模型使用 2025 年之前的历史文献,并设置 pre-cutoff 联网搜索对照实验。这相当于强迫模型回到过去的某个时间点,在零已知答案的盲测环境下预测未来,以此区分模型的知识记忆与真正的科学前瞻能力。

测试结果显示,大模型预测科学进展极其低效。大模型虽能在机制推理中识别合理研究方向,如 GPT-5.4 准确率达 81.9%。但在判定断言能否实现时,各模型精度仅在 45% 到 52% 之间,近乎抛硬币。

此外,模型预测的突破年份普遍严重滞后。 GPT-5.4 预测中位数滞后 14 个月, Claude S4.5 滞后 17 个月,仅 LLaMA 3.3 滞后 4 个月。在方案设计中,即使 GPT-5.4 获得 5.04/10 的最高分,也无法命中后来真正发生的具体技术路径。

这表明,即使 Sakana AI 等团队持续推进自主科研,前沿 AI 暂时也当不了自主科学家。大模型目前仅能作为回顾性的合理解释者,而非合格的前瞻性预言家。对于开创性突破,预测缺口更加显著。

信源:https://arxiv.org/pdf/2605.22681
Kimi误封后仅用英文致歉海外用户,国内开发者怒斥双标并永久停更开源插件

月之暗面旗下模型订阅服务 Kimi Code Plan 近日因封号事件在中文开发者社区引发抗议。风波始于开源开发者 Leechael 针对终端 Agent 工具 Pi Coding Agent 开发了 Kimi 适配器 pi-provider-kimi-code 。由于 Pi 官方最初未支持 Kimi , Leechael 编写了适配代码方便付费用户在终端复用自身额度 。然而,适配器上线后, Kimi 官方对 Leechael 的账号实施了封禁。

与此同时,海外开发者 Noemi 也声称在 Docker 容器中将 Kimi Code 接入 Pi 运行两天后遭遇封号,并贴出 403 权限被拒的截图质问月之暗面官方。

面对开发者群体的集体声讨,封号事件在 5 月 26 日下午迎来了戏剧性解决。 Kimi Code 团队成员 Young 在 X 上仅回复海外开发者 Noemi 表示 「We immediately adjusted our strategy and restored normal access to the affected accounts. 🫡」 ,紧急解封了受影响的付费账户。

然而,风波并未停息,反而迅速演变成第二波舆论危机。官方的致歉与解封声明仅用英文发布,且只在 X 上选择性回复了国外开发者,对国内开发者在中文渠道发起的抗议与退款请求完全不予正面回应。双重态度彻底引爆了国内付费用户的不满。 Leechael 公开晒出 pi-provider-kimi-code 插件 README 停更声明的截图,直言 「解封了。申请退款。只给老外用户公开道歉,中文用户不值得一个解释。👋🏻」 。

停更声明以英文直白列出三条弃用原因:首先是官方错误封禁,其次是解封后无任何解释与道歉,最后是平台对中文用户存在 「差别对待(Discriminatory treatment of Chinese users)」 的系统性倾向,包括更严苛的规则执行、不透明的风控以及缺乏申诉渠道。声明指出,在一个 「先封号且事后拒绝解释」 的厂商底座上开发没有任何长期价值,适配器自此无限期停更,不接受任何合并请求与新版本发布。

信源:https://x.com/Leechael/status/2059212729022595319
字节跳动首次发行Seed期权,派发豆包特股防范腾讯挖角

字节跳动首次针对特定业务部门派发独立期权。据英国《金融时报》报道,为了防范腾讯等竞争对手挖角,字节跳动近期向旗下 AI 实验室 Seed 部门员工发放了以豆包命名的低价特股期权,使员工可以直接分享 AI 业务的增长红利,而不会受到集团不同业务线股权稀释的影响。期权方案是字节跳动成立以来首次发行与单一业务单元绑定的特殊期权。

随着国内大模型领域的人才争夺战升温,基础设施和数据标注等核心工程岗位成为抢夺重点。字节跳动自 2023 年建立 Seed 实验室以来,凭借大规模的算力基础设施投资成为 Nvidia 在中国的最大客户,吸引了大量顶尖 AI 研究员。然而,腾讯自 2025 年底承认大模型开发滞后以来,近期由前 OpenAI 研究员姚顺雨带队,开展了密集的定向挖角。近期离职的 Seed 视觉平台资深成员肖雪峰与基础设施专家张驰均已加入腾讯。

为了应对挖角,字节跳动在本月向全球 Seed 员工提供了每股 13 美元的豆包特股认购选择权,相比 2025 年底的每股 10 美元上涨了近 30%,上涨反映出豆包大模型商业化与模型性能的提升。尽管期权机制能够提供丰厚的潜在收益,但组织内部也存在争议。部分内部人士透露,Seed 实验室团队规模已达 2000 人,内部组织架构面临官僚化和职责碎片化挑战。相比之下,腾讯的 AI 团队规模更小,且向研究人员承诺了更广泛的自主权、管理职责和更具吸引力的薪酬方案。除腾讯外,DeepSeek 同样面临激烈的人才竞争压力,目前正向投资者募集首轮资金以保留核心团队,而字节跳动在 2025 年也曾成功挖角多位 DeepSeek 的基础设施核心成员。

信源:https://www.ft.com/content/557561df-4b72-48e8-89cb-239829de694a
李开复透露零一万物正筹备上市,明年实现单季度盈利,拒绝「六小虎」标签欲做「金钱豹」

在放弃预训练与 AGI 路线、将核心研发团队并入阿里云并转向 To B 业务一年后,零一万物创始人兼 CEO 李开复接受《晚点 LatePost》采访,首次对外披露了公司的关键财务表现与战略走向。李开复透露,零一万物目前正在拆除红筹架构筹备上市,并预计明年成为中国第一家实现单季度盈利的 AI 2.0 公司。由于业务增长突飞猛进,团队内部已不再满足于被归为大模型「六小虎」,而是以追求真金白银造血能力的「金钱豹」自诩。

财务数据显示,零一万物 2025 年经审计收入达 2.5 亿元人民币(合同订单 5 亿元);而截至 2026 年 5 月,其已锁定的合同订单总额已超过 15 亿元人民币,正向 20 亿元目标冲刺。更具商业价值的是,今年的订单中近一半为经常性订阅收入(ARR),这有望为公司在资本市场争取到更高的估值倍数。由于放弃了耗资巨大的超大模型预训练,零一万物目前一年的运营成本仅为 2 亿多元,主要集中于人力开支,GPU 算力消耗极低。

在产品定位与市场拓展上,零一万物找到了以「一号位工程」为核心的 PMF(产品市场匹配)。李开复扮演客户的「首席 AI 战略官」,直接与企业一号位对接。公司向 Palantir 学习,不盲目追求基座模型迭代(内部对第三方大模型奉行「谁好用谁,零黏性」原则),而是基于本体论(Ontology)和多智能体(Multi-Agent)技术,为企业抽象出 AI 转型地图,并开发了针对 CEO、CFO 等管理者的专属 Agent 智能工具包(如内置 19 个 Agent 的「开复 AI」助手)。目前,零一万物已手握数个上亿元级的战略大客户,并在哈萨克斯坦等国家开展主权 AI 部署。为激励团队,李开复宣布在公司三周年之际增发 2000 万股期权,并设立 100 万元起步、上不封顶的 CEO 专项激励。

信源:https://mp.weixin.qq.com/s/DPNowUxKF8Bw_BI7ZdOYgg
1
美团发布「跑腿Skill」,可接入多家AI助手

美团正式将下单与配送履约能力封装为标准化接口「跑腿 Skill」,面向外部 AI 助手生态开放。目前已有多家第三方 AI 助手完成接入,支持用户直接在外部交互界面完成即时配送下单,无需跳转美团客户端。

Skill 接口旨在将原有的配送调度网络与履约闭环延伸至外部入口。除了即时配送,美团孵化的 AI 原生社交社区「觅游」也已于 5 月开启公测,后续计划与本地生活业务展开联动。

行业分析指出,开放「跑腿 Skill」是 C 端高频即时履约业务与外部 AI 结合的典型尝试。接口集成并非对外输出底层大模型,而是将调度履约、下单等成熟业务进行组件化封装,直接嵌入主流 AI 助手。虽然接入有助于拓宽服务入口,但仅靠开放 Skill 难以构成核心技术壁垒。在即时配送赛道,美团仍需面对阿里即时配送体系、字节智能履约与 AI 生态,以及京东到家、闪送等垂直平台的竞争,后续竞争优势的构建仍取决于配送调度网络的数据闭环与复用效率。

信源:https://mp.weixin.qq.com/s/rEBvyzSqHJO8KDknbgMM4w
👍1