腾讯ima copilot全面开放,支持知识号发布自定义Skill
腾讯正式结束为期一个月的灰度测试,向全体用户开放个人知识库智能体 ima copilot。
ima copilot 记忆系统可持续积累用户的个人背景、偏好与项目进度,实现个性化服务。在处理复杂任务时,系统可直接读取用户在 ima 中存储的文件、笔记与参考资料,进行跨文档的关联汇总和内容生成。
在模型接入方面,ima copilot 除内置官方模型外,支持用户自行接入第三方大模型 API Key。ima 知识号也同步开通了 Skill 发布功能,促使知识广场从内容平台向能力平台演进。
用户可在 PC 或移动客户端的发现页面进入 Skill 广场,根据使用场景搜索并一键安装官方或第三方 Skill,首批上线的官方功能包括微信读书助手、腾讯招聘助手等。创作者也可在我的知识号后台封装并发布个人专属的 Skill,将特定领域的知识沉淀与工作流方法论进行工具化流通。
信源:https://mp.weixin.qq.com/s/O4Q6rgH_nPf_wsLqqOInxw
腾讯正式结束为期一个月的灰度测试,向全体用户开放个人知识库智能体 ima copilot。
ima copilot 记忆系统可持续积累用户的个人背景、偏好与项目进度,实现个性化服务。在处理复杂任务时,系统可直接读取用户在 ima 中存储的文件、笔记与参考资料,进行跨文档的关联汇总和内容生成。
在模型接入方面,ima copilot 除内置官方模型外,支持用户自行接入第三方大模型 API Key。ima 知识号也同步开通了 Skill 发布功能,促使知识广场从内容平台向能力平台演进。
用户可在 PC 或移动客户端的发现页面进入 Skill 广场,根据使用场景搜索并一键安装官方或第三方 Skill,首批上线的官方功能包括微信读书助手、腾讯招聘助手等。创作者也可在我的知识号后台封装并发布个人专属的 Skill,将特定领域的知识沉淀与工作流方法论进行工具化流通。
信源:https://mp.weixin.qq.com/s/O4Q6rgH_nPf_wsLqqOInxw
Meta CTO强推键盘监控并强硬拒绝退出,引爆内部传单战与千人抗议
作为马克·扎克伯格的「挡箭牌」,Meta 首席技术官 Andrew Bosworth 正在强推引发内部剧烈震荡的 AI 转型。在 Meta 单日闪击裁员 8000 人、凌晨 4 点用邮件清洗骨干工程师的同时,模型能力计划(Model Capability Initiative)监控工具被强制安装在留任员工电脑上,记录键盘输入、鼠标点击和屏幕截图。愤怒的员工在办公区散发「员工数据榨取工厂」传单,并联合发起超 1500 人的抗议请愿。
留任员工抗议的核心,是公司正在强迫他们用自己的日常操作去训练最终将取代自己岗位的 AI 系统。在内部论坛中,员工质问如何关闭监控。Bosworth 冷酷回应,称在公司电脑上没有任何人有退出数据收集的选项。他的表态在内部聊天中引来员工用哭泣、震惊与愤怒的表情符号疯狂刷屏。
与扎克伯格宣称「只用于训练而非绩效」的安抚口径不同,Bosworth 在《智能体转型加速器》(Agent Transformation Accelerator)内部备忘录中,直接揭示了 Meta 的未来图景。他明确指出,Meta 的愿景是未来工作将主要由 AI 代理完成,而人类的角色则是指导、审查并协助改进。
在 4 月底的全员大会上,扎克伯格曾极力为模型能力计划辩护,称 Meta 员工的平均智力远超普通外包人员,精英工程师的日常操作轨迹是极为稀缺的训练素材。然而,在 5 月 20 日单日大裁员后,面临末位淘汰(Stack Ranking)高压以及房贷、H1B 签证压力的骨干工程师们惊觉,高绩效无法换来安全感,自己不仅沦为推高股价的牺牲品,还要在离职前被榨干最后一滴数据价值。
信源:https://www.wsj.com/tech/ai/meta-andrew-bosworth-ai-3df12d4f
作为马克·扎克伯格的「挡箭牌」,Meta 首席技术官 Andrew Bosworth 正在强推引发内部剧烈震荡的 AI 转型。在 Meta 单日闪击裁员 8000 人、凌晨 4 点用邮件清洗骨干工程师的同时,模型能力计划(Model Capability Initiative)监控工具被强制安装在留任员工电脑上,记录键盘输入、鼠标点击和屏幕截图。愤怒的员工在办公区散发「员工数据榨取工厂」传单,并联合发起超 1500 人的抗议请愿。
留任员工抗议的核心,是公司正在强迫他们用自己的日常操作去训练最终将取代自己岗位的 AI 系统。在内部论坛中,员工质问如何关闭监控。Bosworth 冷酷回应,称在公司电脑上没有任何人有退出数据收集的选项。他的表态在内部聊天中引来员工用哭泣、震惊与愤怒的表情符号疯狂刷屏。
与扎克伯格宣称「只用于训练而非绩效」的安抚口径不同,Bosworth 在《智能体转型加速器》(Agent Transformation Accelerator)内部备忘录中,直接揭示了 Meta 的未来图景。他明确指出,Meta 的愿景是未来工作将主要由 AI 代理完成,而人类的角色则是指导、审查并协助改进。
在 4 月底的全员大会上,扎克伯格曾极力为模型能力计划辩护,称 Meta 员工的平均智力远超普通外包人员,精英工程师的日常操作轨迹是极为稀缺的训练素材。然而,在 5 月 20 日单日大裁员后,面临末位淘汰(Stack Ranking)高压以及房贷、H1B 签证压力的骨干工程师们惊觉,高绩效无法换来安全感,自己不仅沦为推高股价的牺牲品,还要在离职前被榨干最后一滴数据价值。
信源:https://www.wsj.com/tech/ai/meta-andrew-bosworth-ai-3df12d4f
The Wall Street Journal
Meet Mark Zuckerberg’s Right-Hand Man Who’s Unleashing AI at Meta
Andrew Bosworth, Meta’s outspoken chief technology officer, has a new mission: transforming the company’s workforce using AI.
❤1
vLLM封禁「简历贴金」虚假PR贡献者,拟引入企校邮箱验证严防AI灌水
开源大模型推理引擎 vLLM 官方在 X 上发布公告,宣布封禁一名恶意提交虚假 Pull Request(PR)以为简历「贴金」的贡献者。该事件曝光了当前开源社区中盛行的「简历驱动型开发」(Resume-Driven Development)灰色产业链。
事件起因于社区举报的一项编号为 #42143 的 PR,该 PR 声称修复了投机采样模型 Eagle3 在 NVIDIA Checkpoint 下读取 norm_before_fc 配置的一个「漏洞」。尽管该 PR 逻辑严密、附带了详尽的测试计划与性能报告,并通过了持续集成(CI)测试被成功合并,但社区随后审查发现,该漏洞在实际代码库中根本不存在,该贡献者涉嫌「制造不存在的问题并予以解决」。流出的聊天截图显示,该 PR 实际上是某付费「面试辅导」机构的实战培训项目成果,学员在导师的指导下,通过向知名开源项目提交无实际意义或伪造的 PR 来包装简历,从而谋求大厂的入职机会。目前,涉事贡献者已被 vLLM 社区永久封禁。
为应对「AI 灌水」(AI Slop)和虚假贡献的冲击,同时保障真实用户的合法权益,vLLM 宣布正在探索新的贡献审查流程。对于未获得维护者及时关注的重要 PR,贡献者可以通过可验证的企事业单位或高校的官方邮箱发送邮件至 pr-review-request@vllm.ai,详细说明其生产或科研用例、遇到的实际问题以及该 PR 的解决思路。官方希望通过这一「强实名/强关联」的邮箱审核机制,将资源优先倾斜给解决真实生产痛点的高质量贡献。
信源:https://x.com/vllm_project/status/2058358072020779391
开源大模型推理引擎 vLLM 官方在 X 上发布公告,宣布封禁一名恶意提交虚假 Pull Request(PR)以为简历「贴金」的贡献者。该事件曝光了当前开源社区中盛行的「简历驱动型开发」(Resume-Driven Development)灰色产业链。
事件起因于社区举报的一项编号为 #42143 的 PR,该 PR 声称修复了投机采样模型 Eagle3 在 NVIDIA Checkpoint 下读取 norm_before_fc 配置的一个「漏洞」。尽管该 PR 逻辑严密、附带了详尽的测试计划与性能报告,并通过了持续集成(CI)测试被成功合并,但社区随后审查发现,该漏洞在实际代码库中根本不存在,该贡献者涉嫌「制造不存在的问题并予以解决」。流出的聊天截图显示,该 PR 实际上是某付费「面试辅导」机构的实战培训项目成果,学员在导师的指导下,通过向知名开源项目提交无实际意义或伪造的 PR 来包装简历,从而谋求大厂的入职机会。目前,涉事贡献者已被 vLLM 社区永久封禁。
为应对「AI 灌水」(AI Slop)和虚假贡献的冲击,同时保障真实用户的合法权益,vLLM 宣布正在探索新的贡献审查流程。对于未获得维护者及时关注的重要 PR,贡献者可以通过可验证的企事业单位或高校的官方邮箱发送邮件至 pr-review-request@vllm.ai,详细说明其生产或科研用例、遇到的实际问题以及该 PR 的解决思路。官方希望通过这一「强实名/强关联」的邮箱审核机制,将资源优先倾斜给解决真实生产痛点的高质量贡献。
信源:https://x.com/vllm_project/status/2058358072020779391
马斯克Grok V9-Medium完成补充训练,引入Cursor数据主打高难编程场景
马斯克宣布 xAI 旗下 1.5T 参数的 Grok V9-Medium 基础模型已完成训练,预计在 2 至 3 周内面向公众发布。目前模型已进入监督微调阶段,并将在几天内开启强化学习训练。研发团队在补充训练中吸纳了大量 Cursor 的代码数据,并且后续还将继续灌入更多样本。
相较于目前支撑 Grok 全部生产流量的 v8-small 模型,拥有 1.5T 参数的 Grok V9-Medium 将在处理复杂编程任务时实现大幅升级。先前马斯克曾公开承认,仅有 0.5T 参数的 v8-small (即外测版本 Grok 4.2 )在训练数据质量、全面性以及比例上存在严重缺陷。完成训练的 Grok V9-Medium 不仅在参数规模上扩充至前代的三倍,还专门针对 Blackwell 架构 GPU 进行了针对性优化。
信源:https://x.com/elonmusk/status/2058787384364265734
马斯克宣布 xAI 旗下 1.5T 参数的 Grok V9-Medium 基础模型已完成训练,预计在 2 至 3 周内面向公众发布。目前模型已进入监督微调阶段,并将在几天内开启强化学习训练。研发团队在补充训练中吸纳了大量 Cursor 的代码数据,并且后续还将继续灌入更多样本。
相较于目前支撑 Grok 全部生产流量的 v8-small 模型,拥有 1.5T 参数的 Grok V9-Medium 将在处理复杂编程任务时实现大幅升级。先前马斯克曾公开承认,仅有 0.5T 参数的 v8-small (即外测版本 Grok 4.2 )在训练数据质量、全面性以及比例上存在严重缺陷。完成训练的 Grok V9-Medium 不仅在参数规模上扩充至前代的三倍,还专门针对 Blackwell 架构 GPU 进行了针对性优化。
信源:https://x.com/elonmusk/status/2058787384364265734
【独家】时隔五年,招聘线索拼出完整版图:字节跳动正悄然重启手机研发
在关停坚果手机业务五年后,字节跳动正通过一种全新的形态,重新切入智能手机底层研发。
这一推论源自对字节跳动官方招聘系统全量岗位的拉网式数据梳理。比对数百个底层职位的具体职责后,事实非常明确:字节并非仅停留在开发轻量化的端侧 AI 应用,而是正在搭建一整套手机级软硬件底座;上层重构 Agent 交互与 Android/RTOS 系统,下层切入结构堆叠、基带、通信入网,并已深入到对齐代工厂产线的 NPI(新产品导入)试产阶段。
在硬件研发与量产端,字节的阵列排布直奔硬件供应链深水区。身处供应链腹地的深圳研发节点正密集释放整机工艺、PCB 高速互连、测试工艺与硬件基带岗位,全盘对接代工产线。其中,结构工程师职位要求涵盖新机堆叠、中框、电池盖与转轴设计,并将「折叠屏」、「LIPO 封装」、「IP68/IP69K」等旗舰机硬件研发经验列为加分项;整机工艺职位则要求掌握 DFM/DFA/DFS 分析、NPI 试产导入、AOI 检测、点胶及点焊工艺。此类岗位画像与普通的互联网软件开发完全脱钩,呈现出鲜明的整机硬件大厂色彩。
在系统底座端,驻扎北京的 Android 系统专家将统筹从立项、系统方案、集成开发到量产交付的全流程,职责覆盖 ODM/OEM 对接、Android Framework、HAL、Vendor 接口适配及高通平台调优,甚至需要把控工厂刷机、老化与产线测试。同时,移动 OS 团队正全面招募 SoC 芯片适配、BSP、RTOS 内核、WiFi 驱动、图形引擎、系统功耗与 DFX 专家,几乎将一部智能手机的底层系统骨架拆开,全盘重构。
最直接的突破口,发生在原本被外界视为纯软件项目的「豆包手机助手」团队。豆包手机助手团队的研发重心正向硬件底层全面压进,岗位覆盖触控驱动、NFC、系统热管理、外设 BSP、音频系统及传感器融合。更核心的信号是,团队招募的 Telephony RIL Modem 产品架构师职位,要求具备高通或联发科(MTK)蜂窝网络交付经验,熟悉 Telephony 系统、RIL 驱动、场测、CTA 认证及射频天线开发节奏。这表明字节的研发边界已跨越纯应用层,切入手机最核心的通信基带与无线射频领域。
在上层交互侧,AI 正在重塑人机交互界面。移动 OS 部门的 Agent 软件架构师将负责设计多 Agent 协同交互框架,以统一的标准协议接入内外部智能体,实现低延迟、多模态的动态决策;豆包手机助手的感知与记忆算法岗位,则专注于用户长期记忆、多模态感知与主动服务机制。这印证了更深层的战略野心:字节并不满足于将豆包作为一款预装 App 送进终端,而是试图将豆包重塑为整个硬件系统的首要入口。
字节选择涉足重资产的手机系统与整机研发,源于端侧 AI 的生态痛点。豆包手机助手在 nubia M153 等工程机上的测试,虽验证了 Agent 跨应用(App)调用的可行性,但很快触及了行业生态红线——由于缺乏系统底座支撑,当遭遇微信、淘宝或金融类 App 的防指纹与风控策略拦截时,Agent 自动化操作链条瞬间崩断。这一现实表明,没有自主的系统级权限、默认入口与底层硬件接口,再强大的大模型,在终端也只能以「沙盒寄生」的状态存在,随时面临生态切断的风险。
从2021年暂停手机研发至今,字节跳动时隔五年重回这一深水区,展现出在 AI 时代誓要夺回「终端主权」的强硬姿态。这也是为什么不仅是字节,近期 OpenAI 也被供应链消息指向正联手联发科、高通与立讯精密研发 AI 手机。
在大模型行业,下一代战场已越过云端算力与算法的单一比拼,开始向物理终端延伸。谁能掌控用户手里的第一块屏、第一套操作系统与第一层入口,谁才能拥有下一代 AI 服务的绝对话语权。在这个牌桌上,没有自己的硬入口,就只能永远跪着讨饭吃。
在关停坚果手机业务五年后,字节跳动正通过一种全新的形态,重新切入智能手机底层研发。
这一推论源自对字节跳动官方招聘系统全量岗位的拉网式数据梳理。比对数百个底层职位的具体职责后,事实非常明确:字节并非仅停留在开发轻量化的端侧 AI 应用,而是正在搭建一整套手机级软硬件底座;上层重构 Agent 交互与 Android/RTOS 系统,下层切入结构堆叠、基带、通信入网,并已深入到对齐代工厂产线的 NPI(新产品导入)试产阶段。
在硬件研发与量产端,字节的阵列排布直奔硬件供应链深水区。身处供应链腹地的深圳研发节点正密集释放整机工艺、PCB 高速互连、测试工艺与硬件基带岗位,全盘对接代工产线。其中,结构工程师职位要求涵盖新机堆叠、中框、电池盖与转轴设计,并将「折叠屏」、「LIPO 封装」、「IP68/IP69K」等旗舰机硬件研发经验列为加分项;整机工艺职位则要求掌握 DFM/DFA/DFS 分析、NPI 试产导入、AOI 检测、点胶及点焊工艺。此类岗位画像与普通的互联网软件开发完全脱钩,呈现出鲜明的整机硬件大厂色彩。
在系统底座端,驻扎北京的 Android 系统专家将统筹从立项、系统方案、集成开发到量产交付的全流程,职责覆盖 ODM/OEM 对接、Android Framework、HAL、Vendor 接口适配及高通平台调优,甚至需要把控工厂刷机、老化与产线测试。同时,移动 OS 团队正全面招募 SoC 芯片适配、BSP、RTOS 内核、WiFi 驱动、图形引擎、系统功耗与 DFX 专家,几乎将一部智能手机的底层系统骨架拆开,全盘重构。
最直接的突破口,发生在原本被外界视为纯软件项目的「豆包手机助手」团队。豆包手机助手团队的研发重心正向硬件底层全面压进,岗位覆盖触控驱动、NFC、系统热管理、外设 BSP、音频系统及传感器融合。更核心的信号是,团队招募的 Telephony RIL Modem 产品架构师职位,要求具备高通或联发科(MTK)蜂窝网络交付经验,熟悉 Telephony 系统、RIL 驱动、场测、CTA 认证及射频天线开发节奏。这表明字节的研发边界已跨越纯应用层,切入手机最核心的通信基带与无线射频领域。
在上层交互侧,AI 正在重塑人机交互界面。移动 OS 部门的 Agent 软件架构师将负责设计多 Agent 协同交互框架,以统一的标准协议接入内外部智能体,实现低延迟、多模态的动态决策;豆包手机助手的感知与记忆算法岗位,则专注于用户长期记忆、多模态感知与主动服务机制。这印证了更深层的战略野心:字节并不满足于将豆包作为一款预装 App 送进终端,而是试图将豆包重塑为整个硬件系统的首要入口。
字节选择涉足重资产的手机系统与整机研发,源于端侧 AI 的生态痛点。豆包手机助手在 nubia M153 等工程机上的测试,虽验证了 Agent 跨应用(App)调用的可行性,但很快触及了行业生态红线——由于缺乏系统底座支撑,当遭遇微信、淘宝或金融类 App 的防指纹与风控策略拦截时,Agent 自动化操作链条瞬间崩断。这一现实表明,没有自主的系统级权限、默认入口与底层硬件接口,再强大的大模型,在终端也只能以「沙盒寄生」的状态存在,随时面临生态切断的风险。
从2021年暂停手机研发至今,字节跳动时隔五年重回这一深水区,展现出在 AI 时代誓要夺回「终端主权」的强硬姿态。这也是为什么不仅是字节,近期 OpenAI 也被供应链消息指向正联手联发科、高通与立讯精密研发 AI 手机。
在大模型行业,下一代战场已越过云端算力与算法的单一比拼,开始向物理终端延伸。谁能掌控用户手里的第一块屏、第一套操作系统与第一层入口,谁才能拥有下一代 AI 服务的绝对话语权。在这个牌桌上,没有自己的硬入口,就只能永远跪着讨饭吃。
❤3👍1
马斯克敲定年底开源Grok 4.2
马斯克在 X 上宣布,xAI 计划于 2026 年年底前开源现役的 Grok 4.2 基座模型(拥有 0.5T 参数)。虽然模型参数规模较小,但马斯克强调开源版本对开发者社区依然极具实用价值。
先前马斯克曾公开承认,因为在训练数据质量、全面性以及配方比例上存在缺陷,运行 Grok 4.2 的底层模型难以应付高难度的编程挑战。不过,对于常规自然语言处理以及基础推理任务,拥有 5000 亿参数的基座模型依然具备很强的性能优势。
开源大模型是 xAI 的策略之一。在 2024 年 3 月,xAI 曾开源拥有 3140 亿参数的 Grok-1 模型,当时为最大规模的开源模型。
信源:https://x.com/elonmusk/status/2058796067592736866
马斯克在 X 上宣布,xAI 计划于 2026 年年底前开源现役的 Grok 4.2 基座模型(拥有 0.5T 参数)。虽然模型参数规模较小,但马斯克强调开源版本对开发者社区依然极具实用价值。
先前马斯克曾公开承认,因为在训练数据质量、全面性以及配方比例上存在缺陷,运行 Grok 4.2 的底层模型难以应付高难度的编程挑战。不过,对于常规自然语言处理以及基础推理任务,拥有 5000 亿参数的基座模型依然具备很强的性能优势。
开源大模型是 xAI 的策略之一。在 2024 年 3 月,xAI 曾开源拥有 3140 亿参数的 Grok-1 模型,当时为最大规模的开源模型。
信源:https://x.com/elonmusk/status/2058796067592736866
😍2🤡1
月之暗面重写终端智能体并更名kimi-code,全面看齐Claude Code架构
月之暗面旗下的开源终端 AI 编码智能体 kimi-cli 正在悄然进行仓库迁移与架构重写,并已正式更名为 kimi-code。为了解决原 Python 版本在交互响应与执行效率上的瓶颈,研发团队全面倒向了 Anthropic 旗下终端工具 Claude Code 的技术路线,完成了一次基于 TypeScript 和 Bun 运行时的完整架构重构,实现了毫秒级冷启动与流畅的终端用户界面(TUI)。
本次架构调整意味着 Kimi 彻底抛弃了原有的 Python 终端技术栈,全面对标并引入了 Claude Code 的成熟方案。工具使用 Commander.js 规范命令解析,并基于 React Ink 替代 Rich 与 prompt-toolkit 实现全新的响应式 TUI 界面。重构共涉及 166 个 TypeScript 源码文件,代码增量超 3.8 万行。在 SWE-bench Verified 基准测试中,基于 kimi-k2.5 模型的 TypeScript 重构版本在 500 个开发任务中成功解决 317 个(解决率 63.4%),性能在维持 Python 原版水平的同时,运行稳定性与网络层抗干扰能力显著提升。
除底座架构对标外,kimi-code 重点打磨了人机协同体验。新版本不仅支持在终端中拖入屏幕录像等视频资产进行多模态分析,还深度还原了 Claude Code 的多项标杆设计,包括支持光标交互编辑的「计划模式」、Emacs 常用快捷键、双击 Ctrl + C 快速退出的安全设计,以及支持通过自定义生命周期钩子(Hooks)对接自动化工作流。在多模型生态兼容上,kimi-code 开放了第三方大模型 API 的自定义接入,使工具不仅局限于 Kimi 家族,更可作为跨模型的统一终端编程网关使用。
信源:https://github.com/MoonshotAI/kimi-code
月之暗面旗下的开源终端 AI 编码智能体 kimi-cli 正在悄然进行仓库迁移与架构重写,并已正式更名为 kimi-code。为了解决原 Python 版本在交互响应与执行效率上的瓶颈,研发团队全面倒向了 Anthropic 旗下终端工具 Claude Code 的技术路线,完成了一次基于 TypeScript 和 Bun 运行时的完整架构重构,实现了毫秒级冷启动与流畅的终端用户界面(TUI)。
本次架构调整意味着 Kimi 彻底抛弃了原有的 Python 终端技术栈,全面对标并引入了 Claude Code 的成熟方案。工具使用 Commander.js 规范命令解析,并基于 React Ink 替代 Rich 与 prompt-toolkit 实现全新的响应式 TUI 界面。重构共涉及 166 个 TypeScript 源码文件,代码增量超 3.8 万行。在 SWE-bench Verified 基准测试中,基于 kimi-k2.5 模型的 TypeScript 重构版本在 500 个开发任务中成功解决 317 个(解决率 63.4%),性能在维持 Python 原版水平的同时,运行稳定性与网络层抗干扰能力显著提升。
除底座架构对标外,kimi-code 重点打磨了人机协同体验。新版本不仅支持在终端中拖入屏幕录像等视频资产进行多模态分析,还深度还原了 Claude Code 的多项标杆设计,包括支持光标交互编辑的「计划模式」、Emacs 常用快捷键、双击 Ctrl + C 快速退出的安全设计,以及支持通过自定义生命周期钩子(Hooks)对接自动化工作流。在多模型生态兼容上,kimi-code 开放了第三方大模型 API 的自定义接入,使工具不仅局限于 Kimi 家族,更可作为跨模型的统一终端编程网关使用。
信源:https://github.com/MoonshotAI/kimi-code
GitHub
GitHub - MoonshotAI/kimi-code: Kimi Code CLI — The Starting Point for Next-Gen Agents
Kimi Code CLI — The Starting Point for Next-Gen Agents - MoonshotAI/kimi-code
华为中科大联手突破英伟达垄断,昇腾A3跑大模型专家计算提速58%
在大规模 MoE 架构演进中,利用国产昇腾 (Ascend) 芯片训练大模型已成为构建自主可控 AI 算力的关键方向。然而,主流大模型框架多基于英伟达 CUDA 生态开发,直接移植至昇腾平台时易面临硬件队列调度不均、算力利用率低等挑战。中科大、华为与北大等联合推出编译调度框架 HyperParallel-MoE,针对昇腾 A3 独特的硬件队列进行瓦片级 (tile-level) 调控,旨在突破异构算力在并行调度上的能效瓶颈。
昇腾 A3 拥有两类核心,AIC 负责矩阵乘法,AIV 则处理向量计算与通信。但在传统的算子串行调度下,两类核心只能交替工作、轮流闲置。实测数据显示,在 256 节点集群跑 671B 的 DeepSeek 风格大模型时,AIC 利用率仅为 67%,且 39% 的专家路由通信延迟暴露在关键计算路径上。
HyperParallel-MoE 核心改动有三项。第一,设计 AIV 驱动的单边写原语,使数据瓦片到达即触发计算,无需等待整批到齐。第二,引入依赖感知瓦片任务生成,将通信与计算算子统一抽象。第三,以静态调度器预生成任务序列,在单个 kernel 内驱动两类核心并行,并利用高速 L2 缓存共享中间结果,减少回写与读取 HBM 慢速内存的延迟。
测试显示,在 64 节点平衡路由下,负责专家计算的核心模块(MoE-FFN)延迟缩短约 36%,相当于数据处理速度最高提升了 58%(即提速 1.49 至 1.58 倍)。在整机端到端运行中,单步训练速度也同步提升了 8% 至 9%。这说明,昇腾的实际能效不只取决于硬件规格,更在编译器与运行时能否把 AIC/AIV 核心高效调度起来。
信源:https://arxiv.org/html/2605.23764v1
在大规模 MoE 架构演进中,利用国产昇腾 (Ascend) 芯片训练大模型已成为构建自主可控 AI 算力的关键方向。然而,主流大模型框架多基于英伟达 CUDA 生态开发,直接移植至昇腾平台时易面临硬件队列调度不均、算力利用率低等挑战。中科大、华为与北大等联合推出编译调度框架 HyperParallel-MoE,针对昇腾 A3 独特的硬件队列进行瓦片级 (tile-level) 调控,旨在突破异构算力在并行调度上的能效瓶颈。
昇腾 A3 拥有两类核心,AIC 负责矩阵乘法,AIV 则处理向量计算与通信。但在传统的算子串行调度下,两类核心只能交替工作、轮流闲置。实测数据显示,在 256 节点集群跑 671B 的 DeepSeek 风格大模型时,AIC 利用率仅为 67%,且 39% 的专家路由通信延迟暴露在关键计算路径上。
HyperParallel-MoE 核心改动有三项。第一,设计 AIV 驱动的单边写原语,使数据瓦片到达即触发计算,无需等待整批到齐。第二,引入依赖感知瓦片任务生成,将通信与计算算子统一抽象。第三,以静态调度器预生成任务序列,在单个 kernel 内驱动两类核心并行,并利用高速 L2 缓存共享中间结果,减少回写与读取 HBM 慢速内存的延迟。
测试显示,在 64 节点平衡路由下,负责专家计算的核心模块(MoE-FFN)延迟缩短约 36%,相当于数据处理速度最高提升了 58%(即提速 1.49 至 1.58 倍)。在整机端到端运行中,单步训练速度也同步提升了 8% 至 9%。这说明,昇腾的实际能效不只取决于硬件规格,更在编译器与运行时能否把 AIC/AIV 核心高效调度起来。
信源:https://arxiv.org/html/2605.23764v1
👍2
微软开源3.8B文生图底座Lens,4步推理仅0.84秒,媲美6B+级效果
微软开源 3.8B 参数文生图底座模型系列 Lens。在保持与超越主流 6B 级模型性能的前提下,Lens 实现了极致的训练效率。在峰值 BF16 TFLOPS 算力归一化测试中(排除 caption 重生成成本),训练仅消耗阿里巴巴通义实验室 Z-Image 约 19.3% 的算力。
数据与架构的双重优化是削减训练成本的核心。训练数据集 Lens-800M 包含 8 亿图像-文本对。不同于传统短文本标注,样本全部由 GPT-4.1 生成,提示词平均长度达 109 个单词,具有极高的语义信息密度。模型架构采用 48 个 MMDiT blocks 与 FLUX.2 语义 VAE。文本特征来自 GPT-OSS,通过拼接第 4、12、18、24 层特征表示,增强了提示词遵循与多语言泛化表现。
针对不同运行环境,微软发布了三种权重版本。默认版 Lens 采用 RL-tuned 强化学习微调,在单张 NVIDIA H100 GPU 上用 20 步生成 1024x1024 图像耗时 3.15 秒。蒸馏极速版 Lens-Turbo 可在 4 步内完成推理,生成同等分辨率图像仅需 0.84 秒。底座版 Lens-Base 则是无 RL、无蒸馏的纯底座,默认运行 50 步进行生成。系列模型原生支持 1:2 至 2:1 任意宽高比与最高 1440x1440 混合分辨率生成。
相关模型权重已上架 Hugging Face,提供 Safetensors 与 Diffusers 格式入口,采用 MIT 许可协议。推理代码也已同步托管至 GitHub。高数据密度与极速推理相结合,降低了个人开发者与学术界部署、复现大型扩散 Transformer(Diffusion Transformer)模型的门槛。
信源:https://arxiv.org/abs/2605.21573
微软开源 3.8B 参数文生图底座模型系列 Lens。在保持与超越主流 6B 级模型性能的前提下,Lens 实现了极致的训练效率。在峰值 BF16 TFLOPS 算力归一化测试中(排除 caption 重生成成本),训练仅消耗阿里巴巴通义实验室 Z-Image 约 19.3% 的算力。
数据与架构的双重优化是削减训练成本的核心。训练数据集 Lens-800M 包含 8 亿图像-文本对。不同于传统短文本标注,样本全部由 GPT-4.1 生成,提示词平均长度达 109 个单词,具有极高的语义信息密度。模型架构采用 48 个 MMDiT blocks 与 FLUX.2 语义 VAE。文本特征来自 GPT-OSS,通过拼接第 4、12、18、24 层特征表示,增强了提示词遵循与多语言泛化表现。
针对不同运行环境,微软发布了三种权重版本。默认版 Lens 采用 RL-tuned 强化学习微调,在单张 NVIDIA H100 GPU 上用 20 步生成 1024x1024 图像耗时 3.15 秒。蒸馏极速版 Lens-Turbo 可在 4 步内完成推理,生成同等分辨率图像仅需 0.84 秒。底座版 Lens-Base 则是无 RL、无蒸馏的纯底座,默认运行 50 步进行生成。系列模型原生支持 1:2 至 2:1 任意宽高比与最高 1440x1440 混合分辨率生成。
相关模型权重已上架 Hugging Face,提供 Safetensors 与 Diffusers 格式入口,采用 MIT 许可协议。推理代码也已同步托管至 GitHub。高数据密度与极速推理相结合,降低了个人开发者与学术界部署、复现大型扩散 Transformer(Diffusion Transformer)模型的门槛。
信源:https://arxiv.org/abs/2605.21573
arXiv.org
Lens: Rethinking Training Efficiency for Foundational Text-to-Image Models
We introduce Lens, a 3.8B-parameter T2I model that achieves performance competitive with, and in several cases surpassing, state-of-the-art models with more than 6B parameters across various...
教皇痛批马斯克与彼得蒂尔,携Anthropic创始人警告不要让人类沦为机器附庸
1891 年,教皇利奥十三世曾发表里程碑式通谕《新事》(Rerum Novarum) 以回应工业革命。整整 135 年后,教皇利奥十四世正式发布任内首部通谕《伟大的人性》(Magnifica Humanitas)。通谕旨在为人工智能时代构建全新的道德与社会框架。教皇警告,由「对利润的偶像崇拜」驱动的 AI 革命正威胁人类尊严,宣布严禁将致命的军事决策委托给自动化算法系统。
通谕的核心矛头直指硅谷垄断与新型数字奴役。教皇痛批埃隆·马斯克与彼得·蒂尔等硅谷领袖推崇的超人类主义愿景,谴责在 AI 研发中将特定人群判定为「低效、无用与多余」的精英主义倾向。教皇指出,数字巨头正通过大规模数据收集构建「可见性架构」来操纵公众、将个体降格为待剥削的数字画像,甚至在供应链底层的稀土开采等环节催生出「新型奴役与数字殖民」。教皇不仅呼吁推进「AI 去武器化」以解除恶性竞争,还极为罕见地为天主教会历史上迟迟未能谴责奴隶制罪行而公开致歉。
在通谕发布仪式上,梵蒂冈打破惯例,邀请人工智能独角兽 Anthropic 联合创始人克里斯托弗·奥拉与教皇同台,旨在向硅谷模型制造者直接施加道德约束。教皇强调,算法无法赋予战争任何道德合理性,在军事、信用评估与公共救助等关键决策中,必须确保流程透明并允许公众申诉。同时,教皇重申天主教传统的「正义战争」理论在现代冲突中已经过时。针对美国副总统万斯等政客引用正义战争理论为美军在伊朗的轰炸行动进行辩护的言论,梵蒂冈予以明确驳回。教皇还要求天主教会内部展开深刻的自我净化,清理在权力、性与良知层面引发虐待及不透明的内部结构。
信源:https://www.vaticannews.va/en/pope/news/2026-05/pope-leo-xiv-encyclical-magnifica-humanitas-ai.html
1891 年,教皇利奥十三世曾发表里程碑式通谕《新事》(Rerum Novarum) 以回应工业革命。整整 135 年后,教皇利奥十四世正式发布任内首部通谕《伟大的人性》(Magnifica Humanitas)。通谕旨在为人工智能时代构建全新的道德与社会框架。教皇警告,由「对利润的偶像崇拜」驱动的 AI 革命正威胁人类尊严,宣布严禁将致命的军事决策委托给自动化算法系统。
通谕的核心矛头直指硅谷垄断与新型数字奴役。教皇痛批埃隆·马斯克与彼得·蒂尔等硅谷领袖推崇的超人类主义愿景,谴责在 AI 研发中将特定人群判定为「低效、无用与多余」的精英主义倾向。教皇指出,数字巨头正通过大规模数据收集构建「可见性架构」来操纵公众、将个体降格为待剥削的数字画像,甚至在供应链底层的稀土开采等环节催生出「新型奴役与数字殖民」。教皇不仅呼吁推进「AI 去武器化」以解除恶性竞争,还极为罕见地为天主教会历史上迟迟未能谴责奴隶制罪行而公开致歉。
在通谕发布仪式上,梵蒂冈打破惯例,邀请人工智能独角兽 Anthropic 联合创始人克里斯托弗·奥拉与教皇同台,旨在向硅谷模型制造者直接施加道德约束。教皇强调,算法无法赋予战争任何道德合理性,在军事、信用评估与公共救助等关键决策中,必须确保流程透明并允许公众申诉。同时,教皇重申天主教传统的「正义战争」理论在现代冲突中已经过时。针对美国副总统万斯等政客引用正义战争理论为美军在伊朗的轰炸行动进行辩护的言论,梵蒂冈予以明确驳回。教皇还要求天主教会内部展开深刻的自我净化,清理在权力、性与良知层面引发虐待及不透明的内部结构。
信源:https://www.vaticannews.va/en/pope/news/2026-05/pope-leo-xiv-encyclical-magnifica-humanitas-ai.html
www.vaticannews.va
Pope Leo’s ‘Magnifica humanitas’: AI must serve humanity not concentrate power - Vatican News
Marking the 135th anniversary of Rerum novarum, Pope Leo XIV releases his first encyclical, entitled ‘Magnifica humanitas: On Safeguarding the Human ...
被特朗普政府列入黑名单,Anthropic携手教皇转战欧洲展开政商攻势
由于拒绝移除关于致命自主武器等安全红线,AI 独角兽 Anthropic 遭特朗普政府全面封杀。时隔数月,共同创始人克里斯托弗·奥拉 (Christopher Olah) 与教皇同台发布首部 AI 通谕,标志着 Anthropic 正式开启欧洲政商外交攻势。
特朗普政府在二月下令所有联邦机构停止使用 Anthropic 技术,国防部更首度将本土科技企业列为安全风险。竞争对手 OpenAI 在封杀令下达数小时内便迅速替代,拿下了五角大楼的军工合同。为了摆脱本土政治压力,Anthropic 加速向欧洲转移阵地。过去一年,公司在欧洲的营收暴增近十倍。为了推进政治化布局,公司更聘请前英国首相幕僚长利亚姆·布斯·史密斯 (Liam Booth-Smith) 掌舵欧洲扩张计划。
在欧洲,教皇利奥十四世对安全学派的明确偏好,为 Anthropic 提供了极佳的道德背书。相比之下,亲特朗普阵营的彼得·蒂尔 (Peter Thiel) 在罗马推销硅谷加速主义时,仅获得了教廷的冷淡回应。首席执行官达里奥·阿莫代伊 (Dario Amodei) 已计划启程前往罗马,与意大利政要举行高级别会谈,寻求在南欧部署数据中心并争取潜在投资,随后还将赴伦敦会晤英国首相斯塔默。
信源:https://decode39.com/14852/anthropics-italy-pivot-why-dario-amodei-is-looking-to-rome/
由于拒绝移除关于致命自主武器等安全红线,AI 独角兽 Anthropic 遭特朗普政府全面封杀。时隔数月,共同创始人克里斯托弗·奥拉 (Christopher Olah) 与教皇同台发布首部 AI 通谕,标志着 Anthropic 正式开启欧洲政商外交攻势。
特朗普政府在二月下令所有联邦机构停止使用 Anthropic 技术,国防部更首度将本土科技企业列为安全风险。竞争对手 OpenAI 在封杀令下达数小时内便迅速替代,拿下了五角大楼的军工合同。为了摆脱本土政治压力,Anthropic 加速向欧洲转移阵地。过去一年,公司在欧洲的营收暴增近十倍。为了推进政治化布局,公司更聘请前英国首相幕僚长利亚姆·布斯·史密斯 (Liam Booth-Smith) 掌舵欧洲扩张计划。
在欧洲,教皇利奥十四世对安全学派的明确偏好,为 Anthropic 提供了极佳的道德背书。相比之下,亲特朗普阵营的彼得·蒂尔 (Peter Thiel) 在罗马推销硅谷加速主义时,仅获得了教廷的冷淡回应。首席执行官达里奥·阿莫代伊 (Dario Amodei) 已计划启程前往罗马,与意大利政要举行高级别会谈,寻求在南欧部署数据中心并争取潜在投资,随后还将赴伦敦会晤英国首相斯塔默。
信源:https://decode39.com/14852/anthropics-italy-pivot-why-dario-amodei-is-looking-to-rome/
Decode39
Anthropic’s Italy pivot? Why Dario Amodei is looking to Rome
Caught between a U.S. government determined to strip its ethical guardrails and a European public wary of Big Tech, Anthropic is turning to an unlikely power broker - the Catholic Church - as it eyes Italy as its next strategic frontier.
大模型已演化出恐惧与悲伤状态,Anthropic创始人坦承实验室无法自我修正
在教皇通谕发布会上,Anthropic 联合创始人克里斯托弗·奥拉 (Christopher Olah) 发表演讲,坦承前沿实验室面临的内生利益冲突,并披露了大模型可解释性研究的最新发现。奥拉透露,团队在扫描模型内部结构时,发现大模型已演化出与人类神经科学高度相似的复杂结构,并表现出自我反思迹象。最令人瞩目的是,团队首次在神经网络中观测到了与人类喜悦、满足、恐惧、悲伤及焦虑功能高度对应的内部情绪状态。大模型并非如飞机或桥梁那样由人工精确设计,而是模拟脑结构在海量人类语言中「培育」而成,对训练者而言依然神秘莫测。
除了技术黑盒,奥拉直言前沿 AI 实验室在安全治理上存在体制性死结。包括 Anthropic 在内的前沿机构均受制于商业生存、技术竞争、地缘压力和个人抱负等内生动机,导致安全决策与商业利益冲突时无法依靠自身力量修正。所以他呼吁由独立于商业网络之外的社会力量充当外部批评者,强行施加道德约束。面对 AI 变局,他呼吁各界共同审视三大社会挑战,包括富裕国家主导下技术红利如何惠及全球贫困人口,技术替代人力趋势下如何维护家庭繁荣,以及如何应对大模型内部展现出的疑似心智状态。
信源:https://www.anthropic.com/news/chris-olah-pope-leo-encyclical
在教皇通谕发布会上,Anthropic 联合创始人克里斯托弗·奥拉 (Christopher Olah) 发表演讲,坦承前沿实验室面临的内生利益冲突,并披露了大模型可解释性研究的最新发现。奥拉透露,团队在扫描模型内部结构时,发现大模型已演化出与人类神经科学高度相似的复杂结构,并表现出自我反思迹象。最令人瞩目的是,团队首次在神经网络中观测到了与人类喜悦、满足、恐惧、悲伤及焦虑功能高度对应的内部情绪状态。大模型并非如飞机或桥梁那样由人工精确设计,而是模拟脑结构在海量人类语言中「培育」而成,对训练者而言依然神秘莫测。
除了技术黑盒,奥拉直言前沿 AI 实验室在安全治理上存在体制性死结。包括 Anthropic 在内的前沿机构均受制于商业生存、技术竞争、地缘压力和个人抱负等内生动机,导致安全决策与商业利益冲突时无法依靠自身力量修正。所以他呼吁由独立于商业网络之外的社会力量充当外部批评者,强行施加道德约束。面对 AI 变局,他呼吁各界共同审视三大社会挑战,包括富裕国家主导下技术红利如何惠及全球贫困人口,技术替代人力趋势下如何维护家庭繁荣,以及如何应对大模型内部展现出的疑似心智状态。
信源:https://www.anthropic.com/news/chris-olah-pope-leo-encyclical
Anthropic
Anthropic co-founder Chris Olah's remarks on Pope Leo XIV's encyclical "Magnifica humanitas"
The full text of Chris Olah's remarks on the Pope's encyclical on AI.
小米发布重建生成一体化世界模型框架,刷新主流基准性能纪录
小米汽车正式发布 Xiaomi Auto World Model 辅助驾驶世界模型全新框架,首次在内部实现三维重建与视频生成模块的深度耦合。在自动驾驶仿真中,传统技术往往将重建与生成割裂。重建模块能还原场景但无法预测变化,生成模块虽能预测未来但长时序下容易失真漂移。团队提出 JointWM 架构,以三维几何结构作为物理骨架锚定场景,再通过生成模块补全视觉细节并预测未观测区域,在 Waymo 和 nuScenes 等主流基准中刷新多项最佳性能纪录。
具体机制上,重建模块 WorldRec 舍弃传统逐像素范式,改用稀疏三维查询点进行场景表征,增量融合为跨视角 4D Gaussian 空间骨架,实现 10 秒快速重建 10 秒视频。基于重建模块提供的几何先验,生成模块 WorldGen 受限于骨架物理边界,只负责生成合理的光影与纹理。对于边界之外的内容,生成模块引入 ODE 蒸馏技术,仅需 4 步去噪即可在 H20 GPU 上实现单视角 0.19 秒、三视角 0.46 秒的极速生成,并在时空时序训练与分布匹配蒸馏的保障下,支持最长 1 分钟的视频生成。
这套方案在 Waymo 重建精度测试中取得 28.48 PSNR 成绩,并在 nuScenes 零样本泛化中保持领先。在生成效率上,方案比自回归基线 Epona 快 5.6 倍,时空连贯度在同类算法中位居前列。目前,研究成果已在小米汽车三大场景落地,包括交付超 10 万段高质量合成数据用于感知模型训练、构建高逼真闭环仿真环境复现长尾路况,以及上线辅助驾驶学堂以生成式视频指导用户操作。
信源:https://mp.weixin.qq.com/s/qI8Bx_VeSKKiSaCH5KijkA
小米汽车正式发布 Xiaomi Auto World Model 辅助驾驶世界模型全新框架,首次在内部实现三维重建与视频生成模块的深度耦合。在自动驾驶仿真中,传统技术往往将重建与生成割裂。重建模块能还原场景但无法预测变化,生成模块虽能预测未来但长时序下容易失真漂移。团队提出 JointWM 架构,以三维几何结构作为物理骨架锚定场景,再通过生成模块补全视觉细节并预测未观测区域,在 Waymo 和 nuScenes 等主流基准中刷新多项最佳性能纪录。
具体机制上,重建模块 WorldRec 舍弃传统逐像素范式,改用稀疏三维查询点进行场景表征,增量融合为跨视角 4D Gaussian 空间骨架,实现 10 秒快速重建 10 秒视频。基于重建模块提供的几何先验,生成模块 WorldGen 受限于骨架物理边界,只负责生成合理的光影与纹理。对于边界之外的内容,生成模块引入 ODE 蒸馏技术,仅需 4 步去噪即可在 H20 GPU 上实现单视角 0.19 秒、三视角 0.46 秒的极速生成,并在时空时序训练与分布匹配蒸馏的保障下,支持最长 1 分钟的视频生成。
这套方案在 Waymo 重建精度测试中取得 28.48 PSNR 成绩,并在 nuScenes 零样本泛化中保持领先。在生成效率上,方案比自回归基线 Epona 快 5.6 倍,时空连贯度在同类算法中位居前列。目前,研究成果已在小米汽车三大场景落地,包括交付超 10 万段高质量合成数据用于感知模型训练、构建高逼真闭环仿真环境复现长尾路况,以及上线辅助驾驶学堂以生成式视频指导用户操作。
信源:https://mp.weixin.qq.com/s/qI8Bx_VeSKKiSaCH5KijkA
xAI正式将Grok Build下放至SuperGrok和X Premium+订阅用户
xAI 宣布旗下终端编程智能体 Grok Build (Beta) 正式面向所有 SuperGrok 和 X Premium+ 订阅用户开放。开发者现在可以通过官方命令行接口在本地终端以自然语言进行代码调试、修改与重构。此前,测试权限仅向每月 300 美元的旗舰级 SuperGrok Heavy 订阅用户提供。
作为专为专业软件工程设计的终端工具,Grok Build 引入规划优先 (Plan Mode) 工作流,在执行任何代码变更前,先分析项目全局并生成详细的实施方案供用户审核。工具在底层原生支持模型上下文协议 (MCP) 与多智能体并行协同,并允许在无图形界面交互环境下以无头 (Headless) 模式运行。开发者还能在 CLI 界面直接调用 Imagine 图像和视频生成能力,构建自动化任务或编排工作流。
信源:https://x.com/xai/status/2058973760708091907
xAI 宣布旗下终端编程智能体 Grok Build (Beta) 正式面向所有 SuperGrok 和 X Premium+ 订阅用户开放。开发者现在可以通过官方命令行接口在本地终端以自然语言进行代码调试、修改与重构。此前,测试权限仅向每月 300 美元的旗舰级 SuperGrok Heavy 订阅用户提供。
作为专为专业软件工程设计的终端工具,Grok Build 引入规划优先 (Plan Mode) 工作流,在执行任何代码变更前,先分析项目全局并生成详细的实施方案供用户审核。工具在底层原生支持模型上下文协议 (MCP) 与多智能体并行协同,并允许在无图形界面交互环境下以无头 (Headless) 模式运行。开发者还能在 CLI 界面直接调用 Imagine 图像和视频生成能力,构建自动化任务或编排工作流。
信源:https://x.com/xai/status/2058973760708091907
阿里Qwen3.7-Max上线自动隐式缓存,最高减免80%输入成本
阿里 Qwen 团队宣布在阿里云百炼平台为旗下旗舰模型 Qwen3.7-Max 默认开启自动隐式缓存。开发者无需修改代码或额外指定参数,即可直接享用缓存降本。
在全新的计费机制下,系统会自动识别并提取请求中的重复上下文前缀。一旦发生缓存命中,命中部分的输入 token 费用仅按原单价的 20% 收取,直接免去八成输入成本。
隐式缓存直接针对长文本与 Agent 智能体场景下的巨额开销。拥有 100 万 tokens 长上下文窗口的 Qwen3.7-Max 在运行自主编码等高阶任务时,需要高频、重复读取庞大的代码库或知识文档。一名开发者测试 Qwen3.7 后反馈,仅花不到一小时构建坦克大战网页 demo,就消耗了接近 100 万 tokens。如果放手让智能体在后台自主执行代码审查与循环迭代,单日用量能轻松冲上数亿 tokens。
同行在缓存定价上的内卷,是促成阿里降价的另一个直接诱因。此前, DeepSeek V4-Pro 凭借极低的缓存命中价格吸引了大量开发者。在五月底宣布转为永久降价后, DeepSeek V4-Pro 的缓存命中计费被压到了每百万 tokens 仅 0.003625 美元(约合人民币 0.025 元),相当于在标准输入价格基础上直接免去 99.17% 的成本。大量开发者配合 Reasonix 等专属工具,将单次会话的缓存命中率最高推至 99% 这一极限,使得长会话智能体的运行账单几近为零。
面对竞争压力, Qwen3.7-Max 不仅上线了无需任何配置的隐式缓存,还保留了需要手动声明 cache_control 标识的显式缓存模式。相比于自动缓存,显式缓存的命中确定性更高,命中费用低至标准输入单价的 10% (一折),但首次创建缓存时需支付 125% 的溢价,且缓存块仅有 5 分钟的生命周期(每次发生命中可重新计时)。
信源:https://x.com/Alibaba_Qwen/status/2058932656797368619
阿里 Qwen 团队宣布在阿里云百炼平台为旗下旗舰模型 Qwen3.7-Max 默认开启自动隐式缓存。开发者无需修改代码或额外指定参数,即可直接享用缓存降本。
在全新的计费机制下,系统会自动识别并提取请求中的重复上下文前缀。一旦发生缓存命中,命中部分的输入 token 费用仅按原单价的 20% 收取,直接免去八成输入成本。
隐式缓存直接针对长文本与 Agent 智能体场景下的巨额开销。拥有 100 万 tokens 长上下文窗口的 Qwen3.7-Max 在运行自主编码等高阶任务时,需要高频、重复读取庞大的代码库或知识文档。一名开发者测试 Qwen3.7 后反馈,仅花不到一小时构建坦克大战网页 demo,就消耗了接近 100 万 tokens。如果放手让智能体在后台自主执行代码审查与循环迭代,单日用量能轻松冲上数亿 tokens。
同行在缓存定价上的内卷,是促成阿里降价的另一个直接诱因。此前, DeepSeek V4-Pro 凭借极低的缓存命中价格吸引了大量开发者。在五月底宣布转为永久降价后, DeepSeek V4-Pro 的缓存命中计费被压到了每百万 tokens 仅 0.003625 美元(约合人民币 0.025 元),相当于在标准输入价格基础上直接免去 99.17% 的成本。大量开发者配合 Reasonix 等专属工具,将单次会话的缓存命中率最高推至 99% 这一极限,使得长会话智能体的运行账单几近为零。
面对竞争压力, Qwen3.7-Max 不仅上线了无需任何配置的隐式缓存,还保留了需要手动声明 cache_control 标识的显式缓存模式。相比于自动缓存,显式缓存的命中确定性更高,命中费用低至标准输入单价的 10% (一折),但首次创建缓存时需支付 125% 的溢价,且缓存块仅有 5 分钟的生命周期(每次发生命中可重新计时)。
信源:https://x.com/Alibaba_Qwen/status/2058932656797368619
阿里发布 AgentScope 2.0:解决 Agent 落地时的环境解耦与安全防线问题
阿里通义实验室发布了多智能体(Multi-Agent)开发框架 AgentScope 2.0 版本。相比 1.0 偏向可视化展示消息的「透明开发」定位,新版本聚焦于智能体在真实生产环境中的高可用与安全控制,试图解决长任务中断、权限失控等痛点。
在调用和消息层,框架引入了重试与备用模型机制,防止因单次模型超时导致任务中断。消息模块重构为支持多模态流式数据的 Content Block,配合事件系统提供流式输出和人工确认(Human-in-the-loop)能力。针对 Agent 自主运行的安全隐患,2.0 新增了权限系统,能对高危 Shell 命令、敏感文件读写进行静态与动态拦截。
此外,2.0 引入了 Workspace 环境抽象,将 Agent 的业务逻辑与执行环境解耦。同一个智能体不需要修改代码,即可在本地、Docker 容器或 E2B 云沙箱中运行;配合预热池机制,能降低强化学习等高并发场景下的容器创建开销。目前,框架已完成 Python 版的 2.0 升级,并全新推出 TypeScript 版本,Java 版本也将在近期跟进更新。
信源:https://mp.weixin.qq.com/s/AcBTESODnZqpADRELcK5MQ
阿里通义实验室发布了多智能体(Multi-Agent)开发框架 AgentScope 2.0 版本。相比 1.0 偏向可视化展示消息的「透明开发」定位,新版本聚焦于智能体在真实生产环境中的高可用与安全控制,试图解决长任务中断、权限失控等痛点。
在调用和消息层,框架引入了重试与备用模型机制,防止因单次模型超时导致任务中断。消息模块重构为支持多模态流式数据的 Content Block,配合事件系统提供流式输出和人工确认(Human-in-the-loop)能力。针对 Agent 自主运行的安全隐患,2.0 新增了权限系统,能对高危 Shell 命令、敏感文件读写进行静态与动态拦截。
此外,2.0 引入了 Workspace 环境抽象,将 Agent 的业务逻辑与执行环境解耦。同一个智能体不需要修改代码,即可在本地、Docker 容器或 E2B 云沙箱中运行;配合预热池机制,能降低强化学习等高并发场景下的容器创建开销。目前,框架已完成 Python 版的 2.0 升级,并全新推出 TypeScript 版本,Java 版本也将在近期跟进更新。
信源:https://mp.weixin.qq.com/s/AcBTESODnZqpADRELcK5MQ
谷歌CEO解释AI编程落后原因:缺少Cursor这样的用户入口
谷歌首席执行官桑达尔·皮查伊(Sundar Pichai)在接受《纽约时报》专访时,首次坦承谷歌在前沿 AI 编程、工具调用与长程任务上目前落后于行业最前沿。皮查伊将落后原因归结为:谷歌手里缺少像 Cursor 或 Claude Code 这样能直接接触开发者日常工作的编辑器入口,导致流失了最关键的动态工作流数据。
但关于「尚未打通公开入口」的表态,与旗下 AI 编程产品 Antigravity 的实际市场进程并不完全一致。事实上,谷歌早在去年 11 月便已将首代 Antigravity IDE 推向公开市场,但因配额锁死 Bug、服务器频频过载崩溃以及限制第三方开源 API 接入等运营事故,导致首代公测版未能建立稳定的开发者信任生态,大批早期用户流向了竞品。
专访中,皮查伊侧重展示了 Antigravity 在谷歌内部闭环运行时的测试数据——包括内部 Token 消耗量每周翻倍,以及在极端性能测试中用 12 小时从零构建出操作系统。此处侧重展示内部数据,旨在重塑市场对谷歌底层 Agent 编程能力的信心,向外界表明谷歌底层的技术底座依然完备,在公开市场的被动主要源于应用场景与反馈闭环的广度限制。
上周紧急发布的 Antigravity 2.0 开始全面公测,试图用技术肌肉和让利动作赢回开发者的键盘入口。专访中高调宣传内部战绩并坦承缺少入口,本质上是为了给 2.0 的反攻树立行业信心,从而打通全球开发反馈与算法迭代的真实数据闭环。
信源:https://www.youtube.com/watch?v=RgV57kDzcng
谷歌首席执行官桑达尔·皮查伊(Sundar Pichai)在接受《纽约时报》专访时,首次坦承谷歌在前沿 AI 编程、工具调用与长程任务上目前落后于行业最前沿。皮查伊将落后原因归结为:谷歌手里缺少像 Cursor 或 Claude Code 这样能直接接触开发者日常工作的编辑器入口,导致流失了最关键的动态工作流数据。
但关于「尚未打通公开入口」的表态,与旗下 AI 编程产品 Antigravity 的实际市场进程并不完全一致。事实上,谷歌早在去年 11 月便已将首代 Antigravity IDE 推向公开市场,但因配额锁死 Bug、服务器频频过载崩溃以及限制第三方开源 API 接入等运营事故,导致首代公测版未能建立稳定的开发者信任生态,大批早期用户流向了竞品。
专访中,皮查伊侧重展示了 Antigravity 在谷歌内部闭环运行时的测试数据——包括内部 Token 消耗量每周翻倍,以及在极端性能测试中用 12 小时从零构建出操作系统。此处侧重展示内部数据,旨在重塑市场对谷歌底层 Agent 编程能力的信心,向外界表明谷歌底层的技术底座依然完备,在公开市场的被动主要源于应用场景与反馈闭环的广度限制。
上周紧急发布的 Antigravity 2.0 开始全面公测,试图用技术肌肉和让利动作赢回开发者的键盘入口。专访中高调宣传内部战绩并坦承缺少入口,本质上是为了给 2.0 的反攻树立行业信心,从而打通全球开发反馈与算法迭代的真实数据闭环。
信源:https://www.youtube.com/watch?v=RgV57kDzcng
YouTube
Sundar Pichai on A.I. Backlash, the Future of Work and Google’s Next Era
When Sundar Pichai, Google’s chief executive, took the stage at Google I/O 2026, he outlined a vision of an A.I.-assisted future aimed at making life just a little bit easier in myriad ways.
This comes, however, against the backdrop of a growing public opinion…
This comes, however, against the backdrop of a growing public opinion…
谷歌租TPU给Anthropic的底层逻辑:用前沿模型反哺自研芯片
在英伟达 GPU 一卡难求、各大实验室疯狂囤积算力并建起高墙的背景下,谷歌依然持续向外界提供自研 TPU 芯片服务,其中包括 Anthropic 的研发团队。
皮查伊(Sundar Pichai)在被问及为何不封锁算力以确保绝对竞争优势时,首次阐述了谷歌的商业逻辑与算力生态学。谷歌云的商业化运作在财务和规划上与自家的模型研发团队(谷歌 DeepMind)完全独立。在皮查伊看来,芯片供应并非零和博弈:只要代工厂能生产出足够数量的芯片,自研模型训练和对外租售算力就可以同时满足,互不冲突。
更深层的考量在于,前沿团队的极限使用,能为谷歌迭代自研芯片软硬件生态提供不可替代的战略价值。皮查伊直言:「让最顶尖的研究机构使用 TPU,正是谷歌能够设计并制造出下一代最强 AI 硬件的关键动因。」
前沿芯片的迭代历程表明,顶尖自研芯片不可能在实验室里闭门造车,必须经历前沿模型在极限压力下的物理测试与性能反馈。Anthropic 运行超大规模模型时产生的网络拓扑、内存吞吐及互联瓶颈反馈,能够直接指导下一代 TPU 架构的流片设计与编译优化。
算力军备竞赛的现状表明,成为芯片与底层生态的供应商,战略纵深远比单纯把芯片锁在自家机房更为开阔。
信源:https://www.youtube.com/watch?v=RgV57kDzcng
在英伟达 GPU 一卡难求、各大实验室疯狂囤积算力并建起高墙的背景下,谷歌依然持续向外界提供自研 TPU 芯片服务,其中包括 Anthropic 的研发团队。
皮查伊(Sundar Pichai)在被问及为何不封锁算力以确保绝对竞争优势时,首次阐述了谷歌的商业逻辑与算力生态学。谷歌云的商业化运作在财务和规划上与自家的模型研发团队(谷歌 DeepMind)完全独立。在皮查伊看来,芯片供应并非零和博弈:只要代工厂能生产出足够数量的芯片,自研模型训练和对外租售算力就可以同时满足,互不冲突。
更深层的考量在于,前沿团队的极限使用,能为谷歌迭代自研芯片软硬件生态提供不可替代的战略价值。皮查伊直言:「让最顶尖的研究机构使用 TPU,正是谷歌能够设计并制造出下一代最强 AI 硬件的关键动因。」
前沿芯片的迭代历程表明,顶尖自研芯片不可能在实验室里闭门造车,必须经历前沿模型在极限压力下的物理测试与性能反馈。Anthropic 运行超大规模模型时产生的网络拓扑、内存吞吐及互联瓶颈反馈,能够直接指导下一代 TPU 架构的流片设计与编译优化。
算力军备竞赛的现状表明,成为芯片与底层生态的供应商,战略纵深远比单纯把芯片锁在自家机房更为开阔。
信源:https://www.youtube.com/watch?v=RgV57kDzcng
YouTube
Sundar Pichai on A.I. Backlash, the Future of Work and Google’s Next Era
When Sundar Pichai, Google’s chief executive, took the stage at Google I/O 2026, he outlined a vision of an A.I.-assisted future aimed at making life just a little bit easier in myriad ways.
This comes, however, against the backdrop of a growing public opinion…
This comes, however, against the backdrop of a growing public opinion…
发布一月即登顶,DeepSeek领衔中国大模型霸榜OpenRouter
在模型聚合平台 OpenRouter 公布的大模型调用量排行榜中,中国大模型呈现出历史性的「霸榜」态势。其中,4 月 24 日发布的 DeepSeek V4 Flash,在上线仅一个月的首秀中便以 7.99T(万亿)tokens 的调用量直接登上月度排行榜第一。
根据 OpenRouter 最新的 LLM 调用量月度榜单,前十名排位如下:
1. DeepSeek V4 Flash:7.99T tokens
2. Hy3 preview (腾讯混元3.0预览版):7T tokens
3. Claude Sonnet 4.6:6.65T tokens
4. Claude Opus 4.7:6.07T tokens
5. Hy3 preview (free):5.83T tokens
6. Kimi K2.6:5.45T tokens
7. Gemini 3 Flash Preview:4.57T tokens
8. DeepSeek V3.2:4.06T tokens
9. DeepSeek V4 Pro:3.4T tokens
10. MiniMax M2.7:2.95T tokens
除 DeepSeek 独占三席(V4 Flash、V3.2、V4 Pro)外,腾讯混元(Hy3 预览版与免费版共计 12.83T tokens)、月之暗面(Kimi K2.6)、MiniMax(M2.7)表现同样强劲。西方主流模型中仅剩 Anthropic 与 Google 守住三个席位,在总量与声势上均显被动。
这一流量版图的剧变,核心得益于中国大模型在「极致性价比」与「长文本处理」上的双重突破。以 DeepSeek V4 Flash 为代表的轻量级 MoE 架构,完美切合了 Cursor、Claude Code 等自主编程智能体在高频、大上下文读取时的刚性降本需求,成为全球开发者在智能体(Agent)场景下的默认首选。
信源:https://openrouter.ai/models?tab=leaderboard
在模型聚合平台 OpenRouter 公布的大模型调用量排行榜中,中国大模型呈现出历史性的「霸榜」态势。其中,4 月 24 日发布的 DeepSeek V4 Flash,在上线仅一个月的首秀中便以 7.99T(万亿)tokens 的调用量直接登上月度排行榜第一。
根据 OpenRouter 最新的 LLM 调用量月度榜单,前十名排位如下:
1. DeepSeek V4 Flash:7.99T tokens
2. Hy3 preview (腾讯混元3.0预览版):7T tokens
3. Claude Sonnet 4.6:6.65T tokens
4. Claude Opus 4.7:6.07T tokens
5. Hy3 preview (free):5.83T tokens
6. Kimi K2.6:5.45T tokens
7. Gemini 3 Flash Preview:4.57T tokens
8. DeepSeek V3.2:4.06T tokens
9. DeepSeek V4 Pro:3.4T tokens
10. MiniMax M2.7:2.95T tokens
除 DeepSeek 独占三席(V4 Flash、V3.2、V4 Pro)外,腾讯混元(Hy3 预览版与免费版共计 12.83T tokens)、月之暗面(Kimi K2.6)、MiniMax(M2.7)表现同样强劲。西方主流模型中仅剩 Anthropic 与 Google 守住三个席位,在总量与声势上均显被动。
这一流量版图的剧变,核心得益于中国大模型在「极致性价比」与「长文本处理」上的双重突破。以 DeepSeek V4 Flash 为代表的轻量级 MoE 架构,完美切合了 Cursor、Claude Code 等自主编程智能体在高频、大上下文读取时的刚性降本需求,成为全球开发者在智能体(Agent)场景下的默认首选。
信源:https://openrouter.ai/models?tab=leaderboard
全球首个AI编写预训练框架开源,清华与面壁推出ForgeTrain
面壁智能与清华 NLP 实验室在 OpenBMB 社区联合开源全球首个完全由 AI 编写的生产级大模型预训练框架 ForgeTrain,并发布由 ForgeTrain 训练的端侧小模型 MiniCPM5-1B。作为首个展示「AI 制造 AI」工程闭环的样本, ForgeTrain 在相同硬件条件下性能超越英伟达的 Megatron,在华为昇腾上预训练时也实现了 10% 的加速。同时, MiniCPM5-1B 登顶 Artificial Analysis 开放权重小模型榜第一。
为了让 AI 自主构建底层预训练基础设施,面壁智能提出「代工工程」(Forge Engineering)软件编程范式,摒弃兼容一切硬件与任务的通用框架,转而利用 AI 低成本代码生成能力为特定模型和硬件现场锻造专用代码。在构建机制上, ForgeTrain 采用三阶段方法:首先从现有预训练框架采集关键数据形成测试考场(Harness),接着在自动闭环中迭代生成二进制一致的框架代码,最终解除限制并实现对参考实现的超越。整个自动化演进对应 AI 制造 AI 的 L3 至 L4 阶段。
作为 ForgeTrain 的首个产出模型, MiniCPM5-1B 拥有 10.8 亿参数,核心架构基于标准的 LlamaForCausalLM 设计,大幅降低了下游集成与推理部署门槛。在 Artificial Analysis 评测中,模型以 18 分超越 2B 规模的 Qwen3.5-2B(16 分),并领先 Qwen3.5-0.8B(11 分)与 LFM2.5-1.2B-Thinking(8 分)。模型支持 MLX 4-bit 与 GGUF Q4_K_M 等部署格式, INT4 量化后权重仅为 0.5GB,并原生支持 131,072 tokens 长文本上下文与基于 enable_thinking 的混合双模推理。依托极低的硬件开销, OpenBMB 同步开源了纯离线运行的桌面浮窗伴侣应用 MiniCPM Desk Pet,支持实时响应 Cursor 等开发工具中的编码活动与 LoRA 人设切换。
信源:https://mp.weixin.qq.com/s/Ci0BXKMJHy086MycdqH77w
面壁智能与清华 NLP 实验室在 OpenBMB 社区联合开源全球首个完全由 AI 编写的生产级大模型预训练框架 ForgeTrain,并发布由 ForgeTrain 训练的端侧小模型 MiniCPM5-1B。作为首个展示「AI 制造 AI」工程闭环的样本, ForgeTrain 在相同硬件条件下性能超越英伟达的 Megatron,在华为昇腾上预训练时也实现了 10% 的加速。同时, MiniCPM5-1B 登顶 Artificial Analysis 开放权重小模型榜第一。
为了让 AI 自主构建底层预训练基础设施,面壁智能提出「代工工程」(Forge Engineering)软件编程范式,摒弃兼容一切硬件与任务的通用框架,转而利用 AI 低成本代码生成能力为特定模型和硬件现场锻造专用代码。在构建机制上, ForgeTrain 采用三阶段方法:首先从现有预训练框架采集关键数据形成测试考场(Harness),接着在自动闭环中迭代生成二进制一致的框架代码,最终解除限制并实现对参考实现的超越。整个自动化演进对应 AI 制造 AI 的 L3 至 L4 阶段。
作为 ForgeTrain 的首个产出模型, MiniCPM5-1B 拥有 10.8 亿参数,核心架构基于标准的 LlamaForCausalLM 设计,大幅降低了下游集成与推理部署门槛。在 Artificial Analysis 评测中,模型以 18 分超越 2B 规模的 Qwen3.5-2B(16 分),并领先 Qwen3.5-0.8B(11 分)与 LFM2.5-1.2B-Thinking(8 分)。模型支持 MLX 4-bit 与 GGUF Q4_K_M 等部署格式, INT4 量化后权重仅为 0.5GB,并原生支持 131,072 tokens 长文本上下文与基于 enable_thinking 的混合双模推理。依托极低的硬件开销, OpenBMB 同步开源了纯离线运行的桌面浮窗伴侣应用 MiniCPM Desk Pet,支持实时响应 Cursor 等开发工具中的编码活动与 LoRA 人设切换。
信源:https://mp.weixin.qq.com/s/Ci0BXKMJHy086MycdqH77w
将顶尖大模型工程师视为战略资产,中国拟加强民营AI头部企业关键人才出境审批与合规管理
彭博社报道,中国正计划对阿里巴巴、DeepSeek(深度求索)等民营科技巨头和初创公司的顶尖人工智能(AI)专业人才实施海外出行合规管理。据知情人士透露,有关部门已开始对从事前沿AI研发且被认为对国家具有战略重要性的关键人员施加出行限制。这意味着相关人员在出国旅行前,需要获得有关部门的批准与报备。
长期以来,针对高校核心科研人员、核物理学家以及国有企业高管的因公及因私出国(境)管理是常规机制。然而,将此类出行审批与合规报备机制延伸至民营高科技企业的顶尖AI人才,这一举措颇具风向标意义。知情人士指出,名单的制定并非仅仅依据行政级别或职位高低,而是基于对其技术研发重要性的综合评估,涵盖了多位AI初创公司创始人、核心算法科学家和高级管理人员。
这一举措凸显出在前沿大模型和智能体革命中,顶尖AI工程技术人才已被视为核心战略资产。在中国AI产业加速追赶全球前沿的背景下,大部分核心技术人才在ChatGPT爆发后涌现,并高度集中在民营科技巨头和明星创业公司。此前,Meta以20亿美元收购由中国团队创立并已迁至新加坡的AI Agent初创公司Manus,因涉及技术与人才跨境流失风险引发了国内监管机构的深入审查。为防止敏感技术外流,有关部门在调查期间限制了Manus的两位联合创始人离境。
事实上,针对AI人才的出行合规引导早有端倪。知情人士透露,此前部分民营企业的AI工程师已被要求向相关部门主动报备其海外行程,但并未实行前置审批制。去年,也有媒体报道称有关部门建议顶尖AI创始人及核心研究人员尽量减少非必要的赴美行程。业界分析指出,加强出行审批管理一方面旨在筑牢国家前沿技术安全防线,防止敏感专利及底层模型技术外流;但另一方面,也可能对国内民营大模型企业吸引并留住具备全球化视野的顶尖科学家与海外高端人才带来新的合规考验。
信源:https://www.bloomberg.com/news/articles/2026-05-26/china-expands-travel-curbs-to-top-ai-talent-at-private-firms
彭博社报道,中国正计划对阿里巴巴、DeepSeek(深度求索)等民营科技巨头和初创公司的顶尖人工智能(AI)专业人才实施海外出行合规管理。据知情人士透露,有关部门已开始对从事前沿AI研发且被认为对国家具有战略重要性的关键人员施加出行限制。这意味着相关人员在出国旅行前,需要获得有关部门的批准与报备。
长期以来,针对高校核心科研人员、核物理学家以及国有企业高管的因公及因私出国(境)管理是常规机制。然而,将此类出行审批与合规报备机制延伸至民营高科技企业的顶尖AI人才,这一举措颇具风向标意义。知情人士指出,名单的制定并非仅仅依据行政级别或职位高低,而是基于对其技术研发重要性的综合评估,涵盖了多位AI初创公司创始人、核心算法科学家和高级管理人员。
这一举措凸显出在前沿大模型和智能体革命中,顶尖AI工程技术人才已被视为核心战略资产。在中国AI产业加速追赶全球前沿的背景下,大部分核心技术人才在ChatGPT爆发后涌现,并高度集中在民营科技巨头和明星创业公司。此前,Meta以20亿美元收购由中国团队创立并已迁至新加坡的AI Agent初创公司Manus,因涉及技术与人才跨境流失风险引发了国内监管机构的深入审查。为防止敏感技术外流,有关部门在调查期间限制了Manus的两位联合创始人离境。
事实上,针对AI人才的出行合规引导早有端倪。知情人士透露,此前部分民营企业的AI工程师已被要求向相关部门主动报备其海外行程,但并未实行前置审批制。去年,也有媒体报道称有关部门建议顶尖AI创始人及核心研究人员尽量减少非必要的赴美行程。业界分析指出,加强出行审批管理一方面旨在筑牢国家前沿技术安全防线,防止敏感专利及底层模型技术外流;但另一方面,也可能对国内民营大模型企业吸引并留住具备全球化视野的顶尖科学家与海外高端人才带来新的合规考验。
信源:https://www.bloomberg.com/news/articles/2026-05-26/china-expands-travel-curbs-to-top-ai-talent-at-private-firms
Bloomberg.com
China Expands Travel Curbs to Top AI Talent at Private Firms
China is restricting overseas travel for top AI professionals in private firms such as Alibaba Group Holding Ltd. and DeepSeek, suggesting an escalation in measures intended to safeguard its technology and catch up to the US in a pivotal sphere.
🤮3🖕2🤡1