动察Beating AI News
3.13K subscribers
870 photos
2 videos
3.38K links
AI新闻信息流
Download Telegram
前TSY Capital联创崔添翼加盟DeepSeek,带队研发对标Claude Code的Agent

前量化投资机构 TSY Capital 联合创始人、曾在华尔街量化巨头 Jane Street 履职 9 年的崔添翼已于今年 3 月正式加盟 DeepSeek,出任其全新组建的 Harness 团队负责人,挂帅研发直接对标 Anthropic 旗下 Claude Code 的桌面端 Agent 产品。

崔添翼曾在本科期间 6 次斩获 ACM 国际大学生程序设计竞赛亚洲区金牌,其此前创立的 TSY Capital 开发团队人均拥有约 5 枚 ACM 级别金牌。

DeepSeek 内部将核心产品路径定义为「Model + Harness = Agent」,将上下文管理、工具调用、文件读写、终端执行与测试反馈等模型之外的工程动作全部划归 Harness 范畴。在此之前,开发者社区曾自发涌现开源终端项目 DeepSeek-TUI。此次官方亲自下场,旨在收回终端入口主导权,将真实项目中的工程试错轨迹直接注入到底层模型的进化闭环中。

信源:https://www.linkedin.com/feed/update/urn:li:activity:7462155484939079680/
知名开发者揭露谷歌AI内斗:逼走原Gemini CLI团队,新产品Antigravity像素级抄袭Codex

知名开发者 Theo(t3.gg)发布视频,揭露了谷歌 AI 团队内部荒诞的政治斗争。他表示,原 Gemini CLI 团队曾积极听取社区反馈并致力于构建优秀的开源解决方案,但随着谷歌出资将 Windsurf 创始人团队挖来开发新产品「Antigravity」,原团队的心血被彻底废弃,核心人员遭到排挤。更具讽刺意味的是,被谷歌寄予厚望的 Antigravity 客户端不仅模型频繁无效消耗 Token,还在 UI 上像素级抄袭了直接竞品 Codex,甚至在官方演示视频中都不慎露出了名为「Codex」的开发文件夹。Theo 直言,这种内部斗争正在逼走真正优秀的工程师,最终导致谷歌只能产出缺乏诚意的「AI 垃圾」。

在抨击 AI 团队恶性政治之余,Theo 也强烈控诉了谷歌云的极度不可靠。他透露,部署平台 Railway 近期遭遇谷歌云荒谬的内部限流机制导致全面宕机,而谷歌内部甚至无人知晓该限制的存在。他重提了 2024 年大型养老基金 UniSuper 整个云账号遭意外全删的罕见事故,痛批谷歌云相较于 AWS 的稳定与 Azure 的积极响应,完全缺乏商业底线,强烈建议开发者尽快将业务迁出。

信源:https://www.youtube.com/watch?v=1p334v40npw
😁2
谷歌Antigravity紧急整改:永久提升3倍Gemini限额,承认前期决策失误

面对开发者社区对其功能设计与资源消耗的强烈批评,谷歌 Antigravity 团队核心成员(原 Windsurf 创始人)Varun Mohan 今日紧急宣布整改措施。他公开承认团队在部分决策上犯了错,承诺将听取社区反馈并尽快修复存在的问题。

作为首个实质性让步,Antigravity 即日起将所有付费层级的 Gemini 模型速率限制(Rate Limits)永久提升 3 倍,并当即重置了所有用户的本周额度配额。

信源:https://x.com/_mohansolo/status/2057331857755422922
火山引擎上线一站式AIGC短剧创作平台「火山剧创1.0」,制作周期缩短80%

火山引擎正式上线一站式 AIGC 短剧创作平台「火山剧创1.0」。该平台依托自研多智能体(Multi-Agent)架构,并深度适配 Seedance、Seedream 等模型,为用户提供从剧本解析、全剧资产设定、分镜视频生成到成片预览的端到端智能解决方案,号称可将短剧制作周期缩短 80% 以上。

此次 1.0 版本升级的核心在于全面支持企业级工业化协作流程。平台新增了三大核心模块:一是支持多模态参考和智能补全的“分镜提示词编辑器”;二是分为安全合规虚拟人像和授权真人双线覆盖的“IP 人像库”;三是面向专业团队的主子账号灵活积分分配及协作管理功能。

目前,火山剧创已支持电影《古格王朝》完成 AI 先导片创作,大幅降低了传统历史战争场景的调度制作成本。未来,平台计划进一步联动红果短剧、巨量引擎及穿山甲等字节生态链路,推进短剧内容的高效工业化生产。

信源:https://mp.weixin.qq.com/s/CVpzldg_PdHi9aM7i_Subg
Zed上线Terminal Threads,规避Claude Code暴涨ACP接口成本

Zed 1.3.5 版本上线 Terminal Threads 功能,允许开发者在侧边栏直接开启终端线程并运行 Claude Code、Amp 等 CLI 工具。6 月 15 日起,Anthropic 将把 Agent SDK 迁移至受限点数系统,通过传统 ACP(Agent Context Protocol)协议调用 Claude Code 的成本将激增 15 至 30 倍。

新机制让外部工具免改造直接切入编辑器工作流,开发者可借此继续使用现有标准订阅,避开高昂的 API 计费。终端线程完整保留了环境变量与项目目录,并支持跨项目并行运行多 Agent。官方表示后续仍会持续投入 ACP 深度集成,新终端主要提供一个低门槛、无额外接口费用的平行接入路径。

信源:https://zed.dev/blog/terminal-threads
海外版剪映CapCut宣布与谷歌达成合作,用户可在Gemini内直接调用剪辑功能

CapCut 今日宣布与谷歌 Gemini 达成合作,将其原生视频与图像编辑工具整合进 Gemini 应用。用户可以直接在 Gemini 聊天界面内使用自然语言指令,调用 CapCut 完成视频片段裁剪、画幅调整及特效添加,整个工作流无需离开当前对话窗口。

这一动作承接了谷歌在 I/O 2026 大会上发布的 Gemini Spark 个人智能体战略。谷歌没有选择在通用 AI 助手内从头搭建专业特效库,而是让 Gemini 充当大脑去直接调度外部成熟的工具链。目前 CapCut 官方社交平台已确认该功能即将上线,谷歌尚未公布确切的推送时间表。

信源:https://x.com/capcutapp/status/2057340757896216641
👍1
开发者吐槽谷歌AI产品生态碎片化:内部晋升机制导致不断「造新轮子」

科技博主 Gergely Orosz 披露谷歌内部晋升机制存在严重偏差。员工只有开发全新产品才能获得内部晋升与奖励,而维护现有系统或帮助老用户迁移等工作被视为毫无晋升价值。这种激励导向导致谷歌每年都在为同类需求重复发布新产品。

开发者 Nathan Clark 列举了这种机制在谷歌 AI 生态中造成的极度碎片化现状。模型端被强行拆分为 Pro、Ultra 和 Flash 等版本。生态端在 Gemini 和 AI Studio 之间摇摆,且 Workspace 版与个人版 Google One 账号完全割裂。

开发者工具层面的混乱更为严重。谷歌同时推出了智能体开发平台 Spark、编码助手 Jules,并存在新老版本 Antigravity IDE 的迭代冲突。原有的 Gemini CLI 被直接弃用。视频产品 Flow 与 Veo 关系模糊,图像生成工具 Nano banana 被塞入 Gemini 体系,而搜索和研究功能又被拆分进独立的 AI 模式和 NotebookLM 中。

信源:https://x.com/GergelyOrosz/status/2057336026046095508
👍1
腾讯混元开源Hy-MT2系列翻译大模型,并同步上线「腾讯Hy翻译」小程序

腾讯混元官方正式宣布开源 Hy-MT2 系列多语种翻译大模型,发布包含 1.8B、7B 及 30B-A3B(MoE架构)三个规模版本。该系列模型支持 33 种语言及 5 种中国方言互译,相关权重与代码已在 Hugging Face、ModelScope 及 GitHub 同步上线,并在 ARM、高通、Intel、沐曦、天数智芯等多个硬件平台完成适配部署。同时,腾讯混元与 WMT26 官方达成合作,共同主办“视频字幕翻译比赛”。

端侧部署是此次升级的重点。借助混元自研的 AngelSlim/Sherry 框架,1.8B 模型实现了 1.25-bit 的极低精度量化,体积压缩至仅 440MB。该版本在苹果 A15 芯片上的推理速度较前代 4-bit 量化版提升 1.5 倍,完全具备在主流手机端侧流畅进行离线推理的能力。此外,7B 与 30B-A3B 版本在 FLORES-200 榜单上击败了 DeepSeek-V4-Pro,并在真实世界与垂直领域测试中,达到 Gemini 3.1 Pro 约 96% 至 99% 的性能水平。官方还一并开源了翻译指令遵循评估基准 IFMTBench。

基于该模型底座的「腾讯Hy翻译」小程序现已开放体验,主打语音输入、风格预设与个性化定制指令。支持离线端侧推理的 iOS 和安卓 APP 也即将在近期上架。

信源:https://mp.weixin.qq.com/s/a_GPa-brAIB5aqXyd8W4-Q
美股AI初创三巨头,竞相上市

随着科技股新一轮狂欢的到来,SpaceX、OpenAI 与 Anthropic 正掀起一场史诗级的 IPO 浪潮。这三家巨头的总估值预计将超过 3 万亿美元,或将重塑未来科技投资的格局。

SpaceX 已正式提交 IPO 招股书,目标估值高达 1.75 万亿至 2.3 万亿美元,预计最早于 2026 年 6 月 12 日挂牌。尽管文件显示公司整体仍面临数十亿美元亏损,但其星链(Starlink)业务在 2025 年已实现 114 亿美元营收和 44 亿美元营业利润。文件还披露了确保马斯克(Elon Musk)维持绝对控制权的超级投票权结构,以及与“建立可容纳 100 万人口的火星殖民地及太空数据中心”挂钩的巨额期权奖励。据悉,高盛 CEO David Solomon 曾通过社交平台私信马斯克直接争取主承销商资格。

在 AI 赛道,OpenAI 正与高盛、摩根士丹利合作,最快将于本周五秘密提交 IPO 招股书草案,计划在 2026 年底前(或最早 9 月)上市。OpenAI 此前在一级市场已累计融资约 1800 亿美元,此次上市估值区间落在 8500 亿至 1.1 万亿美元。受此消息提振,持有其约 13% 股份的主要股东软银(SoftBank)股价大涨 20%,目前已在该笔投资上录得约 450 亿美元的未实现收益。

作为主要竞争对手,Anthropic 同样已正式委托律师团队推进上市流程,计划在 2026 年下半年申请纳斯达克上市,目标估值高达 9000 亿美元。得益于商业化的迅猛进展,Anthropic 今年一季度营收达 48 亿美元,并预计二季度营收将达到 109 亿美元,有望借此实现公司史上首个单季盈利。

信源:https://www.timesnownews.com/business-economy/markets/spacex-vs-openai-vs-anthropic-the-next-tech-ipo-war-article-154366685
1
AI搜索引擎Exa完成2.5亿美元C轮融资,估值一年翻三倍

专为 AI Agent 构建底层搜索基础设施的 Exa 宣布完成 2.5 亿美元 C 轮融资,由 a16z 领投,投后估值从去年 9 月的 7 亿美元飙升至 22 亿美元。本轮资金将用于扩充专有索引库、训练新一代检索模型,并将底层吞吐量扩容至每秒数十万次并发请求。

Exa 强调其核心护城河是「全栈自建」:拥有独立爬虫、追踪超五千亿 URL 的原生索引系统、自研 embedding 模型及第三代向量数据库,彻底告别业内普遍的「套壳谷歌」方案。这套专为 AI 设计的引擎,支持从 200 毫秒极速响应(Exa Instant)到分钟级的自主深度检索(Deep Max,近期在 DeepSearchQA 取得 SOTA)。最新研究还表明,使用 Exa 替代传统搜索引擎进行 RL 智能体训练,可节省 69% 的 Token 消耗,搜索正从「推理工具」进化为不可或缺的「训练基底」。

目前 Exa 的月查询量已达 10 亿次,一年激增十倍,服务客户包括 Cursor、Cognition 等头部 AI 公司。颇具戏剧性的是,曾立起「10^18 > 10^100」(Exa 大于 Google)挑衅广告牌的 Exa,近期也作为首批伙伴接入了 Google Cloud Vertex AI,为 Gemini 企业客户提供 Grounding 搜索落地服务。

信源:https://x.com/ExaAILabs/status/2057132080317042697
👍1
Manus创始人拟融资10亿美元以撤销Meta收购案并谋求在港上市

智能体 AI 初创公司 Manus 的三位创始人肖弘、季逸超与张涛正探讨回购方案,拟从外部投资者处融资约 10 亿美元,以应对北京监管机构此前要求撤销 Meta 收购案的决定。

知情人士透露,上述回购估值将至少匹配 Meta 收购时支付的 20 亿美元。除计划引入 10 亿美元外部资金外,创始人还可能自掏腰包补齐余款。若谈判达成,Manus 将与这些投资方在华设立合资企业,并谋求在香港上市。

今年 4 月,北京监管机构向当事方发出通知,要求取消这笔在 2025 年 12 月宣布的收购案。监管层明确表示,将全力阻止敏感技术流向美国企业。此前,监管部门已采取类似严厉立场,禁止字节跳动和月之暗面等本土科技巨头在未经批准的情况下接受美资,并收紧了离岸中国企业在港上市的监管路径。

由于大部分交易已经完成,在实际操作中彻底逆转交易面临极大难度。Manus 员工目前已入职 Meta 位于新加坡的办公室,技术已与后者的系统深度整合,腾讯、红杉中国及真格基金等早期投资方也已收到退出资金。目前,相关的回购和拆分方案仍处于初步探讨阶段,估值和条款随时可能发生变化,三位创始人最终也可能选择放弃。

信源:https://www.bloomberg.com/news/articles/2026-05-21/manus-weighs-raising-1-billion-to-unwind-meta-takeover
AMD第六代EPYC处理器Venice在台积电2nm量产,百亿美元投资扩充台湾先进封装

AMD 第六代 EPYC 处理器(代号 Venice)已在台积电台湾晶圆厂的 2nm 节点启动量产。这是业界首款基于台积电 2nm 工艺量产的高性能计算(HPC)产品。面向智能体(Agentic)AI 激增的内存需求,AMD 后续的 Verano 处理器将沿用 2nm 工艺并整合 LPDDR 内存。台积电亚利桑那州工厂也已列入后续量产版图。

AMD 同步在台湾生态圈投资逾 100 亿美元,集中扩建先进封装产能。资金流向日月光(ASE)、硅品(SPIL)和力成科技(PTI)等产业链企业。其中,力成科技已完成业界首个面板级 EFB(Elevated Fanout Bridge)2.5D 互连技术验证,负责拔高 Venice CPU 的互连带宽与能效。

搭载 Venice CPU 与 Instinct MI450X GPU 的 AMD Helios 机架级系统正交由新美亚(Sanmina)、纬颖、纬创与英业达进行系统构建。整套平台预计于 2026 年下半年启动数千兆瓦(multi-gigawatt)规模的部署。

信源:https://ir.amd.com/news-events/press-releases/detail/1287/amd-announces-production-ramp-of-next-generation-amd-epyc-processor-venice-on-tsmc-2nm-process-technology
Meta单日裁员8000人,凌晨4点发解雇邮件且监控留任员工训练AI

Meta 于 2026 年 5 月 20 日裁员 8000 人。多位员工披露解雇邮件在当天凌晨 4 点集中发出,公司此前已要求全员在家办公。被裁名单包含每天睡眠不足 4 小时、常在凌晨 3 点提交代码的 IC4 级别高绩效且无 PIP 记录的骨干工程师。

未被裁员的留任员工电脑已被安装监控软件。内部员工 Marco 指出,公司正在追踪留任者的操作轨迹来训练 AI,目标是利用这些 AI 进一步替代现有岗位。Meta 当前正处于创纪录利润期。前员工 Jeremy Bernier 证实内部仍在执行末位淘汰(Stack Ranking),大量背负房贷的初中级工程师及 H1B 签证持有者在无底线加班后,依然直接成为推高股价的牺牲品。

信源:https://x.com/jeremybernier/status/2057089908175679663
阿里云发布万镜一刻全链路AI视频创作平台

阿里云正式发布全链路 AI 视频创作平台万镜一刻 WonderClip,集成 Happy Horse、Wan、Qwen-image 与 Z-image 等阿里系大模型并向全行业开放。

平台提供三种核心工作流。第一,故事板模式专为剧情视频与 AI 短漫剧设计,用户上传剧本或小说后,编剧、分镜和导演智能体自动协同解析,生成分镜和运镜指令以批量产出人物一致的画面。第二,无限画布模式面向广告创意与短剧,用户在单一画布内即可通过自然语言引导智能体搭建生产流,并支持将创作链路保存为协同模板。第三,Agent 模式通过多智能体协同提供对话式成片能力,近期将开启灰度测试。

针对商业营销中常见的字符渲染难题,万镜一刻引入营销意图理解智能体与专用排版渲染引擎,保证生成的字幕、数字及品牌视觉元素精准无误,解决了大模型在视频中文字生成容易出错的痛点。

在交付与协作层面,平台提供品牌定制、轻量化嵌入及全栈 API 集成,支持企业部署具有独立域名和 UI 的品牌空间,并支持多工作室资产管理与精细权限隔离。针对已拥有智能体架构的企业,平台开放了音视频创作技能与 API 接口,供其无缝集成至现有业务流程。目前,史密斯、钛动科技与天阅剧场等企业已接入万镜一刻,用于生成虚拟品牌官视频及短剧量产。

信源:https://mp.weixin.qq.com/s/gV1jZDiOhqe_79Q_k-ngbw
OpenAI模型推翻80年单位距离猜想,AI首次独立解决核心数学公开难题

OpenAI 内部一款通用推理模型推翻了埃尔德什在 1946 年提出的平面单位距离猜想。根据原猜想,在平面上放置 n 个点,距离刚好为 1 的点对数量不会显著超过 n^{1+o(1)},数学界长期认为类似方格的构造已接近极值。

完成这项证明的模型不是专门的数学系统,也没有使用搜索脚手架针对这道难题定制。模型给出一族新的点集构造,把单位距离点对数量拉高到 n^{1+δ} 级别(δ 为大于 0 的常数),打破了学术界沿用近 80 年的上界预期。

新解法直接跨越了常规的学科边界。模型将代数数论的深层工具引入欧氏平面组合几何。Noga Alon、Tim Gowers 和 Arul Shankar 等外部数学家在检查原始证明后,于 arXiv 发布了配套说明论文,指出推导过程依赖 Ellenberg-Venkatesh 和 Golod-Shafarevich 等复杂的代数数论思想。

菲尔兹奖得主 Tim Gowers 将这一成果视作 AI 数学里程碑。数论学者 Arul Shankar 认为当前模型已具备提出原创想法并推进完整论证的能力。相比于证明结论,更大的技术增量在于通用模型在没有专属工具链的环境下,独立跑通了一条人类专家长期未能触及的反例路线。

信源:https://openai.com/index/model-disproves-discrete-geometry-conjecture/
草稿模型开始退场,MTP推测解码冲上本地推理前台

以往做推测解码提速,推理系统习惯外挂一个草稿模型:小模型先猜后续 token,主模型再批量核对。随着带原生多 Token 预测(MTP)能力的模型出现,这个过程正被拉回主模型内部。

MTP 的思路是让主模型自己预判并验证后续 token。对比外接方案,它省掉了一套独立的模型权重和适配环节,也避开了两者 tokenizer 或词表对不齐的麻烦。

上游模型已经给出了动作。DeepSeek-V3 在技术报告中将 MTP 列为训练目标,并指出其可在推理时用于 speculative decoding。DeepSeek-V4 报告也明确沿用了与 V3 相同的 MTP 策略。Qwen3.6 则直接在官方模型卡里写明了 SGLang 和 vLLM 的启动命令。

下游推理框架和工具也开始了密集适配:

• llama.cpp 在 2026 年 5 月 16 日合入了 MTP 支持。据开发者在 Qwen3.6 27B 和 35B-A3B 上的测试,稳定接受率达到 75% 左右,部分配置下生成速度翻倍。但 PR 同样提醒,开启 MTP 会拖慢 prompt processing,并行解码也还待优化。
• vLLM 已将 MTP 加入官方 speculative decoding 列表。按 Qwen3.6 官方推荐,加上 --speculative-config '{"method":"qwen3_next_mtp","num_speculative_tokens":2}' 参数即可启用。不过 vLLM 文档也交了底:真实的提速收益依然取决于具体模型和部署环境。
• LM Studio 0.4.14 Beta 加入了 MTP 手动开关,用户下载好支持 MTP 的模型后,在高级加载设置里开启即可。
• Ollama 现阶段相对谨慎,官方日志目前仅确认在 Mac 的 MLX runner 上支持 Gemma 4 MTP,尚未看到针对 Qwen3.6 或通用 MTP-GGUF 的默认加速说明。
腾讯会议AI同传上线支持音色模仿,时延压低至3秒内

腾讯会议正式上线 AI 同传功能,首期支持中英互译。新功能将同传时延压缩至 3 秒以内,并支持用户开启「模仿你的音色」功能,使 AI 语音翻译能够还原发言人的声音特征。

传统的同传类似于接力赛,需要发言人讲完整句后翻译才能开始。腾讯会议 AI 同传采用实时翻译机制,实现发言与翻译几乎同步。在多人会议场景中,开启音色模仿不仅能让翻译听起来像参会者本人在用外语说话,还能帮助听众轻松分辨不同的发言人,避免被单一的机器合成音混淆。用户也可以随时切换回系统音色,并自由调节原声音量与同传音量比例。

新推出的同传服务与腾讯会议原有的实时转写和会中字幕深度打通,构建起由双语字幕、文字记录与同传语音组成的完整 AI 会议工作流。这一闭环流程能够精准捕捉并即时传递跨语言发言,生成可被 AI 读取和调动的高质量会议上下文素材,从而提高跨语言会议中 AI 纪要、待办提取以及会后问答的准确度。

信源:https://mp.weixin.qq.com/s/fUeZi5zv9ky2nxeLZVhb6A
Grok订阅打通开源终端智能体OpenCode

开源终端编程智能体 OpenCode 正式接入 xAI Grok 订阅服务。拥有 SuperGrok 或 X Premium 个人订阅的用户,可通过 OAuth 授权机制在 OpenCode 中连接并使用个人账号的算力额度,免去单独申请与配置大模型 API Key 的步骤。

用户在 OpenCode 中运行 /connect 并选择 xAI 后,即可开始调用专属代码模型 Grok Build 进行编程。这一模型也是 xAI 官方终端编码智能体的底层驱动模型。针对不同的部署环境,授权流程提供两种接入方式。在常规桌面端,系统通过 xAI Grok OAuth 直接拉起本地浏览器登录。若在无 GUI 交互的远程服务器、VPS 或 SSH 终端中,系统则会打印出临时验证码与认证 URL,支持以 Headless 模式远程授权。

这是继 5 月 16 日首发接入开源智能体 Hermes Agent,以及 5 月 20 日打通 OpenClaw 之后,xAI 在一周内第三次向下释放个人订阅算力。xAI 官方在公告中确认,未来还将引入更多开源智能体与集成通道。

信源:https://x.ai/news/grok-opencode
ChatGPT官方PowerPoint插件上线Beta版,Office套件集成拼图再落一子

OpenAI 官方宣布推出 ChatGPT for PowerPoint 官方插件,目前处于 Beta 测试阶段。用户可以直接在 PowerPoint 的侧边栏中开启 ChatGPT,使用自然语言指令直接创建和修改演示文稿,且生成的幻灯片保留完全的可编辑性。此外,该插件还支持重写单页标题、提炼多文字幻灯片,并能联动 Gmail、Outlook 及 SharePoint 等关联服务,依据用户已有的邮件和文档快速梳理并生成汇报 PPT。

在此之前,OpenAI 已于 2026 年 3 月 5 日推出了官方的 ChatGPT for Excel** 插件 Beta 版,并于 5 月 5 日正式推向 General Availability (GA),覆盖 Free、Plus、Pro 及企业版等所有计划,支持用户直接在 Excel 侧边栏进行公式生成、表格修改和跨 Sheet 数据分析。

不过,对于 Microsoft Word,OpenAI 目前尚未推出官方的 ChatGPT 插件。如果用户需要在 Word 中使用深度集成的 AI 体验,目前主要依赖微软官方推出的 Microsoft 365 Copilot,或者从 Office Add-ins 应用商店中安装由第三方开发者发布的 GPT 插件(需要自行配置 OpenAI API Key )。

信源:https://x.com/ChatGPTapp/status/2057375218765275136
智谱发布GLM-5.1高速版API,400 tokens/s刷新全球速度纪录

智谱面向部分企业客户推出 GLM-5.1 高速版 API ,其模型输出速度达到 400 tokens/s ,刷新了全球大模型官方接口的端到端速度上限。

在完整保留原有旗舰模型能力的前提下,此高速版通过智谱与 TileRT 团队联合研发的高性能推理引擎进行驱动。此引擎彻底重构了 GPU 的运行调度机制,在编译期将模型静态编排为一个常驻 GPU 的 persistent Engine Kernel 。单卡推理时,计算、异步 IO 与通信被全部拆解为 tile 级微任务并仅启动一次 kernel ,算子间的中间结果通过寄存器和共享缓存直传,消除了传统推理中频繁内核启动与显存读写带来的延迟空泡。

当扩展至多卡尺度时, TileRT 进一步将 specialization 并行思路扩展到整张 8 卡 NVL 拓扑,将原本同构的 GPU 节点特化为承担不同任务的异构 Worker 。在处理 GLM-5.1 的注意层计算时,系统指派 GPU 0 运行稀疏索引 Worker ,专门进行稀疏索引构建与路由决策。同时指派 GPU 1 至 GPU 7 运行 MLA Worker ,负责计算密集阶段并将通信完全下沉至 tile 级任务流水线内部,实现了计算与跨卡通信的深度重叠。

此高速版服务目前已面向智谱 MaaS 平台的部分企业客户开放。未来,此技术还将进一步优化 FP8 推理与超长上下文生产环境,为 AI 编程、实时交互和实时语音等低延迟敏感场景提供更具确定性的性能支持。

信源:https://mp.weixin.qq.com/s/FJn5athj8G4y2narTzMSyA
OpenAI推出Codex黑屏锁屏接管功能,防物理窥屏且碰实体键即锁

OpenAI 旗下 Agent 产品 Codex 推出锁定态屏幕控制功能,支持用户在 Mac 处于锁屏且黑屏状态下,通过手机等移动端设备远程安全接管并操作电脑软件。

为实现锁定状态下的安全托管, Codex 会在 macOS 系统中引入经 Apple 授权的底层辅助插件,深度接入系统级解锁流程。移动端发起操作请求时,此插件会在后台悄悄临时解锁系统以运行目标应用。在此期间,系统会完全屏蔽本地物理键盘与鼠标指针输入,同时向所有相连的显示器投射纯黑覆盖层,在物理感官上彻底「致盲」本地屏幕,确保电脑外观始终保持黑屏和锁定状态。

这一后台自动解锁通道受到极严苛的安全边界限制。它只会在移动端安全认证的短暂控制周期内开启,其他本地软件或第三方进程完全无法调用。操作运行中,系统一旦检测到本地物理键盘或鼠标被触碰,会瞬间触发警报,立即收回后台解锁状态并拉起锁屏,暂停所有自动操作,直到用户在现场手动完成解锁。

此外,出于防提权安全考量,这一机制本质上是一个受限的「隐形沙箱」,无法接管终端应用( Terminal ),无法影响 Codex 自身,亦无法私自执行管理员身份认证( Sudo )或批准系统的隐私安全弹窗。

信源:https://x.com/OpenAIDevs/status/2057536706778378692