动察Beating AI News
3.15K subscribers
883 photos
2 videos
3.4K links
AI新闻信息流
Download Telegram
问一句话终端长出仪表盘:Vercel json-render推出Generative TUI

Vercel 开源 Generative UI 框架 json-render 的创建者 Chris Tate 发布终端渲染器 @json-render/ink,将 AI 生成界面的能力带入命令行。用户输入自然语言提问,即可在终端中实时渲染包含图表、表格、指标卡片等组件的数据仪表盘,演示中展示了一个完整的 iPhone 销售趋势面板,含柱状图、季度明细表和市场份额图。

该渲染器基于 Ink(基于 React 的终端 UI 库)构建,提供 27 个预置组件,支持流式渲染,AI 生成的 JSON spec 随模型响应逐步呈现。开发者可通过 npx skills add vercel-labs/json-render --skill ink 一键安装为 Claude Code skill。

json-render 今年 1 月开源,GitHub 星标超 1.33 万,支持 React、Vue、Svelte、SolidJS、React Native、PDF、邮件、终端和 3D 场景共 9 个渲染目标,均从同一组件目录生成。核心机制是 AI 只能使用开发者预定义的组件,输出受 JSON schema 约束,确保可预测性。

信源:https://x.com/ctatedev/status/2036149934441783691
元宝派上电脑了:视频连麦、共享屏幕、边聊边问AI

腾讯 AI 助手元宝宣布「元宝派」电脑版正式上线。元宝派是今年 1 月内测的多人社交空间,深度打通微信和 QQ,用户将元宝电脑版升级至最新版本后可在侧边栏进入。

电脑版新增视频连麦和屏幕共享功能,连麦时弹出独立窗口,可同步电脑声音并自定义画质。用户在群聊中可随时 @元宝 提问,不用退出对话即可调用 AI。手机与电脑消息实时同步,文件拖入聊天框即可上传。龙虾(OpenClaw)Bot 也已登陆电脑端,3 月 24 日至 4 月 1 日每天中午 12 点和晚 8 点可免费领取,每只自带 Token 额度。

信源:https://mp.weixin.qq.com/s/10A13ZuOVNDFQrKDIm6KjA
中国模型上次SWE-rebench全落前十被嘲「刷分」,这次占了四席

SWE-rebench 是一个每月从 GitHub 抽取全新软件工程任务(issue + PR)的实时基准测试,模型无法提前针对题目优化。维护者 Ibragim 3 月 23 日公布榜单更新,取消了此前的示例演示和 80 步操作限制,新增辅助评估任务。

最新前十排名:

1. Claude Opus 4.6:65.3%
2. GPT-5.2 medium:64.4%
3. GLM-5:62.8%
4. GPT-5.4 medium:62.8%
5. Gemini 3.1 Pro Preview:62.3%
6. DeepSeek-V3.2:60.9%
7. Claude Sonnet 4.6:60.7%
8. Claude Sonnet 4.5:60.0%
9. Qwen3.5-397B-A17B:59.9%
10. Step-3.5-Flash:59.6%

智谱 AI 的开源模型 GLM-5(MIT 协议)以 62.8% 排名第三,是榜上最高的开源模型。中国模型占前十中四席,除 GLM-5 外,还有深度求索 DeepSeek-V3.2(第六)、阿里通义千问 Qwen3.5-397B-A17B(第九)以及阶跃星辰 Step-3.5-Flash(第十)。智谱 Z.ai 全球负责人李子玄评论称,上一次 SWE-rebench 更新时中国模型全部落在前十之外,被批评为「benchmaxing」(刷分)。

信源:https://x.com/ZixuanLi_/status/2036114799029821491
AI密钥不再裸奔:Tailscale网关Aperture开放自助注册,Agent调用全程可追踪

组网工具 Tailscale 将其 AI 网关 Aperture 从候补名单制改为自助注册,开发者可直接开通使用,目前为 alpha 阶段。

Aperture 解决的是 AI 时代的密钥扩散问题:开发者将 LLM API 密钥复制到本地 .env 文件、CI 管道、容器、Agent 运行时,每一步都扩大攻击面。Aperture 将密钥集中存储在网关内,客户端通过 Tailscale 身份认证发起请求,网关代为向模型提供商鉴权,密钥不再出现在应用环境中。以 Claude Code 为例,只需将 ANTHROPIC_BASE_URL 设为 http://ai 即可接入,无需在本地存储任何密钥。

目前支持 Anthropic、OpenAI、AWS Bedrock、Google Vertex AI、Google AI Studio、Vercel AI Gateway、OpenRouter 及本地部署模型共 8 类提供商。平台提供按用户和 Agent 维度的 token 消耗与 API 调用量追踪,员工离职或密钥泄露时只需在 Tailscale 中移除权限,无需逐一轮换密钥。Aperture 可独立于 Tailscale 付费计划单独购买。

信源:https://tailscale.com/blog/aperture-self-serve
只看截图就能操作浏览器:AI2开源80亿参数网页Agent,四项基准超GPT-4o方案

非营利 AI 研究机构 AI2(Allen Institute for AI)发布开源视觉网页智能体 MolmoWeb,基于其 Molmo 2 多模态模型构建,提供 4B 和 8B 两个版本,模型权重、训练数据、代码和评估工具全部公开。

MolmoWeb 的核心设计是纯视觉驱动:通过截图理解网页界面,不依赖 HTML 或无障碍树等结构化页面数据。模型在每一步接收任务指令和当前页面截图,生成推理过程和下一步浏览器操作(点击、输入、滚动等),可完成搜索、表单填写、商品比价等日常任务。单张截图远比序列化的页面结构紧凑,且视觉界面在底层代码变动时仍保持稳定。

在 WebVoyager、Online-Mind2Web、DeepShop、WebTailBench 四个主流基准上,MolmoWeb (8B) 均为开源模型最优:WebVoyager 78.2%、DeepShop 42.3%、WebTailBench 49.5%,全面超越此前最强的开源模型 Fara-7B。4B 版本在 30 步限制下也优于 Fara-7B 的 100 步表现。MolmoWeb 还超越了基于 GPT-4o 等闭源模型构建的网页智能体,后者使用了标注截图和结构化页面数据等更丰富的输入。通过测试时扩展(运行多次独立推理取最优),8B 模型在 WebVoyager 上可达 94.7%(pass@4)。

AI2 同步开源训练数据集 MolmoWebMix,包含 3.6 万条人类操作轨迹(覆盖 1100 多个网站、62.3 万个子任务演示)、由文本智能体生成的合成轨迹,以及 220 万组网页截图问答对。训练过程未使用任何闭源视觉智能体的蒸馏数据。

信源:https://allenai.org/blog/molmoweb
AI Agent也要有域名了:.agent顶级域名社区竞标下月启动,Brave、阿里云等700家公司加入

一个由 3000 多名成员(700 多家公司和 2300 多名开发者)组成的社区正在向 ICANN 申请 .agent 顶级域名,主张这一 AI 命名层应由社区治理,而非被单一公司控制。隐私浏览器 Brave 宣布已注册 .agent 域名并加入该倡议,其他参与方还包括 Ollama、Datadog、Netlify、Sourcegraph、阿里云、Product Hunt 等。

该社区认为,.agent 之于 AI Agent 网络,就像 DNS 之于早期互联网:谁控制了命名层,谁就能决定哪些 Agent 可以被发现、哪些被封锁。社区治理模式旨在确保透明的注册政策、可预期的定价,以及不受任何单一公司董事会左右的准入规则。

ICANN 的申请窗口将于 2026 年 4 月下旬开放,持续 90 天。在有争议的顶级域名分配中,ICANN 采用「社区优先评估」(CPE)机制,由第三方专家小组从社区规模、与域名的关联度、注册政策和社区背书四个维度打分,社区的成员数量和多样性直接影响竞标结果。

信源:https://agentcommunity.org/about
阿里云JVS Claw全面开放:无需邀请码即可「养虾」,新增语音和文件空间

阿里云宣布 AI 智能体产品 JVS Claw 全面开放,所有用户无需邀请码,下载客户端即可获得一只云端「龙虾」。此前该产品处于邀请制内测阶段。

新版主要更新:

1. 手机 App 新增语音输入,支持语音下达任务
2. JVS 文件空间提供 5GB 专属存储,可在多轮对话中搜索历史任务
3. 新增 Skill 管控台,支持第三方 Skill 自定义开关
4. Clawbot 支持一键热升级,无需重建
5. 新增定时任务专用入口
6. 支持微博龙虾助手一键接入

阿里云同步发布《JVS 养虾宝典》,列举 20 多种使用场景。

信源:https://mp.weixin.qq.com/s/1UGnrKk9PSIQ0XkWKmiBPw?clicktime=1774418862&enterid=1774418862&scene=126&sessionid=1774418861&subscene=7
Cursor发布Composer2技术报告:RL环境完全模拟真实用户场景,底座模型得分提升70%

Cursor 发布 Composer 2 技术报告,首次披露完整训练方案。底座 Kimi K2.5 为 MoE 架构,总参数 1.04 万亿、激活参数 320 亿。训练分两阶段:先在代码数据上继续预训练以增强编码知识,再通过大规模强化学习提升端到端编码能力。RL 环境完全模拟真实 Cursor 使用场景,包括文件编辑、终端操作、代码搜索等工具调用,让模型在接近生产环境的条件下学习。

报告同步公布了自研基准 CursorBench 的构建方法:从工程团队的真实编码会话中采集任务,而非人工构造。底座 Kimi K2.5 在该基准上仅得 36.0 分,经两阶段训练后 Composer 2 达到 61.3 分,提升 70%。Cursor 称其推理成本显著低于 GPT-5.4 和 Claude Opus 4.6 等前沿模型 API,在准确率与成本之间实现帕累托最优。

信源:https://cursor.com/resources/Composer2.pdf
Papers with Code创始团队再出发:OpenReward上线330+强化学习环境,一个API训练AI Agent

Papers with Code 联合创始人 Ross Taylor 创办的伦敦 AI 研发公司 General Reasoning 发布开放平台 OpenReward,提供 330 多个强化学习环境和超 450 万个独立任务,开发者通过单一 API 即可训练和评估 AI 智能体。平台基于团队同步发布的 Open Reward Standard(ORS),一个开源 HTTP 协议,环境代码托管在 GitHub,可与任意训练框架和沙盒提供商对接,平台提供可选的托管基础设施,按实际用量计费。

Taylor 此前在 Meta AI 主导了 Llama 2/3 的研发,也是科学大模型 Galactica 的第一作者。他与 Robert Stojnic 于 2018 年联合创建 Papers with Code,后被 Meta 收购,去年关闭。General Reasoning 成立于 2025 年,去年完成 1090 万美元融资。

首批上线的重点环境包括:

1. 英伟达 Nemotron-Math-Proofs-v1:约 58 万道数学证明题,附带 90 万条推理轨迹
2. Nebius 的 SWE-rebench-V2:覆盖 Python、JavaScript、Go、Rust 的 3.2 万多个软件工程任务
3. Eigent 的 SETA:面向 CLI 操作的训练环境,提供 1000 至 1 万个任务
4. EndlessTerminals:程序化生成的终端任务环境

平台目前为公开测试版,训练功能以早期研究预览形式开放,计算资源有限。

信源:https://www.gr.inc/releases/introducing-openreward
Figure创始人自掏1亿美元做「个人AI」:前苹果iPhone Air设计师加盟,要造一系列AI硬件

人形机器人公司 Figure CEO Brett Adcock 宣布创办新 AI 实验室 Hark,目标是打造「全球最先进的个人智能」,将自研多模态模型与定制硬件深度整合,构建人与机器之间的通用交互界面。Hark 已秘密运营 8 个月,由 Adcock 个人出资 1 亿美元启动,据福布斯估算其净资产为 191 亿美元。

Adcock 对 Bloomberg 表示,Hark 正在开发「一系列 AI 设备,既有个人用的,也有家庭用的」,形态将有别于现有的手机、可穿戴设备和智能眼镜。首批 AI 模型计划今年夏天发布,硬件随后跟进。

团队方面,前苹果工业设计师 Abidur Chowdhury 出任设计负责人,他在苹果工作七年,参与了 iPhone 和 Mac 产品线设计,包括近期的 iPhone Air。硬件团队还引入了苹果资深员工 David Narajowski 和 Dave Wilkes。AI 研究侧从 Meta 超级智能实验室(Superintelligence Lab)招入多名高级研究员。团队目前约 45 人,预计上半年扩至 100 人,成员还来自谷歌、亚马逊和特斯拉。Hark 已与英伟达达成算力协议,数千块 GPU 将于下月上线用于模型训练。

Adcock 是连续创业者,2022 年创办的 Figure 最近一轮估值 390 亿美元,此前还创办了招聘平台 Vettery(1 亿美元退出)、电动垂直起降飞行器公司 Archer(NYSE: ACHR)和武器检测公司 Cover。Figure 将保持独立运营。

信源:https://x.com/adcock_brett/status/2036461258443202810
让AI编程助手直接操控桌面:Zig原生CLI工具usecomputer开源,兼容Claude Code和Codex

开源开发者 Tommaso De Rossi 发布桌面自动化命令行工具 usecomputer,用 Zig 编写原生二进制文件,不依赖 Node.js 运行时,让 AI 编程助手(Claude Code、Codex、OpenCode 等)直接控制桌面的鼠标、键盘和截图。支持 macOS 和 Linux(X11,Wayland 通过 XWayland 兼容)。

usecomputer 提供截图、鼠标移动/点击/拖拽/滚动、键盘输入和快捷键合成等 CLI 命令,附带坐标映射系统(coord-map),将截图中的像素坐标自动转换为实际屏幕坐标。截图输出默认将最长边缩放至 1568 像素以适配模型上下文窗口。工具还支持 Kitty Graphics Protocol,设置环境变量后截图可直接内联到模型上下文中,无需额外读取文件。

De Rossi 此前开发了浏览器自动化工具 Playwriter(3200+ GitHub 星标),usecomputer 从浏览器自动化延伸到桌面自动化。项目从其 kimaki 单仓库中独立拆出,同时提供 CLI 和 Node.js 库两种使用方式,README 中包含 OpenAI computer tool 和 Anthropic computer use 的完整集成示例。

信源:https://github.com/remorses/usecomputer
GSM8K团队五年后再出手:25道博士级数学题,所有前沿模型正确率不到10%

AI 数据标注公司 Surge AI 发布数学基准测试 Riemann-bench。Surge AI 五年前与 OpenAI 合作构建了 GSM8K,当时 GPT-3 系列在该测试上正确率不到 20%,如今 GSM8K 已成为行业入门级基准。Riemann-bench 瞄准的是另一个层级:25 道来自常春藤联盟数学教授、博士生和 IMO 奖牌得主自身研究中的问题,出题者本人往往需要数周才能独立解出,示例题目的预估解题时间为 40 至 50 小时。

当前排名:Claude Opus 4.6 和 Gemini 3.1 Pro 并列第一,正确率均为 6%;Kimi K2.5 和 Gemini 3 Pro 并列第三,4%;DeepSeek v3.2 为 3%;GPT-5.2 和 Claude Opus 4.5 均为 2%。GPT-5.4 系列因 API 报错尚未完成测试。

与 FrontierMath 等现有数学基准相比,Riemann-bench 有两个设计差异:一是不限制 Agent 的推理框架和 token 上限,允许模型自由使用工具和多步推理;二是采用双盲验证,每道题由两位独立领域专家从零解题确认答案。题库完全保密,防止模型针对性优化。

信源:https://surgehq.ai/blog/riemann-bench-a-benchmark-for-moonshot-mathematics
马斯克预告Grok Imagine v2:「下一版将是史诗级的」

Elon Musk 发帖称 xAI 图像生成工具 Grok Imagine 的下一个版本「将是史诗级的,我们正在加倍投入」。Grok 官方账号随后回复确认新版本名为 Grok Imagine v2,称将在「创造力和真实感」上大幅提升。未披露具体发布日期和技术细节。

信源:https://x.com/grok/status/2036693952435265941
Anthropic经济指数:老用户成功率高10%,编程任务正从网页端迁移到API

Anthropic 发布第三期经济指数报告,基于 2026 年 2 月 Claude 使用数据分析 AI 对经济的影响。

核心发现是「学习曲线」效应:使用 Claude 超过 6 个月的老用户,对话成功率比新用户高约 10%,即使在控制了任务类型、国家、模型选择等变量后,差距仍有约 4 个百分点。老用户更倾向于与 Claude 协作迭代,而非简单下达指令,用于工作的比例高出 7 个百分点,处理的任务所需教育水平也更高。

使用场景方面,编程仍是最大类别,占 Claude.ai 对话的 35%,但正加速从网页端迁移到 API。Claude Code 的 Agent 架构将编程工作拆分为更小的 API 调用,推动 API 端编程份额持续上升。Claude.ai 上使用场景更加分散,前 10 大任务占比从 24% 降至 19%,个人用途(体育赛事、产品比较、家庭维护等)从 35% 升至 42%。Claude.ai 上任务的平均经济价值(以对应美国职业时薪衡量)从 49.3 美元微降至 47.9 美元。

用户在选择模型时表现出明显的任务匹配行为:付费用户在编程任务中选择 Opus 的比例比平均水平高 4 个百分点,在辅导类任务中低 7 个百分点。API 端这种差异更为明显,任务价值每增加 10 美元时薪,Opus 使用比例上升 2.8 个百分点。

API 端两类新兴自动化工作流增长尤为突出,份额至少翻倍:企业销售外联自动化(线索筛选、客户数据补充、冷邮件撰写)和自动化交易与市场运营(市场监控、投资建议、交易提醒)。

地理分布上,美国各州之间的使用差距继续收窄,但速度放缓,按当前趋势需 5 至 9 年才能趋于均等。国际差距则略有扩大,前 20 个国家的人均使用份额从 45% 升至 48%。报告指出,49% 的职业已有至少四分之一的任务通过 Claude 完成。

信源:https://www.anthropic.com/research/economic-index-march-2026-report
分析:Anthropic年化营收190亿美元同比涨14倍,但和OpenAI的250亿不是一本账

《The Information》分析称,Anthropic 2 月底年化营收突破 190 亿美元,同比增长约 14 倍;同期 OpenAI 年化营收约 250 亿美元,同比增约 4 倍。

两家的年化计算方法几乎一致:取最近四周收入乘以 13(对应一年 52 周)。Anthropic 的细节是 API 收入按四周乘以 13,订阅收入按当日活跃订阅数折算月收入再乘以 12。此前 X 上有声音质疑 Anthropic 的年化算法与 OpenAI 存在重大差异,该报道否定了这一猜测。

但两家在云渠道收入的记账方式上确有实质分歧。微软通过 Azure 向客户转售 OpenAI 模型,OpenAI 仅将自己分到的 20% 计为营收,因为微软被认定为该服务的「委托人」(principal),直接控制交付并拥有 OpenAI 知识产权的独家使用权。Anthropic 则将 AWS、谷歌、微软三家云平台转售 Claude 的全部销售额计为自己的营收,付给云厂商的分成记入销售与营销费用,理由是 Anthropic 自身才是委托人,云厂商只是分销商。两种处理均符合 GAAP,但导致两家的营收数字无法直接对比。

报道认为,比较两家实验室或许自由现金流是更好的指标:Anthropic 预计最早 2028 年转正,比 OpenAI 早两年。其他数据:Anthropic 2025 年全年实际营收约 45 亿美元;OpenAI 约 131 亿美元,预计 2026 年增至约 300 亿美元。

信源:https://www.theinformation.com/newsletters/dealmaker/math-behind-anthropics-mad-revenue-growth
Meta收购Manus案升级:外媒曝肖弘、季逸超被发改委约谈后遭边控,监管从多个方向收紧

英国《金融时报》披露了 Meta 收购 AI Agent 公司 Manus 一案的最新细节。Manus CEO 肖弘和首席科学家季逸超本月被国家发改委召至北京约谈,问询方向为 Manus 所有权变更后,其境内主体是否按规定完成了外商直接投资信息报告。约谈结束后,二人被告知在审查期间不得离境,但可在国内自由活动。此前《纽约时报》已报道高管被限制出境,FT 的报道进一步明确了限制对象为肖弘、季逸超,约谈主体为发改委,边控措施直接与此次约谈相关。

至此,该交易同时面临两条监管线:商务部自 1 月 8 日起对出口管制合规的审查,以及发改委对 FDI 申报违规的问询。多部门同步介入,显示监管层对这笔交易的关切已从单一维度扩展为系统性审视。

目前未启动正式调查,也未提出任何指控。Manus 正在寻找律所和咨询机构协助应对。报道援引知情人士称,即使违规被确认,依据现行法律也不太可能导致严重处罚,但监管方显然在寻找介入交易的切入口。极端情况下可能要求撤销交易,但由于 Meta 已开始将 Manus 的 AI Agent 软件整合入自有平台,强行拆解会非常复杂。外媒普遍认为,此举意在向中国 AI 创业者发出信号:在境内研发核心技术后迁往海外再出售给美国企业的路径,将面临越来越大的监管压力。

Meta 发言人回应称,「该交易完全符合适用法律,我们预期此次问询会得到妥善解决。」

信源:https://www.ft.com/content/d9123d9d-c807-41d6-8a17-80ff1111834a
Meta设9万亿美元市值目标留人:IPO以来首发期权,比马斯克方案增幅相当但时间减半

Meta 推出新的股票期权激励计划,高管只有在公司市值于 2031 年前突破 9 万亿美元时才能兑现全部价值,较当前约 1.5 万亿美元需增长 500%。这是 Meta 2012 年 IPO 以来首次向高管授予股票期权。

计划覆盖六位核心高管:CTO Andrew Bosworth、首席产品官 Chris Cox、COO Javier Olivan、CFO Susan Li、首席法务官 C.J. Mahoney 和副董事长 Dina Powell McCormick。CEO 扎克伯格不在其中。期权分多档行权,最低一档要求股价达到 1116.08 美元(较当前涨 88%,对应市值约 2.82 万亿美元),最高档 3727.12 美元(对应市值超 9 万亿美元)。Meta 同时增加了部分高管的 RSU 授予。

Meta 发言人称这是一次「大赌注」,「只有 Meta 实现巨大成功,所有股东都从中受益时,这些薪酬才会兑现」。

作为对比,特斯拉去年秋天通过的马斯克薪酬方案价值最高 1 万亿美元,需在 10 年内将市值从 1.2 万亿推至 8.5 万亿美元。Meta 的计划要求几乎同等增幅,但时间窗口只有一半。AI 人才争夺战正在推高 Meta 的股票薪酬成本:2025 年与员工股票奖励相关的现金支出消耗了公司 96% 的自由现金流,达 420 亿美元;全年回购的 4000 万股中,90% 是为了抵消员工股票奖励带来的稀释。

信源:https://www.wsj.com/tech/meta-targets-9-trillion-valuation-with-new-executive-incentive-program-64460862
传蚂蚁集团正开发AI眼镜独立App,「看一下支付」要从插件变入口

微信公众号「读佳」爆料称,蚂蚁集团正在开发「蚂蚁数科AI眼镜」独立 App。

蚂蚁数科去年 9 月发布 AI 眼镜可信连接技术框架 gPass,已与 Rokid、小米等主流 AI 眼镜品牌完成对接,实现「看一下支付」在消费、停车、文旅等场景落地。目前 gPass 以插件形式嵌入各硬件厂商系统。若独立 App 落地,蚂蚁的 AI 眼镜支付能力将不再依附于单一硬件品牌,可跨品牌覆盖用户。

信源:https://mp.weixin.qq.com/s/W6j7dbsIAHvt7i7gtIRe-w
杨植麟中关村论坛演讲:大模型训练正进入第三阶段,100个Agent并行后执行时间几乎不随复杂度上升

月之暗面创始人杨植麟在 2026 中关村论坛全体会议上以《开源 AI:加速探索智能上限》为题发表演讲,提出大模型训练正经历三个阶段的演进:三年前主要依赖互联网天然数据加少量人工标注;2025 年转向大规模强化学习,由人工筛选高质量任务,编程和数学领域的性能提升主要来自这一路线;从今年起进入第三阶段,AI 将更大程度主导研究本身,每个研究员将配备海量 token,由 AI 自动合成新任务与新环境、定义奖励函数,甚至探索全新网络架构。

杨植麟介绍了 Kimi K2.5 中首创的 Agent 集群(Agent Swarm)技术。他展示的数据显示,单一智能体模式下任务复杂度与执行时间呈指数级增长,而并行启用 100 个智能体协作后,执行时间几乎不再随任务复杂度上升而显著增加。他将此比喻为「从 0 到 1 建造一家千亿美元公司,一个人可能需要 100 年,但 100 个聪明人一起协作,就能在短时间内完成」。

杨植麟还指出,开源模型正成为全球 AI 产业新标准。在英伟达 GTC 2026 大会上,黄仁勋主题演讲多次引用 Kimi 等开源模型作为芯片性能评测基准,「如果你要发布一个新芯片,就必须通过 Kimi 或其他开源模型来评测性能提升」。

信源:https://www.nbd.com.cn/articles/2026-03-25/4307655.html
一个Transformer同时生成视频和语音:Sand.ai开源150亿参数人像基座模型,单H100两秒出片

视频生成创业公司 Sand.ai 与上海创智学院 GAIR 实验室联合开源音视频联合生成基座模型 daVinci-MagiHuman,150 亿参数,采用单流 Transformer 架构,将文本、视频、音频统一放入同一个 token 序列,仅靠自注意力完成联合建模,不依赖跨注意力或模态专属分支。

模型以人像场景为核心能力,可生成富有表现力的面部表情与自然语音,实现口型、表情与动作的精确同步,支持中文(普通话与粤语)、英文、日文、韩文、德文、法文六种语言。推理侧结合模型蒸馏、隐空间超分辨率和 Turbo VAE 解码器,在单张 H100 GPU 上 2 秒生成 5 秒 256p 视频。

在客观评测中,daVinci-MagiHuman 在开源模型中视觉质量和文本一致性均为最优,语音可懂度词错误率(WER)14.60%,远低于 LTX 2.3 和 Ovi 1.1。2000 组人工盲评中,对 Ovi 1.1 胜率 80%,对 LTX 2.3 胜率 60.9%。完整模型栈(基座模型、蒸馏模型、超分模型、推理代码)全部开源。

Sand.ai 由马尔奖(Marr Prize)得主曹越创立,此前发布了自回归视频生成模型 Magi-1 和主打「AI 演员」的 GAGA-1。上海创智学院 GAIR 实验室由刘鹏飞领导,聚焦生成式 AI 前沿研究。

信源:https://arxiv.org/abs/2603.21986
WordPress 7.0将于4月9日发布,全球43%网站将原生支持AI Agent接入

WordPress 7.0 定于 4 月 9 日发布,核心变化之一是将 MCP(Model Context Protocol)适配器纳入核心,使任何 WordPress 站点都能作为 MCP 服务器,允许 Claude、ChatGPT 等 AI Agent 直接在站点内发现功能、理解结构并执行操作。

具体而言,7.0 在 AI 基础设施层面引入三个组件:

1. AI Connectors:在设置面板统一管理 AI 服务的 API 密钥,首批支持 Anthropic、OpenAI、谷歌三家,所有插件共享同一套凭证,不再各自存储。
2. Abilities API:6.9 版本引入、7.0 扩展的能力注册接口,插件可以用 AI 能理解的格式声明自身功能(如获取文章、更新页面、运行站点健康检查),标准化输入输出。
3. MCP Adapter:将所有已注册的 Ability 通过 MCP 协议暴露给外部 AI Agent,Agent 可自动发现站点能力并在用户授权下调用。

WordPress.com 已于 3 月 20 日率先上线 MCP 写入权限,覆盖 6 类内容的 19 项写操作(编辑内容、管理评论、创建页面、上传媒体、调整分类和标签等)。所有操作需用户明确确认后才会执行,新内容默认为草稿,删除内容进入回收站保留 30 天。WordPress.com 还默认启用 OAuth 2.1 认证,AI 客户端仅使用有时效的 token,不接触用户凭证。

WordPress 驱动着全球约 43% 的网站。MCP 支持进入核心意味着这些站点将具备标准化的 AI Agent 接入能力,类似于 2016 年 REST API 进入核心后催生了无头 WordPress 和现代主题开发生态。

信源:https://x.com/adityaarsharma/status/2036485004348498180