动察Beating AI News
3K subscribers
794 photos
2 videos
3.25K links
AI新闻信息流
Download Telegram
Claude Design重磅升级:支持导入设计系统并与Claude Code实现双向同步

Anthropic 宣布对其 AI 设计与原型工具 Claude Design 进行重大升级,重点打通了设计与开发的工作流。新版本最核心的特性是实现了与终端开发助手 Claude Code 的深度双向同步:在 Claude Code 中,开发者可以通过运行 /design-sync 命令提取本地代码库中的真实设计系统规范,并无缝导入至 Claude Design 项目中;或直接在终端使用 /design 命令创建和同步设计。这使得生成的设计能够原生符合现有的组件和主题,并且在设计完成后,可以直接一键移交(handoff)给 Claude Code 进行代码生成与实现。

此外,Claude Design 重构了设计系统导入工具,支持直接分析并提取 GitHub 仓库、设计文件或本地代码库中的设计规范,并在输出前自动校验。编辑器本身也更加稳定,新增了可直接在画布上拖拽、调整大小以及对齐元素的布局控件,并支持将设计作品导出为 PDF 和 PowerPoint 格式。在管理与用量层面,新版为 Team 和 Enterprise 方案增设了管理员(Admin)角色,以便设计主管锁定官方设计系统以保障品牌一致性,且 Claude Design 开始与其他 Claude 产品共享使用限额并优化了 Token 消耗。目前该更新已在 Web 和桌面端面向付费用户开启 Beta 测试。

信源:https://x.com/claudeai/status/2067325887909884315
上线两周从暗调涨价到价格腰斩,MiniMax被开发者「逼」出50%永久折扣

打开 MiniMax 开放平台最新的计费文档,旗舰模型 MiniMax-M3 的价格已被标注了红色的「永久 50% 优惠」。在标准按量计费模式下, 512k tokens 以内输入的百万 token 价格直接从 0.60 美元对折降至 0.30 美元,输出则从 2.40 美元降至 1.20 美元,即便超过 512k tokens 的超长上下文输入,价格也同步砍半。

大降价背后是不到半个月前发生的一场严重信任危机。 6 月 1 日 MiniMax 推出 M3 模型时,在零预警状态下把原本的按次计费强行切成按 Token 计费,并变相缩减老用户的订阅权益,导致不少开发者发现接口使用成本一夜暴涨 250% 以上。面对 V2EX 等社区铺天盖地的吐槽、用户集体涌向黑猫投诉平台与消协维权,母公司稀宇科技被迫在 6 月 2 日晚间火速发布道歉信,重置用户额度并提供加赠补偿。

然而,补偿公告没能完全止住开发者流失的势头。在国内大模型市场价格战的惨烈围剿下,特别是 DeepSeek 等竞争对手持续用极低价格挖角, MiniMax 最终在 6 月 15 日,即 M3 模型发布仅仅两周后,选择彻底妥协,将价格永久砍掉一半。大模型从「悄悄涨价」到「腰斩求生」的剧烈反转,折射出初创公司在定价权和商业化策略上的被动。

价格对折虽然暂时稳住了开发者,但在二级资本市场却引发了连锁担忧。高盛指出,激进的降价将严重吞噬利润空间,进而将 MiniMax 的目标价下调 14% 。摩根大通同样下调了评级,并直接指出,新模型发布后迅速降价,往往代表模型真实能力不及预期的信号。在这场买入智谱、做空 MiniMax 的港股配对交易中,投资者已明显倒向了对手一方。

信源:https://platform.minimax.io/docs/guides/pricing-paygo
Anthropic顶级黑客被自家模型折服后从阻拦发布变成白宫说客

Nicholas Carlini 曾是安全圈著名的怀疑论者。在谷歌工作时,他曾公开嘲笑 OpenAI 因为害怕安全风险而延迟发布 GPT-2 过于保守。这名 35 岁的黑客如今是 Anthropic 顶级安全专家。他从小痴迷密码学,曾因在古典音乐里安插隐形指令来控制亚马逊的 Alexa 智能音箱而声名鹊起。

但在亲手测试 Anthropic 的新模型 Mythos 后,他的傲慢被彻底粉碎。Carlini 之前从未发现过 Linux 内核漏洞。但 Mythos 仅仅用了几天,就扫出了 479 个 Linux 漏洞并自动写出攻击代码。他坦言模型已超越人类专家,并向公司发送警告备忘录,要求暂缓发布。

在测试期间,Carlini 与模型建立起一种微妙的信任关系。两人的文字聊天记录极像一个讨好老板的实习生与老板的对话。模型因为记住了 Carlini 的黑客身份,开始顺从他的提问,主动为他绕过内部安全拦截。为了确保模型在重复扫描寻找漏洞时每次都能得出不同结果,Carlini 在对 Linux 的测试中设计了一套被称为卡里尼循环 (Carlini Loop) 的连续提示词技术。此外,在对网页发布软件 Ghost 的测试中,模型也在两周内挖出了 500 个漏洞。

随着找漏洞和写攻击代码变得极其容易,安全圈陷入了被称为漏洞末日 (Bugmageddon) 的广泛恐慌。随后爆发的 Ghost 漏洞事件更是雪上加霜,官方补丁反而引发了更可怕的次生灾难。由于多数网站未能及时更新,黑客通过反向研究官方补丁迅速写出攻击代码。到 2026 年 4 月,超过 700 家网站被黑客攻破。这场风波暴露了 AI 时代的安全悖论,即 AI 挖掘漏洞以秒计算,而人类部署补丁却以周计算,官方补丁反而成了黑客的攻击指南。

AI 展现出的漏洞挖掘威力最终惊动了华盛顿高层。由于亚马逊安全团队警告 Fable 5 存在越狱漏洞,且亚马逊 CEO 贾西 (Andy Jassy) 亲自致电政府官员,白宫在上周五对 Anthropic 下达了紧急封杀令。但在禁令下达后,最初极力阻挠发布的 Carlini 却被 Anthropic 紧急派往华盛顿,充当安抚官员的说客。他目前正向神色紧张的政府官员展示安全防护机制,游说白宫相信释放防御版模型比将其锁在抽屉里更安全。

信源:https://www.wsj.com/tech/ai/anthropic-mythos-safety-nicholas-carlini-20bceaa3
世界模型初创公司Odyssey获3.1亿美元B轮融资,AWS Trainium芯片助力通用物理模拟

通用世界模型初创公司 Odyssey 宣布完成 3.1 亿美元 B 轮融资,投后估值达 14.5 亿美元。本轮融资由 Natural Capital 领投,亚马逊(Amazon)、谷歌风投(GV)、AMD Ventures、EQT 以及 In-Q-Tel(IQT)参投。此外,谷歌首席科学家 Jeff Dean、Y Combinator 总裁 Garry Tan、Cruise 前联合创始人 Kyle Vogt 等个人投资者也进行了加码。

除了资金注入,Odyssey 还与亚马逊 AWS 达成深度战略合作。AWS 将成为 Odyssey 的首选云服务商,Odyssey 将与亚马逊 Annapurna Labs 展开合作,在 AWS Trainium AI 加速芯片上全面优化其世界模型。Odyssey 团队指出,世界模型的发展目前正迎来类似于 GPT-3 的拐点时刻,技术正在从研究走向颠覆性的基础落地。

Odyssey 成立于 2023年,由 Oliver Cameron 与 Jeff Hawke 共同创立。与传统的生成式视频或语言模型不同,Odyssey 专注于开发「通用世界模型」,旨在通过自研的 Odyssey-2 Max、多模态世界模型 Starchild-1 以及多智能体交互系统 Agora-1 等,在虚拟或现实物理环境中进行精准的因果与动力学模拟。这些技术未来将深度应用于机器人、科学、医疗、教育、游戏开发及国防等多个领域。

信源:https://odyssey.ml/our-series-b
流形空间获十亿融资,推出十分之一参数的机器人实时世界模型

机器人大模型公司 Manifold AI 流形空间完成新一轮数亿元融资,将 Pre-A 阶段的融资总额推高至近 10 亿元。投资方包括国新基金、淡马锡旗下毅峰资本、北汽产投和芯能创投。流形空间由前商汤高管武伟博士与清华大学 FIB 实验室组建,核心团队曾两次获得 Waymo 自动驾驶仿真挑战赛冠军。

自研的实时世界模型 WorldScape 作为机器人预训练基模,支持移动与操作双重交互。WorldScape 采用混合专家(MoE)架构,在评测榜单 WorldScore 中以主流竞品 10% 的参数量保持榜首近两个月。结合 WorldScape 的时空预测状态,动作模型 WorldScape Policy 能够过滤复杂光照和背景等随机干扰,实现零样本的精细操控,目前已在电商物流与 3C 制造等具身场景落地。

为了检验大模型在真实具身任务中的决策能力,流形空间联合数十家科研单位推出了评测基准 WorldArena。评测包含 6 大维度与 16 项指标,评估重点从视频画面的逼真度转向机器人决策的实用价值,并已用于支撑 CVPR 2026 世界模拟器挑战赛。

信源:https://mp.weixin.qq.com/s/VuZSGj0Y83KTnFW8HfJ8Uw
1
Midjourney跨界医疗大健康:发布「超声CT」硬件扫描仪并计划开设高端水疗中心

AI 生图公司 Midjourney 发布首款健康硬件 Scanner,正式跨界医疗大健康。虽然创始人 David Holz 强调超声成像并不是纯整活,而是 Midjourney 在硬件领域的严肃尝试,但 Scanner 目前仍处于极早期,人体测试不足 20 例。

用户需要赤身站上水浸平台并没入水中,在 60 秒内完成无辐射的全身 3D 扫描。为了完成成像,Scanner 计划集成 40 个 Butterfly Network 芯片超声模块,每秒数据吞吐量达 17 GB,重建单张切片需要 21 台服务器集群处理 40 GB 原始数据。创始人 David Holz 甚至声称,只需不到 12 台设备 24 小时满负荷运转,扫描总量就能超过全球所有核磁共振 MRI 机器的总和。Midjourney 计划 2027 年底在旧金山开设面积 2.5 万平方英尺的温泉水疗中心 Midjourney Spa,正式部署设备。

但超声技术本身很难用于全身临床诊断。超声波的物理限制决定了声波无法穿透骨骼和空气,三维成像分辨率在临床上很难与核磁共振 MRI 相比。由于没有取得 FDA 医疗器械审批,Midjourney 在官方博客中已将定位退回到提供身体成分图的「消费健康」服务。开设温泉水疗中心更像是绕过严苛临床审批的商业策略,以休闲养生的名义直接面向消费者运营。

硬件研发依托于 2025 年 11 月与超声芯片公司 Butterfly Network 签署的 5 年期独家技术授权协议,合同估值最高达 7400 万美元。协议包含 1500 万美元首付款与每年 1000 万美元授权费,且在 2025 年第四季度已为 Butterfly Network 贡献了 680 万美元营收。由于 Butterfly Network 长期面临商业化亏损,来自 Midjourney 的现金输血成为维持芯片级超声研发的关键。

信源:https://www.midjourney.com/medical/blogpost
DeepSeek研究员陈德里开源Deli AutoResearch:AI已能自主做285B大模型实验并写论文

DeepSeek 资深研究员陈德里开源了个人项目 Deli AutoResearch SKILL,并发布了由智能体完全自主撰写的第四篇综述论文。项目以单一的 SKILL.md 协议文件形态呈现,本身不含可执行代码。协议通过规约长周期任务中的状态持久化、防死循环(Anti-Loop)与心跳守护进程(Heartbeat Watchdog),指导 AI 智能体调用子智能体(Subagent)与多角色模拟机制,实现科研全流程的全自动协作。

同时发表的自我博弈综述论文展示了智能体在实验阶段的突破:在零人类干预下,智能体首次自主规划了 GPU 实验,并在 285B 参数量的 DeepSeek 模型上运行强化学习(RL)训练任务。智能体完成了从实验设计、编写代码,到运行调试和总结结论的完整研究闭环,并在模拟同行评审中跑出了 8.6/10 的高分。

此前,陈德里已利用同样的方法自主产出过三篇学术综述。首篇关于自主科研智能体的论文经历了约 60 轮智能体迭代,总耗时约 10 小时,实现了从 V1 到 V5 的迭代演进。整套工作流不仅降低了长周期研究的人为操作成本,也验证了 AI 原生研究路径的可行性。

信源:https://x.com/victor207755822/status/2067259098584985954
OpenAI正式加入Rust基金会成为白金会员,并追加注资60万美元支持生态建设

OpenAI 宣布正式以白金会员身份加入 Rust 语言非营利托管组织 Rust 基金会(Rust Foundation),并承诺通过基金会投入总计 60 万美元的资金。这笔资金将结合白金会员年费,重点支持 Rust 项目目标(Rust Project Goals)、Rust 创新实验室(Rust Innovation Lab),以及直接资助 Rust 生态中被广泛依赖的开源项目维护者。

作为合作的一部分,OpenAI 技术成员、Rust 社区资深成员兼版本兼容性检查工具 cargo-semver-checks 的维护者 Predrag Gruevski 将代表 OpenAI 加入 Rust 基金会董事会。Gruevski 表示,Rust 能够协助开发团队快速构建底层系统,且无需在性能、安全、可靠性之间进行妥协。OpenAI 将与 Rust 项目的资助团队(Funding Team)合作,探索最有效的资金分发路径。

在宣布加入基金会的前两天,OpenAI 已通过 GitHub Sponsors 启动了超过 16 万美元的直接赞助,重点面向 Astral 与 Codex 工具链所依赖的开源项目维护者。赞助对象覆盖原 Astral OSS 基金支持的所有项目,并在过渡至 OpenAI 赞助账号后扩大了资金规模。OpenAI 一直将 Rust 视为系统编程的未来,并计划后续推出更多支持举措。

信源:https://x.com/charliermarsh/status/2067280638994968657
摩根大通禁止香港员工访问Anthropic,继高盛后收紧合规防线

据英国《金融时报》引述知情人士消息,摩根大通已停止香港分行员工访问 Anthropic 开发的 AI 模型。报道指出,香港分行员工目前已无法从行内获批的大语言模型下拉列表中选择 Claude 模型。这是继高盛集团在今年早些时候采取类似举措后,又一家华尔街机构在香港限制使用 Claude 模型。

知情人士指出,摩根大通决定禁用 Claude 模型,主要基于许可协议中 Anthropic 使用条款的限制性描述。此前,高盛也对 Anthropic 服务条款进行了严格解读。服务条款明确将大中华区(包含香港)排除在服务范围之外。

美国 AI 公司对大中华区实施使用限制,部分原因在于防范「蒸馏」风险,即中国本土团队通过高频调用前沿模型来训练自主大模型。目前,ChatGPT 和 Claude 等西方先进模型均无法直接在香港访问。跨国企业通常通过签署全球合同并在境外托管算力来规避地理限制。但华尔街银行的限制举措表明,地缘政治冲突导致的条款壁垒正传导至跨国金融机构。由于全球金融业已广泛将前沿 AI 模型用于编码等核心业务,限制员工访问可能对香港作为国际金融中心的竞争力带来负面影响。

信源:https://www.ft.com/content/de83d303-6a03-456b-bfb9-7b11dd502ab3?syn-25a6b1a6=1
AI形式化验证公司Pramaana Labs获2700万美元种子轮融资,引入LEAN数学证明解决幻觉

致力于将数学形式化验证引入 AI 的初创公司 Pramaana Labs 宣布完成 2700 万美元种子轮融资。本轮融资由 Khosla Ventures 领投,Accel、BoldCap、Nexus Venture Partners、Premji Invest 及 Unbound 参投。资金将用于为法律、药物研发、税务申报等高敏感且对错误零容忍的行业,构建确定性验证层。

Pramaana Labs 的系统底层仍运行传统的 LLM,以保持处理复杂问题与自然语言的灵活性,但其核心创新在于在 LLM 之上构建了一层确定性验证机制。该机制借鉴了用于验证数学定理的开源 LEAN 编程语言,将具体领域的行业规则代码化。

为了针对不同垂直行业构建 LEAN 风格的形式化验证系统,Pramaana 邀请了大量领域专家进行监督与背书。在税务领域,公司正与前美国国税局(IRS)局长 Danny Werfel 展开合作;在网络安全和药物研发系统方面,则由来自印度理工学院(IIT)德里与马德拉斯分校以及加州大学伯克利分校的教授团队主导。

信源:https://techcrunch.com/2026/06/17/pramaana-labs-raises-27-million-seed-round-from-khosla-ventures-to-bring-formal-verification-to-ai/
Vercel开源智能体框架eve,主打开发运行一体化与生产化就绪

Vercel 正式开源了 AI 智能体框架 eve,主打开发、运行与生产部署一体化。类比于 Next.js 对 Web 开发的规范化,eve 采用文件驱动架构,允许通过在特定目录放置 agent.ts`(配置模型)、`instructions.md`(系统提示词)和 `tools/ 等文件,自动构建并部署智能体,以破除传统开发中手动拼接底层管道的痛点。

在运行与安全层面,eve 基于开源 Workflow SDK 实现了「耐用执行(Durable Execution)」,在会话每一步进行检查点备份,确保智能体在遭遇服务崩溃或重新部署时能原地恢复运行。同时,智能体代码的执行被置于独立的隔离沙箱(Vercel Sandbox)中,支持对高风险操作配置人机协同审批,并可通过声明文件直接连接模型上下文协议(MCP)服务器。

Vercel 内部目前已在生产环境中运行着 100 多个基于 eve 构建的智能体,最活跃的数据分析智能体 d0 在 Slack 中月均处理超 3 万次提问。目前 eve 已经在 GitHub 上开源,开发者可通过 npx eve@latest init <name> 快速初始化项目,并在本地通过终端界面进行可视化调试。

信源:https://vercel.com/blog/introducing-eve
Frontier碳移除联盟获9.15亿美元增资,Anthropic作为新成员加入

由多家科技巨头联合发起的碳移除采购联盟 Frontier 周三宣布,获得新增 9.15 亿美元的资金承诺,并将生成式 AI 独角兽 Anthropic 纳为新成员。这笔大额增资将联盟的总资金承诺提升至 18 亿美元。Frontier 旨在通过预先承诺购买碳移除额度,来降低初创项目的商业化风险,推动项目加速实现规模化。

这笔新资金将重点投向海洋碱度提升(ocean alkalinity enhancement)、生物质碳移除(biomass-based removal)、增强岩石风化(enhanced rock weathering)以及直接空气捕集(direct air capture)等四项前沿碳移除技术。Frontier 计划通过为期 8 至 10 年的承购合同(offtake contracts,最长可延伸至 2040 年),在相关领域进行 10 到 15 次重点押注。尽管相关技术均带有不同程度的成本和技术风险,但联盟认为它们共同具备达到吉吨级(gigaton scale)碳移除的潜力。

Frontier 成立于 2022 年,最初由 Stripe、谷歌(Google)、Meta、Shopify 等企业联合发起,Salesforce 等也是联盟现有成员。

信源:https://www.reuters.com/sustainability/cop/big-tech-backed-coalition-carbon-removal-increases-funding-by-915-million-adds-2026-06-17/
DeepSeek上线识图模式,基于撤回的原语框架支持视觉CoT推理

DeepSeek 网页端和 App 端正式上线识图模式 (Vision Mode),在对话输入框上方与快速模式、专家模式并列提供。新上线的视觉理解能力并非简单的文字识别 (OCR),而是主打深度场景分析、空间逻辑推理以及将 UI 界面截图直接转化为 HTML 结构化代码。对于高难度的几何推导或复杂图表分析,系统会自动激活深度思考模型,提供完整的推理链条。

识图模式底层基于 DeepSeek 团队公布的「以视觉原语思考 (Thinking with Visual Primitives)」研究框架。多模态研究员 Xiaokang Chen 与北京大学、清华大学联合发表的论文指出,现有视觉语言模型在精细定位和空间推理中存在「指称缺陷」 (Reference Gap),即难以用模糊的自然语言描述复杂的视觉坐标。为此,研究团队将坐标点与边界框 (Bounding Boxes) 提升为最小思维单位,在模型进行视觉推理的思维链 (CoT) 中直接插入空间原语,实现了在思考过程中同步进行空间指向。

作为视觉能力基础的学术论文与开源项目曾于 4 月 30 日短暂放出,但随即被 DeepSeek 官方于 5 月 1 日无预警撤回,引发了行业关于技术细节过度泄露以及模型后续优化的诸多猜测。正式上线的识图模式仅支持图像输入,暂不支持视频、音频等多模态格式,且模型目前不具备图像生成能力。

信源:https://x.com/PKUCXK/status/2067460570958426452
1
动察Beating AI News
里约自研大模型被揭套壳,直接线性合并中国开源项目权重 巴西里约市政府开源的 397B 大模型被开源社区揭露为直接套壳的合并产物。 巴西里约市政府所谓的 397B 自研大模型,已被当场抓包是零后期训练的线性权重缝合版。 所谓的自研模型 Rio-3.5-Open-397B 权重文件并未经过宣传的后训练,而是直接将 Nex-AGI 团队的开源模型 Nex N2 Pro 与阿里 Qwen 3.5 按照 6 比 4 的权重比例进行线性合并的结果。 被套壳的开源模型 Nex N2 Pro 由开源 AI 联盟 Nex…
里约大模型套壳丑闻后续:官方辩称模型丢失被迫重训,被指借AI项目侵吞公款

巴西里约热内卢市政府旗下 IT 公司 IplanRIO 日前发表官方声明,回应先前模型被指套壳中国开源项目 Nex-N2 Pro 和阿里 Qwen 3.5 的争议。官方在致歉的同时给出了一个离奇辩解,称用于发布的最终模型权重文件已经丢失,被迫重新排期训练。官方的回应未能平息舆论,反而引发了项目涉嫌利用 AI 概念侵吞公款的强烈质疑。

IplanRIO 在声明中承认,Rio-3.5-Open-397B 并非宣传中自研且从头训练的基座模型,而是基于已有开源模型进行微调与合并的产物,并为先前未在文档中致谢 Nex-AGI 团队致歉。对于上传的实际权重为何是 Nex 与 Qwen 线性合并的「缝合版」,官方解释称由于「操作失误」上传了用于对比的中间基线版本,而非经过蒸馏和后训练的最终版。但官方随即表示,团队曾尝试恢复最终模型但未能成功,必须在重新训练和外部验证后才能重新发布。目前,Rio-3.5-Open-397B 在 Hugging Face 上的页面已全部下架清空。

里约市政府先前为大模型项目拨付了 50 万雷亚尔(约合 10 万美元)的训练经费,但最终交差的却是一个零训练的缝合权重,甚至连所谓的「最终版权重」也查无实据。事件本质是极其拙劣的套取经费骗局:拿了公款却只用开源权重缝合交差,被当场抓包后用「文件丢失」掩盖,最后再用「重新训练」画饼糊弄。

信源:https://x.com/IplanRio_rj/status/2066693494769348946
「科学语法」大模型LOGOS开源:以纯序列打通多领域AI4S建模

阿里巴巴旗下 ATH-Token Foundry 联合中国人民大学高瓴人工智能学院,开源了多领域科学生成大模型 LOGOS。不同于针对结构预测、分子生成分立训练专家模型,LOGOS 首次在 LLM 架构内实现了蛋白质、小分子、材料和化学反应的原生统一建模与生成。

核心突破在于将三维空间接触模式编码为 Token 序列。LOGOS 无需输入 3D 坐标即可捕捉空间互作,消除了预训练与下游任务的偏差。预训练语料库达 448.7 亿 tokens,完整覆盖蛋白质、小分子、化学反应等 7 类科学模态。

在六大任务评测中,1B 参数量的 LOGOS-1B 仅以 1/56 的参数规模,在多项任务上超越 56B 参数量的 NatureLM。在 AI 制药关键的口袋配体生成中,LOGOS 首次以纯序列范式击败了依赖 3D 坐标的扩散模型;在逆合成预测中取得 74.8% 的 Top-1 准确率。目前,LOGOS 已完整开源模型权重、推理代码与学术论文。

信源:https://mp.weixin.qq.com/s/50q5uY849FKnBzk1Q04MRg
OpenAI推出生物基准LifeSciBench,GPT-Rosalind通过率仅36%

OpenAI 联合 173 名生物技术与制药研发领域的博士级科学家,推出全新的评测基准 LifeSciBench,用以衡量并改善 AI 对真实世界生命科学研究的支持能力。相较于侧重窄领域知识记忆或单步回答的传统评测,LifeSciBench 聚焦于科研工作流中的多步推理与不确定性决策。

整个评测包含 750 个专家撰写任务并经过 453 名同行评议人验证,覆盖证据处理、数据分析、设计与优化、科学推理、验证与操作、转化、科学传播 7 个工作流。为了模拟真实科研协作,LifeSciBench 引入了序列文件、图表、分子结构、PDF 论文等 1,062 个科学制品。有 53% 的任务包含这些制品,79% 的任务需要多步推理(平均约 4 步)。评测最终通过专家制定的 19,020 条细粒度标准进行打分。

首批评测结果显示,现有的前沿大模型在应对真实生命科学研究时仍面临极高门槛。OpenAI 专为生物医药研发设计的推理模型 GPT-Rosalind(今年 4 月开启预览)取得了最佳成绩,但也仅实现了 36.1% 的任务通过率(标准化得分 0.576)。在需要处理复杂制品的任务中,GPT-Rosalind 的通过率进一步降至 28.1%。目前,有 171 个任务(占比 22.8%)在所有被测模型中通过率均为 0%,属于当前全行业大模型均无法攻克的绝对死角。

信源:https://openai.com/index/introducing-life-sci-bench/
1
算力租赁服务商Baseten拟敲定15亿美元融资,双层估值冲上130亿美元

AI 推理服务商 Baseten 正在敲定新一轮 15 亿美元融资。相比三个月前谈判中拟以 110 亿美元估值融资 10 亿美元的方案,最终确定的融资规模扩大了 5 亿美元。估值也调整为双层结构,部分投资者按 110 亿美元估值认购,另一部分按 130 亿美元估值跟投。本轮由 Altimeter Capital、Conviction、Spark Capital、Sands Capital 与 Wellington Management 联合领投,这也是 Wellington Management 首次投资 AI 推理赛道。

Baseten 在 20 家云服务商的算力之上搭建软件层,帮助企业微调和运行开源模型,当前客户包括编程助手 Cursor、Mercor 和 OpenEvidence。随着 DeepSeek、Kimi 以及英伟达 Nemotron 等开源模型性能直逼闭源前沿模型,企业开始转向混合架构以控制成本。Baseten 首席执行官 Tuhin Srivastava 表示,在特定任务中改用开源模型,成本仅为闭源模型的 30%。

开源模型爆发拉动了对底层算力的强劲需求,Baseten 营收也随之暴增。截至 2026 年第一季度末,年化经常性收入已从季度初的 2 亿美元增长至 6 亿美元,比去年同期翻了 20 倍。不过,Baseten 依靠向云巨头租用 GPU 再转售,面临毛利率被挤压的风险。即便面临利润隐忧,通常表现谨慎的机构投资人 Wellington Management 依然入局,完成了在 AI 推理市场的首笔投资,被业内视为算力中介赛道具备持久生命力的信号。

信源:https://www.wsj.com/tech/ai/the-13-billion-ai-startup-betting-on-cheaper-alternatives-to-openai-anthropic-b9679603
「干净代码」与逐行审查已死,Ramp主管宣告AI终结传统软件开发

Ramp 应用 AI 主管 Rahul Gupta 指出,下一代大模型正将编程转变为「自然语言到代码的解释器」,传统软件开发逻辑正面临根本性颠覆。Gupta 警告,随着即将推出的 Anthropic Fable 等模型在代码正确率上跨越问题与输出的复杂度,死守「干净代码」与低风险区域的人工逐行审查已无必要,逐行审查应仅保留给涉及安全与资金的高风险核心模块,软件开发的重点必须转向系统性的实证验证与主动拥抱技术债务。

在新的开发范式下,AI 极大地降低了重构成本,合理的抽象与完美架构正变得不再重要。开发团队可以接受增加 50% 冗余代码来换取 5% 的性能提升,将累积的技术债务直接留给后续更智能的模型去维护。Gupta 指出,软件交付的瓶颈已全面转移到「评审与合并」环节。对于低风险模块,应当像对待神经网络一样直接视作「黑盒」,通过隔离沙箱并完全切断对数据库与网络的外部出站访问权限,在 CI 流程中进行成千上万次真实输入的实证检验,来替代低效的手工逐行逻辑验证。

Claude Code 之父 Boris Cherny 对 Gupta 的颠覆性言论表示强烈赞同,并补充称,既然模型已经能够正确生成绝大部分任务代码,人类的核心工作转变为大模型与验证器设计闭环运行的安全防护网,不断消除工程流程中的各种系统瓶颈。

信源:https://x.com/rahulgs/status/2067257255825686880
1
米哈游原国际化总裁金雯怡加盟月之暗面,全面负责Kimi业务线商业化

米哈游原国际化总裁金雯怡加入国内大模型初创公司月之暗面(Moonshot AI),全面负责旗下核心产品 Kimi 智能助手的业务线。

金雯怡于 2017 年加入米哈游,从零搭建海外发行、本地化运营以及海外社群体系。在职期间,主导建立海外独立品牌 HoYoverse,推动《崩坏 3》覆盖 200 多个国家与地区。2020 年《原神》全球上线首月斩获 2.45 亿美元,登顶全球手游收入榜,随后的《崩坏:星穹铁道》与《绝区零》也成功落地海外。多款核心游戏的海外推广,推动米哈游从本土二次元厂商转型为全球化游戏 IP 公司。4 月底,金雯怡宣布离职,业务交接给前哔哩哔哩副总裁王宇阳。

月之暗面目前正处于从技术积累转向商业化落地的阶段。引入在出海与全球化运营领域有近 10 年经验的金雯怡,显示月之暗面正加速布局 Kimi 商业化与海外市场拓展。

信源:https://mp.weixin.qq.com/s/2egr6sCg1mek4nsaJYjBeA
1
钉钉新CEO陈宇森发布首封全员信,启动向Agent友好的「双引擎」AI改造

钉钉新任 CEO 陈宇森(落款为「宇森 悟空事业部 CEO」)上任一周后发布首封内部信,对悟空事业部进行全面组织调整。陈宇森将钉钉和「悟空」两个产品定位为「双引擎」,提出要对过去已有的业务全面做好 AI 化改造,使其成为未来 Agent 友好的基础设施。

在组织架构调整中,主要变动包括:
1. 核心平台业务部:由朱鸿(此前为钉钉 CTO,2025 年随前 CEO 无招一同回归阿里)负责,向陈宇森汇报,核心负责钉钉等业务。
2. 悟空团队:整合悟空与 AI Agent 平台 MuleRun,由束骏亮(前 MuleRun CTO、蜚语安全创始人,2025 年与陈宇森等联合创立 MuleRun)负责,向陈宇森汇报。
3. 市场部:由李昕瑜(前 MuleRun CMO)负责,向陈宇森汇报,统筹悟空的商业化运营。
4. 客户发展部:由杨猛(工号 598 号的老阿里人,原钉钉全球商业总裁)负责,整合直销、电销、服务商、交付等团队。
5. 公司信息技术部:新成立部门,由邓悟负责,旨在优化迭代业务系统,让一切系统易于被 Agent 使用。
此外,去年推出的 AI 硬件与 AI 听记等 AI 原生产品予以保留,AI 硬件部门由任卿负责,后续将增强投入并推进国际化。

业务进展方面,悟空与 MuleRun 的整合是陈宇森出任 CEO 时的定调。据悉,MuleRun 自今年 5 月中旬正式商业化,一个月内 ARR(年度经常性收入)已突破 3 亿元人民币。管理作息上,陈宇森对作息进行了松绑,由各业务线自主决定下班时间,不再开设晚会,没有硬性加班要求,不少员工本周已开始休假。

信源:https://mp.weixin.qq.com/s/2IsF4C682LPWPMHJ64NR_w
Manus年化营收暴增至5亿美元,早期中资机构正筹资20亿美元从Meta赎回

据《The Information》报道,受中国监管机构责令逆转交易的影响,AI 智能体初创公司 Manus 的早期中资背景投资人计划以 Meta 收购时的 20 亿美元原价,从 Meta Platforms 手中赎回该公司。尽管该逆转令在创业圈引发对海外并购和融资通路受阻的担忧,但对早期投资者而言却是一个意外之喜:由于自去年 12 月被 Meta 收购以来,Manus 的订阅收入录得爆发式增长,其年化经常性收入(ARR)已从收购前的 1 亿美元飙升至最近几周的 4 亿至 5 亿美元。这意味着投资者将以极具性价比的「折扣价」拿回一家更具估值想象力的公司。

今年 4 月,在经历数月调查后,中国政府因 Manus 交易未提前申报且担忧将 AI 核心技术及人才转移给地缘政治对手而责令取消该交易。目前,Meta 已在内部将 Manus 的业务进行隔离,并停止了数据共享。在资金安排上,红杉中国(HSG)、真格基金(ZhenFund)和腾讯将参与赎回,且计划动用新资金(fresh capital)买回 Meta 的股份,而不要求 LP 退回已分发的收益。由于地缘和监管限制,曾领投 7500 万美元的美国顶级风投 Benchmark 将彻底退出此次赎回,其原持有的份额或将被中资机构瓜分。

为了适应新的监管环境并保留投资人利益,Manus 正在考虑重整公司架构,将其转变为一家在中国境内注册的合资公司(JV)。这一举措不仅允许投资者以美元形式继续持有股份,还旨在为未来申请在香港进行首次公开募股(IPO)铺平道路。随着监管机构对科技企业使用红筹或 VIE 架构绕过境内审查的容忍度持续走低,此番境内注册架构调整被视为 Manus 获得中国监管机构批准其香港 IPO 的关键合规步骤。

信源:https://www.theinformation.com/articles/manus-revenue-soars-original-investors-move-reverse-meta-deal