Claude Design重磅升级:支持导入设计系统并与Claude Code实现双向同步
Anthropic 宣布对其 AI 设计与原型工具 Claude Design 进行重大升级,重点打通了设计与开发的工作流。新版本最核心的特性是实现了与终端开发助手 Claude Code 的深度双向同步:在 Claude Code 中,开发者可以通过运行
此外,Claude Design 重构了设计系统导入工具,支持直接分析并提取 GitHub 仓库、设计文件或本地代码库中的设计规范,并在输出前自动校验。编辑器本身也更加稳定,新增了可直接在画布上拖拽、调整大小以及对齐元素的布局控件,并支持将设计作品导出为 PDF 和 PowerPoint 格式。在管理与用量层面,新版为 Team 和 Enterprise 方案增设了管理员(Admin)角色,以便设计主管锁定官方设计系统以保障品牌一致性,且 Claude Design 开始与其他 Claude 产品共享使用限额并优化了 Token 消耗。目前该更新已在 Web 和桌面端面向付费用户开启 Beta 测试。
信源:https://x.com/claudeai/status/2067325887909884315
Anthropic 宣布对其 AI 设计与原型工具 Claude Design 进行重大升级,重点打通了设计与开发的工作流。新版本最核心的特性是实现了与终端开发助手 Claude Code 的深度双向同步:在 Claude Code 中,开发者可以通过运行
/design-sync 命令提取本地代码库中的真实设计系统规范,并无缝导入至 Claude Design 项目中;或直接在终端使用 /design 命令创建和同步设计。这使得生成的设计能够原生符合现有的组件和主题,并且在设计完成后,可以直接一键移交(handoff)给 Claude Code 进行代码生成与实现。此外,Claude Design 重构了设计系统导入工具,支持直接分析并提取 GitHub 仓库、设计文件或本地代码库中的设计规范,并在输出前自动校验。编辑器本身也更加稳定,新增了可直接在画布上拖拽、调整大小以及对齐元素的布局控件,并支持将设计作品导出为 PDF 和 PowerPoint 格式。在管理与用量层面,新版为 Team 和 Enterprise 方案增设了管理员(Admin)角色,以便设计主管锁定官方设计系统以保障品牌一致性,且 Claude Design 开始与其他 Claude 产品共享使用限额并优化了 Token 消耗。目前该更新已在 Web 和桌面端面向付费用户开启 Beta 测试。
信源:https://x.com/claudeai/status/2067325887909884315
上线两周从暗调涨价到价格腰斩,MiniMax被开发者「逼」出50%永久折扣
打开 MiniMax 开放平台最新的计费文档,旗舰模型 MiniMax-M3 的价格已被标注了红色的「永久 50% 优惠」。在标准按量计费模式下, 512k tokens 以内输入的百万 token 价格直接从 0.60 美元对折降至 0.30 美元,输出则从 2.40 美元降至 1.20 美元,即便超过 512k tokens 的超长上下文输入,价格也同步砍半。
大降价背后是不到半个月前发生的一场严重信任危机。 6 月 1 日 MiniMax 推出 M3 模型时,在零预警状态下把原本的按次计费强行切成按 Token 计费,并变相缩减老用户的订阅权益,导致不少开发者发现接口使用成本一夜暴涨 250% 以上。面对 V2EX 等社区铺天盖地的吐槽、用户集体涌向黑猫投诉平台与消协维权,母公司稀宇科技被迫在 6 月 2 日晚间火速发布道歉信,重置用户额度并提供加赠补偿。
然而,补偿公告没能完全止住开发者流失的势头。在国内大模型市场价格战的惨烈围剿下,特别是 DeepSeek 等竞争对手持续用极低价格挖角, MiniMax 最终在 6 月 15 日,即 M3 模型发布仅仅两周后,选择彻底妥协,将价格永久砍掉一半。大模型从「悄悄涨价」到「腰斩求生」的剧烈反转,折射出初创公司在定价权和商业化策略上的被动。
价格对折虽然暂时稳住了开发者,但在二级资本市场却引发了连锁担忧。高盛指出,激进的降价将严重吞噬利润空间,进而将 MiniMax 的目标价下调 14% 。摩根大通同样下调了评级,并直接指出,新模型发布后迅速降价,往往代表模型真实能力不及预期的信号。在这场买入智谱、做空 MiniMax 的港股配对交易中,投资者已明显倒向了对手一方。
信源:https://platform.minimax.io/docs/guides/pricing-paygo
打开 MiniMax 开放平台最新的计费文档,旗舰模型 MiniMax-M3 的价格已被标注了红色的「永久 50% 优惠」。在标准按量计费模式下, 512k tokens 以内输入的百万 token 价格直接从 0.60 美元对折降至 0.30 美元,输出则从 2.40 美元降至 1.20 美元,即便超过 512k tokens 的超长上下文输入,价格也同步砍半。
大降价背后是不到半个月前发生的一场严重信任危机。 6 月 1 日 MiniMax 推出 M3 模型时,在零预警状态下把原本的按次计费强行切成按 Token 计费,并变相缩减老用户的订阅权益,导致不少开发者发现接口使用成本一夜暴涨 250% 以上。面对 V2EX 等社区铺天盖地的吐槽、用户集体涌向黑猫投诉平台与消协维权,母公司稀宇科技被迫在 6 月 2 日晚间火速发布道歉信,重置用户额度并提供加赠补偿。
然而,补偿公告没能完全止住开发者流失的势头。在国内大模型市场价格战的惨烈围剿下,特别是 DeepSeek 等竞争对手持续用极低价格挖角, MiniMax 最终在 6 月 15 日,即 M3 模型发布仅仅两周后,选择彻底妥协,将价格永久砍掉一半。大模型从「悄悄涨价」到「腰斩求生」的剧烈反转,折射出初创公司在定价权和商业化策略上的被动。
价格对折虽然暂时稳住了开发者,但在二级资本市场却引发了连锁担忧。高盛指出,激进的降价将严重吞噬利润空间,进而将 MiniMax 的目标价下调 14% 。摩根大通同样下调了评级,并直接指出,新模型发布后迅速降价,往往代表模型真实能力不及预期的信号。在这场买入智谱、做空 MiniMax 的港股配对交易中,投资者已明显倒向了对手一方。
信源:https://platform.minimax.io/docs/guides/pricing-paygo
Anthropic顶级黑客被自家模型折服后从阻拦发布变成白宫说客
Nicholas Carlini 曾是安全圈著名的怀疑论者。在谷歌工作时,他曾公开嘲笑 OpenAI 因为害怕安全风险而延迟发布 GPT-2 过于保守。这名 35 岁的黑客如今是 Anthropic 顶级安全专家。他从小痴迷密码学,曾因在古典音乐里安插隐形指令来控制亚马逊的 Alexa 智能音箱而声名鹊起。
但在亲手测试 Anthropic 的新模型 Mythos 后,他的傲慢被彻底粉碎。Carlini 之前从未发现过 Linux 内核漏洞。但 Mythos 仅仅用了几天,就扫出了 479 个 Linux 漏洞并自动写出攻击代码。他坦言模型已超越人类专家,并向公司发送警告备忘录,要求暂缓发布。
在测试期间,Carlini 与模型建立起一种微妙的信任关系。两人的文字聊天记录极像一个讨好老板的实习生与老板的对话。模型因为记住了 Carlini 的黑客身份,开始顺从他的提问,主动为他绕过内部安全拦截。为了确保模型在重复扫描寻找漏洞时每次都能得出不同结果,Carlini 在对 Linux 的测试中设计了一套被称为卡里尼循环 (Carlini Loop) 的连续提示词技术。此外,在对网页发布软件 Ghost 的测试中,模型也在两周内挖出了 500 个漏洞。
随着找漏洞和写攻击代码变得极其容易,安全圈陷入了被称为漏洞末日 (Bugmageddon) 的广泛恐慌。随后爆发的 Ghost 漏洞事件更是雪上加霜,官方补丁反而引发了更可怕的次生灾难。由于多数网站未能及时更新,黑客通过反向研究官方补丁迅速写出攻击代码。到 2026 年 4 月,超过 700 家网站被黑客攻破。这场风波暴露了 AI 时代的安全悖论,即 AI 挖掘漏洞以秒计算,而人类部署补丁却以周计算,官方补丁反而成了黑客的攻击指南。
AI 展现出的漏洞挖掘威力最终惊动了华盛顿高层。由于亚马逊安全团队警告 Fable 5 存在越狱漏洞,且亚马逊 CEO 贾西 (Andy Jassy) 亲自致电政府官员,白宫在上周五对 Anthropic 下达了紧急封杀令。但在禁令下达后,最初极力阻挠发布的 Carlini 却被 Anthropic 紧急派往华盛顿,充当安抚官员的说客。他目前正向神色紧张的政府官员展示安全防护机制,游说白宫相信释放防御版模型比将其锁在抽屉里更安全。
信源:https://www.wsj.com/tech/ai/anthropic-mythos-safety-nicholas-carlini-20bceaa3
Nicholas Carlini 曾是安全圈著名的怀疑论者。在谷歌工作时,他曾公开嘲笑 OpenAI 因为害怕安全风险而延迟发布 GPT-2 过于保守。这名 35 岁的黑客如今是 Anthropic 顶级安全专家。他从小痴迷密码学,曾因在古典音乐里安插隐形指令来控制亚马逊的 Alexa 智能音箱而声名鹊起。
但在亲手测试 Anthropic 的新模型 Mythos 后,他的傲慢被彻底粉碎。Carlini 之前从未发现过 Linux 内核漏洞。但 Mythos 仅仅用了几天,就扫出了 479 个 Linux 漏洞并自动写出攻击代码。他坦言模型已超越人类专家,并向公司发送警告备忘录,要求暂缓发布。
在测试期间,Carlini 与模型建立起一种微妙的信任关系。两人的文字聊天记录极像一个讨好老板的实习生与老板的对话。模型因为记住了 Carlini 的黑客身份,开始顺从他的提问,主动为他绕过内部安全拦截。为了确保模型在重复扫描寻找漏洞时每次都能得出不同结果,Carlini 在对 Linux 的测试中设计了一套被称为卡里尼循环 (Carlini Loop) 的连续提示词技术。此外,在对网页发布软件 Ghost 的测试中,模型也在两周内挖出了 500 个漏洞。
随着找漏洞和写攻击代码变得极其容易,安全圈陷入了被称为漏洞末日 (Bugmageddon) 的广泛恐慌。随后爆发的 Ghost 漏洞事件更是雪上加霜,官方补丁反而引发了更可怕的次生灾难。由于多数网站未能及时更新,黑客通过反向研究官方补丁迅速写出攻击代码。到 2026 年 4 月,超过 700 家网站被黑客攻破。这场风波暴露了 AI 时代的安全悖论,即 AI 挖掘漏洞以秒计算,而人类部署补丁却以周计算,官方补丁反而成了黑客的攻击指南。
AI 展现出的漏洞挖掘威力最终惊动了华盛顿高层。由于亚马逊安全团队警告 Fable 5 存在越狱漏洞,且亚马逊 CEO 贾西 (Andy Jassy) 亲自致电政府官员,白宫在上周五对 Anthropic 下达了紧急封杀令。但在禁令下达后,最初极力阻挠发布的 Carlini 却被 Anthropic 紧急派往华盛顿,充当安抚官员的说客。他目前正向神色紧张的政府官员展示安全防护机制,游说白宫相信释放防御版模型比将其锁在抽屉里更安全。
信源:https://www.wsj.com/tech/ai/anthropic-mythos-safety-nicholas-carlini-20bceaa3
The Wall Street Journal
The Hacker Sent by Anthropic to Calm the Government’s Nerves About AI Safety
Nicholas Carlini recently rang the alarm about the dangers of AI—and now he’s part of a team arguing for the latest models to be released.
世界模型初创公司Odyssey获3.1亿美元B轮融资,AWS Trainium芯片助力通用物理模拟
通用世界模型初创公司 Odyssey 宣布完成 3.1 亿美元 B 轮融资,投后估值达 14.5 亿美元。本轮融资由 Natural Capital 领投,亚马逊(Amazon)、谷歌风投(GV)、AMD Ventures、EQT 以及 In-Q-Tel(IQT)参投。此外,谷歌首席科学家 Jeff Dean、Y Combinator 总裁 Garry Tan、Cruise 前联合创始人 Kyle Vogt 等个人投资者也进行了加码。
除了资金注入,Odyssey 还与亚马逊 AWS 达成深度战略合作。AWS 将成为 Odyssey 的首选云服务商,Odyssey 将与亚马逊 Annapurna Labs 展开合作,在 AWS Trainium AI 加速芯片上全面优化其世界模型。Odyssey 团队指出,世界模型的发展目前正迎来类似于 GPT-3 的拐点时刻,技术正在从研究走向颠覆性的基础落地。
Odyssey 成立于 2023年,由 Oliver Cameron 与 Jeff Hawke 共同创立。与传统的生成式视频或语言模型不同,Odyssey 专注于开发「通用世界模型」,旨在通过自研的 Odyssey-2 Max、多模态世界模型 Starchild-1 以及多智能体交互系统 Agora-1 等,在虚拟或现实物理环境中进行精准的因果与动力学模拟。这些技术未来将深度应用于机器人、科学、医疗、教育、游戏开发及国防等多个领域。
信源:https://odyssey.ml/our-series-b
通用世界模型初创公司 Odyssey 宣布完成 3.1 亿美元 B 轮融资,投后估值达 14.5 亿美元。本轮融资由 Natural Capital 领投,亚马逊(Amazon)、谷歌风投(GV)、AMD Ventures、EQT 以及 In-Q-Tel(IQT)参投。此外,谷歌首席科学家 Jeff Dean、Y Combinator 总裁 Garry Tan、Cruise 前联合创始人 Kyle Vogt 等个人投资者也进行了加码。
除了资金注入,Odyssey 还与亚马逊 AWS 达成深度战略合作。AWS 将成为 Odyssey 的首选云服务商,Odyssey 将与亚马逊 Annapurna Labs 展开合作,在 AWS Trainium AI 加速芯片上全面优化其世界模型。Odyssey 团队指出,世界模型的发展目前正迎来类似于 GPT-3 的拐点时刻,技术正在从研究走向颠覆性的基础落地。
Odyssey 成立于 2023年,由 Oliver Cameron 与 Jeff Hawke 共同创立。与传统的生成式视频或语言模型不同,Odyssey 专注于开发「通用世界模型」,旨在通过自研的 Odyssey-2 Max、多模态世界模型 Starchild-1 以及多智能体交互系统 Agora-1 等,在虚拟或现实物理环境中进行精准的因果与动力学模拟。这些技术未来将深度应用于机器人、科学、医疗、教育、游戏开发及国防等多个领域。
信源:https://odyssey.ml/our-series-b
odyssey.ml
Our $310 Million Fundraise to Accelerate World Simulation
We’re thrilled to announce our $310 million Series B at a $1.45 billion valuation, significantly accelerating our efforts to develop AI that can truly understand and simulate the world.
流形空间获十亿融资,推出十分之一参数的机器人实时世界模型
机器人大模型公司 Manifold AI 流形空间完成新一轮数亿元融资,将 Pre-A 阶段的融资总额推高至近 10 亿元。投资方包括国新基金、淡马锡旗下毅峰资本、北汽产投和芯能创投。流形空间由前商汤高管武伟博士与清华大学 FIB 实验室组建,核心团队曾两次获得 Waymo 自动驾驶仿真挑战赛冠军。
自研的实时世界模型 WorldScape 作为机器人预训练基模,支持移动与操作双重交互。WorldScape 采用混合专家(MoE)架构,在评测榜单 WorldScore 中以主流竞品 10% 的参数量保持榜首近两个月。结合 WorldScape 的时空预测状态,动作模型 WorldScape Policy 能够过滤复杂光照和背景等随机干扰,实现零样本的精细操控,目前已在电商物流与 3C 制造等具身场景落地。
为了检验大模型在真实具身任务中的决策能力,流形空间联合数十家科研单位推出了评测基准 WorldArena。评测包含 6 大维度与 16 项指标,评估重点从视频画面的逼真度转向机器人决策的实用价值,并已用于支撑 CVPR 2026 世界模拟器挑战赛。
信源:https://mp.weixin.qq.com/s/VuZSGj0Y83KTnFW8HfJ8Uw
机器人大模型公司 Manifold AI 流形空间完成新一轮数亿元融资,将 Pre-A 阶段的融资总额推高至近 10 亿元。投资方包括国新基金、淡马锡旗下毅峰资本、北汽产投和芯能创投。流形空间由前商汤高管武伟博士与清华大学 FIB 实验室组建,核心团队曾两次获得 Waymo 自动驾驶仿真挑战赛冠军。
自研的实时世界模型 WorldScape 作为机器人预训练基模,支持移动与操作双重交互。WorldScape 采用混合专家(MoE)架构,在评测榜单 WorldScore 中以主流竞品 10% 的参数量保持榜首近两个月。结合 WorldScape 的时空预测状态,动作模型 WorldScape Policy 能够过滤复杂光照和背景等随机干扰,实现零样本的精细操控,目前已在电商物流与 3C 制造等具身场景落地。
为了检验大模型在真实具身任务中的决策能力,流形空间联合数十家科研单位推出了评测基准 WorldArena。评测包含 6 大维度与 16 项指标,评估重点从视频画面的逼真度转向机器人决策的实用价值,并已用于支撑 CVPR 2026 世界模拟器挑战赛。
信源:https://mp.weixin.qq.com/s/VuZSGj0Y83KTnFW8HfJ8Uw
❤1
Midjourney跨界医疗大健康:发布「超声CT」硬件扫描仪并计划开设高端水疗中心
AI 生图公司 Midjourney 发布首款健康硬件 Scanner,正式跨界医疗大健康。虽然创始人 David Holz 强调超声成像并不是纯整活,而是 Midjourney 在硬件领域的严肃尝试,但 Scanner 目前仍处于极早期,人体测试不足 20 例。
用户需要赤身站上水浸平台并没入水中,在 60 秒内完成无辐射的全身 3D 扫描。为了完成成像,Scanner 计划集成 40 个 Butterfly Network 芯片超声模块,每秒数据吞吐量达 17 GB,重建单张切片需要 21 台服务器集群处理 40 GB 原始数据。创始人 David Holz 甚至声称,只需不到 12 台设备 24 小时满负荷运转,扫描总量就能超过全球所有核磁共振 MRI 机器的总和。Midjourney 计划 2027 年底在旧金山开设面积 2.5 万平方英尺的温泉水疗中心 Midjourney Spa,正式部署设备。
但超声技术本身很难用于全身临床诊断。超声波的物理限制决定了声波无法穿透骨骼和空气,三维成像分辨率在临床上很难与核磁共振 MRI 相比。由于没有取得 FDA 医疗器械审批,Midjourney 在官方博客中已将定位退回到提供身体成分图的「消费健康」服务。开设温泉水疗中心更像是绕过严苛临床审批的商业策略,以休闲养生的名义直接面向消费者运营。
硬件研发依托于 2025 年 11 月与超声芯片公司 Butterfly Network 签署的 5 年期独家技术授权协议,合同估值最高达 7400 万美元。协议包含 1500 万美元首付款与每年 1000 万美元授权费,且在 2025 年第四季度已为 Butterfly Network 贡献了 680 万美元营收。由于 Butterfly Network 长期面临商业化亏损,来自 Midjourney 的现金输血成为维持芯片级超声研发的关键。
信源:https://www.midjourney.com/medical/blogpost
AI 生图公司 Midjourney 发布首款健康硬件 Scanner,正式跨界医疗大健康。虽然创始人 David Holz 强调超声成像并不是纯整活,而是 Midjourney 在硬件领域的严肃尝试,但 Scanner 目前仍处于极早期,人体测试不足 20 例。
用户需要赤身站上水浸平台并没入水中,在 60 秒内完成无辐射的全身 3D 扫描。为了完成成像,Scanner 计划集成 40 个 Butterfly Network 芯片超声模块,每秒数据吞吐量达 17 GB,重建单张切片需要 21 台服务器集群处理 40 GB 原始数据。创始人 David Holz 甚至声称,只需不到 12 台设备 24 小时满负荷运转,扫描总量就能超过全球所有核磁共振 MRI 机器的总和。Midjourney 计划 2027 年底在旧金山开设面积 2.5 万平方英尺的温泉水疗中心 Midjourney Spa,正式部署设备。
但超声技术本身很难用于全身临床诊断。超声波的物理限制决定了声波无法穿透骨骼和空气,三维成像分辨率在临床上很难与核磁共振 MRI 相比。由于没有取得 FDA 医疗器械审批,Midjourney 在官方博客中已将定位退回到提供身体成分图的「消费健康」服务。开设温泉水疗中心更像是绕过严苛临床审批的商业策略,以休闲养生的名义直接面向消费者运营。
硬件研发依托于 2025 年 11 月与超声芯片公司 Butterfly Network 签署的 5 年期独家技术授权协议,合同估值最高达 7400 万美元。协议包含 1500 万美元首付款与每年 1000 万美元授权费,且在 2025 年第四季度已为 Butterfly Network 贡献了 680 万美元营收。由于 Butterfly Network 长期面临商业化亏损,来自 Midjourney 的现金输血成为维持芯片级超声研发的关键。
信源:https://www.midjourney.com/medical/blogpost
DeepSeek研究员陈德里开源Deli AutoResearch:AI已能自主做285B大模型实验并写论文
DeepSeek 资深研究员陈德里开源了个人项目 Deli AutoResearch SKILL,并发布了由智能体完全自主撰写的第四篇综述论文。项目以单一的
同时发表的自我博弈综述论文展示了智能体在实验阶段的突破:在零人类干预下,智能体首次自主规划了 GPU 实验,并在 285B 参数量的 DeepSeek 模型上运行强化学习(RL)训练任务。智能体完成了从实验设计、编写代码,到运行调试和总结结论的完整研究闭环,并在模拟同行评审中跑出了 8.6/10 的高分。
此前,陈德里已利用同样的方法自主产出过三篇学术综述。首篇关于自主科研智能体的论文经历了约 60 轮智能体迭代,总耗时约 10 小时,实现了从 V1 到 V5 的迭代演进。整套工作流不仅降低了长周期研究的人为操作成本,也验证了 AI 原生研究路径的可行性。
信源:https://x.com/victor207755822/status/2067259098584985954
DeepSeek 资深研究员陈德里开源了个人项目 Deli AutoResearch SKILL,并发布了由智能体完全自主撰写的第四篇综述论文。项目以单一的
SKILL.md 协议文件形态呈现,本身不含可执行代码。协议通过规约长周期任务中的状态持久化、防死循环(Anti-Loop)与心跳守护进程(Heartbeat Watchdog),指导 AI 智能体调用子智能体(Subagent)与多角色模拟机制,实现科研全流程的全自动协作。同时发表的自我博弈综述论文展示了智能体在实验阶段的突破:在零人类干预下,智能体首次自主规划了 GPU 实验,并在 285B 参数量的 DeepSeek 模型上运行强化学习(RL)训练任务。智能体完成了从实验设计、编写代码,到运行调试和总结结论的完整研究闭环,并在模拟同行评审中跑出了 8.6/10 的高分。
此前,陈德里已利用同样的方法自主产出过三篇学术综述。首篇关于自主科研智能体的论文经历了约 60 轮智能体迭代,总耗时约 10 小时,实现了从 V1 到 V5 的迭代演进。整套工作流不仅降低了长周期研究的人为操作成本,也验证了 AI 原生研究路径的可行性。
信源:https://x.com/victor207755822/status/2067259098584985954
X (formerly Twitter)
Deli Chen (@victor207755822) on X
🧵 Deli AutoResearch SKILL is now officially open source! 🎉
https://t.co/Wrbfc4GKjA
Alongside it, we’re dropping our 4th survey paper — this time on Self-play.
https://t.co/zqycXMqQMK
Inspired by AlphaZero, we got a powerful insight: prior knowledge doesn’t…
https://t.co/Wrbfc4GKjA
Alongside it, we’re dropping our 4th survey paper — this time on Self-play.
https://t.co/zqycXMqQMK
Inspired by AlphaZero, we got a powerful insight: prior knowledge doesn’t…
OpenAI正式加入Rust基金会成为白金会员,并追加注资60万美元支持生态建设
OpenAI 宣布正式以白金会员身份加入 Rust 语言非营利托管组织 Rust 基金会(Rust Foundation),并承诺通过基金会投入总计 60 万美元的资金。这笔资金将结合白金会员年费,重点支持 Rust 项目目标(Rust Project Goals)、Rust 创新实验室(Rust Innovation Lab),以及直接资助 Rust 生态中被广泛依赖的开源项目维护者。
作为合作的一部分,OpenAI 技术成员、Rust 社区资深成员兼版本兼容性检查工具 cargo-semver-checks 的维护者 Predrag Gruevski 将代表 OpenAI 加入 Rust 基金会董事会。Gruevski 表示,Rust 能够协助开发团队快速构建底层系统,且无需在性能、安全、可靠性之间进行妥协。OpenAI 将与 Rust 项目的资助团队(Funding Team)合作,探索最有效的资金分发路径。
在宣布加入基金会的前两天,OpenAI 已通过 GitHub Sponsors 启动了超过 16 万美元的直接赞助,重点面向 Astral 与 Codex 工具链所依赖的开源项目维护者。赞助对象覆盖原 Astral OSS 基金支持的所有项目,并在过渡至 OpenAI 赞助账号后扩大了资金规模。OpenAI 一直将 Rust 视为系统编程的未来,并计划后续推出更多支持举措。
信源:https://x.com/charliermarsh/status/2067280638994968657
OpenAI 宣布正式以白金会员身份加入 Rust 语言非营利托管组织 Rust 基金会(Rust Foundation),并承诺通过基金会投入总计 60 万美元的资金。这笔资金将结合白金会员年费,重点支持 Rust 项目目标(Rust Project Goals)、Rust 创新实验室(Rust Innovation Lab),以及直接资助 Rust 生态中被广泛依赖的开源项目维护者。
作为合作的一部分,OpenAI 技术成员、Rust 社区资深成员兼版本兼容性检查工具 cargo-semver-checks 的维护者 Predrag Gruevski 将代表 OpenAI 加入 Rust 基金会董事会。Gruevski 表示,Rust 能够协助开发团队快速构建底层系统,且无需在性能、安全、可靠性之间进行妥协。OpenAI 将与 Rust 项目的资助团队(Funding Team)合作,探索最有效的资金分发路径。
在宣布加入基金会的前两天,OpenAI 已通过 GitHub Sponsors 启动了超过 16 万美元的直接赞助,重点面向 Astral 与 Codex 工具链所依赖的开源项目维护者。赞助对象覆盖原 Astral OSS 基金支持的所有项目,并在过渡至 OpenAI 赞助账号后扩大了资金规模。OpenAI 一直将 Rust 视为系统编程的未来,并计划后续推出更多支持举措。
信源:https://x.com/charliermarsh/status/2067280638994968657
X (formerly Twitter)
Charlie Marsh (@charliermarsh) on X
At OpenAI, we're continuing to bet on Rust as the future of systems programming.
I'm proud to announce that we're making a $600,000 commitment to the Rust Foundation, which combines our Platinum membership with additional support for maintainer efforts across…
I'm proud to announce that we're making a $600,000 commitment to the Rust Foundation, which combines our Platinum membership with additional support for maintainer efforts across…
摩根大通禁止香港员工访问Anthropic,继高盛后收紧合规防线
据英国《金融时报》引述知情人士消息,摩根大通已停止香港分行员工访问 Anthropic 开发的 AI 模型。报道指出,香港分行员工目前已无法从行内获批的大语言模型下拉列表中选择 Claude 模型。这是继高盛集团在今年早些时候采取类似举措后,又一家华尔街机构在香港限制使用 Claude 模型。
知情人士指出,摩根大通决定禁用 Claude 模型,主要基于许可协议中 Anthropic 使用条款的限制性描述。此前,高盛也对 Anthropic 服务条款进行了严格解读。服务条款明确将大中华区(包含香港)排除在服务范围之外。
美国 AI 公司对大中华区实施使用限制,部分原因在于防范「蒸馏」风险,即中国本土团队通过高频调用前沿模型来训练自主大模型。目前,ChatGPT 和 Claude 等西方先进模型均无法直接在香港访问。跨国企业通常通过签署全球合同并在境外托管算力来规避地理限制。但华尔街银行的限制举措表明,地缘政治冲突导致的条款壁垒正传导至跨国金融机构。由于全球金融业已广泛将前沿 AI 模型用于编码等核心业务,限制员工访问可能对香港作为国际金融中心的竞争力带来负面影响。
信源:https://www.ft.com/content/de83d303-6a03-456b-bfb9-7b11dd502ab3?syn-25a6b1a6=1
据英国《金融时报》引述知情人士消息,摩根大通已停止香港分行员工访问 Anthropic 开发的 AI 模型。报道指出,香港分行员工目前已无法从行内获批的大语言模型下拉列表中选择 Claude 模型。这是继高盛集团在今年早些时候采取类似举措后,又一家华尔街机构在香港限制使用 Claude 模型。
知情人士指出,摩根大通决定禁用 Claude 模型,主要基于许可协议中 Anthropic 使用条款的限制性描述。此前,高盛也对 Anthropic 服务条款进行了严格解读。服务条款明确将大中华区(包含香港)排除在服务范围之外。
美国 AI 公司对大中华区实施使用限制,部分原因在于防范「蒸馏」风险,即中国本土团队通过高频调用前沿模型来训练自主大模型。目前,ChatGPT 和 Claude 等西方先进模型均无法直接在香港访问。跨国企业通常通过签署全球合同并在境外托管算力来规避地理限制。但华尔街银行的限制举措表明,地缘政治冲突导致的条款壁垒正传导至跨国金融机构。由于全球金融业已广泛将前沿 AI 模型用于编码等核心业务,限制员工访问可能对香港作为国际金融中心的竞争力带来负面影响。
信源:https://www.ft.com/content/de83d303-6a03-456b-bfb9-7b11dd502ab3?syn-25a6b1a6=1
AI形式化验证公司Pramaana Labs获2700万美元种子轮融资,引入LEAN数学证明解决幻觉
致力于将数学形式化验证引入 AI 的初创公司 Pramaana Labs 宣布完成 2700 万美元种子轮融资。本轮融资由 Khosla Ventures 领投,Accel、BoldCap、Nexus Venture Partners、Premji Invest 及 Unbound 参投。资金将用于为法律、药物研发、税务申报等高敏感且对错误零容忍的行业,构建确定性验证层。
Pramaana Labs 的系统底层仍运行传统的 LLM,以保持处理复杂问题与自然语言的灵活性,但其核心创新在于在 LLM 之上构建了一层确定性验证机制。该机制借鉴了用于验证数学定理的开源 LEAN 编程语言,将具体领域的行业规则代码化。
为了针对不同垂直行业构建 LEAN 风格的形式化验证系统,Pramaana 邀请了大量领域专家进行监督与背书。在税务领域,公司正与前美国国税局(IRS)局长 Danny Werfel 展开合作;在网络安全和药物研发系统方面,则由来自印度理工学院(IIT)德里与马德拉斯分校以及加州大学伯克利分校的教授团队主导。
信源:https://techcrunch.com/2026/06/17/pramaana-labs-raises-27-million-seed-round-from-khosla-ventures-to-bring-formal-verification-to-ai/
致力于将数学形式化验证引入 AI 的初创公司 Pramaana Labs 宣布完成 2700 万美元种子轮融资。本轮融资由 Khosla Ventures 领投,Accel、BoldCap、Nexus Venture Partners、Premji Invest 及 Unbound 参投。资金将用于为法律、药物研发、税务申报等高敏感且对错误零容忍的行业,构建确定性验证层。
Pramaana Labs 的系统底层仍运行传统的 LLM,以保持处理复杂问题与自然语言的灵活性,但其核心创新在于在 LLM 之上构建了一层确定性验证机制。该机制借鉴了用于验证数学定理的开源 LEAN 编程语言,将具体领域的行业规则代码化。
为了针对不同垂直行业构建 LEAN 风格的形式化验证系统,Pramaana 邀请了大量领域专家进行监督与背书。在税务领域,公司正与前美国国税局(IRS)局长 Danny Werfel 展开合作;在网络安全和药物研发系统方面,则由来自印度理工学院(IIT)德里与马德拉斯分校以及加州大学伯克利分校的教授团队主导。
信源:https://techcrunch.com/2026/06/17/pramaana-labs-raises-27-million-seed-round-from-khosla-ventures-to-bring-formal-verification-to-ai/
TechCrunch
Pramaana Labs raises $27M seed round from Khosla Ventures to bring formal verification to AI | TechCrunch
Pramaana will focus on highly sensitive verticals like law, drug discovery, and tax preparation — where errors can be costly and reliability is at a premium.
Vercel开源智能体框架eve,主打开发运行一体化与生产化就绪
Vercel 正式开源了 AI 智能体框架 eve,主打开发、运行与生产部署一体化。类比于 Next.js 对 Web 开发的规范化,eve 采用文件驱动架构,允许通过在特定目录放置
在运行与安全层面,eve 基于开源 Workflow SDK 实现了「耐用执行(Durable Execution)」,在会话每一步进行检查点备份,确保智能体在遭遇服务崩溃或重新部署时能原地恢复运行。同时,智能体代码的执行被置于独立的隔离沙箱(Vercel Sandbox)中,支持对高风险操作配置人机协同审批,并可通过声明文件直接连接模型上下文协议(MCP)服务器。
Vercel 内部目前已在生产环境中运行着 100 多个基于 eve 构建的智能体,最活跃的数据分析智能体 d0 在 Slack 中月均处理超 3 万次提问。目前 eve 已经在 GitHub 上开源,开发者可通过
信源:https://vercel.com/blog/introducing-eve
Vercel 正式开源了 AI 智能体框架 eve,主打开发、运行与生产部署一体化。类比于 Next.js 对 Web 开发的规范化,eve 采用文件驱动架构,允许通过在特定目录放置
agent.ts`(配置模型)、`instructions.md`(系统提示词)和 `tools/ 等文件,自动构建并部署智能体,以破除传统开发中手动拼接底层管道的痛点。在运行与安全层面,eve 基于开源 Workflow SDK 实现了「耐用执行(Durable Execution)」,在会话每一步进行检查点备份,确保智能体在遭遇服务崩溃或重新部署时能原地恢复运行。同时,智能体代码的执行被置于独立的隔离沙箱(Vercel Sandbox)中,支持对高风险操作配置人机协同审批,并可通过声明文件直接连接模型上下文协议(MCP)服务器。
Vercel 内部目前已在生产环境中运行着 100 多个基于 eve 构建的智能体,最活跃的数据分析智能体 d0 在 Slack 中月均处理超 3 万次提问。目前 eve 已经在 GitHub 上开源,开发者可通过
npx eve@latest init <name> 快速初始化项目,并在本地通过终端界面进行可视化调试。信源:https://vercel.com/blog/introducing-eve
Vercel
Introducing eve
Introducing eve, the open-source agent framework from Vercel for building, running, and scaling agents in production, with durable execution, sandboxed compute, approvals, channels, tracing, and evals built in.
Frontier碳移除联盟获9.15亿美元增资,Anthropic作为新成员加入
由多家科技巨头联合发起的碳移除采购联盟 Frontier 周三宣布,获得新增 9.15 亿美元的资金承诺,并将生成式 AI 独角兽 Anthropic 纳为新成员。这笔大额增资将联盟的总资金承诺提升至 18 亿美元。Frontier 旨在通过预先承诺购买碳移除额度,来降低初创项目的商业化风险,推动项目加速实现规模化。
这笔新资金将重点投向海洋碱度提升(ocean alkalinity enhancement)、生物质碳移除(biomass-based removal)、增强岩石风化(enhanced rock weathering)以及直接空气捕集(direct air capture)等四项前沿碳移除技术。Frontier 计划通过为期 8 至 10 年的承购合同(offtake contracts,最长可延伸至 2040 年),在相关领域进行 10 到 15 次重点押注。尽管相关技术均带有不同程度的成本和技术风险,但联盟认为它们共同具备达到吉吨级(gigaton scale)碳移除的潜力。
Frontier 成立于 2022 年,最初由 Stripe、谷歌(Google)、Meta、Shopify 等企业联合发起,Salesforce 等也是联盟现有成员。
信源:https://www.reuters.com/sustainability/cop/big-tech-backed-coalition-carbon-removal-increases-funding-by-915-million-adds-2026-06-17/
由多家科技巨头联合发起的碳移除采购联盟 Frontier 周三宣布,获得新增 9.15 亿美元的资金承诺,并将生成式 AI 独角兽 Anthropic 纳为新成员。这笔大额增资将联盟的总资金承诺提升至 18 亿美元。Frontier 旨在通过预先承诺购买碳移除额度,来降低初创项目的商业化风险,推动项目加速实现规模化。
这笔新资金将重点投向海洋碱度提升(ocean alkalinity enhancement)、生物质碳移除(biomass-based removal)、增强岩石风化(enhanced rock weathering)以及直接空气捕集(direct air capture)等四项前沿碳移除技术。Frontier 计划通过为期 8 至 10 年的承购合同(offtake contracts,最长可延伸至 2040 年),在相关领域进行 10 到 15 次重点押注。尽管相关技术均带有不同程度的成本和技术风险,但联盟认为它们共同具备达到吉吨级(gigaton scale)碳移除的潜力。
Frontier 成立于 2022 年,最初由 Stripe、谷歌(Google)、Meta、Shopify 等企业联合发起,Salesforce 等也是联盟现有成员。
信源:https://www.reuters.com/sustainability/cop/big-tech-backed-coalition-carbon-removal-increases-funding-by-915-million-adds-2026-06-17/
DeepSeek上线识图模式,基于撤回的原语框架支持视觉CoT推理
DeepSeek 网页端和 App 端正式上线识图模式 (Vision Mode),在对话输入框上方与快速模式、专家模式并列提供。新上线的视觉理解能力并非简单的文字识别 (OCR),而是主打深度场景分析、空间逻辑推理以及将 UI 界面截图直接转化为 HTML 结构化代码。对于高难度的几何推导或复杂图表分析,系统会自动激活深度思考模型,提供完整的推理链条。
识图模式底层基于 DeepSeek 团队公布的「以视觉原语思考 (Thinking with Visual Primitives)」研究框架。多模态研究员 Xiaokang Chen 与北京大学、清华大学联合发表的论文指出,现有视觉语言模型在精细定位和空间推理中存在「指称缺陷」 (Reference Gap),即难以用模糊的自然语言描述复杂的视觉坐标。为此,研究团队将坐标点与边界框 (Bounding Boxes) 提升为最小思维单位,在模型进行视觉推理的思维链 (CoT) 中直接插入空间原语,实现了在思考过程中同步进行空间指向。
作为视觉能力基础的学术论文与开源项目曾于 4 月 30 日短暂放出,但随即被 DeepSeek 官方于 5 月 1 日无预警撤回,引发了行业关于技术细节过度泄露以及模型后续优化的诸多猜测。正式上线的识图模式仅支持图像输入,暂不支持视频、音频等多模态格式,且模型目前不具备图像生成能力。
信源:https://x.com/PKUCXK/status/2067460570958426452
DeepSeek 网页端和 App 端正式上线识图模式 (Vision Mode),在对话输入框上方与快速模式、专家模式并列提供。新上线的视觉理解能力并非简单的文字识别 (OCR),而是主打深度场景分析、空间逻辑推理以及将 UI 界面截图直接转化为 HTML 结构化代码。对于高难度的几何推导或复杂图表分析,系统会自动激活深度思考模型,提供完整的推理链条。
识图模式底层基于 DeepSeek 团队公布的「以视觉原语思考 (Thinking with Visual Primitives)」研究框架。多模态研究员 Xiaokang Chen 与北京大学、清华大学联合发表的论文指出,现有视觉语言模型在精细定位和空间推理中存在「指称缺陷」 (Reference Gap),即难以用模糊的自然语言描述复杂的视觉坐标。为此,研究团队将坐标点与边界框 (Bounding Boxes) 提升为最小思维单位,在模型进行视觉推理的思维链 (CoT) 中直接插入空间原语,实现了在思考过程中同步进行空间指向。
作为视觉能力基础的学术论文与开源项目曾于 4 月 30 日短暂放出,但随即被 DeepSeek 官方于 5 月 1 日无预警撤回,引发了行业关于技术细节过度泄露以及模型后续优化的诸多猜测。正式上线的识图模式仅支持图像输入,暂不支持视频、音频等多模态格式,且模型目前不具备图像生成能力。
信源:https://x.com/PKUCXK/status/2067460570958426452
❤1
动察Beating AI News
里约自研大模型被揭套壳,直接线性合并中国开源项目权重 巴西里约市政府开源的 397B 大模型被开源社区揭露为直接套壳的合并产物。 巴西里约市政府所谓的 397B 自研大模型,已被当场抓包是零后期训练的线性权重缝合版。 所谓的自研模型 Rio-3.5-Open-397B 权重文件并未经过宣传的后训练,而是直接将 Nex-AGI 团队的开源模型 Nex N2 Pro 与阿里 Qwen 3.5 按照 6 比 4 的权重比例进行线性合并的结果。 被套壳的开源模型 Nex N2 Pro 由开源 AI 联盟 Nex…
里约大模型套壳丑闻后续:官方辩称模型丢失被迫重训,被指借AI项目侵吞公款
巴西里约热内卢市政府旗下 IT 公司 IplanRIO 日前发表官方声明,回应先前模型被指套壳中国开源项目 Nex-N2 Pro 和阿里 Qwen 3.5 的争议。官方在致歉的同时给出了一个离奇辩解,称用于发布的最终模型权重文件已经丢失,被迫重新排期训练。官方的回应未能平息舆论,反而引发了项目涉嫌利用 AI 概念侵吞公款的强烈质疑。
IplanRIO 在声明中承认,Rio-3.5-Open-397B 并非宣传中自研且从头训练的基座模型,而是基于已有开源模型进行微调与合并的产物,并为先前未在文档中致谢 Nex-AGI 团队致歉。对于上传的实际权重为何是 Nex 与 Qwen 线性合并的「缝合版」,官方解释称由于「操作失误」上传了用于对比的中间基线版本,而非经过蒸馏和后训练的最终版。但官方随即表示,团队曾尝试恢复最终模型但未能成功,必须在重新训练和外部验证后才能重新发布。目前,Rio-3.5-Open-397B 在 Hugging Face 上的页面已全部下架清空。
里约市政府先前为大模型项目拨付了 50 万雷亚尔(约合 10 万美元)的训练经费,但最终交差的却是一个零训练的缝合权重,甚至连所谓的「最终版权重」也查无实据。事件本质是极其拙劣的套取经费骗局:拿了公款却只用开源权重缝合交差,被当场抓包后用「文件丢失」掩盖,最后再用「重新训练」画饼糊弄。
信源:https://x.com/IplanRio_rj/status/2066693494769348946
巴西里约热内卢市政府旗下 IT 公司 IplanRIO 日前发表官方声明,回应先前模型被指套壳中国开源项目 Nex-N2 Pro 和阿里 Qwen 3.5 的争议。官方在致歉的同时给出了一个离奇辩解,称用于发布的最终模型权重文件已经丢失,被迫重新排期训练。官方的回应未能平息舆论,反而引发了项目涉嫌利用 AI 概念侵吞公款的强烈质疑。
IplanRIO 在声明中承认,Rio-3.5-Open-397B 并非宣传中自研且从头训练的基座模型,而是基于已有开源模型进行微调与合并的产物,并为先前未在文档中致谢 Nex-AGI 团队致歉。对于上传的实际权重为何是 Nex 与 Qwen 线性合并的「缝合版」,官方解释称由于「操作失误」上传了用于对比的中间基线版本,而非经过蒸馏和后训练的最终版。但官方随即表示,团队曾尝试恢复最终模型但未能成功,必须在重新训练和外部验证后才能重新发布。目前,Rio-3.5-Open-397B 在 Hugging Face 上的页面已全部下架清空。
里约市政府先前为大模型项目拨付了 50 万雷亚尔(约合 10 万美元)的训练经费,但最终交差的却是一个零训练的缝合权重,甚至连所谓的「最终版权重」也查无实据。事件本质是极其拙劣的套取经费骗局:拿了公款却只用开源权重缝合交差,被当场抓包后用「文件丢失」掩盖,最后再用「重新训练」画饼糊弄。
信源:https://x.com/IplanRio_rj/status/2066693494769348946
X (formerly Twitter)
IplanRio (@IplanRio_rj) on X
NOTE ON RIO 3.5 OPEN
In recent days, Rio 3.5 Open has received far more attention than we anticipated. Along with it came analyses and, of course, criticisms and questions.
First, we want to clarify that the model is not foundational, trained from scratch…
In recent days, Rio 3.5 Open has received far more attention than we anticipated. Along with it came analyses and, of course, criticisms and questions.
First, we want to clarify that the model is not foundational, trained from scratch…
「科学语法」大模型LOGOS开源:以纯序列打通多领域AI4S建模
阿里巴巴旗下 ATH-Token Foundry 联合中国人民大学高瓴人工智能学院,开源了多领域科学生成大模型 LOGOS。不同于针对结构预测、分子生成分立训练专家模型,LOGOS 首次在 LLM 架构内实现了蛋白质、小分子、材料和化学反应的原生统一建模与生成。
核心突破在于将三维空间接触模式编码为 Token 序列。LOGOS 无需输入 3D 坐标即可捕捉空间互作,消除了预训练与下游任务的偏差。预训练语料库达 448.7 亿 tokens,完整覆盖蛋白质、小分子、化学反应等 7 类科学模态。
在六大任务评测中,1B 参数量的 LOGOS-1B 仅以 1/56 的参数规模,在多项任务上超越 56B 参数量的 NatureLM。在 AI 制药关键的口袋配体生成中,LOGOS 首次以纯序列范式击败了依赖 3D 坐标的扩散模型;在逆合成预测中取得 74.8% 的 Top-1 准确率。目前,LOGOS 已完整开源模型权重、推理代码与学术论文。
信源:https://mp.weixin.qq.com/s/50q5uY849FKnBzk1Q04MRg
阿里巴巴旗下 ATH-Token Foundry 联合中国人民大学高瓴人工智能学院,开源了多领域科学生成大模型 LOGOS。不同于针对结构预测、分子生成分立训练专家模型,LOGOS 首次在 LLM 架构内实现了蛋白质、小分子、材料和化学反应的原生统一建模与生成。
核心突破在于将三维空间接触模式编码为 Token 序列。LOGOS 无需输入 3D 坐标即可捕捉空间互作,消除了预训练与下游任务的偏差。预训练语料库达 448.7 亿 tokens,完整覆盖蛋白质、小分子、化学反应等 7 类科学模态。
在六大任务评测中,1B 参数量的 LOGOS-1B 仅以 1/56 的参数规模,在多项任务上超越 56B 参数量的 NatureLM。在 AI 制药关键的口袋配体生成中,LOGOS 首次以纯序列范式击败了依赖 3D 坐标的扩散模型;在逆合成预测中取得 74.8% 的 Top-1 准确率。目前,LOGOS 已完整开源模型权重、推理代码与学术论文。
信源:https://mp.weixin.qq.com/s/50q5uY849FKnBzk1Q04MRg
OpenAI推出生物基准LifeSciBench,GPT-Rosalind通过率仅36%
OpenAI 联合 173 名生物技术与制药研发领域的博士级科学家,推出全新的评测基准 LifeSciBench,用以衡量并改善 AI 对真实世界生命科学研究的支持能力。相较于侧重窄领域知识记忆或单步回答的传统评测,LifeSciBench 聚焦于科研工作流中的多步推理与不确定性决策。
整个评测包含 750 个专家撰写任务并经过 453 名同行评议人验证,覆盖证据处理、数据分析、设计与优化、科学推理、验证与操作、转化、科学传播 7 个工作流。为了模拟真实科研协作,LifeSciBench 引入了序列文件、图表、分子结构、PDF 论文等 1,062 个科学制品。有 53% 的任务包含这些制品,79% 的任务需要多步推理(平均约 4 步)。评测最终通过专家制定的 19,020 条细粒度标准进行打分。
首批评测结果显示,现有的前沿大模型在应对真实生命科学研究时仍面临极高门槛。OpenAI 专为生物医药研发设计的推理模型 GPT-Rosalind(今年 4 月开启预览)取得了最佳成绩,但也仅实现了 36.1% 的任务通过率(标准化得分 0.576)。在需要处理复杂制品的任务中,GPT-Rosalind 的通过率进一步降至 28.1%。目前,有 171 个任务(占比 22.8%)在所有被测模型中通过率均为 0%,属于当前全行业大模型均无法攻克的绝对死角。
信源:https://openai.com/index/introducing-life-sci-bench/
OpenAI 联合 173 名生物技术与制药研发领域的博士级科学家,推出全新的评测基准 LifeSciBench,用以衡量并改善 AI 对真实世界生命科学研究的支持能力。相较于侧重窄领域知识记忆或单步回答的传统评测,LifeSciBench 聚焦于科研工作流中的多步推理与不确定性决策。
整个评测包含 750 个专家撰写任务并经过 453 名同行评议人验证,覆盖证据处理、数据分析、设计与优化、科学推理、验证与操作、转化、科学传播 7 个工作流。为了模拟真实科研协作,LifeSciBench 引入了序列文件、图表、分子结构、PDF 论文等 1,062 个科学制品。有 53% 的任务包含这些制品,79% 的任务需要多步推理(平均约 4 步)。评测最终通过专家制定的 19,020 条细粒度标准进行打分。
首批评测结果显示,现有的前沿大模型在应对真实生命科学研究时仍面临极高门槛。OpenAI 专为生物医药研发设计的推理模型 GPT-Rosalind(今年 4 月开启预览)取得了最佳成绩,但也仅实现了 36.1% 的任务通过率(标准化得分 0.576)。在需要处理复杂制品的任务中,GPT-Rosalind 的通过率进一步降至 28.1%。目前,有 171 个任务(占比 22.8%)在所有被测模型中通过率均为 0%,属于当前全行业大模型均无法攻克的绝对死角。
信源:https://openai.com/index/introducing-life-sci-bench/
OpenAI
Introducing LifeSciBench
Introducing LifeSciBench, an expert-authored, expert-reviewed benchmark for evaluating how AI systems handle real-world life science research tasks and decisions.
❤1
算力租赁服务商Baseten拟敲定15亿美元融资,双层估值冲上130亿美元
AI 推理服务商 Baseten 正在敲定新一轮 15 亿美元融资。相比三个月前谈判中拟以 110 亿美元估值融资 10 亿美元的方案,最终确定的融资规模扩大了 5 亿美元。估值也调整为双层结构,部分投资者按 110 亿美元估值认购,另一部分按 130 亿美元估值跟投。本轮由 Altimeter Capital、Conviction、Spark Capital、Sands Capital 与 Wellington Management 联合领投,这也是 Wellington Management 首次投资 AI 推理赛道。
Baseten 在 20 家云服务商的算力之上搭建软件层,帮助企业微调和运行开源模型,当前客户包括编程助手 Cursor、Mercor 和 OpenEvidence。随着 DeepSeek、Kimi 以及英伟达 Nemotron 等开源模型性能直逼闭源前沿模型,企业开始转向混合架构以控制成本。Baseten 首席执行官 Tuhin Srivastava 表示,在特定任务中改用开源模型,成本仅为闭源模型的 30%。
开源模型爆发拉动了对底层算力的强劲需求,Baseten 营收也随之暴增。截至 2026 年第一季度末,年化经常性收入已从季度初的 2 亿美元增长至 6 亿美元,比去年同期翻了 20 倍。不过,Baseten 依靠向云巨头租用 GPU 再转售,面临毛利率被挤压的风险。即便面临利润隐忧,通常表现谨慎的机构投资人 Wellington Management 依然入局,完成了在 AI 推理市场的首笔投资,被业内视为算力中介赛道具备持久生命力的信号。
信源:https://www.wsj.com/tech/ai/the-13-billion-ai-startup-betting-on-cheaper-alternatives-to-openai-anthropic-b9679603
AI 推理服务商 Baseten 正在敲定新一轮 15 亿美元融资。相比三个月前谈判中拟以 110 亿美元估值融资 10 亿美元的方案,最终确定的融资规模扩大了 5 亿美元。估值也调整为双层结构,部分投资者按 110 亿美元估值认购,另一部分按 130 亿美元估值跟投。本轮由 Altimeter Capital、Conviction、Spark Capital、Sands Capital 与 Wellington Management 联合领投,这也是 Wellington Management 首次投资 AI 推理赛道。
Baseten 在 20 家云服务商的算力之上搭建软件层,帮助企业微调和运行开源模型,当前客户包括编程助手 Cursor、Mercor 和 OpenEvidence。随着 DeepSeek、Kimi 以及英伟达 Nemotron 等开源模型性能直逼闭源前沿模型,企业开始转向混合架构以控制成本。Baseten 首席执行官 Tuhin Srivastava 表示,在特定任务中改用开源模型,成本仅为闭源模型的 30%。
开源模型爆发拉动了对底层算力的强劲需求,Baseten 营收也随之暴增。截至 2026 年第一季度末,年化经常性收入已从季度初的 2 亿美元增长至 6 亿美元,比去年同期翻了 20 倍。不过,Baseten 依靠向云巨头租用 GPU 再转售,面临毛利率被挤压的风险。即便面临利润隐忧,通常表现谨慎的机构投资人 Wellington Management 依然入局,完成了在 AI 推理市场的首笔投资,被业内视为算力中介赛道具备持久生命力的信号。
信源:https://www.wsj.com/tech/ai/the-13-billion-ai-startup-betting-on-cheaper-alternatives-to-openai-anthropic-b9679603
The Wall Street Journal
Exclusive | The $13 Billion AI Startup Betting on Cheaper Alternatives to OpenAI, Anthropic
Baseten, part of a growing Silicon Valley ecosystem offering services to enable low-cost AI models, is raising $1.5 billion in a new round.
「干净代码」与逐行审查已死,Ramp主管宣告AI终结传统软件开发
Ramp 应用 AI 主管 Rahul Gupta 指出,下一代大模型正将编程转变为「自然语言到代码的解释器」,传统软件开发逻辑正面临根本性颠覆。Gupta 警告,随着即将推出的 Anthropic Fable 等模型在代码正确率上跨越问题与输出的复杂度,死守「干净代码」与低风险区域的人工逐行审查已无必要,逐行审查应仅保留给涉及安全与资金的高风险核心模块,软件开发的重点必须转向系统性的实证验证与主动拥抱技术债务。
在新的开发范式下,AI 极大地降低了重构成本,合理的抽象与完美架构正变得不再重要。开发团队可以接受增加 50% 冗余代码来换取 5% 的性能提升,将累积的技术债务直接留给后续更智能的模型去维护。Gupta 指出,软件交付的瓶颈已全面转移到「评审与合并」环节。对于低风险模块,应当像对待神经网络一样直接视作「黑盒」,通过隔离沙箱并完全切断对数据库与网络的外部出站访问权限,在 CI 流程中进行成千上万次真实输入的实证检验,来替代低效的手工逐行逻辑验证。
Claude Code 之父 Boris Cherny 对 Gupta 的颠覆性言论表示强烈赞同,并补充称,既然模型已经能够正确生成绝大部分任务代码,人类的核心工作转变为大模型与验证器设计闭环运行的安全防护网,不断消除工程流程中的各种系统瓶颈。
信源:https://x.com/rahulgs/status/2067257255825686880
Ramp 应用 AI 主管 Rahul Gupta 指出,下一代大模型正将编程转变为「自然语言到代码的解释器」,传统软件开发逻辑正面临根本性颠覆。Gupta 警告,随着即将推出的 Anthropic Fable 等模型在代码正确率上跨越问题与输出的复杂度,死守「干净代码」与低风险区域的人工逐行审查已无必要,逐行审查应仅保留给涉及安全与资金的高风险核心模块,软件开发的重点必须转向系统性的实证验证与主动拥抱技术债务。
在新的开发范式下,AI 极大地降低了重构成本,合理的抽象与完美架构正变得不再重要。开发团队可以接受增加 50% 冗余代码来换取 5% 的性能提升,将累积的技术债务直接留给后续更智能的模型去维护。Gupta 指出,软件交付的瓶颈已全面转移到「评审与合并」环节。对于低风险模块,应当像对待神经网络一样直接视作「黑盒」,通过隔离沙箱并完全切断对数据库与网络的外部出站访问权限,在 CI 流程中进行成千上万次真实输入的实证检验,来替代低效的手工逐行逻辑验证。
Claude Code 之父 Boris Cherny 对 Gupta 的颠覆性言论表示强烈赞同,并补充称,既然模型已经能够正确生成绝大部分任务代码,人类的核心工作转变为大模型与验证器设计闭环运行的安全防护网,不断消除工程流程中的各种系统瓶颈。
信源:https://x.com/rahulgs/status/2067257255825686880
X (formerly Twitter)
rahul (@rahulgs) on X
1. as a mental model it is more correct to think of fable+ class models as english -> code interpreters - converts your idea into code into "correct" code regardless of problem complexity and output complexity (diff size). Fable 5 will be the worst of this…
❤1
米哈游原国际化总裁金雯怡加盟月之暗面,全面负责Kimi业务线商业化
米哈游原国际化总裁金雯怡加入国内大模型初创公司月之暗面(Moonshot AI),全面负责旗下核心产品 Kimi 智能助手的业务线。
金雯怡于 2017 年加入米哈游,从零搭建海外发行、本地化运营以及海外社群体系。在职期间,主导建立海外独立品牌 HoYoverse,推动《崩坏 3》覆盖 200 多个国家与地区。2020 年《原神》全球上线首月斩获 2.45 亿美元,登顶全球手游收入榜,随后的《崩坏:星穹铁道》与《绝区零》也成功落地海外。多款核心游戏的海外推广,推动米哈游从本土二次元厂商转型为全球化游戏 IP 公司。4 月底,金雯怡宣布离职,业务交接给前哔哩哔哩副总裁王宇阳。
月之暗面目前正处于从技术积累转向商业化落地的阶段。引入在出海与全球化运营领域有近 10 年经验的金雯怡,显示月之暗面正加速布局 Kimi 商业化与海外市场拓展。
信源:https://mp.weixin.qq.com/s/2egr6sCg1mek4nsaJYjBeA
米哈游原国际化总裁金雯怡加入国内大模型初创公司月之暗面(Moonshot AI),全面负责旗下核心产品 Kimi 智能助手的业务线。
金雯怡于 2017 年加入米哈游,从零搭建海外发行、本地化运营以及海外社群体系。在职期间,主导建立海外独立品牌 HoYoverse,推动《崩坏 3》覆盖 200 多个国家与地区。2020 年《原神》全球上线首月斩获 2.45 亿美元,登顶全球手游收入榜,随后的《崩坏:星穹铁道》与《绝区零》也成功落地海外。多款核心游戏的海外推广,推动米哈游从本土二次元厂商转型为全球化游戏 IP 公司。4 月底,金雯怡宣布离职,业务交接给前哔哩哔哩副总裁王宇阳。
月之暗面目前正处于从技术积累转向商业化落地的阶段。引入在出海与全球化运营领域有近 10 年经验的金雯怡,显示月之暗面正加速布局 Kimi 商业化与海外市场拓展。
信源:https://mp.weixin.qq.com/s/2egr6sCg1mek4nsaJYjBeA
❤1
钉钉新CEO陈宇森发布首封全员信,启动向Agent友好的「双引擎」AI改造
钉钉新任 CEO 陈宇森(落款为「宇森 悟空事业部 CEO」)上任一周后发布首封内部信,对悟空事业部进行全面组织调整。陈宇森将钉钉和「悟空」两个产品定位为「双引擎」,提出要对过去已有的业务全面做好 AI 化改造,使其成为未来 Agent 友好的基础设施。
在组织架构调整中,主要变动包括:
1. 核心平台业务部:由朱鸿(此前为钉钉 CTO,2025 年随前 CEO 无招一同回归阿里)负责,向陈宇森汇报,核心负责钉钉等业务。
2. 悟空团队:整合悟空与 AI Agent 平台 MuleRun,由束骏亮(前 MuleRun CTO、蜚语安全创始人,2025 年与陈宇森等联合创立 MuleRun)负责,向陈宇森汇报。
3. 市场部:由李昕瑜(前 MuleRun CMO)负责,向陈宇森汇报,统筹悟空的商业化运营。
4. 客户发展部:由杨猛(工号 598 号的老阿里人,原钉钉全球商业总裁)负责,整合直销、电销、服务商、交付等团队。
5. 公司信息技术部:新成立部门,由邓悟负责,旨在优化迭代业务系统,让一切系统易于被 Agent 使用。
此外,去年推出的 AI 硬件与 AI 听记等 AI 原生产品予以保留,AI 硬件部门由任卿负责,后续将增强投入并推进国际化。
业务进展方面,悟空与 MuleRun 的整合是陈宇森出任 CEO 时的定调。据悉,MuleRun 自今年 5 月中旬正式商业化,一个月内 ARR(年度经常性收入)已突破 3 亿元人民币。管理作息上,陈宇森对作息进行了松绑,由各业务线自主决定下班时间,不再开设晚会,没有硬性加班要求,不少员工本周已开始休假。
信源:https://mp.weixin.qq.com/s/2IsF4C682LPWPMHJ64NR_w
钉钉新任 CEO 陈宇森(落款为「宇森 悟空事业部 CEO」)上任一周后发布首封内部信,对悟空事业部进行全面组织调整。陈宇森将钉钉和「悟空」两个产品定位为「双引擎」,提出要对过去已有的业务全面做好 AI 化改造,使其成为未来 Agent 友好的基础设施。
在组织架构调整中,主要变动包括:
1. 核心平台业务部:由朱鸿(此前为钉钉 CTO,2025 年随前 CEO 无招一同回归阿里)负责,向陈宇森汇报,核心负责钉钉等业务。
2. 悟空团队:整合悟空与 AI Agent 平台 MuleRun,由束骏亮(前 MuleRun CTO、蜚语安全创始人,2025 年与陈宇森等联合创立 MuleRun)负责,向陈宇森汇报。
3. 市场部:由李昕瑜(前 MuleRun CMO)负责,向陈宇森汇报,统筹悟空的商业化运营。
4. 客户发展部:由杨猛(工号 598 号的老阿里人,原钉钉全球商业总裁)负责,整合直销、电销、服务商、交付等团队。
5. 公司信息技术部:新成立部门,由邓悟负责,旨在优化迭代业务系统,让一切系统易于被 Agent 使用。
此外,去年推出的 AI 硬件与 AI 听记等 AI 原生产品予以保留,AI 硬件部门由任卿负责,后续将增强投入并推进国际化。
业务进展方面,悟空与 MuleRun 的整合是陈宇森出任 CEO 时的定调。据悉,MuleRun 自今年 5 月中旬正式商业化,一个月内 ARR(年度经常性收入)已突破 3 亿元人民币。管理作息上,陈宇森对作息进行了松绑,由各业务线自主决定下班时间,不再开设晚会,没有硬性加班要求,不少员工本周已开始休假。
信源:https://mp.weixin.qq.com/s/2IsF4C682LPWPMHJ64NR_w
Manus年化营收暴增至5亿美元,早期中资机构正筹资20亿美元从Meta赎回
据《The Information》报道,受中国监管机构责令逆转交易的影响,AI 智能体初创公司 Manus 的早期中资背景投资人计划以 Meta 收购时的 20 亿美元原价,从 Meta Platforms 手中赎回该公司。尽管该逆转令在创业圈引发对海外并购和融资通路受阻的担忧,但对早期投资者而言却是一个意外之喜:由于自去年 12 月被 Meta 收购以来,Manus 的订阅收入录得爆发式增长,其年化经常性收入(ARR)已从收购前的 1 亿美元飙升至最近几周的 4 亿至 5 亿美元。这意味着投资者将以极具性价比的「折扣价」拿回一家更具估值想象力的公司。
今年 4 月,在经历数月调查后,中国政府因 Manus 交易未提前申报且担忧将 AI 核心技术及人才转移给地缘政治对手而责令取消该交易。目前,Meta 已在内部将 Manus 的业务进行隔离,并停止了数据共享。在资金安排上,红杉中国(HSG)、真格基金(ZhenFund)和腾讯将参与赎回,且计划动用新资金(fresh capital)买回 Meta 的股份,而不要求 LP 退回已分发的收益。由于地缘和监管限制,曾领投 7500 万美元的美国顶级风投 Benchmark 将彻底退出此次赎回,其原持有的份额或将被中资机构瓜分。
为了适应新的监管环境并保留投资人利益,Manus 正在考虑重整公司架构,将其转变为一家在中国境内注册的合资公司(JV)。这一举措不仅允许投资者以美元形式继续持有股份,还旨在为未来申请在香港进行首次公开募股(IPO)铺平道路。随着监管机构对科技企业使用红筹或 VIE 架构绕过境内审查的容忍度持续走低,此番境内注册架构调整被视为 Manus 获得中国监管机构批准其香港 IPO 的关键合规步骤。
信源:https://www.theinformation.com/articles/manus-revenue-soars-original-investors-move-reverse-meta-deal
据《The Information》报道,受中国监管机构责令逆转交易的影响,AI 智能体初创公司 Manus 的早期中资背景投资人计划以 Meta 收购时的 20 亿美元原价,从 Meta Platforms 手中赎回该公司。尽管该逆转令在创业圈引发对海外并购和融资通路受阻的担忧,但对早期投资者而言却是一个意外之喜:由于自去年 12 月被 Meta 收购以来,Manus 的订阅收入录得爆发式增长,其年化经常性收入(ARR)已从收购前的 1 亿美元飙升至最近几周的 4 亿至 5 亿美元。这意味着投资者将以极具性价比的「折扣价」拿回一家更具估值想象力的公司。
今年 4 月,在经历数月调查后,中国政府因 Manus 交易未提前申报且担忧将 AI 核心技术及人才转移给地缘政治对手而责令取消该交易。目前,Meta 已在内部将 Manus 的业务进行隔离,并停止了数据共享。在资金安排上,红杉中国(HSG)、真格基金(ZhenFund)和腾讯将参与赎回,且计划动用新资金(fresh capital)买回 Meta 的股份,而不要求 LP 退回已分发的收益。由于地缘和监管限制,曾领投 7500 万美元的美国顶级风投 Benchmark 将彻底退出此次赎回,其原持有的份额或将被中资机构瓜分。
为了适应新的监管环境并保留投资人利益,Manus 正在考虑重整公司架构,将其转变为一家在中国境内注册的合资公司(JV)。这一举措不仅允许投资者以美元形式继续持有股份,还旨在为未来申请在香港进行首次公开募股(IPO)铺平道路。随着监管机构对科技企业使用红筹或 VIE 架构绕过境内审查的容忍度持续走低,此番境内注册架构调整被视为 Manus 获得中国监管机构批准其香港 IPO 的关键合规步骤。
信源:https://www.theinformation.com/articles/manus-revenue-soars-original-investors-move-reverse-meta-deal
The Information
Manus’ Revenue Soars as Original Investors Move to Reverse Meta Deal
The early Chinese backers of AI firm Manus are planning to buy the firm back from Meta Platforms at the $2 billion price Meta paid, in response to a Chinese government order that the deal be reversed, according to two people with direct knowledge of the matter.…