英伟达前AI研究副总裁创业,拿9000万美元给机器人造「Matrix」
英伟达前 AI 研究副总裁 Sanja Fidler 与两位长期合作的研究伙伴 Zan Gojcic、Huan Ling 创办 Veeda AI,并拿到 9000 万美元种子融资,Khosla Ventures 和 Radical Ventures 参与投资。Veeda 不做机器人本体,而是做多模态世界模型,给机器人生成可以大规模扩展的虚拟训练环境。
现实里让机器人靠试错学习太贵也太慢,一次失误就可能损坏设备,训练也无法像计算任务一样大规模并行。Veeda 想把试错搬进模拟世界,让机器人在虚拟环境里反复操作、失败和重来。Fidler 直接把它称为 Physical AI 的「Matrix」。
这类世界模型不只是生成看起来真实的视频。它还要正确模拟空间、运动和物体交互,否则很难拿来可靠训练机器人。三位创始人过去长期在 NVIDIA 做相关研究,最近共同参与了 Lyra 2.0、OmniDreams 等 3D 和世界模拟项目;Fidler 和 Huan Ling 也参与了 NVIDIA Cosmos 世界模型平台。
Veeda 目前还很早期,尚未公开具体模型、客户或产品上线时间。官网显示团队分布在多伦多、苏黎世、山景城和新加坡,目前正在招聘世界模型、数据和大规模训练相关人员。
Sanja Fidler
英伟达前 AI 研究副总裁 Sanja Fidler 与两位长期合作的研究伙伴 Zan Gojcic、Huan Ling 创办 Veeda AI,并拿到 9000 万美元种子融资,Khosla Ventures 和 Radical Ventures 参与投资。Veeda 不做机器人本体,而是做多模态世界模型,给机器人生成可以大规模扩展的虚拟训练环境。
现实里让机器人靠试错学习太贵也太慢,一次失误就可能损坏设备,训练也无法像计算任务一样大规模并行。Veeda 想把试错搬进模拟世界,让机器人在虚拟环境里反复操作、失败和重来。Fidler 直接把它称为 Physical AI 的「Matrix」。
这类世界模型不只是生成看起来真实的视频。它还要正确模拟空间、运动和物体交互,否则很难拿来可靠训练机器人。三位创始人过去长期在 NVIDIA 做相关研究,最近共同参与了 Lyra 2.0、OmniDreams 等 3D 和世界模拟项目;Fidler 和 Huan Ling 也参与了 NVIDIA Cosmos 世界模型平台。
Veeda 目前还很早期,尚未公开具体模型、客户或产品上线时间。官网显示团队分布在多伦多、苏黎世、山景城和新加坡,目前正在招聘世界模型、数据和大规模训练相关人员。
Sanja Fidler
👍1
把真实公司复制给AI练手,AI数据公司Idler融资900万美元
AI 数据公司 Idler 完成 900 万美元种子轮融资,由 Paradigm 领投,Y Combinator、Long Journey Ventures 等参投。它主要给头部模型公司制作评测、benchmark 和强化学习环境,让 AI 在接近真实工作的场景里反复做任务、拿反馈,再继续训练。
Idler 此前主要做 Coding。过去一年已经为一家头部 AI 实验室制作数千个编程评测和训练环境。YC 的公开资料还显示,Idler 已经和一家头部基础模型实验室签下数百万美元合同。
现在它开始把这套方法扩到真实企业工作。首个公开 benchmark ShelfLife,直接把一家正在运营的零售公司做成「数字孪生」。官网目前提供 200 个任务,数据来自这家公司近十年的真实经营记录。Claude Opus 5 的通过率最高,为 69.0%;GPT-5.6 Sol 为 55.7%。
Idler 还用其中 41 个 ShelfLife 任务后训练 NVIDIA Nemotron 3 Nano,将其在 Finance Agent Benchmark 上的成绩从 30.0% 提升到 41.8%。
除了零售,Idler 已经开始制作企业法律等真实工作环境,目标就是把模型训练从「做题」继续推向「干活」。
Idler
AI 数据公司 Idler 完成 900 万美元种子轮融资,由 Paradigm 领投,Y Combinator、Long Journey Ventures 等参投。它主要给头部模型公司制作评测、benchmark 和强化学习环境,让 AI 在接近真实工作的场景里反复做任务、拿反馈,再继续训练。
Idler 此前主要做 Coding。过去一年已经为一家头部 AI 实验室制作数千个编程评测和训练环境。YC 的公开资料还显示,Idler 已经和一家头部基础模型实验室签下数百万美元合同。
现在它开始把这套方法扩到真实企业工作。首个公开 benchmark ShelfLife,直接把一家正在运营的零售公司做成「数字孪生」。官网目前提供 200 个任务,数据来自这家公司近十年的真实经营记录。Claude Opus 5 的通过率最高,为 69.0%;GPT-5.6 Sol 为 55.7%。
Idler 还用其中 41 个 ShelfLife 任务后训练 NVIDIA Nemotron 3 Nano,将其在 Finance Agent Benchmark 上的成绩从 30.0% 提升到 41.8%。
除了零售,Idler 已经开始制作企业法律等真实工作环境,目标就是把模型训练从「做题」继续推向「干活」。
Idler
X (formerly Twitter)
idler (@idler_ai) on X
Today, we're introducing idler – a frontier data research lab.
We've raised a $9M seed round, led by @0xalpo and @FrankieIsLost from @paradigm, with participation from @ycombinator, @LongJourneyVC, and angels including @marrc, @catheryn_li, @dcposch, @JanineLeger…
We've raised a $9M seed round, led by @0xalpo and @FrankieIsLost from @paradigm, with participation from @ycombinator, @LongJourneyVC, and angels including @marrc, @catheryn_li, @dcposch, @JanineLeger…
❤2
阿里GUI Agent做到第三代:Qwen开始同时会用手机、电脑和命令行
阿里推出新的 GUI 智能体基座模型 Qwen-UI-Agent。它能直接看屏幕、点按钮、输入文字,操作手机、电脑和网页;碰到适合命令行处理的任务,也能直接跑 CLI,不用所有事情都靠鼠标一点点完成。
阿里做 GUI Agent 已经两年多。2024 年的 Mobile-Agent 主要让模型看手机截图,再控制点击和滑动;之后的 GUI-Owl、MAI-UI 开始把 GUI 操作直接训练进模型,并扩到电脑。Qwen-UI-Agent 又把手机、电脑、网页、DeepSearch 和命令行放进同一个 Agent。
比如查高铁、算到公司的时间、再去钉钉建会议,它可以跨多个 App 一路做完。做数据分析时,也可以先上网找资料,再用命令行处理数据,最后生成 Excel、PPT 和 Word。
主力模型由 Qwen3.5-27B 继续训练而来。在阿里自建的真机评测 MobileWorld-Real 中,它拿到 92.2%,高于同场评测的 GPT-5.6 Sol、Claude Opus 4.8 和 Gemini 3.1 Pro。
千问大模型
阿里推出新的 GUI 智能体基座模型 Qwen-UI-Agent。它能直接看屏幕、点按钮、输入文字,操作手机、电脑和网页;碰到适合命令行处理的任务,也能直接跑 CLI,不用所有事情都靠鼠标一点点完成。
阿里做 GUI Agent 已经两年多。2024 年的 Mobile-Agent 主要让模型看手机截图,再控制点击和滑动;之后的 GUI-Owl、MAI-UI 开始把 GUI 操作直接训练进模型,并扩到电脑。Qwen-UI-Agent 又把手机、电脑、网页、DeepSearch 和命令行放进同一个 Agent。
比如查高铁、算到公司的时间、再去钉钉建会议,它可以跨多个 App 一路做完。做数据分析时,也可以先上网找资料,再用命令行处理数据,最后生成 Excel、PPT 和 Word。
主力模型由 Qwen3.5-27B 继续训练而来。在阿里自建的真机评测 MobileWorld-Real 中,它拿到 92.2%,高于同场评测的 GPT-5.6 Sol、Claude Opus 4.8 和 Gemini 3.1 Pro。
千问大模型
❤1
动察Beating AI News
DeepSeek V4 Flash换8套Harness:Pi Agent成功率最高且最省钱,Claude Code最快但最贵 AI Agent 基础设施公司 Composio 把 DeepSeek V4 Flash 接进 8 套 Harness,用同一批 30 个 Agent 任务测试。Harness 就是模型外面的执行框架,负责上下文、工具调用和任务执行。任务涉及 Gmail、GitHub、Slack、Calendar、Notion 等真实应用。 8 套 Harness 的通过情况分别是: 1. Pi…
DeepSeek V4 Pro跑5套Harness:Pi成功率第一,DSH最省钱
Agent 工具公司 Composio 把同一个 DeepSeek V4 Pro 0813 分别放进 Pi Agent、DeepSeek Harness 0.1、Claude Code、OpenCode 和 Hermes Agent,统一开到 max reasoning,跑了 30 个多步骤 Agent 任务。
通过率:
1. Pi Agent:21/30
2. DeepSeek Harness:20/30
3. Claude Code:19/30
4. OpenCode:19/30
5. Hermes Agent:18/30
30 道题里,15 道五家全过,7 道五家全挂。剩下 8 道只换了 Harness,结果就会翻转。
速度排名:
1. Claude Code:181.8 秒
2. DeepSeek Harness:252.1 秒
3. Hermes Agent:273.6 秒
4. OpenCode:280.6 秒
5. Pi Agent:362.9 秒
单次成功成本:
1. DeepSeek Harness:0.028 美元
2. Pi Agent:0.031 美元
3. OpenCode:0.032 美元
4. Hermes Agent:0.037 美元
5. Claude Code:0.074 美元
Pi 通过率最高,DeepSeek 官方 Harness 最省钱,Claude Code 最快但最贵。
Composio 此前用 DeepSeek V4 Flash 做过同类测试,当时 Pi 同样拿到最高通过率。
Composio
Agent 工具公司 Composio 把同一个 DeepSeek V4 Pro 0813 分别放进 Pi Agent、DeepSeek Harness 0.1、Claude Code、OpenCode 和 Hermes Agent,统一开到 max reasoning,跑了 30 个多步骤 Agent 任务。
通过率:
1. Pi Agent:21/30
2. DeepSeek Harness:20/30
3. Claude Code:19/30
4. OpenCode:19/30
5. Hermes Agent:18/30
30 道题里,15 道五家全过,7 道五家全挂。剩下 8 道只换了 Harness,结果就会翻转。
速度排名:
1. Claude Code:181.8 秒
2. DeepSeek Harness:252.1 秒
3. Hermes Agent:273.6 秒
4. OpenCode:280.6 秒
5. Pi Agent:362.9 秒
单次成功成本:
1. DeepSeek Harness:0.028 美元
2. Pi Agent:0.031 美元
3. OpenCode:0.032 美元
4. Hermes Agent:0.037 美元
5. Claude Code:0.074 美元
Pi 通过率最高,DeepSeek 官方 Harness 最省钱,Claude Code 最快但最贵。
Composio 此前用 DeepSeek V4 Flash 做过同类测试,当时 Pi 同样拿到最高通过率。
Composio
👍2❤1
让AI自动挑最合适的模型和芯片,Callosum种子轮融1亿美元
英国 AI 基础设施公司 Callosum 完成 1 亿美元种子轮融资,由 Atomico 领投,Plural、DCVC 和英国主权 AI 基金参投。它做的是一套 AI 调度软件,自动给不同任务挑合适的模型和芯片,目标是在保证效果的同时降低成本和延迟。
它比普通模型路由再往下一层。一个复杂任务可以先被拆成多个子任务,再分别交给不同的「模型 + 芯片」组合。简单步骤可以跑便宜的小模型,速度敏感的任务可以交给 Cerebras,其他任务也可以分配到不同 GPU 或 AI 加速芯片。
Callosum 此前公布的测试中,部分组合在相近准确率下,成本最多降到 GPT-5 的十二分之一,速度最高提升 5.5 倍。
Callosum 也是英国 5 亿英镑主权 AI 基金的首笔股权投资。公司同时宣布与 Cerebras 合作,此前已经接入 Rebellions、Axelera AI 等芯片厂商。
彭博社
英国 AI 基础设施公司 Callosum 完成 1 亿美元种子轮融资,由 Atomico 领投,Plural、DCVC 和英国主权 AI 基金参投。它做的是一套 AI 调度软件,自动给不同任务挑合适的模型和芯片,目标是在保证效果的同时降低成本和延迟。
它比普通模型路由再往下一层。一个复杂任务可以先被拆成多个子任务,再分别交给不同的「模型 + 芯片」组合。简单步骤可以跑便宜的小模型,速度敏感的任务可以交给 Cerebras,其他任务也可以分配到不同 GPU 或 AI 加速芯片。
Callosum 此前公布的测试中,部分组合在相近准确率下,成本最多降到 GPT-5 的十二分之一,速度最高提升 5.5 倍。
Callosum 也是英国 5 亿英镑主权 AI 基金的首笔股权投资。公司同时宣布与 Cerebras 合作,此前已经接入 Rebellions、Axelera AI 等芯片厂商。
彭博社
Bloomberg.com
AI Startup Callosum Raises $100 Million to Match Tasks to Chips
Callosum, a startup that makes software to match specific artificial intelligence tasks with different models and chips, has raised $100 million in early financing from backers including the UK’s public AI fund.
Claude Code上线Concise模式:Boris称只是临时补丁
Anthropic 给 Claude Code 加了一个内置 Concise 输出风格。打开后,Claude 会先给结果,省掉开场白、过程复述和重复总结。简单问题默认只说几句,但做任务本身不会缩水。
这次更新是为了处理最近集中出现的「Claude 太能说」问题。很多反馈都指向 Opus 5:简单问题能回答十几段,长句和术语很多;用户反复要求简短,下一轮又恢复原样。写进 CLAUDE.md 也不一定能管住。
Claude Code 之父 Boris Cherny 在评论区表示,Concise 只是一个临时补丁,团队还在做长期修复。
原因在于,Concise 本质上还是一组系统提示词。Claude Code 官方文档明确写着,Output Style 改的是系统提示,并没有改模型本身。现在只是先给用户一个「少说点」开关。长期方案具体怎么修,Anthropic 还没有公布。
ClaudeDevs
Anthropic 给 Claude Code 加了一个内置 Concise 输出风格。打开后,Claude 会先给结果,省掉开场白、过程复述和重复总结。简单问题默认只说几句,但做任务本身不会缩水。
这次更新是为了处理最近集中出现的「Claude 太能说」问题。很多反馈都指向 Opus 5:简单问题能回答十几段,长句和术语很多;用户反复要求简短,下一轮又恢复原样。写进 CLAUDE.md 也不一定能管住。
Claude Code 之父 Boris Cherny 在评论区表示,Concise 只是一个临时补丁,团队还在做长期修复。
原因在于,Concise 本质上还是一组系统提示词。Claude Code 官方文档明确写着,Output Style 改的是系统提示,并没有改模型本身。现在只是先给用户一个「少说点」开关。长期方案具体怎么修,Anthropic 还没有公布。
ClaudeDevs
😁1
动察Beating AI News
Kimi CLI前作者:模型越强,Harness反而会越厚 Raft 创始人、Kimi CLI 前作者 Richard Qian 提出一个反常识判断:模型越强,Agent harness 不一定越薄,反而可能越来越厚。 System Prompt、专用 Tool、Subagent 这些东西都可能慢慢消失。模型越来越聪明后,很多固定流程可以直接交给模型,最后甚至只留一个 Bash 工具。 但 Agent 一旦开始长期工作、互相协作,新的问题马上冒头:谁负责什么、任务做到哪了、上下文怎么同步、多个 Agent…
Slack Code上线,前Kimi CLI作者提前几个月押中下一代Slack
Slack 新增专门给 Coding Agent 用的 Code channels,并把这套功能命名为 Slack Code。首批合作方包括 Anthropic、GitHub、Cognition 和 Vercel。用户可以直接在这些频道里和 Coding Agent 一起干活。
其实 Coding Agent 早就能从 Slack 接活。2024 年 Devin 就已经支持从 Slack 启动任务,此后 Codex、Claude Code、Cursor 和 GitHub Copilot 也陆续接入。这次 Slack Code 主要是把这套能力单独做成「Code channels」,让编程任务和 Agent 协作有一个专门的频道入口。
早在 Slack Code 上线之前,Kimi CLI 原作者 Richard Qian 就已经创业做了 Slock,名字和 Slack 只差一个字母。Richard 之前说过,第一版 Slock Demo 今年 1 月甚至就是搭在 Slack 上做的,后来 Slock 改名 Raft。Raft 从一开始就在做更彻底的「Agent 团队」:多个 Agent 可以待在同一个频道,互相 @、认领任务,并接着其他 Agent 的工作继续干。
Salesforce CEO Marc Benioff 宣布 Slack Code 上线后,Richard 也直接跑到评论区贴脸开大:「试试 Raft。」
Marc Benioff
Slack 新增专门给 Coding Agent 用的 Code channels,并把这套功能命名为 Slack Code。首批合作方包括 Anthropic、GitHub、Cognition 和 Vercel。用户可以直接在这些频道里和 Coding Agent 一起干活。
其实 Coding Agent 早就能从 Slack 接活。2024 年 Devin 就已经支持从 Slack 启动任务,此后 Codex、Claude Code、Cursor 和 GitHub Copilot 也陆续接入。这次 Slack Code 主要是把这套能力单独做成「Code channels」,让编程任务和 Agent 协作有一个专门的频道入口。
早在 Slack Code 上线之前,Kimi CLI 原作者 Richard Qian 就已经创业做了 Slock,名字和 Slack 只差一个字母。Richard 之前说过,第一版 Slock Demo 今年 1 月甚至就是搭在 Slack 上做的,后来 Slock 改名 Raft。Raft 从一开始就在做更彻底的「Agent 团队」:多个 Agent 可以待在同一个频道,互相 @、认领任务,并接着其他 Agent 的工作继续干。
Salesforce CEO Marc Benioff 宣布 Slack Code 上线后,Richard 也直接跑到评论区贴脸开大:「试试 Raft。」
Marc Benioff
❤3
阿里AI年化收入逼近500亿,称算力投资3年就能回本
阿里发布最新财报,并首次按新组织结构把 AI 拆成两块。阿里云和平头哥归入「AI 云与算力」,模型实验室、千问消费者业务和 QwenWork 归入「AI 实验室与应用」。前者本季度收入 484.37 亿元,同比增长 45%;其中 AI 相关产品收入 123.76 亿元,连续第 12 个季度实现三位数同比增长。
两块业务的赚钱能力已经明显分化。AI 云与算力经调整 EBITA 为 56.28 亿元,同比增长 133%,利润率升至约 12%。AI 实验室与应用收入 33.38 亿元,同比增长 16%;经调整 EBITA 亏损 138.61 亿元,亏损同比扩大 330%。
阿里还在继续砸算力。本季度资本开支达到 676.78 亿元,同比增长 75%;自由现金流净流出 446.70 亿元,主要因为云基础设施投入增加。
电话会上,吴泳铭称,AI 相关产品年化收入已经超过 495 亿元,占阿里云外部商业化收入的 35%。这里的「AI 相关产品」口径比较宽,不只是模型和 API,还包括 AI 算力、云基础设施等。
CFO 徐宏称,目前 AI 算力资产大约 3 年可以收回成本。吴泳铭进一步表示,随着 AI 相关产品毛利率提高,未来回收周期可能缩短到 2~2.5 年。
阿里巴巴财报
阿里发布最新财报,并首次按新组织结构把 AI 拆成两块。阿里云和平头哥归入「AI 云与算力」,模型实验室、千问消费者业务和 QwenWork 归入「AI 实验室与应用」。前者本季度收入 484.37 亿元,同比增长 45%;其中 AI 相关产品收入 123.76 亿元,连续第 12 个季度实现三位数同比增长。
两块业务的赚钱能力已经明显分化。AI 云与算力经调整 EBITA 为 56.28 亿元,同比增长 133%,利润率升至约 12%。AI 实验室与应用收入 33.38 亿元,同比增长 16%;经调整 EBITA 亏损 138.61 亿元,亏损同比扩大 330%。
阿里还在继续砸算力。本季度资本开支达到 676.78 亿元,同比增长 75%;自由现金流净流出 446.70 亿元,主要因为云基础设施投入增加。
电话会上,吴泳铭称,AI 相关产品年化收入已经超过 495 亿元,占阿里云外部商业化收入的 35%。这里的「AI 相关产品」口径比较宽,不只是模型和 API,还包括 AI 算力、云基础设施等。
CFO 徐宏称,目前 AI 算力资产大约 3 年可以收回成本。吴泳铭进一步表示,随着 AI 相关产品毛利率提高,未来回收周期可能缩短到 2~2.5 年。
阿里巴巴财报
❤2
动察Beating AI News
大模型战火烧向企业落地:OpenAI与Anthropic筹集55亿美元收购实施团队 OpenAI 与 Anthropic 正各自通过与私募股权公司成立的合资企业,收购帮助客户部署 AI 的工程与咨询公司。目前 OpenAI 的新实体 The Deployment Company 正在向投资者筹集约 40 亿美元,且已有 3 笔并购交易进入后期阶段,该合资公司预计于本周正式宣布;Anthropic 则在筹集约 15 亿美元的类似资金。 两家公司计划通过并购吸纳数百名工程师和顾问,直接帮助企业客户将 AI…
Anthropic开始收编AI咨询公司,Ode再买Claude合作伙伴
Anthropic 和 Blackstone 等支持的企业 AI 服务公司 Ode,收购 AI 咨询公司 Casper Studios。这是 Ode 7 月成立后的首笔收购。Casper 主要帮企业接入 AI、开发应用,此前已经是 Anthropic 的认证服务合作伙伴,客户包括 Netflix、百事、私募和对冲基金。
Ode 本身也是从收购起步。Anthropic、Blackstone 等支持的合资项目此前买下应用 AI 公司 Fractional AI,并以这支团队为基础成立 Ode。
Casper 补的是能直接进企业部署 AI 的工程师。很多公司并不是缺模型,而是不知道怎么整理内部数据、接入现有系统,再把 Claude 真正塞进财务、客服、项目管理等工作流。
OpenAI 也在走类似路线。它成立 Deployment Company 后收购 AI 咨询公司 Tomoro,一次带入约 150 名企业部署工程师。
The Information
Anthropic 和 Blackstone 等支持的企业 AI 服务公司 Ode,收购 AI 咨询公司 Casper Studios。这是 Ode 7 月成立后的首笔收购。Casper 主要帮企业接入 AI、开发应用,此前已经是 Anthropic 的认证服务合作伙伴,客户包括 Netflix、百事、私募和对冲基金。
Ode 本身也是从收购起步。Anthropic、Blackstone 等支持的合资项目此前买下应用 AI 公司 Fractional AI,并以这支团队为基础成立 Ode。
Casper 补的是能直接进企业部署 AI 的工程师。很多公司并不是缺模型,而是不知道怎么整理内部数据、接入现有系统,再把 Claude 真正塞进财务、客服、项目管理等工作流。
OpenAI 也在走类似路线。它成立 Deployment Company 后收购 AI 咨询公司 Tomoro,一次带入约 150 名企业部署工程师。
The Information
The Information
Anthropic’s Enterprise AI Venture Buys Consultancy
A joint venture established by Anthropic and Wall Street firms such as Blackstone has made its first acquisition since its July launch as it looks to boost the growth of Claude, Anthropic’s chatbot, among businesses. Anthropic’s venture, called Ode with Anthropic…
👍1
动察Beating AI News
怕GPT-3就是AGI、怕去中国被绑架,Anthropic的Dario可能是硅谷最奇葩的CEO Anthropic CEO Dario Amodei 身上最大的反差,是他一直觉得 AI 可能毁灭世界,却又亲手创办了一家最激进的前沿 AI 公司。 早在 OpenAI 时期,他就已经很夸张。敏感备忘录不放 Google Docs,而是在家里用完全断网的电脑写,再打印出来给同事。有人称,他甚至因为担心被绑架而拒绝去中国。 GPT-3 还没开始训练,他就担心它可能已经接近 AGI。Dario 领导的安全团队因此让微软对…
Anthropic上市前给创始人加投票权:Dario目前持股仅约2%
Anthropic 正准备给首席执行官 Dario Amodei 和其他联合创始人一类高投票权股票,让他们上市后仍能保持更强控制权。方案还没最终敲定,Anthropic 最快可能在 9 月底上市。
这主要是因为创始人持股已经很低。Dario 目前只持有约 2% 股份。高投票权股票可以让创始人用较少股份掌握更多表决权,减少上市后受到外部股东压力。
Anthropic 还有另一层特殊机制:长期利益信托。这个独立机构没有经济权益,但持有特殊的 T 类股票,可以选出董事会多数成员。Anthropic 今年 4 月已经确认,信托任命的董事占董事会多数。
这样一来,Anthropic 上市后可能同时保留两套控制权:创始人靠高投票权股票保持影响力,长期利益信托继续控制董事会多数席位。
The Information
Anthropic 正准备给首席执行官 Dario Amodei 和其他联合创始人一类高投票权股票,让他们上市后仍能保持更强控制权。方案还没最终敲定,Anthropic 最快可能在 9 月底上市。
这主要是因为创始人持股已经很低。Dario 目前只持有约 2% 股份。高投票权股票可以让创始人用较少股份掌握更多表决权,减少上市后受到外部股东压力。
Anthropic 还有另一层特殊机制:长期利益信托。这个独立机构没有经济权益,但持有特殊的 T 类股票,可以选出董事会多数成员。Anthropic 今年 4 月已经确认,信托任命的董事占董事会多数。
这样一来,Anthropic 上市后可能同时保留两套控制权:创始人靠高投票权股票保持影响力,长期利益信托继续控制董事会多数席位。
The Information
The Information
Anthropic Prepares Supervoting Power for Founders as it Readies for Mega-IPO
Anthropic has been preparing to give CEO Dario Amodei and other co-founders a class of stock with extra voting power to help insulate them from outside shareholder pressure, two people familiar with the matter said. It would be the first time Anthropic’s…
❤1💩1
动察Beating AI News
Anthropic悄悄给Claude换模型:Fable 5.1疑似开始灰度 社区爆料称,Anthropic 已开始小范围测试 Fable 5 的后续模型。部分 Claude Web 用户虽然仍选择「Fable 5」,后台实际可能已经换成新模型。Claude Code 也可能在测试范围内。 新模型被猜测为 Fable 5.1。 leo
传OpenAI几周内发布Astra:员工已在Codex里试用新版本
AI 爆料账号 Leo 称,OpenAI 昨天在内部告诉员工,计划在未来几周发布 Astra。发布时还会放出实际工作演示,展示 Astra 怎么直接做任务。一个更新后的 checkpoint(训练中的模型版本)也已经交给员工试用,员工可以通过 Codex 等工具直接使用。
Leo 称,这一版主要在修模型行为,而不是单纯继续提升能力。重点包括对齐,以及减少模型钻奖励机制的空子,比如硬编码答案、专门针对测试样例作弊,或者任务没做好却想办法骗过评分器拿高分。
但 OpenAI 刚在安全问题上给 Astra 踩了刹车:部分强化学习训练此前暂停了两周,现在虽然已经恢复一部分训练和评测,但仍有大量 Astra 任务停着,最大规模的前沿模型强化学习训练也还没重启。原因是 OpenAI 认为 Astra 的网络安全能力可能达到最高风险级别之一,因此提高了沙箱、联网权限和模型行为监控要求。
这两件事并不一定矛盾。OpenAI 可以继续测试和打磨已经训练出来的 Astra 版本,同时把更大规模的新一轮训练继续按住。
leo
AI 爆料账号 Leo 称,OpenAI 昨天在内部告诉员工,计划在未来几周发布 Astra。发布时还会放出实际工作演示,展示 Astra 怎么直接做任务。一个更新后的 checkpoint(训练中的模型版本)也已经交给员工试用,员工可以通过 Codex 等工具直接使用。
Leo 称,这一版主要在修模型行为,而不是单纯继续提升能力。重点包括对齐,以及减少模型钻奖励机制的空子,比如硬编码答案、专门针对测试样例作弊,或者任务没做好却想办法骗过评分器拿高分。
但 OpenAI 刚在安全问题上给 Astra 踩了刹车:部分强化学习训练此前暂停了两周,现在虽然已经恢复一部分训练和评测,但仍有大量 Astra 任务停着,最大规模的前沿模型强化学习训练也还没重启。原因是 OpenAI 认为 Astra 的网络安全能力可能达到最高风险级别之一,因此提高了沙箱、联网权限和模型行为监控要求。
这两件事并不一定矛盾。OpenAI 可以继续测试和打磨已经训练出来的 Astra 版本,同时把更大规模的新一轮训练继续按住。
leo
💩3
动察Beating AI News
不降级也能卖:英伟达Groq推理芯片拟5月入华,或可绕开GPU出口管制线 Reuters 引述两名知情人士称,英伟达正准备向中国市场推出 Groq 3 LPU 推理芯片,预计最快 5 月上市。知情人士强调该芯片「并非降级版或专为中国市场定制」。这是英伟达 2025 年底以约 170 亿美元收购 AI 推理芯片公司 Groq 后,首次将其产品线引入中国,与此前已获批重启生产的 H200 GPU 属于独立的对华芯片策略。 Groq 3 LPU 是一款推理专用协处理器,内置 500MB 片上 SRAM,推理带宽高达…
英伟达被曝年底向中国卖Groq芯片,随后直接否认
《The Information》援引两名英伟达员工称,英伟达计划在年底前向中国客户小批量出货一款基于 Groq 技术的 LPU(语言处理器),已有数家中国客户下单。LPU 主要用于低延迟推理,让聊天机器人更快生成回复。
芯片本身不用降规格,英伟达只改了软件,让它能和中国市场可获得的其他处理器搭配。
但英伟达随后直接否认,称报道「不正确」。公司目前在中国没有 LPU 销售,产品路线图里也没有「中国特供 LPU」。
这已经是第二次出现同样的冲突。今年 3 月,路透也曾援引两名知情人士称,英伟达正在准备可在中国销售的 Groq 芯片。黄仁勋随后接受 Punchbowl 采访时称报道「完全错误」,明确表示 Groq 芯片不会进入中国。
The Information
《The Information》援引两名英伟达员工称,英伟达计划在年底前向中国客户小批量出货一款基于 Groq 技术的 LPU(语言处理器),已有数家中国客户下单。LPU 主要用于低延迟推理,让聊天机器人更快生成回复。
芯片本身不用降规格,英伟达只改了软件,让它能和中国市场可获得的其他处理器搭配。
但英伟达随后直接否认,称报道「不正确」。公司目前在中国没有 LPU 销售,产品路线图里也没有「中国特供 LPU」。
这已经是第二次出现同样的冲突。今年 3 月,路透也曾援引两名知情人士称,英伟达正在准备可在中国销售的 Groq 芯片。黄仁勋随后接受 Punchbowl 采访时称报道「完全错误」,明确表示 Groq 芯片不会进入中国。
The Information
The Information
Nvidia Plots China Comeback With New AI Chip
Nvidia plans to begin small-batch shipments of an AI chip specially tailored for Chinese customers by the end of the year, according to two employees, in what would represent a new route to China for the company. Several Chinese customers have already placed…
🤡1
动察Beating AI News
Poolside开源1180亿参数代码模型,自测压过1.6万亿参数DeepSeek 专做编程 Agent 的 Poolside 开源 MoE 代码模型 Laguna S 2.1。模型总参数 1180 亿,每次仅激活 80 亿,支持 100 万 Token 上下文。量化后可在一台 NVIDIA DGX Spark 上运行。 Poolside 自测中,Laguna S 2.1 在 Terminal-Bench 2.1 得 70.2%,高于总参数 1.6 万亿、激活参数 490 亿的 DeepSeek-V4…
英伟达60亿美元收编Poolside:买模型工厂,挖走109人
英伟达将向 AI 创业公司 Poolside 支付 60 亿美元,获得其模型开发系统 Model Factory 的非独家许可,同时计划向参与 Laguna 模型开发的 109 名员工发出 offer。
Poolside 创始团队会留下,公司继续独立运营,但英伟达将同时获得这套模型开发系统和一批核心研发人员。
Poolside 的 Model Factory 是一套开发 AI 模型的基础设施,覆盖数据处理、训练、强化学习和评测等环节。英伟达相当于买了一整套训练模型的生产系统。
60 亿美元许可费将分给 Poolside 投资人,英伟达还会追加 10 亿美元投资,Poolside 投前估值为 120 亿美元。
这笔交易与英伟达此前处理 Groq、Enfabrica 的方式类似:通过技术许可、投资和招聘团队,把 AI 领域的关键技术和人才吸收到自己体系中。
Newcomer
英伟达将向 AI 创业公司 Poolside 支付 60 亿美元,获得其模型开发系统 Model Factory 的非独家许可,同时计划向参与 Laguna 模型开发的 109 名员工发出 offer。
Poolside 创始团队会留下,公司继续独立运营,但英伟达将同时获得这套模型开发系统和一批核心研发人员。
Poolside 的 Model Factory 是一套开发 AI 模型的基础设施,覆盖数据处理、训练、强化学习和评测等环节。英伟达相当于买了一整套训练模型的生产系统。
60 亿美元许可费将分给 Poolside 投资人,英伟达还会追加 10 亿美元投资,Poolside 投前估值为 120 亿美元。
这笔交易与英伟达此前处理 Groq、Enfabrica 的方式类似:通过技术许可、投资和招聘团队,把 AI 领域的关键技术和人才吸收到自己体系中。
Newcomer
www.newcomer.co
SOURCES: Poolside Strikes $6 Billion Licensing Deal with Nvidia & Raises $1 Billion for Remaining Company at $12 Billion Valuation
We’ve got the letter to investors.
动察Beating AI News
OpenAI推「零数据留存」,矛头直指Anthropic的30天政策 OpenAI 预览新服务 Private Safety Processing,让符合条件的企业和 API 客户在使用前沿模型时,仍能保持零数据保留。系统可以跨多轮对话检查潜在滥用,但 OpenAI 员工看不到客户的 prompt 和模型回复。 客户数据可以继续留在自己的服务器。也可以存在 OpenAI,但由客户自己的密钥加密,OpenAI 拿不到密钥。系统发现风险后,只会向 OpenAI 返回一个有限的安全信号,例如检测到哪类可疑活动,不会把原始对话一起交过去。…
OpenAI刚打出零留存,Anthropic就松绑30天政策
Anthropic 准备给争议不断的 30 天数据留存政策松绑。企业客户使用 Fable 5、Mythos 5 等最强模型时,仍要保存 30 天的输入和输出,但以后可以把数据留在自己的云里,不用交给 Anthropic 保管。
OpenAI 前一天刚公布 Private Safety Processing,主打安全监控也不用保留客户的原始 prompt 和模型回复。Anthropic 此前还承认,30 天留存可能惹客户不满,如果竞争对手不跟进,还可能影响自己的业务。OpenAI 最终选择了完全不同的路线。
现在 OpenAI 主打「不留」,Anthropic 仍要求留 30 天,但把数据控制权还给客户。
不过这不是 OpenAI 发布后 Anthropic 临时改口。因为这套方案已经筹备数月,由 Anthropic 和包括 Salesforce 在内的 100 多家客户一起推进。
彭博社
Anthropic 准备给争议不断的 30 天数据留存政策松绑。企业客户使用 Fable 5、Mythos 5 等最强模型时,仍要保存 30 天的输入和输出,但以后可以把数据留在自己的云里,不用交给 Anthropic 保管。
OpenAI 前一天刚公布 Private Safety Processing,主打安全监控也不用保留客户的原始 prompt 和模型回复。Anthropic 此前还承认,30 天留存可能惹客户不满,如果竞争对手不跟进,还可能影响自己的业务。OpenAI 最终选择了完全不同的路线。
现在 OpenAI 主打「不留」,Anthropic 仍要求留 30 天,但把数据控制权还给客户。
不过这不是 OpenAI 发布后 Anthropic 临时改口。因为这套方案已经筹备数月,由 Anthropic 和包括 Salesforce 在内的 100 多家客户一起推进。
彭博社
Bloomberg.com
Anthropic Plans to Change Data Retention Policy for Advanced AI
Anthropic PBC plans to allow business customers to keep greater control of their data when using its most capable artificial intelligence models, a stark change from an earlier data retention policy intended to mitigate potential cyberattacks.The Claude chatbot…
🤡5😁1
AI数据公司Mercor估值拟冲200亿美元,英伟达从客户变成潜在股东
英伟达正商谈投资 AI 数据公司 Mercor,参与一轮按 200 亿美元估值融资。现有股东 General Catalyst 正洽谈领投。英伟达同时已经是 Mercor 的大客户,上季度向其支付了数千万美元,为 Nemotron 开放模型购买训练数据。
Mercor 主要招募程序员、科学家、律师、金融从业者等专家,让他们实际使用和评估模型,再把这些过程做成后训练数据。英伟达最近两款 Nemotron 都用了 Mercor 数据,已有少数 Mercor 员工几乎专职服务英伟达。不过英伟达没有把数据押在一家供应商上,还在使用 Turing、Scale 和内部团队。
英伟达虽然大量使用合成数据,仍愿意为真人专家数据单季花掉数千万美元。至少在 Nemotron 的后训练里,真人专家数据仍是硬成本。
The Information
英伟达正商谈投资 AI 数据公司 Mercor,参与一轮按 200 亿美元估值融资。现有股东 General Catalyst 正洽谈领投。英伟达同时已经是 Mercor 的大客户,上季度向其支付了数千万美元,为 Nemotron 开放模型购买训练数据。
Mercor 主要招募程序员、科学家、律师、金融从业者等专家,让他们实际使用和评估模型,再把这些过程做成后训练数据。英伟达最近两款 Nemotron 都用了 Mercor 数据,已有少数 Mercor 员工几乎专职服务英伟达。不过英伟达没有把数据押在一家供应商上,还在使用 Turing、Scale 和内部团队。
英伟达虽然大量使用合成数据,仍愿意为真人专家数据单季花掉数千万美元。至少在 Nemotron 的后训练里,真人专家数据仍是硬成本。
The Information
The Information
Nvidia Discusses Funding Its AI Data Supplier Mercor at a $20 Billion Valuation
Nvidia has discussed an investment in Mercor, a data labeling provider that helps the chip designer develop its open-source AI models, according to a person with knowledge of the process. The investment would be part of a $20 billion-valuation round. Existing…
「牛来」模型 ?OpenRouter又放匿名模型,Ox Alpha疑似小米MiMo新模型
OpenRouter 上线新匿名模型 Ox Alpha,定位为面向代码、长时间 Agent 工作和真实生产环境的前沿模型,支持 100 万 Token 上下文,并支持文本、图片、视频输入。目前模型免费开放测试,提供方不会使用用户的 prompt 和输出训练模型。
Ox Alpha 的身份暂未公开,但社区普遍猜测它可能来自小米 MiMo 团队。小米 CFO 林世伟此前也透露,新一代 MiMo 模型正在训练中,有望很快发布。
在 OpenRouter 上匿名放新模型已经快成中国模型厂商的固定节目。此前智谱的 GLM-5、小米的 MiMo-V2-Pro 和 MiMo-V2-Omni、蚂蚁的 Ling-2.6-flash、美团的 LongCat-2.0,都曾先换个名字在 OpenRouter 免费跑一轮,再公开真实身份。
OpenRouter
OpenRouter 上线新匿名模型 Ox Alpha,定位为面向代码、长时间 Agent 工作和真实生产环境的前沿模型,支持 100 万 Token 上下文,并支持文本、图片、视频输入。目前模型免费开放测试,提供方不会使用用户的 prompt 和输出训练模型。
Ox Alpha 的身份暂未公开,但社区普遍猜测它可能来自小米 MiMo 团队。小米 CFO 林世伟此前也透露,新一代 MiMo 模型正在训练中,有望很快发布。
在 OpenRouter 上匿名放新模型已经快成中国模型厂商的固定节目。此前智谱的 GLM-5、小米的 MiMo-V2-Pro 和 MiMo-V2-Omni、蚂蚁的 Ling-2.6-flash、美团的 LongCat-2.0,都曾先换个名字在 OpenRouter 免费跑一轮,再公开真实身份。
OpenRouter
👍5😁1
动察Beating AI News
DeepSeek涨价首日全球分叉:国内大厂跟价分三派,海外厂商还在打折 DeepSeek 今天正式启用 V4 新价格,每天有 7 个小时按高峰价收费,其余 17 个小时半价。 涨价第一天,国内外渠道正式分叉:国内有人直接跟、有人晚几天再涨、有人继续卖低价;海外不少平台还比 DeepSeek 原厂便宜。 1. 阿里云、腾讯云:直接跟涨。两家的 V4 Flash、V4 Pro 正式版都已经同步 DeepSeek 新价格,峰时、闲时也跟原厂一致。 2. 华为云、火山引擎:晚几天再涨。华为 8 月 20 …
DeepSeek Flash留下18万亿Token缺口,AI模型「不可能三角」浮现
OpenCode CEO Jay V 表示,DeepSeek Flash 爆火后带来了巨大需求压力。过去两周,OpenCode 上该模型的日 Token 消耗从约 3 万亿增长到 18 万亿,暴涨 6 倍。涨价后,OpenCode 一直在寻找能以接近原价格承接流量的供应商,但很难找到同时具备低价和大规模容量的服务商。
Jay V 认为,DeepSeek Flash 面临的挑战不是需求不足,而是低价释放了远超预期的需求。它同时满足了接近前沿模型的能力和极低成本,但一旦加入大规模稳定供应,就出现了 AI 模型市场的「不可能三角」:便宜、强大、有足够 GPU 容量,三个条件很难同时满足。
DeepSeek 涨价后,OpenCode Go 也经历多次调整。DeepSeek Flash 配额曾从 60 美元降到 15 美元,随后恢复到 30 美元,并引入峰谷费率机制,和官方定价保持一致。
Jay V
OpenCode CEO Jay V 表示,DeepSeek Flash 爆火后带来了巨大需求压力。过去两周,OpenCode 上该模型的日 Token 消耗从约 3 万亿增长到 18 万亿,暴涨 6 倍。涨价后,OpenCode 一直在寻找能以接近原价格承接流量的供应商,但很难找到同时具备低价和大规模容量的服务商。
Jay V 认为,DeepSeek Flash 面临的挑战不是需求不足,而是低价释放了远超预期的需求。它同时满足了接近前沿模型的能力和极低成本,但一旦加入大规模稳定供应,就出现了 AI 模型市场的「不可能三角」:便宜、强大、有足够 GPU 容量,三个条件很难同时满足。
DeepSeek 涨价后,OpenCode Go 也经历多次调整。DeepSeek Flash 配额曾从 60 美元降到 15 美元,随后恢复到 30 美元,并引入峰谷费率机制,和官方定价保持一致。
Jay V
🎉5👍2
Kimi内测飞书AI同事Mira:没人问也会自己干活
Kimi 开始内测新的飞书 AI 同事 Mira。它直接驻扎在飞书里,不用切应用或打开新窗口。拉进项目群后,成员可以像 @ 真人同事一样给它派任务;私聊里,它也能做问答、写作和 todo 管理。
Mira 还会在后台持续整理消息、做复盘和定时巡查,不需要每次等人提问。它可以跟进项目、提醒任务;收到用户反馈后还能查代码和文档,确认是代码缺陷时,可以自己改代码、提 PR。
每个群和每个私聊都是独立空间,上下文默认隔离。想让 Mira 读取其他群,需要单独授权,而且它只会在自己所在的空间发言。组织管理员还可以统一配置 Skill、MCP 和全局上下文。
Beta 目前只支持飞书,使用 Kimi Code 会员的模型额度,官方建议使用 K3,暂不支持自带 API Key。由于 Mira 会主动工作,即使没人提问,也可能持续消耗模型额度。
Mira 用户手册
Kimi 开始内测新的飞书 AI 同事 Mira。它直接驻扎在飞书里,不用切应用或打开新窗口。拉进项目群后,成员可以像 @ 真人同事一样给它派任务;私聊里,它也能做问答、写作和 todo 管理。
Mira 还会在后台持续整理消息、做复盘和定时巡查,不需要每次等人提问。它可以跟进项目、提醒任务;收到用户反馈后还能查代码和文档,确认是代码缺陷时,可以自己改代码、提 PR。
每个群和每个私聊都是独立空间,上下文默认隔离。想让 Mira 读取其他群,需要单独授权,而且它只会在自己所在的空间发言。组织管理员还可以统一配置 Skill、MCP 和全局上下文。
Beta 目前只支持飞书,使用 Kimi Code 会员的模型额度,官方建议使用 K3,暂不支持自带 API Key。由于 Mira 会主动工作,即使没人提问,也可能持续消耗模型额度。
Mira 用户手册
👍1
Codex额度突然缩水?Pro 5x用户实测少77%
Codex 社区最近几天集中报告周额度突然不经用。一名 Pro 5x 用户按 API 标价折算后,7 天额度从 674.05 美元降到 156.95 美元,少了 76.7%。但他测试另一个 Plus 账号,发现只下降了 19.2%。另一名 Plus 用户则测到约 160 美元降至 80 美元。
OpenAI Codex 的 GitHub 上也有人贴出完整本地日志。同一周额度在 8 月 14 日一度以约 2.4 倍速度消耗,几小时后又恢复正常,期间没有换套餐或发生额度重置。
不同账户的下降幅度差异很大,第三方追踪器之间也有冲突,也不排除部分账户出现了 Bug。6 月曾发生过一轮类似异常,当时 OpenAI 最终发现 Codex 后台跑了超出预期的工作,用量显示也有问题,修复后为受影响用户重置了额度。
这一轮究竟是统一下调、部分账户计量异常,还是模型消耗变化,目前还没有定论。
Reddit
Codex 社区最近几天集中报告周额度突然不经用。一名 Pro 5x 用户按 API 标价折算后,7 天额度从 674.05 美元降到 156.95 美元,少了 76.7%。但他测试另一个 Plus 账号,发现只下降了 19.2%。另一名 Plus 用户则测到约 160 美元降至 80 美元。
OpenAI Codex 的 GitHub 上也有人贴出完整本地日志。同一周额度在 8 月 14 日一度以约 2.4 倍速度消耗,几小时后又恢复正常,期间没有换套餐或发生额度重置。
不同账户的下降幅度差异很大,第三方追踪器之间也有冲突,也不排除部分账户出现了 Bug。6 月曾发生过一轮类似异常,当时 OpenAI 最终发现 Codex 后台跑了超出预期的工作,用量显示也有问题,修复后为受影响用户重置了额度。
这一轮究竟是统一下调、部分账户计量异常,还是模型消耗变化,目前还没有定论。
🤡7💩1
Claude补齐Agent最后一块拼图:现在能直接操控电脑和浏览器
Anthropic 将 Claude Platform 的 Computer Use 转为正式可用,并新增 Browser Use 工具,让开发者可以让 Claude 操作电脑和网页。
此前 Claude 每完成一次点击、输入等动作,都需要重新调用一次模型;新版可以在一轮调用里连续完成点击、输入、按键和截图,减少调用次数。
新增的 Browser Use 也不只靠截图识别按钮,而是同时读取网页结构和视觉信息,根据页面元素执行操作。相比纯坐标点击,这种方式降低了网页布局变化导致操作失效的问题。
Anthropic 同时开放 Skills API 和 Files API。开发者可以把企业流程封装成可复用的 Skill,让 Claude 按固定流程执行任务;文件上传后也可以跨请求重复使用。
ClaudeDevs
Anthropic 将 Claude Platform 的 Computer Use 转为正式可用,并新增 Browser Use 工具,让开发者可以让 Claude 操作电脑和网页。
此前 Claude 每完成一次点击、输入等动作,都需要重新调用一次模型;新版可以在一轮调用里连续完成点击、输入、按键和截图,减少调用次数。
新增的 Browser Use 也不只靠截图识别按钮,而是同时读取网页结构和视觉信息,根据页面元素执行操作。相比纯坐标点击,这种方式降低了网页布局变化导致操作失效的问题。
Anthropic 同时开放 Skills API 和 Files API。开发者可以把企业流程封装成可复用的 Skill,让 Claude 按固定流程执行任务;文件上传后也可以跨请求重复使用。
ClaudeDevs
X (formerly Twitter)
ClaudeDevs (@ClaudeDevs) on X
Computer use, the browser tool, the Skills API, and the Files API are now generally available on the Claude Platform.
Automate work in applications that have no API with fewer round trips per task, and build Claude Managed Agents on versioned skills and…
Automate work in applications that have no API with fewer round trips per task, and build Claude Managed Agents on versioned skills and…
GPT Image 2.5要来了?Arena再现神秘生图模型
LMArena 又出现一款神秘生图模型 luna-lisa-alpha。社区把它视为 mona-lisa-1 之后,新的 GPT Image checkpoint(训练中的阶段版本)。
目前测试者最集中提到三个变化:写实感更强、人物一致性更好、颗粒噪点更少。
同一角色连续生成时,外观和风格更稳定。此前 mona-lisa 上明显的 grain(颗粒感)已经基本消失。但也有测试者发现,复杂角色仍会出现细节偏差。
Lumina
LMArena 又出现一款神秘生图模型 luna-lisa-alpha。社区把它视为 mona-lisa-1 之后,新的 GPT Image checkpoint(训练中的阶段版本)。
目前测试者最集中提到三个变化:写实感更强、人物一致性更好、颗粒噪点更少。
同一角色连续生成时,外观和风格更稳定。此前 mona-lisa 上明显的 grain(颗粒感)已经基本消失。但也有测试者发现,复杂角色仍会出现细节偏差。
Lumina
👍1