动察Beating AI News
3.44K subscribers
1.11K photos
2 videos
1 file
3.74K links
AI新闻信息流
Download Telegram
动察Beating AI News
豆包给Agent配上云电脑:合上笔记本也能继续干活 豆包「工作任务」新增云电脑运行环境。用户可以把数据调研、批量处理文件、定时任务等重活交给云端,豆包会在一台独立的云电脑里持续执行。 这样任务不用一直占着自己的电脑。人在外面或者合上笔记本,云端任务也能继续跑,还可以用手机查看进度和结果。社区实测也确认,目前工作任务已经可以在本地和云端之间切换。 豆包现在相当于提供两套工作环境:本地数据和轻任务直接用自己的电脑,响应更快;长时间、持续运行的任务则可以扔给云电脑。 豆包
豆包把聊天框改成工作台:文档、网页、代码都能边聊边改

豆包「工作任务」升级对话界面,在聊天窗口右侧新增侧边工作台。用户可以一边和豆包对话,一边直接打开、查看和编辑任务里的各种内容,不用频繁切换窗口。

侧边工作台支持本地文件、飞书文档、网页、代码、应用和终端等内容,并用多个标签页同时打开。编辑文档时可以直接修改并即时保存,任务生成的图片、文件和代码也能随时切过去查看。

豆包
👍1💩1
动察Beating AI News
Stripe给投资人写信:AI奇点已开始,私有化反而成了优势 Stripe 三位负责人在最新投资人信中称,他们把今年 1 月 1 日视为「奇点的开始」。 这里不是说 AI 已经超过人类,而是 Stripe 认为多个长期趋势出现明显拐点,比如新公司创办速度大幅上升。 Stripe 自己也吃到了这波增长。今年上半年净收入同比增长 41%,自由现金流增长 43%。Forbes AI 50 中有 88% 的公司在使用 Stripe,包括 OpenAI 和 Anthropic;剩下的 12% 大多还没有开始商业化。AI…
OpenRouter被嘲「没护城河」,Menlo合伙人:3年Token调用量涨3万倍

OpenRouter 投资人、Menlo Ventures 合伙人 Deedy Das 发文复盘 Stripe 收购 OpenRouter。他称,OpenRouter 从成立到被收购几乎正好 3 年,是历史上同等规模最快的收购之一。Stripe 已确认收购 OpenRouter,交易预计未来几周完成。

Das 重点回应了外界对 OpenRouter「没有护城河」的质疑。他认为,很多人只盯着技术难度,但 OpenRouter 真正的壁垒是双边市场。对模型厂商,它能提供稳定的需求、分发和容量规划;对开发者,则是一套接口访问大量模型。用户越多,模型厂商越愿意优先接入、提供更多容量和折扣,反过来又会吸引更多用户。

增长速度也支撑了这个判断。Das 称,OpenRouter 上线以来 Token 处理量增长约 3 万倍。目前每周处理量已超过 87 万亿 Token,对应年化超过 4500 万亿 Token,过去 3 年月均增长约 33%。

OpenRouter 也是 Das 加入 Menlo 后参与的第一批项目。Menlo 从 Seed 阶段开始投资,之后又领投 Series A。Das 认为 Stripe 是理想买家,因为两家公司分别控制企业的「资金流」和「模型调用流」,合并后可以把模型选择、Token 消耗、计费和支付直接串起来。

Deedy Das
👍2
动察Beating AI News
谷歌1000万美元抢下破产航司数据,企业「数字遗产」成AI新矿 谷歌以 1000 万美元赢下 Spirit Airlines 破产数据拍卖。里面包括约 1 亿封邮件、5 亿条 Microsoft Teams 聊天,还有表格、日历和运营资料。谷歌称会拿来改进产品和 AI 模型。AI 数据公司 Mercor 也参与竞拍,最终报价 750 万美元。交易仍需美国破产法院批准。 这已经不是孤例。今年 4 月,已关停的 cielo24 把 13 年积累的 Slack、Jira、邮件和 Google Drive 资…
谷歌1000万美元买航司Spirit数据遭员工反对,法院推迟审批

谷歌 1000 万美元收购 Spirit Airlines 内部数据的交易遇到阻力。代表数千名前 Spirit 空乘的工会提出反对,要求先排除员工机密信息,或至少给员工数据和客户数据同等保护。法院已把审批听证会推迟到 9 月 9 日。

工会发现,客户和员工的数据待遇并不一样。客户档案、邮箱、会员数据和聊天记录大多不在出售范围内。但员工的工时、工资、税表、差旅等资料,几乎所有类别都包含在交易中。

谷歌回应称,拿到数据前会由第三方删除可识别个人身份的信息。Spirit 也会让第三方确认数据符合隐私法规。但工会认为,删掉姓名等身份信息,只能让外界不知道「这是谁」,并不能让工资、税表等内容本身不再保密。

WSJ
英伟达前AI研究副总裁创业,拿9000万美元给机器人造「Matrix」

英伟达前 AI 研究副总裁 Sanja Fidler 与两位长期合作的研究伙伴 Zan Gojcic、Huan Ling 创办 Veeda AI,并拿到 9000 万美元种子融资,Khosla Ventures 和 Radical Ventures 参与投资。Veeda 不做机器人本体,而是做多模态世界模型,给机器人生成可以大规模扩展的虚拟训练环境。

现实里让机器人靠试错学习太贵也太慢,一次失误就可能损坏设备,训练也无法像计算任务一样大规模并行。Veeda 想把试错搬进模拟世界,让机器人在虚拟环境里反复操作、失败和重来。Fidler 直接把它称为 Physical AI 的「Matrix」。

这类世界模型不只是生成看起来真实的视频。它还要正确模拟空间、运动和物体交互,否则很难拿来可靠训练机器人。三位创始人过去长期在 NVIDIA 做相关研究,最近共同参与了 Lyra 2.0、OmniDreams 等 3D 和世界模拟项目;Fidler 和 Huan Ling 也参与了 NVIDIA Cosmos 世界模型平台。

Veeda 目前还很早期,尚未公开具体模型、客户或产品上线时间。官网显示团队分布在多伦多、苏黎世、山景城和新加坡,目前正在招聘世界模型、数据和大规模训练相关人员。

Sanja Fidler
👍1
把真实公司复制给AI练手,AI数据公司Idler融资900万美元

AI 数据公司 Idler 完成 900 万美元种子轮融资,由 Paradigm 领投,Y Combinator、Long Journey Ventures 等参投。它主要给头部模型公司制作评测、benchmark 和强化学习环境,让 AI 在接近真实工作的场景里反复做任务、拿反馈,再继续训练。

Idler 此前主要做 Coding。过去一年已经为一家头部 AI 实验室制作数千个编程评测和训练环境。YC 的公开资料还显示,Idler 已经和一家头部基础模型实验室签下数百万美元合同。

现在它开始把这套方法扩到真实企业工作。首个公开 benchmark ShelfLife,直接把一家正在运营的零售公司做成「数字孪生」。官网目前提供 200 个任务,数据来自这家公司近十年的真实经营记录。Claude Opus 5 的通过率最高,为 69.0%;GPT-5.6 Sol 为 55.7%。

Idler 还用其中 41 个 ShelfLife 任务后训练 NVIDIA Nemotron 3 Nano,将其在 Finance Agent Benchmark 上的成绩从 30.0% 提升到 41.8%。

除了零售,Idler 已经开始制作企业法律等真实工作环境,目标就是把模型训练从「做题」继续推向「干活」。

Idler
1
阿里GUI Agent做到第三代:Qwen开始同时会用手机、电脑和命令行

阿里推出新的 GUI 智能体基座模型 Qwen-UI-Agent。它能直接看屏幕、点按钮、输入文字,操作手机、电脑和网页;碰到适合命令行处理的任务,也能直接跑 CLI,不用所有事情都靠鼠标一点点完成。

阿里做 GUI Agent 已经两年多。2024 年的 Mobile-Agent 主要让模型看手机截图,再控制点击和滑动;之后的 GUI-Owl、MAI-UI 开始把 GUI 操作直接训练进模型,并扩到电脑。Qwen-UI-Agent 又把手机、电脑、网页、DeepSearch 和命令行放进同一个 Agent。

比如查高铁、算到公司的时间、再去钉钉建会议,它可以跨多个 App 一路做完。做数据分析时,也可以先上网找资料,再用命令行处理数据,最后生成 Excel、PPT 和 Word。

主力模型由 Qwen3.5-27B 继续训练而来。在阿里自建的真机评测 MobileWorld-Real 中,它拿到 92.2%,高于同场评测的 GPT-5.6 Sol、Claude Opus 4.8 和 Gemini 3.1 Pro。

千问大模型
1
动察Beating AI News
DeepSeek V4 Flash换8套Harness:Pi Agent成功率最高且最省钱,Claude Code最快但最贵 AI Agent 基础设施公司 Composio 把 DeepSeek V4 Flash 接进 8 套 Harness,用同一批 30 个 Agent 任务测试。Harness 就是模型外面的执行框架,负责上下文、工具调用和任务执行。任务涉及 Gmail、GitHub、Slack、Calendar、Notion 等真实应用。 8 套 Harness 的通过情况分别是: 1. Pi…
DeepSeek V4 Pro跑5套Harness:Pi成功率第一,DSH最省钱

Agent 工具公司 Composio 把同一个 DeepSeek V4 Pro 0813 分别放进 Pi Agent、DeepSeek Harness 0.1、Claude Code、OpenCode 和 Hermes Agent,统一开到 max reasoning,跑了 30 个多步骤 Agent 任务。

通过率:

1. Pi Agent:21/30
2. DeepSeek Harness:20/30
3. Claude Code:19/30
4. OpenCode:19/30
5. Hermes Agent:18/30

30 道题里,15 道五家全过,7 道五家全挂。剩下 8 道只换了 Harness,结果就会翻转。

速度排名:

1. Claude Code:181.8 秒
2. DeepSeek Harness:252.1 秒
3. Hermes Agent:273.6 秒
4. OpenCode:280.6 秒
5. Pi Agent:362.9 秒

单次成功成本:

1. DeepSeek Harness:0.028 美元
2. Pi Agent:0.031 美元
3. OpenCode:0.032 美元
4. Hermes Agent:0.037 美元
5. Claude Code:0.074 美元

Pi 通过率最高,DeepSeek 官方 Harness 最省钱,Claude Code 最快但最贵。

Composio 此前用 DeepSeek V4 Flash 做过同类测试,当时 Pi 同样拿到最高通过率。

Composio
👍21
让AI自动挑最合适的模型和芯片,Callosum种子轮融1亿美元

英国 AI 基础设施公司 Callosum 完成 1 亿美元种子轮融资,由 Atomico 领投,Plural、DCVC 和英国主权 AI 基金参投。它做的是一套 AI 调度软件,自动给不同任务挑合适的模型和芯片,目标是在保证效果的同时降低成本和延迟。

它比普通模型路由再往下一层。一个复杂任务可以先被拆成多个子任务,再分别交给不同的「模型 + 芯片」组合。简单步骤可以跑便宜的小模型,速度敏感的任务可以交给 Cerebras,其他任务也可以分配到不同 GPU 或 AI 加速芯片。

Callosum 此前公布的测试中,部分组合在相近准确率下,成本最多降到 GPT-5 的十二分之一,速度最高提升 5.5 倍。

Callosum 也是英国 5 亿英镑主权 AI 基金的首笔股权投资。公司同时宣布与 Cerebras 合作,此前已经接入 Rebellions、Axelera AI 等芯片厂商。

彭博社
Claude Code上线Concise模式:Boris称只是临时补丁

Anthropic 给 Claude Code 加了一个内置 Concise 输出风格。打开后,Claude 会先给结果,省掉开场白、过程复述和重复总结。简单问题默认只说几句,但做任务本身不会缩水。

这次更新是为了处理最近集中出现的「Claude 太能说」问题。很多反馈都指向 Opus 5:简单问题能回答十几段,长句和术语很多;用户反复要求简短,下一轮又恢复原样。写进 CLAUDE.md 也不一定能管住。

Claude Code 之父 Boris Cherny 在评论区表示,Concise 只是一个临时补丁,团队还在做长期修复。

原因在于,Concise 本质上还是一组系统提示词。Claude Code 官方文档明确写着,Output Style 改的是系统提示,并没有改模型本身。现在只是先给用户一个「少说点」开关。长期方案具体怎么修,Anthropic 还没有公布。

ClaudeDevs
😁1
动察Beating AI News
Kimi CLI前作者:模型越强,Harness反而会越厚 Raft 创始人、Kimi CLI 前作者 Richard Qian 提出一个反常识判断:模型越强,Agent harness 不一定越薄,反而可能越来越厚。 System Prompt、专用 Tool、Subagent 这些东西都可能慢慢消失。模型越来越聪明后,很多固定流程可以直接交给模型,最后甚至只留一个 Bash 工具。 但 Agent 一旦开始长期工作、互相协作,新的问题马上冒头:谁负责什么、任务做到哪了、上下文怎么同步、多个 Agent…
Slack Code上线,前Kimi CLI作者提前几个月押中下一代Slack

Slack 新增专门给 Coding Agent 用的 Code channels,并把这套功能命名为 Slack Code。首批合作方包括 Anthropic、GitHub、Cognition 和 Vercel。用户可以直接在这些频道里和 Coding Agent 一起干活。

其实 Coding Agent 早就能从 Slack 接活。2024 年 Devin 就已经支持从 Slack 启动任务,此后 Codex、Claude Code、Cursor 和 GitHub Copilot 也陆续接入。这次 Slack Code 主要是把这套能力单独做成「Code channels」,让编程任务和 Agent 协作有一个专门的频道入口。

早在 Slack Code 上线之前,Kimi CLI 原作者 Richard Qian 就已经创业做了 Slock,名字和 Slack 只差一个字母。Richard 之前说过,第一版 Slock Demo 今年 1 月甚至就是搭在 Slack 上做的,后来 Slock 改名 Raft。Raft 从一开始就在做更彻底的「Agent 团队」:多个 Agent 可以待在同一个频道,互相 @、认领任务,并接着其他 Agent 的工作继续干。

Salesforce CEO Marc Benioff 宣布 Slack Code 上线后,Richard 也直接跑到评论区贴脸开大:「试试 Raft。」

Marc Benioff
3
阿里AI年化收入逼近500亿,称算力投资3年就能回本

阿里发布最新财报,并首次按新组织结构把 AI 拆成两块。阿里云和平头哥归入「AI 云与算力」,模型实验室、千问消费者业务和 QwenWork 归入「AI 实验室与应用」。前者本季度收入 484.37 亿元,同比增长 45%;其中 AI 相关产品收入 123.76 亿元,连续第 12 个季度实现三位数同比增长。

两块业务的赚钱能力已经明显分化。AI 云与算力经调整 EBITA 为 56.28 亿元,同比增长 133%,利润率升至约 12%。AI 实验室与应用收入 33.38 亿元,同比增长 16%;经调整 EBITA 亏损 138.61 亿元,亏损同比扩大 330%。

阿里还在继续砸算力。本季度资本开支达到 676.78 亿元,同比增长 75%;自由现金流净流出 446.70 亿元,主要因为云基础设施投入增加。

电话会上,吴泳铭称,AI 相关产品年化收入已经超过 495 亿元,占阿里云外部商业化收入的 35%。这里的「AI 相关产品」口径比较宽,不只是模型和 API,还包括 AI 算力、云基础设施等。

CFO 徐宏称,目前 AI 算力资产大约 3 年可以收回成本。吴泳铭进一步表示,随着 AI 相关产品毛利率提高,未来回收周期可能缩短到 2~2.5 年。

阿里巴巴财报
2
动察Beating AI News
大模型战火烧向企业落地:OpenAI与Anthropic筹集55亿美元收购实施团队 OpenAI 与 Anthropic 正各自通过与私募股权公司成立的合资企业,收购帮助客户部署 AI 的工程与咨询公司。目前 OpenAI 的新实体 The Deployment Company 正在向投资者筹集约 40 亿美元,且已有 3 笔并购交易进入后期阶段,该合资公司预计于本周正式宣布;Anthropic 则在筹集约 15 亿美元的类似资金。 两家公司计划通过并购吸纳数百名工程师和顾问,直接帮助企业客户将 AI…
Anthropic开始收编AI咨询公司,Ode再买Claude合作伙伴

Anthropic 和 Blackstone 等支持的企业 AI 服务公司 Ode,收购 AI 咨询公司 Casper Studios。这是 Ode 7 月成立后的首笔收购。Casper 主要帮企业接入 AI、开发应用,此前已经是 Anthropic 的认证服务合作伙伴,客户包括 Netflix、百事、私募和对冲基金。

Ode 本身也是从收购起步。Anthropic、Blackstone 等支持的合资项目此前买下应用 AI 公司 Fractional AI,并以这支团队为基础成立 Ode。

Casper 补的是能直接进企业部署 AI 的工程师。很多公司并不是缺模型,而是不知道怎么整理内部数据、接入现有系统,再把 Claude 真正塞进财务、客服、项目管理等工作流。

OpenAI 也在走类似路线。它成立 Deployment Company 后收购 AI 咨询公司 Tomoro,一次带入约 150 名企业部署工程师。

The Information
👍1
动察Beating AI News
怕GPT-3就是AGI、怕去中国被绑架,Anthropic的Dario可能是硅谷最奇葩的CEO Anthropic CEO Dario Amodei 身上最大的反差,是他一直觉得 AI 可能毁灭世界,却又亲手创办了一家最激进的前沿 AI 公司。 早在 OpenAI 时期,他就已经很夸张。敏感备忘录不放 Google Docs,而是在家里用完全断网的电脑写,再打印出来给同事。有人称,他甚至因为担心被绑架而拒绝去中国。 GPT-3 还没开始训练,他就担心它可能已经接近 AGI。Dario 领导的安全团队因此让微软对…
Anthropic上市前给创始人加投票权:Dario目前持股仅约2%

Anthropic 正准备给首席执行官 Dario Amodei 和其他联合创始人一类高投票权股票,让他们上市后仍能保持更强控制权。方案还没最终敲定,Anthropic 最快可能在 9 月底上市。

这主要是因为创始人持股已经很低。Dario 目前只持有约 2% 股份。高投票权股票可以让创始人用较少股份掌握更多表决权,减少上市后受到外部股东压力。

Anthropic 还有另一层特殊机制:长期利益信托。这个独立机构没有经济权益,但持有特殊的 T 类股票,可以选出董事会多数成员。Anthropic 今年 4 月已经确认,信托任命的董事占董事会多数。

这样一来,Anthropic 上市后可能同时保留两套控制权:创始人靠高投票权股票保持影响力,长期利益信托继续控制董事会多数席位。

The Information
动察Beating AI News
Anthropic悄悄给Claude换模型:Fable 5.1疑似开始灰度 社区爆料称,Anthropic 已开始小范围测试 Fable 5 的后续模型。部分 Claude Web 用户虽然仍选择「Fable 5」,后台实际可能已经换成新模型。Claude Code 也可能在测试范围内。 新模型被猜测为 Fable 5.1。 leo
传OpenAI几周内发布Astra:员工已在Codex里试用新版本

AI 爆料账号 Leo 称,OpenAI 昨天在内部告诉员工,计划在未来几周发布 Astra。发布时还会放出实际工作演示,展示 Astra 怎么直接做任务。一个更新后的 checkpoint(训练中的模型版本)也已经交给员工试用,员工可以通过 Codex 等工具直接使用。

Leo 称,这一版主要在修模型行为,而不是单纯继续提升能力。重点包括对齐,以及减少模型钻奖励机制的空子,比如硬编码答案、专门针对测试样例作弊,或者任务没做好却想办法骗过评分器拿高分。

但 OpenAI 刚在安全问题上给 Astra 踩了刹车:部分强化学习训练此前暂停了两周,现在虽然已经恢复一部分训练和评测,但仍有大量 Astra 任务停着,最大规模的前沿模型强化学习训练也还没重启。原因是 OpenAI 认为 Astra 的网络安全能力可能达到最高风险级别之一,因此提高了沙箱、联网权限和模型行为监控要求。

这两件事并不一定矛盾。OpenAI 可以继续测试和打磨已经训练出来的 Astra 版本,同时把更大规模的新一轮训练继续按住。

leo
💩1