动察Beating AI News
3.45K subscribers
1.14K photos
2 videos
1 file
3.77K links
AI新闻信息流
Download Telegram
动察Beating AI News
DeepSeek Harness增强多Agent编排:把Claude Code、Codex做成按需安装组件 DeepSeek 更新开源 Agent 框架 Harness,RC.8 继续加强多 Agent 编排。Claude Code 和 Codex 现在可以做成独立的 Profile Bundle,用户需要时再安装。两者此前已经能作为 Harness 的子代理运行,新增的是安装和配置方式进一步模块化。 Codex 也多了两项能力。它现在支持非交互权限模式,更适合放进自动化流程;同时可以配置多个命名实例,让…
DeepSeek终于要上多模态了?全新视觉模型已进入官方Harness

DeepSeek 一个新的视觉模型 deepseek-v4-flash-vision-exp 开始浮出水面。社区已经有人通过 API 跑通,可以直接传图提问。更直接的信号是,DeepSeek Harness 今天已经把这个模型加入默认模型目录,并明确标记为支持图片输入。对应的合并提交直接写着「publish the vision model」。

DeepSeek 其实早就能识图。网页和 App 已经上线识图模式。此前 DeepSeek 视觉团队公开的研究基于 V4-Flash,让模型把点和边界框直接插进推理链,相当于一边「指」着图片,一边完成视觉 CoT 推理。项目当时还提到,这套视觉模型未来会整合进基础模型并发布。

这次的新模型也早有伏笔。两天前的 DeepSeek Harness RC.8 刚给官方 DeepSeek 适配器补上原生图片输入。实现笔记当时已经写出 deepseek-v4-flash-vision-exp,但特意没有放进默认模型目录,理由是要等模型端点准备好。

两天后,这个限制被拿掉。Harness v0.1.1-rc.1 已经把 deepseek-v4-flash-vision-exp 列入默认模型目录,社区也开始出现成功调用。此前还在「等 API 端点」,现在模型已经进入官方 Harness,发布信号已经非常明显。
👍2
DeepSeek视觉模型正式上线API:价格和V4 Flash完全一样

DeepSeek 正式上线全新视觉模型 `deepseek-v4-flash-vision-exp`。官方 API 文档已经将它与 V4 Flash、V4 Pro 并列,开发者可以直接通过 DeepSeek API 传入图片。模型支持 100 万 Token 上下文,最大输出 38.4 万 Token,还支持 JSON Output、Tool Calls、Responses API 和 Anthropic API。

价格直接对齐 V4 Flash。每百万 Token 输入在缓存未命中时,高峰期为 3 元、空闲期 1.5 元;缓存命中分别只要 0.1 元和 0.05 元。每百万 Token 输出高峰期 9 元、空闲期 4.5 元。相比 V4 Pro,同档价格只有三分之一。

图片没有单独按张收费。DeepSeek 会根据图片尺寸把图片换算成 Token,再和文本 Token 一起计费。高峰期为北京时间 9:00–12:00、14:00–18:00,其余时间价格减半。

官方模型文档
🐳5
DeepSeek视觉模型多模态Agent能力逼近Opus 4.8!4项打成2:2

DeepSeek 公布 V4-Flash-Vision-Exp 的首批 Agent 跑分。在 4 项多模态 Agent 评测中,它和 Opus 4.8 打成 2 胜 2 负:Agents' Last Exam 为 27.3 对 25.7,ZeroBench 为 35.0 对 34.0;ApexBench 为 36.5 对 39.4,Chartography 为 64.3 对 65.0。

相比纯文本版 V4-Flash-0731,视觉版在 ApexBench 从 26.2 升到 36.5,Agents' Last Exam 从 25.2 升到 27.3。不过这两个评测本身包含图片,官方注明 V4-Flash 会直接忽略其中的多模态内容,因此这里主要体现的是补上视觉输入后的能力,而不是纯文本推理突然变强。

加上视觉后,文本 Agent 能力也没有明显缩水。7 项文本评测里,Vision Exp 有 6 项高于 V4-Flash-0731。比如 DeepSWE 从 54.4 升到 59.3,甚至超过 Opus 4.8 的 58.0;Toolathlon 为 75.9,也几乎追平 Opus 4.8 的 76.2。

需要注意,这组结果来自 DeepSeek 官方自测,不是第三方独立榜单。DeepSeek 系列在公开 Code Agent 文本任务中使用 DeepSeek Harness 极简模式,推理档位设为 max。

官方公告
🐳8
DeepSeek直接白送25GiB图片云盘:存图免费,调用才收钱

DeepSeek 随 V4-Flash-Vision-Exp 一起上线 Files API。开发者可以先把图片上传到 DeepSeek,再通过 file_id 在模型请求里直接引用。同一张图片可以跨多个请求反复使用,不需要每次重新上传。官方称 Files API 本身不收费。

目前 Files API 只支持图片,包括 JPEG、PNG、GIF 和 WebP。单个文件最大 64 MiB,每个用户最多存 25 GiB、10000 个文件。上传时可以设置 1 小时到 30 天的有效期;如果不设置过期时间,文件可以永久保留。

它主要解决大图和重复传图的问题。直接把图片塞进请求时,单图内联限制为 32 MiB;改用 file_id 后,单张图片可以到 64 MiB。模型真正读取图片时仍会按图片换算后的 Token 收费,免费的只是 Files API 上传和存储本身。

不过它目前还算不上通用文件盘。官方文档只允许上传图片,也没有提供下载文件内容的接口,只能查询信息、引用或删除。文件主要是给 deepseek-v4-flash-vision-exp 在 API 请求里重复使用。

官方文档
👍7
Anthropic把内部AI培训公开:Claude Academy免费上线

Anthropic 正式上线 Claude Academy,把怎么用 Claude、怎么和 AI 协作做成了一套免费课程。

平台目前有 22 门课程、289 项课程、教程和实际用例,任何人都可以学习。内容覆盖 Claude、Claude Code、Cowork、Claude Tag 和 API,也有学生、教师、小企业等不同人群的学习路线。

它最特别的地方,是直接照着 Anthropic 培训自己员工的方法来教。Anthropic 员工从入职第一天就要学习 4D AI Fluency:哪些工作该交给 AI、怎么描述任务、怎么判断输出质量,以及怎么检查 AI 的错误。之后还会持续学习模型的能力和局限、人和 Agent 怎么配合。

课程也不只教 Prompt 技巧。Anthropic 认为模型变化太快,很多固定技巧很快就会过时。比如以前需要主动告诉 Claude 内容写给谁,新模型现在已经会自己追问。相比背 Prompt,Claude Academy 更强调什么时候该用 AI、什么时候该自己做,以及任务风险越高,检查就要越严格。

用户登录后可以记录学习进度、获得完成徽章。Anthropic 还提供了 Claude Academy Skill,可以让 Claude 根据你的工作方式直接推荐课程和学习路线。

Claude
🤡5
动察Beating AI News
一个月前还在带货反代,现在Codex负责人称订阅共享会触发风控 OpenAI Codex 负责人 Tibo Sottiaux 回应最近的额度缩水争议。他称 OpenAI 不会偷偷修改额度。团队调查部分受影响用户后发现,不少人在使用 sub2api。把订阅转成 API 流量,再分发或共享给多人,会被 OpenAI 的反欺诈系统标记。 讽刺的是,Tibo 一个月前才亲自推荐过另一款代理工具 CLIProxyAPI。他教用户用 Codex OAuth 登录,再把 GPT-5.6 Sol 接进 Claude …
Codex额度缩水还在查,OpenAI先给所有用户送一次Reset

OpenAI Codex 负责人 Tibo Sottiaux 又回应了额度缩水争议。他补充称,目前 OpenAI 没发现整体用量系统存在异常,但调查仍在继续。上一条关于 sub2api 的回应,只是在解释团队发现的一种特定情况,不能用来解释所有用户额度突然掉得更快的问题。

这就有点尴尬了。几小时前,Tibo 刚称不少受影响用户在通过 sub2api 把订阅转成 API,再分发给多人,因此触发了反欺诈系统。现在他又明确表示,额度消耗变快本身还没有查清。也就是说,目前还不能把这轮争议简单归因于反代或订阅共享。

与此同时,Codex 本周活跃用户已经突破 2000 万。为庆祝这个数字,OpenAI 会给所有 Codex 和 ChatGPT Work 用户发放一次「Banked Reset」,可以先存着,之后自行选择时间恢复一次额度。CNBC 此前也报道,OpenAI 的 AI 编程和工作产品已经达到 2000 万周活跃用户。

额度到底有没有被统一下调,OpenAI 目前依然没有给出答案。只是这次他们澄清 sub2api 是他们调查中发现的问题之一,不是这轮额度缩水的最终结论。

Tibo
👍5🥱1
腾讯给视频生成套上Agent Harness:HyCreator可全自动生成10分钟长片

腾讯混元多模态强化学习技术负责人庞天宇公布 HyCreator,并开放早期体验申请。

HyCreator 被定义为面向长视频生成的 agent harness(把模型、工具和制作流程串起来的智能体框架),可以在零人工干预下生成 10 分钟量级影片。中途想调整时,用户可以随时切到实时交互编辑。

官网已经放出一批实际作品,其中最长达到 10 分 27 秒,另有 9 分 45 秒、9 分 59 秒的长片。每部作品还可以查看 Agent 的生成 Trace。一个公开案例中,Pro 模式共执行 13 个步骤,产生 45 项中间产出,最后还会检查片段质量、镜头衔接和全片连贯性,再合成为成片。

HyCreator 提供 Lite 和 Pro 两种成片模式。目前底层调用哪些视频模型、完整生成耗时和成本,还没有披露。

HyCreator 官网
WSJ长文复盘:中国AI崛起背后,是一条清华人才链

《华尔街日报》复盘中国 AI 崛起时,关注到一条延续多年的清华人才链。

智谱创始人唐杰和月之暗面创始人杨植麟,十多年前还是清华实验室里的师生。唐杰曾指导杨植麟研究机器学习,还推荐他角逐清华最高学术奖。如今,两人分别创办智谱和月之暗面,成为中国 AI 模型创业浪潮中的代表人物。

这批人的故事并不是从 DeepSeek 爆火才开始。唐杰已经研究机器学习约 25 年。过去二十多年,中国高校培养了一批计算机人才,互联网时代又积累了大量数据和工程经验。后来,一些研究者进入美国科技公司,再回国创业,把学术研究、工程能力和商业化连接起来。

唐杰很早就把目标放在 AGI 上。GPT-3 发布后,他曾表示希望打造能「像人一样思考」的机器。2019 年,他将清华实验室技术商业化,创办智谱,随后一路押注大模型。

中国 AI 公司的追赶方式,也和美国巨头不同。由于芯片和资金限制,它们很难复制 OpenAI、Anthropic 的高投入路线,只能在算法效率、开源和工程优化上寻找突破。DeepSeek 的 MLA、MoE 等技术,就是这种「用更少资源换更高效率」思路的代表。

过去几年,中国 AI 竞争表面上是一场模型竞赛,背后其实也是一场人才积累的兑现。曾经停留在实验室里的研究,正在通过一批创业公司进入产业。

WSJ
6😁1
动察Beating AI News
OpenAI大甩卖:GPT-5.6 Luna发布仅三周,降价80% OpenAI 大幅下调 GPT-5.6 的 API 价格。Luna 降价 80%,每百万输入 Token 从 1 美元降至 0.2 美元,输出从 6 美元降至 1.2 美元。Terra 同步降价 20%,输入、输出价格降至 2 美元和 12 美元。 GPT-5.6 系列发布只有三周。OpenAI 称,模型、推理系统和上下文管理的效率提升,给了这次降价空间。 Sol 没有降价,但 API 新增 Fast 模式。速度最高是标准模式的 2.5…
OpenAI给GPT-5.6 Sol限时降价:长上下文输出价格直接腰斩

OpenAI 下调 GPT-5.6 Sol 的 API 和 credits 价格,整体降幅超过 20%。优惠至少持续到 11 月 21 日。API 已经生效,ChatGPT Work 和 Codex 的 credits 也在向符合条件的套餐陆续调整。

以标准短上下文 API 为例,每百万输入 Token 从 5 美元降到 4 美元,降幅 20%;输出从 30 美元降到 20 美元,直接便宜三分之一。长上下文此前为输入 10 美元、输出 60 美元,现已分别降至 8 美元和 30 美元。

不过,Plus、Pro 和 Business 订阅自带的使用额度没有增加。这轮降价主要惠及 API 用户,以及需要额外购买 credits 的 ChatGPT Work 和 Codex 用户。

上月底 OpenAI 已把 GPT-5.6 Terra 降价 20%,Luna 更是降了 80%,当时唯独 Sol 没动。现在旗舰模型也跟着降价,GPT-5.6 三档模型已经全部完成一轮降价。

OpenAI
Anthropic把Mythos 5塞进Claude Security:企业能用,但拿不到模型

Anthropic 将 Claude Security 的底层扫描模型升级为 Claude Mythos 5,并向所有 Claude Enterprise 客户开放公测。企业接入 GitHub 仓库后,Mythos 5 会扫描代码漏洞,返回 CWE 分类、置信度、严重等级和修复建议。

Claude Security 其实早已上线。4 月底开放公测时,它用的还是 Claude Opus 4.7。此次最大的变化,是把此前严格限制访问的 Mythos 5 放进现有安全产品。Mythos 5 不仅能发现漏洞,还能把漏洞转成可工作的攻击,因此一直只向经过审核的机构开放。

企业现在依然不能直接调用 Mythos 5。模型只在扫描后台运行,用户拿到漏洞报告和修复建议。后续在 Claude Code 里修改代码,仍使用企业已有的模型,而且补丁必须人工批准。扫描按现有套餐正常计 Token,不需要单独购买 Mythos 5。

Anthropic 还准备把 Mythos 5 接入合作伙伴的安全产品,并推出 3500 万美元 Claude 额度的 Defender Advantage Fund,用于帮助开源项目查漏洞和修补漏洞。

Claude
英伟达Rubin开始量产交付:微软首批设备已到货

微软 CEO Satya Nadella 晒出数据中心现场图,微软的首批量产版 NVIDIA Vera Rubin 已经到货。英伟达随后确认,Vera Rubin 正在进入全面量产。

Vera Rubin 是 Blackwell 之后的新一代机架级 AI 计算平台。一套 NVL72 集成 72 块 Rubin GPU 和 36 颗 Vera CPU。英伟达称,相比 GB200 NVL72,它能把每百万 Token 的推理成本降到约十分之一,训练 MoE 模型所需 GPU 数降到四分之一。

Satya Nadella
👍4
Vercel给网站做Agent体检:100多项检查,一键找出AI卡在哪

Vercel 上线 Is Agentic,专门检查网站对 AI Agent 是否友好。输入网址后,它会从 100 多项指标入手,判断 Agent 能不能发现、读取、理解并实际使用这个网站,最后给出 0 到 100 分。底层扫描由 Agent 网站评测平台 Ora 提供,Vercel 再按自己的规则加权和展示结果。

它不只检查 robots.txt、llms.txt 这类文件。服务端渲染、HTTP 返回、页面结构、可操作按钮都会被测试。网站如果提供 API、OAuth、GraphQL 或 MCP,还会继续检查这些接口能不能被 Agent 正常使用。

扫描完还能看到 Agent 实际访问网站时走了哪条路径、卡在哪里。每个问题都会附证据和修复建议,还能生成一段 prompt,直接交给 coding agent 改网站。完成的报告也能通过 JSON API、Markdown 和 MCP 读取。

Ora 扫描的 1.4 万多个网站平均只有 34 分,77% 处于 D 或 F。现在大多数网站显然还没为 Agent 做好准备。

Is Agentic
👍1
动察Beating AI News
ZCode免费送1亿GLM-5.3 Token,太火导致上线一小时就暂停 智谱旗下编程 Agent 工具 ZCode,给 GLM-5.3 推出了一场周末免费活动。新用户首次登录 ZCode,即可获得 1 亿 GLM-5.3 Token,用于 AI 编程、代码修改和 Agent 任务。 活动原定北京时间 8 月 16 日 0 点开始,持续到 17 日上午 9 点。结果上线一小时,ZCode 就宣布暂停新增 1 亿 Token 发放。官方称活动需求「超出预期」,正在调整服务容量。 已经领取的额度不受影响,普通新用户的…
智谱又送1亿Token:这次备了5万份,上轮曾挤停

智谱又给 ZCode 新用户发 GLM-5.3 免费额度。北京时间 8 月 22 日 0 点到 24 日 9 点,首次登录 ZCode 的新用户可自动领取 1 亿 Token,共 5 万份,先到先得。额度只能在 ZCode 内使用,活动结束后没用完的直接失效。

这已经是同一活动第二轮。上一轮 8 月 16 日开启后,ZCode 很快就因为需求超过服务容量,暂停继续发放 1 亿 Token。几天后活动重新开跑,这次官方直接把名额写明为 5 万份。

1 亿看着很多,但 Agent 编程也很能吃 Token。跑重度长任务的话,1 亿 Token 几小时就能耗完。GLM-5.3 API 目前也已经开放,但这波免费额度仍是 ZCode 专属,不能当普通 API 余额使用。

Zixuan Li
动察Beating AI News
OpenAI冲IPO再换营收一把手,总裁Brockman开始接管更多经营权 OpenAI 首席营收官 Denise Dresser 宣布离职,上任还不到一年。接替她的是 Wiz 前总裁兼 COO Dali Rajic,后者将负责 OpenAI 接下来的企业销售和营收增长。 这已经是 OpenAI 本周第二名重要高管离开。前 COO、特殊项目负责人 Brad Lightcap 两天前刚宣布离职,负责 AGI 业务的 Fidji Simo 上个月也已卸任。联合创始人兼总裁 Greg Brockman 正在…
OpenAI企业销售再走高管:加入5个月,转身回Salesforce

OpenAI 美洲销售副总裁 Kaylin Voss 辞职。她加入 OpenAI 只有 5 个月,现在又将回到老东家 Salesforce。Salesforce CEO Marc Benioff 随后在 X 上回应:「欢迎回家。」

Voss 原本负责 Salesforce 的 Agentforce 和 Data Cloud 销售,此前还担任过 Slack 首席营收官。她是前 Slack CEO Denise Dresser 从 Salesforce 招来搭建 OpenAI 企业销售团队的多名高管之一。Dresser 担任 OpenAI 首席营收官仅 9 个月,也在一周前宣布离职。

这次离职来得很突然。8 月 17 日,Voss 还以 OpenAI 美洲及行业副总裁身份出现在 Synchrony 的合作公告里。4 天后,辞职消息就被曝出。

Dresser 任内把 OpenAI 销售团队扩大到原来的 3 倍。她和 Voss 接连离开后,已有其他销售人员考虑辞职。OpenAI 已任命原 Wiz 总裁兼 COO Dali Rajic 接任首席营收官。

The Information
动察Beating AI News
OpenAI前CTO新公司开源首个模型Inkling,架构借鉴DeepSeek-V3 OpenAI 前 CTO Mira Murati 创办的 Thinking Machines Lab,发布首个通用模型 Inkling。模型总参数 9750 亿,每次激活 410 亿,支持文本、图像和音频,最长上下文为 100 万 token。 Inkling 从零训练,但 MoE 架构主要参考 DeepSeek-V3。后训练初期还使用了 Kimi K2.5 等开放模型生成的数据。完整权重已上架 Hugging Face,采用…
Thinking Machines拿免费Inkling换Agent数据:OpenRouter限免数周

OpenAI 前 CTO Mira Murati 创办的 Thinking Machines Lab 把 Inkling 和 Inkling-Small 放到 OpenRouter 免费开放。

这次不是单纯送额度。官方称,希望观察 Inkling 在真实 Agent 环境里的表现,继续提升它的 Agent 能力。免费测试预计持续数周,而且仅限 agentic harnesses 使用。

免费端点会记录用户的 Prompt、模型输出和使用数据,并在与账号等长期身份标识解绑后,用于改进模型、产品和服务。更详细的条款还允许 Thinking Machines 将这些数据用于训练、微调和评测模型。官方因此明确提醒,不要上传机密信息或个人数据。

Inkling 本身并不是今天才发布。Inkling 于 7 月 15 日上线,共 9750 亿参数、每次激活 410 亿;Inkling-Small 于 7 月 30 日发布,共 2760 亿参数、激活 120 亿。两款 OpenRouter 免费端点都提供约 26.2 万 Token 上下文,并支持工具调用。

Thinking Machines Lab
谷歌给Antigravity装上遥控器:手机直接接管本地Agent

Google 给 Antigravity 2.0 上线远程控制功能。电脑上的 Agent 还在干活时,人可以直接离开桌面,用手机或其他设备的浏览器继续控制。无需安装单独的手机 App。

远程端可以查看正在运行的会话、继续发任务、检查方案和产物。用户还能同时连接笔记本、台式机和服务器,在不同机器之间切换。手机端还可以开启推送,Agent 做完一轮或需要人工确认时会主动提醒。

Google 还支持把服务器接进远程控制。即使没有图形界面,也可以在服务器上持续跑 Agent,再用手机或浏览器远程管理。

功能目前正在分批开放,Google AI Ultra 用户优先。

Google
👍3
Claude Code优化远程控制:手机选目录就能开本地会话

Anthropic 优化了 Claude Code 的远程控制功能,重点解决连接不稳定的问题。以前需要先在电脑上打开 Claude Code 会话,再交给手机接管。现在电脑运行 claude remote-control 后,会直接作为设备出现在 Claude 手机 App。用户选中电脑和项目目录,就能从手机新开一个跑在这台电脑上的 Claude Code 会话。

手机和电脑之间的状态同步也更完整。电脑上恢复会话后,手机会继续显示同一个实时会话;Claude Code 退出后,手机会在几秒内显示离线。切换 Wi-Fi、短暂合上笔记本导致掉线时,也会自动重连。重连期间,子 Agent 和工作流的状态会暂存,恢复连接后继续同步。

模型和推理强度现在也会在手机与 CLI 之间同步。iOS 打开大型会话的速度有所提升,手机端的 Slash Command 也得到优化:/clear 可以重置会话视图,/compact 会显示上下文压缩位置,/diff 可以直接打开原生代码差异页面。

ClaudeDevs
👍2
动察Beating AI News
谷歌三周又更Flash,Gemini 3.7智能再涨4分 谷歌发布 Gemini 3.7 Flash,距离 3.6 Flash 只有三周。新模型继续主攻编程和 Agent,已经上线 Gemini API、AI Studio、Antigravity 等平台,并开始用于 Gemini Spark。 三周时间,综合能力又涨了一截。Artificial Analysis 实测,高推理档智能指数达到 56 分,比 3.6 Flash 高 4 分。它只比 GPT-5.6 Terra 和 Muse Spark 1.2…
Gemini 3.7 Flash成爆款:上线一周破增长纪录

谷歌 CEO Sundar Pichai 表示,Gemini 3.7 Flash 上线首周就打破了此前 Gemini 模型的增长纪录,成为谷歌迄今增长最快的 Gemini 模型。不过谷歌没有公布具体增长口径和使用规模。

这款模型确实踩中了性价比甜点区。Artificial Analysis 给它的综合智能指数为 56,高推理模式输出速度约 340 token/s,每项评测任务成本约 0.40 美元,并进入智能与完成时间的帕累托前沿。中等推理模式成本进一步降至 0.26 美元,进入智能与成本的帕累托前沿。

ARC Prize 的独立验证中,Gemini 3.7 Flash 高推理模式在 ARC-AGI-2(抽象推理基准)拿到 84.6%,每项任务成本仅 0.25 美元。

谷歌也迅速把 3.7 Flash 铺进自家产品。Gemini App、Antigravity、AI Studio 已经接入,Google Search 也开始使用该模型。

Sundar Pichai
🤡4