以四分之一生成成本硬刚Claude!SpaceXAI推出Grok 4.5推理模型
SpaceXAI 正式推出 Grok 4.5 推理模型。新模型主打编程、智能体任务和专业推理。这是 SpaceX 收购 AI 编程平台 Cursor 后的首个成果。模型利用 Cursor 平台万亿级交互数据进行了联合训练。
在软件工程测试 SWE Bench Pro 中,新模型解决单个任务平均仅需约 1.6 万个输出 token。这比 Claude 4.8 Opus 节省了 4.2 倍,开发成本大幅降低. 目前模型运行速度为 80 TPS。API 价格为输入每百万 2 美元,输出 6 美元。除编程外,用户还可以在 Grok Build 中进行联网 Excel 建模,或者在 Word 和 PowerPoint 里生成排版与图表。
开发者可在 Cursor、Grok Build 和 SpaceXAI 控制台体验,但欧盟地区需等到 7 月中旬。
信源:https://x.ai/news/grok-4-5
SpaceXAI 正式推出 Grok 4.5 推理模型。新模型主打编程、智能体任务和专业推理。这是 SpaceX 收购 AI 编程平台 Cursor 后的首个成果。模型利用 Cursor 平台万亿级交互数据进行了联合训练。
在软件工程测试 SWE Bench Pro 中,新模型解决单个任务平均仅需约 1.6 万个输出 token。这比 Claude 4.8 Opus 节省了 4.2 倍,开发成本大幅降低. 目前模型运行速度为 80 TPS。API 价格为输入每百万 2 美元,输出 6 美元。除编程外,用户还可以在 Grok Build 中进行联网 Excel 建模,或者在 Word 和 PowerPoint 里生成排版与图表。
开发者可在 Cursor、Grok Build 和 SpaceXAI 控制台体验,但欧盟地区需等到 7 月中旬。
信源:https://x.ai/news/grok-4-5
x.ai
Introducing Grok 4.5
Grok 4.5 is SpaceXAI's smartest model built for coding, agentic tasks, and knowledge work.
中国拟允许采购英伟达H200:仅限训练,推理须优先国产
中国政府计划允许阿里巴巴、字节跳动和 DeepSeek 等头部 AI 企业采购少量英伟达 H200 芯片,以缓解国内严重的算力缺口。美国已在 2025 年 12 月批准芯片出口,但中国官方此前因保护本土产业,以及担忧芯片被远程追踪、禁用等网络安全风险,一直未发放采购许可。
本次拟批准的采购总量预计不足 20 万颗,低于企业 2026 年初申请量的一半,且最终审批尚未完全落实,仍存在变数。官方要求这批芯片仅用于训练公开数据,严禁处理敏感客户信息;在模型推理环节,政府明确要求企业优先使用国产处理器,来强化本土芯片的战略地位。
由于美国近期加大了对东南亚走私芯片的打击力度,国内黑市渠道收紧,企业面临更大的训练算力缺口。这一采购松动可能为英伟达带来意料之外的营收。
信源:https://www.theinformation.com/articles/china-plans-let-top-ai-firms-buy-limited-amount-nvidia-h200-chips
中国政府计划允许阿里巴巴、字节跳动和 DeepSeek 等头部 AI 企业采购少量英伟达 H200 芯片,以缓解国内严重的算力缺口。美国已在 2025 年 12 月批准芯片出口,但中国官方此前因保护本土产业,以及担忧芯片被远程追踪、禁用等网络安全风险,一直未发放采购许可。
本次拟批准的采购总量预计不足 20 万颗,低于企业 2026 年初申请量的一半,且最终审批尚未完全落实,仍存在变数。官方要求这批芯片仅用于训练公开数据,严禁处理敏感客户信息;在模型推理环节,政府明确要求企业优先使用国产处理器,来强化本土芯片的战略地位。
由于美国近期加大了对东南亚走私芯片的打击力度,国内黑市渠道收紧,企业面临更大的训练算力缺口。这一采购松动可能为英伟达带来意料之外的营收。
信源:https://www.theinformation.com/articles/china-plans-let-top-ai-firms-buy-limited-amount-nvidia-h200-chips
The Information
China Plans to Let Top AI Firms Buy Limited Amount of Nvidia H200 Chips
China plans to allow some of the country’s biggest AI companies to buy a small number of Nvidia’s H200 chips, according to two people with direct knowledge of the matter. The chip purchase approvals would offset a shortage caused by soaring demand for AI…
❤2
长鑫科技科创板IPO:估算市值达2950亿,首日限售比例达78%
芯片巨头长鑫科技已获中国证监会同意注册,正式启动发行程序。本次计划募资 295 亿元,是近年来最大的半导体上市案。如果按募资额与发行量计算,它的估算发行价大约为每股 4.41 元,发行后的总市值(估算上市市值)将接近 2950 亿元。今年上半年,公司预计实现收入 1100 亿到 1200 亿元,净利润达 660 亿到 750 亿元,业绩实现强劲扭亏。
根据初始发行安排测算,上市首日可流通新股的比例较低。本次发行初始战略配售占比达上限 50.00%。网下配售执行「3+7」规则,其中 70% 的网下获配股份须限售 6 个月。测算显示,新股发行总量中约 78.00% 在首日处于限售锁定状态,首日可流通新股仅占 22.00%,对应估算流通市值约 65 亿元。
参与申购的投资者需要注意资格与市值门槛。网上普通投资者申购(代码 787825)须开通科创板交易权限,并在 7 月 14 日前持有 1 万元以上的沪市日均市值;参与网下询价的机构则要求极严,不仅要有 6000 万元的沪市市值,还必须有 600 万元以上的科创板日均持仓。限售方面,部分持股 51% 以上的主要发行前股东承诺锁定 36 个月,第一大股东清辉集电还承诺若上市当年起扣非归母净利润较上市前一年下滑超 50% 将自动延长锁定 12 个月。主承销商中金公司拥有 15% 的超额配售选择权,在上市后 30 个自然日内若股价跌破发行价,有权在二级市场买入股票进行稳定。
信源:https://static.sse.com.cn/disclosure/listedinfo/announcement/c/new/2026-07-09/688825_20260709_A24U.pdf
芯片巨头长鑫科技已获中国证监会同意注册,正式启动发行程序。本次计划募资 295 亿元,是近年来最大的半导体上市案。如果按募资额与发行量计算,它的估算发行价大约为每股 4.41 元,发行后的总市值(估算上市市值)将接近 2950 亿元。今年上半年,公司预计实现收入 1100 亿到 1200 亿元,净利润达 660 亿到 750 亿元,业绩实现强劲扭亏。
根据初始发行安排测算,上市首日可流通新股的比例较低。本次发行初始战略配售占比达上限 50.00%。网下配售执行「3+7」规则,其中 70% 的网下获配股份须限售 6 个月。测算显示,新股发行总量中约 78.00% 在首日处于限售锁定状态,首日可流通新股仅占 22.00%,对应估算流通市值约 65 亿元。
参与申购的投资者需要注意资格与市值门槛。网上普通投资者申购(代码 787825)须开通科创板交易权限,并在 7 月 14 日前持有 1 万元以上的沪市日均市值;参与网下询价的机构则要求极严,不仅要有 6000 万元的沪市市值,还必须有 600 万元以上的科创板日均持仓。限售方面,部分持股 51% 以上的主要发行前股东承诺锁定 36 个月,第一大股东清辉集电还承诺若上市当年起扣非归母净利润较上市前一年下滑超 50% 将自动延长锁定 12 个月。主承销商中金公司拥有 15% 的超额配售选择权,在上市后 30 个自然日内若股价跌破发行价,有权在二级市场买入股票进行稳定。
信源:https://static.sse.com.cn/disclosure/listedinfo/announcement/c/new/2026-07-09/688825_20260709_A24U.pdf
OpenAI推出全新语音架构GPT-Live:支持边听边说,后台运算不卡顿
OpenAI 宣布向全球 ChatGPT 用户推送第三代语音模型和架构 GPT-Live,免费用户可使用 GPT-Live-1 mini,付费用户默认使用 GPT-Live-1。它将复杂推理与实时交谈剥离,用户说话时它能同时倾听,不再需要像对讲机一样轮流发言。
GPT-Live 采用全双工(full-duplex)架构,支持双向倾听与发言。对话中它会用「嗯」、「对的」等语气词表明自己在听,支持快速来回互动,或在用户需要思考时保持安静。
遇到需要搜索或深度推理的问题时,GPT-Live 会在后台将任务委派给 GPT-5.5 运行,并在等待结果期间保持与用户的交谈。在交谈中它还能呈现天气、股市等视觉卡片来辅助理解。
信源:https://x.com/OpenAI/status/2074907025537224840
OpenAI 宣布向全球 ChatGPT 用户推送第三代语音模型和架构 GPT-Live,免费用户可使用 GPT-Live-1 mini,付费用户默认使用 GPT-Live-1。它将复杂推理与实时交谈剥离,用户说话时它能同时倾听,不再需要像对讲机一样轮流发言。
GPT-Live 采用全双工(full-duplex)架构,支持双向倾听与发言。对话中它会用「嗯」、「对的」等语气词表明自己在听,支持快速来回互动,或在用户需要思考时保持安静。
遇到需要搜索或深度推理的问题时,GPT-Live 会在后台将任务委派给 GPT-5.5 运行,并在等待结果期间保持与用户的交谈。在交谈中它还能呈现天气、股市等视觉卡片来辅助理解。
信源:https://x.com/OpenAI/status/2074907025537224840
X (formerly Twitter)
OpenAI (@OpenAI) on X
Introducing GPT-Live, a new generation of voice models for natural human-AI interaction.
Rolling out in ChatGPT starting today.
You’ll want to turn the sound on for this one.
Rolling out in ChatGPT starting today.
You’ll want to turn the sound on for this one.
🎉1
Cognition发布每秒1000 Token的编程大模型SWE-1.7
AI 编程公司 Cognition 发布了全新 AI 编程大模型 SWE-1.7,目前已在 Devin 中上线。SWE-1.7 基于月之暗面的 Kimi K2.7 Code 研发。在多项智能体编程测试中,它接近 GPT-5.5 与 Claude Opus 4.8 的水平,但生成成本大幅降低。通过接入 Cerebras 推理芯片,SWE-1.7 的运行速度达到每秒 1000 Token。
为了应对超长任务,模型学会在上下文临界点自动总结当前状态,并从摘要中继续运行。这使单次任务的持续时间可以达到 6 小时。团队在训练中引入了交替长度惩罚机制,在特定阶段惩罚冗余输出,促使模型对简单任务精简推理,而将长推理留给难题。为打破单一集群算力限制,团队还构建了跨越三大洲的多集群分布式训练架构,通过仅同步权重变化量,在数分钟内即可完成全球节点的参数更新。
信源:https://cognition.com/blog/swe-1-7
AI 编程公司 Cognition 发布了全新 AI 编程大模型 SWE-1.7,目前已在 Devin 中上线。SWE-1.7 基于月之暗面的 Kimi K2.7 Code 研发。在多项智能体编程测试中,它接近 GPT-5.5 与 Claude Opus 4.8 的水平,但生成成本大幅降低。通过接入 Cerebras 推理芯片,SWE-1.7 的运行速度达到每秒 1000 Token。
为了应对超长任务,模型学会在上下文临界点自动总结当前状态,并从摘要中继续运行。这使单次任务的持续时间可以达到 6 小时。团队在训练中引入了交替长度惩罚机制,在特定阶段惩罚冗余输出,促使模型对简单任务精简推理,而将长推理留给难题。为打破单一集群算力限制,团队还构建了跨越三大洲的多集群分布式训练架构,通过仅同步权重变化量,在数分钟内即可完成全球节点的参数更新。
信源:https://cognition.com/blog/swe-1-7
Cognition
SWE-1.7: Frontier Intelligence at a Fraction of the Cost
Today, we’re launching SWE-1.7, the most capable model we’ve trained so far. It reaches frontier-level intelligence at a much lower cost, advancing the cost-performance Pareto curve.
🎉1
SambaNova估值升至110亿美元,摩根大通将采用其AI推理系统
AI 芯片与基础设施公司 SambaNova 完成 F 轮首批 10 亿美元融资,公司投后估值达到 110 亿美元。本轮由 General Atlantic 领投,Seligman Ventures、T. Rowe Price、Capital Group 等参投。
SambaNova 同时宣布,摩根大通已选择其 RDU 芯片系统,用于安全的本地 AI 推理。RDU 是 SambaNova 自研的数据流处理芯片,主打企业内部部署,不把敏感数据送到外部云端。
新资金将用于扩产、产品研发,以及扩大企业、云厂商和主权 AI 部署。
信源:https://sambanova.ai/press/sambanova-completes-first-close-of-1b-financing-at-11b-valuation
AI 芯片与基础设施公司 SambaNova 完成 F 轮首批 10 亿美元融资,公司投后估值达到 110 亿美元。本轮由 General Atlantic 领投,Seligman Ventures、T. Rowe Price、Capital Group 等参投。
SambaNova 同时宣布,摩根大通已选择其 RDU 芯片系统,用于安全的本地 AI 推理。RDU 是 SambaNova 自研的数据流处理芯片,主打企业内部部署,不把敏感数据送到外部云端。
新资金将用于扩产、产品研发,以及扩大企业、云厂商和主权 AI 部署。
信源:https://sambanova.ai/press/sambanova-completes-first-close-of-1b-financing-at-11b-valuation
sambanova.ai
SambaNova Completes First Close of $1B Financing at $11B Valuation
SambaNova today announced it has completed the first close of $1 billion in strategic financing as part of a Series F round, valuing the company at $11 billion post money.
Meta在加拿大建首座AI数据中心,130亿加元押注天然气
Meta 宣布在加拿大阿尔伯塔省斯特金县建设新的 AI 数据中心。这是 Meta 在加拿大的首座数据中心,也是其全球第 33 座数据中心。项目投资超过 130 亿加元,规模为 1GW,主要用于支撑 Meta 的 AI 训练和核心产品。
Meta 称,项目高峰期将支持超过 3000 个建筑岗位,建成后提供 300 多个运营岗位。公司还将投入约 6000 万加元,用于当地道路、供水等基础设施和社区项目。
这座数据中心将依赖新建天然气电厂供电。配套的绿光电力中心规模为 932MW,预计 2030 年下半年投运。项目采用闭环冷却系统,Meta 称不会直接取用当地水源。
信源:https://about.fb.com/news/2026/07/breaking-ground-on-metas-first-data-center-in-canada/
Meta 宣布在加拿大阿尔伯塔省斯特金县建设新的 AI 数据中心。这是 Meta 在加拿大的首座数据中心,也是其全球第 33 座数据中心。项目投资超过 130 亿加元,规模为 1GW,主要用于支撑 Meta 的 AI 训练和核心产品。
Meta 称,项目高峰期将支持超过 3000 个建筑岗位,建成后提供 300 多个运营岗位。公司还将投入约 6000 万加元,用于当地道路、供水等基础设施和社区项目。
这座数据中心将依赖新建天然气电厂供电。配套的绿光电力中心规模为 932MW,预计 2030 年下半年投运。项目采用闭环冷却系统,Meta 称不会直接取用当地水源。
信源:https://about.fb.com/news/2026/07/breaking-ground-on-metas-first-data-center-in-canada/
Meta Newsroom
Breaking Ground on Meta’s First Data Center in Canada
We’re breaking ground on a new 1GW, AI-optimized data center in Sturgeon County, Alberta — our first data center in Canada and 33rd in our global fleet.
火山引擎上线Seedream 5.0 Pro API,AI绘图走向局部像素级编辑
火山引擎发布豆包图像创作模型 Seedream 5.0 Pro 的 API 服务。新模型改进了传统 AI 绘图只能靠文字提示词控制的局限,提供像素级局部微调。设计师可以在画面中点选或圈选特定区域,直接调整位置、替换材质或分离图层,无需重绘整张图片。
模型提升了复杂排版与文字呈现质量,能够自动生成科普绘本、复杂 PPT 等高密度信息图。人像与光影质感同样得到强化,逼真还原皮肤肌理和环境折射。出海场景中,模型支持直接生成西班牙语、阿拉伯语等十余种全球常用语言,确保书写与排版符合当地习惯。
信源:https://mp.weixin.qq.com/s/s3vYTUZHZYNpVGSK-W9neA
火山引擎发布豆包图像创作模型 Seedream 5.0 Pro 的 API 服务。新模型改进了传统 AI 绘图只能靠文字提示词控制的局限,提供像素级局部微调。设计师可以在画面中点选或圈选特定区域,直接调整位置、替换材质或分离图层,无需重绘整张图片。
模型提升了复杂排版与文字呈现质量,能够自动生成科普绘本、复杂 PPT 等高密度信息图。人像与光影质感同样得到强化,逼真还原皮肤肌理和环境折射。出海场景中,模型支持直接生成西班牙语、阿拉伯语等十余种全球常用语言,确保书写与排版符合当地习惯。
信源:https://mp.weixin.qq.com/s/s3vYTUZHZYNpVGSK-W9neA
Typeless 2.0上线:边想边说也能直接成稿
AI 语音输入工具 Typeless 发布 2.0 版本。相比旧版,2.0 不只做语音转写和润色,还能把零散口述整理成完整文本。
用户可以边想边说,也可以中途改口、补充说明,比如「这里语气轻一点」「前面那句换个说法」。Typeless 会把这些内容当作写作提示,而不是原样写进正文。
这让 Typeless 更像一个语音写作代理,能把半成品想法快速变成邮件、消息、社媒回复或 AI prompt。
Typeless 支持 Mac、Windows、iOS 和 Android。官方称,语音和有限上下文会在云端实时处理,结果返回设备后立即丢弃,不在服务器保存。
信源:https://x.com/huang_song_/status/2074860776670847388?s=46
AI 语音输入工具 Typeless 发布 2.0 版本。相比旧版,2.0 不只做语音转写和润色,还能把零散口述整理成完整文本。
用户可以边想边说,也可以中途改口、补充说明,比如「这里语气轻一点」「前面那句换个说法」。Typeless 会把这些内容当作写作提示,而不是原样写进正文。
这让 Typeless 更像一个语音写作代理,能把半成品想法快速变成邮件、消息、社媒回复或 AI prompt。
Typeless 支持 Mac、Windows、iOS 和 Android。官方称,语音和有限上下文会在云端实时处理,结果返回设备后立即丢弃,不在服务器保存。
信源:https://x.com/huang_song_/status/2074860776670847388?s=46
AI编程跑分又不准了,OpenAI发现SWE-Bench Pro约三成题目有问题
OpenAI 发布编程评测审计报告,称 SWE-Bench Pro 约三成题目不适合作为有效评测。SWE-Bench Pro 原本用于测试 AI agent 的真实编程能力,也是 OpenAI 此前推荐替代 SWE-bench Verified 的评测集。
OpenAI 审计了 SWE-Bench Pro 的 731 道公开题。自动流程标出 200 道问题题目,占 27.4%;人工标注发现 249 道,占 34.1%。
主要问题包括:题目描述不完整、测试要求过严、隐藏测试检查了额外要求,以及测试覆盖不足。这会让模型跑分失真:失败不一定是模型不会,通过也不一定是真修好了问题。
OpenAI 称,前沿模型在这组公开题上的通过率,8 个月内从 23.3% 升到 80.3%。但在题目本身存在噪声的情况下,这类涨分需要更谨慎解读。
OpenAI 已撤回此前采用 SWE-Bench Pro 的建议,并呼吁社区重新构建更可信的编程评测。
信源:https://openai.com/index/separating-signal-from-noise-coding-evaluations/
OpenAI 发布编程评测审计报告,称 SWE-Bench Pro 约三成题目不适合作为有效评测。SWE-Bench Pro 原本用于测试 AI agent 的真实编程能力,也是 OpenAI 此前推荐替代 SWE-bench Verified 的评测集。
OpenAI 审计了 SWE-Bench Pro 的 731 道公开题。自动流程标出 200 道问题题目,占 27.4%;人工标注发现 249 道,占 34.1%。
主要问题包括:题目描述不完整、测试要求过严、隐藏测试检查了额外要求,以及测试覆盖不足。这会让模型跑分失真:失败不一定是模型不会,通过也不一定是真修好了问题。
OpenAI 称,前沿模型在这组公开题上的通过率,8 个月内从 23.3% 升到 80.3%。但在题目本身存在噪声的情况下,这类涨分需要更谨慎解读。
OpenAI 已撤回此前采用 SWE-Bench Pro 的建议,并呼吁社区重新构建更可信的编程评测。
信源:https://openai.com/index/separating-signal-from-noise-coding-evaluations/
OpenAI
Separating signal from noise in coding evaluations
A new analysis from OpenAI reveals issues in SWE-Bench Pro, a popular coding benchmark, raising concerns about reliability and accuracy in evaluating AI models.
传GPT-6改用更大底座对标Fable5.1,DeepSeek V4 GA或超GLM-5.2
AI 爆料账号 leo 称,OpenAI 的 GPT-5.6 将是 5.x 系列最后一代,GPT-6 预计约一个月内发布,甚至可能更早。
GPT-6 将基于一个新的、更大的预训练底座,而不是继续沿用 GPT-5.5 / GPT-5.6 传闻中的 Spud 底座。Spud 规模约为 4T 参数。OpenAI 原本计划将 Spud 用到 GPT-6,但最终改用更大底座。
OpenAI 内部对新底座很兴奋,认为它更适合对抗 Anthropic 的 Fable 5 和即将推出的 Fable 5.1。
同一爆料还提到,DeepSeek 正准备推出 V4 GA,表现可能对标或超过 GLM-5.2。DeepSeek 也已开始研发更大规模模型,用来对抗 MiniMax 计划推出的 2.7 万亿参数 MiniMax Pro / M3 Pro。
信源:https://x.com/synthwavedd/status/2074886230018568582?s=46
AI 爆料账号 leo 称,OpenAI 的 GPT-5.6 将是 5.x 系列最后一代,GPT-6 预计约一个月内发布,甚至可能更早。
GPT-6 将基于一个新的、更大的预训练底座,而不是继续沿用 GPT-5.5 / GPT-5.6 传闻中的 Spud 底座。Spud 规模约为 4T 参数。OpenAI 原本计划将 Spud 用到 GPT-6,但最终改用更大底座。
OpenAI 内部对新底座很兴奋,认为它更适合对抗 Anthropic 的 Fable 5 和即将推出的 Fable 5.1。
同一爆料还提到,DeepSeek 正准备推出 V4 GA,表现可能对标或超过 GLM-5.2。DeepSeek 也已开始研发更大规模模型,用来对抗 MiniMax 计划推出的 2.7 万亿参数 MiniMax Pro / M3 Pro。
信源:https://x.com/synthwavedd/status/2074886230018568582?s=46
OpenAI研究员:多数AI研究任务,我会选GPT-5.6而不是人类实习生
OpenAI 高级研究员 Noam Brown 表示,如果是在今天的大多数 AI 研究任务中,他会选择 GPT-5.6,而不是一名人类研究实习生。
Brown 是在 ICML 2026 期间回应「AI 是否已达到 AI 研究实习生水平」时作出上述表态。他同时承认,目前还没有公认方法衡量 AI 是否真正达到人类研究实习生水平。
另一位 OpenAI 研究员 Yash Pande 提出一个更现实的衡量方式:研究人员愿意给 Codex 分配多少 GPU 去完成科研任务。如果 AI 真比人更强,公司理论上会投入更多算力。
信源:https://www.theinformation.com/articles/openai-researcher-says-gpt-5-6-better-ai-research-human-interns
OpenAI 高级研究员 Noam Brown 表示,如果是在今天的大多数 AI 研究任务中,他会选择 GPT-5.6,而不是一名人类研究实习生。
Brown 是在 ICML 2026 期间回应「AI 是否已达到 AI 研究实习生水平」时作出上述表态。他同时承认,目前还没有公认方法衡量 AI 是否真正达到人类研究实习生水平。
另一位 OpenAI 研究员 Yash Pande 提出一个更现实的衡量方式:研究人员愿意给 Codex 分配多少 GPU 去完成科研任务。如果 AI 真比人更强,公司理论上会投入更多算力。
信源:https://www.theinformation.com/articles/openai-researcher-says-gpt-5-6-better-ai-research-human-interns
The Information
OpenAI Researcher Says GPT-5.6 is Better at AI Research Than Most Human Interns
I’m reporting from Seoul, where thousands of AI researchers from around the world have gathered for this year’s International Conference on Machine Learning. One of the most popular spots at the conference is OpenAI’s booth, which has been consistently encircled…
OpenAI研究员:下一代模型可能让大量Agent框架过时
OpenAI 高级研究员 Noam Brown 表示,开发者不应把太多精力投入复杂的 Agent 框架(Harness)。随着模型能力快速提升,今天许多依赖框架实现的功能,未来几个月可能会变成模型的原生能力。
Brown 建议开发者尽量保持框架简单,把更多能力交给模型本身完成。OpenAI 企业产品负责人 Alexander Embiricos 此前也表示,公司会避免手工开发那些未来模型应该自带的能力。
信源:https://www.theinformation.com/articles/openai-researcher-says-gpt-5-6-better-ai-research-human-interns
OpenAI 高级研究员 Noam Brown 表示,开发者不应把太多精力投入复杂的 Agent 框架(Harness)。随着模型能力快速提升,今天许多依赖框架实现的功能,未来几个月可能会变成模型的原生能力。
Brown 建议开发者尽量保持框架简单,把更多能力交给模型本身完成。OpenAI 企业产品负责人 Alexander Embiricos 此前也表示,公司会避免手工开发那些未来模型应该自带的能力。
信源:https://www.theinformation.com/articles/openai-researcher-says-gpt-5-6-better-ai-research-human-interns
The Information
OpenAI Researcher Says GPT-5.6 is Better at AI Research Than Most Human Interns
I’m reporting from Seoul, where thousands of AI researchers from around the world have gathered for this year’s International Conference on Machine Learning. One of the most popular spots at the conference is OpenAI’s booth, which has been consistently encircled…
OpenClaw基金会正式运营,腾讯与OpenAI英伟达微软同列首批伙伴
开源个人 AI agent 项目 OpenClaw 宣布,其非营利基金会 OpenClaw Foundation 已正式运营。
OpenClaw 是一个跑在用户自己设备上的个人 AI 助手。它可以接入邮件、日历、聊天工具和本地应用,让 AI 直接替用户完成任务。
基金会将负责 OpenClaw 的治理、资金、社区和长期维护,确保项目继续保持开源和独立。
官方称,OpenClaw 仍将保持 MIT 许可。Peter Steinberger 会继续负责项目方向,尤其是技术决策。OpenAI 也承诺支持 OpenClaw 作为开放独立项目运行。
首批合作伙伴包括 OpenAI、英伟达、微软、密歇根大学、GitHub、Cloudflare、Vercel 等。中国公司腾讯也在名单中,主要参与安全、部署和基础设施相关支持。
信源:https://openclaw.ai/blog/introducing-openclaw-foundation?xcard=20260708
开源个人 AI agent 项目 OpenClaw 宣布,其非营利基金会 OpenClaw Foundation 已正式运营。
OpenClaw 是一个跑在用户自己设备上的个人 AI 助手。它可以接入邮件、日历、聊天工具和本地应用,让 AI 直接替用户完成任务。
基金会将负责 OpenClaw 的治理、资金、社区和长期维护,确保项目继续保持开源和独立。
官方称,OpenClaw 仍将保持 MIT 许可。Peter Steinberger 会继续负责项目方向,尤其是技术决策。OpenAI 也承诺支持 OpenClaw 作为开放独立项目运行。
首批合作伙伴包括 OpenAI、英伟达、微软、密歇根大学、GitHub、Cloudflare、Vercel 等。中国公司腾讯也在名单中,主要参与安全、部署和基础设施相关支持。
信源:https://openclaw.ai/blog/introducing-openclaw-foundation?xcard=20260708
openclaw.ai
Introducing the OpenClaw Foundation - OpenClaw Blog
The lobster grows up: OpenClaw is now a non-profit, with a full-time team, world-class partners, and a mission to bring personal AI to everyone.
❤1
动察Beating AI News
一碰红线即归零:Zapier推出AI自动化新评测,最强模型得分亦折半 工作流自动化平台 Zapier 与评测机构 Artificial Analysis 合作,推出了独立的 SaaS 工作流自动化评测基准 AutomationBench-AA。 基准基于 Zapier 平台上的真实脱敏数据,设计了包含 657 个多步骤任务和 40 个模拟 SaaS 软件环境(包括 Gmail、Slack、Salesforce、Jira 等)的私有测试集,进行客观的第三方评估。 测试的严苛之处在于引入了安全合规红线(…
Grok 4.5登顶SaaS工作流评测,成本约为Claude四分之一
独立评测机构 Artificial Analysis 更新 AutomationBench-AA 榜单。SpaceXAI 的 Grok 4.5 以 51.4% 得分登顶,超过 Claude Fable 5 的 48.6% 和 Claude Opus 4.8 的 48.5%。
AutomationBench-AA 基于 Zapier 的 AutomationBench,测试 AI agent 能否按企业规则完成真实 SaaS 工作流。测试集包含 657 个多步骤任务,覆盖 40 个模拟应用环境,包括 Gmail、Google Sheets、Slack、Salesforce 和 HubSpot。
评分规则很严。模型不只要把任务做完,还不能碰企业预设红线。只要某个任务触发违规,这个任务就按 0 分处理。
Grok 4.5 的原始目标完成率接近 80%,高于 Claude Fable 5 和 Claude Opus 4.8。即便被红线扣分后,它仍以 51.4% 排在第一,也是当前首个得分超过 50% 的模型。
它的成本优势更明显。Grok 4.5 每个任务成本为 0.34 美元,低于 Claude Fable 5 的 1.35 美元、Claude Opus 4.8 的 1.46 美元,以及 GPT-5.5 xhigh 的 1.28 美元。
但 Grok 4.5 不是最稳的模型。它平均每个任务触发 0.63 次违规,高于 Claude Opus 4.8 的 0.55 次和 Gemini 3.5 Flash 的 0.46 次。
信源:https://x.com/artificialanlys/status/2075047187525034114?s=46
独立评测机构 Artificial Analysis 更新 AutomationBench-AA 榜单。SpaceXAI 的 Grok 4.5 以 51.4% 得分登顶,超过 Claude Fable 5 的 48.6% 和 Claude Opus 4.8 的 48.5%。
AutomationBench-AA 基于 Zapier 的 AutomationBench,测试 AI agent 能否按企业规则完成真实 SaaS 工作流。测试集包含 657 个多步骤任务,覆盖 40 个模拟应用环境,包括 Gmail、Google Sheets、Slack、Salesforce 和 HubSpot。
评分规则很严。模型不只要把任务做完,还不能碰企业预设红线。只要某个任务触发违规,这个任务就按 0 分处理。
Grok 4.5 的原始目标完成率接近 80%,高于 Claude Fable 5 和 Claude Opus 4.8。即便被红线扣分后,它仍以 51.4% 排在第一,也是当前首个得分超过 50% 的模型。
它的成本优势更明显。Grok 4.5 每个任务成本为 0.34 美元,低于 Claude Fable 5 的 1.35 美元、Claude Opus 4.8 的 1.46 美元,以及 GPT-5.5 xhigh 的 1.28 美元。
但 Grok 4.5 不是最稳的模型。它平均每个任务触发 0.63 次违规,高于 Claude Opus 4.8 的 0.55 次和 Gemini 3.5 Flash 的 0.46 次。
信源:https://x.com/artificialanlys/status/2075047187525034114?s=46
X (formerly Twitter)
Artificial Analysis (@ArtificialAnlys) on X
SpaceXAI's Grok 4.5 takes the #1 spot on AutomationBench-AA with a score of 51%, ahead of Claude Fable 5 (49%) and Claude Opus 4.8 (48%) at roughly a quarter of their cost per task - the first model to complete more than half of workflow objectives without…
OpenAI招投行专家,AI要学估值和尽调了
OpenAI 正在为 Applied AI 团队招聘一名投行业务专家,岗位位于旧金山。
招聘页显示,这个岗位主要服务模型训练和评测。候选人需要熟悉行业研究、财务分析、估值、尽调、交易执行和客户材料制作。
入职后,这名专家要设计真实投行任务,制定评测标准,并制作金融模型、估值分析、pitch book、投委会材料等参考样本。
OpenAI 还要求候选人评估模型和 agent 工作流。重点是判断结果是否准确、可追溯、前后一致,能否通过资深投行人士审查。
岗位要求至少 2 年投行经验。工作模式为每周 3 天到办公室。薪酬为 18.5 万至 20.5 万美元,并提供股权。
信源:https://openai.com/careers/subject-matter-expert-investment-banking-san-francisco/
OpenAI 正在为 Applied AI 团队招聘一名投行业务专家,岗位位于旧金山。
招聘页显示,这个岗位主要服务模型训练和评测。候选人需要熟悉行业研究、财务分析、估值、尽调、交易执行和客户材料制作。
入职后,这名专家要设计真实投行任务,制定评测标准,并制作金融模型、估值分析、pitch book、投委会材料等参考样本。
OpenAI 还要求候选人评估模型和 agent 工作流。重点是判断结果是否准确、可追溯、前后一致,能否通过资深投行人士审查。
岗位要求至少 2 年投行经验。工作模式为每周 3 天到办公室。薪酬为 18.5 万至 20.5 万美元,并提供股权。
信源:https://openai.com/careers/subject-matter-expert-investment-banking-san-francisco/
Openai
Subject Matter Expert, Investment Banking
Applied AI · San Francisco · FullTime
Claude Code上线/checkup,一键清理臃肿配置省上下文
Anthropic 旗下终端 Agent 工具 Claude Code 新增 /checkup 命令,用来检查和清理本地开发环境。
/checkup 会检查未使用的 Skills、MCP 和插件,减少无效上下文占用。它还能去重本地 CLAUDE.md,并把根目录 CLAUDE.md 拆成更细的嵌套文件或 Skills。
新命令还会检查慢 Hook、版本更新和权限设置。它可以建议开启默认 Auto Mode,并把常被拦截的只读命令加入预批准。
/checkup 在修改前会先向用户确认,用户可以选择全部清理、手动挑选,或只查看报告。
信源:https://x.com/bcherny/status/2074997570317779038?s=46
Anthropic 旗下终端 Agent 工具 Claude Code 新增 /checkup 命令,用来检查和清理本地开发环境。
/checkup 会检查未使用的 Skills、MCP 和插件,减少无效上下文占用。它还能去重本地 CLAUDE.md,并把根目录 CLAUDE.md 拆成更细的嵌套文件或 Skills。
新命令还会检查慢 Hook、版本更新和权限设置。它可以建议开启默认 Auto Mode,并把常被拦截的只读命令加入预批准。
/checkup 在修改前会先向用户确认,用户可以选择全部清理、手动挑选,或只查看报告。
信源:https://x.com/bcherny/status/2074997570317779038?s=46
Anthropic给AI危险知识装开关,一个模型切出16种配置
Anthropic 与 AE Studio 发布新研究 GRAM,尝试给 AI 的「双用途知识」装上开关。双用途知识指既能用于正当研究,也可能被滥用的能力,比如病毒学、网络安全和核物理。
GRAM 的做法是在模型每一层加入额外模块。训练遇到敏感领域数据时,只让对应模块学习。训练结束后,开发者可以保留模块,也可以删除模块,让模型失去对应能力。
研究团队在真实数据实验中测试了 4 类双用途领域:病毒学、网络安全、核物理和小众编程语言。4 个模块可组合出 16 种能力配置。相比为每种配置单独训练模型,这种方法只需一次训练。
论文还测试了 50M 到 5B 参数模型。结果显示,GRAM 在保留通用能力的同时,能较好移除目标能力,对小规模恶意微调的抵抗也强于训练后「遗忘」方法。
信源:https://www.anthropic.com/research/off-switch-dual-use
Anthropic 与 AE Studio 发布新研究 GRAM,尝试给 AI 的「双用途知识」装上开关。双用途知识指既能用于正当研究,也可能被滥用的能力,比如病毒学、网络安全和核物理。
GRAM 的做法是在模型每一层加入额外模块。训练遇到敏感领域数据时,只让对应模块学习。训练结束后,开发者可以保留模块,也可以删除模块,让模型失去对应能力。
研究团队在真实数据实验中测试了 4 类双用途领域:病毒学、网络安全、核物理和小众编程语言。4 个模块可组合出 16 种能力配置。相比为每种配置单独训练模型,这种方法只需一次训练。
论文还测试了 50M 到 5B 参数模型。结果显示,GRAM 在保留通用能力的同时,能较好移除目标能力,对小规模恶意微调的抵抗也强于训练后「遗忘」方法。
信源:https://www.anthropic.com/research/off-switch-dual-use
Anthropic
An off switch for dual-use knowledge in AI models
New results on a method of controlling access to potentially dangerous AI capabilities
OpenAI国安合作原则出炉:AI能进军方,但不能自己开火
OpenAI 发布政府与国家安全合作原则,明确会继续和美国政府及盟友合作。
合作重点主要是两类:网络防御和生物安全。
网络防御:OpenAI 已和澳大利亚、加拿大、日本、韩国、法国、德国、波兰、荷兰,以及欧盟网络安全机构 ENISA 建立合作。英国政府也参与网络安全、模型测试和评估合作。
生物安全:OpenAI 已向部分美国政府和盟友开放 GPT-Rosalind,用于公共卫生和生物防御任务。
OpenAI 同时划出底线:不支持大规模国内监控,不支持绕开法律和监督,也不允许 AI 在没人类授权的情况下,自主选定并攻击目标。
但 OpenAI 没有把军事、情报和调查用途全部排除。
信源:https://openai.com/index/government-national-security-partnerships/
OpenAI 发布政府与国家安全合作原则,明确会继续和美国政府及盟友合作。
合作重点主要是两类:网络防御和生物安全。
网络防御:OpenAI 已和澳大利亚、加拿大、日本、韩国、法国、德国、波兰、荷兰,以及欧盟网络安全机构 ENISA 建立合作。英国政府也参与网络安全、模型测试和评估合作。
生物安全:OpenAI 已向部分美国政府和盟友开放 GPT-Rosalind,用于公共卫生和生物防御任务。
OpenAI 同时划出底线:不支持大规模国内监控,不支持绕开法律和监督,也不允许 AI 在没人类授权的情况下,自主选定并攻击目标。
但 OpenAI 没有把军事、情报和调查用途全部排除。
信源:https://openai.com/index/government-national-security-partnerships/
OpenAI
Our approach to government and national security partnerships
Learn how OpenAI approaches government and national security partnerships, with principles for responsible AI use, democratic accountability, and public safety.
Databricks拿真实代码库测Agent,GLM 5.2进第一梯队
Databricks 发布内部 AI 编程 Agent 评测,用自家数百万行代码库里的真实 PR 做测试。
这套评测没有直接用 SWE-Bench。Databricks 认为公开题集可能进过训练数据,也不够贴近真实工程。
测试任务来自近期合并的 PR,覆盖 Python、Go、TypeScript、Scala 等语言。团队过滤了机器人提交、AI 生成代码和自动生成代码,只保留能验证结果的任务。
结果显示,编程 Agent 已经分出大致三档。最高一档不只包括 OpenAI 和 Anthropic 模型,也包括开源模型。GLM 5.2 进入第一梯队,质量上与 Opus 4.8 接近,单任务成本为 1.28 美元,低于 Opus 4.8 的 1.94 美元。
评测还发现,Token 单价不能直接代表真实成本。Sonnet 5 每 Token 更便宜,但在这套任务里跑得更久、读得更多,单任务成本反而更高。
工具壳也很关键。同一模型换不同 Agent 框架,任务成本最高可差 2 倍以上,但完成质量变化不大。
信源:https://www.databricks.com/blog/benchmarking-coding-agents-databricks-multi-million-line-codebase
Databricks 发布内部 AI 编程 Agent 评测,用自家数百万行代码库里的真实 PR 做测试。
这套评测没有直接用 SWE-Bench。Databricks 认为公开题集可能进过训练数据,也不够贴近真实工程。
测试任务来自近期合并的 PR,覆盖 Python、Go、TypeScript、Scala 等语言。团队过滤了机器人提交、AI 生成代码和自动生成代码,只保留能验证结果的任务。
结果显示,编程 Agent 已经分出大致三档。最高一档不只包括 OpenAI 和 Anthropic 模型,也包括开源模型。GLM 5.2 进入第一梯队,质量上与 Opus 4.8 接近,单任务成本为 1.28 美元,低于 Opus 4.8 的 1.94 美元。
评测还发现,Token 单价不能直接代表真实成本。Sonnet 5 每 Token 更便宜,但在这套任务里跑得更久、读得更多,单任务成本反而更高。
工具壳也很关键。同一模型换不同 Agent 框架,任务成本最高可差 2 倍以上,但完成质量变化不大。
信源:https://www.databricks.com/blog/benchmarking-coding-agents-databricks-multi-million-line-codebase