动察Beating AI News
2.98K subscribers
784 photos
2 videos
3.23K links
AI新闻信息流
Download Telegram
OpenAI九年老将Joshua Achiam离职:AGI使命不只在实验室墙内

OpenAI 首席未来学家 Joshua Achiam 宣布将离开公司,本月 24 日是最后一天。他在 X 上公开了发给内部 Slack 的告别信,称离职没有具体原因,也不是被某个时间点触发,只是自己想了一段时间后,认为现在已经可以在前沿实验室之外继续推动安全 AGI 使命。

Achiam 2017 年以实习生身份加入 OpenAI,之后长期从事 AI 安全研究,曾担任使命对齐团队负责人。今年 2 月,OpenAI 解散使命对齐团队后,他转任首席未来学家,负责研究 AGI 和更强 AI 对社会、政策与安全的影响。

他在告别信中说,过去九年像是「一个十年里发生了几个世纪的变化」;未来取决于各方围绕 AGI 和超级智能作出的共同选择。

OpenAI 暂未公布谁将接任这一角色。Achiam 是 OpenAI 近年离开的又一位安全方向负责人。

信源:https://x.com/jachiam0/status/2074605703281693175?s=46
👍1🤡1
MiniMax三季度或开源2.7万亿参数模型,有望成为全球最大开源大模型

The Information 援引知情人士称,MiniMax 正在研发一款 2.7 万亿参数大语言模型,最快可能在第三季度发布,并计划开源。模型内部代号为 M3 Pro,但最终发布名称尚未确定。

如果按计划开放权重,这款模型有望成为全球参数规模最大的开源大模型。MiniMax 现有旗舰模型 M3 为 4280 亿参数,新模型规模约为 M3 的 6.3 倍,也将超过目前多款万亿级开放权重模型。

更大的参数规模通常有利于复杂推理和多步指令任务,但最终表现仍要看训练质量、激活参数、推理成本和评测结果。MiniMax 需要用这款模型证明自己仍在中国开源模型第一梯队。

信源:https://www.theinformation.com/briefings/exclusive-chinas-minimax-plans-launch-2-7-trillion-parameter-model
Mistral发布8B机器人导航模型,只靠一颗摄像头认路

Mistral AI 发布 Robostral Navigate,这是一个面向机器人导航的 8B 模型。用户给一句普通指令,比如「离开大厅,穿过走廊,进储物间」,机器人就能根据摄像头画面自己移动。

最大亮点是硬件要求很低。Robostral Navigate 只用一颗普通 RGB 摄像头,不用激光雷达、深度传感器或多摄像头方案。在 R2R-CE 测试中,它在未见过环境里的成功率达到 76.6%,比最佳单摄像头方案高 9.7 个百分点,也比最佳多传感器方案高 4.5 个百分点。

模型完全用模拟数据训练,数据包含约 40 万条路径和 6000 个场景。它会先看摄像头画面,判断下一步往哪里走;如果目标不在画面里,就改用「向前 2 米、左转 25 度」这类动作指令继续找路。训练时,团队还复用了大量重复内容的计算结果,把训练 token 数压低了 22 倍;强化学习又让成功率提高 3.2%。

信源:https://mistral.ai/news/robostral-navigate
🎉1
以四分之一生成成本硬刚Claude!SpaceXAI推出Grok 4.5推理模型

SpaceXAI 正式推出 Grok 4.5 推理模型。新模型主打编程、智能体任务和专业推理。这是 SpaceX 收购 AI 编程平台 Cursor 后的首个成果。模型利用 Cursor 平台万亿级交互数据进行了联合训练。

在软件工程测试 SWE Bench Pro 中,新模型解决单个任务平均仅需约 1.6 万个输出 token。这比 Claude 4.8 Opus 节省了 4.2 倍,开发成本大幅降低. 目前模型运行速度为 80 TPS。API 价格为输入每百万 2 美元,输出 6 美元。除编程外,用户还可以在 Grok Build 中进行联网 Excel 建模,或者在 Word 和 PowerPoint 里生成排版与图表。

开发者可在 Cursor、Grok Build 和 SpaceXAI 控制台体验,但欧盟地区需等到 7 月中旬。

信源:https://x.ai/news/grok-4-5
中国拟允许采购英伟达H200:仅限训练,推理须优先国产

中国政府计划允许阿里巴巴、字节跳动和 DeepSeek 等头部 AI 企业采购少量英伟达 H200 芯片,以缓解国内严重的算力缺口。美国已在 2025 年 12 月批准芯片出口,但中国官方此前因保护本土产业,以及担忧芯片被远程追踪、禁用等网络安全风险,一直未发放采购许可。

本次拟批准的采购总量预计不足 20 万颗,低于企业 2026 年初申请量的一半,且最终审批尚未完全落实,仍存在变数。官方要求这批芯片仅用于训练公开数据,严禁处理敏感客户信息;在模型推理环节,政府明确要求企业优先使用国产处理器,来强化本土芯片的战略地位。

由于美国近期加大了对东南亚走私芯片的打击力度,国内黑市渠道收紧,企业面临更大的训练算力缺口。这一采购松动可能为英伟达带来意料之外的营收。

信源:https://www.theinformation.com/articles/china-plans-let-top-ai-firms-buy-limited-amount-nvidia-h200-chips
2
长鑫科技科创板IPO:估算市值达2950亿,首日限售比例达78%

芯片巨头长鑫科技已获中国证监会同意注册,正式启动发行程序。本次计划募资 295 亿元,是近年来最大的半导体上市案。如果按募资额与发行量计算,它的估算发行价大约为每股 4.41 元,发行后的总市值(估算上市市值)将接近 2950 亿元。今年上半年,公司预计实现收入 1100 亿到 1200 亿元,净利润达 660 亿到 750 亿元,业绩实现强劲扭亏。

根据初始发行安排测算,上市首日可流通新股的比例较低。本次发行初始战略配售占比达上限 50.00%。网下配售执行「3+7」规则,其中 70% 的网下获配股份须限售 6 个月。测算显示,新股发行总量中约 78.00% 在首日处于限售锁定状态,首日可流通新股仅占 22.00%,对应估算流通市值约 65 亿元。

参与申购的投资者需要注意资格与市值门槛。网上普通投资者申购(代码 787825)须开通科创板交易权限,并在 7 月 14 日前持有 1 万元以上的沪市日均市值;参与网下询价的机构则要求极严,不仅要有 6000 万元的沪市市值,还必须有 600 万元以上的科创板日均持仓。限售方面,部分持股 51% 以上的主要发行前股东承诺锁定 36 个月,第一大股东清辉集电还承诺若上市当年起扣非归母净利润较上市前一年下滑超 50% 将自动延长锁定 12 个月。主承销商中金公司拥有 15% 的超额配售选择权,在上市后 30 个自然日内若股价跌破发行价,有权在二级市场买入股票进行稳定。

信源:https://static.sse.com.cn/disclosure/listedinfo/announcement/c/new/2026-07-09/688825_20260709_A24U.pdf
OpenAI推出全新语音架构GPT-Live:支持边听边说,后台运算不卡顿

OpenAI 宣布向全球 ChatGPT 用户推送第三代语音模型和架构 GPT-Live,免费用户可使用 GPT-Live-1 mini,付费用户默认使用 GPT-Live-1。它将复杂推理与实时交谈剥离,用户说话时它能同时倾听,不再需要像对讲机一样轮流发言。

GPT-Live 采用全双工(full-duplex)架构,支持双向倾听与发言。对话中它会用「嗯」、「对的」等语气词表明自己在听,支持快速来回互动,或在用户需要思考时保持安静。

遇到需要搜索或深度推理的问题时,GPT-Live 会在后台将任务委派给 GPT-5.5 运行,并在等待结果期间保持与用户的交谈。在交谈中它还能呈现天气、股市等视觉卡片来辅助理解。

信源:https://x.com/OpenAI/status/2074907025537224840
🎉1
Cognition发布每秒1000 Token的编程大模型SWE-1.7

AI 编程公司 Cognition 发布了全新 AI 编程大模型 SWE-1.7,目前已在 Devin 中上线。SWE-1.7 基于月之暗面的 Kimi K2.7 Code 研发。在多项智能体编程测试中,它接近 GPT-5.5 与 Claude Opus 4.8 的水平,但生成成本大幅降低。通过接入 Cerebras 推理芯片,SWE-1.7 的运行速度达到每秒 1000 Token。

为了应对超长任务,模型学会在上下文临界点自动总结当前状态,并从摘要中继续运行。这使单次任务的持续时间可以达到 6 小时。团队在训练中引入了交替长度惩罚机制,在特定阶段惩罚冗余输出,促使模型对简单任务精简推理,而将长推理留给难题。为打破单一集群算力限制,团队还构建了跨越三大洲的多集群分布式训练架构,通过仅同步权重变化量,在数分钟内即可完成全球节点的参数更新。

信源:https://cognition.com/blog/swe-1-7
🎉1
SambaNova估值升至110亿美元,摩根大通将采用其AI推理系统

AI 芯片与基础设施公司 SambaNova 完成 F 轮首批 10 亿美元融资,公司投后估值达到 110 亿美元。本轮由 General Atlantic 领投,Seligman Ventures、T. Rowe Price、Capital Group 等参投。

SambaNova 同时宣布,摩根大通已选择其 RDU 芯片系统,用于安全的本地 AI 推理。RDU 是 SambaNova 自研的数据流处理芯片,主打企业内部部署,不把敏感数据送到外部云端。

新资金将用于扩产、产品研发,以及扩大企业、云厂商和主权 AI 部署。

信源:https://sambanova.ai/press/sambanova-completes-first-close-of-1b-financing-at-11b-valuation
Meta在加拿大建首座AI数据中心,130亿加元押注天然气

Meta 宣布在加拿大阿尔伯塔省斯特金县建设新的 AI 数据中心。这是 Meta 在加拿大的首座数据中心,也是其全球第 33 座数据中心。项目投资超过 130 亿加元,规模为 1GW,主要用于支撑 Meta 的 AI 训练和核心产品。

Meta 称,项目高峰期将支持超过 3000 个建筑岗位,建成后提供 300 多个运营岗位。公司还将投入约 6000 万加元,用于当地道路、供水等基础设施和社区项目。

这座数据中心将依赖新建天然气电厂供电。配套的绿光电力中心规模为 932MW,预计 2030 年下半年投运。项目采用闭环冷却系统,Meta 称不会直接取用当地水源。

信源:https://about.fb.com/news/2026/07/breaking-ground-on-metas-first-data-center-in-canada/
火山引擎上线Seedream 5.0 Pro API,AI绘图走向局部像素级编辑

火山引擎发布豆包图像创作模型 Seedream 5.0 Pro 的 API 服务。新模型改进了传统 AI 绘图只能靠文字提示词控制的局限,提供像素级局部微调。设计师可以在画面中点选或圈选特定区域,直接调整位置、替换材质或分离图层,无需重绘整张图片。

模型提升了复杂排版与文字呈现质量,能够自动生成科普绘本、复杂 PPT 等高密度信息图。人像与光影质感同样得到强化,逼真还原皮肤肌理和环境折射。出海场景中,模型支持直接生成西班牙语、阿拉伯语等十余种全球常用语言,确保书写与排版符合当地习惯。

信源:https://mp.weixin.qq.com/s/s3vYTUZHZYNpVGSK-W9neA
Typeless 2.0上线:边想边说也能直接成稿

AI 语音输入工具 Typeless 发布 2.0 版本。相比旧版,2.0 不只做语音转写和润色,还能把零散口述整理成完整文本。

用户可以边想边说,也可以中途改口、补充说明,比如「这里语气轻一点」「前面那句换个说法」。Typeless 会把这些内容当作写作提示,而不是原样写进正文。

这让 Typeless 更像一个语音写作代理,能把半成品想法快速变成邮件、消息、社媒回复或 AI prompt。

Typeless 支持 Mac、Windows、iOS 和 Android。官方称,语音和有限上下文会在云端实时处理,结果返回设备后立即丢弃,不在服务器保存。

信源:https://x.com/huang_song_/status/2074860776670847388?s=46
AI编程跑分又不准了,OpenAI发现SWE-Bench Pro约三成题目有问题

OpenAI 发布编程评测审计报告,称 SWE-Bench Pro 约三成题目不适合作为有效评测。SWE-Bench Pro 原本用于测试 AI agent 的真实编程能力,也是 OpenAI 此前推荐替代 SWE-bench Verified 的评测集。

OpenAI 审计了 SWE-Bench Pro 的 731 道公开题。自动流程标出 200 道问题题目,占 27.4%;人工标注发现 249 道,占 34.1%。

主要问题包括:题目描述不完整、测试要求过严、隐藏测试检查了额外要求,以及测试覆盖不足。这会让模型跑分失真:失败不一定是模型不会,通过也不一定是真修好了问题。

OpenAI 称,前沿模型在这组公开题上的通过率,8 个月内从 23.3% 升到 80.3%。但在题目本身存在噪声的情况下,这类涨分需要更谨慎解读。

OpenAI 已撤回此前采用 SWE-Bench Pro 的建议,并呼吁社区重新构建更可信的编程评测。

信源:https://openai.com/index/separating-signal-from-noise-coding-evaluations/
传GPT-6改用更大底座对标Fable5.1,DeepSeek V4 GA或超GLM-5.2

AI 爆料账号 leo 称,OpenAI 的 GPT-5.6 将是 5.x 系列最后一代,GPT-6 预计约一个月内发布,甚至可能更早。

GPT-6 将基于一个新的、更大的预训练底座,而不是继续沿用 GPT-5.5 / GPT-5.6 传闻中的 Spud 底座。Spud 规模约为 4T 参数。OpenAI 原本计划将 Spud 用到 GPT-6,但最终改用更大底座。

OpenAI 内部对新底座很兴奋,认为它更适合对抗 Anthropic 的 Fable 5 和即将推出的 Fable 5.1。

同一爆料还提到,DeepSeek 正准备推出 V4 GA,表现可能对标或超过 GLM-5.2。DeepSeek 也已开始研发更大规模模型,用来对抗 MiniMax 计划推出的 2.7 万亿参数 MiniMax Pro / M3 Pro。

信源:https://x.com/synthwavedd/status/2074886230018568582?s=46
腾讯混元Hy3上线爆火,WorkBuddy宣布紧急扩容

腾讯混元与 WorkBuddy 联合项目组宣布,Hy3 在 WorkBuddy 上线后调用量快速增长,7 月 8 日上午算力需求达到峰值,下午排队率一度超过 50%。

官方表示,团队已紧急调度算力资源完成扩容,目前服务恢复正常,并将继续优化 Hy3 的使用体验和稳定性。
OpenAI研究员:多数AI研究任务,我会选GPT-5.6而不是人类实习生

OpenAI 高级研究员 Noam Brown 表示,如果是在今天的大多数 AI 研究任务中,他会选择 GPT-5.6,而不是一名人类研究实习生。

Brown 是在 ICML 2026 期间回应「AI 是否已达到 AI 研究实习生水平」时作出上述表态。他同时承认,目前还没有公认方法衡量 AI 是否真正达到人类研究实习生水平。

另一位 OpenAI 研究员 Yash Pande 提出一个更现实的衡量方式:研究人员愿意给 Codex 分配多少 GPU 去完成科研任务。如果 AI 真比人更强,公司理论上会投入更多算力。

信源:https://www.theinformation.com/articles/openai-researcher-says-gpt-5-6-better-ai-research-human-interns
OpenAI研究员:下一代模型可能让大量Agent框架过时

OpenAI 高级研究员 Noam Brown 表示,开发者不应把太多精力投入复杂的 Agent 框架(Harness)。随着模型能力快速提升,今天许多依赖框架实现的功能,未来几个月可能会变成模型的原生能力。

Brown 建议开发者尽量保持框架简单,把更多能力交给模型本身完成。OpenAI 企业产品负责人 Alexander Embiricos 此前也表示,公司会避免手工开发那些未来模型应该自带的能力。

信源:https://www.theinformation.com/articles/openai-researcher-says-gpt-5-6-better-ai-research-human-interns
OpenClaw基金会正式运营,腾讯与OpenAI英伟达微软同列首批伙伴

开源个人 AI agent 项目 OpenClaw 宣布,其非营利基金会 OpenClaw Foundation 已正式运营。

OpenClaw 是一个跑在用户自己设备上的个人 AI 助手。它可以接入邮件、日历、聊天工具和本地应用,让 AI 直接替用户完成任务。

基金会将负责 OpenClaw 的治理、资金、社区和长期维护,确保项目继续保持开源和独立。

官方称,OpenClaw 仍将保持 MIT 许可。Peter Steinberger 会继续负责项目方向,尤其是技术决策。OpenAI 也承诺支持 OpenClaw 作为开放独立项目运行。

首批合作伙伴包括 OpenAI、英伟达、微软、密歇根大学、GitHub、Cloudflare、Vercel 等。中国公司腾讯也在名单中,主要参与安全、部署和基础设施相关支持。

信源:https://openclaw.ai/blog/introducing-openclaw-foundation?xcard=20260708
1
动察Beating AI News
一碰红线即归零:Zapier推出AI自动化新评测,最强模型得分亦折半 工作流自动化平台 Zapier 与评测机构 Artificial Analysis 合作,推出了独立的 SaaS 工作流自动化评测基准 AutomationBench-AA。 基准基于 Zapier 平台上的真实脱敏数据,设计了包含 657 个多步骤任务和 40 个模拟 SaaS 软件环境(包括 Gmail、Slack、Salesforce、Jira 等)的私有测试集,进行客观的第三方评估。 测试的严苛之处在于引入了安全合规红线(…
Grok 4.5登顶SaaS工作流评测,成本约为Claude四分之一

独立评测机构 Artificial Analysis 更新 AutomationBench-AA 榜单。SpaceXAI 的 Grok 4.5 以 51.4% 得分登顶,超过 Claude Fable 5 的 48.6% 和 Claude Opus 4.8 的 48.5%。

AutomationBench-AA 基于 Zapier 的 AutomationBench,测试 AI agent 能否按企业规则完成真实 SaaS 工作流。测试集包含 657 个多步骤任务,覆盖 40 个模拟应用环境,包括 Gmail、Google Sheets、Slack、Salesforce 和 HubSpot。

评分规则很严。模型不只要把任务做完,还不能碰企业预设红线。只要某个任务触发违规,这个任务就按 0 分处理。

Grok 4.5 的原始目标完成率接近 80%,高于 Claude Fable 5 和 Claude Opus 4.8。即便被红线扣分后,它仍以 51.4% 排在第一,也是当前首个得分超过 50% 的模型。

它的成本优势更明显。Grok 4.5 每个任务成本为 0.34 美元,低于 Claude Fable 5 的 1.35 美元、Claude Opus 4.8 的 1.46 美元,以及 GPT-5.5 xhigh 的 1.28 美元。

但 Grok 4.5 不是最稳的模型。它平均每个任务触发 0.63 次违规,高于 Claude Opus 4.8 的 0.55 次和 Gemini 3.5 Flash 的 0.46 次。

信源:https://x.com/artificialanlys/status/2075047187525034114?s=46
OpenAI招投行专家,AI要学估值和尽调了

OpenAI 正在为 Applied AI 团队招聘一名投行业务专家,岗位位于旧金山。

招聘页显示,这个岗位主要服务模型训练和评测。候选人需要熟悉行业研究、财务分析、估值、尽调、交易执行和客户材料制作。

入职后,这名专家要设计真实投行任务,制定评测标准,并制作金融模型、估值分析、pitch book、投委会材料等参考样本。

OpenAI 还要求候选人评估模型和 agent 工作流。重点是判断结果是否准确、可追溯、前后一致,能否通过资深投行人士审查。

岗位要求至少 2 年投行经验。工作模式为每周 3 天到办公室。薪酬为 18.5 万至 20.5 万美元,并提供股权。

信源:https://openai.com/careers/subject-matter-expert-investment-banking-san-francisco/