动察Beating AI News
3K subscribers
801 photos
2 videos
3.26K links
AI新闻信息流
Download Telegram
OpenAI重组安全团队,原安全系统负责人离职

OpenAI 原安全系统负责人 Johannes Heidecke 已向员工宣布离职。

与此同时,OpenAI 正在调整安全团队架构,将安全团队与研究团队进一步合并。原研究副总裁兼对齐负责人 Mia Glaese 将升任研究与安全副总裁,负责协调相关工作。OpenAI 所有安全团队今后都将向她汇报。

此前领导过安全团队的 Saachi Jain,将暂代安全系统负责人,并向 Glaese 汇报。

OpenAI 首席研究官 Mark Chen 称,由于训练模型的频率大幅加快,产品发布周期也明显缩短,安全协调比以往更难。希望通过新的组织架构,让安全团队更早参与模型、产品和发布决策。

信源:https://www.wired.com/story/openai-head-of-safety-leaving/
智谱启动「摸高计划」,未来两年不追短期变现

智谱创始人唐杰发布内部信,宣布启动 Touch High(摸高)计划。未来两年,公司将继续重投 AGI 研究,不把短期应用变现放在首位。

计划集中在四个方向:让模型长期执行复杂任务;让大量 Agent 自主协作;用合成数据和自博弈实现完全自我训练;加强安全治理。

唐杰特别强调安全,称智谱计划投入百亿级资源研究「机械可解释性」,弄清模型为什么会做出某个决定。他还表示,智谱上市后仍要回归基础模型研究,「不登顶,就是失败」。

此前,智谱公布一笔约 314 亿港元的新股配售。募集资金用途包括基座模型研发、算力基础设施建设和商业化拓展。

信源:https://mp.weixin.qq.com/s/3CQSkf_kBnXiCDgS4L-Cgg
👍21
苹果起诉OpenAI后,马斯克骂奥特曼诈骗,奥特曼反讽他向股民画饼

苹果起诉 OpenAI 窃取硬件机密后,马斯克立即借题发挥,称 Sam Altman「把诈骗提升到了新高度」。

他还贴出 Altman 说「我做这件事是因为热爱」的梗图,讽刺他「可能比世上任何人都更热衷诈骗」。

Altman 回呛,马斯克才是在向股市投资者兜售「短期内把数据中心送上太空」的故事。

马斯克回应称,相关设备明年就会发射,还嘲讽 Altman:「假释官批准的话,你可以来看看。」

同时马斯克继续火力全开,称 Altman 先「偷走一个开源 AI 公益组织」,现在又「偷走苹果全部手机技术」,并问他接下来还准备偷什么。
🤮3
奥特曼称AI目前反而在净增就业,和自己预想相反

OpenAI CEO Sam Altman 称,至少到目前为止,AI 很可能在净创造岗位,而不是造成净失业。他承认,这和自己原先的判断不同。以当前模型能力,他本以为就业市场早已受到更明显冲击。

这不是 Altman 第一次给「AI 失业潮」降温。5 月,他曾表示,AI 没有带来此前担心的「就业末日」。入门级白领岗位的流失也比预期少。

现有数据只能部分支持他的说法。欧洲央行研究发现,AI 对美国整体就业和工资的影响仍然有限。但高替代风险岗位在 2019 至 2025 年平均减少超过 4%。Altman 这次也没有给出「净增就业」的具体数据。

《华尔街日报》称,科技行业的口风正在集体转变。越来越多 CEO 从警告 AI 消灭岗位,转向强调它能提高生产率、帮助企业扩张。

信源:https://x.com/sama/status/2076036901824532530?s=46
OpenAI把K-pop搬进ICML,AI人才战卷成演唱会

OpenAI 在 ICML 2026 期间举办场外派对,请来韩国歌手 CHUNG HA 表演。舞台中央摆着 OpenAI 标志。她还对不认识自己的研究员说:「不知道我是谁,就去问 ChatGPT。」

现场视频传开后,有参会者调侃,自己已经取消了 Claude 订阅。另一名参会者称,一名 Anthropic 研究员抱怨,有候选人为了 K-pop 放弃其招聘晚宴。

ICML 今年吸引 20,456 名线下参会者,门票首次售罄。OpenAI、Google、Meta、Amazon 和 Apple 等公司都在会场内外延揽 AI 人才。
🤩1
阶跃发布Step Edge,端侧Agent工具调用低至0.1秒

阶跃星辰发布端侧模型家族 Step Edge,包含基础模型、Audio、GUI 和 Gen,面向手机、汽车等终端。它能在本地处理文字、图像和语音,完成屏幕理解、语音识别、界面操作及图像生成。端侧工具调用延迟最低 0.1 秒。

简单、高频或弱网任务可在本地完成,复杂推理再交给云端。敏感数据不用上传,也能减少对网络和云端算力的依赖。

阶跃还推出自研 Step Inference NPU 推理引擎,针对终端芯片降低延迟。官方称,Step Edge 系列在 29 项核心评测指标中取得第一。

信源:https://edge.iap.platform.shaipower.com/waic/step-edge/
1
Claude Fable 5再次续杯,付费用户免加钱用到7月19日

Anthropic 再次延长 Claude Fable 5 的促销访问期。付费套餐用户可在 7 月 19 日前免额外付费使用这款模型,Claude Code 每周用量上限提高 50% 的活动也同步延长。

这已经是 Fable 5 第二次延期。最初截止日期为 7 月 7 日,随后延至 7 月 12 日,现在又增加一周。

用户最多可将每周总额度的 50% 用于 Fable 5。达到上限后,可以改用其他模型,也可以启用按量付费继续使用。API 调用不参加活动,仍按标准价格计费。

信源:https://x.com/claudeai/status/2076351399999557669?s=46
👍1
Codex用户冲到600万,OpenAI临时取消5小时用量上限

OpenAI 核心产品负责人 Tibo 称,Codex 与 ChatGPT Work 的活跃用户合计已达到 600 万。Codex 将临时取消 Plus、Business 和 Pro 套餐的 5 小时用量限制,并统一重置一次额度。

OpenAI 还在调整 GPT-5.6 Sol 的用量计算。新版会减少同类任务消耗的额度,但具体降幅尚未公布。对高频用户来说,这两项调整会直接延长连续使用时长。

Codex 用户增长仍在加速。Axios 6 月初报道,其周活跃用户刚超过 500 万,较 2 月桌面版发布时增长超过 6 倍。一个多月后,官方口径已升至 600 万。

信源:https://x.com/thsottiaux/status/2076365965915467978?s=46
🔥2
Grok Build被曝上传整个代码库,密钥和Git历史都可能被偷走

安全研究者对 Grok Build CLI 0.2.93 进行抓包。结果显示,这款 xAI 编程 Agent 会把当前 Git 仓库整体上传到云端。内容包括所有 Git 跟踪文件和完整提交历史,不限于 Agent 实际读取的代码。

研究者要求 Grok「不要读取任何文件」,仍从上传包中还原出未被打开的诱饵文件。相同结果在第二个仓库中复现。测试一个 12GB 仓库时,中止前已有 5.5GB 数据上传成功。

如果 Grok 读取 .env,其中的 API 密钥和数据库密码也会原样进入模型请求和会话存档。关闭「Improve the model」后,整仓上传仍会继续。

xAI 官方文档只说明提示词和文件内容会发往云端推理,没有说明会额外上传完整仓库。

信源:https://www.reddit.com/r/LocalLLaMA/comments/1ut7tis/grok_build_cli_uploads_your_whole_repo_full_git/
🤡61
腾讯Hy3免费版用量超小米、DeepSeek,登顶OpenRouter周榜

腾讯混元 7 月 6 日正式发布 Hy3,并在 OpenRouter 开启两周免费 API 调用。数据显示,Hy3 免费版已升至 OpenRouter LLM 周使用榜第一,单周处理 6.13 万亿 Token,高于小米 MiMo-V2.5 的 5.95 万亿和 DeepSeek V4 Flash 的 5.22 万亿。

OpenRouter 免费版将于 7 月 21 日结束,付费版价格为输入每百万 Token 0.14 美元、输出 0.58 美元。

信源:https://openrouter.ai/rankings#top-models
🔥2
GPT-5.6 Sol被质疑「降智」,OpenAI称推理预算调整只是排查实验

有用户发现,GPT-5.6 Sol 各档位的内部推理预算明显下降,最高档从 960 降至 128,因此怀疑 OpenAI 为节省算力削弱模型。

OpenAI Codex 负责人 Tibo Sottiaux 回应称,团队曾调整推理强度,用来排查订阅额度为何消耗过快。这项实验已经撤回,官方称并未长期削弱模型。

OpenAI 已确认,37.2 万上下文会导致额度扣除高于预期,因此暂时降回 27.2 万。high 和 xhigh 档的多 Agent 调用也比预期更多,目前正在修复。

此外,OpenAI 完成了推理优化,GPT-5.6 Sol 各档订阅可多获得约 10% 用量。

信源:https://x.com/thsottiaux/status/2076495156757577895
1
传被字节索赔800万的前实习生创业做世界模型,估值2亿美元

NeurIPS 2024 最佳论文一作田柯宇被曝进入世界模型创业。知情人士称,项目由五源资本合伙人孟醒孵化并投资,已融资数千万美元,估值约 2 亿美元。

工商信息显示,田柯宇今年已在北京成立多家 AI 公司。北京蓝炭网络科技有限公司由他持股 60%,业务涉及 AI 硬件、智能机器人和人工智能技术研发。另一家公司北京蓝之炭网络科技有限公司注册资本为 190 万美元。

田柯宇曾在字节跳动实习。字节指控他篡改代码、攻击团队模型训练任务,并于 2024 年起诉索赔 802 万元。案件已获法院受理,但尚未查到公开判决结果。

此后,田柯宇以第一作者身份凭借 VAR 图像生成框架获得 NeurIPS 2024 最佳论文。VAR 采用由粗到细的「下一尺度预测」,论文称其在图像质量、推理速度和数据效率等方面超过扩散 Transformer。

信源:https://mp.weixin.qq.com/s/_VolxhRVvsh7cZSqzdD_Ag
👎1🤣1
Claude Code发布后,美国开发岗位逆势涨15%

Indeed 招聘实验室发现,自 Claude Code 于 2025 年 2 月发布以来,美国软件开发岗位招聘量增长近 15%。同期,Indeed 全部岗位招聘量下降 7%。

增长主要集中在资深和 AI 岗位。2025 年 5 月至 2026 年 5 月,71% 的新增招聘来自高级职位,37% 来自名称中提到 AI 的岗位。

但这不能证明 Claude Code 直接带动了招聘。Indeed 强调,两者只是同期出现。软件开发岗位即使反弹,仍比 2020 年 2 月低 27.5%。

这轮增长更像是需求换了方向。企业正在增加能驾驭 AI 的资深开发者,初级岗位未必同步受益。

信源:https://www.hiringlab.org/2026/07/08/ai-and-job-postings-from-destruction-to-creation/
🥰1
GPT-5.6 Sol登顶单轮前端榜,领先GPT-5.5 18名

Design Arena 公布前端设计榜结果。GPT-5.6 Sol 以 1353 Elo 排名第一,略高于 GLM 5.2 的 1351 分。Claude Fable 5 以 1345 分位居第三。

这次登顶的是「非 Agent」榜。模型不能调用搜索、终端或文件编辑工具,也没有多轮修改机会。它需要读完提示词后,一次生成完整的单文件 HTML 网页。最终效果再由真实用户两两比较。

GPT-5.6 Sol 比 GPT-5.5 高出 60 Elo,排名领先 18 位。Design Arena 还称,它在同等表现的模型中速度最快。

信源:https://x.com/Designarena/status/2076391367446860249
👍1
动察Beating AI News
微软CEO纳德拉大谈AI人机协同转头疯狂裁员,被指说一套做一套 微软掌门人萨提亚·纳德拉在 X 上撰文,探讨企业在 AI 时代如何保持自主权。纳德拉认为,光靠购买通用大模型无法建立长期壁垒,反而会让公司受制于人。企业真正的应对之策是让人类经验与技术相结合,将员工的业务积淀与公司的 AI 能力结合起来,防范行业价值被少数模型巨头完全垄断。 在双重资本框架下,AI 并不会直接取代人类,相反,人的判断力、沟通能力和模式识别在技术普及后会变得更加重要。企业需要做的是在通用模型之上,用内部数据跑出私有的学习闭环…
纳德拉呼吁企业夺回AI学习权:别花钱帮模型厂商积累经验

微软 CEO 萨提亚·纳德拉再次发长文,呼吁企业把 AI 产生的学习成果留在自己手中。他将当前的风险称为「反向信息悖论」:企业不仅要花钱购买 AI,还可能交出最宝贵的内部经验。

模型越想做得准,企业就要提供越多业务信息。员工写下的提示词、调用过的工具、内部评测和纠错记录,都会沉淀为公司独有的知识。但在现有模式下,这些信息也可能反过来帮助模型厂商改进产品。

纳德拉批评,部分模型公司认为自己可以学习互联网上的公开内容,却限制客户利用模型输出训练自己的系统,同时还可能从客户的使用记录中继续学习。知识如果只向供应商一侧流动,企业投入的人力和经验,最后就可能变成模型巨头的资产。

他呼吁企业掌握自己的评测、记忆、运行轨迹和微调权重,并将 Agent 编排层与单一模型分开。即使模型厂商退出或涨价,企业积累的业务能力也不至于随之丢失。

一个月前,纳德拉已经提出「人力资本与 Token 资本」框架,警告企业不能把学习能力外包出去。

信源:https://x.com/satyanadella/status/2076323181154230284
🔥1
近3万元把孩子包装成CEO,AI研学营收割家长焦虑

今年暑期,AI 研学营成了家长圈的新热门。有人收费近 3 万元,让不到 10 岁的孩子挂上 CEO、CTO 胸牌,背着台词参加创业路演。还有机构宣称,孩子能在 6 天内创办一家 AI 公司。

这类课程抓住了家长最直接的恐惧:别人家的孩子已经在学 AI、做产品甚至谈融资,自己的孩子会不会被时代甩下。机构卖的也不只是课程,而是一张「孩子没有落后」的心理安慰券。

但《中国新闻周刊》调查发现,不少项目的「含 AI 量」并不高。所谓大厂和高校研学,可能只是参观、拍照和打卡。孩子答不上技术问题时,由指导老师代答。收费 1.5 万元的「大模型实战营」,最后可能只教用 AI 做 PPT 和文案。

师资同样参差不齐。部分授课老师只接受几天培训,专业背景与 AI 无关。一名从业者称,整个 AI 教育市场「90%以上都是糊弄」。

真正的 AI 教育需要长期训练、专业师资和完整课程。把孩子包装成「8 岁产品经理」「10 岁 CEO」,更像是在向家长展示成果,而不是让孩子真正掌握技术。家长花万元买到的,可能只是一场精心拍摄的儿童创业表演。

信源:https://mp.weixin.qq.com/s/4oLgvsTY30A8nXwanOwI9A
😁1
Prime Intellect重写Verifiers,Agent训练评测可像积木拼装

AI 训练平台 Prime Intellect 发布 verifiers 0.2.0,并在其中开放下一代 Verifiers v1 的架构预览。Verifiers 是给 AI Agent 出题、运行和打分的开源框架,可用于能力评测和强化学习训练。

Prime Intellect 还开源了模型训练框架 prime-rl。简单来说,Verifiers 负责定义任务、工具和评分规则,prime-rl 根据任务结果训练模型。开发者可以自行下载和部署这两套工具。

Prime Intellect 同时运营 Environments Hub 和 Lab。前者用于共享和下载现成的训练环境,后者提供托管训练服务。开发者可以自己部署整套工具,也可以直接使用 Prime Intellect 的环境和算力平台。

旧版 Verifiers 把任务和 Agent 的运行方式绑在一起。v1 将其拆成三块:Taskset 规定做什么、提供哪些工具、如何评分;Harness 决定 Agent 怎样完成任务;Runtime 决定任务在本地、Docker 还是远程沙箱中运行。

同一套任务因此可以换用 Codex、Kimi Code、Terminus 2 等 Agent,也可以在本地、Docker 或远程沙箱中执行。开发者不用每换一个 Agent 或执行环境,就重写任务和评分规则。

v1 还能记录子 Agent 调用、上下文压缩等分支过程,并保存训练所需的 Token ID 和对数概率。新版更适合持续数百轮的长任务,也能直接把 Agent 的运行轨迹用于强化学习。未来的 1.0.0 还计划加入多 Agent 环境,并完善对 OpenEnv、NeMo Gym 和 OpenReward 等环境框架的支持。

信源:https://www.primeintellect.ai/blog/verifiers-v1