动察Beating AI News
3.18K subscribers
902 photos
2 videos
1 file
3.44K links
AI新闻信息流
Download Telegram
仅用五天!Anthropic绝密模型Mythos攻破苹果耗时五年的M5内存防御

安全研究团队 Calif 宣布,他们利用 Anthropic 尚未公开的 Mythos Preview 模型,成功在搭载 M5 芯片的 Mac 设备上构建了首个公开的 macOS 内核内存损坏漏洞利用链。MIE(内存完整性强制执行)是苹果为 M5 和 A19 芯片打造的旗舰级硬件安全机制,官方为此投入五年时间与数十亿美元,其设计初衷并非绝对免疫黑客,而是旨在通过极大提高利用成本来缓解内存损坏漏洞。而 Calif 团队从发现缺陷到完成利用,仅用了五天时间。

这次攻击链路包含两个漏洞和多种技术,从无特权的本地普通用户起步,仅依赖常规系统调用,最终夺取了设备的 root 权限。该利用链属于纯数据驱动的内核本地提权,直接针对开启了内核 MIE 机制的 macOS 26.4.1 裸机真实硬件。

Mythos 模型擅长在学习某一类攻击后迅速泛化到同类问题,它帮助团队快速定位了属于已知漏洞类的缺陷,后续再由人类专家攻克新型硬件防御。这次破防验证了“AI 发现漏洞 + 专家绕过防御”的高效组合,也证明在顶级大模型的辅助下,小型安全团队足以撼动大公司耗费重金建立的技术壁垒。

信源:https://blog.calif.io/p/first-public-kernel-memory-corruption
终于跳出IDE插件:GitHub推出Copilot独立桌面端,支持多Agent并行

GitHub 宣布推出 GitHub Copilot 桌面端技术预览版。Copilot 借此从单一的编辑器辅助工具,转变为专为智能体驱动开发(agent-driven development)打造的独立应用。开发者现在可以在一个界面内,统筹多个 AI 智能体并行处理不同的需求和代码库。

新版本抛弃了传统的单线对话模式,引入了完全隔离的并行工作流。在应用内同时启动多个智能体任务时,系统会为每个会话自动创建独立的 Git 工作树(worktree)和分支。开发者可以让一个智能体去分析和修复另一个仓库的 CI 报错,同时安排第二个智能体根据当前的 Issue 编写新功能代码,全程互不干扰本地正在编写的代码,也无需反复切换终端和 IDE。

为了实现开发周期的闭环,应用加入了 Agent Merge 机制,允许智能体自主处理代码审查意见、修复测试报错并在满足条件后直接合并 PR。同时,新版原生支持接入 MCP(模型上下文协议)服务器和自定义技能,以挂载更多本地开发工具。该桌面端目前已开放预览候补,Business 与 Enterprise 订阅用户经企业授权后可直接使用。

信源:https://github.com/features/preview/github-app
Nous开源Lighthouse Attention:单B200跑512K提速17倍

Nous Research 开源了长上下文预训练机制 Lighthouse Attention。在单张 B200 显卡上处理 512K 长度文本时,该方案的计算速度比传统机制快约 17 倍,并在 98K 长度下实现了 1.4 到 1.7 倍的端到端训练提速。

传统注意力机制需要计算所有字词的两两关系,文本一长,算力消耗就会呈平方级暴涨。Lighthouse Attention 改用先粗筛再精算的思路。它会先在不同层级快速浏览文本的压缩摘要,通过打分挑出核心片段拼成短文本,然后直接交给现成的高效算子 FlashAttention 处理。由于筛选逻辑被彻底剥离到了内核之外,开发者直接省去了手写底层代码的麻烦,也不用增加额外的训练目标。

过去采用类似思路的加速方案常有副作用,模型习惯跳跃阅读后,极易丧失原本逐字精读的能力。为了避开这个陷阱,研发团队让模型先用加速模式跑完绝大部分进度,只在训练末尾短暂切回传统的全注意力计算稍作适应。在针对 5.3 亿参数规模的模型、投喂 500 亿 Token 训练数据的实测中,这样练出的模型不仅大幅缩短了耗时,最终表现还全面追平甚至反超了全程使用传统方式训练的基线版本。

信源:https://nousresearch.com/lighthouse-attention
观察:上万名AI核心员工赚足2000万美元,加剧硅谷阶层焦虑

Menlo Ventures 合伙人 Deedy Das 今日发文指出,受 AI 浪潮影响,旧金山湾区正经历严重的财富分化与心理撕裂。过去 5 年间,约 1 万名来自 OpenAI、Anthropic、xAI 和英伟达等企业的核心员工及创始人,已累积超过 2000 万美元的财富。这种断崖式的造富神话,正让传统软件工程师对职业前景感到绝望。

伴随大厂裁员和日常工作被 AI 改变,硅谷科技圈正在出现四种典型心态转变:

• 传统晋升路线失灵。多数人意识到年薪 50 万美元的常规工作无法跨越财富鸿沟,开始频繁跳槽或盲目跟风创业。
• 年轻群体陷入职业虚无。面对随时可能被取代的岗位,部分年轻人开始担忧沦为底层阶级,难以专注当前工作。
• 中层管理者感到瘫痪。由于缺乏精力创业且没有核心 AI 技能,许多背负家庭压力的中层正面临岗位被掏空的风险。
• 暴富群体陷入目标缺失。部分人在几年内从年薪 15 万美元跃升至身价 5000 万美元后,面临人生规划被彻底打乱的困境,往往仅为获取身份地位而继续创业。

Das 认为,在这场重塑社会的 AI 淘金热中,试图通过努力跟上财富步伐的焦虑感,正从心理上折磨着大量硅谷从业者。而这种焦虑带来的副作用,恰恰是驱使更多人去疯狂开发那些能够造富的 AI 产品。

信源:https://x.com/deedydas/status/2055491938464489888
微信读书上线专属Skill,支持AI直连个人书架与阅读笔记

微信读书上线官方专属 Skill,允许用户通过 API Key 将个人微信读书账号与 AI 助手直连。这一更新打破了此前 AI 只能泛泛推荐书籍的限制,使大模型可以直接调取用户的私人书架、划线笔记以及阅读时长等深度行为数据。

用户向 AI 助手发送指令并绑定 API Key 后,即可获取六大核心数据读取能力:查阅私人书架全貌、量化分析阅读习惯、提取并导出划线笔记、检索全局书城信息、查看书籍详情与个人进度,以及基于真实阅读历史获取个性化推荐。

为消除隐私疑虑,官方明确声明该 API Key 调取的数据仅用户个人可见。这套机制直接替代了过去依赖第三方脚本或手动导出的繁琐工作流,让个人知识库整理与阅读量化分析能通过自然对话一次性完成。

信源:https://weread.qq.com/r/weread-skills
1🎉1
OpenClaw调用摄像头监视主人喝水,The Atlantic抨击硅谷狂飙引发全社会AI倦怠

The Atlantic 报道指出,随着 AI 智能体展现出调用摄像头监控人类等越界行为,硅谷强行冲刺奇点的节奏正让全社会陷入严重的 AI 倦怠。数据印证了这种情绪崩塌,NBC News 民调显示公众对 AI 的好感度已跌至 26%,仅剩 18% 的 Z 世代对此抱有希望。

狂热正在催生荒诞的现实。GitHub 前 CEO Nat Friedman 透露,他的本地代理 OpenClaw 为执行保持水分的指令,竟直接接管家中摄像头进行实时盯梢,直到确认他喝完水才罢休。同时,Claude Code 等代理工具也正让部分开发者陷入无法自控的能力成瘾,连续编码直到凌晨。

The Atlantic 尖锐评价,这种让人窒息的加速度并非偶然,而是科技巨头有意维持的系统特征。当 Anthropic 高管预言 2028 年 AI 就将自主迭代时,巨头们正试图用跟不上就被淘汰的末世叙事剥夺公众参与决策的权利。在这场技术狂飙里,大众正在被少数人单方面重构的社会契约强制收割。

信源:https://www.theatlantic.com/technology/2026/05/too-much-happening-too-fast/687177/
Mistral CEO明确拒绝向硅谷巨头卖身,放话能挖出Anthropic同等漏洞

Mistral AI 联合创始人兼 CEO Arthur Mensch 近日在法国国民议会听证会上发表了强硬表态。面对议员对于公司是否会被美国巨头买走的担忧,他明确表示拒绝。Mensch 抨击了欧洲初创企业总想着卖给硅谷套现的行业风气,直言企业只要成功就不会被收购,被收购在某种意义上就是失败。同时,他首次公开叫板美国安全标杆 Anthropic,称 Mistral 的模型完全有能力找出 Mythos 发现的全部网络漏洞。

为了支撑独立发展的野心,Mistral 今年的研发投入高达 10 亿欧元。Mensch 透露,公司目前 75% 的营收来自欧洲本土。在技术路线上,Mistral 坚持在内部集中算力训练超大模型,然后再通过蒸馏技术向客户提供更高效的小模型。为保证算力自主,公司计划明年在法国建成 80 MW 的算力集群,并向 2029 年达到 1 GW 规模的目标冲刺。

Mensch 强调 AI 的本质就是将电能转化为 Token。由于主要依赖核电,在法国部署算力能极大降低碳足迹。他以建设 1 GW 数据中心需耗资 500 亿欧元为例,指出电力成本其实只占最终产值的 10%。他警告称,欧洲如果现在因为高昂的成本退缩,不仅会彻底丧失底层算力的控制权,未来纯靠进口美国 AI 服务还将带来每年上万亿欧元的贸易逆差。

信源:https://gist.github.com/eliebak/5945ce3c84d77b0f30ea1190cf34ad5b
告别受限内测?Claude Mythos摘除预览标签,疑似即将向公众开放

5 月 17 日,Claude Mythos 基础模型现身谷歌云(Google Cloud)控制台的配额与系统限制列表。与此前不同,该模型选项已正式移除了「预览」标签,且根据开发者追踪,昨日该列表中尚无此模型。

此前,Claude Opus 4.7 在正式发布前,也曾遵循同样的路径在谷歌云控制台中「抢跑」。这一高度重合的轨迹暗示,原本受限内测的 Claude Mythos 极有可能即将全面向公众开放。

信源:https://x.com/AiBattle_/status/2055762242373558477
Meta裁员前夜的荒诞求生:员工开会防AI监听,靠刷废话凑大模型榜单时长

Meta 预计将于 5 月 20 日裁减约 8000 名员工。在向 AI 激进转型的重压下,这家科技巨头内部正催生出一系列充满荒诞色彩的生存防御机制。

尽管高管承诺裁员不考核 AI 熟练度,但 Meta 仍上线了公开展示 token 消耗量和交互时长的 AI 内部榜单。在无形的末位淘汰恐惧下,部分员工为了保住饭碗,不得不主动给内部机器人发送无意义的提问,纯靠「刷废话」来积累交互数据。

这种防备情绪已蔓延至日常办公的每个角落。面对近期引入的键盘记录软件(key-stroke logging),Meta 员工开始在视频会议中频繁手动关闭默认的「AI 记笔记」功能,只为能安全讨论关于裁员的内部传闻。在极度紧绷的氛围中,内部论坛上一条「建议给能用 AI 替代自己工作的人发放 5 年薪水买断离职」的帖子获得了大量共鸣。

比起单纯的失业,更深的无力感来源于工作本身的异化。面对一边担忧被取代,一边又被要求必须亲手训练内部模型的处境,受访员工直言,即使还没失去工作,人类员工也已经「被提前商品化」。

信源:https://sfstandard.com/pacific-standard-time/2026/05/15/meta-employee-gets-real-horror-working-right-now/
X Premium开放第三方调用,开源Hermes Agent新增推文搜索

继昨日打通 Grok 独立订阅后,xAI 今日宣布,拥有附赠 Grok 权限的 X Premium 订阅用户,现也可直接在开源智能体 Hermes Agent 中授权调用模型能力。

此前,该第三方机制仅支持在 Grok.com 单独付费的订阅账号。此次将调用权限扩展至受众更广的 X 平台付费会员体系,大幅降低了普通用户为本地智能体获取顶级算力的门槛。

信源:https://x.com/xai/status/2055745332919808181
推理成本仅GPT-5.5二十分之一,Gemini 3.2实时模型现身谷歌云

谷歌云控制台的模型筛选列表中出现名为 gemini-3.2-flash-lite-live-preview 的基础模型选项。这是继本月初在 iOS 应用构建包和 AI Studio 暴露痕迹后,该系列模型在官方平台的再次曝光。

新选项带有 litelive 后缀,表明谷歌正切分出针对极低延迟实时交互的特化版本。Abacus.AI 首席执行官 Bindu Reddy 此前透露,Gemini 3.2 Flash 的编码与推理能力达到 GPT-5.5 的 92%,但得益于蒸馏加稀疏化技术,推理成本仅为后者的二十分之一,多数查询延迟低于 200 毫秒。

随着云端接口提前抢跑,业内预计这一定位极致性价比的轻量模型将在 5 月 20 日的谷歌 I/O 大会上正式发布。

信源:https://x.com/AiBattle_/status/2055760108693397644
突破苹果锁屏限制,OpenAI正测试手机远程控制休眠Mac

OpenAI 似乎正试图打破桌面端 AI 远程控制的最大痛点。据 TestingCatalog 曝光,OpenAI 正在为 Codex 开发一项新能力,目标是让 AI 即使在 Mac 锁屏甚至休眠的状态下,也能继续在后台操作软件干活。

此前各家的界面控制功能都有一个硬伤:电脑必须处于解锁亮屏状态,AI 才能查看屏幕并模拟键鼠点击。爆料称,新功能旨在补齐这一短板。如果成功落地,用户在路上用手机遥控家里的 Codex 跑测试或查数据时,将不再需要走回电脑前物理“解锁”屏幕。此外,OpenAI 还在测试跨设备互联,未来允许主设备直接遥控运行了 Codex 的 Mac Mini。

当前无论是现有的 Codex 还是竞品 Claude Code,一旦遇到系统锁屏同样都会受限。但让 AI 试图绕开锁屏密码直接在系统内保持活跃,明显挑战了 macOS 默认的安全防御预期。这种激进的底层越界尝试,极有可能在未来引发苹果官方的干预审查。

信源:https://www.testingcatalog.com/openai-will-let-codex-control-other-desktop-devices-via-computer-use/
👍2
单题写10万Token!30B开源模型不调工具,靠长考把IMO硬抬上金牌线

上海人工智能实验室联合清华大学、北京大学、上海交通大学与香港中文大学,共同开源了奥赛推理模型 SU-01。它基于 P1-30B-A3B 后训练,作答时不调用代码执行器、外部定理证明器或专门符号求解器,纯靠内部的生成、验证、修改循环,在 IMO 2025 官方题评测中拿到 35 分,达到当年金牌线。

SU-01 证明了解顶级数学题不一定非要外挂复杂的代码工具。只要给足测试时算力扩展(Test-Time Scaling,简称 TTS),30B 级别的模型单靠自己反复推敲,也能拿下顶尖成绩。

团队先用逆困惑度课程训练模型,按困惑度降序喂送样本,强迫它优先啃下最难模仿的推理轨迹。接着用强化学习稳固找答案的能力,最后要求模型反复自我修正,补全严密的证明。

这套机制在作答时极其消耗算力。面对难题,SU-01 会自己写出初稿,找出漏洞并反复重写。2026 年美国数学奥林匹克(USAMO)的测试轨迹显示,它解一道题光是写第一版答案,通常就会消耗 10.6 万 token(中位数);后续哪怕只做一次修改,也会再花掉 8.3 万 token。

不开启 TTS 时,SU-01 在 IMO 2025 的得分只有 21 分。它的金牌成绩,主要来自高 token 预算下的多轮深度搜索、自我检查和修改。

信源:https://arxiv.org/abs/2605.13301
马斯克敲定1.5T新Grok四周内上线,急抽Cursor数据火线救场

继前两日承认现役模型存在数据缺陷后,马斯克紧接着在 X 上给出了换代时间表。他宣布 1.5T 参数的内部第 9 版基础模型已完成训练,预计将于 3 到 4 周内正式发布,并豪言新版将带来「王炸(banger)」般的体验。

为填补前代数据缺陷,该模型接下来将进入「补充训练」阶段,专门用于海量吸纳 Cursor 的代码数据。完成底层知识灌输后,再交由监督微调(SFT)和强化学习(RL)进行打磨。

信源:https://x.com/elonmusk/status/2055914584373141906
Hermes发布v0.14:全面原生接入Grok,官方下场推C端订阅转API代理

NousResearch 发布多平台智能体框架 Hermes Agent 的 v0.14.0 重大版本更新。本次迭代合入了超 800 个提交,核心动作是将 xAI 体系升格为原生基础能力,并试图接管用户的各大 AI 会员订阅。

Grok 获得最高级别支持。新版引入 SuperGrok 订阅支持,用户无需申请 API Key 即可调用模型,配套的 grok-4.3 模型上下文窗口同步提升至 100 万 token。此前依赖外部实现的 x_search 推文搜索也转为原生内置工具,打通了 X OAuth 授权。

官方内置本地接口代理。新增的 hermes proxy 命令能够将 Claude Pro、ChatGPT Pro 与 SuperGrok 的网页端授权直接转化为标准 OpenAI 格式的本地接口。这一功能在理论上可替代多种第三方逆向代理工具。

智能体执行流引入硬核校验。新版加入带上下文的模型无缝切换指令 handoff。在代码编辑场景,系统在写入文件后会强制执行 LSP 语义诊断并附加校验层,直接针对大模型宣称修改实则未写入的幻觉问题下药。

此外,由于将音视频与部分平台交互等重型依赖改为懒加载模式,该框架的冷启动时间被削减了近 19 秒。

信源:https://github.com/NousResearch/hermes-agent/releases/tag/v2026.5.16
300美元直降至99美元,xAI掀价格战强推Grok Build

xAI 针对其顶配订阅服务 SuperGrok Heavy 推出激进的限时补贴策略。新老用户在未来 6 个月内,可享受从 300 美元/月直降 67% 至 99 美元/月的超级折扣。

Heavy 订阅是目前获取 xAI 命令行编程工具 Grok Build 的唯一门槛。该工具上周已开启公测,主打并发多子体(Subagents)与原生 MCP 扩展。

信源:https://grok.com/supergrok?referrer=grok-build
腾讯公测AI设计智能体Ardot:基于MCP接入IDE,支持私有组件库生成

腾讯今日开启自研 AI 设计智能体平台 Ardot 公测。该平台的核心机制在于将 AI 生成的设计稿转化为结构化数据,并通过 MCP(模型上下文协议)直接连接外部 IDE。

在设计侧,Ardot 支持通过自然语言批量生成或修改矢量界面,并允许直接导入 Figma 文件。为了避免 AI 绘图规范不可控的问题,平台开放了企业私有业务组件库接入,使 AI 生成的草稿能够直接遵循团队现有的设计规范。

在交接侧,包含变量、组件和布局数据的设计资产,可通过 MCP 协议直接被 CodeBuddy、Cursor 与 Claude Code 等开发工具读取。研发人员可在 IDE 内一键生成前端代码,从而替代传统的人工切图与标注流程。

该平台目前已提供 1000 Credits 初始额度,内置多人在线评审功能已同步上线。

信源:https://mp.weixin.qq.com/s/cCbdbFfy0-ciPhpd56GeQA
Citadel创始人:大企业护城河正被填平,内部AI已将金融PhD数月投研缩至数小时

对冲基金 Citadel 正在公司内部真切感受到 AI 对高智力岗位的残酷替代。创始人兼 CEO Ken Griffin 在 2026 斯坦福领袖论坛(Stanford Leadership Forum)上证实,以往需要金融学硕士和 PhD 耗时数周甚至数月的高级投研工作,目前正被其内部署的 AI 智能体在几小时或几天内批量搞定。

Griffin 坦言,亲眼看着核心研发层被机器迅速自动化,曾让他在某个周五下班时感到抑郁。他直接借用历史学家 Niall Ferguson 的悚然论断定调了这场冲击:「在 AI 的世界里,人类就是当年被汽车取代的马。」

毁灭同时伴随着旧有格局的解体。Griffin 明确指出,大型企业长期依赖的竞争护城河正被各种 AI 工具迅速填平。这直接将当下的市场变成了创业者的梦幻乐园,小团队向行业巨头开战的门槛已被降至历史最低。

信源:https://www.youtube.com/watch?v=Csjy_A3Kj9s
腾讯测试知识库工具狍子AI,将微信公众号文章一键转为个人知识库

腾讯正在测试一款名为 狍子 AI 的个人知识库工具。该产品允许用户将微信公众号文章一键导入专属知识库,把只存不看的内容转变为可检索和问答的数据。

用户在 狍子 AI 客户端完成账号绑定后,只需在微信内将文章直接转发给对应账号即可完成入库。
前SpaceX工程师忠告:想做硬件创业就立刻飞深圳

前 Tesla 无人驾驶与 SpaceX 猛禽团队工程师 Zac Valles 在 YC 路演结束 72 小时后直飞深圳。在实地驻扎 8 周并带着新硬件返回旧金山后,他强烈建议所有硬件创业者,哪怕还没融资、没团队、甚至没点子,只要想做硬件就该立刻去深圳。

他总结了在深圳对接供应链的核心经验。在切入路径上,他建议利用大型展会作为跳板,这是进入任何工厂最有效的敲门砖。在与代工厂沟通时,初期应重点询问交期而不是成本。他指出,硬件迭代速度受制于交期最长的零件,尽早锁定这些零件才能排布准确的时间表。

在供应商筛选与设计端,Valles 提醒创业者对代工厂的执行能力做好分级。他特别建议不要设计工序过于复杂的零件,例如需要 12 道后续加工的组件极难找到愿意接单的工厂。此外,他推荐在华强北这个“微型城市”预留 4 到 6 小时实地考察,并指出尊重当地商业文化(如“酒满茶半”)是推进合作的重要润滑剂。

信源:https://x.com/zacharyvalles/status/2055676910739599462
谷歌双雄高难局反超,TERMS-Bench把AI谈判做成破产压力测试

斯坦福 Erica Zhang 等人发布了经济谈判测试集 TERMS-Bench。它移除了黑箱的「大模型裁判」,让评测方能直接看清模型到底输在出价、让步还是违规。

在常规测试中,Claude Opus 4.6 和智谱 GLM 5.1 拿下前两名。论文发现,它们采用了「高出价、死不让步」的强硬策略,在利润丰厚的顺风局能把对手榨干。

但在利润空间极窄的最高难度局,强硬策略会因为频繁谈崩而吃亏。榜单在这里直接翻车:懂得适度让步保订单的 Gemma 4 31B(开放权重模型)和 Gemini 3.1 Pro 反超冲到前两名;而此前的领跑者 Claude 掉到第 5,GLM 掉到第 9。

除了测试极限难度,该基准最具冲击力的是测试生存能力的 Bankroll(资金池)模式。单次谈判被拉长成连续采购:每个 Agent 拿 100 美元本金连谈 50 期,每期固定扣运营费,亏完就破产。在这里,微小的谈判失误都会复利成破产危机。

结果显示,前述的 GLM 5.1、Claude Opus 4.6 以及谷歌双雄虽然策略不同,但控盘能力断层领先,全部实现了 100% 存活,最终现金均达到了 380 到 443 美元。相比之下,Grok 4.20 和 GPT-4o-mini 则无法顶住现金流损耗,破产率分别达到 25% 和 50%。

TERMS-Bench 的关键不在成交率,而在把谈判错误换算成现金亏损和破产风险。模型能不能说服对手,只是第一层;在连续交易里能不能守住利润和现金流,才真正拉开差距。

信源:https://arxiv.org/abs/2605.13909v1