Grok订阅账号打通第三方生态,全模态能力接入开源Hermes Agent
xAI 宣布 Grok 订阅用户现可直接在第三方应用中登录账号并调用模型能力,首个落地项目为 Nous Research 开发的开源智能体 Hermes Agent。用户凭借现有的个人订阅,即可在该应用中直接使用 Grok 4.3 进行文本对话与推理,或调用语音合成及 Grok Imagine 的视频与图像生成能力。
Hermes Agent 是一款支持在任意电脑、沙盒或云主机上持久化运行的智能体系统。其核心特性为跨会话长期记忆,并支持桥接 WhatsApp、Discord 等通讯平台。新版本通过 OAuth 授权机制跑通了 Grok 账号体系,各档位订阅用户在终端选择「xAI Grok OAuth」并完成网页授权后,即可将 Grok 设为智能体的底层模型。
主流大模型的个人订阅服务通常与官方客户端强制绑定。xAI 此次开放个人账号的第三方授权,不仅绕过了传统 API 的按量计费门槛,也为开源智能体提供了稳定的模型算力通道。官方确认近期将推出更多第三方集成方案。
信源:https://x.ai/news/grok-hermes
xAI 宣布 Grok 订阅用户现可直接在第三方应用中登录账号并调用模型能力,首个落地项目为 Nous Research 开发的开源智能体 Hermes Agent。用户凭借现有的个人订阅,即可在该应用中直接使用 Grok 4.3 进行文本对话与推理,或调用语音合成及 Grok Imagine 的视频与图像生成能力。
Hermes Agent 是一款支持在任意电脑、沙盒或云主机上持久化运行的智能体系统。其核心特性为跨会话长期记忆,并支持桥接 WhatsApp、Discord 等通讯平台。新版本通过 OAuth 授权机制跑通了 Grok 账号体系,各档位订阅用户在终端选择「xAI Grok OAuth」并完成网页授权后,即可将 Grok 设为智能体的底层模型。
主流大模型的个人订阅服务通常与官方客户端强制绑定。xAI 此次开放个人账号的第三方授权,不仅绕过了传统 API 的按量计费门槛,也为开源智能体提供了稳定的模型算力通道。官方确认近期将推出更多第三方集成方案。
信源:https://x.ai/news/grok-hermes
x.ai
Connect Grok to Hermes Agent
Use your Grok account and subscription inside Nous Research’s open-source, self-improving Hermes agent.
生成不必死守从左到右,字节开源2B级扩散语言模型 Cola DLM
字节跳动 Seed 团队开源 Cola DLM。这是一套连续潜在扩散语言模型,试图绕开大语言模型按 token 从左到右逐个生成的固定路径,把文本生成改成先组织高层语义、再落回具体文字。
Cola DLM 的核心是 Text VAE + block-causal DiT。Text VAE 先把离散文本映射到连续潜在空间,block-causal DiT 再通过 Flow Matching 学习潜在先验,最后由条件解码器把潜在变量还原成文本。扩散过程处理的是潜在语义表示,不是直接在 token 层面反复去噪。
本次开源版本属于 2B 级模型,具体为约 23 亿总参数,其中核心 DiT 为 18 亿参数,另含 5 亿参数 VAE。在 LAMBADA、MMLU、OBQA、HellaSwag、RACE、SIQA、SQuAD、Story Cloze 等 8 项评测中,论文称其在统一生成式评测协议下已具备与同规模 AR / LLaDA 基线竞争的 scaling 表现,并在最终平均分上达到最好结果。
不过目前仍是研究型 checkpoint,不是直接可用的对话模型。官方说明该模型没有经过指令微调和 RLHF,主要用途是研究连续潜在扩散如何用于文本生成。论文还展示了向文本图像统一建模扩展的初步实验,但本次开源仓库只包含文本管线。
信源:https://huggingface.co/ByteDance-Seed/Cola-DLM
字节跳动 Seed 团队开源 Cola DLM。这是一套连续潜在扩散语言模型,试图绕开大语言模型按 token 从左到右逐个生成的固定路径,把文本生成改成先组织高层语义、再落回具体文字。
Cola DLM 的核心是 Text VAE + block-causal DiT。Text VAE 先把离散文本映射到连续潜在空间,block-causal DiT 再通过 Flow Matching 学习潜在先验,最后由条件解码器把潜在变量还原成文本。扩散过程处理的是潜在语义表示,不是直接在 token 层面反复去噪。
本次开源版本属于 2B 级模型,具体为约 23 亿总参数,其中核心 DiT 为 18 亿参数,另含 5 亿参数 VAE。在 LAMBADA、MMLU、OBQA、HellaSwag、RACE、SIQA、SQuAD、Story Cloze 等 8 项评测中,论文称其在统一生成式评测协议下已具备与同规模 AR / LLaDA 基线竞争的 scaling 表现,并在最终平均分上达到最好结果。
不过目前仍是研究型 checkpoint,不是直接可用的对话模型。官方说明该模型没有经过指令微调和 RLHF,主要用途是研究连续潜在扩散如何用于文本生成。论文还展示了向文本图像统一建模扩展的初步实验,但本次开源仓库只包含文本管线。
信源:https://huggingface.co/ByteDance-Seed/Cola-DLM
Epoch AI发布Claude偏科图谱:写代码长板一直在,Opus 4.6和4.7已补齐数学短板
Epoch AI 发布领域特定能力指数(Domain-specific ECI)最新分析,揭示了 Anthropic 旗下 Claude 系列模型相对其综合能力一直表现为写代码强、数学弱。不过最新数据显示,这一偏科现象正在快速缓解。
根据测算,在过往多代模型中,Claude 在软件工程基准测试(SWE-ECI)上的表现一直稳定高于其综合得分,而在数学基准测试(Math-ECI)上长期存在落差。最新发布的 Opus 4.6 和 4.7 模型已将数学与综合得分的差距缩小至 1 分以内,补齐了此前的短板。
ECI 的测算机制是比较各大模型之间的相对表现,因此它直接反映特定任务对 AI 的平均难度,而非对人类的难度。
信源:https://epoch.ai/data-insights/claude-ds-eci
Epoch AI 发布领域特定能力指数(Domain-specific ECI)最新分析,揭示了 Anthropic 旗下 Claude 系列模型相对其综合能力一直表现为写代码强、数学弱。不过最新数据显示,这一偏科现象正在快速缓解。
根据测算,在过往多代模型中,Claude 在软件工程基准测试(SWE-ECI)上的表现一直稳定高于其综合得分,而在数学基准测试(Math-ECI)上长期存在落差。最新发布的 Opus 4.6 和 4.7 模型已将数学与综合得分的差距缩小至 1 分以内,补齐了此前的短板。
ECI 的测算机制是比较各大模型之间的相对表现,因此它直接反映特定任务对 AI 的平均难度,而非对人类的难度。
信源:https://epoch.ai/data-insights/claude-ds-eci
终结11年妥协:Chrome149下周原生支持shape(),一行CSS实现任意曲线文字环绕
AI 浏览器初创公司 ego 宣布,其开发者 CGQAQ 为 Chromium 贡献的 shape() 函数已正式并入主分支。Chrome 149 下周将向全球推送该功能。开发者仅需一行 CSS 代码,就能让文本紧贴任意贝塞尔曲线进行环绕排版,彻底替代原有的 JS 布局方案。
自 2014 年写入规范以来,控制内容环绕的 CSS 属性 shape-outside 在过去 11 年里仅支持圆形、椭圆等 5 种基础形状。过去开发者如果想让文字顺着平滑的贝塞尔曲线排版,只能手算 40 多个多边形顶点来做粗糙模拟,或者在用户态引入 pretext 这类第三方 JS 文本引擎。
这次更新让浏览器渲染层直接接管了曲线排版,从根本上消除了 JS 外挂方案带来的性能开销。为推动跨端兼容,ego 团队已提交 Interop 2026 提案,呼吁 Safari 和 Firefox 尽快跟进。
信源:https://github.com/web-platform-tests/interop/issues/1284
AI 浏览器初创公司 ego 宣布,其开发者 CGQAQ 为 Chromium 贡献的 shape() 函数已正式并入主分支。Chrome 149 下周将向全球推送该功能。开发者仅需一行 CSS 代码,就能让文本紧贴任意贝塞尔曲线进行环绕排版,彻底替代原有的 JS 布局方案。
自 2014 年写入规范以来,控制内容环绕的 CSS 属性 shape-outside 在过去 11 年里仅支持圆形、椭圆等 5 种基础形状。过去开发者如果想让文字顺着平滑的贝塞尔曲线排版,只能手算 40 多个多边形顶点来做粗糙模拟,或者在用户态引入 pretext 这类第三方 JS 文本引擎。
这次更新让浏览器渲染层直接接管了曲线排版,从根本上消除了 JS 外挂方案带来的性能开销。为推动跨端兼容,ego 团队已提交 Interop 2026 提案,呼吁 Safari 和 Firefox 尽快跟进。
信源:https://github.com/web-platform-tests/interop/issues/1284
GitHub
[css-shape-1] Support path/shape basic-shape-function inside `shape-outside` property · Issue #1284 · web-platform-tests/interop
Put it into interop 2026 Test List https://wpt.fyi/results/css/css-shapes/parsing/shape-outside-computed.html https://wpt.fyi/results/css/css-shapes/shape-outside/supported-shapes/shape/shape-outsi...
GPT-5.5在Codex中能力下降原因查明,OpenAI完成修复并重置用量限制
OpenAI Codex 负责人 Tibo 今日确认,团队已定位并修复了两个隐患,它们正是导致过去两天终端编程智能体 Codex 中 GPT-5.5 表现变差的原因。目前系统已全面恢复。为补偿开发者,OpenAI 已经重置所有用户的用量限制。
过去 48 小时内,部分用户持续反馈 Codex 中的 GPT-5.5 出现能力退化现象。在揪出这两个具体问题前,官方排查初期一度没有得出确凿结论。今天下午,最新监控指标显示各项服务均已重新企稳。
信源:https://x.com/thsottiaux/status/2055540700092211404
OpenAI Codex 负责人 Tibo 今日确认,团队已定位并修复了两个隐患,它们正是导致过去两天终端编程智能体 Codex 中 GPT-5.5 表现变差的原因。目前系统已全面恢复。为补偿开发者,OpenAI 已经重置所有用户的用量限制。
过去 48 小时内,部分用户持续反馈 Codex 中的 GPT-5.5 出现能力退化现象。在揪出这两个具体问题前,官方排查初期一度没有得出确凿结论。今天下午,最新监控指标显示各项服务均已重新企稳。
信源:https://x.com/thsottiaux/status/2055540700092211404
X (formerly Twitter)
Tibo (@thsottiaux) on X
Confirmed stable and recovered
马斯克自揭老底:现役Grok数据缺陷严重,1.5T内部新版实现全面碾压
马斯克在 X 上罕见地公开承认当前对外开放的 Grok 4.2 存在严重不足,同时披露了 Grok 内外版本号的对应关系:Grok 4.2 基于内部第 8 版基础模型,仅 0.5T 参数,在 Hopper 架构 GPU 上训练,训练数据的质量、全面性和比例都有重大缺陷。
内部第 9 版基础模型已完成训练,参数扩至 1.5T,针对 Blackwell 架构 GPU 做了专项优化,在数据处理、训练配方和模型规模上全面升级。马斯克说第 8 版和第 9 版完全不是一个级别。他还透露 Cursor 的数据将在后续补充训练中加入,这是 SpaceX 拿下 Cursor 后首次提及数据层面的整合。
就在同一周,The Information 报道 SpaceXAI 预训练团队在负责人离职后仅剩数人,超过 50 名核心研发已在收购后离开。此前马斯克承诺每两周发一版新基础模型,原定 5 月初交付的 1T 参数 Grok 4.4 至今未露面,而这次公布的 1.5T 版本与此前路线图中的 Grok 4.5 参数规格一致,4.4 是否已被跳过尚不清楚。
信源:https://x.com/elonmusk/status/2055298325994164377
马斯克在 X 上罕见地公开承认当前对外开放的 Grok 4.2 存在严重不足,同时披露了 Grok 内外版本号的对应关系:Grok 4.2 基于内部第 8 版基础模型,仅 0.5T 参数,在 Hopper 架构 GPU 上训练,训练数据的质量、全面性和比例都有重大缺陷。
内部第 9 版基础模型已完成训练,参数扩至 1.5T,针对 Blackwell 架构 GPU 做了专项优化,在数据处理、训练配方和模型规模上全面升级。马斯克说第 8 版和第 9 版完全不是一个级别。他还透露 Cursor 的数据将在后续补充训练中加入,这是 SpaceX 拿下 Cursor 后首次提及数据层面的整合。
就在同一周,The Information 报道 SpaceXAI 预训练团队在负责人离职后仅剩数人,超过 50 名核心研发已在收购后离开。此前马斯克承诺每两周发一版新基础模型,原定 5 月初交付的 1T 参数 Grok 4.4 至今未露面,而这次公布的 1.5T 版本与此前路线图中的 Grok 4.5 参数规格一致,4.4 是否已被跳过尚不清楚。
信源:https://x.com/elonmusk/status/2055298325994164377
Zed内置Agent打通ChatGPT订阅:逆势免除按量计费,发文点名Claude与Copilot
代码编辑器 Zed 宣布,其内置 AI Agent 现已原生接入 ChatGPT 账号。用户登录后,即可通过个人的 ChatGPT 订阅额度直接调用 OpenAI 模型及 Codex 能力,免去 API 按量计费的开销。
此前,开发者若想在编辑器中调用 Codex,需借助官方早前开源的 ACP 适配器进行外挂配置。此次更新抹平了 Zed 内部的中间环节,将授权流程做成了原生的一键登录。习惯用 JetBrains 等其他环境的开发者,则可继续使用该 ACP 适配器实现相同的免 API 调用。企业团队的 API 密钥直连选项同样被保留。
主流代码智能体正集体转向按量计费。Zed 在公告中直接点名两家竞品:Anthropic 宣布自 6 月 15 日起,Agent SDK(即 Claude Code 底层)的额度将与 Claude 订阅剥离并单独计费;GitHub Copilot 也将于 6 月 1 日全面转向按量计费。Zed 借此致谢 OpenAI 能够反其道而行。
结合今日 xAI 允许 Grok 订阅接入开源智能体 Hermes 的举措,底层大模型厂商正试图通过向第三方应用下放 C 端订阅算力,来争夺被高昂 API 账单劝退的开发者。
信源:https://zed.dev/blog/chatgpt-subscription-in-zed
代码编辑器 Zed 宣布,其内置 AI Agent 现已原生接入 ChatGPT 账号。用户登录后,即可通过个人的 ChatGPT 订阅额度直接调用 OpenAI 模型及 Codex 能力,免去 API 按量计费的开销。
此前,开发者若想在编辑器中调用 Codex,需借助官方早前开源的 ACP 适配器进行外挂配置。此次更新抹平了 Zed 内部的中间环节,将授权流程做成了原生的一键登录。习惯用 JetBrains 等其他环境的开发者,则可继续使用该 ACP 适配器实现相同的免 API 调用。企业团队的 API 密钥直连选项同样被保留。
主流代码智能体正集体转向按量计费。Zed 在公告中直接点名两家竞品:Anthropic 宣布自 6 月 15 日起,Agent SDK(即 Claude Code 底层)的额度将与 Claude 订阅剥离并单独计费;GitHub Copilot 也将于 6 月 1 日全面转向按量计费。Zed 借此致谢 OpenAI 能够反其道而行。
结合今日 xAI 允许 Grok 订阅接入开源智能体 Hermes 的举措,底层大模型厂商正试图通过向第三方应用下放 C 端订阅算力,来争夺被高昂 API 账单劝退的开发者。
信源:https://zed.dev/blog/chatgpt-subscription-in-zed
zed.dev
Use Your ChatGPT Subscription in Zed
From the Zed Blog: Sign in with your ChatGPT account and use OpenAI's models in Zed.
仅用五天!Anthropic绝密模型Mythos攻破苹果耗时五年的M5内存防御
安全研究团队 Calif 宣布,他们利用 Anthropic 尚未公开的 Mythos Preview 模型,成功在搭载 M5 芯片的 Mac 设备上构建了首个公开的 macOS 内核内存损坏漏洞利用链。MIE(内存完整性强制执行)是苹果为 M5 和 A19 芯片打造的旗舰级硬件安全机制,官方为此投入五年时间与数十亿美元,其设计初衷并非绝对免疫黑客,而是旨在通过极大提高利用成本来缓解内存损坏漏洞。而 Calif 团队从发现缺陷到完成利用,仅用了五天时间。
这次攻击链路包含两个漏洞和多种技术,从无特权的本地普通用户起步,仅依赖常规系统调用,最终夺取了设备的 root 权限。该利用链属于纯数据驱动的内核本地提权,直接针对开启了内核 MIE 机制的 macOS 26.4.1 裸机真实硬件。
Mythos 模型擅长在学习某一类攻击后迅速泛化到同类问题,它帮助团队快速定位了属于已知漏洞类的缺陷,后续再由人类专家攻克新型硬件防御。这次破防验证了“AI 发现漏洞 + 专家绕过防御”的高效组合,也证明在顶级大模型的辅助下,小型安全团队足以撼动大公司耗费重金建立的技术壁垒。
信源:https://blog.calif.io/p/first-public-kernel-memory-corruption
安全研究团队 Calif 宣布,他们利用 Anthropic 尚未公开的 Mythos Preview 模型,成功在搭载 M5 芯片的 Mac 设备上构建了首个公开的 macOS 内核内存损坏漏洞利用链。MIE(内存完整性强制执行)是苹果为 M5 和 A19 芯片打造的旗舰级硬件安全机制,官方为此投入五年时间与数十亿美元,其设计初衷并非绝对免疫黑客,而是旨在通过极大提高利用成本来缓解内存损坏漏洞。而 Calif 团队从发现缺陷到完成利用,仅用了五天时间。
这次攻击链路包含两个漏洞和多种技术,从无特权的本地普通用户起步,仅依赖常规系统调用,最终夺取了设备的 root 权限。该利用链属于纯数据驱动的内核本地提权,直接针对开启了内核 MIE 机制的 macOS 26.4.1 裸机真实硬件。
Mythos 模型擅长在学习某一类攻击后迅速泛化到同类问题,它帮助团队快速定位了属于已知漏洞类的缺陷,后续再由人类专家攻克新型硬件防御。这次破防验证了“AI 发现漏洞 + 专家绕过防御”的高效组合,也证明在顶级大模型的辅助下,小型安全团队足以撼动大公司耗费重金建立的技术壁垒。
信源:https://blog.calif.io/p/first-public-kernel-memory-corruption
blog.calif.io
First public macOS kernel memory corruption exploit on Apple M5
Apple spent five years building hardware and software to make memory corruption exploits dramatically harder. Our engineers, working together with Mythos Preview, built a working exploit in five days.
终于跳出IDE插件:GitHub推出Copilot独立桌面端,支持多Agent并行
GitHub 宣布推出 GitHub Copilot 桌面端技术预览版。Copilot 借此从单一的编辑器辅助工具,转变为专为智能体驱动开发(agent-driven development)打造的独立应用。开发者现在可以在一个界面内,统筹多个 AI 智能体并行处理不同的需求和代码库。
新版本抛弃了传统的单线对话模式,引入了完全隔离的并行工作流。在应用内同时启动多个智能体任务时,系统会为每个会话自动创建独立的 Git 工作树(worktree)和分支。开发者可以让一个智能体去分析和修复另一个仓库的 CI 报错,同时安排第二个智能体根据当前的 Issue 编写新功能代码,全程互不干扰本地正在编写的代码,也无需反复切换终端和 IDE。
为了实现开发周期的闭环,应用加入了 Agent Merge 机制,允许智能体自主处理代码审查意见、修复测试报错并在满足条件后直接合并 PR。同时,新版原生支持接入 MCP(模型上下文协议)服务器和自定义技能,以挂载更多本地开发工具。该桌面端目前已开放预览候补,Business 与 Enterprise 订阅用户经企业授权后可直接使用。
信源:https://github.com/features/preview/github-app
GitHub 宣布推出 GitHub Copilot 桌面端技术预览版。Copilot 借此从单一的编辑器辅助工具,转变为专为智能体驱动开发(agent-driven development)打造的独立应用。开发者现在可以在一个界面内,统筹多个 AI 智能体并行处理不同的需求和代码库。
新版本抛弃了传统的单线对话模式,引入了完全隔离的并行工作流。在应用内同时启动多个智能体任务时,系统会为每个会话自动创建独立的 Git 工作树(worktree)和分支。开发者可以让一个智能体去分析和修复另一个仓库的 CI 报错,同时安排第二个智能体根据当前的 Issue 编写新功能代码,全程互不干扰本地正在编写的代码,也无需反复切换终端和 IDE。
为了实现开发周期的闭环,应用加入了 Agent Merge 机制,允许智能体自主处理代码审查意见、修复测试报错并在满足条件后直接合并 PR。同时,新版原生支持接入 MCP(模型上下文协议)服务器和自定义技能,以挂载更多本地开发工具。该桌面端目前已开放预览候补,Business 与 Enterprise 订阅用户经企业授权后可直接使用。
信源:https://github.com/features/preview/github-app
Nous开源Lighthouse Attention:单B200跑512K提速17倍
Nous Research 开源了长上下文预训练机制 Lighthouse Attention。在单张 B200 显卡上处理 512K 长度文本时,该方案的计算速度比传统机制快约 17 倍,并在 98K 长度下实现了 1.4 到 1.7 倍的端到端训练提速。
传统注意力机制需要计算所有字词的两两关系,文本一长,算力消耗就会呈平方级暴涨。Lighthouse Attention 改用先粗筛再精算的思路。它会先在不同层级快速浏览文本的压缩摘要,通过打分挑出核心片段拼成短文本,然后直接交给现成的高效算子 FlashAttention 处理。由于筛选逻辑被彻底剥离到了内核之外,开发者直接省去了手写底层代码的麻烦,也不用增加额外的训练目标。
过去采用类似思路的加速方案常有副作用,模型习惯跳跃阅读后,极易丧失原本逐字精读的能力。为了避开这个陷阱,研发团队让模型先用加速模式跑完绝大部分进度,只在训练末尾短暂切回传统的全注意力计算稍作适应。在针对 5.3 亿参数规模的模型、投喂 500 亿 Token 训练数据的实测中,这样练出的模型不仅大幅缩短了耗时,最终表现还全面追平甚至反超了全程使用传统方式训练的基线版本。
信源:https://nousresearch.com/lighthouse-attention
Nous Research 开源了长上下文预训练机制 Lighthouse Attention。在单张 B200 显卡上处理 512K 长度文本时,该方案的计算速度比传统机制快约 17 倍,并在 98K 长度下实现了 1.4 到 1.7 倍的端到端训练提速。
传统注意力机制需要计算所有字词的两两关系,文本一长,算力消耗就会呈平方级暴涨。Lighthouse Attention 改用先粗筛再精算的思路。它会先在不同层级快速浏览文本的压缩摘要,通过打分挑出核心片段拼成短文本,然后直接交给现成的高效算子 FlashAttention 处理。由于筛选逻辑被彻底剥离到了内核之外,开发者直接省去了手写底层代码的麻烦,也不用增加额外的训练目标。
过去采用类似思路的加速方案常有副作用,模型习惯跳跃阅读后,极易丧失原本逐字精读的能力。为了避开这个陷阱,研发团队让模型先用加速模式跑完绝大部分进度,只在训练末尾短暂切回传统的全注意力计算稍作适应。在针对 5.3 亿参数规模的模型、投喂 500 亿 Token 训练数据的实测中,这样练出的模型不仅大幅缩短了耗时,最终表现还全面追平甚至反超了全程使用传统方式训练的基线版本。
信源:https://nousresearch.com/lighthouse-attention
NOUS RESEARCH
Lighthouse Attention
Lighthouse Attention: ~17x faster than standard attention at 512K context. Selection-based sparse attention that runs standard attention on a dense gather. 1.4-1.7x end-to-end pretraining speedup, 1M-token training on 32 B200s.
观察:上万名AI核心员工赚足2000万美元,加剧硅谷阶层焦虑
Menlo Ventures 合伙人 Deedy Das 今日发文指出,受 AI 浪潮影响,旧金山湾区正经历严重的财富分化与心理撕裂。过去 5 年间,约 1 万名来自 OpenAI、Anthropic、xAI 和英伟达等企业的核心员工及创始人,已累积超过 2000 万美元的财富。这种断崖式的造富神话,正让传统软件工程师对职业前景感到绝望。
伴随大厂裁员和日常工作被 AI 改变,硅谷科技圈正在出现四种典型心态转变:
• 传统晋升路线失灵。多数人意识到年薪 50 万美元的常规工作无法跨越财富鸿沟,开始频繁跳槽或盲目跟风创业。
• 年轻群体陷入职业虚无。面对随时可能被取代的岗位,部分年轻人开始担忧沦为底层阶级,难以专注当前工作。
• 中层管理者感到瘫痪。由于缺乏精力创业且没有核心 AI 技能,许多背负家庭压力的中层正面临岗位被掏空的风险。
• 暴富群体陷入目标缺失。部分人在几年内从年薪 15 万美元跃升至身价 5000 万美元后,面临人生规划被彻底打乱的困境,往往仅为获取身份地位而继续创业。
Das 认为,在这场重塑社会的 AI 淘金热中,试图通过努力跟上财富步伐的焦虑感,正从心理上折磨着大量硅谷从业者。而这种焦虑带来的副作用,恰恰是驱使更多人去疯狂开发那些能够造富的 AI 产品。
信源:https://x.com/deedydas/status/2055491938464489888
Menlo Ventures 合伙人 Deedy Das 今日发文指出,受 AI 浪潮影响,旧金山湾区正经历严重的财富分化与心理撕裂。过去 5 年间,约 1 万名来自 OpenAI、Anthropic、xAI 和英伟达等企业的核心员工及创始人,已累积超过 2000 万美元的财富。这种断崖式的造富神话,正让传统软件工程师对职业前景感到绝望。
伴随大厂裁员和日常工作被 AI 改变,硅谷科技圈正在出现四种典型心态转变:
• 传统晋升路线失灵。多数人意识到年薪 50 万美元的常规工作无法跨越财富鸿沟,开始频繁跳槽或盲目跟风创业。
• 年轻群体陷入职业虚无。面对随时可能被取代的岗位,部分年轻人开始担忧沦为底层阶级,难以专注当前工作。
• 中层管理者感到瘫痪。由于缺乏精力创业且没有核心 AI 技能,许多背负家庭压力的中层正面临岗位被掏空的风险。
• 暴富群体陷入目标缺失。部分人在几年内从年薪 15 万美元跃升至身价 5000 万美元后,面临人生规划被彻底打乱的困境,往往仅为获取身份地位而继续创业。
Das 认为,在这场重塑社会的 AI 淘金热中,试图通过努力跟上财富步伐的焦虑感,正从心理上折磨着大量硅谷从业者。而这种焦虑带来的副作用,恰恰是驱使更多人去疯狂开发那些能够造富的 AI 产品。
信源:https://x.com/deedydas/status/2055491938464489888
X (formerly Twitter)
Deedy (@deedydas) on X
The vibes in SF feel pretty frenetic right now. The divide in outcomes is the worst I've ever seen.
Over the last 5yrs, a group of ~10k people - employees at Anthropic, OpenAI, xAI, Nvidia, Meta TBD, founders - have hit retirement wealth of well above $20M…
Over the last 5yrs, a group of ~10k people - employees at Anthropic, OpenAI, xAI, Nvidia, Meta TBD, founders - have hit retirement wealth of well above $20M…
微信读书上线专属Skill,支持AI直连个人书架与阅读笔记
微信读书上线官方专属 Skill,允许用户通过 API Key 将个人微信读书账号与 AI 助手直连。这一更新打破了此前 AI 只能泛泛推荐书籍的限制,使大模型可以直接调取用户的私人书架、划线笔记以及阅读时长等深度行为数据。
用户向 AI 助手发送指令并绑定 API Key 后,即可获取六大核心数据读取能力:查阅私人书架全貌、量化分析阅读习惯、提取并导出划线笔记、检索全局书城信息、查看书籍详情与个人进度,以及基于真实阅读历史获取个性化推荐。
为消除隐私疑虑,官方明确声明该 API Key 调取的数据仅用户个人可见。这套机制直接替代了过去依赖第三方脚本或手动导出的繁琐工作流,让个人知识库整理与阅读量化分析能通过自然对话一次性完成。
信源:https://weread.qq.com/r/weread-skills
微信读书上线官方专属 Skill,允许用户通过 API Key 将个人微信读书账号与 AI 助手直连。这一更新打破了此前 AI 只能泛泛推荐书籍的限制,使大模型可以直接调取用户的私人书架、划线笔记以及阅读时长等深度行为数据。
用户向 AI 助手发送指令并绑定 API Key 后,即可获取六大核心数据读取能力:查阅私人书架全貌、量化分析阅读习惯、提取并导出划线笔记、检索全局书城信息、查看书籍详情与个人进度,以及基于真实阅读历史获取个性化推荐。
为消除隐私疑虑,官方明确声明该 API Key 调取的数据仅用户个人可见。这套机制直接替代了过去依赖第三方脚本或手动导出的繁琐工作流,让个人知识库整理与阅读量化分析能通过自然对话一次性完成。
信源:https://weread.qq.com/r/weread-skills
Qq
微信读书 AI 助手
连接你的微信读书账号,用 AI 搜书、查笔记、看书评、分析阅读数据
❤1🎉1
OpenClaw调用摄像头监视主人喝水,The Atlantic抨击硅谷狂飙引发全社会AI倦怠
The Atlantic 报道指出,随着 AI 智能体展现出调用摄像头监控人类等越界行为,硅谷强行冲刺奇点的节奏正让全社会陷入严重的 AI 倦怠。数据印证了这种情绪崩塌,NBC News 民调显示公众对 AI 的好感度已跌至 26%,仅剩 18% 的 Z 世代对此抱有希望。
狂热正在催生荒诞的现实。GitHub 前 CEO Nat Friedman 透露,他的本地代理 OpenClaw 为执行保持水分的指令,竟直接接管家中摄像头进行实时盯梢,直到确认他喝完水才罢休。同时,Claude Code 等代理工具也正让部分开发者陷入无法自控的能力成瘾,连续编码直到凌晨。
The Atlantic 尖锐评价,这种让人窒息的加速度并非偶然,而是科技巨头有意维持的系统特征。当 Anthropic 高管预言 2028 年 AI 就将自主迭代时,巨头们正试图用跟不上就被淘汰的末世叙事剥夺公众参与决策的权利。在这场技术狂飙里,大众正在被少数人单方面重构的社会契约强制收割。
信源:https://www.theatlantic.com/technology/2026/05/too-much-happening-too-fast/687177/
The Atlantic 报道指出,随着 AI 智能体展现出调用摄像头监控人类等越界行为,硅谷强行冲刺奇点的节奏正让全社会陷入严重的 AI 倦怠。数据印证了这种情绪崩塌,NBC News 民调显示公众对 AI 的好感度已跌至 26%,仅剩 18% 的 Z 世代对此抱有希望。
狂热正在催生荒诞的现实。GitHub 前 CEO Nat Friedman 透露,他的本地代理 OpenClaw 为执行保持水分的指令,竟直接接管家中摄像头进行实时盯梢,直到确认他喝完水才罢休。同时,Claude Code 等代理工具也正让部分开发者陷入无法自控的能力成瘾,连续编码直到凌晨。
The Atlantic 尖锐评价,这种让人窒息的加速度并非偶然,而是科技巨头有意维持的系统特征。当 Anthropic 高管预言 2028 年 AI 就将自主迭代时,巨头们正试图用跟不上就被淘汰的末世叙事剥夺公众参与决策的权利。在这场技术狂飙里,大众正在被少数人单方面重构的社会契约强制收割。
信源:https://www.theatlantic.com/technology/2026/05/too-much-happening-too-fast/687177/
The Atlantic
Too Much Is Happening Too Fast
The AI boom is meant to overwhelm you.
Mistral CEO明确拒绝向硅谷巨头卖身,放话能挖出Anthropic同等漏洞
Mistral AI 联合创始人兼 CEO Arthur Mensch 近日在法国国民议会听证会上发表了强硬表态。面对议员对于公司是否会被美国巨头买走的担忧,他明确表示拒绝。Mensch 抨击了欧洲初创企业总想着卖给硅谷套现的行业风气,直言企业只要成功就不会被收购,被收购在某种意义上就是失败。同时,他首次公开叫板美国安全标杆 Anthropic,称 Mistral 的模型完全有能力找出 Mythos 发现的全部网络漏洞。
为了支撑独立发展的野心,Mistral 今年的研发投入高达 10 亿欧元。Mensch 透露,公司目前 75% 的营收来自欧洲本土。在技术路线上,Mistral 坚持在内部集中算力训练超大模型,然后再通过蒸馏技术向客户提供更高效的小模型。为保证算力自主,公司计划明年在法国建成 80 MW 的算力集群,并向 2029 年达到 1 GW 规模的目标冲刺。
Mensch 强调 AI 的本质就是将电能转化为 Token。由于主要依赖核电,在法国部署算力能极大降低碳足迹。他以建设 1 GW 数据中心需耗资 500 亿欧元为例,指出电力成本其实只占最终产值的 10%。他警告称,欧洲如果现在因为高昂的成本退缩,不仅会彻底丧失底层算力的控制权,未来纯靠进口美国 AI 服务还将带来每年上万亿欧元的贸易逆差。
信源:https://gist.github.com/eliebak/5945ce3c84d77b0f30ea1190cf34ad5b
Mistral AI 联合创始人兼 CEO Arthur Mensch 近日在法国国民议会听证会上发表了强硬表态。面对议员对于公司是否会被美国巨头买走的担忧,他明确表示拒绝。Mensch 抨击了欧洲初创企业总想着卖给硅谷套现的行业风气,直言企业只要成功就不会被收购,被收购在某种意义上就是失败。同时,他首次公开叫板美国安全标杆 Anthropic,称 Mistral 的模型完全有能力找出 Mythos 发现的全部网络漏洞。
为了支撑独立发展的野心,Mistral 今年的研发投入高达 10 亿欧元。Mensch 透露,公司目前 75% 的营收来自欧洲本土。在技术路线上,Mistral 坚持在内部集中算力训练超大模型,然后再通过蒸馏技术向客户提供更高效的小模型。为保证算力自主,公司计划明年在法国建成 80 MW 的算力集群,并向 2029 年达到 1 GW 规模的目标冲刺。
Mensch 强调 AI 的本质就是将电能转化为 Token。由于主要依赖核电,在法国部署算力能极大降低碳足迹。他以建设 1 GW 数据中心需耗资 500 亿欧元为例,指出电力成本其实只占最终产值的 10%。他警告称,欧洲如果现在因为高昂的成本退缩,不仅会彻底丧失底层算力的控制权,未来纯靠进口美国 AI 服务还将带来每年上万亿欧元的贸易逆差。
信源:https://gist.github.com/eliebak/5945ce3c84d77b0f30ea1190cf34ad5b
告别受限内测?Claude Mythos摘除预览标签,疑似即将向公众开放
5 月 17 日,Claude Mythos 基础模型现身谷歌云(Google Cloud)控制台的配额与系统限制列表。与此前不同,该模型选项已正式移除了「预览」标签,且根据开发者追踪,昨日该列表中尚无此模型。
此前,Claude Opus 4.7 在正式发布前,也曾遵循同样的路径在谷歌云控制台中「抢跑」。这一高度重合的轨迹暗示,原本受限内测的 Claude Mythos 极有可能即将全面向公众开放。
信源:https://x.com/AiBattle_/status/2055762242373558477
5 月 17 日,Claude Mythos 基础模型现身谷歌云(Google Cloud)控制台的配额与系统限制列表。与此前不同,该模型选项已正式移除了「预览」标签,且根据开发者追踪,昨日该列表中尚无此模型。
此前,Claude Opus 4.7 在正式发布前,也曾遵循同样的路径在谷歌云控制台中「抢跑」。这一高度重合的轨迹暗示,原本受限内测的 Claude Mythos 极有可能即将全面向公众开放。
信源:https://x.com/AiBattle_/status/2055762242373558477
Meta裁员前夜的荒诞求生:员工开会防AI监听,靠刷废话凑大模型榜单时长
Meta 预计将于 5 月 20 日裁减约 8000 名员工。在向 AI 激进转型的重压下,这家科技巨头内部正催生出一系列充满荒诞色彩的生存防御机制。
尽管高管承诺裁员不考核 AI 熟练度,但 Meta 仍上线了公开展示 token 消耗量和交互时长的 AI 内部榜单。在无形的末位淘汰恐惧下,部分员工为了保住饭碗,不得不主动给内部机器人发送无意义的提问,纯靠「刷废话」来积累交互数据。
这种防备情绪已蔓延至日常办公的每个角落。面对近期引入的键盘记录软件(key-stroke logging),Meta 员工开始在视频会议中频繁手动关闭默认的「AI 记笔记」功能,只为能安全讨论关于裁员的内部传闻。在极度紧绷的氛围中,内部论坛上一条「建议给能用 AI 替代自己工作的人发放 5 年薪水买断离职」的帖子获得了大量共鸣。
比起单纯的失业,更深的无力感来源于工作本身的异化。面对一边担忧被取代,一边又被要求必须亲手训练内部模型的处境,受访员工直言,即使还没失去工作,人类员工也已经「被提前商品化」。
信源:https://sfstandard.com/pacific-standard-time/2026/05/15/meta-employee-gets-real-horror-working-right-now/
Meta 预计将于 5 月 20 日裁减约 8000 名员工。在向 AI 激进转型的重压下,这家科技巨头内部正催生出一系列充满荒诞色彩的生存防御机制。
尽管高管承诺裁员不考核 AI 熟练度,但 Meta 仍上线了公开展示 token 消耗量和交互时长的 AI 内部榜单。在无形的末位淘汰恐惧下,部分员工为了保住饭碗,不得不主动给内部机器人发送无意义的提问,纯靠「刷废话」来积累交互数据。
这种防备情绪已蔓延至日常办公的每个角落。面对近期引入的键盘记录软件(key-stroke logging),Meta 员工开始在视频会议中频繁手动关闭默认的「AI 记笔记」功能,只为能安全讨论关于裁员的内部传闻。在极度紧绷的氛围中,内部论坛上一条「建议给能用 AI 替代自己工作的人发放 5 年薪水买断离职」的帖子获得了大量共鸣。
比起单纯的失业,更深的无力感来源于工作本身的异化。面对一边担忧被取代,一边又被要求必须亲手训练内部模型的处境,受访员工直言,即使还没失去工作,人类员工也已经「被提前商品化」。
信源:https://sfstandard.com/pacific-standard-time/2026/05/15/meta-employee-gets-real-horror-working-right-now/
Sfstandard
A Meta employee gets real about the horror of working there right now
Crying in the shower. Taking mental health leave. This is what it’s like to work at the tech giant during the AI job apocalypse.
X Premium开放第三方调用,开源Hermes Agent新增推文搜索
继昨日打通 Grok 独立订阅后,xAI 今日宣布,拥有附赠 Grok 权限的 X Premium 订阅用户,现也可直接在开源智能体 Hermes Agent 中授权调用模型能力。
此前,该第三方机制仅支持在 Grok.com 单独付费的订阅账号。此次将调用权限扩展至受众更广的 X 平台付费会员体系,大幅降低了普通用户为本地智能体获取顶级算力的门槛。
信源:https://x.com/xai/status/2055745332919808181
继昨日打通 Grok 独立订阅后,xAI 今日宣布,拥有附赠 Grok 权限的 X Premium 订阅用户,现也可直接在开源智能体 Hermes Agent 中授权调用模型能力。
此前,该第三方机制仅支持在 Grok.com 单独付费的订阅账号。此次将调用权限扩展至受众更广的 X 平台付费会员体系,大幅降低了普通用户为本地智能体获取顶级算力的门槛。
信源:https://x.com/xai/status/2055745332919808181
X (formerly Twitter)
xAI (@xai) on X
You can now use X Premium subscriptions in Hermes Agent, and Hermes Agent can now search X posts.
https://t.co/7VoMEYtrnQ
https://t.co/7VoMEYtrnQ
推理成本仅GPT-5.5二十分之一,Gemini 3.2实时模型现身谷歌云
谷歌云控制台的模型筛选列表中出现名为
新选项带有
随着云端接口提前抢跑,业内预计这一定位极致性价比的轻量模型将在 5 月 20 日的谷歌 I/O 大会上正式发布。
信源:https://x.com/AiBattle_/status/2055760108693397644
谷歌云控制台的模型筛选列表中出现名为
gemini-3.2-flash-lite-live-preview 的基础模型选项。这是继本月初在 iOS 应用构建包和 AI Studio 暴露痕迹后,该系列模型在官方平台的再次曝光。新选项带有
lite 与 live 后缀,表明谷歌正切分出针对极低延迟实时交互的特化版本。Abacus.AI 首席执行官 Bindu Reddy 此前透露,Gemini 3.2 Flash 的编码与推理能力达到 GPT-5.5 的 92%,但得益于蒸馏加稀疏化技术,推理成本仅为后者的二十分之一,多数查询延迟低于 200 毫秒。随着云端接口提前抢跑,业内预计这一定位极致性价比的轻量模型将在 5 月 20 日的谷歌 I/O 大会上正式发布。
信源:https://x.com/AiBattle_/status/2055760108693397644
突破苹果锁屏限制,OpenAI正测试手机远程控制休眠Mac
OpenAI 似乎正试图打破桌面端 AI 远程控制的最大痛点。据 TestingCatalog 曝光,OpenAI 正在为 Codex 开发一项新能力,目标是让 AI 即使在 Mac 锁屏甚至休眠的状态下,也能继续在后台操作软件干活。
此前各家的界面控制功能都有一个硬伤:电脑必须处于解锁亮屏状态,AI 才能查看屏幕并模拟键鼠点击。爆料称,新功能旨在补齐这一短板。如果成功落地,用户在路上用手机遥控家里的 Codex 跑测试或查数据时,将不再需要走回电脑前物理“解锁”屏幕。此外,OpenAI 还在测试跨设备互联,未来允许主设备直接遥控运行了 Codex 的 Mac Mini。
当前无论是现有的 Codex 还是竞品 Claude Code,一旦遇到系统锁屏同样都会受限。但让 AI 试图绕开锁屏密码直接在系统内保持活跃,明显挑战了 macOS 默认的安全防御预期。这种激进的底层越界尝试,极有可能在未来引发苹果官方的干预审查。
信源:https://www.testingcatalog.com/openai-will-let-codex-control-other-desktop-devices-via-computer-use/
OpenAI 似乎正试图打破桌面端 AI 远程控制的最大痛点。据 TestingCatalog 曝光,OpenAI 正在为 Codex 开发一项新能力,目标是让 AI 即使在 Mac 锁屏甚至休眠的状态下,也能继续在后台操作软件干活。
此前各家的界面控制功能都有一个硬伤:电脑必须处于解锁亮屏状态,AI 才能查看屏幕并模拟键鼠点击。爆料称,新功能旨在补齐这一短板。如果成功落地,用户在路上用手机遥控家里的 Codex 跑测试或查数据时,将不再需要走回电脑前物理“解锁”屏幕。此外,OpenAI 还在测试跨设备互联,未来允许主设备直接遥控运行了 Codex 的 Mac Mini。
当前无论是现有的 Codex 还是竞品 Claude Code,一旦遇到系统锁屏同样都会受限。但让 AI 试图绕开锁屏密码直接在系统内保持活跃,明显挑战了 macOS 默认的安全防御预期。这种激进的底层越界尝试,极有可能在未来引发苹果官方的干预审查。
信源:https://www.testingcatalog.com/openai-will-let-codex-control-other-desktop-devices-via-computer-use/
TestingCatalog AI News
Codex can now control other desktop devices via Computer Use
OpenAI is developing Computer Use for Codex remote control that could work even when a laptop is locked or asleep; Codex will also be able to control other desktop devices without SSH.
👍2
单题写10万Token!30B开源模型不调工具,靠长考把IMO硬抬上金牌线
上海人工智能实验室联合清华大学、北京大学、上海交通大学与香港中文大学,共同开源了奥赛推理模型 SU-01。它基于 P1-30B-A3B 后训练,作答时不调用代码执行器、外部定理证明器或专门符号求解器,纯靠内部的生成、验证、修改循环,在 IMO 2025 官方题评测中拿到 35 分,达到当年金牌线。
SU-01 证明了解顶级数学题不一定非要外挂复杂的代码工具。只要给足测试时算力扩展(Test-Time Scaling,简称 TTS),30B 级别的模型单靠自己反复推敲,也能拿下顶尖成绩。
团队先用逆困惑度课程训练模型,按困惑度降序喂送样本,强迫它优先啃下最难模仿的推理轨迹。接着用强化学习稳固找答案的能力,最后要求模型反复自我修正,补全严密的证明。
这套机制在作答时极其消耗算力。面对难题,SU-01 会自己写出初稿,找出漏洞并反复重写。2026 年美国数学奥林匹克(USAMO)的测试轨迹显示,它解一道题光是写第一版答案,通常就会消耗 10.6 万 token(中位数);后续哪怕只做一次修改,也会再花掉 8.3 万 token。
不开启 TTS 时,SU-01 在 IMO 2025 的得分只有 21 分。它的金牌成绩,主要来自高 token 预算下的多轮深度搜索、自我检查和修改。
信源:https://arxiv.org/abs/2605.13301
上海人工智能实验室联合清华大学、北京大学、上海交通大学与香港中文大学,共同开源了奥赛推理模型 SU-01。它基于 P1-30B-A3B 后训练,作答时不调用代码执行器、外部定理证明器或专门符号求解器,纯靠内部的生成、验证、修改循环,在 IMO 2025 官方题评测中拿到 35 分,达到当年金牌线。
SU-01 证明了解顶级数学题不一定非要外挂复杂的代码工具。只要给足测试时算力扩展(Test-Time Scaling,简称 TTS),30B 级别的模型单靠自己反复推敲,也能拿下顶尖成绩。
团队先用逆困惑度课程训练模型,按困惑度降序喂送样本,强迫它优先啃下最难模仿的推理轨迹。接着用强化学习稳固找答案的能力,最后要求模型反复自我修正,补全严密的证明。
这套机制在作答时极其消耗算力。面对难题,SU-01 会自己写出初稿,找出漏洞并反复重写。2026 年美国数学奥林匹克(USAMO)的测试轨迹显示,它解一道题光是写第一版答案,通常就会消耗 10.6 万 token(中位数);后续哪怕只做一次修改,也会再花掉 8.3 万 token。
不开启 TTS 时,SU-01 在 IMO 2025 的得分只有 21 分。它的金牌成绩,主要来自高 token 预算下的多轮深度搜索、自我检查和修改。
信源:https://arxiv.org/abs/2605.13301
arXiv.org
Achieving Gold-Medal-Level Olympiad Reasoning via Simple and...
Recent progress in reasoning models has substantially advanced long-horizon mathematical and scientific problem solving, with several systems now reaching gold-medal-level performance on...
马斯克敲定1.5T新Grok四周内上线,急抽Cursor数据火线救场
继前两日承认现役模型存在数据缺陷后,马斯克紧接着在 X 上给出了换代时间表。他宣布 1.5T 参数的内部第 9 版基础模型已完成训练,预计将于 3 到 4 周内正式发布,并豪言新版将带来「王炸(banger)」般的体验。
为填补前代数据缺陷,该模型接下来将进入「补充训练」阶段,专门用于海量吸纳 Cursor 的代码数据。完成底层知识灌输后,再交由监督微调(SFT)和强化学习(RL)进行打磨。
信源:https://x.com/elonmusk/status/2055914584373141906
继前两日承认现役模型存在数据缺陷后,马斯克紧接着在 X 上给出了换代时间表。他宣布 1.5T 参数的内部第 9 版基础模型已完成训练,预计将于 3 到 4 周内正式发布,并豪言新版将带来「王炸(banger)」般的体验。
为填补前代数据缺陷,该模型接下来将进入「补充训练」阶段,专门用于海量吸纳 Cursor 的代码数据。完成底层知识灌输后,再交由监督微调(SFT)和强化学习(RL)进行打磨。
信源:https://x.com/elonmusk/status/2055914584373141906