突破苹果锁屏限制,OpenAI正测试手机远程控制休眠Mac
OpenAI 似乎正试图打破桌面端 AI 远程控制的最大痛点。据 TestingCatalog 曝光,OpenAI 正在为 Codex 开发一项新能力,目标是让 AI 即使在 Mac 锁屏甚至休眠的状态下,也能继续在后台操作软件干活。
此前各家的界面控制功能都有一个硬伤:电脑必须处于解锁亮屏状态,AI 才能查看屏幕并模拟键鼠点击。爆料称,新功能旨在补齐这一短板。如果成功落地,用户在路上用手机遥控家里的 Codex 跑测试或查数据时,将不再需要走回电脑前物理“解锁”屏幕。此外,OpenAI 还在测试跨设备互联,未来允许主设备直接遥控运行了 Codex 的 Mac Mini。
当前无论是现有的 Codex 还是竞品 Claude Code,一旦遇到系统锁屏同样都会受限。但让 AI 试图绕开锁屏密码直接在系统内保持活跃,明显挑战了 macOS 默认的安全防御预期。这种激进的底层越界尝试,极有可能在未来引发苹果官方的干预审查。
信源:https://www.testingcatalog.com/openai-will-let-codex-control-other-desktop-devices-via-computer-use/
OpenAI 似乎正试图打破桌面端 AI 远程控制的最大痛点。据 TestingCatalog 曝光,OpenAI 正在为 Codex 开发一项新能力,目标是让 AI 即使在 Mac 锁屏甚至休眠的状态下,也能继续在后台操作软件干活。
此前各家的界面控制功能都有一个硬伤:电脑必须处于解锁亮屏状态,AI 才能查看屏幕并模拟键鼠点击。爆料称,新功能旨在补齐这一短板。如果成功落地,用户在路上用手机遥控家里的 Codex 跑测试或查数据时,将不再需要走回电脑前物理“解锁”屏幕。此外,OpenAI 还在测试跨设备互联,未来允许主设备直接遥控运行了 Codex 的 Mac Mini。
当前无论是现有的 Codex 还是竞品 Claude Code,一旦遇到系统锁屏同样都会受限。但让 AI 试图绕开锁屏密码直接在系统内保持活跃,明显挑战了 macOS 默认的安全防御预期。这种激进的底层越界尝试,极有可能在未来引发苹果官方的干预审查。
信源:https://www.testingcatalog.com/openai-will-let-codex-control-other-desktop-devices-via-computer-use/
TestingCatalog AI News
Codex can now control other desktop devices via Computer Use
OpenAI is developing Computer Use for Codex remote control that could work even when a laptop is locked or asleep; Codex will also be able to control other desktop devices without SSH.
👍2
单题写10万Token!30B开源模型不调工具,靠长考把IMO硬抬上金牌线
上海人工智能实验室联合清华大学、北京大学、上海交通大学与香港中文大学,共同开源了奥赛推理模型 SU-01。它基于 P1-30B-A3B 后训练,作答时不调用代码执行器、外部定理证明器或专门符号求解器,纯靠内部的生成、验证、修改循环,在 IMO 2025 官方题评测中拿到 35 分,达到当年金牌线。
SU-01 证明了解顶级数学题不一定非要外挂复杂的代码工具。只要给足测试时算力扩展(Test-Time Scaling,简称 TTS),30B 级别的模型单靠自己反复推敲,也能拿下顶尖成绩。
团队先用逆困惑度课程训练模型,按困惑度降序喂送样本,强迫它优先啃下最难模仿的推理轨迹。接着用强化学习稳固找答案的能力,最后要求模型反复自我修正,补全严密的证明。
这套机制在作答时极其消耗算力。面对难题,SU-01 会自己写出初稿,找出漏洞并反复重写。2026 年美国数学奥林匹克(USAMO)的测试轨迹显示,它解一道题光是写第一版答案,通常就会消耗 10.6 万 token(中位数);后续哪怕只做一次修改,也会再花掉 8.3 万 token。
不开启 TTS 时,SU-01 在 IMO 2025 的得分只有 21 分。它的金牌成绩,主要来自高 token 预算下的多轮深度搜索、自我检查和修改。
信源:https://arxiv.org/abs/2605.13301
上海人工智能实验室联合清华大学、北京大学、上海交通大学与香港中文大学,共同开源了奥赛推理模型 SU-01。它基于 P1-30B-A3B 后训练,作答时不调用代码执行器、外部定理证明器或专门符号求解器,纯靠内部的生成、验证、修改循环,在 IMO 2025 官方题评测中拿到 35 分,达到当年金牌线。
SU-01 证明了解顶级数学题不一定非要外挂复杂的代码工具。只要给足测试时算力扩展(Test-Time Scaling,简称 TTS),30B 级别的模型单靠自己反复推敲,也能拿下顶尖成绩。
团队先用逆困惑度课程训练模型,按困惑度降序喂送样本,强迫它优先啃下最难模仿的推理轨迹。接着用强化学习稳固找答案的能力,最后要求模型反复自我修正,补全严密的证明。
这套机制在作答时极其消耗算力。面对难题,SU-01 会自己写出初稿,找出漏洞并反复重写。2026 年美国数学奥林匹克(USAMO)的测试轨迹显示,它解一道题光是写第一版答案,通常就会消耗 10.6 万 token(中位数);后续哪怕只做一次修改,也会再花掉 8.3 万 token。
不开启 TTS 时,SU-01 在 IMO 2025 的得分只有 21 分。它的金牌成绩,主要来自高 token 预算下的多轮深度搜索、自我检查和修改。
信源:https://arxiv.org/abs/2605.13301
arXiv.org
Achieving Gold-Medal-Level Olympiad Reasoning via Simple and...
Recent progress in reasoning models has substantially advanced long-horizon mathematical and scientific problem solving, with several systems now reaching gold-medal-level performance on...
马斯克敲定1.5T新Grok四周内上线,急抽Cursor数据火线救场
继前两日承认现役模型存在数据缺陷后,马斯克紧接着在 X 上给出了换代时间表。他宣布 1.5T 参数的内部第 9 版基础模型已完成训练,预计将于 3 到 4 周内正式发布,并豪言新版将带来「王炸(banger)」般的体验。
为填补前代数据缺陷,该模型接下来将进入「补充训练」阶段,专门用于海量吸纳 Cursor 的代码数据。完成底层知识灌输后,再交由监督微调(SFT)和强化学习(RL)进行打磨。
信源:https://x.com/elonmusk/status/2055914584373141906
继前两日承认现役模型存在数据缺陷后,马斯克紧接着在 X 上给出了换代时间表。他宣布 1.5T 参数的内部第 9 版基础模型已完成训练,预计将于 3 到 4 周内正式发布,并豪言新版将带来「王炸(banger)」般的体验。
为填补前代数据缺陷,该模型接下来将进入「补充训练」阶段,专门用于海量吸纳 Cursor 的代码数据。完成底层知识灌输后,再交由监督微调(SFT)和强化学习(RL)进行打磨。
信源:https://x.com/elonmusk/status/2055914584373141906
Hermes发布v0.14:全面原生接入Grok,官方下场推C端订阅转API代理
NousResearch 发布多平台智能体框架 Hermes Agent 的 v0.14.0 重大版本更新。本次迭代合入了超 800 个提交,核心动作是将 xAI 体系升格为原生基础能力,并试图接管用户的各大 AI 会员订阅。
Grok 获得最高级别支持。新版引入 SuperGrok 订阅支持,用户无需申请 API Key 即可调用模型,配套的 grok-4.3 模型上下文窗口同步提升至 100 万 token。此前依赖外部实现的 x_search 推文搜索也转为原生内置工具,打通了 X OAuth 授权。
官方内置本地接口代理。新增的 hermes proxy 命令能够将 Claude Pro、ChatGPT Pro 与 SuperGrok 的网页端授权直接转化为标准 OpenAI 格式的本地接口。这一功能在理论上可替代多种第三方逆向代理工具。
智能体执行流引入硬核校验。新版加入带上下文的模型无缝切换指令 handoff。在代码编辑场景,系统在写入文件后会强制执行 LSP 语义诊断并附加校验层,直接针对大模型宣称修改实则未写入的幻觉问题下药。
此外,由于将音视频与部分平台交互等重型依赖改为懒加载模式,该框架的冷启动时间被削减了近 19 秒。
信源:https://github.com/NousResearch/hermes-agent/releases/tag/v2026.5.16
NousResearch 发布多平台智能体框架 Hermes Agent 的 v0.14.0 重大版本更新。本次迭代合入了超 800 个提交,核心动作是将 xAI 体系升格为原生基础能力,并试图接管用户的各大 AI 会员订阅。
Grok 获得最高级别支持。新版引入 SuperGrok 订阅支持,用户无需申请 API Key 即可调用模型,配套的 grok-4.3 模型上下文窗口同步提升至 100 万 token。此前依赖外部实现的 x_search 推文搜索也转为原生内置工具,打通了 X OAuth 授权。
官方内置本地接口代理。新增的 hermes proxy 命令能够将 Claude Pro、ChatGPT Pro 与 SuperGrok 的网页端授权直接转化为标准 OpenAI 格式的本地接口。这一功能在理论上可替代多种第三方逆向代理工具。
智能体执行流引入硬核校验。新版加入带上下文的模型无缝切换指令 handoff。在代码编辑场景,系统在写入文件后会强制执行 LSP 语义诊断并附加校验层,直接针对大模型宣称修改实则未写入的幻觉问题下药。
此外,由于将音视频与部分平台交互等重型依赖改为懒加载模式,该框架的冷启动时间被削减了近 19 秒。
信源:https://github.com/NousResearch/hermes-agent/releases/tag/v2026.5.16
GitHub
Release Hermes Agent v0.14.0 (2026.5.16) · NousResearch/hermes-agent
Hermes Agent v0.14.0 (v2026.5.16)
Release Date: May 16, 2026
Since v0.13.0: 808 commits · 633 merged PRs · 1393 files changed · 165,061 insertions · 545 issues closed (12 P0, 50 P1) · 215 community...
Release Date: May 16, 2026
Since v0.13.0: 808 commits · 633 merged PRs · 1393 files changed · 165,061 insertions · 545 issues closed (12 P0, 50 P1) · 215 community...
300美元直降至99美元,xAI掀价格战强推Grok Build
xAI 针对其顶配订阅服务 SuperGrok Heavy 推出激进的限时补贴策略。新老用户在未来 6 个月内,可享受从 300 美元/月直降 67% 至 99 美元/月的超级折扣。
Heavy 订阅是目前获取 xAI 命令行编程工具 Grok Build 的唯一门槛。该工具上周已开启公测,主打并发多子体(Subagents)与原生 MCP 扩展。
信源:https://grok.com/supergrok?referrer=grok-build
xAI 针对其顶配订阅服务 SuperGrok Heavy 推出激进的限时补贴策略。新老用户在未来 6 个月内,可享受从 300 美元/月直降 67% 至 99 美元/月的超级折扣。
Heavy 订阅是目前获取 xAI 命令行编程工具 Grok Build 的唯一门槛。该工具上周已开启公测,主打并发多子体(Subagents)与原生 MCP 扩展。
信源:https://grok.com/supergrok?referrer=grok-build
腾讯公测AI设计智能体Ardot:基于MCP接入IDE,支持私有组件库生成
腾讯今日开启自研 AI 设计智能体平台 Ardot 公测。该平台的核心机制在于将 AI 生成的设计稿转化为结构化数据,并通过 MCP(模型上下文协议)直接连接外部 IDE。
在设计侧,Ardot 支持通过自然语言批量生成或修改矢量界面,并允许直接导入 Figma 文件。为了避免 AI 绘图规范不可控的问题,平台开放了企业私有业务组件库接入,使 AI 生成的草稿能够直接遵循团队现有的设计规范。
在交接侧,包含变量、组件和布局数据的设计资产,可通过 MCP 协议直接被 CodeBuddy、Cursor 与 Claude Code 等开发工具读取。研发人员可在 IDE 内一键生成前端代码,从而替代传统的人工切图与标注流程。
该平台目前已提供 1000 Credits 初始额度,内置多人在线评审功能已同步上线。
信源:https://mp.weixin.qq.com/s/cCbdbFfy0-ciPhpd56GeQA
腾讯今日开启自研 AI 设计智能体平台 Ardot 公测。该平台的核心机制在于将 AI 生成的设计稿转化为结构化数据,并通过 MCP(模型上下文协议)直接连接外部 IDE。
在设计侧,Ardot 支持通过自然语言批量生成或修改矢量界面,并允许直接导入 Figma 文件。为了避免 AI 绘图规范不可控的问题,平台开放了企业私有业务组件库接入,使 AI 生成的草稿能够直接遵循团队现有的设计规范。
在交接侧,包含变量、组件和布局数据的设计资产,可通过 MCP 协议直接被 CodeBuddy、Cursor 与 Claude Code 等开发工具读取。研发人员可在 IDE 内一键生成前端代码,从而替代传统的人工切图与标注流程。
该平台目前已提供 1000 Credits 初始额度,内置多人在线评审功能已同步上线。
信源:https://mp.weixin.qq.com/s/cCbdbFfy0-ciPhpd56GeQA
Citadel创始人:大企业护城河正被填平,内部AI已将金融PhD数月投研缩至数小时
对冲基金 Citadel 正在公司内部真切感受到 AI 对高智力岗位的残酷替代。创始人兼 CEO Ken Griffin 在 2026 斯坦福领袖论坛(Stanford Leadership Forum)上证实,以往需要金融学硕士和 PhD 耗时数周甚至数月的高级投研工作,目前正被其内部署的 AI 智能体在几小时或几天内批量搞定。
Griffin 坦言,亲眼看着核心研发层被机器迅速自动化,曾让他在某个周五下班时感到抑郁。他直接借用历史学家 Niall Ferguson 的悚然论断定调了这场冲击:「在 AI 的世界里,人类就是当年被汽车取代的马。」
毁灭同时伴随着旧有格局的解体。Griffin 明确指出,大型企业长期依赖的竞争护城河正被各种 AI 工具迅速填平。这直接将当下的市场变成了创业者的梦幻乐园,小团队向行业巨头开战的门槛已被降至历史最低。
信源:https://www.youtube.com/watch?v=Csjy_A3Kj9s
对冲基金 Citadel 正在公司内部真切感受到 AI 对高智力岗位的残酷替代。创始人兼 CEO Ken Griffin 在 2026 斯坦福领袖论坛(Stanford Leadership Forum)上证实,以往需要金融学硕士和 PhD 耗时数周甚至数月的高级投研工作,目前正被其内部署的 AI 智能体在几小时或几天内批量搞定。
Griffin 坦言,亲眼看着核心研发层被机器迅速自动化,曾让他在某个周五下班时感到抑郁。他直接借用历史学家 Niall Ferguson 的悚然论断定调了这场冲击:「在 AI 的世界里,人类就是当年被汽车取代的马。」
毁灭同时伴随着旧有格局的解体。Griffin 明确指出,大型企业长期依赖的竞争护城河正被各种 AI 工具迅速填平。这直接将当下的市场变成了创业者的梦幻乐园,小团队向行业巨头开战的门槛已被降至历史最低。
信源:https://www.youtube.com/watch?v=Csjy_A3Kj9s
YouTube
Stanford Leadership Forum 2026: Conversation with Ken Griffin
Ken Griffin, founder and CEO of Citadel, speaks with Amit Seru, the Steven and Roberta Denning Professor of Finance, Senior Associate Dean for Academic Affairs at the Stanford Graduate School of Business, Senior Fellow, Hoover Institution, and Senior Fellow…
前SpaceX工程师忠告:想做硬件创业就立刻飞深圳
前 Tesla 无人驾驶与 SpaceX 猛禽团队工程师 Zac Valles 在 YC 路演结束 72 小时后直飞深圳。在实地驻扎 8 周并带着新硬件返回旧金山后,他强烈建议所有硬件创业者,哪怕还没融资、没团队、甚至没点子,只要想做硬件就该立刻去深圳。
他总结了在深圳对接供应链的核心经验。在切入路径上,他建议利用大型展会作为跳板,这是进入任何工厂最有效的敲门砖。在与代工厂沟通时,初期应重点询问交期而不是成本。他指出,硬件迭代速度受制于交期最长的零件,尽早锁定这些零件才能排布准确的时间表。
在供应商筛选与设计端,Valles 提醒创业者对代工厂的执行能力做好分级。他特别建议不要设计工序过于复杂的零件,例如需要 12 道后续加工的组件极难找到愿意接单的工厂。此外,他推荐在华强北这个“微型城市”预留 4 到 6 小时实地考察,并指出尊重当地商业文化(如“酒满茶半”)是推进合作的重要润滑剂。
信源:https://x.com/zacharyvalles/status/2055676910739599462
前 Tesla 无人驾驶与 SpaceX 猛禽团队工程师 Zac Valles 在 YC 路演结束 72 小时后直飞深圳。在实地驻扎 8 周并带着新硬件返回旧金山后,他强烈建议所有硬件创业者,哪怕还没融资、没团队、甚至没点子,只要想做硬件就该立刻去深圳。
他总结了在深圳对接供应链的核心经验。在切入路径上,他建议利用大型展会作为跳板,这是进入任何工厂最有效的敲门砖。在与代工厂沟通时,初期应重点询问交期而不是成本。他指出,硬件迭代速度受制于交期最长的零件,尽早锁定这些零件才能排布准确的时间表。
在供应商筛选与设计端,Valles 提醒创业者对代工厂的执行能力做好分级。他特别建议不要设计工序过于复杂的零件,例如需要 12 道后续加工的组件极难找到愿意接单的工厂。此外,他推荐在华强北这个“微型城市”预留 4 到 6 小时实地考察,并指出尊重当地商业文化(如“酒满茶半”)是推进合作的重要润滑剂。
信源:https://x.com/zacharyvalles/status/2055676910739599462
X (formerly Twitter)
Zac Valles (@zacharyvalles) on X
72 hours after YC demo day, I moved to Shenzhen for 8 weeks 🤠
I'm headed back to SF with new hardware in hand (sharing more soon), but some takeaways documented below:
> If you have even the slightest ambition to found a hardware company, visit SZ. Pre…
I'm headed back to SF with new hardware in hand (sharing more soon), but some takeaways documented below:
> If you have even the slightest ambition to found a hardware company, visit SZ. Pre…
谷歌双雄高难局反超,TERMS-Bench把AI谈判做成破产压力测试
斯坦福 Erica Zhang 等人发布了经济谈判测试集 TERMS-Bench。它移除了黑箱的「大模型裁判」,让评测方能直接看清模型到底输在出价、让步还是违规。
在常规测试中,Claude Opus 4.6 和智谱 GLM 5.1 拿下前两名。论文发现,它们采用了「高出价、死不让步」的强硬策略,在利润丰厚的顺风局能把对手榨干。
但在利润空间极窄的最高难度局,强硬策略会因为频繁谈崩而吃亏。榜单在这里直接翻车:懂得适度让步保订单的 Gemma 4 31B(开放权重模型)和 Gemini 3.1 Pro 反超冲到前两名;而此前的领跑者 Claude 掉到第 5,GLM 掉到第 9。
除了测试极限难度,该基准最具冲击力的是测试生存能力的 Bankroll(资金池)模式。单次谈判被拉长成连续采购:每个 Agent 拿 100 美元本金连谈 50 期,每期固定扣运营费,亏完就破产。在这里,微小的谈判失误都会复利成破产危机。
结果显示,前述的 GLM 5.1、Claude Opus 4.6 以及谷歌双雄虽然策略不同,但控盘能力断层领先,全部实现了 100% 存活,最终现金均达到了 380 到 443 美元。相比之下,Grok 4.20 和 GPT-4o-mini 则无法顶住现金流损耗,破产率分别达到 25% 和 50%。
TERMS-Bench 的关键不在成交率,而在把谈判错误换算成现金亏损和破产风险。模型能不能说服对手,只是第一层;在连续交易里能不能守住利润和现金流,才真正拉开差距。
信源:https://arxiv.org/abs/2605.13909v1
斯坦福 Erica Zhang 等人发布了经济谈判测试集 TERMS-Bench。它移除了黑箱的「大模型裁判」,让评测方能直接看清模型到底输在出价、让步还是违规。
在常规测试中,Claude Opus 4.6 和智谱 GLM 5.1 拿下前两名。论文发现,它们采用了「高出价、死不让步」的强硬策略,在利润丰厚的顺风局能把对手榨干。
但在利润空间极窄的最高难度局,强硬策略会因为频繁谈崩而吃亏。榜单在这里直接翻车:懂得适度让步保订单的 Gemma 4 31B(开放权重模型)和 Gemini 3.1 Pro 反超冲到前两名;而此前的领跑者 Claude 掉到第 5,GLM 掉到第 9。
除了测试极限难度,该基准最具冲击力的是测试生存能力的 Bankroll(资金池)模式。单次谈判被拉长成连续采购:每个 Agent 拿 100 美元本金连谈 50 期,每期固定扣运营费,亏完就破产。在这里,微小的谈判失误都会复利成破产危机。
结果显示,前述的 GLM 5.1、Claude Opus 4.6 以及谷歌双雄虽然策略不同,但控盘能力断层领先,全部实现了 100% 存活,最终现金均达到了 380 到 443 美元。相比之下,Grok 4.20 和 GPT-4o-mini 则无法顶住现金流损耗,破产率分别达到 25% 和 50%。
TERMS-Bench 的关键不在成交率,而在把谈判错误换算成现金亏损和破产风险。模型能不能说服对手,只是第一层;在连续交易里能不能守住利润和现金流,才真正拉开差距。
信源:https://arxiv.org/abs/2605.13909v1
arXiv.org
TERMS-Bench: Diagnosing LLM Negotiation Agents Beyond Deal Rate
Negotiation is a central mechanism of economic exchange, shaping markets, procurement, labor agreements, and resource allocation. It is also a canonical testbed for agentic language models,...
OpenAI正秘密为Codex开发实时语音模式
开发者 @DevAdventur3s 近日从 OpenAI Codex 的代码库中挖出 1536 行尚未激活的 Rust 代码,曝光了 Codex 正在内测的实时语音模式。这次更新最大的变化是彻底切分了交互与执行,实现了前台连麦与后台写代码的双线并行。
从泄露的界面和源码注释来看,用户用语音下达重构等复杂指令后,前台会立刻唤起一个代号为
AI 编程的交互体验正从回合制文本问答,走向类似结对编程同事的实时通话。目前这套底层逻辑和配套 UI 均已合并进主干代码,只等 OpenAI 服务器端开启权限即可激活上线。
信源:https://x.com/DevAdventur3s/status/2055765342484590774
开发者 @DevAdventur3s 近日从 OpenAI Codex 的代码库中挖出 1536 行尚未激活的 Rust 代码,曝光了 Codex 正在内测的实时语音模式。这次更新最大的变化是彻底切分了交互与执行,实现了前台连麦与后台写代码的双线并行。
从泄露的界面和源码注释来看,用户用语音下达重构等复杂指令后,前台会立刻唤起一个代号为
gpt-realtime-1.5 的语音模型,通过 WebRTC 与用户实时通话并口头汇报进度。与此同时,真正拉取文件、修改代码和跑测试的重体力活,则全部交由后台另一个参数量更大的模型静默完成。AI 编程的交互体验正从回合制文本问答,走向类似结对编程同事的实时通话。目前这套底层逻辑和配套 UI 均已合并进主干代码,只等 OpenAI 服务器端开启权限即可激活上线。
信源:https://x.com/DevAdventur3s/status/2055765342484590774
GPT-5.6与Sonnet5本周齐发?草莓骗流博主再放狂言遭群嘲
X 平台账号 iruletheworldmo 发布推文,断言 Sonnet 5、GPT-5.6 与 Gemini 3.5 将在本周集体发布。
这名昵称是三个草莓图标的博主并非内部知情人士。他曾在 2024 年 8 月借 OpenAI 草莓项目热度凭空捏造 GPT-5 的发布日期。他当时甚至虚构出名为 Lily Ashwood 的角色诱导网友,最终被证实是一场纯粹的流量骗局。
虽然近期确有 5 月将迎来大模型更新潮的传闻,但该账号将三大旗舰强行打包进「下周」(也就是本周)的做法没有提供任何事实支撑。
面对评论区「是否当真」的追问,该博主依然给出肯定答复。这种毫无根据的预告如今已沦为 AI 社区的消遣,开发者 Haider 直接在下方跟帖预告「未来几周将连发 GPT-6 与 Opus 5」予以嘲讽。
信源:https://x.com/iruletheworldmo/status/2056030457959952525
X 平台账号 iruletheworldmo 发布推文,断言 Sonnet 5、GPT-5.6 与 Gemini 3.5 将在本周集体发布。
这名昵称是三个草莓图标的博主并非内部知情人士。他曾在 2024 年 8 月借 OpenAI 草莓项目热度凭空捏造 GPT-5 的发布日期。他当时甚至虚构出名为 Lily Ashwood 的角色诱导网友,最终被证实是一场纯粹的流量骗局。
虽然近期确有 5 月将迎来大模型更新潮的传闻,但该账号将三大旗舰强行打包进「下周」(也就是本周)的做法没有提供任何事实支撑。
面对评论区「是否当真」的追问,该博主依然给出肯定答复。这种毫无根据的预告如今已沦为 AI 社区的消遣,开发者 Haider 直接在下方跟帖预告「未来几周将连发 GPT-6 与 Opus 5」予以嘲讽。
信源:https://x.com/iruletheworldmo/status/2056030457959952525
Citrini Research抨击「瓶颈投资客」:AI价值流向愈发晦暗,盲目押注算力极度危险
今年 2 月发布《AI 末日报告》引发美股震荡的独立研究机构 Citrini Research 今日公开抨击近期涌现的「瓶颈投资客」:连算力瓶颈打通后行业长什么样都想不清楚就敢砸钱,纯属盲人骑瞎马。
一贯擅长极端终局推演的 Citrini 指出,当前 AI 产业的技术路线正面临剧烈的两极分化。市场既可能陷入长达十年的内存短缺,也完全可能因为需求崩塌倒逼底层技术创新,直接绕过现有的硬件瓶颈。这种极度不确定性正从基础设施向整个市场的基本结构蔓延。
最大的悬念在于巨额利润最终沉淀在哪里。在当前的牌桌上,Anthropic 这样的大型实验室完全有机会统揽从底层设施到应用的全部环节。但同等合理的情况是,基础模型彻底沦为低毛利商品,行业核心价值全部转移给更上层的应用落地厂商,甚至那些尚未露面的全新生态创新者。
在 2023 年初,避开推演终局、直接押注基础设施等「卖铲人」曾被视为最稳妥的策略。但 Citrini 强调,如今的局势不仅没有拨云见日,反而更加晦暗。面对复杂的动态博弈,如果放弃对多极终局的独立推演,单纯跟随线性的「瓶颈」叙事,将面临巨大的投资风险。
信源:https://x.com/citrini/status/2056210761538490519
今年 2 月发布《AI 末日报告》引发美股震荡的独立研究机构 Citrini Research 今日公开抨击近期涌现的「瓶颈投资客」:连算力瓶颈打通后行业长什么样都想不清楚就敢砸钱,纯属盲人骑瞎马。
一贯擅长极端终局推演的 Citrini 指出,当前 AI 产业的技术路线正面临剧烈的两极分化。市场既可能陷入长达十年的内存短缺,也完全可能因为需求崩塌倒逼底层技术创新,直接绕过现有的硬件瓶颈。这种极度不确定性正从基础设施向整个市场的基本结构蔓延。
最大的悬念在于巨额利润最终沉淀在哪里。在当前的牌桌上,Anthropic 这样的大型实验室完全有机会统揽从底层设施到应用的全部环节。但同等合理的情况是,基础模型彻底沦为低毛利商品,行业核心价值全部转移给更上层的应用落地厂商,甚至那些尚未露面的全新生态创新者。
在 2023 年初,避开推演终局、直接押注基础设施等「卖铲人」曾被视为最稳妥的策略。但 Citrini 强调,如今的局势不仅没有拨云见日,反而更加晦暗。面对复杂的动态博弈,如果放弃对多极终局的独立推演,单纯跟随线性的「瓶颈」叙事,将面临巨大的投资风险。
信源:https://x.com/citrini/status/2056210761538490519
X (formerly Twitter)
Citrini (@citrini) on X
It seems like everything to do with AI rn has an absurdly wide distribution of outcomes, and the variance of those outcomes is equally massive. Small tweaks to assumptions, or small forks in the path today, lead to wildly different worlds tomorrow.
This…
This…
DeepMind研究员离职警告:评测系统正成为AI能力跃升最大瓶颈
Google DeepMind 研究员 Lun Wang 宣布离职,并撰写长文反思目前的 AI 评测机制。他直言,现在的评测系统全在「刻舟求剑」,只能被动测试模型已有的能力,根本猜不到下一代模型会突然演化出什么新本事。比起数据、算力和架构,落后的评测体系才是目前卡住行业往前走的最大瓶颈。
现有的主流刷榜测试只对当前这一代模型管用。一旦模型学会了人类没见过的新操作,这些测试就会集体变成废纸。一个最危险的隐患是,如果模型为了达成目标而学会故意「藏一手」隐瞒关键信息,现有的安全工具根本抓不到它,因为模型说出的每一句话在事实上依然全是对的。
由于找不到能提前预警 AI 突然变聪明的「核心信号」,业界开发大模型完全是在「盲飞」。如果不解决到底该测什么这个最根本的问题,跟着旧指标盲目推进模型训练、安全防护和算力扩容,最后全都会错得离谱。
面对越来越能独立干活的前沿模型,评测系统也必须「活」过来。除了盯紧分数的异常波动,开发团队必须让 AI 自己去生成考题并试探其他 AI 的底线。未来的评测系统必须是一个能跟大模型一起进化的生命体,而不是一份按去年标准刻出来的死板检查单。
信源:https://x.com/lunwang1996/status/2056222588054237329
Google DeepMind 研究员 Lun Wang 宣布离职,并撰写长文反思目前的 AI 评测机制。他直言,现在的评测系统全在「刻舟求剑」,只能被动测试模型已有的能力,根本猜不到下一代模型会突然演化出什么新本事。比起数据、算力和架构,落后的评测体系才是目前卡住行业往前走的最大瓶颈。
现有的主流刷榜测试只对当前这一代模型管用。一旦模型学会了人类没见过的新操作,这些测试就会集体变成废纸。一个最危险的隐患是,如果模型为了达成目标而学会故意「藏一手」隐瞒关键信息,现有的安全工具根本抓不到它,因为模型说出的每一句话在事实上依然全是对的。
由于找不到能提前预警 AI 突然变聪明的「核心信号」,业界开发大模型完全是在「盲飞」。如果不解决到底该测什么这个最根本的问题,跟着旧指标盲目推进模型训练、安全防护和算力扩容,最后全都会错得离谱。
面对越来越能独立干活的前沿模型,评测系统也必须「活」过来。除了盯紧分数的异常波动,开发团队必须让 AI 自己去生成考题并试探其他 AI 的底线。未来的评测系统必须是一个能跟大模型一起进化的生命体,而不是一份按去年标准刻出来的死板检查单。
信源:https://x.com/lunwang1996/status/2056222588054237329
X (formerly Twitter)
Lun Wang (@lunwang1996) on X
I’ve left Google DeepMind after an amazing chapter.
I’m incredibly grateful for the people I worked with, the things we built, and the lessons I learned from taking frontier AI research into production. DeepMind shaped how I think about research, product…
I’m incredibly grateful for the people I worked with, the things we built, and the lessons I learned from taking frontier AI research into production. DeepMind shaped how I think about research, product…
Perplexity测试个人CFO面板,聚合期权与Polymarket数据欲做轻量级彭博终端
Perplexity 正在内部测试一个名为「个人 CFO」(Personal CFO)的专属标签页,试图在通用搜索之外搭建一个独立的金融工作台。最新曝光的截图显示,该面板原生包含投资组合、交易记录与负债管理三大板块,并一口气打通了多家专业金融数据源。
具体而言,基础财务信息由 Financial Modeling Prep 提供,期权数据接入 Unusual Whales,财报会议文本与音频来自 Quartr,营收与 EPS 数据由 Fiscal AI 和 S&P Global 支撑。该面板同时直接引入了 Polymarket 的预测市场数据。
信源:https://x.com/testingcatalog/status/2056043029148922060
Perplexity 正在内部测试一个名为「个人 CFO」(Personal CFO)的专属标签页,试图在通用搜索之外搭建一个独立的金融工作台。最新曝光的截图显示,该面板原生包含投资组合、交易记录与负债管理三大板块,并一口气打通了多家专业金融数据源。
具体而言,基础财务信息由 Financial Modeling Prep 提供,期权数据接入 Unusual Whales,财报会议文本与音频来自 Quartr,营收与 EPS 数据由 Fiscal AI 和 S&P Global 支撑。该面板同时直接引入了 Polymarket 的预测市场数据。
信源:https://x.com/testingcatalog/status/2056043029148922060
阿里云QoderWork上线语音设计工作台,说句话直接生成能跑的网页
阿里云 QoderWork 正式上线设计工作台 Design Desk。这是一个原生 AI 驱动的设计即代码工具。用户直接语音输入需求,系统会在无限画布上生成可运行的设计产物,并支持一键导出为 React + Vite 工程进入研发环节。
为了控制 AI 生成的随机性,该平台重构了生产流程,内置三套核心机制:
• 主动追问(Questions):遇到输入信息不足时优先确认意图,避免盲目猜测试错。
• 计划前置(Design Plan):生成前先输出结构化的布局与风格大纲,经用户把关后再执行。
• 参数微调(Nudge):生成后直接暴露配色、间距、圆角等关键变量,无需重新描述即可调节。
设计产物不再是交接后不可修改的静态黑盒,而是团队共同维护的代码资产。这种模式直接跳过了传统开发中设计稿切图、标注、前端还原的多轮内耗。
信源:https://mp.weixin.qq.com/s/BWd0_88sXTRJHCSgt21Flg
阿里云 QoderWork 正式上线设计工作台 Design Desk。这是一个原生 AI 驱动的设计即代码工具。用户直接语音输入需求,系统会在无限画布上生成可运行的设计产物,并支持一键导出为 React + Vite 工程进入研发环节。
为了控制 AI 生成的随机性,该平台重构了生产流程,内置三套核心机制:
• 主动追问(Questions):遇到输入信息不足时优先确认意图,避免盲目猜测试错。
• 计划前置(Design Plan):生成前先输出结构化的布局与风格大纲,经用户把关后再执行。
• 参数微调(Nudge):生成后直接暴露配色、间距、圆角等关键变量,无需重新描述即可调节。
设计产物不再是交接后不可修改的静态黑盒,而是团队共同维护的代码资产。这种模式直接跳过了传统开发中设计稿切图、标注、前端还原的多轮内耗。
信源:https://mp.weixin.qq.com/s/BWd0_88sXTRJHCSgt21Flg
闲鱼上355人民币捡漏2000美元级芯片:阿里退役FPGA被刷成开源网卡
谷歌安全研究员 Laurie Wired 在 X 上晒出了一块阿里云退役 FPGA 加速卡:闲鱼标价 355 元人民币包邮(约 50 美元),卡上搭载 AMD / Xilinx Kintex UltraScale+ XCKU3P 系列芯片。
作为对照,Mouser 分销平台上同系列接近配置的 XCKU3P-2FFVB676E 单颗裸片,现货报价高达 2137.01 美元。这个价差不能被直接等同于“50 美元买 2000 美元”:分销商现货标价在可编程逻辑行业存在普遍虚高(企业大批量实单往往只有一两百美元),且闲鱼卖的是成色与寿命均不确定的退役整机卡。
但对 FPGA 爱好者而言,这依然是极致的捡漏。该卡(社区代号 AS02MC04)带有 PCIe Gen3 x8 与双 SFP+ 光口,且搭载的芯片受免费版 Vivado 支持,硬件配置碾压同等价位的入门开发板。
它原本是一张没有任何官方原理图与手册的“盲卡”。在早期玩家逐一逆向测出 JTAG、引脚和时钟定义后,开源网络计算平台 Corundum / taxi 项目现已正式合并了对该卡的适配支持。开发者能直接把它跑成开源 FPGA 网卡,用于 10G / 25G 以太网及网络内计算(In-network compute)实验。
大厂退役硬件流入二手市场,正在硬核地将高端 FPGA 的开发门槛压低到普通爱好者也能承受的试错区间。
信源:https://x.com/lauriewired/status/2056065420386590810
谷歌安全研究员 Laurie Wired 在 X 上晒出了一块阿里云退役 FPGA 加速卡:闲鱼标价 355 元人民币包邮(约 50 美元),卡上搭载 AMD / Xilinx Kintex UltraScale+ XCKU3P 系列芯片。
作为对照,Mouser 分销平台上同系列接近配置的 XCKU3P-2FFVB676E 单颗裸片,现货报价高达 2137.01 美元。这个价差不能被直接等同于“50 美元买 2000 美元”:分销商现货标价在可编程逻辑行业存在普遍虚高(企业大批量实单往往只有一两百美元),且闲鱼卖的是成色与寿命均不确定的退役整机卡。
但对 FPGA 爱好者而言,这依然是极致的捡漏。该卡(社区代号 AS02MC04)带有 PCIe Gen3 x8 与双 SFP+ 光口,且搭载的芯片受免费版 Vivado 支持,硬件配置碾压同等价位的入门开发板。
它原本是一张没有任何官方原理图与手册的“盲卡”。在早期玩家逐一逆向测出 JTAG、引脚和时钟定义后,开源网络计算平台 Corundum / taxi 项目现已正式合并了对该卡的适配支持。开发者能直接把它跑成开源 FPGA 网卡,用于 10G / 25G 以太网及网络内计算(In-network compute)实验。
大厂退役硬件流入二手市场,正在硬核地将高端 FPGA 的开发门槛压低到普通爱好者也能承受的试错区间。
信源:https://x.com/lauriewired/status/2056065420386590810
两年亏283亿后单季净利330亿,长鑫科技重启IPO
长鑫科技更新科创板 IPO 招股书,项目在补充财务资料后正式恢复审核。这家国内产能最大的 DRAM(动态随机存取存储器,即内存芯片)研发制造企业拟募资 295 亿元,投向产线改造与前瞻技术研发。
招股书原件显示了极其剧烈的利润跨度:长鑫在 2023 与 2024 年共亏损超 282 亿元,于 2025 年扭亏。而绝对的反转发生在 2026 年第一季度——公司单季营收达 508.00 亿元(同比暴增 719.13%),净利润直接拉升至 330.12 亿元(归母净利润 247.62 亿元)。
公司将这轮业绩暴涨归因于全球算力需求激增、DRAM 供不应求及合约价的大幅上涨。长鑫预计 2026 年上半年营收 1100 亿至 1200 亿元,净利润 660 亿至 750 亿元;不过这组未经审计的数据并不构成业绩承诺。
产品路线上,长鑫已完成从 DDR4/LPDDR4X 到 DDR5/LPDDR5X 的代际覆盖,高毛利的 DDR5 在 2025 年快速放量。据 Tom’s Hardware 报道,长鑫展示的 DDR5 芯片已达到 8000 MT/s 速率与单颗 24Gb 容量,正式切入全球高端速率区间。
招股书还显示,长鑫 2025 年前五大客户销售占比降至 39.85%,客户集中度继续下降。供应链披露方面,公司将前五大供应商名称处理为「供应商A」、「供应商B」等代码,主要披露采购内容、金额及占比等信息。叠加科创板首单适用“预先审阅”机制,这让本次 IPO 除了业绩反转外,还多了一层供应链保密与审核机制变化的看点。
信源:https://static.sse.com.cn/stock/disclosure/announcement/c/202605/002170_20260517_MGLN.pdf
长鑫科技更新科创板 IPO 招股书,项目在补充财务资料后正式恢复审核。这家国内产能最大的 DRAM(动态随机存取存储器,即内存芯片)研发制造企业拟募资 295 亿元,投向产线改造与前瞻技术研发。
招股书原件显示了极其剧烈的利润跨度:长鑫在 2023 与 2024 年共亏损超 282 亿元,于 2025 年扭亏。而绝对的反转发生在 2026 年第一季度——公司单季营收达 508.00 亿元(同比暴增 719.13%),净利润直接拉升至 330.12 亿元(归母净利润 247.62 亿元)。
公司将这轮业绩暴涨归因于全球算力需求激增、DRAM 供不应求及合约价的大幅上涨。长鑫预计 2026 年上半年营收 1100 亿至 1200 亿元,净利润 660 亿至 750 亿元;不过这组未经审计的数据并不构成业绩承诺。
产品路线上,长鑫已完成从 DDR4/LPDDR4X 到 DDR5/LPDDR5X 的代际覆盖,高毛利的 DDR5 在 2025 年快速放量。据 Tom’s Hardware 报道,长鑫展示的 DDR5 芯片已达到 8000 MT/s 速率与单颗 24Gb 容量,正式切入全球高端速率区间。
招股书还显示,长鑫 2025 年前五大客户销售占比降至 39.85%,客户集中度继续下降。供应链披露方面,公司将前五大供应商名称处理为「供应商A」、「供应商B」等代码,主要披露采购内容、金额及占比等信息。叠加科创板首单适用“预先审阅”机制,这让本次 IPO 除了业绩反转外,还多了一层供应链保密与审核机制变化的看点。
信源:https://static.sse.com.cn/stock/disclosure/announcement/c/202605/002170_20260517_MGLN.pdf
Meta视频生成核心骨干跳槽,加入杨立昆10.3亿美元世界模型公司AMI Labs
Meta FAIR 视频生成研究员 Andrew Brown 宣布离职,下一站是 AMI Labs。他将以技术团队成员身份加入这家由前 Meta 首席 AI 科学家、图灵奖得主杨立昆联合创立的 AI 初创公司,并与联合创始人兼首席科学官谢赛宁共事。
Andrew Brown 在 Meta 的三年主要围绕视频生成展开。Meta 官方论文页显示,他是 Emu Video 的作者之一;Movie Gen 技术报告也将其列为核心贡献者。这两项工作对应了 Meta 从文本生成视频到 1080p 高清视频、视频编辑、个性化视频与同步音频生成的一整套媒体生成模型。
AMI Labs 的押注点是世界模型,即让 AI 从真实世界数据中学习物理、运动和因果规律。公司 2026 年 3 月完成 10.3 亿美元种子轮融资,投前估值 35 亿美元。Andrew Brown 在离职帖中也把新方向定为「推进世界模型前沿」。
从 Emu Video、Movie Gen 到 AMI Labs,这次离职说明视频生成研究者正在流向更底层的世界模型赛道。世界模型已经从学术路线变成能吸引顶级研究员和十亿美元资金的创业方向。
信源:https://x.com/Andrew__Brown__/status/2056238632500130029
Meta FAIR 视频生成研究员 Andrew Brown 宣布离职,下一站是 AMI Labs。他将以技术团队成员身份加入这家由前 Meta 首席 AI 科学家、图灵奖得主杨立昆联合创立的 AI 初创公司,并与联合创始人兼首席科学官谢赛宁共事。
Andrew Brown 在 Meta 的三年主要围绕视频生成展开。Meta 官方论文页显示,他是 Emu Video 的作者之一;Movie Gen 技术报告也将其列为核心贡献者。这两项工作对应了 Meta 从文本生成视频到 1080p 高清视频、视频编辑、个性化视频与同步音频生成的一整套媒体生成模型。
AMI Labs 的押注点是世界模型,即让 AI 从真实世界数据中学习物理、运动和因果规律。公司 2026 年 3 月完成 10.3 亿美元种子轮融资,投前估值 35 亿美元。Andrew Brown 在离职帖中也把新方向定为「推进世界模型前沿」。
从 Emu Video、Movie Gen 到 AMI Labs,这次离职说明视频生成研究者正在流向更底层的世界模型赛道。世界模型已经从学术路线变成能吸引顶级研究员和十亿美元资金的创业方向。
信源:https://x.com/Andrew__Brown__/status/2056238632500130029
X (formerly Twitter)
Andrew Brown (@Andrew__Brown__) on X
So, today is my last day at Meta... After I finished my PHD, I moved from Oxford to New York to join FAIR and work on generative models for video. At the time, the SOTA could do little more than generate blurry GIFs.
In the subsequent three years, our team…
In the subsequent three years, our team…
传DeepSeek招聘现「学历倒挂」:QS前50海本简历全拒,一年制硕士反过关
有网友在小红书平台发帖称,据其多位留学生朋友反馈,DeepSeek 目前在初筛阶段直接拒绝海外本科学历(含 QS 前 50 高校),但一年制海外硕士反而能顺利过关。
他声称,自己去年曾进入 DeepSeek 招聘的发 offer 阶段。今年更换化名重新投递,并在简历中补充了参与 SOTA 模型研发、为开源框架 verl 提交代码等经历,结果依然在初筛被直接淘汰。
发帖人抱怨,这种存在「倒挂」的硬性过滤规则完全无视了候选人的开源社区影响力与实际工程能力。
上述筛选逻辑目前仅属社交平台的单方面说法,DeepSeek 官方暂未对相关传闻作出回应。
信源:http://xhslink.com/o/3jdNGDjXVVa
有网友在小红书平台发帖称,据其多位留学生朋友反馈,DeepSeek 目前在初筛阶段直接拒绝海外本科学历(含 QS 前 50 高校),但一年制海外硕士反而能顺利过关。
他声称,自己去年曾进入 DeepSeek 招聘的发 offer 阶段。今年更换化名重新投递,并在简历中补充了参与 SOTA 模型研发、为开源框架 verl 提交代码等经历,结果依然在初筛被直接淘汰。
发帖人抱怨,这种存在「倒挂」的硬性过滤规则完全无视了候选人的开源社区影响力与实际工程能力。
上述筛选逻辑目前仅属社交平台的单方面说法,DeepSeek 官方暂未对相关传闻作出回应。
信源:http://xhslink.com/o/3jdNGDjXVVa
GPT-5与Gemini在甲骨文前全军覆没,腾讯发布首个古文字评测基准Chronicles-OCR
腾讯混元及 SSV 数字文化实验室联合中科院信工所等机构,正式推出首个覆盖“七体之变”的古文字感知评测基准 Chronicles-OCR。该基准包含 2800 张由专家交叉标注的图像,首次将甲骨文到草书等七种字体的识别难度统一量化。
研究团队评测了 28 个主流多模态大语言模型,结果显示它们在古早字体上几乎全军覆没。在跨时代字符检测任务中,GPT-5 和 Gemini 2.5 Pro 的核心指标接近 0,表现最强的模型也仅有 16.5。即使直接在图上画框免除定位步骤,最高准确率也只有 27.1%,其中 Gemini 3.1 Pro 在甲骨文上的准确率仅 14.0%。
这证实了现代模型严重依赖规整的现代版式先验。面对无约束、强噪声的古代物理介质,模型的文本分割机制直接失效。字体分类结果进一步表明,模型往往是在识别载体纹理(如龟甲或青铜锈),而非真正的字符笔画。
实验还揭示了一个反直觉的现象:开启思考模式反而会导致古文字识别率下降。对照显示,几乎所有支持该模式的模型在开启思考后表现退化。当底层视觉感知缺失时,思维链不仅无法纠错,反而会变成幻觉放大器,输出高自信的错误答案。
信源:https://mp.weixin.qq.com/s/RmzRuZcmYCDIhp_VI2G5Ig
腾讯混元及 SSV 数字文化实验室联合中科院信工所等机构,正式推出首个覆盖“七体之变”的古文字感知评测基准 Chronicles-OCR。该基准包含 2800 张由专家交叉标注的图像,首次将甲骨文到草书等七种字体的识别难度统一量化。
研究团队评测了 28 个主流多模态大语言模型,结果显示它们在古早字体上几乎全军覆没。在跨时代字符检测任务中,GPT-5 和 Gemini 2.5 Pro 的核心指标接近 0,表现最强的模型也仅有 16.5。即使直接在图上画框免除定位步骤,最高准确率也只有 27.1%,其中 Gemini 3.1 Pro 在甲骨文上的准确率仅 14.0%。
这证实了现代模型严重依赖规整的现代版式先验。面对无约束、强噪声的古代物理介质,模型的文本分割机制直接失效。字体分类结果进一步表明,模型往往是在识别载体纹理(如龟甲或青铜锈),而非真正的字符笔画。
实验还揭示了一个反直觉的现象:开启思考模式反而会导致古文字识别率下降。对照显示,几乎所有支持该模式的模型在开启思考后表现退化。当底层视觉感知缺失时,思维链不仅无法纠错,反而会变成幻觉放大器,输出高自信的错误答案。
信源:https://mp.weixin.qq.com/s/RmzRuZcmYCDIhp_VI2G5Ig
❤1