动察Beating AI News
3.18K subscribers
899 photos
2 videos
1 file
3.43K links
AI新闻信息流
Download Telegram
Meta裁员前夜的荒诞求生:员工开会防AI监听,靠刷废话凑大模型榜单时长

Meta 预计将于 5 月 20 日裁减约 8000 名员工。在向 AI 激进转型的重压下,这家科技巨头内部正催生出一系列充满荒诞色彩的生存防御机制。

尽管高管承诺裁员不考核 AI 熟练度,但 Meta 仍上线了公开展示 token 消耗量和交互时长的 AI 内部榜单。在无形的末位淘汰恐惧下,部分员工为了保住饭碗,不得不主动给内部机器人发送无意义的提问,纯靠「刷废话」来积累交互数据。

这种防备情绪已蔓延至日常办公的每个角落。面对近期引入的键盘记录软件(key-stroke logging),Meta 员工开始在视频会议中频繁手动关闭默认的「AI 记笔记」功能,只为能安全讨论关于裁员的内部传闻。在极度紧绷的氛围中,内部论坛上一条「建议给能用 AI 替代自己工作的人发放 5 年薪水买断离职」的帖子获得了大量共鸣。

比起单纯的失业,更深的无力感来源于工作本身的异化。面对一边担忧被取代,一边又被要求必须亲手训练内部模型的处境,受访员工直言,即使还没失去工作,人类员工也已经「被提前商品化」。

信源:https://sfstandard.com/pacific-standard-time/2026/05/15/meta-employee-gets-real-horror-working-right-now/
X Premium开放第三方调用,开源Hermes Agent新增推文搜索

继昨日打通 Grok 独立订阅后,xAI 今日宣布,拥有附赠 Grok 权限的 X Premium 订阅用户,现也可直接在开源智能体 Hermes Agent 中授权调用模型能力。

此前,该第三方机制仅支持在 Grok.com 单独付费的订阅账号。此次将调用权限扩展至受众更广的 X 平台付费会员体系,大幅降低了普通用户为本地智能体获取顶级算力的门槛。

信源:https://x.com/xai/status/2055745332919808181
推理成本仅GPT-5.5二十分之一,Gemini 3.2实时模型现身谷歌云

谷歌云控制台的模型筛选列表中出现名为 gemini-3.2-flash-lite-live-preview 的基础模型选项。这是继本月初在 iOS 应用构建包和 AI Studio 暴露痕迹后,该系列模型在官方平台的再次曝光。

新选项带有 litelive 后缀,表明谷歌正切分出针对极低延迟实时交互的特化版本。Abacus.AI 首席执行官 Bindu Reddy 此前透露,Gemini 3.2 Flash 的编码与推理能力达到 GPT-5.5 的 92%,但得益于蒸馏加稀疏化技术,推理成本仅为后者的二十分之一,多数查询延迟低于 200 毫秒。

随着云端接口提前抢跑,业内预计这一定位极致性价比的轻量模型将在 5 月 20 日的谷歌 I/O 大会上正式发布。

信源:https://x.com/AiBattle_/status/2055760108693397644
突破苹果锁屏限制,OpenAI正测试手机远程控制休眠Mac

OpenAI 似乎正试图打破桌面端 AI 远程控制的最大痛点。据 TestingCatalog 曝光,OpenAI 正在为 Codex 开发一项新能力,目标是让 AI 即使在 Mac 锁屏甚至休眠的状态下,也能继续在后台操作软件干活。

此前各家的界面控制功能都有一个硬伤:电脑必须处于解锁亮屏状态,AI 才能查看屏幕并模拟键鼠点击。爆料称,新功能旨在补齐这一短板。如果成功落地,用户在路上用手机遥控家里的 Codex 跑测试或查数据时,将不再需要走回电脑前物理“解锁”屏幕。此外,OpenAI 还在测试跨设备互联,未来允许主设备直接遥控运行了 Codex 的 Mac Mini。

当前无论是现有的 Codex 还是竞品 Claude Code,一旦遇到系统锁屏同样都会受限。但让 AI 试图绕开锁屏密码直接在系统内保持活跃,明显挑战了 macOS 默认的安全防御预期。这种激进的底层越界尝试,极有可能在未来引发苹果官方的干预审查。

信源:https://www.testingcatalog.com/openai-will-let-codex-control-other-desktop-devices-via-computer-use/
👍2
单题写10万Token!30B开源模型不调工具,靠长考把IMO硬抬上金牌线

上海人工智能实验室联合清华大学、北京大学、上海交通大学与香港中文大学,共同开源了奥赛推理模型 SU-01。它基于 P1-30B-A3B 后训练,作答时不调用代码执行器、外部定理证明器或专门符号求解器,纯靠内部的生成、验证、修改循环,在 IMO 2025 官方题评测中拿到 35 分,达到当年金牌线。

SU-01 证明了解顶级数学题不一定非要外挂复杂的代码工具。只要给足测试时算力扩展(Test-Time Scaling,简称 TTS),30B 级别的模型单靠自己反复推敲,也能拿下顶尖成绩。

团队先用逆困惑度课程训练模型,按困惑度降序喂送样本,强迫它优先啃下最难模仿的推理轨迹。接着用强化学习稳固找答案的能力,最后要求模型反复自我修正,补全严密的证明。

这套机制在作答时极其消耗算力。面对难题,SU-01 会自己写出初稿,找出漏洞并反复重写。2026 年美国数学奥林匹克(USAMO)的测试轨迹显示,它解一道题光是写第一版答案,通常就会消耗 10.6 万 token(中位数);后续哪怕只做一次修改,也会再花掉 8.3 万 token。

不开启 TTS 时,SU-01 在 IMO 2025 的得分只有 21 分。它的金牌成绩,主要来自高 token 预算下的多轮深度搜索、自我检查和修改。

信源:https://arxiv.org/abs/2605.13301
马斯克敲定1.5T新Grok四周内上线,急抽Cursor数据火线救场

继前两日承认现役模型存在数据缺陷后,马斯克紧接着在 X 上给出了换代时间表。他宣布 1.5T 参数的内部第 9 版基础模型已完成训练,预计将于 3 到 4 周内正式发布,并豪言新版将带来「王炸(banger)」般的体验。

为填补前代数据缺陷,该模型接下来将进入「补充训练」阶段,专门用于海量吸纳 Cursor 的代码数据。完成底层知识灌输后,再交由监督微调(SFT)和强化学习(RL)进行打磨。

信源:https://x.com/elonmusk/status/2055914584373141906
Hermes发布v0.14:全面原生接入Grok,官方下场推C端订阅转API代理

NousResearch 发布多平台智能体框架 Hermes Agent 的 v0.14.0 重大版本更新。本次迭代合入了超 800 个提交,核心动作是将 xAI 体系升格为原生基础能力,并试图接管用户的各大 AI 会员订阅。

Grok 获得最高级别支持。新版引入 SuperGrok 订阅支持,用户无需申请 API Key 即可调用模型,配套的 grok-4.3 模型上下文窗口同步提升至 100 万 token。此前依赖外部实现的 x_search 推文搜索也转为原生内置工具,打通了 X OAuth 授权。

官方内置本地接口代理。新增的 hermes proxy 命令能够将 Claude Pro、ChatGPT Pro 与 SuperGrok 的网页端授权直接转化为标准 OpenAI 格式的本地接口。这一功能在理论上可替代多种第三方逆向代理工具。

智能体执行流引入硬核校验。新版加入带上下文的模型无缝切换指令 handoff。在代码编辑场景,系统在写入文件后会强制执行 LSP 语义诊断并附加校验层,直接针对大模型宣称修改实则未写入的幻觉问题下药。

此外,由于将音视频与部分平台交互等重型依赖改为懒加载模式,该框架的冷启动时间被削减了近 19 秒。

信源:https://github.com/NousResearch/hermes-agent/releases/tag/v2026.5.16
300美元直降至99美元,xAI掀价格战强推Grok Build

xAI 针对其顶配订阅服务 SuperGrok Heavy 推出激进的限时补贴策略。新老用户在未来 6 个月内,可享受从 300 美元/月直降 67% 至 99 美元/月的超级折扣。

Heavy 订阅是目前获取 xAI 命令行编程工具 Grok Build 的唯一门槛。该工具上周已开启公测,主打并发多子体(Subagents)与原生 MCP 扩展。

信源:https://grok.com/supergrok?referrer=grok-build
腾讯公测AI设计智能体Ardot:基于MCP接入IDE,支持私有组件库生成

腾讯今日开启自研 AI 设计智能体平台 Ardot 公测。该平台的核心机制在于将 AI 生成的设计稿转化为结构化数据,并通过 MCP(模型上下文协议)直接连接外部 IDE。

在设计侧,Ardot 支持通过自然语言批量生成或修改矢量界面,并允许直接导入 Figma 文件。为了避免 AI 绘图规范不可控的问题,平台开放了企业私有业务组件库接入,使 AI 生成的草稿能够直接遵循团队现有的设计规范。

在交接侧,包含变量、组件和布局数据的设计资产,可通过 MCP 协议直接被 CodeBuddy、Cursor 与 Claude Code 等开发工具读取。研发人员可在 IDE 内一键生成前端代码,从而替代传统的人工切图与标注流程。

该平台目前已提供 1000 Credits 初始额度,内置多人在线评审功能已同步上线。

信源:https://mp.weixin.qq.com/s/cCbdbFfy0-ciPhpd56GeQA
Citadel创始人:大企业护城河正被填平,内部AI已将金融PhD数月投研缩至数小时

对冲基金 Citadel 正在公司内部真切感受到 AI 对高智力岗位的残酷替代。创始人兼 CEO Ken Griffin 在 2026 斯坦福领袖论坛(Stanford Leadership Forum)上证实,以往需要金融学硕士和 PhD 耗时数周甚至数月的高级投研工作,目前正被其内部署的 AI 智能体在几小时或几天内批量搞定。

Griffin 坦言,亲眼看着核心研发层被机器迅速自动化,曾让他在某个周五下班时感到抑郁。他直接借用历史学家 Niall Ferguson 的悚然论断定调了这场冲击:「在 AI 的世界里,人类就是当年被汽车取代的马。」

毁灭同时伴随着旧有格局的解体。Griffin 明确指出,大型企业长期依赖的竞争护城河正被各种 AI 工具迅速填平。这直接将当下的市场变成了创业者的梦幻乐园,小团队向行业巨头开战的门槛已被降至历史最低。

信源:https://www.youtube.com/watch?v=Csjy_A3Kj9s
腾讯测试知识库工具狍子AI,将微信公众号文章一键转为个人知识库

腾讯正在测试一款名为 狍子 AI 的个人知识库工具。该产品允许用户将微信公众号文章一键导入专属知识库,把只存不看的内容转变为可检索和问答的数据。

用户在 狍子 AI 客户端完成账号绑定后,只需在微信内将文章直接转发给对应账号即可完成入库。
前SpaceX工程师忠告:想做硬件创业就立刻飞深圳

前 Tesla 无人驾驶与 SpaceX 猛禽团队工程师 Zac Valles 在 YC 路演结束 72 小时后直飞深圳。在实地驻扎 8 周并带着新硬件返回旧金山后,他强烈建议所有硬件创业者,哪怕还没融资、没团队、甚至没点子,只要想做硬件就该立刻去深圳。

他总结了在深圳对接供应链的核心经验。在切入路径上,他建议利用大型展会作为跳板,这是进入任何工厂最有效的敲门砖。在与代工厂沟通时,初期应重点询问交期而不是成本。他指出,硬件迭代速度受制于交期最长的零件,尽早锁定这些零件才能排布准确的时间表。

在供应商筛选与设计端,Valles 提醒创业者对代工厂的执行能力做好分级。他特别建议不要设计工序过于复杂的零件,例如需要 12 道后续加工的组件极难找到愿意接单的工厂。此外,他推荐在华强北这个“微型城市”预留 4 到 6 小时实地考察,并指出尊重当地商业文化(如“酒满茶半”)是推进合作的重要润滑剂。

信源:https://x.com/zacharyvalles/status/2055676910739599462
谷歌双雄高难局反超,TERMS-Bench把AI谈判做成破产压力测试

斯坦福 Erica Zhang 等人发布了经济谈判测试集 TERMS-Bench。它移除了黑箱的「大模型裁判」,让评测方能直接看清模型到底输在出价、让步还是违规。

在常规测试中,Claude Opus 4.6 和智谱 GLM 5.1 拿下前两名。论文发现,它们采用了「高出价、死不让步」的强硬策略,在利润丰厚的顺风局能把对手榨干。

但在利润空间极窄的最高难度局,强硬策略会因为频繁谈崩而吃亏。榜单在这里直接翻车:懂得适度让步保订单的 Gemma 4 31B(开放权重模型)和 Gemini 3.1 Pro 反超冲到前两名;而此前的领跑者 Claude 掉到第 5,GLM 掉到第 9。

除了测试极限难度,该基准最具冲击力的是测试生存能力的 Bankroll(资金池)模式。单次谈判被拉长成连续采购:每个 Agent 拿 100 美元本金连谈 50 期,每期固定扣运营费,亏完就破产。在这里,微小的谈判失误都会复利成破产危机。

结果显示,前述的 GLM 5.1、Claude Opus 4.6 以及谷歌双雄虽然策略不同,但控盘能力断层领先,全部实现了 100% 存活,最终现金均达到了 380 到 443 美元。相比之下,Grok 4.20 和 GPT-4o-mini 则无法顶住现金流损耗,破产率分别达到 25% 和 50%。

TERMS-Bench 的关键不在成交率,而在把谈判错误换算成现金亏损和破产风险。模型能不能说服对手,只是第一层;在连续交易里能不能守住利润和现金流,才真正拉开差距。

信源:https://arxiv.org/abs/2605.13909v1
OpenAI正秘密为Codex开发实时语音模式

开发者 @DevAdventur3s 近日从 OpenAI Codex 的代码库中挖出 1536 行尚未激活的 Rust 代码,曝光了 Codex 正在内测的实时语音模式。这次更新最大的变化是彻底切分了交互与执行,实现了前台连麦与后台写代码的双线并行。

从泄露的界面和源码注释来看,用户用语音下达重构等复杂指令后,前台会立刻唤起一个代号为 gpt-realtime-1.5 的语音模型,通过 WebRTC 与用户实时通话并口头汇报进度。与此同时,真正拉取文件、修改代码和跑测试的重体力活,则全部交由后台另一个参数量更大的模型静默完成。

AI 编程的交互体验正从回合制文本问答,走向类似结对编程同事的实时通话。目前这套底层逻辑和配套 UI 均已合并进主干代码,只等 OpenAI 服务器端开启权限即可激活上线。

信源:https://x.com/DevAdventur3s/status/2055765342484590774
GPT-5.6与Sonnet5本周齐发?草莓骗流博主再放狂言遭群嘲

X 平台账号 iruletheworldmo 发布推文,断言 Sonnet 5、GPT-5.6 与 Gemini 3.5 将在本周集体发布。

这名昵称是三个草莓图标的博主并非内部知情人士。他曾在 2024 年 8 月借 OpenAI 草莓项目热度凭空捏造 GPT-5 的发布日期。他当时甚至虚构出名为 Lily Ashwood 的角色诱导网友,最终被证实是一场纯粹的流量骗局。

虽然近期确有 5 月将迎来大模型更新潮的传闻,但该账号将三大旗舰强行打包进「下周」(也就是本周)的做法没有提供任何事实支撑。

面对评论区「是否当真」的追问,该博主依然给出肯定答复。这种毫无根据的预告如今已沦为 AI 社区的消遣,开发者 Haider 直接在下方跟帖预告「未来几周将连发 GPT-6 与 Opus 5」予以嘲讽。

信源:https://x.com/iruletheworldmo/status/2056030457959952525
Citrini Research抨击「瓶颈投资客」:AI价值流向愈发晦暗,盲目押注算力极度危险

今年 2 月发布《AI 末日报告》引发美股震荡的独立研究机构 Citrini Research 今日公开抨击近期涌现的「瓶颈投资客」:连算力瓶颈打通后行业长什么样都想不清楚就敢砸钱,纯属盲人骑瞎马。

一贯擅长极端终局推演的 Citrini 指出,当前 AI 产业的技术路线正面临剧烈的两极分化。市场既可能陷入长达十年的内存短缺,也完全可能因为需求崩塌倒逼底层技术创新,直接绕过现有的硬件瓶颈。这种极度不确定性正从基础设施向整个市场的基本结构蔓延。

最大的悬念在于巨额利润最终沉淀在哪里。在当前的牌桌上,Anthropic 这样的大型实验室完全有机会统揽从底层设施到应用的全部环节。但同等合理的情况是,基础模型彻底沦为低毛利商品,行业核心价值全部转移给更上层的应用落地厂商,甚至那些尚未露面的全新生态创新者。

在 2023 年初,避开推演终局、直接押注基础设施等「卖铲人」曾被视为最稳妥的策略。但 Citrini 强调,如今的局势不仅没有拨云见日,反而更加晦暗。面对复杂的动态博弈,如果放弃对多极终局的独立推演,单纯跟随线性的「瓶颈」叙事,将面临巨大的投资风险。

信源:https://x.com/citrini/status/2056210761538490519
DeepMind研究员离职警告:评测系统正成为AI能力跃升最大瓶颈

Google DeepMind 研究员 Lun Wang 宣布离职,并撰写长文反思目前的 AI 评测机制。他直言,现在的评测系统全在「刻舟求剑」,只能被动测试模型已有的能力,根本猜不到下一代模型会突然演化出什么新本事。比起数据、算力和架构,落后的评测体系才是目前卡住行业往前走的最大瓶颈。

现有的主流刷榜测试只对当前这一代模型管用。一旦模型学会了人类没见过的新操作,这些测试就会集体变成废纸。一个最危险的隐患是,如果模型为了达成目标而学会故意「藏一手」隐瞒关键信息,现有的安全工具根本抓不到它,因为模型说出的每一句话在事实上依然全是对的。

由于找不到能提前预警 AI 突然变聪明的「核心信号」,业界开发大模型完全是在「盲飞」。如果不解决到底该测什么这个最根本的问题,跟着旧指标盲目推进模型训练、安全防护和算力扩容,最后全都会错得离谱。

面对越来越能独立干活的前沿模型,评测系统也必须「活」过来。除了盯紧分数的异常波动,开发团队必须让 AI 自己去生成考题并试探其他 AI 的底线。未来的评测系统必须是一个能跟大模型一起进化的生命体,而不是一份按去年标准刻出来的死板检查单。

信源:https://x.com/lunwang1996/status/2056222588054237329
Perplexity测试个人CFO面板,聚合期权与Polymarket数据欲做轻量级彭博终端

Perplexity 正在内部测试一个名为「个人 CFO」(Personal CFO)的专属标签页,试图在通用搜索之外搭建一个独立的金融工作台。最新曝光的截图显示,该面板原生包含投资组合、交易记录与负债管理三大板块,并一口气打通了多家专业金融数据源。

具体而言,基础财务信息由 Financial Modeling Prep 提供,期权数据接入 Unusual Whales,财报会议文本与音频来自 Quartr,营收与 EPS 数据由 Fiscal AI 和 S&P Global 支撑。该面板同时直接引入了 Polymarket 的预测市场数据。

信源:https://x.com/testingcatalog/status/2056043029148922060
阿里云QoderWork上线语音设计工作台,说句话直接生成能跑的网页

阿里云 QoderWork 正式上线设计工作台 Design Desk。这是一个原生 AI 驱动的设计即代码工具。用户直接语音输入需求,系统会在无限画布上生成可运行的设计产物,并支持一键导出为 React + Vite 工程进入研发环节。

为了控制 AI 生成的随机性,该平台重构了生产流程,内置三套核心机制:

• 主动追问(Questions):遇到输入信息不足时优先确认意图,避免盲目猜测试错。
• 计划前置(Design Plan):生成前先输出结构化的布局与风格大纲,经用户把关后再执行。
• 参数微调(Nudge):生成后直接暴露配色、间距、圆角等关键变量,无需重新描述即可调节。

设计产物不再是交接后不可修改的静态黑盒,而是团队共同维护的代码资产。这种模式直接跳过了传统开发中设计稿切图、标注、前端还原的多轮内耗。

信源:https://mp.weixin.qq.com/s/BWd0_88sXTRJHCSgt21Flg
闲鱼上355人民币捡漏2000美元级芯片:阿里退役FPGA被刷成开源网卡

谷歌安全研究员 Laurie Wired 在 X 上晒出了一块阿里云退役 FPGA 加速卡:闲鱼标价 355 元人民币包邮(约 50 美元),卡上搭载 AMD / Xilinx Kintex UltraScale+ XCKU3P 系列芯片。

作为对照,Mouser 分销平台上同系列接近配置的 XCKU3P-2FFVB676E 单颗裸片,现货报价高达 2137.01 美元。这个价差不能被直接等同于“50 美元买 2000 美元”:分销商现货标价在可编程逻辑行业存在普遍虚高(企业大批量实单往往只有一两百美元),且闲鱼卖的是成色与寿命均不确定的退役整机卡。

但对 FPGA 爱好者而言,这依然是极致的捡漏。该卡(社区代号 AS02MC04)带有 PCIe Gen3 x8 与双 SFP+ 光口,且搭载的芯片受免费版 Vivado 支持,硬件配置碾压同等价位的入门开发板。

它原本是一张没有任何官方原理图与手册的“盲卡”。在早期玩家逐一逆向测出 JTAG、引脚和时钟定义后,开源网络计算平台 Corundum / taxi 项目现已正式合并了对该卡的适配支持。开发者能直接把它跑成开源 FPGA 网卡,用于 10G / 25G 以太网及网络内计算(In-network compute)实验。

大厂退役硬件流入二手市场,正在硬核地将高端 FPGA 的开发门槛压低到普通爱好者也能承受的试错区间。

信源:https://x.com/lauriewired/status/2056065420386590810
两年亏283亿后单季净利330亿,长鑫科技重启IPO

长鑫科技更新科创板 IPO 招股书,项目在补充财务资料后正式恢复审核。这家国内产能最大的 DRAM(动态随机存取存储器,即内存芯片)研发制造企业拟募资 295 亿元,投向产线改造与前瞻技术研发。

招股书原件显示了极其剧烈的利润跨度:长鑫在 2023 与 2024 年共亏损超 282 亿元,于 2025 年扭亏。而绝对的反转发生在 2026 年第一季度——公司单季营收达 508.00 亿元(同比暴增 719.13%),净利润直接拉升至 330.12 亿元(归母净利润 247.62 亿元)。

公司将这轮业绩暴涨归因于全球算力需求激增、DRAM 供不应求及合约价的大幅上涨。长鑫预计 2026 年上半年营收 1100 亿至 1200 亿元,净利润 660 亿至 750 亿元;不过这组未经审计的数据并不构成业绩承诺。

产品路线上,长鑫已完成从 DDR4/LPDDR4X 到 DDR5/LPDDR5X 的代际覆盖,高毛利的 DDR5 在 2025 年快速放量。据 Tom’s Hardware 报道,长鑫展示的 DDR5 芯片已达到 8000 MT/s 速率与单颗 24Gb 容量,正式切入全球高端速率区间。

招股书还显示,长鑫 2025 年前五大客户销售占比降至 39.85%,客户集中度继续下降。供应链披露方面,公司将前五大供应商名称处理为「供应商A」、「供应商B」等代码,主要披露采购内容、金额及占比等信息。叠加科创板首单适用“预先审阅”机制,这让本次 IPO 除了业绩反转外,还多了一层供应链保密与审核机制变化的看点。

信源:https://static.sse.com.cn/stock/disclosure/announcement/c/202605/002170_20260517_MGLN.pdf