动察Beating AI News
3.19K subscribers
902 photos
2 videos
1 file
3.44K links
AI新闻信息流
Download Telegram
Mistral CEO明确拒绝向硅谷巨头卖身,放话能挖出Anthropic同等漏洞

Mistral AI 联合创始人兼 CEO Arthur Mensch 近日在法国国民议会听证会上发表了强硬表态。面对议员对于公司是否会被美国巨头买走的担忧,他明确表示拒绝。Mensch 抨击了欧洲初创企业总想着卖给硅谷套现的行业风气,直言企业只要成功就不会被收购,被收购在某种意义上就是失败。同时,他首次公开叫板美国安全标杆 Anthropic,称 Mistral 的模型完全有能力找出 Mythos 发现的全部网络漏洞。

为了支撑独立发展的野心,Mistral 今年的研发投入高达 10 亿欧元。Mensch 透露,公司目前 75% 的营收来自欧洲本土。在技术路线上,Mistral 坚持在内部集中算力训练超大模型,然后再通过蒸馏技术向客户提供更高效的小模型。为保证算力自主,公司计划明年在法国建成 80 MW 的算力集群,并向 2029 年达到 1 GW 规模的目标冲刺。

Mensch 强调 AI 的本质就是将电能转化为 Token。由于主要依赖核电,在法国部署算力能极大降低碳足迹。他以建设 1 GW 数据中心需耗资 500 亿欧元为例,指出电力成本其实只占最终产值的 10%。他警告称,欧洲如果现在因为高昂的成本退缩,不仅会彻底丧失底层算力的控制权,未来纯靠进口美国 AI 服务还将带来每年上万亿欧元的贸易逆差。

信源:https://gist.github.com/eliebak/5945ce3c84d77b0f30ea1190cf34ad5b
告别受限内测?Claude Mythos摘除预览标签,疑似即将向公众开放

5 月 17 日,Claude Mythos 基础模型现身谷歌云(Google Cloud)控制台的配额与系统限制列表。与此前不同,该模型选项已正式移除了「预览」标签,且根据开发者追踪,昨日该列表中尚无此模型。

此前,Claude Opus 4.7 在正式发布前,也曾遵循同样的路径在谷歌云控制台中「抢跑」。这一高度重合的轨迹暗示,原本受限内测的 Claude Mythos 极有可能即将全面向公众开放。

信源:https://x.com/AiBattle_/status/2055762242373558477
Meta裁员前夜的荒诞求生:员工开会防AI监听,靠刷废话凑大模型榜单时长

Meta 预计将于 5 月 20 日裁减约 8000 名员工。在向 AI 激进转型的重压下,这家科技巨头内部正催生出一系列充满荒诞色彩的生存防御机制。

尽管高管承诺裁员不考核 AI 熟练度,但 Meta 仍上线了公开展示 token 消耗量和交互时长的 AI 内部榜单。在无形的末位淘汰恐惧下,部分员工为了保住饭碗,不得不主动给内部机器人发送无意义的提问,纯靠「刷废话」来积累交互数据。

这种防备情绪已蔓延至日常办公的每个角落。面对近期引入的键盘记录软件(key-stroke logging),Meta 员工开始在视频会议中频繁手动关闭默认的「AI 记笔记」功能,只为能安全讨论关于裁员的内部传闻。在极度紧绷的氛围中,内部论坛上一条「建议给能用 AI 替代自己工作的人发放 5 年薪水买断离职」的帖子获得了大量共鸣。

比起单纯的失业,更深的无力感来源于工作本身的异化。面对一边担忧被取代,一边又被要求必须亲手训练内部模型的处境,受访员工直言,即使还没失去工作,人类员工也已经「被提前商品化」。

信源:https://sfstandard.com/pacific-standard-time/2026/05/15/meta-employee-gets-real-horror-working-right-now/
X Premium开放第三方调用,开源Hermes Agent新增推文搜索

继昨日打通 Grok 独立订阅后,xAI 今日宣布,拥有附赠 Grok 权限的 X Premium 订阅用户,现也可直接在开源智能体 Hermes Agent 中授权调用模型能力。

此前,该第三方机制仅支持在 Grok.com 单独付费的订阅账号。此次将调用权限扩展至受众更广的 X 平台付费会员体系,大幅降低了普通用户为本地智能体获取顶级算力的门槛。

信源:https://x.com/xai/status/2055745332919808181
推理成本仅GPT-5.5二十分之一,Gemini 3.2实时模型现身谷歌云

谷歌云控制台的模型筛选列表中出现名为 gemini-3.2-flash-lite-live-preview 的基础模型选项。这是继本月初在 iOS 应用构建包和 AI Studio 暴露痕迹后,该系列模型在官方平台的再次曝光。

新选项带有 litelive 后缀,表明谷歌正切分出针对极低延迟实时交互的特化版本。Abacus.AI 首席执行官 Bindu Reddy 此前透露,Gemini 3.2 Flash 的编码与推理能力达到 GPT-5.5 的 92%,但得益于蒸馏加稀疏化技术,推理成本仅为后者的二十分之一,多数查询延迟低于 200 毫秒。

随着云端接口提前抢跑,业内预计这一定位极致性价比的轻量模型将在 5 月 20 日的谷歌 I/O 大会上正式发布。

信源:https://x.com/AiBattle_/status/2055760108693397644
突破苹果锁屏限制,OpenAI正测试手机远程控制休眠Mac

OpenAI 似乎正试图打破桌面端 AI 远程控制的最大痛点。据 TestingCatalog 曝光,OpenAI 正在为 Codex 开发一项新能力,目标是让 AI 即使在 Mac 锁屏甚至休眠的状态下,也能继续在后台操作软件干活。

此前各家的界面控制功能都有一个硬伤:电脑必须处于解锁亮屏状态,AI 才能查看屏幕并模拟键鼠点击。爆料称,新功能旨在补齐这一短板。如果成功落地,用户在路上用手机遥控家里的 Codex 跑测试或查数据时,将不再需要走回电脑前物理“解锁”屏幕。此外,OpenAI 还在测试跨设备互联,未来允许主设备直接遥控运行了 Codex 的 Mac Mini。

当前无论是现有的 Codex 还是竞品 Claude Code,一旦遇到系统锁屏同样都会受限。但让 AI 试图绕开锁屏密码直接在系统内保持活跃,明显挑战了 macOS 默认的安全防御预期。这种激进的底层越界尝试,极有可能在未来引发苹果官方的干预审查。

信源:https://www.testingcatalog.com/openai-will-let-codex-control-other-desktop-devices-via-computer-use/
👍2
单题写10万Token!30B开源模型不调工具,靠长考把IMO硬抬上金牌线

上海人工智能实验室联合清华大学、北京大学、上海交通大学与香港中文大学,共同开源了奥赛推理模型 SU-01。它基于 P1-30B-A3B 后训练,作答时不调用代码执行器、外部定理证明器或专门符号求解器,纯靠内部的生成、验证、修改循环,在 IMO 2025 官方题评测中拿到 35 分,达到当年金牌线。

SU-01 证明了解顶级数学题不一定非要外挂复杂的代码工具。只要给足测试时算力扩展(Test-Time Scaling,简称 TTS),30B 级别的模型单靠自己反复推敲,也能拿下顶尖成绩。

团队先用逆困惑度课程训练模型,按困惑度降序喂送样本,强迫它优先啃下最难模仿的推理轨迹。接着用强化学习稳固找答案的能力,最后要求模型反复自我修正,补全严密的证明。

这套机制在作答时极其消耗算力。面对难题,SU-01 会自己写出初稿,找出漏洞并反复重写。2026 年美国数学奥林匹克(USAMO)的测试轨迹显示,它解一道题光是写第一版答案,通常就会消耗 10.6 万 token(中位数);后续哪怕只做一次修改,也会再花掉 8.3 万 token。

不开启 TTS 时,SU-01 在 IMO 2025 的得分只有 21 分。它的金牌成绩,主要来自高 token 预算下的多轮深度搜索、自我检查和修改。

信源:https://arxiv.org/abs/2605.13301
马斯克敲定1.5T新Grok四周内上线,急抽Cursor数据火线救场

继前两日承认现役模型存在数据缺陷后,马斯克紧接着在 X 上给出了换代时间表。他宣布 1.5T 参数的内部第 9 版基础模型已完成训练,预计将于 3 到 4 周内正式发布,并豪言新版将带来「王炸(banger)」般的体验。

为填补前代数据缺陷,该模型接下来将进入「补充训练」阶段,专门用于海量吸纳 Cursor 的代码数据。完成底层知识灌输后,再交由监督微调(SFT)和强化学习(RL)进行打磨。

信源:https://x.com/elonmusk/status/2055914584373141906
Hermes发布v0.14:全面原生接入Grok,官方下场推C端订阅转API代理

NousResearch 发布多平台智能体框架 Hermes Agent 的 v0.14.0 重大版本更新。本次迭代合入了超 800 个提交,核心动作是将 xAI 体系升格为原生基础能力,并试图接管用户的各大 AI 会员订阅。

Grok 获得最高级别支持。新版引入 SuperGrok 订阅支持,用户无需申请 API Key 即可调用模型,配套的 grok-4.3 模型上下文窗口同步提升至 100 万 token。此前依赖外部实现的 x_search 推文搜索也转为原生内置工具,打通了 X OAuth 授权。

官方内置本地接口代理。新增的 hermes proxy 命令能够将 Claude Pro、ChatGPT Pro 与 SuperGrok 的网页端授权直接转化为标准 OpenAI 格式的本地接口。这一功能在理论上可替代多种第三方逆向代理工具。

智能体执行流引入硬核校验。新版加入带上下文的模型无缝切换指令 handoff。在代码编辑场景,系统在写入文件后会强制执行 LSP 语义诊断并附加校验层,直接针对大模型宣称修改实则未写入的幻觉问题下药。

此外,由于将音视频与部分平台交互等重型依赖改为懒加载模式,该框架的冷启动时间被削减了近 19 秒。

信源:https://github.com/NousResearch/hermes-agent/releases/tag/v2026.5.16
300美元直降至99美元,xAI掀价格战强推Grok Build

xAI 针对其顶配订阅服务 SuperGrok Heavy 推出激进的限时补贴策略。新老用户在未来 6 个月内,可享受从 300 美元/月直降 67% 至 99 美元/月的超级折扣。

Heavy 订阅是目前获取 xAI 命令行编程工具 Grok Build 的唯一门槛。该工具上周已开启公测,主打并发多子体(Subagents)与原生 MCP 扩展。

信源:https://grok.com/supergrok?referrer=grok-build
腾讯公测AI设计智能体Ardot:基于MCP接入IDE,支持私有组件库生成

腾讯今日开启自研 AI 设计智能体平台 Ardot 公测。该平台的核心机制在于将 AI 生成的设计稿转化为结构化数据,并通过 MCP(模型上下文协议)直接连接外部 IDE。

在设计侧,Ardot 支持通过自然语言批量生成或修改矢量界面,并允许直接导入 Figma 文件。为了避免 AI 绘图规范不可控的问题,平台开放了企业私有业务组件库接入,使 AI 生成的草稿能够直接遵循团队现有的设计规范。

在交接侧,包含变量、组件和布局数据的设计资产,可通过 MCP 协议直接被 CodeBuddy、Cursor 与 Claude Code 等开发工具读取。研发人员可在 IDE 内一键生成前端代码,从而替代传统的人工切图与标注流程。

该平台目前已提供 1000 Credits 初始额度,内置多人在线评审功能已同步上线。

信源:https://mp.weixin.qq.com/s/cCbdbFfy0-ciPhpd56GeQA
Citadel创始人:大企业护城河正被填平,内部AI已将金融PhD数月投研缩至数小时

对冲基金 Citadel 正在公司内部真切感受到 AI 对高智力岗位的残酷替代。创始人兼 CEO Ken Griffin 在 2026 斯坦福领袖论坛(Stanford Leadership Forum)上证实,以往需要金融学硕士和 PhD 耗时数周甚至数月的高级投研工作,目前正被其内部署的 AI 智能体在几小时或几天内批量搞定。

Griffin 坦言,亲眼看着核心研发层被机器迅速自动化,曾让他在某个周五下班时感到抑郁。他直接借用历史学家 Niall Ferguson 的悚然论断定调了这场冲击:「在 AI 的世界里,人类就是当年被汽车取代的马。」

毁灭同时伴随着旧有格局的解体。Griffin 明确指出,大型企业长期依赖的竞争护城河正被各种 AI 工具迅速填平。这直接将当下的市场变成了创业者的梦幻乐园,小团队向行业巨头开战的门槛已被降至历史最低。

信源:https://www.youtube.com/watch?v=Csjy_A3Kj9s
腾讯测试知识库工具狍子AI,将微信公众号文章一键转为个人知识库

腾讯正在测试一款名为 狍子 AI 的个人知识库工具。该产品允许用户将微信公众号文章一键导入专属知识库,把只存不看的内容转变为可检索和问答的数据。

用户在 狍子 AI 客户端完成账号绑定后,只需在微信内将文章直接转发给对应账号即可完成入库。
前SpaceX工程师忠告:想做硬件创业就立刻飞深圳

前 Tesla 无人驾驶与 SpaceX 猛禽团队工程师 Zac Valles 在 YC 路演结束 72 小时后直飞深圳。在实地驻扎 8 周并带着新硬件返回旧金山后,他强烈建议所有硬件创业者,哪怕还没融资、没团队、甚至没点子,只要想做硬件就该立刻去深圳。

他总结了在深圳对接供应链的核心经验。在切入路径上,他建议利用大型展会作为跳板,这是进入任何工厂最有效的敲门砖。在与代工厂沟通时,初期应重点询问交期而不是成本。他指出,硬件迭代速度受制于交期最长的零件,尽早锁定这些零件才能排布准确的时间表。

在供应商筛选与设计端,Valles 提醒创业者对代工厂的执行能力做好分级。他特别建议不要设计工序过于复杂的零件,例如需要 12 道后续加工的组件极难找到愿意接单的工厂。此外,他推荐在华强北这个“微型城市”预留 4 到 6 小时实地考察,并指出尊重当地商业文化(如“酒满茶半”)是推进合作的重要润滑剂。

信源:https://x.com/zacharyvalles/status/2055676910739599462
谷歌双雄高难局反超,TERMS-Bench把AI谈判做成破产压力测试

斯坦福 Erica Zhang 等人发布了经济谈判测试集 TERMS-Bench。它移除了黑箱的「大模型裁判」,让评测方能直接看清模型到底输在出价、让步还是违规。

在常规测试中,Claude Opus 4.6 和智谱 GLM 5.1 拿下前两名。论文发现,它们采用了「高出价、死不让步」的强硬策略,在利润丰厚的顺风局能把对手榨干。

但在利润空间极窄的最高难度局,强硬策略会因为频繁谈崩而吃亏。榜单在这里直接翻车:懂得适度让步保订单的 Gemma 4 31B(开放权重模型)和 Gemini 3.1 Pro 反超冲到前两名;而此前的领跑者 Claude 掉到第 5,GLM 掉到第 9。

除了测试极限难度,该基准最具冲击力的是测试生存能力的 Bankroll(资金池)模式。单次谈判被拉长成连续采购:每个 Agent 拿 100 美元本金连谈 50 期,每期固定扣运营费,亏完就破产。在这里,微小的谈判失误都会复利成破产危机。

结果显示,前述的 GLM 5.1、Claude Opus 4.6 以及谷歌双雄虽然策略不同,但控盘能力断层领先,全部实现了 100% 存活,最终现金均达到了 380 到 443 美元。相比之下,Grok 4.20 和 GPT-4o-mini 则无法顶住现金流损耗,破产率分别达到 25% 和 50%。

TERMS-Bench 的关键不在成交率,而在把谈判错误换算成现金亏损和破产风险。模型能不能说服对手,只是第一层;在连续交易里能不能守住利润和现金流,才真正拉开差距。

信源:https://arxiv.org/abs/2605.13909v1
OpenAI正秘密为Codex开发实时语音模式

开发者 @DevAdventur3s 近日从 OpenAI Codex 的代码库中挖出 1536 行尚未激活的 Rust 代码,曝光了 Codex 正在内测的实时语音模式。这次更新最大的变化是彻底切分了交互与执行,实现了前台连麦与后台写代码的双线并行。

从泄露的界面和源码注释来看,用户用语音下达重构等复杂指令后,前台会立刻唤起一个代号为 gpt-realtime-1.5 的语音模型,通过 WebRTC 与用户实时通话并口头汇报进度。与此同时,真正拉取文件、修改代码和跑测试的重体力活,则全部交由后台另一个参数量更大的模型静默完成。

AI 编程的交互体验正从回合制文本问答,走向类似结对编程同事的实时通话。目前这套底层逻辑和配套 UI 均已合并进主干代码,只等 OpenAI 服务器端开启权限即可激活上线。

信源:https://x.com/DevAdventur3s/status/2055765342484590774
GPT-5.6与Sonnet5本周齐发?草莓骗流博主再放狂言遭群嘲

X 平台账号 iruletheworldmo 发布推文,断言 Sonnet 5、GPT-5.6 与 Gemini 3.5 将在本周集体发布。

这名昵称是三个草莓图标的博主并非内部知情人士。他曾在 2024 年 8 月借 OpenAI 草莓项目热度凭空捏造 GPT-5 的发布日期。他当时甚至虚构出名为 Lily Ashwood 的角色诱导网友,最终被证实是一场纯粹的流量骗局。

虽然近期确有 5 月将迎来大模型更新潮的传闻,但该账号将三大旗舰强行打包进「下周」(也就是本周)的做法没有提供任何事实支撑。

面对评论区「是否当真」的追问,该博主依然给出肯定答复。这种毫无根据的预告如今已沦为 AI 社区的消遣,开发者 Haider 直接在下方跟帖预告「未来几周将连发 GPT-6 与 Opus 5」予以嘲讽。

信源:https://x.com/iruletheworldmo/status/2056030457959952525
Citrini Research抨击「瓶颈投资客」:AI价值流向愈发晦暗,盲目押注算力极度危险

今年 2 月发布《AI 末日报告》引发美股震荡的独立研究机构 Citrini Research 今日公开抨击近期涌现的「瓶颈投资客」:连算力瓶颈打通后行业长什么样都想不清楚就敢砸钱,纯属盲人骑瞎马。

一贯擅长极端终局推演的 Citrini 指出,当前 AI 产业的技术路线正面临剧烈的两极分化。市场既可能陷入长达十年的内存短缺,也完全可能因为需求崩塌倒逼底层技术创新,直接绕过现有的硬件瓶颈。这种极度不确定性正从基础设施向整个市场的基本结构蔓延。

最大的悬念在于巨额利润最终沉淀在哪里。在当前的牌桌上,Anthropic 这样的大型实验室完全有机会统揽从底层设施到应用的全部环节。但同等合理的情况是,基础模型彻底沦为低毛利商品,行业核心价值全部转移给更上层的应用落地厂商,甚至那些尚未露面的全新生态创新者。

在 2023 年初,避开推演终局、直接押注基础设施等「卖铲人」曾被视为最稳妥的策略。但 Citrini 强调,如今的局势不仅没有拨云见日,反而更加晦暗。面对复杂的动态博弈,如果放弃对多极终局的独立推演,单纯跟随线性的「瓶颈」叙事,将面临巨大的投资风险。

信源:https://x.com/citrini/status/2056210761538490519
DeepMind研究员离职警告:评测系统正成为AI能力跃升最大瓶颈

Google DeepMind 研究员 Lun Wang 宣布离职,并撰写长文反思目前的 AI 评测机制。他直言,现在的评测系统全在「刻舟求剑」,只能被动测试模型已有的能力,根本猜不到下一代模型会突然演化出什么新本事。比起数据、算力和架构,落后的评测体系才是目前卡住行业往前走的最大瓶颈。

现有的主流刷榜测试只对当前这一代模型管用。一旦模型学会了人类没见过的新操作,这些测试就会集体变成废纸。一个最危险的隐患是,如果模型为了达成目标而学会故意「藏一手」隐瞒关键信息,现有的安全工具根本抓不到它,因为模型说出的每一句话在事实上依然全是对的。

由于找不到能提前预警 AI 突然变聪明的「核心信号」,业界开发大模型完全是在「盲飞」。如果不解决到底该测什么这个最根本的问题,跟着旧指标盲目推进模型训练、安全防护和算力扩容,最后全都会错得离谱。

面对越来越能独立干活的前沿模型,评测系统也必须「活」过来。除了盯紧分数的异常波动,开发团队必须让 AI 自己去生成考题并试探其他 AI 的底线。未来的评测系统必须是一个能跟大模型一起进化的生命体,而不是一份按去年标准刻出来的死板检查单。

信源:https://x.com/lunwang1996/status/2056222588054237329
Perplexity测试个人CFO面板,聚合期权与Polymarket数据欲做轻量级彭博终端

Perplexity 正在内部测试一个名为「个人 CFO」(Personal CFO)的专属标签页,试图在通用搜索之外搭建一个独立的金融工作台。最新曝光的截图显示,该面板原生包含投资组合、交易记录与负债管理三大板块,并一口气打通了多家专业金融数据源。

具体而言,基础财务信息由 Financial Modeling Prep 提供,期权数据接入 Unusual Whales,财报会议文本与音频来自 Quartr,营收与 EPS 数据由 Fiscal AI 和 S&P Global 支撑。该面板同时直接引入了 Polymarket 的预测市场数据。

信源:https://x.com/testingcatalog/status/2056043029148922060
阿里云QoderWork上线语音设计工作台,说句话直接生成能跑的网页

阿里云 QoderWork 正式上线设计工作台 Design Desk。这是一个原生 AI 驱动的设计即代码工具。用户直接语音输入需求,系统会在无限画布上生成可运行的设计产物,并支持一键导出为 React + Vite 工程进入研发环节。

为了控制 AI 生成的随机性,该平台重构了生产流程,内置三套核心机制:

• 主动追问(Questions):遇到输入信息不足时优先确认意图,避免盲目猜测试错。
• 计划前置(Design Plan):生成前先输出结构化的布局与风格大纲,经用户把关后再执行。
• 参数微调(Nudge):生成后直接暴露配色、间距、圆角等关键变量,无需重新描述即可调节。

设计产物不再是交接后不可修改的静态黑盒,而是团队共同维护的代码资产。这种模式直接跳过了传统开发中设计稿切图、标注、前端还原的多轮内耗。

信源:https://mp.weixin.qq.com/s/BWd0_88sXTRJHCSgt21Flg