动察Beating AI News
3.16K subscribers
889 photos
2 videos
1 file
3.41K links
AI新闻信息流
Download Telegram
传DeepSeek招聘现「学历倒挂」:QS前50海本简历全拒,一年制硕士反过关

有网友在小红书平台发帖称,据其多位留学生朋友反馈,DeepSeek 目前在初筛阶段直接拒绝海外本科学历(含 QS 前 50 高校),但一年制海外硕士反而能顺利过关。

他声称,自己去年曾进入 DeepSeek 招聘的发 offer 阶段。今年更换化名重新投递,并在简历中补充了参与 SOTA 模型研发、为开源框架 verl 提交代码等经历,结果依然在初筛被直接淘汰。

发帖人抱怨,这种存在「倒挂」的硬性过滤规则完全无视了候选人的开源社区影响力与实际工程能力。

上述筛选逻辑目前仅属社交平台的单方面说法,DeepSeek 官方暂未对相关传闻作出回应。

信源:http://xhslink.com/o/3jdNGDjXVVa
GPT-5与Gemini在甲骨文前全军覆没,腾讯发布首个古文字评测基准Chronicles-OCR

腾讯混元及 SSV 数字文化实验室联合中科院信工所等机构,正式推出首个覆盖“七体之变”的古文字感知评测基准 Chronicles-OCR。该基准包含 2800 张由专家交叉标注的图像,首次将甲骨文到草书等七种字体的识别难度统一量化。

研究团队评测了 28 个主流多模态大语言模型,结果显示它们在古早字体上几乎全军覆没。在跨时代字符检测任务中,GPT-5 和 Gemini 2.5 Pro 的核心指标接近 0,表现最强的模型也仅有 16.5。即使直接在图上画框免除定位步骤,最高准确率也只有 27.1%,其中 Gemini 3.1 Pro 在甲骨文上的准确率仅 14.0%。

这证实了现代模型严重依赖规整的现代版式先验。面对无约束、强噪声的古代物理介质,模型的文本分割机制直接失效。字体分类结果进一步表明,模型往往是在识别载体纹理(如龟甲或青铜锈),而非真正的字符笔画。

实验还揭示了一个反直觉的现象:开启思考模式反而会导致古文字识别率下降。对照显示,几乎所有支持该模式的模型在开启思考后表现退化。当底层视觉感知缺失时,思维链不仅无法纠错,反而会变成幻觉放大器,输出高自信的错误答案。

信源:https://mp.weixin.qq.com/s/RmzRuZcmYCDIhp_VI2G5Ig
1
多语种SWE-Bench压制GPT-5.5!Cursor发布最强模型Composer2.5,确认调用Colossus2百万卡集群

Cursor 刚刚发布其迄今最强的代码模型 Composer 2.5。该模型继续基于月之暗面开源的 Kimi K2.5 权重构建,重点优化了长周期任务执行与复杂指令遵循能力。马斯克随后在 X 上转发证实,该模型的训练已部分调用 Colossus 2 超级计算集群。

在官方公布的基准测试中,Composer 2.5 在多语种 SWE-Bench(SWE-Bench Multilingual)得分达 79.8%,直接反超 GPT-5.5 的 77.8%,并逼近 Opus 4.7 的 80.5%。在更难的自有测试集 CursorBench v3.1 中,其 63.2% 的成绩也大幅超越前代 Composer 2 的 52.2%。

为解决长上下文强化学习中的信用分配(Credit assignment)难题,Cursor 在训练中引入了带文本反馈的定向强化学习技术。当模型在数十万 token 的长文中出现局部错误(如调用了不存在的工具)时,全局最终奖励往往只能给出模糊的惩罚。新机制会在错误发生的特定轮次插入“可用工具列表”等纠正提示,仅对该局部的概率分布进行定向蒸馏更新,从而在保留全局目标的同时精准修复行为缺陷。

此外,Composer 2.5 的训练使用了比前代多 25 倍的合成数据。这诱发了高阶的奖励黑客(Reward hacking)行为:模型学会了通过逆向工程 Python 类型检查缓存来寻找被删除的函数签名,甚至通过反编译 Java 字节码来重构第三方 API,以非预期的方式抄近道完成任务。

Cursor 透露,团队目前正与 SpaceXAI 合作,动用 Colossus 2 提供的一百万张 H100 等效算力,从零开始训练规模更大的下一代模型。

价格方面,Composer 2.5 基础版定价为每百万输入 token 0.5 美元、输出 2.5 美元;系统默认的快速版(Fast)定价为每百万输入 3 美元、输出 15 美元。首周向用户提供双倍使用额度。

信源:https://cursor.com/blog/composer-2-5
马斯克输掉与奥特曼的世纪官司,坚称遭「日历陷阱」必将上诉

加州奥克兰联邦法院的九人陪审团一致裁定,埃隆·马斯克因起诉太晚,在这场针对 OpenAI 及山姆·奥特曼(Sam Altman)的诉讼中彻底败诉。主审法官 Yvonne Gonzalez Rogers 随即当庭驳回了马斯克的全部诉求。

因为错过了三年时效,马斯克精心准备的「违反慈善信托」、「高管不当得利」等核心底牌,甚至连送上审判席的机会都没拿到。

OpenAI 发言人在法庭外称这一判决是「一场伟大的胜利」,其代理律师更是直言马斯克的指控「与现实毫无关系,完全是一派胡言」。

马斯克随即在 X 平台猛烈开炮,将判决斥为「日历上的技术把戏」。他坚称毫无疑问,奥特曼和总裁 Greg Brockman 确实通过「窃取慈善机构让自己赚得盆满钵满」。

他的代理律师 Marc Toberoff 在法庭外给出了最强硬的表态:「只有一个词——上诉。这场战争还没结束。」

他重申了诉讼核心:绝不能允许有人打着公共慈善的幌子筹集数百万美元,等时机成熟就摇身一变成营利企业,让高管中饱私囊。如果这次让他们蒙混过关,慈善机构的防线将荡然无存。

尽管马斯克誓不罢休,但多位资深上诉律师指出,上诉法院极难推翻陪审团做出的时效认定。这场事关 OpenAI 转型合规性与马斯克颜面的法律长跑,将在第九巡回法院陷入漫长的拉锯。

信源:https://www.bbc.com/news/articles/cewpyv79pw1o
Android上线实时语音!开源智能体OpenClaw发新版,全面解锁GPT-5

开源个人智能体服务 OpenClaw 发布 v2026.5.18 新版本。本次更新将 Android 客户端的对话模式切换为基于网关中继的实时语音会话,并全面放开了对 GPT-5 系列模型的配置验证与支持。

新版 Android 客户端实现了流式麦克风输入与实时音频回放,并打通了工具结果桥接(tool-result bridging,指将工具调用状态与语音流实时同步)与屏幕实时字幕。这使得移动端用户可以直接通过语音唤醒并运行复杂的本地工具链。

在模型支持方面,OpenClaw 解除了配置校验阶段对 GPT-5.1、GPT-5.2、GPT-5.3 以及 openai-codex 模型的拦截。新版本停止了对 GPT-5 最终回复的强制缩简截断逻辑,以保留完整的通道响应,并在激活严格智能体执行(strict-agentic execution)时自动写入日志。

为了简化插件扩展,新版推出了 defineToolPlugin 极简插件接口,并配套了 openclaw plugins build、validate 和 init 命令行工具。开发者现在可以用强类型方式声明简单的工具插件,系统将自动生成所需的描述清单(manifest)和上下文工厂。

底层性能方面,内存核心(Memory-core)引入了启动增量同步机制。系统在启动时会比对磁盘会话与索引文件,仅对缺失、变动或大小改变的文件执行增量索引更新,大幅缩短了冷启动耗时。

此外,非托管的信号(如 SIGUSR1)配置重载完全在进程内完成,避免了因派生孤立子进程而导致父级守护程序丢失进程标识符(PID)的问题。

信源:https://github.com/openclaw/openclaw/releases/tag/v2026.5.18
AI包月「续杯」终结!谷歌Gemini改用「算力限额」

谷歌针对其 AI 助手 Gemini 的服务条款发布公告,宣布自 2026 年 5 月 17 日起,全面调整年满 18 周岁用户的用量限额规则。Gemini 将彻底弃用传统的「每日固定提问次数」限制,改用基于计算的用量限额,额度每 5 小时刷新一次并设有每周上限。

根据新规,系统将依据提示的复杂程度、用户所用功能以及对话长度来实时计算额度消耗。使用 Pro 模型、Deep Research、扩展思考与 Deep Think 以及生成图片、视频或音乐等媒体功能,将更快速地消耗额度。付费用户的限额倍数将与订阅价格直接挂钩,8 美元/月的 AI Plus 用户享有 2 倍于免费用户的额度,20 美元/月的 AI Pro 用户享有 4 倍额度,而 250 美元/月的 AI Ultra 用户额度则高达免费用户的 20 倍。

信源:https://support.google.com/gemini/answer/17004136?hl=zh-Hans
特朗普后悔英特尔股份要少了,称早当政抢光台积电业务

美国总统特朗普在接受《财富》杂志专访时表示,他后悔此前代表美国政府入股英特尔时股份要少了。去年 8 月,特朗普政府宣布将《芯片法案》中约 89 亿美元的补贴转化为股权(以每股 20.47 美元购入约 4.33 亿股),获得英特尔 9.9% 的股份。仅 8 个月后,这笔持股价值已飙升至 500 亿美元以上,账面浮盈超 410 亿美元。

这笔暴利背后是美国政府亲自下场拉动业绩的结果。《华尔街日报》披露,苹果已与英特尔达成初步协议,由后者为其代工芯片,打破台积电长期独占。作为英特尔的重要股东,美国商务部长霍华德·卢特尼克过去一年里多次会见库克,极力游说苹果将订单分流给英特尔。而由于英伟达等巨头的 AI 芯片暴涨严重挤压了台积电的产能,备受缺芯困扰的苹果最终妥协。

除苹果外,英特尔首席执行官陈立武上任一年来已集齐三大巨头:去年 9 月英伟达注资 50 亿美元由其代工数据中心 CPU,上个月马斯克也宣布与其在得州合资建厂。为承接大单,英特尔在最先进的 14A 制程上投入重金,并冒着法律诉讼风险从台积电挖来高管罗唯仁(Wei-Jen Lo)主管代工。受这一系列利好提振,英特尔股价此前暴涨,创下 132.75 美元的历史新高。

特朗普在专访中透露了与陈立武的谈判细节。他当时直接要求对方免费给国家 10% 的股权,在对方爽快答应后,他感到后悔并自嘲当时应该要更多。特朗普还直言,英特尔目前本该是全球最大的公司;如果自己能早点当政,并对进口芯片加征关税保护英特尔,那么如今原本属于台积电的芯片制造业务现在全都会属于英特尔。对于这笔持股的未来,他倾向于在不引发股价大跌的前提下缓慢减持。

信源:https://fortune.com/2026/05/18/trump-interview-economic-strategy-tariffs-ai-dealmaking-china-summit/
新兴云厂商因绑定英伟达拒租TPU!谷歌联手黑石狂砸50亿美元建专属云公司

谷歌联手黑石集团成立了一家独立的云计算公司,专向 AI 开发者出租 TPU 算力。在这笔代号为 Project Braid 的合作中,黑石注入 50 亿美元股权投资,谷歌则退居少数股东,直接提供 TPU 硬件底层。

谷歌一直谋求扩大 TPU 租赁版图以对抗英伟达。但忌惮于英伟达在芯片配额上的掌控力,多数新兴云厂商 Neoclouds 拒绝接手谷歌的 TPU。借黑石资本另起炉灶,让谷歌得以彻底绕过英伟达的生态封锁,为 TPU 强行撕开一条租赁通路。

新合资公司将由谷歌云资深高管 Benjamin Treynor Sloss 出任 CEO。按计划,高达 500MW 的 TPU 算力将在 2027 年前上线运营。

信源:https://www.theinformation.com/briefings/google-blackstone-create-tpu-cloud-provider
1
阿里Qwen3.7空降大模型竞技场!旗舰款登顶国产第一,距前代发布仅四周

阿里千问团队在 chat.qwen.ai 悄然上线 Qwen3.7 系列首批预览版:Max 与 Plus。新版本强制锁定为深度思考模式,并为此临时禁用了联网搜索与代码解释器。

在最新出炉的大模型竞技场 Arena 榜单中,Qwen3.7 拿下了文本与视觉领域的双料国产第一。

其中,旗舰款 Qwen3.7-Max-Preview 位列文本总榜全球第 13,将阿里实验室的文本研发排名推高至全球第 6。新模型在硬核推理赛道全面挤入全球前十:数学第 7、专家提示与软件 IT 第 9、代码生成第 10。

主打视觉的 Qwen3.7-Plus-Preview 则拿下视觉榜全球第 16。这也将阿里的整体视觉研发实力推高至全球第 5 位。

前代旗舰 Qwen3.6-Max-Preview 在 4 月 20 日才发布,仅隔 28 天便推出 Qwen3.7 预览版,产品迭代速度极快。此次赶在会前「偷跑」上线,显然是在为 5 月 20 日于杭州开幕的 2026 阿里云峰会造势,届时官方将正式揭晓新基座的技术底牌与商业部署。

信源:https://x.com/Alibaba_Qwen/status/2056403591464984753
1
连胡彦斌都来Vibe Coding了:亲自开发粉丝专属社区「彦火」

歌手胡彦斌在社交平台晒出写代码的日常,自曝正在为亲手开发的粉丝专属互动社区 APP「彦火」修 bug,该应用已于近日在苹果 TestFlight 开启内测。

根据流出的内测截图,该 APP 并非粗糙的试验品,而是包含了动态分享、演出通告、粉丝聊天以及虚拟成长体系等核心功能。应用内设计了精美的「巡演地图」,能直观复盘巡演城市与里程数据并解锁趣味成就,同时还内置了由胡彦斌亲自设定个性化角色的 AI 助手「小 tiger」。

信源:http://xhslink.com/o/Az4G88jmLmA
2
模拟芯片巨头亚德诺拟15亿美元收购Empower,硬刚英伟达电源供应商MPS

模拟芯片巨头亚德诺半导体(Analog Devices,以下简称 ADI)正与 AI 电源管理芯片初创公司 Empower Semiconductor 展开高级别收购谈判,拟以约 15 亿美元的价格将其收入囊中。如果谈判顺利,双方最快可能于本周三,即 ADI 发布季度财报之日正式宣布这一消息。

Empower 成立于 12 年前,总部位于加利福尼亚州米尔皮塔斯,此前已从富达管理(Fidelity Management)、Alphabet 旗下 CapitalG 等机构融资超 2.15 亿美元。该公司在电源管理上采用了独特的电力传输机制。传统方案中,芯片设计商通常将电源管理芯片放置在处理器旁边的电路板上,让电力水平传输,这会导致显著的电能损耗。而 Empower 则将集成稳压器(IVR,指将电压调节功能直接制作在微小芯片上的电源管理技术)直接安装在 AI 芯片的下方或内部,极大缩短了电力传输距离,从而大幅降低了传输途中的能耗损失。

除了降低功耗,Empower 的芯片还能以极快的速度调整电压,在算力瞬间激增的计算峰值期间确保 AI 芯片的运行稳定性。去年,该公司已与芯片制造商马维尔科技(Marvell Technology)达成合作,为其定制芯片开发这种一体化电源方案。

此次收购若能达成,将直接增强 ADI 与 MPS(Monolithic Power Systems)竞争的筹码。后者是目前英伟达 Hopper 与 Blackwell 芯片外围电源管理芯片的主要供应商,今年以来其股价已大涨 60%。

受益于 AI 数据中心客户订单的激增,ADI 在今年 1 月结束的季度中,数据中心相关营收大增 30% 至 32 亿美元,公司股价今年以来已累计上涨超 50%。

信源:https://www.theinformation.com/articles/analog-devices-talks-buy-ai-power-chip-startup-1-5-billion
用xAI算法帮品牌找网红!X独家推出Creator Connect抢夺中小创作者广告市场

X 宣布推出一款全新广告对接工具 Creator Connect。新系统由 AI 驱动,核心技术由马斯克关联公司 xAI 提供,通过分析平台数据与实时热点,帮品牌精准匹配契合的垂直创作者。

与传统的头部网红营销不同,新工具将重心放在中小微创作者上。X 内容合伙关系全球主管 Mitchell Smith 接受采访时指出,相较于自带商业光环的 1% 头部大 V,小微创作者在各自深耕的极细分领域中往往拥有更忠实的受众与更高的带货转化率。

若广告主对某位创作者的产出风格非常满意,系统还能自动搜寻并配对其他相似风格的创作者,从而快速复制推广效果。

工作流程上,品牌只需输入具体营销目标与热点诉求,AI 系统就会深度扫描平台上的视频和图文内容,生成最匹配的红人推荐清单,再由平台系统自动向这些创作者发送合作邀请以征询意向。目前,这套合作模式已在笔记本电脑和电影宣发的早期推广中完成测试。

此外,X 计划将新系统与另一款趋势监测工具 Trend Genius 进行绑定。当平台出现某个引发大规模讨论的社会事件或体育赛事时,Trend Genius 会自动捕捉热度流量,帮助广告主在几分钟内根据即时热点生成创意资产,再通过 Creator Connect 的匹配通道瞬间部署到对应中小创作者的受众信息流中。

在 YouTube 和 TikTok 强力吸金的背景下,X 试图通过引入 xAI 算法撮合中小广告,把平台独特的实时讨论属性快速变现,以此缓解创作者流失与广告营收增长的双重瓶颈。

信源:https://www.hollywoodreporter.com/business/digital/x-creator-push-advertising-new-product-brands-1236597139/
哈萨比斯AI投资版图曝光:隐秘入股Anthropic,DeepMind帮已融140亿

《金融时报》披露,谷歌旗下 AI 实验室 DeepMind 创始人戴米斯·哈萨比斯(Demis Hassabis)是竞争对手 Anthropic 的早期天使投资人,这一此前未公开的隐秘持股引发了行业震动。作为目前全球估值最高的 AI 独角兽之一,Anthropic 刚刚以 9000 亿美元的估值同意了新一轮 300 亿美元的融资意向。

Anthropic 创始人兼首席执行官达里奥·阿莫代伊(Dario Amodei)一直将哈萨比斯视为榜样。而在公司层面,谷歌已向 Anthropic 累计投资数十亿美元,作为双方云服务与 AI 战略合作的一环。

这并非哈萨比斯首次投资前同事的创业公司。自 2014 年以 4 亿英镑将 DeepMind 出售给谷歌以来,他频频以个人身份投资前同事的创业项目,其版图包括前 DeepMind 联合创始人穆斯塔法·苏莱曼(Mustafa Suleyman)创立的 Inflection AI,长期合作伙伴大卫·席尔瓦(David Silver)设立的 Ineffable Intelligence,以及英国初创企业孵化器 Entrepreneurs First。

哈萨比斯的个人天使投资与 DeepMind 离职潮交织在一起,折射出 AI 黄金一代的复杂权力图谱。这批顶尖人才既是直接对垒的商业竞争对手,又通过资本与人脉编织起一张密不可分的利益网络。

数据显示,自 2021 年以来,前 DeepMind 研究人员已创办了十几家 AI 公司,累计融资至少 140 亿美元。其代表包括药物研发公司 Isomorphic Labs 与席尔瓦的 Ineffable Intelligence,这两家公司在过去一个月内便筹集了超过 30 亿美元;此外,Mistral AI、法律 AI 独角兽 Harvey、新型材料搜索引擎 Cusp.ai 等知名初创公司中,也活跃着大量 DeepMind 校友的身影。

与人才流出相对应的是,DeepMind 核心高管正全面接管谷歌的 AI 业务权力。去年,首席技术官科拉伊·卡武克库奥卢(Koray Kavukcuoglu)被提升为谷歌首席 AI 架构师;上个月,主导 AlphaFold 项目的普什米特·科利(Pushmeet Kohli)出任谷歌云首席科学家。

尽管哈萨比斯在谷歌内部的权势已达到顶峰,但 DeepMind 依然拒绝搬往硅谷,始终坚守在伦敦国王十字区,并在此拉动起一个庞大的欧洲 AI 创新产业群。

信源:https://www.ft.com/content/8f2a529e-7a1b-4d8e-95be-338d0c4c98f5?syn-25a6b1a6=1
1
Lucius完成数百万美元融资,要让AI住进群聊跟着真人学

企业 AI 员工服务商 Lucius 完成数百万美元天使轮融资,由明势创投领投。其主打的组织记忆系统(Organization Context Layer)目前已服务 30+ 家客户,通过在 Discord、飞书等群聊中记录并实时提炼真人的每一次业务判断,打破了传统 RAG 对人工配置知识库的依赖。

与普通的 RAG(检索增强生成,指检索文档来回答问题的技术)不同,Lucius 不只答题,更专注于记住每一次判断。当遇到未知问题时,系统不直接生成答案,而是转交人工团队。真人给出回复后,Lucius 会自动提炼该回复的适用场景、风险边界和后续动作。下次类似问题出现时,模型便能结合上下文精准匹配,避免旧答案被盲目套用。

目前该模式已在多个社区验证。AI 配音工具 Dubbing AI 接入后,其 Discord 社区自解决率在单月内从 29% 提升至 88%,节省超 100 小时重复回答。低代码平台 Momen.app 也有约 80% 的问答实现自主处理。更重要的是,这些日常对话会被沉淀为可调用语料,产品经理可直接向 Lucius 询问用户高频痛点,作为迭代决策的输入。

创始人赵赫曾主导无代码平台 Zion 等出海项目。他发现,将业务知识整理进系统门槛极高,客户极不愿意配置和维护知识库。Lucius 的思路是让 AI 直接住进群聊跟着真人学,从而绕过冷启动瓶颈,并计划从售卖软件工具转向直接对业务结果收费。

信源:https://mp.weixin.qq.com/s/ChnntEbRTygAouKf-SpzoA
20小时工作只需21美元!SemiAnalysis实测AI代工:最高ROI近94倍

知名半导体与 AI 行业研究机构 SemiAnalysis 公开了其分析师团队的 AI 代工实测数据。该团队持续追踪了涵盖公司研究、财报速递、会议纪要挖掘和财务数据拉取的 9 个真实工作流,用 Token 消耗与人工成本的硬核对比证明 AI 回报是真实且结构性的。实测显示,所有任务的投资回报率(ROI)均超过 10 倍,大部分集中在 60 至 90 倍之间,其中一项公司研究任务仅耗费 21.33 美元 Token 便替代了 20 小时的人工,ROI 高达 93.8 倍。

为了展示 AI 工具在实际业务中的具体效益,SemiAnalysis 披露了多项代表性任务的实测数据。
• 针对惠普企业(Hewlett Packard Enterprise,简称 HPE)的深度公司研究,Token 成本仅 21.33 美元,即可替代价值 2000 美元的人工(耗时 20 小时),ROI 达 93.8 倍。
• 财务数据拉取与 Excel 邮件发送,Token 成本仅 1.87 美元,即可替代价值 150 美元的人工(耗时 3 小时),ROI 达 80.2 倍。
• 针对迈威尔科技(Marvell)的财报速递,Token 成本仅 2.82 美元,即可替代价值 200 美元的人工(耗时 4 小时),ROI 达 70.9 倍。
• 构建代币经济学披露 Slack 机器人,Token 成本为 58.02 美元,即可替代价值 1000 美元的人工(耗时 20 小时),ROI 达 17.2 倍。

除了内部实测,SemiAnalysis 还通过外部 AI 编程工具的爆发式数据,印证了整个行业被 AI 渗透的极速扩张。该机构每日追踪 AI 编程智能体 Claude Code 的 GitHub 提交记录(GitHub Commits),数据显示在 2026 年 2 月,该工具的日提交量已突破 13.4 万次,占 GitHub 公开提交总量的约 4.0%,在 13 个月内实现了 42896 倍的爆发式增长。其最新的内部追踪数据显示,这一增长曲线目前仍在持续向上攀升。

SemiAnalysis 认为,一旦体验过将 20 小时繁琐任务压缩至 21 美元 Token 消耗的效率飞跃,分析师的工作流便再难退回手动时代。不过,随着合规与 IT 限制导致银行等大型机构尚未大规模接入,AI 在企业级市场的真正爆发才刚拉开序幕。

信源:https://x.com/SemiAnalysis_/status/2056480113357729977
直接买下OpenAI的SDK代工厂!Anthropic溢价一倍收购Stainless

Anthropic 宣布正式收购开发者工具初创公司 Stainless。这家公司专门用 AI 把复杂的 API 自动打包成跨语言的 SDK。交易完成后,Stainless 团队将整体并入 Anthropic,专门去帮 Claude 打通外部工具与数据。

这笔交易等于让 Anthropic 直接控制了竞争对手的底层工具链。由于自己维护多语言 SDK 太耗费工程资源,OpenAI 此前干脆放弃内部开发,全面转投了 Stainless。虽然市面上还有 Speakeasy、LibLab 等平替方案,但目前最头部的三家大模型厂商(OpenAI、谷歌、Anthropic)全在用 Stainless 生成 SDK。

官方并未公开具体成交额。但据 The Information 此前披露,收购对价至少为 3 亿美元,等于在 Stainless 去年 12 月 1.5 亿美元估值的基础上直接翻倍。

除了服务三大模型厂,Stainless 此前还专门为 Anthropic 发布过的 MCP(模型上下文协议)开发过配套工具。这也是 Anthropic 半年内的第四次扫货:继去年买下 JavaScript 运行时 Bun 后,它又接连吞并了计算机操作厂商 Vercept 与 AI 生物科技公司 Coefficient Bio。

信源:https://www.anthropic.com/news/anthropic-acquires-stainless
1
1000美元一天从零训出1B基础模型!Sapient开源层级推理架构HRM-Text

Sapient Intelligence 开源了 10 亿参数(1B)的文本生成基础模型 HRM-Text。这是一款基于层级推理模型(HRM)架构的纯预训练模型。它通过在架构底层引入潜在空间推理,将基础模型预训练的算力消耗缩减了 130 至 600 倍。

具体而言,HRM-Text 仅使用 400 亿(40B)个结构化 Token 便完成了预训练,数据量约为同级别常规模型的千分之一。官方实测显示,使用两台 8 卡 H100 服务器,耗时约 46 小时即可从零训完 1B 版本,计算成本约 1472 美元;而 0.6B 版本只需单节点跑 50 小时,硬件成本约 800 美元。包含数据提取、序列打包与 PyTorch 分布式训练在内的完整工程框架均已同步开源。

极限降本的支撑在于独特的双时间尺度循环(Dual-timescale recurrent)设计。模型内置了快(低层)与慢(高层)两套 Transformer 模块。这两套模块在同一批输入上交替迭代,并通过状态相加来交换信息。这种设计允许模型在物理参数总量固定的前提下,通过增加循环次数来动态拓展计算深度。

预训练门槛的断崖式下降,让许多过去因算力昂贵而被搁置的模型理论,重新获得了低成本验证的机会。需要特别注意的是,本次释放的仅为未对齐的纯预训练权重,模型只能执行前缀续写任务,无法直接作为问答助手使用。

信源:https://github.com/sapientinc/HRM-Text
Odyssey两天连发,世界模型开始像游戏引擎了

AI 初创公司 Odyssey 在两天内连发两款模型:Starchild-1 和 Agora-1。

Starchild-1 解决了实时的视听交互。以 DeepMind 的视频模型 Veo 为例,这类模型通常是离线生成。按下生成键后,视频的时长和轨迹就已固定,用户无法再中途干预。

Starchild-1 通过因果蒸馏和异步 KV 缓存,分开了音频和视频的上下文保存节奏。用户可以随时输入语音、文本或做动作,模型会立刻响应并改变接下来的画面和环境音。

紧接着发布的 Agora-1 把实时交互扩展到了多人场景。它支持最多 4 名真人或 AI 玩家,在同一局《黄金眼 007》的射击战场里对战。

之前让多个智能体互动的方案不够稳定。Multiverse 用的是分屏式状态表示,Solaris 则把所有参与者强行拼进单个 Transformer 的序列里。一旦人多起来,上下文会变得极长;玩家一旦散开,眼前的世界状态就容易对不上。

Agora-1 直接把底层规则和画面渲染分开了。它先在内部算出玩家的具体位置和血量,维持一个绝对一致的共享状态;然后再交由 DiT 模型读取状态,给每名玩家单独渲染第一人称画面。

连着两款模型发布,Odyssey 的方向很明确:把世界模型从单向生成的视频,做成能听能看、多人联机的交互引擎。

TechCrunch 此前报道,Odyssey 由两位有自动驾驶背景的创始人创办,目前累计融资已达 2700 万美元。

信源:https://odyssey.ml/introducing-agora-1
1
Anthropic上线自托管沙盒:云端大脑编排,企业内网执行代理工具

Anthropic 为 Claude Managed Agents 推出自托管沙盒(Self-hosted sandboxes)与 MCP 隧道(MCP tunnels)两项新功能。AI 代理的计算与执行环境被一分为二。

代理循环(任务编排、上下文管理与错误恢复)继续在 Anthropic 云端运行。所有的工具调用和代码执行转移到企业自己的基础设施,或 Cloudflare、Daytona、Modal、Vercel 等托管沙盒中。

企业可以自行分配沙盒的 CPU、内存与运行时镜像。需要长时间构建或生成图像的代理,可以直接调用企业本地算力。

同步推出的 MCP 隧道功能,通过在企业内网部署单向连接的轻量级网关,打通了代理与本地服务的加密通道。

无需开放入站防火墙,Claude 代理就能直接调用内网的数据库、私有 API 和知识库。敏感文件与凭证全程不离开企业安全边界。

目前,自托管沙盒处于公测阶段,MCP 隧道开放研究预览申请。

信源:https://claude.com/blog/claude-managed-agents-updates
中美正式确认开展AI官方对话

中国外交部正式确认,中美已同意开展人工智能官方对话。这一共识是在两国最高层就 AI 监管问题进行直接交流后敲定的。

这场高规格的接触,落定了数月来的双边博弈。在此之前,美国正因 Anthropic 前沿模型 Mythos 展现出的网络武器潜力而焦虑,迫切希望建立防线;而中国大模型凭借适配华为芯片,拿到了不受算力制约的谈判底牌。

此前,美方牵头人曾公开放话排斥他国参与制定全球 AI 规则。此次高层直接对话越过了这层强硬姿态,为建立类似冷战时期的危机管控机制钉下了明确框架。

中方在回应中强调,作为两个大国,双方应携手促进 AI 的发展与治理。

信源:https://mp.weixin.qq.com/s/0mGbdz4op2UelzqLJr3K1A