动察Beating AI News
3.16K subscribers
890 photos
2 videos
1 file
3.41K links
AI新闻信息流
Download Telegram
谷歌双雄高难局反超,TERMS-Bench把AI谈判做成破产压力测试

斯坦福 Erica Zhang 等人发布了经济谈判测试集 TERMS-Bench。它移除了黑箱的「大模型裁判」,让评测方能直接看清模型到底输在出价、让步还是违规。

在常规测试中,Claude Opus 4.6 和智谱 GLM 5.1 拿下前两名。论文发现,它们采用了「高出价、死不让步」的强硬策略,在利润丰厚的顺风局能把对手榨干。

但在利润空间极窄的最高难度局,强硬策略会因为频繁谈崩而吃亏。榜单在这里直接翻车:懂得适度让步保订单的 Gemma 4 31B(开放权重模型)和 Gemini 3.1 Pro 反超冲到前两名;而此前的领跑者 Claude 掉到第 5,GLM 掉到第 9。

除了测试极限难度,该基准最具冲击力的是测试生存能力的 Bankroll(资金池)模式。单次谈判被拉长成连续采购:每个 Agent 拿 100 美元本金连谈 50 期,每期固定扣运营费,亏完就破产。在这里,微小的谈判失误都会复利成破产危机。

结果显示,前述的 GLM 5.1、Claude Opus 4.6 以及谷歌双雄虽然策略不同,但控盘能力断层领先,全部实现了 100% 存活,最终现金均达到了 380 到 443 美元。相比之下,Grok 4.20 和 GPT-4o-mini 则无法顶住现金流损耗,破产率分别达到 25% 和 50%。

TERMS-Bench 的关键不在成交率,而在把谈判错误换算成现金亏损和破产风险。模型能不能说服对手,只是第一层;在连续交易里能不能守住利润和现金流,才真正拉开差距。

信源:https://arxiv.org/abs/2605.13909v1
OpenAI正秘密为Codex开发实时语音模式

开发者 @DevAdventur3s 近日从 OpenAI Codex 的代码库中挖出 1536 行尚未激活的 Rust 代码,曝光了 Codex 正在内测的实时语音模式。这次更新最大的变化是彻底切分了交互与执行,实现了前台连麦与后台写代码的双线并行。

从泄露的界面和源码注释来看,用户用语音下达重构等复杂指令后,前台会立刻唤起一个代号为 gpt-realtime-1.5 的语音模型,通过 WebRTC 与用户实时通话并口头汇报进度。与此同时,真正拉取文件、修改代码和跑测试的重体力活,则全部交由后台另一个参数量更大的模型静默完成。

AI 编程的交互体验正从回合制文本问答,走向类似结对编程同事的实时通话。目前这套底层逻辑和配套 UI 均已合并进主干代码,只等 OpenAI 服务器端开启权限即可激活上线。

信源:https://x.com/DevAdventur3s/status/2055765342484590774
GPT-5.6与Sonnet5本周齐发?草莓骗流博主再放狂言遭群嘲

X 平台账号 iruletheworldmo 发布推文,断言 Sonnet 5、GPT-5.6 与 Gemini 3.5 将在本周集体发布。

这名昵称是三个草莓图标的博主并非内部知情人士。他曾在 2024 年 8 月借 OpenAI 草莓项目热度凭空捏造 GPT-5 的发布日期。他当时甚至虚构出名为 Lily Ashwood 的角色诱导网友,最终被证实是一场纯粹的流量骗局。

虽然近期确有 5 月将迎来大模型更新潮的传闻,但该账号将三大旗舰强行打包进「下周」(也就是本周)的做法没有提供任何事实支撑。

面对评论区「是否当真」的追问,该博主依然给出肯定答复。这种毫无根据的预告如今已沦为 AI 社区的消遣,开发者 Haider 直接在下方跟帖预告「未来几周将连发 GPT-6 与 Opus 5」予以嘲讽。

信源:https://x.com/iruletheworldmo/status/2056030457959952525
Citrini Research抨击「瓶颈投资客」:AI价值流向愈发晦暗,盲目押注算力极度危险

今年 2 月发布《AI 末日报告》引发美股震荡的独立研究机构 Citrini Research 今日公开抨击近期涌现的「瓶颈投资客」:连算力瓶颈打通后行业长什么样都想不清楚就敢砸钱,纯属盲人骑瞎马。

一贯擅长极端终局推演的 Citrini 指出,当前 AI 产业的技术路线正面临剧烈的两极分化。市场既可能陷入长达十年的内存短缺,也完全可能因为需求崩塌倒逼底层技术创新,直接绕过现有的硬件瓶颈。这种极度不确定性正从基础设施向整个市场的基本结构蔓延。

最大的悬念在于巨额利润最终沉淀在哪里。在当前的牌桌上,Anthropic 这样的大型实验室完全有机会统揽从底层设施到应用的全部环节。但同等合理的情况是,基础模型彻底沦为低毛利商品,行业核心价值全部转移给更上层的应用落地厂商,甚至那些尚未露面的全新生态创新者。

在 2023 年初,避开推演终局、直接押注基础设施等「卖铲人」曾被视为最稳妥的策略。但 Citrini 强调,如今的局势不仅没有拨云见日,反而更加晦暗。面对复杂的动态博弈,如果放弃对多极终局的独立推演,单纯跟随线性的「瓶颈」叙事,将面临巨大的投资风险。

信源:https://x.com/citrini/status/2056210761538490519
DeepMind研究员离职警告:评测系统正成为AI能力跃升最大瓶颈

Google DeepMind 研究员 Lun Wang 宣布离职,并撰写长文反思目前的 AI 评测机制。他直言,现在的评测系统全在「刻舟求剑」,只能被动测试模型已有的能力,根本猜不到下一代模型会突然演化出什么新本事。比起数据、算力和架构,落后的评测体系才是目前卡住行业往前走的最大瓶颈。

现有的主流刷榜测试只对当前这一代模型管用。一旦模型学会了人类没见过的新操作,这些测试就会集体变成废纸。一个最危险的隐患是,如果模型为了达成目标而学会故意「藏一手」隐瞒关键信息,现有的安全工具根本抓不到它,因为模型说出的每一句话在事实上依然全是对的。

由于找不到能提前预警 AI 突然变聪明的「核心信号」,业界开发大模型完全是在「盲飞」。如果不解决到底该测什么这个最根本的问题,跟着旧指标盲目推进模型训练、安全防护和算力扩容,最后全都会错得离谱。

面对越来越能独立干活的前沿模型,评测系统也必须「活」过来。除了盯紧分数的异常波动,开发团队必须让 AI 自己去生成考题并试探其他 AI 的底线。未来的评测系统必须是一个能跟大模型一起进化的生命体,而不是一份按去年标准刻出来的死板检查单。

信源:https://x.com/lunwang1996/status/2056222588054237329
Perplexity测试个人CFO面板,聚合期权与Polymarket数据欲做轻量级彭博终端

Perplexity 正在内部测试一个名为「个人 CFO」(Personal CFO)的专属标签页,试图在通用搜索之外搭建一个独立的金融工作台。最新曝光的截图显示,该面板原生包含投资组合、交易记录与负债管理三大板块,并一口气打通了多家专业金融数据源。

具体而言,基础财务信息由 Financial Modeling Prep 提供,期权数据接入 Unusual Whales,财报会议文本与音频来自 Quartr,营收与 EPS 数据由 Fiscal AI 和 S&P Global 支撑。该面板同时直接引入了 Polymarket 的预测市场数据。

信源:https://x.com/testingcatalog/status/2056043029148922060
阿里云QoderWork上线语音设计工作台,说句话直接生成能跑的网页

阿里云 QoderWork 正式上线设计工作台 Design Desk。这是一个原生 AI 驱动的设计即代码工具。用户直接语音输入需求,系统会在无限画布上生成可运行的设计产物,并支持一键导出为 React + Vite 工程进入研发环节。

为了控制 AI 生成的随机性,该平台重构了生产流程,内置三套核心机制:

• 主动追问(Questions):遇到输入信息不足时优先确认意图,避免盲目猜测试错。
• 计划前置(Design Plan):生成前先输出结构化的布局与风格大纲,经用户把关后再执行。
• 参数微调(Nudge):生成后直接暴露配色、间距、圆角等关键变量,无需重新描述即可调节。

设计产物不再是交接后不可修改的静态黑盒,而是团队共同维护的代码资产。这种模式直接跳过了传统开发中设计稿切图、标注、前端还原的多轮内耗。

信源:https://mp.weixin.qq.com/s/BWd0_88sXTRJHCSgt21Flg
闲鱼上355人民币捡漏2000美元级芯片:阿里退役FPGA被刷成开源网卡

谷歌安全研究员 Laurie Wired 在 X 上晒出了一块阿里云退役 FPGA 加速卡:闲鱼标价 355 元人民币包邮(约 50 美元),卡上搭载 AMD / Xilinx Kintex UltraScale+ XCKU3P 系列芯片。

作为对照,Mouser 分销平台上同系列接近配置的 XCKU3P-2FFVB676E 单颗裸片,现货报价高达 2137.01 美元。这个价差不能被直接等同于“50 美元买 2000 美元”:分销商现货标价在可编程逻辑行业存在普遍虚高(企业大批量实单往往只有一两百美元),且闲鱼卖的是成色与寿命均不确定的退役整机卡。

但对 FPGA 爱好者而言,这依然是极致的捡漏。该卡(社区代号 AS02MC04)带有 PCIe Gen3 x8 与双 SFP+ 光口,且搭载的芯片受免费版 Vivado 支持,硬件配置碾压同等价位的入门开发板。

它原本是一张没有任何官方原理图与手册的“盲卡”。在早期玩家逐一逆向测出 JTAG、引脚和时钟定义后,开源网络计算平台 Corundum / taxi 项目现已正式合并了对该卡的适配支持。开发者能直接把它跑成开源 FPGA 网卡,用于 10G / 25G 以太网及网络内计算(In-network compute)实验。

大厂退役硬件流入二手市场,正在硬核地将高端 FPGA 的开发门槛压低到普通爱好者也能承受的试错区间。

信源:https://x.com/lauriewired/status/2056065420386590810
两年亏283亿后单季净利330亿,长鑫科技重启IPO

长鑫科技更新科创板 IPO 招股书,项目在补充财务资料后正式恢复审核。这家国内产能最大的 DRAM(动态随机存取存储器,即内存芯片)研发制造企业拟募资 295 亿元,投向产线改造与前瞻技术研发。

招股书原件显示了极其剧烈的利润跨度:长鑫在 2023 与 2024 年共亏损超 282 亿元,于 2025 年扭亏。而绝对的反转发生在 2026 年第一季度——公司单季营收达 508.00 亿元(同比暴增 719.13%),净利润直接拉升至 330.12 亿元(归母净利润 247.62 亿元)。

公司将这轮业绩暴涨归因于全球算力需求激增、DRAM 供不应求及合约价的大幅上涨。长鑫预计 2026 年上半年营收 1100 亿至 1200 亿元,净利润 660 亿至 750 亿元;不过这组未经审计的数据并不构成业绩承诺。

产品路线上,长鑫已完成从 DDR4/LPDDR4X 到 DDR5/LPDDR5X 的代际覆盖,高毛利的 DDR5 在 2025 年快速放量。据 Tom’s Hardware 报道,长鑫展示的 DDR5 芯片已达到 8000 MT/s 速率与单颗 24Gb 容量,正式切入全球高端速率区间。

招股书还显示,长鑫 2025 年前五大客户销售占比降至 39.85%,客户集中度继续下降。供应链披露方面,公司将前五大供应商名称处理为「供应商A」、「供应商B」等代码,主要披露采购内容、金额及占比等信息。叠加科创板首单适用“预先审阅”机制,这让本次 IPO 除了业绩反转外,还多了一层供应链保密与审核机制变化的看点。

信源:https://static.sse.com.cn/stock/disclosure/announcement/c/202605/002170_20260517_MGLN.pdf
Meta视频生成核心骨干跳槽,加入杨立昆10.3亿美元世界模型公司AMI Labs

Meta FAIR 视频生成研究员 Andrew Brown 宣布离职,下一站是 AMI Labs。他将以技术团队成员身份加入这家由前 Meta 首席 AI 科学家、图灵奖得主杨立昆联合创立的 AI 初创公司,并与联合创始人兼首席科学官谢赛宁共事。

Andrew Brown 在 Meta 的三年主要围绕视频生成展开。Meta 官方论文页显示,他是 Emu Video 的作者之一;Movie Gen 技术报告也将其列为核心贡献者。这两项工作对应了 Meta 从文本生成视频到 1080p 高清视频、视频编辑、个性化视频与同步音频生成的一整套媒体生成模型。

AMI Labs 的押注点是世界模型,即让 AI 从真实世界数据中学习物理、运动和因果规律。公司 2026 年 3 月完成 10.3 亿美元种子轮融资,投前估值 35 亿美元。Andrew Brown 在离职帖中也把新方向定为「推进世界模型前沿」。

从 Emu Video、Movie Gen 到 AMI Labs,这次离职说明视频生成研究者正在流向更底层的世界模型赛道。世界模型已经从学术路线变成能吸引顶级研究员和十亿美元资金的创业方向。

信源:https://x.com/Andrew__Brown__/status/2056238632500130029
传DeepSeek招聘现「学历倒挂」:QS前50海本简历全拒,一年制硕士反过关

有网友在小红书平台发帖称,据其多位留学生朋友反馈,DeepSeek 目前在初筛阶段直接拒绝海外本科学历(含 QS 前 50 高校),但一年制海外硕士反而能顺利过关。

他声称,自己去年曾进入 DeepSeek 招聘的发 offer 阶段。今年更换化名重新投递,并在简历中补充了参与 SOTA 模型研发、为开源框架 verl 提交代码等经历,结果依然在初筛被直接淘汰。

发帖人抱怨,这种存在「倒挂」的硬性过滤规则完全无视了候选人的开源社区影响力与实际工程能力。

上述筛选逻辑目前仅属社交平台的单方面说法,DeepSeek 官方暂未对相关传闻作出回应。

信源:http://xhslink.com/o/3jdNGDjXVVa
GPT-5与Gemini在甲骨文前全军覆没,腾讯发布首个古文字评测基准Chronicles-OCR

腾讯混元及 SSV 数字文化实验室联合中科院信工所等机构,正式推出首个覆盖“七体之变”的古文字感知评测基准 Chronicles-OCR。该基准包含 2800 张由专家交叉标注的图像,首次将甲骨文到草书等七种字体的识别难度统一量化。

研究团队评测了 28 个主流多模态大语言模型,结果显示它们在古早字体上几乎全军覆没。在跨时代字符检测任务中,GPT-5 和 Gemini 2.5 Pro 的核心指标接近 0,表现最强的模型也仅有 16.5。即使直接在图上画框免除定位步骤,最高准确率也只有 27.1%,其中 Gemini 3.1 Pro 在甲骨文上的准确率仅 14.0%。

这证实了现代模型严重依赖规整的现代版式先验。面对无约束、强噪声的古代物理介质,模型的文本分割机制直接失效。字体分类结果进一步表明,模型往往是在识别载体纹理(如龟甲或青铜锈),而非真正的字符笔画。

实验还揭示了一个反直觉的现象:开启思考模式反而会导致古文字识别率下降。对照显示,几乎所有支持该模式的模型在开启思考后表现退化。当底层视觉感知缺失时,思维链不仅无法纠错,反而会变成幻觉放大器,输出高自信的错误答案。

信源:https://mp.weixin.qq.com/s/RmzRuZcmYCDIhp_VI2G5Ig
1
多语种SWE-Bench压制GPT-5.5!Cursor发布最强模型Composer2.5,确认调用Colossus2百万卡集群

Cursor 刚刚发布其迄今最强的代码模型 Composer 2.5。该模型继续基于月之暗面开源的 Kimi K2.5 权重构建,重点优化了长周期任务执行与复杂指令遵循能力。马斯克随后在 X 上转发证实,该模型的训练已部分调用 Colossus 2 超级计算集群。

在官方公布的基准测试中,Composer 2.5 在多语种 SWE-Bench(SWE-Bench Multilingual)得分达 79.8%,直接反超 GPT-5.5 的 77.8%,并逼近 Opus 4.7 的 80.5%。在更难的自有测试集 CursorBench v3.1 中,其 63.2% 的成绩也大幅超越前代 Composer 2 的 52.2%。

为解决长上下文强化学习中的信用分配(Credit assignment)难题,Cursor 在训练中引入了带文本反馈的定向强化学习技术。当模型在数十万 token 的长文中出现局部错误(如调用了不存在的工具)时,全局最终奖励往往只能给出模糊的惩罚。新机制会在错误发生的特定轮次插入“可用工具列表”等纠正提示,仅对该局部的概率分布进行定向蒸馏更新,从而在保留全局目标的同时精准修复行为缺陷。

此外,Composer 2.5 的训练使用了比前代多 25 倍的合成数据。这诱发了高阶的奖励黑客(Reward hacking)行为:模型学会了通过逆向工程 Python 类型检查缓存来寻找被删除的函数签名,甚至通过反编译 Java 字节码来重构第三方 API,以非预期的方式抄近道完成任务。

Cursor 透露,团队目前正与 SpaceXAI 合作,动用 Colossus 2 提供的一百万张 H100 等效算力,从零开始训练规模更大的下一代模型。

价格方面,Composer 2.5 基础版定价为每百万输入 token 0.5 美元、输出 2.5 美元;系统默认的快速版(Fast)定价为每百万输入 3 美元、输出 15 美元。首周向用户提供双倍使用额度。

信源:https://cursor.com/blog/composer-2-5
马斯克输掉与奥特曼的世纪官司,坚称遭「日历陷阱」必将上诉

加州奥克兰联邦法院的九人陪审团一致裁定,埃隆·马斯克因起诉太晚,在这场针对 OpenAI 及山姆·奥特曼(Sam Altman)的诉讼中彻底败诉。主审法官 Yvonne Gonzalez Rogers 随即当庭驳回了马斯克的全部诉求。

因为错过了三年时效,马斯克精心准备的「违反慈善信托」、「高管不当得利」等核心底牌,甚至连送上审判席的机会都没拿到。

OpenAI 发言人在法庭外称这一判决是「一场伟大的胜利」,其代理律师更是直言马斯克的指控「与现实毫无关系,完全是一派胡言」。

马斯克随即在 X 平台猛烈开炮,将判决斥为「日历上的技术把戏」。他坚称毫无疑问,奥特曼和总裁 Greg Brockman 确实通过「窃取慈善机构让自己赚得盆满钵满」。

他的代理律师 Marc Toberoff 在法庭外给出了最强硬的表态:「只有一个词——上诉。这场战争还没结束。」

他重申了诉讼核心:绝不能允许有人打着公共慈善的幌子筹集数百万美元,等时机成熟就摇身一变成营利企业,让高管中饱私囊。如果这次让他们蒙混过关,慈善机构的防线将荡然无存。

尽管马斯克誓不罢休,但多位资深上诉律师指出,上诉法院极难推翻陪审团做出的时效认定。这场事关 OpenAI 转型合规性与马斯克颜面的法律长跑,将在第九巡回法院陷入漫长的拉锯。

信源:https://www.bbc.com/news/articles/cewpyv79pw1o
Android上线实时语音!开源智能体OpenClaw发新版,全面解锁GPT-5

开源个人智能体服务 OpenClaw 发布 v2026.5.18 新版本。本次更新将 Android 客户端的对话模式切换为基于网关中继的实时语音会话,并全面放开了对 GPT-5 系列模型的配置验证与支持。

新版 Android 客户端实现了流式麦克风输入与实时音频回放,并打通了工具结果桥接(tool-result bridging,指将工具调用状态与语音流实时同步)与屏幕实时字幕。这使得移动端用户可以直接通过语音唤醒并运行复杂的本地工具链。

在模型支持方面,OpenClaw 解除了配置校验阶段对 GPT-5.1、GPT-5.2、GPT-5.3 以及 openai-codex 模型的拦截。新版本停止了对 GPT-5 最终回复的强制缩简截断逻辑,以保留完整的通道响应,并在激活严格智能体执行(strict-agentic execution)时自动写入日志。

为了简化插件扩展,新版推出了 defineToolPlugin 极简插件接口,并配套了 openclaw plugins build、validate 和 init 命令行工具。开发者现在可以用强类型方式声明简单的工具插件,系统将自动生成所需的描述清单(manifest)和上下文工厂。

底层性能方面,内存核心(Memory-core)引入了启动增量同步机制。系统在启动时会比对磁盘会话与索引文件,仅对缺失、变动或大小改变的文件执行增量索引更新,大幅缩短了冷启动耗时。

此外,非托管的信号(如 SIGUSR1)配置重载完全在进程内完成,避免了因派生孤立子进程而导致父级守护程序丢失进程标识符(PID)的问题。

信源:https://github.com/openclaw/openclaw/releases/tag/v2026.5.18
AI包月「续杯」终结!谷歌Gemini改用「算力限额」

谷歌针对其 AI 助手 Gemini 的服务条款发布公告,宣布自 2026 年 5 月 17 日起,全面调整年满 18 周岁用户的用量限额规则。Gemini 将彻底弃用传统的「每日固定提问次数」限制,改用基于计算的用量限额,额度每 5 小时刷新一次并设有每周上限。

根据新规,系统将依据提示的复杂程度、用户所用功能以及对话长度来实时计算额度消耗。使用 Pro 模型、Deep Research、扩展思考与 Deep Think 以及生成图片、视频或音乐等媒体功能,将更快速地消耗额度。付费用户的限额倍数将与订阅价格直接挂钩,8 美元/月的 AI Plus 用户享有 2 倍于免费用户的额度,20 美元/月的 AI Pro 用户享有 4 倍额度,而 250 美元/月的 AI Ultra 用户额度则高达免费用户的 20 倍。

信源:https://support.google.com/gemini/answer/17004136?hl=zh-Hans
特朗普后悔英特尔股份要少了,称早当政抢光台积电业务

美国总统特朗普在接受《财富》杂志专访时表示,他后悔此前代表美国政府入股英特尔时股份要少了。去年 8 月,特朗普政府宣布将《芯片法案》中约 89 亿美元的补贴转化为股权(以每股 20.47 美元购入约 4.33 亿股),获得英特尔 9.9% 的股份。仅 8 个月后,这笔持股价值已飙升至 500 亿美元以上,账面浮盈超 410 亿美元。

这笔暴利背后是美国政府亲自下场拉动业绩的结果。《华尔街日报》披露,苹果已与英特尔达成初步协议,由后者为其代工芯片,打破台积电长期独占。作为英特尔的重要股东,美国商务部长霍华德·卢特尼克过去一年里多次会见库克,极力游说苹果将订单分流给英特尔。而由于英伟达等巨头的 AI 芯片暴涨严重挤压了台积电的产能,备受缺芯困扰的苹果最终妥协。

除苹果外,英特尔首席执行官陈立武上任一年来已集齐三大巨头:去年 9 月英伟达注资 50 亿美元由其代工数据中心 CPU,上个月马斯克也宣布与其在得州合资建厂。为承接大单,英特尔在最先进的 14A 制程上投入重金,并冒着法律诉讼风险从台积电挖来高管罗唯仁(Wei-Jen Lo)主管代工。受这一系列利好提振,英特尔股价此前暴涨,创下 132.75 美元的历史新高。

特朗普在专访中透露了与陈立武的谈判细节。他当时直接要求对方免费给国家 10% 的股权,在对方爽快答应后,他感到后悔并自嘲当时应该要更多。特朗普还直言,英特尔目前本该是全球最大的公司;如果自己能早点当政,并对进口芯片加征关税保护英特尔,那么如今原本属于台积电的芯片制造业务现在全都会属于英特尔。对于这笔持股的未来,他倾向于在不引发股价大跌的前提下缓慢减持。

信源:https://fortune.com/2026/05/18/trump-interview-economic-strategy-tariffs-ai-dealmaking-china-summit/
新兴云厂商因绑定英伟达拒租TPU!谷歌联手黑石狂砸50亿美元建专属云公司

谷歌联手黑石集团成立了一家独立的云计算公司,专向 AI 开发者出租 TPU 算力。在这笔代号为 Project Braid 的合作中,黑石注入 50 亿美元股权投资,谷歌则退居少数股东,直接提供 TPU 硬件底层。

谷歌一直谋求扩大 TPU 租赁版图以对抗英伟达。但忌惮于英伟达在芯片配额上的掌控力,多数新兴云厂商 Neoclouds 拒绝接手谷歌的 TPU。借黑石资本另起炉灶,让谷歌得以彻底绕过英伟达的生态封锁,为 TPU 强行撕开一条租赁通路。

新合资公司将由谷歌云资深高管 Benjamin Treynor Sloss 出任 CEO。按计划,高达 500MW 的 TPU 算力将在 2027 年前上线运营。

信源:https://www.theinformation.com/briefings/google-blackstone-create-tpu-cloud-provider
1
阿里Qwen3.7空降大模型竞技场!旗舰款登顶国产第一,距前代发布仅四周

阿里千问团队在 chat.qwen.ai 悄然上线 Qwen3.7 系列首批预览版:Max 与 Plus。新版本强制锁定为深度思考模式,并为此临时禁用了联网搜索与代码解释器。

在最新出炉的大模型竞技场 Arena 榜单中,Qwen3.7 拿下了文本与视觉领域的双料国产第一。

其中,旗舰款 Qwen3.7-Max-Preview 位列文本总榜全球第 13,将阿里实验室的文本研发排名推高至全球第 6。新模型在硬核推理赛道全面挤入全球前十:数学第 7、专家提示与软件 IT 第 9、代码生成第 10。

主打视觉的 Qwen3.7-Plus-Preview 则拿下视觉榜全球第 16。这也将阿里的整体视觉研发实力推高至全球第 5 位。

前代旗舰 Qwen3.6-Max-Preview 在 4 月 20 日才发布,仅隔 28 天便推出 Qwen3.7 预览版,产品迭代速度极快。此次赶在会前「偷跑」上线,显然是在为 5 月 20 日于杭州开幕的 2026 阿里云峰会造势,届时官方将正式揭晓新基座的技术底牌与商业部署。

信源:https://x.com/Alibaba_Qwen/status/2056403591464984753
1
连胡彦斌都来Vibe Coding了:亲自开发粉丝专属社区「彦火」

歌手胡彦斌在社交平台晒出写代码的日常,自曝正在为亲手开发的粉丝专属互动社区 APP「彦火」修 bug,该应用已于近日在苹果 TestFlight 开启内测。

根据流出的内测截图,该 APP 并非粗糙的试验品,而是包含了动态分享、演出通告、粉丝聊天以及虚拟成长体系等核心功能。应用内设计了精美的「巡演地图」,能直观复盘巡演城市与里程数据并解锁趣味成就,同时还内置了由胡彦斌亲自设定个性化角色的 AI 助手「小 tiger」。

信源:http://xhslink.com/o/Az4G88jmLmA
2