GPT-1作者Alec Radford新作:只喂1930年前的书训练LLM,不懂代码却能写Python
GPT-1/GPT-2 及 CLIP 的作者 Alec Radford 与多伦多大学教授 David Duvenaud、Nick Levine 发布 talkie-1930-13b,一个 130 亿参数的「复古语言模型」,训练数据全部来自 1930 年 12 月 31 日之前的英文文本,包括书籍、报纸、期刊、专利和判例法,共 2600 亿 token。这是目前已知最大的此类模型,权重已开源。
talkie 的后训练不使用任何现代聊天数据。团队从礼仪手册、百科全书、书信写作指南等历史文献中提取指令-回答对做微调,再用 Claude Sonnet 4.6 做偏好优化的评判模型。由于训练数据中没有任何计算机代码,talkie 天然不存在基准测试污染问题。团队在 HumanEval 编程测试中给它几个 Python 示例,它能写出简单的单行程序,比如看到旋转密码的编码函数后自行写出解码函数(把加法改成减法),显示出对逆函数概念的理解。
团队还用《纽约时报》「历史上的今天」近 5000 条事件描述测试模型的「未来预测」能力:1930 年后的事件对模型来说明显更令人意外(困惑度更高),到 1950-60 年代达到峰值后趋于平稳。下一步计划训练 GPT-3 级别的复古模型,语料可扩展到超万亿 token,目标达到初代 ChatGPT 水平,预计今年夏天发布。Anthropic 提供了算力支持。
信源:https://talkie-lm.com
GPT-1/GPT-2 及 CLIP 的作者 Alec Radford 与多伦多大学教授 David Duvenaud、Nick Levine 发布 talkie-1930-13b,一个 130 亿参数的「复古语言模型」,训练数据全部来自 1930 年 12 月 31 日之前的英文文本,包括书籍、报纸、期刊、专利和判例法,共 2600 亿 token。这是目前已知最大的此类模型,权重已开源。
talkie 的后训练不使用任何现代聊天数据。团队从礼仪手册、百科全书、书信写作指南等历史文献中提取指令-回答对做微调,再用 Claude Sonnet 4.6 做偏好优化的评判模型。由于训练数据中没有任何计算机代码,talkie 天然不存在基准测试污染问题。团队在 HumanEval 编程测试中给它几个 Python 示例,它能写出简单的单行程序,比如看到旋转密码的编码函数后自行写出解码函数(把加法改成减法),显示出对逆函数概念的理解。
团队还用《纽约时报》「历史上的今天」近 5000 条事件描述测试模型的「未来预测」能力:1930 年后的事件对模型来说明显更令人意外(困惑度更高),到 1950-60 年代达到峰值后趋于平稳。下一步计划训练 GPT-3 级别的复古模型,语料可扩展到超万亿 token,目标达到初代 ChatGPT 水平,预计今年夏天发布。Anthropic 提供了算力支持。
信源:https://talkie-lm.com
YouTube上线AI对话搜索:问问题返回视频+文字摘要,Premium用户先用
谷歌在 YouTube 测试名为「Ask YouTube」的 AI 对话式搜索功能。用户在搜索栏点击「Ask YouTube」按钮后,可以用自然语言提问,YouTube 返回由 AI 生成的文字摘要,并搭配长视频、Shorts 和分类推荐,整合在同一个结果页中。页面底部还提供后续问题建议和追问输入框,支持多轮对话。
该功能目前限定美国地区 18 岁以上的 YouTube Premium 订阅用户,通过 YouTube 实验室页面开启。YouTube 官方表示已在推进向非 Premium 用户开放。
《The Verge》记者实测发现 AI 生成的文字摘要存在事实错误:在介绍 Valve 旧款 Steam 手柄时,AI 称该手柄没有摇杆,实际上旧款有一个摇杆。这与谷歌搜索的 AI Mode 类似,生成内容仍需用户自行核实。
信源:https://www.theverge.com/streaming/919441/google-ask-youtube-ai-chatbot-search
谷歌在 YouTube 测试名为「Ask YouTube」的 AI 对话式搜索功能。用户在搜索栏点击「Ask YouTube」按钮后,可以用自然语言提问,YouTube 返回由 AI 生成的文字摘要,并搭配长视频、Shorts 和分类推荐,整合在同一个结果页中。页面底部还提供后续问题建议和追问输入框,支持多轮对话。
该功能目前限定美国地区 18 岁以上的 YouTube Premium 订阅用户,通过 YouTube 实验室页面开启。YouTube 官方表示已在推进向非 Premium 用户开放。
《The Verge》记者实测发现 AI 生成的文字摘要存在事实错误:在介绍 Valve 旧款 Steam 手柄时,AI 称该手柄没有摇杆,实际上旧款有一个摇杆。这与谷歌搜索的 AI Mode 类似,生成内容仍需用户自行核实。
信源:https://www.theverge.com/streaming/919441/google-ask-youtube-ai-chatbot-search
The Verge
Google is testing AI chatbot search for YouTube
Get ready to “Ask YouTube.”
Kimi K2.6上线一周登顶OpenRouter,用量超Claude Sonnet 4.6近40%
月之暗面旗舰模型 Kimi K2.6 在 OpenRouter 本周 LLM 排行榜以 1.88T token 用量登顶第一,周环比暴涨 7683%。该模型 4 月 20 日上架 OpenRouter,一周内即超越此前长期占据前两位的 Claude Sonnet 4.6(1.35T)和 DeepSeek V3.2(1.24T)。
前十名中,Anthropic 占三席:Claude Sonnet 4.6 第二(1.35T,↓3%)、Claude Opus 4.7 第四(1.17T,↑180%)、Claude Opus 4.6 第九(662B,↓42%)。Opus 4.7 是本周第二大增长模型,用量近乎翻三倍。谷歌 Gemini 3 Flash Preview 排第五(1.03T,↓11%),阶跃星辰 Step 3.5 Flash(762B,↑78%)和英伟达 Nemotron 3 Super free(656B,↑25%)涨幅也较明显。
OpenRouter 排行榜按各模型在平台上的实际 token 消耗量排名,反映开发者在 API 层面的真实调用偏好。
信源:https://openrouter.ai/rankings
月之暗面旗舰模型 Kimi K2.6 在 OpenRouter 本周 LLM 排行榜以 1.88T token 用量登顶第一,周环比暴涨 7683%。该模型 4 月 20 日上架 OpenRouter,一周内即超越此前长期占据前两位的 Claude Sonnet 4.6(1.35T)和 DeepSeek V3.2(1.24T)。
前十名中,Anthropic 占三席:Claude Sonnet 4.6 第二(1.35T,↓3%)、Claude Opus 4.7 第四(1.17T,↑180%)、Claude Opus 4.6 第九(662B,↓42%)。Opus 4.7 是本周第二大增长模型,用量近乎翻三倍。谷歌 Gemini 3 Flash Preview 排第五(1.03T,↓11%),阶跃星辰 Step 3.5 Flash(762B,↑78%)和英伟达 Nemotron 3 Super free(656B,↑25%)涨幅也较明显。
OpenRouter 排行榜按各模型在平台上的实际 token 消耗量排名,反映开发者在 API 层面的真实调用偏好。
信源:https://openrouter.ai/rankings
OpenAI开源React语音控件:用gpt-realtime-1.5让用户开口操控App
OpenAI 开源了 realtime-voice-component,一套 React 组件库,让开发者把语音操控能力嵌入现有 Web 应用。用户对着麦克风说话,模型通过开发者预定义的工具(tool)直接调用 App 功能,而非生成自由文本回复。该库基于 OpenAI Realtime API,搭配旗舰语音模型 gpt-realtime-1.5 使用,采用 Apache-2.0 许可。
核心设计是「App 拥有状态,语音只是调用者」。开发者用
该库定位为参考实现和教学用途,未发布到 npm,README 明确标注「不是生产级 UI 框架的承诺」。
信源:https://github.com/openai/realtime-voice-component/
OpenAI 开源了 realtime-voice-component,一套 React 组件库,让开发者把语音操控能力嵌入现有 Web 应用。用户对着麦克风说话,模型通过开发者预定义的工具(tool)直接调用 App 功能,而非生成自由文本回复。该库基于 OpenAI Realtime API,搭配旗舰语音模型 gpt-realtime-1.5 使用,采用 Apache-2.0 许可。
核心设计是「App 拥有状态,语音只是调用者」。开发者用
defineVoiceTool() 把 App 动作注册为语音工具,`createVoiceControlController()` 管理会话和连接生命周期,`VoiceControlWidget` 提供启动按钮,可选的 `GhostCursorOverlay`(幽灵光标)在屏幕上显示 AI 正在操作的位置,给用户视觉确认。仓库附带一个教学用 demo,包含主题切换、多步表单和国际象棋对弈三个场景。该库定位为参考实现和教学用途,未发布到 npm,README 明确标注「不是生产级 UI 框架的承诺」。
信源:https://github.com/openai/realtime-voice-component/
GitHub
GitHub - openai/realtime-voice-component
Contribute to openai/realtime-voice-component development by creating an account on GitHub.
让AI用人类看不懂的符号思考,答题一样准但快12倍
论文「Thinking Without Words」提出 Abstract-CoT:给模型的词表里塞进 64 个全新的「抽象符号」,这些符号不对应任何人类语言,模型在回答问题前先输出一小串这种符号当草稿纸,然后直接给答案,跳过传统的长篇自然语言推理过程。
效果:在 MATH-500 数学题上,推理过程从几百个 token 压缩到几十个,token 用量减少最高 11.6 倍,答对率不变。AlpacaEval 指令跟随测试上分数反而更高。实验覆盖 Qwen3-8B、Qwen3-4B 和 IBM Granite 4.0 Micro 三个模型家族,效果一致。
更有意思的是,这 64 个符号在训练过程中自发形成了类似自然语言的使用规律:少数符号被高频复用,多数符号偶尔出现,分布曲线和人类语言中「的、是、了」远多于生僻字的规律一致。把符号顺序打乱后答题准确率明显下降,说明模型确实学会了用这套「密码」做有结构的推理,而非随便输出占位符。
信源:https://arxiv.org/abs/2604.22709
论文「Thinking Without Words」提出 Abstract-CoT:给模型的词表里塞进 64 个全新的「抽象符号」,这些符号不对应任何人类语言,模型在回答问题前先输出一小串这种符号当草稿纸,然后直接给答案,跳过传统的长篇自然语言推理过程。
效果:在 MATH-500 数学题上,推理过程从几百个 token 压缩到几十个,token 用量减少最高 11.6 倍,答对率不变。AlpacaEval 指令跟随测试上分数反而更高。实验覆盖 Qwen3-8B、Qwen3-4B 和 IBM Granite 4.0 Micro 三个模型家族,效果一致。
更有意思的是,这 64 个符号在训练过程中自发形成了类似自然语言的使用规律:少数符号被高频复用,多数符号偶尔出现,分布曲线和人类语言中「的、是、了」远多于生僻字的规律一致。把符号顺序打乱后答题准确率明显下降,说明模型确实学会了用这套「密码」做有结构的推理,而非随便输出占位符。
信源:https://arxiv.org/abs/2604.22709
arXiv.org
Thinking Without Words: Efficient Latent Reasoning with Abstract...
While long, explicit chains-of-thought (CoT) have proven effective on complex reasoning tasks, they are costly to generate during inference. Non-verbal reasoning methods have emerged with shorter...
美团悄悄发布全新大模型:没有公告,没有开源
美团在 LongCat API 平台上线了新模型 LongCat-2.0-Preview,更新日志日期为 4 月 20 日,但美团至今未发布任何官方公告或技术报告。此前 LongCat 系列每款模型(Flash-Chat、Flash-Thinking、Flash-Lite、Flash-Omni、Next)发布时均配有官方博客、技术报告,并同步在 Hugging Face 和 GitHub 开源。2.0-Preview 的更新日志中没有任何开源链接,仅通过 API 提供服务。
更新日志仅列出三项能力:面向 agent 开发,原生支持工具调用、多步推理和长上下文任务;擅长代码生成、自动化工作流和复杂指令执行;深度集成 Claude Code、OpenClaw、OpenCode 和 Kilo Code。
4 月 24 日,多家媒体援引知情人士报道了更多细节:该模型总参数突破万亿,采用 MoE 架构,支持 1M 上下文窗口,参数量与同日发布的 DeepSeek V4 基本一致。知情人士称 LongCat-2.0-Preview 训练推理全程基于国产算力集群完成,动用 5 到 6 万张国产加速卡,是迄今国产算力完成的最大规模训练任务。测试期间每日提供 1000 万 token 免费额度。
信源:https://longcat.chat/platform/docs/ChangeLog.html
美团在 LongCat API 平台上线了新模型 LongCat-2.0-Preview,更新日志日期为 4 月 20 日,但美团至今未发布任何官方公告或技术报告。此前 LongCat 系列每款模型(Flash-Chat、Flash-Thinking、Flash-Lite、Flash-Omni、Next)发布时均配有官方博客、技术报告,并同步在 Hugging Face 和 GitHub 开源。2.0-Preview 的更新日志中没有任何开源链接,仅通过 API 提供服务。
更新日志仅列出三项能力:面向 agent 开发,原生支持工具调用、多步推理和长上下文任务;擅长代码生成、自动化工作流和复杂指令执行;深度集成 Claude Code、OpenClaw、OpenCode 和 Kilo Code。
4 月 24 日,多家媒体援引知情人士报道了更多细节:该模型总参数突破万亿,采用 MoE 架构,支持 1M 上下文窗口,参数量与同日发布的 DeepSeek V4 基本一致。知情人士称 LongCat-2.0-Preview 训练推理全程基于国产算力集群完成,动用 5 到 6 万张国产加速卡,是迄今国产算力完成的最大规模训练任务。测试期间每日提供 1000 万 token 免费额度。
信源:https://longcat.chat/platform/docs/ChangeLog.html
英伟达Nemotron 3 Nano Omni开源:单模型统一视觉音频文本,吞吐比同类高9倍
英伟达发布 Nemotron 3 Nano Omni,一个开源多模态模型,将视觉、音频和文本理解统一进单个模型,替代传统 agent 系统中视觉、语音、语言各跑一个模型的做法。模型采用 30B-A3B 混合 MoE(混合专家,按任务激活所需专家模块)架构,开放权重、数据集和训练方法。
在文档智能、视频和音频理解方面,Nemotron 3 Nano Omni 登顶 6 项排行榜,包括 MMlongbench-Doc、OCRBenchV2、WorldSense、DailyOmni 和 VoiceBench。在保持相同用户交互响应速度的前提下,视频推理场景系统吞吐约为同类开源 omni 模型的 9.2 倍,多文档推理约为 7.4 倍。
模型支持 FP8 和 NVFP4 量化,可部署在从 Jetson 边缘设备到数据中心的全链路硬件上。已有 H Company、富士康、Palantir 等公司采用或评估。Nemotron 3 家族过去一年下载量超 5000 万次。
信源:https://blogs.nvidia.com/blog/nemotron-3-nano-omni-multimodal-ai-agents/
英伟达发布 Nemotron 3 Nano Omni,一个开源多模态模型,将视觉、音频和文本理解统一进单个模型,替代传统 agent 系统中视觉、语音、语言各跑一个模型的做法。模型采用 30B-A3B 混合 MoE(混合专家,按任务激活所需专家模块)架构,开放权重、数据集和训练方法。
在文档智能、视频和音频理解方面,Nemotron 3 Nano Omni 登顶 6 项排行榜,包括 MMlongbench-Doc、OCRBenchV2、WorldSense、DailyOmni 和 VoiceBench。在保持相同用户交互响应速度的前提下,视频推理场景系统吞吐约为同类开源 omni 模型的 9.2 倍,多文档推理约为 7.4 倍。
模型支持 FP8 和 NVFP4 量化,可部署在从 Jetson 边缘设备到数据中心的全链路硬件上。已有 H Company、富士康、Palantir 等公司采用或评估。Nemotron 3 家族过去一年下载量超 5000 万次。
信源:https://blogs.nvidia.com/blog/nemotron-3-nano-omni-multimodal-ai-agents/
NVIDIA Blog
NVIDIA Launches Nemotron 3 Nano Omni Model, Unifying Vision, Audio and Language for up to 9x More Efficient AI Agents
Best-in-class open omni-modal reasoning model delivers the highest efficiency and accuracy to power agentic workflows such as computer use, document intelligence and audio-video reasoning.
❤1
GPT-5.5、Codex和托管Agent三件套同日登陆AWS Bedrock
OpenAI 与 AWS 宣布三项产品同步进入 limited preview:GPT-5.5 等 OpenAI 模型上线 Amazon Bedrock,Codex 可直接以 Bedrock 为后端运行,以及由 OpenAI 驱动的 Amazon Bedrock Managed Agents 托管 agent 服务。这是 OpenAI 闭源模型首次在微软 Azure 之外的云平台上直接可用。
Codex 目前周活超过 400 万人,用途已从代码生成扩展到研究分析、文档摘要、幻灯片和电子表格制作。接入 Bedrock 后,Codex CLI、桌面应用和 VS Code 扩展均可切换至 Bedrock 作为模型提供方,用量可直接抵扣企业的 AWS 承诺消费额度。Managed Agents 则让企业在 AWS 环境内部署可保持上下文、执行多步工作流、调用工具的 agent,由 AWS 处理编排、治理和安全合规。
信源:https://openai.com/index/openai-on-aws/
OpenAI 与 AWS 宣布三项产品同步进入 limited preview:GPT-5.5 等 OpenAI 模型上线 Amazon Bedrock,Codex 可直接以 Bedrock 为后端运行,以及由 OpenAI 驱动的 Amazon Bedrock Managed Agents 托管 agent 服务。这是 OpenAI 闭源模型首次在微软 Azure 之外的云平台上直接可用。
Codex 目前周活超过 400 万人,用途已从代码生成扩展到研究分析、文档摘要、幻灯片和电子表格制作。接入 Bedrock 后,Codex CLI、桌面应用和 VS Code 扩展均可切换至 Bedrock 作为模型提供方,用量可直接抵扣企业的 AWS 承诺消费额度。Managed Agents 则让企业在 AWS 环境内部署可保持上下文、执行多步工作流、调用工具的 agent,由 AWS 处理编排、治理和安全合规。
信源:https://openai.com/index/openai-on-aws/
OpenAI
OpenAI models, Codex, and Managed Agents come to AWS
OpenAI GPT models, Codex, and Managed Agents are now available on AWS, enabling enterprises to build secure AI in their AWS environments.
OpenAI内部预测:Plus订户今年暴跌80%,广告2030年成最大收入来源
OpenAI 内部预测显示,公司今年消费者订阅结构将发生剧烈翻转:8 美元/月的广告版 ChatGPT Go 订户预计从年初约 310 万猛涨 36 倍至 1.12 亿,而 20 美元/月的 ChatGPT Plus 订户将从约 4500 万暴跌 80% 至约 900 万。Go 在订阅用户中的占比将从去年的 7% 升至年底 92%,Plus 则从 92% 降至 7%,增长主要来自 Plus 用户降级。消费者总订户预计翻倍达 1.22 亿,2030 年 3.06 亿。
大量用户涌入低价档的直接后果是 ARPU 腰斩:平均每位订户月费从去年约 23 美元降至明年不到 12 美元。OpenAI 的对策是广告补血。公司预测广告今年贡献约 24 亿美元营收,明年翻四倍至近 110 亿美元,到 2030 年达约 1020 亿美元,届时将成为公司最大收入来源,占总营收约 36%。今年总营收预计仍翻倍至 300 亿美元,2030 年 2840 亿美元。
这个预测的难题在时间差:广告业务 2 月才启动试点,3 月底年化收入约 1 亿美元,但全年目标已定在 24 亿美元。同时公司一季度已错过内部营收目标。Go 于去年 8 月在印度推出、今年 1 月全球上线,约 90% 的周活跃用户在美国以外,大部分 Go 增长料将来自海外市场。
信源:https://www.theinformation.com/articles/openai-sees-8-chatgpt-driving-consumer-subscribers-122-million-year
OpenAI 内部预测显示,公司今年消费者订阅结构将发生剧烈翻转:8 美元/月的广告版 ChatGPT Go 订户预计从年初约 310 万猛涨 36 倍至 1.12 亿,而 20 美元/月的 ChatGPT Plus 订户将从约 4500 万暴跌 80% 至约 900 万。Go 在订阅用户中的占比将从去年的 7% 升至年底 92%,Plus 则从 92% 降至 7%,增长主要来自 Plus 用户降级。消费者总订户预计翻倍达 1.22 亿,2030 年 3.06 亿。
大量用户涌入低价档的直接后果是 ARPU 腰斩:平均每位订户月费从去年约 23 美元降至明年不到 12 美元。OpenAI 的对策是广告补血。公司预测广告今年贡献约 24 亿美元营收,明年翻四倍至近 110 亿美元,到 2030 年达约 1020 亿美元,届时将成为公司最大收入来源,占总营收约 36%。今年总营收预计仍翻倍至 300 亿美元,2030 年 2840 亿美元。
这个预测的难题在时间差:广告业务 2 月才启动试点,3 月底年化收入约 1 亿美元,但全年目标已定在 24 亿美元。同时公司一季度已错过内部营收目标。Go 于去年 8 月在印度推出、今年 1 月全球上线,约 90% 的周活跃用户在美国以外,大部分 Go 增长料将来自海外市场。
信源:https://www.theinformation.com/articles/openai-sees-8-chatgpt-driving-consumer-subscribers-122-million-year
The Information
OpenAI Sees $8 ChatGPT Driving Consumer Subscribers to 122 Million This Year
For three years, OpenAI has generated most of its revenue from people paying $20 a month for subscriptions to ChatGPT. This year, it is forecasting a massive shift, expecting a cheaper, ad-supported tier will both draw new users and cause tens of millions…
陈天桥Manus事件后对MiroMind实施中美防火墙:禁止跨境共享代码和数据
盛大集团创始人陈天桥对旗下 AI 公司 MiroMind 实施中美业务全面隔离:禁止跨境共享信息或代码,最小化人员、数据和资产流动,各地区业务由当地团队独立运营。陈天桥称此举是受到 Manus 收购风波的直接影响。
起因是 Meta 收购 Manus 引发北京监管审查后,监管部门 3 月联系了陈天桥团队,警告不得单方面将技术转移出境。陈天桥向《彭博商业周刊》表示,在说明内部防火墙方案后问题已得到解决,但他在北京周一宣布叫停 Meta 收购后仍坚持推进隔离改革。
陈天桥原话:「以前我相信可以汇聚中国和全球人才为人类未来做贡献,但 Manus 事件之后,我们不得不全面实施防火墙」「这种做法有种『自断手脚』的感觉,但在当前监管环境下,这是必要的妥协」「国际环境极其复杂,企业实际上别无选择,只能选边站」。
陈天桥已向 MiroMind 投入 1 亿美元,来自盛大集团承诺的 20 亿美元「可发现 AI」总投资。公司目前有 60 多名科学家,分布在新加坡、东京和西雅图,计划今年下半年启动首轮外部融资。此前关键科学家、清华大学副教授代季峰离开 MiroMind,双方对离职原因说法相左。
陈天桥是中国最早一批受益于美国资本的科技创始人。盛大 2004 年在纳斯达克上市融资 1.52 亿美元,陈天桥 30 岁成为亿万富翁。他已旅居海外 16 年,先在新加坡,后搬至加州。对今天的中国 AI 创业者而言,这条路越来越难走。
信源:https://www.bloomberg.com/news/articles/2026-04-28/chinese-billionaire-overhauls-ai-startup-after-warning-on-manus
盛大集团创始人陈天桥对旗下 AI 公司 MiroMind 实施中美业务全面隔离:禁止跨境共享信息或代码,最小化人员、数据和资产流动,各地区业务由当地团队独立运营。陈天桥称此举是受到 Manus 收购风波的直接影响。
起因是 Meta 收购 Manus 引发北京监管审查后,监管部门 3 月联系了陈天桥团队,警告不得单方面将技术转移出境。陈天桥向《彭博商业周刊》表示,在说明内部防火墙方案后问题已得到解决,但他在北京周一宣布叫停 Meta 收购后仍坚持推进隔离改革。
陈天桥原话:「以前我相信可以汇聚中国和全球人才为人类未来做贡献,但 Manus 事件之后,我们不得不全面实施防火墙」「这种做法有种『自断手脚』的感觉,但在当前监管环境下,这是必要的妥协」「国际环境极其复杂,企业实际上别无选择,只能选边站」。
陈天桥已向 MiroMind 投入 1 亿美元,来自盛大集团承诺的 20 亿美元「可发现 AI」总投资。公司目前有 60 多名科学家,分布在新加坡、东京和西雅图,计划今年下半年启动首轮外部融资。此前关键科学家、清华大学副教授代季峰离开 MiroMind,双方对离职原因说法相左。
陈天桥是中国最早一批受益于美国资本的科技创始人。盛大 2004 年在纳斯达克上市融资 1.52 亿美元,陈天桥 30 岁成为亿万富翁。他已旅居海外 16 年,先在新加坡,后搬至加州。对今天的中国 AI 创业者而言,这条路越来越难走。
信源:https://www.bloomberg.com/news/articles/2026-04-28/chinese-billionaire-overhauls-ai-startup-after-warning-on-manus
Bloomberg.com
Chinese Billionaire Overhauls AI Startup After Warning on Manus
The fallout from Meta Platforms Inc.’s controversial acquisition of Manus is prompting one tech founder to erect strict walls between his Chinese and US businesses, calling it a regrettable but necessary template for navigating geopolitical tensions.
Warp客户端开源:5年闭源终转AGPL,OpenAI赞助agent驱动贡献流程
AI 终端工具 Warp 宣布客户端全量开源,代码托管在 GitHub,主体采用 AGPL v3 许可,UI 框架 warpui_core 和 warpui 两个 crate 采用 MIT 许可。Warp 用 Rust 编写,经过 5 年闭源开发,活跃开发者近百万。
OpenAI 是开源仓库的「founding sponsor」,社区贡献流程由 Warp 自研的云 agent 编排平台 Oz 管理,背后跑 GPT 模型。整套流程的设计思路是让 agent 承担编码、规划和测试,人类负责提想法、把方向和验收。贡献者提交 issue 或功能请求后,Warp 团队标记就绪状态,Oz 自动分配 agent 编写 spec 和代码,再由人工审核合并。贡献者也可以用 Claude Code、Codex、Gemini CLI 等其他编程 agent,不限于 Oz。
Warp 创始人在博文中解释开源时机:当前开发瓶颈不再是写代码,而是产品设计和行为验证等需要人参与的环节,邀请社区帮忙管理 agent 能加速这部分。他提到 Warp 每年都讨论过是否开源,今年 agent 的成熟度让天平第一次倒向开源。
同步上线三项产品更新:新增 Kimi、MiniMax、Qwen 等开源模型支持,加入「auto (open)」路由自动选最优开源模型;支持在纯终端、带 diff 视图和文件树的轻量模式、完整 ADE 三种形态间切换;新增 settings 文件,方便跨设备同步配置。
信源:https://www.warp.dev/blog/warp-is-now-open-source
AI 终端工具 Warp 宣布客户端全量开源,代码托管在 GitHub,主体采用 AGPL v3 许可,UI 框架 warpui_core 和 warpui 两个 crate 采用 MIT 许可。Warp 用 Rust 编写,经过 5 年闭源开发,活跃开发者近百万。
OpenAI 是开源仓库的「founding sponsor」,社区贡献流程由 Warp 自研的云 agent 编排平台 Oz 管理,背后跑 GPT 模型。整套流程的设计思路是让 agent 承担编码、规划和测试,人类负责提想法、把方向和验收。贡献者提交 issue 或功能请求后,Warp 团队标记就绪状态,Oz 自动分配 agent 编写 spec 和代码,再由人工审核合并。贡献者也可以用 Claude Code、Codex、Gemini CLI 等其他编程 agent,不限于 Oz。
Warp 创始人在博文中解释开源时机:当前开发瓶颈不再是写代码,而是产品设计和行为验证等需要人参与的环节,邀请社区帮忙管理 agent 能加速这部分。他提到 Warp 每年都讨论过是否开源,今年 agent 的成熟度让天平第一次倒向开源。
同步上线三项产品更新:新增 Kimi、MiniMax、Qwen 等开源模型支持,加入「auto (open)」路由自动选最优开源模型;支持在纯终端、带 diff 视图和文件树的轻量模式、完整 ADE 三种形态间切换;新增 settings 文件,方便跨设备同步配置。
信源:https://www.warp.dev/blog/warp-is-now-open-source
Warp
Warp is now open-source
Warp is now open-source, and the community can participate in building it using an agent-first workflow managed by Oz, our cloud agent orchestration platform.
马斯克诉OpenAI案法官当庭训话:管住你们发社交媒体的冲动
马斯克诉 OpenAI 案主审法官 Gonzalez Rogers 在周二开庭陈述前当庭警告双方,要求「管住你们用社交媒体让庭外局势恶化的冲动」。前一天双方在 X 上密集互喷,马斯克还付费推广 Altman 负面报道。马斯克当庭辩称自己是在 OpenAI 先公开发帖后才回击,法官随即提议「从今天起翻篇重来」,马斯克、Altman 和 Brockman 三人同意。
庭审正式进入开庭陈述阶段。陪审团将审查 OpenAI 创始人之间多年的邮件、短信和公司文件,判断领导层是否在转向营利和接受微软投资时背弃了创立原则。预计出庭作证的证人包括微软 CEO Nadella、OpenAI 前高管 Mira Murati 和 Ilya Sutskever,以及马斯克数名子女的母亲、OpenAI 前董事 Shivon Zilis。陪审团预计 5 月 12 日前开始评议。
信源:https://www.bloomberg.com/news/articles/2026-04-28/judge-lectures-musk-altman-on-trading-social-media-barbs
马斯克诉 OpenAI 案主审法官 Gonzalez Rogers 在周二开庭陈述前当庭警告双方,要求「管住你们用社交媒体让庭外局势恶化的冲动」。前一天双方在 X 上密集互喷,马斯克还付费推广 Altman 负面报道。马斯克当庭辩称自己是在 OpenAI 先公开发帖后才回击,法官随即提议「从今天起翻篇重来」,马斯克、Altman 和 Brockman 三人同意。
庭审正式进入开庭陈述阶段。陪审团将审查 OpenAI 创始人之间多年的邮件、短信和公司文件,判断领导层是否在转向营利和接受微软投资时背弃了创立原则。预计出庭作证的证人包括微软 CEO Nadella、OpenAI 前高管 Mira Murati 和 Ilya Sutskever,以及马斯克数名子女的母亲、OpenAI 前董事 Shivon Zilis。陪审团预计 5 月 12 日前开始评议。
信源:https://www.bloomberg.com/news/articles/2026-04-28/judge-lectures-musk-altman-on-trading-social-media-barbs
Bloomberg.com
OpenAI Trial Judge Lectures Musk, Altman on Trading Social Media Barbs
The judge overseeing a high-profile court case between Elon Musk and OpenAI has asked the tech executives involved in the legal battle to refrain from posting too much on social media, one day after the world’s richest person made a series of jabs at the…
马斯克出庭称OpenAI「偷慈善」,旧邮件曝其团队曾拟给他55%股权
马斯克诉 OpenAI 案周二进入开庭陈述和证人作证阶段。马斯克作为己方首位证人出庭,称 OpenAI 的营利化转型是「偷了一家慈善机构」,「如果得逞,等于给全美慈善机构的被洗劫开了先例」。他索赔 1500 亿美元,并要求撤销 OpenAI 营利化。OpenAI 目前估值约 7300 亿美元。
双方开庭陈述针锋相对。马斯克律师 Molo 将 OpenAI 比作「博物馆商店抢了博物馆,偷走毕加索拿去牟利」。OpenAI 律师 Savitt 回击称这是「吃不到葡萄」:马斯克 2018 年走人后,对微软次年投 10 亿美元毫无异议,直到 ChatGPT 爆红才翻脸。「我的客户有胆量在没有他的情况下做成了,马斯克不高兴了。」Savitt 当庭展示马斯克离职前其幕僚长的邮件,邮件中拟给马斯克营利实体 55% 股权,给 Altman 仅 7.5%。
马斯克在证词中自称 OpenAI 的推动者:「我起了名字、招了关键的人、拉了资金。」他承认参与过设立营利实体的讨论,但称底线是营利部分要小,「尾巴不能摇狗」。他说最终走人是因为其他创始人在营利实体中要的股权太多,过程「非常烦人」。他还讲述了 OpenAI 的起源:谷歌联合创始人 Larry Page 在一次谈话中称他是「物种主义者」(偏袒人类而非未来的数字生命),促使他决定创建 OpenAI 来制衡谷歌。
微软律师 Cohen 称马斯克在 OpenAI 设立营利实体期间持续捐款、从未反对,ChatGPT 成功后才起诉。Cohen 还透露 2023 年 Altman 被董事会解雇时微软事先完全不知情。马斯克周三继续作证。
信源:https://www.nytimes.com/live/2026/04/28/technology/openai-sam-altman-elon-musk-trial?smid=tw-nytimes&smtyp=cur
马斯克诉 OpenAI 案周二进入开庭陈述和证人作证阶段。马斯克作为己方首位证人出庭,称 OpenAI 的营利化转型是「偷了一家慈善机构」,「如果得逞,等于给全美慈善机构的被洗劫开了先例」。他索赔 1500 亿美元,并要求撤销 OpenAI 营利化。OpenAI 目前估值约 7300 亿美元。
双方开庭陈述针锋相对。马斯克律师 Molo 将 OpenAI 比作「博物馆商店抢了博物馆,偷走毕加索拿去牟利」。OpenAI 律师 Savitt 回击称这是「吃不到葡萄」:马斯克 2018 年走人后,对微软次年投 10 亿美元毫无异议,直到 ChatGPT 爆红才翻脸。「我的客户有胆量在没有他的情况下做成了,马斯克不高兴了。」Savitt 当庭展示马斯克离职前其幕僚长的邮件,邮件中拟给马斯克营利实体 55% 股权,给 Altman 仅 7.5%。
马斯克在证词中自称 OpenAI 的推动者:「我起了名字、招了关键的人、拉了资金。」他承认参与过设立营利实体的讨论,但称底线是营利部分要小,「尾巴不能摇狗」。他说最终走人是因为其他创始人在营利实体中要的股权太多,过程「非常烦人」。他还讲述了 OpenAI 的起源:谷歌联合创始人 Larry Page 在一次谈话中称他是「物种主义者」(偏袒人类而非未来的数字生命),促使他决定创建 OpenAI 来制衡谷歌。
微软律师 Cohen 称马斯克在 OpenAI 设立营利实体期间持续捐款、从未反对,ChatGPT 成功后才起诉。Cohen 还透露 2023 年 Altman 被董事会解雇时微软事先完全不知情。马斯克周三继续作证。
信源:https://www.nytimes.com/live/2026/04/28/technology/openai-sam-altman-elon-musk-trial?smid=tw-nytimes&smtyp=cur
The Washington Post
‘It’s not okay to steal a charity’: Musk testifies in trial over AI’s future
Elon Musk painted himself as an innovator trying to help humanity flourish when he took the stand in the trial over his lawsuit against ChatGPT-maker OpenAI.
签机密合同同一天,谷歌悄悄退出了五角大楼无人机蜂群竞赛
谷歌 1 月底参加了五角大楼一项 1 亿美元奖金的自主无人机蜂群技术竞赛并成功入围,但几周后通知政府退出。退出决定源于内部伦理审查,对外说辞则是「资源不足」。多名参与项目的谷歌员工对退出表示失望。
该竞赛由特种作战司令部防务自主作战组和国防创新单元联合主导,目标是让指挥官通过语音指令控制无人机蜂群。竞赛为期六个月,后续阶段涉及「目标相关感知与共享」和「从发射到终结」。OpenAI、Palantir 和 xAI 已入选继续参赛。Anthropic 也提交了方案但未入选,公司评估认为该方案未触及 CEO Dario Amodei 划定的「不参与全自主武器」红线。
谷歌的矛盾姿态在同一天集中暴露:退出无人机蜂群竞赛的同时,公司修订了与五角大楼的现有合同,允许军方将其 AI 用于「一切合法政府用途」,包括机密工作。谷歌发言人称这只是对消费级安全过滤器的常规企业客户调整,「不涉及为五角大楼开发定制模型」,并强调「AI 不应在缺乏适当人类监督的情况下用于自主武器」。
信源:https://www.bloomberg.com/news/articles/2026-04-28/google-drops-out-of-pentagon-drone-swarm-contest-after-advancing
谷歌 1 月底参加了五角大楼一项 1 亿美元奖金的自主无人机蜂群技术竞赛并成功入围,但几周后通知政府退出。退出决定源于内部伦理审查,对外说辞则是「资源不足」。多名参与项目的谷歌员工对退出表示失望。
该竞赛由特种作战司令部防务自主作战组和国防创新单元联合主导,目标是让指挥官通过语音指令控制无人机蜂群。竞赛为期六个月,后续阶段涉及「目标相关感知与共享」和「从发射到终结」。OpenAI、Palantir 和 xAI 已入选继续参赛。Anthropic 也提交了方案但未入选,公司评估认为该方案未触及 CEO Dario Amodei 划定的「不参与全自主武器」红线。
谷歌的矛盾姿态在同一天集中暴露:退出无人机蜂群竞赛的同时,公司修订了与五角大楼的现有合同,允许军方将其 AI 用于「一切合法政府用途」,包括机密工作。谷歌发言人称这只是对消费级安全过滤器的常规企业客户调整,「不涉及为五角大楼开发定制模型」,并强调「AI 不应在缺乏适当人类监督的情况下用于自主武器」。
信源:https://www.bloomberg.com/news/articles/2026-04-28/google-drops-out-of-pentagon-drone-swarm-contest-after-advancing
Bloomberg.com
Google Drops Out of Pentagon Drone Swarm Contest After Advancing
Google abruptly dropped out of a $100 million Pentagon prize challenge to create technology for voice-controlled, autonomous drone swarms after it was among the successful submissions, according to people briefed on the matter.
蚂蚁百灵Ling-2.6-flash权重开源:1040亿参数只激活74亿,agent评测多项SOTA
蚂蚁集团旗下蚂蚁百灵(Inclusion AI)正式开源 Ling-2.6-flash 权重,此前该模型仅提供 API。总参数 1040 亿,每次推理只激活 74 亿,上下文窗口 256K,MIT 许可,BF16、FP8、INT4 三个精度版本均已上线 HuggingFace 和魔搭。
Ling-2.6-flash 在 Ling 2.0 基础上引入混合线性注意力,将原来的 GQA 升级为 1:7 MLA + Lightning Linear 混合架构,再加上高稀疏 MoE,推理效率明显高于同级模型:4 卡 H20 环境下生成速度最高 340 tokens/s,prefill 和 decode 吞吐峰值约为同级开源模型的 4 倍。agent 相关评测表现突出:BFCL-V4、TAU2-bench、SWE-bench Verified(61.2%)、Claw-Eval、PinchBench 多项达到或接近同级 SOTA。在 Artificial Analysis 全套评测中总 token 消耗仅 1500 万。数学方面,AIME 2026 得分 73.85%。
蚂蚁百灵官网同时列出了 Ling-2.6-1T(万亿参数旗舰版)和 Ling-2.6-mini(轻量版)两款模型,但截至发稿,这两款模型的权重在 HuggingFace 上仍为未公开状态,仅 flash 系列可下载。
信源:https://huggingface.co/inclusionAI/Ling-2.6-flash
蚂蚁集团旗下蚂蚁百灵(Inclusion AI)正式开源 Ling-2.6-flash 权重,此前该模型仅提供 API。总参数 1040 亿,每次推理只激活 74 亿,上下文窗口 256K,MIT 许可,BF16、FP8、INT4 三个精度版本均已上线 HuggingFace 和魔搭。
Ling-2.6-flash 在 Ling 2.0 基础上引入混合线性注意力,将原来的 GQA 升级为 1:7 MLA + Lightning Linear 混合架构,再加上高稀疏 MoE,推理效率明显高于同级模型:4 卡 H20 环境下生成速度最高 340 tokens/s,prefill 和 decode 吞吐峰值约为同级开源模型的 4 倍。agent 相关评测表现突出:BFCL-V4、TAU2-bench、SWE-bench Verified(61.2%)、Claw-Eval、PinchBench 多项达到或接近同级 SOTA。在 Artificial Analysis 全套评测中总 token 消耗仅 1500 万。数学方面,AIME 2026 得分 73.85%。
蚂蚁百灵官网同时列出了 Ling-2.6-1T(万亿参数旗舰版)和 Ling-2.6-mini(轻量版)两款模型,但截至发稿,这两款模型的权重在 HuggingFace 上仍为未公开状态,仅 flash 系列可下载。
信源:https://huggingface.co/inclusionAI/Ling-2.6-flash
Altman预告Codex新界面:编程之外新增办公模式,编程agent集体转向双轨
OpenAI CEO Sam Altman 在 X 上发布 Codex 新版引导界面截图。用户首次进入时需选择两种模式之一:「Excelmogging」面向日常办公,描述为「Same tools, simpler interface」,示例任务为「做一张电子表格」;「Codemaxxing」面向专业编程,描述为「For coding and development」,示例任务为「调试数据库查询」。
Codex 此前以代码生成和工程任务为核心,但周活已超 400 万、用途早已扩展到研究分析、文档摘要和幻灯片制作。新界面将这一趋势正式产品化,把非程序员用户分流到更简洁的交互中。Anthropic 的 Claude 也已将 Claude Code(编程)和 Co Work(日常工作)分为两条产品线,字节跳动的 TRAE Solo 同样划分了编程与日常办公两种模式。编程 agent 向通用办公 agent 延伸正成为行业共识。
信源:https://x.com/sama/status/2049314532892475791
OpenAI CEO Sam Altman 在 X 上发布 Codex 新版引导界面截图。用户首次进入时需选择两种模式之一:「Excelmogging」面向日常办公,描述为「Same tools, simpler interface」,示例任务为「做一张电子表格」;「Codemaxxing」面向专业编程,描述为「For coding and development」,示例任务为「调试数据库查询」。
Codex 此前以代码生成和工程任务为核心,但周活已超 400 万、用途早已扩展到研究分析、文档摘要和幻灯片制作。新界面将这一趋势正式产品化,把非程序员用户分流到更简洁的交互中。Anthropic 的 Claude 也已将 Claude Code(编程)和 Co Work(日常工作)分为两条产品线,字节跳动的 TRAE Solo 同样划分了编程与日常办公两种模式。编程 agent 向通用办公 agent 延伸正成为行业共识。
信源:https://x.com/sama/status/2049314532892475791
X (formerly Twitter)
Sam Altman (@sama) on X
马斯克上证人席从当伐木工讲起,想开玩笑热场效果不佳
马斯克诉 OpenAI 案首日庭审除了法律交锋,现场细节同样耐看。
马斯克作为首位证人上台,花了 30 分钟从当伐木工人讲起,历数 PayPal、SpaceX、Tesla、Neuralink 的功绩。谈到 OpenAI 时他概括自己的贡献:「我提了点子、起了名字、招了关键的人、把我知道的都教给他们、出了全部启动资金。除此之外,没做什么。」他停顿等笑声,法庭基本没人笑。
被问到前 OpenAI 董事 Shivon Zilis 是谁时,马斯克答道:「Shivon 是,呃,我的幕僚长,然后,呃,你懂的。」旁听席有人大笑,陪审团面露困惑。Zilis 是马斯克数名子女的母亲。他还提到自己从谷歌挖走 Sutskever 后,「Larry Page 从此再也不跟我说话了」。
开庭前 Altman 走到一名《纽约时报》记者面前说:「希望你看得开心。」Brockman 则在马斯克作证全程安静地用小本子做笔记,偶尔抬头看看律师展示的旧邮件证据。
信源:https://www.theverge.com/ai-artificial-intelligence/920191/elon-musk-sam-altman-trial-day-one
马斯克诉 OpenAI 案首日庭审除了法律交锋,现场细节同样耐看。
马斯克作为首位证人上台,花了 30 分钟从当伐木工人讲起,历数 PayPal、SpaceX、Tesla、Neuralink 的功绩。谈到 OpenAI 时他概括自己的贡献:「我提了点子、起了名字、招了关键的人、把我知道的都教给他们、出了全部启动资金。除此之外,没做什么。」他停顿等笑声,法庭基本没人笑。
被问到前 OpenAI 董事 Shivon Zilis 是谁时,马斯克答道:「Shivon 是,呃,我的幕僚长,然后,呃,你懂的。」旁听席有人大笑,陪审团面露困惑。Zilis 是马斯克数名子女的母亲。他还提到自己从谷歌挖走 Sutskever 后,「Larry Page 从此再也不跟我说话了」。
开庭前 Altman 走到一名《纽约时报》记者面前说:「希望你看得开心。」Brockman 则在马斯克作证全程安静地用小本子做笔记,偶尔抬头看看律师展示的旧邮件证据。
信源:https://www.theverge.com/ai-artificial-intelligence/920191/elon-musk-sam-altman-trial-day-one
🤡2❤1
白宫想「体面地把Anthropic请回来」,起草行政令绕过自家封杀
白宫正在起草行政指令,为联邦机构绕过五角大楼对 Anthropic 的供应链风险认定铺路,让各部门重新采购 Anthropic 模型,包括其最强模型 Mythos。知情人士称白宫此举是想「体面地把 Anthropic 请回来」。
本月早些时候,白宫幕僚长 Susie Wiles 和财政部长 Scott Bessent 已与 Anthropic CEO Dario Amodei 会面,双方称会谈「富有成效」。白宫本周还召集多个行业的企业,讨论 Mythos 部署的最佳实践,并对可能撤回管理与预算办公室(OMB)禁令的方案进行「桌面推演」。
冲突源于今年 2 月。Anthropic 拒绝签署允许五角大楼将 Claude 用于「一切合法用途」的协议,坚持两条底线:禁止大规模国内监控、禁止全自主武器。国防部长 Hegseth 随即在 3 月 3 日将 Anthropic 列为供应链风险,这是美国历史上首次对本国公司使用该认定。特朗普本人当时在社交媒体上声称「不会再和他们做生意」。但联邦各部门对 Mythos 的需求挡不住:NSA 已在使用 Mythos,多个内阁级部门也在排队等候。
OpenAI 和谷歌都已签署了五角大楼要求的「一切合法用途」协议,但两家均称协议实际遵守了与 Anthropic 相同的两条红线。即便白宫新指令落地,五角大楼内部主战派仍不松口,核心分歧未解,双方可能很快再次回到谈判僵局。
信源:https://www.axios.com/2026/04/29/trump-anthropic-pentagon-ai-executive-order-gov
白宫正在起草行政指令,为联邦机构绕过五角大楼对 Anthropic 的供应链风险认定铺路,让各部门重新采购 Anthropic 模型,包括其最强模型 Mythos。知情人士称白宫此举是想「体面地把 Anthropic 请回来」。
本月早些时候,白宫幕僚长 Susie Wiles 和财政部长 Scott Bessent 已与 Anthropic CEO Dario Amodei 会面,双方称会谈「富有成效」。白宫本周还召集多个行业的企业,讨论 Mythos 部署的最佳实践,并对可能撤回管理与预算办公室(OMB)禁令的方案进行「桌面推演」。
冲突源于今年 2 月。Anthropic 拒绝签署允许五角大楼将 Claude 用于「一切合法用途」的协议,坚持两条底线:禁止大规模国内监控、禁止全自主武器。国防部长 Hegseth 随即在 3 月 3 日将 Anthropic 列为供应链风险,这是美国历史上首次对本国公司使用该认定。特朗普本人当时在社交媒体上声称「不会再和他们做生意」。但联邦各部门对 Mythos 的需求挡不住:NSA 已在使用 Mythos,多个内阁级部门也在排队等候。
OpenAI 和谷歌都已签署了五角大楼要求的「一切合法用途」协议,但两家均称协议实际遵守了与 Anthropic 相同的两条红线。即便白宫新指令落地,五角大楼内部主战派仍不松口,核心分歧未解,双方可能很快再次回到谈判僵局。
信源:https://www.axios.com/2026/04/29/trump-anthropic-pentagon-ai-executive-order-gov
Axios
Scoop: White House workshops plan to bring back Anthropic
One source described the efforts as a way to "save face and bring em back in."
高盛香港员工被禁用Claude:出差到港也不行,Anthropic称从未正式支持香港
高盛集团香港办公室员工几周前起无法再通过内部 AI 平台使用 Anthropic 的 Claude 模型。限制按地理位置执行:从海外出差到港的员工在港期间同样无法访问。受影响的主要是使用 Claude 写代码和做金融建模的软件工程师。
高盛对与 Anthropic 合同条款做了严格解读,经与 Anthropic 协商后认定香港员工不应使用任何 Anthropic 产品。Anthropic 发言人对《金融时报》表示,Claude 从未在香港被正式「supported」,但拒绝进一步说明。该限制不涉及 OpenAI 等其他 AI 供应商,高盛员工仍可在内部平台使用 ChatGPT 和 Gemini。
美国 AI 公司限制香港使用的核心顾虑是「蒸馏」:本地机构通过密集调用外国模型的输出来训练自己的模型。ChatGPT 和 Claude 在中国大陆已被屏蔽,但香港此前基本不受限,使用边界由美国公司自行划定。香港是多数全球银行在大中华区的投行和跨境交易枢纽,若员工无法使用最强模型,可能落后于其他团队。《金融时报》称尚无法确认其他银行或企业是否也做了类似限制。
信源:https://www.ft.com/content/aa3a7a19-ab94-4069-aea4-e192ab9abc41?syn-25a6b1a6=1
高盛集团香港办公室员工几周前起无法再通过内部 AI 平台使用 Anthropic 的 Claude 模型。限制按地理位置执行:从海外出差到港的员工在港期间同样无法访问。受影响的主要是使用 Claude 写代码和做金融建模的软件工程师。
高盛对与 Anthropic 合同条款做了严格解读,经与 Anthropic 协商后认定香港员工不应使用任何 Anthropic 产品。Anthropic 发言人对《金融时报》表示,Claude 从未在香港被正式「supported」,但拒绝进一步说明。该限制不涉及 OpenAI 等其他 AI 供应商,高盛员工仍可在内部平台使用 ChatGPT 和 Gemini。
美国 AI 公司限制香港使用的核心顾虑是「蒸馏」:本地机构通过密集调用外国模型的输出来训练自己的模型。ChatGPT 和 Claude 在中国大陆已被屏蔽,但香港此前基本不受限,使用边界由美国公司自行划定。香港是多数全球银行在大中华区的投行和跨境交易枢纽,若员工无法使用最强模型,可能落后于其他团队。《金融时报》称尚无法确认其他银行或企业是否也做了类似限制。
信源:https://www.ft.com/content/aa3a7a19-ab94-4069-aea4-e192ab9abc41?syn-25a6b1a6=1
阶跃Step Image Edit 2上线:3.5B参数打赢12B-20B级模型,单张图0.5秒出
阶跃星辰发布新一代轻量级图像生成编辑模型 Step Image Edit 2,参数量仅 3.5B,在实测中超越 12B-20B 级开源图像编辑模型。单次生图 0.5-2 秒,API 定价 0.02 元/张,上线首周限免。
模型同时支持文生图和图像编辑,覆盖中英文渲染、局部编辑、视觉推理、主体一致性、风格迁移等能力。在公开学术评测 KRIS-Bench 上,Step Image Edit 2 在轻量级图像编辑模型中综合排名第一。
技术层面,阶跃提出两项新方法。一是多专家自演化学习:从基座模型分出多个细分任务专家分支做差异化训练,再通过迭代自蒸馏(用大模型的输出训练小模型)把知识压回基座,不加参数就拉高性能上限。二是分布匹配强化学习(DARL):把强化学习的目标从单次输出好坏改为整体输出分布与参考分布的对齐,训练更稳定。数据侧投入超 5000 万条专项训练数据,其中 2000 万条针对文字编辑场景。
信源:https://mp.weixin.qq.com/s/iHlnN2YGafxWweVLCP2--g
阶跃星辰发布新一代轻量级图像生成编辑模型 Step Image Edit 2,参数量仅 3.5B,在实测中超越 12B-20B 级开源图像编辑模型。单次生图 0.5-2 秒,API 定价 0.02 元/张,上线首周限免。
模型同时支持文生图和图像编辑,覆盖中英文渲染、局部编辑、视觉推理、主体一致性、风格迁移等能力。在公开学术评测 KRIS-Bench 上,Step Image Edit 2 在轻量级图像编辑模型中综合排名第一。
技术层面,阶跃提出两项新方法。一是多专家自演化学习:从基座模型分出多个细分任务专家分支做差异化训练,再通过迭代自蒸馏(用大模型的输出训练小模型)把知识压回基座,不加参数就拉高性能上限。二是分布匹配强化学习(DARL):把强化学习的目标从单次输出好坏改为整体输出分布与参考分布的对齐,训练更稳定。数据侧投入超 5000 万条专项训练数据,其中 2000 万条针对文字编辑场景。
信源:https://mp.weixin.qq.com/s/iHlnN2YGafxWweVLCP2--g
GEO论文实测三大AI搜索引擎:ChatGPT引用最少但「吸收」最深
GEO 专家张凯和姚金刚在预印本平台 arXiv 发布 GEO(Generative Engine Optimization,生成式引擎优化)研究论文,提出「引用选择」与「引用吸收」两阶段测量框架,用 602 条控制 prompt 实测 ChatGPT、Google AI Overview/Gemini 和 Perplexity 三大平台的引用行为,共采集 21,143 条引用和 23,745 条特征记录。
核心发现是引用数量和引用深度明显分化。Perplexity 每条 prompt 平均引用 16.35 个来源,Google 为 12.06 个,ChatGPT 仅 6.88 个;但 ChatGPT 对所引页面的平均影响力得分(衡量引用内容被多深地「吸收」进生成答案)反而最高。简单数引用条数不能反映 AI 搜索引擎真正使用了多少内容。
论文进一步分析了什么样的页面更容易被深度吸收。高影响力页面与低影响力页面对比中,字数差距 11.44 倍,标题数差距 12.5 倍。含代码的页面平均影响力比不含代码的高 76.88%,含数字/统计数据高 61.55%,含定义标记高 57.33%,含对比内容高 55.28%。但 Q&A 格式反而拉低影响力 5.74%,表明证据密度比表面排版更关键。按域名类型看,百科类页面影响力最高,新闻类虽频繁被引但影响力偏低。
论文数据和代码已开源在 GitHub。
信源:https://arxiv.org/abs/2604.25707
GEO 专家张凯和姚金刚在预印本平台 arXiv 发布 GEO(Generative Engine Optimization,生成式引擎优化)研究论文,提出「引用选择」与「引用吸收」两阶段测量框架,用 602 条控制 prompt 实测 ChatGPT、Google AI Overview/Gemini 和 Perplexity 三大平台的引用行为,共采集 21,143 条引用和 23,745 条特征记录。
核心发现是引用数量和引用深度明显分化。Perplexity 每条 prompt 平均引用 16.35 个来源,Google 为 12.06 个,ChatGPT 仅 6.88 个;但 ChatGPT 对所引页面的平均影响力得分(衡量引用内容被多深地「吸收」进生成答案)反而最高。简单数引用条数不能反映 AI 搜索引擎真正使用了多少内容。
论文进一步分析了什么样的页面更容易被深度吸收。高影响力页面与低影响力页面对比中,字数差距 11.44 倍,标题数差距 12.5 倍。含代码的页面平均影响力比不含代码的高 76.88%,含数字/统计数据高 61.55%,含定义标记高 57.33%,含对比内容高 55.28%。但 Q&A 格式反而拉低影响力 5.74%,表明证据密度比表面排版更关键。按域名类型看,百科类页面影响力最高,新闻类虽频繁被引但影响力偏低。
论文数据和代码已开源在 GitHub。
信源:https://arxiv.org/abs/2604.25707
arXiv.org
From Citation Selection to Citation Absorption: A Measurement...
Generative search engines increasingly determine whether online information is merely discoverable, cited as a source, or actually absorbed into generated answers. This paper proposes a two-stage...