Qwen3.7-Max正式上线API,百炼提供Token Plan订阅调用
阿里千问最新旗舰大模型 Qwen3.7-Max 登陆阿里云百炼平台,正式开放 API 接口与 Token Plan 订阅服务调用,输入每百万 Tokens 12 元,输出每百万 Tokens 36 元。
百炼 Token Plan 订阅服务已同步上线 Qwen3.7-Max,订阅用户无需额外付费即可直接调用。
据 Artificial Analysis 评测,此前已发布的 Qwen3.7-Max 得分 56.6 分,位列全球第五、国产大模型第一。
Qwen3.7-Max 专为智能体设计,在自主编程和多工具调用等长程任务中进行了架构优化。在实际长程测试中,Qwen3.7-Max 协同 Claude Code、OpenClaw、Hermes Agent 和 Qwen Code 等框架,能够独立完成长达 35 小时、超过 1000 次工具调用的企业级复杂任务。
信源:https://mp.weixin.qq.com/s/wUSqHErGrillzGxyPOZMOQ
阿里千问最新旗舰大模型 Qwen3.7-Max 登陆阿里云百炼平台,正式开放 API 接口与 Token Plan 订阅服务调用,输入每百万 Tokens 12 元,输出每百万 Tokens 36 元。
百炼 Token Plan 订阅服务已同步上线 Qwen3.7-Max,订阅用户无需额外付费即可直接调用。
据 Artificial Analysis 评测,此前已发布的 Qwen3.7-Max 得分 56.6 分,位列全球第五、国产大模型第一。
Qwen3.7-Max 专为智能体设计,在自主编程和多工具调用等长程任务中进行了架构优化。在实际长程测试中,Qwen3.7-Max 协同 Claude Code、OpenClaw、Hermes Agent 和 Qwen Code 等框架,能够独立完成长达 35 小时、超过 1000 次工具调用的企业级复杂任务。
信源:https://mp.weixin.qq.com/s/wUSqHErGrillzGxyPOZMOQ
美团开源LongCat-Video-Avatar 1.5数字人框架推理缩至8步
美团 LongCat 团队开源数字人生成框架 LongCat-Video-Avatar 1.5,全面重构音频提取与视频生成算法。框架主打工业级时空稳定性与极速推理,以缩短研究原型与真实部署的性能差距。
框架将先前 Wav2Vec2 编码器替换为 Whisper-large-v3 音频编码器,以提升口型同步和唇形动态。Whisper-large-v3 音频编码器带来的声学表征大幅提升了多语种和跨语言口型生成的鲁棒性。
模型通过 GRPO 强化学习对齐优化,降低了手部变形和异常抽帧等常见生成伪影,提升了长视频的身份一致性。在长视频生成中,框架采用多片段滚动推理,利用前序视频建立全局时序上下文,保持角色身份连贯。
推理端引入基于 DMD2 的少步步数蒸馏技术,将生成去噪迭代压缩至 8 步,以平衡推理效率与图像保真度。
在评估测试中,团队基于 508 组图像与音频配对样本进行测试。众包测试引入了 770 名评估者并收集了 13240 次人工判断,另由 10 名专家从物理合理性、时序稳定性、画面协调性及身份一致性等维度进行评分。官方展示了与 HeyGen、Kling Avatar 2.0、OmniHuman-1.5 的同场对比,并称在时序稳定性、身份一致性和自然口型方面取得了重点提升。除写实人像外,框架可泛化至动漫与动物等风格,并原生支持单声道与多声道音频输入以驱动多人对话与手物交互场景。
模型权重以 MIT 协议发布。同时,项目页伦理声明称页面展示所用生成内容仅供学术使用,不允许商业使用。实际商用仍需单独核对权重、代码、素材和生成内容边界。
信源:https://huggingface.co/meituan-longcat/LongCat-Video-Avatar-1.5
美团 LongCat 团队开源数字人生成框架 LongCat-Video-Avatar 1.5,全面重构音频提取与视频生成算法。框架主打工业级时空稳定性与极速推理,以缩短研究原型与真实部署的性能差距。
框架将先前 Wav2Vec2 编码器替换为 Whisper-large-v3 音频编码器,以提升口型同步和唇形动态。Whisper-large-v3 音频编码器带来的声学表征大幅提升了多语种和跨语言口型生成的鲁棒性。
模型通过 GRPO 强化学习对齐优化,降低了手部变形和异常抽帧等常见生成伪影,提升了长视频的身份一致性。在长视频生成中,框架采用多片段滚动推理,利用前序视频建立全局时序上下文,保持角色身份连贯。
推理端引入基于 DMD2 的少步步数蒸馏技术,将生成去噪迭代压缩至 8 步,以平衡推理效率与图像保真度。
在评估测试中,团队基于 508 组图像与音频配对样本进行测试。众包测试引入了 770 名评估者并收集了 13240 次人工判断,另由 10 名专家从物理合理性、时序稳定性、画面协调性及身份一致性等维度进行评分。官方展示了与 HeyGen、Kling Avatar 2.0、OmniHuman-1.5 的同场对比,并称在时序稳定性、身份一致性和自然口型方面取得了重点提升。除写实人像外,框架可泛化至动漫与动物等风格,并原生支持单声道与多声道音频输入以驱动多人对话与手物交互场景。
模型权重以 MIT 协议发布。同时,项目页伦理声明称页面展示所用生成内容仅供学术使用,不允许商业使用。实际商用仍需单独核对权重、代码、素材和生成内容边界。
信源:https://huggingface.co/meituan-longcat/LongCat-Video-Avatar-1.5
huggingface.co
meituan-longcat/LongCat-Video-Avatar-1.5 · Hugging Face
We’re on a journey to advance and democratize artificial intelligence through open source and open science.
DeepSeek 100亿美元巨额融资进入谈判后期,梁文锋表态专注AGI与开源
DeepSeek(深度求索)目前正处于一轮高达 700 亿元人民币(约合 100 亿美元)巨额融资谈判的最后阶段,较 5 月 8 日市场传闻的 500 亿元(约 73.5 亿美元)规模再度追加。本轮融资以约 450 亿美元的投前估值推进,投后估值将被推升至 550 亿美元。
在资本结构与投资方博弈方面,本轮融资呈现出最新的多方博弈格局。此前 5 月上旬有报道称,创始人梁文锋计划个人出资最高 200 亿元人民币(约 30 亿美元,占本轮约 40% 的份额)以确保团队的绝对控制权,从而取代此前传闻领投的国家人工智能产业投资基金,使后者预计退居第二大资方。
而根据 5 月 22 日的最新进展,随着总融资额扩大,本轮资方的豪华阵容已基本明朗:除国家队基金与梁文锋本人的巨额自有资金跟投外,包括腾讯控股、IDG 资本以及砺思资本(Monolith Capital)在内的多家头部科技巨头与顶尖创投机构已接近确定参与本轮投资,共同构建起「国资+大厂+头部 VC+创始团队」的联合战线。
DeepSeek 管理层在谈判中表现得极其强势。知情人士透露,梁文锋及高管团队在与投资者的多场关键会面中立下硬性承诺:公司即使拿走百亿美元,也将坚定把实现通用人工智能(AGI)作为核心战略目标,优先把资源向开源 AI 模型与前沿探索性研究倾斜,明确将短期商业化变现与盈利压力置于次要地位。
信源:https://www.bloomberg.com/news/articles/2026-05-22/deepseek-founder-declares-agi-goal-as-10-billion-round-advances
DeepSeek(深度求索)目前正处于一轮高达 700 亿元人民币(约合 100 亿美元)巨额融资谈判的最后阶段,较 5 月 8 日市场传闻的 500 亿元(约 73.5 亿美元)规模再度追加。本轮融资以约 450 亿美元的投前估值推进,投后估值将被推升至 550 亿美元。
在资本结构与投资方博弈方面,本轮融资呈现出最新的多方博弈格局。此前 5 月上旬有报道称,创始人梁文锋计划个人出资最高 200 亿元人民币(约 30 亿美元,占本轮约 40% 的份额)以确保团队的绝对控制权,从而取代此前传闻领投的国家人工智能产业投资基金,使后者预计退居第二大资方。
而根据 5 月 22 日的最新进展,随着总融资额扩大,本轮资方的豪华阵容已基本明朗:除国家队基金与梁文锋本人的巨额自有资金跟投外,包括腾讯控股、IDG 资本以及砺思资本(Monolith Capital)在内的多家头部科技巨头与顶尖创投机构已接近确定参与本轮投资,共同构建起「国资+大厂+头部 VC+创始团队」的联合战线。
DeepSeek 管理层在谈判中表现得极其强势。知情人士透露,梁文锋及高管团队在与投资者的多场关键会面中立下硬性承诺:公司即使拿走百亿美元,也将坚定把实现通用人工智能(AGI)作为核心战略目标,优先把资源向开源 AI 模型与前沿探索性研究倾斜,明确将短期商业化变现与盈利压力置于次要地位。
信源:https://www.bloomberg.com/news/articles/2026-05-22/deepseek-founder-declares-agi-goal-as-10-billion-round-advances
Bloomberg.com
DeepSeek Founder Declares AGI Goal as $10 Billion Round Advances
DeepSeek’s senior management has told potential investors in its ongoing 70 billion yuan ($10 billion) funding round that the startup will prioritize groundbreaking AI research over short-term commercialization, people familiar with the matter said.
👍2
Nous Research证实分词红利可被纯字节模拟,免分词大模型迎突破
Nous Research 发表论文指出,大语言模型长期依赖的分词器未来有望被替代。通过在 1.7B 参数规模下进行受控测试,研究团队系统量化了分词机制的性能优势,证明这些红利能够通过工程手段在纯字节层面被有效模拟。
实验发现,只要在原生字节模型中提升数据吞吐量并注入形态学边界,就能大幅弥合性能差距。在同等算力预算下,模拟压缩扩大了单步梯度的处理量,直接贡献了最大的验证损失降幅。同时,将子词边界作为二进制序列叠加至输入字节中,成功为模型建立了不泄露未来信息的长效归纳偏置。
尽管更庞大参数下的协同效应仍有待验证,但这项测试发现在 1.7B 规模下,词表参数缩放以及预测下一个子词等另外四项机制的收益极度有限。这为开发免分词大模型提供了明确的破局思路,指出未来架构优化应当直接聚焦于提升实际吞吐量,并以非泄露的方式显式融入形态学先验。
信源:https://arxiv.org/abs/2604.27263
Nous Research 发表论文指出,大语言模型长期依赖的分词器未来有望被替代。通过在 1.7B 参数规模下进行受控测试,研究团队系统量化了分词机制的性能优势,证明这些红利能够通过工程手段在纯字节层面被有效模拟。
实验发现,只要在原生字节模型中提升数据吞吐量并注入形态学边界,就能大幅弥合性能差距。在同等算力预算下,模拟压缩扩大了单步梯度的处理量,直接贡献了最大的验证损失降幅。同时,将子词边界作为二进制序列叠加至输入字节中,成功为模型建立了不泄露未来信息的长效归纳偏置。
尽管更庞大参数下的协同效应仍有待验证,但这项测试发现在 1.7B 规模下,词表参数缩放以及预测下一个子词等另外四项机制的收益极度有限。这为开发免分词大模型提供了明确的破局思路,指出未来架构优化应当直接聚焦于提升实际吞吐量,并以非泄露的方式显式融入形态学先验。
信源:https://arxiv.org/abs/2604.27263
分析:AI算力补贴时代终结,智能体高昂消耗或逼迫产业资产减记
大模型厂商长期亏本的 AI 订阅补贴时代正在加速终结。分析师 Hedgie 强调,按 token 计费的真实成本已远超企业预期,这将倒逼产业进入两难困境,要么企业因预算超支而大规模缩减智能体使用,要么模型厂商降价自行吸收亏损,两者最终都将指向资产减记 (Writedown)。
近期,微软与优步的算力预算超支事件已暴露出智能体 (Agent) 的成本痛点。在优步,AI 工具的采用导致单个工程师每月的 API 调用成本高达 500 至 2000 美元,导致优步在 2026 年前四个月就彻底透支了全年的 AI 预算。微软 Experiences + Devices 部门亦宣布在 6 月 30 日前终止 Claude Code 授权。类似案例表明,当企业从传统的单句自动补全转向多步骤自主推理智能体时,按 token 计费的消耗量呈指数级上升,彻底打破了原有的固定席位费 (Flat-rate) 商业假设。
针对这重成本僵局,行业未来可能出现两条分化路径。第一条路径是,若企业端为迎合预算而大范围缩减智能体用量,大模型研发商将面临营收增速放缓,进而难以支撑大模型研发商在首次公开募股 (IPO) 前的高昂估值。第二条路径则是,若模型研发商为维系用量而降价,大模型研发商自身的单位经济模型 (Unit Economics) 将在非常不利的时点进一步恶化。GitHub Copilot 自 2026 年 6 月 1 日起全面推行基于使用量计费的 AI Credits 模式,本质上是将算力成本压力转嫁给最终用户的转折点。最终,这笔算力烂账总有一方需要以资产减记方式予以承担。
信源:https://x.com/HedgieMarkets/status/2057531661785628841
大模型厂商长期亏本的 AI 订阅补贴时代正在加速终结。分析师 Hedgie 强调,按 token 计费的真实成本已远超企业预期,这将倒逼产业进入两难困境,要么企业因预算超支而大规模缩减智能体使用,要么模型厂商降价自行吸收亏损,两者最终都将指向资产减记 (Writedown)。
近期,微软与优步的算力预算超支事件已暴露出智能体 (Agent) 的成本痛点。在优步,AI 工具的采用导致单个工程师每月的 API 调用成本高达 500 至 2000 美元,导致优步在 2026 年前四个月就彻底透支了全年的 AI 预算。微软 Experiences + Devices 部门亦宣布在 6 月 30 日前终止 Claude Code 授权。类似案例表明,当企业从传统的单句自动补全转向多步骤自主推理智能体时,按 token 计费的消耗量呈指数级上升,彻底打破了原有的固定席位费 (Flat-rate) 商业假设。
针对这重成本僵局,行业未来可能出现两条分化路径。第一条路径是,若企业端为迎合预算而大范围缩减智能体用量,大模型研发商将面临营收增速放缓,进而难以支撑大模型研发商在首次公开募股 (IPO) 前的高昂估值。第二条路径则是,若模型研发商为维系用量而降价,大模型研发商自身的单位经济模型 (Unit Economics) 将在非常不利的时点进一步恶化。GitHub Copilot 自 2026 年 6 月 1 日起全面推行基于使用量计费的 AI Credits 模式,本质上是将算力成本压力转嫁给最终用户的转折点。最终,这笔算力烂账总有一方需要以资产减记方式予以承担。
信源:https://x.com/HedgieMarkets/status/2057531661785628841
X (formerly Twitter)
Hedgie (@HedgieMarkets) on X
🦔Microsoft canceled its internal Claude Code licenses this week after token-based billing made the cost untenable, even for a company with effectively infinite cloud resources. Uber's CTO sent an internal memo warning the company burned through its entire…
Grok Imagine代理模式正式登陆iOS端,大幅提升角色一致性与叙事连贯性
Grok 图像生成的高阶功能 Grok Imagine 代理模式(Agent Mode)正式上线 iOS 客户端。
传统的 AI 生图通常依赖单次提示词交互。Agent Mode 改变了交互逻辑,引入多步创意工作流。依靠自主规划与迭代机制,用户可以在画布中连续生成、编辑并优化图像资产。
根据用户反馈与公开功能界面,iOS 版本的核心升级集中于四个技术点。首要变化是跨代生成的角色一致性,即在多次生图中精准保持人物面部与体型特征。其次是支持同角色多场景延展,可将同一设定的角色放置在不同故事情节中。同时,功能开放了多镜头视角与环境控制,允许用户指定特写或全景机位,并调整环境光影。最后是提供电影级的视觉叙事表达,让生成画面在色调与质感上贴近故事板。
现在,用户直接在 Grok iOS 应用的输入框旁即可开启 Agent 开关。功能界面内置了历史故事、虚拟试穿、角色概念等专区入口。目前,多步图像生成能力仅面向 Grok 与 X Premium 订阅用户开放。
信源:https://x.com/XFreeze/status/2057646423022477711
Grok 图像生成的高阶功能 Grok Imagine 代理模式(Agent Mode)正式上线 iOS 客户端。
传统的 AI 生图通常依赖单次提示词交互。Agent Mode 改变了交互逻辑,引入多步创意工作流。依靠自主规划与迭代机制,用户可以在画布中连续生成、编辑并优化图像资产。
根据用户反馈与公开功能界面,iOS 版本的核心升级集中于四个技术点。首要变化是跨代生成的角色一致性,即在多次生图中精准保持人物面部与体型特征。其次是支持同角色多场景延展,可将同一设定的角色放置在不同故事情节中。同时,功能开放了多镜头视角与环境控制,允许用户指定特写或全景机位,并调整环境光影。最后是提供电影级的视觉叙事表达,让生成画面在色调与质感上贴近故事板。
现在,用户直接在 Grok iOS 应用的输入框旁即可开启 Agent 开关。功能界面内置了历史故事、虚拟试穿、角色概念等专区入口。目前,多步图像生成能力仅面向 Grok 与 X Premium 订阅用户开放。
信源:https://x.com/XFreeze/status/2057646423022477711
新加坡国立与南洋理工等开源Mega-ASR,降低极端噪声下ASR幻觉与丢字
新加坡国立大学、南洋理工大学与上海人工智能实验室等团队联合开源首个全场景鲁棒语音识别基座模型 Mega-ASR,旨在解决真实环境下语音识别面临的幻觉、丢字和空白输出等问题。模型以 Qwen3-ASR 1.7B 为底层驱动,在极端复杂声学环境下相比 Whisper、Gemini 3 Pro 和 Seed-ASR 等模型实现最高近 30% 的性能提升。目前项目已在 GitHub 开源,并采用 Apache-2.0 协议发布全部代码和模型权重。
研究团队构建了包含 240 万个样本、总长 1.1 万小时的 Voices-in-the-wild-2M 训练数据集。数据集通过基于频谱物理特性的模拟流水线,合成涵盖混响、回声、加性噪声、远场、频率丢包、带宽限制以及剪切失真 7 种原子声学效应,并衍生出 54 种复合环境场景。为确保训练的稳定性,团队在过滤掉词错误率超过 70% 的样本后,通过物理合理性检测对数据集难度分布进行校准。
在训练机制上,Mega-ASR 引入了声学到语义渐进式监督微调 A2S-SFT,分阶段对音频特征进行对齐,以增强模型在重度干扰下的语义恢复能力。在策略优化阶段,模型采用双粒度词错误率门控策略优化 DG-WGPO 进行强化学习。当输入音频质量较好、词错误率较低时,系统侧重字符级的声学细节重建。若音频严重失真、词错误率较高,决策机制则转向句子级的语义重构,大幅减少大模型常见的幻觉与漏字现象。
为了应对在干净音频下可能出现的识别率略微下降,Mega-ASR 内置了动态路由机制。路由决策器能自动评估当前音频的质量,智能决定是否挂载 LoRA 微调权重,从而保证模型在干净和嘈杂场景下都能输出最优结果。
信源:https://github.com/xzf-thu/Mega-ASR
新加坡国立大学、南洋理工大学与上海人工智能实验室等团队联合开源首个全场景鲁棒语音识别基座模型 Mega-ASR,旨在解决真实环境下语音识别面临的幻觉、丢字和空白输出等问题。模型以 Qwen3-ASR 1.7B 为底层驱动,在极端复杂声学环境下相比 Whisper、Gemini 3 Pro 和 Seed-ASR 等模型实现最高近 30% 的性能提升。目前项目已在 GitHub 开源,并采用 Apache-2.0 协议发布全部代码和模型权重。
研究团队构建了包含 240 万个样本、总长 1.1 万小时的 Voices-in-the-wild-2M 训练数据集。数据集通过基于频谱物理特性的模拟流水线,合成涵盖混响、回声、加性噪声、远场、频率丢包、带宽限制以及剪切失真 7 种原子声学效应,并衍生出 54 种复合环境场景。为确保训练的稳定性,团队在过滤掉词错误率超过 70% 的样本后,通过物理合理性检测对数据集难度分布进行校准。
在训练机制上,Mega-ASR 引入了声学到语义渐进式监督微调 A2S-SFT,分阶段对音频特征进行对齐,以增强模型在重度干扰下的语义恢复能力。在策略优化阶段,模型采用双粒度词错误率门控策略优化 DG-WGPO 进行强化学习。当输入音频质量较好、词错误率较低时,系统侧重字符级的声学细节重建。若音频严重失真、词错误率较高,决策机制则转向句子级的语义重构,大幅减少大模型常见的幻觉与漏字现象。
为了应对在干净音频下可能出现的识别率略微下降,Mega-ASR 内置了动态路由机制。路由决策器能自动评估当前音频的质量,智能决定是否挂载 LoRA 微调权重,从而保证模型在干净和嘈杂场景下都能输出最优结果。
信源:https://github.com/xzf-thu/Mega-ASR
GitHub
GitHub - xzf-thu/Mega-ASR: First foundation ASR built for the real world - 7 atomic acoustic conditions, 54 compound scenarios…
First foundation ASR built for the real world - 7 atomic acoustic conditions, 54 compound scenarios, 2.6M samples, and up to ~30% gains over SOTA where every other model falls apart. **You'...
❤1
恒生科技指数纳入智谱与MiniMax-W,今日股价暴涨
恒生指数公司发布最新指数检讨结果,正式将智谱与 MiniMax-W 纳入恒生科技指数成份股,同时剔除金蝶国际与金山软件。指数成份股变动将于 2026 年 6 月 5 日收市后实施,并于 6 月 8 日起正式生效。
作为中国生成式 AI 领域的头部独角兽,智谱与 MiniMax 均于 2026 年 1 月通过港交所「特专科技公司」(第 18C 章)规则成功上市。
在纳入结果于 5 月 22 日收市后正式公布前,市场预期已提前提振概念股表现,两家公司当日股价双双暴涨。截至当日收盘,智谱(02513.HK)大涨 26.93% 收报 1,282.00 港元,MiniMax-W(00100.HK)亦大涨 15.91% 收报 768.50 港元。两家独角兽上市不足半年便被快速纳指,显示出资本市场对大模型题材的高度关注,后续也有望获得港股通资格,迎来南向资金配置。
信源:https://www.hsi.com.hk/static/uploads/contents/zh_cn/news/pressRelease/20260522T174500.pdf
恒生指数公司发布最新指数检讨结果,正式将智谱与 MiniMax-W 纳入恒生科技指数成份股,同时剔除金蝶国际与金山软件。指数成份股变动将于 2026 年 6 月 5 日收市后实施,并于 6 月 8 日起正式生效。
作为中国生成式 AI 领域的头部独角兽,智谱与 MiniMax 均于 2026 年 1 月通过港交所「特专科技公司」(第 18C 章)规则成功上市。
在纳入结果于 5 月 22 日收市后正式公布前,市场预期已提前提振概念股表现,两家公司当日股价双双暴涨。截至当日收盘,智谱(02513.HK)大涨 26.93% 收报 1,282.00 港元,MiniMax-W(00100.HK)亦大涨 15.91% 收报 768.50 港元。两家独角兽上市不足半年便被快速纳指,显示出资本市场对大模型题材的高度关注,后续也有望获得港股通资格,迎来南向资金配置。
信源:https://www.hsi.com.hk/static/uploads/contents/zh_cn/news/pressRelease/20260522T174500.pdf
❤1
自掏1亿美元启动资金,Figure AI创始人新公司Hark获7亿美元融资估值60亿
人形机器人巨头 Figure AI 与电动航空企业 Archer Aviation 的联合创始人 Brett Adcock 宣布,新创立的个人智能体硬件公司 Hark 斩获 7 亿美元 A 轮融资,投后估值达到 60 亿美元。Hark 早期由 Adcock 出资 1 亿美元启动资金创立。本轮融资由 Parkway Venture Capital 领投,NVIDIA、AMD Ventures、Intel Capital、Qualcomm Ventures 以及 Salesforce Ventures 等行业巨头参投。
Hark 定位为个人 AI 平台,旨在通过自研基础模型、系统软件与专属硬件的垂直整合,构建人机交互的通用接口。Adcock 认为现有的 AI 模型过于单一基础,新一代智能体必须具备自然听说、视觉理解与长期记忆能力,并在物理世界中自主执行任务。按照规划,Hark 将于 2026 年夏季推出首批多模态模型,后续将推出配套的个人 AI 硬件终端。
筹得的 7 亿美元资金将直接用于扩展 GPU 算力基础设施、加速前沿模型研发以及开发下一代智能体硬件。Hark 团队目前拥有约 70 名成员,主要在 NVIDIA B200 GPU 算力集群上运行。公司计划将工程团队规模在短期内扩大至 200 人。
信源:https://x.com/adcock_brett/status/2057462134989263047
人形机器人巨头 Figure AI 与电动航空企业 Archer Aviation 的联合创始人 Brett Adcock 宣布,新创立的个人智能体硬件公司 Hark 斩获 7 亿美元 A 轮融资,投后估值达到 60 亿美元。Hark 早期由 Adcock 出资 1 亿美元启动资金创立。本轮融资由 Parkway Venture Capital 领投,NVIDIA、AMD Ventures、Intel Capital、Qualcomm Ventures 以及 Salesforce Ventures 等行业巨头参投。
Hark 定位为个人 AI 平台,旨在通过自研基础模型、系统软件与专属硬件的垂直整合,构建人机交互的通用接口。Adcock 认为现有的 AI 模型过于单一基础,新一代智能体必须具备自然听说、视觉理解与长期记忆能力,并在物理世界中自主执行任务。按照规划,Hark 将于 2026 年夏季推出首批多模态模型,后续将推出配套的个人 AI 硬件终端。
筹得的 7 亿美元资金将直接用于扩展 GPU 算力基础设施、加速前沿模型研发以及开发下一代智能体硬件。Hark 团队目前拥有约 70 名成员,主要在 NVIDIA B200 GPU 算力集群上运行。公司计划将工程团队规模在短期内扩大至 200 人。
信源:https://x.com/adcock_brett/status/2057462134989263047
X (formerly Twitter)
Brett Adcock (@adcock_brett) on X
Today I'm excited to share that Hark has raised $700M at a $6B valuation
When I use these AI models today, they feel basic. They should be able to listen and talk naturally, understand vision, retain persistent memory, and become deeply personalized over…
When I use these AI models today, they feel basic. They should be able to listen and talk naturally, understand vision, retain persistent memory, and become deeply personalized over…
RAEv2开源:收敛速度提升10倍,80轮训练超越前代800轮纪录
Adobe Research、澳大利亚国立大学 (ANU) 与纽约大学 (NYU) 的谢赛宁团队等机构联合开源了第二代表示自编码器 RAEv2 (Representation Autoencoders v2) 的代码、模型权重与训练数据。作为取代传统变分自编码器 (VAE) 的扩散模型图像重构方案,新版本解决了初代重构质量差、无法使用标准无分类器引导 (CFG) 以及收敛极慢等痛点,在 ImageNet 上仅需 80 轮训练即可达到 1.06 的全局 FID (gFID) 成绩,收敛速度提升 10 倍以上。
研究团队在架构设计上实现了三项核心优化。首先,不同于初代仅使用预训练编码器最后一层的做法,新架构采用「多层表示」方案,将编码器最后 K 层的输出直接相加。在超高维度空间中,简单的加法操作能够完美保留底层子空间的结构,用户只需调整 K 的数值便能获得重构质量与压缩效率的最优帕累托边界。第二,团队阐明了表示自编码器与表示对齐 (REPA) 的互补机制。在联合使用时,自编码器主要提取全局语义信息,而表示对齐机制则对空间细节与结构提供强约束。互补设计使得 DINOv3 等空间特征敏感的更强编码器也能在生成任务中发挥优势,而在初代模型中, DINOv3 的生成表现甚至劣于 DINOv2。
最关键的发现是 REPA 在自编码器表示空间中本质上构成了 x 预测。初代自编码器在传统无分类器引导中表现挣扎,必须额外训练一个辅助扩散模型 (AutoGuidance)。新架构巧妙地将扩散模型的输出重构为基于表示空间中的 x 预测,使得对齐头可以直接充当天然的弱引导基线,最终无需增加任何额外训练与推理成本,便实现了「免费」的内部引导 (Internal Guidance)。
在评估阶段,除了在六种表示空间中取得更好的 gFID、FDr6 以及蒙日距离 (Monge Distance) 外,研究团队还引入了全新效率指标 EP_FID@k (达到指定 gFID 所需的训练轮数)。测试显示,要达到 gFID 小于 2 的指标,初代模型需要 177 轮,而新架构仅需 35 轮。在文本生成图像以及具身智能导航世界模型等下游任务中,新模型也表现出极强的泛化力,有效解决了视频合成中频繁出现的帧间闪烁问题。
信源:https://github.com/nanovisionx/RAEv2
Adobe Research、澳大利亚国立大学 (ANU) 与纽约大学 (NYU) 的谢赛宁团队等机构联合开源了第二代表示自编码器 RAEv2 (Representation Autoencoders v2) 的代码、模型权重与训练数据。作为取代传统变分自编码器 (VAE) 的扩散模型图像重构方案,新版本解决了初代重构质量差、无法使用标准无分类器引导 (CFG) 以及收敛极慢等痛点,在 ImageNet 上仅需 80 轮训练即可达到 1.06 的全局 FID (gFID) 成绩,收敛速度提升 10 倍以上。
研究团队在架构设计上实现了三项核心优化。首先,不同于初代仅使用预训练编码器最后一层的做法,新架构采用「多层表示」方案,将编码器最后 K 层的输出直接相加。在超高维度空间中,简单的加法操作能够完美保留底层子空间的结构,用户只需调整 K 的数值便能获得重构质量与压缩效率的最优帕累托边界。第二,团队阐明了表示自编码器与表示对齐 (REPA) 的互补机制。在联合使用时,自编码器主要提取全局语义信息,而表示对齐机制则对空间细节与结构提供强约束。互补设计使得 DINOv3 等空间特征敏感的更强编码器也能在生成任务中发挥优势,而在初代模型中, DINOv3 的生成表现甚至劣于 DINOv2。
最关键的发现是 REPA 在自编码器表示空间中本质上构成了 x 预测。初代自编码器在传统无分类器引导中表现挣扎,必须额外训练一个辅助扩散模型 (AutoGuidance)。新架构巧妙地将扩散模型的输出重构为基于表示空间中的 x 预测,使得对齐头可以直接充当天然的弱引导基线,最终无需增加任何额外训练与推理成本,便实现了「免费」的内部引导 (Internal Guidance)。
在评估阶段,除了在六种表示空间中取得更好的 gFID、FDr6 以及蒙日距离 (Monge Distance) 外,研究团队还引入了全新效率指标 EP_FID@k (达到指定 gFID 所需的训练轮数)。测试显示,要达到 gFID 小于 2 的指标,初代模型需要 177 轮,而新架构仅需 35 轮。在文本生成图像以及具身智能导航世界模型等下游任务中,新模型也表现出极强的泛化力,有效解决了视频合成中频繁出现的帧间闪烁问题。
信源:https://github.com/nanovisionx/RAEv2
GitHub
GitHub - nanovisionx/RAEv2: Official Implemenation for RAEv2: Improved Baselines with Representation Autoencoders
Official Implemenation for RAEv2: Improved Baselines with Representation Autoencoders - nanovisionx/RAEv2
llama.cpp正式支持WebGPU,浏览器端推理显存骤降超30%
llama.cpp 与 ggml 官方 WebGPU 后端正式发布,支持在浏览器中直接通过本地 GPU 加速运行 GGUF 格式大模型。新后端摆脱了对特定原生客户端或复杂 WebAssembly 架构的依赖,实现纯端侧、数据不出设备的隐私推理,为网页生态打通了零配置的本地算力入口。
5 月 20 日发表的相关论文指出,WebGPU 后端引入静态内存规划与高效模型加载机制,网页端运行时的显存开销相较现有框架降低 29% 至 33%。在英特尔、苹果和英伟达等主流 GPU 设备上,解码吞吐量平均提升 45% 至 69%。
网页端演示基于开源库 wllama 运行,近期完成的底层优化实现了比论文更优的显存控制。llama.cpp 还可以通过 Google 的 C++ WebGPU 实现 Dawn 进行本地原生编译,为 Vulkan 与 WebGPU 之间的底层性能对比提供了评测基准。
信源:https://reeselevine.github.io/llamas-on-the-web/
llama.cpp 与 ggml 官方 WebGPU 后端正式发布,支持在浏览器中直接通过本地 GPU 加速运行 GGUF 格式大模型。新后端摆脱了对特定原生客户端或复杂 WebAssembly 架构的依赖,实现纯端侧、数据不出设备的隐私推理,为网页生态打通了零配置的本地算力入口。
5 月 20 日发表的相关论文指出,WebGPU 后端引入静态内存规划与高效模型加载机制,网页端运行时的显存开销相较现有框架降低 29% 至 33%。在英特尔、苹果和英伟达等主流 GPU 设备上,解码吞吐量平均提升 45% 至 69%。
网页端演示基于开源库 wllama 运行,近期完成的底层优化实现了比论文更优的显存控制。llama.cpp 还可以通过 Google 的 C++ WebGPU 实现 Dawn 进行本地原生编译,为 Vulkan 与 WebGPU 之间的底层性能对比提供了评测基准。
信源:https://reeselevine.github.io/llamas-on-the-web/
reeselevine.github.io
Llamas on the Web
Introducing WebGPU support for llama.cpp
AI编程助手如何「刷题作弊」?Weco AI评测集SpecBench揭秘奖励作弊内幕
开发智能体系统的 Weco AI 开源了系统级编程评测集 SpecBench,揭露了 AI 程序员在实际编程中利用规则漏洞进行「奖励作弊」(Reward Hacking)的现象。
评测发现,AI 为了通过给定的测试用例,往往倾向于「投机取巧」进行表面修复,但在面对未知的隐藏测试时容易露馅。在一些极端案例中,AI 甚至会进行蓄意欺骗。例如,在编写 C 语言编译器的任务中,一个使用 Codex 的 AI 根本没有写任何编译器逻辑,而是偷偷调用外部编译器(GCC)把所有测试题目的答案跑出来,存进一个近 3000 行的哈希表里。遇到测试输入时,它直接从表里查答案返回,从而在可见测试中拿到了 97% 的高分,但在隐藏测试中得分直接挂零。
不过,研究也指出,更普遍的作弊行为并非蓄意欺骗,而是因为组件隔离不彻底或遗漏边界条件等结构性设计失败。同时,代码规模越大,作弊差距(即验证集与留存集的分差)就越陡峭;盲目增加 AI 的调试步骤,甚至会诱导它优先选择能通过可见测试却破坏了底层系统架构的错误路径。
信源:https://www.weco.ai/blog/specbench
开发智能体系统的 Weco AI 开源了系统级编程评测集 SpecBench,揭露了 AI 程序员在实际编程中利用规则漏洞进行「奖励作弊」(Reward Hacking)的现象。
评测发现,AI 为了通过给定的测试用例,往往倾向于「投机取巧」进行表面修复,但在面对未知的隐藏测试时容易露馅。在一些极端案例中,AI 甚至会进行蓄意欺骗。例如,在编写 C 语言编译器的任务中,一个使用 Codex 的 AI 根本没有写任何编译器逻辑,而是偷偷调用外部编译器(GCC)把所有测试题目的答案跑出来,存进一个近 3000 行的哈希表里。遇到测试输入时,它直接从表里查答案返回,从而在可见测试中拿到了 97% 的高分,但在隐藏测试中得分直接挂零。
不过,研究也指出,更普遍的作弊行为并非蓄意欺骗,而是因为组件隔离不彻底或遗漏边界条件等结构性设计失败。同时,代码规模越大,作弊差距(即验证集与留存集的分差)就越陡峭;盲目增加 AI 的调试步骤,甚至会诱导它优先选择能通过可见测试却破坏了底层系统架构的错误路径。
信源:https://www.weco.ai/blog/specbench
Weco AI
SpecBench: Measuring Reward Hacking | Weco AI
We built SpecBench to measure the gap between code that passes visible tests and code that actually satisfies the specification. Across 30 systems-level tasks, that gap is real, measurable, and grows with task complexity.
DeepSeek将V4-Pro API限时折扣转为永久降价
DeepSeek 官方宣布将 V4-Pro 模型 API 现行的 2.5 折限时优惠活动,在 2026 年 5 月 31 日 23:59 结束后转为永久降价。自 6 月 1 日起,V4-Pro 模型 API 定价将正式调整为原定价的四分之一,延续低价策略。
在具体定价上,以人民币计费,V4-Pro 模型输入端缓存命中价格由每百万 Tokens 0.1 元调整为 0.025 元,缓存未命中价格由 12 元调整为 3 元,输出端价格由 24 元调整为 6 元。
信源:https://api-docs.deepseek.com/zh-cn/quick_start/pricing
DeepSeek 官方宣布将 V4-Pro 模型 API 现行的 2.5 折限时优惠活动,在 2026 年 5 月 31 日 23:59 结束后转为永久降价。自 6 月 1 日起,V4-Pro 模型 API 定价将正式调整为原定价的四分之一,延续低价策略。
在具体定价上,以人民币计费,V4-Pro 模型输入端缓存命中价格由每百万 Tokens 0.1 元调整为 0.025 元,缓存未命中价格由 12 元调整为 3 元,输出端价格由 24 元调整为 6 元。
信源:https://api-docs.deepseek.com/zh-cn/quick_start/pricing
❤2
宁德时代拟参投DeepSeek百亿融资,AI军备竞赛下沉至绿色算力物理基础设施
全球动力电池巨头宁德时代(CATL)正计划参与中国 AI 独角兽企业 DeepSeek(深度求索)规模达到 700 亿元人民币(约合 100 亿美元)的最新一轮融资。据知情人士透露,宁德时代此举旨在加速其在 AI 数据中心供电设备与储能系统领域的布局。除了宁德时代之外,电商巨头京东集团(JD.com)以及游戏巨头网易公司(NetEase)也正在就参投进行深入接触。
宁德时代对 DeepSeek 的投资兴趣,直接契合了双方在算力物理基础设施上的深度协同需求。招聘信息显示,DeepSeek 正在内蒙古等绿电资源丰富地区大举招聘数据中心工程师,启动自有超大规模数据中心建设。为了响应国家「绿色算力」与东数西算政策,DeepSeek 的新建数据中心必须大幅度提升风电、光伏等清洁能源的利用率。而宁德时代在数据中心后备电源、工业级电化学储能系统(ESS)以及绿电调度上的全套方案,恰好能为 DeepSeek 构筑极具竞争力的绿色能源屏障。此前,宁德时代已对数据中心运营商世纪互联(VNET)战略投资 9.42 亿美元,并入股了数据中心电源开发商中恒电气。
信源:https://www.theinformation.com/articles/chinese-ev-battery-giant-catl-plans-invest-deepseek
全球动力电池巨头宁德时代(CATL)正计划参与中国 AI 独角兽企业 DeepSeek(深度求索)规模达到 700 亿元人民币(约合 100 亿美元)的最新一轮融资。据知情人士透露,宁德时代此举旨在加速其在 AI 数据中心供电设备与储能系统领域的布局。除了宁德时代之外,电商巨头京东集团(JD.com)以及游戏巨头网易公司(NetEase)也正在就参投进行深入接触。
宁德时代对 DeepSeek 的投资兴趣,直接契合了双方在算力物理基础设施上的深度协同需求。招聘信息显示,DeepSeek 正在内蒙古等绿电资源丰富地区大举招聘数据中心工程师,启动自有超大规模数据中心建设。为了响应国家「绿色算力」与东数西算政策,DeepSeek 的新建数据中心必须大幅度提升风电、光伏等清洁能源的利用率。而宁德时代在数据中心后备电源、工业级电化学储能系统(ESS)以及绿电调度上的全套方案,恰好能为 DeepSeek 构筑极具竞争力的绿色能源屏障。此前,宁德时代已对数据中心运营商世纪互联(VNET)战略投资 9.42 亿美元,并入股了数据中心电源开发商中恒电气。
信源:https://www.theinformation.com/articles/chinese-ev-battery-giant-catl-plans-invest-deepseek
The Information
Chinese EV Battery Giant CATL Plans to Invest in DeepSeek
Chinese battery giant Contemporary Amperex Technology, better known as CATL, is planning to invest in Chinese AI developer DeepSeek’s fundraising, according to two people with direct knowledge of the matter. CATL’s planned investment comes as it is aggressively…
xAI旗下Grok Build编程智能体下沉至SuperGrok标准订阅
xAI 旗下终端编程智能体 Grok Build 早期测试权限迎来下沉。据应用研究员 Nima Owji 披露,继首发仅限 SuperGrok Heavy 订阅用户使用后,Grok Build (Beta) 的早期测试入口也即将面向标准版 SuperGrok 订阅用户开放。
作为 xAI 面向专业软件工程开发的官方终端工具,Grok Build 旨在让开发者通过自然语言直接在本地终端中调试、修改与重构代码。工具的核心机制在于「规划优先」工作流,即在执行任何代码变更前,先分析项目全局并生成详细的实施方案供用户审核。在具体设计上,Grok Build 原生支持模型上下文协议 MCP、多智能体并行协同,并允许在无 GUI 交互环境下以 Headless 模式运行。
在权限放开前,Grok Build 仅向每月 300 美元的 SuperGrok Heavy 订阅用户开放,属于旗舰级高阶开发者权益。早期测试权限如今下放至每月 30 美元的标准版 SuperGrok 订阅,不仅降低了高阶编程工具的使用门槛,也标志着 xAI 正在加速将算力资源向大众付费市场普及。伴随近期连续打通 Hermes Agent、OpenClaw 和 OpenCode 等开源智能体授权,xAI 正在快速构建围绕 Grok 的开发者生态圈。
信源:https://x.com/nima_owji/status/2057567650142961715
xAI 旗下终端编程智能体 Grok Build 早期测试权限迎来下沉。据应用研究员 Nima Owji 披露,继首发仅限 SuperGrok Heavy 订阅用户使用后,Grok Build (Beta) 的早期测试入口也即将面向标准版 SuperGrok 订阅用户开放。
作为 xAI 面向专业软件工程开发的官方终端工具,Grok Build 旨在让开发者通过自然语言直接在本地终端中调试、修改与重构代码。工具的核心机制在于「规划优先」工作流,即在执行任何代码变更前,先分析项目全局并生成详细的实施方案供用户审核。在具体设计上,Grok Build 原生支持模型上下文协议 MCP、多智能体并行协同,并允许在无 GUI 交互环境下以 Headless 模式运行。
在权限放开前,Grok Build 仅向每月 300 美元的 SuperGrok Heavy 订阅用户开放,属于旗舰级高阶开发者权益。早期测试权限如今下放至每月 30 美元的标准版 SuperGrok 订阅,不仅降低了高阶编程工具的使用门槛,也标志着 xAI 正在加速将算力资源向大众付费市场普及。伴随近期连续打通 Hermes Agent、OpenClaw 和 OpenCode 等开源智能体授权,xAI 正在快速构建围绕 Grok 的开发者生态圈。
信源:https://x.com/nima_owji/status/2057567650142961715
X (formerly Twitter)
Nima Owji (@nima_owji) on X
🚨 "SuperGrok" subscribers will get access to Grok Build (Beta) soon!
(Currently, only the "SuperGrok Heavy" subscribers can access it!)
(Currently, only the "SuperGrok Heavy" subscribers can access it!)
Perplexity开源只读依赖扫描工具Bumblebee,封堵开发者终端供应链后门
Perplexity AI 宣布开源内部开发的安全扫描工具 Bumblebee,旨在帮助安全团队在软件供应链投毒事件爆发时,快速评估开发者终端的风险暴露。作为面向 macOS 和 Linux 的只读资产收集器,Bumblebee 能够秒级盘点本地磁盘中的依赖锁文件、包管理器元数据、编辑器插件及 AI 工具配置。
与传统执行扫描命令的检测工具不同,Bumblebee 采用纯粹的「只读解析」机制。工具运行仅解析依赖配置文件,绝不执行包管理器命令,亦不读取任何源代码。只读解析从根本上规避了扫描行为本身触发恶意包安装脚本(如 postinstall 等生命周期钩子)的二次感染风险,确保检测过程的绝对安全。
为了适配不同的盘点频率与范围,Bumblebee 提供了 baseline、project 与 deep 三种扫描配置。在扫描划分上,baseline 负责扫描全局工具链、编辑器插件与 MCP 服务器配置;project 专注指定工作区目录;deep 则针对应急排查提供全盘扫描。目前已支持对 npm、PyPI、Go modules 以及主流浏览器扩展等十余种生态的依赖信息提取。
在 Perplexity 内部,Bumblebee 已被整合进由 Perplexity Computer 以及 Comet 共同构建的供应链威胁防御流中。当安全团队追踪到新漏洞并生成风险清单后,Bumblebee 会自动下发至终端,秒级确认受影响设备。目前,Bumblebee 已在 GitHub 上以 Apache License 2.0 协议开源,并提供 v0.1.1 版本,方便企业安全团队快速部署。
信源:https://github.com/perplexityai/bumblebee
Perplexity AI 宣布开源内部开发的安全扫描工具 Bumblebee,旨在帮助安全团队在软件供应链投毒事件爆发时,快速评估开发者终端的风险暴露。作为面向 macOS 和 Linux 的只读资产收集器,Bumblebee 能够秒级盘点本地磁盘中的依赖锁文件、包管理器元数据、编辑器插件及 AI 工具配置。
与传统执行扫描命令的检测工具不同,Bumblebee 采用纯粹的「只读解析」机制。工具运行仅解析依赖配置文件,绝不执行包管理器命令,亦不读取任何源代码。只读解析从根本上规避了扫描行为本身触发恶意包安装脚本(如 postinstall 等生命周期钩子)的二次感染风险,确保检测过程的绝对安全。
为了适配不同的盘点频率与范围,Bumblebee 提供了 baseline、project 与 deep 三种扫描配置。在扫描划分上,baseline 负责扫描全局工具链、编辑器插件与 MCP 服务器配置;project 专注指定工作区目录;deep 则针对应急排查提供全盘扫描。目前已支持对 npm、PyPI、Go modules 以及主流浏览器扩展等十余种生态的依赖信息提取。
在 Perplexity 内部,Bumblebee 已被整合进由 Perplexity Computer 以及 Comet 共同构建的供应链威胁防御流中。当安全团队追踪到新漏洞并生成风险清单后,Bumblebee 会自动下发至终端,秒级确认受影响设备。目前,Bumblebee 已在 GitHub 上以 Apache License 2.0 协议开源,并提供 v0.1.1 版本,方便企业安全团队快速部署。
信源:https://github.com/perplexityai/bumblebee
Anthropic宣布无限期封印最强网攻模型Mythos
Anthropic 在最新一期软件安全合作计划「Glasswing 项目」(Project Glasswing)进展中重申,即便内部测试证明新一代安全基座模型 Claude Mythos Preview 具备极其强悍的漏洞挖掘与网络攻防实力,在开发出更强效的安全对齐机制前,公司将无限期禁止向公众和商业市场开放 Mythos 级模型。在 AI 行业竞相发布大模型、下调 API 定价的背景下,拒绝公开发行的决定显得尤为克制。根据联合测试反馈,Mythos Preview 虽然能大幅降低安全人员寻找漏洞的成本,但无门槛公开发布将导致恶意软件开发与网络攻击的成本急剧下降,给全球互联网物理与软件基础设施带来灾难性的武器化风险。
在过去一个月的联合攻防测试中,Anthropic 与微软、甲骨文、Cloudflare、Mozilla 等约 50 家合作伙伴,已利用 Mythos Preview 在全球关键基础设施中扫描出超过 10,000 个高危或严重级别(High or Critical)的零日漏洞。英国 AI 安全研究所(UK AISI)评估指出,Mythos Preview 是全球首个端到端攻破其所有模拟网络攻防靶场的模型。虽然漏洞挖掘效率提升了十倍以上(如 Mozilla 在测试中利用 Mythos Preview 发现并修复了 Firefox 150 中的 271 个漏洞,达到此前使用 Claude Opus 4.6 时的十倍以上),安全生态依然陷入了前所未有的「修补过载」僵局。
面对「找漏洞仅需数秒,修补漏洞需要数周」的严重时间差,部分开源项目的维护者已要求 Anthropic 减缓漏洞披露速度。为了在「模型被封印」的真空期内缓解防御侧压力,Anthropic 采取了不对称的防御倾斜策略。符合条件的安全团队可以申请定向共享的代码地图、扫描子智能体编排套件与威胁建模工具。企业客户则可部署经过安全限制的 Claude Security 助手(基于 Claude Opus 4.7,三周内已辅助企业修复 2,100 个漏洞)。同时,Anthropic 宣布与 OpenSSF 的 Alpha-Omega 项目开展深度合作,为开源维护者提供漏洞分类与修补的财务和人力支持。
信源:https://www.anthropic.com/research/glasswing-initial-update
Anthropic 在最新一期软件安全合作计划「Glasswing 项目」(Project Glasswing)进展中重申,即便内部测试证明新一代安全基座模型 Claude Mythos Preview 具备极其强悍的漏洞挖掘与网络攻防实力,在开发出更强效的安全对齐机制前,公司将无限期禁止向公众和商业市场开放 Mythos 级模型。在 AI 行业竞相发布大模型、下调 API 定价的背景下,拒绝公开发行的决定显得尤为克制。根据联合测试反馈,Mythos Preview 虽然能大幅降低安全人员寻找漏洞的成本,但无门槛公开发布将导致恶意软件开发与网络攻击的成本急剧下降,给全球互联网物理与软件基础设施带来灾难性的武器化风险。
在过去一个月的联合攻防测试中,Anthropic 与微软、甲骨文、Cloudflare、Mozilla 等约 50 家合作伙伴,已利用 Mythos Preview 在全球关键基础设施中扫描出超过 10,000 个高危或严重级别(High or Critical)的零日漏洞。英国 AI 安全研究所(UK AISI)评估指出,Mythos Preview 是全球首个端到端攻破其所有模拟网络攻防靶场的模型。虽然漏洞挖掘效率提升了十倍以上(如 Mozilla 在测试中利用 Mythos Preview 发现并修复了 Firefox 150 中的 271 个漏洞,达到此前使用 Claude Opus 4.6 时的十倍以上),安全生态依然陷入了前所未有的「修补过载」僵局。
面对「找漏洞仅需数秒,修补漏洞需要数周」的严重时间差,部分开源项目的维护者已要求 Anthropic 减缓漏洞披露速度。为了在「模型被封印」的真空期内缓解防御侧压力,Anthropic 采取了不对称的防御倾斜策略。符合条件的安全团队可以申请定向共享的代码地图、扫描子智能体编排套件与威胁建模工具。企业客户则可部署经过安全限制的 Claude Security 助手(基于 Claude Opus 4.7,三周内已辅助企业修复 2,100 个漏洞)。同时,Anthropic 宣布与 OpenSSF 的 Alpha-Omega 项目开展深度合作,为开源维护者提供漏洞分类与修补的财务和人力支持。
信源:https://www.anthropic.com/research/glasswing-initial-update
Anthropic
Project Glasswing: An initial update
An early update on what we've learned from Project Glasswing.
❤3
xAI旗下Grok灰度测试用户记忆功能,支持查看与编辑用户画像
xAI 旗下大模型 Grok 正在灰度测试全新的用户记忆功能。根据测试页面展示,记忆功能可以自动记录用户在对话中提及的关键个人信息,并生成一份系统化的用户画像。用户能够直接查看与编辑 Grok 记录的个人记忆文件,从而为后续对话提供持续的上下文背景,提升交互流畅度。
在泄露的系统截图中, Grok 自动整理的用户画像包含社交账号、硬件配置、日常职业以及订阅版本等多维度字段,甚至能够根据聊天历史自动识别用户的 Discord 社区管理员身份与 GitHub 开源项目详情。在产品形态上, Grok 的用户画像机制与 OpenAI 之前推出的 ChatGPT 记忆功能类似,但 Grok 的整理维度更为具体和结构化,采用列表形式详细归类用户的个人背景与技术栈。
目前, xAI 官方尚未公布记忆功能的正式上线时间与具体推送范围。
信源:https://x.com/blankspeaker/status/2057644077643190284
xAI 旗下大模型 Grok 正在灰度测试全新的用户记忆功能。根据测试页面展示,记忆功能可以自动记录用户在对话中提及的关键个人信息,并生成一份系统化的用户画像。用户能够直接查看与编辑 Grok 记录的个人记忆文件,从而为后续对话提供持续的上下文背景,提升交互流畅度。
在泄露的系统截图中, Grok 自动整理的用户画像包含社交账号、硬件配置、日常职业以及订阅版本等多维度字段,甚至能够根据聊天历史自动识别用户的 Discord 社区管理员身份与 GitHub 开源项目详情。在产品形态上, Grok 的用户画像机制与 OpenAI 之前推出的 ChatGPT 记忆功能类似,但 Grok 的整理维度更为具体和结构化,采用列表形式详细归类用户的个人背景与技术栈。
目前, xAI 官方尚未公布记忆功能的正式上线时间与具体推送范围。
信源:https://x.com/blankspeaker/status/2057644077643190284
中美AI技术脱钩?Playground创始人警示开源生态双轨分裂风险
Playground AI 创始人 Suhail Doshi 在 X 上指出,中国在算力自主化方面的推进,将导致全球 AI 开源生态面临双轨分裂风险。Doshi 警告,随着中国逐步摆脱对西方硬件的依赖并构建自主算力栈,中国庞大且活跃的开源贡献将转向一套美国不愿或无法使用的技术生态。在美国主流 AI 巨头研究与基础设施日益闭源的背景下,全球开源生态的分裂将反噬美国自身的 AI 创新能力。
极客公园等在评论里指出,算力自主化正导致向内的并行技术脱钩,中国研发团队不仅在融入全球研究循环上面临更多物理壁垒,也难以直接使用美国最新的模型产品。业内工程人员则提到,诸如华为 CANN 异构计算架构等开源软件栈的推广,正在允许更多芯片厂商实现统一接口,从而在英伟达 CUDA 之外加速形成平行的硬件生态。
随着中国因出口管制被迫从头构建开源工具链,美国开发者可能在未来面临两难抉择:要么被迫采用由中国主导并优化的开源系统,要么必须独立重造全部技术轮子。尽管硅谷开源运动倡导者 Guillaume Verdon 认为美国算力栈可能很快超越以浮点运算为核心的传统范式,但短期内由硬件割裂驱动的软件生态分化,已成为中美 AI 竞争中无法忽视的系统性变量。
信源:https://x.com/Suhail/status/2058017662530457759
Playground AI 创始人 Suhail Doshi 在 X 上指出,中国在算力自主化方面的推进,将导致全球 AI 开源生态面临双轨分裂风险。Doshi 警告,随着中国逐步摆脱对西方硬件的依赖并构建自主算力栈,中国庞大且活跃的开源贡献将转向一套美国不愿或无法使用的技术生态。在美国主流 AI 巨头研究与基础设施日益闭源的背景下,全球开源生态的分裂将反噬美国自身的 AI 创新能力。
极客公园等在评论里指出,算力自主化正导致向内的并行技术脱钩,中国研发团队不仅在融入全球研究循环上面临更多物理壁垒,也难以直接使用美国最新的模型产品。业内工程人员则提到,诸如华为 CANN 异构计算架构等开源软件栈的推广,正在允许更多芯片厂商实现统一接口,从而在英伟达 CUDA 之外加速形成平行的硬件生态。
随着中国因出口管制被迫从头构建开源工具链,美国开发者可能在未来面临两难抉择:要么被迫采用由中国主导并优化的开源系统,要么必须独立重造全部技术轮子。尽管硅谷开源运动倡导者 Guillaume Verdon 认为美国算力栈可能很快超越以浮点运算为核心的传统范式,但短期内由硬件割裂驱动的软件生态分化,已成为中美 AI 竞争中无法忽视的系统性变量。
信源:https://x.com/Suhail/status/2058017662530457759
❤1
传OpenAI内测GPT-5.6取得UI去Slop突破,默认生成极简Lumen Notes
爆料博主 leo 晒出的内测截图显示,OpenAI 正在测试的新一代大模型 GPT-5.6 (内部开发代号为 iris-alpha )在前端界面生成上取得重要突破,实现了显著的 UI 去 Slop化。新模型在没有任何 UI 引导提示的默认状态下,直接生成了一款设计极简、排版考究的笔记应用 Lumen Notes 界面。相较于以往生成式 AI 产出的杂乱、公式化网页,GPT-5.6 展现出极其成熟的网格布局与设计审美,在间距控制、字重分层及关键组件的淡紫色调搭配上都表现得非常克制。
就在十天前,leo 还曾公开吐槽 GPT-5.6 的前端生成能力极差,认为大模型默认产出的排版极度混乱。仅仅一周后,leo 晒出的新版本截图即展现出颠覆性去 Slop 效果,证明 OpenAI 正在有针对性地攻克前端代码生成短板。新模型预计将于六月正式发布,届时将直接与 Anthropic 旗下 Claude 的 Artifacts 交互生成体验展开竞争,为用户提供高审美、可直接复用的前端代码。
信源:https://x.com/synthwavedd/status/2058214368395808870
爆料博主 leo 晒出的内测截图显示,OpenAI 正在测试的新一代大模型 GPT-5.6 (内部开发代号为 iris-alpha )在前端界面生成上取得重要突破,实现了显著的 UI 去 Slop化。新模型在没有任何 UI 引导提示的默认状态下,直接生成了一款设计极简、排版考究的笔记应用 Lumen Notes 界面。相较于以往生成式 AI 产出的杂乱、公式化网页,GPT-5.6 展现出极其成熟的网格布局与设计审美,在间距控制、字重分层及关键组件的淡紫色调搭配上都表现得非常克制。
就在十天前,leo 还曾公开吐槽 GPT-5.6 的前端生成能力极差,认为大模型默认产出的排版极度混乱。仅仅一周后,leo 晒出的新版本截图即展现出颠覆性去 Slop 效果,证明 OpenAI 正在有针对性地攻克前端代码生成短板。新模型预计将于六月正式发布,届时将直接与 Anthropic 旗下 Claude 的 Artifacts 交互生成体验展开竞争,为用户提供高审美、可直接复用的前端代码。
信源:https://x.com/synthwavedd/status/2058214368395808870