DeepSeek创始人谈中美AI差距
2026年7月,腾讯科技发布了DeepSeek创始人梁文锋与投资者的近4小时会议记录。梁文锋在记录中详细阐述了中美AI差距的核心观点,认为所有差异——包括人才、模型能力和应用——本质上都源于算力资源的差距。他指出,DeepSeek的效率优势并非技术突破,而是对资源短缺的适应。中国不仅无法购买足够芯片,资本投入也远低于美国,人才瓶颈同样源于算力不足导致实验机会减少。他估算DeepSeek落后美国两年,但仅使用二十分之一的算力,并希望改写叙事,计划将差距缩小至6个月甚至3个月。梁文锋坚信规模扩展的有效性,但限制因素并非意愿而是算力。他还强调,美国认为规模扩展已达天花板,而中国远未触及这一极限。 #DeepSeek #AI #算力差距 #梁文锋 #人工智能 #中国AI
2026年7月,腾讯科技发布了DeepSeek创始人梁文锋与投资者的近4小时会议记录。梁文锋在记录中详细阐述了中美AI差距的核心观点,认为所有差异——包括人才、模型能力和应用——本质上都源于算力资源的差距。他指出,DeepSeek的效率优势并非技术突破,而是对资源短缺的适应。中国不仅无法购买足够芯片,资本投入也远低于美国,人才瓶颈同样源于算力不足导致实验机会减少。他估算DeepSeek落后美国两年,但仅使用二十分之一的算力,并希望改写叙事,计划将差距缩小至6个月甚至3个月。梁文锋坚信规模扩展的有效性,但限制因素并非意愿而是算力。他还强调,美国认为规模扩展已达天花板,而中国远未触及这一极限。 #DeepSeek #AI #算力差距 #梁文锋 #人工智能 #中国AI
使用 MUD 游戏评估 AI 遭遇“裁判偏差”,LLM 评分稳定性受质疑
一项由独立研究团队开展的实验表明,将多用户地牢(MUD)游戏用作大语言模型(LLM)的评估环境时,模型排名对评分组件高度敏感,尤其是依赖 LLM 裁判(如 Gemini Flash Lite)的评分项。实验运行了 650 轮,评估 13 个模型在社交任务中的表现,但聚合数据无法揭示具体哪些模型受影响最大;协议检测的 κ 值为 0.04,而独立裁判间的模型级别一致性从 21.7% 波动至 84.8%。移除依赖裁判的评分项后,排名相关性降至 ρ=0.70,其中一个前沿模型下跌 6 位。研究者指出,使用 LLM 裁判的基准测试应报告每个主体的协议审计,并进行裁判消融实验以验证稳定性。该发现揭示了裁判偏差在整体指标中被掩盖的风险,并提供了开源代码与数据供社区验证。 #AI评估 #LLM裁判 #MUD游戏 #模型评测 #偏差分析 #独立研究
一项由独立研究团队开展的实验表明,将多用户地牢(MUD)游戏用作大语言模型(LLM)的评估环境时,模型排名对评分组件高度敏感,尤其是依赖 LLM 裁判(如 Gemini Flash Lite)的评分项。实验运行了 650 轮,评估 13 个模型在社交任务中的表现,但聚合数据无法揭示具体哪些模型受影响最大;协议检测的 κ 值为 0.04,而独立裁判间的模型级别一致性从 21.7% 波动至 84.8%。移除依赖裁判的评分项后,排名相关性降至 ρ=0.70,其中一个前沿模型下跌 6 位。研究者指出,使用 LLM 裁判的基准测试应报告每个主体的协议审计,并进行裁判消融实验以验证稳定性。该发现揭示了裁判偏差在整体指标中被掩盖的风险,并提供了开源代码与数据供社区验证。 #AI评估 #LLM裁判 #MUD游戏 #模型评测 #偏差分析 #独立研究
RTX 5060 消费级硬件 LLM 并发测试
一位高级玩家在搭载 RTX 5060(8GB VRAM)的消费级 PC 上,对 17 个 LLM 模型进行了大规模并发测试。实验在一个“日常使用”环境中进行,而非理想实验室环境,旨在真实反映消费级硬件的极限。核心发现是:通过池化代理,最高实现了 8.7 倍的吞吐量提升。其中,MiniCPM5 1B 模型表现最佳,峰值达到 983 tok/s(是单线程速度的 433%)。而 Qwen3.5 0.8B 模型在启用多令牌预测时,因序列化请求导致并发性能毫无扩展。测试还发现,推理模型的大部分计算开销隐藏在推理内容中,负载增加时,首令牌生成时间会从毫秒级恶化至数十秒。尽管环境严苛,全部 408 次运行中错误数为零。测试使用 Node 代理循环与 LM Studio 本地端点通信,每个模型在 1 至 24 的并发级别下各运行 24 次,每次持续 60 秒。 #LLM #消费级硬件 #并发测试 #RTX5060 #AI性能
一位高级玩家在搭载 RTX 5060(8GB VRAM)的消费级 PC 上,对 17 个 LLM 模型进行了大规模并发测试。实验在一个“日常使用”环境中进行,而非理想实验室环境,旨在真实反映消费级硬件的极限。核心发现是:通过池化代理,最高实现了 8.7 倍的吞吐量提升。其中,MiniCPM5 1B 模型表现最佳,峰值达到 983 tok/s(是单线程速度的 433%)。而 Qwen3.5 0.8B 模型在启用多令牌预测时,因序列化请求导致并发性能毫无扩展。测试还发现,推理模型的大部分计算开销隐藏在推理内容中,负载增加时,首令牌生成时间会从毫秒级恶化至数十秒。尽管环境严苛,全部 408 次运行中错误数为零。测试使用 Node 代理循环与 LM Studio 本地端点通信,每个模型在 1 至 24 的并发级别下各运行 24 次,每次持续 60 秒。 #LLM #消费级硬件 #并发测试 #RTX5060 #AI性能