BenchmarkList 上线:一站式追踪超2400个AI基准测试与模型
一个名为BenchmarkList的新平台正式上线,旨在为AI社区提供一站式基准测试、模型和能力追踪服务。该平台目前已收录2465个基准测试、24173个模型及1594个提供商,并提供交互式时间线、前沿模型能力评分(如GPT-5.6 Sol评分156.99)以及热门基准测试排名(如SWE-Marathon、DeepSWE等)。平台还列出了顶级提供商,包括OpenAI、Google、Anthropic、Qwen和DeepSeek等。近期新增了WANDR、DuelLab GameBench 2、FrontierFinance、RoboDojo等多个新基准测试,覆盖代理、游戏、金融和机器人等领域。其中RoboDojo是一个统一的模拟与真实世界基准,用于系统评估通用机器人操作策略,包含42个模拟任务和18个真实世界任务。 #AI #基准测试 #大模型 #机器学习 #机器人 #科技新闻
一个名为BenchmarkList的新平台正式上线,旨在为AI社区提供一站式基准测试、模型和能力追踪服务。该平台目前已收录2465个基准测试、24173个模型及1594个提供商,并提供交互式时间线、前沿模型能力评分(如GPT-5.6 Sol评分156.99)以及热门基准测试排名(如SWE-Marathon、DeepSWE等)。平台还列出了顶级提供商,包括OpenAI、Google、Anthropic、Qwen和DeepSeek等。近期新增了WANDR、DuelLab GameBench 2、FrontierFinance、RoboDojo等多个新基准测试,覆盖代理、游戏、金融和机器人等领域。其中RoboDojo是一个统一的模拟与真实世界基准,用于系统评估通用机器人操作策略,包含42个模拟任务和18个真实世界任务。 #AI #基准测试 #大模型 #机器学习 #机器人 #科技新闻
Thinking Machines 发布 975B 参数开源大模型 Inkling
穆拉蒂创立的 Thinking Machines 公司正式发布开源大模型 Inkling。该模型拥有 9750 亿总参数(活跃参数 410 亿),采用混合专家(MoE)架构,支持高达 100 万 token 的上下文窗口,可处理文本、图像和音频输入。作为一款开源权重模型,Inkling 可在 Tinker 平台进行微调。其能力覆盖通用智能、数学推理、编码与工具调用,并具备多模态输入处理、可控推理时间及置信度预测等特性,旨在平衡速度与性能,便于开发者定制。 #ThinkingMachines #Inkling #大模型 #开源 #AI #多模态 #MoE #科技新闻
穆拉蒂创立的 Thinking Machines 公司正式发布开源大模型 Inkling。该模型拥有 9750 亿总参数(活跃参数 410 亿),采用混合专家(MoE)架构,支持高达 100 万 token 的上下文窗口,可处理文本、图像和音频输入。作为一款开源权重模型,Inkling 可在 Tinker 平台进行微调。其能力覆盖通用智能、数学推理、编码与工具调用,并具备多模态输入处理、可控推理时间及置信度预测等特性,旨在平衡速度与性能,便于开发者定制。 #ThinkingMachines #Inkling #大模型 #开源 #AI #多模态 #MoE #科技新闻
企业转向开源LLM推理
开源LLM推理领域在2026年迎来重要转折。许多企业在依赖前沿模型API后,面临成本飙升、法律合规风险及延迟控制不足等问题。财务部门发现API账单增长远超收入增速,法律部门担忧数据被第三方接触,工程团队则需要P99延迟保障。这些压力促使企业探索替代方案。文章指出,离开前沿API后主要有两条路径:一是选择托管推理服务(如Fireworks、Together等),保留API体验但获得模型选择权和数据控制权;二是完全自建,即采购开源权重、自租GPU并搭建开源推理堆栈。若选择自建,通常从单副本(复制模型到一张或多张GPU)开始,并使用vLLM等引擎启动。这一趋势反映了企业对成本、数据主权和性能控制的综合需求,开源堆栈正从零散组件走向系统化部署。 #开源LLM #推理 #自建 #成本控制 #数据安全 #API替代 #技术决策
开源LLM推理领域在2026年迎来重要转折。许多企业在依赖前沿模型API后,面临成本飙升、法律合规风险及延迟控制不足等问题。财务部门发现API账单增长远超收入增速,法律部门担忧数据被第三方接触,工程团队则需要P99延迟保障。这些压力促使企业探索替代方案。文章指出,离开前沿API后主要有两条路径:一是选择托管推理服务(如Fireworks、Together等),保留API体验但获得模型选择权和数据控制权;二是完全自建,即采购开源权重、自租GPU并搭建开源推理堆栈。若选择自建,通常从单副本(复制模型到一张或多张GPU)开始,并使用vLLM等引擎启动。这一趋势反映了企业对成本、数据主权和性能控制的综合需求,开源堆栈正从零散组件走向系统化部署。 #开源LLM #推理 #自建 #成本控制 #数据安全 #API替代 #技术决策
Linus Torvalds 告诉反对 AI 的贡献者
Linux 创始人 Linus Torvalds 在邮件列表中明确表示,Linux 不是“反 AI”项目,反对在社区中使用 AI 的贡献者可以自行 fork 项目或直接离开。他称 AI 是“有用的工具”,强调如今已无人能质疑其价值。Torvalds 承认 AI 会给维护者带来负担,也会不断暴露出尴尬的 bug,但解决方案不是把头埋进沙子里。他透露,过去一年多自己的态度已发生转变——从最初认为 90% 的 AI 是营销炒作,到如今认为 LLM 工具应帮助维护者而非制造痛苦。Torvalds 表示,内核社区基于技术优势做开源决策,不因宗教式恐惧拒绝新工具。Senior 维护者 Greg Kroah-Hartman 也证实,AI 辅助的 bug 报告和代码审查在过去几个月大幅改善。Torvalds 最后调侃道:“AI 并不完美,但指出 AI 问题的人最好也照照镜子——自然智能也并非总是那么出色。” #LinusTorvalds #Linux #AI #开源 #内核 #技术争议 #软件维护
Linux 创始人 Linus Torvalds 在邮件列表中明确表示,Linux 不是“反 AI”项目,反对在社区中使用 AI 的贡献者可以自行 fork 项目或直接离开。他称 AI 是“有用的工具”,强调如今已无人能质疑其价值。Torvalds 承认 AI 会给维护者带来负担,也会不断暴露出尴尬的 bug,但解决方案不是把头埋进沙子里。他透露,过去一年多自己的态度已发生转变——从最初认为 90% 的 AI 是营销炒作,到如今认为 LLM 工具应帮助维护者而非制造痛苦。Torvalds 表示,内核社区基于技术优势做开源决策,不因宗教式恐惧拒绝新工具。Senior 维护者 Greg Kroah-Hartman 也证实,AI 辅助的 bug 报告和代码审查在过去几个月大幅改善。Torvalds 最后调侃道:“AI 并不完美,但指出 AI 问题的人最好也照照镜子——自然智能也并非总是那么出色。” #LinusTorvalds #Linux #AI #开源 #内核 #技术争议 #软件维护