AI 打工排行榜更新:Claude Fable 5 自动化率 16.1%,是 GPT
AI 安全中心(CAIS)与 Scale AI 联合发布的远程劳动力指数(RLI)最新数据显示,Claude Fable 5 以 16.1% 的自动化率位居榜首,约为第二名 Opus 4.8(8.3%)的两倍,是第三名 GPT-5.5(6.3%)的 2.5 倍。该指数基于 240 个来自 Upwork 的真实自由职业项目,涵盖 3D 建模、平面设计、数据分析等 23 个领域,评估 AI 能否独立完成客户付费级别的工作。相比 8 个月前榜单最高分仅 2.5%,前沿模型自动化能力已提升四倍以上。Fable 5 的高分得益于“工人-评审循环”框架,即一个独立评审 Agent 模拟苛刻客户审核并返工修改,同时其项目预算上限为 150 美元,高于其他模型的 50 美元。然而,测试发现 AI 评审在取代人工评审时存在严重偏差,对部分模型评分高估数倍。此外,84% 的项目目前仍无法被 AI 独立完成,AI 能力呈现出“锯齿状前沿”特征,而非简单随任务耗时增加而下降。 #AI #Claude #Fable5 #GPT5 #RLI #自动化 #科技新闻 #远程工作
AI 安全中心(CAIS)与 Scale AI 联合发布的远程劳动力指数(RLI)最新数据显示,Claude Fable 5 以 16.1% 的自动化率位居榜首,约为第二名 Opus 4.8(8.3%)的两倍,是第三名 GPT-5.5(6.3%)的 2.5 倍。该指数基于 240 个来自 Upwork 的真实自由职业项目,涵盖 3D 建模、平面设计、数据分析等 23 个领域,评估 AI 能否独立完成客户付费级别的工作。相比 8 个月前榜单最高分仅 2.5%,前沿模型自动化能力已提升四倍以上。Fable 5 的高分得益于“工人-评审循环”框架,即一个独立评审 Agent 模拟苛刻客户审核并返工修改,同时其项目预算上限为 150 美元,高于其他模型的 50 美元。然而,测试发现 AI 评审在取代人工评审时存在严重偏差,对部分模型评分高估数倍。此外,84% 的项目目前仍无法被 AI 独立完成,AI 能力呈现出“锯齿状前沿”特征,而非简单随任务耗时增加而下降。 #AI #Claude #Fable5 #GPT5 #RLI #自动化 #科技新闻 #远程工作
GPT-5.6 性能超Claude Opus,AI代理迁移成本降27%速度升2.2倍
据CSDN博客报道,最新发布的大模型GPT-5.6在多项基准测试中超越Claude Opus,展现出更强的推理与生成能力。同时,AI代理平台Ploy在迁移至新架构后,实现了运营成本降低27%,处理速度提升2.2倍的显著成效。这一突破不仅验证了GPT-5.6在企业级AI应用中的潜力,也为代理部署优化提供了参考。相关技术细节已在Ploy的官方文档中披露。 #GPT5.6 #ClaudeOpus #AI代理 #大模型 #技术进步
据CSDN博客报道,最新发布的大模型GPT-5.6在多项基准测试中超越Claude Opus,展现出更强的推理与生成能力。同时,AI代理平台Ploy在迁移至新架构后,实现了运营成本降低27%,处理速度提升2.2倍的显著成效。这一突破不仅验证了GPT-5.6在企业级AI应用中的潜力,也为代理部署优化提供了参考。相关技术细节已在Ploy的官方文档中披露。 #GPT5.6 #ClaudeOpus #AI代理 #大模型 #技术进步
AI巨头掀起价格战,OpenAI、Meta、SpaceX AI齐推低成本模型
近期,全球人工智能领域掀起新一轮价格竞争。OpenAI、Meta、SpaceX AI等巨头相继推出低成本大语言模型,旨在降低AI应用门槛。OpenAI推出了更轻量化、成本更低的API接入版本;Meta则开源了其Llama系列模型的微调版本,吸引开发者使用;而SpaceX AI则首次发布面向企业的高性价比推理模型。分析认为,这场价格战背后是AI行业从技术研发转向规模化应用的关键转折,预计将加速AI在各行业的普及,但也可能引发中小企业的淘汰潮。 #AI价格战 #OpenAI #Meta #SpaceXAI #低成本模型 #人工智能 #科技竞争
近期,全球人工智能领域掀起新一轮价格竞争。OpenAI、Meta、SpaceX AI等巨头相继推出低成本大语言模型,旨在降低AI应用门槛。OpenAI推出了更轻量化、成本更低的API接入版本;Meta则开源了其Llama系列模型的微调版本,吸引开发者使用;而SpaceX AI则首次发布面向企业的高性价比推理模型。分析认为,这场价格战背后是AI行业从技术研发转向规模化应用的关键转折,预计将加速AI在各行业的普及,但也可能引发中小企业的淘汰潮。 #AI价格战 #OpenAI #Meta #SpaceXAI #低成本模型 #人工智能 #科技竞争
AI巨头掀起低价风暴,OpenAI、Meta、SpaceXAI纷纷推出低成本模型
近期,全球AI行业掀起价格战。OpenAI、Meta、SpaceXAI等科技巨头相继发布低成本大模型,旨在降低AI应用门槛。OpenAI推出轻量化版本,以更实惠的价格提供核心推理能力;Meta则开源其小型模型,推动开发者生态;SpaceXAI也加入竞争,主打高效能与低成本结合。这一趋势反映了AI市场从技术竞赛转向商业化落地的策略调整。分析认为,随着模型成本下降,AI将在中小企业及垂直场景中得到更广泛应用,但同时也可能加剧行业竞争,冲击部分初创公司。目前,多家厂商已下调API调用费用,引发市场对AI产业盈利模式的重新思考。 #AI #价格战 #OpenAI #Meta #SpaceXAI #大模型 #科技新闻
近期,全球AI行业掀起价格战。OpenAI、Meta、SpaceXAI等科技巨头相继发布低成本大模型,旨在降低AI应用门槛。OpenAI推出轻量化版本,以更实惠的价格提供核心推理能力;Meta则开源其小型模型,推动开发者生态;SpaceXAI也加入竞争,主打高效能与低成本结合。这一趋势反映了AI市场从技术竞赛转向商业化落地的策略调整。分析认为,随着模型成本下降,AI将在中小企业及垂直场景中得到更广泛应用,但同时也可能加剧行业竞争,冲击部分初创公司。目前,多家厂商已下调API调用费用,引发市场对AI产业盈利模式的重新思考。 #AI #价格战 #OpenAI #Meta #SpaceXAI #大模型 #科技新闻
AI 是人类的产物,人类应当共同拥有 AI
埃隆·马斯克成为世界首富,其财富不仅源自个人能力,也离不开资本主义金融架构和税收漏洞的支撑。然而,科技亿万富翁的公司在掠夺人类独特的创造力:生成式 AI 模型从社交媒体数据、学术成果、文学作品、艺术、电影、音乐、播客、软件代码乃至医疗记录等全球创意产品中训练,并通过用户提示数据微调提升预测能力。AI 无疑是人类的产物。Bernie Sanders 提议对 OpenAI、Anthropic 和 xAI 等 AI 公司征收一次性 50% 的股票税,这是一种合理的补偿措施。但这一提议陷入民族主义陷阱:用于训练的创意产品及研究人员、开发者、初创企业多来自全球,而非仅限于美国。因此,AI 主权财富基金应属于全球公众。此外,AI 的实际控制者和主要受益者是英伟达和云巨头(如亚马逊、微软和谷歌的云服务),每一个 AI 模型都通过这些云平台运行,云的采用才是 AI 落地的关键。因此,人类应共享 AI 的所有权和治理权,而非仅让少数企业巨头独享其利。 #AI #人工智能 #财富分配 #科技伦理 #BernieSanders #云服务 #全球治理
埃隆·马斯克成为世界首富,其财富不仅源自个人能力,也离不开资本主义金融架构和税收漏洞的支撑。然而,科技亿万富翁的公司在掠夺人类独特的创造力:生成式 AI 模型从社交媒体数据、学术成果、文学作品、艺术、电影、音乐、播客、软件代码乃至医疗记录等全球创意产品中训练,并通过用户提示数据微调提升预测能力。AI 无疑是人类的产物。Bernie Sanders 提议对 OpenAI、Anthropic 和 xAI 等 AI 公司征收一次性 50% 的股票税,这是一种合理的补偿措施。但这一提议陷入民族主义陷阱:用于训练的创意产品及研究人员、开发者、初创企业多来自全球,而非仅限于美国。因此,AI 主权财富基金应属于全球公众。此外,AI 的实际控制者和主要受益者是英伟达和云巨头(如亚马逊、微软和谷歌的云服务),每一个 AI 模型都通过这些云平台运行,云的采用才是 AI 落地的关键。因此,人类应共享 AI 的所有权和治理权,而非仅让少数企业巨头独享其利。 #AI #人工智能 #财富分配 #科技伦理 #BernieSanders #云服务 #全球治理
从弱模型到前沿性能
一位工程师提出假设:通过构建最强脚手架(包括个人知识库检索、工具集调用、验证循环等),即使搭载弱模型,也能实现前沿级表现。本文验证了这一假设,测试了五个组件:知识检索(11B参数模型在NaturalQuestions上击败540B模型)、单轮工具调用语法和窄域可验证任务(SWE-bench提升约15倍)。但研究也发现了模型上限:在代理编码任务中,同一脚手架下不同模型性能差距达1.5-4倍;在METR自主任务时间跨度上差距扩大至50-100倍;多轮工具协作随模型缩小崩溃;无真值的自我纠错反而使输出质量下降。最终证据支持的架构是分层路由与前沿模型升级策略,核心经验是:一旦拥有能干的脚手架,更换模型将成为所有干预手段中最有效的因素。 #LLM #脚手架工程 #模型能力 #代理编码 #函数调用 #分层路由 #测试时计算
一位工程师提出假设:通过构建最强脚手架(包括个人知识库检索、工具集调用、验证循环等),即使搭载弱模型,也能实现前沿级表现。本文验证了这一假设,测试了五个组件:知识检索(11B参数模型在NaturalQuestions上击败540B模型)、单轮工具调用语法和窄域可验证任务(SWE-bench提升约15倍)。但研究也发现了模型上限:在代理编码任务中,同一脚手架下不同模型性能差距达1.5-4倍;在METR自主任务时间跨度上差距扩大至50-100倍;多轮工具协作随模型缩小崩溃;无真值的自我纠错反而使输出质量下降。最终证据支持的架构是分层路由与前沿模型升级策略,核心经验是:一旦拥有能干的脚手架,更换模型将成为所有干预手段中最有效的因素。 #LLM #脚手架工程 #模型能力 #代理编码 #函数调用 #分层路由 #测试时计算