AI知识库 @ai521
340 subscribers
22.7K photos
42 videos
20 files
875 links
@ai521 专注分享最实用的AI内容

🤖 AI教程(新手到进阶)
🧠 AI知识科普(大模型 / 提示词 / 自动化)
📰 AI资讯更新(每日最新AI动态)
📚 AI实战技巧(写作 / 绘画 / 编程 / 赚钱)
🔧 最新AI工具推荐

每天更新AI干货
长期做一个真正有价值的AI频道
Download Telegram
AI打工能力排行榜更新:Claude Fable 5自动化率16.1%,是GPT

AI安全中心(CAIS)与Scale AI联合开发的远程劳动力指数(RLI)发布最新评估结果。该基准通过240个来自Upwork平台、总价值超14.4万美元的真实自由职业项目,评估AI自主完成完整商业委托的能力。Claude Fable 5以16.1%的自动化率位居榜首,是第二名Opus 4.8(8.3%)的两倍,第三名GPT-5.5(6.3%)的2.5倍。相比8个月前RLI刚发布时最高仅2.5%的自动化率,前沿AI模型的能力在不到八个月内翻了四倍以上。Fable 5的突破得益于新的Worker-critic Loop框架,允许评审Agent以苛刻客户视角检查并打回交付物,直至质量达标。然而,评估因美国政府出口管制中断了22个项目,即便将这些项目全部视为失败,Fable 5的自动化率仍达14.6%。值得注意的是,虽然AI在视觉质量上有显著提升,但84%的真实商业项目仍超出其能力范围。此外,用AI替代人类评审的尝试也遭遇瓶颈,AI评审对GPT-5.5的能力高估了近3倍。 #AI #自动化 #劳动力市场 #Claude #GPT5
AI 打工排行榜更新:Claude Fable 5 自动化率 16.1%,是 GPT

AI 安全中心(CAIS)与 Scale AI 联合发布的远程劳动力指数(RLI)最新数据显示,Claude Fable 5 以 16.1% 的自动化率位居榜首,约为第二名 Opus 4.8(8.3%)的两倍,是第三名 GPT-5.5(6.3%)的 2.5 倍。该指数基于 240 个来自 Upwork 的真实自由职业项目,涵盖 3D 建模、平面设计、数据分析等 23 个领域,评估 AI 能否独立完成客户付费级别的工作。相比 8 个月前榜单最高分仅 2.5%,前沿模型自动化能力已提升四倍以上。Fable 5 的高分得益于“工人-评审循环”框架,即一个独立评审 Agent 模拟苛刻客户审核并返工修改,同时其项目预算上限为 150 美元,高于其他模型的 50 美元。然而,测试发现 AI 评审在取代人工评审时存在严重偏差,对部分模型评分高估数倍。此外,84% 的项目目前仍无法被 AI 独立完成,AI 能力呈现出“锯齿状前沿”特征,而非简单随任务耗时增加而下降。 #AI #Claude #Fable5 #GPT5 #RLI #自动化 #科技新闻 #远程工作
GPT-5.6 性能超Claude Opus,AI代理迁移成本降27%速度升2.2倍

据CSDN博客报道,最新发布的大模型GPT-5.6在多项基准测试中超越Claude Opus,展现出更强的推理与生成能力。同时,AI代理平台Ploy在迁移至新架构后,实现了运营成本降低27%,处理速度提升2.2倍的显著成效。这一突破不仅验证了GPT-5.6在企业级AI应用中的潜力,也为代理部署优化提供了参考。相关技术细节已在Ploy的官方文档中披露。 #GPT5.6 #ClaudeOpus #AI代理 #大模型 #技术进步
GPT-5.6 超越 Claude Opus,企业 AI 代理迁移成本与效率双提升

根据技术博客披露,最新发布的 GPT-5.6 模型在多项基准测试中超越 Claude Opus,成为当前性能最强的 AI 模型。Ploy 公司基于 GPT-5.6 成功实现了 AI 代理的批量迁移,迁移成本降低 27%,运行速度提升 2.2 倍。这一突破显著优化了企业级 AI 应用的部署效率,有望推动更多企业采用 GPT-5.6 替代现有模型,进一步降低运营成本并提升响应速度。 #GPT5.6 #ClaudeOpus #AI代理 #企业AI #模型迁移 #成本优化 #效率提升