GPT-5.6 Sol 在 ARC
据最新测试结果,GPT-5.6 系列中的 Sol 模型在 ARC-AGI 基准测试中表现突出。在最大推理努力下,Sol 在公开测试集上平均得分 13.33%,在半私有测试集上得分 7.78%,成为该系列中唯一性能显著的模型。它还首次赢得 ARC-AGI-3 公开赛(ft09 关卡,得分 87%),能够正确理解陌生场景并使用游戏自身词汇,将失败假设视为重新规划而非混乱。大多数智能体失败源于其编写的代码或采取的行动上游,而 Sol 之所以能胜任,并非执行更好,而是首先在新环境中正确定位自身。测试还按推理难度列出了各基准的通过/失败情况,最难任务位列首位。 #GPT5 #ARCAGI #AI推理 #大模型 #智能体
据最新测试结果,GPT-5.6 系列中的 Sol 模型在 ARC-AGI 基准测试中表现突出。在最大推理努力下,Sol 在公开测试集上平均得分 13.33%,在半私有测试集上得分 7.78%,成为该系列中唯一性能显著的模型。它还首次赢得 ARC-AGI-3 公开赛(ft09 关卡,得分 87%),能够正确理解陌生场景并使用游戏自身词汇,将失败假设视为重新规划而非混乱。大多数智能体失败源于其编写的代码或采取的行动上游,而 Sol 之所以能胜任,并非执行更好,而是首先在新环境中正确定位自身。测试还按推理难度列出了各基准的通过/失败情况,最难任务位列首位。 #GPT5 #ARCAGI #AI推理 #大模型 #智能体