我的本地语言模型拿了6/6分,但每题都答错了
一篇技术反思文章披露,作者花费六个月时间试图让一个1.2B参数的小型本地模型变得有用,却发现自己构建的评估系统存在致命缺陷。该模型在自建基准测试中六道题全部“通过”,但实际答案全是错的——评分器只检查输出是否为裸整数格式,从未验证答案的正确性。作者最初认为通过设计更好的推理框架能让小模型胜任多数任务,但模型在“12人中选择5人委员会”等问题上连续给出错误答案,却因格式正确而得分。随后作者改用更严格的MMLU-Pro基准测试,但优化过程进展缓慢且不稳定。文章指出,没有经过验证的测量工具,所有改进都是空中楼阁,警示AI评估不能只重形式而忽略内容。 #LLM #本地模型 #AI评估 #基准测试 #MMLUPro #人工智能 #技术反思 #模型测量
一篇技术反思文章披露,作者花费六个月时间试图让一个1.2B参数的小型本地模型变得有用,却发现自己构建的评估系统存在致命缺陷。该模型在自建基准测试中六道题全部“通过”,但实际答案全是错的——评分器只检查输出是否为裸整数格式,从未验证答案的正确性。作者最初认为通过设计更好的推理框架能让小模型胜任多数任务,但模型在“12人中选择5人委员会”等问题上连续给出错误答案,却因格式正确而得分。随后作者改用更严格的MMLU-Pro基准测试,但优化过程进展缓慢且不稳定。文章指出,没有经过验证的测量工具,所有改进都是空中楼阁,警示AI评估不能只重形式而忽略内容。 #LLM #本地模型 #AI评估 #基准测试 #MMLUPro #人工智能 #技术反思 #模型测量