模型评测分两层:公开基准测试用于横向对比,人工/业务评测用于最终决策。
常见公开基准
- MMLU:涵盖 57 个学科的多选题,测综合知识
- HumanEval / MBPP:代码生成正确率,测编程能力
- GSM8K / MATH:数学解题能力
- GPQA、BIG-Bench 等:高难度推理与综合任务
- 中文场景还可看 C-Eval、CMMLU 等中文基准
基准的局限
- 可能「过拟合」:模型见过题目或训练目标相似,分数虚高
- 题目脱离真实业务:能答对常识题不等于能处理好你的数据
- 榜单更新快,同一模型不同版本分数差异大
人工评测怎么做
拿「自己的真实数据 + 自己的评分标准」做盲测:同一批问题,多个模型匿名回答,按正确性、格式、风格打分。人工评测成本高,但它是选型与验收的最后一道关。