模型评测分两层:公开基准测试用于横向对比,人工/业务评测用于最终决策。

常见公开基准

  • MMLU:涵盖 57 个学科的多选题,测综合知识
  • HumanEval / MBPP:代码生成正确率,测编程能力
  • GSM8K / MATH:数学解题能力
  • GPQA、BIG-Bench 等:高难度推理与综合任务
  • 中文场景还可看 C-Eval、CMMLU 等中文基准

基准的局限

  • 可能「过拟合」:模型见过题目或训练目标相似,分数虚高
  • 题目脱离真实业务:能答对常识题不等于能处理好你的数据
  • 榜单更新快,同一模型不同版本分数差异大

人工评测怎么做

拿「自己的真实数据 + 自己的评分标准」做盲测:同一批问题,多个模型匿名回答,按正确性、格式、风格打分。人工评测成本高,但它是选型与验收的最后一道关。