新模型一发布,各种榜单就跟着刷屏。截图里全是加粗的第一名,配上「全面超越」的标题。
看多了会发现一件事:同一批模型,在不同榜单上的名次能差出好几位。 这不是谁在造假,而是榜单本身就在测不同的东西。所以读榜单的关键不是记住名次,是先搞清楚它在测什么、又是谁在什么条件下测出来的。
先分清榜单在测什么
把常见的评测拆开,大致是五类:
- 知识与问答:事实准确性、学科题
- 推理与数学:多步推导、代码题
- 指令跟随:格式约束、多轮约束
- 长文本:长文档理解、跨段落引用
- 工具调用:函数调用、多步任务编排
一个模型在知识类领先,不代表它在工具调用上也能打。这两件事需要的训练侧重完全不同,甚至常常互相牵制——为了把指令跟随练稳,模型可能变得更保守,反而牺牲一点开放性。
所以看到「第一名」之前,先问一句:它赢的是哪个维度。
误判一:把总分当结论
总分是加权出来的,而权重是评测方定的,反映的是它的用途偏好,不是你的。
如果你要做的是文档抽取,那些「数学推理」的高分跟你基本无关;反过来,总分中游但结构化输出很稳的模型,可能才是你该选的。
看总分适合粗筛,不适合做决定。 它能把候选从二十个缩到五个,剩下的必须自己判断。
误判二:忽略评测集污染
公开题目一旦长期存在于互联网上,就有进入训练数据的可能。表现是:它在经典题上很强,在你随手写的同类题上明显变差。
一个简单的自查办法:把评测里的题改掉变量名、换个语境再问一遍,看分数掉不掉。掉得厉害,就要留个心眼。
更进一步的做法是准备一批「自己出的题」——从真实业务里挑,答案只有你团队知道。这批题的价值会随时间越来越高。
误判三:不看成本和延迟
榜单排名是效果维度,账单是另一张表。同一个任务,效果高两分的模型可能贵三倍、慢一倍。
对大多数业务来说,效果够用加成本可控的组合,比效果最好加成本失控更值得选。做批量任务时这一点尤其明显:单次省下的钱不多,乘上每天的调用量就是真金白银。
延迟也同理。对话场景里,用户对首字延迟的容忍度远低于对答案长度不足的容忍度。
误判四:拿别人的场景当自己的场景
榜单里的题目是别人设计的,你的输入有你的格式、术语和脏数据。
我见过不少团队,选型时只看榜单,上线后发现问题全出在自己数据上——表格有合并单元格、文档是扫描件、用户会打错别字、同一件事在三份材料里有三种说法。这些榜单测不到,却决定了实际体验。
榜单之外的三个信号
更新频率:榜单有保质期。看它最近一次更新是什么时候、参评的是哪个版本。挂着已下线模型的榜单,维护质量要打问号。
失败案例:只展示好例子的评测,通常不告诉你它在什么情况下会崩。有输错分析的榜单更有参考价值。
评测方式:人工打分还是自动判分、单轮还是多轮、有没有隐藏测试集。这几项决定了数字的可信区间。
- 1定任务列出真实要模型做的 3~5 类活
- 2挑子集找对应的分项分数,不看总分
- 3自测用自己 50~100 条真实样本跑一遍,人工打分
- 4复测换版本或改提示词后重跑,记录差异
一个可以直接用的读法
我的习惯是三步:先看分项不看总分;再看成本和延迟,把候选缩到两三个;最后用自己的一批真实样本做对照,人工打分。
前两步十分钟能完成,第三步要花半天,但它省掉的是后面几周的返工。对照的时候记得把结论写下来——哪一项赢、哪一项输、在什么输入上输,下次换版本就不用从头再来。
榜单是用来排雷的,不是用来替代判断的。
本文不构成任何采购或技术选型建议,具体评测请以官方文档与自有数据实测为准。