模型的能力上限由预训练决定,行为风格由微调塑造,可用性由评测把关。三个环节吃的是完全不同的数据。
三个阶段
- 预训练:海量互联网文本/代码/图像,决定知识与语言能力,成本最高
- 指令微调:高质量问答对,决定模型「听话」程度
- 评测:基准题集与真实场景样本,决定上线与否
常见误区
- 以为微调能补知识:知识主要来自预训练,微调补知识效率低
- 以为数据越多越好:低质重复数据反而损害效果
- 以为评测能一次定终身:领域数据要持续回归
个人开发者怎么参与
- 用开源模型做领域微调时,优先整理「干净的小数据」而非堆量
- 用评测集验证每个版本,别只看一两句示例输出
- 关注数据合规:版权、隐私、去标识化
一句话:预训练决定「会不会」,微调决定「听不听话」,评测决定「敢不敢用」。