「垃圾进,垃圾出」在 AI 训练中体现得最直接:数据质量决定模型上限,算法只是逼近这个上限。

训练数据的构成

  • 预训练数据:海量网页、书籍、论文、代码,决定通用知识广度
  • 指令数据(SFT):问题-答案对,教会模型「按指令回答」
  • 偏好数据(RLHF/DPO):多个回答的优劣标注,塑造模型偏好与安全性

清洗流程

  1. 去重:去除重复与近似重复文本
  2. 过滤:去掉低质量、有毒、违规内容与噪声(乱码、广告)
  3. 格式化:统一编码、修正 HTML 残留、清理多余空白
  4. 隐私与版权排查:移除个人信息与受保护内容
  5. 采样与配比:平衡领域分布,控制重复数据比例

常见坑

  • 重复数据导致过拟合,模型「背答案」而不是「学规律」
  • 清洗过度把有效信号也删掉
  • 忽视语言/领域配比,模型偏科