对齐(Alignment)指让模型的行为符合人类的意图与价值观:不仅「会答」,还要「答得对、答得安全、不越权」。

对齐的目标

  • 有用(Helpful):准确完成任务
  • 诚实(Honest):不知道就说不知道,不编造
  • 安全(Harmless):拒绝有害请求、不泄露敏感信息

主流方法

  • RLHF(基于人类反馈的强化学习):先训练奖励模型模拟人类偏好,再用强化学习优化策略模型,ChatGPT 是代表作
  • DPO(直接偏好优化):不需要奖励模型,直接用偏好数据微调,更简单稳定
  • RLAIF:用 AI 生成反馈替代部分人工标注,降低成本

评测方式

对齐效果通过红队测试(Red Teaming,攻击性测试)、安全基准与人工偏好评估综合判断。对齐与能力常有权衡:过度对齐可能让模型「过度拒绝」,需要按场景调平衡。