三兄弟关系:V3 → R1-Zero → R1

  • V3:通用基座,能聊天但不会长思维链推理
  • R1-Zero:纯强化学习(无人类标注)训练的实验版,推理指标反超 V3,但输出语言混杂、格式混乱
  • R1:在 R1-Zero 基础上加冷启动与多阶段优化,推理强且输出规范,可直接商用

GRPO:组内奖励对比

传统 RLHF 需要额外训练一个 Critic 价值模型评估每步好坏,成本高。GRPO(Group Relative Policy Optimization)改为:对同一个问题生成一组答案,用组内相对优劣作为奖励信号,不需要 Critic 模型,训练成本大幅下降。

R1 四阶段「炼金术」

  1. 冷启动:用少量高质量思维链(CoT)数据教模型「标准答案格式」
  2. RL 锻造:用 GRPO 在数学、代码等可验证任务上强化推理路径
  3. 数据反哺:让模型自生成高质量数据,减少对人工标注的依赖
  4. 人机融合:引入人类偏好奖励,让输出既准又符合使用习惯

训练成本约 557.6 万美元、2048 张 H800、55 天,被业界称为「属于推理模型的 AlphaZero 时刻」:不靠人类棋谱,靠自我博弈逼近最强。

R1 的意义:证明「纯强化学习 + 可验证奖励」能训练出顶级推理模型,这是开源社区的一次范式级示范。