RLHF 的三阶段

第一阶段:监督微调(SFT)

收集人类标注的高质量指令-回答对,在基座模型上微调。

第二阶段:训练奖励模型

让人类标注者对多个回答进行偏好排序,训练一个奖励模型来预测人类偏好。

第三阶段:PPO 强化学习

使用 PPO 算法,以奖励模型为奖励信号,进一步优化策略模型。

实践中的挑战

  • 奖励模型可能被”欺骗”
  • 人类偏好的一致性难以保证
  • 训练过程不稳定

RLHF 不仅是技术问题,也引发了 AI 对齐问题的哲学思考 中讨论的深层哲学问题。