RLHF 的三阶段
第一阶段:监督微调(SFT)
收集人类标注的高质量指令-回答对,在基座模型上微调。
第二阶段:训练奖励模型
让人类标注者对多个回答进行偏好排序,训练一个奖励模型来预测人类偏好。
第三阶段:PPO 强化学习
使用 PPO 算法,以奖励模型为奖励信号,进一步优化策略模型。
实践中的挑战
- 奖励模型可能被”欺骗”
- 人类偏好的一致性难以保证
- 训练过程不稳定
RLHF 不仅是技术问题,也引发了 AI 对齐问题的哲学思考 中讨论的深层哲学问题。
收集人类标注的高质量指令-回答对,在基座模型上微调。
让人类标注者对多个回答进行偏好排序,训练一个奖励模型来预测人类偏好。
使用 PPO 算法,以奖励模型为奖励信号,进一步优化策略模型。
RLHF 不仅是技术问题,也引发了 AI 对齐问题的哲学思考 中讨论的深层哲学问题。