学习笔记精选2026年7月7日RLHF 原理与实践RLHF 的三阶段 第一阶段:监督微调(SFT) 收集人类标注的高质量指令回答对,在基座模型上微调。 第二阶段:训练奖励模型 让人类标注者对多个回答进行偏好排序,训练一个奖励模型来预测人类偏好。 第三阶段:PPO 强化学习 使用 PPO 算...RLHF对齐LLM