RLHF-PPO 概念梳理
RLHF 场景下 PPO 的关键概念与 KL 约束。
2026-07-25·— 阅读·RL
RLHF 四阶段
- SFT(监督微调)
- 训练 Reward Model
- 用 PPO 做强化学习微调
- (可选)DPO 等替代方案
KL 约束
用 Reference Model 计算 token 级 KL 散度,约束策略不要偏离过远:
其中 是 KL 系数,过大则学不动,过小则策略漂移、奖励 hacking。
关键模型角色
| 模型 | 作用 | 是否更新 |
|---|---|---|
| Actor | 生成回答 | 是 |
| Critic | 估计价值 | 是 |
| Reference | 计算 KL | 否 |
| Reward | 打分 | 否 |
代码片段
# 伪代码:PPO 一步更新
ratio = exp(logprob_new - logprob_old)
surr1 = ratio * advantage
surr2 = clamp(ratio, 1 - eps, 1 + eps) * advantage
loss = -min(surr1, surr2).mean() + beta * kl
loss.backward()