Jingh's Blog
返回首页

RLHF-PPO 概念梳理

RLHF 场景下 PPO 的关键概念与 KL 约束。

2026-07-25·— 阅读·RL

RLHF 四阶段

  1. SFT(监督微调)
  2. 训练 Reward Model
  3. 用 PPO 做强化学习微调
  4. (可选)DPO 等替代方案

KL 约束

用 Reference Model 计算 token 级 KL 散度,约束策略不要偏离过远:

L=E[r(x,y)βKL(πθπref)]\mathcal{L} = \mathbb{E}\left[r(x, y) - \beta \cdot \mathrm{KL}\left(\pi_\theta \| \pi_{\mathrm{ref}}\right)\right]

其中 β\beta 是 KL 系数,过大则学不动,过小则策略漂移、奖励 hacking。

关键模型角色

模型 作用 是否更新
Actor 生成回答
Critic 估计价值
Reference 计算 KL
Reward 打分

代码片段

# 伪代码:PPO 一步更新
ratio = exp(logprob_new - logprob_old)
surr1 = ratio * advantage
surr2 = clamp(ratio, 1 - eps, 1 + eps) * advantage
loss = -min(surr1, surr2).mean() + beta * kl
loss.backward()