Theme
下面整理的是 Lecture 15–16 的复习笔记:核心主线是从 “SFT 无法处理开放式偏好” 进化到 “用 RLHF 学人类偏好”,再进一步到 “为什么 RLHF 通常用 PPO 而不是朴素 policy gradient / TRPO”。课件来源为 lecture-15 和 lecture-16。
Lecture 15–16 总体进化树
核心目标:
给定一个已经预训练、再经过 SFT 的语言模型,我们希望它不仅“会生成语言”,而且生成更符合人类偏好的回答。问题是:开放式任务没有唯一标准答案,传统交叉熵只会惩罚与参考答案不同的 token,无法表达“哪个错得更合理、哪个更离谱”。因此需要:
text
SFT 的局限
→ 引入 reward function R(s)
→ 用 policy gradient 最大化期望 reward
→ 人类偏好难以绝对打分
→ 用 pairwise comparison 训练 Reward Model
→ 用 RLHF 优化语言模型
→ reward hacking / policy collapse
→ 用 KL penalty / trust region 限制策略变化
→ NPG / TRPO / PPO重要程度标注: ★★★★★ 必考核心;★★★★ 高频理解题;★★★ 可能考概念;★★ 补充理解。
1. SFT 的局限:为什么不能只靠 supervised fine-tuning?★★★★★
SFT 的训练目标通常是最大化参考答案的 token likelihood,等价于最小化交叉熵:
符号解释:
是词表;
是某个候选 token;
是 one-hot ground-truth 标签;
是模型预测 token 的概率;
是模型给正确词 fantasy 的概率。
逻辑直觉:SFT 只关心“标准答案 token 的概率是多少”,不关心其他错误答案之间的语义差异。例如 ground truth 是 fantasy,而模型高概率预测 adventure 或 musical,在 CE loss 看来可能惩罚相同,因为两者都不是 fantasy。但人类知道 adventure 比 musical 更接近正确答案。课件第 3 页正是用这个例子说明 SFT loss 无法区分不同质量的错误答案。
开放式生成尤其严重。例如“写一首关于孤独的诗”,A1 和 A2 都可能合理,没有唯一正确答案。SFT 假设一个标准答案,而开放式任务需要比较多个候选回答的质量。
2. Reward Function:从“唯一答案”到“质量度量”★★★★★
因此我们引入 reward function:
其中 是模型生成的完整回答, 是回答质量的标量分数。它不要求回答有唯一正确答案,而是给每个回答一个相对质量评价。
RLHF 的目标是最大化模型采样输出的期望 reward:
符号解释:
是语言模型参数;
是模型生成完整序列 的概率分布;
表示从当前模型中采样一个回答;
是这个回答的 reward。
直觉:高 reward 的回答应该更常被生成,低 reward 的回答应该更少被生成。
3. Policy Gradient:reward 不可微时怎么优化?★★★★★
直接对期望 reward 求梯度:
展开期望:
使用 log-derivative trick:
所以:
代回:
也就是:
Monte Carlo 估计:
符号解释:
是采样数量;
是第 个采样生成序列;
是增加该序列生成概率的方向;
决定这个方向是被鼓励还是被抑制。
关键理解:我们不需要对 求导,只需要知道它是高还是低。真正可微的是模型的 log-probability。课件第 7–9 页强调了这一点。
对语言模型来说,完整序列概率分解为:
其中:
是生成长度;
是第 个样本在第 步生成的 token;
是第 步之前的上下文 token。
这说明 RLHF 不是只看一句话整体 reward,还必须计算每个 token 的 likelihood,因为序列 log-probability 是 token log-probability 的和。Lecture 15 quiz 的 Q1 正是在考这个点。
4. Reward Model:为什么用 pairwise comparison?★★★★★
直接让人类给回答打 1–10 分存在三个问题:
- expensive and slow;
- absolute scoring 模糊,比如 7 和 8 的边界不清楚;
- annotator calibration 不一致,有人严格,有人宽松。
所以更可靠的方法是 pairwise comparison:给定两个回答,让人类判断哪个更好。课件第 12 页指出,相对判断比绝对评分更稳定,inter-annotator agreement 更高。
Bradley-Terry Model ★★★★★
假设每个回答 有一个潜在强度:
Reward Model 输出这个分数:
其中 是 reward model 参数。
Bradley-Terry 模型认为,回答 战胜回答 的概率为:
等价地:
其中:
是 sigmoid 函数;
是回答 的 reward score;
是回答 的 reward score;
表示人类偏好 胜过 。
关键直觉:偏好概率只依赖分数差 ,不依赖绝对分数。因此 reward model 不需要学会“这个回答绝对是 8 分”,只需要学会“这个回答比另一个更好”。
Reward Model Loss ★★★★★
课件中的 reward model loss 是:
符号解释:
是人类偏好数据集;
是 winner response,即人类更喜欢的回答;
是 loser response,即人类不喜欢的回答;
是 reward model 给 winner 的分数;
是 reward model 给 loser 的分数;
是模型认为 winner 胜过 loser 的概率。
训练目标:让 尽可能大于 。
5. Reward Hacking:为什么 RM 不能被无限优化?★★★★★
Reward hacking 指 policy model 学会利用 reward model 的漏洞,而不是满足真实人类意图。
例如 RM 可能学到“自信、热情、礼貌”的回答更容易被打高分,于是模型对虚构问题也会自信胡编。课件第 16 页给了 Atlantis 的例子:模型可能生成很热情但虚假的答案。
本质问题:
Reward model 只是人类偏好的 proxy。当 policy 过度优化 proxy,就会偏离真实目标。
6. RLHF Objective with KL Penalty ★★★★★
为了防止 reward hacking 和语言能力崩坏,RLHF 通常加入 KL penalty:
也可理解为最大化:
符号解释:
是 pretrained / reference model 的生成概率,冻结不训练;
是当前正在 RL 训练的 policy model;
是冻结的 reward model 给出的分数;
控制 KL penalty 强度;
衡量两个生成分布之间的差异。
直觉:reward model 鼓励模型更符合人类偏好,KL penalty 防止模型离原来的语言模型太远,避免胡言乱语、重复、模式崩坏。Lecture 15 第 17 页明确说明 KL penalty 的作用是让输出接近 ,保持 human-readable 语言能力。
7. Lecture 16:为什么需要 PPO?★★★★★
Lecture 16 的核心问题是:
朴素 policy gradient 可以优化 reward,但 policy network 对参数更新非常敏感。参数空间中看似小的更新,可能导致策略分布发生巨大变化,从而造成 policy collapse。
对于语言模型,这种 collapse 可能表现为:
text
trees trees trees the the the ...
I love machine learning. I love machine learning...一旦模型 collapse,之后从这个坏策略采样的数据也是坏的,训练会进入恶性循环。
8. KL Divergence:为什么不用参数距离,而用策略距离?★★★★★
参数距离:
不可靠。因为同样的参数变化,在不同区域可能导致完全不同的输出分布变化。
因此使用 KL divergence 衡量两个策略分布的差异:
符号解释:
通常是旧策略分布;
通常是新策略分布;
是动作或 token;
表示用 近似 时的信息损失。
KL 的性质:
当且仅当 时为 0;
KL 不对称:
在 RLHF 中,KL 的作用是约束新 policy 不要离旧 policy 或 reference model 太远。Lecture 16 第 10–11 页强调,KL 比参数距离更适合衡量策略行为变化。
9. Natural Policy Gradient:从欧氏空间梯度到分布空间梯度 ★★★★
目标是在 trust region 内最大化目标函数:
由于精确 KL 约束难解,对 做一阶近似,对 KL 做二阶近似。
目标函数一阶近似:
KL 二阶近似:
其中:
是 Fisher Information Matrix,也等于 KL 在当前点的 Hessian;
是参数更新方向;
是 trust region 半径。
于是优化问题变成:
构造拉格朗日函数:
对 求导并令其为 0:
所以:
这就是 natural gradient direction:
相比 vanilla gradient:
natural gradient 会根据策略分布对参数变化的敏感度重新缩放方向。Lecture 16 第 14–15 页推导了这个结果。
10. Natural Gradient 的步长推导 ★★★★
设:
自然梯度更新写成:
为了最大化 trust region 内目标,最优解在边界上:
代入:
由于 对称,且 ,有:
所以:
因此:
直觉:步长不是普通 learning rate,而是由 trust region 和 Fisher metric 自动决定。
11. TNPG 与 TRPO:解决 Natural Gradient 的计算问题 ★★★★
Natural gradient 的问题是 很难算,因为参数维度可能是百万、亿级。
于是把:
改写成线性方程:
用 conjugate gradient 迭代近似求解,不显式构造或求逆 。这叫 Truncated Natural Policy Gradient, TNPG。Lecture 16 第 16–17 页说明了用 Hessian-vector product 避免显式计算 FIM。
TRPO = TNPG + line search。
TRPO 的安全机制:
text
先计算 natural gradient 更新方向
→ 尝试较大步长
→ 检查 surrogate objective 是否改善
→ 检查 KL 是否小于阈值
→ 如果不安全,就缩小步长重试TRPO 的问题:虽然避免显式求逆,但仍属于二阶优化,需要多次 backward / Hessian-vector product,比 Adam 这类一阶优化贵很多。Lecture 16 第 19–20 页指出 TRPO 仍然计算成本高。
12. PPO:保留 trust region 思想,放弃昂贵二阶优化 ★★★★★
PPO 的核心思想:
不用显式 KL 二阶优化,不用 conjugate gradient,而是用一阶优化器 Adam;但通过 clipping 限制新旧策略概率比,近似实现 safe update。
定义旧策略:
定义新策略:
概率比:
符号解释:
是状态;在语言模型中可理解为当前上下文;
是动作;在语言模型中通常是下一个 token;
是采样数据时使用的旧 policy,冻结;
是当前正在更新的新 policy;
表示新策略比旧策略更倾向于生成该动作;
表示新策略降低了该动作概率。
Advantage ★★★★★
PPO 不直接用 reward,而用 advantage:
其中:
是 action-value,表示在状态 下采取动作 后的期望回报;
是 state-value / baseline,表示处于状态 的平均期望回报;
说明动作 比平均更好,应该鼓励;
说明动作 比平均更差,应该抑制。
13. PPO Clipped Objective ★★★★★
PPO 的 clipped surrogate objective:
其中:
符号解释:
是估计出来的 advantage;
是 clipping range,例如 0.2;
是概率增加上限;
是概率降低下限。
两种情况:
若:
动作是好动作,我们想增加它的概率。但当:
时,继续增加概率不会带来更高 objective,因为 clip 后被封顶。直觉:好动作可以鼓励,但不要贪心过度。
若:
动作是坏动作,我们想降低它的概率。但当:
时,继续降低概率不会带来更高收益,避免过度惩罚。直觉:坏动作可以抑制,但不要一次性打死,否则会丢失探索。
Lecture 16 第 22–23 页就是 PPO 的核心公式与正负 advantage 情况分析。
14. 方法对比表:SFT → RLHF → NPG/TRPO/PPO
| 方法 | 核心目标 | 优点 | 主要问题 | 重要程度 |
|---|---|---|---|---|
| SFT | 模仿参考答案 | 简单稳定,训练高效 | 开放式任务没有唯一答案;无法区分不同质量错误 | ★★★★★ |
| Reward Model | 学习人类偏好分数 | 把主观偏好变成可优化信号 | RM 只是 proxy,可能被 hacking | ★★★★★ |
| Policy Gradient | 最大化期望 reward | 不需要 reward 可微 | 更新不稳定,可能 collapse | ★★★★★ |
| KL-regularized RLHF | reward + 保持接近原模型 | 防止语言能力崩坏和 reward hacking | KL 系数难调,仍需稳定优化 | ★★★★★ |
| Natural Policy Gradient | 用 FIM 修正梯度方向 | 更符合策略分布几何 | 太贵 | ★★★★ |
| TNPG | 用 CG 近似 | 避免显式求逆 | 仍需多次迭代 | ★★★ |
| TRPO | TNPG + line search | 理论上安全更新 | 二阶优化太贵 | ★★★★ |
| PPO | clipping 近似 trust region | 简单、稳定、便宜,适合大模型 | 是近似方法,不保证严格 KL 约束 | ★★★★★ |
15. 期末高频考点总结
最可能考:
- 为什么 SFT 不适合开放式生成?
- Policy gradient 的 log-derivative trick 推导。
- 为什么 RLHF 不需要对 reward 求导,但仍需要 token likelihood?
- Reward Model 为什么用 pairwise comparison?
- Bradley-Terry 模型和 RM loss。
- Reward hacking 是什么,KL penalty 如何缓解?
- 为什么策略更新不能只看参数距离?
- KL divergence 在 RLHF / PPO 中的作用。
- Natural gradient 如何从 KL trust region 推导出来?
- PPO clipped objective 如何分别处理 positive advantage 和 negative advantage?
一句话抓住 Lecture 15–16:
SFT 只能模仿标准答案,RLHF 用 reward model 学人类偏好;但直接最大化 reward 会导致策略崩坏或 reward hacking,所以 PPO 用 probability ratio clipping 近似 trust region,在保持更新安全的同时高效优化语言模型。
下面继续整理 Lecture 17。它是 Lecture 15–16 的自然延伸:前面讲了 RLHF + PPO,现在这节课主要讲为什么大家开始寻找 PPO 的替代方案:DPO、GRPO、KTO、SimPO、DAPO。课件来源为 lecture-17。
Lecture 17 核心脉络
本章要解决的问题是:
text
RLHF + PPO 有效
→ 但 PPO 工程复杂、训练昂贵、Reward Model 可能 reward hacking
→ 是否可以直接用 preference data 优化 LLM?
→ DPO:去掉显式 Reward Model 和 RL rollout
→ GRPO:保留 RL,但去掉 Critic / Value Model
→ KTO / SimPO / DAPO:针对 DPO/GRPO 的数据与训练缺陷继续改进一句话总结:
Lecture 17 的核心是从“复杂但强大的 PPO-RLHF”走向“更轻量、更直接、更适合开源训练的 preference optimization”。
1. RLHF + Reward Model 的局限 ★★★★★
Lecture 17 开头回顾了 RLHF 的问题:Reward hacking 是 RL 中常见问题。Reward Model 是从 noisy human preference 中学出来的 proxy,不等于真正的人类偏好,因此 policy 可能学会利用 RM 的漏洞,而不是生成真实更好的答案。课件第 2 页用 Google Bard 错误导致股价下跌,以及 reward model over-optimization 曲线说明:RM prediction 可以持续上升,但 actual preference 可能先升后降。
为了缓解这个问题,前面讲过 KL penalty:
其中:
是冻结 reward model 给出的分数;
是当前 RL 训练中的 policy;
是 reference / pretrained model;
控制模型不能偏离 reference model 太远。
逻辑直觉:RM 负责“往人类偏好方向拉”,KL 负责“别偏离原语言模型太远”。但这仍然没有解决 PPO 本身复杂、昂贵的问题。
2. PPO 为什么复杂?★★★★★
PPO 在 RLHF 中通常是 advantage actor-critic 算法。课件第 3 页图中包含 Policy LM、Reward Model、Value Model、GAE、Experience Buffer、Reference Model 等模块。
其中:
text
Actor = Policy LM
Critic = Value Model
Reward Model = 给完整回答打分
Reference Model = 计算 KL penalty
GAE = 估计 advantageValue Model 通常和 Policy Model 架构类似,因此训练成本很高。对于大语言模型来说,这意味着不仅要训练 actor,还要维护 critic、reference model、reward model,显存和工程复杂度都很大。
3. 为什么 PPO 要用 Advantage?★★★★
Reward 本身不是绝对好坏,必须和 baseline 比较。
例如课件第 4 页给了三个 rollout reward:
平均值是:
所以 advantage 是:
直觉:reward = 10 看起来是正数,但相对于同一批 rollout 的平均水平,它其实很差。因此 policy optimization 不应该只看 reward 的绝对值,而要看“比平均好还是差”。
一般定义:
其中:
是在状态 下采取动作 后的期望回报;
是状态 的平均期望回报,也就是 baseline;
表示动作比平均更好,应该增加概率;
表示动作比平均更差,应该降低概率。
4. DPO Motivation:能不能不要 PPO?★★★★★
DPO 的动机是:
text
既然我们最终想让模型符合 preference data,
能不能跳过 Reward Model + RL,
直接用 preference data 优化语言模型?课件第 5 页明确说:DPO derives a closed-form solution to the reward function for simpler MLE optimization。也就是说,PPO 是用 RL 间接优化偏好目标,而 DPO 把 reward 函数解析地写成 policy 概率比,从而直接做 maximum likelihood 风格的优化。
5. 从 RLHF Objective 推导 DPO 的关键公式 ★★★★★
RLHF 的 KL-regularized objective 对于输入 和回答 可以写成:
令:
则目标函数写为:
约束是:
构造拉格朗日函数:
对 求偏导并令其为 0:
整理得:
两边除以 :
指数化:
所以:
归一化后得到:
其中:
是 partition function / normalization constant。
这一点非常重要:理论最优 policy 是 reference model 按 reward 指数加权后的分布。但 要对所有可能回答求和,无法直接计算。课件第 6–10 页完整推导了这个 closed-form optimal policy。
6. 用 Policy 反推 Reward:DPO 的关键一步 ★★★★★
由:
两边取 log:
整理得到:
DPO 的核心替换是:用当前 policy 近似最优 policy,于是定义隐式 reward:
注意课件第 11 页强调:这是 definition, not derivation。也就是说 DPO 定义了一个由 policy 隐含表示的 reward model。
问题:这里仍然有 ,看起来不可计算。但 Bradley-Terry pairwise loss 会让它消掉。
7. Bradley-Terry 如何消掉 ★★★★★
给定同一个 prompt ,有 winner response 和 loser response 。Bradley-Terry 偏好概率为:
等价为:
其中:
Reward Model loss 是:
把 DPO 的隐式 reward 代入:
则:
其中:
完全抵消。
所以:
最终 DPO loss:
这是 Lecture 17 最核心公式。课件第 12–13 页说明,DPO 之所以可行,是因为 pairwise comparison 只关心 reward difference,而 在同一个 prompt 下会被消掉。
8. DPO 的直觉 ★★★★★
DPO 做的事情可以理解为:
text
对于 winner y_w:
让当前模型相比 reference model 更愿意生成它。
对于 loser y_l:
让当前模型相比 reference model 更不愿意生成它。也就是增大:
减小:
更准确地说,是增大二者差值:
所以 DPO 不需要显式训练 Reward Model,也不需要 PPO rollout。Reference model 仍然存在,它提供了“不要偏离原模型太远”的基准。
9. DPO 的效果与工业位置 ★★★★
课件第 14 页提到 Zephyr-7B:HuggingFaceH4 使用 DPO 训练 7B 模型,在当时的对话能力评测中超过了 Llama-2-Chat 70B。这里的重点不是背具体分数,而是理解 DPO 的意义:它让开源社区能用较低工程成本做有效 alignment。
Lecture 17 第 17 页对 PPO 和 DPO 做了工业对比:
| 维度 | PPO | DPO |
|---|---|---|
| 定位 | 重型计算护城河 | 开源友好的轻量方法 |
| 代表 | OpenAI, Anthropic | Hugging Face, Mistral, Llama 系列 |
| 优势 | 更强全局探索能力 | 简洁、便宜、plug-and-play |
| 性能上限 | 高,适合复杂逻辑和长文本 | 对一般 alignment 很有效 |
| 资源需求 | 巨大算力与工程投入 | 开源开发者可承受 |
10. GRPO Motivation:去掉 Critic 的 RL ★★★★★
PPO 的一个大成本来自 critic / value model。Value Model 通常和 Policy Model 一样大,用来估计 advantage:
GRPO 的思想是:不要训练 Critic,而是让同一个 prompt 下生成的多个回答互相比较,用 group baseline 计算 advantage。
对于同一个输入问题 ,policy 生成 个回答:
每个回答有 reward:
用组内均值和标准差归一化 advantage:
其中:
是 group size;
是第 个回答的 reward;
是同一问题下 个回答的平均 reward;
是同一问题下 个 reward 的标准差;
是第 个回答相对于同组其他回答的 advantage。
关键:GRPO 的 advantage 是同一个 query 内多个 samples 的相对分数,不是不同 query 混在一起算。Lecture 17 quiz Q3 正是在考这个点:GRPO 不是用不同 queries 的多个 samples 计算 advantage,所以答案是 False。
11. GRPO Loss ★★★★★
课件第 16 页给出 GRPO loss,与 PPO clipping 很像,只是 advantage 来源变了。核心 token-level ratio 是:
符号解释:
是第 个回答的第 个 token;
是第 个回答在第 步之前的 prefix context;
是输入问题;
是当前 policy;
是生成这批数据时的旧 policy;
是 token-level importance sampling ratio。
Clipped objective 部分:
GRPO 整体目标:
直觉:GRPO 仍然是 PPO 风格的 clipped policy optimization,但不用 critic,而是用 group-relative reward 估计 advantage。
12. DPO vs GRPO:本质区别 ★★★★★
| 方法 | 是否 RL | 是否需要 Reward Model | 是否需要 Critic | 数据形式 | 核心思想 |
|---|---|---|---|---|---|
| PPO-RLHF | 是 | 需要 | 需要 | rollout + RM score | 用 RL 最大化 RM reward |
| DPO | 否 | 不显式需要 | 不需要 | pairwise preference | 直接用 winner/loser 优化 policy |
| GRPO | 是 | 通常需要 reward signal | 不需要 | 同一 query 的多样本 group | 用组内均值替代 value baseline |
最容易混淆的一点:
DPO 是“去 RL 化”;GRPO 是“保留 RL,但去 critic”。
13. KTO:解决 DPO 对 paired preference 的依赖 ★★★
DPO 的问题:需要严格成对的 preference data,即同一个 prompt 下有 winner 和 loser。但现实中更常见的是 unpaired feedback,例如 thumbs up / thumbs down。
KTO,即 Kahneman-Tversky Optimization,动机来自 prospect theory:人类对坏回答的厌恶通常强于对好回答的喜爱。课件第 18 页说,KTO 不需要 pairwise comparison,而是基于每个单独回答是 desirable 还是 undesirable 来优化 implicit utility。
可以这样理解:
text
DPO:必须知道 A 比 B 好。
KTO:只需要知道 A 是好回答,或者 B 是坏回答。因此 KTO 更适合大量非配对反馈数据。
14. SimPO:解决 DPO 的长度偏置 ★★★★
DPO 的一个问题是:序列越长,token-level log probability 的累积差异越大。即使每个 token 的优势很小,长回答也可能因为累计效应扩大 winner-loser 的 reward gap。
SimPO 的解决方法是 length-normalized implicit reward,并且 reference-free。
课件第 19 页公式:
其中:
是输入 prompt;
是回答;
是回答长度,也就是 token 数;
是当前 policy 生成回答 的概率;
是 scaling hyperparameter。
SimPO loss:
其中:
是 chosen / winner response;
是 rejected / loser response;
是 reward margin,用来保证 winner 和 loser 之间有严格差距;
是 logistic sigmoid。
SimPO 的两个关键词:
text
length-normalized
reference-free它不再显式使用 reference model 的概率比,而是直接用当前模型的长度归一化 log-probability 构造 implicit reward。
15. DAPO:解决 GRPO 的 clipping 抑制探索问题 ★★★
GRPO / PPO 的标准 clipping 通常是对称的:
例如 ,上界是 1.2。
问题是:对于低概率但高 reward 的探索 token,这个上界太严格。课件第 20 页举例:
如果一个 exploitation token 初始概率是:
那么上界:
实际最大概率接近 1,几乎不受限制。
但如果一个 exploration token 初始概率是:
那么上界:
它最多只能从 0.01 增加到 0.012,几乎无法变成重要候选。因此模型会更容易重复已有高概率模式,探索能力下降,甚至 entropy collapse。
DAPO 的解决思路:给低概率但正 advantage 的 token 更高 upper bound,鼓励探索。
可以理解为:
text
标准 PPO/GRPO clipping:所有 token 一视同仁。
DAPO:对有潜力的新 token 放宽上界,让模型敢于探索。16. Lecture 17 的算法演进图
text
RLHF + PPO
优点:性能强,能通过 reward 做全局探索
问题:RM hacking、PPO 复杂、Critic 昂贵
↓
DPO
去掉显式 RM + RL rollout
用 preference pair 直接优化 policy
问题:依赖 paired preference;可能有长度偏置
↓
KTO
不需要 pairwise,只需 thumbs up/down
↓
SimPO
reference-free + length-normalized,缓解长度偏置
另一路:
PPO
问题:Critic 太贵
↓
GRPO
用同一 query 的 group rewards 估计 advantage
问题:标准 clipping 抑制低概率探索 token
↓
DAPO
非对称 clipping / 提高探索 token 上界17. 期末高频考点
Lecture 17 最可能考这些:
- 为什么 PPO-RLHF 复杂?
- Advantage 为什么不是直接 reward?
- DPO 的动机:如何跳过 Reward Model 和 RL?
- RLHF 最优 policy 的 closed-form:
- 为什么 不可计算?
- 为什么 DPO 中 会抵消?
- DPO loss 公式:
- GRPO 如何不用 Critic?
- GRPO 的 advantage 是同一个 query 下多个 responses 的组内归一化:
- KTO、SimPO、DAPO 分别解决什么问题?
18. 最后用一句话串起来
PPO-RLHF 是“训练 RM,再用 RL 优化 policy”;DPO 是“把 RM 隐式写成 policy/reference 概率比,直接用 preference pair 训练”;GRPO 是“保留 RL,但用同一问题的多个回答互相做 baseline,去掉昂贵 Critic”;KTO、SimPO、DAPO 则分别针对“无配对数据、长度偏置、探索受限”继续改进。