Skip to content

下面整理的是 Lecture 15–16 的复习笔记:核心主线是从 “SFT 无法处理开放式偏好” 进化到 “用 RLHF 学人类偏好”,再进一步到 “为什么 RLHF 通常用 PPO 而不是朴素 policy gradient / TRPO”。课件来源为 lecture-15 和 lecture-16。

Lecture 15–16 总体进化树

核心目标:

给定一个已经预训练、再经过 SFT 的语言模型,我们希望它不仅“会生成语言”,而且生成更符合人类偏好的回答。问题是:开放式任务没有唯一标准答案,传统交叉熵只会惩罚与参考答案不同的 token,无法表达“哪个错得更合理、哪个更离谱”。因此需要:

text
SFT 的局限
→ 引入 reward function R(s)
→ 用 policy gradient 最大化期望 reward
→ 人类偏好难以绝对打分
→ 用 pairwise comparison 训练 Reward Model
→ 用 RLHF 优化语言模型
→ reward hacking / policy collapse
→ 用 KL penalty / trust region 限制策略变化
→ NPG / TRPO / PPO

重要程度标注: ★★★★★ 必考核心;★★★★ 高频理解题;★★★ 可能考概念;★★ 补充理解。

1. SFT 的局限:为什么不能只靠 supervised fine-tuning?★★★★★

SFT 的训练目标通常是最大化参考答案的 token likelihood,等价于最小化交叉熵:

符号解释:

是词表;

是某个候选 token;

是 one-hot ground-truth 标签;

是模型预测 token 的概率;

是模型给正确词 fantasy 的概率。

逻辑直觉:SFT 只关心“标准答案 token 的概率是多少”,不关心其他错误答案之间的语义差异。例如 ground truth 是 fantasy,而模型高概率预测 adventure 或 musical,在 CE loss 看来可能惩罚相同,因为两者都不是 fantasy。但人类知道 adventure 比 musical 更接近正确答案。课件第 3 页正是用这个例子说明 SFT loss 无法区分不同质量的错误答案。

开放式生成尤其严重。例如“写一首关于孤独的诗”,A1 和 A2 都可能合理,没有唯一正确答案。SFT 假设一个标准答案,而开放式任务需要比较多个候选回答的质量。

2. Reward Function:从“唯一答案”到“质量度量”★★★★★

因此我们引入 reward function:

其中 是模型生成的完整回答, 是回答质量的标量分数。它不要求回答有唯一正确答案,而是给每个回答一个相对质量评价。

RLHF 的目标是最大化模型采样输出的期望 reward:

符号解释:

是语言模型参数;

是模型生成完整序列 的概率分布;

表示从当前模型中采样一个回答;

是这个回答的 reward。

直觉:高 reward 的回答应该更常被生成,低 reward 的回答应该更少被生成。

3. Policy Gradient:reward 不可微时怎么优化?★★★★★

直接对期望 reward 求梯度:

展开期望:

使用 log-derivative trick:

所以:

代回:

也就是:

Monte Carlo 估计:

符号解释:

是采样数量;

是第 个采样生成序列;

是增加该序列生成概率的方向;

决定这个方向是被鼓励还是被抑制。

关键理解:我们不需要对 求导,只需要知道它是高还是低。真正可微的是模型的 log-probability。课件第 7–9 页强调了这一点。

对语言模型来说,完整序列概率分解为:

其中:

是生成长度;

是第 个样本在第 步生成的 token;

是第 步之前的上下文 token。

这说明 RLHF 不是只看一句话整体 reward,还必须计算每个 token 的 likelihood,因为序列 log-probability 是 token log-probability 的和。Lecture 15 quiz 的 Q1 正是在考这个点。

4. Reward Model:为什么用 pairwise comparison?★★★★★

直接让人类给回答打 1–10 分存在三个问题:

  1. expensive and slow;
  2. absolute scoring 模糊,比如 7 和 8 的边界不清楚;
  3. annotator calibration 不一致,有人严格,有人宽松。

所以更可靠的方法是 pairwise comparison:给定两个回答,让人类判断哪个更好。课件第 12 页指出,相对判断比绝对评分更稳定,inter-annotator agreement 更高。

Bradley-Terry Model ★★★★★

假设每个回答 有一个潜在强度:

Reward Model 输出这个分数:

其中 是 reward model 参数。

Bradley-Terry 模型认为,回答 战胜回答 的概率为:

等价地:

其中:

是 sigmoid 函数;

是回答 的 reward score;

是回答 的 reward score;

表示人类偏好 胜过

关键直觉:偏好概率只依赖分数差 ,不依赖绝对分数。因此 reward model 不需要学会“这个回答绝对是 8 分”,只需要学会“这个回答比另一个更好”。

Reward Model Loss ★★★★★

课件中的 reward model loss 是:

符号解释:

是人类偏好数据集;

是 winner response,即人类更喜欢的回答;

是 loser response,即人类不喜欢的回答;

是 reward model 给 winner 的分数;

是 reward model 给 loser 的分数;

是模型认为 winner 胜过 loser 的概率。

训练目标:让 尽可能大于

5. Reward Hacking:为什么 RM 不能被无限优化?★★★★★

Reward hacking 指 policy model 学会利用 reward model 的漏洞,而不是满足真实人类意图。

例如 RM 可能学到“自信、热情、礼貌”的回答更容易被打高分,于是模型对虚构问题也会自信胡编。课件第 16 页给了 Atlantis 的例子:模型可能生成很热情但虚假的答案。

本质问题:

Reward model 只是人类偏好的 proxy。当 policy 过度优化 proxy,就会偏离真实目标。

6. RLHF Objective with KL Penalty ★★★★★

为了防止 reward hacking 和语言能力崩坏,RLHF 通常加入 KL penalty:

也可理解为最大化:

符号解释:

是 pretrained / reference model 的生成概率,冻结不训练;

是当前正在 RL 训练的 policy model;

是冻结的 reward model 给出的分数;

控制 KL penalty 强度;

衡量两个生成分布之间的差异。

直觉:reward model 鼓励模型更符合人类偏好,KL penalty 防止模型离原来的语言模型太远,避免胡言乱语、重复、模式崩坏。Lecture 15 第 17 页明确说明 KL penalty 的作用是让输出接近 ,保持 human-readable 语言能力。

7. Lecture 16:为什么需要 PPO?★★★★★

Lecture 16 的核心问题是:

朴素 policy gradient 可以优化 reward,但 policy network 对参数更新非常敏感。参数空间中看似小的更新,可能导致策略分布发生巨大变化,从而造成 policy collapse。

对于语言模型,这种 collapse 可能表现为:

text
trees trees trees the the the ...
I love machine learning. I love machine learning...

一旦模型 collapse,之后从这个坏策略采样的数据也是坏的,训练会进入恶性循环。

8. KL Divergence:为什么不用参数距离,而用策略距离?★★★★★

参数距离:

不可靠。因为同样的参数变化,在不同区域可能导致完全不同的输出分布变化。

因此使用 KL divergence 衡量两个策略分布的差异:

符号解释:

通常是旧策略分布;

通常是新策略分布;

是动作或 token;

表示用 近似 时的信息损失。

KL 的性质:

当且仅当 时为 0;

KL 不对称:

在 RLHF 中,KL 的作用是约束新 policy 不要离旧 policy 或 reference model 太远。Lecture 16 第 10–11 页强调,KL 比参数距离更适合衡量策略行为变化。

9. Natural Policy Gradient:从欧氏空间梯度到分布空间梯度 ★★★★

目标是在 trust region 内最大化目标函数:

由于精确 KL 约束难解,对 做一阶近似,对 KL 做二阶近似。

目标函数一阶近似:

KL 二阶近似:

其中:

是 Fisher Information Matrix,也等于 KL 在当前点的 Hessian;

是参数更新方向;

是 trust region 半径。

于是优化问题变成:

构造拉格朗日函数:

求导并令其为 0:

所以:

这就是 natural gradient direction:

相比 vanilla gradient:

natural gradient 会根据策略分布对参数变化的敏感度重新缩放方向。Lecture 16 第 14–15 页推导了这个结果。

10. Natural Gradient 的步长推导 ★★★★

设:

自然梯度更新写成:

为了最大化 trust region 内目标,最优解在边界上:

代入:

由于 对称,且 ,有:

所以:

因此:

直觉:步长不是普通 learning rate,而是由 trust region 和 Fisher metric 自动决定。

11. TNPG 与 TRPO:解决 Natural Gradient 的计算问题 ★★★★

Natural gradient 的问题是 很难算,因为参数维度可能是百万、亿级。

于是把:

改写成线性方程:

用 conjugate gradient 迭代近似求解,不显式构造或求逆 。这叫 Truncated Natural Policy Gradient, TNPG。Lecture 16 第 16–17 页说明了用 Hessian-vector product 避免显式计算 FIM。

TRPO = TNPG + line search。

TRPO 的安全机制:

text
先计算 natural gradient 更新方向
→ 尝试较大步长
→ 检查 surrogate objective 是否改善
→ 检查 KL 是否小于阈值
→ 如果不安全,就缩小步长重试

TRPO 的问题:虽然避免显式求逆,但仍属于二阶优化,需要多次 backward / Hessian-vector product,比 Adam 这类一阶优化贵很多。Lecture 16 第 19–20 页指出 TRPO 仍然计算成本高。

12. PPO:保留 trust region 思想,放弃昂贵二阶优化 ★★★★★

PPO 的核心思想:

不用显式 KL 二阶优化,不用 conjugate gradient,而是用一阶优化器 Adam;但通过 clipping 限制新旧策略概率比,近似实现 safe update。

定义旧策略:

定义新策略:

概率比:

符号解释:

是状态;在语言模型中可理解为当前上下文;

是动作;在语言模型中通常是下一个 token;

是采样数据时使用的旧 policy,冻结;

是当前正在更新的新 policy;

表示新策略比旧策略更倾向于生成该动作;

表示新策略降低了该动作概率。

Advantage ★★★★★

PPO 不直接用 reward,而用 advantage:

其中:

是 action-value,表示在状态 下采取动作 后的期望回报;

是 state-value / baseline,表示处于状态 的平均期望回报;

说明动作 比平均更好,应该鼓励;

说明动作 比平均更差,应该抑制。

13. PPO Clipped Objective ★★★★★

PPO 的 clipped surrogate objective:

其中:

符号解释:

是估计出来的 advantage;

是 clipping range,例如 0.2;

是概率增加上限;

是概率降低下限。

两种情况:

若:

动作是好动作,我们想增加它的概率。但当:

时,继续增加概率不会带来更高 objective,因为 clip 后被封顶。直觉:好动作可以鼓励,但不要贪心过度。

若:

动作是坏动作,我们想降低它的概率。但当:

时,继续降低概率不会带来更高收益,避免过度惩罚。直觉:坏动作可以抑制,但不要一次性打死,否则会丢失探索。

Lecture 16 第 22–23 页就是 PPO 的核心公式与正负 advantage 情况分析。

14. 方法对比表:SFT → RLHF → NPG/TRPO/PPO

方法核心目标优点主要问题重要程度
SFT模仿参考答案简单稳定,训练高效开放式任务没有唯一答案;无法区分不同质量错误★★★★★
Reward Model学习人类偏好分数把主观偏好变成可优化信号RM 只是 proxy,可能被 hacking★★★★★
Policy Gradient最大化期望 reward不需要 reward 可微更新不稳定,可能 collapse★★★★★
KL-regularized RLHFreward + 保持接近原模型防止语言能力崩坏和 reward hackingKL 系数难调,仍需稳定优化★★★★★
Natural Policy Gradient用 FIM 修正梯度方向更符合策略分布几何 太贵★★★★
TNPG用 CG 近似 避免显式求逆仍需多次迭代★★★
TRPOTNPG + line search理论上安全更新二阶优化太贵★★★★
PPOclipping 近似 trust region简单、稳定、便宜,适合大模型是近似方法,不保证严格 KL 约束★★★★★

15. 期末高频考点总结

最可能考:

  1. 为什么 SFT 不适合开放式生成?
  2. Policy gradient 的 log-derivative trick 推导。
  3. 为什么 RLHF 不需要对 reward 求导,但仍需要 token likelihood?
  4. Reward Model 为什么用 pairwise comparison?
  5. Bradley-Terry 模型和 RM loss。
  6. Reward hacking 是什么,KL penalty 如何缓解?
  7. 为什么策略更新不能只看参数距离?
  8. KL divergence 在 RLHF / PPO 中的作用。
  9. Natural gradient 如何从 KL trust region 推导出来?
  10. PPO clipped objective 如何分别处理 positive advantage 和 negative advantage?

一句话抓住 Lecture 15–16:

SFT 只能模仿标准答案,RLHF 用 reward model 学人类偏好;但直接最大化 reward 会导致策略崩坏或 reward hacking,所以 PPO 用 probability ratio clipping 近似 trust region,在保持更新安全的同时高效优化语言模型。


下面继续整理 Lecture 17。它是 Lecture 15–16 的自然延伸:前面讲了 RLHF + PPO,现在这节课主要讲为什么大家开始寻找 PPO 的替代方案:DPO、GRPO、KTO、SimPO、DAPO。课件来源为 lecture-17。

Lecture 17 核心脉络

本章要解决的问题是:

text
RLHF + PPO 有效
→ 但 PPO 工程复杂、训练昂贵、Reward Model 可能 reward hacking
→ 是否可以直接用 preference data 优化 LLM?
→ DPO:去掉显式 Reward Model 和 RL rollout
→ GRPO:保留 RL,但去掉 Critic / Value Model
→ KTO / SimPO / DAPO:针对 DPO/GRPO 的数据与训练缺陷继续改进

一句话总结:

Lecture 17 的核心是从“复杂但强大的 PPO-RLHF”走向“更轻量、更直接、更适合开源训练的 preference optimization”。

1. RLHF + Reward Model 的局限 ★★★★★

Lecture 17 开头回顾了 RLHF 的问题:Reward hacking 是 RL 中常见问题。Reward Model 是从 noisy human preference 中学出来的 proxy,不等于真正的人类偏好,因此 policy 可能学会利用 RM 的漏洞,而不是生成真实更好的答案。课件第 2 页用 Google Bard 错误导致股价下跌,以及 reward model over-optimization 曲线说明:RM prediction 可以持续上升,但 actual preference 可能先升后降。

为了缓解这个问题,前面讲过 KL penalty:

其中:

是冻结 reward model 给出的分数;

是当前 RL 训练中的 policy;

是 reference / pretrained model;

控制模型不能偏离 reference model 太远。

逻辑直觉:RM 负责“往人类偏好方向拉”,KL 负责“别偏离原语言模型太远”。但这仍然没有解决 PPO 本身复杂、昂贵的问题。

2. PPO 为什么复杂?★★★★★

PPO 在 RLHF 中通常是 advantage actor-critic 算法。课件第 3 页图中包含 Policy LM、Reward Model、Value Model、GAE、Experience Buffer、Reference Model 等模块。

其中:

text
Actor = Policy LM
Critic = Value Model
Reward Model = 给完整回答打分
Reference Model = 计算 KL penalty
GAE = 估计 advantage

Value Model 通常和 Policy Model 架构类似,因此训练成本很高。对于大语言模型来说,这意味着不仅要训练 actor,还要维护 critic、reference model、reward model,显存和工程复杂度都很大。

3. 为什么 PPO 要用 Advantage?★★★★

Reward 本身不是绝对好坏,必须和 baseline 比较。

例如课件第 4 页给了三个 rollout reward:

平均值是:

所以 advantage 是:

直觉:reward = 10 看起来是正数,但相对于同一批 rollout 的平均水平,它其实很差。因此 policy optimization 不应该只看 reward 的绝对值,而要看“比平均好还是差”。

一般定义:

其中:

是在状态 下采取动作 后的期望回报;

是状态 的平均期望回报,也就是 baseline;

表示动作比平均更好,应该增加概率;

表示动作比平均更差,应该降低概率。

4. DPO Motivation:能不能不要 PPO?★★★★★

DPO 的动机是:

text
既然我们最终想让模型符合 preference data,
能不能跳过 Reward Model + RL,
直接用 preference data 优化语言模型?

课件第 5 页明确说:DPO derives a closed-form solution to the reward function for simpler MLE optimization。也就是说,PPO 是用 RL 间接优化偏好目标,而 DPO 把 reward 函数解析地写成 policy 概率比,从而直接做 maximum likelihood 风格的优化。

5. 从 RLHF Objective 推导 DPO 的关键公式 ★★★★★

RLHF 的 KL-regularized objective 对于输入 和回答 可以写成:

令:

则目标函数写为:

约束是:

构造拉格朗日函数:

求偏导并令其为 0:

整理得:

两边除以

指数化:

所以:

归一化后得到:

其中:

是 partition function / normalization constant。

这一点非常重要:理论最优 policy 是 reference model 按 reward 指数加权后的分布。但 要对所有可能回答求和,无法直接计算。课件第 6–10 页完整推导了这个 closed-form optimal policy。

6. 用 Policy 反推 Reward:DPO 的关键一步 ★★★★★

由:

两边取 log:

整理得到:

DPO 的核心替换是:用当前 policy 近似最优 policy,于是定义隐式 reward:

注意课件第 11 页强调:这是 definition, not derivation。也就是说 DPO 定义了一个由 policy 隐含表示的 reward model。

问题:这里仍然有 ,看起来不可计算。但 Bradley-Terry pairwise loss 会让它消掉。

7. Bradley-Terry 如何消掉 ★★★★★

给定同一个 prompt ,有 winner response 和 loser response 。Bradley-Terry 偏好概率为:

等价为:

其中:

Reward Model loss 是:

把 DPO 的隐式 reward 代入:

则:

其中:

完全抵消。

所以:

最终 DPO loss:

这是 Lecture 17 最核心公式。课件第 12–13 页说明,DPO 之所以可行,是因为 pairwise comparison 只关心 reward difference,而 在同一个 prompt 下会被消掉。

8. DPO 的直觉 ★★★★★

DPO 做的事情可以理解为:

text
对于 winner y_w:
让当前模型相比 reference model 更愿意生成它。

对于 loser y_l:
让当前模型相比 reference model 更不愿意生成它。

也就是增大:

减小:

更准确地说,是增大二者差值:

所以 DPO 不需要显式训练 Reward Model,也不需要 PPO rollout。Reference model 仍然存在,它提供了“不要偏离原模型太远”的基准。

9. DPO 的效果与工业位置 ★★★★

课件第 14 页提到 Zephyr-7B:HuggingFaceH4 使用 DPO 训练 7B 模型,在当时的对话能力评测中超过了 Llama-2-Chat 70B。这里的重点不是背具体分数,而是理解 DPO 的意义:它让开源社区能用较低工程成本做有效 alignment。

Lecture 17 第 17 页对 PPO 和 DPO 做了工业对比:

维度PPODPO
定位重型计算护城河开源友好的轻量方法
代表OpenAI, AnthropicHugging Face, Mistral, Llama 系列
优势更强全局探索能力简洁、便宜、plug-and-play
性能上限高,适合复杂逻辑和长文本对一般 alignment 很有效
资源需求巨大算力与工程投入开源开发者可承受

10. GRPO Motivation:去掉 Critic 的 RL ★★★★★

PPO 的一个大成本来自 critic / value model。Value Model 通常和 Policy Model 一样大,用来估计 advantage:

GRPO 的思想是:不要训练 Critic,而是让同一个 prompt 下生成的多个回答互相比较,用 group baseline 计算 advantage。

对于同一个输入问题 ,policy 生成 个回答:

每个回答有 reward:

用组内均值和标准差归一化 advantage:

其中:

是 group size;

是第 个回答的 reward;

是同一问题下 个回答的平均 reward;

是同一问题下 个 reward 的标准差;

是第 个回答相对于同组其他回答的 advantage。

关键:GRPO 的 advantage 是同一个 query 内多个 samples 的相对分数,不是不同 query 混在一起算。Lecture 17 quiz Q3 正是在考这个点:GRPO 不是用不同 queries 的多个 samples 计算 advantage,所以答案是 False。

11. GRPO Loss ★★★★★

课件第 16 页给出 GRPO loss,与 PPO clipping 很像,只是 advantage 来源变了。核心 token-level ratio 是:

符号解释:

是第 个回答的第 个 token;

是第 个回答在第 步之前的 prefix context;

是输入问题;

是当前 policy;

是生成这批数据时的旧 policy;

是 token-level importance sampling ratio。

Clipped objective 部分:

GRPO 整体目标:

直觉:GRPO 仍然是 PPO 风格的 clipped policy optimization,但不用 critic,而是用 group-relative reward 估计 advantage。

12. DPO vs GRPO:本质区别 ★★★★★

方法是否 RL是否需要 Reward Model是否需要 Critic数据形式核心思想
PPO-RLHF需要需要rollout + RM score用 RL 最大化 RM reward
DPO不显式需要不需要pairwise preference直接用 winner/loser 优化 policy
GRPO通常需要 reward signal不需要同一 query 的多样本 group用组内均值替代 value baseline

最容易混淆的一点:

DPO 是“去 RL 化”;GRPO 是“保留 RL,但去 critic”。

13. KTO:解决 DPO 对 paired preference 的依赖 ★★★

DPO 的问题:需要严格成对的 preference data,即同一个 prompt 下有 winner 和 loser。但现实中更常见的是 unpaired feedback,例如 thumbs up / thumbs down。

KTO,即 Kahneman-Tversky Optimization,动机来自 prospect theory:人类对坏回答的厌恶通常强于对好回答的喜爱。课件第 18 页说,KTO 不需要 pairwise comparison,而是基于每个单独回答是 desirable 还是 undesirable 来优化 implicit utility。

可以这样理解:

text
DPO:必须知道 A 比 B 好。
KTO:只需要知道 A 是好回答,或者 B 是坏回答。

因此 KTO 更适合大量非配对反馈数据。

14. SimPO:解决 DPO 的长度偏置 ★★★★

DPO 的一个问题是:序列越长,token-level log probability 的累积差异越大。即使每个 token 的优势很小,长回答也可能因为累计效应扩大 winner-loser 的 reward gap。

SimPO 的解决方法是 length-normalized implicit reward,并且 reference-free。

课件第 19 页公式:

其中:

是输入 prompt;

是回答;

是回答长度,也就是 token 数;

是当前 policy 生成回答 的概率;

是 scaling hyperparameter。

SimPO loss:

其中:

是 chosen / winner response;

是 rejected / loser response;

是 reward margin,用来保证 winner 和 loser 之间有严格差距;

是 logistic sigmoid。

SimPO 的两个关键词:

text
length-normalized
reference-free

它不再显式使用 reference model 的概率比,而是直接用当前模型的长度归一化 log-probability 构造 implicit reward。

15. DAPO:解决 GRPO 的 clipping 抑制探索问题 ★★★

GRPO / PPO 的标准 clipping 通常是对称的:

例如 ,上界是 1.2。

问题是:对于低概率但高 reward 的探索 token,这个上界太严格。课件第 20 页举例:

如果一个 exploitation token 初始概率是:

那么上界:

实际最大概率接近 1,几乎不受限制。

但如果一个 exploration token 初始概率是:

那么上界:

它最多只能从 0.01 增加到 0.012,几乎无法变成重要候选。因此模型会更容易重复已有高概率模式,探索能力下降,甚至 entropy collapse。

DAPO 的解决思路:给低概率但正 advantage 的 token 更高 upper bound,鼓励探索。

可以理解为:

text
标准 PPO/GRPO clipping:所有 token 一视同仁。
DAPO:对有潜力的新 token 放宽上界,让模型敢于探索。

16. Lecture 17 的算法演进图

text
RLHF + PPO
  优点:性能强,能通过 reward 做全局探索
  问题:RM hacking、PPO 复杂、Critic 昂贵

DPO
  去掉显式 RM + RL rollout
  用 preference pair 直接优化 policy
  问题:依赖 paired preference;可能有长度偏置

KTO
  不需要 pairwise,只需 thumbs up/down

SimPO
  reference-free + length-normalized,缓解长度偏置

另一路:
PPO
  问题:Critic 太贵

GRPO
  用同一 query 的 group rewards 估计 advantage
  问题:标准 clipping 抑制低概率探索 token

DAPO
  非对称 clipping / 提高探索 token 上界

17. 期末高频考点

Lecture 17 最可能考这些:

  1. 为什么 PPO-RLHF 复杂?
  2. Advantage 为什么不是直接 reward?
  3. DPO 的动机:如何跳过 Reward Model 和 RL?
  4. RLHF 最优 policy 的 closed-form:
  1. 为什么 不可计算?
  2. 为什么 DPO 中 会抵消?
  3. DPO loss 公式:
  1. GRPO 如何不用 Critic?
  2. GRPO 的 advantage 是同一个 query 下多个 responses 的组内归一化:
  1. KTO、SimPO、DAPO 分别解决什么问题?

18. 最后用一句话串起来

PPO-RLHF 是“训练 RM,再用 RL 优化 policy”;DPO 是“把 RM 隐式写成 policy/reference 概率比,直接用 preference pair 训练”;GRPO 是“保留 RL,但用同一问题的多个回答互相做 baseline,去掉昂贵 Critic”;KTO、SimPO、DAPO 则分别针对“无配对数据、长度偏置、探索受限”继续改进。

Static academic notes built with VitePress and KaTeX.