核心摘要

DPO(Direct Preference Optimization,直接偏好优化)和 RLHF(Reinforcement Learning from Human Feedback,基于人类反馈的强化学习)是偏好对齐研究中的两条重要路线。本文从数学假设出发,比较训练流程、数据契约、工程复杂度和评测边界,并介绍 IPO、KTO、ORPO、SimPO 等变体,不把某种方法写成跨模型、跨任务的默认答案。

为什么需要对齐技术

预训练模型的根本缺陷

经过大规模预训练的语言模型主要优化下一个 Token 的预测目标,因此预训练损失不能直接代表帮助性、真实性或安全性。模型仍可能生成有害、错误或不符合意图的回答。

模型对齐技术正是为了弥补这一根本性缺陷。它的核心目标是让模型的输出符合人类偏好,通常概括为三个维度:

  • 有帮助(Helpful):回答能真正解决用户问题
  • 无害(Harmless):拒绝生成危险、不当的内容
  • 诚实(Honest):不编造事实,对不确定的问题坦诚表达

从 SFT 到偏好优化

对齐训练的第一步通常是监督微调(Supervised Fine-Tuning, SFT)。通过让模型在高质量的指令-回复对上做微调,模型学会了"说人话"的基本能力。

但 SFT 有一个本质局限:它只能教模型"应该怎么说",却无法精确传达"A 回复比 B 好在哪里"这种相对偏好信息。这正是 RLHF 和 DPO 要解决的核心问题——如何利用人类的偏好判断进一步优化模型行为。

RLHF:基于奖励模型的强化学习路径

三阶段训练流程

RLHF 常用的一种形式包含 SFT、奖励模型训练和 PPO 策略优化。其他系统也会使用拒绝采样、监督式偏好目标、过程奖励或不同的策略优化算法,因此三阶段流程是参考模型,不是所有系统的必选步骤:

阶段一:监督微调(SFT)

在高质量的 prompt-response 数据集上对预训练模型做监督微调,得到一个初始策略模型 $\pi_{\text{SFT}}$。

阶段二:训练奖励模型(Reward Model)

收集人类偏好数据:对同一个 prompt,让模型生成多个回复,由人类标注员判断哪个更好。用这些偏好对训练一个奖励模型 $r_\phi$,使其能够为任意回复打分。奖励模型的训练目标基于 Bradley-Terry 模型:

$$L_{\text{RM}} = -\mathbb{E}{(x, y_w, y_l)} [\log \sigma(r\phi(x, y_w) - r_\phi(x, y_l))]$$

其中 $y_w$ 是人类偏好的"胜出"回复,$y_l$ 是"失败"回复。

阶段三:PPO 强化学习优化

强化学习算法(通常是 PPO,近端策略优化)来优化策略模型。优化目标是最大化奖励模型给出的分数,同时通过 KL 散度惩罚确保模型不偏离 SFT 模型太远:

$$\max_\pi \mathbb{E}{x \sim D, y \sim \pi} [r\phi(x, y)] - \beta \cdot \text{KL}[\pi(y|x) | \pi_{\text{SFT}}(y|x)]$$

如果你想深入了解 RLHF 的完整原理和 PPO 算法细节,推荐阅读RLHF 深度解析:ChatGPT 如何从人类反馈中学习

RLHF 的工程复杂度

RLHF 的核心挑战在于它引入了极高的工程复杂度:

  1. 多组件协同训练:PPO 实现可能涉及策略、参考、奖励和价值组件,但不同框架的并行、共享和卸载方式不同,应报告真实拓扑、精度、序列长度、Batch 和检查点策略
  2. 超参数敏感:PPO 本身的超参数(学习率、clip range、GAE lambda)加上 KL 惩罚系数 $\beta$,调参空间巨大
  3. 训练不稳定:奖励模型的误差会被强化学习放大,容易出现 reward hacking——策略模型学会"欺骗"奖励模型获取高分,但实际输出质量反而下降
  4. 基础设施要求高:在线生成(on-policy)会增加推理、调度和数据回流工作量,实际资源不能只按参数量推算

DPO:砍掉奖励模型的直接优化

核心数学洞察

2023 年,Rafailov 等人提出了 DPO。在 KL 正则化奖励目标和 Bradley-Terry 等偏好模型的假设下,可以推导出直接使用偏好对优化策略的损失,无需单独拟合奖励模型或运行 PPO;这些假设和参考策略仍然重要:

$$\pi^*(y|x) = \frac{1}{Z(x)} \pi_{\text{ref}}(y|x) \exp\left(\frac{1}{\beta} r(x, y)\right)$$

对这个关系做变量替换,可以用策略模型的对数概率直接表达出奖励函数,从而完全消除对独立奖励模型的需求。最终的 DPO 损失函数为:

$$L_{\text{DPO}} = -\mathbb{E}{(x, y_w, y_l)} \left[\log \sigma\left(\beta \log \frac{\pi\theta(y_w|x)}{\pi_{\text{ref}}(y_w|x)} - \beta \log \frac{\pi_\theta(y_l|x)}{\pi_{\text{ref}}(y_l|x)}\right)\right]$$

为什么 DPO 更简单

DPO 的突破性意义在于将对齐训练从复杂的强化学习问题简化为一个标准的监督学习问题:

  • 无需奖励模型:训练过程只需要策略模型和参考模型两个拷贝
  • 无需在线采样:直接使用离线的偏好数据集,不需要在训练过程中做模型推理
  • 超参数极少:核心超参数只有 $\beta$(控制偏离参考模型的程度)和标准的学习率等
  • 训练稳定:标准的交叉熵式损失函数,梯度行为可预测,不存在 RL 特有的训练不稳定问题

这些特性可能降低工程表面,但不会消除分布偏移、偏好数据偏差、截断、参考模型选择和安全评测。熟悉监督微调的团队仍需重新建立数据和评测流程。

DPO 的训练流程

code
偏好数据集 (prompt, chosen, rejected)
         |
         v
  加载 SFT 模型作为参考模型 (frozen)
         |
         v
  复制一份作为策略模型 (trainable)
         |
         v
  计算 DPO Loss → 反向传播 → 更新策略模型
         |
         v
  对齐后的模型

整个流程与标准的微调几乎一致,唯一的区别是损失函数换成了 DPO Loss,且需要保留一个冻结的参考模型来计算对数概率比值。

深度对比:DPO vs RLHF

训练效率与资源消耗

维度 RLHF (PPO) DPO
训练阶段 常见为 SFT + RM + PPO,但实现会变化 偏好优化阶段;SFT 可能单独进行
模型/组件 可能包含策略、参考、奖励和价值组件,取决于拓扑 经典目标通常需要策略和参考模型
显存占用 取决于拓扑、精度、序列长度和 Batch 取决于参考模型、适配器和序列长度
训练时长 长(含在线采样) 短(纯离线训练)
超参数数量 多(PPO + KL + RM 相关) 少(主要是 $\beta$)
工程复杂度 高(需要 RL 基础设施) 低(标准训练循环)

不要在没有受控实验的情况下发布显存或 GPU 数字。公平比较应固定模型 revision、数据、序列上限、硬件、精度、Batch、评测目标和成本核算范围;QLoRA 也不能替代实际 OOM、吞吐和质量测试。

对齐效果对比

在实际效果上,两者的差距取决于模型、数据、实现和具体任务:

可比较的实验问题:

  • 固定模型、偏好数据和验证切片后,哪种方法在帮助性、真实性、拒答、安全和回归指标上更好?
  • 在线探索是否带来目标任务收益,是否值得额外推理、标注和治理成本?
  • 参考模型、奖励模型和数据分布变化是否改变结论?

数据需求差异

RLHF 和 DPO 都需要偏好数据,但对数据的使用方式有本质区别:

  • RLHF 的离线+在线模式:偏好数据用于训练奖励模型(离线),然后 PPO 阶段会在线生成新的回复让奖励模型打分。这意味着奖励模型可以泛化到训练集中没有的新回复上。
  • DPO 的纯离线模式:直接从固定的偏好数据集中学习,不会产生新的交互数据。这使得 DPO 的效果高度依赖训练数据的质量和覆盖度。

这一区别引出了 DPO 的一个重要潜在风险:分布外泛化能力有限。如果偏好数据没有覆盖某类 prompt,DPO 模型在该类 prompt 上的对齐效果可能不佳。

新一代偏好优化变体

DPO 的成功激发了大量后续研究,涌现出多种改进变体:

IPO(Identity Preference Optimization)

IPO 通过不同的目标形式研究 DPO 偏好过拟合和过度自信问题;它是否更抗噪声取决于数据、超参数和评测协议,不能直接当作保证。

KTO(Kahneman-Tversky Optimization)

KTO 使用单条回复的正负反馈,而不是要求同一 Prompt 下的成对偏好。它改变了数据契约,但二元标签的语义、类别不平衡和标注校准仍需单独验证。

ORPO(Odds Ratio Preference Optimization)

ORPO 将语言建模损失与 odds-ratio 偏好项组合为一个目标,减少了单独参考模型的依赖。是否可以从预训练模型直接开始、以及数据是否足以承担 SFT 职责,仍需按实现和实验验证。

SimPO(Simple Preference Optimization)

SimPO 使用长度归一化的平均对数概率和 margin,目标是减少长度偏差并移除参考模型;具体收益必须绑定论文中的模型、数据、Prompt 和评测协议。

方法 需要配对数据 需要参考模型 需要独立 SFT 核心优势
DPO 简单有效、广泛验证
IPO 抗噪声鲁棒
KTO 数据需求极低
ORPO 单阶段训练
SimPO 无需参考模型

实战指南:从选型到落地

决策框架

在实际项目中,选择对齐技术时可以遵循以下决策逻辑:

第一步:评估团队能力和基础设施

如果团队没有强化学习经验,DPO 可能更容易建立第一个可比基线,但不能因此预设它更好。应根据偏好数据契约、目标行为、参考模型和评测成本选择方法,并参考LLM 微调方法对比

第二步:评估数据情况

  • 有配对偏好数据 -> 比较 DPO、IPO 与记录完整的 RLHF 基线
  • 只有二元标注(好/坏)-> 评估 KTO,并校准标签语义和类别比例
  • 参考模型显存成为瓶颈 -> 评估 ORPO 或 SimPO 的质量代价
  • 需要在线探索 -> 评估 PPO 或在线/迭代方法,并加入 reward hacking 测试

第三步:评估规模和迭代需求

  • 使用 LoRA/QLoRA -> 报告模型 revision、序列长度、精度、Batch、框架版本和许可证
  • 需要奖励塑形或探索 -> 以相同质量和安全目标评估 RLHF/PPO
  • 资源受限 -> 测量量化、适配器、检查点和吞吐对质量的实际影响

使用 TRL 库实现 DPO 训练

以下是 Hugging Face TRL 的示意模板;API、数据 Schema、模型卡和许可证会变化,运行前必须固定 revision、检查数据许可证并验证 Chat Template:

python
import torch
from datasets import load_dataset
from transformers import AutoModelForCausalLM, AutoTokenizer
from trl import DPOConfig, DPOTrainer
from peft import LoraConfig

model_name = "ORG/MODEL@REVIEWED_REVISION"

tokenizer = AutoTokenizer.from_pretrained(model_name)
model = AutoModelForCausalLM.from_pretrained(
    model_name,
    torch_dtype=torch.bfloat16,
    device_map="auto",
)

dataset = load_dataset("ORG/REVIEWED_PREFERENCE_DATASET", revision="REVIEWED_REVISION")

peft_config = LoraConfig(
    r=16,
    lora_alpha=32,
    lora_dropout=0.05,
    target_modules=["q_proj", "v_proj", "k_proj", "o_proj"],
    task_type="CAUSAL_LM",
)

training_args = DPOConfig(
    output_dir="./dpo-llama3-aligned",
    per_device_train_batch_size=2,
    gradient_accumulation_steps=8,
    learning_rate=5e-7,
    beta=0.1,
    num_train_epochs=1,
    warmup_ratio=0.1,
    bf16=True,
    logging_steps=10,
    save_strategy="epoch",
)

trainer = DPOTrainer(
    model=model,
    args=training_args,
    train_dataset=dataset["train"],
    processing_class=tokenizer,
    peft_config=peft_config,
)

trainer.train()
trainer.save_model("./dpo-llama3-final")

偏好数据的准备要点

偏好数据的质量直接决定了对齐效果。以下是几条关键实践:

  1. 校准标注:建立清晰指南,记录一致与分歧模式,并保留仲裁规则;单一一致率阈值不能证明偏好质量
  2. 覆盖多样场景:偏好数据应覆盖模型预期使用的各种 prompt 类型——开放式问答、代码生成、创意写作、安全拒答等
  3. rejected 不宜太差:DPO 的学习效率在 chosen 和 rejected 质量差距适中时最高。如果 rejected 回复明显是胡言乱语,模型能学到的偏好信号很有限
  4. 数据规模:不要套用固定条数;按任务切片、模型、序列长度、标注噪声和验证集结果确定是否继续收集

评估与监控

无论选择哪种对齐方法,都需要建立完善的评估体系:

  • 自动化评估:固定基准版本、Prompt、Judge 和污染检查,报告不确定性
  • 能力与安全切片:评估事实性、拒答、隐私、鲁棒性、回归和任务效用
  • 人类/专家评估:采用校准抽样、置信区间和分歧分析
  • 监控过拟合:同时观察偏好准确率、KL、独立任务指标和奖励模型分数

产业实践与趋势

公开披露与归因边界

不同团队在实际生产中的选择反映了 RLHF 和 DPO 各自的定位:

公开技术报告通常只披露训练流程的一部分,不能据此为每个模型或版本归纳固定的 RLHF/DPO 路线。比较厂商策略时,应引用具体版本、官方报告、发布日期和披露范围,不把社区推测当作事实。

迭代式 DPO 与在线 DPO

最新的研究趋势正在弥合 DPO 和 RLHF 之间的鸿沟:

迭代式 DPO(Iterative DPO):在每轮 DPO 训练后,用更新的模型生成新的回复,重新收集偏好标注,然后进行下一轮训练。这本质上是在离线的 DPO 框架中引入了 RLHF 的在线探索元素。

在线 DPO(Online DPO):训练过程中实时从当前策略采样生成回复并更新偏好数据,而非使用固定的离线数据集。这会改变探索和数据回流方式,但是否接近某个 RLHF 基线必须由同一模型、数据和评测协议验证。

对齐税与效率优化

对齐训练会带来所谓的"对齐税"(Alignment Tax)——模型在获得更好的对齐效果的同时,某些原始能力可能会下降。这与模型量化中的精度损失问题类似。

缓解对齐税的常见策略包括:

  • 使用 PEFT 技术(如 LoRA)只更新部分参数,保留预训练模型的大部分知识
  • 在对齐训练中混入一部分原始预训练数据
  • 在验证集上调节 $\beta$,记录参考模型距离、偏好指标和能力回归;不要把它直接类比为推理阶段的温度参数
  • 使用知识蒸馏从大模型向小模型传递对齐能力,减少小模型的直接对齐训练开销

如何选择:受控实验矩阵

不要用 GPU 数量、参数规模或 “SOTA” 作为自动分流条件。先固定数据和质量目标,再比较候选方案:

code
开始
  |
  ├── 偏好数据是成对的吗?
  |     └── 是 → 比较 DPO/IPO 与记录完整的 RLHF 基线
  |
  ├── 只有二元标注数据(非配对)?
  |     └── 是 → KTO
  |
  ├── 参考模型显存是主要瓶颈?
  |     └── 是 → 评估 ORPO/SimPO 的质量代价
  |
  ├── 需要在线探索或奖励塑形?
  |     └── 是 → 评估 PPO/在线方法并测试 reward hacking
  |
  └── 偏好数据噪声大、标注质量不稳定?
        └── 是 → IPO 或 RLHF

对于许多团队,DPO 可能是较易建立的基线,但不是普遍最佳选择。每个候选方法都应经过能力、安全、偏好、成本和回滚门禁;只有留出切片证明收益,才增加在线探索或更复杂的奖励流程。

选择好对齐策略后,如果你面临的是"是否需要微调"这一更上层的技术决策,推荐阅读 RAG vs 微调选型指南做更全面的考量。

总结

RLHF 和 DPO 代表不同的数据、优化和工程契约。DPO 可以去掉 PPO 与独立奖励模型,但不能去掉偏好偏差、分布外风险或安全评测;RLHF 可以提供在线探索和奖励塑形,但要承担更复杂的校准与运维。

未来方案可能组合离线偏好优化、在线数据回流、过程反馈和多目标安全评测;具体收益必须通过可复现的模型、数据、版本和指标记录来证明。

一手来源