什么是 RLHF?

RLHF(Reinforcement Learning from Human Feedback,基于人类反馈的强化学习)是一类训练方法:它利用人类判断构建偏好或奖励信号,并据此优化模型策略,通常同时约束模型相对参考策略的偏移。

快速了解

全称基于人类反馈的强化学习
创建时间2017 年由 OpenAI 提出,2022 年普及
规范文档官方规范

工作原理

RLHF 常被实现为一条训练流水线:先通过监督微调得到初始的指令遵循策略,再收集经过校准的偏好比较数据,拟合奖励模型或偏好信号,最后用 PPO 等带 KL 约束的强化学习目标优化策略。具体阶段并不固定,有些系统会跳过 SFT、使用 AI 反馈,或采用无需单独奖励模型的偏好目标。人类判断只是预期结果的带噪声、局部代理,因此必须做标注规范设计、标注者校准、分歧分析、留出集评测、对抗测试和独立安全控制。最大化奖励模型分数的模型,在标注分布之外仍可能不真实、过度迎合或不安全。

主要特点

  • 使用示范和/或成对比较作为预期行为的代理信号
  • 通常训练奖励模型,并在参考模型约束下进行 RL 策略优化
  • 需要明确评分准则、标注者校准和分歧处理
  • 可以使用 PPO,但优化器和流水线是实现选择,不是定义本身
  • 能改善偏好遵循,但仍可能在真实性、鲁棒性或长尾安全上失败
  • 除训练奖励外,还需要留出集、对抗性和结果导向的评测

常见用途

  1. 改善有明确边界的助手策略的指令遵循能力
  2. 训练有事实依据回答与无依据回答之间的偏好比较
  3. 在确定策略下学习校准后的拒绝与安全替代方案
  4. 在专家能定义可靠规则的场景中优化回答风格
  5. 研究偏好数据和奖励模型如何泛化

示例

loading...
Loading code...

常见问题

RLHF 常见的训练阶段有哪些?

常见流程是先用监督微调得到初始策略,再用人工成对比较训练奖励模型,最后用 PPO 等受约束的策略优化算法训练。这是一种常用模式而非固定要求;不同实现可能使用不同初始化、AI 反馈或其他偏好目标。

为什么仍需要人类反馈?

下一个词预测并不会直接表达一个回答是否有帮助、是否足够谨慎或是否符合产品策略。偏好比较让评审者能够表达相对质量,但它仍是有限代理信号。反馈必须有评分准则、代表性任务、质量审查,并测试其泛化能力。

RLHF 和 DPO 有何区别?

经典 RLHF 通常先学习独立奖励模型,再用强化学习优化;DPO 直接相对参考策略优化偏好损失。DPO 往往能简化训练,但二者没有绝对优劣。数据质量、目标选择、能力保持和留出集评测决定实际效果。

RLHF 有哪些主要局限?

主要问题包括专家标注昂贵、判断可能不一致或带偏差、罕见场景覆盖不足、奖励黑客、策略坍缩或过度偏离,以及对基准过拟合。RLHF 也不能在运行时执行业务身份和授权,因此工具边界与确定性策略控制仍不可少。

如何评测 RLHF 系统?

使用映射到产品契约的留出测试集,覆盖任务成功率、事实依据、校准后的不确定性、策略遵循、提示词注入鲁棒性和工具调用鉴权。应按用户群与场景跟踪回归,对高影响结果加入人工复核,并保留明确的回滚门禁。

相关工具

相关术语

相关文章