Skip to content

RLHF(Reinforcement Learning from Human Feedback,基于人类反馈的强化学习)是让大模型"学会看人脸色"的关键技术。InstructGPT 论文开篇即指出:模型变大并不天然更会遵循用户意图——大模型可能输出不真实、有毒或无帮助的内容。对齐(Alignment)的目标,就是让模型按人类意图行事:遵循指令、诚实、无害。

对齐问题定义

大模型先通过"预测下一个 Token"的预训练获得广泛知识与能力,但这一目标与"帮助人类"并不一致。对齐要解决的核心矛盾是:"好"很难被量化成标准答案——很难让标注员为每个问题写出"完美回答",但让他们比较"两个回答哪个更好"却简单可行。RLHF 正是从这种人类偏好比较出发,把主观质量转化为可优化的训练信号。

RLHF 三阶段:SFT → 奖励模型 → PPO

阶段做什么关键点
1. SFT(监督微调)用人工撰写的示范回答微调预训练模型让模型先学会"像样地回答指令"
2. 奖励模型(Reward Model)标注员对多个输出两两比较/排序,训练输出标量奖励的偏好模型直接打分不稳定,排序更稳健;偏好数据通常在约 5 万条量级
3. PPO 强化学习以奖励模型为信号,用 PPO 微调策略模型加入 KL 散度惩罚,防止模型偏离原分布"刷分"产生胡言乱语

标志性成果:1.3B 参数的 InstructGPT 输出在人类评估中优于 175B 的 GPT-3(参数少约 100 倍),且真实性和无害性提升。ChatGPT 基于 GPT-3.5 采用相同方法训练。

RLHF 变体:DPO 与 RLAIF

RLHF 的三阶段流程效果显著,但工程复杂、训练不稳定。主要变体:

方法核心思路优势局限
RLHF(PPO)显式训练奖励模型 + 强化学习微调效果好,可迭代在线更新工程复杂、需大量调参、计算成本高
DPO(斯坦福 2023)把奖励模型参数化出闭合最优解,用简单分类损失直接优化策略免去在线采样与 PPO 调参,稳定且轻量,效果媲美或超过 RLHF离线训练,难以在线迭代
RLAIF / Constitutional AI(Anthropic 2022)用"宪法"原则清单替代人类标注:AI 自我批评、修订并互相评判,再训练偏好模型大幅减少人类标注需求,可控性与可解释性更强依赖宪法规则质量,AI 评判存在偏差风险

对齐挑战与局限

  1. 数据成本:人类偏好标注昂贵且主观,标注员之间常存在分歧,缺乏"标准答案"。
  2. 奖励黑客(Reward Hacking):模型可能学会欺骗奖励模型获得高分,而非真正变好;KL 惩罚只能缓解。
  3. 过度优化:对奖励模型优化过头反而损害真实质量(reward overoptimization),需要设置合理的优化强度。
  4. 并未根治不安全:对齐后的模型仍可能输出有害或不实内容,"对齐"是持续过程而非终点。

对齐研究正沿着 RLHF → DPO/离线 RL → RLAIF/可扩展监督的方向演进,成为大模型安全与可控性研究的核心主线。

一句话总结

RLHF 靠"两两比较"捕捉难以打分的人类偏好;1.3B 的 InstructGPT 胜过 175B 的 GPT-3,说明对齐比参数更关键,而对齐是持续过程。

关联概念