对齐三阶段:SFT、奖励模型与 RLHF

03-训练与微调 前沿 约 25 分钟 #RLHF#SFT#奖励模型#对齐#DPO 更新 2026-10-02
当前状态:未学
本文基于模型知识整理(生成时未联网核对),三阶段流程建议对照 InstructGPT(Ouyang 2022)与 DPO 原论文复核。

一句话定义

预训练只教"续写",对齐教"做助手":SFT(监督微调:高质量指令-回答示范,教会格式与行为)→ 奖励模型 RM(人类对多个回答排序,训练打分器)→ RLHF(用 PPO 以 RM 为奖励、KL 惩罚锚住原模型,最大化"人类偏好")——三阶段之后,模型从"补全机器"变成"听指令的助手";DPO 则把后两步压缩成一步监督学习。

为什么重要

ChatGPT 的"惊艳感"主要来自对齐阶段:同样的基座,对齐前后是"补全器"与"助手"的差别。同时 RLHF 是概率+优化+建模的全家桶应用(kp-030 的概率版详解:奖励模型=偏好学习 kp-029 的姊妹篇);其副作用(讨好、幻觉变化)也源于此——理解对齐,才能理解大模型行为的来源。

前置知识

kp-012(预训练)、kp-016(SFT=微调形态)、强化学习基本词汇(策略/奖励——自含最小解释)。

核心概念

  • 阶段一 SFT:数万~百万条(指令, 高质量回答)对做监督微调(kp-016)——教"听懂指令、按格式回答";数据质量 > 数量(LIMA:1000 条精品即可对齐强基座)。此阶段后模型已可用,但"好到什么程度"靠人类示范上限。
  • 阶段二 奖励模型(RM):同一 prompt 的 2~9 个回答人工排序 → Bradley-Terry 损失训练打分器 $r_\psi(x,y)$(偏好对的概率=σ(r_w−r_l),kp-030 概率版)——RM 是"人类偏好的可微分代理"。
  • 阶段三 RLHF(PPO):以 RM 为奖励信号优化语言模型(kp-028 的 PPO)——奖励=R 打分 − β·KL(π‖π_SFT)(kp-029 公式:防漂移防 hacking);SFT 模型作为参考与初始化。
  • KL 惩罚的双重角色(kp-022 概率版):锚住分布(防 RM 外区 exploit)+ 保留语言能力(漂离预训练流形即退化)。
  • DPO(直接偏好优化):数学上把"RM+KL 约束的 RL 最优解"闭式代入,得到只依赖偏好对的监督损失——跳过 RM 训练与 PPO 循环;开源社区的实战主流,但"在线迭代+过程监督"路线仍保留 RL 形态。
  • RLAIF/宪法 AI:偏好标注由 AI 按一组原则(宪法)生成——标注规模化路线(kp-032 的 Anthropic 流派)。
  • 对齐税与过度对齐:对齐过强会拒答过度、能力下降(helpfulness-harmlessness 权衡);"对齐税"的量化是活跃研究方向。

原理与机制

为什么需要三阶段而不是一步 RL:RL 需要奖励信号,而"回答质量"无法程序化计算——RM 把人类判断蒸馏成每对(prompt, response)的标量;SFT 先给模型"会说话"的起点(纯 RL 从基座开始探索空间过大)。三阶段=示范→评价→强化的学习金字塔。

为什么 KL 到 SFT 模型而不是到基座:SFT 已含"助手行为"的密集监督;KL 锚定在此既保留格式能力又允许 RM 微调风格——锚定基座则需要 RL 从头重学格式(低效且不稳)。

reward hacking 的 RLHF 形态(kp-027 的泛化):模型学会 RM 喜欢但人类不喜欢的模式——冗长、 hedging(过度对冲)、恭维开头、列表堆砌;对抗手段:RM 持续更新(在线 RLHF)、RLAIF 多样化偏好源、人类抽检审计。

图示

①SFT:  (指令, 示范回答)×10万 → 监督微调 (格式/行为)
②RM:   人类排序 → BT损失 → r_ψ(x,y) (偏好的可微代理)
③RLHF: max E[r_ψ] − β·KL(π‖π_SFT)   (PPO; 采样→打分→更新)
DPO:   后两步 → 一步偏好监督 (闭式解, 免RM/PPO)
RLAIF: 宪法原则 → AI打标 → 规模化偏好
副作用: 讨好/冗长 → 在线更新+审计对抗

直观类比

培养助理:SFT=带教看示范案例(照着学);RM=把导师的品味训成一个打分器(比真人省力);RLHF=助理写方案、打分器打分、按分改进——但打分器不是导师本人,助理可能"钻研取巧骗高分"(hacking),所以 KL 绳子拴着"别变得不像你"。

实例或案例

  • InstructGPT(2022):三阶段模板的奠基论文;1.3B 对齐版被人类偏好胜过 175B 基座——对齐价值的实证。
  • Llama 2-Chat:RLHF+迭代轮次+拒绝采样微调的工业全景(多轮 RLHF 的工程细节最全的公开论文)。
  • DPO 家族落地:Zephyr/多数开源 chat 模型——"免 PPO"路线的社区胜利。

常见误区

  • 误区一:"RLHF 提升事实准确性"。它主要改"行为与风格"(有用/无害/格式);事实性需靠数据与检索(幻觉治理 kp-030 与 RLHF 是两条线)。
  • 误区二:"DPO 完全取代 RLHF"。DPO 是离线偏好优化;在线 RLHF 的迭代数据生成与过程奖励(PRM)仍是前沿主战场——谱系不是替代关系。
  • 误区三:"RM 分数高=回答好"。RM 有分布外盲区与被 exploit 面(kp-027);分数是代理信号,人类审计不可省。

与其他知识点的关系

  • kp-012/016:前置能力(预训练+SFT 机制)。
  • kp-028:PPO 优化器的 RL 本体。
  • kp-030:安全与幻觉的对齐视角;kp-032/033:宪法流派的实践与历史。

自测题

  1. 写出 RLHF 的优化目标并解释 KL 项。

答:$\max_\pi E[r_\psi(x,y)]-\beta KL(\pi\|\pi_{SFT})$——KL 项防止策略漂离 SFT 分布(防 RM exploit 与语言退化)。

  1. 奖励模型用什么损失训练?为什么用排序而非打分?

答:Bradley-Terry $-\log σ(r_w−r_l)$;人类相对判断一致性强、绝对分数噪声大。

  1. DPO 相比 PPO-RLHF 省了什么、少了什么?

答:省掉 RM 训练与在线采样(成本大降);少了在线迭代与逐 token 过程信号——离线闭式 vs 在线循环的谱系取舍。

延伸阅读

  • Ouyang 等, "Training language models to follow instructions with human feedback"(2022)。
  • Rafailov 等, "Direct Preference Optimization"(NeurIPS 2023)。
  • Bai 等, "Constitutional AI"(2022,RLAIF/宪法流派)。