
系列:AI 论文精读与复现训练营
日期:2026-08-04
适合读者:已经了解 SFT、Transformer 和基础强化学习概念,想系统读懂 RLHF、DPO、GRPO 与偏好数据论文的研究生、科研新人和工程背景读者。
摘要
RLHF / Preference Optimization 是现代 LLM 后训练里最容易被“公式名词”淹没的方向:PPO、reward model、DPO、KTO、ORPO、SimPO、GRPO、DAPO 看起来像一串算法清单,但真正要读懂的是三件事:偏好信号如何被定义,优化目标如何把偏好转成语言模型更新,评测如何证明模型真的更符合目标而不是更长、更讨巧或更会迎合 judge。本文给出一条精读路线:先读经典 RLHF 管线,再读 DPO 家族的离线偏好优化,再读 GRPO / RLVR 推理训练,最后用 RewardBench、AlpacaEval 和复现日志去审视论文证据。
目录
- 为什么 RLHF / Preference Optimization 重要
- 核心阅读方法:从数据、目标函数到评测闭环
- 代表论文路线图
- 关键论文精读
- 方法与实验对比表
- 复现建议
- 常见误区
- 适合研究生继续做的选题
- 总结
- 参考资料
为什么这个主题重要
预训练模型学到的是“下一个 token 的统计规律”,SFT 让它更像一个能按指令回答问题的助手,但“什么回答更好”往往不能只靠一个参考答案来定义。总结是否简洁、拒答是否适度、数学推理是否可靠、代码答案是否可执行、长回答是否只是啰嗦,这些都需要某种偏好信号。RLHF 的贡献在于把人类比较、规则验证或模型反馈转成可优化目标,让模型沿着“更被偏好”的方向更新。
但这个方向也有研究风险。第一,偏好不是客观真理,数据来源、标注指南和人群差异会改变训练目标。第二,reward model 可能被模型钻空子,出现 reward hacking、verbosity bias、拒答过度或安全能力倒退。第三,DPO 等离线方法简化了管线,却把问题转移到偏好对质量、参考模型、长度归一化和超参数敏感性上。第四,DeepSeek-R1 之后,GRPO / RLVR 让“可验证奖励 + 多样本采样 + 长推理”成为研究热点,但很多复现失败不是因为公式没抄对,而是因为数据筛选、模板、采样、长度惩罚、日志监控和评测协议没有对齐。
所以读这个方向不能只背公式。你需要问:偏好来自谁,奖励在优化什么,方法省掉了什么组件,省掉组件后引入了什么偏差,论文证据能否排除“模型变长”“benchmark 泄漏”“judge 偏置”“base model 本来就会”的解释。
核心阅读方法

读 RLHF / Preference Optimization 论文,可以按四层拆解。
第一层是数据。看清楚样本单元到底是什么:一个 prompt 配两个回答,还是一个 prompt 配多个候选;反馈是人类偏好、AI 反馈、规则验证、单条 thumbs-up/down,还是 reward model 打分;chosen 是否真的高质量,rejected 是否只是弱模型输出;训练集和评测集是否共享 prompt 模板、数据源或生成模型。
第二层是目标函数。PPO 类方法显式训练 policy 去最大化 reward,同时用 KL 约束不让模型偏离参考策略;DPO 把 reward model 的最优策略关系重写成分类损失;KTO 用二元 desirable / undesirable 信号;ORPO 和 SimPO 试图减少 reference model 或阶段数量;GRPO 用同一 prompt 的一组采样结果做相对优势估计,减少 critic / value model 的成本。读公式时不要停在“有没有 RL”,而要写出每个 loss 鼓励什么、惩罚什么、默认长度如何处理、参考模型是否参与、是否需要在线采样。
第三层是训练系统。RLHF 和 RLVR 很多结论依赖工程细节:rollout 速度、vLLM / SGLang 生成后端、ZeRO/FSDP、reference model 放置、KL 计算、reward server、断点续训、seed、采样温度、每个 prompt 采样数、max tokens、是否过滤全对或全错样本。论文如果只写“we use GRPO”,复现价值是不够的。
第四层是评测。偏好优化论文常用 MT-Bench、AlpacaEval、Arena-Hard、RewardBench、MATH、AIME、HumanEval、IFEval 或安全评测。你要分清:这是评估 policy,还是评估 reward model;是 automatic judge,还是人类偏好;有没有长度控制;有没有多次采样平均;有没有报告方差;有没有把失败样例公开。
代表论文路线图
1. 经典 RLHF 管线
从 Ziegler 等人的 human preferences 语言模型微调,到 OpenAI 的 summarization from human feedback,再到 InstructGPT,主线是“收集比较数据 -> 训练 reward model -> 用 PPO 优化 policy -> 加 KL 控制漂移”。这组论文的阅读重点不是今天是否还用完全相同的 pipeline,而是理解 reward model 为什么必要、PPO 为什么复杂、KL 为什么成为后训练里的基础约束。
2. DPO 与离线偏好优化
DPO 的关键贡献是把 RLHF 目标改写成不显式训练 reward model、不在线 rollout 的监督式 pairwise loss。后续 KTO、ORPO、SimPO、f-DPO、RSO 等方法从反馈形式、reference model、divergence、长度归一化和采样来源上继续改造。读这一支时要追问:方法变简单以后,是否牺牲了探索能力?是否更依赖偏好数据质量?是否会把 chosen 变得更短、更长或更模式化?
3. GRPO / RLVR 与推理模型
DeepSeekMath 提出 GRPO,DeepSeek-R1 把“可验证任务上的强化学习”推到研究中心。这里的偏好不一定来自人类比较,而可能来自数学、代码、格式或单元测试这类可验证奖励。DAPO、Dr. GRPO 和异步 RL 系统进一步指出:长推理训练的关键不只是 reward,而是采样组的方差、长度偏差、过长惩罚、动态采样和系统吞吐。
4. Reward model 与评测
RewardBench 与 RewardBench 2 说明,评估 reward model 本身已经是一个独立问题。一个 reward model 在 pairwise benchmark 上高分,不必然意味着它能稳定改进 policy;一个 policy 在 AlpacaEval 上赢,也不必然表示推理能力或安全性提高。读评测论文时要把“评价器的偏好”作为研究对象,而不是当成客观裁判。
关键论文精读
Learning to summarize from human feedback / InstructGPT
这两篇适合放在第一周读。阅读时画出三阶段流程:SFT 初始化、reward model 学比较、PPO 优化 policy。重点看偏好数据如何采集、标注者一致性如何控制、KL penalty 如何防止模型偏离,以及为什么人工偏好能击败 ROUGE 之类的自动指标。复现训练不必一开始跑大模型,可以用开源 summarization 数据、一个小 reward model 和 TRL 的 PPOTrainer 做最小闭环。
DPO
DPO 要精读公式推导。你需要自己从 KL-regularized RLHF objective 推到 reward-policy 关系,再推到 Bradley-Terry preference loss。读完后写一页“DPO 省掉了什么”:省掉 reward model 显式训练,省掉在线采样,省掉 PPO 的 critic,但保留 reference policy 和偏好对。实验部分重点看 DPO 与 PPO、SFT、rejection sampling 的比较是否控制了模型初始化、数据和评测协议。
KTO / ORPO / SimPO
这三篇适合并排读。KTO 问的是“如果没有成对偏好,只有 desirable / undesirable 能不能训”;ORPO 试图把 SFT 和偏好惩罚合成一个阶段;SimPO 用平均 log probability 作为隐式 reward,并移除 reference model。它们的共同训练点是:不要只看论文声称“更简单”,而要拆每个简化背后的假设。比如 reference-free 是否真的省内存,是否更难控制漂移;binary feedback 是否更便宜,是否也更含混;单阶段训练是否容易把 instruction learning 和 preference learning 混在一起。
DeepSeekMath / DeepSeek-R1 / DAPO / Dr. GRPO
这一组论文是 2025 之后读 RLHF 必须补的新分支。DeepSeekMath 里 GRPO 的动机是减少 PPO 中 value model 的成本,用同一 prompt 下多个输出的 reward 均值和标准差估计 advantage。DeepSeek-R1 让研究者看到 rule-based reward 可以在数学、代码等可验证任务中驱动长推理模式。DAPO 的价值在于公开了更完整的训练 recipe:动态采样、clip 调整、token-level loss、过长惩罚。Dr. GRPO 则提醒大家,GRPO 的标准化和长度处理可能引入优化偏差,所谓“思考变长”不一定等于“推理机制变强”。
RewardBench / RewardBench 2
这两篇用来训练你的评测敏感度。Reward model 既可以用于 RLHF 训练,也可以用于 best-of-N 或 reranking;但 reward model benchmark 与 downstream policy 改进之间不是自动等价。RewardBench 2 明确把多技能 reward model 评测做得更难,并报告与下游推理扩展和 PPO 等训练用途的相关性。读这类论文时,最好把 benchmark item 分成 instruction following、reasoning、safety、style、拒答、细微差别等桶,再看模型在哪些桶上掉分。
方法与实验对比表
| 方法 | 主要信号 | 是否显式 reward model | 是否在线采样 | 读论文时最该检查 |
|---|---|---|---|---|
| PPO-RLHF | human preference -> RM score | 是 | 是 | KL、critic、reward overoptimization、rollout 日志 |
| DPO | chosen/rejected pair | 否 | 否 | reference model、beta、pair 质量、长度偏差 |
| KTO | desirable / undesirable binary feedback | 否 | 否 | 二元标签来源、正负样本比例、任务适配性 |
| ORPO | SFT 数据 + preference pair | 否 | 否 | 单阶段训练是否混淆 SFT 与对齐收益 |
| SimPO | pairwise preference + average log probability | 否 | 否 | reference-free 漂移、beta/gamma、回答长度 |
| GRPO | 同 prompt 多采样 reward | 可选 | 是 | group size、reward 方差、零方差样本、长度处理 |
| DAPO | RLVR reward + 动态采样 | 可选 | 是 | 数据筛选、动态采样规则、过长惩罚、复现脚本 |
复现建议
不要从完整 RLHF 大系统开始。建议做三层复现。
第一层:DPO 最小复现。选一个 1B-3B instruction model,使用 HH-RLHF 或 UltraFeedback 的小子集,固定 prompt template,用 TRL DPOTrainer 训练一轮。记录 train loss、chosen/rejected reward margin、response length、MT-Bench 或 AlpacaEval 子集结果。目标不是刷榜,而是观察 beta 和 learning rate 如何影响输出长度与拒答风格。
第二层:reward model 复现。训练一个 pairwise reward model,然后在 RewardBench 或自建小集合上测 accuracy。再用它做 best-of-N,观察 reward 分数提高是否真的改善人工检查质量。这里最容易发现 reward hacking:模型可能变长、变模板化、过度安全或迎合 judge。
第三层:RLVR / GRPO 玩具复现。选 GSM8K、MATH 子集或可单元测试的代码任务,用规则 verifier 给 reward,设置每个 prompt 多采样,跑 GRPO 或 RLOO。必须保存每步 group reward、answer length、pass rate、全对/全错样本比例、KL、entropy、截断率。没有这些日志,就无法判断训练是在学习推理,还是只是在改变采样长度。
复现报告至少写五个字段:数据版本、模型 checkpoint、训练命令、关键超参数、失败样例。偏好优化实验对 seed、模板和生成参数很敏感,单次结果不能当结论。
常见误区
误区一:DPO 比 PPO “一定更好”。 DPO 更简单、更稳定,但它主要是离线偏好优化。需要探索新行为、依赖环境反馈或可验证奖励时,在线 RL 仍然有价值。
误区二:reward model 分数越高,policy 越好。 reward model 会有盲区。RewardBench 2 这类工作的重要提醒是:reward model evaluation 和 downstream training performance 要分开验证。
误区三:长 CoT 就是推理能力涌现。 GRPO / RLVR 训练中,长度增长可能来自任务需要,也可能来自 loss、标准化、截断和过长惩罚设计。必须同时报告准确率、token 数、截断率和错误样例。
误区四:偏好数据只看规模。 DPO 数据研究已经反复指出,chosen 质量、pair 对比度、on-policy 程度和标注一致性都可能比单纯样本数更关键。
误区五:自动评测可以替代人工阅读。 AlpacaEval、Arena-Hard、LLM-as-judge 很有用,但在 preference optimization 论文里,它们本身就是可能被优化的对象。高分样例要人工抽查。
适合研究生继续做的选题
- 偏好对质量诊断:设计指标预测哪些 DPO 样本会带来有效更新,比较 chosen 质量、rejected 难度、语义距离和长度差。
- reference-free 方法的漂移分析:对 SimPO / ORPO 类方法做多任务评测,检查安全、事实性、推理和回答长度的共同变化。
- GRPO 长度偏差复现实验:在数学小模型上系统改变 group size、max tokens、过长惩罚和标准化方式,验证长度增长与准确率的关系。
- reward model 与 downstream policy 相关性:训练多个 reward model,在 RewardBench、best-of-N、PPO 或 DPO 后 policy 表现之间做相关性分析。
- 偏好优化失败样例库:收集过度拒答、迎合 judge、长而错、格式正确但语义错、代码测试过拟合等样例,形成可复用 evaluation card。
总结
RLHF / Preference Optimization 的阅读顺序应该从“人类偏好如何进入训练”开始,而不是从算法名字开始。经典 RLHF 教你 reward model、PPO 和 KL 的基本闭环;DPO 家族教你如何把偏好优化变成更轻量的监督损失;GRPO / RLVR 教你可验证奖励如何推动推理训练;RewardBench 和复现论文提醒你,优化目标和评测目标之间永远可能存在裂缝。真正的科研训练不是记住 DPO、KTO、ORPO、SimPO、GRPO 的公式差异,而是能拿一篇新论文问出四个问题:数据可信吗,loss 在鼓励什么,系统细节是否足够复现,评测是否排除了更简单的解释。
参考资料
检索日期:2026-08-04。
- Schulman et al., “Proximal Policy Optimization Algorithms,” arXiv, 2017. https://arxiv.org/abs/1707.06347
- OpenAI, “Learning to summarize with human feedback,” 2020. https://openai.com/index/learning-to-summarize-with-human-feedback/
- Stiennon et al., “Learning to summarize from human feedback,” arXiv, 2020. https://arxiv.org/abs/2009.01325
- OpenAI, “Aligning language models to follow instructions,” 2022. https://openai.com/index/instruction-following/
- Rafailov et al., “Direct Preference Optimization: Your Language Model is Secretly a Reward Model,” arXiv, submitted 2023, revised 2024. https://arxiv.org/abs/2305.18290
- Ethayarajh et al., “Model Alignment as Prospect Theoretic Optimization,” ICML / PMLR, 2024. https://proceedings.mlr.press/v235/ethayarajh24a.html
- Hong, Lee and Thorne, “ORPO: Monolithic Preference Optimization without Reference Model,” arXiv, 2024. https://arxiv.org/abs/2403.07691
- Meng, Xia and Chen, “SimPO: Simple Preference Optimization with a Reference-Free Reward,” NeurIPS 2024. https://papers.neurips.cc/paper_files/paper/2024/hash/e099c1c9699814af0be873a175361713-Abstract-Conference.html
- Shao et al., “DeepSeekMath: Pushing the Limits of Mathematical Reasoning in Open Language Models,” arXiv, 2024. https://arxiv.org/abs/2402.03300
- DeepSeek-AI et al., “DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning,” arXiv / Nature, submitted 2025, revised 2026. https://arxiv.org/abs/2501.12948
- Yu et al., “DAPO: An Open-Source LLM Reinforcement Learning System at Scale,” arXiv, 2025. https://arxiv.org/abs/2503.14476
- DAPO project page, ByteDance Seed / Tsinghua AIR / HKU / SIA-Lab. https://dapo-sia.github.io/
- Liu et al., “Understanding R1-Zero-Like Training: A Critical Perspective,” arXiv, 2025. https://arxiv.org/abs/2503.20783
- Malik et al., “RewardBench 2: Advancing Reward Model Evaluation,” arXiv / ICLR 2026. https://arxiv.org/abs/2506.01937
- Hugging Face TRL documentation, accessed 2026-08-04. https://huggingface.co/docs/trl/en/index
- OpenRLHF documentation, “RL Training Guide,” accessed 2026-08-04. https://openrlhf.readthedocs.io/en/latest/agent_training.html
- Anthropic HH-RLHF dataset, Hugging Face, accessed 2026-08-04. https://huggingface.co/datasets/Anthropic/hh-rlhf/tree/main
- OpenBMB UltraFeedback repository, accessed 2026-08-04. https://github.com/OpenBMB/UltraFeedback
- AllenAI RewardBench repository, accessed 2026-08-04. https://github.com/allenai/reward-bench
- Tatsu Lab AlpacaEval repository, accessed 2026-08-04. https://github.com/tatsu-lab/alpaca_eval