所属: 训练推理平台层。目标: 在不从头学习语言的前提下,将基座模型的生成分布改造成更符合任务、偏好或可验证目标的策略。
#0. 先纠正分类:不是“监督到无监督”
| 名称 | 监督信号从哪里来 | 是否是无监督 |
|---|---|---|
| 预训练 | 原始文本自身的下一个 token | 自监督学习 |
| SFT | 人工/合成的输入—理想回答 | 监督学习 |
| 偏好优化 | 的成对偏好 | 弱监督/比较监督 |
| RLHF | 人类偏好训练的奖励模型 | 强化学习 + 人类反馈 |
| RLAIF | AI 生成的偏好或奖励 | 强化学习 + AI 反馈 |
| RLVR | 可执行验证器的正确/错误奖励 | 强化学习 + 可验证监督 |
结论: RLVR 不叫“无监督”。它摆脱的是人工逐条标注,不是摆脱监督信号;奖励仍由答案检查器、单元测试、编译器、定理验证器或规则系统提供。
#1. 符号说明与统一对象
| 符号 | 含义 |
|---|---|
| prompt / 问题 / 当前状态 | |
| 完整回答或行动轨迹 | |
| 回答的第 个 token、其前缀与回答长度 | |
| 当前语言模型策略 | |
| 冻结的参考策略,通常是 SFT 模型 | |
| 采样轨迹时使用的旧策略 | |
| 同一 下偏好胜出/失败回答 | |
| 奖励;可以来自人、AI 或验证器 | |
| 参数为 的奖励模型及其参数 | |
| 偏离参考模型的惩罚强度 | |
| SFT 数据集、示范回答、位置 的损失掩码 | |
| 监督微调损失、奖励模型损失 | |
| Logistic 函数,用于把分数差映射为偏好概率 | |
| 分布对 的 KL 散度 | |
| 当前算法用于采样 prompt 的训练分布或数据集 | |
| 对同一提示采样的回答组大小 | |
| 第 条回答的奖励与相对优势 | |
| PPO 与组内样本 的 token 级重要性比率 | |
| PPO 在第 个位置使用的优势估计 | |
| PPO/GRPO 的裁剪半径 | |
| GRPO 组内标准化时防止除零的微小常数 | |
| SimPO 的目标奖励间隔;在其他上下文可能有不同含义 | |
| ORPO 中长度归一化序列概率及其优势比 | |
| ORPO 中偏好项相对 SFT 项的权重 | |
| RLVR 中可程序验证的判定器 | |
| 正确性、格式与冗长奖励的组合权重 | |
| 正确性、格式与冗长三类奖励分量 | |
| DAPO 的非对称裁剪下、上半径 | |
| GFPO 的原始候选组与过滤后候选组 | |
| GFPO 对回答进行过滤或排序的度量 | |
| 各后训练算法的优化损失 | |
| SimPO 由策略对数概率构造的隐式奖励 | |
| GSPO 的序列级重要性比率 | |
| 组内奖励均值与标准差 |
序列概率由 token 概率相乘:
后训练始终在回答同一件事:怎样提高好回答的概率,并控制对原模型能力的破坏?
#2. 技术路线:每一步解决前一步的什么缺陷
- 在线优化:预训练 → SFT → 奖励建模 + PPO → 可验证奖励 + GRPO → DAPO / GSPO / GFPO。
- 离线偏好:SFT → DPO → ORPO / SimPO。
- 反馈来源:人类标注 → AI 反馈(RLAIF)→ 可验证反馈(RLVR)。
注意:RLAIF 是反馈来源的变化;RLVR 是奖励可验证性的变化;GRPO/DAPO/GSPO/GFPO 是在线 RL 优化器或采样机制的变化。它们不是严格单线替代关系。公开技术报告表明,部分推理模型会组合 SFT、偏好优化与可验证奖励强化学习,但不同模型的配方、阶段顺序和能力来源并不相同;对未公开完整训练细节的商业模型,不能仅凭产品能力反推其训练流水线。强化学习可以显著塑造推理行为,却不能笼统地称为所有模型推理能力的“主要来源”。
#3. 第一阶段:监督微调 SFT
#3.1 目标函数
给定示范数据如下:
- :loss mask;通常只训练 assistant token,不训练用户 prompt。
- 本质:行为克隆(behavior cloning),让模型模仿给定轨迹。
#3.2 解决了什么
- 将“补全文本”变成“理解指令—按格式回答”。
- 注入对话模板、输出格式、领域术语和基本工具调用格式。
- 训练稳定、实现简单、样本效率通常高于在线 RL。
#3.3 新问题
- 每个 prompt 往往只有一个示范;没有表达“多个答案中哪个更好”。
- 只能模仿数据平均行为,不能直接优化人类偏好或最终任务成功率。
- 合成示范质量、长度和风格会被直接蒸馏。
#3.4 数据规模与配比的工程实践
现代 SFT 的数据规模在 1M–10M 量级。Nemotron 3 Super 从 40M 样本的语料中筛选出 7M 高质量样本用于 SFT。数据筛选的核心维度包括:指令多样性、回答质量、任务覆盖面和格式规范性。SFT 数据的长度分布直接影响模型的输出风格——若示范回答普遍较长,模型倾向于生成冗长输出。
因此出现: 成对偏好学习与奖励建模。
#4. 偏好建模:把“更好”变为可学习信号
#4.1 Bradley–Terry 偏好模型
令奖励模型为 ,成对偏好概率定义为:
奖励模型损失:
#4.2 解决了什么
- 标注者不必写理想答案,只需比较候选。
- 奖励可为未见过的模型回答打分。
- 支持在线 RL:策略生成新回答,奖励模型给分。
#4.3 新问题
- 人类偏好昂贵、主观且可能互相冲突。
- 奖励模型可能被策略“钻空子”(reward hacking)。
- 奖励模型、价值模型、策略模型同时训练,显存与工程复杂度高。
因此出现两条路线: 离线直接偏好优化;或将反馈来源从人扩展到 AI/验证器。
#5. RLHF:奖励模型上的在线策略优化
#5.1 KL 正则化目标
- 第一项:偏向高奖励回答。
- KL 项:防止策略为投机奖励而偏离语言能力、格式或安全边界。
#5.2 PPO 的近端更新
定义如下:
- :优势估计,表示该动作比当前基线好多少。PPO 使用广义优势估计(GAE)配合学习到的价值函数 来估计状态价值。
- clip:阻止一次更新把策略推得过远。
#5.3 优势与缺陷
| 解决的问题 | 新问题 |
|---|---|
| 能直接优化在线生成答案的奖励 | 要维护 actor、reference、reward、critic 等多个模型 |
| 能发现离线偏好数据没覆盖的新轨迹 | on-policy rollout 成本高 |
| KL 防止策略突变 | critic/value 训练可能不稳定,显存开销大 |
PPO 的全局基线和单轨迹优势估计在长上下文和稀疏奖励场景中方差较大,这直接推动了 GRPO 的提出。
#6. RLAIF:把“人类反馈”扩展为“AI 反馈”
#6.1 位置
候选回答 → 强 LLM / 宪法规则评价 → AI 偏好或奖励 → 奖励模型 / 直接奖励 → RL 或偏好优化。
#6.2 原理
RLAIF 的优化器可以仍是 PPO,也可以是其他 RL;变化是偏好标签 或 的产生方式。反馈来源的演进关系可写成一行:human label → AI judge / constitutional critique。它是监督来源变化,不是优化公式。
#6.3 优势与缺陷
| 优势 | 缺陷 |
|---|---|
| 可扩到大量偏好数据 | 继承 judge 的偏差、盲点与格式偏好 |
| 可用规则/宪法明确约束无害性 | judge 与被训模型同质时,错误相关性高 |
| 可与少量人类数据混合校准 | “AI 说更好”不等于真实用户更偏好 |
原始论文: RLAIF: Scaling Reinforcement Learning from Human Feedback。
#7. DPO:绕过显式奖励模型的离线偏好优化
#7.1 核心重参数化
在 KL 正则化 RL 的最优条件下,隐式奖励可写为策略相对参考模型的对数比。DPO 直接最小化:
DPO 于 2023 年提出,是后训练方法演进的范式转折点:它证明了偏好对齐可以完全跳过显式奖励建模和在线 RL。
#7.2 解决了什么
- 不训练单独奖励模型。
- 不进行在线 rollout;只使用离线偏好对。
- 比 PPO/RLHF 更简单、显存更低、训练更稳定。
#7.3 新问题
- 强依赖离线偏好数据覆盖;难以纠正策略当前会生成的新错误。
- 需要 reference model 前向计算。
- 序列总 log-probability 会受回答长度影响。
因此出现: ORPO、SimPO 等参考模型自由或长度归一化的直接偏好方法。
#8. ORPO:SFT 与偏好目标合并
#8.1 核心思想
ORPO 不再先 SFT、再偏好优化,也不需要 reference model。论文先定义回答的长度归一化似然 ,再用它构造 odds:
目标由 SFT 项和 odds-ratio 偏好项组成:
#8.2 解决了什么
- 移除 reference model,减少显存和计算。
- 将“学会回答”和“偏向好回答”合并为单阶段目标。
- 对小/中模型的偏好微调更轻量。
#8.3 新问题
- 仍是离线偏好学习,不能获得在线探索收益。
- odds 近似与超参数 对不同数据分布敏感。
- 长度偏置和偏好数据质量并未自动消失。
原始论文: ORPO。
#9. SimPO:长度归一化的无参考偏好奖励
#9.1 隐式奖励
SimPO 用平均 token log-probability 定义奖励:
带目标 margin 的损失:
#9.2 解决了什么
- 不需要 reference model。
- 归一化减弱累计 log-probability 随长度增长而更负造成的比较偏差。长度归一化是 SimPO 最重要的组件:移除它会产生长回答偏好。
- margin 强制赢家和输家拉开足够差距。SimPO 在 AlpacaEval 2 LC 上比基线高出 3.6–4.8 分,且比 DPO 快约 20%、轻约 10%。
#9.3 新问题
- 长度归一化并不等于完全消除长度偏好;任务本身可能需要长推理。
- 需要随任务和长度分布调节。
- 同样受限于离线偏好对与 judge 偏差。
原始论文: SimPO。
#10. RLVR:可验证奖励推动推理训练
#10.1 奖励来源
数学、代码、定理证明、结构化查询等任务存在检查器 :
也可加入格式、长度、工具合法性等可验证项:
#10.2 解决了什么
- 不依赖人类或 AI judge 的主观打分。
- 结果可自动规模化标注。
- 对有确定正确性的任务,奖励噪声通常更低。RLVR 的训练动态分析表明,它从训练早期就开始激励正确的推理行为,推理质量的提升在训练过程中持续积累。
#10.3 新问题
- 最终答案奖励稀疏:错误轨迹几乎都得到 。
- 模型可能利用检查器漏洞,或只学会输出格式。
- 仅适用于可可靠验证的任务;开放式写作、伦理判断没有天然 checker。
- 正确最终答案不保证推理过程可靠或可读。
因此出现: group-based 相对优势、动态采样、长度控制和更稳定的重要性比率。
#11. GRPO:用组内相对奖励替代 critic
#11.1 组内优势
对同一个 prompt 采样 个回答 (通常从下式所示数值起,最高可到 ),得到奖励 :
GRPO 由 DeepSeekMath 在 2024 年提出,通过组级奖励统计构造相对优势,不再训练独立的 critic/value model。由此可以省去 critic 的参数、梯度和优化器状态,但显存节省比例取决于 actor/reference 是否共享、优化器、ZeRO/FSDP 分片方式以及 rollout 缓冲区,不能把“约 50%”视为固定结论。
#11.2 优化目标
#11.3 解决了什么
- 不训练 critic/value model,降低 PPO 的显存负担。
- 同题多采样构造相对基线;适合只有最终奖励的推理任务。
- 可将可验证奖励直接用于在线 RL。理论分析表明 GRPO 的策略梯度是一个 U-统计量,在渐近意义上等价于一个具有理想价值函数的 oracle 算法,并非仅仅是经验性的工程技巧。
#11.4 新问题
- 若同组奖励全相同(全对或全错),则下式成立,这一题没有学习信号,优势坍缩为零。
- token 级 importance ratio 与长序列/MoE 下的更新稳定性可能较差。
- 多采样提高训练期 rollout 成本。
- 可能奖励更长、更冗余的思维链。
原始论文: DeepSeekMath / GRPO。
#12. DAPO:解决 GRPO 的采样与长度稳定性
#12.1 四个关键设计
| 设计 | 解决的问题 |
|---|---|
| Clip-Higher | 正优势样本的更新上界过紧,探索不足 |
| Dynamic Sampling | 全对/全错组没有优势信号,浪费 rollout |
| Token-level policy gradient loss | 长短回答对样本权重不合理 |
| Overlong reward shaping | 通过无效拉长推理换奖励 |
#12.2 非对称裁剪
直觉:对有正优势的好轨迹,允许更充分提高其概率;对负向更新保持更谨慎。DAPO 在 AIME 2024 上达到 50% 准确率,较朴素 GRPO 实现 67% 的相对提升。
#12.3 新问题
- 仍基于 token 级比率,长序列重要性估计问题没有从定义上消失。
- 动态采样改变了训练样本分布,需防止只学习“刚好难”的题。
- 长度 shaping 的权重错误会压制真正需要长推理的题。DAPO 减少的 KL 正则化可能导致策略偏差过大。
原始论文: DAPO。
#13. GSPO:将重要性比率提升到序列级
#13.1 动机
GRPO 常将策略比率写在 token 级:
长回答会积累大量局部比率,更新噪声会被放大;MoE 的 token 路由变化也会加剧不稳定。超稀疏 MoE 模型中,专家路由在更新之间会翻转,这会破坏 token 级 GRPO 的稳定性。
#13.2 序列级比率
GSPO 以序列似然比的几何平均构造序列尺度的比率:
进行长度归一化以降低方差并统一 的数值范围。然后对 作序列级裁剪、奖励和优化,而不是让每个 token 独立承担 clip。一旦推导出序列级重要性比率,GSPO 的训练目标就与 GRPO 几乎相同:对序列级比率应用截断,使用相同的优势,并在序列级别取截断目标与未截断目标的最小值。
#13.3 解决了什么
- 更新单位与“完整回答获得一个最终奖励”的粒度更一致。
- 改善长序列和 MoE RL 的稳定性。GSPO 的序列级比率是 MoE 模型的更安全默认选择。
- 简化部分 RL 基础设施的实现边界。
#13.4 新问题
- 序列平均化弱化了 token 级细粒度归因。
- 长度规范化可能使模型对“应当写得更长的困难题”不敏感。
- 仍需高成本在线采样,且依赖奖励质量。
原始论文: GSPO。
#14. GFPO:用组过滤抑制推理长度膨胀
#14.1 动机
RLVR/GRPO 可能奖励“多写一些 token”,因为更长轨迹有更多机会碰到正确答案或格式。GFPO 先对每题采样更大的候选组 ,再用目标属性选择其中 条:
随后在保留组 上用奖励计算组内相对优势,对未选轨迹不施加策略梯度。GFPO 将 GRPO 的长度膨胀削减高达 85%(STEM 和编码基准,AIME 24/25、GPQA、Omni-MATH、LiveCodeBench),同时保持准确率。训练时间仅增加约 7%,端到端延迟降低 30%,困难查询的响应时间减少约 90 秒。
#14.2 解决了什么
- 通过训练期更多采样,筛出正确且更高 token efficiency 的轨迹。
- 减少“正确但冗长”的思维链被持续强化。
- 将一部分计算从推理期转移到训练期。留存响应的百分比 可控制长度压力:降低 或提高 会进一步缩短长度。
#14.3 新问题
- 过滤规则本身构成新的偏好函数;错设会奖励过短答案。
- 更大组采样增加训练时 rollout 成本。
- 对难题,正确短轨迹可能不存在,不能机械惩罚长度。GFPO 进一步提出 Adaptive Difficulty GFPO,为更困难的问题分配更多训练探索,在效率-准确率权衡上表现更好。
原始论文: GFPO。
#15. 方法关系:不要混为一张“算法排行榜”
| 类别 | 方法 | 它改变什么 | 主要适用场景 |
|---|---|---|---|
| 示范学习 | SFT | 训练信号:标准答案 | 指令、格式、领域行为 |
| 离线偏好 | DPO、ORPO、SimPO | 从偏好对直接更新策略 | 高质量离线偏好数据 |
| 反馈来源 | RLHF、RLAIF | 人类 vs AI 产生偏好/奖励 | 开放任务、主观质量 |
| 奖励来源 | RLVR | checker 产生正确性奖励 | 数学、代码、可验证工具任务 |
| 在线优化器 | PPO、GRPO、DAPO、GSPO | 如何估计优势、裁剪和更新 | 在线 rollout RL |
| 轨迹效率 | GFPO | 过滤哪些组内轨迹参与学习 | 抑制冗长推理 |
演进逻辑的一行总结: PPO 需要 critic → GRPO 用组内均值替代 critic → DAPO 用非对称裁剪和动态采样修复 GRPO 的稳定性 → GSPO 把比率提到序列级以修复 MoE 和长序列的不稳定 → GFPO 在 GRPO 基础上过滤冗余轨迹以控制推理长度。每一步的动机都来自前一步在某个具体场景下的失败模式。
#16. 选择逻辑
| 已有条件或观察 | 优先比较的路线 |
|---|---|
| 有标准示范 | SFT |
| 只有偏好对、在线预算有限 | DPO / ORPO / SimPO |
| 需要在线探索,且奖励可学习 | RLHF / RLAIF + PPO 或 GRPO 类方法 |
| 答案可由程序可靠检查 | RLVR + GRPO / DAPO / GSPO |
| RL 后推理明显变长 | 先检查奖励设计,再比较 GFPO 或长度约束 |
| 长序列或 MoE 更新不稳 | 比较 GSPO 等序列级更新 |
#17. 评估时必须分开报告
- 正确率:最终答案是否正确。
- Pass@K:采样多次是否至少有一条正确轨迹。
- 过程正确性:中间推理是否有效,不只看最终答案。
- 长度/成本:平均输出 token、推理延迟、token efficiency。
- 通用能力保持:RL 后是否遗忘指令遵循、语言质量或安全性。
- 奖励一致性:reward/judge 与人工或真实 checker 的一致程度。
#18. 与相邻模块的分工
- 预训练解释基座能力形成,CPT/DAPT 仍使用原始 token 的自监督目标;本页解释之后的行为与奖励优化。
- 标注与偏好数据解释反馈如何被生产、校准和质检;本页只负责优化算法。
- 分布式训练与显存解释在线 rollout、参考模型、奖励模型与优化器状态为何耗资源。
- 推理时计算解释训练完成后如何采样、搜索和验证;训练出的长链推理能力仍须扣除推理预算比较。
- 评测与污染解释正确率、Pass@K、长度和污染如何影响方法比较。
#原始资料
- Post-Training in 2026: GRPO, DAPO, RLVR & Beyond
- Large Language Models Post-training: Surveying Techniques from Alignment to Reasoning
- Reinforcement Learning for LLM Post-Training: A Survey
- DeepSeekMath / GRPO
- DAPO
- GSPO: Towards Scalable Reinforcement Learning for Language Models
- GFPO: Sample More to Think Less
- SimPO
- ORPO
- RLVR Implicitly Incentivizes Correct Reasoning