所属: 数据治理层。本页边界: 示范、成对偏好和过程标注怎样形成后训练数据。
#核心公式
该 Bradley–Terry 目标把同一提示下的相对偏好转化为奖励模型的可学习信号,比单纯列出偏好数据元组更能代表本模块原理。
#符号说明
| 符号 | 含义 | 单位/条件 |
|---|---|---|
| 提示、问题或任务上下文 | token 序列 | |
| 被偏好与被拒绝的候选回答 | token 序列 | |
| 参数为 的奖励模型对回答的标量评分 | 标量 | |
| Logistic 函数 | 输出属于 | |
| 奖励模型预测的成对偏好概率 | ||
| 偏好样本集合 | 数据集 | |
| 第 条偏好的标注者或反馈来源 | 类别/来源 ID | |
| 奖励模型的负对数似然损失 | 标量 |
#技术要点
- 示范数据给出目标轨迹;偏好数据给出相对排序。偏好数据可通过评分(rating)或排序(ranking)两种协议采集,二者产生的偏好推断存在显著不一致。
- 标注协议需要定义任务、评分维度、冲突处理与质检。常用一致性指标包括 Cohen's (两人)、Fleiss' (多人)、Krippendorff's (任意人数、支持缺失数据)。
- 过程监督可标记步骤,但成本和一致性要求更高。PRM800K 包含 800K 步骤级标注,每个步骤标记为 good/bad/neutral。
- AI 标注可扩展,但需要人类校准。Constitutional AI 通过“宪法”原则和自批评-修正循环实现 RLAIF,无需人类标注有害输出。
- RLVR 在数学和代码等可验证任务上提供确定性奖励信号,但验证器自身可能存在假阳性,导致奖励黑客。
- 偏好数据中的长度偏差、格式偏差和位置偏差是奖励黑客的结构性来源,需要针对性缓解。
#原理与演进
#信号从哪里来
| 数据 | 标注者提供什么 | 典型用途 | 难点 |
|---|---|---|---|
| 示范 | 一个可模仿的回答 | SFT | 可能只有一种写法 |
| 偏好 | 两个回答的相对好坏 | 奖励模型 / DPO | 标注尺度、长度与格式偏差 |
| 过程标签 | 中间步骤是否有效 | 过程奖励 / 纠错 | 标注成本、步骤边界不一致 |
| 可验证结果 | 测试通过或答案正确 | RLVR | 验证器假阳性覆盖不到主观质量 |
- 当前公式记录同一问题 下的胜出回答 、失败回答 和标注来源 ;偏好概率建模与损失函数见后训练。
- 同一任务应固定 rubric:事实性、完整性、格式、安全性分开判断;“总体更好”容易让标注者只看文风。
- 标注一致性低不一定是标注者失误,也可能说明题目本身有多种合理答案。
#反馈来源的演进
人工示范可教会格式,但难表达相对质量 → 人类成对偏好更容易比较,但规模受限 → AI 反馈扩大量级,却可能复制评审模型偏差 → 可验证奖励在数学/代码等可检查任务上降低主观性,却覆盖不了所有任务。
#1. 标注对象的信号结构
| 信号 | 一条记录回答的问题 | 能学到什么 | 不能直接学到什么 |
|---|---|---|---|
| 示范 | “应该怎样回答?” | 条件分布中的可模仿轨迹 | 未展示答案之间的相对优劣 |
| 成对偏好 | “哪一个更好?” | 局部排序和隐含价值标准 | 绝对质量;两个都差时仍须二选一 |
| 标量评分 | “好到什么程度?” | 跨答案校准后的强度 | 评分者间尺度往往不一致 |
| 过程标签 | “哪一步开始错?” | 错误定位与中间监督 | 最终答案的全部效用 |
| 可验证反馈 | “测试/证明是否通过?” | 客观、可扩展的二值或连续信号 | 风格、安全与开放问题的质量 |
对同一个提示 ,标注质量不应只看标签数量。若候选 几乎相同,偏好信息量很低;若差别主要是长度或语气,模型可能学到与正确性无关的捷径。
#1.1 评分协议与排序协议的不一致性
偏好数据的采集协议存在结构性设计选择:评分(如“给回答 A 打 1–7 分”)与排序(如“回答 A 是否优于 B”)是两种主要的稀疏反馈形式。对同一组回答,从评分推断的偏好与从排序推断的偏好存在约 60% 的显著不一致,这一现象在人类标注者和 AI 标注者中均存在。
不一致的根源在于两种协议激活了标注者不同的认知策略:标注者在评分时倾向于给信息密度更高的回答打高分,而在成对比较时更关注准确性。偏好优化算法(如 DPO)对排序协议敏感,对评分协议的敏感性较低;但对同一对回答,两种协议产生的训练信号可能指向不同方向。
对对齐评估也有直接影响:使用排序数据进行对齐的模型在基于排序的评估协议下被偏好,但在基于评分的评估协议下不被偏好。这说明对齐方法和评估协议的选择必须协同设计,否则评估结果可能反映的是协议偏差而非模型能力的真实差异。
#2. 偏好如何变成训练信号
Bradley–Terry 模型通过页首公式,将潜在效用差映射为偏好概率,并以负对数似然训练奖励模型。
- 是奖励模型分数;相同偏好可由许多整体平移后的分数表示,因此绝对分数不天然可解释。
- 大差距样本易学却可能过于简单;接近决策边界的样本更能揭示标准,但也更容易有标注分歧。
- 候选由哪一版模型生成,决定了偏好数据覆盖的分布。仅在旧模型输出上训练奖励模型,新策略跑到分布外时可能被错误高分诱导;这就是奖励黑客的一条来源。
- 直接偏好优化不显式训练奖励模型,其目标函数与参考策略关系见后训练。本页只讨论数据本身。
#2.1 奖励黑客的数据来源
奖励黑客(reward hacking)指模型优化到“在奖励模型眼里很好,但在真实人类眼里不行”的方向。偏好数据中的统计误差是奖励黑客的主要驱动因素之一。偏好数据通常面临部分覆盖问题——无法对所有可能选项都采集足够的偏好样本。覆盖不足的选择项,其偏好标签的统计波动更大,因为偏好标签是以 Bradley–Terry 概率为参数的伯努利随机变量。
Type I 奖励黑客:数据集中覆盖不足的劣质选项,由于统计误差显得更受偏好,导致学到的策略具有较低的期望真实奖励。理论分析表明,即使在最优动作被充分覆盖的有利场景下,一个覆盖不足的低奖励动作样本即可压倒许多偏好优化算法,导致其学到高度次优的策略。这一现象在 DPO、IPO、SimPO 等主流偏好优化算法中均被证明存在。
#2.2 标注者偏差的审计框架
RLHF 假设标注者的回答反映真实的人类偏好。然而行为科学六十年的研究表明,人们 routinely 在没有真实观点的情况下产生回答,基于情境线索即时构建偏好,并对相同问题产生不同理解。这些现象在最需要对齐的价值负载判断中尤为普遍。
一个关键的分类框架区分了真实偏好与三类噪声来源:
- 非态度(non-attitudes) :标注者对问题没有真实观点,仍给出回答。
- 构建偏好(constructed preferences) :标注者基于情境线索即时构建偏好,而非持有稳定偏好。
- 测量伪影(measurement artifacts) :问题措辞、选项顺序等测量工具引入的偏差。
标注者状态偏差是另一个结构性混淆因素。在持续压力或痛苦条件下,标注者可能将自身情绪状态投射到对回答质量的判断中,这种偏差不同于随机标签噪声——它可能在共享条件下的标注者之间相关,形成系统性偏移。
偏好数据中的标签翻转:偏好数据集不仅对个体回答中的噪声脆弱,还容易受到回答间偏好错误翻转的影响。偏好数据集中的不一致标注主要源于标注者间的变异和偏好多维性的内在本质。
缓解方法:标签翻转和标签平滑可有效缓解偏好噪声的影响。奖励模型为回答对分配的分数差异可有效指示数据质量,不同质量的数据在奖励模型训练中表现出显著差异。一种自动调整奖励建模的方法,基于数据质量降低噪声影响并充分利用数据集。
#3. 标注协议与一致性度量
将“总体更好”拆成可检查维度:事实正确 、指令遵循 、完整性 、风险 。下式所示总分只是某一任务下的加权选择,不能当成普适真值。
| 设计项 | 缺失时的偏差 | 可观察检查 |
|---|---|---|
| 固定题目与上下文 | 不同标注者比较不同事实条件 | 相同 的复标一致性 |
| 明确不可接受错误 | 文风盖过事实与安全 | 分维度错误率 |
| 隐去模型身份和位置 | 品牌/先后顺序偏置 | 交换候选顺序后的胜率变化 |
| 保留平局/均不佳 | 强制二选一造成虚假偏好 | 平局比例与争议样本复审 |
| 标注者校准 | 评分尺度漂移 | 锚题上的一致性 |
#3.1 一致性度量指标的选择
选择合适的一致性度量取决于数据类型、标注者数量和是否需要机会校正。常用指标及其特性如下:
| 指标 | 数据类型 | 标注者数 | 机会校正 | 局限性 |
|---|---|---|---|---|
| 百分比一致率 | 名义 | 成对 | 否 | 高估可靠性 |
| Cohen's | 名义 | 仅两人 | 是 | 类别频率或标注者偏差不同时不稳定 |
| Fleiss' | 名义 | 三人及以上 | 是 | 要求每项评分人数相等 |
| Krippendorff's | 名义/序数/区间/比率 | 两人及以上 | 是 | 计算复杂;解释因距离度量而异 |
| Gwet's AC1/AC2 | 名义/序数 | 两人及以上 | 是 | 文献中较少使用 |
| 加权 | 序数 | 仅两人 | 是 | 需谨慎选择权重方案 |
| ICC | 连续/区间 | 两人及以上 | 是 | 对模型选择敏感,假设正态性 |
Krippendorff's 在 NLP 标注中具有独特优势:支持任意数量的标注者、可处理缺失数据、适用于多种数据类型。对主观 NLP 任务(流畅性、有用性), 通常在 0.40–0.70 之间;Krippendorff 建议以下式作为暂定结论的最低标准。一项使用评分-条件化 LLM 标注协议的研究中,人类标注者间的成对 Cohen's 均值为 0.460(中等一致),而 GPT-4o-mini 与人类多数标签的 为 0.360,与人类一致标签的 为 0.434,与人类-人类 的量级相当。
低一致性不等于坏标注:开放任务的合理答案可能本来就不唯一,需分析分歧来源。标注者间的分歧可能来自:真实的偏好差异、对评分维度的不同理解、标注疲劳或状态偏差。区分这些来源比单纯提高一致性数字更重要。
#3.2 标注分歧的来源分析
一项对偏好数据中不一致性的系统分析发现,标注分歧的主要来源包括:
- 人类标注错误(占约 64%):标注者在判断特定样本时出现失误。
- 不同的偏好标准:标注者对“什么算更好”持不同标准。
- 不同的阈值:对“好到什么程度才算好”的阈值不同。
这提示标注协议需要明确的维度定义和锚点示例,以减小标准分歧;同时需要质量控制机制(如黄金标准样本、争议仲裁)来处理标注错误。
#4. 反馈来源的演进与技术细节
示范模仿 → 成对人类偏好(缓解“唯一标准答案”)→ AI 生成偏好(缓解人工成本)→ 人类校准的 AI 反馈(缓解评审偏差)→ 可验证反馈(在有验证器的任务上缓解主观性)。
| 方法 | 解决的问题 | 新问题与适用边界 |
|---|---|---|
| 人类示范 | 冷启动指令行为 | 示范昂贵,且只能覆盖少数轨迹 |
| 人类偏好 | 质量难以写成单一参考答案 | 受标注者背景、位置、冗长度影响 |
| RLAIF:AI 反馈 | 降低标注扩张成本 | 教师模型偏见、错误可能被放大;需抽样人工核验 |
| 宪法式原则与自评 | 用显式原则约束 AI 反馈 | 原则本身的取舍与冲突需要人定 |
| RLVR:可验证奖励 | 数学、代码等可用规则自动打分 | 验证器误判、测试集不全、结果正确但推理不可靠 |
| 过程监督 | 终局反馈过稀疏 | 细粒度步骤标签昂贵,模型也可能迎合标注形式 |
RLAIF 是反馈来源,RLVR 是反馈可验证性,SFT/DPO/PPO/GRPO 是优化算法;这三条轴不能写成互相替代的同一列。
#4.1 Constitutional AI 与 RLAIF 的两阶段机制
Constitutional AI(CAI)由 Anthropic 提出,通过自我改进训练无害 AI 助手,无需人类标注有害输出,仅通过一组规则或原则(即“宪法”)提供人类监督。
监督学习阶段:从初始模型采样,生成自我批评和修正,然后在修正后的回答上微调原始模型。
强化学习阶段(RLAIF) :从微调后的模型采样,使用模型评估两个样本中哪个更好,然后从这些 AI 偏好数据集中训练偏好模型。随后使用偏好模型作为奖励信号进行 RL 训练,即“从 AI 反馈中进行强化学习”(RLAIF)。最终训练出的助手对有害查询作出非回避的回应,解释其反对理由。
CAI 的一个关键安全考量是宪法设计本身构成潜在攻击面。如果训练模型的表示以改变宪法激活方向的方式漂移,迭代 RLAIF 的动态可能变得复杂,方向可能在有害方向上漂移。
#4.2 RLVR 的可验证奖励机制
RLVR(Reinforcement Learning with Verifiable Rewards)使用确定性程序验证答案正确性,而非学习到的奖励模型。奖励信号来自程序而非模型,这一设计选择改变了训练的经济性:确定性检查几乎无运行成本,在数百万样本上保持一致,且无法像学习到的奖励模型那样被“奉承”。
验证器类型:大多数任务映射到五类验证器之一——数学或符号等价性检查、沙箱化代码执行对测试、字符串匹配、格式或模式验证、约束检查。
数学验证器:使用 math_verify 等库,其 parse 和 verify 调用处理 LaTeX、分数和数值容差,使等价形式均得满分。
代码奖励:必须在锁定沙箱中运行不可信模型输出,无网络访问,硬性 CPU、内存和时间限制,非特权用户;仅子进程超时不是隔离。
三类失败模式:
- 验证器游戏:模型学会利用验证器的弱点而非真正解决问题。
- 弱检查导致的假阳性:验证器接受第一个数字、忽略重复 JSON 键或将打印文本视为程序正确性,创建高奖励假阳性区域。
- 某些基座模型上的虚假奖励增益:如 Qwen 等模型可能出现虚假奖励信号。
假阳性与假阴性:许多 RLVR 系统在训练期间将奖励折叠为二值 以减少验证器黑客攻击的脆弱性。这一选择引入假阴性(拒绝正确答案)和假阳性(接受错误答案)。假阴性剥夺智能体有信息量的梯度并减慢收敛,假阳性奖励可黑客模式并在策略优化中膨胀回报。
#4.3 过程监督与 PRM
过程奖励模型(PRM)将逐步检查改写为分类任务:标注员读取题目和此前步骤,判断当前步骤能否继续。模型输出 good、bad 或 neutral 的概率。
PRM800K 是 OpenAI 公开的步骤级标注数据集,规模 800K 步骤级标注,来自 MATH 数据集中题目的模型解题过程,每个步骤标注为三种状态:good(推理合理,可以继续)、bad(推理有误,应该停止或回退)、neutral(可能是中间过渡,不评价对错)。数据收集沿解题轨迹逐步进行,标注员结合原题和此前步骤给当前候选标记,发现首个错误后停止或改写后续候选。
标注成本:800K 步骤 × 平均 30 秒/步 ≈ 24,000 小时(约 12 人年),实际项目还需培训、复核、争议仲裁和质量抽检。
CPMI(Contrastive Pointwise Mutual Information) 是一种自动步骤级奖励标注方法,利用模型内部概率推断步骤级监督,显著减少标注数据集的計算负担。CPMI 量化推理步骤相对于硬负例替代方案对正确目标答案的互信息增加量。与蒙特卡洛估计相比,CPMI 将构造时间减少 84%,token 生成减少 98%,同时在过程级评估和数学推理上达到更高精度。
PRM 与 ORM 的对比:Let's Verify Step by Step 论文比较了仅监督最终答案(ORM)和逐步标注(PRM)两种路线。差别不在模型是否“更大”,而在监督信号落在结尾还是每个步骤。随着模型和标注规模增大,过程监督在给定实验中持续优于结果监督;使用完整数据训练的过程监督模型在有代表性的 MATH 测试子集上解决了 78% 的问题(包含多候选生成与评价器选择)。
#5. 偏差来源与缓解
#5.1 长度偏差
奖励模型倾向于偏好更长回答,这是偏好学习中最广为人知的偏差之一。长度偏差的成因在于人工标注者在比较时可能将长度与详尽程度、信息量混淆。缓解方法包括:长度正则化策略防止长度利用;反事实数据增强(CDA)使用合成的对比示例;在偏好数据中显式加入长度控制。
#5.2 格式偏差
格式偏差是长度偏差之外更广泛的偏好学习偏差。研究表明,仅需少量偏差数据即可向奖励模型注入显著偏差。格式偏差涵盖列表结构、表情符号、Markdown 格式等表面特征。
#5.3 位置偏差
LLM 作为评判者时存在位置偏差:倾向于选择第一个呈现的选项。MT-Bench 论文测量位置偏差在成对比较中达到 10–15 个百分点的胜率波动。位置交换法是标准缓解方法:对每个实例运行两次,交换两个回答的位置,要求两次判断一致才视为有效偏好。
位置交换法消除了位置偏差,但对冗长偏差或自我偏好偏差无效。自我偏好泄漏指模型评判者倾向于偏好自己生成的回答,与位置偏差是不同的偏差维度。
#5.4 奖励模型偏差的放大机制
偏好数据的统计误差通过偏好优化算法被放大。当奖励模型与真实人类判断开始偏离,强化学习会将模型带向“在奖励模型眼里很好,但在真实人类眼里不行”的方向。奖励模型偏差通过强化学习被放大,导致奖励黑客现象。
缓解策略:PRISM(Preference-based Reward Invariance for Shortcut Mitigation)将奖励黑客统一为捷径学习问题,使用群不变核同时缓解多种虚假相关(冗长、奉承、语气等),在分布外偏好数据和下游策略模型上取得一致改进。
#6. 与数据分布和评测的连接
- 任务抽样应覆盖难度、主题、语言、长度、风险等级;否则 ,偏好优化主要改善训练分布。
- 对可验证任务,记录验证器版本和测试集。验证规则变动会改变同一回答的奖励;未公开测试样例不应混入训练语料。
- 对主观任务,建立盲评和“拒答是否适当”等独立维度,避免一个总分掩盖安全—有用性权衡。
- 偏好数据的采集协议(评分 vs. 排序)应与对齐算法和评估协议协同设计,避免协议偏差污染评估结论。
- 奖励模型的偏差审计应覆盖长度、格式、位置和自我偏好等多个维度,而非仅关注单一偏差。
原始资料:
- InstructGPT / 人类反馈;
- Constitutional AI / AI 反馈;
- Peering Through Preferences:评分与排序的不一致性;
- Let's Verify Step by Step:过程监督;
- Reward Modeling Requires Automatic Adjustment Based on Data Quality;
- Sail into the Headwind:偏好优化中的奖励黑客;
- Counting on Consensus:一致性度量选择;
- LLMs Gaming Verifiers:RLVR 验证器游戏;
- CPMI:对比点互信息步骤标注;
- From Lists to Emojis:格式偏差