知识库 / 数据治理
GitHub
← 数据治理

LAYER 02 / DATA ENGINEERING

质量过滤、数据配比与课程学习

所属: 数据治理层。本页边界: 不同来源和难度的数据怎样共同决定模型能力与遗忘。

#核心公式

ptrain(x)=∑kwkpk(x),∑kwk=1 p_{\mathrm{train}}(x)=\sum_k w_k p_k(x),\qquad\sum_k w_k=1

#符号说明

符号 含义 单位/条件
pk(x)p_k(x) 第 kk 个来源、语种或任务域的数据分布 概率分布
wkw_k 训练时选择第 kk 个分布的抽样权重 wk≥0w_k\ge0
ptrain(x)p_{\mathrm{train}}(x) 实际训练时看到的混合分布 概率分布
q(x)q(x) 过滤器给样本 xx 的质量分 依评分器定义
τ\tau 质量过滤阈值 与 qq 同量纲
ℓθ(x)\ell_\theta(x) 模型参数与样本分别为 θ, x\theta,\ x 时的损失 标量
wk(t)w_k(t) 课程学习中随训练步 tt 变化的来源权重 [0,1][0,1]
w^k\hat w_k 按实际消费 token 统计的来源曝光比例 [0,1][0,1]
Dτ\mathcal D_\tau 质量分不低于阈值 τ\tau 的保留样本集合 数据集
g, ∇θℓθ(x)g,\ \nabla_\theta\ell_\theta(x) 随机梯度及样本 xx 对参数的梯度贡献 梯度向量
tt 训练步编号 非负整数

必须说明 wkw_k 按文档、样本还是 token 计数;三种口径并不等价。

#技术要点

  • 质量分可来自规则、分类器、困惑度或模型 judge。FastText 分类器是当前主流方案,训练成本低、推理速度快,适合 Web 规模数据。
  • 配比权重 wkw_k 决定不同语种、代码、数学和领域数据的曝光。DoReMi 和 RegMix 提供了系统化的配比优化方法。
  • 课程学习改变不同难度样本的时间顺序。FRAME 将预训练划分为四个象限阶段,按 PPL 和 PPL 差分组织数据。
  • 质量模型也会引入自己的偏好和盲点。基于分类器的过滤(CQF)提高下游任务表现但不一定提升语言建模能力。
  • 数据配比可通过缩放律建模,BIMIX 以平均相对误差小于 0.2% 的精度预测混合性能。
  • 稀缺目标数据在混合训练中的最优重复次数为 15–20 次,远高于单源训练的约 4 次上限。
  • 多阶段预训练中,先高 PPL 后低 PPL、先低 PD 后高 PD 的四象限组织可带来约 16.8% 的平均性能提升。

#原理与演进

#过滤与配比是两个不同旋钮

  • 过滤决定样本是否进入候选集合:乱码、广告、损坏文档可通过规则处理;语言、可读性和事实性需要更谨慎的估计。
  • 配比决定候选集合的曝光次数。公式中 pk(x)p_k(x) 是第 kk 类数据分布,wkw_k 是抽样比例;同一数据不变,改变 wkw_k 就会改变训练目标。
  • 以困惑度过滤只保留“模型容易读”的文本,可能丢掉新知识、低资源语言和专业术语;模型 judge 也有同类偏好。

#课程学习改变时间顺序

pt(x)=∑kwk(t)pk(x) p_t(x)=\sum_k w_k(t)p_k(x)
  • 静态混合让 wkw_k 固定;课程学习让它随训练步 tt 改变,例如先稳定学习常见结构,再增加长文本或难题。
  • 优点:可能降低早期优化不稳定,或把训练预算集中到当前薄弱能力。
  • 新问题:后期数据过窄会遗忘通用能力;效果需与相同 token 预算的随机混合比较,不能仅与更少数据的基线比较。

关联: 数据来源定义有哪些分布;预训练讨论这些分布如何形成能力。

#1. 质量过滤的具体技术

#1.1 规则过滤:确定性坏样本的识别

C4 启发式规则和 Gopher 规则是规则过滤的两个经典参考。规则过滤只处理高确定性的坏样本,不尝试判断“质量高低”。

C4 启发式规则(Raffel et al., 2020):

  • 只保留以标点符号结尾的行。
  • 丢弃少于 3 个词的页面。
  • 丢弃包含任何“不良词”的页面。
  • 丢弃代码行占比过高的页面。
  • 丢弃包含 lorem ipsum 的页面。

Gopher 规则(Rae et al., 2021):

  • 词数在 50–100,000 之间。
  • 平均词长在 3–10 个字符之间。
  • 符号与词的比例低于 0.1。
  • 以省略号结尾的行占比低于 0.1。
  • 80% 以上的词包含至少一个字母字符。

规则过滤的优点是透明、可复现、计算成本低;缺点是依赖人工构建的先验规则,泛化能力弱,且对代码、数学符号等特殊内容容易误伤。

#1.2 基于 FastText 的分类器过滤

FastText 分类器是当前 Web 规模数据质量过滤的主流方法。相比 BERT 或 DeBERTa 分类器,FastText 的训练和推理成本低 1–2 个数量级,适合对数万亿 token 的语料做全量打分。

训练数据的构造。 GneissWeb 的工作展示了典型流程:使用 40 万份文档训练分类器,正负样本各半。正样本包含 19 万份从 Cosmopedia 合成的文档和 1 万份经 Mixtral-8x22B 标注为高教育价值的文档;负样本为 20 万份被标注为低教育价值的文档。

FastText 的训练参数。 BETR 工作给出了具体设置:学习率 0.1,嵌入维度 100,上下文窗口 5,训练 5 个 epoch,最小词频阈值 1,使用 bi-gram 特征(word Ngrams=2),softmax 损失函数,固定随机种子 42。

DCLM 的 FastText 方案。 DCLM 使用 FastText 分类器评估样本与 SFT 数据的相似性,这一思路被广泛沿用。PreSelect 方法的创新在于用 FastText 作为预测强度的代理模型,只需训练一个 FastText 评分器就可以减少 10 倍的计算需求。

PreSelect 的预测强度概念。 该方法将数据筛选转化为对模型能力的贡献评估:对多个模型(在 benchmark 上得分满足式(1)),计算这些模型在数据集 dd 上的归一化 loss 排序与 benchmark 得分排序的一致性。当预测强度满足式(2)时,两种排序完全一致,说明该数据对下游任务的作用强。根据预测强度高低筛选数据,优先保留那些使不同模型在 benchmark 上的得分排序与在数据上的 loss 排序更一致的数据。

式(1):

S1<S2<⋯<SN S_1 < S_2 < \dots < S_N

式(2):

S=1 S=1

DeBERTa 分类器。 当计算预算允许时,DeBERTa-v3-base 可作为更精确的质量分类器。典型配置为最大序列长度 512 token,学习率 2×10−52 \times 10^{-5},AdamW 优化器,cosine 学习率调度(6% warmup),FP16 精度,训练 2 个 epoch。训练数据按三个质量类别分层:高质量(Nemotron-CC HQ、Ultra-FineWeb、FineWeb-Edu)、中等质量(DCLM)、低质量(垃圾内容、低留存率页面)。

#1.3 可读性评分

可读性评分是基于文本统计量的公式,用于评估文本的易读程度。GneissWeb 比较了多种可读性评分公式(Flesch-Kincaid、ARI、Gunning Fog、McAlpine-EFLAW),发现 McAlpine-EFLAW 效果最佳。该评分的计算方式为:(词数 + 迷你词数)/ 句子数,数值越低表示文本越容易理解。相比其他评分公式局限于估算文本的年级水平,McAlpine-EFLAW 产生的是面向全球受众的数值评分,更适合文档质量标注。

#1.4 CQF 的悖论

基于分类器的质量过滤(CQF)一致地提升下游任务表现,但不一定提升在高质量数据集上的语言建模能力。原因在于 CQF 隐式地过滤了高质量数据集本身——分类器在高质量数据集上训练,倾向于保留与训练数据风格相似的样本,可能排除高质量但风格不同的文本。【DataComp-LM】

#1.5 过滤信号的选择

信号 能较好发现 容易误伤
编码/规则 乱码、空文档、模板噪声 代码符号、数学记号
语言识别 明显错语种或混乱文本 混合语言与低资源语言
困惑度 模型极难预测的异常文本 新知识、专业术语
FastText 分类器 低质量写作或不合任务内容 与评分模型风格不一致的优质文本
可读性评分 难读的低质量文档 专业术语密集但高质量的技术文档
LLM judge 教育价值、事实性、有害性 与评分模型风格不一致的优质文本

#2. 阈值选择是一项分布决策

设样本质量分数为 q(x)q(x),阈值为 τ\tau,保留样本集合:

Dτ={x∈D:q(x)≥τ}. \mathcal D_{\tau}=\{x\in\mathcal D:q(x)\geq\tau\}.
  • 阈值升高通常提高平均评分,却减少样本量与覆盖;不存在对所有领域都最佳的 τ\tau。
  • 需分别观察代码、数学、口语、方言与专业文档的保留率;全局平均值可能掩盖少数类被清空。
  • 评分与训练目标相关,但最终判断应来自固定计算预算下的模型效果,而非评分器自身分数。
  • 质量与多样性的冲突:过滤器若倾向规范书面语,会减少口语、方言、低资源语言和罕见专业术语。短期验证损失可能下降,但模型在这些少数场景的泛化下降。应检查每个子群的保留率、事实错误率、毒性/隐私风险与下游能力,而非将所有文本压成一个“质量分”。

#3. 数据配比怎样进入梯度

下式表示每步先按 wkw_k 选来源,再从该来源采样。对应期望梯度:

ptrain(x)=∑kwkpk(x) p_{\mathrm{train}}(x)=\sum_k w_kp_k(x) E[g]=∑kwk Ex∼pk[∇θℓθ(x)]. \mathbb E[g]=\sum_k w_k\,\mathbb E_{x\sim p_k}[\nabla_\theta\ell_\theta(x)].
  • 因此改 wkw_k 实际上改变了各类样本对参数更新的权重。
  • 原始语料占比不等于训练曝光占比:可以重采样小语料,但重复太多会记忆与过拟合。
  • wkw_k 总和为 1;若按 token 而非文档抽样,长文档与短文档的真实曝光方式也不同。

#3.1 按文档采样与按 token 采样不等价

若来源 kk 有文档集合 DkD_k,按文档均匀采样会让短文档与长文档出现概率相同,但每次输入的 token 数不同。按 token 统计训练贡献时,来源实际曝光比例应以进入训练的 token 数计算:

w^k=∑x∈Dknseen(x) ∣τ(x)∣∑j∑x∈Djnseen(x) ∣τ(x)∣ \hat w_k=\frac{\sum_{x\in D_k}n_{\mathrm{seen}}(x)\,|\tau(x)|}{\sum_j\sum_{x\in D_j}n_{\mathrm{seen}}(x)\,|\tau(x)|}

这与配置文件中的“文档比例”可能相差很大。Packing 和截断会进一步改变有效曝光:长文末尾如果经常被截断,原文虽被计入语料,却几乎不参与梯度。数据配比应报告训练实际消费的 token,而不只报原始文件大小。

#4. 数据配比的系统化方法

#4.1 从静态比例到自适应比例

方法 机制 解决旧问题 新问题
原样合并 按来源自然数量训练 实现简单 大来源压制小领域
手工重采样 指定 wkw_k 保证目标领域曝光 比例主观、重复增加
质量加权 高分样本采样更多 降低明显噪声 评分偏见被放大
DoReMi(Group DRO) 代理模型优化最差域超额损失 无需下游任务知识 代理与目标模型不一致
RegMix(回归) 小模型混合实验 + 回归预测 系统性搜索最优混合 线性模型可能欠拟合

#4.2 DoReMi:用 Group DRO 优化域权重

DoReMi(Domain Reweighting with Minimax Optimization)的核心思路是:使用一个小的代理模型(proxy model),通过分组分布鲁棒优化(Group DRO)来优化最差情况下的域超额损失,从而产生域权重,再用这些权重重新采样训练数据以训练更大的模型。

具体步骤:

  1. 训练参考模型。 使用初始域权重 α0\alpha_0(通常为均匀权重)训练一个小型参考模型。

  2. 训练代理模型。 以参考模型为起点,使用 Group DRO 目标训练代理模型。Group DRO 的目标是最小化最差域的超额损失(excess loss),即每个域的损失减去该域在参考模型上的损失。超额损失更直接地衡量了各域的训练难度差异。

  3. 提取域权重。 从训练好的代理模型中提取 DRO 权重作为最终的域混合比例。

  4. 重采样训练大模型。 用这些权重对数据集进行重采样,训练完整的模型。

实验数据:在 The Pile 上,DoReMi 在 280M 参数代理模型上设置域权重,用于训练 8B 参数模型(30 倍大)。相比默认的 Pile 域权重,DoReMi 将平均 few-shot 下游准确率提高了 6.5 个百分点,并以 2.6 倍更少的训练步数达到基线准确率。在 GLaM 数据集上,DoReMi 无下游任务知识的情况下,甚至匹配了在下游任务上调优的域权重性能。

#4.3 RegMix:将数据混合视为回归

RegMix 将数据混合选择建模为回归任务。其核心流程为:随机生成多种数据混合配置;用这些配置训练小的代理模型(1M 参数级别);用代理模型的性能(默认使用 Pile-CC 上的验证损失)拟合回归模型;用回归模型预测大规模训练的最优混合。

RegMix 的实现中训练了 768 个 TinyLlama-1M 代理模型,其中 512 个用于拟合回归模型,256 个用于验证。

RegMix-D 是 RegMix 的动态扩展。与 RegMix 选择单一静态混合不同,RegMix-D 通过代理训练轨迹动态调整混合比例。核心观察是:最优混合比例随训练进程变化——训练早期适合更多样化的数据,后期应增加高质量领域数据的比例。RegMix-D 将静态回归替换为基于训练轨迹的动态调整,在相同计算预算下优于静态混合。

#4.4 数据混合的缩放律

BIMIX 是数据混合的二元缩放律,同时建模域比例和数据量的联合缩放行为。BIMIX 在损失外推上的平均相对误差小于 0.2%,对未见混合的泛化满足下式。BIMIX 还建立了基于熵的度量作为数据混合的高效代理,提供了一种计算轻量的策略。

R2>0.97 R^2 > 0.97

数据约束下的混合缩放律。 Apple 的研究覆盖了 2000 多次训练运行,发现混合训练相比单源训练能容忍更高的重复率:稀缺目标语料可以重用 15–20 次,而单源训练中重复超过 4 次后收益急剧下降。最优重复次数取决于目标数据大小、计算预算和模型规模。研究者进一步提出了重复感知的混合缩放律,量化了重复目标 token 的递减价值和通用数据的正则化作用。

CMR 缩放律。 关键混合比(Critical Mixture Ratio, CMR)定义了在保持通用能力不显著退化前提下的最大领域数据混合比。CMR 随模型规模增大而提高(460M 模型约 29.76%,940M 模型约 34.89%),说明大模型能容忍更高比例的领域数据。

#5. 课程学习的具体策略

令 wk(t)w_k(t) 随训练步变化,便从静态混合变成课程。常见直觉是先让模型学稳定、常见结构,再增加难样本、长文或领域文本。

#5.1 基于影响力的课程学习

传统课程学习使用人工定义的难度指标(如句子长度、词汇复杂度),在语言模型预训练中效果有限。基于训练数据影响力的课程学习改变了这一点:用影响力分数估计每个训练样本对模型输出的影响,按影响力排序训练数据。

在 BabyLM 挑战赛上的实验表明:按训练数据影响力排序的课程学习,在多个 benchmark 上比随机顺序训练高出 超过 10 个百分点。这说明课程学习对语言模型预训练是有益的,前提是采用更以模型为中心的难度概念,而非人工定义的难度指标。

#5.2 FRAME:四象限多阶段预训练

FRAME(Four-quadRAnt Multi-stage prEtraining)将预训练数据按照两个维度划分为四个象限:困惑度(PPL) 和 PPL 差分(PD) 。PPL 衡量数据对当前模型的难度,PD 衡量数据在训练过程中损失下降的速度。四个阶段按以下顺序组织:

  1. 高 PPL 数据
  2. 低 PPL 数据
  3. 低 PD 数据
  4. 高 PD 数据

这一组织方式的核心发现是:高 PPL 数据后跟低 PPL 数据、低 PD 数据后跟高 PD 数据,都能导致损失显著下降两次。在 3B 模型上,FRAME 相比随机顺序在 MMLU 和 CMMLU 上平均提升 16.8%。

#5.3 EDCO:基于推理熵的动态课程

EDCO(Entropy-based Dynamic Curriculum Orchestration)针对领域微调场景,核心概念是推理熵:模型对训练样本的答案不确定性。与静态课程不同,EDCO 持续寻找模型仍然感到不确定的样本,用这些样本指导下一阶段训练。

EDCO 的三个组件:使用前缀 token 近似全序列熵的高效熵估计器;选择最高推理熵样本的熵基课程生成器;在选定课程上优化模型的训练器。在通信、医学和法律领域的实验中,EDCO 在 Qwen3-4B 和 Llama3.2-3B 上均优于传统课程策略,熵估计将计算时间减少 83.5% 同时保持高精度。

#5.4 多阶段预训练的数据配比

现代 LLM 预训练通常包含多个阶段,每个阶段使用不同的数据混合。SmolLM3 的实例展示了典型的多阶段设计:

  • 阶段 1:基础训练(8T token,4k 上下文):使用核心预训练混合数据,以 Web 数据为主。
  • 阶段 2:高质量注入(2T token,4k 上下文):引入更高比例的 FineMath4+ 和 Stack-Edu 等高质量数据。
  • 阶段 3:扩展上下文:增加长上下文训练数据。

数据分布在阶段间的变化也很显著。FRAME 的实验展示了四个阶段的数据配比:通用数据从 79.4% 逐步降至 17.0%,代码数据从 12.0% 增至 25.2%,数学数据从 8.6% 增至 25.3%,指令微调数据在第四阶段从 0% 增至 32.5%。

#6. 评估数据决策的最小实验

  1. 固定模型架构、总 token、训练算力与评测集。
  2. 每次只改一个因素:过滤阈值、配比或课程顺序。
  3. 同时看目标任务、通用能力、低资源类别和记忆/污染。
  4. 报告保留文档数、实际曝光 token 数与来源分布。
  5. 对配比实验,报告 wkw_k 的口径(文档/token)和实际曝光 w^k\hat w_k。
  6. 对课程实验,报告与相同 token 预算随机混合基线的对比。

边界: 本页解释样本怎样被选中;标签如何产生见标注与反馈,训练目标见预训练。

#原始资料

本页由仓库中的 Markdown 生成。具体技术结论请结合正文引用与实验条件理解。

输入关键词,探索整个知识库

↑ ↓ 选择 ↵ 打开36 篇笔记,一次搜索