所属: 数据治理层。本页边界: 不同来源和难度的数据怎样共同决定模型能力与遗忘。
#核心公式
#符号说明
| 符号 | 含义 | 单位/条件 |
|---|---|---|
| 第 个来源、语种或任务域的数据分布 | 概率分布 | |
| 训练时选择第 个分布的抽样权重 | ||
| 实际训练时看到的混合分布 | 概率分布 | |
| 过滤器给样本 的质量分 | 依评分器定义 | |
| 质量过滤阈值 | 与 同量纲 | |
| 模型参数与样本分别为 时的损失 | 标量 | |
| 课程学习中随训练步 变化的来源权重 | ||
| 按实际消费 token 统计的来源曝光比例 | ||
| 质量分不低于阈值 的保留样本集合 | 数据集 | |
| 随机梯度及样本 对参数的梯度贡献 | 梯度向量 | |
| 训练步编号 | 非负整数 |
必须说明 按文档、样本还是 token 计数;三种口径并不等价。
#技术要点
- 质量分可来自规则、分类器、困惑度或模型 judge。FastText 分类器是当前主流方案,训练成本低、推理速度快,适合 Web 规模数据。
- 配比权重 决定不同语种、代码、数学和领域数据的曝光。DoReMi 和 RegMix 提供了系统化的配比优化方法。
- 课程学习改变不同难度样本的时间顺序。FRAME 将预训练划分为四个象限阶段,按 PPL 和 PPL 差分组织数据。
- 质量模型也会引入自己的偏好和盲点。基于分类器的过滤(CQF)提高下游任务表现但不一定提升语言建模能力。
- 数据配比可通过缩放律建模,BIMIX 以平均相对误差小于 0.2% 的精度预测混合性能。
- 稀缺目标数据在混合训练中的最优重复次数为 15–20 次,远高于单源训练的约 4 次上限。
- 多阶段预训练中,先高 PPL 后低 PPL、先低 PD 后高 PD 的四象限组织可带来约 16.8% 的平均性能提升。
#原理与演进
#过滤与配比是两个不同旋钮
- 过滤决定样本是否进入候选集合:乱码、广告、损坏文档可通过规则处理;语言、可读性和事实性需要更谨慎的估计。
- 配比决定候选集合的曝光次数。公式中 是第 类数据分布, 是抽样比例;同一数据不变,改变 就会改变训练目标。
- 以困惑度过滤只保留“模型容易读”的文本,可能丢掉新知识、低资源语言和专业术语;模型 judge 也有同类偏好。
#课程学习改变时间顺序
- 静态混合让 固定;课程学习让它随训练步 改变,例如先稳定学习常见结构,再增加长文本或难题。
- 优点:可能降低早期优化不稳定,或把训练预算集中到当前薄弱能力。
- 新问题:后期数据过窄会遗忘通用能力;效果需与相同 token 预算的随机混合比较,不能仅与更少数据的基线比较。
关联: 数据来源定义有哪些分布;预训练讨论这些分布如何形成能力。
#1. 质量过滤的具体技术
#1.1 规则过滤:确定性坏样本的识别
C4 启发式规则和 Gopher 规则是规则过滤的两个经典参考。规则过滤只处理高确定性的坏样本,不尝试判断“质量高低”。
C4 启发式规则(Raffel et al., 2020):
- 只保留以标点符号结尾的行。
- 丢弃少于 3 个词的页面。
- 丢弃包含任何“不良词”的页面。
- 丢弃代码行占比过高的页面。
- 丢弃包含 lorem ipsum 的页面。
Gopher 规则(Rae et al., 2021):
- 词数在 50–100,000 之间。
- 平均词长在 3–10 个字符之间。
- 符号与词的比例低于 0.1。
- 以省略号结尾的行占比低于 0.1。
- 80% 以上的词包含至少一个字母字符。
规则过滤的优点是透明、可复现、计算成本低;缺点是依赖人工构建的先验规则,泛化能力弱,且对代码、数学符号等特殊内容容易误伤。
#1.2 基于 FastText 的分类器过滤
FastText 分类器是当前 Web 规模数据质量过滤的主流方法。相比 BERT 或 DeBERTa 分类器,FastText 的训练和推理成本低 1–2 个数量级,适合对数万亿 token 的语料做全量打分。
训练数据的构造。 GneissWeb 的工作展示了典型流程:使用 40 万份文档训练分类器,正负样本各半。正样本包含 19 万份从 Cosmopedia 合成的文档和 1 万份经 Mixtral-8x22B 标注为高教育价值的文档;负样本为 20 万份被标注为低教育价值的文档。
FastText 的训练参数。 BETR 工作给出了具体设置:学习率 0.1,嵌入维度 100,上下文窗口 5,训练 5 个 epoch,最小词频阈值 1,使用 bi-gram 特征(word Ngrams=2),softmax 损失函数,固定随机种子 42。
DCLM 的 FastText 方案。 DCLM 使用 FastText 分类器评估样本与 SFT 数据的相似性,这一思路被广泛沿用。PreSelect 方法的创新在于用 FastText 作为预测强度的代理模型,只需训练一个 FastText 评分器就可以减少 10 倍的计算需求。
PreSelect 的预测强度概念。 该方法将数据筛选转化为对模型能力的贡献评估:对多个模型(在 benchmark 上得分满足式(1)),计算这些模型在数据集 上的归一化 loss 排序与 benchmark 得分排序的一致性。当预测强度满足式(2)时,两种排序完全一致,说明该数据对下游任务的作用强。根据预测强度高低筛选数据,优先保留那些使不同模型在 benchmark 上的得分排序与在数据上的 loss 排序更一致的数据。
式(1):
式(2):
DeBERTa 分类器。 当计算预算允许时,DeBERTa-v3-base 可作为更精确的质量分类器。典型配置为最大序列长度 512 token,学习率 ,AdamW 优化器,cosine 学习率调度(6% warmup),FP16 精度,训练 2 个 epoch。训练数据按三个质量类别分层:高质量(Nemotron-CC HQ、Ultra-FineWeb、FineWeb-Edu)、中等质量(DCLM)、低质量(垃圾内容、低留存率页面)。
#1.3 可读性评分
可读性评分是基于文本统计量的公式,用于评估文本的易读程度。GneissWeb 比较了多种可读性评分公式(Flesch-Kincaid、ARI、Gunning Fog、McAlpine-EFLAW),发现 McAlpine-EFLAW 效果最佳。该评分的计算方式为:(词数 + 迷你词数)/ 句子数,数值越低表示文本越容易理解。相比其他评分公式局限于估算文本的年级水平,McAlpine-EFLAW 产生的是面向全球受众的数值评分,更适合文档质量标注。
#1.4 CQF 的悖论
基于分类器的质量过滤(CQF)一致地提升下游任务表现,但不一定提升在高质量数据集上的语言建模能力。原因在于 CQF 隐式地过滤了高质量数据集本身——分类器在高质量数据集上训练,倾向于保留与训练数据风格相似的样本,可能排除高质量但风格不同的文本。【DataComp-LM】
#1.5 过滤信号的选择
| 信号 | 能较好发现 | 容易误伤 |
|---|---|---|
| 编码/规则 | 乱码、空文档、模板噪声 | 代码符号、数学记号 |
| 语言识别 | 明显错语种或混乱文本 | 混合语言与低资源语言 |
| 困惑度 | 模型极难预测的异常文本 | 新知识、专业术语 |
| FastText 分类器 | 低质量写作或不合任务内容 | 与评分模型风格不一致的优质文本 |
| 可读性评分 | 难读的低质量文档 | 专业术语密集但高质量的技术文档 |
| LLM judge | 教育价值、事实性、有害性 | 与评分模型风格不一致的优质文本 |
#2. 阈值选择是一项分布决策
设样本质量分数为 ,阈值为 ,保留样本集合:
- 阈值升高通常提高平均评分,却减少样本量与覆盖;不存在对所有领域都最佳的 。
- 需分别观察代码、数学、口语、方言与专业文档的保留率;全局平均值可能掩盖少数类被清空。
- 评分与训练目标相关,但最终判断应来自固定计算预算下的模型效果,而非评分器自身分数。
- 质量与多样性的冲突:过滤器若倾向规范书面语,会减少口语、方言、低资源语言和罕见专业术语。短期验证损失可能下降,但模型在这些少数场景的泛化下降。应检查每个子群的保留率、事实错误率、毒性/隐私风险与下游能力,而非将所有文本压成一个“质量分”。
#3. 数据配比怎样进入梯度
下式表示每步先按 选来源,再从该来源采样。对应期望梯度:
- 因此改 实际上改变了各类样本对参数更新的权重。
- 原始语料占比不等于训练曝光占比:可以重采样小语料,但重复太多会记忆与过拟合。
- 总和为 1;若按 token 而非文档抽样,长文档与短文档的真实曝光方式也不同。
#3.1 按文档采样与按 token 采样不等价
若来源 有文档集合 ,按文档均匀采样会让短文档与长文档出现概率相同,但每次输入的 token 数不同。按 token 统计训练贡献时,来源实际曝光比例应以进入训练的 token 数计算:
这与配置文件中的“文档比例”可能相差很大。Packing 和截断会进一步改变有效曝光:长文末尾如果经常被截断,原文虽被计入语料,却几乎不参与梯度。数据配比应报告训练实际消费的 token,而不只报原始文件大小。
#4. 数据配比的系统化方法
#4.1 从静态比例到自适应比例
| 方法 | 机制 | 解决旧问题 | 新问题 |
|---|---|---|---|
| 原样合并 | 按来源自然数量训练 | 实现简单 | 大来源压制小领域 |
| 手工重采样 | 指定 | 保证目标领域曝光 | 比例主观、重复增加 |
| 质量加权 | 高分样本采样更多 | 降低明显噪声 | 评分偏见被放大 |
| DoReMi(Group DRO) | 代理模型优化最差域超额损失 | 无需下游任务知识 | 代理与目标模型不一致 |
| RegMix(回归) | 小模型混合实验 + 回归预测 | 系统性搜索最优混合 | 线性模型可能欠拟合 |
#4.2 DoReMi:用 Group DRO 优化域权重
DoReMi(Domain Reweighting with Minimax Optimization)的核心思路是:使用一个小的代理模型(proxy model),通过分组分布鲁棒优化(Group DRO)来优化最差情况下的域超额损失,从而产生域权重,再用这些权重重新采样训练数据以训练更大的模型。
具体步骤:
-
训练参考模型。 使用初始域权重 (通常为均匀权重)训练一个小型参考模型。
-
训练代理模型。 以参考模型为起点,使用 Group DRO 目标训练代理模型。Group DRO 的目标是最小化最差域的超额损失(excess loss),即每个域的损失减去该域在参考模型上的损失。超额损失更直接地衡量了各域的训练难度差异。
-
提取域权重。 从训练好的代理模型中提取 DRO 权重作为最终的域混合比例。
-
重采样训练大模型。 用这些权重对数据集进行重采样,训练完整的模型。
实验数据:在 The Pile 上,DoReMi 在 280M 参数代理模型上设置域权重,用于训练 8B 参数模型(30 倍大)。相比默认的 Pile 域权重,DoReMi 将平均 few-shot 下游准确率提高了 6.5 个百分点,并以 2.6 倍更少的训练步数达到基线准确率。在 GLaM 数据集上,DoReMi 无下游任务知识的情况下,甚至匹配了在下游任务上调优的域权重性能。
#4.3 RegMix:将数据混合视为回归
RegMix 将数据混合选择建模为回归任务。其核心流程为:随机生成多种数据混合配置;用这些配置训练小的代理模型(1M 参数级别);用代理模型的性能(默认使用 Pile-CC 上的验证损失)拟合回归模型;用回归模型预测大规模训练的最优混合。
RegMix 的实现中训练了 768 个 TinyLlama-1M 代理模型,其中 512 个用于拟合回归模型,256 个用于验证。
RegMix-D 是 RegMix 的动态扩展。与 RegMix 选择单一静态混合不同,RegMix-D 通过代理训练轨迹动态调整混合比例。核心观察是:最优混合比例随训练进程变化——训练早期适合更多样化的数据,后期应增加高质量领域数据的比例。RegMix-D 将静态回归替换为基于训练轨迹的动态调整,在相同计算预算下优于静态混合。
#4.4 数据混合的缩放律
BIMIX 是数据混合的二元缩放律,同时建模域比例和数据量的联合缩放行为。BIMIX 在损失外推上的平均相对误差小于 0.2%,对未见混合的泛化满足下式。BIMIX 还建立了基于熵的度量作为数据混合的高效代理,提供了一种计算轻量的策略。
数据约束下的混合缩放律。 Apple 的研究覆盖了 2000 多次训练运行,发现混合训练相比单源训练能容忍更高的重复率:稀缺目标语料可以重用 15–20 次,而单源训练中重复超过 4 次后收益急剧下降。最优重复次数取决于目标数据大小、计算预算和模型规模。研究者进一步提出了重复感知的混合缩放律,量化了重复目标 token 的递减价值和通用数据的正则化作用。
CMR 缩放律。 关键混合比(Critical Mixture Ratio, CMR)定义了在保持通用能力不显著退化前提下的最大领域数据混合比。CMR 随模型规模增大而提高(460M 模型约 29.76%,940M 模型约 34.89%),说明大模型能容忍更高比例的领域数据。
#5. 课程学习的具体策略
令 随训练步变化,便从静态混合变成课程。常见直觉是先让模型学稳定、常见结构,再增加难样本、长文或领域文本。
#5.1 基于影响力的课程学习
传统课程学习使用人工定义的难度指标(如句子长度、词汇复杂度),在语言模型预训练中效果有限。基于训练数据影响力的课程学习改变了这一点:用影响力分数估计每个训练样本对模型输出的影响,按影响力排序训练数据。
在 BabyLM 挑战赛上的实验表明:按训练数据影响力排序的课程学习,在多个 benchmark 上比随机顺序训练高出 超过 10 个百分点。这说明课程学习对语言模型预训练是有益的,前提是采用更以模型为中心的难度概念,而非人工定义的难度指标。
#5.2 FRAME:四象限多阶段预训练
FRAME(Four-quadRAnt Multi-stage prEtraining)将预训练数据按照两个维度划分为四个象限:困惑度(PPL) 和 PPL 差分(PD) 。PPL 衡量数据对当前模型的难度,PD 衡量数据在训练过程中损失下降的速度。四个阶段按以下顺序组织:
- 高 PPL 数据
- 低 PPL 数据
- 低 PD 数据
- 高 PD 数据
这一组织方式的核心发现是:高 PPL 数据后跟低 PPL 数据、低 PD 数据后跟高 PD 数据,都能导致损失显著下降两次。在 3B 模型上,FRAME 相比随机顺序在 MMLU 和 CMMLU 上平均提升 16.8%。
#5.3 EDCO:基于推理熵的动态课程
EDCO(Entropy-based Dynamic Curriculum Orchestration)针对领域微调场景,核心概念是推理熵:模型对训练样本的答案不确定性。与静态课程不同,EDCO 持续寻找模型仍然感到不确定的样本,用这些样本指导下一阶段训练。
EDCO 的三个组件:使用前缀 token 近似全序列熵的高效熵估计器;选择最高推理熵样本的熵基课程生成器;在选定课程上优化模型的训练器。在通信、医学和法律领域的实验中,EDCO 在 Qwen3-4B 和 Llama3.2-3B 上均优于传统课程策略,熵估计将计算时间减少 83.5% 同时保持高精度。
#5.4 多阶段预训练的数据配比
现代 LLM 预训练通常包含多个阶段,每个阶段使用不同的数据混合。SmolLM3 的实例展示了典型的多阶段设计:
- 阶段 1:基础训练(8T token,4k 上下文):使用核心预训练混合数据,以 Web 数据为主。
- 阶段 2:高质量注入(2T token,4k 上下文):引入更高比例的 FineMath4+ 和 Stack-Edu 等高质量数据。
- 阶段 3:扩展上下文:增加长上下文训练数据。
数据分布在阶段间的变化也很显著。FRAME 的实验展示了四个阶段的数据配比:通用数据从 79.4% 逐步降至 17.0%,代码数据从 12.0% 增至 25.2%,数学数据从 8.6% 增至 25.3%,指令微调数据在第四阶段从 0% 增至 32.5%。
#6. 评估数据决策的最小实验
- 固定模型架构、总 token、训练算力与评测集。
- 每次只改一个因素:过滤阈值、配比或课程顺序。
- 同时看目标任务、通用能力、低资源类别和记忆/污染。
- 报告保留文档数、实际曝光 token 数与来源分布。
- 对配比实验,报告 的口径(文档/token)和实际曝光 。
- 对课程实验,报告与相同 token 预算随机混合基线的对比。
边界: 本页解释样本怎样被选中;标签如何产生见标注与反馈,训练目标见预训练。
#原始资料
- DoReMi:数据配比优化
- DataComp-LM:数据过滤与模型质量
- RegMix: Data Mixture as Regression for Language Model Pre-training
- BIMIX: Bivariate Data Mixing Law for Language Model Pretraining
- Scaling Laws for Mixture Pretraining Under Data Constraints
- FRAME: Boosting LLMs with A Four-Quadrant Multi-Stage Pretraining Strategy
- Influence-driven Curriculum Learning for Pre-training on Limited Data
- EDCO: Dynamic Curriculum Orchestration for Domain-specific LLM Fine-tuning
- GneissWeb: Preparing High Quality Data for LLMs at Scale
- PreSelect: Predictive Data Selection
- NVIDIA NeMo Curator: Nemotron-CC 数据管护工作流