所属: 数据治理层。本页边界: 训练数据为何定义了模型所拟合的世界分布与合法边界。
#技术要点
- 模型学到的是处理后数据的经验分布,不是抽象的“互联网”。来源构成、过滤规则、采样权重和重复次数共同决定这一分布。
- 网页、书籍、代码、对话和领域资料具有不同分布形态、信息密度和许可约束。
- 来源与许可决定可用范围,也影响数据可追溯性。没有来源元数据,污染定位和删除执行都无法落地。
- 领域数据少不等于应从零训练;RAG、SFT、继续预训练各有适用条件。
- 合成数据比例上升带来模型自我循环风险,需要保留真实数据锚点。
- 开源不等于放弃版权约束,训练数据需逐项对照许可条款。
- 基于分类器的质量过滤(CQF)提高下游任务表现,但不一定提升语言建模能力。
- 数据配比中行业与通用数据存在经验比例,过高或过低都会损害特定能力。
#原理与演进
#模型拟合的是处理后的经验分布
训练数据不是原始文件,而是经过解析、过滤、去重、采样、tokenization 和 packing 后的 token 序列。模型在这些序列上做梯度更新,学到的分布由以下因素共同决定:
- 来源构成:不同来源的文档数量、字节数和 token 数不等价。长文档可能占大量 token,短文档数量多未必主导训练。
- 过滤规则:质量过滤器和去重算法改变了保留样本的分布。过滤越激进,保留样本的平均质量越高,但低资源语言和新颖内容被误删的概率也越大。
- 采样权重:即使原始语料中某来源占比很小,通过上采样可以让其在训练中反复出现。高频来源获得更多梯度更新。
- 重复次数:同一网页被多次抓取且未去重时,其在训练批次中出现次数增多,对梯度的影响增大。
讨论“某类数据占比”时必须说明分母:文件数、文档数、token 数,还是重复采样后的训练曝光量。这四个口径可能给出完全不同的结论。
#来源类型与能力偏向
| 来源 | 常见强项 | 易忽略的缺陷 | 更可能影响的能力 |
|---|---|---|---|
| 网页 | 覆盖广、时效较高 | 模板、重复、广告与错误 | 通用表达与长尾知识 |
| 书籍/长文 | 篇章结构完整 | 授权、扫描解析与年代偏差 | 长文组织 |
| 代码与技术文档 | 语法精确、可执行 | 版本过时、生成仓库重复 | 编程与工具格式 |
| 对话/问答 | 指令形式贴近交互 | 风格与标注偏好 | 指令遵循 |
| 领域资料 | 专业术语与任务结构 | 量少、格式杂、权限限制 | 领域迁移 |
| 合成数据 | 可控、可扩展 | 分布过窄、自我循环 | 特定任务格式 |
来源类型不是质量标签:专业资料也可能错误,网页也可能包含高质量论文或文档。多来源混合的价值在于覆盖不同条件分布,但混合比例本身成为隐性训练目标。改变混合比例,实际上是在改变模型优化的目标函数。
#为什么来源与许可属于技术链路
来源与许可不是法律部门的附加要求,而是技术链路的一环:
- 获取时记录来源、版本、时间和允许用途。 这是后续所有追溯操作的基础。
- 解析后保留文档与来源的对应关系。 否则发现测试污染或敏感内容时,无法定位受影响样本与训练版本。
- 混合数据时先判断任务分布差异,再决定抽样权重。 具体方法见质量与配比。
没有来源标识,后续的污染控制、删除请求和版本回滚都只能作用于整个数据集,而非受影响的子集。这在实际运营中意味着要么全量重训,要么接受污染。
#许可元数据的实际维度
公开可访问不等于可任意用于训练。来源元数据至少应包含以下维度:
- 来源标识:URL、数据集名称、版本号、快照时间。
- 获取方式:爬取、API、授权采购、用户贡献。
- 使用限制:是否允许商业使用、是否允许衍生、是否要求署名、是否有地域限制。
- 处理链:经过了哪些过滤、去重、转换步骤。
- 合成数据记录:生成模型、提示模板、筛选器、生成时间。
授权状态因来源和时间而异。同一网站在不同时期可能采用不同的许可条款;同一数据集的不同版本可能采用不同许可。因此,元数据需要记录获取时刻的许可状态,而非假设当前状态适用于历史数据。
#1. 开源许可与训练数据的法律边界
#1.1 开源不等于放弃版权约束
开源的法律基础建立在许可证制度之上。权利人并没有放弃版权,而是借助版权通过格式化合同,向公众有条件地让渡使用、修改和分发的权利。不同许可证设定截然不同的权利边界:有的允许商业使用但要求保留版权声明,有的要求衍生作品必须以相同协议开源,还有的明确禁止商业用途。违反许可证条款,附条件的授权即告终止,继续使用便构成侵权。
模型权重的开源与训练数据的可用性是两种不同性质的客体,适用不同的法律规则。以医疗大模型为例,其训练数据往往涉及大量患者病历,相关授权通常只覆盖内部用于训练模型这一特定目的,与模型是否开源无关。
#1.2 许可数据集的构建实践
KL3M Data Project 是当前最大的版权清洁训练数据管道之一。该项目构建了超过 1.32 亿份文档、数万亿 token 的语料,覆盖 16 个不同来源,全部经过严格的版权和许可协议验证。项目开源了完整的管道,包括文档获取和处理源代码、原始文档格式与来源元数据、标准化提取内容、预 token 化表示,以及各类后训练资源。所有资源在 S3、Hugging Face 和 GitHub 上以 CC-BY 条款免费公开。
Open License Corpus(OLC)将数据许可分为四个类别:公共领域(无限制)、宽松许可软件(MIT、Apache、BSD)、署名许可(可自由使用但要求署名)和未知许可(被视为高风险)。OLC 包含 2280 亿 token 的宽松许可文本数据,但面临严重的领域分布偏斜问题——宽松许可数据在多数领域极为稀缺。
#1.3 三重过滤与来源图谱
实践中对训练数据的版权审核通常采用多重过滤:第一层为自动化筛查,利用版权识别算法如哈希值比对、特征提取,过滤已知版权内容;第二层为人工审核;第三层为来源图谱验证,确保每条数据可追溯至原始许可。
#1.4 Data Cards 与 Datasheets 框架
Datasheets for Datasets 是最具影响力的数据集文档框架之一,要求每个数据集附带结构化文档,描述其动机、组成、收集过程、预处理步骤、用途、分发方式及维护计划。其核心论点是:完成文档的过程本身具有价值,因为它促使创作者反思设计假设、权衡取舍和下游风险。
Data Cards 框架进一步将数据集文档定位为用户中心的透明度工件,强调模块化、可扩展性和可访问性。文档应同时支持概览级理解和详细的结构化查询。
#2. 元数据治理与血缘追踪
#2.1 TableVault 框架
TableVault 是面向人机协作数据创建的元数据治理框架。它记录数据摄入事件、追踪操作状态、将执行参数链接至数据来源,并暴露标准化元数据层。通过结合数据库启发的保证和面向 AI 的设计(如声明式操作构建器和血缘感知引用),TableVault 在混合人-模型管道中支持透明性和可复现性。
#2.2 数据血缘溯源
数据血缘追踪记录数据从来源经过转换到消费的完整路径。邮储银行构建了基于大模型的智能数据血缘溯源技术体系,用于数据治理与风险管控。阿里云的 AI 资产血缘服务追踪数据集、模型、训练任务之间的来源和演变关系,涵盖数据集版本、数据处理流程、训练任务、模型版本等资产对象。
#3. 质量过滤技术
#3.1 基于分类器的质量过滤(CQF)
CQF 是当前预训练数据过滤的主流方法,已集成到 GPT-3、LLaMA、PaLM 等模型的训练管道中。其流程为:训练一个二分类器区分大规模低质量预训练集和小规模高质量数据集,为每份文档分配质量分数,保留得分最高的 top-k 比例文档。
然而,Apple 的研究揭示了 CQF 的一个悖论:CQF 一致地提升下游任务表现,但不一定提升在高质量数据集上的语言建模能力。原因在于 CQF 隐式地过滤了高质量数据集本身。通过比较 CQF 训练模型与在递增质量合成数据上训练的模型,研究发现二者的趋势截然不同,这挑战了 CQF 捕获了有意义数据质量概念的观点。
#3.2 基于 token 分类的精细化过滤(SELECT)
SELECT 框架将数据精炼重新定义为 token 分类任务:将每个 token 分类为信息性或噪声性,删除噪声 token。与传统基于启发式规则的方法(在文档级判断,丢弃整个文档)和行级方法(缺乏全局上下文)相比,SELECT 实现了细粒度的 token 级优化,同时避免了生成式方法(如 PROX-C)的高计算成本和幻觉引入问题。
在多样化下游基准上,SELECT 精炼语料训练的模型平均优于原始数据超过 2%,超过最佳启发式基线超过 1%,同时多保留 17% 的 token。SELECT 在所有实验设置中均优于生成式 PROX-C,推理速度快 2.5 倍。
#3.3 基于 LLM 的行级过滤
FinerWeb-10BT 使用 GPT-4o mini 对 FineWeb 的 20,000 份文档样本进行行级标注,标注分为九个主要类别,然后训练 DeBERTa-v3 分类器进行行级过滤,最终生成 10B token 的精炼数据集。
#4. 数据配比的工程实践
#4.1 行业与通用数据的配比原则
华为云盘古大模型的实践表明,行业指令数据和通用指令数据的比例通常控制在 1:3 左右。如果行业数据质量较高,可适当增加行业数据的混合比例;如果希望尽可能多地保留通用能力,则应混入更多的高质量通用数据。
以金融 L1 为例,配比方案为:25% 通用数学数据、20.5% 通用代码数据、21.5% 通用逻辑推理数据、12.5% 通用非逻辑推理数据、20.5% 行业数据。
不同行业场景需要差异化的配比方案:医疗场景优先考虑医学领域数据和真实病例;金融场景关注财经新闻和金融报告,若数据包含大量知识密度较低的财务报表,可适当降低其比例;法律场景应特别注重法律领域数据并避免过多通用数据;客服场景的客户对话数据质量通常不高,可适当降低行业数据比例。
#4.2 领域适应预训练的数据选择
DAPT(Domain-Adaptive Pre-training)在通用预训练模型基础上,使用领域语料进行继续预训练。数据选择方法通常使用困惑度或领域相似性度量(如术语分布的 Jensen-Shannon 散度)来选取与目标领域最匹配的数据。
语料分为三个层级:领域级(与某一领域相关的最大语料)、实体级和任务级(明确与目标领域特定任务相关)。多阶段预训练从广泛覆盖到领域/任务适应,逐步缩小数据范围。
NVIDIA NeMo Curator 提供了 DAPT 数据策划教程,展示了在芯片设计领域使用 200 亿以上 token 进行继续预训练的最佳实践。
#5. 合成数据的风险与控制
#5.1 模型坍缩机制
递归训练中使用合成数据可以缓解数据稀缺,但面临模型坍缩风险:重复训练侵蚀分布尾部并同质化输出。当验证器仅观察到目标流形的局部、碎片化和有偏切片时,数据选择本身变为有偏的——选择偏好保留与局部流形对齐的样本,修剪全局相关的尾部模式,从防止坍缩的保障机制转变为加速坍缩的机制。
理论证明这种孤立选择会加速坍缩并导致幂律多样性衰减。缓解方案是使用多数据持有者的信息构建共享参考,而无需交换原始数据。实验证实,局部参考选择在偏斜分布上失败,而协作代理参考可缓解多样性退化。
#5.2 合成数据的安全护栏
在医疗 AI 中,建议采用阶段特定保障措施:通过 k-匿名测试(k≥5)和成员推理优势测试量化重识别风险;持续对照真实基线进行准确性基准测试;自动拒绝主要(>50%)依赖合成特征或高风险变量的预测。
#5.3 差分隐私与合成数据生成
通过 LoRA 微调和提示技术结合差分隐私(DP),可以在合成数据生成中增强隐私保护。端到端工作流包括隐私风险审计环节,确保生成的数据不泄露原始训练数据中的敏感信息。
#6. 领域数据的决策框架
| 需求 | 优先检查 | 原因 |
|---|---|---|
| 回答需要可更新事实 | RAG | 可给出处,不必改权重 |
| 需要固定格式/专业工作流 | SFT | 示范直接教行为 |
| 基座对领域语言分布本身陌生 | CPT/DAPT | 自监督学习术语和关联 |
| 现有架构/词表根本不适配且资源充足 | 从零预训练的可行性分析 | 成本与遗忘风险最高 |
领域语料规模小、质量高时,可能更适合检索或监督微调,而非继续预训练。继续预训练需要足够的语料规模来覆盖领域术语和关联,同时需要控制学习率和训练步数,避免灾难性遗忘通用能力。
#7. 演进与反作用
- 单一来源语料规模扩大:语言覆盖增长,但模板和重复被放大。
- 多来源组合:改善覆盖,但混合比例成为隐性训练目标。
- 模型评分与自动过滤:提高平均质量,却可能压低低资源语言和新颖内容。
- 领域与合成数据:补齐任务能力,却增加分布过窄与自我循环风险。
数据不是被动“燃料”;来源、过滤和采样共同定义模型优化的经验分布。每次改数据,实际上也在改训练目标。
#原始资料
- The Pile:多来源语言模型数据集
- DataComp-LM:数据集设计与过滤研究
- Deduplicating Training Data Makes Language Models Better
- Textbooks Are All You Need
- KL3M Data Project:版权清洁训练资源
- Datasheets for Datasets
- SELECT: Token-Level Pre-training Data Curation
- The Data-Quality Illusion: Rethinking CQF
- Model Collapse and Sample Selection Bias
- 华为云盘古大模型数据配比最佳实践