知识库 / 训练与推理
GitHub
← 训练与推理

LAYER 03 / TRAINING & INFERENCE

预训练:数据、目标与能力形成

所属: 训练推理平台层。本页边界: 基座模型怎样从大规模无标注 token 中获得语言、知识和模式能力。

#核心公式

LPT=−1T∑t=1Tlog⁡pθ(xt∣x<t) \mathcal L_{\mathrm{PT}}=-\frac1T\sum_{t=1}^{T}\log p_\theta(x_t\mid x_{<t})

#符号说明

符号 含义 单位/条件
LPT\mathcal L_{\mathrm{PT}} 自回归预训练的平均负对数似然 标量
TT 当前训练序列的 token 数 正整数
xt, x<tx_t,\ x_{<t} 第 tt 个真实 token 及其左侧前缀 token / token 序列
pθ(xt∣x<t)p_\theta(x_t\mid x_{<t}) 参数为 θ\theta 的模型给真实 token 的条件概率 [0,1][0,1]
NN 稠密模型参数量 个
DD 训练实际消费的 token 总数 个
CtrainC_{\mathrm{train}} 训练计算量的量级估计 FLOPs
pk, πkp_k,\ \pi_k 第 kk 类数据分布及其混合权重 分布、[0,1][0,1]
λ\lambda CPT 中领域损失的混合系数 [0,1][0,1]
Lgeneral, Ldomain\mathcal L_{\mathrm{general}},\ \mathcal L_{\mathrm{domain}} 通用语料损失与领域语料损失 标量
LCPT\mathcal L_{\mathrm{CPT}} 通用与领域目标混合后的继续预训练损失 标量
pdata, pθp_{\mathrm{data}},\ p_\theta 真实数据分布与模型分布 概率分布
H(pdata), DKL(pdata∥pθ)H(p_{\mathrm{data}}),\ D_{\mathrm{KL}}(p_{\mathrm{data}}\Vert p_\theta) 数据分布熵、数据分布相对模型分布的 KL 散度 非负标量
K, Dk, ℓθ(x)K,\ D_k,\ \ell_\theta(x) 数据域数量、第 kk 个数据域、样本级训练损失 正整数、数据集、标量
Lmix(θ)L_{\mathrm{mix}}(\theta) 多数据域加权后的训练目标 标量

下式是稠密 Transformer 的量级估计,不是所有架构和实现的恒等式。

Ctrain≈6ND C_{\mathrm{train}}\approx6ND

#技术要点

  • 自回归目标提升真实下一个 token 的条件概率。NTP 是当前主流,但存在曝光偏差和长程依赖捕获不足的结构性限制。
  • 参数量、训练 token 和计算量共同受 scaling 约束。Chinchilla 最优比例并非恒定定律,需结合推理成本综合判断。
  • 继续预训练改变领域分布,不等于 SFT。CPT 仍使用自回归目标,区别在数据条件和目标行为。
  • 高质量、覆盖和配比通常比单纯 token 数更重要。数据混合规律使混合比例的系统化优化成为可能。
  • MTP 通过多个预测头同时预测未来 kk 个 token,DeepSeek-V3 和 Qwen-3 已在大规模系统中验证其有效性。
  • 未来摘要预测(FSP)在 MTP 基础上增加长期未来的压缩表示预测,在数学、推理和代码任务上均优于 NTP 和 MTP。
  • 潜在 CoT 预训练将推理能力内化到预训练阶段,通过潜在空间的迭代计算替代显式文本 CoT,在相同参数量下匹配更大模型的性能。
  • JEPA 将嵌入空间预测目标引入语言模型,通过配对文本视图的嵌入预测增强表示学习。
  • 课程学习在采用模型中心难度指标后,可在有限数据预训练中带来超过 10 个百分点的提升。

#原理与演进

#梯度究竟来自哪里

  • 每个位置把前面的 token 当条件,预测当前 token;标签直接来自原文本,所以叫自监督。
  • 目标函数只要求给真实下一个 token 更高概率。语法、事实关联、代码结构和部分推理模式是为降低该损失而间接形成的,目标本身没有“必须真实/有帮助”的项。
  • 训练样本由Tokenizer 与 Packing变成 token;数据配比改变模型见到的条件分布。

#参数、token 与算力一起变化

Ctrain≈6ND C_{\mathrm{train}}\approx 6ND
  • NN 为稠密模型参数数、DD 为训练 token 数;6ND6ND 是估算 Transformer 训练 FLOPs 的常用量级式,忽略架构、序列长度与实现差异。
  • 只增加 NN 而不给足 DD,参数可能训练不足;只增加 DD 则受固定模型容量限制。计算最优比例依任务与推理成本变化,不能把单篇论文的比例当恒定定律。Chinchilla 原论文

#从通用预训练到继续预训练

阶段 起点 训练信号 解决问题 新风险
从零预训练 随机权重 大规模自监督 token 获得基础语言能力 数据、计算和稳定性成本最高
CPT/DAPT 已有基座 领域原始文本的自监督 token 补充领域分布与术语 领域过窄可能导致通用能力退化
SFT 已有基座 输入—理想回答 学会任务格式与行为 不能单靠示范优化偏好

继续预训练常把领域与通用数据混合,以降低遗忘风险:

LCPT=(1−λ)Lgeneral+λLdomain \mathcal L_{\mathrm{CPT}}=(1-\lambda)\mathcal L_{\mathrm{general}}+\lambda\mathcal L_{\mathrm{domain}}

λ\lambda 控制领域曝光,不能只看领域验证损失;通用能力和领域任务须同时评测。训练阶段越靠后,可用数据越窄,分布偏移的风险越需要显式监控。

后两者的目标不同;SFT、偏好与 RL 的细节见后训练。

#1. 自监督目标与能力不是同义词

给定文本分布 pdata(x)p_{\mathrm{data}}(x),最大似然训练近似最小化 DKL(pdata∥pθ)D_{\mathrm{KL}}(p_{\mathrm{data}}\Vert p_\theta) 的经验形式。它使模型学习“这类上下文后通常出现什么”,并不直接验证句子是否真实。

Ex∼pdata[−log⁡pθ(x)]=H(pdata)+DKL(pdata∥pθ). \mathbb E_{x\sim p_{\mathrm{data}}}[-\log p_\theta(x)] =H(p_{\mathrm{data}})+D_{\mathrm{KL}}(p_{\mathrm{data}}\Vert p_\theta).

右侧第一项与参数无关,因此优化的是分布拟合。语言结构、领域知识、代码语法、部分多步推理都可能成为降低预测误差的可迁移表征;但“知道某个事实”和“在指令下可靠说出事实”不是同一个能力,后者还受后训练与检索影响。

#2. 训练目标的选择

目标 条件信息 典型模型 优势 限制
Causal LM 左侧历史 x<tx_{<t} Decoder-only 与开放式生成一致;推理接口简单 单向上下文建模
Masked LM 遮盖位置周围双向上下文 Encoder 表征学习、判别任务友好 不能原样逐 token 开放生成
Span corruption 破坏输入片段并重建 Encoder–decoder 条件生成与理解兼顾 两套网络带来部署复杂度

这些是目标/架构组合,不是单纯时间序列上的“后一代淘汰前一代”。当前大规模开放式生成多用自回归 decoder,但检索编码器仍常使用双向表征。

#3. NTP 的结构性限制与目标函数演进

#3.1 NTP 的固有问题

下一 token 预测(NTP)配合教师强制训练是当前预训练的基础方法,但存在两个结构性限制:

曝光偏差(exposure bias) :训练时模型以真实历史为条件预测下一 token,推理时则必须依赖自身生成的输出。训练与推理之间的分布差异导致误差累积,长程生成质量下降。

捷径学习:教师强制使模型倾向于利用真实前缀中的局部线索,而非捕获真正的长程依赖关系。这些问题在需要扩展推理、叙事连贯性和开放式创造力的任务中最为明显。

#3.2 多 token 预测(MTP)

MTP 通过多个预测头在每个时间步同时预测未来 kk 个 token,而非仅预测下一个 token。DeepSeek-V3 和 Qwen-3 已在大规模系统中验证了 MTP 的有效性。

MTP 的训练机制:在标准 NTP 基础上增加辅助预测头,每个头负责预测偏移 1,2,…,k1, 2, \dots, k 个位置的 token。辅助头与主 NTP 头共享 Transformer 主干,仅预测头独立。

MTP 的收益与局限:MTP 改善了下游性能、推理速度和训练效率,尤其对大模型效果显著。但 MTP 主要捕获短程依赖,对长程推理和规划的改善有限,且假设预测 token 之间在给定前缀下相互独立。

小模型的 MTP 困难。小型语言模型(SLM)难以直接利用 MTP 目标。为此,ACL 2025 提出了 MTP 的课程学习策略:前向课程从 NTP 逐步过渡到 MTP,反向课程则相反。实验表明,前向课程使 SLM 更好地利用 MTP 目标,改善下游 NTP 性能和生成输出质量,同时保留自推测解码的收益;反向课程获得更强的 NTP 性能,但失去自推测解码优势。

#3.3 未来摘要预测(FSP)

FSP 在 MTP 基础上进一步扩展:训练一个辅助头预测长期未来的紧凑表示,而非逐个预测多个 token。FSP 有两种变体:

  • 手工摘要:如未来序列的词袋摘要。
  • 学习摘要:使用从右到左训练的反向语言模型产生的嵌入。

在 3B 和 8B 参数模型的大规模预训练实验中,FSP 在数学、推理和编码基准上均优于 NTP 和 MTP。FSP 的核心优势在于:它捕获的是长期未来的压缩表示,而非短程的逐 token 预测,从而保留了长程生成所需的信息。

#4. 推理能力的预训练内化

#4.1 从后训练 CoT 到预训练潜在推理

现代 LLM 主要通过显式文本生成(如 Chain-of-Thought)来“思考”,这将推理推迟到后训练阶段,未能充分利用预训练数据中的推理信号。

Ouro(Looped Language Model) 将推理构建到预训练阶段,通过三个机制实现:潜在空间中的迭代计算、熵正则化的学习深度分配、以及扩展到 7.7T token 的预训练规模。Ouro 1.4B 和 2.6B 模型在广泛基准上匹配了高达 12B SOTA LLM 的结果。控制实验表明,这一优势并非来自知识容量的增加,而是来自知识操作能力的提升。LoopLM 产生的推理痕迹比显式 CoT 更与最终输出对齐。

#4.2 自适应潜在 CoT 预训练

Adaptive Latent CoT 让模型在输出每个 token 前生成可变长度的潜在 CoT 轨迹——对困难 token 分配更长轨迹,对简单 token 分配更短甚至零长度轨迹。这一行为从单阶段通用文本预训练中自然涌现,通过 token 级自适应停止减少训练和推理计算。在 Llama 架构上的实验表明,自适应潜在 CoT 持续改善语言建模困惑度和广泛下游准确率,且使用的训练 FLOPs 少于先前循环基线。

#4.3 JEPA:嵌入空间预测目标

LLM-JEPA 是联合嵌入预测架构(JEPA)在语言模型上的首次应用。核心思想是将配对文本数据视为同一底层知识的不同“视图”(如 GitHub issue 与对应代码 diff、自然语言描述与正则表达式),在嵌入空间中进行预测,而非重建 token 空间。

JEPA 损失与标准文本生成损失互补,在多个数据集(NL-RX、GSM8K、Spider、RottenTomatoes)和多个模型家族(Llama3、OpenELM、Gemma2、Olmo)上优于标准 LLM 训练目标,且对过拟合具有鲁棒性。

JEPA 在语言上的挑战:视觉 JEPA 受益于自然的多视图数据(遮蔽 patch、增强视图),但语言缺乏这种自然的多视图结构,需要显式的配对视图数据。开发通用的文本“数据增强”机制仍是开放问题。

#5. 规模法则怎样指导预算

经验损失常写作近似形式如式(1)所示;α,β,a,bα,β,a,b 由模型、数据和训练区间拟合,并非普适常数。在式(2)约束下,增加参数会减少在固定预算内可训练的 token;选择 N,DN,D 是受预算约束的优化问题。

式(1):

L(N,D)≈L∞+aN−α+bD−β L(N,D)\approx L_\infty+aN^{-\alpha}+bD^{-\beta}

式(2):

C≈6ND C\approx6ND
  • 参数少、数据多:容量可能成为瓶颈;参数多、数据少:训练不足,推理成本却高。
  • “计算最优”针对训练 FLOPs;若模型将被高频调用,较小模型多训练一些 token 可能降低长期推理总成本。
  • 重复采样同一文本不等于新增同等信息量。数据质量与覆盖会改变规模法则的拟合区间。

路线:小规模实验外推 → 参数/数据联合配置(Chinchilla)→ 混合质量与领域分布优化 → 同时考虑训练、推理和数据许可的总成本。

#6. 数据混合规律:从试错到系统优化

#6.1 数据混合规律的形式

Data Mixing Laws 发现了模型性能与混合比例之间的定量可预测性,将模型性能表示为混合比例的函数形式。在样本混合上拟合这些函数,可在实际训练前预测未见混合的性能,从而指导理想混合的选择。通过嵌套使用训练步数缩放定律、模型规模缩放定律和数据混合规律,仅用小规模训练即可预测大规模数据在不同混合下的性能。在 RedPajama 上训练 1B 模型 100B token 的实验中,该方法达到的性能相当于在默认混合上训练 48% 更多步数的效果。

#6.2 混合预训练的缩放定律

Scaling Laws for Optimal Data Mixtures 提出了一种系统化方法,通过缩放定律确定任意目标域的最优数据混合,取代了大规模预训练中不切实际的试错方法。

BIMIX 是数据混合的二元缩放定律,同时建模域比例和数据量的联合缩放行为,在损失外推上的平均相对误差小于 0.2%。

重复感知的混合缩放定律量化了重复目标 token 的递减价值和通用数据的正则化作用。在数据约束下,混合训练相比单源训练能容忍更高的重复率。

#7. 课程学习:从人类中心到模型中心

传统课程学习使用人工定义的难度指标(如句子长度、词汇复杂度),在语言模型预训练中效果有限。

影响力驱动的课程学习用训练数据影响力分数替代人工难度指标。影响力分数估计每个训练样本对模型输出的影响,按影响力排序训练数据。在 BabyLM 基准上,按训练数据影响力排序的课程学习比随机顺序训练在多个 benchmark 上高出超过 10 个百分点,证实了采用更以模型为中心的难度概念后,课程学习对语言模型预训练是有益的。

#8. 训练动态:loss 下降不代表每种能力都提高

平均交叉熵按 token 加权,频繁出现的普通文本可主导总 loss。若专业数据只占很小比例,领域验证集和任务评测可能几乎不动;若专业数据权重过大,通用能力又可能退化。

Lmix(θ)=∑k=1Kπk Ex∼Dkℓθ(x),∑kπk=1. L_{\mathrm{mix}}(\theta)=\sum_{k=1}^K\pi_k\,\mathbb E_{x\sim D_k}\ell_\theta(x),\quad \sum_k\pi_k=1.

πk\pi_k 改变的是优化目标,不只是读盘顺序;具体过滤与配比策略由数据治理维护。本页关注它怎样改变预训练梯度。

#9. 领域继续预训练的判断

观察 更可能的干预 原因
模型知道事实但不会遵循输出格式 SFT / Prompt 行为约束问题,不是知识密度不足
新知识频繁更新、需可追溯证据 RAG 权重更新慢,来源难定位
专业术语与文体普遍陌生 CPT / DAPT 基座分布与目标语料存在系统偏移
目标领域有大量可靠原始语料且基座无覆盖 CPT,少数情况从零训练 从零训练需重新付出通用能力成本

CPT 的训练目标仍是自回归预测;SFT 的目标样本是“提示—回答”。区别在数据条件与目标行为,不是是否更新全部参数。可用混合数据、较低学习率和通用保留集限制遗忘,但无法从理论上保证所有能力不退化。

原始资料: GPT-3 / in-context learning;Scaling Laws;Chinchilla。

#10. 梯度估计与训练稳定性

每一步从数据分布抽批次 BB,用下式近似总体梯度。若样本近似独立,批次增大可降低梯度估计方差,但不能无限提高收益:大批量可能减少单位计算预算中的参数更新次数,数据相关性也会削弱“独立样本”假设。

gB=1∣B∣∑x∈B∇θℓθ(x) g_B=\frac1{|B|}\sum_{x\in B}\nabla_\theta\ell_\theta(x)

学习率过高可能使参数跨过低损失区域、出现 loss spike;过低则收敛慢。Warmup、衰减、梯度裁剪与归一化主要是控制优化动态,不会弥补坏数据或错误目标。遇到 spike 应同时查样本、梯度范数、数值溢出和硬件/通信,而不能只把学习率调小。

#11. 训练 token 数为何不是有效数据量

若同一文档重复 kk 次,总 token 数涨了 kk 倍,独立信息量却远不到 kk 倍。重复文本会增加某些模式在经验分布中的权重,可能提高特定记忆和训练集 loss,却导致过拟合或评测污染。去重机制见数据去重;本页强调它怎样改变目标分布。

对于训练语料分布 ptrainp_{\mathrm{train}} 与目标任务分布 ptargetp_{\mathrm{target}},低预训练 loss 仅说明对前者拟合更好,不能保证后者更好。若专业领域占比过低,模型可能只学到浅层术语;若领域过度加权,可能造成一般语言任务退化。因此继续预训练需要双保留集:领域任务与通用任务。

#12. “能力涌现”表述要有评测条件

某任务准确率随规模突然升高,可能来自模型内部表征的非线性变化,也可能来自二值指标的阈值效应:连续的正确答案概率跨过判分阈值后,准确率呈现跳变。讨论能力发展时,需同时报告连续损失/置信度、任务指标与训练预算;不能仅凭单一曲线断言存在普适的突然相变。

#原始资料

本页由仓库中的 Markdown 生成。具体技术结论请结合正文引用与实验条件理解。

输入关键词,探索整个知识库

↑ ↓ 选择 ↵ 打开36 篇笔记,一次搜索