知识库 / 模型架构
GitHub
← 模型架构

LAYER 04 / MODEL ARCHITECTURE

概率语言模型:条件概率与生成

所属: 模型资产层。本页边界: 语言模型如何把序列表示为条件概率分布,以及这一表示框架的结构性边界与扩展方向。

#核心公式

pθ(x1:T)=∏t=1Tpθ(xt∣x<t) p_\theta(x_{1:T})=\prod_{t=1}^{T}p_\theta(x_t\mid x_{<t})

#符号说明

符号 含义 单位/条件
x1:Tx_{1:T} 长度为 TT 的完整 token 序列 token 序列
xt, x<tx_t,\ x_{<t} 第 tt 个 token 与其左侧前缀 token / token 序列
pθp_\theta 参数为 θ\theta 的语言模型分布 概率分布
zi, piz_i,\ p_i 词表项 ii 的 logit 及 softmax 概率 实数、[0,1][0,1]
y, 1[i=y]y,\ \mathbf 1[i=y] 真实目标 token 的词表编号、类别指示函数 索引、0 或 1
VV tokenizer 词表;∣V∣\lvert V\rvert 为词表大小 有限集合
ℓ, L\ell,\ L 单位置负对数似然及其 token 平均 标量
PPL\mathrm{PPL} 困惑度;自然对数定义下为 eLe^L 正实数
TtempT_{\mathrm{temp}} 采样温度;与序列长度 TT 区分 正实数
DKL(p∥q)D_{\mathrm{KL}}(p\Vert q) 分布对 p, qp,\ q 的 KL 散度 非负标量
H(Xt∣c)H(X_t\mid c) 给定上下文 cc 时下一 token 的条件熵 非负标量
p^cal\hat p_{\mathrm{cal}} 校准后的预测概率 [0,1][0,1]
Dfuture\mathcal D_{\mathrm{future}} 未来 token 窗口的软目标分布 概率分布

链式法则对任何离散序列分布成立;模型结构决定如何近似每个条件概率。本节讨论的是这一近似框架在表示能力、训练目标和生成行为上的结构性边界。

#技术要点

  • 链式法则的数学正确性不保证模型能学到条件分布的真实结构。one-hot 目标抑制了模型内部固有的“预期规划”能力。
  • Next-ToBE 用未来窗口的软 token 袋分布替代 one-hot 目标,无需额外参数即可激活预期能力,在数学、代码和常识推理上优于 MTP。
  • 未来摘要预测(FSP)在 MTP 基础上预测长期未来的紧凑表示,在推理和代码任务上优于 NTP 和 MTP。
  • 扩散语言模型通过迭代 refinement 实现并行解码,但其似然建模弱于自回归模型。锚定扩散语言模型通过先预测关键 token 再重建其余 token,在 MAUVE 分数上首次超越自回归模型。
  • Teacher forcing 的 one-hot 目标鼓励短程模式匹配,惩罚合理的同义替代,削弱长程语义建模。
  • 困惑度对模型选择不可靠:低困惑度序列可能被同一模型错误预测,且困惑度无法区分“措辞不确定”与“事实判断不确定”。
  • 模型校准不等于准确率:高准确率不蕴含可靠的不确定性估计,推理任务上的校准优于知识密集型任务。
  • 最小贝叶斯风险解码将模型参数后验纳入解码过程,在解码阶段显式处理模型不确定性。

#原理与演进

#从 token 到下一个 token 分布

pθ(xt=i∣x<t)=exp⁡(zi)∑j=1∣V∣exp⁡(zj) p_\theta(x_t=i\mid x_{<t})=\frac{\exp(z_i)}{\sum_{j=1}^{|V|}\exp(z_j)}
  • ziz_i 是第 ii 个词表项的 logit,∣V∣|V| 是词表大小。模型输出的是条件分布,不是已经核实的事实。
  • 链式法则把整段序列概率拆成逐 token 条件概率;生成时再由解码策略从每一步分布选 token。
  • 对真实 token 最小化负对数概率就是预训练交叉熵;它优化“像数据”,并不直接优化“有证据”。

#概率高不等于回答可靠

  1. 训练数据中的高频说法即使错误,也可能获得高概率。
  2. 温度降低会让分布更尖锐,答案更确定,但不能把错误分布变正确。
  3. 参考模型的 KL 约束限制策略偏离,常用于后训练;它也不保证真实性。

#1. 链式法则的表示边界

概率链式法则对任意离散序列分布都成立;“语言模型”具体做的是用参数 θ\theta 近似每个条件分布。若模型只能看到最多 WW 个 token,则实际近似 pθ(xt∣xmax⁡(1,t−W):t−1)p_\theta(x_t\mid x_{\max(1,t-W):t-1})。有限窗口、有限容量与训练数据偏差,都会使它偏离真实条件分布。

更根本的问题在于条件概率的估计难度。对词汇表大小 ∣V∣|V| 的语言模型,长度为 mm 的前缀有 ∣V∣m|V|^m 种可能,从语料中估计 P(wm∣w1,…,wm−1)P(w_m\mid w_1,\dots,w_{m-1}) 面临严重的数据稀疏问题。n-gram 用马尔可夫假设截断历史,但长距离依赖被丢失;RNN 将历史压入固定维度的状态向量,长依赖容易衰减;Transformer 通过自注意力直接访问窗口内任意位置,并行训练友好,但计算和 KV 缓存随序列长度增长。架构演进的动因始终是“如何更好地表示条件上下文”,但链式法则本身不提供任何关于“哪些历史真正重要”的归纳偏置。

#1.1 链式分解的概率一致性

对任何定义良好的概率分布,序列困惑度在任何分解下都是不变的,包括前向、后向或任意排列分解。这一理论结果为语言模型的学习提供了严格基础:无论模型如何分解序列概率,只要它学到的条件分布精确,联合分布就是一致的。但实际模型的条件分布只能近似,不同分解方式对近似误差的敏感度不同。前向分解(自回归)将长程依赖转化为一系列短程预测,每个位置的误差都会向前传播;双向分解(如掩码语言模型)在每个位置都能利用两侧上下文,但无法直接用于开放生成。

#2. Teacher Forcing 的结构性缺陷

#2.1 暴露偏差

训练时模型以式(1)所示的真实前缀为条件预测下一 token;生成时模型使用自己先前采出的式(2)。若前一步出错,后续条件可能偏离训练时常见分布,错误因此传播。这一训练-推理分布不匹配称为暴露偏差。

式(1):

x<t x_{<t}

式(2):

x^<t \hat x_{<t}

暴露偏差的后果不仅是错误累积。从模仿学习的视角看,teacher forcing 导致模型在训练时从未被要求“从自己的错误中恢复”。模型学到的策略是“给定正确前缀时的最优下一步”,而不是“给定任意前缀时的最优下一步”。这解释了语言生成中重复、不连贯和幻觉的常见模式——当模型生成一个不常见的 token 后,后续条件分布落入训练时很少见的区域,模型的行为变得不可靠。

#2.2 One-hot 目标对预期能力的抑制

标准 NTP 的 one-hot 目标将概率质量集中于单一“正确答案”,偏好 token 的边缘分布,鼓励短程模式匹配,同时惩罚合理的高置信度替代方案(同义词、改写)。这一目标无意中抑制了模型内部固有的“预期规划”能力。

证据表明,自回归 LLM 虽然仅被训练预测下一 token,但其内层隐藏状态能够预测更远未来的 token,甚至在生成第一个 token 之前就编码了全局响应特征。这种“先思考后说话”的能力对多步规划和长程逻辑一致性至关重要。one-hot 目标的压缩效应削弱了这种能力的表达:模型被推向局部最优的短程预测,而非全局一致的规划。

#3. 超越下一 token 预测的目标函数

#3.1 多 token 预测(MTP)及其局限

MTP 使用多个并行辅助头同时预测多个未来 token,缓解了 NTP 的部分长程规划问题。但 MTP 仍面临两个问题:大额额外参数/内存开销;继续依赖 one-hot 目标,继承了语义灵活性下降和概率过度集中的缺陷。MTP 主要捕获短程依赖,对长程推理和规划的改善有限。

#3.2 Next-ToBE:软 token 袋目标

Next-ToBE 用“软 token 袋分布”替代 NTP 的 one-hot 目标,覆盖未来窗口内的多个 token。核心设计是:立即下一 token 保持主导地位,更远的“前瞻 token”以较低概率加入目标分布。这一设计不添加任何额外参数,通过修改目标分布本身来激活模型潜在的预期规划能力。

在数学、代码和常识推理基准上,Next-ToBE 一致优于 MTP 等强基线。其机制在于:软目标允许合理的同义替代获得梯度,减少了 one-hot 目标对语义灵活性的抑制;同时未来窗口内的 token 为模型提供了“规划信号”,使内层表示能够编码更远期的全局结构。

#3.3 未来摘要预测(FSP)

FSP 在 MTP 基础上进一步扩展:训练一个辅助头预测长期未来的紧凑表示,而非逐个预测多个 token。FSP 有两种变体:手工摘要(如未来序列的词袋摘要)和学习摘要(使用从右到左训练的反向语言模型产生的嵌入)。

在 3B 和 8B 参数模型的大规模预训练实验中,FSP 在数学、推理和编码基准上均优于 NTP 和 MTP。FSP 的核心优势在于:它捕获的是长期未来的压缩表示,而非短程的逐 token 预测,从而保留了长程生成所需的信息。与 MTP 的 one-hot 目标不同,FSP 的摘要目标是分布式的、可压缩的,不强制模型在多个未来位置上同时做精确的点预测。

#3.4 下一概念预测(NCP)

NCP 将预测粒度从 token 级提升到概念级:预测跨越多个 token 的离散概念。这引入了显式且更具挑战性的概念级目标,同时保留标准的 token 级自回归生成。概念级目标迫使模型学习更高层次的语义抽象,而非 token 共现的表面模式。

目标 预测对象 目标形式 额外参数 主要优势
NTP 下一 token One-hot 无 简单、高效
MTP 多个未来 token One-hot × kk 辅助头 短程规划
Next-ToBE 未来窗口 token 袋 软分布 无 激活预期能力
FSP 长期未来摘要 紧凑表示 辅助头 长程信息保留
NCP 跨 token 概念 离散概念 待定 语义抽象

#4. 扩散语言模型

#4.1 并行解码的潜力与似然建模的弱点

扩散语言模型通过迭代 refinement 实现并行解码,与自回归模型的逐 token 生成形成对比。DLM 的生成过程从完全掩码的序列开始,通过多轮去噪逐步恢复 token,每轮可以并行更新多个位置。

然而,DLM 在似然建模和生成文本质量上长期弱于自回归模型。锚定扩散语言模型(ADLM)识别了根本原因:重要 token(如关键词或锚定句子的低频词)在前向过程早期被掩码,限制了准确重建所需的上下文信息。当这些锚定 token 被过早移除时,模型丢失了句子结构的核心线索,重建出的文本偏离了原始语义。

#4.2 锚定扩散的两阶段框架

ADLM 提出两阶段框架:首先通过锚网络预测重要 token 的分布,然后以锚定预测为条件预测缺失 token 的似然。ADLM 在 LM1B 和 OpenWebText 上的测试困惑度相比先前 DLM 提升最高 25.4%,缩小了与强自回归基线的差距。在 MAUVE 分数上,ADLM 首次实现了 DLM 生成的文本比自回归模型更接近人类文本。

理论层面,ADLM 推导了锚定负证据下界(ANELBO),证明锚定改善了样本复杂度和似然建模。锚定机制不仅适用于扩散模型:它也能提升自回归模型的性能,并在数学和逻辑任务上增强推理能力,优于现有的思维链方法。

#4.3 EvoToken-DLM:软 token 分布作为去噪中间态

EvoToken-DLM 用演化软 token 分布替代硬二进制掩码,实现从掩码状态到离散输出的渐进过渡。这一设计支持可修正解码:早期决策可以在后续迭代中被修改,而非像硬掩码那样一旦确定就无法回退。连续轨迹监督使训练目标与迭代概率更新对齐。

在数据受限设置下,掩码扩散模型在重复遍历有限数据时显著优于自回归模型,前提是计算资源充足。这提示了 DLM 的一个独特优势:当数据稀缺但计算可用时,迭代 refinement 的并行去噪过程比逐 token 自回归更有效地利用有限数据。

#5. 概率生成的理论边界

#5.1 幻觉与模式坍缩的权衡

语言生成面临一个根本性的权衡:模型需要(1)为训练数据中存在的序列分配足够概率,(2)足够表达以捕获语言的完整丰富性。这两个目标之间存在张力。对高频模式的过度优化导致模式坍缩——模型只能生成少数几种“安全”的响应,丧失多样性;对表达能力的过度追求则增加幻觉风险——模型生成训练数据中不存在的、不可靠的序列。

后训练中的反馈信号(编码负例)对减少幻觉至关重要,但同时也限制了模式坍缩。这一双向作用说明:幻觉和多样性不是独立的失败模式,而是同一概率质量分配问题在不同方向上的表现。

#5.2 校准与准确率的分离

LLM 的 token 级概率输出提供了信心估计的原始信号,但模型校准不等于准确率。高准确率不蕴含可靠的不确定性估计;准确率相同的模型,校准质量可能差异显著。

实证发现:LLM 在推理任务上的不确定性估计优于知识密集型任务。这一差异的机制在于:推理任务的答案空间结构化,模型可以通过中间步骤的一致性来校准;知识密集型任务依赖外部事实,模型缺乏内部验证信号,因此信心估计与真实正确性之间的相关性更弱。此外,良好的校准不必然转化为有效的错误排序——一个校准良好的模型可能仍然无法区分其正确答案和错误答案。

#5.3 困惑度作为评估指标的局限

困惑度对模型选择不可靠。形式化证明显示:对任何紧凑的解码器-only Transformer 模型,存在一个序列,该序列被模型精确且自信地预测(高概率),但模型却不能正确预测该序列中的某些其他 token。这意味着低困惑度不意味着模型“理解”了数据。

更具体地,生成困惑度(gen-PPL,即样本在冻结 AR 打分器下的逐 token 负对数似然)在评估扩散/连续流语言模型时不可靠。用一组零参数扰动即可显著改变 gen-PPL 排序,而样本质量并未相应变化。困惑度无法区分“措辞不确定”与“事实判断不确定”:一个开放问题的多个合理措辞产生高熵,一个知识问题的模型不知道答案也产生高熵,但两者的认知状态完全不同。

#6. 从 logits 到梯度

单位置交叉熵如下。对 logit 的导数为

ℓ=−log⁡pθ(xt=y∣x<t) \ell=-\log p_\theta(x_t=y\mid x_{<t}) ∂ℓ∂zi=pi−1[i=y]. \frac{\partial\ell}{\partial z_i}=p_i-\mathbf 1[i=y].

因此真实 token 的 logit 被推高,其他 token 按当前预测概率被压低。梯度经过输出层、Transformer 各层回传;并不存在显式“真实性监督”项。若原文本包含错误,模型同样会尝试拟合错误 token。one-hot 目标的梯度将所有非目标 token 一视同仁地压低,这是其抑制预期能力的梯度层面的根源——合理的同义替代与真正错误的 token 受到相同的惩罚。

#7. 解码策略的概率视角

#7.1 最小贝叶斯风险解码

标准解码方法(贪心、温度采样、top-p)从模型输出的条件分布中直接选择 token。最小贝叶斯风险(MBR)解码从另一角度处理概率分布:选择使期望风险最小的生成结果,而非最大化单序列概率。

MBR 的原始设计已考虑概率语言模型的不完美性:不信任单一最高概率序列,而是在多个候选序列的效用空间中选择鲁棒性最好的。不确定性感知的 MBR 进一步将模型参数的后验分布纳入期望风险的計算,使解码过程显式处理模型自身的不确定性。这在 hallucination 场景中尤为重要:当模型参数的后验分散时,高概率单序列的可靠性下降,MBR 倾向于选择在参数不确定性下仍然稳健的输出。

#7.2 采样适配器

标准语言生成器的训练目标(最大似然)不必然赋予其作为生成器时的理想特性。最大似然训练是召回优先的:它为所有训练序列分配概率,不特别强调正确性。采样适配器在解码阶段重新对齐分布,将其转变为精度优先的概率目标。这一调整在模型被“开箱即用”作为生成器时可能至关重要,因为训练目标与生成质量之间不存在自动的一致性。

#8. 生成分布的改变

操作 改动对象 可能改善 不能解决
温度/top-p 采样分布 多样性、重复程度 权重中的错误知识
Prompt 条件上下文 任务激活、输出格式 缺失的外部事实
RAG 条件中加入证据 更新知识、可追溯性 错误检索与证据误读
SFT/偏好优化 模型参数 行为与偏好 不保证所有回答真实

设参考策略 p0p_0、调整后策略 pθp_\theta,下式衡量偏离。限制 KL 可减少偏好优化中策略跑远,但也会抑制必要改变;它是稳定性约束,不是准确性证书。

DKL(pθ∥p0)=Epθlog⁡(pθ/p0) D_{\mathrm{KL}}(p_\theta\Vert p_0)=\mathbb E_{p_\theta}\log(p_\theta/p_0)

#9. 熵与认知状态

给定上下文 cc,下式所示的 token 分布熵描述下一个 token 的不确定度。熵高可能因为有多个合理措辞,也可能因为模型不知道答案;不能直接等同于知识缺口。对于开放问题,要把“措辞不确定”与“事实判断不确定”分开评估。

H(Xt∣c)=−∑ipilog⁡pi H(X_t\mid c)=-\sum_i p_i\log p_i

若采用 beam search 或低温采样,输出更确定只是降低采样随机性,不改变模型参数中的不确定来源。若多个独立证据冲突,模型应表达冲突或检索核验,而不是仅通过温度让其中一个结论更坚定。校准的几何框架(如 credal set)通过比较模型输出分布与人类创造变异的差异来量化这一不确定性,揭示了当前模型在捕获人类创造性变异方面的显著差距。

关联: 预训练目标解释概率模型的学习;解码解释如何从分布产生答案;蒸馏解释软标签分布如何传递类别间关系信息。

#原始资料

本页由仓库中的 Markdown 生成。具体技术结论请结合正文引用与实验条件理解。

输入关键词,探索整个知识库

↑ ↓ 选择 ↵ 打开36 篇笔记,一次搜索