所属: 模型资产层。本页边界: 自注意力如何在序列位置间按内容建立信息交互,以及2025–2026年主流变体如何在不同约束下重新分配计算、内存和表达能力。
#核心公式
#符号说明
| 符号 | 含义 | 典型形状/条件 |
|---|---|---|
| 一层 Transformer 的输入隐藏状态 | ||
| Query、Key、Value 投影 | ||
| 注意力的可训练投影矩阵 | 依隐藏维度定义 | |
| 每个 Key/Query 头的维度 | 正整数 | |
| 因果或其他注意力掩码 | ||
| 单层注意力模块的输出隐藏状态 | ||
| 序列长度与模型隐藏维度 | 正整数 | |
| 注意力头数量 | 正整数 | |
| FFN 中间维度 | 正整数 | |
| Transformer 层数与词表大小 | 正整数 | |
| 仅计主要矩阵参数时的 Decoder 参数量近似 | 参数个数 | |
| MLA 的潜在压缩维度 | 正整数 | |
| 线性注意力的特征映射维度 | 正整数 |
页首公式省略了多头拼接、输出投影和因果掩码;Decoder 的完整形式在正文给出。
#技术要点
- 注意力机制的核心矛盾从计算复杂度转向推理时的KV Cache内存占用——长上下文部署中内存而非算力是主要瓶颈。
- MLA通过低秩联合压缩将KV Cache降低至MHA的约4%,同时性能优于MHA。
- RoPE存在Fourier障碍:所有双线性正交位置编码在相对距离上计算有限傅里叶级数,Gibbs现象从结构上限制外推能力。
- RMSNorm正被多种无归一化或动态归一化方案挑战,DynTanh和TaperNorm等替代方案在消除逐token统计计算的同时保持训练稳定性。
- SwiGLU的性能优势源于其对离群值驱动的重缩放的支持能力,而非简单的泛化改进。
- 状态空间模型(Mamba)和混合架构(Native Hybrid Attention)在长上下文场景中提供了Transformer的可行替代。
- 基座模型架构已收敛到“RMSNorm + SwiGLU + RoPE + GQA”模板,但MoE和MLA等变体正在重新定义这一标准。
- 线性注意力与RoPE的结合可重写为Mamba形式,揭示了两种架构的深层数学联系。
#原理与演进
#一层 Decoder 的信息流
- token embedding 给出初始 ;注意力根据 Q/K 相似度混合历史位置的 V;MLP 再逐位置变换特征。
- 因果 mask 使位置 不能看 之后的 token,保证训练目标与自回归生成一致。
- 对第 个查询与第 个键,因果 mask 在满足下式时赋值 ,其 softmax 权重便为零:
- 下式所示的缩放可避免维度增大时点积幅度过大、softmax 过于尖锐。多个头各自投影,再拼接输出。Transformer 原论文
#2025–2026 年的核心约束转移
早期研究主要关注自注意力的计算复杂度,但大规模部署表明推理时的KV Cache内存占用已成为可扩展性、延迟和能效的主要瓶颈。这一约束转移驱动了三条并行的架构演进路线:
- 压缩KV Cache:MLA(Multi-head Latent Attention)通过低秩联合压缩将KV Cache降低到MHA的约4%,同时保持或超越MHA的性能。
- 替代注意力:状态空间模型(Mamba系列)和线性注意力以线性时间建模序列,从根本上消除KV Cache。
- 混合架构:Native Hybrid Attention(NHA)在统一层设计中融合线性注意力和全注意力,通过滑动窗口大小这一单一超参数在纯线性与全注意力之间平滑调节。
#1. 注意力机制的变体
#1.1 Multi-head Latent Attention (MLA)
MLA的核心思想是将Key和Value投影到低维潜在空间,通过低秩联合压缩减少KV Cache。设潜在维度为 ,MLA将KV Cache从 降低到 ,当 时压缩效果显著。
DeepSeek-V3采用MLA作为默认注意力机制,在保持128K上下文能力的同时大幅降低推理内存。Latent-Condensed Attention(LCA)进一步在MLA的潜在空间中直接压缩上下文,将表示解耦为语义潜在向量和位置键,在128K上下文下实现最高2.5倍prefill加速和90% KV Cache缩减。
#1.2 原生混合注意力(NHA)
NHA解决线性注意力在长上下文召回精度上的不足。其设计为:用线性RNN更新的key-value槽维护长期上下文,用滑动窗口的短期token增强这些槽,然后对所有key和value应用单一softmax注意力操作,实现逐token和逐头的上下文依赖加权,无需额外融合参数。
层间行为通过单一超参数——滑动窗口大小控制,可在纯线性注意力和全注意力之间平滑调节,同时保持所有层结构统一。预训练LLM可通过NHA进行结构混合化,在保持竞争力的准确率的同时获得显著效率增益。
#1.3 稀疏与结构化注意力
ScoPE(Scoped Position Encoding)将结构化稀疏重新构想为内在的位置编码机制:为注意力头分配指数缩放的look-back范围,将多头注意力转化为层次化处理器,序感知视野随深度指数增长至序列长度。
ScoPE无参数且不依赖脆弱的位运算,通过掩码大部分注意力计算显著提升效率,在长上下文下理论注意力FLOPs减少8倍。在LLaMA-3-8B上的评估显示,ScoPE在原生长度外推和检索保真度上均优于RoPE,同时大幅降低训练和推理延迟。
#2. 位置编码的变体
#2.1 RoPE的Fourier障碍
研究证明RoPE和所有双线性正交位置编码在相对距离上计算有限傅里叶级数——这一Fourier障碍通过Gibbs现象从结构上限制了外推能力。
Hamiltonian Attention通过在每个注意力头添加个内容门控的阻尼余弦通道来突破这一障碍。等计算量变体(Ham-iso)复用现有头维度,添加零参数和零速度开销。在1.15B规模上,Ham-iso匹配ALiBi的PPL 18.1并比RoPE(19.0)优5%,在4倍上下文外推时保持平坦(18.7 vs RoPE的35.7)。
研究建立了缩放律:位置编码方法之间的质量差距按下式衰减,在十亿参数以上收敛至零——但外推差距不闭合,使位置先验的选择对长度泛化至关重要。
#2.2 其他位置编码变体
| 方法 | 核心机制 | 关键结果 |
|---|---|---|
| CirPE | 用代数推导的频率替代RoPE的启发式频率表 | RoPE的即插即用替代 |
| PaTH | 基于Householder变换累积乘积的数据依赖位置编码 | 在合成基准和中等规模语言建模上优于RoPE |
| PoPE | 极坐标位置嵌入,消除“什么”与“哪里”的混淆 | 在评估损失和下游任务上优于RoPE |
| GRAPE | 统一框架,组合乘法旋转和加法logit偏置 | 将RoPE和ALiBi作为特例包含 |
| ScoPE | 结构化稀疏作为内在位置编码 | 8倍注意力FLOPs缩减,优于RoPE的外推能力 |
#3. 归一化的变体
#3.1 归一化消除的趋势
近期工作正在质疑归一化层是否必要,提出轻量或混合策略来减少或完全消除归一化。
Dynamic Tanh (DynTanh) 是首个在Transformer中成功替代LayerNorm的无归一化方案。其核心观察是:深层LayerNorm往往诱导tanh-like S形激活映射。DynTanh用下式所示的简单逐元素函数替代统计量计算,其中 是自适应输入分布的可学习标量。在LLaMA-7B上,每层推理时间减少超过50%,整体训练速度提升约8%。
TaperNorm 采用渐进式策略:训练早期完全表现为标准RMSNorm,随后平滑过渡为与样本无关的仿射映射。在推理时,逐token统计量消失,固定缩放可折叠到相邻线性投影中,在last-token logits模式下实现最高1.22倍吞吐提升。
#3.2 归一化变体的核心洞察
TaperNorm的理论分析揭示了尺度锚定是关键角色:输出归一化作为近零次齐次映射,移除了输出的径向梯度;没有这种锚定,交叉熵会鼓励无界的logit增长(“logit chasing”)。
这一发现的方法论意义在于:归一化的核心功能不是“标准化输入分布”,而是防止logit幅度失控。任何提供尺度锚定的机制都可以替代归一化,这解释了为什么TaperNorm在训练早期保持标准归一化、后期移除后仍能稳定训练。
#4. 激活函数的变体
#4.1 SwiGLU的优势来源
SwiGLU已成为LLaMA、Qwen、DeepSeek等几乎所有现代开源LLM的FFN默认选择。
统一分析框架揭示:GLU和SwiGLU的性能差距主要源于它们对离群值驱动的重缩放的支持能力差异,而非简单的泛化改进。这也解释了为什么更容易产生离群值的高阶激活函数(如ReLU²或PolyNorm)在需要这种重缩放时可能更具优势。当通过GatedNorm显式提供重缩放时,模型对影响离群值生成的架构选择变得鲁棒。
#4.2 不同激活函数的权衡
| 激活函数 | 优势 | 局限 | 适用场景 |
|---|---|---|---|
| ReLU | 简单、计算高效 | 表达能力有限,存在死区 | 轻量模型 |
| GELU | 平滑、梯度性质好 | 计算效率一般 | 通用模型 |
| SwiGLU | 性能与效率平衡,支持离群值重缩放 | 双支路增加参数 | 大规模LLM标配 |
| ReLU² | 更容易产生离群值,利于重缩放 | 训练稳定性需控制 | 特定架构需求 |
在7B–13B规模上,相比ReLU/GELU,SwiGLU能在有限参数下挖掘更多特征信息,提升小模型的“性价比”。
#5. 注意力替代架构
#5.1 状态空间模型(Mamba)
Mamba用可选择的线性递归完全取代注意力,通过线性微分方程系统建模序列,可用卷积核高效求解。Mamba-2和Mamba-3进一步优化了结构化状态空间的设计。
在生产部署中,状态空间模型展现出优越的内存扩展性,但在训练稳定性和延迟分析方面引入了独特挑战。
#5.2 混合架构
英伟达Nemotron-H用Mamba-2取代大多数注意力层(约8%的层仍是注意力层,大约12层中有1层),56B版本在MMLU-Pro上击败Qwen-2.5-72B,速度还快得多。Nemotron-3(2026年6月)是混合Mamba-Transformer MoE系列。
Bamba和IBM Granite等混合架构融合了SSM效率与Transformer精度。线性注意力与RoPE的结合可重写为Mamba形式,揭示了两种架构的深层数学等价性。
#6. 基座模型谱系与架构收敛
#6.1 “LLaMA架构模板”成为事实标准
RMSNorm + SwiGLU + RoPE + GQA 的组合已成为事实上的标准架构模板,被Llama、Qwen、DeepSeek等主流模型采用。
| 模型家族 | 核心架构 | 关键创新 | 上下文 |
|---|---|---|---|
| Llama 3.1 | 优化Transformer | GQA | 64K |
| Qwen3 | 混合Transformer + KG | INT8/FP16量化 | 64K–256K |
| DeepSeek-V3/R1 | MoE(16专家,动态路由) | MLA + FlashAttention-2 + RoPE | 128K |
| Llama 4 Maverick | MoE(2个活跃专家,每个8192隐藏单元) | 经典MoE设置 | — |
#6.2 架构分歧点
尽管基本组件趋同,主流模型在MoE设计上出现分化:
- DeepSeek-V3采用9个活跃专家(每个2048隐藏单元),细粒度专家分工
- Llama 4 Maverick采用较少但更大的专家(2个活跃专家,每个8192隐藏单元),经典MoE设置
这一分歧反映了MoE设计中专家数量与专家容量的权衡:更多小专家提供更细粒度的条件计算,但增加路由复杂度和通信开销;更少大专家降低路由难度,但条件计算的灵活性下降。
#7. 复杂度与真实瓶颈
全注意力单层约需 计算,FFN 约 。短序列/大隐藏维度时 FFN 也可能主导;长序列注意力比例升高。FlashAttention 保留精确注意力的数学结果,通过分块减少 HBM 读写,不把全注意力计算复杂度改成线性。【硬件效率](../01_基础设施层/03_算子、带宽与Roofline模型.md)
但2025–2026年的部署经验表明,推理阶段的主要瓶颈已从计算复杂度转向KV Cache内存。FlashAttention-3等硬件感知的精确注意力方案和MLA等潜在压缩注意力方案成为解决长上下文部署的关键。
#8. 架构演进并非单线替代
RNN串行瓶颈 → Transformer并行训练与长程访问 → RoPE/相对位置提升序列建模 → GQA/MQA降解码KV成本 → MLA进一步压缩KV Cache → MoE扩总参数而控制激活计算 → 混合SSM-Transformer架构在长上下文场景中提供替代路径。每一步解决不同约束,并有代价。
“基座模型”是大规模通用预训练后可迁移的模型资产,不等于某个固定结构;同一基座可经SFT、领域继续预训练、量化获得不同派生模型,制品血缘见模型版本。
#9. 参数量从一层推出来
对于隐藏维度 、FFN 中间维度满足式(1)的简化 Decoder 层,Q/K/V/O 四个投影约 参数,两层普通 FFN 约为式(2),合计约 ; 层约 ,再加词嵌入约 。
式(1):
式(2):
层数线性增加参数量;隐藏维度增大时主干参数近似二次增长。MoE 把 FFN 换成多个专家后,总参数可以增加而每 token 仅用少数专家,见MoE。
#10. 为什么残差与归一化影响可训练深度
深层网络若每层都完全改写状态,反向梯度经过多个雅可比矩阵相乘,可能消失或爆炸。下式所示残差结构形成恒等路径,其雅可比为 ,使信息和梯度有更直接的路径。归一化调节每层输入尺度,但不同Norm的计算、数值稳定性和最终表示并不相同。
Pre-Norm 在子层前归一化,常有利于深层训练稳定;Post-Norm 在残差合并后归一化,可能需要更精细的初始化或学习率设计。TaperNorm的分析进一步表明,归一化在输出端的关键作用是移除径向梯度,防止logit幅度无界增长;这一功能可以通过显式的尺度锚定损失来替代。
#11. 训练与推理的复杂度不是同一口径
训练一个长度 的序列时,所有 token 可并行参与矩阵运算;推理生成长度 时,输出位置必须串行产生。KV Cache 缓存历史 K/V 后,解码不再重算旧 token 的投影,但每一步仍需读取历史 KV。故模型的训练 FLOPs、prefill FLOPs、decode 时延与显存占用应分别计算。推理模块
#原始资料
- Beyond Attention Complexity: A Survey of Efficient and Frugal Transformers for Long-Context Deployment
- Challenging Quadratic Attention: A Holistic View On the Rise of Alternative Language Model Architectures
- The Fourier Barrier in Attention and a Scaling Law for Position Encoding
- SCOPE: Boosting LLM Efficiency with Scoped Position Encoding
- Native Hybrid Attention for Efficient Sequence Modeling
- A Unified View of Attention and Residual Sinks: Outlier-Driven Rescaling
- Post-Transformer Architectures in 2025: Mamba, RWKV, and Hybrid Models in Production
- Dynamic Tanh: A Lightweight Normalization-Free Alternative
- TaperNorm: Gated Removal of Normalization in Transformers
- Meta-analysis of Large Language Models: Benchmarking DeepSeek-R1