知识库 / 模型架构
GitHub
← 模型架构

LAYER 04 / MODEL ARCHITECTURE

多模态模型:音频、视频与世界模型

所属: 模型资产层。本页边界: 连续、高维、时序性的物理信号如何被离散化为语言模型可统一处理的 token,并在此基础上实现理解、生成与预测。

#核心公式

zmod=P fencoder(xmod),Lgen=−∑t=1Tlog⁡pθ(yt∣y<t,xtext,zmod) z_{\mathrm{mod}}=P\,f_{\mathrm{encoder}}(x_{\mathrm{mod}}), \qquad \mathcal L_{\mathrm{gen}} =-\sum_{t=1}^{T} \log p_\theta(y_t\mid y_{<t},x_{\mathrm{text}},z_{\mathrm{mod}})

第一式定义模态特征如何接入语言模型,第二式才是多模态生成训练真正优化的目标。在统一架构中,fencoderf_{\mathrm{encoder}} 和 PP 被原生表征空间取代,zmodz_{\mathrm{mod}} 与文本 token 嵌入共享同一计算路径。

#符号说明

符号 含义 典型对象
xmodx_{\mathrm{mod}} 图像、音频或视频等原始模态输入 连续信号
fencoderf_{\mathrm{encoder}} 对应模态的编码器 神经网络
PP 将编码器特征映射到语言模型隐藏维度的投影器 矩阵/网络
zmodz_{\mathrm{mod}} 语言模型可读取的模态表示 特征序列
xtextx_{\mathrm{text}} 文本问题、指令或上下文 token 序列
yt, y<ty_t,\ y_{<t} 第 tt 个答案 token 及其前缀 token / token 序列
pθp_\theta 参数为 θ\theta 的多模态生成模型 条件概率分布
Lgen\mathcal L_{\mathrm{gen}} 多模态条件生成的 token 级负对数似然 非负标量
TT 目标答案长度 token 数
B, τB,\ \tau 对比学习批大小与温度 正整数、正实数
s(⋅,⋅)s(\cdot,\cdot) 图文表征之间的相似度函数 标量
ziI,ziTz_i^I,z_i^T 批内第 ii 个图像表征与配对文本表征 向量
LI→T\mathcal L_{I\to T} 以图像查询配对文本的对比学习损失 非负标量
afa_f 第 ff 帧分配的视觉 token 预算 正整数
TtotalT_{\mathrm{total}} 总视觉 token 预算 正整数
WfW_f 第 ff 帧的任务重要性权重 [0,1][0,1]
Ianchor, Irecent, Imiddle\mathcal I_{\mathrm{anchor}},\ \mathcal I_{\mathrm{recent}},\ \mathcal I_{\mathrm{middle}} 锚定、近期、中间时间索引集 索引集合
MM 结构化记忆库中的记忆组 记忆 token 集合

#技术要点

  • 音频模态的架构演进方向是完全端到端的离散分词器,摒弃预训练编码器和异构 CNN 架构,用同构因果 Transformer 块联合优化编码、量化和解码。TAC/MOSS-Audio-Tokenizer 在语音、音效和音乐上以 16 亿参数在多种比特率下全面超越先前编解码器。
  • 视频模态的核心矛盾是信息密度与计算成本的冲突。任务感知的动态视觉预算分配在特征提取之前就为每帧分配 token 预算,而非在编码后压缩。
  • 世界模型分化出四条技术路线:视频生成式(像素级预测)、潜空间预测(JEPA)、3D 空间智能与具身操作。PAIWorld 以“几何先验驱动 + 多视角时空联合建模”登顶 WorldArena 榜单,Motion Smoothness 95.41 分,Trajectory Accuracy 领先第二名 7.4 分。
  • 统一多模态架构正从“外挂式拼接”走向“原生统一”。NEO-unify 完全去除视觉编码器和 VAE,构建统一表征空间。Ming-Flash-Omni 以 100B-A6B 稀疏 MoE 实现全模态统一。NExT-OMNI 用离散流匹配替代自回归范式实现任意到任意的统一建模。

#原理与演进

#模态如何进入语言模型

  • 图像编码器把像素分成 patch 或视觉特征;音频编码器处理连续声学信号;投影器 PP 把特征转成语言模型可接收的维度。
  • 接入可用“模态 token 与文本 token 拼接”,也可用跨注意力让文本位置读取外部模态特征。两者的上下文成本不同。
  • 视频把帧数、每帧 patch 数同时带入 token 预算;音频还涉及时间对齐与流式延迟。统一架构将这一接口内化到模型自身的表征学习中。

#训练信号逐步解决什么

阶段 目标 学到什么 局限
图文对比 匹配正确图文对 跨模态语义空间 不自动会多轮问答。CLIP 原论文
特征投影/对齐 让视觉特征进入 LLM 模态接口 可能只能描述常见对象
视觉指令微调 图像—问题—回答 按指令使用视觉证据 依赖数据质量与识别可靠性。LLaVA 原论文
端到端离散分词 从原始信号学习 token 统一离散接口 需要大规模数据与同构架构

图文对比训练可把同一批的其他图文对作为负例:

LI→T=−1B∑i=1Blog⁡exp⁡(s(ziI,ziT)/τ)∑j=1Bexp⁡(s(ziI,zjT)/τ) \mathcal L_{I\to T}=-\frac1B\sum_{i=1}^{B}\log\frac{\exp(s(z_i^I,z_i^T)/\tau)}{\sum_{j=1}^{B}\exp(s(z_i^I,z_j^T)/\tau)}

它学会“哪个描述更匹配图像”,但不自动学会按复杂指令逐步回答。

#1. 音频模型:端到端离散分词的架构收敛

音频处理的核心挑战在于其连续性(采样率、音高、音色)和时序性。主流架构经历了从级联式(ASR → LLM → TTS)到离散端到端的演进。

级联式架构路径清晰,但会丢失语调、说话人身份和非言语声音。离散端到端架构将连续音频信号转换为离散音频 token,与文本 token 拼接后交由同一个 LLM 处理。

#TAC / MOSS-Audio-Tokenizer:同构 Transformer 的端到端学习

TAC(Transformer-based Audio Tokenizer)的核心论点是:离散音频分词应当完全使用同构且可扩展的架构进行端到端学习。现有方法依赖预训练编码器、语义蒸馏或异构 CNN 架构,这些设计引入了固定的归纳偏置,限制了重建保真度并阻碍了有效规模扩展。

TAC 用纯粹基于因果 Transformer 块的架构,从零开始联合优化编码器、量化和解码器。MOSS-Audio-Tokenizer 是该架构的大规模实例,拥有 16 亿参数,在 300 万小时各类通用音频数据上预训练。

关键结果:

  • 在语音、音效和音乐上,各种比特率下始终优于先前编解码器,且随规模增加表现出可预测的改进。
  • 利用 TAC 的离散 token,开发了首个纯自回归 TTS 模型,性能超越先前的非自回归和级联系统。
  • 无需辅助编码器即可实现有竞争力的 ASR 性能。

TAC 的意义不在于某个具体指标,而在于它证明了同构、可扩展的端到端架构在音频领域同样适用,与文本和视觉领域的架构收敛趋势一致。

#2. 视频模型:任务感知的动态视觉预算

视频模型的核心矛盾是信息密度与计算成本的冲突。视频的 token 数量随帧数和分辨率呈爆炸式增长,简单均匀采样既浪费算力,又可能错过关键信息。

#从“编码后压缩”到“预算先行”

主流视频 MLLM 的效率方法在编码后压缩 token,迫使模型先承担全部密集像素处理的计算成本,然后才实现节省。ResAdapt 等框架改变了这一顺序:通过查询感知的分配器,在特征提取之前就为每帧分配视觉预算。

DyToK(Dynamic Token Allocation and Compression) 给出了具体的分配算法:

  1. 根据帧的重要性权重 WfW_f 初始化每帧的 token 分配如下
af∝Wf⋅Ttotal a_f \propto W_f \cdot T_{\mathrm{total}}
  1. 计算剩余 token 如下
Trem=Ttotal−∑faf T_{\mathrm{rem}} = T_{\mathrm{total}} - \sum_f a_f
  1. 将超出每帧上限 TmaxT_{\mathrm{max}} 的 token 重新分配给有容量余量的帧
  2. 按重要性排序,对每帧应用动态压缩函数 Compression(xf,af)\mathrm{Compression}(x_f, a_f)

这一策略将**“决定看什么”与“如何理解看到的内容”解耦**,使模型能够根据任务类型动态调整视觉预算:长时间/时间相关任务分配更多帧数,细节/空间相关任务在特定帧上分配更高分辨率。

#3. 世界模型:从像素预测到物理理解

世界模型的目标是让模型在内部构建对物理环境的模拟与预测能力。当前的架构探索分化为四条技术路线。

#3.1 视频生成式世界模型:PAIWorld

PAIWorld 以“几何先验驱动 + 多视角时空联合建模”为核心设计,在 WorldArena 榜单以 72.31 分登顶。其架构包含三个核心组件:

三维几何先验注入。 通过三维基础模型为模型注入空间一致性先验,将真实世界的深度结构、表面几何与遮挡关系作为显式约束嵌入生成过程,使模型在长时序、复杂交互场景下保持稳定一致的物体结构。

几何旋转位置编码(Geo-RoPE)。 将注意力头拆分为射线子空间(编码像素级三维射线方向)和位姿子空间(编码视角级相机位姿),使模型天然具备跨视角的三维几何感知能力。

多视角注意力机制。 在主干视频生成网络中引入多视角注意力,使模型在生成每一帧时都能跨视角对齐同一物理场景的几何与外观信息。

关键结果:Motion Smoothness 95.41 分,Trajectory Accuracy 领先第二名 7.4 分,证明模型在“时空一致、精准预测、遵循物理”的全链路能力上达到领先水平。

#3.2 JEPA 与结构化记忆:HERA

Yann LeCun 提出的联合嵌入预测架构(JEPA) 不预测像素,而是在潜在空间预测抽象表示。HERA 在冻结的 V-JEPA 2 预测器之上,仅训练结构化记忆库和交叉注意力读取器,实现了物理预测能力的增强。

HERA 的核心设计是将记忆组织为四个功能组:

  • Anchor memory:存储最早的上下文证据(初始物体身份、颜色、位置)
  • Middle memory:压缩中间的运动和交互历史
  • Recent memory:保留预测前瞬间的状态
  • Global memory:在粗粒度上概括完整上下文

这种按时间角色组织的结构化记忆,使早期证据在冻结预测器被要求使用之前就以稳定形式可用,解决了长时域物理预测中证据分布分散的问题。

#4. 统一多模态架构:从拼接走向原生

上述所有模态的终极架构趋势是从“外挂式”模块拼接,走向“原生统一”。

#4.1 NEO-unify:去除 VE 和 VAE 的原生统一

NEO-unify 的核心主张是完全去除视觉编码器(VE)和变分自编码器(VAE),构建统一的表征空间,并将统一性深入融入每一层计算中。

架构三要素:

  1. 近无损视觉接口:输入和输出都保持像素级保真度,不经过预训练编码器的有损压缩。
  2. 原生 Mixture-of-Transformer(MoT) :理解与生成在同一体系中协同进行,共享主干但保留各自的计算路径。
  3. 统一学习目标:文本用自回归交叉熵,视觉用像素流匹配(pixel flow matching)。

关键发现:即使理解分支保持冻结,生成分支仍能从近无损输入中恢复细粒度视觉细节(MS COCO 上 PSNR 31.56,SSIM 0.85)。理解与生成在 MoT 主干中协同演化,冲突最小。数据缩放效率显著优于拼接式方案,以更少的训练 token 达到更高性能。

#4.2 Ming-Flash-Omni:稀疏 MoE 的全模态统一

Ming-Flash-Omni 基于 Ling-2.0 的稀疏 MoE 变体,总参数量 1000 亿,但每 token 仅激活 61 亿参数。这一稀疏设计使模型能在极低的计算成本下大幅扩展容量,从而在视觉、音频、语言等多个模态上实现统一智能。

采用双平衡路由机制(Dual-Balanced Routing),在 MoE 架构中同时平衡专家负载和模态分布。集成 VideoRoPE 增强时序建模能力。

#4.3 NExT-OMNI:离散流匹配替代自回归

NExT-OMNI 用离散流匹配(Discrete Flow Matching, DFM) 替代自回归作为统一建模范式,是首个完全基于 DFM 的开源全模态基础模型。

与自回归逐 token 顺序生成不同,离散流模型从完全损坏的序列开始,并行地迭代去噪整个序列,从而实现更丰富的双向信息整合和灵活的任意到任意跨模态生成与理解。

架构上,NExT-OMNI 将视觉、文本、音频统一编码为离散 token 序列,用一个从 AR-LLM(Qwen2.5-7B)初始化的骨干在每层做多模态自注意力深度融合,整个序列在 DFM 范式下并行去噪预测,再由轻量的模态专属 head 解码回各模态。

在跨模态检索等需要深度特征融合的任务上,DFM 展现了相对于自回归范式的优势,多轮多模态交互和跨模态检索性能超越先前统一模型。

#5. 架构视角的统一

从架构角度看,音频、视频和世界模型的发展指向同一个方向:将物理世界的连续信号,通过可扩展的离散化接口,接入统一的表征空间,并在此基础上实现理解、生成与预测的闭环。

  • 音频的突破口在于端到端的离散分词器,用同构因果 Transformer 从原始波形中直接学习 token,证明了架构收敛趋势在音频域同样成立。
  • 视频的突破口在于任务感知的动态计算分配,在特征提取之前就决定“看什么”和“看多细”,而非在编码后被动压缩。
  • 世界模型的突破口在于将物理先验显式注入架构:PAIWorld 注入 3D 几何先验,HERA 用结构化记忆组织时间证据。
  • 统一模型的突破口在于摒弃模块拼接,在表征层面实现原生融合。NEO-unify 去除 VE/VAE,Ming-Flash-Omni 用稀疏 MoE 扩展容量,NExT-OMNI 用离散流匹配替代自回归。

这些方向并非相互独立:视频的任务感知机制可以用于音频,世界模型的几何先验可以注入统一模型,而统一模型的高效架构(MoT、稀疏 MoE、DFM)又为更复杂的世界模拟提供了基础设施。

原始资料:

交叉阅读:

本页由仓库中的 Markdown 生成。具体技术结论请结合正文引用与实验条件理解。

输入关键词,探索整个知识库

↑ ↓ 选择 ↵ 打开36 篇笔记,一次搜索