知识库 / 模型架构
GitHub
← 返回知识地图

LAYER 04 / MODEL ARCHITECTURE

模型架构

理解概率、注意力与模型结构之间的联系。

Transformer · MoE · 多模态 · 5 篇笔记
01

概率语言模型:条件概率与生成

语言模型如何把序列表示为条件概率分布,以及这一表示框架的结构性边界与扩展方向。

13 分钟阅读
02

Transformer 与基座模型

自注意力如何在序列位置间按内容建立信息交互,以及2025–2026年主流变体如何在不同约束下重新分配计算、内存和表达能力。

12 分钟阅读
03

长上下文

模型“能利用多长的上下文”由哪些条件共同决定,以及这一能力在训练、推理和检索之间的取舍。

10 分钟阅读
04

MoE:条件计算与路由

怎样以稀疏激活增加参数容量,以及路由为何成为瓶颈。

12 分钟阅读
05

多模态模型:音频、视频与世界模型

连续、高维、时序性的物理信号如何被离散化为语言模型可统一处理的 token,并在此基础上实现理解、生成与预测。

10 分钟阅读

输入关键词,探索整个知识库

↑ ↓ 选择 ↵ 打开36 篇笔记,一次搜索