知识库 / 基础设施
GitHub
← 返回知识地图

LAYER 01 / INFRASTRUCTURE

基础设施

从计算与存储出发,理解模型背后的物理约束。

GPU · HBM · Roofline · 8 篇笔记
01

异构计算:CPU、GPU、TPU与NPU

不同处理器怎样执行张量计算,以及为什么 LLM 主体依赖加速器。

13 分钟阅读
02

存储层次:寄存器、SRAM、HBM与DRAM

为什么同一模型的不同阶段会分别受计算和显存带宽限制。

11 分钟阅读
03

算子、带宽与 Roofline 模型

怎样判断一个 kernel 是计算受限还是带宽受限。

14 分钟阅读
04

节点内互联:PCIe、NVLink、NUMA 与 NVSwitch

同一服务器中多张加速卡为什么不是天然等价的并行资源。

15 分钟阅读
05

跨节点网络与集合通信:从数据流到集群拓扑

解释多台服务器之间为什么需要通信、数据经过哪些硬件、网络怎样组织,以及 AllReduce、All-to-All 等集合通信如何利用物理网络。

24 分钟阅读
06

分布式存储、数据读取与 Checkpoint

训练数据和模型状态怎样以足够吞吐被读取、保存和恢复。

13 分钟阅读
07

容器、隔离与资源调度原理

多任务如何共享加速器而不混淆依赖、数据和资源边界。

13 分钟阅读
08

边缘设备与端侧推理约束

端侧模型为何必须同时受内存、功耗、带宽和时延约束。

11 分钟阅读

输入关键词,探索整个知识库

↑ ↓ 选择 ↵ 打开36 篇笔记,一次搜索