LAYER 01 / INFRASTRUCTURE
基础设施
从计算与存储出发,理解模型背后的物理约束。
GPU · HBM · Roofline · 8 篇笔记0102030405060708
异构计算:CPU、GPU、TPU与NPU
不同处理器怎样执行张量计算,以及为什么 LLM 主体依赖加速器。
13 分钟阅读存储层次:寄存器、SRAM、HBM与DRAM
为什么同一模型的不同阶段会分别受计算和显存带宽限制。
11 分钟阅读算子、带宽与 Roofline 模型
怎样判断一个 kernel 是计算受限还是带宽受限。
14 分钟阅读节点内互联:PCIe、NVLink、NUMA 与 NVSwitch
同一服务器中多张加速卡为什么不是天然等价的并行资源。
15 分钟阅读跨节点网络与集合通信:从数据流到集群拓扑
解释多台服务器之间为什么需要通信、数据经过哪些硬件、网络怎样组织,以及 AllReduce、All-to-All 等集合通信如何利用物理网络。
24 分钟阅读分布式存储、数据读取与 Checkpoint
训练数据和模型状态怎样以足够吞吐被读取、保存和恢复。
13 分钟阅读容器、隔离与资源调度原理
多任务如何共享加速器而不混淆依赖、数据和资源边界。
13 分钟阅读边缘设备与端侧推理约束
端侧模型为何必须同时受内存、功耗、带宽和时延约束。
11 分钟阅读