Track 03 · Compute Foundations
计算基础
从执行模型、内存层次和互联出发,建立解释 AI 工作负载的硬件直觉。
- 读者目标
- 把 CPU/GPU 架构概念映射到真实的吞吐、延迟与数据移动约束。
- 完成产出
- 能从指令、缓存、地址转换和互联解释性能上限,并与推理优化语言互译。
唯一入口
GPU Architecture Deep Dive 先建立 SIMT、SM、线程调度与内存层次的硬件地图。 从这里开始
-
阶段一 执行模型
从流水线和指令接口理解硬件如何发出并完成工作。
-
阶段二 内存与拓扑
理解数据放在哪里、如何被定位,以及远近访问为什么不同。
-
阶段三 连接到 AI 系统
把架构术语转换为模型执行、数据搬运和多卡通信决策。