跳转到主要内容
← 三条旗舰路线

Track 03 · Compute Foundations

计算基础

从执行模型、内存层次和互联出发,建立解释 AI 工作负载的硬件直觉。

读者目标
把 CPU/GPU 架构概念映射到真实的吞吐、延迟与数据移动约束。
完成产出
能从指令、缓存、地址转换和互联解释性能上限,并与推理优化语言互译。
唯一入口

从这里开始

GPU Architecture Deep Dive 先建立 SIMT、SM、线程调度与内存层次的硬件地图。
  1. 阶段一

    执行模型

    从流水线和指令接口理解硬件如何发出并完成工作。

    1. 1.1 Pipeline 用冒险、停顿和并行度建立 CPU 执行直觉。
    2. 1.2 PTX 技术详解 理解 CUDA 程序到 SIMT 执行之间的中间表示。
    3. 1.3 AMX 指令 以 Tile 与矩阵乘为例连接 ISA、数据格式和吞吐。
  2. 阶段二

    内存与拓扑

    理解数据放在哪里、如何被定位,以及远近访问为什么不同。

    1. 2.1 Cache 掌握局部性、映射、替换与一致性的基本约束。
    2. 2.2 MMU 沿页表遍历理解虚拟地址到物理访问的代价。
    3. 2.3 Numa and Socket 把访问延迟放回 Socket 和 NUMA 拓扑。
  3. 阶段三

    连接到 AI 系统

    把架构术语转换为模型执行、数据搬运和多卡通信决策。

    1. 3.1 GPU Communication 理解 NVLink、NVSwitch 与跨设备数据路径。
    2. 3.2 Compute-bound vs Memory-bound:推理的两大瓶颈 用 Roofline 把硬件上限接到推理 workload。
    3. 3.3 从 AVX/AMX 到 Tensor Core:CPU 工程师理解 LLM 量化 把 AVX/AMX/Cache 心智模型迁移到 Tensor Core、HBM 与量化。