GPU 是 LLM 推理的唯一载体,理解其架构是性能优化的前提。
前置知识
为什么 FDE 需要懂 GPU
推理优化的最终战场在 GPU 上。从模型量化、算子融合、KV Cache 管理到多卡部署,每一项优化都建立在对 GPU 硬件的理解之上。面试中经常考察:为什么 decode 阶段是 memory-bound?为什么要用 Tensor Core?如何选 GPU 性价比最高?这些问题的答案都在架构细节里。
核心概念:GPU 架构概览
层级结构
GPU 的架构是一个严格的层级树,从大到小:
关键路径 :数据从 HBM 经过 L2、L1/Shared Memory 到达 SM,在 SM 中由 Tensor Core 或 CUDA Core 执行计算,结果写回。每一步的延迟和带宽差异巨大。
SM(Streaming Multiprocessor)—— GPU 的基本执行单元
SM 是 GPU 中真正的 "计算核心"。可以把它类比为 CPU 的一个核心,但设计理念完全不同:
SM 的核心优势是 极高并发度 :单个 SM 可容纳 2048 个线程(Hopper),整个 H100 SXM 可以同时运行超过 34 万个活跃线程。
Warp —— SIMT 执行的基本单位
Warp 是 32 个线程的组。SM 以 warp 为单位调度指令:
Tensor Core —— LLM 推理的核心引擎
Tensor Core 是 NVIDIA Volta(2017)引入的专用矩阵乘法单元,到 Hopper 已经进化到第五代。
为什么 Tensor Core 是 LLM 推理的核心?
MMA(Matrix Multiply-Accumulate)指令 :一次指令完成 D = A 乘以 B + C,其中 A、B、C 都是矩阵块。Hopper 第五代 Tensor Core 支持 FP8 精度下的 512 TOPS/SM,比 FP32 快 1000 倍以上。
混合精度推理 :权重和激活用 FP8/FP16/BF16(低精度、省带宽),累加用 FP32(高精度、保精度)。这种精度策略大幅降低了显存带宽需求。
LLM 的本质是矩阵乘法 :Attention 的 QKV 投影、MLP 的线性层全部是 GEMM(General Matrix Multiply),这正是 Tensor Core 最擅长的操作。LLM 中 95% 以上的计算量在 GEMM 上。
CUDA Core vs Tensor Core
SIMT vs MIMD —— GPU 与 CPU 的本质差异
理解这一点是理解一切 GPU 性能优化的基础:
GPU 适合矩阵运算的根本原因: 矩阵乘法的每个输出元素计算是独立的 ,可以分配给不同的 warp 同时执行。GEMM 的 O(n 的三次方) 计算量和 O(n 平方) 数据量使得计算强度高,能够充分利用 GPU 的算力。
NVIDIA GPU 产品线对比
推理场景关键参数表
H100 vs A100 关键差异
H100 相比 A100 的改进是代际性的,不只是 "更快一点":
HBM3 vs HBM2e :带宽从 2.0 TB/s 提升到 3.35 TB/s(提升 67.5%)。这直接决定了 decode 阶段的 throughput 上限。
NVLink 4.0 :带宽从 600 GB/s 提升到 900 GB/s(提升 50%)。对于 TP(张量并行)通信延迟影响巨大。
FP8 支持 :H100 原生支持 FP8 Tensor Core,相比 FP16 几乎 双倍 throughput 。这是 H100 推理性能的核心优势。FP8 量化正在成为 LLM 推理的事实标准。
Transformer Engine :H100 内置硬件级的自动混合精度引擎,可自动选择 FP8/FP16/BF16。
SM 数量 :H100 SXM 168 个 vs A100 SXM 108 个(增加 56%),FP16 Tensor 吞吐增加 217%。
深入:GPU 硬件层次详解
GPC 与 TPC
在 SM 之上,GPU 还有两层组织结构:
对推理而言,我们主要关心 SM 和 Tensor Core,GPC/TPC 是物理组织层面,不影响编程模型。
GPU 代际演进:从 CUDA 到 Blackwell
对 FDE 的意义 :架构代际直接决定了你能用什么精度。Ampere(A100)不支持 FP8,所以 FP8 量化在 A100 上无法使用 Tensor Core 加速。
MIG(Multi-Instance GPU)
MIG 是 Ampere(A100/A30)引入的功能,可以将一张物理 GPU 切分成最多 7 个完全隔离的 GPU 实例:
部署视角:GPU 选型指南
按场景选 GPU
选型核心指标
面试视角
进阶问题
1."GPU 的 GPC、TPC、SM 之间是什么关系?"
2."CUDA Core 和 Tensor Core 的数量关系?"
3."Blackwell(B200)相比 H100 有什么改进?"
4."Vera Rubin(2026)有什么突破?"
常考问题
1."GPU 和 CPU 的架构区别是什么?为什么 GPU 适合 LLM 推理?"
2."什么是 Tensor Core?它和普通 CUDA Core 的区别?"
3."H100 相比 A100 有哪些关键升级?对推理有什么影响?"
4."什么是 warp?什么是 warp divergence?"
5."70B 模型怎么部署?需要什么样的 GPU 配置?"
6."MIG 是什么?什么场景适合用?"
最佳实践
快速参考:关键公式
术语速查表