所有的推理优化最终都要落到 GPU 的物理特性上。不理解 GPU 的架构和显存模型,就无法理解"为什么 decode 是 memory-bound"、"为什么量化能加速"这些核心问题。
为什么这个模块对 FDE 至关重要
很多 FDE 候选人能说出 Transformer 的公式,但回答不了:
GPU 是推理的物理载体。一切优化手段——量化、PagedAttention、Continuous Batching、张量并行——本质上都是在和 GPU 的物理特性博弈。
GPU 架构全景图
关键数字(A100 80GB):
显存层级与性能关系
学习路径
模块知识结构图
前置知识
建议先完成模型是怎么工作的了解模型的计算特征(prefill 是 compute-bound,decode 是 memory-bound)。