推理为什么慢
LLM 推理是自回归的——每次生成一个 token,需要重新计算整个序列的注意力。这导致计算量随序列长度平方增长。
KV Cache
推理时将之前计算的 Key 和 Value 矩阵缓存起来,新 token 只需要计算增量部分。
Flash Attention
通过分块计算和 IO 优化,将注意力计算的显存访问降到最低。Flash Attention 2 比标准实现快 2-3 倍。
量化部署
将 FP16 模型量化为 INT8 或 INT4,显著降低显存占用和推理延迟。GGUF、AWQ 是常用的量化格式。
理解 Self-Attention 的计算过程是优化推理的基础,详见 Transformer 注意力机制详解。