推理为什么慢

LLM 推理是自回归的——每次生成一个 token,需要重新计算整个序列的注意力。这导致计算量随序列长度平方增长。

KV Cache

推理时将之前计算的 Key 和 Value 矩阵缓存起来,新 token 只需要计算增量部分。

Flash Attention

通过分块计算和 IO 优化,将注意力计算的显存访问降到最低。Flash Attention 2 比标准实现快 2-3 倍。

量化部署

将 FP16 模型量化为 INT8 或 INT4,显著降低显存占用和推理延迟。GGUF、AWQ 是常用的量化格式。

理解 Self-Attention 的计算过程是优化推理的基础,详见 Transformer 注意力机制详解