AI2026年7月14日LLM 推理优化推理为什么慢 LLM 推理是自回归的——每次生成一个 token,需要重新计算整个序列的注意力。这导致计算量随序列长度平方增长。 KV Cache 推理时将之前计算的 Key 和 Value 矩阵缓存起来,新 token 只需要计算增量部分...LLM推理优化