推理优化PagedAttention:用操作系统分页管好 KV 缓存KV 缓存的连续预分配会造成大量显存碎片,压低并发。vLLM 借用操作系统分页:KV 切成固定大小的块、用块表映射逻辑到物理,浪费压到一个块以内,相同前缀还能写时复制共享。07-18·4 分钟 · 1.8 千字