推理优化
BatchNorm、LayerNorm、GroupNorm:区别只在一个维度
三种归一化做的是同一件事——减均值、除标准差、再仿射,唯一的区别是统计量在哪些维度上求。想透这一点,选型、Transformer 为何弃用 BN、以及推理时能否折叠,都成了推论。
9 分钟 · 3.6 千字
主题索引
3 篇
三种归一化做的是同一件事——减均值、除标准差、再仿射,唯一的区别是统计量在哪些维度上求。想透这一点,选型、Transformer 为何弃用 BN、以及推理时能否折叠,都成了推论。
注意力慢在访存,不在算力。FlashAttention 把 Q/K/V 分块搬进 SRAM,用在线 softmax 保证分块结果与整行 softmax 逐位相等,N×N 中间矩阵从不落地显存。
KV 缓存的连续预分配会造成大量显存碎片,压低并发。vLLM 借用操作系统分页:KV 切成固定大小的块、用块表映射逻辑到物理,浪费压到一个块以内,相同前缀还能写时复制共享。