推理优化BatchNorm、LayerNorm、GroupNorm:区别只在一个维度三种归一化做的是同一件事——减均值、除标准差、再仿射,唯一的区别是统计量在哪些维度上求。想透这一点,选型、Transformer 为何弃用 BN、以及推理时能否折叠,都成了推论。07-28·9 分钟 · 3.6 千字