BatchNorm、 LayerNorm、 GroupNorm: 区别 只在 一个 维度
三种归一化做的是同一件事——减均值、除标准差、再仿射,唯一的区别是统计量在哪些维度上求。想透这一点,选型、Transformer 为何弃用 BN、以及推理时能否折叠,都成了推论。
Inference optimisation9 min · 3.6K characters
Topic index
1 post
三种归一化做的是同一件事——减均值、除标准差、再仿射,唯一的区别是统计量在哪些维度上求。想透这一点,选型、Transformer 为何弃用 BN、以及推理时能否折叠,都成了推论。