模型架构
Attention Residuals:让每一层自己决定回头翻哪一层
残差连接十年没变——每层只读上一层,深了之后早期信号被一路加法稀释。AttnRes 给每层一个零初始化的 pseudo-query,让它在所有历史层输出上做注意力、按需聚合,只花约 4%/2% 开销。
7 分钟 · 2.8 千字
主题索引
2 篇
残差连接十年没变——每层只读上一层,深了之后早期信号被一路加法稀释。AttnRes 给每层一个零初始化的 pseudo-query,让它在所有历史层输出上做注意力、按需聚合,只花约 4%/2% 开销。
三种归一化做的是同一件事——减均值、除标准差、再仿射,唯一的区别是统计量在哪些维度上求。想透这一点,选型、Transformer 为何弃用 BN、以及推理时能否折叠,都成了推论。