模型架构
Attention Residuals:让每一层自己决定回头翻哪一层
残差连接十年没变——每层只读上一层,深了之后早期信号被一路加法稀释。AttnRes 给每层一个零初始化的 pseudo-query,让它在所有历史层输出上做注意力、按需聚合,只花约 4%/2% 开销。
7 分钟 · 2.8 千字
主题索引
1 篇
残差连接十年没变——每层只读上一层,深了之后早期信号被一路加法稀释。AttnRes 给每层一个零初始化的 pseudo-query,让它在所有历史层输出上做注意力、按需聚合,只花约 4%/2% 开销。