模型架构
Attention Residuals:让每一层自己决定回头翻哪一层
残差连接十年没变——每层只读上一层,深了之后早期信号被一路加法稀释。AttnRes 给每层一个零初始化的 pseudo-query,让它在所有历史层输出上做注意力、按需聚合,只花约 4%/2% 开销。
7 分钟 · 2.8 千字
归档
12 篇
残差连接十年没变——每层只读上一层,深了之后早期信号被一路加法稀释。AttnRes 给每层一个零初始化的 pseudo-query,让它在所有历史层输出上做注意力、按需聚合,只花约 4%/2% 开销。
线性注意力想免掉 KV cache 的税,却一直打不过 full attention。KDA 只改了一件事——把 Gated DeltaNet 的标量遗忘门细化到逐通道,再配 3:1 混合全注意力,把线性注意力拉到能挑大梁的位置。
三种归一化做的是同一件事——减均值、除标准差、再仿射,唯一的区别是统计量在哪些维度上求。想透这一点,选型、Transformer 为何弃用 BN、以及推理时能否折叠,都成了推论。
注意力慢在访存,不在算力。FlashAttention 把 Q/K/V 分块搬进 SRAM,用在线 softmax 保证分块结果与整行 softmax 逐位相等,N×N 中间矩阵从不落地显存。
KV 缓存的连续预分配会造成大量显存碎片,压低并发。vLLM 借用操作系统分页:KV 切成固定大小的块、用块表映射逻辑到物理,浪费压到一个块以内,相同前缀还能写时复制共享。
Paraformer 用 CIF 预测器解决了非自回归识别的长度对齐,得以一次并行输出整句。热词版再挂一条偏置注意力分支,推理时传入词表即可让人名、术语这些低频定制词被正确召回。