模型架构
Stable LatentMoE:896 选 16 的极端稀疏怎么才不训崩
MoE 越稀疏越省算力,也越容易训崩。K3 把稀疏度推到 896 选 16(不到 2% 激活),靠归一化、SiTU-GLU、Quantile Balancing 三个稳定器把它拉住——名字里的 Stable 才是重点。
7 分钟 · 2.9 千字
主题索引
3 篇
MoE 越稀疏越省算力,也越容易训崩。K3 把稀疏度推到 896 选 16(不到 2% 激活),靠归一化、SiTU-GLU、Quantile Balancing 三个稳定器把它拉住——名字里的 Stable 才是重点。
残差连接十年没变——每层只读上一层,深了之后早期信号被一路加法稀释。AttnRes 给每层一个零初始化的 pseudo-query,让它在所有历史层输出上做注意力、按需聚合,只花约 4%/2% 开销。
线性注意力想免掉 KV cache 的税,却一直打不过 full attention。KDA 只改了一件事——把 Gated DeltaNet 的标量遗忘门细化到逐通道,再配 3:1 混合全注意力,把线性注意力拉到能挑大梁的位置。