Stable LatentMoE: 896 选 16 的 极端 稀疏 怎么 才不 训崩
MoE 越稀疏越省算力,也越容易训崩。K3 把稀疏度推到 896 选 16(不到 2% 激活),靠归一化、SiTU-GLU、Quantile Balancing 三个稳定器把它拉住——名字里的 Stable 才是重点。
Model architecture7 min · 2.9K characters
Topic index
1 post
MoE 越稀疏越省算力,也越容易训崩。K3 把稀疏度推到 896 选 16(不到 2% 激活),靠归一化、SiTU-GLU、Quantile Balancing 三个稳定器把它拉住——名字里的 Stable 才是重点。