模型架构
Stable LatentMoE:896 选 16 的极端稀疏怎么才不训崩
MoE 越稀疏越省算力,也越容易训崩。K3 把稀疏度推到 896 选 16(不到 2% 激活),靠归一化、SiTU-GLU、Quantile Balancing 三个稳定器把它拉住——名字里的 Stable 才是重点。
7 分钟 · 2.9 千字
主题索引
1 篇
MoE 越稀疏越省算力,也越容易训崩。K3 把稀疏度推到 896 选 16(不到 2% 激活),靠归一化、SiTU-GLU、Quantile Balancing 三个稳定器把它拉住——名字里的 Stable 才是重点。