模型架构
Kimi Delta Attention:把遗忘门做到每个通道
线性注意力想免掉 KV cache 的税,却一直打不过 full attention。KDA 只改了一件事——把 Gated DeltaNet 的标量遗忘门细化到逐通道,再配 3:1 混合全注意力,把线性注意力拉到能挑大梁的位置。
9 分钟 · 3.6 千字
主题索引
1 篇
线性注意力想免掉 KV cache 的税,却一直打不过 full attention。KDA 只改了一件事——把 Gated DeltaNet 的标量遗忘门细化到逐通道,再配 3:1 混合全注意力,把线性注意力拉到能挑大梁的位置。