Kimi Delta Attention: 把 遗忘 门 做到 每个 通道
线性注意力想免掉 KV cache 的税,却一直打不过 full attention。KDA 只改了一件事——把 Gated DeltaNet 的标量遗忘门细化到逐通道,再配 3:1 混合全注意力,把线性注意力拉到能挑大梁的位置。
Model architecture9 min · 3.6K characters
Topic index
1 post
线性注意力想免掉 KV cache 的税,却一直打不过 full attention。KDA 只改了一件事——把 Gated DeltaNet 的标量遗忘门细化到逐通道,再配 3:1 混合全注意力,把线性注意力拉到能挑大梁的位置。