推理优化
FlashAttention:把注意力的瓶颈从算力挪回访存
注意力慢在访存,不在算力。FlashAttention 把 Q/K/V 分块搬进 SRAM,用在线 softmax 保证分块结果与整行 softmax 逐位相等,N×N 中间矩阵从不落地显存。
6 分钟 · 2.5 千字
主题索引
1 篇
注意力慢在访存,不在算力。FlashAttention 把 Q/K/V 分块搬进 SRAM,用在线 softmax 保证分块结果与整行 softmax 逐位相等,N×N 中间矩阵从不落地显存。