Attention 机制
本专题收录各种 Attention(注意力)机制 的原理、变体与工程实现, 覆盖从标准 Softmax Attention 到线性注意力、稀疏/压缩注意力及其与 SSM 的联系, 作为理解大模型架构演进的基础专题。
核心脉络
- 标准 Softmax Attention:, 表达力强但复杂度 ,长上下文下计算与显存开销大。
- 高效注意力(线性 / 稀疏 / 压缩):通过核化、稀疏化或状态压缩降低复杂度, 在表达力、并行性与实际延迟之间权衡。
- 与 SSM / Mamba 的联系:线性注意力与选择性状态空间模型在 结构化矩阵(半可分矩阵 / SSD 框架)下存在形式化对偶。
收录条目
- Gated Delta Network(GDN) — 门控 + delta 更新规则的递推公式、WY 表示与 chunkwise 并行训练、 长序列递推中"逐 token"与"分块并行"的真实关系。
(待补充:Multi-Head / Grouped-Query / Multi-Query Attention、FlashAttention、 稀疏与压缩注意力(如 CSA2)、Sliding Window / 局部注意力、KV 压缩等。)
相关: DeepSeek-V4.1-Flash 的压缩稀疏注意力实现。
© 2026 Yang Huan · yanghuan9812@qq.com