FlashQLA:面向 Gated Delta Network 的融合线性注意力算子库
GitHub 引言 # 自 Qwen3-Next 发布以来,Gated Delta Network (GDN) 已经成为 Qwen 全系列的主力注意力层 —— 从 Qwen3-Next-80B-A3B 一路延伸到后续推出的 Qwen3.5 / Qwen3.6 系列。随着模型规模扩展到 397A17B / 122A10B / 35B / 27B ,上下文长度突破 256K,GDN 这一模块在端到端训练与推理中的开销也变得不可忽视。 今天我们正式开源 FlashQLA : 一个基于 TileLang 实现的高性能线性注意力算子库。FlashQLA 将 GDN Chunked Prefill 的前向和反向 进行了合理的算子融合与性能优化 ,在 NVIDIA Hopper 上实现多场景相较于 FLA triton Kernel 2-3× 前向加速 和 2× 反向加速 。对于预训练场景和端侧 agentic 推理效率提升明显。 本次发布的核心亮点: Gate 驱动的自动化卡内序列并行 。利用 GDN gate 的指数衰减性质,FlashQLA 在 TP、长序列、小头数等场景下自动开启卡内序列并行