Qwen3.8-Flash-Next:全新架构,迈向极致性价比
HUGGING FACE MODELSCOPE TECH REPORT FLASHQLA DISCORD 引言 # 我们此次发布 Qwen3.8-Flash-Next 的开源权重,这是一个开源权重的多模态 MoE 模型,同时作为 Qwen4 所用模型结构的先导预览。它承担的角色与 Qwen3-Next 对 Qwen3.5 的角色一致:当时引入的 Gated DeltaNet + Gated Attention 混合结构,此后被用于 Qwen3.5、Qwen3.6、Qwen3.7 与 Qwen3.8 系列。我们这次提前释出结构上的改动,以便在其上构建 Qwen4 完整模型家族之前,先让社区对其进行检验。 Qwen3.8-Flash-Next 围绕 Attention、Residual、Embedding 和 Optimization 四个方面对模型进行了系统升级,在提升模型能力的同时,进一步优化计算效率、模型容量和训练稳定性: Attention :采用 GDN + QSA Hybrid 架构 。Gated DeltaNet(GDN)高效压缩历史信息; Qwen Sparse Atten