HUGGING FACE MODELSCOPE TECH REPORT FLASHQLA DISCORD
引言#
我们此次发布 Qwen3.8-Flash-Next 的开源权重,这是一个开源权重的多模态 MoE 模型,同时作为 Qwen4 所用模型结构的先导预览。它承担的角色与 Qwen3-Next 对 Qwen3.5 的角色一致:当时引入的 Gated DeltaNet + Gated Attention 混合结构,此后被用于 Qwen3.5、Qwen3.6、Qwen3.7 与 Qwen3.8 系列。我们这次提前释出结构上的改动,以便在其上构建 Qwen4 完整模型家族之前,先让社区对其进行检验。
Qwen3.8-Flash-Next 围绕 Attention、Residual、Embedding 和 Optimization 四个方面对模型进行了系统升级,在提升模型能力的同时,进一步优化计算效率、模型容量和训练稳定性:
- Attention:采用 GDN + QSA Hybrid 架构。Gated DeltaNet(GDN)高效压缩历史信息;Qwen Sparse Attention(QSA) 通过压缩式轻量 Indexer 在 micro-block 粒度上筛选重要上下文,显著降低长序列 Attention 开销。
- Residual:引入 Gated Residual(GR),将 Residual Stream 扩展为 4 条分支,并通过动态 Gate 控制信息读写,增强跨层信息传递和训练稳定性。
- Embedding:引入 N-gram Embedding,利用局部上下文进行查表,以很少的额外计算扩展模型容量;Embedding Table 可以卸载到 Host Memory,并通过异步 Prefetch 与模型计算重叠。
- Optimization:采用 Muon Optimizer,围绕正交化精度、Muon 与 AdamW 的参数分工以及融合参数拆分等策略进一步优化,并针对新架构重新拟合 Scaling Law。
Qwen3.8-Flash-Next 的主模型参数量为 125B,额外配备 51B 的 N-gram Embedding,每 token 激活 6B 参数。 相比于 Qwen3.7-Plus,Qwen3.8-Flash-Next 显著降低了训练与推理成本,训练开销仅约为前者的 1/9,但在编码和办公任务上却具有更强的能力。
它原生支持 262,144 token 上下文,并可通过 YaRN 扩展至 1,000,000 token。有关 Qwen3.8-Flash-Next 架构设计、训练方法和实验分析的更多技术细节,请参阅 GitHub 仓库中的技术报告。
Qwen3.8-Flash-Next 权重已在 Hugging Face 与 ModelScope 发布。默认 1M 上下文并内置官方工具的生产版本,以 Qwen3.8-Flash 名称在 千问AI平台 提供服务,每百万 Tokens 输入仅0.8元、输出2.7元。
模型表现#
纯文本#
| Qwen3.8-Flash-Next | Qwen3.8-27B | Qwen3.7-Plus | DeepSeek-V4-Flash-0731 | Claude-Opus-4.6 (Max) | |
|---|---|---|---|---|---|
# Params | 125B | 27B | 397B | 284B | -- |
# Activated params | 6B | 27B | 17B | 13B | -- |
# N-gram embedding params | 51B | -- | -- | -- | -- |
| Coding | |||||
Agentic coding DeepSWE 1.1 | 58.7 | 42.2 | 16.5 | 54.4 | -- |
Agentic coding SWE-bench Pro | 62.5 | 61.7 | 55.8 | 56.0 | 53.4 |
Multilingual software engineering SWE-bench Multilingual | 81.0 | 73.8 | 75.8 | -- | 77.5 |
Repo-level code generation NL2Repo-Bench | 48.1 | 42.3 | 41.1 | 54.2 | 47.6 |
| Agent | |||||
Long-horizon office work CoWorkBench | 73.9 | 70.7 | 65.1 | 45.1 | 68.2 |
Professional job tasks JobBench | 55.7 | 33.4 | 27.6 | 41.3 | 36.6 |
Frontier agentic tasks Agents' Last Exam | Pass@1 24.3 Score 51.2 | Pass@1 20.4 Score 42.9 | Pass@1 13.2 Score 33.6 | Pass@1 25.2 Score -- | -- |
Real-world tool use Toolathlon Verified (Pass@1) | 73.5 | 67.1 | 50.6 | 70.3 | -- |
| General | |||||
Instruction following IFBench | 81.3 | 79.5 | 79.1 | 79.2 | 62.5 |
Scientific reasoning GPQA Diamond | 91.7 | 89.2 | 90.3 | 90.8 | 91.3 |
Multidisciplinary reasoning HLE | 35.9 | 30.8 | 34.7 | 33.8 | 40.0 |
Competitive coding LiveCodeBench v6 | 91.9 | 90.3 | 89.6 | 90.6 | 88.8 |
1. DeepSWE 1.1:使用 Claude Code 和 mini-SWE-agent 评测框架评估,temp=1.0,top_p=0.95,上下文窗口 256K。我们报告两个框架中的最高分;值得注意的是,Qwen3.8-Flash-Next 在 mini-SWE-agent 上表现最佳。
2. SWE-bench Pro:除 Claude-Opus-4.6 (Max) 采用官方报告分数外,其余模型均使用 Claude Code 评测框架评估,temp=1.0,top_p=0.95,上下文窗口 256K。已修正存在问题的任务,并在修正后的基准上重新评估所有基线模型。
3. SWE-bench Multilingual:使用 mini-SWE-agent 评测框架评估,temp=1.0,top_p=0.95,上下文窗口 256K。
4. NL2Repo-Bench:使用 Claude Code 评测框架评估。为防止奖励黑客攻击,我们禁用了试图访问特定仓库的 Bash 命令,如 pip download、pip install 和 git clone。
5. CoWorkBench:内部 Cowork 基准,用于评估跨计算机科学、金融、法律、医疗及其他生产力领域的长周期办公与生产力智能体任务。
6. HLE:由 GPT-4o 评判。
7. 每行最优结果加粗。
8. 空白单元格(--):分数尚不可用或不适用。
多模态#
| Qwen3.8-Flash-Next | Qwen3.8-27B | Qwen3.7-Plus | Claude-Opus-4.6 (Max) | |
|---|---|---|---|---|
| Agentic Multimodal Intelligence | ||||
Multimodal tool use ClawEval-MM | Pass@3 64.4 Average 60.4 | Pass@3 57.4 Average 56.9 | Pass@3 57.4 Average 60.1 | Pass@3 52.5 Average 54.7 |
Application recreation RecreationBench | 49.9 | 47.1 | 30.2 | -- |
Mobile use AndroidWorld | 84.5 | 81.9 | 81.0 | 62.0 |
Computer use OSWorld 2.0 | Binary 19.4 Partial 52.3 | Binary 19.4 Partial 48.0 | Binary 2.8 Partial 21.5 | -- |
Visual web development Vision2Web | 64.0 | 62.9 | 42.1 | -- |
| General Multimodal Intelligence | ||||
Embodied intelligence ERQA | 72.3 | 65.5 | 69.8 | 40.8 |
Long video understanding LVBench | 76.6 | 72.4 | 76.2 | 63.0 |
Real-world perception RealWorldQA | 88.5 | 85.9 | 86.9 | 73.9 |
Visual math problem solving MathVision | Without CI 90.6 With CI 95.7 | Without CI 90.0 With CI 94.6 | Without CI 90.3 With CI 88.7 | Without CI 65.5 |
Scientific chart analysis CharXiv (RQ) | Without CI 84.6 With CI 90.6 | Without CI 83.7 With CI 90.2 | Without CI 85.8 With CI 85.9 | Without CI 66.0 |
1. ClawEval-MM:分数以「pass@3 / 平均分」的形式给出。pass@3 为三次试验中至少通过一次的比例,平均分为三次试验得分的均值。
2. RecreationBench:内部的长程应用复现 benchmark,用于评估覆盖五个平台的混合智能体能力——桌面(Ubuntu、macOS、Windows)、移动(Android)与网页。
3. OSWorld 2.0:分数以「binary / partial」的形式给出。binary 为获得完整任务奖励的任务占比,partial 为在所有任务上取得的部分奖励的汇总。
4. Vision2Web:取 frontend、webpage 与 website 三类的平均,使用 Claude Code harness,由 gpt-5.4-2026-03-05 评判。
5. MathVision、CharXiv (RQ):分数以「不含 CI / 含 CI」的形式给出。MathVision 中少量标注有误的 ground truth 已在人工核对后修正。我们的分数使用固定 prompt 评测,例如「Please reason step by step, and put your final answer within \boxed{}.」;对其他模型,我们取带与不带 \boxed{} 指令两次结果中的较高者。
6. 每行最优结果加粗。
7. 空白单元格(--):分数尚不可用或不适用。
模型结构#
Attention:GDN + QSA,高效记忆与精准检索#
传统 Full Attention 可以直接访问所有历史 token,但上下文越长,计算和 KV Cache 访存成本越高。
延续 Qwen3.5 的架构设计,Qwen3.8-Flash-Next 采用 GDN [1] + Attention 的 Hybrid 架构:每四层中三层使用 Gated DeltaNet(GDN),将历史信息持续压缩到固定大小的状态中;另一层保留全局 Attention,负责精确检索全局信息。
对于全局 Attention,我们进一步引入 Qwen Sparse Attention(QSA)。Sparse Attention 通过只关注重要上下文来减少长序列下的计算,但现有方案如 DSA [2] 通常仍需要一个 token 级 indexer 来寻找重要位置;随着上下文增长,indexer 本身的计算也会逐渐成为不可忽略的开销。
QSA 将这一过程进一步压缩:轻量 indexer 先把序列聚合成 micro-block,在 block 粒度上估计上下文重要性,再选出最相关的区域执行 Attention。这样不仅减少了实际 Attention 的计算量,也显著降低了“寻找重要上下文”本身的 indexing 成本。相比跨层共享索引[3]的方法,QSA 在每一层内部独立完成序列压缩,对跨层 Attention 相似性的依赖更小,也更适合 GDN 与 Attention 交替出现的 Hybrid 架构。
可以简单理解为:GDN 负责高效“记住”,QSA 负责精准“查找”。
在 1M token 上,QSA 的 Attention Kernel 在 Prefill 和 Decode 阶段分别实现最高 7.6× 和 4.9× 的加速。在贴近线上高缓存复用场景的实验设定下(Prefix Cache 命中率为 90%),Qwen3.8-Flash-Next 在 1M 上下文下的 Prefill 吞吐达到 Qwen3.7-Plus 的 8.6 倍。
Gated Residual:给信息更多传递路径#
传统 Transformer 中,各层持续在同一条 Residual Stream 上读写信息。随着网络加深,早期特征不断与后续信息混合,重要信息更容易被逐渐稀释。
Gated Residual(GR) 可以看作两种思路的结合:一方面延续 Hyper-Connection[4] 将 residual stream 扩展为多分支的设计,另一方面将 GatedNorm[5] 的逐元素动态门控融入 residual read。最终,原本单一的 residual stream 被扩展成 4 条并行分支,模型可以根据当前内容动态决定从不同分支读取多少信息,以及向不同分支写入多少信息。
可以把它理解为把一条信息通道扩展成多条车道:有些分支负责局部信息传递,有些则可以把早期信息直接保留到很深的网络层。实际分析中也观察到,其中一条 branch 会自然形成连接第一层 Attention 和大部分中后层的长距离通道。
GR 还进一步简化了 Hyper-Connection:当 read/write 足够灵活后,额外的 branch mixing 已经没有明显收益,因此可以直接去掉,减少访存开销和不稳定因素。归一化后的 Gate 同时能够有效抑制 activation outlier、提升训练稳定性;Residual State 支持使用 FP8 存储,进一步降低访存开销。
N-gram Embedding:低成本扩展模型容量#
受到 Gemma 3n 中 Per-Layer Embedding 和 DeepSeek Engram[6] 等工作的启发,我们进一步引入 N-gram Embedding,从 Transformer 参数之外的维度扩展模型容量。
普通 Embedding 根据单个 token 查表;N-gram Embedding 则结合当前 token 与前几个 token 组成的局部上下文进行查表,为常见短语和局部模式提供额外表示。
它的核心优势是: 可以增加大量参数,同时几乎不增加每个 token 的计算量。
Qwen3.8-Flash-Next 额外引入了 51B N-gram Embedding 参数。由于查询位置可以提前确定,这些参数可以存放在 Host Memory 中,通过异步 Prefetch 与模型计算重叠,无需长期占用 GPU 显存。
最终,模型只在前部使用一层 N-gram Embedding,以较低的额外成本增加了一个大规模的 “局部模式记忆库”。
Optimization:架构和优化协同设计#
Qwen3.8-Flash-Next 使用 Muon Optimizer[7] 训练,并围绕三个关键问题进一步优化 Muon 在大模型训练中的使用方式:正交化精度、Muon 与 AdamW 的参数分工,以及融合参数矩阵的拆分。
对于真正作为二维线性映射的参数,例如 Attention、GDN 和 MoE Expert 中的主要权重,我们使用 Muon;Embedding、MoE Router、GR 低秩参数等则继续使用 AdamW。对于工程实现中融合存储的 QKV、SwiGLU 和 GDN Projection,则先按照实际对应的独立线性变换进行拆分,再分别执行正交化。
针对新的模型结构和 Optimizer,我们重新拟合了 Scaling Law。结果显示,模型可以稳定使用 更大的 Learning Rate 和 Batch Size,进一步提升收敛效率和大规模并行训练吞吐。
实验还发现,过去大模型训练中常见的 Batch Size Warmup 已经不再必要:从小 Batch 逐渐增加到目标 Batch 并没有改善最终效果,反而需要额外执行 18.8% 的 optimizer steps。因此,在最终训练配置中,我们直接从目标 Batch Size 开始训练。
其他架构优化#
此外,其余组件沿用 Qwen3-Next 所确立、并在 Qwen3.5–Qwen3.8 系列中不断打磨的设计。
- 极致稀疏 MoE: 在全局负载均衡 [8] 下,固定激活专家数量而持续增加专家总参数量,可稳定降低训练 loss。因此 Qwen3.8-Flash-Next 采用较大的专家池,每 token 只路由少量专家,并配合一个共享专家。
- Multi-Token Prediction: MTP 模块以多步方式训练,保持训练与推理之间的一致性,从而提升实用场景下 speculative decoding 的接受率,同时也提升主干本身的性能。其中的全注意力层同样被替换为 QSA。
- 训练稳定性: 保留 Zero-Centered RMSNorm 并对 norm weight 施加 weight decay、注意力输出门控机制 [9],以及 MoE router 参数初始化的归一化。这些设计使小规模消融结果更为可靠,也有助于大规模训练平稳进行。
Base 模型表现#
我们将 Qwen3.8-Flash-Next-Base 与 Qwen3.8-27B 及 Qwen3.7-Plus 的 base 模型进行比较。
| Qwen3.8-Flash-Next-Base | Qwen3.8-27B-Base | Qwen3.7-Plus-Base | |
|---|---|---|---|
# Params | 125B | 27B | 397B |
# Activated params | 6B | 27B | 17B |
# N-gram embedding params | 51B | -- | -- |
| General tasks | |||
MMLU | 90.36 | 87.51 | 90.43 |
MMLU-Redux | 90.68 | 87.26 | 91.47 |
MMLU-Pro | 73.23 | 68.60 | 70.90 |
SuperGPQA | 51.36 | 44.86 | 48.42 |
BBH | 90.87 | 89.56 | 89.41 |
| Math & STEM tasks | |||
GPQA | 51.42 | 45.01 | 51.52 |
GSM8K | 93.29 | 93.18 | 92.95 |
MATH | 72.78 | 60.54 | 74.38 |
| Coding tasks | |||
EvalPlus | 78.76 | 76.05 | 78.06 |
MultiPL-E | 79.09 | 74.50 | 81.68 |
SWEBench-Pretrain | 50.99 | 41.66 | 49.24 |
| Multilingual tasks | |||
MGSM | 89.33 | 86.37 | 85.42 |
MMMLU | 84.86 | 79.74 | 84.53 |
INCLUDE | 78.40 | 74.37 | 78.90 |
1. 每行最优结果加粗。
2. 空白单元格(--):分数尚不可用或不适用。
在 6B 激活参数下,Qwen3.8-Flash-Next-Base 在 14 个 benchmark 中的 8 个上取得最优结果,包括 MMLU-Pro、SuperGPQA、BBH、GSM8K、EvalPlus、SWEBench-Pretrain、MGSM 与 MMMLU;在 MMLU、MMLU-Redux、GPQA、MATH 与 MultiPL-E 上与 Qwen3.7-Plus-Base 接近。其中 51B 的 N-gram embedding 参数是确定性寻址的,不进入每 token 的矩阵乘预算。
开始使用 Qwen3.8-Flash-Next#
Qwen3.8-Flash-Next 已作为开放模型在 HuggingFace 和 ModelScope 公开,并在 千问AI平台 提供官方托管 API。 该模型在能力、延迟和成本之间取得了出色的平衡,非常适用于高并发应用、工具驱动的工作流以及编程与协同办公助手。 在下文中,您可以了解如何调用千问AI平台API,并将 Qwen3.8-Flash-Next 集成到智能体系统和编程助手中。
API 使用#
Qwen3.8-Flash-Next 可通过 API 访问:
千问AI平台#
在千问AI平台上,该模型以 qwen3.8-flash 的名称提供服务。
千问AI平台支持行业标准协议,包括兼容 OpenAI 的 Chat Completions 和 Responses API,以及兼容 Anthropic 的接口。
"""
Environment variables:
DASHSCOPE_API_KEY: Your API Key from https://platform.qianwenai.com/home
DASHSCOPE_BASE_URL: (optional) Base URL for compatible-mode API.
- Beijing: https://dashscope.aliyuncs.com/compatible-mode/v1
- Singapore: https://dashscope-intl.aliyuncs.com/compatible-mode/v1
- US (Virginia): https://dashscope-us.aliyuncs.com/compatible-mode/v1
"""
from openai import OpenAI
import os
api_key = os.environ.get("DASHSCOPE_API_KEY")
if not api_key:
raise ValueError(
"DASHSCOPE_API_KEY is required. "
"Set it via: export DASHSCOPE_API_KEY='your-api-key'"
)
client = OpenAI(
api_key=api_key,
base_url=os.environ.get(
"DASHSCOPE_BASE_URL",
"https://dashscope.aliyuncs.com/compatible-mode/v1",
),
)
messages = [{"role": "user", "content": "Write a Python function to merge two sorted linked lists."}]
completion = client.chat.completions.create(
model="qwen3.8-flash",
messages=messages,
extra_body={
"enable_thinking": True,
# "preserve_thinking": True,
},
reasoning_effort="xhigh", # supported levels are xhigh, medium, and low
stream=True,
)
reasoning_content = ""
answer_content = ""
is_answering = False
print("\n" + "=" * 20 + "Reasoning" + "=" * 20 + "\n")
for chunk in completion:
if not chunk.choices:
print("\nUsage:")
print(chunk.usage)
continue
delta = chunk.choices[0].delta
if hasattr(delta, "reasoning_content") and delta.reasoning_content is not None:
if not is_answering:
print(delta.reasoning_content, end="", flush=True)
reasoning_content += delta.reasoning_content
if hasattr(delta, "content") and delta.content:
if not is_answering:
print("\n" + "=" * 20 + "Answer" + "=" * 20 + "\n")
is_answering = True
print(delta.content, end="", flush=True)
answer_content += delta.content
智能体框架与编程助手#
Qwen3.8-Flash-Next 可无缝集成主流的智能体框架与编程助手:
千问办公#
千问办公 是阿里巴巴旗下的旗舰级 AI 生产力平台,旨在帮助个人与企业实现日常任务的自动化与业务运转效率的加速。
千问办公现已接入 Qwen3.8-Flash-Next,驱动其全新推出的“标准”模式。依托模型的前沿能力,这一模式将为用户带来 Agent 智能水平、推理效率、成本控制三位一体的极致体验,重新定义 AI 办公场景新“标准”。
了解更多详情请参阅官方文档!
Claude Code#
Qwen API 支持 Anthropic API 协议,可直接配合 Claude Code 使用:
npm install -g @anthropic-ai/claude-code
export ANTHROPIC_MODEL="qwen3.8-flash"
export ANTHROPIC_SMALL_FAST_MODEL="qwen3.8-flash"
export ANTHROPIC_BASE_URL=https://dashscope.aliyuncs.com/apps/anthropic
export ANTHROPIC_AUTH_TOKEN=<your_api_key>
claude
Codex#
Qwen API 支持 OpenAI Responses 协议,可配合 Codex 使用:
在 ~/.codex/model-catalog.local.json 中配置:
{
"models": [
{
"slug": "qwen3.8-flash",
"display_name": "qwen3.8-flash",
"description": "千问AI平台: Qwen3.8-Flash",
"default_reasoning_level": "xhigh",
"supported_reasoning_levels": [
{
"effort": "low",
"description": "Fast responses with lighter reasoning"
},
{
"effort": "medium",
"description": "Greater reasoning depth for complex problems"
},
{
"effort": "xhigh",
"description": "Extra high reasoning depth for complex problems"
}
],
"context_window": 1000000,
"effective_context_window_percent": 95,
"supports_parallel_tool_calls": true,
"supports_image_detail_original": true,
"input_modalities": ["text", "image"],
"shell_type": "default",
"visibility": "list",
"supported_in_api": true,
"priority": 1,
"base_instructions": "",
"support_verbosity": false,
"supports_reasoning_summaries": false,
"experimental_supported_tools": [],
"truncation_policy": {
"mode": "bytes",
"limit": 10000
}
}
]
}
在 ~/.codex/config.toml 中配置:
model_catalog_json = "~/.codex/model-catalog.local.json"
model_provider = "QwenCloud"
model = "qwen3.8-flash"
[model_providers.QwenCloud]
name = "千问AI平台"
base_url = "https://dashscope.aliyuncs.com/compatible-mode/v1"
env_key = "OPENAI_API_KEY"
wire_api = "responses"
npm install -g @openai/codex
export OPENAI_API_KEY=<your_api_key>
codex
Qoder CLI#
Qoder 与 Qwen 协同演进,专为智能体编程(Agentic Coding)打造:
curl -fsSL https://qoder.com/install | bash
qoder
Qwen Code#
Qwen Code 针对 Qwen 系列模型进行了深度优化:
npm install -g @qwen-code/qwen-code@latest
qwen
OpenClaw#
curl -fsSL https://openclaw.ai/install.sh | bash
export DASHSCOPE_API_KEY=<your_api_key>
openclaw dashboard
配置 ~/.openclaw/openclaw.json:
{
"models": {
"mode": "merge",
"providers": {
"qwencloud": {
"baseUrl": "https://dashscope.aliyuncs.com/compatible-mode/v1",
"apiKey": "DASHSCOPE_API_KEY",
"api": "openai-completions",
"models": [
{
"id": "qwen3.8-flash",
"name": "qwen3.8-flash",
"reasoning": true,
"input": ["text", "image"],
"contextWindow": 1000000,
"maxTokens": 65536
}
]
}
}
},
"agents": {
"defaults": {
"model": {
"primary": "qwencloud/qwen3.8-flash"
}
}
}
}
总结#
Qwen3.8-Flash-Next 在 Qwen3-Next 所引入的混合架构之上,沿 Attention、Residual、Embedding 与 Optimization 四个方向作了扩展。QSA 在每一层内部将序列压缩为 micro-block,在保持精确检索能力的同时,降低了长上下文下的注意力开销与 indexing 开销。Gated Residual 将残差流扩展为多条并行分支,并以逐元素的动态门控控制读写,在算术开销可忽略的前提下改善跨层信息传递与训练稳定性;残差状态还可以保存为 FP8,进一步降低访存量。N-gram Embedding 以确定性寻址的查表记忆扩展容量,可以在几乎不增加每 token 计算的前提下扩展,并卸载到 host memory。优化方面,Muon 作为主优化器使用,其中正交化精度、参数分工与融合矩阵拆分是决定性的实现选择,我们也针对新架构重新拟合了 Scaling Law。
我们像发布 Qwen3-Next 时一样提前释出这批权重,以便该结构能够被社区独立评测;我们也将继续朝 Qwen4 的方向对其进行完善。
引用#
@techreport{qwen2026design,
title = {On the Design of {Qwen3.8-Next} Architecture: Evaluation, Efficiency, and Training Stability},
author = {{Qwen Team}},
institution = {Alibaba Group},
month = {August},
year = {2026}
}
@misc{qwen3.8flashnext,
title = {{Qwen3.8-Flash-Next}: A New Architecture, Towards Ultimate Cost-Efficiency},
author = {{Qwen Team}},
month = {August},
year = {2026},
url = {https://qwen.ai/blog?id=qwen3.8-flash-next}
}
参考文献#
[1] Gated Delta Networks: Improving Mamba2 with Delta Rule
[2] DeepSeek-V3.2: Pushing the Frontier of Open Large Language Models
[3] IndexCache: Accelerating Sparse Attention via Cross-Layer Index Reuse
[4] Hyper-Connections
[5] A Unified View of Attention and Residual Sinks: Outlier-Driven Rescaling is Essential for Transformer Training
[6] Conditional Memory via Scalable Lookup: A New Axis of Sparsity for Large Language Models
[7] Muon: An Optimizer for Hidden Layers in Neural Networks
[8] Demons in the Detail: On Implementing Load Balancing Loss for Training Specialized Mixture-of-Expert Models
[9] Gated Attention for Large Language Models: Non-linearity, Sparsity, and Attention-Sink-Free