Qwen3.8-Next 架构解读:GDN、QSA、门控残差与 n-gram
Qwen3.8-Flash-Next 激活 6B 参数;3:1 GDN 混合、稀疏注意力、门控残差和 Muon 以 1/9 FLOPs 追平 Qwen3.7-Plus。
架构一览
Qwen3.8-Next 论文 是 Qwen3.8-Flash-Next 的设计记录:125B 总参数,每 token 激活 6B,另有 51B 参数的 n-gram 嵌入表放在主机内存里按需预取。四个组件撑起它。token 混合是三层 Gated DeltaNet(GDN)交替一层注意力;继续预训练时注意力层变成 Qwen 稀疏注意力(QSA)。每个子层通过逐元素门读写一条加宽到四条分支的残差流,即门控残差。放在第 2 层的单层 n-gram 嵌入在骨干之外增加容量。Muon 训练二维权重,嵌入、输出头和 MoE 路由器用 AdamW。基座模型在 14 项预训练基准中的 8 项领先 397B-A17B 的 Qwen3.7-Plus,其余落后不超过 2.6 分,而激活参数和 token 约为三分之一、训练 FLOPs 约为九分之一。
关键数字
| 测量项 | 数值 | 设置与出处 | 同一套评测? |
|---|---|---|---|
| 总参数 / 激活 / n-gram 参数 | 125B / 6B / 51B | 论文摘要 | 不适用 |
| token 混合消融,九项基准平均 | 全注意力 49.87;SWA 混合 51.15;GDN 混合 53.81 | 28 层 25B-A3B,4000 亿 + 800 亿 token,表 1 | 是 |
| 同一消融,MATH / BBH / MultiPL-E | 49.40 / 63.78 / 39.73 → 53.98 / 68.72 / 47.48(全注意力 → GDN) | 表 1 | 是 |
| QSA 对全注意力,短上下文平均 | 75.9 → 76.8 | 生产模型,表 2 | 是 |
| QSA 对全注意力,RULER 512K 到 1M | 90.08 → 93.00 | 表 3 | 是 |
| QSA 对全注意力,8 针 MRCR 512K / 1M | 30.66 / 20.71 → 40.53 / 26.44 | 表 3 | 是 |
| QSA 下 MTP 接受长度 | 4.06 → 4.07 | 四步起草,表 4 | 是 |
| 基座对 Qwen3.7-Plus-Base,MMLU-Pro / SuperGPQA / SWEBench-Pretrain | 73.23 对 70.90 / 51.36 对 48.42 / 50.99 对 49.24 | 表 11 | 是 |
| 落后 Qwen3.7-Plus 的地方 | MATH 72.78 对 74.38;MultiPL-E 79.09 对 81.68 | 表 11 | 是 |
| 相对 Qwen3.7-Plus 的算力比 | 约 1/3 激活参数、1/3 token、1/9 FLOPs | 论文第 4 节 | 不适用 |
| 稳定性压力测试 | 恒定学习率下 Muon 比 AdamW 尖峰更多;Muon 加门控残差最少 | 25B-A3B,图 10 到 12 | 是 |
token 混合:支撑 3:1 的消融
GDN 是一种带门控的 delta 规则线性注意力,与 Mamba 各变体和 Kimi Delta Attention 同族:固定大小的状态,通过写入新值与状态预测之差来更新,并带衰减门。次二次方架构研究解释了这类门控能算什么、不能算什么,Qwen 的论文则提供了部署规模的证据。三个在相同 token 上训练、只有 token 混合不同的 25B-A3B 检查点,平均分别是全注意力 49.87、128 token 滑动窗口混合 51.15、GDN 混合 53.81,两个混合都每四层保留一层全注意力。GDN 的增益落在 MATH、BBH 和代码上,与 Moonlight 中 Muon 的增益落点相同,论文保留那一层注意力的明确理由是精确的 token 级检索,任何有限状态记忆都无法复现。
Kimi K3 用 KDA 得到同样的 3:1 分配但没有发布消融;Qwen 的表格是两种设计共同倚靠的数字。
Qwen 稀疏注意力
继续预训练时全注意力层换成 QSA。一个轻量索引器把序列压缩成微块表示,在压缩的因果掩码下打分并选出前 k 个块;选中的索引展开成微块级稀疏掩码供核心注意力使用。设计目标是让索引成本本身随序列长度下降,论文以此对比那些索引器开销在长上下文下仍然显著的稀疏设计。这次替换在短上下文上几乎免费(平均 75.9 到 76.8),在长上下文上为正:RULER 512K 以上从 90.08 升到 93.00,8 针 MRCR 1M 从 20.71 升到 26.44,MTP 接受长度不变。与 DeepSeek V4 在稀疏选择之前先把成组 token 压成单个 KV 条目、直接缩小缓存的做法相比,QSA 保留全分辨率 KV,省的是索引和注意力计算;Qwen 的 KV 节省来自 GDN 层。
残差流
把残差流加宽成多条分支是 2026 年的潮流,有三种实现。DeepSeek V4 的 mHC 用被约束为双随机的学习混合矩阵。Kimi K3 的注意力残差对前置层做注意力。Qwen 的门控残差加宽到四条分支,通过带分组 RMSNorm 的逐元素门读取再写回;在 25B-A3B、5600 亿 token 上的消融发现,读写足够有表达力后显式的混合算子贡献很小,而门提供的重缩放才是保持训练稳定的东西。读和写是融合 kernel,加宽的流每个块每个方向只遍历一次。图 7 显示门学出了跨层路径,是 AttnRes 显式做法的廉价回声。
放在加速器外的 n-gram 嵌入
单层 n-gram 嵌入以局部上下文而非单个 token 身份为条件做查表。它的 51B 参数放在主机内存里预取,每 token FLOPs 和延迟几乎不动。两个发现给这个想法降温:放置位置有影响(表 7),扩大 n-gram 词表能单调降低损失但下游精度饱和(表 8、9),这是论文里损失与精度不一致的例子之一。若干 token 归一化和分配变体没有带来一致的收益。
优化器与稳定性
Muon 是注意力和 GDN 投影、专家 MLP、n-gram key 与 value 投影上的主优化器。嵌入、输出头和 MoE 路由器留在 AdamW 上,路由器是因为 Muon 加剧了训练早期的波动。恒定学习率的压力测试比较 AdamW 下的 Qwen3.5 结构、换 Muon、以及 Muon 加门控残差:门同时降低梯度范数尖峰的频率和幅度,固定优化器只切换 GatedNorm 的受控实验隔离了这一效应。论文把架构、优化器和稳定性当作一个设计问题来读,这是它最可迁移的经验。
局限与存疑
组件消融在 25B-A3B、4800 亿到 5600 亿 token 上进行,低于生产模型。头条对比是基座对基座、在预训练基准上;没有后训练或智能体数字。1/9 FLOPs 由参数与 token 比例推出,而非报告的总算力。主机内存 n-gram 设计假设服务硬件有足够的主机带宽,能不停顿地预取 51B 参数的表。
常见问题
Qwen3.8-Next 的架构是什么?
125B 参数、每 token 激活 6B、另有 51B 主机内存 n-gram 嵌入参数的 MoE。三层 Gated DeltaNet 交替一层注意力,后者在继续预训练时变成 Qwen 稀疏注意力;残差流有四条带门的分支;Muon 训练二维权重,嵌入、输出头和路由器用 AdamW。
Qwen3.8-Next 为什么用 Gated DeltaNet 而不是全注意力?
因为 25B-A3B 上相同 token 的受控消融里,GDN 混合平均 53.81,全注意力 49.87,滑动窗口混合 51.15,最大增益在 MATH、BBH 和代码上,同时每四层一层注意力保留精确检索。
Qwen 稀疏注意力和 DeepSeek V4 的压缩稀疏注意力有什么区别?
QSA 保留全分辨率 KV,用微块索引器选择关注哪些块,省的是索引和注意力计算;DeepSeek V4 在稀疏选择之前把成组 token 压成单个 KV 条目,缩小的是缓存本身。在 Qwen 的模型上 QSA 把 RULER 512K 以上从 90.08 提到 93.00。
Qwen3.8-Next 的门控残差和 Kimi K3 的注意力残差对比如何?
两者都在加宽残差路径。Qwen 加宽到四条分支,通过带分组 RMSNorm 的逐元素门读取,并发现门还能稳定训练;Kimi K3 则让每一层以 12 层为块关注前置层的输出。DeepSeek V4 的 mHC 是第三种变体,用双随机混合。