语言模型 · 高效 AI · 开放模型 · 长上下文

Qwen3.8-Next 架构解读:GDN、QSA、门控残差与 n-gram

Qwen3.8-Flash-Next 激活 6B 参数;3:1 GDN 混合、稀疏注意力、门控残差和 Muon 以 1/9 FLOPs 追平 Qwen3.7-Plus。

Qwen3.8-Next 架构解读:GDN、QSA、门控残差与 n-gram

架构一览

Qwen3.8-Next 论文 是 Qwen3.8-Flash-Next 的设计记录:125B 总参数,每 token 激活 6B,另有 51B 参数的 n-gram 嵌入表放在主机内存里按需预取。四个组件撑起它。token 混合是三层 Gated DeltaNet(GDN)交替一层注意力;继续预训练时注意力层变成 Qwen 稀疏注意力(QSA)。每个子层通过逐元素门读写一条加宽到四条分支的残差流,即门控残差。放在第 2 层的单层 n-gram 嵌入在骨干之外增加容量。Muon 训练二维权重,嵌入、输出头和 MoE 路由器用 AdamW。基座模型在 14 项预训练基准中的 8 项领先 397B-A17B 的 Qwen3.7-Plus,其余落后不超过 2.6 分,而激活参数和 token 约为三分之一、训练 FLOPs 约为九分之一。

关键数字

测量项数值设置与出处同一套评测?
总参数 / 激活 / n-gram 参数125B / 6B / 51B论文摘要不适用
token 混合消融,九项基准平均全注意力 49.87;SWA 混合 51.15;GDN 混合 53.8128 层 25B-A3B,4000 亿 + 800 亿 token,表 1
同一消融,MATH / BBH / MultiPL-E49.40 / 63.78 / 39.73 → 53.98 / 68.72 / 47.48(全注意力 → GDN)表 1
QSA 对全注意力,短上下文平均75.9 → 76.8生产模型,表 2
QSA 对全注意力,RULER 512K 到 1M90.08 → 93.00表 3
QSA 对全注意力,8 针 MRCR 512K / 1M30.66 / 20.71 → 40.53 / 26.44表 3
QSA 下 MTP 接受长度4.06 → 4.07四步起草,表 4
基座对 Qwen3.7-Plus-Base,MMLU-Pro / SuperGPQA / SWEBench-Pretrain73.23 对 70.90 / 51.36 对 48.42 / 50.99 对 49.24表 11
落后 Qwen3.7-Plus 的地方MATH 72.78 对 74.38;MultiPL-E 79.09 对 81.68表 11
相对 Qwen3.7-Plus 的算力比约 1/3 激活参数、1/3 token、1/9 FLOPs论文第 4 节不适用
稳定性压力测试恒定学习率下 Muon 比 AdamW 尖峰更多;Muon 加门控残差最少25B-A3B,图 10 到 12

token 混合:支撑 3:1 的消融

GDN 是一种带门控的 delta 规则线性注意力,与 Mamba 各变体和 Kimi Delta Attention 同族:固定大小的状态,通过写入新值与状态预测之差来更新,并带衰减门。次二次方架构研究解释了这类门控能算什么、不能算什么,Qwen 的论文则提供了部署规模的证据。三个在相同 token 上训练、只有 token 混合不同的 25B-A3B 检查点,平均分别是全注意力 49.87、128 token 滑动窗口混合 51.15、GDN 混合 53.81,两个混合都每四层保留一层全注意力。GDN 的增益落在 MATH、BBH 和代码上,与 Moonlight 中 Muon 的增益落点相同,论文保留那一层注意力的明确理由是精确的 token 级检索,任何有限状态记忆都无法复现。

Kimi K3 用 KDA 得到同样的 3:1 分配但没有发布消融;Qwen 的表格是两种设计共同倚靠的数字。

Qwen 稀疏注意力

继续预训练时全注意力层换成 QSA。一个轻量索引器把序列压缩成微块表示,在压缩的因果掩码下打分并选出前 k 个块;选中的索引展开成微块级稀疏掩码供核心注意力使用。设计目标是让索引成本本身随序列长度下降,论文以此对比那些索引器开销在长上下文下仍然显著的稀疏设计。这次替换在短上下文上几乎免费(平均 75.9 到 76.8),在长上下文上为正:RULER 512K 以上从 90.08 升到 93.00,8 针 MRCR 1M 从 20.71 升到 26.44,MTP 接受长度不变。与 DeepSeek V4 在稀疏选择之前先把成组 token 压成单个 KV 条目、直接缩小缓存的做法相比,QSA 保留全分辨率 KV,省的是索引和注意力计算;Qwen 的 KV 节省来自 GDN 层。

残差流

把残差流加宽成多条分支是 2026 年的潮流,有三种实现。DeepSeek V4 的 mHC 用被约束为双随机的学习混合矩阵。Kimi K3 的注意力残差对前置层做注意力。Qwen 的门控残差加宽到四条分支,通过带分组 RMSNorm 的逐元素门读取再写回;在 25B-A3B、5600 亿 token 上的消融发现,读写足够有表达力后显式的混合算子贡献很小,而门提供的重缩放才是保持训练稳定的东西。读和写是融合 kernel,加宽的流每个块每个方向只遍历一次。图 7 显示门学出了跨层路径,是 AttnRes 显式做法的廉价回声。

放在加速器外的 n-gram 嵌入

单层 n-gram 嵌入以局部上下文而非单个 token 身份为条件做查表。它的 51B 参数放在主机内存里预取,每 token FLOPs 和延迟几乎不动。两个发现给这个想法降温:放置位置有影响(表 7),扩大 n-gram 词表能单调降低损失但下游精度饱和(表 8、9),这是论文里损失与精度不一致的例子之一。若干 token 归一化和分配变体没有带来一致的收益。

优化器与稳定性

Muon 是注意力和 GDN 投影、专家 MLP、n-gram key 与 value 投影上的主优化器。嵌入、输出头和 MoE 路由器留在 AdamW 上,路由器是因为 Muon 加剧了训练早期的波动。恒定学习率的压力测试比较 AdamW 下的 Qwen3.5 结构、换 Muon、以及 Muon 加门控残差:门同时降低梯度范数尖峰的频率和幅度,固定优化器只切换 GatedNorm 的受控实验隔离了这一效应。论文把架构、优化器和稳定性当作一个设计问题来读,这是它最可迁移的经验。

局限与存疑

组件消融在 25B-A3B、4800 亿到 5600 亿 token 上进行,低于生产模型。头条对比是基座对基座、在预训练基准上;没有后训练或智能体数字。1/9 FLOPs 由参数与 token 比例推出,而非报告的总算力。主机内存 n-gram 设计假设服务硬件有足够的主机带宽,能不停顿地预取 51B 参数的表。

常见问题

Qwen3.8-Next 的架构是什么?

125B 参数、每 token 激活 6B、另有 51B 主机内存 n-gram 嵌入参数的 MoE。三层 Gated DeltaNet 交替一层注意力,后者在继续预训练时变成 Qwen 稀疏注意力;残差流有四条带门的分支;Muon 训练二维权重,嵌入、输出头和路由器用 AdamW。

Qwen3.8-Next 为什么用 Gated DeltaNet 而不是全注意力?

因为 25B-A3B 上相同 token 的受控消融里,GDN 混合平均 53.81,全注意力 49.87,滑动窗口混合 51.15,最大增益在 MATH、BBH 和代码上,同时每四层一层注意力保留精确检索。

Qwen 稀疏注意力和 DeepSeek V4 的压缩稀疏注意力有什么区别?

QSA 保留全分辨率 KV,用微块索引器选择关注哪些块,省的是索引和注意力计算;DeepSeek V4 在稀疏选择之前把成组 token 压成单个 KV 条目,缩小的是缓存本身。在 Qwen 的模型上 QSA 把 RULER 512K 以上从 90.08 提到 93.00。

Qwen3.8-Next 的门控残差和 Kimi K3 的注意力残差对比如何?

两者都在加宽残差路径。Qwen 加宽到四条分支,通过带分组 RMSNorm 的逐元素门读取,并发现门还能稳定训练;Kimi K3 则让每一层以 12 层为块关注前置层的输出。DeepSeek V4 的 mHC 是第三种变体,用双随机混合。