语言模型 · 高效 AI · 开放模型 · 序列建模

Nemotron 3 架构解读:Mamba 混合、LatentMoE、NVFP4

Nemotron 3 Ultra 大多数层是 Mamba-2,注意力只有 2 个 KV 头,经潜变量路由到 512 选 22 的专家;解码比 GLM-5.1 快最多 5.9 倍。

Nemotron 3 架构解读:Mamba 混合、LatentMoE、NVFP4

架构一览

Nemotron 3 Ultra 报告 描述了一个 108 层、550B 总参数、55B 激活的模型。token 混合是混合式的:大多数层是 Mamba-2 状态空间层,携带固定大小的循环状态,每步解码代价不随上下文增长;少数层是注意力层。注意力层用 64 个查询头但只有 2 个 key-value 头,头维 128,所以即便存在 KV 缓存也很小。前馈层是 LatentMoE:每层 512 个专家,每 token 激活 22 个,经 2048 维潜变量路由,外加一个共享专家。两个共享权重的多 token 预测头,各由一层注意力接一层 MoE 组成,为推测解码起草并加速 RL 采样。整个模型以 NVFP4 在 20T token 上按 warmup-stable-decay 日程预训练,再扩展到 1M token 上下文。

关键数字

测量项数值设置与出处同一套评测?
总参数 / 激活参数,层数550B / 55B,108报告表 1不适用
注意力头64 个查询头,2 个 key-value 头,头维 128表 1不适用
Mamba 配置256 个维度 64 的头,状态维 128,8 组表 1不适用
MoE512 专家,top-22,潜变量 2048,专家隐层 5120,共享专家 10240表 1不适用
MTP2 个头,共享权重,各含注意力 + MoE2.1 节不适用
预训练NVFP4,20T token(15T 多样性阶段 + 5T 质量阶段)第 2 节不适用
再训 740 亿 token 后 NVFP4 对 BF16 的损失差距从 5T、10T、16T 检查点分别为 0.33%、0.34%、0.03%图 3
解码吞吐,8K 输入 / 64K 输出GLM-5.1-754B-A40B 的 5.9 倍,Kimi-K2.6-1T-A32B 的 4.8 倍,Qwen-3.5-397B-17B 的 1.6 倍图 1,NVFP4,最大吞吐是,英伟达测量
预填充密集,50K 输入 / 2K 输出落后 Qwen-3.5图 15
基座 MMLU-Pro / MATH / GPQA79.07 / 82.00 / 50.00,次佳开源基座 69.15 / 68.40 / 43.43表 2
后训练 SWE-Bench Verified / Terminal Bench 2.170.7 / 56.4,GLM-5.1 76.2 / 59.3,Kimi-K2.6 75.7 / 67.2表 10
RULER 1M94.7,表内最佳表 10
MOPD 收益Terminal Bench 2.0 44.5 → 54.0,SWE-Bench Verified 65.8 → 71.7,BrowseComp 31.0 → 44.4表 5

以 Mamba 为主的混合为什么解码更快

长输出的解码吞吐受限于内存搬运而不是算术:每生成一个 token 都要重读每个注意力层的 KV 缓存加上权重。Mamba 层用固定大小的状态取代不断增长的缓存,所以每 token 代价与对话或智能体轨迹长度无关。Nemotron 3 让大多数层是 Mamba-2,保留少数注意力层做精确检索,并用 2 个 KV 头进一步缩小这些层的缓存。报告的图 14 显示,同样批大小和长度下 SSM 缓存远低于 FP8 KV 缓存的占用,吞吐图随之而来:8K 输入、64K 输出的负载上是 GLM-5.1 的 5.9 倍,这正是一次长智能体运行的形状。

同一设计也解释了它输在哪。预填充成本随激活参数和提示上的总计算量增长,而不是随缓存读取,所以在 50K 输入、2K 输出的负载上 Nemotron 3 Ultra 落后于激活参数更少的 Qwen-3.5。报告说得很直白:激活参数决定预填充,总权重 I/O 决定解码,Nemotron 3 优化的是后者。

LatentMoE 与 MTP 头

LatentMoE 让每个 token 经 2048 维潜变量而不是 8192 的完整隐层宽度到达它的 22 个专家,这使每层 512 个专家在通信和专家权重搬运上负担得起。英伟达报告它比标准细粒度 MoE 有更好的每参数精度;Kimi K3 采用同一家族,896 个专家、3584 维潜变量,并加了归一化和基于分位数的路由器来稳定它。Nemotron 3 也记录了失效的一面:NVFP4 训练期间,团队把专家负载均衡和残差流范数当作健康信号来监控,在迫使回滚并把 token 总量缩到 20T 的几次发散附近发现了不均衡和死亡的专家。

两个 MTP 头在架构上很轻,各一层注意力加一层 MoE,并共享参数,使草稿在头之间是自回归的。推理时它们是推测解码的草稿模型;后训练时它们加速 RL 采样,这正是 Bebop 论文研究的杠杆,即策略熵上升时如何保持 MTP 接受率。Nemotron 3 的 MTP 增强阶段重新训练这些头以弥合训练与推理的不一致,并报告 SPEED-Bench 上更长的接受长度。

全程 NVFP4

用 4 比特浮点做预训练是报告的另一个头条。持平的证据是切换到 BF16 的消融:从 5T 和 10T 检查点继续用 BF16 训 740 亿 token,损失差距停在 0.33% 到 0.34% 不再缩小;从 16T 检查点出发差距为 0.03%。随后单个 NVFP4 检查点既能以 W4A16 服务,也能在 Blackwell 上以原生 W4A4 服务;4.85 到 7.19 比特每元素的扫描里,只有长上下文推理在加入混合 FP8 层后有变化。不稳定是真实发生的,第一阶段数据上两次发散加一次失败的回滚,但报告没有把它们归因于精度。

与 DeepSeek V4 和 Kimi K3 相比

三个开源旗舰用三条路线通向便宜的 1M token 推理。DeepSeek V4 每层保留注意力,但把 token 压成更少的 KV 条目并稀疏关注,缓存降到 V3.2 的 10%。Kimi K3 每四层中三层用线性 delta 规则注意力。Nemotron 3 在循环这条路上走得最远,大多数层是 Mamba-2,其余层只有 2 个 KV 头。精度表和这个排序对应:在最难的智能体套件上,Nemotron 3 落后 DeepSeek V4-Pro 和 Kimi K2.6 四到十七分(SWE-Bench Verified 70.7 对 74.5,HLE 26.7 对 37.7,BrowseComp 44.4 对 61.3),在 RULER 1M 和非幻觉率上领先,在解码吞吐上大胜。

局限与存疑

108 层里注意力层与 Mamba 层的确切数量由报告的层模式图给出,正文没有以数字写明。吞吐是英伟达在自家硬件上、为每个模型选最好设置的测量。报告没有在这个规模上消融混合比例、2 个 KV 头的选择或 LatentMoE 相对替代方案,预训练发散也仍无解释。模型最强的结果既依赖架构,同样依赖 MOPD 后训练阶段。

常见问题

Nemotron 3 Ultra 的架构是什么?

108 层的 Mamba-2 状态空间层与注意力层混合,注意力有 64 个查询头和 2 个 key-value 头,用 LatentMoE 前馈层稀疏扩展,每层 512 个专家、经 2048 维潜变量激活 22 个,总参数 550B、激活 55B,另有两个共享权重的多 token 预测头。以 NVFP4 在 20T token 上预训练。

Nemotron 3 为什么比 DeepSeek V4 或 Kimi K2.6 解码更快?

它的大多数层是 Mamba-2,每 token 解码代价与上下文长度无关,注意力层只有 2 个 KV 头,所以每个生成 token 的权重和缓存 I/O 总量很小。8K 输入、64K 输出的负载上英伟达报告为 GLM-5.1 的 5.9 倍、Kimi-K2.6 的 4.8 倍;预填充密集的负载上它落后于 Qwen-3.5。

Nemotron 3 的架构和 Kimi K3 的对比如何?

两者都是循环层与注意力层的混合加潜变量 MoE。Nemotron 3 用 Mamba-2 层、少数层用注意力、512 个专家激活 22 个;Kimi K3 每四层中三层用 Kimi Delta Attention、896 个专家激活 16 个,并加了跨深度的注意力残差。

NVFP4 预训练会损害 Nemotron 3 的精度吗?

报告的消融显示,从训练中段检查点出发相对 BF16 的训练损失差距为 0.33% 到 0.34%,从 16T 检查点出发为 0.03%,后训练模型与其他开源旗舰相差几分之内。训练确实发散过两次,但报告没有归因于精度。