语言模型 · 高效 AI · 强化学习

Muon 和 AdamW 的区别:预训练省一半算力,后训练用错地方

Muon 预训练用约一半 FLOPs 达到 AdamW 的损失,DeepSeek-V4、Kimi K3 已采用;用于 AdamW 模型的 SFT 会丢分,RL 里会崩。

Muon 和 AdamW 的区别:预训练省一半算力,后训练用错地方

两种优化器对一次更新各做了什么

AdamW 逐元素工作。每个参数维护梯度的滑动均值和方差,更新是均值除以方差的平方根,再加衰减。规则里没有任何东西知道某个权重属于一个矩阵。

Muon 逐矩阵工作。它为每个二维权重维护梯度动量,用几步 Newton-Schulz 迭代把动量正交化,让所有奇异值趋向 1,再把结果作为更新。更新因此在每个奇异方向上能量相等,这是一种谱白化。月之暗面的 Muon is Scalable 让它在大模型规模可用:加入 AdamW 式权重衰减,否则权重范数会增长到 bf16 精确范围之外;把每次更新缩放到均方根约 0.2,即 AdamW 的常见区间,这样 Muon 可以复用为 AdamW 调好的学习率和权重衰减。

决定大多数对比结果的推论是:白化是一个很强的先验,认为梯度的每个方向都配得上同样的步长。梯度高秩且干净时这是对的,比如预训练;梯度低秩或嘈杂时这是错的,而这正是 Rethinking Muon 在机器人策略和 RL 微调中量到的。

关键数字

测量项AdamWMuon设置与出处同一套评测?
达到同一损失所需算力,算力最优1 倍约 0.5 倍399M 到 1.5B 模型,Moonlight 缩放律
1.2T token 处的优化器对换:HumanEval / MATH / GSM8K29.3 / 16.1 / 43.837.2 / 19.8 / 45.0Moonlight 对 Moonlight-A,配方完全相同
同一对换:MMLU / BBH60.2 / 45.360.4 / 43.2同上
对 AdamW 预训练模型做 SFT:MMLU / HumanEval / GSM8K71.4 / 79.3 / 89.870.8 / 77.4 / 85.8Qwen2.5-7B,tulu-3,Moonlight 论文表 7
预训练到 SFT 的优化器配对,HumanEvalAdamW 接 AdamW 53.1Muon 接 Muon 57.3;Muon 接 AdamW 52.4;AdamW 接 Muon 53.7Moonlight 表 6
超参数学习率、权重衰减、beta更新 RMS 对齐后复用 AdamW 的学习率和衰减;多出 Newton-Schulz 步数和动量设计,Moonlight不适用
覆盖的参数全部只有二维矩阵;嵌入、输出头和 MoE 路由器留在 AdamWMoonlight;Qwen3.8-Next 发现 Muon 会让路由器不稳不适用
VLA 微调,VLANeXt LIBERO 平均79.4593.65(Pion 96.35)Pion 论文表 1
VLA-Adapter LIBERO Object,1500 步32.2%97.0%(Pion 100%)Pion 论文图 5
真机,pi-0.5,3 个任务,20000 步31.1%38.9%(Pion 85.6%)Pion 论文表 3
可验证奖励 RL,Qwen3-1.7B 和 4B 上的 GRPO 与 GMPO能训,稳步提升崩溃,准确率接近零Pion 论文图 6,八个设置
恒定学习率压力测试的梯度范数尖峰,25B-A3B基线裸 Muon 尖峰更多;Muon 加门控残差更少Qwen3.8-Next 图 10、11
前沿预训练的采用历史默认DeepSeek-V4(1.6T)、Kimi K3(2.8T,逐头变体)、Qwen3.8-Next2026 年报告不适用

前五行是同一篇论文内部的受控对换。VLA 和 RL 行也是受控的,但模型较小。采用那一行不是前沿规模上实测差距的证据;各报告引用的是收敛速度和稳定性,而不是对 AdamW 的消融。

Muon 在哪挣到它的 2 倍

从零预训练、二维权重、高秩梯度。Moonlight 的缩放律显示 Muon 在五个模型规模上以约一半 FLOPs 追平 AdamW 的损失,受控的 1.2T token 对换显示收益落在代码和数学上:HumanEval 升 8 分,MATH 升 3.7,MMLU 持平,BBH 降 2。作者发现 Muon 训练的矩阵 SVD 熵更高,解读为优化器探索了更多方向。三份前沿报告随后跟进。DeepSeek-V4 在 1.6T 参数上对大多数矩阵用 Muon,嵌入、输出头、mHC 的门和归一化留给 AdamW,并加了防止注意力 logit 爆炸的措施。Kimi K3 对注意力投影按头而不是按矩阵正交化。Qwen3.8-Next 把 Muon 用于注意力、GDN 和专家投影,但发现它在训练早期让 MoE 路由器不稳,于是路由器、嵌入和输出头留在 AdamW。

超参数的故事也是实在的优势。更新 RMS 固定在 0.2 后,Muon 原样接过 AdamW 的学习率和权重衰减,省掉了本会吃掉算力节省的调参成本。

AdamW 仍然赢在哪

微调一个用 AdamW 预训练的模型。Moonlight 的表 7 是最干净的证据:在 Qwen2.5-7B 上,Muon SFT 比 Adam SFT 少 0.6 MMLU、1.9 HumanEval、4.0 GSM8K。2×2 消融解释了原因:收益绑定在 Muon 预训练时建立的奇异值结构上,阶段之间换优化器无论哪个方向都丢分。

嘈杂或低秩的梯度。视觉-语言-动作训练里动作头的梯度近似低秩,白化把它们的噪声抬到与信号同一量级;Muon 在这里仍胜过 AdamW,但只是因为 AdamW 收敛慢,而滤波后的变体以大幅优势胜过两者。可验证奖励 RL 的梯度信噪比低,因为奖励是轨迹级的,裁剪和重要性采样又丢掉信号;裸 Muon 在全部八个测试设置里崩溃,AdamW 稳步提升。反向消融,一个同样失败的低通 Muon,把原因钉在谱整形本身。

压力下的稳定性。Qwen 的恒定学习率压力测试显示,同一结构下裸 Muon 比 AdamW 尖峰更多,所以报告把 Muon 和抑制尖峰的门控残差配套使用。大规模的 Muon 是和架构、精度选择捆绑的整套方案,不是即插即用的替换。

怎么选

  • 从零预训练稠密或 MoE 模型: 二维权重用 Muon,嵌入、输出头、路由器和任何逐通道或门参数用 AdamW。更新 RMS 对齐到 0.2,复用你的 AdamW 学习率和权重衰减。
  • 微调别人用 AdamW 预训练的检查点: AdamW。唯一的受控测试里 Muon SFT 略差。
  • 微调自己用 Muon 预训练的检查点: 继续用 Muon;Moonlight 2×2 里 Muon 接 Muon 那格最好。
  • 可验证奖励 RL,GRPO 或 GMPO: AdamW,或 Pion 逐头模式这类谱滤波变体。绝不裸用 Muon。
  • 机器人策略等梯度低秩的跨模态头: Muon 在收敛速度上胜过 AdamW,但能采用高通变体的话它是更好的选择。

局限与存疑

2 倍缩放律止于 1.5B 参数和一个 16B 总参数的 MoE;前沿采用有记录,但那个规模上没有对 AdamW 的消融。SFT 和 RL 的失效结果来自 7B、1.7B、4B 模型和很窄的任务集。VLA 数字用的是两种特定策略架构和一套真机设置。而且没有一篇论文在同一模型上把 Muon 和 AdamW 跑完从预训练到 RL 的完整流程,而那正是为新模型家族选优化器的实验室真正需要的对比。

常见问题

Muon 比 AdamW 好吗?

从零预训练二维权重时,证据说是:达到同一损失约用一半算力,代码和数学上收益最大,DeepSeek-V4、Kimi K3 和 Qwen3.8-Next 都采用了。微调 AdamW 预训练的模型或做可验证奖励 RL 时,不是:Muon 在 SFT 里丢分,在 RL 里崩溃。

Muon 能复用 AdamW 的学习率和权重衰减吗?

能,前提是把每次更新缩放到 RMS 约 0.2,对齐 AdamW 的常见区间。月之暗面引入这一步就是为了让 Muon 不需要单独的超参数搜索。权重衰减本身必须加上,因为原版 Muon 省略了它。

为什么 Muon 在 RL 微调里失效而 AdamW 有效?

可验证奖励 RL 产生的梯度信噪比低。Muon 的 Newton-Schulz 步骤给每个奇异方向同样的量级,噪声方向和有信息的方向权重相同,策略于是崩溃;Pion 论文里 Qwen3-1.7B 和 4B 上 GRPO 与 GMPO 的准确率都接近零,AdamW 则稳步提升。

用 Muon 时哪些参数该留在 AdamW 上?

嵌入、输出头、MoE 路由器,以及归一化、偏置、门这类逐通道参数。Moonlight、DeepSeek-V4 和 Qwen3.8-Next 都把它们留在 AdamW 上;Qwen 报告路由器用 Muon 会导致训练早期不稳定。