SDPG:自蒸馏策略梯度,给稀疏奖励 RL 补密集信号
SDPG 给验证器 RL 加一项全词表自蒸馏损失,让看过答案的模型逐 token 监督自己。Qwen3-4B 上 AIME25 从 GRPO 的 0.242 升到 0.327。
快速答案
SDPG(自蒸馏策略梯度)针对 RLVR 的稀疏奖励难题,让模型逐 token 监督自己。同一套权重扮演两个角色:学生只看到题目,教师额外看到一段特权提示(正确答案加一份 Gemini 2.5 Pro 写的参考解法)。一项辅助损失把学生的全词表分布拉向教师分布,在验证器只给一条轨迹一个比特的地方,提供了每个位置都有的密集梯度。Qwen3-4B 训练 400 步后,SDPG-UFKL 在 AIME2025 末检查点拿到 0.327,而 GRPO 类训练只有 0.242;AIME2024 为 0.380 对 0.280;AMC23 为 0.858 对 0.714。增益来自全词表在线蒸馏与参考 KL 正则的组合,而非单靠验证器优势。
为什么验证器奖励太稀疏
在 RLVR 里,一条长思维链最后只拿到一个标量:对或错。这个信号要回传摊到几百个 token 上,大部分轨迹几乎学不到哪个 token 是关键。SDPG 的前提是:模型其实知道的比奖励透露的多,关键是换个方式问。把同一个策略条件在答案和参考解法上,它的下一 token 分布就比盲猜的策略更准。两个分布的差,就是每个位置都存在的密集监督,而且算力上几乎免费,因为两次前向用的是同一套权重。
特权上下文 c 是核心,也最容易被误读。教师不是更强的外部模型,而是看到了部署时拿不到的文本的学生:正确答案是 {answer},一种常见解法是:{solution}。这与 Self-Distilled Agentic RL 用的特权教师思路一致,只是这里用于数学推理,而非智能体工具调用。
三块怎么拼起来
目标函数叠了三项。第一,带归一化标准差的组相对验证器优势 A = (R - 均值) / (标准差 + eps_std),eps_std > 0 防止一组样本得分全相同时分母爆炸,这是 GRPO 已知的不稳定点。第二,精确的全词表在线蒸馏(OPD)损失:逐位置在整个词表 V 上求学生到教师的 KL,D_KL(p_t || stopgrad[q_t]),p_t 是学生分布,q_t 是条件于提示的教师分布。表现最好的 UFKL 变体用非归一化前向 KL,促使学生去覆盖教师的整个提示分布,而不是塌缩到单个最高概率 token。第三,参考策略 KL 项(URKL 变体用系数 alpha = 1e-3 的平方对数惩罚),把策略拴在基座模型附近。
两个开关让蒸馏不跑偏。正优势门控只在验证器判对的轨迹上施加 OPD 损失;否则这个”特权但不完美”的教师会在全局错误的路径上强化局部看似合理的 token。beta 调度让蒸馏权重先升、再保持、临近训练末段衰减,这样学生最终不再依赖测试时拿不到的信息。
关键结果
- AIME2024(Qwen3-4B,pass@1 mean@32,400 步): SDPG-UFKL 末检查点 0.380 / 最优 0.408,GRPO 0.280 / 0.316,RLSD 0.378 / 0.395。SDPG 在最优上追平自蒸馏基线,末检查点比 GRPO 高 0.10。
- AIME2025: SDPG-UFKL 0.327 / 0.335,GRPO 0.242 / 0.279,RLSD 0.300 / 0.304,差距最大:末检查点比 GRPO 高 0.085,比 RLSD 高 0.027。
- AMC23: SDPG-UFKL 0.858 / 0.870,GRPO 0.714 / 0.739,RLSD 0.813 / 0.813,末检查点比 GRPO 跳了 0.144。
- 熵稳定性: SDPG-UFKL 全程维持较高的 actor 熵,而 RLSD 自蒸馏基线在第 250 步附近熵崩塌,这正是 SDPG 的 KL 正则要防的失效模式。
- 拉开速度: 各基准曲线上,SDPG 变体约前 50 步就甩开 GRPO 和 RLSD,并提前数百步到达更高的奖励平台。
- 变体对比: 非归一化前向 KL 变体(UFKL)在 AIME25 末检查点(0.327 对 0.307)和 AMC23 最优(0.870 对 0.863)上略胜反向 KL 变体(URKL),说明 KL 方向是真实的调参轴。
局限与存疑
特权上下文不是免费的,论文也明说:它对每道训练题都要用到标准答案加 Gemini 2.5 Pro 的解法,所以 SDPG 是”已有可验证参考”场景下的微调方法,不是只靠验证器信号就能自学。作者还点出一个不可消除的条件互信息缺口:教师条件于学生永远看不到的信息,会留下学生补不上的残差,这正是 beta 调度必须把信号逐步撤掉的原因。证据面偏窄:只在 Qwen3-4B(附录另有 Qwen3-1.7B)和三个数学竞赛上验证,没有大规模 GSM8K/MATH、没有更大模型、没有非数学推理。论文也没给教师那次额外前向的时钟或 token 成本,而 AIME 上末检查点与最优的差距(0.380 对 0.408)暗示这个规模的训练仍有噪声。
常见问题
SDPG 这个方法能让模型不靠任何外部监督就通过自蒸馏变强吗?
不能,这是最常见的误读。“自”蒸馏指同一套权重同时当学生和教师,但教师之所以有用,是因为它条件在一段特权提示上:标准答案,加一份 Gemini 2.5 Pro 生成的参考解法。SDPG 是在你已经握有训练集可验证参考时的稀疏奖励微调方法,不是只靠验证器奖励的免费自举。
为什么 SDPG-UFKL 不会像 RLSD 基线那样在第 250 步熵崩塌?
RLSD 从特权教师蒸馏却没有刹车,策略不断把概率质量集中,actor 熵约在第 250 步崩塌,是模式坍缩的特征。SDPG 加了参考策略 KL 正则和衰减的蒸馏权重,把学生拴在基座附近,保住探索。曲线上 SDPG-UFKL 全程维持更高的熵,同时分数更高,比如 AIME2025 末检查点 0.327 对 RLSD 的 0.300。
SDPG 在数学基准上比 GRPO 高多少,哪个基准差距最大?
Qwen3-4B 训练 400 步(pass@1,mean@32),SDPG-UFKL 末检查点比 GRPO 高 0.100(AIME2024,0.380 对 0.280)、0.085(AIME2025,0.327 对 0.242)、0.144(AMC23,0.858 对 0.714)。AMC23 绝对跳幅最大;AIME2025 相对其更难、更低的基线差距最宽。
SDPG 方法里的正优势门控有什么用?
它只在验证器判对的轨迹上施加在线蒸馏损失。否则那个”分布很尖但仍不完美”的教师,会在全局错误的推理路径上强化局部看似合理的 token,等于在错误轨迹上教出自信的错答。门控把密集的蒸馏信号绑在稀疏的正确性信号上。
一句话:SDPG 让看过答案的同一个模型逐 token 教自己,把一比特的验证器奖励变成密集监督,再用 KL 正则防止这种自教把策略压崩。阅读 arXiv 原文。