强化学习 · UCLA SDPG:自蒸馏策略梯度,给稀疏奖励 RL 补密集信号 SDPG 给验证器 RL 加一项全词表自蒸馏损失,让看过答案的模型逐 token 监督自己。Qwen3-4B 上 AIME25 从 GRPO 的 0.242 升到 0.327。