强化学习 · 大模型推理

DelTA、AntiSD 与 DVAO 对比:RLVR 单点奖励的三层修法

RLVR 只在答案末尾给一个对错信号,三个 2026 年的方法在不同层修这件事:DelTA 重加权更新方向,AntiSD 造逐 token 的稠密奖励,DVAO 按组内方差自动配比多路奖励。

DelTA、AntiSD 与 DVAO 对比:RLVR 单点奖励的三层修法

单点奖励问题

可验证奖励强化学习(RLVR)给整段推理链打分的方式很像考试批改作文:只在最后给一个分数。答案对或错,训练循环能拿到的反馈就只有这一个标量。但参数更新要作用在成千上万个 token 上,算法总得决定哪些 token 真正导致了结果。GRPO 给的答案很糙:正确回答里的每个 token 被同样幅度地推高,错误回答里的每个 token 被同样幅度地压低。逗号和关键引理待遇相同。

这个糙答案曾经够用:DeepSeekMath-RL 7B 靠它把 MATH 从 46.8% 拉到 51.7%,至今仍是几乎所有开源推理配方的默认设置。但 2026 年的三篇论文从栈里三个不同的层攻击同一个弱点,而且它们之间的选择是真正的工程决策,不是榜单口味问题。DelTA 不动奖励,只重加权更新方向,让信用落在决定性的 token 上。AntiSD 直接改造奖励本身,从特权上下文里挖出一个逐 token 的稠密信号。DVAO 完全不碰 token 维度,它修的是多个标量奖励怎么合并成一个优势值。同一种病,三个不同的器官。

更新层:DelTA

DelTA 的观察是几何性的。它证明策略梯度更新在数学上等价于在 token 梯度向量上构造一个线性判别器:更新方向是带优势权重的 token 向量求出来的质心,应用这个更新就是把策略往”正确”一侧推、远离”错误”一侧。朴素的序列级 RLVR 用简单平均构造质心,于是高频、低信息量的 token 支配了整个方向。格式符号、连接词、套话几乎出现在每个回答里,无论对错,而真正区分对错的那少数关键 token 被淹没了。

DelTA 估计逐 token 的系数,放大指向明确的一侧的方向、压低共享方向,再用这些系数重加权一个自归一化的 RLVR 代理目标。奖励完全不动,还是原来那个可验证的 0/1 信号,改变的是谁有资格花你的梯度预算。代价是一个近似:为了让系数估计便宜,DelTA 用的是受限层的 token 梯度代理,而不是全参数梯度。这是额外算力,也是最可能在别的模型家族上失真的地方。

回报是:七个数学基准上,Qwen3-8B-Base 平均准确率 28.40,对 DAPO、SAPO、FIPO 中最强者 25.14(+3.26);Qwen3-14B-Base 是 39.91 对 37.29(+2.62)。附录里还有代码生成和 Olmo3-7B-Base 的结果,但证据集中在 Qwen3-Base 的数学任务上。

奖励层:AntiSD

AntiSD 走得更远:它造了一个新的逐 token 奖励。关键在于把自蒸馏反过来。普通的特权上下文自蒸馏(问题加提示或部分解)把策略拉向老师,而论文的诊断是:这恰好锐化了错误的 token——结构性套话更自信了,而模型真正在权衡的推敲 token 反而被压平。AntiSD 转而计算下一个 token 与特权上下文之间的条件逐点互信息(PMI),奖励特权分布与无条件模型发生分歧的那些 token。带新信息的 token 被推高,不带的被忽略。最小化这个差距是蒸馏,最大化它才是”反”。

两个工程细节防止它崩掉。优势用一个平滑的 phi 函数塑形,推敲侧以 -0.5·log 2 为下界,探索性 token 不会被罚得太狠。熵门控则在 5 步 warmup 里标定教师熵基线,一旦熵跌破基线的 0.93 倍就关掉这个奖励——自信的老师已经没有分歧可挖了。信号只在有信息时被使用,所以它前期可以激进、后期无害。

结果主打的是样本效率而不只是最终分数:五个从 4B 到 30B 的模型(含 Qwen3-8B、Qwen3-30B-A3B 和两个 OLMo-3 变体)上,AntiSD 用少 2 到 10 倍的步数达到 GRPO 的准确率,最终还多出最多 11.5 分。最强的单点数据是 Qwen3-8B 在 HMMT 2025 上:约五分之一的步数到达 GRPO 的峰值,最终高出约 15 分。诚实的保留意见是广度:数学题的”部分解”很好构造,开放任务或智能体任务里特权上下文该怎么定义,论文没有答案。

目标层:DVAO

DVAO 回答的是另一个真实部署里才会出现的问题:不是”哪个 token 该得分”,而是”哪路奖励该得分”。一旦你想同时要正确、格式好、不超长度、工具调用合法,GRPO 式训练就得把多个标量奖励合并成一个优势值。两种标准合并方式各有死法。先加奖励再算优势,会产生幅度过大的优势值,策略梯度失稳。每路目标各算一个优势再按固定权重相加,尺度稳定但瞎:整组 rollout 都已经满足的奖励几乎不带学习信号,它的固定权重却一直在淹没真正需要梯度的难目标。

DVAO 读取每组 rollout 内每路奖励的经验方差,按方差给该路目标的优势加权。16 个采样回答全都已经满足格式奖励,那这一路方差接近零,贡献就小;正确性在组内差异大,信号就在那里,权重就高。按组归一化让合并后的优势有界,一个自适应的跨目标正则项防止某路目标压垮另一路,驱动它们的同样是方差统计量,而不是每个任务都要重调的超参。

Qwen3-4B-Base 上同时训数学和工具调用奖励,DVAO 平均准确率 42.19%,对奖励合并的 38.99% 和优势合并的 38.75%;长度合规率 99.91%,对其他方法约 96%。同设置下固定权重的 GDPO 崩到 13.41%,是最有说服力的一行:错误的目标配重不只是差一点,可以让训练直接失败。但方差加权的已知失效模式也要记住:一路所有 rollout 全失败的目标方差同样低,会在最要劲的时候被饿死。

关键数字

测量项DelTAAntiSDDVAO设置与出处同一套评测?
修法所在层token 更新重加权新增逐 token 奖励目标级优势权重设计层面,三篇论文是,由定义决定
每步额外机制受限层梯度代理特权上下文前向 + 熵门控组内方差统计各论文是
主打结果均分 +3.26(28.40 对 25.14)最多 +11.5,2–10 倍提速42.19% 对 38.99% 平均准确率Qwen3-8B-Base 数学 / 4B–30B 数学 / Qwen3-4B-Base 数学+工具否,三套不同设置
Qwen3-8B 数学细节AIME24 43.13,AIME25 26.46,HMMT25 18.33HMMT25:约 1/5 步数到 GRPO 峰值,终局约 +15 分未在该模型上跑DelTA 与 AntiSD 论文表格否
测过的最大模型Qwen3-14B-Base(39.91 对 37.29,+2.62)Qwen3-30B-A3B(五个模型 4B–30B)Qwen2.5-7B-Instruct各论文否
次要目标无熵门控阈值 0.93×warmup 基线长度合规 99.91% 对约 96%AntiSD / DVAO 论文否
支持多路奖励否,单一可验证奖励否,单路塑形奖励是,数学 + 工具调用(BFCL-v4)设计层面是
数学之外代码增益在附录HumanEval+/MBPP+ 作次要检查BFCL-v4 工具调用套件各论文否

读这张表要读它缺什么:没有任何一行把这三个方法放在相同数据、相同奖励、相同算力下跑过。DelTA、AntiSD、DVAO 各自挑了自己的基线、各自的评测组合,Qwen3-8B 数学那几行来自不同论文、不同 rollout 预算和步数,所以”主打结果”那一行应当作三个独立声明读,而不是排名。真正能直接比的是设计行:只有 DVAO 管多路奖励,只有 AntiSD 每步需要额外前向。

也值得把这三个方法放进 GRPO 变体的大图里看。CPPO 证明了”在哪里收紧信赖域”和”收多紧”同样重要:对靠前的 token 更严的裁剪加上前缀漂移预算,在 Qwen3-30B-A3B-Base 上把 AIME Avg@16 从 GRPO 的 38.19 拉到 54.79,数据与奖励完全相同。这个结果既不需要新奖励也不需要新权重,它提醒一件事:在加机制之前,裁剪策略本身还是个自由变量。

怎么选

  • 单一可验证奖励、每步前向预算紧张: 先用 DelTA。rollout 阶段不需要任何额外东西,沿用成熟的结果级奖励,8B 规模七个数学基准平均 +3.26 是超过 DAPO 一类基线的实在提升。风险在梯度代理,留一个快速 sanity check 给自己的模型家族。
  • rollout 生成占训练成本大头、任务像数学: 三个方法里 AntiSD 的主张最强,因为 2–10 倍提速是算力声明,不是榜单微调。代价是你要能构造特权上下文,还有一个带调参常数(0.93、5 步 warmup)的熵门控值得做敏感性检查。
  • 两路以上奖励混训: 三个方法里只有 DVAO 适用。Qwen3-4B-Base 上同一轮训练拿到最高准确率和 99.91% 长度合规,正是固定权重不做逐任务调参就很难同时做到的。留意”整组全失败的目标被饿死”的失效模式。
  • 以上都不是: 如果你的奖励是学习出来的偏好模型而不是可验证判分,三个方法都失去立足点。它们是 RLVR 的修法;奖励带噪声的 RLHF 是另一个问题。

局限与存疑

最明显的缺口是受控对比的缺席:没人把 DelTA、AntiSD、DVAO 放在同一数据、同一奖励、同一算力下跑过。每篇论文报的是各自的基线、步数和评测组合,所以本页刻意不根据数字封王。广度是第二个共同局限:三者主打数学推理,那里可验证奖励最干净。DelTA 的代码和域外结果只有附录规模;AntiSD 的特权上下文在数学里很自然、在多数智能体任务里无定义;DVAO 的工具调用数字是它自己表格里最薄的一列。第三,各带各的脆点:DelTA 的受限层代理、AntiSD 的门控常数、DVAO 的全败目标饿死。最后,没有一个方法被拿去和”把它替代的东西精调到手”的版本比过——token 加权、辅助损失、固定奖励系数都一样。“省掉调参负担”是三篇共同承诺、也都没完全兑现的事。

常见问题

DelTA 和 AntiSD 都作用在 token 级,到底差在哪?

差在改的是什么。DelTA 把奖励保持为答案末尾的单一标量,重加权的是 token 级的”更新”,让决定性 token 支配梯度质心;它不需要新信号,只需要一个梯度代理。AntiSD 造的是逐 token 的”新奖励”,用下一个 token 对特权上下文的逐点互信息计算,所以需要额外前向来评估特权上下文,但从此不再依赖结果信用的间接分配。

AntiSD 会替换掉 RLVR 里的可验证奖励吗?

不会。PMI 奖励是逐 token 的辅助塑形信号,可验证的结果奖励照旧决定答案对错。这个分工的权重配比以论文自己的消融为准,但论文把 PMI 项定位成”用少 2 到 10 倍的步数达到同一准确率”的效率手段,而不是可验证判分的替代品。

只用一路奖励训练时,DVAO 还有意义吗?

没有。DVAO 只改多路目标怎么合并成一个优势,单路奖励下它退化成普通的组内相对归一化。它的全部价值出现在同时优化正确性、格式合规、长度预算这类组合场景:固定权重要么让训练失稳,要么让难目标被淹掉。

Qwen3-8B 数学 run 应该先试哪个?

如果这轮训练很贵、任务又是数学,AntiSD 在恰好这个设置上有最强主张:Qwen3-8B 在 HMMT 2025 上用约五分之一的步数追平 GRPO 峰值,终局高出约 15 分。如果想动最少的零件、不要额外前向,DelTA 在同型号上七个数学基准平均 +3.26 是保守之选。