ByG:无配对数据训练编辑模型,胜过百万配对的监督模型
ByG 不用任何配对数据、不用奖励模型,训练图像与视频编辑模型;视频两两对比中以 75.3% 胜率击败用数百万配对训练的 Ditto。
快速答案
ByG(Bootstrap Your Generator)训练一个流匹配编辑器,全程不用一对”编辑前/编辑后”样本。它只从一个冻结的基础生成模型里学:一边从该模型抽取”指令该怎么改”的线索,一边用循环一致性损失保住结构。在视频编辑上,它在两两人评中以 75.3% 的胜率击败 Ditto(一个用数百万合成配对训练出来的模型);在没见过的 3D-CGI 转换上,ByG 胜率 85.0%,Ditto 只有 15.0%。图像模型从约 330 个无标注图像元组学,视频模型从 328 段生成视频学,基模型分别是 FLUX.1-dev 和 Wan2.2。一句话:基模型自带的语义,足以同时顶替配对数据和外部奖励模型。
编辑为什么离不开配对数据,视频又为什么拿不到
指令编辑器通常靠三元组学:原图、编辑指令、正确结果。给图像凑几百万这样的配对已经很贵,给视频几乎做不到,你得把同一段片子在只改一处的前提下渲两遍。ByG 把这个要求整个去掉了。它先问冻结的基模型:编辑后的画面该长什么样(指令线索);再要求把编辑做一遍、再逆回去要能还原原图(循环一致性管结构)。没有人工标注,没有合成的编辑配对,也没有单独打分的奖励模型。监督信号来自基模型跟自己较劲,直到编辑既听指令、又不改身份。
“在干净预测上回传梯度”到底修了什么
流匹配在带噪状态上训练,但 ByG 关心的损失(编辑听不听指令、结构保不保得住)只有在干净图上才有意义。直接在一步去噪的干净猜测上算损失,图太糊,梯度是坏的;干脆多步去噪到清晰图,又因为采样器没法好好求导,把反向传播断了。ByG 把两件事拆开。前向时用多步去噪的干净估计来算损失,图够清,损失才靠谱;反向时让梯度绕开这个估计,改从一步预测里走。这是把直通估计搬到了流匹配上:在真实的干净图上评估,在可导的带噪状态上学习。训练优化的就是推理时采样器输出的那张干净图,训练和推理的口径对上了。
这套流匹配建模沿用了 Stable Diffusion 3 带火的写法;它盯的训练与推理分布差,也正是 Flow-OPD 从蒸馏一侧要解决的同一个问题。
哪一块在扛结果
消融(0 到 10 分,分别打编辑成功度和原图保留度)说得很直白。去掉方向正则损失,模型直接崩:编辑成功度跌到 0.633,原图保留度反而冲到 9.767,意思是它学会了照抄输入、无视指令。就这一个损失,挡住了身份塌缩。去掉自举(bootstrapping),编辑成功度落到 5.517,所以这个迭代自我改进是第二根顶梁柱。梯度路由和循环损失单独拿掉影响小一些(编辑成功度 8.917 和 8.983,完整模型是 8.317)。这给出一个有用的信号:那个出彩的梯度技巧是真的,但真正不让训练垮掉的是正则项和自举循环。只抄”聪明”的梯度路由,模型大概率会崩。
关键结果
- 视频人评:ByG 总体胜率 75.3%(±2.2),卡通目标 70.0%,写实目标 80.5%,对手是 Ditto。评分者一致性 Fleiss κ = 0.44,二项检验 p 小于 3e-15。
- 域外视频:在没见过的 3D-CGI 转换上,ByG 胜率 85.0%,Ditto 仅 15.0%,差距最大,也是泛化最硬的证据。
- 视频客观指标(对比 Ditto):DINO 结构相似度 0.718 比 0.536,CLIP 方向性 0.104 比 0.091,运动保真度 0.715 比 0.616。
- 长尾风格编辑:风格转写实 8.30 比 FLUX-Kontext 的 7.85;写实转风格 6.33 比 6.00,覆盖六种冷门风格(GTA V、Minecraft、美漫、低多边形、体素、乐高)。
- 通用图像编辑(GEdit-Bench):总体持平,难类别拉开差距:运动 6.88 比 Kontext 4.53,人物 6.59 比 3.94,风格 6.95 比 5.90。
- 训练成本:图像模型在 8 张 H100 上跑 30000 步,从约 330 个无标注元组学,单步约为监督训练的 3 倍(约 2.9 秒比 0.97 秒);视频模型 750 步。
怎么读这个标题
“胜过用数百万样本训练的监督模型”是最强的说法,也最该细看。干净的部分是视频客观表(DINO 0.718 比 0.536)和长尾风格分,这些是自动指标。人评数字偏主观:8 个评分者、238 票,而且视频是作者每个方法先采 4 段、人工挑出最好的一段,再拿去给人看,这对方差大的方法更有利。一致性 κ = 0.44 只能算中等。所以”75.3% 胜率”的真实含义是:一个小评审团,在 ByG 手挑的最佳片段和 Ditto 手挑的最佳片段之间,更偏向前者。结构相似度和域外差距才是更耐看的证据,胜率是辅证,不是主证。通用图像那条也诚实:在标准 GEdit-Bench 上是持平而非碾压,增益集中在运动、人物、风格三类。
这种无配对编辑,跟”不靠逐任务监督也能可控编辑视频”的大方向挨着,和 LoomVideo、以及 CoVE-Bench 的指令评测是同一片地。
局限与存疑
单步训练比监督编辑慢约 3 倍,所以”不要数据”是用数据成本换了算力成本,外加一个更脆的优化过程。整套结果都吃定基模型本来就认识目标概念;ByG 只是抽线索,不会教基模型任何新东西,基模型不会的编辑就够不着。基准偏小,而且部分是自建的:视频集是作者自己攒的 119 个任务,用户研究是 8 个评分者加人工 best-of-4 挑选,协议偏宽松。没有在监督基线的主场跑 FID 或大规模自动评测,所以”胜过监督”靠的是风格/结构指标加评审团。那个防塌缩的正则损失显然很敏感(去掉它编辑成功度近乎归零),说明训练对这个超参很挑。
常见问题
ByG 用到了配对数据或奖励模型吗?
没有。ByG 训练时零配对编辑样本,也没有外部奖励模型。监督全部来自冻结的基生成模型:从它抽取的指令线索,加上一个管结构的循环一致性损失。图像模型从约 330 个无标注图像元组学,视频模型从 328 段生成视频学,基模型分别是 FLUX.1-dev 和 Wan2.2。
ByG 这个方法在干净预测上回传梯度,到底修了什么?
修的是训练与推理的口径差。ByG 的损失只有在清晰图上才有意义,但产出清晰图的采样器不好求导,而一步去噪的干净猜测又太糊、打不出有效分。ByG 前向时用多步去噪的干净估计来算损失,反向时让梯度改走一步预测,这是给流匹配做的直通估计,让训练去优化推理真正会输出的那张干净图。
ByG 的消融里,是哪一块在扛结果?
最关键的是方向正则损失:去掉它,编辑成功度跌到 0.633(满分 10),原图保留度升到 9.767,模型变成照抄输入。第二是自举,去掉后编辑成功度落到 5.517。梯度路由和循环损失单独影响较小(8.917 和 8.983,完整模型 8.317),所以真正稳住训练的是正则项和自举循环。
ByG 在域外视频上跟 Ditto 对比怎么样?
在没见过的 3D-CGI 转换上,ByG 以 85.0% 的人评胜率压过 Ditto 的 15.0%,这是它最大的优势。视频总体胜率 75.3%(±2.2)。客观上 ByG 保结构强得多,DINO 相似度 0.718 比 0.536。需要留意:评分者看的是每个方法人工挑出的 best-of-4 片段,胜率协议偏宽松;DINO 和域外这两个差距才是更硬的证据。
一句话:ByG 证明一个冻结的生成模型自带的信号,已经足够训出一个不用配对数据、不用奖励模型的编辑器,代价是约 3 倍训练算力和一个很挑的正则项。阅读 arXiv 原文。