视频生成 · 扩散模型 · 高效 AI

Causal Forcing++ 对比 AnyFlow:少步视频扩散的两种相反修法

都把 Wan2.1 蒸馏到低成本:Causal Forcing++ 钉死每帧 1-2 步换 14.1 FPS 实时出流,AnyFlow 让步数自由、质量随步数上升。

Causal Forcing++ 对比 AnyFlow:少步视频扩散的两种相反修法

两者分歧的那个问题

少步视频扩散有一个设计岔口:采样预算在训练时钉死,还是推理时留给用户?2026 年 5 月相隔两天发表、同基于开源 Wan2.1 视频底座的 Causal Forcing++(清华)与 AnyFlow(英伟达),站在这个岔口的两侧。

Causal Forcing++ 认为:交互视频的用户没有资格「选」步数。类游戏的世界必须按固定帧率出帧,所以模型就该被蒸馏到一个硬预算,每帧 1-2 步,然后把包括训练在内的一切工程都围绕把这个固定点做到又好用又便宜来优化。

AnyFlow 认为:从业者期待扩散模型随算力扩展,而一致性蒸馏模型在 16 或 32 步时反而变差,把这个性质弄丢了。该修的是扩展律,不是预算;修好之后,一个 checkpoint 同时服务 4 步预览和 32 步成品。

同月底座、同一个月份、相反的答案。下面的对照表只收录两篇论文各自真实报告的数字。

关键数字

指标Causal Forcing++AnyFlow同口径?
底座模型Wan2.1-1.3B(学生),Wan2.1-14B 作第三阶段打分模型Wan2.1,1.3B 到 14B是,同为 Wan2.1 家族
采样预算固定:每帧 1-2 步自由:展示了 4 / 16 / 32 NFE否,设计目标不同
吞吐2 步逐帧 14.1 FPS;4 步逐帧 8.69 FPS;4 步分块 10.4 FPS现有材料未报告不适用
首帧延迟逐帧 0.27 秒,分块基线 0.60 秒(降 50%)未报告不适用
VBench 总分2 步 84.14,4 步 Causal Forcing 基线 84.04未公布单一 VBench 数字CF++ 各行:同一 Wan2.1-1.3B 口径
VBench 质量 / 语义2 步 84.89 / 81.13,基线 84.59 / 81.84未报告同口径
VisionReward2 步 6.661、4 步 6.798,分块基线 6.326未报告同口径
少步训练成本第二阶段从 11,600 降到 2,900 A800 GPU 小时(约 4 倍),零轨迹存储Flow Map Backward Simulation 引入 rollout 分解,摘要未量化开销否
步数扩展性2 步到 4 步质量基本持平(VBench 仅动约 0.1)质量随 4 到 32 NFE 上升;一致性基线反而变差两者无直接对比
因果 / 自回归设置逐帧 AR 是主结果;动作条件世界模型版仍停在分块 4 步双向与因果 AR 均覆盖;用在策略监督针对暴露偏差否

注意这张表没有的东西:不存在把两个方法放进同一基准的实验。Causal Forcing++ 在 1.3B 小骨干上给出延迟、吞吐、VBench、VisionReward 的硬数字;AnyFlow 报告的是 1.3B-14B、4-32 NFE 的结果形态,但没有公布任何头部基准分。任何给你单一赢家加领先幅度的对照表都是在编数据。

Causal Forcing++ 到底为谁服务

Causal Forcing++ 是一篇效率论文,而且对自己很诚实。它的命题是交互性:动作驱动的世界模型必须按快过人的反应速度出帧,而一次定稿整段片段的双向模型做不到。修法是架构性的:改成逐帧自回归,让首帧在 0.27 秒时就流出、后面的帧还在规划;同时把每帧压到 2 步去噪,稳态跑出 14.1 FPS。

它真正的贡献不在自回归(此前的 Causal Forcing 已有),而在把少步阶段做便宜。前作用因果 ODE 蒸馏做少步初始化,要在每条真实训练视频上预先算好并存下完整去噪轨迹;Causal Forcing++ 换成因果一致性蒸馏,只在相邻时间步之间取单步在线教师 ODE 做监督,论文论证这学到的是同一个自回归条件流映射,却省掉全部预计算和存储,约 4 倍的第二阶段省钱(11,600 → 2,900 A800 GPU 小时)正来自这里。

质量上的叙事刻意低调:从 4 步砍到 2 步,VBench 总分从 84.04 到 84.14,在噪声范围内;赢点在质量持平的同时延迟减半。论文自留的保留对选型很重要:1 步设置动态好但语义理解弱(所以甜点在 2 步),曝光偏差仍让靠后的帧变差,而真交互模拟最需要的动作条件世界模型版仍停留在分块 4 步。「完全实时」目前对提示词驱动生成最站得住脚。

AnyFlow 到底为谁服务

AnyFlow 从一个让人意外的失效出发:给 4 步蒸馏视频模型 16 或 32 步,它反而更差。论文的诊断是:一致性训练用一条独立的一致性采样轨迹替换了概率流 ODE 轨迹,模型学到的是终点而非路径,于是中间步偏离轨迹、累加误差。

修法是把流映射本身蒸出来:沿真实 ODE、在任意时间区间上从 z_t 到 z_r 的转移,而不是蒸一个终点捷径。这样每多一步采样都留在模型真正认识的路径上,测试时扩展被恢复:4 步到项目页展示的 32 步,质量随 NFE 上升。训练端靠 Flow Map Backward Simulation 把完整多步 Euler 积分分解成捷径转移,让监督落在学生推理时真正经过的状态上,即所谓在策略(on-policy)监督,直接针对论文点名的两类失败:少步离散化误差,和因果生成里逐帧误差累积的暴露偏差。

代价是可验证性。摘要与项目页确立了定性结论:少步区间持平或超过一致性方法、4/16/32 NFE 随步数扩展、1.3B 到 14B 双向因果都行,但现有材料里没有公布任何单一 VBench 或 FVD 数字,多出来的训练机制也没有成本核算。「任意步数」这个词也有水分:证据覆盖 4 到 32 步的窗口,不是无界预算。

分歧的本质

剥掉工程细节,两篇论文对「蒸馏后的视频模型是什么」给出了不同定义。

Causal Forcing++ 把它当作有服务等级目标的实时组件:14.1 FPS、首帧 0.27 秒、质量与基线持平。在这份合同下,自由步数是负债:模型若有时想要 16 步才好看,就守不住 14.1 FPS,而交互产品在运行时做不了这个取舍。所以它把预算钉在 2 步,接受 1 步不可用的小代价,然后把其余一切,尤其训练成本,围绕这个固定点优化。

AnyFlow 把它当作应遵守原扩散模型合同的通用生成器:花算力,换质量。在这份合同下,钉死的 2 步预算才是负债,因为它封死了影视管线心甘情愿为之付费的 16 步精修。它修的失效真实存在(一致性模型越过调好区间后肉眼可见地变差),只是论文没给出量化幅度的数字。

技术上有一处呼应:两篇都收敛到「在轨迹上的监督」作为自回归误差的解药。因果一致性蒸馏与流映射蒸馏是不同形式化,但都把「在预计算或捷径状态上训练」换成「与学生真实会走的 ODE 路径绑定的状态」。Causal Forcing++ 用它省掉一个预计算环节,AnyFlow 用它恢复扩展性;两者都不是凭空发明,都是同一个观察的精修:离轨迹的监督正是少步与自回归视频模型悄悄坏掉的地方。

怎么选

  • **有帧率保证的交互或流式产品:**Causal Forcing++。它是两者中唯一公布了延迟与吞吐数字的,Wan2.1-1.3B 上 2 步 0.27 秒首帧、14.1 FPS 是一份可以照着搭系统的规格。选型时把动作条件版仍是分块 4 步这个保留算进排期。
  • **用户按任务自选质量与速度的离线生成:**这正是 AnyFlow 的前提。一个 checkpoint 同时服务 4 步草稿和 32 步成品,是图像视频工具想要的工作流。但在其公布分数之前,先验证再押注。
  • **训练预算是硬约束:**Causal Forcing++ 有实测答案,少步阶段约便宜 4 倍且零轨迹存储。AnyFlow 的在策略 rollout 分解大概率比朴素一致性蒸馏更贵,但论文没有量化。
  • **误差会沿长自回归滚动累积的场景:**两篇都明确针对暴露偏差,AnyFlow 点名用在策略流映射监督,Causal Forcing++ 靠自回归训练加蒸馏间接缓解。没有正面交锋,这仍是一个待实验回答的开放问题。

局限与存疑

大家想要的那个对照,同一模型、同一基准、两个方法同台,在已发表材料里不存在。Causal Forcing++ 的数字全在 1.3B 学生上,causal CD 的等价性与训练省钱能否撑到 14B 级骨干,未知。AnyFlow 号称覆盖 1.3B 到 14B,却没有分规模的公布分数,扩展行为无法对照 VBench 核验。两篇都没有测对方的工作点:Causal Forcing++ 没展示 4 步之后会怎样,AnyFlow 没给 2 步下的延迟数字。而且两者的评测精神也不同,一个固定步数测 VBench 与 VisionReward,一个不带头部分量展示步数扩展,所以即便将来有了正面交锋,也必须同口径才有意义。

常见问题

推理速度上谁更快?

只有 Causal Forcing++ 公布了速度数字:Wan2.1-1.3B 上每帧 2 步跑出 14.1 FPS、首帧延迟 0.27 秒。AnyFlow 没有公布任何延迟或吞吐数据,所以不存在同口径的速度对比。

AnyFlow 步数越多真的越好吗?

这正是它的核心主张:在展示的 4 到 32 NFE 区间内质量上升,而一致性蒸馏的基线越过调好的步数区间后不升反降。已发表材料给的是扩展曲线的形态,没有单一的 VBench 或 FVD 总分,所以效果是「定性可见、幅度未量化」。

Causal Forcing++ 质量比 AnyFlow 高吗?

没有数据能回答。Causal Forcing++ 报告了 Wan2.1-1.3B 上 2 步 VBench 84.14,与自家的 4 步基线基本持平;AnyFlow 现有材料里没有 VBench 数字。任何宣称质量赢家的人,都是在拿缺失的数据做比较。

两个方法都能做流式和实时视频吗?

两者都瞄准流式所在的因果(逐帧自回归)场景。Causal Forcing++ 把它作为主结果,但动作条件世界模型版仍停留在分块 4 步;AnyFlow 覆盖了因果生成并声称用在策略监督削减暴露偏差,但没有公布实时配置。

一句话:要么钉死步数、把一切都围绕实时来工程,要么放开步数、把「多花多得」还回来。完整拆解见 Causal Forcing++ 与 AnyFlow。