视频生成 · 高效 AI

LoomVideo:5B 统一视频模型,编辑不靠拼接

LoomVideo 用一个 5B 模型同时做文生视频、指令编辑和多图生视频,VBench 平均 63.15 追平 13B 的 UniVideo(63.01),编辑速度快 5.41 倍。

LoomVideo:5B 统一视频模型,编辑不靠拼接

快速答案

LoomVideo 是一个 5B 参数的模型,在同一套架构里跑文生视频、指令编辑、参考图编辑和多图生视频四种任务。VBench 上它的 RL 版平均拿到 63.15,用不到一半的参数压过了 13B 的 UniVideo(63.01)。效率这块的说法是真的,但范围要看清:在 480x832x97 的视频上,编辑耗时 166.30 秒,而 UniVideo 要 6140.18 秒、OmniWeaving 要 899.32 秒,5.41 倍说的是和 OmniWeaving 的对比。提速来自一个条件注入的小改动。别的模型把源视频的 token 拼到目标序列上(序列长度翻倍,自注意力开销大约翻到四倍),LoomVideo 直接把干净的源视频 latent 乘上一个系数,加进带噪的目标 latent 里,序列长度不变。

拼接为什么是它要绕开的瓶颈

统一视频编辑器通常这样喂源视频:把源片段的 latent token 跟带噪目标 token 拼在一起。贵就贵在这。自注意力对序列长度是平方复杂度,多出一段视频让 token 数翻倍,注意力计算大约翻到四倍,UniVideo 编辑要 6140 秒就是这么来的。LoomVideo 的 Scale-and-Add 条件注入只保留一条序列:取源视频的 VAE latent,乘上一个可学习的系数,在进 DiT 之前加进带噪目标 latent。不多 token,不多注意力。就靠这一步,5B 模型编辑起来比同样 5B、但用拼接的基线还快,比 13B 那些快得多。

MLLM 和 Deepstack 各自换来什么

LoomVideo 扔掉了常用的 T5 文本编码器,改用 Qwen3-VL 这个 8B 的多模态大模型读 prompt,再用 Deepstack 机制把特征注进 DiT,对齐的是 MLLM 的多层输出,不只是最后一层隐状态。理由是 MLLM 本来就同时懂图和指令,能把一条编辑命令和它指向的视觉对象编进同一套表示,文本编码器做不到这点。这和统一离散 token 的多模态模型是同一个思路,只是搬进了扩散 Transformer 的条件通路。多张参考图的情况,论文加了一个 Negative Temporal RoPE,给参考帧分配负的时间位置,让它们待在生成片段时间轴之外,不去抢正片的帧位。

关键结果

  • VBench(视频生成): LoomVideo-RL 平均 63.15,UniVideo(13B)63.01,Wan 2.2(5B)62.50;成像质量 70.92 领先两者。用 DiffusionNFT 加 PickScore 奖励做的 RL,把 Stage-3 的 61.82 抬到了 63.15。
  • 编辑速度(480x832x97 视频): LoomVideo 166.30 秒,OmniWeaving 899.32 秒(5.41 倍),UniVideo 6140.18 秒(约 37 倍);文生视频 132.23 秒对 824.93 秒,差 6.24 倍。
  • RefVIE-Bench(参考图编辑): 总分 3.78,UniVideo(13B)3.38,Kiwi-Edit(5B)2.96;主体(4.50)和背景(3.98)保真都拿第一。
  • OpenVE-Bench(指令编辑): Stage-2 总分 3.15,所比方法里最高。
  • FashionVideoBench(电商): 总分 4.59,VINO 4.38、UniVideo 4.26、OmniWeaving 3.56,这正是它训练数据的主场。
  • 多图生视频(IntelligentVBench TIV2V): 平均 4.24,OmniWeaving 3.89。

怎么读这个提速数字

5.41 倍是按能力对齐的,不是按架构。论文老实写了对比对象是”能力相近的模型”,而 OmniWeaving(8.3B)和 UniVideo(13B)参数都更多,所以这速度差里有一部分只是体量差。更干净的信号在 Table 8 里面:LoomVideo 文生视频 132 秒、编辑 166 秒,几乎持平,只涨了 26%;用拼接的编辑器从生成到编辑会爆掉(UniVideo 从 1792 秒涨到 6140 秒,涨了 3.4 倍)。这条几乎平的曲线,比跨模型的倍数更能说明 Scale-and-Add 有用。论文没做把拼接换回去的同模型消融,所以归因靠的是跨模型数字和这条耗时曲线,不是受控的 A/B。

容易读歪的地方

5B 追平 13B 不等于 LoomVideo 打赢了最好的视频模型。这里的基线全是别的开源统一生成加编辑系统,没有跟闭源前沿视频生成器比过,VBench 63.15 在开源里算不错,但不是前沿分数。它真正的卖点是在某个能力档位上的效率:把四种输入模态折进一个小模型,还能便宜地做编辑,这对它训练数据瞄准的电商和服饰场景最有用。对做工程的人,值钱的是这套条件注入配方,不是新的质量天花板。如果你的编辑器在拼接参考片段,Scale-and-Add 是个几乎零成本的替换,能把编辑的耗时曲线压平,和步数蒸馏的视频扩散从采样端砍推理成本是一个路子。

局限与存疑

组件归因是最弱的一环。论文端到端的数字很好,但没有把 Deepstack、MLLM 编码器、Scale-and-Add 拆开的干净消融,每块贡献多少是推出来的,不是测出来的。作者自己点了高动态场景下的画面瑕疵(眼睛变形、肢体不自然),也承认 5B 这个体量限制了容量。训练数据偏电商和服饰,FashionVideoBench 的分被这点抬高了,真实世界场景的多样性没测过,4.59 不能当成通用能力强的证据。没有同参数量下的耗时对比,没给多出来那个 8B MLLM 的显存占用,也没测 Negative Temporal RoPE 在参考图多到一定程度后还撑不撑得住。Scale-and-Add 的收益在更大的 DiT 上(那时注意力占总成本的比重更小)还成不成立,同样是个开放问题。

常见问题

LoomVideo 编辑视频时怎么绕开 token 拼接?

它不把源片段的 latent token 接到带噪目标序列后面,而是用 Scale-and-Add:把干净的源视频 latent 乘上一个可学习系数,在进 DiT 之前加进带噪目标 latent。序列长度不变,自注意力开销就不涨。所以它的编辑耗时(166.30 秒)只比文生视频(132.23 秒)高 26%,而用拼接的 UniVideo 从 1792 秒跳到 6140 秒。

LoomVideo 的 5.41 倍提速是和谁比的?

是和 OmniWeaving(8.3B)比编辑耗时:480x832x97 视频上,166.30 秒对 899.32 秒。对更大的 UniVideo(13B)差距约 37 倍(166 秒对 6140 秒)。对比对象是”能力相近的模型”,所以差距里有一部分是参数量,不全是条件注入这个改动。

LoomVideo 的 5B 模型打赢最好的视频生成器了吗?

没有。它 VBench 63.15 压过 13B 的 UniVideo(63.01)和 Wan 2.2(62.50),但所有基线都是别的开源统一生成加编辑系统,没跟闭源前沿视频模型比过。63.15 是某个能力档位上不错的开源分数,不是前沿质量的主张。

LoomVideo 里的 MLLM 编码器和 Deepstack 注入各做什么?

LoomVideo 用 Qwen3-VL(8B)替掉 T5 文本编码器,再用 Deepstack 把 MLLM 多层的特征注进 DiT,不只取最后一层。目的是把编辑指令和它指向的视觉对象一起编码。论文端到端分数不错,但没有把它和 Scale-and-Add 拆开的干净消融,所以单块贡献是推出来的。

一句话:LoomVideo 证明了一个 5B 模型能统一四种视频任务,并靠把源 latent 加进去(而不是拼接)做到比 8.3B 基线快 5.41 倍,代价是放弃前沿质量的说法、只主张效率。读arXiv 原文