VLM 还是视频生成:谁更适合空间智能
冻结特征探针对比 VLM 与视频生成模型:语义任务 VLM 赢(mAP 92.08 对 69.89),几何任务视频模型赢(相机 AUC 0.527 对 0.330),把两者拼起来比谁都强。
快速答案
没有一边通吃。浙江大学和 Om AI Lab 把一批视觉语言模型(VLM)和视频生成模型(VGM)全部冻结,只在上面训一个薄探针,读出三种空间能力:语义打标、跨视角实例分组、稠密三维几何。结论很干净。VLM 在语义上碾压,ScanNet20 打标平均 mAP 92.08,视频模型只有 69.89;实例分组也是 VLM 领先,T-mIoU 22.66 对 13.24。几何任务上反过来:视频模型在 DL3DV 上拿到平均相机 AUC@30 0.527,VLM 只有 0.330,深度误差也更低(0.072 对 0.113 AbsRel)。真正的亮点是第三条:把一个 VGM 和一个 VLM 的特征拼起来,训同一个探针,得到 92.30 mAP 和 0.615 相机 AUC,两个维度都超过任一单边骨干。所以实用结论是:别再二选一。
三个空间基准在测什么
这三个任务专门用来把语义和几何拆开,这正是对比的目的。语义打标问的是一段视频里出现了哪些物体类别,用 ScanNet20 上的 mAP 计分。实例分组更难:给定多个视角,判断哪些像素属于同一个物理物体,用奖励跨帧一致性的时序 mIoU(T-mIoU)计分。第三个维度三维几何打包了稠密深度(AbsRel 误差)、点云图重建、相机运动恢复(位姿 AUC@30),在 DL3DV 场景上测。打标和分组问的是”是什么、是哪个”,几何问的是”在哪里、相机怎么动”。把三者放进同一个探针,VLM 对 VGM 的差距才看得清,而不是停留在感觉。
如果你更关心空间推理这一面,我们对 VLM 跨视角空间推理的拆解讲了为什么视角变化是语义对齐特征的难点。
VLM 对视频生成骨干,正面硬碰
两边的阵容都铺得很广。VLM 这边:InternVL3(1B/2B/8B)、InternVL3.5(4B/8B)、Qwen2.5-VL(3B/7B)、Qwen3-VL(2B/4B/8B)。视频这边:WAN2.1(T2V 1.3B/14B 和 I2V-14B)、CogVideoX(T2V 2B/5B 和 I2V-5B)、OpenSora2.0、Aether。所有模型都冻结。只训探针(交替帧注意力加全局注意力的 transformer)和任务头,所以数字读出的是每种预训练已经编码进去的东西,不是微调能后天装上的能力。
为什么会这样分?对比式图文预训练教会 VLM 给东西命名,它的特征里带着物体身份,直接迁移到打标和分组上。视频生成器训练的是预测下一帧,这逼它去建模运动、遮挡和视差。这个目标顺带把相机几何和深度编码得比配文目标便宜得多。Qwen3-VL-2B 在它那边拿到最好的语义分数;WAN2.1-T2V-14B 在另一边领跑几何。两个目标把表示拉向不同方向,探针只是把它暴露出来。
关键结果
- 语义打标(ScanNet20,mAP): VLM 平均 92.08,VGM 69.89,差 22 分。VLM 的 APmid 也领先(87.28 对 58.63)。
- 实例分组(T-mIoU / T-SR): VLM 22.66 / 11.23,VGM 13.24 / 4.35。分组靠的是物体中心的语义,所以 VLM 的优势延续过来。
- 三维几何(DL3DV): VGM 每项都赢:相机 AUC@30 0.527 对 0.330,深度 AbsRel 0.072 对 0.113,点云图误差 0.152 对 0.223(后两项越低越好)。
- 简单融合(WAN2.1-T2V-14B + Qwen3-VL-8B,归一化特征拼接): 92.30 mAP,23.70 T-mIoU,0.042 深度 AbsRel,0.615 相机 AUC@30。语义和几何同时超过两个单边骨干。
- 探针深度稳定: 探针深度从 1 到 6,模型相对排名几乎不动,说明探针是在读已有结构,不是从头学任务。
- 分组要语义,不只是连续性: 跨视角分组从物体中心特征获益,比从纯几何连续性获益更多,这也是视频模型几何更强却在分组上落后的原因。
局限与存疑
这是一项探针研究,要当作对冻结表示的测量来读,不是最佳空间模型的配方。完整微调可能重排名次,论文有意没测这一项。基准偏窄:ScanNet20 室内场景加 DL3DV,没有室外、动态或第一视角的压力测试,所以这里的”空间智能”主要是静态室内三维。融合结果最让人兴奋,也查得最少。它只是把一个 VGM 和一个 VLM 拼一次,没有扫过哪些配对融合最好,没有分析增益在更大规模上是否成立,也没有用导航、操作这类下游任务确认探针指标能落地。关于这类表示如何喂进真正的世界模型,世界模型主题页汇集了会消费这种骨干的系统。
常见问题
视觉语言模型和视频生成模型对比,谁更适合空间智能?
看是哪种空间任务,这个分化正是论文的主结论。视觉语言模型赢语义这一轴(打标 mAP 92.08 对 69.89)和实例分组(T-mIoU 22.66 对 13.24),因为对比式图文训练编码了物体身份。视频生成模型赢三维几何(相机 AUC 0.527 对 0.330,深度误差 0.072 对 0.113),因为预测下一帧逼它建模运动和视差。合起来的答案是:把两者各取一个拼起来,效果超过任一单边,所以诚实的建议是一起用,而不是挑一个赢家。
冻结状态下,视频生成模型和 VLM 在深度估计上的结果有何不同?
在这个基准上是的。两边骨干都冻结、只训探针时,视频模型在 DL3DV 上拿到平均深度 AbsRel 0.072,VLM 是 0.113;相机 AUC@30 是 0.527 对 0.330。原因在训练目标:预测未来帧需要内在的深度、遮挡和相机运动感,而配文目标从不需要。WAN2.1-T2V-14B 是研究里最强的几何骨干。
为什么实例分组偏向 VLM 而不是视频模型?
把像素跨视角归到同一个物体,听起来很几何,但论文发现它更靠物体中心的语义,而不是几何连续性。VLM 已经知道”这些像素是一把椅子”,这正是跨视角把一个实例攥在一起所需的先验。视频模型擅长追踪运动,物体身份却更弱,所以尽管几何领先,T-mIoU 仍落后(13.24 对 22.66)。
把 VLM 和视频模型的特征简单拼接,结果真能比两者都强吗?
在这项研究里能。把 WAN2.1-T2V-14B 和 Qwen3-VL-8B 的归一化特征拼起来,训同一个探针,得到 92.30 mAP(高过最强 VLM)、0.042 深度 AbsRel、0.615 相机 AUC@30(高过最强视频模型)。两种范式编码互补信息,所以一次简单拼接既保住 VLM 的语义,又继承视频模型的几何。它只是一个配对,没有扫过其它组合,所以当作一个有力的存在性证明,而非调好的最优解。
一句话:VLM 读语义,视频模型读空间,各取一个拼起来一次性赢过两边。阅读 arXiv 原文。