VLM 还是视频生成:谁更适合空间智能
冻结特征探针对比 VLM 与视频生成模型:语义任务 VLM 赢(mAP 92.08 对 69.89),几何任务视频模型赢(相机 AUC 0.527 对 0.330),把两者拼起来比谁都强。
主题
从文本或其它条件合成视频的模型,涵盖流式与自回归扩散等方法。
冻结特征探针对比 VLM 与视频生成模型:语义任务 VLM 赢(mAP 92.08 对 69.89),几何任务视频模型赢(相机 AUC 0.527 对 0.330),把两者拼起来比谁都强。
WorldCraft 让你点物体、画路径,在镜头可控的视频世界模型里把它拖着走。轨迹误差 38.90px,优于 DragAnything 的 39.86,镜头 RPE 仍保持 0.131。
ByG 不用任何配对数据、不用奖励模型,训练图像与视频编辑模型;视频两两对比中以 75.3% 胜率击败用数百万配对训练的 Ditto。
LoomVideo 用一个 5B 模型同时做文生视频、指令编辑和多图生视频,VBench 平均 63.15 追平 13B 的 UniVideo(63.01),编辑速度快 5.41 倍。
首个自回归扩散口型同步法:把 14B 双向教师蒸馏成因果学生,每块只跑 2 步去噪,1.3B 跑到 31.58 FPS,首帧延迟亚毫秒。
SCAIL-2 把原始驱动视频直接拼进生成序列,不再走骨架中间表示,Studio-Bench 上 FVD 287 优于 Wan-Animate 的 305,且一个模型同时做动画和角色替换。
OmniDirector 把参考视频的运镜复制到新生成的视频里,旋转误差降到 2.64 度,优于 CamCloneMaster 的 4.11,且不需要跨配对训练数据。
HYDRA-X 用单个 ViT 统一图像和视频 tokenization,tubelet attention 与层级时间压缩把 DAVIS rFVD 做到 11.19,编辑总分 4.34。
ABot-Earth 0.5 用卫星图生成 3D Gaussian Splatting 城市场景,报告每平方公里 10 分钟内生成,FID 为 16.1。
CoVEBench:视频编辑能否听懂复杂指令把视频编辑复杂指令遵循变成可检查任务,帮助读者判断系统在哪里失效、结果应如何解读。
世界模型 · JD.com (Joy Future Academy)
镜头转回旧场景时,块状状态空间循环拿到 69.0 的开放域一致性分,无记忆基线只有 12.25;激进压缩与空间摘要几乎全军覆没。
多模态模型 · Independent Researcher
VideoKR:知识密集型视频理解把视频理解中的知识与推理变成可检查任务,帮助读者判断系统在哪里失效、结果应如何解读。
不让视频模型自己硬推,而是让 VLM 给中间帧打分、逐样本微调一个 LoRA。RULER-Bench 从 46.4 拉到 68.2。
Echo-Infinity 用可学习演化记忆以恒定成本压缩任意长度历史,单张 H100 上 18.5 FPS 实现 24 小时(超 130 万帧)实时生成。
SANA-Streaming 在单张 RTX 5090 上 24 FPS 端到端实时编辑 1280x704 视频,DiT 核心达 58 FPS,靠混合 DiT 与循环反向正则化保证时序一致。
VideoMLA 把多头潜在注意力搬进因果视频扩散,单 token KV 显存砍 92.7%(224 对 3,072 标量),VBench 60s 夺冠,B200 吞吐提升 1.23 倍。
扩散模型 · University of Science and Technology of China
Stream-R1 用视频奖励分数和逐区域困惑度给 DMD 损失重新加权,1.3B 流式模型在 VBench 拿到 84.40,反超 14B 教师的 84.26,且仍是 23.1 FPS。