VLM 还是视频生成:谁更适合空间智能
冻结特征探针对比 VLM 与视频生成模型:语义任务 VLM 赢(mAP 92.08 对 69.89),几何任务视频模型赢(相机 AUC 0.527 对 0.330),把两者拼起来比谁都强。
机构
专注多模态与视觉语言模型的开源 AI 研究团队,代表项目有 OmAgent、OmDet。
冻结特征探针对比 VLM 与视频生成模型:语义任务 VLM 赢(mAP 92.08 对 69.89),几何任务视频模型赢(相机 AUC 0.527 对 0.330),把两者拼起来比谁都强。