ReRe:跨视角复看,提升 MLLM 空间推理
ReRe 让 MLLM 先答一遍空间问题,再看一段合成的新视角视频来修正。免训练,把 Qwen3-VL-2B 在 VSI-Bench 上从 22.5 拉到 31.0(+8.5)。
快速答案
ReRe(Reason, then Re-reason)是一个免训练、推理期的外挂框架,让多模态大模型在看过一段它本来没见过的视频后修正自己的空间答案。模型先从原始第一人称视频里给出一个假设(Reason 阶段);随后一条 Geometry-to-Video 流水线把场景重建成 3D,渲染出一段抬高、斜俯视的新视角视频;同一个模型再看这段视频来验证或纠正自己(Re-reason 阶段)。在 VSI-Bench 上,Qwen3-VL-2B 从 22.5 升到 31.0(+8.5),Qwen3-VL-4B 从 30.7 到 36.5(+5.8),Qwen2.5-VL-7B 从 24.8 到 29.5(+4.7)。权重一点没动。涨分来自给模型看了一个相机没拍到的视角,不靠让它多想一遍。
为什么一条相机轨迹是瓶颈
第一人称视频的空间问题,问的是两个物体隔多远、房间什么布局,可相机只走了一条路。没拍到的角落,模型就永远看不到。单轮模型只能用语义先验去补几何空缺:它会按”沙发到电视的常见距离”去猜,而不是从画面里读出来。ReRe 的出发点是,证据不全时给出的空间结论,应该在有更好视角后还能改。所以系统干脆自己造一个视角出来。
Geometry-to-Video 怎么造出第二个视角
流水线先用 VGGT(一个前馈式 3D 几何 transformer)在原始帧上预测逐像素 3D 点,滤掉置信度低于 0.5 的点,做中值滤波,再沿一条设计好的相机轨迹把点云栅格化成一段新视频。这条轨迹叫”Oblique Sweep”,按 p(t) = c + r·(1-2t)·d 走,方向向量取 45 度仰角,给出抬高的斜俯视角和覆盖全场景的视野。关键是输出还是视频,所以 MLLM 用看原片同一个接口去读它,不加任何投影层、适配器,也不重训。
涨分到底是哪部分带来的
有意思的结论是:单纯复看几乎没用,新视角才是干活的那个。在 Qwen2.5-VL-7B 上(基线 24.8),把原视频和自己拼接得到 25.4,交错帧得到 25.6,都在噪声里。带合成俯视视角的结构化 re-reason 到 29.5。视角的选法也很要命:提出的 Oblique Sweep 是 29.5,鸟瞰环绕 27.4,中等高度平移只有 25.6。最锋利的证据是反例。当论文把原视频和俯视视角按错误协议配对时,分数掉到 23.5,低于 24.8 的基线。第二个视角只有在它带来互补几何、且模型被告知拿它当修正而非额外素材时,才有用。这比作者明说的更强:喂错角度,方法会让结果更糟。
关键结果
- VSI-Bench,开源底座: Qwen3-VL-2B 22.5 到 31.0(+8.5),Qwen3-VL-4B 30.7 到 36.5(+5.8),Qwen2.5-VL-7B 24.8 到 29.5(+4.7);InternVL 的提升小很多(InternVL2.5-8B 35.5 到 36.7,+1.2)。作个参照,GPT-4o 是 34.0,Gemini-1.5 Pro 是 45.4,所以带 ReRe 的 2B 模型(31.0)已经追到接近 GPT-4o。
- STI-Bench 静态子集: Qwen3-VL-2B 22.2 到 30.2(+8.0),Qwen3-VL-4B 29.7 到 34.4(+4.7);闭源对照是 GPT-4o 31.0、Claude-3.7-Sonnet 37.0、Gemini-2.5-Pro 37.1。
- 复看协议消融(Qwen2.5-VL-7B): 单轮 24.8,拼接 25.4,交错 25.6,ReRe 29.5;朴素复看没价值,结构化修正步骤才把分拿到手。
- 视角来源消融: 只看原片 24.8,带俯视视角 re-reason 27.3,错配的原片加俯视 23.5(低于基线),完整 ReRe 29.5;差的第二视角会主动拖低答案。
- 轨迹消融: Oblique Sweep 29.5 胜过鸟瞰环绕 27.4 和中等高度平移 25.6;起作用的是抬高的斜俯视角,不是随便哪个新视角。
- 翻转分析: 在答案发生变化的样本里,71.6% 是错变对,28.4% 是对变错;整体上 11.21% 被纠正、4.44% 被改坏。
怎么读这个标题
涨幅在小模型上最大(2B 底座跳 8 分),到更强的 InternVL 底座上缩到约 1 分。ReRe 是给弱空间感知打的拐杖,模型本身几何读得越好,合成视角能加的就越少。闭源对比也得细看:2B 模型 31.0 超过 GPT-4o 的 34.0,是在加了 VGGT 重建、渲染、外加一次推理之后才做到的,所以”追平闭源 SOTA”说的是这套增强流水线,而不是底座本身,而且仍落后 Gemini-1.5 Pro 的 45.4。这条线和 SpatialClaw、SpatialWorld 的智能体空间推理是同一脉,但 ReRe 把模型冻住,把活全挪到了视角合成上。
局限与存疑
整套方法压在单目 3D 重建上,而单目重建本身是病态的;论文滤掉置信度低于 0.5 的点,正是因为几何有噪声。VGGT 看错场景时,渲染出的视角就把这个错也编了进去,28.4% 的对变错翻转率就是它显性的代价。STI-Bench 只报了静态子集,动态场景的空间推理这里没测。延迟是实打实的:A100 上跑 Qwen3-VL-8B 每个样本多约 11 秒(其中 VGGT 处理 100 帧约占 9 秒),而两次 MLLM 推理本身只要约 2 秒;降到 20 帧的变体能压到约 4 秒,但只给 +2.8 而非 +5.2。论文没换过别的 3D 底座,所以天花板里有多少是 VGGT 的重建质量、多少是复看这个想法本身,没测出来。而且评测都是基准 QA,不是开放式具身任务;在真实世界里一个错的合成视角可能把执行中的智能体带偏。
常见问题
ReRe 这套方法会重训或改 MLLM 吗?
不会。ReRe 是免训练、推理期方法。它冻住底座 MLLM,不加任何架构、适配器或投影层。第二个视角渲染成普通视频,模型用原生视频接口去读。比如 Qwen3-VL-2B 在 VSI-Bench 上从 22.5 到 31.0,全部来自合成新视角那一遍加上修正提示,权重不变。
ReRe 涨分来自新视角还是多推理一遍?消融结果怎么说
来自新视角。Qwen2.5-VL-7B 的消融显示朴素复看几乎不动分(拼接 25.4、交错 25.6,基线 24.8),而合成的俯视视角到 29.5。轨迹消融也印证:Oblique Sweep 29.5,中等高度平移只有 25.6。重看同一段素材基本没收益,带来互补的视角才修得动几何。
错的合成视角会拖低 ReRe 的准确率吗?
会。论文把原视频和俯视视角按错误协议配对时,分数掉到 23.5,低于 24.8 的单轮基线。第二个视角只有在带来互补几何、且模型把它当成修正步骤时才有用。这是给工程的主要警告:差的重建会让答案比不复看还糟。
ReRe 在 VSI-Bench 上的准确率和延迟怎么权衡?
A100 上跑 Qwen3-VL-8B,完整流水线每样本多约 11 秒(VGGT 处理 100 帧约 9 秒),换来 +5.2;两次 MLLM 推理本身约 2 秒。降到 20 帧的变体约 4 秒,但只有 +2.8。所以重建用多少帧,是准确率和延迟之间的主要旋钮。
ReRe 在 VSI-Bench 和 STI-Bench 上和闭源模型比如何?
VSI-Bench 上,ReRe 把 Qwen3-VL-2B 拉到 31.0,在 GPT-4o 的 34.0 之下、离 Gemini-1.5 Pro 的 45.4 还远。STI-Bench 静态子集上,ReRe 在小 Qwen3-VL 底座上到 30.2 至 34.4,对照是 GPT-4o 31.0、Claude-3.7-Sonnet 37.0、Gemini-2.5-Pro 37.1。所以 ReRe 追上了大半中档闭源模型,但没超过最强的 Gemini。
一句话:ReRe 说明第一人称空间推理的瓶颈更多在相机轨迹而非模型本身,渲染一段互补的新视角让模型复看,就足以把冻住的 2B MLLM 在 VSI-Bench 上从 22.5 抬到 31.0。读原论文(arXiv)。