检索增强生成 · 多模态模型 · 长上下文

重新审视长视频 RAG:V-RAGBench 与 CARVE

CARVE 给每个视频块单独选模态-粒度配置,而不是按查询统一定一种,在去泄漏的 V-RAGBench 上把 Recall@5 从最强基线的 0.510 提到 0.603。

重新审视长视频 RAG:V-RAGBench 与 CARVE

快速答案

CARVE 在长第一视角视频上做检索:四路检索器并行跑,每路对应一种模态-粒度配置,然后让每个视频块用最适合它的那种配置进入生成器。在新基准 V-RAGBench 上(2100 条 查询/证据/答案 三元组,覆盖 216 个视频,时长 11 到 99 小时),CARVE 拿到 0.603 Recall@5,最强基线 VideoRAG-A 只有 0.510;用 Qwen3-VL-8B 做生成,通过率 0.357,基线 0.315。方法背后的核心发现是:最优检索配置由视频块的内容决定,而不是由查询决定,所以业界常用的「一条查询固定一种配置」漏掉了召回。基准本身的贡献和方法一样重要,它先证明了一件事:当下常用的视频问答里,过半样本根本不看视频也能答对。

V-RAGBench 修的泄漏问题

现有的视频 RAG 基准,模型可以什么都没检索对却拿高分。作者发现常用视频问答集里过半样本靠语言先验、世界知识或静态画面就能答,于是生成准确率高也说明不了检索找对了片段。这等于把评估检索这件事架空了。

V-RAGBench 就是来堵这个口子的。它从 Ego4D 取 174 个视频(平均 86 分钟)、从 EgoLife 取 42 个(平均 379 分钟),候选查询过五道筛:语义相似度去重、用 GPT-5.2-chat 验证可答性、剔除捷径偏差(凡是不看画面就能答的全扔)、实证确认可答、再做证据唯一性检查(答案若能从非证据块里恢复,这条查询就删)。剩下 2100 条三元组,按 1800 训练、300 测试切分,每条都带标注好的证据块。证据有标注,检索和生成就能分开打分:检索用 Recall@5 和 nDCG@5,生成用 LLM 评判的通过率。这种解耦是让检索分数可信的关键设计。检索需要诚实、专门的评估,这条思路也贯穿在重新审视超越语义相似度的检索里。

CARVE 怎么给每个块选配置

这里的配置是一个 2x2 网格里的一格:模态(视觉嵌入 vs 文本摘要)乘以粒度(k-means 选 5 个关键帧 vs 整段 2 分钟片段)。以前的方法对查询触及的每个块都锁死一格,或固定融合全部四格。CARVE 认为决策单元就选错了。

第一阶段:四路检索器各跑各的,把各自 top-k 合进一个候选池,每个块带上「是哪种配置把它捞出来的」标签。第二阶段:用一个多模态交叉编码器(Qwen3-VL-Reranker-2B)重排,每个块只在自己的标签下打分,不在四种配置下都算一遍,得分最高的标签就是这个块的胜出配置。到生成阶段,证据以模态交错的方式喂进去:这个块是关键帧,下个块是文本摘要,再下个是整段片段,各自用把它检索出来的那种表示。生成器看到的是异构证据集,而不是被统一成一种格式。这是「检索不等于相似」这条教训更锋利的一版,智能体式记忆检索从视频理解那一侧也撞上了同一个点。

按块选配置到底买来了什么

消融把 0.603 拆开看。最好的单一配置(视觉嵌入 + 整段片段)只有 0.507 Recall@5;最好的两两组合到 0.567;四种配置加按块选到 0.603。也就是说,相对单一配置的提升里,约一半来自模态-粒度本身的多样性,剩下一半来自按块选而非按查询选。

重排策略同样吃重。每个块在自己的检索配置下打分能拿 0.603,而随机给配置或把四种配置拼成一个联合分数都掉到 0.513。这 9 个点就是忽略「到底哪种视角找到了这个块」的代价。配置分布表证明这里没有捷径:胜出配置散落在整个网格上(文本-帧 25% 到 37%,视觉-片段 24% 到 36%,其余 11% 到 28%),没有任何一种配置悄悄通吃,按块的这套机制配得上它的开销。

关键结果

  • 检索 Recall@5:CARVE 0.603,最强基线 VideoRAG-A 0.510(8 个基线之首,k=5,测试集),绝对涨 0.093,证明按块配置胜过按查询配置。
  • 检索 nDCG@5:0.433 对该指标最强基线 GQR 的 0.340,说明改善的是排序质量,不只是命中率。
  • 生成通过率:Qwen3-VL-8B 上 0.357 对 0.315(VideoRAG-B),Qwen3-VL-32B 上 0.367 对 0.317,Gemma-4-26B 上 0.320 对 0.307(VideoRAG-A),检索收益在三种生成器上都传得下去。
  • 无需训练胜过按查询路由:CARVE 通过率 0.357,训练过的非 LLM 路由器 0.329,LoRA 微调的 LLM 路由器 0.310,一条不训练的按块规则压过学出来的按查询路由。
  • 重排关键:按配置重排 0.603 Recall@5,随机分配配置或联合拼接都只有 0.513,忽略配置标签就掉 0.090。
  • 基准泄漏:常用视频问答集里过半样本不看视频也能答,V-RAGBench 用五道筛过滤到 2100 条带证据标注的三元组。

局限与存疑

绝对值并不高。0.603 Recall@5 意味着正确证据约有 40% 的概率掉出前 5,生成通过率约 0.36 意味着多数问题还是没答对,所以 V-RAGBench 是个难基准,CARVE 是赢下了一个难题而非解决它。基准的范围限定在基于内容、基于块:证据落在不重叠的 2 分钟块里,跨块边界或长跨度的查询会被卡住,知识图谱和元数据检索整块被搁置。给每条查询都跑四路检索加一个 2B 重排器,比单配置流水线更费算力,而论文谈质量提升时没给配套的延迟或成本预算,相对便宜的固定配置到底划不划算没有量化。整套流程还依赖特定模型(筛选用 GPT-5.2-chat,重排和评判用 Qwen3-VL 系列),泄漏筛和通过率评判对这几个评判模型有多敏感,论文没压测。从第一视角的 Ego4D/EgoLife 素材推广到第三人称或教学视频,也还没验证。

常见问题

为什么 V-RAGBench 说过半视频问答样本不看视频也能答?

作者发现常见视频问答查询靠的是语言先验、世界知识或静态画面,而非随时间变化的视觉证据,模型光靠文本就能答。这会抬高生成准确率却掩盖检索失败,所以 V-RAGBench 在保留 2100 条三元组前先过五道筛,包括剔除捷径偏差和证据唯一性检查。

CARVE 为什么不训练就能在 V-RAGBench 上压过按查询路由?

CARVE 按块而非按查询分配检索配置,再让每个块只在检索到它的那种配置下重排。生成通过率 0.357,高过训练好的非 LLM 路由器 0.329 和 LoRA 微调的 LLM 路由器 0.310。收益来自把最优配置当成视频块内容的属性,而不是对每条查询只做一次的决定。

CARVE 的 0.603 Recall@5 在 V-RAGBench 上是和哪些基准对比的?

和 8 个 VideoRAG 基线比,k=5,300 条测试样本。最强的 VideoRAG-A 是 0.510 Recall@5,所以 CARVE 的 0.603 绝对涨 0.093。消融显示最好的单一配置只有 0.507,最好的两配置组合 0.567,所以模态-粒度多样性和按块选这两件事都有贡献。

CARVE 的模态交错生成方法是什么意思?

每个证据块用检索到它的那种配置喂进生成器,于是一个块是 5 个关键帧,另一个是文本摘要,再一个是整段 2 分钟片段。生成器看到的是混合格式的证据集,而不是被统一成一种表示,这正是让按块选配置延续到生成阶段的做法。

一句话:CARVE 说明合适的检索格式是每个视频块的属性、不是查询的属性;V-RAGBench 说明在你把那些根本不需要视频的视频问答剔掉之前,你根本量不准这件事。阅读 arXiv 原文