多模态模型 · AI 智能体

InternVideo3:8B 视频模型加一圈智能体推理

InternVideo3 是 8B 视频模型,单次前向在 Video-MME 拿 73.8,套一圈智能体推理再加 2.7。M2LA 让单张 H200 跑到 768K token。

InternVideo3:8B 视频模型加一圈智能体推理

快速答案

InternVideo3 是上海 AI Lab 与南京大学的 8B 视频语言模型,做了两件可以分开看的事。当作普通模型,它在 Video-MME 拿 73.8、MLVU 77.3、EgoSchema 76.6,超过 7B 的前作 InternVideo2.5(65.1 / 72.8 / 63.9),也超过同规模的 Qwen3-VL-8B(71.4 / 57.6 / 69.8)。另一件事是:给这个模型套上作者称为多模态上下文推理(MCR)的智能体回路后,Video-MME 从 73.1 升到 75.8,这 +2.7 来自推理时的工具调用,不是权重本身变强。第三块是底层管线:一个自研注意力变体 M2LA,让单张 H200 跑到 768K token,而基座架构在 512K 就显存耗尽。

这三件分开记。单次前向的分数是 8B 权重的能力。+2.7 是工具回路在上面加的。768K 上下文是分钟级视频能跑起来的前提。

问题:长视频会把单次问答压垮

15 分钟视频按 4 fps 算,大约 256K token。到这个长度有两处会崩。一是 KV 缓存装不下:基座 Qwen3-8B 注意力在 H200 上约 512K token 就爆显存,真正的长视频根本上不了台面。二是一次前向回答一个难的时序问题,模型得在同一遍里找到相关片段、看懂、再推理,没有机会回头再看一眼。InternVideo3 两头都打:M2LA 解决显存墙,MCR 把单次问答变成”看、想、动手、再看”的回路。

智能体回路怎么转,以及它不是什么

MCR 把一个问题当成在不断生长的共享上下文上的闭环。每一轮模型观察视觉 token,写下中间推理,选一个动作,再把结果折回上下文。动作是真工具:视频分割、ASR、时序定位、网页搜索、记忆读写、一个验证步、一个终止步。再往上是一套视频智能体脚手架,带分层记忆(帧索引、场景边界、片段字幕、时间戳)、一个先给问题分类的路由器,以及给出答案前的递归自检。

这条线要守住:Video-MME 上的 +2.7 来自这套脚手架,不是基座权重在测试时变聪明了。智能体可以重新查询某个片段、对听错的一段重跑 ASR、答题前先验证一个判断,增益就藏在这些额外的来回里。如果把 75.8 报成”模型的分数”,等于悄悄把搜索预算和工具栈算到了 8B 网络头上。诚实的说法是:73.1 是模型,75.8 是模型加一圈带工具预算的智能体回路。这种区分在搜索智能体的 harness 里同样关键,脚手架和策略各占最终数字的一块。

M2LA:怎么不丢 token 装下 768K

M2LA(多模态多头潜在注意力)压缩 KV 缓存,而不是裁剪 token。它把键值分解到一个紧凑的潜在空间,再逐头重建,加上模态感知适配器让文本和视觉在缓存的潜变量上各用一组仿射映射,并在更深的层做更激进的压缩。能在 Qwen3 骨干上跑通的关键是处理 QK-Norm:论文观察到 RMSNorm 系数集中在高维空间,把这个归一化近似成一个常数线性缩放,潜在分解才能穿过归一化层活下来。

回报在单张 H200 上:32K token 解码加速 1.84 倍,128K 加速 4.12 倍,256K 到 384K 高到 5.01 倍。基座在 512K 爆显存,M2LA 跑到 768K。同样的低秩 KV 思路也出现在 VideoMLA 的潜在 KV 缓存 里,只是那篇把它搬进了视频扩散而非理解。这是视频系统里正在收敛的一个方向,不是孤例。

怎么训出来的

四个阶段,按顺序。先在 16M 多模态样本(约 13.5B token)上继续预训练,把 M2LA 改造后掉的语言能力和对齐找回来。再做短到长的监督微调,先 2 fps、最多 512 帧,再 4 fps、最多 2048 帧,用的是 379K 条平均 15.8 分钟的长视频(约 10 万小时),配分层叙事和超过 100 万对问答。然后是基于规则的 RL,用 GSPO,时序定位用 IoU 奖励,选择题用正确性奖励。最后是在线蒸馏:学生采一条轨迹,Qwen3-235B 教师对同一前缀打分,用反向 KL 损失,集中在教师答对、学生答错的样本上。消融说继续预训练是单一最大杠杆:去掉它平均掉 2.1 分(66.8 到 64.7)。

关键结果

  • Video-MME(长视频,8B): 73.8,对 InternVideo2.5-7B 的 65.1 和 Qwen3-VL-8B 的 71.4。闭源前沿仍领先,Gemini 3 Pro 是 88.6,所以这是一个强开源 8B,不是前沿模型。
  • EgoSchema: 76.6,对 Qwen3-VL-8B 的 69.8 和 GPT-5 的 75.6,这是 8B 唯一压过一个具名前沿系统的基准。
  • MLVU / LongVideoBench / VRBench: 77.3 / 66.8 / 69.4,每项都超过 InternVideo2.5 和 Qwen3-VL-8B;VRBench 开源间差距最宽(69.4 对 InternVideo2.5 的 51.9)。
  • 智能体推理(测试时 MCR): Video-MME 从 73.1 到 75.8,+2.7 来自工具回路,与权重分开。
  • M2LA 效率: 128K token 在单张 H200 上解码加速 4.12 倍,768K 上下文,而基座在 512K 爆显存。
  • 短视频,如实呈现: 在 NextQA 上微胜前作(85.5 对 InternVideo2.5 的 84.9),VSIBench 压过 Qwen3-VL-8B(68.1 对 59.1),但 MVBench 输给同一前作(75.0 对 75.7)。增益集中在长视频和时空任务,不是全面碾压。

局限与存疑

论文坦白:更新的模型(Qwen3.5+、GLM、Kimi)已经超过 InternVideo3,所以对比集是个移动靶。M2LA 绑在改造一个现成 GQA 骨干上,对本身就是原生 MLA 或线性注意力的模型不好套。MCR 是隐式状态建模,不是完整的动作条件世界模型,工具出错会顺着回路传下去,缺少联合优化来兜底。评测只在视频上:尽管标题说”agentify foundation models”,却没有 GUI、移动端或具身智能体场景的证据。智能体增益只在 Video-MME 上报告,这 +2.7 在其他长视频基准上是稳住还是缩水,论文没给。

常见问题

InternVideo3 是什么,和 InternVideo2.5 差在哪?

InternVideo3 是上海 AI Lab 与南京大学的 8B 视频语言模型。相比 7B 的 InternVideo2.5,它把 Video-MME 从 65.1 提到 73.8、MLVU 从 72.8 提到 77.3、EgoSchema 从 63.9 提到 76.6。两个结构上的新增是用于长上下文的 M2LA 注意力,和用于推理时工具调用的智能体 MCR 回路,这两样 2.5 都没有。

InternVideo3 的 Video-MME 分数来自模型还是智能体回路?

两者都有,而且分开报。8B 权重单次前向是 73.1 到 73.8。智能体 MCR 回路能重查片段、跑 ASR、定位时间戳、自我验证,在上面再加 +2.7(Video-MME 从 73.1 到 75.8)。把整个 75.8 算到模型头上,等于把工具预算和搜索归给基座网络,而消融并不支持这一点。

InternVideo3 怎么在单张 GPU 上装下 768K token?

靠 M2LA(多模态多头潜在注意力),把 KV 缓存压进低秩潜在空间再逐头重建,配模态感知适配器和更深层的预算分配。单张 H200 上,128K token 解码加速 4.12 倍,跑到 768K,而未改的 Qwen3-8B 注意力在 512K 就爆显存。

InternVideo3 在视频上能赢 Gemini 3 Pro 这类闭源模型吗?

大多不能。Video-MME 上,Gemini 3 Pro 是 88.6,InternVideo3 是 73.8。论文里唯一的例外是 EgoSchema,InternVideo3 的 76.6 微胜 GPT-5 的 75.6。公允的说法是:它是个领先同规模开源模型的强 8B,而不是追平前沿闭源系统。

一句话:InternVideo3 是 8B 视频模型,权重在 Video-MME 拿 73.8,智能体工具回路再加 2.7,M2LA 让单张 H200 跑 768K token。阅读 arXiv 原文