多模态模型 · Shanghai AI Laboratory
InternVideo3:8B 视频模型加一圈智能体推理
InternVideo3 是 8B 视频模型,单次前向在 Video-MME 拿 73.8,套一圈智能体推理再加 2.7。M2LA 让单张 H200 跑到 768K token。
机构
中国南京的顶尖综合性研究型大学,本文由其 NJU-LINK 团队主导。
多模态模型 · Shanghai AI Laboratory
InternVideo3 是 8B 视频模型,单次前向在 Video-MME 拿 73.8,套一圈智能体推理再加 2.7。M2LA 让单张 H200 跑到 768K token。
World Pilot 给 VLA 外挂两路世界模型先验,LIBERO-Plus 零样本 OOD 拿到 84.7%,比 ABot-M0 高 4.2 分,场景先验来自未训练动作的世界模型也有效
HYDRA-X 用单个 ViT 统一图像和视频 tokenization,tubelet attention 与层级时间压缩把 DAVIS rFVD 做到 11.19,编辑总分 4.34。
CoVEBench:视频编辑能否听懂复杂指令把视频编辑复杂指令遵循变成可检查任务,帮助读者判断系统在哪里失效、结果应如何解读。
TELBench 让模型在十余步的研究轨迹里找出坏掉的那一段。DRIFT 用主张对证据的审计法,把 span 级宏 F1 推到 54.91%,比直接喂原始轨迹最高高出 30 个百分点。