World Pilot:用世界-动作先验给 VLA 策略掌舵
World Pilot 给 VLA 外挂两路世界模型先验,LIBERO-Plus 零样本 OOD 拿到 84.7%,比 ABot-M0 高 4.2 分,场景先验来自未训练动作的世界模型也有效
快速答案
World Pilot 在 LIBERO-Plus 零样本分布外(OOD)基准上拿到 84.7% 总成功率,比它所包裹的 ABot-M0 策略(80.5%)高 4.2 分。这 4.2 分不是来自更大或重训过的策略网络,而是把同一个策略喂上了两路来自独立世界-动作模型(WAM)的先验:潜在引导(Latent Steering)用一个预测出来的场景演化潜在向量去调制感知层;动作引导(Action Steering)把一段预判轨迹当成运动先验交给动作头。单独跑,潜在引导 83.7%、动作引导 83.1%,合在一起 84.7%,两路几乎是各自独立叠加。最反直觉的一点:当场景先验来自一个只在视频上预训练、从没在机器人动作上后训练过的世界模型时,它依然有效,LIBERO-Plus 上仍有 82.6%,比底座高 2.1 分。
静态预训练的 VLA 为什么抓不住接触动力学
视觉-语言-动作模型的语义 grounding 来自图文预训练,而图文是静态的。它知道毛巾长什么样,却不知道你拽住一角时毛巾会怎么形变。这道缺口恰好出现在操作最难的地方:接触密集、多步、还要应对新视角、新几何或可形变状态。World Pilot 的前提是,世界模型本身就带着这份缺失的动力学信号,因为要预测后续几帧,它就被迫去建模场景会怎么动。于是这篇工作不去重训策略学动力学,而是在推理时把世界模型的预测注入策略。这跟 Kairos 为物理 AI 搭原生世界模型栈的思路同源,但 World Pilot 把策略冻住,只把世界模型当成一个外挂顾问。
两路引导通道
潜在引导拿 WAM 预测出的未来,一个 5 步的场景演化潜在向量,在策略做任何决策之前先调制它的感知层。动作引导拿 WAM 预判出的轨迹,把它喂给流匹配动作头作为运动起点,而不是让动作头从噪声生成。这里的底座策略是 ABot-M0,VLM 主干用 Qwen3-VL,动作头是基于 DiT 的流匹配头;WAM 用的是 Cosmos Policy,跑 5 步去噪。
每路先验的形态比想象中更要紧。把未来当成潜在向量喂(84.7%),好过先解码成一张真实未来图再去调制(83.5%),说明策略用压缩后的预测比用渲染图更顺。动作侧也一样:把预判轨迹压成单个编码 token(84.7%)好过逐步 token(83.6%)、流初始化(84.1%)和原始轨迹(83.0%)。给工程的启示很直接:先验作为紧凑的条件信号最有用,而不是当成图像或一步步的计划丢给策略去解析。
84.7% 该怎么读
84.7% 是 LIBERO-Plus 这一个零样本 OOD 基准上的总成功率,不是干净条件下的分数,也不是放之四海皆准的数字。诚实的对比是同一套策略加先验对同一套策略不加先验,在这条轴上 +4.2 才是真正的看点。分轴看,提升并不均匀:World Pilot 在外观偏移上领先(光照 98.6%、背景 96.4%、噪声 93.6%),相机视角也强(82.8%,比次优基线高 13.2),但机器人本体偏移只有 60.6%,是最弱的一轴。所以”总成功率 SOTA”成立,却也藏住了有一类偏移仍然很难。把这个标题当成世界模型先验能迁移动力学知识的证据,别当成策略已经能扛所有偏移。
真正吃重的结果是 WAM 消融。一个只训练去预测场景、完全没做动作后训练的世界模型(Cosmos-Predict),仍把策略抬到 LIBERO-Plus 82.6%、RoboCasa 62.7%(+8.7)、RoboTwin2.0 85.3%(+4.1)。再加上动作后训练(Cosmos Policy),LIBERO-Plus 也就再多约 1.1 分。这说明可迁移的信号大头在朴素的视频预测里,而视频预测又便宜又量大,动作专属的微调只是个小补丁。如果这个结论站得住,你就能拿一个现成的视频世界模型去给操作策略掌舵。
关键结果
- LIBERO-Plus 总成功率:84.7% 对 ABot-M0 底座的 80.5%(+4.2),是该零样本 OOD 基准上的 SOTA 总成功率。
- 通道消融:潜在引导单跑 83.7%(+3.2),动作引导单跑 83.1%(+2.6),合跑 84.7%(+4.2),两路近乎独立叠加,潜在引导是略强的单通道。
- 不需要动作后训练:只做场景预测的世界模型(Cosmos-Predict)仍到 LIBERO-Plus 82.6%(+2.1)、RoboCasa 62.7%(+8.7)、RoboTwin2.0 85.3%(+4.1);再加动作后训练只多约 1.1 分。
- 真机 4 个任务:每个分布内与偏移设定都拿最高成功率,比如水果摆盘 90% 分布内 / 75% 新水果 / 70% 布局偏移,叠毛巾 85% / 75% / 70%;分布内到 OOD 的掉幅控制在约 20 分内,而基线掉 25 到 50 分。
- 先验形态:未来用潜在向量好过解码成未来图(84.7 对 83.5);动作用单 token 好过原始轨迹(84.7 对 83.0),紧凑条件赢过照搬信号。
- 分轴:外观最强(光照 98.6%、背景 96.4%)、相机视角 +13.2,机器人本体偏移最弱(60.6%)。
局限与存疑
World Pilot 继承了 WAM 的覆盖面。测试场景一旦落在世界模型视频预训练的分布之外,两路先验都会退化、增益缩水,所以这套方法的泛化上限就是背后那个世界模型。各轴提升不均,机器人本体偏移这一轴(60.6%)说明先验并不能解决一切。真机上 OOD 成功率仍掉 10 到 20 分,比基线好但远没解决。最大的实际成本是运行时:每个控制步要跑一次 WAM 前向,带来的延迟据论文说会限制它在高频反应式控制上的用武之地,而文中没有给出墙钟或吞吐数字来量化这一点。动作后训练只换来约 1.1 分,这点增益是否值得多搭一条训练管线,论文没下结论;它也没测 WAM 的预测误差会怎样传导成错误动作。
常见问题
World Pilot 需要在机器人动作上后训练过的世界模型吗?
不需要,这正是核心发现。一个只在视频上学预测场景演化、完全没做动作后训练的世界模型(Cosmos-Predict),仍把策略抬到 LIBERO-Plus 82.6%(比 ABot-M0 底座高 2.1)、RoboCasa 62.7%(+8.7)、RoboTwin2.0 85.3%(+4.1)。再加动作后训练(Cosmos Policy)也就再多约 1.1 分,说明可迁移信号大头在朴素的视频预测里。
World Pilot 里潜在引导和动作引导哪个更有用?
潜在引导作为单通道略强:83.7%(比底座高 3.2),动作引导是 83.1%(+2.6)。两路合起来 84.7%(+4.2),接近各自增益之和,说明感知侧的场景先验和动作侧的运动先验修的是不同的失败,而非互相重叠。
World Pilot 在 LIBERO-Plus 上比 ABot-M0 底座好多少?
World Pilot 拿到 84.7% 总成功率,而被它包裹的 ABot-M0 策略是 80.5%,在零样本 OOD 基准上高 4.2 分。两次跑的是同一套策略权重,所以增益归功于世界-动作先验,而非更大或重训过的策略网络。
World Pilot 在四个真机任务上表现如何?
在堆方块、叠毛巾、水果摆盘、容器对盖四个任务上,World Pilot 在每个分布内和偏移设定上都拿最高成功率。比如水果摆盘分布内 90%、新水果 75%、布局偏移 70%。分布内到 OOD 的掉幅控制在约 20 分内,而对比基线要掉 25 到 50 分。
一句话:World Pilot 证明操作策略能在推理时从视频世界模型借来接触动力学,把 LIBERO-Plus 80.5% 的底座推到 84.7%,既不重训策略,也不需要训练过动作的世界模型。读arXiv 原文。