视觉-语言-动作 · 机器人 · 多模态模型

RT-2、π0、Qwen-VLA 对比:VLA 模型怎么输出动作,真实数字差在哪

RT-2 把动作写成文本 token,π0 换成 50Hz 的流匹配动作块,2026 年的新模型又加上三维推理和世界模型先验。榜单数字显示仿真已近饱和,真机差距和分布外泛化才是分水岭。

RT-2、π0、Qwen-VLA 对比:VLA 模型怎么输出动作,真实数字差在哪

一个接口问题串起整条技术线

所有视觉-语言-动作模型要回答的是同一个问题:语言模型只会吐离散 token,怎么驱动连续的电机?VLA 的发展史就是对这个接口问题的一串回答,每个回答都在语义广度和控制精度之间做取舍。

RT-2 的回答最朴素:把夹爪的平移、旋转、开合离散化成格子,每个格子写成一个文本 token,让网页预训练好的视觉语言模型像吐词一样吐动作。动作和语言共用一套 token 空间,网页上学到的语义就免费带进了控制。代价在硬件边界上显形:离散 token 对接触丰富的运动太粗,自回归解码对需要实时反应的机器人也太慢。

π0 走了另一条路。保留预训练 VLM 当语义主干,再外挂一个用流匹配训练的独立动作专家,输出动作块:一小段未来电机指令,频率约 50Hz,这正是灵巧操作需要的控制频率。代价是结构变复杂:动作流不再是文本,“网页知识直通动作”变成了”网页知识去条件化一个独立控制器”。

2026 年的新一代是在两条路上做 refinement,而不是推倒重来。Qwen-VLA 保留扩散式解码器(DiT 动作头),加上本体感知提示词,让一个权重同时做操作、导航和轨迹预测。MolmoAct2 保留动作 token 化(OpenFAST 分词器),但在感知和动作之间插入显式的三维空间推理。World Pilot 干脆不当策略:它是一对推理时注入冻结 VLA 的引导先验。

关键数字

模型动作怎么输出论文报告的头部结果这个数字真正的比较基础
RT-2夹爪位姿离散化成文本 token约 6000 次真机评测;对未见物体的涌现泛化超过 RT-1,没有单一成功率只和 RT-1 比,同一批机器人数据
π0流匹配动作专家,约 50Hz 动作块真机叠衣服、收拾桌子、组装纸箱;无数 benchmark 表只有定性演示
Qwen-VLADiT 扩散动作解码器加本体提示词LIBERO 97.9%,Simpler-WidowX 73.7%,RoboTwin 易/难 86.1%/87.2%,R2R 69.0% OSR自家协议,单一统一权重
MolmoAct2OpenFAST 分词器,先显式三维推理再动作LIBERO 98.1% 对 π0.5 的 96.9%(微调后的 Think 版);真机 DROID 87.1%,比第二名高 38.7 分;MolmoSpaces +10.6,MolmoBot +3.2和 π0.5 在相同仿真评测上对比
World Pilot不是策略:向冻结 VLA 注入隐变量与动作引导LIBERO-Plus 零样本分布外总分 84.7%,同权重基线 80.5%;单用引导 83.7(隐变量)/ 83.1(动作)同一策略权重,加不加先验

先看最右边一列,再看数字。全表最有分量的行,是评测口径真正共享的那些:MolmoAct2 对 π0.5 在同一批仿真套件上比,World Pilot 对自家包装的策略用同一组权重比。大家最常搜的跨论文对比,Qwen-VLA 的 97.9% 对 MolmoAct2 的 98.1%,出自两篇不同论文、不同变体(一个 instruct、一个微调 Think 版),评测划分很可能也不一样。它只能说明”两家都摸到了 LIBERO 天花板”,不能当成一分的胜负。

最干净的受控结果属于 World Pilot。同一个 ABot-M0 策略,不加先验在 LIBERO-Plus 上 80.5%,加了 84.7%,这 +4.2 可以归因于世界-动作先验,而不是网络变好。它自己的消融更进一步:单加隐变量引导 +3.2,单加动作引导 +2.6,两个一起 +4.2,接近相加,说明感知侧的场景先验和动作侧的运动先验修的是 largely 不同的失败。

最夸张的数字属于 MolmoAct2。真机 DROID 上报告 87.1% 成功率,比第二名高 38.7 分。站内论文自己的解读值得复读一遍:这个差距换到仿真就缩到个位数(MolmoSpaces +10.6,MolmoBot +3.2,LIBERO 上对 π0.5 只高约 1.2 分),这正符合一个预期:显式空间推理恰恰在分布偏移最严重的地方,也就是真机上,买得最值。

两个缺席和表里的条目一样重要。π0 根本没报 benchmark 表,证据是真机杂务的广度;RT-2 早于共享 benchmark 的时代,报的是评测量级(约 6000 次)和对 RT-1 的涌现泛化,不是一个成功率百分比。这两个都无法放到 LIBERO 坐标轴上,谁把它们排进 LIBERO 榜单,谁就在编数据。

LIBERO 家族的数字怎么读

五篇里有三篇报的是某种 LIBERO 变体,每个含义不同。Qwen-VLA 的 97.9% 是标准 LIBERO,自家统一权重协议。MolmoAct2 的 98.1% 是微调后的 Think 版,和同样微调设置下的 π0.5 的 96.9% 对比。World Pilot 的 84.7% 是 LIBERO-Plus,零样本分布外基准,带外观、相机和本体扰动,对照组是同权重的 80.5%。

这不是同一根轴上的三个点。标准 LIBERO 对头部模型已接近饱和,那里的分差主要反映评测噪声和协议选择。LIBERO-Plus 的分整体更低,因为基准故意刁难,而 World Pilot 自己的数字显示了不均衡:光照扰动下 98.6%,换机器人本体只剩 60.6%。一个模型可以 LIBERO-Plus 总分登顶,同时某个类别远未解决。

怎么选

  • **要桌上机械臂的语义泛化,且能接受粗控制:**RT-2 的文本 token 路线最简单,直接架在现成 VLM 上,约 6000 次评测的量级证明了涌现式指令跟随。接触丰富或力控任务别用它。
  • **要高频率的灵巧真机操作:**π0 的流匹配动作块路线(约 50Hz)是能叠衣服、收拾桌子的设计。代价是要养一个独立动作专家,新技能还得采数据微调;论文自己也承认,真正的新技能仍需要演示。
  • **一个权重必须同时覆盖操作、导航和轨迹:**Qwen-VLA 是这里唯一同权重给出导航分数(R2R 69.0% OSR,RxR 59.6% SR)还拿到 LIBERO 97.9% 的。它的 instruct 版在单项上是有竞争力而非碾压,卖点是广度。
  • **真机部署,且动作前显式推理的开销付得起:**MolmoAct2 报了最大的真机差距(DROID 87.1%,高第二名 38.7 分),还放出了数据集,复现价值最高。它的 Molmo2-ER 推理模型在具身推理套件上平均 63.8%,论文报告超过 GPT-5 和 Gemini Robotics ER。
  • **已有 VLA 策略,想低成本加固:**World Pilot 完全不用训练策略。一个只在视频上预训练、从没练过动作的世界模型,仍能把被包装的策略在 LIBERO-Plus 上托到 82.6%,说明大部分增益来自普通视频预测。代价是延迟:每个控制步要多一次世界模型前向。

局限与存疑

这组论文里没有任何一篇在同一个协议下评测过其中两个模型。上面的跨论文数字来自不同的仿真器、任务套件、微调设置和成功率定义,表里每一行都标了口径。一个真正的 VLA 对比基准,同样的机器人、同样的任务、同样的指标,哪怕只覆盖这里两个系统,在这批文献里也不存在。

仿真饱和把头部差距压扁了。标准 LIBERO 分数挤在 90 多分时,榜单差分不再测量能力,有信息量的信号移到了分布外套件(比如 LIBERO-Plus,World Pilot 在换本体轴上仍掉到 60.6%)和真机部署(那里 MolmoAct2 的 DROID 差距最突出,Qwen-VLA 在动态操作基准 DOMINO 上零样本只有 26.6%)。Qwen-VLA 页面的原话很直白:未见任务的动态操作基本没解决,统一化救不了它。

延迟和成本被整个领域系统性低报。World Pilot 明说每步一次世界模型前向限制了高频反应式控制的应用;π0 的流专家跑在约 50Hz,但论文同样没有把墙钟成本放在显眼处;Qwen-VLA 的摘要级声明里没有参数量或推理延迟,一个大多任务模型对几个小专家的实践价格仍是未知数。五篇论文没有一篇回答部署工程师真正的问题:在我的硬件上,每美元每小时的成功率是多少。

常见问题

VLA 模型怎么输出动作:token、扩散还是流匹配?

三种接口为主。RT-2 把动作离散成格子写成文本 token;Qwen-VLA 和 MolmoAct2 保留 token 式或扩散式解码器(DiT 动作头、OpenFAST 分词器);π0 用流匹配以约 50Hz 生成连续动作块,这是为灵巧性选的设计。

Qwen-VLA 的 LIBERO 97.9% 比 MolmoAct2 的 98.1% 强吗?

在可测量的意义上不是。两个数字来自不同论文、不同模型变体(instruct 对微调 Think 版),评测划分很可能也不同。两家都贴在标准 LIBERO 的天花板上,这里的分差主要反映协议选择,而不是能力。

为什么 World Pilot 的 84.7% 比别人家的 LIBERO 分数低?

因为 LIBERO-Plus 是零样本分布外基准,带外观、相机和本体扰动,不是干净条件下的套件。它的 84.7% 对照的是同权重基线的 80.5%,所以 +4.2 是世界-动作先验带来的受控增益,这才是重要的比较。

哪个 VLA 模型的真机结果最好?

按这些论文自己报的数字,MolmoAct2 的 DROID 结果(87.1% 成功率,比第二名高 38.7 分)是最强的真机声明,而它自己的分析指出这个差距在仿真里缩到个位数。π0 定性演示了更难的灵巧任务但没有成功率,两者无法直接对比。

这组对比里哪个模型最容易复现?

MolmoAct2 放出了三个共 330 万样本的数据集,包括 3.45 万条双臂演示和 DROID/SO-100 采集,微调结果最可核验。π0 的跨本体预训练重到论文自己暗示大多数实验室复现不了。

这些方法解决了动态或接触丰富的操作吗?

按它们自己的数字,没有。Qwen-VLA 在动态操作基准 DOMINO 上零样本只有 26.6%,World Pilot 在 LIBERO-Plus 换本体轴上掉到 60.6%。RT-2 的文本 token 从来不是为力反馈设计的,π0 的灵巧演示虽然惊艳,但同样没有可靠性统计。