DragMesh-2:靠接触把铰接物体拉开的灵巧手
DragMesh-2 用 51 自由度的手开门、拉抽屉,物体关节无驱动,运动只能靠接触拖出来。PICA 训练标称阻尼下成功率 0.89,4 倍阻尼下仍有 0.56,且无触觉输入。
快速答案
DragMesh-2 用一只 51 自由度的 SMPL-X 手去操作铰接物体(洗碗机门、储物柜抽屉、微波炉门),策略只控制手。目标关节没有动作通道,门和抽屉只有在手和把手持续接触、被拖动时才会动。核心数字:它的 PICA 训练方案在七个 GAPartNet 物体上,标称阻尼下成功率 0.89,4 倍阻尼下仍保持 0.56,而只用状态的 PPO 基线是 0.58 / 0.27,全程没有 RGB、深度、力觉或触觉输入。这个增益来自接触历史编码器加上辅助接触预测损失,不是基础 RL 单独做到的。
问题:你没法直接命令的铰接运动
多数操作策略都偷了点懒。物体关节有自己的控制器,或者用脚本轨迹把它拉开,手只是跟着走。DragMesh-2 把这根拐杖拿掉了。抽屉关节是被动的,手一松,抽屉就停。所以策略必须学会那件盲学很难的事:在整个拉动过程中,对把手保持足够的接触力、方向还要对,而它只能看到运动学。
这就是这篇论文值得看的原因,哪怕绝对数字不高。它把操作问题和驱动捷径分开,失效模式因此变得诚实。“DragMesh-2”这个名字点出了来历:它把一个以物体为中心的网格拖动生成器,扩展成了手驱动的交互策略。
PICA 怎么在没有力觉传感器时注入物理
观测里没有力觉或触觉通道。PICA(物理知情、接触感知训练)靠三块东西,从运动学里重建出对接触的感知。
接触历史时序编码器把当前 PD 跟踪误差和上一步动作打包成历史 token,再用门控线性注意力编码器处理最近几个交互块。这给了策略一段关于接触近况的短期记忆。
在它之上,一个因果窗口辅助头从这些时序特征里预测四个接触响应信号:最近的物体关节响应、手掌到把手的最大距离、脱离风险代理量,以及最大跟踪应力。用 K 步窗口而不是单步差分来预测,能抹平接触求解器带来的噪声。
奖励再加上显式的物理项:接触维持、动作正则、脱离惩罚、动作边界饱和抑制、接触距离正则。训练还把关节阻尼在 [1.0, 2.0] 倍区间里随机化,让策略不至于过拟合到单一动力学设定。把物理结构压进学到的控制器,这个思路在 Playful Agentic Robot Learning 这类具身工作里也出现过。
关键结果
- 成功率随阻尼变化(确定性执行,7 个物体,各 20 回合): PICA 在 1 倍为 0.89,2 倍为 0.80,4 倍为 0.56。只用状态的 PPO 落在 0.58 / 0.44 / 0.27,Transformer-PPO 变体更差,只有 0.35 / 0.23 / 0.09。接触那套机制把 OOD 成功率几乎翻倍。
- 消融,增益归谁: 单独 GLA 编码器(无 PICA 信号)拿到 0.65 / 0.56 / 0.36;单独 PICA 信号(无 GLA)是 0.75 / 0.71 / 0.43;完整系统 0.89 / 0.80 / 0.56。两半都复现不了整体,说明提升是记忆加接触监督的联合效果。
- 随机执行也站得住: 用采样而非取均值,PICA 仍有 0.82 / 0.72 / 0.43,远高于只用状态的 PPO 的 0.44 / 0.35 / 0.26。
- 标称成功率掩盖坍缩: 训练从 150 轮拉到 500 轮,1 倍成功率从 0.90 升到满分 1.00,而 4 倍成功率从 0.55 掉到 0.10,动作饱和度(接近最大动作的步数占比)爬到 0.99。漂亮的分布内数字,预示的恰恰是鲁棒性的反面。
- 基线很诚实: 脚本式轨迹跟踪基线在分布内反而赢 PICA(1 倍下 1.00),但在负载下平均只追平(4 倍下 0.71);平行夹爪原语在所有阻尼下都卡在 0.14,这说明灵巧手这套表述确实做了夹爪做不到的事。
看数字前先看这一条
最容易的误读是”成功率 0.89,铰接操作搞定了”。没有。那个 0.89 是标称阻尼、七个物体、特权状态观测、没有感知栈的条件下拿到的。降到 4 倍阻尼,也就是作者说的分布外区间,最好的系统也只到 0.56,脱离成为主要失败模式。论文自己的诊断才是重点:它表明分布内分数是个误导性的标题,只从运动学误差推断出的接触,在高阻尼下不足以稳定地轻拉。
对做工程的人,启示是结构性的。如果你在训一个接触很重的策略,别用标称阻尼成功率来选检查点,因为这个指标在涨,真实鲁棒性却在掉。该盯的是动作饱和度和脱离代理量。这里的四个辅助信号加起来很便宜,还能兼做预警仪表,可能比具体架构更可迁移。
局限与存疑
证据面偏窄:七个 GAPartNet 物体,全是仿真,带特权运动学状态,没有视觉、力觉或触觉输入。作者直说接触只能从跟踪误差间接推断,而这在高阻尼下不足以稳定轻拉。组合模块微调超过 50 轮后,OOD 不再有进一步收益,暗示在没有更丰富接触感知时存在鲁棒性天花板。物体间差异也很大:4 倍阻尼下不同物体的成功率相差悬殊,平均值盖住了实例级难度。论文给了一个真机演示,但定量结论只来自仿真。加一个哪怕粗糙的触觉通道能不能捅破天花板,是显而易见的下一个问题,而最近的参照系是 ABot Earth-0.5 这类有感知接地的具身智能体。
常见问题
DragMesh-2 是什么,跟普通抓取策略有什么不同?
DragMesh-2 是一个接触驱动的框架,用于灵巧操作铰接物体。它和普通抓取或铰接策略的区别在于:物体关节没有驱动,抽屉或门只能靠手和把手的持续接触来动。这只 51 自由度的手必须在整个运动过程中维持对的接触力和方向,而且只靠运动学观测,没有力觉或触觉传感器。
DragMesh-2 在分布外阻尼下还能用吗,还是只在简单条件下成立?
部分能用。标称(1 倍)阻尼下 PICA 成功率 0.89,但在论文当作分布外的 4 倍阻尼下,最好的系统掉到 0.56,脱离成为主要失败模式。这仍远高于只用状态的 PPO 在 4 倍下的 0.27,所以接触感知训练在负载下确实有用,但没有解决高阻尼区间。
为什么 DragMesh-2 训练更久反而更差,这对评估意味着什么?
训练从 150 轮拉到 500 轮,1 倍成功率从 0.90 升到 1.00,而 4 倍成功率从 0.55 崩到 0.10,动作饱和度爬到 0.99。策略过拟合到了单一动力学设定,并且把动作顶到极限。教训是:对接触很重的任务,标称阻尼成功率是个误导性的检查点选择指标,盯饱和度或脱离代理量更安全。
一句话:DragMesh-2 证明你能用一只灵巧手、不靠触觉传感器把铰接物体拖开,分布内成功率 0.89,4 倍阻尼下 0.56;但它真正的贡献,是证明了分布内分数会在鲁棒性上撒谎。阅读 arXiv 原文。