四足机器人装上机械臂后,摄像头会随底盘移动,手臂动作也会改变画面。清华大学、上海人工智能实验室、哈尔滨工业大学、云深处科技等机构提出DECOWAM,分别建模相机自运动、底盘和机械臂动作,再联合预测未来视频与控制。
在固定重放协议下,DECOWAM相对FastWAM将动作均方误差降低21.7%,只训练2595万适配参数。每种方法完成79次闭环实机试验后,它在论文比较中取得最高的全身协调和底盘位移鲁棒性,任务完成表现与最强基线相当。
固定机械臂模型难处理移动视角
桌面机械臂的相机往往固定,画面变化大多来自手臂和物体。四足移动操作完全不同:机器人向前走时,桌面整体在视野中移动;机械臂伸出又造成局部变化。把这些运动混在一个潜变量里,模型容易把相机位移误认为手臂动作。
DECOWAM为不同因素设置独立条件接口。底盘速度作为视频预测条件,底盘和机械臂动作进入分离的潜变量;模型还使用对抗目标减少两种表示之间的串扰。
对比案例中,冻结解耦适配后的系统完成了需要底盘和机械臂配合的操作。
这类分解并非要求真实世界完全独立。底盘移动必然改变机械臂可达范围,模型仍需在预测阶段联合使用各部分信息,只是在表示层明确它们的来源。
冻结主干,只训练残差适配器
DECOWAM从经过适配的FastWAM主干开始,冻结大部分参数,再训练残差适配器。这样不必为新的四足本体从头训练完整视频模型,也减少小规模实机数据上的过拟合风险。
一个“动作等价未来”瓶颈从训练阶段可见的特权观测中蒸馏信息,要求表示保留与控制有关的未来变化。推理时不再需要特权信息,模型依靠当前观测和动作条件输出未来画面与动作。
方法将移动视角、底盘动作和机械臂动作通过专用接口送入冻结主干与适配器。
2595万是可训练适配参数数量,不是整个系统的总参数。参数高效说明需要更新的权重较少,但部署时仍要加载冻结主干,显存和推理成本需按完整模型计算。
ARMDOG同步记录视频、状态、动作和语言
团队同时构建ARMDOG真实机器人数据集,统一记录视频、全身状态、动作和语言描述。多模态同步使研究者能检查某次底盘位移、手臂伸展与画面变化是否在时间上对应。
数据集把机载视觉、全身本体状态、控制动作和语言任务对齐。
固定重放实验先排除闭环控制中的随机干扰,比较模型对同一记录的预测。DECOWAM同时改善未来视频和动作预测,动作MSE相对FastWAM下降21.7%。
闭环测试每种方法运行79次。论文称DECOWAM在全身协调和底盘位移鲁棒性上最好,但任务完成率只是与最强基线相当。这一区分很重要:动作更平稳、位置更稳健,不等于每个任务都多成功一次。
从移动操作扩展到更长任务
当前实验验证了四足底盘与机械臂的短程协同。进入仓储、巡检或家庭环境后,机器人还要处理斜坡、狭窄通道、动态障碍和更长语言任务,错误会在多步预测中累积。
滚动预测用于检查移动视角下的未来画面与动作是否保持一致。
后续研究可以加入触觉、力矩和地形信息,让模型区分“手臂到了目标位置”和“物体确实被抓稳”。对高速运动,还需要评估视频预测延迟是否满足闭环频率。
DECOWAM展示了本体感知分解的价值:移动机器人不应照搬固定机械臂的世界模型。真正产品化仍需更大规模、跨机器人和跨场景测试,并公开数据采集范围与失败分布。
数据集若进一步公开,还应附带传感器标定、控制频率和任务失败标签。这样第三方才能区分模型预测误差、执行器延迟与机械接触造成的失败,并在相同协议下比较新的世界动作模型。