arXivDaily arXiv每日学术速递 周一至周五更新

PAPERDAILY REPORTS

英伟达等提出Hydra-0:把机器人动作变成像素流,运动误差降低90.4%

arXiv 2608.18077 cs.RO

机器人换一副机械臂,原有世界模型往往就要重新学习动作含义。英伟达、布朗大学、哥伦比亚大学、哈佛大学等机构提出Hydra-0,把关节角、末端位姿等机器人专属命令转换成画面中的像素运动轨迹,让不同形态的机器人共享一种视觉动作接口。

论文报告,最佳配置相对直接使用动作命令的Cosmos 2.5基线,将机器人运动误差降低90.40%,物体运动误差降低60.16%。它还能把预测方向反过来:输入物体应该如何移动,模型推断相容的机器人运动,再由动作头输出实机可以执行的命令。

先把机械命令投影到相机画面

传统动作条件模型直接接收关节空间或末端执行器命令。关节空间与机器人结构绑定;即便末端执行器移动方向一致,两台机器人也可能走出完全不同的关节轨迹,视频模型必须额外学习每种机体的运动映射。

Hydra-0先在物理模拟器中执行候选命令,结合机器人几何、相机内外参,把可见表面点投影到图像平面。连续帧里的二维轨迹组成“动作流”,它描述哪一块像素将往哪里移动,不向视频模型暴露原始控制空间。

Hydra-0总体流程

论文总览:多种机器人和人手视频被转换成共享动作流,再用于仿真、策略评估和控制。

训练数据缺少机器人描述文件或相机标定时,团队改用视频跟踪与分割,从画面中恢复机器人、手和物体的轨迹。几何投影与纯视频提取最终落到相同的数据格式,使DROID单臂、双臂遥操作、人手操作和软物体交互可以进入同一训练池。

论文汇总了7类来源,共178187段轨迹、约2201.7小时视频;过滤静止片段和无效标注后保留1565634个约5秒窗口。这个规模解释了“通用”来自哪里,也限定了它仍然依赖训练池覆盖的视觉与交互分布。

预测的不只是下一帧,还包括动作是否会成功

动作流被送入视频生成骨干后,模型预测候选命令造成的未来画面。作者分别在Cosmos 2.5、Wan2.2 I2V-A14B和Wan2.2 TI2V-5B上实现这套接口,说明改动不局限于单一视频模型。

软物体交互预测

软物体实验展示模型根据动作流预测物体变形,画面同时保留机器人与操作对象的运动。

开放环策略评估里,团队固定已经执行过的夹爪轨迹,让模型重放5个RoboLab策略可能产生的结果。生成视频的成功率与参考成功率在聚合结果上的皮尔逊相关系数达到0.96。它提供的是低成本筛选信号,并没有替代闭环实机测试:模型看不到执行中途的新观测,也不会现场纠正动作。

折叠任务预测

折叠任务中的定性结果用于检查动作流对双臂运动和布料变化的约束。

因果推理还采用分块自回归生成和少步蒸馏。每个视频块复用此前生成的上下文与KV缓存,蒸馏版本每块只进行4步去噪,为机器人部署压缩推理成本。论文没有把该速度直接写成真实控制频率,产品级实时性仍需按硬件、骨干模型和控制周期分别测试。

从“动作会怎样”反推“应该怎么动”

Hydra-0的逆向模式不输入夹爪轨迹,而是输入目标物体的期望动作流。模型在潜在特征里形成与该目标相容的机器人运动,轻量动作头再解码动作和状态。训练使用真实机器人轨迹,但不要求每段都是专家成功示范,因为失败轨迹也保留了动作与实际运动之间的对应关系。

DROID任务预测

DROID数据上的结果检查单臂场景中动作轨迹与预测后果是否保持对应。

团队把人类示范中的物体轨迹迁移给模型,并在真实机器人上完成控制概念验证。这里展示的是特定设置下从目标流到可执行动作的可行性,尚不能写成无需机器人数据的通用控制器;动作头仍用配对的真实机器人轨迹训练,复杂开放环境中的闭环恢复也未被覆盖。

下一步是把视觉接口接进闭环控制

动作流的直接用途是把异构视频、不同机器人和策略评估放到一条训练链上。模型可以先模拟多个候选动作的视觉后果,策略再依据预测选择下一步;逆向模式则能把人类演示中的物体运动转成目标条件,减少为每项任务采集专家轨迹的压力。

走向部署还需要两项验证:一是把开放环视频预测接入连续反馈,测量误差累积和故障恢复;二是在更换相机、光照、机器人和柔性物体后重新报告成功率。论文已经证明共享像素轨迹能跨骨干、跨机体工作,下一阶段的评价标准将从视频是否像真,转向动作能否稳定完成任务。

参考资料

https://arxiv.org/abs/2608.18077

https://nvidia-isaac.github.io/video_to_data/hydra-0/