DiT4DiT: Jointly Modeling Video Dynamics and Actions for Generalizable Robot Control
DiT4DiT:联合建模视频动态与动作以实现通用机器人控制
机构 * Mondo Robotics(Mondo机器人公司) ; HKUST(GZ)(香港科技大学(广州)) ; HKUST(香港科技大学)
专题命中 机器人学习 :robot learning(abstract);manipulation(abstract);robot policy(abstract);robotic(abstract)
AI总结 本文提出DiT4DiT模型,通过结合视频扩散变换器与动作扩散变换器,实现视频动态与动作的联合建模,提升机器人控制的泛化能力与样本效率。
Comments https://dit4dit.github.io/