SpatialVAM:Spatial-Aware Multi-View Video Diffusion as a Data-Efficient Robot Policy
多视角视频扩散策略:一种3D空间-时间感知的视频动作模型
机构 * New Laboratory of Pattern Recognition (NLPR), Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所模式识别国家重点实验室) ; School of Artificial Intelligence, University of Chinese Academy of Sciences(中国科学院大学人工智能学院) ; FiveAges(五时代) ; Tsinghua University(清华大学) ; Xi’an Jiaotong University(西安交通大学) ; Wuhan University(武汉大学) ; Nanjing University(南京大学)
专题命中 机器人学习 :robot policy(title);manipulation(abstract);robotic(abstract);分类 cs.RO、cs.CV
AI总结 本文提出MV-VDP,通过联合建模环境的3D空间-时间状态,解决机器人操控中对3D空间结构和时间演变理解不足的问题,实现高效、鲁棒且可解释的动作执行。
Comments Updated Version; Project Website: https://spatialvam.github.io/