VT-WAM: Visual-Tactile World Action Model for Contact-Rich Manipulation
VT-WAM: 面向密集接触操作的视觉-触觉世界动作模型
机构 * SKL-MAIS, Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所复杂系统管理与控制国家重点实验室) ; School of Artificial Intelligence, University of Chinese Academy of Sciences(中国科学院大学人工智能学院) ; TARS Robotics ; National University of Singapore(新加坡国立大学) ; Fudan University(复旦大学)
AI总结 提出VT-WAM,在统一流匹配框架中联合学习视觉预测、触觉变形预测和动作预测,通过非对称混合Transformer注意力和接触门控注意力引导,在六项真实密集接触操作任务中平均成功率71.67%。