VTAM: Video-Tactile-Action Models for Complex Physical Interaction Beyond VLAs
VTAM:用于复杂物理交互的视频-触觉-动作模型超越VLAs
机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) ; Stanford University(斯坦福大学) ; Shanghai Jiao Tong University(上海交通大学)
专题命中 GUI与屏幕智能体 :visual reasoning(abstract);grounding(abstract);分类 cs.CV、cs.AI、cs.LG
AI总结 VTAM通过整合触觉感知提升复杂物理交互的稳定性,其多模态框架在接触密集任务中表现优异,成功率达到90%。