TAP-VLA: Tactile Annotation Prompting for Vision Language Action Models
TAP-VLA:面向视觉语言动作模型的触觉标注提示
机构 * Robotics Department, University of Michigan(密歇根大学机器人系) ; Computer Science and Engineering Department, University of Michigan(密歇根大学计算机科学与工程系)
专题命中 VLA模型 :VLA(title,title_cn);action model(title,abstract);vision language action(title);vision-language-action(abstract)
AI总结 提出TAP-VLA框架,通过将触觉剪切场叠加到RGB图像上作为视觉增强,无需修改架构或触觉预训练,即可将触觉反馈融入VLA模型,在接触丰富任务中成功率78%,显著优于基线。
Comments 8 pages + references