Tactile Modality Fusion for Vision-Language-Action Models
触觉模态融合用于视觉-语言-动作模型
专题命中 VLA模型 :VLA(summary_cn,abstract);vision-language-action(title,abstract);action model(title);分类 cs.RO、cs.CV、cs.LG
AI总结 本文提出TacFiLM,一种轻量级模态融合方法,将视觉-触觉信号整合到视觉-语言-动作(VLA)模型中。通过特征级线性调制(FiLM)对中间视觉特征进行条件化,提升接触丰富操作行为的性能。
Comments Accepted to the European Conference on Computer Vision (ECCV), 2026, 20 pages, 5 figures