ViTaPEs: Visuotactile Position Encodings for Cross-Modal Alignment in Multimodal Transformers
ViTaPEs: 视觉触觉位置编码用于多模态转换器中的跨模态对齐
机构 * Chair of Cyber-Physical Systems(感知系统教授席位) ; Institute of Machine Learning and Neural Computation(机器学习与神经计算研究所) ; Technical University of Leoben(莱比锡技术大学) ; Graz University of Technology(格拉茨技术大学)
专题命中 多模态训练与对齐 :cross-modal(title,abstract);multimodal(title);分类 cs.CV
AI总结 ViTaPEs通过两阶段位置注入学习任务无关的视觉触觉表示,提升多模态对齐性能,实验证明其在多种任务和领域中的优越表现。