GRAMformer: Any-Order Modality Interactions via Volumetric Multimodal Cross-Attention
GRAMformer: 通过体积多模态交叉注意力实现任意顺序模态交互
机构 * Dept. of Information Engineering, Electronics, and Telecommunications, Sapienza University of Rome(信息工程、电子与电信系,罗马萨皮恩扎大学)
专题命中 其他多模态 :multimodal(title,abstract);分类 cs.CV
AI总结 提出体积多模态交叉注意力(VMA)机制,通过计算查询与多模态键向量的联合几何体积来建模任意顺序的模态交互,并集成到新型多模态Transformer架构GRAMformer中,提升多模态学习的有效性和效率。