HMVLA: Hyperbolic Multimodal Fusion for Vision-Language-Action Models
HMVLA:超几何多模态融合用于视觉-语言-动作模型
机构 * Harbin Institute of Technology(哈尔滨工业大学) ; Chongqing Research Institute of HIT(重庆HIT研究 institute) ; Guangdong Laboratory of Artificial Intelligence and Digital Economy (SZ)(广东人工智能与数字经济实验室(深圳))
专题命中 音视频/视觉语言融合 :multimodal fusion(title);分类 cs.RO
AI总结 HMVLA通过在双曲空间中融合视觉、语言和动作信息,提升多模态语义对齐的效率和准确性。
Comments 5 pages,5 figures,ICASSP
Journal ref ICASSP 2026 - 2026 IEEE International Conference on Acoustics, Speech and Signal Processing (ICASSP)