Revisiting Multimodal Positional Encoding in Vision-Language Models
重新审视视觉-语言模型中的多模态位置编码
机构 * Qwen Team, Alibaba Group(Qwen团队,阿里巴巴集团) ; Institute of Computing Technology, Chinese Academy of Sciences(中国科学院计算技术研究所)
专题命中 文档图表理解 :vision-language model(title,abstract);分类 cs.CV
AI总结 本文分析了多模态Rotary Positional Embedding的核心组件,提出MHRoPE和MRoPE-Interleave两种改进方法,在多种基准测试中表现优异,提升了多模态理解能力。
Comments 16 pages