MODIX: A Training-Free Multimodal Information-Driven Positional Index Scaling for Vision-Language Models
MODIX:一种无需训练的多模态信息驱动的位置索引缩放
机构 * Peking University(北京大学)
专题命中 图文多模态 :multimodal(title,abstract);cross-modal(abstract);分类 cs.CV、cs.AI
AI总结 MODIX通过动态调整位置步长,基于模态特定贡献优化多模态模型的位置编码,提升多模态推理能力。
Comments Accepted by CVPR 2026 (Highlight). 10 pages, 2 figures, 5 tables