QLIP: A Dynamic Quadtree Vision Prior Enhances MLLM Performance Without Retraining
QLIP:一种动态四叉树视觉先验增强MLLM性能无需重新训练
专题命中 视觉问答 :MLLM(title,abstract);vision language model(abstract);LLaVA(abstract);visual question answering(abstract)
AI总结 QLIP通过动态四叉树视觉先验提升MLLM的粗粒度和细粒度视觉理解能力,无需重新训练,实验显示在LLaVA v1.5系列模型上提升视觉问答准确率,且在V-star基准测试中提升细节理解性能达13.6%。
Comments Accepted as ICLR 2026 poster. 22 pages, 19 figures