Training Long-Context Vision-Language Models Effectively with Generalization Beyond 128K Context
通过超越128K上下文的泛化有效训练长上下文视觉-语言模型
机构 * CSE Department, HKUST(香港科技大学计算机科学与工程系)
专题命中 视觉问答 :vision-language model(title,abstract);分类 cs.CV
AI总结 本文研究了长上下文视觉-语言模型的持续预训练,通过平衡数据和检索优化,提出MMProLong模型在长文档VQA等任务中表现优异,且能扩展至更长上下文和多任务场景。
Comments work in progress