VinQA: Visual Elements Interleaved Long-form Answer Generation for Real-World Multimodal Document QA
VinQA:面向真实世界多模态文档问答的交错视觉元素长文本答案生成
机构 * LG AI Research(LG AI研究院)
专题命中 多模态生成 :multimodal(title,abstract);MLLM(abstract,abstract_cn);分类 cs.CV、cs.AI
AI总结 提出VinQA数据集和两种编码方法(页面编码与模态编码),用于生成交错引用视觉元素的长文本答案;通过M-GroSE评估框架和微调Qwen2.5-VL模型,显著缩小与专有模型的性能差距。
Comments Accepted to CVPR 2026. Main paper: 5 figures, 4 tables; includes supplementary material