Fusion of Detected Objects in Text for Visual Question Answering
专题命中 视觉问答 :visual question answering(title);分类 cs.CV、cs.LG
AI 大模型
视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。
专题命中 视觉问答 :visual question answering(title);分类 cs.CV、cs.LG
专题命中 视觉问答 :visual question answering(title);分类 cs.CV、cs.AI
Comments 28 pages, 15 figures
专题命中 视觉问答 :visual question answering(title);分类 cs.CV、cs.AI
Comments Improved version, it also has a final table from the VQA challenge, and more baselines on DAQUAR
DentiAsk:全景牙科X光片中多模态推理的视觉问答基准测试
专题命中 视觉问答 :vision-language model(abstract);LLaVA(abstract);visual question answering(abstract)
AI总结 研究旨在解决现有医学视觉问答基准测试无法充分体现全景牙科X光片解读复杂性的问题,引入DentiAsk基准测试,涵盖多种病变和推理层次,对10种模型测试发现其在空间定位等方面存在局限,为推进医学成像多模态推理提供挑战基准。
看一次就够了?用于3D问答的在线几何感知令牌剪枝
机构 * National Tsing Hua University(国立清华大学) ; Industrial Technology Research Institute ITRI(工业技术研究院) ; University of Toronto(多伦多大学) ; Atmanity Inc(Atmanity公司)
专题命中 视觉问答 :MLLM(abstract,abstract_cn);分类 cs.CV、cs.AI、cs.LG
AI总结 针对3D问答中多模态大语言模型推理成本高的问题,提出在线令牌剪枝方法,利用深度和相机姿态投影到体素空间,识别重叠区域并剪枝冗余令牌,减少令牌使用,提升效率和性能。
Comments published at ICLR 2026 Workshop on Efficient Spatial Reasoning
V2T-CoT:从视觉到文本链式推理用于医学推理与诊断
专题命中 视觉问答 :vision language model(abstract);visual question answering(abstract);grounding(abstract)
AI总结 本文提出V2T-CoT方法,通过自动化定位生物医学图像中的偏好区域并将其整合到区域级像素注意力中,提升医学诊断的可解释性与准确性。
Comments 12 pages, 4 figures
视觉运动策略中的记忆检索用于长期机器人控制
机构 * The University of Texas at Austin(德克萨斯大学奥斯汀分校)
专题命中 视觉问答 :VLM(abstract,abstract_cn);vision-language model(abstract)
AI总结 提出HALO策略,通过注意力记忆检索机制和视觉语言模型先验蒸馏,解决长期控制中的虚假相关和记忆误差累积问题,实现从长达8分钟历史中检索任务相关信息。
Comments 16 pages, 5 tables, 8 figures
grounded还是猜测?通过盲图像对比排序进行LVLM置信度估计
机构 * Michigan State University(密歇根州立大学) ; Independent AI Researcher(独立AI研究员) ; JPMorgan AI Research(摩根大通AI研究) ; Henry Ford Health(亨利福特健康)
专题命中 视觉问答 :vision-language model(abstract);visual question answering(abstract);grounding(abstract)
AI总结 本文提出BICR框架,通过对比真实图像与遮蔽图像的隐藏状态,评估LVLM的置信度,实现跨模型的校准与判别性能优化。
AVA-Bench:用于视觉基础模型的原子视觉能力基准
机构 * The Ohio State University(俄亥俄州立大学) ; Adobe Research(Adobe研究院) ; Boston University(波士顿大学)
专题命中 视觉问答 :visual reasoning(abstract);visual question answering(abstract);分类 cs.CV、cs.AI、cs.LG
AI总结 AVA-Bench通过解耦14种原子视觉能力,揭示视觉基础模型的性能差异,提升模型选择的科学性与效率。
Comments Accepted by CVPR 2026. The first two authors contribute equally
VQQA:视频评估与质量提升的代理方法
机构 * Google(谷歌)
专题命中 视觉问答 :vision-language model(abstract);VLM(abstract);分类 cs.CV、cs.AI、cs.LG
AI总结 本文提出VQQA框架,通过动态生成视觉问题并利用视觉语言模型进行语义梯度优化,实现高效的闭环提示优化,提升视频生成质量。
通过超级神经元进行类别视觉问答的捷径
机构 * Seoul National University(首尔国立大学) ; EPFL(瑞士联邦理工学院) ; Google Deepmind(谷歌DeepMind)
专题命中 视觉问答 :vision language model(abstract);VLM(abstract);分类 cs.CV、cs.AI、cs.LG
AI总结 本文提出通过超级神经元提升类别视觉问答的性能,利用标量激活代替注意力向量,实现更高效的分类和更快的推理速度。
Comments 25 pages, 15 tables, 8 figures
结构感知对比学习用于多模态模型的图表理解
机构 * The Japan Research Institute, Limited(日本研究机构)
专题命中 视觉问答 :vision-language model(abstract);visual question answering(abstract);分类 cs.CV、cs.AI、cs.LG
AI总结 本文提出结构感知对比学习方法,通过专门的损失函数提升多模态模型对图表图像的理解能力,在图像-文本匹配和视觉问答任务中取得显著改进。
Comments 10 pages, 8 figures
Journal ref ICCVW (2025) 7463-7472
具有领域不变多模态掩码重建的医学视觉-语言模型鲁棒预训练
专题命中 视觉问答 :vision-language model(abstract);visual question answering(abstract);分类 cs.CV、cs.AI、cs.LG
AI总结 本文提出Robust-MMR框架,通过显式建模鲁棒性提升医学视觉-语言模型在跨领域和扰动下的表现,实现更可靠的医疗应用。
Comments 28 pages, 3 figures
VOILA:基于信息价值的保真度选择框架用于成本感知的多模态问答
专题命中 视觉问答 :vision-language model(abstract);visual question answering(abstract);分类 cs.CV、cs.AI、cs.LG
AI总结 VOILA通过基于信息价值的自适应保真度选择,在多模态问答中实现成本优化与高精度的平衡。
从像素到 prose:推进遥感多模态语言模型
机构 * Simon Fraser University(西蒙弗雷泽大学) ; University of Minnesota - Twin Cities(明尼苏达大学双城分校) ; Kyoto University(京都大学) ; Georgia Institute of Technology(佐治亚理工学院) ; National Taiwan Normal University(台湾师范大学) ; Purdue University(普渡大学) ; Emory University(埃默里大学) ; The University of Texas at Dallas(德克萨斯大学达拉斯分校)
专题命中 视觉问答 :visual question answering(abstract);MLLM(abstract);分类 cs.CV、cs.AI、cs.LG
AI总结 本文探讨了多模态语言模型在遥感中的应用,分析了其技术基础、挑战及未来发展方向,强调了其在环境监测和灾害响应中的重要作用。
Comments 10 pages, 1 figure
FOCUS: 长视频理解中的高效关键帧选择
机构 * National University of Singapore(新加坡国立大学) ; TikTok
专题命中 视觉问答 :vision-language model(abstract);multimodal large language model(abstract);分类 cs.CV、cs.AI、cs.LG
AI总结 FOCUS通过两阶段探索-利用策略,在严格标记预算下高效选择关键帧,提升长视频理解的准确性。
机构 * Krutrim AI ; OLA Electric
专题命中 视觉问答 :vision-language model(abstract);visual question answering(abstract);分类 cs.CV、cs.AI、cs.LG
机构 * Eluvio AI Labs(Eluvio AI实验室)
专题命中 视觉问答 :vision language model(abstract);visual question answering(abstract);分类 cs.CV、cs.AI、cs.LG
Comments 11 pages
机构 * Johns Hopkins University(约翰霍普金斯大学) ; Purdue University(普渡大学) ; University at Albany(阿尔巴尼大学)
专题命中 视觉问答 :vision-language model(abstract);VLM(abstract);visual question answering(abstract)
机构 * Indian Institute of Technology Jodhpur(印度理工学院朱罗普尔)
专题命中 视觉问答 :vision-language model(abstract);visual question answering(abstract);分类 cs.CV、cs.AI、cs.LG
专题命中 视觉问答 :visual question answering(abstract);multimodal large language model(abstract);分类 cs.CV、cs.AI、cs.LG
Comments The first version of this paper mistakenly included a prompt injection phrase, which was inappropriate and unprofessional. Although we corrected the version on arXiv and withdrew from the conference, my co-authors and university strongly request a full withdrawal. Given the situation, I no longer have the authority to manage this paper, and withdrawing it from arXiv is the most responsible action
专题命中 视觉问答 :LLaVA(abstract);visual question answering(abstract);分类 cs.CV、cs.AI、cs.LG
Comments 7-page main paper + appendix, 18 figures
专题命中 视觉问答 :vision-language model(abstract);visual question answering(abstract);分类 cs.CV、cs.AI、cs.LG
专题命中 视觉问答 :visual question answering(abstract);MLLM(abstract);分类 cs.CV、cs.AI、cs.LG
Comments Published as a conference paper at ICLR 2025. The model is available at https://huggingface.co/StevenHH2000/Finedefics
专题命中 视觉问答 :vision-language model(abstract);visual question answering(abstract);分类 cs.CV、cs.AI、cs.LG
Comments Accepted at NeurIPS 2024
专题命中 视觉问答 :vision-language model(abstract);visual question answering(abstract);分类 cs.CV、cs.AI、cs.LG
Comments 32 pages, 8 figures
专题命中 视觉问答 :vision language model(abstract);visual question answering(abstract);分类 cs.CV、cs.AI、cs.LG
Comments NeurIPS 2024
专题命中 视觉问答 :visual question answering(abstract);MLLM(abstract);分类 cs.CV、cs.AI、cs.LG
专题命中 视觉问答 :multimodal large language model(abstract);MLLM(abstract);分类 cs.CV、cs.AI、cs.LG
专题命中 视觉问答 :vision-language model(abstract);VLM(abstract);分类 cs.CV、cs.AI、cs.LG
Comments Robotics: Science and Systems (RSS) 2024