VLM2Vec: Training Vision-Language Models for Massive Multimodal Embedding Tasks
专题命中 视觉问答 :vision-language model(title,abstract);LLaVA(abstract);visual question answering(abstract);grounding(abstract)
Comments Technical Report
AI 大模型
视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。
专题命中 视觉问答 :vision-language model(title,abstract);LLaVA(abstract);visual question answering(abstract);grounding(abstract)
Comments Technical Report
VisualOverload: 在真正密集场景中探测VLM的视觉理解
机构 * Independent Researcher(独立研究者) ; JKU Linz(林茨JKU) ; MIT CSAIL ; Tübingen AI Center(图宾根人工智能中心) ; Stanford(斯坦福) ; MIT-IBM Watson AI Lab(MIT-IBM沃森人工智能实验室)
专题命中 视觉问答 :VLM(title_cn,summary_cn);visual question answering(abstract);分类 cs.CV、cs.AI、cs.LG
AI总结 提出VisualOverload基准,通过密集场景中的简单视觉任务测试VLM,发现最佳模型仅达69.5%准确率,揭示计数、OCR和逻辑一致性等关键缺陷。
Comments Accepted at CVPR 2026
INDOTABVQA:一种用于巴厘语文档中跨语言表格理解的基准测试
机构 * IIT Jodhpur(印度理工学院贾尔普尔分校) ; Punjabi University(旁遮普大学)
专题命中 视觉问答 :VLM(summary_cn,abstract);vision-language model(abstract);visual question answering(abstract);分类 cs.CV、cs.AI、cs.LG
AI总结 本文提出INDOTABVQA基准测试,用于评估跨语言表格视觉问答性能,包含1593张文档图像和四语问题-答案对,揭示了VLM在单语和跨语言设置下的性能差异,并展示了微调对提升准确性的作用。
Comments Accepted in ACL 2026 (Findings)
机构 * Computer Vision Center, Universitat Autònoma de Barcelona(计算机视觉中心,巴塞罗那自治大学) ; Gradiant
专题命中 视觉问答 :vision language model(title,abstract);visual question answering(title);分类 cs.CV、cs.AI、cs.LG
Comments This work has been accepted for presentation at the 16th Conference and Labs of the Evaluation Forum (CLEF 2025) and will be published in the proceedings by Springer in the Lecture Notes in Computer Science (LNCS) series. Please cite the published version when available
专题命中 视觉问答 :vision-language model(title,abstract);visual question answering(title,abstract)
专题命中 视觉问答 :grounding(title,abstract);visual question answering(title);分类 cs.CV、cs.AI、cs.LG
Comments 8 pages, 4 figures
SCOPE-Router:面向执行导向任务的成本感知开放集视觉语言模型路由
机构 * CASIA(中国科学院自动化研究所) ; UCAS(中国科学院大学) ; NUS(新加坡国立大学) ; Tencent(腾讯)
专题命中 视觉问答 :VLM(title,summary_cn);分类 cs.CV
AI总结 本文提出SCOPE-Router与CRM+RCCR,构建执行导向VLM路由基准VLM-ExecRouterBench,解决现有VLM路由局限,在多基准上取得更优性能。
Jagle:构建大规模日语多模态预训练数据集以构建视觉-语言模型
机构 * Kyoto University(京都大学) ; NII LLMC(国立信息学研究所LLMC) ; Waseda University(早稻田大学) ; Institute of Science Tokyo(东京科学大学) ; NII(国立信息学研究所) ; Aichi Institute of Technology(爱知工业大学) ; Institute of Physical and Chemical Research(理化学研究所)
专题命中 视觉问答 :vision-language model(title,abstract);VLM(abstract,abstract_cn);visual question answering(abstract);分类 cs.CV
AI总结 本文提出Jagle,一个包含920万实例的日语多模态预训练数据集,通过多种策略生成VQA对,实验表明其在日语任务中表现优异,且与FineVision结合能提升英文性能。
Comments Accepted to COLM 2026
DM-KG:一种提升街景图像中视觉语言模型空间认知的新方法
机构 * Institute of Surveying and Mapping, Information Engineering University(信息工程大学测绘学院) ; Institute of Geographic Sciences and Natural Resources Research, Chinese Academy of Sciences(中国科学院地理科学与资源研究所)
专题命中 视觉问答 :vision-language model(title,abstract);VLM(abstract,abstract_cn);visual question answering(abstract);分类 cs.CV
AI总结 研究针对视觉语言模型在街景图像空间认知方面的不足,提出DM-KG框架,通过提取实体关系、结合全景分割与深度估计计算坐标并编码知识图,有效提升模型空间推理准确性,降低误差,为地理视觉问答提供新框架。
从回顾到前瞻:面向知识驱动视觉问答的自我鼓励回顾蒸馏
机构 * College of Computing and Data Science, Nanyang Technological University(南洋理工大学计算与数据科学学院)
专题命中 视觉问答 :visual question answering(title,abstract);MLLM(abstract,abstract_cn);multimodal large language model(abstract);分类 cs.CV
AI总结 本文提出HinD框架,通过知识鼓励偏好优化提升多模态大语言模型的知识推理能力,实验表明其在OK-VQA和A-OKVQA上表现优异。
基于搜索的车内场景理解视觉语言模型测试
机构 * BMW Group, Technical University of Munich(宝马集团、慕尼黑技术大学) ; Technical University of Munich(慕尼黑技术大学) ; Technical University of Munich, fortiss GmbH(慕尼黑技术大学、fortiss GmbH)
专题命中 视觉问答 :VLM(summary_cn,abstract_cn);vision language model(title);vision-language model(abstract);分类 cs.CV
AI总结 提出ISU-Test方法,结合渲染场景生成与搜索测试,通过优化场景参数自动生成多样化车内场景,评估VLM在问答和字幕任务中的性能,相比随机生成故障率提高10倍,故障覆盖率提高3.6倍。
Comments Accepted at the Industry Track of the 41st IEEE/ACM International Conference on Automated Software Engineering (ASE 2026)
OneFocus: 实现基于统一视觉语言模型的真实世界X光安检
专题命中 视觉问答 :vision-language model(title,abstract);VLM(abstract,abstract_cn);visual question answering(abstract);分类 cs.CV
AI总结 针对X光违禁品检测中新型违禁品适应难和视觉理解不足的问题,提出MMXray数据集和统一视觉语言模型OneFocus,支持问答、定位、分类和图像理解四项核心任务,达到最先进性能。
Comments 17 pages, 10 figures
OphIn-500K:策划网络规模的视觉指令以扩展眼科多模态大语言模型
机构 * Arizona State University(亚利桑那州立大学) ; Clemson University(克莱姆森大学) ; Washington University in St. Louis(圣路易斯华盛顿大学) ; University of Notre Dame(诺特丹大学) ; Florida State University(佛罗里达州立大学) ; Rice University(里德大学) ; NVIDIA(英伟达) ; Mayo Clinic(梅奥诊所)
专题命中 视觉问答 :multimodal large language model(title,abstract);MLLM(abstract,abstract_cn);visual question answering(abstract);分类 cs.CV
AI总结 提出OphIn-Engine流水线从网络视频中构建高质量眼科指令数据,生成包含50万+指令实例的OphIn-500K数据集,并基于此开发眼科专用多模态大语言模型OphIn-VL,在多项任务上超越现有通用医学和专用模型。
大型预训练视觉语言模型能否成为有效的施工安全检查员?
机构 * Mechanical Engineering(机械工程)
专题命中 视觉问答 :vision language model(title,abstract);VLM(abstract_cn);visual question answering(abstract);grounding(abstract)
AI总结 本文提出ConstructionSite 10k数据集,包含1万张施工图像及三项任务标注,评估大型预训练视觉语言模型在零样本和小样本下的泛化能力,为施工安全检查提供基准。
AgroCoT:用于评估农业中视觉语言模型推理能力的推理链基准
机构 * Sun Yat-sen University(中山大学) ; Tsinghua University(清华大学) ; Southwest University(西南大学) ; HuanTian Wisdom Technology Co., Ltd.(慧天智慧科技有限公司) ; China Agricultural University(中国农业大学) ; Southwest Jiaotong University(西南交通大学) ; National Supercomputing Center in Shenzhen(深圳国家超算中心)
专题命中 视觉问答 :vision-language model(title,abstract);VLM(abstract,abstract_cn);visual question answering(abstract);分类 cs.AI
AI总结 本文提出AgroCoT基准,通过整合推理链(CoT)方法,评估视觉语言模型在农业复杂场景中的推理和问题解决能力,发现现有模型在推理能力上的不足。
重新审视CroPA:面向视觉-语言模型跨提示对抗转移性的可重复性研究与改进
机构 * Mehta Family School of Data Science and Artificial Intelligence(梅hta家族数据科学与人工智能学院) ; Indian Institute of Technology, Roorkee(印度理工学院罗奥克学院) ; Department of Civil Engineering(土木工程系) ; Department of Electronics and Communication(电子与通信系)
专题命中 视觉问答 :vision-language model(title,abstract);LLaVA(abstract,abstract_cn);visual question answering(abstract);分类 cs.CV
AI总结 本文重新审视CroPA,验证其跨提示转移性,并提出改进方法,包括新的初始化策略、跨图像迁移性研究及针对视觉编码器的损失函数,提升对抗有效性。
Comments Accepted to MLRC 2025
Journal ref Transactions on Machine Learning Research (TMLR), 2025. Available at OpenReview: https://openreview.net/forum?id=5L90cl0xtf
LLMind: 基于生物启发的无训练自适应视觉表示用于视觉-语言模型
机构 * Nanyang Technological University(南洋理工大学)
专题命中 视觉问答 :vision-language model(title,abstract);VLM(abstract,abstract_cn);visual question answering(abstract);分类 cs.CV
AI总结 LLMind通过生物启发的自适应采样策略,实现视觉-语言模型在有限像素预算下的高效自适应表示,实验显示在多个基准测试中性能显著提升。
Comments CVPR 2026, Highlight, 10 pages, 7 figures, 3 tables
NuRisk:面向自动驾驶中 agent 级风险评估的视觉问答数据集
机构 * Professorship of Autonomous Vehicle Systems, TUM School of Engineering and Design, Technical University of Munich(自主车辆系统教授职位,TUM工程与设计学院,慕尼黑技术大学) ; Munich Institute of Robotics and Machine Intelligence (MIRMI)(慕尼黑机器人与机器智能研究所(MIRMI))
专题命中 视觉问答 :visual question answering(title,abstract);VLM(abstract,abstract_cn);vision language model(abstract);分类 cs.AI
AI总结 NuRisk 数据集通过 2.9K 场景和 1.1M agent 级样本,提供基于鸟瞰图的时序图像及量化风险标注,提升自动驾驶中 agent 行为与情境的时空推理能力。
Comments 2026 IEEE International Conference on Robotics and Automation (ICRA)
V-Loop:用于医学视觉问答中幻觉检测的视觉逻辑循环验证
机构 * Northwestern Polytechnical University(西北工业大学)
专题命中 视觉问答 :visual question answering(title,abstract);grounding(abstract);multimodal large language model(abstract);MLLM(abstract)
AI总结 V-Loop通过双向推理和视觉逻辑循环验证,提升医学视觉问答中幻觉检测的准确性和效率。
机构 * University of Maryland Baltimore County (UMBC)(马里兰大学巴尔的摩县分校)
专题命中 视觉问答 :vision-language model(title,abstract);vision language model(abstract);VLM(abstract);visual question answering(abstract)
机构 * School of Software Engineering, South China University of Technology(软件工程学院,华南理工大学) ; School of Future Technology, South China University of Technology(未来技术学院,华南理工大学) ; Shien-Ming Wu School of Intelligent Engineering, South China University of Technology(智能工程学院,华南理工大学)
专题命中 视觉问答 :VLM(title,abstract);vision-language model(abstract);visual question answering(abstract);grounding(abstract)
Comments submitted to NeurIPS 2025
专题命中 视觉问答 :visual question answering(title,abstract);vision-language model(abstract);LLaVA(abstract);visual reasoning(abstract)
专题命中 视觉问答 :visual question answering(title,abstract);LLaVA(abstract);multimodal large language model(abstract);MLLM(abstract)
Comments 6 pages, 3 figures, under review
专题命中 视觉问答 :vision-language model(title,abstract);VLM(abstract);visual reasoning(abstract);visual question answering(abstract)
Comments Accepted to NeurIPS 2024, Safe Generative AI
专题命中 视觉问答 :VLM(title,abstract);visual language model(abstract);LLaVA(abstract);visual question answering(abstract)
专题命中 视觉问答 :visual question answering(title,abstract);VLM(abstract);visual reasoning(abstract);grounding(abstract)
Comments Submitted to the Journal on February 6, 2024
CRAG-MM诊断:实现对知识密集型视觉问答的逐阶段分析
机构 * New York University(纽约大学) ; McGill University(麦吉尔大学) ; Mila - Quebec AI Institute(米拉-魁北克人工智能研究所) ; UNC Chapel Hill(北卡罗来纳大学教堂山分校) ; MIT(麻省理工学院)
专题命中 视觉问答 :VLM(summary_cn,abstract_cn);vision-language model(abstract);visual question answering(abstract);grounding(abstract)
AI总结 研究知识密集型视觉问答流程,引入CRAG-MM-Diagnostics诊断基准,通过逐阶段数据注释分离子问题,评估VLM并进行细粒度分析,指出知识检索和推理是主要瓶颈,还提出改进流程提升准确率。
Comments Accepted to ECCV 2026
用于脑肿瘤视觉指令微调的多语言模型协作式MRI报告生成
专题命中 视觉问答 :VLM(summary_cn,abstract);vision-language model(abstract);visual question answering(abstract);分类 cs.CV、cs.AI
AI总结 针对脑肿瘤缺乏配对3D成像 - 文本数据问题,提出用多语言模型协作创建3D图像 - 文本数据集,构建VLM将MRI扫描转换为令牌并与文本指令对齐,该方法在报告生成等任务中表现优于其他方法,有助于脑肿瘤诊断治疗。
关于视觉对象属性的常识推理研究
机构 * Department of Computer Science, Vrije Universiteit(自由大学计算机科学系) ; Information Sciences Institute, University of Southern California(南加州大学信息科学研究所)
专题命中 视觉问答 :VLM(summary_cn,abstract_cn);vision-language model(abstract);visual reasoning(abstract);visual question answering(abstract)
AI总结 研究针对视觉对象属性的常识推理,引入含特定图像类型、推理层次和属性维度的评估框架,在两个VQA基准中实验,发现现有VLM存在显著局限,虽新模型有进步但仍与人类有差距,还提供了相关数据和代码以助未来研究。
SIEVES:通过视觉证据评分实现选择性预测
机构 * TU Darmstadt(图宾根大学)
专题命中 视觉问答 :grounding(summary_cn,abstract);visual question answering(abstract);multimodal large language model(abstract);分类 cs.CV、cs.AI
AI总结 SIEVES通过视觉证据评分提升视觉问答在分布外任务中的覆盖范围,相比非 grounding 基准线提升三倍,适用于多种推理模型,无需依赖模型权重或 logit。