arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视觉大模型 / VLM

视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。

共收录 25867 信号源:cs.CV, cs.AI, cs.LG

1. 视觉问答 3111 篇

2410.05160 2025-01-03 cs.CV cs.AI cs.CL 88%

VLM2Vec: Training Vision-Language Models for Massive Multimodal Embedding Tasks

Ziyan Jiang, Rui Meng, Xinyi Yang, Semih Yavuz, Yingbo Zhou, Wenhu Chen

专题命中 视觉问答 :vision-language model(title,abstract);LLaVA(abstract);visual question answering(abstract);grounding(abstract)

Comments Technical Report

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.25339 2026-05-26 cs.CV cs.AI cs.LG eess.IV 88%

VisualOverload: Probing Visual Understanding of VLMs in Really Dense Scenes

VisualOverload: 在真正密集场景中探测VLM的视觉理解

Paul Gavrikov, Wei Lin, M. Jehanzeb Mirza, Soumya Jahagirdar, Muhammad Huzaifa, Sivan Doveh, Serena Yeung-Levy, James Glass, Hilde Kuehne

机构 * Independent Researcher(独立研究者) JKU Linz(林茨JKU) MIT CSAIL Tübingen AI Center(图宾根人工智能中心) Stanford(斯坦福) MIT-IBM Watson AI Lab(MIT-IBM沃森人工智能实验室)

专题命中 视觉问答 :VLM(title_cn,summary_cn);visual question answering(abstract);分类 cs.CV、cs.AI、cs.LG

AI总结 提出VisualOverload基准,通过密集场景中的简单视觉任务测试VLM,发现最佳模型仅达69.5%准确率,揭示计数、OCR和逻辑一致性等关键缺陷。

Comments Accepted at CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.11970 2026-04-15 cs.CV cs.AI cs.CL cs.LG 88%

INDOTABVQA: A Benchmark for Cross-Lingual Table Understanding in Bahasa Indonesia Documents

INDOTABVQA:一种用于巴厘语文档中跨语言表格理解的基准测试

Somraj Gautam, Anathapindika Dravichi, Gaurav Harit

机构 * IIT Jodhpur(印度理工学院贾尔普尔分校) Punjabi University(旁遮普大学)

专题命中 视觉问答 :VLM(summary_cn,abstract);vision-language model(abstract);visual question answering(abstract);分类 cs.CV、cs.AI、cs.LG

AI总结 本文提出INDOTABVQA基准测试,用于评估跨语言表格视觉问答性能,包含1593张文档图像和四语问题-答案对,揭示了VLM在单语和跨语言设置下的性能差异,并展示了微调对提升准确性的作用。

Comments Accepted in ACL 2026 (Findings)

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.12490 2025-07-18 cs.CV cs.AI cs.CL cs.LG 88%

Spatially Grounded Explanations in Vision Language Models for Document Visual Question Answering

Maximiliano Hormazábal Lagos, Héctor Cerezo-Costas, Dimosthenis Karatzas

机构 * Computer Vision Center, Universitat Autònoma de Barcelona(计算机视觉中心,巴塞罗那自治大学) Gradiant

专题命中 视觉问答 :vision language model(title,abstract);visual question answering(title);分类 cs.CV、cs.AI、cs.LG

Comments This work has been accepted for presentation at the 16th Conference and Labs of the Evaluation Forum (CLEF 2025) and will be published in the proceedings by Springer in the Lecture Notes in Computer Science (LNCS) series. Please cite the published version when available

详情

展开后加载摘要…

URL PDF HTML 收藏
2310.16405 2023-10-26 cs.RO 88%

Binary State Recognition by Robots using Visual Question Answering of Pre-Trained Vision-Language Model

Kento Kawaharazuka, Yoshiki Obinata, Naoaki Kanazawa, Kei Okada, Masayuki Inaba

专题命中 视觉问答 :vision-language model(title,abstract);visual question answering(title,abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
1808.00265 2018-08-02 cs.CV cs.AI cs.CL cs.LG 88%

Interpretable Visual Question Answering by Visual Grounding from Attention Supervision Mining

Yundong Zhang, Juan Carlos Niebles, Alvaro Soto

专题命中 视觉问答 :grounding(title,abstract);visual question answering(title);分类 cs.CV、cs.AI、cs.LG

Comments 8 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.12127 2026-08-13 cs.CV 新提交 87%

SCOPE-Router: Cost-Aware Open-Set VLM Routing for Execution-Oriented Tasks

SCOPE-Router:面向执行导向任务的成本感知开放集视觉语言模型路由

Tao Yu, Yifei Qu, Zhiqing Cui, Pengfei Zhou, Zhongtian Luo, Yujia Yang, Shenghua Chai, Haopeng Jin, Zhenghao Zhang, Xinming Wang, Hongzhu Yi, Wangbo Zhao, Zhenglin Wan, Yan Huang, Yeshani, Jinwen Luo, Yang You

机构 * CASIA(中国科学院自动化研究所) UCAS(中国科学院大学) NUS(新加坡国立大学) Tencent(腾讯)

专题命中 视觉问答 :VLM(title,summary_cn);分类 cs.CV

AI总结 本文提出SCOPE-Router与CRM+RCCR,构建执行导向VLM路由基准VLM-ExecRouterBench,解决现有VLM路由局限,在多基准上取得更优性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.02048 2026-08-11 cs.CV 版本更新 87%

Jagle: Building a Large-Scale Japanese Multimodal Post-Training Dataset for Vision-Language Models

Jagle:构建大规模日语多模态预训练数据集以构建视觉-语言模型

Issa Sugiura, Keito Sasagawa, Keisuke Nakao, Koki Maeda, Ziqi Yin, Zhishen Yang, Shuhei Kurita, Yusuke Oda, Ryoko Tokuhisa, Daisuke Kawahara, Naoaki Okazaki

机构 * Kyoto University(京都大学) NII LLMC(国立信息学研究所LLMC) Waseda University(早稻田大学) Institute of Science Tokyo(东京科学大学) NII(国立信息学研究所) Aichi Institute of Technology(爱知工业大学) Institute of Physical and Chemical Research(理化学研究所)

专题命中 视觉问答 :vision-language model(title,abstract);VLM(abstract,abstract_cn);visual question answering(abstract);分类 cs.CV

AI总结 本文提出Jagle,一个包含920万实例的日语多模态预训练数据集,通过多种策略生成VQA对,实验表明其在日语任务中表现优异,且与FineVision结合能提升英文性能。

Comments Accepted to COLM 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.12319 2026-07-15 cs.CV 新提交 87%

DM-KG: A Novel Method for Boosting Spatial Cognition of Vision-Language Models in Street View Imagery

DM-KG:一种提升街景图像中视觉语言模型空间认知的新方法

Xinyue Xu, Zheng Zhang, Kunyang Ma, Ge Zhu, Lianshuai Cao, Lei Wang, Zixuan Li, Yi Cheng

机构 * Institute of Surveying and Mapping, Information Engineering University(信息工程大学测绘学院) Institute of Geographic Sciences and Natural Resources Research, Chinese Academy of Sciences(中国科学院地理科学与资源研究所)

专题命中 视觉问答 :vision-language model(title,abstract);VLM(abstract,abstract_cn);visual question answering(abstract);分类 cs.CV

AI总结 研究针对视觉语言模型在街景图像空间认知方面的不足,提出DM-KG框架,通过提取实体关系、结合全景分割与深度估计计算坐标并编码知识图,有效提升模型空间推理准确性,降低误差,为地理视觉问答提供新框架。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.11132 2026-07-15 cs.CV 版本更新 87%

From Hindsight to Foresight: Self-Encouraged Hindsight Distillation for Knowledge-based Visual Question Answering

从回顾到前瞻:面向知识驱动视觉问答的自我鼓励回顾蒸馏

Yu Zhao, Ying Zhang, Xuhui Sui, Baohang Zhou, Xinying Qian, Li Shen, Dacheng Tao

机构 * College of Computing and Data Science, Nanyang Technological University(南洋理工大学计算与数据科学学院)

专题命中 视觉问答 :visual question answering(title,abstract);MLLM(abstract,abstract_cn);multimodal large language model(abstract);分类 cs.CV

AI总结 本文提出HinD框架,通过知识鼓励偏好优化提升多模态大语言模型的知识推理能力,实验表明其在OK-VQA和A-OKVQA上表现优异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.02300 2026-07-10 cs.CV cs.SE 新提交 87%

Search-based Testing of Vision Language Models for In-Car Scene Understanding

基于搜索的车内场景理解视觉语言模型测试

Lev Sorokin, Chen Yang, Ken E. Friedl, Andrea Stocco

机构 * BMW Group, Technical University of Munich(宝马集团、慕尼黑技术大学) Technical University of Munich(慕尼黑技术大学) Technical University of Munich, fortiss GmbH(慕尼黑技术大学、fortiss GmbH)

专题命中 视觉问答 :VLM(summary_cn,abstract_cn);vision language model(title);vision-language model(abstract);分类 cs.CV

AI总结 提出ISU-Test方法,结合渲染场景生成与搜索测试,通过优化场景参数自动生成多样化车内场景,评估VLM在问答和字幕任务中的性能,相比随机生成故障率提高10倍,故障覆盖率提高3.6倍。

Comments Accepted at the Industry Track of the 41st IEEE/ACM International Conference on Automated Software Engineering (ASE 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.15663 2026-06-16 cs.CV 新提交 87%

OneFocus: Enabling Real-World X-ray Security Screening with a Unified Vision-Language Model

OneFocus: 实现基于统一视觉语言模型的真实世界X光安检

Jiali Wen, Hongxia Gao, Litao Li, Yixin Chen, Kaijie Zhang, Qianyun Liu, Xiaoqin Wen

专题命中 视觉问答 :vision-language model(title,abstract);VLM(abstract,abstract_cn);visual question answering(abstract);分类 cs.CV

AI总结 针对X光违禁品检测中新型违禁品适应难和视觉理解不足的问题,提出MMXray数据集和统一视觉语言模型OneFocus,支持问答、定位、分类和图像理解四项核心任务,达到最先进性能。

Comments 17 pages, 10 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.27916 2026-05-28 cs.CV cs.CL 87%

OphIn-500K: Curating Web-Scale Visual Instructions for Scaling Ophthalmic Multimodal Large Language Models

OphIn-500K:策划网络规模的视觉指令以扩展眼科多模态大语言模型

Xuanzhao Dong, Wenhui Zhu, Xiwen Chen, Hao Wang, Xin Li, Yujian Xiong, Jiajun Cheng, Jingjing Wang, Xiaobing Yu, Haiyu Wu, Shao Tang, Zhipeng Wang, Langechuan Liu, Shan Lin, Oana Dumitrascu, Yalin Wang

机构 * Arizona State University(亚利桑那州立大学) Clemson University(克莱姆森大学) Washington University in St. Louis(圣路易斯华盛顿大学) University of Notre Dame(诺特丹大学) Florida State University(佛罗里达州立大学) Rice University(里德大学) NVIDIA(英伟达) Mayo Clinic(梅奥诊所)

专题命中 视觉问答 :multimodal large language model(title,abstract);MLLM(abstract,abstract_cn);visual question answering(abstract);分类 cs.CV

AI总结 提出OphIn-Engine流水线从网络视频中构建高质量眼科指令数据,生成包含50万+指令实例的OphIn-500K数据集,并基于此开发眼科专用多模态大语言模型OphIn-VL,在多项任务上超越现有通用医学和专用模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.11011 2026-05-28 cs.CV 87%

Are Large Pre-trained Vision Language Models Effective Construction Safety Inspectors?

大型预训练视觉语言模型能否成为有效的施工安全检查员?

Xuezheng Chen, Zhengbo Zou

机构 * Mechanical Engineering(机械工程)

专题命中 视觉问答 :vision language model(title,abstract);VLM(abstract_cn);visual question answering(abstract);grounding(abstract)

AI总结 本文提出ConstructionSite 10k数据集,包含1万张施工图像及三项任务标注,评估大型预训练视觉语言模型在零样本和小样本下的泛化能力,为施工安全检查提供基准。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.23253 2026-05-19 cs.AI 87%

AgroCoT: A Chain-of-Thought Benchmark for Evaluating Reasoning in Vision-Language Models for Agriculture

AgroCoT:用于评估农业中视觉语言模型推理能力的推理链基准

Yibin Wen, Qingmei Li, Zi Ye, Jiarui Zhang, Xiaoya Fan, Zurong Mai, Jing Wu, Shuohong Lou, Yuhang Chen, Henglian Huang, Yang Zhang, Defeng Gu, Lingyuan Zhao, Yutong Lu, Haohuan Fu, Jianxi Huang, Juepeng Zheng

机构 * Sun Yat-sen University(中山大学) Tsinghua University(清华大学) Southwest University(西南大学) HuanTian Wisdom Technology Co., Ltd.(慧天智慧科技有限公司) China Agricultural University(中国农业大学) Southwest Jiaotong University(西南交通大学) National Supercomputing Center in Shenzhen(深圳国家超算中心)

专题命中 视觉问答 :vision-language model(title,abstract);VLM(abstract,abstract_cn);visual question answering(abstract);分类 cs.AI

AI总结 本文提出AgroCoT基准,通过整合推理链(CoT)方法,评估视觉语言模型在农业复杂场景中的推理和问题解决能力,发现现有模型在推理能力上的不足。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.22982 2026-05-04 cs.CV 87%

Revisiting CroPA: A Reproducibility Study and Enhancements for Cross-Prompt Adversarial Transferability in Vision-Language Models

重新审视CroPA:面向视觉-语言模型跨提示对抗转移性的可重复性研究与改进

Atharv Mittal, Agam Pandey, Amritanshu Tiwari, Sukrit Jindal, Swadesh Swain

机构 * Mehta Family School of Data Science and Artificial Intelligence(梅hta家族数据科学与人工智能学院) Indian Institute of Technology, Roorkee(印度理工学院罗奥克学院) Department of Civil Engineering(土木工程系) Department of Electronics and Communication(电子与通信系)

专题命中 视觉问答 :vision-language model(title,abstract);LLaVA(abstract,abstract_cn);visual question answering(abstract);分类 cs.CV

AI总结 本文重新审视CroPA,验证其跨提示转移性,并提出改进方法,包括新的初始化策略、跨图像迁移性研究及针对视觉编码器的损失函数,提升对抗有效性。

Comments Accepted to MLRC 2025

Journal ref Transactions on Machine Learning Research (TMLR), 2025. Available at OpenReview: https://openreview.net/forum?id=5L90cl0xtf

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.14882 2026-04-28 cs.CV 87%

LLMind: Bio-inspired Training-free Adaptive Visual Representations for Vision-Language Models

LLMind: 基于生物启发的无训练自适应视觉表示用于视觉-语言模型

Soumyaratna Debnath, Bui Duc Manh, Zinan Liu, Lin Wang

机构 * Nanyang Technological University(南洋理工大学)

专题命中 视觉问答 :vision-language model(title,abstract);VLM(abstract,abstract_cn);visual question answering(abstract);分类 cs.CV

AI总结 LLMind通过生物启发的自适应采样策略,实现视觉-语言模型在有限像素预算下的高效自适应表示,实验显示在多个基准测试中性能显著提升。

Comments CVPR 2026, Highlight, 10 pages, 7 figures, 3 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.25944 2026-04-21 cs.AI 87%

NuRisk: A Visual Question Answering Dataset for Agent-Level Risk Assessment in Autonomous Driving

NuRisk:面向自动驾驶中 agent 级风险评估的视觉问答数据集

Yuan Gao, Mattia Piccinini, Roberto Brusnicki, Yuchen Zhang, Johannes Betz

机构 * Professorship of Autonomous Vehicle Systems, TUM School of Engineering and Design, Technical University of Munich(自主车辆系统教授职位,TUM工程与设计学院,慕尼黑技术大学) Munich Institute of Robotics and Machine Intelligence (MIRMI)(慕尼黑机器人与机器智能研究所(MIRMI))

专题命中 视觉问答 :visual question answering(title,abstract);VLM(abstract,abstract_cn);vision language model(abstract);分类 cs.AI

AI总结 NuRisk 数据集通过 2.9K 场景和 1.1M agent 级样本,提供基于鸟瞰图的时序图像及量化风险标注,提升自动驾驶中 agent 行为与情境的时空推理能力。

Comments 2026 IEEE International Conference on Robotics and Automation (ICRA)

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.18240 2026-01-27 cs.CV 87%

V-Loop: Visual Logical Loop Verification for Hallucination Detection in Medical Visual Question Answering

V-Loop:用于医学视觉问答中幻觉检测的视觉逻辑循环验证

Mengyuan Jin, Zehui Liao, Yong Xia

机构 * Northwestern Polytechnical University(西北工业大学)

专题命中 视觉问答 :visual question answering(title,abstract);grounding(abstract);multimodal large language model(abstract);MLLM(abstract)

AI总结 V-Loop通过双向推理和视觉逻辑循环验证,提升医学视觉问答中幻觉检测的准确性和效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.09724 2025-07-03 cs.CV 87%

A Survey on Efficient Vision-Language Models

Gaurav Shinde, Anuradha Ravi, Emon Dey, Shadman Sakib, Milind Rampure, Nirmalya Roy

机构 * University of Maryland Baltimore County (UMBC)(马里兰大学巴尔的摩县分校)

专题命中 视觉问答 :vision-language model(title,abstract);vision language model(abstract);VLM(abstract);visual question answering(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.12374 2025-06-25 cs.RO cs.AI 87%

AntiGrounding: Lifting Robotic Actions into VLM Representation Space for Decision Making

Wenbo Li, Shiyi Wang, Yiteng Chen, Huiping Zhuang, Qingyao Wu

机构 * School of Software Engineering, South China University of Technology(软件工程学院,华南理工大学) School of Future Technology, South China University of Technology(未来技术学院,华南理工大学) Shien-Ming Wu School of Intelligent Engineering, South China University of Technology(智能工程学院,华南理工大学)

专题命中 视觉问答 :VLM(title,abstract);vision-language model(abstract);visual question answering(abstract);grounding(abstract)

Comments submitted to NeurIPS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.14674 2025-03-20 cs.CV 87%

Elevating Visual Question Answering through Implicitly Learned Reasoning Pathways in LVLMs

Liu Jing, Amirul Rahman

专题命中 视觉问答 :visual question answering(title,abstract);vision-language model(abstract);LLaVA(abstract);visual reasoning(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.20927 2024-12-31 cs.CV 87%

Enhanced Multimodal RAG-LLM for Accurate Visual Question Answering

Junxiao Xue, Quan Deng, Fei Yu, Yanhao Wang, Jun Wang, Yuehua Li

专题命中 视觉问答 :visual question answering(title,abstract);LLaVA(abstract);multimodal large language model(abstract);MLLM(abstract)

Comments 6 pages, 3 figures, under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.02253 2024-10-17 cs.CV 87%

How to Determine the Preferred Image Distribution of a Black-Box Vision-Language Model?

Saeid Asgari Taghanaki, Joseph Lambourne, Alana Mongkhounsavath

专题命中 视觉问答 :vision-language model(title,abstract);VLM(abstract);visual reasoning(abstract);visual question answering(abstract)

Comments Accepted to NeurIPS 2024, Safe Generative AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.01690 2024-10-03 cs.AI 87%

Why context matters in VQA and Reasoning: Semantic interventions for VLM input modalities

Kenza Amara, Lukas Klein, Carsten Lüth, Paul Jäger, Hendrik Strobelt, Mennatallah El-Assady

专题命中 视觉问答 :VLM(title,abstract);visual language model(abstract);LLaVA(abstract);visual question answering(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2405.07451 2024-05-14 cs.CV 87%

CLIP-Powered TASS: Target-Aware Single-Stream Network for Audio-Visual Question Answering

Yuanyuan Jiang, Jianqin Yin

专题命中 视觉问答 :visual question answering(title,abstract);VLM(abstract);visual reasoning(abstract);grounding(abstract)

Comments Submitted to the Journal on February 6, 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.21155 2026-07-24 cs.CV cs.AI 新提交 87%

CRAG-MM-Diagnostics: Enabling Stage-Wise Analysis of Knowledge-Intensive VQA

CRAG-MM诊断:实现对知识密集型视觉问答的逐阶段分析

Hanseok Oh, Parishad BehnamGhader, Benno Krojer, Hyunji Lee, Paul Liang, Siva Reddy, Verna Dankers

机构 * New York University(纽约大学) McGill University(麦吉尔大学) Mila - Quebec AI Institute(米拉-魁北克人工智能研究所) UNC Chapel Hill(北卡罗来纳大学教堂山分校) MIT(麻省理工学院)

专题命中 视觉问答 :VLM(summary_cn,abstract_cn);vision-language model(abstract);visual question answering(abstract);grounding(abstract)

AI总结 研究知识密集型视觉问答流程,引入CRAG-MM-Diagnostics诊断基准,通过逐阶段数据注释分离子问题,评估VLM并进行细粒度分析,指出知识检索和推理是主要瓶颈,还提出改进流程提升准确率。

Comments Accepted to ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.14581 2026-07-17 cs.AI cs.CV 新提交 87%

Multi-LLM Collaborative MRI Report Generation for Visual Instruction Tuning in Brain Oncology

用于脑肿瘤视觉指令微调的多语言模型协作式MRI报告生成

Sinyoung Ra, Jonghun Kim, Hyunjin Park

专题命中 视觉问答 :VLM(summary_cn,abstract);vision-language model(abstract);visual question answering(abstract);分类 cs.CV、cs.AI

AI总结 针对脑肿瘤缺乏配对3D成像 - 文本数据问题,提出用多语言模型协作创建3D图像 - 文本数据集,构建VLM将MRI扫描转换为令牌并与文本指令对齐,该方法在报告生成等任务中表现优于其他方法,有助于脑肿瘤诊断治疗。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.10956 2026-07-09 cs.CV cs.AI 版本更新 87%

A Study of Commonsense Reasoning over Visual Object Properties

关于视觉对象属性的常识推理研究

Abhishek Kolari, Mohammadhossein Khojasteh, Yifan Jiang, Floris den Hengst, Filip Ilievski

机构 * Department of Computer Science, Vrije Universiteit(自由大学计算机科学系) Information Sciences Institute, University of Southern California(南加州大学信息科学研究所)

专题命中 视觉问答 :VLM(summary_cn,abstract_cn);vision-language model(abstract);visual reasoning(abstract);visual question answering(abstract)

AI总结 研究针对视觉对象属性的常识推理,引入含特定图像类型、推理层次和属性维度的评估框架,在两个VQA基准中实验,发现现有VLM存在显著局限,虽新模型有进步但仍与人类有差距,还提供了相关数据和代码以助未来研究。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.25855 2026-05-15 cs.CV cs.AI 87%

SIEVES: Selective Prediction Generalizes through Visual Evidence Scoring

SIEVES:通过视觉证据评分实现选择性预测

Hector G. Rodriguez, Marcus Rohrbach

机构 * TU Darmstadt(图宾根大学)

专题命中 视觉问答 :grounding(summary_cn,abstract);visual question answering(abstract);multimodal large language model(abstract);分类 cs.CV、cs.AI

AI总结 SIEVES通过视觉证据评分提升视觉问答在分布外任务中的覆盖范围,相比非 grounding 基准线提升三倍,适用于多种推理模型,无需依赖模型权重或 logit。

详情

展开后加载摘要…

URL PDF HTML 收藏