arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视觉大模型 / VLM

视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。

共收录 25867 信号源:cs.CV, cs.AI, cs.LG

1. 视觉问答 3111 篇

2511.22521 2026-05-25 cs.CV cs.AI 88%

DocVAL: Validated Chain-of-Thought Distillation for Grounded Document VQA

DocVAL:用于基于文档的视觉问答的验证链式思维蒸馏

Pinaki Prasad Guha Neogi, Ahmad Mohammadshirazi, Ser-Nam Lim, Rajiv Ramnath

机构 * Department of Computer Science(计算机科学系) Engineering, Ohio State University, Ohio, US(工程系,俄亥俄州立大学,俄亥俄,美国) Department of Computer Science, University of Central Florida, Florida, US(计算机科学系,中央佛罗里达大学,佛罗里达,美国)

专题命中 视觉问答 :VLM(summary_cn,abstract);vision-language model(abstract);visual question answering(abstract);grounding(abstract)

AI总结 提出DocVAL框架,通过验证链式思维蒸馏将大型教师模型的空间推理能力转移到紧凑学生模型,结合规则验证器和两阶段训练,在文档VQA任务上提升定位性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.17664 2025-09-23 cs.CV cs.AI 88%

SD-VLM: Spatial Measuring and Understanding with Depth-Encoded Vision-Language Models

Pingyi Chen, Yujing Lou, Shen Cao, Jinhui Guo, Lubin Fan, Yue Wu, Lin Yang, Lizhuang Ma, Jieping Ye

机构 * Zhejiang University(浙江大学) Westlake University(西湖大学) Alibaba Cloud Computing(阿里云 computing) Shanghai Jiao Tong University(上海交通大学)

专题命中 视觉问答 :VLM(title,abstract);vision-language model(title);vision language model(abstract);分类 cs.CV、cs.AI

Comments Accepted by NeurIPS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.00413 2025-03-04 cs.CV cs.LG 88%

CL-MoE: Enhancing Multimodal Large Language Model with Dual Momentum Mixture-of-Experts for Continual Visual Question Answering

Tianyu Huai, Jie Zhou, Xingjiao Wu, Qin Chen, Qingchun Bai, Ze Zhou, Liang He

专题命中 视觉问答 :visual question answering(title,abstract);multimodal large language model(title,abstract);分类 cs.CV、cs.LG

Comments 10 pages,4 figures,accepted by CVPR2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.01595 2025-02-12 cs.CV cs.AI 88%

RS-MoE: A Vision-Language Model with Mixture of Experts for Remote Sensing Image Captioning and Visual Question Answering

Hui Lin, Danfeng Hong, Shuhang Ge, Chuyao Luo, Kai Jiang, Hao Jin, Congcong Wen

专题命中 视觉问答 :visual question answering(title,abstract);vision-language model(title);VLM(abstract);分类 cs.CV、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2403.02469 2024-12-02 cs.CV cs.LG 88%

Vision-Language Models for Medical Report Generation and Visual Question Answering: A Review

Iryna Hartsock, Ghulam Rasool

专题命中 视觉问答 :vision-language model(title,abstract);visual question answering(title,abstract);分类 cs.CV、cs.LG

Comments 43 pages; paper edited and restructured

详情

展开后加载摘要…

URL PDF HTML 收藏
1606.01847 2016-09-27 cs.CV cs.AI cs.CL 88%

Multimodal Compact Bilinear Pooling for Visual Question Answering and Visual Grounding

Akira Fukui, Dong Huk Park, Daylen Yang, Anna Rohrbach, Trevor Darrell, Marcus Rohrbach

专题命中 视觉问答 :visual question answering(title,abstract);grounding(title,abstract);分类 cs.CV、cs.AI

Comments Accepted to EMNLP 2016

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.15565 2026-07-20 cs.CV cs.AI cs.LG eess.IV 新提交 88%

Ask Twice, Look Twice: Prompt Echoing Resolves the Question-First Paradox in Vision-Language Models

问两次,看两次:提示回声解决视觉语言模型中的问题优先悖论

Rakshanda Hassan Abhinandan, John Galeotti, Deva Ramanan, Gautam Rajendrakumar Gare

机构 * Carnegie Mellon University(卡内基梅隆大学)

专题命中 视觉问答 :vision-language model(title,abstract);VLM(abstract,abstract_cn);visual question answering(abstract);分类 cs.CV、cs.AI、cs.LG

AI总结 研究视觉语言模型中问题优先提示的悖论,发现问题前置虽能引导感知但后续答案生成阶段难关注到问题。提出问题回声方法,即在图像两侧重复问题,解决了悖论,在多基准测试中表现出色且无需训练等。

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.16526 2024-07-24 cs.CV cs.AI cs.CL cs.LG 88%

Imperfect Vision Encoders: Efficient and Robust Tuning for Vision-Language Models

Aristeidis Panos, Rahaf Aljundi, Daniel Olmeda Reino, Richard E Turner

专题命中 视觉问答 :vision-language model(title);vision language model(abstract);VLM(abstract);visual question answering(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.09733 2026-07-29 cs.CL cs.CV 版本更新 88%

VisRAG2.0: Mitigating Visual Hallucinations via Evidence-Guided Multi-Image Reasoning in Visual Retrieval-Augmented Generation

VisRAG2.0:通过视觉检索增强生成中的证据引导多图像推理减轻视觉幻觉

Yubo Sun, Chunyi Peng, Yukun Yan, Shi Yu, Zhenghao Liu, Sen Mei, Chi Chen, Maosong Sun

机构 * School of Software and Microelectronics, Peking University, China(北京大学软件与微电子学院) School of Computer Science and Engineering, Northeastern University, China(东北大学计算机科学与工程学院) Department of Computer Science and Technology, Institute for AI, Tsinghua University, China(清华大学人工智能研究院计算机科学与技术系)

专题命中 视觉问答 :VLM(summary_cn,abstract);vision-language model(abstract);visual question answering(abstract);grounding(abstract)

AI总结 研究针对视觉检索增强生成中VLM存在的视觉幻觉及证据识别问题,提出证据引导的多图像推理框架EVisRAG,引入RS-GRPO改进训练,实验表明该方法能提升性能、减少幻觉,有效提高视觉基础和推理可靠性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.23921 2026-07-28 cs.CV 新提交 88%

DDVT: Dynamic Dual-level Vision Transformer Fusion Network for Answer Grounding in Visual Question Answering

DDVT:用于视觉问答中答案定位的动态双级视觉Transformer融合网络

Yue Zhang, Xiangyu Li, Wanshu Fan, Xin Yang, Dongsheng Zhou

机构 * National and Local Joint Engineering Laboratory of Computer Aided Design, School of Software Engineering, Dalian University(大连大学软件工程学院计算机辅助设计国家地方联合工程实验室) School of Computer Science and Technology, Dalian University of Technology(大连理工大学计算机科学与技术学院)

专题命中 视觉问答 :visual question answering(title,abstract);grounding(title,abstract);分类 cs.CV

AI总结 研究视觉问答中答案定位问题,提出动态双级视觉Transformer融合网络DDVT,含问题引导的动态区域级模块和跨模态多尺度聚合模块,能精确定位相关视觉内容并融合文本特征,实验证明其性能优于现有方法。

Comments Accepted by CGI

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.00843 2025-12-09 cs.CV 88%

VLM-Assisted Continual learning for Visual Question Answering in Self-Driving

基于视觉语言模型的持续学习用于自动驾驶中的视觉问答

Yuxin Lin, Mengshi Qi, Liang Liu, Huadong Ma

机构 * State Key Laboratory of Networking and Switching Technology(网络与交换技术国家重点实验室) Beijing University of Posts and Telecommunications(北京邮电大学)

专题命中 视觉问答 :visual question answering(title,abstract);VLM(title);vision-language model(abstract);分类 cs.CV

AI总结 本文提出结合视觉语言模型与持续学习的方法,以提升自动驾驶中视觉问答系统的性能和可靠性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.16661 2025-08-26 cs.CV 88%

QA-VLM: Providing human-interpretable quality assessment for wire-feed laser additive manufacturing parts with Vision Language Models

Qiaojie Zheng, Jiucai Zhang, Joy Gockel, Michael B. Wakin, Craig Brice, Xiaoli Zhang

机构 * Mechanical Engineering, Colorado School of Mines(机械工程,科罗拉多矿业学院) Electrical Engineering, Colorado School of Mines(电气工程,科罗拉多矿业学院)

专题命中 视觉问答 :VLM(title,abstract);vision language model(title);vision-language model(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.21335 2025-07-30 cs.CV 88%

Analyzing the Sensitivity of Vision Language Models in Visual Question Answering

Monika Shah, Sudarshan Balaji, Somdeb Sarkhel, Sanorita Dey, Deepak Venugopal

机构 * University of Memphis, TN, USA(密苏里大学) Adobe Research, San Jose, CA, USA(Adobe研究院) University of Maryland Baltimore County, USA(马里兰大学巴尔的摩县分校)

专题命中 视觉问答 :vision language model(title,abstract);visual question answering(title,abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.16624 2025-05-23 cs.CV cs.CL 88%

Grounding Chest X-Ray Visual Question Answering with Generated Radiology Reports

Francesco Dalla Serra, Patrick Schrempf, Chaoyang Wang, Zaiqiao Meng, Fani Deligianni, Alison Q. O'Neil

机构 * Canon Medical Research Europe(Canon医疗研究欧洲)

专题命中 视觉问答 :visual question answering(title,abstract);grounding(title,abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.03181 2025-05-07 cs.LG 88%

VLM Q-Learning: Aligning Vision-Language Models for Interactive Decision-Making

Jake Grigsby, Yuke Zhu, Michael Ryoo, Juan Carlos Niebles

机构 * The University of Texas at Austin(德克萨斯大学奥斯汀分校) Salesforce AI Research(Salesforce人工智能研究)

专题命中 视觉问答 :vision-language model(title,abstract);VLM(title);visual reasoning(abstract);分类 cs.LG

Comments SSI-FM Workshop ICLR 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.10636 2025-03-03 cs.AI cs.HC cs.RO 88%

USER-VLM 360: Personalized Vision Language Models with User-aware Tuning for Social Human-Robot Interactions

Hamed Rahimi, Adil Bahaj, Mouad Abrini, Mahdi Khoramshahi, Mounir Ghogho, Mohamed Chetouani

专题命中 视觉问答 :VLM(title,abstract);vision language model(title);vision-language model(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.17558 2024-11-27 cs.CL cs.CV 88%

Natural Language Understanding and Inference with MLLM in Visual Question Answering: A Survey

Jiayi Kuang, Jingyou Xie, Haohao Luo, Ronghao Li, Zhe Xu, Xianfeng Cheng, Yinghui Li, Xika Lin, Ying Shen

专题命中 视觉问答 :visual question answering(title,abstract);MLLM(title);multimodal large language model(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.10857 2024-11-19 cs.CV cs.CL 88%

Large Vision-Language Models for Remote Sensing Visual Question Answering

Surasakdi Siripong, Apirak Chaiyapan, Thanakorn Phonchai

专题命中 视觉问答 :vision-language model(title,abstract);visual question answering(title,abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2402.08360 2024-02-14 cs.CV 88%

Visual Question Answering Instruction: Unlocking Multimodal Large Language Model To Domain-Specific Visual Multitasks

Jusung Lee, Sungguk Cha, Younghyun Lee, Cheoljong Yang

专题命中 视觉问答 :visual question answering(title,abstract);multimodal large language model(title);MLLM(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2310.18046 2023-10-30 cs.CL cs.CV 88%

ViCLEVR: A Visual Reasoning Dataset and Hybrid Multimodal Fusion Model for Visual Question Answering in Vietnamese

Khiem Vinh Tran, Hao Phu Phan, Kiet Van Nguyen, Ngan Luu Thuy Nguyen

专题命中 视觉问答 :visual reasoning(title,abstract);visual question answering(title,abstract);分类 cs.CV

Comments A pre-print version and submitted to journal

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.20477 2026-06-23 cs.CV cs.CL cs.LG 新提交 88%

Scalable Training of Spatially Grounded 2D Vision-Language Models for Radiology

面向放射学的空间定位2D视觉-语言模型的可扩展训练

Yusuf Salcan, Simon Ging, Robin Tibor Schirrmeister, Philipp Arnold, Elmar Kotter, Behzad Bozorgtabar, Thomas Brox

机构 * Computer Vision Group, University of Freiburg, Germany(德国弗莱堡大学计算机视觉组) Department of Radiology, Medical Center -- University of Freiburg, Germany(德国弗莱堡大学医学中心放射科) CRIION-AI Lab, Freiburg, Germany(德国弗莱堡CRIION-AI实验室)

专题命中 视觉问答 :vision-language model(title,abstract);VLM(abstract_cn);visual question answering(abstract);grounding(abstract)

AI总结 提出RefRad2D大规模双语数据集,通过LLM和自动分割生成空间定位数据,训练RadGrounder模型联合完成报告生成、VQA和空间定位,在外部基准上取得竞争性结果。

Comments Accepted for MICCAI 2026. First two authors: equal contribution. Last two authors: equal supervision

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.30231 2026-05-29 cs.CV cs.AI 88%

Beyond 3D VQAs: Injecting 3D Spatial Priors into Vision-Language Models for Enhanced Geometric Reasoning

超越3D VQA:将3D空间先验注入视觉-语言模型以增强几何推理

Chun-Hsiao Yeh, Shengyi Qian, Manchen Wang, Yi Ma, Joseph Tighe, Fanyi Xiao

机构 * FAIR at Meta(Meta的FAIR)

专题命中 视觉问答 :vision-language model(title,abstract);VLM(summary_cn,abstract_cn);分类 cs.CV、cs.AI

AI总结 提出GASP框架,通过将几何先验注入LLM的Transformer层,利用对比损失和深度一致性监督训练,显著提升VLM的3D空间推理能力,在多个基准上取得大幅提升。

Comments CVPR 2026. Project page: https://danielchyeh.github.io/GASP/

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.02408 2026-05-13 cs.CV cs.AI 88%

ReasonEdit: Editing Vision-Language Models using Human Reasoning

ReasonEdit:通过人类推理编辑视觉语言模型

Jiaxing Qiu, Kaihua Hou, Roxana Daneshjou, Ahmed Alaa, Thomas Hartvigsen

机构 * University of Virginia(弗吉尼亚大学) University of California, Berkeley(加州大学伯克利分校) Stanford University(斯坦福大学)

专题命中 视觉问答 :vision-language model(title,abstract);VLM(abstract,abstract_cn);visual question answering(abstract);分类 cs.CV、cs.AI

AI总结 ReasonEdit通过引入人类推理机制,改进视觉语言模型的编辑能力,提升编辑泛化性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.09838 2026-01-14 cs.CV cs.AI 88%

ClimateIQA: A New Dataset and Benchmark to Advance Vision-Language Models in Meteorology Anomalies Analysis

ClimateIQA: 一种新的数据集和基准,以推进气象异常分析中的视觉-语言模型

Jian Chen, Peilin Zhou, Yining Hua, Dading Chong, Meng Cao, Yaowei Li, Wei Chen, Bing Zhu, Junwei Liang, Zixuan Yuan

机构 * Thrust of Artificial Intelligence, The Hong Kong University of Science and Technology (Guangzhou)(人工智能研究所,香港科学与技术大学(广州)) Thrust of Data Science and Analytics, The Hong Kong University of Science and Technology (Guangzhou)(数据科学与分析研究所,香港科学与技术大学(广州)) Harvard University(哈佛大学) Peking University(北京大学) Mohamed bin Zayed University of Artificial Intelligence(穆罕默德·本·扎耶德人工智能大学)

专题命中 视觉问答 :vision-language model(title,abstract);VLM(abstract);LLaVA(abstract);visual question answering(abstract)

AI总结 ClimateIQA通过引入SPOT算法和新型数据集,提升视觉-语言模型在气象异常分析中的准确性和表现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.07302 2025-12-09 cs.CV cs.AI 88%

Towards Accurate UAV Image Perception: Guiding Vision-Language Models with Stronger Task Prompts

迈向准确的无人机图像感知:通过更强的任务提示引导视觉-语言模型

Mingning Guo, Mengwei Wu, Shaoxian Li, Haifeng Li, Chao Tao

机构 * School of Geosciences and InfoPhysics, Central South University(地质科学与信息物理学院,中南大学)

专题命中 视觉问答 :vision-language model(title);VLM(abstract);visual reasoning(abstract);visual question answering(abstract)

AI总结 AerialVP通过增强任务提示提升无人机图像感知性能,引入AerialSense基准评估模型在复杂场景下的表现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.01419 2025-12-02 cs.CV cs.AI 88%

Rice-VL: Evaluating Vision-Language Models for Cultural Understanding Across ASEAN Countries

Rice-VL:评估跨东盟国家的视觉语言模型的文化理解能力

Tushar Pranav, Eshan Pandey, Austria Lyka Diane Bala, Aman Chadha, Indriyati Atmosukarto, Donny Soh Cheng Lock

机构 * Singapore Institute of Technology(新加坡理工学院) Amazon GenAI(亚马逊人工智能实验室)

专题命中 视觉问答 :vision-language model(title,abstract);VLM(abstract);visual question answering(abstract);grounding(abstract)

AI总结 RICE-VL通过评估视觉语言模型在11个东盟国家的文化理解能力,揭示了模型在文化多样性地区存在的偏见和局限性,强调了开发更具包容性的模型的重要性。

Comments 14 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.00275 2025-11-20 cs.CV cs.AI 88%

AdCare-VLM: Towards a Unified and Pre-aligned Latent Representation for Healthcare Video Understanding

Md Asaduzzaman Jabin, Hanqi Jiang, Yiwei Li, Patrick Kaggwa, Eugene Douglass, Juliet N. Sekandi, Tianming Liu

机构 * University of Georgia(佐治亚大学)

专题命中 视觉问答 :VLM(title,abstract);vision language model(abstract);LLaVA(abstract);visual question answering(abstract)

Comments 39th Conference on Neural Information Processing Systems (NeurIPS 2025) Workshop: 7th International Workshop on Large Scale Holistic Video Understanding: Toward Video Foundation Models

Journal ref Neural Information Processing Systems (NeurIPS 2025)

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.09278 2025-10-09 cs.CV cs.AI 88%

Towards a Multimodal Large Language Model with Pixel-Level Insight for Biomedicine

Xiaoshuang Huang, Lingdong Shen, Jia Liu, Fangxin Shang, Hongxiang Li, Haifeng Huang, Yehui Yang

机构 * Baidu Inc.(百度公司)

专题命中 视觉问答 :multimodal large language model(title,abstract);visual question answering(abstract);grounding(abstract);MLLM(abstract)

Comments Accepted by AAAI2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.22404 2025-09-29 cs.CV cs.AI 88%

RAU: Reference-based Anatomical Understanding with Vision Language Models

Yiwei Li, Yikang Liu, Jiaqi Guo, Lin Zhao, Zheyuan Zhang, Xiao Chen, Boris Mailhe, Ankush Mukherjee, Terrence Chen, Shanhui Sun

机构 * United Imaging Intelligence(联合影像智能) School of Computing, University of Georgia(佐治亚大学计算机学院) Department of Electrical and Computer Engineering, Northwestern University(西北大学电气与计算机工程系)

专题命中 视觉问答 :vision language model(title);vision-language model(abstract);VLM(abstract);visual reasoning(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.18620 2025-03-28 cs.AI cs.CL cs.CV 88%

Cross-modal Information Flow in Multimodal Large Language Models

Zhi Zhang, Srishti Yadav, Fengze Han, Ekaterina Shutova

专题命中 视觉问答 :multimodal large language model(title,abstract);LLaVA(abstract);visual question answering(abstract);MLLM(abstract)

Journal ref CVPR2025

详情

展开后加载摘要…

URL PDF HTML 收藏