arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视觉大模型 / VLM

视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。

共收录 3115 信号源:cs.CV, cs.AI, cs.LG

1. 视觉问答 3115 篇

2503.12490 2025-03-18 cs.CV cs.AI 84%

GeoRSMLLM: A Multimodal Large Language Model for Vision-Language Tasks in Geoscience and Remote Sensing

Zilun Zhang, Haozhan Shen, Tiancheng Zhao, Bin Chen, Zian Guan, Yuhao Wang, Xu Jia, Yuxiang Cai, Yongheng Shang, Jianwei Yin

专题命中 视觉问答 :multimodal large language model(title);vision-language model(abstract);visual question answering(abstract);分类 cs.CV、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.09837 2025-03-17 cs.CV cs.AI cs.CL 84%

On the Limitations of Vision-Language Models in Understanding Image Transforms

Ahmad Mustafa Anis, Hasnain Ali, Saquib Sarfraz

专题命中 视觉问答 :vision-language model(title);vision language model(abstract);visual question answering(abstract);分类 cs.CV、cs.AI

Comments 8 pages, 15 images

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.20622 2025-03-17 cs.CV cs.AI 84%

Towards a Systematic Evaluation of Hallucinations in Large-Vision Language Models

Ashish Seth, Dinesh Manocha, Chirag Agarwal

专题命中 视觉问答 :vision language model(title);vision-language model(abstract);visual question answering(abstract);分类 cs.CV、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.20327 2025-03-11 cs.CV cs.AI 84%

R-LLaVA: Improving Med-VQA Understanding through Visual Region of Interest

Xupeng Chen, Zhixin Lai, Kangrui Ruan, Shichu Chen, Jiaxiang Liu, Zuozhu Liu

专题命中 视觉问答 :LLaVA(title,abstract);visual question answering(abstract);分类 cs.CV、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.02358 2025-03-05 cs.CV cs.AI cs.CL 84%

Are Large Vision Language Models Good Game Players?

Xinyu Wang, Bohan Zhuang, Qi Wu

专题命中 视觉问答 :vision language model(title,abstract);visual question answering(abstract);分类 cs.CV、cs.AI

Comments ICLR2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.14191 2025-02-21 cs.CV cs.AI 84%

Multimodal RewardBench: Holistic Evaluation of Reward Models for Vision Language Models

Michihiro Yasunaga, Luke Zettlemoyer, Marjan Ghazvininejad

专题命中 视觉问答 :vision language model(title);vision-language model(abstract);VLM(abstract);分类 cs.CV、cs.AI

Comments Dataset available at https://github.com/facebookresearch/multimodal_rewardbench

详情

展开后加载摘要…

URL PDF HTML 收藏
2405.14974 2025-02-21 cs.CV cs.AI cs.CL 84%

LOVA3: Learning to Visual Question Answering, Asking and Assessment

Henry Hengyuan Zhao, Pan Zhou, Difei Gao, Zechen Bai, Mike Zheng Shou

专题命中 视觉问答 :visual question answering(title,abstract);multimodal large language model(abstract);分类 cs.CV、cs.AI

Comments NeurIPS 2024. The code is available at https://github.com/showlab/LOVA3

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.12751 2025-01-23 cs.IR cs.CV cs.LG 84%

Patent Figure Classification using Large Vision-language Models

Sushil Awale, Eric Müller-Budack, Ralph Ewerth

专题命中 视觉问答 :vision-language model(title,abstract);visual question answering(abstract);分类 cs.CV、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2408.12763 2024-12-23 cs.LG cs.AI cs.CL 84%

Assessing Modality Bias in Video Question Answering Benchmarks with Multimodal Large Language Models

Jean Park, Kuk Jin Jang, Basam Alasaly, Sriharsha Mopidevi, Andrew Zolensky, Eric Eaton, Insup Lee, Kevin Johnson

专题命中 视觉问答 :multimodal large language model(title,abstract);MLLM(abstract);分类 cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2408.04594 2024-12-20 cs.CV cs.AI 84%

Img-Diff: Contrastive Data Synthesis for Multimodal Large Language Models

Qirui Jiao, Daoyuan Chen, Yilun Huang, Bolin Ding, Yaliang Li, Ying Shen

专题命中 视觉问答 :multimodal large language model(title,abstract);visual question answering(abstract);分类 cs.CV、cs.AI

Comments 22 pages, 10 figures, 16 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2408.10072 2024-11-22 cs.CV cs.AI 84%

FFAA: Multimodal Large Language Model based Explainable Open-World Face Forgery Analysis Assistant

Zhengchao Huang, Bin Xia, Zicheng Lin, Zhun Mou, Wenming Yang, Jiaya Jia

专题命中 视觉问答 :multimodal large language model(title,abstract);MLLM(abstract);分类 cs.CV、cs.AI

Comments 23 pages, 21 figures; project page: https://ffaa-vl.github.io

详情

展开后加载摘要…

URL PDF HTML 收藏
2312.10104 2024-11-01 cs.CV cs.CL cs.LG 84%

Lever LM: Configuring In-Context Sequence to Lever Large Vision Language Models

Xu Yang, Yingzhe Peng, Haoxuan Ma, Shuo Xu, Chi Zhang, Yucheng Han, Hanwang Zhang

专题命中 视觉问答 :vision language model(title);vision-language model(abstract);visual question answering(abstract);分类 cs.CV、cs.LG

Comments 17 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.13121 2024-10-18 cs.CV cs.AI 84%

Trust but Verify: Programmatic VLM Evaluation in the Wild

Viraj Prabhu, Senthil Purushwalkam, An Yan, Caiming Xiong, Ran Xu

专题命中 视觉问答 :VLM(title,abstract);vision-language model(abstract);分类 cs.CV、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2408.11312 2024-10-16 cs.CV cs.AI 84%

Swarm Intelligence in Geo-Localization: A Multi-Agent Large Vision-Language Model Collaborative Framework

Xiao Han, Chen Zhu, Xiangyu Zhao, Hengshu Zhu

专题命中 视觉问答 :vision-language model(title,abstract);visual question answering(abstract);分类 cs.CV、cs.AI

Comments resubmit to www2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.10920 2024-10-15 cs.CV cs.AI cs.CL 84%

Benchmarking Vision Language Models for Cultural Understanding

Shravan Nayak, Kanishk Jain, Rabiul Awal, Siva Reddy, Sjoerd van Steenkiste, Lisa Anne Hendricks, Karolina Stańczak, Aishwarya Agrawal

专题命中 视觉问答 :vision language model(title,abstract);VLM(abstract);分类 cs.CV、cs.AI

Comments Accepted to EMNLP 2024 Main Conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.05928 2024-10-10 cs.CV cs.AI cs.CL 84%

Beyond Captioning: Task-Specific Prompting for Improved VLM Performance in Mathematical Reasoning

Ayush Singh, Mansi Gupta, Shivank Garg, Abhinav Kumar, Vansh Agrawal

专题命中 视觉问答 :VLM(title);vision-language model(abstract);visual question answering(abstract);分类 cs.CV、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.19330 2024-10-01 cs.CV cs.AI 84%

3D-CT-GPT: Generating 3D Radiology Reports through Integration of Large Vision-Language Models

Hao Chen, Wei Zhao, Yingli Li, Tianyang Zhong, Yisong Wang, Youlan Shang, Lei Guo, Junwei Han, Tianming Liu, Jun Liu, Tuo Zhang

专题命中 视觉问答 :vision-language model(title);visual language model(abstract);visual question answering(abstract);分类 cs.CV、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2312.14115 2024-09-27 cs.RO cs.AI cs.CV 84%

LingoQA: Visual Question Answering for Autonomous Driving

Ana-Maria Marcu, Long Chen, Jan Hünermann, Alice Karnsund, Benoit Hanotte, Prajwal Chidananda, Saurabh Nair, Vijay Badrinarayanan, Alex Kendall, Jamie Shotton, Elahe Arani, Oleg Sinavski

专题命中 视觉问答 :visual question answering(title,abstract);vision-language model(abstract);分类 cs.CV、cs.AI

Comments Accepted to ECCV 2024. Benchmark and dataset are available at https://github.com/wayveai/LingoQA/

详情

展开后加载摘要…

URL PDF HTML 收藏
2408.08632 2024-09-09 cs.CL cs.AI cs.CV 84%

A Survey on Benchmarks of Multimodal Large Language Models

Jian Li, Weiheng Lu, Hao Fei, Meng Luo, Ming Dai, Min Xia, Yizhang Jin, Zhenye Gan, Ding Qi, Chaoyou Fu, Ying Tai, Wankou Yang, Yabiao Wang, Chengjie Wang

专题命中 视觉问答 :multimodal large language model(title,abstract);visual question answering(abstract);分类 cs.CV、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2408.11742 2024-08-22 cs.CV cs.AI 84%

CluMo: Cluster-based Modality Fusion Prompt for Continual Learning in Visual Question Answering

Yuliang Cai, Mohammad Rostami

专题命中 视觉问答 :visual question answering(title);vision-language model(abstract);VLM(abstract);分类 cs.CV、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.20174 2024-08-13 cs.CV cs.AI 84%

Advancing Multimodal Large Language Models in Chart Question Answering with Visualization-Referenced Instruction Tuning

Xingchen Zeng, Haichuan Lin, Yilin Ye, Wei Zeng

专题命中 视觉问答 :multimodal large language model(title,abstract);MLLM(abstract);分类 cs.CV、cs.AI

Comments 11 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.20563 2024-07-31 cs.CV cs.AI 84%

Pyramid Coder: Hierarchical Code Generator for Compositional Visual Question Answering

Ruoyue Shen, Nakamasa Inoue, Koichi Shinoda

专题命中 视觉问答 :visual question answering(title,abstract);visual reasoning(abstract);分类 cs.CV、cs.AI

Comments Accepted to the IEEE International Conference on Image Processing (IEEE ICIP) 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.19237 2024-07-01 cs.CL cs.CV cs.IR cs.LG 84%

FlowVQA: Mapping Multimodal Logic in Visual Question Answering with Flowcharts

Shubhankar Singh, Purvi Chaurasia, Yerram Varun, Pranshu Pandya, Vatsal Gupta, Vivek Gupta, Dan Roth

专题命中 视觉问答 :visual question answering(title,abstract);grounding(abstract);分类 cs.CV、cs.LG

Comments Accepted in ACL 2024 (Findings), 21 pages, 7 figures, 9 Tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2405.18831 2024-05-30 cs.CV cs.LG 84%

Evaluating Zero-Shot GPT-4V Performance on 3D Visual Question Answering Benchmarks

Simranjit Singh, Georgios Pavlakos, Dimitrios Stamoulis

专题命中 视觉问答 :visual question answering(title,abstract);grounding(abstract);分类 cs.CV、cs.LG

Comments Accepted at 1st Workshop on Multimodalities for 3D Scenes CVPR 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2405.03852 2024-05-08 cs.CV cs.AI 84%

VSA4VQA: Scaling a Vector Symbolic Architecture to Visual Question Answering on Natural Images

Anna Penzkofer, Lei Shi, Andreas Bulling

专题命中 视觉问答 :visual question answering(title,abstract);vision-language model(abstract);分类 cs.CV、cs.AI

Comments To be published in the Proceedings of the Annual Meeting of the Cognitive Science Society (CogSci'24)

详情

展开后加载摘要…

URL PDF HTML 收藏
2402.07270 2024-05-07 cs.CV cs.CL cs.LG 84%

Open-ended VQA benchmarking of Vision-Language models by exploiting Classification datasets and their semantic hierarchy

Simon Ging, María A. Bravo, Thomas Brox

专题命中 视觉问答 :vision-language model(title,abstract);visual question answering(abstract);分类 cs.CV、cs.LG

Comments Accepted as Spotlight Paper for ICLR 2024. The first two authors contributed equally to this work

详情

展开后加载摘要…

URL PDF HTML 收藏
2212.12043 2024-04-16 cs.CV cs.CL cs.LG 84%

When are Lemons Purple? The Concept Association Bias of Vision-Language Models

Yutaro Yamada, Yingtian Tang, Yoyo Zhang, Ilker Yildirim

专题命中 视觉问答 :vision-language model(title,abstract);visual question answering(abstract);分类 cs.CV、cs.LG

Comments EMNLP 2023 main

详情

展开后加载摘要…

URL PDF HTML 收藏
2305.05726 2024-04-03 cs.CV cs.AI 84%

Vision-Language Models in Remote Sensing: Current Progress and Future Trends

Xiang Li, Congcong Wen, Yuan Hu, Zhenghang Yuan, Xiao Xiang Zhu

专题命中 视觉问答 :vision-language model(title,abstract);visual question answering(abstract);分类 cs.CV、cs.AI

Comments Accepted by IEEE Geoscience and Remote Sensing Magazine

详情

展开后加载摘要…

URL PDF HTML 收藏
2401.15842 2024-03-26 cs.CV cs.AI 84%

LCV2: An Efficient Pretraining-Free Framework for Grounded Visual Question Answering

Yuhan Chen, Lumei Su, Lihua Chen, Zhiwei Lin

专题命中 视觉问答 :visual question answering(title,abstract);grounding(abstract);分类 cs.CV、cs.AI

Comments 21 pages,9 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2307.11471 2024-02-20 cs.CV cs.AI 84%

Robust Visual Question Answering: Datasets, Methods, and Future Challenges

Jie Ma, Pinghui Wang, Dechen Kong, Zewei Wang, Jun Liu, Hongbin Pei, Junzhou Zhao

专题命中 视觉问答 :visual question answering(title,abstract);grounding(abstract);分类 cs.CV、cs.AI

Comments Accepted by IEEE TPAMI

详情

展开后加载摘要…

URL PDF HTML 收藏