arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视觉大模型 / VLM

视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。

共收录 3122 信号源:cs.CV, cs.AI, cs.LG

1. 视觉问答 3122 篇

2404.19024 2024-05-01 cs.CV 79%

Multi-Page Document Visual Question Answering using Self-Attention Scoring Mechanism

Lei Kang, Rubèn Tito, Ernest Valveny, Dimosthenis Karatzas

专题命中 视觉问答 :visual question answering(title,abstract);分类 cs.CV

Comments Accepted to ICDAR2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2404.18397 2024-04-30 cs.CV 79%

ViOCRVQA: Novel Benchmark Dataset and Vision Reader for Visual Question Answering by Understanding Vietnamese Text in Images

Huy Quang Pham, Thang Kien-Bao Nguyen, Quan Van Nguyen, Dan Quang Tran, Nghia Hieu Nguyen, Kiet Van Nguyen, Ngan Luu-Thuy Nguyen

专题命中 视觉问答 :visual question answering(title,abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2404.16192 2024-04-26 cs.CL cs.CV 79%

Fusion of Domain-Adapted Vision and Language Models for Medical Visual Question Answering

Cuong Nhat Ha, Shima Asaadi, Sanjeev Kumar Karn, Oladimeji Farri, Tobias Heimann, Thomas Runkler

专题命中 视觉问答 :visual question answering(title);vision-language model(abstract);分类 cs.CV

Comments Clinical NLP @ NAACL 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2404.13039 2024-04-22 cs.CV cs.CL 79%

LaPA: Latent Prompt Assist Model For Medical Visual Question Answering

Tiancheng Gu, Kaicheng Yang, Dongnan Liu, Weidong Cai

专题命中 视觉问答 :visual question answering(title,abstract);分类 cs.CV

Comments 10 pages, 4 figures, Accepted by CVPRW2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2311.15596 2024-03-29 cs.CV cs.CL 79%

EgoThink: Evaluating First-Person Perspective Thinking Capability of Vision-Language Models

Sijie Cheng, Zhicheng Guo, Jingwen Wu, Kechen Fang, Peng Li, Huaping Liu, Yang Liu

专题命中 视觉问答 :vision-language model(title,abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2403.17545 2024-03-27 cs.CL cs.CV 79%

A Gaze-grounded Visual Question Answering Dataset for Clarifying Ambiguous Japanese Questions

Shun Inadumi, Seiya Kawano, Akishige Yuguchi, Yasutomo Kawanishi, Koichiro Yoshino

专题命中 视觉问答 :visual question answering(title,abstract);分类 cs.CV

Comments LREC-COLING 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2403.04735 2024-03-08 cs.CV 79%

SnapNTell: Enhancing Entity-Centric Visual Question Answering with Retrieval Augmented Multimodal LLM

Jielin Qiu, Andrea Madotto, Zhaojiang Lin, Paul A. Crook, Yifan Ethan Xu, Xin Luna Dong, Christos Faloutsos, Lei Li, Babak Damavandi, Seungwhan Moon

专题命中 视觉问答 :visual question answering(title,abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2402.13088 2024-02-21 cs.CV 79%

Slot-VLM: SlowFast Slots for Video-Language Modeling

Jiaqi Xu, Cuiling Lan, Wenxuan Xie, Xuejin Chen, Yan Lu

专题命中 视觉问答 :VLM(title,abstract);分类 cs.CV

Comments 16 pages, 10 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2305.14836 2024-02-21 cs.CV 79%

NuScenes-QA: A Multi-modal Visual Question Answering Benchmark for Autonomous Driving Scenario

Tianwen Qian, Jingjing Chen, Linhai Zhuo, Yang Jiao, Yu-Gang Jiang

专题命中 视觉问答 :visual question answering(title,abstract);分类 cs.CV

Comments Accepted to AAAI 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2402.11083 2024-02-20 cs.CV 79%

VQAttack: Transferable Adversarial Attacks on Visual Question Answering via Pre-trained Models

Ziyi Yin, Muchao Ye, Tianrong Zhang, Jiaqi Wang, Han Liu, Jinghui Chen, Ting Wang, Fenglong Ma

专题命中 视觉问答 :visual question answering(title,abstract);分类 cs.CV

Comments AAAI 2024, 11 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2402.09677 2024-02-16 cs.CV 79%

Prompt-based Personalized Federated Learning for Medical Visual Question Answering

He Zhu, Ren Togo, Takahiro Ogawa, Miki Haseyama

专题命中 视觉问答 :visual question answering(title,abstract);分类 cs.CV

Comments Accept by ICASSP2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2401.15646 2024-01-30 cs.CV 79%

Improving Data Augmentation for Robust Visual Question Answering with Effective Curriculum Learning

Yuhang Zheng, Zhen Wang, Long Chen

专题命中 视觉问答 :visual question answering(title,abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2210.00044 2024-01-23 cs.LG 79%

Task Formulation Matters When Learning Continually: A Case Study in Visual Question Answering

Mavina Nikandrou, Lu Yu, Alessandro Suglia, Ioannis Konstas, Verena Rieser

专题命中 视觉问答 :visual question answering(title,abstract);分类 cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2312.12816 2023-12-21 cs.CV 79%

Object-aware Adaptive-Positivity Learning for Audio-Visual Question Answering

Zhangbin Li, Dan Guo, Jinxing Zhou, Jing Zhang, Meng Wang

专题命中 视觉问答 :visual question answering(title,abstract);分类 cs.CV

Comments Accepted by AAAI-2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2312.12723 2023-12-21 cs.CV 79%

Multi-Clue Reasoning with Memory Augmentation for Knowledge-based Visual Question Answering

Chengxiang Yin, Zhengping Che, Kun Wu, Zhiyuan Xu, Jian Tang

专题命中 视觉问答 :visual question answering(title,abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2312.07867 2023-12-14 cs.AI cs.CL 79%

BESTMVQA: A Benchmark Evaluation System for Medical Visual Question Answering

Xiaojie Hong, Zixin Song, Liangzhi Li, Xiaoli Wang, Feiyan Liu

专题命中 视觉问答 :visual question answering(title,abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2307.02783 2023-11-21 cs.CV cs.HC 79%

UIT-Saviors at MEDVQA-GI 2023: Improving Multimodal Learning with Image Enhancement for Gastrointestinal Visual Question Answering

Triet M. Thai, Anh T. Vo, Hao K. Tieu, Linh N. P. Bui, Thien T. B. Nguyen

专题命中 视觉问答 :visual question answering(title,abstract);分类 cs.CV

Comments ImageCLEF2023 published version: https://ceur-ws.org/Vol-3497/paper-129.pdf

详情

展开后加载摘要…

URL PDF HTML 收藏
2309.17133 2023-10-31 cs.CL cs.CV 79%

Fine-grained Late-interaction Multi-modal Retrieval for Retrieval Augmented Visual Question Answering

Weizhe Lin, Jinghong Chen, Jingbiao Mei, Alexandru Coca, Bill Byrne

专题命中 视觉问答 :visual question answering(title,abstract);分类 cs.CV

Comments To appear at NeurIPS 2023. This is the camera-ready version. We fixed some numbers and added more experiments to address reviewers' comments

详情

展开后加载摘要…

URL PDF HTML 收藏
2310.17914 2023-10-30 cs.CV cs.CL 79%

3D-Aware Visual Question Answering about Parts, Poses and Occlusions

Xingrui Wang, Wufei Ma, Zhuowan Li, Adam Kortylewski, Alan Yuille

专题命中 视觉问答 :visual question answering(title,abstract);分类 cs.CV

Comments Accepted by NeurIPS2023

详情

展开后加载摘要…

URL PDF HTML 收藏
2310.13570 2023-10-25 cs.CV 79%

A Simple Baseline for Knowledge-Based Visual Question Answering

Alexandros Xenos, Themos Stafylakis, Ioannis Patras, Georgios Tzimiropoulos

专题命中 视觉问答 :visual question answering(title,abstract);分类 cs.CV

Comments Accepted at EMNLP 2023 (camera-ready version)

详情

展开后加载摘要…

URL PDF HTML 收藏
2209.05401 2023-10-25 cs.CL cs.CV 79%

MaXM: Towards Multilingual Visual Question Answering

Soravit Changpinyo, Linting Xue, Michal Yarom, Ashish V. Thapliyal, Idan Szpektor, Julien Amelot, Xi Chen, Radu Soricut

专题命中 视觉问答 :visual question answering(title,abstract);分类 cs.CV

Comments EMNLP 2023 (Findings). https://github.com/google-research-datasets/maxm

详情

展开后加载摘要…

URL PDF HTML 收藏
2310.08148 2023-10-13 cs.LG 79%

Open-Set Knowledge-Based Visual Question Answering with Inference Paths

Jingru Gan, Xinzhe Han, Shuhui Wang, Qingming Huang

专题命中 视觉问答 :visual question answering(title,abstract);分类 cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2310.05410 2023-10-10 cs.AI 79%

Causal Reasoning through Two Layers of Cognition for Improving Generalization in Visual Question Answering

Trang Nguyen, Naoaki Okazaki

专题命中 视觉问答 :visual question answering(title,abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2310.02528 2023-10-05 cs.CV 79%

On the Cognition of Visual Question Answering Models and Human Intelligence: A Comparative Study

Liben Chen, Long Chen, Tian Ellison-Chen, Zhuoyuan Xu

专题命中 视觉问答 :visual question answering(title,abstract);分类 cs.CV

Comments 16 pages, 11 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2203.12929 2023-09-06 cs.CV cs.MM 79%

Towards Escaping from Language Bias and OCR Error: Semantics-Centered Text Visual Question Answering

Chengyang Fang, Gangyan Zeng, Yu Zhou, Daiqing Wu, Can Ma, Dayong Hu, Weiping Wang

专题命中 视觉问答 :visual question answering(title,abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2308.16383 2023-09-01 cs.CV cs.MM 79%

Separate and Locate: Rethink the Text in Text-based Visual Question Answering

Chengyang Fang, Jiangnan Li, Liang Li, Can Ma, Dayong Hu

专题命中 视觉问答 :visual question answering(title,abstract);分类 cs.CV

Comments Accepted by ACM MM 2023

详情

展开后加载摘要…

URL PDF HTML 收藏
2307.15745 2023-08-31 cs.CL cs.CV 79%

Context-VQA: Towards Context-Aware and Purposeful Visual Question Answering

Nandita Naik, Christopher Potts, Elisa Kreiss

专题命中 视觉问答 :visual question answering(title,abstract);分类 cs.CV

Comments Proceedings of ICCV 2023 Workshop on Closing the Loop Between Vision and Language

详情

展开后加载摘要…

URL PDF HTML 收藏
2308.05421 2023-08-11 cs.CV cs.MM 79%

Progressive Spatio-temporal Perception for Audio-Visual Question Answering

Guangyao Li, Wenxuan Hou, Di Hu

专题命中 视觉问答 :visual question answering(title,abstract);分类 cs.CV

Comments Accepted by ACM MM 2023

详情

展开后加载摘要…

URL PDF HTML 收藏
2307.15335 2023-07-31 cs.CL cs.CV 79%

BARTPhoBEiT: Pre-trained Sequence-to-Sequence and Image Transformers Models for Vietnamese Visual Question Answering

Khiem Vinh Tran, Kiet Van Nguyen, Ngan Luu Thuy Nguyen

专题命中 视觉问答 :visual question answering(title,abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2307.09329 2023-07-31 cs.CV 79%

Towards a performance analysis on pre-trained Visual Question Answering models for autonomous driving

Kaavya Rekanar, Ciarán Eising, Ganesh Sistu, Martin Hayes

专题命中 视觉问答 :visual question answering(title,abstract);分类 cs.CV

Journal ref Proceedings of the Irish Machine Vision and Image Processing Conference 2023

详情

展开后加载摘要…

URL PDF HTML 收藏