arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视觉大模型 / VLM

视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。

共收录 3126 信号源:cs.CV, cs.AI, cs.LG

1. 视觉问答 3126 篇

2407.18449 2025-04-15 eess.IV cs.CV cs.LG 62%

Towards A Generalizable Pathology Foundation Model via Unified Knowledge Distillation

Jiabo Ma, Zhengrui Guo, Fengtao Zhou, Yihui Wang, Yingxue Xu, Jinbang Li, Fang Yan, Yu Cai, Zhengjie Zhu, Cheng Jin, Yi Lin, Xinrui Jiang, Chenglong Zhao, Danyi Li, Anjia Han, Zhenhui Li, Ronald Cheong Kin Chan, Jiguang Wang, Peng Fei, Kwang-Ting Cheng, Shaoting Zhang, Li Liang, Hao Chen

专题命中 视觉问答 :visual question answering(abstract);分类 cs.CV、cs.LG

Comments update

详情

展开后加载摘要…

URL PDF HTML 收藏
2405.11145 2025-04-01 cs.CV cs.AI cs.MM 62%

Detecting Multimodal Situations with Insufficient Context and Abstaining from Baseless Predictions

Junzhang Liu, Zhecan Wang, Hammad Ayyubi, Haoxuan You, Chris Thomas, Rui Sun, Shih-Fu Chang, Kai-Wei Chang

专题命中 视觉问答 :vision-language model(abstract);分类 cs.CV、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.19680 2025-03-28 cs.CV cs.AI 62%

M-LLM Based Video Frame Selection for Efficient Video Understanding

Kai Hu, Feng Gao, Xiaohan Nie, Peng Zhou, Son Tran, Tal Neiman, Lingyun Wang, Mubarak Shah, Raffay Hamid, Bing Yin, Trishul Chilimbi

专题命中 视觉问答 :visual reasoning(abstract);分类 cs.CV、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.08182 2025-03-21 cs.CV cs.AI cs.CL 62%

MRAG-Bench: Vision-Centric Evaluation for Retrieval-Augmented Multimodal Models

Wenbo Hu, Jia-Chen Gu, Zi-Yi Dou, Mohsen Fayyaz, Pan Lu, Kai-Wei Chang, Nanyun Peng

专题命中 视觉问答 :vision-language model(abstract);分类 cs.CV、cs.AI

Comments ICLR 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.11761 2025-03-20 cs.CV cs.AI 62%

SlideChat: A Large Vision-Language Assistant for Whole-Slide Pathology Image Understanding

Ying Chen, Guoan Wang, Yuanfeng Ji, Yanjun Li, Jin Ye, Tianbin Li, Ming Hu, Rongshan Yu, Yu Qiao, Junjun He

专题命中 视觉问答 :multimodal large language model(abstract);分类 cs.CV、cs.AI

Comments Accepted by CVPR2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.05031 2025-03-14 cs.CV cs.LG cs.RO 62%

ECBench: Can Multi-modal Foundation Models Understand the Egocentric World? A Holistic Embodied Cognition Benchmark

Ronghao Dang, Yuqian Yuan, Wenqi Zhang, Yifei Xin, Boqiang Zhang, Long Li, Liuyi Wang, Qinyang Zeng, Xin Li, Lidong Bing

专题命中 视觉问答 :vision-language model(abstract);分类 cs.CV、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.19973 2025-03-11 cs.CV cs.AI 62%

Can Large Language Models Unveil the Mysteries? An Exploration of Their Ability to Unlock Information in Complex Scenarios

Chao Wang, Luning Zhang, Zheng Wang, Yang Zhou

专题命中 视觉问答 :visual question answering(abstract);分类 cs.CV、cs.AI

Comments 11pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2204.08027 2025-03-10 cs.CV cs.AI 62%

Attention Mechanism based Cognition-level Scene Understanding

Xuejiao Tang, Wenbin Zhang

专题命中 视觉问答 :visual question answering(abstract);分类 cs.CV、cs.AI

Comments Published in Information

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.03285 2025-03-07 cs.CV cs.LG 62%

Enhancing Vietnamese VQA through Curriculum Learning on Raw and Augmented Text Representations

Khoi Anh Nguyen, Linh Yen Vu, Thang Dinh Duong, Thuan Nguyen Duong, Huy Thanh Nguyen, Vinh Quang Dinh

专题命中 视觉问答 :visual question answering(abstract);分类 cs.CV、cs.LG

Comments 10 pages, 3 figures, AAAI-25 Workshop on Document Understanding and Intelligence

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.02476 2025-03-05 cs.CV cs.AI 62%

BioD2C: A Dual-level Semantic Consistency Constraint Framework for Biomedical VQA

Zhengyang Ji, Shang Gao, Li Liu, Yifan Jia, Yutao Yue

专题命中 视觉问答 :visual question answering(abstract);分类 cs.CV、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2402.05374 2025-02-25 cs.CV cs.AI cs.CL 62%

CIC: A Framework for Culturally-Aware Image Captioning

Youngsik Yun, Jihie Kim

专题命中 视觉问答 :visual question answering(abstract);分类 cs.CV、cs.AI

Comments Accepted by IJCAI 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.09219 2025-02-14 cs.LO cs.AI cs.LG 62%

Abduction of Domain Relationships from Data for VQA

Al Mehdi Saadat Chowdhury, Paulo Shakarian, Gerardo I. Simari

专题命中 视觉问答 :visual question answering(abstract);分类 cs.AI、cs.LG

Comments In Proceedings ICLP 2024, arXiv:2502.08453

Journal ref EPTCS 416, 2025, pp. 168-174

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.09211 2025-02-14 cs.AI cs.CV cs.LO 62%

Visual Graph Question Answering with ASP and LLMs for Language Parsing

Jakob Johannes Bauer, Thomas Eiter, Nelson Higuera Ruiz, Johannes Oetsch

专题命中 视觉问答 :visual question answering(abstract);分类 cs.CV、cs.AI

Comments In Proceedings ICLP 2024, arXiv:2502.08453. This work was partially funded from the Bosch Center for AI

Journal ref EPTCS 416, 2025, pp. 15-28

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.12784 2025-02-11 cs.CV cs.AI 62%

Evaluating Image Hallucination in Text-to-Image Generation with Question-Answering

Youngsun Lim, Hojun Choi, Hyunjung Shim

专题命中 视觉问答 :visual question answering(abstract);分类 cs.CV、cs.AI

Comments 20 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2405.00021 2025-02-04 cs.CV cs.AI cs.CL 62%

SIMPLOT: Enhancing Chart Question Answering by Distilling Essentials

Wonjoong Kim, Sangwu Park, Yeonjun In, Seokwon Han, Chanyoung Park

专题命中 视觉问答 :vision-language model(abstract);分类 cs.CV、cs.AI

Comments Findings of NAACL 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.16300 2025-01-28 cs.CV cs.AI 62%

Large Models in Dialogue for Active Perception and Anomaly Detection

Tzoulio Chamiti, Nikolaos Passalis, Anastasios Tefas

专题命中 视觉问答 :visual question answering(abstract);分类 cs.CV、cs.AI

Comments Accepted to International Conference of Pattern Recognition (ICPR 2024)

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.13297 2025-01-24 cs.CL cs.AI cs.IR cs.LG 62%

RAMQA: A Unified Framework for Retrieval-Augmented Multi-Modal Question Answering

Yang Bai, Christan Earl Grant, Daisy Zhe Wang

专题命中 视觉问答 :LLaVA(abstract);分类 cs.AI、cs.LG

Comments Accepted by NAACL 2025 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.09413 2025-01-14 cs.CL cs.AI cs.CV 62%

SPIQA: A Dataset for Multimodal Question Answering on Scientific Papers

Shraman Pramanick, Rama Chellappa, Subhashini Venugopalan

专题命中 视觉问答 :multimodal large language model(abstract);分类 cs.CV、cs.AI

Comments NeurIPS 2024, Datasets & Benchmarks track

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.10221 2025-01-13 cs.CV cs.AI cs.CL 62%

Long Story Short: Story-level Video Understanding from 20K Short Films

Ridouane Ghermi, Xi Wang, Vicky Kalogeiton, Ivan Laptev

专题命中 视觉问答 :vision-language model(abstract);分类 cs.CV、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.04053 2024-12-23 cs.CV cs.AI 62%

COLUMBUS: Evaluating COgnitive Lateral Understanding through Multiple-choice reBUSes

Koen Kraaijveld, Yifan Jiang, Kaixin Ma, Filip Ilievski

专题命中 视觉问答 :vision-language model(abstract);分类 cs.CV、cs.AI

Comments 15 pages, 10 figures, accepted to AAAI-25

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.10756 2024-12-17 cs.CV cs.LG 62%

Damage Assessment after Natural Disasters with UAVs: Semantic Feature Extraction using Deep Learning

Nethmi S. Hewawiththi, M. Mahesha Viduranga, Vanodhya G. Warnasooriya, Tharindu Fernando, Himal A. Suraweera, Sridha Sridharan, Clinton Fookes

专题命中 视觉问答 :visual question answering(abstract);分类 cs.CV、cs.LG

Comments 11 pages, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.09230 2024-12-13 cs.CV cs.AI 62%

Foundation Models and Adaptive Feature Selection: A Synergistic Approach to Video Question Answering

Sai Bhargav Rongali, Mohamad Hassan N C, Ankit Jha, Neha Bhargava, Saurabh Prasad, Biplab Banerjee

专题命中 视觉问答 :grounding(abstract);分类 cs.CV、cs.AI

Journal ref WACV2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.08158 2024-12-12 cs.CV cs.CL cs.LG 62%

How Vision-Language Tasks Benefit from Large Pre-trained Models: A Survey

Yayun Qi, Hongxi Li, Yiqi Song, Xinxiao Wu, Jiebo Luo

专题命中 视觉问答 :visual question answering(abstract);分类 cs.CV、cs.LG

Comments Under Review

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.16201 2024-11-26 cs.LG cs.CL cs.CV 62%

Video-Text Dataset Construction from Multi-AI Feedback: Promoting Weak-to-Strong Preference Learning for Video Large Language Models

Hao Yi, Qingyang Li, Yulan Hu, Fuzheng Zhang, Di Zhang, Yong Liu

专题命中 视觉问答 :multimodal large language model(abstract);分类 cs.CV、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.20098 2024-11-19 cs.CV cs.AI cs.CL 62%

Web2Code: A Large-scale Webpage-to-Code Dataset and Evaluation Framework for Multimodal LLMs

Sukmin Yun, Haokun Lin, Rusiru Thushara, Mohammad Qazim Bhat, Yongxin Wang, Zutao Jiang, Mingkai Deng, Jinhong Wang, Tianhua Tao, Junbo Li, Haonan Li, Preslav Nakov, Timothy Baldwin, Zhengzhong Liu, Eric P. Xing, Xiaodan Liang, Zhiqiang Shen

专题命中 视觉问答 :multimodal large language model(abstract);分类 cs.CV、cs.AI

Comments NeurIPS 2024 Datasets and Benchmarks Camera-ready Version. Website at https://mbzuai-llm.github.io/webpage2code/

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.03628 2024-11-07 cs.CV cs.AI 62%

StreamingBench: Assessing the Gap for MLLMs to Achieve Streaming Video Understanding

Junming Lin, Zheng Fang, Chi Chen, Zihao Wan, Fuwen Luo, Peng Li, Yang Liu, Maosong Sun

专题命中 视觉问答 :multimodal large language model(abstract);分类 cs.CV、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.01153 2024-11-05 cs.CV cs.AI 62%

Designing a Robust Radiology Report Generation System

Sonit Singh

专题命中 视觉问答 :visual question answering(abstract);分类 cs.CV、cs.AI

Comments 21 pages, 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.24114 2024-11-01 cs.CV cs.AI cs.CL 62%

Nearest Neighbor Normalization Improves Multimodal Retrieval

Neil Chowdhury, Franklin Wang, Sumedh Shenoy, Douwe Kiela, Sarah Schwettmann, Tristan Thrush

专题命中 视觉问答 :visual question answering(abstract);分类 cs.CV、cs.AI

Journal ref EMNLP 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.23698 2024-11-01 cs.LG cs.CV 62%

Aggregate-and-Adapt Natural Language Prompts for Downstream Generalization of CLIP

Chen Huang, Skyler Seto, Samira Abnar, David Grangier, Navdeep Jaitly, Josh Susskind

专题命中 视觉问答 :vision-language model(abstract);分类 cs.CV、cs.LG

Comments NeurIPS 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.01437 2024-11-01 cs.CV cs.AI 62%

Kvasir-VQA: A Text-Image Pair GI Tract Dataset

Sushant Gautam, Andrea Storås, Cise Midoglu, Steven A. Hicks, Vajira Thambawita, Pål Halvorsen, Michael A. Riegler

专题命中 视觉问答 :visual question answering(abstract);分类 cs.CV、cs.AI

Comments to be published in VLM4Bio 2024, part of the ACM Multimedia (ACM MM) conference 2024

详情

展开后加载摘要…

URL PDF HTML 收藏