arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视觉大模型 / VLM

视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。

共收录 3129 信号源:cs.CV, cs.AI, cs.LG

1. 视觉问答 3129 篇

2508.17398 2025-08-26 cs.CL 50%

DashboardQA: Benchmarking Multimodal Agents for Question Answering on Interactive Dashboards

Aaryaman Kartha, Ahmed Masry, Mohammed Saidul Islam, Thinh Lang, Shadikur Rahman, Ridwan Mahbub, Mizanur Rahman, Mahir Ahmed, Md Rizwan Parvez, Enamul Hoque, Shafiq Joty

机构 * York University(约克大学) RBC Qatar Computing Research Institute (QCRI)(卡塔尔计算研究所) Nanyang Technological University(南洋理工大学) Salesforce Research(Salesforce研究)

专题命中 视觉问答 :grounding(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.18023 2025-08-26 cs.CL 50%

Detecting Knowledge Boundary of Vision Large Language Models by Sampling-Based Inference

Zhuo Chen, Xinyu Wang, Yong Jiang, Zhen Zhang, Xinyu Geng, Pengjun Xie, Fei Huang, Kewei Tu

机构 * School of Information Science and Technology, ShanghaiTech University(信息科学与技术学院,上海科技大学) Shanghai Engineering Research Center of Intelligent Vision and Imaging(智能视觉与成像上海工程研究中心) Institute for Intelligent Computing, Alibaba Group(智能计算研究院,阿里巴巴集团)

专题命中 视觉问答 :visual question answering(abstract)

Comments EMNLP2025 Main Conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.16139 2025-08-25 cs.CL 50%

XLQA: A Benchmark for Locale-Aware Multilingual Open-Domain Question Answering

Keon-Woo Roh, Yeong-Joon Ju, Seong-Whan Lee

机构 * Department of Artificial Intelligence, Korea University(人工智能系,韩国大学)

专题命中 视觉问答 :grounding(abstract)

Comments Accepted to EMNLP 2025 main conference. 12 pages, 4 figures, 7 tables. Code is available at https://github.com/ro-ko/XLQA

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.05182 2025-08-22 cs.IR 50%

On the Comprehensibility of Multi-structured Financial Documents using LLMs and Pre-processing Tools

Shivani Upadhyay, Messiah Ataey, Syed Shariyar Murtaza, Yifan Nie, Jimmy Lin

专题命中 视觉问答 :MLLM(abstract)

Comments 15 pages, 5 figures, 9 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.04271 2025-08-07 cs.DC 50%

S2M3: Split-and-Share Multi-Modal Models for Distributed Multi-Task Inference on the Edge

JinYi Yoon, JiHo Lee, Ting He, Nakjung Choi, Bo Ji

专题命中 视觉问答 :visual question answering(abstract)

Comments Accepted at IEEE International Conference on Distributed Computing Systems (ICDCS 2025)

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.04585 2025-07-31 cs.CL 50%

MuSciClaims: Multimodal Scientific Claim Verification

Yash Kumar Lal, Manikanta Bandham, Mohammad Saqib Hasan, Apoorva Kashi, Mahnaz Koupaee, Niranjan Balasubramanian

机构 * Stony Brook University(石溪大学)

专题命中 视觉问答 :vision-language model(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.21520 2025-07-30 cs.IR 50%

Solution for Meta KDD Cup'25: A Comprehensive Three-Step Framework for Vision Question Answering

Zijian Zhang, Xiaocheng Zhang, Yang Zhou, Zhimin Lin, Peng Yan

专题命中 视觉问答 :visual question answering(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.06571 2025-07-10 cs.CL 50%

Enhancing Food-Domain Question Answering with a Multimodal Knowledge Graph: Hybrid QA Generation and Diversity Analysis

Srihari K B, Pushpak Bhattacharyya

专题命中 视觉问答 :LLaVA(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.01627 2025-07-03 cs.CL 50%

Chart Question Answering from Real-World Analytical Narratives

Maeve Hutchinson, Radu Jianu, Aidan Slingsby, Jo Wood, Pranava Madhyastha

专题命中 视觉问答 :multimodal large language model(abstract)

Comments This paper has been accepted to the ACL Student Research Workshop (SRW) 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.00355 2025-07-02 cs.CL 50%

Question Decomposition for Retrieval-Augmented Generation

Paul J. L. Ammann, Jonas Golde, Alan Akbik

机构 * Humboldt-Universität zu Berlin(柏林洪堡大学)

专题命中 视觉问答 :grounding(abstract)

Comments Accepted to ACL SRW 2025. 9 Pages, 2 Figures, 4 Tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.20330 2025-06-26 cs.IR 50%

Semantic-enhanced Modality-asymmetric Retrieval for Online E-commerce Search

Zhigong Zhou, Ning Ding, Xiaochuan Fan, Yue Shang, Yiming Qiu, Jingwei Zhuo, Zhiwei Ge, Songlin Wang, Lin Liu, Sulong Xu, Han Zhang

专题命中 视觉问答 :visual question answering(abstract)

Comments published in sigir2023

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.16968 2025-06-23 cs.CR cs.CY 50%

MM-AttacKG: A Multimodal Approach to Attack Graph Construction with Large Language Models

Yongheng Zhang, Xinyun Zhao, Yunshan Ma, Haokai Ma, Yingxiao Guan, Guozheng Yang, Yuliang Lu, Xiang Wang

专题命中 视觉问答 :multimodal large language model(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.10116 2025-06-13 cs.CL 50%

ChartReasoner: Code-Driven Modality Bridging for Long-Chain Reasoning in Chart Question Answering

Caijun Jia, Nan Xu, Jingxuan Wei, Qingli Wang, Lei Wang, Bihui Yu, Junnan Zhu

机构 * MAIS, Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所MAIS研究所) Shenyang Institute of Computing Technology, Chinese Academy of Sciences(中国科学院沈阳计算技术研究所) Beijing Wenge Technology Co., Ltd.(北京文耕科技有限公司) University of Chinese Academy of Sciences(中国科学院大学)

专题命中 视觉问答 :visual reasoning(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.00232 2025-06-03 cs.CL 50%

ComposeRAG: A Modular and Composable RAG for Corpus-Grounded Multi-Hop Question Answering

Ruofan Wu, Youngwon Lee, Fan Shu, Danmei Xu, Seung-won Hwang, Zhewei Yao, Yuxiong He, Feng Yan

机构 * University of Houston(德克萨斯大学休斯敦分校) Seoul National University(首尔国立大学) Snowflake AI Research(Snowflake人工智能研究)

专题命中 视觉问答 :grounding(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.14248 2025-06-02 cs.CL 50%

Addressing Blind Guessing: Calibration of Selection Bias in Multiple-Choice Question Answering by Video Language Models

Olga Loginova, Oleksandr Bezrukov, Ravi Shekhar, Alexey Kravets

机构 * University of Trento(特伦托大学) Gran Sasso Science Institute(格兰萨索科学研究所) University of Essex(埃塞克斯大学) University of Bath(巴斯大学)

专题命中 视觉问答 :VLM(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.09715 2025-05-05 cs.IT cs.GT math.IT 50%

Generative Semantic Communication via Textual Prompts: Latency Performance Tradeoffs

Mengmeng Ren, Li Qiao, Long Yang, Zhen Gao, Jian Chen, Mahdi Boloursaz Mashhadi, Pei Xiao, Rahim Tafazolli, Mehdi Bennis

专题命中 视觉问答 :vision language model(abstract)

Comments Accepted by IEEE Transactions on Vehicular Technology

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.21252 2025-05-01 cs.CL 50%

Talk Before You Retrieve: Agent-Led Discussions for Better RAG in Medical QA

Xuanzhao Dong, Wenhui Zhu, Hao Wang, Xiwen Chen, Peijie Qiu, Rui Yin, Yi Su, Yalin Wang

机构 * Arizona State University(亚利桑那州立大学) Clemson University(克莱姆森大学) Washington University in St.Louis(圣路易斯华盛顿大学) Banner Alzheimer’s Institute(班纳阿尔茨海默病研究所)

专题命中 视觉问答 :VLM(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.05506 2025-04-11 cs.CL 50%

ChartQAPro: A More Diverse and Challenging Benchmark for Chart Question Answering

Ahmed Masry, Mohammed Saidul Islam, Mahir Ahmed, Aayush Bajaj, Firoz Kabir, Aaryaman Kartha, Md Tahmid Rahman Laskar, Mizanur Rahman, Shadikur Rahman, Mehrad Shahmohammadi, Megh Thakkar, Md Rizwan Parvez, Enamul Hoque, Shafiq Joty

专题命中 视觉问答 :vision-language model(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.04303 2025-04-08 cs.CL 50%

Graph-Based Multimodal Contrastive Learning for Chart Question Answering

Yue Dai, Soyeon Caren Han, Wei Liu

专题命中 视觉问答 :multimodal large language model(abstract)

Comments Accepted at SIGIR 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2403.01390 2025-03-26 cs.CL 50%

Right for Right Reasons: Large Language Models for Verifiable Commonsense Knowledge Graph Question Answering

Armin Toroghi, Willis Guo, Mohammad Mahdi Abdollah Pour, Scott Sanner

专题命中 视觉问答 :grounding(abstract)

Comments 33 pages, EMNLP24

详情

展开后加载摘要…

URL PDF HTML 收藏
2405.09818 2025-03-24 cs.CL 50%

Chameleon: Mixed-Modal Early-Fusion Foundation Models

Chameleon Team

专题命中 视觉问答 :visual question answering(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.11747 2025-02-19 cs.IR 50%

Open-Ended and Knowledge-Intensive Video Question Answering

Md Zarif Ul Alam, Hamed Zamani

专题命中 视觉问答 :vision language model(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.06329 2025-02-11 cs.CL 50%

Expect the Unexpected: FailSafe Long Context QA for Finance

Kiran Kamble, Melisa Russak, Dmytro Mozolevskyi, Muayad Ali, Mateusz Russak, Waseem AlShikh

专题命中 视觉问答 :grounding(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.01034 2025-01-14 cs.CL cs.SD eess.AS 50%

Advancing Singlish Understanding: Bridging the Gap with Datasets and Multimodal Models

Bin Wang, Xunlong Zou, Shuo Sun, Wenyu Zhang, Yingxu He, Zhuohan Liu, Chengwei Wei, Nancy F. Chen, AiTi Aw

专题命中 视觉问答 :multimodal large language model(abstract)

Comments Open-Source: https://github.com/AudioLLMs/Singlish

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.17701 2024-12-25 cs.CL 50%

From Models to Microtheories: Distilling a Model's Topical Knowledge for Grounded Question Answering

Nathaniel Weir, Bhavana Dalvi Mishra, Orion Weller, Oyvind Tafjord, Sam Hornstein, Alexander Sabol, Peter Jansen, Benjamin Van Durme, Peter Clark

专题命中 视觉问答 :grounding(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.03736 2024-12-24 cs.CL 50%

Domain-specific Question Answering with Hybrid Search

Dewang Sultania, Zhaoyu Lu, Twisha Naik, Franck Dernoncourt, David Seunghyun Yoon, Sanat Sharma, Trung Bui, Ashok Gupta, Tushar Vatsa, Suhas Suresha, Ishita Verma, Vibha Belavadi, Cheng Chen, Michael Friedrich

专题命中 视觉问答 :grounding(abstract)

Comments AAAI-25 Workshop on Document Understanding and Intelligence

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.18069 2024-12-17 cs.IR 50%

Overview of TREC 2024 Biomedical Generative Retrieval (BioGen) Track

Deepak Gupta, Dina Demner-Fushman, William Hersh, Steven Bedrick, Kirk Roberts

专题命中 视觉问答 :grounding(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.14795 2024-11-25 cs.CL 50%

De-biased Multimodal Electrocardiogram Analysis

Haitao Li, Ziyu Li, Yiheng Mao, Ziyi Liu, Zhoujian Sun, Zhengxing Huang

专题命中 视觉问答 :multimodal large language model(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.12722 2024-10-17 cs.CL 50%

WorldMedQA-V: a multilingual, multimodal medical examination dataset for multimodal language models evaluation

João Matos, Shan Chen, Siena Placino, Yingya Li, Juan Carlos Climent Pardo, Daphna Idan, Takeshi Tohyama, David Restrepo, Luis F. Nakayama, Jose M. M. Pascual-Leone, Guergana Savova, Hugo Aerts, Leo A. Celi, A. Ian Wong, Danielle S. Bitterman, Jack Gallifant

专题命中 视觉问答 :vision language model(abstract)

Comments submitted for review, total of 14 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.11366 2024-10-16 cs.CL 50%

LargePiG: Your Large Language Model is Secretly a Pointer Generator

Zhongxiang Sun, Zihua Si, Xiaoxue Zang, Kai Zheng, Yang Song, Xiao Zhang, Jun Xu

专题命中 视觉问答 :vision language model(abstract)

Comments 24 pages

详情

展开后加载摘要…

URL PDF HTML 收藏