arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视觉大模型 / VLM

视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。

共收录 25909 信号源:cs.CV, cs.AI, cs.LG

1. 视觉问答 3115 篇

1810.02358 2019-04-09 cs.LG cs.CL cs.CV stat.ML 81%

Transfer Learning via Unsupervised Task Discovery for Visual Question Answering

Hyeonwoo Noh, Taehoon Kim, Jonghwan Mun, Bohyung Han

专题命中 视觉问答 :visual question answering(title,abstract);分类 cs.CV、cs.LG

Comments CVPR 2019

详情

展开后加载摘要…

URL PDF HTML 收藏
1802.00209 2019-03-27 cs.AI cs.CL cs.CV cs.NE stat.ML 81%

Dual Recurrent Attention Units for Visual Question Answering

Ahmed Osman, Wojciech Samek

专题命中 视觉问答 :visual question answering(title,abstract);分类 cs.CV、cs.AI

Comments 8 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
1809.01124 2018-09-05 cs.CV cs.AI 81%

Straight to the Facts: Learning Knowledge Base Retrieval for Factual Visual Question Answering

Medhini Narasimhan, Alexander G. Schwing

专题命中 视觉问答 :visual question answering(title,abstract);分类 cs.CV、cs.AI

Comments Accepted to ECCV 2018

详情

展开后加载摘要…

URL PDF HTML 收藏
1808.02632 2018-08-09 cs.CV cs.AI cs.CL cs.MM 81%

Question-Guided Hybrid Convolution for Visual Question Answering

Peng Gao, Pan Lu, Hongsheng Li, Shuang Li, Yikang Li, Steven Hoi, Xiaogang Wang

专题命中 视觉问答 :visual question answering(title,abstract);分类 cs.CV、cs.AI

Comments 17 pages, 4 figures, accepted in ECCV 2018

详情

展开后加载摘要…

URL PDF HTML 收藏
1806.03379 2018-06-12 cs.CV cs.AI 81%

CS-VQA: Visual Question Answering with Compressively Sensed Images

Li-Chi Huang, Kuldeep Kulkarni, Anik Jha, Suhas Lohit, Suren Jayasuriya, Pavan Turaga

专题命中 视觉问答 :visual question answering(title,abstract);分类 cs.CV、cs.AI

Comments 5 pages, 2 figures, accepted to ICIP 2018

详情

展开后加载摘要…

URL PDF HTML 收藏
1803.09374 2018-04-09 cs.LG cs.CV stat.ML 81%

Generalized Hadamard-Product Fusion Operators for Visual Question Answering

Brendan Duke, Graham W. Taylor

专题命中 视觉问答 :visual question answering(title,abstract);分类 cs.CV、cs.LG

Comments 8 pages, 3 figures. To appear in CRV, 2018, 15th Canadian Conference on Computer and Robot Vision

详情

展开后加载摘要…

URL PDF HTML 收藏
1712.08697 2018-03-05 cs.AI cs.CL cs.CV 81%

Interpretable Counting for Visual Question Answering

Alexander Trott, Caiming Xiong, Richard Socher

专题命中 视觉问答 :visual question answering(title,abstract);分类 cs.CV、cs.AI

Comments ICLR 2018

详情

展开后加载摘要…

URL PDF HTML 收藏
1711.06794 2018-03-02 cs.CV cs.AI cs.CL 81%

Co-attending Free-form Regions and Detections with Multi-modal Multiplicative Feature Embedding for Visual Question Answering

Pan Lu, Hongsheng Li, Wei Zhang, Jianyong Wang, Xiaogang Wang

专题命中 视觉问答 :visual question answering(title,abstract);分类 cs.CV、cs.AI

Comments To appear in AAAI 2018

详情

展开后加载摘要…

URL PDF HTML 收藏
1703.09684 2017-09-15 cs.CV cs.AI cs.CL 81%

An Analysis of Visual Question Answering Algorithms

Kushal Kafle, Christopher Kanan

专题命中 视觉问答 :visual question answering(title,abstract);分类 cs.CV、cs.AI

Comments To appear in ICCV 2017. Visit http://kushalkafle.com/projects/tdiuc to download the dataset

详情

展开后加载摘要…

URL PDF HTML 收藏
1610.01465 2017-06-16 cs.CV cs.AI cs.CL 81%

Visual Question Answering: Datasets, Algorithms, and Future Challenges

Kushal Kafle, Christopher Kanan

专题命中 视觉问答 :visual question answering(title,abstract);分类 cs.CV、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
1705.03865 2017-05-12 cs.CL cs.AI cs.CV 81%

Survey of Visual Question Answering: Datasets and Techniques

Akshay Kumar Gupta

专题命中 视觉问答 :visual question answering(title,abstract);分类 cs.CV、cs.AI

Comments 10 pages, 3 figures, 3 tables Added references, corrected typos, made references less wordy

详情

展开后加载摘要…

URL PDF HTML 收藏
1609.05600 2017-03-31 cs.CV cs.AI cs.CL 81%

Graph-Structured Representations for Visual Question Answering

Damien Teney, Lingqiao Liu, Anton van den Hengel

专题命中 视觉问答 :visual question answering(title,abstract);分类 cs.CV、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
1702.06700 2017-02-23 cs.CV cs.AI cs.CL cs.NE 81%

Task-driven Visual Saliency and Attention-based Visual Question Answering

Yuetan Lin, Zhangyang Pang, Donghui Wang, Yueting Zhuang

专题命中 视觉问答 :visual question answering(title,abstract);分类 cs.CV、cs.AI

Comments 8 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
1611.05546 2016-11-22 cs.CV cs.AI cs.CL 81%

Zero-Shot Visual Question Answering

Damien Teney, Anton van den Hengel

专题命中 视觉问答 :visual question answering(title,abstract);分类 cs.CV、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
1610.06620 2016-10-25 cs.CL cs.AI cs.CV 81%

Proposing Plausible Answers for Open-ended Visual Question Answering

Omid Bakhshandeh, Trung Bui, Zhe Lin, Walter Chang

专题命中 视觉问答 :visual question answering(title,abstract);分类 cs.CV、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
1511.05234 2016-03-22 cs.CV cs.AI cs.CL cs.NE 81%

Ask, Attend and Answer: Exploring Question-Guided Spatial Attention for Visual Question Answering

Huijuan Xu, Kate Saenko

专题命中 视觉问答 :visual question answering(title,abstract);分类 cs.CV、cs.AI

Comments include test-standard result on VQA full release (V1.0) dataset

详情

展开后加载摘要…

URL PDF HTML 收藏
2209.10326 2023-06-16 cs.CV cs.MM 80%

Toward 3D Spatial Reasoning for Human-like Text-based Visual Question Answering

Hao Li, Jinfa Huang, Peng Jin, Guoli Song, Qi Wu, Jie Chen

专题命中 视觉问答 :visual question answering(title,abstract);分类 cs.CV

Comments Accepted by TIP2023, The Arxiv version of "Weakly-Supervised 3D Spatial Reasoning for Text-based Visual Question Answering"

详情

展开后加载摘要…

URL PDF HTML 收藏
1707.07998 2018-03-15 cs.CV 80%

Bottom-Up and Top-Down Attention for Image Captioning and Visual Question Answering

Peter Anderson, Xiaodong He, Chris Buehler, Damien Teney, Mark Johnson, Stephen Gould, Lei Zhang

专题命中 视觉问答 :visual question answering(title,abstract);分类 cs.CV

Comments CVPR 2018 full oral, winner of the 2017 Visual Question Answering challenge

详情

展开后加载摘要…

URL PDF HTML 收藏
1708.02711 2017-08-10 cs.CV cs.CL 80%

Tips and Tricks for Visual Question Answering: Learnings from the 2017 Challenge

Damien Teney, Peter Anderson, Xiaodong He, Anton van den Hengel

专题命中 视觉问答 :visual question answering(title,abstract);分类 cs.CV

Comments Winner of the 2017 Visual Question Answering (VQA) Challenge at CVPR

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.00123 2026-06-02 cs.CV cs.AI cs.LG 80%

CardioLens: Revealing the Clinical Reality Gap of MLLMs via Multi-Sequence Cardiac MRI Evaluations

CardioLens: 通过多序列心脏MRI评估揭示MLLMs的临床现实差距

Zixian Su, Hongkai Zhang, Fan Gao, Encheng Su, Taiping Qu, Jingwei Guo, Nan Zhang, Hui Wang, Zhen Zhou, Kairui Bo, Yan Chen, Yue Ren, Shuai Li, Lei Xu, Henggui Zhang

机构 * Beijing Academy of Artificial Intelligence(北京人工智能研究院) Beijing Anzhen Hospital(北京安贞医院) Beihang University(北航) King Abdullah University of Science and Technology(国王 Abdullah 科学与技术大学)

专题命中 视觉问答 :MLLM(abstract,abstract_cn);multimodal large language model(abstract);分类 cs.CV、cs.AI、cs.LG

AI总结 提出CardioLens测试平台,通过多序列心脏磁共振成像评估24个多模态大语言模型,发现其在临床工作流中表现不佳,存在类别崩溃失败模式,且输入选择和推理提示改进效果有限。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.20525 2026-05-21 cs.CV cs.AI cs.CL cs.LG eess.IV 80%

NeuroQA: A Large-Scale Image-Grounded Benchmark for 3D Brain MRI Understanding

NeuroQA: 一种大规模的3D脑部MRI理解图像 grounded 评估基准

Mohammad H. Abbasi, Favour Nerrise, Shaurnav Ghosh, Ridvan Yesiloglu, Yuncong Mao, Bailey Trang, Mohammad Asadi, Merryn Daniel, Gustavo Chau Loo Kung, Ken Chang, Pavan Pinkesh Shah, Adam Turnbull, Kyan Younes, Seena Dehkharghani, Ehsan Adeli

机构 * Stanford University(斯坦福大学)

专题命中 视觉问答 :vision-language model(abstract);visual question answering(abstract);grounding(abstract);分类 cs.CV、cs.AI、cs.LG

AI总结 本文提出NeuroQA,一个大规模的3D脑部MRI视觉问答基准,包含来自12977名受试者的56953个问答对,涵盖5-104岁及五个临床领域,通过3D体积评估11种临床推理技能,并提供可复现的生成脚本和在线排行榜。

Comments 30 pages, dataset and benchmark release

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.03583 2026-04-30 cs.MM cs.IR 80%

OpenLifelogQA: An Open-Ended Multi-Modal Lifelog Question-Answering Dataset

OpenLifelogQA:一个开放式多模态生活日志问答数据集

Quang-Linh Tran, Hoang-Bao Le, Tuong-Nghiem Diep, Binh Nguyen, Gareth J. F. Jones, Cathal Gurrin

专题命中 视觉问答 :LLaVA(summary_cn,abstract)

AI总结 OpenLifelogQA数据集包含14187对问答对,用于支持真实场景下的鲁棒评估,相比现有资源更适用于实际应用,通过评估LLaVA-NeXT-Interleave 7B模型展示了其在生活日志问答中的性能。

Comments In the proceedings of the 14th International Symposium on Information and Communication Technology

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.20816 2026-04-22 cs.CL 80%

Rethinking Information Synthesis in Multimodal Question Answering A Multi-Agent Perspective

重新思考多模态问答中的信息合成:多智能体视角

Krishna Singh Rajput, Tejas Anvekar, Chitta Baral, Vivek Gupta

机构 * Arizona State University(亚利桑那州立大学)

专题命中 视觉问答 :VLM(abstract,abstract_cn);visual language model(abstract);multimodal large language model(abstract)

AI总结 本文提出多智能体框架MAMMQA,通过分解查询、跨模态推理和整合答案,提升多模态问答的准确性和可解释性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.11169 2025-11-17 cs.CV cs.AI cs.LG 80%

Refine and Align: Confidence Calibration through Multi-Agent Interaction in VQA

Ayush Pandey, Jai Bardhan, Ishita Jain, Ramya S Hebbalaguppe, Rohan Raju Dhanakshirur, Lovekesh Vig

机构 * TCS Research(塔塔咨询研究)

专题命中 视觉问答 :vision-language model(abstract);VLM(abstract);visual question answering(abstract);分类 cs.CV、cs.AI、cs.LG

Comments 17 pages, 6 figures, 5 tables. Accepted to Special Track on AI Alignment, AAAI 2026. Project Page- https://refine-align.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.12750 2025-10-15 cs.CV cs.AI cs.LG 80%

VQArt-Bench: A semantically rich VQA Benchmark for Art and Cultural Heritage

A. Alfarano, L. Venturoli, D. Negueruela del Castillo

机构 * University of Zurich, Max Planck Society(苏黎世大学、马克斯·普朗克研究所)

专题命中 视觉问答 :visual reasoning(abstract);visual question answering(abstract);multimodal large language model(abstract);分类 cs.CV、cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.14424 2024-12-20 cs.CV cs.AI cs.LG 80%

FedPIA -- Permuting and Integrating Adapters leveraging Wasserstein Barycenters for Finetuning Foundation Models in Multi-Modal Federated Learning

Pramit Saha, Divyanshu Mishra, Felix Wagner, Konstantinos Kamnitsas, J. Alison Noble

专题命中 视觉问答 :vision-language model(abstract);VLM(abstract);visual question answering(abstract);分类 cs.CV、cs.AI、cs.LG

Comments Accepted for publication in AAAI 2025 (Main Track)

详情

展开后加载摘要…

URL PDF HTML 收藏
2402.14683 2024-06-18 cs.CV cs.AI cs.LG 80%

Visual Hallucinations of Multi-modal Large Language Models

Wen Huang, Hongbin Liu, Minxin Guo, Neil Zhenqiang Gong

专题命中 视觉问答 :LLaVA(abstract);visual question answering(abstract);MLLM(abstract);分类 cs.CV、cs.AI、cs.LG

Comments To appear in ACL Findings, 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2405.03685 2024-05-07 cs.CV cs.AI cs.CL cs.LG 80%

Language-Image Models with 3D Understanding

Jang Hyun Cho, Boris Ivanovic, Yulong Cao, Edward Schmerling, Yue Wang, Xinshuo Weng, Boyi Li, Yurong You, Philipp Krähenbühl, Yan Wang, Marco Pavone

专题命中 视觉问答 :visual question answering(abstract);grounding(abstract);MLLM(abstract);分类 cs.CV、cs.AI、cs.LG

Comments Project page: https://janghyuncho.github.io/Cube-LLM

详情

展开后加载摘要…

URL PDF HTML 收藏
2401.04157 2024-02-21 cs.RO 80%

RePLan: Robotic Replanning with Perception and Language Models

Marta Skreta, Zihan Zhou, Jia Lin Yuan, Kourosh Darvish, Alán Aspuru-Guzik, Animesh Garg

专题命中 视觉问答 :vision language model(abstract);VLM(abstract);visual question answering(abstract);grounding(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2311.07575 2023-11-14 cs.CV cs.AI cs.CL cs.LG 80%

SPHINX: The Joint Mixing of Weights, Tasks, and Visual Embeddings for Multi-modal Large Language Models

Ziyi Lin, Chris Liu, Renrui Zhang, Peng Gao, Longtian Qiu, Han Xiao, Han Qiu, Chen Lin, Wenqi Shao, Keqin Chen, Jiaming Han, Siyuan Huang, Yichi Zhang, Xuming He, Hongsheng Li, Yu Qiao

专题命中 视觉问答 :visual question answering(abstract);grounding(abstract);MLLM(abstract);分类 cs.CV、cs.AI、cs.LG

Comments Work in progress. Code and demos are released at https://github.com/Alpha-VLLM/LLaMA2-Accessory

详情

展开后加载摘要…

URL PDF HTML 收藏