arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视觉大模型 / VLM

视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。

共收录 26030 信号源:cs.CV, cs.AI, cs.LG

1. 视觉问答 3126 篇

2406.02331 2024-06-05 cs.CL 78%

Translation Deserves Better: Analyzing Translation Artifacts in Cross-lingual Visual Question Answering

ChaeHun Park, Koanho Lee, Hyesu Lim, Jaeseok Kim, Junmo Park, Yu-Jung Heo, Du-Seong Chang, Jaegul Choo

专题命中 视觉问答 :visual question answering(title,abstract)

Comments ACL 2024 Findings Accepted

详情

展开后加载摘要…

URL PDF HTML 收藏
2405.06636 2024-05-24 cs.CV cs.AI cs.CL cs.LG 78%

Federated Document Visual Question Answering: A Pilot Study

Khanh Nguyen, Dimosthenis Karatzas

专题命中 视觉问答 :visual question answering(title);分类 cs.CV、cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2303.02601 2024-05-06 cs.CL 78%

Knowledge-Based Counterfactual Queries for Visual Question Answering

Theodoti Stoikou, Maria Lymperaiou, Giorgos Stamou

专题命中 视觉问答 :visual question answering(title,abstract)

Journal ref AAAI MAKE 2023

详情

展开后加载摘要…

URL PDF HTML 收藏
2308.08628 2024-04-24 cs.CL 78%

Learning the meanings of function words from grounded language using a visual question answering model

Eva Portelance, Michael C. Frank, Dan Jurafsky

专题命中 视觉问答 :visual question answering(title,abstract)

Comments Published in Cognitive Science 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2302.11752 2024-04-18 cs.CL 78%

EVJVQA Challenge: Multilingual Visual Question Answering

Ngan Luu-Thuy Nguyen, Nghia Hieu Nguyen, Duong T. D Vo, Khanh Quoc Tran, Kiet Van Nguyen

专题命中 视觉问答 :visual question answering(title,abstract)

Comments VLSP2022 EVJVQA challenge

详情

展开后加载摘要…

URL PDF HTML 收藏
2403.17647 2024-03-28 cs.CL 78%

Intrinsic Subgraph Generation for Interpretable Graph based Visual Question Answering

Pascal Tilli, Ngoc Thang Vu

专题命中 视觉问答 :visual question answering(title,abstract)

Comments Accepted at LREC-COLING 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2303.05674 2024-03-19 cs.RO 78%

Robotic Applications of Pre-Trained Vision-Language Models to Various Recognition Behaviors

Kento Kawaharazuka, Yoshiki Obinata, Naoaki Kanazawa, Kei Okada, Masayuki Inaba

专题命中 视觉问答 :vision-language model(title,abstract)

Comments Accepted at Humanoids2023

详情

展开后加载摘要…

URL PDF HTML 收藏
2401.05736 2024-01-12 cs.CL cs.IR 78%

Cross-modal Retrieval for Knowledge-based Visual Question Answering

Paul Lerner, Olivier Ferret, Camille Guinaudeau

专题命中 视觉问答 :visual question answering(title,abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2310.14670 2023-11-02 cs.CV cs.AI cs.CL cs.LG cs.MM 78%

Dataset Bias Mitigation in Multiple-Choice Visual Question Answering and Beyond

Zhecan Wang, Long Chen, Haoxuan You, Keyang Xu, Yicheng He, Wenhao Li, Noel Codella, Kai-Wei Chang, Shih-Fu Chang

专题命中 视觉问答 :visual question answering(title);分类 cs.CV、cs.AI、cs.LG

Comments EMNLP 2023

Journal ref EMNLP 2023

详情

展开后加载摘要…

URL PDF HTML 收藏
2305.04183 2023-10-03 cs.CL 78%

OpenViVQA: Task, Dataset, and Multimodal Fusion Models for Visual Question Answering in Vietnamese

Nghia Hieu Nguyen, Duong T. D. Vo, Kiet Van Nguyen, Ngan Luu-Thuy Nguyen

专题命中 视觉问答 :visual question answering(title,abstract)

Comments submitted to Elsevier

详情

展开后加载摘要…

URL PDF HTML 收藏
2202.07630 2023-06-12 cs.CL 78%

Delving Deeper into Cross-lingual Visual Question Answering

Chen Liu, Jonas Pfeiffer, Anna Korhonen, Ivan Vulić, Iryna Gurevych

专题命中 视觉问答 :visual question answering(title,abstract)

Comments Findings of EACL 2023

详情

展开后加载摘要…

URL PDF HTML 收藏
2306.05392 2023-06-09 cs.CL 78%

Modular Visual Question Answering via Code Generation

Sanjay Subramanian, Medhini Narasimhan, Kushal Khangaonkar, Kevin Yang, Arsha Nagrani, Cordelia Schmid, Andy Zeng, Trevor Darrell, Dan Klein

专题命中 视觉问答 :visual question answering(title,abstract)

Comments ACL 2023

详情

展开后加载摘要…

URL PDF HTML 收藏
2305.17690 2023-05-30 cs.CL 78%

HaVQA: A Dataset for Visual Question Answering and Multimodal Research in Hausa Language

Shantipriya Parida, Idris Abdulmumin, Shamsuddeen Hassan Muhammad, Aneesh Bose, Guneet Singh Kohli, Ibrahim Said Ahmad, Ketan Kotwal, Sayan Deb Sarkar, Ondřej Bojar, Habeebah Adamu Kakudi

专题命中 视觉问答 :visual question answering(title,abstract)

Comments Accepted at ACL 2023 as a long paper (Findings)

详情

展开后加载摘要…

URL PDF HTML 收藏
2104.14336 2023-04-04 cs.IR 78%

Document Collection Visual Question Answering

Rubèn Tito, Dimosthenis Karatzas, Ernest Valveny

专题命中 视觉问答 :visual question answering(title,abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2301.10799 2023-02-14 cs.CL 78%

Towards a Unified Model for Generating Answers and Explanations in Visual Question Answering

Chenxi Whitehouse, Tillman Weyde, Pranava Madhyastha

专题命中 视觉问答 :visual question answering(title,abstract)

Comments Findings of EACL 2023

详情

展开后加载摘要…

URL PDF HTML 收藏
2301.07227 2023-01-19 cs.CL 78%

Curriculum Script Distillation for Multilingual Visual Question Answering

Khyathi Raghavi Chandu, Alborz Geramifard

专题命中 视觉问答 :visual question answering(title,abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2210.03809 2022-11-01 cs.CL 78%

Retrieval Augmented Visual Question Answering with Outside Knowledge

Weizhe Lin, Bill Byrne

专题命中 视觉问答 :visual question answering(title,abstract)

Comments Accepted to appear at the main conference of EMNLP 2022

详情

展开后加载摘要…

URL PDF HTML 收藏
2209.15301 2022-10-03 cs.CL 78%

Medical Question Understanding and Answering with Knowledge Grounding and Semantic Self-Supervision

Khalil Mrini, Harpreet Singh, Franck Dernoncourt, Seunghyun Yoon, Trung Bui, Walter Chang, Emilia Farcas, Ndapa Nakashole

专题命中 视觉问答 :grounding(title,abstract)

Comments Accepted as Main Conference Long paper at COLING 2022

详情

展开后加载摘要…

URL PDF HTML 收藏
2207.12783 2022-07-27 cs.CL 78%

Equivariant and Invariant Grounding for Video Question Answering

Yicong Li, Xiang Wang, Junbin Xiao, Tat-Seng Chua

专题命中 视觉问答 :grounding(title,abstract)

Comments MM22

详情

展开后加载摘要…

URL PDF HTML 收藏
2109.06082 2022-03-18 cs.CL 78%

xGQA: Cross-Lingual Visual Question Answering

Jonas Pfeiffer, Gregor Geigle, Aishwarya Kamath, Jan-Martin O. Steitz, Stefan Roth, Ivan Vulić, Iryna Gurevych

专题命中 视觉问答 :visual question answering(title,abstract)

Comments Findings of ACL 2022

详情

展开后加载摘要…

URL PDF HTML 收藏
2109.04653 2021-09-13 cs.CL 78%

Towards Developing a Multilingual and Code-Mixed Visual Question Answering System by Knowledge Distillation

Humair Raj Khan, Deepak Gupta, Asif Ekbal

专题命中 视觉问答 :visual question answering(title,abstract)

Comments Accepted in EMNLP-Findings (2021)

详情

展开后加载摘要…

URL PDF HTML 收藏
2105.03938 2021-05-11 cs.IR 78%

Passage Retrieval for Outside-Knowledge Visual Question Answering

Chen Qu, Hamed Zamani, Liu Yang, W. Bruce Croft, Erik Learned-Miller

专题命中 视觉问答 :visual question answering(title,abstract)

Comments Accepted to SIGIR'21 as a short paper

详情

展开后加载摘要…

URL PDF HTML 收藏
2105.00136 2021-05-04 cs.MM 78%

Cross-Modal Self-Attention with Multi-Task Pre-Training for Medical Visual Question Answering

Haifan Gong, Guanqi Chen, Sishuo Liu, Yizhou Yu, Guanbin Li

专题命中 视觉问答 :visual question answering(title,abstract)

Comments ICMR '21: ACM International Conference on Multimedia Retrieval, Taipei, Taiwan, August 21-24, 2021

详情

展开后加载摘要…

URL PDF HTML 收藏
1906.06216 2019-06-17 cs.CL 78%

Improving Visual Question Answering by Referring to Generated Paragraph Captions

Hyounghun Kim, Mohit Bansal

专题命中 视觉问答 :visual question answering(title,abstract)

Comments ACL 2019 (7 pages)

详情

展开后加载摘要…

URL PDF HTML 收藏
1906.04229 2019-06-12 cs.CL 78%

Psycholinguistics meets Continual Learning: Measuring Catastrophic Forgetting in Visual Question Answering

Claudio Greco, Barbara Plank, Raquel Fernández, Raffaella Bernardi

专题命中 视觉问答 :visual question answering(title,abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
1905.12008 2019-05-30 cs.CV cs.AI cs.CL cs.LG 78%

Leveraging Medical Visual Question Answering with Supporting Facts

Tomasz Kornuta, Deepta Rajan, Chaitanya Shivade, Alexis Asseman, Ahmet S. Ozcan

专题命中 视觉问答 :visual question answering(title);分类 cs.CV、cs.AI、cs.LG

Comments Working notes from the ImageCLEF 2019 VQA-Med competition

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.17427 2026-08-19 cs.CV 新提交 77%

Counterfactual Anatomy-guided Spatial-Temporal Decoding for Annotation-Free Hallucination Mitigation in Medical VLMs

用于医学视觉语言模型无注释幻觉缓解的反事实解剖学引导时空解码

Yifan Lu, Adinath Dukre, Abhijit Das, Ziyun Zou, Haolin Yang, Yutong Xie, Imran Razzak

机构 * Mohamed bin Zayed University of Artificial Intelligence(穆罕默德·本·扎耶德人工智能大学) MedOS

专题命中 视觉问答 :vision-language model(abstract);visual question answering(abstract);grounding(abstract);分类 cs.CV

AI总结 该研究提出无需人工注释的CAST框架,通过自动选择解剖区域结合对比解码,在SLAKE和MIMIC-CXR数据集上针对三种Med-VLMs实现优于基线的幻觉缓解,提升了医学视觉语言模型的空间接地性。

Comments Accepted by MICCAI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.14841 2026-08-18 cs.AI 新提交 77%

What the Reranker Sees: Multi-Aspect Page Annotation for Long-Document Multimodal Question Answering

重排序器所见:面向长文档多模态问答的多方面页面标注

Guanchen Wu, Jiayuan Ding, Subhabrata Mukherjee, Carl Yang

机构 * Emory University(埃默里大学) Hippocratic AI(希波克拉底人工智能公司)

专题命中 视觉问答 :VLM(abstract,abstract_cn);visual question answering(abstract);分类 cs.AI

AI总结 本文针对长文档多模态问答的重排序瓶颈,提出含Trident-R与Trident-S组件的Trident模型,通过多方面页面标注提升检索与生成性能,在多数据集上取得显著效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.09573 2026-08-11 cs.CV 新提交 77%

VideoVIBE: A Video-Grounded Diagnostic Benchmark for One-Shot Interactive Website Generation

VideoVIBE:用于一次性交互式网站生成的基于视频的诊断基准

Jiajun Xu, Yanghao Zhou, Jingyun Liao, Yu Bai, Jinxing Zhou, Chengliang Liu, Changsen Yuan, Bo Wang, Qian Liu

专题命中 视觉问答 :MLLM(summary_cn,abstract_cn);分类 cs.CV

AI总结 针对现有一次性交互式网站生成质量评估的不足,提出VideoVIBE基准与V2Lens多智能体系统,实验显示V2Lens可提升Video MLLM的评估性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.05631 2026-08-07 cs.CV 新提交 77%

ChronoVision: Temporal Reasoning via Latent State Reconstruction

ChronoVision:基于潜在状态重构的时序推理

Yifan Shen, Jian Xu, Boyi Li, Yuner Zhang, Tianjiao Yu, Bingxuan Li, Houze Yang, Rushi Wang, Xu Cao

专题命中 视觉问答 :grounding(abstract,abstract_cn);multimodal large language model(abstract);分类 cs.CV

AI总结 针对多模态大语言模型时序推理不足的问题,本文提出ChronoVision框架,引入Vbvr-VQA数据集,实验显示其在相关基准上取得最优性能。

详情

展开后加载摘要…

URL PDF HTML 收藏