arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视觉大模型 / VLM

视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。

共收录 3129 信号源:cs.CV, cs.AI, cs.LG

1. 视觉问答 3129 篇

2410.08764 2024-10-14 cs.CL 50%

Measuring the Groundedness of Legal Question-Answering Systems

Dietrich Trautmann, Natalia Ostapuk, Quentin Grail, Adrian Alan Pol, Guglielmo Bonifazi, Shang Gao, Martin Gajek

专题命中 视觉问答 :grounding(abstract)

Comments to appear NLLP @ EMNLP 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.11030 2024-10-01 cs.CL 50%

FoodieQA: A Multimodal Dataset for Fine-Grained Understanding of Chinese Food Culture

Wenyan Li, Xinyu Zhang, Jiaang Li, Qiwei Peng, Raphael Tang, Li Zhou, Weijia Zhang, Guimin Hu, Yifei Yuan, Anders Søgaard, Daniel Hershcovich, Desmond Elliott

专题命中 视觉问答 :vision-language model(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.14891 2024-09-17 cs.CL cs.IR 50%

Generate-then-Ground in Retrieval-Augmented Generation for Multi-hop Question Answering

Zhengliang Shi, Weiwei Sun, Shen Gao, Pengjie Ren, Zhumin Chen, Zhaochun Ren

专题命中 视觉问答 :grounding(abstract)

Comments ACL 2024 (main conference)

详情

展开后加载摘要…

URL PDF HTML 收藏
2408.05123 2024-08-12 cs.HC 50%

Sportify: Question Answering with Embedded Visualizations and Personified Narratives for Sports Video

Chunggi Lee, Tica Lin, Hanspeter Pfister, Chen Zhu-Tian

专题命中 视觉问答 :visual question answering(abstract)

Comments 14 pages, 8 figures, conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2408.01679 2024-08-06 cs.CL cs.MM 50%

MMPKUBase: A Comprehensive and High-quality Chinese Multi-modal Knowledge Graph

Xuan Yi, Yanzeng Li, Lei Zou

专题命中 视觉问答 :visual question answering(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2401.17536 2024-07-24 cs.CL 50%

PipeNet: Question Answering with Semantic Pruning over Knowledge Graphs

Ying Su, Jipeng Zhang, Yangqiu Song, Tong Zhang

专题命中 视觉问答 :grounding(abstract)

Comments 8 pages, 4 figures, accepted to *SEM 2024

Journal ref https://aclanthology.org/2024.starsem-1.29

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.07080 2024-06-12 cs.CL 50%

DARA: Decomposition-Alignment-Reasoning Autonomous Language Agent for Question Answering over Knowledge Graphs

Haishuo Fang, Xiaodan Zhu, Iryna Gurevych

专题命中 视觉问答 :grounding(abstract)

Comments Accepted by ACL2024 findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2311.11598 2024-06-11 cs.CL 50%

Filling the Image Information Gap for VQA: Prompting Large Language Models to Proactively Ask Questions

Ziyue Wang, Chi Chen, Peng Li, Yang Liu

专题命中 视觉问答 :visual question answering(abstract)

Comments Accepted to EMNLP2023 Findings

Journal ref https://aclanthology.org/2023.findings-emnlp.189/

详情

展开后加载摘要…

URL PDF HTML 收藏
2402.08327 2024-06-06 cs.CL 50%

PreFLMR: Scaling Up Fine-Grained Late-Interaction Multi-modal Retrievers

Weizhe Lin, Jingbiao Mei, Jinghong Chen, Bill Byrne

专题命中 视觉问答 :visual question answering(abstract)

Comments ACL 2024; Project page: https://preflmr.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2405.16021 2024-06-03 cs.RO 50%

VADER: Visual Affordance Detection and Error Recovery for Multi Robot Human Collaboration

Michael Ahn, Montserrat Gonzalez Arenas, Matthew Bennice, Noah Brown, Christine Chan, Byron David, Anthony Francis, Gavin Gonzalez, Rainer Hessmer, Tomas Jackson, Nikhil J Joshi, Daniel Lam, Tsang-Wei Edward Lee, Alex Luong, Sharath Maddineni, Harsh Patel, Jodilyn Peralta, Jornell Quiambao, Diego Reyes, Rosario M Jauregui Ruano, Dorsa Sadigh, Pannag Sanketi, Leila Takayama, Pavel Vodenski, Fei Xia

专题命中 视觉问答 :visual question answering(abstract)

Comments 9 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2404.14567 2024-04-24 cs.CL 50%

WangLab at MEDIQA-M3G 2024: Multimodal Medical Answer Generation using Large Language Models

Ronald Xie, Steven Palayew, Augustin Toma, Gary Bader, Bo Wang

专题命中 视觉问答 :visual question answering(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2403.19454 2024-03-29 cs.CL 50%

JDocQA: Japanese Document Question Answering Dataset for Generative Language Models

Eri Onami, Shuhei Kurita, Taiki Miyanishi, Taro Watanabe

专题命中 视觉问答 :visual question answering(abstract)

Comments LREC-COLING2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2402.11770 2024-02-21 cs.CL 50%

Structured Chain-of-Thought Prompting for Few-Shot Generation of Content-Grounded QA Conversations

Md Arafat Sultan, Jatin Ganhotra, Ramón Fernandez Astudillo

专题命中 视觉问答 :grounding(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2311.07878 2024-01-04 cs.IR 50%

Evaluating LLMs on Document-Based QA: Exact Answer Selection and Numerical Extraction using Cogtale dataset

Zafaryab Rasool, Stefanus Kurniawan, Sherwin Balugo, Scott Barnett, Rajesh Vasa, Courtney Chesser, Benjamin M. Hampstead, Sylvie Belleville, Kon Mouzakis, Alex Bahar-Fuchs

专题命中 视觉问答 :grounding(abstract)

Comments 10 pages, 1 figure

详情

展开后加载摘要…

URL PDF HTML 收藏
2312.15021 2023-12-27 cs.CL 50%

Towards a Unified Multimodal Reasoning Framework

Abhinav Arun, Dipendra Singh Mal, Mehul Soni, Tomohiro Sawada

专题命中 视觉问答 :visual question answering(abstract)

Comments 6 pages, 11 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2305.10512 2023-12-19 cs.CL cs.HC 50%

IMAD: IMage-Augmented multi-modal Dialogue

Viktor Moskvoretskii, Anton Frolov, Denis Kuznetsov

专题命中 视觉问答 :visual question answering(abstract)

Comments Main part contains 6 pages, 4 figures. It was accepted on AINL. We wait the publication and DOI

详情

展开后加载摘要…

URL PDF HTML 收藏
2311.08584 2023-11-16 cs.CL 50%

Asking More Informative Questions for Grounded Retrieval

Sedrick Keh, Justin T. Chiu, Daniel Fried

专题命中 视觉问答 :visual question answering(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2310.20170 2023-11-01 cs.CL 50%

DIVKNOWQA: Assessing the Reasoning Ability of LLMs via Open-Domain Question Answering over Knowledge Base and Text

Wenting Zhao, Ye Liu, Tong Niu, Yao Wan, Philip S. Yu, Shafiq Joty, Yingbo Zhou, Semih Yavuz

专题命中 视觉问答 :grounding(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2310.16568 2023-10-26 cs.CL 50%

1-PAGER: One Pass Answer Generation and Evidence Retrieval

Palak Jain, Livio Baldini Soares, Tom Kwiatkowski

专题命中 视觉问答 :grounding(abstract)

Comments Accepted at EMNLP 2023 (Findings)

详情

展开后加载摘要…

URL PDF HTML 收藏
2305.15294 2023-10-24 cs.CL 50%

Enhancing Retrieval-Augmented Large Language Models with Iterative Retrieval-Generation Synergy

Zhihong Shao, Yeyun Gong, Yelong Shen, Minlie Huang, Nan Duan, Weizhu Chen

专题命中 视觉问答 :grounding(abstract)

Comments Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2305.12199 2023-07-05 cs.CL 50%

VNHSGE: VietNamese High School Graduation Examination Dataset for Large Language Models

Xuan-Quy Dao, Ngoc-Bich Le, The-Duy Vo, Xuan-Dung Phan, Bac-Bien Ngo, Van-Tien Nguyen, Thi-My-Thanh Nguyen, Hong-Phuoc Nguyen

专题命中 视觉问答 :visual question answering(abstract)

Comments 74 pages, 44 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2305.15225 2023-06-27 cs.CL 50%

SAIL: Search-Augmented Instruction Learning

Hongyin Luo, Yung-Sung Chuang, Yuan Gong, Tianhua Zhang, Yoon Kim, Xixin Wu, Danny Fox, Helen Meng, James Glass

专题命中 视觉问答 :grounding(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2306.07198 2023-06-13 cs.CL 50%

A Survey of Vision-Language Pre-training from the Lens of Multimodal Machine Translation

Jeremy Gwinnup, Kevin Duh

专题命中 视觉问答 :visual question answering(abstract)

Comments 10 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2305.13703 2023-05-24 cs.CL 50%

MemeCap: A Dataset for Captioning and Interpreting Memes

EunJeong Hwang, Vered Shwartz

专题命中 视觉问答 :visual question answering(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2302.04833 2023-02-10 cs.CR cs.DB 50%

Pushing the Boundaries of Private, Large-Scale Query Answering

Brendan Avent, Aleksandra Korolova

专题命中 视觉问答 :grounding(abstract)

Comments Workshop on Privacy-Preserving Artificial Intelligence (PPAI-23), AAAI, 2023

详情

展开后加载摘要…

URL PDF HTML 收藏
2211.05190 2022-11-11 cs.CL 50%

Towards Reasoning-Aware Explainable VQA

Rakesh Vaideeswaran, Feng Gao, Abhinav Mathur, Govind Thattai

专题命中 视觉问答 :visual question answering(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2208.10297 2022-08-23 cs.CL 50%

Locate Then Ask: Interpretable Stepwise Reasoning for Multi-hop Question Answering

Siyuan Wang, Zhongyu Wei, Zhihao Fan, Qi Zhang, Xuanjing Huang

专题命中 视觉问答 :grounding(abstract)

Comments 11 pages, 6 figures, 6 tables, accepted as a long paper to COLING 2022

详情

展开后加载摘要…

URL PDF HTML 收藏
2206.15030 2022-07-01 cs.CL 50%

Modern Question Answering Datasets and Benchmarks: A Survey

Zhen Wang

专题命中 视觉问答 :visual question answering(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2112.10255 2021-12-21 eess.SP 50%

Task-Oriented Multi-User Semantic Communications

Huiqiang Xie, Zhijin Qin, Xiaoming Tao, Khaled B. Letaief

专题命中 视觉问答 :visual question answering(abstract)

Comments 14 pages, 11 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2108.07357 2021-12-15 eess.SP 50%

Task-Oriented Multi-User Semantic Communications for VQA Task

Huiqiang Xie, Zhijin Qin, Geoffrey Ye Li

专题命中 视觉问答 :visual question answering(abstract)

Comments 5 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏