arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视觉大模型 / VLM

视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。

共收录 3129 信号源:cs.CV, cs.AI, cs.LG

1. 视觉问答 3129 篇

2312.15300 2023-12-27 cs.CV 57%

Q-Boost: On Visual Quality Assessment Ability of Low-level Multi-Modality Foundation Models

Zicheng Zhang, Haoning Wu, Zhongpeng Ji, Chunyi Li, Erli Zhang, Wei Sun, Xiaohong Liu, Xiongkuo Min, Fengyu Sun, Shangling Jui, Weisi Lin, Guangtao Zhai

专题命中 视觉问答 :MLLM(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2312.11146 2023-12-25 cs.CV 57%

OsmLocator: locating overlapping scatter marks with a non-training generative perspective

Yuming Qiu, Aleksandra Pizurica, Qi Ming, Nicolas Nadisic

专题命中 视觉问答 :visual question answering(abstract);分类 cs.CV

Comments 22pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2312.13848 2023-12-22 cs.CV 57%

Reducing Hallucinations: Enhancing VQA for Flood Disaster Damage Assessment with Visual Contexts

Yimin Sun, Chao Wang, Yan Peng

专题命中 视觉问答 :visual question answering(abstract);分类 cs.CV

Comments already be accepted by 2024 3rd International Conference on Computer, Artificial Intelligence and Control Engineering (CAICE 2024)

详情

展开后加载摘要…

URL PDF HTML 收藏
2312.13219 2023-12-21 cs.RO cs.CL cs.CV 57%

Interactive Visual Task Learning for Robots

Weiwei Gu, Anant Sah, Nakul Gopalan

专题命中 视觉问答 :visual question answering(abstract);分类 cs.CV

Comments In Proceedings of The 38th Annual AAAI Conference on Artificial Intelligence

详情

展开后加载摘要…

URL PDF HTML 收藏
2310.09767 2023-12-20 cs.CL cs.AI 57%

VLIS: Unimodal Language Models Guide Multimodal Language Generation

Jiwan Chung, Youngjae Yu

专题命中 视觉问答 :vision-language model(abstract);分类 cs.AI

Comments Accepted as main paper in EMNLP 2023

详情

展开后加载摘要…

URL PDF HTML 收藏
2312.09251 2023-12-15 cs.CV 57%

VL-GPT: A Generative Pre-trained Transformer for Vision and Language Understanding and Generation

Jinguo Zhu, Xiaohan Ding, Yixiao Ge, Yuying Ge, Sijie Zhao, Hengshuang Zhao, Xiaohua Wang, Ying Shan

专题命中 视觉问答 :visual question answering(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2312.06720 2023-12-15 cs.CV 57%

Audio-Visual LLM for Video Understanding

Fangxun Shu, Lei Zhang, Hao Jiang, Cihang Xie

专题命中 视觉问答 :multimodal large language model(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2312.06685 2023-12-13 cs.AI 57%

Causal-CoG: A Causal-Effect Look at Context Generation for Boosting Multi-modal Language Models

Shitian Zhao, Zhuowan Li, Yadong Lu, Alan Yuille, Yan Wang

专题命中 视觉问答 :visual question answering(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2310.06641 2023-12-08 cs.CV 57%

How (not) to ensemble LVLMs for VQA

Lisa Alazraki, Lluis Castrejon, Mostafa Dehghani, Fantine Huot, Jasper Uijlings, Thomas Mensink

专题命中 视觉问答 :vision-language model(abstract);分类 cs.CV

Comments 4th I Can't Believe It's Not Better Workshop (co-located with NeurIPS 2023)

详情

展开后加载摘要…

URL PDF HTML 收藏
2306.07096 2023-12-07 cs.CV 57%

Global and Local Semantic Completion Learning for Vision-Language Pre-training

Rong-Cheng Tu, Yatai Ji, Jie Jiang, Weijie Kong, Chengfei Cai, Wenzhe Zhao, Hongfa Wang, Yujiu Yang, Wei Liu

专题命中 视觉问答 :visual question answering(abstract);分类 cs.CV

Comments arXiv admin note: substantial text overlap with arXiv:2211.13437

详情

展开后加载摘要…

URL PDF HTML 收藏
2308.02463 2023-11-17 cs.CV cs.CL 57%

Towards Generalist Foundation Model for Radiology by Leveraging Web-scale 2D&3D Medical Data

Chaoyi Wu, Xiaoman Zhang, Ya Zhang, Yanfeng Wang, Weidi Xie

专题命中 视觉问答 :visual question answering(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2311.03354 2023-11-07 cs.CV 57%

CoVLM: Composing Visual Entities and Relationships in Large Language Models Via Communicative Decoding

Junyan Li, Delin Chen, Yining Hong, Zhenfang Chen, Peihao Chen, Yikang Shen, Chuang Gan

专题命中 视觉问答 :visual question answering(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2305.03971 2023-11-01 cs.CL cs.CV 57%

Adaptive loose optimization for robust question answering

Jie Ma, Pinghui Wang, Zewei Wang, Dechen Kong, Min Hu, Ting Han, Jun Liu

专题命中 视觉问答 :visual question answering(abstract);分类 cs.CV

Comments 13 pages,8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2302.10503 2023-10-30 cs.AI 57%

Reusable Slotwise Mechanisms

Trang Nguyen, Amin Mansouri, Kanika Madan, Khuong Nguyen, Kartik Ahuja, Dianbo Liu, Yoshua Bengio

专题命中 视觉问答 :visual question answering(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2310.07091 2023-10-20 cs.CL cs.AI 57%

Jaeger: A Concatenation-Based Multi-Transformer VQA Model

Jieting Long, Zewei Shi, Penghao Jiang, Yidong Gan

专题命中 视觉问答 :visual question answering(abstract);分类 cs.AI

Comments This paper is the technical research paper of CIKM 2023 DocIU challenges. The authors received the CIKM 2023 DocIU Winner Award, sponsored by Google, Microsoft, and the Centre for data-driven geoscience

详情

展开后加载摘要…

URL PDF HTML 收藏
2307.07362 2023-10-20 cs.CV cs.CL 57%

A scoping review on multimodal deep learning in biomedical images and texts

Zhaoyi Sun, Mingquan Lin, Qingqing Zhu, Qianqian Xie, Fei Wang, Zhiyong Lu, Yifan Peng

专题命中 视觉问答 :visual question answering(abstract);分类 cs.CV

Comments This paper has been accepted by the Journal of Biomedical Informatics

Journal ref Journal of Biomedical Informatics, Volume 146, October 2023, 104482

详情

展开后加载摘要…

URL PDF HTML 收藏
2310.09147 2023-10-16 cs.MM cs.CV 57%

Exploring Sparse Spatial Relation in Graph Inference for Text-Based VQA

Sheng Zhou, Dan Guo, Jia Li, Xun Yang, Meng Wang

专题命中 视觉问答 :visual question answering(abstract);分类 cs.CV

Comments Accepted by TIP 2023

详情

展开后加载摘要…

URL PDF HTML 收藏
2310.04443 2023-10-16 cs.CL cs.AI 57%

Human Mobility Question Answering (Vision Paper)

Hao Xue, Flora D. Salim

专题命中 视觉问答 :visual question answering(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2310.01842 2023-10-04 cs.CV 57%

SelfGraphVQA: A Self-Supervised Graph Neural Network for Scene-based Question Answering

Bruno Souza, Marius Aasan, Helio Pedrini, Adín Ramírez Rivera

专题命中 视觉问答 :visual question answering(abstract);分类 cs.CV

Comments To appear in Vision-and-Language Algorithmic Reasoning Workshop at ICCV 2023

详情

展开后加载摘要…

URL PDF HTML 收藏
2309.15915 2023-09-29 cs.CV 57%

Zero-Shot and Few-Shot Video Question Answering with Multi-Modal Prompts

Deniz Engin, Yannis Avrithis

专题命中 视觉问答 :vision-language model(abstract);分类 cs.CV

Comments ICCV2023 CLVL Workshop (Oral). Project page: https://engindeniz.github.io/vitis

详情

展开后加载摘要…

URL PDF HTML 收藏
2309.15487 2023-09-28 cs.CV 57%

Tackling VQA with Pretrained Foundation Models without Further Training

Alvin De Jun Tan, Bingquan Shen

专题命中 视觉问答 :visual question answering(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2309.10375 2023-09-20 cs.CV 57%

Pointing out Human Answer Mistakes in a Goal-Oriented Visual Dialogue

Ryosuke Oshima, Seitaro Shinagawa, Hideki Tsunashima, Qi Feng, Shigeo Morishima

专题命中 视觉问答 :visual language model(abstract);分类 cs.CV

Comments Accepted at ICCVW 2023

详情

展开后加载摘要…

URL PDF HTML 收藏
2110.08797 2023-09-15 cs.CV 57%

Towards Language-guided Visual Recognition via Dynamic Convolutions

Gen Luo, Yiyi Zhou, Xiaoshuai Sun, Yongjian Wu, Yue Gao, Rongrong Ji

专题命中 视觉问答 :visual question answering(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2308.10240 2023-08-22 cs.CV 57%

Generic Attention-model Explainability by Weighted Relevance Accumulation

Yiming Huang, Aozhe Jia, Xiaodan Zhang, Jiawei Zhang

专题命中 视觉问答 :visual question answering(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2211.09778 2023-08-22 cs.CV cs.CL 57%

I Can't Believe There's No Images! Learning Visual Tasks Using only Language Supervision

Sophia Gu, Christopher Clark, Aniruddha Kembhavi

专题命中 视觉问答 :visual question answering(abstract);分类 cs.CV

Comments website (https://prior.allenai.org/projects/close), code (https://github.com/allenai/close)

详情

展开后加载摘要…

URL PDF HTML 收藏
2209.05534 2023-08-22 cs.CV cs.CL 57%

PreSTU: Pre-Training for Scene-Text Understanding

Jihyung Kil, Soravit Changpinyo, Xi Chen, Hexiang Hu, Sebastian Goodman, Wei-Lun Chao, Radu Soricut

专题命中 视觉问答 :visual question answering(abstract);分类 cs.CV

Comments Accepted to ICCV 2023

详情

展开后加载摘要…

URL PDF HTML 收藏
2303.11897 2023-08-21 cs.CV 57%

TIFA: Accurate and Interpretable Text-to-Image Faithfulness Evaluation with Question Answering

Yushi Hu, Benlin Liu, Jungo Kasai, Yizhong Wang, Mari Ostendorf, Ranjay Krishna, Noah A Smith

专题命中 视觉问答 :visual question answering(abstract);分类 cs.CV

Comments Accepted to ICCV 2023

详情

展开后加载摘要…

URL PDF HTML 收藏
2211.09699 2023-08-21 cs.CV cs.CL 57%

PromptCap: Prompt-Guided Task-Aware Image Captioning

Yushi Hu, Hang Hua, Zhengyuan Yang, Weijia Shi, Noah A Smith, Jiebo Luo

专题命中 视觉问答 :visual question answering(abstract);分类 cs.CV

Comments Accepted to ICCV 2023

详情

展开后加载摘要…

URL PDF HTML 收藏
2308.03906 2023-08-09 cs.CV 57%

TIJO: Trigger Inversion with Joint Optimization for Defending Multimodal Backdoored Models

Indranil Sur, Karan Sikka, Matthew Walmer, Kaushik Koneripalli, Anirban Roy, Xiao Lin, Ajay Divakaran, Susmit Jha

专题命中 视觉问答 :visual question answering(abstract);分类 cs.CV

Comments Published as conference paper at ICCV 2023. 13 pages, 6 figures, 7 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2306.09224 2023-07-25 cs.CV 57%

Encyclopedic VQA: Visual questions about detailed properties of fine-grained categories

Thomas Mensink, Jasper Uijlings, Lluis Castrejon, Arushi Goel, Felipe Cadar, Howard Zhou, Fei Sha, André Araujo, Vittorio Ferrari

专题命中 视觉问答 :visual question answering(abstract);分类 cs.CV

Comments ICCV'23

详情

展开后加载摘要…

URL PDF HTML 收藏