arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视觉大模型 / VLM

视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。

共收录 3126 信号源:cs.CV, cs.AI, cs.LG

1. 视觉问答 3126 篇

2410.17484 2024-10-24 cs.CV cs.CL cs.LG 62%

Which Client is Reliable?: A Reliable and Personalized Prompt-based Federated Learning for Medical Image Question Answering

He Zhu, Ren Togo, Takahiro Ogawa, Miki Haseyama

专题命中 视觉问答 :visual question answering(abstract);分类 cs.CV、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2308.05822 2024-10-21 cs.CV cs.AI cs.HC 62%

Encode-Store-Retrieve: Augmenting Human Memory through Language-Encoded Egocentric Perception

Junxiao Shen, John Dudley, Per Ola Kristensson

专题命中 视觉问答 :vision language model(abstract);分类 cs.CV、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2404.05465 2024-10-15 cs.CV cs.LG 62%

HAMMR: HierArchical MultiModal React agents for generic VQA

Lluis Castrejon, Thomas Mensink, Howard Zhou, Vittorio Ferrari, Andre Araujo, Jasper Uijlings

专题命中 视觉问答 :visual question answering(abstract);分类 cs.CV、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2401.10712 2024-10-15 cs.CV cs.AI cs.CL 62%

Q&A Prompts: Discovering Rich Visual Clues through Mining Question-Answer Prompts for VQA requiring Diverse World Knowledge

Haibo Wang, Weifeng Ge

专题命中 视觉问答 :visual question answering(abstract);分类 cs.CV、cs.AI

Comments Accepted by ECCV'24

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.05800 2024-10-10 cs.CV cs.AI 62%

Core Tokensets for Data-efficient Sequential Training of Transformers

Subarnaduti Paul, Manuel Brack, Patrick Schramowski, Kristian Kersting, Martin Mundt

专题命中 视觉问答 :visual question answering(abstract);分类 cs.CV、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2311.08695 2024-10-08 cs.LG cs.CL cs.CV 62%

Attribute Diversity Determines the Systematicity Gap in VQA

Ian Berlot-Attwell, Kumar Krishna Agrawal, A. Michael Carrell, Yash Sharma, Naomi Saphra

专题命中 视觉问答 :visual question answering(abstract);分类 cs.CV、cs.LG

Comments 36 pages, 27 figures, EMNLP 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.19010 2024-10-01 cs.CL cs.AI cs.LG 62%

A comprehensive study of on-device NLP applications -- VQA, automated Form filling, Smart Replies for Linguistic Codeswitching

Naman Goyal

专题命中 视觉问答 :visual question answering(abstract);分类 cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2311.13833 2024-09-30 cs.CV cs.CL cs.LG 62%

Lego: Learning to Disentangle and Invert Personalized Concepts Beyond Object Appearance in Text-to-Image Diffusion Models

Saman Motamed, Danda Pani Paudel, Luc Van Gool

专题命中 视觉问答 :visual question answering(abstract);分类 cs.CV、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.09748 2024-09-17 cs.CV cs.AI 62%

Explore the Hallucination on Low-level Perception for MLLMs

Yinan Sun, Zicheng Zhang, Haoning Wu, Xiaohong Liu, Weisi Lin, Guangtao Zhai, Xiongkuo Min

专题命中 视觉问答 :visual question answering(abstract);分类 cs.CV、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.07748 2024-09-16 cs.CV cs.AI cs.CL 62%

Top-down Activity Representation Learning for Video Question Answering

Yanan Wang, Shuichiro Haruta, Donghuo Zeng, Julio Vizcarra, Mori Kurokawa

专题命中 视觉问答 :LLaVA(abstract);分类 cs.CV、cs.AI

Comments presented at MIRU2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.06644 2024-09-12 cs.CV cs.AI 62%

EyeCLIP: A visual-language foundation model for multi-modal ophthalmic image analysis

Danli Shi, Weiyi Zhang, Jiancheng Yang, Siyu Huang, Xiaolan Chen, Mayinuer Yusufu, Kai Jin, Shan Lin, Shunming Liu, Qing Zhang, Mingguang He

专题命中 视觉问答 :visual question answering(abstract);分类 cs.CV、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.01560 2024-09-04 cs.CV cs.AI 62%

Blocks as Probes: Dissecting Categorization Ability of Large Multimodal Models

Bin Fu, Qiyang Wan, Jialin Li, Ruiping Wang, Xilin Chen

专题命中 视觉问答 :visual question answering(abstract);分类 cs.CV、cs.AI

Comments 39 pages, 28 figures, 4 tables. Accepted at The 35th British Machine Vision Conference (BMVC 2024). Project page at https://fubin29.github.io/Blocks-as-Probes/

详情

展开后加载摘要…

URL PDF HTML 收藏
2311.06607 2024-08-27 cs.CV cs.AI cs.CL 62%

Monkey: Image Resolution and Text Label Are Important Things for Large Multi-modal Models

Zhang Li, Biao Yang, Qiang Liu, Zhiyin Ma, Shuo Zhang, Jingxu Yang, Yabo Sun, Yuliang Liu, Xiang Bai

专题命中 视觉问答 :visual question answering(abstract);分类 cs.CV、cs.AI

Comments CVPR 2024 Highlight

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.01942 2024-07-03 cs.AI cs.CL cs.CV 62%

Certainly Uncertain: A Benchmark and Metric for Multimodal Epistemic and Aleatoric Awareness

Khyathi Raghavi Chandu, Linjie Li, Anas Awadalla, Ximing Lu, Jae Sung Park, Jack Hessel, Lijuan Wang, Yejin Choi

专题命中 视觉问答 :visual question answering(abstract);分类 cs.CV、cs.AI

Comments 26 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2312.10251 2024-06-25 cs.CV cs.AI 62%

Advancing Surgical VQA with Scene Graph Knowledge

Kun Yuan, Manasi Kattel, Joel L. Lavanchy, Nassir Navab, Vinkle Srivastav, Nicolas Padoy

专题命中 视觉问答 :visual question answering(abstract);分类 cs.CV、cs.AI

Comments IPCAI 2024, Int J CARS (2024)

详情

展开后加载摘要…

URL PDF HTML 收藏
2401.05163 2024-06-21 cs.CV cs.AI 62%

MISS: A Generative Pretraining and Finetuning Approach for Med-VQA

Jiawei Chen, Dingkang Yang, Yue Jiang, Yuxuan Lei, Lihua Zhang

专题命中 视觉问答 :visual question answering(abstract);分类 cs.CV、cs.AI

Comments ICANN, 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2311.12639 2024-06-14 cs.CV cs.AI 62%

KNVQA: A Benchmark for evaluation knowledge-based VQA

Sirui Cheng, Siyu Zhang, Jiayi Wu, Muchen Lan

专题命中 视觉问答 :vision-language model(abstract);分类 cs.CV、cs.AI

Comments There was a little error in the method section of the paper

详情

展开后加载摘要…

URL PDF HTML 收藏
2402.08017 2024-06-04 cs.CV cs.CL cs.LG 62%

Lumos : Empowering Multimodal LLMs with Scene Text Recognition

Ashish Shenoy, Yichao Lu, Srihari Jayakumar, Debojeet Chatterjee, Mohsen Moslehpour, Pierce Chuang, Abhay Harpale, Vikas Bhardwaj, Di Xu, Shicong Zhao, Longfang Zhao, Ankit Ramchandani, Xin Luna Dong, Anuj Kumar

专题命中 视觉问答 :multimodal large language model(abstract);分类 cs.CV、cs.LG

Comments Accepted to KDD 2024 (ADS Track)

详情

展开后加载摘要…

URL PDF HTML 收藏
2404.14760 2024-05-30 cs.CL cs.AI cs.IR cs.LG 62%

Retrieval Augmented Generation for Domain-specific Question Answering

Sanat Sharma, David Seunghyun Yoon, Franck Dernoncourt, Dewang Sultania, Karishma Bagga, Mengjiao Zhang, Trung Bui, Varun Kotte

专题命中 视觉问答 :grounding(abstract);分类 cs.AI、cs.LG

Comments AAAI 2024 (Association for the Advancement of Artificial Intelligence) Scientific Document Understanding Workshop

详情

展开后加载摘要…

URL PDF HTML 收藏
2405.11338 2024-05-24 cs.CV cs.AI 62%

EyeFound: A Multimodal Generalist Foundation Model for Ophthalmic Imaging

Danli Shi, Weiyi Zhang, Xiaolan Chen, Yexin Liu, Jiancheng Yang, Siyu Huang, Yih Chung Tham, Yingfeng Zheng, Mingguang He

专题命中 视觉问答 :visual question answering(abstract);分类 cs.CV、cs.AI

Comments 21 pages, 2 figures, 4 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2404.13594 2024-04-23 cs.CV cs.AI 62%

Lost in Space: Probing Fine-grained Spatial Understanding in Vision and Language Resamplers

Georgios Pantazopoulos, Alessandro Suglia, Oliver Lemon, Arash Eshghi

专题命中 视觉问答 :visual question answering(abstract);分类 cs.CV、cs.AI

Comments NAACL 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2303.03761 2024-04-15 cs.CV cs.LG 62%

Graph Neural Networks in Vision-Language Image Understanding: A Survey

Henry Senior, Gregory Slabaugh, Shanxin Yuan, Luca Rossi

专题命中 视觉问答 :visual question answering(abstract);分类 cs.CV、cs.LG

Comments 20 pages, 5 figures, 5 tables

Journal ref Vis Comput (2024)

详情

展开后加载摘要…

URL PDF HTML 收藏
2306.14899 2024-03-25 cs.CV cs.AI cs.CL cs.MM 62%

FunQA: Towards Surprising Video Comprehension

Binzhu Xie, Sicheng Zhang, Zitang Zhou, Bo Li, Yuanhan Zhang, Jack Hessel, Jingkang Yang, Ziwei Liu

专题命中 视觉问答 :vision-language model(abstract);分类 cs.CV、cs.AI

Comments Project Page: https://funqa-benchmark.github.io/ Codebase: https://github.com/Jingkang50/FunQA

详情

展开后加载摘要…

URL PDF HTML 收藏
2403.02626 2024-03-21 cs.CV cs.LG 62%

Modeling Collaborator: Enabling Subjective Vision Classification With Minimal Human Effort via LLM Tool-Use

Imad Eddine Toubal, Aditya Avinash, Neil Gordon Alldrin, Jan Dlabal, Wenlei Zhou, Enming Luo, Otilia Stretcu, Hao Xiong, Chun-Ta Lu, Howard Zhou, Ranjay Krishna, Ariel Fuxman, Tom Duerig

专题命中 视觉问答 :vision-language model(abstract);分类 cs.CV、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2402.17753 2024-02-28 cs.CL cs.AI cs.LG 62%

Evaluating Very Long-Term Conversational Memory of LLM Agents

Adyasha Maharana, Dong-Ho Lee, Sergey Tulyakov, Mohit Bansal, Francesco Barbieri, Yuwei Fang

专题命中 视觉问答 :grounding(abstract);分类 cs.AI、cs.LG

Comments 19 pages; Project page: https://snap-research.github.io/locomo/

详情

展开后加载摘要…

URL PDF HTML 收藏
2402.15096 2024-02-26 cs.LG cs.CV cs.MM 62%

Multimodal Transformer With a Low-Computational-Cost Guarantee

Sungjin Park, Edward Choi

专题命中 视觉问答 :visual question answering(abstract);分类 cs.CV、cs.LG

Comments Accepted to ICASSP 2024 (5 pages)

详情

展开后加载摘要…

URL PDF HTML 收藏
2402.14835 2024-02-26 cs.CL cs.AI cs.LG 62%

MIKE: A New Benchmark for Fine-grained Multimodal Entity Knowledge Editing

Jiaqi Li, Miaozeng Du, Chuanyi Zhang, Yongrui Chen, Nan Hu, Guilin Qi, Haiyun Jiang, Siyuan Cheng, Bozhong Tian

专题命中 视觉问答 :multimodal large language model(abstract);分类 cs.AI、cs.LG

Comments 8 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2312.10637 2024-02-15 cs.CV cs.AI 62%

An Evaluation of GPT-4V and Gemini in Online VQA

Mengchen Liu, Chongyan Chen, Danna Gurari

专题命中 视觉问答 :visual question answering(abstract);分类 cs.CV、cs.AI

Comments 20 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2402.02541 2024-02-07 cs.CL cs.AI cs.CV 62%

Knowledge Generation for Zero-shot Knowledge-based VQA

Rui Cao, Jing Jiang

专题命中 视觉问答 :visual question answering(abstract);分类 cs.CV、cs.AI

Comments accepted as Findings in EACL 2023

详情

展开后加载摘要…

URL PDF HTML 收藏
2312.17016 2023-12-29 cs.CV cs.AI 62%

On the Promises and Challenges of Multimodal Foundation Models for Geographical, Environmental, Agricultural, and Urban Planning Applications

Chenjiao Tan, Qian Cao, Yiwei Li, Jielu Zhang, Xiao Yang, Huaqin Zhao, Zihao Wu, Zhengliang Liu, Hao Yang, Nemin Wu, Tao Tang, Xinyue Ye, Lilong Chai, Ninghao Liu, Changying Li, Lan Mu, Tianming Liu, Gengchen Mai

专题命中 视觉问答 :visual question answering(abstract);分类 cs.CV、cs.AI

Comments 110 Pages; 61 Figures

详情

展开后加载摘要…

URL PDF HTML 收藏