arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视觉大模型 / VLM

视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。

共收录 26117 信号源:cs.CV, cs.AI, cs.LG

1. 视觉问答 3132 篇

2407.00252 2024-07-02 cs.CV cs.ET 57%

Assistive Image Annotation Systems with Deep Learning and Natural Language Capabilities: A Review

Moseli Mots'oehli

专题命中 视觉问答 :visual question answering(abstract);分类 cs.CV

Comments Accepted IEEE ETNCC 2024, 9 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.00980 2024-06-04 cs.CL cs.CV 57%

Selectively Answering Visual Questions

Julian Martin Eisenschlos, Hernán Maina, Guido Ivetta, Luciana Benotti

专题命中 视觉问答 :visual question answering(abstract);分类 cs.CV

Comments To be published in the findings of the 2024 Annual Meeting of the Association for Computational Linguistics

详情

展开后加载摘要…

URL PDF HTML 收藏
2405.19794 2024-05-31 cs.CV 57%

Video Question Answering for People with Visual Impairments Using an Egocentric 360-Degree Camera

Inpyo Song, Minjun Joo, Joonhyung Kwon, Jangwon Lee

专题命中 视觉问答 :visual question answering(abstract);分类 cs.CV

Comments CVPR2024 EgoVis Workshop

详情

展开后加载摘要…

URL PDF HTML 收藏
2311.17005 2024-05-24 cs.CV 57%

MVBench: A Comprehensive Multi-modal Video Understanding Benchmark

Kunchang Li, Yali Wang, Yinan He, Yizhuo Li, Yi Wang, Yi Liu, Zun Wang, Jilan Xu, Guo Chen, Ping Luo, Limin Wang, Yu Qiao

专题命中 视觉问答 :MLLM(abstract);分类 cs.CV

Comments CVPR 2024 highlight: updated version with Mistral and better performances for MVBench/NExT-QA/STAR/TVQA/EgoSchema/IntentQA

详情

展开后加载摘要…

URL PDF HTML 收藏
2405.02750 2024-05-07 cs.CL cs.AI 57%

Enhancing Contextual Understanding in Large Language Models through Contrastive Decoding

Zheng Zhao, Emilio Monti, Jens Lehmann, Haytham Assem

专题命中 视觉问答 :grounding(abstract);分类 cs.AI

Comments Accepted to NAACL 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2404.17176 2024-04-29 cs.CV 57%

MovieChat+: Question-aware Sparse Memory for Long Video Question Answering

Enxin Song, Wenhao Chai, Tian Ye, Jenq-Neng Hwang, Xi Li, Gaoang Wang

专题命中 视觉问答 :grounding(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2404.08704 2024-04-16 cs.CL cs.AI 57%

MM-PhyQA: Multimodal Physics Question-Answering With Multi-Image CoT Prompting

Avinash Anand, Janak Kapuriya, Apoorv Singh, Jay Saraf, Naman Lal, Astha Verma, Rushali Gupta, Rajiv Shah

专题命中 视觉问答 :LLaVA(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2312.10908 2024-04-11 cs.CV 57%

CLOVA: A Closed-Loop Visual Assistant with Tool Usage and Update

Zhi Gao, Yuntao Du, Xintong Zhang, Xiaojian Ma, Wenjuan Han, Song-Chun Zhu, Qing Li

专题命中 视觉问答 :visual question answering(abstract);分类 cs.CV

Comments CVPR 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2403.08092 2024-04-11 cs.CV 57%

Mitigating the Impact of Attribute Editing on Face Recognition

Sudipta Banerjee, Sai Pranaswi Mullangi, Shruti Wagle, Chinmay Hegde, Nasir Memon

专题命中 视觉问答 :LLaVA(abstract);分类 cs.CV

Comments Under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2404.04538 2024-04-09 cs.AI cs.CL 57%

Soft-Prompting with Graph-of-Thought for Multi-modal Representation Learning

Juncheng Yang, Zuchao Li, Shuai Xie, Wei Yu, Shijun Li, Bo Du

专题命中 视觉问答 :visual question answering(abstract);分类 cs.AI

Comments This paper is accepted to LREC-COLING 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2404.04627 2024-04-09 cs.CV 57%

Self-Training Large Language Models for Improved Visual Program Synthesis With Visual Reinforcement

Zaid Khan, Vijay Kumar BG, Samuel Schulter, Yun Fu, Manmohan Chandraker

专题命中 视觉问答 :visual question answering(abstract);分类 cs.CV

Comments CVPR 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2403.11487 2024-04-03 cs.RO cs.AI 57%

Can LLMs Generate Human-Like Wayfinding Instructions? Towards Platform-Agnostic Embodied Instruction Synthesis

Vishnu Sashank Dorbala, Sanjoy Chowdhury, Dinesh Manocha

专题命中 视觉问答 :visual question answering(abstract);分类 cs.AI

Comments 14 Pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2312.06505 2024-04-02 cs.CV 57%

Grounded Question-Answering in Long Egocentric Videos

Shangzhe Di, Weidi Xie

专题命中 视觉问答 :grounding(abstract);分类 cs.CV

Comments Accepted to CVPR 2024. Project website at https://dszdsz.cn/GroundVQA

详情

展开后加载摘要…

URL PDF HTML 收藏
2205.14444 2024-04-01 cs.CV 57%

Visual Superordinate Abstraction for Robust Concept Learning

Qi Zheng, Chaoyue Wang, Dadong Wang, Dacheng Tao

专题命中 视觉问答 :visual question answering(abstract);分类 cs.CV

Comments 14 pages, 11 figures

Journal ref Machine Intelligence Research vol. 20, no. 1, pp. 79-91, 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2403.16385 2024-03-29 cs.CV cs.CL 57%

Synthesize Step-by-Step: Tools, Templates and LLMs as Data Generators for Reasoning-Based Chart VQA

Zhuowan Li, Bhavan Jasani, Peng Tang, Shabnam Ghadar

专题命中 视觉问答 :visual question answering(abstract);分类 cs.CV

Comments Accepted to CVPR 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2312.01629 2024-03-28 cs.CV 57%

CLAMP: Contrastive LAnguage Model Prompt-tuning

Piotr Teterwak, Ximeng Sun, Bryan A. Plummer, Kate Saenko, Ser-Nam Lim

专题命中 视觉问答 :visual question answering(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2308.10185 2024-03-27 cs.CV 57%

ViT-Lens: Initiating Omni-Modal Exploration through 3D Insights

Weixian Lei, Yixiao Ge, Jianfeng Zhang, Dylan Sun, Kun Yi, Ying Shan, Mike Zheng Shou

专题命中 视觉问答 :vision-language model(abstract);分类 cs.CV

Comments 19 pages, 4 figures and 9 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2403.13499 2024-03-21 cs.CV 57%

Improved Baselines for Data-efficient Perceptual Augmentation of LLMs

Théophane Vallaeys, Mustafa Shukor, Matthieu Cord, Jakob Verbeek

专题命中 视觉问答 :visual question answering(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2403.11317 2024-03-19 cs.CL cs.CV 57%

Few-Shot VQA with Frozen LLMs: A Tale of Two Approaches

Igor Sterner, Weizhe Lin, Jinghong Chen, Bill Byrne

专题命中 视觉问答 :visual question answering(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2401.03411 2024-03-19 cs.CL cs.CV 57%

GRAM: Global Reasoning for Multi-Page VQA

Tsachi Blau, Sharon Fogel, Roi Ronen, Alona Golts, Roy Ganz, Elad Ben Avraham, Aviad Aberdam, Shahar Tsiper, Ron Litman

专题命中 视觉问答 :visual question answering(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2403.10037 2024-03-18 cs.CV 57%

Knowledge Condensation and Reasoning for Knowledge-based VQA

Dongze Hao, Jian Jia, Longteng Guo, Qunbo Wang, Te Yang, Yan Li, Yanhua Cheng, Bo Wang, Quan Chen, Han Li, Jing Liu

专题命中 视觉问答 :visual question answering(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2403.09027 2024-03-15 cs.CV 57%

VisionGPT: Vision-Language Understanding Agent Using Generalized Multimodal Framework

Chris Kelly, Luhui Hu, Bang Yang, Yu Tian, Deshun Yang, Cindy Yang, Zaoshan Huang, Zihao Li, Jiayin Hu, Yuexian Zou

专题命中 视觉问答 :visual question answering(abstract);分类 cs.CV

Comments 17 pages, 5 figures, and 1 table. arXiv admin note: substantial text overlap with arXiv:2311.10125

详情

展开后加载摘要…

URL PDF HTML 收藏
2403.07874 2024-03-13 cs.CV 57%

Beyond Text: Frozen Large Language Models in Visual Signal Comprehension

Lei Zhu, Fangyun Wei, Yanye Lu

专题命中 视觉问答 :visual question answering(abstract);分类 cs.CV

Comments Accepted by CVPR 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2403.06679 2024-03-12 cs.CV 57%

Answering Diverse Questions via Text Attached with Key Audio-Visual Clues

Qilang Ye, Zitong Yu, Xin Liu

专题命中 视觉问答 :visual question answering(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2306.08173 2024-03-04 cs.LG cs.CR cs.IT math.IT stat.ML 57%

Safeguarding Data in Multimodal AI: A Differentially Private Approach to CLIP Training

Alyssa Huang, Peihan Liu, Ryumei Nakada, Linjun Zhang, Wanrong Zhang

专题命中 视觉问答 :visual question answering(abstract);分类 cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2402.13288 2024-02-22 cs.DB cs.AI 57%

Training Table Question Answering via SQL Query Decomposition

Raphaël Mouravieff, Benjamin Piwowarski, Sylvain Lamprier

专题命中 视觉问答 :grounding(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2402.07220 2024-02-21 eess.IV cs.CV 57%

KVQ: Kwai Video Quality Assessment for Short-form Videos

Yiting Lu, Xin Li, Yajing Pei, Kun Yuan, Qizhi Xie, Yunpeng Qu, Ming Sun, Chao Zhou, Zhibo Chen

专题命中 视觉问答 :vision language model(abstract);分类 cs.CV

Comments 19 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2305.17369 2024-01-25 cs.CV cs.MM 57%

Modularized Zero-shot VQA with Pre-trained Models

Rui Cao, Jing Jiang

专题命中 视觉问答 :visual question answering(abstract);分类 cs.CV

Comments accepted as Findings in ACL 2023; Code available: https://github.com/abril4416/Mod-Zero-VQA

详情

展开后加载摘要…

URL PDF HTML 收藏
2401.09883 2024-01-19 cs.CV 57%

Question-Answer Cross Language Image Matching for Weakly Supervised Semantic Segmentation

Songhe Deng, Wei Zhuo, Jinheng Xie, Linlin Shen

专题命中 视觉问答 :visual question answering(abstract);分类 cs.CV

Comments ACM MM 2023

详情

展开后加载摘要…

URL PDF HTML 收藏
2401.08660 2024-01-18 cs.AI cs.CL 57%

Gemini Pro Defeated by GPT-4V: Evidence from Education

Gyeong-Geon Lee, Ehsan Latif, Lehong Shi, Xiaoming Zhai

专题命中 视觉问答 :visual question answering(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏