arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视觉大模型 / VLM

视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。

共收录 3129 信号源:cs.CV, cs.AI, cs.LG

1. 视觉问答 3129 篇

2311.17005 2024-05-24 cs.CV 57%

MVBench: A Comprehensive Multi-modal Video Understanding Benchmark

Kunchang Li, Yali Wang, Yinan He, Yizhuo Li, Yi Wang, Yi Liu, Zun Wang, Jilan Xu, Guo Chen, Ping Luo, Limin Wang, Yu Qiao

专题命中 视觉问答 :MLLM(abstract);分类 cs.CV

Comments CVPR 2024 highlight: updated version with Mistral and better performances for MVBench/NExT-QA/STAR/TVQA/EgoSchema/IntentQA

详情

展开后加载摘要…

URL PDF HTML 收藏
2405.02750 2024-05-07 cs.CL cs.AI 57%

Enhancing Contextual Understanding in Large Language Models through Contrastive Decoding

Zheng Zhao, Emilio Monti, Jens Lehmann, Haytham Assem

专题命中 视觉问答 :grounding(abstract);分类 cs.AI

Comments Accepted to NAACL 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2404.17176 2024-04-29 cs.CV 57%

MovieChat+: Question-aware Sparse Memory for Long Video Question Answering

Enxin Song, Wenhao Chai, Tian Ye, Jenq-Neng Hwang, Xi Li, Gaoang Wang

专题命中 视觉问答 :grounding(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2404.08704 2024-04-16 cs.CL cs.AI 57%

MM-PhyQA: Multimodal Physics Question-Answering With Multi-Image CoT Prompting

Avinash Anand, Janak Kapuriya, Apoorv Singh, Jay Saraf, Naman Lal, Astha Verma, Rushali Gupta, Rajiv Shah

专题命中 视觉问答 :LLaVA(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2312.10908 2024-04-11 cs.CV 57%

CLOVA: A Closed-Loop Visual Assistant with Tool Usage and Update

Zhi Gao, Yuntao Du, Xintong Zhang, Xiaojian Ma, Wenjuan Han, Song-Chun Zhu, Qing Li

专题命中 视觉问答 :visual question answering(abstract);分类 cs.CV

Comments CVPR 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2403.08092 2024-04-11 cs.CV 57%

Mitigating the Impact of Attribute Editing on Face Recognition

Sudipta Banerjee, Sai Pranaswi Mullangi, Shruti Wagle, Chinmay Hegde, Nasir Memon

专题命中 视觉问答 :LLaVA(abstract);分类 cs.CV

Comments Under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2404.04538 2024-04-09 cs.AI cs.CL 57%

Soft-Prompting with Graph-of-Thought for Multi-modal Representation Learning

Juncheng Yang, Zuchao Li, Shuai Xie, Wei Yu, Shijun Li, Bo Du

专题命中 视觉问答 :visual question answering(abstract);分类 cs.AI

Comments This paper is accepted to LREC-COLING 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2404.04627 2024-04-09 cs.CV 57%

Self-Training Large Language Models for Improved Visual Program Synthesis With Visual Reinforcement

Zaid Khan, Vijay Kumar BG, Samuel Schulter, Yun Fu, Manmohan Chandraker

专题命中 视觉问答 :visual question answering(abstract);分类 cs.CV

Comments CVPR 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2403.11487 2024-04-03 cs.RO cs.AI 57%

Can LLMs Generate Human-Like Wayfinding Instructions? Towards Platform-Agnostic Embodied Instruction Synthesis

Vishnu Sashank Dorbala, Sanjoy Chowdhury, Dinesh Manocha

专题命中 视觉问答 :visual question answering(abstract);分类 cs.AI

Comments 14 Pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2312.06505 2024-04-02 cs.CV 57%

Grounded Question-Answering in Long Egocentric Videos

Shangzhe Di, Weidi Xie

专题命中 视觉问答 :grounding(abstract);分类 cs.CV

Comments Accepted to CVPR 2024. Project website at https://dszdsz.cn/GroundVQA

详情

展开后加载摘要…

URL PDF HTML 收藏
2205.14444 2024-04-01 cs.CV 57%

Visual Superordinate Abstraction for Robust Concept Learning

Qi Zheng, Chaoyue Wang, Dadong Wang, Dacheng Tao

专题命中 视觉问答 :visual question answering(abstract);分类 cs.CV

Comments 14 pages, 11 figures

Journal ref Machine Intelligence Research vol. 20, no. 1, pp. 79-91, 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2403.16385 2024-03-29 cs.CV cs.CL 57%

Synthesize Step-by-Step: Tools, Templates and LLMs as Data Generators for Reasoning-Based Chart VQA

Zhuowan Li, Bhavan Jasani, Peng Tang, Shabnam Ghadar

专题命中 视觉问答 :visual question answering(abstract);分类 cs.CV

Comments Accepted to CVPR 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2312.01629 2024-03-28 cs.CV 57%

CLAMP: Contrastive LAnguage Model Prompt-tuning

Piotr Teterwak, Ximeng Sun, Bryan A. Plummer, Kate Saenko, Ser-Nam Lim

专题命中 视觉问答 :visual question answering(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2308.10185 2024-03-27 cs.CV 57%

ViT-Lens: Initiating Omni-Modal Exploration through 3D Insights

Weixian Lei, Yixiao Ge, Jianfeng Zhang, Dylan Sun, Kun Yi, Ying Shan, Mike Zheng Shou

专题命中 视觉问答 :vision-language model(abstract);分类 cs.CV

Comments 19 pages, 4 figures and 9 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2403.13499 2024-03-21 cs.CV 57%

Improved Baselines for Data-efficient Perceptual Augmentation of LLMs

Théophane Vallaeys, Mustafa Shukor, Matthieu Cord, Jakob Verbeek

专题命中 视觉问答 :visual question answering(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2403.11317 2024-03-19 cs.CL cs.CV 57%

Few-Shot VQA with Frozen LLMs: A Tale of Two Approaches

Igor Sterner, Weizhe Lin, Jinghong Chen, Bill Byrne

专题命中 视觉问答 :visual question answering(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2401.03411 2024-03-19 cs.CL cs.CV 57%

GRAM: Global Reasoning for Multi-Page VQA

Tsachi Blau, Sharon Fogel, Roi Ronen, Alona Golts, Roy Ganz, Elad Ben Avraham, Aviad Aberdam, Shahar Tsiper, Ron Litman

专题命中 视觉问答 :visual question answering(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2403.10037 2024-03-18 cs.CV 57%

Knowledge Condensation and Reasoning for Knowledge-based VQA

Dongze Hao, Jian Jia, Longteng Guo, Qunbo Wang, Te Yang, Yan Li, Yanhua Cheng, Bo Wang, Quan Chen, Han Li, Jing Liu

专题命中 视觉问答 :visual question answering(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2403.09027 2024-03-15 cs.CV 57%

VisionGPT: Vision-Language Understanding Agent Using Generalized Multimodal Framework

Chris Kelly, Luhui Hu, Bang Yang, Yu Tian, Deshun Yang, Cindy Yang, Zaoshan Huang, Zihao Li, Jiayin Hu, Yuexian Zou

专题命中 视觉问答 :visual question answering(abstract);分类 cs.CV

Comments 17 pages, 5 figures, and 1 table. arXiv admin note: substantial text overlap with arXiv:2311.10125

详情

展开后加载摘要…

URL PDF HTML 收藏
2403.07874 2024-03-13 cs.CV 57%

Beyond Text: Frozen Large Language Models in Visual Signal Comprehension

Lei Zhu, Fangyun Wei, Yanye Lu

专题命中 视觉问答 :visual question answering(abstract);分类 cs.CV

Comments Accepted by CVPR 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2403.06679 2024-03-12 cs.CV 57%

Answering Diverse Questions via Text Attached with Key Audio-Visual Clues

Qilang Ye, Zitong Yu, Xin Liu

专题命中 视觉问答 :visual question answering(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2306.08173 2024-03-04 cs.LG cs.CR cs.IT math.IT stat.ML 57%

Safeguarding Data in Multimodal AI: A Differentially Private Approach to CLIP Training

Alyssa Huang, Peihan Liu, Ryumei Nakada, Linjun Zhang, Wanrong Zhang

专题命中 视觉问答 :visual question answering(abstract);分类 cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2402.13288 2024-02-22 cs.DB cs.AI 57%

Training Table Question Answering via SQL Query Decomposition

Raphaël Mouravieff, Benjamin Piwowarski, Sylvain Lamprier

专题命中 视觉问答 :grounding(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2402.07220 2024-02-21 eess.IV cs.CV 57%

KVQ: Kwai Video Quality Assessment for Short-form Videos

Yiting Lu, Xin Li, Yajing Pei, Kun Yuan, Qizhi Xie, Yunpeng Qu, Ming Sun, Chao Zhou, Zhibo Chen

专题命中 视觉问答 :vision language model(abstract);分类 cs.CV

Comments 19 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2305.17369 2024-01-25 cs.CV cs.MM 57%

Modularized Zero-shot VQA with Pre-trained Models

Rui Cao, Jing Jiang

专题命中 视觉问答 :visual question answering(abstract);分类 cs.CV

Comments accepted as Findings in ACL 2023; Code available: https://github.com/abril4416/Mod-Zero-VQA

详情

展开后加载摘要…

URL PDF HTML 收藏
2401.09883 2024-01-19 cs.CV 57%

Question-Answer Cross Language Image Matching for Weakly Supervised Semantic Segmentation

Songhe Deng, Wei Zhuo, Jinheng Xie, Linlin Shen

专题命中 视觉问答 :visual question answering(abstract);分类 cs.CV

Comments ACM MM 2023

详情

展开后加载摘要…

URL PDF HTML 收藏
2401.08660 2024-01-18 cs.AI cs.CL 57%

Gemini Pro Defeated by GPT-4V: Evidence from Education

Gyeong-Geon Lee, Ehsan Latif, Lehong Shi, Xiaoming Zhai

专题命中 视觉问答 :visual question answering(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2106.06147 2024-01-15 cs.CL cs.LG cs.SD eess.AS 57%

NAAQA: A Neural Architecture for Acoustic Question Answering

Jerome Abdelnour, Jean Rouat, Giampiero Salvi

专题命中 视觉问答 :visual question answering(abstract);分类 cs.LG

Comments Submitted to IEEE Transactions on Pattern Analysis and Machine Intelligence (PAMI) in April 2021 (first revision February 2022)

Journal ref IEEE Transactions on Pattern Analysis and Machine Intelligence, 2023, Volume: 45 Issue: 4, Page(s): 4997-5009

详情

展开后加载摘要…

URL PDF HTML 收藏
2401.01529 2024-01-04 cs.CV 57%

Glance and Focus: Memory Prompting for Multi-Event Video Question Answering

Ziyi Bai, Ruiping Wang, Xilin Chen

专题命中 视觉问答 :vision language model(abstract);分类 cs.CV

Comments Accepted in NeurIPS 2023

详情

展开后加载摘要…

URL PDF HTML 收藏
2401.00988 2024-01-03 cs.CV 57%

Holistic Autonomous Driving Understanding by Bird's-Eye-View Injected Multi-Modal Large Models

Xinpeng Ding, Jinahua Han, Hang Xu, Xiaodan Liang, Wei Zhang, Xiaomeng Li

专题命中 视觉问答 :multimodal large language model(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏