arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

视觉大模型 / VLM

视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。

共收录 26117 信号源:cs.CV, cs.AI, cs.LG

1. 视觉推理 4478 篇

2404.12065 2024-07-15 cs.CL cs.AI cs.CY cs.ET cs.MA 79%

RAGAR, Your Falsehood Radar: RAG-Augmented Reasoning for Political Fact-Checking using Multimodal Large Language Models

M. Abdul Khaliq, P. Chang, M. Ma, B. Pflugfelder, F. Miletić

专题命中 视觉推理 :multimodal large language model(title,abstract);分类 cs.AI

Comments 8 pages, submitted to ACL Rolling Review June 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2403.10854 2024-07-12 cs.CV 79%

A Comprehensive Study of Multimodal Large Language Models for Image Quality Assessment

Tianhe Wu, Kede Ma, Jie Liang, Yujiu Yang, Lei Zhang

专题命中 视觉推理 :multimodal large language model(title,abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.19131 2024-06-28 cs.CV 79%

CELLO: Causal Evaluation of Large Vision-Language Models

Meiqi Chen, Bo Peng, Yan Zhang, Chaochao Lu

专题命中 视觉推理 :vision-language model(title,abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2402.12289 2024-06-26 cs.CV 79%

DriveVLM: The Convergence of Autonomous Driving and Large Vision-Language Models

Xiaoyu Tian, Junru Gu, Bailin Li, Yicheng Liu, Yang Wang, Zhiyong Zhao, Kun Zhan, Peng Jia, Xianpeng Lang, Hang Zhao

专题命中 视觉推理 :vision-language model(title,abstract);分类 cs.CV

Comments Project Page: https://tsinghua-mars-lab.github.io/DriveVLM/

详情

展开后加载摘要…

URL PDF HTML 收藏
2312.06722 2024-06-12 cs.CV cs.CL cs.RO 79%

EgoPlan-Bench: Benchmarking Multimodal Large Language Models for Human-Level Planning

Yi Chen, Yuying Ge, Yixiao Ge, Mingyu Ding, Bohao Li, Rui Wang, Ruifeng Xu, Ying Shan, Xihui Liu

专题命中 视觉推理 :multimodal large language model(title,abstract);分类 cs.CV

Comments Project released at: https://github.com/ChenYi99/EgoPlan

详情

展开后加载摘要…

URL PDF HTML 收藏
2405.17201 2024-05-28 cs.CV 79%

Diagnosing the Compositional Knowledge of Vision Language Models from a Game-Theoretic View

Jin Wang, Shichao Dong, Yapeng Zhu, Kelu Yao, Weidong Zhao, Chao Li, Ping Luo

专题命中 视觉推理 :vision language model(title,abstract);分类 cs.CV

Comments 21 pages, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2405.13751 2024-05-24 cs.RO cs.AI 79%

GameVLM: A Decision-making Framework for Robotic Task Planning Based on Visual Language Models and Zero-sum Games

Aoran Mei, Jianhua Wang, Guo-Niu Zhu, Zhongxue Gan

专题命中 视觉推理 :visual language model(title);VLM(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2404.00906 2024-04-25 cs.CV 79%

From Pixels to Graphs: Open-Vocabulary Scene Graph Generation with Vision-Language Models

Rongjie Li, Songyang Zhang, Dahua Lin, Kai Chen, Xuming He

专题命中 视觉推理 :vision-language model(title);VLM(abstract);分类 cs.CV

Comments Accepted by CVPR 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2404.07031 2024-04-11 cs.CV 79%

ORacle: Large Vision-Language Models for Knowledge-Guided Holistic OR Domain Modeling

Ege Özsoy, Chantal Pellegrini, Matthias Keicher, Nassir Navab

专题命中 视觉推理 :vision-language model(title,abstract);分类 cs.CV

Comments 11 pages, 3 figures, 7 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2403.12801 2024-03-20 cs.CV 79%

RelationVLM: Making Large Vision-Language Models Understand Visual Relations

Zhipeng Huang, Zhizheng Zhang, Zheng-Jun Zha, Yan Lu, Baining Guo

专题命中 视觉推理 :vision-language model(title,abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2403.10378 2024-03-18 cs.CL cs.CV 79%

EXAMS-V: A Multi-Discipline Multilingual Multimodal Exam Benchmark for Evaluating Vision Language Models

Rocktim Jyoti Das, Simeon Emilov Hristov, Haonan Li, Dimitar Iliyanov Dimitrov, Ivan Koychev, Preslav Nakov

专题命中 视觉推理 :vision language model(title,abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2403.06059 2024-03-12 cs.CV 79%

Test-time Distribution Learning Adapter for Cross-modal Visual Reasoning

Yi Zhang, Ce Zhang

专题命中 视觉推理 :visual reasoning(title,abstract);分类 cs.CV

Comments Accepted by ICASSP 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2403.02330 2024-03-05 cs.CV 79%

RegionGPT: Towards Region Understanding Vision Language Model

Qiushan Guo, Shalini De Mello, Hongxu Yin, Wonmin Byeon, Ka Chun Cheung, Yizhou Yu, Ping Luo, Sifei Liu

专题命中 视觉推理 :vision language model(title,abstract);分类 cs.CV

Comments Accepted by CVPR 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2402.02205 2024-02-08 cs.CV 79%

GPT-4V as Traffic Assistant: An In-depth Look at Vision Language Model on Complex Traffic Events

Xingcheng Zhou, Alois C. Knoll

专题命中 视觉推理 :vision language model(title);vision-language model(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2311.14580 2023-11-27 cs.CV 79%

Large Language Models as Automated Aligners for benchmarking Vision-Language Models

Yuanfeng Ji, Chongjian Ge, Weikai Kong, Enze Xie, Zhengying Liu, Zhengguo Li, Ping Luo

专题命中 视觉推理 :vision-language model(title,abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2306.02500 2023-11-14 cs.CV 79%

Systematic Visual Reasoning through Object-Centric Relational Abstraction

Taylor W. Webb, Shanka Subhra Mondal, Jonathan D. Cohen

专题命中 视觉推理 :visual reasoning(title,abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2310.13473 2023-10-23 cs.CV 79%

Benchmarking Sequential Visual Input Reasoning and Prediction in Multimodal Large Language Models

Mingwei Zhu, Leigang Sha, Yu Shu, Kangjia Zhao, Tiancheng Zhao, Jianwei Yin

专题命中 视觉推理 :multimodal large language model(title,abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2310.02569 2023-10-18 cs.CV 79%

ReForm-Eval: Evaluating Large Vision Language Models via Unified Re-Formulation of Task-Oriented Benchmarks

Zejun Li, Ye Wang, Mengfei Du, Qingwen Liu, Binhao Wu, Jiwen Zhang, Chengxing Zhou, Zhihao Fan, Jie Fu, Jingjing Chen, Xuanjing Huang, Zhongyu Wei

专题命中 视觉推理 :vision language model(title);vision-language model(abstract);分类 cs.CV

Comments 38 pages, 11 figures, 24 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2309.01155 2023-09-25 cs.CV 79%

LoGoPrompt: Synthetic Text Images Can Be Good Visual Prompts for Vision-Language Models

Cheng Shi, Sibei Yang

专题命中 视觉推理 :vision-language model(title,abstract);分类 cs.CV

Comments ICCV 2023; Project Page:https://chengshiest.github.io/logo

详情

展开后加载摘要…

URL PDF HTML 收藏
2308.16890 2023-09-06 cs.CV cs.CL 79%

TouchStone: Evaluating Vision-Language Models by Language Models

Shuai Bai, Shusheng Yang, Jinze Bai, Peng Wang, Xingxuan Zhang, Junyang Lin, Xinggang Wang, Chang Zhou, Jingren Zhou

专题命中 视觉推理 :vision-language model(title,abstract);分类 cs.CV

Comments https://github.com/OFA-Sys/TouchStone

详情

展开后加载摘要…

URL PDF HTML 收藏
2212.00259 2023-06-02 cs.CV cs.CL 79%

Super-CLEVR: A Virtual Benchmark to Diagnose Domain Robustness in Visual Reasoning

Zhuowan Li, Xingrui Wang, Elias Stengel-Eskin, Adam Kortylewski, Wufei Ma, Benjamin Van Durme, Alan Yuille

专题命中 视觉推理 :visual reasoning(title);visual question answering(abstract);分类 cs.CV

Comments Published in CVPR 2023 as Highlight. Data and code are released at https://github.com/Lizw14/Super-CLEVR

详情

展开后加载摘要…

URL PDF HTML 收藏
2305.18373 2023-05-31 cs.CV cs.CL 79%

KAFA: Rethinking Image Ad Understanding with Knowledge-Augmented Feature Adaptation of Vision-Language Models

Zhiwei Jia, Pradyumna Narayana, Arjun R. Akula, Garima Pruthi, Hao Su, Sugato Basu, Varun Jampani

专题命中 视觉推理 :vision-language model(title,abstract);分类 cs.CV

Comments ACL 2023

详情

展开后加载摘要…

URL PDF HTML 收藏
2304.03318 2023-04-10 cs.HC cs.AI 79%

Explainable AI And Visual Reasoning: Insights From Radiology

Robert Kaufman, David Kirsh

专题命中 视觉推理 :visual reasoning(title);grounding(abstract);分类 cs.AI

Comments Accepted to 2023 Conference on Computer-Human Interaction (CHI) Human-Centered Explainable AI Workshop, 8 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2212.13296 2023-01-02 cs.CV 79%

VQA and Visual Reasoning: An Overview of Recent Datasets, Methods and Challenges

Rufai Yusuf Zakari, Jim Wilson Owusu, Hailin Wang, Ke Qin, Zaharaddeen Karami Lawal, Yuezhou Dong

专题命中 视觉推理 :visual reasoning(title,abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2212.06971 2022-12-15 cs.CV cs.CL 79%

Find Someone Who: Visual Commonsense Understanding in Human-Centric Grounding

Haoxuan You, Rui Sun, Zhecan Wang, Kai-Wei Chang, Shih-Fu Chang

专题命中 视觉推理 :grounding(title,abstract);分类 cs.CV

Comments 11 pages, 7 figures. EMNLP 2022-findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2207.11514 2022-12-07 cs.CV cs.RO 79%

Semantic Abstraction: Open-World 3D Scene Understanding from 2D Vision-Language Models

Huy Ha, Shuran Song

专题命中 视觉推理 :vision-language model(title,abstract);分类 cs.CV

Comments 16 pages, 9 figures, project website at https://semantic-abstraction.cs.columbia.edu/

详情

展开后加载摘要…

URL PDF HTML 收藏
2211.00262 2022-11-02 cs.CL cs.CV 79%

Training Vision-Language Models with Less Bimodal Supervision

Elad Segal, Ben Bogin, Jonathan Berant

专题命中 视觉推理 :vision-language model(title,abstract);分类 cs.CV

Comments AKBC 2022

详情

展开后加载摘要…

URL PDF HTML 收藏
2206.09265 2022-06-23 cs.CV 79%

SAViR-T: Spatially Attentive Visual Reasoning with Transformers

Pritish Sahu, Kalliopi Basioti, Vladimir Pavlovic

专题命中 视觉推理 :visual reasoning(title,abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2205.03075 2022-05-09 cs.CV cs.CL 79%

QLEVR: A Diagnostic Dataset for Quantificational Language and Elementary Visual Reasoning

Zechen Li, Anders Søgaard

专题命中 视觉推理 :visual reasoning(title,abstract);分类 cs.CV

Comments To appear at Findings of NAACL 2022

详情

展开后加载摘要…

URL PDF HTML 收藏
2204.02380 2022-04-06 cs.CV cs.CL 79%

CLEVR-X: A Visual Reasoning Dataset for Natural Language Explanations

Leonard Salewski, A. Sophia Koepke, Hendrik P. A. Lensch, Zeynep Akata

专题命中 视觉推理 :visual reasoning(title);visual question answering(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏