arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视觉大模型 / VLM

视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。

共收录 1565 信号源:cs.CV, cs.AI, cs.LG

1. 其他VLM 1565 篇

2402.13607 2024-06-06 cs.CV cs.CL 79%

CODIS: Benchmarking Context-Dependent Visual Comprehension for Multimodal Large Language Models

Fuwen Luo, Chi Chen, Zihao Wan, Zhaolu Kang, Qidong Yan, Yingjie Li, Xiaolong Wang, Siyu Wang, Ziyue Wang, Xiaoyue Mi, Peng Li, Ning Ma, Maosong Sun, Yang Liu

专题命中 其他VLM :multimodal large language model(title,abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2401.07529 2024-06-04 cs.CV cs.CL 79%

MM-SAP: A Comprehensive Benchmark for Assessing Self-Awareness of Multimodal Large Language Models in Perception

Yuhao Wang, Yusheng Liao, Heyang Liu, Hongcheng Liu, Yu Wang, Yanfeng Wang

专题命中 其他VLM :multimodal large language model(title,abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2405.11301 2024-05-21 cs.CL cs.CV 79%

Enhancing Fine-Grained Image Classifications via Cascaded Vision Language Models

Canshi Wei

专题命中 其他VLM :vision language model(title);vision-language model(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2405.02266 2024-05-06 cs.CV 79%

On the test-time zero-shot generalization of vision-language models: Do we really need prompt learning?

Maxime Zanella, Ismail Ben Ayed

专题命中 其他VLM :vision-language model(title,abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2404.17534 2024-04-29 cs.CV cs.MM 79%

Exploring the Distinctiveness and Fidelity of the Descriptions Generated by Large Vision-Language Models

Yuhang Huang, Zihan Wu, Chongyang Gao, Jiawei Peng, Xu Yang

专题命中 其他VLM :vision-language model(title,abstract);分类 cs.CV

Comments 11 pages, 9 figures, 6 tables. For associated code, see https://anonymous.4open.science/r/Explore_FGVDs-E277

详情

展开后加载摘要…

URL PDF HTML 收藏
2404.09732 2024-04-16 cs.CV 79%

Photo-Realistic Image Restoration in the Wild with Controlled Vision-Language Models

Ziwei Luo, Fredrik K. Gustafsson, Zheng Zhao, Jens Sjölund, Thomas B. Schön

专题命中 其他VLM :vision-language model(title,abstract);分类 cs.CV

Comments CVPRW 2024; Code: https://github.com/Algolzw/daclip-uir

详情

展开后加载摘要…

URL PDF HTML 收藏
2404.06512 2024-04-10 cs.CV cs.CL 79%

InternLM-XComposer2-4KHD: A Pioneering Large Vision-Language Model Handling Resolutions from 336 Pixels to 4K HD

Xiaoyi Dong, Pan Zhang, Yuhang Zang, Yuhang Cao, Bin Wang, Linke Ouyang, Songyang Zhang, Haodong Duan, Wenwei Zhang, Yining Li, Hang Yan, Yang Gao, Zhe Chen, Xinyue Zhang, Wei Li, Jingwen Li, Wenhai Wang, Kai Chen, Conghui He, Xingcheng Zhang, Jifeng Dai, Yu Qiao, Dahua Lin, Jiaqi Wang

专题命中 其他VLM :vision-language model(title,abstract);分类 cs.CV

Comments Code and models are publicly available at https://github.com/InternLM/InternLM-XComposer

详情

展开后加载摘要…

URL PDF HTML 收藏
2403.20330 2024-04-10 cs.CV 79%

Are We on the Right Way for Evaluating Large Vision-Language Models?

Lin Chen, Jinsong Li, Xiaoyi Dong, Pan Zhang, Yuhang Zang, Zehui Chen, Haodong Duan, Jiaqi Wang, Yu Qiao, Dahua Lin, Feng Zhao

专题命中 其他VLM :vision-language model(title,abstract);分类 cs.CV

Comments Project page: https://mmstar-benchmark.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2404.01911 2024-04-03 cs.CV 79%

VLRM: Vision-Language Models act as Reward Models for Image Captioning

Maksim Dzabraev, Alexander Kunitsyn, Andrei Ivaniuta

专题命中 其他VLM :vision-language model(title,abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2205.11100 2024-03-26 cs.CV 79%

Supporting Vision-Language Model Inference with Confounder-pruning Knowledge Prompt

Jiangmeng Li, Wenyi Mo, Wenwen Qiang, Bing Su, Changwen Zheng, Hui Xiong, Ji-Rong Wen

专题命中 其他VLM :vision-language model(title,abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2311.11178 2024-03-22 cs.CV 79%

Active Prompt Learning in Vision Language Models

Jihwan Bang, Sumyeong Ahn, Jae-Gil Lee

专题命中 其他VLM :vision language model(title,abstract);分类 cs.CV

Comments accepted at CVPR 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2403.11450 2024-03-19 cs.CV 79%

Zero-shot Compound Expression Recognition with Visual Language Model at the 6th ABAW Challenge

Jiahe Wang, Jiale Huang, Bingzhao Cai, Yifan Cao, Xin Yun, Shangfei Wang

专题命中 其他VLM :visual language model(title,abstract);分类 cs.CV

Comments USTC-AC's paper for Compound Expression (CE) Recognition Challenge in 6th Workshop and Competition on Affective Behavior Analysis in-the-wild (ABAW)

详情

展开后加载摘要…

URL PDF HTML 收藏
2311.14339 2024-03-07 cs.CV 79%

Towards Concept-based Interpretability of Skin Lesion Diagnosis using Vision-Language Models

Cristiano Patrício, Luís F. Teixeira, João C. Neves

专题命中 其他VLM :vision-language model(title,abstract);分类 cs.CV

Comments Accepted for publication in IEEE ISBI 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2401.08276 2024-01-17 cs.CV cs.CL 79%

AesBench: An Expert Benchmark for Multimodal Large Language Models on Image Aesthetics Perception

Yipo Huang, Quan Yuan, Xiangfei Sheng, Zhichao Yang, Haoning Wu, Pengfei Chen, Yuzhe Yang, Leida Li, Weisi Lin

专题命中 其他VLM :multimodal large language model(title,abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2401.03105 2024-01-17 cs.CV cs.MM 79%

Incorporating Visual Experts to Resolve the Information Loss in Multimodal Large Language Models

Xin He, Longhui Wei, Lingxi Xie, Qi Tian

专题命中 其他VLM :multimodal large language model(title,abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2401.02418 2024-01-05 cs.CV 79%

Learning to Prompt with Text Only Supervision for Vision-Language Models

Muhammad Uzair Khattak, Muhammad Ferjad Naeem, Muzammal Naseer, Luc Van Gool, Federico Tombari

专题命中 其他VLM :vision-language model(title,abstract);分类 cs.CV

Comments Project Page: https://muzairkhattak.github.io/ProText/

详情

展开后加载摘要…

URL PDF HTML 收藏
2310.00500 2023-12-07 cs.CV 79%

Self-Supervised Open-Ended Classification with Small Visual Language Models

Mohammad Mahdi Derakhshani, Ivona Najdenkoska, Cees G. M. Snoek, Marcel Worring, Yuki M. Asano

专题命中 其他VLM :visual language model(title,abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2311.11477 2023-11-21 cs.CV cs.CL 79%

What's left can't be right -- The remaining positional incompetence of contrastive vision-language models

Nils Hoehing, Ellen Rushe, Anthony Ventresque

专题命中 其他VLM :vision-language model(title,abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2306.01747 2023-11-08 cs.CV 79%

UMDFood: Vision-language models boost food composition compilation

Peihua Ma, Yixin Wu, Ning Yu, Yang Zhang, Michael Backes, Qin Wang, Cheng-I Wei

专题命中 其他VLM :vision-language model(title,abstract);分类 cs.CV

Comments 13 pages, 9 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2310.12062 2023-10-19 cs.CV 79%

On the use of Vision-Language models for Visual Sentiment Analysis: a study on CLIP

Cristina Bustos, Carles Civit, Brian Du, Albert Sole-Ribalta, Agata Lapedriza

专题命中 其他VLM :vision-language model(title,abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2308.04005 2023-08-09 cs.CV 79%

Few-shot medical image classification with simple shape and texture text descriptors using vision-language models

Michal Byra, Muhammad Febrian Rachmadi, Henrik Skibbe

专题命中 其他VLM :vision-language model(title,abstract);分类 cs.CV

Comments 13 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2307.14063 2023-07-27 cs.CV 79%

ECO: Ensembling Context Optimization for Vision-Language Models

Lorenzo Agnolucci, Alberto Baldrati, Francesco Todino, Federico Becattini, Marco Bertini, Alberto Del Bimbo

专题命中 其他VLM :vision-language model(title,abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2307.11227 2023-07-24 cs.CV 79%

UP-DP: Unsupervised Prompt Learning for Data Pre-Selection with Vision-Language Models

Xin Li, Sima Behpour, Thang Doan, Wenbin He, Liang Gou, Liu Ren

专题命中 其他VLM :vision-language model(title,abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2211.16594 2023-04-20 cs.CV 79%

Exploiting Category Names for Few-Shot Classification with Vision-Language Models

Taihong Xiao, Zirui Wang, Liangliang Cao, Jiahui Yu, Shengyang Dai, Ming-Hsuan Yang

专题命中 其他VLM :vision-language model(title,abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2212.04196 2023-04-03 cs.CV 79%

Learning Domain Invariant Prompt for Vision-Language Models

Cairong Zhao, Yubin Wang, Xinyang Jiang, Yifei Shen, Kaitao Song, Dongsheng Li, Duoqian Miao

专题命中 其他VLM :vision-language model(title,abstract);分类 cs.CV

Comments 12 pages, 6 figures, 5 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2303.17169 2023-03-31 cs.CV 79%

Task-Oriented Multi-Modal Mutual Leaning for Vision-Language Models

Sifan Long, Zhen Zhao, Junkun Yuan, Zichang Tan, Jiangjiang Liu, Luping Zhou, Shengsheng Wang, Jingdong Wang

专题命中 其他VLM :vision-language model(title,abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2301.00182 2023-03-28 cs.CV 79%

Bidirectional Cross-Modal Knowledge Exploration for Video Recognition with Pre-trained Vision-Language Models

Wenhao Wu, Xiaohan Wang, Haipeng Luo, Jingdong Wang, Yi Yang, Wanli Ouyang

专题命中 其他VLM :vision-language model(title,abstract);分类 cs.CV

Comments Accepted by CVPR 2023

详情

展开后加载摘要…

URL PDF HTML 收藏
2303.07226 2023-03-14 cs.CV cs.CL 79%

Scaling Vision-Language Models with Sparse Mixture of Experts

Sheng Shen, Zhewei Yao, Chunyuan Li, Trevor Darrell, Kurt Keutzer, Yuxiong He

专题命中 其他VLM :vision-language model(title,abstract);分类 cs.CV

Comments Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2301.10166 2023-01-25 q-fin.ST cs.CL cs.LG 79%

Leveraging Vision-Language Models for Granular Market Change Prediction

Christopher Wimmer, Navid Rekabsaz

专题命中 其他VLM :vision-language model(title,abstract);分类 cs.LG

Comments Accepted at Multimodal AI for Financial Forecasting Workshop (Muffin) at AAAI 2023

详情

展开后加载摘要…

URL PDF HTML 收藏
2211.05077 2022-11-10 cs.CV 79%

Prompting Large Pre-trained Vision-Language Models For Compositional Concept Learning

Guangyue Xu, Parisa Kordjamshidi, Joyce Chai

专题命中 其他VLM :vision-language model(title,abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏