arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视觉大模型 / VLM

视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。

共收录 1565 信号源:cs.CV, cs.AI, cs.LG

1. 其他VLM 1565 篇

2406.09858 2024-12-11 cs.CV 79%

Vision Language Modeling of Content, Distortion and Appearance for Image Quality Assessment

Fei Zhou, Tianhao Gu, Zhicong Huang, Guoping Qiu

专题命中 其他VLM :vision language model(title);vision-language model(abstract);分类 cs.CV

Comments This paper has been accepted for publication in Journal of Selected Topics in Signal Processing, \c{opyright} 2024 IEEE. Personal use is permitted. For other uses, permission must be obtained from IEEE

详情

展开后加载摘要…

URL PDF HTML 收藏
2312.04066 2024-12-02 cs.CV 79%

Combining inherent knowledge of vision-language models with unsupervised domain adaptation through strong-weak guidance

Thomas Westfechtel, Dexuan Zhang, Tatsuya Harada

专题命中 其他VLM :vision-language model(title,abstract);分类 cs.CV

Comments Accepted for WACV 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.11235 2024-11-19 cs.CL cs.AI 79%

MEMO-Bench: A Multiple Benchmark for Text-to-Image and Multimodal Large Language Models on Human Emotion Analysis

Yingjie Zhou, Zicheng Zhang, Jiezhang Cao, Jun Jia, Yanwei Jiang, Farong Wen, Xiaohong Liu, Xiongkuo Min, Guangtao Zhai

专题命中 其他VLM :multimodal large language model(title,abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.09449 2024-11-15 cs.CV 79%

Image Regeneration: Evaluating Text-to-Image Model via Generating Identical Image with Multimodal Large Language Models

Chutian Meng, Fan Ma, Jiaxu Miao, Chi Zhang, Yi Yang, Yueting Zhuang

专题命中 其他VLM :multimodal large language model(title);MLLM(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.06287 2024-11-12 cs.CV 79%

Hidden in Plain Sight: Evaluating Abstract Shape Recognition in Vision-Language Models

Arshia Hemmat, Adam Davies, Tom A. Lamb, Jianhao Yuan, Philip Torr, Ashkan Khakzar, Francesco Pinto

专题命中 其他VLM :vision-language model(title,abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.04663 2024-11-08 cs.CV 79%

Explainable Search and Discovery of Visual Cultural Heritage Collections with Multimodal Large Language Models

Taylor Arnold, Lauren Tilton

专题命中 其他VLM :multimodal large language model(title,abstract);分类 cs.CV

Comments 16 pages, CHR 2024: Computational Humanities Research Conference, December 4 - 6, 2024, Aarhus University, Denmark

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.11686 2024-10-16 cs.CV 79%

A Survey of Low-shot Vision-Language Model Adaptation via Representer Theorem

Kun Ding, Ying Wang, Gaofeng Meng, Shiming Xiang

专题命中 其他VLM :vision-language model(title,abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.07030 2024-10-10 cs.CV cs.CL 79%

Clean Evaluations on Contaminated Visual Language Models

Hongyuan Lu, Shujie Miao, Wai Lam

专题命中 其他VLM :visual language model(title,abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2401.10226 2024-10-02 cs.CV 79%

Towards Language-Driven Video Inpainting via Multimodal Large Language Models

Jianzong Wu, Xiangtai Li, Chenyang Si, Shangchen Zhou, Jingkang Yang, Jiangning Zhang, Yining Li, Kai Chen, Yunhai Tong, Ziwei Liu, Chen Change Loy

专题命中 其他VLM :multimodal large language model(title,abstract);分类 cs.CV

Comments CVPR-2024. Project Page: https://jianzongwu.github.io/projects/rovi

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.14963 2024-09-24 cs.CV 79%

Exploring Fine-grained Retail Product Discrimination with Zero-shot Object Classification Using Vision-Language Models

Anil Osman Tur, Alessandro Conti, Cigdem Beyan, Davide Boscaini, Roberto Larcher, Stefano Messelodi, Fabio Poiesi, Elisa Ricci

专题命中 其他VLM :vision-language model(title,abstract);分类 cs.CV

Comments Accepted at 2024 IEEE 8th Forum on Research and Technologies for Society and Industry Innovation (RTSI) conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2405.06468 2024-09-16 cs.CV cs.CL 79%

Pseudo-Prompt Generating in Pre-trained Vision-Language Models for Multi-Label Medical Image Classification

Yaoqin Ye, Junjie Zhang, Hongwei Shi

专题命中 其他VLM :vision-language model(title,abstract);分类 cs.CV

Comments Accepted by PRCV 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.05413 2024-09-10 cs.CV cs.RO 79%

From Words to Poses: Enhancing Novel Object Pose Estimation with Vision Language Models

Tessa Pulli, Stefan Thalhammer, Simon Schwaiger, Markus Vincze

专题命中 其他VLM :vision language model(title,abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.02101 2024-09-04 cs.CV cs.MM 79%

Towards Real-World Adverse Weather Image Restoration: Enhancing Clearness and Semantics with Vision-Language Models

Jiaqi Xu, Mengyang Wu, Xiaowei Hu, Chi-Wing Fu, Qi Dou, Pheng-Ann Heng

专题命中 其他VLM :vision-language model(title,abstract);分类 cs.CV

Comments Accepted by ECCV 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.01883 2024-09-04 cs.CV 79%

Boosting Vision-Language Models for Histopathology Classification: Predict all at once

Maxime Zanella, Fereshteh Shakeri, Yunshi Huang, Houda Bahig, Ismail Ben Ayed

专题命中 其他VLM :vision-language model(title,abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.18915 2024-08-30 cs.RO cs.CV 79%

Manipulate-Anything: Automating Real-World Robots using Vision-Language Models

Jiafei Duan, Wentao Yuan, Wilbert Pumacay, Yi Ru Wang, Kiana Ehsani, Dieter Fox, Ranjay Krishna

专题命中 其他VLM :vision-language model(title,abstract);分类 cs.CV

Comments Project page: https://robot-ma.github.io/. All supplementary material, prompts and code can be found on the project page

详情

展开后加载摘要…

URL PDF HTML 收藏
2408.09706 2024-08-20 cs.CV 79%

MePT: Multi-Representation Guided Prompt Tuning for Vision-Language Model

Xinyang Wang, Yi Yang, Minfeng Zhu, Kecheng Zheng, Shi Liu, Wei Chen

专题命中 其他VLM :vision-language model(title,abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2403.06126 2024-08-20 cs.CV 79%

In-context Prompt Learning for Test-time Vision Recognition with Frozen Vision-language Model

Junhui Yin, Xinyu Zhang, Lin Wu, Xiaojie Wang

专题命中 其他VLM :vision-language model(title,abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2408.09474 2024-08-20 cs.CR cs.CL cs.CV 79%

Image-Based Geolocation Using Large Vision-Language Models

Yi Liu, Junchen Ding, Gelei Deng, Yuekang Li, Tianwei Zhang, Weisong Sun, Yaowen Zheng, Jingquan Ge, Yang Liu

专题命中 其他VLM :vision-language model(title,abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2405.01040 2024-08-16 cs.CV cs.CL eess.IV 79%

Few Shot Class Incremental Learning using Vision-Language models

Anurag Kumar, Chinmay Bharti, Saikat Dutta, Srikrishna Karanam, Biplab Banerjee

专题命中 其他VLM :vision-language model(title,abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2408.05775 2024-08-13 cs.CV 79%

Efficient Test-Time Prompt Tuning for Vision-Language Models

Yuhan Zhu, Guozhen Zhang, Chen Xu, Haocheng Shen, Xiaoxin Chen, Gangshan Wu, Limin Wang

专题命中 其他VLM :vision-language model(title,abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2408.03554 2024-08-08 cs.CL cs.CR cs.LG 79%

Empirical Analysis of Large Vision-Language Models against Goal Hijacking via Visual Prompt Injection

Subaru Kimura, Ryota Tanaka, Shumpei Miyawaki, Jun Suzuki, Keisuke Sakaguchi

专题命中 其他VLM :vision-language model(title,abstract);分类 cs.LG

Comments 8 pages, 6 figures, Accepted to NAACL 2024 SRW

详情

展开后加载摘要…

URL PDF HTML 收藏
2408.02718 2024-08-07 cs.CV 79%

MMIU: Multimodal Multi-image Understanding for Evaluating Large Vision-Language Models

Fanqing Meng, Jin Wang, Chuanhao Li, Quanfeng Lu, Hao Tian, Jiaqi Liao, Xizhou Zhu, Jifeng Dai, Yu Qiao, Ping Luo, Kaipeng Zhang, Wenqi Shao

专题命中 其他VLM :vision-language model(title,abstract);分类 cs.CV

Comments Project Page: https://mmiu-bench.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.10704 2024-07-23 cs.CV 79%

Quantized Prompt for Efficient Generalization of Vision-Language Models

Tianxiang Hao, Xiaohan Ding, Juexiao Feng, Yuhong Yang, Hui Chen, Guiguang Ding

专题命中 其他VLM :vision-language model(title,abstract);分类 cs.CV

Comments ECCV 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2403.09296 2024-07-18 cs.CV 79%

Select and Distill: Selective Dual-Teacher Knowledge Transfer for Continual Learning on Vision-Language Models

Yu-Chu Yu, Chi-Pin Huang, Jr-Jen Chen, Kai-Po Chang, Yung-Hsuan Lai, Fu-En Yang, Yu-Chiang Frank Wang

专题命中 其他VLM :vision-language model(title,abstract);分类 cs.CV

Comments Accepted to ECCV 2024. Project page: https://chuyu.org/research/snd

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.10996 2024-07-17 cs.CL cs.AI cs.HC 79%

Visualization Literacy of Multimodal Large Language Models: A Comparative Study

Zhimin Li, Haichao Miao, Valerio Pascucci, Shusen Liu

专题命中 其他VLM :multimodal large language model(title,abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2312.09187 2024-07-16 cs.LG 79%

Vision-Language Models as a Source of Rewards

Kate Baumli, Satinder Baveja, Feryal Behbahani, Harris Chan, Gheorghe Comanici, Sebastian Flennerhag, Maxime Gazeau, Kristian Holsheimer, Dan Horgan, Michael Laskin, Clare Lyle, Hussain Masoom, Kay McKinney, Volodymyr Mnih, Alexander Neitz, Dmitry Nikulin, Fabio Pardo, Jack Parker-Holder, John Quan, Tim Rocktäschel, Himanshu Sahni, Tom Schaul, Yannick Schroecker, Stephen Spencer, Richie Steigerwald, Luyu Wang, Lei Zhang

专题命中 其他VLM :vision-language model(title,abstract);分类 cs.LG

Comments 10 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.08942 2024-07-15 cs.IR cs.AI 79%

A Neural Matrix Decomposition Recommender System Model based on the Multimodal Large Language Model

Ao Xiang, Bingjie Huang, Xinyu Guo, Haowei Yang, Tianyao Zheng

专题命中 其他VLM :multimodal large language model(title,abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2402.02235 2024-07-12 cs.CV 79%

Image Fusion via Vision-Language Model

Zixiang Zhao, Lilun Deng, Haowen Bai, Yukun Cui, Zhipeng Zhang, Yulun Zhang, Haotong Qin, Dongdong Chen, Jiangshe Zhang, Peng Wang, Luc Van Gool

专题命中 其他VLM :vision-language model(title,abstract);分类 cs.CV

Comments Accepted by International Conference on Machine Learning (ICML) 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.03320 2024-07-04 cs.CV cs.CL 79%

InternLM-XComposer-2.5: A Versatile Large Vision Language Model Supporting Long-Contextual Input and Output

Pan Zhang, Xiaoyi Dong, Yuhang Zang, Yuhang Cao, Rui Qian, Lin Chen, Qipeng Guo, Haodong Duan, Bin Wang, Linke Ouyang, Songyang Zhang, Wenwei Zhang, Yining Li, Yang Gao, Peng Sun, Xinyue Zhang, Wei Li, Jingwen Li, Wenhai Wang, Hang Yan, Conghui He, Xingcheng Zhang, Kai Chen, Jifeng Dai, Yu Qiao, Dahua Lin, Jiaqi Wang

专题命中 其他VLM :vision language model(title,abstract);分类 cs.CV

Comments Technical Report. https://github.com/InternLM/InternLM-XComposer

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.02987 2024-06-06 cs.CV 79%

Enhancing Multimodal Large Language Models with Multi-instance Visual Prompt Generator for Visual Representation Enrichment

Wenliang Zhong, Wenyi Wu, Qi Li, Rob Barton, Boxin Du, Shioulin Sam, Karim Bouyarmane, Ismail Tutar, Junzhou Huang

专题命中 其他VLM :multimodal large language model(title,abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏