arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视觉大模型 / VLM

视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。

共收录 1566 信号源:cs.CV, cs.AI, cs.LG

1. 其他VLM 1566 篇

2401.16420 2024-01-30 cs.CV cs.CL 57%

InternLM-XComposer2: Mastering Free-form Text-Image Composition and Comprehension in Vision-Language Large Model

Xiaoyi Dong, Pan Zhang, Yuhang Zang, Yuhang Cao, Bin Wang, Linke Ouyang, Xilin Wei, Songyang Zhang, Haodong Duan, Maosong Cao, Wenwei Zhang, Yining Li, Hang Yan, Yang Gao, Xinyue Zhang, Wei Li, Jingwen Li, Kai Chen, Conghui He, Xingcheng Zhang, Yu Qiao, Dahua Lin, Jiaqi Wang

专题命中 其他VLM :vision-language model(abstract);分类 cs.CV

Comments Code and models are available at https://github.com/InternLM/InternLM-XComposer

详情

展开后加载摘要…

URL PDF HTML 收藏
2305.17891 2024-01-30 cs.CV 57%

The Rise of AI Language Pathologists: Exploring Two-level Prompt Learning for Few-shot Weakly-supervised Whole Slide Image Classification

Linhao Qu, Xiaoyuan Luo, Kexue Fu, Manning Wang, Zhijian Song

专题命中 其他VLM :vision-language model(abstract);分类 cs.CV

Comments Accepted by NeurIPS 2023

详情

展开后加载摘要…

URL PDF HTML 收藏
2401.10475 2024-01-26 cs.CV cs.MM 57%

CBVS: A Large-Scale Chinese Image-Text Benchmark for Real-World Short Video Search Scenarios

Xiangshuo Qiao, Xianxin Li, Xiaozhe Qu, Jie Zhang, Yang Liu, Yu Luo, Cihang Jin, Jin Ma

专题命中 其他VLM :vision-language model(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2401.06890 2024-01-17 cs.LG 57%

An Axiomatic Approach to Model-Agnostic Concept Explanations

Zhili Feng, Michal Moshkovitz, Dotan Di Castro, J. Zico Kolter

专题命中 其他VLM :vision language model(abstract);分类 cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2306.00917 2024-01-15 cs.CV 57%

Vocabulary-free Image Classification

Alessandro Conti, Enrico Fini, Massimiliano Mancini, Paolo Rota, Yiming Wang, Elisa Ricci

专题命中 其他VLM :vision-language model(abstract);分类 cs.CV

Comments Accepted at NeurIPS2023, 19 pages, 8 figures, code is available at https://github.com/altndrr/vic

详情

展开后加载摘要…

URL PDF HTML 收藏
2401.03641 2024-01-09 cs.RO cs.CV 57%

DME-Driver: Integrating Human Decision Logic and 3D Scene Perception in Autonomous Driving

Wencheng Han, Dongqian Guo, Cheng-Zhong Xu, Jianbing Shen

专题命中 其他VLM :vision language model(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2401.02147 2024-01-05 cs.CL cs.CV 57%

Exploring Boundary of GPT-4V on Marine Analysis: A Preliminary Case Study

Ziqiang Zheng, Yiwei Chen, Jipeng Zhang, Tuan-Anh Vu, Huimin Zeng, Yue Him Wong Tim, Sai-Kit Yeung

专题命中 其他VLM :MLLM(abstract);分类 cs.CV

Comments 51 pages, 36 figures, Repository: https://github.com/hkust-vgd/Marine_GPT-4V_Eval

详情

展开后加载摘要…

URL PDF HTML 收藏
2312.07009 2023-12-18 cs.CV 57%

Vision-language Assisted Attribute Learning

Kongming Liang, Xinran Wang, Rui Wang, Donghui Gao, Ling Jin, Weidong Liu, Xiatian Zhu, Zhanyu Ma, Jun Guo

专题命中 其他VLM :vision-language model(abstract);分类 cs.CV

Comments Accepted by IEEE IC-NIDC 2023

详情

展开后加载摘要…

URL PDF HTML 收藏
2310.07730 2023-12-13 cs.CV eess.IV 57%

Domain-Controlled Prompt Learning

Qinglong Cao, Zhengqin Xu, Yuntian Chen, Chao Ma, Xiaokang Yang

专题命中 其他VLM :vision-language model(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2312.04679 2023-12-11 eess.IV cs.CV 57%

ConVRT: Consistent Video Restoration Through Turbulence with Test-time Optimization of Neural Video Representations

Haoming Cai, Jingxi Chen, Brandon Y. Feng, Weiyun Jiang, Mingyang Xie, Kevin Zhang, Ashok Veeraraghavan, Christopher Metzler

专题命中 其他VLM :vision-language model(abstract);分类 cs.CV

Comments https://convrt-2024.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2312.04655 2023-12-11 cs.CV 57%

ECLIPSE: A Resource-Efficient Text-to-Image Prior for Image Generations

Maitreya Patel, Changhoon Kim, Sheng Cheng, Chitta Baral, Yezhou Yang

专题命中 其他VLM :vision-language model(abstract);分类 cs.CV

Comments Project Page: https://eclipse-t2i.vercel.app/

详情

展开后加载摘要…

URL PDF HTML 收藏
2311.17737 2023-11-30 cs.CV cs.GR 57%

GenZI: Zero-Shot 3D Human-Scene Interaction Generation

Lei Li, Angela Dai

专题命中 其他VLM :vision-language model(abstract);分类 cs.CV

Comments Project page: https://craigleili.github.io/projects/genzi/ Video: https://youtu.be/ozfs6E0JIMY

详情

展开后加载摘要…

URL PDF HTML 收藏
2311.11695 2023-11-21 cs.CV 57%

Clarity ChatGPT: An Interactive and Adaptive Processing System for Image Restoration and Enhancement

Yanyan Wei, Zhao Zhang, Jiahuan Ren, Xiaogang Xu, Richang Hong, Yi Yang, Shuicheng Yan, Meng Wang

专题命中 其他VLM :vision-language model(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2311.05729 2023-11-13 cs.CV 57%

GIPCOL: Graph-Injected Soft Prompting for Compositional Zero-Shot Learning

Guangyue Xu, Joyce Chai, Parisa Kordjamshidi

专题命中 其他VLM :vision-language model(abstract);分类 cs.CV

Comments WACV24

详情

展开后加载摘要…

URL PDF HTML 收藏
2311.04257 2023-11-13 cs.CL cs.CV 57%

mPLUG-Owl2: Revolutionizing Multi-modal Large Language Model with Modality Collaboration

Qinghao Ye, Haiyang Xu, Jiabo Ye, Ming Yan, Anwen Hu, Haowei Liu, Qi Qian, Ji Zhang, Fei Huang, Jingren Zhou

专题命中 其他VLM :MLLM(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2311.01034 2023-11-03 cs.CV 57%

Learning to Adapt CLIP for Few-Shot Monocular Depth Estimation

Xueting Hu, Ce Zhang, Yi Zhang, Bowen Hai, Ke Yu, Zhihai He

专题命中 其他VLM :vision-language model(abstract);分类 cs.CV

Comments Accepted by WACV 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2310.18949 2023-10-31 cs.CV 57%

Customize StyleGAN with One Hand Sketch

Shaocong Zhang

专题命中 其他VLM :vision-language model(abstract);分类 cs.CV

Comments preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2310.15985 2023-10-25 cs.CV 57%

Vision-Language Pseudo-Labels for Single-Positive Multi-Label Learning

Xin Xing, Zhexiao Xiong, Abby Stylianou, Srikumar Sastry, Liyu Gong, Nathan Jacobs

专题命中 其他VLM :vision-language model(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2304.08931 2023-10-23 cs.CV cs.CL 57%

Enhancing Textbooks with Visuals from the Web for Improved Learning

Janvijay Singh, Vilém Zouhar, Mrinmaya Sachan

专题命中 其他VLM :vision-language model(abstract);分类 cs.CV

Comments EMNLP 2023; 14 pages (8+6)

详情

展开后加载摘要…

URL PDF HTML 收藏
2310.09929 2023-10-17 cs.CV cs.CL 57%

Prompting Scientific Names for Zero-Shot Species Recognition

Shubham Parashar, Zhiqiu Lin, Yanan Li, Shu Kong

专题命中 其他VLM :vision-language model(abstract);分类 cs.CV

Comments EMNLP 2023

详情

展开后加载摘要…

URL PDF HTML 收藏
2310.08368 2023-10-13 cs.CV 57%

Mapping Memes to Words for Multimodal Hateful Meme Classification

Giovanni Burbi, Alberto Baldrati, Lorenzo Agnolucci, Marco Bertini, Alberto Del Bimbo

专题命中 其他VLM :vision-language model(abstract);分类 cs.CV

Comments ICCV2023 CLVL Workshop

详情

展开后加载摘要…

URL PDF HTML 收藏
2310.06838 2023-10-11 cs.CV 57%

AutoAD II: The Sequel -- Who, When, and What in Movie Audio Description

Tengda Han, Max Bain, Arsha Nagrani, Gül Varol, Weidi Xie, Andrew Zisserman

专题命中 其他VLM :vision-language model(abstract);分类 cs.CV

Comments ICCV2023. Project page: https://www.robots.ox.ac.uk/vgg/research/autoad/

详情

展开后加载摘要…

URL PDF HTML 收藏
2310.02426 2023-10-05 cs.CV 57%

EditVal: Benchmarking Diffusion Based Text-Guided Image Editing Methods

Samyadeep Basu, Mehrdad Saberi, Shweta Bhardwaj, Atoosa Malemir Chegini, Daniela Massiceti, Maziar Sanjabi, Shell Xu Hu, Soheil Feizi

专题命中 其他VLM :vision-language model(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2208.11553 2023-09-26 cs.CV 57%

MuMUR : Multilingual Multimodal Universal Retrieval

Avinash Madasu, Estelle Aflalo, Gabriela Ben Melech Stan, Shachar Rosenman, Shao-Yen Tseng, Gedas Bertasius, Vasudev Lal

专题命中 其他VLM :vision-language model(abstract);分类 cs.CV

Comments This is an extension of the previous MKTVR paper (for which you can find a reference here : https://dl.acm.org/doi/abs/10.1007/978-3-031-28244-7_42 or in a previous version on arxiv). This version was published to the Information Retrieval Journal

详情

展开后加载摘要…

URL PDF HTML 收藏
2309.12530 2023-09-25 cs.CV 57%

A Sentence Speaks a Thousand Images: Domain Generalization through Distilling CLIP with Language Guidance

Zeyi Huang, Andy Zhou, Zijian Lin, Mu Cai, Haohan Wang, Yong Jae Lee

专题命中 其他VLM :vision-language model(abstract);分类 cs.CV

Comments to appear at ICCV2023

详情

展开后加载摘要…

URL PDF HTML 收藏
2309.08928 2023-09-19 cs.CV 57%

In-Style: Bridging Text and Uncurated Videos with Style Transfer for Text-Video Retrieval

Nina Shvetsova, Anna Kukleva, Bernt Schiele, Hilde Kuehne

专题命中 其他VLM :vision-language model(abstract);分类 cs.CV

Comments Published at ICCV 2023, code: https://github.com/ninatu/in_style

详情

展开后加载摘要…

URL PDF HTML 收藏
2309.08531 2023-09-18 cs.CV cs.CL eess.AS eess.IV 57%

Towards Practical and Efficient Image-to-Speech Captioning with Vision-Language Pre-training and Multi-modal Tokens

Minsu Kim, Jeongsoo Choi, Soumi Maiti, Jeong Hun Yeo, Shinji Watanabe, Yong Man Ro

专题命中 其他VLM :vision-language model(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2308.10755 2023-09-18 cs.CL cs.CV 57%

WanJuan: A Comprehensive Multimodal Dataset for Advancing English and Chinese Large Models

Conghui He, Zhenjiang Jin, Chao Xu, Jiantao Qiu, Bin Wang, Wei Li, Hang Yan, Jiaqi Wang, Dahua Lin

专题命中 其他VLM :multimodal large language model(abstract);分类 cs.CV

Comments Technical Report

详情

展开后加载摘要…

URL PDF HTML 收藏
2307.06526 2023-09-15 cs.CV cs.GR 57%

AvatarFusion: Zero-shot Generation of Clothing-Decoupled 3D Avatars Using 2D Diffusion

Shuo Huang, Zongxin Yang, Liangting Li, Yi Yang, Jia Jia

专题命中 其他VLM :vision-language model(abstract);分类 cs.CV

Comments Accepted by ACM Multimedia 2023

详情

展开后加载摘要…

URL PDF HTML 收藏
2308.16474 2023-09-01 cs.CL cs.AI 57%

Enhancing Subtask Performance of Multi-modal Large Language Model

Yongqiang Zhao, Zhenyu Li, Feng Zhang, Xinhai Xu, Donghong Liu

专题命中 其他VLM :MLLM(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏