MLLM-Guided VLM Fine-Tuning with Joint Inference for Zero-Shot Composed Image Retrieval
机构 * College of Computing and Data Science, Nanyang Technological University, Singapore(南洋理工大学计算机与数据科学学院) ; Department of Computer Science, University of California, Los Angeles, USA(加州大学洛杉矶分校计算机科学系) ; Sun Yat-sen University Shenzhen Campus, School of Cyber Science and Technology, Shenzhen, China(中山大学深圳校区信息科学与技术学院)
专题命中 VLM训练与架构 :VLM(title,abstract);MLLM(title,abstract);multimodal large language model(abstract);分类 cs.CV