RAR: Retrieving And Ranking Augmented MLLMs for Visual Recognition
RAR:用于视觉识别的检索与排序增强多模态大语言模型
机构 * Shanghai Jiao Tong University(上海交通大学) ; Shanghai AI Laboratory(上海人工智能实验室) ; The Chinese University of Hong Kong(香港中文大学) ; MThreads, Inc.(MThreads公司) ; Nanyang Technological University(南洋理工大学)
专题命中 视觉定位与Grounding :MLLM(summary_cn,abstract_cn);multimodal large language model(abstract);分类 cs.CV、cs.AI、cs.LG
AI总结 RAR结合CLIP的检索与MLLM的排序,提升细粒度识别精度,增强少样本和零样本任务表现。
Comments Project: https://github.com/Liuziyu77/RAR