Towards General Continuous Memory for Vision-Language Models
机构 * University of California, San Diego(加州大学圣地亚哥分校)
专题命中 VLM训练与架构 :vision-language model(title,abstract);VLM(abstract);分类 cs.AI、cs.LG
AI 大模型
视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。
机构 * University of California, San Diego(加州大学圣地亚哥分校)
专题命中 VLM训练与架构 :vision-language model(title,abstract);VLM(abstract);分类 cs.AI、cs.LG
机构 * VCIP, School of Computer Science, Nankai University(南开大学计算机学院) ; Tongyi Lab, Alibaba Group(阿里巴巴集团 Tongyi 实验室)
专题命中 VLM训练与架构 :LLaVA(title,abstract);multimodal large language model(abstract);分类 cs.CV、cs.AI
Comments 21 pages, 4 figures, 7 tables
机构 * Sun Yat-sen University(中山大学) ; Snap Inc.(Snap公司)
专题命中 VLM训练与架构 :VLM(title,abstract);vision-language model(abstract);分类 cs.AI、cs.LG
机构 * Texas A&M University(德克萨斯大学) ; University of Texas at Austin(德克萨斯大学奥斯汀分校) ; University of Toronto(多伦多大学) ; Nanyang Technological University(南洋理工大学)
专题命中 VLM训练与架构 :multimodal large language model(title,abstract);MLLM(abstract);分类 cs.CV、cs.AI
Comments 18 pages
机构 * The University of Hong Kong(香港大学) ; UC Santa Cruz(圣克拉拉大学)
专题命中 VLM训练与架构 :vision-language model(title,abstract);VLM(abstract);分类 cs.CV、cs.LG
专题命中 VLM训练与架构 :VLM(title,abstract);vision-language model(abstract);分类 cs.AI、cs.LG
Comments ICML 2025
机构 * The Chinese University of Hong Kong(香港中文大学) ; Microsoft(微软公司)
专题命中 VLM训练与架构 :vision-language model(title,abstract);VLM(abstract);分类 cs.CV、cs.AI
机构 * University of Modena and Reggio Emilia(摩德纳和雷吉奥艾米利亚大学) ; University of Pisa(比萨大学) ; University of Trento(特伦托大学) ; IIT-CNR
专题命中 VLM训练与架构 :multimodal large language model(title,abstract);MLLM(abstract);分类 cs.CV、cs.AI
机构 * Department of Computer Science and Engineering, Kyung Hee University(计算机科学与工程系,庆熙大学)
专题命中 VLM训练与架构 :VLM(title,abstract);vision-language model(abstract);分类 cs.CV、cs.LG
Comments 10 pages, 2 figures
机构 * Massachusetts Institute of Technology(麻省理工学院)
专题命中 VLM训练与架构 :vision-language model(title,abstract);VLM(abstract);分类 cs.CV、cs.AI
机构 * Barcelona Supercomputing Center(巴塞罗那超级计算中心) ; Universitat Politècnica de Catalunya(加泰罗尼亚理工大学)
专题命中 VLM训练与架构 :visual language model(title,abstract);VLM(abstract);分类 cs.CV、cs.AI
Comments v2: Expanded model merging experiments. Fix duplicated subsection on limitations
专题命中 VLM训练与架构 :vision-language model(title,abstract);VLM(abstract);分类 cs.CV、cs.LG
Comments Main paper: 11 pages, 4 figures, 3 tables. Supplementary: 1 page
机构 * State Key Laboratory for Novel Software Technology(新型软件技术国家重点实验室)
专题命中 VLM训练与架构 :vision-language model(title);vision language model(abstract);VLM(abstract);分类 cs.CV、cs.LG
Comments fix typo in figure 2 "Capability Gap"
机构 * Meituan(美团)
专题命中 VLM训练与架构 :vision-language model(title,abstract);VLM(abstract);分类 cs.CV、cs.AI
Comments 18 pages, 7 figures
机构 * Amara Tariq, Ph.D(博士) ; Rimita Lahiri, Ph.D(博士) ; Charles Kahn, M.D(医学博士) ; Imon Banerjee, Ph.D(博士)
专题命中 VLM训练与架构 :VLM(title,abstract);vision language model(abstract);分类 cs.AI、cs.LG
Comments 15 pages, 2, tables, 3 figures
机构 * Politecnico di Milano, Italy(米兰理工学院,意大利) ; University of Oxford, UK(牛津大学,英国) ; CODE University of Applied Sciences, Germany(德国应用科学大学)
专题命中 VLM训练与架构 :vision language model(title,abstract);VLM(abstract);分类 cs.CV、cs.AI
机构 * University of California, Berkeley, USA(加州大学伯克利分校)
专题命中 VLM训练与架构 :vision-language model(title,abstract);VLM(abstract);分类 cs.CV、cs.LG
Comments ICML 2025
专题命中 VLM训练与架构 :vision-language model(title,abstract);VLM(abstract);分类 cs.AI、cs.LG
Comments Accepted by ICML 2025
专题命中 VLM训练与架构 :vision language model(title,abstract);VLM(abstract);分类 cs.CV、cs.AI
Comments Accepted to CVPR25. Project page: https://davidetalon.github.io/fashionact-page/
机构 * AI Innovation Center, China Unicom(中国unicom人工智能创新中心) ; Unicom Digital Technology, China Unicom(中国unicom数字技术)
专题命中 VLM训练与架构 :vision-language model(title,abstract);LLaVA(abstract);分类 cs.CV、cs.AI
Comments Accepted by IROS2024(9 pages, 8 figures)
机构 * Laboratory for Artificial Intelligence in Design(人工智能设计实验室) ; School of Fashion and Textiles(时尚与纺织学院)
专题命中 VLM训练与架构 :vision-language model(title,abstract);VLM(abstract);分类 cs.CV、cs.AI
专题命中 VLM训练与架构 :vision language model(title);vision-language model(abstract);VLM(abstract);分类 cs.CV、cs.AI
专题命中 VLM训练与架构 :visual language model(title,abstract);VLM(abstract);分类 cs.CV、cs.AI
Comments 11 pages, 5 figures
专题命中 VLM训练与架构 :vision-language model(title,abstract);VLM(abstract);分类 cs.CV、cs.LG
Comments Accepted by CVPR 2025
专题命中 VLM训练与架构 :vision-language model(title,abstract);VLM(abstract);分类 cs.CV、cs.LG
Comments ICLR 2025
专题命中 VLM训练与架构 :multimodal large language model(title,abstract);MLLM(abstract);分类 cs.CV、cs.AI
Comments CVPR2025 Camera-ready
专题命中 VLM训练与架构 :vision-language model(title,abstract);VLM(abstract);分类 cs.CV、cs.LG
专题命中 VLM训练与架构 :vision-language model(title,abstract);VLM(abstract);分类 cs.CV、cs.LG
Comments Accepted by CVPR 2025
专题命中 VLM训练与架构 :vision language model(title);vision-language model(abstract);visual question answering(abstract);分类 cs.CV、cs.LG
专题命中 VLM训练与架构 :vision-language model(title,abstract);VLM(abstract);分类 cs.CV、cs.LG