LADA: Scalable Label-Specific CLIP Adapter for Continual Learning
专题命中 VLM训练与架构 :vision-language model(abstract);分类 cs.CV、cs.LG
Comments Accepted at ICML 2025
AI 大模型
视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。
专题命中 VLM训练与架构 :vision-language model(abstract);分类 cs.CV、cs.LG
Comments Accepted at ICML 2025
机构 * College of Computer Science and Technology, Zhejiang University(浙江大学计算机科学与技术学院) ; Binjiang Research Institute of Zhejiang University(浙江大学滨江研究院) ; School of Software Engineering of Zhejiang University(浙江大学软件工程学院) ; Polytechnic Institute of Zhejiang University(浙江大学 polytechnic 院)
专题命中 VLM训练与架构 :multimodal large language model(abstract);分类 cs.CV、cs.AI
Comments Accepted by IEEE Geoscience and Remote Sensing Magazine
机构 * School of Software, Tsinghua University(清华大学软件学院) ; BNRist, Tsinghua University(清华大学BNRist) ; Department of Automation, Tsinghua University(清华大学自动化系)
专题命中 VLM训练与架构 :LLaVA(abstract);分类 cs.CV、cs.AI
机构 * Technische Universität Berlin(柏林技术大学) ; IIIT Hyderabad(海得拉巴国家理工学院) ; Univ of Maryland(马里兰大学) ; Rice Univ(Rice 大学) ; Univ of Wisconsin - Madison(威斯康星大学麦迪逊分校) ; Spector Inc(Spector 公司) ; Microsoft(微软公司)
专题命中 VLM训练与架构 :MLLM(abstract);分类 cs.AI、cs.LG
Comments 30 pages, 22 figures, The Thirteenth International Conference on Learning Representations, ICLR-2025, Singapore. https://openreview.net/pdf?id=xkgfLXZ4e0
Journal ref ICLR-2025, Singapore
机构 * School of Computer Science, The University of Sydney(悉尼大学计算机科学学院) ; Shanghai Jiao Tong University(上海交通大学)
专题命中 VLM训练与架构 :vision-language model(abstract);分类 cs.CV、cs.AI
机构 * Changdae Oh ; Zhen Fang ; Shawn Im ; Xuefeng Du ; Yixuan Li
专题命中 VLM训练与架构 :multimodal large language model(abstract);分类 cs.AI、cs.LG
Comments ICML 2025 camera-ready
机构 * University of Southern California(南加州大学)
专题命中 VLM训练与架构 :vision-language model(abstract);分类 cs.CV、cs.AI
Comments 15 pages, 3 figures
机构 * Wangxuan Institute of Computer Technology, Peking University(北京大学王宣计算机技术研究所) ; University of Science and Technology of China(中国科学技术大学) ; State Key Laboratory of General Artificial Intelligence(通用人工智能国家重点实验室)
专题命中 VLM训练与架构 :grounding(abstract);分类 cs.AI、cs.LG
机构 * George Mason University(乔治·马歇尔大学)
专题命中 VLM训练与架构 :vision-language model(abstract);分类 cs.CV、cs.AI
机构 * Shanghai Jiaotong University(上海交通大学) ; Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) ; The Chinese University of Hong Kong(香港中文大学) ; Wuhan University(武汉大学)
专题命中 VLM训练与架构 :vision-language model(abstract);分类 cs.CV、cs.AI
Comments project url: https://github.com/Liuziyu77/Visual-RFT/tree/main/Visual-ARFT
机构 * University of Notre Dame(诺丁汉大学) ; Lehigh University(莱斯大学) ; Imperial College London(伦敦帝国理工学院) ; Rutgers University(罗格斯大学) ; International Business Machines Corporation (IBM)(国际商业机器公司(IBM)) ; University of Illinois Chicago(伊利诺伊大学芝加哥分校) ; Microsoft Research(微软研究院)
专题命中 VLM训练与架构 :vision-language model(abstract);分类 cs.AI、cs.LG
机构 * Electrical and Computer Engineering(电气与计算机工程)
专题命中 VLM训练与架构 :LLaVA(abstract);分类 cs.CV、cs.AI
Journal ref Published in ACM Transactions on Intelligent Systems and Technology, 2025
机构 * Department of Computer Science University of California, Los Angeles(计算机科学系,加州大学洛杉矶分校)
专题命中 VLM训练与架构 :MLLM(abstract);分类 cs.CV、cs.AI
专题命中 VLM训练与架构 :vision-language model(abstract);分类 cs.CV、cs.AI
专题命中 VLM训练与架构 :VLM(abstract);分类 cs.CV、cs.AI
机构 * Samsung AI Cambridge(三星AI剑桥) ; Technical University of Iasi(伊阿西技术大学) ; Queen Mary University of London(伦敦女王学院)
专题命中 VLM训练与架构 :vision-language model(abstract);分类 cs.CV、cs.AI
Comments Published at CVPR 2025
机构 * Artificial Intelligence Research Center(人工智能研究中心) ; National Institute of Advanced Industrial Science and Technology(国家先进工业科学与技术研究院)
专题命中 VLM训练与架构 :vision-language model(abstract);分类 cs.CV、cs.AI
Journal ref Published in Proceedings of the 1st Workshop on Nordic-Baltic Responsible Evaluation and Alignment of Language, NoDaLiDa - Baltic HLT 2025
专题命中 VLM训练与架构 :multimodal large language model(abstract);分类 cs.AI、cs.LG
专题命中 VLM训练与架构 :visual language model(abstract);分类 cs.CV、cs.AI
专题命中 VLM训练与架构 :VLM(abstract);分类 cs.CV、cs.AI
Comments Project Page: https://ucsc-vlaa.github.io/Complex-Edit/, Dataset: https://huggingface.co/datasets/UCSC-VLAA/Complex-Edit
专题命中 VLM训练与架构 :vision-language model(abstract);分类 cs.AI、cs.LG
专题命中 VLM训练与架构 :vision-language model(abstract);分类 cs.CV、cs.LG
Comments Published in Transactions on Machine Learning Research (TMLR)
专题命中 VLM训练与架构 :VLM(abstract);分类 cs.CV、cs.LG
专题命中 VLM训练与架构 :vision-language model(abstract);分类 cs.CV、cs.AI
Comments CVPR 2025, project page at https://github.com/google-deepmind/video_comp
专题命中 VLM训练与架构 :multimodal large language model(abstract);分类 cs.CV、cs.AI
Comments Project page: https://cvlab-kaist.github.io/URECA Code: https://github.com/cvlab-kaist/URECA
专题命中 VLM训练与架构 :vision language model(abstract);分类 cs.AI、cs.LG
专题命中 VLM训练与架构 :visual language model(abstract);分类 cs.AI、cs.LG
Comments IROS 2025
专题命中 VLM训练与架构 :vision-language model(abstract);分类 cs.CV、cs.AI
专题命中 VLM训练与架构 :vision-language model(abstract);分类 cs.CV、cs.LG
Comments accepted at CVPR 2025 Workshop on ELVM
专题命中 VLM训练与架构 :vision-language model(abstract);分类 cs.CV、cs.LG
Comments Accepted to NeurIPS 2024