BiPVL-Seg: Bidirectional Progressive Vision-Language Fusion with Global-Local Alignment for Medical Image Segmentation
专题命中 VLM训练与架构 :vision-language model(abstract);分类 cs.CV、cs.AI
AI 大模型
视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。
专题命中 VLM训练与架构 :vision-language model(abstract);分类 cs.CV、cs.AI
专题命中 VLM训练与架构 :LLaVA(abstract);分类 cs.CV、cs.LG
专题命中 VLM训练与架构 :MLLM(abstract);分类 cs.CV、cs.AI
专题命中 VLM训练与架构 :LLaVA(abstract);分类 cs.CV、cs.AI
专题命中 VLM训练与架构 :vision-language model(abstract);分类 cs.CV、cs.AI
Comments 25 pages, 12 figures
Journal ref Information 2025, 16, 81
专题命中 VLM训练与架构 :vision-language model(abstract);分类 cs.CV、cs.AI
Comments CVPR 2025
专题命中 VLM训练与架构 :multimodal large language model(abstract);分类 cs.CV、cs.LG
Comments Code is available at https://github.com/Jam1ezhang/DYTO
专题命中 VLM训练与架构 :vision-language model(abstract);分类 cs.CV、cs.AI
Comments Accepted by CVPR 2025
专题命中 VLM训练与架构 :vision language model(abstract);分类 cs.CV、cs.LG
专题命中 VLM训练与架构 :VLM(abstract);分类 cs.AI、cs.LG
Comments 57 Pages, 5 Figures
专题命中 VLM训练与架构 :MLLM(abstract);分类 cs.CV、cs.LG
专题命中 VLM训练与架构 :grounding(abstract);分类 cs.AI、cs.LG
专题命中 VLM训练与架构 :vision-language model(abstract);分类 cs.CV、cs.AI
Comments Accepted by ECCV 2024 (14 pages, 8 figures)
专题命中 VLM训练与架构 :LLaVA(abstract);分类 cs.AI、cs.LG
Comments ICLR 2025
专题命中 VLM训练与架构 :visual language model(abstract);分类 cs.CV、cs.LG
Comments Code: https://github.com/mit-han-lab/vila-u. The first two authors contributed equally to this work
专题命中 VLM训练与架构 :VLM(abstract);分类 cs.AI、cs.LG
Comments To appear at the 13th International Conference on Learning Representations (ICLR 2025) as a Spotlight presentation
专题命中 VLM训练与架构 :LLaVA(abstract);分类 cs.AI、cs.LG
专题命中 VLM训练与架构 :grounding(abstract);分类 cs.CV、cs.AI
Comments 8 pages
专题命中 VLM训练与架构 :vision language model(abstract);分类 cs.CV、cs.AI
Comments Code and data are available at https://github.com/Leezekun/MMSci
专题命中 VLM训练与架构 :VLM(abstract);分类 cs.AI、cs.LG
专题命中 VLM训练与架构 :multimodal large language model(abstract);分类 cs.CV、cs.AI
Comments 24 pages,14 figures, 5 tables
专题命中 VLM训练与架构 :vision language model(abstract);分类 cs.AI、cs.LG
Comments Accepted by ICLR 2025. 22 pages. 9 Figures. 13 Tables
专题命中 VLM训练与架构 :multimodal large language model(abstract);分类 cs.CV、cs.AI
专题命中 VLM训练与架构 :vision-language model(abstract);分类 cs.CV、cs.LG
Comments to appear at ICLR25
专题命中 VLM训练与架构 :vision language model(abstract);分类 cs.CV、cs.AI
专题命中 VLM训练与架构 :vision-language model(abstract);分类 cs.CV、cs.LG
Comments Website: https://grape-vla.github.io/
专题命中 VLM训练与架构 :vision-language model(abstract);分类 cs.CV、cs.AI
Comments This paper has been accepted for presentation at the 2025 IEEE International Symposium on Biomedical Imaging (ISBI 2025)
专题命中 VLM训练与架构 :multimodal large language model(abstract);分类 cs.CV、cs.AI
Comments Accepted at AAAI 2025 (Main Track). Project page: https://vl2g.github.io/projects/PatentLMM/
专题命中 VLM训练与架构 :VLM(abstract);分类 cs.CV、cs.AI
专题命中 VLM训练与架构 :LLaVA(abstract);分类 cs.AI、cs.LG
Comments 25 pages, 6 figures, 7 tables