Vision-Language Model Fine-Tuning via Simple Parameter-Efficient Modification
专题命中 VLM训练与架构 :vision-language model(title,abstract);分类 cs.CV、cs.AI、cs.LG
Comments EMNLP 2024 Main Conference
AI 大模型
视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。
专题命中 VLM训练与架构 :vision-language model(title,abstract);分类 cs.CV、cs.AI、cs.LG
Comments EMNLP 2024 Main Conference
专题命中 VLM训练与架构 :vision-language model(title,abstract);VLM(abstract)
专题命中 VLM训练与架构 :visual language model(title,abstract);VLM(abstract)
Comments 15 pages, 7 figures
专题命中 VLM训练与架构 :VLM(title,abstract);vision language model(abstract)
专题命中 VLM训练与架构 :VLM(title,abstract);visual language model(abstract)
Comments The paper is accepted by the IEEE conference
专题命中 VLM训练与架构 :vision-language model(title,abstract);VLM(abstract)
Comments 9 pages, 9 figures, accepted to IROS2024, project page: https://omron-sinicx.github.io/visuo-tactile-recognition/
专题命中 VLM训练与架构 :vision-language model(title,abstract);分类 cs.CV、cs.AI、cs.LG
专题命中 VLM训练与架构 :multimodal large language model(title,abstract);分类 cs.CV、cs.AI、cs.LG
Comments Accepted by ACMMM2024
专题命中 VLM训练与架构 :VLM(title);vision-language model(abstract);分类 cs.CV、cs.AI、cs.LG
Comments 8 pages, 9 figures
专题命中 VLM训练与架构 :vision-language model(title,abstract);分类 cs.CV、cs.AI、cs.LG
Comments 9 main pages and 19 pages of supplemental material; 3 main tables, 3 main figures and 11 supplemental tables, 7 supplemental figures
专题命中 VLM训练与架构 :vision-language model(title,abstract);分类 cs.CV、cs.AI、cs.LG
Comments Accepted by ICML2024
专题命中 VLM训练与架构 :multimodal large language model(title,abstract);MLLM(abstract)
Comments ACL finding 2024
专题命中 VLM训练与架构 :vision-language model(title,abstract);分类 cs.CV、cs.AI、cs.LG
Comments Accepted by ICML 2024
专题命中 VLM训练与架构 :multimodal large language model(title,abstract);分类 cs.CV、cs.AI、cs.LG
Comments Accepted in CVPR 2024 as Poster (Highlight)
专题命中 VLM训练与架构 :vision language model(title);vision-language model(abstract);分类 cs.CV、cs.AI、cs.LG
专题命中 VLM训练与架构 :vision-language model(title);VLM(abstract);分类 cs.CV、cs.AI、cs.LG
专题命中 VLM训练与架构 :vision language model(title);vision-language model(abstract);VLM(abstract)
Comments CVPR 2024
专题命中 VLM训练与架构 :vision-language model(title,abstract);分类 cs.CV、cs.AI、cs.LG
专题命中 VLM训练与架构 :vision-language model(title,abstract);VLM(abstract)
Comments Work in progress
专题命中 VLM训练与架构 :vision language model(title);vision-language model(abstract);分类 cs.CV、cs.AI、cs.LG
Comments Accepted at EMNLP 2023 (Main track)
专题命中 VLM训练与架构 :vision-language model(title,abstract);VLM(abstract)
专题命中 VLM训练与架构 :vision-language model(title,abstract);visual question answering(abstract)
专题命中 VLM训练与架构 :visual language model(title,abstract);分类 cs.CV、cs.AI、cs.LG
Comments Findings of EMNLP 2023
专题命中 VLM训练与架构 :vision-language model(title,abstract);分类 cs.CV、cs.AI、cs.LG
Comments ICCV 2023
专题命中 VLM训练与架构 :vision-language model(title,abstract);分类 cs.CV、cs.AI、cs.LG
Comments CVPR 2022. Update: Adds results on the DOSCO (DOmain Shift in COntext) benchmark
相似性并非逻辑:双编码器视觉语言模型的因式推理
专题命中 VLM训练与架构 :vision-language model(title,abstract);分类 cs.CV、cs.LG;VLM(comments)
AI总结 研究双编码器视觉语言模型组合约束失效问题,提出因式推理,将证据提取与约束执行分离,引入LCSE方法,在FACTOR-Bench上实验,提升了准确率并保持检索性能。
Comments Accepted at ICML 2026. 18 pages, 8 figures. Project page: https://sultanmo.github.io/factored-vlm Code and benchmark: https://github.com/SultanMo/factored-vlm
机构 * Southeast University(东南大学) ; Xi'an Jiaotong University(西安交通大学)
专题命中 VLM训练与架构 :multimodal large language model(title,abstract);分类 cs.CV、cs.AI
Comments Accepted by ACM MM 2025. First PTQ solution for Multimodal large language models applicable to 5 mainstream MLLMs
专题命中 VLM训练与架构 :LLaVA(title,abstract);分类 cs.CV、cs.AI
Comments Accepted to ICLR 2025. Code: https://github.com/ictnlp/LLaVA-Mini Model: https://huggingface.co/ICTNLP/llava-mini-llama-3.1-8b
专题命中 VLM训练与架构 :LLaVA(title,abstract);分类 cs.CV、cs.AI
Comments Project Homepage: https://llava-vl.github.io/blog/2024-08-05-llava-onevision/
专题命中 VLM训练与架构 :LLaVA(title,abstract);分类 cs.CV、cs.LG
Comments Project Page: https://llava-vl.github.io/blog/2024-06-16-llava-next-interleave/