Behind Maya: Building a Multilingual Vision Language Model
专题命中 VLM训练与架构 :vision language model(title);vision-language model(abstract);VLM(abstract);LLaVA(abstract)
Comments Accepted at VLMs4ALL CVPR 2025 Workshop; corrected workshop name spelling
AI 大模型
视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。
专题命中 VLM训练与架构 :vision language model(title);vision-language model(abstract);VLM(abstract);LLaVA(abstract)
Comments Accepted at VLMs4ALL CVPR 2025 Workshop; corrected workshop name spelling
机构 * Department of Population Health, University of Oxford(牛津大学流行病学与健康统计学系) ; University of Oxford(牛津大学) ; School of Epidemiology and Health Statistics, Chengdu Medical College(成都医学院流行病学与健康统计学系)
专题命中 VLM训练与架构 :vision-language model(title,abstract);vision language model(abstract);VLM(abstract);分类 cs.CV
专题命中 VLM训练与架构 :vision-language model(title,abstract);VLM(abstract);LLaVA(abstract);分类 cs.AI
Comments Accepted by USENIX'25; 22 pages, 28 figures;
专题命中 VLM训练与架构 :vision language model(title,abstract);VLM(abstract);LLaVA(abstract);分类 cs.CV
专题命中 VLM训练与架构 :multimodal large language model(title,abstract);LLaVA(abstract);MLLM(abstract);分类 cs.CV
专题命中 VLM训练与架构 :LLaVA(title,abstract);grounding(abstract);multimodal large language model(abstract);分类 cs.CV
专题命中 VLM训练与架构 :multimodal large language model(title,abstract);LLaVA(abstract);MLLM(abstract);分类 cs.CV
Comments Accepted to AAAI2025
专题命中 VLM训练与架构 :vision-language model(title,abstract);vision language model(abstract);LLaVA(abstract);分类 cs.AI
专题命中 VLM训练与架构 :multimodal large language model(title,abstract);LLaVA(abstract);MLLM(abstract);分类 cs.CV
Comments Technical report, 18 pages
专题命中 VLM训练与架构 :multimodal large language model(title,abstract);LLaVA(abstract);MLLM(abstract);分类 cs.CV
专题命中 VLM训练与架构 :LLaVA(title,abstract);grounding(abstract);multimodal large language model(abstract);分类 cs.CV
专题命中 VLM训练与架构 :multimodal large language model(title,abstract);LLaVA(abstract);MLLM(abstract);分类 cs.CV
专题命中 VLM训练与架构 :visual language model(title);vision language model(abstract);VLM(abstract);LLaVA(abstract)
专题命中 VLM训练与架构 :visual language model(title,abstract);vision language model(abstract);VLM(abstract);分类 cs.CV
Journal ref Computers & Graphics 124C (2024) 104048
专题命中 VLM训练与架构 :vision language model(title);vision-language model(abstract);VLM(abstract);LLaVA(abstract)
Comments Under Submission
专题命中 VLM训练与架构 :vision language model(title,abstract);vision-language model(abstract);VLM(abstract);分类 cs.CV
专题命中 VLM训练与架构 :vision language model(title,abstract);VLM(abstract);LLaVA(abstract);分类 cs.CV
Comments Outstanding Champion & Innovation Award @ CARLA Autonomous Driving Challenge 2024; Project video: https://youtu.be/E1nsEgcHRuc
专题命中 VLM训练与架构 :visual language model(title,abstract);VLM(abstract);LLaVA(abstract);分类 cs.CV
Comments CVPR 2024
专题命中 VLM训练与架构 :multimodal large language model(title,abstract);LLaVA(abstract);MLLM(abstract);分类 cs.CV
专题命中 VLM训练与架构 :vision-language model(title,abstract);VLM(abstract);visual language model(abstract);分类 cs.CV
专题命中 VLM训练与架构 :LLaVA(title,abstract);multimodal large language model(abstract);MLLM(abstract);分类 cs.CV
专题命中 VLM训练与架构 :vision-language model(title,journal_ref);VLM(abstract);LLaVA(abstract);分类 cs.CV、cs.AI、cs.LG
Journal ref ICLR 2025, BlueSuffix: Reinforced Blue Teaming for Vision-Language Models Against Jailbreak Attacks. In Proceedings of the International Conference on Learning Representations (ICLR), 2025
专题命中 VLM训练与架构 :LLaVA(title,abstract);vision-language model(abstract);分类 cs.CV、cs.AI、cs.LG
Comments 25 pages, 25M file size. Project Page: https://llava-vl.github.io/llava-plus/
专题命中 VLM训练与架构 :vision-language model(title,abstract);VLM(abstract,comments);分类 cs.CV、cs.AI、cs.LG
Comments Published at International Conference on Computer Vision (ICCV) 2023. Poster at https://xuanlinli17.github.io/pdfs/iccv23_large_vlm_distillation_poster.pdf
专题命中 VLM训练与架构 :vision-language model(title,abstract);VLM(abstract,comments);分类 cs.CV、cs.AI、cs.LG
Comments IJCV minor revision; 16 pages; code: https://github.com/Imbalance-VLM/Imbalance-VLM
用于视觉令牌剪枝的AI4AI框架
专题命中 VLM训练与架构 :MLLM(summary_cn,abstract);multimodal large language model(abstract);分类 cs.CV、cs.LG
AI总结 本研究提出AutoPrune框架,通过TPDSL让LLM自动设计视觉令牌剪枝策略,在14个多模态基准和3个MLLM主干上,剪枝94.4%视觉令牌仍保留超99%性能,大幅降低推理成本。
TransVLM:一种用于检测任意 shot 转换的视觉-语言框架和基准
机构 * University of Melbourne(墨尔本大学) ; HeyGen Research(HeyGen研究院) ; Nanyang Technological University(南洋理工大学)
专题命中 VLM训练与架构 :VLM(summary_cn,abstract);vision-language model(abstract);分类 cs.CV、cs.AI
AI总结 TransVLM 提出了一种视觉-语言框架,通过注入光流作为关键运动先验,提升对任意 shot 转换的检测能力,同时设计了可扩展的数据引擎和基准测试,实验表明其性能优于传统方法和现有 VLM。
Comments v2: Corrected an inaccurate statement in the abstract regarding production deployment. Accepted by ECCV 2026. For more related research, please visit HeyGen Research (https://www.heygen.com/research) and HeyGen Avatar-V (https://www.heygen.com/research/avatar-v-model). Project page: https://chence17.github.io/TransVLM/
基于OpenStreetMap的领域自适应方法:为遥感VLMs的领域适应
机构 * INSAIT, Sofia University ``St. Kliment Ohridski''(INSAIT,索菲亚大学『圣克莱门特·奥赫里德斯』)
专题命中 VLM训练与架构 :VLM(summary_cn,abstract);vision-language model(abstract);分类 cs.CV、cs.LG
AI总结 本文提出OSMDA方法,利用OpenStreetMap数据生成自标注数据,无需人工标注或强外部模型,通过细调基础VLM实现遥感领域适应,经10个基准测试显示其在文本生成任务中达到SOTA,且训练成本更低。
RefineSVG:视觉反馈驱动的图像转SVG生成强化学习
机构 * Shenzhen University(深圳大学) ; Peking University(北京大学)
专题命中 VLM训练与架构 :MLLM(summary_cn,abstract);multimodal large language model(abstract);分类 cs.CV、cs.AI
AI总结 RefineSVG是一种视觉反馈驱动的闭环框架,通过引入SVG语义词汇表和渐进式训练,使MLLM实现高保真图像转SVG生成,性能优于现有基线。
Comments 17 pages, 5 main-paper figures. Accepted at the 34th ACM International Conference on Multimedia (ACM MM 2026). Includes the complete supplementary material
用基于树图解析支持的加权班扎夫交互解释生物医学CLIP
机构 * University of Warsaw(华沙大学) ; Centre for Credible AI, Warsaw University of Technology(华沙理工大学可信人工智能中心)
专题命中 VLM训练与架构 :VLM(summary_cn,abstract);vision-language model(abstract);分类 cs.CV、cs.AI
AI总结 研究针对视觉语言模型在医学任务中解释难的问题,引入ParseFIxLIP方法,将树图解析融入班扎夫交互博弈,通过smart_depth分组策略减轻概念碎片化,提升跨模态交互可解释性,为VLM决策提供医学领域相关见解。
Comments 12 pages, 13 figures. Accepted at EXPLIMED 2026 (Third Workshop on Explainable Artificial Intelligence for the medical domain), IJCAI-ECAI 2026