VLM-RL: A Unified Vision Language Models and Reinforcement Learning Framework for Safe Autonomous Driving
专题命中 VLM训练与架构 :VLM(title,abstract);vision language model(title);vision-language model(abstract);分类 cs.CV、cs.AI
Comments 28 pages, 16 figures
AI 大模型
视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。
专题命中 VLM训练与架构 :VLM(title,abstract);vision language model(title);vision-language model(abstract);分类 cs.CV、cs.AI
Comments 28 pages, 16 figures
专题命中 VLM训练与架构 :vision language model(title,abstract);VLM(title,abstract);分类 cs.CV、cs.AI
专题命中 VLM训练与架构 :vision-language model(title,abstract);LLaVA(title);VLM(abstract);分类 cs.CV、cs.AI
专题命中 VLM训练与架构 :vision-language model(title,abstract);VLM(title,abstract);分类 cs.CV、cs.AI
专题命中 VLM训练与架构 :VLM(title,abstract);vision-language model(title,abstract);分类 cs.CV
Comments EMNLP 2025 System Demonstration | Code: https://github.com/compling-wat/vlm-lens
基于视觉语言模型的图像传输个性化数字语义通信
专题命中 VLM训练与架构 :VLM(summary_cn,abstract);vision-language model(title,abstract)
AI总结 针对现有语义通信方案忽略接收端依赖语义的问题,提出整合VLM与LDM的PDSC框架,构建容量受限的个性化语义率失真问题,实验证实其在带宽受限场景下的源语义一致性与个性化表现优于CDDM、MoS等基线。
Comments Accepted by IEEE GLOBECOM 2026
HyperParallel-Mpipe:用于在超级节点集群上优化多模态大语言模型训练的可组合代数系统
专题命中 VLM训练与架构 :MLLM(title,summary_cn);multimodal large language model(abstract)
AI总结 分析多模态大语言模型(MLLM)训练痛点,引入Mpipe,用调度代数从紧凑调度规范推导运行时行为,得出多模态感知异构并行调度transpose,在Ascend 910C NPU集群上加速显著。
GenRecal:从大到小视觉语言模型的校准后生成
机构 * NVIDIA ; KAIST(韩国成均馆大学)
专题命中 VLM训练与架构 :VLM(summary_cn,abstract);vision-language model(title,abstract)
AI总结 提出GenRecal通用蒸馏框架,通过校准器对齐异构VLM特征,实现从大到小模型的有效知识迁移,在多个基准上超越大规模开源和闭源VLM。
Comments Project page: https://byungkwanlee.github.io/GenRecal-page/
LUQ: 多模态大语言模型的逐层超低位量化
机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) ; University of California, Los Angeles(加州大学洛杉矶分校) ; HP Inc.(惠普公司)
专题命中 VLM训练与架构 :LLaVA(summary_cn,abstract);multimodal large language model(title);分类 cs.CV、cs.AI、cs.LG
AI总结 提出LUQ方法,通过逐层输出激活熵衡量功能复杂度,对简单层应用超低位量化,结合多模态校准,在LLaVA-1.5和Qwen-2.5-VL上实现低于4-bit量化,内存减少40%和31%,MME性能下降<10%。
Comments Published in Transactions on Machine Learning Research (2026)
DRIFT:一种用于视觉-语言模型中连续输出解码的残差流适配器
机构 * University of Wisconsin–Madison(威斯康星大学麦迪逊分校) ; West Lafayette Jr./Sr. High School(韦斯特拉法叶高中)
专题命中 VLM训练与架构 :vision-language model(title,abstract);VLM(abstract_cn);grounding(abstract);MLLM(abstract_cn)
AI总结 提出DRIFT框架,通过结合基础预测器和基于流匹配的生成式精化模块,将预训练视觉-语言模型适配到连续解码任务,在视觉定位和机器人控制等任务上优于回归和生成方法。
Model-Dowser:无数据重要性探测以缓解多模态大语言模型中的灾难性遗忘
专题命中 VLM训练与架构 :LLaVA(summary_cn,abstract);multimodal large language model(title,abstract)
AI总结 提出Model-Dowser,一种基于重要性评分的稀疏微调方法,通过联合考虑权重幅度、输入激活和输出敏感性来缓解多模态大语言模型微调中的灾难性遗忘,在LLaVA和NVILA上优于现有方法。
Comments Accepted at ICML 2026. Code link: https://model-dowser.github.io
ICG: 通过基于MLLM的提示和个性化偏好对齐改进封面图像生成
机构 * Huazhong University of Science and Technology(华中科技大学) ; Huawei Noah’s Ark Lab(华为诺亚实验室) ; Hong Kong Polytechnic University(香港理工大学) ; Zhejiang University(浙江大学)
专题命中 VLM训练与架构 :MLLM(title,title_cn);multimodal large language model(abstract)
AI总结 提出ICG框架,利用多模态大语言模型和扩散模型,通过元标记提取语义特征、用户嵌入个性化对齐及多奖励学习策略,实现高质量、个性化封面图像生成。
Comments Published in Proceedings of the 2025 Conference on Empirical Methods in Natural Language Processing, pages 12268-12278, EMNLP 2025. Official version: https://doi.org/10.18653/v1/2025.emnlp-main.617
Journal ref Proceedings of the 2025 Conference on Empirical Methods in Natural Language Processing (Main Track) EMNLP 2025 12268-12278
为高能物理中的中微子事件分类适应视觉-语言模型
机构 * Department of Computer Science, University of California, Irvine, CA, USA(计算机科学系,加州大学欧文分校,加州,美国) ; Department of Physics, University of California, Irvine, CA, USA(物理系,加州大学欧文分校,加州,美国)
专题命中 VLM训练与架构 :vision-language model(title,abstract);VLM(abstract,abstract_cn);vision language model(abstract);分类 cs.CV、cs.AI、cs.LG
AI总结 本文探讨了将微调后的LLaMA 3.2应用于中微子事件分类,对比了Transformer架构与CNN在准确性和鲁棒性上的表现,展示了视觉-语言模型在物理事件分类中的潜力。
Comments Accepted for publication in Communications Physics (Nature Portfolio)
DistortBench:用于图像失真识别的视觉语言模型基准测试
机构 * Adobe Inc.(Adobe公司)
专题命中 VLM训练与架构 :VLM(summary_cn,abstract_cn);vision language model(title);vision-language model(abstract);分类 cs.CV、cs.AI、cs.LG
AI总结 本文提出DistortBench,一个用于评估视觉语言模型图像失真识别能力的基准测试,包含13500道四选一问题,涵盖27种失真类型及不同严重程度,评估18种模型,揭示当前VLM在低级感知上的不足。
MEDLAYXPLAIN: 医学视觉语言模型中的专家-外行差距基准测试
机构 * Seoul National University(首尔大学) ; Seoul National University Hospital(首尔大学医院) ; Seoul National University College of Medicine(首尔大学医学院) ; Sungkyunkwan University School of Medicine(成均馆大学医学院)
专题命中 VLM训练与架构 :vision-language model(title,abstract);VLM(summary_cn,abstract_cn);分类 cs.CV、cs.AI
AI总结 提出首个大规模医学外行语言生成基准MedLayXPlain,包含12万+区域级样本和三层UMLS本体,通过HOVER管道构建外行描述,并引入轻量级评估器MedLayEval,揭示当前医学VLM在外行可读性与临床精度间的系统性差距。
Comments 40 pages (10 pages main text, 30 pages appendix), 4 main figures, 33 vision-language models benchmarked
一旦投毒,任意受控:视觉语言模型(VLM)中的可编程后门
专题命中 VLM训练与架构 :VLM(title_cn,summary_cn);vision-language model(abstract);分类 cs.CV
AI总结 该研究提出一种向VLM植入可编程后门的方法,通过启发式投毒策略和特征空间触发器隐写,可在推理时动态选择未见过的目标字幕并触发对应输出,攻击成功率高且能规避部分防御。
面向冻结视觉语言模型的VLM感知元光学前端设计
机构 * Department of Artificial Intelligence, Hanyang University(汉阳大学人工智能系) ; School of Computational Science and Engineering, Georgia Institute of Technology(佐治亚理工学院计算科学与工程学院) ; Department of Electronic Engineering, Hanyang University(汉阳大学电子工程系)
专题命中 VLM训练与架构 :VLM(title,title_cn);vision-language model(title);分类 cs.CV
AI总结 提出CODA框架,通过可微成像和伴随梯度更新优化连续密度元光学前端,直接优化冻结CLIP分类器的交叉熵损失,在ImageNet-100上将零样本准确率从53.75%提升至65.41%,并跨模型和数据集泛化。
Comments 18 pages, 6 figures, 3 tables
量化视觉-语言模型用于损伤评估:LLaVA-1.5-7B量化级别的比较研究
专题命中 VLM训练与架构 :vision-language model(title,abstract);LLaVA(title,abstract);分类 cs.CV
AI总结 本文研究了量化视觉-语言模型在桥梁损伤评估中的应用,比较了不同量化级别在描述质量、推理速度和资源需求之间的平衡,发现Q5_K_M在质量、速度和效率上达到最佳平衡。
Comments 16 pages, 4 figures, 8 tables
U-VLM:用于报告生成的分层视觉语言模型
机构 * Medical Image Insights Co. Ltd.(医疗影像洞察有限公司) ; Shanghai Jiao Tong University(上海交通大学)
专题命中 VLM训练与架构 :VLM(title,abstract);vision language model(title);vision-language model(abstract);分类 cs.CV
AI总结 U-VLM通过分层视觉语言建模在CT-RATE和AbdomenAtlas 3.0上实现了最先进的报告生成性能,展示了精心设计的视觉编码器预训练的重要性。
利用LLaVA框架实现波兰语视觉-语言模型的高效标注
机构 * NASK National Research Institute(国家研究机构NASK)
专题命中 VLM训练与架构 :vision-language model(title,abstract);LLaVA(title,abstract);分类 cs.AI
AI总结 本文提出利用LLaVA框架高效适应波兰语的视觉-语言模型,通过自动化翻译和合成数据提升多模态模型性能。
HiRes-LLaVA: 高分辨率大视觉-语言模型中碎片化输入的恢复
机构 * Shenzhen campus of Sun Yat-sen University(中山大学深圳校区) ; Huawei(华为) ; The Hong Kong University of Science and Technology(香港科技大学) ; The University of Hong Kong(香港大学)
专题命中 VLM训练与架构 :vision-language model(title,abstract);LLaVA(title,abstract);分类 cs.CV
AI总结 HiRes-LLaVA通过引入SliceRestore适配器和Self-Mining Sampler,有效恢复高分辨率输入的碎片化问题,提升模型在文档相关任务中的性能。
Delta-LLaVA: 基于令牌效率的视觉-语言模型对齐方法
机构 * University of Wyoming(怀俄明大学)
专题命中 VLM训练与架构 :LLaVA(title,abstract);vision-language model(title);multimodal large language model(abstract);分类 cs.CV
AI总结 Delta-LLaVA通过低秩Delta投影和轻量级Transformer块实现视觉-语言模型的高效对齐,提升推理速度和训练效率。
EEG-VLM:一种具有多级特征对齐和视觉增强语言引导推理的分层视觉-语言模型,用于基于EEG图像的睡眠阶段预测
机构 * School of Electronic and Electrical Engineering, Shanghai University of Engineering Science(上海工程技术大学电子与电气工程学院) ; Department of Control Science and Engineering, College of Electronics and Information Engineering, Tongji University(同济大学电子信息工程学院控制科学与工程系) ; Tencent Youtu Lab(腾讯云视觉实验室) ; Case Western Reserve University(凯斯西储大学)
专题命中 VLM训练与架构 :vision-language model(title,abstract);VLM(title,abstract);分类 cs.AI
AI总结 EEG-VLM通过多级特征对齐和视觉增强语言引导推理,提升基于EEG图像的睡眠阶段分类的准确性和可解释性。
Q-MLLM:向量量化用于鲁棒多模态大语言模型安全
机构 * Singapore Management University(新加坡管理大学)
专题命中 VLM训练与架构 :multimodal large language model(title,abstract);MLLM(title,abstract);分类 cs.AI
AI总结 Q-MLLM通过两级向量量化提升多模态大语言模型的安全性,有效防御对抗性攻击并保持模型实用性。
Comments Accepted by NDSS 2026
机构 * Zhejiang University(浙江大学) ; Tencent Hunyuan(腾讯文言) ; Tsinghua University(清华大学) ; The University of Hong Kong(香港大学)
专题命中 VLM训练与架构 :multimodal large language model(title,abstract);MLLM(title,abstract);分类 cs.CV
机构 * School of Physics, Engineering and Technology, University of York(物理、工程与技术学院,约克大学) ; Department of Engineering, King’s College London(工程学院,伦敦国王学院)
专题命中 VLM训练与架构 :multimodal large language model(title,abstract);MLLM(title,abstract);分类 cs.AI
Comments Accepted to IEEE Robotics and Automation Letters (RAL)
机构 * School of Vehicle and Mobility, Tsinghua University(清华大学车辆与移动性学院) ; State Key Laboratory of Intelligent Green Vehicle and Mobility, Tsinghua University(清华大学智能绿色车辆与移动性国家重点实验室) ; College of Information and Electrical Engineering, China Agricultural University(中国农业大学信息与电气工程学院) ; School of Statistics and Data Science, Southwestern University of Finance and Economics(西南财经大学统计与数据科学学院) ; Meituan, China(美团(中国))
专题命中 VLM训练与架构 :VLM(title,abstract);vision-language model(title);visual language model(abstract);分类 cs.CV
机构 * New York University Shanghai(纽约大学上海校区) ; University of Chinese Academy of Sciences(中国科学院大学) ; Rice University(德克萨斯大学里德学院)
专题命中 VLM训练与架构 :multimodal large language model(title,abstract);MLLM(title,abstract);分类 cs.LG
Comments 16 pages, 4 figures
机构 * Zhejiang University(浙江大学)
专题命中 VLM训练与架构 :LLaVA(title,abstract);multimodal large language model(title,abstract);分类 cs.AI
Comments 21 pages, 19 figures, Submitted to NeurIPS 2025
专题命中 VLM训练与架构 :vision-language model(title,abstract);VLM(title);LLaVA(abstract);分类 cs.CV