arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视觉大模型 / VLM

视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。

共收录 5009 信号源:cs.CV, cs.AI, cs.LG

1. VLM训练与架构 5009 篇

2412.15544 2024-12-23 cs.RO cs.AI cs.CV 88%

VLM-RL: A Unified Vision Language Models and Reinforcement Learning Framework for Safe Autonomous Driving

Zilin Huang, Zihao Sheng, Yansong Qu, Junwei You, Sikai Chen

专题命中 VLM训练与架构 :VLM(title,abstract);vision language model(title);vision-language model(abstract);分类 cs.CV、cs.AI

Comments 28 pages, 16 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.14759 2024-09-24 cs.CV cs.AI 88%

VLM's Eye Examination: Instruct and Inspect Visual Competency of Vision Language Models

Nam Hyeon-Woo, Moon Ye-Bin, Wonseok Choi, Lee Hyun, Tae-Hyun Oh

专题命中 VLM训练与架构 :vision language model(title,abstract);VLM(title,abstract);分类 cs.CV、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2408.16224 2024-09-02 cs.CV cs.AI 88%

LLaVA-SG: Leveraging Scene Graphs as Visual Semantic Expression in Vision-Language Models

Jingyi Wang, Jianzhong Ju, Jian Luan, Zhidong Deng

专题命中 VLM训练与架构 :vision-language model(title,abstract);LLaVA(title);VLM(abstract);分类 cs.CV、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.07577 2024-07-11 cs.CV cs.AI 88%

IDA-VLM: Towards Movie Understanding via ID-Aware Large Vision-Language Model

Yatai Ji, Shilong Zhang, Jie Wu, Peize Sun, Weifeng Chen, Xuefeng Xiao, Sidi Yang, Yujiu Yang, Ping Luo

专题命中 VLM训练与架构 :vision-language model(title,abstract);VLM(title,abstract);分类 cs.CV、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.02292 2025-10-03 cs.CL cs.CV 88%

From Behavioral Performance to Internal Competence: Interpreting Vision-Language Models with VLM-Lens

Hala Sheta, Eric Huang, Shuyu Wu, Ilia Alenabi, Jiajun Hong, Ryker Lin, Ruoxi Ning, Daniel Wei, Jialin Yang, Jiawei Zhou, Ziqiao Ma, Freda Shi

专题命中 VLM训练与架构 :VLM(title,abstract);vision-language model(title,abstract);分类 cs.CV

Comments EMNLP 2025 System Demonstration | Code: https://github.com/compling-wat/vlm-lens

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.14260 2026-08-17 eess.IV cs.MM 新提交 88%

Personalized Digital Semantic Communication for Image Transmission with Vision-Language Models

基于视觉语言模型的图像传输个性化数字语义通信

Nan Li, Li Zhou, Haijun Wang, Jun Xiong, Haitao Zhao, Jibo Wei

专题命中 VLM训练与架构 :VLM(summary_cn,abstract);vision-language model(title,abstract)

AI总结 针对现有语义通信方案忽略接收端依赖语义的问题,提出整合VLM与LDM的PDSC框架,构建容量受限的个性化语义率失真问题,实验证实其在带宽受限场景下的源语义一致性与个性化表现优于CDDM、MoS等基线。

Comments Accepted by IEEE GLOBECOM 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.03229 2026-07-07 cs.DC 新提交 88%

HyperParallel-Mpipe: A Composable Algebra System for Optimizing MLLM Training over Supernode Clusters

HyperParallel-Mpipe:用于在超级节点集群上优化多模态大语言模型训练的可组合代数系统

Chong Li, Zhengdao Yu, Nelson Lossing, Thibaut Tachon, Pierre Leca, Etienne Filhol, Yujie Yuan, Chong Bao, Teng Su

专题命中 VLM训练与架构 :MLLM(title,summary_cn);multimodal large language model(abstract)

AI总结 分析多模态大语言模型(MLLM)训练痛点,引入Mpipe,用调度代数从紧凑调度规范推导运行时行为,得出多模态感知异构并行调度transpose,在Ascend 910C NPU集群上加速显著。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.15681 2026-06-26 cs.CL 版本更新 88%

GenRecal: Generation after Recalibration from Large to Small Vision-Language Models

GenRecal:从大到小视觉语言模型的校准后生成

Byung-Kwan Lee, Ryo Hachiuma, Yong Man Ro, Yu-Chiang Frank Wang, Yueh-Hua Wu

机构 * NVIDIA KAIST(韩国成均馆大学)

专题命中 VLM训练与架构 :VLM(summary_cn,abstract);vision-language model(title,abstract)

AI总结 提出GenRecal通用蒸馏框架,通过校准器对齐异构VLM特征,实现从大到小模型的有效知识迁移,在多个基准上超越大规模开源和闭源VLM。

Comments Project page: https://byungkwanlee.github.io/GenRecal-page/

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.23729 2026-06-23 cs.CV cs.AI cs.LG eess.IV 版本更新 88%

LUQ: Layerwise Ultra-Low Bit Quantization for Multimodal Large Language Models

LUQ: 多模态大语言模型的逐层超低位量化

Shubhang Bhatnagar, Andy Xu, Kar-Han Tan, Narendra Ahuja

机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) University of California, Los Angeles(加州大学洛杉矶分校) HP Inc.(惠普公司)

专题命中 VLM训练与架构 :LLaVA(summary_cn,abstract);multimodal large language model(title);分类 cs.CV、cs.AI、cs.LG

AI总结 提出LUQ方法,通过逐层输出激活熵衡量功能复杂度,对简单层应用超低位量化,结合多模态校准,在LLaVA-1.5和Qwen-2.5-VL上实现低于4-bit量化,内存减少40%和31%,MME性能下降<10%。

Comments Published in Transactions on Machine Learning Research (2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.05758 2026-06-05 cs.CV cs.AI cs.LG 88%

DRIFT: A Residual Flow Adapter for Decoding Continuous Outputs in Vision-Language Models

DRIFT:一种用于视觉-语言模型中连续输出解码的残差流适配器

Zhuoming Liu, Jinhong Lin, Kwan Man Cheng, Lin Zhang, Shayok Bagchi, Yin Li

机构 * University of Wisconsin–Madison(威斯康星大学麦迪逊分校) West Lafayette Jr./Sr. High School(韦斯特拉法叶高中)

专题命中 VLM训练与架构 :vision-language model(title,abstract);VLM(abstract_cn);grounding(abstract);MLLM(abstract_cn)

AI总结 提出DRIFT框架,通过结合基础预测器和基于流匹配的生成式精化模块,将预训练视觉-语言模型适配到连续解码任务,在视觉定位和机器人控制等任务上优于回归和生成方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.04509 2026-06-02 cs.CL 88%

Model-Dowser: Data-Free Importance Probing to Mitigate Catastrophic Forgetting in Multimodal Large Language Models

Model-Dowser:无数据重要性探测以缓解多模态大语言模型中的灾难性遗忘

Hyeontaek Hwang, Nguyen Dinh Son, Daeyoung Kim

专题命中 VLM训练与架构 :LLaVA(summary_cn,abstract);multimodal large language model(title,abstract)

AI总结 提出Model-Dowser,一种基于重要性评分的稀疏微调方法,通过联合考虑权重幅度、输入激活和输出敏感性来缓解多模态大语言模型微调中的灾难性遗忘,在LLaVA和NVILA上优于现有方法。

Comments Accepted at ICML 2026. Code link: https://model-dowser.github.io

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.27374 2026-05-28 cs.CL 88%

ICG: Improving Cover Image Generation via MLLM-based Prompting and Personalized Preference Alignment

ICG: 通过基于MLLM的提示和个性化偏好对齐改进封面图像生成

Zhipeng Bian, Jieming Zhu, Qijiong Liu, Wang Lin, Guohao Cai, Zhaocheng Du, Jiacheng Sun, Zhou Zhao, Zhenhua Dong

机构 * Huazhong University of Science and Technology(华中科技大学) Huawei Noah’s Ark Lab(华为诺亚实验室) Hong Kong Polytechnic University(香港理工大学) Zhejiang University(浙江大学)

专题命中 VLM训练与架构 :MLLM(title,title_cn);multimodal large language model(abstract)

AI总结 提出ICG框架,利用多模态大语言模型和扩散模型,通过元标记提取语义特征、用户嵌入个性化对齐及多奖励学习策略,实现高质量、个性化封面图像生成。

Comments Published in Proceedings of the 2025 Conference on Empirical Methods in Natural Language Processing, pages 12268-12278, EMNLP 2025. Official version: https://doi.org/10.18653/v1/2025.emnlp-main.617

Journal ref Proceedings of the 2025 Conference on Empirical Methods in Natural Language Processing (Main Track) EMNLP 2025 12268-12278

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.08461 2026-05-14 cs.LG cs.AI cs.CV hep-ex 88%

Adapting Vision-Language Models for Neutrino Event Classification in High-Energy Physics

为高能物理中的中微子事件分类适应视觉-语言模型

Dikshant Sagar, Kaiwen Yu, Alejandro Yankelevich, Jianming Bian, Pierre Baldi

机构 * Department of Computer Science, University of California, Irvine, CA, USA(计算机科学系,加州大学欧文分校,加州,美国) Department of Physics, University of California, Irvine, CA, USA(物理系,加州大学欧文分校,加州,美国)

专题命中 VLM训练与架构 :vision-language model(title,abstract);VLM(abstract,abstract_cn);vision language model(abstract);分类 cs.CV、cs.AI、cs.LG

AI总结 本文探讨了将微调后的LLaMA 3.2应用于中微子事件分类,对比了Transformer架构与CNN在准确性和鲁棒性上的表现,展示了视觉-语言模型在物理事件分类中的潜力。

Comments Accepted for publication in Communications Physics (Nature Portfolio)

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.19966 2026-04-23 cs.CV cs.AI cs.LG cs.RO 88%

DistortBench: Benchmarking Vision Language Models on Image Distortion Identification

DistortBench:用于图像失真识别的视觉语言模型基准测试

Divyanshu Goyal, Akhil Eppa, Vanya Bannihatti Kumar

机构 * Adobe Inc.(Adobe公司)

专题命中 VLM训练与架构 :VLM(summary_cn,abstract_cn);vision language model(title);vision-language model(abstract);分类 cs.CV、cs.AI、cs.LG

AI总结 本文提出DistortBench,一个用于评估视觉语言模型图像失真识别能力的基准测试,包含13500道四选一问题,涵盖27种失真类型及不同严重程度,评估18种模型,揭示当前VLM在低级感知上的不足。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.21194 2026-06-23 cs.CV cs.AI cs.CL 新提交 88%

MEDLAYXPLAIN: Benchmarking the Expert-Lay Gap in Medical Vision-Language Models

MEDLAYXPLAIN: 医学视觉语言模型中的专家-外行差距基准测试

Han Jang, Junhyeok Lee, Songsoo Kim, Chae Young Lim, Hyeonjin Goh, Heeseong Eum, Kyu Sung Choi

机构 * Seoul National University(首尔大学) Seoul National University Hospital(首尔大学医院) Seoul National University College of Medicine(首尔大学医学院) Sungkyunkwan University School of Medicine(成均馆大学医学院)

专题命中 VLM训练与架构 :vision-language model(title,abstract);VLM(summary_cn,abstract_cn);分类 cs.CV、cs.AI

AI总结 提出首个大规模医学外行语言生成基准MedLayXPlain,包含12万+区域级样本和三层UMLS本体,通过HOVER管道构建外行描述,并引入轻量级评估器MedLayEval,揭示当前医学VLM在外行可读性与临床精度间的系统性差距。

Comments 40 pages (10 pages main text, 30 pages appendix), 4 main figures, 33 vision-language models benchmarked

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.10959 2026-08-12 cs.CV cs.CR 新提交 88%

Once Poisoned, Arbitrarily Controlled: A Programmable Backdoor in VLMs

一旦投毒,任意受控:视觉语言模型(VLM)中的可编程后门

Tao Lin, Gaojie Jin, Zongxin Liu, Peng Wu, Lijia Yu

专题命中 VLM训练与架构 :VLM(title_cn,summary_cn);vision-language model(abstract);分类 cs.CV

AI总结 该研究提出一种向VLM植入可编程后门的方法,通过启发式投毒策略和特征空间触发器隐写,可在推理时动态选择未见过的目标字幕并触发对应输出,攻击成功率高且能规避部分防御。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.27646 2026-07-09 cs.CV physics.optics 新提交 88%

VLM-Aware Meta-Optic Front-End Design for Frozen Vision-Language Models

面向冻结视觉语言模型的VLM感知元光学前端设计

Chanik Kang, Raphaël Pestourie, Haejun Chung

机构 * Department of Artificial Intelligence, Hanyang University(汉阳大学人工智能系) School of Computational Science and Engineering, Georgia Institute of Technology(佐治亚理工学院计算科学与工程学院) Department of Electronic Engineering, Hanyang University(汉阳大学电子工程系)

专题命中 VLM训练与架构 :VLM(title,title_cn);vision-language model(title);分类 cs.CV

AI总结 提出CODA框架,通过可微成像和伴随梯度更新优化连续密度元光学前端,直接优化冻结CLIP分类器的交叉熵损失,在ImageNet-100上将零样本准确率从53.75%提升至65.41%,并跨模型和数据集泛化。

Comments 18 pages, 6 figures, 3 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.26770 2026-03-31 cs.CV 88%

Quantized Vision-Language Models for Damage Assessment: A Comparative Study of LLaVA-1.5-7B Quantization Levels

量化视觉-语言模型用于损伤评估:LLaVA-1.5-7B量化级别的比较研究

Takato Yasuno

专题命中 VLM训练与架构 :vision-language model(title,abstract);LLaVA(title,abstract);分类 cs.CV

AI总结 本文研究了量化视觉-语言模型在桥梁损伤评估中的应用,比较了不同量化级别在描述质量、推理速度和资源需求之间的平衡,发现Q5_K_M在质量、速度和效率上达到最佳平衡。

Comments 16 pages, 4 figures, 8 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.00479 2026-03-03 cs.CV 88%

U-VLM: Hierarchical Vision Language Modeling for Report Generation

U-VLM:用于报告生成的分层视觉语言模型

Pengcheng Shi, Minghui Zhang, Kehan Song, Jiaqi Liu, Yun Gu, Xinglin Zhang

机构 * Medical Image Insights Co. Ltd.(医疗影像洞察有限公司) Shanghai Jiao Tong University(上海交通大学)

专题命中 VLM训练与架构 :VLM(title,abstract);vision language model(title);vision-language model(abstract);分类 cs.CV

AI总结 U-VLM通过分层视觉语言建模在CT-RATE和AbdomenAtlas 3.0上实现了最先进的报告生成性能,展示了精心设计的视觉编码器预训练的重要性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.14073 2026-02-18 cs.CL cs.AI 88%

Annotation-Efficient Vision-Language Model Adaptation to the Polish Language Using the LLaVA Framework

利用LLaVA框架实现波兰语视觉-语言模型的高效标注

Grzegorz Statkiewicz, Alicja Dobrzeniecka, Karolina Seweryn, Aleksandra Krasnodębska, Karolina Piosek, Katarzyna Bogusz, Sebastian Cygert, Wojciech Kusa

机构 * NASK National Research Institute(国家研究机构NASK)

专题命中 VLM训练与架构 :vision-language model(title,abstract);LLaVA(title,abstract);分类 cs.AI

AI总结 本文提出利用LLaVA框架高效适应波兰语的视觉-语言模型,通过自动化翻译和合成数据提升多模态模型性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.08706 2026-01-13 cs.CV 88%

HiRes-LLaVA: Restoring Fragmentation Input in High-Resolution Large Vision-Language Models

HiRes-LLaVA: 高分辨率大视觉-语言模型中碎片化输入的恢复

Runhui Huang, Xinpeng Ding, Chunwei Wang, Jianhua Han, Yulong Liu, Hengshuang Zhao, Hang Xu, Lu Hou, Wei Zhang, Xiaodan Liang

机构 * Shenzhen campus of Sun Yat-sen University(中山大学深圳校区) Huawei(华为) The Hong Kong University of Science and Technology(香港科技大学) The University of Hong Kong(香港大学)

专题命中 VLM训练与架构 :vision-language model(title,abstract);LLaVA(title,abstract);分类 cs.CV

AI总结 HiRes-LLaVA通过引入SliceRestore适配器和Self-Mining Sampler,有效恢复高分辨率输入的碎片化问题,提升模型在文档相关任务中的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.18910 2025-12-23 cs.CV 88%

Delta-LLaVA: Base-then-Specialize Alignment for Token-Efficient Vision-Language Models

Delta-LLaVA: 基于令牌效率的视觉-语言模型对齐方法

Mohamad Zamini, Diksha Shukla

机构 * University of Wyoming(怀俄明大学)

专题命中 VLM训练与架构 :LLaVA(title,abstract);vision-language model(title);multimodal large language model(abstract);分类 cs.CV

AI总结 Delta-LLaVA通过低秩Delta投影和轻量级Transformer块实现视觉-语言模型的高效对齐,提升推理速度和训练效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.19155 2025-11-25 cs.AI 88%

EEG-VLM: A Hierarchical Vision-Language Model with Multi-Level Feature Alignment and Visually Enhanced Language-Guided Reasoning for EEG Image-Based Sleep Stage Prediction

EEG-VLM:一种具有多级特征对齐和视觉增强语言引导推理的分层视觉-语言模型,用于基于EEG图像的睡眠阶段预测

Xihe Qiu, Gengchen Ma, Haoyu Wang, Chen Zhan, Xiaoyu Tan, Shuo Li

机构 * School of Electronic and Electrical Engineering, Shanghai University of Engineering Science(上海工程技术大学电子与电气工程学院) Department of Control Science and Engineering, College of Electronics and Information Engineering, Tongji University(同济大学电子信息工程学院控制科学与工程系) Tencent Youtu Lab(腾讯云视觉实验室) Case Western Reserve University(凯斯西储大学)

专题命中 VLM训练与架构 :vision-language model(title,abstract);VLM(title,abstract);分类 cs.AI

AI总结 EEG-VLM通过多级特征对齐和视觉增强语言引导推理,提升基于EEG图像的睡眠阶段分类的准确性和可解释性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.16229 2025-11-21 cs.CR cs.AI 88%

Q-MLLM: Vector Quantization for Robust Multimodal Large Language Model Security

Q-MLLM:向量量化用于鲁棒多模态大语言模型安全

Wei Zhao, Zhe Li, Yige Li, Jun Sun

机构 * Singapore Management University(新加坡管理大学)

专题命中 VLM训练与架构 :multimodal large language model(title,abstract);MLLM(title,abstract);分类 cs.AI

AI总结 Q-MLLM通过两级向量量化提升多模态大语言模型的安全性,有效防御对抗性攻击并保持模型实用性。

Comments Accepted by NDSS 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.13647 2025-11-18 cs.CV 88%

Part-X-MLLM: Part-aware 3D Multimodal Large Language Model

Chunshi Wang, Junliang Ye, Yunhan Yang, Yang Li, Zizhuo Lin, Jun Zhu, Zhuo Chen, Yawei Luo, Chunchao Guo

机构 * Zhejiang University(浙江大学) Tencent Hunyuan(腾讯文言) Tsinghua University(清华大学) The University of Hong Kong(香港大学)

专题命中 VLM训练与架构 :multimodal large language model(title,abstract);MLLM(title,abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.04351 2025-10-14 cs.RO cs.AI 88%

MLLM-Fabric: Multimodal Large Language Model-Driven Robotic Framework for Fabric Sorting and Selection

Liman Wang, Hanyang Zhong, Tianyuan Wang, Shan Luo, Jihong Zhu

机构 * School of Physics, Engineering and Technology, University of York(物理、工程与技术学院,约克大学) Department of Engineering, King’s College London(工程学院,伦敦国王学院)

专题命中 VLM训练与架构 :multimodal large language model(title,abstract);MLLM(title,abstract);分类 cs.AI

Comments Accepted to IEEE Robotics and Automation Letters (RAL)

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.09061 2025-08-13 cs.CV 88%

VLM-3D:End-to-End Vision-Language Models for Open-World 3D Perception

Fuhao Chang, Shuxin Li, Yabei Li, Lei He

机构 * School of Vehicle and Mobility, Tsinghua University(清华大学车辆与移动性学院) State Key Laboratory of Intelligent Green Vehicle and Mobility, Tsinghua University(清华大学智能绿色车辆与移动性国家重点实验室) College of Information and Electrical Engineering, China Agricultural University(中国农业大学信息与电气工程学院) School of Statistics and Data Science, Southwestern University of Finance and Economics(西南财经大学统计与数据科学学院) Meituan, China(美团(中国))

专题命中 VLM训练与架构 :VLM(title,abstract);vision-language model(title);visual language model(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.10282 2025-06-13 cs.LG 88%

Graph-MLLM: Harnessing Multimodal Large Language Models for Multimodal Graph Learning

Jiajin Liu, Dongzhe Fan, Jiacheng Shen, Chuanhao Ji, Daochen Zha, Qiaoyu Tan

机构 * New York University Shanghai(纽约大学上海校区) University of Chinese Academy of Sciences(中国科学院大学) Rice University(德克萨斯大学里德学院)

专题命中 VLM训练与架构 :multimodal large language model(title,abstract);MLLM(title,abstract);分类 cs.LG

Comments 16 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.19474 2025-05-27 cs.AI 88%

Causal-LLaVA: Causal Disentanglement for Mitigating Hallucination in Multimodal Large Language Models

Xinmiao Hu, Chun Wang, Ruihe An, ChenYu Shao, Xiaojun Ye, Sheng Zhou, Liangcheng Li

机构 * Zhejiang University(浙江大学)

专题命中 VLM训练与架构 :LLaVA(title,abstract);multimodal large language model(title,abstract);分类 cs.AI

Comments 21 pages, 19 figures, Submitted to NeurIPS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.08119 2025-02-25 cs.CV 88%

Q-VLM: Post-training Quantization for Large Vision-Language Models

Changyuan Wang, Ziwei Wang, Xiuwei Xu, Yansong Tang, Jie Zhou, Jiwen Lu

专题命中 VLM训练与架构 :vision-language model(title,abstract);VLM(title);LLaVA(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏