arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视觉大模型 / VLM

视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。

共收录 5009 信号源:cs.CV, cs.AI, cs.LG

1. VLM训练与架构 5009 篇

2505.19707 2025-05-27 cs.CV cs.IR 89%

MLLM-Guided VLM Fine-Tuning with Joint Inference for Zero-Shot Composed Image Retrieval

Rong-Cheng Tu, Zhao Jin, Jingyi Liao, Xiao Luo, Yingjie Wang, Li Shen, Dacheng Tao

机构 * College of Computing and Data Science, Nanyang Technological University, Singapore(南洋理工大学计算机与数据科学学院) Department of Computer Science, University of California, Los Angeles, USA(加州大学洛杉矶分校计算机科学系) Sun Yat-sen University Shenzhen Campus, School of Cyber Science and Technology, Shenzhen, China(中山大学深圳校区信息科学与技术学院)

专题命中 VLM训练与架构 :VLM(title,abstract);MLLM(title,abstract);multimodal large language model(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2408.11795 2025-04-08 cs.CV 89%

EE-MLLM: A Data-Efficient and Compute-Efficient Multimodal Large Language Model

Feipeng Ma, Yizhou Zhou, Zheyu Zhang, Shilin Yan, Hebei Li, Zilong He, Siying Wu, Fengyun Rao, Yueyi Zhang, Xiaoyan Sun

专题命中 VLM训练与架构 :multimodal large language model(title,abstract);MLLM(title,abstract);LLaVA(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.13871 2025-03-20 cs.CV 89%

LLaVA-UHD v2: an MLLM Integrating High-Resolution Semantic Pyramid via Hierarchical Window Transformer

Yipeng Zhang, Yifan Liu, Zonghao Guo, Yidan Zhang, Xuesong Yang, Xiaoying Zhang, Chi Chen, Jun Song, Bo Zheng, Yuan Yao, Zhiyuan Liu, Tat-Seng Chua, Maosong Sun

专题命中 VLM训练与架构 :LLaVA(title,abstract);MLLM(title,abstract);multimodal large language model(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.08202 2025-03-14 cs.CV cs.CL 89%

Mono-InternVL: Pushing the Boundaries of Monolithic Multimodal Large Language Models with Endogenous Visual Pre-training

Gen Luo, Xue Yang, Wenhan Dou, Zhaokai Wang, Jiawen Liu, Jifeng Dai, Yu Qiao, Xizhou Zhu

专题命中 VLM训练与架构 :InternVL(title,abstract);multimodal large language model(title,abstract);MLLM(abstract);分类 cs.CV

Comments Accepted by CVPR 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2408.05924 2025-01-22 cs.RO cs.AI 89%

Space-LLaVA: a Vision-Language Model Adapted to Extraterrestrial Applications

Matthew Foutter, Daniele Gammelli, Justin Kruger, Ethan Foss, Praneet Bhoj, Tommaso Guffanti, Simone D'Amico, Marco Pavone

专题命中 VLM训练与架构 :vision-language model(title,abstract);LLaVA(title,abstract);VLM(abstract);分类 cs.AI

Comments Accepted to IEEE Aerospace Conference, 23 pages, 18 figures, 3 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2402.06264 2024-09-19 cs.AI cs.CL cs.SI 89%

LLaVA-Docent: Instruction Tuning with Multimodal Large Language Model to Support Art Appreciation Education

Unggi Lee, Minji Jeon, Yunseo Lee, Gyuri Byun, Yoorim Son, Jaeyoon Shin, Hongkyu Ko, Hyeoncheol Kim

专题命中 VLM训练与架构 :LLaVA(title,abstract);multimodal large language model(title,abstract);MLLM(abstract);分类 cs.AI

Comments 37 pages, 4 figures, 10 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.02333 2024-07-03 cs.CL cs.CV 89%

Why do LLaVA Vision-Language Models Reply to Images in English?

Musashi Hinck, Carolin Holtermann, Matthew Lyle Olson, Florian Schneider, Sungduk Yu, Anahita Bhiwandiwalla, Anne Lauscher, Shaoyen Tseng, Vasudev Lal

专题命中 VLM训练与架构 :vision-language model(title,abstract);LLaVA(title,abstract);VLM(abstract);分类 cs.CV

Comments Pre-print

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.00876 2025-03-24 cs.CV cs.AI cs.CL cs.LG 89%

Dynamic-LLaVA: Efficient Multimodal Large Language Models via Dynamic Vision-language Context Sparsification

Wenxuan Huang, Zijie Zhai, Yunhang Shen, Shaosheng Cao, Fei Zhao, Xiangfeng Xu, Zheyu Ye, Yao Hu, Shaohui Lin

专题命中 VLM训练与架构 :LLaVA(title,abstract);multimodal large language model(title,abstract);分类 cs.CV、cs.AI、cs.LG

Comments Accepted to ICLR 2025. Code is available at https://github.com/Osilly/dynamic_llava

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.04454 2026-08-06 cs.CV cs.LG 新提交 89%

Beyond Global Routing Aggregation: Phase-Aware Expert Merging for MoE Vision-Language Models

超越全局路由聚合:面向MoE视觉-语言模型的阶段感知专家合并

Hongyu Zhang, Cheng Yan, Xiang Xia, Wuyang Zhang

专题命中 VLM训练与架构 :VLM(summary_cn,abstract);vision-language model(title,abstract);分类 cs.CV、cs.LG

AI总结 针对MoE-VLM全局路由聚合导致专家角色混淆的问题,提出无需训练的RoleMerge方法,通过阶段归一化路由统计合并专家,在匹配专家保留比例下性能优于现有方法,六任务宏平均相对提升最高9.6%。

Comments 17 pages, 3 figures, 17 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.03428 2026-08-05 cs.CV cs.AI 新提交 89%

OliveGemma: A 3 Billion Visual Language Model for Recognising the Mediterranean & European Diet

OliveGemma:一款用于识别地中海与欧洲饮食的30亿参数视觉语言模型

Dimitrios I. Zaridis, Traianos Tsiokris, Vasileios C. Pezoulas, Daphni Plati, Eugenia Mylona, Eleni Georga, Nikos Tsiknakis, Antonis Sakellarios, Dimitrios I. Fotiadis

专题命中 VLM训练与架构 :VLM(summary_cn,abstract);visual language model(title);vision language model(abstract);分类 cs.CV、cs.AI

AI总结 本研究构建基于PaliGemma-2-3B的OliveGemma,经LoRA微调后在欧洲饮食识别任务上超越多数前沿模型,仅逊于DenseNet-121,小型VLM经PEFT适配可在专业任务超越大模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.24516 2026-07-28 cs.CV cs.AI 新提交 89%

DecoupleMix: Decoupled Ratio Search and Convex Allocation for Scalable VLM Data Recipes

DecoupleMix:用于可扩展视觉语言模型数据配方的解耦比率搜索和凸分配

Jiahao Xie, Zhongbin Guo, Qianle Wang, Ruiqi Lu, Dongling Xiao, Wanxuan Sun, Cheng Yang

机构 * ByteDance(字节跳动)

专题命中 VLM训练与架构 :VLM(title,summary_cn);vision language model(abstract);分类 cs.CV、cs.AI

AI总结 该研究针对视觉语言模型数据构建缺乏原则性标准的问题,提出DecoupleMix框架,将其解耦为类间比率搜索和类内凸分配两个子问题,实验证明该方法优于启发式基线,且最优比率可跨规模转移,提升了VLM竞争力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.05981 2026-07-16 cs.CV cs.LG 版本更新 89%

Inverting the Streaming-Diffusion Bottleneck: Video-Rate MLLM-Conditioned Edit Diffusion on a Consumer GPU

基于视觉感知的多模态大语言模型条件编辑扩散的视频率流式风格化:蒸馏UNet + MLLM文本编码器上的非对称批处理推理

Yoshiyuki Ootani

机构 * Independent researcher(独立研究员)

专题命中 VLM训练与架构 :MLLM(title,title_cn);multimodal large language model(abstract);分类 cs.CV、cs.LG

AI总结 针对蒸馏扩散模型中文本编码器成为瓶颈的问题,提出一种结合非对称CUDA流水线、编译友好的ControlNet-LLLite重构和周期性条件刷新调度的流式管线,在消费级GPU上实现视频率实时风格化编辑。

Comments 14 pages, 4 figures, 13 tables. Code, evaluation harness, and the released Temporal LLLite adapter weights are at https://github.com/otanl/dreamlite-stream (also mirrored to Hugging Face and Zenodo)

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.09520 2026-07-13 cs.CV cs.AI 新提交 89%

Seeing is Free, Speaking is Not: Uncovering the True Energy Bottleneck in Edge VLM Inference

眼见无需耗能,言语却要代价:揭示边缘视觉语言模型推理中的真正能量瓶颈

Junfei Zhan, Haoxun Shen, Mingang Guo, Zixuan Huang, Tengjiao He

机构 * University of Pennsylvania(宾夕法尼亚大学) Shenzhen Institutes of Advanced Technology, Chinese Academy of Sciences(中国科学院深圳先进技术研究院) Jinan University(暨南大学)

专题命中 VLM训练与架构 :VLM(title,summary_cn);vision-language model(abstract);分类 cs.CV、cs.AI

AI总结 研究边缘VLM推理的能量瓶颈,通过系统能量分析发现平均推理功率恒定,输出令牌耗时多是关键,图像复杂度因输出长度影响能量,揭示视觉令牌修剪局限,控制输出长度能大幅节能。

Comments Accepted to ACM MM 2026. 10 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.00283 2026-07-02 cs.RO cs.AI cs.CV 新提交 89%

What's Hidden Matters: Identifying Planning-Critical Occluded Agents using Vision-Language Models

隐藏之物至关重要:使用视觉语言模型识别规划关键性的被遮挡智能体

Amirhosein Chahe, Tyler Naes, Jovin D'sa, Faizan M. Tariq, Sangjae Bae, Lifeng Zhou, David Isele

专题命中 VLM训练与架构 :VLM(summary_cn,abstract);vision-language model(title,abstract);分类 cs.CV、cs.AI

AI总结 提出利用视觉语言模型(VLM)识别对自车轨迹影响最大的被遮挡智能体,通过规划KL散度(PKL)度量进行排序,并微调VLM以提升性能,实验表明该方法比随机采样提升约30%。

Comments Accepted to the 2026 IEEE/RSJ International Conference on Intelligent Robots and Systems (IROS 2026). 9 pages, 5 figures, 5 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.20439 2026-05-28 cs.CV cs.AI 89%

Object-Centric Vision Token Pruning for Vision Language Models

面向视觉语言模型的以对象为中心的视觉令牌剪枝

Guangyuan Li, Rongzhen Zhao, Jinhong Deng, Yanbo Wang, Joni Pajarinen

机构 * Aalto University(阿alto大学) University of Electronic Science and Technology of China(电子科学与技术大学) Delft University of Technology(代尔夫特理工大学)

专题命中 VLM训练与架构 :VLM(summary_cn,abstract);vision language model(title,abstract);分类 cs.CV、cs.AI

AI总结 提出OC-VTP方法,通过轻量预训练以对象为中心的视觉令牌剪枝器,直接选择最具代表性的视觉令牌,在保持高精度的同时提升VLM推理效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.05442 2026-05-19 cs.CV cs.AI 89%

Structured Labeling Enables Faster Vision-Language Models for End-to-End Autonomous Driving

结构化标注加速面向端到端自动驾驶的视觉-语言模型

Hao Jiang, Chuan Hu, Yukang Shi, Yuan He, Ke Wang, Xi Zhang, Zhipeng Zhang

机构 * Shanghai Jiao Tong University(上海交通大学) KargoBot

专题命中 VLM训练与架构 :vision-language model(title,abstract);VLM(abstract,abstract_cn);LLaVA(abstract,abstract_cn);分类 cs.CV、cs.AI

AI总结 本文提出结构化标注的NuScenes-S数据集和紧凑型FastDrive模型,提升自动驾驶中决策任务的效率与准确性,实验显示在结构化数据集上性能优异,推理速度提升超10倍。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.13047 2026-05-14 cs.CV cs.AI 89%

Revealing the Gap in Human and VLM Scene Perception through Counterfactual Semantic Saliency

通过反事实语义显著性揭示人类与VLM场景感知之间的差距

Ziqi Wen, Parsa Madinei, Miguel P. Eckstein

机构 * Department of Computer Science, University of California, Santa Barbara(加州大学圣巴巴拉分校计算机科学系) Department of Psychological and Brain Sciences, University of California, Santa Barbara(加州大学圣巴巴拉分校心理学与脑科学系)

专题命中 VLM训练与架构 :VLM(title,title_cn);vision-language model(abstract);分类 cs.CV、cs.AI

AI总结 本文通过反事实语义显著性方法揭示VLM在高阶语义场景理解中与人类感知之间的差距,发现模型过度依赖大物体、图像中心物体和高显著性物体,而对人物依赖程度较低。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.16462 2026-04-21 cs.CV cs.AI 89%

From Inheritance to Saturation: Disentangling the Evolution of Visual Redundancy for Architecture-Aware MLLM Inference Acceleration

从继承到饱和:解构视觉冗余的演化以实现架构感知的MLLM推理加速

Jiaqi Shi, Yuechan Li, Xulong Zhang, Xiaoyang Qu, Jianzong Wang

机构 * University of Science and Technology of China(中国科学技术大学) Wuhan University(武汉大学) Ping An Technology (Shenzhen) Co., Ltd.(平安科技(深圳)有限公司)

专题命中 VLM训练与架构 :MLLM(title,title_cn);LLaVA(abstract,abstract_cn);multimodal large language model(abstract);分类 cs.CV、cs.AI

AI总结 本文提出HalfV框架,通过统一剪枝策略缓解内在视觉冗余,并根据具体表现适应性处理二次饱和冗余,实现跨架构的高效推理。

Comments 16 pages, 14 figures, plus appendix, accepted at ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.15188 2026-04-17 cs.CV cs.AI 89%

VisPCO: Visual Token Pruning Configuration Optimization via Budget-Aware Pareto-Frontier Learning for Vision-Language Models

VisPCO:通过预算感知的帕累托前沿学习实现视觉令牌修剪配置优化

Huawei Ji, Yuanhao Sun, Yuan Jin, Cheng Deng, Jiaxin Ding, Luoyi Fu, Xinbing Wang

机构 * Shanghai Jiao Tong University(上海交通大学) University of Edinburgh(爱丁堡大学)

专题命中 VLM训练与架构 :VLM(summary_cn,abstract);vision-language model(title,abstract);分类 cs.CV、cs.AI

AI总结 本文提出VisPCO框架,通过将视觉令牌修剪问题建模为帕累托配置优化问题,自动识别最优配置。实验表明,该方法在8个视觉基准上有效逼近帕累托前沿,并在不同修剪方法和VLM架构中泛化良好。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.12119 2026-04-15 cs.CV cs.LG 89%

Beyond Perception Errors: Semantic Fixation in Large Vision-Language Models

超越感知误差:大型视觉-语言模型中的语义固定

Md Tanvirul Alam

机构 * Rochester Institute of Technology(罗切斯特理工学院)

专题命中 VLM训练与架构 :VLM(summary_cn,abstract);vision-language model(title,abstract);分类 cs.CV、cs.LG

AI总结 研究发现大型视觉-语言模型在面对提示指定的替代映射时,倾向于保留默认解释,通过VLM-Fix基准测试揭示了语义固定现象,且通过训练和激活调整可部分修复误差。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.23867 2026-07-01 cs.LG cs.AI cs.CV 版本更新 89%

Can VLMs Reason Robustly? A Neuro-Symbolic Investigation

VLM能稳健推理吗?一项神经符号研究

Weixin Chen, Antonio Vergari, Han Zhao

机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) University of Edinburgh(爱丁堡大学)

专题命中 VLM训练与架构 :VLM(title_cn,summary_cn);vision-language model(abstract);分类 cs.CV、cs.AI、cs.LG

AI总结 研究视觉语言模型在分布偏移下的推理稳健性,提出结合VLM概念识别与电路符号推理的神经符号方法VLC,在三个视觉演绎推理任务上实现更高的分布外准确率。

Comments TMLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.16193 2026-06-16 cs.CV cs.AI cs.LG 新提交 89%

Cascaded Sparse Autoencoders Learn Multi-Level Visual Concepts in Multimodal LLMs

级联稀疏自编码器在多模态大语言模型中学习多级视觉概念

Yusong Zhao, Hengyi Wang, Tanuja Ganu, Akshay Nambi, Hao Wang

机构 * Rutgers University(罗格斯大学) Microsoft Research(微软研究院)

专题命中 VLM训练与架构 :MLLM(summary_cn,abstract);LLaVA(abstract,abstract_cn);multimodal large language model(abstract);分类 cs.CV、cs.AI、cs.LG

AI总结 提出级联稀疏自编码器(CSAEs),通过在第一级SAE解码器权重上训练第二级SAE来学习层次化视觉概念,避免嵌套或堆叠SAE的缺点,在多个MLLM和数据集上提升了概念层次一致性和干预效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.15134 2026-06-16 cs.CV cs.AI cs.LG 新提交 89%

Beyond Scalar Distances: Semantic Attribute Gradients from Frozen MLLMs for Visual Embeddings

超越标量距离:来自冻结MLLM的语义属性梯度用于视觉嵌入

Shubhang Bhatnagar, Dheeraj Baiju, Narendra Ahuja

机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校)

专题命中 VLM训练与架构 :MLLM(title_cn,summary_cn);multimodal large language model(abstract);分类 cs.CV、cs.AI、cs.LG

AI总结 提出SAGA框架,利用冻结的多模态大语言模型(MLLM)通过GRPO奖励机制为视觉编码器提供属性级监督,替代传统标量距离,提升零样本图像检索性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.07051 2026-02-10 cs.CV cs.AI cs.LG cs.NE 89%

Neural Sentinel: Unified Vision Language Model (VLM) for License Plate Recognition with Human-in-the-Loop Continual Learning

神经哨兵:用于车牌识别的统一视觉语言模型(VLM)与人类在循环持续学习

Karthik Sivakoti

专题命中 VLM训练与架构 :vision language model(title,abstract);VLM(title,abstract);分类 cs.CV、cs.AI、cs.LG

AI总结 Neural Sentinel利用视觉语言模型实现车牌识别与多任务学习,提升准确率并减少系统复杂性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.11464 2026-01-19 cs.CV cs.AI cs.CL cs.LG 89%

MHA2MLA-VLM: Enabling DeepSeek's Economical Multi-Head Latent Attention across Vision-Language Models

MHA2MLA-VLM: 使DeepSeek的经济型多头潜在注意力在视觉-语言模型中生效

Xiaoran Fan, Zhichao Sun, Tao Ji, Lixing Shen, Tao Gui

机构 * DeepSeek

专题命中 VLM训练与架构 :vision-language model(title,abstract);VLM(title,abstract);分类 cs.CV、cs.AI、cs.LG

AI总结 MHA2MLA-VLM通过参数高效的方法将现有视觉-语言模型转换为多头潜在注意力架构,减少缓存足迹并提升推理效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.08402 2025-11-12 cs.CV cs.AI cs.LG 89%

Anatomy-VLM: A Fine-grained Vision-Language Model for Medical Interpretation

Difei Gu, Yunhe Gao, Mu Zhou, Dimitris Metaxas

机构 * Rutgers University(新泽西罗格斯大学) Stanford University(斯坦福大学)

专题命中 VLM训练与架构 :vision-language model(title,abstract);VLM(title,abstract);分类 cs.CV、cs.AI、cs.LG

Comments Accepted to Winter Conference on Applications of Computer Vision (WACV) 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.11961 2025-09-16 cs.CL 89%

Spec-LLaVA: Accelerating Vision-Language Models with Dynamic Tree-Based Speculative Decoding

Mingxiao Huo, Jiayi Zhang, Hewei Wang, Jinfeng Xu, Zheyu Chen, Huilin Tai, Yijun Chen

机构 * Carnegie Mellon University(卡内基梅隆大学) University of Nottingham(诺丁汉大学) The University of Hong Kong(香港大学) The Hong Kong Polytechnic University(香港理工大学) Columbia University(哥伦比亚大学) University of California, Berkeley(加州大学伯克利分校)

专题命中 VLM训练与架构 :vision-language model(title,abstract);LLaVA(title,abstract);VLM(abstract)

Comments 7pages, accepted by ICML TTODLer-FM workshop

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.00456 2025-08-18 eess.SP 89%

When Vision-Language Model (VLM) Meets Beam Prediction: A Multimodal Contrastive Learning Framework

Ji Wang, Bin Tang, Jian Xiao, Qimei Cui, Xingwang Li, Tony Q. S. Quek

专题命中 VLM训练与架构 :vision-language model(title,abstract);VLM(title,abstract);grounding(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.23859 2025-08-04 astro-ph.IM 89%

radio-llava: Advancing Vision-Language Models for Radio Astronomical Source Analysis

S. Riggi, T. Cecconello, A. Pilzer, S. Palazzo, N. Gupta, A. M. Hopkins, C. Trigilio, G. Umana

专题命中 VLM训练与架构 :vision-language model(title,abstract);LLaVA(title,abstract);VLM(abstract)

Comments 19 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.07435 2026-08-10 cs.CV cs.AI cs.CL 新提交 89%

SABRE: Scalable and Automated Benchmarking of VLMs under Stress

SABRE:压力场景下视觉语言模型(VLM)的可扩展自动化基准测试

Zixuan Lan, Luzhe Sun, Matthew R. Walter, Jiawei Zhou

机构 * University of Chicago(芝加哥大学) Toyota Technological Institute at Chicago(芝加哥丰田技术学院) Stony Brook University(石溪大学)

专题命中 VLM训练与架构 :VLM(title_cn,summary_cn);vision-language model(abstract);分类 cs.CV、cs.AI

AI总结 SABRE是可扩展自动化VLM压力测试框架,可生成多维度测试样本,经实验验证其能有效评估VLMs对视觉证据与世界先验的依赖程度,支持多种压力测试场景。

Comments 22 pages, 10 figures. Code and resources will be available at https://zesearch.github.io/vlm-SABRE/

详情

展开后加载摘要…

URL PDF HTML 收藏