arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视觉大模型 / VLM

视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。

共收录 5048 信号源:cs.CV, cs.AI, cs.LG

1. VLM训练与架构 5048 篇

2410.09382 2024-10-15 cs.CV 77%

CLIP-SCGI: Synthesized Caption-Guided Inversion for Person Re-Identification

Qianru Han, Xinwei He, Zhi Liu, Sannyuya Liu, Ying Zhang, Jinhai Xiang

专题命中 VLM训练与架构 :vision-language model(abstract);vision language model(abstract);LLaVA(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2402.04492 2024-08-07 cs.CV cs.CL 77%

ColorSwap: A Color and Word Order Dataset for Multimodal Evaluation

Jirayu Burapacheep, Ishan Gaur, Agam Bhatia, Tristan Thrush

专题命中 VLM训练与架构 :VLM(abstract);visual language model(abstract);LLaVA(abstract);分类 cs.CV

Comments ACL Findings 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2408.00620 2024-08-02 cs.CV cs.CL 77%

Are Bigger Encoders Always Better in Vision Large Models?

Bozhou Li, Hao Liang, Zimo Meng, Wentao Zhang

专题命中 VLM训练与架构 :vision language model(abstract);VLM(abstract);multimodal large language model(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.08672 2024-07-12 cs.CV 77%

NODE-Adapter: Neural Ordinary Differential Equations for Better Vision-Language Reasoning

Yi Zhang, Chun-Wun Cheng, Ke Yu, Zhihai He, Carola-Bibiane Schönlieb, Angelica I. Aviles-Rivero

专题命中 VLM训练与架构 :vision-language model(abstract);VLM(abstract);visual reasoning(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.14544 2024-06-21 cs.CV cs.CL 77%

Prism: A Framework for Decoupling and Assessing the Capabilities of VLMs

Yuxuan Qiao, Haodong Duan, Xinyu Fang, Junming Yang, Lin Chen, Songyang Zhang, Jiaqi Wang, Dahua Lin, Kai Chen

专题命中 VLM训练与架构 :vision language model(abstract);VLM(abstract);LLaVA(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2403.14599 2024-03-22 cs.CV 77%

MyVLM: Personalizing VLMs for User-Specific Queries

Yuval Alaluf, Elad Richardson, Sergey Tulyakov, Kfir Aberman, Daniel Cohen-Or

专题命中 VLM训练与架构 :vision-language model(abstract);VLM(abstract);LLaVA(abstract);分类 cs.CV

Comments Project page: https://snap-research.github.io/MyVLM/

详情

展开后加载摘要…

URL PDF HTML 收藏
2312.00849 2024-03-11 cs.CL cs.CV 77%

RLHF-V: Towards Trustworthy MLLMs via Behavior Alignment from Fine-grained Correctional Human Feedback

Tianyu Yu, Yuan Yao, Haoye Zhang, Taiwen He, Yifeng Han, Ganqu Cui, Jinyi Hu, Zhiyuan Liu, Hai-Tao Zheng, Maosong Sun, Tat-Seng Chua

专题命中 VLM训练与架构 :LLaVA(abstract);multimodal large language model(abstract);MLLM(abstract);分类 cs.CV

Comments Accepted by CVPR 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2206.01127 2022-09-07 cs.CV cs.CL 77%

VL-BEiT: Generative Vision-Language Pretraining

Hangbo Bao, Wenhui Wang, Li Dong, Furu Wei

专题命中 VLM训练与架构 :vision-language model(abstract);visual reasoning(abstract);visual question answering(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2402.10884 2024-11-06 cs.CL cs.AI cs.CV cs.LG 76%

Multi-modal Preference Alignment Remedies Degradation of Visual Instruction Tuning on Language Models

Shengzhi Li, Rongyu Lin, Shichao Pei

专题命中 VLM训练与架构 :MLLM(abstract,comments);LLaVA(abstract);分类 cs.CV、cs.AI、cs.LG

Comments Project code, model and data: https://github.com/findalexli/mllm-dpo

Journal ref Proceedings of the 62nd Annual Meeting of the Association for Computational Linguistics (Volume 1: Long Papers), pages 14188-14200, 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.16451 2026-08-04 cs.CL cs.CV cs.LG physics.ao-ph 76%

SynopticBench: Evaluating Vision-Language Models on Generating Weather Forecast Discussions of the Future

SynopticBench:在生成未来天气预报讨论上评估视觉-语言模型

Timothy B. Higgins, Antonios Mamalakis, Chirag Agarwal

机构 * Department of Environmental Sciences(环境科学系) School of Data Science(数据科学学院)

专题命中 VLM训练与架构 :vision-language model(title);分类 cs.CV、cs.LG

AI总结 本文提出SynopticBench数据集和SPACE评估框架,用于评估视觉-语言模型在生成天气现象描述中的性能,揭示现有评估指标的局限性。

Comments Accepted for presentation at Climate Informatics 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.12364 2026-07-15 cs.CV cs.AI 新提交 76%

Lost in Visual Translation: A VLM-Assisted Perceptual-Semantic Coherence Framework for EEG-to-Image Reconstruction

迷失在视觉翻译中:用于脑电到图像重建的基于视觉语言模型的感知语义连贯框架

Sukriti Tiwari, BHVSP Subrahmanyam, Nidhi Goyal, Sai Amrit Patnaik

机构 * Mahindra University(马欣德拉大学) MU-VT Interdisciplinary Advanced Research Centre for Transformative Technologies, Mahindra University(马欣德拉大学MU-VT变革性技术跨学科高级研究中心)

专题命中 VLM训练与架构 :VLM(title);分类 cs.CV、cs.AI

AI总结 研究脑电到图像重建中视觉保真度与语义可恢复性评估问题,引入基于四个视觉语言模型的框架,通过结构化问题评估图像对,产生宽容感知和语义对齐分数,提炼出脑机接口连贯分数,有效评估感知语义可恢复性。

Comments 27 pages, 3 figures, 13 tables. Accepted at the 5th International Workshop on Human Brain and Artificial Intelligence (HBAI 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.08902 2026-05-12 cs.CV cs.AI 76%

DAPE: Dynamic Non-uniform Alignment and Progressive Detail Enhancement Techniques for Improving the Performance of Efficient Visual Language Models

DAPE:动态非均匀对齐与渐进细节增强技术以提升高效视觉语言模型的性能

Mengyuan Tian, Qiyan Zhao, Yanan Wang, Da-Han Wang

机构 * The Wang Yanan Institute for Studies in Economics, Xiamen University, Xiamen 361005, China(厦门大学王文安经济研究所) Fujian Key Laboratory of Pattern Recognition and Image Understanding, School of Computer and Information Engineering, Xiamen University of Technology, Xiamen 361024, China(福建pattern识别与图像理解重点实验室,厦门理工大学计算机与信息工程学院)

专题命中 VLM训练与架构 :visual language model(title);分类 cs.CV、cs.AI

AI总结 本文提出DAPE框架,通过动态跨模态对齐和连续细节引入技术,提升高效视觉语言模型的性能,减少计算开销并提升下游任务准确性。

Comments Accepted in ICIC 2026 Oral

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.05668 2026-05-08 cs.AI cs.CV 76%

Large Vision-Language Models Get Lost in Attention

大视觉-语言模型在注意力中迷失

Gongli Xi, Ye Tian, Mengyu Yang, Huahui Yi, Liang Lin, Xiaoshuai Hao, Kun Wang, Wendong Wang

机构 * School of Cyberspace Security, Beijing University of Posts(信息安全学院,北京邮电大学) State Key Laboratory of Networking and Switching Technology, Beijing University of Posts(网络与交换技术国家重点实验室,北京邮电大学) School of Computer Science (National Pilot Software Engineering School), Beijing University of Posts(计算机科学学院(国家试点软件工程学院),北京邮电大学) Nanyang Technological University, Singapore(新加坡南洋理工大学) Institute of Information Engineering, Chinese Academy of Sciences, Beijing, China(信息工程研究所,中国科学院北京研究院)

专题命中 VLM训练与架构 :vision-language model(title);分类 cs.CV、cs.AI

AI总结 研究揭示大视觉-语言模型中注意力与前馈网络的作用差异,提出基于信息论和几何的统一框架,发现注意力模块存在冗余问题。

Comments 25 pages, 10 figures. Accepted by ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.08373 2026-04-30 cs.AI cs.LG 76%

Grounding Generative Planners in Verifiable Logic: A Hybrid Architecture for Trustworthy Embodied AI

基于可验证逻辑的生成规划器:一种可信具身AI的混合架构

Feiyu Wu, Xu Zheng, Yue Qu, Zhuocheng Wang, Zicheng Feng, Hui Li

机构 * School of Cyber Engineering, Xidian University(电子科技大学信息工程学院)

专题命中 VLM训练与架构 :grounding(title);分类 cs.AI、cs.LG

AI总结 本文提出VIRF框架,通过逻辑导师与LLM的对话机制实现主动协作,提升具身AI的安全性与可靠性,实验显示其在家庭安全任务中表现优异。

Comments Accepted to ICLR 2026. Project page. https://openreview.net/forum?id=wb05ver1k8&noteId=v1Ax8CwI71

Journal ref Proceedings of the International Conference on Learning Representations (ICLR), 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.13565 2026-04-16 cs.CV cs.AI 76%

UHR-BAT: Budget-Aware Token Compression Vision-Language model for Ultra-High-Resolution Remote Sensing

UHR-BAT:面向超高清遥感的预算感知视觉-语言模型

Yunkai Dang, Minxin Dai, Yuekun Yang, Zhangnan Li, Wenbin Li, Feng Miao, Yang Gao

机构 * School of Artificial Intelligence Science and Technology, Nanjing University(南京大学人工智能科学与技术学院) School of Electronic Science and Engineering, Nanjing University(南京大学电子科学与工程学院) School of Physics, Nanjing University(南京大学物理学院)

专题命中 VLM训练与架构 :vision-language model(title);分类 cs.CV、cs.AI

AI总结 本文提出UHR-BAT模型,通过文本引导的多尺度重要性估计和区域保留合并策略,实现高效视觉token压缩,在严格预算下提升超高清遥感图像信息提取效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.13021 2026-04-15 cs.CV cs.AI 76%

Representation geometry shapes task performance in vision-language modeling for CT enterography

表征几何形状任务性能在CT结肠镜视觉-语言建模中的作用

Cristian Minoccheri, Emily Wittrup, Kayvan Najarian, Ryan Stidham

机构 * Gilbert S. Omenn Department of Computational Medicine and Bioinformatics(Gilbert S. Omenn 计算医学与生物信息学部门) Department of Gastroenterology(消化内科部门) Department of Emergency Medicine(急诊医学部门) Department of Electrical Engineering and Computer Science(电气工程与计算机科学部门)

专题命中 VLM训练与架构 :vision-language model(title);分类 cs.CV、cs.AI

AI总结 本文研究了CT结肠镜视觉-语言迁移学习,发现均值池化在疾病分类中表现更优,而注意力池化在跨模态检索中更有效,同时指出单片组织对比度比空间覆盖范围更重要,为构建体积医学影像视觉-语言系统提供了基础。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.06124 2026-04-08 cs.CV cs.AI 76%

Lightweight Multimodal Adaptation of Vision Language Models for Species Recognition and Habitat Context Interpretation in Drone Thermal Imagery

轻量级多模态适应:为无人机热成像中的物种识别和栖息地上下文解释优化视觉语言模型

Hao Chen, Fang Qiu, Fangchao Dong, Defei Yang, Eve Bohnett, Li An

机构 * The University of Texas at Dallas(德克萨斯大学达拉斯分校) University of Florida(佛罗里达大学) Auburn University(奥本大学)

专题命中 VLM训练与架构 :vision language model(title);分类 cs.CV、cs.AI

AI总结 本研究提出轻量级多模态适应框架,用于提升视觉语言模型在无人机热成像中的物种识别与栖息地上下文解释能力,通过热数据集优化模型性能,实现从RGB到热辐射的高效迁移。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.13855 2026-04-03 cs.CV cs.AI 76%

Improvise, Adapt, Overcome -- Telescopic Adapters for Efficient Fine-tuning of Vision Language Models in Medical Imaging

即兴、适应、克服——用于医疗影像中视觉语言模型高效微调的望远镜适配器

Ujjwal Mishra, Vinita Shukla, Praful Hambarde, Amit Shukla

机构 * Centre for Artificial Intelligence and Robotics, Indian Institute of Technology Mandi(印度理工学院曼迪分校人工智能与机器人中心)

专题命中 VLM训练与架构 :vision language model(title);分类 cs.CV、cs.AI

AI总结 本文提出望远镜适配器,通过深度感知缩放提升视觉语言分割模型在医疗影像中的微调效率,仅用613k参数在五个数据集上取得优异性能。

Comments Accepted at the IEEE/CVF winter conference on applications of computer vision (WACV 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.27482 2026-03-31 cs.CV cs.AI 76%

Difference Feedback: Generating Multimodal Process-Level Supervision for VLM Reinforcement Learning

差分反馈:为视觉语言模型强化学习生成多模态过程级监督

Feiding, Yongkang Zhang, Yuhao Liao, Zijian Zeng, Chunzheng Zhu, Yaozong Zheng, Yafei Liu, Yeling Peng, Youwei Wang, Sibo Wang, Huiming Yang, Linglin Liao, Shunzhi Yang

机构 * Shenzhen International Graduate School, Tsinghua University, China(清华大学深圳国际研究生院)

专题命中 VLM训练与架构 :VLM(title);分类 cs.CV、cs.AI

AI总结 本文提出差分反馈方法,通过修复错误推理轨迹自动构建token/步骤级监督掩码,实现多模态推理中的过程级视觉对齐,实验显示在MMMStar和MathVista基准上平均提升3%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.20089 2026-03-03 cs.CV cs.AI 76%

StructXLIP: Enhancing Vision-language Models with Multimodal Structural Cues

StructXLIP: 通过多模态结构线索增强视觉-语言模型

Zanxi Ruan, Songqun Gao, Qiuyu Kong, Yiming Wang, Marco Cristani

专题命中 VLM训练与架构 :vision-language model(title);分类 cs.CV、cs.AI

AI总结 StructXLIP通过引入多模态结构线索提升视觉-语言模型的跨模态检索性能。

Comments Accepted by CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.11740 2026-01-27 cs.LG cs.CV 76%

Mitigating Visual Knowledge Forgetting in MLLM Instruction-tuning via Modality-decoupled Gradient Descent

通过模态解耦梯度下降缓解MLLM指令微调中的视觉知识遗忘

Junda Wu, Yuxin Xiong, Xintong Li, Yu Xia, Ruoyu Wang, Yu Wang, Tong Yu, Sungchul Kim, Ryan A. Rossi, Lina Yao, Jingbo Shang, Julian McAuley

机构 * UC San Diego(加州大学圣迭戈分校) University of New South Wales(新南威尔士大学) Adobe Research(Adobe研究)

专题命中 VLM训练与架构 :MLLM(title);分类 cs.CV、cs.LG

AI总结 本文提出模态解耦梯度下降方法,通过有效秩量化视觉退化并缓解过度压缩,保留预训练视觉知识并提升任务适应能力。

Comments 9 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.22594 2025-12-01 cs.CV cs.AI 76%

HarmoCLIP: Harmonizing Global and Regional Representations in Contrastive Vision-Language Models

HarmoCLIP:在对比视觉语言模型中协调全局和区域表示

Haoxi Zeng, Haoxuan Li, Yi Bin, Pengpeng Zeng, Xing Xu, Yang Yang, Heng Tao Shen

机构 * Tongji University(同济大学) University of Electronic Science and Technology of China(电子科技大学)

专题命中 VLM训练与架构 :vision-language model(title);分类 cs.CV、cs.AI

AI总结 HarmoCLIP通过引入细粒度语义监督和区域-语言对齐策略,协调CLIP中全局与区域表示,提升检索和边界框分类性能,实现平衡高效的全局-局部权衡解决方案。

Comments 13 pages, 7 figures, 6 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.00120 2025-11-04 cs.CV cs.AI 76%

VLM6D: VLM based 6Dof Pose Estimation based on RGB-D Images

Md Selim Sarowar, Sungho Kim

专题命中 VLM训练与架构 :VLM(title);分类 cs.CV、cs.AI

Comments This paper has been accepted to IEIE( The Institute Of Electronics and Information Engineering, South Korea) Fall,2025 Conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.21344 2025-11-04 cs.CV cs.AI q-bio.QM 76%

Vision-Language Model-Based Semantic-Guided Imaging Biomarker for Lung Nodule Malignancy Prediction

Luoting Zhuang, Seyed Mohammad Hossein Tabatabaei, Ramin Salehi-Rad, Linh M. Tran, Denise R. Aberle, Ashley E. Prosper, William Hsu

机构 * organization= Medical \& Imaging Informatics, Department of Radiological Sciences, David Geffen School of Medicine at UCLA , city= Los Angeles , postcode= 90095 , state= CA , country= USA organization= Department of Medicine, Division of Pulmonology Critical Care, David Geffen School of Medicine at UCLA , city= Los Angeles , postcode= 90095 , state= CA , country= USA

专题命中 VLM训练与架构 :vision-language model(title);分类 cs.CV、cs.AI

Journal ref Journal of Biomedical Informatics 172 (2025) 104947

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.21879 2025-10-28 cs.CV cs.AI 76%

TernaryCLIP: Efficiently Compressing Vision-Language Models with Ternary Weights and Distilled Knowledge

Shu-Hao Zhang, Wei-Cheng Tang, Chen Wu, Peng Hu, Nan Li, Liang-Jie Zhang, Qi Zhang, Shao-Qun Zhang

机构 * State Key Laboratory of Novel Software Technology, Nanjing University(新型软件技术国家重点实验室) Microsoft AI(微软人工智能)

专题命中 VLM训练与架构 :vision-language model(title);分类 cs.CV、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2405.14715 2025-10-07 cs.CV cs.AI 76%

Towards Cross-modal Backward-compatible Representation Learning for Vision-Language Models

Young Kyun Jang, Ser-nam Lim

机构 * Google DeepMind(谷歌DeepMind) University of Central Florida(中央佛罗里达大学)

专题命中 VLM训练与架构 :vision-language model(title);分类 cs.CV、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.18179 2025-09-24 cs.CV cs.AI 76%

The Describe-Then-Generate Bottleneck: How VLM Descriptions Alter Image Generation Outcomes

Sai Varun Kodathala, Rakesh Vunnam

机构 * Sports Vision, Inc.(体育视觉公司) Vizworld, Inc.(Vizworld公司)

专题命中 VLM训练与架构 :VLM(title);分类 cs.CV、cs.AI

Comments 13 pages, 7 Figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.19295 2025-08-28 cs.CV cs.LG 76%

Large VLM-based Stylized Sports Captioning

Sauptik Dhar, Nicholas Buoncristiani, Joe Anakata, Haoyu Zhang, Michelle Munson

机构 * Eluvio AI Labs(Eluvio AI实验室)

专题命中 VLM训练与架构 :VLM(title);分类 cs.CV、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.01225 2025-08-25 cs.CV cs.AI 76%

Multi-Cache Enhanced Prototype Learning for Test-Time Generalization of Vision-Language Models

Xinyu Chen, Haotian Zhai, Can Zhang, Xiupeng Shi, Ruirui Li

机构 * Shanghai University(上海大学) Beijing University of Chemical Technology(北京化工大学) University of Minnesota(明尼苏达大学)

专题命中 VLM训练与架构 :vision-language model(title);分类 cs.CV、cs.AI

Comments Accepted by ICCV 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.15506 2025-05-22 cs.CV cs.LG 76%

Prompt Tuning Vision Language Models with Margin Regularizer for Few-Shot Learning under Distribution Shifts

Debarshi Brahma, Anuska Roy, Soma Biswas

机构 * Indian Institute of Science(印度科学研究院)

专题命中 VLM训练与架构 :vision language model(title);分类 cs.CV、cs.LG

Comments Published in TMLR (2025)

详情

展开后加载摘要…

URL PDF HTML 收藏