arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视觉大模型 / VLM

视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。

共收录 5009 信号源:cs.CV, cs.AI, cs.LG

1. VLM训练与架构 5009 篇

2505.17670 2025-07-09 cs.LG cs.AI 84%

Towards General Continuous Memory for Vision-Language Models

Wenyi Wu, Zixuan Song, Kun Zhou, Yifei Shao, Zhiting Hu, Biwei Huang

机构 * University of California, San Diego(加州大学圣地亚哥分校)

专题命中 VLM训练与架构 :vision-language model(title,abstract);VLM(abstract);分类 cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.21862 2025-06-30 cs.CV cs.AI cs.HC cs.MM 84%

LLaVA-Scissor: Token Compression with Semantic Connected Components for Video LLMs

Boyuan Sun, Jiaxing Zhao, Xihan Wei, Qibin Hou

机构 * VCIP, School of Computer Science, Nankai University(南开大学计算机学院) Tongyi Lab, Alibaba Group(阿里巴巴集团 Tongyi 实验室)

专题命中 VLM训练与架构 :LLaVA(title,abstract);multimodal large language model(abstract);分类 cs.CV、cs.AI

Comments 21 pages, 4 figures, 7 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.17267 2025-06-24 cs.LG cs.AI 84%

CF-VLM:CounterFactual Vision-Language Fine-tuning

Jusheng Zhang, Kaitong Cai, Yijia Fan, Jian Wang, Keze Wang

机构 * Sun Yat-sen University(中山大学) Snap Inc.(Snap公司)

专题命中 VLM训练与架构 :VLM(title,abstract);vision-language model(abstract);分类 cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.15645 2025-06-19 cs.CV cs.AI 84%

Demystifying the Visual Quality Paradox in Multimodal Large Language Models

Shuo Xing, Lanqing Guo, Hongyuan Hua, Seoyoung Lee, Peiran Li, Yufei Wang, Zhangyang Wang, Zhengzhong Tu

机构 * Texas A&M University(德克萨斯大学) University of Texas at Austin(德克萨斯大学奥斯汀分校) University of Toronto(多伦多大学) Nanyang Technological University(南洋理工大学)

专题命中 VLM训练与架构 :multimodal large language model(title,abstract);MLLM(abstract);分类 cs.CV、cs.AI

Comments 18 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.09638 2025-06-12 cs.LG cs.CV 84%

FedVLMBench: Benchmarking Federated Fine-Tuning of Vision-Language Models

Weiying Zheng, Ziyue Lin, Pengxin Guo, Yuyin Zhou, Feifei Wang, Liangqiong Qu

机构 * The University of Hong Kong(香港大学) UC Santa Cruz(圣克拉拉大学)

专题命中 VLM训练与架构 :vision-language model(title,abstract);VLM(abstract);分类 cs.CV、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.03792 2025-06-04 cs.LG cs.AI 84%

Towards Efficient Online Tuning of VLM Agents via Counterfactual Soft Reinforcement Learning

Lang Feng, Weihao Tan, Zhiyi Lyu, Longtao Zheng, Haiyang Xu, Ming Yan, Fei Huang, Bo An

专题命中 VLM训练与架构 :VLM(title,abstract);vision-language model(abstract);分类 cs.AI、cs.LG

Comments ICML 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.23043 2025-05-30 cs.CV cs.AI 84%

Are Unified Vision-Language Models Necessary: Generalization Across Understanding and Generation

Jihai Zhang, Tianle Li, Linjie Li, Zhengyuan Yang, Yu Cheng

机构 * The Chinese University of Hong Kong(香港中文大学) Microsoft(微软公司)

专题命中 VLM训练与架构 :vision-language model(title,abstract);VLM(abstract);分类 cs.CV、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.20405 2025-05-28 cs.CV cs.AI cs.CL cs.MM 84%

What Changed? Detecting and Evaluating Instruction-Guided Image Edits with Multimodal Large Language Models

Lorenzo Baraldi, Davide Bucciarelli, Federico Betti, Marcella Cornia, Lorenzo Baraldi, Nicu Sebe, Rita Cucchiara

机构 * University of Modena and Reggio Emilia(摩德纳和雷吉奥艾米利亚大学) University of Pisa(比萨大学) University of Trento(特伦托大学) IIT-CNR

专题命中 VLM训练与架构 :multimodal large language model(title,abstract);MLLM(abstract);分类 cs.CV、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.17042 2025-05-26 cs.CL cs.CV cs.IR cs.LG 84%

VLM-KG: Multimodal Radiology Knowledge Graph Generation

Abdullah Abdullah, Seong Tae Kim

机构 * Department of Computer Science and Engineering, Kyung Hee University(计算机科学与工程系,庆熙大学)

专题命中 VLM训练与架构 :VLM(title,abstract);vision-language model(abstract);分类 cs.CV、cs.LG

Comments 10 pages, 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.14646 2025-05-21 cs.CV cs.AI 84%

CAD-Coder: An Open-Source Vision-Language Model for Computer-Aided Design Code Generation

Anna C. Doris, Md Ferdous Alam, Amin Heyrani Nobari, Faez Ahmed

机构 * Massachusetts Institute of Technology(麻省理工学院)

专题命中 VLM训练与架构 :vision-language model(title,abstract);VLM(abstract);分类 cs.CV、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.22577 2025-05-21 cs.CV cs.AI 84%

Breaking Language Barriers in Visual Language Models via Multilingual Textual Regularization

Iñigo Pikabea, Iñaki Lacunza, Oriol Pareras, Carlos Escolano, Aitor Gonzalez-Agirre, Javier Hernando, Marta Villegas

机构 * Barcelona Supercomputing Center(巴塞罗那超级计算中心) Universitat Politècnica de Catalunya(加泰罗尼亚理工大学)

专题命中 VLM训练与架构 :visual language model(title,abstract);VLM(abstract);分类 cs.CV、cs.AI

Comments v2: Expanded model merging experiments. Fix duplicated subsection on limitations

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.10526 2025-05-20 cs.LG cs.CL cs.CV 84%

MASSV: Multimodal Adaptation and Self-Data Distillation for Speculative Decoding of Vision-Language Models

Mugilan Ganesan, Shane Segal, Ankur Aggarwal, Nish Sinnadurai, Sean Lie, Vithursan Thangarasa

专题命中 VLM训练与架构 :vision-language model(title,abstract);VLM(abstract);分类 cs.CV、cs.LG

Comments Main paper: 11 pages, 4 figures, 3 tables. Supplementary: 1 page

详情

展开后加载摘要…

URL PDF HTML 收藏
2403.13797 2025-05-20 cs.LG cs.CV 84%

Bridge the Modality and Capability Gaps in Vision-Language Model Selection

Chao Yi, Yu-Hang He, De-Chuan Zhan, Han-Jia Ye

机构 * State Key Laboratory for Novel Software Technology(新型软件技术国家重点实验室)

专题命中 VLM训练与架构 :vision-language model(title);vision language model(abstract);VLM(abstract);分类 cs.CV、cs.LG

Comments fix typo in figure 2 "Capability Gap"

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.09498 2025-05-15 cs.CV cs.AI 84%

Flash-VL 2B: Optimizing Vision-Language Model Performance for Ultra-Low Latency and High Throughput

Bo Zhang, Shuo Li, Runhe Tian, Yang Yang, Jixin Tang, Jinhao Zhou, Lin Ma

机构 * Meituan(美团)

专题命中 VLM训练与架构 :vision-language model(title,abstract);VLM(abstract);分类 cs.CV、cs.AI

Comments 18 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.08818 2025-05-15 cs.CY cs.AI cs.LG 84%

Position: Restructuring of Categories and Implementation of Guidelines Essential for VLM Adoption in Healthcare

Amara Tariq, Rimita Lahiri, Charles Kahn, Imon Banerjee

机构 * Amara Tariq, Ph.D(博士) Rimita Lahiri, Ph.D(博士) Charles Kahn, M.D(医学博士) Imon Banerjee, Ph.D(博士)

专题命中 VLM训练与架构 :VLM(title,abstract);vision language model(abstract);分类 cs.AI、cs.LG

Comments 15 pages, 2, tables, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.05318 2025-05-09 cs.CV cs.AI cs.CY cs.HC cs.RO 84%

Mapping User Trust in Vision Language Models: Research Landscape, Challenges, and Prospects

Agnese Chiatti, Sara Bernardini, Lara Shibelski Godoy Piccolo, Viola Schiaffonati, Matteo Matteucci

机构 * Politecnico di Milano, Italy(米兰理工学院,意大利) University of Oxford, UK(牛津大学,英国) CODE University of Applied Sciences, Germany(德国应用科学大学)

专题命中 VLM训练与架构 :vision language model(title,abstract);VLM(abstract);分类 cs.CV、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.22330 2025-05-08 cs.CV cs.CL cs.LG 84%

Vision-Language Models Create Cross-Modal Task Representations

Grace Luo, Trevor Darrell, Amir Bar

机构 * University of California, Berkeley, USA(加州大学伯克利分校)

专题命中 VLM训练与架构 :vision-language model(title,abstract);VLM(abstract);分类 cs.CV、cs.LG

Comments ICML 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.18271 2025-05-08 cs.LG cs.AI 84%

Vision-Language Model Selection and Reuse for Downstream Adaptation

Hao-Zhe Tan, Zhi Zhou, Yu-Feng Li, Lan-Zhe Guo

专题命中 VLM训练与架构 :vision-language model(title,abstract);VLM(abstract);分类 cs.AI、cs.LG

Comments Accepted by ICML 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.03242 2025-05-07 cs.CV cs.AI 84%

Seeing the Abstract: Translating the Abstract Language for Vision Language Models

Davide Talon, Federico Girella, Ziyue Liu, Marco Cristani, Yiming Wang

专题命中 VLM训练与架构 :vision language model(title,abstract);VLM(abstract);分类 cs.CV、cs.AI

Comments Accepted to CVPR25. Project page: https://davidetalon.github.io/fashionact-page/

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.18027 2025-04-28 cs.CV cs.AI cs.RO 84%

A Large Vision-Language Model based Environment Perception System for Visually Impaired People

Zezhou Chen, Zhaoxiang Liu, Kai Wang, Kohou Wang, Shiguo Lian

机构 * AI Innovation Center, China Unicom(中国unicom人工智能创新中心) Unicom Digital Technology, China Unicom(中国unicom数字技术)

专题命中 VLM训练与架构 :vision-language model(title,abstract);LLaVA(abstract);分类 cs.CV、cs.AI

Comments Accepted by IROS2024(9 pages, 8 figures)

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.17826 2025-04-28 cs.CV cs.AI 84%

FashionM3: Multimodal, Multitask, and Multiround Fashion Assistant based on Unified Vision-Language Model

Kaicheng Pang, Xingxing Zou, Waikeung Wong

机构 * Laboratory for Artificial Intelligence in Design(人工智能设计实验室) School of Fashion and Textiles(时尚与纺织学院)

专题命中 VLM训练与架构 :vision-language model(title,abstract);VLM(abstract);分类 cs.CV、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.09620 2025-04-15 cs.CL cs.AI cs.CV cs.MA 84%

Metropolis-Hastings Captioning Game: Knowledge Fusion of Vision Language Models via Decentralized Bayesian Inference

Yuta Matsui, Ryosuke Yamaki, Ryo Ueda, Seitaro Shinagawa, Tadahiro Taniguchi

专题命中 VLM训练与架构 :vision language model(title);vision-language model(abstract);VLM(abstract);分类 cs.CV、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.05141 2025-04-10 cs.CV cs.AI 84%

EffOWT: Transfer Visual Language Models to Open-World Tracking Efficiently and Effectively

Bingyang Wang, Kaer Huang, Bin Li, Yiqiang Yan, Lihe Zhang, Huchuan Lu, You He

专题命中 VLM训练与架构 :visual language model(title,abstract);VLM(abstract);分类 cs.CV、cs.AI

Comments 11 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.02862 2025-04-08 cs.CV cs.LG 84%

Towards Understanding How Knowledge Evolves in Large Vision-Language Models

Sudong Wang, Yunjian Zhang, Yao Zhu, Jianing Li, Zizhe Wang, Yanwei Liu, Xiangyang Ji

专题命中 VLM训练与架构 :vision-language model(title,abstract);VLM(abstract);分类 cs.CV、cs.LG

Comments Accepted by CVPR 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.10114 2025-04-02 cs.LG cs.CL cs.CV 84%

Mixture of Experts Made Personalized: Federated Prompt Learning for Vision-Language Models

Jun Luo, Chen Chen, Shandong Wu

专题命中 VLM训练与架构 :vision-language model(title,abstract);VLM(abstract);分类 cs.CV、cs.LG

Comments ICLR 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.16761 2025-04-01 cs.CV cs.AI 84%

Is 'Right' Right? Enhancing Object Orientation Understanding in Multimodal Large Language Models through Egocentric Instruction Tuning

Ji Hyeok Jung, Eun Tae Kim, Seoyeon Kim, Joo Ho Lee, Bumsoo Kim, Buru Chang

专题命中 VLM训练与架构 :multimodal large language model(title,abstract);MLLM(abstract);分类 cs.CV、cs.AI

Comments CVPR2025 Camera-ready

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.20662 2025-03-27 cs.CV cs.LG eess.IV 84%

AutoRad-Lung: A Radiomic-Guided Prompting Autoregressive Vision-Language Model for Lung Nodule Malignancy Prediction

Sadaf Khademi, Mehran Shabanpour, Reza Taleei, Anastasia Oikonomou, Arash Mohammadi

专题命中 VLM训练与架构 :vision-language model(title,abstract);VLM(abstract);分类 cs.CV、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.08497 2025-03-27 cs.LG cs.CV 84%

MMRL: Multi-Modal Representation Learning for Vision-Language Models

Yuncheng Guo, Xiaodong Gu

专题命中 VLM训练与架构 :vision-language model(title,abstract);VLM(abstract);分类 cs.CV、cs.LG

Comments Accepted by CVPR 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.19508 2025-03-26 cs.CV cs.LG 84%

Improved Alignment of Modalities in Large Vision Language Models

Kartik Jangra, Aman Kumar Singh, Yashwani Mann, Geetanjali Rathee

专题命中 VLM训练与架构 :vision language model(title);vision-language model(abstract);visual question answering(abstract);分类 cs.CV、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.06993 2025-03-11 cs.LG cs.CV 84%

CAPT: Class-Aware Prompt Tuning for Federated Long-Tailed Learning with Vision-Language Model

Shihao Hou, Xinyi Shang, Shreyank N Gowda, Yang Lu, Chao Wu, Yan Yan, Hanzi Wang

专题命中 VLM训练与架构 :vision-language model(title,abstract);VLM(abstract);分类 cs.CV、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏