arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视觉大模型 / VLM

视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。

共收录 5030 信号源:cs.CV, cs.AI, cs.LG

1. VLM训练与架构 5030 篇

2506.19651 2025-07-30 cs.CV cs.LG cs.PF 81%

PEVLM: Parallel Encoding for Vision-Language Models

Letian Kang, Shixian Luo, Yiqiang Li, Yuxin Yin, Shenxuan Zhou, Xiaoyang Yu, Jin Yang, Yong Wu

机构 * Li Auto Inc.(利自动公司)

专题命中 VLM训练与架构 :vision-language model(title,abstract);分类 cs.CV、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.01986 2025-07-28 cs.CV cs.AI 81%

FrameFusion: Combining Similarity and Importance for Video Token Reduction on Large Vision Language Models

Tianyu Fu, Tengxuan Liu, Qinghao Han, Guohao Dai, Shengen Yan, Huazhong Yang, Xuefei Ning, Yu Wang

机构 * Tsinghua University(清华大学) Infinigence-AI Peking University(北京大学) Shanghai Jiao Tong University(上海交通大学)

专题命中 VLM训练与架构 :vision language model(title);vision-language model(abstract);分类 cs.CV、cs.AI

Comments ICCV 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.07588 2025-07-25 cs.CV cs.AI 81%

When Large Vision-Language Model Meets Large Remote Sensing Imagery: Coarse-to-Fine Text-Guided Token Pruning

Junwei Luo, Yingying Zhang, Xue Yang, Kang Wu, Qi Zhu, Lei Liang, Jingdong Chen, Yansheng Li

机构 * Wuhan University(武汉大学) Ant Group(蚂蚁集团) SAIS, Shanghai Jiao Tong University(上海交通大学国际学院)

专题命中 VLM训练与架构 :vision-language model(title,abstract);分类 cs.CV、cs.AI

Comments 18 pages, 6 figures, 18 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.06788 2025-07-25 cs.CV cs.AI 81%

EVEv2: Improved Baselines for Encoder-Free Vision-Language Models

Haiwen Diao, Xiaotong Li, Yufeng Cui, Yueze Wang, Haoge Deng, Ting Pan, Wenxuan Wang, Huchuan Lu, Xinlong Wang

机构 * DLUT(大连理工大学) BAAI(北京人工智能研究院) PKU(北京大学) BUPT(北京邮电大学) UCAS(中国科学院大学) CASIA(中国科学院自动化研究所)

专题命中 VLM训练与架构 :vision-language model(title,abstract);分类 cs.CV、cs.AI

Comments 20 pages, 10 figures, Accepted by ICCV2025 (highlight)

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.11153 2025-07-16 cs.CV cs.AI 81%

Assessing Color Vision Test in Large Vision-language Models

Hongfei Ye, Bin Chen, Wenxi Liu, Yu Zhang, Zhao Li, Dandan Ni, Hongyang Chen

机构 * University of Chinese Academy of Sciences(中国科学院大学) Zhejiang Lab(浙江实验室) Zhejiang University(浙江大学)

专题命中 VLM训练与架构 :vision-language model(title,abstract);分类 cs.CV、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.06845 2025-07-08 cs.CL cs.AI cs.LG 81%

7B Fully Open Source Moxin-LLM/VLM -- From Pretraining to GRPO-based Reinforcement Learning Enhancement

Pu Zhao, Xuan Shen, Zhenglun Kong, Yixin Shen, Sung-En Chang, Arash Akbari, Timothy Rupprecht, Lei Lu, Enfu Nan, Changdi Yang, Yumei He, Weiyan Shi, Xingchen Xu, Yu Huang, Wei Jiang, Wei Wang, Yue Chen, Yong He, Yanzhi Wang

机构 * Northeastern University(东北大学) Harvard University(哈佛大学) Cornell University(康奈尔大学) Tulane University(路易斯安那州立大学) University of Washington(华盛顿大学) Futurewei Technologies(未来科技) AIBAO LLC

专题命中 VLM训练与架构 :VLM(title);vision language model(abstract);分类 cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.10334 2025-06-13 cs.CV cs.AI 81%

Using Vision Language Models to Detect Students' Academic Emotion through Facial Expressions

Deliang Wang, Chao Yang, Gaowei Chen

机构 * Faculty of Education(教育学院) The University of Hong Kong(香港大学)

专题命中 VLM训练与架构 :vision language model(title);vision-language model(abstract);分类 cs.CV、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2404.10332 2025-06-05 cs.CV cs.AI 81%

Prescribing the Right Remedy: Mitigating Hallucinations in Large Vision-Language Models via Targeted Instruction Tuning

Rui Hu, Yahan Tu, Shuyu Wei, Dongyuan Lu, Jitao Sang

机构 * Beijing Key Lab of Traffic Data Analysis and Mining(北京交通大数据分析与挖掘重点实验室) Beijing Jiaotong University(北京交通大学) School of Information Technology and Management(信息科学技术学院)

专题命中 VLM训练与架构 :vision-language model(title,abstract);分类 cs.CV、cs.AI

Comments Accepted in Information Sciences 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.16282 2025-06-03 eess.IV cs.AI cs.CV 81%

Brain-Adapter: Enhancing Neurological Disorder Analysis with Adapter-Tuning Multimodal Large Language Models

Jing Zhang, Xiaowei Yu, Yanjun Lyu, Lu Zhang, Tong Chen, Chao Cao, Yan Zhuang, Minheng Chen, Tianming Liu, Dajiang Zhu

专题命中 VLM训练与架构 :multimodal large language model(title,abstract);分类 cs.CV、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.00479 2025-06-03 cs.CL cs.CV cs.LG 81%

EffiVLM-BENCH: A Comprehensive Benchmark for Evaluating Training-Free Acceleration in Large Vision-Language Models

Zekun Wang, Minghua Ma, Zexin Wang, Rongchuan Mu, Liping Shan, Ming Liu, Bing Qin

机构 * Harbin Institute of Technology(哈尔滨工业大学) Pengcheng Laboratory(鹏城实验室) Du Xiaoman Science Technology Co., Ltd(杜祥曼科技有限公司)

专题命中 VLM训练与架构 :vision-language model(title,abstract);分类 cs.CV、cs.LG

Comments ACL 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.15210 2025-06-02 cs.LG cs.AI cs.CL 81%

PairBench: Are Vision-Language Models Reliable at Comparing What They See?

Aarash Feizi, Sai Rajeswar, Adriana Romero-Soriano, Reihaneh Rabbany, Valentina Zantedeschi, Spandana Gella, João Monteiro

专题命中 VLM训练与架构 :vision-language model(title);vision language model(abstract);分类 cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.21061 2025-05-28 cs.CV cs.AI 81%

LPOI: Listwise Preference Optimization for Vision Language Models

Fatemeh Pesaran Zadeh, Yoojin Oh, Gunhee Kim

专题命中 VLM训练与架构 :vision language model(title);VLM(abstract);分类 cs.CV、cs.AI

Comments ACL 2025 Main. Code is released at https://github.com/fatemehpesaran310/lpoi

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.19235 2025-05-27 cs.LG cs.CV 81%

CoreMatching: A Co-adaptive Sparse Inference Framework with Token and Neuron Pruning for Comprehensive Acceleration of Vision-Language Models

Qinsi Wang, Hancheng Ye, Ming-Yu Chung, Yudong Liu, Yueqian Lin, Martin Kuo, Mingyuan Ma, Jianyi Zhang, Yiran Chen

专题命中 VLM训练与架构 :vision-language model(title,abstract);分类 cs.CV、cs.LG

Comments ICML 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.14728 2025-05-22 cs.CV cs.AI cs.CL cs.CY cs.MM 81%

MORALISE: A Structured Benchmark for Moral Alignment in Visual Language Models

Xiao Lin, Zhining Liu, Ze Yang, Gaotang Li, Ruizhong Qiu, Shuke Wang, Hui Liu, Haotian Li, Sumit Keswani, Vishwa Pardeshi, Huijun Zhao, Wei Fan, Hanghang Tong

机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) Amazon(亚马逊) Fidelity Investments(富达投资)

专题命中 VLM训练与架构 :visual language model(title);vision-language model(abstract);分类 cs.CV、cs.AI

Comments 21 pages, 11 figures, 7 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.12359 2025-05-20 cs.LG cs.CV 81%

STAR: Stage-Wise Attention-Guided Token Reduction for Efficient Large Vision-Language Models Inference

Yichen Guo, Hanze Li, Zonghao Zhang, Jinhao You, Kai Tang, Xiande Huang

机构 * De Artificial Intelligence Lab(人工智能实验室)

专题命中 VLM训练与架构 :vision-language model(title,abstract);分类 cs.CV、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.07864 2025-05-14 cs.AI cs.CL cs.CV 81%

Arrow-Guided VLM: Enhancing Flowchart Understanding via Arrow Direction Encoding

Takamitsu Omasa, Ryo Koshihara, Masumi Morishige

机构 * Galirage Inc.(加里拉格公司)

专题命中 VLM训练与架构 :VLM(title);vision-language model(abstract);分类 cs.CV、cs.AI

Comments 11 pages, 1 figures,

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.02056 2025-05-06 cs.CV cs.LG 81%

Handling Imbalanced Pseudolabels for Vision-Language Models with Concept Alignment and Confusion-Aware Calibrated Margin

Yuchen Wang, Xuefeng Bai, Xiucheng Li, Weili Guan, Liqiang Nie, Xinyang Chen

专题命中 VLM训练与架构 :vision-language model(title,abstract);分类 cs.CV、cs.LG

Comments Accepted to ICML 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.15929 2025-04-25 cs.CV cs.AI 81%

Meta-Entity Driven Triplet Mining for Aligning Medical Vision-Language Models

Saban Ozturk, Melih B. Yilmaz, Muti Kara, M. Talat Yavuz, Aykut Koç, Tolga Çukur

专题命中 VLM训练与架构 :vision-language model(title,abstract);分类 cs.CV、cs.AI

Comments 18 pages, 7 figures, 6 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.14123 2025-04-22 cs.AI cs.CL cs.CV 81%

Bayesian Principles Improve Prompt Learning In Vision-Language Models

Mingyu Kim, Jongwoo Ko, Mijung Park

机构 * UBC CS(不列颠哥伦比亚大学计算机科学系) KAIST AI(韩国科学技术院人工智能学院)

专题命中 VLM训练与架构 :vision-language model(title,abstract);分类 cs.CV、cs.AI

Comments AISTATS2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.06298 2025-04-10 cs.CV cs.LG 81%

Ternarization of Vision Language Models for use on edge devices

Ben Crulis, Cyril De Runz, Barthelemy Serres, Gilles Venturini

专题命中 VLM训练与架构 :vision language model(title,abstract);分类 cs.CV、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.18278 2025-04-01 cs.CV cs.AI 81%

TopV: Compatible Token Pruning with Inference Time Optimization for Fast and Low-Memory Multimodal Vision Language Model

Cheng Yang, Yang Sui, Jinqi Xiao, Lingyi Huang, Yu Gong, Chendi Li, Jinghua Yan, Yu Bai, Ponnuswamy Sadayappan, Xia Hu, Bo Yuan

专题命中 VLM训练与架构 :vision language model(title);vision-language model(abstract);分类 cs.CV、cs.AI

Comments Accepted by CVPR 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2405.12523 2025-03-31 cs.CV cs.AI 81%

Single Image Unlearning: Efficient Machine Unlearning in Multimodal Large Language Models

Jiaqi Li, Qianshan Wei, Chuanyi Zhang, Guilin Qi, Miaozeng Du, Yongrui Chen, Sheng Bi, Fan Liu

专题命中 VLM训练与架构 :multimodal large language model(title,abstract);分类 cs.CV、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.18013 2025-03-25 cs.CV cs.AI 81%

Vision-R1: Evolving Human-Free Alignment in Large Vision-Language Models via Vision-Guided Reinforcement Learning

Yufei Zhan, Yousong Zhu, Shurong Zheng, Hongyin Zhao, Fan Yang, Ming Tang, Jinqiao Wang

专题命中 VLM训练与架构 :vision-language model(title,abstract);分类 cs.CV、cs.AI

Comments Project in development. Github: https://github.com/jefferyZhan/Griffon/tree/master/Vision-R1

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.03871 2025-03-24 cs.CV cs.AI cs.ET cs.IR cs.MM 81%

CLIP-PING: Boosting Lightweight Vision-Language Models with Proximus Intrinsic Neighbors Guidance

Chu Myaet Thwal, Ye Lin Tun, Minh N. H. Nguyen, Eui-Nam Huh, Choong Seon Hong

专题命中 VLM训练与架构 :vision-language model(title,abstract);分类 cs.CV、cs.AI

Comments 14 pages, 5 figures, 24 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2408.02032 2025-03-18 cs.CV cs.AI 81%

Self-Introspective Decoding: Alleviating Hallucinations for Large Vision-Language Models

Fushuo Huo, Wenchao Xu, Zhong Zhang, Haozhao Wang, Zhicheng Chen, Peilin Zhao

专题命中 VLM训练与架构 :vision-language model(title,abstract);分类 cs.CV、cs.AI

Comments ICLR2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.11609 2025-03-17 cs.CV cs.LG cs.MM 81%

Rethinking Few-Shot Adaptation of Vision-Language Models in Two Stages

Matteo Farina, Massimiliano Mancini, Giovanni Iacca, Elisa Ricci

专题命中 VLM训练与架构 :vision-language model(title,abstract);分类 cs.CV、cs.LG

Comments Camera-ready version for CVPR 2025 (w/ SuppMat, 23 pages)

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.11241 2025-03-17 cs.CV cs.AI 81%

Compound Expression Recognition via Large Vision-Language Models

Jun Yu, Xilong Lu

专题命中 VLM训练与架构 :vision-language model(title,abstract);分类 cs.CV、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.14717 2025-03-11 cs.LG cs.CL cs.CV 81%

FedMLLM: Federated Fine-tuning MLLM on Multimodal Heterogeneity Data

Binqian Xu, Xiangbo Shu, Haiyang Mei, Guosen Xie, Basura Fernando, Jinhui Tang

专题命中 VLM训练与架构 :MLLM(title);multimodal large language model(abstract);分类 cs.CV、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.13085 2025-03-04 cs.LG cs.CL cs.CV 81%

MMed-RAG: Versatile Multimodal RAG System for Medical Vision Language Models

Peng Xia, Kangyu Zhu, Haoran Li, Tianze Wang, Weijia Shi, Sheng Wang, Linjun Zhang, James Zou, Huaxiu Yao

专题命中 VLM训练与架构 :vision language model(title);vision-language model(abstract);分类 cs.CV、cs.LG

Comments ICLR 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.04734 2025-02-26 cs.LG cs.CL cs.CV 81%

TLDR: Token-Level Detective Reward Model for Large Vision Language Models

Deqing Fu, Tong Xiao, Rui Wang, Wang Zhu, Pengchuan Zhang, Guan Pang, Robin Jia, Lawrence Chen

专题命中 VLM训练与架构 :vision language model(title);multimodal large language model(abstract);分类 cs.CV、cs.LG

Comments Published as a conference paper at ICLR 2025

详情

展开后加载摘要…

URL PDF HTML 收藏