arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视觉大模型 / VLM

视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。

共收录 5030 信号源:cs.CV, cs.AI, cs.LG

1. VLM训练与架构 5030 篇

2503.21817 2025-07-04 cs.CV 83%

Skip-Vision: Efficient and Scalable Acceleration of Vision-Language Models via Adaptive Token Skipping

Weili Zeng, Ziyuan Huang, Kaixiang Ji, Yichao Yan

机构 * MoE Key Lab of Artificial Intelligence, AI Institute Shanghai Jiao Tong University(人工智能大模型关键实验室,上海交通大学AI研究院)

专题命中 VLM训练与架构 :vision-language model(title,abstract);multimodal large language model(abstract);分类 cs.CV

Comments Accepted by ICCV2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.15318 2025-07-01 cs.CV 83%

OpenPath: Open-Set Active Learning for Pathology Image Classification via Pre-trained Vision-Language Models

Lanfeng Zhong, Xin Liao, Shichuan Zhang, Shaoting Zhang, Guotai Wang

机构 * University of Electronic Science and Technology of China(电子科技大学) Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) Department of Pathology, West China Second University Hospital, Sichuan University(四川大学病理科西昌第二大学医院部) Department of Radiation Oncology, Sichuan Cancer Hospital and Institute, University of Electronic Science and Technology of China(四川癌症医院与研究所放射肿瘤科,电子科技大学)

专题命中 VLM训练与架构 :vision-language model(title,abstract);VLM(abstract);分类 cs.CV

Comments MICCAI 2025 early accept

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.22395 2025-06-30 cs.CV 83%

Test-Time Consistency in Vision Language Models

Shih-Han Chou, Shivam Chandhok, James J. Little, Leonid Sigal

机构 * Department of Computer Science, University of British Columbia(不列颠哥伦比亚大学计算机科学系) Vector Institute for AI(人工智能矢量研究所) Canada CIFAR AI Chair(加拿大CIFAR人工智能主席)

专题命中 VLM训练与架构 :vision language model(title);vision-language model(abstract);VLM(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.21627 2025-06-30 cs.RO cs.AI 83%

FrankenBot: Brain-Morphic Modular Orchestration for Robotic Manipulation with Vision-Language Models

Shiyi Wang, Wenbo Li, Yiteng Chen, Qingyao Wu, Huiping Zhuang

机构 * School of Future Technology, South China University of Technology(未来技术学院,华南理工大学) School of Software Engineering, South China University of Technology(软件工程学院,华南理工大学) Shien-Ming Wu School of Intelligent Engineering, South China University of Technology(智能工程学院,华南理工大学)

专题命中 VLM训练与架构 :vision-language model(title,abstract);VLM(abstract);分类 cs.AI

Comments 15 pages, 4 figures, under review of NeurIPS

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.21317 2025-06-27 cs.CV 83%

LLaVA-Pose: Enhancing Human Pose and Action Understanding via Keypoint-Integrated Instruction Tuning

Dewen Zhang, Tahir Hussain, Wangpeng An, Hayaru Shouno

机构 * Department of Informatics, Graduate School of Informatics and Engineering, The University of Electro-Communications(信息学院、信息工程研究生院、东京电波通信大学)

专题命中 VLM训练与架构 :LLaVA(title,abstract);vision-language model(abstract);分类 cs.CV

Comments arXiv admin note: substantial text overlap with arXiv:2409.09306

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.18378 2025-06-24 eess.IV cs.CV 83%

Taming Vision-Language Models for Medical Image Analysis: A Comprehensive Review

Haoneng Lin, Cheng Xu, Jing Qin

机构 * Center of Smart Health, Hong Kong Polytechnic University, Hong Kong, China(智能健康中心,香港理工大学,中国)

专题命中 VLM训练与架构 :vision-language model(title,abstract);VLM(abstract);分类 cs.CV

Comments 34 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.16691 2025-06-23 cs.CV 83%

LaVi: Efficient Large Vision-Language Models via Internal Feature Modulation

Tongtian Yue, Longteng Guo, Yepeng Tang, Zijia Zhao, Xinxin Zhu, Hua Huang, Jing Liu

机构 * Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) School of Artificial Intelligence, University of Chinese Academy of Sciences(中国科学院大学人工智能学院) Institute of Information Science, Beijing Jiaotong University(北京交通大学信息科学研究院) School of Artificial Intelligence, Beijing Normal University(北京师范大学人工智能学院)

专题命中 VLM训练与架构 :vision-language model(title,abstract);LLaVA(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.15477 2025-06-19 cs.CV 83%

Multimodal Large Language Models for Medical Report Generation via Customized Prompt Tuning

Chunlei Li, Jingyang Hou, Yilei Shi, Jingliang Hu, Xiao Xiang Zhu, Lichao Mou

机构 * MedAI Technology (Wuxi) Co. Ltd.(MedAI技术(无锡)有限公司) Technical University of Munich(慕尼黑技术大学)

专题命中 VLM训练与架构 :multimodal large language model(title,abstract);MLLM(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.12822 2025-06-17 cs.LG cs.RO 83%

Enhancing Rating-Based Reinforcement Learning to Effectively Leverage Feedback from Large Vision-Language Models

Tung Minh Luu, Younghwan Lee, Donghoon Lee, Sunho Kim, Min Jun Kim, Chang D. Yoo

机构 * Korea Advanced Institute of Science and Technology (KAIST)(韩国科学技术院)

专题命中 VLM训练与架构 :vision-language model(title,abstract);VLM(abstract);分类 cs.LG

Comments Accepted to ICML 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.12683 2025-06-17 cs.CV q-bio.QM 83%

Evaluating Cell Type Inference in Vision Language Models Under Varying Visual Context

Samarth Singhal, Sandeep Singhal

机构 * University of North Dakota(北达科他大学)

专题命中 VLM训练与架构 :vision language model(title);vision-language model(abstract);VLM(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.14361 2025-06-11 cs.CV 83%

Vision-Language Modeling Meets Remote Sensing: Models, Datasets and Perspectives

Xingxing Weng, Chao Pang, Gui-Song Xia

机构 * School of Computer Science, Wuhan University(武汉大学计算机学院) School of Artificial Intelligence, Wuhan University(武汉大学人工智能学院)

专题命中 VLM训练与架构 :vision-language model(title,abstract);VLM(abstract);分类 cs.CV

Comments Accepted by IEEE Geoscience and Remote Sensing Magazine

Journal ref IEEE Geoscience and Remote Sensing Magazine, Early Access, 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.07627 2025-06-10 cs.CV 83%

Event-Priori-Based Vision-Language Model for Efficient Visual Understanding

Haotong Qin, Cheng Hu, Michele Magno

机构 * Center for Project-Based Learning D-ITET, ETH Zürich, Switzerland(项目基于学习中心D-ITET,苏黎世联邦理工学院,瑞士) State Key Laboratory of Industrial Control Technology, Zhejiang University, China(工业控制技术国家重点实验室,浙江大学,中国)

专题命中 VLM训练与架构 :vision-language model(title,abstract);VLM(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.03420 2025-06-10 cs.MM cs.CV 83%

Mitigating Image Captioning Hallucinations in Vision-Language Models

Fei Zhao, Chengcui Zhang, Runlin Zhang, Tianyang Wang, Xi Li

机构 * Department of Computer Science, The University of Alabama at Birmingham(亚拉巴马大学伯明翰分校计算机科学系) Department of Computer Science, University of Waterloo(滑铁卢大学计算机科学系)

专题命中 VLM训练与架构 :vision-language model(title,abstract);LLaVA(abstract);分类 cs.CV

Journal ref IEEE International Conference on Multimedia Information Processing and Retrieval (MIPR) 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.05952 2025-06-10 cs.CV cs.CL 83%

Scalable Vision Language Model Training via High Quality Data Curation

Hongyuan Dong, Zijian Kang, Weijie Yin, Xiao Liang, Chao Feng, Jiao Ran

机构 * ByteDance Douyin Content Group(字节跳动抖音内容团队)

专题命中 VLM训练与架构 :vision language model(title,abstract);VLM(abstract);分类 cs.CV

Comments ACL 2025 Main Conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.09295 2025-06-05 cs.CL cs.CV 83%

AlignMMBench: Evaluating Chinese Multimodal Alignment in Large Vision-Language Models

Yuhang Wu, Wenmeng Yu, Yean Cheng, Yan Wang, Xiaohan Zhang, Jiazheng Xu, Ming Ding, Yuxiao Dong

机构 * Tsinghua University(清华大学) Zhipu AI(智谱AI) Peking University(北京大学)

专题命中 VLM训练与架构 :vision-language model(title,abstract);VLM(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.02708 2025-06-04 cs.CV cs.CL 83%

Iterative Self-Improvement of Vision Language Models for Image Scoring and Self-Explanation

Naoto Tanji, Toshihiko Yamasaki

专题命中 VLM训练与架构 :vision language model(title,abstract);VLM(abstract);分类 cs.CV

Comments Accepted to ICIP2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.02557 2025-06-04 cs.CV 83%

Kernel-based Unsupervised Embedding Alignment for Enhanced Visual Representation in Vision-language Models

Shizhan Gong, Yankai Jiang, Qi Dou, Farzan Farnia

专题命中 VLM训练与架构 :vision-language model(title,abstract);LLaVA(abstract);分类 cs.CV

Comments ICML 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.01203 2025-06-03 cs.CV 83%

Self-Supervised Multi-View Representation Learning using Vision-Language Model for 3D/4D Facial Expression Recognition

Muzammil Behzad

机构 * King Fahd University of Petroleum and Minerals(国王法赫德石油矿物大学)

专题命中 VLM训练与架构 :vision-language model(title,abstract);VLM(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.01097 2025-06-03 cs.CV 83%

Generic Token Compression in Multimodal Large Language Models from an Explainability Perspective

Lei Lei, Jie Gu, Xiaokang Ma, Chu Tang, Jingmin Chen, Tong Xu

机构 * University of Science and Technology of China(中国科学技术大学) Rightly Robotics(Rightly机器人公司) Shanghai Innovation Institute(上海创新研究院)

专题命中 VLM训练与架构 :multimodal large language model(title,abstract);LLaVA(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.00930 2025-06-03 cs.AI cs.CL 83%

Aligning VLM Assistants with Personalized Situated Cognition

Yongqi Li, Shen Zhou, Xiaohu Li, Xin Miao, Jintao Wen, Mayi Xu, Jianhao Chen, Birong Pan, Hankun Kang, Yuanyuan Zhu, Ming Zhong, Tieyun Qian

机构 * School of Computer Science, Wuhan University(武汉大学计算机学院) Zhongguancun Academy(中关村学院)

专题命中 VLM训练与架构 :VLM(title,abstract);vision-language model(abstract);分类 cs.AI

Comments Accepted to ACL 2025 (main), camera-ready version

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.00805 2025-06-03 cs.CV cs.CL 83%

HSCR: Hierarchical Self-Contrastive Rewarding for Aligning Medical Vision Language Models

Songtao Jiang, Yan Zhang, Yeying Jin, Zhihang Tang, Yangyang Wu, Yang Feng, Jian Wu, Zuozhu Liu

机构 * Zhejiang University(浙江大学) Byte Dance(字节跳动) National University of Singapore(新加坡国立大学) Angelalign Inc China(Angelalign中国公司) Zhejiang Key Laboratory of Medical Imaging Artificial Intelligence(浙江省医学影像人工智能重点实验室)

专题命中 VLM训练与架构 :vision language model(title);vision-language model(abstract);VLM(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.24208 2025-06-02 cs.AI 83%

Bootstrapping LLM Robustness for VLM Safety via Reducing the Pretraining Modality Gap

Wenhan Yang, Spencer Stice, Ali Payani, Baharan Mirzasoleiman

机构 * Computer Science Department UCLA(计算机科学系,加州大学洛杉矶分校) Cisco Systems Inc.(思科系统公司)

专题命中 VLM训练与架构 :VLM(title);vision-language model(abstract);LLaVA(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.21465 2025-05-28 cs.CV cs.CL 83%

ID-Align: RoPE-Conscious Position Remapping for Dynamic High-Resolution Adaptation in Vision-Language Models

Bozhou Li, Wentao Zhang

机构 * Peking University(北京大学)

专题命中 VLM训练与架构 :vision-language model(title,abstract);LLaVA(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.12057 2025-05-20 cs.AI 83%

CorBenchX: Large-Scale Chest X-Ray Error Dataset and Vision-Language Model Benchmark for Report Error Correction

Jing Zou, Qingqiu Li, Chenyu Lian, Lihao Liu, Xiaohan Yan, Shujun Wang, Jing Qin

机构 * Center for Smart Health, The Hong Kong Polytechnic University(智能健康中心,香港理工大学) School of Computer Science, Fudan University(复旦大学计算机科学学院) Amazon(亚马逊) Tongji University(同济大学) Department of Biomedical Engineering, The Hong Kong Polytechnic University(生物医学工程系,香港理工大学) Research Institute for Smart Ageing, The Hong Kong Polytechnic University(智能老龄化研究 institute,香港理工大学)

专题命中 VLM训练与架构 :vision-language model(title,abstract);InternVL(abstract);分类 cs.AI

Comments 12 pages, 5figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.09897 2025-05-20 cs.CV 83%

TAMP: Token-Adaptive Layerwise Pruning in Multimodal Large Language Models

Jaewoo Lee, Keyang Xuan, Chanakya Ekbote, Sandeep Polisetty, Yi R. Fung, Paul Pu Liang

机构 * University of North Carolina Chapel Hill(北卡罗来纳大学教堂山分校) University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) Massachusetts Institute of Technology(麻省理工学院) University of Massachusetts Amherst(马萨诸塞大学阿默斯特分校) Hong Kong University of Science and Technology(香港科学与技术大学)

专题命中 VLM训练与架构 :multimodal large language model(title,abstract);LLaVA(abstract);分类 cs.CV

Comments ACL Findings 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.18711 2025-05-19 cs.CV cs.CL 83%

Evaluating Vision-Language Models as Evaluators in Path Planning

Mohamed Aghzal, Xiang Yue, Erion Plaku, Ziyu Yao

专题命中 VLM训练与架构 :vision-language model(title,abstract);VLM(abstract);分类 cs.CV

Comments Accepted to the 2025 IEEE / CVF Computer Vision and Pattern Recognition Conference (CVPR)

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.10088 2025-05-16 cs.CV 83%

MMRL++: Parameter-Efficient and Interaction-Aware Representation Learning for Vision-Language Models

Yuncheng Guo, Xiaodong Gu

专题命中 VLM训练与架构 :vision-language model(title,abstract);VLM(abstract);分类 cs.CV

Comments Due to the limitation "The abstract field cannot be longer than 1,920 characters", the abstract appearing here is slightly shorter than that in the PDF file

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.09139 2025-05-15 cs.CV 83%

Beyond General Prompts: Automated Prompt Refinement using Contrastive Class Alignment Scores for Disambiguating Objects in Vision-Language Models

Lucas Choi, Ross Greer

机构 * University of California, Merced(加州大学默塞德分校)

专题命中 VLM训练与架构 :vision-language model(title,abstract);VLM(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.07690 2025-05-13 cs.CV 83%

Beyond CLIP Generalization: Against Forward&Backward Forgetting Adapter for Continual Learning of Vision-Language Models

Songlin Dong, Chenhao Ding, Jiangyang Li, Jizhou Han, Qiang Wang, Yuhang He, Yihong Gong

机构 * College of Artificial Intelligence, Xi’an Jiaotong University(人工智能学院,西安交通大学) School of Software Engineering, Xi’an Jiaotong University(软件工程学院,西安交通大学)

专题命中 VLM训练与架构 :vision-language model(title,abstract);VLM(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.03350 2025-05-07 cs.CV 83%

A Vision-Language Model for Focal Liver Lesion Classification

Song Jian, Hu Yuchang, Wang Hui, Chen Yen-Wei

专题命中 VLM训练与架构 :vision-language model(title,abstract);VLM(abstract);分类 cs.CV

Comments 9 pages,4 figures, 4 tables,Innovation in Medicine and Healthcare Proceedings of 13th KES-InMed 2025

详情

展开后加载摘要…

URL PDF HTML 收藏