arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视觉大模型 / VLM

视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。

共收录 5039 信号源:cs.CV, cs.AI, cs.LG

1. VLM训练与架构 5039 篇

2508.17380 2025-08-26 cs.AI 79%

Mimicking the Physicist's Eye:A VLM-centric Approach for Physics Formula Discovery

Jiaqi Liu, Songning Lai, Pengze Li, Di Yu, Wenjie Zhou, Yiyang Zhou, Peng Xia, Zijun Wang, Xi Chen, Shixiang Tang, Lei Bai, Wanli Ouyang, Mingyu Ding, Huaxiu Yao, Aoran Wang

机构 * UNC–Chapel Hill(北卡罗来纳大学教堂山分校) HKUST (Guangzhou)(香港科技大学(广州)) Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) Fudan University(复旦大学) Tsinghua University(清华大学) Nankai University(南开大学) UC Santa Cruz(圣塔克鲁兹大学) The Chinese University of Hong Kong(香港中文大学) Shanghai Innovation Institute(上海创新研究院)

专题命中 VLM训练与架构 :VLM(title,abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.14537 2025-08-21 cs.CV 79%

WISE-FUSE: Efficient Whole Slide Image Encoding via Coarse-to-Fine Patch Selection with VLM and LLM Knowledge Fusion

Yonghan Shin, SeungKyu Kim, Won-Ki Jeong

专题命中 VLM训练与架构 :VLM(title);vision-language model(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.12877 2025-08-19 cs.CV 79%

Preserve and Sculpt: Manifold-Aligned Fine-tuning of Vision-Language Models for Few-Shot Learning

Dexia Chen, Qianjie Zhu, Weibing Li, Yue Yu, Tong Zhang, Ruixuan Wang

专题命中 VLM训练与架构 :vision-language model(title,abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.12512 2025-08-19 cs.CV 79%

LangVision-LoRA-NAS: Neural Architecture Search for Variable LoRA Rank in Vision Language Models

Krishna Teja Chitty-Venkata, Murali Emani, Venkatram Vishwanath

专题命中 VLM训练与架构 :vision language model(title,abstract);分类 cs.CV

Comments Accepted by ICIP 2025 Conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.12137 2025-08-19 cs.CV 79%

Infusing fine-grained visual knowledge to Vision-Language Models

Nikolaos-Antonios Ypsilantis, Kaifeng Chen, André Araujo, Ondřej Chum

机构 * VRG, FEE, Czech Technical University in Prague(捷克布拉格技术大学)

专题命中 VLM训练与架构 :vision-language model(title);VLM(abstract);分类 cs.CV

Comments ICCVW 2025 accepted paper. Workshop name: "What is Next in Multimodal Foundation Models?"

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.11176 2025-08-18 cs.CV 79%

Fine-Grained VLM Fine-tuning via Latent Hierarchical Adapter Learning

Yumiao Zhao, Bo Jiang, Yuhe Ding, Xiao Wang, Jin Tang, Bin Luo

机构 * Information Materials and Intelligent Sensing Laboratory of Anhui Province(安徽省信息材料与智能感知实验室) Anhui Provincial Key Laboratory of Multimodal Cognitive Computation(安徽省多模态认知计算重点实验室) School of Computer Science and Technology, Anhui University(安徽大学计算机科学与技术学院)

专题命中 VLM训练与架构 :VLM(title);vision-language model(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.14976 2025-08-15 cs.CV 79%

Hierarchical Cross-modal Prompt Learning for Vision-Language Models

Hao Zheng, Shunzhi Yang, Zhuoxin He, Jinfeng Yang, Zhenhua Huang

机构 * South China Normal University(华南师范大学) Shenzhen Polytechnic University(深圳职业技术大学)

专题命中 VLM训练与架构 :vision-language model(title,abstract);分类 cs.CV

Comments Accepted by ICCV2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.00332 2025-08-14 cs.AI q-bio.NC 79%

Vision Language Models Know Law of Conservation without Understanding More-or-Less

Dezhi Luo, Haiyun Lyu, Qingying Gao, Haoran Sun, Yijiang Li, Hokin Deng

机构 * University of Michigan(密歇根大学) University of North Carolina at Chapel Hill(北卡罗来纳大学教堂山分校) Johns Hopkins University(约翰霍普金斯大学) University of California, San Diego(加州大学圣地亚哥分校) Carnegie Mellon University(卡内基梅隆大学)

专题命中 VLM训练与架构 :vision language model(title,abstract);分类 cs.AI

Comments Published at the ICLR 2025 Workshop on Bidirectional Human-AI Alignment (BiAlign)

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.06795 2025-08-13 cs.CL cs.CV 79%

From Pixels to Tokens: Revisiting Object Hallucinations in Large Vision-Language Models

Yuying Shang, Xinyi Zeng, Yutao Zhu, Xiao Yang, Zhengwei Fang, Jingyuan Zhang, Jiawei Chen, Zinan Liu, Yu Tian

机构 * University of Chinese Academy of Sciences(中国科学院大学) Dept. of Comp. Sci. and Tech., Institute for AI, Tsinghua University(计算机科学与技术系,人工智能研究院,清华大学) Gaoling School of Artificial Intelligence, Renmin University of China(人工智能学院,中国人民大学) Kuaishou Technology Inc.(快手科技有限公司) Shanghai Key Laboratory of Multi. Info. Processing, East China Normal University(多信息处理重点实验室,华东师范大学)

专题命中 VLM训练与架构 :vision-language model(title,abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.04963 2025-08-08 cs.IR cs.LG 79%

A Metric for MLLM Alignment in Large-scale Recommendation

Yubin Zhang, Yanhua Huang, Haiming Xu, Mingliang Qi, Chang Wang, Jiarui Jin, Xiangyuan Ren, Xiaodan Wang, Ruiwen Xu

机构 * Xiaohongshu Inc.(小红书公司)

专题命中 VLM训练与架构 :MLLM(title);multimodal large language model(abstract);分类 cs.LG

Comments Pre-print.Under Review

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.01548 2025-08-05 cs.CV 79%

A Glimpse to Compress: Dynamic Visual Token Pruning for Large Vision-Language Models

Quan-Sheng Zeng, Yunheng Li, Qilong Wang, Peng-Tao Jiang, Zuxuan Wu, Ming-Ming Cheng, Qibin Hou

机构 * VCIP, CS, Nankai University(VCIP计算机科学系,南开大学) Shanghai Innovation Institute(上海创新研究院) Tianjin University(天津大学) vivo Mobile Communication Co., Ltd(vivo移动通信有限公司)

专题命中 VLM训练与架构 :vision-language model(title,abstract);分类 cs.CV

Comments 15 pages, 10 figures. Project page: https://github.com/HVision-NKU/GlimpsePrune

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.15731 2025-08-05 cs.CV 79%

The Inter-Intra Modal Measure: A Predictive Lens on Fine-Tuning Outcomes in Vision-Language Models

Laura Niss, Kevin Vogt-Lowell, Theodoros Tsiligkaridis

机构 * MIT Lincoln Laboratory(麻省理工学院林肯实验室)

专题命中 VLM训练与架构 :vision-language model(title,abstract);分类 cs.CV

Comments Accepted to ICCV 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.00260 2025-08-04 cs.CV cs.MM 79%

Instruction-Grounded Visual Projectors for Continual Learning of Generative Vision-Language Models

Hyundong Jin, Hyung Jin Chang, Eunwoo Kim

机构 * School of Computer Science and Engineering, Chung-Ang University(Chung-Ang 大学计算机科学与工程学院) School of Computer Science, University of Birmingham(布拉德福德大学计算机科学学院)

专题命中 VLM训练与架构 :vision-language model(title,abstract);分类 cs.CV

Comments Accepted to ICCV 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.13180 2025-08-04 cs.CV 79%

Feather the Throttle: Revisiting Visual Token Pruning for Vision-Language Model Acceleration

Mark Endo, Xiaohan Wang, Serena Yeung-Levy

机构 * Stanford University(斯坦福大学)

专题命中 VLM训练与架构 :vision-language model(title,abstract);分类 cs.CV

Comments ICCV 2025, project page: https://web.stanford.edu/~markendo/projects/feather

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.06458 2025-08-01 cs.CV 79%

Pruning All-Rounder: Rethinking and Improving Inference Efficiency for Large Vision Language Models

Wei Suo, Ji Ma, Mengyang Sun, Lin Yuanbo Wu, Peng Wang, Yanning Zhang

机构 * Northwestern Polytechnical University(西北工业大学) Swansea University(斯旺西大学)

专题命中 VLM训练与架构 :vision language model(title);vision-language model(abstract);分类 cs.CV

Comments Accepted by ICCV 25

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.20842 2025-07-29 cs.CV 79%

METEOR: Multi-Encoder Collaborative Token Pruning for Efficient Vision Language Models

Yuchen Liu, Yaoming Wang, Bowen Shi, Xiaopeng Zhang, Wenrui Dai, Chenglin Li, Hongkai Xiong, Qi Tian

专题命中 VLM训练与架构 :vision language model(title,abstract);分类 cs.CV

Comments Accepted by ICCV 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.08607 2025-07-14 cs.CV 79%

BayesTTA: Continual-Temporal Test-Time Adaptation for Vision-Language Models via Gaussian Discriminant Analysis

Shuang Cui, Jinglin Xu, Yi Li, Xiongxin Tang, Jiangmeng Li, Jiahuan Zhou, Fanjiang Xu, Fuchun Sun, Hui Xiong

机构 * National Key Laboratory of Space Integrated Information System(国家空间信息集成系统重点实验室) Institute of Software Chinese Academy of Sciences(中国科学院软件研究所) University of Chinese Academy of Sciences(中国科学院大学) Wangxuan Institute of Computer Technology(计算机技术王轩研究所) Peking University(北京大学) Department of Computer Science and Technology(计算机科学与技术系) Tsinghua University(清华大学) Thrust of Artificial Intelligence, the Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)人工智能方向) Department of Computer Science & Engineering, the Hong Kong University of Science and Technology(香港科技大学计算机科学与工程系)

专题命中 VLM训练与架构 :vision-language model(title,abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.08410 2025-07-14 cs.CV 79%

Multi-modal Mutual-Guidance Conditional Prompt Learning for Vision-Language Models

Shijun Yang, Xiang Zhang, Wanqing Zhao, Hangzai Luo, Sheng Zhong, Jinye Peng, Jianping Fan

机构 * School of Information and Technology, Northwest University(信息与技术学院,西北大学)

专题命中 VLM训练与架构 :vision-language model(title,abstract);分类 cs.CV

Comments 21 pages, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.05677 2025-07-10 cs.CV 79%

Integrated Structural Prompt Learning for Vision-Language Models

Jiahui Wang, Qin Xu, Bo Jiang, Bin Luo

机构 * School of Computer Science and Technology(计算机科学与技术学院) Anhui University(安徽大学) The Key Laboratory of Intelligent Computing(智能计算重点实验室) Intelligent Sensing Laboratory of Anhui Province(安徽省智能感知实验室)

专题命中 VLM训练与架构 :vision-language model(title,abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.05668 2025-07-09 cs.CV 79%

Dynamic Rank Adaptation for Vision-Language Models

Jiahui Wang, Qin Xu, Bo Jiang, Bin Luo

机构 * Anhui University(安徽大学)

专题命中 VLM训练与架构 :vision-language model(title,abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.03283 2025-07-08 cs.CV 79%

MolVision: Molecular Property Prediction with Vision Language Models

Deepan Adak, Yogesh Singh Rawat, Shruti Vyas

机构 * NIT Kurukshetra(尼特学院) University of Central Florida(中央佛罗里达大学)

专题命中 VLM训练与架构 :vision language model(title);vision-language model(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.02279 2025-07-04 cs.CV 79%

LaCo: Efficient Layer-wise Compression of Visual Tokens for Multimodal Large Language Models

Juntao Liu, Liqiang Niu, Wenchao Chen, Jie Zhou, Fandong Meng

机构 * Pattern Recognition Center, WeChat AI, Tencent Inc(模式识别中心、微信AI、腾讯公司)

专题命中 VLM训练与架构 :multimodal large language model(title,abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.01673 2025-07-03 cs.CV 79%

Facial Emotion Learning with Text-Guided Multiview Fusion via Vision-Language Model for 3D/4D Facial Expression Recognition

Muzammil Behzad

机构 * King Fahd University of Petroleum and Minerals(国王法赫德石油矿物大学) SDAIA-KFUPM Joint Research Center on Artificial Intelligence(SDAIA-KFUPM人工智能联合研究中心)

专题命中 VLM训练与架构 :vision-language model(title);VLM(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.23822 2025-07-01 cs.CV 79%

Interpretable Zero-Shot Learning with Locally-Aligned Vision-Language Model

Shiming Chen, Bowen Duan, Salman Khan, Fahad Shahbaz Khan

机构 * Mohamed bin Zayed University of AI(莫扎伊德大学人工智能学院) Huazhong University of Science and Technology(华中科技大学) Australian National University(澳大利亚国立大学) Linköping University(林雪平大学)

专题命中 VLM训练与架构 :vision-language model(title,abstract);分类 cs.CV

Comments Accepted to ICCV'25

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.16297 2025-07-01 cs.CV 79%

FALCON: Resolving Visual Redundancy and Fragmentation in High-resolution Multimodal Large Language Models via Visual Registers

Renshan Zhang, Rui Shao, Gongwei Chen, Miao Zhang, Kaiwen Zhou, Weili Guan, Liqiang Nie

机构 * Harbin Institute of Technology, Shenzhen(哈尔滨工业大学(深圳))

专题命中 VLM训练与架构 :multimodal large language model(title,abstract);分类 cs.CV

Comments Accepted to the IEEE/CVF International Conference on Computer Vision (ICCV) 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.00473 2025-06-19 cs.CV 79%

Jailbreak Large Vision-Language Models Through Multi-Modal Linkage

Yu Wang, Xiaofei Zhou, Yichen Wang, Geyuan Zhang, Tianxing He

机构 * Institute of Information Engineering, Chinese Academy of Sciences(中国科学院信息工程研究所) School of Cyber Security, University of Chinese Academy of Sciences(中国科学院大学网络安全学院) Institute for Interdisciplinary Information Sciences, Tsinghua University(清华大学交叉信息研究院) Shanghai Qi Zhi Institute(上海启智研究所) University of Chicago(芝加哥大学)

专题命中 VLM训练与架构 :vision-language model(title,abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.13166 2025-06-17 cs.CV 79%

GreedyPrune: Retenting Critical Visual Token Set for Large Vision Language Models

Ruiguang Pei, Weiqing Sun, Zhihui Fu, Jun Wang

专题命中 VLM训练与架构 :vision language model(title,abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.12232 2025-06-17 cs.CV cs.CL 79%

Zero-Shot Scene Understanding with Multimodal Large Language Models for Automated Vehicles

Mohammed Elhenawy, Shadi Jaradat, Taqwa I. Alhadidi, Huthaifa I. Ashqar, Ahmed Jaber, Andry Rakotonirainy, Mohammad Abu Tami

专题命中 VLM训练与架构 :multimodal large language model(title,abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.08666 2025-06-16 cs.CV 79%

LLaVA-c: Continual Improved Visual Instruction Tuning

Wenzhuo Liu, Fei Zhu, Haiyang Guo, Longhui Wei, Cheng-Lin Liu

机构 * School of Artificial Intelligence, UCAS(人工智能学院,UCAS) State Key Laboratory of Multimodal Artificial Intelligence Systems, CASIA(多模态人工智能系统国家重点实验室,CASIA) Centre for Artificial Intelligence and Robotics, HKISI-CAS(人工智能与机器人中心,HKISI-CAS) Huawei Inc(华为公司)

专题命中 VLM训练与架构 :LLaVA(title,abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.07214 2025-06-10 cs.CV cs.CR 79%

Backdoor Attack on Vision Language Models with Stealthy Semantic Manipulation

Zhiyuan Zhong, Zhen Sun, Yepang Liu, Xinlei He, Guanhong Tao

专题命中 VLM训练与架构 :vision language model(title,abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏