arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视觉大模型 / VLM

视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。

共收录 5048 信号源:cs.CV, cs.AI, cs.LG

1. VLM训练与架构 5048 篇

2509.04378 2025-09-10 cs.CV 70%

Aesthetic Image Captioning with Saliency Enhanced MLLMs

Yilin Tao, Jiashui Huang, Huaze Xu, Ling Shao

专题命中 VLM训练与架构 :multimodal large language model(abstract);MLLM(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.00700 2025-09-10 cs.CV 70%

Prompt the Unseen: Evaluating Visual-Language Alignment Beyond Supervision

Raehyuk Jung, Seungjun Yu, Hyunjung Shim

专题命中 VLM训练与架构 :vision-language model(abstract);VLM(abstract);分类 cs.CV

Comments Link to publicly available codes is added

详情

展开后加载摘要…

URL PDF HTML 收藏
2408.11505 2025-09-10 cs.CV 70%

MSCPT: Few-shot Whole Slide Image Classification with Multi-scale and Context-focused Prompt Tuning

Minghao Han, Linhao Qu, Dingkang Yang, Xukun Zhang, Xiaoying Wang, Lihua Zhang

机构 * Academy for Engineering and Technology, Fudan University(工程与技术学院,复旦大学) Fudan University(复旦大学) Zhongshan Hospital, Fudan University(复旦大学中山医院)

专题命中 VLM训练与架构 :vision-language model(abstract);VLM(abstract);分类 cs.CV

Comments This work has been submitted to the IEEE TMI for possible publication

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.20454 2025-09-10 cs.LG cs.CL 70%

CoMMIT: Coordinated Multimodal Instruction Tuning

Xintong Li, Junda Wu, Tong Yu, Yu Wang, Xiang Chen, Jiuxiang Gu, Lina Yao, Julian McAuley, Jingbo Shang

机构 * University of California, San Diego(加州大学圣地亚哥分校) Adobe Research(Adobe研究) The University of New South Wales(新南威尔士大学) CSIRO’s Data61(澳大利亚联邦科学与工业研究组织的数据61)

专题命中 VLM训练与架构 :multimodal large language model(abstract);MLLM(abstract);分类 cs.LG

Comments 9 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.03494 2025-09-09 cs.CV 70%

Parameter-Efficient Adaptation of mPLUG-Owl2 via Pixel-Level Visual Prompts for NR-IQA

Yahya Benmahane, Mohammed El Hassouni

机构 * Computer Science Department Faculty of Sciences, Rabat(科学学院计算机科学系,拉巴特) Computer Science Department FLSH(计算机科学系FLSH)

专题命中 VLM训练与架构 :multimodal large language model(abstract);MLLM(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2312.10032 2025-09-09 cs.CV 70%

Osprey: Pixel Understanding with Visual Instruction Tuning

Yuqian Yuan, Wentong Li, Jian Liu, Dongqi Tang, Xinjie Luo, Chi Qin, Lei Zhang, Jianke Zhu

机构 * Zhejiang University(浙江大学) Ant Group(蚂蚁集团) Microsoft(微软) The HongKong Polytechnical University(香港理工大学)

专题命中 VLM训练与架构 :vision-language model(abstract);multimodal large language model(abstract);分类 cs.CV

Comments CVPR2024, Code and Demo link:https://github.com/CircleRadon/Osprey

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.20309 2025-09-08 cs.CV 70%

Instruction-Oriented Preference Alignment for Enhancing Multi-Modal Comprehension Capability of MLLMs

Zitian Wang, Yue Liao, Kang Rong, Fengyun Rao, Yibo Yang, Si Liu

机构 * Beihang University(北航大学) National University of Singapore(国立新加坡大学) King Abdullah University of Science and Technology(国王 Abdullah 科学与技术大学)

专题命中 VLM训练与架构 :visual question answering(abstract);multimodal large language model(abstract);分类 cs.CV

Comments Accepted by ICCV 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.03863 2025-09-05 cs.AI 70%

Expedition & Expansion: Leveraging Semantic Representations for Goal-Directed Exploration in Continuous Cellular Automata

Sina Khajehabdollahi, Gautier Hamon, Marko Cvjetko, Pierre-Yves Oudeyer, Clément Moulin-Frier, Cédric Colas

机构 * Flowers AI & CogSci Lab, Inria, France(Flowers AI与认知科学实验室,Inria,法国) MIT, USA(麻省理工学院,美国)

专题命中 VLM训练与架构 :vision-language model(abstract);VLM(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.00305 2025-09-03 cs.CV 70%

Language-Aware Information Maximization for Transductive Few-Shot CLIP

Ghassen Baklouti, Maxime Zanella, Ismail Ben Ayed

机构 * École de Technologie Supérieure (ÉTS)(École de Technologie Supérieure) Université Catholique de Louvain (UCLouvain)(Université Catholique de Louvain) Université de Mons (UMons)(Université de Mons)

专题命中 VLM训练与架构 :vision-language model(abstract);VLM(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.21066 2025-08-29 cs.CV 70%

OneReward: Unified Mask-Guided Image Generation via Multi-Task Human Preference Learning

Yuan Gong, Xionghui Wang, Jie Wu, Shiyin Wang, Yitong Wang, Xinglong Wu

机构 * ByteDance Inc.(字节跳动公司)

专题命中 VLM训练与架构 :vision-language model(abstract);VLM(abstract);分类 cs.CV

Comments project url: https://one-reward.github.io

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.16076 2025-08-27 cs.HC cs.CV 70%

Prompting with Sign Parameters for Low-resource Sign Language Instruction Generation

Md Tariquzzaman, Md Farhan Ishmam, Saiyma Sittul Muna, Md Kamrul Hasan, Hasan Mahmud

机构 * Department of Computer Science and Engineering(计算机科学与工程系)

专题命中 VLM训练与架构 :vision language model(abstract);VLM(abstract);分类 cs.CV

Comments CV4A11y@ICCV 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.17686 2025-08-26 cs.CV 70%

Language-Guided Temporal Token Pruning for Efficient VideoLLM Processing

Yogesh Kumar

机构 * Indian Institute of Technology Jodhpur(印度理工学院朱道普尔)

专题命中 VLM训练与架构 :vision language model(abstract);LLaVA(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.17638 2025-08-26 cs.CV cs.CL 70%

Dynamic Embedding of Hierarchical Visual Features for Efficient Vision-Language Fine-Tuning

Xinyu Wei, Guoli Yang, Jialu Zhou, Mingyue Yang, Leqian Li, Kedi Zhang, Chunping Qiu

专题命中 VLM训练与架构 :vision-language model(abstract);visual question answering(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.17037 2025-08-26 cs.CV 70%

F4-ITS: Fine-grained Feature Fusion for Food Image-Text Search

Raghul Asokan

机构 * HyperVerge

专题命中 VLM训练与架构 :vision-language model(abstract);VLM(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.12603 2025-08-19 cs.CV 70%

ViLaD: A Large Vision Language Diffusion Framework for End-to-End Autonomous Driving

Can Cui, Yupeng Zhou, Juntong Peng, Sung-Yeon Park, Zichong Yang, Prashanth Sankaranarayanan, Jiaru Zhang, Ruqi Zhang, Ziran Wang

机构 * College of Engineering, Purdue University(普渡大学工程学院)

专题命中 VLM训练与架构 :vision language model(abstract);VLM(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2311.14749 2025-08-18 cs.CV 70%

Compositional Zero-shot Learning via Progressive Language-based Observations

Lin Li, Guikun Chen, Zhen Wang, Jun Xiao, Long Chen

机构 * AI Chip Center for Emerging Smart Systems(新兴智能系统人工智能芯片中心) The Hong Kong University of Science(香港科学大学) Zhejiang University College of Computer Science(浙江大学计算机科学学院)

专题命中 VLM训练与架构 :vision-language model(abstract);VLM(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.08098 2025-08-15 cs.CV 70%

TBAC-UniImage: Unified Understanding and Generation by Ladder-Side Diffusion Tuning

Junzhe Xu, Yuyang Yin, Xi Chen

机构 * Basic Algorithm Center, PCG, Tencent(腾讯基础算法中心、PCG、腾讯)

专题命中 VLM训练与架构 :multimodal large language model(abstract);MLLM(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.09524 2025-08-15 cs.CV 70%

SOI is the Root of All Evil: Quantifying and Breaking Similar Object Interference in Single Object Tracking

Yipei Wang, Shiyu Hu, Shukun Jia, Panxi Xu, Hongfei Ma, Yiping Ma, Jing Zhang, Xiaobo Lu, Xin Zhao

专题命中 VLM训练与架构 :vision-language model(abstract);VLM(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2205.14865 2025-08-14 cs.CV 70%

Prompt-aligned Gradient for Prompt Tuning

Beier Zhu, Yulei Niu, Yucheng Han, Yue Wu, Hanwang Zhang

机构 * Nanyang Technological University(南洋理工大学) Columbia University(哥伦比亚大学) Damo Academy, Alibaba Group(阿里集团大模型学院)

专题命中 VLM训练与架构 :vision-language model(abstract);VLM(abstract);分类 cs.CV

Comments ICCV2023

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.06525 2025-08-12 cs.CV 70%

Large Language Models Facilitate Vision Reflection in Image Classification

Guoyuan An, JaeYoon Kim, SungEui Yoon

专题命中 VLM训练与架构 :vision-language model(abstract);LLaVA(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.04987 2025-08-08 cs.CV 70%

Unified modality separation: A vision-language framework for unsupervised domain adaptation

Xinyao Li, Jingjing Li, Zhekai Du, Lei Zhu, Heng Tao Shen

机构 * University of Electronic Science and Technology of China(电子科学与技术大学) Tongji University(同济大学)

专题命中 VLM训练与架构 :vision-language model(abstract);VLM(abstract);分类 cs.CV

Comments Accepted to TPAMI

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.04449 2025-08-07 cs.CV cs.CL 70%

p-MoD: Building Mixture-of-Depths MLLMs via Progressive Ratio Decay

Jun Zhang, Desen Meng, Zhengming Zhang, Zhenpeng Huang, Tao Wu, Limin Wang

机构 * State Key Laboratory for Novel Software Technology, Nanjing University(南京大学新型软件技术国家重点实验室) China Mobile Research Institute(中国移动研究院) Shanghai AI Lab(上海AI实验室)

专题命中 VLM训练与架构 :multimodal large language model(abstract);MLLM(abstract);分类 cs.CV

Comments Accepted by ICCV 2025; Code released at https://github.com/MCG-NJU/p-MoD

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.02807 2025-08-06 cs.CV 70%

DreamVVT: Mastering Realistic Video Virtual Try-On in the Wild via a Stage-Wise Diffusion Transformer Framework

Tongchun Zuo, Zaiyu Huang, Shuliang Ning, Ente Lin, Chao Liang, Zerong Zheng, Jianwen Jiang, Yuan Zhang, Mingyuan Gao, Xin Dong

机构 * ByteDance Intelligent Creation(字节跳动智能创作)

专题命中 VLM训练与架构 :vision-language model(abstract);VLM(abstract);分类 cs.CV

Comments 18 pages, 12 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.00945 2025-08-05 cs.CV 70%

Optimizing Vision-Language Consistency via Cross-Layer Regional Attention Alignment

Yifan Wang, Hongfeng Ai, Quangao Liu, Maowei Jiang, Ruiyuan Kang, Ruiqi Li, Jiahua Dong, Mengting Xiao, Cheng Jiang, Chenzhong Li

机构 * School of Medicine, The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳)医学院) Shenyang Institute of Automation, Chinese Academy of Sciences(中国科学院沈阳自动化研究所) Shenzhen International Graduate School, Tsinghua University(清华大学深圳国际研究生院) Wave and Machine Intelligence Department, Technology Innovation Institute(技术创新研究院波浪与机器智能部门) University of the Chinese Academy of Sciences(中国科学院大学) McGill University(麦吉尔大学)

专题命中 VLM训练与架构 :vision language model(abstract);LLaVA(abstract);分类 cs.CV

Comments 10 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.22664 2025-08-05 cs.CV 70%

Zero-Shot Vision Encoder Grafting via LLM Surrogates

Kaiyu Yue, Vasu Singla, Menglin Jia, John Kirchenbauer, Rifaa Qadri, Zikui Cai, Abhinav Bhatele, Furong Huang, Tom Goldstein

机构 * University of Maryland(马里兰大学) Meta

专题命中 VLM训练与架构 :vision language model(abstract);VLM(abstract);分类 cs.CV

Comments ICCV 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.00400 2025-08-04 cs.CV 70%

Sari Sandbox: A Virtual Retail Store Environment for Embodied AI Agents

Janika Deborah Gajo, Gerarld Paul Merales, Jerome Escarcha, Brenden Ashley Molina, Gian Nartea, Emmanuel G. Maminta, Juan Carlos Roldan, Rowel O. Atienza

机构 * EEEI, University of the Philippines(电子工程学院,菲律宾大学) AI Graduate Program, University of the Philippines(人工智能研究生项目,菲律宾大学)

专题命中 VLM训练与架构 :vision language model(abstract);VLM(abstract);分类 cs.CV

Comments 14 pages, accepted in ICCV 2025 Workshop on RetailVision

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.19480 2025-08-01 cs.CV 70%

GenHancer: Imperfect Generative Models are Secretly Strong Vision-Centric Enhancers

Shijie Ma, Yuying Ge, Teng Wang, Yuxin Guo, Yixiao Ge, Ying Shan

机构 * ARC Lab, Tencent PCG(腾讯PCG ARC实验室) Institute of Automation, CAS(中国科学院自动化研究所)

专题命中 VLM训练与架构 :VLM(abstract);multimodal large language model(abstract);分类 cs.CV

Comments ICCV 2025. Project released at: https://mashijie1028.github.io/GenHancer/

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.22076 2025-07-31 cs.LG 70%

Test-time Prompt Refinement for Text-to-Image Models

Mohammad Abdul Hafeez Khan, Yash Jain, Siddhartha Bhattacharyya, Vibhav Vineet

机构 * Florida Institute of Technology(佛罗里达理工学院) Microsoft Research(微软研究院)

专题命中 VLM训练与架构 :multimodal large language model(abstract);MLLM(abstract);分类 cs.LG

Comments Accepted to ICCV 2025, MARS2 Workshop. Total 14 pages, 12 figures and 3 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.07317 2025-07-29 cs.CV 70%

ADIEE: Automatic Dataset Creation and Scorer for Instruction-Guided Image Editing Evaluation

Sherry X. Chen, Yi Wei, Luowei Zhou, Suren Kumar

机构 * Samsung AI Center(三星AI中心) Mountain View University of California, Santa Barbara(山景城加州大学圣巴巴拉分校)

专题命中 VLM训练与架构 :vision-language model(abstract);LLaVA(abstract);分类 cs.CV

Comments International Conference on Computer Vision (ICCV) 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.08513 2025-07-25 cs.GR cs.CV 70%

Advancing Multimodal LLMs by Large-Scale 3D Visual Instruction Dataset Generation

Liu He, Xiao Zeng, Yizhi Song, Albert Y. C. Chen, Lu Xia, Shashwat Verma, Sankalp Dayal, Min Sun, Cheng-Hao Kuo, Daniel Aliaga

机构 * Purdue University(普渡大学) Amazon(亚马逊)

专题命中 VLM训练与架构 :multimodal large language model(abstract);MLLM(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏