arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视觉大模型 / VLM

视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。

共收录 5048 信号源:cs.CV, cs.AI, cs.LG

1. VLM训练与架构 5048 篇

2504.04405 2025-05-27 cs.IR cs.AI 70%

Universal Item Tokenization for Transferable Generative Recommendation

Bowen Zheng, Hongyu Lu, Yu Chen, Wayne Xin Zhao, Ji-Rong Wen

机构 * Gaoling School of Artificial Intelligence, Renmin University of China(中国人民大学人工智能学院)

专题命中 VLM训练与架构 :multimodal large language model(abstract);MLLM(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.16805 2025-05-23 cs.CV 70%

SOLVE: Synergy of Language-Vision and End-to-End Networks for Autonomous Driving

Xuesong Chen, Linjiang Huang, Tao Ma, Rongyao Fang, Shaoshuai Shi, Hongsheng Li

专题命中 VLM训练与架构 :vision-language model(abstract);VLM(abstract);分类 cs.CV

Comments Accepted by CVPR 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.16279 2025-05-23 cs.MM cs.CV 70%

MM-MovieDubber: Towards Multi-Modal Learning for Multi-Modal Movie Dubbing

Junjie Zheng, Zihao Chen, Chaofan Ding, Yunming Liang, Yihan Fan, Huan Yang, Lei Xie, Xinhan Di

机构 * Giant NetworkChina(巨网中国) The East China University of Science and TechnologyChina(东华大学) Northwestern Polytechnical UniversityChina(西北工业大学)

专题命中 VLM训练与架构 :vision-language model(abstract);VLM(abstract);分类 cs.CV

Comments 5 pages, 4 figures, accepted by Interspeech 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.14682 2025-05-21 cs.CV 70%

UniGen: Enhanced Training & Test-Time Strategies for Unified Multimodal Understanding and Generation

Rui Tian, Mingfei Gao, Mingze Xu, Jiaming Hu, Jiasen Lu, Zuxuan Wu, Yinfei Yang, Afshin Dehghan

机构 * Apple(苹果公司) Fudan University(复旦大学)

专题命中 VLM训练与架构 :multimodal large language model(abstract);MLLM(abstract);分类 cs.CV

Comments Technical report

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.13965 2025-05-21 cs.CL cs.AI 70%

CAFES: A Collaborative Multi-Agent Framework for Multi-Granular Multimodal Essay Scoring

Jiamin Su, Yibo Yan, Zhuoran Gao, Han Zhang, Xiang Liu, Xuming Hu

机构 * The Hong Kong University of Science and Technology (Guangzhou)(香港科学与技术大学(广州)) Beijing Future Brain Education Technology Co., Ltd.(北京未来脑教育科技有限公司)

专题命中 VLM训练与架构 :multimodal large language model(abstract);MLLM(abstract);分类 cs.AI

Comments arXiv admin note: substantial text overlap with arXiv:2502.11916

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.10917 2025-05-20 cs.CV 70%

VISTA: Enhancing Vision-Text Alignment in MLLMs via Cross-Modal Mutual Information Maximization

Mingxiao Li, Na Su, Fang Qu, Zhizhou Zhong, Ziyang Chen, Yuan Li, Zhaopeng Tu, Xiaolong Li

机构 * Tencent(腾讯)

专题命中 VLM训练与架构 :multimodal large language model(abstract);MLLM(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.06840 2025-05-13 cs.CV 70%

Visual Instruction Tuning with Chain of Region-of-Interest

Yixin Chen, Shuai Zhang, Boran Han, Bernie Wang

机构 * Amazon Web Services(亚马逊网络服务)

专题命中 VLM训练与架构 :LLaVA(abstract);multimodal large language model(abstract);分类 cs.CV

Comments N/A

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.05681 2025-05-12 cs.CV 70%

Fine-Tuning Video-Text Contrastive Model for Primate Behavior Retrieval from Unlabeled Raw Videos

Giulio Cesare Mastrocinque Santo, Patrícia Izar, Irene Delval, Victor de Napole Gregolin, Nina S. T. Hirata

机构 * Institute of Mathematics and Statistics, University of São Paulo (IME-USP)(数学统计研究所,圣保罗大学) Department of Experimental Psychology, Institute of Psychology, University of São Paulo (IP-USP)(心理学实验部门,心理学研究所,圣保罗大学) Institute of Biosciences, University of São Paulo (IB-USP)(生物科学研究所,圣保罗大学)

专题命中 VLM训练与架构 :vision-language model(abstract);multimodal large language model(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.04637 2025-05-09 cs.CL cs.AI 70%

Adaptive Token Boundaries: Integrating Human Chunking Mechanisms into Multimodal LLMs

Dongxing Yu

专题命中 VLM训练与架构 :visual question answering(abstract);multimodal large language model(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.02325 2025-05-06 cs.CV 70%

TeDA: Boosting Vision-Lanuage Models for Zero-Shot 3D Object Retrieval via Testing-time Distribution Alignment

Zhichuan Wang, Yang Zhou, Jinhai Xiang, Yulong Wang, Xinwei He

机构 * Huazhong Agricultural University(华中农业大学)

专题命中 VLM训练与架构 :vision-language model(abstract);InternVL(abstract);分类 cs.CV

Comments Accepted by ICMR 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.20520 2025-04-30 cs.RO cs.AI 70%

PRISM: Projection-based Reward Integration for Scene-Aware Real-to-Sim-to-Real Transfer with Few Demonstrations

Haowen Sun, Han Wang, Chengzhong Ma, Shaolong Zhang, Jiawei Ye, Xingyu Chen, Xuguang Lan

机构 * National Key Laboratory of Human-Machine Hybrid Augmented Intelligence(人机混合增强智能国家级实验室) Institute of Artificial Intelligence and Robotics(人工智能与机器人研究院) Xi’an Jiaotong University(西安交通大学)

专题命中 VLM训练与架构 :vision-language model(abstract);VLM(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.18856 2025-04-29 cs.CV 70%

Multi-Resolution Pathology-Language Pre-training Model with Text-Guided Visual Representation

Shahad Albastaki, Anabia Sohail, Iyyakutti Iyappan Ganapathi, Basit Alawode, Asim Khan, Sajid Javed, Naoufel Werghi, Mohammed Bennamoun, Arif Mahmood

机构 * Department of Computer Science(计算机科学系) ARIC Khalifa University of Science and Technology(科技大学) Information Technology University of the Punjab(旁遮普信息科技大学) University of the Western Australia(西澳大学)

专题命中 VLM训练与架构 :vision-language model(abstract);VLM(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.17395 2025-04-25 cs.CV 70%

SDVPT: Semantic-Driven Visual Prompt Tuning for Open-World Object Counting

Yiming Zhao, Guorong Li, Laiyun Qing, Amin Beheshti, Jian Yang, Michael Sheng, Yuankai Qi, Qingming Huang

机构 * UCAS Beijing China(中国科学院大学北京校区) Macquarie University(麦考瑞大学)

专题命中 VLM训练与架构 :vision-language model(abstract);VLM(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.16030 2025-04-23 cs.CV 70%

LiveCC: Learning Video LLM with Streaming Speech Transcription at Scale

Joya Chen, Ziyun Zeng, Yiqi Lin, Wei Li, Zejun Ma, Mike Zheng Shou

机构 * Show Lab, National University of Singapore(新加坡国立大学Show实验室) ByteDance(字节跳动)

专题命中 VLM训练与架构 :vision-language model(abstract);LLaVA(abstract);分类 cs.CV

Comments CVPR 2025. If any references are missing, please contact joyachen@u.nus.edu

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.14117 2025-04-22 cs.CL cs.CV 70%

PEFT A2Z: Parameter-Efficient Fine-Tuning Survey for Large Language and Vision Models

Nusrat Jahan Prottasha, Upama Roy Chowdhury, Shetu Mohanto, Tasfia Nuzhat, Abdullah As Sami, Md Shamol Ali, Md Shohanur Islam Sobuj, Hafijur Raman, Md Kowsher, Ozlem Ozmen Garibay

机构 * University of Central Florida(佛罗里达中央大学) Khulna University of Engineering & Technology(库尔纳工程与技术大学) Delineate Inc.(Delineate公司) Universiti Tenaga Nasional(国家能源大学) University of South Florida(佛罗里达州立大学) Daffodil International University(达夫迪尔国际大学) Anymate Me(Anymate Me公司)

专题命中 VLM训练与架构 :vision language model(abstract);grounding(abstract);分类 cs.CV

Comments PEFT Survey paper

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.12018 2025-04-17 cs.CV 70%

Instruction-augmented Multimodal Alignment for Image-Text and Element Matching

Xinli Yue, JianHui Sun, Junda Lu, Liangchao Yao, Fan Xia, Tianyi Wang, Fengyun Rao, Jing Lyu, Yuetang Deng

专题命中 VLM训练与架构 :visual question answering(abstract);multimodal large language model(abstract);分类 cs.CV

Comments Accepted to CVPR 2025 Workshop

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.11838 2025-04-17 cs.CV 70%

A Visual RAG Pipeline for Few-Shot Fine-Grained Product Classification

Bianca Lamm, Janis Keuper

专题命中 VLM训练与架构 :vision language model(abstract);VLM(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.10462 2025-04-15 cs.CV 70%

The Scalability of Simplicity: Empirical Analysis of Vision-Language Learning with a Single Transformer

Weixian Lei, Jiacong Wang, Haochen Wang, Xiangtai Li, Jun Hao Liew, Jiashi Feng, Zilong Huang

专题命中 VLM训练与架构 :multimodal large language model(abstract);MLLM(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.04332 2025-04-14 cs.CV 70%

Liquid: Language Models are Scalable and Unified Multi-modal Generators

Junfeng Wu, Yi Jiang, Chuofan Ma, Yuliang Liu, Hengshuang Zhao, Zehuan Yuan, Song Bai, Xiang Bai

专题命中 VLM训练与架构 :multimodal large language model(abstract);MLLM(abstract);分类 cs.CV

Comments Technical report. Project page: https://foundationvision.github.io/Liquid/

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.06666 2025-04-10 cs.CV 70%

Patch Matters: Training-free Fine-grained Image Caption Enhancement via Local Perception

Ruotian Peng, Haiying He, Yake Wei, Yandong Wen, Di Hu

专题命中 VLM训练与架构 :LLaVA(abstract);multimodal large language model(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.06481 2025-04-08 cs.CV 70%

NeIn: Telling What You Don't Want

Nhat-Tan Bui, Dinh-Hieu Hoang, Quoc-Huy Trinh, Minh-Triet Tran, Truong Nguyen, Susan Gauch

专题命中 VLM训练与架构 :vision-language model(abstract);LLaVA(abstract);分类 cs.CV

Comments Accepted to CVPR 2025 Workshop SyntaGen. Project page: https://tanbuinhat.github.io/NeIn/

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.17811 2025-04-04 cs.CV 70%

ChatGarment: Garment Estimation, Generation and Editing via Large Language Models

Siyuan Bian, Chenghao Xu, Yuliang Xiu, Artur Grigorev, Zhen Liu, Cewu Lu, Michael J. Black, Yao Feng

专题命中 VLM训练与架构 :vision-language model(abstract);VLM(abstract);分类 cs.CV

Comments CVPR 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.12957 2025-04-04 cs.RO cs.LG 70%

R+X: Retrieval and Execution from Everyday Human Videos

Georgios Papagiannis, Norman Di Palo, Pietro Vitiello, Edward Johns

专题命中 VLM训练与架构 :vision language model(abstract);VLM(abstract);分类 cs.LG

Comments Published at the IEEE International Conference on Robotics and Automation (ICRA) 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.01786 2025-04-03 cs.GR cs.LG 70%

BlenderGym: Benchmarking Foundational Model Systems for Graphics Editing

Yunqi Gu, Ian Huang, Jihyeon Je, Guandao Yang, Leonidas Guibas

专题命中 VLM训练与架构 :vision-language model(abstract);VLM(abstract);分类 cs.LG

Comments CVPR 2025 Accepted

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.23959 2025-04-02 cs.CV 70%

Local Information Matters: Inference Acceleration For Grounded Conversation Generation Models Through Adaptive Local-Aware Token Pruning

Bizhe Bai, Jianjian Cao, Yadan Luo, Tao Chen

专题命中 VLM训练与架构 :LLaVA(abstract);grounding(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.23508 2025-04-01 cs.CV 70%

Re-Aligning Language to Visual Objects with an Agentic Workflow

Yuming Chen, Jiangyan Feng, Haodong Zhang, Lijun Gong, Feng Zhu, Rui Zhao, Qibin Hou, Ming-Ming Cheng, Yibing Song

专题命中 VLM训练与架构 :vision-language model(abstract);VLM(abstract);分类 cs.CV

Comments 33 pages, 20 figures, 17 tables, ICLR 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.16930 2025-03-24 cs.CV 70%

Vision-Language Gradient Descent-driven All-in-One Deep Unfolding Networks

Haijin Zeng, Xiangming Wang, Yongyong Chen, Jingyong Su, Jie Liu

专题命中 VLM训练与架构 :vision-language model(abstract);VLM(abstract);分类 cs.CV

Comments CVPR 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.01509 2025-03-21 cs.CV cs.CL 70%

MIA-Bench: Towards Better Instruction Following Evaluation of Multimodal LLMs

Yusu Qian, Hanrong Ye, Jean-Philippe Fauconnier, Peter Grasch, Yinfei Yang, Zhe Gan

专题命中 VLM训练与架构 :multimodal large language model(abstract);MLLM(abstract);分类 cs.CV

Comments Accepted at ICLR 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.12866 2025-03-18 cs.CV 70%

SCAP: Transductive Test-Time Adaptation via Supportive Clique-based Attribute Prompting

Chenyu Zhang, Kunlun Xu, Zichen Liu, Yuxin Peng, Jiahuan Zhou

专题命中 VLM训练与架构 :vision-language model(abstract);VLM(abstract);分类 cs.CV

Comments Accepted by CVPR 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.12329 2025-03-18 cs.CV cs.CL 70%

CapArena: Benchmarking and Analyzing Detailed Image Captioning in the LLM Era

Kanzhi Cheng, Wenpo Song, Jiaxin Fan, Zheng Ma, Qiushi Sun, Fangzhi Xu, Chenyang Yan, Nuo Chen, Jianbing Zhang, Jiajun Chen

专题命中 VLM训练与架构 :vision-language model(abstract);VLM(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏