arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

视觉大模型 / VLM

视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。

共收录 5058 信号源:cs.CV, cs.AI, cs.LG

1. VLM训练与架构 5058 篇

2504.04158 2025-04-08 cs.CV 57%

JarvisIR: Elevating Autonomous Driving Perception with Intelligent Image Restoration

Yunlong Lin, Zixu Lin, Haoyu Chen, Panwang Pan, Chenxin Li, Sixiang Chen, Yeying Jin, Wenbo Li, Xinghao Ding

专题命中 VLM训练与架构 :VLM(abstract);分类 cs.CV

Comments 25 pages, 15 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.04024 2025-04-08 cs.CV 57%

Window Token Concatenation for Efficient Visual Large Language Models

Yifan Li, Wentao Bao, Botao Ye, Zhen Tan, Tianlong Chen, Huan Liu, Yu Kong

专题命中 VLM训练与架构 :LLaVA(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.20880 2025-04-07 cs.CV q-bio.CB q-bio.QM q-bio.TO 57%

BioX-CPath: Biologically-driven Explainable Diagnostics for Multistain IHC Computational Pathology

Amaya Gallagher-Syed, Henry Senior, Omnia Alwazzan, Elena Pontarini, Michele Bombardieri, Costantino Pitzalis, Myles J. Lewis, Michael R. Barnes, Luca Rossi, Gregory Slabaugh

专题命中 VLM训练与架构 :grounding(abstract);分类 cs.CV

Comments Accepted for publication at CVPR 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.01666 2025-04-03 cs.CV 57%

CLIP-SLA: Parameter-Efficient CLIP Adaptation for Continuous Sign Language Recognition

Sarah Alyami, Hamzah Luqman

专题命中 VLM训练与架构 :vision-language model(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.10462 2025-04-03 cs.CV 57%

CoMM: A Coherent Interleaved Image-Text Dataset for Multimodal Understanding and Generation

Wei Chen, Lin Li, Yongqi Yang, Bin Wen, Fan Yang, Tingting Gao, Yu Wu, Long Chen

专题命中 VLM训练与架构 :multimodal large language model(abstract);分类 cs.CV

Comments 22 pages, Accepted by CVPR 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2403.08002 2025-04-03 cs.CL cs.CV 57%

Towards a clinically accessible radiology foundation model: open-access and lightweight, with automated evaluation

Juan Manuel Zambrano Chaves, Shih-Cheng Huang, Yanbo Xu, Hanwen Xu, Naoto Usuyama, Sheng Zhang, Fei Wang, Yujia Xie, Mahmoud Khademi, Ziyi Yang, Hany Awadalla, Julia Gong, Houdong Hu, Jianwei Yang, Chunyuan Li, Jianfeng Gao, Yu Gu, Cliff Wong, Mu Wei, Tristan Naumann, Muhao Chen, Matthew P. Lungren, Akshay Chaudhari, Serena Yeung-Levy, Curtis P. Langlotz, Sheng Wang, Hoifung Poon

专题命中 VLM训练与架构 :LLaVA(abstract);分类 cs.CV

Journal ref Nature Communications volume 16, Article number: 3108 (2025)

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.06809 2025-04-02 cs.CV 57%

DetailCLIP: Detail-Oriented CLIP for Fine-Grained Tasks

Amin Karimi Monsefi, Kishore Prakash Sailaja, Ali Alilooee, Ser-Nam Lim, Rajiv Ramnath

专题命中 VLM训练与架构 :vision-language model(abstract);分类 cs.CV

Comments Accepted in SSI-FM Workshop of ICLR 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2403.17238 2025-04-02 cs.RO cs.LG 57%

Temporal and Semantic Evaluation Metrics for Foundation Models in Post-Hoc Analysis of Robotic Sub-tasks

Jonathan Salfity, Selma Wanna, Minkyu Choi, Mitch Pryor

专题命中 VLM训练与架构 :vision language model(abstract);分类 cs.LG

Comments 8 pages, 3 figures. IROS 2024 Submission

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.01167 2025-04-01 cs.CV 57%

Enhancing Vision-Language Compositional Understanding with Multimodal Synthetic Data

Haoxin Li, Boyang Li

专题命中 VLM训练与架构 :vision-language model(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.02729 2025-04-01 cs.CV 57%

Can language-guided unsupervised adaptation improve medical image classification using unpaired images and texts?

Umaima Rahman, Raza Imam, Mohammad Yaqub, Boulbaba Ben Amor, Dwarikanath Mahapatra

专题命中 VLM训练与架构 :vision-language model(abstract);分类 cs.CV

Comments Conference paper at International Symposium on Biomedical Imaging (ISBI) 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.10034 2025-03-31 cs.CV 57%

TULIP: Token-length Upgraded CLIP

Ivona Najdenkoska, Mohammad Mahdi Derakhshani, Yuki M. Asano, Nanne van Noord, Marcel Worring, Cees G. M. Snoek

专题命中 VLM训练与架构 :vision-language model(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.18609 2025-03-28 cs.CV 57%

Video-Panda: Parameter-efficient Alignment for Encoder-free Video-Language Models

Jinhui Yi, Syed Talal Wasim, Yanan Luo, Muzammal Naseer, Juergen Gall

专题命中 VLM训练与架构 :LLaVA(abstract);分类 cs.CV

Comments CVPR 2025 camera-ready version

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.21069 2025-03-28 cs.CV 57%

Efficient Multi-Instance Generation with Janus-Pro-Dirven Prompt Parsing

Fan Qi, Yu Duan, Changsheng Xu

专题命中 VLM训练与架构 :grounding(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.18407 2025-03-26 cs.CV 57%

VTD-CLIP: Video-to-Text Discretization via Prompting CLIP

Wencheng Zhu, Yuexin Wang, Hongxuan Li, Pengfei Zhu, Qinghua Hu

专题命中 VLM训练与架构 :vision-language model(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.17782 2025-03-26 cs.CV 57%

GOAL: Global-local Object Alignment Learning

Hyungyu Choi, Young Kyun Jang, Chanho Eom

专题命中 VLM训练与架构 :vision-language model(abstract);分类 cs.CV

Comments 16 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.18320 2025-03-25 cs.AI cs.CL 57%

Bridging Writing Manner Gap in Visual Instruction Tuning by Creating LLM-aligned Instructions

Dong Jing, Nanyi Fei, Zhiwu Lu

专题命中 VLM训练与架构 :LLaVA(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.15406 2025-03-25 cs.CV 57%

Visual Persona: Foundation Model for Full-Body Human Customization

Jisu Nam, Soowon Son, Zhan Xu, Jing Shi, Difan Liu, Feng Liu, Aashish Misraa, Seungryong Kim, Yang Zhou

专题命中 VLM训练与架构 :vision-language model(abstract);分类 cs.CV

Comments CVPR 2025, Project page is available at https://cvlab-kaist.github.io/Visual-Persona

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.14504 2025-03-25 cs.CV 57%

Aligning Multimodal LLM with Human Preference: A Survey

Tao Yu, Yi-Fan Zhang, Chaoyou Fu, Junkang Wu, Jinda Lu, Kun Wang, Xingyu Lu, Yunhang Shen, Guibin Zhang, Dingjie Song, Yibo Yan, Tianlong Xu, Qingsong Wen, Zhang Zhang, Yan Huang, Liang Wang, Tieniu Tan

专题命中 VLM训练与架构 :multimodal large language model(abstract);分类 cs.CV

Comments Project page: https://github.com/BradyFU/Awesome-Multimodal-Large-Language-Models/tree/Alignment

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.08326 2025-03-25 cs.CV 57%

Omni-RGPT: Unifying Image and Video Region-level Understanding via Token Marks

Miran Heo, Min-Hung Chen, De-An Huang, Sifei Liu, Subhashree Radhakrishnan, Seon Joo Kim, Yu-Chiang Frank Wang, Ryo Hachiuma

专题命中 VLM训练与架构 :multimodal large language model(abstract);分类 cs.CV

Comments CVPR 2025, Project page: https://miranheo.github.io/omni-rgpt/

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.19425 2025-03-25 cs.CV 57%

Harnessing Frozen Unimodal Encoders for Flexible Multimodal Alignment

Mayug Maniparambil, Raiymbek Akshulakov, Yasser Abdelaziz Dahou Djilali, Sanath Narayan, Ankit Singh, Noel E. O'Connor

专题命中 VLM训练与架构 :vision-language model(abstract);分类 cs.CV

Comments Accepted CVPR 2025; First two authors contributed equally;

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.17044 2025-03-24 cs.CV 57%

ExCap3D: Expressive 3D Scene Understanding via Object Captioning with Varying Detail

Chandan Yeshwanth, David Rozenberszki, Angela Dai

专题命中 VLM训练与架构 :VLM(abstract);分类 cs.CV

Comments Project page: https://cy94.github.io/excap3d/, Video: https://www.youtube.com/watch?v=SQRV1l_0oY0

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.16660 2025-03-24 cs.CV 57%

When Less is Enough: Adaptive Token Reduction for Efficient Image Representation

Eduard Allakhverdov, Elizaveta Goncharova, Andrey Kuznetsov

专题命中 VLM训练与架构 :LLaVA(abstract);分类 cs.CV

Comments 10 pages, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.06553 2025-03-24 cs.CV 57%

VASparse: Towards Efficient Visual Hallucination Mitigation via Visual-Aware Token Sparsification

Xianwei Zhuang, Zhihong Zhu, Yuxin Xie, Liming Liang, Yuexian Zou

专题命中 VLM训练与架构 :vision-language model(abstract);分类 cs.CV

Comments Accepted by CVPR 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.13717 2025-03-24 cs.CL cs.CV 57%

Towards Automatic Evaluation for Image Transcreation

Simran Khanuja, Vivek Iyer, Claire He, Graham Neubig

专题命中 VLM训练与架构 :VLM(abstract);分类 cs.CV

Comments To be presented at NAACL 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.12785 2025-03-24 cs.CV 57%

Activating Distributed Visual Region within LLMs for Efficient and Effective Vision-Language Training and Inference

Siyuan Wang, Dianyi Wang, Chengxing Zhou, Zejun Li, Zhihao Fan, Xuanjing Huang, Zhongyu Wei

专题命中 VLM训练与架构 :vision-language model(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2401.00254 2025-03-24 cs.CV 57%

Morphing Tokens Draw Strong Masked Image Models

Taekyung Kim, Byeongho Heo, Dongyoon Han

专题命中 VLM训练与架构 :vision-language model(abstract);分类 cs.CV

Comments 24 pages, 16 tables, 8 figures. To be presented at ICLR'25

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.15940 2025-03-21 cs.CV 57%

UniCrossAdapter: Multimodal Adaptation of CLIP for Radiology Report Generation

Yaxiong Chen, Chuang Du, Chunlei Li, Jingliang Hu, Yilei Shi, Shengwu Xiong, Xiao Xiang Zhu, Lichao Mou

专题命中 VLM训练与架构 :vision-language model(abstract);分类 cs.CV

Comments MICCAI 2024 Workshop

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.18042 2025-03-21 cs.CV cs.CL 57%

EMOVA: Empowering Language Models to See, Hear and Speak with Vivid Emotions

Kai Chen, Yunhao Gou, Runhui Huang, Zhili Liu, Daxin Tan, Jing Xu, Chunwei Wang, Yi Zhu, Yihan Zeng, Kuo Yang, Dingdong Wang, Kun Xiang, Haoyuan Li, Haoli Bai, Jianhua Han, Xiaohui Li, Weike Jin, Nian Xie, Yu Zhang, James T. Kwok, Hengshuang Zhao, Xiaodan Liang, Dit-Yan Yeung, Xiao Chen, Zhenguo Li, Wei Zhang, Qun Liu, Jun Yao, Lanqing Hong, Lu Hou, Hang Xu

专题命中 VLM训练与架构 :vision-language model(abstract);分类 cs.CV

Comments Accepted by CVPR 2025. Project Page: https://emova-ollm.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.15633 2025-03-21 cs.CV 57%

Vision-Speech Models: Teaching Speech Models to Converse about Images

Amélie Royer, Moritz Böhle, Gabriel de Marmiesse, Laurent Mazaré, Neil Zeghidour, Alexandre Défossez, Patrick Pérez

专题命中 VLM训练与架构 :vision-language model(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.11223 2025-03-19 cs.CV 57%

Efficient Transfer Learning for Video-language Foundation Models

Haoxing Chen, Zizheng Huang, Yan Hong, Yanshuo Wang, Zhongcai Lyu, Zhuoer Xu, Jun Lan, Zhangxuan Gu

专题命中 VLM训练与架构 :vision-language model(abstract);分类 cs.CV

Comments Accepted by CVPR 2025

详情

展开后加载摘要…

URL PDF HTML 收藏