arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视觉大模型 / VLM

视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。

共收录 5039 信号源:cs.CV, cs.AI, cs.LG

1. VLM训练与架构 5039 篇

2506.07077 2025-06-10 cs.CR cs.AI 79%

Dual-Priv Pruning : Efficient Differential Private Fine-Tuning in Multimodal Large Language Models

Qianshan Wei, Jiaqi Li, Zihan You, Yi Zhan, Kecen Li, Jialin Wu, Xinfeng Li Hengjun Liu, Yi Yu, Bin Cao, Yiwen Xu, Yang Liu, Guilin Qi

专题命中 VLM训练与架构 :multimodal large language model(title,abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.04964 2025-06-10 cs.CV 79%

CAG-VLM: Fine-Tuning of a Large-Scale Model to Recognize Angiographic Images for Next-Generation Diagnostic Systems

Yuto Nakamura, Satoshi Kodera, Haruki Settai, Hiroki Shinohara, Masatsugu Tamura, Tomohiro Noguchi, Tatsuki Furusawa, Ryo Takizawa, Tempei Kabayama, Norihiko Takeda

机构 * The University of Tokyo(东京大学) The University of Tokyo Hospital(东京大学医院)

专题命中 VLM训练与架构 :VLM(title,abstract);分类 cs.CV

Comments The 4th Workshop on Computer Vision in the Wild

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.15334 2025-06-09 cs.CV 79%

Modality-Fair Preference Optimization for Trustworthy MLLM Alignment

Songtao Jiang, Yan Zhang, Ruizhe Chen, Tianxiang Hu, Yeying Jin, Qinglin He, Yang Feng, Jian Wu, Zuozhu Liu

机构 * Zhejiang University(浙江大学) ByteDance(字节跳动) National University of Singapore(新加坡国立大学) Angelalign Inc., China(中国Angelalign公司)

专题命中 VLM训练与架构 :MLLM(title);multimodal large language model(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.04606 2025-06-06 cs.CV 79%

SmartAvatar: Text- and Image-Guided Human Avatar Generation with VLM AI Agents

Alexander Huang-Menders, Xinhang Liu, Andy Xu, Yuyao Zhang, Chi-Keung Tang, Yu-Wing Tai

机构 * The Hong Kong University of Science and Technology(香港科技大学) Dartmouth College(达特茅斯学院)

专题命中 VLM训练与架构 :VLM(title);vision-language model(abstract);分类 cs.CV

Comments 16 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.18053 2025-06-06 cs.CL cs.CV 79%

DREAM: Disentangling Risks to Enhance Safety Alignment in Multimodal Large Language Models

Jianyu Liu, Hangyu Guo, Ranjie Duan, Xingyuan Bu, Yancheng He, Shilong Li, Hui Huang, Jiaheng Liu, Yucheng Wang, Chenchen Jing, Xingwei Qu, Xiao Zhang, Yingshui Tan, Yanan Wu, Jihao Gu, Yangguang Li, Jianke Zhu

机构 * Alibaba Group(阿里巴巴集团) Zhejiang University(浙江大学) M-A-P The Chinese University of Hong Kong(香港中文大学)

专题命中 VLM训练与架构 :multimodal large language model(title,abstract);分类 cs.CV

Comments [NAACL 2025] The first four authors contribute equally, 23 pages, repo at https://github.com/Kizna1ver/DREAM

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.02555 2025-06-04 cs.CV 79%

SurgVLM: A Large Vision-Language Model and Systematic Evaluation Benchmark for Surgical Intelligence

Zhitao Zeng, Zhu Zhuo, Xiaojun Jia, Erli Zhang, Junde Wu, Jiaan Zhang, Yuxuan Wang, Chang Han Low, Jian Jiang, Zilong Zheng, Xiaochun Cao, Yutong Ban, Qi Dou, Yang Liu, Yueming Jin

机构 * National University of Singapore(新加坡国立大学) Nanyang Technological University(南洋理工大学) University of Oxford(牛津大学) State Key Laboratory of General Artificial Intelligence, BIGAI(通用人工智能国家重点实验室,BIGAI) Shanghai Jiao Tong University(上海交通大学) Sun Yat-sen University(中山大学) The Chinese University of Hong Kong(香港中文大学)

专题命中 VLM训练与架构 :vision-language model(title,abstract);分类 cs.CV

Comments 29 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.01724 2025-06-03 cs.CV 79%

Active Learning via Vision-Language Model Adaptation with Open Data

Tong Wang, Jiaqi Wang, Shu Kong

机构 * University of Macau(澳门大学) Shanghai AI Lab(上海人工智能实验室) Institute of Collaborative Innovation project webpage(协同创新项目研究所)

专题命中 VLM训练与架构 :vision-language model(title);VLM(abstract);分类 cs.CV

Comments Here is the project webpage: https://leowangtong.github.io/ALOR/

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.15678 2025-06-02 cs.LG 79%

Testing the Limits of Fine-Tuning for Improving Visual Cognition in Vision Language Models

Luca M. Schulze Buschoff, Konstantinos Voudouris, Elif Akata, Matthias Bethge, Joshua B. Tenenbaum, Eric Schulz

专题命中 VLM训练与架构 :vision language model(title,abstract);分类 cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.23358 2025-05-30 cs.CV 79%

Beam-Guided Knowledge Replay for Knowledge-Rich Image Captioning using Vision-Language Model

Reem AlJunaid, Muzammil Behzad

机构 * KFUPM(科威特理工学院)

专题命中 VLM训练与架构 :vision-language model(title,abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.11501 2025-05-30 cs.CL cs.CV 79%

Token Pruning in Multimodal Large Language Models: Are We Solving the Right Problem?

Zichen Wen, Yifeng Gao, Weijia Li, Conghui He, Linfeng Zhang

机构 * Shanghai Jiao Tong University(上海交通大学) EPIC Lab, SJTU(EPIC实验室,SJTu) Shanghai AI Laboratory(上海人工智能实验室) Sun Yat-sen University(中山大学)

专题命中 VLM训练与架构 :multimodal large language model(title,abstract);分类 cs.CV

Comments ACL 2025 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.19373 2025-05-27 cs.CV 79%

DiSa: Directional Saliency-Aware Prompt Learning for Generalizable Vision-Language Models

Niloufar Alipour Talemi, Hossein Kashiani, Hossein R. Nowdeh, Fatemeh Afghah

机构 * Clemson University(克莱姆森大学)

专题命中 VLM训练与架构 :vision-language model(title,abstract);分类 cs.CV

Comments Accepted at the 31st ACM SIGKDD Conference on Knowledge Discovery and Data Mining (KDD 2025)

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.18503 2025-05-27 cs.CV 79%

Focus on What Matters: Enhancing Medical Vision-Language Models with Automatic Attention Alignment Tuning

Aofei Chang, Le Huang, Alex James Boyd, Parminder Bhatia, Taha Kass-Hout, Cao Xiao, Fenglong Ma

专题命中 VLM训练与架构 :vision-language model(title,abstract);分类 cs.CV

Comments Accepted to ACL2025 (main)

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.10174 2025-05-27 cs.CV 79%

LLaVA-ReID: Selective Multi-image Questioner for Interactive Person Re-Identification

Yiding Lu, Mouxing Yang, Dezhong Peng, Peng Hu, Yijie Lin, Xi Peng

专题命中 VLM训练与架构 :LLaVA(title,abstract);分类 cs.CV

Comments Accepted by ICML 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.17835 2025-05-26 cs.CV 79%

VLM Models and Automated Grading of Atopic Dermatitis

Marc Lalonde, Hamed Ghodrati

专题命中 VLM训练与架构 :VLM(title);vision-language model(abstract);分类 cs.CV

Comments 10 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.16916 2025-05-23 cs.CR cs.CV 79%

Backdoor Cleaning without External Guidance in MLLM Fine-tuning

Xuankun Rong, Wenke Huang, Jian Liang, Jinhe Bi, Xun Xiao, Yiming Li, Bo Du, Mang Ye

专题命中 VLM训练与架构 :MLLM(title);multimodal large language model(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.14391 2025-05-23 cs.CV 79%

How Well Can General Vision-Language Models Learn Medicine By Watching Public Educational Videos?

Rahul Thapa, Andrew Li, Qingyang Wu, Bryan He, Yuki Sahashi, Christina Binder, Angela Zhang, Ben Athiwaratkun, Shuaiwen Leon Song, David Ouyang, James Zou

机构 * Stanford University(斯坦福大学) Together AI University of California, Berkeley(加州大学伯克利分校) Cedars-Sinai Medical Center(西德斯-西奈医学中心) University of California, San Francisco(加州大学旧金山分校)

专题命中 VLM训练与架构 :vision-language model(title,abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.03450 2025-05-23 cs.LG 79%

MLLM as Retriever: Interactively Learning Multimodal Retrieval for Embodied Agents

Junpeng Yue, Xinrun Xu, Börje F. Karlsson, Zongqing Lu

机构 * School of Computer Science, Peking University(北京大学计算机科学学院) Institute of Software, Chinese Academy of Sciences(中国科学院软件研究所) Beijing Academy of Artificial Intelligence(北京人工智能研究院)

专题命中 VLM训练与架构 :MLLM(title,abstract);分类 cs.LG

Comments ICLR 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.07267 2025-05-22 cs.CV 79%

MiniDrive: More Efficient Vision-Language Models with Multi-Level 2D Features as Text Tokens for Autonomous Driving

Enming Zhang, Xingyuan Dai, Min Huang, Yisheng Lv, Qinghai Miao

机构 * School of Artificial Intelligence, University of Chinese Academy of Sciences(中国科学院大学人工智能学院) State Key Laboratory of Multimodal Artificial Intelligence Systems, Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所)

专题命中 VLM训练与架构 :vision-language model(title,abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.13746 2025-05-21 cs.CV eess.IV 79%

ReSW-VL: Representation Learning for Surgical Workflow Analysis Using Vision-Language Model

Satoshi Kondo

机构 * Muroran Institute of Technology(茂兰技术学院)

专题命中 VLM训练与架构 :vision-language model(title,abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.13233 2025-05-20 cs.CV 79%

From Local Details to Global Context: Advancing Vision-Language Models with Attention-Based Selection

Lincan Cai, Jingxuan Kang, Shuang Li, Wenxuan Ma, Binhui Xie, Zhida Qin, Jian Liang

专题命中 VLM训练与架构 :vision-language model(title,abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.12912 2025-05-20 cs.CV 79%

Uniformity First: Uniformity-aware Test-time Adaptation of Vision-language Models against Image Corruption

Kazuki Adachi, Shin'ya Yamaguchi, Tomoki Hamagami

机构 * NTT, Inc.(NTT公司) Kyoto University(京都大学) Yokohama National University(横滨国立大学)

专题命中 VLM训练与架构 :vision-language model(title,abstract);分类 cs.CV

Comments Code is available at https://github.com/kzkadc/uninfo

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.12605 2025-05-20 cs.CV 79%

Temporal-Oriented Recipe for Transferring Large Vision-Language Model to Video Understanding

Thong Nguyen, Zhiyuan Hu, Xu Lin, Cong-Duy Nguyen, See-Kiong Ng, Luu Anh Tuan

机构 * National University of Singapore(新加坡国立大学) Nanyang Technological University(南洋理工大学)

专题命中 VLM训练与架构 :vision-language model(title,abstract);分类 cs.CV

Comments In Progress

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.12253 2025-05-20 cs.CV 79%

LLaVA-4D: Embedding SpatioTemporal Prompt into LMMs for 4D Scene Understanding

Hanyu Zhou, Gim Hee Lee

机构 * School of Computing, National University of Singapore(计算学院,新加坡国立大学)

专题命中 VLM训练与架构 :LLaVA(title,abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.04729 2025-05-19 cs.CV 79%

Espresso: High Compression For Rich Extraction From Videos for Your Vision-Language Model

Keunwoo Peter Yu, Achal Dave, Rares Ambrus, Jean Mercat

专题命中 VLM训练与架构 :vision-language model(title,abstract);分类 cs.CV

Comments 16 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.09336 2025-05-15 cs.CV 79%

Unsupervised Multiview Contrastive Language-Image Joint Learning with Pseudo-Labeled Prompts Via Vision-Language Model for 3D/4D Facial Expression Recognition

Muzammil Behzad

专题命中 VLM训练与架构 :vision-language model(title,abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.06356 2025-05-13 cs.CV 79%

Understanding and Mitigating Toxicity in Image-Text Pretraining Datasets: A Case Study on LLaVA

Karthik Reddy Kanjula, Surya Guthikonda, Nahid Alam, Shayekh Bin Islam

机构 * Cohere for AI Community(Cohere for AI社区) Cisco Meraki Indiana University Bloomington(印第安纳大学布卢明顿分校) Bangladesh University of Engineering and Technology(孟加拉工程与技术大学)

专题命中 VLM训练与架构 :LLaVA(title,abstract);分类 cs.CV

Comments Accepted at ReGenAI CVPR2025 Workshop as Oral

详情

展开后加载摘要…

URL PDF HTML 收藏
2306.07971 2025-05-08 cs.CV 79%

XrayGPT: Chest Radiographs Summarization using Medical Vision-Language Models

Omkar Thawakar, Abdelrahman Shaker, Sahal Shaji Mullappilly, Hisham Cholakkal, Rao Muhammad Anwer, Salman Khan, Jorma Laaksonen, Fahad Shahbaz Khan

机构 * Mohamed bin Zayed University of AI(穆罕默德·本·扎耶德人工智能大学) Aalto University(艾尔沃斯大学)

专题命中 VLM训练与架构 :vision-language model(title,abstract);分类 cs.CV

Comments Accepted at ACL 2024-BIONLP Workshop. Code: https://github.com/mbzuai-oryx/XrayGPT

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.01790 2025-05-06 cs.CV cs.CL cs.MM 79%

Enhancing the Learning Experience: Using Vision-Language Models to Generate Questions for Educational Videos

Markos Stamatakis, Joshua Berger, Christian Wartena, Ralph Ewerth, Anett Hoppe

机构 * TIB – Leibniz Information Centre for Science and Technology(蒂宾根-莱比锡信息科学与技术研究中心) Hochschule Hannover – Data(汉诺威高等学院-数据) H Institute for Applied Data Science(汉诺威应用数据科学研究所) L3S Research Center – Leibniz University Hannover(L3S研究中心-汉诺威莱比锡大学)

专题命中 VLM训练与架构 :vision-language model(title,abstract);分类 cs.CV

Comments 12 pages (excluding references), 8 tables, 1 equation

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.01163 2025-04-25 cs.CV 79%

3D-LLaVA: Towards Generalist 3D LMMs with Omni Superpoint Transformer

Jiajun Deng, Tianyu He, Li Jiang, Tianyu Wang, Feras Dayoub, Ian Reid

机构 * Australian Institute for Machine Learning, The University of Adelaide(澳大利亚机器学习研究所,阿德莱德大学) Microsoft Research(微软研究院) The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳)) Mohamed bin Zayed University of AI(穆罕默德·本·扎耶德人工智能大学)

专题命中 VLM训练与架构 :LLaVA(title,abstract);分类 cs.CV

Comments Accepted by CVPR 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.09317 2025-04-22 eess.IV cs.CV 79%

Enhancing Diagnostic Accuracy in Rare and Common Fundus Diseases with a Knowledge-Rich Vision-Language Model

Meng Wang, Tian Lin, Aidi Lin, Kai Yu, Yuanyuan Peng, Lianyu Wang, Cheng Chen, Ke Zou, Huiyu Liang, Man Chen, Xue Yao, Meiqin Zhang, Binwei Huang, Chaoxin Zheng, Peixin Zhang, Wei Chen, Yilong Luo, Yifan Chen, Honghe Xia, Tingkun Shi, Qi Zhang, Jinming Guo, Xiaolin Chen, Jingcheng Wang, Yih Chung Tham, Dianbo Liu, Wendy Wong, Sahil Thakur, Beau Fenner, Danqi Fang, Siying Liu, Qingyun Liu, Yuqiang Huang, Hongqiang Zeng, Yanda Meng, Yukun Zhou, Zehua Jiang, Minghui Qiu, Changqing Zhang, Xinjian Chen, Sophia Y. Wang, Cecilia S. Lee, Lucia Sobrin, Carol Y Cheung, Chi Pui Pang, Pearse A. Keane, Ching-Yu Cheng, Haoyu Chen, Huazhu Fu

机构 * Centre for Innovation & Precision Eye Health(创新与精准眼科健康中心) Yong Loo Lin School of Medicine(尤洛林医学院) National University of Singapore(新加坡国立大学) Department of Ophthalmology(眼科部门) Joint Shantou International Eye Center(汕尾国际眼科中心) Shantou University(汕尾大学) Chinese University of Hong Kong(香港中文大学) Department of Radiology(放射科部门) University of Pennsylvania(宾夕法尼亚大学) School of Biomedical Engineering(生物医学工程学院) College of Computer Science and Technology(计算机科学与技术学院) Center of Advanced Medical Computing and Analysis(先进医学计算与分析中心) National Key Laboratory of Fundamental Science on Synthetic Vision and the College of Computer Science(合成视觉基础科学国家实验室和计算机科学学院) Big Vision Medical Technology Ltd.(大视觉医疗科技有限公司) Singapore Eye Research Institute(新加坡眼科研究院) Singapore National Eye Centre(新加坡国家眼科中心) Ophthalmology & Visual Sciences Academic Clinical Program (EYE ACP)(眼科与视觉科学学术临床计划) The Chinese University of Hong Kong(香港中文大学) Shenzhen Longgang E.N.T Hospital(深圳龙岗耳鼻喉医院) Dongguan Songshan Lake Central Hospital(东莞松山湖中心医院) Department of Computer Science(计算机科学部门) University of Exeter(埃克塞特大学)

专题命中 VLM训练与架构 :vision-language model(title,abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏