arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视觉大模型 / VLM

视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。

共收录 5009 信号源:cs.CV, cs.AI, cs.LG

1. VLM训练与架构 5009 篇

2510.22702 2025-10-28 cs.AI cs.CV cs.ET eess.IV 84%

Atlas Urban Index: A VLM-Based Approach for Spatially and Temporally Calibrated Urban Development Monitoring

Mithul Chander, Sai Pragnya Ranga, Prathamesh Mayekar

机构 * Propheus

专题命中 VLM训练与架构 :VLM(title,abstract);vision-language model(abstract);分类 cs.CV、cs.AI

Comments An abridged version of this paper will be presented at and appear in the Proceedings of ACM IKDD CODS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.22571 2025-10-28 cs.CV cs.AI cs.MM 84%

STATUS Bench: A Rigorous Benchmark for Evaluating Object State Understanding in Vision-Language Models

Mahiro Ukai, Shuhei Kurita, Nakamasa Inoue

机构 * Institute of Science Tokyo(东京科学研究所) National Institute of Informatics(日本信息处理学会)

专题命中 VLM训练与架构 :vision-language model(title,abstract);VLM(abstract);分类 cs.CV、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.21740 2025-10-28 cs.CV cs.AI cs.CL 84%

Diagnosing Bottlenecks in Data Visualization Understanding by Vision-Language Models

Alexa R. Tartaglini, Satchel Grant, Daniel Wurgaft, Christopher Potts, Judith E. Fan

机构 * Department of Computer Science(计算机科学系) Department of Psychology(心理学系) Department of Linguistics(语言学系) Stanford University(斯坦福大学)

专题命中 VLM训练与架构 :vision-language model(title,abstract);VLM(abstract);分类 cs.CV、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.20990 2025-10-27 cs.LG cs.CL cs.CV 84%

SharpZO: Hybrid Sharpness-Aware Vision Language Model Prompt Tuning via Forward-Only Passes

Yifan Yang, Zhen Zhang, Rupak Vignesh Swaminathan, Jing Liu, Nathan Susanj, Zheng Zhang

专题命中 VLM训练与架构 :vision language model(title,abstract);VLM(abstract);分类 cs.CV、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.13359 2025-10-16 cs.IR cs.CV cs.LG 84%

Improving Visual Recommendation on E-commerce Platforms Using Vision-Language Models

Yuki Yada, Sho Akiyama, Ryo Watanabe, Yuta Ueno, Yusuke Shido, Andre Rusli

机构 * Mercari, Inc.(Mercari公司)

专题命中 VLM训练与架构 :vision-language model(title,abstract);VLM(abstract);分类 cs.CV、cs.LG

Comments Accepted to ACM RecSys 2025 (Spotlight)

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.10487 2025-10-14 cs.CV cs.AI 84%

Towards Self-Refinement of Vision-Language Models with Triangular Consistency

Yunlong Deng, Guangyi Chen, Tianpei Gu, Lingjing Kong, Yan Li, Zeyu Tang, Kun Zhang

机构 * Mohamed bin Zayed University of Artificial Intelligence(穆罕默德·本·扎耶德人工智能大学) ByteDance US(字节跳动美国公司) Carnegie Mellon University(卡内基梅隆大学)

专题命中 VLM训练与架构 :vision-language model(title,abstract);LLaVA(abstract);分类 cs.CV、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.08470 2025-10-10 cs.AI cs.CL cs.LG 84%

Looking to Learn: Token-wise Dynamic Gating for Low-Resource Vision-Language Modelling

Bianca-Mihaela Ganescu, Suchir Salhan, Andrew Caines, Paula Buttery

机构 * ALTA Institute(ALTA研究院) Department of Computer Science & Technology, University of Cambridge(计算机科学与技术系,剑桥大学)

专题命中 VLM训练与架构 :vision-language model(title,abstract);grounding(abstract);分类 cs.AI、cs.LG

Comments Accepted to the EMNLP 2025 BabyLM Workshop

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.08132 2025-10-10 cs.LG cs.AI 84%

Approximate Domain Unlearning for Vision-Language Models

Kodai Kawamura, Yuta Goto, Rintaro Yanagi, Hirokatsu Kataoka, Go Irie

机构 * Tokyo University of Science(东京科学大学) National University of Singapore(新加坡国立大学) National Institute of Advanced Industrial Science and Technology (AIST)(国家先进工业科学与技术研究院) University of Oxford(牛津大学)

专题命中 VLM训练与架构 :vision-language model(title,abstract);VLM(abstract);分类 cs.AI、cs.LG

Comments NeurIPS 2025 (Spotlight)

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.02922 2025-10-06 cs.CV cs.AI 84%

Multimodal Carotid Risk Stratification with Large Vision-Language Models: Benchmarking, Fine-Tuning, and Clinical Insights

Daphne Tsolissou, Theofanis Ganitidis, Konstantinos Mitsis, Stergios CHristodoulidis, Maria Vakalopoulou, Konstantina Nikita

机构 * National Technical University of Athens(希腊国家技术大学) CentraleSupélec, Université Paris-Saclay(巴黎-萨克雷大学中央理工学院)

专题命中 VLM训练与架构 :vision-language model(title,abstract);LLaVA(abstract);分类 cs.CV、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.02803 2025-10-06 cs.RO cs.AI cs.CV 84%

Work Zones challenge VLM Trajectory Planning: Toward Mitigation and Robust Autonomous Driving

Yifan Liao, Zhen Sun, Xiaoyun Qiu, Zixiao Zhao, Wenbing Tang, Xinlei He, Xinhu Zheng, Tianwei Zhang, Xinyi Huang, Xingshuo Han

机构 * Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) Nanjing University of Aeronautics and Astronautics(南京航空航天大学) Northwest A&F University(西北农林科技大学) Nanyang Technological University(南洋理工大学) Jinan University(济南大学)

专题命中 VLM训练与架构 :VLM(title,abstract);visual language model(abstract);分类 cs.CV、cs.AI

Comments 13 pages,5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.01454 2025-10-03 cs.CV cs.LG 84%

Data Selection for Fine-tuning Vision Language Models via Cross Modal Alignment Trajectories

Nilay Naharas, Dang Nguyen, Nesihan Bulut, Mohammadhossein Bateni, Vahab Mirrokni, Baharan Mirzasoleiman

机构 * Department of Computer Science, University of California Los Angeles(加州大学洛杉矶分校计算机科学系) Google Research(谷歌研究)

专题命中 VLM训练与架构 :vision language model(title);vision-language model(abstract);LLaVA(abstract);分类 cs.CV、cs.LG

Comments 30 pages, 10 figures, 5 tables, link: https://bigml-cs-ucla.github.io/XMAS-project-page/

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.21358 2025-09-29 cs.CV cs.AI 84%

MDF-MLLM: Deep Fusion Through Cross-Modal Feature Alignment for Contextually Aware Fundoscopic Image Classification

Jason Jordan, Mohammadreza Akbari Lor, Peter Koulen, Mei-Ling Shyu, Shu-Ching Chen

专题命中 VLM训练与架构 :MLLM(title,abstract);multimodal large language model(abstract);分类 cs.CV、cs.AI

Comments Word count: 5157, Table count: 2, Figure count: 5

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.13146 2025-09-23 cs.CV cs.LG 84%

Re-Align: Aligning Vision Language Models via Retrieval-Augmented Direct Preference Optimization

Shuo Xing, Peiran Li, Yuping Wang, Ruizheng Bai, Yueqi Wang, Chan-Wei Hu, Chengxuan Qian, Huaxiu Yao, Zhengzhong Tu

机构 * Texas A&M University(德克萨斯大学) University of Michigan(密歇根大学) UIUC(伊利诺伊大学香槟分校) UNC Chapel Hill(北卡罗来纳大学教堂山分校)

专题命中 VLM训练与架构 :vision language model(title,abstract);VLM(abstract);分类 cs.CV、cs.LG

Comments Published at EMNLP 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.13638 2025-09-22 cs.CV cs.AI 84%

DualEdit: Dual Editing for Knowledge Updating in Vision-Language Models

Zhiyi Shi, Binjie Wang, Chongjie Si, Yichen Wu, Junsik Kim, Hanspeter Pfister

机构 * Harvard University(哈佛大学) City University of Hong Kong(香港城市大学) Amazon(亚马逊) Fudan University(复旦大学) MoE Key Lab of Artificial Intelligence, AI Institute, Shanghai Jiao Tong University(人工智能关键实验室,上海交通大学)

专题命中 VLM训练与架构 :vision-language model(title,abstract);VLM(abstract);分类 cs.CV、cs.AI

Comments COLM 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.15076 2025-09-19 cs.LG cs.CV 84%

Forecasting and Visualizing Air Quality from Sky Images with Vision-Language Models

Mohammad Saleh Vahdatpour, Maryam Eyvazi, Yanqing Zhang

机构 * Georgia State University(佐治亚州立大学) Savannah College of Art and Design(萨凡纳艺术与设计学院)

专题命中 VLM训练与架构 :vision-language model(title,abstract);VLM(abstract);分类 cs.CV、cs.LG

Comments Published at ICCVW 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.09808 2025-09-19 cs.CV cs.AI 84%

Fine-tuning Vision Language Models with Graph-based Knowledge for Explainable Medical Image Analysis

Chenjun Li, Laurin Lux, Alexander H. Berger, Martin J. Menten, Mert R. Sabuncu, Johannes C. Paetzold

机构 * School of Electrical and Computer Engineering, Cornell University(电气与计算机工程学院,康奈尔大学) School of Computation, Information and Technology, Technical University of Munich(计算、信息与技术学院,慕尼黑技术大学) Cornell Tech(康奈尔科技) Weill Cornell Medicine(韦尔·康奈尔医学)

专题命中 VLM训练与架构 :vision language model(title);vision-language model(abstract);VLM(abstract);分类 cs.CV、cs.AI

Comments 11 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.06759 2025-09-09 cs.LG cs.AI 84%

Aligning Large Vision-Language Models by Deep Reinforcement Learning and Direct Preference Optimization

Thanh Thi Nguyen, Campbell Wilson, Janis Dalins

机构 * AiLECS Lab, Monash University Melbourne, Australia(墨尔本大学AiLECS实验室,澳大利亚) AiLECS Lab, Monash University, Australia ICMEC Australia, Sydney, Australia(墨尔本大学AiLECS实验室,澳大利亚 ICMEC澳大利亚,悉尼,澳大利亚)

专题命中 VLM训练与架构 :vision-language model(title,abstract);multimodal large language model(abstract);分类 cs.AI、cs.LG

Comments Accepted for publication in the Proceedings of the 8th International Conference on Algorithms, Computing and Artificial Intelligence (ACAI 2025)

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.05703 2025-09-09 cs.CV cs.AI cs.IR 84%

Knowledge-Augmented Vision Language Models for Underwater Bioacoustic Spectrogram Analysis

Ragib Amin Nihal, Benjamin Yen, Takeshi Ashizawa, Kazuhiro Nakadai

机构 * Systems and Control Engineering, Institute of Science Tokyo(科学理工学院东京)

专题命中 VLM训练与架构 :vision language model(title,abstract);VLM(abstract);分类 cs.CV、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.21430 2025-09-01 cs.CL cs.AI cs.CV 84%

Med-RewardBench: Benchmarking Reward Models and Judges for Medical Multimodal Large Language Models

Meidan Ding, Jipeng Zhang, Wenxuan Wang, Cheng-Yi Li, Wei-Chieh Fang, Hsin-Yu Wu, Haiqin Zhong, Wenting Chen, Linlin Shen

机构 * College of Computer Science and Software Engineering, Shenzhen University(深圳大学计算机科学与软件工程学院) School of Artificial Intelligence, Shenzhen University(深圳大学人工智能学院) Guangdong Provincial Key Laboratory of Intelligent Information Processing(广东省智能信息处理重点实验室) The Hong Kong University of Science and Technology(香港科学与技术大学) Renmin University of China(中国人民大学) National Yang Ming Chiao Tung University Taipei Veterans General Hospital(台北荣民总医院) School of Biomedical Engineering, Shenzhen University(深圳大学生物医学工程学院)

专题命中 VLM训练与架构 :multimodal large language model(title,abstract);MLLM(abstract);分类 cs.CV、cs.AI

Comments 19 pages, 5 figures, 3 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.13524 2025-08-20 cs.CV cs.AI 84%

Evaluating Open-Source Vision Language Models for Facial Emotion Recognition against Traditional Deep Learning Models

Vamsi Krishna Mulukutla, Sai Supriya Pavarala, Srinivasa Raju Rudraraju, Sridevi Bonthu

专题命中 VLM训练与架构 :vision language model(title);vision-language model(abstract);VLM(abstract);分类 cs.CV、cs.AI

Journal ref EAI Endorsed Transactions on AI and Robotics, 4, August 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.09225 2025-08-14 eess.IV cs.AI cs.CV 84%

AMRG: Extend Vision Language Models for Automatic Mammography Report Generation

Nak-Jun Sung, Donghyun Lee, Bo Hwa Choi, Chae Jung Park

机构 * Research Institute, National Cancer Center Korea(韩国国家癌症中心研究所) Department of Radiology, National Cancer Center Korea(韩国国家癌症中心放射科)

专题命中 VLM训练与架构 :vision language model(title);vision-language model(abstract);VLM(abstract);分类 cs.CV、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.09672 2025-08-06 cs.CV cs.AI 84%

CHIRP: A Fine-Grained Benchmark for Open-Ended Response Evaluation in Vision-Language Models

Alexis Roger, Prateek Humane, Daniel Z. Kaplan, Kshitij Gupta, Qi Sun, George Adamopoulos, Jonathan Siu Chi Lim, Quentin Anthony, Edwin Fennell, Irina Rish

机构 * Mila - Quebec AI Institute(魁北克人工智能研究所) Université de Montréal(蒙特利尔大学) Tokyo Institute of Technology(东京技术大学) McGill University(麦吉尔大学) EleutherAI University College London(伦敦大学学院)

专题命中 VLM训练与架构 :vision-language model(title,abstract);VLM(abstract);分类 cs.CV、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.02429 2025-08-05 cs.AI cs.LG 84%

Multimodal Large Language Models for End-to-End Affective Computing: Benchmarking and Boosting with Generative Knowledge Prompting

Miaosen Luo, Jiesen Long, Zequn Li, Yunying Yang, Yuncheng Jiang, Sijie Mai

机构 * School of Computer Science, South China Normal University(华南师范大学计算机科学学院) School of Information Technology in Education, South China Normal University(华南师范大学教育信息技术学院)

专题命中 VLM训练与架构 :multimodal large language model(title,abstract);MLLM(abstract);分类 cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.15621 2025-08-01 cs.CV cs.AI cs.CL cs.MM 84%

LLaVA-MORE: A Comparative Study of LLMs and Visual Backbones for Enhanced Visual Instruction Tuning

Federico Cocchi, Nicholas Moratelli, Davide Caffagni, Sara Sarto, Lorenzo Baraldi, Marcella Cornia, Rita Cucchiara

机构 * University of Modena and Reggio Emilia(摩德纳和雷吉奥艾米利亚大学) University of Pisa(比萨大学) IIT-CNR(意大利国家研究 council(IIT))

专题命中 VLM训练与架构 :LLaVA(title,abstract);multimodal large language model(abstract);分类 cs.CV、cs.AI

Comments ICCV 2025 Workshop on What is Next in Multimodal Foundation Models

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.19628 2025-07-28 cs.CV cs.CL cs.LG cs.MM 84%

Accelerating Multimodal Large Language Models via Dynamic Visual-Token Exit and the Empirical Findings

Qiong Wu, Wenhao Lin, Yiyi Zhou, Weihao Ye, Zhanpeng Zen, Xiaoshuai Sun, Rongrong Ji

机构 * Key Laboratory of Multimedia Trusted Perception and Efficient Computing, Ministry of Education of China, Xiamen University(中国教育部多媒体可信感知与高效计算重点实验室,厦门大学) Institute of Artificial Intelligence, Xiamen University(厦门大学人工智能研究院)

专题命中 VLM训练与架构 :multimodal large language model(title);LLaVA(abstract);InternVL(abstract);分类 cs.CV、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.12795 2025-07-18 cs.CV cs.AI 84%

City-VLM: Towards Multidomain Perception Scene Understanding via Multimodal Incomplete Learning

Penglei Sun, Yaoxian Song, Xiangru Zhu, Xiang Liu, Qiang Wang, Yue Liu, Changqun Xia, Tiefeng Li, Yang Yang, Xiaowen Chu

机构 * The Hong Kong University of Science and Technology (Guangzhou)(香港科学与技术大学(广州)) Zhejiang University(浙江大学) Fudan University(复旦大学) Harbin Institute of Technology (Shenzhen)(哈尔滨工业大学(深圳)) Terminus Technologies Co., Ltd. Pengcheng Laboratory(鹏城实验室)

专题命中 VLM训练与架构 :VLM(title,abstract);vision-language model(abstract);分类 cs.CV、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.10442 2025-07-15 cs.LG cs.AI 84%

Response Wide Shut? Surprising Observations in Basic Vision Language Model Capabilities

Shivam Chandhok, Wan-Cyuan Fan, Vered Shwartz, Vineeth N Balasubramanian, Leonid Sigal

机构 * University of British Columbia(不列颠哥伦比亚大学) Vector Institute for AI(人工智能矢量研究所) IIT Hyderabad(海得拉巴印度理工学院) CIFAR AI Chair(卡尔加里人工智能主席) Microsoft Research India(微软印度研究院)

专题命中 VLM训练与架构 :vision language model(title);vision-language model(abstract);VLM(abstract);分类 cs.AI、cs.LG

Comments Accepted at ACL 2025 (Main Conference)

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.02948 2025-07-15 cs.CV cs.AI cs.RO 84%

DriveMRP: Enhancing Vision-Language Models with Synthetic Motion Data for Motion Risk Prediction

Zhiyi Hou, Enhui Ma, Fang Li, Zhiyi Lai, Kalok Ho, Zhanqian Wu, Lijun Zhou, Long Chen, Chitian Sun, Haiyang Sun, Bing Wang, Guang Chen, Hangjun Ye, Kaicheng Yu

机构 * Westlake University(西湖大学) Xiaomi EV(小米汽车) Zhejiang University(浙江大学)

专题命中 VLM训练与架构 :vision-language model(title,abstract);VLM(abstract);分类 cs.CV、cs.AI

Comments 12 pages, 4 figures. Code available at https://github.com/hzy138/DriveMRP

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.07572 2025-07-11 cs.CL cs.AI cs.CV 84%

Single-to-mix Modality Alignment with Multimodal Large Language Model for Document Image Machine Translation

Yupu Liang, Yaping Zhang, Zhiyang Zhang, Yang Zhao, Lu Xiang, Chengqing Zong, Yu Zhou

专题命中 VLM训练与架构 :multimodal large language model(title,abstract);MLLM(abstract);分类 cs.CV、cs.AI

Comments Accepted by ACL 2025 Main

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.06140 2025-07-09 eess.IV cs.AI cs.CV 84%

LangMamba: A Language-driven Mamba Framework for Low-dose CT Denoising with Vision-language Models

Zhihao Chen, Tao Chen, Chenhui Wang, Qi Gao, Huidong Xie, Chuang Niu, Ge Wang, Hongming Shan

机构 * Institute of Science and Technology for Brain-inspired Intelligence, Fudan University(脑启发智能科学与技术研究院,复旦大学) Department of Biomedical Engineering, Yale University(生物医学工程系,耶鲁大学) Biomedical Imaging Center, Center for Biotechnology and Interdisciplinary Studies, Department of Biomedical Engineering, Rensselaer Polytechnic Institute(生物医学成像中心,生物技术与跨学科研究所在生物医学工程系,罗切斯特理工学院) Institute of Science and Technology for Brain-inspired Intelligence, MOE Frontiers Center for Brain Science and Key Laboratory of Computational Neuroscience and Brain-Inspired Intelligence (Ministry of Education), Fudan University(脑启发智能科学与技术研究院,教育部脑科学前沿中心和计算神经科学与脑启发智能重点实验室,复旦大学) Shanghai Center for Brain Science and Brain-inspired Technology(上海脑科学与脑启发技术中心)

专题命中 VLM训练与架构 :vision-language model(title,abstract);VLM(abstract);分类 cs.CV、cs.AI

Comments 11 pages, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏