arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视觉大模型 / VLM

视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。

共收录 1565 信号源:cs.CV, cs.AI, cs.LG

1. 其他VLM 1565 篇

2409.17806 2025-11-14 cs.LG 79%

Caption, Create, Continue: Continual Learning with Pre-trained Generative Vision-Language Models

Indu Solomon, Aye Phyu Phyu Aung, Uttam Kumar, Senthilnath Jayavelu

机构 * International Institute of Information Technology Bangalore (IIITB), India(国际信息技术研究所(班加罗尔)) Institute for Infocomm Research, Agency for Science, Technology and Research (A*STAR), Singapore(信息与通信研究所(A*STAR))

专题命中 其他VLM :vision-language model(title,abstract);分类 cs.LG

Comments This is the revised and peer-reviewed version of our paper, accepted and published in the Proceedings of the 34th ACM International Conference on Information and Knowledge Management (CIKM 2025)

Journal ref Proc. 34th ACM International Conference on Information and Knowledge Management (CIKM), 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.04062 2025-11-13 eess.IV cs.CV 79%

PET2Rep: Towards Vision-Language Model-Drived Automated Radiology Report Generation for Positron Emission Tomography

Yichi Zhang, Wenbo Zhang, Zehui Ling, Gang Feng, Sisi Peng, Deshu Chen, Yuchen Liu, Hongwei Zhang, Shuqi Wang, Lanlan Li, Limei Han, Yuan Cheng, Zixin Hu, Yuan Qi, Le Xue

专题命中 其他VLM :vision-language model(title,abstract);分类 cs.CV

Comments Accepted by AAAI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.27256 2025-11-03 cs.LG cs.HC 79%

ECVL-ROUTER: Scenario-Aware Routing for Vision-Language Models

Xin Tang, Youfang Han, Fangfei Gou, Wei Zhao, Xin Meng, Yang Yu, Jinguo Zhang, Yuanchun Shi, Yuntao Wang, Tengxiang Zhang

机构 * Tsinghua University(清华大学) Goertek Inc(歌尔股份有限公司)

专题命中 其他VLM :vision-language model(title,abstract);分类 cs.LG

Comments 23 pages, 13 figures, 7 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.21175 2025-10-27 cs.AI 79%

Memory-Free Continual Learning with Null Space Adaptation for Zero-Shot Vision-Language Models

Yujin Jo, Taesup Kim

专题命中 其他VLM :vision-language model(title,abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.13276 2025-10-16 cs.CV cs.CL 79%

MMLongCite: A Benchmark for Evaluating Fidelity of Long-Context Vision-Language Models

Keyan Zhou, Zecheng Tang, Lingfeng Ming, Guanghao Zhou, Qiguang Chen, Dan Qiao, Zheming Yang, Libo Qin, Minghui Qiu, Juntao Li, Min Zhang

机构 * Soochow University(苏州大学) ByteDance(字节跳动) Harbin Institute of Technology(哈尔滨工业大学) Central South University(中南大学)

专题命中 其他VLM :vision-language model(title);vision language model(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.26161 2025-10-01 cs.AI cs.SE 79%

90% Faster, 100% Code-Free: MLLM-Driven Zero-Code 3D Game Development

Runxin Yang, Yuxuan Wan, Shuqing Li, Michael R. Lyu

机构 * The Chinese University of Hong Kong(香港中文大学)

专题命中 其他VLM :MLLM(title);multimodal large language model(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.22447 2025-09-29 cs.AI cs.NE 79%

Guiding Evolution of Artificial Life Using Vision-Language Models

Nikhil Baid, Hannah Erlebach, Paul Hellegouarch, Frederico Wieser

机构 * University College London(伦敦大学学院) Institut Pasteur(巴斯德研究院)

专题命中 其他VLM :vision-language model(title,abstract);分类 cs.AI

Comments 9 pages, 6 figures. Accepted for publication in the Proceedings of the Artificial Life Conference 2025 (MIT Press)

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.10634 2025-09-17 cs.CV 79%

Cross-Image Contrastive Decoding: Precise, Lossless Suppression of Language Priors in Large Vision-Language Models

Jianfei Zhao, Feng Zhang, Xin Sun, Lingxing Kong, Zhixing Tan, Chong Feng

机构 * School of Computer Science and Technology, Beijing Institute of Technology(计算机科学与技术学院,北京理工大学) Zhongguancun Academy(中关村学院) Southeast Academy of Information Technology, Beijing Institute of Technology(信息技术东南学院,北京理工大学) Tsinghua University(清华大学)

专题命中 其他VLM :vision-language model(title,abstract);分类 cs.CV

Comments Under Review

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.17675 2025-09-09 cs.LG 79%

Towards Synthesizing Normative Data for Cognitive Assessments Using Generative Multimodal Large Language Models

Victoria Yan, Honor Chotkowski, Fengran Wang, Xinhui Li, Carl Yang, Jiaying Lu, Runze Yan, Xiao Hu, Alex Fedorov

机构 * The Westminster Schools(韦斯敏斯特学校) Center for Data Science, Nell Hodgson Woodruff School of Nursing, Emory University(数据科学中心、恩莫森护理学院、埃默里大学) Department of Computer Science, Emory University(计算机科学系、埃默里大学) School of Electrical and Computer Engineering, Georgia Institute of Technology(电气与计算机工程学院、佐治亚理工学院)

专题命中 其他VLM :multimodal large language model(title,abstract);分类 cs.LG

Comments Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.04480 2025-09-08 cs.CL cs.LG 79%

Discrete Prompt Tuning via Recursive Utilization of Black-box Multimodal Large Language Model for Personalized Visual Emotion Recognition

Ryo Takahashi, Naoki Saito, Keisuke Maeda, Takahiro Ogawa, Miki Haseyama

机构 * Graduate School of Information Science(信息科学研究生学校) Technology, Hokkaido University, Sapporo 060-0814, Japan(技术,北海道大学,札幌060-0814,日本) Office of Institutional Research, Hokkaido University, Sapporo 060-0808, Japan(机构研究办公室,北海道大学,札幌060-0808,日本) Faculty of Information Science(信息科学学院)

专题命中 其他VLM :multimodal large language model(title,abstract);分类 cs.LG

Comments 11 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.10583 2025-08-29 cs.CV cs.CL 79%

Relative Drawing Identification Complexity is Invariant to Modality in Vision-Language Models

Diogo Freitas, Brigt Håvardstun, Cèsar Ferri, Darío Garigliotti, Jan Arne Telle, José Hernández-Orallo

机构 * Interactive Technologies Institute and NOVA LINCS Faculty of Exact Sciences and Engineering University of Madeira Portugal(互动技术研究所和NOVA LINCS精确科学与工程学院马德拉大学) Department of Informatics University of Bergen Norway(信息学院卑尔根大学挪威) Valencian Research Institute for Artificial Intelligence Universitat Politècnica de València Spain(瓦伦西亚人工智能研究机构瓦伦西亚理工大学西班牙) Leverhulme Centre for the Future of Intelligence and Valencian Research Institute for Artificial Intelligence Spain(未来智能中心和瓦伦西亚人工智能研究机构西班牙)

专题命中 其他VLM :vision-language model(title,abstract);分类 cs.CV

Comments 54 pages (42 pages of appendix). Accepted for publication at the ECAI 2025 conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2404.10357 2025-08-19 cs.CV 79%

Optimization of Prompt Learning via Multi-Knowledge Representation for Vision-Language Models

Enming Zhang, Bingke Zhu, Yingying Chen, Qinghai Miao, Ming Tang, Jinqiao Wang

机构 * School of Artificial Intelligence, University of Chinese Academy of Sciences(中国科学院大学人工智能学院) Foundation Model Research Center, Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所基础模型研究中心) Wuhan AI Research(武汉人工智能研究所) Peng Cheng Laboratory(鹏城实验室)

专题命中 其他VLM :vision-language model(title,abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.10645 2025-08-15 cs.CV 79%

SemPT: Semantic Prompt Tuning for Vision-Language Models

Xiao Shi, Yangjun Ou, Zhenzhong Chen

机构 * School of Computer Science and Artificial Intelligence, Wuhan Textile University(武汉纺织大学计算机科学与人工智能学院) School of Remote Sensing and Information Engineering, Wuhan University(武汉大学遥感与信息工程学院)

专题命中 其他VLM :vision-language model(title,abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.22793 2025-08-15 cs.CV cs.CL 79%

Evaluation of Cultural Competence of Vision-Language Models

Srishti Yadav, Lauren Tilton, Maria Antoniak, Taylor Arnold, Jiaang Li, Siddhesh Milind Pawar, Antonia Karamolegkou, Stella Frank, Zhaochong An, Negar Rostamzadeh, Daniel Hershcovich, Serge Belongie, Ekaterina Shutova

机构 * Department of Computer Science, University of Copenhagen(计算机科学系,哥本哈根大学) Department of Rhetoric and Communication Studies, University of Richmond(修辞与传播研究系,里士满大学) Department of Data Science and Statistics, University of Richmond(数据科学与统计系,里士满大学) Google Research(谷歌研究) ILLC, University of Amsterdam(阿姆斯特丹大学ILLC中心) Pioneer Centre of AI, Denmark(丹麦先锋人工智能中心)

专题命中 其他VLM :vision-language model(title,abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.05898 2025-08-11 cs.CV 79%

ETTA: Efficient Test-Time Adaptation for Vision-Language Models through Dynamic Embedding Updates

Hamidreza Dastmalchi, Aijun An, Ali cheraghian

机构 * York University(约克大学) The Australian National University(澳大利亚国立大学) Data61-CSIRO

专题命中 其他VLM :vision-language model(title,abstract);分类 cs.CV

Comments BMVC2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.04192 2025-08-07 cs.CV 79%

From Learning to Unlearning: Biomedical Security Protection in Multimodal Large Language Models

Dunyuan Xu, Xikai Yang, Yaoqian Li, Jinpeng Li, Pheng-Ann Heng

专题命中 其他VLM :multimodal large language model(title,abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.04028 2025-08-07 cs.CV cs.IR 79%

Dual Prompt Learning for Adapting Vision-Language Models to Downstream Image-Text Retrieval

Yifan Wang, Tao Wang, Chenwei Tang, Caiyang Yu, Zhengqing Zang, Mengmi Zhang, Shudong Huang, Jiancheng Lv

机构 * College of Computer Science, Sichuan University(四川大学计算机学院) Engineering Research Center of Machine Learning and Industry Intelligence, Ministry of Education, Chengdu, China(教育部机器学习与产业智能工程研究中心) Deep NeuroCognition Lab, I2R and CFAR, Agency for Science, Technology and Research, Singapore(深度神经认知实验室,I2R和CFAR,科技研究局,新加坡)

专题命中 其他VLM :vision-language model(title,abstract);分类 cs.CV

Comments 10 pages, 7figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.19064 2025-08-06 cs.CV 79%

Negation-Aware Test-Time Adaptation for Vision-Language Models

Haochen Han, Alex Jinpeng Wang, Fangming Liu, Jun Zhu

机构 * Department of AI Computing, Pengcheng Laboratory(人工智能计算系,鹏城实验室) School of Computer Science and Technology, Central South University(计算机科学与技术学院,中南大学) Department of Computer Science and Technology, Institute for AI, BNRist Center, THBI Lab, Tsinghua-Bosch Joint Center for ML, Tsinghua University(计算机科学与技术系,人工智能研究院,BNRist中心,THBI实验室,清华-博世联合人工智能中心,清华大学)

专题命中 其他VLM :vision-language model(title,abstract);分类 cs.CV

Comments This paper will be submitted to the IEEE for possible publication

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.01236 2025-08-05 cs.CV 79%

Mitigating Information Loss under High Pruning Rates for Efficient Large Vision Language Models

Mingyu Fu, Wei Suo, Ji Ma, Lin Yuanbo Wu, Peng Wang, Yanning Zhang

机构 * Northwestern Polytechnical University(西北工业大学) National Engineering Laboratory for Integrated Aero-Space-Ground-Ocean Big Data Application Technology(集成空天地海大数据应用技术国家工程实验室) Swansea University(斯旺西大学)

专题命中 其他VLM :vision language model(title,abstract);分类 cs.CV

Comments accepted by ACM MM 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.16326 2025-08-05 cs.LG 79%

ChemMLLM: Chemical Multimodal Large Language Model

Qian Tan, Dongzhan Zhou, Peng Xia, Wanhao Liu, Wanli Ouyang, Lei Bai, Yuqiang Li, Tianfan Fu

专题命中 其他VLM :multimodal large language model(title,abstract);分类 cs.LG

Comments 23 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.14939 2025-08-01 cs.CV 79%

VisNumBench: Evaluating Number Sense of Multimodal Large Language Models

Tengjin Weng, Jingyi Wang, Wenhao Jiang, Zhong Ming

机构 * College of Computer Science and Software Engineering, Shenzhen University(深圳大学计算机科学与软件工程学院) Guangdong Laboratory of Artificial Intelligence and Digital Economy (SZ)(广东省人工智能与数字经济发展实验室) Shenzhen International Graduate School, Tsinghua University(清华大学深圳国际 Graduate School) Shenzhen Technology University(深圳技术大学)

专题命中 其他VLM :multimodal large language model(title,abstract);分类 cs.CV

Comments accepted by ICCV 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.12545 2025-07-23 cs.CV 79%

PEBench: A Fictitious Dataset to Benchmark Machine Unlearning for Multimodal Large Language Models

Zhaopan Xu, Pengfei Zhou, Weidong Tang, Jiaxin Ai, Wangbo Zhao, Kai Wang, Xiaojiang Peng, Wenqi Shao, Hongxun Yao, Kaipeng Zhang

机构 * Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) School of Computer, Harbin Institute of Technology(计算机学院,哈尔滨工业大学) School of Computer, National University of Singapore(计算机学院,国立新加坡大学) School of Computer, Xidian University(计算机学院,西安电子科技大学) College of Big Data and Internet, Shenzhen Technology University(大数据与互联网学院,深圳科技大学)

专题命中 其他VLM :multimodal large language model(title,abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.05887 2025-07-21 cs.CV 79%

GeoMag: A Vision-Language Model for Pixel-level Fine-Grained Remote Sensing Image Parsing

Xianzhi Ma, Jianhui Li, Changhua Pei, Hao Liu

机构 * Institute of Space Earth Science, School of Frontier Sciences, Nanjing University(南京大学空间地球科学学院) Computer Network Information Center, Chinese Academy of Sciences(中国科学院计算机网络信息中心)

专题命中 其他VLM :vision-language model(title,abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.13089 2025-07-18 cs.CV 79%

GLAD: Generalizable Tuning for Vision-Language Models

Yuqi Peng, Pengfei Wang, Jianzhuang Liu, Shifeng Chen

机构 * Shenzhen Institutes of Advanced Technology, Chinese Academy of Sciences(深圳先进技术研究院,中国科学院) Northeastern University(东北大学) The Hong Kong Polytechnic University(香港理工大学) Shenzhen University of Advanced Technology(深圳先进技术大学)

专题命中 其他VLM :vision-language model(title,abstract);分类 cs.CV

Comments ICCV 2025 workshop

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.23329 2025-07-01 cs.CV 79%

IR3D-Bench: Evaluating Vision-Language Model Scene Understanding as Agentic Inverse Rendering

Parker Liu, Chenxin Li, Zhengxin Li, Yipeng Wu, Wuyang Li, Zhiqin Yang, Zhenyuan Zhang, Yunlong Lin, Sirui Han, Brandon Y. Feng

机构 * CUHK(香港中文大学) TJU(天津大学) EPFL(瑞士联邦理工学院) HKUST(香港科技大学) XMU(厦门大学) MIT(麻省理工学院)

专题命中 其他VLM :vision-language model(title,abstract);分类 cs.CV

Comments Project Page: https://ir3d-bench.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.19389 2025-06-25 cs.CV 79%

Emergence of Text Readability in Vision Language Models

Jaeyoo Park, Sanghyuk Chun, Wonjae Kim, Sangdoo Yun, Bohyung Han

机构 * Naver AI Lab Seoul National University(首尔国立大学) Computer Vision Laboratory, ECE(计算机视觉实验室,电子与计算机工程系) IPAI

专题命中 其他VLM :vision language model(title);vision-language model(abstract);分类 cs.CV

Comments EVAL-FoMo Workshop @ CVPR 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.14224 2025-06-18 cs.AI 79%

From Black Boxes to Transparent Minds: Evaluating and Enhancing the Theory of Mind in Multimodal Large Language Models

Xinyang Li, Siqi Liu, Bochao Zou, Jiansheng Chen, Huimin Ma

机构 * School of Computer and Communication Engineering, University of Science and Technology Beijing(计算机与通信工程学院,科学技术大学)

专题命中 其他VLM :multimodal large language model(title,abstract);分类 cs.AI

Comments 24 pages, 22 figures, accepted at ICML 2025, project page: see https://annaisavailable.github.io/GridToM/

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.14015 2025-06-18 cs.CV 79%

Disentangling 3D from Large Vision-Language Models for Controlled Portrait Generation

Nick Yiwen Huang, Akin Caliskan, Berkay Kicanaoglu, James Tompkin, Hyeongwoo Kim

机构 * Brown University(布朗大学) Flawless AI Imperial College London(帝国理工学院伦敦分校)

专题命中 其他VLM :vision-language model(title,abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.11155 2025-06-16 cs.CV 79%

Evaluating Multimodal Large Language Models on Video Captioning via Monte Carlo Tree Search

Linhao Yu, Xinguang Ji, Yahui Liu, Fanheng Kong, Chenxi Sun, Jingyuan Zhang, Hongzhi Zhang, V. W., Fuzheng Zhang, Deyi Xiong

机构 * TJUNLP Lab, College of Intelligence and Computing, Tianjin University(天津大学智能计算学院)

专题命中 其他VLM :multimodal large language model(title,abstract);分类 cs.CV

Comments 28 pages; ACL 2025(main)

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.04005 2025-06-05 cs.CV 79%

Vocabulary-free few-shot learning for Vision-Language Models

Maxime Zanella, Clément Fuchs, Ismail Ben Ayed, Christophe De Vleeschouwer

机构 * UCLouvain(乌得勒支大学) UMons(蒙斯大学) ÉTS Montreal(蒙特利尔ÉTS)

专题命中 其他VLM :vision-language model(title,abstract);分类 cs.CV

Comments Accepted at CVPR Workshops 2025

详情

展开后加载摘要…

URL PDF HTML 收藏