arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视觉大模型 / VLM

视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。

共收录 1565 信号源:cs.CV, cs.AI, cs.LG

1. 其他VLM 1565 篇

2511.15633 2025-11-20 cs.CV cs.LG 62%

Hierarchical Semantic Tree Anchoring for CLIP-Based Class-Incremental Learning

基于CLIP的层次语义树锚定的类增量学习

Tao Hu, Lan Li, Zhen-Hao Xie, Da-Wei Zhou

机构 * School of Artificial Intelligence, Nanjing University(人工智能学院,南京大学) State Key Laboratory for Novel Software Technology, Nanjing University(新型软件技术国家重点实验室,南京大学)

专题命中 其他VLM :vision-language model(abstract);分类 cs.CV、cs.LG

AI总结 HASTEN通过层次语义树锚定方法,有效解决CLIP类增量学习中的灾难性遗忘问题,提升模型对层次化类别结构的保持能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.26125 2025-11-14 cs.CV cs.AI 62%

WOD-E2E: Waymo Open Dataset for End-to-End Driving in Challenging Long-tail Scenarios

Runsheng Xu, Hubert Lin, Wonseok Jeon, Hao Feng, Yuliang Zou, Liting Sun, John Gorman, Ekaterina Tolstaya, Sarah Tang, Brandyn White, Ben Sapp, Mingxing Tan, Jyh-Jing Hwang, Dragomir Anguelov

机构 * Waymo LLC(Waymo公司)

专题命中 其他VLM :multimodal large language model(abstract);分类 cs.CV、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.08075 2025-11-12 cs.CV cs.AI 62%

CLIP is All You Need for Human-like Semantic Representations in Stable Diffusion

Cameron Braunstein, Mariya Toneva, Eddy Ilg

机构 * Saarland University, Saarbrücken Germany(萨尔兰州大学) MPI for Software Systems, Saarbrücken Germany(软件系统研究所) University of Technology Nuremberg, Nuremberg Germany(纽伦堡技术大学)

专题命中 其他VLM :vision-language model(abstract);分类 cs.CV、cs.AI

Comments 28 pages, 8 figures, 2 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.13231 2025-11-12 cs.CV cs.AI 62%

WildFireCan-MMD: A Multimodal Dataset for Classification of User-Generated Content During Wildfires in Canada

Braeden Sherritt, Isar Nejadgholi, Efstratios Aivaliotis, Khaled Mslmani, Marzieh Amini

机构 * Carleton University(卡尔顿大学) National Research Council Canada(加拿大国家研究委员会)

专题命中 其他VLM :vision-language model(abstract);分类 cs.CV、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.18800 2025-11-11 cs.CV cs.AI 62%

Video CLIP Model for Multi-View Echocardiography Interpretation

Ryo Takizawa, Satoshi Kodera, Tempei Kabayama, Ryo Matsuoka, Yuta Ando, Yuto Nakamura, Haruki Settai, Norihiko Takeda

机构 * The University of Tokyo Hospital(东京大学医院)

专题命中 其他VLM :vision-language model(abstract);分类 cs.CV、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.02720 2025-11-05 cs.CV cs.AI 62%

LLEXICORP: End-user Explainability of Convolutional Neural Networks

Vojtěch Kůr, Adam Bajger, Adam Kukučka, Marek Hradil, Vít Musil, Tomáš Brázdil

专题命中 其他VLM :multimodal large language model(abstract);分类 cs.CV、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.02358 2025-11-05 cs.CL cs.AI cs.IR cs.LG cs.MM 62%

Let Multimodal Embedders Learn When to Augment Query via Adaptive Query Augmentation

Wongyu Kim, Hochang Lee, Sanghak Lee, Yoonsung Kim, Jaehyun Park

机构 * NC AI(NC人工智能)

专题命中 其他VLM :MLLM(abstract);分类 cs.AI、cs.LG

Comments Accepted to MMGenSR Workshop (CIKM 2025)

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.08221 2025-11-04 cs.CV cs.AI cs.MM 62%

EgoBlind: Towards Egocentric Visual Assistance for the Blind

Junbin Xiao, Nanxin Huang, Hao Qiu, Zhulin Tao, Xun Yang, Richang Hong, Meng Wang, Angela Yao

机构 * National University of Singapore(新加坡国立大学) Communication University of China(中国传媒大学) University of Science and Technology of China(中国科学技术大学) Hefei University of Technoloy(合肥工业大学)

专题命中 其他VLM :multimodal large language model(abstract);分类 cs.CV、cs.AI

Comments NeurIPS'25 (D&B Track)

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.00480 2025-11-04 cs.CV cs.LG 62%

FedMGP: Personalized Federated Learning with Multi-Group Text-Visual Prompts

Weihao Bo, Yanpeng Sun, Yu Wang, Xinyu Zhang, Zechao Li

机构 * Nanjing University of Science and Technology(南京理工大学) National University of Singapore(新加坡国立大学) Baidu VIS(百度视觉部) University of Auckland(奥克兰大学)

专题命中 其他VLM :vision-language model(abstract);分类 cs.CV、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.08478 2025-11-04 cs.IR cs.AI cs.LG 62%

Federated Vision-Language-Recommendation with Personalized Fusion

Zhiwei Li, Guodong Long, Jing Jiang, Chengqi Zhang, Qiang Yang

专题命中 其他VLM :vision-language model(abstract);分类 cs.AI、cs.LG

Comments 15 pages, 10 figures, 7 tables, conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.24321 2025-10-29 cs.CV cs.AI 62%

Few-Shot Remote Sensing Image Scene Classification with CLIP and Prompt Learning

Ivica Dimitrovski, Vlatko Spasev, Ivan Kitanovski

机构 * Faculty of Computer Science and Engineering(计算机科学与工程学院) University Ss Cyril and Methodius(西里尔与美多西乌斯大学)

专题命中 其他VLM :vision-language model(abstract);分类 cs.CV、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.22141 2025-10-28 cs.CV cs.CL cs.LG cs.RO eess.IV 62%

LOC: A General Language-Guided Framework for Open-Set 3D Occupancy Prediction

Yuhang Gao, Xiang Xiang, Sheng Zhong, Guoyou Wang

专题命中 其他VLM :vision-language model(abstract);分类 cs.CV、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.16448 2025-10-21 cs.LG cs.AI 62%

Input Domain Aware MoE: Decoupling Routing Decisions from Task Optimization in Mixture of Experts

Yongxiang Hua, Haoyu Cao, Zhou Tao, Bocheng Li, Zihao Wu, Chaohu Liu, Linli Xu

机构 * University of Science and Technology of China(科学技术大学) State Key Laboratory of Cognitive Intelligence(认知智能国家重点实验室)

专题命中 其他VLM :vision-language model(abstract);分类 cs.AI、cs.LG

Comments ACM MM25

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.13364 2025-10-16 cs.CV cs.AI 62%

Language as a Label: Zero-Shot Multimodal Classification of Everyday Postures under Data Scarcity

MingZe Tang, Jubal Chandy Jacob

机构 * Department of Computing Science University of Aberdeen(计算科学系阿伯丁大学)

专题命中 其他VLM :vision-language model(abstract);分类 cs.CV、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.13211 2025-10-16 cs.CV cs.AI 62%

MIRROR: Multimodal Cognitive Reframing Therapy for Rolling with Resistance

Subin Kim, Hoonrae Kim, Jihyun Lee, Yejin Jeon, Gary Geunbae Lee

机构 * KT Corporation, Republic of Korea(韩国KT公司) Graduate School of Artificial Intelligence, POSTECH, Republic of Korea(POSTECH人工智能研究生院) Computer Science and Engineering, POSTECH, Republic of Korea(POSTECH计算机科学与工程系)

专题命中 其他VLM :vision language model(abstract);分类 cs.CV、cs.AI

Comments EMNLP 2025 Main

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.10315 2025-10-14 cs.LG cs.AI 62%

A Vision-Language Pre-training Model-Guided Approach for Mitigating Backdoor Attacks in Federated Learning

Keke Gai, Dongjue Wang, Jing Yu, Liehuang Zhu, Qi Wu

机构 * School of Cyberspace Science and Technology, Beijing Institute of Technology(信息空间科学与技术学院,北京理工大学) School of Information Engineering, Minzu University of China(信息工程学院,民族大学) Australian Institute of Machine Learning, The University of Adelaide(澳大利亚机器学习研究所,阿德莱德大学)

专题命中 其他VLM :multimodal large language model(abstract);分类 cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.10100 2025-10-14 cs.CV cs.LG 62%

Cooperative Pseudo Labeling for Unsupervised Federated Classification

Kuangpu Guo, Lijun Sheng, Yongcan Yu, Jian Liang, Zilei Wang, Ran He

机构 * University of Science and Technology of China(中国科学技术大学) NLPR & MAIS, Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) School of Artificial Intelligence, University of Chinese Academy of Sciences(中国科学院大学人工智能学院)

专题命中 其他VLM :vision language model(abstract);分类 cs.CV、cs.LG

Comments Accepted by ICCV 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.08894 2025-10-10 cs.CV cs.AI 62%

Product of Experts for Visual Generation

Yunzhi Zhang, Carson Murtuza-Lanier, Zizhang Li, Yilun Du, Jiajun Wu

机构 * Stanford University(斯坦福大学) Harvard University(哈佛大学)

专题命中 其他VLM :visual language model(abstract);分类 cs.CV、cs.AI

Comments Project page: https://product-of-experts.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.00046 2025-10-02 cs.CV cs.AI 62%

Reinforcement Learning-Based Prompt Template Stealing for Text-to-Image Models

Xiaotian Zou

机构 * Xiaotian Zou

专题命中 其他VLM :multimodal large language model(abstract);分类 cs.CV、cs.AI

Comments 10 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.25818 2025-10-01 cs.CV cs.AI cs.CL 62%

VELA: An LLM-Hybrid-as-a-Judge Approach for Evaluating Long Image Captions

Kazuki Matsuda, Yuiga Wada, Shinnosuke Hirano, Seitaro Otsuki, Komei Sugiura

机构 * Keio University(庆应大学)

专题命中 其他VLM :multimodal large language model(abstract);分类 cs.CV、cs.AI

Comments EMNLP 2025 Main Conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.08727 2025-09-24 cs.CV cs.AI cs.CY 62%

Visual Chronicles: Using Multimodal LLMs to Analyze Massive Collections of Images

Boyang Deng, Songyou Peng, Kyle Genova, Gordon Wetzstein, Noah Snavely, Leonidas Guibas, Thomas Funkhouser

机构 * Stanford University(斯坦福大学) Google DeepMind(谷歌DeepMind)

专题命中 其他VLM :MLLM(abstract);分类 cs.CV、cs.AI

Comments ICCV 2025, Project page: https://boyangdeng.com/visual-chronicles , second and third listed authors have equal contributions

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.17024 2025-09-23 cs.CV cs.AI 62%

When Color-Space Decoupling Meets Diffusion for Adverse-Weather Image Restoration

Wenxuan Fang, Jili Fan, Chao Wang, Xiantao Hu, Jiangwei Weng, Ying Tai, Jian Yang, Jun Li

机构 * School of Computer Science and Engineering, Nanjing University of Science and Technology(计算机科学与工程学院,南京理工大学) School of Electrical Engineering, Southeast University(电气工程学院,东南大学) School of Intelligence Science and Technology, Nanjing University(智能科学与技术学院,南京大学)

专题命中 其他VLM :vision-language model(abstract);分类 cs.CV、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.05439 2025-09-22 cs.CV cs.AI cs.CL 62%

LLMs Can Compensate for Deficiencies in Visual Representations

Sho Takishita, Jay Gala, Abdelrahman Mohamed, Kentaro Inui, Yova Kementchedjhieva

机构 * Fujitsu Limited(富士通有限公司) MBZUAI Tohoku University(东北大学) RIKEN(日本研究机构)

专题命中 其他VLM :vision-language model(abstract);分类 cs.CV、cs.AI

Comments EMNLP 2025 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.10704 2025-09-16 cs.AI cs.CV 62%

Maestro: Self-Improving Text-to-Image Generation via Agent Orchestration

Xingchen Wan, Han Zhou, Ruoxi Sun, Hootan Nakhost, Ke Jiang, Rajarishi Sinha, Sercan Ö. Arık

机构 * Google(谷歌)

专题命中 其他VLM :MLLM(abstract);分类 cs.CV、cs.AI

Comments 15 pages, 7 figures, 2 tables (22 pages, 9 figures and 3 tables including references and appendices)

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.09507 2025-09-15 cs.LG cs.CV 62%

When and How Does CLIP Enable Domain and Compositional Generalization?

Elias Kempf, Simon Schrodi, Max Argus, Thomas Brox

机构 * University of Freiburg(弗赖堡大学)

专题命中 其他VLM :vision-language model(abstract);分类 cs.CV、cs.LG

Comments ICML 2025 (Spotlight)

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.09307 2025-09-12 cs.CV cs.AI cs.CL cs.MM 62%

Can Multimodal LLMs See Materials Clearly? A Multimodal Benchmark on Materials Characterization

Zhengzhao Lai, Youbin Zheng, Zhenyang Cai, Haonan Lyu, Jinpu Yang, Hongqing Liang, Yan Hu, Benyou Wang

专题命中 其他VLM :multimodal large language model(abstract);分类 cs.CV、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.21831 2025-09-12 cs.CV cs.AI 62%

Early Exit and Multi Stage Knowledge Distillation in VLMs for Video Summarization

Anas Anwarul Haq Khan, Utkarsh Verma, Ganesh Ramakrishnan

机构 * Department of Computer Science and Engineering, IIT Bombay(印度理工学院班加罗尔计算机科学与工程系) Center of Machine Intelligence and Data Science (C-MInDS), IIT Bombay(印度理工学院班加罗尔人工智能与数据科学中心)

专题命中 其他VLM :vision language model(abstract);分类 cs.CV、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.06585 2025-09-10 cs.AI cs.CV 62%

CountQA: How Well Do MLLMs Count in the Wild?

Jayant Sravan Tamarapalli, Rynaa Grover, Nilay Pande, Sahiti Yerramilli

专题命中 其他VLM :multimodal large language model(abstract);分类 cs.CV、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.05714 2025-09-09 cs.AI cs.CV 62%

Towards Meta-Cognitive Knowledge Editing for Multimodal LLMs

Zhaoyu Fan, Kaihang Pan, Mingze Zhou, Bosheng Qin, Juncheng Li, Shengyu Zhang, Wenqiao Zhang, Siliang Tang, Fei Wu, Yueting Zhuang

机构 * Zhejiang University(浙江大学)

专题命中 其他VLM :multimodal large language model(abstract);分类 cs.CV、cs.AI

Comments 15 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.04757 2025-09-08 cs.CV cs.AI 62%

MCANet: A Multi-Scale Class-Specific Attention Network for Multi-Label Post-Hurricane Damage Assessment using UAV Imagery

Zhangding Liu, Neda Mohammadi, John E. Taylor

专题命中 其他VLM :multimodal large language model(abstract);分类 cs.CV、cs.AI

Comments 34 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏