arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视觉大模型 / VLM

视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。

共收录 1566 信号源:cs.CV, cs.AI, cs.LG

1. 其他VLM 1566 篇

2503.15973 2025-03-26 cs.CV 57%

STOP: Integrated Spatial-Temporal Dynamic Prompting for Video Understanding

Zichen Liu, Kunlun Xu, Bing Su, Xu Zou, Yuxin Peng, Jiahuan Zhou

专题命中 其他VLM :vision-language model(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.18483 2025-03-25 cs.CV 57%

Explaining Domain Shifts in Language: Concept erasing for Interpretable Image Classification

Zequn Zeng, Yudi Su, Jianqiao Sun, Tiansheng Wen, Hao Zhang, Zhengjue Wang, Bo Chen, Hongwei Liu, Jiawei Ma

专题命中 其他VLM :vision-language model(abstract);分类 cs.CV

Comments Accepted by CVPR2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.18461 2025-03-25 cs.CV 57%

MuMA: 3D PBR Texturing via Multi-Channel Multi-View Generation and Agentic Post-Processing

Lingting Zhu, Jingrui Ye, Runze Zhang, Zeyu Hu, Yingda Yin, Lanjiong Li, Jinnan Chen, Shengju Qian, Xin Wang, Qingmin Liao, Lequan Yu

专题命中 其他VLM :multimodal large language model(abstract);分类 cs.CV

Comments 17 pages, 14 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.16413 2025-03-21 cs.CV cs.RO 57%

M3: 3D-Spatial MultiModal Memory

Xueyan Zou, Yuchen Song, Ri-Zhao Qiu, Xuanbin Peng, Jianglong Ye, Sifei Liu, Xiaolong Wang

专题命中 其他VLM :vision-language model(abstract);分类 cs.CV

Comments ICLR2025 homepage: https://m3-spatial-memory.github.io code: https://github.com/MaureenZOU/m3-spatial

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.13145 2025-03-19 cs.CV 57%

Multimodal Mamba: Decoder-only Multimodal State Space Model via Quadratic to Linear Distillation

Bencheng Liao, Hongyuan Tao, Qian Zhang, Tianheng Cheng, Yingyue Li, Haoran Yin, Wenyu Liu, Xinggang Wang

专题命中 其他VLM :multimodal large language model(abstract);分类 cs.CV

Comments Code and model are available at https://github.com/hustvl/mmMamba

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.09962 2025-03-14 cs.CV 57%

Modeling Thousands of Human Annotators for Generalizable Text-to-Image Person Re-identification

Jiayu Jiang, Changxing Ding, Wentao Tan, Junhong Wang, Jin Tao, Xiangmin Xu

专题命中 其他VLM :MLLM(abstract);分类 cs.CV

Comments CVPR 2025. Project website: https://github.com/sssaury/HAM

详情

展开后加载摘要…

URL PDF HTML 收藏
2311.14282 2025-03-12 cs.CV 57%

Image Super-Resolution with Text Prompt Diffusion

Zheng Chen, Yulun Zhang, Jinjin Gu, Xin Yuan, Linghe Kong, Guihai Chen, Xiaokang Yang

专题命中 其他VLM :MLLM(abstract);分类 cs.CV

Comments Code is available at https://github.com/zhengchen1999/PromptSR

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.07125 2025-03-11 cs.CV 57%

Learning A Zero-shot Occupancy Network from Vision Foundation Models via Self-supervised Adaptation

Sihao Lin, Daqi Liu, Ruochong Fu, Dongrui Liu, Andy Song, Hongwei Xie, Zhihui Li, Bing Wang, Xiaojun Chang

专题命中 其他VLM :vision-language model(abstract);分类 cs.CV

Comments preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.05962 2025-03-11 cs.HC cs.CV 57%

OSCAR: Object Status and Contextual Awareness for Recipes to Support Non-Visual Cooking

Franklin Mingzhe Li, Kaitlyn Ng, Bin Zhu, Patrick Carrington

专题命中 其他VLM :vision-language model(abstract);分类 cs.CV

Comments CHI 2025 Late Breaking Work

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.04506 2025-03-07 cs.SE cs.AI 57%

Multi-modal Summarization in Model-Based Engineering: Automotive Software Development Case Study

Nenad Petrovic, Yurui Zhang, Moaad Maaroufi, Kuo-Yi Chao, Lukasz Mazur, Fengjunjie Pan, Vahid Zolfaghari, Alois Knoll

专题命中 其他VLM :multimodal large language model(abstract);分类 cs.AI

Comments Conference paper accepted for IntelliSys2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.02206 2025-03-05 cs.CV 57%

Language-Guided Visual Perception Disentanglement for Image Quality Assessment and Conditional Image Generation

Zhichao Yang, Leida Li, Pengfei Chen, Jinjian Wu, Giuseppe Valenzise

专题命中 其他VLM :vision-language model(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.00908 2025-03-04 eess.IV cs.CV 57%

Patient-Level Anatomy Meets Scanning-Level Physics: Personalized Federated Low-Dose CT Denoising Empowered by Large Language Model

Ziyuan Yang, Yingyu Chen, Zhiwen Wang, Hongming Shan, Yang Chen, Yi Zhang

专题命中 其他VLM :MLLM(abstract);分类 cs.CV

Comments Accepted by CVPR 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.20480 2025-03-03 cs.CV cs.HC 57%

VideoA11y: Method and Dataset for Accessible Video Description

Chaoyu Li, Sid Padmanabhuni, Maryam Cheema, Hasti Seifi, Pooyan Fazli

专题命中 其他VLM :multimodal large language model(abstract);分类 cs.CV

Comments ACM CHI 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.19293 2025-02-28 cs.CV 57%

Pathology Report Generation and Multimodal Representation Learning for Cutaneous Melanocytic Lesions

Ruben T. Lucassen, Sander P. J. Moonemans, Tijn van de Luijtgaarden, Gerben E. Breimer, Willeke A. M. Blokx, Mitko Veta

专题命中 其他VLM :vision-language model(abstract);分类 cs.CV

Comments 11 pages, 2 figures. arXiv admin note: text overlap with arXiv:2502.19285

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.18180 2025-02-28 cs.AI cs.MA 57%

ChatMotion: A Multimodal Multi-Agent for Human Motion Analysis

Lei Li, Sen Jia, Jianhao Wang, Zhaochong An, Jiaang Li, Jenq-Neng Hwang, Serge Belongie

专题命中 其他VLM :multimodal large language model(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.20635 2025-02-26 cs.RO cs.AI 57%

Autonomous Improvement of Instruction Following Skills via Foundation Models

Zhiyuan Zhou, Pranav Atreya, Abraham Lee, Homer Walke, Oier Mees, Sergey Levine

专题命中 其他VLM :vision-language model(abstract);分类 cs.AI

Comments 2024 Conference on Robot Learning (CoRL)

Journal ref Conference on Robot Learning 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.09052 2025-02-25 eess.IV cs.LG 57%

Continual Test-Time Adaptation for Single Image Defocus Deblurring via Causal Siamese Networks

Shuang Cui, Yi Li, Jiangmeng Li, Xiongxin Tang, Bing Su, Fanjiang Xu, Hui Xiong

专题命中 其他VLM :vision-language model(abstract);分类 cs.LG

Journal ref International Journal of Computer Vision 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.15457 2025-02-24 cs.CV 57%

Memory Helps, but Confabulation Misleads: Understanding Streaming Events in Videos with MLLMs

Gengyuan Zhang, Mingcong Ding, Tong Liu, Yao Zhang, Volker Tresp

专题命中 其他VLM :multimodal large language model(abstract);分类 cs.CV

Comments Short paper (5 pages)

详情

展开后加载摘要…

URL PDF HTML 收藏
2408.10575 2025-02-24 cs.CV 57%

MUSE: Mamba is Efficient Multi-scale Learner for Text-video Retrieval

Haoran Tang, Meng Cao, Jinfa Huang, Ruyang Liu, Peng Jin, Ge Li, Xiaodan Liang

专题命中 其他VLM :vision-language model(abstract);分类 cs.CV

Comments Accepted by AAAI 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.13983 2025-02-21 eess.AS cs.AI 57%

Gesture-Aware Zero-Shot Speech Recognition for Patients with Language Disorders

Seungbae Kim, Daeun Lee, Brielle Stark, Jinyoung Han

专题命中 其他VLM :multimodal large language model(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.12081 2025-02-18 cs.CV cs.CL 57%

Unhackable Temporal Rewarding for Scalable Video MLLMs

En Yu, Kangheng Lin, Liang Zhao, Yana Wei, Zining Zhu, Haoran Wei, Jianjian Sun, Zheng Ge, Xiangyu Zhang, Jingyu Wang, Wenbing Tao

专题命中 其他VLM :MLLM(abstract);分类 cs.CV

Comments Accepted by ICLR2025. Project Page: https://ahnsun.github.io/UTR/

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.03635 2025-02-14 cs.CV 57%

SSP-IR: Semantic and Structure Priors for Diffusion-based Realistic Image Restoration

Yuhong Zhang, Hengsheng Zhang, Zhengxue Cheng, Rong Xie, Li Song, Wenjun Zhang

专题命中 其他VLM :multimodal large language model(abstract);分类 cs.CV

Comments To be published in IEEE TCSVT

Journal ref Y. Zhang, H. Zhang, Z. Cheng, R. Xie, L. Song and W. Zhang, "SSP-IR: Semantic and Structure Priors for Diffusion-based Realistic Image Restoration," in IEEE Transactions on Circuits and Systems for Video Technology, 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.11619 2025-02-11 cs.CV cs.CL 57%

MultiVENT 2.0: A Massive Multilingual Benchmark for Event-Centric Video Retrieval

Reno Kriz, Kate Sanders, David Etter, Kenton Murray, Cameron Carpenter, Kelly Van Ochten, Hannah Recknor, Jimena Guallar-Blasco, Alexander Martin, Ronald Colaianni, Nolan King, Eugene Yang, Benjamin Van Durme

专题命中 其他VLM :vision-language model(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.00426 2025-02-11 cs.CV 57%

TEST-V: TEst-time Support-set Tuning for Zero-shot Video Classification

Rui Yan, Jin Wang, Hongyu Qu, Xiaoyu Du, Dong Zhang, Jinhui Tang, Tieniu Tan

专题命中 其他VLM :vision language model(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2408.13257 2025-02-06 cs.CV 57%

MME-RealWorld: Could Your Multimodal LLM Challenge High-Resolution Real-World Scenarios that are Difficult for Humans?

Yi-Fan Zhang, Huanyu Zhang, Haochen Tian, Chaoyou Fu, Shuangqing Zhang, Junfei Wu, Feng Li, Kun Wang, Qingsong Wen, Zhang Zhang, Liang Wang, Rong Jin, Tieniu Tan

专题命中 其他VLM :multimodal large language model(abstract);分类 cs.CV

Comments Project Page: https://mme-realworld.github.io/; accepted by ICLR 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2408.11449 2025-02-04 cs.AI 57%

Enabling Small Models for Zero-Shot Selection and Reuse through Model Label Learning

Jia Zhang, Zhi Zhou, Lan-Zhe Guo, Yu-Feng Li

专题命中 其他VLM :vision-language model(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.16153 2025-01-28 cs.CL cs.CV 57%

Pangea: A Fully Open Multilingual Multimodal LLM for 39 Languages

Xiang Yue, Yueqi Song, Akari Asai, Seungone Kim, Jean de Dieu Nyandwi, Simran Khanuja, Anjali Kantharuban, Lintang Sutawika, Sathyanarayanan Ramamoorthy, Graham Neubig

专题命中 其他VLM :multimodal large language model(abstract);分类 cs.CV

Comments 54 pages, 27 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.05728 2025-01-17 cs.CV 57%

Super-class guided Transformer for Zero-Shot Attribute Classification

Sehyung Kim, Chanhyeong Yang, Jihwan Park, Taehoon Song, Hyunwoo J. Kim

专题命中 其他VLM :vision-language model(abstract);分类 cs.CV

Comments AAAI25

详情

展开后加载摘要…

URL PDF HTML 收藏
2308.07898 2025-01-16 cs.CV 57%

A Foundation Language-Image Model of the Retina (FLAIR): Encoding Expert Knowledge in Text Supervision

Julio Silva-Rodríguez, Hadi Chakor, Riadh Kobbi, Jose Dolz, Ismail Ben Ayed

专题命中 其他VLM :vision-language model(abstract);分类 cs.CV

Comments Accepted in Medical Image Analysis. The pre-trained model is available at: https://github.com/jusiro/FLAIR

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.05884 2025-01-13 cs.CV 57%

Text-to-Edit: Controllable End-to-End Video Ad Creation via Multimodal LLMs

Dabing Cheng, Haosen Zhan, Xingchen Zhao, Guisheng Liu, Zemin Li, Jinghui Xie, Zhao Song, Weiguo Feng, Bingyue Peng

专题命中 其他VLM :multimodal large language model(abstract);分类 cs.CV

Comments 16pages conference

详情

展开后加载摘要…

URL PDF HTML 收藏