arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视觉大模型 / VLM

视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。

共收录 7314 信号源:cs.CV, cs.AI, cs.LG

1. 视觉定位与Grounding 7314 篇

2506.10415 2025-06-13 cs.CL cs.CV 83%

Burn After Reading: Do Multimodal Large Language Models Truly Capture Order of Events in Image Sequences?

Yingjin Song, Yupei Du, Denis Paperno, Albert Gatt

机构 * Utrecht University(乌特雷赫大学)

专题命中 视觉定位与Grounding :multimodal large language model(title,abstract);grounding(abstract);分类 cs.CV

Comments 27 pages, 14 figures. Accepted to ACL 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.08466 2025-06-10 cs.CV 83%

Weakly Supervised Temporal Action Localization via Dual-Prior Collaborative Learning Guided by Multimodal Large Language Models

Quan Zhang, Jinwei Fang, Rui Yuan, Xi Tang, Yuxin Qi, Ke Zhang, Chun Yuan

机构 * Tsinghua University(清华大学) University of Science and Technology of China(中国科学技术大学) Shanghai Jiao Tong University(上海交通大学)

专题命中 视觉定位与Grounding :multimodal large language model(title,abstract);MLLM(abstract);分类 cs.CV

Comments Accepted to CVPR

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.04383 2025-05-30 cs.CV cs.RO 83%

SeeGround: See and Ground for Zero-Shot Open-Vocabulary 3D Visual Grounding

Rong Li, Shijie Li, Lingdong Kong, Xulei Yang, Junwei Liang

机构 * HKUST(GZ)(香港科技大学(广州)) I 2 R, A*STAR(I2R, A*STAR) National University of Singapore(新加坡国立大学) CSE, HKUST(香港科技大学计算机科学与工程系)

专题命中 视觉定位与Grounding :grounding(title,abstract);vision-language model(abstract);分类 cs.CV

Comments CVPR 2025; 21 pages, 10 figures, 10 tables; Code at https://seeground.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.02013 2025-05-06 cs.CV 83%

MLLM-Enhanced Face Forgery Detection: A Vision-Language Fusion Solution

Siran Peng, Zipei Wang, Li Gao, Xiangyu Zhu, Tianshuo Zhang, Ajian Liu, Haoyuan Zhang, Zhen Lei

机构 * CASIA UCAS CMCC CAIR, HKISI, CAS

专题命中 视觉定位与Grounding :MLLM(title,abstract);multimodal large language model(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.20419 2025-04-30 cs.CV 83%

Plant Disease Detection through Multimodal Large Language Models and Convolutional Neural Networks

Konstantinos I. Roumeliotis, Ranjan Sapkota, Manoj Karkee, Nikolaos D. Tselikas, Dimitrios K. Nasiopoulos

专题命中 视觉定位与Grounding :multimodal large language model(title,abstract);vision language model(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2402.04178 2025-04-22 cs.CV 83%

SHIELD : An Evaluation Benchmark for Face Spoofing and Forgery Detection with Multimodal Large Language Models

Yichen Shi, Yuhao Gao, Yingxin Lai, Hongyang Wang, Jun Feng, Lei He, Jun Wan, Changsheng Chen, Zitong Yu, Xiaochun Cao

机构 * School of Electronic Information and Electrical Engineering, Shanghai Jiao Tong University(上海交通大学电子信息与电气工程学院) Department of Artificial Intelligence, Xiamen University(厦门大学人工智能系) School of Information Science and Technology, Shijiazhuang Tiedao University(石家庄铁道大学信息科学与技术学院) Electrical Engineering Department, UCLA(加州大学洛杉矶分校电子工程系) New Laboratory of Pattern Recognition(NLPR), Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所模式识别新实验室) College of Electronics and Information Engineering, Shenzhen University(深圳大学电子与信息工程学院) School of Computing and Information Technology, Great Bay University(广东东莞Great Bay大学计算与信息科技学院) School of Cyber Science and Technology, Shenzhen Campus of Sun Yat-sen University(中山大学深圳校区网络科学与技术学院)

专题命中 视觉定位与Grounding :multimodal large language model(title,abstract);MLLM(abstract);分类 cs.CV

Comments Accepted by Visual Intelligence

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.10642 2025-04-16 cs.CV 83%

SilVar-Med: A Speech-Driven Visual Language Model for Explainable Abnormality Detection in Medical Imaging

Tan-Hanh Pham, Chris Ngo, Trong-Duong Bui, Minh Luu Quang, Tan-Huong Pham, Truong-Son Hy

专题命中 视觉定位与Grounding :visual language model(title,abstract);VLM(abstract);分类 cs.CV

Comments CVPR Multimodal Algorithmic Reasoning Workshop 2025 - SilVarMed

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.10320 2025-04-15 cs.CV 83%

SlowFastVAD: Video Anomaly Detection via Integrating Simple Detector and RAG-Enhanced Vision-Language Model

Zongcan Ding, Haodong Zhang, Peng Wu, Guansong Pang, Zhiwei Yang, Peng Wang, Yanning Zhang

专题命中 视觉定位与Grounding :vision-language model(title,abstract);VLM(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.02823 2025-04-04 cs.CV eess.IV 83%

STING-BEE: Towards Vision-Language Model for Real-World X-ray Baggage Security Inspection

Divya Velayudhan, Abdelfatah Ahmed, Mohamad Alansari, Neha Gour, Abderaouf Behouch, Taimur Hassan, Syed Talal Wasim, Nabil Maalej, Muzammal Naseer, Juergen Gall, Mohammed Bennamoun, Ernesto Damiani, Naoufel Werghi

专题命中 视觉定位与Grounding :vision-language model(title);visual question answering(abstract);grounding(abstract);分类 cs.CV

Comments Accepted at CVPR 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.01472 2025-04-03 cs.CV 83%

ANNEXE: Unified Analyzing, Answering, and Pixel Grounding for Egocentric Interaction

Yuejiao Su, Yi Wang, Qiongyang Hu, Chuang Yang, Lap-Pui Chau

专题命中 视觉定位与Grounding :grounding(title,abstract);multimodal large language model(abstract);分类 cs.CV

Comments Computer Vision and Pattern Recognition

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.23297 2025-04-01 cs.CV 83%

ReasonGrounder: LVLM-Guided Hierarchical Feature Splatting for Open-Vocabulary 3D Visual Grounding and Reasoning

Zhenyang Liu, Yikai Wang, Sixiao Zheng, Tongying Pan, Longfei Liang, Yanwei Fu, Xiangyang Xue

专题命中 视觉定位与Grounding :grounding(title,abstract);vision-language model(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.10212 2025-03-28 cs.CV 83%

MouseGPT: A Large-scale Vision-Language Model for Mouse Behavior Analysis

Teng Xu, Taotao Zhou, Youjia Wang, Peng Yang, Simin Tang, Kuixiang Shao, Zifeng Tang, Yifei Liu, Xinyuan Chen, Hongshuang Wang, Xiaohui Wang, Huoqing Luo, Jingya Wang, Ji Hu, Jingyi Yu

专题命中 视觉定位与Grounding :vision-language model(title,abstract);VLM(abstract);分类 cs.CV

Comments 53 pages, 5 figures, 7 extended figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.14340 2025-03-26 cs.CV 83%

Zero-shot Action Localization via the Confidence of Large Vision-Language Models

Josiah Aklilu, Xiaohan Wang, Serena Yeung-Levy

专题命中 视觉定位与Grounding :vision-language model(title,abstract);visual question answering(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.17406 2025-03-25 cs.CV cs.RO 83%

IRef-VLA: A Benchmark for Interactive Referential Grounding with Imperfect Language in 3D Scenes

Haochen Zhang, Nader Zantout, Pujith Kachana, Ji Zhang, Wenshan Wang

专题命中 视觉定位与Grounding :grounding(title,abstract);vision-language model(abstract);分类 cs.CV

Comments Accepted to ICRA 2025. Code available at https://github.com/HaochenZ11/IRef-VLA. arXiv admin note: text overlap with arXiv:2411.03540

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.11400 2025-03-17 cs.CV cs.RO 83%

A Framework for a Capability-driven Evaluation of Scenario Understanding for Multimodal Large Language Models in Autonomous Driving

Tin Stribor Sohn, Philipp Reis, Maximilian Dillitzer, Johannes Bach, Jason J. Corso, Eric Sax

专题命中 视觉定位与Grounding :multimodal large language model(title,abstract);grounding(abstract);分类 cs.CV

Comments Submitted to IEEE IAVVC 2025, Under Review

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.11919 2025-03-07 cs.CV 83%

LLM-wrapper: Black-Box Semantic-Aware Adaptation of Vision-Language Models for Referring Expression Comprehension

Amaia Cardiel, Eloi Zablocki, Elias Ramzi, Oriane Siméoni, Matthieu Cord

专题命中 视觉定位与Grounding :vision-language model(title);vision language model(abstract);VLM(abstract);分类 cs.CV

Comments LLM-wrapper (v3) is published as a conference paper at ICLR 2025. (v1 was presented at EVAL-FoMo workshop, ECCV 2024.)

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.01169 2025-03-04 cs.CV 83%

A Zero-Shot Learning Approach for Ephemeral Gully Detection from Remote Sensing using Vision Language Models

Seyed Mohamad Ali Tousi, Ramy Farag, Jacket Demby's, Gbenga Omotara, John A. Lory, G. N. DeSouza

专题命中 视觉定位与Grounding :vision language model(title);vision-language model(abstract);visual language model(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.01020 2025-03-04 cs.CV 83%

Delving into Out-of-Distribution Detection with Medical Vision-Language Models

Lie Ju, Sijin Zhou, Yukun Zhou, Huimin Lu, Zhuoting Zhu, Pearse A. Keane, Zongyuan Ge

专题命中 视觉定位与Grounding :vision-language model(title,abstract);VLM(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.20869 2025-03-03 cs.CV 83%

PathVG: A New Benchmark and Dataset for Pathology Visual Grounding

Chunlin Zhong, Shuang Hao, Junhua Wu, Xiaona Chang, Jiwei Jiang, Xiu Nie, He Tang, Xiang Bai

专题命中 视觉定位与Grounding :grounding(title,abstract);visual question answering(abstract);分类 cs.CV

Comments 10pages, 4figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.13990 2025-02-21 eess.IV cs.LG 83%

Remote Sensing Semantic Segmentation Quality Assessment based on Vision Language Model

Huiying Shi, Zhihong Tan, Zhihan Zhang, Hongchen Wei, Yaosi Hu, Yingxue Zhang, Zhenzhong Chen

专题命中 视觉定位与Grounding :vision language model(title,abstract);VLM(abstract);分类 cs.LG

Comments 16 pages,6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.05240 2025-02-13 cs.CV 83%

Survey on AI-Generated Media Detection: From Non-MLLM to MLLM

Yueying Zou, Peipei Li, Zekun Li, Huaibo Huang, Xing Cui, Xuannan Liu, Chenghanyu Zhang, Ran He

专题命中 视觉定位与Grounding :MLLM(title,abstract);multimodal large language model(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.15795 2025-01-28 cs.CV 83%

Can Multimodal Large Language Models be Guided to Improve Industrial Anomaly Detection?

Zhiling Chen, Hanning Chen, Mohsen Imani, Farhad Imani

专题命中 视觉定位与Grounding :multimodal large language model(title,abstract);MLLM(abstract);分类 cs.CV

Comments 16 pages, 11 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.11485 2025-01-22 cs.CV 83%

SimLabel: Consistency-Guided OOD Detection with Pretrained Vision-Language Models

Shu Zou, Xinyu Tian, Qinyu Zhao, Zhaoyuan Yang, Jing Zhang

专题命中 视觉定位与Grounding :vision-language model(title,abstract);VLM(abstract);分类 cs.CV

Comments 10 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.07972 2025-01-15 cs.MM cs.CV 83%

Zero-shot Video Moment Retrieval via Off-the-shelf Multimodal Large Language Models

Yifang Xu, Yunzhuo Sun, Benxiang Zhai, Ming Li, Wenxin Liang, Yang Li, Sidan Du

专题命中 视觉定位与Grounding :multimodal large language model(title,abstract);MLLM(abstract);分类 cs.CV

Comments Accepted by AAAI 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.01767 2025-01-09 cs.CV 83%

LogicAD: Explainable Anomaly Detection via VLM-based Text Feature Extraction

Er Jin, Qihui Feng, Yongli Mou, Stefan Decker, Gerhard Lakemeyer, Oliver Simons, Johannes Stegmaier

专题命中 视觉定位与Grounding :VLM(title);vision language model(abstract);visual reasoning(abstract);分类 cs.CV

Comments Accepted for publication at aaai25, project page: https://jasonjin34.github.io/logicad.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.23904 2024-12-20 cs.CV 83%

EZ-HOI: VLM Adaptation via Guided Prompt Learning for Zero-Shot HOI Detection

Qinqian Lei, Bo Wang, Robby T. Tan

专题命中 视觉定位与Grounding :VLM(title,abstract);vision-language model(abstract);分类 cs.CV

Comments Accepted by NeurIPS 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.12492 2024-12-18 cs.CV 83%

DuSSS: Dual Semantic Similarity-Supervised Vision-Language Model for Semi-Supervised Medical Image Segmentation

Qingtao Pan, Wenhao Qiao, Jingjiao Lou, Bing Ji, Shuo Li

专题命中 视觉定位与Grounding :vision-language model(title,abstract);VLM(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.01756 2024-12-17 cs.CV 83%

ChatTracker: Enhancing Visual Tracking Performance via Chatting with Multimodal Large Language Model

Yiming Sun, Fan Yu, Shaoxiang Chen, Yu Zhang, Junwei Huang, Chenhui Li, Yang Li, Changbo Wang

专题命中 视觉定位与Grounding :multimodal large language model(title,abstract);MLLM(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.16278 2024-12-10 cs.CV 83%

Adapting Vision-Language Model with Fine-grained Semantics for Open-Vocabulary Segmentation

Yong Xien Chng, Xuchong Qiu, Yizeng Han, Kai Ding, Wan Ding, Gao Huang

专题命中 视觉定位与Grounding :vision-language model(title,abstract);VLM(abstract);分类 cs.CV

Comments 13 pages, 10 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.11362 2024-11-19 cs.CV cs.CL 83%

MAIRA-Seg: Enhancing Radiology Report Generation with Segmentation-Aware Multimodal Large Language Models

Harshita Sharma, Valentina Salvatelli, Shaury Srivastav, Kenza Bouzid, Shruthi Bannur, Daniel C. Castro, Maximilian Ilse, Sam Bond-Taylor, Mercy Prasanna Ranjit, Fabian Falck, Fernando Pérez-García, Anton Schwaighofer, Hannah Richardson, Maria Teodora Wetscherek, Stephanie L. Hyland, Javier Alvarez-Valle

专题命中 视觉定位与Grounding :multimodal large language model(title,abstract);MLLM(abstract);分类 cs.CV

Comments Accepted as Proceedings Paper at ML4H 2024

详情

展开后加载摘要…

URL PDF HTML 收藏