arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视觉大模型 / VLM

视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。

共收录 7348 信号源:cs.CV, cs.AI, cs.LG

1. 视觉定位与Grounding 7348 篇

2501.15795 2025-01-28 cs.CV 83%

Can Multimodal Large Language Models be Guided to Improve Industrial Anomaly Detection?

Zhiling Chen, Hanning Chen, Mohsen Imani, Farhad Imani

专题命中 视觉定位与Grounding :multimodal large language model(title,abstract);MLLM(abstract);分类 cs.CV

Comments 16 pages, 11 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.11485 2025-01-22 cs.CV 83%

SimLabel: Consistency-Guided OOD Detection with Pretrained Vision-Language Models

Shu Zou, Xinyu Tian, Qinyu Zhao, Zhaoyuan Yang, Jing Zhang

专题命中 视觉定位与Grounding :vision-language model(title,abstract);VLM(abstract);分类 cs.CV

Comments 10 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.07972 2025-01-15 cs.MM cs.CV 83%

Zero-shot Video Moment Retrieval via Off-the-shelf Multimodal Large Language Models

Yifang Xu, Yunzhuo Sun, Benxiang Zhai, Ming Li, Wenxin Liang, Yang Li, Sidan Du

专题命中 视觉定位与Grounding :multimodal large language model(title,abstract);MLLM(abstract);分类 cs.CV

Comments Accepted by AAAI 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.01767 2025-01-09 cs.CV 83%

LogicAD: Explainable Anomaly Detection via VLM-based Text Feature Extraction

Er Jin, Qihui Feng, Yongli Mou, Stefan Decker, Gerhard Lakemeyer, Oliver Simons, Johannes Stegmaier

专题命中 视觉定位与Grounding :VLM(title);vision language model(abstract);visual reasoning(abstract);分类 cs.CV

Comments Accepted for publication at aaai25, project page: https://jasonjin34.github.io/logicad.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.23904 2024-12-20 cs.CV 83%

EZ-HOI: VLM Adaptation via Guided Prompt Learning for Zero-Shot HOI Detection

Qinqian Lei, Bo Wang, Robby T. Tan

专题命中 视觉定位与Grounding :VLM(title,abstract);vision-language model(abstract);分类 cs.CV

Comments Accepted by NeurIPS 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.12492 2024-12-18 cs.CV 83%

DuSSS: Dual Semantic Similarity-Supervised Vision-Language Model for Semi-Supervised Medical Image Segmentation

Qingtao Pan, Wenhao Qiao, Jingjiao Lou, Bing Ji, Shuo Li

专题命中 视觉定位与Grounding :vision-language model(title,abstract);VLM(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.01756 2024-12-17 cs.CV 83%

ChatTracker: Enhancing Visual Tracking Performance via Chatting with Multimodal Large Language Model

Yiming Sun, Fan Yu, Shaoxiang Chen, Yu Zhang, Junwei Huang, Chenhui Li, Yang Li, Changbo Wang

专题命中 视觉定位与Grounding :multimodal large language model(title,abstract);MLLM(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.16278 2024-12-10 cs.CV 83%

Adapting Vision-Language Model with Fine-grained Semantics for Open-Vocabulary Segmentation

Yong Xien Chng, Xuchong Qiu, Yizeng Han, Kai Ding, Wan Ding, Gao Huang

专题命中 视觉定位与Grounding :vision-language model(title,abstract);VLM(abstract);分类 cs.CV

Comments 13 pages, 10 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.11362 2024-11-19 cs.CV cs.CL 83%

MAIRA-Seg: Enhancing Radiology Report Generation with Segmentation-Aware Multimodal Large Language Models

Harshita Sharma, Valentina Salvatelli, Shaury Srivastav, Kenza Bouzid, Shruthi Bannur, Daniel C. Castro, Maximilian Ilse, Sam Bond-Taylor, Mercy Prasanna Ranjit, Fabian Falck, Fernando Pérez-García, Anton Schwaighofer, Hannah Richardson, Maria Teodora Wetscherek, Stephanie L. Hyland, Javier Alvarez-Valle

专题命中 视觉定位与Grounding :multimodal large language model(title,abstract);MLLM(abstract);分类 cs.CV

Comments Accepted as Proceedings Paper at ML4H 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.10922 2024-11-19 cs.CV 83%

Exploiting VLM Localizability and Semantics for Open Vocabulary Action Detection

Wentao Bao, Kai Li, Yuxiao Chen, Deep Patel, Martin Renqiang Min, Yu Kong

专题命中 视觉定位与Grounding :VLM(title,abstract);vision-language model(abstract);分类 cs.CV

Comments WACV 2025 Accepted

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.24148 2024-11-01 cs.CV 83%

Exploring Vision Language Models for Facial Attribute Recognition: Emotion, Race, Gender, and Age

Nouar AlDahoul, Myles Joshua Toledo Tan, Harishwar Reddy Kasireddy, Yasir Zaki

专题命中 视觉定位与Grounding :vision language model(title,abstract);LLaVA(abstract);分类 cs.CV

Comments 52 pages, 13 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.08021 2024-10-28 cs.CV 83%

OneRef: Unified One-tower Expression Grounding and Segmentation with Mask Referring Modeling

Linhui Xiao, Xiaoshan Yang, Fang Peng, Yaowei Wang, Changsheng Xu

专题命中 视觉定位与Grounding :grounding(title,abstract);visual language model(abstract);分类 cs.CV

Comments Accepted by NeurIPS 2024. The project page: https://github.com/linhuixiao/OneRef

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.11404 2024-10-16 cs.CV 83%

MoChat: Joints-Grouped Spatio-Temporal Grounding LLM for Multi-Turn Motion Comprehension and Description

Jiawei Mo, Yixuan Chen, Rifen Lin, Yongkang Ni, Min Zeng, Xiping Hu, Min Li

专题命中 视觉定位与Grounding :grounding(title,abstract);multimodal large language model(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.18722 2024-10-15 cs.RO cs.CV 83%

Towards Open-World Grasping with Large Vision-Language Models

Georgios Tziafas, Hamidreza Kasaei

专题命中 视觉定位与Grounding :vision-language model(title,abstract);grounding(abstract);分类 cs.CV

Comments 8th Conference on Robot Learning (CoRL 2024), Munich, Germany

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.03054 2024-10-07 cs.CV cs.RO 83%

CLIP-Clique: Graph-based Correspondence Matching Augmented by Vision Language Models for Object-based Global Localization

Shigemichi Matsuzaki, Kazuhito Tanaka, Kazuhiro Shintani

专题命中 视觉定位与Grounding :vision language model(title,abstract);VLM(abstract);分类 cs.CV

Comments IEEE Robotics and Automation Letters

详情

展开后加载摘要…

URL PDF HTML 收藏
2307.00329 2024-09-17 cs.RO cs.AI 83%

DoReMi: Grounding Language Model by Detecting and Recovering from Plan-Execution Misalignment

Yanjiang Guo, Yen-Jen Wang, Lihan Zha, Jianyu Chen

专题命中 视觉定位与Grounding :grounding(title,abstract);vision language model(abstract);分类 cs.AI

Comments Published in IROS 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.06210 2024-09-11 cs.CV 83%

INTRA: Interaction Relationship-aware Weakly Supervised Affordance Grounding

Ji Ha Jang, Hoigi Seo, Se Young Chun

专题命中 视觉定位与Grounding :grounding(title,abstract);vision-language model(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2403.08108 2024-09-09 cs.CV 83%

TaskCLIP: Extend Large Vision-Language Model for Task Oriented Object Detection

Hanning Chen, Wenjun Huang, Yang Ni, Sanggeon Yun, Yezi Liu, Fei Wen, Alvaro Velasquez, Hugo Latapie, Mohsen Imani

专题命中 视觉定位与Grounding :vision-language model(title,abstract);VLM(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2408.16500 2024-08-30 cs.CV 83%

CogVLM2: Visual Language Models for Image and Video Understanding

Wenyi Hong, Weihan Wang, Ming Ding, Wenmeng Yu, Qingsong Lv, Yan Wang, Yean Cheng, Shiyu Huang, Junhui Ji, Zhao Xue, Lei Zhao, Zhuoyi Yang, Xiaotao Gu, Xiaohan Zhang, Guanyu Feng, Da Yin, Zihan Wang, Ji Qi, Xixuan Song, Peng Zhang, Debing Liu, Bin Xu, Juanzi Li, Yuxiao Dong, Jie Tang

专题命中 视觉定位与Grounding :visual language model(title,abstract);grounding(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2408.16219 2024-08-30 cs.CV 83%

Training-free Video Temporal Grounding using Large-scale Pre-trained Models

Minghang Zheng, Xinhao Cai, Qingchao Chen, Yuxin Peng, Yang Liu

专题命中 视觉定位与Grounding :grounding(title,abstract);visual language model(abstract);分类 cs.CV

Comments Accepted by ECCV 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2403.15952 2024-08-12 cs.CV cs.CL 83%

IllusionVQA: A Challenging Optical Illusion Dataset for Vision Language Models

Haz Sameen Shahgir, Khondker Salman Sayeed, Abhik Bhattacharjee, Wasi Uddin Ahmad, Yue Dong, Rifat Shahriyar

专题命中 视觉定位与Grounding :vision language model(title,abstract);VLM(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.14563 2024-07-23 cs.CV 83%

Learning Visual Grounding from Generative Vision and Language Model

Shijie Wang, Dahun Kim, Ali Taalimi, Chen Sun, Weicheng Kuo

专题命中 视觉定位与Grounding :grounding(title,abstract);VLM(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2403.16528 2024-07-22 cs.CV 83%

Open-Set Recognition in the Age of Vision-Language Models

Dimity Miller, Niko Sünderhauf, Alex Kenna, Keita Mason

专题命中 视觉定位与Grounding :vision-language model(title,abstract);VLM(abstract);分类 cs.CV

Comments 29 pages, Accepted for publication in ECCV 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.13898 2024-06-21 cs.CV cs.CL cs.CY 83%

The Use of Multimodal Large Language Models to Detect Objects from Thermal Images: Transportation Applications

Huthaifa I. Ashqar, Taqwa I. Alhadidi, Mohammed Elhenawy, Nour O. Khanfar

专题命中 视觉定位与Grounding :multimodal large language model(title,abstract);MLLM(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2312.04016 2024-04-17 cs.CV 83%

PartDistill: 3D Shape Part Segmentation by Vision-Language Model Distillation

Ardian Umam, Cheng-Kun Yang, Min-Hung Chen, Jen-Hui Chuang, Yen-Yu Lin

专题命中 视觉定位与Grounding :vision-language model(title,abstract);VLM(abstract);分类 cs.CV

Comments CVPR 2024 Accepted

详情

展开后加载摘要…

URL PDF HTML 收藏
2311.02612 2024-04-17 cs.CV 83%

GPT-4V-AD: Exploring Grounding Potential of VQA-oriented GPT-4V for Zero-shot Anomaly Detection

Jiangning Zhang, Haoyang He, Xuhai Chen, Zhucun Xue, Yabiao Wang, Chengjie Wang, Lei Xie, Yong Liu

专题命中 视觉定位与Grounding :grounding(title,abstract);visual question answering(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2404.05955 2024-04-10 cs.CL cs.AI 83%

VisualWebBench: How Far Have Multimodal LLMs Evolved in Web Page Understanding and Grounding?

Junpeng Liu, Yifan Song, Bill Yuchen Lin, Wai Lam, Graham Neubig, Yuanzhi Li, Xiang Yue

专题命中 视觉定位与Grounding :grounding(title,abstract);multimodal large language model(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2404.00419 2024-04-02 cs.CV cs.CL 83%

Do Vision-Language Models Understand Compound Nouns?

Sonal Kumar, Sreyan Ghosh, S Sakshi, Utkarsh Tyagi, Dinesh Manocha

专题命中 视觉定位与Grounding :vision-language model(title,abstract);VLM(abstract);分类 cs.CV

Comments Accepted to NAACL 2024 Main Conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2401.07764 2024-02-20 cs.AI cs.NI 83%

When Large Language Model Agents Meet 6G Networks: Perception, Grounding, and Alignment

Minrui Xu, Dusit Niyato, Jiawen Kang, Zehui Xiong, Shiwen Mao, Zhu Han, Dong In Kim, Khaled B. Letaief

专题命中 视觉定位与Grounding :grounding(title,abstract);multimodal large language model(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2401.07803 2024-02-16 cs.CV 83%

Uncovering the Full Potential of Visual Grounding Methods in VQA

Daniel Reich, Tanja Schultz

专题命中 视觉定位与Grounding :grounding(title,abstract);visual question answering(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏