arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视觉大模型 / VLM

视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。

共收录 7360 信号源:cs.CV, cs.AI, cs.LG

1. 视觉定位与Grounding 7360 篇

2501.17654 2025-01-30 cs.CL cs.AI 79%

Exploring Vision Language Models for Multimodal and Multilingual Stance Detection

Jake Vasilakes, Carolina Scarton, Zhixue Zhao

专题命中 视觉定位与Grounding :vision language model(title);vision-language model(abstract);分类 cs.AI

Comments Submitted to the International AAAI Conference on Web and Social Media (ICWSM) 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.13925 2025-01-24 cs.CV 79%

GeoPixel: Pixel Grounding Large Multimodal Model in Remote Sensing

Akashah Shabbir, Mohammed Zumri, Mohammed Bennamoun, Fahad S. Khan, Salman Khan

专题命中 视觉定位与Grounding :grounding(title,abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.09428 2025-01-17 cs.CV 79%

AugRefer: Advancing 3D Visual Grounding via Cross-Modal Augmentation and Spatial Relation-based Referring

Xinyi Wang, Na Zhao, Zhiyuan Han, Dan Guo, Xun Yang

专题命中 视觉定位与Grounding :grounding(title,abstract);分类 cs.CV

Comments AAAI 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.04693 2025-01-16 cs.RO cs.AI 79%

Beyond Sight: Finetuning Generalist Robot Policies with Heterogeneous Sensors via Language Grounding

Joshua Jones, Oier Mees, Carmelo Sferrazza, Kyle Stachowicz, Pieter Abbeel, Sergey Levine

专题命中 视觉定位与Grounding :grounding(title,abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.06746 2025-01-15 cs.CV 79%

Diversified Augmentation with Domain Adaptation for Debiased Video Temporal Grounding

Junlong Ren, Gangjian Zhang, Haifeng Sun, Hao Wang

专题命中 视觉定位与Grounding :grounding(title,abstract);分类 cs.CV

Comments Accepted by ICASSP 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.07396 2025-01-14 cs.CV 79%

Zero-Shot Scene Understanding for Automatic Target Recognition Using Large Vision-Language Models

Yasiru Ranasinghe, Vibashan VS, James Uplinger, Celso De Melo, Vishal M. Patel

专题命中 视觉定位与Grounding :vision-language model(title,abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.05228 2025-01-10 cs.CV 79%

Harnessing Large Language and Vision-Language Models for Robust Out-of-Distribution Detection

Pei-Kang Lee, Jun-Cheng Chen, Ja-Ling Wu

专题命中 视觉定位与Grounding :vision-language model(title,abstract);分类 cs.CV

Comments 9 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.01416 2025-01-03 cs.CV 79%

Hierarchical Alignment-enhanced Adaptive Grounding Network for Generalized Referring Expression Comprehension

Yaxian Wang, Henghui Ding, Shuting He, Xudong Jiang, Bifan Wei, Jun Liu

专题命中 视觉定位与Grounding :grounding(title,abstract);分类 cs.CV

Comments AAAI 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.20059 2024-12-31 cs.CV 79%

AI-based Wearable Vision Assistance System for the Visually Impaired: Integrating Real-Time Object Recognition and Contextual Understanding Using Large Vision-Language Models

Mirza Samad Ahmed Baig, Syeda Anshrah Gillani, Shahid Munir Shah, Mahmoud Aljawarneh, Abdul Akbar Khan, Muhammad Hamzah Siddiqui

专题命中 视觉定位与Grounding :vision-language model(title);vision language model(abstract);分类 cs.CV

Comments N-A

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.16723 2024-12-24 cs.CV 79%

Divide and Conquer: Grounding a Bleeding Areas in Gastrointestinal Image with Two-Stage Model

Yu-Fan Lin, Bo-Cheng Qiu, Chia-Ming Lee, Chih-Chung Hsu

专题命中 视觉定位与Grounding :grounding(title,abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.07870 2024-12-23 cs.CL cs.AI 79%

Trustful LLMs: Customizing and Grounding Text Generation with Knowledge Bases and Dual Decoders

Xiaofeng Zhu, Jaya Krishna Mandivarapu

专题命中 视觉定位与Grounding :grounding(title,abstract);分类 cs.AI

Journal ref EMNLP CustomNLP4U 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.22306 2024-12-23 cs.CV 79%

Multi-Object 3D Grounding with Dynamic Modules and Language-Informed Spatial Attention

Haomeng Zhang, Chiao-An Yang, Raymond A. Yeh

专题命中 视觉定位与Grounding :grounding(title,abstract);分类 cs.CV

Comments NeurIPS 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.00143 2024-12-20 cs.CV 79%

Diversifying Query: Region-Guided Transformer for Temporal Sentence Grounding

Xiaolong Sun, Liushuai Shi, Le Wang, Sanping Zhou, Kun Xia, Yabing Wang, Gang Hua

专题命中 视觉定位与Grounding :grounding(title,abstract);分类 cs.CV

Comments Accepted by AAAI-25. Code is available at https://github.com/TensorsSun/RGTR

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.04925 2024-12-09 cs.CV 79%

$S^3$: Synonymous Semantic Space for Improving Zero-Shot Generalization of Vision-Language Models

Xiaojie Yin, Qilong Wang, Bing Cao, Qinghua Hu

专题命中 视觉定位与Grounding :vision-language model(title,abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.00890 2024-12-03 cs.CV 79%

Exploring Large Vision-Language Models for Robust and Efficient Industrial Anomaly Detection

Kun Qian, Tianyu Sun, Wenhong Wang

专题命中 视觉定位与Grounding :vision-language model(title,abstract);分类 cs.CV

Comments 14 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.12066 2024-12-03 cs.CV 79%

Temporally Grounding Instructional Diagrams in Unconstrained Videos

Jiahao Zhang, Frederic Z. Zhang, Cristian Rodriguez, Yizhak Ben-Shabat, Anoop Cherian, Stephen Gould

专题命中 视觉定位与Grounding :grounding(title,abstract);分类 cs.CV

Comments Accepted to WACV'25

详情

展开后加载摘要…

URL PDF HTML 收藏
2403.03077 2024-12-03 cs.CV 79%

MiKASA: Multi-Key-Anchor & Scene-Aware Transformer for 3D Visual Grounding

Chun-Peng Chang, Shaoxiang Wang, Alain Pagani, Didier Stricker

专题命中 视觉定位与Grounding :grounding(title,abstract);分类 cs.CV

Comments CVPR 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.19220 2024-12-02 cs.CV cs.MM 79%

Automatic Prompt Generation and Grounding Object Detection for Zero-Shot Image Anomaly Detection

Tsun-Hin Cheung, Ka-Chun Fung, Songjiang Lai, Kwan-Ho Lin, Vincent Ng, Kin-Man Lam

专题命中 视觉定位与Grounding :grounding(title,abstract);分类 cs.CV

Comments Accepted to APSIPA ASC 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.01400 2024-12-02 cs.CV 79%

GalLoP: Learning Global and Local Prompts for Vision-Language Models

Marc Lafon, Elias Ramzi, Clément Rambour, Nicolas Audebert, Nicolas Thome

专题命中 视觉定位与Grounding :vision-language model(title,abstract);分类 cs.CV

Journal ref The 18th European Conference on Computer Vision ECCV 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.17481 2024-11-27 cs.CV 79%

Dual-task Mutual Reinforcing Embedded Joint Video Paragraph Retrieval and Grounding

Mengzhao Wang, Huafeng Li, Yafei Zhang, Jinxing Li, Minghong Xie, Dapeng Tao

专题命中 视觉定位与Grounding :grounding(title,abstract);分类 cs.CV

Comments This work has been accepted with mandatory minor revisions by TMM

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.16932 2024-11-27 cs.CV 79%

Seq2Time: Sequential Knowledge Transfer for Video LLM Temporal Grounding

Andong Deng, Zhongpai Gao, Anwesa Choudhuri, Benjamin Planche, Meng Zheng, Bin Wang, Terrence Chen, Chen Chen, Ziyan Wu

专题命中 视觉定位与Grounding :grounding(title,abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2305.08685 2024-11-20 cs.CV 79%

CLIP-VG: Self-paced Curriculum Adapting of CLIP for Visual Grounding

Linhui Xiao, Xiaoshan Yang, Fang Peng, Ming Yan, Yaowei Wang, Changsheng Xu

专题命中 视觉定位与Grounding :grounding(title,abstract);分类 cs.CV

Comments Accepted by IEEE Transaction on Multimedia (2023), Paper page: https://ieeexplore.ieee.org/abstract/document/10269126. Code are available at https://github.com/linhuixiao/CLIP-VG

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.07945 2024-11-13 cs.CV 79%

SimBase: A Simple Baseline for Temporal Video Grounding

Peijun Bao, Alex C. Kot

专题命中 视觉定位与Grounding :grounding(title,abstract);分类 cs.CV

Comments Technical report

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.02742 2024-11-13 cs.CL cs.LG cs.RO 79%

Grounding Large Language Models In Embodied Environment With Imperfect World Models

Haolan Liu, Jishen Zhao

专题命中 视觉定位与Grounding :grounding(title,abstract);分类 cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.03409 2024-11-07 cs.RO cs.AI 79%

STEER: Flexible Robotic Manipulation via Dense Language Grounding

Laura Smith, Alex Irpan, Montserrat Gonzalez Arenas, Sean Kirmani, Dmitry Kalashnikov, Dhruv Shah, Ted Xiao

专题命中 视觉定位与Grounding :grounding(title);vision-language model(abstract);分类 cs.AI

Comments Project website: https://lauramsmith.github.io/steer/

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.03405 2024-11-07 cs.CV 79%

Fine-Grained Spatial and Verbal Losses for 3D Visual Grounding

Sombit Dey, Ozan Unal, Christos Sakaridis, Luc Van Gool

专题命中 视觉定位与Grounding :grounding(title,abstract);分类 cs.CV

Comments Accepted at WACV 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.00881 2024-11-05 cs.CV 79%

Technical Report for SoccerNet Challenge 2022 -- Replay Grounding Task

Shimin Chen, Wei Li, Jiaming Chu, Chen Chen, Chen Zhang, Yandong Guo

专题命中 视觉定位与Grounding :grounding(title,abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.20474 2024-11-04 cs.CV 79%

GrounDiT: Grounding Diffusion Transformers via Noisy Patch Transplantation

Phillip Y. Lee, Taehoon Yoon, Minhyuk Sung

专题命中 视觉定位与Grounding :grounding(title,abstract);分类 cs.CV

Comments Accepted to NeurIPS 2024. Project Page: https://groundit-diffusion.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.23570 2024-11-01 cs.CV 79%

Phrase Decoupling Cross-Modal Hierarchical Matching and Progressive Position Correction for Visual Grounding

Minghong Xie, Mengzhao Wang, Huafeng Li, Yafei Zhang, Dapeng Tao, Zhengtao Yu

专题命中 视觉定位与Grounding :grounding(title,abstract);分类 cs.CV

Comments This work has been accepted by TMM

详情

展开后加载摘要…

URL PDF HTML 收藏
2403.19137 2024-11-01 cs.CV 79%

CLAP4CLIP: Continual Learning with Probabilistic Finetuning for Vision-Language Models

Saurav Jha, Dong Gong, Lina Yao

专题命中 视觉定位与Grounding :vision-language model(title,abstract);分类 cs.CV

Comments Accepted as a poster at NeurIPS 2024

详情

展开后加载摘要…

URL PDF HTML 收藏