arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视觉大模型 / VLM

视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。

共收录 7348 信号源:cs.CV, cs.AI, cs.LG

1. 视觉定位与Grounding 7348 篇

2507.12739 2025-07-18 cs.CV cs.AI 81%

Transformer-based Spatial Grounding: A Comprehensive Survey

Ijazul Haq, Muhammad Saqib, Yingjie Zhang

机构 * School of Intelligent Manufacturing, South China University of Technology(华南理工大学智能制造学院) Department of Software Engineering, University of Engineering & Technology(工程大学软件工程系)

专题命中 视觉定位与Grounding :grounding(title,abstract);分类 cs.CV、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.01366 2025-07-09 cs.CV cs.AI cs.CL 81%

ViGiL3D: A Linguistically Diverse Dataset for 3D Visual Grounding

Austin T. Wang, ZeMing Gong, Angel X. Chang

机构 * Simon Fraser University(西蒙弗雷泽大学) Alberta Machine Intelligence Institute (Amii)(阿尔伯塔人工智能研究所)

专题命中 视觉定位与Grounding :grounding(title,abstract);分类 cs.CV、cs.AI

Comments 24 pages with 8 figures and 14 tables; updated for ACL 2025 camera-ready with additional discussion and figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.16145 2025-05-29 cs.CV cs.AI 81%

Progressive Language-guided Visual Learning for Multi-Task Visual Grounding

Jingchao Wang, Hong Wang, Wenlong Zhang, Kunhua Ji, Dingjiang Huang, Yefeng Zheng

机构 * East China Normal University(东华大学) Xi’an Jiaotong University(西安交通大学) Shanghai AI Laboratory(上海人工智能实验室) Westlake University(西湖大学)

专题命中 视觉定位与Grounding :grounding(title,abstract);分类 cs.CV、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.16376 2025-05-23 cs.CV cs.AI 81%

DeCafNet: Delegate and Conquer for Efficient Temporal Grounding in Long Videos

Zijia Lu, A S M Iftekhar, Gaurav Mittal, Tianjian Meng, Xiawei Wang, Cheng Zhao, Rohith Kukkala, Ehsan Elhamifar, Mei Chen

机构 * Microsoft(微软公司) Northeastern University(东北大学)

专题命中 视觉定位与Grounding :grounding(title,abstract);分类 cs.CV、cs.AI

Comments Accepted by CVPR 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.15810 2025-05-23 cs.CL cs.AI cs.CV 81%

GUI-G1: Understanding R1-Zero-Like Training for Visual Grounding in GUI Agents

Yuqi Zhou, Sunhao Dai, Shuai Wang, Kaiwen Zhou, Qinglin Jia, Jun Xu

机构 * Gaoling School of Artificial Intelligence, Renmin University of China(中国人民大学 Gallagher人工智能学院) Huawei Noah’s Ark Lab(华为诺亚实验室)

专题命中 视觉定位与Grounding :grounding(title,abstract);分类 cs.CV、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.01031 2025-05-23 cs.CL cs.AI cs.CV 81%

Evaluating Automated Radiology Report Quality through Fine-Grained Phrasal Grounding of Clinical Findings

Razi Mahmood, Pingkun Yan, Diego Machado Reyes, Ge Wang, Mannudeep K. Kalra, Parisa Kaviani, Joy T. Wu, Tanveer Syeda-Mahmood

专题命中 视觉定位与Grounding :grounding(title,abstract);分类 cs.CV、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2403.07887 2025-05-12 cs.CV cs.AI 81%

Neural Slot Interpreters: Grounding Object Semantics in Emergent Slot Representations

Bhishma Dedhia, Niraj K. Jha

机构 * Department of Electrical and Computer Engineering(电气与计算机工程系) Princeton University(普林斯顿大学)

专题命中 视觉定位与Grounding :grounding(title,abstract);分类 cs.CV、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.04270 2025-05-08 cs.CV cs.AI 81%

Object-Shot Enhanced Grounding Network for Egocentric Video

Yisen Feng, Haoyu Zhang, Meng Liu, Weili Guan, Liqiang Nie

机构 * Harbin Institute of Technology (Shenzhen)(哈尔滨工业大学(深圳)) Pengcheng Laboratory(鹏城实验室) Shandong Jianzhu University(山东建筑大学)

专题命中 视觉定位与Grounding :grounding(title,abstract);分类 cs.CV、cs.AI

Comments Accepted by CVPR 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.15539 2025-05-06 cs.CV cs.AI 81%

Large Language Model with Region-guided Referring and Grounding for CT Report Generation

Zhixuan Chen, Yequan Bie, Haibo Jin, Hao Chen

机构 * Hong Kong University of Science and Technology(香港科技大学)

专题命中 视觉定位与Grounding :grounding(title,abstract);分类 cs.CV、cs.AI

Comments 10 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.11686 2025-04-17 cs.CV cs.AI 81%

Can GPT tell us why these images are synthesized? Empowering Multimodal Large Language Models for Forensics

Yiran He, Yun Cao, Bowen Yang, Zeyu Zhang

专题命中 视觉定位与Grounding :multimodal large language model(title,abstract);分类 cs.CV、cs.AI

Comments 12 pages, 11 figures, 13IHMMSec2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.09623 2025-04-15 cs.CV cs.AI cs.MM 81%

Ges3ViG: Incorporating Pointing Gestures into Language-Based 3D Visual Grounding for Embodied Reference Understanding

Atharv Mahesh Mane, Dulanga Weerakoon, Vigneshwaran Subbaraju, Sougata Sen, Sanjay E. Sarma, Archan Misra

专题命中 视觉定位与Grounding :grounding(title,abstract);分类 cs.CV、cs.AI

Comments Accepted to the IEEE/CVF Conference on Computer Vision and Pattern Recognition (CVPR) 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.19626 2025-04-01 cs.CV cs.AI 81%

GREAT: Geometry-Intention Collaborative Inference for Open-Vocabulary 3D Object Affordance Grounding

Yawen Shao, Wei Zhai, Yuhang Yang, Hongchen Luo, Yang Cao, Zheng-Jun Zha

专题命中 视觉定位与Grounding :grounding(title,abstract);分类 cs.CV、cs.AI

Comments CVPR 2025. Project page: https://yawen-shao.github.io/GREAT/ Code: https://github.com/yawen-shao/GREAT_code

详情

展开后加载摘要…

URL PDF HTML 收藏
2402.12198 2025-03-25 cs.CL cs.CV cs.LG 81%

Exploring the Limits of Zero Shot Vision Language Models for Hate Meme Detection: The Vulnerabilities and their Interpretations

Naquee Rizwan, Paramananda Bhaskar, Mithun Das, Swadhin Satyaprakash Majhi, Punyajoy Saha, Animesh Mukherjee

专题命中 视觉定位与Grounding :vision language model(title,abstract);分类 cs.CV、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.10392 2025-03-12 cs.CV cs.LG 81%

TSP3D: Text-guided Sparse Voxel Pruning for Efficient 3D Visual Grounding

Wenxuan Guo, Xiuwei Xu, Ziwei Wang, Jianjiang Feng, Jie Zhou, Jiwen Lu

专题命中 视觉定位与Grounding :grounding(title,abstract);分类 cs.CV、cs.LG

Comments Accepted at CVPR2025 with a top score

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.06470 2025-03-11 cs.AI cs.CL cs.CV 81%

Think Twice, Click Once: Enhancing GUI Grounding via Fast and Slow Systems

Fei Tang, Yongliang Shen, Hang Zhang, Siqi Chen, Guiyang Hou, Wenqi Zhang, Wenqiao Zhang, Kaitao Song, Weiming Lu, Yueting Zhuang

专题命中 视觉定位与Grounding :grounding(title,abstract);分类 cs.CV、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.09601 2025-03-06 cs.CV cs.AI cs.CL 81%

TimeRefine: Temporal Grounding with Time Refining Video LLM

Xizi Wang, Feng Cheng, Ziyang Wang, Huiyu Wang, Md Mohaiminul Islam, Lorenzo Torresani, Mohit Bansal, Gedas Bertasius, David Crandall

专题命中 视觉定位与Grounding :grounding(title,abstract);分类 cs.CV、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.01037 2025-03-04 cs.CV cs.LG 81%

A Comparison of Object Detection and Phrase Grounding Models in Chest X-ray Abnormality Localization using Eye-tracking Data

Elham Ghelichkhan, Tolga Tasdizen

专题命中 视觉定位与Grounding :grounding(title,abstract);分类 cs.CV、cs.LG

Comments Accepted in 2025 IEEE International Symposium on Biomedical Imaging (ISBI 2025)

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.16618 2025-02-25 cs.CV cs.AI cs.CL 81%

Can Large Vision-Language Models Detect Images Copyright Infringement from GenAI?

Qipan Xu, Zhenting Wang, Xiaoxiao He, Ligong Han, Ruixiang Tang

专题命中 视觉定位与Grounding :vision-language model(title,abstract);分类 cs.CV、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.09453 2025-02-24 cs.AI cs.CV 81%

MMAD: A Comprehensive Benchmark for Multimodal Large Language Models in Industrial Anomaly Detection

Xi Jiang, Jian Li, Hanqiu Deng, Yong Liu, Bin-Bin Gao, Yifeng Zhou, Jialin Li, Chengjie Wang, Feng Zheng

专题命中 视觉定位与Grounding :multimodal large language model(title,abstract);分类 cs.CV、cs.AI

Comments Accepted by ICLR 2025. The code and data are available at https://github.com/jam-cc/MMAD

详情

展开后加载摘要…

URL PDF HTML 收藏
2312.02073 2025-02-18 cs.CL cs.AI cs.LG 81%

A Glitch in the Matrix? Locating and Detecting Language Model Grounding with Fakepedia

Giovanni Monea, Maxime Peyrard, Martin Josifoski, Vishrav Chaudhary, Jason Eisner, Emre Kıcıman, Hamid Palangi, Barun Patra, Robert West

专题命中 视觉定位与Grounding :grounding(title,abstract);分类 cs.AI、cs.LG

Comments Accepted at ACL 2024 (main conference)

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.09194 2025-02-11 cs.CV cs.AI 81%

Grounding Text-to-Image Diffusion Models for Controlled High-Quality Image Generation

Ahmad Süleyman, Göksel Biricik

专题命中 视觉定位与Grounding :grounding(title,abstract);分类 cs.CV、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.14975 2025-02-11 cs.CV cs.AI 81%

Reflexive Guidance: Improving OoDD in Vision-Language Models via Self-Guided Image-Adaptive Concept Generation

Jihyo Kim, Seulbi Lee, Sangheum Hwang

专题命中 视觉定位与Grounding :vision-language model(title,abstract);分类 cs.CV、cs.AI

Comments Accepted at ICLR 2025. The first two authors contributed equally

详情

展开后加载摘要…

URL PDF HTML 收藏
2404.12920 2025-01-31 cs.CV cs.LG 81%

Zero-Shot Medical Phrase Grounding with Off-the-shelf Diffusion Models

Konstantinos Vilouras, Pedro Sanchez, Alison Q. O'Neil, Sotirios A. Tsaftaris

专题命中 视觉定位与Grounding :grounding(title,abstract);分类 cs.CV、cs.LG

Comments 10 pages, 3 figures, IEEE J-BHI Special Issue on Foundation Models in Medical Imaging

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.06710 2025-01-14 cs.CV cs.AI 81%

Multi-task Visual Grounding with Coarse-to-Fine Consistency Constraints

Ming Dai, Jian Li, Jiedong Zhuang, Xian Zhang, Wankou Yang

专题命中 视觉定位与Grounding :grounding(title,abstract);分类 cs.CV、cs.AI

Comments AAAI2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.02699 2025-01-07 cs.CV cs.AI 81%

EAGLE: Enhanced Visual Grounding Minimizes Hallucinations in Instructional Multimodal Models

Andrés Villa, Juan León Alcázar, Motasem Alfarra, Vladimir Araujo, Alvaro Soto, Bernard Ghanem

专题命中 视觉定位与Grounding :grounding(title,abstract);分类 cs.CV、cs.AI

Comments 12 pages, 4 figures, 8 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.20088 2024-12-31 cs.CV cs.AI 81%

An archaeological Catalog Collection Method Based on Large Vision-Language Models

Honglin Pang, Yi Chang, Tianjing Duan, Xi Yang

专题命中 视觉定位与Grounding :vision-language model(title,abstract);分类 cs.CV、cs.AI

Comments 4 pages,4 figures,www source track

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.00465 2024-12-24 cs.CV cs.AI 81%

AgriBench: A Hierarchical Agriculture Benchmark for Multimodal Large Language Models

Yutong Zhou, Masahiro Ryo

专题命中 视觉定位与Grounding :multimodal large language model(title,abstract);分类 cs.CV、cs.AI

Comments Accepted by CVPPA @ECCV2024. Dataset: https://github.com/Yutong-Zhou-cv/AgriBench

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.13441 2024-12-19 cs.CV cs.AI cs.CL 81%

FlashVTG: Feature Layering and Adaptive Score Handling Network for Video Temporal Grounding

Zhuo Cao, Bingqing Zhang, Heming Du, Xin Yu, Xue Li, Sen Wang

专题命中 视觉定位与Grounding :grounding(title,abstract);分类 cs.CV、cs.AI

Comments Accepted to WACV 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2404.11064 2024-12-19 cs.CV cs.AI 81%

Rethinking 3D Dense Caption and Visual Grounding in A Unified Framework through Prompt-based Localization

Yongdong Luo, Haojia Lin, Xiawu Zheng, Yigeng Jiang, Fei Chao, Jie Hu, Guannan Jiang, Songan Zhang, Rongrong Ji

专题命中 视觉定位与Grounding :grounding(title,abstract);分类 cs.CV、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2403.13804 2024-12-17 cs.CV cs.CL cs.LG 81%

Learning from Synthetic Data for Visual Grounding

Ruozhen He, Ziyan Yang, Paola Cascante-Bonilla, Alexander C. Berg, Vicente Ordonez

专题命中 视觉定位与Grounding :grounding(title,abstract);分类 cs.CV、cs.LG

Comments Project Page: https://catherine-r-he.github.io/SynGround/

详情

展开后加载摘要…

URL PDF HTML 收藏