arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视觉大模型 / VLM

视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。

共收录 7360 信号源:cs.CV, cs.AI, cs.LG

1. 视觉定位与Grounding 7360 篇

2502.18290 2025-03-27 cs.CV 79%

Stealthy Backdoor Attack in Self-Supervised Learning Vision Encoders for Large Vision Language Models

Zhaoyi Liu, Huan Zhang

专题命中 视觉定位与Grounding :vision language model(title,abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.04923 2025-03-26 cs.CV 79%

VideoGLaMM: A Large Multimodal Model for Pixel-Level Visual Grounding in Videos

Shehan Munasinghe, Hanan Gani, Wenqi Zhu, Jiale Cao, Eric Xing, Fahad Shahbaz Khan, Salman Khan

专题命中 视觉定位与Grounding :grounding(title,abstract);分类 cs.CV

Comments Technical Report of VideoGLaMM

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.15024 2025-03-25 cs.CV 79%

Forensics-Bench: A Comprehensive Forgery Detection Benchmark Suite for Large Vision Language Models

Jin Wang, Chenghui Lv, Xian Li, Shichao Dong, Huadong Li, kelu Yao, Chao Li, Wenqi Shao, Ping Luo

专题命中 视觉定位与Grounding :vision language model(title,abstract);分类 cs.CV

Comments 31 pages, 19 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.16776 2025-03-24 cs.CV 79%

OpenCity3D: What do Vision-Language Models know about Urban Environments?

Valentin Bieri, Marco Zamboni, Nicolas S. Blumer, Qingxuan Chen, Francis Engelmann

专题命中 视觉定位与Grounding :vision-language model(title,abstract);分类 cs.CV

Comments Published at WACV 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.10332 2025-03-24 cs.CV 79%

Number it: Temporal Grounding Videos like Flipping Manga

Yongliang Wu, Xinting Hu, Yuyang Sun, Yizhou Zhou, Wenbo Zhu, Fengyun Rao, Bernt Schiele, Xu Yang

专题命中 视觉定位与Grounding :grounding(title,abstract);分类 cs.CV

Comments Accepted by CVPR 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.17053 2025-03-18 cs.CV 79%

Contextual Self-paced Learning for Weakly Supervised Spatio-Temporal Video Grounding

Akash Kumar, Zsolt Kira, Yogesh Singh Rawat

专题命中 视觉定位与Grounding :grounding(title,abstract);分类 cs.CV

Comments ICLR'25 Main Conference. Project Page: https://akash2907.github.io/cospal_webpage

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.08520 2025-03-18 cs.CV 79%

GroundingBooth: Grounding Text-to-Image Customization

Zhexiao Xiong, Wei Xiong, Jing Shi, He Zhang, Yizhi Song, Nathan Jacobs

专题命中 视觉定位与Grounding :grounding(title,abstract);分类 cs.CV

Comments Project page: https://groundingbooth.github.io

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.03461 2025-03-17 cs.CL cs.LG 79%

Auto-GDA: Automatic Domain Adaptation for Efficient Grounding Verification in Retrieval-Augmented Generation

Tobias Leemann, Periklis Petridis, Giuseppe Vietri, Dionysis Manousakas, Aaron Roth, Sergul Aydore

专题命中 视觉定位与Grounding :grounding(title,abstract);分类 cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.10500 2025-03-14 cs.CV 79%

OmniSTVG: Toward Spatio-Temporal Omni-Object Video Grounding

Jiali Yao, Xinran Deng, Xin Gu, Mengrui Dai, Bing Fan, Zhipeng Zhang, Yan Huang, Heng Fan, Libo Zhang

专题命中 视觉定位与Grounding :grounding(title,abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.07244 2025-03-13 cs.CV cs.CL 79%

Can Vision-Language Models Evaluate Handwritten Math?

Oikantik Nath, Hanani Bathina, Mohammed Safi Ur Rahman Khan, Mitesh M. Khapra

专题命中 视觉定位与Grounding :vision-language model(title,abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.08084 2025-03-12 cs.RO cs.AI 79%

Instruction-Augmented Long-Horizon Planning: Embedding Grounding Mechanisms in Embodied Mobile Manipulation

Fangyuan Wang, Shipeng Lyu, Peng Zhou, Anqing Duan, Guodong Guo, David Navarro-Alarcon

专题命中 视觉定位与Grounding :grounding(title,abstract);分类 cs.AI

Comments 17 pages, 11 figures

Journal ref AAAI 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.06142 2025-03-11 cs.CV 79%

VLForgery Face Triad: Detection, Localization and Attribution via Multimodal Large Language Models

Xinan He, Yue Zhou, Bing Fan, Bin Li, Guopu Zhu, Feng Ding

专题命中 视觉定位与Grounding :multimodal large language model(title,abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2408.04034 2025-03-11 cs.CV 79%

Task-oriented Sequential Grounding and Navigation in 3D Scenes

Zhuofan Zhang, Ziyu Zhu, Junhao Li, Pengxiang Li, Tianxu Wang, Tengyu Liu, Xiaojian Ma, Yixin Chen, Baoxiong Jia, Siyuan Huang, Qing Li

专题命中 视觉定位与Grounding :grounding(title,abstract);分类 cs.CV

Comments website: https://sg-3d.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.05082 2025-03-10 cs.CV 79%

Taming Video Diffusion Prior with Scene-Grounding Guidance for 3D Gaussian Splatting from Sparse Inputs

Yingji Zhong, Zhihao Li, Dave Zhenyu Chen, Lanqing Hong, Dan Xu

专题命中 视觉定位与Grounding :grounding(title,abstract);分类 cs.CV

Comments Accepted by CVPR2025. The project page is available at https://zhongyingji.github.io/guidevd-3dgs/

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.04250 2025-03-07 cs.CV cs.HC 79%

An Egocentric Vision-Language Model based Portable Real-time Smart Assistant

Yifei Huang, Jilan Xu, Baoqi Pei, Yuping He, Guo Chen, Mingfang Zhang, Lijin Yang, Zheng Nie, Jinyao Liu, Guoshun Fan, Dechen Lin, Fang Fang, Kunpeng Li, Chang Yuan, Xinyuan Chen, Yaohui Wang, Yali Wang, Yu Qiao, Limin Wang

专题命中 视觉定位与Grounding :vision-language model(title);grounding(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.05643 2025-03-04 cs.CV 79%

TRACE: Temporal Grounding Video LLM via Causal Event Modeling

Yongxin Guo, Jingyu Liu, Mingda Li, Qingbin Liu, Xi Chen, Xiaoying Tang

专题命中 视觉定位与Grounding :grounding(title,abstract);分类 cs.CV

Comments ICLR 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.20572 2025-03-03 cs.CV cs.CL 79%

HazardNet: A Small-Scale Vision Language Model for Real-Time Traffic Safety Detection at Edge Devices

Mohammad Abu Tami, Mohammed Elhenawy, Huthaifa I. Ashqar

专题命中 视觉定位与Grounding :vision language model(title,abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.16786 2025-03-03 cs.CV 79%

SwimVG: Step-wise Multimodal Fusion and Adaption for Visual Grounding

Liangtao Shi, Ting Liu, Xiantao Hu, Yue Hu, Quanjun Yin, Richang Hong

专题命中 视觉定位与Grounding :grounding(title,abstract);分类 cs.CV

Comments 12 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.19247 2025-02-28 cs.CV 79%

ProxyTransformation: Preshaping Point Cloud Manifold With Proxy Attention For 3D Visual Grounding

Qihang Peng, Henry Zheng, Gao Huang

专题命中 视觉定位与Grounding :grounding(title,abstract);分类 cs.CV

Comments 12 pages, 3 figures. Accepted by CVPR2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2308.09599 2025-02-26 cs.CV cs.MM 79%

Language-Guided Diffusion Model for Visual Grounding

Sijia Chen, Baochun Li

专题命中 视觉定位与Grounding :grounding(title,abstract);分类 cs.CV

Comments 20 pages, 16 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.16842 2025-02-25 cs.CV 79%

Exploring Causes and Mitigation of Hallucinations in Large Vision Language Models

Yaqi Sun, Kyohei Atarashi, Koh Takeuchi, Hisashi Kashima

专题命中 视觉定位与Grounding :vision language model(title);vision-language model(abstract);分类 cs.CV

Comments 19 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.16585 2025-02-25 cs.CV 79%

Anatomical grounding pre-training for medical phrase grounding

Wenjun Zhang, Shakes Chandra, Aaron Nicolson

专题命中 视觉定位与Grounding :grounding(title,abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2403.16539 2025-02-25 cs.CV 79%

Data-Efficient 3D Visual Grounding via Order-Aware Referring

Tung-Yu Wu, Sheng-Yu Huang, Yu-Chiang Frank Wang

专题命中 视觉定位与Grounding :grounding(title,abstract);分类 cs.CV

Comments accepted to WACV 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.16223 2025-02-25 cs.CV 79%

Prompt as Knowledge Bank: Boost Vision-language model via Structural Representation for zero-shot medical detection

Yuguang Yang, Tongfei Chen, Haoyu Huang, Linlin Yang, Chunyu Xie, Dawei Leng, Xianbin Cao, Baochang Zhang

专题命中 视觉定位与Grounding :vision-language model(title,abstract);分类 cs.CV

Comments Accepted as ICLR 2025 conference paper

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.14638 2025-02-21 cs.CL cs.CV 79%

NAVIG: Natural Language-guided Analysis with Vision Language Models for Image Geo-localization

Zheyuan Zhang, Runze Li, Tasnim Kabir, Jordan Boyd-Graber

专题命中 视觉定位与Grounding :vision language model(title,abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2312.00663 2025-02-20 cs.CV cs.RO 79%

Generalized Robot 3D Vision-Language Model with Fast Rendering and Pre-Training Vision-Language Alignment

Kangcheng Liu, Yong-Jin Liu, Baoquan Chen

专题命中 视觉定位与Grounding :vision-language model(title,abstract);分类 cs.CV

Comments IEEE Transactions on Pattern Analysis and Machine Intelligence, Manuscript Info: 17 Pages, 13 Figures, and 6 Tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.12917 2025-02-19 cs.CV 79%

Contrast-Unity for Partially-Supervised Temporal Sentence Grounding

Haicheng Wang, Chen Ju, Weixiong Lin, Chaofan Ma, Shuai Xiao, Ya Zhang, Yanfeng Wang

专题命中 视觉定位与Grounding :grounding(title,abstract);分类 cs.CV

Comments Accepted by ICASSP 2025.The first two authors share the same contribution. arXiv admin note: text overlap with arXiv:2302.09850

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.10455 2025-02-18 cs.LG cs.MM 79%

E2LVLM:Evidence-Enhanced Large Vision-Language Model for Multimodal Out-of-Context Misinformation Detection

Junjie Wu, Yumeng Fu, Nan Yu, Guohong Fu

专题命中 视觉定位与Grounding :vision-language model(title,abstract);分类 cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2408.17207 2025-02-13 cs.CV cs.RO 79%

NanoMVG: USV-Centric Low-Power Multi-Task Visual Grounding based on Prompt-Guided Camera and 4D mmWave Radar

Runwei Guan, Jianan Liu, Liye Jia, Haocheng Zhao, Shanliang Yao, Xiaohui Zhu, Ka Lok Man, Eng Gee Lim, Jeremy Smith, Yutao Yue

专题命中 视觉定位与Grounding :grounding(title,abstract);分类 cs.CV

Comments 8 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2405.13382 2025-02-04 cs.CV 79%

VTG-LLM: Integrating Timestamp Knowledge into Video LLMs for Enhanced Video Temporal Grounding

Yongxin Guo, Jingyu Liu, Mingda Li, Dingxin Cheng, Xiaoying Tang, Dianbo Sui, Qingbin Liu, Xi Chen, Kevin Zhao

专题命中 视觉定位与Grounding :grounding(title,abstract);分类 cs.CV

Comments AAAI 2025

详情

展开后加载摘要…

URL PDF HTML 收藏