arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视觉大模型 / VLM

视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。

共收录 7360 信号源:cs.CV, cs.AI, cs.LG

1. 视觉定位与Grounding 7360 篇

2306.10159 2024-03-22 cs.CV 79%

Vision-Language Models can Identify Distracted Driver Behavior from Naturalistic Videos

Md Zahid Hasan, Jiajing Chen, Jiyang Wang, Mohammed Shaiqur Rahman, Ameya Joshi, Senem Velipasalar, Chinmay Hegde, Anuj Sharma, Soumik Sarkar

专题命中 视觉定位与Grounding :vision-language model(title,abstract);分类 cs.CV

Comments 15 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2403.08182 2024-03-14 cs.CV 79%

SeCG: Semantic-Enhanced 3D Visual Grounding via Cross-modal Graph Attention

Feng Xiao, Hongbin Xu, Qiuxia Wu, Wenxiong Kang

专题命中 视觉定位与Grounding :grounding(title,abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2403.07407 2024-03-13 cs.CV 79%

In-context learning enables multimodal large language models to classify cancer pathology images

Dyke Ferber, Georg Wölflein, Isabella C. Wiest, Marta Ligero, Srividhya Sainath, Narmin Ghaffari Laleh, Omar S. M. El Nahhas, Gustav Müller-Franzes, Dirk Jäger, Daniel Truhn, Jakob Nikolas Kather

专题命中 视觉定位与Grounding :multimodal large language model(title);vision language model(abstract);分类 cs.CV

Comments 40 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2311.01091 2024-03-12 cs.CV 79%

Enriching Phrases with Coupled Pixel and Object Contexts for Panoptic Narrative Grounding

Tianrui Hui, Zihan Ding, Junshi Huang, Xiaoming Wei, Xiaolin Wei, Jiao Dai, Jizhong Han, Si Liu

专题命中 视觉定位与Grounding :grounding(title,abstract);分类 cs.CV

Comments Accepted by IJCAI 2023. Since the PNG benchmark adopts a different data partition manner from ours, we update the experimental results on the things/stuff/singulars/plurals subsets based on the PNG's code

详情

展开后加载摘要…

URL PDF HTML 收藏
2401.06071 2024-03-06 cs.CV cs.CL 79%

GroundingGPT:Language Enhanced Multi-modal Grounding Model

Zhaowei Li, Qi Xu, Dong Zhang, Hang Song, Yiqing Cai, Qi Qi, Ran Zhou, Junting Pan, Zefeng Li, Van Tu Vu, Zhida Huang, Tao Wang

专题命中 视觉定位与Grounding :grounding(title,abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2402.19116 2024-03-05 cs.CL cs.AI 79%

How to Understand "Support"? An Implicit-enhanced Causal Inference Approach for Weakly-supervised Phrase Grounding

Jiamin Luo, Jianing Zhao, Jingjing Wang, Guodong Zhou

专题命中 视觉定位与Grounding :grounding(title,abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2109.11265 2024-02-29 cs.CV 79%

End-to-End Dense Video Grounding via Parallel Regression

Fengyuan Shi, Weilin Huang, Limin Wang

专题命中 视觉定位与Grounding :grounding(title,abstract);分类 cs.CV

Comments Accepted by Computer Vision and Image Understanding (CVIU) in February 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2310.10221 2024-02-26 cs.RO cs.CV 79%

RoboLLM: Robotic Vision Tasks Grounded on Multimodal Large Language Models

Zijun Long, George Killick, Richard McCreadie, Gerardo Aragon Camarasa

专题命中 视觉定位与Grounding :multimodal large language model(title,abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2402.13290 2024-02-22 cs.AI 79%

Grounding from an AI and Cognitive Science Lens

Goonmeet Bajaj, Srinivasan Parthasarathy, Valerie L. Shalin, Amit Sheth

专题命中 视觉定位与Grounding :grounding(title,abstract);分类 cs.AI

Journal ref IEEE Intelligent Systems, 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2402.12927 2024-02-21 cs.CV 79%

CLIPping the Deception: Adapting Vision-Language Models for Universal Deepfake Detection

Sohail Ahmed Khan, Duc-Tien Dang-Nguyen

专题命中 视觉定位与Grounding :vision-language model(title,abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2402.10992 2024-02-20 cs.CL cs.AI 79%

"Understanding AI": Semantic Grounding in Large Language Models

Holger Lyre

专题命中 视觉定位与Grounding :grounding(title,abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2303.08345 2024-02-20 cs.CV 79%

Scanning Only Once: An End-to-end Framework for Fast Temporal Grounding in Long Videos

Yulin Pan, Xiangteng He, Biao Gong, Yiliang Lv, Yujun Shen, Yuxin Peng, Deli Zhao

专题命中 视觉定位与Grounding :grounding(title,abstract);分类 cs.CV

Comments 11 pages, 8 figures

Journal ref 2023 IEEE/CVF International Conference on Computer Vision (ICCV)

详情

展开后加载摘要…

URL PDF HTML 收藏
2402.09760 2024-02-16 cs.CL cs.AI cs.IR 79%

Grounding Language Model with Chunking-Free In-Context Retrieval

Hongjin Qian, Zheng Liu, Kelong Mao, Yujia Zhou, Zhicheng Dou

专题命中 视觉定位与Grounding :grounding(title,abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2402.07342 2024-02-13 cs.HC cs.AI 79%

Imagining a Future of Designing with AI: Dynamic Grounding, Constructive Negotiation, and Sustainable Motivation

Priyan Vaithilingam, Ian Arawjo, Elena L. Glassman

专题命中 视觉定位与Grounding :grounding(title,abstract);分类 cs.AI

Comments 12 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2305.13876 2024-02-08 cs.CV 79%

Cross3DVG: Cross-Dataset 3D Visual Grounding on Different RGB-D Scans

Taiki Miyanishi, Daichi Azuma, Shuhei Kurita, Motoki Kawanabe

专题命中 视觉定位与Grounding :grounding(title,abstract);分类 cs.CV

Comments 3DV 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2307.14277 2024-01-10 cs.CV 79%

G2L: Semantically Aligned and Uniform Video Grounding via Geodesic and Game Theory

Hongxiang Li, Meng Cao, Xuxin Cheng, Yaowei Li, Zhihong Zhu, Yuexian Zou

专题命中 视觉定位与Grounding :grounding(title,abstract);分类 cs.CV

Comments ICCV2023 oral, release the code

详情

展开后加载摘要…

URL PDF HTML 收藏
2108.11092 2024-01-09 cs.RO cs.AI 79%

INVIGORATE: Interactive Visual Grounding and Grasping in Clutter

Hanbo Zhang, Yunfan Lu, Cunjun Yu, David Hsu, Xuguang Lan, Nanning Zheng

专题命中 视觉定位与Grounding :grounding(title,abstract);分类 cs.AI

Comments 12 pages, full version

详情

展开后加载摘要…

URL PDF HTML 收藏
2401.02361 2024-01-08 cs.CV 79%

An Open and Comprehensive Pipeline for Unified Object Grounding and Detection

Xiangyu Zhao, Yicheng Chen, Shilin Xu, Xiangtai Li, Xinjiang Wang, Yining Li, Haian Huang

专题命中 视觉定位与Grounding :grounding(title,abstract);分类 cs.CV

Comments 10 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2401.01578 2024-01-04 cs.CV 79%

Context-Guided Spatio-Temporal Video Grounding

Xin Gu, Heng Fan, Yan Huang, Tiejian Luo, Libo Zhang

专题命中 视觉定位与Grounding :grounding(title,abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2310.17189 2024-01-01 cs.CV 79%

Exploring Iterative Refinement with Diffusion Models for Video Grounding

Xiao Liang, Tao Shi, Yaoyuan Liang, Te Tao, Shao-Lun Huang

专题命中 视觉定位与Grounding :grounding(title,abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2312.15162 2023-12-27 cs.CV 79%

Cycle-Consistency Learning for Captioning and Grounding

Ning Wang, Jiajun Deng, Mingbo Jia

专题命中 视觉定位与Grounding :grounding(title,abstract);分类 cs.CV

Comments To appear in AAAI 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2312.15043 2023-12-27 cs.CV 79%

GroundVLP: Harnessing Zero-shot Visual Grounding from Vision-Language Pre-training and Open-Vocabulary Object Detection

Haozhan Shen, Tiancheng Zhao, Mingwei Zhu, Jianwei Yin

专题命中 视觉定位与Grounding :grounding(title,abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2312.13633 2023-12-22 cs.CV 79%

Multi-Modal Domain Adaptation Across Video Scenes for Temporal Video Grounding

Haifeng Huang, Yang Zhao, Zehan Wang, Yan Xia, Zhou Zhao

专题命中 视觉定位与Grounding :grounding(title,abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2206.07207 2023-12-21 cs.CV cs.CL 79%

Beyond Grounding: Extracting Fine-Grained Event Hierarchies Across Modalities

Hammad A. Ayyubi, Christopher Thomas, Lovish Chum, Rahul Lokesh, Long Chen, Yulei Niu, Xudong Lin, Xuande Feng, Jaywon Koo, Sounak Ray, Shih-Fu Chang

专题命中 视觉定位与Grounding :grounding(title,abstract);分类 cs.CV

Comments AAAI 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2312.11967 2023-12-20 cs.CV 79%

Context Disentangling and Prototype Inheriting for Robust Visual Grounding

Wei Tang, Liang Li, Xuejing Liu, Lu Jin, Jinhui Tang, Zechao Li

专题命中 视觉定位与Grounding :grounding(title,abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2312.09532 2023-12-18 cs.AI 79%

Grounding for Artificial Intelligence

Bing Liu

专题命中 视觉定位与Grounding :grounding(title,abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2312.08022 2023-12-14 cs.CV 79%

Mono3DVG: 3D Visual Grounding in Monocular Images

Yang Zhan, Yuan Yuan, Zhitong Xiong

专题命中 视觉定位与Grounding :grounding(title,abstract);分类 cs.CV

Comments Accepted by the Thirty-Eighth AAAI Conference on Artificial Intelligence (AAAI 2024)

详情

展开后加载摘要…

URL PDF HTML 收藏
2308.00541 2023-12-14 cs.CV 79%

Detecting Cloud Presence in Satellite Images Using the RGB-based CLIP Vision-Language Model

Mikolaj Czerkawski, Robert Atkinson, Christos Tachtatzis

专题命中 视觉定位与Grounding :vision-language model(title,abstract);分类 cs.CV

Journal ref IGARSS 2023

详情

展开后加载摘要…

URL PDF HTML 收藏
2312.04794 2023-12-11 cs.CV 79%

Visual Grounding of Whole Radiology Reports for 3D CT Images

Akimichi Ichinose, Taro Hatsutani, Keigo Nakamura, Yoshiro Kitamura, Satoshi Iizuka, Edgar Simo-Serra, Shoji Kido, Noriyuki Tomiyama

专题命中 视觉定位与Grounding :grounding(title,abstract);分类 cs.CV

Comments 14 pages, 7 figures. Accepted at MICCAI 2023

Journal ref Medical Image Computing and Computer Assisted Intervention Lecture Notes in Computer Science 14224 (2023) 611-621

详情

展开后加载摘要…

URL PDF HTML 收藏
2308.11887 2023-11-21 cs.CV 79%

A Unified Framework for 3D Point Cloud Visual Grounding

Haojia Lin, Yongdong Luo, Xiawu Zheng, Lijiang Li, Fei Chao, Taisong Jin, Donghao Luo, Yan Wang, Liujuan Cao, Rongrong Ji

专题命中 视觉定位与Grounding :grounding(title,abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏