arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视觉大模型 / VLM

视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。

共收录 7360 信号源:cs.CV, cs.AI, cs.LG

1. 视觉定位与Grounding 7360 篇

2408.09605 2024-08-20 cs.AI 79%

Does Thought Require Sensory Grounding? From Pure Thinkers to Large Language Models

David J. Chalmers

专题命中 视觉定位与Grounding :grounding(title,abstract);分类 cs.AI

Journal ref Proceedings and Addresses of the American Philosophical Association, 2023

详情

展开后加载摘要…

URL PDF HTML 收藏
2408.01669 2024-08-20 cs.CV cs.MM 79%

SynopGround: A Large-Scale Dataset for Multi-Paragraph Video Grounding from TV Dramas and Synopses

Chaolei Tan, Zihang Lin, Junfu Pu, Zhongang Qi, Wei-Yi Pei, Zhi Qu, Yexin Wang, Ying Shan, Wei-Shi Zheng, Jian-Fang Hu

专题命中 视觉定位与Grounding :grounding(title,abstract);分类 cs.CV

Comments Accepted to ACM MM 2024. Project page: https://synopground.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2408.07975 2024-08-16 cs.RO cs.CL cs.CV 79%

Polaris: Open-ended Interactive Robotic Manipulation via Syn2Real Visual Grounding and Large Language Models

Tianyu Wang, Haitao Lin, Junqiu Yu, Yanwei Fu

专题命中 视觉定位与Grounding :grounding(title,abstract);分类 cs.CV

Comments Accepted by IROS 2024. 8 pages, 5 figures. See https://star-uu-wang.github.io/Polaris/

详情

展开后加载摘要…

URL PDF HTML 收藏
2408.04961 2024-08-12 cs.CV 79%

In Defense of Lazy Visual Grounding for Open-Vocabulary Semantic Segmentation

Dahyun Kang, Minsu Cho

专题命中 视觉定位与Grounding :grounding(title,abstract);分类 cs.CV

Comments Accepted to ECCV 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2408.04023 2024-08-09 cs.CL cs.AI 79%

Improving Large Language Model (LLM) fidelity through context-aware grounding: A systematic approach to reliability and veracity

Wrick Talukdar, Anjanava Biswas

专题命中 视觉定位与Grounding :grounding(title,abstract);分类 cs.AI

Comments 14 pages

Journal ref World Journal of Advanced Engineering Technology and Sciences, 2023, 10(2), 283-296

详情

展开后加载摘要…

URL PDF HTML 收藏
2408.01120 2024-08-05 cs.CV 79%

An Efficient and Effective Transformer Decoder-Based Framework for Multi-Task Visual Grounding

Wei Chen, Long Chen, Yu Wu

专题命中 视觉定位与Grounding :grounding(title,abstract);分类 cs.CV

Comments 21pages, 10 figures, 9 tables. Accepted to ECCV 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2408.00932 2024-08-05 cs.CV cs.CL 79%

Towards Zero-Shot Annotation of the Built Environment with Vision-Language Models (Vision Paper)

Bin Han, Yiwei Yang, Anat Caspi, Bill Howe

专题命中 视觉定位与Grounding :vision-language model(title);vision language model(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2311.11273 2024-07-31 cs.CV 79%

Chain of Visual Perception: Harnessing Multimodal Large Language Models for Zero-shot Camouflaged Object Detection

Lv Tang, Peng-Tao Jiang, Zhihao Shen, Hao Zhang, Jinwei Chen, Bo Li

专题命中 视觉定位与Grounding :multimodal large language model(title,abstract);分类 cs.CV

Comments Accepted by ACMMM2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.18391 2024-07-29 cs.CV 79%

UOUO: Uncontextualized Uncommon Objects for Measuring Knowledge Horizons of Vision Language Models

Xinyu Pi, Mingyuan Wu, Jize Jiang, Haozhen Zheng, Beitong Tian, Chengxiang Zhai, Klara Nahrstedt, Zhiting Hu

专题命中 视觉定位与Grounding :vision language model(title);grounding(abstract);分类 cs.CV

Comments 10 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.17035 2024-07-25 cs.CV 79%

Q-Ground: Image Quality Grounding with Large Multi-modality Models

Chaofeng Chen, Sensen Yang, Haoning Wu, Liang Liao, Zicheng Zhang, Annan Wang, Wenxiu Sun, Qiong Yan, Weisi Lin

专题命中 视觉定位与Grounding :grounding(title,abstract);分类 cs.CV

Comments ACM Multimedia 2024 (Oral)

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.15728 2024-07-25 eess.IV cs.CV 79%

SAM2CLIP2SAM: Vision Language Model for Segmentation of 3D CT Scans for Covid-19 Detection

Dimitrios Kollias, Anastasios Arsenos, James Wingate, Stefanos Kollias

专题命中 视觉定位与Grounding :vision language model(title);vision-language model(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2308.03725 2024-07-25 cs.CV 79%

Efficient Temporal Sentence Grounding in Videos with Multi-Teacher Knowledge Distillation

Renjie Liang, Yiming Yang, Hui Lu, Li Li

专题命中 视觉定位与Grounding :grounding(title,abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.15046 2024-07-23 cs.CV cs.CL cs.MM 79%

Audio-visual training for improved grounding in video-text LLMs

Shivprasad Sagare, Hemachandran S, Kinshuk Sarabhai, Prashant Ullegaddi, Rajeshkumar SA

专题命中 视觉定位与Grounding :grounding(title,abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.05785 2024-07-23 cs.CV 79%

A Survey on Text-guided 3D Visual Grounding: Elements, Recent Advances, and Future Directions

Daizong Liu, Yang Liu, Wencan Huang, Wei Hu

专题命中 视觉定位与Grounding :grounding(title,abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2404.00801 2024-07-23 cs.CV 79%

$R^2$-Tuning: Efficient Image-to-Video Transfer Learning for Video Temporal Grounding

Ye Liu, Jixuan He, Wanhua Li, Junsik Kim, Donglai Wei, Hanspeter Pfister, Chang Wen Chen

专题命中 视觉定位与Grounding :grounding(title,abstract);分类 cs.CV

Comments ECCV 2024 Camera Ready

详情

展开后加载摘要…

URL PDF HTML 收藏
2312.14055 2024-07-23 cs.CV 79%

Multi-Sentence Grounding for Long-term Instructional Video

Zeqian Li, Qirui Chen, Tengda Han, Ya Zhang, Yanfeng Wang, Weidi Xie

专题命中 视觉定位与Grounding :grounding(title,abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2403.13589 2024-07-22 cs.CV 79%

ReGround: Improving Textual and Spatial Grounding at No Cost

Phillip Y. Lee, Minhyuk Sung

专题命中 视觉定位与Grounding :grounding(title,abstract);分类 cs.CV

Comments Accepted to ECCV 2024. Project page: https://re-ground.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2303.05499 2024-07-22 cs.CV 79%

Grounding DINO: Marrying DINO with Grounded Pre-Training for Open-Set Object Detection

Shilong Liu, Zhaoyang Zeng, Tianhe Ren, Feng Li, Hao Zhang, Jie Yang, Qing Jiang, Chunyuan Li, Jianwei Yang, Hang Su, Jun Zhu, Lei Zhang

专题命中 视觉定位与Grounding :grounding(title,abstract);分类 cs.CV

Comments Code will be available at https://github.com/IDEA-Research/GroundingDINO

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.13219 2024-07-19 cs.CV 79%

Multi-sentence Video Grounding for Long Video Generation

Wei Feng, Xin Wang, Hong Chen, Zeyang Zhang, Wenwu Zhu

专题命中 视觉定位与Grounding :grounding(title,abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2309.04561 2024-07-17 cs.CV cs.CL 79%

Four Ways to Improve Verbo-visual Fusion for Dense 3D Visual Grounding

Ozan Unal, Christos Sakaridis, Suman Saha, Luc Van Gool

专题命中 视觉定位与Grounding :grounding(title,abstract);分类 cs.CV

Comments Accepted at ECCV 2024. Winner of the ICCV 2023 ScanRefer Challenge

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.05118 2024-07-16 cs.CV 79%

SHINE: Saliency-aware HIerarchical NEgative Ranking for Compositional Temporal Grounding

Zixu Cheng, Yujiang Pu, Shaogang Gong, Parisa Kordjamshidi, Yu Kong

专题命中 视觉定位与Grounding :grounding(title,abstract);分类 cs.CV

Comments Accepted to ECCV 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2312.06729 2024-07-16 cs.CV 79%

RGNet: A Unified Clip Retrieval and Grounding Network for Long Videos

Tanveer Hannan, Md Mohaiminul Islam, Thomas Seidl, Gedas Bertasius

专题命中 视觉定位与Grounding :grounding(title,abstract);分类 cs.CV

Comments The code is released at https://github.com/Tanveer81/RGNet

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.08156 2024-07-12 cs.CV 79%

AddressCLIP: Empowering Vision-Language Models for City-wide Image Address Localization

Shixiong Xu, Chenghao Zhang, Lubin Fan, Gaofeng Meng, Shiming Xiang, Jieping Ye

专题命中 视觉定位与Grounding :vision-language model(title,abstract);分类 cs.CV

Comments Accepted at ECCV 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2403.00219 2024-07-12 cs.CV 79%

Multi-modal Attribute Prompting for Vision-Language Models

Xin Liu, Jiamin Wu, and Wenfei Yang, Xu Zhou, Tianzhu Zhang

专题命中 视觉定位与Grounding :vision-language model(title,abstract);分类 cs.CV

Comments Accepted for Publication in IEEE Transactions on Circuits and Systems for Video Technology (TCSVT)

详情

展开后加载摘要…

URL PDF HTML 收藏
2402.10416 2024-07-10 cs.AI cs.CL 79%

Grounding Language about Belief in a Bayesian Theory-of-Mind

Lance Ying, Tan Zhi-Xuan, Lionel Wong, Vikash Mansinghka, Joshua Tenenbaum

专题命中 视觉定位与Grounding :grounding(title,abstract);分类 cs.AI

Comments Published at CogSci 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.05352 2024-07-09 cs.CV cs.MM 79%

Exploring Phrase-Level Grounding with Text-to-Image Diffusion Model

Danni Yang, Ruohan Dong, Jiayi Ji, Yiwei Ma, Haowei Wang, Xiaoshuai Sun, Rongrong Ji

专题命中 视觉定位与Grounding :grounding(title,abstract);分类 cs.CV

Comments Accepted by ECCV2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.03251 2024-07-09 cs.CV 79%

ACTRESS: Active Retraining for Semi-supervised Visual Grounding

Weitai Kang, Mengxue Qu, Yunchao Wei, Yan Yan

专题命中 视觉定位与Grounding :grounding(title,abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.03243 2024-07-09 cs.CV 79%

Visual Grounding with Attention-Driven Constraint Balancing

Weitai Kang, Luowei Zhou, Junyi Wu, Changchang Sun, Yan Yan

专题命中 视觉定位与Grounding :grounding(title,abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.03200 2024-07-09 cs.CV 79%

SegVG: Transferring Object Bounding Box to Segmentation for Visual Grounding

Weitai Kang, Gaowen Liu, Mubarak Shah, Yan Yan

专题命中 视觉定位与Grounding :grounding(title,abstract);分类 cs.CV

Comments Accepted to ECCV 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.02846 2024-07-08 cs.CV 79%

Multi-Task Domain Adaptation for Language Grounding with 3D Objects

Penglei Sun, Yaoxian Song, Xinglin Pan, Peijie Dong, Xiaofei Yang, Qiang Wang, Zhixu Li, Tiefeng Li, Xiaowen Chu

专题命中 视觉定位与Grounding :grounding(title,abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏