arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视觉大模型 / VLM

视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。

共收录 7360 信号源:cs.CV, cs.AI, cs.LG

1. 视觉定位与Grounding 7360 篇

2311.08835 2024-07-08 cs.CV 79%

Correlation-Guided Query-Dependency Calibration for Video Temporal Grounding

WonJun Moon, Sangeek Hyun, SuBeen Lee, Jae-Pil Heo

专题命中 视觉定位与Grounding :grounding(title,abstract);分类 cs.CV

Comments 29 pages, 15 figures, 14 tables, Code is available at https://github.com/wjun0830/CGDETR

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.18146 2024-07-01 cs.CV 79%

A Refer-and-Ground Multimodal Large Language Model for Biomedicine

Xiaoshuang Huang, Haifeng Huang, Lingdong Shen, Yehui Yang, Fangxin Shang, Junwei Liu, Jia Liu

专题命中 视觉定位与Grounding :multimodal large language model(title,abstract);分类 cs.CV

Comments Accepted by MICCAI2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.18253 2024-06-27 cs.CV 79%

On the Role of Visual Grounding in VQA

Daniel Reich, Tanja Schultz

专题命中 视觉定位与Grounding :grounding(title,abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.17880 2024-06-27 cs.CV 79%

MLLM as Video Narrator: Mitigating Modality Imbalance in Video Moment Retrieval

Weitong Cai, Jiabo Huang, Shaogang Gong, Hailin Jin, Yang Liu

专题命中 视觉定位与Grounding :MLLM(title,abstract);分类 cs.CV

Comments Under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.04603 2024-06-19 cs.CV 79%

Simplify Implant Depth Prediction as Video Grounding: A Texture Perceive Implant Depth Prediction Network

Xinquan Yang, Xuguang Li, Xiaoling Luo, Leilei Zeng, Yudi Zhang, Linlin Shen, Yongqiang Deng

专题命中 视觉定位与Grounding :grounding(title,abstract);分类 cs.CV

Journal ref MICCAI'2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2308.09568 2024-06-18 cs.CV cs.CL 79%

PUMGPT: A Large Vision-Language Model for Product Understanding

Wei Xue, Zongyi Guo, Baoliang Cui, Zheng Xing, Xiaoyi Zeng, Xiufei Wang, Shuhui Wu, Weiming Lu

专题命中 视觉定位与Grounding :vision-language model(title);vision language model(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.09575 2024-06-17 cs.CV 79%

CARLOR @ Ego4D Step Grounding Challenge: Bayesian temporal-order priors for test time refinement

Carlos Plou, Lorenzo Mur-Labadia, Ruben Martinez-Cantin, Ana C. Murillo

专题命中 视觉定位与Grounding :grounding(title,abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.08907 2024-06-14 cs.CV cs.MM 79%

Dual Attribute-Spatial Relation Alignment for 3D Visual Grounding

Yue Xu, Kaizhi Yang, Jiebo Luo, Xuejin Chen

专题命中 视觉定位与Grounding :grounding(title,abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.07091 2024-06-12 cs.CV 79%

AutoTVG: A New Vision-language Pre-training Paradigm for Temporal Video Grounding

Xing Zhang, Jiaxi Gu, Haoyu Zhao, Shicong Wang, Hang Xu, Renjing Pei, Songcen Xu, Zuxuan Wu, Yu-Gang Jiang

专题命中 视觉定位与Grounding :grounding(title,abstract);分类 cs.CV

Comments Technique Report

详情

展开后加载摘要…

URL PDF HTML 收藏
2403.14077 2024-06-12 cs.AI cs.CR 79%

Can ChatGPT Detect DeepFakes? A Study of Using Multimodal Large Language Models for Media Forensics

Shan Jia, Reilin Lyu, Kangran Zhao, Yize Chen, Zhiyuan Yan, Yan Ju, Chuanbo Hu, Xin Li, Baoyuan Wu, Siwei Lyu

专题命中 视觉定位与Grounding :multimodal large language model(title,abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2405.06217 2024-06-11 cs.CV cs.MM 79%

DARA: Domain- and Relation-aware Adapters Make Parameter-efficient Tuning for Visual Grounding

Ting Liu, Xuyang Liu, Siteng Huang, Honggang Chen, Quanjun Yin, Long Qin, Donglin Wang, Yue Hu

专题命中 视觉定位与Grounding :grounding(title,abstract);分类 cs.CV

Comments Accepted by ICME 2024 (Oral)

详情

展开后加载摘要…

URL PDF HTML 收藏
2306.09244 2024-06-05 cs.CV 79%

Text Promptable Surgical Instrument Segmentation with Vision-Language Models

Zijian Zhou, Oluwatosin Alabi, Meng Wei, Tom Vercauteren, Miaojing Shi

专题命中 视觉定位与Grounding :vision-language model(title,abstract);分类 cs.CV

Comments NeurIPS 2023

Journal ref https://proceedings.neurips.cc/paper_files/paper/2023/hash/5af741d487c5f0b08bfe56e11d1883e4-Abstract-Conference.html

详情

展开后加载摘要…

URL PDF HTML 收藏
2405.10300 2024-06-04 cs.CV 79%

Grounding DINO 1.5: Advance the "Edge" of Open-Set Object Detection

Tianhe Ren, Qing Jiang, Shilong Liu, Zhaoyang Zeng, Wenlong Liu, Han Gao, Hongjie Huang, Zhengyu Ma, Xiaoke Jiang, Yihao Chen, Yuda Xiong, Hao Zhang, Feng Li, Peijun Tang, Kent Yu, Lei Zhang

专题命中 视觉定位与Grounding :grounding(title,abstract);分类 cs.CV

Comments homepage: https://deepdataspace.com/home

详情

展开后加载摘要…

URL PDF HTML 收藏
2404.13611 2024-06-04 cs.CV cs.CL 79%

Video sentence grounding with temporally global textual knowledge

Cai Chen, Runzhong Zhang, Jianjun Gao, Kejun Wu, Kim-Hui Yap, Yi Wang

专题命中 视觉定位与Grounding :grounding(title,abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2309.02691 2024-06-03 cs.CL cs.CV 79%

A Joint Study of Phrase Grounding and Task Performance in Vision and Language Models

Noriyuki Kojima, Hadar Averbuch-Elor, Yoav Artzi

专题命中 视觉定位与Grounding :grounding(title,abstract);分类 cs.CV

Comments This was published in TMLR in 2024, on January 24th

详情

展开后加载摘要…

URL PDF HTML 收藏
2303.16990 2024-05-30 cs.CV 79%

What, when, and where? -- Self-Supervised Spatio-Temporal Grounding in Untrimmed Multi-Action Videos from Narrated Instructions

Brian Chen, Nina Shvetsova, Andrew Rouditchenko, Daniel Kondermann, Samuel Thomas, Shih-Fu Chang, Rogerio Feris, James Glass, Hilde Kuehne

专题命中 视觉定位与Grounding :grounding(title,abstract);分类 cs.CV

Comments To be presented at CVPR 2024. Project page: https://brian7685.github.io/STG/

详情

展开后加载摘要…

URL PDF HTML 收藏
2404.12678 2024-05-27 cs.CV 79%

Exploring Interactive Semantic Alignment for Efficient HOI Detection with Vision-language Model

Jihao Dong, Renjie Pan, Hua Yang

专题命中 视觉定位与Grounding :vision-language model(title,abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2405.15274 2024-05-27 cs.CV cs.HC 79%

Talk to Parallel LiDARs: A Human-LiDAR Interaction Method Based on 3D Visual Grounding

Yuhang Liu, Boyi Sun, Guixu Zheng, Yishuo Wang, Jing Wang, Fei-Yue Wang

专题命中 视觉定位与Grounding :grounding(title,abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2404.01174 2024-05-24 cs.CV cs.MM 79%

SpikeMba: Multi-Modal Spiking Saliency Mamba for Temporal Video Grounding

Wenrui Li, Xiaopeng Hong, Ruiqin Xiong, Xiaopeng Fan

专题命中 视觉定位与Grounding :grounding(title,abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2403.11463 2024-05-15 cs.CV 79%

Siamese Learning with Joint Alignment and Regression for Weakly-Supervised Video Paragraph Grounding

Chaolei Tan, Jianhuang Lai, Wei-Shi Zheng, Jian-Fang Hu

专题命中 视觉定位与Grounding :grounding(title,abstract);分类 cs.CV

Comments Accepted to CVPR 2024. v2: fix a typo in figure 1

详情

展开后加载摘要…

URL PDF HTML 收藏
2405.00197 2024-05-02 cs.AI cs.DB cs.IR 79%

Grounding Realizable Entities

Michael Rabenberg, Carter Benson, Federico Donato, Yongqun He, Anthony Huffman, Shane Babcock, John Beverley

专题命中 视觉定位与Grounding :grounding(title,abstract);分类 cs.AI

Comments 13

详情

展开后加载摘要…

URL PDF HTML 收藏
2404.07973 2024-04-12 cs.CV 79%

Ferret-v2: An Improved Baseline for Referring and Grounding with Large Language Models

Haotian Zhang, Haoxuan You, Philipp Dufter, Bowen Zhang, Chen Chen, Hong-You Chen, Tsu-Jui Fu, William Yang Wang, Shih-Fu Chang, Zhe Gan, Yinfei Yang

专题命中 视觉定位与Grounding :grounding(title,abstract);分类 cs.CV

Comments Preprint. 14 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2404.02257 2024-04-08 cs.CV 79%

SnAG: Scalable and Accurate Video Grounding

Fangzhou Mu, Sicheng Mo, Yin Li

专题命中 视觉定位与Grounding :grounding(title,abstract);分类 cs.CV

Comments Accepted to CVPR 2024. Code available at https://github.com/fmu2/snag_release

详情

展开后加载摘要…

URL PDF HTML 收藏
2403.12686 2024-04-08 cs.CV cs.MM cs.RO 79%

WaterVG: Waterway Visual Grounding based on Text-Guided Vision and mmWave Radar

Runwei Guan, Liye Jia, Fengyufan Yang, Shanliang Yao, Erick Purwanto, Xiaohui Zhu, Eng Gee Lim, Jeremy Smith, Ka Lok Man, Xuming Hu, Yutao Yue

专题命中 视觉定位与Grounding :grounding(title,abstract);分类 cs.CV

Comments 10 pages, 10 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2309.04077 2024-04-05 cs.RO cs.AI 79%

SayNav: Grounding Large Language Models for Dynamic Planning to Navigation in New Environments

Abhinav Rajvanshi, Karan Sikka, Xiao Lin, Bhoram Lee, Han-Pang Chiu, Alvaro Velasquez

专题命中 视觉定位与Grounding :grounding(title,abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2404.01207 2024-04-02 cs.CV 79%

Vision-language models for decoding provider attention during neonatal resuscitation

Felipe Parodi, Jordan Matelsky, Alejandra Regla-Vargas, Elizabeth Foglia, Charis Lim, Danielle Weinberg, Konrad Kording, Heidi Herrick, Michael Platt

专题命中 视觉定位与Grounding :vision-language model(title,abstract);分类 cs.CV

Comments 9 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2401.00901 2024-04-02 cs.CV 79%

Video-GroundingDINO: Towards Open-Vocabulary Spatio-Temporal Video Grounding

Syed Talal Wasim, Muzammal Naseer, Salman Khan, Ming-Hsuan Yang, Fahad Shahbaz Khan

专题命中 视觉定位与Grounding :grounding(title,abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2311.15383 2024-03-26 cs.CV 79%

Visual Programming for Zero-shot Open-Vocabulary 3D Visual Grounding

Zhihao Yuan, Jinke Ren, Chun-Mei Feng, Hengshuang Zhao, Shuguang Cui, Zhen Li

专题命中 视觉定位与Grounding :grounding(title,abstract);分类 cs.CV

Comments Accepted by CVPR 2024, project website: https://curryyuan.github.io/ZSVG3D/

详情

展开后加载摘要…

URL PDF HTML 收藏
2301.05997 2024-03-26 cs.CV 79%

Exploiting Auxiliary Caption for Video Grounding

Hongxiang Li, Meng Cao, Xuxin Cheng, Zhihong Zhu, Yaowei Li, Yuexian Zou

专题命中 视觉定位与Grounding :grounding(title,abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2312.10103 2024-03-22 cs.CV 79%

GSVA: Generalized Segmentation via Multimodal Large Language Models

Zhuofan Xia, Dongchen Han, Yizeng Han, Xuran Pan, Shiji Song, Gao Huang

专题命中 视觉定位与Grounding :multimodal large language model(title,abstract);分类 cs.CV

Comments Accepted by CVPR2024 (19 pages, 9 figures, 11 tables)

详情

展开后加载摘要…

URL PDF HTML 收藏