arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视觉大模型 / VLM

视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。

共收录 7360 信号源:cs.CV, cs.AI, cs.LG

1. 视觉定位与Grounding 7360 篇

2311.02536 2023-11-07 cs.CV 79%

Augment the Pairs: Semantics-Preserving Image-Caption Pair Augmentation for Grounding-Based Vision and Language Models

Jingru Yi, Burak Uzkent, Oana Ignat, Zili Li, Amanmeet Garg, Xiang Yu, Linda Liu

专题命中 视觉定位与Grounding :grounding(title,abstract);分类 cs.CV

Comments Accepted to WACV2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2310.18773 2023-10-31 cs.CV 79%

CityRefer: Geography-aware 3D Visual Grounding Dataset on City-scale Point Cloud Data

Taiki Miyanishi, Fumiya Kitamori, Shuhei Kurita, Jungdae Lee, Motoaki Kawanabe, Nakamasa Inoue

专题命中 视觉定位与Grounding :grounding(title,abstract);分类 cs.CV

Comments NeurIPS D&B 2023. The first two authors are equally contributed

详情

展开后加载摘要…

URL PDF HTML 收藏
2310.18142 2023-10-30 cs.CV 79%

Semi-Supervised Panoptic Narrative Grounding

Danni Yang, Jiayi Ji, Xiaoshuai Sun, Haowei Wang, Yinan Li, Yiwei Ma, Rongrong Ji

专题命中 视觉定位与Grounding :grounding(title,abstract);分类 cs.CV

Comments ACM MM 2023

详情

展开后加载摘要…

URL PDF HTML 收藏
2310.17395 2023-10-27 cs.CV 79%

Learning Temporal Sentence Grounding From Narrated EgoVideos

Kevin Flanagan, Dima Damen, Michael Wray

专题命中 视觉定位与Grounding :grounding(title,abstract);分类 cs.CV

Comments Accepted in BMVC 2023

详情

展开后加载摘要…

URL PDF HTML 收藏
2209.13959 2023-10-27 cs.CV 79%

Dynamic MDETR: A Dynamic Multimodal Transformer Decoder for Visual Grounding

Fengyuan Shi, Ruopeng Gao, Weilin Huang, Limin Wang

专题命中 视觉定位与Grounding :grounding(title,abstract);分类 cs.CV

Comments Accepted by IEEE Transactions on Pattern Analysis and Machine Intelligence (TPAMI) in October 2023

详情

展开后加载摘要…

URL PDF HTML 收藏
2310.16616 2023-10-26 cs.CV cs.CL 79%

Context Does Matter: End-to-end Panoptic Narrative Grounding with Deformable Attention Refined Matching Network

Yiming Lin, Xiao-Bo Jin, Qiufeng Wang, Kaizhu Huang

专题命中 视觉定位与Grounding :grounding(title,abstract);分类 cs.CV

Comments Accepted by ICDM 2023

详情

展开后加载摘要…

URL PDF HTML 收藏
2310.14374 2023-10-24 cs.CV 79%

OV-VG: A Benchmark for Open-Vocabulary Visual Grounding

Chunlei Wang, Wenquan Feng, Xiangtai Li, Guangliang Cheng, Shuchang Lyu, Binghao Liu, Lijiang Chen, Qi Zhao

专题命中 视觉定位与Grounding :grounding(title,abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2310.12147 2023-10-19 cs.RO cs.CV 79%

InViG: Benchmarking Interactive Visual Grounding with 500K Human-Robot Interactions

Hanbo Zhang, Jie Xu, Yuchen Mo, Tao Kong

专题命中 视觉定位与Grounding :grounding(title,abstract);分类 cs.CV

Comments 8 pages, 9 figures, 3 tables, under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2302.11649 2023-10-19 cs.RO cs.AI cs.CL cs.FL 79%

Grounding Complex Natural Language Commands for Temporal Tasks in Unseen Environments

Jason Xinyu Liu, Ziyi Yang, Ifrah Idrees, Sam Liang, Benjamin Schornstein, Stefanie Tellex, Ankit Shah

专题命中 视觉定位与Grounding :grounding(title,abstract);分类 cs.AI

Comments Conference on Robot Learning 2023

详情

展开后加载摘要…

URL PDF HTML 收藏
2204.06272 2023-10-13 cs.CV 79%

3D-SPS: Single-Stage 3D Visual Grounding via Referred Point Progressive Selection

Junyu Luo, Jiahui Fu, Xianghao Kong, Chen Gao, Haibing Ren, Hao Shen, Huaxia Xia, Si Liu

专题命中 视觉定位与Grounding :grounding(title,abstract);分类 cs.CV

Comments CVPR 2022, Oral

详情

展开后加载摘要…

URL PDF HTML 收藏
2209.14941 2023-10-09 cs.CV cs.RO 79%

EDA: Explicit Text-Decoupling and Dense Alignment for 3D Visual Grounding

Yanmin Wu, Xinhua Cheng, Renrui Zhang, Zesen Cheng, Jian Zhang

专题命中 视觉定位与Grounding :grounding(title,abstract);分类 cs.CV

Comments CVPR2023, with supplementary material

Journal ref 2023 IEEE/CVF Conference on Computer Vision and Pattern Recognition (CVPR), Vancouver, BC, Canada, 2023, pp. 19231-19242

详情

展开后加载摘要…

URL PDF HTML 收藏
2309.15940 2023-09-29 cs.RO cs.CV 79%

Context-Aware Entity Grounding with Open-Vocabulary 3D Scene Graphs

Haonan Chang, Kowndinya Boyalakuntla, Shiyang Lu, Siwei Cai, Eric Jing, Shreesh Keskar, Shijie Geng, Adeeb Abbas, Lifeng Zhou, Kostas Bekris, Abdeslam Boularias

专题命中 视觉定位与Grounding :grounding(title,abstract);分类 cs.CV

Comments The code and dataset used for evaluation can be found at https://github.com/changhaonan/OVSG}{https://github.com/changhaonan/OVSG. This paper has been accepted by CoRL2023

详情

展开后加载摘要…

URL PDF HTML 收藏
2307.06135 2023-09-29 cs.RO cs.AI 79%

SayPlan: Grounding Large Language Models using 3D Scene Graphs for Scalable Robot Task Planning

Krishan Rana, Jesse Haviland, Sourav Garg, Jad Abou-Chakra, Ian Reid, Niko Suenderhauf

专题命中 视觉定位与Grounding :grounding(title,abstract);分类 cs.AI

Comments Accepted for oral presentation at the Conference on Robot Learning (CoRL), 2023. Project page can be found here: https://sayplan.github.io

详情

展开后加载摘要…

URL PDF HTML 收藏
2309.14203 2023-09-26 cs.CV 79%

Detecting and Grounding Multi-Modal Media Manipulation and Beyond

Rui Shao, Tianxing Wu, Jianlong Wu, Liqiang Nie, Ziwei Liu

专题命中 视觉定位与Grounding :grounding(title,abstract);分类 cs.CV

Comments Extension of our CVPR 2023 paper: arXiv:2304.02556 Code: https://github.com/rshaojimmy/MultiModal-DeepFake

详情

展开后加载摘要…

URL PDF HTML 收藏
2309.09667 2023-09-19 cs.CV 79%

Unified Frequency-Assisted Transformer Framework for Detecting and Grounding Multi-Modal Manipulation

Huan Liu, Zichang Tan, Qiang Chen, Yunchao Wei, Yao Zhao, Jingdong Wang

专题命中 视觉定位与Grounding :grounding(title,abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2307.11319 2023-09-19 cs.RO cs.AI 79%

"Tidy Up the Table": Grounding Common-sense Objective for Tabletop Object Rearrangement

Yiqing Xu, David Hsu

专题命中 视觉定位与Grounding :grounding(title,abstract);分类 cs.AI

Comments RSSLRL2023 Workshop, Under review for conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2303.01615 2023-09-19 cs.CV 79%

ConTEXTual Net: A Multimodal Vision-Language Model for Segmentation of Pneumothorax

Zachary Huemann, Xin Tie, Junjie Hu, Tyler J. Bradshaw

专题命中 视觉定位与Grounding :vision-language model(title,abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2309.06176 2023-09-13 cs.CV cs.MM 79%

Dual-Path Temporal Map Optimization for Make-up Temporal Video Grounding

Jiaxiu Li, Kun Li, Jia Li, Guoliang Chen, Dan Guo, Meng Wang

专题命中 视觉定位与Grounding :grounding(title,abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2309.05251 2023-09-12 cs.CV 79%

Multi3DRefer: Grounding Text Description to Multiple 3D Objects

Yiming Zhang, ZeMing Gong, Angel X. Chang

专题命中 视觉定位与Grounding :grounding(title,abstract);分类 cs.CV

Comments ICCV 2023

详情

展开后加载摘要…

URL PDF HTML 收藏
2309.01352 2023-09-06 cs.CL cs.AI 79%

Self-driven Grounding: Large Language Model Agents with Automatical Language-aligned Skill Learning

Shaohui Peng, Xing Hu, Qi Yi, Rui Zhang, Jiaming Guo, Di Huang, Zikang Tian, Ruizhi Chen, Zidong Du, Qi Guo, Yunji Chen, Ling Li

专题命中 视觉定位与Grounding :grounding(title,abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2308.16354 2023-09-01 cs.CV 79%

Catalog Phrase Grounding (CPG): Grounding of Product Textual Attributes in Product Images for e-commerce Vision-Language Applications

Wenyi Wu, Karim Bouyarmane, Ismail Tutar

专题命中 视觉定位与Grounding :grounding(title,abstract);分类 cs.CV

Comments KDD 2022 Workshop on First Content Understanding and Generation for e-Commerce

详情

展开后加载摘要…

URL PDF HTML 收藏
2307.16715 2023-08-21 cs.CV 79%

UniVTG: Towards Unified Video-Language Temporal Grounding

Kevin Qinghong Lin, Pengchuan Zhang, Joya Chen, Shraman Pramanick, Difei Gao, Alex Jinpeng Wang, Rui Yan, Mike Zheng Shou

专题命中 视觉定位与Grounding :grounding(title,abstract);分类 cs.CV

Comments Accepted by ICCV 2023. 16 pages, 10 figures, 13 tables. Code: https://github.com/showlab/UniVTG

详情

展开后加载摘要…

URL PDF HTML 收藏
2308.07102 2023-08-15 cs.CV cs.CL cs.MM 79%

Temporal Sentence Grounding in Streaming Videos

Tian Gan, Xiao Wang, Yan Sun, Jianlong Wu, Qingpei Guo, Liqiang Nie

专题命中 视觉定位与Grounding :grounding(title,abstract);分类 cs.CV

Comments Accepted by ACM MM 2023

详情

展开后加载摘要…

URL PDF HTML 收藏
2303.10437 2023-08-10 cs.CV 79%

Grounding 3D Object Affordance from 2D Interactions in Images

Yuhang Yang, Wei Zhai, Hongchen Luo, Yang Cao, Jiebo Luo, Zheng-Jun Zha

专题命中 视觉定位与Grounding :grounding(title,abstract);分类 cs.CV

Comments ICCV2023, camera-ready version

详情

展开后加载摘要…

URL PDF HTML 收藏
2308.04197 2023-08-09 cs.CV 79%

D3G: Exploring Gaussian Prior for Temporal Sentence Grounding with Glance Annotation

Hanjun Li, Xiujun Shu, Sunan He, Ruizhi Qiao, Wei Wen, Taian Guo, Bei Gan, Xing Sun

专题命中 视觉定位与Grounding :grounding(title,abstract);分类 cs.CV

Comments ICCV2023

详情

展开后加载摘要…

URL PDF HTML 收藏
2307.13363 2023-07-26 cs.CV 79%

3DRP-Net: 3D Relative Position-aware Network for 3D Visual Grounding

Zehan Wang, Haifeng Huang, Yang Zhao, Linjun Li, Xize Cheng, Yichen Zhu, Aoxiong Yin, Zhou Zhao

专题命中 视觉定位与Grounding :grounding(title,abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2307.12392 2023-07-25 cs.CV 79%

Iterative Robust Visual Grounding with Masked Reference based Centerpoint Supervision

Menghao Li, Chunlei Wang, Wenquan Feng, Shuchang Lyu, Guangliang Cheng, Xiangtai Li, Binghao Liu, Qi Zhao

专题命中 视觉定位与Grounding :grounding(title,abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2301.00805 2023-07-25 cs.CV 79%

Betrayed by Captions: Joint Caption Grounding and Generation for Open Vocabulary Instance Segmentation

Jianzong Wu, Xiangtai Li, Henghui Ding, Xia Li, Guangliang Cheng, Yunhai Tong, Chen Change Loy

专题命中 视觉定位与Grounding :grounding(title,abstract);分类 cs.CV

Comments ICCV-2023

详情

展开后加载摘要…

URL PDF HTML 收藏
2307.11558 2023-07-24 cs.CV cs.CL 79%

Advancing Visual Grounding with Scene Knowledge: Benchmark and Method

Zhihong Chen, Ruifei Zhang, Yibing Song, Xiang Wan, Guanbin Li

专题命中 视觉定位与Grounding :grounding(title,abstract);分类 cs.CV

Comments Computer Vision and Natural Language Processing. 21 pages, 14 figures. CVPR-2023

详情

展开后加载摘要…

URL PDF HTML 收藏
2307.10567 2023-07-21 cs.CV 79%

No-frills Temporal Video Grounding: Multi-Scale Neighboring Attention and Zoom-in Boundary Detection

Qi Zhang, Sipeng Zheng, Qin Jin

专题命中 视觉定位与Grounding :grounding(title,abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏