arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视觉大模型 / VLM

视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。

共收录 7348 信号源:cs.CV, cs.AI, cs.LG

1. 视觉定位与Grounding 7348 篇

2211.14739 2022-11-29 cs.CV cs.AI cs.CL 81%

MNER-QG: An End-to-End MRC framework for Multimodal Named Entity Recognition with Query Grounding

Meihuizi Jia, Lei Shen, Xin Shen, Lejian Liao, Meng Chen, Xiaodong He, Zhendong Chen, Jiaqi Li

专题命中 视觉定位与Grounding :grounding(title,abstract);分类 cs.CV、cs.AI

Comments 13 pages, 6 figures, published to AAAI

详情

展开后加载摘要…

URL PDF HTML 收藏
2205.11169 2022-11-23 cs.CV cs.AI cs.CL 81%

PEVL: Position-enhanced Pre-training and Prompt Tuning for Vision-language Models

Yuan Yao, Qianyu Chen, Ao Zhang, Wei Ji, Zhiyuan Liu, Tat-Seng Chua, Maosong Sun

专题命中 视觉定位与Grounding :vision-language model(title);grounding(abstract);分类 cs.CV、cs.AI

Comments Accepted by EMNLP 2022

详情

展开后加载摘要…

URL PDF HTML 收藏
2203.08481 2022-11-18 cs.CV cs.AI cs.CL 81%

Pseudo-Q: Generating Pseudo Language Queries for Visual Grounding

Haojun Jiang, Yuanze Lin, Dongchen Han, Shiji Song, Gao Huang

专题命中 视觉定位与Grounding :grounding(title,abstract);分类 cs.CV、cs.AI

Comments Accepted by CVPR2022

详情

展开后加载摘要…

URL PDF HTML 收藏
2211.01969 2022-11-04 cs.CV cs.AI 81%

Grounding Scene Graphs on Natural Images via Visio-Lingual Message Passing

Aditay Tripathi, Anand Mishra, Anirban Chakraborty

专题命中 视觉定位与Grounding :grounding(title,abstract);分类 cs.CV、cs.AI

Journal ref WACV 2023

详情

展开后加载摘要…

URL PDF HTML 收藏
2210.04996 2022-11-01 cs.CV cs.AI 81%

Graph2Vid: Flow graph to Video Grounding for Weakly-supervised Multi-Step Localization

Nikita Dvornik, Isma Hadji, Hai Pham, Dhaivat Bhatt, Brais Martinez, Afsaneh Fazly, Allan D. Jepson

专题命中 视觉定位与Grounding :grounding(title,abstract);分类 cs.CV、cs.AI

Comments ECCV'22, oral

Journal ref ECCV 2022

详情

展开后加载摘要…

URL PDF HTML 收藏
2204.04308 2022-09-12 cs.LG cs.AI cs.CL 81%

Grounding Hindsight Instructions in Multi-Goal Reinforcement Learning for Robotics

Frank Röder, Manfred Eppe, Stefan Wermter

专题命中 视觉定位与Grounding :grounding(title,abstract);分类 cs.AI、cs.LG

Comments Published at the 2022 IEEE International Conference on Development and Learning (ICDL)

详情

展开后加载摘要…

URL PDF HTML 收藏
2209.02066 2022-09-07 cs.AI cs.LG cs.RO 81%

Trust in Language Grounding: a new AI challenge for human-robot teams

David M. Bossens, Christine Evers

专题命中 视觉定位与Grounding :grounding(title,abstract);分类 cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2205.12089 2022-07-12 cs.CV cs.AI 81%

Sim-To-Real Transfer of Visual Grounding for Human-Aided Ambiguity Resolution

Georgios Tziafas, Hamidreza Kasaei

专题命中 视觉定位与Grounding :grounding(title,abstract);分类 cs.CV、cs.AI

Comments Accepted CoLLAs 2022

详情

展开后加载摘要…

URL PDF HTML 收藏
2206.09114 2022-06-23 cs.CV cs.LG 81%

Bear the Query in Mind: Visual Grounding with Query-conditioned Convolution

Chonghan Chen, Qi Jiang, Chih-Hao Wang, Noel Chen, Haohan Wang, Xiang Li, Bhiksha Raj

专题命中 视觉定位与Grounding :grounding(title,abstract);分类 cs.CV、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2203.01762 2022-06-22 cs.LG cs.CV physics.flu-dyn 81%

NeuroFluid: Fluid Dynamics Grounding with Particle-Driven Neural Radiance Fields

Shanyan Guan, Huayu Deng, Yunbo Wang, Xiaokang Yang

专题命中 视觉定位与Grounding :grounding(title,abstract);分类 cs.CV、cs.LG

Comments ICML 2022, the project page: https://syguan96.github.io/NeuroFluid/

详情

展开后加载摘要…

URL PDF HTML 收藏
2203.16434 2022-06-10 cs.CV cs.CL cs.LG 81%

TubeDETR: Spatio-Temporal Video Grounding with Transformers

Antoine Yang, Antoine Miech, Josef Sivic, Ivan Laptev, Cordelia Schmid

专题命中 视觉定位与Grounding :grounding(title,abstract);分类 cs.CV、cs.LG

Comments Updated vIoU results compared to the CVPR'22 camera-ready version; 17 pages; 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2205.09710 2022-05-20 cs.CL cs.AI cs.CV 81%

Voxel-informed Language Grounding

Rodolfo Corona, Shizhan Zhu, Dan Klein, Trevor Darrell

专题命中 视觉定位与Grounding :grounding(title,abstract);分类 cs.CV、cs.AI

Comments ACL 2022

详情

展开后加载摘要…

URL PDF HTML 收藏
2204.01450 2022-04-13 cs.CV cs.CL cs.LG 81%

Learning Commonsense-aware Moment-Text Alignment for Fast Video Temporal Grounding

Ziyue Wu, Junyu Gao, Shucheng Huang, Changsheng Xu

专题命中 视觉定位与Grounding :grounding(title,abstract);分类 cs.CV、cs.LG

Comments Submitted to IEEE TMM; Code is available at https://github.com/ZiyueWu59/CCA

详情

展开后加载摘要…

URL PDF HTML 收藏
2202.10292 2022-03-31 cs.CL cs.CV cs.LG 81%

Seeing the advantage: visually grounding word embeddings to better capture human semantic knowledge

Danny Merkx, Stefan L. Frank, Mirjam Ernestus

专题命中 视觉定位与Grounding :grounding(title,abstract);分类 cs.CV、cs.LG

Journal ref Proceedings of the Workshop on Cognitive Modeling and Computational Linguistics (CMCL) 2022

详情

展开后加载摘要…

URL PDF HTML 收藏
2112.00431 2022-03-29 cs.CV cs.AI 81%

MAD: A Scalable Dataset for Language Grounding in Videos from Movie Audio Descriptions

Mattia Soldan, Alejandro Pardo, Juan León Alcázar, Fabian Caba Heilbron, Chen Zhao, Silvio Giancola, Bernard Ghanem

专题命中 视觉定位与Grounding :grounding(title,abstract);分类 cs.CV、cs.AI

Comments 12 Pages, 6 Figures, 7 Tables

Journal ref Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition CVPR 2022

详情

展开后加载摘要…

URL PDF HTML 收藏
2202.03543 2022-03-03 eess.AS cs.CL cs.CV cs.LG cs.SD 81%

Self-Supervised Representation Learning for Speech Using Visual Grounding and Masked Language Modeling

Puyuan Peng, David Harwath

专题命中 视觉定位与Grounding :grounding(title,abstract);分类 cs.CV、cs.LG

Comments SAS workshop at AAAI2022, code and model weights available at https://github.com/jasonppy/FaST-VGS-Family

详情

展开后加载摘要…

URL PDF HTML 收藏
2108.05308 2022-02-03 cs.CV cs.LG 81%

A Better Loss for Visual-Textual Grounding

Davide Rigoni, Luciano Serafini, Alessandro Sperduti

专题命中 视觉定位与Grounding :grounding(title,abstract);分类 cs.CV、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2110.10661 2022-01-26 cs.CL cs.AI cs.LG 81%

SILG: The Multi-environment Symbolic Interactive Language Grounding Benchmark

Victor Zhong, Austin W. Hanjie, Sida I. Wang, Karthik Narasimhan, Luke Zettlemoyer

专题命中 视觉定位与Grounding :grounding(title,abstract);分类 cs.AI、cs.LG

Comments NeurIPS 2021. 14 pages, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2201.05307 2022-01-17 cs.CV cs.LG 81%

Unsupervised Temporal Video Grounding with Deep Semantic Clustering

Daizong Liu, Xiaoye Qu, Yinzhen Wang, Xing Di, Kai Zou, Yu Cheng, Zichuan Xu, Pan Zhou

专题命中 视觉定位与Grounding :grounding(title,abstract);分类 cs.CV、cs.LG

Comments Accepted by AAAI2022

详情

展开后加载摘要…

URL PDF HTML 收藏
2110.10596 2021-12-03 cs.CV cs.LG 81%

Look at What I'm Doing: Self-Supervised Spatial Grounding of Narrations in Instructional Videos

Reuben Tan, Bryan A. Plummer, Kate Saenko, Hailin Jin, Bryan Russell

专题命中 视觉定位与Grounding :grounding(title,abstract);分类 cs.CV、cs.LG

Comments Accepted at NeurIPS 2021 (Spotlight)

详情

展开后加载摘要…

URL PDF HTML 收藏
2106.08858 2021-10-12 cs.AI cs.CL cs.LG 81%

Grounding Spatio-Temporal Language with Transformers

Tristan Karch, Laetitia Teodorescu, Katja Hofmann, Clément Moulin-Frier, Pierre-Yves Oudeyer

专题命中 视觉定位与Grounding :grounding(title,abstract);分类 cs.AI、cs.LG

Comments Contains main article and supplementaries

Journal ref Neurips 2021

详情

展开后加载摘要…

URL PDF HTML 收藏
2109.08039 2021-09-20 cs.CV cs.AI cs.MM 81%

A Survey on Temporal Sentence Grounding in Videos

Xiaohan Lan, Yitian Yuan, Xin Wang, Zhi Wang, Wenwu Zhu

专题命中 视觉定位与Grounding :grounding(title,abstract);分类 cs.CV、cs.AI

Comments 32 pages with 19 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2109.04600 2021-09-13 cs.CV cs.AI cs.CL 81%

EVOQUER: Enhancing Temporal Grounding with Video-Pivoted BackQuery Generation

Yanjun Gao, Lulu Liu, Jason Wang, Xin Chen, Huayan Wang, Rui Zhang

专题命中 视觉定位与Grounding :grounding(title,abstract);分类 cs.CV、cs.AI

Comments Accepted by Visually Grounded Interaction and Language (ViGIL) Workshop at NAACL 2021

详情

展开后加载摘要…

URL PDF HTML 收藏
2108.02388 2021-08-12 cs.CV cs.AI 81%

TransRefer3D: Entity-and-Relation Aware Transformer for Fine-Grained 3D Visual Grounding

Dailan He, Yusheng Zhao, Junyu Luo, Tianrui Hui, Shaofei Huang, Aixi Zhang, Si Liu

专题命中 视觉定位与Grounding :grounding(title,abstract);分类 cs.CV、cs.AI

Comments ACM MM2021

详情

展开后加载摘要…

URL PDF HTML 收藏
2108.00205 2021-08-03 cs.CV cs.AI cs.CL 81%

Word2Pix: Word to Pixel Cross Attention Transformer in Visual Grounding

Heng Zhao, Joey Tianyi Zhou, Yew-Soon Ong

专题命中 视觉定位与Grounding :grounding(title,abstract);分类 cs.CV、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2107.00339 2021-07-02 cs.RO cs.AI cs.LG 81%

Policy Transfer across Visual and Dynamics Domain Gaps via Iterative Grounding

Grace Zhang, Linghan Zhong, Youngwoon Lee, Joseph J. Lim

专题命中 视觉定位与Grounding :grounding(title,abstract);分类 cs.AI、cs.LG

Comments Robotics: Science and Systems (RSS), 2021

详情

展开后加载摘要…

URL PDF HTML 收藏
2101.07393 2021-06-15 cs.CL cs.AI cs.LG 81%

Grounding Language to Entities and Dynamics for Generalization in Reinforcement Learning

Austin W. Hanjie, Victor Zhong, Karthik Narasimhan

专题命中 视觉定位与Grounding :grounding(title,abstract);分类 cs.AI、cs.LG

Comments Accepted to ICML 2021. Note author list and name changes from previous version

详情

展开后加载摘要…

URL PDF HTML 收藏
2011.05049 2021-06-03 cs.CV cs.AI cs.MM 81%

Human-centric Spatio-Temporal Video Grounding With Visual Transformers

Zongheng Tang, Yue Liao, Si Liu, Guanbin Li, Xiaojie Jin, Hongxu Jiang, Qian Yu, Dong Xu

专题命中 视觉定位与Grounding :grounding(title,abstract);分类 cs.CV、cs.AI

Comments Accept at TCSVT

详情

展开后加载摘要…

URL PDF HTML 收藏
2003.08717 2021-05-27 cs.CV cs.AI cs.CL 81%

Giving Commands to a Self-driving Car: A Multimodal Reasoner for Visual Grounding

Thierry Deruyttere, Guillem Collell, Marie-Francine Moens

专题命中 视觉定位与Grounding :grounding(title,abstract);分类 cs.CV、cs.AI

Comments Updated acknowledgements

详情

展开后加载摘要…

URL PDF HTML 收藏
2007.01951 2021-04-27 cs.CV cs.LG 81%

Improving Weakly Supervised Visual Grounding by Contrastive Knowledge Distillation

Liwei Wang, Jing Huang, Yin Li, Kun Xu, Zhengyuan Yang, Dong Yu

专题命中 视觉定位与Grounding :grounding(title,abstract);分类 cs.CV、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏