arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视觉大模型 / VLM

视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。

共收录 7360 信号源:cs.CV, cs.AI, cs.LG

1. 视觉定位与Grounding 7360 篇

2307.09267 2023-07-19 cs.CV 79%

Distilling Coarse-to-Fine Semantic Matching Knowledge for Weakly Supervised 3D Visual Grounding

Zehan Wang, Haifeng Huang, Yang Zhao, Linjun Li, Xize Cheng, Yichen Zhu, Aoxiong Yin, Zhou Zhao

专题命中 视觉定位与Grounding :grounding(title,abstract);分类 cs.CV

Comments ICCV2023

详情

展开后加载摘要…

URL PDF HTML 收藏
2307.05963 2023-07-13 cs.RO cs.CV 79%

GVCCI: Lifelong Learning of Visual Grounding for Language-Guided Robotic Manipulation

Junghyun Kim, Gi-Cheon Kang, Jaein Kim, Suyeon Shin, Byoung-Tak Zhang

专题命中 视觉定位与Grounding :grounding(title,abstract);分类 cs.CV

Comments Accepted at IROS2023

详情

展开后加载摘要…

URL PDF HTML 收藏
2307.05873 2023-07-13 cs.CV 79%

OG: Equip vision occupancy with instance segmentation and visual grounding

Zichao Dong, Hang Ji, Weikun Zhang, Xufeng Huang, Junbo Chen

专题命中 视觉定位与Grounding :grounding(title,abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2306.04652 2023-06-09 cs.CV 79%

Language Adaptive Weight Generation for Multi-task Visual Grounding

Wei Su, Peihan Miao, Huanzhang Dou, Gaoang Wang, Liang Qiao, Zheyang Li, Xi Li

专题命中 视觉定位与Grounding :grounding(title,abstract);分类 cs.CV

Comments Accepted by CVPR2023

详情

展开后加载摘要…

URL PDF HTML 收藏
2209.10918 2023-06-01 cs.CV cs.CL cs.IR 79%

CONE: An Efficient COarse-to-fiNE Alignment Framework for Long Video Temporal Grounding

Zhijian Hou, Wanjun Zhong, Lei Ji, Difei Gao, Kun Yan, Wing-Kwong Chan, Chong-Wah Ngo, Zheng Shou, Nan Duan

专题命中 视觉定位与Grounding :grounding(title,abstract);分类 cs.CV

Comments ACL 2023 Camera Ready. 14 pages, 7 figures, 4 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2305.18993 2023-05-31 cs.CV 79%

ConES: Concept Embedding Search for Parameter Efficient Tuning Large Vision Language Models

Huahui Yi, Ziyuan Qin, Wei Xu, Miaotian Guo, Kun Wang, Shaoting Zhang, Kang Li, Qicheng Lao

专题命中 视觉定位与Grounding :vision language model(title);vision-language model(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2209.13359 2023-05-26 cs.CV cs.CL 79%

Towards Parameter-Efficient Integration of Pre-Trained Language Models In Temporal Video Grounding

Erica K. Shimomoto, Edison Marrese-Taylor, Hiroya Takamura, Ichiro Kobayashi, Hideki Nakayama, Yusuke Miyao

专题命中 视觉定位与Grounding :grounding(title,abstract);分类 cs.CV

Comments Accepted for Findings of ACL2023

详情

展开后加载摘要…

URL PDF HTML 收藏
2305.13668 2023-05-24 cs.CL cs.LG 79%

Grounding and Distinguishing Conceptual Vocabulary Through Similarity Learning in Embodied Simulations

Sadaf Ghaffari, Nikhil Krishnaswamy

专题命中 视觉定位与Grounding :grounding(title,abstract);分类 cs.LG

Comments Accepted at IWCS Conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2301.09071 2023-05-16 cs.CV 79%

Variational Cross-Graph Reasoning and Adaptive Structured Semantics Learning for Compositional Temporal Grounding

Juncheng Li, Siliang Tang, Linchao Zhu, Wenqiao Zhang, Yi Yang, Tat-Seng Chua, Fei Wu, Yueting Zhuang

专题命中 视觉定位与Grounding :grounding(title,abstract);分类 cs.CV

Comments arXiv admin note: substantial text overlap with arXiv:2203.13049

Journal ref IEEE Transactions on Pattern Analysis and Machine Intelligence 2023

详情

展开后加载摘要…

URL PDF HTML 收藏
2212.01588 2023-05-15 cs.CL cs.AI 79%

RHO ($ρ$): Reducing Hallucination in Open-domain Dialogues with Knowledge Grounding

Ziwei Ji, Zihan Liu, Nayeon Lee, Tiezheng Yu, Bryan Wilie, Min Zeng, Pascale Fung

专题命中 视觉定位与Grounding :grounding(title,abstract);分类 cs.AI

Comments accepted by ACL 2023 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2305.04123 2023-05-09 cs.CV 79%

Transform-Equivariant Consistency Learning for Temporal Sentence Grounding

Daizong Liu, Xiaoye Qu, Jianfeng Dong, Pan Zhou, Zichuan Xu, Haozhao Wang, Xing Di, Weining Lu, Yu Cheng

专题命中 视觉定位与Grounding :grounding(title,abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2212.09736 2023-05-04 cs.CL cs.AI 79%

Don't Generate, Discriminate: A Proposal for Grounding Language Models to Real-World Environments

Yu Gu, Xiang Deng, Yu Su

专题命中 视觉定位与Grounding :grounding(title,abstract);分类 cs.AI

Comments 18 pages, 6 figures, 6 tables; accepted to ACL'2023

详情

展开后加载摘要…

URL PDF HTML 收藏
2304.13130 2023-04-27 cs.CV 79%

Hypernymization of named entity-rich captions for grounding-based multi-modal pretraining

Giacomo Nebbia, Adriana Kovashka

专题命中 视觉定位与Grounding :grounding(title,abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2105.08481 2023-04-26 cs.CL cs.CV 79%

Parallel Attention Network with Sequence Matching for Video Grounding

Hao Zhang, Aixin Sun, Wei Jing, Liangli Zhen, Joey Tianyi Zhou, Rick Siow Mong Goh

专题命中 视觉定位与Grounding :grounding(title,abstract);分类 cs.CV

Comments 15 pages, 10 figures, 7 tables, Findings at ACL 2021

详情

展开后加载摘要…

URL PDF HTML 收藏
2304.02556 2023-04-06 cs.CV 79%

Detecting and Grounding Multi-Modal Media Manipulation

Rui Shao, Tianxing Wu, Ziwei Liu

专题命中 视觉定位与Grounding :grounding(title,abstract);分类 cs.CV

Comments CVPR 2023. Project page: https://rshaojimmy.github.io/Projects/MultiModal-DeepFake Code: https://github.com/rshaojimmy/MultiModal-DeepFake

详情

展开后加载摘要…

URL PDF HTML 收藏
2303.17647 2023-04-03 cs.CL cs.CV 79%

Detecting and Grounding Important Characters in Visual Stories

Danyang Liu, Frank Keller

专题命中 视觉定位与Grounding :grounding(title,abstract);分类 cs.CV

Comments AAAI 2023

详情

展开后加载摘要…

URL PDF HTML 收藏
2303.17018 2023-03-31 cs.AI 79%

System Predictor: Grounding Size Estimator for Logic Programs under Answer Set Semantics

Daniel Bresnahan, Nicholas Hippen, Yuliya Lierler

专题命中 视觉定位与Grounding :grounding(title,abstract);分类 cs.AI

Comments Under consideration in Theory and Practice of Logic Programming (TPLP)

详情

展开后加载摘要…

URL PDF HTML 收藏
2303.14644 2023-03-28 cs.CV 79%

Affordance Grounding from Demonstration Video to Target Image

Joya Chen, Difei Gao, Kevin Qinghong Lin, Mike Zheng Shou

专题命中 视觉定位与Grounding :grounding(title,abstract);分类 cs.CV

Comments CVPR 2023

详情

展开后加载摘要…

URL PDF HTML 收藏
2303.13186 2023-03-24 cs.CV 79%

ScanERU: Interactive 3D Visual Grounding based on Embodied Reference Understanding

Ziyang Lu, Yunqiang Pei, Guoqing Wang, Yang Yang, Zheng Wang, Heng Tao Shen

专题命中 视觉定位与Grounding :grounding(title,abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2303.12027 2023-03-22 cs.CV 79%

Joint Visual Grounding and Tracking with Natural Language Specification

Li Zhou, Zikun Zhou, Kaige Mao, Zhenyu He

专题命中 视觉定位与Grounding :grounding(title,abstract);分类 cs.CV

Comments Accepted by CVPR 2023

详情

展开后加载摘要…

URL PDF HTML 收藏
2302.08063 2023-03-21 cs.CV 79%

MINOTAUR: Multi-task Video Grounding From Multimodal Queries

Raghav Goyal, Effrosyni Mavroudi, Xitong Yang, Sainbayar Sukhbaatar, Leonid Sigal, Matt Feiszli, Lorenzo Torresani, Du Tran

专题命中 视觉定位与Grounding :grounding(title,abstract);分类 cs.CV

Comments 22 pages, 8 figures and 13 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2303.09665 2023-03-20 cs.CV 79%

LOCATE: Localize and Transfer Object Parts for Weakly Supervised Affordance Grounding

Gen Li, Varun Jampani, Deqing Sun, Laura Sevilla-Lara

专题命中 视觉定位与Grounding :grounding(title,abstract);分类 cs.CV

Comments CVPR 2023, Project page: https://reagan1311.github.io/locate/, Video: https://www.youtube.com/watch?v=RLHansdFxII

详情

展开后加载摘要…

URL PDF HTML 收藏
2303.07748 2023-03-15 cs.CV cs.MM 79%

Generation-Guided Multi-Level Unified Network for Video Grounding

Xing Cheng, Xiangyu Wu, Dong Shen, Hezheng Lin, Fan Yang

专题命中 视觉定位与Grounding :grounding(title,abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2303.07618 2023-03-15 cs.CV 79%

Medical Phrase Grounding with Region-Phrase Context Contrastive Alignment

Zhihao Chen, Yang Zhou, Anh Tran, Junting Zhao, Liang Wan, Gideon Ooi, Lionel Cheng, Choon Hua Thng, Xinxing Xu, Yong Liu, Huazhu Fu

专题命中 视觉定位与Grounding :grounding(title,abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2303.06545 2023-03-14 cs.CV 79%

Towards Diverse Temporal Grounding under Single Positive Labels

Hao Zhou, Chongyang Zhang, Yanjun Chen, Chuanping Hu

专题命中 视觉定位与Grounding :grounding(title,abstract);分类 cs.CV

Comments The source codes are available at https://github.com/zhouhaocv/DTG-SPL

详情

展开后加载摘要…

URL PDF HTML 收藏
2209.15639 2023-02-27 cs.CV 79%

F-VLM: Open-Vocabulary Object Detection upon Frozen Vision and Language Models

Weicheng Kuo, Yin Cui, Xiuye Gu, AJ Piergiovanni, Anelia Angelova

专题命中 视觉定位与Grounding :VLM(title,abstract);分类 cs.CV

Comments Accepted to ICLR 2023 (https://iclr.cc/Conferences/2023). 20 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2302.11252 2023-02-23 cs.CV 79%

Focusing On Targets For Improving Weakly Supervised Visual Grounding

Viet-Quoc Pham, Nao Mishima

专题命中 视觉定位与Grounding :grounding(title,abstract);分类 cs.CV

Comments accepted by ICASSP2023

详情

展开后加载摘要…

URL PDF HTML 收藏
2302.10813 2023-02-22 cs.CV 79%

Tracking Objects and Activities with Attention for Temporal Sentence Grounding

Zeyu Xiong, Daizong Liu, Pan Zhou, Jiahao Zhu

专题命中 视觉定位与Grounding :grounding(title,abstract);分类 cs.CV

Comments accepted by ICASSP2023

详情

展开后加载摘要…

URL PDF HTML 收藏
2302.09850 2023-02-21 cs.CV 79%

Constraint and Union for Partially-Supervised Temporal Sentence Grounding

Chen Ju, Haicheng Wang, Jinxiang Liu, Chaofan Ma, Ya Zhang, Peisen Zhao, Jianlong Chang, Qi Tian

专题命中 视觉定位与Grounding :grounding(title,abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2211.02219 2023-02-15 cs.CV 79%

Understanding and Mitigating Overfitting in Prompt Tuning for Vision-Language Models

Chengcheng Ma, Yang Liu, Jiankang Deng, Lingxi Xie, Weiming Dong, Changsheng Xu

专题命中 视觉定位与Grounding :vision-language model(title,abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏