arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视觉大模型 / VLM

视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。

共收录 7387 信号源:cs.CV, cs.AI, cs.LG

1. 视觉定位与Grounding 7387 篇

2407.12498 2024-07-18 cs.CL cs.CV 70%

Evaluating Linguistic Capabilities of Multimodal LLMs in the Lens of Few-Shot Learning

Mustafa Dogan, Ilker Kesen, Iacer Calixto, Aykut Erdem, Erkut Erdem

专题命中 视觉定位与Grounding :grounding(abstract);multimodal large language model(abstract);分类 cs.CV

Comments Preprint. 33 pages, 17 Figures, 3 Tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.12345 2024-07-18 cs.CV 70%

VisionTrap: Vision-Augmented Trajectory Prediction Guided by Textual Descriptions

Seokha Moon, Hyun Woo, Hongbeen Park, Haeji Jung, Reza Mahjourian, Hyung-gun Chi, Hyerin Lim, Sangpil Kim, Jinkyu Kim

专题命中 视觉定位与Grounding :vision-language model(abstract);VLM(abstract);分类 cs.CV

Comments Accepted at ECCV 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2312.03766 2024-07-18 cs.CL cs.CV 70%

Mismatch Quest: Visual and Textual Feedback for Image-Text Misalignment

Brian Gordon, Yonatan Bitton, Yonatan Shafir, Roopal Garg, Xi Chen, Dani Lischinski, Daniel Cohen-Or, Idan Szpektor

专题命中 视觉定位与Grounding :vision language model(abstract);grounding(abstract);分类 cs.CV

Journal ref ECCV 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.10655 2024-07-16 cs.CV 70%

OVLW-DETR: Open-Vocabulary Light-Weighted Detection Transformer

Yu Wang, Xiangbo Su, Qiang Chen, Xinyu Zhang, Teng Xi, Kun Yao, Errui Ding, Gang Zhang, Jingdong Wang

专题命中 视觉定位与Grounding :vision-language model(abstract);VLM(abstract);分类 cs.CV

Comments 4 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2402.17766 2024-07-15 cs.CV 70%

ShapeLLM: Universal 3D Object Understanding for Embodied Interaction

Zekun Qi, Runpei Dong, Shaochen Zhang, Haoran Geng, Chunrui Han, Zheng Ge, Li Yi, Kaisheng Ma

专题命中 视觉定位与Grounding :grounding(abstract);multimodal large language model(abstract);分类 cs.CV

Comments Accepted at ECCV 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.16384 2024-07-12 cs.CV 70%

High-resolution open-vocabulary object 6D pose estimation

Jaime Corsetti, Davide Boscaini, Francesco Giuliari, Changjae Oh, Andrea Cavallaro, Fabio Poiesi

专题命中 视觉定位与Grounding :vision-language model(abstract);VLM(abstract);分类 cs.CV

Comments Technical report. Extension of CVPR paper "Open-vocabulary object 6D pose estimation". Project page: https://jcorsetti.github.io/oryon

详情

展开后加载摘要…

URL PDF HTML 收藏
2311.11241 2024-07-08 cs.CV 70%

Open-Vocabulary Camouflaged Object Segmentation

Youwei Pang, Xiaoqi Zhao, Jiaming Zuo, Lihe Zhang, Huchuan Lu

专题命中 视觉定位与Grounding :vision-language model(abstract);VLM(abstract);分类 cs.CV

Comments Update details. Acceptd by ECCV 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.04842 2024-06-10 cs.CV 70%

3rd Place Solution for MeViS Track in CVPR 2024 PVUW workshop: Motion Expression guided Video Segmentation

Feiyu Pan, Hao Fang, Xiankai Lu

专题命中 视觉定位与Grounding :vision-language model(abstract);VLM(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2405.08272 2024-05-15 cs.CV 70%

VS-Assistant: Versatile Surgery Assistant on the Demand of Surgeons

Zhen Chen, Xingjian Luo, Jinlin Wu, Danny T. M. Chan, Zhen Lei, Jinqiao Wang, Sebastien Ourselin, Hongbin Liu

专题命中 视觉定位与Grounding :multimodal large language model(abstract);MLLM(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2404.15785 2024-04-25 cs.CV 70%

Seeing Beyond Classes: Zero-Shot Grounded Situation Recognition via Language Explainer

Jiaming Lei, Lin Li, Chunping Wang, Jun Xiao, Long Chen

专题命中 视觉定位与Grounding :vision language model(abstract);grounding(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2404.14990 2024-04-24 cs.CV eess.IV 70%

Interpreting COVID Lateral Flow Tests' Results with Foundation Models

Stuti Pandey, Josh Myers-Dean, Jarek Reynolds, Danna Gurari

专题命中 视觉定位与Grounding :vision language model(abstract);grounding(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2404.05016 2024-04-09 cs.CV 70%

Hyperbolic Learning with Synthetic Captions for Open-World Detection

Fanjie Kong, Yanbei Chen, Jiarui Cai, Davide Modolo

专题命中 视觉定位与Grounding :vision-language model(abstract);grounding(abstract);分类 cs.CV

Comments CVPR 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2404.01232 2024-04-03 cs.CL cs.CV 70%

Open-Vocabulary Federated Learning with Multimodal Prototyping

Huimin Zeng, Zhenrui Yue, Dong Wang

专题命中 视觉定位与Grounding :vision-language model(abstract);VLM(abstract);分类 cs.CV

Comments Accepted at NAACL 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2404.01014 2024-04-02 cs.CV 70%

Harnessing Large Language Models for Training-free Video Anomaly Detection

Luca Zanella, Willi Menapace, Massimiliano Mancini, Yiming Wang, Elisa Ricci

专题命中 视觉定位与Grounding :vision-language model(abstract);VLM(abstract);分类 cs.CV

Comments CVPR 2024. Project website at https://lucazanella.github.io/lavad/

详情

展开后加载摘要…

URL PDF HTML 收藏
2310.01393 2024-04-02 cs.CV 70%

DST-Det: Simple Dynamic Self-Training for Open-Vocabulary Object Detection

Shilin Xu, Xiangtai Li, Size Wu, Wenwei Zhang, Yunhai Tong, Chen Change Loy

专题命中 视觉定位与Grounding :vision-language model(abstract);VLM(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2402.06092 2024-02-12 cs.CV cs.RO 70%

CLIP-Loc: Multi-modal Landmark Association for Global Localization in Object-based Maps

Shigemichi Matsuzaki, Takuma Sugino, Kazuhito Tanaka, Zijun Sha, Shintaro Nakaoka, Shintaro Yoshizawa, Kazuhiro Shintani

专题命中 视觉定位与Grounding :vision language model(abstract);VLM(abstract);分类 cs.CV

Comments 7 pages, 7 figures. Accepted to IEEE International Conference on Robotics and Automation (ICRA) 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2402.04630 2024-02-08 cs.CV 70%

LLMs Meet VLMs: Boost Open Vocabulary Object Detection with Fine-grained Descriptors

Sheng Jin, Xueying Jiang, Jiaxing Huang, Lewei Lu, Shijian Lu

专题命中 视觉定位与Grounding :vision language model(abstract);VLM(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2401.09413 2024-01-18 cs.CV 70%

POP-3D: Open-Vocabulary 3D Occupancy Prediction from Images

Antonin Vobecky, Oriane Siméoni, David Hurych, Spyros Gidaris, Andrei Bursuc, Patrick Pérez, Josef Sivic

专题命中 视觉定位与Grounding :vision-language model(abstract);grounding(abstract);分类 cs.CV

Comments accepted to NeurIPS 2023

详情

展开后加载摘要…

URL PDF HTML 收藏
2312.09237 2023-12-15 cs.CV 70%

Pixel Aligned Language Models

Jiarui Xu, Xingyi Zhou, Shen Yan, Xiuye Gu, Anurag Arnab, Chen Sun, Xiaolong Wang, Cordelia Schmid

专题命中 视觉定位与Grounding :vision-language model(abstract);grounding(abstract);分类 cs.CV

Comments Project page: https://jerryxu.net/PixelLLM

详情

展开后加载摘要…

URL PDF HTML 收藏
2312.03026 2023-12-07 cs.CV 70%

Uni3DL: Unified Model for 3D and Language Understanding

Xiang Li, Jian Ding, Zhaoyang Chen, Mohamed Elhoseiny

专题命中 视觉定位与Grounding :vision-language model(abstract);grounding(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2311.17122 2023-11-30 cs.CV 70%

Large Model Based Referring Camouflaged Object Detection

Shupeng Cheng, Ge-Peng Ji, Pengda Qin, Deng-Ping Fan, Bowen Zhou, Peng Xu

专题命中 视觉定位与Grounding :multimodal large language model(abstract);MLLM(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2311.16241 2023-11-29 cs.CV 70%

SemiVL: Semi-Supervised Semantic Segmentation with Vision-Language Guidance

Lukas Hoyer, David Joseph Tan, Muhammad Ferjad Naeem, Luc Van Gool, Federico Tombari

专题命中 视觉定位与Grounding :vision-language model(abstract);VLM(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2306.16605 2023-10-13 cs.RO cs.CV 70%

KITE: Keypoint-Conditioned Policies for Semantic Manipulation

Priya Sundaresan, Suneel Belkhale, Dorsa Sadigh, Jeannette Bohg

专题命中 视觉定位与Grounding :visual language model(abstract);grounding(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2306.05718 2023-10-11 cs.CV 70%

Learning Domain-Aware Detection Head with Prompt Tuning

Haochen Li, Rui Zhang, Hantao Yao, Xinkai Song, Yifan Hao, Yongwei Zhao, Ling Li, Yunji Chen

专题命中 视觉定位与Grounding :vision-language model(abstract);VLM(abstract);分类 cs.CV

Comments Accepted by NeurIPS 2023

详情

展开后加载摘要…

URL PDF HTML 收藏
2309.05069 2023-09-12 cs.CV 70%

Exploiting CLIP for Zero-shot HOI Detection Requires Knowledge Distillation at Multiple Levels

Bo Wan, Tinne Tuytelaars

专题命中 视觉定位与Grounding :vision-language model(abstract);VLM(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2309.03696 2023-09-08 cs.CV 70%

Efficient Adaptive Human-Object Interaction Detection with Concept-guided Memory

Ting Lei, Fabian Caba, Qingchao Chen, Hailin Jin, Yuxin Peng, Yang Liu

专题命中 视觉定位与Grounding :vision-language model(abstract);VLM(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2306.16658 2023-06-30 cs.CV 70%

Prompt Ensemble Self-training for Open-Vocabulary Domain Adaptation

Jiaxing Huang, Jingyi Zhang, Han Qiu, Sheng Jin, Shijian Lu

专题命中 视觉定位与Grounding :vision-language model(abstract);VLM(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2212.09737 2023-06-08 cs.CV 70%

Position-guided Text Prompt for Vision-Language Pre-training

Alex Jinpeng Wang, Pan Zhou, Mike Zheng Shou, Shuicheng Yan

专题命中 视觉定位与Grounding :visual reasoning(abstract);grounding(abstract);分类 cs.CV

Comments Camera-ready version, code is in https://github.com/sail-sg/ptp

详情

展开后加载摘要…

URL PDF HTML 收藏
2304.04514 2023-04-11 cs.CV 70%

DetCLIPv2: Scalable Open-Vocabulary Object Detection Pre-training via Word-Region Alignment

Lewei Yao, Jianhua Han, Xiaodan Liang, Dan Xu, Wei Zhang, Zhenguo Li, Hang Xu

专题命中 视觉定位与Grounding :vision-language model(abstract);grounding(abstract);分类 cs.CV

Comments Accepted to CVPR2023

详情

展开后加载摘要…

URL PDF HTML 收藏
2303.09553 2023-03-17 cs.CV cs.GR 70%

LERF: Language Embedded Radiance Fields

Justin Kerr, Chung Min Kim, Ken Goldberg, Angjoo Kanazawa, Matthew Tancik

专题命中 视觉定位与Grounding :vision-language model(abstract);grounding(abstract);分类 cs.CV

Comments Project website can be found at https://lerf.io

详情

展开后加载摘要…

URL PDF HTML 收藏