arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视觉大模型 / VLM

视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。

共收录 7348 信号源:cs.CV, cs.AI, cs.LG

1. 视觉定位与Grounding 7348 篇

2403.17124 2024-12-10 cs.RO cs.AI cs.CL cs.LG 81%

Grounding Language Plans in Demonstrations Through Counterfactual Perturbations

Yanwei Wang, Tsun-Hsuan Wang, Jiayuan Mao, Michael Hagenow, Julie Shah

专题命中 视觉定位与Grounding :grounding(title,abstract);分类 cs.AI、cs.LG

Comments ICLR 2024 Spotlight

Journal ref In International Conference on Learning Representations (ICLR) (2024)

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.03841 2024-12-06 cs.CV cs.AI 81%

LL-ICM: Image Compression for Low-level Machine Vision via Large Vision-Language Model

Yuan Xue, Qi Zhang, Chuanmin Jia, Shiqi Wang

专题命中 视觉定位与Grounding :vision-language model(title,abstract);分类 cs.CV、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.03561 2024-12-05 cs.CV cs.AI 81%

FLAIR: VLM with Fine-grained Language-informed Image Representations

Rui Xiao, Sanghwan Kim, Mariana-Iuliana Georgescu, Zeynep Akata, Stephan Alaniz

专题命中 视觉定位与Grounding :VLM(title);vision-language model(abstract);分类 cs.CV、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2408.14776 2024-11-28 cs.CV cs.AI 81%

MROVSeg: Breaking the Resolution Curse of Vision-Language Models in Open-Vocabulary Image Segmentation

Yuanbing Zhu, Bingke Zhu, Yingying Chen, Yunfang Niu, Ming Tang, Jinqiao Wang

专题命中 视觉定位与Grounding :vision-language model(title,abstract);分类 cs.CV、cs.AI

Comments Technical report

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.16407 2024-11-26 cs.CV cs.AI 81%

A Study on Unsupervised Domain Adaptation for Semantic Segmentation in the Era of Vision-Language Models

Manuel Schwonberg, Claus Werner, Hanno Gottschalk, Carsten Meyer

专题命中 视觉定位与Grounding :vision-language model(title,abstract);分类 cs.CV、cs.AI

Comments Accepted to British Machine Vision Conference (BMVC) 2024: Workshop on Robust Recognition in the Open World (RROW)

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.00299 2024-11-19 cs.CV cs.LG 81%

RadFlag: A Black-Box Hallucination Detection Method for Medical Vision Language Models

Serena Zhang, Sraavya Sambara, Oishi Banerjee, Julian Acosta, L. John Fahrner, Pranav Rajpurkar

专题命中 视觉定位与Grounding :vision language model(title,abstract);分类 cs.CV、cs.LG

Comments 17 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.05767 2024-11-15 cs.CV cs.AI cs.MM 81%

Grounding is All You Need? Dual Temporal Grounding for Video Dialog

You Qin, Wei Ji, Xinze Lan, Hao Fei, Xun Yang, Dan Guo, Roger Zimmermann, Lizi Liao

专题命中 视觉定位与Grounding :grounding(title,abstract);分类 cs.CV、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.00862 2024-11-06 cs.CV cs.AI 81%

A Simple and Effective Temporal Grounding Pipeline for Basketball Broadcast Footage

Levi Harris

专题命中 视觉定位与Grounding :grounding(title,abstract);分类 cs.CV、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.17531 2024-10-29 cs.CV cs.AI 81%

SimVG: A Simple Framework for Visual Grounding with Decoupled Multi-modal Fusion

Ming Dai, Lingfeng Yang, Yihao Xu, Zhenhua Feng, Wankou Yang

专题命中 视觉定位与Grounding :grounding(title,abstract);分类 cs.CV、cs.AI

Comments 24pages, 18figures, NeurIPS2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.01023 2024-10-24 cs.CV cs.AI 81%

Can visual language models resolve textual ambiguity with visual cues? Let visual puns tell you!

Jiwan Chung, Seungwon Lim, Jaehyun Jeon, Seungbeen Lee, Youngjae Yu

专题命中 视觉定位与Grounding :visual language model(title);grounding(abstract);分类 cs.CV、cs.AI

Comments Accepted as main paper in EMNLP 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.09662 2024-10-23 cs.CL cs.AI cs.CV 81%

Learning Language Structures through Grounding

Freda Shi

专题命中 视觉定位与Grounding :grounding(title,abstract);分类 cs.CV、cs.AI

Comments Ph.D. Thesis

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.08611 2024-10-14 cs.CV cs.AI 81%

Conjugated Semantic Pool Improves OOD Detection with Pre-trained Vision-Language Models

Mengyuan Chen, Junyu Gao, Changsheng Xu

专题命中 视觉定位与Grounding :vision-language model(title,abstract);分类 cs.CV、cs.AI

Comments 28 pages, accepted by NeurIPS 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.08257 2024-10-14 cs.CV cs.GR cs.LG 81%

Neural Material Adaptor for Visual Grounding of Intrinsic Dynamics

Junyi Cao, Shanyan Guan, Yanhao Ge, Wei Li, Xiaokang Yang, Chao Ma

专题命中 视觉定位与Grounding :grounding(title,abstract);分类 cs.CV、cs.LG

Comments NeurIPS 2024, the project page: https://xjay18.github.io/projects/neuma.html

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.19650 2024-10-01 cs.CV cs.AI 81%

Grounding 3D Scene Affordance From Egocentric Interactions

Cuiyu Liu, Wei Zhai, Yuhang Yang, Hongchen Luo, Sen Liang, Yang Cao, Zheng-Jun Zha

专题命中 视觉定位与Grounding :grounding(title,abstract);分类 cs.CV、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.12969 2024-09-23 cs.CL cs.CV cs.LG 81%

Seeing Through Their Eyes: Evaluating Visual Perspective Taking in Vision Language Models

Gracjan Góral, Alicja Ziarko, Michal Nauman, Maciej Wołczyk

专题命中 视觉定位与Grounding :vision language model(title,abstract);分类 cs.CV、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2408.16272 2024-08-30 cs.CV cs.AI 81%

Beyond Uncertainty: Evidential Deep Learning for Robust Video Temporal Grounding

Kaijing Ma, Haojian Huang, Jin Chen, Haodong Chen, Pengliang Ji, Xianghao Zang, Han Fang, Chao Ban, Hao Sun, Mulin Chen, Xuelong Li

专题命中 视觉定位与Grounding :grounding(title,abstract);分类 cs.CV、cs.AI

Comments Ongoing work: 28pages, 19 figures, 7 tables. Code is available at: https://kaijing.space/SRAM/

详情

展开后加载摘要…

URL PDF HTML 收藏
2408.07146 2024-08-15 cs.CV cs.AI 81%

Vision Language Model for Interpretable and Fine-grained Detection of Safety Compliance in Diverse Workplaces

Zhiling Chen, Hanning Chen, Mohsen Imani, Ruimin Chen, Farhad Imani

专题命中 视觉定位与Grounding :vision language model(title,abstract);分类 cs.CV、cs.AI

Comments 20 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2305.18279 2024-08-13 cs.CV cs.AI 81%

Contextual Object Detection with Multimodal Large Language Models

Yuhang Zang, Wei Li, Jun Han, Kaiyang Zhou, Chen Change Loy

专题命中 视觉定位与Grounding :multimodal large language model(title,abstract);分类 cs.CV、cs.AI

Comments IJCV 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2408.05097 2024-08-12 cs.LG cs.AI 81%

Hyperbolic Learning with Multimodal Large Language Models

Paolo Mandica, Luca Franco, Konstantinos Kallidromitis, Suzanne Petryk, Fabio Galasso

专题命中 视觉定位与Grounding :multimodal large language model(title);vision-language model(abstract);分类 cs.AI、cs.LG

Comments ECCV 2024 - Beyond Euclidean Workshop

详情

展开后加载摘要…

URL PDF HTML 收藏
2306.06048 2024-07-30 cs.CV cs.CY cs.LG 81%

How Does Fine-Tuning Impact Out-of-Distribution Detection for Vision-Language Models?

Yifei Ming, Yixuan Li

专题命中 视觉定位与Grounding :vision-language model(title,abstract);分类 cs.CV、cs.LG

Comments Accepted to IJCV 2023

Journal ref International Journal of Computer Vision 2023

详情

展开后加载摘要…

URL PDF HTML 收藏
2312.00083 2024-07-19 cs.CV cs.LG 81%

BAM-DETR: Boundary-Aligned Moment Detection Transformer for Temporal Sentence Grounding in Videos

Pilhyeon Lee, Hyeran Byun

专题命中 视觉定位与Grounding :grounding(title,abstract);分类 cs.CV、cs.LG

Comments Accepted by ECCV 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.12836 2024-07-19 cs.CL cs.AI cs.LG 81%

OSPC: Artificial VLM Features for Hateful Meme Detection

Peter Grönquist

专题命中 视觉定位与Grounding :VLM(title);vision-language model(abstract);分类 cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.12064 2024-07-18 eess.IV cs.CL cs.CV cs.LG cs.MM 81%

LiteGPT: Large Vision-Language Model for Joint Chest X-ray Localization and Classification Task

Khai Le-Duc, Ryan Zhang, Ngoc Son Nguyen, Tan-Hanh Pham, Anh Dao, Ba Hung Ngo, Anh Totti Nguyen, Truong-Son Hy

专题命中 视觉定位与Grounding :vision-language model(title,abstract);分类 cs.CV、cs.LG

Comments Preprint, 19 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.06304 2024-07-10 cs.CV cs.AI cs.CL 81%

VIMI: Grounding Video Generation through Multi-modal Instruction

Yuwei Fang, Willi Menapace, Aliaksandr Siarohin, Tsai-Shien Chen, Kuan-Chien Wang, Ivan Skorokhodov, Graham Neubig, Sergey Tulyakov

专题命中 视觉定位与Grounding :grounding(title,abstract);分类 cs.CV、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.05758 2024-07-09 eess.IV cs.AI cs.CV 81%

Potential of Multimodal Large Language Models for Data Mining of Medical Images and Free-text Reports

Yutong Zhang, Yi Pan, Tianyang Zhong, Peixin Dong, Kangni Xie, Yuxiao Liu, Hanqi Jiang, Zhengliang Liu, Shijie Zhao, Tuo Zhang, Xi Jiang, Dinggang Shen, Tianming Liu, Xin Zhang

专题命中 视觉定位与Grounding :multimodal large language model(title,abstract);分类 cs.CV、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2312.17648 2024-07-09 cs.CV cs.AI 81%

Bridging Modality Gap for Visual Grounding with Effecitve Cross-modal Distillation

Jiaxi Wang, Wenhui Hu, Xueyang Liu, Beihu Wu, Yuting Qiu, YingYing Cai

专题命中 视觉定位与Grounding :grounding(title,abstract);分类 cs.CV、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2402.01183 2024-07-03 cs.RO cs.AI cs.CL cs.CV 81%

LINGO-Space: Language-Conditioned Incremental Grounding for Space

Dohyun Kim, Nayoung Oh, Deokmin Hwang, Daehyung Park

专题命中 视觉定位与Grounding :grounding(title,abstract);分类 cs.CV、cs.AI

Comments Accepted by AAAI 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2312.12423 2024-06-21 cs.CV cs.AI 81%

Jack of All Tasks, Master of Many: Designing General-purpose Coarse-to-Fine Vision-Language Model

Shraman Pramanick, Guangxing Han, Rui Hou, Sayan Nag, Ser-Nam Lim, Nicolas Ballas, Qifan Wang, Rama Chellappa, Amjad Almahairi

专题命中 视觉定位与Grounding :vision-language model(title);grounding(abstract);分类 cs.CV、cs.AI

Comments CVPR 2024 Highlight

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.05629 2024-06-11 cs.CV cs.CL cs.IR cs.LG cs.SD eess.AS 81%

Separating the "Chirp" from the "Chat": Self-supervised Visual Grounding of Sound and Language

Mark Hamilton, Andrew Zisserman, John R. Hershey, William T. Freeman

专题命中 视觉定位与Grounding :grounding(title,abstract);分类 cs.CV、cs.LG

Comments Computer Vision and Pattern Recognition 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2312.09507 2024-06-04 cs.CV cs.AI 81%

WAVER: Writing-style Agnostic Text-Video Retrieval via Distilling Vision-Language Models Through Open-Vocabulary Knowledge

Huy Le, Tung Kieu, Anh Nguyen, Ngan Le

专题命中 视觉定位与Grounding :vision-language model(title,abstract);分类 cs.CV、cs.AI

Comments Accepted to ICASSP 2024

详情

展开后加载摘要…

URL PDF HTML 收藏