arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视觉大模型 / VLM

视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。

共收录 1565 信号源:cs.CV, cs.AI, cs.LG

1. 其他VLM 1565 篇

2411.12790 2024-11-21 cs.CV cs.AI 81%

Visual-Oriented Fine-Grained Knowledge Editing for MultiModal Large Language Models

Zhen Zeng, Leijiang Gu, Xun Yang, Zhangling Duan, Zenglin Shi, Meng Wang

专题命中 其他VLM :multimodal large language model(title,abstract);分类 cs.CV、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.06764 2024-11-12 cs.CV cs.LG 81%

Multi-Stage Knowledge Integration of Vision-Language Models for Continual Learning

Hongsheng Zhang, Zhong Ji, Jingren Liu, Yanwei Pang, Jungong Han

专题命中 其他VLM :vision-language model(title);vision language model(abstract);分类 cs.CV、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.22707 2024-10-31 cs.RO cs.AI cs.CV 81%

Robotic State Recognition with Image-to-Text Retrieval Task of Pre-Trained Vision-Language Model and Black-Box Optimization

Kento Kawaharazuka, Yoshiki Obinata, Naoaki Kanazawa, Kei Okada, Masayuki Inaba

专题命中 其他VLM :vision-language model(title,abstract);分类 cs.CV、cs.AI

Comments Accepted at Humanoids2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.07593 2024-10-30 cs.CV cs.AI 81%

A Unified Debiasing Approach for Vision-Language Models across Modalities and Tasks

Hoin Jung, Taeuk Jang, Xiaoqian Wang

专题命中 其他VLM :vision-language model(title,abstract);分类 cs.CV、cs.AI

Comments NeurIPS 2024 (Spotlight), the Thirty-Eighth Annual Conference on Neural Information Processing Systems

详情

展开后加载摘要…

URL PDF HTML 收藏
2403.07350 2024-10-30 cs.CL cs.AI cs.CV 81%

VLKEB: A Large Vision-Language Model Knowledge Editing Benchmark

Han Huang, Haitian Zhong, Tao Yu, Qiang Liu, Shu Wu, Liang Wang, Tieniu Tan

专题命中 其他VLM :vision-language model(title,abstract);分类 cs.CV、cs.AI

Comments NeurIPS 2024, Datasets and Benchmarks Track

详情

展开后加载摘要…

URL PDF HTML 收藏
2402.02103 2024-10-30 cs.CV cs.LG 81%

Déjà Vu Memorization in Vision-Language Models

Bargav Jayaraman, Chuan Guo, Kamalika Chaudhuri

专题命中 其他VLM :vision-language model(title,abstract);分类 cs.CV、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.19808 2024-10-29 cs.CV cs.AI 81%

LocateBench: Evaluating the Locating Ability of Vision Language Models

Ting-Rui Chiang, Joshua Robinson, Xinyan Velocity Yu, Dani Yogatama

专题命中 其他VLM :vision language model(title,abstract);分类 cs.CV、cs.AI

Comments We release the dataset at https://usc-tamagotchi.github.io/locate-bench/

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.15397 2024-10-22 cs.LG cs.CL cs.CV 81%

IPO: Interpretable Prompt Optimization for Vision-Language Models

Yingjun Du, Wenfang Sun, Cees G. M. Snoek

专题命中 其他VLM :vision-language model(title,abstract);分类 cs.CV、cs.LG

Comments Accepted by NeurIPS 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.12790 2024-10-17 cs.CV cs.LG 81%

Dual Prototype Evolving for Test-Time Generalization of Vision-Language Models

Ce Zhang, Simon Stepputtis, Katia Sycara, Yaqi Xie

专题命中 其他VLM :vision-language model(title,abstract);分类 cs.CV、cs.LG

Comments Accepted by NeurIPS 2024. Project page: https://zhangce01.github.io/DPE-CLIP

详情

展开后加载摘要…

URL PDF HTML 收藏
2311.15569 2024-10-14 cs.CV cs.AI 81%

Towards Difficulty-Agnostic Efficient Transfer Learning for Vision-Language Models

Yongjin Yang, Jongwoo Ko, Se-Young Yun

专题命中 其他VLM :vision-language model(title,abstract);分类 cs.CV、cs.AI

Comments EMNLP 2024; code available at: https://github.com/YangYongJin/APEX

详情

展开后加载摘要…

URL PDF HTML 收藏
2408.14496 2024-09-19 cs.LG cs.AI cs.CL eess.IV 81%

A New Era in Computational Pathology: A Survey on Foundation and Vision-Language Models

Dibaloke Chanda, Milan Aryal, Nasim Yahya Soltani, Masoud Ganji

专题命中 其他VLM :vision-language model(title,abstract);分类 cs.AI、cs.LG

Comments 20 pages, 19 figures and 9 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2408.04664 2024-08-12 cs.CL cs.AI cs.CV 81%

Mitigating Hallucinations in Large Vision-Language Models (LVLMs) via Language-Contrastive Decoding (LCD)

Avshalom Manevich, Reut Tsarfaty

专题命中 其他VLM :vision-language model(title,abstract);分类 cs.CV、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2402.12750 2024-07-29 cs.CV cs.AI cs.CL 81%

Model Composition for Multimodal Large Language Models

Chi Chen, Yiyang Du, Zheng Fang, Ziyue Wang, Fuwen Luo, Peng Li, Ming Yan, Ji Zhang, Fei Huang, Maosong Sun, Yang Liu

专题命中 其他VLM :multimodal large language model(title,abstract);分类 cs.CV、cs.AI

Comments ACL2024 Main Conference; Code is available at https://github.com/THUNLP-MT/ModelCompose

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.12638 2024-06-19 cs.CV cs.LG 81%

Efficient and Long-Tailed Generalization for Pre-trained Vision-Language Model

Jiang-Xin Shi, Chi Zhang, Tong Wei, Yu-Feng Li

专题命中 其他VLM :vision-language model(title,abstract);分类 cs.CV、cs.LG

Comments Accepted by KDD 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.05756 2024-06-11 cs.AI cs.CL cs.CV cs.MM 81%

EmbSpatial-Bench: Benchmarking Spatial Understanding for Embodied Tasks with Large Vision-Language Models

Mengfei Du, Binhao Wu, Zejun Li, Xuanjing Huang, Zhongyu Wei

专题命中 其他VLM :vision-language model(title,abstract);分类 cs.CV、cs.AI

Comments Accepted by ACL 2024 Main

详情

展开后加载摘要…

URL PDF HTML 收藏
2405.19423 2024-05-31 cs.CV cs.AI 81%

Evaluating Vision-Language Models on Bistable Images

Artemis Panagopoulou, Coby Melkin, Chris Callison-Burch

专题命中 其他VLM :vision-language model(title,abstract);分类 cs.CV、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2404.16339 2024-04-26 cs.CV cs.AI 81%

Training-Free Unsupervised Prompt for Vision-Language Models

Sifan Long, Linbin Wang, Zhen Zhao, Zichang Tan, Yiming Wu, Shengsheng Wang, Jingdong Wang

专题命中 其他VLM :vision-language model(title,abstract);分类 cs.CV、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2401.15914 2024-04-17 cs.CV cs.AI 81%

Overcoming the Pitfalls of Vision-Language Model Finetuning for OOD Generalization

Yuhang Zang, Hanlin Goh, Josh Susskind, Chen Huang

专题命中 其他VLM :vision-language model(title,abstract);分类 cs.CV、cs.AI

Comments ICLR 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2404.04072 2024-04-08 cs.CV cs.LG 81%

Label Propagation for Zero-shot Classification with Vision-Language Models

Vladan Stojnić, Yannis Kalantidis, Giorgos Tolias

专题命中 其他VLM :vision-language model(title,abstract);分类 cs.CV、cs.LG

Comments CVPR 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2403.08239 2024-03-19 cs.RO cs.CV cs.LG 81%

Continuous Object State Recognition for Cooking Robots Using Pre-Trained Vision-Language Models and Black-box Optimization

Kento Kawaharazuka, Naoaki Kanazawa, Yoshiki Obinata, Kei Okada, Masayuki Inaba

专题命中 其他VLM :vision-language model(title,abstract);分类 cs.CV、cs.LG

Comments accepted at IEEE Robotics and Automation Letters (RA-L), website - https://haraduka.github.io/continuous-state-recognition/

详情

展开后加载摘要…

URL PDF HTML 收藏
2305.07019 2024-03-18 cs.CV cs.AI cs.CL 81%

Musketeer: Joint Training for Multi-task Vision Language Model with Task Explanation Prompts

Zhaoyang Zhang, Yantao Shen, Kunyu Shi, Zhaowei Cai, Jun Fang, Siqi Deng, Hao Yang, Davide Modolo, Zhuowen Tu, Stefano Soatto

专题命中 其他VLM :vision language model(title);vision-language model(abstract);分类 cs.CV、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2402.17969 2024-02-29 cs.CV cs.AI 81%

Vision Language Model-based Caption Evaluation Method Leveraging Visual Context Extraction

Koki Maeda, Shuhei Kurita, Taiki Miyanishi, Naoaki Okazaki

专题命中 其他VLM :vision language model(title,abstract);分类 cs.CV、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2401.14502 2024-01-29 cs.RO cs.CV cs.LG 81%

MResT: Multi-Resolution Sensing for Real-Time Control with Vision-Language Models

Saumya Saxena, Mohit Sharma, Oliver Kroemer

专题命中 其他VLM :vision-language model(title,abstract);分类 cs.CV、cs.LG

Comments CoRL'23, Project website: http://tinyurl.com/multi-res-realtime-control

详情

展开后加载摘要…

URL PDF HTML 收藏
2305.14053 2023-11-14 cs.CV cs.LG 81%

Parts of Speech-Grounded Subspaces in Vision-Language Models

James Oldfield, Christos Tzelepis, Yannis Panagakis, Mihalis A. Nicolaou, Ioannis Patras

专题命中 其他VLM :vision-language model(title,abstract);分类 cs.CV、cs.LG

Comments Accepted at NeurIPS 2023

详情

展开后加载摘要…

URL PDF HTML 收藏
2311.05746 2023-11-13 cs.CY cs.AI cs.CL cs.CV 81%

Bridging the Digital Divide: Performance Variation across Socio-Economic Factors in Vision-Language Models

Joan Nwatu, Oana Ignat, Rada Mihalcea

专题命中 其他VLM :vision-language model(title,abstract);分类 cs.CV、cs.AI

Journal ref EMNLP 2023

详情

展开后加载摘要…

URL PDF HTML 收藏
2310.06123 2023-10-11 cs.CV cs.AI 81%

Text-driven Prompt Generation for Vision-Language Models in Federated Learning

Chen Qiu, Xingyu Li, Chaithanya Kumar Mummadi, Madan Ravi Ganesh, Zhenzhen Li, Lu Peng, Wan-Yi Lin

专题命中 其他VLM :vision-language model(title,abstract);分类 cs.CV、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2303.06628 2023-08-14 cs.CV cs.LG 81%

Preventing Zero-Shot Transfer Degradation in Continual Learning of Vision-Language Models

Zangwei Zheng, Mingyuan Ma, Kai Wang, Ziheng Qin, Xiangyu Yue, Yang You

专题命中 其他VLM :vision-language model(title,abstract);分类 cs.CV、cs.LG

Comments Accepted by ICCV 2023

详情

展开后加载摘要…

URL PDF HTML 收藏
2211.11736 2023-07-04 cs.RO cs.AI cs.LG 81%

Robotic Skill Acquisition via Instruction Augmentation with Vision-Language Models

Ted Xiao, Harris Chan, Pierre Sermanet, Ayzaan Wahid, Anthony Brohan, Karol Hausman, Sergey Levine, Jonathan Tompson

专题命中 其他VLM :vision-language model(title,abstract);分类 cs.AI、cs.LG

Comments Published as a conference paper at RSS 2023

详情

展开后加载摘要…

URL PDF HTML 收藏
2210.01253 2023-02-13 cs.CV cs.CL cs.LG 81%

PLOT: Prompt Learning with Optimal Transport for Vision-Language Models

Guangyi Chen, Weiran Yao, Xiangchen Song, Xinyue Li, Yongming Rao, Kun Zhang

专题命中 其他VLM :vision-language model(title,abstract);分类 cs.CV、cs.LG

Comments ICLR 2023, Spotlight

详情

展开后加载摘要…

URL PDF HTML 收藏
2209.06103 2022-09-15 cs.CV cs.AI cs.CL 81%

VL-Taboo: An Analysis of Attribute-based Zero-shot Capabilities of Vision-Language Models

Felix Vogel, Nina Shvetsova, Leonid Karlinsky, Hilde Kuehne

专题命中 其他VLM :vision-language model(title,abstract);分类 cs.CV、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏