arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视觉大模型 / VLM

视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。

共收录 5039 信号源:cs.CV, cs.AI, cs.LG

1. VLM训练与架构 5039 篇

2408.05478 2024-12-31 cs.AI cs.RO 79%

Multi-Agent Planning Using Visual Language Models

Michele Brienza, Francesco Argenziano, Vincenzo Suriani, Domenico D. Bloisi, Daniele Nardi

专题命中 VLM训练与架构 :visual language model(title,abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2305.14014 2024-12-25 cs.CV 79%

CLIP4STR: A Simple Baseline for Scene Text Recognition with Pre-trained Vision-Language Model

Shuai Zhao, Ruijie Quan, Linchao Zhu, Yi Yang

专题命中 VLM训练与架构 :vision-language model(title,abstract);分类 cs.CV

Comments Accepted by T-IP. A PyTorch re-implementation is at https://github.com/VamosC/CLIP4STR (Credit on GitHub@VamosC)

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.17610 2024-12-24 cs.CV 79%

Personalized Large Vision-Language Models

Chau Pham, Hoang Phan, David Doermann, Yunjie Tian

专题命中 VLM训练与架构 :vision-language model(title,abstract);分类 cs.CV

Comments A simple way to personalize your LLM

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.16524 2024-12-24 cs.CV 79%

LLaVA-SLT: Visual Language Tuning for Sign Language Translation

Han Liang, Chengyu Huang, Yuecheng Xu, Cheng Tang, Weicai Ye, Juze Zhang, Xin Chen, Jingyi Yu, Lan Xu

专题命中 VLM训练与架构 :LLaVA(title,abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.15650 2024-12-23 cs.LG 79%

Beyond Human Data: Aligning Multimodal Large Language Models by Iterative Self-Evolution

Wentao Tan, Qiong Cao, Yibing Zhan, Chao Xue, Changxing Ding

专题命中 VLM训练与架构 :multimodal large language model(title,abstract);分类 cs.LG

Comments AAAI 2025. The code is available at https://github.com/WentaoTan/SENA

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.04749 2024-12-20 cs.CV 79%

LLaVA Needs More Knowledge: Retrieval Augmented Natural Language Generation with Knowledge Graph for Explaining Thoracic Pathologies

Ameer Hamza, Abdullah, Yong Hyun Ahn, Sungyoung Lee, Seong Tae Kim

专题命中 VLM训练与架构 :LLaVA(title,abstract);分类 cs.CV

Comments AAAI2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.10680 2024-12-17 cs.CV cs.IR cs.MM 79%

UCDR-Adapter: Exploring Adaptation of Pre-Trained Vision-Language Models for Universal Cross-Domain Retrieval

Haoyu Jiang, Zhi-Qi Cheng, Gabriel Moreira, Jiawen Zhu, Jingdong Sun, Bukun Ren, Jun-Yan He, Qi Dai, Xian-Sheng Hua

专题命中 VLM训练与架构 :vision-language model(title,abstract);分类 cs.CV

Comments Accepted to WACV 2025. Project link: https://github.com/fine68/UCDR2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.09875 2024-12-16 cs.CV 79%

Selective State Space Memory for Large Vision-Language Models

Chee Ng, Yuen Fung

专题命中 VLM训练与架构 :vision-language model(title,abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.09613 2024-12-13 cs.CV 79%

PVC: Progressive Visual Token Compression for Unified Image and Video Processing in Large Vision-Language Models

Chenyu Yang, Xuan Dong, Xizhou Zhu, Weijie Su, Jiahao Wang, Hao Tian, Zhe Chen, Wenhai Wang, Lewei Lu, Jifeng Dai

专题命中 VLM训练与架构 :vision-language model(title,abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.08443 2024-12-12 cs.CV cs.MM 79%

POINTS1.5: Building a Vision-Language Model towards Real World Applications

Yuan Liu, Le Tian, Xiao Zhou, Xinyu Gao, Kavio Yu, Yang Yu, Jie Zhou

专题命中 VLM训练与架构 :vision-language model(title,abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.07247 2024-12-11 cs.CV 79%

Driving with InternVL: Oustanding Champion in the Track on Driving with Language of the Autonomous Grand Challenge at CVPR 2024

Jiahan Li, Zhiqi Li, Tong Lu

专题命中 VLM训练与架构 :InternVL(title,abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.02158 2024-12-05 cs.CV 79%

Agri-LLaVA: Knowledge-Infused Large Multimodal Assistant on Agricultural Pests and Diseases

Liqiong Wang, Teng Jin, Jinyu Yang, Ales Leonardis, Fangyi Wang, Feng Zheng

专题命中 VLM训练与架构 :LLaVA(title,abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2408.08855 2024-12-03 cs.CV 79%

DPA: Dual Prototypes Alignment for Unsupervised Adaptation of Vision-Language Models

Eman Ali, Sathira Silva, Muhammad Haris Khan

专题命中 VLM训练与架构 :vision-language model(title,abstract);分类 cs.CV

Comments Accepted at WACV 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2311.14064 2024-12-03 cs.CV 79%

HGCLIP: Exploring Vision-Language Models with Graph Representations for Hierarchical Understanding

Peng Xia, Xingtong Yu, Ming Hu, Lie Ju, Zhiyong Wang, Peibo Duan, Zongyuan Ge

专题命中 VLM训练与架构 :vision-language model(title,abstract);分类 cs.CV

Comments COLING 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.15735 2024-11-26 cs.CV 79%

Test-time Alignment-Enhanced Adapter for Vision-Language Models

Baoshun Tong, Kaiyu Song, Hanjiang Lai

专题命中 VLM训练与架构 :vision-language model(title,abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.15673 2024-11-26 cs.CV 79%

Semantic Shield: Defending Vision-Language Models Against Backdooring and Poisoning via Fine-grained Knowledge Alignment

Alvi Md Ishmam, Christopher Thomas

专题命中 VLM训练与架构 :vision-language model(title,abstract);分类 cs.CV

Comments CVPR 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.14925 2024-11-25 cs.HC cs.AI 79%

Purrfessor: A Fine-tuned Multimodal LLaVA Diet Health Chatbot

Linqi Lu, Yifan Deng, Chuan Tian, Sijia Yang, Dhavan Shah

专题命中 VLM训练与架构 :LLaVA(title,abstract);分类 cs.AI

Comments 10 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.02074 2024-11-19 cs.CV 79%

GraphVL: Graph-Enhanced Semantic Modeling via Vision-Language Models for Generalized Class Discovery

Bhupendra Solanki, Ashwin Nair, Mainak Singha, Souradeep Mukhopadhyay, Ankit Jha, Biplab Banerjee

专题命中 VLM训练与架构 :vision-language model(title,abstract);分类 cs.CV

Comments Accepted in ACM ICVGIP 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.01956 2024-11-13 cs.CV 79%

Enhance Image-to-Image Generation with LLaVA-generated Prompts

Zhicheng Ding, Panfeng Li, Qikai Yang, Siyang Li

专题命中 VLM训练与架构 :LLaVA(title,abstract);分类 cs.CV

Comments Accepted by 2024 5th International Conference on Information Science, Parallel and Distributed Systems

Journal ref Proceedings of the 2024 5th International Conference on Information Science, Parallel and Distributed Systems (ISPDS), 2024, pp. 77-81

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.03034 2024-11-06 cs.AI cs.MM 79%

HumanVLM: Foundation for Human-Scene Vision-Language Model

Dawei Dai, Xu Long, Li Yutang, Zhang Yuanhui, Shuyin Xia

专题命中 VLM训练与架构 :vision-language model(title,abstract);分类 cs.AI

Comments 34 pages,11 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.02999 2024-11-06 cs.CV 79%

Precise Drive with VLM: First Prize Solution for PRCV 2024 Drive LM challenge

Bin Huang, Siyu Wang, Yuanpeng Chen, Yidan Wu, Hui Song, Zifan Ding, Jing Leng, Chengpeng Liang, Peng Xue, Junliang Zhang, Tiankun Zhao

专题命中 VLM训练与架构 :VLM(title);InternVL(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2405.17815 2024-11-05 cs.CV 79%

Visual Anchors Are Strong Information Aggregators For Multimodal Large Language Model

Haogeng Liu, Quanzeng You, Xiaotian Han, Yongfei Liu, Huaibo Huang, Ran He, Hongxia Yang

专题命中 VLM训练与架构 :multimodal large language model(title,abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.11832 2024-10-30 cs.CV cs.MM 79%

Unveiling Encoder-Free Vision-Language Models

Haiwen Diao, Yufeng Cui, Xiaotong Li, Yueze Wang, Huchuan Lu, Xinlong Wang

专题命中 VLM训练与架构 :vision-language model(title,abstract);分类 cs.CV

Comments 17 pages, 8 figures, Accepted by NeurIPS2024 (spotlight)

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.16166 2024-10-22 cs.CV cs.CL 79%

Beyond Filtering: Adaptive Image-Text Quality Enhancement for MLLM Pretraining

Han Huang, Yuqi Huo, Zijia Zhao, Haoyu Lu, Shu Wu, Bingning Wang, Qiang Liu, Weipeng Chen, Liang Wang

专题命中 VLM训练与架构 :MLLM(title);multimodal large language model(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.09421 2024-10-21 cs.CV cs.CL 79%

VLFeedback: A Large-Scale AI Feedback Dataset for Large Vision-Language Models Alignment

Lei Li, Zhihui Xie, Mukai Li, Shunian Chen, Peiyi Wang, Liang Chen, Yazheng Yang, Benyou Wang, Lingpeng Kong, Qi Liu

专题命中 VLM训练与架构 :vision-language model(title,abstract);分类 cs.CV

Comments EMNLP 2024 Main Conference camera-ready version (fixed small typos). This article supersedes arXiv:2312.10665

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.04952 2024-10-18 cs.CL cs.CV 79%

Granular Privacy Control for Geolocation with Vision Language Models

Ethan Mendes, Yang Chen, James Hays, Sauvik Das, Wei Xu, Alan Ritter

专题命中 VLM训练与架构 :vision language model(title,abstract);分类 cs.CV

Comments Accepted to EMNLP 2024 main conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.07167 2024-10-17 cs.CV cs.CL 79%

Deciphering Cross-Modal Alignment in Large Vision-Language Models with Modality Integration Rate

Qidong Huang, Xiaoyi Dong, Pan Zhang, Yuhang Zang, Yuhang Cao, Jiaqi Wang, Dahua Lin, Weiming Zhang, Nenghai Yu

专题命中 VLM训练与架构 :vision-language model(title);vision language model(abstract);分类 cs.CV

Comments Project page: https://github.com/shikiw/Modality-Integration-Rate

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.07854 2024-10-11 cs.CV cs.MM 79%

HeGraphAdapter: Tuning Multi-Modal Vision-Language Models with Heterogeneous Graph Adapter

Yumiao Zhao, Bo Jiang, Xiao Wang, Qin Xu, Jin Tang

专题命中 VLM训练与架构 :vision-language model(title,abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.19178 2024-10-07 cs.CV eess.SP 79%

Power-LLaVA: Large Language and Vision Assistant for Power Transmission Line Inspection

Jiahao Wang, Mingxuan Li, Haichen Luo, Jinguo Zhu, Aijun Yang, Mingzhe Rong, Xiaohua Wang

专题命中 VLM训练与架构 :LLaVA(title,abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.01861 2024-10-04 cs.CV 79%

OCC-MLLM-Alpha:Empowering Multi-modal Large Language Model for the Understanding of Occluded Objects with Self-Supervised Test-Time Learning

Shuxin Yang, Xinhan Di

专题命中 VLM训练与架构 :MLLM(title);VLM(abstract);分类 cs.CV

Comments Accepted by ECCV 2024 Observing and Understanding Hands in Action Workshop (5 pages, 3 figures, 2 tables). arXiv admin note: substantial text overlap with arXiv:2410.01261

详情

展开后加载摘要…

URL PDF HTML 收藏