arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

视觉大模型 / VLM

视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。

共收录 5058 信号源:cs.CV, cs.AI, cs.LG

1. VLM训练与架构 5058 篇

2503.12332 2025-03-18 cs.CV 57%

VideoMAP: Toward Scalable Mamba-based Video Autoregressive Pretraining

Yunze Liu, Peiran Wu, Cheng Liang, Junxiao Shen, Limin Wang, Li Yi

专题命中 VLM训练与架构 :multimodal large language model(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.02304 2025-03-18 cs.CV 57%

A Token-level Text Image Foundation Model for Document Understanding

Tongkun Guan, Zining Wang, Pei Fu, Zhengtao Guo, Wei Shen, Kai Zhou, Tiezhu Yue, Chen Duan, Hao Sun, Qianyi Jiang, Junfeng Luo, Xiaokang Yang

专题命中 VLM训练与架构 :MLLM(abstract);分类 cs.CV

Comments 23 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.05662 2025-03-18 cs.CL cs.AI 57%

Cascaded Self-Evaluation Augmented Training for Lightweight Multimodal LLMs

Zheqi Lv, Wenkai Wang, Jiawei Wang, Shengyu Zhang, Fei Wu

专题命中 VLM训练与架构 :multimodal large language model(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.08689 2025-03-12 cs.CV 57%

QuoTA: Query-oriented Token Assignment via CoT Query Decouple for Long Video Comprehension

Yongdong Luo, Wang Chen, Xiawu Zheng, Weizhong Huang, Shukang Yin, Haojia Lin, Chaoyou Fu, Jinfa Huang, Jiayi Ji, Jiebo Luo, Rongrong Ji

专题命中 VLM训练与架构 :LLaVA(abstract);分类 cs.CV

Comments Project page: https://github.com/MAC-AutoML/QuoTA

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.08300 2025-03-12 cs.CV 57%

Feature Alignment with Equivariant Convolutions for Burst Image Super-Resolution

Xinyi Liu, Feiyu Tan, Qi Xie, Qian Zhao, Deyu Meng

专题命中 VLM训练与架构 :grounding(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.05204 2025-03-10 cs.CV 57%

Data-Efficient Generalization for Zero-shot Composed Image Retrieval

Zining Chen, Zhicheng Zhao, Fei Su, Xiaoqin Zhang, Shijian Lu

专题命中 VLM训练与架构 :vision-language model(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.21314 2025-03-10 cs.CV 57%

Raccoon: Multi-stage Diffusion Training with Coarse-to-Fine Curating Videos

Zhiyu Tan, Junyan Wang, Hao Yang, Luozheng Qin, Hesen Chen, Qiang Zhou, Hao Li

专题命中 VLM训练与架构 :vision-language model(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.20577 2025-03-10 cs.CV 57%

InstaFace: Identity-Preserving Facial Editing with Single Image Inference

MD Wahiduzzaman Khan, Mingshan Jia, Xiaolin Zhang, En Yu, Caifeng Shan, Kaska Musial-Gabrys

专题命中 VLM训练与架构 :vision-language model(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.10309 2025-03-10 cs.CV 57%

Modification Takes Courage: Seamless Image Stitching via Reference-Driven Inpainting

Ziqi Xie, Xiao Lai, Weidong Zhao, Siqi Jiang, Xianhui Liu, Wenlong Hou

专题命中 VLM训练与架构 :multimodal large language model(abstract);分类 cs.CV

Comments 18 pages, 10 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.04592 2025-03-07 cs.CV 57%

A Benchmark for Multi-Lingual Vision-Language Learning in Remote Sensing Image Captioning

Qing Zhou, Tao Yang, Junyu Gao, Weiping Ni, Junzheng Wu, Qi Wang

专题命中 VLM训练与架构 :vision-language model(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.04444 2025-03-07 cs.CV 57%

ToFu: Visual Tokens Reduction via Fusion for Multi-modal, Multi-patch, Multi-image Task

Vittorio Pippi, Matthieu Guillaumin, Silvia Cascianelli, Rita Cucchiara, Maximilian Jaritz, Loris Bazzani

专题命中 VLM训练与架构 :LLaVA(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.03202 2025-03-06 cs.CV 57%

Variance-Aware Loss Scheduling for Multimodal Alignment in Low-Data Settings

Sneh Pillai

专题命中 VLM训练与架构 :vision-language model(abstract);分类 cs.CV

Comments 8 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.12275 2025-03-04 cs.CV 57%

VoCo-LLaMA: Towards Vision Compression with Large Language Models

Xubing Ye, Yukang Gan, Xiaoke Huang, Yixiao Ge, Yansong Tang

专题命中 VLM训练与架构 :vision-language model(abstract);分类 cs.CV

Comments 11 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.20509 2025-03-03 cs.CV 57%

CoCa-CXR: Contrastive Captioners Learn Strong Temporal Structures for Chest X-Ray Vision-Language Understanding

Yixiong Chen, Shawn Xu, Andrew Sellergren, Yossi Matias, Avinatan Hassidim, Shravya Shetty, Daniel Golden, Alan Yuille, Lin Yang

专题命中 VLM训练与架构 :vision-language model(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.02052 2025-03-03 cs.CL cs.CV 57%

ExACT: Teaching AI Agents to Explore with Reflective-MCTS and Exploratory Learning

Xiao Yu, Baolin Peng, Vineeth Vajipey, Hao Cheng, Michel Galley, Jianfeng Gao, Zhou Yu

专题命中 VLM训练与架构 :vision-language model(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.19946 2025-02-28 cs.CV 57%

Space Rotation with Basis Transformation for Training-free Test-Time Adaptation

Chenhao Ding, Xinyuan Gao, Songlin Dong, Yuhang He, Qiang Wang, Xiang Song, Alex Kot, Yihong Gong

专题命中 VLM训练与架构 :VLM(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.19828 2025-02-28 cs.CV 57%

Analyzing CLIP's Performance Limitations in Multi-Object Scenarios: A Controlled High-Resolution Study

Reza Abbasi, Ali Nazari, Aminreza Sefid, Mohammadali Banayeeanzade, Mohammad Hossein Rohban, Mahdieh Soleymani Baghshah

专题命中 VLM训练与架构 :vision-language model(abstract);分类 cs.CV

Comments Accepted at ECCV 2024 Workshop EVAL-FoMo

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.17860 2025-02-28 cs.CV 57%

UniGS: Unified Language-Image-3D Pretraining with Gaussian Splatting

Haoyuan Li, Yanpeng Zhou, Tao Tang, Jifei Song, Yihan Zeng, Michael Kampffmeyer, Hang Xu, Xiaodan Liang

专题命中 VLM训练与架构 :vision-language model(abstract);分类 cs.CV

Comments ICLR 2025; Corrected citation of Uni3D;

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.19128 2025-02-27 cs.CV 57%

SCA3D: Enhancing Cross-modal 3D Retrieval via 3D Shape and Caption Paired Data Augmentation

Junlong Ren, Hao Wu, Hui Xiong, Hao Wang

专题命中 VLM训练与架构 :LLaVA(abstract);分类 cs.CV

Comments ICRA 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.19038 2025-02-27 cs.CV 57%

FungalZSL: Zero-Shot Fungal Classification with Image Captioning Using a Synthetic Data Approach

Anju Rani, Daniel O. Arroyo, Petar Durdevic

专题命中 VLM训练与架构 :vision-language model(abstract);分类 cs.CV

Comments 11 pages, 5 Figures, 1 Table

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.18356 2025-02-26 cs.LG 57%

WebGames: Challenging General-Purpose Web-Browsing AI Agents

George Thomas, Alex J. Chan, Jikun Kang, Wenqi Wu, Filippos Christianos, Fraser Greenlee, Andy Toulis, Marvin Purtorab

专题命中 VLM训练与架构 :vision-language model(abstract);分类 cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.16815 2025-02-25 cs.CV 57%

CLIP-SENet: CLIP-based Semantic Enhancement Network for Vehicle Re-identification

Liping Lu, Zihao Fu, Duanfeng Chu, Wei Wang, Bingrong Xu

专题命中 VLM训练与架构 :vision-language model(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.15809 2025-02-25 cs.LG eess.IV 57%

Black Sheep in the Herd: Playing with Spuriously Correlated Attributes for Vision-Language Recognition

Xinyu Tian, Shu Zou, Zhaoyuan Yang, Mengqi He, Jing Zhang

专题命中 VLM训练与架构 :vision-language model(abstract);分类 cs.LG

Comments Accepted to ICLR2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.14906 2025-02-24 cs.CL cs.AI 57%

Beyond Words: Exploring Cultural Value Sensitivity in Multimodal Models

Srishti Yadav, Zhi Zhang, Daniel Hershcovich, Ekaterina Shutova

专题命中 VLM训练与架构 :vision-language model(abstract);分类 cs.AI

Journal ref NAACL 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.12599 2025-02-19 cs.RO cs.LG 57%

Learning a High-quality Robotic Wiping Policy Using Systematic Reward Analysis and Visual-Language Model Based Curriculum

Yihong Liu, Dongyeop Kang, Sehoon Ha

专题命中 VLM训练与架构 :VLM(abstract);分类 cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.19684 2025-02-18 cs.AI 57%

Boosting Private Domain Understanding of Efficient MLLMs: A Tuning-free, Adaptive, Universal Prompt Optimization Framework

Jiang Liu, Bolin Li, Haoyuan Li, Tianwei Lin, Wenqiao Zhang, Tao Zhong, Zhelun Yu, Jinghao Wei, Hao Cheng, Wanggui He, Fangxun Shu, Hao Jiang, Zheqi Lv, Juncheng Li, Siliang Tang, Yueting Zhuang

专题命中 VLM训练与架构 :multimodal large language model(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.06720 2025-02-18 cs.CV cs.CL 57%

VP-MEL: Visual Prompts Guided Multimodal Entity Linking

Hongze Mi, Jinyuan Li, Xuying Zhang, Haoran Cheng, Jiahao Wang, Di Sun, Gang Pan

专题命中 VLM训练与架构 :VLM(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.08642 2025-02-13 cs.CV 57%

SwiftSketch: A Diffusion Model for Image-to-Vector Sketch Generation

Ellie Arar, Yarden Frenkel, Daniel Cohen-Or, Ariel Shamir, Yael Vinker

专题命中 VLM训练与架构 :vision-language model(abstract);分类 cs.CV

Comments https://swiftsketch.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.01943 2025-02-12 cs.CV 57%

DAMA: Data- and Model-aware Alignment of Multi-modal LLMs

Jinda Lu, Junkang Wu, Jinghan Li, Xiaojun Jia, Shuo Wang, YiFan Zhang, Junfeng Fang, Xiang Wang, Xiangnan He

专题命中 VLM训练与架构 :MLLM(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.06760 2025-02-11 cs.CV 57%

Ranking-aware adapter for text-driven image ordering with CLIP

Wei-Hsiang Yu, Yen-Yu Lin, Ming-Hsuan Yang, Yi-Hsuan Tsai

专题命中 VLM训练与架构 :vision-language model(abstract);分类 cs.CV

Comments Accepted by ICLR2025. Github link: github.com/uynaes/RankingAwareCLIP

详情

展开后加载摘要…

URL PDF HTML 收藏