arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

视觉大模型 / VLM

视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。

共收录 5058 信号源:cs.CV, cs.AI, cs.LG

1. VLM训练与架构 5058 篇

2505.07704 2025-05-13 cs.CV cs.CL 57%

Through the Looking Glass: Common Sense Consistency Evaluation of Weird Images

Elisei Rykov, Kseniia Petrushina, Kseniia Titova, Anton Razzhigaev, Alexander Panchenko, Vasily Konovalov

机构 * Skoltech(斯克利切夫斯克技术大学) AIRI(人工智能研究所) MTS AI(MTS人工智能) Moscow Institute of Physics and Technology(莫斯科物理技术学院)

专题命中 VLM训练与架构 :vision-language model(abstract);分类 cs.CV

Journal ref Proceedings of the 2025 Conference of the Nations of the Americas Chapter of the Association for Computational Linguistics: Human Language Technologies (Volume 4: Student Research Workshop)

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.06592 2025-05-13 cs.CV 57%

Batch Augmentation with Unimodal Fine-tuning for Multimodal Learning

H M Dipu Kabir, Subrota Kumar Mondal, Mohammad Ali Moni

机构 * AI and Cyber Futures Institute, Charles Sturt University, Australia(人工智能与网络未来研究所,查尔斯·斯特劳特大学,澳大利亚) Rural Health Research Institute, Charles Sturt University, Australia(农村健康研究研究所,查尔斯·斯特劳特大学,澳大利亚) School of Computer Science and Engineering, Macau University of Science and Technology, Macao(计算机科学与工程学院,澳门科学技术大学,澳门)

专题命中 VLM训练与架构 :multimodal large language model(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.04651 2025-05-09 cs.CL cs.LG 57%

Scientific Hypothesis Generation and Validation: Methods, Datasets, and Future Directions

Adithya Kulkarni, Fatimah Alotaibi, Xinyue Zeng, Longfeng Wu, Tong Zeng, Barry Menglong Yao, Minqian Liu, Shuaicheng Zhang, Lifu Huang, Dawei Zhou

机构 * Virginia Tech(弗吉尼亚理工大学) University of California, Davis(加州大学戴维斯分校)

专题命中 VLM训练与架构 :grounding(abstract);分类 cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.04512 2025-05-09 cs.CV 57%

HunyuanCustom: A Multimodal-Driven Architecture for Customized Video Generation

Teng Hu, Zhentao Yu, Zhengguang Zhou, Sen Liang, Yuan Zhou, Qin Lin, Qinglin Lu

机构 * Tencent Hunyuan(腾讯文汇)

专题命中 VLM训练与架构 :LLaVA(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.04601 2025-05-08 cs.CV 57%

OpenVision: A Fully-Open, Cost-Effective Family of Advanced Vision Encoders for Multimodal Learning

Xianhang Li, Yanqing Liu, Haoqin Tu, Hongru Zhu, Cihang Xie

机构 * University of California, Santa Cruz(加州大学圣克鲁兹分校)

专题命中 VLM训练与架构 :LLaVA(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.03667 2025-05-07 cs.CV 57%

Distribution-Conditional Generation: From Class Distribution to Creative Generation

Fu Feng, Yucheng Xie, Xu Yang, Jing Wang, Xin Geng

机构 * School of Computer Science and Engineering, Southeast University, Nanjing, China(计算机科学与工程学院,东南大学,南京,中国) Key Laboratory of New Generation Artificial Intelligence Technology and Its Interdisciplinary Applications (Southeast University), Ministry of Education, China(新一代人工智能技术及其跨学科应用重点实验室(东南大学),教育部,中国)

专题命中 VLM训练与架构 :vision-language model(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2311.14284 2025-05-07 cs.CV 57%

Paragraph-to-Image Generation with Information-Enriched Diffusion Model

Weijia Wu, Zhuang Li, Yefei He, Mike Zheng Shou, Chunhua Shen, Lele Cheng, Yan Li, Tingting Gao, Di Zhang

机构 * Kuaishou Technology(快手科技) Zhejiang University(浙江大学) Show Lab, National University of Singapore(新加坡国立大学Show实验室)

专题命中 VLM训练与架构 :vision-language model(abstract);分类 cs.CV

Comments The project website is at: https://weijiawu.github.io/ParaDiffusionPage/. Code: https://github.com/weijiawu/ParaDiffusion

Journal ref IJCV 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.00156 2025-05-02 cs.CV 57%

V3LMA: Visual 3D-enhanced Language Model for Autonomous Driving

Jannik Lübberstedt, Esteban Rivera, Nico Uhlemann, Markus Lienkamp

机构 * Technical University of Munich (TUM)(慕尼黑技术大学) Munich Institute of Robotics and Machine Intelligence (MIRMI)(慕尼黑机器人与智能机械研究所)

专题命中 VLM训练与架构 :vision language model(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2403.10635 2025-05-01 cs.CV 57%

MeDSLIP: Medical Dual-Stream Language-Image Pre-training with Pathology-Anatomy Semantic Alignment

Wenrui Fan, Mohammod N. I. Suvon, Shuo Zhou, Xianyuan Liu, Samer Alabed, Venet Osmani, Andrew J. Swift, Chen Chen, Haiping Lu

机构 * Centre for Machine Intelligence and School of Computer Science, University of Sheffield(智能中心和计算机科学学院,谢菲尔德大学) School of Medicine and Population Health, and INSIGNEO, Institute for in Silico Medicine, University of Sheffield(医学与人口健康学院,INSIGNEO,虚拟医学研究所,谢菲尔德大学) Digital Environment Research Institute, Queen Mary University of London(数字环境研究所,伦敦大学玛丽女王学院) School of Computer Science, University of Sheffield(计算机科学学院,谢菲尔德大学) Department of Computing, Imperial College London(计算系,伦敦帝国学院)

专题命中 VLM训练与架构 :vision-language model(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.20384 2025-04-30 cs.CV 57%

FiLA-Video: Spatio-Temporal Compression for Fine-Grained Long Video Understanding

Yanan Guo, Wenhui Dong, Jun Song, Shiding Zhu, Xuan Zhang, Hanqing Yang, Yingbo Wang, Yang Du, Xianing Chen, Bo Zheng

机构 * University of Science and Technology of China(中国科学技术大学) Alibaba Group(阿里巴巴集团) ZheJiang University(浙江大学)

专题命中 VLM训练与架构 :vision language model(abstract);分类 cs.CV

Comments 8 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.17789 2025-04-29 cs.CV 57%

Token-Shuffle: Towards High-Resolution Image Generation with Autoregressive Models

Xu Ma, Peize Sun, Haoyu Ma, Hao Tang, Chih-Yao Ma, Jialiang Wang, Kunpeng Li, Xiaoliang Dai, Yujun Shi, Xuan Ju, Yushi Hu, Artsiom Sanakoyeu, Felix Juefei-Xu, Ji Hou, Junjiao Tian, Tao Xu, Tingbo Hou, Yen-Cheng Liu, Zecheng He, Zijian He, Matt Feiszli, Peizhao Zhang, Peter Vajda, Sam Tsai, Yun Fu

机构 * Northeastern University(东北大学) Meta GenAI(Meta 生成人工智能) Meta FAIR National University of Singapore(国立新加坡大学) The Chinese University of Hong Kong(香港中文大学) University of Washington(华盛顿大学)

专题命中 VLM训练与架构 :multimodal large language model(abstract);分类 cs.CV

Comments Project Page: https://ma-xu.github.io/token-shuffle/ Add related works

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.23452 2025-04-29 cs.CV 57%

VideoGen-Eval: Agent-based System for Video Generation Evaluation

Yuhang Yang, Ke Fan, Shangkun Sun, Hongxiang Li, Ailing Zeng, FeiLin Han, Wei Zhai, Wei Liu, Yang Cao, Zheng-Jun Zha

机构 * USTC(中国科学技术大学) SJTU(上海交通大学) PKUSZ(北京大学软件学院) Tencent(腾讯) BFA(北京航空航天大学)

专题命中 VLM训练与架构 :MLLM(abstract);分类 cs.CV

Comments project:https://github.com/AILab-CVC/VideoGen-Eval

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.18478 2025-04-29 cs.CV 57%

Video-XL-Pro: Reconstructive Token Compression for Extremely Long Video Understanding

Xiangrui Liu, Yan Shu, Zheng Liu, Ao Li, Yang Tian, Bo Zhao

机构 * School of AI, Shanghai Jiao Tong University(上海交通大学人工智能学院) Beijing Academy of Artificial Intelligence(北京人工智能研究院) University of Trento(特伦多大学)

专题命中 VLM训练与架构 :multimodal large language model(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.16427 2025-04-25 cs.CL cs.AI cs.MM 57%

Can Large Language Models Help Multimodal Language Analysis? MMLA: A Comprehensive Benchmark

Hanlei Zhang, Zhuohang Li, Yeshuang Zhu, Hua Xu, Peiwu Wang, Haige Zhu, Jie Zhou, Jinchao Zhang

机构 * Department of Computer Science and Technology, Tsinghua University(清华大学计算机科学与技术系) Pattern Recognition Center, WeChat AI, Tencent Inc, China(腾讯人工智能研究院) Kennesaw State University(凯斯西储大学)

专题命中 VLM训练与架构 :multimodal large language model(abstract);分类 cs.AI

Comments 23 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.08802 2025-04-25 cs.CL cs.CV cs.IR 57%

jina-clip-v2: Multilingual Multimodal Embeddings for Text and Images

Andreas Koukounas, Georgios Mastrapas, Sedigheh Eslami, Bo Wang, Mohammad Kalim Akram, Michael Günther, Isabelle Mohr, Saba Sturua, Nan Wang, Han Xiao

机构 * Jina AI GmbH(Jina AI公司)

专题命中 VLM训练与架构 :vision-language model(abstract);分类 cs.CV

Comments 30 pages, 1-10 main paper, 10-12 refs, 12-30 benchmarks

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.04918 2025-04-25 cs.CV 57%

Training-free Zero-shot Composed Image Retrieval via Weighted Modality Fusion and Similarity

Ren-Di Wu, Yu-Yen Lin, Huei-Fang Yang

机构 * National Sun Yat-sen University(国立中山大学)

专题命中 VLM训练与架构 :multimodal large language model(abstract);分类 cs.CV

Comments 14 pages, 6 figures, International Conference on Technologies and Applications of Artificial Intelligence (TAAI) Camera Ready

Journal ref Technologies and Applications of Artificial Intelligence, pp. 77-90, Springer, 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2408.02657 2025-04-25 cs.CV 57%

Lumina-mGPT: Illuminate Flexible Photorealistic Text-to-Image Generation with Multimodal Generative Pretraining

Dongyang Liu, Shitian Zhao, Le Zhuo, Weifeng Lin, Yi Xin, Xinyue Li, Qi Qin, Yu Qiao, Hongsheng Li, Peng Gao

专题命中 VLM训练与架构 :visual question answering(abstract);分类 cs.CV

Comments Code available at: https://github.com/Alpha-VLLM/Lumina-mGPT

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.14666 2025-04-22 cs.CV 57%

Generative Multimodal Pretraining with Discrete Diffusion Timestep Tokens

Kaihang Pan, Wang Lin, Zhongqi Yue, Tenglong Ao, Liyu Jia, Wei Zhao, Juncheng Li, Siliang Tang, Hanwang Zhang

机构 * Zhejiang University(浙江大学) Nanyang Technological University(新加坡国立大学) Peking University(北京大学) Huawei Singapore Research Center(华为新加坡研究中心)

专题命中 VLM训练与架构 :multimodal large language model(abstract);分类 cs.CV

Comments Accepted by CVPR 2025 (Oral)

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.13074 2025-04-22 cs.CV 57%

SkyReels-V2: Infinite-length Film Generative Model

Guibin Chen, Dixuan Lin, Jiangping Yang, Chunze Lin, Junchen Zhu, Mingyuan Fan, Hao Zhang, Sheng Chen, Zheng Chen, Chengcheng Ma, Weiming Xiong, Wei Wang, Nuo Pang, Kang Kang, Zhiheng Xu, Yuzhe Jin, Yupeng Liang, Yubing Song, Peng Zhao, Boyuan Xu, Di Qiu, Debang Li, Zhengcong Fei, Yang Li, Yahui Zhou

专题命中 VLM训练与架构 :MLLM(abstract);分类 cs.CV

Comments 31 pages,10 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.23869 2025-04-22 cs.LG 57%

Communication-Efficient and Personalized Federated Foundation Model Fine-Tuning via Tri-Matrix Adaptation

Yongle Li, Bo Liu, Sheng Huang, ZHeng ZHang, Xiaotong Yuan, Richang Hong

机构 * Hefei University of Technology(合肥工业大学) Chongqing University(重庆大学) Tsinghua University(清华大学) Nanjing University(南京大学)

专题命中 VLM训练与架构 :VLM(abstract);分类 cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.04616 2025-04-22 cs.CV 57%

Assessing and Learning Alignment of Unimodal Vision and Language Models

Le Zhang, Qian Yang, Aishwarya Agrawal

机构 * Mila - Quebec AI Institute(魁北克人工智能研究所) Université de Montréal(蒙特利尔大学) Canada CIFAR AI Chair(加拿大CIFAR人工智能 chair)

专题命中 VLM训练与架构 :multimodal large language model(abstract);分类 cs.CV

Comments CVPR 2025 Highlight

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.12476 2025-04-18 cs.CY cs.AI 57%

What do people expect from Artificial Intelligence? Public opinion on alignment in AI moderation from Germany and the United States

Andreas Jungherr, Adrian Rauchfleisch

专题命中 VLM训练与架构 :grounding(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.07265 2025-04-18 cs.CV 57%

ViTOC: Vision Transformer and Object-aware Captioner

Feiyang Huang

专题命中 VLM训练与架构 :vision-language model(abstract);分类 cs.CV

Comments The core idea is too close to what has been published in other journals

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.11930 2025-04-17 cs.CV 57%

Beyond Words: Augmenting Discriminative Richness via Diffusions in Unsupervised Prompt Learning

Hairui Ren, Fan Tang, He Zhao, Zixuan Wang, Dandan Guo, Yi Chang

专题命中 VLM训练与架构 :vision-language model(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.10001 2025-04-17 cs.CV 57%

GaussVideoDreamer: 3D Scene Generation with Video Diffusion and Inconsistency-Aware Gaussian Splatting

Junlin Hao, Peiheng Wang, Haoyang Wang, Xinggong Zhang, Zongming Guo

专题命中 VLM训练与架构 :LLaVA(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.05810 2025-04-16 cs.CV 57%

PaMi-VDPO: Mitigating Video Hallucinations by Prompt-Aware Multi-Instance Video Preference Learning

Xinpeng Ding, Kui Zhang, Jianhua Han, Lanqing Hong, Hang Xu, Xiaomeng Li

专题命中 VLM训练与架构 :multimodal large language model(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.09518 2025-04-15 cs.CV 57%

3D CoCa: Contrastive Learners are 3D Captioners

Ting Huang, Zeyu Zhang, Yemin Wang, Hao Tang

专题命中 VLM训练与架构 :grounding(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.16739 2025-04-14 cs.CV 57%

UNEM: UNrolled Generalized EM for Transductive Few-Shot Learning

Long Zhou, Fereshteh Shakeri, Aymen Sadraoui, Mounir Kaaniche, Jean-Christophe Pesquet, Ismail Ben Ayed

专题命中 VLM训练与架构 :vision-language model(abstract);分类 cs.CV

Comments Accepted by CVPR2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.07424 2025-04-11 cs.AI 57%

Routing to the Right Expertise: A Trustworthy Judge for Instruction-based Image Editing

Chenxi Sun, Hongzhi Zhang, Qi Wang, Fuzheng Zhang

专题命中 VLM训练与架构 :multimodal large language model(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.19050 2025-04-11 cs.CV 57%

I Dream My Painting: Connecting MLLMs and Diffusion Models via Prompt Generation for Text-Guided Multi-Mask Inpainting

Nicola Fanelli, Gennaro Vessio, Giovanna Castellano

专题命中 VLM训练与架构 :LLaVA(abstract);分类 cs.CV

Comments Accepted at WACV 2025

详情

展开后加载摘要…

URL PDF HTML 收藏