arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

视觉大模型 / VLM

视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。

共收录 5058 信号源:cs.CV, cs.AI, cs.LG

1. VLM训练与架构 5058 篇

2508.04469 2025-08-07 cs.CV cs.CL 57%

FrEVL: Leveraging Frozen Pretrained Embeddings for Efficient Vision-Language Understanding

Emmanuelle Bourigault, Pauline Bourigault

机构 * Department of Engineering Science, University of Oxford(牛津大学工程科学系) Department of Electrical Engineering, Imperial College London(伦敦帝国学院电子工程系)

专题命中 VLM训练与架构 :vision-language model(abstract);分类 cs.CV

Comments 8 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.01602 2025-08-07 cs.CV 57%

Enhancing Zero-Shot Brain Tumor Subtype Classification via Fine-Grained Patch-Text Alignment

Lubin Gan, Jing Zhang, Linhao Qu, Yijun Wang, Siying Wu, Xiaoyan Sun

机构 * University of Science and Technology of China(科学技术大学) Fudan University(复旦大学)

专题命中 VLM训练与架构 :vision-language model(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.02532 2025-08-05 cs.CL cs.LG 57%

Contextual Graph Transformer: A Small Language Model for Enhanced Engineering Document Information Extraction

Karan Reddy, Mayukha Pal

专题命中 VLM训练与架构 :grounding(abstract);分类 cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.02331 2025-08-05 cs.CV cs.SD 57%

VAEmo: Efficient Representation Learning for Visual-Audio Emotion with Knowledge Injection

Hao Cheng, Zhiwei Zhao, Yichao He, Zhenzhen Hu, Jia Li, Meng Wang, Richang Hong

机构 * Hefei University of Technology(合肥工业大学)

专题命中 VLM训练与架构 :multimodal large language model(abstract);分类 cs.CV

Comments Source code and pre-trained models will be available at https://github.com/MSA-LMC/VAEmo

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.19903 2025-08-05 cs.CV 57%

Scaling Vision Pre-Training to 4K Resolution

Baifeng Shi, Boyi Li, Han Cai, Yao Lu, Sifei Liu, Marco Pavone, Jan Kautz, Song Han, Trevor Darrell, Pavlo Molchanov, Hongxu Yin

机构 * UC Berkeley(加州大学伯克利分校) NVIDIA(英伟达)

专题命中 VLM训练与架构 :MLLM(abstract);分类 cs.CV

Comments CVPR 2025. Project Page: https://nvlabs.github.io/PS3

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.07025 2025-08-05 cs.CV cs.CL 57%

CheXalign: Preference fine-tuning in chest X-ray interpretation models without human feedback

Dennis Hein, Zhihong Chen, Sophie Ostmeier, Justin Xu, Maya Varma, Eduardo Pontes Reis, Arne Edward Michalson, Christian Bluethgen, Hyun Joo Shin, Curtis Langlotz, Akshay S Chaudhari

机构 * Stanford University(斯坦福大学) University of Oxford(牛津大学) University Hospital Zurich, University of Zurich(苏黎世大学医院、苏黎世大学) Yongin Severance Hospital, Yonsei University(永临松医院、延世大学)

专题命中 VLM训练与架构 :vision-language model(abstract);分类 cs.CV

Comments ACL 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2307.15640 2025-08-05 cs.CV cs.MM 57%

CLIP Brings Better Features to Visual Aesthetics Learners

Liwu Xu, Jinjin Xu, Yuzhe Yang, Xilu Wang, Yijie Huang, Yaqian Li

机构 * OPPO AI Center(OPPO人工智能中心) University of Surrey(塞弗尔大学)

专题命中 VLM训练与架构 :vision-language model(abstract);分类 cs.CV

Comments ICME 2025 Oral

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.22062 2025-08-04 cs.CV cs.CL 57%

Meta CLIP 2: A Worldwide Scaling Recipe

Yung-Sung Chuang, Yang Li, Dong Wang, Ching-Feng Yeh, Kehan Lyu, Ramya Raghavendra, James Glass, Lifei Huang, Jason Weston, Luke Zettlemoyer, Xinlei Chen, Zhuang Liu, Saining Xie, Wen-tau Yih, Shang-Wen Li, Hu Xu

机构 * FAIR, Meta(FAIR与Meta公司) MIT(麻省理工学院) Princeton University(普林斯顿大学) New York University(纽约大学)

专题命中 VLM训练与架构 :multimodal large language model(abstract);分类 cs.CV

Comments 10 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.23373 2025-08-01 cs.CV 57%

Multi-Prompt Progressive Alignment for Multi-Source Unsupervised Domain Adaptation

Haoran Chen, Zexiao Wang, Haidong Cao, Zuxuan Wu, Yu-Gang Jiang

机构 * Institute of Trustworthy Embodied AI, Fudan University(可信具身人工智能研究院,复旦大学)

专题命中 VLM训练与架构 :vision-language model(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.22003 2025-07-31 cs.CV 57%

See Different, Think Better: Visual Variations Mitigating Hallucinations in LVLMs

Ziyun Dai, Xiaoqiang Li, Shaohua Zhang, Yuanchen Wu, Jide Li

专题命中 VLM训练与架构 :vision-language model(abstract);分类 cs.CV

Comments Accepted by ACM MM25

Journal ref 33rd ACM International Conference on Multimedia 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.22100 2025-07-31 cs.CV 57%

Trade-offs in Image Generation: How Do Different Dimensions Interact?

Sicheng Zhang, Binzhu Xie, Zhonghao Yan, Yuli Zhang, Donghao Zhou, Xiaofei Chen, Shi Qiu, Jiaqi Liu, Guoyang Xie, Zhichao Lu

机构 * Khalifa University(卡利法大学) The Chinese University of Hong Kong(香港中文大学) Queen Mary University of London(伦敦大学玛丽女王学院) Xi’an Jiaotong-Liverpool University(西安交通大学利物浦大学) City University of Hong Kong(香港城市大学)

专题命中 VLM训练与架构 :VLM(abstract);分类 cs.CV

Comments Accepted in ICCV 2025, Codebase: https://github.com/fesvhtr/TRIG

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.11824 2025-07-29 cs.CV 57%

KITTEN: A Knowledge-Intensive Evaluation of Image Generation on Visual Entities

Hsin-Ping Huang, Xinyi Wang, Yonatan Bitton, Hagai Taitelbaum, Gaurav Singh Tomar, Ming-Wei Chang, Xuhui Jia, Kelvin C. K. Chan, Hexiang Hu, Yu-Chuan Su, Ming-Hsuan Yang

专题命中 VLM训练与架构 :MLLM(abstract);分类 cs.CV

Comments Project page: https://kitten-project.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.18915 2025-07-28 cs.CL cs.CV 57%

Mining Contextualized Visual Associations from Images for Creativity Understanding

Ananya Sahu, Amith Ananthram, Kathleen McKeown

机构 * Columbia University(哥伦比亚大学)

专题命中 VLM训练与架构 :vision-language model(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.18531 2025-07-25 cs.CV 57%

IntentVCNet: Bridging Spatio-Temporal Gaps for Intention-Oriented Controllable Video Captioning

Tianheng Qiu, Jingchun Gao, Jingyu Li, Huiyi Leong, Xuan Huang, Xi Wang, Xiaocheng Zhang, Kele Xu, Lan Zhang

机构 * University of Science and Technology of China(中国科学技术大学) Hefei Institutes of Physical Science,Chinese Academy of Sciences(合肥物理研究所,中国科学院) Institute of Artificial Intelligence, Hefei Comprehensive National Science Center(人工智能研究所,合肥综合性国家科学中心) State Key Lab. for Novel Software Technology, Nanjing University(新型软件技术国家重点实验室,南京大学) University of Chicago(芝加哥大学) National University of Defense Technology(国防科技大学) Harbin Institute of Technology(哈尔滨工业大学)

专题命中 VLM训练与架构 :visual language model(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.23825 2025-07-25 cs.CV 57%

Flash-VStream: Efficient Real-Time Understanding for Long Video Streams

Haoji Zhang, Yiqin Wang, Yansong Tang, Yong Liu, Jiashi Feng, Xiaojie Jin

机构 * Tsinghua University(清华大学) Tsinghua Shenzhen International Graduate School(清华大学深圳国际研究生院) Beijing Jiaotong University(北京交通大学) ByteDance Inc(字节跳动公司)

专题命中 VLM训练与架构 :multimodal large language model(abstract);分类 cs.CV

Comments Accepted by ICCV 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.02591 2025-07-24 cs.CV 57%

AuroraLong: Bringing RNNs Back to Efficient Open-Ended Video Understanding

Weili Xu, Enxin Song, Wenhao Chai, Xuexiang Wen, Tian Ye, Gaoang Wang

机构 * Zhejiang University(浙江大学) University of Washington(华盛顿大学) HKUST (GZ)(香港科技大学(广州)) Zhejiang University / Shanghai AI Lab(浙江大学/上海人工智能实验室)

专题命中 VLM训练与架构 :LLaVA(abstract);分类 cs.CV

Comments ICCV 2025 Camera Ready

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.06312 2025-07-23 cs.CV 57%

DOFA-CLIP: Multimodal Vision-Language Foundation Models for Earth Observation

Zhitong Xiong, Yi Wang, Weikang Yu, Adam J Stewart, Jie Zhao, Nils Lehmann, Thomas Dujardin, Zhenghang Yuan, Pedram Ghamisi, Xiao Xiang Zhu

机构 * Technical University of Munich(慕尼黑技术大学) Helmholtz-Zentrum Dresden-Rossendorf(德累斯顿-罗斯托克亥姆霍尔茨中心)

专题命中 VLM训练与架构 :vision-language model(abstract);分类 cs.CV

Comments code & weights: https://github.com/xiong-zhitong/DOFA-CLIP

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.15576 2025-07-22 cs.CL cs.CV 57%

Smart Eyes for Silent Threats: VLMs and In-Context Learning for THz Imaging

Nicolas Poggi, Shashank Agnihotri, Margret Keuper

机构 * Data and Web Science Group, University of Mannheim(曼海姆大学数据与网络科学组) Max-Planck-Institute for Informatics, Saarland Informatics Campus(马克斯·普朗克信息研究所,萨尔兰州信息校区)

专题命中 VLM训练与架构 :vision-language model(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.15281 2025-07-22 cs.CL cs.AI 57%

A Novel Self-Evolution Framework for Large Language Models

Haoran Sun, Zekun Zhang, Shaoning Zeng

机构 * Haoran Sun, Zekun Zhang, Shaoning Zeng(作者)

专题命中 VLM训练与架构 :grounding(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.15130 2025-07-22 cs.CV 57%

Enhancing Visual Planning with Auxiliary Tasks and Multi-token Prediction

Ce Zhang, Yale Song, Ruta Desai, Michael Louis Iuzzolino, Joseph Tighe, Gedas Bertasius, Satwik Kottur

机构 * UNC Chapel Hill(北卡罗来纳大学教堂山分校) Meta

专题命中 VLM训练与架构 :multimodal large language model(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.09442 2025-07-22 cs.CV 57%

Advancing Textual Prompt Learning with Anchored Attributes

Zheng Li, Yibing Song, Ming-Ming Cheng, Xiang Li, Jian Yang

机构 * PCA Lab, VCIP, College of Computer Science, Nankai University(PCA实验室、VCIP、计算机科学学院、南开大学) DAMO Academy, Alibaba Group(达摩院、阿里巴巴集团)

专题命中 VLM训练与架构 :vision-language model(abstract);分类 cs.CV

Comments ICCV 2025. Code: https://github.com/zhengli97/ATPrompt. Project Page: https://zhengli97.github.io/ATPrompt/

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.06656 2025-07-22 eess.AS cs.CL cs.LG cs.SD 57%

Sortformer: A Novel Approach for Permutation-Resolved Speaker Supervision in Speech-to-Text Systems

Taejin Park, Ivan Medennikov, Kunal Dhawan, Weiqing Wang, He Huang, Nithin Rao Koluguri, Krishna C. Puvvada, Jagadeesh Balam, Boris Ginsburg

机构 * nvidia

专题命中 VLM训练与架构 :multimodal large language model(abstract);分类 cs.LG

Comments Published at ICML 2025

Journal ref Proceedings of the 42nd International Conference on Machine Learning (ICML), 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.13609 2025-07-21 cs.CV cs.CL 57%

CoTasks: Chain-of-Thought based Video Instruction Tuning Tasks

Yanan Wang, Julio Vizcarra, Zhi Li, Hao Niu, Mori Kurokawa

机构 * KDDI Research, Inc.(KDDI研究公司)

专题命中 VLM训练与架构 :LLaVA(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.10432 2025-07-17 cs.CV 57%

Text-Visual Semantic Constrained AI-Generated Image Quality Assessment

Qiang Li, Qingsen Yan, Haojian Huang, Peng Wu, Haokui Zhang, Yanning Zhang

机构 * Northwestern Polytechnical University(西北工业大学) The University of Hong Kong(香港大学)

专题命中 VLM训练与架构 :multimodal large language model(abstract);分类 cs.CV

Comments 9 pages, 5 figures, Accepted at ACMMM 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.01069 2025-07-15 cs.CV 57%

UniQA: Unified Vision-Language Pre-training for Image Quality and Aesthetic Assessment

Hantao Zhou, Longxiang Tang, Rui Yang, Guanyi Qin, Yan Zhang, Yutao Li, Xiu Li, Runze Hu, Guangtao Zhai

机构 * Tsinghua Shenzhen International Graduate School, Tsinghua University(清华大学深圳国际研究生院,清华大学) Media Analytics and Computing Lab, Department of Artificial Intelligence, School of Informatics, Xiamen University(媒体分析与计算实验室,人工智能系,厦门大学) School of Computer Science and Technology, Ocean University of China(计算机科学与技术学院,中国海洋大学) Institute of Image Communication and Information Processing, Shanghai Jiao Tong University(图像通信与信息处理研究所,上海交通大学)

专题命中 VLM训练与架构 :multimodal large language model(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.09615 2025-07-15 cs.CV 57%

Towards Fine-Grained Adaptation of CLIP via a Self-Trained Alignment Score

Eman Ali, Sathira Silva, Chetan Arora, Muhammad Haris Khan

机构 * Mohamed Bin Zayed University of Artificial Intelligence(莫莫德·本·扎耶德人工智能大学) IIT Delhi(德里印度理工学院) Alexandria University(亚历山大大学)

专题命中 VLM训练与架构 :vision-language model(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.08590 2025-07-14 cs.MM cs.CV 57%

Visual Semantic Description Generation with MLLMs for Image-Text Matching

Junyu Chen, Yihua Gao, Mingyong Li

机构 * Chongqing Normal University(重庆师范大学)

专题命中 VLM训练与架构 :multimodal large language model(abstract);分类 cs.CV

Comments Accepted by ICME2025 oral

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.07104 2025-07-14 cs.CV 57%

Vision-Language-Vision Auto-Encoder: Scalable Knowledge Distillation from Diffusion Models

Tiezheng Zhang, Yitong Li, Yu-cheng Chou, Jieneng Chen, Alan Yuille, Chen Wei, Junfei Xiao

机构 * Johns Hopkins University(约翰霍普金斯大学) Tsinghua University(清华大学) Rice University(Rice 大学)

专题命中 VLM训练与架构 :vision-language model(abstract);分类 cs.CV

Comments Project Page: https://lambert-x.github.io/Vision-Language-Vision/

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.06679 2025-07-10 cs.CV 57%

Text-promptable Object Counting via Quantity Awareness Enhancement

Miaojing Shi, Xiaowen Zhang, Zijie Yue, Yong Luo, Cairong Zhao, Li Li

机构 * College of Electronic and Information Engineering, Tongji University(同济大学电子与信息学院) College of Computer Science, Wuhan University(武汉大学计算机学院) College of Computer Science, Tongji University(同济大学计算机学院) State Key Laboratory of Autonomous Intelligent Unmanned Systems(自主智能无人系统国家重点实验室)

专题命中 VLM训练与架构 :vision-language model(abstract);分类 cs.CV

Comments 13 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.20214 2025-07-09 cs.CV cs.MM 57%

UniCode$^2$: Cascaded Large-scale Codebooks for Unified Multimodal Understanding and Generation

Yanzhe Chen, Huasong Zhong, Yan Li, Zhenheng Yang

机构 * ByteDance(字节跳动)

专题命中 VLM训练与架构 :multimodal large language model(abstract);分类 cs.CV

Comments 19 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏