arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

共收录 46073 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 图文多模态 4651 篇

2408.08704 2025-06-30 cs.CV cs.AI 62%

Beyond the Hype: A dispassionate look at vision-language models in medical scenario

Yang Nan, Huichi Zhou, Xiaodan Xing, Guang Yang

机构 * Bioengineering Department and Imperial-X, Imperial College London(生物工程部门和Imperial-X,帝国理工学院伦敦分校) GSK, Artificial Intelligence and Machine Learning(GSK,人工智能与机器学习) Cardiovascular Research Centre, Royal Brompton Hospital(心血管研究中心,皇家布里托尼医院) School of Biomedical Engineering and Imaging Sciences, King’s College London(生物医学工程与成像科学学院,国王学院伦敦分校)

专题命中 图文多模态 :multimodal(abstract);分类 cs.CV、cs.AI

Comments 10 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.19848 2025-06-25 cs.CV cs.CL 62%

ScaleCap: Inference-Time Scalable Image Captioning via Dual-Modality Debiasing

Long Xing, Qidong Huang, Xiaoyi Dong, Pan Zhang, Yuhang Zang, Yuhang Cao, Jinsong Li, Shuangrui Ding, Weiming Zhang, Nenghai Yu, Jiaqi Wang, Feng Wu, Dahua Lin

机构 * University of Science and Technology of China(中国科学技术大学) Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) The Chinese University of Hong Kong(香港中文大学)

专题命中 图文多模态 :multimodal(abstract);分类 cs.CV、cs.CL

Comments Code is available at https://github.com/Cooperx521/ScaleCap

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.16385 2025-06-23 cs.CV cs.AI cs.LG 62%

CLIP-MG: Guiding Semantic Attention with Skeletal Pose Features and RGB Data for Micro-Gesture Recognition on the iMiGUE Dataset

Santosh Patapati, Trisanth Srinivasan, Amith Adiraju

机构 * Cyrion Labs, Texas, United States(Cyrion实验室,德克萨斯州,美国)

专题命中 图文多模态 :multi-modal(abstract);分类 cs.CV、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.09965 2025-06-23 cs.CV cs.AI 62%

Reinforcing Spatial Reasoning in Vision-Language Models with Interwoven Thinking and Visual Drawing

Junfei Wu, Jian Guan, Kaituo Feng, Qiang Liu, Shu Wu, Liang Wang, Wei Wu, Tieniu Tan

机构 * Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) University of Chinese Academy of Sciences(中国科学院大学) Ant Group(蚂蚁集团) CUHK MMLab(香港中文大学MMLab) Nanjing University(南京大学)

专题命中 图文多模态 :multimodal(abstract);分类 cs.CV、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.14907 2025-06-19 cs.CV cs.AI 62%

PeRL: Permutation-Enhanced Reinforcement Learning for Interleaved Vision-Language Reasoning

Yizhen Zhang, Yang Ding, Shuoshuo Zhang, Xinchen Zhang, Haoling Li, Zhong-zhi Li, Peijie Wang, Jie Wu, Lei Ji, Yelong Shen, Yujiu Yang, Yeyun Gong

机构 * Tsinghua University(清华大学) Microsoft(微软) CASIA(中国科学院自动化研究所)

专题命中 图文多模态 :multimodal(abstract);分类 cs.CV、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.13888 2025-06-18 cs.CL cs.CV 62%

VL-GenRM: Enhancing Vision-Language Verification via Vision Experts and Iterative Training

Jipeng Zhang, Kehao Miao, Renjie Pi, Zhaowei Wang, Runtao Liu, Rui Pan, Tong Zhang

机构 * The Hong Kong University of Science and Technology(香港科学与技术大学) Nanyang Technological University(南洋理工大学) University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校)

专题命中 图文多模态 :multimodal(abstract);分类 cs.CV、cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2408.15521 2025-06-18 cs.CV cs.MM 62%

A Simple Baseline with Single-encoder for Referring Image Segmentation

Seonghoon Yu, Ilchae Jung, Byeongju Han, Taeoh Kim, Yunho Kim, Dongyoon Wee, Jeany Son

机构 * AI Graduate School, GIST(人工智能研究生院,韩国科学技术院) NAVER Cloud(NAVER云) Electrical Engineering and Computer Science, GIST(电子工程与计算机科学,韩国科学技术院)

专题命中 图文多模态 :multi-modal(abstract);分类 cs.CV、cs.MM

Comments arXiv pre-print

详情

展开后加载摘要…

URL PDF HTML 收藏
2310.14735 2025-06-18 cs.CL cs.AI 62%

Unleashing the potential of prompt engineering for large language models

Banghao Chen, Zhaofeng Zhang, Nicolas Langrené, Shengxin Zhu

机构 * Guangdong Provincial Key Laboratory of Interdisciplinary Research and Application for Data Science(interdisciplinary Research and Application for Data Science省重点实验室) BNU-HKBU United International College(北京师范大学-香港浸会大学联合国际学院) Research Center for Mathematics, Beijing Normal University(北京师范大学数学研究中心)

专题命中 图文多模态 :multimodal(abstract);分类 cs.CL、cs.AI

Comments v6 - Metadata updated (title, journal ref, DOI). PDF identical to v5 (original submission). Please cite the peer-reviewed Version of Record in "Patterns" (DOI: 10.1016/j.patter.2025.101260)

Journal ref Patterns 6(6) 101260 (2025)

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.13458 2025-06-17 cs.CV cs.CL 62%

Leveraging Vision-Language Pre-training for Human Activity Recognition in Still Images

Cristina Mahanta, Gagan Bhatia

机构 * Department of Computing Science University of Aberdeen(计算科学系大学阿伯丁)

专题命中 图文多模态 :multimodal(abstract);分类 cs.CV、cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.11417 2025-06-16 cs.CV cs.AI 62%

Stop learning it all to mitigate visual hallucination, Focus on the hallucination target

Dokyoon Yoon, Youngsook Song, Woomyong Park

机构 * SIONIC AI

专题命中 图文多模态 :multimodal(abstract);分类 cs.CV、cs.AI

Comments Accepted to CVPR 2025

Journal ref Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition (CVPR), 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.10172 2025-06-13 cs.RO cs.AI cs.CV 62%

A Navigation Framework Utilizing Vision-Language Models

Yicheng Duan, Kaiyu tang

机构 * Computer and Data Sciences, School of Engineering(计算机与数据科学系,工程学院)

专题命中 图文多模态 :multimodal(abstract);分类 cs.CV、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.09691 2025-06-12 cs.CV cs.CL cs.LG 62%

Adding simple structure at inference improves Vision-Language Compositionality

Imanol Miranda, Ander Salaberria, Eneko Agirre, Gorka Azkune

机构 * HiTZ Center – Ixa, University of the Basque Country (UPV/EHU)(希茨中心–Ixa,巴斯克大学(UPV/EHU))

专题命中 图文多模态 :image-text(abstract);分类 cs.CV、cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.09634 2025-06-12 cs.CV cs.AI 62%

HSENet: Hybrid Spatial Encoding Network for 3D Medical Vision-Language Understanding

Yanzhao Shi, Xiaodan Zhang, Junzhong Ji, Haoning Jiang, Chengxin Zheng, Yinong Wang, Liangqiong Qu

机构 * The University of Hong Kong(香港大学) Beijing University of Technology(北京工业大学)

专题命中 图文多模态 :multimodal(abstract);分类 cs.CV、cs.AI

Comments 27 pages, 9 figures. arXiv admin note: text overlap with arXiv:2410.14200 by other authors

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.13949 2025-06-11 cs.CL cs.CV 62%

Cracking the Code of Hallucination in LVLMs with Vision-aware Head Divergence

Jinghan He, Kuan Zhu, Haiyun Guo, Junfeng Fang, Zhenglin Hua, Yuheng Jia, Ming Tang, Tat-Seng Chua, Jinqiao Wang

机构 * Foundation Model Research Center, Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所基础模型研究中心) School of Artificial Intelligence, University of Chinese Academy of Sciences(中国科学院大学人工智能学院) National University of Singapore(新加坡国立大学) Southeast University(东南大学) Wuhan AI Research(武汉人工智能研究所)

专题命中 图文多模态 :multimodal(abstract);分类 cs.CV、cs.CL

Comments ACL2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.14669 2025-06-11 cs.CV cs.CL 62%

NaturalBench: Evaluating Vision-Language Models on Natural Adversarial Samples

Baiqi Li, Zhiqiu Lin, Wenxuan Peng, Jean de Dieu Nyandwi, Daniel Jiang, Zixian Ma, Simran Khanuja, Ranjay Krishna, Graham Neubig, Deva Ramanan

机构 * Carnegie Mellon University(卡内基梅隆大学) University of Washington(华盛顿大学)

专题命中 图文多模态 :image-text(abstract);分类 cs.CV、cs.CL

Comments Accepted to NeurIPS 24; We open-source our dataset at: https://huggingface.co/datasets/BaiqiL/NaturalBench ; Project page at: https://linzhiqiu.github.io/papers/naturalbench/

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.06938 2025-06-10 cs.MM cs.CV 62%

Experimental Evaluation of Static Image Sub-Region-Based Search Models Using CLIP

Bastian Jäckl, Vojtěch Kloda, Daniel A. Keim, Jakub Lokoč

专题命中 图文多模态 :multimodal(abstract);分类 cs.CV、cs.MM

Comments 14 pages, 4 figures, 2 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.03604 2025-06-10 cs.CL cs.CV 62%

Modality-Specialized Synergizers for Interleaved Vision-Language Generalists

Zhiyang Xu, Minqian Liu, Ying Shen, Joy Rimchala, Jiaxin Zhang, Qifan Wang, Yu Cheng, Lifu Huang

机构 * Virginia Tech(弗吉尼亚理工大学) Intuit AI Research(Intuit AI研究院) Meta AI The Chinese University of Hong Kong(香港中文大学) University of California, Davis(加州大学戴维斯分校)

专题命中 图文多模态 :cross-modal(abstract);分类 cs.CV、cs.CL

Comments 8 Pages, interleaved instruction tuning, parameter-efficient tuning, image understanding, image generation

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.05358 2025-06-09 cs.CV cs.AI cs.CR 62%

Can ChatGPT Perform Image Splicing Detection? A Preliminary Study

Souradip Nath

机构 * Arizona State University(亚利桑那州立大学)

专题命中 图文多模态 :multimodal(abstract);分类 cs.CV、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.23330 2025-06-09 cs.CV cs.AI cs.LG 62%

CLIPErase: Efficient Unlearning of Visual-Textual Associations in CLIP

Tianyu Yang, Lisen Dai, Xiangqi Wang, Minhao Cheng, Yapeng Tian, Xiangliang Zhang

机构 * University of Notre Dame(诺丁汉大学) Columbia University(哥伦比亚大学) Pennsylvania State University(宾夕法尼亚州立大学) University of Texas at Dallas(德克萨斯大学达拉斯分校)

专题命中 图文多模态 :multimodal(abstract);分类 cs.CV、cs.AI

Comments ACL main 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.23161 2025-06-05 cs.CV cs.AI cs.LG 62%

Implicit Inversion turns CLIP into a Decoder

Antonio D'Orazio, Maria Rosaria Briglia, Donato Crisostomi, Dario Loi, Emanuele Rodolà, Iacopo Masi

专题命中 图文多模态 :multimodal(abstract);分类 cs.CV、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.05561 2025-06-05 cs.CV cs.AI cs.LG 62%

Objective drives the consistency of representational similarity across datasets

Laure Ciernik, Lorenz Linhardt, Marco Morik, Jonas Dippel, Simon Kornblith, Lukas Muttenthaler

专题命中 图文多模态 :image-text(abstract);分类 cs.CV、cs.AI

Comments 26 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2404.10332 2025-06-05 cs.CV cs.AI 62%

Prescribing the Right Remedy: Mitigating Hallucinations in Large Vision-Language Models via Targeted Instruction Tuning

Rui Hu, Yahan Tu, Shuyu Wei, Dongyuan Lu, Jitao Sang

机构 * Beijing Key Lab of Traffic Data Analysis and Mining(北京交通大数据分析与挖掘重点实验室) Beijing Jiaotong University(北京交通大学) School of Information Technology and Management(信息科学技术学院)

专题命中 图文多模态 :cross-modal(abstract);分类 cs.CV、cs.AI

Comments Accepted in Information Sciences 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.05098 2025-06-04 cs.RO cs.CL cs.CV cs.ET 62%

X-Driver: Explainable Autonomous Driving with Vision-Language Models

Wei Liu, Jiyuan Zhang, Binxiong Zheng, Yufeng Hu, Yingzhan Lin, Zengfeng Zeng

机构 * Harbin Institute of Technology, Shenzhen(哈尔滨工业大学(深圳)) Baidu Inc.(百度公司)

专题命中 图文多模态 :multi-modal(abstract);分类 cs.CV、cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.22627 2025-06-03 cs.CL cs.CV 62%

Chain-of-Talkers (CoTalk): Fast Human Annotation of Dense Image Captions

Yijun Shen, Delong Chen, Fan Liu, Xingyu Wang, Chuanyi Zhang, Liang Yao, Yuhui Zheng

机构 * Hohai University(河海大学) HKUST(香港科技大学)

专题命中 图文多模态 :multimodal(abstract);分类 cs.CV、cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.23313 2025-05-30 cs.CV cs.AI cs.LG 62%

Adversarial Semantic and Label Perturbation Attack for Pedestrian Attribute Recognition

Weizhe Kong, Xiao Wang, Ruichong Gao, Chenglong Li, Yu Zhang, Xing Yang, Yaowei Wang, Jin Tang

机构 * School of Artificial Intelligence, Anhui University(安徽大学人工智能学院) School of Computer Science and Technology, Anhui University(安徽大学计算机科学与技术学院) National University of Defense Technology(国防科学技术大学) Harbin Institute of Technology(哈尔滨工业大学) Peng Cheng Laboratory(鹏城实验室)

专题命中 图文多模态 :multi-modal(abstract);分类 cs.CV、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.23043 2025-05-30 cs.CV cs.AI 62%

Are Unified Vision-Language Models Necessary: Generalization Across Understanding and Generation

Jihai Zhang, Tianle Li, Linjie Li, Zhengyuan Yang, Yu Cheng

机构 * The Chinese University of Hong Kong(香港中文大学) Microsoft(微软公司)

专题命中 图文多模态 :multimodal(abstract);分类 cs.CV、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.22200 2025-05-29 cs.CV cs.AI 62%

Investigating Mechanisms for In-Context Vision Language Binding

Darshana Saravanan, Makarand Tapaswi, Vineet Gandhi

机构 * CVIT, IIIT Hyderabad, India(计算机视觉研究所,印度海得拉巴印度理工学院)

专题命中 图文多模态 :image-text(abstract);分类 cs.CV、cs.AI

Comments Accepted to MIV at CVPRW 2025 (Oral)

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.21547 2025-05-29 cs.CV cs.AI 62%

Image Tokens Matter: Mitigating Hallucination in Discrete Tokenizer-based Large Vision-Language Models via Latent Editing

Weixing Wang, Zifeng Ding, Jindong Gu, Rui Cao, Christoph Meinel, Gerard de Melo, Haojin Yang

机构 * Hasso Plattner Institute(霍普夫纳研究所) University of Potsdam(波茨坦大学) University of Cambridge(剑桥大学) University of Oxford(牛津大学) German University of Digital Science(德国数字科学大学)

专题命中 图文多模态 :multimodal(abstract);分类 cs.CV、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.13062 2025-05-29 cs.MM cs.SD eess.AS 62%

Hearing from Silence: Reasoning Audio Descriptions from Silent Videos via Vision-Language Model

Yong Ren, Chenxing Li, Le Xu, Hao Gu, Duzhen Zhang, Yujie Chen, Manjie Xu, Ruibo Fu, Shan Yang, Dong Yu

机构 * Chinese Academy of Sciences(中国科学院) University of Chinese Academy of Sciences(中国科学院大学) Tencent AI Lab(腾讯AI实验室) Institute of Automation School of Artificial Intelligence(自动化研究所人工智能学院)

专题命中 图文多模态 :multimodal(abstract);分类 cs.MM、eess.AS

Comments Accepted by Interspeech 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.20578 2025-05-29 cs.CV cs.AI cs.LG 62%

Interpreting CLIP with Hierarchical Sparse Autoencoders

Vladimir Zaigrajew, Hubert Baniecki, Przemyslaw Biecek

专题命中 图文多模态 :multimodal(abstract);分类 cs.CV、cs.AI

Journal ref Proceedings of the 42st International Conference on Machine Learning (ICML 2025)

详情

展开后加载摘要…

URL PDF HTML 收藏