arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

共收录 45787 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 图文多模态 4633 篇

2501.15370 2025-05-30 cs.CV cs.AI 86%

Scaling Large Vision-Language Models for Enhanced Multimodal Comprehension In Biomedical Image Analysis

Robinson Umeike, Neil Getty, Fangfang Xia, Rick Stevens

专题命中 图文多模态 :multimodal(title,abstract);cross-modal(abstract);image-text(abstract);分类 cs.CV、cs.AI

Comments 4 Pages, 4 Figures, 1 Table

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.08707 2025-05-30 cs.CL cs.CV 86%

mOSCAR: A Large-scale Multilingual and Multimodal Document-level Corpus

Matthieu Futeral, Armel Zebaze, Pedro Ortiz Suarez, Julien Abadji, Rémi Lacroix, Cordelia Schmid, Rachel Bawden, Benoît Sagot

机构 * Inria(法国国家信息与自动化技术研究院) Département d’informatique de l’ENS, CNRS, PSL Research University(巴黎高等师范学院计算机科学系、国家科学研究中心、巴黎综合理工研究学院) Institut du développement et des ressources en informatique scientifique, CNRS(科学信息发展与资源研究所、国家科学研究中心) Sorbonne Université(索邦大学) Common Crawl Foundation(Common Crawl基金会) Université Paris-Saclay(巴黎萨克雷大学)

专题命中 图文多模态 :multimodal(title,abstract);MLLM(abstract);image-text(abstract);分类 cs.CV、cs.CL

Comments ACL 2025 (Findings)

详情

展开后加载摘要…

URL PDF HTML 收藏
2306.11207 2025-01-14 cs.CV cs.CL cs.LG 86%

Quilt-1M: One Million Image-Text Pairs for Histopathology

Wisdom Oluchi Ikezogwo, Mehmet Saygin Seyfioglu, Fatemeh Ghezloo, Dylan Stefan Chan Geva, Fatwir Sheikh Mohammed, Pavan Kumar Anand, Ranjay Krishna, Linda Shapiro

专题命中 图文多模态 :image-text(title,abstract);multi-modal(abstract);cross-modal(abstract);分类 cs.CV、cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.08303 2024-11-26 cs.CV cs.AI 86%

DenseFusion-1M: Merging Vision Experts for Comprehensive Multimodal Perception

Xiaotong Li, Fan Zhang, Haiwen Diao, Yueze Wang, Xinlong Wang, Ling-Yu Duan

专题命中 图文多模态 :multimodal(title,abstract);MLLM(abstract);image-text(abstract);分类 cs.CV、cs.AI

Comments Accepted by NeurIPS 2024. Project is available at https://github.com/baaivision/DenseFusion

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.00304 2024-11-04 cs.CV cs.MM 86%

Unified Generative and Discriminative Training for Multi-modal Large Language Models

Wei Chow, Juncheng Li, Qifan Yu, Kaihang Pan, Hao Fei, Zhiqi Ge, Shuai Yang, Siliang Tang, Hanwang Zhang, Qianru Sun

专题命中 图文多模态 :multi-modal(title);multimodal(abstract);MLLM(abstract);image-text(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.11963 2024-10-17 cs.CV cs.AI 86%

CtrlSynth: Controllable Image Text Synthesis for Data-Efficient Multimodal Learning

Qingqing Cao, Mahyar Najibi, Sachin Mehta

专题命中 图文多模态 :multimodal(title,abstract);image-text(abstract);multimodal foundation model(abstract);分类 cs.CV、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.20424 2024-10-01 cs.CV cs.AI 86%

World to Code: Multi-modal Data Generation via Self-Instructed Compositional Captioning and Filtering

Jiacong Wang, Bohong Wu, Haiyong Jiang, Xun Zhou, Xin Xiao, Haoyuan Guo, Jun Xiao

专题命中 图文多模态 :multi-modal(title,abstract);multimodal(abstract);cross-modal(abstract);分类 cs.CV、cs.AI

Comments Accepted at EMNLP 2024 Main Conference, 16pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.12568 2024-09-20 cs.CV cs.MM 86%

InfiMM-WebMath-40B: Advancing Multimodal Pre-Training for Enhanced Mathematical Reasoning

Xiaotian Han, Yiren Jian, Xuefeng Hu, Haogeng Liu, Yiqi Wang, Qihang Fan, Yuang Ai, Huaibo Huang, Ran He, Zhenheng Yang, Quanzeng You

专题命中 图文多模态 :multimodal(title,abstract);multi-modal(abstract);image-text(abstract);分类 cs.CV、cs.MM

详情

展开后加载摘要…

URL PDF HTML 收藏
2402.02544 2024-07-17 cs.CV cs.AI cs.LG 86%

LHRS-Bot: Empowering Remote Sensing with VGI-Enhanced Large Multimodal Language Model

Dilxat Muhtar, Zhenshi Li, Feng Gu, Xueliang Zhang, Pengfeng Xiao

专题命中 图文多模态 :multimodal(title,abstract);MLLM(abstract);image-text(abstract);分类 cs.CV、cs.AI

Comments 36 pages, 10 figures. Github https://github.com/NJU-LHRS/LHRS-Bot

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.07588 2024-07-02 cs.MM cs.CL 86%

AIM: Let Any Multi-modal Large Language Models Embrace Efficient In-Context Learning

Jun Gao, Qian Qiao, Ziqiang Cao, Zili Wang, Wenjie Li

专题命中 图文多模态 :multi-modal(title,abstract);MLLM(abstract);image-text(abstract);分类 cs.CL、cs.MM

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.12479 2024-06-19 cs.CV cs.AI 86%

RS-GPT4V: A Unified Multimodal Instruction-Following Dataset for Remote Sensing Image Understanding

Linrui Xu, Ling Zhao, Wang Guo, Qiujun Li, Kewang Long, Kaiqi Zou, Yuhan Wang, Haifeng Li

专题命中 图文多模态 :multimodal(title,abstract);multi-modal(abstract);MLLM(abstract);分类 cs.CV、cs.AI

Comments 14 pages, 6 figures, 4 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.03496 2024-06-06 cs.CL cs.AI cs.LG 86%

Wings: Learning Multimodal LLMs without Text-only Forgetting

Yi-Kai Zhang, Shiyin Lu, Yang Li, Yanqing Ma, Qing-Guo Chen, Zhao Xu, Weihua Luo, Kaifu Zhang, De-Chuan Zhan, Han-Jia Ye

专题命中 图文多模态 :multimodal(title,abstract);MLLM(abstract);image-text(abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2404.18114 2024-04-30 cs.CV cs.MM 86%

Deep Boosting Learning: A Brand-new Cooperative Approach for Image-Text Matching

Haiwen Diao, Ying Zhang, Shang Gao, Xiang Ruan, Huchuan Lu

专题命中 图文多模态 :image-text(title,abstract);multi-modal(abstract);cross-modal(abstract);分类 cs.CV、cs.MM

Comments 12 pages, 9 figures, Accepted by TIP2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2401.15896 2024-02-06 cs.CV cs.AI 86%

M2-Encoder: Advancing Bilingual Image-Text Understanding by Large-scale Efficient Pretraining

Qingpei Guo, Furong Xu, Hanxiao Zhang, Wang Ren, Ziping Ma, Lin Ju, Jian Wang, Jingdong Chen, Ming Yang

专题命中 图文多模态 :image-text(title,abstract);multimodal(abstract);multimodal foundation model(abstract);分类 cs.CV、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2310.13619 2023-10-23 cs.CL cs.CV 86%

Semi-supervised multimodal coreference resolution in image narrations

Arushi Goel, Basura Fernando, Frank Keller, Hakan Bilen

专题命中 图文多模态 :multimodal(title,abstract);cross-modal(abstract);image-text(abstract);分类 cs.CV、cs.CL

Comments Long paper at EMNLP'23-Main

详情

展开后加载摘要…

URL PDF HTML 收藏
2306.14824 2023-07-14 cs.CL cs.CV 86%

Kosmos-2: Grounding Multimodal Large Language Models to the World

Zhiliang Peng, Wenhui Wang, Li Dong, Yaru Hao, Shaohan Huang, Shuming Ma, Furu Wei

专题命中 图文多模态 :multimodal(title,abstract);MLLM(abstract);image-text(abstract);分类 cs.CV、cs.CL

Comments 20 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2302.06605 2023-05-23 cs.CV cs.CL 86%

UniAdapter: Unified Parameter-Efficient Transfer Learning for Cross-modal Modeling

Haoyu Lu, Yuqi Huo, Guoxing Yang, Zhiwu Lu, Wei Zhan, Masayoshi Tomizuka, Mingyu Ding

专题命中 图文多模态 :cross-modal(title,abstract);multimodal(abstract);image-text(abstract);分类 cs.CV、cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2211.09371 2023-03-21 cs.CV cs.MM 86%

CapEnrich: Enriching Caption Semantics for Web Images via Cross-modal Pre-trained Knowledge

Linli Yao, Weijing Chen, Qin Jin

专题命中 图文多模态 :cross-modal(title,abstract);multimodal(abstract);image-text(abstract);分类 cs.CV、cs.MM

Comments Accepted to WWW2023

详情

展开后加载摘要…

URL PDF HTML 收藏
2203.11480 2022-05-03 cs.CV cs.CL 86%

WuDaoMM: A large-scale Multi-Modal Dataset for Pre-training models

Sha Yuan, Shuai Zhao, Jiahong Leng, Zhao Xue, Hanyu Zhao, Peiyu Liu, Zheng Gong, Wayne Xin Zhao, Junyi Li, Jie Tang

专题命中 图文多模态 :multi-modal(title,abstract);cross-modal(abstract);image-text(abstract);分类 cs.CV、cs.CL

Comments Some data problems cannot be obtained

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.21710 2025-10-30 cs.CV 86%

FOCUS: Internal MLLM Representations for Efficient Fine-Grained Visual Question Answering

Liangyu Zhong, Fabio Rosenthal, Joachim Sicking, Fabian Hüger, Thorsten Bagdonat, Hanno Gottschalk, Leo Schwinn

机构 * Technical University of Berlin(柏林技术大学) Technical University of Munich(慕尼黑技术大学) CARIAD SE Volkswagen AG(大众集团)

专题命中 图文多模态 :MLLM(title,abstract);multimodal(abstract);image-text(abstract);分类 cs.CV

Comments Accepted by NeurIPS 2025 - main track. Project page: https://focus-mllm-vqa.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2103.06561 2021-07-09 cs.CV cs.IR 86%

WenLan: Bridging Vision and Language by Large-Scale Multi-Modal Pre-Training

Yuqi Huo, Manli Zhang, Guangzhen Liu, Haoyu Lu, Yizhao Gao, Guoxing Yang, Jingyuan Wen, Heng Zhang, Baogui Xu, Weihao Zheng, Zongzheng Xi, Yueqian Yang, Anwen Hu, Jinming Zhao, Ruichen Li, Yida Zhao, Liang Zhang, Yuqing Song, Xin Hong, Wanqing Cui, Danyang Hou, Yingyan Li, Junyi Li, Peiyu Liu, Zheng Gong, Chuhao Jin, Yuchong Sun, Shizhe Chen, Zhiwu Lu, Zhicheng Dou, Qin Jin, Yanyan Lan, Wayne Xin Zhao, Ruihua Song, Ji-Rong Wen

专题命中 图文多模态 :multi-modal(title,abstract);cross-modal(abstract);image-text(abstract);分类 cs.CV

Comments This paper is the outcome of the Chinese multi-modal pre-training project called 'WenLan'

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.18200 2025-05-30 eess.SP 86%

Zero-Shot Semantic Communication with Multimodal Foundation Models

Jiangjing Hu, Haotian Wu, Wenjing Zhang, Fengyu Wang, Wenjun Xu, Hui Gao, Deniz Gündüz

专题命中 图文多模态 :multimodal(title);multimodal foundation model(title);multi-modal(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2403.08783 2024-03-15 cs.CV cs.AI cs.CL 86%

Image-Text Out-Of-Context Detection Using Synthetic Multimodal Misinformation

Fatma Shalabi, Huy H. Nguyen, Hichem Felouat, Ching-Chun Chang, Isao Echizen

专题命中 图文多模态 :multimodal(title);image-text(title);分类 cs.CV、cs.CL、cs.AI

Comments 8 pages, 2 figures, conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.17499 2026-07-21 cs.AI 新提交 85%

Pailitao-MMSearch: Building Native E-Commerce Multimodal Search Foundation

派利淘-多模态搜索:构建原生电子商务多模态搜索基础

Xiaohan Ye, Xu Chen, Zihan Gong, Jian Ding, Lianyu Du, Baicheng Chen, Yunmeng Shu, Jingqian Zhao, Zhixiang Zhao, Shuaiqi Jia, Chong Ma, Shuwen Xiao, Xiangheng Kong, Yuan Gao, Jun Song, Jinsong Lan, Xiaoyong Zhu, Bo Zheng

机构 * Taobao & Tmall Group of Alibaba(阿里巴巴淘宝及天猫集团)

专题命中 图文多模态 :multimodal(title,abstract);multi-modal(abstract);cross-modal(abstract);分类 cs.AI

AI总结 针对电子商务多模态搜索问题,提出派利淘-多模态搜索基础模型,通过混合语义ID、两阶段持续预训练策略和混合推理后训练管道,在淘宝派利淘平台实现显著改进,提升了商品交易总额和交易量。

Comments Technical Report: Pailitao-MMSearch

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.07673 2026-07-09 cs.CV cs.LG 新提交 85%

MedPMC: A Systematic Framework for Scaling High-Fidelity Medical Multimodal Data for Foundation Models

MedPMC:一种用于为基础模型扩展高保真医学多模态数据的系统框架

Hyunjae Kim, Dain Kim, Pan Xiao, Serina S. Applebaum, Younjoon Chung, Xuguang Ai, Yu Yin, Roy Jiang, Yuexi Du, Yawen Wei, Yiming Kong, Tuo Guo, Zhiyuan Cao, Mengmeng Du, Yuelei Fu, Yan Hu, Rui Shi, Gui Yang, Kevin W. Jin, Yuntian Liu, Yuxuan Tian, Jonathan Marquez, Zhen Chen, Sheng Zhang, Hoifung Poon, Hua Xu, Jaewoo Kang, Qingyu Chen

机构 * Yale University(耶鲁大学) Korea University(韩国大学) Washington University in St. Louis(圣路易斯华盛顿大学) The University of Queensland(昆士兰大学) The University of Texas Health Science Center at Houston(德克萨斯大学休斯顿健康科学中心) University of Washington(华盛顿大学) Microsoft Research(微软研究院)

专题命中 图文多模态 :multimodal(title,abstract);image-text(abstract);multimodal foundation model(abstract);分类 cs.CV

AI总结 研究针对医学多模态基础模型受高质量临床数据限制问题,提出MedPMC框架,将文献转化为高保真基础设施。经实验,该框架整理大量图像-文本对,在多方面评估表现出色,训练模型在多基准测试和临床场景中效果显著,还公开相关资源。

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.01576 2026-06-04 cs.CV 85%

Robust-LLaVA: On the Effectiveness of Large-Scale Robust Image Encoders for Multi-modal Large Language Models

Robust-LLaVA:大规模鲁棒图像编码器对多模态大语言模型的有效性

Hashmat Shadab Malik, Fahad Shamshad, Muzammal Naseer, Karthik Nandakumar, Fahad Khan, Salman Khan

机构 * Mohamed bin Zayed University of AI(Mohamed bin Zayed人工智能大学) Khalifa University(卡利法大学) Michigan State University(密歇根州立大学) Australian National University(澳大利亚国立大学)

专题命中 图文多模态 :multi-modal(title,abstract);MLLM(abstract,abstract_cn);分类 cs.CV

AI总结 本文提出利用大规模对抗预训练的图像分类模型替代CLIP编码器,以增强多模态大语言模型对视觉对抗扰动的鲁棒性,在无需额外对抗训练的情况下,在视觉问答、图像描述和越狱攻击任务中取得显著鲁棒性提升。

Comments Accepted at Trustworthy FMs Workshop Trust Before Use: Building Foundation Models that You Can Trust (ICCVW) 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.15234 2026-06-02 cs.CV 85%

Exploring the Capabilities of Large Language Model Encoders for Image-Text Retrieval in Chest X-rays

探索大语言模型编码器在胸部X光片图像-文本检索中的能力

Hanbin Ko, Gihun Cho, Inhyeok Baek, Donguk Kim, Joonbeom Koo, Changi Kim, Dongheon Lee, Chang Min Park

机构 * Interdisciplinary Program in Bioengineering, Seoul National University Graduate School(生物工程跨学科项目,首尔国立大学研究生院) Integrated Major in Innovative Medical Science, Seoul National University Graduate School(创新医学科学整合专业,首尔国立大学研究生院) Department of Radiology, The First Affiliated Hospital, Zhejiang University School of Medicine(浙江大学医学院第一附属医院放射科) Seoul National University College of Medicine(首尔国立大学医学院) Department of Radiology, Seoul National University College of Medicine, Seoul National University Hospital(首尔国立大学医学院放射科,首尔国立大学医院) Institute of Medical and Biological Engineering, Seoul National University Medical Research Center(医学与生物工程研究所,首尔国立大学医学研究所以及) Institute of Radiation Medicine, Seoul National University Medical Research Center(放射医学研究所,首尔国立大学医学研究所以及)

专题命中 图文多模态 :image-text(title,abstract);multimodal(abstract);cross-modal(abstract);分类 cs.CV

AI总结 提出一种领域自适应的双向大语言模型文本编码器,通过掩码标记预测和监督对比学习训练,结合参数高效的双塔对比视觉语言框架,提升胸部X光片图像与文本的对齐和检索性能。

Comments 12 pages, 2 figures, under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.15723 2026-05-18 cs.LG cs.CV 85%

GOMA: Toward Structure-Driven Multimodal Alignment from a Graph Signal Smoothing Perspective

GOMA:从图信号平滑视角迈向结构驱动的多模态对齐

Xu Wang, Xunkai Li, Yinlin Zhu, Rong-Hua Li, Guoren Wang

机构 * School of Airspace Science and Engineering, Shandong University(山东大学 airspace 科学与工程学院) Department of Computer Science, Beijing Institute of Technology(北京理工大学计算机学院) School of Computer Science and Engineering, Sun Yat-sen University(中山大学计算机科学与工程学院)

专题命中 图文多模态 :multimodal(title,abstract);cross-modal(abstract);image-text(abstract);分类 cs.CV

AI总结 GOMA通过统一设计解决多模态对齐中的拓扑障碍、平滑控制与信息保留问题,在七个多模态图基准上取得最佳检索性能并保持稳定性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.05181 2026-03-27 cs.CV 85%

Mario: Multimodal Graph Reasoning with Large Language Models

Mario:基于大语言模型的多模态图推理

Yuanfu Sun, Kang Li, Pengkang Guo, Jiajin Liu, Qiaoyu Tan

机构 * New York University Shanghai(上海纽约大学) New York University(纽约大学) Tsinghua University(清华大学) EPFL(瑞士联邦理工学院洛桑)

专题命中 图文多模态 :multimodal(title,abstract);cross-modal(abstract);image-text(abstract);分类 cs.CV

AI总结 Mario通过多模态图推理框架解决跨模态一致性与异构模态偏好问题,实现对多模态图的有效推理,优于现有图模型。

Comments CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.04217 2026-02-03 cs.LG cs.AI 85%

MLLMEraser: Achieving Test-Time Unlearning in Multimodal Large Language Models through Activation Steering

MLLMEraser: 通过激活引导在多模态大语言模型中实现测试时遗忘

Chenlu Ding, Jiancan Wu, Leheng Sheng, Fan Zhang, Yancheng Yuan, Xiang Wang, Xiangnan He

机构 * University of Science and Technology of China(中国科学技术大学) National University of Singapore(新加坡国立大学) The Hong Kong Polytechnic University(香港理工大学) Huawei(华为)

专题命中 图文多模态 :multimodal(title,abstract);MLLM(abstract);image-text(abstract);分类 cs.AI

AI总结 MLLMEraser通过激活引导实现多模态大语言模型的测试时遗忘,无需训练且有效降低计算成本,同时保持保留知识的效用。

详情

展开后加载摘要…

URL PDF HTML 收藏