arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

共收录 45787 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 图文多模态 4633 篇

2510.09764 2026-08-06 cs.LG 版本更新 85%

Prototype-based Self-Supervised Multimodal Learning for PPG and Accelerometry Signals

基于原型的PPG与加速度计信号自监督多模态学习

Wanting Mao, Maxwell A Xu, Harish Haresamudram, Mithun Saha, Santosh Kumar, James Matthew Rehg

机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) University of Memphis(密苏里大学孟菲斯分校)

专题命中 图文多模态 :multimodal(title,abstract);multi-modal(abstract);cross-modal(abstract)

AI总结 针对PPG与加速度计等生物信号的多模态学习局限,提出基于原型的SSL框架ProtoMM,开发Pulse-Motion基础模型,性能优于现有对比式及多模态SSL方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.19523 2026-05-20 cs.CL cs.AI cs.CV 85%

Investigating Cross-Modal Skill Injection: Scenarios, Methods, and Hyperparameters

探究跨模态技能注入:场景、方法与超参数

Zhiyu Xu, Lean Wang, Yuanxin Liu, Lei Li, Hao Zhou, Fandong Meng, Jie Zhou, Xu Sun

机构 * State Key Laboratory for Multimedia Information Processing, School of Computer Science, Peking University(多媒体信息处理国家重点实验室,计算机科学学院,北京大学) WeChat AI, Tencent Inc., China(腾讯公司,中国) The University of Hong Kong(香港大学)

专题命中 图文多模态 :cross-modal(title,abstract);multi-modal(abstract);分类 cs.CV、cs.CL、cs.AI

AI总结 本文研究了跨模态技能注入在不同场景下的表现,分析了其方法和超参数的影响,发现其在指令遵循和跨语言任务中表现良好,但在数学推理中存在困难,同时指出经典方法如TA和DARE在性能上优于其他融合方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.14291 2026-05-15 cs.CR cs.AI cs.CL cs.CV cs.LG 85%

To See is Not to Learn: Protecting Multimodal Data from Unauthorized Fine-Tuning of Large Vision-Language Model

看清并非学习:保护多模态数据免受大视觉语言模型的未经授权微调

Chengshuai Zhao, Zhen Tan, Dawei Li, Zhiyuan Yu, Huan Liu

机构 * School of Computing Augmented Intelligence, Arizona State University, Tempe, AZ, USA Department of Computer Science Engineering, Texas A\&M University, College Station, TX, USA

专题命中 图文多模态 :multimodal(title,abstract);cross-modal(abstract);分类 cs.CV、cs.CL、cs.AI

AI总结 本文提出MMGuard,通过注入不可察觉扰动主动利用LVLM学习动态,生成不可学习示例,从而保护多模态数据免受未经授权的微调。通过最小化训练损失,扰动创建优化捷径,导致模型在推理时因噪声过拟合而性能下降。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.14656 2026-04-17 cs.AI cs.CL cs.CV 85%

Rethinking Patient Education as Multi-turn Multi-modal Interaction

重新思考患者教育作为多轮多模态交互

Zonghai Yao, Zhipeng Tang, Chengtao Lin, Xiong Luo, Benlu Wang, Juncheng Huang, Chin Siang Ong, Hong Yu

机构 * VA Bedford Health Care(VA贝德福德医疗中心) UMass Amherst(马萨诸塞大学阿默斯特分校) UMass Lowell(马萨诸塞大学洛厄尔分校) Yale University(耶鲁大学) National University of Singapore(新加坡国立大学) Yale School of Medicine(耶鲁医学院)

专题命中 图文多模态 :multi-modal(title);multimodal(abstract);image-text(abstract);分类 cs.CV、cs.CL、cs.AI

AI总结 本文提出MedImageEdu基准,通过多轮多模态交互提升患者教育效果,评估咨询过程和最终响应质量,发现多模态模型在视觉 grounding、安全性和情绪互动方面存在不足。

Comments Equal contribution for the first two authors

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.13054 2026-04-16 cs.CL cs.AI cs.CV 85%

Caption First, VQA Second: Knowledge Density, Not Task Format, Drives Multimodal Scaling

先caption,后VQA:知识密度而非任务格式驱动多模态扩展

Hongjian Zou, Yue Ge, Qi Ding, Yixuan Liao, Xiaoxin Chen

机构 * vivo AI Lab(vivo人工智能实验室) Wuhan University(武汉大学)

专题命中 图文多模态 :multimodal(title,abstract);cross-modal(abstract);分类 cs.CV、cs.CL、cs.AI

AI总结 研究发现,多模态模型扩展的关键瓶颈在于训练数据的知识密度而非任务格式,通过结构化caption增强和跨模态知识注入可提升模型性能,表明当前多模态模型因训练数据知识覆盖不足而难以扩展。

Comments 23 pages, 4 figures, 10 tables. Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.08541 2026-04-10 cs.CV cs.AI cs.CL 85%

Seeing but Not Thinking: Routing Distraction in Multimodal Mixture-of-Experts

视觉而无思维:多模态混合专家中的路由干扰

Haolei Xu, Haiwen Hong, Hongxing Li, Rui Zhou, Yang Zhang, Longtao Huang, Hui Xue, Yongliang Shen, Weiming Lu, Yueting Zhuang

机构 * Zhejiang University(浙江大学) Alibaba Group(阿里巴巴集团)

专题命中 图文多模态 :multimodal(title,abstract);cross-modal(abstract);分类 cs.CV、cs.CL、cs.AI

AI总结 研究揭示多模态混合专家模型在视觉输入时路由机制无法有效激活任务相关专家,导致推理失败,提出路由干扰假说并验证其有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.17689 2026-02-23 cs.LG cs.AI cs.CL cs.CV 85%

Robust Pre-Training of Medical Vision-and-Language Models with Domain-Invariant Multi-Modal Masked Reconstruction

具有领域不变多模态掩码重建的医学视觉-语言模型鲁棒预训练

Melika Filvantorkaman, Mohsen Piri

专题命中 图文多模态 :multi-modal(title,abstract);image-text(abstract);分类 cs.CV、cs.CL、cs.AI

AI总结 本文提出Robust-MMR框架,通过显式建模鲁棒性提升医学视觉-语言模型在跨领域和扰动下的表现,实现更可靠的医疗应用。

Comments 28 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.14778 2026-01-09 cs.CL cs.AI cs.CV 85%

Harnessing PDF Data for Improving Japanese Large Multimodal Models

利用PDF数据提升日语大规模多模态模型

Jeonghun Baek, Akiko Aizawa, Kiyoharu Aizawa

机构 * The University of Tokyo(东京大学) National Institute of Informatics(信息处理研究所)

专题命中 图文多模态 :multimodal(title,abstract);image-text(abstract);分类 cs.CV、cs.CL、cs.AI

AI总结 本文通过利用日本PDF数据提升日语大规模多模态模型的性能,采用自动化流程提取图像-文本对并构建指令数据,实验结果显示在Heron-Bench上性能提升达2.1%-13.8%。

Comments Accepted to ACL2025 Findings. Code: https://github.com/ku21fan/PDF-JLMM

Journal ref Findings of the Association for Computational Linguistics: ACL 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2311.15759 2025-12-30 cs.CL cs.AI cs.CV 85%

Vision Enhancing LLMs: Empowering Multimodal Knowledge Storage and Sharing in LLMs

视觉增强大语言模型:赋能大语言模型中的多模态知识存储与共享

Yunxin Li, Zhenyu Liu, Baotian Hu, Wei Wang, Yuxin Ding, Xiaochun Cao, Min Zhang

机构 * Research Institute of Computing and Intelligence(计算与智能研究 institute) Harbin Institute of Technology(哈尔滨工业大学)

专题命中 图文多模态 :multimodal(title,abstract);image-text(abstract);分类 cs.CV、cs.CL、cs.AI

AI总结 本文提出MKS2方法,通过多模态知识存储与共享增强大语言模型的推理能力,提升其在物理和常识知识场景下的表现。

Comments 21 pages, 7 figures; Accepted by IEEE TIP

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.22232 2025-12-01 cs.CV cs.AI cs.CL 85%

From Compound Figures to Composite Understanding: Developing a Multi-Modal LLM from Biomedical Literature with Medical Multiple-Image Benchmarking and Validation

从复合图形到综合理解:开发一种从生物医学文献中基于医疗多图像基准测试和验证的多模态大语言模型

Zhen Chen, Yihang Fu, Gabriel Madera, Mauro Giuffre, Serina Applebaum, Hyunjae Kim, Hua Xu, Qingyu Chen

机构 * Department of Biomedical Informatics and Data Science, Yale School of Medicine, Yale University, New Haven, CT 06510, USA(耶鲁医学院生物医学信息学与数据科学系,耶鲁大学,新 Haven,CT 06510,USA) School of Medicine, University of Puerto Rico, San Juan, PR 00921, USA(波多黎各大学医学院,波多黎各,San Juan,PR 00921,USA)

专题命中 图文多模态 :multi-modal(title,abstract);cross-modal(abstract);分类 cs.CV、cs.CL、cs.AI

AI总结 本文提出M3LLM,一种基于生物医学文献中复合图像的多模态大语言模型,通过分而治之策略提升多图像理解能力,实验证明其在多图像、单图像等场景中表现优异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.07026 2025-11-24 cs.CV cs.CL cs.MM cs.SI 85%

Resolving Sentiment Discrepancy for Multimodal Sentiment Detection via Semantics Completion and Decomposition

通过语义补全与分解解决多模态情感检测中的情感差异

Daiqing Wu, Dongbao Yang, Huawen Shen, Can Ma, Yu Zhou

机构 * IIE, Chinese Academy of Sciences(中国科学院信息工程研究所) Nankai University(南开大学) University of Chinese Academy of Sciences(中国科学院大学)

专题命中 图文多模态 :multimodal(title,abstract);image-text(abstract);分类 cs.CV、cs.CL、cs.MM

AI总结 本文提出CoDe网络,通过语义补全与分解解决多模态情感检测中的情感差异问题,提升分类性能。

Comments Accepted by Pattern Recognition

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.16464 2025-11-14 cs.CL cs.AI cs.CV 85%

InterCLIP-MEP: Interactive CLIP and Memory-Enhanced Predictor for Multi-modal Sarcasm Detection

Junjie Chen, Hang Yu, Subin Huang, Sanmin Liu, Linfeng Zhang

机构 * Anhui Polytechnic University(安徽理工大学) Shanghai University(上海大学) Shanghai Jiao Tong University(上海交通大学)

专题命中 图文多模态 :multi-modal(title,abstract);cross-modal(abstract);分类 cs.CV、cs.CL、cs.AI

Comments ACM TOMM; Code and data are available at https://github.com/CoderChen01/InterCLIP-MEP

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.10560 2025-10-14 cs.CL cs.AI cs.CV 85%

BitMar: Low-Bit Multimodal Fusion with Episodic Memory for Edge Devices

Euhid Aman, Esteban Carlin, Hsing-Kuo Pao, Giovanni Beltrame, Ghaluh Indah Permata Sari, Yie-Tarng Chen

机构 * NTUST(国立台湾科技大学) Polytechnique Montréal(蒙特利尔理工学院)

专题命中 图文多模态 :multimodal(title,abstract);image-text(abstract);分类 cs.CV、cs.CL、cs.AI

Comments 6 pages, BabyLM Workshop, EMNLP 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.04039 2025-09-23 cs.CV cs.AI cs.CL 85%

Mitigating Hallucinations in Large Vision-Language Models via Entity-Centric Multimodal Preference Optimization

Jiulong Wu, Zhengliang Shi, Shuaiqiang Wang, Jizhou Huang, Dawei Yin, Lingyong Yan, Min Cao, Min Zhang

机构 * Soochow University(苏州大学) Baidu Inc.(百度公司) Shandong University(山东大学)

专题命中 图文多模态 :multimodal(title,abstract);image-text(abstract);分类 cs.CV、cs.CL、cs.AI

Comments This paper is accepted by EMNLP2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2408.08872 2025-09-18 cs.CV cs.AI cs.CL 85%

xGen-MM (BLIP-3): A Family of Open Large Multimodal Models

Le Xue, Manli Shu, Anas Awadalla, Jun Wang, An Yan, Senthil Purushwalkam, Honglu Zhou, Viraj Prabhu, Yutong Dai, Michael S Ryoo, Shrikant Kendre, Jieyu Zhang, Shaoyen Tseng, Gustavo A Lujan-Moreno, Matthew L Olson, Musashi Hinck, David Cobbley, Vasudev Lal, Can Qin, Shu Zhang, Chia-Chih Chen, Ning Yu, Juntao Tan, Tulika Manoj Awalgaonkar, Shelby Heinecke, Huan Wang, Yejin Choi, Ludwig Schmidt, Zeyuan Chen, Silvio Savarese, Juan Carlos Niebles, Caiming Xiong, Ran Xu

机构 * Salesforce AI Research(Salesforce AI研究院) Intel Labs(英特尔实验室) University of Washington(华盛顿大学)

专题命中 图文多模态 :multimodal(title,abstract);image-text(abstract);分类 cs.CV、cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.20691 2025-08-29 cs.CV cs.AI cs.CL cs.LG 85%

MobileCLIP2: Improving Multi-Modal Reinforced Training

Fartash Faghri, Pavan Kumar Anasosalu Vasu, Cem Koc, Vaishaal Shankar, Alexander Toshev, Oncel Tuzel, Hadi Pouransari

机构 * Apple(苹果公司)

专题命中 图文多模态 :multi-modal(title,abstract);image-text(abstract);分类 cs.CV、cs.CL、cs.AI

Comments TMLR August 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.16258 2025-08-26 cs.CL cs.AI cs.CV 85%

IRONIC: Coherence-Aware Reasoning Chains for Multi-Modal Sarcasm Detection

Aashish Anantha Ramakrishnan, Aadarsh Anantha Ramakrishnan, Dongwon Lee

机构 * College of Information Sciences and Technology(信息科学与技术学院) The Pennsylvania State University(宾夕法尼亚州立大学) Department of Computer Science and Engineering(计算机科学与工程系) National Institute of Technology, Tiruchirappalli(特里奇里帕利理工学院)

专题命中 图文多模态 :multi-modal(title,abstract);image-text(abstract);分类 cs.CV、cs.CL、cs.AI

Comments Accepted in the COLM First Workshop on Pragmatic Reasoning in Language Models (PragLM), Montreal, Canada, October 2025, https://sites.google.com/berkeley.edu/praglm

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.11616 2025-08-18 cs.CV cs.AI cs.CL cs.LG 85%

Controlling Multimodal LLMs via Reward-guided Decoding

Oscar Mañas, Pierluca D'Oro, Koustuv Sinha, Adriana Romero-Soriano, Michal Drozdzal, Aishwarya Agrawal

机构 * Mila - Quebec AI Institute(魁北克AI研究院) Université de Montréal(蒙特利尔大学) McGill University(麦吉尔大学) Meta FAIR Canada CIFAR AI Chair(加拿大CIFAR人工智能主席)

专题命中 图文多模态 :multimodal(title,abstract);MLLM(abstract);分类 cs.CV、cs.CL、cs.AI

Comments Published at ICCV 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.10300 2025-07-15 cs.CV cs.AI cs.CL 85%

FaceLLM: A Multimodal Large Language Model for Face Understanding

Hatef Otroshi Shahreza, Sébastien Marcel

专题命中 图文多模态 :multimodal(title,abstract);image-text(abstract);分类 cs.CV、cs.CL、cs.AI

Comments Accepted in ICCV 2025 workshops

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.19939 2025-05-20 cs.CR cs.AI cs.CL cs.CV 85%

VLSBench: Unveiling Visual Leakage in Multimodal Safety

Xuhao Hu, Dongrui Liu, Hao Li, Xuanjing Huang, Jing Shao

机构 * Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) Fudan University(复旦大学) Beihang University(北京航空航天大学)

专题命中 图文多模态 :multimodal(title,abstract);image-text(abstract);分类 cs.CV、cs.CL、cs.AI

Comments ACL2025 Main

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.00127 2025-04-17 cs.CV cs.AI cs.CL 85%

Orthus: Autoregressive Interleaved Image-Text Generation with Modality-Specific Heads

Siqi Kou, Jiachun Jin, Zhihong Liu, Chang Liu, Ye Ma, Jian Jia, Quan Chen, Peng Jiang, Zhijie Deng

专题命中 图文多模态 :image-text(title,abstract);multimodal(abstract);分类 cs.CV、cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2311.12047 2025-04-10 cs.AI cs.CL cs.CV cs.LG 85%

MultiDelete for Multimodal Machine Unlearning

Jiali Cheng, Hadi Amiri

专题命中 图文多模态 :multimodal(title,abstract);image-text(abstract);分类 cs.CV、cs.CL、cs.AI

Comments ECCV 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.10639 2025-03-12 cs.CV cs.AI cs.CL cs.LG 85%

MTA: Multimodal Task Alignment for BEV Perception and Captioning

Yunsheng Ma, Burhaneddin Yaman, Xin Ye, Jingru Luo, Feng Tao, Abhirup Mallik, Ziran Wang, Liu Ren

专题命中 图文多模态 :multimodal(title,abstract);cross-modal(abstract);分类 cs.CV、cs.CL、cs.AI

Comments 10 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.00902 2025-02-10 cs.CV cs.AI cs.CL cs.LG 85%

From Introspection to Best Practices: Principled Analysis of Demonstrations in Multimodal In-Context Learning

Nan Xu, Fei Wang, Sheng Zhang, Hoifung Poon, Muhao Chen

专题命中 图文多模态 :multimodal(title,abstract);image-text(abstract);分类 cs.CV、cs.CL、cs.AI

Comments NAACL 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.14660 2024-12-30 cs.CV cs.AI cs.CL cs.LG stat.ML 85%

Unveiling Uncertainty: A Deep Dive into Calibration and Performance of Multimodal Large Language Models

Zijun Chen, Wenbo Hu, Guande He, Zhijie Deng, Zheng Zhang, Richang Hong

专题命中 图文多模态 :multimodal(title,abstract);MLLM(abstract);分类 cs.CV、cs.CL、cs.AI

Comments Accepted to COLING 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.09999 2024-10-15 cs.CL cs.AI cs.CV cs.IR 85%

Leveraging Customer Feedback for Multi-modal Insight Extraction

Sandeep Sricharan Mukku, Abinesh Kanagarajan, Pushpendu Ghosh, Chetan Aggarwal

专题命中 图文多模态 :multi-modal(title,abstract);image-text(abstract);分类 cs.CV、cs.CL、cs.AI

Comments NAACL 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.17639 2024-09-17 cs.CV cs.AI cs.CL cs.LG 85%

Mitigate the Gap: Investigating Approaches for Improving Cross-Modal Alignment in CLIP

Sedigheh Eslami, Gerard de Melo

专题命中 图文多模态 :cross-modal(title,abstract);multi-modal(abstract);分类 cs.CV、cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2405.20606 2024-09-17 cs.CV cs.AI cs.LG cs.MM 85%

Vision-Language Meets the Skeleton: Progressively Distillation with Cross-Modal Knowledge for 3D Action Representation Learning

Yang Chen, Tian He, Junfeng Fu, Ling Wang, Jingcai Guo, Ting Hu, Hong Cheng

专题命中 图文多模态 :cross-modal(title,abstract);multimodal(abstract);分类 cs.CV、cs.AI、cs.MM

Comments Accepted by IEEE Transactions on Multimedia

详情

展开后加载摘要…

URL PDF HTML 收藏
2301.07088 2024-08-06 cs.CV cs.AI cs.CL cs.LG 85%

Vision Learners Meet Web Image-Text Pairs

Bingchen Zhao, Quan Cui, Hao Wu, Osamu Yoshie, Cheng Yang, Oisin Mac Aodha

专题命中 图文多模态 :image-text(title,abstract);multi-modal(abstract);分类 cs.CV、cs.CL、cs.AI

Comments Project page: https://bzhao.me/MUG/

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.01157 2024-07-02 cs.CV cs.AI cs.CL cs.LG 85%

Unaligning Everything: Or Aligning Any Text to Any Image in Multimodal Models

Shaeke Salman, Md Montasir Bin Shams, Xiuwen Liu

专题命中 图文多模态 :multimodal(title,abstract);image-text(abstract);分类 cs.CV、cs.CL、cs.AI

Comments 14 pages, 14 figures. arXiv admin note: substantial text overlap with arXiv:2401.15568, arXiv:2402.08473

详情

展开后加载摘要…

URL PDF HTML 收藏