arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

共收录 4932 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 多模态生成 4932 篇

2507.08903 2025-07-15 cs.RO cs.CV 83%

Multimodal HD Mapping for Intersections by Intelligent Roadside Units

Zhongzhang Chen, Miao Fan, Shengtong Xu, Mengmeng Yang, Kun Jiang, Xiangzeng Liu, Haoyi Xiong

专题命中 多模态生成 :multimodal(title,abstract);cross-modal(abstract);分类 cs.CV

Comments Accepted by ITSC'25

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.04621 2025-07-08 cs.LG cs.AI cs.NI 83%

Multimodal LLM Integrated Semantic Communications for 6G Immersive Experiences

Yusong Zhang, Yuxuan Sun, Lei Guo, Wei Chen, Bo Ai, Deniz Gunduz

机构 * School of Electronic and Information Engineering, Beijing Jiaotong University(电子信息工程学院,北京交通大学) School of Electrical and Electronic Engineering, Imperial College London(电子电气工程学院,帝国理工学院伦敦分校)

专题命中 多模态生成 :multimodal(title,abstract);MLLM(abstract);分类 cs.AI

Comments This work has been submitted to the IEEE for possible publication

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.04036 2025-07-08 cs.CV 83%

PresentAgent: Multimodal Agent for Presentation Video Generation

Jingwei Shi, Zeyu Zhang, Biao Wu, Yanjie Liang, Meng Fang, Ling Chen, Yang Zhao

机构 * AI Geeks, Australia Australian Artificial Intelligence Institute, Australia(澳大利亚人工智能研究所) University of Liverpool, United Kingdom(利物浦大学) La Trobe University, Australia(拉特罗布大学)

专题命中 多模态生成 :multimodal(title,abstract);audio-visual(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.00316 2025-07-03 cs.LG cs.CL eess.IV 83%

$μ^2$Tokenizer: Differentiable Multi-Scale Multi-Modal Tokenizer for Radiology Report Generation

Siyou Li, Pengyao Qin, Huanan Wu, Dong Nie, Arun J. Thirunavukarasu, Juntao Yu, Le Zhang

机构 * School of Electronic Engineering and Computer Science(电子工程与计算机科学学院) Queen Mary University of London(伦敦女王学院) School of Engineering, College of Engineering and Physical Sciences(工程学院,工程与物理科学学院) University of Birmingham(伯明翰大学) Guangdong University of Technology(广东工业大学) Meta Inc. US(Meta美国公司) Nuffield Department of Clinical Neurosciences(临床神经科学系) University of Oxford(牛津大学) William Harvey Research Institute, NIHR Barts Biomedical Research Centre, Queen Mary University London(威廉·哈里弗研究所在NIHR巴茨生物医学研究中心,伦敦女王学院)

专题命中 多模态生成 :multi-modal(title,abstract);multimodal(abstract);分类 cs.CL

Comments Accepted by MICCAI 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.06598 2025-07-03 cs.AI 83%

ChartCoder: Advancing Multimodal Large Language Model for Chart-to-Code Generation

Xuanle Zhao, Xianzhen Luo, Qi Shi, Chi Chen, Shuo Wang, Zhiyuan Liu, Maosong Sun

机构 * Tsinghua University, Beijing, China(清华大学) Harbin Institute of Technology(哈尔滨工业大学)

专题命中 多模态生成 :multimodal(title,abstract);MLLM(abstract);分类 cs.AI

Comments Accepted by ACL 2025 Main, Camera Ready

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.21557 2025-06-30 cs.CL 83%

Debunk and Infer: Multimodal Fake News Detection via Diffusion-Generated Evidence and LLM Reasoning

Kaiying Yan, Moyang Liu, Yukun Liu, Ruibo Fu, Zhengqi Wen, Jianhua Tao, Xuefei Liu

机构 * Sun Yat-sen University(中山大学) Beihang University(北航) University of Chinese Academy of Sciences(中国科学院大学) Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) Beijing National Research Center for Information Science and Technology, Tsinghua University(北京信息科学与技术国家研究中心,清华大学) Department of Automation, Tsinghua University(清华大学自动化系)

专题命中 多模态生成 :multimodal(title,abstract);MLLM(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.23905 2025-06-30 cs.CV 83%

Boosting MLLM Reasoning with Text-Debiased Hint-GRPO

Qihan Huang, Weilong Dai, Jinlong Liu, Wanggui He, Hao Jiang, Mingli Song, Jingyuan Chen, Chang Yao, Jie Song

机构 * Zhejiang University(浙江大学) Alibaba Group(阿里巴巴集团)

专题命中 多模态生成 :MLLM(title,abstract);multimodal(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.15477 2025-06-19 cs.CV 83%

Multimodal Large Language Models for Medical Report Generation via Customized Prompt Tuning

Chunlei Li, Jingyang Hou, Yilei Shi, Jingliang Hu, Xiao Xiang Zhu, Lichao Mou

机构 * MedAI Technology (Wuxi) Co. Ltd.(MedAI技术(无锡)有限公司) Technical University of Munich(慕尼黑技术大学)

专题命中 多模态生成 :multimodal(title,abstract);MLLM(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.15218 2025-06-19 cs.CV 83%

DM-FNet: Unified multimodal medical image fusion via diffusion process-trained encoder-decoder

Dan He, Weisheng Li, Guofen Wang, Yuping Huang, Shiqiang Liu

机构 * School of Computer Science and Technology, Chongqing University of Posts and Telecommunications(重庆邮电大学计算机科学与技术学院) Chongqing Key Laboratory of Image Recognition, Chongqing University of Posts and Telecommunications(重庆邮电大学图像识别重点实验室) Key Laboratory of Cyberspace Big Data Intelligent Security (Chongqing University of Posts and Telecommunications), Ministry of Education(教育部重庆邮电大学网络大数据智能安全重点实验室) College of Computer and Information Science, Chongqing Normal University(重庆师范大学计算机与信息科学学院)

专题命中 多模态生成 :multimodal(title,abstract);cross-modal(abstract);分类 cs.CV

Comments This paper has been accepted by IEEE Transactions on Multimedia (TMM) in March 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.02471 2025-06-16 cs.CV 83%

Ming-Lite-Uni: Advancements in Unified Architecture for Natural Multimodal Interaction

Inclusion AI, Biao Gong, Cheng Zou, Dandan Zheng, Hu Yu, Jingdong Chen, Jianxin Sun, Junbo Zhao, Jun Zhou, Kaixiang Ji, Lixiang Ru, Libin Wang, Qingpei Guo, Rui Liu, Weilong Chai, Xinyu Xiao, Ziyuan Huang

机构 * Inclusion AI Ant Group(Inclusion AI蚂蚁集团)

专题命中 多模态生成 :multimodal(title,abstract);MLLM(abstract);分类 cs.CV

Comments https://github.com/inclusionAI/Ming/tree/Ming-Lite-Omni-Preview/Ming-unify

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.09344 2025-06-12 cs.AI cs.CL cs.CV cs.LG cs.SD eess.AS 83%

Ming-Omni: A Unified Multimodal Model for Perception and Generation

Inclusion AI, Biao Gong, Cheng Zou, Chuanyang Zheng, Chunluan Zhou, Canxiang Yan, Chunxiang Jin, Chunjie Shen, Dandan Zheng, Fudong Wang, Furong Xu, GuangMing Yao, Jun Zhou, Jingdong Chen, Jianxin Sun, Jiajia Liu, Jianjiang Zhu, Jun Peng, Kaixiang Ji, Kaiyou Song, Kaimeng Ren, Libin Wang, Lixiang Ru, Lele Xie, Longhua Tan, Lyuxin Xue, Lan Wang, Mochen Bai, Ning Gao, Pei Chen, Qingpei Guo, Qinglong Zhang, Qiang Xu, Rui Liu, Ruijie Xiong, Sirui Gao, Tinghao Liu, Taisong Li, Weilong Chai, Xinyu Xiao, Xiaomei Wang, Xiaoxue Chen, Xiao Lu, Xiaoyu Li, Xingning Dong, Xuzheng Yu, Yi Yuan, Yuting Gao, Yunxiao Sun, Yipeng Chen, Yifei Wu, Yongjie Lyu, Ziping Ma, Zipeng Feng, Zhijiang Fang, Zhihao Qiu, Ziyuan Huang, Zhengyu He

机构 * Inclusion AI

专题命中 多模态生成 :multimodal(title,abstract);分类 cs.CV、cs.CL、cs.AI

Comments 18 pages,8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.19285 2025-06-09 cs.CV 83%

On the Importance of Text Preprocessing for Multimodal Representation Learning and Pathology Report Generation

Ruben T. Lucassen, Tijn van de Luijtgaarden, Sander P. J. Moonemans, Gerben E. Breimer, Willeke A. M. Blokx, Mitko Veta

机构 * Dept. of Pathology, University Medical Center Utrecht(病理学系,乌得勒支大学医学中心) Dept. of Biomedical Engineering, Eindhoven University of Technology(生物医学工程系,埃因霍温理工大学) Dept. of Mathematics and Computer Science, Eindhoven University of Technology(数学与计算机科学系,埃因霍温理工大学)

专题命中 多模态生成 :multimodal(title,abstract);cross-modal(abstract);分类 cs.CV

Comments 11 pages, 1 figure

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.23661 2025-06-03 cs.CV 83%

OpenUni: A Simple Baseline for Unified Multimodal Understanding and Generation

Size Wu, Zhonghua Wu, Zerui Gong, Qingyi Tao, Sheng Jin, Qinyue Li, Wei Li, Chen Change Loy

机构 * S-Lab, Nanyang Technological University(南洋理工大学S实验室) SenseTime Research(商汤科技研究院) SenseTime Research and Tetras.AI(商汤研究与Tetras.AI)

专题命中 多模态生成 :multimodal(title,abstract);image-text(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.24211 2025-06-02 cs.CL 83%

Are Any-to-Any Models More Consistent Across Modality Transfers Than Specialists?

Jiwan Chung, Janghan Yoon, Junhyeong Park, Sangeyl Lee, Joowon Yang, Sooyeon Park, Youngjae Yu

机构 * Yonsei University(延世大学)

专题命中 多模态生成 :any-to-any(title,abstract);cross-modal(abstract);分类 cs.CL

Journal ref ACL 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.19415 2025-05-29 cs.CV 83%

MMIG-Bench: Towards Comprehensive and Explainable Evaluation of Multi-Modal Image Generation Models

Hang Hua, Ziyun Zeng, Yizhi Song, Yunlong Tang, Liu He, Daniel Aliaga, Wei Xiong, Jiebo Luo

机构 * University of Rochester(罗切斯特大学) Purdue University(普渡大学) NVIDIA(英伟达)

专题命中 多模态生成 :multi-modal(title,abstract);multimodal(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.19149 2025-05-27 cs.CV 83%

MIND-Edit: MLLM Insight-Driven Editing via Language-Vision Projection

Shuyu Wang, Weiqi Li, Qian Wang, Shijie Zhao, Jian Zhang

机构 * School of Electronic and Computer Engineering, Peking University(北京大学电子与计算机工程学院) ByteDance Inc.(字节跳动公司)

专题命中 多模态生成 :MLLM(title,abstract);multimodal(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.14682 2025-05-21 cs.CV 83%

UniGen: Enhanced Training & Test-Time Strategies for Unified Multimodal Understanding and Generation

Rui Tian, Mingfei Gao, Mingze Xu, Jiaming Hu, Jiasen Lu, Zuxuan Wu, Yinfei Yang, Afshin Dehghan

机构 * Apple(苹果公司) Fudan University(复旦大学)

专题命中 多模态生成 :multimodal(title,abstract);MLLM(abstract);分类 cs.CV

Comments Technical report

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.05472 2025-05-13 cs.CV 83%

Mogao: An Omni Foundation Model for Interleaved Multi-Modal Generation

Chao Liao, Liyang Liu, Xun Wang, Zhengxiong Luo, Xinyu Zhang, Wenliang Zhao, Jie Wu, Liang Li, Zhi Tian, Weilin Huang

机构 * ByteDance Seed(字节跳动种子)

专题命中 多模态生成 :multi-modal(title,abstract);omni-modal(abstract);分类 cs.CV

Comments Mogao Technical Report

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.04512 2025-05-09 cs.CV 83%

HunyuanCustom: A Multimodal-Driven Architecture for Customized Video Generation

Teng Hu, Zhentao Yu, Zhengguang Zhou, Sen Liang, Yuan Zhou, Qin Lin, Qinglin Lu

机构 * Tencent Hunyuan(腾讯文汇)

专题命中 多模态生成 :multimodal(title);multi-modal(abstract);image-text(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2408.02657 2025-04-25 cs.CV 83%

Lumina-mGPT: Illuminate Flexible Photorealistic Text-to-Image Generation with Multimodal Generative Pretraining

Dongyang Liu, Shitian Zhao, Le Zhuo, Weifeng Lin, Yi Xin, Xinyue Li, Qi Qin, Yu Qiao, Hongsheng Li, Peng Gao

专题命中 多模态生成 :multimodal(title,abstract);multi-modal(abstract);分类 cs.CV

Comments Code available at: https://github.com/Alpha-VLLM/Lumina-mGPT

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.03641 2025-04-08 cs.CV 83%

MME-Unify: A Comprehensive Benchmark for Unified Multimodal Understanding and Generation Models

Wulin Xie, Yi-Fan Zhang, Chaoyou Fu, Yang Shi, Bingyan Nie, Hongkai Chen, Zhang Zhang, Liang Wang, Tieniu Tan

专题命中 多模态生成 :multimodal(title,abstract);MLLM(abstract);分类 cs.CV

Comments Project page: https://mme-unify.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.09439 2025-04-08 cs.CV 83%

Spider: Any-to-Many Multimodal LLM

Jinxiang Lai, Jie Zhang, Jun Liu, Jian Li, Xiaocheng Lu, Song Guo

专题命中 多模态生成 :multimodal(title,abstract);any-to-any(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.20644 2025-03-27 cs.CV 83%

MMGen: Unified Multi-modal Image Generation and Understanding in One Go

Jiepeng Wang, Zhaoqing Wang, Hao Pan, Yuan Liu, Dongdong Yu, Changhu Wang, Wenping Wang

专题命中 多模态生成 :multi-modal(title,abstract);cross-modal(abstract);分类 cs.CV

Comments Our project page: https://jiepengwang.github.io/MMGen/

详情

展开后加载摘要…

URL PDF HTML 收藏
2408.00777 2025-03-27 cs.CV eess.SP q-bio.NC 83%

CATD: Unified Representation Learning for EEG-to-fMRI Cross-Modal Generation

Weiheng Yao, Zhihan Lyu, Mufti Mahmud, Ning Zhong, Baiying Lei, Shuqiang Wang

专题命中 多模态生成 :cross-modal(title,abstract);multi-modal(abstract);分类 cs.CV

Comments 11 pages, 9 figures, Accepted by IEEE Transactions on Medical Imaging

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.05818 2025-03-26 cs.CV cs.AI cs.CL cs.LG cs.MM 83%

SILMM: Self-Improving Large Multimodal Models for Compositional Text-to-Image Generation

Leigang Qu, Haochuan Li, Wenjie Wang, Xiang Liu, Juncheng Li, Liqiang Nie, Tat-Seng Chua

专题命中 多模态生成 :multimodal(title,abstract);分类 cs.CV、cs.CL、cs.AI

Comments CVPR 2025 Camera-ready. Project page: https://silmm.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.05814 2025-03-26 cs.CV cs.AI cs.CL cs.LG cs.MM 83%

TIGeR: Unifying Text-to-Image Generation and Retrieval with Large Multimodal Models

Leigang Qu, Haochuan Li, Tan Wang, Wenjie Wang, Yongqi Li, Liqiang Nie, Tat-Seng Chua

专题命中 多模态生成 :multimodal(title,abstract);分类 cs.CV、cs.CL、cs.AI

Comments ICLR 2025 Camera-ready

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.15978 2025-03-21 cs.CV 83%

A Survey on fMRI-based Brain Decoding for Reconstructing Multimodal Stimuli

Pengyu Liu, Guohua Dong, Dan Guo, Kun Li, Fengling Li, Xun Yang, Meng Wang, Xiaomin Ying

专题命中 多模态生成 :multimodal(title,abstract);cross-modal(abstract);分类 cs.CV

Comments 31 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.11190 2025-03-17 cs.SD cs.AI cs.CL cs.MM eess.AS 83%

Cross-Modal Learning for Music-to-Music-Video Description Generation

Zhuoyuan Mao, Mengjie Zhao, Qiyu Wu, Zhi Zhong, Wei-Hsiang Liao, Hiromi Wakaki, Yuki Mitsufuji

专题命中 多模态生成 :cross-modal(title);multimodal(abstract);分类 cs.CL、cs.AI、cs.MM

Comments Accepted by RepL4NLP 2025 @ NAACL 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.07589 2025-03-14 cs.CV 83%

DiffSensei: Bridging Multi-Modal LLMs and Diffusion Models for Customized Manga Generation

Jianzong Wu, Chao Tang, Jingbo Wang, Yanhong Zeng, Xiangtai Li, Yunhai Tong

专题命中 多模态生成 :multi-modal(title);multimodal(abstract);MLLM(abstract);分类 cs.CV

Comments [CVPR 2025] The project page is https://jianzongwu.github.io/projects/diffsensei/

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.08686 2025-03-12 cs.CV 83%

OmniMamba: Efficient and Unified Multimodal Understanding and Generation via State Space Models

Jialv Zou, Bencheng Liao, Qian Zhang, Wenyu Liu, Xinggang Wang

专题命中 多模态生成 :multimodal(title,abstract);image-text(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏