arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

共收录 4932 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 多模态生成 4932 篇

2404.12973 2025-11-05 eess.IV cs.CV cs.LG q-bio.QM 83%

Cross-modal Diffusion Modelling for Super-resolved Spatial Transcriptomics

Xiaofei Wang, Xingxu Huang, Stephen J. Price, Chao Li

机构 * Department of Clinical Neurosciences, University of Cambridge, UK(剑桥大学临床神经科学系) Department of Applied Mathematics and Theoretical Physics, University of Cambridge, UK(剑桥大学应用数学与理论物理系) School of Science and Engineering, University of Dundee, UK(邓迪大学科学与工程学院) School of Medicine, University of Dundee, UK(邓迪大学医学院) Zhejiang Lab, China(浙江实验室)

专题命中 多模态生成 :cross-modal(title,abstract);multi-modal(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.01163 2025-11-04 cs.CV 83%

ROVER: Benchmarking Reciprocal Cross-Modal Reasoning for Omnimodal Generation

Yongyuan Liang, Wei Chow, Feng Li, Ziqiao Ma, Xiyao Wang, Jiageng Mao, Jiuhai Chen, Jiatao Gu, Yue Wang, Furong Huang

机构 * University of Maryland, College Park(马里兰大学学院公园分校) University of Pennsylvania(宾夕法尼亚大学) The Hong Kong University of Science and Technology(香港科学与技术大学) University of Michigan(密歇根大学) University of Southern California(南加州大学)

专题命中 多模态生成 :cross-modal(title,abstract);multimodal(abstract);分类 cs.CV

Comments Project Page: https://roverbench.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.22827 2025-10-21 cs.CV 83%

ScreenCoder: Advancing Visual-to-Code Generation for Front-End Automation via Modular Multimodal Agents

Yilei Jiang, Yaozhi Zheng, Yuxuan Wan, Jiaming Han, Qunzhong Wang, Michael R. Lyu, Xiangyu Yue

机构 * CUHK(香港中文大学) MMLab(多模态实验室) ARISE Lab(ARISE实验室)

专题命中 多模态生成 :multimodal(title,abstract);MLLM(abstract);分类 cs.CV

Comments ScreenCoder-v2

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.15872 2025-10-21 cs.AR cs.AI cs.LG 83%

Multimodal Chip Physical Design Engineer Assistant

Yun-Da Tsai, Chang-Yu Chao, Liang-Yeh Shen, Tsung-Han Lin, Haoyu Yang, Mark Ho, Yi-Chen Lu, Wen-Hao Liu, Shou-De Lin, Haoxing Ren

机构 * National Taiwan University(国立台湾大学) NVIDIA Research(NVIDIA研究)

专题命中 多模态生成 :multimodal(title,abstract);MLLM(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.15068 2025-10-20 cs.CR cs.AI 83%

Sequential Comics for Jailbreaking Multimodal Large Language Models via Structured Visual Storytelling

Deyue Zhang, Dongdong Yang, Junjie Mu, Quancheng Zou, Zonghao Ying, Wenzhuo Xu, Zhao Liu, Xuan Wang, Xiangzheng Zhang

机构 * AI Security Lab(360人工智能安全实验室) Politecnico di Milano(米兰理工大学) Beihang University(北京航空航天大学)

专题命中 多模态生成 :multimodal(title,abstract);cross-modal(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.14954 2025-10-17 cs.CV 83%

OmniMotion: Multimodal Motion Generation with Continuous Masked Autoregression

Zhe Li, Weihao Yuan, Weichao Shen, Siyu Zhu, Zilong Dong, Chang Xu

机构 * University of Sydney(悉尼大学) Alibaba Group(阿里集团) Fudan University(复旦大学)

专题命中 多模态生成 :multimodal(title,abstract);multi-modal(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.11096 2025-10-14 cs.CV 83%

CoDefend: Cross-Modal Collaborative Defense via Diffusion Purification and Prompt Optimization

Fengling Zhu, Boshi Liu, Jingyu Hua, Sheng Zhong

专题命中 多模态生成 :cross-modal(title,abstract);multimodal(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.08485 2025-10-10 cs.CV 83%

InstructX: Towards Unified Visual Editing with MLLM Guidance

Chong Mou, Qichao Sun, Yanze Wu, Pengze Zhang, Xinghui Li, Fulong Ye, Songtao Zhao, Qian He

机构 * Intelligent Creation Team, ByteDance(字节跳动智能创作团队)

专题命中 多模态生成 :MLLM(title,abstract);multimodal(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.26231 2025-10-01 cs.CV 83%

IMG: Calibrating Diffusion Models via Implicit Multimodal Guidance

Jiayi Guo, Chuanhao Yan, Xingqian Xu, Yulin Wang, Kai Wang, Gao Huang, Humphrey Shi

机构 * Tsinghua University(清华大学)

专题命中 多模态生成 :multimodal(title,abstract);MLLM(abstract);分类 cs.CV

Comments ICCV 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.25681 2025-10-01 cs.RO cs.CV 83%

dVLA: Diffusion Vision-Language-Action Model with Multimodal Chain-of-Thought

Junjie Wen, Minjie Zhu, Jiaming Liu, Zhiyuan Liu, Yicun Yang, Linfeng Zhang, Shanghang Zhang, Yichen Zhu, Yi Xu

机构 * Midea Group(美的集团) Peking University(北京大学) Shanghai Jiaotong University(上海交通大学)

专题命中 多模态生成 :multimodal(title,abstract);cross-modal(abstract);分类 cs.CV

Comments technique report

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.15809 2025-09-26 cs.CV 83%

MMaDA: Multimodal Large Diffusion Language Models

Ling Yang, Ye Tian, Bowen Li, Xinchen Zhang, Ke Shen, Yunhai Tong, Mengdi Wang

机构 * Princeton University(普林斯顿大学) Peking University(北京大学) Tsinghua University(清华大学) ByteDance Seed(字节跳动种子)

专题命中 多模态生成 :multimodal(title,abstract);multimodal foundation model(abstract);分类 cs.CV

Comments NeurIPS 2025. Project: https://github.com/Gen-Verse/MMaDA

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.12148 2025-09-26 cs.CV 83%

HermesFlow: Seamlessly Closing the Gap in Multimodal Understanding and Generation

Ling Yang, Xinchen Zhang, Ye Tian, Chenming Shang, Minghao Xu, Wentao Zhang, Bin Cui

机构 * Peking University(北京大学) Tsinghua University(清华大学) Mila - Québec AI Institute(魁北克人工智能研究所)

专题命中 多模态生成 :multimodal(title,abstract);multimodal foundation model(abstract);分类 cs.CV

Comments NeurIPS 2025. Code: https://github.com/Gen-Verse/HermesFlow

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.17589 2025-09-23 cs.AI 83%

Table2LaTeX-RL: High-Fidelity LaTeX Code Generation from Table Images via Reinforced Multimodal Language Models

Jun Ling, Yao Qi, Tao Huang, Shibo Zhou, Yanqin Huang, Jiang Yang, Ziqi Song, Ying Zhou, Yang Yang, Heng Tao Shen, Peng Wang

机构 * School of Computer Science and Engineering, University of Electronic Science and Technology of China(电子科技大学计算机科学与工程学院) Research Center for Scientific Data Hub, Zhejiang Lab, Hangzhou, China(浙江实验室科学数据中心研究中心) School of Computer Science and Technology, Tongji University(同济大学计算机科学与技术学院)

专题命中 多模态生成 :multimodal(title,abstract);MLLM(abstract);分类 cs.AI

Comments NeurIPS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.16127 2025-09-22 cs.CV 83%

BaseReward: A Strong Baseline for Multimodal Reward Model

Yi-Fan Zhang, Haihua Yang, Huanyu Zhang, Yang Shi, Zezhou Chen, Haochen Tian, Chaoyou Fu, Haotian Wang, Kai Wu, Bo Cui, Xu Wang, Jianfei Pan, Haotian Wang, Zhang Zhang, Liang Wang

机构 * ByteDance(字节跳动) CASIA(中国科学院自动化研究所) NJU(南京大学) PKU(北京大学) THU(清华大学)

专题命中 多模态生成 :multimodal(title,abstract);MLLM(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.13759 2025-09-22 cs.LG cs.AI 83%

Discrete Diffusion in Large Language and Multimodal Models: A Survey

Runpeng Yu, Qi Li, Xinchao Wang

专题命中 多模态生成 :multimodal(title,abstract);MLLM(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.13642 2025-09-18 cs.LG cs.CV 83%

LLM-I: LLMs are Naturally Interleaved Multimodal Creators

Zirun Guo, Feng Zhang, Kai Jia, Tao Jin

机构 * Zhejiang University(浙江大学)

专题命中 多模态生成 :multimodal(title);MLLM(abstract);image-text(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.12883 2025-09-17 cs.CV 83%

Lego-Edit: A General Image Editing Framework with Model-Level Bricks and MLLM Builder

Qifei Jia, Yu Liu, Yajie Chai, Xintong Yao, Qiming Lu, Yasen Zhang, Runyu Shi, Ying Huang, Guoquan Zhang

机构 * Xiaomi Corporation Beijing, China(小米公司北京)

专题命中 多模态生成 :MLLM(title,abstract);multi-modal(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.09456 2025-09-12 cs.CV 83%

FlexiD-Fuse: Flexible number of inputs multi-modal medical image fusion based on diffusion model

Yushen Xu, Xiaosong Li, Yuchun Wang, Xiaoqi Cheng, Huafeng Li, Haishu Tan

机构 * School of Physics(物理学院) Optoelectronic Engineering, Foshan University(光电工程学院,佛山大学) Guangdong-HongKong-Macao Joint Laboratory for Intelligent Micro-Nano Optoelectronic Technology(粤港澳联合智能微纳光电技术实验室) Guangdong Provincial Key Laboratory of Industrial Intelligent Inspection Technology(广东省工业智能检测技术重点实验室) School of Information Engineering(信息工程学院) Automation, Kunming University of Science(自动化系,昆明理工大学)

专题命中 多模态生成 :multi-modal(title,abstract);cross-modal(abstract);分类 cs.CV

Journal ref Expert Systems with Applications, 2025: 128895

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.09012 2025-09-03 cs.CV cs.AI cs.CL cs.MM 83%

Multimodal LLMs Can Reason about Aesthetics in Zero-Shot

Ruixiang Jiang, Changwen Chen

机构 * The Hong Kong Polytechnic University(香港理工大学)

专题命中 多模态生成 :multimodal(title,abstract);分类 cs.CV、cs.CL、cs.AI

Comments ACM MM 2025 Camera Ready

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.11433 2025-08-27 cs.CV 83%

MM-R1: Unleashing the Power of Unified Multimodal Large Language Models for Personalized Image Generation

Qian Liang, Yujia Wu, Kuncheng Li, Jiwei Wei, Shiyuan He, Jinyu Guo, Ning Xie

专题命中 多模态生成 :multimodal(title,abstract);cross-modal(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.17376 2025-08-26 cs.LG cs.CV 83%

ShaLa: Multimodal Shared Latent Space Modelling

Jiali Cui, Yan-Ying Chen, Yanxia Zhang, Matthew Klenk

专题命中 多模态生成 :multimodal(title,abstract);cross-modal(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.12854 2025-08-19 cs.AI cs.CL cs.CV cs.HC cs.MM 83%

E3RG: Building Explicit Emotion-driven Empathetic Response Generation System with Multimodal Large Language Model

Ronghao Lin, Shuai Shen, Weipeng Hu, Qiaolin He, Aolin Xiong, Li Huang, Haifeng Hu, Yap-peng Tan

机构 * Sun Yat-sen University(中山大学) Nanyang Technological University(南洋理工大学) Desay SV Automotive Co., Ltd(德赛西威汽车有限公司) Pazhou Laboratory(琶洲实验室)

专题命中 多模态生成 :multimodal(title,abstract);分类 cs.CV、cs.CL、cs.AI

Comments Accepted at ACM MM 2025 Grand Challenge

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.06134 2025-08-12 cs.CV 83%

X2I: Seamless Integration of Multimodal Understanding into Diffusion Transformer via Attention Distillation

Jian Ma, Qirong Peng, Xu Guo, Chen Chen, Haonan Lu, Zhenyu Yang

机构 * OPPO AI Center(OPPO人工智能中心) Tsinghua University(清华大学)

专题命中 多模态生成 :multimodal(title,abstract);image-text(abstract);分类 cs.CV

Comments Accepted to ICCV 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.05352 2025-08-08 cs.IR cs.AI 83%

Multi-Modal Multi-Behavior Sequential Recommendation with Conditional Diffusion-Based Feature Denoising

Xiaoxi Cui, Weihai Lu, Yu Tong, Yiheng Li, Zhejun Zhao

机构 * Peking University(北京大学) Wuhan University(武汉大学) Shanghai University of International Business(上海国际商务大学) Microsoft(微软公司)

专题命中 多模态生成 :multi-modal(title,abstract);multimodal(abstract);分类 cs.AI

Comments SIGIR 2025

Journal ref SIGIR 2025: Proceedings of the 48th International ACM SIGIR Conference on Research and Development in Information Retrieval Pages 1593 - 1602

详情

展开后加载摘要…

URL PDF HTML 收藏
2311.17963 2025-08-08 cs.CV 83%

M$^{2}$Chat: Empowering VLM for Multimodal LLM Interleaved Text-Image Generation

Xiaowei Chi, Junbo Qi, Rongyu Zhang, Shanghang Zhang, Qifeng Liu, Yike Guo

机构 * The Hong Kong University of Science and Technology(香港科学与技术大学) Waseda University(早稻田大学) Peking University(北京大学)

专题命中 多模态生成 :multimodal(title,abstract);image-text(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.03859 2025-08-07 cs.CV 83%

CreatiLayout: Siamese Multimodal Diffusion Transformer for Creative Layout-to-Image Generation

Hui Zhang, Dexiang Hong, Yitong Wang, Jie Shao, Xinglong Wu, Zuxuan Wu, Yu-Gang Jiang

机构 * Institute of Trustworthy Embodied AI(可信具身人工智能研究院) Fudan University(复旦大学) Shanghai Collaborative Innovation Center of Intelligent Visual Computing(上海智能视觉计算协同创新中心) Bytedance Intelligent Creation(字节跳动智能创作)

专题命中 多模态生成 :multimodal(title,abstract);image-text(abstract);分类 cs.CV

Comments Accepted by ICCV 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.01615 2025-08-05 cs.LG cs.AI 83%

TCDiff: Triplex Cascaded Diffusion for High-fidelity Multimodal EHRs Generation with Incomplete Clinical Data

Yandong Yan, Chenxi Li, Yu Huang, Dexuan Xu, Jiaqi Zhu, Zhongyan Chai, Huamin Zhang

机构 * School of Computer Science, Peking University(北京大学计算机科学学院) School of Information and Software Engineering, University of Electronic Science and Technology of China(电子科技大学信息与软件工程学院) National Engineering Research Center for Software Engineering, Peking University(软件工程国家工程研究中心) Institute of Software, Chinese Academy of Science(中国科学院软件研究所) School of Software and Microelectronics, Peking University(北京大学软件与微电子学院) Institute of Basic Theory of Chinese Medicine, China Academy of Chinese Medical Sciences(中国中医科学院中医基础理论研究所)

专题命中 多模态生成 :multimodal(title,abstract);cross-modal(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.12789 2025-07-29 cs.CV 83%

Efficient Physics Simulation for 3D Scenes via MLLM-Guided Gaussian Splatting

Haoyu Zhao, Hao Wang, Xingyue Zhao, Hao Fei, Hongqiu Wang, Chengjiang Long, Hua Zou

机构 * School of Computer Science, Wuhan University(武汉大学计算机学院) Wuhan National Laboratory for Optoelectronics, Huazhong University of Science and Technology(华中科技大学光电研究院) Meta Reality Lab(Meta现实实验室) Xi’an Jiao Tong University(西安交通大学) National University of Singapore(新加坡国立大学) The Department of Systems Hub, Hong Kong University of Science and Technology (Guangzhou)(香港科技大学系统枢纽部门(广州))

专题命中 多模态生成 :MLLM(title,abstract);multi-modal(abstract);分类 cs.CV

Comments ICCV 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.08513 2025-07-25 cs.GR cs.CV 83%

Advancing Multimodal LLMs by Large-Scale 3D Visual Instruction Dataset Generation

Liu He, Xiao Zeng, Yizhi Song, Albert Y. C. Chen, Lu Xia, Shashwat Verma, Sankalp Dayal, Min Sun, Cheng-Hao Kuo, Daniel Aliaga

机构 * Purdue University(普渡大学) Amazon(亚马逊)

专题命中 多模态生成 :multimodal(title,abstract);MLLM(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.09910 2025-07-15 cs.CV 83%

IGD: Instructional Graphic Design with Multimodal Layer Generation

Yadong Qu, Shancheng Fang, Yuxin Wang, Xiaorui Wang, Zhineng Chen, Hongtao Xie, Yongdong Zhang

机构 * University of Science and Technology of China(中国科学技术大学) YuanShi Technology(元世科技) Institute of Trustworthy Embodied AI, Fudan University(复旦大学可信具身人工智能研究院)

专题命中 多模态生成 :multimodal(title,abstract);MLLM(abstract);分类 cs.CV

Comments ICCV 2025

详情

展开后加载摘要…

URL PDF HTML 收藏