arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

共收录 4946 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 多模态生成 4946 篇

2403.05262 2025-08-15 cs.CV 79%

Debiasing Multimodal Large Language Models via Penalization of Language Priors

YiFan Zhang, Yang Shi, Weichen Yu, Qingsong Wen, Xue Wang, Wenjing Yang, Zhang Zhang, Liang Wang, Rong Jin

机构 * Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) Peking University(北京大学) Carnegie Mellon University(卡内基梅隆大学) Alibaba Group(阿里巴巴集团) National University of Defense Technology(国防科技大学) Meta

专题命中 多模态生成 :multimodal(title,abstract);分类 cs.CV

Comments 10 pages, 12 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.08821 2025-08-13 cs.CV 79%

3DFroMLLM: 3D Prototype Generation only from Pretrained Multimodal LLMs

Noor Ahmed, Cameron Braunstein, Steffen Eger, Eddy Ilg

专题命中 多模态生成 :multimodal(title);multi-modal(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.11676 2025-08-13 cs.RO cs.AI cs.LG cs.MA 79%

Hypergraph-based Motion Generation with Multi-modal Interaction Relational Reasoning

Keshu Wu, Yang Zhou, Haotian Shi, Dominique Lord, Bin Ran, Xinyue Ye

机构 * organization= Center for Geospatial Sciences, Applications Department of Landscape of Architecture Urban Planning, Texas A\&M University , addressline= 788 Ross St , city= College Station , postcode= 77840 , state= TX , country= United States organization= Zachry Department of Civil Environmental Engineering, Texas A\&M University , addressline= 201 Dwight Look Engineering Building , city= College Station , postcode= 77843 , state= TX , country= United States organization= Department of Civil Environmental Engineering, University of Wisconsin-Madison , addressline= 1415 Engineering Dr , city= Madison , postcode= 53706 , state= WI , country= United States

专题命中 多模态生成 :multi-modal(title,abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.07519 2025-08-12 cs.CV 79%

Exploring Multimodal Diffusion Transformers for Enhanced Prompt-based Image Editing

Joonghyuk Shin, Alchan Hwang, Yujin Kim, Daneul Kim, Jaesik Park

机构 * Seoul National University(首尔国立大学)

专题命中 多模态生成 :multimodal(title,abstract);分类 cs.CV

Comments ICCV 2025. Project webpage: https://joonghyuk.com/exploring-mmdit-web/

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.23186 2025-08-12 cs.CV 79%

HiGarment: Cross-modal Harmony Based Diffusion Model for Flat Sketch to Realistic Garment Image

Junyi Guo, Jingxuan Zhang, Fangyu Wu, Huanda Lu, Qiufeng Wang, Wenmian Yang, Eng Gee Lim, Dongming Lu

机构 * Xi’an Jiaotong Liverpool University(西安交通大学利物浦大学) NingboTech University(宁波科技学院) Beijing Normal University(北京师范大学) Zhejiang University(浙江大学)

专题命中 多模态生成 :cross-modal(title);multi-modal(abstract);分类 cs.CV

Comments ICCV 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.07021 2025-08-12 cs.CV 79%

DocRefine: An Intelligent Framework for Scientific Document Understanding and Content Optimization based on Multimodal Large Model Agents

Kun Qian, Wenjie Li, Tianyu Sun, Wenhong Wang, Wenhan Luo

机构 * Shangqiu University(商丘大学)

专题命中 多模态生成 :multimodal(title,abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.03256 2025-08-11 cs.GR cs.CV 79%

MoDA: Multi-modal Diffusion Architecture for Talking Head Generation

Xinyang Li, Gen Li, Zhihui Lin, Yichen Qian, GongXin Yao, Weinan Jia, Aowen Wang, Weihua Chen, Fan Wang

机构 * Xunguang Team, DAMO Academy, Alibaba Group(达摩院、阿里集团) Zhejiang University(浙江大学) Hupan Lab(虎盘实验室)

专题命中 多模态生成 :multi-modal(title,abstract);分类 cs.CV

Comments 12 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.04229 2025-08-07 cs.CV 79%

Intention Enhanced Diffusion Model for Multimodal Pedestrian Trajectory Prediction

Yu Liu, Zhijie Liu, Xiao Ren, You-Fu Li, He Kong

机构 * Guangdong Provincial Key Laboratory of Fully Actuated System Control Theory and Technology, the Southern University of Science and Technology, Shenzhen 518055, China(广东省全自动化系统控制理论与技术重点实验室,南方科技大学,深圳518055,中国) Department of Mechanical Engineering, City University of Hong Kong, Hong Kong SAR, China(香港城市大学机械工程系,香港特别行政区,中国)

专题命中 多模态生成 :multimodal(title,abstract);分类 cs.CV

Comments To be presented at the 28th IEEE International Conference on Intelligent Transportation Systems (ITSC), 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.20830 2025-08-07 cs.CV 79%

CMT: A Cascade MAR with Topology Predictor for Multimodal Conditional CAD Generation

Jianyu Wu, Yizhou Wang, Xiangyu Yue, Xinzhu Ma, Jingyang Guo, Dongzhan Zhou, Wanli Ouyang, Shixiang Tang

机构 * Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) Shanghai Jiao Tong University(上海交通大学) The Chinese University of Hong Kong(香港中文大学) Beihang University(北京航空航天大学)

专题命中 多模态生成 :multimodal(title,abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.21893 2025-08-06 cs.CV 79%

Aether Weaver: Multimodal Affective Narrative Co-Generation with Dynamic Scene Graphs

Saeed Ghorbani

专题命中 多模态生成 :multimodal(title,abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.01058 2025-08-05 eess.IV cs.CV 79%

ReCoSeg++:Extended Residual-Guided Cross-Modal Diffusion for Brain Tumor Segmentation

Sara Yavari, Rahul Nitin Pandya, Jacob Furst

机构 * School of Computing, DePaul University(计算学院,德保罗大学)

专题命中 多模态生成 :cross-modal(title,abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.01577 2025-08-05 eess.IV cs.CV 79%

Tractography-Guided Dual-Label Collaborative Learning for Multi-Modal Cranial Nerves Parcellation

Lei Xie, Junxiong Huang, Yuanjing Feng, Qingrun Zeng

机构 * Zhejiang University of Technology(浙江工业大学)

专题命中 多模态生成 :multi-modal(title,abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.23202 2025-08-01 cs.CV 79%

Adversarial-Guided Diffusion for Multimodal LLM Attacks

Chengwei Xia, Fan Ma, Ruijie Quan, Kun Zhan, Yi Yang

机构 * School of Information Science and Engineering, Lanzhou University(兰州大学信息科学与工程学院) College of Computer Science and Technology, Zhejiang University(浙江大学计算机科学与技术学院) College of Computing and Data Science, Nanyang Technological University(南洋理工大学计算与数据科学学院)

专题命中 多模态生成 :multimodal(title,abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.21872 2025-08-01 cs.AI 79%

MultiEditor: Controllable Multimodal Object Editing for Driving Scenarios Using 3D Gaussian Splatting Priors

Shouyi Lu, Zihan Lin, Chao Lu, Huanran Wang, Guirong Zhuo, Lianqing Zheng

专题命中 多模态生成 :multimodal(title,abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.19939 2025-07-29 cs.CV 79%

LLMControl: Grounded Control of Text-to-Image Diffusion-based Synthesis with Multimodal LLMs

Jiaze Wang, Rui Chen, Haowang Cui

机构 * Tianjin University(天津大学)

专题命中 多模态生成 :multimodal(title,abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.02984 2025-07-29 cs.CL 79%

From Answers to Rationales: Self-Aligning Multimodal Reasoning with Answer-Oriented Chain-of-Thought

Wentao Tan, Qiong Cao, Yibing Zhan, Chao Xue, Changxing Ding

专题命中 多模态生成 :multimodal(title,abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.21291 2025-07-29 cs.CV 79%

MIGE: Mutually Enhanced Multimodal Instruction-Based Image Generation and Editing

Xueyun Tian, Wei Li, Bingbing Xu, Yige Yuan, Yuanzhuo Wang, Huawei Shen

机构 * State Key Laboratory of AI Safety, Institute of Computing Technology, Chinese Academy of Sciences(人工智能安全国家重点实验室,计算技术研究所,中国科学院) University of Chinese Academy of Sciences(中国科学院大学)

专题命中 多模态生成 :multimodal(title,abstract);分类 cs.CV

Comments This paper have been accepted by ACM MM25

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.03225 2025-07-29 cs.CV 79%

MaterialPicker: Multi-Modal DiT-Based Material Generation

Xiaohe Ma, Valentin Deschaintre, Miloš Hašan, Fujun Luan, Kun Zhou, Hongzhi Wu, Yiwei Hu

机构 * State Key Lab of CAD\&CG, Zhejiang University(浙江大学CAD与CG国家重点实验室) Adobe Research(Adobe研究) State Key Lab of CAD\&CG, Zhejiang University and ZJU-FaceUnity Joint Lab of Intelligent Graphics(浙江大学CAD与CG国家重点实验室) ZJU-FaceUnity Joint Lab of Intelligent Graphics(浙大-面 unity 智能图形联合实验室)

专题命中 多模态生成 :multi-modal(title,abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.18763 2025-07-28 cs.CV cs.RO 79%

Diffusion-FS: Multimodal Free-Space Prediction via Diffusion for Autonomous Driving

Keshav Gupta, Tejas S. Stanley, Pranjal Paul, Arun K. Singh, K. Madhava Krishna

机构 * Robotics Research Center, IIIT-Hyderabad(IIIT-海得拉巴机器人研究中心) The University of Tartu(塔尔图大学)

专题命中 多模态生成 :multimodal(title,abstract);分类 cs.CV

Comments 8 pages, 7 figures, IROS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.14024 2025-07-21 cs.CV 79%

Moodifier: MLLM-Enhanced Emotion-Driven Image Editing

Jiarong Ye, Sharon X. Huang

机构 * The Pennsylvania State University(宾夕法尼亚州立大学)

专题命中 多模态生成 :MLLM(title);multimodal(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.02994 2025-07-18 cs.DB cs.AI cs.LG 79%

MedPix 2.0: A Comprehensive Multimodal Biomedical Data set for Advanced AI Applications with Retrieval Augmented Generation and Knowledge Graphs

Irene Siragusa, Salvatore Contino, Massimo La Ciura, Rosario Alicata, Roberto Pirrone

机构 * Department of Engineering, University of Palermo(1 工程学院,巴勒莫大学)

专题命中 多模态生成 :multimodal(title,abstract);分类 cs.AI

Journal ref Data Sci. Eng. (2025)

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.06662 2025-07-10 cs.CV cs.RO 79%

MK-Pose: Category-Level Object Pose Estimation via Multimodal-Based Keypoint Learning

Yifan Yang, Peili Song, Enfan Lan, Dong Liu, Jingtai Liu

机构 * Institute of Robotics and Automatic Information System(机器人与自动信息系统研究所) Tianjin Key Laboratory of Intelligent Robotics(天津智能机器人重点实验室) TBI center(TBI中心) Nankai University(南开大学)

专题命中 多模态生成 :multimodal(title,abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.06571 2025-07-10 cs.CL 79%

Enhancing Food-Domain Question Answering with a Multimodal Knowledge Graph: Hybrid QA Generation and Diversity Analysis

Srihari K B, Pushpak Bhattacharyya

专题命中 多模态生成 :multimodal(title,abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.05790 2025-07-09 cs.CV 79%

TalkFashion: Intelligent Virtual Try-On Assistant Based on Multimodal Large Language Model

Yujie Hu, Xuanyu Zhang, Weiqi Li, Jian Zhang

机构 * School of Electronic and Computer Engineering, Peking University, China(北京大学电子与计算机工程学院) Guangdong Provincial Key Laboratory of Ultra High Definition Immersive Media Technology, Shenzhen Graduate School, Peking University(北京大学深圳研究生院)

专题命中 多模态生成 :multimodal(title);multi-modal(abstract);分类 cs.CV

Comments 6 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.02995 2025-07-09 cs.CV cs.CR 79%

FreqCross: A Multi-Modal Frequency-Spatial Fusion Network for Robust Detection of Stable Diffusion 3.5 Generated Images

Guang Yang

机构 * University of California, Berkeley(加州大学伯克利分校)

专题命中 多模态生成 :multi-modal(title,abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.04000 2025-07-08 cs.IR cs.AI 79%

Leveraging Multimodal Data and Side Users for Diffusion Cross-Domain Recommendation

Fan Zhang, Jinpeng Chen, Huan Li, Senzhang Wang, Yuan Cao, Kaimin Wei, JianXiang He, Feifei Kou, Jinqing Wang

机构 * School of Computer Science (National Pilot Software Engineering School), Beijing University of Posts and Telecommunications(北京邮电大学计算机学院(国家级试点软件工程学院)) The State Key Laboratory of Blockchain and Data Security, Zhejiang University(浙江大学区块链与数据安全国家重点实验室) Central South University(中南大学) National University of Singapore(新加坡国立大学) Jinan University(暨南大学)

专题命中 多模态生成 :multimodal(title,abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.14453 2025-07-08 cs.CV cs.GR cs.LG 79%

Multimodal Latent Diffusion Model for Complex Sewing Pattern Generation

Shengqi Liu, Yuhao Cheng, Zhuo Chen, Xingyu Ren, Wenhan Zhu, Lincheng Li, Mengxiao Bi, Xiaokang Yang, Yichao Yan

机构 * MoE Key Lab of Artificial Intelligence, AI Institute, Shanghai Jiao Tong University, China(人工智能领域关键实验室、人工智能研究院、上海交通大学)

专题命中 多模态生成 :multimodal(title);multi-modal(abstract);分类 cs.CV

Comments Our project page: https://shengqiliu1.github.io/SewingLDM

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.03326 2025-07-08 cs.CV 79%

Mirror in the Model: Ad Banner Image Generation via Reflective Multi-LLM and Multi-modal Agents

Zhao Wang, Bowen Chen, Yotaro Shimose, Sota Moriyama, Heng Wang, Shingo Takamatsu

专题命中 多模态生成 :multi-modal(title,abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.22374 2025-06-30 cs.LG cs.AI 79%

Sheaf-Based Decentralized Multimodal Learning for Next-Generation Wireless Communication Systems

Abdulmomen Ghalkha, Zhuojun Tian, Chaouki Ben Issaid, Mehdi Bennis

机构 * Center for Wireless Communications, University of Oulu(无线通信中心,奥卢大学)

专题命中 多模态生成 :multimodal(title,abstract);分类 cs.AI

Comments 13 pages, 9 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.21832 2025-06-30 cs.CV 79%

TaleForge: Interactive Multimodal System for Personalized Story Creation

Minh-Loi Nguyen, Quang-Khai Le, Tam V. Nguyen, Minh-Triet Tran, Trung-Nghia Le

机构 * 1 University of Science, VNU-HCM, Ho Chi Minh City, Vietnam 2 Vietnam National University, Ho Chi Minh City, Vietnam 3 Department of Computer Science \ of Dayton Ohio, United States

专题命中 多模态生成 :multimodal(title,abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏