arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

共收录 4951 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 多模态生成 4951 篇

2502.04378 2025-02-10 cs.CV cs.GR cs.LG cs.SE 74%

DILLEMA: Diffusion and Large Language Models for Multi-Modal Augmentation

Luciano Baresi, Davide Yi Xian Hu, Muhammad Irfan Mas'udi, Giovanni Quattrocchi

专题命中 多模态生成 :multi-modal(title);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.07320 2025-01-09 cs.CV 74%

CoMA: Compositional Human Motion Generation with Multi-modal Agents

Shanlin Sun, Gabriel De Araujo, Jiaqi Xu, Shenghan Zhou, Hanwen Zhang, Ziheng Huang, Chenyu You, Xiaohui Xie

专题命中 多模态生成 :multi-modal(title);分类 cs.CV

Comments Project Page: https://gabrie-l.github.io/coma-page/

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.06997 2024-12-30 eess.IV cs.CV 74%

Feasibility Study of a Diffusion-Based Model for Cross-Modal Generation of Knee MRI from X-ray: Integrating Radiographic Feature Information

Zhe Wang, Yung Hsin Chen, Aladine Chetouani, Fabian Bauer, Yuhua Ru, Fang Chen, Liping Zhang, Rachid Jennane, Mohamed Jarraya

专题命中 多模态生成 :cross-modal(title);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2408.14368 2024-12-24 cs.RO cs.AI 74%

GR-MG: Leveraging Partially Annotated Data via Multi-Modal Goal-Conditioned Policy

Peiyan Li, Hongtao Wu, Yan Huang, Chilam Cheang, Liang Wang, Tao Kong

专题命中 多模态生成 :multi-modal(title);分类 cs.AI

Comments 8 pages, 5 figures, RA-L

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.10740 2024-11-12 cs.CV 74%

FreeMotion: MoCap-Free Human Motion Synthesis with Multimodal Large Language Models

Zhikai Zhang, Yitang Li, Haofeng Huang, Mingxian Lin, Li Yi

专题命中 多模态生成 :multimodal(title);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.03982 2024-11-07 cs.CV 74%

ReEdit: Multimodal Exemplar-Based Image Editing with Diffusion Models

Ashutosh Srivastava, Tarun Ram Menta, Abhinav Java, Avadhoot Jadhav, Silky Singh, Surgan Jandial, Balaji Krishnamurthy

专题命中 多模态生成 :multimodal(title);分类 cs.CV

Comments First three authors contributed equally to this work

详情

展开后加载摘要…

URL PDF HTML 收藏
2207.09185 2024-10-23 cs.LG cs.AI 74%

Multimodal hierarchical Variational AutoEncoders with Factor Analysis latent space

Alejandro Guerrero-López, Carlos Sevilla-Salcedo, Vanessa Gómez-Verdejo, Pablo M. Olmos

专题命中 多模态生成 :multimodal(title);分类 cs.AI

Comments 21 pages main work, 2 pages supplementary, 14 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.13305 2024-10-15 cs.AI 74%

Multimodal MRI Accurately Identifies Amyloid Status in Unbalanced Cohorts in Alzheimer's Disease Continuum

Giorgio Dolci, Charles A. Ellis, Federica Cruciani, Lorenza Brusini, Anees Abrol, Ilaria Boscolo Galazzo, Gloria Menegaz, Vince D. Calhoun

专题命中 多模态生成 :multimodal(title);分类 cs.AI

Comments 16 pages, 3 figures, provisionally accepted to a journal

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.08100 2024-10-15 cs.CV 74%

CrackSegDiff: Diffusion Probability Model-based Multi-modal Crack Segmentation

Xiaoyan Jiang, Licheng Jiang, Anjie Wang, Kaiying Zhu, Yongbin Gao

专题命中 多模态生成 :multi-modal(title);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.02936 2024-10-02 eess.IV cs.CV 74%

Radiomics-guided Multimodal Self-attention Network for Predicting Pathological Complete Response in Breast MRI

Jonghun Kim, Hyunjin Park

专题命中 多模态生成 :multimodal(title);分类 cs.CV

Comments 5 pages, 5 figures, IEEE ISBI 2024 proceedings

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.02919 2024-09-10 cs.CV 74%

HiPrompt: Tuning-free Higher-Resolution Generation with Hierarchical MLLM Prompts

Xinyu Liu, Yingqing He, Lanqing Guo, Xiang Li, Bu Jin, Peng Li, Yan Li, Chi-Min Chan, Qifeng Chen, Wei Xue, Wenhan Luo, Qifeng Liu, Yike Guo

专题命中 多模态生成 :MLLM(title);分类 cs.CV

Comments https://liuxinyv.github.io/HiPrompt/

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.02610 2024-06-06 q-bio.QM cs.AI cs.LG 74%

MoFormer: Multi-objective Antimicrobial Peptide Generation Based on Conditional Transformer Joint Multi-modal Fusion Descriptor

Li Wang, Xiangzheng Fu, Jiahao Yang, Xinyi Zhang, Xiucai Ye, Yiping Liu, Tetsuya Sakurai, Xiangxiang Zeng

专题命中 多模态生成 :multi-modal(title);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2405.07164 2024-05-14 cs.CV 74%

Modeling Pedestrian Intrinsic Uncertainty for Multimodal Stochastic Trajectory Prediction via Energy Plan Denoising

Yao Liu, Quan Z. Sheng, Lina Yao

专题命中 多模态生成 :multimodal(title);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2404.09977 2024-04-16 cs.CV 74%

MaxFusion: Plug&Play Multi-Modal Generation in Text-to-Image Diffusion Models

Nithin Gopalakrishnan Nair, Jeya Maria Jose Valanarasu, Vishal M Patel

专题命中 多模态生成 :multi-modal(title);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2311.17516 2024-04-02 cs.CR cs.CV 74%

MMA-Diffusion: MultiModal Attack on Diffusion Models

Yijun Yang, Ruiyuan Gao, Xiaosen Wang, Tsung-Yi Ho, Nan Xu, Qiang Xu

专题命中 多模态生成 :multimodal(title);分类 cs.CV

Comments CVPR 2024. Our codes and benchmarks are available at https://github.com/cure-lab/MMA-Diffusion

详情

展开后加载摘要…

URL PDF HTML 收藏
2403.08764 2024-03-14 cs.CV 74%

VLOGGER: Multimodal Diffusion for Embodied Avatar Synthesis

Enric Corona, Andrei Zanfir, Eduard Gabriel Bazavan, Nikos Kolotouros, Thiemo Alldieck, Cristian Sminchisescu

专题命中 多模态生成 :multimodal(title);分类 cs.CV

Comments Project web: https://enriccorona.github.io/vlogger/

详情

展开后加载摘要…

URL PDF HTML 收藏
2311.04552 2024-02-27 eess.IV cs.CV 74%

A 3D generative model of pathological multi-modal MR images and segmentations

Virginia Fernandez, Walter Hugo Lopez Pinaya, Pedro Borges, Mark S. Graham, Tom Vercauteren, M. Jorge Cardoso

专题命中 多模态生成 :multi-modal(title);分类 cs.CV

Comments Accepted for publication at the 2023 Deep Generative Models (DGM4MICCAI) MICCAI workshop (Vancouver, Canada)

详情

展开后加载摘要…

URL PDF HTML 收藏
2312.17353 2024-01-03 eess.SY cs.AI cs.LG cs.SY 74%

Towards Auto-Modeling of Formal Verification for NextG Protocols: A Multimodal cross- and self-attention Large Language Model Approach

Jingda Yang, Ying Wang

专题命中 多模态生成 :multimodal(title);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2310.07287 2023-10-12 cs.MM 74%

Interactive Interior Design Recommendation via Coarse-to-fine Multimodal Reinforcement Learning

He Zhang, Ying Sun, Weiyu Guo, Yafei Liu, Haonan Lu, Xiaodong Lin, Hui Xiong

专题命中 多模态生成 :multimodal(title);分类 cs.MM

Comments Accepted by ACM International Conference on Multimedia'23. 9 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2302.08706 2023-02-21 cs.CV 74%

Fine-grained Cross-modal Fusion based Refinement for Text-to-Image Synthesis

Haoran Sun, Yang Wang, Haipeng Liu, Biao Qian

专题命中 多模态生成 :cross-modal(title);分类 cs.CV

Comments 13 pages, 8 figures, accepted by Chinese Journal of Electronics

详情

展开后加载摘要…

URL PDF HTML 收藏
2211.14286 2023-02-07 cs.CV cs.LG 74%

CHIMLE: Conditional Hierarchical IMLE for Multimodal Conditional Image Synthesis

Shichong Peng, Alireza Moazeni, Ke Li

专题命中 多模态生成 :multimodal(title);分类 cs.CV

Comments More results and code are available on the project website at https://niopeng.github.io/CHIMLE/

详情

展开后加载摘要…

URL PDF HTML 收藏
2210.03007 2022-10-07 cs.CV cs.GR cs.LG 74%

XDGAN: Multi-Modal 3D Shape Generation in 2D Space

Hassan Abu Alhaija, Alara Dirik, André Knörig, Sanja Fidler, Maria Shugrina

专题命中 多模态生成 :multi-modal(title);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2206.08916 2022-10-06 cs.CV 74%

Unified-IO: A Unified Model for Vision, Language, and Multi-Modal Tasks

Jiasen Lu, Christopher Clark, Rowan Zellers, Roozbeh Mottaghi, Aniruddha Kembhavi

专题命中 多模态生成 :multi-modal(title);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2207.14781 2022-08-01 cs.CV cs.LG q-bio.QM 74%

Using Multi-modal Data for Improving Generalizability and Explainability of Disease Classification in Radiology

Pranav Agnihotri, Sara Ketabi, Khashayar, Namdar, Farzad Khalvati

专题命中 多模态生成 :multi-modal(title);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2111.05039 2021-11-10 cs.CL cs.IR cs.IT cs.SI math.IT 74%

Multimodal intelligibility of scholarly hypertext: the documentalist's contribution. A required collaboration for serial documentisation in the scientific editorial process

Gérald Kembellec

专题命中 多模态生成 :multimodal(title);分类 cs.CL

Comments in French, H2PTM, Oct 2021, Paris, France

详情

展开后加载摘要…

URL PDF HTML 收藏
2106.13188 2021-06-25 eess.IV cs.CV cs.LG 74%

Q-space Conditioned Translation Networks for Directional Synthesis of Diffusion Weighted Images from Multi-modal Structural MRI

Mengwei Ren, Heejong Kim, Neel Dey, Guido Gerig

专题命中 多模态生成 :multi-modal(title);分类 cs.CV

Comments Accepted by MICCAI 2021. Project page: https://heejongkim.com/dwi-synthesis; Code: https://github.com/mengweiren/q-space-conditioned-dwi-synthesis

详情

展开后加载摘要…

URL PDF HTML 收藏
2011.04779 2020-11-11 cs.CV cs.IR cs.LG 74%

After All, Only The Last Neuron Matters: Comparing Multi-modal Fusion Functions for Scene Graph Generation

Mohamed Karim Belaid

专题命中 多模态生成 :multi-modal(title);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
1908.08191 2019-08-23 cs.CL 74%

Entropy-Enhanced Multimodal Attention Model for Scene-Aware Dialogue Generation

Kuan-Yen Lin, Chao-Chun Hsu, Yun-Nung Chen, Lun-Wei Ku

专题命中 多模态生成 :multimodal(title);分类 cs.CL

Comments DSTC7 collocated with AAAI2019

详情

展开后加载摘要…

URL PDF HTML 收藏
1906.03922 2019-06-11 cs.CV 74%

Generation of Multimodal Justification Using Visual Word Constraint Model for Explainable Computer-Aided Diagnosis

Hyebin Lee, Seong Tae Kim, Yong Man Ro

专题命中 多模态生成 :multimodal(title);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
1809.07921 2018-09-24 cs.CV 74%

Adversarial 3D Human Pose Estimation via Multimodal Depth Supervision

Kun Zhou, Jinmiao Cai, Yao Li, Yulong Shi, Xiaoguang Han, Nianjuan Jiang, Kui Jia, Jiangbo Lu

专题命中 多模态生成 :multimodal(title);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏