arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

共收录 4946 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 多模态生成 4946 篇

2308.11206 2023-08-23 cs.CV 79%

DiffCloth: Diffusion Based Garment Synthesis and Manipulation via Structural Cross-modal Semantic Alignment

Xujie Zhang, Binbin Yang, Michael C. Kampffmeyer, Wenqing Zhang, Shiyue Zhang, Guansong Lu, Liang Lin, Hang Xu, Xiaodan Liang

专题命中 多模态生成 :cross-modal(title,abstract);分类 cs.CV

Comments accepted by ICCV2023

详情

展开后加载摘要…

URL PDF HTML 收藏
2308.08849 2023-08-21 cs.CV 79%

A Survey on Deep Multi-modal Learning for Body Language Recognition and Generation

Li Liu, Lufei Gao, Wentao Lei, Fengji Ma, Xiaotian Lin, Jinting Wang

专题命中 多模态生成 :multi-modal(title,abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2308.04733 2023-08-15 cs.CV 79%

TextPainter: Multimodal Text Image Generation with Visual-harmony and Text-comprehension for Poster Design

Yifan Gao, Jinpeng Lin, Min Zhou, Chuanbin Liu, Hongtao Xie, Tiezheng Ge, Yuning Jiang

专题命中 多模态生成 :multimodal(title,abstract);分类 cs.CV

Comments Accepted to ACM MM 2023. Dataset Link: https://tianchi.aliyun.com/dataset/160034

详情

展开后加载摘要…

URL PDF HTML 收藏
2307.01969 2023-07-06 cs.CV 79%

Multimodal Prompt Learning for Product Title Generation with Extremely Limited Labels

Bang Yang, Fenglin Liu, Zheng Li, Qingyu Yin, Chenyu You, Bing Yin, Yuexian Zou

专题命中 多模态生成 :multimodal(title,abstract);分类 cs.CV

Comments accepted by ACL Findings 2023

详情

展开后加载摘要…

URL PDF HTML 收藏
2307.01425 2023-07-06 cs.CV 79%

Consistent Multimodal Generation via A Unified GAN Framework

Zhen Zhu, Yijun Li, Weijie Lyu, Krishna Kumar Singh, Zhixin Shu, Soeren Pirk, Derek Hoiem

专题命中 多模态生成 :multimodal(title,abstract);分类 cs.CV

Comments In review

详情

展开后加载摘要…

URL PDF HTML 收藏
2306.16649 2023-06-30 cs.CL 79%

ZeroGen: Zero-shot Multimodal Controllable Text Generation with Multiple Oracles

Haoqin Tu, Bowen Yang, Xianfeng Zhao

专题命中 多模态生成 :multimodal(title,abstract);分类 cs.CL

Comments 17 pages, preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2306.09385 2023-06-19 cs.LG cs.AI eess.SP 79%

Employing Multimodal Machine Learning for Stress Detection

Rahee Walambe, Pranav Nayak, Ashmit Bhardwaj, Ketan Kotecha

专题命中 多模态生成 :multimodal(title,abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2306.01322 2023-06-05 cs.LG cs.CR cs.CV 79%

Privacy Distillation: Reducing Re-identification Risk of Multimodal Diffusion Models

Virginia Fernandez, Pedro Sanchez, Walter Hugo Lopez Pinaya, Grzegorz Jacenków, Sotirios A. Tsaftaris, Jorge Cardoso

专题命中 多模态生成 :multimodal(title,abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2306.01144 2023-06-05 cs.LG cs.CL 79%

Evaluating the Capabilities of Multi-modal Reasoning Models with Synthetic Task Data

Nathan Vaska, Victoria Helus

专题命中 多模态生成 :multi-modal(title,abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2305.02572 2023-06-01 cs.CV 79%

High-fidelity Generalized Emotional Talking Face Generation with Multi-modal Emotion Space Learning

Chao Xu, Junwei Zhu, Jiangning Zhang, Yue Han, Wenqing Chu, Ying Tai, Chengjie Wang, Zhifeng Xie, Yong Liu

专题命中 多模态生成 :multi-modal(title,abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2302.12764 2023-05-22 cs.CV 79%

Modulating Pretrained Diffusion Models for Multimodal Image Synthesis

Cusuh Ham, James Hays, Jingwan Lu, Krishna Kumar Singh, Zhifei Zhang, Tobias Hinz

专题命中 多模态生成 :multimodal(title,abstract);分类 cs.CV

Comments SIGGRAPH Conference Proceedings 2023. Project page at https://mcm-diffusion.github.io

详情

展开后加载摘要…

URL PDF HTML 收藏
2305.02594 2023-05-10 cs.CV 79%

Multimodal-driven Talking Face Generation via a Unified Diffusion-based Generator

Chao Xu, Shaoting Zhu, Junwei Zhu, Tianxin Huang, Jiangning Zhang, Ying Tai, Yong Liu

专题命中 多模态生成 :multimodal(title,abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2304.11697 2023-04-25 cs.CV eess.IV 79%

Informative Data Selection with Uncertainty for Multi-modal Object Detection

Xinyu Zhang, Zhiwei Li, Zhenhong Zou, Xin Gao, Yijin Xiong, Dafeng Jin, Jun Li, Huaping Liu

专题命中 多模态生成 :multi-modal(title,abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2304.10530 2023-04-21 cs.CV 79%

Collaborative Diffusion for Multi-Modal Face Generation and Editing

Ziqi Huang, Kelvin C. K. Chan, Yuming Jiang, Ziwei Liu

专题命中 多模态生成 :multi-modal(title,abstract);分类 cs.CV

Comments CVPR 2023. Project page: https://ziqihuangg.github.io/projects/collaborative-diffusion.html Code: https://github.com/ziqihuangg/Collaborative-Diffusion

详情

展开后加载摘要…

URL PDF HTML 收藏
2304.09728 2023-04-21 cs.CV eess.IV 79%

Any-to-Any Style Transfer: Making Picasso and Da Vinci Collaborate

Songhua Liu, Jingwen Ye, Xinchao Wang

专题命中 多模态生成 :any-to-any(title,abstract);分类 cs.CV

Comments Work in progress

详情

展开后加载摘要…

URL PDF HTML 收藏
2212.00793 2023-04-21 cs.CV 79%

Unite and Conquer: Plug & Play Multi-Modal Synthesis using Diffusion Models

Nithin Gopalakrishnan Nair, Wele Gedara Chaminda Bandara, Vishal M. Patel

专题命中 多模态生成 :multi-modal(title);multimodal(abstract);分类 cs.CV

Comments Accepted at CVPR 2023

详情

展开后加载摘要…

URL PDF HTML 收藏
2303.14081 2023-03-27 eess.IV cs.CV 79%

CoLa-Diff: Conditional Latent Diffusion Model for Multi-Modal MRI Synthesis

Lan Jiang, Ye Mao, Xi Chen, Xiangfeng Wang, Chao Li

专题命中 多模态生成 :multi-modal(title,abstract);分类 cs.CV

Comments 8 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2212.04493 2023-03-23 cs.CV cs.LG 79%

SDFusion: Multimodal 3D Shape Completion, Reconstruction, and Generation

Yen-Chi Cheng, Hsin-Ying Lee, Sergey Tulyakov, Alexander Schwing, Liangyan Gui

专题命中 多模态生成 :multimodal(title);multi-modal(abstract);分类 cs.CV

Comments In CVPR 2023. Project page and code is available at: https://yccyenchicheng.github.io/SDFusion/. Fix some typos

详情

展开后加载摘要…

URL PDF HTML 收藏
2303.09319 2023-03-17 cs.CV 79%

Unified Multi-Modal Latent Diffusion for Joint Subject and Text Conditional Image Generation

Yiyang Ma, Huan Yang, Wenjing Wang, Jianlong Fu, Jiaying Liu

专题命中 多模态生成 :multi-modal(title,abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2303.02688 2023-03-09 cs.CV 79%

Text2Face: A Multi-Modal 3D Face Model

Will Rowan, Patrik Huber, Nick Pears, Andrew Keeling

专题命中 多模态生成 :multi-modal(title,abstract);分类 cs.CV

Comments Fixed formatting and a typo

详情

展开后加载摘要…

URL PDF HTML 收藏
2208.00751 2023-01-18 cs.CV 79%

CSDN: Cross-modal Shape-transfer Dual-refinement Network for Point Cloud Completion

Zhe Zhu, Liangliang Nan, Haoran Xie, Honghua Chen, Mingqiang Wei, Jun Wang, Jing Qin

专题命中 多模态生成 :cross-modal(title,abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2212.02936 2022-12-08 cs.CV 79%

M-VADER: A Model for Diffusion with Multimodal Context

Samuel Weinbach, Marco Bellagente, Constantin Eichenberg, Andrew Dai, Robert Baldock, Souradeep Nanda, Björn Deiseroth, Koen Oostermeijer, Hannah Teufel, Andres Felipe Cruz-Salinas

专题命中 多模态生成 :multimodal(title,abstract);分类 cs.CV

Comments 22 pages, 14 figures, 2 tables, fixed figure 3

详情

展开后加载摘要…

URL PDF HTML 收藏
2210.12565 2022-10-25 cs.CL cs.LG 79%

A Visual Tour Of Current Challenges In Multimodal Language Models

Shashank Sonkar, Naiming Liu, Richard G. Baraniuk

专题命中 多模态生成 :multimodal(title,abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2209.13360 2022-09-29 cs.CV 79%

Draw Your Art Dream: Diverse Digital Art Synthesis with Multimodal Guided Diffusion

Nisha Huang, Fan Tang, Weiming Dong, Changsheng Xu

专题命中 多模态生成 :multimodal(title,abstract);分类 cs.CV

Comments Accepted by ACM MM 2022

详情

展开后加载摘要…

URL PDF HTML 收藏
2001.05490 2022-09-29 cs.AI 79%

Modeling and solving the multimodal car- and ride-sharing problem

Miriam Enzi, Sophie N. Parragh, David Pisinger, Matthias Prandtstetter

专题命中 多模态生成 :multimodal(title,abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2202.12998 2022-09-28 cs.LG cs.AI cs.CY 79%

Integrated multimodal artificial intelligence framework for healthcare applications

Luis R. Soenksen, Yu Ma, Cynthia Zeng, Leonard D. J. Boussioux, Kimberly Villalobos Carballo, Liangyuan Na, Holly M. Wiberg, Michael L. Li, Ignacio Fuentes, Dimitris Bertsimas

专题命中 多模态生成 :multimodal(title,abstract);分类 cs.AI

Journal ref Nature npj Digital Medicine, 2022

详情

展开后加载摘要…

URL PDF HTML 收藏
2209.03160 2022-09-09 cs.CV 79%

AI Illustrator: Translating Raw Descriptions into Images by Prompt-based Cross-Modal Generation

Yiyang Ma, Huan Yang, Bei Liu, Jianlong Fu, Jiaying Liu

专题命中 多模态生成 :cross-modal(title,abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2204.02399 2022-09-07 cs.LG cs.CV eess.IV 79%

Multi-Modal Hypergraph Diffusion Network with Dual Prior for Alzheimer Classification

Angelica I. Aviles-Rivero, Christina Runkel, Nicolas Papadakis, Zoe Kourtzi, Carola-Bibiane Schönlieb

专题命中 多模态生成 :multi-modal(title,abstract);分类 cs.CV

Journal ref MICCAI 2022

详情

展开后加载摘要…

URL PDF HTML 收藏
2110.04854 2022-08-03 cs.CV 79%

Identity-guided Face Generation with Multi-modal Contour Conditions

Qingyan Bai, Weihao Xia, Fei Yin, Yujiu Yang

专题命中 多模态生成 :multi-modal(title,abstract);分类 cs.CV

Comments Accepted to ICIP 2022

详情

展开后加载摘要…

URL PDF HTML 收藏
2207.11795 2022-07-26 cs.CV 79%

Cross-Modal 3D Shape Generation and Manipulation

Zezhou Cheng, Menglei Chai, Jian Ren, Hsin-Ying Lee, Kyle Olszewski, Zeng Huang, Subhransu Maji, Sergey Tulyakov

专题命中 多模态生成 :cross-modal(title);multi-modal(abstract);分类 cs.CV

Comments ECCV 2022. Project page: https://people.cs.umass.edu/~zezhoucheng/edit3d/

详情

展开后加载摘要…

URL PDF HTML 收藏