MODUS: Decoder-Only Any-to-Any Modeling of Diverse Modalities
MODUS:仅解码器的多模态任意到任意建模
Mingqiao Ye, Zhaochong An, Zhitong Gao, Xian Liu, François Fleuret, Chuan Li, Amir Zadeh, Serge Belongie, Afshin Dehghan, Jesse Allardice, David Mizrahi, Oğuzhan Fatih Kar, Roman Bachmann, Amir Zamir
FlowInOne:Unifying Multimodal Generation as Image-in, Image-out Flow Matching
FlowInOne:将多模态生成统一为图像输入、图像输出的流匹配
Junchao Yi, Rui Zhao, Jiahao Tang, Weixian Lei, Linjie Li, Qisheng Su, Zhengyuan Yang, Lijuan Wang, Xiaofeng Zhu, Alex Jinpeng Wang
机构
*
University of Electronic Science and Technology of China(电子科技大学)
;
Central South University(中南大学)
;
National University of Singapore(新加坡国立大学)
;
University of Science and Technology of China(中国科学技术大学)
;
Microsoft(微软)
LaP-Forensics: Latent-Pixel Consistency Guided Multimodal Reasoning for Deepfake Detection
LaP-Forensics:用于深度伪造检测的潜在像素一致性引导的多模态推理
Can Wang, Yuhao Wang, Yushe Cao, Canran Xiao, Fei Shen
机构
*
The Hong Kong Polytechnic University(香港理工大学)
;
University College London(伦敦大学学院)
;
Tsinghua University(清华大学)
;
Sun Yat-sen University(中山大学)
;
National University of Singapore(新加坡国立大学)