Lumina-DiMOO: An Omni Diffusion Large Language Model for Multi-Modal Generation and Understanding
Yi Xin, Qi Qin, Siqi Luo, Kaiwen Zhu, Juncheng Yan, Yan Tai, Jiayi Lei, Yuewen Cao, Keqi Wang, Yibin Wang, Jinbin Bai, Qian Yu, Dengyang Jiang, Yuandong Pu, Haoxing Chen, Le Zhuo, Junjun He, Gen Luo, Tianbin Li, Ming Hu, Jin Ye, Shenglong Ye, Bo Zhang, Chang Xu, Wenhai Wang, Hongsheng Li, Guangtao Zhai, Tianfan Xue, Bin Fu, Xiaohong Liu, Yu Qiao, Yihao Liu
机构
*
Shanghai AI Laboratory(上海人工智能实验室)
;
Shanghai Innovation Institute(上海创新研究院)
;
Nanjing University(南京大学)
;
The University of Sydney(悉尼大学)
;
Shanghai Jiao Tong University(上海交通大学)
;
Tsinghua University(清华大学)
;
The Chinese University of Hong Kong(香港中文大学)
机构
*
Nanjing University of Aeronautics and Astronautics(南京航空航天大学)
;
Guangdong University of Technology(广东工业大学)
;
The Hong Kong Polytechnic University(香港理工大学)
;
The Chinese University of Hong Kong(香港中文大学)
;
Guizhou University(贵州大学)
;
Zhejiang University(浙江大学)
;
Nanyang Technological University(南洋理工大学)
Design and Application of Multimodal Large Language Model Based System for End to End Automation of Accident Dataset Generation
MD Thamed Bin Zaman Chowdhury, Moazzem Hossain
专题命中
多模态生成
:multimodal(title,abstract);分类 cs.CL
CommentsThis paper is accepted for presentation in TRB annual meeting 2026. The version presented here is the preprint version before peer review process
机构
*
National University of Singapore(新加坡国立大学)
;
Fudan University(复旦大学)
;
Harbin Institute of Technology(哈尔滨工业大学)
;
Eastern Institute of Technology(东方技术研究所)
GoalFlow: Goal-Driven Flow Matching for Multimodal Trajectories Generation in End-to-End Autonomous Driving
Zebin Xing, Xingyu Zhang, Yang Hu, Bo Jiang, Tong He, Qian Zhang, Xiaoxiao Long, Wei Yin
机构
*
School of Artificial Intelligence, University of Chinese Academy of Sciences(中国科学院大学人工智能学院)
;
Horizon Robotics
;
Nanjing University(南京大学)
;
Huazhong University of Science & Technology(华中科技大学)
;
Shanghai AI Laboratory(上海人工智能实验室)
UniMIC: Token-Based Multimodal Interactive Coding for Human-AI Collaboration
Qi Mao, Tinghan Yang, Jiahao Li, Bin Li, Libiao Jin, Yan Lu
机构
*
State Key Laboratory of Media Convergence and Communication(媒体融合与传播国家重点实验室)
;
Communication University of China(中国传媒大学)
;
Microsoft Research Asia(微软亚洲研究院)
TransDiffuser: Diverse Trajectory Generation with Decorrelated Multi-modal Representation for End-to-end Autonomous Driving
Xuefeng Jiang, Yuan Ma, Pengxiang Li, Leimeng Xu, Xin Wen, Kun Zhan, Zhongpu Xia, Peng Jia, Xianpeng Lang, Sheng Sun
机构
*
LiAuto Inc(LiAuto公司)
;
Institute of Computing Technology, Chinese Academy of Sciences(中国科学院计算技术研究所)
;
School of Vehicle and Mobility, Tsinghua University(清华大学车辆与移动研究所)
机构
*
King Abdullah University of Science and Technology(国王阿卜杜勒阿齐兹大学科学与技术大学)
;
Lanzhou University(兰州大学)
;
Meta AI
;
The University of Sydney(悉尼大学)
;
IHPC, A*STAR(IHPC,A*STAR)
MMCIG: Multimodal Cover Image Generation for Text-only Documents and Its Dataset Construction via Pseudo-labeling
Hyeyeon Kim, Sungwoo Han, Jingun Kwon, Hidetaka Kamigaito, Manabu Okumura
机构
*
Chungnam National University(Chungnam 国立大学)
;
Nara Institute of Science and Technology (NAIST)(Nara 科学技术研究所)
;
Institute of Science Tokyo(东京科学研究所)