arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

2026-04-17 至 2026-04-17 共收录 7 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 多模态生成 7 篇

2512.14098 2026-04-17 cs.LG cs.DC 88%

Cornfigurator: Automated Planning for Any-to-Any Multimodal Model Serving

Cornfigurator:任意到任意多模态模型服务的自动化规划

Jeff J. Ma, Jae-Won Chung, Jisang Ahn, Yizhuo Liang, Runyu Lu, Akshay Jajoo, Myungjin Lee, Mosharaf Chowdhury

机构 * University of Michigan(密歇根大学) University of Southern California(南加州大学) Cisco Research(思科研究)

专题命中 多模态生成 :multimodal(title,abstract);any-to-any(title,abstract)

AI总结 Cornfigurator是首个针对通用任意到任意模型推理服务的部署规划器,通过统计评估最大化服务吞吐量,比现有系统和专家调优方案提升1.12至6.32倍。

Comments Open-source at https://github.com/cornserve-ai/cornfigurator

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.14574 2026-04-17 cs.CV 79%

M3D-Net: Multi-Modal 3D Facial Feature Reconstruction Network for Deepfake Detection

M3D-Net:面向深度伪造检测的多模态3D面部特征重建网络

Haotian Wu, Yue Cheng, Shan Bian

机构 * College of Mathematics and Informatics(数学与信息学院) South China Agricultural University(华南农业大学) Wushan Road, Tianhe District(天河南路) Guangzhou(广州) China(中国)

专题命中 多模态生成 :multi-modal(title,abstract);分类 cs.CV

AI总结 本文提出M3D-Net,通过多模态特征融合和3D重建模块提升深度伪造检测的准确性和鲁棒性,实验表明其在多个数据集上表现优异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.14268 2026-04-17 cs.CV 79%

HY-World 2.0: A Multi-Modal World Model for Reconstructing, Generating, and Simulating 3D Worlds

HY-World 2.0:一个多模态世界模型用于重建、生成和模拟3D世界

Team HY-World, Chenjie Cao, Xuhui Zuo, Zhenwei Wang, Yisu Zhang, Junta Wu, Zhenyang Liu, Yuning Gong, Yang Liu, Bo Yuan, Chao Zhang, Coopers Li, Dongyuan Guo, Fan Yang, Haiyu Zhang, Hang Cao, Jianchen Zhu, Jiaxin Lin, Jie Xiao, Jihong Zhang, Junlin Yu, Lei Wang, Lifu Wang, Lilin Wang, Linus, Minghui Chen, Peng He, Penghao Zhao, Qi Chen, Rui Chen, Rui Shao, Sicong Liu, Wangchen Qin, Xiaochuan Niu, Xiang Yuan, Yi Sun, Yifei Tang, Yifu Sun, Yihang Lian, Yonghao Tan, Yuhong Liu, Yuyang Yin, Zhiyuan Min, Tengfei Wang, Chunchao Guo

机构 * Tencent(腾讯)

专题命中 多模态生成 :multi-modal(title,abstract);分类 cs.CV

AI总结 HY-World 2.0通过多模态输入生成高保真3D场景,改进了先前版本,引入了多项创新以提升全景真实性、3D场景理解和规划能力,并升级了WorldStereo和WorldMirror模型,实现了3D世界交互探索。

Comments Project Page: https://3d-models.hunyuan.tencent.com/world/ ; Code: https://github.com/Tencent-Hunyuan/HY-World-2.0

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.23468 2026-04-17 cs.RO cs.AI cs.LG 79%

Multi-Modal Manipulation via Multi-Modal Policy Consensus

多模态操控 via 多模态策略共识

Haonan Chen, Jiaming Xu, Hongyu Chen, Kaiwen Hong, Binghao Huang, Chaoqi Liu, Jiayuan Mao, Yunzhu Li, Yilun Du, Katherine Driggs-Campbell

机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) Columbia University(哥伦比亚大学) Massachusetts Institute of Technology(麻省理工学院) Harvard University(哈佛大学)

专题命中 多模态生成 :multi-modal(title);multimodal(abstract);分类 cs.AI

AI总结 本文提出通过多模态策略共识实现多模态操控,采用扩散模型分解策略并利用路由网络动态组合模态贡献,提升机器人操控任务中多模态推理能力。

Comments 8 pages, 7 figures. Project website: https://policyconsensus.github.io

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.09057 2026-04-17 cs.CV cs.MM cs.SD 62%

Tora3: Trajectory-Guided Audio-Video Generation with Physical Coherence

Tora3:基于轨迹的音频视频生成与物理一致性

Junchao Liao, Zhenghao Zhang, Xiangyu Meng, Litao Li, Ziying Zhang, Siyu Zhu, Long Qin, Weizhi Wang

机构 * Alibaba Cloud Computing(阿里巴巴云 computing) Fudan University(复旦大学)

专题命中 多模态生成 :multimodal(abstract);分类 cs.CV、cs.MM

AI总结 Tora3通过引入轨迹作为共享的运动先验,提升音频视频生成的物理一致性,采用轨迹对齐的运动表示和混合流匹配方案,改进运动真实性和运动-声音同步性。

Comments 12 pages, 5 tables, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.07069 2026-04-17 cs.CV cs.AI 62%

Bird-SR: Bidirectional Reward-Guided Diffusion for Real-World Image Super-Resolution

Bird-SR:双向奖励引导扩散用于现实世界图像超分辨率

Zihao Fan, Xin Lu, Yidi Liu, Jie Huang, Dong Li, Xueyang Fu, Baocai Yin

机构 * MoE Key Laboratory of Brain-inspired Intelligent Perception and Cognition, School of Information Science and Technology, University of Science and Technology of China(脑启发智能感知与认知MoE实验室,信息科学与技术学院,中国科学技术大学) iFlytek Research, iFlytek Co., Ltd., Hefei, China(科大讯飞研究院,科大讯飞股份有限公司,合肥,中国)

专题命中 多模态生成 :multimodal(abstract);分类 cs.CV、cs.AI

AI总结 Bird-SR通过双向奖励引导扩散框架,结合合成和真实图像数据,提升现实世界超分辨率的结构一致性与感知质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.15311 2026-04-17 cs.CV 57%

LeapAlign: Post-Training Flow Matching Models at Any Generation Step by Building Two-Step Trajectories

LeapAlign: 通过构建两步轨迹实现任意生成步骤的训练后流匹配模型对齐

Zhanhao Liang, Tao Yang, Jie Wu, Chengjian Feng, Liang Zheng

机构 * The Australian National University(澳大利亚国立大学)

专题命中 多模态生成 :image-text(abstract);分类 cs.CV

AI总结 本文提出LeapAlign方法,通过缩短生成轨迹为两步,减少计算成本并实现早期生成步骤的梯度传播,提升模型更新效率与稳定性,优于现有方法。

Comments Accepted by CVPR 2026. Project page: https://rockeycoss.github.io/leapalign/

详情

展开后加载摘要…

URL PDF HTML 收藏