Towards Unified Vision-Language Models with Incomplete Multi-Modal Inputs
面向不完整多模态输入的统一视觉-语言模型
机构 * School of Software Engineering, Huazhong University of Science and Technology(华中科技大学软件工程学院) ; Nanyang Technological University, Singapore(新加坡南洋理工大学) ; University College London(伦敦大学学院) ; Guangzhou University(广州大学) ; Wuhan University(武汉大学) ; Nanjing University(南京大学)
专题命中 其他视频模型 :video-language(abstract);分类 cs.CV
AI总结 针对视频-语言模型在传感器失效导致模态不完整数据下的训练-测试不一致问题,提出首个统一的不完整视频-语言模型作为即插即用模块,提升多模态任务性能。
Comments Published in AAAI 2026