arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

多模态信息融合

面向图像、视频、多传感器和跨模态感知的信息融合,包括 Image Fusion、红外可见光、遥感、医学影像、LiDAR/雷达/相机和音视频融合。

2026-05-13 至 2026-05-13 共收录 1 信号源:cs.CV, eess.IV, eess.SP, cs.RO, cs.MM

1. 融合架构与评测 1 篇

2605.12031 2026-05-13 cs.LG cs.CV 57%

Resilient Vision-Tabular Multimodal Learning under Modality Missingness

在模态缺失下的视觉-表格多模态学习的鲁棒性

Camillo Maria Caruso, Valerio Guarrasi, Paolo Soda

机构 * Research Unit of Artificial Intelligence and Computer Systems, Department of Engineering, Università Campus Bio-Medico di Roma(人工智能与计算机系统研究单位,工程系,罗马生物医学大学) Department of Diagnostics and Intervention, Radiation Physics, Biomedical Engineering, Umeå University(诊断与干预系,辐射物理,生物医学工程,乌梅大学)

专题命中 融合架构与评测 :multimodal fusion(abstract);分类 cs.CV

AI总结 本文提出一种多模态Transformer框架,用于在普遍存在模态缺失的情况下进行视觉-表格联合学习,通过可学习的模态标记和中间融合实现鲁棒的多模态推理。

详情

展开后加载摘要…

URL PDF HTML 收藏