arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

多模态信息融合

面向图像、视频、多传感器和跨模态感知的信息融合,包括 Image Fusion、红外可见光、遥感、医学影像、LiDAR/雷达/相机和音视频融合。

2026-05-14 至 2026-05-14 共收录 7 信号源:cs.CV, eess.IV, eess.SP, cs.RO, cs.MM

1. 红外-可见光融合 4 篇

2605.13049 2026-05-14 cs.CV 83%

Uncertainty-aware Spatial-Frequency Registration and Fusion for Infrared and Visible Images

具有不确定性的空间-频率配准与融合用于红外和可见图像

Xingyuan Li, Haoyuan Xu, Xingyue Zhu, Jun Ma, Yang Zou, Zhiying Jiang, Jinyuan Liu

机构 * Dalian University of Technology(大连理工大学) Northwestern Polytechnical University(西北工业大学) Dalian Maritime University(大连海事大学)

专题命中 红外-可见光融合 :infrared and visible(title,abstract);image fusion(abstract);分类 cs.CV

AI总结 本文提出SFRF框架,通过整合不确定性估计和红外热辐射分布一致性,解决配准误差累积问题,提升空间和频率域的融合效果。

Comments 10 pages, 5 figures, 4 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.15642 2026-05-14 cs.CV 83%

UNIV: Unified Foundation Model for Infrared and Visible Modalities

UNIV:用于红外和可见模态的统一基础模型

Fangyuan Mao, Shuo Wang, Jilin Mei, Shun Lu, Chen Min, Fuyang Liu, Xiaokun Feng, Meiqi Wu, Yu Hu

机构 * Research Center for Intelligent Computing Systems, CAS ICT(智能计算系统研究所以及中国科学院信息科技研究院) University of Chinese Academy of Sciences(中国科学院大学) Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所)

专题命中 红外-可见光融合 :infrared and visible(title,abstract);visible-infrared(abstract);分类 cs.CV

AI总结 UNIV通过跨模态对比学习提升红外与可见光感知的鲁棒性,解决模态偏差问题,实验显示在红外任务中表现优异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.13462 2026-05-14 cs.LG 71%

Efficient Sensor Fusion for Gesture Recognition on Resource-Constrained Devices

面向资源受限设备的高效手势识别传感器融合

Pietro Bartoli, Christian Veronesi, Tommaso Bondini, Andrea Giudici, Franco Zappa

机构 * EssilorLuxottica Smart Eyewear Lab(EssilorLuxottica 智能眼镜实验室) Politecnico di Milano(米兰理工学院)

专题命中 红外-可见光融合 :sensor fusion(title)

AI总结 本文提出基于低分辨率ToF和红外热传感器融合的轻量隐私保护手势识别系统,通过紧凑CNN实现高效融合,实验显示在7种静态手势数据集上准确率达92.3%,且在STM32系列MCU上实现毫秒级推理延迟和50mW功耗。

Comments The article is already accepted for IEEE Sensors Applications Symposium (IEEE SAS) 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.13218 2026-05-14 cs.LG 50%

Machine Learning-Driven Multimodal Spectroscopic Liquid Biopsy for Early Multicancer Detection

基于机器学习的多模态光谱学液体活检用于早期多癌种检测

Alejandro Leonardo García Navarro, Javier Cachón Ortiz, Javier González Colsa, Samuel García Díaz, Carlos Viadero Valderrama

机构 * Signal Processing Group(信号处理组) Gregorio Marañón Health Research Institute(格雷戈里奥·马兰农健康研究中心) Amber Health Solutions(艾默健康解决方案)

专题命中 红外-可见光融合 :multimodal fusion(abstract)

AI总结 本文提出结合FTIR、拉曼和EEM荧光光谱的多模态液体活检框架,利用机器学习方法实现多癌种早期检测,实验显示多模态融合在ROC-AUC和灵敏度特异度上表现最优。

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 遥感融合与全色锐化 1 篇

2605.13621 2026-05-14 cs.CV 57%

WD-FQDet: Multispectral Detection Transformer via Wavelet Decomposition and Frequency-aware Query Learning

WD-FQDet:通过小波分解和频率感知查询学习的多光谱检测变换器

Chunjin Yang, Xiwei Zhang, Yiming Xiao, Fanman Meng

机构 * University of Electronic Science and Technology of China(电子科学与技术大学)

专题命中 遥感融合与全色锐化 :infrared and visible(abstract);分类 cs.CV

AI总结 本文提出WD-FQDet框架,通过小波分解和频率感知查询学习分离红外与可见光的共性与专用特征,提升多光谱目标检测性能。

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 融合架构与评测 2 篇

2605.12852 2026-05-14 cs.LG q-bio.QM 78%

Multitask Multimodal Fusion with Tabular Foundation Models for Peak and Durability Prediction of Pertussis Booster Response

多任务多模态融合:基于表格基础模型的百日咳加强针反应峰值和持续性预测

Divya Sitani

机构 * Berlin, Germany(柏林,德国)

专题命中 融合架构与评测 :multimodal fusion(title,abstract)

AI总结 本文提出多任务对比多模态融合架构,用于预测百日咳加强针反应的峰值和持续性,通过结合冻结的TabPFN-v2模态编码器、双标签监督对比损失、模态dropout和缺失性掩码注意力融合,实现了对两个任务的联合预测。

Comments 22 pages, 8 figures, 4 tables. Code available at https://github.com/Divya1205/cmi-pb-multitask

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.13312 2026-05-14 cs.LG 50%

Supervised Deep Multimodal Matrix Factorization for Interpretable Brain Network Analysis

监督深度多模态矩阵分解用于可解释性脑网络分析

Amjad Seyedi, Lifang He, Songlin Zhao, Akwum Onwunta, Nicolas Gillis

机构 * Dept. of Mathematics & Operational Research University of Mons(数学与运筹学系蒙斯大学) Dept. of Computer Science & Engineering Lehigh University(计算机科学与工程系莱斯大学) Dept. of Industrial & Systems Engineering Lehigh University(工业与系统工程系莱斯大学)

专题命中 融合架构与评测 :multimodal fusion(abstract)

AI总结 本文提出SD3MF框架,通过深度层次分解和共享潜在表示整合多模态脑网络数据,实现可解释的群体预测。实验表明SD3MF在多模态连接组数据上优于CNN和GNN等基线模型。

详情

展开后加载摘要…

URL PDF HTML 收藏