arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

多模态信息融合

面向图像、视频、多传感器和跨模态感知的信息融合,包括 Image Fusion、红外可见光、遥感、医学影像、LiDAR/雷达/相机和音视频融合。

共收录 11 信号源:cs.CV, eess.IV, eess.SP, cs.RO, cs.MM

1. 红外-可见光融合 11 篇

2603.16130 2026-07-03 cs.CV 版本更新 88%

EPOFusion: Exposure aware Progressive Optimization Method for Infrared and Visible Image Fusion

EPOFusion:一种针对红外和可见图像融合的曝光感知渐进优化方法

Zhiwei Wang, Defeng He, Li Zhao, Xiaoqin Zhang, Yuxing Li, Edmund Y. Lam

机构 * College of Information Engineering, Zhejiang University of Technology(浙江工业大学信息工程学院) College of Information Science and Technology, Zhejiang Shuren University(浙江树人大学信息科技学院) Department of Electrical and Electronic Engineering, The University of Hong Kong(香港大学电机电子工程系)

专题命中 红外-可见光融合 :image fusion(title,abstract);infrared and visible(title,abstract);分类 cs.CV

AI总结 本文提出EPOFusion方法,通过引入指导模块和迭代解码器提升曝光区域的融合效果,同时构建首个高质红外引导标注的曝光数据集,实验表明其在视觉保真度和下游任务表现上优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.01958 2026-06-26 cs.CV 版本更新 83%

MAVFusion: Efficient Infrared and Visible Video Fusion via Motion-Aware Sparse Interaction

MAVFusion: 基于运动感知稀疏交互的高效红外与可见光视频融合

Xilai Li, Weijun Jiang, Xiaosong Li, Yang Liu, Hongbin Wang, Tao Ye, Huafeng Li, Haishu Tan

机构 * Foshan University(佛山大学) Kunming University of Science and Technology(昆明理工大学) China University of Mining and Technology(中国矿业大学)

专题命中 红外-可见光融合 :infrared and visible(title,abstract);image fusion(abstract);分类 cs.CV

AI总结 提出MAVFusion端到端视频融合框架,通过运动感知稀疏交互机制,利用光流识别动态区域并分配跨模态注意力,对静态区域使用轻量弱交互模块,在保持时间一致性和细节的同时加速推理,达到14.16 FPS。

Comments Accepted at ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.01301 2026-08-10 cs.CV cs.AI 版本更新 79%

Ranking Image Fusion the Way Humans Do: A Learned Pairwise Preference Measure for Infrared-Visible Fusion Assessment

以人类方式进行图像融合排序:用于红外-可见光融合评估的学习型成对偏好度量

Haoran Liu, Mingzhe Liu, Peng Li, Guibin Zan

专题命中 红外-可见光融合 :image fusion(title,abstract);分类 cs.CV

AI总结 针对红外-可见光图像融合缺乏理想参考、成对比较成本高的问题,提出LPIFM模型,利用新偏好语料库训练,可准确复现人类成对判断,性能优于传统度量,还公开了相关数据集与代码。

Comments 23 pages, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.10309 2026-08-05 cs.CV 版本更新 79%

CLIP4VI-ReID: Learning Modality-shared Representations via CLIP Semantic Bridge for Visible-Infrared Person Re-identification

CLIP4VI-ReID:通过CLIP语义桥学习模态共享表征用于可见光-红外行人重识别

Xiaomei Yang, Xizhan Gao, Sijie Niu, Fa Zhu, Guang Feng, Xiaofeng Qu, David Camacho

机构 * Shandong Key Laboratory of Ubiquitous Intelligent Computing, School of Information Science and Engineering, University of Jinan(山东 ubiquitous 智能计算重点实验室,信息科学与工程学院,济南大学) College of Information Science and Technology & College of Artificial Intelligence, Nanjing Forestry University(信息科学与技术学院及人工智能学院,南京林业大学) Computer Systems Engineering Department, Universidad Politécnica de Madrid(计算机系统工程系,马德里理工大学)

专题命中 红外-可见光融合 :visible-infrared(title,abstract);分类 cs.CV

AI总结 本文提出CLIP4VI-ReID网络,通过TSG、IFE、HSA模块及CLIP语义桥实现跨模态对齐,在VI-ReID任务上取得优于现有方法的性能。

Comments This article has been accepted for publication in IEEE Transactions on Biometrics, Behavior, and Identity Science

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.12062 2026-06-26 cs.CV 版本更新 79%

Learning Language-Driven Sequence-Level Modal-Invariant Representations for Video-Based Visible-Infrared Person Re-Identification

基于语言驱动的序列级模态不变表示学习用于视频可见光-红外行人重识别

Xiaomei Yang, Antai Liu, Xizhan Gao, Fa Zhu, Sijie Niu, Giancarlo Fortino

机构 * Shandong Key Laboratory of Ubiquitous Intelligent Computing, School of Information Science and Engineering, University of Jinan(山东省 Ubiquitous Intelligent Computing 重点实验室,济南大学信息科学与工程学院) College of Information Science and Technology & Artificial Intelligence, Nanjing Forestry University(信息科学与技术及人工智能学院,南京林业大学) Department of Informatics, Modeling, Electronics, and Systems, University of Calabria(信息学、建模、电子与系统系,卡利博大学)

专题命中 红外-可见光融合 :visible-infrared(title,abstract);分类 cs.CV

AI总结 提出LSMRL方法,通过CLIP的时空特征学习、语义扩散和跨模态交互模块,结合模态级损失,学习序列级模态不变表示,在VVI-ReID任务上超越现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.01173 2026-08-04 cs.CV 版本更新 74%

Bridging Multimodal Fusion and Expert Routing via Spectral Reliability Descriptors for Robust Object Detection

复用融合时频谱可靠性用于RGB-红外目标检测的自适应融合与专家路由

Yefeng Wu

机构 * Tsinghua University(清华大学)

专题命中 红外-可见光融合 :multimodal fusion(title);分类 cs.CV

AI总结 提出一种无参数的7维频谱可靠性描述符,通过频谱可靠性融合和可靠性条件专家路由,提升RGB-红外目标检测在退化条件下的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.02258 2026-07-30 cs.CV 版本更新 57%

SpectraDINO: Modality-Conditioned Adaptation of RGB Vision Foundation Models Across Infrared Bands

SpectraDINO:跨红外波段的RGB视觉基础模型的模态条件适配

Yagiz Nalcakan, Hyeongjin Ju, Incheol Park, Sanghyeop Yeo, Youngwan Jin, Shiho Kim

专题命中 红外-可见光融合 :visible-infrared(abstract);分类 cs.CV

AI总结 SpectraDINO是适配RGB视觉基础模型的跨红外波段统一骨干网络,通过分阶段蒸馏与微调技术,在7个检测和分割基准上性能优于或媲美特定模态方法。

Comments Updated with the revised model results

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.19942 2026-07-28 cs.CV cs.AI 版本更新 57%

G-MAD: A Game-Based Data Generation Framework for Multi-View RGB-T Aerial Object Detection

G-MAD:用于多视图RGB-T航空目标检测的基于游戏的数据生成框架

Yechan Kim, JongHyun Park, Dongho Yoon, Namhoon Jung, Moongu Jeon

机构 * LIG Defense&Aerospace(LIG国防与航空航天公司) GIST(韩国科学技术院)

专题命中 红外-可见光融合 :multi-modal fusion(abstract);分类 cs.CV

AI总结 研究针对航空目标检测中数据集构建的问题,提出基于游戏的G-MAD数据生成框架,可解决视点控制、数据对齐及标注成本等问题,支持多视图相机放置等功能,还构建并发布了AMOD基准。

Comments ACM Multimedia 2026 (Supplementary Material Included)

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.02808 2026-07-21 cs.CV 版本更新 57%

CMCC-ReID: Cross-Modality Clothing-Change Person Re-Identification

CMCC-ReID: 跨模态服装变化人员重识别

Haoxuan Xu, Hanzi Wang, Guanglin Niu

机构 * School of Artificial Intelligence, Beihang University(北京航空航天大学人工智能学院) School of Informatics, Xiamen University(厦门大学信息学院)

专题命中 红外-可见光融合 :visible-infrared(abstract);分类 cs.CV

AI总结 本文提出CMCC-ReID任务,解决跨模态和服装变化的人员匹配问题,构建SYSU-CMCC基准数据集,并提出PIA网络,通过DBDL和BPL模块提升重识别性能。

Comments ECCV2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.14776 2026-07-15 cs.CV 版本更新 57%

M2I2HA: Multi-modal Object Detection Based on Intra- and Inter-Modal Hypergraph Attention

M2I2HA:基于模态内和模态间超图注意力的多模态目标检测

Xiaofan Yang, Yubin Liu, Wei Pan, Guoqing Chu, Junming Zhang, Jie Zhao, Zhuoqi Man, Xuanming Cao

机构 * Harbin Institute of Technology(哈尔滨工业大学)

专题命中 红外-可见光融合 :multi-modal fusion(abstract);分类 cs.CV

AI总结 针对多模态目标检测中模态内和模态间信息提取及跨模态对齐的挑战,提出基于超图理论的M2I2HA网络,通过多个模块实现多模态特征的有效处理,在多模态目标检测任务中取得了最优性能。

Comments 43 pages, 13 figures, The theoretical derivation was refined, some data was updated, and experiments were added

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.24755 2026-06-25 eess.SY cs.SY 版本更新 50%

Asymmetry-Aware Routing for Industrial Multimodal Monitoring: A Diagnostic Framework

面向工业多模态监测的非对称感知路由:一个诊断框架

Sungwoo Kang

专题命中 红外-可见光融合 :multimodal fusion(abstract)

AI总结 提出非对称感知路由框架,通过三步诊断(单模态性能差距、门权重归因、模态损坏测试)决定多模态融合策略,在三个数据集上验证了其有效性。

Comments A subsequent extension of this analysis to a larger corpus found that the heterogeneity predictor is collinear with the industrial-versus-general domain split, so the corresponding effect is not identifiable on the available data

详情

展开后加载摘要…

URL PDF HTML 收藏