arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

多模态信息融合

面向图像、视频、多传感器和跨模态感知的信息融合,包括 Image Fusion、红外可见光、遥感、医学影像、LiDAR/雷达/相机和音视频融合。

共收录 4740 信号源:cs.CV, eess.IV, eess.SP, cs.RO, cs.MM

1. 红外-可见光融合 533 篇

2607.11646 2026-07-14 cs.CV cs.RO 新提交 62%

Event-RGB Adaptive Tracking for Nighttime Highway Perception

用于夜间高速公路感知的事件-RGB自适应跟踪

Haidong Wang, Hengxing Cai, Wanlei Li, Xiaogang Xiong, Renxin Zhong

机构 * School of Intelligent Systems Engineering, Sun Yat-sen University(中山大学智能系统工程学院) School of Intelligence Science and Engineering, Harbin Institute of Technology(哈尔滨工业大学智能科学与工程学院)

专题命中 红外-可见光融合 :multi-modal fusion(abstract);分类 cs.CV、cs.RO

AI总结 针对高速公路夜间低光条件下RGB感知性能差的问题,提出JEAT框架,通过自适应扩展卡尔曼滤波器动态融合事件流与RGB帧,还创建SEHN数据集,为多模态融合研究提供支持。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.05923 2026-01-12 eess.SP cs.AI cs.LG eess.IV q-bio.QM 62%

Cedalion Tutorial: A Python-based framework for comprehensive analysis of multimodal fNIRS & DOT from the lab to the everyday world

Cedalion教程:一个基于Python的框架,用于对多模态fNIRS与DOT进行综合分析,从实验室到日常世界

E. Middell, L. Carlton, S. Moradi, T. Codina, T. Fischer, J. Cutler, S. Kelley, J. Behrendt, T. Dissanayake, N. Harmening, M. A. Yücel, D. A. Boas, A. von Lühmann

专题命中 红外-可见光融合 :multimodal fusion(abstract);分类 eess.IV、eess.SP

AI总结 Cedalion是一个基于Python的开源框架,用于统一多模态fNIRS和DOT数据的分析,支持可重复、可扩展的神经成像工作流程。

Comments 33 pages main manuscript, 180 pages Supplementary Tutorial Notebooks, 12 figures, 6 tables, under review in SPIE Neurophotonics

详情

展开后加载摘要…

URL PDF HTML 收藏
2408.06123 2025-10-02 cs.CV cs.MM 62%

DPDETR: Decoupled Position Detection Transformer for Infrared-Visible Object Detection

Junjie Guo, Chenqiang Gao, Fangcen Liu, Deyu Meng

机构 * School of Communications and Information Engineering, Chongqing University of Posts and Telecommunications(通信与信息工程学院,重庆邮电大学) School of Intelligent Systems Engineering, Shenzhen Campus of Sun Yat-sen University(智能系统工程学院,中山大学深圳校区) School of Mathematics and Statistics, Xi’an Jiaotong University(数学与统计学院,西安交通大学)

专题命中 红外-可见光融合 :infrared and visible(abstract);分类 cs.CV、cs.MM

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.24878 2025-09-30 cs.CV cs.RO 62%

ThermalGen: Style-Disentangled Flow-Based Generative Models for RGB-to-Thermal Image Translation

Jiuhong Xiao, Roshan Nayak, Ning Zhang, Daniel Tortei, Giuseppe Loianno

机构 * New York University(纽约大学) Technology Innovation Institute(技术创新研究所) University of California, Berkeley(加州大学伯克利分校)

专题命中 红外-可见光融合 :sensor fusion(abstract);分类 cs.CV、cs.RO

Comments 23 pages including the checklist and appendix. Accepted at NeurIPS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2401.00766 2025-01-27 cs.CV eess.IV 62%

Exposure Bracketing Is All You Need For A High-Quality Image

Zhilu Zhang, Shuohao Zhang, Renlong Wu, Zifei Yan, Wangmeng Zuo

专题命中 红外-可见光融合 :multi-exposure(abstract);分类 cs.CV、eess.IV

Comments ICLR 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2303.17386 2024-03-05 cs.CV cs.AI cs.RO 62%

Complementary Random Masking for RGB-Thermal Semantic Segmentation

Ukcheol Shin, Kyunghyun Lee, In So Kweon, Jean Oh

专题命中 红外-可见光融合 :multi-modal fusion(abstract);分类 cs.CV、cs.RO

Comments ICRA 2024, Our source code is available at https://github.com/UkcheolShin/CRM_RGBTSeg

详情

展开后加载摘要…

URL PDF HTML 收藏
2312.10798 2023-12-20 cs.CV cs.AI eess.IV 62%

Land use/land cover classification of fused Sentinel-1 and Sentinel-2 imageries using ensembles of Random Forests

Shivam Pande

专题命中 红外-可见光融合 :image fusion(abstract);分类 cs.CV、eess.IV

Comments Thesis for Master of Technology. Created: July 2018. Total pages 124

详情

展开后加载摘要…

URL PDF HTML 收藏
2310.19372 2023-10-31 cs.CV cs.AI cs.RO 62%

RGB-X Object Detection via Scene-Specific Fusion Modules

Sri Aditya Deevi, Connor Lee, Lu Gan, Sushruth Nagesh, Gaurav Pandey, Soon-Jo Chung

专题命中 红外-可见光融合 :sensor fusion(abstract);分类 cs.CV、cs.RO

Comments Accepted to 2024 IEEE/CVF Winter Conference on Applications of Computer Vision (WACV 2024)

详情

展开后加载摘要…

URL PDF HTML 收藏
2309.13216 2023-09-26 cs.CV cs.AI cs.HC cs.RO 62%

MISFIT-V: Misaligned Image Synthesis and Fusion using Information from Thermal and Visual

Aadhar Chauhan, Isaac Remy, Danny Broyles, Karen Leung

专题命中 红外-可见光融合 :image fusion(abstract);分类 cs.CV、cs.RO

详情

展开后加载摘要…

URL PDF HTML 收藏
2304.02767 2023-04-07 eess.IV cs.CV cs.LG stat.ML 62%

MethaneMapper: Spectral Absorption aware Hyperspectral Transformer for Methane Detection

Satish Kumar, Ivan Arevalo, ASM Iftekhar, B S Manjunath

专题命中 红外-可见光融合 :visible-infrared(abstract);分类 cs.CV、eess.IV

Comments 16 pages, 9 figures, 3 tables, Accepted to Computer Vision and Pattern Recognition (CVPR 2023) conference. CVPR 2023 Highlights paper

详情

展开后加载摘要…

URL PDF HTML 收藏
2112.05144 2021-12-13 cs.CV eess.IV 62%

Edge-aware Guidance Fusion Network for RGB Thermal Scene Parsing

Wujie Zhou, Shaohua Dong, Caie Xu, Yaguan Qian

专题命中 红外-可见光融合 :multimodal fusion(abstract);分类 cs.CV、eess.IV

Comments Accepted by AAAI2022

详情

展开后加载摘要…

URL PDF HTML 收藏
2109.01733 2021-09-07 cs.CV eess.IV 62%

F3S: Free Flow Fever Screening

Kunal Rao, Giuseppe Coviello, Min Feng, Biplob Debnath, Wang-Pin Hsiung, Murugan Sankaradas, Yi Yang, Oliver Po, Utsav Drolia, Srimat Chakradhar

专题命中 红外-可见光融合 :sensor fusion(abstract);分类 cs.CV、eess.IV

详情

展开后加载摘要…

URL PDF HTML 收藏
2007.00199 2021-03-02 eess.IV cs.CV 62%

Low-light Image Restoration with Short- and Long-exposure Raw Pairs

Meng Chang, Huajun Feng, Zhihai Xu, Qi Li

专题命中 红外-可见光融合 :image fusion(abstract);分类 cs.CV、eess.IV

详情

展开后加载摘要…

URL PDF HTML 收藏
2005.01047 2020-05-05 eess.IV cs.CV 62%

Fusion of visible and infrared images via complex function

Ya. Ye. Khaustov, D. Ye, Ye. Ryzhov, E. Lychkovskyy, Yu. A. Nastishin

专题命中 红外-可见光融合 :image fusion(abstract);分类 cs.CV、eess.IV

Comments 12 pages with 7 figures, submitted to Military Technical Collection 22 (2020) see http://vtz.asv.gov.ua

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.07848 2026-08-11 cs.CV 新提交 57%

IRPol-Fuse: Energy-structure coordination for infrared polarization fusion under low visibility

IRPol-Fuse:低能见度下红外偏振图像的能量-结构协同融合方法

Zhuangfan Huang, Chusheng Fang, Xiaosong Li, Yang Liua, Xiaoqi Cheng, Haishu Tan

机构 * Foshan University(佛山大学)

专题命中 红外-可见光融合 :image fusion(abstract);分类 cs.CV

AI总结 该研究针对低能见度下红外偏振图像融合的缺陷,提出IRPol-Fuse框架,构建LI-PI数据集,实验验证其在目标与细节保留及下游任务中的优异性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.02258 2026-07-30 cs.CV 版本更新 57%

SpectraDINO: Modality-Conditioned Adaptation of RGB Vision Foundation Models Across Infrared Bands

SpectraDINO:跨红外波段的RGB视觉基础模型的模态条件适配

Yagiz Nalcakan, Hyeongjin Ju, Incheol Park, Sanghyeop Yeo, Youngwan Jin, Shiho Kim

专题命中 红外-可见光融合 :visible-infrared(abstract);分类 cs.CV

AI总结 SpectraDINO是适配RGB视觉基础模型的跨红外波段统一骨干网络,通过分阶段蒸馏与微调技术,在7个检测和分割基准上性能优于或媲美特定模态方法。

Comments Updated with the revised model results

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.24110 2026-07-28 cs.CV cs.LG physics.optics 新提交 57%

BeyondFusion: Self-Aligned Latent Diffusion for Calibration-Free Infrared Super-Resolution and Infrared-Visible Fusion

超越融合:用于无校准红外超分辨率和红外-可见光融合的自对齐潜在扩散

Minchong Chen, Xiaoyun Yuan, Minyu Cao, Jianing Zhang, Jun Zhang, Shuyang Liu, Xiaokang Yang

专题命中 红外-可见光融合 :infrared and visible(abstract);分类 cs.CV

AI总结 针对移动红外-可见光成像中跨传感器未对准问题,提出超越融合框架,通过引入跨模态自对齐模块及未对准增强模块,实现无校准条件下的红外超分辨率和红外-可见光融合,经实验验证了其有效性。

Comments 13 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.19942 2026-07-28 cs.CV cs.AI 版本更新 57%

G-MAD: A Game-Based Data Generation Framework for Multi-View RGB-T Aerial Object Detection

G-MAD:用于多视图RGB-T航空目标检测的基于游戏的数据生成框架

Yechan Kim, JongHyun Park, Dongho Yoon, Namhoon Jung, Moongu Jeon

机构 * LIG Defense&Aerospace(LIG国防与航空航天公司) GIST(韩国科学技术院)

专题命中 红外-可见光融合 :multi-modal fusion(abstract);分类 cs.CV

AI总结 研究针对航空目标检测中数据集构建的问题,提出基于游戏的G-MAD数据生成框架,可解决视点控制、数据对齐及标注成本等问题,支持多视图相机放置等功能,还构建并发布了AMOD基准。

Comments ACM Multimedia 2026 (Supplementary Material Included)

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.02808 2026-07-21 cs.CV 版本更新 57%

CMCC-ReID: Cross-Modality Clothing-Change Person Re-Identification

CMCC-ReID: 跨模态服装变化人员重识别

Haoxuan Xu, Hanzi Wang, Guanglin Niu

机构 * School of Artificial Intelligence, Beihang University(北京航空航天大学人工智能学院) School of Informatics, Xiamen University(厦门大学信息学院)

专题命中 红外-可见光融合 :visible-infrared(abstract);分类 cs.CV

AI总结 本文提出CMCC-ReID任务,解决跨模态和服装变化的人员匹配问题,构建SYSU-CMCC基准数据集,并提出PIA网络,通过DBDL和BPL模块提升重识别性能。

Comments ECCV2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.14776 2026-07-15 cs.CV 版本更新 57%

M2I2HA: Multi-modal Object Detection Based on Intra- and Inter-Modal Hypergraph Attention

M2I2HA:基于模态内和模态间超图注意力的多模态目标检测

Xiaofan Yang, Yubin Liu, Wei Pan, Guoqing Chu, Junming Zhang, Jie Zhao, Zhuoqi Man, Xuanming Cao

机构 * Harbin Institute of Technology(哈尔滨工业大学)

专题命中 红外-可见光融合 :multi-modal fusion(abstract);分类 cs.CV

AI总结 针对多模态目标检测中模态内和模态间信息提取及跨模态对齐的挑战,提出基于超图理论的M2I2HA网络,通过多个模块实现多模态特征的有效处理,在多模态目标检测任务中取得了最优性能。

Comments 43 pages, 13 figures, The theoretical derivation was refined, some data was updated, and experiments were added

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.30939 2026-06-01 cs.CV 57%

IAF-Net: Illumination-Adaptive Fusion for Low-Light Urban Road Segmentation

IAF-Net:用于低光照城市道路分割的照明自适应融合网络

Bingtao Wang, Daojie Peng, Fulong Ma, Jun Ma, Liang Zhang

机构 * The Shandong University(山东大学) The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州))

专题命中 红外-可见光融合 :multi-modal fusion(abstract);分类 cs.CV

AI总结 提出IAF-Net,通过照明自适应融合模块动态调整RGB与几何特征的融合权重,并利用亮度调制注意力解码器增强低光照特征选择,实现不同光照条件下鲁棒的道路分割。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.25775 2026-05-26 cs.CV 57%

DRFusion: Drift-Resilient Temporally Consistent Infrared-Visible Video Fusion

DRFusion: 抗漂移的时间一致红外-可见光视频融合

Xingyuan Li, Haoyuan Xu, Shulin Li, Xiang Chen, Zhiying Jiang, Jinyuan Liu

机构 * College of Computer Science Technology, Zhejiang University, Hangzhou, China School of Software Technology \& DUT-RU International School of ISE, Dalian University of Technology, Dalian, China College of Information Science Technology, Dalian Maritime University, Dalian, China

专题命中 红外-可见光融合 :infrared and visible(abstract);分类 cs.CV

AI总结 提出一种抗漂移的视频融合方法,将任务重构为历史条件运动生成,通过稳定历史引导和软时间锚定实现时间一致性,并采用解耦结构-运动适应策略,在融合质量和时间稳定性上达到最优。

Comments 11 pages, 7 figures, 4 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.17564 2026-05-19 cs.CV 57%

A Conditional U-Net Pipeline with Pre- and Post-Processing for Aerial RGB-to-Thermal Image Translation

具有预处理和后处理的条件U-Net管道用于航空RGB到热图像转换

Tseten Sherpa, Sikandar Ali, Shubham Parab, Haoyun Feng, Matthew Dennis, Keenan Gibbons, Verrah Otiende, Geoffrey H. Siwo

机构 * Department of Data Science, University of Michigan, Ann Arbor, MI, USA(数据科学系,密歇根大学,安阿伯,MI,美国) Department of Information Science, University of Michigan, Ann Arbor, MI, USA(信息科学系,密歇根大学,安阿伯,MI,美国) Department of Computer Science, University of Michigan, Ann Arbor, MI, USA(计算机科学系,密歇根大学,安阿伯,MI,美国) Arcknow, New York, USA(Arcknow,纽约,美国) School of Environmental Sustainability, University of Michigan, Ann Arbor, MI, USA(可持续环境学院,密歇根大学,安阿伯,MI,美国) SmithGroup, Ann Arbor, MI, USA(SmithGroup,安阿伯,MI,美国) Michigan Institute for Data and AI in Society (MIDAS), University of Michigan, Ann Arbor, MI, USA(密歇根数据与人工智能社会研究院(MIDAS),密歇根大学,安阿伯,MI,美国) United States International University (USIU), Nairobi, Kenya(美国国际大学(USIU),内罗毕,肯尼亚) Department of Learning Health Sciences, University of Michigan Medical School, Ann Arbor, MI, USA(学习健康科学系,密歇根大学医学院,安阿伯,MI,美国) Department of Pharmacology, University of Michigan Medical School, Ann Arbor, MI, USA(药理学系,密歇根大学医学院,安阿伯,MI,美国) Center for Global Health Equity, University of Michigan, Ann Arbor, MI, USA(全球健康公平中心,密歇根大学,安阿伯,MI,美国)

专题命中 红外-可见光融合 :image fusion(abstract);分类 cs.CV

AI总结 本文提出了一种基于条件U-Net的简单架构,结合天气数据和针对性预处理与后处理技术,以提高航空RGB到热图像转换的性能,实验结果显示其在PSNR、SSIM和LPIPS指标上优于现有方法。

Comments 8 pages, 7 figures, NeurIPS 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.15326 2026-05-18 cs.CV 57%

Multimodal Object Detection Under Sparse Forest-Canopy Occlusion

多模态目标检测在稀疏森林冠层遮挡下的应用

Nitik Jain, Mangal Kothari

机构 * Robotics & AI, Johns Hopkins University, USA(约翰霍普金斯大学机器人与人工智能系,美国) Department of Aerospace Engineering, IIT Kanpur(印度理工学院坎浦尔航空航天工程系) Senior Principal Flight Control Engineer, ADASI, EDGE Group, Abu Dhabi, UAE(阿布扎赫尔ADASI高级飞行控制系统工程师,EDGE集团)

专题命中 红外-可见光融合 :image fusion(abstract);分类 cs.CV

AI总结 本文提出一种多模态管道,结合激光雷达、可见-热成像融合和合成孔径成像技术,以提高森林冠层下人类检测的可靠性,展示了改进的YOLOv5检测器在热成像和融合图像上的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.06010 2026-05-08 cs.CV cs.AI 57%

Adding Thermal Awareness to Visual Systems in Real-Time via Distilled Diffusion Models

通过蒸馏扩散模型在实时中增强视觉系统热感知

Yuchen Guo, Junli Gong, Wenjun Dong, Yiuming Cheung, Weifeng Su

机构 * Northwestern University(西北大学) Northeastern University(东北大学) Hong Kong Baptist University(香港 Baptist大学) Beijing Normal - Hong Kong Baptist University(北京师范大学-香港 Baptist大学)

专题命中 红外-可见光融合 :image fusion(abstract);分类 cs.CV

AI总结 本文提出FusionProxy模块,通过蒸馏扩散模型实现实时热感知融合,提升静态识别和动态任务鲁棒性,适用于边缘部署。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.04682 2026-04-29 cs.CV 57%

HATIR: Heat-Aware Diffusion for Turbulent Infrared Video Super-Resolution

HATIR: 用于湍流红外视频超分辨率的热感知扩散

Yang Zou, Xingyue Zhu, Kaiqi Han, Jun Ma, Xingyuan Li, Zhiying Jiang, Jinyuan Liu

机构 * Northwestern Polytechnical University(西北工业大学) Dalian University of Technology(大连理工大学) Zhejiang University(浙江大学) Dalian Maritime University(大连海事大学)

专题命中 红外-可见光融合 :infrared and visible(abstract);分类 cs.CV

AI总结 HATIR通过热感知变形先验联合建模湍流退化与结构细节损失,提出相位引导流估计器和湍流感知解码器,构建首个湍流红外视频超分辨率数据集FLIR-IVSR,提升非均匀退化下的结构恢复精度。

Journal ref Proceedings of the 40th Annual AAAI Conference on Artificial Intelligence (AAAI 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.01766 2026-04-03 cs.CV cs.AI 57%

FSKD: Monocular Forest Structure Inference via LiDAR-to-RGBI Knowledge Distillation

FSKD:通过LiDAR到RGBI知识蒸馏推断单目森林结构

Taimur Khan, Hannes Feilhauer, Muhammad Jazib Zafar

机构 * Helmholtz Centre for Environmental Research – UFZ(亥姆霍兹环境研究中心) Leipzig University(莱比锡大学) Georg-August University of Göttingen(哥廷根大学)

专题命中 红外-可见光融合 :multi-modal fusion(abstract);分类 cs.CV

AI总结 本文提出FSKD框架,利用多模态教师模型融合RGBI影像与LiDAR衍生的平面指标和垂直剖面,通过交叉注意力机制,使RGBI-only的SegFormer学生模型在零样本情况下实现最先进的CHM性能,同时预测PAI和FHD等多指标。

Comments Paper in-review

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.22027 2026-03-24 cs.CV 57%

Tuning Real-World Image Restoration at Inference: A Test-Time Scaling Paradigm for Flow Matching Models

在推理过程中调整现实世界图像恢复:一种适用于流匹配模型的测试时间缩放范式

Purui Bai, Junxian Duan, Pin Wang, Jinhua Hao, Ming Sun, Chao Zhou, Huaibo Huang

机构 * MAIS \& NLPR, Institute of Automation, Chinese Academy of Sciences, China Kuaishou Tech, China

专题命中 红外-可见光融合 :multi-modal fusion(abstract);分类 cs.CV

AI总结 本文提出ResFlow-Tuner框架,基于FLUX.1-dev模型,结合多模态融合与测试时间缩放,实现高质量图像恢复。通过奖励模型动态调整去噪方向,提升性能并控制计算开销,实验表明其在多个基准上达到最优。

Comments 27 pages, 10 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.19565 2026-03-23 cs.CV cs.AI cs.LG 57%

PFM-VEPAR: Prompting Foundation Models for RGB-Event Camera based Pedestrian Attribute Recognition

基于RGB事件相机的行人属性识别的PFM-VEPAR:用于基础模型的提示方法

Minghe Xu, Rouying Wu, ChiaWei Chu, Xiao Wang, Yu Li

机构 * City University of Macau(澳门城市大学) Zhuhai College of Science and Technology(珠海科学技术学院) Macau University of Science and Technology(澳门科学大学) School of Computer Science and Technology, Anhui University(安徽大学计算机科学与技术学院)

专题命中 红外-可见光融合 :multimodal fusion(abstract);分类 cs.CV

AI总结 本文提出PFM-VEPAR,通过轻量级DCT和IDCT提取事件域特征,结合外部记忆库和Hopfield网络提升行人属性识别的准确性与效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.06750 2026-03-10 cs.CV cs.AI 57%

XMACNet: An Explainable Lightweight Attention based CNN with Multi Modal Fusion for Chili Disease Classification

XMACNet:一种具有多模态融合的轻量级可解释注意力CNN用于辣椒疾病分类

Tapon Kumer Ray, Rajkumar Y, Shalini R, Srigayathri K, Jayashree S, Lokeswari P

专题命中 红外-可见光融合 :multi-modal fusion(abstract);分类 cs.CV

AI总结 XMACNet通过结合自注意力和多模态融合,实现轻量级且可解释的辣椒疾病分类,优于现有基线模型。

Comments 14 pages, 8 figures, Conference Paper

详情

展开后加载摘要…

URL PDF HTML 收藏