arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

多模态信息融合

面向图像、视频、多传感器和跨模态感知的信息融合,包括 Image Fusion、红外可见光、遥感、医学影像、LiDAR/雷达/相机和音视频融合。

2026-08-05 至 2026-08-05 共收录 5 信号源:cs.CV, eess.IV, eess.SP, cs.RO, cs.MM

1. 通用Image Fusion 2 篇

2608.03252 2026-08-05 cs.CV 新提交 88%

Clarity Contrast and Similarity Selection for Multi-Focus Image Fusion

用于多聚焦图像融合的清晰度对比与相似性选择

Yicheng Zhang, Haoyou Deng, Zhiqiang Li, Wenti Yin, Nong Sang, Changxin Gao

专题命中 通用Image Fusion :image fusion(title,abstract);multi-focus(title,abstract);分类 cs.CV

AI总结 该研究针对多聚焦图像融合中源图像交互不足的问题,提出CSNet模型,通过CCAM和相似性选择策略实现信息交互,在定量和定性评估中达到当前最优性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.03107 2026-08-05 cs.CV 新提交 74%

A Unified Resolution-Conditioned Framework for Orthogonal Line-Scanning Image Fusion

一种用于正交线扫描图像融合的统一分辨率条件框架

Yiming Gong, Kai Wang

专题命中 通用Image Fusion :image fusion(title);分类 cs.CV

AI总结 针对正交线扫描图像融合,提出基于RELA和FiLM的统一分辨率条件框架,可跨狭缝宽度适配,性能优于现有方法,能平滑泛化到未见过的中间配置。

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 红外-可见光融合 1 篇

2511.10309 2026-08-05 cs.CV 版本更新 79%

CLIP4VI-ReID: Learning Modality-shared Representations via CLIP Semantic Bridge for Visible-Infrared Person Re-identification

CLIP4VI-ReID:通过CLIP语义桥学习模态共享表征用于可见光-红外行人重识别

Xiaomei Yang, Xizhan Gao, Sijie Niu, Fa Zhu, Guang Feng, Xiaofeng Qu, David Camacho

机构 * Shandong Key Laboratory of Ubiquitous Intelligent Computing, School of Information Science and Engineering, University of Jinan(山东 ubiquitous 智能计算重点实验室,信息科学与工程学院,济南大学) College of Information Science and Technology & College of Artificial Intelligence, Nanjing Forestry University(信息科学与技术学院及人工智能学院,南京林业大学) Computer Systems Engineering Department, Universidad Politécnica de Madrid(计算机系统工程系,马德里理工大学)

专题命中 红外-可见光融合 :visible-infrared(title,abstract);分类 cs.CV

AI总结 本文提出CLIP4VI-ReID网络,通过TSG、IFE、HSA模块及CLIP语义桥实现跨模态对齐,在VI-ReID任务上取得优于现有方法的性能。

Comments This article has been accepted for publication in IEEE Transactions on Biometrics, Behavior, and Identity Science

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 音视频/视觉语言融合 2 篇

2505.12715 2026-08-05 cs.CV 版本更新 74%

VLC Fusion: Vision-Language Conditioned Sensor Fusion for Robust Object Detection

VLC Fusion:面向鲁棒目标检测的视觉-语言条件传感器融合

Aditya Taparia, Noel Ngu, Mario Leiva, Joshua Shay Kricheli, John Corcoran, Nathaniel D. Bastian, Gerardo Simari, Paulo Shakarian, Ransalu Senanayake

机构 * Arizona State University(亚利桑那州立大学) Department of Computer Science and Engineering, Universidad Nacional del Sur and Institute for Computer Science and Engineering(计算机科学与工程系,国家南方大学和计算机科学与工程研究所) U.S. Department of Defense(美国国防部) United States Military Academy(美国军事学院) Syracuse University(雪城大学)

专题命中 音视频/视觉语言融合 :sensor fusion(title);分类 cs.CV

AI总结 本文提出VLC Fusion视觉-语言条件传感器融合框架,利用VLM捕捉环境线索动态调整模态权重,在多传感器融合目标检测任务中,于自动驾驶与军事目标数据集上较传统方法实现更优性能。

Comments 27 pages, 20 figures, Accepted for presentation at ECML PKDD 2026, Shortlisted for the Best Research Track Student Paper Award

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.03475 2026-08-05 cs.MM cs.AI cs.CL 新提交 57%

Adaptive Modality Reliability Diagnosis and Restoration for Robust Multimodal Intent Recognition

用于鲁棒多模态意图识别的自适应模态可靠性诊断与恢复

Suraj Kumar, Mohnish Raj, Soumi Chattopadhayay, Chandranath Adak, Ayan Dutta

专题命中 音视频/视觉语言融合 :multimodal fusion(abstract);分类 cs.MM

AI总结 提出PRIME闭环可靠性引导框架,通过诊断恢复多模态意图识别的不可靠模态,在保持干净数据性能的同时提升了多模态数据各类退化场景下的鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏