arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

视觉与机器人

多模态信息融合

面向图像、视频、多传感器和跨模态感知的信息融合,包括 Image Fusion、红外可见光、遥感、医学影像、LiDAR/雷达/相机和音视频融合。

2026-03-10 至 2026-03-10 共收录 11 信号源:cs.CV, eess.IV, eess.SP, cs.RO, cs.MM

1. 通用Image Fusion 2 篇

2603.07120 2026-03-10 cs.CV 88%

Inter-Image Pixel Shuffling for Multi-focus Image Fusion

跨图像像素洗牌用于多焦点图像融合

Huangxing Lin, Rongrong Ma, Cheng Wang

机构 * College of Computer Science and Technology, Huaqiao University(华交大学计算机科学与技术学院)

专题命中 通用Image Fusion :image fusion(title,abstract);multi-focus(title,abstract);分类 cs.CV

AI总结 本文提出IPS方法,通过像素洗牌实现多焦点图像融合,无需实际多焦点图像即可学习融合过程,提升融合质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.08240 2026-03-10 cs.CV 57%

SiMO: Single-Modality-Operable Multimodal Collaborative Perception

SiMO: 单模态可操作的多模态协作感知

Jiageng Wen, Shengjie Zhao, Bing Li, Jiafeng Huang, Kenan Ye, Hao Deng

机构 * Shanghai Research Institute for Intelligent Autonomous Systems, Tongji University(同济大学智能自主系统上海研究院) School of Computer Science and Technology, Tongji University(同济大学计算机科学与技术学院) School of Mechatronic Engineering and Automation, Shanghai University(上海大学机械电子工程与自动化学院)

专题命中 通用Image Fusion :multi-modal fusion(abstract);分类 cs.CV

AI总结 SiMO通过单模态可操作的多模态协作感知方法,解决多模态特征融合中的语义不匹配问题,提升协作感知性能。

Comments Accepted to ICLR 2026. This arXiv version includes an additional appendix (Appendix 15) containing further philosophical discussion not included in the official ICLR peer-reviewed version

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 红外-可见光融合 3 篇

2603.07667 2026-03-10 cs.CV 88%

FusionRegister: Every Infrared and Visible Image Fusion Deserves Registration

FusionRegister: 每个红外和可见图像融合都应进行配准

Congcong Bian, Haolong Ma, Hui Li, Zhongwei Shen, Xiaoqing Luo, Xiaoning Song, Xiao-Jun Wu

机构 * School of Artificial Intelligence and Computer Science, Jiangnan University, Wuxi, China(江南大学人工智能与计算机科学学院) School of Electronic and Information Engineering, Suzhou University of Science and Technology, Suzhou, China(苏州科技大学电子与信息工程学院)

专题命中 红外-可见光融合 :image fusion(title,abstract);infrared and visible(title,abstract);分类 cs.CV

AI总结 FusionRegister 通过视觉先验引导的通用跨模态配准方法,提升红外与可见图像融合的鲁棒性与效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.08208 2026-03-10 cs.CV cs.AI 79%

Alignment-Aware and Reliability-Gated Multimodal Fusion for Unmanned Aerial Vehicle Detection Across Heterogeneous Thermal-Visual Sensors

具有对齐意识和可靠性门控的多模态融合用于跨异质热视觉传感器的无人机检测

Ishrat Jahan, Molla E Majid, M Murugappan, Muhammad E. H. Chowdhury, N. B. Prakash, Saad Bin Abul Kashem, Balamurugan Balusamy, Amith Khandakar

专题命中 红外-可见光融合 :multimodal fusion(title);image fusion(abstract);分类 cs.CV

AI总结 本研究提出RGIF和RGMAF两种融合策略,通过注册意识和可靠性门控提升跨异质热视觉传感器的无人机检测性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.06750 2026-03-10 cs.CV cs.AI 57%

XMACNet: An Explainable Lightweight Attention based CNN with Multi Modal Fusion for Chili Disease Classification

XMACNet:一种具有多模态融合的轻量级可解释注意力CNN用于辣椒疾病分类

Tapon Kumer Ray, Rajkumar Y, Shalini R, Srigayathri K, Jayashree S, Lokeswari P

专题命中 红外-可见光融合 :multi-modal fusion(abstract);分类 cs.CV

AI总结 XMACNet通过结合自注意力和多模态融合,实现轻量级且可解释的辣椒疾病分类,优于现有基线模型。

Comments 14 pages, 8 figures, Conference Paper

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 自动驾驶多传感器融合 1 篇

2603.08611 2026-03-10 cs.CV cs.RO 62%

FOMO-3D: Using Vision Foundation Models for Long-Tailed 3D Object Detection

FOMO-3D:利用视觉基础模型进行长尾3D目标检测

Anqi Joyce Yang, James Tu, Nikita Dvornik, Enxu Li, Raquel Urtasun

机构 * Waabi University of Toronto(多伦多大学)

专题命中 自动驾驶多传感器融合 :multi-modal fusion(abstract);分类 cs.CV、cs.RO

AI总结 FOMO-3D通过利用视觉基础模型的丰富先验知识和多模态融合设计,提升长尾3D目标检测的性能。

Comments Published at 9th Annual Conference on Robot Learning (CoRL 2025)

详情

展开后加载摘要…

URL PDF HTML 收藏

4. 机器人多传感器融合 1 篇

2603.08038 2026-03-10 eess.SY cs.SY 50%

Distributed Coordination Algorithms with Efficient Communication for Open Multi-Agent Systems with Dynamic Communication Links and Processing Delays

具有高效通信的分布式协调算法用于具有动态通信链接和处理延迟的开放多智能体系统

Jiaqi Hu, Karl H. Johansson, Apostolos I. Rikos

专题命中 机器人多传感器融合 :sensor fusion(abstract)

AI总结 本文提出三种高效通信的分布式算法,用于解决开放多智能体系统中动态通信链接和处理延迟下的量化平均一致性问题,展示了其有限时间收敛和鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏

5. 音视频/视觉语言融合 2 篇

2603.02767 2026-03-10 cs.CV cs.AI 57%

ITO: Images and Texts as One via Synergizing Multiple Alignment and Training-Time Fusion

通过协同多模态对齐和训练时融合实现图像与文本一体化:ITO

Hanpeng Liu, Yaqian Li, Zidan Wang, Shuoxi Zhang, Zonglin Zhao, Zihao Bo, Rinyoichi Takezoe, Kaiwen Long, Kun He

机构 * School of Computer Science(计算机科学学院) Huazhong University of Science and Technology(华中科技大学) Li Auto Inc.(力汽车公司) Institute of AI for Industries, Chinese Academy of Sciences(产业人工智能研究院,中国科学院)

专题命中 音视频/视觉语言融合 :multimodal fusion(abstract);分类 cs.CV

AI总结 ITO通过协同多模态对齐与训练时融合机制,提升图像与文本表示的一致性,有效解决模态间结构化交互问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.08459 2026-03-10 cs.LG 50%

Data-Driven Priors for Uncertainty-Aware Deterioration Risk Prediction with Multimodal Data

数据驱动先验用于多模态数据的不确定性感知退化风险预测

L. Julián Lechuga López, Tim G. J. Rudner, Farah E. Shamout

机构 * New York University Abu Dhabi(纽约大学阿布扎克校区) University of Toronto(多伦多大学) Tandon School of Engineering, New York University(纽约大学工程学院)

专题命中 音视频/视觉语言融合 :information fusion(abstract)

AI总结 本文提出MedCertAIn框架,通过数据驱动的先验方法提升多模态临床数据中风险预测的准确性和不确定性量化能力。

Comments 24 pages, 5 figures, 8 tables

详情

展开后加载摘要…

URL PDF HTML 收藏

6. 融合架构与评测 2 篇

2509.13172 2026-03-10 cs.CV 57%

WHU-STree: A Multi-modal Benchmark Dataset for Street Tree Inventory

WHU-STree: 一个用于街道树盘点的多模态基准数据集

Ruifei Ding, Zhe Chen, Wen Fan, Chen Long, Huijuan Xiao, Yelu Zeng, Zhen Dong, Bisheng Yang

专题命中 融合架构与评测 :multi-modal fusion(abstract);分类 cs.CV

AI总结 WHU-STree是一个多模态的街道树盘点数据集,包含丰富的标注和多任务支持,用于提升城市街道树管理的自动化和智能化水平。

Journal ref ISPRS Journal of Photogrammetry and Remote Sensing, 2026, 233: 519-542

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.07130 2026-03-10 cs.SD eess.AS 50%

Toward Multimodal Industrial Fault Analysis: A Single-Speed Chain Conveyor Dataset with Audio and Vibration Signals

迈向多模态工业故障分析:一个包含音频和振动信号的单速链式输送机数据集

Zhang Chen, Yucong Zhang, Xiaoxiao Miao, Ming Li

机构 * Digital Innovation Research Center, Duke Kunshan University(杜克昆山大学数字创新研究中心) School of Artificial Intelligence, The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳)人工智能学院) School of Artificial Intelligence, Wuhan University(武汉大学人工智能学院) School of Computer Science, Wuhan University(武汉大学计算机学院)

专题命中 融合架构与评测 :multimodal fusion(abstract)

AI总结 本文提出一个包含音频和振动信号的单速链式输送机数据集,用于多模态工业故障分析,提供标准化评估协议和统一基准以支持通道级分析和多模态融合研究。

Comments Submitted to Interspeech 2026

详情

展开后加载摘要…

URL PDF HTML 收藏