arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

视觉与机器人

多模态信息融合

面向图像、视频、多传感器和跨模态感知的信息融合,包括 Image Fusion、红外可见光、遥感、医学影像、LiDAR/雷达/相机和音视频融合。

2026-03-25 至 2026-03-25 共收录 8 信号源:cs.CV, eess.IV, eess.SP, cs.RO, cs.MM

1. 通用Image Fusion 1 篇

2603.23272 2026-03-25 cs.CV cs.MM 88%

Multi-Modal Image Fusion via Intervention-Stable Feature Learning

多模态图像融合 via 干预稳定的特征学习

Xue Wang, Zheng Guan, Wenhua Qian, Chengchao Wang, Runzhuo Ma

机构 * School of Information Science and Engineering, Yunnan University(云南大学信息科学与工程学院) School of Artificial Intelligence, Nanyang Normal University(南阳师范学院人工智能学院) Department of Electrical and Electronic Engineering, Hong Kong Polytechnic University(香港理工大学电子与电气工程系)

专题命中 通用Image Fusion :image fusion(title,abstract);multi-modal image fusion(title,abstract);分类 cs.CV、cs.MM

AI总结 本文提出基于因果原则的干预框架,通过三种干预策略探索模态关系,设计因果特征整合器捕捉稳健的模态依赖而非虚假关联。

Comments Accpted by CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 自动驾驶多传感器融合 2 篇

2512.02448 2026-03-25 cs.CV cs.RO 62%

nuScenes Revisited: Progress and Challenges in Autonomous Driving

nuScenes 重新审视:自动驾驶领域的进展与挑战

Whye Kit Fong, Venice Erin Liong, Kok Seang Tan, Holger Caesar

专题命中 自动驾驶多传感器融合 :sensor fusion(abstract);分类 cs.CV、cs.RO

AI总结 本文重新审视nuScenes数据集,探讨其在自动驾驶发展中的核心作用,分析其技术细节及对后续研究的影响,总结多模态传感器融合与标准化评估的关键贡献。

Comments 18 pages, 17 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.22852 2026-03-25 cs.CV 57%

Gau-Occ: Geometry-Completed Gaussians for Multi-Modal 3D Occupancy Prediction

Gau-Occ:用于多模态3D占用预测的几何完备高斯分布

Chengxin Lv, Yihui Li, Hongyu Yang, YunHong Wang

机构 * State Key Laboratory of Virtual Reality Technology and Systems, Beihang University, Beijing, China(虚拟现实技术与系统国家重点实验室,北京航空航天大学,北京,中国) School of Computer Science and Engineering, Beihang University, Beijing, China(计算机科学与工程学院,北京航空航天大学,北京,中国) School of Artificial Intelligence, Beihang University, Beijing, China(人工智能学院,北京航空航天大学,北京,中国)

专题命中 自动驾驶多传感器融合 :multi-modal fusion(abstract);分类 cs.CV

AI总结 Gau-Occ通过几何完备的3D高斯分布实现多模态3D占用预测,利用LiDAR完成扩散器恢复缺失结构并融合多视角图像语义,提升空间一致性和语义区分性。

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 音视频/视觉语言融合 1 篇

2603.23276 2026-03-25 cs.CV 57%

CCF: Complementary Collaborative Fusion for Domain Generalized Multi-Modal 3D Object Detection

CCF:互补协作融合用于领域泛化的多模态3D目标检测

Yuchen Wu, Kun Wang, Yining Pan, Na Zhao

机构 * Singapore University of Technology and Design(新加坡科技设计大学)

专题命中 音视频/视觉语言融合 :multi-modal fusion(abstract);分类 cs.CV

AI总结 本文提出CCF方法,通过查询解耦损失、LiDAR引导深度先验和互补跨模态掩码,提升多模态3D目标检测在跨领域场景下的鲁棒性,实验表明优于现有方法且保持源域性能。

Comments Accepted to CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏

4. 融合架构与评测 4 篇

2511.20008 2026-03-25 cs.CV cs.AI 79%

Pedestrian Crossing Intention Prediction Using Multimodal Fusion Network

基于多模态融合网络的行人过街意图预测

Yuanzhe Li, Steffen Müller

机构 * Chair of Automotive Engineering, Technische Universität Berlin(柏林技术大学汽车工程系)

专题命中 融合架构与评测 :multimodal fusion(title,abstract);分类 cs.CV

AI总结 本文提出多模态融合网络,通过视觉和运动分支提取七种模态特征,有效整合互补信息,提升自动驾驶车辆在城市环境中对行人意图预测的准确性。

Comments 29th IAVSD International Symposium on Dynamics of Vehicles on Roads and Tracks (IAVSD 2025)

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.22371 2026-03-25 eess.IV 79%

Multimodal Fusion of Skeleton Dynamics and Clinical Gait Features for Video-Based Cerebral Palsy Severity Assessment

基于骨骼动力学和临床步态特征的多模态融合用于视频基于的脑瘫严重程度评估

Kaiyuan Yang, Xupeng Chen, Jiangpeng He

专题命中 融合架构与评测 :multimodal fusion(title,abstract);分类 eess.IV

AI总结 本文提出一种多模态融合框架,结合骨骼动力学和临床有意义的步态特征,提升视频脑瘫严重程度评估的预测性能和生物力学可解释性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.22369 2026-03-25 q-bio.GN cs.AI cs.LG 78%

SynLeaF: A Dual-Stage Multimodal Fusion Framework for Synthetic Lethality Prediction Across Pan- and Single-Cancer Contexts

SynLeaF:一种用于跨泛癌和单癌情境的合成致死性预测双阶段多模态融合框架

Zheming Xing, Siyuan Zhou, Ruinan Wang, Rui Han, Shiming Zhang, Shiqu Chen, Yurui Huang, Jiahao Ma, Yifan Chen, Xuan Wang, Yadong Wang, Junyi Li

专题命中 融合架构与评测 :multimodal fusion(title,abstract)

AI总结 SynLeaF通过双阶段多模态融合框架,有效整合基因表达、突变、甲基化和拷贝数变异等多组学数据,并利用关系图卷积网络捕捉生物医学知识图谱中的结构化基因表示,从而在17/19种场景中实现优于现有方法的性能。

Comments 29 pages, 5 figures, 3 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.03473 2026-03-25 astro-ph.SR 50%

Vision-Based CNN Prediction of Sunspot Numbers from SDO/HMI Images

基于视觉的CNN对SDO/HMI图像中太阳黑子数的预测

Fabian C. Quintero-Pareja, Diederik A. Montano-Burbano, Santiago Quintero-Pareja, D. Sierra-Porta

专题命中 融合架构与评测 :multimodal fusion(abstract)

AI总结 本文提出基于视觉的回归框架,利用SDO/HMI图像预测太阳黑子数,通过CNN实现端到端映射,实验结果显示模型在预测精度和可解释性方面表现良好,为大规模太阳监测提供可行方案。

Comments 10 pages, 9 figures, 2 tables

Journal ref Published in the Open Journal of Astrophysics - 2026

详情

展开后加载摘要…

URL PDF HTML 收藏