arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

视觉与机器人

多模态信息融合

面向图像、视频、多传感器和跨模态感知的信息融合,包括 Image Fusion、红外可见光、遥感、医学影像、LiDAR/雷达/相机和音视频融合。

2026-03-03 至 2026-03-03 共收录 11 信号源:cs.CV, eess.IV, eess.SP, cs.RO, cs.MM

1. 通用Image Fusion 2 篇

2602.21101 2026-03-03 cs.CV cs.RO 62%

Event-Aided Sharp Radiance Field Reconstruction for Fast-Flying Drones

事件辅助的快速飞行无人机辐射场重建

Rong Zou, Marco Cannici, Davide Scaramuzza

机构 * Robotics and Perception Group, University of Zurich(苏黎世大学机器人与感知组)

专题命中 通用Image Fusion :image fusion(abstract);分类 cs.CV、cs.RO

AI总结 本文提出利用事件流和运动模糊帧的统一框架,实现快速飞行无人机的高保真辐射场重建,无需地面真实监督,实现实验数据性能提升超50%。

Journal ref IEEE Transactions on Robotics, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.01947 2026-03-03 cs.CV cs.AI 57%

physfusion: A Transformer-based Dual-Stream Radar and Vision Fusion Framework for Open Water Surface Object Detection

physfusion: 一种基于Transformer的双流雷达与视觉融合框架用于开放水域表面目标检测

Yuting Wan, Liguo Sun, Jiuwu Hao, Zao Zhang, Pin LV

机构 * School of Artificial Intelligence, University of Chinese Academy of Sciences(中国科学院大学人工智能学院) Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所)

专题命中 通用Image Fusion :image fusion(abstract);分类 cs.CV

AI总结 PhysFusion通过物理引导雷达编码器和Transformer融合模块,实现开放水域表面目标的高效检测,取得高精度检测结果。

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 红外-可见光融合 1 篇

2503.23359 2026-03-03 cs.CV 70%

VideoFusion: A Spatio-Temporal Collaborative Network for Multi-modal Video Fusion

VideoFusion: 一种用于多模态视频融合的时空协作网络

Linfeng Tang, Yeda Wang, Meiqi Gong, Zizhuo Li, Yuxin Deng, Xunpeng Yi, Chunyu Li, Han Xu, Hao Zhang, Jiayi Ma

机构 * School of Robotics, Wuhan University, Wuhan, China(机器人学院,武汉大学,武汉,中国) Electronic Information School, Wuhan University, Wuhan, China(电子信息学院,武汉大学,武汉,中国) Southeast University, Nanjing, China(东南大学,南京,中国)

专题命中 红外-可见光融合 :sensor fusion(abstract);multi-sensor fusion(abstract);分类 cs.CV

AI总结 VideoFusion通过时空协作网络实现多模态视频融合,利用跨模态互补性和时间动态性提升视频一致性。

Comments Accepted to CVPR 2026. The dataset and code are available at https://github.com/Linfeng-Tang/VideoFusion

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 遥感融合与全色锐化 1 篇

2504.06027 2026-03-03 cs.CV eess.IV 62%

OSDM-MReg: Multimodal Image Registration based One Step Diffusion Model

OSDM-MReg: 基于一步扩散模型的多模态图像配准

Xiaochen Wei, Weiwei Guo, Wenxian Yu, Feiming Wei, Dongying Li

机构 * Shanghai Key Laboratory of Intelligent Sensing and Recognition(上海智能感知与识别重点实验室) Shanghai Jiao Tong University(上海交通大学) Center of Digital Innovation(数字创新中心)

专题命中 遥感融合与全色锐化 :multimodal fusion(abstract);分类 cs.CV、eess.IV

AI总结 OSDM-MReg通过一步扩散模型和多模态融合策略,实现多模态图像配准的高效准确配准。

详情

展开后加载摘要…

URL PDF HTML 收藏

4. 医学影像融合 1 篇

2603.00156 2026-03-03 cs.CV 57%

BiCLIP: Bidirectional and Consistent Language-Image Processing for Robust Medical Image Segmentation

BiCLIP: 用于鲁棒医学图像分割的双向和一致语言-图像处理

Saivan Talaei, Fatemeh Daneshfar, Abdulhady Abas Abdullah, Mustaqeem Khan

机构 * Department of Computer Engineering, University of Kurdistan, Iran(伊朗库尔德大学计算机工程系) Artificial Intelligence and Innovation Centre, University of Kurdistan, Erbil, Iraq(伊拉克埃尔比尔库尔德大学人工智能与创新中心) College of Information Technology, United Arab Emirates University, UAE(阿联酋大学信息科技学院)

专题命中 医学影像融合 :multimodal fusion(abstract);分类 cs.CV

AI总结 BiCLIP通过双向多模态融合和一致性目标提升医学图像分割的鲁棒性,有效应对标注稀少和临床伪影挑战。

详情

展开后加载摘要…

URL PDF HTML 收藏

5. 机器人多传感器融合 1 篇

2603.00108 2026-03-03 cs.RO cs.AI 79%

SurgFusion-Net: Diversified Adaptive Multimodal Fusion Network for Surgical Skill Assessment

SurgFusion-Net:用于外科技能评估的多样化自适应多模态融合网络

Runlong He, Freweini M. Tesfai, Matthew W. E. Boal, Nazir Sirajudeen, Dimitrios Anastasiou, Jialang Xu, Mobarak I. Hoque, Philip J. Edwards, John D. Kelly, Ashwin Sridhar, Abdolrahim Kadkhodamohammadi, Dhivya Chandrasekaran, Matthew J. Clarkson, Danail Stoyanov, Nader Francis, Evangelos B. Mazomenos

机构 * UCL Hawkes Institute and the Department of Medical Physics & Biomedical Engineering, UCL(UCL哈维斯研究所及UCL医学物理与生物医学工程系) UCL Hawkes Institute and the Department of Computer Science, UCL(UCL哈维斯研究所及UCL计算机科学系) UCL Hawkes Institute and the Division of Informatics, Imaging & Data Sciences, The University of Manchester(UCL哈维斯研究所及信息学、成像与数据科学系,曼彻斯特大学) UCL Hospitals NHS Foundation Trust(UCL医院 NHS基金会信托) Griffin Institute, Northwick Park and St Mark’s Hospital(格里芬研究所,北wick公园及圣马可医院)

专题命中 机器人多传感器融合 :multimodal fusion(title);information fusion(abstract);分类 cs.RO

AI总结 SurgFusion-Net通过引入DRA策略和两个新的临床数据集,提升了多模态外科技能评估的准确性和可靠性。

详情

展开后加载摘要…

URL PDF HTML 收藏

6. 音视频/视觉语言融合 3 篇

2603.01536 2026-03-03 cs.IR cs.MM 57%

CLEAR: Null-Space Projection for Cross-Modal De-Redundancy in Multimodal Recommendation

CLEAR: 多模态去冗余中的跨模态空域投影

Hao Zhan, Yihui Wang, Yonghui Yang, Danyang Yue, Yu Wang, Pengyang Shao, Fei Shen, Fei Liu, Le Wu

专题命中 音视频/视觉语言融合 :multimodal fusion(abstract);分类 cs.MM

AI总结 CLEAR通过显式减少跨模态冗余提升多模态推荐性能,采用子空间投影方法增强表示学习动态。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.01382 2026-03-03 cs.SD cs.CL 50%

End-to-End Simultaneous Dysarthric Speech Reconstruction with Frame-Level Adaptor and Multiple Wait-k Knowledge Distillation

端到端的同时口吃语音重建与帧级适配模块及多视图知识蒸馏

Minghui Wu, Haitao Tang, Jiahuan Fan, Ruizhi Liao, Yanyong Zhang

机构 * University of Science and Technology of China(中国科学技术大学) iFlytek Co., Ltd.(科大讯飞股份有限公司)

专题命中 音视频/视觉语言融合 :information fusion(abstract)

AI总结 本文提出端到端的同时口吃语音重建系统,通过帧级适配模块和多视图知识蒸馏模块,提升重建语音的鲁棒性和可懂度。

Comments Submitted to 2025 Asia Pacific Signal and Information Processing Association Annual Summit and Conference (APSIPA ASC)

Journal ref 2025 Asia Pacific Signal and Information Processing Association Annual Summit and Conference (APSIPA ASC), Singapore, 2025, pp. 1092-1097

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.22961 2026-03-03 eess.AS 50%

Adapting Speech Foundation Models for Unified Multimodal Speech Recognition with Large Language Models

为统一多模态语音识别适应语音基础模型与大语言模型

Jing-Xuan Zhang, Genshun Wan, Jin Li, Jianqing Gao, Duo Zhao, Zhen-Hua Ling

专题命中 音视频/视觉语言融合 :multimodal fusion(abstract)

AI总结 本文提出UASR-LLM框架,通过大语言模型与语音基础模型结合,实现多模态语音识别的统一优化与性能提升。

Comments 10 pages, 4 figures, 5 tables

详情

展开后加载摘要…

URL PDF HTML 收藏

7. 融合架构与评测 2 篇

2508.16479 2026-03-03 eess.IV cs.AI cs.CV 62%

Disentangled Multi-modal Learning of Histology and Transcriptomics for Cancer Characterization

解耦的多模态学习:组织学与转录组学用于癌症表征

Yupei Zhang, Xiaofei Wang, Anran Liu, Lequan Yu, Chao Li

机构 * Department of Clinical Neurosciences, University of Cambridge, UK(剑桥大学临床神经科学系) Department of Health Technology & Informatics, The Hong Kong Polytechnic University(香港理工大学健康科技与信息学系) Department of Statistics and Actuarial Science, The University of Hong Kong(香港大学统计与精算科学系) Department of Clinical Neurosciences and Department of Applied Mathematics and Theoretical Physics, University of Cambridge(剑桥大学临床神经科学系和应用数学与理论物理系;邓迪大学科学与工程学院和医学院) School of Science and Engineering and School of Medicine, University of Dundee, UK

专题命中 融合架构与评测 :multi-modal fusion(abstract);分类 cs.CV、eess.IV

AI总结 本文提出了解耦的多模态学习框架,通过分解组织学和转录组数据以提高癌症表征的准确性和实用性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.00046 2026-03-03 cs.LG cs.AI 50%

REMIND: Rethinking Medical High-Modality Learning under Missingness--A Long-Tailed Distribution Perspective

REMIND: 重新思考医疗多模态学习中的缺失性——从长尾分布视角

Chenwei Wu, Zitao Shuai, Liyue Shen

机构 * University of Michigan(密歇根大学)

专题命中 融合架构与评测 :multi-modal fusion(abstract)

AI总结 REMIND从长尾分布视角重新思考医疗多模态学习中的高模态缺失问题,提出组专用混合专家架构和分布鲁棒优化策略,有效提升尾部模态组合的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏