arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

多模态信息融合

面向图像、视频、多传感器和跨模态感知的信息融合,包括 Image Fusion、红外可见光、遥感、医学影像、LiDAR/雷达/相机和音视频融合。

2026-07-22 至 2026-07-22 共收录 6 信号源:cs.CV, eess.IV, eess.SP, cs.RO, cs.MM

1. 红外-可见光融合 2 篇

2607.18688 2026-07-22 cs.CV 新提交 79%

Dual-Edged Homogeneous-Modality Similarity: Towards Visible-Infrared Modality-Incomplete Person Re-Identification with Modality Adaptive Matching

双边同质模态相似性:迈向具有模态自适应匹配的可见-红外模态不完整行人重识别

Xin Xu, Shuhao Zhan, Wei Liu, Zheng Wang, Kui Jiang, Chia-Wen Lin

专题命中 红外-可见光融合 :visible-infrared(title,abstract);分类 cs.CV

AI总结 研究开放世界场景下可见-红外模态不完整行人重识别问题,提出模态自适应匹配Transformer(MAMT),通过散度Transformer模块和共享Transformer模块提取特征,经模态自适应匹配模块动态融合,在新构建基准上实验,证明方法有效且具适应性。

Comments 18 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.18729 2026-07-22 physics.optics 新提交 50%

Raman-Assisted Multiband Nonlinear Frequency-Conversion Network in a High-Q LTOI Microdisk

高Q值绝缘体上钽酸锂微盘中的拉曼辅助多波段非线性频率转换网络

Zhifan Fang, Yuxuan He, Zhangning Pan, Xianfeng Chen, Yuping Chen

专题命中 红外-可见光融合 :infrared and visible(abstract)

AI总结 研究在高Q值LTOI微盘中实现拉曼辅助多波段非线性频率转换网络,通过谐振泵浦产生高纯度单模拉曼激光,附近泵浦下产生多斯托克斯分量及反斯托克斯线,可产生多波段信号,为集成多波段光源及研究耦合非线性动力学提供了平台。

Comments 11 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 遥感融合与全色锐化 1 篇

2607.18936 2026-07-22 cs.RO cs.CV 新提交 76%

NGPS: GPS-Denied Aerial Geo-Localization and 2.5D Reconstruction via Deep Satellite Image Matching and Multi-Rate Sensor Fusion

NGPS:通过深度卫星图像匹配和多速率传感器融合实现无GPS的航空地理定位和2.5D重建

Sanket Sharma

专题命中 遥感融合与全色锐化 :sensor fusion(title);分类 cs.CV、cs.RO

AI总结 研究针对高空无人机视觉地理定位问题,提出NGPS框架,通过深度卫星图像匹配及多速率传感器融合实现无GPS绝对定位,结合多种技术,经实验在五个飞行序列上取得良好效果,相比单目VIO有显著提升,且能实时运行并部分开源。

Comments 9 pages (8-page paper + IEEE copyright/citation cover page), 6 figures. Accepted to IEEE/RSJ IROS 2026

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 机器人多传感器融合 1 篇

2607.18897 2026-07-22 eess.IV 新提交 79%

Thinking Fast, Thinking Slow: Adaptive Multimodal Transformer-based Sensor Fusion for Depth Estimation on Ultra-low-power MCUs

快速思考,慢速思考:基于自适应多模态Transformer的超低功耗MCU深度估计传感器融合

Luca Crupi, Lorenzo Lamberti, Giovanni Badaracco, Daniele Allegri, Alessandro Giusti, Daniele Palossi

专题命中 机器人多传感器融合 :sensor fusion(title,abstract);分类 eess.IV

AI总结 研究针对超低功耗MCU深度估计问题,提出结合多模态传感器融合与轻量级基于循环Transformer架构的自适应方法,通过令牌传播和增量传感器利用机制平衡能耗与精度,实验证明该方法节能且精度提升显著。

Comments 16 pages, 9 figures, 6 tables. This paper has been accepted for publication in the IEEE Sensors Journal Copyright 2026 IEEE

详情

展开后加载摘要…

URL PDF HTML 收藏

4. 音视频/视觉语言融合 1 篇

2607.19086 2026-07-22 cs.CV 新提交 79%

Advancing Multimodal Fusion on Heterogeneous Medical Data with Hybrid Geometry Attention

利用混合几何注意力推进异构医学数据上的多模态融合

Joy Dhar, Manish Kumar Pandey, Nayyar Zaidi, Chen Chen, Maryam Haghighat, Ferdous Sohel, Puneet Goyal

机构 * Indian Institute of Technology Ropar(印度理工学院罗帕尔分校) RoentGen Health(伦琴健康公司) Deakin University(迪肯大学) University of Central Florida(中佛罗里达大学) Queensland University of Technology(昆士兰科技大学) Murdoch University(莫道克大学)

专题命中 音视频/视觉语言融合 :multimodal fusion(title,abstract);分类 cs.CV

AI总结 针对异构医学数据多模态融合难题,提出CURE框架,通过HyFuse层及相关模块逐步整合模态,有效捕捉跨模态交互,降低计算成本,在多数据集上评估显示其性能显著提升,优于领先方法。

Comments ACM SIGKDD Conference on Knowledge Discovery and Data Mining (KDD 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏

5. 融合架构与评测 1 篇

2607.18336 2026-07-22 cs.MM cs.CL cs.LG 新提交 57%

EmoEUS: Uncertainty Supervision for Multimodal Emotion Recognition in Conversation

EmoEUS:对话中多模态情感识别的不确定性监督

Zilong Huang, Kong Aik Lee, Junjie Li, Zhe Li, Man-Wai Mak

机构 * Dept. of Electrical and Electronic Engineering, The Hong Kong Polytechnic University(香港理工大学电子与电气工程系) Speech, Language, and Cognition Laboratory, The University of Hong Kong(香港大学语音、语言与认知实验室)

专题命中 融合架构与评测 :multimodal fusion(abstract);分类 cs.MM

AI总结 研究对话中多模态情感识别,提出EmoEUS框架,通过动态加权模态执行不确定性感知多模态融合,并引入显式监督损失,实验证明该框架优于现有方法。

Comments Accept by Interspeech 2026

详情

展开后加载摘要…

URL PDF HTML 收藏