arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

多模态信息融合

面向图像、视频、多传感器和跨模态感知的信息融合,包括 Image Fusion、红外可见光、遥感、医学影像、LiDAR/雷达/相机和音视频融合。

2026-07-22 至 2026-07-22 共收录 10 信号源:cs.CV, eess.IV, eess.SP, cs.RO, cs.MM

1. 红外-可见光融合 2 篇

2607.18688 2026-07-22 cs.CV 新提交 79%

Dual-Edged Homogeneous-Modality Similarity: Towards Visible-Infrared Modality-Incomplete Person Re-Identification with Modality Adaptive Matching

双边同质模态相似性:迈向具有模态自适应匹配的可见-红外模态不完整行人重识别

Xin Xu, Shuhao Zhan, Wei Liu, Zheng Wang, Kui Jiang, Chia-Wen Lin

专题命中 红外-可见光融合 :visible-infrared(title,abstract);分类 cs.CV

AI总结 研究开放世界场景下可见-红外模态不完整行人重识别问题,提出模态自适应匹配Transformer(MAMT),通过散度Transformer模块和共享Transformer模块提取特征,经模态自适应匹配模块动态融合,在新构建基准上实验,证明方法有效且具适应性。

Comments 18 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.18729 2026-07-22 physics.optics 新提交 50%

Raman-Assisted Multiband Nonlinear Frequency-Conversion Network in a High-Q LTOI Microdisk

高Q值绝缘体上钽酸锂微盘中的拉曼辅助多波段非线性频率转换网络

Zhifan Fang, Yuxuan He, Zhangning Pan, Xianfeng Chen, Yuping Chen

专题命中 红外-可见光融合 :infrared and visible(abstract)

AI总结 研究在高Q值LTOI微盘中实现拉曼辅助多波段非线性频率转换网络,通过谐振泵浦产生高纯度单模拉曼激光,附近泵浦下产生多斯托克斯分量及反斯托克斯线,可产生多波段信号,为集成多波段光源及研究耦合非线性动力学提供了平台。

Comments 11 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 遥感融合与全色锐化 1 篇

2607.18936 2026-07-22 cs.RO cs.CV 新提交 76%

NGPS: GPS-Denied Aerial Geo-Localization and 2.5D Reconstruction via Deep Satellite Image Matching and Multi-Rate Sensor Fusion

NGPS:通过深度卫星图像匹配和多速率传感器融合实现无GPS的航空地理定位和2.5D重建

Sanket Sharma

专题命中 遥感融合与全色锐化 :sensor fusion(title);分类 cs.CV、cs.RO

AI总结 研究针对高空无人机视觉地理定位问题,提出NGPS框架,通过深度卫星图像匹配及多速率传感器融合实现无GPS绝对定位,结合多种技术,经实验在五个飞行序列上取得良好效果,相比单目VIO有显著提升,且能实时运行并部分开源。

Comments 9 pages (8-page paper + IEEE copyright/citation cover page), 6 figures. Accepted to IEEE/RSJ IROS 2026

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 机器人多传感器融合 2 篇

2607.18897 2026-07-22 eess.IV 新提交 79%

Thinking Fast, Thinking Slow: Adaptive Multimodal Transformer-based Sensor Fusion for Depth Estimation on Ultra-low-power MCUs

快速思考,慢速思考:基于自适应多模态Transformer的超低功耗MCU深度估计传感器融合

Luca Crupi, Lorenzo Lamberti, Giovanni Badaracco, Daniele Allegri, Alessandro Giusti, Daniele Palossi

专题命中 机器人多传感器融合 :sensor fusion(title,abstract);分类 eess.IV

AI总结 研究针对超低功耗MCU深度估计问题,提出结合多模态传感器融合与轻量级基于循环Transformer架构的自适应方法,通过令牌传播和增量传感器利用机制平衡能耗与精度,实验证明该方法节能且精度提升显著。

Comments 16 pages, 9 figures, 6 tables. This paper has been accepted for publication in the IEEE Sensors Journal Copyright 2026 IEEE

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.13715 2026-07-22 cs.CV 版本更新 57%

MVGD-Net: A Novel Motion-aware Video Glass Surface Detection Method

MVGD-Net: 一种新颖的运动感知视频玻璃表面检测网络

Yiwei Lu, Hao Huang, Tao Yan

机构 * Tao Yan(谭燕)

专题命中 机器人多传感器融合 :multimodal fusion(abstract);分类 cs.CV

AI总结 MVGD-Net通过利用视频中运动不一致特性,提出新颖网络检测玻璃表面,结合多模块融合与大规模数据集提升检测性能。

Comments This paper has been accepted by the 40th AAAI Conference on Artificial Intelligence (AAAI-26). It contians 9 pages, 11 figures

详情

展开后加载摘要…

URL PDF HTML 收藏

4. 音视频/视觉语言融合 1 篇

2607.19086 2026-07-22 cs.CV 新提交 79%

Advancing Multimodal Fusion on Heterogeneous Medical Data with Hybrid Geometry Attention

利用混合几何注意力推进异构医学数据上的多模态融合

Joy Dhar, Manish Kumar Pandey, Nayyar Zaidi, Chen Chen, Maryam Haghighat, Ferdous Sohel, Puneet Goyal

机构 * Indian Institute of Technology Ropar(印度理工学院罗帕尔分校) RoentGen Health(伦琴健康公司) Deakin University(迪肯大学) University of Central Florida(中佛罗里达大学) Queensland University of Technology(昆士兰科技大学) Murdoch University(莫道克大学)

专题命中 音视频/视觉语言融合 :multimodal fusion(title,abstract);分类 cs.CV

AI总结 针对异构医学数据多模态融合难题,提出CURE框架,通过HyFuse层及相关模块逐步整合模态,有效捕捉跨模态交互,降低计算成本,在多数据集上评估显示其性能显著提升,优于领先方法。

Comments ACM SIGKDD Conference on Knowledge Discovery and Data Mining (KDD 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏

5. 融合架构与评测 4 篇

2606.15265 2026-07-22 cs.CV 版本更新 74%

Trusted Multi-View Deep Learning Classification of Fetal Congenital Heart Disease with Feature-level and Decision-level Fusion

基于特征级与决策级融合的胎儿先天性心脏病可信多视图深度学习分类

Tan Zhou, Shifa Yao, Suncheng Xiang, Dahong Qian, Baoying Ye

机构 * School of Biomedical Engineering, Shanghai Jiao Tong University(生物医学工程学院,上海交通大学) Shanghai Key Laboratory of Embryo Original Diseases(上海胚胎原发疾病重点实验室) Shanghai Municipal Key Clinical Specialty(上海市级重点临床专科)

专题命中 融合架构与评测 :decision-level fusion(title);分类 cs.CV

AI总结 提出一种多视图深度学习框架,通过特征提取、注意力机制和不确定性决策融合超声心动图多视角图像,实现胎儿先天性心脏病高精度二分类。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.18336 2026-07-22 cs.MM cs.CL cs.LG 新提交 57%

EmoEUS: Uncertainty Supervision for Multimodal Emotion Recognition in Conversation

EmoEUS:对话中多模态情感识别的不确定性监督

Zilong Huang, Kong Aik Lee, Junjie Li, Zhe Li, Man-Wai Mak

机构 * Dept. of Electrical and Electronic Engineering, The Hong Kong Polytechnic University(香港理工大学电子与电气工程系) Speech, Language, and Cognition Laboratory, The University of Hong Kong(香港大学语音、语言与认知实验室)

专题命中 融合架构与评测 :multimodal fusion(abstract);分类 cs.MM

AI总结 研究对话中多模态情感识别,提出EmoEUS框架,通过动态加权模态执行不确定性感知多模态融合,并引入显式监督损失,实验证明该框架优于现有方法。

Comments Accept by Interspeech 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.14702 2026-07-22 cs.CV cs.AI 版本更新 57%

Team RAS in 11th ABAW Competition: Multimodal Ambivalence Recognition Approach

第十一届ABAW竞赛中的团队RAS:多模态矛盾情绪识别方法

Elena Ryumina, Maxim Markitantov, Alexandr Axyonov, Fedor Shchetinin, Timur Abdulkadirov, Dmitry Ryumin, Alexey Karpov

机构 * St. Petersburg Federal Research Center of the Russian Academy of Sciences (SPC RAS)(俄罗斯科学院圣彼得堡联邦研究中心) HSE University(圣彼得堡高等经济学院) ITMO University(圣彼得堡国立信息技术机械与光学大学)

专题命中 融合架构与评测 :multimodal fusion(abstract);分类 cs.CV

AI总结 针对第十一届ABAW竞赛的视频级矛盾情绪和犹豫情绪识别,提出以文本为中心的多模态方法,用文本残差融合模型结合多种特征,实验表明该方法能有效提高识别性能,无需大型模型集成。

Comments 10 pages, 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.16216 2026-07-22 math.OC 版本更新 50%

Conservative fusion of unbiased partial state estimates: CI is optimal

无偏部分状态估计的保守融合:协方差交集是最优的

Jochen Trumpf, Behzad Zamani, Chris Manzie

专题命中 融合架构与评测 :information fusion(abstract)

AI总结 研究两个无偏部分状态估计信息融合时,证明协方差交集(CI)在保守无偏线性融合规则中最优,还表明三个优化问题等价,给出可解性条件及相关成本函数最优解方程。

Comments Provisionally accepted for Automatica

详情

展开后加载摘要…

URL PDF HTML 收藏