arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

多模态信息融合

面向图像、视频、多传感器和跨模态感知的信息融合,包括 Image Fusion、红外可见光、遥感、医学影像、LiDAR/雷达/相机和音视频融合。

2026-08-05 至 2026-08-05 共收录 2 信号源:cs.CV, eess.IV, eess.SP, cs.RO, cs.MM

1. 音视频/视觉语言融合 2 篇

2505.12715 2026-08-05 cs.CV 版本更新 74%

VLC Fusion: Vision-Language Conditioned Sensor Fusion for Robust Object Detection

VLC Fusion:面向鲁棒目标检测的视觉-语言条件传感器融合

Aditya Taparia, Noel Ngu, Mario Leiva, Joshua Shay Kricheli, John Corcoran, Nathaniel D. Bastian, Gerardo Simari, Paulo Shakarian, Ransalu Senanayake

机构 * Arizona State University(亚利桑那州立大学) Department of Computer Science and Engineering, Universidad Nacional del Sur and Institute for Computer Science and Engineering(计算机科学与工程系,国家南方大学和计算机科学与工程研究所) U.S. Department of Defense(美国国防部) United States Military Academy(美国军事学院) Syracuse University(雪城大学)

专题命中 音视频/视觉语言融合 :sensor fusion(title);分类 cs.CV

AI总结 本文提出VLC Fusion视觉-语言条件传感器融合框架,利用VLM捕捉环境线索动态调整模态权重,在多传感器融合目标检测任务中,于自动驾驶与军事目标数据集上较传统方法实现更优性能。

Comments 27 pages, 20 figures, Accepted for presentation at ECML PKDD 2026, Shortlisted for the Best Research Track Student Paper Award

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.03475 2026-08-05 cs.MM cs.AI cs.CL 新提交 57%

Adaptive Modality Reliability Diagnosis and Restoration for Robust Multimodal Intent Recognition

用于鲁棒多模态意图识别的自适应模态可靠性诊断与恢复

Suraj Kumar, Mohnish Raj, Soumi Chattopadhayay, Chandranath Adak, Ayan Dutta

专题命中 音视频/视觉语言融合 :multimodal fusion(abstract);分类 cs.MM

AI总结 提出PRIME闭环可靠性引导框架,通过诊断恢复多模态意图识别的不可靠模态,在保持干净数据性能的同时提升了多模态数据各类退化场景下的鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏