arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

多模态信息融合

面向图像、视频、多传感器和跨模态感知的信息融合,包括 Image Fusion、红外可见光、遥感、医学影像、LiDAR/雷达/相机和音视频融合。

2026-08-21 至 2026-08-21 共收录 2 信号源:cs.CV, eess.IV, eess.SP, cs.RO, cs.MM

1. 音视频/视觉语言融合 1 篇

2608.19710 2026-08-21 cs.CV cs.AI 新提交 57%

Robust Cross-Modal Foundation Model Perception for Underwater Robots under Degraded Visual Conditions

退化视觉条件下水下机器人的鲁棒跨模态基础模型感知

Mohammad Arif Ul Alam

机构 * College of Science and Technology, North Carolina A & T State University(北卡罗来纳农工州立大学科学技术学院)

专题命中 音视频/视觉语言融合 :multimodal fusion(abstract);分类 cs.CV

AI总结 该研究针对水下机器人视觉退化问题,提出感知退化的视觉-声纳门控融合方法,在极端退化下使平衡准确率较 DINOv2 基线提升 33.5%,实现鲁棒跨模态感知。

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 融合架构与评测 1 篇

2608.19788 2026-08-21 eess.IV cs.CV 新提交 62%

MOSAIC: Modality-agnostic Spectral Alignment for Federated Image-level Weakly Supervised Tumor Segmentation under Client-specific Missing Modalities

MOSAIC:面向客户端特定缺失模态的联邦图像级弱监督肿瘤分割的模态无关频谱对齐方法

Tarun Kumar Garg, Vaanathi Sundaresan

专题命中 融合架构与评测 :multimodal fusion(abstract);分类 cs.CV、eess.IV

AI总结 本研究针对客户端特定缺失模态的联邦图像级弱监督肿瘤分割问题,提出MOSAIC框架,通过模态对齐模块、频谱原型对齐损失及联邦优化网络,在三个脑肿瘤基准上取得显著优于基线的性能,仅用图像级标签接近全监督精度,且支持动态客户端加入。

详情

展开后加载摘要…

URL PDF HTML 收藏