arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

视觉与机器人

多模态信息融合

面向图像、视频、多传感器和跨模态感知的信息融合,包括 Image Fusion、红外可见光、遥感、医学影像、LiDAR/雷达/相机和音视频融合。

2026-03-17 至 2026-03-17 共收录 2 信号源:cs.CV, eess.IV, eess.SP, cs.RO, cs.MM

1. 音视频/视觉语言融合 2 篇

2603.14361 2026-03-17 cs.CV 57%

BROTHER: Behavioral Recognition Optimized Through Heterogeneous Ensemble Regularization for Ambivalence and Hesitancy

BROTHER: 通过异质性集成正则化优化行为识别以应对矛盾与犹豫

Alexandre Pereira, Bruno Fernandes, Pablo Barros

专题命中 音视频/视觉语言融合 :multimodal fusion(abstract);分类 cs.CV

AI总结 本文提出BROTHER框架,通过异质集成正则化方法,结合视觉、音频和语言数据,提升对矛盾与犹豫等复杂行为状态的识别能力,采用PSO硬投票集成策略,实现宏F1分数达0.7465。

Comments 5 pages, 2 figures, 3 tables, Ambivalence/Hesitancy (AH) Video Recognition Challenge, ABAW10th, CVPR2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.13719 2026-03-17 cs.CV 57%

Sparse-Dense Mixture of Experts Adapter for Multi-Modal Tracking

稀疏-密集专家混合适配器用于多模态跟踪

Yabin Zhu, Jianqi Li, Chenglong Li, Jiaxiang Wang, Chengjie Gu, Jin Tang

专题命中 音视频/视觉语言融合 :multi-modal fusion(abstract);分类 cs.CV

AI总结 本文提出稀疏-密集专家混合适配器框架,通过稀疏MoE和密集共享MoE有效建模多模态特征,结合Gram基于语义对齐超图融合模块,提升多模态跟踪性能。

详情

展开后加载摘要…

URL PDF HTML 收藏