arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

视觉与机器人

多模态信息融合

面向图像、视频、多传感器和跨模态感知的信息融合,包括 Image Fusion、红外可见光、遥感、医学影像、LiDAR/雷达/相机和音视频融合。

2026-03-19 至 2026-03-19 共收录 1 信号源:cs.CV, eess.IV, eess.SP, cs.RO, cs.MM

1. 音视频/视觉语言融合 1 篇

2603.16939 2026-03-19 cs.CV 79%

Solution for 10th Competition on Ambivalence/Hesitancy (AH) Video Recognition Challenge using Divergence-Based Multimodal Fusion

第十届Ambivalence/Hesitancy(AH)视频识别挑战赛中基于分歧的多模态融合解决方案

Aislan Gabriel O. Souza, Agostinho Freire, Leandro Honorato Silva, Igor Lucas B. da Silva, João Vinícius R. de Andrade, Gabriel C. de Albuquerque, Lucas Matheus da S. Oliveira, Mário Stela Guerra, Luciana Machado

机构 * Universidade de Pernambuco(巴伊亚大学) Escola Politécnica de Pernambuco(巴伊亚理工学院)

专题命中 音视频/视觉语言融合 :multimodal fusion(title,abstract);分类 cs.CV

AI总结 本文提出基于分歧的多模态融合方法,通过测量视觉、音频和文本通道间的跨模态冲突,提升AH识别性能,在BAH数据集上达到0.6808的宏F1分数,优于基准线。

详情

展开后加载摘要…

URL PDF HTML 收藏