arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

多模态信息融合

面向图像、视频、多传感器和跨模态感知的信息融合,包括 Image Fusion、红外可见光、遥感、医学影像、LiDAR/雷达/相机和音视频融合。

2026-07-10 至 2026-07-10 共收录 2 信号源:cs.CV, eess.IV, eess.SP, cs.RO, cs.MM

1. 音视频/视觉语言融合 2 篇

2607.08112 2026-07-10 cs.CV 新提交 57%

VSRo-200: A Romanian Visual Speech Recognition Dataset for Studying Supervision and Multimodal Robustness

VSRo-200:用于研究监督和多模态鲁棒性的罗马尼亚语视觉语音识别数据集

Iulia-Maria Udrea, Alexandra Diaconu, Bogdan Alexe

机构 * University of Bucharest(布加勒斯特大学)

专题命中 音视频/视觉语言融合 :multimodal fusion(abstract);分类 cs.CV

AI总结 本文介绍罗马尼亚语视觉语音识别数据集VSRo-200,通过伪标签和人工转录注释样本,建立低资源视觉语音识别基准。研究监督质量影响,评估域转移鲁棒性及噪声下视听语音识别,证明其表示可转移至其他基准,为相关研究提供新测试平台。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.08573 2026-07-10 cs.AI 新提交 50%

SHAP-Weighted Cross-Modal Expert Fusion for Emotion and Sentiment Recognition: Evidence and Limits

用于情感和情绪识别的SHAP加权跨模态专家融合:证据与局限

Adis Alihodzic, Selma Skopljakovic Hubljar

机构 * Faculty of Science, University of Sarajevo(萨拉热窝大学理学院)

专题命中 音视频/视觉语言融合 :multimodal fusion(abstract)

AI总结 研究多模态情感和情绪识别,重新审视XAI引导的自适应融合\xgaf,分析专家特征维度不等时SHAP归因减少的影响,通过实验对比不同融合方法在情感识别任务中的表现,揭示SHAP减少、专家维度和跨模态专家设计对模块化多模态融合的作用。

详情

展开后加载摘要…

URL PDF HTML 收藏