arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

多模态信息融合

面向图像、视频、多传感器和跨模态感知的信息融合,包括 Image Fusion、红外可见光、遥感、医学影像、LiDAR/雷达/相机和音视频融合。

2026-08-12 至 2026-08-12 共收录 2 信号源:cs.CV, eess.IV, eess.SP, cs.RO, cs.MM

1. 音视频/视觉语言融合 2 篇

2607.15779 2026-08-12 cs.CV 版本更新 57%

Multimodal Ambivalence and Hesitancy Recognition via Cross-Attention and Gated Fusion

通过交叉注意力和门控融合进行多模态矛盾与犹豫识别

Oussama Berhili, Yassine Ouzar, Larbi Boubchir

机构 * University of Paris 8(巴黎第八大学) LIASD Laboratory(LIASD实验室)

专题命中 音视频/视觉语言融合 :multimodal fusion(abstract);分类 cs.CV

AI总结 为ECCV 2026的ABAW11挑战赛开发多模态框架,用预训练编码器提取多模态特征,建立单模态基线,在此基础上提出含交叉注意力和门控融合的多模态架构,验证集宏F1达0.7394,提升显著。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.03921 2026-08-12 eess.AS 版本更新 50%

Cyclostationarity Analysis as a Complement to Self-Supervised Representations for Speech Deepfake Detection

循环平稳性分析作为语音深度伪造检测中自监督表示的补充

Cemal Hanilçi, Md Sahidullah, Tomi Kinnunen

专题命中 音视频/视觉语言融合 :hybrid fusion(abstract)

AI总结 本文提出基于循环平稳性分析的声学特征提取框架,用于提升语音深度伪造检测的性能。

Comments accepted for publication in IEEE Transactions on Audio, Speech and Language Processing

详情

展开后加载摘要…

URL PDF HTML 收藏