arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

视觉与机器人

多模态信息融合

面向图像、视频、多传感器和跨模态感知的信息融合,包括 Image Fusion、红外可见光、遥感、医学影像、LiDAR/雷达/相机和音视频融合。

2026-03-30 至 2026-03-30 共收录 1 信号源:cs.CV, eess.IV, eess.SP, cs.RO, cs.MM

1. 音视频/视觉语言融合 1 篇

2603.25752 2026-03-30 cs.CL cs.SD eess.AS 50%

Relational graph-driven differential denoising and diffusion attention fusion for multimodal conversation emotion recognition

关系图驱动的微分去噪和扩散注意力融合用于多模态对话情感识别

Ying Liu, Yuntao Shou, Wei Ai, Tao Meng, Keqin Li

机构 * College of Computer and Mathematics, Central South University of Forestry and Technology(中南林业科技大学计算机与数学学院) Department of Computer Science, State University of New York, New Paltz(纽约州立大学新帕尔茨分校计算机科学系)

专题命中 音视频/视觉语言融合 :multimodal fusion(abstract)

AI总结 本文提出关系感知去噪和扩散注意力融合模型,通过微分Transformer去噪、构建模态关系子图和文本引导跨模态扩散机制,提升多模态对话情感识别性能。

Comments 19 pages

Journal ref neurocomputing2026

详情

展开后加载摘要…

URL PDF HTML 收藏