arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

视觉与机器人

多模态信息融合

面向图像、视频、多传感器和跨模态感知的信息融合,包括 Image Fusion、红外可见光、遥感、医学影像、LiDAR/雷达/相机和音视频融合。

2026-04-17 至 2026-04-17 共收录 3 信号源:cs.CV, eess.IV, eess.SP, cs.RO, cs.MM

1. 融合架构与评测 3 篇

2510.11066 2026-04-17 cs.IR 78%

Decoupled Multimodal Fusion for User Interest Modeling in Click-Through Rate Prediction

解耦多模态融合用于点击通过率预测中的用户兴趣建模

Alin Fan, Hanqing Li, Sihan Lu, Jingsong Yuan, Jiandong Zhang

专题命中 融合架构与评测 :multimodal fusion(title,abstract)

AI总结 本文提出解耦多模态融合方法,通过构建目标感知特征和优化注意力机制,提升用户兴趣建模效果,实验表明在公开和工业数据集上均取得显著提升。

Comments Accepted by ICDE2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.14574 2026-04-17 cs.CV 57%

M3D-Net: Multi-Modal 3D Facial Feature Reconstruction Network for Deepfake Detection

M3D-Net:面向深度伪造检测的多模态3D面部特征重建网络

Haotian Wu, Yue Cheng, Shan Bian

机构 * College of Mathematics and Informatics(数学与信息学院) South China Agricultural University(华南农业大学) Wushan Road, Tianhe District(天河南路) Guangzhou(广州) China(中国)

专题命中 融合架构与评测 :multi-modal fusion(abstract);分类 cs.CV

AI总结 本文提出M3D-Net,通过多模态特征融合和3D重建模块提升深度伪造检测的准确性和鲁棒性,实验表明其在多个数据集上表现优异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.14520 2026-04-17 cs.CV 57%

Chain of Modality: From Static Fusion to Dynamic Orchestration in Omni-MLLMs

模态链:从静态融合到动态编排在多模态大语言模型中

Ziyang Luo, Nian Liu, Junwei Han

机构 * Northwestern Polytechnical University(西北工业大学)

专题命中 融合架构与评测 :multimodal fusion(abstract);分类 cs.CV

AI总结 本文提出CoM框架,通过动态编排解决多模态融合的静态融合问题,提升模型在不同任务中的泛化能力。

详情

展开后加载摘要…

URL PDF HTML 收藏