arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

多模态信息融合

面向图像、视频、多传感器和跨模态感知的信息融合,包括 Image Fusion、红外可见光、遥感、医学影像、LiDAR/雷达/相机和音视频融合。

2026-04-29 至 2026-04-29 共收录 1 信号源:cs.CV, eess.IV, eess.SP, cs.RO, cs.MM

1. 融合架构与评测 1 篇

2604.23214 2026-04-29 cs.CL 50%

DARC-CLIP: Dynamic Adaptive Refinement with Cross-Attention for Meme Understanding

DARC-CLIP:动态自适应细化与跨注意力机制用于表情包理解

Qiyuan Jin

机构 * The Hong Kong University of Science(香港科技大学)

专题命中 融合架构与评测 :multimodal fusion(abstract)

AI总结 本文提出DARC-CLIP框架,通过层次化细化栈实现自适应多模态融合,提升表情包中多模态线索的建模精度,尤其在仇恨检测任务中取得显著提升。

Comments Accepted to IEEE ICASSP 2026. 5 pages, 3 figures, 4 tables

详情

展开后加载摘要…

URL PDF HTML 收藏