Transformer-Driven Multimodal Fusion for Explainable Suspiciousness Estimation in Visual Surveillance
基于Transformer的多模态融合用于视觉监控中的可解释性可疑性估计
机构 * Big Data Research and Supercomputing Division, CSIR Fourth Paradigm Institute(CSIR第四范式研究所大数据研究与超级计算部门) ; Department of Electrical Engineering, Bharti School of Telecommunication, Yardi School of Artificial Intelligence, IIT Delhi(电信学院电子工程系、Yardi人工智能学院、德里理工学院)
专题命中 多模态训练与对齐 :multimodal(title,abstract);分类 cs.CV
AI总结 本文提出基于Transformer的多模态融合框架DeepUSEvision,结合YOLOv12、双深度卷积网络和Transformer判别器,实现高准确率和可解释性的可疑性估计。
Comments 12 pages, 10 figures, IEEE Transaction on Image Processing