DDVT: Dynamic Dual-level Vision Transformer Fusion Network for Answer Grounding in Visual Question Answering
DDVT:用于视觉问答中答案定位的动态双级视觉Transformer融合网络
机构 * National and Local Joint Engineering Laboratory of Computer Aided Design, School of Software Engineering, Dalian University(大连大学软件工程学院计算机辅助设计国家地方联合工程实验室) ; School of Computer Science and Technology, Dalian University of Technology(大连理工大学计算机科学与技术学院)
专题命中 视觉问答 :visual question answering(title,abstract);grounding(title,abstract);分类 cs.CV
AI总结 研究视觉问答中答案定位问题,提出动态双级视觉Transformer融合网络DDVT,含问题引导的动态区域级模块和跨模态多尺度聚合模块,能精确定位相关视觉内容并融合文本特征,实验证明其性能优于现有方法。
Comments Accepted by CGI