Towards Self-Explainable Document Visual Question Answering with Chain-of-Explanation Predictions
迈向具有解释链预测的自解释文档视觉问答
机构 * Department of Informatics, University of Oslo(奥斯陆大学信息学院) ; Integreat – Norwegian Centre for Knowledge-driven Machine Learning(挪威知识驱动机器学习中心) ; TRUST – The Norwegian Centre for Trustworthy AI(挪威可信人工智能中心)
专题命中 视觉问答 :visual question answering(title,abstract);vision-language model(abstract);分类 cs.CV、cs.LG
AI总结 本文提出CoExVQA框架,通过解释链设计实现文档视觉问答的自解释,通过证据识别、答案定位和基于证据解码三步流程提升可解释性,实验显示在PFL-DocVQA上取得SotA性能,ANLS提升12%。