AutoVQA-G: Self-Improving Agentic Framework for Automated Visual Question Answering and Grounding Annotation
AutoVQA-G:用于自动视觉问答与接地标注的自我改进代理框架
机构 * School of Artificial Intelligence(人工智能学院)
专题命中 视觉问答 :visual question answering(title,abstract);grounding(title,abstract);VLM(abstract,abstract_cn);vision-language model(abstract)
AI总结 本文提出AutoVQA-G框架,通过迭代优化流程提升视觉问答接地标注的准确性,优于现有多模态LLM,为构建高质量数据促进更稳健的视觉语言模型训练提供新方法。
Comments Accepted at IEEE ICASSP 2026. 5 pages, 5 figures. Code available at https://github.com/rohnson1999/AutoVQA-G
Journal ref Proc. 2026 IEEE International Conference on Acoustics, Speech and Signal Processing (ICASSP), pp. 12312-12316, 2026