Towards Grounded GI Endoscopy VQA via Multi-Task Learning on Small VLMs
基于小型视觉语言模型多任务学习的 grounded 胃肠道内窥镜视觉问答研究
机构 * Institute of Business and Administration(商业管理学院)
专题命中 视觉问答 :VLM(abstract,abstract_cn);grounding(abstract,abstract_cn);vision-language model(abstract);visual question answering(abstract)
AI总结 该研究针对胃肠道内窥镜视觉问答任务,提出多任务微调方案,利用现有数据集构建辅助任务,微调小型视觉语言模型,实现了准确率提升与答案-图像区域对齐优化。
Comments Accepted at EMA4MICCAI 2026 (Workshop on Efficient Medical AI, MICCAI 2026)