Object Tokens as a Bridge Between Segmentation and Visual Question Answering in Robotic Surgery
对象标记作为机器人手术中分割与视觉问答的桥梁
机构 * Department of Biomedical Engineering, Eindhoven University of Technology(埃因霍温理工大学生物医学工程系) ; Department of Electrical Engineering, Eindhoven University of Technology(埃因霍温理工大学电气工程系) ; Department of Surgery, University Medical Center Utrecht(乌得勒支大学医学中心外科)
专题命中 视觉问答 :VLM(summary_cn,abstract);visual question answering(title,abstract);vision-language model(abstract);visual reasoning(abstract)
AI总结 提出统一框架,联合像素级分割与视觉问答,通过VLM生成对象标记引导答案预测和分割掩码,在RAMIE和EndoVis18数据集上优于基线方法。