FZ-VLM: A Two Stage Florence-Zephyr Vision Language Model Framework for Pulmonary Nodule Characterization and Clinical Decision Making
FZ-VLM:用于肺结节特征表征与临床决策的两阶段Florence-Zephyr视觉语言模型框架
机构 * College of Engineering, University of Guelph(圭尔夫大学工程学院) ; Holland Bloorview Kids Rehabilitation Hospital(霍兰德布鲁尔维尤儿童康复医院) ; Guelph General Hospital(圭尔夫综合医院) ; Ontario Veterinary College, University of Guelph(圭尔夫大学安大略兽医学院)
专题命中 视觉定位与Grounding :VLM(title,title_cn);vision language model(title,abstract);vision-language model(abstract);分类 cs.CV、cs.AI
AI总结 本研究提出首个两阶段视觉语言模型框架FZ-VLM,通过微调Florence-2与Zephyr-7B模型,实现肺CT中肺结节的结构化特征表征与临床决策,性能优于GPT-4基线及人类基线。