Vision-Language and Large Language Model Performance in Gastroenterology: GPT, Claude, Llama, Phi, Mistral, Gemma, and Quantized Models
视觉-语言与大语言模型在胃肠病学中的表现:GPT、Claude、Llama、Phi、Mistral、Gemma及量化模型
机构 * Icahn School of Medicine at Mount Sinai(西奈山伊坎医学院) ; University of Texas Health(德克萨斯大学健康科学中心) ; Virginia Hospital Center(弗吉尼亚医院中心) ; Shahid Beheshti University of Medical Sciences(沙希德·贝赫什提医科大学) ; Stanford University(斯坦福大学) ; Cedars-Sinai Medical Center(西达赛奈医疗中心) ; Inova Fairfax Medical Campus(伊诺瓦费尔法克斯医疗中心) ; University of California–Los Angeles(加州大学洛杉矶分校) ; NYU Grossman School of Medicine(纽约大学格罗斯曼医学院) ; Columbia University(哥伦比亚大学)
专题命中 效率与部署 :large language model(title,abstract);language model(title,abstract);LLM(abstract,comments);分类 cs.CL、cs.AI
AI总结 本研究评估了大语言模型和视觉-语言模型在胃肠病学中的医学推理性能,比较了不同模型配置、参数及提示工程策略对性能的影响,发现专有模型在准确性上优于开源模型,且图像描述对视觉-语言模型性能有显著影响。
Comments Manuscript Pages: 34, Figures: 7, Tables: 2, Supplementary File Pages: 35, Data Transparency Statement: Code is available at: https://github.com/Sdamirsa/LLM-VLM-in-Gastroenterology . Study data from American College of Gastroenterology (ACG) are restricted and available upon request with ACG permission. Correction: updated abstract considering Llama3.1 results
Journal ref npj Digital Medicine 8, 797 (2025)