Pocket-Dentist: On-Device Dental Image Understanding via Efficient Multimodal Large Language Models
口袋牙医:通过高效多模态大语言模型实现设备端牙科图像理解
机构 * The University of Auckland, New Zealand(奥克兰大学) ; Shandong University, China(山东大学) ; The University of Melbourne, Australia(墨尔本大学)
专题命中 视觉问答 :multimodal large language model(title);VLM(abstract,abstract_cn);vision-language model(abstract);分类 cs.CV、cs.AI
AI总结 提出Pocket-Dentist基准,通过评估14种视觉语言模型发现紧凑模型(2B参数)在牙科图像理解中精度更高且计算成本更低,并在iPhone 17 Pro上实现低延迟部署。