Fine-tuning a multimodal large language model for clinician-grade autism behavioral scoring from short home videos
微调多模态大语言模型用于从短视频中对自闭症行为进行临床级评分
机构 * Stanford University(斯坦福大学) ; University of Hawaii at Manoa(夏威夷大学马诺阿分校) ; University of California San Francisco(加利福尼亚大学旧金山分校)
专题命中 VLM训练与架构 :multimodal large language model(title);分类 cs.CV
AI总结 微调Gemini 2.5 Pro模型,从400个临床评分的家庭视频中提取30个行为特征,在99名儿童上实现与临床医生评分的一致性提升40%,并零样本达到53%的自闭症诊断F1提升。