ProfVLM: A lightweight video-language model for multi-view proficiency estimation
ProfVLM:一种轻量级视频-语言模型用于多视角技能评估
机构 * Free University of Bozen-Bolzano(博洛尼亚-博兹纳自由大学) ; University of Trento(特伦托大学)
专题命中 动作与事件理解 :video-language(title);分类 cs.CV
AI总结 本文提出ProfVLM,一种轻量级视频-语言模型,通过生成式视觉-语言建模实现多视角技能评估,兼具生成自然语言反馈与定量评分,参数更少且训练更快。
Journal ref Computer Vision and Image Understanding, Volume 268, 2026