HandVQA: Diagnosing and Improving Fine-Grained Spatial Reasoning about Hands in Vision-Language Models
HandVQA: 评估视觉-语言模型中手部精细空间推理的诊断与改进
机构 * UNIST(蔚山科学技术院) ; University of Aberdeen(阿伯丁大学) ; University College London(伦敦大学学院) ; Fogsphere (Redev.AI Ltd), UK(Fogsphere (Redev.AI Ltd),英国)
专题命中 视觉推理 :vision-language model(title,abstract);LLaVA(abstract);visual question answering(abstract);分类 cs.CV
AI总结 HandVQA通过视觉问答评估VLM对手部解剖的精细空间理解,发现现有模型在手部关节空间关系推理上的系统性缺陷,并通过3D数据训练提升模型在手部姿态识别和手-物交互任务中的性能。
Comments Accepted in CVPR 2026; Project page, code, and dataset: https://kcsayem.github.io/handvqa/