Do Egocentric Video-Language Models Capture Both Hand- and Object-Centric Cues?
以自我为中心的视频-语言模型是否捕捉了以手和物体为中心的线索?
机构 * The University of Tokyo(东京大学) ; University of Twente(特温特大学) ; University of Bristol(布里斯托大学)
专题命中 图像修复 :inpainting(abstract);分类 cs.CV
AI总结 研究手部-物体交互识别中现有视频-语言模型的局限,提出结合手部-物体掩码训练与HOI-动态感知解码器的新范式,构建DEHOI测试平台评估,证明该方法更有效利用相关信息,在多方面优于现有模型,提升HOI理解。