Unleashing Multimodal Large Language Models for Training-free HOI Detection in the Wild
释放多模态大语言模型用于野外无训练的人机交互检测
机构 * Wangxuan Institute of Computer Technology, Peking University(北京大学王选计算机技术研究所)
专题命中 视觉定位与Grounding :multimodal large language model(title);grounding(abstract);分类 cs.CV、cs.AI
AI总结 该研究针对传统人机交互检测方法在开放世界和组合场景中泛化能力受限的问题,提出无训练的AgentHOI框架,利用基础模型多模态推理能力,通过上下文感知多轮推理和多方面交互定位机制,在实际场景中取得优于现有监督和弱监督方法的性能。