IntentVLM: Open-Vocabulary Intention Recognition through Forward-Inverse Modeling with Video-Language Models
IntentVLM: 通过视频语言模型的前-后向建模实现开放词汇意图识别
机构 * Institute of Intelligent Systems and Robotics (ISIR)(智能系统与机器人研究所)
专题命中 视频理解 :video-language(title,abstract);分类 cs.MM
AI总结 本文提出IntentVLM框架,通过前-后向建模提升多模态环境下的人意图识别效果,实验表明其在IntentQA和Inst-IT Bench数据集上达到80%准确率,超越基线30%,接近人类水平。