HORNet: Task-Guided Frame Selection for Video Question Answering with Vision-Language Models
HORNet:基于任务引导的帧选择用于视觉语言模型的视频问答
机构 * Northeastern University(东北大学)
专题命中 视觉问答 :vision-language model(title,abstract);VLM(abstract);分类 cs.CV
AI总结 HORNet通过轻量级策略优化,显著减少视频输入帧数和VLM处理时间,同时提升问答质量与时间推理任务表现。