Modularized Dynamic-Granularity Video LLM for Multi-Event Long Video Understanding
用于多事件长视频理解的模块化动态粒度视频语言模型
专题命中 视频理解 :video understanding(title,abstract);long video(title,abstract);video reasoning(abstract);分类 cs.CV
AI总结 针对长视频理解中视觉令牌预算与多事件捕捉的矛盾问题,提出MoD-VLLM框架,含正-负视频片段定位和模块化动态粒度反射模块,结合动态粒度强化学习策略,在多事件长视频基准测试中显著优于现有基线。
Comments Accepted by 2026 IEEE International Conference on Multimedia and Expo (ICME 2026)