Light-Omni: Reflex over Reasoning in Agentic Video Understanding with Long-Term Memory
Light-Omni:基于长期记忆的智能视频理解中的反射优于推理
机构 * Nanjing University(南京大学)
专题命中 视频理解 :video understanding(title,abstract);分类 cs.CV
AI总结 研究针对智能视频理解中先进智能体依赖迭代推理成本高的问题,提出Light-Omni框架,通过双重上下文状态实现反射式轻量级视频理解,经实验验证其有效性,性能优于M3-Agent且能增强现有MLLMs。
Comments Project Page: https://clare-nie.github.io/Light-Omni