ViSAGE: Constructing Self-Correcting Memories for Long-Form Video Understanding
ViSAGE:为长视频理解构建自修正记忆
机构 * Zhejiang University(浙江大学) ; Xidian University(西安电子科技大学)
专题命中 视频理解 :video understanding(title);分类 cs.CV
AI总结 ViSAGE是一种多模态智能体记忆框架,通过跨模态绑定、双向记忆精调及多智能体交叉验证解决长视频理解中的实体混淆等问题,较最强基线准确率提升5.9%。
Comments Accept by ACMMM 2026