video-SALMONN-R$^3$: Learning to ReWatch, ReAsk, and ReAnswer for Efficient Video Understanding
video-SALMONN-R$^3$: 学习重看、重问和重答以实现高效视频理解
机构 * Tsinghua University(清华大学) ; ByteDance(字节跳动) ; University of Cambridge(剑桥大学)
AI总结 提出video-SALMONN-R$^3$,首个通过强化学习实现重看机制的视频大语言模型,无需链式思维冷启动,采用重答和重问策略提升视频问答效率与准确性。