STRIDE: When to Speak Meets Sequence Denoising for Streaming Video Understanding
STRIDE:当语音识别与序列去噪相结合用于流媒体视频理解
机构 * UIUC(伊利诺伊大学厄巴纳-香槟分校) ; KAIST(韩国科学技术院) ; Google DeepMind(谷歌DeepMind)
专题命中 推理与问题求解 :large language model(abstract);language model(abstract);分类 cs.AI
AI总结 本文提出STRIDE方法,通过结构化序列建模解决流媒体视频中的主动激活问题,提升在线流媒体场景下的'何时说话'决策质量。
Comments Project page: https://interlive-team.github.io/STRIDE