Parallelized Autoregressive Decoding for Omni-Modal Dense Video Captioning
用于全模态密集视频字幕的并行自回归解码
机构 * National University of Singapore(新加坡国立大学)
专题命中 视频多模态 :omni-modal(title,abstract);cross-modal(abstract);audio-visual(abstract);分类 cs.CV、cs.AI、cs.MM
AI总结 研究密集视频字幕生成,提出并行自回归框架,利用事件间弱局部依赖重组因果依赖图,引入全局规划和事件分解并行解码机制,提升效率与字幕性能。
Comments ECCV 2026. Project website: https://github.com/showlab/PadCaptioner