Representations Before Pixels: Semantics-Guided Hierarchical Video Prediction
在像素之前:基于语义的分层视频预测
机构 * Archimedes Athena Research Center(雅典娜研究中心) ; National Technical University of Athens(雅典国家技术大学) ; University of Crete(克里特大学) ; IACM-Forth(希腊研究与技术基金会-应用与计算数学研究所)
专题命中 扩散模型 :diffusion(abstract);分类 cs.CV
AI总结 本文提出Re2Pix框架,通过先预测语义表示再生成视觉内容,提升动态环境视频预测的语义一致性和视觉质量。