Anchored Video Generation: Decoupling Scene Construction and Temporal Synthesis in Text-to-Video Diffusion Models
锚定视频生成:解耦场景构建与时间合成在文本到视频扩散模型中
机构 * École Polytechnique Fédérale de Lausanne (EPFL)(瑞士联邦理工学院洛桑分校)
专题命中 推理与问题求解 :LLM(abstract);large language model(abstract);language model(abstract)
AI总结 本文提出锚定视频生成方法,通过解耦场景构建与时间合成任务,提升文本到视频扩散模型在复杂场景生成和时间逻辑遵循上的性能。