Corruption-Aware Training of Latent Video Diffusion Models for Robust Text-to-Video Generation
面向鲁棒文本到视频生成的潜变量视频扩散模型腐蚀感知训练
机构 * William & Mary(威廉与玛丽学院) ; Carnegie Mellon University(卡内基梅隆大学) ; The University of Hong Kong(香港大学)
专题命中 视频扩散模型 :video generation(title,abstract);video diffusion(title,abstract);text-to-video(title);video understanding(abstract)
AI总结 本文提出CAT-LVDM框架,通过结构化噪声注入提升视频扩散模型的鲁棒性,实验显示其在多个数据集上优于传统方法,且能扩展至自回归生成和多模态视频理解模型。
Comments ICLR 2026 ReALM-GEN