CT-1: Vision-Language-Camera Models Transfer Spatial Reasoning Knowledge to Camera-Controllable Video Generation
CT-1:视觉-语言-相机模型将空间推理知识转移到相机可控的视频生成
机构 * Fudan University(复旦大学) ; Tencent(腾讯) ; Xiamen University(厦门大学) ; Shanghai Jiao Tong University(上海交通大学)
专题命中 视频生成 :video generation(title,abstract);video diffusion(abstract);分类 cs.CV
AI总结 本文提出CT-1模型,通过准确估计相机轨迹将空间推理知识转移到视频生成中,利用小波正则化损失和视频扩散模型提升相机控制精度,实验显示其生成的视频质量高且控制准确率提升25.7%。