Spatially-Grounded Text-to-Video Generation via Inference-Time Gradient-Free Optimization
基于推理时无梯度优化的空间接地文本到视频生成
机构 * ISIR - Sorbonne Université(ISIR - 索邦大学) ; Obvious Research
专题命中 视频生成 :video generation(title,abstract);text-to-video(title,abstract);分类 cs.CV
AI总结 针对文本到视频生成的空间可控性挑战,提出无训练无梯度的GATO-Vid方法,通过解析求解交叉注意力分数实现精确空间引导,在提升定位精度的同时降低计算开销。
Comments Final Version