Rethinking Position Embedding as a Context Controller for Multi-Reference and Multi-Shot Video Generation
重新思考位置嵌入作为多参考和多镜头视频生成的上下文控制器
机构 * Wuhan University(武汉大学) ; University of Science and Technology of China(中国科学技术大学) ; Hong Kong University of Science and Technology(香港科技大学) ; Tsinghua University(清华大学)
专题命中 视频生成 :video generation(title,abstract);分类 cs.CV
AI总结 本文提出PoCo方法,通过引入位置嵌入作为额外的上下文控制,解决多参考和多镜头视频生成中参考混淆问题,提升跨镜头一致性和参考保真度。
Comments Accepted to CVPR 2026