Beyond Boundary Frames: Talking-Head Inbetweening via Context-Aware Motion Modeling
超越边界框架:基于音频视觉语义的上下文中心视频插值
机构 * Tsinghua Shenzhen International Graduate School, Tsinghua University(清华大学深圳国际研究生院) ; Pengcheng Laboratory(鹏城实验室)
专题命中 音频语音多模态 :audio-visual(title,abstract);multimodal(abstract);分类 cs.CV
AI总结 本文提出BBF框架,通过解耦多模态条件,结合视觉上下文、文本语义和音频时间动态,提升视频插值的可控性和准确性,实验表明其在通用插值和音视频同步生成任务中优于现有方法。