Character-Centered Dialogue Generation from Scene-Level Prompts
从场景级提示生成以角色为中心的对话
机构 * University of Maryland at College Park, United States(马里兰大学学院市分校,美国)
专题命中 视频问答 :video generation(abstract);分类 cs.CV
AI总结 本研究提出了一种模块化流程,将动作级提示转化为视觉和听觉上一致的对话,丰富了基于场景的故事叙述。通过预训练的视觉-语言编码器提取高级视觉语义,并结合结构化提示引导大型语言模型生成对话。引入递归叙述银行以保持跨场景的上下文和情感一致性,最终生成具有表现力的角色条件语音,产生完整的视听叙事。
Comments Accepted to the 2026 IEEE International Conference on Image Processing (ICIP 2026). 18 pages, 5 figures