arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

图像生成

图像生成、文生图、图像编辑、扩散模型和可控生成。

2026-04-20 至 2026-04-20 共收录 1 信号源:cs.CV, cs.GR, cs.MM

1. 个性化与一致性 1 篇

2604.16108 2026-04-20 cs.CV 57%

Polyglot: Multilingual Style Preserving Speech-Driven Facial Animation

Polyglot:多语言风格保留的语音驱动面部动画

Federico Nocentini, Kwanggyoon Seo, Qingju Liu, Claudio Ferrari, Stefano Berretti, David Ferman, Hyeongwoo Kim, Pablo Garrido, Akin Caliskan

机构 * University of Florence(佛罗伦萨大学) Flawless AI Imperial College London(伦敦帝国学院)

专题命中 个性化与一致性 :diffusion(abstract);分类 cs.CV

AI总结 本文提出Polyglot,一种统一的扩散架构,用于多语言语音驱动面部动画,通过结合语言和风格信息,提升动画的真实性和一致性。

Comments The project website is available at https://fedenoce.github.io/polyglot/

详情

展开后加载摘要…

URL PDF HTML 收藏