OmniShow: Unifying Multimodal Conditions for Human-Object Interaction Video Generation
OmniShow:统一多模态条件以生成人-物体交互视频
机构 * The Chinese University of Hong Kong(香港中文大学)
专题命中 多模态生成 :multimodal(title,abstract);audio-visual(abstract);分类 cs.CV
AI总结 本文提出OmniShow框架,统一文本、图像、音频和姿态多模态条件,解决人-物体交互视频生成中的可控性与质量平衡问题,通过统一通道条件和门控局部上下文注意力实现高效生成,建立HOIVG-Bench基准测试平台,取得多模态条件下的最佳性能。
Comments Project page: https://correr-zhou.github.io/OmniShow/