Beyond Text Prompts: Visual-to-Visual Generation as A Unified Paradigm
超越文本提示:视觉到视觉生成作为统一范式
机构 * City University of Hong Kong(香港城市大学) ; City University of Hong Kong (Dongguan)(香港城市大学(东莞)) ; The Hong Kong University of Science and Technology(香港科学与技术大学) ; The Chinese University of Hong Kong(香港中文大学) ; Celia Research HK(Celia研究香港) ; Great Bay University(大湾大学) ; Lingnan University(岭南大学)
专题命中 VLM训练与架构 :VLM(abstract,abstract_cn);vision-language model(abstract);分类 cs.CV
AI总结 提出视觉到视觉(V2V)生成范式及无需训练的V2V-Zero框架,通过利用视觉页面隐藏状态替代文本条件,在多个任务上达到或接近优化后的文本到图像性能。
Comments Project Page: https://yaofang-liu.github.io/V2V_Web