Unify-Agent: A Unified Multimodal Agent for World-Grounded Image Synthesis
Unify-Agent:一种用于世界 grounded 图像合成的统一多模态代理
机构 * University of California, Los Angeles(加州大学洛杉矶分校) ; Tencent Hunyuan(腾讯混元) ; The Chinese University of Hong Kong(香港中文大学) ; The Hong Kong University of Science and Technology(香港科技大学)
专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.CV
AI总结 本文提出Unify-Agent,一种统一多模态代理,用于世界 grounded 图像合成,通过代理流程提升图像生成质量,结合事实IP基准测试,展示其在多种任务中的优越表现。
Comments Project Page: https://github.com/shawn0728/Unify-Agent