StruVis: Enhancing Reasoning-based Text-to-Image Generation via Thinking with Structured Vision
StruVis: 通过结构化视觉进行推理的文本到图像生成增强
Yuanhuiyi Lyu, Kaiyu Lei, Ziqiao Weng, Xu Zheng, Lutao Jiang, Teng Li, Yangfu Li, Ziyuan Huang, Linfeng Zhang, Xuming Hu
机构
*
Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州))
;
Ant Group(蚂蚁集团)
;
Shanghai Jiao Tong University(上海交通大学)
;
Hong Kong University of Science and Technology(香港科技大学)
;
East China Normal University(华东师范大学)
VisualPrompter: Semantic-Aware Prompt Optimization with Visual Feedback for Text-to-Image Synthesis
VisualPrompter: 基于视觉反馈的语义感知提示优化用于文本到图像合成
Shiyu Wu, Mingzhen Sun, Weining Wang, Yequan Wang, Jing Liu
机构
*
Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所)
;
Beijing Academy of Artificial Intelligence(北京人工智能研究院)
;
University of Chinese Academy of Sciences(中国科学院大学)
;
Peking University(北京大学)
机构
*
Institute of Information Engineering, CAS(中国科学院信息工程研究所)
;
School of Cyber Security, University of Chinese Academy of Sciences(中国科学院大学网络安全学院)
;
State Key Laboratory of AI Safety, Institute of Computing Technology, CAS(中国科学院计算技术研究所人工智能安全国家重点实验室)
;
School of Computer Science and Technology, University of Chinese Academy of Sciences(中国科学院大学计算机科学与技术学院)
;
BDKM, University of Chinese Academy of Sciences(中国科学院大学BDKM)
;
School of Computer Science and Technology, Beijing Institute of Technology(北京理工大学计算机科学与技术学院)
;
School of Cyber Science and Tech., Shenzhen Campus, Sun Yat-sen University(中山大学深圳校区网络安全科学与技术学院)
机构
*
Institute of Computing Technology, Chinese Academy of Sciences(中国科学院计算技术研究所)
;
Peking University(北京大学)
;
University of Chinese Academy of Sciences(中国科学院大学)
;
Sun Yat-sen University(中山大学)
;
Baidu Inc.(百度公司)