Grounding Text-to-Image Diffusion Models for Controlled High-Quality Image Generation
专题命中 可控生成 :image generation(title,abstract);text-to-image(title,abstract);diffusion(title,abstract);分类 cs.CV
视觉与机器人
图像生成、文生图、图像编辑、扩散模型和可控生成。
专题命中 可控生成 :image generation(title,abstract);text-to-image(title,abstract);diffusion(title,abstract);分类 cs.CV
专题命中 可控生成 :image generation(title,abstract);text-to-image(title,abstract);diffusion(title,abstract);分类 cs.CV
PixelPonder: 动态补丁自适应增强多条件文本到图像生成
机构 * Fudan University(复旦大学) ; Tencent Youtu Lab(腾讯优图实验室) ; Western University(西澳大学) ; University of Chinese Academy of Sciences(中国科学院大学)
专题命中 可控生成 :image generation(title,abstract);text-to-image(title,abstract);diffusion(abstract);分类 cs.CV
AI总结 提出PixelPonder统一控制框架,通过补丁级自适应条件选择和时间感知控制注入机制,解决多条件文本到图像生成中结构失真和伪影问题,在保持文本语义一致性的同时提升空间对齐精度。
逐层实例绑定用于文本到图像扩散变换器中的区域和遮挡控制
机构 * Tianjin University(天津大学)
专题命中 可控生成 :text-to-image(title,abstract);diffusion(title,abstract);image generation(abstract);分类 cs.CV
AI总结 LayerBind通过逐层实例绑定实现文本到图像扩散变换器中的区域和遮挡控制,无需训练即可提升生成质量和遮挡管理能力。
Comments Accepted by CVPR26
机构 * Cognitive Neuroinformatics University of Bremen(认知神经信息学不莱梅大学)
专题命中 可控生成 :diffusion(title,abstract);image generation(title);text-to-image(abstract);image synthesis(abstract)
Comments 12 pages, 5 figures
机构 * Institute for AI Industry Research (AIR), Tsinghua University University of Chinese Academy of Sciences Mercedes-Benz Group China Ltd. Peking University \& Carnegie Mellon University ,\
专题命中 可控生成 :diffusion(title,abstract);image synthesis(title,abstract);image generation(abstract);分类 cs.CV
Comments Project Page: https://air-discover.github.io/SCP-Diff/
机构 * CUHK(香港中文大学) ; SIAT, CAS(中国科学院深圳先进技术研究院) ; NUS(新加坡国立大学) ; Zhejiang Lab(浙江实验室) ; Shanghai AI Lab(上海人工智能实验室)
专题命中 可控生成 :text-to-image(title,abstract);diffusion(title,abstract);image generation(abstract);分类 cs.CV
Comments Accepted by IJCAI2025 (Project page: https://correr-zhou.github.io/MagicTailor)
专题命中 可控生成 :text-to-image(title,abstract);diffusion(title,abstract);image generation(abstract);分类 cs.CV
Comments Codes and models are available at https://github.com/fenfenfenfan/VMix
专题命中 可控生成 :text-to-image(title,abstract);diffusion(title,abstract);image editing(abstract);分类 cs.CV
Comments project page: https://customdiffusion360.github.io
专题命中 可控生成 :diffusion(title,abstract);image synthesis(title,abstract);inpainting(abstract);分类 cs.CV
Comments Accepted to ICLR 2024. The final version is available at OpenReview: https://openreview.net/forum?id=rHzapPnCgT
Journal ref The Twelfth International Conference on Learning Representations, 2024
专题命中 可控生成 :diffusion(title,abstract);text-to-image(title);image generation(abstract);image synthesis(abstract)
专题命中 可控生成 :text-to-image(title,abstract);diffusion(title,abstract);image generation(abstract);分类 cs.CV
专题命中 可控生成 :text-to-image(title,abstract);diffusion(title,abstract);image generation(abstract);分类 cs.CV
专题命中 可控生成 :image generation(title,abstract);diffusion(title,abstract);image synthesis(abstract);分类 cs.CV
Comments Accepted by CVPR2023
专题命中 可控生成 :text-to-image(title,abstract);diffusion(title,abstract);image generation(abstract);分类 cs.CV
Comments Accepted at CVPR 2024
专题命中 可控生成 :image generation(title,abstract);text-to-image(title,abstract);diffusion(abstract);分类 cs.CV
专题命中 可控生成 :text-to-image(title,abstract);diffusion(title,abstract);image generation(abstract);分类 cs.CV
Comments Project page: https://text2control3d.github.io/
专题命中 可控生成 :diffusion(title,abstract);image synthesis(title,abstract);image editing(abstract);分类 cs.CV
专题命中 可控生成 :image generation(title,abstract);text-to-image(title,abstract);diffusion(abstract);分类 cs.CV
专题命中 可控生成 :image generation(title,abstract);diffusion(title,abstract);image editing(abstract);分类 cs.CV
专题命中 可控生成 :text-to-image(title,abstract);diffusion(title,abstract);分类 cs.CV、cs.GR、cs.MM
Comments Codes and Supplementary Material: https://github.com/lllyasviel/ControlNet
基于文本到图像扩散模型的可控生成:综述
机构 * Beijing University of Posts and Telecommunications(北京邮电大学)
专题命中 可控生成 :text-to-image(title,abstract);diffusion(title,abstract);分类 cs.CV
AI总结 本文综述了基于文本到图像扩散模型的可控生成方法,分析了不同条件下的生成机制及分类。
Comments TPAMI 2025; A collection of resources on controllable generation with text-to-image diffusion models: https://github.com/PRIV-Creation/Awesome-Controllable-T2I-Diffusion-Models
专题命中 可控生成 :image generation(title,abstract);diffusion(title,abstract);分类 cs.CV、cs.GR
Comments Accepted to SIGGRAPH 2024. Project page: https://dilightnet.github.io/
Journal ref ACM SIGGRAPH 2024 Conference Proceedings
专题命中 可控生成 :text-to-image(title,abstract);diffusion(title,abstract);分类 cs.CV、cs.GR
Comments Camera Ready, Code is available at https://github.com/ShihaoZhaoZSH/Uni-ControlNet
专题命中 可控生成 :diffusion(title,abstract);image synthesis(title,abstract);分类 cs.CV、cs.GR
Comments WACV 2023. Project page https://xh-liu.github.io/sdg/
RichControl: 面向文本到图像生成的、结构和外观丰富的免训练空间控制
机构 * Peking University(北京大学) ; Carnegie Mellon University(卡内基梅隆大学)
专题命中 可控生成 :text-to-image(title,abstract);image generation(title);diffusion(abstract);分类 cs.CV
AI总结 提出一种免训练框架,通过解耦条件特征的采样调度与去噪过程,并引入重启细化调度和外观丰富提示策略,在复杂条件下实现结构和外观平衡的受控生成。
通过学习视角令牌实现文本到图像生成的相机控制
机构 * University of California, Irvine(加州大学尔湾分校)
专题命中 可控生成 :image generation(title,abstract);text-to-image(title,abstract);分类 cs.CV
AI总结 本文提出通过学习参数化相机令牌实现文本到图像生成中的精确相机控制,结合3D渲染图像和真实增强图像,提升生成图像的准确性和保真度。
基于布局的可控病理图像生成与上下文扩散变换器
机构 * Xi'an Jiaotong University(西安交通大学)
专题命中 可控生成 :diffusion(title,abstract);image generation(title);image synthesis(abstract);分类 cs.CV
AI总结 本文提出基于布局的可控病理图像生成方法,通过多代理LVLM注释框架构建精细临床对齐的监督数据,提出IC-DiT模型整合空间布局、文本描述和视觉嵌入,实现高保真生成与强空间可控性。
Comments 19 pages
SeeThrough3D: 3D布局生成中的遮挡感知控制
机构 * IIIT Hyderabad(IIIT海得拉尔) ; IISc Bengaluru(IISc班加罗尔)
专题命中 可控生成 :image generation(title,abstract);text-to-image(title,abstract);分类 cs.CV
AI总结 SeeThrough3D通过引入遮挡感知的3D场景表示和掩码自注意力机制,实现了对3D布局生成中遮挡关系的精确建模与控制。
Comments Project page: https://seethrough3d.github.io. Accepted at CVPR 2026
受PBR启发的可控扩散用于图像生成
专题命中 可控生成 :image generation(title,abstract);diffusion(title);text-to-image(abstract);分类 cs.GR
AI总结 本研究提出了一种受PBR启发的可控扩散方法,通过生成G-buffer实现对图像生成中几何布局和材质属性的精细控制,通过用户研究验证了其在文本引导图像生成中的有效性。