arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

图像生成

图像生成、文生图、图像编辑、扩散模型和可控生成。

共收录 4200 信号源:cs.CV, cs.GR, cs.MM

1. 可控生成 4200 篇

2501.09194 2025-02-11 cs.CV cs.AI 92%

Grounding Text-to-Image Diffusion Models for Controlled High-Quality Image Generation

Ahmad Süleyman, Göksel Biricik

专题命中 可控生成 :image generation(title,abstract);text-to-image(title,abstract);diffusion(title,abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2305.14720 2023-06-23 cs.CV cs.AI 92%

BLIP-Diffusion: Pre-trained Subject Representation for Controllable Text-to-Image Generation and Editing

Dongxu Li, Junnan Li, Steven C. H. Hoi

专题命中 可控生成 :image generation(title,abstract);text-to-image(title,abstract);diffusion(title,abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.06684 2026-05-25 cs.CV 89%

PixelPonder: Dynamic Patch Adaptation for Enhanced Multi-Conditional Text-to-Image Generation

PixelPonder: 动态补丁自适应增强多条件文本到图像生成

Yanjie Pan, Qingdong He, Zhengkai Jiang, Pengcheng Xu, Chaoyi Wang, Jinlong Peng, Haoxuan Wang, Yun Cao, Zhenye Gan, Mingmin Chi, Bo Peng, Yabiao Wang

机构 * Fudan University(复旦大学) Tencent Youtu Lab(腾讯优图实验室) Western University(西澳大学) University of Chinese Academy of Sciences(中国科学院大学)

专题命中 可控生成 :image generation(title,abstract);text-to-image(title,abstract);diffusion(abstract);分类 cs.CV

AI总结 提出PixelPonder统一控制框架,通过补丁级自适应条件选择和时间感知控制注入机制,解决多条件文本到图像生成中结构失真和伪影问题,在保持文本语义一致性的同时提升空间对齐精度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.05769 2026-03-09 cs.CV 89%

Layer-wise Instance Binding for Regional and Occlusion Control in Text-to-Image Diffusion Transformers

逐层实例绑定用于文本到图像扩散变换器中的区域和遮挡控制

Ruidong Chen, Yancheng Bai, Xuanpu Zhang, Jianhao Zeng, Lanjun Wang, Dan Song, Lei Sun, Xiangxiang Chu, Anan Liu

机构 * Tianjin University(天津大学)

专题命中 可控生成 :text-to-image(title,abstract);diffusion(title,abstract);image generation(abstract);分类 cs.CV

AI总结 LayerBind通过逐层实例绑定实现文本到图像扩散变换器中的区域和遮挡控制,无需训练即可提升生成质量和遮挡管理能力。

Comments Accepted by CVPR26

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.06888 2025-11-12 cs.CV 89%

A Two-Stage System for Layout-Controlled Image Generation using Large Language Models and Diffusion Models

Jan-Hendrik Koch, Jonas Krumme, Konrad Gadzicki

机构 * Cognitive Neuroinformatics University of Bremen(认知神经信息学不莱梅大学)

专题命中 可控生成 :diffusion(title,abstract);image generation(title);text-to-image(abstract);image synthesis(abstract)

Comments 12 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2403.09638 2025-09-16 cs.CV 89%

SCP-Diff: Spatial-Categorical Joint Prior for Diffusion Based Semantic Image Synthesis

Huan-ang Gao, Mingju Gao, Jiaju Li, Wenyi Li, Rong Zhi, Hao Tang, Hao Zhao

机构 * Institute for AI Industry Research (AIR), Tsinghua University University of Chinese Academy of Sciences Mercedes-Benz Group China Ltd. Peking University \& Carnegie Mellon University ,\

专题命中 可控生成 :diffusion(title,abstract);image synthesis(title,abstract);image generation(abstract);分类 cs.CV

Comments Project Page: https://air-discover.github.io/SCP-Diff/

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.13370 2025-05-22 cs.CV cs.AI 89%

MagicTailor: Component-Controllable Personalization in Text-to-Image Diffusion Models

Donghao Zhou, Jiancheng Huang, Jinbin Bai, Jiaze Wang, Hao Chen, Guangyong Chen, Xiaowei Hu, Pheng-Ann Heng

机构 * CUHK(香港中文大学) SIAT, CAS(中国科学院深圳先进技术研究院) NUS(新加坡国立大学) Zhejiang Lab(浙江实验室) Shanghai AI Lab(上海人工智能实验室)

专题命中 可控生成 :text-to-image(title,abstract);diffusion(title,abstract);image generation(abstract);分类 cs.CV

Comments Accepted by IJCAI2025 (Project page: https://correr-zhou.github.io/MagicTailor)

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.20800 2024-12-31 cs.CV 89%

VMix: Improving Text-to-Image Diffusion Model with Cross-Attention Mixing Control

Shaojin Wu, Fei Ding, Mengqi Huang, Wei Liu, Qian He

专题命中 可控生成 :text-to-image(title,abstract);diffusion(title,abstract);image generation(abstract);分类 cs.CV

Comments Codes and models are available at https://github.com/fenfenfenfan/VMix

详情

展开后加载摘要…

URL PDF HTML 收藏
2404.12333 2024-12-04 cs.CV 89%

Customizing Text-to-Image Diffusion with Object Viewpoint Control

Nupur Kumari, Grace Su, Richard Zhang, Taesung Park, Eli Shechtman, Jun-Yan Zhu

专题命中 可控生成 :text-to-image(title,abstract);diffusion(title,abstract);image editing(abstract);分类 cs.CV

Comments project page: https://customdiffusion360.github.io

详情

展开后加载摘要…

URL PDF HTML 收藏
2310.06313 2024-11-22 cs.CV 89%

Advancing Pose-Guided Image Synthesis with Progressive Conditional Diffusion Models

Fei Shen, Hu Ye, Jun Zhang, Cong Wang, Xiao Han, Wei Yang

专题命中 可控生成 :diffusion(title,abstract);image synthesis(title,abstract);inpainting(abstract);分类 cs.CV

Comments Accepted to ICLR 2024. The final version is available at OpenReview: https://openreview.net/forum?id=rHzapPnCgT

Journal ref The Twelfth International Conference on Learning Representations, 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2312.06573 2024-08-13 cs.CV 89%

ControlNet-XS: Rethinking the Control of Text-to-Image Diffusion Models as Feedback-Control Systems

Denis Zavadski, Johann-Friedrich Feiden, Carsten Rother

专题命中 可控生成 :diffusion(title,abstract);text-to-image(title);image generation(abstract);image synthesis(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2306.14408 2024-07-16 cs.CV 89%

Text-Anchored Score Composition: Tackling Condition Misalignment in Text-to-Image Diffusion Models

Luozhou Wang, Guibao Shen, Wenhang Ge, Guangyong Chen, Yijun Li, Ying-cong Chen

专题命中 可控生成 :text-to-image(title,abstract);diffusion(title,abstract);image generation(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2403.18417 2024-03-28 cs.CV 89%

ECNet: Effective Controllable Text-to-Image Diffusion Models

Sicheng Li, Keqiang Sun, Zhixin Lai, Xiaoshi Wu, Feng Qiu, Haoran Xie, Kazunori Miyata, Hongsheng Li

专题命中 可控生成 :text-to-image(title,abstract);diffusion(title,abstract);image generation(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2303.17189 2024-03-13 cs.CV 89%

LayoutDiffusion: Controllable Diffusion Model for Layout-to-image Generation

Guangcong Zheng, Xianpan Zhou, Xuewei Li, Zhongang Qi, Ying Shan, Xi Li

专题命中 可控生成 :image generation(title,abstract);diffusion(title,abstract);image synthesis(abstract);分类 cs.CV

Comments Accepted by CVPR2023

详情

展开后加载摘要…

URL PDF HTML 收藏
2403.03485 2024-03-07 cs.CV 89%

NoiseCollage: A Layout-Aware Text-to-Image Diffusion Model Based on Noise Cropping and Merging

Takahiro Shirakawa, Seiichi Uchida

专题命中 可控生成 :text-to-image(title,abstract);diffusion(title,abstract);image generation(abstract);分类 cs.CV

Comments Accepted at CVPR 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2402.04504 2024-02-08 cs.CV 89%

Text2Street: Controllable Text-to-image Generation for Street Views

Jinming Su, Songen Gu, Yiting Duan, Xingyue Chen, Junfeng Luo

专题命中 可控生成 :image generation(title,abstract);text-to-image(title,abstract);diffusion(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2309.03550 2023-09-08 cs.CV 89%

Text2Control3D: Controllable 3D Avatar Generation in Neural Radiance Fields using Geometry-Guided Text-to-Image Diffusion Model

Sungwon Hwang, Junha Hyung, Jaegul Choo

专题命中 可控生成 :text-to-image(title,abstract);diffusion(title,abstract);image generation(abstract);分类 cs.CV

Comments Project page: https://text2control3d.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2305.18812 2023-05-31 cs.CV cs.AI 89%

DiffSketching: Sketch Control Image Synthesis with Diffusion Models

Qiang Wang, Di Kong, Fengyin Lin, Yonggang Qi

专题命中 可控生成 :diffusion(title,abstract);image synthesis(title,abstract);image editing(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2305.18583 2023-05-31 cs.CV cs.AI 89%

Controllable Text-to-Image Generation with GPT-4

Tianjun Zhang, Yi Zhang, Vibhav Vineet, Neel Joshi, Xin Wang

专题命中 可控生成 :image generation(title,abstract);text-to-image(title,abstract);diffusion(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2304.04269 2023-04-11 cs.CV 89%

HumanSD: A Native Skeleton-Guided Diffusion Model for Human Image Generation

Xuan Ju, Ailing Zeng, Chenchen Zhao, Jianan Wang, Lei Zhang, Qiang Xu

专题命中 可控生成 :image generation(title,abstract);diffusion(title,abstract);image editing(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2302.05543 2023-11-28 cs.CV cs.AI cs.GR cs.HC cs.MM 89%

Adding Conditional Control to Text-to-Image Diffusion Models

Lvmin Zhang, Anyi Rao, Maneesh Agrawala

专题命中 可控生成 :text-to-image(title,abstract);diffusion(title,abstract);分类 cs.CV、cs.GR、cs.MM

Comments Codes and Supplementary Material: https://github.com/lllyasviel/ControlNet

详情

展开后加载摘要…

URL PDF HTML 收藏
2403.04279 2026-01-09 cs.CV 89%

Controllable Generation with Text-to-Image Diffusion Models: A Survey

基于文本到图像扩散模型的可控生成:综述

Pu Cao, Feng Zhou, Qing Song, Lu Yang

机构 * Beijing University of Posts and Telecommunications(北京邮电大学)

专题命中 可控生成 :text-to-image(title,abstract);diffusion(title,abstract);分类 cs.CV

AI总结 本文综述了基于文本到图像扩散模型的可控生成方法,分析了不同条件下的生成机制及分类。

Comments TPAMI 2025; A collection of resources on controllable generation with text-to-image diffusion models: https://github.com/PRIV-Creation/Awesome-Controllable-T2I-Diffusion-Models

详情

展开后加载摘要…

URL PDF HTML 收藏
2402.11929 2024-05-29 cs.CV cs.GR 88%

DiLightNet: Fine-grained Lighting Control for Diffusion-based Image Generation

Chong Zeng, Yue Dong, Pieter Peers, Youkang Kong, Hongzhi Wu, Xin Tong

专题命中 可控生成 :image generation(title,abstract);diffusion(title,abstract);分类 cs.CV、cs.GR

Comments Accepted to SIGGRAPH 2024. Project page: https://dilightnet.github.io/

Journal ref ACM SIGGRAPH 2024 Conference Proceedings

详情

展开后加载摘要…

URL PDF HTML 收藏
2305.16322 2023-10-31 cs.CV cs.GR 88%

Uni-ControlNet: All-in-One Control to Text-to-Image Diffusion Models

Shihao Zhao, Dongdong Chen, Yen-Chun Chen, Jianmin Bao, Shaozhe Hao, Lu Yuan, Kwan-Yee K. Wong

专题命中 可控生成 :text-to-image(title,abstract);diffusion(title,abstract);分类 cs.CV、cs.GR

Comments Camera Ready, Code is available at https://github.com/ShihaoZhaoZSH/Uni-ControlNet

详情

展开后加载摘要…

URL PDF HTML 收藏
2112.05744 2022-12-06 cs.CV cs.GR 88%

More Control for Free! Image Synthesis with Semantic Diffusion Guidance

Xihui Liu, Dong Huk Park, Samaneh Azadi, Gong Zhang, Arman Chopikyan, Yuxiao Hu, Humphrey Shi, Anna Rohrbach, Trevor Darrell

专题命中 可控生成 :diffusion(title,abstract);image synthesis(title,abstract);分类 cs.CV、cs.GR

Comments WACV 2023. Project page https://xh-liu.github.io/sdg/

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.02792 2026-06-02 cs.CV 88%

RichControl: Structure- and Appearance-Rich Training-Free Spatial Control for Text-to-Image Generation

RichControl: 面向文本到图像生成的、结构和外观丰富的免训练空间控制

Lexi Pang, Liheng Zhang, Hang Ye, Xiaoxuan Ma, Yizhou Wang

机构 * Peking University(北京大学) Carnegie Mellon University(卡内基梅隆大学)

专题命中 可控生成 :text-to-image(title,abstract);image generation(title);diffusion(abstract);分类 cs.CV

AI总结 提出一种免训练框架,通过解耦条件特征的采样调度与去噪过程,并引入重启细化调度和外观丰富提示策略,在复杂条件下实现结构和外观平衡的受控生成。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.19954 2026-04-23 cs.CV 88%

Camera Control for Text-to-Image Generation via Learning Viewpoint Tokens

通过学习视角令牌实现文本到图像生成的相机控制

Xinxuan Lu, Charless Fowlkes, Alexander C. Berg

机构 * University of California, Irvine(加州大学尔湾分校)

专题命中 可控生成 :image generation(title,abstract);text-to-image(title,abstract);分类 cs.CV

AI总结 本文提出通过学习参数化相机令牌实现文本到图像生成中的精确相机控制,结合3D渲染图像和真实增强图像,提升生成图像的准确性和保真度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.13386 2026-03-17 cs.CV 88%

Layout-Guided Controllable Pathology Image Generation with In-Context Diffusion Transformers

基于布局的可控病理图像生成与上下文扩散变换器

Yuntao Shou, Xiangyong Cao, Qian Zhao, Deyu Meng

机构 * Xi'an Jiaotong University(西安交通大学)

专题命中 可控生成 :diffusion(title,abstract);image generation(title);image synthesis(abstract);分类 cs.CV

AI总结 本文提出基于布局的可控病理图像生成方法,通过多代理LVLM注释框架构建精细临床对齐的监督数据,提出IC-DiT模型整合空间布局、文本描述和视觉嵌入,实现高保真生成与强空间可控性。

Comments 19 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.23359 2026-02-27 cs.CV cs.AI 88%

SeeThrough3D: Occlusion Aware 3D Control in Text-to-Image Generation

SeeThrough3D: 3D布局生成中的遮挡感知控制

Vaibhav Agrawal, Rishubh Parihar, Pradhaan Bhat, Ravi Kiran Sarvadevabhatla, R. Venkatesh Babu

机构 * IIIT Hyderabad(IIIT海得拉尔) IISc Bengaluru(IISc班加罗尔)

专题命中 可控生成 :image generation(title,abstract);text-to-image(title,abstract);分类 cs.CV

AI总结 SeeThrough3D通过引入遮挡感知的3D场景表示和掩码自注意力机制,实现了对3D布局生成中遮挡关系的精确建模与控制。

Comments Project page: https://seethrough3d.github.io. Accepted at CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.15147 2026-02-10 cs.GR 88%

PBR-Inspired Controllable Diffusion for Image Generation

受PBR启发的可控扩散用于图像生成

Bowen Xue, Giuseppe Claudio Guarnera, Shuang Zhao, Zahra Montazeri

专题命中 可控生成 :image generation(title,abstract);diffusion(title);text-to-image(abstract);分类 cs.GR

AI总结 本研究提出了一种受PBR启发的可控扩散方法,通过生成G-buffer实现对图像生成中几何布局和材质属性的精细控制,通过用户研究验证了其在文本引导图像生成中的有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏