arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

图像生成

图像生成、文生图、图像编辑、扩散模型和可控生成。

共收录 4200 信号源:cs.CV, cs.GR, cs.MM

1. 可控生成 4200 篇

2410.12669 2025-12-03 cs.CV 88%

3DIS: Depth-Driven Decoupled Instance Synthesis for Text-to-Image Generation

3DIS: 基于深度的解耦实例合成用于文本到图像生成

Dewei Zhou, Ji Xie, Zongxin Yang, Yi Yang

机构 * CCAI, Zhejiang University(中国浙江大学计算机辅助智能学院)

专题命中 可控生成 :image generation(title,abstract);text-to-image(title,abstract);分类 cs.CV

AI总结 3DIS提出了一种基于深度的解耦实例合成方法,通过分阶段生成场景深度图和渲染细粒度属性,提升文本到图像生成中多实例的布局精度和属性渲染效果。

Comments 10 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.21775 2025-12-02 cs.CV cs.AI eess.IV 88%

Face-MakeUpV2: Facial Consistency Learning for Controllable Text-to-Image Generation

Face-MakeUpV2:面向可控文本到图像生成的面部一致性学习

Dawei Dai, Yinxiu Zhou, Chenghang Li, Guolai Jiang, Chengfang Zhang

专题命中 可控生成 :image generation(title,abstract);text-to-image(title,abstract);分类 cs.CV

AI总结 Face-MakeUpV2通过引入3D面部渲染和全局面部特征通道,解决文本到图像生成中的面部属性泄露和物理一致性问题,实现更可控的面部生成。

Comments Some errors in the critical data presented in Table 1 and Table 2

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.07129 2025-10-09 cs.CV cs.AI 88%

Graph Conditioned Diffusion for Controllable Histopathology Image Generation

Sarah Cechnicka, Matthew Baugh, Weitong Zhang, Mischa Dombrowski, Zhe Li, Johannes C. Paetzold, Candice Roufosse, Bernhard Kainz

机构 * Department of Computing, Imperial College London, UK(帝国理工学院计算系) Weill Cornell Medicine, NY, USA(韦尔·科恩医学中心) Cornell Tech, NY, USA(康奈尔科技) Centre for Inflammatory Disease, Imperial College London, London, UK(帝国理工学院炎症疾病研究中心)

专题命中 可控生成 :diffusion(title,abstract);image generation(title);image synthesis(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.15204 2025-08-14 eess.IV cs.CV 88%

Lung-DDPM: Semantic Layout-guided Diffusion Models for Thoracic CT Image Synthesis

Yifan Jiang, Yannick Lemaréchal, Sophie Plante, Josée Bafaro, Jessica Abi-Rjeile, Philippe Joubert, Philippe Després, Venkata Manem

机构 * Centre de recherche du CHU de Québec-Université Laval(魁北克大学拉瓦尔医院研究中心) Centre de recherche de l’Institut universitaire de cardiologie et de pneumologie de Québec-Université Laval(魁北克大学拉瓦尔心血管与呼吸病学研究所)

专题命中 可控生成 :diffusion(title,abstract);image synthesis(title,abstract);分类 cs.CV

Comments Accepted by IEEE Transactions on Biomedical Engineering (TBME)

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.19939 2025-07-29 cs.CV 88%

LLMControl: Grounded Control of Text-to-Image Diffusion-based Synthesis with Multimodal LLMs

Jiaze Wang, Rui Chen, Haowang Cui

机构 * Tianjin University(天津大学)

专题命中 可控生成 :text-to-image(title,abstract);diffusion(title,abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.20983 2025-06-27 cs.CV 88%

Rethink Sparse Signals for Pose-guided Text-to-image Generation

Wenjie Xuan, Jing Zhang, Juhua Liu, Bo Du, Dacheng Tao

机构 * Wuhan University(武汉大学) Nanyang Technological University(南洋理工大学)

专题命中 可控生成 :image generation(title,abstract);text-to-image(title,abstract);分类 cs.CV

Comments accepted by ICCV 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.06826 2025-06-10 cs.CV cs.AI 88%

Controllable Coupled Image Generation via Diffusion Models

Chenfei Yuan, Nanshan Jia, Hangqi Li, Peter W. Glynn, Zeyu Zheng

机构 * UC Berkeley IEOR and BAIR(伯克利大学工业工程与运营研究系和BAIR)

专题命中 可控生成 :image generation(title,abstract);diffusion(title);text-to-image(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.06752 2025-04-11 cs.CV 88%

Compass Control: Multi Object Orientation Control for Text-to-Image Generation

Rishubh Parihar, Vaibhav Agrawal, Sachidanand VS, R. Venkatesh Babu

专题命中 可控生成 :text-to-image(title,abstract);image generation(title);diffusion(abstract);分类 cs.CV

Comments CVPR 2025 Camera Ready. Project page: https://rishubhpar.github.io/compasscontrol

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.12213 2025-03-18 cs.CV 88%

STAY Diffusion: Styled Layout Diffusion Model for Diverse Layout-to-Image Generation

Ruyu Wang, Xuefeng Hou, Sabrina Schmedding, Marco F. Huber

专题命中 可控生成 :image generation(title,abstract);diffusion(title,abstract);分类 cs.CV

Comments Accepted by WACV2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.07556 2025-02-12 cs.HC cs.CV 88%

SketchFlex: Facilitating Spatial-Semantic Coherence in Text-to-Image Generation with Region-Based Sketches

Haichuan Lin, Yilin Ye, Jiazhi Xia, Wei Zeng

专题命中 可控生成 :image generation(title,abstract);text-to-image(title,abstract);分类 cs.CV

Comments conference: CHI2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2311.18435 2024-12-02 cs.CV 88%

Layered Rendering Diffusion Model for Controllable Zero-Shot Image Synthesis

Zipeng Qi, Guoxi Huang, Chenyang Liu, Fei Ye

专题命中 可控生成 :diffusion(title,abstract);image synthesis(title,abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.04724 2024-11-08 cs.CV 88%

Controlling Human Shape and Pose in Text-to-Image Diffusion Models via Domain Adaptation

Benito Buchheim, Max Reimann, Jürgen Döllner

专题命中 可控生成 :text-to-image(title,abstract);diffusion(title,abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.08240 2024-11-07 cs.CV cs.AI 88%

IFAdapter: Instance Feature Control for Grounded Text-to-Image Generation

Yinwei Wu, Xianpan Zhou, Bing Ma, Xuefeng Su, Kai Ma, Xinchao Wang

专题命中 可控生成 :text-to-image(title,abstract);image generation(title);diffusion(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.21708 2024-10-30 cs.CV 88%

Unsupervised Modality Adaptation with Text-to-Image Diffusion Models for Semantic Segmentation

Ruihao Xia, Yu Liang, Peng-Tao Jiang, Hao Zhang, Bo Li, Yang Tang, Pan Zhou

专题命中 可控生成 :text-to-image(title,abstract);diffusion(title,abstract);分类 cs.CV

Comments NeurIPS 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.21638 2024-10-30 cs.CV 88%

Adapting Diffusion Models for Improved Prompt Compliance and Controllable Image Synthesis

Deepak Sridhar, Abhishek Peri, Rohith Rachala, Nuno Vasconcelos

专题命中 可控生成 :diffusion(title,abstract);image synthesis(title,abstract);分类 cs.CV

Comments Accepted to NeurIPS 2024 conference. Project Page: https://deepaksridhar.github.io/factorgraphdiffusion.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.14324 2024-10-21 cs.CV 88%

HiCo: Hierarchical Controllable Diffusion Model for Layout-to-image Generation

Bo Cheng, Yuhang Ma, Liebucha Wu, Shanyuan Liu, Ao Ma, Xiaoyu Wu, Dawei Leng, Yuhui Yin

专题命中 可控生成 :image generation(title,abstract);diffusion(title,abstract);分类 cs.CV

Comments NeurIPS2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2403.11614 2024-09-04 cs.CV 88%

CRS-Diff: Controllable Remote Sensing Image Generation with Diffusion Model

Datao Tang, Xiangyong Cao, Xingsong Hou, Zhongyuan Jiang, Junmin Liu, Deyu Meng

专题命中 可控生成 :image generation(title,abstract);diffusion(title,abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2408.14819 2024-08-28 cs.CV 88%

Build-A-Scene: Interactive 3D Layout Control for Diffusion-Based Image Generation

Abdelrahman Eldesokey, Peter Wonka

专题命中 可控生成 :diffusion(title,abstract);image generation(title);text-to-image(abstract);分类 cs.CV

Comments Project Page: https://abdo-eldesokey.github.io/build-a-scene/

详情

展开后加载摘要…

URL PDF HTML 收藏
2408.05083 2024-08-12 cs.CV 88%

PreciseControl: Enhancing Text-To-Image Diffusion Models with Fine-Grained Attribute Control

Rishubh Parihar, Sachidanand VS, Sabariswaran Mani, Tejan Karmali, R. Venkatesh Babu

专题命中 可控生成 :text-to-image(title,abstract);diffusion(title,abstract);分类 cs.CV

Comments ECCV 2024, Project page: https://rishubhpar.github.io/PreciseControl.home/

详情

展开后加载摘要…

URL PDF HTML 收藏
2312.06193 2024-07-25 cs.CV 88%

DisControlFace: Adding Disentangled Control to Diffusion Autoencoder for One-shot Explicit Facial Image Editing

Haozhe Jia, Yan Li, Hengfei Cui, Di Xu, Yuwang Wang, Tao Yu

专题命中 可控生成 :diffusion(title,abstract);image editing(title,abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2304.06671 2024-07-23 cs.CV cs.AI cs.CL cs.LG 88%

Diagnostic Benchmark and Iterative Inpainting for Layout-Guided Image Generation

Jaemin Cho, Linjie Li, Zhengyuan Yang, Zhe Gan, Lijuan Wang, Mohit Bansal

专题命中 可控生成 :image generation(title,abstract);inpainting(title,abstract);分类 cs.CV

Comments CVPR 2024 Workshop; Project website: https://layoutbench.github.io

详情

展开后加载摘要…

URL PDF HTML 收藏
2405.04834 2024-05-24 cs.CV 88%

FlexEControl: Flexible and Efficient Multimodal Control for Text-to-Image Generation

Xuehai He, Jian Zheng, Jacob Zhiyuan Fang, Robinson Piramuthu, Mohit Bansal, Vicente Ordonez, Gunnar A Sigurdsson, Nanyun Peng, Xin Eric Wang

专题命中 可控生成 :text-to-image(title,abstract);image generation(title);diffusion(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2404.11949 2024-04-19 cs.CV cs.AI cs.LG 88%

Sketch-guided Image Inpainting with Partial Discrete Diffusion Process

Nakul Sharma, Aditay Tripathi, Anirban Chakraborty, Anand Mishra

专题命中 可控生成 :diffusion(title,abstract);inpainting(title,abstract);分类 cs.CV

Comments Accepted to NTIRE Workshop @ CVPR 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2308.10156 2024-03-14 cs.CV cs.AI 88%

SSMG: Spatial-Semantic Map Guided Diffusion Model for Free-form Layout-to-Image Generation

Chengyou Jia, Minnan Luo, Zhuohang Dang, Guang Dai, Xiaojun Chang, Mengmeng Wang, Jingdong Wang

专题命中 可控生成 :diffusion(title,abstract);image generation(title);text-to-image(abstract);分类 cs.CV

Comments Accepted to AAAI 2024

Journal ref 38th AAAI Conference on Artificial Intelligence (AAAI2024), Vancouver, BC, Canada, 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2312.07536 2023-12-13 cs.CV 88%

FreeControl: Training-Free Spatial Control of Any Text-to-Image Diffusion Model with Any Condition

Sicheng Mo, Fangzhou Mu, Kuan Heng Lin, Yanli Liu, Bochen Guan, Yin Li, Bolei Zhou

专题命中 可控生成 :text-to-image(title,abstract);diffusion(title,abstract);分类 cs.CV

Comments Project Page: https://genforce.github.io/freecontrol/

详情

展开后加载摘要…

URL PDF HTML 收藏
2306.14636 2023-06-27 cs.CV 88%

Localized Text-to-Image Generation for Free via Cross Attention Control

Yutong He, Ruslan Salakhutdinov, J. Zico Kolter

专题命中 可控生成 :image generation(title,abstract);text-to-image(title,abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2304.01900 2023-04-05 cs.CV cs.AI 88%

PODIA-3D: Domain Adaptation of 3D Generative Model Across Large Domain Gap Using Pose-Preserved Text-to-Image Diffusion

Gwanghyun Kim, Ji Ha Jang, Se Young Chun

专题命中 可控生成 :text-to-image(title,abstract);diffusion(title,abstract);分类 cs.CV

Comments Project page: https://gwang-kim.github.io/podia_3d/

详情

展开后加载摘要…

URL PDF HTML 收藏
2303.02737 2023-03-07 cs.CV 88%

SePaint: Semantic Map Inpainting via Multinomial Diffusion

Zheng Chen, Deepak Duggirala, David Crandall, Lei Jiang, Lantao Liu

专题命中 可控生成 :diffusion(title,abstract);inpainting(title,abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2302.08908 2023-02-20 cs.CV 88%

LayoutDiffuse: Adapting Foundational Diffusion Models for Layout-to-Image Generation

Jiaxin Cheng, Xiao Liang, Xingjian Shi, Tong He, Tianjun Xiao, Mu Li

专题命中 可控生成 :image generation(title,abstract);diffusion(title,abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2211.06235 2022-11-14 cs.CV 88%

HumanDiffusion: a Coarse-to-Fine Alignment Diffusion Framework for Controllable Text-Driven Person Image Generation

Kaiduo Zhang, Muyi Sun, Jianxin Sun, Binghao Zhao, Kunbo Zhang, Zhenan Sun, Tieniu Tan

专题命中 可控生成 :image generation(title,abstract);diffusion(title,abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏