arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

图像生成

图像生成、文生图、图像编辑、扩散模型和可控生成。

共收录 4201 信号源:cs.CV, cs.GR, cs.MM

1. 可控生成 4201 篇

2512.08645 2025-12-10 cs.CV 83%

Chain-of-Image Generation: Toward Monitorable and Controllable Image Generation

图像生成链:迈向可监控和可控的图像生成

Young Kyung Kim, Oded Schlesinger, Yuzhou Zhao, J. Matias Di Martino, Guillermo Sapiro

机构 * Duke University(杜克大学) Princeton University(普林斯顿大学) Universidad Católica del Uruguay(乌拉圭天主教大学) Apple(苹果公司)

专题命中 可控生成 :image generation(title,abstract);text-to-image(abstract);分类 cs.CV

AI总结 CoIG框架通过将图像生成过程分解为可监控的步骤,提升图像生成的可控性和可解释性。

Comments 19 pages, 13 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.00596 2025-11-11 cs.CV 83%

Seg2Any: Open-set Segmentation-Mask-to-Image Generation with Precise Shape and Semantic Control

Danfeng Li, Hui Zhang, Sheng Wang, Jiacheng Li, Zuxuan Wu

机构 * Shanghai Key Lab of Intell. Info. Processing, School of CS, Fudan University(上海智能信息处理关键实验室,复旦大学计算机学院) Shanghai Collaborative Innovation Center of Intelligent Visual Computing(上海智能视觉计算协同创新中心) HiThink Research(HiThink研究机构)

专题命中 可控生成 :image generation(title);text-to-image(abstract);diffusion(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.04753 2025-11-10 cs.CV cs.AI cs.LG 83%

CPO: Condition Preference Optimization for Controllable Image Generation

Zonglin Lyu, Ming Li, Xinxin Liu, Chen Chen

机构 * Institute of Artificial Intelligence(人工智能研究院) University of Central Florida(中央佛罗里达大学)

专题命中 可控生成 :image generation(title,abstract);text-to-image(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.14975 2025-10-17 cs.CV cs.AI 83%

WithAnyone: Towards Controllable and ID Consistent Image Generation

Hengyuan Xu, Wei Cheng, Peng Xing, Yixiao Fang, Shuhan Wu, Rui Wang, Xianfang Zeng, Daxin Jiang, Gang Yu, Xingjun Ma, Yu-Gang Jiang

机构 * Fudan University(复旦大学) StepFun Project(StepFun项目) MultiID-2M MultiID-Bench

专题命中 可控生成 :image generation(title);text-to-image(abstract);diffusion(abstract);分类 cs.CV

Comments 23 Pages; Project Page: https://doby-xu.github.io/WithAnyone/; Code: https://github.com/Doby-Xu/WithAnyone

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.22720 2025-09-30 cs.CV cs.AI cs.LG 83%

LayoutAgent: A Vision-Language Agent Guided Compositional Diffusion for Spatial Layout Planning

Zezhong Fan, Xiaohan Li, Luyi Ma, Kai Zhao, Liang Peng, Topojoy Biswas, Evren Korpeoglu, Kaushiki Nag, Kannan Achan

机构 * Personalization Team, Walmart Global Tech(Walmart全球科技个性化团队)

专题命中 可控生成 :diffusion(title,abstract);image generation(abstract);分类 cs.CV

Comments NeurIPS 2025 Workshop on SPACE in Vision, Language, and Embodied AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.20524 2025-09-26 cs.CV cs.AI 83%

InstructVTON: Optimal Auto-Masking and Natural-Language-Guided Interactive Style Control for Inpainting-Based Virtual Try-On

Julien Han, Shuwen Qiu, Qi Li, Xingzi Xu, Mehmet Saygin Seyfioglu, Kavosh Asadi, Karim Bouyarmane

机构 * Amazon(亚马逊公司) University of California, Los Angeles (UCLA)(加州大学洛杉矶分校) Duke University(杜克大学)

专题命中 可控生成 :inpainting(title,abstract);image generation(abstract);分类 cs.CV

Comments Submitted to CVPR 2025 and Published at CVPR 2025 AI for Content Creation workshop

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.20083 2025-09-16 cs.CV 83%

KB-DMGen: Knowledge-Based Global Guidance and Dynamic Pose Masking for Human Image Generation

Shibang Liu, Xuemei Xie, Guangming Shi

机构 * Shibang Liu Xuemei Xie Guangming Shi

专题命中 可控生成 :image generation(title,abstract);diffusion(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.04126 2025-09-16 cs.CV cs.AI 83%

MEPG:Multi-Expert Planning and Generation for Compositionally-Rich Image Generation

Yuan Zhao, Lin Liu

专题命中 可控生成 :image generation(title);text-to-image(abstract);diffusion(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.22627 2025-09-05 cs.CV cs.AI 83%

LOTS of Fashion! Multi-Conditioning for Image Generation via Sketch-Text Pairing

Federico Girella, Davide Talon, Ziyue Liu, Zanxi Ruan, Yiming Wang, Marco Cristani

机构 * University of Verona(威尼斯大学) Fondazione Bruno Kessler(布鲁诺·凯斯勒基金会) Polytechnic Institute of Turin(都灵理工学院) University of Reykjavik(雷克雅未克大学)

专题命中 可控生成 :image generation(title,abstract);diffusion(abstract);分类 cs.CV

Comments Accepted at ICCV25 (Oral). Project page: https://intelligolabs.github.io/lots/

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.15313 2025-08-26 cs.CV 83%

FaceCrafter: Identity-Conditional Diffusion with Disentangled Control over Facial Pose, Expression, and Emotion

Kazuaki Mishima, Antoni Bigata Casademunt, Stavros Petridis, Maja Pantic, Kenji Suzuki

机构 * Institute of Science Tokyo(东京科学研究所) Imperial College London(伦敦帝国学院)

专题命中 可控生成 :diffusion(title,abstract);image generation(abstract);分类 cs.CV

Comments 9 pages(excluding references), 3 figures, 5 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.07647 2025-08-12 cs.CV 83%

LaRender: Training-Free Occlusion Control in Image Generation via Latent Rendering

Xiaohang Zhan, Dingming Liu

机构 * Tencent(腾讯)

专题命中 可控生成 :image generation(title,abstract);diffusion(abstract);分类 cs.CV

Comments Accepted by ICCV 2025 (oral). Project page: https://xiaohangzhan.github.io/projects/larender/

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.05236 2025-08-08 cs.CV 83%

ArbiViewGen: Controllable Arbitrary Viewpoint Camera Data Generation for Autonomous Driving via Stable Diffusion Models

Yatong Lan, Jingfeng Chen, Yiru Wang, Lei He

专题命中 可控生成 :diffusion(title,abstract);image generation(abstract);分类 cs.CV

Comments 11 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.23652 2025-08-01 cs.CV 83%

Adaptively Distilled ControlNet: Accelerated Training and Superior Sampling for Medical Image Synthesis

Kunpeng Qiu, Zhiying Zhou, Yongxin Guo

机构 * National University of Singapore(国立新加坡大学) National University of Singapore Suzhou Research Institute(国立新加坡大学苏州市研究 institute) City University of Hong Kong(香港城市大学)

专题命中 可控生成 :image synthesis(title);image generation(abstract);diffusion(abstract);分类 cs.CV

Comments Accepted by MICCAI2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.23620 2025-08-01 cs.CV cs.LG 83%

DivControl: Knowledge Diversion for Controllable Image Generation

Yucheng Xie, Fu Feng, Ruixiao Shi, Jing Wang, Yong Rui, Xin Geng

机构 * School of Computer Science and Engineering, Southeast University, Nanjing, China(东南大学计算机科学与工程学院) Key Laboratory of New Generation Artificial Intelligence Technology and Its Interdisciplinary Applications (Southeast University), Ministry of Education, China(新一代人工智能技术及其跨学科应用国家重点实验室(东南大学))

专题命中 可控生成 :image generation(title);text-to-image(abstract);diffusion(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.07157 2025-07-11 cs.CV cs.LG eess.SP 83%

Interpretable EEG-to-Image Generation with Semantic Prompts

Arshak Rezvani, Ali Akbari, Kosar Sanjar Arani, Maryam Mirian, Emad Arasteh, Martin J. McKeown

机构 * Pacific Parkinson’s Research Centre, Djavad Mowafaghian Centre for Brain Health, University of British Columbia, Vancouver, Canada(太平洋帕金森研究中心、Djavad Mowafaghian脑健康中心、不列颠哥伦比亚大学,温哥华,加拿大) Department of Electrical and Computer Engineering, University of Tehran, Tehran, Iran(电气与计算机工程系、伊朗德黑兰大学,德黑兰,伊朗) Department of Medicine British Columbia, Vancouver, Canada(医学系、不列颠哥伦比亚大学,温哥华,加拿大)

专题命中 可控生成 :image generation(title,abstract);diffusion(abstract);分类 cs.CV

Comments Actionable Interpretability Workshop (non-archival) at the 42 International Conference on Machine Learning

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.04451 2025-07-08 cs.CV 83%

CoT-lized Diffusion: Let's Reinforce T2I Generation Step-by-step

Zheyuan Liu, Munan Ning, Qihui Zhang, Shuo Yang, Zhongrui Wang, Yiwei Yang, Xianzhe Xu, Yibing Song, Weihua Chen, Fan Wang, Li Yuan

机构 * School of Electrical and Computer Engineering, Peking University(北京大学电子工程学院) Hupan Lab(鸿篇实验室) DAMO Academy, Alibaba Group(阿里云达摩院) Shanghai Jiao Tong University(上海交通大学)

专题命中 可控生成 :diffusion(title,abstract);text-to-image(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.07945 2025-07-02 cs.CV cs.LG 83%

SurGrID: Controllable Surgical Simulation via Scene Graph to Image Diffusion

Yannik Frisch, Ssharvien Kumar Sivakumar, Çağhan Köksal, Elsa Böhm, Felix Wagner, Adrian Gericke, Ghazal Ghazaei, Anirban Mukhopadhyay

机构 * TU Darmstadt(图宾根大学) TU Munich(慕尼黑工业大学) Carl Zeiss AG(蔡司股份公司) Universitätsmedizin Mainz(法兰克福大学医学中心)

专题命中 可控生成 :diffusion(title,abstract);image synthesis(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.21034 2025-06-30 cs.CV 83%

DidSee: Diffusion-Based Depth Completion for Material-Agnostic Robotic Perception and Manipulation

Wenzhou Lyu, Jialing Lin, Wenqi Ren, Ruihao Xia, Feng Qian, Yang Tang

机构 * East China University of Science and Technology(东华大学)

专题命中 可控生成 :diffusion(title,abstract);text-to-image(abstract);分类 cs.CV

Comments Project page: https://wenzhoulyu.github.io/DidSee/

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.21446 2025-06-27 cs.CV 83%

Controllable 3D Placement of Objects with Scene-Aware Diffusion Models

Mohamed Omran, Dimitris Kalatzis, Jens Petersen, Amirhossein Habibian, Auke Wiggers

机构 * Qualcomm AI Research(高通人工智能研究)

专题命中 可控生成 :diffusion(title);image editing(abstract);inpainting(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.12680 2025-06-18 cs.CV 83%

3D Hand Mesh-Guided AI-Generated Malformed Hand Refinement with Hand Pose Transformation via Diffusion Model

Chen-Bin Feng, Kangdao Liu, Jian Sun, Jiping Jin, Yiguo Jiang, Chi-Man Vong

机构 * Department of Computer and Information Science, University of Macau, Macau, China(计算机与信息科学系,澳门大学,澳门,中国) ShanghaiTech University, Shanghai, China(上海科技大学,上海,中国)

专题命中 可控生成 :diffusion(title,abstract);inpainting(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.24301 2025-06-02 cs.CV cs.HC 83%

Category-aware EEG image generation based on wavelet transform and contrast semantic loss

Enshang Zhang, Zhicheng Zhang, Takashi Hanakawa

机构 * Department of Integrated Neuroanatomy and Neuroimaging, Kyoto University Graduate School of Medicine(整合神经解剖与神经影像学系,京都大学医学研究院) JancsiLab, JancsiTech(Jancsi实验室,Jancsi科技) Sino-Finland Joint AI Laboratory for Child Health of Zhejiang Province(浙江省儿童健康中芬联合人工智能实验室)

专题命中 可控生成 :image generation(title,abstract);diffusion(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.12274 2025-05-20 cs.CV 83%

Context-Aware Autoregressive Models for Multi-Conditional Image Generation

Yixiao Chen, Zhiyuan Ma, Guoli Jia, Che Jiang, Jianjun Li, Bowen Zhou

机构 * Department of Computer Science and Technology, Tsinghua University(清华大学计算机科学与技术系) Department of Electronic Engineering, Tsinghua University(清华大学电子工程系) Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) School of Computer Science and Technology, Huazhong University of Science and Technology(华中科技大学计算机科学与技术学院)

专题命中 可控生成 :image generation(title,abstract);diffusion(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.00394 2025-04-02 cs.CV 83%

AP-CAP: Advancing High-Quality Data Synthesis for Animal Pose Estimation via a Controllable Image Generation Pipeline

Lei Wang, Yujie Zhong, Xiaopeng Sun, Jingchun Cheng, Chengjian Feng, Qiong Cao, Lin Ma, Zhaoxin Fan

专题命中 可控生成 :image generation(title,abstract);image synthesis(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.10127 2025-04-01 cs.CV 83%

PlanGen: Towards Unified Layout Planning and Image Generation in Auto-Regressive Vision Language Models

Runze He, Bo Cheng, Yuhang Ma, Qingxiang Jia, Shanyuan Liu, Ao Ma, Xiaoyu Wu, Liebucha Wu, Dawei Leng, Yuhui Yin

专题命中 可控生成 :image generation(title,abstract);diffusion(abstract);分类 cs.CV

Comments 15 pages, 12 figures, project page: https://360cvgroup.github.io/PlanGen

详情

展开后加载摘要…

URL PDF HTML 收藏
2403.17217 2025-03-26 cs.CV cs.AI 83%

DiffusionAct: Controllable Diffusion Autoencoder for One-shot Face Reenactment

Stella Bounareli, Christos Tzelepis, Vasileios Argyriou, Ioannis Patras, Georgios Tzimiropoulos

专题命中 可控生成 :diffusion(title,abstract);image generation(abstract);分类 cs.CV

Comments Project page: https://stelabou.github.io/diffusionact/

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.03150 2025-03-19 cs.CV 83%

Appearance Matching Adapter for Exemplar-based Semantic Image Synthesis in-the-Wild

Siyoon Jin, Jisu Nam, Jiyoung Kim, Dahyun Chung, Yeong-Seok Kim, Joonhyung Park, Heonjeong Chu, Seungryong Kim

专题命中 可控生成 :image synthesis(title,abstract);diffusion(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.18068 2025-03-17 cs.CV cs.AI 83%

PersonaCraft: Personalized and Controllable Full-Body Multi-Human Scene Generation Using Occlusion-Aware 3D-Conditioned Diffusion

Gwanghyun Kim, Suh Yoon Jeon, Seunggyu Lee, Se Young Chun

专题命中 可控生成 :diffusion(title,abstract);image synthesis(abstract);分类 cs.CV

Comments Project page: https://gwang-kim.github.io/persona_craft

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.07027 2025-03-11 cs.CV 83%

EasyControl: Adding Efficient and Flexible Control for Diffusion Transformer

Yuxuan Zhang, Yirui Yuan, Yiren Song, Haofan Wang, Jiaming Liu

专题命中 可控生成 :diffusion(title,abstract);image synthesis(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.06809 2025-03-11 eess.IV cs.CV 83%

Interactive Tumor Progression Modeling via Sketch-Based Image Editing

Gexin Huang, Ruinan Jin, Yucheng Tang, Can Zhao, Tatsuya Harada, Xiaoxiao Li, Gu Lin

专题命中 可控生成 :image editing(title,abstract);diffusion(abstract);分类 cs.CV

Comments 9 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.02705 2025-03-11 cs.CV 83%

ControlAR: Controllable Image Generation with Autoregressive Models

Zongming Li, Tianheng Cheng, Shoufa Chen, Peize Sun, Haocheng Shen, Longjin Ran, Xiaoxin Chen, Wenyu Liu, Xinggang Wang

专题命中 可控生成 :image generation(title,abstract);diffusion(abstract);分类 cs.CV

Comments To appear in ICLR 2025

详情

展开后加载摘要…

URL PDF HTML 收藏