arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

图像生成

图像生成、文生图、图像编辑、扩散模型和可控生成。

共收录 4200 信号源:cs.CV, cs.GR, cs.MM

1. 可控生成 4200 篇

2409.08260 2024-09-13 cs.CV cs.MM 86%

Improving Text-guided Object Inpainting with Semantic Pre-inpainting

Yifu Chen, Jingwen Chen, Yingwei Pan, Yehao Li, Ting Yao, Zhineng Chen, Tao Mei

专题命中 可控生成 :inpainting(title,abstract);text-to-image(abstract);diffusion(abstract);分类 cs.CV、cs.MM

Comments ECCV 2024. Source code is available at https://github.com/Nnn-s/CATdiffusion

详情

展开后加载摘要…

URL PDF HTML 收藏
2305.13840 2024-08-13 cs.CV cs.AI cs.LG cs.MM 86%

Control-A-Video: Controllable Text-to-Video Diffusion Models with Motion Prior and Reward Feedback Learning

Weifeng Chen, Yatai Ji, Jie Wu, Hefeng Wu, Pan Xie, Jiashi Li, Xin Xia, Xuefeng Xiao, Liang Lin

专题命中 可控生成 :diffusion(title,abstract);image generation(abstract);text-to-image(abstract);分类 cs.CV、cs.MM

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.06469 2024-07-10 cs.CV cs.GR 86%

Sketch-Guided Scene Image Generation

Tianyu Zhang, Xiaoxuan Xie, Xusheng Du, Haoran Xie

专题命中 可控生成 :image generation(title,abstract);text-to-image(abstract);diffusion(abstract);分类 cs.CV、cs.GR

Comments 12 pages, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2311.17024 2024-04-04 cs.CV cs.GR 86%

Diffusion 3D Features (Diff3F): Decorating Untextured Shapes with Distilled Semantic Features

Niladri Shekhar Dutt, Sanjeev Muralikrishnan, Niloy J. Mitra

专题命中 可控生成 :diffusion(title,abstract);image generation(abstract);image synthesis(abstract);分类 cs.CV、cs.GR

Comments Accepted at CVPR'24

详情

展开后加载摘要…

URL PDF HTML 收藏
2211.14305 2023-09-06 cs.CV cs.GR cs.LG 86%

SpaText: Spatio-Textual Representation for Controllable Image Generation

Omri Avrahami, Thomas Hayes, Oran Gafni, Sonal Gupta, Yaniv Taigman, Devi Parikh, Dani Lischinski, Ohad Fried, Xi Yin

专题命中 可控生成 :image generation(title,abstract);text-to-image(abstract);diffusion(abstract);分类 cs.CV、cs.GR

Comments CVPR 2023. Project page available at: https://omriavrahami.com/spatext

详情

展开后加载摘要…

URL PDF HTML 收藏
2307.13720 2023-07-27 cs.CV cs.AI cs.GR cs.HC 86%

Composite Diffusion | whole >= Σparts

Vikram Jamwal, Ramaneswaran S

专题命中 可控生成 :diffusion(title,abstract);image generation(abstract);text-to-image(abstract);分类 cs.CV、cs.GR

Comments 44 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.12829 2026-08-14 cs.CV 新提交 85%

Semantic Steering for Controllable Generation: Tuning-Free Concept Erasure in Multimodal Diffusion Transformers

语义引导用于可控生成:多模态扩散Transformer中的无调优概念擦除

Qiao Li, Xiaomeng Fu, Yuanshu Zhao, Qipeng Wang, Jiao Dai, Jizhong Han

机构 * Institute of Information Engineering, Chinese Academy of Sciences(中国科学院信息工程研究所) School of Cyber Security, University of Chinese Academy of Sciences(中国科学院大学网络空间安全学院)

专题命中 可控生成 :diffusion(title,abstract);image generation(abstract);text-to-image(abstract);分类 cs.CV

AI总结 该研究针对MM-DiTs的安全风险,提出一种无调优的概念擦除方法,通过在MM-DiT中间模块构建引导向量注入模型,实现高效鲁棒的概念擦除,性能优于现有方法。

Comments Accepted to ACM MM 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.00933 2026-08-04 cs.CV 版本更新 85%

EmoScene: A Dual-space Dataset for Controllable Affective Image Generation

EmoScene:用于可控情感图像生成的双空间数据集

Li He, Longtai Zhang, Wenqiang Zhang, Yan Wang, Lizhe Qi

机构 * Fudan University(复旦大学) East China Normal University(华东师范大学)

专题命中 可控生成 :image generation(title,abstract);text-to-image(abstract);diffusion(abstract);分类 cs.CV

AI总结 本文提出EmoScene数据集,通过双空间编码情感维度与感知属性,提升文本到图像模型对场景语义和情感调制的控制能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.31147 2026-07-01 cs.CV 新提交 85%

WaterGen: Decoupling Scene and Medium in Underwater Image Generation

WaterGen:水下图像生成中的场景与介质解耦

Jiayi Wu, Tianfu Wang, Tianyi Xiong, Dehao Yuan, Xiaomin Lin, Md Jahidul Islam, Cornelia Fermuller, Christopher Metzler, Yiannis Aloimonos

机构 * University of Maryland(马里兰大学) University of South Florida(南佛罗里达大学) University of Florida(佛罗里达大学)

专题命中 可控生成 :image generation(title,abstract);diffusion(abstract);image synthesis(abstract);分类 cs.CV

AI总结 提出WaterGen方法,通过解耦场景生成和介质建模,在潜在扩散框架下生成大规模、真实、多样的水下图像,提升下游恢复和分割性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.23178 2026-05-25 cs.CV 85%

Composing People Together: Iterative Pose-Image Generation for Multi-Person Interaction Scenes

将人物组合在一起:面向多人交互场景的迭代姿态-图像生成

Wenxuan Peng, Bharath Hariharan, Hadar Averbuch-Elor

机构 * Cornell University(康奈尔大学)

专题命中 可控生成 :image generation(title,abstract);text-to-image(abstract);diffusion(abstract);分类 cs.CV

AI总结 提出一种双姿态-图像表示方法,将人物结构先验引入预训练扩散Transformer,通过跨模态对齐和迭代场景构建,提升多人交互图像生成的提示对齐度和场景多样性。

Comments Accepted to SIGGRAPH Conference Papers 2026. 22 pages, 12 figures. Project page: https://cornell-vailab.github.io/PeopleComposer/

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.13863 2026-04-16 cs.CV 85%

PostureObjectstitch: Anomaly Image Generation Considering Assembly Relationships in Industrial Scenarios

姿态物体拼接:考虑装配关系的异常图像生成

Zebei Tong, Hongchang Chen, Yujie Lei, Gang Chen, Yushi Liu, Zhi Zheng, Hao Chen, Jieming Zhang, Ying Li, Dongpu Cao

机构 * Beijing Institute of Technology(北京理工大学) The Hong Kong Polytechnic University(香港理工大学) Tsinghua University(清华大学)

专题命中 可控生成 :image generation(title,abstract);diffusion(abstract);image synthesis(abstract);分类 cs.CV

AI总结 本文提出PostureObjectStitch方法,通过解耦多视角图像特征和引入条件损失与几何先验,实现工业场景中考虑装配关系的准确异常图像生成。

详情

展开后加载摘要…

URL PDF HTML 收藏
2405.06535 2026-04-08 cs.CV cs.LG 85%

Controllable Image Generation with Composed Parallel Token Prediction

通过组合并行令牌预测实现可控图像生成

Jamie Stirling, Noura Al-Moubayed, Chris G. Willcocks, Hubert P. H. Shum

机构 * Durham University(杜伦大学)

专题命中 可控生成 :image generation(title,abstract);text-to-image(abstract);diffusion(abstract);分类 cs.CV

AI总结 本文提出一种理论指导的离散生成过程组合方法,通过掩码生成(吸收扩散)实现多输入条件的精确组合,提升图像生成的可控性和效率。

Comments 8 pages + references, 7 figures, accepted to CVPR Workshops 2026 (LoViF)

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.03281 2026-03-12 cs.CV cs.LG 85%

CFG-Ctrl: Control-Based Classifier-Free Diffusion Guidance

CFG-Ctrl: 基于控制的分类器自由扩散引导

Hanyang Wang, Yiyang Liu, Jiawei Chi, Fangfu Liu, Ran Xue, Yueqi Duan

专题命中 可控生成 :diffusion(title,abstract);image generation(abstract);text-to-image(abstract);分类 cs.CV

AI总结 CFG-Ctrl通过引入滑模控制方法改进分类器自由扩散引导,提升语义对齐和鲁棒性。

Comments Accepted by CVPR 2026; Project Page: https://hanyang-21.github.io/CFG-Ctrl

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.10519 2026-03-12 cs.CV 85%

Visually-Guided Controllable Medical Image Generation via Fine-Grained Semantic Disentanglement

通过细粒度语义解耦实现视觉引导的可控医学图像生成

Xin Huang, Junjie Liang, Qingshan Hou, Peng Cao, Jinzhu Yang, Xiaoli Liu, Osmar R. Zaiane

机构 * Computer Science and Engineering, Northeastern University, Shenyang, China(东北大学计算机科学与工程系,中国沈阳) Key Laboratory of Intelligent Computing in Medical Image of Ministry of Education, Northeastern University, Shenyang, China(教育部医学图像智能计算重点实验室,东北大学,中国沈阳) National Frontiers Science Center for Industrial Intelligence and Systems Optimization, Shenyang, China(工业智能与系统优化国家级前沿科学中心,中国沈阳) AiShiWeiLai AI Research, China(艾世维来人工智能研究,中国) Amii, University of Alberta, Edmonton, Alberta, Canada(阿尔伯塔大学艾米人工智能研究所,加拿大埃德蒙顿,阿尔伯塔)

专题命中 可控生成 :image generation(title);text-to-image(abstract);diffusion(abstract);image synthesis(abstract)

AI总结 本文提出视觉引导的文本解耦框架,通过细粒度语义解耦提升医学图像生成的可控性和生成质量。

Comments 10 pages, 7 figures. Currently under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.09484 2026-03-11 cs.CV 85%

Component-Aware Sketch-to-Image Generation Using Self-Attention Encoding and Coordinate-Preserving Fusion

基于组件意识的草图到图像生成:使用自注意力编码和坐标保持融合

Ali Zia, Muhammad Umer Ramzan, Usman Ali, Muhammad Faheem, Abdelwahed Khamis, Shahnawaz Qureshi

专题命中 可控生成 :image generation(title,abstract);diffusion(abstract);image synthesis(abstract);分类 cs.CV

AI总结 本文提出了一种基于自注意力编码和坐标保持融合的组件意识框架,用于提升草图到图像生成的逼真度和一致性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.01991 2026-02-12 cs.CV 85%

Localized Control in Diffusion Models via Latent Vector Prediction

通过潜在向量预测实现扩散模型中的局部控制

Pablo Domingo-Gregorio, Javier Ruiz-Hidalgo

专题命中 可控生成 :diffusion(title,abstract);image generation(abstract);text-to-image(abstract);分类 cs.CV

AI总结 本文提出通过潜在向量预测实现扩散模型的局部控制,使模型能精准控制用户定义区域并自主生成剩余部分。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.06605 2026-01-13 cs.CV 85%

Sissi: Zero-shot Style-guided Image Synthesis via Semantic-style Integration

Sissi:通过语义-风格整合实现零样本风格引导图像合成

Yingying Deng, Xiangyu He, Fan Tang, Weiming Dong, Xucheng Yin

专题命中 可控生成 :image synthesis(title);image generation(abstract);diffusion(abstract);inpainting(abstract)

AI总结 Sissi通过语义-风格整合实现零样本风格引导图像合成,采用上下文学习框架提升风格化效果与语义一致性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.00075 2025-12-02 cs.CV eess.IV 85%

Adapter Shield: A Unified Framework with Built-in Authentication for Preventing Unauthorized Zero-Shot Image-to-Image Generation

Adapter Shield: 一种集成了认证机制的统一框架,用于防止未经授权的零样本图像到图像生成

Jun Jia, Hongyi Miao, Yingjie Zhou, Wangqiu Zhou, Jianbo Zhang, Linhan Cao, Dandan Zhu, Hua Yang, Xiongkuo Min, Wei Sun, Guangtao Zhai

机构 * Shanghai Jiao Tong University(上海交通大学) Shandong University(山东大学) Hefei University of Technology(合肥工业大学) East China Normal University(华东师范大学)

专题命中 可控生成 :image generation(title,abstract);diffusion(abstract);image synthesis(abstract);分类 cs.CV

AI总结 Adapter Shield通过集成认证机制的统一框架,防止未经授权的零样本图像生成,实现安全的图像访问控制。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.21691 2025-11-27 cs.CV 85%

Canvas-to-Image: Compositional Image Generation with Multimodal Controls

画布到图像:利用多模态控制的组合图像生成

Yusuf Dalva, Guocheng Gordon Qian, Maya Goldenberg, Tsai-Shien Chen, Kfir Aberman, Sergey Tulyakov, Pinar Yanardag, Kuan-Chieh Jackson Wang

机构 * Snap Inc. UC Merced(加州大学默塞德分校) Virginia Tech(弗吉尼亚理工大学)

专题命中 可控生成 :image generation(title,abstract);text-to-image(abstract);diffusion(abstract);分类 cs.CV

AI总结 Canvas-to-Image通过统一框架整合多模态控制,提升图像生成的组合性和控制精度。

Comments 24 pages; webpage: https://snap-research.github.io/canvas-to-image/

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.19268 2025-11-25 cs.CV 85%

BideDPO: Conditional Image Generation with Simultaneous Text and Condition Alignment

BideDPO:基于文本和条件对齐的同时图像生成

Dewei Zhou, Mingwei Li, Zongxin Yang, Yu Lu, Yunqiu Xu, Zhizhong Wang, Zeyi Huang, Yi Yang

机构 * Zhejiang University(浙江大学) Harvard University(哈佛大学) Huawei Technologies Ltd., China(华为技术有限公司)

专题命中 可控生成 :image generation(title,abstract);text-to-image(abstract);image synthesis(abstract);分类 cs.CV

AI总结 BideDPO通过双向解耦的DPO框架解决文本与条件间的冲突,提升图像生成的准确性和一致性。

Comments 29 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.04726 2025-11-25 cs.CV cs.AI 85%

Backdoors in Conditional Diffusion: Threats to Responsible Synthetic Data Pipelines

条件扩散中的后门:对负责任的合成数据管道的威胁

Raz Lapid, Almog Dubin

机构 * Raz Lapid Almog Dubin

专题命中 可控生成 :diffusion(title,abstract);image generation(abstract);text-to-image(abstract);分类 cs.CV

AI总结 本文提出了一种针对ControlNet的模型污染攻击,通过后门生成攻击者指定内容,并提出CFT方法作为防御措施。

Comments Accepted at RDS @ AAAI 2026

Journal ref AAAI 2026 Workshop on Shaping Responsible Synthetic Data in the Era of Foundation Models

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.07934 2025-11-12 cs.CV 85%

Laytrol: Preserving Pretrained Knowledge in Layout Control for Multimodal Diffusion Transformers

Sida Huang, Siqi Huang, Ping Luo, Hongyuan Zhang

专题命中 可控生成 :diffusion(title,abstract);image generation(abstract);text-to-image(abstract);分类 cs.CV

Comments Accepted by AAAI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.11468 2025-11-11 cs.CV 85%

PSDiffusion: Harmonized Multi-Layer Image Generation via Layout and Appearance Alignment

Dingbang Huang, Wenbo Li, Yifei Zhao, Xinyu Pan, Chun Wang, Yanhong Zeng, Bo Dai

机构 * Shanghai Jiao Tong University(上海交通大学) The Chinese University of Hong Kong(香港中文大学) Zhejiang University(浙江大学) Shanghai AI Laboratory(上海人工智能实验室) The University of Hong Kong(香港大学)

专题命中 可控生成 :image generation(title,abstract);text-to-image(abstract);diffusion(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.16691 2025-10-29 cs.CV 85%

InstanceAssemble: Layout-Aware Image Generation via Instance Assembling Attention

Qiang Xiang, Shuang Sun, Binglei Li, Dejia Song, Huaxia Li, Nemo Chen, Xu Tang, Yao Hu, Junping Zhang

专题命中 可控生成 :image generation(title,abstract);diffusion(abstract);image synthesis(abstract);分类 cs.CV

Comments Accepted in NeurIPS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.22851 2025-10-28 cs.CV cs.AI 85%

Semantic Surgery: Zero-Shot Concept Erasure in Diffusion Models

Lexiang Xiong, Chengyu Liu, Jingwen Ye, Yan Liu, Yuecong Xu

机构 * National University of Singapore(国立新加坡大学) Sichuan University(四川大学)

专题命中 可控生成 :diffusion(title,abstract);image generation(abstract);text-to-image(abstract);分类 cs.CV

Comments Accepted to the 39th Conference on Neural Information Processing Systems (NeurIPS 2025). Code is available at https://github.com/Lexiang-Xiong/Semantic-Surgery

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.21763 2025-10-28 cs.CV cs.AI 85%

Proportion and Perspective Control for Flow-Based Image Generation

Julien Boudier, Hugo Caselles-Dupré

机构 * Obvious Research(Obvious研究)

专题命中 可控生成 :image generation(title);text-to-image(abstract);diffusion(abstract);image synthesis(abstract)

Comments Technical report after open-source release

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.18083 2025-10-23 cs.CV 85%

Chimera: Compositional Image Generation using Part-based Concepting

Shivam Singh, Yiming Chen, Agneet Chatterjee, Amit Raj, James Hays, Yezhou Yang, Chitta Baral

机构 * Arizona State University(亚利桑那州立大学) Georgia Institute of Technology(佐治亚理工学院) Google Deepmind(谷歌DeepMind)

专题命中 可控生成 :image generation(title,abstract);text-to-image(abstract);diffusion(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.18092 2025-10-17 cs.CV 85%

ComposeMe: Attribute-Specific Image Prompts for Controllable Human Image Generation

Guocheng Gordon Qian, Daniil Ostashev, Egor Nemchinov, Avihay Assouline, Sergey Tulyakov, Kuan-Chieh Jackson Wang, Kfir Aberman

机构 * Snap Inc.

专题命中 可控生成 :image generation(title);text-to-image(abstract);diffusion(abstract);image synthesis(abstract)

Comments Accepted to SIGGRAPH Asia 2025, webpage: https://snap-research.github.io/composeme/

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.05173 2025-10-16 cs.CR cs.AI cs.CV 85%

SafeGuider: Robust and Practical Content Safety Control for Text-to-Image Models

Peigui Qi, Kunsheng Tang, Wenbo Zhou, Weiming Zhang, Nenghai Yu, Tianwei Zhang, Qing Guo, Jie Zhang

机构 * University of Science and Technology of China(中国科学技术大学) Nanyang Technological University(南洋理工大学)

专题命中 可控生成 :text-to-image(title,abstract);image generation(abstract);diffusion(abstract);分类 cs.CV

Comments Accepted by ACM CCS 2025, Code is available at [this https URL](https://github.com/pgqihere/safeguider)

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.23760 2025-09-30 cs.CV 85%

UniAlignment: Semantic Alignment for Unified Image Generation, Understanding, Manipulation and Perception

Xinyang Song, Libin Wang, Weining Wang, Shaozhen Liu, Dandan Zheng, Jingdong Chen, Qi Li, Zhenan Sun

机构 * Ant Group(蚂蚁集团)

专题命中 可控生成 :image generation(title,abstract);text-to-image(abstract);diffusion(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏