arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

图像生成

图像生成、文生图、图像编辑、扩散模型和可控生成。

共收录 4201 信号源:cs.CV, cs.GR, cs.MM

1. 可控生成 4201 篇

2509.01405 2025-09-03 cs.CV 77%

Neural Scene Designer: Self-Styled Semantic Image Manipulation

Jianman Lin, Tianshui Chen, Chunmei Qing, Zhijing Yang, Shuangping Huang, Yuheng Ren, Liang Lin

机构 * South China University of Technology(南方科技大学) Guangdong University of Technology(广东工业大学) Jimei University(集美大学) Xiamen Kunlu AI Research Institute(厦门鲲 lun AI 研究院) Sun Yat-sen University(中山大学)

专题命中 可控生成 :diffusion(abstract);image editing(abstract);inpainting(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.14440 2025-08-21 cs.CV 77%

MUSE: Multi-Subject Unified Synthesis via Explicit Layout Semantic Expansion

Fei Peng, Junqiang Wu, Yan Li, Tingting Gao, Di Zhang, Huiyuan Fu

机构 * Beijing University of Posts and Telecommunications(北京邮电大学) Kuaishou Technology(快手科技)

专题命中 可控生成 :text-to-image(abstract);diffusion(abstract);image synthesis(abstract);分类 cs.CV

Comments This paper is accepted by ICCV 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.16978 2025-08-08 cs.CV cs.AI 77%

PromptDresser: Improving the Quality and Controllability of Virtual Try-On via Generative Textual Prompt and Prompt-aware Mask

Jeongho Kim, Hoiyeong Jin, Sunghyun Park, Jaegul Choo

机构 * KAIST(韩国科学技术院)

专题命中 可控生成 :text-to-image(abstract);diffusion(abstract);inpainting(abstract);分类 cs.CV

Comments 20 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.08654 2025-07-30 cs.CV 77%

ZeroStereo: Zero-shot Stereo Matching from Single Images

Xianqi Wang, Hao Yang, Gangwei Xu, Junda Cheng, Min Lin, Yong Deng, Jinliang Zang, Yurui Chen, Xin Yang

机构 * Huazhong University of Science and Technology(华中科技大学) Autel Robotics(Autel机器人公司) Optics Valley Laboratory(光学谷实验室)

专题命中 可控生成 :image generation(abstract);diffusion(abstract);inpainting(abstract);分类 cs.CV

Comments Accepted to ICCV 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.15010 2025-07-01 cs.CV 77%

DepthART: Monocular Depth Estimation as Autoregressive Refinement Task

Bulat Gabdullin, Nina Konovalova, Nikolay Patakin, Dmitry Senushkin, Anton Konushin

机构 * AIRI HSE University(俄罗斯伏尔加格勒国立大学)

专题命中 可控生成 :text-to-image(abstract);diffusion(abstract);image synthesis(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.15563 2025-06-19 cs.CV 77%

Control and Realism: Best of Both Worlds in Layout-to-Image without Training

Bonan Li, Yinhan Hu, Songhua Liu, Xinchao Wang

机构 * University of Chinese Academy of Sciences, Beijing, China(中国科学院大学) National University of Singapore, Singapore(新加坡国立大学)

专题命中 可控生成 :image generation(abstract);text-to-image(abstract);diffusion(abstract);分类 cs.CV

Comments Accepted by ICML2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.09363 2025-06-12 cs.CV cs.AI cs.CR 77%

SAGE: Exploring the Boundaries of Unsafe Concept Domain with Semantic-Augment Erasing

Hongguang Zhu, Yunchao Wei, Mengyu Wang, Siyu Jiao, Yan Fang, Jiannan Huang, Yao Zhao

机构 * Faculty of Data Science, City University of Macau(澳门城市大学数据科学学院) Institute of Information Science, Beijing Jiaotong University(北京交通大学信息科学学院) Beijing Key Laboratory of Advanced Information Science and Network Technology(北京先进信息科学与网络技术重点实验室)

专题命中 可控生成 :image generation(abstract);text-to-image(abstract);diffusion(abstract);分类 cs.CV

Comments Under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.05501 2025-06-09 cs.CV 77%

FocusDiff: Advancing Fine-Grained Text-Image Alignment for Autoregressive Visual Generation through RL

Kaihang Pan, Wendong Bu, Yuruo Wu, Yang Wu, Kai Shen, Yunfei Li, Hang Zhao, Juncheng Li, Siliang Tang, Yueting Zhuang

机构 * Zhejiang University(浙江大学) Ant Group(蚂蚁集团)

专题命中 可控生成 :image generation(abstract);text-to-image(abstract);diffusion(abstract);分类 cs.CV

Comments 15 pages, 8 figures. Project Page: https://focusdiff.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.22523 2025-05-29 cs.CV 77%

PrismLayers: Open Data for High-Quality Multi-Layer Transparent Image Generative Models

Junwen Chen, Heyang Jiang, Yanbin Wang, Keming Wu, Ji Li, Chao Zhang, Keiji Yanai, Dong Chen, Yuhui Yuan

机构 * Microsoft Research Asia(微软亚洲研究院)

专题命中 可控生成 :image generation(abstract);text-to-image(abstract);diffusion(abstract);分类 cs.CV

Comments Homepage: https://prism-layers.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.19724 2025-04-29 cs.CV 77%

RepText: Rendering Visual Text via Replicating

Haofan Wang, Yujia Xu, Yimeng Li, Junchen Li, Chaowei Zhang, Jing Wang, Kejia Yang, Zhibo Chen

专题命中 可控生成 :image generation(abstract);text-to-image(abstract);diffusion(abstract);分类 cs.CV

Comments Technical Report. https://reptext.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.04185 2025-04-08 cs.CV 77%

SDEIT: Semantic-Driven Electrical Impedance Tomography

Dong Liu, Yuanchao Wu, Bowen Tong, Jiansong Deng

专题命中 可控生成 :image generation(abstract);text-to-image(abstract);diffusion(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2404.09227 2025-04-03 cs.CV 77%

DreamScape: 3D Scene Creation via Gaussian Splatting joint Correlation Modeling

Yueming Zhao, Xuening Yuan, Hongyu Yang, Di Huang

专题命中 可控生成 :image generation(abstract);text-to-image(abstract);diffusion(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2403.17064 2025-03-17 cs.CV cs.AI cs.LG 77%

Continuous, Subject-Specific Attribute Control in T2I Models by Identifying Semantic Directions

Stefan Andreas Baumann, Felix Krause, Michael Neumayr, Nick Stracke, Melvin Sevi, Vincent Tao Hu, Björn Ommer

专题命中 可控生成 :image generation(abstract);text-to-image(abstract);diffusion(abstract);分类 cs.CV

Comments CVPR 2025. Project page: https://compvis.github.io/attribute-control

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.04391 2025-02-10 cs.CV cs.AI 77%

Towards Fair and Robust Face Parsing for Generative AI: A Multi-Objective Approach

Sophia J. Abraham, Jonathan D. Hauenstein, Walter J. Scheirer

专题命中 可控生成 :image generation(abstract);diffusion(abstract);image synthesis(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2312.12635 2025-02-03 cs.CV 77%

RealCraft: Attention Control as A Tool for Zero-Shot Consistent Video Editing

Shutong Jin, Ruiyu Wang, Florian T. Pokorny

专题命中 可控生成 :text-to-image(abstract);diffusion(abstract);image editing(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.12173 2025-01-22 cs.CV 77%

ComposeAnyone: Controllable Layout-to-Human Generation with Decoupled Multimodal Conditions

Shiyue Zhang, Zheng Chong, Xi Lu, Wenqing Zhang, Haoxiang Li, Xujie Zhang, Jiehui Huang, Xiao Dong, Xiaodan Liang

专题命中 可控生成 :image generation(abstract);text-to-image(abstract);diffusion(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.11473 2025-01-06 cs.CV 77%

InvSeg: Test-Time Prompt Inversion for Semantic Segmentation

Jiayi Lin, Jiabo Huang, Jian Hu, Shaogang Gong

专题命中 可控生成 :image generation(abstract);text-to-image(abstract);diffusion(abstract);分类 cs.CV

Comments AAAI 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.09656 2024-12-16 cs.CV cs.AI 77%

From Noise to Nuance: Advances in Deep Generative Image Models

Benji Peng, Chia Xin Liang, Ziqian Bi, Ming Liu, Yichao Zhang, Tianyang Wang, Keyu Chen, Xinyuan Song, Pohsun Feng

专题命中 可控生成 :image generation(abstract);diffusion(abstract);image synthesis(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.00306 2024-12-03 cs.CV 77%

Refine-by-Align: Reference-Guided Artifacts Refinement through Semantic Alignment

Yizhi Song, Liu He, Zhifei Zhang, Soo Ye Kim, He Zhang, Wei Xiong, Zhe Lin, Brian Price, Scott Cohen, Jianming Zhang, Daniel Aliaga

专题命中 可控生成 :image generation(abstract);diffusion(abstract);image synthesis(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.00548 2024-11-04 cs.CV cs.AI cs.LG 77%

Generative AI-based Pipeline Architecture for Increasing Training Efficiency in Intelligent Weed Control Systems

Sourav Modak, Anthony Stein

专题命中 可控生成 :image generation(abstract);text-to-image(abstract);diffusion(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.10792 2024-10-15 cs.LG cs.CV stat.ML 77%

Semantic Image Inversion and Editing using Rectified Stochastic Differential Equations

Litu Rout, Yujia Chen, Nataniel Ruiz, Constantine Caramanis, Sanjay Shakkottai, Wen-Sheng Chu

专题命中 可控生成 :diffusion(abstract);image editing(abstract);image synthesis(abstract);分类 cs.CV

Comments Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.04439 2024-10-08 cs.CV cs.AI 77%

Empowering Backbone Models for Visual Text Generation with Input Granularity Control and Glyph-Aware Training

Wenbo Li, Guohao Li, Zhibin Lan, Xue Xu, Wanru Zhuang, Jiachen Liu, Xinyan Xiao, Jinsong Su

专题命中 可控生成 :image generation(abstract);text-to-image(abstract);diffusion(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.06183 2024-10-04 cs.CV 77%

EDADepth: Enhanced Data Augmentation for Monocular Depth Estimation

Nischal Khanal, Shivanand Venkanna Sheshappanavar

专题命中 可控生成 :text-to-image(abstract);diffusion(abstract);image synthesis(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.06937 2024-07-10 cs.CV 77%

HumanRefiner: Benchmarking Abnormal Human Generation and Refining with Coarse-to-fine Pose-Reversible Guidance

Guian Fang, Wenbiao Yan, Yuanfan Guo, Jianhua Han, Zutao Jiang, Hang Xu, Shengcai Liao, Xiaodan Liang

专题命中 可控生成 :image generation(abstract);text-to-image(abstract);diffusion(abstract);分类 cs.CV

Comments Accepted by ECCV2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.00272 2024-06-04 cs.CV 77%

Temporally Consistent Object Editing in Videos using Extended Attention

AmirHossein Zamani, Amir G. Aghdam, Tiberiu Popa, Eugene Belilovsky

专题命中 可控生成 :image generation(abstract);diffusion(abstract);inpainting(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2310.07697 2024-05-24 cs.CV 77%

ConditionVideo: Training-Free Condition-Guided Text-to-Video Generation

Bo Peng, Xinyuan Chen, Yaohui Wang, Chaochao Lu, Yu Qiao

专题命中 可控生成 :image generation(abstract);text-to-image(abstract);diffusion(abstract);分类 cs.CV

Comments AAAI 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2306.08707 2024-04-03 cs.CV 77%

VidEdit: Zero-Shot and Spatially Aware Text-Driven Video Editing

Paul Couairon, Clément Rambour, Jean-Emmanuel Haugeard, Nicolas Thome

专题命中 可控生成 :image generation(abstract);text-to-image(abstract);diffusion(abstract);分类 cs.CV

Comments TMLR 2024. Project web-page at https://videdit.github.io

详情

展开后加载摘要…

URL PDF HTML 收藏
2306.04607 2024-02-20 cs.CV cs.AI 77%

GeoDiffusion: Text-Prompted Geometric Control for Object Detection Data Generation

Kai Chen, Enze Xie, Zhe Chen, Yibo Wang, Lanqing Hong, Zhenguo Li, Dit-Yan Yeung

专题命中 可控生成 :image generation(abstract);text-to-image(abstract);diffusion(abstract);分类 cs.CV

Comments Accept by ICLR 2024. Project Page: https://kaichen1998.github.io/projects/geodiffusion/

详情

展开后加载摘要…

URL PDF HTML 收藏
2304.07410 2023-04-18 cs.CV cs.AI 77%

Text-Conditional Contextualized Avatars For Zero-Shot Personalization

Samaneh Azadi, Thomas Hayes, Akbar Shah, Guan Pang, Devi Parikh, Sonal Gupta

专题命中 可控生成 :image generation(abstract);text-to-image(abstract);diffusion(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2303.04761 2023-03-09 cs.CV 77%

Video-P2P: Video Editing with Cross-attention Control

Shaoteng Liu, Yuechen Zhang, Wenbo Li, Zhe Lin, Jiaya Jia

专题命中 可控生成 :image generation(abstract);diffusion(abstract);image editing(abstract);分类 cs.CV

Comments 10 pages, 9 figures. Project page: https://video-p2p.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏