arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

图像生成

图像生成、文生图、图像编辑、扩散模型和可控生成。

共收录 3474 信号源:cs.CV, cs.GR, cs.MM

1. 文生图 3474 篇

2506.23630 2025-07-01 cs.CV 89%

Blending Concepts with Text-to-Image Diffusion Models

Lorenzo Olearo, Giorgio Longari, Alessandro Raganato, Rafael Peñaloza, Simone Melzi

专题命中 文生图 :text-to-image(title,abstract);diffusion(title,abstract);image generation(abstract);分类 cs.CV

Comments Currently under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.15381 2025-06-19 cs.CV 89%

When Model Knowledge meets Diffusion Model: Diffusion-assisted Data-free Image Synthesis with Alignment of Domain and Class

Yujin Kim, Hyunsoo Kim, Hyunwoo J. Kim, Suhyun Kim

机构 * Korea University(韩国大学) Korea Advanced Institute of Science and Technology(韩国科学技术院) Kyung Hee University(庆熙大学) Korea Institute of Science(韩国科学研究院)

专题命中 文生图 :diffusion(title,abstract);image synthesis(title,abstract);text-to-image(abstract);分类 cs.CV

Comments Published at ICML 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.08210 2025-06-17 cs.CV cs.AI cs.CL cs.LG 89%

A Comprehensive Study of Decoder-Only LLMs for Text-to-Image Generation

Andrew Z. Wang, Songwei Ge, Tero Karras, Ming-Yu Liu, Yogesh Balaji

机构 * University of Maryland(马里兰大学) NVIDIA(英伟达)

专题命中 文生图 :image generation(title,abstract);text-to-image(title,abstract);diffusion(abstract);分类 cs.CV

Comments CVPR 2025

Journal ref Proceedings of the Computer Vision and Pattern Recognition Conference (CVPR), 2025, pp. 28575-28585

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.12579 2025-06-10 cs.CV 89%

CHATS: Combining Human-Aligned Optimization and Test-Time Sampling for Text-to-Image Generation

Minghao Fu, Guo-Hua Wang, Liangfu Cao, Qing-Guo Chen, Zhao Xu, Weihua Luo, Kaifu Zhang

机构 * National Key Laboratory for Novel Software Technology, Nanjing University(新型软件技术国家实验室,南京大学) School of Artificial Intelligence, Nanjing University(人工智能学院,南京大学) Alibaba Group(阿里巴巴集团)

专题命中 文生图 :image generation(title,abstract);text-to-image(title,abstract);diffusion(abstract);分类 cs.CV

Comments ICML 2025. The code is publicly available at https://github.com/AIDC-AI/CHATS

详情

展开后加载摘要…

URL PDF HTML 收藏
2404.16556 2025-06-03 cs.CV 89%

Conditional Distribution Modelling for Few-Shot Image Synthesis with Diffusion Models

Parul Gupta, Munawar Hayat, Abhinav Dhall, Thanh-Toan Do

机构 * Monash University(墨尔本大学) Flinders University(弗林德斯大学)

专题命中 文生图 :diffusion(title,abstract);image synthesis(title,abstract);image generation(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.24086 2025-06-02 cs.CV 89%

ComposeAnything: Composite Object Priors for Text-to-Image Generation

Zeeshan Khan, Shizhe Chen, Cordelia Schmid

机构 * Inria(法国国家信息与自动化技术研究院) École normale supérieure(巴黎高等师范学院) CNRS(法国国家科学研究中心) PSL Research University(巴黎综合理工研究院)

专题命中 文生图 :image generation(title,abstract);text-to-image(title,abstract);diffusion(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.21960 2025-05-29 cs.CV 89%

One-Way Ticket:Time-Independent Unified Encoder for Distilling Text-to-Image Diffusion Models

Senmao Li, Lei Wang, Kai Wang, Tao Liu, Jiehang Xie, Joost van de Weijer, Fahad Shahbaz Khan, Shiqi Yang, Yaxing Wang, Jian Yang

专题命中 文生图 :text-to-image(title,abstract);diffusion(title,abstract);image generation(abstract);分类 cs.CV

Comments Accepted at CVPR2025, Code: https://github.com/sen-mao/Loopfree

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.14254 2025-05-21 cs.CV 89%

Instructing Text-to-Image Diffusion Models via Classifier-Guided Semantic Optimization

Yuanyuan Chang, Yinghua Yao, Tao Qin, Mengmeng Wang, Ivor Tsang, Guang Dai

机构 * MOE Key Laboratory for Intelligent Networks and Network Security(信息网络与网络安全教育部重点实验室) Center for Frontier AI Research(前沿人工智能研究中心) Agency for Science, Technology and Research(科技研究局) Institute of High Performance Computing(高性能计算研究所) Zhejiang University of Technology(浙江工业大学) SGIT AI Lab(SGIT人工智能实验室)

专题命中 文生图 :text-to-image(title,abstract);diffusion(title,abstract);image generation(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.12606 2025-05-20 cs.CV 89%

Diff-MM: Exploring Pre-trained Text-to-Image Generation Model for Unified Multi-modal Object Tracking

Shiyu Xuan, Zechao Li, Jinhui Tang

机构 * School of Computer Science and Engineering, Nanjing University of Science and Technology(计算机科学与工程学院,南京理工大学)

专题命中 文生图 :image generation(title,abstract);text-to-image(title,abstract);diffusion(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.16902 2025-05-20 cs.CV cs.AI 89%

Culture-TRIP: Culturally-Aware Text-to-Image Generation with Iterative Prompt Refinement

Suchae Jeong, Inseong Choi, Youngsik Yun, Jihie Kim

机构 * Department of Computer Science and Engineering, Dongguk University(计算机科学与工程系,东国大学) Department of Computer Science and Artificial Intelligence, Dongguk University(计算机科学与人工智能系,东国大学)

专题命中 文生图 :image generation(title,abstract);text-to-image(title,abstract);diffusion(abstract);分类 cs.CV

Comments 31 pages, 23 figures, Accepted by NAACL 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2401.14066 2025-05-16 cs.CV cs.AI 89%

CreativeSynth: Cross-Art-Attention for Artistic Image Synthesis with Multimodal Diffusion

Nisha Huang, Weiming Dong, Yuxin Zhang, Fan Tang, Ronghui Li, Chongyang Ma, Xiu Li, Tong-Yee Lee, Changsheng Xu

机构 * Tsinghua Shenzhen International Graduate School, Tsinghua University(清华大学深圳国际研究生院) Pengcheng Laboratory(鹏城实验室) MAIS, Institute of Automation, Chinese Academy of Sciences(自动化所MAIS部) School of Artificial Intelligence, University of Chinese Academy of Sciences(中国科学院大学人工智能学院) University of Chinese Academy of Sciences(中国科学院大学) ByteDance Inc.(字节跳动公司) National Cheng Kung University(国立成功大学)

专题命中 文生图 :diffusion(title,abstract);image synthesis(title);image generation(abstract);text-to-image(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.05573 2025-05-13 cs.CV cs.AI 89%

Prompt to Polyp: Medical Text-Conditioned Image Synthesis with Diffusion Models

Mikhail Chaichuk, Sushant Gautam, Steven Hicks, Elena Tutubalina

机构 * AIRI HSE University(俄罗斯高等经济大学) Simula Metropolitan Center for Digital Engineering(Simula 数字工程研究中心) Oslo Metropolitan University(奥斯陆 Metropolitan 大学) Kazan Federal University(卡扎ン联邦大学)

专题命中 文生图 :diffusion(title,abstract);image synthesis(title,abstract);text-to-image(abstract);分类 cs.CV

Comments code available at https://github.com/THunderCondOR/ImageCLEFmed-MEDVQA-GI-2024-MMCP-Team

详情

展开后加载摘要…

URL PDF HTML 收藏
2408.02657 2025-04-25 cs.CV 89%

Lumina-mGPT: Illuminate Flexible Photorealistic Text-to-Image Generation with Multimodal Generative Pretraining

Dongyang Liu, Shitian Zhao, Le Zhuo, Weifeng Lin, Yi Xin, Xinyue Li, Qi Qin, Yu Qiao, Hongsheng Li, Peng Gao

专题命中 文生图 :image generation(title,abstract);text-to-image(title,abstract);diffusion(abstract);分类 cs.CV

Comments Code available at: https://github.com/Alpha-VLLM/Lumina-mGPT

详情

展开后加载摘要…

URL PDF HTML 收藏
2403.08857 2025-04-21 cs.CV 89%

DialogGen: Multi-modal Interactive Dialogue System for Multi-turn Text-to-Image Generation

Minbin Huang, Yanxin Long, Xinchi Deng, Ruihang Chu, Jiangfeng Xiong, Xiaodan Liang, Hong Cheng, Qinglin Lu, Wei Liu

专题命中 文生图 :image generation(title,abstract);text-to-image(title,abstract);image editing(abstract);分类 cs.CV

Comments Project page: https://hunyuan-dialoggen.github.io/. Accepted to NAACL2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.13061 2025-04-18 cs.CV cs.CR cs.LG 89%

ArtistAuditor: Auditing Artist Style Pirate in Text-to-Image Generation Models

Linkang Du, Zheng Zhu, Min Chen, Zhou Su, Shouling Ji, Peng Cheng, Jiming Chen, Zhikun Zhang

专题命中 文生图 :image generation(title,abstract);text-to-image(title,abstract);diffusion(abstract);分类 cs.CV

Comments To appear in the ACM Web Conference 2025, Sydney, Australia

详情

展开后加载摘要…

URL PDF HTML 收藏
2403.19653 2025-04-18 cs.CV 89%

Detecting Origin Attribution for Text-to-Image Diffusion Models

Katherine Xu, Lingzhi Zhang, Jianbo Shi

专题命中 文生图 :text-to-image(title,abstract);diffusion(title,abstract);image generation(abstract);分类 cs.CV

Comments Code available at https://github.com/k8xu/ImageAttribution

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.22168 2025-03-31 cs.CV 89%

Spatial Transport Optimization by Repositioning Attention Map for Training-Free Text-to-Image Synthesis

Woojung Han, Yeonkyung Lee, Chanyoung Kim, Kwanghyun Park, Seong Jae Hwang

专题命中 文生图 :text-to-image(title,abstract);image synthesis(title);image generation(abstract);diffusion(abstract)

Comments CVPR2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.19897 2025-03-26 cs.CV 89%

Scaling Down Text Encoders of Text-to-Image Diffusion Models

Lifu Wang, Daqing Liu, Xinchen Liu, Xiaodong He

专题命中 文生图 :text-to-image(title,abstract);diffusion(title,abstract);image generation(abstract);分类 cs.CV

Comments accepted by CVPR 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.22775 2025-03-24 cs.CV 89%

Diffusion Beats Autoregressive: An Evaluation of Compositional Generation in Text-to-Image Models

Arash Marioriyad, Parham Rezaei, Mahdieh Soleymani Baghshah, Mohammad Hossein Rohban

专题命中 文生图 :text-to-image(title,abstract);diffusion(title,abstract);image generation(abstract);分类 cs.CV

Comments NeurIPS 2024 Workshop on Compositional Learning: Perspectives, Methods, and Paths Forward

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.01819 2025-03-21 cs.CV 89%

Switti: Designing Scale-Wise Transformers for Text-to-Image Synthesis

Anton Voronov, Denis Kuznedelev, Mikhail Khoroshikh, Valentin Khrulkov, Dmitry Baranchuk

专题命中 文生图 :text-to-image(title,abstract);image synthesis(title);image generation(abstract);diffusion(abstract)

Comments CVPR 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.18810 2025-03-21 cs.CV cs.LG 89%

All Seeds Are Not Equal: Enhancing Compositional Text-to-Image Generation with Reliable Random Seeds

Shuangqi Li, Hieu Le, Jingyi Xu, Mathieu Salzmann

专题命中 文生图 :image generation(title,abstract);text-to-image(title,abstract);diffusion(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.08261 2025-03-14 cs.CV 89%

Meissonic: Revitalizing Masked Generative Transformers for Efficient High-Resolution Text-to-Image Synthesis

Jinbin Bai, Tian Ye, Wei Chow, Enxin Song, Xiangtai Li, Zhen Dong, Lei Zhu, Shuicheng Yan

专题命中 文生图 :text-to-image(title,abstract);image synthesis(title,abstract);diffusion(abstract);分类 cs.CV

Comments Accepted to ICLR 2025. Codes and Supplementary Material: https://github.com/viiika/Meissonic

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.21151 2025-03-12 cs.CV 89%

A Review on Generative AI For Text-To-Image and Image-To-Image Generation and Implications To Scientific Images

Zineb Sordo, Eric Chagnon, Daniela Ushizima

专题命中 文生图 :image generation(title,abstract);text-to-image(title,abstract);diffusion(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2306.17567 2025-03-06 cs.CV 89%

Counting Guidance for High Fidelity Text-to-Image Synthesis

Wonjun Kang, Kevin Galim, Hyung Il Koo, Nam Ik Cho

专题命中 文生图 :text-to-image(title,abstract);image synthesis(title);image generation(abstract);diffusion(abstract)

Comments Accepted at WACV 2025 (Oral). Code is available at https://github.com/furiosa-ai/counting-guidance

详情

展开后加载摘要…

URL PDF HTML 收藏
2403.05846 2025-03-04 cs.CV cs.CL 89%

Diffusion Lens: Interpreting Text Encoders in Text-to-Image Pipelines

Michael Toker, Hadas Orgad, Mor Ventura, Dana Arad, Yonatan Belinkov

专题命中 文生图 :text-to-image(title,abstract);diffusion(title,abstract);image generation(abstract);分类 cs.CV

Comments Published in: ACL 2024 Project webpage: tokeron.github.io/DiffusionLensWeb

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.18302 2025-02-26 cs.CV 89%

LDGen: Enhancing Text-to-Image Synthesis via Large Language Model-Driven Language Representation

Pengzhi Li, Pengfei Yu, Zide Liu, Wei He, Xuhao Pan, Xudong Rao, Tao Wei, Wei Chen

专题命中 文生图 :text-to-image(title,abstract);image synthesis(title);image generation(abstract);diffusion(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.11477 2025-02-18 cs.CV 89%

Learning to Sample Effective and Diverse Prompts for Text-to-Image Generation

Taeyoung Yun, Dinghuai Zhang, Jinkyoo Park, Ling Pan

专题命中 文生图 :image generation(title,abstract);text-to-image(title,abstract);diffusion(abstract);分类 cs.CV

Comments 18 pages, 14 figures, 6 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.12042 2025-02-12 cs.CV cs.LG 89%

Not All Prompts Are Made Equal: Prompt-based Pruning of Text-to-Image Diffusion Models

Alireza Ganjdanesh, Reza Shirkavand, Shangqian Gao, Heng Huang

专题命中 文生图 :text-to-image(title,abstract);diffusion(title,abstract);image generation(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.13554 2025-02-06 cs.CV cs.AI cs.LG 89%

One-Prompt-One-Story: Free-Lunch Consistent Text-to-Image Generation Using a Single Prompt

Tao Liu, Kai Wang, Senmao Li, Joost van de Weijer, Fahad Shahbaz Khan, Shiqi Yang, Yaxing Wang, Jian Yang, Ming-Ming Cheng

专题命中 文生图 :image generation(title,abstract);text-to-image(title,abstract);diffusion(abstract);分类 cs.CV

Comments 28 pages, 22 figures, ICLR2025 conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.07171 2025-02-06 cs.CV 89%

IterComp: Iterative Composition-Aware Feedback Learning from Model Gallery for Text-to-Image Generation

Xinchen Zhang, Ling Yang, Guohao Li, Yaqi Cai, Jiake Xie, Yong Tang, Yujiu Yang, Mengdi Wang, Bin Cui

专题命中 文生图 :image generation(title,abstract);text-to-image(title,abstract);diffusion(abstract);分类 cs.CV

Comments ICLR 2025. Project: https://github.com/YangLing0818/IterComp

详情

展开后加载摘要…

URL PDF HTML 收藏