arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

图像生成

图像生成、文生图、图像编辑、扩散模型和可控生成。

共收录 86350 信号源:cs.CV, cs.GR, cs.MM

1. 文生图 3474 篇

2407.06642 2024-07-19 cs.CV 89%

Powerful and Flexible: Personalized Text-to-Image Generation via Reinforcement Learning

Fanyue Wei, Wei Zeng, Zhenyang Li, Dawei Yin, Lixin Duan, Wen Li

专题命中 文生图 :image generation(title,abstract);text-to-image(title,abstract);diffusion(abstract);分类 cs.CV

Comments Accepted by ECCV 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2404.05256 2024-07-18 cs.CV cs.AI 89%

StyleForge: Enhancing Text-to-Image Synthesis for Any Artistic Styles with Dual Binding

Junseo Park, Beomseok Ko, Hyeryung Jang

专题命中 文生图 :text-to-image(title,abstract);image synthesis(title,abstract);diffusion(abstract);分类 cs.CV

Comments 20 pages, 12 figuers

详情

展开后加载摘要…

URL PDF HTML 收藏
2405.14224 2024-07-11 cs.CV 89%

DiM: Diffusion Mamba for Efficient High-Resolution Image Synthesis

Yao Teng, Yue Wu, Han Shi, Xuefei Ning, Guohao Dai, Yu Wang, Zhenguo Li, Xihui Liu

专题命中 文生图 :diffusion(title,abstract);image synthesis(title,abstract);image generation(abstract);分类 cs.CV

Comments The code of our work is available here: {\url{https://github.com/tyshiwo1/DiM-DiffusionMamba/}}

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.04842 2024-07-09 cs.CV cs.CL cs.LG 89%

MJ-Bench: Is Your Multimodal Reward Model Really a Good Judge for Text-to-Image Generation?

Zhaorun Chen, Yichao Du, Zichen Wen, Yiyang Zhou, Chenhang Cui, Zhenzhen Weng, Haoqin Tu, Chaoqi Wang, Zhengwei Tong, Qinglan Huang, Canyu Chen, Qinghao Ye, Zhihong Zhu, Yuqing Zhang, Jiawei Zhou, Zhuokai Zhao, Rafael Rafailov, Chelsea Finn, Huaxiu Yao

专题命中 文生图 :image generation(title,abstract);text-to-image(title,abstract);diffusion(abstract);分类 cs.CV

Comments 42 pages, 13 figures, 33 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2404.03673 2024-06-25 cs.CV cs.AI cs.LG 89%

RL for Consistency Models: Faster Reward Guided Text-to-Image Generation

Owen Oertell, Jonathan D. Chang, Yiyi Zhang, Kianté Brantley, Wen Sun

专题命中 文生图 :image generation(title,abstract);text-to-image(title,abstract);diffusion(abstract);分类 cs.CV

Comments 18 pages, 9 figures, 1 table

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.09162 2024-06-14 cs.CV 89%

EMMA: Your Text-to-Image Diffusion Model Can Secretly Accept Multi-Modal Prompts

Yucheng Han, Rui Wang, Chi Zhang, Juntao Hu, Pei Cheng, Bin Fu, Hanwang Zhang

专题命中 文生图 :text-to-image(title,abstract);diffusion(title,abstract);image generation(abstract);分类 cs.CV

Comments https://tencentqqgylab.github.io/EMMA

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.08713 2024-06-14 cs.AI cs.CV 89%

Batch-Instructed Gradient for Prompt Evolution:Systematic Prompt Optimization for Enhanced Text-to-Image Synthesis

Xinrui Yang, Zhuohan Wang, Anthony Hu

专题命中 文生图 :text-to-image(title,abstract);image synthesis(title);image generation(abstract);diffusion(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.08431 2024-06-13 cs.CV cs.AI cs.CR cs.LG 89%

Diffusion Soup: Model Merging for Text-to-Image Diffusion Models

Benjamin Biggs, Arjun Seshadri, Yang Zou, Achin Jain, Aditya Golatkar, Yusheng Xie, Alessandro Achille, Ashwin Swaminathan, Stefano Soatto

专题命中 文生图 :text-to-image(title,abstract);diffusion(title,abstract);image generation(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2311.16567 2024-06-13 cs.CV 89%

MobileDiffusion: Instant Text-to-Image Generation on Mobile Devices

Yang Zhao, Yanwu Xu, Zhisheng Xiao, Haolin Jia, Tingbo Hou

专题命中 文生图 :image generation(title,abstract);text-to-image(title,abstract);diffusion(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.05641 2024-06-11 cs.CV 89%

PaRa: Personalizing Text-to-Image Diffusion via Parameter Rank Reduction

Shangyu Chen, Zizheng Pan, Jianfei Cai, Dinh Phung

专题命中 文生图 :text-to-image(title,abstract);diffusion(title,abstract);image editing(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2401.11708 2024-06-05 cs.CV cs.AI cs.LG 89%

Mastering Text-to-Image Diffusion: Recaptioning, Planning, and Generating with Multimodal LLMs

Ling Yang, Zhaochen Yu, Chenlin Meng, Minkai Xu, Stefano Ermon, Bin Cui

专题命中 文生图 :text-to-image(title,abstract);diffusion(title,abstract);image generation(abstract);分类 cs.CV

Comments ICML 2024. Project: https://github.com/YangLing0818/RPG-DiffusionMaster

详情

展开后加载摘要…

URL PDF HTML 收藏
2405.15321 2024-05-27 cs.CV 89%

SG-Adapter: Enhancing Text-to-Image Generation with Scene Graph Guidance

Guibao Shen, Luozhou Wang, Jiantao Lin, Wenhang Ge, Chaozhe Zhang, Xin Tao, Yuan Zhang, Pengfei Wan, Zhongyuan Wang, Guangyong Chen, Yijun Li, Ying-Cong Chen

专题命中 文生图 :image generation(title,abstract);text-to-image(title,abstract);diffusion(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2405.12211 2024-05-21 cs.CV 89%

Slicedit: Zero-Shot Video Editing With Text-to-Image Diffusion Models Using Spatio-Temporal Slices

Nathaniel Cohen, Vladimir Kulikov, Matan Kleiner, Inbar Huberman-Spiegelglas, Tomer Michaeli

专题命中 文生图 :text-to-image(title,abstract);diffusion(title,abstract);image synthesis(abstract);分类 cs.CV

Comments ICML 2024. Code and examples are available at https://matankleiner.github.io/slicedit/

详情

展开后加载摘要…

URL PDF HTML 收藏
2405.08246 2024-05-15 cs.CV cs.AI cs.LG 89%

Compositional Text-to-Image Generation with Dense Blob Representations

Weili Nie, Sifei Liu, Morteza Mardani, Chao Liu, Benjamin Eckart, Arash Vahdat

专题命中 文生图 :image generation(title,abstract);text-to-image(title,abstract);diffusion(abstract);分类 cs.CV

Comments ICML 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2312.03045 2024-05-10 cs.CV 89%

Customization Assistant for Text-to-image Generation

Yufan Zhou, Ruiyi Zhang, Jiuxiang Gu, Tong Sun

专题命中 文生图 :image generation(title,abstract);text-to-image(title,abstract);diffusion(abstract);分类 cs.CV

Comments CVPR 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2404.13899 2024-04-23 cs.CL cs.AI cs.MM 89%

Towards Better Text-to-Image Generation Alignment via Attention Modulation

Yihang Wu, Xiao Cao, Kaixin Li, Zitan Chen, Haonan Wang, Lei Meng, Zhiyong Huang

专题命中 文生图 :image generation(title,abstract);text-to-image(title,abstract);diffusion(abstract);分类 cs.MM

详情

展开后加载摘要…

URL PDF HTML 收藏
2404.11925 2024-04-19 cs.LG cs.AI cs.CV 89%

EdgeFusion: On-Device Text-to-Image Generation

Thibault Castells, Hyoung-Kyu Song, Tairen Piao, Shinkook Choi, Bo-Kyeong Kim, Hanyoung Yim, Changgwun Lee, Jae Gon Kim, Tae-Ho Kim

专题命中 文生图 :image generation(title,abstract);text-to-image(title,abstract);diffusion(abstract);分类 cs.CV

Comments 4 pages, accepted to CVPR24 First Workshop on Efficient and On-Device Generation (EDGE)

详情

展开后加载摘要…

URL PDF HTML 收藏
2404.09977 2024-04-16 cs.CV 89%

MaxFusion: Plug&Play Multi-Modal Generation in Text-to-Image Diffusion Models

Nithin Gopalakrishnan Nair, Jeya Maria Jose Valanarasu, Vishal M Patel

专题命中 文生图 :text-to-image(title,abstract);diffusion(title,abstract);image generation(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2312.10240 2024-04-10 cs.CV 89%

Rich Human Feedback for Text-to-Image Generation

Youwei Liang, Junfeng He, Gang Li, Peizhao Li, Arseniy Klimovskiy, Nicholas Carolan, Jiao Sun, Jordi Pont-Tuset, Sarah Young, Feng Yang, Junjie Ke, Krishnamurthy Dj Dvijotham, Katie Collins, Yiwen Luo, Yang Li, Kai J Kohlhoff, Deepak Ramachandran, Vidhya Navalpakkam

专题命中 文生图 :image generation(title,abstract);text-to-image(title,abstract);diffusion(abstract);分类 cs.CV

Comments CVPR'24

详情

展开后加载摘要…

URL PDF HTML 收藏
2404.04095 2024-04-08 cs.CV cs.AI 89%

Dynamic Prompt Optimizing for Text-to-Image Generation

Wenyi Mo, Tianyu Zhang, Yalong Bai, Bing Su, Ji-Rong Wen, Qing Yang

专题命中 文生图 :image generation(title,abstract);text-to-image(title,abstract);diffusion(abstract);分类 cs.CV

Comments Accepted to CVPR 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2404.02790 2024-04-04 cs.CV 89%

MULAN: A Multi Layer Annotated Dataset for Controllable Text-to-Image Generation

Petru-Daniel Tudosiu, Yongxin Yang, Shifeng Zhang, Fei Chen, Steven McDonagh, Gerasimos Lampouras, Ignacio Iacobacci, Sarah Parisot

专题命中 文生图 :image generation(title,abstract);text-to-image(title,abstract);image editing(abstract);分类 cs.CV

Comments CVPR 2024 - Project page: https://MuLAn-dataset.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2404.01154 2024-04-02 cs.CV cs.AI 89%

Uncovering the Text Embedding in Text-to-Image Diffusion Models

Hu Yu, Hao Luo, Fan Wang, Feng Zhao

专题命中 文生图 :text-to-image(title,abstract);diffusion(title,abstract);image editing(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2310.00390 2024-03-19 cs.CV 89%

InstructCV: Instruction-Tuned Text-to-Image Diffusion Models as Vision Generalists

Yulu Gan, Sungwoo Park, Alexander Schubert, Anthony Philippakis, Ahmed M. Alaa

专题命中 文生图 :text-to-image(title,abstract);diffusion(title,abstract);image generation(abstract);分类 cs.CV

Comments ICLR 2024; Code is available at https://github.com/AlaaLab/InstructCV

详情

展开后加载摘要…

URL PDF HTML 收藏
2403.04997 2024-03-11 cs.CL cs.CV 89%

DiffChat: Learning to Chat with Text-to-Image Synthesis Models for Interactive Image Creation

Jiapeng Wang, Chengyu Wang, Tingfeng Cao, Jun Huang, Lianwen Jin

专题命中 文生图 :text-to-image(title,abstract);image synthesis(title,abstract);diffusion(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2311.17695 2024-03-07 cs.CV cs.AI cs.CY cs.LG 89%

Fair Text-to-Image Diffusion via Fair Mapping

Jia Li, Lijie Hu, Jingfeng Zhang, Tianhang Zheng, Hua Zhang, Di Wang

专题命中 文生图 :text-to-image(title,abstract);diffusion(title,abstract);image generation(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2305.13655 2024-03-05 cs.CV 89%

LLM-grounded Diffusion: Enhancing Prompt Understanding of Text-to-Image Diffusion Models with Large Language Models

Long Lian, Boyi Li, Adam Yala, Trevor Darrell

专题命中 文生图 :text-to-image(title,abstract);diffusion(title,abstract);image generation(abstract);分类 cs.CV

Comments Transactions on Machine Learning Research (TMLR) 2024, with Featured Certification

详情

展开后加载摘要…

URL PDF HTML 收藏
2310.10640 2024-02-27 cs.CV 89%

LLM Blueprint: Enabling Text-to-Image Generation with Complex and Detailed Prompts

Hanan Gani, Shariq Farooq Bhat, Muzammal Naseer, Salman Khan, Peter Wonka

专题命中 文生图 :image generation(title,abstract);text-to-image(title,abstract);diffusion(abstract);分类 cs.CV

Comments Accepted at ICLR 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2402.08654 2024-02-14 cs.CV 89%

Learning Continuous 3D Words for Text-to-Image Generation

Ta-Ying Cheng, Matheus Gadelha, Thibault Groueix, Matthew Fisher, Radomir Mech, Andrew Markham, Niki Trigoni

专题命中 文生图 :image generation(title,abstract);text-to-image(title,abstract);diffusion(abstract);分类 cs.CV

Comments Project Page: https://ttchengab.github.io/continuous_3d_words

详情

展开后加载摘要…

URL PDF HTML 收藏
2401.15688 2024-01-31 cs.CV 89%

Divide and Conquer: Language Models can Plan and Self-Correct for Compositional Text-to-Image Generation

Zhenyu Wang, Enze Xie, Aoxue Li, Zhongdao Wang, Xihui Liu, Zhenguo Li

专题命中 文生图 :image generation(title,abstract);text-to-image(title,abstract);image editing(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2401.15708 2024-01-30 cs.CV 89%

Object-Driven One-Shot Fine-tuning of Text-to-Image Diffusion with Prototypical Embedding

Jianxiang Lu, Cong Xie, Hui Guo

专题命中 文生图 :text-to-image(title,abstract);diffusion(title,abstract);image generation(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏