arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

图像生成

图像生成、文生图、图像编辑、扩散模型和可控生成。

共收录 3472 信号源:cs.CV, cs.GR, cs.MM

1. 文生图 3472 篇

2607.17634 2026-07-21 cs.CV 新提交 93%

MixDiffusion: Mixing Diffusion-based Uni-condition Text-to-Image Generation Models for Multi-condition Image Synthesis

MixDiffusion:用于多条件图像合成的基于混合扩散的单条件文本到图像生成模型

Pengcheng Wan, Liang Han, Lin Xu, Bowen Xiao, Liqiang Nie

专题命中 文生图 :image generation(title,abstract);text-to-image(title,abstract);diffusion(title,abstract);image synthesis(title,abstract)

AI总结 研究针对现有基于扩散的文本到图像生成方法控制条件单一的问题,提出MixDiffusion框架,通过集成多个预训练单条件模型,支持多条件图像合成,具有无需训练、易部署和可扩展新模态的特点。

Comments 15 pages, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2308.06027 2023-10-31 cs.CV cs.GR 93%

Masked-Attention Diffusion Guidance for Spatially Controlling Text-to-Image Generation

Yuki Endo

专题命中 文生图 :image generation(title,abstract);text-to-image(title,abstract);diffusion(title,abstract);image editing(abstract)

Comments Accepted to The Visual Computer, code: https://github.com/endo-yuki-t/MAG

详情

展开后加载摘要…

URL PDF HTML 收藏
2309.05534 2023-09-12 cs.CL cs.AI cs.CV 93%

PAI-Diffusion: Constructing and Serving a Family of Open Chinese Diffusion Models for Text-to-image Synthesis on the Cloud

Chengyu Wang, Zhongjie Duan, Bingyan Liu, Xinyi Zou, Cen Chen, Kui Jia, Jun Huang

专题命中 文生图 :text-to-image(title,abstract);diffusion(title,abstract);image synthesis(title,abstract);image generation(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.25763 2026-05-28 cs.CV 92%

AI-T2I: Aggregating-and-Isolating Cross-Attention to Diffusion Models for Text-to-Image Synthesis

AI-T2I: 面向文本到图像合成的扩散模型的聚合与隔离交叉注意力

Shipeng Cao, Biao Qian, Haipeng Liu, Yang Wang, Meng Wang

机构 * Institute of Advanced Medicine and Frontier Technology(先进医学与前沿技术研究院) Hefei University of Technology(合肥工业大学) Key Laboratory of Knowledge Engineering With Big Data, Ministry of Education(大数据知识工程重点实验室) Department of Automation, Tsinghua University(清华大学自动化系)

专题命中 文生图 :text-to-image(title,abstract);diffusion(title,abstract);image synthesis(title,abstract);personalized generation(abstract)

AI总结 针对扩散模型在文本到图像合成中交叉注意力图内文本-图像对齐不精确的问题,提出一种聚合与隔离交叉注意力方法(AI-T2I),通过聚合损失整合分散的令牌内激活并引入隔离损失分离令牌间激活,实现精确对齐。

Comments Accepted by IEEE Transactions on Multimedia (2026). 13 pages, 15 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.10046 2025-05-16 cs.CV 92%

Exploring the Deep Fusion of Large Language Models and Diffusion Transformers for Text-to-Image Synthesis

Bingda Tang, Boyang Zheng, Xichen Pan, Sayak Paul, Saining Xie

机构 * New York University(纽约大学) Hugging Face

专题命中 文生图 :text-to-image(title,abstract);diffusion(title,abstract);image synthesis(title,abstract);image generation(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2212.04489 2025-04-01 cs.CV cs.AI 92%

SINE: SINgle Image Editing with Text-to-Image Diffusion Models

Zhixing Zhang, Ligong Han, Arnab Ghosh, Dimitris Metaxas, Jian Ren

专题命中 文生图 :diffusion(title,abstract);image editing(title,abstract);text-to-image(title);image generation(abstract)

Comments Accepted at CVPR 2023. Project website: https://zhang-zx.github.io/SINE/

详情

展开后加载摘要…

URL PDF HTML 收藏
2403.12931 2025-02-26 cs.CV 92%

You Only Sample Once: Taming One-Step Text-to-Image Synthesis by Self-Cooperative Diffusion GANs

Yihong Luo, Xiaolong Chen, Xinghua Qu, Tianyang Hu, Jing Tang

专题命中 文生图 :text-to-image(title,abstract);diffusion(title,abstract);image synthesis(title,abstract);image generation(abstract)

Comments ICLR 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2403.16954 2025-01-20 cs.CV 92%

Isolated Diffusion: Optimizing Multi-Concept Text-to-Image Generation Training-Freely with Isolated Diffusion Guidance

Jingyuan Zhu, Huimin Ma, Jiansheng Chen, Jian Yuan

专题命中 文生图 :image generation(title,abstract);text-to-image(title,abstract);diffusion(title,abstract);image synthesis(abstract)

Comments Accepted by IEEE Transactions on Visualization and Computer Graphics

详情

展开后加载摘要…

URL PDF HTML 收藏
2403.07860 2024-03-13 cs.CV 92%

Bridging Different Language Models and Generative Vision Models for Text-to-Image Generation

Shihao Zhao, Shaozhe Hao, Bojia Zi, Huaizhe Xu, Kwan-Yee K. Wong

专题命中 文生图 :image generation(title,abstract);text-to-image(title,abstract);generative vision(title,abstract);diffusion(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2312.16486 2024-01-01 cs.CV cs.AI 92%

PanGu-Draw: Advancing Resource-Efficient Text-to-Image Synthesis with Time-Decoupled Training and Reusable Coop-Diffusion

Guansong Lu, Yuanfan Guo, Jianhua Han, Minzhe Niu, Yihan Zeng, Songcen Xu, Zeyi Huang, Zhao Zhong, Wei Zhang, Hang Xu

专题命中 文生图 :text-to-image(title,abstract);diffusion(title,abstract);image synthesis(title,abstract);image generation(abstract)

Comments 16 pages, 16 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2310.00426 2024-01-01 cs.CV 92%

PixArt-$α$: Fast Training of Diffusion Transformer for Photorealistic Text-to-Image Synthesis

Junsong Chen, Jincheng Yu, Chongjian Ge, Lewei Yao, Enze Xie, Yue Wu, Zhongdao Wang, James Kwok, Ping Luo, Huchuan Lu, Zhenguo Li

专题命中 文生图 :text-to-image(title,abstract);diffusion(title,abstract);image synthesis(title,abstract);image generation(abstract)

Comments Project Page: https://pixart-alpha.github.io

详情

展开后加载摘要…

URL PDF HTML 收藏
2311.09257 2023-12-08 cs.CV 92%

UFOGen: You Forward Once Large Scale Text-to-Image Generation via Diffusion GANs

Yanwu Xu, Yang Zhao, Zhisheng Xiao, Tingbo Hou

专题命中 文生图 :image generation(title,abstract);text-to-image(title,abstract);diffusion(title,abstract);image synthesis(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2210.09549 2022-10-19 cs.CV cs.LG 92%

Swinv2-Imagen: Hierarchical Vision Transformer Diffusion Models for Text-to-Image Generation

Ruijun Li, Weihua Li, Yi Yang, Hanyu Wei, Jianhua Jiang, Quan Bai

专题命中 文生图 :image generation(title,abstract);text-to-image(title,abstract);diffusion(title,abstract);image synthesis(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2403.04982 2024-09-24 cs.AR 92%

A 28.6 mJ/iter Stable Diffusion Processor for Text-to-Image Generation with Patch Similarity-based Sparsity Augmentation and Text-based Mixed-Precision

Jiwon Choi, Wooyoung Jo, Seongyon Hong, Beomseok Kwon, Wonhoon Park, Hoi-Jun Yoo

专题命中 文生图 :image generation(title,abstract);text-to-image(title,abstract);diffusion(title,abstract);image synthesis(abstract)

Comments Accepted at 2024 IEEE International Symposium on Circuits and Systems (ISCAS)

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.28615 2026-05-28 cs.CV 92%

Compositional Text-to-Image Generation Via Region-aware Bimodal Direct Preference Optimization

基于区域感知双模态直接偏好优化的组合式文本到图像生成

Zhuohan Liu, Wujian Peng, Yitong Chen, Zuxuan Wu

机构 * Shanghai Key Lab of Intell. Info. Processing, School of CS, Fudan University(上海智能信息处理关键实验室,复旦大学计算机学院) Shanghai Collaborative Innovation Center of Intelligent Visual Computing(上海智能视觉计算协同创新中心)

专题命中 文生图 :diffusion(summary_cn,abstract);image generation(title,abstract);text-to-image(title,abstract);分类 cs.CV

AI总结 提出BiDPO框架,通过构建大规模偏好数据集BiComp和扩展Diffusion DPO联合优化图像与文本偏好,结合区域级引导方法,提升文本到图像模型对复杂组合提示的生成保真度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.11905 2025-03-18 cs.CV cs.AI 92%

Upcycling Text-to-Image Diffusion Models for Multi-Task Capabilities

Ruchika Chavhan, Abhinav Mehrotra, Malcolm Chadwick, Alberto Gil Ramos, Luca Morreale, Mehdi Noroozi, Sourav Bhattacharya

专题命中 文生图 :text-to-image(title,abstract);diffusion(title,abstract);image generation(abstract);image editing(abstract)

Comments Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2303.07909 2024-11-11 cs.CV cs.AI cs.LG 92%

Text-to-image Diffusion Models in Generative AI: A Survey

Chenshuang Zhang, Chaoning Zhang, Mengchun Zhang, In So Kweon, Junmo Kim

专题命中 文生图 :text-to-image(title,abstract);diffusion(title,abstract);image generation(abstract,comments);image editing(abstract)

Comments First survey on the recent progress of text-to-image generation based on the diffusion model

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.06886 2026-08-03 cs.CV 版本更新 92%

Prompt Reinjection: Alleviating Prompt Forgetting in Multimodal Diffusion Transformers for Text-to-Image Generation

提示重注入:缓解多模态扩散变换器中的提示遗忘

Yuxuan Yao, Yuxuan Chen, Hui Li, Kaihui Cheng, Qipeng Guo, Yuwei Sun, Zilong Dong, Jingdong Wang, Siyu Zhu

机构 * University of Science and Technology of China(中国科学技术大学)

专题命中 文生图 :image generation(title,abstract);text-to-image(title,abstract);diffusion(title,abstract);分类 cs.CV

AI总结 本研究针对多模态扩散变换器中提示遗忘问题,提出一种无需训练的提示重注入方法,通过将早期层的提示表示重新注入到后期层,以提升指令遵循能力和生成质量。

Comments 19 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.13450 2026-04-13 cs.CV cs.CL 92%

LADR: Locality-Aware Dynamic Rescue for Efficient Text-to-Image Generation with Diffusion Large Language Models

LADR:基于局部性的动态救援方法,用于高效文本到图像生成的扩散大语言模型

Chenglin Wang, Yucheng Zhou, Shawn Chen, Tao Wang, Kai Zhang

机构 * East China Normal University(华东师范大学) University of Macau(澳门大学) Zhejiang University(浙江大学) Nanjing University(南京大学)

专题命中 文生图 :image generation(title,abstract);text-to-image(title,abstract);diffusion(title,abstract);分类 cs.CV

AI总结 本文提出LADR方法,通过利用图像的空间马尔可夫性质加速推理,实现文本到图像生成的高效生成,同时保持生成质量。

Comments ACL2026 Main Conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.13389 2026-03-17 cs.CV cs.LG 92%

High-Fidelity Text-to-Image Generation from Pre-Trained Vision-Language Models via Distribution-Conditioned Diffusion Decoding

通过分布条件扩散解码从预训练视觉-语言模型生成高保真的文本到图像

Ji Woo Hong, Hee Suk Yoon, Gwanhyeong Koo, Eunseop Yoon, SooHwan Eom, Qi Dai, Chong Luo, Chang D. Yoo

机构 * Korea Advanced Institute of Science and Technology (KAIST)(韩国科学技术院) Microsoft Research Asia (MSRA)(微软亚洲研究院)

专题命中 文生图 :image generation(title,abstract);text-to-image(title,abstract);diffusion(title,abstract);分类 cs.CV

AI总结 本文提出一种基于扩散解码的框架,通过训练仅需扩散解码器即可提升图像保真度,利用分布加权代码向量增强视觉质量,仅需ImageNet-1K短训练即可改进VQ-VAE重建和文本到图像生成。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.20821 2025-12-30 cs.CV cs.AI cs.CL cs.LG 92%

Training-Free Diffusion Priors for Text-to-Image Generation via Optimization-based Visual Inversion

无需训练的扩散先验:通过基于优化的视觉反向生成文本到图像

Samuele Dell'Erba, Andrew D. Bagdanov

机构 * University of Florence(佛罗伦萨大学)

专题命中 文生图 :image generation(title,abstract);text-to-image(title,abstract);diffusion(title,abstract);分类 cs.CV

AI总结 本研究提出无需训练的基于优化的视觉反向方法,用于文本到图像生成,通过约束优化提升图像质量,挑战传统先验的必要性。

Comments 13 pages, 7 figures, technical report (preprint)

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.18742 2025-12-01 cs.CV cs.AI cs.LG 92%

ProxT2I: Efficient Reward-Guided Text-to-Image Generation via Proximal Diffusion

ProxT2I:通过近端扩散实现高效的奖励引导文本到图像生成

Zhenghan Fang, Jian Zheng, Qiaozi Gao, Xiaofeng Gao, Jeremias Sulam

机构 * Johns Hopkins University(约翰霍普金斯大学) Amazon(亚马逊)

专题命中 文生图 :image generation(title,abstract);text-to-image(title,abstract);diffusion(title,abstract);分类 cs.CV

AI总结 ProxT2I通过近端扩散和奖励引导方法,提升文本到图像生成的效率和人类偏好对齐,实现高效且轻量的生成效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.05616 2025-11-11 cs.CV cs.AI 92%

Personalized Image Editing in Text-to-Image Diffusion Models via Collaborative Direct Preference Optimization

Connor Dunlop, Matthew Zheng, Kavana Venkatesh, Pinar Yanardag

机构 * Virginia Tech(弗吉尼亚理工大学)

专题命中 文生图 :text-to-image(title,abstract);diffusion(title,abstract);image editing(title,abstract);分类 cs.CV

Comments Published at NeurIPS'25 Main Conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.17760 2025-08-26 cs.CV cs.CL 92%

CEIDM: A Controlled Entity and Interaction Diffusion Model for Enhanced Text-to-Image Generation

Mingyue Yang, Dianxi Shi, Jialu Zhou, Xinyu Wei, Leqian Li, Shaowu Yang, Chunping Qiu

专题命中 文生图 :image generation(title,abstract);text-to-image(title,abstract);diffusion(title,abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.04347 2025-05-08 cs.CV 92%

CountDiffusion: Text-to-Image Synthesis with Training-Free Counting-Guidance Diffusion

Yanyu Li, Pencheng Wan, Liang Han, Yaowei Wang, Liqiang Nie, Min Zhang

机构 * Department of Computer Science and Technology, Harbin Institute of Technology(计算机科学与技术系,哈尔滨工业大学)

专题命中 文生图 :text-to-image(title,abstract);diffusion(title,abstract);image synthesis(title,abstract);分类 cs.CV

Comments 8 pages, 9 figures, 3 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.02648 2025-05-07 cs.CV 92%

MCCD: Multi-Agent Collaboration-based Compositional Diffusion for Complex Text-to-Image Generation

Mingcheng Li, Xiaolu Hou, Ziyang Liu, Dingkang Yang, Ziyun Qian, Jiawei Chen, Jinjie Wei, Yue Jiang, Qingyao Xu, Lihua Zhang

机构 * Academy for Engineering and Technology(工程与技术学院) Cognition and Intelligent Technology Laboratory (CIT Lab)(认知与智能技术实验室) School of Future Science and Engineering(未来科学与工程学院) Jilin Provincial Key Laboratory of Intelligence Science and Engineering(吉林省智能科学与工程重点实验室) Engineering Research Center of AI and Robotics, Ministry of Education(人工智能与机器人工程研究中心)

专题命中 文生图 :image generation(title,abstract);text-to-image(title,abstract);diffusion(title,abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.00917 2025-01-03 cs.CV 92%

Hierarchical Vision-Language Alignment for Text-to-Image Generation via Diffusion Models

Emily Johnson, Noah Wilson

专题命中 文生图 :image generation(title,abstract);text-to-image(title,abstract);diffusion(title,abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.10800 2024-11-19 cs.CV 92%

Test-time Conditional Text-to-Image Synthesis Using Diffusion Models

Tripti Shukla, Srikrishna Karanam, Balaji Vasan Srinivasan

专题命中 文生图 :text-to-image(title,abstract);diffusion(title,abstract);image synthesis(title,abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.18897 2024-09-30 cs.CV 92%

Detecting Dataset Abuse in Fine-Tuning Stable Diffusion Models for Text-to-Image Synthesis

Songrui Wang, Yubo Zhu, Wei Tong, Sheng Zhong

专题命中 文生图 :text-to-image(title,abstract);diffusion(title,abstract);image synthesis(title,abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.08026 2024-09-13 cs.CV 92%

Scribble-Guided Diffusion for Training-free Text-to-Image Generation

Seonho Lee, Jiho Choi, Seohyun Lim, Jiwook Kim, Hyunjung Shim

专题命中 文生图 :image generation(title,abstract);text-to-image(title,abstract);diffusion(title,abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏