arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

图像生成

图像生成、文生图、图像编辑、扩散模型和可控生成。

共收录 86350 信号源:cs.CV, cs.GR, cs.MM

1. 文生图 3474 篇

2311.12229 2024-04-09 cs.AI 89%

NeuroPrompts: An Adaptive Framework to Optimize Prompts for Text-to-Image Generation

Shachar Rosenman, Vasudev Lal, Phillip Howard

专题命中 文生图 :image generation(title,abstract);text-to-image(title,abstract);diffusion(abstract)

Comments Accepted to EACL 2024 System Demonstration Track

详情

展开后加载摘要…

URL PDF HTML 收藏
2312.05849 2024-02-28 cs.CV cs.GR cs.MM 89%

InteractDiffusion: Interaction Control in Text-to-Image Diffusion Models

Jiun Tian Hoe, Xudong Jiang, Chee Seng Chan, Yap-Peng Tan, Weipeng Hu

专题命中 文生图 :text-to-image(title,abstract);diffusion(title,abstract);分类 cs.CV、cs.GR、cs.MM

Comments Website: https://jiuntian.github.io/interactdiffusion. Accepted at CVPR2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2210.00968 2022-10-04 cs.CR cs.LG 89%

Membership Inference Attacks Against Text-to-image Generation Models

Yixin Wu, Ning Yu, Zheng Li, Michael Backes, Yang Zhang

专题命中 文生图 :image generation(title,abstract);text-to-image(title,abstract);diffusion(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2004.11437 2020-04-27 cs.LG stat.ML 89%

Efficient Neural Architecture for Text-to-Image Synthesis

Douglas M. Souza, Jônatas Wehrmann, Duncan D. Ruiz

专题命中 文生图 :text-to-image(title,abstract);image synthesis(title,abstract);image generation(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.20241 2026-06-19 cs.CV 新提交 89%

BAFIS: Dataset + Framework to assess occupational Bias and Human Preference in modern Text-to-image Models

BAFIS:评估现代文本到图像模型中的职业偏见与人类偏好的数据集与框架

Thomas Klassert, Adrian Ulges, Biying Fu

机构 * RheinMain University of Applied Sciences(莱茵美因应用科学大学)

专题命中 文生图 :text-to-image(title,abstract);diffusion(abstract,abstract_cn);image generation(abstract);image synthesis(abstract)

AI总结 本研究提出BAFIS平台和包含21,140张多语言提示生成图像的数据集,评估五种文本到图像模型在职业生成中的性别和种族偏见,结合人类偏好反馈,发现系统性偏见并强调纳入人类偏好的必要性。

Comments Accepted at the IEEE Winter Conference on Applications of Computer Vision, WACV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.21375 2025-09-29 cs.CV cs.AI 89%

Automated Prompt Generation for Creative and Counterfactual Text-to-image Synthesis

Aleksa Jelaca, Ying Jiao, Chang Tian, Marie-Francine Moens

专题命中 文生图 :text-to-image(title,abstract);image synthesis(title);image generation(abstract,comments);分类 cs.CV

Comments text-to-image generation, automatic prompt, DPO, Counterfactual

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.10711 2025-08-19 cs.CV 89%

NextStep-1: Toward Autoregressive Image Generation with Continuous Tokens at Scale

NextStep Team, Chunrui Han, Guopeng Li, Jingwei Wu, Quan Sun, Yan Cai, Yuang Peng, Zheng Ge, Deyu Zhou, Haomiao Tang, Hongyu Zhou, Kenkun Liu, Ailin Huang, Bin Wang, Changxin Miao, Deshan Sun, En Yu, Fukun Yin, Gang Yu, Hao Nie, Haoran Lv, Hanpeng Hu, Jia Wang, Jian Zhou, Jianjian Sun, Kaijun Tan, Kang An, Kangheng Lin, Liang Zhao, Mei Chen, Peng Xing, Rui Wang, Shiyu Liu, Shutao Xia, Tianhao You, Wei Ji, Xianfang Zeng, Xin Han, Xuelin Zhang, Yana Wei, Yanming Xu, Yimin Jiang, Yingming Wang, Yu Zhou, Yucheng Han, Ziyang Meng, Binxing Jiao, Daxin Jiang, Xiangyu Zhang, Yibo Zhu

机构 * NextStep-Team(NextStep团队)

专题命中 文生图 :image generation(title,abstract);text-to-image(abstract);diffusion(abstract);image editing(abstract)

Comments Code: https://github.com/stepfun-ai/NextStep-1

详情

展开后加载摘要…

URL PDF HTML 收藏
2404.10141 2026-04-28 cs.CV cs.CL cs.MM 88%

ANCHOR: LLM-driven Subject Conditioning for Text-to-Image Synthesis

ANCHOR:基于大语言模型的文本到图像合成中的主体条件化

Aashish Anantha Ramakrishnan, Sharon X. Huang, Dongwon Lee

机构 * Optum AI The Pennsylvania State University(宾夕法尼亚州立大学)

专题命中 文生图 :text-to-image(title,abstract);image synthesis(title,abstract);分类 cs.CV、cs.MM

AI总结 ANCHOR通过大规模抽象式标题数据集研究文本到图像合成中多主体理解与上下文推理的缺陷,提出基于大语言模型的主体感知微调方法,提升图像-标题一致性与人类偏好对齐。

Comments Accepted to The 64th Annual Meeting of the Association for Computational Linguistics (ACL) 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.03813 2026-03-17 cs.GR cs.AI cs.CV cs.LG 88%

Diverse Text-to-Image Generation via Contrastive Noise Optimization

通过对比噪声优化实现文本到图像生成的多样性

Byungjun Kim, Soobin Um, Jong Chul Ye

专题命中 文生图 :text-to-image(title,abstract);image generation(title);diffusion(abstract);分类 cs.CV、cs.GR

AI总结 本文提出对比噪声优化方法,通过调整初始噪声提升文本到图像生成的多样性,同时保持图像质量,实验表明其在质量与多样性之间取得平衡。

Comments Accepted to ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.17099 2025-10-21 cs.HC cs.CV cs.GR cs.LG 88%

Text-to-Image Generation for Vocabulary Learning Using the Keyword Method

Nuwan T. Attygalle, Matjaž Kljun, Aaron Quigley, Klen čOpič Pucihar, Jens Grubert, Verena Biener, Luis A. Leiva, Juri Yoneyama, Alice Toniolo, Angela Miguel, Hirokazu Kato, Maheshya Weerasinghe

专题命中 文生图 :text-to-image(title,abstract);image generation(title);diffusion(abstract);分类 cs.CV、cs.GR

Journal ref IUI '25: Proceedings of the 30th International Conference on Intelligent User Interfaces, Pages 1381 - 1397, 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2408.11721 2025-06-06 cs.CV cs.AI cs.GR cs.LG 88%

Detection-Driven Object Count Optimization for Text-to-Image Diffusion Models

Oz Zafar, Yuval Cohen, Lior Wolf, Idan Schwartz

机构 * Tel-Aviv University(特拉维夫大学) Bar-Ilan University(巴伊兰大学)

专题命中 文生图 :text-to-image(title,abstract);diffusion(title);image generation(abstract);分类 cs.CV、cs.GR

Comments Pre-print

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.05818 2025-03-26 cs.CV cs.AI cs.CL cs.LG cs.MM 88%

SILMM: Self-Improving Large Multimodal Models for Compositional Text-to-Image Generation

Leigang Qu, Haochuan Li, Wenjie Wang, Xiang Liu, Juncheng Li, Liqiang Nie, Tat-Seng Chua

专题命中 文生图 :image generation(title,abstract);text-to-image(title,abstract);分类 cs.CV、cs.MM

Comments CVPR 2025 Camera-ready. Project page: https://silmm.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.05814 2025-03-26 cs.CV cs.AI cs.CL cs.LG cs.MM 88%

TIGeR: Unifying Text-to-Image Generation and Retrieval with Large Multimodal Models

Leigang Qu, Haochuan Li, Tan Wang, Wenjie Wang, Yongqi Li, Liqiang Nie, Tat-Seng Chua

专题命中 文生图 :image generation(title,abstract);text-to-image(title,abstract);分类 cs.CV、cs.MM

Comments ICLR 2025 Camera-ready

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.11817 2025-03-04 cs.CV cs.LG cs.MM 88%

Improving Long-Text Alignment for Text-to-Image Diffusion Models

Luping Liu, Chao Du, Tianyu Pang, Zehan Wang, Chongxuan Li, Dong Xu

专题命中 文生图 :text-to-image(title,abstract);diffusion(title,abstract);分类 cs.CV、cs.MM

Journal ref International Conference on Learning Representations (ICLR 2025)

详情

展开后加载摘要…

URL PDF HTML 收藏
2403.11821 2025-01-30 cs.CV cs.AI cs.GR 88%

A Survey on Quality Metrics for Text-to-Image Generation

Sebastian Hartwig, Dominik Engel, Leon Sick, Hannah Kniesel, Tristan Payer, Poonam Poonam, Michael Glöckler, Alex Bäuerle, Timo Ropinski

专题命中 文生图 :image generation(title,abstract);text-to-image(title,abstract);分类 cs.CV、cs.GR

Comments preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.00437 2025-01-03 cs.CV cs.CL cs.LG cs.MM 88%

Unleashing Text-to-Image Diffusion Prior for Zero-Shot Image Captioning

Jianjie Luo, Jingwen Chen, Yehao Li, Yingwei Pan, Jianlin Feng, Hongyang Chao, Ting Yao

专题命中 文生图 :text-to-image(title,abstract);diffusion(title,abstract);分类 cs.CV、cs.MM

Comments ECCV 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.01179 2024-11-05 cs.CV cs.AI cs.GR cs.LG 88%

Hollowed Net for On-Device Personalization of Text-to-Image Diffusion Models

Wonguk Cho, Seokeon Choi, Debasmit Das, Matthias Reisser, Taesup Kim, Sungrack Yun, Fatih Porikli

专题命中 文生图 :text-to-image(title,abstract);diffusion(title,abstract);分类 cs.CV、cs.GR

Comments NeurIPS 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.12700 2024-10-17 cs.CV cs.AI cs.CY cs.LG cs.MM 88%

Embedding an Ethical Mind: Aligning Text-to-Image Synthesis via Lightweight Value Optimization

Xingqi Wang, Xiaoyuan Yi, Xing Xie, Jia Jia

专题命中 文生图 :text-to-image(title,abstract);image synthesis(title);diffusion(abstract);分类 cs.CV、cs.MM

Comments Accepted by ACM Multimedia 2024. The dataset and code can be found at https://github.com/achernarwang/LiVO

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.01731 2024-10-03 cs.CV cs.CL cs.GR 88%

ComfyGen: Prompt-Adaptive Workflows for Text-to-Image Generation

Rinon Gal, Adi Haviv, Yuval Alaluf, Amit H. Bermano, Daniel Cohen-Or, Gal Chechik

专题命中 文生图 :image generation(title,abstract);text-to-image(title,abstract);分类 cs.CV、cs.GR

Comments Project website: https://comfygen-paper.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2311.10093 2024-07-16 cs.CV cs.GR cs.LG 88%

The Chosen One: Consistent Characters in Text-to-Image Diffusion Models

Omri Avrahami, Amir Hertz, Yael Vinker, Moab Arar, Shlomi Fruchter, Ohad Fried, Daniel Cohen-Or, Dani Lischinski

专题命中 文生图 :text-to-image(title,abstract);diffusion(title);image generation(abstract);分类 cs.CV、cs.GR

Comments Accepted to SIGGRAPH 2024. Project page is available at https://omriavrahami.com/the-chosen-one/

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.10210 2024-06-17 cs.CV cs.AI cs.GR 88%

Make It Count: Text-to-Image Generation with an Accurate Number of Objects

Lital Binyamin, Yoad Tewel, Hilit Segev, Eran Hirsch, Royi Rassin, Gal Chechik

专题命中 文生图 :text-to-image(title,abstract);image generation(title);diffusion(abstract);分类 cs.CV、cs.GR

Comments Project page is at https://make-it-count-paper.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2402.03286 2024-05-31 cs.CV cs.AI cs.GR cs.LG 88%

Training-Free Consistent Text-to-Image Generation

Yoad Tewel, Omri Kaduri, Rinon Gal, Yoni Kasten, Lior Wolf, Gal Chechik, Yuval Atzmon

专题命中 文生图 :image generation(title,abstract);text-to-image(title,abstract);分类 cs.CV、cs.GR

Comments Accepted to journal track of SIGGRAPH 2024 (TOG). Project page is at https://consistory-paper.github.io

详情

展开后加载摘要…

URL PDF HTML 收藏
2404.15100 2024-04-24 cs.CV cs.MM 88%

Multimodal Large Language Model is a Human-Aligned Annotator for Text-to-Image Generation

Xun Wu, Shaohan Huang, Furu Wei

专题命中 文生图 :image generation(title,abstract);text-to-image(title,abstract);分类 cs.CV、cs.MM

详情

展开后加载摘要…

URL PDF HTML 收藏
2403.16990 2024-03-26 cs.CV cs.AI cs.GR cs.LG 88%

Be Yourself: Bounded Attention for Multi-Subject Text-to-Image Generation

Omer Dahary, Or Patashnik, Kfir Aberman, Daniel Cohen-Or

专题命中 文生图 :text-to-image(title,abstract);image generation(title);diffusion(abstract);分类 cs.CV、cs.GR

Comments Project page: https://omer11a.github.io/bounded-attention/

详情

展开后加载摘要…

URL PDF HTML 收藏
2403.04321 2024-03-15 cs.CV cs.AI cs.CL cs.MM 88%

Discriminative Probing and Tuning for Text-to-Image Generation

Leigang Qu, Wenjie Wang, Yongqi Li, Hanwang Zhang, Liqiang Nie, Tat-Seng Chua

专题命中 文生图 :image generation(title,abstract);text-to-image(title,abstract);分类 cs.CV、cs.MM

Comments CVPR 2024; project page: https://dpt-t2i.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2306.07280 2024-03-15 cs.CV cs.AI cs.GR cs.LG 88%

Controlling Text-to-Image Diffusion by Orthogonal Finetuning

Zeju Qiu, Weiyang Liu, Haiwen Feng, Yuxuan Xue, Yao Feng, Zhen Liu, Dan Zhang, Adrian Weller, Bernhard Schölkopf

专题命中 文生图 :text-to-image(title,abstract);diffusion(title,abstract);分类 cs.CV、cs.GR

Comments NeurIPS 2023 (v3: fixed formula typos in Section 3.5, 43 pages, 34 figures, project page: https://oft.wyliu.com/)

详情

展开后加载摘要…

URL PDF HTML 收藏
2311.12803 2024-02-20 cs.MM cs.AI cs.GR 88%

On Copyright Risks of Text-to-Image Diffusion Models

Yang Zhang, Teoh Tze Tzun, Lim Wei Hern, Haonan Wang, Kenji Kawaguchi

专题命中 文生图 :text-to-image(title,abstract);diffusion(title,abstract);分类 cs.GR、cs.MM

Comments 16 pages including appendix

详情

展开后加载摘要…

URL PDF HTML 收藏
2310.16573 2023-10-26 cs.CV cs.AI cs.MM 88%

Adapt Anything: Tailor Any Image Classifiers across Domains And Categories Using Text-to-Image Diffusion Models

Weijie Chen, Haoyu Wang, Shicai Yang, Lei Zhang, Wei Wei, Yanning Zhang, Luojun Lin, Di Xie, Yueting Zhuang

专题命中 文生图 :text-to-image(title,abstract);diffusion(title,abstract);分类 cs.CV、cs.MM

Comments 11 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2303.13516 2023-08-17 cs.CV cs.GR cs.LG 88%

Ablating Concepts in Text-to-Image Diffusion Models

Nupur Kumari, Bingliang Zhang, Sheng-Yu Wang, Eli Shechtman, Richard Zhang, Jun-Yan Zhu

专题命中 文生图 :text-to-image(title,abstract);diffusion(title,abstract);分类 cs.CV、cs.GR

Comments ICCV 2023. Project website: https://www.cs.cmu.edu/~concept-ablation/

详情

展开后加载摘要…

URL PDF HTML 收藏
2303.11306 2023-08-15 cs.CV cs.GR cs.LG 88%

Localizing Object-level Shape Variations with Text-to-Image Diffusion Models

Or Patashnik, Daniel Garibi, Idan Azuri, Hadar Averbuch-Elor, Daniel Cohen-Or

专题命中 文生图 :text-to-image(title,abstract);diffusion(title);image generation(abstract);分类 cs.CV、cs.GR

Comments ICCV 2023. Project page at https://orpatashnik.github.io/local-prompt-mixing/

详情

展开后加载摘要…

URL PDF HTML 收藏