arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

图像生成

图像生成、文生图、图像编辑、扩散模型和可控生成。

共收录 86504 信号源:cs.CV, cs.GR, cs.MM

1. 文生图 3480 篇

2509.08940 2025-09-12 cs.CV 83%

Discovering Divergent Representations between Text-to-Image Models

Lisa Dunlap, Joseph E. Gonzalez, Trevor Darrell, Fabian Caba Heilbron, Josef Sivic, Bryan Russell

专题命中 文生图 :text-to-image(title,abstract);diffusion(abstract);分类 cs.CV

Comments Accepted to ICCV 2025. Code available at https://github.com/adobe-research/CompCon

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.08346 2025-09-03 cs.CV 83%

Pathology-Aware Adaptive Watermarking for Text-Driven Medical Image Synthesis

Chanyoung Kim, Dayun Ju, Jinyeong Kim, Woojung Han, Roberto Alcover-Couso, Seong Jae Hwang

机构 * Department of Artificial Intelligence, Yonsei University(人工智能系,延世大学) Amazon(亚马逊)

专题命中 文生图 :image synthesis(title,abstract);diffusion(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.15312 2025-09-03 cs.CV cs.AI 83%

Synergistic Dual Spatial-aware Generation of Image-to-Text and Text-to-Image

Yu Zhao, Hao Fei, Xiangtai Li, Libo Qin, Jiayi Ji, Hongyuan Zhu, Meishan Zhang, Min Zhang, Jianguo Wei

机构 * Tianjin University(天津大学) National University of Singapore(新加坡国立大学) Nanyang Technological University(南洋理工大学) Central South University(中南大学) I 2 R & CFAR, A*STAR(I 2 R与CFAR,A*STAR) Harbin Institute of Technology (Shenzhen)(哈尔滨工业大学(深圳))

专题命中 文生图 :text-to-image(title,abstract);diffusion(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.05063 2025-09-03 cs.CV cs.CL cs.LG 83%

CytoDiff: AI-Driven Cytomorphology Image Synthesis for Medical Diagnostics

Jan Carreras Boada, Rao Muhammad Umer, Carsten Marr

机构 * Institute of AI for Health, Helmholtz Zentrum München - German Research Center for Environmental Health(人工智能与健康研究所,慕尼黑德国环境健康研究中心) Department of Medicine III, Ludwig-Maximilian-University Hospital(第三医学部,路德维希-马克西米利安大学医院) DKTK, German Cancer Consortium(德国癌症联盟,DKTK) Escola Superior de Comerç Internacional, Universitat Pompeu Fabra (ESCI-UPF)(国际商业学校,庞培法布拉大学(ESCI-UPF))

专题命中 文生图 :image synthesis(title);image generation(abstract);diffusion(abstract);分类 cs.CV

Comments Accepted at ICCV 2025, 7-8 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.14502 2025-08-21 cs.CV 83%

SATURN: Autoregressive Image Generation Guided by Scene Graphs

Thanh-Nhan Vo, Trong-Thuan Nguyen, Tam V. Nguyen, Minh-Triet Tran

机构 * University of Science, VNU-HCM(越南国家大学科学大学) Vietnam National University, Ho Chi Minh City, Vietnam(越南国家大学河内市) University of Dayton(Dayton 大学) Ohio, USA(俄亥俄州,美国)

专题命中 文生图 :image generation(title);text-to-image(abstract);diffusion(abstract);分类 cs.CV

Comments Accepted to MAPR 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.11695 2025-08-19 cs.GR cs.AI 83%

RefAdGen: High-Fidelity Advertising Image Generation

Yiyun Chen, Weikai Yang

专题命中 文生图 :image generation(title,abstract);image synthesis(abstract);分类 cs.GR

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.05101 2025-08-04 cs.CV 83%

The Silent Assistant: NoiseQuery as Implicit Guidance for Goal-Driven Image Generation

Ruoyu Wang, Huayang Huang, Ye Zhu, Olga Russakovsky, Yu Wu

机构 * School of Computer Science, Wuhan University(武汉大学计算机学院) Department of Computer Science, Princeton University(普林斯顿大学计算机科学系)

专题命中 文生图 :image generation(title);text-to-image(abstract);diffusion(abstract);分类 cs.CV

Comments ICCV 2025 Highlight

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.22100 2025-07-31 cs.CV 83%

Trade-offs in Image Generation: How Do Different Dimensions Interact?

Sicheng Zhang, Binzhu Xie, Zhonghao Yan, Yuli Zhang, Donghao Zhou, Xiaofei Chen, Shi Qiu, Jiaqi Liu, Guoyang Xie, Zhichao Lu

机构 * Khalifa University(卡利法大学) The Chinese University of Hong Kong(香港中文大学) Queen Mary University of London(伦敦大学玛丽女王学院) Xi’an Jiaotong-Liverpool University(西安交通大学利物浦大学) City University of Hong Kong(香港城市大学)

专题命中 文生图 :image generation(title,abstract);text-to-image(abstract);分类 cs.CV

Comments Accepted in ICCV 2025, Codebase: https://github.com/fesvhtr/TRIG

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.18750 2025-07-28 cs.MM cs.SD eess.AS 83%

CatchPhrase: EXPrompt-Guided Encoder Adaptation for Audio-to-Image Generation

Hyunwoo Oh, SeungJu Cha, Kwanyoung Lee, Si-Woo Kim, Dong-Jin Kim

机构 * Hanyang University(翰阳大学)

专题命中 文生图 :image generation(title,abstract);text-to-image(abstract);分类 cs.MM

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.22531 2025-07-28 cs.CV 83%

Preserve Anything: Controllable Image Synthesis with Object Preservation

Prasen Kumar Sharma, Neeraj Matiyali, Siddharth Srivastava, Gaurav Sharma

专题命中 文生图 :image synthesis(title,abstract);text-to-image(abstract);分类 cs.CV

Comments Accepted at ICCV 2025 (main conference)

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.15775 2025-07-28 cs.CV cs.SE 83%

Do Existing Testing Tools Really Uncover Gender Bias in Text-to-Image Models?

Yunbo Lyu, Zhou Yang, Yuqing Niu, Jing Jiang, David Lo

机构 * Singapore Management University(新加坡管理大学) University of Alberta(阿尔伯塔大学) Australian National University(澳大利亚国立大学)

专题命中 文生图 :text-to-image(title,abstract);diffusion(abstract);分类 cs.CV

Comments Accepted to ACM MM 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.11937 2025-07-25 cs.CV cs.AI 83%

Att-Adapter: A Robust and Precise Domain-Specific Multi-Attributes T2I Diffusion Adapter via Conditional Variational Autoencoder

Wonwoong Cho, Yan-Ying Chen, Matthew Klenk, David I. Inouye, Yanxia Zhang

机构 * Purdue University(普渡大学) Toyota Research Institute(丰田研究院)

专题命中 文生图 :diffusion(title,abstract);text-to-image(abstract);分类 cs.CV

Comments ICCV'25 (Highlight), The project page is available at https://tri-mac.github.io/att-adapter/

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.13753 2025-07-21 cs.CV 83%

Encapsulated Composition of Text-to-Image and Text-to-Video Models for High-Quality Video Synthesis

Tongtong Su, Chengyu Wang, Bingyan Liu, Jun Huang, Dongming Lu

机构 * Zhejiang University(浙江大学) Alibaba Cloud Computing(阿里云计算) South China University of Technology(华南理工大学)

专题命中 文生图 :text-to-image(title,abstract);diffusion(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.05300 2025-07-09 cs.CV cs.AI cs.CL cs.LG 83%

Structured Captions Improve Prompt Adherence in Text-to-Image Models (Re-LAION-Caption 19M)

Nicholas Merchant, Haitz Sáez de Ocáriz Borde, Andrei Cristian Popescu, Carlos Garcia Jurado Suarez

专题命中 文生图 :text-to-image(title,abstract);diffusion(abstract);分类 cs.CV

Comments 7-page main paper + appendix, 18 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.17669 2025-07-09 cs.CV 83%

TDRI: Two-Phase Dialogue Refinement and Co-Adaptation for Interactive Image Generation

Yuheng Feng, Jianhui Wang, Kun Li, Sida Li, Tianyu Shi, Haoyue Han, Miao Zhang, Xueqian Wang

机构 * organization= Xidian University , addressline= No. 2 Taibai South Road , city= Xi'an , postcode= 710071 , state= Shaanxi , country= China organization= Xiamen University Malaysia , addressline= Jalan Sunsuria, Bandar Sunsuria , city= Sepang , postcode= 43900 , state= Selangor , country= Malaysia organization= Peking University , addressline= 5 Yiheyuan Road, Haidian District , city= Beijing , postcode= 100871 , state= Beijing , country= China organization= Faculty of Applied Science \& Engineering, University of Toronto , addressline= 27 King's College Cir , city= Toronto , postcode= M5S 1A1 , state= Ontario , country= Canada organization= Shenzhen International Graduate School, Tsinghua University , addressline= University Town of Shenzhen, Nanshan District , city= Shenzhen , postcode= 518055 , state= Guangdong , country= China

专题命中 文生图 :image generation(title,abstract);text-to-image(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.03275 2025-07-08 cs.CV cs.LG 83%

ConceptMix++: Leveling the Playing Field in Text-to-Image Benchmarking via Iterative Prompt Optimization

Haosheng Gan, Berk Tinaz, Mohammad Shahab Sepehri, Zalan Fabian, Mahdi Soltanolkotabi

专题命中 文生图 :text-to-image(title,abstract);diffusion(abstract);分类 cs.CV

Comments An earlier version appeared in the CVPR 2025 Workshop on Generative Models for Computer Vision

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.00703 2025-07-02 cs.CV cs.AI cs.CL cs.LG 83%

T2I-R1: Reinforcing Image Generation with Collaborative Semantic-level and Token-level CoT

Dongzhi Jiang, Ziyu Guo, Renrui Zhang, Zhuofan Zong, Hao Li, Le Zhuo, Shilin Yan, Pheng-Ann Heng, Hongsheng Li

机构 * CUHK MMLab(CUHK多媒体实验室) CUHK MiuLar Lab(CUHK MiuLar实验室) Shanghai AI Laboratory(上海人工智能实验室)

专题命中 文生图 :image generation(title,abstract);text-to-image(abstract);分类 cs.CV

Comments Project Page: https://github.com/CaraJ7/T2I-R1

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.23440 2025-07-01 cs.CV 83%

PathDiff: Histopathology Image Synthesis with Unpaired Text and Mask Conditions

Mahesh Bhosale, Abdul Wasi, Yuanhao Zhai, Yunjie Tian, Samuel Border, Nan Xi, Pinaki Sarder, Junsong Yuan, David Doermann, Xuan Gong

机构 * University at Buffalo(布法罗大学) University of Florida(佛罗里达大学) Harvard Medical School(哈佛医学院)

专题命中 文生图 :image synthesis(title);image generation(abstract);diffusion(abstract);分类 cs.CV

Comments Accepted to ICCV 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2307.08526 2025-06-24 cs.CV cs.AI cs.LG 83%

Image Captions are Natural Prompts for Text-to-Image Models

Shiye Lei, Hao Chen, Sen Zhang, Bo Zhao, Dacheng Tao

专题命中 文生图 :text-to-image(title,abstract);image synthesis(abstract);分类 cs.CV

Comments 31 pages, 2 figure, 15 tables. Codes are available at https://github.com/LeavesLei/Caption_in_Prompt

Journal ref International Journal of Computer Vision (June 2025)

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.18095 2025-06-24 cs.CV cs.AI cs.LG 83%

ShareGPT-4o-Image: Aligning Multimodal Models with GPT-4o-Level Image Generation

Junying Chen, Zhenyang Cai, Pengcheng Chen, Shunian Chen, Ke Ji, Xidong Wang, Yunjin Yang, Benyou Wang

机构 * The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳))

专题命中 文生图 :image generation(title,abstract);text-to-image(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.16679 2025-06-23 cs.CV cs.AI cs.LG 83%

How to Train your Text-to-Image Model: Evaluating Design Choices for Synthetic Training Captions

Manuel Brack, Sudeep Katakol, Felix Friedrich, Patrick Schramowski, Hareesh Ravi, Kristian Kersting, Ajinkya Kale

机构 * Adobe Applied Research(Adobe应用研究) TU Darmstadt(图林大学达姆施塔特分校) DFKI(德意志联邦防务研究院)

专题命中 文生图 :text-to-image(title,abstract);image generation(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.13780 2025-06-18 cs.CV cs.AI cs.CY cs.LG 83%

Hidden Bias in the Machine: Stereotypes in Text-to-Image Models

Sedat Porikli, Vedat Porikli

机构 * Canyon Crest Academy(山崖顶峰学院)

专题命中 文生图 :text-to-image(title,abstract);diffusion(abstract);分类 cs.CV

Comments Equal contribution by both authors, Published at CVPR 2025 Workshop on Experimental Model Auditing via Controllable Synthesis (EMACS) and Workshop on Demographic Diversity in Computer Vision (DemoDiv)

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.04431 2025-06-18 cs.CV 83%

Infinity: Scaling Bitwise AutoRegressive Modeling for High-Resolution Image Synthesis

Jian Han, Jinlai Liu, Yi Jiang, Bin Yan, Yuqi Zhang, Zehuan Yuan, Bingyue Peng, Xiaobing Liu

机构 * ByteDance(字节跳动)

专题命中 文生图 :image synthesis(title);text-to-image(abstract);diffusion(abstract);分类 cs.CV

Comments 17 pages, 14 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.11371 2025-06-16 cs.CV 83%

A Watermark for Auto-Regressive Image Generation Models

Yihan Wu, Xuehao Cui, Ruibo Chen, Georgios Milis, Heng Huang

机构 * University of Maryland, College Park(马里兰大学 College Park分校)

专题命中 文生图 :image generation(title,abstract);image synthesis(abstract);分类 cs.CV

Comments Technical report

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.19149 2025-06-12 cs.CV cs.AI cs.CR cs.LG 83%

Multimodal Pragmatic Jailbreak on Text-to-image Models

Tong Liu, Zhixin Lai, Jiawen Wang, Gengyuan Zhang, Shuo Chen, Philip Torr, Vera Demberg, Volker Tresp, Jindong Gu

机构 * LMU Munich, Germany(慕尼黑大学) Munich Center for Machine Learning, Germany(慕尼黑机器学习中心) Saarland University, Germany(萨尔兰大学) Max Planck Institute for Informatics, Germany(马克斯·普朗克信息研究所) Cornell University, USA(康奈尔大学) University of Oxford, UK(牛津大学)

专题命中 文生图 :text-to-image(title,abstract);diffusion(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.08480 2025-06-11 cs.CL cs.AI cs.CV 83%

Re-Thinking the Automatic Evaluation of Image-Text Alignment in Text-to-Image Models

Huixuan Zhang, Xiaojun Wan

机构 * Wangxuan Institute of Computer Technology, Peking University(计算机技术研究院,北京大学)

专题命中 文生图 :text-to-image(title,abstract);image generation(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.08071 2025-06-11 cs.CV 83%

CuRe: Cultural Gaps in the Long Tail of Text-to-Image Systems

Aniket Rege, Zinnia Nie, Mahesh Ramesh, Unmesh Raskar, Zhuoran Yu, Aditya Kusupati, Yong Jae Lee, Ramya Korlakai Vinayak

机构 * University of Wisconsin-Madison(威斯康星大学麦迪逊分校) University of Washington(华盛顿大学)

专题命中 文生图 :text-to-image(title,abstract);diffusion(abstract);分类 cs.CV

Comments 41 pages, 22 figures, 17 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.03131 2025-06-04 cs.CV cs.LG 83%

Native-Resolution Image Synthesis

Zidong Wang, Lei Bai, Xiangyu Yue, Wanli Ouyang, Yiyuan Zhang

机构 * MMLab, CUHK(CUHK多媒体实验室) Shanghai AI Lab(上海人工智能实验室)

专题命中 文生图 :image synthesis(title,abstract);diffusion(abstract);分类 cs.CV

Comments Project Page: https://wzdthu.github.io/NiT/

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.17794 2025-06-02 cs.CV cs.AI 83%

Progressive Prompt Detailing for Improved Alignment in Text-to-Image Generative Models

Ketan Suhaas Saichandran, Xavier Thomas, Prakhar Kaushik, Deepti Ghadiyaram

机构 * Boston University(波士顿大学) Johns Hopkins University(约翰霍普金斯大学)

专题命中 文生图 :text-to-image(title,abstract);diffusion(abstract);分类 cs.CV

Comments Accepted at CVPR 2025 workshops (AI4CC (oral) & GMCV (poster))

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.24023 2025-06-02 cs.CV cs.AI 83%

Multi-Group Proportional Representation for Text-to-Image Models

Sangwon Jung, Alex Oesterling, Claudio Mayrink Verdun, Sajani Vithana, Taesup Moon, Flavio P. Calmon

专题命中 文生图 :text-to-image(title,abstract);image generation(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏