arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

图像生成

图像生成、文生图、图像编辑、扩散模型和可控生成。

共收录 3480 信号源:cs.CV, cs.GR, cs.MM

1. 文生图 3480 篇

2511.06876 2025-11-11 cs.CV 79%

Generating an Image From 1,000 Words: Enhancing Text-to-Image With Structured Captions

Eyal Gutflaish, Eliran Kachlon, Hezi Zisman, Tal Hacham, Nimrod Sarid, Alexander Visheratin, Saar Huberman, Gal Davidi, Guy Bukchin, Kfir Goldberg, Ron Mokady

机构 * BRIA AI(BRIA人工智能)

专题命中 文生图 :text-to-image(title,abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.21257 2025-11-11 cs.CV cs.CL 79%

Hallucination as an Upper Bound: A New Perspective on Text-to-Image Evaluation

Seyed Amir Kasaei, Mohammad Hossein Rohban

机构 * Department of Computer Engineering, Sharif University of Technology(谢里夫理工大学计算机工程系)

专题命中 文生图 :text-to-image(title,abstract);分类 cs.CV

Comments Accepted at GenProCC NeurIPS 2025 Workshop

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.24034 2025-10-29 cs.CV 79%

AutoPrompt: Automated Red-Teaming of Text-to-Image Models via LLM-Driven Adversarial Prompts

Yufan Liu, Wanqian Zhang, Huashan Chen, Lin Wang, Xiaojun Jia, Zheng Lin, Weiping Wang

机构 * Institute of Information Engineering, Chinese Academy of Sciences(中国科学院信息工程研究所) School of Cyber Security, University of Chinese Academy of Sciences(中国科学院大学网络安全学院) School of Cyberspace, Hangzhou Dianzi University(杭州电子科技大学网络空间学院) Nanyang Technological University(南洋理工大学)

专题命中 文生图 :text-to-image(title,abstract);分类 cs.CV

Comments Accepted by ICCV 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.21821 2025-10-28 cs.CV cs.AI 79%

Prompt fidelity of ChatGPT4o / Dall-E3 text-to-image visualisations

Dirk HR Spennemann

专题命中 文生图 :text-to-image(title,abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.17685 2025-10-21 cs.CV cs.AI 79%

Multilingual Text-to-Image Person Retrieval via Bidirectional Relation Reasoning and Aligning

Min Cao, Xinyu Zhou, Ding Jiang, Bo Du, Mang Ye, Min Zhang

机构 * School of Computer Science and Technology, Soochow University(苏州大学计算机科学与技术学院) School of Computer Science, Wuhan University(武汉大学计算机学院) Key Laboratory of New Generation Artificial Intelligence Technology & Its Interdisciplinary Applications (Southeast University), Ministry of Education, China(新 generation 人工智能技术及交叉应用重点实验室(东南大学),教育部,中国)

专题命中 文生图 :text-to-image(title,abstract);分类 cs.CV

Comments Final version published in IEEE Transactions on Pattern Analysis and Machine Intelligence (TPAMI). Xplore link: https://ieeexplore.ieee.org/document/11199360

详情

展开后加载摘要…

URL PDF HTML 收藏
2405.14022 2025-10-21 eess.IV cs.CV 79%

I2I-Mamba: Multi-modal medical image synthesis via selective state space modeling

Omer F. Atli, Bilal Kabas, Fuat Arslan, Arda C. Demirtas, Mahmut Yurt, Onat Dalmaz, Tolga Çukur

机构 * Department of Electrical and Electronics Engineering, and National Magnetic Resonance Research Center, Bilkent University(电子工程系和国家磁共振研究中心,比尔肯特大学) Department of Electrical Engineering, Stanford University(电气工程系,斯坦福大学)

专题命中 文生图 :image synthesis(title,abstract);分类 cs.CV

Comments 12 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.00139 2025-10-10 cs.CV 79%

EFSA: Episodic Few-Shot Adaptation for Text-to-Image Retrieval

Muhammad Huzaifa, Yova Kementchedjhieva

机构 * MBZUAI(马尔堡人工智能研究所)

专题命中 文生图 :text-to-image(title,abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.19378 2025-10-08 cs.CV cs.LG eess.IV 79%

Unified Cross-Modal Medical Image Synthesis with Hierarchical Mixture of Product-of-Experts

Reuben Dorent, Nazim Haouchine, Alexandra Golby, Sarah Frisken, Tina Kapur, William Wells

机构 * Harvard Medical School and the Brigham and Women’s Hospital(哈佛医学院和布里洛妇产科医院) MIND Team, Inria Saclay, Université Paris-Saclay, Palaiseau, France and Sorbonne Université, Institut du Cerveau - Paris Brain Institute - ICM, CNRS, Inria, Inserm, AP-HP, Hôpital de la Pitié Salpêtrière(MIND团队、Inria Saclay、巴黎萨克雷大学、Palaiseau,法国以及索邦大学、巴黎脑研究所-ICM、CNRS、Inria、Inserm、AP-HP、皮蒂埃萨勒普蒂耶医院) Massachusetts Institute of Technology(麻省理工学院)

专题命中 文生图 :image synthesis(title,abstract);分类 cs.CV

Comments Accepted in IEEE Transactions on Pattern Analysis and Machine Intelligence (TPAMI)

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.02815 2025-10-06 cs.CV 79%

Med-K2N: Flexible K-to-N Modality Translation for Medical Image Synthesis

Feng Yuan, Yifan Gao, Yuehua Ye, Haoyue Li, Xin Gao

机构 * University of Science and Technology of China(中国科学技术大学) Suzhou Institute of Biomedical Engineering and Technology(苏州生物医学工程与技术研究所) Chinese Academy of Sciences(中国科学院) The Third Affiliated Hospital of Sun Yat-sen University(中山大学第三附属医院)

专题命中 文生图 :image synthesis(title,abstract);分类 cs.CV

Comments ICLR2026 under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.24913 2025-10-03 cs.CV cs.AI 79%

Segmentor-Guided Counterfactual Fine-Tuning for Locally Coherent and Targeted Image Synthesis

Tian Xia, Matthew Sinclair, Andreas Schuh, Fabio De Sousa Ribeiro, Raghav Mehta, Rajat Rasal, Esther Puyol-Antón, Samuel Gerber, Kersten Petersen, Michiel Schaap, Ben Glocker

机构 * Department of Computing, Imperial College London, UK(帝国理工学院 computing 部, 英国) Heartflow, Inc., Mountain View, CA, USA(Heartflow 公司, 美国)

专题命中 文生图 :image synthesis(title);image generation(abstract);分类 cs.CV

Comments Accepted at MICCAI 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.00046 2025-10-02 cs.CV cs.AI 79%

Reinforcement Learning-Based Prompt Template Stealing for Text-to-Image Models

Xiaotian Zou

机构 * Xiaotian Zou

专题命中 文生图 :text-to-image(title,abstract);分类 cs.CV

Comments 10 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.22485 2025-09-29 cs.CV 79%

Group Critical-token Policy Optimization for Autoregressive Image Generation

Guohui Zhang, Hu Yu, Xiaoxiao Ma, JingHao Zhang, Yaning Pan, Mingde Yao, Jie Xiao, Linjiang Huang, Feng Zhao

机构 * University of Science and Technology of China(中国科学技术大学) Shanghai Innovation Institute(上海创新研究院) Fudan University(复旦大学) CUHK(香港中文大学) Beihang University(北京航空航天大学)

专题命中 文生图 :image generation(title);text-to-image(abstract);分类 cs.CV

Comments Code is available at https://github.com/zghhui/GCPO

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.21360 2025-09-29 cs.CV cs.AI 79%

Multimodal Prompt Decoupling Attack on the Safety Filters in Text-to-Image Models

Xingkai Peng, Jun Jiang, Meng Tong, Shuai Li, Weiming Zhang, Nenghai Yu, Kejiang Chen

机构 * University of Science and Technology of China(中国科学技术大学)

专题命中 文生图 :text-to-image(title,abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.15803 2025-09-22 cs.CV cs.AI 79%

CIDER: A Causal Cure for Brand-Obsessed Text-to-Image Models

Fangjian Shen, Zifeng Liang, Chao Wang, Wushao Wen

机构 * School of Computer Science(计算机科学学院) Engineering, Sun Yat-sen University, Guangzhou, China(工程学院,中山大学,广州,中国)

专题命中 文生图 :text-to-image(title,abstract);分类 cs.CV

Comments 5 pages, 7 figures, submitted to ICASSP2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.07027 2025-09-19 cs.CV cs.AI cs.LG 79%

Moment- and Power-Spectrum-Based Gaussianity Regularization for Text-to-Image Models

Jisung Hwang, Jaihoon Kim, Minhyuk Sung

机构 * KAIST(韩国科学技术院)

专题命中 文生图 :text-to-image(title,abstract);分类 cs.CV

Comments Accepted to NeurIPS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2403.01489 2025-09-09 cs.CV cs.AI 79%

Regeneration Based Training-free Attribution of Fake Images Generated by Text-to-Image Generative Models

Meiling Li, Zhenxing Qian, Xinpeng Zhang

专题命中 文生图 :text-to-image(title,abstract);分类 cs.CV

Comments The paper has been withdrawn by the authors because the proposed approach is currently undergoing optimization and improvement. We are refining the methodology to achieve more robust and convincing results, and a revised version will be submitted once the enhancements are completed

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.01028 2025-09-04 cs.CV 79%

CompSlider: Compositional Slider for Disentangled Multiple-Attribute Image Generation

Zixin Zhu, Kevin Duarte, Mamshad Nayeem Rizve, Chengyuan Xu, Ratheesh Kalarot, Junsong Yuan

机构 * University at Buffalo(布法罗大学) Adobe Inc. (ASML)(Adobe公司)

专题命中 文生图 :image generation(title);text-to-image(abstract);分类 cs.CV

Comments Accepted by ICCV 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.16636 2025-08-18 cs.CL cs.CV 79%

Visual-RAG: Benchmarking Text-to-Image Retrieval Augmented Generation for Visual Knowledge Intensive Queries

Yin Wu, Quanyu Long, Jing Li, Jianfei Yu, Wenya Wang

专题命中 文生图 :text-to-image(title,abstract);分类 cs.CV

Comments 21 pages, 6 figures, 17 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.04472 2025-08-07 cs.CV cs.AI cs.LG 79%

Zero-Residual Concept Erasure via Progressive Alignment in Text-to-Image Model

Hongxu Chen, Zhen Wang, Taoran Mei, Lin Li, Bowei Zhu, Runshi Li, Long Chen

机构 * The Hong Kong University of Science and Technology(香港科学与技术大学) University of Science and Technology of China(中国科学技术大学)

专题命中 文生图 :text-to-image(title,abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.03696 2025-08-07 cs.CR cs.AI cs.CV 79%

PLA: Prompt Learning Attack against Text-to-Image Generative Models

Xinqi Lyu, Yihao Liu, Yanjie Li, Bin Xiao

机构 * The Hong Kong Polytechnic University(香港理工大学)

专题命中 文生图 :text-to-image(title,abstract);分类 cs.CV

Comments 10 pages, 3 figures, and published to ICCV2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.07730 2025-08-05 cs.CV 79%

Democratizing Text-to-Image Masked Generative Models with Compact Text-Aware One-Dimensional Tokens

Dongwon Kim, Ju He, Qihang Yu, Chenglin Yang, Xiaohui Shen, Suha Kwak, Liang-Chieh Chen

机构 * ByteDance Seed(字节跳动种子) POSTECH

专题命中 文生图 :text-to-image(title,abstract);分类 cs.CV

Comments ICCV 2025. Project page at https://tacju.github.io/projects/maskgen.html

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.20536 2025-07-30 cs.CV cs.AI cs.HC 79%

T2I-Copilot: A Training-Free Multi-Agent Text-to-Image System for Enhanced Prompt Interpretation and Interactive Generation

Chieh-Yun Chen, Min Shi, Gong Zhang, Humphrey Shi

专题命中 文生图 :text-to-image(title,abstract);分类 cs.CV

Comments ICCV 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.15606 2025-07-22 cs.CV 79%

CylinderPlane: Nested Cylinder Representation for 3D-aware Image Generation

Ru Jia, Xiaozhuang Ma, Jianji Wang, Nanning Zheng

专题命中 文生图 :image generation(title);image synthesis(abstract);分类 cs.CV

Comments 5 pages, 4 figures, to be published

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.13383 2025-07-21 cs.LG cs.AI cs.CV 79%

Whose View of Safety? A Deep DIVE Dataset for Pluralistic Alignment of Text-to-Image Models

Charvi Rastogi, Tian Huey Teh, Pushkar Mishra, Roma Patel, Ding Wang, Mark Díaz, Alicia Parrish, Aida Mostafazadeh Davani, Zoe Ashwood, Michela Paganini, Vinodkumar Prabhakaran, Verena Rieser, Lora Aroyo

机构 * Google DeepMind(谷歌DeepMind) Google Research(谷歌研究)

专题命中 文生图 :text-to-image(title,abstract);分类 cs.CV

Comments 28 pages, 16 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.23418 2025-07-01 cs.CV 79%

Why Settle for Mid: A Probabilistic Viewpoint to Spatial Relationship Alignment in Text-to-image Models

Parham Rezaei, Arash Marioriyad, Mahdieh Soleymani Baghshah, Mohammad Hossein Rohban

机构 * Department of Computer Engineering(计算机工程系) Sharif University of Technology(谢赫·伊斯兰技术大学)

专题命中 文生图 :text-to-image(title,abstract);分类 cs.CV

Comments 12 main pages, 18 figures, and 16 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.22864 2025-07-01 cs.CV cs.AI cs.CL 79%

Mask-aware Text-to-Image Retrieval: Referring Expression Segmentation Meets Cross-modal Retrieval

Li-Cheng Shen, Jih-Kang Hsieh, Wei-Hua Li, Chu-Song Chen

机构 * National Taiwan University(国立台湾大学)

专题命中 文生图 :text-to-image(title,abstract);分类 cs.CV

Comments ICMR 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2403.09605 2025-06-17 cs.CV cs.AI 79%

Counterfactual contrastive learning: robust representations via causal image synthesis

Melanie Roschewitz, Fabio De Sousa Ribeiro, Tian Xia, Galvin Khara, Ben Glocker

机构 * Imperial College London(帝国理工学院伦敦分校) Kheiron Medical Technologies(Kheiron医疗技术)

专题命中 文生图 :image synthesis(title);image generation(abstract);分类 cs.CV

Comments Extended version available at https://doi.org/10.1016/j.media.2025.103668. This version was published in the proceedings of the MICCAI 2024 Data Engineering in Medical Imaging workshop. Code available at https://github.com/biomedia-mira/counterfactual-contrastive

Journal ref Data Engineering in Medical Imaging. DEMI 2024. Lecture Notes in Computer Science, vol 15265

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.11753 2025-06-16 eess.IV cs.CV 79%

Exploring the Effectiveness of Deep Features from Domain-Specific Foundation Models in Retinal Image Synthesis

Zuzanna Skorniewska, Bartlomiej W. Papiez

专题命中 文生图 :image synthesis(title);image generation(abstract);分类 cs.CV

Comments To be published and presented at the MIUA 2025 conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.11036 2025-06-16 cs.LG cs.MM 79%

Human-centered Interactive Learning via MLLMs for Text-to-Image Person Re-identification

Yang Qin, Chao Chen, Zhihang Fu, Dezhong Peng, Xi Peng, Peng Hu

机构 * College of Computer Science, Sichuan University(四川大学计算机学院) National Key Laboratory of Fundamental Algorithms and Models for Engineering Simulation, Sichuan University(四川大学国家工程仿真基础算法与模型重点实验室) Sichuan National Innovation New Vision UHD Video Technology Co., Ltd(四川国家创新新视觉超高清视频技术有限公司) Tianfu Jincheng Laboratory(天府锦城实验室)

专题命中 文生图 :text-to-image(title,abstract);分类 cs.MM

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.05108 2025-06-06 cs.CV 79%

DIMCIM: A Quantitative Evaluation Framework for Default-mode Diversity and Generalization in Text-to-Image Generative Models

Revant Teotia, Candace Ross, Karen Ullrich, Sumit Chopra, Adriana Romero-Soriano, Melissa Hall, Matthew J. Muckley

机构 * FAIR at Meta - New York and Montreal labs(Meta 新 York 和 Montreal 实验室) Courant Institute for Mathematical Sciences, NYU(纽约大学应用数学科学研究所) Mila - Quebec AI Institute(魁北克人工智能研究所) McGill University(麦吉尔大学) Canada CIFAR AI chair(加拿大 CIFAR 人工智能主席)

专题命中 文生图 :text-to-image(title,abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏