arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

图像生成

图像生成、文生图、图像编辑、扩散模型和可控生成。

共收录 3472 信号源:cs.CV, cs.GR, cs.MM

1. 文生图 3472 篇

2602.09165 2026-02-11 cs.CV 89%

All-in-One Conditioning for Text-to-Image Synthesis

文本到图像合成的综合条件化

Hirunima Jayasekara, Chuong Huynh, Yixuan Ren, Christabel Acquaye, Abhinav Shrivastava

机构 * University of Maryland, College Park(马里兰大学学院公园分校)

专题命中 文生图 :text-to-image(title,abstract);image synthesis(title,abstract);diffusion(abstract);分类 cs.CV

AI总结 本文提出基于场景图的零样本条件化机制,通过轻量级语言模型生成视觉条件,提升文本到图像合成的语义一致性和生成多样性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2405.16895 2026-02-09 cs.CV 89%

Anonymization Prompt Learning for Facial Privacy-Preserving Text-to-Image Generation

面向面部隐私保护的匿名化提示学习

Liang Shi, Jie Zhang, Shiguang Shan

机构 * University of Chinese Academy of Sciences(中国科学院大学)

专题命中 文生图 :image generation(title,abstract);text-to-image(title,abstract);diffusion(abstract);分类 cs.CV

AI总结 本文提出匿名化提示学习方法,通过训练可学习的提示前缀,实现文本到图像生成中面部身份的匿名化,以保护隐私并防止深度伪造风险。

Comments Accepted by IJCV

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.06884 2026-01-26 cs.CV cs.AI cs.LG 89%

Text-to-Image Diffusion Models Cannot Count, and Prompt Refinement Cannot Help

文本到图像扩散模型无法计数,提示细化无法帮助

Xuyang Guo, Jiayan Huo, Yingyu Liang, Zhenmei Shi, Zhao Song, Jiahao Zhang, Zhen Zhuang

机构 * Department of XXX, University of YYY, Location, Country(XXX系,YYY大学,地点,国家) School of ZZZ, Institute of WWW, Location, Country(ZZZ学院,WWW研究所,地点,国家)

专题命中 文生图 :text-to-image(title,abstract);diffusion(title,abstract);image generation(abstract);分类 cs.CV

AI总结 文本到图像扩散模型在计数任务上存在根本性缺陷,现有方法无法有效提升计数准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.10332 2026-01-16 cs.CV 89%

Think-Then-Generate: Reasoning-Aware Text-to-Image Diffusion with LLM Encoders

思考-然后-生成:基于LLM编码器的推理感知文本到图像扩散模型

Siqi Kou, Jiachun Jin, Zetong Zhou, Ye Ma, Yugang Wang, Quan Chen, Peng Jiang, Xiao Yang, Jun Zhu, Kai Yu, Zhijie Deng

机构 * Shanghai Jiao Tong University(上海交通大学) Kuaishou Technology(快手科技) Tsinghua University(清华大学)

专题命中 文生图 :text-to-image(title,abstract);diffusion(title,abstract);image generation(abstract);分类 cs.CV

AI总结 本文提出基于LLM编码器的推理感知文本到图像扩散模型,通过推理重写提示提升生成质量,达到接近GPT-4的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.10710 2026-01-06 cs.CV 89%

CountCluster: Training-Free Object Quantity Guidance with Cross-Attention Map Clustering for Text-to-Image Generation

CountCluster: 无训练对象数量引导与跨注意力图聚类用于文本到图像生成

Joohyeon Lee, Jin-Seop Lee, Jee-Hyong Lee

机构 * Sungkyunkwan University(釜山大学)

专题命中 文生图 :image generation(title,abstract);text-to-image(title,abstract);diffusion(abstract);分类 cs.CV

AI总结 CountCluster通过无训练的跨注意力图聚类方法提升文本到图像生成中对象数量的准确性与控制性能。

Comments Under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.02824 2025-12-24 cs.CV cs.AI cs.CR 89%

Towards Dataset Copyright Evasion Attack against Personalized Text-to-Image Diffusion Models

面向个性化文本到图像扩散模型的数据集版权规避攻击

Kuofeng Gao, Yufei Zhu, Yiming Li, Jiawang Bai, Yong Yang, Zhifeng Li, Shu-Tao Xia

机构 * Tsinghua Shenzhen International Graduate School, Tsinghua University(清华大学深圳国际研究生院) Peng Cheng Laboratory(鹏城实验室) College of Computer Science and Software Engineering, Shenzhen University(深圳大学计算机科学与软件工程学院) Nanyang Technological University(南洋理工大学) Tencent(腾讯)

专题命中 文生图 :text-to-image(title,abstract);diffusion(title,abstract);image generation(abstract);分类 cs.CV

AI总结 本文提出CEAT2I,一种针对文本到图像扩散模型中数据集版权验证机制的版权规避攻击方法,通过检测水印样本、识别触发令牌和移除水印三阶段实现绕过验证。

Comments Accepted by IEEE Transactions on Information Forensics and Security

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.17909 2025-12-22 cs.CV 89%

Both Semantics and Reconstruction Matter: Making Representation Encoders Ready for Text-to-Image Generation and Editing

语义与重建同样重要:使表示编码器为文本到图像生成和编辑做好准备

Shilong Zhang, He Zhang, Zhifei Zhang, Chongjian Ge, Shuchen Xue, Shaoteng Liu, Mengwei Ren, Soo Ye Kim, Yuqian Zhou, Qing Liu, Daniil Pakhomov, Kai Zhang, Zhe Lin, Ping Luo

机构 * The University of Hong Kong(香港大学) Adobe Research(Adobe研究)

专题命中 文生图 :text-to-image(title,abstract);image generation(title);diffusion(abstract);image editing(abstract)

AI总结 本文提出一种框架,通过语义-像素重建目标正则化潜在空间,使编码器特征更适用于生成任务,实现高质量图像生成和编辑。

Comments Project Page: https://jshilong.github.io/PS-VAE-PAGE/

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.09560 2025-12-19 eess.IV cs.CV 89%

StructDiff: Structure-aware Diffusion Model for 3D Fine-grained Medical Image Synthesis

StructDiff: 一种结构感知的扩散模型用于3D细粒度医学图像合成

Jiahao Xia, Yutao Hu, Yaolei Qi, Zhenliang Li, Wenqi Shao, Junjun He, Ying Fu, Longjiang Zhang, Guanyu Yang

机构 * Key Laboratory of New Generation Artificial Intelligence Technology and Its Interdisciplinary Applications (Southeast University), Ministry of Education, China(新一代人工智能技术及跨学科应用关键实验室(东南大学),中华人民共和国教育部,中国) Jiangsu Province Joint International Research Laboratory of Medical Information Processing, Southeast University, Nanjing, China(江苏省医疗信息处理联合国际研究实验室(东南大学),南京市,中国) Univ Rennes, CHU Rennes, Inserm, LTSI– UMR 1099, F-35000 Rennes, France(里昂大学,里昂大学医院,Inserm,LTSI– UMR 1099,法国里昂,法国) Shanghai AI Laboratory(上海人工智能实验室) School of Computer Science and Technology, Beijing Institute of Technology, Beijing, China(计算机科学与技术学院,北京理工大学,北京,中国) Department of Radiology, Jinling Hospital, Affiliated Hospital of Medical School, Nanjing University, Nanjing, China(放射科,南京大学附属医院,南京大学,南京,中国)

专题命中 文生图 :diffusion(title,abstract);image synthesis(title,abstract);image generation(abstract);分类 cs.CV

AI总结 StructDiff通过结构感知扩散模型解决3D医学图像细粒度生成中的拓扑一致性和细节还原问题,提升下游分割性能。

Comments 17 pages, 10 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.11749 2025-12-15 cs.CV 89%

SVG-T2I: Scaling Up Text-to-Image Latent Diffusion Model Without Variational Autoencoder

SVG-T2I: 在视觉基础模型表示空间中扩展文本到图像的潜在扩散模型而不使用变分自编码器

Minglei Shi, Haolin Wang, Borui Zhang, Wenzhao Zheng, Bohan Zeng, Ziyang Yuan, Xiaoshi Wu, Yuanxing Zhang, Huan Yang, Xintao Wang, Pengfei Wan, Kun Gai, Jie Zhou, Jiwen Lu

机构 * Department of Automation, Tsinghua University(自动化系,清华大学) Kling Team, Kuaishou Technology(快手技术团队)

专题命中 文生图 :text-to-image(title,abstract);diffusion(title,abstract);image synthesis(abstract);分类 cs.CV

AI总结 SVG-T2I通过在视觉基础模型表示空间中直接进行文本到图像生成,实现了高质量的图像合成并验证了VFM在生成任务中的能力。

Comments Code Repository: https://github.com/KlingTeam/SVG-T2I; Model Weights: https://huggingface.co/KlingTeam/SVG-T2I

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.16713 2025-12-15 cs.CV 89%

Conditional Text-to-Image Generation with Reference Guidance

基于参考引导的条件文本到图像生成

Taewook Kim, Ze Wang, Zhengyuan Yang, Jiang Wang, Lijuan Wang, Zicheng Liu, Qiang Qiu

机构 * Purdue University(普渡大学) AMD Microsoft(微软)

专题命中 文生图 :image generation(title,abstract);text-to-image(title,abstract);diffusion(abstract);分类 cs.CV

AI总结 本文提出基于参考引导的条件文本到图像生成方法,通过专家插件提升模型在文本拼写和多语言生成等任务上的表现。

Comments WACV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.00473 2025-12-02 cs.CV cs.AI 89%

RealGen: Photorealistic Text-to-Image Generation via Detector-Guided Rewards

RealGen:通过检测器引导的奖励实现逼真文本到图像生成

Junyan Ye, Leiqi Zhu, Yuncheng Guo, Dongzhi Jiang, Zilong Huang, Yifan Zhang, Zhiyuan Yan, Haohuan Fu, Conghui He, Weijia Li

机构 * Shanghai AI Lab(上海人工智能实验室) Sun Yat-Sen University(中山大学) Nanjing University(南京大学) CUHK MMLab(香港中文大学多模态实验室) Tsinghua University(清华大学) Peking University(北京大学)

专题命中 文生图 :image generation(title,abstract);text-to-image(title,abstract);diffusion(abstract);分类 cs.CV

AI总结 RealGen通过检测器引导的奖励机制提升文本到图像生成的真实感和细节,优于现有模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.20973 2025-11-24 cs.LG cs.CV 89%

Model-Agnostic Gender Bias Control for Text-to-Image Generation via Sparse Autoencoder

面向文本到图像生成的模型无关性别偏见控制:通过稀疏自编码器

Chao Wu, Zhenyi Wang, Kangxian Xie, Naresh Kumar Devulapally, Vishnu Suresh Lokhande, Mingchen Gao

机构 * University at Buffalo, USA(美国布法罗大学) University of Maryland, College Park, USA(马里兰大学 College Park 分校)

专题命中 文生图 :image generation(title,abstract);text-to-image(title,abstract);diffusion(abstract);分类 cs.CV

AI总结 本文提出SAE Debias,通过稀疏自编码器在文本到图像生成中减轻性别偏见,提供可解释且模型无关的去偏方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.01517 2025-11-04 cs.CV 89%

NSYNC: Negative Synthetic Image Generation for Contrastive Training to Improve Stylized Text-To-Image Translation

Serkan Ozturk, Samet Hicsonmez, Pinar Duygulu

机构 * Dept. of Computer Engineering, Hacettepe University(计算机工程系,哈切特佩大学) University of Luxembourg(卢森堡大学)

专题命中 文生图 :image generation(title,abstract);text-to-image(title,abstract);diffusion(abstract);分类 cs.CV

Comments Under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.23574 2025-10-28 cs.CV 89%

More Than Generation: Unifying Generation and Depth Estimation via Text-to-Image Diffusion Models

Hongkai Lin, Dingkang Liang, Mingyang Du, Xin Zhou, Xiang Bai

机构 * Huazhong University of Science and Technology(华中科技大学)

专题命中 文生图 :text-to-image(title,abstract);diffusion(title,abstract);image generation(abstract);分类 cs.CV

Comments Accepted by NeurIPS 2025. The code will be made available at https://github.com/H-EmbodVis/MERGE

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.00010 2025-10-20 cs.LG cs.GR cs.MA 89%

LayerCraft: Enhancing Text-to-Image Generation with CoT Reasoning and Layered Object Integration

Yuyao Zhang, Jinghao Li, Yu-Wing Tai

机构 * Dartmouth College(达特茅斯学院) CUHK(香港大学)

专题命中 文生图 :image generation(title,abstract);text-to-image(title,abstract);image editing(abstract);分类 cs.GR

Comments 26 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.02710 2025-10-07 cs.CV cs.AI cs.CR 89%

SteerDiff: Steering towards Safe Text-to-Image Diffusion Models

Hongxiang Zhang, Yifeng He, Hao Chen

机构 * University of California, Davis(加州大学戴维斯分校)

专题命中 文生图 :text-to-image(title,abstract);diffusion(title,abstract);image generation(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.03255 2025-09-29 cs.CV 89%

DynamicControl: Adaptive Condition Selection for Improved Text-to-Image Generation

Qingdong He, Jinlong Peng, Pengcheng Xu, Boyuan Jiang, Xiaobin Hu, Donghao Luo, Yong Liu, Yabiao Wang, Chengjie Wang, Xiangtai Li, Jiangning Zhang

机构 * Youtu Lab, Tencent(腾讯优图实验室) Western University(西部大学) Nanyang Technological University(南洋理工大学) Zhejiang University(浙江大学)

专题命中 文生图 :text-to-image(title,abstract);image generation(title);diffusion(abstract);image synthesis(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.13496 2025-09-18 cs.CV cs.LG 89%

BiasMap: Leveraging Cross-Attentions to Discover and Mitigate Hidden Social Biases in Text-to-Image Generation

Rajatsubhra Chakraborty, Xujun Che, Depeng Xu, Cori Faklaris, Xi Niu, Shuhan Yuan

机构 * Institute for Clarity in Documentation(清晰文档研究所) Inria Paris-Rocquencourt(巴黎-罗克琴court研究所) Rajiv Gandhi University(拉吉夫·甘地大学) Tsinghua University(清华大学) Palmer Research Laboratories(帕勒尔研究实验室) University of North Carolina at Charlotte(北卡罗来纳大学教堂山分校) Utah State University(犹他州立大学)

专题命中 文生图 :image generation(title,abstract);text-to-image(title,abstract);diffusion(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.06945 2025-09-10 cs.CV cs.AI cs.CL cs.LG 89%

Interleaving Reasoning for Better Text-to-Image Generation

Wenxuan Huang, Shuang Chen, Zheyong Xie, Shaosheng Cao, Shixiang Tang, Yufan Shen, Qingyu Yin, Wenbo Hu, Xiaoman Wang, Yuntian Tang, Junbo Qiao, Yue Guo, Yao Hu, Zhenfei Yin, Philip Torr, Yu Cheng, Wanli Ouyang, Shaohui Lin

机构 * East China Normal University(华东师范大学) The Chinese University of Hong Kong(香港中文大学) Xiaohongshu Inc.(小红书公司) University of California, Los Angeles(加州大学洛杉矶分校) Zhejiang University(浙江大学) University of Oxford(牛津大学)

专题命中 文生图 :image generation(title,abstract);text-to-image(title,abstract);image synthesis(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.00177 2025-09-03 cs.CV 89%

Category-level Text-to-Image Retrieval Improved: Bridging the Domain Gap with Diffusion Models and Vision Encoders

Faizan Farooq Khan, Vladan Stojnić, Zakaria Laskar, Mohamed Elhoseiny, Giorgos Tolias

机构 * King Abdullah University of Science and Technology(国王阿卜杜勒-阿齐兹大学科学与技术大学) Visual Recognition Group(视觉识别组) Faculty of Electrical Engineering(电气工程学院) Czech Technical University in Prague(布拉格捷克技术大学)

专题命中 文生图 :text-to-image(title,abstract);diffusion(title,abstract);image generation(abstract);分类 cs.CV

Comments BMVC 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2305.15194 2025-08-27 cs.CV cs.AI cs.LG 89%

DiffBlender: Composable and Versatile Multimodal Text-to-Image Diffusion Models

Sungnyun Kim, Junsoo Lee, Kibeom Hong, Daesik Kim, Namhyuk Ahn

机构 * KAIST AI(韩国科学技术院人工智能研究所) NAVER WEBTOON AI Sookmyung Women’s University(成均馆女子大学) Inha University(釜山大学)

专题命中 文生图 :text-to-image(title,abstract);diffusion(title,abstract);image synthesis(abstract);分类 cs.CV

Comments Expert Systems with Applications 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.17718 2025-08-26 cs.CV cs.AI 89%

Instant Preference Alignment for Text-to-Image Diffusion Models

Yang Li, Songlin Yang, Xiaoxuan Han, Wei Wang, Jing Dong, Yueming Lyu, Ziyu Xue

机构 * New Laboratory of Pattern Recognition, CASIA(模式识别新实验室,中国科学院自动化研究所) The Hong Kong University of Science and Technology(香港科技大学) Nanjing university(南京大学) Academy of Broadcasting Science, NRTA(广播科学研究院,国家广播电视总局)

专题命中 文生图 :text-to-image(title,abstract);diffusion(title,abstract);image generation(abstract);分类 cs.CV

Comments 17 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.09575 2025-08-14 cs.CV 89%

Dual Recursive Feedback on Generation and Appearance Latents for Pose-Robust Text-to-Image Diffusion

Jiwon Kim, Pureum Kim, SeonHwa Kim, Soobin Park, Eunju Cha, Kyong Hwan Jin

机构 * Korea University(韩国大学) Sookmyung Women’s University(肃明女子大学)

专题命中 文生图 :text-to-image(title,abstract);diffusion(title,abstract);image generation(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.05399 2025-08-08 cs.CV cs.AI cs.LG 89%

UNCAGE: Contrastive Attention Guidance for Masked Generative Transformers in Text-to-Image Generation

Wonjun Kang, Byeongkeun Ahn, Minjae Lee, Kevin Galim, Seunghyuk Oh, Hyung Il Koo, Nam Ik Cho

专题命中 文生图 :image generation(title,abstract);text-to-image(title,abstract);diffusion(abstract);分类 cs.CV

Comments Code is available at https://github.com/furiosa-ai/uncage

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.04732 2025-08-08 cs.LG cs.GR 89%

LumiGen: An LVLM-Enhanced Iterative Framework for Fine-Grained Text-to-Image Generation

Xiaoqi Dong, Xiangyu Zhou, Nicholas Evans, Yujia Lin

机构 * Dali University(大理大学) Bandırma Onyedi Eylül University(班迪尔马第十七个九月大学)

专题命中 文生图 :image generation(title,abstract);text-to-image(title,abstract);diffusion(abstract);分类 cs.GR

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.03006 2025-08-06 cs.CV 89%

Seeing It Before It Happens: In-Generation NSFW Detection for Diffusion-Based Text-to-Image Models

Fan Yang, Yihao Huang, Jiayi Zhu, Ling Shi, Geguang Pu, Jin Song Dong, Kailong Wang

机构 * Huazhong University of Science and Technology(华中科技大学) National University of Singapore(新加坡国立大学) East China Normal University(华东师范大学) Nanyang Technological University(南洋理工大学)

专题命中 文生图 :text-to-image(title,abstract);diffusion(title,abstract);image generation(abstract);分类 cs.CV

Comments 8 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.00319 2025-08-04 cs.CV cs.LG 89%

Steering Guidance for Personalized Text-to-Image Diffusion Models

Sunghyun Park, Seokeon Choi, Hyoungwoo Park, Sungrack Yun

机构 * Qualcomm AI Research(高通人工智能研究)

专题命中 文生图 :text-to-image(title,abstract);diffusion(title,abstract);image generation(abstract);分类 cs.CV

Comments ICCV 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.23001 2025-08-01 eess.IV cs.CV 89%

LesionGen: A Concept-Guided Diffusion Model for Dermatology Image Synthesis

Jamil Fayyad, Nourhan Bayasi, Ziyang Yu, Homayoun Najjaran

机构 * University of Victoria, Canada(维多利亚大学,加拿大) University of British Columbia, Canada(不列颠哥伦比亚大学,加拿大) University of Toronto, Canada(多伦多大学,加拿大)

专题命中 文生图 :diffusion(title,abstract);image synthesis(title,abstract);text-to-image(abstract);分类 cs.CV

Comments Accepted at the MICCAI 2025 ISIC Workshop

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.12771 2025-07-18 cs.CV cs.AI 89%

Local Representative Token Guided Merging for Text-to-Image Generation

Min-Jeong Lee, Hee-Dong Kim, Seong-Whan Lee

机构 * Department of Artificial Intelligence, Korea University(人工智能系,韩国大学)

专题命中 文生图 :image generation(title,abstract);text-to-image(title,abstract);diffusion(abstract);分类 cs.CV

Comments 6 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.12356 2025-07-11 cs.CV cs.AI 89%

Localized Concept Erasure for Text-to-Image Diffusion Models Using Training-Free Gated Low-Rank Adaptation

Byung Hyun Lee, Sungjin Lim, Se Young Chun

机构 * Department of ECE(电子工程系) IPAI INMC Seoul National University(首尔国立大学)

专题命中 文生图 :text-to-image(title,abstract);diffusion(title,abstract);image generation(abstract);分类 cs.CV

Comments Accepted to CVPR 2025

详情

展开后加载摘要…

URL PDF HTML 收藏