arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

图像生成

图像生成、文生图、图像编辑、扩散模型和可控生成。

共收录 86350 信号源:cs.CV, cs.GR, cs.MM

1. 文生图 3474 篇

2512.22681 2026-01-01 cs.CV 88%

CritiFusion: Semantic Critique and Spectral Alignment for Faithful Text-to-Image Generation

CritiFusion: 语义批评与频谱对齐用于忠实的文本到图像生成

ZhenQi Chen, TsaiChing Ni, YuanFu Yang

机构 * National Yang Ming Chiao Tung University

专题命中 文生图 :text-to-image(title,abstract);image generation(title);diffusion(abstract);分类 cs.CV

AI总结 CritiFusion通过语义批评和频谱对齐提升文本到图像生成的忠实度和细节质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.16443 2026-01-01 cs.CV 88%

Geometric Disentanglement of Text Embeddings for Subject-Consistent Text-to-Image Generation using A Single Prompt

基于几何解耦的文本嵌入去纠缠:利用单一提示进行主题一致的文本到图像生成

Shangxun Li, Youngjung Uh

机构 * Yonsei University(延世大学)

专题命中 文生图 :text-to-image(title,abstract);image generation(title);diffusion(abstract);分类 cs.CV

AI总结 本文提出一种无需训练的方法,通过几何视角优化文本嵌入,解决文本到图像生成中主题一致性不足的问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.23546 2025-12-30 cs.CV 88%

PurifyGen: A Risk-Discrimination and Semantic-Purification Model for Safe Text-to-Image Generation

PurifyGen:一种用于安全文本到图像生成的风险判别和语义净化模型

Zongsheng Cao, Yangfan He, Anran Liu, Jun Xie, Feng Chen, Zepeng Wang

机构 * Researcher(研究者)

专题命中 文生图 :text-to-image(title,abstract);image generation(title);diffusion(abstract);分类 cs.CV

AI总结 PurifyGen通过双阶段策略实现安全文本到图像生成,通过语义距离评估和双空间转换净化危险提示,减少不安全内容生成。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.17851 2025-12-30 cs.CV cs.AI 88%

InfSplign: Inference-Time Spatial Alignment of Text-to-Image Diffusion Models

InfSplign: 文本到图像扩散模型推理时的空间对齐

Sarah Rastegar, Violeta Chatalbasheva, Sieger Falkena, Anuj Singh, Yanbo Wang, Tejas Gokhale, Hamid Palangi, Hadi Jamali-Rad

机构 * Delft University of Technology(代尔夫特理工大学) University of Maryland Baltimore County(马里兰大学巴尔的摩县分校) Shell Information Technology International(壳牌信息科技国际) Google(谷歌)

专题命中 文生图 :text-to-image(title,abstract);diffusion(title,abstract);分类 cs.CV

AI总结 InfSplign通过推理时调整噪声的复合损失,提升文本到图像扩散模型的空间对齐性能,实现新的最先进的结果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.23022 2025-12-29 cs.CV 88%

Copyright Infringement Detection in Text-to-Image Diffusion Models via Differential Privacy

通过差分隐私在文本到图像扩散模型中检测版权侵权

Xiafeng Man, Zhipeng Wei, Jingjing Chen

专题命中 文生图 :text-to-image(title,abstract);diffusion(title,abstract);分类 cs.CV

AI总结 本文提出DPM框架,通过差分隐私概念检测文本到图像扩散模型中的版权侵权,无需原始数据集即可实现可靠检测。

Comments AAAI 2026 (Oral)

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.18675 2025-12-23 cs.CV 88%

AsyncDiff: Asynchronous Timestep Conditioning for Enhanced Text-to-Image Diffusion Inference

AsyncDiff: 异步时间步条件化以提升文本到图像扩散推理

Longhuan Xu, Feng Yin, Cunjian Chen

机构 * Southeast University-Monash University Joint Graduate School(东南大学-墨尔本大学联合研究生院) Southeast University(东南大学) Monash University(墨尔本大学)

专题命中 文生图 :text-to-image(title,abstract);diffusion(title,abstract);分类 cs.CV

AI总结 AsyncDiff通过异步时间步条件化提升文本到图像扩散推理性能,采用轻量时间步预测模块和动态缩放参数实现更灵活的噪声控制。

Comments Under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.09814 2025-12-11 cs.CV 88%

DynaIP: Dynamic Image Prompt Adapter for Scalable Zero-shot Personalized Text-to-Image Generation

DynaIP: 动态图像提示适配器用于可扩展的零样本个性化文本到图像生成

Zhizhong Wang, Tianyi Chu, Zeyi Huang, Nanyang Wang, Kehan Li

机构 * Central Media Technology Institute, Huawei(华为中央媒体技术研究所)

专题命中 文生图 :text-to-image(title,abstract);image generation(title);diffusion(abstract);分类 cs.CV

AI总结 DynaIP通过动态解耦策略和层次特征融合模块,提升零样本个性化文本到图像生成的细粒度概念保真度与多主体扩展能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.03844 2025-12-04 cs.CV 88%

CoDA: From Text-to-Image Diffusion Models to Training-Free Dataset Distillation

CoDA:从文本到图像扩散模型到无训练数据集蒸馏

Letian Zhou, Songhua Liu, Xinchao Wang

专题命中 文生图 :text-to-image(title,abstract);diffusion(title,abstract);分类 cs.CV

AI总结 CoDA通过核心分布对齐技术,利用现成文本到图像模型实现无训练数据集蒸馏,提升目标语义与通用生成先验的对齐,取得ImageNet-1K的高准确率。

Comments 34 pages, 24 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.03749 2025-12-04 cs.CV 88%

Fully Unsupervised Self-debiasing of Text-to-Image Diffusion Models

文本到图像扩散模型的完全无监督自去偏

Korada Sri Vardhana, Shrikrishna Lolla, Soma Biswas

机构 * Indian Institute of Science(印度科学研究院)

专题命中 文生图 :text-to-image(title,abstract);diffusion(title,abstract);分类 cs.CV

AI总结 SelfDebias是一种完全无监督的文本到图像扩散模型去偏方法,通过识别语义聚类来减少生成图像中的偏见,同时保持视觉真实性。

Comments Accepted at WACV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.02794 2025-12-03 cs.CV 88%

PhyCustom: Towards Realistic Physical Customization in Text-to-Image Generation

PhyCustom: 向文本到图像生成中的真实物理定制迈进

Fan Wu, Cheng Chen, Zhoujie Fu, Jiacheng Wei, Yi Xu, Deheng Ye, Guosheng Lin

机构 * Nanyang Technological University(南洋理工大学) Goertek Alpha Labs(歌尔声学Alpha实验室) Tencent(腾讯)

专题命中 文生图 :text-to-image(title,abstract);image generation(title);diffusion(abstract);分类 cs.CV

AI总结 PhyCustom通过引入两个新正则化损失,提升文本到图像生成中对物理概念的真实定制能力。

Comments codes:https://github.com/wufan-cse/PhyCustom

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.20518 2025-12-02 cs.CV 88%

Dynamic Attention Analysis for Backdoor Detection in Text-to-Image Diffusion Models

文本到图像扩散模型中后门检测的动态注意力分析

Zhongqi Wang, Jie Zhang, Shiguang Shan, Xilin Chen

机构 * Key Laboratory of AI Safety of CAS, Institute of Computing Technology (ICT), Chinese Academy of Sciences (CAS), Beijing 100190, China, and also with the University of Chinese Academy of Sciences (UCAS), Beijing 100049, China(中国科学院人工智能安全重点实验室,计算技术研究所(ICT),中国科学院(CAS),北京100190,中国,以及中国科学院大学(UCAS),北京100049,中国)

专题命中 文生图 :text-to-image(title,abstract);diffusion(title,abstract);分类 cs.CV

AI总结 本研究提出动态注意力分析方法,通过分析扩散模型中注意力图的动态演变,有效检测文本到图像扩散模型中的后门攻击。

Comments Accepted by TPAMI

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.22245 2025-12-01 cs.CV 88%

Semantic Anchoring for Robust Personalization in Text-to-Image Diffusion Models

语义锚定用于文本到图像扩散模型中的稳健个性化

Seoyun Yang, Gihoon Kim, Taesup Kim

机构 * Graduate School of Data Science, Seoul National University(数据科学研究生院,首尔国立大学)

专题命中 文生图 :text-to-image(title,abstract);diffusion(title,abstract);分类 cs.CV

AI总结 通过语义锚定方法,文本到图像扩散模型在有限参考图像中实现稳健个性化,平衡主题保真度与语义对齐。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.18378 2025-11-25 cs.CV 88%

Synthetic Curriculum Reinforces Compositional Text-to-Image Generation

合成课程强化组合文本到图像生成

Shijian Wang, Runhao Fu, Siyi Zhao, Qingqin Zhan, Xingjian Wang, Jiarui Jin, Yuan Lu, Hanqian Wu, Cunjian Chen

机构 * Southeast University(东南大学) Xiaohongshu Inc.(小红书公司) Monash University(墨尔本大学) Shanghai Jiao Tong University(上海交通大学) Anhui University(安徽大学)

专题命中 文生图 :text-to-image(title,abstract);image generation(title);diffusion(abstract);分类 cs.CV

AI总结 CompGen通过课程强化学习框架提升文本到图像生成的组合能力,采用场景图和自适应采样算法优化模型性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.17615 2025-11-25 cs.CV cs.AI 88%

Plug-and-Play Multi-Concept Adaptive Blending for High-Fidelity Text-to-Image Synthesis

即插即用多概念自适应混合用于高保真文本到图像合成

Young-Beom Woo

专题命中 文生图 :text-to-image(title,abstract);image synthesis(title,abstract);分类 cs.CV

AI总结 PnP-MIX通过引导外观注意力和掩码引导噪声混合策略,实现高保真文本到图像合成中多概念的无缝整合,无需额外调优。

Comments [Master's thesis, Korea University, 2025]

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.13002 2025-11-18 cs.CV 88%

Infinite-Story: A Training-Free Consistent Text-to-Image Generation

Jihun Park, Kyoungmin Lee, Jongmin Gim, Hyeonseo Jo, Minseok Oh, Wonhyeok Choi, Kyumin Hwang, Jaeyeul Kim, Minwoo Choi, Sunghoon Im

专题命中 文生图 :text-to-image(title,abstract);image generation(title);diffusion(abstract);分类 cs.CV

Comments 18pages, 13 figures, AAAI 2026 Oral

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.07334 2025-11-17 cs.CV 88%

Unleashing the Potential of Large Language Models for Text-to-Image Generation through Autoregressive Representation Alignment

Xing Xie, Jiawei Liu, Ziyue Lin, Huijie Fan, Zhi Han, Yandong Tang, Liangqiong Qu

专题命中 文生图 :image generation(title,abstract);text-to-image(title,abstract);分类 cs.CV

Comments Accepted by AAAI 2026 Oral

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.11014 2025-11-17 cs.CV cs.CY 88%

SP-Guard: Selective Prompt-adaptive Guidance for Safe Text-to-Image Generation

Sumin Yu, Taesup Moon

机构 * Department of Electrical and Computer Engineering, Seoul National University, Seoul, South Korea(电气与计算机工程系,首尔国立大学,首尔,韩国) IPAI / ASRI / INMC, Seoul National University, Seoul, South Korea(IPAI/ASRI/INMC,首尔国立大学,首尔,韩国)

专题命中 文生图 :image generation(title,abstract);text-to-image(title);diffusion(abstract);分类 cs.CV

Comments Accepted for presentation at TRUST-AI Workshop, ECAI 2025. Proceedings to appear in CEUR-WS

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.27135 2025-11-03 cs.CV 88%

E-MMDiT: Revisiting Multimodal Diffusion Transformer Design for Fast Image Synthesis under Limited Resources

Tong Shen, Jingai Yu, Dong Zhou, Dong Li, Emad Barsoum

机构 * Advanced Micro Devices, Inc.(Advanced Micro Devices公司)

专题命中 文生图 :diffusion(title,abstract);image synthesis(title,abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.25739 2025-10-30 cs.CV cs.LG 88%

Hawk: Leveraging Spatial Context for Faster Autoregressive Text-to-Image Generation

Zhi-Kai Chen, Jun-Peng Jiang, Han-Jia Ye, De-Chuan Zhan

机构 * School of Artificial Intelligence, Nanjing University, China(南京大学人工智能学院) National Key Laboratory for Novel Software Technology, Nanjing University, China(南京大学新型软件技术国家重点实验室)

专题命中 文生图 :image generation(title,abstract);text-to-image(title,abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.22194 2025-10-28 cs.CV cs.LG 88%

ORIGEN: Zero-Shot 3D Orientation Grounding in Text-to-Image Generation

Yunhong Min, Daehyeon Choi, Kyeongmin Yeo, Jihyun Lee, Minhyuk Sung

机构 * KAIST(韩国科学技术院)

专题命中 文生图 :image generation(title,abstract);text-to-image(title,abstract);分类 cs.CV

Comments Project Page: https://origen2025.github.io

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.15450 2025-10-24 cs.CV 88%

Comprehensive Evaluation and Analysis for NSFW Concept Erasure in Text-to-Image Diffusion Models

Die Chen, Zhiwen Li, Cen Chen, Yuexiang Xie, Xiaodan Li, Jinyan Ye, Yingda Chen, Yaliang Li

机构 * East China Normal University(东华师范大学) Alibaba Group(阿里巴巴集团)

专题命中 文生图 :text-to-image(title,abstract);diffusion(title,abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.19278 2025-10-23 cs.CV 88%

D2D: Detector-to-Differentiable Critic for Improved Numeracy in Text-to-Image Generation

Nobline Yoo, Olga Russakovsky, Ye Zhu

机构 * Princeton University(普林斯顿大学) LIX, École Polytechnique, IP Paris(巴黎理工学院LIX研究所)

专题命中 文生图 :text-to-image(title,abstract);image generation(title);diffusion(abstract);分类 cs.CV

Comments 24 pages, 14 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.15752 2025-10-20 cs.CV cs.AI 88%

NDM: A Noise-driven Detection and Mitigation Framework against Implicit Sexual Intentions in Text-to-Image Generation

Yitong Sun, Yao Huang, Ruochen Zhang, Huanran Chen, Shouwei Ruan, Ranjie Duan, Xingxing Wei

机构 * Institute of Artificial Intelligence, Beihang University(北航人工智能研究院) College of AI, Tsinghua University(清华人工智能学院) Security Group, Alibaba Group(阿里集团安全组)

专题命中 文生图 :text-to-image(title,abstract);image generation(title);diffusion(abstract);分类 cs.CV

Comments 10 pages, 8 figures, accepted by ACMMM 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.02599 2025-10-06 cs.CV 88%

PEO: Training-Free Aesthetic Quality Enhancement in Pre-Trained Text-to-Image Diffusion Models with Prompt Embedding Optimization

Hovhannes Margaryan, Bo Wan, Tinne Tuytelaars

机构 * KU Leuven(鲁文大学) Université Paris-Saclay(巴黎-萨克雷大学) Meta

专题命中 文生图 :text-to-image(title,abstract);diffusion(title,abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.15562 2025-10-01 cs.CV cs.AI 88%

CE-SDWV: Effective and Efficient Concept Erasure for Text-to-Image Diffusion Models via a Semantic-Driven Word Vocabulary

Jiahang Tu, Qian Feng, Jiahua Dong, Hanbin Zhao, Chao Zhang, Nicu Sebe, Hui Qian

机构 * College of Computer Science and Technology, Zhejiang University, China(浙江大学计算机科学与技术学院) Mohamed bin Zayed University of Artificial Intelligence, Abu Dhabi(阿布扎赫德莫罕默德·本·扎耶德人工智能大学) Department of Information Engineering and Computer Science, University of Trento, Italy(意大利特伦托大学信息工程与计算机科学系)

专题命中 文生图 :text-to-image(title,abstract);diffusion(title,abstract);分类 cs.CV

Comments 25 pages, 14 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.25771 2025-10-01 cs.CV cs.AI 88%

Free Lunch Alignment of Text-to-Image Diffusion Models without Preference Image Pairs

Jia Jun Cheng Xian, Muchen Li, Haotian Yang, Xin Tao, Pengfei Wan, Leonid Sigal, Renjie Liao

机构 * University of British Columbia(不列颠哥伦比亚大学) Vector Institute for AI(人工智能向量研究所) Canada CIFAR AI Chair(加拿大CIFAR人工智能主席) Kling Team, Kuaishou Technology(快手科技 Kling 团队) NSERC CRC Chair(加拿大NSERC CRC主席)

专题命中 文生图 :text-to-image(title,abstract);diffusion(title,abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.04946 2025-10-01 cs.CV cs.CL 88%

Taming the Tri-Space Tension: ARC-Guided Hallucination Modeling and Control for Text-to-Image Generation

Jianjiang Yang, Ziyan Huang, Yanshu li, Da Peng, Huaiyuan Yao

机构 * University of Bristol(布里斯托大学) South China University of Technology(华南理工大学) Brown University(布朗大学) Xi’an Jiaotong University(西安交通大学) Arizona State University(亚利桑那州立大学)

专题命中 文生图 :text-to-image(title,abstract);image generation(title);diffusion(abstract);分类 cs.CV

Comments 9 pages,6 figures,7 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.21008 2025-09-29 cs.CV 88%

A Single Neuron Works: Precise Concept Erasure in Text-to-Image Diffusion Models

Qinqin He, Jiaqi Weng, Jialing Tao, Hui Xue

机构 * Alibaba Group(阿里巴巴集团)

专题命中 文生图 :text-to-image(title,abstract);diffusion(title);image generation(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.10704 2025-09-16 cs.AI cs.CV 88%

Maestro: Self-Improving Text-to-Image Generation via Agent Orchestration

Xingchen Wan, Han Zhou, Ruoxi Sun, Hootan Nakhost, Ke Jiang, Rajarishi Sinha, Sercan Ö. Arık

机构 * Google(谷歌)

专题命中 文生图 :image generation(title,abstract);text-to-image(title,abstract);分类 cs.CV

Comments 15 pages, 7 figures, 2 tables (22 pages, 9 figures and 3 tables including references and appendices)

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.09070 2025-09-16 cs.LG cs.AI cs.CV 88%

FairCoT: Enhancing Fairness in Text-to-Image Generation via Chain of Thought Reasoning with Multimodal Large Language Models

Zahraa Al Sahili, Ioannis Patras, Matthew Purver

机构 * School of Electronic Engineering and Computer Science, Queen Mary University of London(伦敦女王学院电子工程与计算机科学学院) Department of Knowledge Technologies, Jožef Stefan Institute(Jožef Stefan研究所知识技术系)

专题命中 文生图 :text-to-image(title,abstract);image generation(title);diffusion(abstract);分类 cs.CV

Comments Accepted at EMNLP 2025

详情

展开后加载摘要…

URL PDF HTML 收藏