arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

图像生成

图像生成、文生图、图像编辑、扩散模型和可控生成。

共收录 69868 信号源:cs.CV, cs.GR, cs.MM

1. 扩散模型 69868 篇

2211.13752 2022-11-28 cs.CV cs.GR cs.LG 88%

Sketch-Guided Text-to-Image Diffusion Models

Andrey Voynov, Kfir Aberman, Daniel Cohen-Or

专题命中 扩散模型 :text-to-image(title,abstract);diffusion(title,abstract);分类 cs.CV、cs.GR

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.14981 2025-10-17 cs.CV cs.AI 88%

Coupled Diffusion Sampling for Training-Free Multi-View Image Editing

Hadi Alzayer, Yunzhi Zhang, Chen Geng, Jia-Bin Huang, Jiajun Wu

机构 * Stanford University(斯坦福大学) University of Maryland, College Park(马里兰大学学院公园分校)

专题命中 扩散模型 :diffusion(title,abstract);image editing(title,abstract);分类 cs.CV

Comments Project page: https://coupled-diffusion.github.io

详情

展开后加载摘要…

URL PDF HTML 收藏
2401.10227 2024-07-17 cs.CV cs.LG 88%

A Simple Latent Diffusion Approach for Panoptic Segmentation and Mask Inpainting

Wouter Van Gansbeke, Bert De Brabandere

专题命中 扩散模型 :diffusion(title,abstract);inpainting(title,abstract);分类 cs.CV

Comments Accepted at ECCV 2024, Code: https://github.com/segments-ai/latent-diffusion-segmentation

详情

展开后加载摘要…

URL PDF HTML 收藏
2402.05210 2024-06-21 eess.IV cs.CV cs.LG stat.ML 88%

Anatomically-Controllable Medical Image Generation with Segmentation-Guided Diffusion Models

Nicholas Konz, Yuwen Chen, Haoyu Dong, Maciej A. Mazurowski

专题命中 扩散模型 :diffusion(title,abstract);image generation(title,abstract);分类 cs.CV

Comments Accepted at MICCAI 2024. Code and synthetic dataset: https://github.com/mazurowski-lab/segmentation-guided-diffusion

详情

展开后加载摘要…

URL PDF HTML 收藏
2303.08084 2023-08-28 cs.CV 88%

Editing Implicit Assumptions in Text-to-Image Diffusion Models

Hadas Orgad, Bahjat Kawar, Yonatan Belinkov

专题命中 扩散模型 :diffusion(title,abstract);text-to-image(title,abstract);分类 cs.CV

Comments Project page: https://time-diffusion.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2303.16765 2023-03-31 cs.CV 88%

MDP: A Generalized Framework for Text-Guided Image Editing by Manipulating the Diffusion Path

Qian Wang, Biao Zhang, Michael Birsak, Peter Wonka

专题命中 扩散模型 :diffusion(title,abstract);image editing(title);image generation(abstract);分类 cs.CV

Comments Project page: https://github.com/QianWangX/MDP-Diffusion

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.01775 2026-07-03 cs.LG 新提交 88%

Set Diffusion: Interpolating Token Orderings Between Autoregression and Diffusion for Fast and Flexible Decoding

Set Diffusion: 在自回归与扩散之间插值令牌顺序以实现快速灵活的解码

Marianne Arriola, Volodymyr Kuleshov

专题命中 扩散模型 :diffusion(title,title_cn)

AI总结 提出Set Diffusion模型,通过将似然参数化为灵活位置和长度的令牌集,并设计集因果扩散架构,支持任意顺序解码和KV缓存更新,在数学推理、摘要和无条件生成上优于先前的扩散语言模型。

Comments ICML 2026. We provide the code at https://github.com/kuleshov-group/setdlms

详情

展开后加载摘要…

URL PDF HTML 收藏
2306.00950 2024-03-01 cs.CV cs.AI cs.GR cs.LG 88%

Differential Diffusion: Giving Each Pixel Its Strength

Eran Levin, Ohad Fried

专题命中 扩散模型 :diffusion(title,abstract);image generation(abstract);inpainting(abstract);image synthesis(abstract)

Comments Project Page: https://differential-diffusion.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.14172 2026-08-17 cs.CV cs.AI cs.LG 新提交 88%

Concept Guidance: Precise, Training-Free Latent Control for Text-to-Image Generation

概念引导:文本到图像生成的精确无训练潜在控制

Nikolai Röhrich, Isabell Hans, Felix Krause, Björn Ommer

机构 * LMU Munich(慕尼黑大学) Konrad Zuse School of Excellence in Reliable AI (relAI)(康拉德·祖斯可靠人工智能卓越学院) Munich Center for Machine Learning (MCML)(慕尼黑机器学习中心)

专题命中 扩散模型 :text-to-image(title,abstract);image generation(title);diffusion(abstract);分类 cs.CV

AI总结 针对文本到图像扩散模型缺乏特定概念引导和局部一致性可靠性不足的问题,提出无训练的CoG方法,利用概念互信息强化相关层影响,在PixArt-alpha等模型上实现性能提升。

Comments Accepted at GCPR 2026 (Oral). 28 pages, includes supplementary material

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.04820 2026-08-06 cs.CV 新提交 88%

When Diffusion Models Forget Who You Are: Identity Preservation in Face Inpainting under Large Occlusions

当扩散模型忘记你是谁:大遮挡下人脸修复中的身份保留

Feng Ding, Shuhuai Xie, Yue Zhou, Yulan Zhang, Guopu Zhu, Mengyao Xiao

专题命中 扩散模型 :diffusion(title,abstract);inpainting(title,abstract);分类 cs.CV

AI总结 针对大遮挡和冲突文本引导下人脸修复的身份保留难题,提出级联扩散框架ReSem-Face,在CelebAHQ-IDI-5等数据集上验证其身份保留修复及文本编辑质量优于基线。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.21904 2026-07-27 cs.CV cs.CL 新提交 88%

Diffusion Models in Medical Image Inpainting: Challenges, Solution Taxonomy, and Future Directions

医学图像修复中的扩散模型:挑战、解决方案分类及未来方向

Arthur Dantas Mangussi, Joana Cristo Santos, Ricardo Cardoso Pereira, Ana Carolina Lorena, Mário A. T. Figueiredo, Pedro Henriques Abreu

机构 * Aeronautics Institute of Technology(航空技术学院) Science and Technology Institute, Federal University of São Paulo(圣保罗联邦大学科学与技术研究所) LASIGE, Faculdade de Ciências, Universidade de Lisboa(里斯本大学理学院LASIGE实验室) University of Coimbra, CISUC/LASI – Centre for Informatics and Systems of the University of Coimbra(科英布拉大学CISUC/LASI - 科英布拉大学信息与系统中心) Instituto Superior Técnico, Universidade de Lisboa, Instituto de Telecomunicações(里斯本大学高等技术学院、电信研究所)

专题命中 扩散模型 :diffusion(title,abstract);inpainting(title,abstract);分类 cs.CV

AI总结 该研究对基于扩散的医学图像修复方法进行系统回顾,涵盖多方面内容并提出分类法。分析显示相关研究兴趣快速增长,扩散模型在生成合理重建结果及辅助临床任务上表现出色,但也面临缺乏标准化基准等挑战。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.16551 2026-07-20 cs.CV cs.AI 版本更新 88%

CompDiff: Hierarchical Compositional Diffusion for Fair and Zero-Shot Intersectional Medical Image Generation

CompDiff:分层组合扩散用于公平和零样本交叉性医学图像生成

Mahmoud Ibrahim, Bart Elen, Chang Sun, Gokhan Ertaylan, Michel Dumontier

机构 * Institute of Data Science, Faculty of Science and Engineering, Maastricht University, Maastricht, The Netherlands(数据科学研究所,科学与工程学院,马斯特里赫特大学,马斯特里赫特,荷兰) Department of Advanced Computing Sciences, Faculty of Science and Engineering, Maastricht University, Maastricht, The Netherlands(先进计算科学系,科学与工程学院,马斯特里赫特大学,马斯特里赫特,荷兰) VITO, Belgium(比利时VITO研究院)

专题命中 扩散模型 :image generation(title,abstract);diffusion(title,abstract);分类 cs.CV

AI总结 CompDiff通过分层组合扩散框架解决生成模型中因数据不平衡导致的公平性和零样本交叉性生成问题,在图像质量、子组公平性和零样本交叉性生成方面表现优异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.16167 2026-07-16 cs.CV cs.AI 版本更新 88%

PersGuard: Preventing Malicious Personalization in Text-to-Image Diffusion Models via Model Backdoors

PersGuard:通过模型后门防止文本到图像扩散模型中的恶意个性化

Xinwei Liu, Xiaojun Jia, Yuan Xun, Hua Zhang, Xiaochun Cao

机构 * Institute of Information Engineering, Chinese Academy of Sciences(信息工程研究所,中国科学院) School of Cyber Security, University of Chinese Academy of Sciences(中国科学院大学网络安全学院) BraneMatrix AI School of Cyber Science and Technology, Shenzhen Campus, Sun Yat-sen University(中山大学深圳校区计算机科学与技术学院)

专题命中 扩散模型 :text-to-image(title,abstract);diffusion(title,abstract);分类 cs.CV

AI总结 研究针对文本到图像扩散模型个性化引发的隐私问题,提出PersGuard框架,通过在模型发布前嵌入保护后门,结合统一优化问题制定后门注入,经实验验证其在隐私保护方面优于现有基于扰动的方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.03899 2026-07-07 cs.CV 新提交 88%

DICT: Data Injection and Contrastive Trajectory Refinement for Conditional Image Generation with Diffusion Models

DICT:用于扩散模型条件图像生成的数据注入和对比轨迹细化

Chunnan Shang, Xin Zhang, Zhizhong Wang, Hongwei Wang

机构 * Zhejiang University(浙江大学)

专题命中 扩散模型 :image generation(title,abstract);diffusion(title,abstract);分类 cs.CV

AI总结 针对条件图像生成,提出DICT方法。通过数据注入将噪声扰动条件信号融入早期去噪阶段,结合对比轨迹细化,在统一扩散框架下提升生成质量,且无需引入任务相关架构,跨任务转移效果好。

Comments Accepted by ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.08303 2026-07-07 cs.CV 版本更新 88%

SnapGen++: Unleashing Diffusion Transformers for Efficient High-Fidelity Image Generation on Edge Devices

SnapGen++:释放扩散变压器以在边缘设备上进行高效高保真图像生成

Dongting Hu, Aarush Gupta, Magzhan Gabidolla, Arpit Sahni, Huseyin Coskun, Yanyu Li, Yerlan Idelbayev, Ahsan Mahmood, Aleksei Lebedev, Dishani Lahiri, Anujraaj Goyal, Ju Hu, Mingming Gong, Sergey Tulyakov, Anil Kag

机构 * Snap Inc. University of Melbourne(墨尔本大学) MBZUAI

专题命中 扩散模型 :image generation(title,abstract);diffusion(title,abstract);分类 cs.CV

AI总结 针对扩散变压器在边缘设备部署的高成本问题,提出高效DiT框架。通过紧凑架构、弹性训练框架和知识引导的分布匹配蒸馏,在资源受限下实现变压器级生成质量,可在多样硬件上部署。

Comments Project page: https://snap-research.github.io/snapgenplusplus/

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.22699 2026-07-07 cs.CV 版本更新 88%

Z-Image: An Efficient Image Generation Foundation Model with Single-Stream Diffusion Transformer

Z-Image: 一种基于单流扩散Transformer的高效图像生成基础模型

Image Team, Huanqia Cai, Sihan Cao, Ruoyi Du, Peng Gao, Aiming Hao, Steven Hoi, Zhaohui Hou, Shijie Huang, Dengyang Jiang, Yuming Jiang, Xin Jin, Liangchen Li, Zhen Li, Zhong-Yu Li, David Liu, Dongyang Liu, Qilong Wu, Feng Yu, Zechao Zhan, Chi Zhang, Shifeng Zhang, Ruikai Zhou, Shilin Zhou

机构 * Alibaba Group(阿里巴巴集团)

专题命中 扩散模型 :image generation(title,abstract);diffusion(title,abstract);分类 cs.CV

AI总结 提出Z-Image,一种6B参数的高效图像生成基础模型,采用可扩展单流扩散Transformer架构,通过优化数据基础设施和训练流程,仅用314K H800 GPU小时完成训练,性能媲美顶级商业模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.00402 2026-07-02 cs.CV cs.AI cs.LG 新提交 88%

The Illusion of High Utility in Safety Alignment of Text-to-Image Diffusion Models

文本到图像扩散模型安全对齐中的高效用幻觉

Adeel Yousaf, Soumik Ghosh, James Beetham, Amrit Singh Bedi, Mubarak Shah

机构 * Institute of Artificial Intelligence University of Central Florida(中佛罗里达大学人工智能研究所)

专题命中 扩散模型 :text-to-image(title,abstract);diffusion(title,abstract);分类 cs.CV

AI总结 揭示安全对齐方法在粗粒度指标上看似高效用,但在细粒度语义正确性上显著下降,提出结构感知几何正则化(SAGE)以恢复结构化效用。

Comments ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.00094 2026-07-02 cs.CV cs.AI 版本更新 88%

Diffusion Image Generation with Explicit Modeling of Data Manifold Geometry

显式建模数据流形几何的扩散图像生成

Duoduo Xue, Zhiyu Zhu, Junhui Hou

机构 * City University of Hong Kong(香港城市大学)

专题命中 扩散模型 :image generation(title,abstract);diffusion(title,abstract);分类 cs.CV

AI总结 提出MIND框架,通过将离散补丁标记化集成到连续扩散模型的得分函数中显式建模流形几何,结合离散标记的结构量化能力和连续扩散的并行生成灵活性,在ImageNet 256×256上显著降低FID。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.14679 2026-07-02 cs.CV 版本更新 88%

Universal Image Immunization against Diffusion-based Image Editing via Semantic Injection

基于语义注入的通用图像免疫方法抵御基于扩散模型的图像编辑

Chanhui Lee, Donggyu Choi, Seunghyun Shin, Hae-Gon Jeon, Jeany Son

机构 * POSTECH(浦项科技大学) GIST(光州科学技术院) Yonsei University(延世大学)

专题命中 扩散模型 :diffusion(title,abstract);image editing(title,abstract);分类 cs.CV

AI总结 提出首个通用对抗扰动框架,通过语义注入使扩散模型误解输入图像,抑制原始内容,从而有效阻断未经授权的编辑,在通用扰动设置下优于基线,并具备黑盒迁移性。

Comments ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.08127 2026-07-02 cs.CV cs.AI 版本更新 88%

Controllable Diffusion-Based Lesion Inpainting for Scalable Histopathology Data Augmentation

基于可控扩散的病灶修复用于可扩展的组织病理学数据增强

Mohamad Koohi-Moghadam, Mohammad-Ali Nikouei Mahani, Rex K. H. Au-Yeung, Raymond Yu O, Monalyn Marabi, Piyapharom Intarawichian, Fabian Z. X. Lean, Andrew Ferguson, Kyongtae Tyler Bae

机构 * Department of Diagnostic Radiology, Li Ka Shing Faculty of Medicine, The University of Hong Kong(香港大学李嘉诚医学院诊断放射学系) Department of Pathology, Li Ka Shing Faculty of Medicine, The University of Hong Kong(香港大学李嘉诚医学院病理学系) Department of Anatomical and Cellular Pathology, Prince of Wales Hospital, The Chinese University of Hong Kong(香港中文大学威尔斯亲王医院解剖及细胞病理学系) Department of Infectious Diseases and Public Health, Jockey Club College of Veterinary Medicine and Life Sciences, City University of Hong Kong(香港城市大学赛马会动物医学及生命科学院传染病及公共卫生学系) CityU Veterinary Diagnostic Laboratory Co., Ltd., City University of Hong Kong(香港城市大学城市大学兽医诊断实验室有限公司)

专题命中 扩散模型 :diffusion(title,abstract);inpainting(title,abstract);分类 cs.CV

AI总结 提出PathoGen扩散模型,将病灶可控地修复到良性组织图像中,生成高保真形态,在四个数据集上优于基线,病理专家区分真假仅略高于随机(57.75%),数据增强使分割Dice提升最高0.18。

Comments 19 pages, 5 figures, 1 Table

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.05693 2026-06-30 eess.IV cs.AI cs.CV 88%

Longitudinal Lesion Inpainting in Brain MRI via 3D Region Aware Diffusion

通过3D区域感知扩散进行脑部MRI的纵向病变修复

Zahra Karimaghaloo, Dumitru Fetco, Haz-Edine Assemlal, Hassan Rivaz, Douglas L. Arnold

专题命中 扩散模型 :diffusion(title,abstract);inpainting(title,abstract);分类 cs.CV

AI总结 本文提出基于DDPM的新型伪3D纵向修复框架,利用多通道条件结合不同时间点的纵向信息,提高病变修复的感知保真度和纵向稳定性,同时提升处理效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.02172 2026-06-30 cs.CV 88%

TerraDiT: Point-Conditioned Diffusion Transformer for Satellite Image Synthesis

TerraDiT:基于点的扩散变换器用于卫星图像合成

Srikumar Sastry, Dan Cher, Brian Wei, Aayush Dhakal, Subash Khanal, Dev Gupta, Nathan Jacobs

专题命中 扩散模型 :diffusion(title,abstract);image synthesis(title);image generation(abstract);分类 cs.CV

AI总结 TerraDiT通过点条件控制实现文本到卫星图像生成,提供语义丰富的控制信号,具有灵活、标注友好和计算简单的推理特性。

Comments 26 pages, 17 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.19718 2026-06-19 cs.CV 新提交 88%

One-Shot Novel View and Pose Human Image Synthesis via 3D Prior Guided Diffusion Model

基于3D先验引导扩散模型的单样本新视角与姿态人体图像合成

Shenjian Gong, Kangkan Wang, Shanshan Zhang, Jian Yang

机构 * PCA Lab, Key Lab of Intelligent Perception and Systems for High-Dimensional Information of Ministry of Education, and Jiangsu Key Lab of Image and Video Understanding for Social Security, School of Computer Science and Engineering, Nanjing University of Science and Technology(南京理工大学计算机科学与工程学院教育部高维信息智能感知与系统重点实验室、江苏省社会安全图像与视频理解重点实验室及PCA实验室) Advanced Laser Technology Laboratory of Anhui Province, Electronic Engineering Institute, National University of Defense Technology, and Jianghuai Advance Technology Center(国防科技大学电子工程学院安徽省先进激光技术实验室及江淮前沿技术中心)

专题命中 扩散模型 :diffusion(title,abstract);image synthesis(title,abstract);分类 cs.CV

AI总结 提出一种基于条件去噪扩散模型的方法,利用3D人体先验(法线图和颜色提示)作为几何和颜色条件,从单张参考图像合成任意姿态和视角的高质量人体图像,包括被遮挡部分。

Comments 30 pages, 10 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.02090 2026-06-03 cs.CV 88%

FocusDiT: Masking Queries in Diffusion Transformers for Fine-grained Image Generation

FocusDiT: 扩散Transformer中的查询掩码用于细粒度图像生成

Xueji Fang, Liyuan Ma, Jianhao Zeng, Jinjin Cao, Mingyuan Zhou, Guo-Jun Qi

机构 * Zhejiang University(浙江大学) Westlake University(西湖大学)

专题命中 扩散模型 :diffusion(title,abstract);image generation(title);text-to-image(abstract);分类 cs.CV

AI总结 提出FocusDiT方法,通过掩码关键查询令牌仅输入FFN层,增强细粒度视觉生成,实验验证其有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.03221 2026-05-29 cs.CR cs.CV 88%

BadBlocks: Low-Cost and Stealthy Backdoor Attacks Tailored for Text-to-Image Diffusion Models

BadBlocks: 针对文本到图像扩散模型的低成本、隐蔽后门攻击

Jia Wu, Yu Pan, Junjun Yang, Yi Du

机构 * Shanghai Polytechnic University(上海理工大学) ShanghaiTech University(上海科技大学)

专题命中 扩散模型 :diffusion(title,abstract);text-to-image(title);image generation(abstract);分类 cs.CV

AI总结 提出BadBlocks攻击方法,通过仅污染UNet架构中的特定块,在保持其他组件不变的情况下,以30%的计算资源和20%的GPU时间实现高成功率且绕过注意力检测防御,揭示了不同神经层的脆弱性差异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.27343 2026-05-27 cs.CV cs.LG 88%

Towards Controllable Image Generation through Representation-Conditioned Diffusion Models

通过表示条件扩散模型实现可控图像生成

Nithesh Chandher Karthikeyan, Jonas Unger, Gabriel Eilertsen

专题命中 扩散模型 :image generation(title,abstract);diffusion(title,abstract);分类 cs.CV

AI总结 本文提出利用预训练自监督模型的表示作为条件,通过扩散模型实现无需大量标注的可控图像生成,并探索了表示空间中的平滑和分离特性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.26332 2026-05-27 cs.CV cs.AI 88%

Erased but Exploitable: Black-box Embedding-Aware Prompting Against Unlearned Text-to-Image Diffusion Models

被擦除但可被利用:针对已遗忘文本到图像扩散模型的黑盒嵌入感知提示攻击

Arian Komaei Koma, Seyed Amir Kasaei, AmirMahdi Sadeghzadeh, Mohammad Hossein Rohban

机构 * Department of Computer Engineering(计算机工程系)

专题命中 扩散模型 :text-to-image(title,abstract);diffusion(title,abstract);分类 cs.CV

AI总结 提出一种黑盒嵌入感知对抗提示攻击BEAP,利用大语言模型迭代生成有效对抗提示,以恢复被遗忘概念,并在攻击成功率上提升超过60%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.07333 2026-05-26 cs.CV cs.AI 88%

Fusion Embedding for Pose-Guided Person Image Synthesis with Diffusion Model

基于扩散模型的姿态引导人物图像合成的融合嵌入

Donghwna Lee, Kirok Kim, Jisu Lee, Kyungha Min, Wooju Kim

机构 * Department of Industrial Engineering(工业工程系)

专题命中 扩散模型 :diffusion(title,abstract);image synthesis(title,abstract);分类 cs.CV

AI总结 提出FPDM框架,通过对比学习显式对齐融合源-姿态嵌入与目标图像嵌入,并作为条件信号生成,解决姿态引导人物图像合成中纹理保真度和一致性问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.19532 2026-05-20 cs.CV cs.LG 88%

Boosting Text-to-Image Diffusion Models via Core Token Attention-Based Seed Selection

通过基于核心标记注意力的种子选择提升文本到图像扩散模型

Yunzhe Zhang, Hongfu Liu, Pengyu Hong

机构 * Brandeis University(布兰迪大学)

专题命中 扩散模型 :text-to-image(title,abstract);diffusion(title,abstract);分类 cs.CV

AI总结 本文研究了文本到图像扩散模型中种子对生成质量的影响,提出基于核心标记注意力的种子选择方法,无需训练即可提升文本与图像的一致性及视觉质量。

Comments Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.08248 2026-05-20 cs.CV 88%

TextBoost: Boosting Text Encoder for Personalized Text-to-Image Generation

TextBoost: 通过文本编码器提升文本到图像生成的个性化

NaHyeon Park, Kunhee Kim, Hyunjung Shim

机构 * KAIST(韩国科学技术院)

专题命中 扩散模型 :text-to-image(title,abstract);image generation(title);diffusion(abstract);分类 cs.CV

AI总结 本文提出TextBoost,一种高效的文本到图像扩散模型单次个性化方法,通过仅微调文本编码器提升计算和存储效率,并保持语义完整性,从而实现更快收敛和更低存储需求,同时保持高质量生成。

Comments Project page: https://textboost.github.io. Accepted to TMLR

详情

展开后加载摘要…

URL PDF HTML 收藏