Sketch-Guided Text-to-Image Diffusion Models
专题命中 扩散模型 :text-to-image(title,abstract);diffusion(title,abstract);分类 cs.CV、cs.GR
视觉与机器人
图像生成、文生图、图像编辑、扩散模型和可控生成。
专题命中 扩散模型 :text-to-image(title,abstract);diffusion(title,abstract);分类 cs.CV、cs.GR
机构 * Stanford University(斯坦福大学) ; University of Maryland, College Park(马里兰大学学院公园分校)
专题命中 扩散模型 :diffusion(title,abstract);image editing(title,abstract);分类 cs.CV
Comments Project page: https://coupled-diffusion.github.io
专题命中 扩散模型 :diffusion(title,abstract);inpainting(title,abstract);分类 cs.CV
Comments Accepted at ECCV 2024, Code: https://github.com/segments-ai/latent-diffusion-segmentation
专题命中 扩散模型 :diffusion(title,abstract);image generation(title,abstract);分类 cs.CV
Comments Accepted at MICCAI 2024. Code and synthetic dataset: https://github.com/mazurowski-lab/segmentation-guided-diffusion
专题命中 扩散模型 :diffusion(title,abstract);text-to-image(title,abstract);分类 cs.CV
Comments Project page: https://time-diffusion.github.io/
专题命中 扩散模型 :diffusion(title,abstract);image editing(title);image generation(abstract);分类 cs.CV
Comments Project page: https://github.com/QianWangX/MDP-Diffusion
Set Diffusion: 在自回归与扩散之间插值令牌顺序以实现快速灵活的解码
专题命中 扩散模型 :diffusion(title,title_cn)
AI总结 提出Set Diffusion模型,通过将似然参数化为灵活位置和长度的令牌集,并设计集因果扩散架构,支持任意顺序解码和KV缓存更新,在数学推理、摘要和无条件生成上优于先前的扩散语言模型。
Comments ICML 2026. We provide the code at https://github.com/kuleshov-group/setdlms
专题命中 扩散模型 :diffusion(title,abstract);image generation(abstract);inpainting(abstract);image synthesis(abstract)
Comments Project Page: https://differential-diffusion.github.io/
概念引导:文本到图像生成的精确无训练潜在控制
机构 * LMU Munich(慕尼黑大学) ; Konrad Zuse School of Excellence in Reliable AI (relAI)(康拉德·祖斯可靠人工智能卓越学院) ; Munich Center for Machine Learning (MCML)(慕尼黑机器学习中心)
专题命中 扩散模型 :text-to-image(title,abstract);image generation(title);diffusion(abstract);分类 cs.CV
AI总结 针对文本到图像扩散模型缺乏特定概念引导和局部一致性可靠性不足的问题,提出无训练的CoG方法,利用概念互信息强化相关层影响,在PixArt-alpha等模型上实现性能提升。
Comments Accepted at GCPR 2026 (Oral). 28 pages, includes supplementary material
当扩散模型忘记你是谁:大遮挡下人脸修复中的身份保留
专题命中 扩散模型 :diffusion(title,abstract);inpainting(title,abstract);分类 cs.CV
AI总结 针对大遮挡和冲突文本引导下人脸修复的身份保留难题,提出级联扩散框架ReSem-Face,在CelebAHQ-IDI-5等数据集上验证其身份保留修复及文本编辑质量优于基线。
医学图像修复中的扩散模型:挑战、解决方案分类及未来方向
机构 * Aeronautics Institute of Technology(航空技术学院) ; Science and Technology Institute, Federal University of São Paulo(圣保罗联邦大学科学与技术研究所) ; LASIGE, Faculdade de Ciências, Universidade de Lisboa(里斯本大学理学院LASIGE实验室) ; University of Coimbra, CISUC/LASI – Centre for Informatics and Systems of the University of Coimbra(科英布拉大学CISUC/LASI - 科英布拉大学信息与系统中心) ; Instituto Superior Técnico, Universidade de Lisboa, Instituto de Telecomunicações(里斯本大学高等技术学院、电信研究所)
专题命中 扩散模型 :diffusion(title,abstract);inpainting(title,abstract);分类 cs.CV
AI总结 该研究对基于扩散的医学图像修复方法进行系统回顾,涵盖多方面内容并提出分类法。分析显示相关研究兴趣快速增长,扩散模型在生成合理重建结果及辅助临床任务上表现出色,但也面临缺乏标准化基准等挑战。
CompDiff:分层组合扩散用于公平和零样本交叉性医学图像生成
机构 * Institute of Data Science, Faculty of Science and Engineering, Maastricht University, Maastricht, The Netherlands(数据科学研究所,科学与工程学院,马斯特里赫特大学,马斯特里赫特,荷兰) ; Department of Advanced Computing Sciences, Faculty of Science and Engineering, Maastricht University, Maastricht, The Netherlands(先进计算科学系,科学与工程学院,马斯特里赫特大学,马斯特里赫特,荷兰) ; VITO, Belgium(比利时VITO研究院)
专题命中 扩散模型 :image generation(title,abstract);diffusion(title,abstract);分类 cs.CV
AI总结 CompDiff通过分层组合扩散框架解决生成模型中因数据不平衡导致的公平性和零样本交叉性生成问题,在图像质量、子组公平性和零样本交叉性生成方面表现优异。
PersGuard:通过模型后门防止文本到图像扩散模型中的恶意个性化
机构 * Institute of Information Engineering, Chinese Academy of Sciences(信息工程研究所,中国科学院) ; School of Cyber Security, University of Chinese Academy of Sciences(中国科学院大学网络安全学院) ; BraneMatrix AI ; School of Cyber Science and Technology, Shenzhen Campus, Sun Yat-sen University(中山大学深圳校区计算机科学与技术学院)
专题命中 扩散模型 :text-to-image(title,abstract);diffusion(title,abstract);分类 cs.CV
AI总结 研究针对文本到图像扩散模型个性化引发的隐私问题,提出PersGuard框架,通过在模型发布前嵌入保护后门,结合统一优化问题制定后门注入,经实验验证其在隐私保护方面优于现有基于扰动的方法。
DICT:用于扩散模型条件图像生成的数据注入和对比轨迹细化
机构 * Zhejiang University(浙江大学)
专题命中 扩散模型 :image generation(title,abstract);diffusion(title,abstract);分类 cs.CV
AI总结 针对条件图像生成,提出DICT方法。通过数据注入将噪声扰动条件信号融入早期去噪阶段,结合对比轨迹细化,在统一扩散框架下提升生成质量,且无需引入任务相关架构,跨任务转移效果好。
Comments Accepted by ECCV 2026
SnapGen++:释放扩散变压器以在边缘设备上进行高效高保真图像生成
机构 * Snap Inc. ; University of Melbourne(墨尔本大学) ; MBZUAI
专题命中 扩散模型 :image generation(title,abstract);diffusion(title,abstract);分类 cs.CV
AI总结 针对扩散变压器在边缘设备部署的高成本问题,提出高效DiT框架。通过紧凑架构、弹性训练框架和知识引导的分布匹配蒸馏,在资源受限下实现变压器级生成质量,可在多样硬件上部署。
Comments Project page: https://snap-research.github.io/snapgenplusplus/
Z-Image: 一种基于单流扩散Transformer的高效图像生成基础模型
机构 * Alibaba Group(阿里巴巴集团)
专题命中 扩散模型 :image generation(title,abstract);diffusion(title,abstract);分类 cs.CV
AI总结 提出Z-Image,一种6B参数的高效图像生成基础模型,采用可扩展单流扩散Transformer架构,通过优化数据基础设施和训练流程,仅用314K H800 GPU小时完成训练,性能媲美顶级商业模型。
文本到图像扩散模型安全对齐中的高效用幻觉
机构 * Institute of Artificial Intelligence University of Central Florida(中佛罗里达大学人工智能研究所)
专题命中 扩散模型 :text-to-image(title,abstract);diffusion(title,abstract);分类 cs.CV
AI总结 揭示安全对齐方法在粗粒度指标上看似高效用,但在细粒度语义正确性上显著下降,提出结构感知几何正则化(SAGE)以恢复结构化效用。
Comments ECCV 2026
显式建模数据流形几何的扩散图像生成
机构 * City University of Hong Kong(香港城市大学)
专题命中 扩散模型 :image generation(title,abstract);diffusion(title,abstract);分类 cs.CV
AI总结 提出MIND框架,通过将离散补丁标记化集成到连续扩散模型的得分函数中显式建模流形几何,结合离散标记的结构量化能力和连续扩散的并行生成灵活性,在ImageNet 256×256上显著降低FID。
基于语义注入的通用图像免疫方法抵御基于扩散模型的图像编辑
机构 * POSTECH(浦项科技大学) ; GIST(光州科学技术院) ; Yonsei University(延世大学)
专题命中 扩散模型 :diffusion(title,abstract);image editing(title,abstract);分类 cs.CV
AI总结 提出首个通用对抗扰动框架,通过语义注入使扩散模型误解输入图像,抑制原始内容,从而有效阻断未经授权的编辑,在通用扰动设置下优于基线,并具备黑盒迁移性。
Comments ECCV 2026
基于可控扩散的病灶修复用于可扩展的组织病理学数据增强
机构 * Department of Diagnostic Radiology, Li Ka Shing Faculty of Medicine, The University of Hong Kong(香港大学李嘉诚医学院诊断放射学系) ; Department of Pathology, Li Ka Shing Faculty of Medicine, The University of Hong Kong(香港大学李嘉诚医学院病理学系) ; Department of Anatomical and Cellular Pathology, Prince of Wales Hospital, The Chinese University of Hong Kong(香港中文大学威尔斯亲王医院解剖及细胞病理学系) ; Department of Infectious Diseases and Public Health, Jockey Club College of Veterinary Medicine and Life Sciences, City University of Hong Kong(香港城市大学赛马会动物医学及生命科学院传染病及公共卫生学系) ; CityU Veterinary Diagnostic Laboratory Co., Ltd., City University of Hong Kong(香港城市大学城市大学兽医诊断实验室有限公司)
专题命中 扩散模型 :diffusion(title,abstract);inpainting(title,abstract);分类 cs.CV
AI总结 提出PathoGen扩散模型,将病灶可控地修复到良性组织图像中,生成高保真形态,在四个数据集上优于基线,病理专家区分真假仅略高于随机(57.75%),数据增强使分割Dice提升最高0.18。
Comments 19 pages, 5 figures, 1 Table
通过3D区域感知扩散进行脑部MRI的纵向病变修复
专题命中 扩散模型 :diffusion(title,abstract);inpainting(title,abstract);分类 cs.CV
AI总结 本文提出基于DDPM的新型伪3D纵向修复框架,利用多通道条件结合不同时间点的纵向信息,提高病变修复的感知保真度和纵向稳定性,同时提升处理效率。
TerraDiT:基于点的扩散变换器用于卫星图像合成
专题命中 扩散模型 :diffusion(title,abstract);image synthesis(title);image generation(abstract);分类 cs.CV
AI总结 TerraDiT通过点条件控制实现文本到卫星图像生成,提供语义丰富的控制信号,具有灵活、标注友好和计算简单的推理特性。
Comments 26 pages, 17 figures
基于3D先验引导扩散模型的单样本新视角与姿态人体图像合成
机构 * PCA Lab, Key Lab of Intelligent Perception and Systems for High-Dimensional Information of Ministry of Education, and Jiangsu Key Lab of Image and Video Understanding for Social Security, School of Computer Science and Engineering, Nanjing University of Science and Technology(南京理工大学计算机科学与工程学院教育部高维信息智能感知与系统重点实验室、江苏省社会安全图像与视频理解重点实验室及PCA实验室) ; Advanced Laser Technology Laboratory of Anhui Province, Electronic Engineering Institute, National University of Defense Technology, and Jianghuai Advance Technology Center(国防科技大学电子工程学院安徽省先进激光技术实验室及江淮前沿技术中心)
专题命中 扩散模型 :diffusion(title,abstract);image synthesis(title,abstract);分类 cs.CV
AI总结 提出一种基于条件去噪扩散模型的方法,利用3D人体先验(法线图和颜色提示)作为几何和颜色条件,从单张参考图像合成任意姿态和视角的高质量人体图像,包括被遮挡部分。
Comments 30 pages, 10 figures
FocusDiT: 扩散Transformer中的查询掩码用于细粒度图像生成
机构 * Zhejiang University(浙江大学) ; Westlake University(西湖大学)
专题命中 扩散模型 :diffusion(title,abstract);image generation(title);text-to-image(abstract);分类 cs.CV
AI总结 提出FocusDiT方法,通过掩码关键查询令牌仅输入FFN层,增强细粒度视觉生成,实验验证其有效性。
BadBlocks: 针对文本到图像扩散模型的低成本、隐蔽后门攻击
机构 * Shanghai Polytechnic University(上海理工大学) ; ShanghaiTech University(上海科技大学)
专题命中 扩散模型 :diffusion(title,abstract);text-to-image(title);image generation(abstract);分类 cs.CV
AI总结 提出BadBlocks攻击方法,通过仅污染UNet架构中的特定块,在保持其他组件不变的情况下,以30%的计算资源和20%的GPU时间实现高成功率且绕过注意力检测防御,揭示了不同神经层的脆弱性差异。
通过表示条件扩散模型实现可控图像生成
专题命中 扩散模型 :image generation(title,abstract);diffusion(title,abstract);分类 cs.CV
AI总结 本文提出利用预训练自监督模型的表示作为条件,通过扩散模型实现无需大量标注的可控图像生成,并探索了表示空间中的平滑和分离特性。
被擦除但可被利用:针对已遗忘文本到图像扩散模型的黑盒嵌入感知提示攻击
机构 * Department of Computer Engineering(计算机工程系)
专题命中 扩散模型 :text-to-image(title,abstract);diffusion(title,abstract);分类 cs.CV
AI总结 提出一种黑盒嵌入感知对抗提示攻击BEAP,利用大语言模型迭代生成有效对抗提示,以恢复被遗忘概念,并在攻击成功率上提升超过60%。
基于扩散模型的姿态引导人物图像合成的融合嵌入
机构 * Department of Industrial Engineering(工业工程系)
专题命中 扩散模型 :diffusion(title,abstract);image synthesis(title,abstract);分类 cs.CV
AI总结 提出FPDM框架,通过对比学习显式对齐融合源-姿态嵌入与目标图像嵌入,并作为条件信号生成,解决姿态引导人物图像合成中纹理保真度和一致性问题。
通过基于核心标记注意力的种子选择提升文本到图像扩散模型
机构 * Brandeis University(布兰迪大学)
专题命中 扩散模型 :text-to-image(title,abstract);diffusion(title,abstract);分类 cs.CV
AI总结 本文研究了文本到图像扩散模型中种子对生成质量的影响,提出基于核心标记注意力的种子选择方法,无需训练即可提升文本与图像的一致性及视觉质量。
Comments Preprint
TextBoost: 通过文本编码器提升文本到图像生成的个性化
机构 * KAIST(韩国科学技术院)
专题命中 扩散模型 :text-to-image(title,abstract);image generation(title);diffusion(abstract);分类 cs.CV
AI总结 本文提出TextBoost,一种高效的文本到图像扩散模型单次个性化方法,通过仅微调文本编码器提升计算和存储效率,并保持语义完整性,从而实现更快收敛和更低存储需求,同时保持高质量生成。
Comments Project page: https://textboost.github.io. Accepted to TMLR