GLIDE: Towards Photorealistic Image Generation and Editing with Text-Guided Diffusion Models
专题命中 扩散模型 :diffusion(title,abstract);image generation(title);image editing(abstract);inpainting(abstract)
Comments 20 pages, 18 figures
视觉与机器人
图像生成、文生图、图像编辑、扩散模型和可控生成。
专题命中 扩散模型 :diffusion(title,abstract);image generation(title);image editing(abstract);inpainting(abstract)
Comments 20 pages, 18 figures
HRDiT:基于现成扩散Transformer模型的无需训练高分辨率图像生成
机构 * Lancaster University(兰卡斯特大学) ; South China University of Technology(华南理工大学) ; NVIDIA AI Tech Centre(英伟达AI技术中心)
专题命中 扩散模型 :image generation(title,abstract);diffusion(title,abstract);text-to-image(abstract);image synthesis(abstract)
AI总结 本研究针对现成DiT模型适配高分辨率图像合成的空间紊乱、生成时间长两大挑战,提出新方法,经实验验证其有效性,代码公开。
Comments Accepted by ECCV 2026
统一安全上下文图像生成:在多模态扩散变换器中通过限制不安全信息流
机构 * University of Science and Technology of China(中国科学技术大学)
专题命中 扩散模型 :image generation(title,abstract);diffusion(title,abstract);text-to-image(abstract);image synthesis(abstract)
AI总结 提出UVR框架,通过分析注意力动态中的不安全信息流,在无需训练的情况下对输出补丁进行注意力调制,实现图像生成和编辑任务的安全控制,达到91%和77%的擦除率。
Comments ICML26
潜在小波扩散用于超高清图像合成
机构 * Sapienza University of Rome(罗马大学) ; Singapore Management University(新加坡管理大学) ; EMBL(欧洲分子生物学实验室)
专题命中 扩散模型 :diffusion(title,summary_cn);image synthesis(title,abstract);分类 cs.CV
AI总结 本文提出Latent Wavelet Diffusion,通过频率感知的掩码策略和一致性VAE目标提升超高清图像生成的细节和纹理保真度,且无需额外计算开销。
Comments Accepted at ICLR 2026
StructDiff:一种结构保持且空间可控的单图像生成扩散模型
机构 * Institute of Information Science, Beijing Jiaotong University(信息科学研究院,北京交通大学) ; Visual Intelligence +X International Cooperation Joint Laboratory of MOE, Beijing(教育部视觉智能+X国际合作联合实验室,北京) ; College of Computing and Data Science, Nanyang Technological University(计算与数据科学学院,南洋理工大学)
专题命中 扩散模型 :image generation(title,abstract);diffusion(title,abstract);image editing(abstract);image synthesis(abstract)
AI总结 StructDiff基于单尺度扩散模型提出,通过自适应感受野模块和3D位置编码实现结构保持与空间可控,引入基于大语言模型的新型评估标准,优于现有方法在结构一致性、视觉质量和空间可控性上。
Comments Accepted by IEEE Transactions on Multimedia (Regular Paper)
Diffusion-4K: 基于潜在扩散模型的超高清图像合成
机构 * State Key Laboratory of Complex and Critical Software Environment(复杂与关键软件环境国家重点实验室) ; Beihang University(北京航空航天大学) ; School of Computer Science and Engineering(计算机科学与工程学院)
专题命中 扩散模型 :diffusion(title,abstract);image synthesis(title,abstract);image generation(abstract);text-to-image(abstract)
AI总结 Diffusion-4K通过引入Aesthetic-4K基准和基于小波的微调方法,实现了高质量超高清图像合成。
Comments Accepted to CVPR 2025
专题命中 扩散模型 :image generation(title,abstract);diffusion(title,abstract);text-to-image(abstract);image synthesis(abstract)
Comments 10 pages
专题命中 扩散模型 :diffusion(title,abstract);image synthesis(title,abstract);image generation(abstract);image editing(abstract)
Comments CVPR 2025 Accepted
专题命中 扩散模型 :diffusion(title,abstract);image editing(title,abstract);image generation(abstract);inpainting(abstract)
Comments Accepted by IEEE Transactions on Pattern Analysis and Machine Intelligence (TPAMI 2025)
专题命中 扩散模型 :image generation(title,abstract);diffusion(title,abstract);text-to-image(abstract);inpainting(abstract)
Comments Accepted to AAAI 2025
专题命中 扩散模型 :diffusion(title,abstract);image editing(title,abstract);image generation(abstract);text-to-image(abstract)
Comments WACV'25
专题命中 扩散模型 :image generation(title,abstract);diffusion(title,abstract);text-to-image(abstract);inpainting(abstract)
Comments Accepted for publication at MIDL 2024
专题命中 扩散模型 :diffusion(title,abstract);image synthesis(title,abstract);image generation(abstract);text-to-image(abstract)
Comments Accepted by CVPR 2024 (Highlight)
专题命中 扩散模型 :image generation(title,abstract);diffusion(title,abstract);text-to-image(abstract);image editing(abstract)
专题命中 扩散模型 :image generation(title,abstract);diffusion(title,abstract);text-to-image(abstract);inpainting(abstract)
Comments Project page, https://mvdiffusion.github.io; NeurIPS 2023 (spotlight); Compressed camera-ready version
专题命中 扩散模型 :diffusion(title,abstract);inpainting(title,abstract);image generation(abstract);text-to-image(abstract)
Comments Accepted by ACMMM'23
专题命中 扩散模型 :diffusion(title,abstract);inpainting(title,abstract);image generation(abstract);text-to-image(abstract)
Journal ref CVPR2023
专题命中 扩散模型 :diffusion(title,abstract);image synthesis(title);image generation(abstract);image editing(abstract)
面向文本到图像扩散Transformer的鲁棒且可泛化的安全引导
机构 * Huzhou Normal University(湖州师范学院) ; Alibaba Group(阿里巴巴集团) ; University of Science and Technology of China(中国科学技术大学) ; Zhejiang Normal University(浙江师范大学) ; Zhejiang University of Technology(浙江工业大学)
专题命中 扩散模型 :diffusion(title,abstract);text-to-image(title,abstract);image generation(abstract)
AI总结 提出SafeDIG框架,通过位置感知稀疏特征迁移实现扩散Transformer的安全引导,在保持源域安全性和图像质量的同时,有效降低目标域和整体不安全生成率。
SimAC: 一种针对扩散模型文本到图像合成的简单面部隐私反定制方法
机构 * University of Science and Technology of China(中国科学技术大学) ; Alibaba Cloud(阿里云)
专题命中 扩散模型 :diffusion(title,abstract);text-to-image(title);image synthesis(title);分类 cs.CV
AI总结 针对扩散模型定制化技术引发的隐私问题,提出SimAC方法,通过分析时间步选择与频域感知关系及去噪过程不同层特征,设计自适应贪婪搜索和特征优化框架,有效提升身份干扰,保护用户隐私。
Comments Accepted by CVPR2024. Code: https://github.com/somuchtome/SimAC
PTL-Diffusion: 具有周期终端定律的流形感知扩散
机构 * University of Pennsylvania(宾夕法尼亚大学) ; University of Cambridge(剑桥大学) ; University of Oxford(牛津大学) ; Harvard University(哈佛大学) ; MIT(麻省理工学院) ; University of Washington(华盛顿大学)
专题命中 扩散模型 :diffusion(title,title_cn);分类 cs.CV
AI总结 提出PTL-Diffusion,通过将前向噪声过程收敛到周期高斯终端族而非单一分布,显式嵌入相位结构,改善低维流形上的分布匹配,在点云和人脸数据集上降低误差。
fMRI-Diffusion: 用于重度抑郁症诊断的基于时间Transformer扩散模型的fMRI时间序列生成
机构 * School of Information and Communication Technology, Griffith University(信息与通信技术学院,格里菲斯大学)
专题命中 扩散模型 :diffusion(title,title_cn);分类 cs.CV
AI总结 提出fMRI-Diffusion框架,通过时间Transformer扩散模型合成ROI级fMRI时间序列而非功能连接矩阵,以保留时间信息并提升小样本下MDD诊断准确率。
RiT: vanilla diffusion transformers suffice in representation space
机构 * Mila – Québec AI Institute, UdeM(魁北克AI研究院,麦吉尔大学) ; Utrecht University(乌得勒支大学) ; Canada CIFAR AI Chair(加拿大CIFAR人工智能主席)
专题命中 扩散模型 :diffusion(title,title_cn);分类 cs.CV
AI总结 该研究探讨了在表示空间中使用vanilla diffusion transformers进行图像生成的有效性,发现通过预训练的表示空间能够更有效地进行流匹配学习,从而在ImageNet数据集上取得了优于DiT-DH-XL的性能。
Diffusion-APO:基于轨迹的直接偏好对齐用于视频扩散变换器
机构 * Alibaba Group(阿里巴巴集团)
专题命中 扩散模型 :diffusion(title,title_cn);分类 cs.CV
AI总结 本文提出Diffusion-APO,通过同步训练噪声与推理时的去噪路径,解决视频扩散模型与人类意图对齐的问题,采用统一的RLHF框架实现灵活的多阶段偏好对齐,提升视觉质量和指令遵循性能。
扩散模板:一种统一的插件框架,用于可控扩散
机构 * Alibaba Group(阿里巴巴集团)
专题命中 扩散模型 :diffusion(title,summary_cn);image editing(abstract);inpainting(abstract);分类 cs.CV
AI总结 本文提出Diffusion Templates框架,通过解耦基础模型推理与可控能力注入,统一了扩散模型的可控能力,支持多种任务和不同backbone的兼容性,提升了模块化和可扩展性。
Comments 21 pages, 15 figures
X-Diffusion:在跨具身人类示范上训练扩散策略
机构 * Cornell University(康奈尔大学)
专题命中 扩散模型 :diffusion(title,title_cn);分类 cs.CV
AI总结 本文提出X-Diffusion框架,通过在噪声人类动作上训练扩散策略,提升机器人任务成功率16%。
Comments ICRA 2026
机构 * Georgia Institute of Technology(佐治亚理工学院) ; Rutgers University(罗格斯大学)
专题命中 扩散模型 :diffusion(title,abstract);image generation(title);text-to-image(title);分类 cs.CV
专题命中 扩散模型 :diffusion(title,abstract);image generation(abstract);text-to-image(abstract);image editing(abstract)
Comments Accepted by CVPR 2024. Project page: https://bivdiff.github.io; GitHub repository: https://github.com/MCG-NJU/BIVDiff
专题命中 扩散模型 :diffusion(title,abstract);image generation(title);text-to-image(title);分类 cs.CV
Comments 28 pages, 8 figures, 10 tables
专题命中 扩散模型 :diffusion(title,abstract);image generation(title);text-to-image(title);分类 cs.CV
Comments Accepted by ICCV 2023