Repurposing 2D Diffusion Models for 3D Shape Completion
将2D扩散模型用于3D形状补全
机构 * Stanford University(斯坦福大学)
专题命中 扩散模型 :diffusion(title,abstract);text-to-image(abstract);分类 cs.CV
AI总结 本文提出利用2D扩散模型进行3D形状补全,通过Shape Atlas实现模态对齐,提升生成效果并验证其在点云补全和网格生成中的实用性。
视觉与机器人
图像生成、文生图、图像编辑、扩散模型和可控生成。
将2D扩散模型用于3D形状补全
机构 * Stanford University(斯坦福大学)
专题命中 扩散模型 :diffusion(title,abstract);text-to-image(abstract);分类 cs.CV
AI总结 本文提出利用2D扩散模型进行3D形状补全,通过Shape Atlas实现模态对齐,提升生成效果并验证其在点云补全和网格生成中的实用性。
AutoRefiner: 通过在随机采样路径上的反思细化改进自回归视频扩散模型
机构 * Australian National University(澳大利亚国立大学) ; Sony AI(索尼人工智能) ; Sony Group Corporation(索尼集团)
专题命中 扩散模型 :diffusion(title,abstract);text-to-image(abstract);分类 cs.CV
AI总结 AutoRefiner通过路径噪声细化和反射式KV缓存改进AR-VDMs的样本保真度
WDT-MD:用于视网膜图像微动脉瘤检测的小波扩散变换器
专题命中 扩散模型 :diffusion(title,abstract);inpainting(abstract);分类 cs.CV
AI总结 WDT-MD 通过小波扩散变换器框架,解决微动脉瘤检测中的身份映射、区分困难和重建效果差问题,提升视网膜图像筛查性能。
Comments 9 pages, 6 figures, 8 tables, accepted by AAAI 2026
扩散模型中hallucination的计数
机构 * University of Adelaide(阿德莱德大学) ; Meituan(美团) ; Shanghai Jiao Tong University(上海交通大学)
专题命中 扩散模型 :diffusion(title,abstract);image generation(abstract);分类 cs.CV
AI总结 本文提出了一种针对扩散模型中计数hallucination的评估方法,通过构建CountHalluSet数据集,系统分析不同采样条件对hallucination的影响,并揭示FID等指标无法捕捉计数hallucination的问题。
MetaVoxel:联合图像与临床元数据的扩散建模
专题命中 扩散模型 :diffusion(title,abstract);image generation(abstract);分类 cs.CV
AI总结 MetaVoxel通过联合扩散建模统一图像与临床元数据,实现图像生成、年龄估计和性别预测,性能媲美传统任务特定模型。
通用去噪扩散代码本模型(gDDCM):利用预训练扩散模型进行图像分词
专题命中 扩散模型 :diffusion(title,abstract);image generation(abstract);分类 cs.CV
AI总结 gDDCM通过统一框架和回溯策略提升图像分词效率,实现对主流扩散模型的兼容性与高质量重建
Comments in Chinese language
Glance: 通过1个样本加速扩散模型
机构 * WHU(武汉大学) ; NUS(国立新加坡大学) ; CSU(中国科学技术大学) ; UESTC(电子科技大学) ; Microsoft(微软公司)
专题命中 扩散模型 :diffusion(title,abstract);image generation(abstract);分类 cs.CV
AI总结 本文提出通过轻量LoRA适配器实现扩散模型的高效加速,仅需1个样本训练即可获得强泛化能力。
扩散生成模型确定性采样动态中的几何正则性
机构 * University at Buffalo, State University of New York(纽约州立大学布法罗分校) ; Zhejiang University(浙江大学)
专题命中 扩散模型 :diffusion(title,abstract);image generation(abstract);分类 cs.CV
AI总结 本文揭示了扩散生成模型采样轨迹的几何正则性,提出动态规划方案提升图像生成性能。
Comments 57 pages. Accepted by Journal of Statistical Mechanics: Theory and Experiment (2025). The short version was published in ICML 2024. arXiv admin note: text overlap with arXiv:2405.11326
Journal ref J. Stat. Mech. (2025) 124002
ObjectAdd:通过一种无需训练的扩散修改方法将对象添加到图像中
专题命中 扩散模型 :diffusion(title,abstract);inpainting(abstract);分类 cs.CV
AI总结 ObjectAdd通过无需训练的扩散修改方法,实现用户指定区域内的对象添加,保持图像一致性与无缝融合。
Comments 12 pages in total
OmniPSD:基于扩散变换器的分层PSD生成
机构 * National University of Singapore(新加坡国立大学) ; Lovart AI
专题命中 扩散模型 :diffusion(title,abstract);image generation(abstract);分类 cs.CV
AI总结 OmniPSD通过扩散变换器实现文本到PSD生成和图像到PSD分解,提升分层设计的生成与编辑能力。
事件定制图像生成
机构 * Zhejiang University, Hangzhou, China(浙江大学) ; The Hong Kong University of Science and Technology(香港科技大学)
专题命中 扩散模型 :image generation(title,abstract);diffusion(abstract);分类 cs.CV
AI总结 本文提出FreeEvent方法,通过引入实体切换和事件转移路径,实现事件定制化图像生成,提升复杂场景下的定制化能力。
Journal ref ICML 2025
TreeQ: 通过树结构混合精度搜索推动扩散变换器的量化边界
机构 * Shanghai Jiao Tong University(上海交通大学) ; Tsinghua University(清华大学) ; ETH Zürich(苏黎世联邦理工学院) ; Adobe Research(Adobe研究院)
专题命中 扩散模型 :diffusion(title,abstract);image generation(abstract);分类 cs.CV
AI总结 TreeQ通过树结构混合精度搜索方法,首次在DiT模型上实现接近无损的4位PTQ性能,解决了DiT量化中的关键挑战。
Comments Code and Supplementary Material could be found at https://github.com/racoonykc/TreeQ
AortaDiff:一种用于无对比剂AAA成像的统一多任务扩散框架
机构 * Department of Engineering Science, University of Oxford, United Kingdom(牛津大学工程科学系) ; Nuffield Department of Surgical Sciences, University of Oxford, United Kingdom(牛津大学外科科学努尔菲尔德系) ; Technical University of Munich, Germany(慕尼黑技术大学) ; ELLIS Institute Finland, Finland(芬兰ELLIS研究所) ; Aalto University, Finland(阿alto大学)
专题命中 扩散模型 :diffusion(title,abstract);image synthesis(abstract);分类 cs.CV
AI总结 AortaDiff通过统一多任务扩散框架实现无对比剂AAA成像,同时生成合成CECT图像并分割主动脉腔和血栓,提升了分割精度和临床测量准确性。
Comments WACV 2026
流到模式:用于最新图像标记化的模式寻求扩散自编码器
机构 * Stanford University(斯坦福大学) ; University of Michigan(密歇根大学)
专题命中 扩散模型 :diffusion(title,abstract);image generation(abstract);分类 cs.CV
AI总结 FlowMo是一种基于Transformer的扩散自编码器,通过模式匹配和模式寻求阶段实现图像标记化的新SOTA,无需卷积、对抗损失等。
Comments ICCV 2025, 19 pages
基于边界的偏好优化:无需参考的扩散模型对齐
专题命中 扩散模型 :diffusion(title,abstract);text-to-image(abstract);分类 cs.CV
AI总结 本文提出MaPO,一种无需参考的扩散模型对齐方法,通过优化偏好输出与非偏好输出之间的边界,提升T2I任务的适应性能,减少训练时间并优于现有方法。
Comments Accepted to AAAI 2026 Main Technical Track
对扩散模型进行噪声条件感知对齐
机构 * Artificial Intelligence Research Institute (AIRI)(人工智能研究 institute(AIRI)) ; Skolkovo Institute of Science and Technology(斯克尔科沃科学与技术研究所) ; HSE University(俄罗斯高等经济学院) ; Research Center for Trusted Artificial Intelligence, ISP RAS(可信人工智能研究中心,信息与通信技术研究院) ; ISP RAS(信息与通信技术研究院)
专题命中 扩散模型 :diffusion(title,abstract);text-to-image(abstract);分类 cs.CV
AI总结 本研究提出在扩散模型的U-Net嵌入空间中使用感知目标,以提升人类偏好对齐的效率和质量,并减少计算成本。
ResDiT: 在扩散变换器中激发内在分辨率可扩展性
机构 * Beijing University of Posts and Telecommunications(北京邮电大学) ; Tsinghua University(清华大学)
专题命中 扩散模型 :diffusion(title,abstract);image synthesis(abstract);分类 cs.CV
AI总结 ResDiT通过改进位置嵌入和局部增强机制,实现了无需训练的高分辨率图像生成,有效解决空间布局崩溃和纹理保真度下降问题。
Comments 8 pages
图像生成作为机器人操作的视觉规划器
机构 * Southern China University of Technology(华南理工大学)
专题命中 扩散模型 :image generation(title,abstract);diffusion(abstract);分类 cs.CV
AI总结 本文提出利用图像生成模型作为机器人视觉规划器,通过轻度微调实现时间连贯的机器人操作视频生成。
Comments 11 pages 9 figures Under review at CVPR 2026
DiffProtect: 用扩散模型生成对抗示例以保护面部隐私
机构 * Johns Hopkins University(约翰霍普金斯大学) ; City University of Hong Kong(香港城市大学) ; University of St Andrews(圣安德鲁大学)
专题命中 扩散模型 :diffusion(title,abstract);image generation(abstract);分类 cs.CV
AI总结 DiffProtect利用扩散模型生成高质量对抗示例,提升面部隐私保护的视觉质量和攻击成功率
Comments Code is at https://github.com/joellliu/DiffProtect/
POLARIS:用于扩散模型中鲁棒和自适应逆向的投影正交最小二乘法
机构 * The Hong Kong University of Science and Technology (Guangzhou)(香港科学与技术大学(广州)) ; Griffith University(格里菲斯大学) ; Data61/CSIRO Project(Data61/CSIRO项目)
专题命中 扩散模型 :diffusion(title,abstract);image editing(abstract);分类 cs.CV
AI总结 POLARIS通过将逆向问题转化为误差来源问题,以单行代码提升扩散模型逆向的鲁棒性和适应性,显著减少噪声近似误差。
一种快速且高效的基于现代BERT的文本条件扩散模型用于医学图像分割
机构 * International Institute of Information Technology, Hyderabad, 500032, India(国际信息科技学院,海得拉巴)
专题命中 扩散模型 :diffusion(title,abstract);image generation(abstract);分类 cs.CV
AI总结 本文提出FastTextDiff,利用ModernBERT提升医学图像分割的效率和准确性,通过整合文本注释和多模态注意力机制改进传统扩散模型。
Comments 15 pages, 3 figures, Accepted in Slide 3 10th International Conference on Computer Vision & Image Processing (CVIP 2026)
DEAL-300K:基于扩散的编辑区域定位与30万规模数据集及频率提示基线
机构 * School of Cyber Science and Engineering, Sichuan University(四川大学计算机科学与工程学院) ; Key Laboratory of Data Protection and Intelligent Management, Ministry of Education, Sichuan University(教育部数据保护与智能管理重点实验室)
专题命中 扩散模型 :diffusion(title,abstract);image editing(abstract);分类 cs.CV
AI总结 DEAL-300K通过多模态大语言模型生成编辑指令,结合频率提示微调方法,实现了基于扩散的图像编辑区域定位,提供高精度的基线和研究基础。
Comments 13pages,12 figures
OmniRefiner: 基于强化学习的局部扩散细化
机构 * Zhejiang University(浙江大学) ; Nankai University(南开大学) ; National University of Singapore(新加坡国立大学)
专题命中 扩散模型 :diffusion(title,abstract);image generation(abstract);分类 cs.CV
AI总结 OmniRefiner通过强化学习和局部扩散细化技术,提升参考引导图像生成中细粒度细节的保留与一致性。
图像扩散模型在视频中表现出涌现的时间传播
机构 * Dept. of CSE, Korea University(计算机科学与工程系,韩国大学)
专题命中 扩散模型 :diffusion(title,abstract);image generation(abstract);分类 cs.CV
AI总结 本文提出DRIFT框架,利用预训练图像扩散模型和SAM引导的掩码细化,实现视频中鲁棒的零样本物体跟踪。
DLADiff: 一种双层防御框架,用于对抗扩散模型的微调和零样本定制
机构 * Shanghai Jiao Tong University(上海交通大学) ; Shandong University(山东大学) ; Hefei University of Technology(合肥工业大学) ; East China Normal University(华东师范大学)
专题命中 扩散模型 :diffusion(title,abstract);image generation(abstract);分类 cs.CV
AI总结 DLADiff提出一种双层防御框架,通过双代理模型和交替动态微调有效防御扩散模型的微调和零样本生成攻击。
通过扩散基于的sinogram补全推进有限角度CT重建
机构 * Dept. of Electrical and Computer Engineering, Northwestern University, Evanston, IL, USA(电气与计算机工程系,西北大学,爱荷华州埃文斯顿)
专题命中 扩散模型 :diffusion(title,abstract);inpainting(abstract);分类 cs.CV
AI总结 本文提出基于扩散模型的sinogram补全方法,结合蒸馏和伪逆约束,实现高效准确的有限角度CT重建,有效抑制伪影并保持结构细节。
Comments Accepted at the 2025 IEEE International Conference on Image Processing (Oral)
通过合并预训练专家打破扩散模型中似然-质量权衡
机构 * Saarland University(萨尔兰大学) ; Helmholtz AI(亥姆霍兹人工智能研究所) ; Technical University of Munich(慕尼黑技术大学) ; CISPA Helmholtz Center for Information Security(亥姆霍兹信息安全部分研究所) ; MPI for Intelligent Systems, Tübingen(图宾根智能系统研究所)
专题命中 扩散模型 :diffusion(title,abstract);image generation(abstract);分类 cs.CV
AI总结 通过在去噪过程中切换预训练专家,该方法有效打破扩散模型中似然与质量的权衡,提升图像生成质量和似然
Comments ICLR 2025 DeLTa workshop
InfoScale: 通过有效利用信息实现免训练可变尺度图像生成
机构 * USTC(中国科学技术大学) ; Beihang University(北京航空航天大学) ; CUHK MMLab(香港中文大学多媒体实验室) ; Kuaishou Technology(快手科技)
专题命中 扩散模型 :image generation(title,abstract);diffusion(abstract);分类 cs.CV
AI总结 InfoScale通过有效利用信息解决扩散模型在可变尺度图像生成中的信息丢失、聚合不灵活和分布不匹配问题。
Warm Diffusion: Blur-Noise Mixture Diffusion Models的配方
机构 * Department of Computer Science, National Yang Ming Chiao Tung University, Hsinchu, Taiwan(计算机科学系,National Yang Ming Chiao Tung大学,Hsinchu,台湾)
专题命中 扩散模型 :diffusion(title,abstract);image generation(abstract);分类 cs.CV
AI总结 Warm Diffusion通过融合模糊与噪声的混合模型,解决传统热扩散和冷扩散的不足,提升图像生成效果。
潜在空间中的一小步,像素世界中的一大跃:一种快速的潜在上采样适配器用于您的扩散模型
专题命中 扩散模型 :diffusion(title,abstract);image synthesis(abstract);分类 cs.CV
AI总结 提出一种轻量级潜在上采样适配器,通过潜在空间单次前向传递实现高分辨率图像合成,提升效率并保持保真度。