arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

图像生成

图像生成、文生图、图像编辑、扩散模型和可控生成。

共收录 1274 信号源:cs.CV, cs.GR, cs.MM

1. 扩散模型 1274 篇

2606.29814 2026-07-17 cs.CV 版本更新 93%

Nemotron-Labs-Diffusion-Image: Advancing Masked Discrete Diffusion for High-Resolution Image Synthesis

Nemotron-Labs-Diffusion-Image:推进掩码离散扩散用于高分辨率图像合成

Shufan Li, Greg Heinrich, Hanrong Ye, Yonggan Fu, Aditya Grover, Jan Kautz, Pavlo Molchanov

机构 * NVIDIA

专题命中 扩散模型 :diffusion(title,title_cn);image synthesis(title,abstract);image generation(abstract);text-to-image(abstract)

AI总结 提出Nemotron-Labs-Diffusion-Image模型,通过令牌编辑机制和分组交叉熵目标解决掩码离散扩散模型的自校正缺失和训练信号稀疏问题,实现高分辨率文本到图像合成。

Comments 23 pages, 12 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.08434 2026-06-09 cs.GR cs.CV 版本更新 93%

Bokeh Diffusion: Defocus Blur Control in Text-to-Image Diffusion Models

Bokeh Diffusion:文本到图像扩散模型中的散焦模糊控制

Armando Fortes, Tianyi Wei, Shangchen Zhou, Xingang Pan

机构 * S-Lab, Nanyang Technological University(S实验室,南洋理工大学)

专题命中 扩散模型 :diffusion(title,title_cn);text-to-image(title,abstract);image editing(abstract);分类 cs.CV、cs.GR

AI总结 提出Bokeh Diffusion框架,通过物理散焦模糊参数条件化扩散模型,结合混合训练流程和接地自注意力机制,实现场景一致的散景模糊控制,支持双向模糊强度调整和真实图像编辑。

Comments SIGGRAPH Asia 2025. Project page: https://atfortes.github.io/projects/bokeh-diffusion/

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.22216 2026-08-06 eess.IV cs.AI cs.CV 版本更新 91%

Delta-Diffusion: Modeling Longitudinal Brain Amyloid-PET Trajectories via Conditional Poisson Diffusion Bridge

Delta-Diffusion: 通过条件泊松扩散桥建模纵向脑淀粉样蛋白-PET轨迹

Yongheng Sun, Minhui Yu, Mengqi Wu, Maureen Kohi, Mingxia Liu

机构 * University of North Carolina at Chapel Hill(北卡罗来纳大学教堂山分校)

专题命中 扩散模型 :diffusion(title,title_cn);image synthesis(abstract);分类 cs.CV

AI总结 提出Delta-Diffusion框架,将纵向PET合成建模为条件泊松扩散桥过程,结合扩散Transformer和物理启发的泊松扰动,在542名受试者上优于现有方法,准确捕捉淀粉样蛋白沉积的纵向变化。

详情

展开后加载摘要…

URL PDF HTML 收藏
2312.07865 2026-06-23 cs.CV 版本更新 90%

SimAC: A Simple Anti-Customization Method for Protecting Face Privacy against Text-to-Image Synthesis of Diffusion Models

SimAC: 一种针对扩散模型文本到图像合成的简单面部隐私反定制方法

Feifei Wang, Zhentao Tan, Tianyi Wei, Yue Wu, Qidong Huang

机构 * University of Science and Technology of China(中国科学技术大学) Alibaba Cloud(阿里云)

专题命中 扩散模型 :diffusion(title,abstract);text-to-image(title);image synthesis(title);分类 cs.CV

AI总结 针对扩散模型定制化技术引发的隐私问题,提出SimAC方法,通过分析时间步选择与频域感知关系及去噪过程不同层特征,设计自适应贪婪搜索和特征优化框架,有效提升身份干扰,保护用户隐私。

Comments Accepted by CVPR2024. Code: https://github.com/somuchtome/SimAC

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.04344 2026-07-21 cs.LG cs.AI 版本更新 89%

UnMaskFork: Test-Time Scaling for Masked Diffusion via Deterministic Action Branching

UnMaskFork:通过确定性动作分支实现Masked Diffusion的测试时扩展

Kou Misaki, Takuya Akiba

专题命中 扩散模型 :diffusion(title,title_cn)

AI总结 UnMaskFork通过确定性动作分支提升Masked Diffusion在测试时的扩展能力,优于现有方法并在复杂任务中表现优异。

Comments Accepted to ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.01170 2026-07-14 cs.IR cs.AI 版本更新 89%

Diffusion-GR2: Diffusion Generative Reasoning Re-ranker

Diffusion-GR2: 扩散生成推理重排序器

Zhuoxuan Zhang, Kangqi Ni, Yuhang Chen, Mingfu Liang, Xiaohan Wei, Yunchen Pu, Fei Tian, Chonglin Sun, Frank Shyu, Adam, Song, Sandeep Pandey, Luke Simon, Tianlong Chen, Xi Liu

机构 * Meta AI UNC Chapel Hill(北卡罗来纳大学教堂山分校)

专题命中 扩散模型 :diffusion(title,title_cn)

AI总结 提出Diffusion-GR2,通过转换微调、在线策略蒸馏和强化学习将自回归推理重排序器转换为块扩散模型,在保持精度的同时将推理吞吐量提升2.4-3.5倍。

Comments Work in progress

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.23053 2026-06-23 cs.LG 版本更新 89%

Double-Diffusion: Balancing Speed, Accuracy, and Uncertainty in Probabilistic Forecasting for Urban Sensor Networks

Double-Diffusion: 城市传感器网络中概率预测的速度、准确性与不确定性的平衡

Hanlin Dong, Arian Prabowo, Hao Xue, Ao Shuang, Tianyi Zhou, Yuxuan Liang, Flora D. Salim

机构 * University of New South Wales(新南威尔士大学) University of Maryland(马里兰大学) The Hong Kong University of Science and Technology (Guangzhou)(香港科学与技术大学(广州))

专题命中 扩散模型 :diffusion(title,title_cn)

AI总结 提出Double-Diffusion方法,结合闭式图热先验与去噪扩散模型,通过短预热链从先验开始去噪,实现快速、准确且具有不确定性的概率预测,在四个真实数据集上取得最佳CRPS。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.24817 2026-08-10 cs.CV eess.IV 版本更新 89%

High-Fidelity Synthetic Transmission Electron Microscopy Image Generation Using Diffusion Probabilistic Models for Data-Limited Semiconductor Metrology

高保真合成透射电子显微镜图像生成:基于扩散概率模型的数据受限半导体计量

Johannes Boehm, Bappaditya Dey

机构 * Chemnitz University of Technology, Chemnitz, Germany(化学工业大学,化学矿泉,德国) Interuniversity Microelectronics Centre (imec), Leuven, Belgium(大学微电子中心(imec),卢汶,比利时)

专题命中 扩散模型 :image generation(title,abstract);diffusion(title,abstract);inpainting(abstract);分类 cs.CV

AI总结 针对半导体计量中TEM数据稀缺问题,提出基于去噪扩散概率模型(DDPM)的合成图像生成框架,采用渐进式补丁训练策略,仅需15个样本即可从零训练,并集成数据增强、域迁移、分类器引导和修复技术,生成图像在结构相似性上达到MS-SSIM>0.98,支持缺陷检测、分割等下游任务。

Comments To be presented at the 2026 International Symposium ELMAR, published by IEEE in the conference proceedings

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.15357 2026-07-28 cs.CV cs.LG 版本更新 89%

MaskAttn-SDXL: Controllable Region-Level Text-To-Image Generation

MaskAttn-SDXL:可控区域级文本到图像生成

Yu Chang, Jiahao Chen, Anzhe Cheng, Paul Bogdan

机构 * University of Southern California(南加州大学) University of Toronto(多伦多大学)

专题命中 扩散模型 :image generation(title,abstract);text-to-image(title,abstract);diffusion(abstract);分类 cs.CV

AI总结 本文提出MaskAttn-SDXL模块,通过在softmax前注入token条件空间门控,解决扩散模型在多物体生成中的全局协调和可靠性问题,无需改变SDXL流程。

Comments Published in the 2026 International Joint Conference on Neural Networks (IJCNN 2026)

Journal ref Proceedings of the 2026 International Joint Conference on Neural Networks (IJCNN 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.03499 2026-07-27 eess.IV cs.CV 版本更新 89%

GeoDiff-SAR: A Geometric Prior Guided Diffusion Model for SAR Image Generation

GeoDiff-SAR:一种基于几何先验的扩散模型用于SAR图像生成

Fan Zhang, Xuanting Wu, Fei Ma, Qiang Yin, Yuxin Hu

机构 * College of Information Science and Technology, Beijing University of Chemical Technology(信息科学与技术学院,北京化工大学) Aerospace Information Research Institute, Chinese Academy of Sciences(航天信息研究所,中国科学院)

专题命中 扩散模型 :diffusion(title,abstract);image generation(title,abstract);分类 cs.CV

AI总结 GeoDiff-SAR通过引入几何先验引导扩散模型,提升SAR图像生成的保真度和分类准确性,尤其在不同方位角识别性能上有显著提升。

Comments 3 pages, 1 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.23783 2026-08-13 cs.CV 版本更新 89%

Diffusion Probe: Generated Image Result Prediction Using CNN Probes

扩散探针:利用CNN探针进行生成图像结果预测

Benlei Cui, Bukun Huang, Zhizeng Ye, Xuemei Dong, Tuo Chen, Hui Xue, Dingkang Yang, Longtao Huang, Jingqun Tang, Haiwen Hong

机构 * Alibaba Group(阿里巴巴集团) Laboratory for Statistical Monitoring and Intelligent Governance of Common Prosperity, School of Statistics and Data Science, Zhejiang Gongshang University(浙江工商大学统计与数据科学学院共同富裕统计监测与智能治理实验室) Southeast University(东南大学) College of Intelligent Robotics and Advanced Manufacturing, Fudan University(复旦大学智能机器人与先进制造学院) ByteDance Inc.(字节跳动有限公司)

专题命中 扩散模型 :diffusion(title,summary_cn);text-to-image(abstract);分类 cs.CV

AI总结 本文提出Diffusion Probe框架,通过早期扩散交叉注意力分布预测最终图像质量,提升文本生成图像的效率与质量。

Comments CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.19244 2026-07-17 cs.CV 版本更新 89%

Lavida-O: Elastic Large Masked Diffusion Models for Unified Multimodal Understanding and Generation

Lavida-O:用于统一多模态理解与生成的弹性大掩码扩散模型

Shufan Li, Jiuxiang Gu, Kangning Liu, Zhe Lin, Zijun Wei, Aditya Grover, Jason Kuen

机构 * Adobe(Adobe公司) UCLA(加州大学洛杉矶分校)

专题命中 扩散模型 :diffusion(title,abstract);image generation(abstract);text-to-image(abstract);image editing(abstract)

AI总结 研究提出Lavida-O统一多模态MDM,采用Elastic-MoT架构,结合轻量级生成与理解分支,通过多种技术支持高效生成。该模型在多模态任务基准测试中性能领先,优于现有模型,还能加速推理,成为可扩展多模态推理和生成新范式。

Comments 31 pages, 15 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.16551 2026-07-20 cs.CV cs.AI 版本更新 88%

CompDiff: Hierarchical Compositional Diffusion for Fair and Zero-Shot Intersectional Medical Image Generation

CompDiff:分层组合扩散用于公平和零样本交叉性医学图像生成

Mahmoud Ibrahim, Bart Elen, Chang Sun, Gokhan Ertaylan, Michel Dumontier

机构 * Institute of Data Science, Faculty of Science and Engineering, Maastricht University, Maastricht, The Netherlands(数据科学研究所,科学与工程学院,马斯特里赫特大学,马斯特里赫特,荷兰) Department of Advanced Computing Sciences, Faculty of Science and Engineering, Maastricht University, Maastricht, The Netherlands(先进计算科学系,科学与工程学院,马斯特里赫特大学,马斯特里赫特,荷兰) VITO, Belgium(比利时VITO研究院)

专题命中 扩散模型 :image generation(title,abstract);diffusion(title,abstract);分类 cs.CV

AI总结 CompDiff通过分层组合扩散框架解决生成模型中因数据不平衡导致的公平性和零样本交叉性生成问题,在图像质量、子组公平性和零样本交叉性生成方面表现优异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.16167 2026-07-16 cs.CV cs.AI 版本更新 88%

PersGuard: Preventing Malicious Personalization in Text-to-Image Diffusion Models via Model Backdoors

PersGuard:通过模型后门防止文本到图像扩散模型中的恶意个性化

Xinwei Liu, Xiaojun Jia, Yuan Xun, Hua Zhang, Xiaochun Cao

机构 * Institute of Information Engineering, Chinese Academy of Sciences(信息工程研究所,中国科学院) School of Cyber Security, University of Chinese Academy of Sciences(中国科学院大学网络安全学院) BraneMatrix AI School of Cyber Science and Technology, Shenzhen Campus, Sun Yat-sen University(中山大学深圳校区计算机科学与技术学院)

专题命中 扩散模型 :text-to-image(title,abstract);diffusion(title,abstract);分类 cs.CV

AI总结 研究针对文本到图像扩散模型个性化引发的隐私问题,提出PersGuard框架,通过在模型发布前嵌入保护后门,结合统一优化问题制定后门注入,经实验验证其在隐私保护方面优于现有基于扰动的方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.08303 2026-07-07 cs.CV 版本更新 88%

SnapGen++: Unleashing Diffusion Transformers for Efficient High-Fidelity Image Generation on Edge Devices

SnapGen++:释放扩散变压器以在边缘设备上进行高效高保真图像生成

Dongting Hu, Aarush Gupta, Magzhan Gabidolla, Arpit Sahni, Huseyin Coskun, Yanyu Li, Yerlan Idelbayev, Ahsan Mahmood, Aleksei Lebedev, Dishani Lahiri, Anujraaj Goyal, Ju Hu, Mingming Gong, Sergey Tulyakov, Anil Kag

机构 * Snap Inc. University of Melbourne(墨尔本大学) MBZUAI

专题命中 扩散模型 :image generation(title,abstract);diffusion(title,abstract);分类 cs.CV

AI总结 针对扩散变压器在边缘设备部署的高成本问题,提出高效DiT框架。通过紧凑架构、弹性训练框架和知识引导的分布匹配蒸馏,在资源受限下实现变压器级生成质量,可在多样硬件上部署。

Comments Project page: https://snap-research.github.io/snapgenplusplus/

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.22699 2026-07-07 cs.CV 版本更新 88%

Z-Image: An Efficient Image Generation Foundation Model with Single-Stream Diffusion Transformer

Z-Image: 一种基于单流扩散Transformer的高效图像生成基础模型

Image Team, Huanqia Cai, Sihan Cao, Ruoyi Du, Peng Gao, Aiming Hao, Steven Hoi, Zhaohui Hou, Shijie Huang, Dengyang Jiang, Yuming Jiang, Xin Jin, Liangchen Li, Zhen Li, Zhong-Yu Li, David Liu, Dongyang Liu, Qilong Wu, Feng Yu, Zechao Zhan, Chi Zhang, Shifeng Zhang, Ruikai Zhou, Shilin Zhou

机构 * Alibaba Group(阿里巴巴集团)

专题命中 扩散模型 :image generation(title,abstract);diffusion(title,abstract);分类 cs.CV

AI总结 提出Z-Image,一种6B参数的高效图像生成基础模型,采用可扩展单流扩散Transformer架构,通过优化数据基础设施和训练流程,仅用314K H800 GPU小时完成训练,性能媲美顶级商业模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.00094 2026-07-02 cs.CV cs.AI 版本更新 88%

Diffusion Image Generation with Explicit Modeling of Data Manifold Geometry

显式建模数据流形几何的扩散图像生成

Duoduo Xue, Zhiyu Zhu, Junhui Hou

机构 * City University of Hong Kong(香港城市大学)

专题命中 扩散模型 :image generation(title,abstract);diffusion(title,abstract);分类 cs.CV

AI总结 提出MIND框架,通过将离散补丁标记化集成到连续扩散模型的得分函数中显式建模流形几何,结合离散标记的结构量化能力和连续扩散的并行生成灵活性,在ImageNet 256×256上显著降低FID。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.14679 2026-07-02 cs.CV 版本更新 88%

Universal Image Immunization against Diffusion-based Image Editing via Semantic Injection

基于语义注入的通用图像免疫方法抵御基于扩散模型的图像编辑

Chanhui Lee, Donggyu Choi, Seunghyun Shin, Hae-Gon Jeon, Jeany Son

机构 * POSTECH(浦项科技大学) GIST(光州科学技术院) Yonsei University(延世大学)

专题命中 扩散模型 :diffusion(title,abstract);image editing(title,abstract);分类 cs.CV

AI总结 提出首个通用对抗扰动框架,通过语义注入使扩散模型误解输入图像,抑制原始内容,从而有效阻断未经授权的编辑,在通用扰动设置下优于基线,并具备黑盒迁移性。

Comments ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.08127 2026-07-02 cs.CV cs.AI 版本更新 88%

Controllable Diffusion-Based Lesion Inpainting for Scalable Histopathology Data Augmentation

基于可控扩散的病灶修复用于可扩展的组织病理学数据增强

Mohamad Koohi-Moghadam, Mohammad-Ali Nikouei Mahani, Rex K. H. Au-Yeung, Raymond Yu O, Monalyn Marabi, Piyapharom Intarawichian, Fabian Z. X. Lean, Andrew Ferguson, Kyongtae Tyler Bae

机构 * Department of Diagnostic Radiology, Li Ka Shing Faculty of Medicine, The University of Hong Kong(香港大学李嘉诚医学院诊断放射学系) Department of Pathology, Li Ka Shing Faculty of Medicine, The University of Hong Kong(香港大学李嘉诚医学院病理学系) Department of Anatomical and Cellular Pathology, Prince of Wales Hospital, The Chinese University of Hong Kong(香港中文大学威尔斯亲王医院解剖及细胞病理学系) Department of Infectious Diseases and Public Health, Jockey Club College of Veterinary Medicine and Life Sciences, City University of Hong Kong(香港城市大学赛马会动物医学及生命科学院传染病及公共卫生学系) CityU Veterinary Diagnostic Laboratory Co., Ltd., City University of Hong Kong(香港城市大学城市大学兽医诊断实验室有限公司)

专题命中 扩散模型 :diffusion(title,abstract);inpainting(title,abstract);分类 cs.CV

AI总结 提出PathoGen扩散模型,将病灶可控地修复到良性组织图像中,生成高保真形态,在四个数据集上优于基线,病理专家区分真假仅略高于随机(57.75%),数据增强使分割Dice提升最高0.18。

Comments 19 pages, 5 figures, 1 Table

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.01959 2026-06-17 cond-mat.mtrl-sci 版本更新 88%

Score-based diffusion models for accurate crystal-structure inpainting and reconstruction of hydrogen positions

基于分数的扩散模型用于精确的晶体结构修补和氢原子位置重建

Timo Reents, Arianna Cantarella, Marnik Bercx, Pietro Bonfà, Giovanni Pizzi

专题命中 扩散模型 :diffusion(title,abstract);inpainting(title,abstract)

AI总结 提出将计算机视觉中的图像修补扩散模型应用于材料科学,实现从部分信息重建晶体结构,特别是氢原子位置,成功率超97%。

Journal ref npj Comput Mater 12, 203 (2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.23452 2026-08-12 cs.CV cs.CL 版本更新 87%

FoR-SALE: Frame of Reference-guided Spatial Adjustment in LLM-based Diffusion Editing

FoR-SALE:基于参考坐标系引导的LLM驱动扩散编辑中的空间调整

Tanawan Premsri, Parisa Kordjamshidi

机构 * Department of Computer Science and Engineering(计算机科学与工程系) Michigan State University(密歇根州立大学)

专题命中 扩散模型 :diffusion(title,abstract);image generation(abstract);text-to-image(abstract);分类 cs.CV

AI总结 FoR-SALE是SLD的扩展,通过参考坐标系引导的潜在空间操作调整图像朝向与深度,在三个空间理解基准上仅单轮校正就将SOTA T2I模型性能提升最高7.0个百分点,解决了非相机视角空间表达的生成偏差问题。

Comments Published in COLM 2026. 10 main pages, 4 tables, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.14008 2026-07-17 cs.CV 版本更新 87%

Sparse-LaViDa: Sparse Multimodal Discrete Diffusion Language Models

稀疏-LaViDa:稀疏多模态离散扩散语言模型

Shufan Li, Jiuxiang Gu, Kangning Liu, Zhe Lin, Zijun Wei, Aditya Grover, Jason Kuen

机构 * Adobe(Adobe公司) UCLA(加州大学洛杉矶分校)

专题命中 扩散模型 :diffusion(title,abstract);image generation(abstract);text-to-image(abstract);image editing(abstract)

AI总结 针对掩码离散扩散模型推理速度慢的问题,提出Sparse-LaViDa框架,通过动态截断冗余掩码令牌加速采样,引入专用寄存器令牌和注意力掩码保证质量与一致性,基于LaViDa - O构建,在多任务中实现加速且保持质量。

Comments 18 pages (12 pages for the main paper and 6 pages for the appendix), 9 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.02211 2026-07-07 cs.CV 版本更新 87%

TexTailor: Inference-Time Textual Guidance Tailoring for Multimodal Diffusion Transformers

TexTailor:用于多模态扩散变压器的推理时文本引导剪裁

Binglei Li, Mengping Yang, Zhiyu Tan, Junping Zhang, Hao Li

机构 * Fudan University(复旦大学) Shanghai Innovation Institute(上海创新研究院) Shanghai Academy of AI for Science(上海人工智能科学研究院)

专题命中 扩散模型 :diffusion(title,abstract);image generation(abstract);text-to-image(abstract);image editing(abstract)

AI总结 研究基于变压器的扩散模型中不同模块与文本条件的交互。通过系统管道分析各模块功能,提出推理时逐块文本引导剪裁方法,提升文本图像对齐,有多种下游应用,实验表明优于基线。

Comments To appear in ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.16325 2026-07-02 cs.CV 版本更新 87%

UltraImageGen: Efficient Ultra-High-Resolution Image Generation with Hierarchical Local Attention

UltraImageGen: 高效超高清图像生成与层级局部注意力

Yuyao Zhang, Yu-Wing Tai

专题命中 扩散模型 :image generation(title,abstract);text-to-image(abstract);diffusion(abstract);image synthesis(abstract)

AI总结 提出UltraImageGen框架,通过层级局部注意力和低分辨率全局引导,将预训练扩散模型扩展到8K以上分辨率,实现近线性复杂度、10倍加速和更低内存占用。

Comments 31 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.17353 2026-06-16 cs.LG cs.AI 版本更新 87%

Learning Permutation Distributions via Reflected Diffusion on Ranks

通过秩上的反射扩散学习排列分布

Sizhuang He, Yangtian Zhang, Shiyang Zhang, David van Dijk

机构 * University of California, Berkeley(加州大学伯克利分校)

专题命中 扩散模型 :diffusion(title,summary_cn)

AI总结 提出Soft-Rank Diffusion框架,通过将排列松弛为软秩实现平滑扩散,并引入上下文广义Plackett-Luce去噪器,在排序和组合优化任务上优于现有扩散方法。

Comments 18 pages including the appendix, 7 figures, 9 tables, Accepted at ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.20889 2026-06-23 cs.CV cs.AI cs.LG 版本更新 86%

Test-Time Alignment of Text-to-Image Diffusion Models via Null-Text Embedding Optimisation

文本到图像扩散模型的测试时对齐:通过空文本嵌入优化

Taehoon Kim, Henry Gouk, Timothy Hospedales

机构 * School of Informatics, University of Edinburgh(爱丁堡大学信息学院) Samsung AI Center, Cambridge(三星人工智能中心)

专题命中 扩散模型 :diffusion(title,abstract);text-to-image(title);分类 cs.CV

AI总结 提出Null-TTA方法,通过优化无分类器引导中的无条件嵌入实现测试时对齐,避免奖励黑客问题,在保持语义一致性的同时达到最先进性能。

Journal ref Published at CVPR2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.01134 2026-08-14 cs.GR cs.CV 版本更新 86%

RealMat: Realistic Materials with Diffusion and Reinforcement Learning

RealMat:结合扩散模型与强化学习的真实材质生成器

Xilong Zhou, Pedro Figueiredo, Miloš Hašan, Valentin Deschaintre, Paul Guerrero, Yiwei Hu, Nima Khademi Kalantari

机构 * Max Planck Institute for Informatics Saarbrücken Germany Texas A\&M University College Station USA Adobe Research San Jose USA Adobe Research London UK Max Planck Institute for Informatics Texas A\&M University Adobe Research

专题命中 扩散模型 :diffusion(title,abstract);text-to-image(abstract);分类 cs.CV、cs.GR

AI总结 针对材质生成的合成数据真实感不足、真实数据规模有限的问题,提出结合SDXL微调与强化学习的RealMat,有效提升了生成材质的真实性。

Comments 12 pages, 12 figures

Journal ref Computer Graphics Forum 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.21913 2026-07-24 physics.med-ph cs.AI 版本更新 86%

Equivariant Conditional Diffusion Model for Head and Neck CT Image Synthesis from CBCT

用于从CBCT合成头颈CT图像的等变条件扩散模型

Alzahra Altalib, Chunhui Li, Alessandro Perelli

专题命中 扩散模型 :diffusion(title,abstract);image synthesis(title)

AI总结 针对CBCT图像有伪影、CT图像难捕捉治疗中解剖变化的问题,提出EqDiff-CT模型,基于扩散概率模型和群等变条件U-Net主干,从CBCT合成高质量CT图像,经实验验证在多方面有显著提升,为CBCT改进提供框架。

Comments 43 pages, 9 figures, 6 tables, accepted in Medical Physics

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.11546 2026-08-14 cs.CV 版本更新 85%

Through Van Gogh's Eyes: Global Style Transfer with Diffusion Model

透过梵高的眼睛:基于扩散模型的全局风格迁移

Jeongha Lee, Yujin Kim, Ghazanfar Ali, Suhyun Kim, Jae-In Hwang

机构 * Korea Institute of Science and Technology(韩国科学技术研究院) University of Science and Technology(科技大学) Korea University(高丽大学) Gachon University(嘉泉大学) Kyung Hee University(庆熙大学)

专题命中 扩散模型 :diffusion(title,abstract);text-to-image(abstract);image synthesis(abstract);分类 cs.CV

AI总结 该研究针对现有艺术图像合成方法难以捕捉艺术家全局风格的问题,提出多对一的全局风格迁移范式及对应的全局风格引导、内容对齐引导方法,在WikiArt上验证了其在风格保真度等指标上的优势。

Comments Published at ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.14270 2026-08-03 cs.CV 版本更新 85%

Diagnosing and Correcting Concept Omission in Multimodal Diffusion Transformers

诊断和纠正多模态扩散Transformer中的概念遗漏

Kanghyun Baek, Jaihyun Lew, Chaehun Shin, Jungbeom Lee, Sungroh Yoon

机构 * Interdisciplinary Program in Artificial Intelligence, Seoul National University, Seoul, South Korea Department of Electrical Computer Engineering, Seoul National University, Seoul, South Korea Department of Computer Science \& Engineering, Korea University, Seoul, South Korea ISRC, Seoul National University, Seoul, South Korea

专题命中 扩散模型 :diffusion(title,abstract);image generation(abstract);text-to-image(abstract);分类 cs.CV

AI总结 本文通过线性探测发现文本嵌入中存在表征目标概念缺失的“遗漏信号”,并提出遗漏信号干预(OSI)方法放大该信号以主动催化缺失概念的生成,在FLUX.1-Dev和SD3.5-Medium上显著缓解了概念遗漏问题。

Comments Accepted to ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏