arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

图像生成

图像生成、文生图、图像编辑、扩散模型和可控生成。

共收录 69833 信号源:cs.CV, cs.GR, cs.MM

1. 扩散模型 69833 篇

2607.26735 2026-07-30 cs.CV cs.AI cs.MM 新提交 90%

Dual Inversion for Text-to-Image Diffusion Models: From Both Prompt and Noise Perspectives

文本到图像扩散模型的双重逆推:从提示与噪声双视角

Xiaolong Liu, Junjian Li, Yuan Xiao, Jiaqi Deng, Dayong Ye, Tianqing Zhu, Huan Huo

机构 * University of Technology Sydney(悉尼科技大学) Geely(吉利) City University of Hong Kong(香港城市大学) City University of Macau(澳门城市大学)

专题命中 扩散模型 :text-to-image(title,abstract);diffusion(title,abstract);image editing(abstract);分类 cs.CV、cs.MM

AI总结 该研究针对现有文本到图像扩散模型提示逆推方法的局限,提出联合恢复语义提示与潜在噪声的Dualin方法,实现了高质量逆推提示与最优图像保真度,为可控图像编辑奠定基础。

Comments Accepted by ACM MM 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.06136 2026-07-08 cs.CV cs.MM 新提交 90%

Tuning-Free Latent Diffusion Models for Ultrahigh-Resolution Image Editing

用于超高分辨率图像编辑的免调优潜在扩散模型

Wanglong Lu, Lingming Su, Kaijie Shi, Minglun Gong, Xiaogang Jin, Hanli Zhao, Xianta Jiang

机构 * College of Computer Science and Artificial Intelligence, Wenzhou University(温州大学计算机科学与人工智能学院) Department of Computer Science, Memorial University of Newfoundland(纽芬兰纪念大学计算机科学系) AI Analytics Team, Nasdaq(纳斯达克人工智能分析团队) State Key Laboratory of CAD&CG, Zhejiang University(浙江大学CAD&CG国家重点实验室)

专题命中 扩散模型 :diffusion(title,abstract);image editing(title,abstract);image generation(abstract);分类 cs.CV、cs.MM

AI总结 针对现有图像编辑方法在高分辨率处理上的局限,提出免调优的UltraDiffEdit框架,通过多尺度渐进编辑、多补丁编码、全局-局部一致性去噪及补丁混合采样等技术,实现高质量超高分辨率图像编辑,处理能力达8K且灵活性高。

Comments 29 pages, 29 figures. Published in IEEE Transactions on Neural Networks and Learning Systems

Journal ref IEEE Transactions on Neural Networks and Learning Systems, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.20053 2025-05-27 cs.CV cs.AI cs.CL cs.MM 90%

Multimodal LLM-Guided Semantic Correction in Text-to-Image Diffusion

Zheqi Lv, Junhao Chen, Qi Tian, Keting Yin, Shengyu Zhang, Fei Wu

机构 * Zhejiang University(浙江大学)

专题命中 扩散模型 :text-to-image(title,abstract);diffusion(title,abstract);image generation(abstract);分类 cs.CV、cs.MM

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.09042 2025-02-11 cs.CV cs.GR cs.LG 90%

CookingDiffusion: Cooking Procedural Image Generation with Stable Diffusion

Yuan Wang, Bin Zhu, Yanbin Hao, Chong-Wah Ngo, Yi Tan, Xiang Wang

专题命中 扩散模型 :image generation(title,abstract);diffusion(title,abstract);text-to-image(abstract);分类 cs.CV、cs.GR

详情

展开后加载摘要…

URL PDF HTML 收藏
2401.13974 2024-01-26 cs.CV cs.AI cs.GR 90%

BootPIG: Bootstrapping Zero-shot Personalized Image Generation Capabilities in Pretrained Diffusion Models

Senthil Purushwalkam, Akash Gokul, Shafiq Joty, Nikhil Naik

专题命中 扩散模型 :image generation(title,abstract);diffusion(title,abstract);text-to-image(abstract);分类 cs.CV、cs.GR

详情

展开后加载摘要…

URL PDF HTML 收藏
2311.05463 2023-11-10 cs.CV cs.MM 90%

ControlStyle: Text-Driven Stylized Image Generation Using Diffusion Priors

Jingwen Chen, Yingwei Pan, Ting Yao, Tao Mei

专题命中 扩散模型 :image generation(title,abstract);diffusion(title,abstract);text-to-image(abstract);分类 cs.CV、cs.MM

Comments ACM Multimedia 2023

详情

展开后加载摘要…

URL PDF HTML 收藏
2204.02849 2022-10-04 cs.CV cs.AI cs.CL cs.GR cs.LG 90%

KNN-Diffusion: Image Generation via Large-Scale Retrieval

Shelly Sheynin, Oron Ashual, Adam Polyak, Uriel Singer, Oran Gafni, Eliya Nachmani, Yaniv Taigman

专题命中 扩散模型 :image generation(title,abstract);diffusion(title,abstract);text-to-image(abstract);分类 cs.CV、cs.GR

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.21032 2025-08-29 cs.CV 90%

Reusing Computation in Text-to-Image Diffusion for Efficient Generation of Image Sets

Dale Decatur, Thibault Groueix, Wang Yifan, Rana Hanocka, Vladimir Kim, Matheus Gadelha

机构 * University of Chicago(芝加哥大学) Adobe Research(Adobe研究)

专题命中 扩散模型 :diffusion(title,abstract);text-to-image(title,abstract);image generation(abstract);分类 cs.CV

Comments ICCV 2025. Project page: https://ddecatur.github.io/hierarchical-diffusion/

详情

展开后加载摘要…

URL PDF HTML 收藏
2302.12764 2023-05-22 cs.CV 90%

Modulating Pretrained Diffusion Models for Multimodal Image Synthesis

Cusuh Ham, James Hays, Jingwan Lu, Krishna Kumar Singh, Zhifei Zhang, Tobias Hinz

专题命中 扩散模型 :diffusion(title,abstract);image synthesis(title,abstract);image generation(abstract);分类 cs.CV

Comments SIGGRAPH Conference Proceedings 2023. Project page at https://mcm-diffusion.github.io

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.12328 2026-08-14 cs.CL 新提交 89%

LoRA-Diffusion: Parameter-Efficient Fine-Tuning via Low-Rank Trajectory Decomposition

LoRA-Diffusion:基于低秩轨迹分解的参数高效微调方法

Iman Khazrak, Narges Nejad, Mohammadhossein Homaei, Mostafa M. Rezaee, Robert C. Green

专题命中 扩散模型 :diffusion(title,title_cn)

AI总结 本文提出 LoRA-Diffusion,将低秩分解应用于扩散式语言模型的去噪轨迹而非权重,引入轨迹级适配器等技术,在 SST-2 等数据集上取得优异性能,为扩散式语言模型提供参数高效微调框架。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.04344 2026-07-21 cs.LG cs.AI 版本更新 89%

UnMaskFork: Test-Time Scaling for Masked Diffusion via Deterministic Action Branching

UnMaskFork:通过确定性动作分支实现Masked Diffusion的测试时扩展

Kou Misaki, Takuya Akiba

专题命中 扩散模型 :diffusion(title,title_cn)

AI总结 UnMaskFork通过确定性动作分支提升Masked Diffusion在测试时的扩展能力,优于现有方法并在复杂任务中表现优异。

Comments Accepted to ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.01170 2026-07-14 cs.IR cs.AI 版本更新 89%

Diffusion-GR2: Diffusion Generative Reasoning Re-ranker

Diffusion-GR2: 扩散生成推理重排序器

Zhuoxuan Zhang, Kangqi Ni, Yuhang Chen, Mingfu Liang, Xiaohan Wei, Yunchen Pu, Fei Tian, Chonglin Sun, Frank Shyu, Adam, Song, Sandeep Pandey, Luke Simon, Tianlong Chen, Xi Liu

机构 * Meta AI UNC Chapel Hill(北卡罗来纳大学教堂山分校)

专题命中 扩散模型 :diffusion(title,title_cn)

AI总结 提出Diffusion-GR2,通过转换微调、在线策略蒸馏和强化学习将自回归推理重排序器转换为块扩散模型,在保持精度的同时将推理吞吐量提升2.4-3.5倍。

Comments Work in progress

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.05722 2026-07-08 cs.CL 新提交 89%

Nemotron-Labs-Diffusion: A Tri-Mode Language Model Unifying Autoregressive, Diffusion, and Self-Speculation Decoding

Nemotron-Labs-Diffusion:一种统一自回归、扩散和自推测解码的三模式语言模型

Yonggan Fu, Lexington Whalen, Abhinav Garg, Chengyue Wu, Maksim Khadkevich, Nicolai Oswald, Enze Xie, Daniel Egert, Sharath Turuvekere Sreenivas, Shizhe Diao, Chenhan Yu, Ye Yu, Weijia Chen, Sajad Norouzi, Jingyu Liu, Shiyi Lan, Ligeng Zhu, Jin Wang, Jindong Jiang, Morteza Mardani, Mehran Maghoumi, Song Han, Ante Jukić, Nima Tajbakhsh, Jan Kautz, Pavlo Molchanov

机构 * Nemotron-Labs(Nemotron实验室)

专题命中 扩散模型 :diffusion(title,title_cn)

AI总结 介绍了统一AR、扩散和自推测解码的三模式语言模型Nemotron-Labs-Diffusion,通过联合目标训练,能切换模式。研究表明其目标互补,自推测模式表现优,有长期潜力,该模型家族在精度和速度上优于现有开源模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.26285 2026-06-26 cs.CR cs.AI 新提交 89%

TEMPO-Diffusion: Temporally Exposed Malicious Poisoning of Diffusion Models

TEMPO-Diffusion:扩散模型的时间暴露恶意投毒

William Aiken, Paula Branco, Guy-Vincent Jourdan, Iosif-Viorel Onut

机构 * School of Electrical Engineering and Computer Science, University of Ottawa(电气与计算机科学学院,渥太华大学)

专题命中 扩散模型 :diffusion(title,title_cn)

AI总结 提出TEMPO-Diffusion框架,通过时间条件触发实现针对特定类别的后门攻击,支持多子图像后门和修复,并引入CALISA数据集验证攻击有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.23053 2026-06-23 cs.LG 版本更新 89%

Double-Diffusion: Balancing Speed, Accuracy, and Uncertainty in Probabilistic Forecasting for Urban Sensor Networks

Double-Diffusion: 城市传感器网络中概率预测的速度、准确性与不确定性的平衡

Hanlin Dong, Arian Prabowo, Hao Xue, Ao Shuang, Tianyi Zhou, Yuxuan Liang, Flora D. Salim

机构 * University of New South Wales(新南威尔士大学) University of Maryland(马里兰大学) The Hong Kong University of Science and Technology (Guangzhou)(香港科学与技术大学(广州))

专题命中 扩散模型 :diffusion(title,title_cn)

AI总结 提出Double-Diffusion方法,结合闭式图热先验与去噪扩散模型,通过短预热链从先验开始去噪,实现快速、准确且具有不确定性的概率预测,在四个真实数据集上取得最佳CRPS。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.19315 2026-06-18 cs.LG 新提交 89%

Diffusion-Proof: Recipe for Formal Theorem Proving Beyond Auto-Regressive Generation

Diffusion-Proof:超越自回归生成的正式定理证明配方

Ruida Wang, Rui Pan, Pengcheng Wang, Shizhe Diao, Tong Zhang

机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) NVIDIA(英伟达)

专题命中 扩散模型 :diffusion(title,title_cn)

AI总结 提出Diffusion-Proof框架,首次将扩散语言模型应用于形式定理证明,通过全证明生成和局部校正方法,在ProofNet和MiniF2F上分别提升1.61%和6.14%,并解决了一个DeepSeek-Prover-V2-7B无法解决的IMO问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.08916 2026-05-21 cs.CE cs.NA math.NA math.PR 89%

Diffusion Restore: Real-Time Markov Chain Monte Carlo Light Transport

Diffusion Restore: 实时马尔可夫链蒙特卡洛光运输

Sascha Holl, Gurprit Singh, Hans-Peter Seidel

专题命中 扩散模型 :diffusion(title,title_cn)

AI总结 本文提出Diffusion Restore,一种基于扩散的实时MCMC光运输框架,通过改进局部探索能力,在保持非可逆性的同时提升对目标分布的探索效率,从而在不同场景中优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.08720 2026-08-11 cs.CV 新提交 89%

High-Quality Exposure Correction with Diffusion-Based Image Generation Priors

基于扩散模型图像生成先验的高质量曝光校正

Ziwen Li, Meng Cao, Jinpu Zhang, Chunyang Li, Long Bao, Heng Sun, Yuehuan Wang

机构 * Huazhong University of Science and Technology(华中科技大学) Mohamed bin Zayed University of Artificial Intelligence(穆罕默德·本·扎耶德人工智能大学) National University of Defense Technology(国防科技大学) Xiaomi Communications Company Ltd.(小米通讯有限公司)

专题命中 扩散模型 :diffusion(title,abstract);image generation(title,abstract);分类 cs.CV

AI总结 本文提出基于扩散先验的曝光校正框架DPEC,通过高效微调策略与联合交叉注意力模块,在多数据集上实现了优于现有方法的曝光校正性能。

Comments Accepted by IEEE Transactions on Multimedia (TMM)

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.24817 2026-08-10 cs.CV eess.IV 版本更新 89%

High-Fidelity Synthetic Transmission Electron Microscopy Image Generation Using Diffusion Probabilistic Models for Data-Limited Semiconductor Metrology

高保真合成透射电子显微镜图像生成:基于扩散概率模型的数据受限半导体计量

Johannes Boehm, Bappaditya Dey

机构 * Chemnitz University of Technology, Chemnitz, Germany(化学工业大学,化学矿泉,德国) Interuniversity Microelectronics Centre (imec), Leuven, Belgium(大学微电子中心(imec),卢汶,比利时)

专题命中 扩散模型 :image generation(title,abstract);diffusion(title,abstract);inpainting(abstract);分类 cs.CV

AI总结 针对半导体计量中TEM数据稀缺问题,提出基于去噪扩散概率模型(DDPM)的合成图像生成框架,采用渐进式补丁训练策略,仅需15个样本即可从零训练,并集成数据增强、域迁移、分类器引导和修复技术,生成图像在结构相似性上达到MS-SSIM>0.98,支持缺陷检测、分割等下游任务。

Comments To be presented at the 2026 International Symposium ELMAR, published by IEEE in the conference proceedings

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.03937 2026-08-05 cs.CV cs.CR 新提交 89%

Progressive Learning of a Diffusion-based Inpainting Model for Separating Overlapped Fingerprints

用于分离重叠指纹的基于扩散模型的修复模型的渐进式学习

Noor Hussein, Anil K. Jain, Karthik Nandakumar

专题命中 扩散模型 :diffusion(title,abstract);inpainting(title,abstract);分类 cs.CV

AI总结 本研究针对重叠指纹分离问题,提出渐进式学习的基于扩散的修复模型,结合指纹先验与多通道条件的感知重叠修复,在公开数据集上实现了高匹配度的组成指纹重建。

Comments Accepted to IJCB 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.25078 2026-07-29 cs.CV 新提交 89%

Diff-ID: Identity Consistent Facial Image Generation and Morphing via Diffusion Models

Diff-ID:通过扩散模型实现身份一致的面部图像生成与变形

Taimoor Rizwan, Sara Atito, Muhammad Awais, Zhenhua Feng, Josef Kittler

机构 * University of Surrey(萨里大学) Jiangnan University(江南大学)

专题命中 扩散模型 :diffusion(title,abstract);image generation(title);image synthesis(abstract);分类 cs.CV

AI总结 研究针对面部图像合成中高分辨率下身份保持难题,提出Diff-ID框架,通过自定义数据集、集成嵌入及新损失函数实现,实验表明其在身份-真实感权衡上表现出色,还展示了基于DDIM的变形管道,强调联合评估身份保持与真实感。

Comments 20 pages, 11 figures, 3 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.22963 2026-07-28 eess.IV cs.CV 新提交 89%

PriSAR: 3D Geometric-Prior-Guided Diffusion for Parameter-Controlled SAR Image Generation

PriSAR:用于参数控制SAR图像生成的3D几何先验引导扩散

Fan Zhang, Xuanting Wu, Fei Ma, Qiang Yin, Yuxin Hu

专题命中 扩散模型 :diffusion(title,abstract);image generation(title,abstract);分类 cs.CV

AI总结 研究SAR图像在稀疏观测角度下的可控生成问题,提出用3D模型导出的几何先验引导扩散模型的方法,即GeoDiff-SAR,经实验在飞机和车辆数据集上取得较好结果,证明该轻量级3D几何先验可改善视点一致性,用作生成指导。

Comments 17 pages,15 images

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.15357 2026-07-28 cs.CV cs.LG 版本更新 89%

MaskAttn-SDXL: Controllable Region-Level Text-To-Image Generation

MaskAttn-SDXL:可控区域级文本到图像生成

Yu Chang, Jiahao Chen, Anzhe Cheng, Paul Bogdan

机构 * University of Southern California(南加州大学) University of Toronto(多伦多大学)

专题命中 扩散模型 :image generation(title,abstract);text-to-image(title,abstract);diffusion(abstract);分类 cs.CV

AI总结 本文提出MaskAttn-SDXL模块,通过在softmax前注入token条件空间门控,解决扩散模型在多物体生成中的全局协调和可靠性问题,无需改变SDXL流程。

Comments Published in the 2026 International Joint Conference on Neural Networks (IJCNN 2026)

Journal ref Proceedings of the 2026 International Joint Conference on Neural Networks (IJCNN 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.03499 2026-07-27 eess.IV cs.CV 版本更新 89%

GeoDiff-SAR: A Geometric Prior Guided Diffusion Model for SAR Image Generation

GeoDiff-SAR:一种基于几何先验的扩散模型用于SAR图像生成

Fan Zhang, Xuanting Wu, Fei Ma, Qiang Yin, Yuxin Hu

机构 * College of Information Science and Technology, Beijing University of Chemical Technology(信息科学与技术学院,北京化工大学) Aerospace Information Research Institute, Chinese Academy of Sciences(航天信息研究所,中国科学院)

专题命中 扩散模型 :diffusion(title,abstract);image generation(title,abstract);分类 cs.CV

AI总结 GeoDiff-SAR通过引入几何先验引导扩散模型,提升SAR图像生成的保真度和分类准确性,尤其在不同方位角识别性能上有显著提升。

Comments 3 pages, 1 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.03180 2026-07-07 cs.CV 新提交 89%

FairFlow: Demystifying and Mitigating Stereotype Bias in Text-to-Image Diffusion Transformers

FairFlow:揭开文本到图像扩散变换器中刻板印象偏差的面纱并减轻其影响

Chen Chen, Yuanmin Huang, Zhenfei Zhang, Mi Zhang, Xiaohan Zhang, Yun Xiong, Xiaoyu You, Min Yang

机构 * Fudan University(复旦大学) East China University of Science and Technology(华东理工大学)

专题命中 扩散模型 :text-to-image(title,abstract);diffusion(title,abstract);image generation(abstract);分类 cs.CV

AI总结 研究文本到图像扩散变换器中刻板印象偏差问题,通过机理分析找到偏差根源,提出FairFlow框架,能有效中和刻板印象偏差,实现公平与保真平衡,且推理开销小、对复杂提示鲁棒。

Comments 15 pages, 11 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.12575 2026-06-30 cs.CV 89%

AccelAes: Accelerating Diffusion Transformers for Training-Free Aesthetic-Enhanced Image Generation

AccelAes: 通过美学感知的时空缩减加速无训练扩散变换器

Xuanhua Yin, Chuanzhi Xu, Haoxian Zhou, Boyu Wei, Weidong Cai

机构 * School of Computer Science, The University of Sydney(悉尼大学计算机科学学院)

专题命中 扩散模型 :image generation(title,abstract);diffusion(title,abstract);text-to-image(abstract);分类 cs.CV

AI总结 本文提出AccelAes框架,通过空间-时间缩减提升扩散变换器的生成效率与美学质量,在Lumina-Next上实现2.11倍加速并提升ImageReward 11.9%。

Comments Accepted by ECCV2026; 34 pages, 19 tables, 12 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.14099 2026-06-04 cs.CV 89%

ViewMask-1-to-3: Multi-View Consistent Image Generation via Multimodal Discrete Diffusion Models

ViewMask-1-to-3: 通过多模态离散扩散模型实现多视图一致图像生成

Ruishu Zhu, Zhihao Huang, Jiacheng Sun, Ping Luo, Hongyuan Zhang, Xuelong Li

机构 * Nanyang Technological University(南洋理工大学)

专题命中 扩散模型 :image generation(title,abstract);diffusion(title,abstract);text-to-image(abstract);分类 cs.CV

AI总结 提出ViewMask-1-to-3,将多视图生成建模为离散序列预测问题,利用MAGVIT-v2视觉令牌和掩码令牌预测的离散扩散,通过迭代去掩码实现渐进式多视图生成,无需专门架构或3D几何先验,在GSO和3D-FUTURE基准上优于基线方法。

Comments Accepted by ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.00133 2026-06-02 cs.CV cs.AI 89%

You Don't Need All That Attention: Surgical Memorization Mitigation in Text-to-Image Diffusion Models

你不需要所有注意力:文本到图像扩散模型中的外科记忆缓解

Kairan Zhao, Eleni Triantafillou, Peter Triantafillou

机构 * University of California, San Diego(加州大学圣地亚哥分校)

专题命中 扩散模型 :text-to-image(title,abstract);diffusion(title,abstract);image generation(abstract);分类 cs.CV

AI总结 提出GUARD框架,通过吸引-排斥动力学调整去噪过程,结合交叉注意力衰减机制,在不损害图像质量的前提下有效缓解文本到图像扩散模型中的记忆问题。

Comments Accepted at ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.26933 2026-05-27 cs.CV 89%

Leveraging Text-to-Image Diffusion Models for Unsupervised Visual Object Tracking

利用文本到图像扩散模型进行无监督视觉目标跟踪

Zhengbo Zhang, Zhigang Tu, Junsong Yuan, De Wen Soh, Bo Du

机构 * Information Systems Technology and Design Pillar, Singapore University of Technology and Design(新加坡科技设计大学信息系统技术与设计学院) State Key Laboratory of Information Engineering in Surveying, Mapping and Remote Sensing, Wuhan University(武汉大学测绘遥感信息工程国家重点实验室) Department of Computer Science and Engineering, University at Buffalo, State University of New York(纽约州立大学布法罗分校计算机科学与工程系) School of Computer Science, Wuhan University(武汉大学计算机学院)

专题命中 扩散模型 :text-to-image(title,abstract);diffusion(title,abstract);image generation(abstract);分类 cs.CV

AI总结 提出Diff-Tracking方法,利用预训练文本到图像扩散模型的跨注意力机制,通过初始提示学习器和在线提示更新器实现无监督目标跟踪。

Comments Accepted by IEEE Transactions on Pattern Analysis and Machine Intelligence (TPAMI), 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.23606 2026-05-27 cs.LG cs.CV 89%

Muddit: Liberating Generation Beyond Text-to-Image with a Unified Discrete Diffusion Model

Muddit: 通过统一离散扩散模型解放超越文本到图像的生成

Qingyu Shi, Jinbin Bai, Zhuoran Zhao, Wenhao Chai, Kaidong Yu, Jianzong Wu, Yunhai Tong, Xiangtai Li, Xuelong Li, Shuicheng Yan

机构 * M-E-AGI-Lab(M-E-AGI实验室)

专题命中 扩散模型 :text-to-image(title,abstract);diffusion(title,abstract);image generation(abstract);分类 cs.CV

AI总结 提出Muddit,一种统一离散扩散Transformer,结合预训练文本到图像骨干的强视觉先验与轻量文本解码器,实现跨文本和图像模态的快速并行生成,在质量和效率上优于大型自回归模型。

Comments Accepted to ICLR 2026. Codes and Supplementary Material: https://github.com/M-E-AGI-Lab/Muddit

详情

展开后加载摘要…

URL PDF HTML 收藏