arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

视觉与机器人

图像生成

图像生成、文生图、图像编辑、扩散模型和可控生成。

2026-03-03 至 2026-03-03 共收录 117 信号源:cs.CV, cs.GR, cs.MM

1. 扩散模型 117 篇

2603.00140 2026-03-03 cs.CV cs.AI cs.LG 88%

Steering Away from Memorization: Reachability-Constrained Reinforcement Learning for Text-to-Image Diffusion

远离记忆化:用于文本到图像扩散的可达性约束强化学习

Sathwik Karnik, Juyeop Kim, Sanmi Koyejo, Jong-Seok Lee, Somil Bansal

机构 * Stanford University, Stanford, CA, USA(斯坦福大学) Yonsei University, Seoul, Korea(延世大学)

专题命中 扩散模型 :text-to-image(title,abstract);diffusion(title,abstract);分类 cs.CV

AI总结 RADS通过约束强化学习方法,在保持生成质量的同时减少文本到图像扩散模型的记忆化问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.00992 2026-03-03 cs.LG 86%

Compensation-free Machine Unlearning in Text-to-Image Diffusion Models by Eliminating the Mutual Information

通过消除互信息实现无补偿的文本到图像扩散模型机器反学习

Xinwen Cheng, Jingyuan Zhang, Zhehao Huang, Yingwen Wu, Xiaolin Huang

机构 * Institute of Image Processing and Pattern Recognition(图像处理与模式识别研究所) School of Automation and Intelligent Sensing(自动化与智能感知学院)

专题命中 扩散模型 :diffusion(title,abstract);text-to-image(title)

AI总结 本文提出无补偿的概念擦除方法MiM-MU,通过最小化互信息精准消除不需要的知识,从而在保持其他生成质量的同时无需事后补偿。

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.06547 2026-03-03 cs.CV cs.LG 85%

Concept-TRAK: Understanding how diffusion models learn concepts through concept-level attribution

Concept-TRAK: 通过概念层面的归因理解扩散模型如何学习概念

Yonghyun Park, Chieh-Hsin Lai, Satoshi Hayakawa, Yuhta Takida, Naoki Murata, Wei-Hsiang Liao, Woosung Choi, Kin Wai Cheuk, Junghyun Koo, Yuki Mitsufuji

机构 * University of Pennsylvania(宾夕法尼亚大学) SONY AI(索尼人工智能) Sony Group Corporation(索尼集团)

专题命中 扩散模型 :diffusion(title,abstract);image generation(abstract);text-to-image(abstract);分类 cs.CV

AI总结 Concept-TRAK通过概念层面归因方法,提升扩散模型对特定概念的解释能力,适用于图像生成中的版权与透明性问题。

Comments This paper has been accepted at ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.01068 2026-03-03 cs.CV cs.LG 85%

LLaDA-o: An Effective and Length-Adaptive Omni Diffusion Model

LLaDA-o:一种高效且长度自适应的多模态扩散模型

Zebin You, Xiaolu Zhang, Jun Zhou, Chongxuan Li, Ji-Rong Wen

机构 * Gaoling School of Artificial Intelligence, Renmin University of China, Beijing, China.(中国人民大学人工智能学院) Beijing Key Laboratory of Research on Large Models(北京大型模型研究关键实验室) Engineering Research Center of Next-Generation Intelligent Search(下一代智能搜索工程研究中心)

专题命中 扩散模型 :diffusion(title,abstract);image generation(abstract);text-to-image(abstract);分类 cs.CV

AI总结 LLaDA-o通过混合扩散框架和数据驱动的长度适应策略,实现了高效且灵活的多模态扩散建模,展示了在文本到图像生成任务中的卓越性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.01552 2026-03-03 cs.CV 83%

Align-cDAE: Alzheimer's Disease Progression Modeling with Attention-Aligned Conditional Diffusion Auto-Encoder

Align-cDAE: 利用注意力对齐的条件扩散自编码器进行阿尔茨海默病进展建模

Ayantika Das, Keerthi Ram, Mohanasankar Sivaprakasam

机构 * Department of Electrical Engineering, Indian Institute of Technology Madras, Chennai, India(电子工程系,印度理工学院马德拉斯,钦奈,印度) Sudha Gopalakrishnan Brain Centre, Indian Institute of Technology Madras, Chennai, India(苏达·戈帕拉克里希南脑中心,印度理工学院马德拉斯,钦奈,印度) Department of Electrical Engineering, Indian Institute of Technology Madras Chennai, India(电子工程系,印度理工学院马德拉斯钦奈,印度)

专题命中 扩散模型 :diffusion(title,abstract);image generation(abstract);分类 cs.CV

AI总结 Align-cDAE通过引入注意力对齐和结构化潜在空间,提升扩散自编码器在阿尔茨海默病进展建模中的精度和可控性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.04663 2026-03-03 cs.CV cs.AI 83%

HierarchicalPrune: Position-Aware Compression for Large-Scale Diffusion Models

分层剪枝:面向大规模扩散模型的位置感知压缩

Young D. Kwon, Rui Li, Sijia Li, Da Li, Sourav Bhattacharya, Stylianos I. Venieris

专题命中 扩散模型 :diffusion(title,abstract);text-to-image(abstract);分类 cs.CV

AI总结 HierarchicalPrune通过分层位置剪枝、位置权重保护和敏感度引导的知识蒸馏,实现大规模扩散模型的高效压缩,减少内存占用和延迟,同时保持图像质量。

Comments Accepted at AAAI 2026 (Main Technical Track)

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.07392 2026-03-03 cs.CV 83%

SPEED: Scalable, Precise, and Efficient Concept Erasure for Diffusion Models

SPEED:可扩展、精确和高效的扩散模型概念擦除

Ouxiang Li, Yuan Wang, Xinting Hu, Houcheng Jiang, Yanbin Hao, Fuli Feng

机构 * University of Science and Technology of China(中国科学技术大学) Hefei University of Technology(合肥工业大学)

专题命中 扩散模型 :diffusion(title,abstract);text-to-image(abstract);分类 cs.CV

AI总结 SPEED通过直接编辑模型参数,高效精准地擦除扩散模型中的多个概念,同时保护非目标概念的质量。

Comments Accepted to ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.08011 2026-03-03 cs.CV cs.AI cs.LG cs.MM 81%

TP-Blend: Textual-Prompt Attention Pairing for Precise Object-Style Blending in Diffusion Models

TP-Blend:基于文本提示注意力配对的精确物体-风格混合扩散模型

Xin Jin, Yichuan Zhong, Yapeng Tian

机构 * GenPi Inc.(GenPi公司) The University of Texas at Dallas(德克萨斯大学达拉斯分校)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV、cs.MM

AI总结 TP-Blend通过双提示注意力配对实现精确物体-风格混合,提升扩散模型的编辑质量和效率。

Journal ref Transactions on Machine Learning Research, 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.00492 2026-03-03 cs.CV cs.AI cs.GR cs.LG 81%

ArtiFixer: Enhancing and Extending 3D Reconstruction with Auto-Regressive Diffusion Models

ArtiFixer:利用自回归扩散模型增强和扩展3D重建

Riccardo de Lutio, Tobias Fischer, Yen-Yu Chang, Yuxuan Zhang, Jay Zhangjie Wu, Xuanchi Ren, Tianchang Shen, Katarina Tothova, Zan Gojcic, Haithem Turki

机构 * NVIDIA NVIDIA Santa Clara USA(NVIDIA) NVIDIA Zurich Switzerland(NVIDIA) Cornell University(康奈尔大学) University of Toronto(多伦多大学) Vector Institute(向量研究所)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV、cs.GR

AI总结 ArtiFixer通过自回归扩散模型提升3D重建质量,解决现有方法在未观测区域的外推问题。

Comments Video results: https://artifixer2026.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.02035 2026-03-03 cs.RO cs.CV 79%

LAD-Drive: Bridging Language and Trajectory with Action-Aware Diffusion Transformers

LAD-Drive: 通过动作感知扩散变换器弥合语言与轨迹

Fabian Schmidt, Karol Fedurko, Markus Enzweiler, Abhinav Valada

机构 * Institute for Intelligent Systems, Esslingen University of Applied Sciences(智能系统研究所,埃斯林根应用科学大学) Department of Computer Science, University of Freiburg(计算机科学系,弗赖堡大学)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 LAD-Drive通过动作感知扩散变换器,将语言模型的意图与连续轨迹生成结合,提升自动驾驶中的多模态规划能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.02012 2026-03-03 cs.CV cs.AI 79%

MAP-Diff: Multi-Anchor Guided Diffusion for Progressive 3D Whole-Body Low-Dose PET Denoising

MAP-Diff: 多锚点引导的扩散模型用于渐进式三维全身低剂量PET去噪

Peiyuan Jing, Chun-Wun Cheng, Liutao Yang, Zhenxuan Zhang, Thiago V. Lima, Klaus Strobel, Antoine Leimgruber, Angelica Aviles-Rivero, Guang Yang, Javier A. Montoya-Zegarra

机构 * School of Engineering, Zurich University of Applied Sciences, CH Bioengineering Department Imperial-X, Imperial College London, UK DAMTP, University of Cambridge, UK Lucerne University Teaching Research Hospital, CH Lung Institute, Imperial College London, UK Cardiovascular Research Centre, Royal Brompton Hospital, UK School of Biomedical Engineering \& Imaging Sciences, King's College London, UK Yau Mathematical Sciences Center, Tsinghua University, CN

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 MAP-Diff通过多锚点引导的扩散模型实现低剂量PET图像的渐进式去噪,提升PSNR和SSIM,降低NMAE,优于多种基线方法。

Comments 8 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.01926 2026-03-03 cs.IR cs.CV 79%

MealRec: Multi-granularity Sequential Modeling via Hierarchical Diffusion Models for Micro-Video Recommendation

MealRec: 基于分层扩散模型的多粒度序列建模用于微视频推荐

Xinxin Dong, Haokai Ma, Yuze Zheng, Yongfu Zha, Yonghui Yang, Xiaodong Wang

机构 * National University of Defense Technology(国防科技大学) National University of Singapore(新加坡国立大学)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 MealRec通过分层扩散模型实现多粒度序列建模,解决微视频推荐中的偏好无关表示和模态冲突问题,提升推荐效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.01913 2026-03-03 cs.CV 79%

Zero-shot Low-Field MRI Enhancement via Diffusion-Based Adaptive Contrast Transport

零场MRI增强通过扩散基于自适应对比传输

Muyu Liu, Chenhe Du, Xuanyu Tian, Qing Wu, Xiao Wang, Haonan Zhang, Hongjiang Wei, Yuyao Zhang

机构 * School of Information Science and Technology, ShanghaiTech University, Shanghai, China(信息科学与技术学院,上海科技大学) School of Biomedical Engineering, Shanghai Jiao Tong University, Shanghai, China(生物医学工程学院,上海交通大学)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 本文提出DACT框架,通过扩散模型和自适应对比传输技术,在无配对监督的情况下实现低场MRI到高场MRI的高质量图像重建,提升组织对比和结构细节。

Comments 11 pages, 4 figures, conference paper

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.01688 2026-03-03 cs.CV 79%

CoopDiff: A Diffusion-Guided Approach for Cooperation under Corruptions

CoopDiff: 一种基于扩散的协作方法以应对腐蚀

Gong Chen, Chaokun Zhang, Pengcheng Lv

机构 * School of Computer Science and Technology, Tianjin University(天津大学计算机科学与技术学院) School of Cybersecurity, Tianjin University(天津大学网络安全学院) School of Future Technology, Tianjin University(天津大学未来技术学院)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 CoopDiff是一种基于扩散的协作感知方法,通过教师-学生范式和去噪机制有效应对腐蚀,提升了鲁棒性和泛化能力。

Comments Accepted by CVPR26

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.01686 2026-03-03 cs.CV 79%

DiffusionXRay: A Diffusion and GAN-Based Approach for Enhancing Digitally Reconstructed Chest Radiographs

DiffusionXRay: 一种基于扩散和GAN的方法用于增强数字重建的胸部X光影像

Aryan Goyal, Ashish Mittal, Pranav Rao, Manoj Tadepalli, Preetham Putha

机构 * Indian Institute of Technology Bombay, India(印度理工学院班加罗尔学院) Qure.ai, India

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 DiffusionXRay通过结合扩散模型和GAN解决胸部X光影像质量退化问题,提升诊断价值。

Comments Published at MICCAI 2025

Journal ref Data Engineering in Medical Imaging: Third MICCAI Workshop, DEMI 2025, Held in Conjunction with MICCAI 2025, Daejeon, South Korea, September 27, 2025, Proceedings

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.01659 2026-03-03 cs.CV 79%

A Diffusion-Driven Fine-Grained Nodule Synthesis Framework for Enhanced Lung Nodule Detection from Chest Radiographs

一种基于扩散的细粒度结节合成框架,用于增强胸部X光片上结节检测

Aryan Goyal, Shreshtha Singh, Ashish Mittal, Manoj Tadepalli, Piyush Kumar, Preetham Putha

机构 * Indian Institute of Technology, Bombay(印度理工学院,孟买)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 本文提出了一种基于扩散的细粒度结节合成框架,通过低秩适应适配器实现对结节特征的精确控制,提升了胸部X光片上结节检测的性能。

Comments Accepted at MIDL 2026 (Poster). Published on OpenReview on February 14, 2026. Proceedings version pending. OpenReview: https://openreview.net/forum?id=7DL7cu8Ui8

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.01253 2026-03-03 cs.CV 79%

Cross-Modal Guidance for Fast Diffusion-Based Computed Tomography

跨模态引导用于快速扩散基于计算机断层扫描

Timofey Efimov, Singanallur Venkatakrishnan, Maliha Hossain, Haley Duba-Sullivan, Amirkoushyar Ziabari

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 本文提出一种无需重新训练扩散模型的跨模态引导方法,用于提升稀疏视图中子CT的重建质量。

Comments Accepted at the IEEE International Conference on Acoustics, Speech, and Signal Processing (ICASSP) 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.01103 2026-03-03 cs.CV 79%

Data-Efficient Brushstroke Generation with Diffusion Models for Oil Painting

基于扩散模型的数据高效笔触生成用于油画

Dantong Qin, Alessandro Bozzon, Xian Yang, Xun Zhang, Yike Guo, Pan Wang

机构 * Delft University of Technology(代尔夫特理工大学) The University of Manchester(曼彻斯特大学) The Hong Kong University of Science(香港科学大学)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 本文提出StrokeDiff模型,通过平滑正则化技术实现基于扩散模型的数据高效笔触生成,用于油画创作。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.26818 2026-03-03 cs.SD cs.AI cs.MM eess.AS 79%

GACA-DiT: Diffusion-based Dance-to-Music Generation with Genre-Adaptive Rhythm and Context-Aware Alignment

GACA-DiT:基于扩散的舞蹈到音乐生成,具有风格自适应节奏和上下文感知对齐

Jinting Wang, Chenxing Li, Li Liu

机构 * The Hong Kong University of Science and Technology (Guangzhou)(香港科学与技术大学(广州)) Tencent AI Lab(腾讯AI实验室)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.MM

AI总结 GACA-DiT通过风格自适应节奏提取和上下文感知时间对齐模块,实现了舞蹈到音乐生成的节奏一致性和时间对齐,提升了生成音乐与舞蹈动作的同步精度。

Comments 5 pages, 4 figures, submitted to Interspeech2026

Journal ref sumbitted to Interspeech2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.15301 2026-03-03 cs.CV cs.AI 79%

Latent Diffusion Model without Variational Autoencoder

无变分自编码器的潜在扩散模型

Minglei Shi, Haolin Wang, Wenzhao Zheng, Ziyang Yuan, Xiaoshi Wu, Xintao Wang, Pengfei Wan, Jie Zhou, Jiwen Lu

机构 * Department of Automation, Tsinghua University(自动化系,清华大学) Kling Team, Kuaishou Technology(快手科技 Kling 团队)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 SVG提出了一种无需变分自编码器的潜在扩散模型,通过自监督表示提升视觉生成的效率和质量。

Comments Accepted by ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.06027 2026-03-03 cs.CV eess.IV 79%

OSDM-MReg: Multimodal Image Registration based One Step Diffusion Model

OSDM-MReg: 基于一步扩散模型的多模态图像配准

Xiaochen Wei, Weiwei Guo, Wenxian Yu, Feiming Wei, Dongying Li

机构 * Shanghai Key Laboratory of Intelligent Sensing and Recognition(上海智能感知与识别重点实验室) Shanghai Jiao Tong University(上海交通大学) Center of Digital Innovation(数字创新中心)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 OSDM-MReg通过一步扩散模型和多模态融合策略,实现多模态图像配准的高效准确配准。

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.09935 2026-03-03 cs.CV 79%

Precise Parameter Localization for Textual Generation in Diffusion Models

扩散模型中文本生成的精确参数定位

Łukasz Staniszewski, Bartosz Cywiński, Franziska Boenisch, Kamil Deja, Adam Dziedzic

机构 * Warsaw University of Technology(华沙技术大学) CISPA Helmholtz Center for Information Security(信息安全赫尔姆霍茨中心) IDEAS NCBR

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 通过局部化扩散模型中负责文本生成的注意力层,提升文本生成效率和性能,同时防止生成有毒文本。

Comments ICLR 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.00756 2026-03-03 cs.CV cs.AI 79%

Stroke outcome and evolution prediction from CT brain using a spatiotemporal diffusion autoencoder

基于CT脑部扫描的中风结果与演变预测:时空扩散自编码器

Adam Marcus, Paul Bentley, Daniel Rueckert

机构 * Imperial College London(帝国理工学院伦敦分校) Technische Universität München(慕尼黑技术大学)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 本文提出一种基于CT图像的时空扩散自编码器,用于预测中风结果与演变,通过自监督学习生成语义表示并结合纵向数据提升预测性能。

Comments Accepted in The 6th International Workshop on Machine Learning in Clinical Neuroimaging (MLCN 2023)

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.00519 2026-03-03 cs.CV 79%

Jano: Adaptive Diffusion Generation with Early-stage Convergence Awareness

Jano:具有早期阶段收敛意识的自适应扩散生成

Yuyang Chen, Linqian Zeng, Yijin ZHou, Hengjie Li, Jidong Zhai

机构 * Shanghai Jiaotong University(上海交通大学) Shanghai AI Laboratory(上海人工智能实验室) Tsinghua University(清华大学)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 Jano通过自适应区域感知生成方法,提升扩散模型的生成效率,实现2.0至2.4倍的加速,同时保持生成质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.00458 2026-03-03 cs.CV 79%

Improved Adversarial Diffusion Compression for Real-World Video Super-Resolution

改进的对抗扩散压缩用于现实世界视频超分辨率

Bin Chen, Weiqi Li, Shijie Zhao, Xuanyu Zhang, Junlin Li, Li Zhang, Jian Zhang

机构 * School of Electronic and Computer Engineering, Peking University(电子与计算机工程学院,北京大学) ByteDance Inc(字节跳动公司)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 本文提出改进的对抗扩散压缩方法,通过蒸馏和轻量化设计,实现现实世界视频超分辨率的高效模型压缩,显著提升效率并保持视频质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.00382 2026-03-03 cs.CV 79%

DiffSOS: Acoustic Conditional Diffusion Model for Speed-of-Sound Reconstruction in Ultrasound Computed Tomography

DiffSOS:用于超声计算断层成像中声速重建的声学条件扩散模型

Yujia Wu, Shuoqi Chen, Shiru Wang, Yucheng Tang, Petr Bruza, Geoffrey P. Luke

机构 * Thayer School of Engineering, Dartmouth College(达特茅斯学院工程学院) NVIDIA Corp(NVIDIA公司)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 DiffSOS通过条件扩散模型实现超声计算断层成像中声速的高精度重建,结合物理波测量与混合损失函数,提升重建质量和可靠性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.00337 2026-03-03 cs.CV 79%

Diffusion-Based Low-Light Image Enhancement with Color and Luminance Priors

基于扩散模型的低光照图像增强与颜色和亮度先验

Xuanshuo Fu, Lei Kang, Javier Vazquez-Corral

机构 * Computer Vision Center(计算机视觉中心) Universitat Autònoma de Barcelona(巴塞罗那自治大学)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 本文提出基于扩散模型的低光照图像增强方法,通过结构化控制嵌入模块结合物理先验,实现高质量的图像增强。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.06871 2026-03-03 cs.CV 79%

RFDM: Residual Flow Diffusion Model for Efficient Causal Video Editing

RFDM: 基于残差流扩散模型的高效因果视频编辑

Mohammadreza Salehi, Mehdi Noroozi, Luca Morreale, Ruchika Chavhan, Malcolm Chadwick, Alberto Gil Ramos, Abhinav Mehrotra

机构 * Samsung AI Center, Cambridge(三星人工智能中心,剑桥)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 RFDM通过残差流扩散模型实现高效因果视频编辑,超越I2I方法并竞争于全时空视频生成模型。

Comments Accepted at CVPR26

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.23258 2026-03-03 cs.CV 79%

Plug-and-Play Fidelity Optimization for Diffusion Transformer Acceleration via Cumulative Error Minimization

通过累积误差最小化实现扩散变换器加速的即插即用保真优化

Tong Shao, Yusen Fu, Guoying Sun, Jingde Kong, Zhuotao Tian, Jingyong Su

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 通过累积误差最小化实现扩散变换器加速的即插即用保真优化,提升生成保真度并优于现有方法。

Comments 29 pages, ICLR2026 accepted

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.20123 2026-03-03 cs.CV 79%

UltraViCo: Breaking Extrapolation Limits in Video Diffusion Transformers

UltraViCo: 突破视频扩散变换器的 extrapolation 限制

Min Zhao, Hongzhou Zhu, Yingze Wang, Bokai Yan, Jintao Zhang, Guande He, Ling Yang, Chongxuan Li, Jun Zhu

机构 * Dept. of Comp. Sci. & Tech., BNRist Center, THU-Bosch ML Center, Tsinghua University(清华大学计算机科学与技术系,BNRist中心,THU-Bosch机器学习中心,清华大学) ShengShu(盛书) Gaoling School of Artificial Intelligence, Renmin University of China(北京理工大学人工智能学院,中国人民大学) The University of Texas at Austin(德克萨斯大学奥斯汀分校) Princeton University(普林斯顿大学)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 UltraViCo通过抑制超出训练窗口的token注意力,突破视频扩散变换器的extrapolation限制,提升泛化能力和性能。

Comments ICLR2026. Project page: https://thu-ml.github.io/UltraViCo.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏