arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

图像生成

图像生成、文生图、图像编辑、扩散模型和可控生成。

2026-08-03 至 2026-08-03 共收录 53 信号源:cs.CV, cs.GR, cs.MM

1. 扩散模型 53 篇

2605.14270 2026-08-03 cs.CV 版本更新 85%

Diagnosing and Correcting Concept Omission in Multimodal Diffusion Transformers

诊断和纠正多模态扩散Transformer中的概念遗漏

Kanghyun Baek, Jaihyun Lew, Chaehun Shin, Jungbeom Lee, Sungroh Yoon

机构 * Interdisciplinary Program in Artificial Intelligence, Seoul National University, Seoul, South Korea Department of Electrical Computer Engineering, Seoul National University, Seoul, South Korea Department of Computer Science \& Engineering, Korea University, Seoul, South Korea ISRC, Seoul National University, Seoul, South Korea

专题命中 扩散模型 :diffusion(title,abstract);image generation(abstract);text-to-image(abstract);分类 cs.CV

AI总结 本文通过线性探测发现文本嵌入中存在表征目标概念缺失的“遗漏信号”,并提出遗漏信号干预(OSI)方法放大该信号以主动催化缺失概念的生成,在FLUX.1-Dev和SD3.5-Medium上显著缓解了概念遗漏问题。

Comments Accepted to ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.03434 2026-08-03 cs.GR cs.DC cs.LG 版本更新 85%

Paris: A Decentralized Trained Open-Weight Diffusion Model

巴黎:一种去中心化训练的开放权重扩散模型

Zhiying Jiang, Raihan Seraj, Marcos Villagra, Bidhan Roy

机构 * Bagel Labs(Bagel实验室)

专题命中 扩散模型 :diffusion(title,abstract);image generation(abstract);text-to-image(abstract);分类 cs.GR

AI总结 Paris是一种通过去中心化训练实现高质量文本到图像生成的开放权重扩散模型,无需专用GPU集群,使用更少的数据和计算资源。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.29337 2026-08-03 cs.CV cs.AI 新提交 83%

DualDiT: A Conditional Dual-Output Diffusion Transformer for Joint OCT Image and Segmentation Mask Generation

DualDiT:用于联合生成OCT图像与分割掩码的条件双输出扩散Transformer

Fernando García-Torres, Rocío del Amor, Sandra Morales, Álvaro Barroso, Peter Heiduschka, Björn Kemper, Valery Naranjo

机构 * Instituto Universitario de Investigación en Tecnología Centrada en el Ser Humano (HUMAN-tech), Universitat Politècnica de València(瓦伦西亚理工大学以人类为中心技术大学研究所) Artikode Intelligence S.L(Artikode智能公司) Biomedical Technology Center of the Medical Faculty, University of Muenster(明斯特大学医学院生物医学技术中心) Department of Ophthalmology, University of Muenster Medical Centre(明斯特大学医学中心眼科)

专题命中 扩散模型 :diffusion(title,abstract);image synthesis(abstract);分类 cs.CV

AI总结 该研究提出DualDiT模型,联合生成小鼠OCT图像与分割掩码,在生成质量、下游分割性能上优于DDPM、LDM,可用于医学图像数据增强

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.29533 2026-08-03 cs.CV 新提交 79%

OSAGEN: Object-Aware Mask Priors and Multistage Decoupled Diffusion for Industrial Anomaly Generation

OSAGEN:面向工业异常生成的感知对象掩码先验与多阶段解耦扩散

Jinyi Xu, Peng Chen, Yunkang Cao, Chengliang Liu, Xinghui Dong, Chao Huang

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 OSAGEN结合感知对象掩码先验与多阶段解耦扩散,通过QBG、ISC及轻量物质化步骤生成工业异常,在MVTec AD和VisA上实现优异的异常定位性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.29122 2026-08-03 cs.CV 新提交 79%

A Frozen Pixel-Space Diffusion Model Can Guide Itself with Its Own Samples

冻结的像素空间扩散模型可利用自身样本进行自引导

Zixuan Fu, Chong Wang, Lanqing Guo, Kailai Zhou, Jiahao Nie, Bihan Wen

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 本研究提出合成自引导(SSG)策略,通过冻结预训练像素扩散模型主干、附加轻量预测头,利用模型自身样本训练头,以预测差异为自引导方向,大幅提升像素扩散模型生成效果且训练成本极低。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.28936 2026-08-03 cs.CV cs.AI 新提交 79%

DiffAttack: Evasion Attacks Against Face Recognition via Latent Diffusion Models

DiffAttack:基于潜在扩散模型的人脸识别规避攻击

Omid Ahmadieh, Nima Karimian

机构 * University of South Florida(南佛罗里达大学) Bellini College of Artificial Intelligence, Cybersecurity and Computing(贝利尼人工智能、网络安全与计算学院)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 该研究针对人脸识别系统易受对抗攻击的问题,提出DiffAttack框架,利用潜在扩散模型生成对抗人脸,在FFHQ、CelebA-HQ等基准上攻击成功率达84.86%,可迁移性优于现有方法。

Comments Accepted at IEEE International Joint Conference on Biometrics (IJCB) 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.17303 2026-08-03 cs.CV 版本更新 79%

EMAG: Self-Rectifying Diffusion Sampling with Exponential Moving Average Guidance

EMAG: 无训练的自修正扩散采样与指数移动平均引导

Ankit Yadav, Ta Duc Huy, Lingqiao Liu

机构 * Australian Institute for Machine Learning(澳大利亚机器学习研究所) The University of Adelaide(阿德莱德大学)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 EMAG通过无训练机制改进扩散模型的引导技术,生成更困难的负样本以提升生成质量和人类偏好分数。

Comments 63 pages (Accepted at ECCV 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.20255 2026-08-03 cs.CV 版本更新 79%

AniCrafter: Customizing Realistic Human-Centric Animation via Avatar-Background Conditioning in Video Diffusion Models

AniCrafter:基于视频扩散模型中化身-背景条件的逼真以人为中心动画定制

Muyao Niu, Mingdeng Cao, Yifan Zhan, Qingtian Zhu, Weihang Ran, Yanhong Zeng, Xiao Sun, Zhihang Zhong, Yinqiang Zheng

机构 * The University of Tokyo(东京大学) Shanghai Artificial Intelligence Laboratory(上海人工智能实验室)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 本研究提出AniCrafter模型,通过在视频扩散模型中引入化身-背景条件机制,解决现有角色动画方法在开放域场景中效果受限的问题,其性能优于现有最先进方法,可生成通用且可感知遮挡的动画结果。

Comments Homepage: https://myniuuu.github.io/AniCrafter ; Codes: https://github.com/MyNiuuu/AniCrafter

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.29398 2026-08-03 cs.LG 新提交 79%

OnlineCache: Learning Dynamic Caching Policies with Error Correction for Efficient Diffusion Inference

OnlineCache:用于高效扩散推理的带误差校正的动态缓存策略学习

Zhikang Xie, Xichen Ye, Yifan Wu, Haoshen Yu, Li chenan, Peizhu Gong, Weizhong Zhang, Cheng Jin

机构 * College of Computer Science and Artificial Intelligence, Fudan University(复旦大学计算机科学与人工智能学院) School of Data Science, Fudan University(复旦大学数据科学学院)

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 本研究针对扩散模型推理延迟高的问题,提出动态缓存框架OnlineCache,结合策略梯度与可学习校正器,实现样本与时间步的自适应资源分配,在FLUX.1-dev等模型上实现加速且优于现有基线。

Comments Dynamic timestep-level cache method for diffusion acceleration via policy gradient

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.29148 2026-08-03 eess.AS 新提交 78%

Exploring Efficient Waveform Diffusion Models for Foley Sound Generation

探索用于拟音音效生成的高效波形扩散模型

Runwu Shi, Chang Li, Jiahui Li, Jiang Wang, Yaozhong Kang, Nabeela Khan, Linghan Fang, Benjamin Yen, Takeshi Ashizawa, Kazuhiro Nakadai

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 该研究针对现有波形扩散模型效率低的问题,提出双路径(DP)架构及DP-DiT、DP-U-Net两个变体,经DCASE和FSD-Kaggle2018数据集实验,3M参数变体性能可媲美50M参数模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.29177 2026-08-03 cs.LG cs.AI 新提交 78%

MBDiff: Multi-view Behavior-aware Diffusion Model for Probabilistic Utility Data Imputation

MBDiff:用于概率效用数据插补的多视图行为感知扩散模型

Rongchao Xu, Lin Jiang, Dahai Yu, Ximiao Li, Guang Wang

机构 * Florida State University(佛罗里达州立大学)

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 针对效用数据缺失问题,提出多视图行为感知扩散模型MBDiff,通过多视图用户行为提取模块和行为感知条件扩散模型,在佛罗里达州市政数据集上优于现有基线模型,提升了用电和用水块缺失插补性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.29079 2026-08-03 cs.CL 新提交 78%

Faster but Different: Diagnosing and Controlling Content Drift in Accelerated Multimodal Diffusion Language Models

更快但不同:加速多模态扩散语言模型中的内容漂移诊断与控制

Yaoxuan Dou, Yang Shu

机构 * School of Mathematics and Statistics, Beijing Institute of Technology(北京理工大学数学与统计学院) Zhejiang University(浙江大学)

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 该研究针对加速多模态扩散语言模型的内容漂移问题,通过实验诊断出漂移源于过期状态,提出缩短KV缓存刷新区间的控制方法,在1.3倍加速时实现近乎完全一致,且未发现事实错误差异。

Comments 9 pages, 4 figures, 6 tables. Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.28945 2026-08-03 cs.LG 新提交 78%

FairDiffuseVQVAE: Sampling-Time Fairness in Tabular Diffusion via Conditional Refinement of Vector-Quantized Latents

FairDiffuseVQVAE:基于向量量化隐变量条件优化的表格扩散模型采样时刻公平性

Nitish Nagesh, Mahdi Bagheri, Amir M. Rahmani

机构 * University of California, Irvine(加州大学欧文分校)

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 FairDiffuseVQVAE是将保真度与公平性解耦的两阶段表格扩散模型,在多个数据集上实现了显著的公平性提升,同时保持了优异的样本质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.29593 2026-08-03 cs.LG math.OC 新提交 78%

Convergence and Regret of the Policy Gradient for Multi-Armed Bandits in Diffusion Environment

扩散环境中多臂老虎机的策略梯度算法:收敛性与悔憾分析

Yanwei Jia, Du Ouyang

机构 * The Chinese University of Hong Kong(香港中文大学) Tsinghua University(清华大学)

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 本文针对扩散环境中多臂老虎机的策略梯度算法,证明其收敛性并推导O(log T)阶悔憾上界,改进了现有分析且可推广至离散时间算法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.29164 2026-08-03 math.AP 新提交 78%

On finite-dimensional attractor to nonsmooth reaction-diffusion equations

关于非光滑反应扩散方程的有限维吸引子

Dalibor Pražák, Buddhika Priyasad, Michael Zelina

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 针对含极大单调关系非光滑低阶项的反应扩散方程,研究证明其全局吸引子具有有限分形维数,并给出基于数据的显式上界估计。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.29639 2026-08-03 cond-mat.soft 新提交 78%

Structure, Diffusion, and Relaxation in a Charge-Neutral ProTalpha-Histone H1 Condensate

电荷中性ProTα-组蛋白H1凝聚物中的结构、扩散与弛豫

Aniket Bhattacharya

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 该研究通过粗粒度模型模拟,探究近电荷中性ProTα-组蛋白H1凝聚物的结构、扩散与弛豫特性,明确其链构象对压力不敏感、扩散系数随压力降低等规律,揭示瞬时静电接触的调控机制。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.23909 2026-08-03 cs.LG cs.RO 版本更新 78%

WorldDiT: A Unified Diffusion Architecture for World and Action Modeling

WorldDiT:用于世界和动作建模的统一扩散架构

Sen Wang, R. Gnana Praveen, Bidhan Roy, Marcos Villagra

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 研究提出WorldDiT统一扩散架构,结合动作生成与视觉世界建模,不依赖大型预训练VLM动作主干,在四个LIBERO模拟套件中表现出色,处于帕累托前沿,为未来扩展研究提供了低于十亿参数的基线。

Comments 9 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.04215 2026-08-03 cs.LG cs.AI 版本更新 78%

Predict-then-Diffuse: Adaptive Response Length for Compute-Budgeted Inference in Diffusion LLMs

预测后扩散:面向扩散大语言模型的自适应响应长度计算

Michael Rottoli, Subhankar Roy, Stefano Paraboschi

机构 * IEEE

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 本文提出Predict-then-Diffuse框架,通过自适应响应长度预测器和安全机制,实现计算预算下的高效推理,减少计算成本并保持输出质量。

Comments Accepted for publication in IJCNN 2026 (International Joint Conference on Neural Networks)

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.02685 2026-08-03 cs.LG 版本更新 78%

Expert-Data Alignment Governs Generation Quality in Decentralized Diffusion Models

专家-数据对齐决定去中心化扩散模型的生成质量

Marcos Villagra, Bidhan Roy, Raihan Seraj, Zhiying Jiang

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 专家-数据对齐决定去中心化扩散模型生成质量,而非数值稳定性。

Comments 15 pages, 4 figures. DeLTa@ICLR2026 and Sci4DL@ICLR2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.07339 2026-08-03 cs.AI cs.LG cs.RO 版本更新 78%

RAPiD: Reward-Guided Consistency Distillation of Diffusion Planners for Real-Time Autonomous Driving

RAPiD: 通过扩散行为先验实现安全高效的实时确定性轨迹规划

Ruturaj Reddy, Hrishav Bakul Barua, Junn Yong Loo, Thanh Thi Nguyen, Ganesh Krishnasamy

机构 * School of Information Technology, Monash University, Malaysia(墨尔本大学信息科技学院) Faculty of Information Technology, Monash University, Australia(墨尔本大学信息技术学院) TCS Research, India(印度TCS研究)

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 RAPiD通过扩散行为先验实现高效安全的实时轨迹规划,优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.08022 2026-08-03 stat.ML cs.LG cs.NA math.NA math.PR math.ST stat.TH 版本更新 78%

Provable Diffusion Posterior Sampling for Bayesian Inversion

可证明的扩散后验采样用于贝叶斯反问题

Jinyuan Chang, Chenguang Duan, Yuling Jiao, Ruoxuan Li, Jerry Zhijian Yang, Cheng Yuan

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 本文提出了一种基于扩散的可证明后验采样方法,通过数据学习分数以捕捉先验分布结构,并提供非渐近误差界以确保复杂多模态后验分布的收敛性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.17136 2026-08-03 cs.LG 版本更新 78%

In-situ Autoguidance: Eliciting Self-Correction in Diffusion Models

原位自引导:激发扩散模型的自校正能力

Enhao Gu, Haolin Hou

机构 * Xinjiang University, Urumqi, Xinjiang, China(新疆大学) Ocean University of China, Qingdao, Shandong, China(中国海洋大学)

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 该研究提出原位自引导方法,无需辅助模型,通过随机前向传播动态生成次优预测,实现零成本的扩散模型自校正引导,为高性价比引导建立了新基准。

Comments ICML 2025 Workshop Accepted

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.24395 2026-08-03 eess.AS cs.SD 版本更新 78%

Unsupervised Single-Channel Speech Separation with Diffusion under Speaker-Embedding Guidance

基于说话人嵌入引导的无监督单通道语音分离扩散模型

Runwu Shi, Kai Li, Yiyan Wang, Jiang Wang, Chang Li, Ragib Amin Nihal, Sihan Tan, Kazuhiro Nakadai

机构 * Institute of Science Tokyo(东京科学研究所) Tsinghua University(清华大学) University of Science and Technology of China(中国科学技术大学)

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 该研究针对无监督单通道语音分离问题,提出说话人嵌入引导与分离导向求解器,提升了基于源模型的无监督语音分离性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.29180 2026-08-03 cs.CV cs.AI 新提交 70%

MoRAE: Flow-Friendly Self-Supervised Latents for Text-to-Motion Generation

MoRAE:面向文本到动作生成的流友好型自监督隐变量

Yifei Zhu, Mingyi Shi, Yangyang Cai, Miao Cheng, Yoshifumi Kitamura, Taku Komura

专题命中 扩散模型 :image generation(abstract);diffusion(abstract);分类 cs.CV

AI总结 MoRAE针对文本到动作生成中直接采用图像生成RAE范式的失败,解决了动作空间的两个特有瓶颈,使Flow-Matching DiT实现了最先进的文本到动作生成性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.26924 2026-08-03 cs.LG cs.RO 版本更新 67%

Temporally Centered SIGReg Improves Multi-Task LeWorldModel Learning: From Analysis to Method

时间中心SIGReg改进多任务LeWorldModel学习:从分析到方法

Chang Liu, Fei Suo, Yanzhou Jin, Yusuke Iwasawa, Yutaka Matsuo, Yaonan Zhu

机构 * Graduate School of Engineering, The University of Tokyo(东京大学工程学院)

专题命中 扩散模型 :diffusion(abstract,abstract_cn)

AI总结 该研究针对SIGReg在多任务LeWM中导致表示混叠的问题,提出将其应用于时间中心残差的改进方法,在LIBERO基准上显著提升了多任务世界模型的下游性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.19537 2026-08-03 cs.CV cs.AI cs.LG cs.MM cs.SD eess.AS 版本更新 62%

Deepfake Media Generation and Detection in the Generative AI Era: A Survey and Outlook

生成式AI时代的深度伪造媒体生成与检测:综述与展望

Florinel-Alin Croitoru, Andrei-Iulian Hiji, Vlad Hondru, Nicolae Catalin Ristea, Paul Irofti, Marius Popescu, Cristian Rusu, Radu Tudor Ionescu, Fahad Shahbaz Khan, Mubarak Shah

机构 * Department of Computer Science, University of Bucharest(布加勒斯特大学计算机科学系) Mohamed bin Zayed University of Artificial Intelligence (MBZUAI)(穆罕默德·本·扎耶德人工智能大学) Department of Computer Science, University of Central Florida(中佛罗里达大学计算机科学系)

专题命中 扩散模型 :diffusion(abstract);分类 cs.CV、cs.MM

AI总结 综述了深度伪造生成与检测技术,涵盖图像、视频、音频和多模态内容,构建了分类体系,并提出了新的多模态基准测试,发现现有检测器对未见生成器的深度伪造泛化能力不足。

Comments Accepted in ACM Computing Surveys

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.29545 2026-08-03 cs.CV 新提交 57%

MoRoute: Dynamic Routing for In-Context Multimodal Video Generation

MoRoute:面向上下文多模态视频生成的动态路由

Chong Gao, Jie Ma, Zhan Peng, Chongxiao Wang, Haoxue Wu, Jun Liang, Guanbin Li, Jing Li

机构 * Sun Yat-sen University(中山大学) HUJING Digital Media & Entertainment Group(沪景数字媒体娱乐集团) Huazhong University of Science and Technology(华中科技大学)

专题命中 扩散模型 :diffusion(abstract);分类 cs.CV

AI总结 MoRoute是采用动态层路由连接VLM与视频DiT的多模态视频生成框架,在三个基准数据集上均优于现有最优方法,提升了视频生成与编辑的性能。

Comments Project page: https://orange-3dv-team.github.io/MoRoute/

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.28760 2026-08-03 cs.CV cs.AI cs.LG stat.ML 新提交 57%

WaiT for the Signal: Simple Frequency-Aware Flow-Matching

面向信号的WaiT:简单的频率感知流匹配

Krunoslav Lehman Pavasovic, Théophane Vallaeys, Stéphane Mallat, Giulio Biroli, Luke Zettlemoyer, Brian Karrer, Jakob Verbeek

机构 * FAIR, Meta(FAIR(Meta旗下研究机构)) École Normale Supérieure(巴黎高等师范学院) Sorbonne University(索邦大学)

专题命中 扩散模型 :image generation(abstract);分类 cs.CV

AI总结 该研究提出频率感知流匹配模型WaiT,通过无损小波分解生成过程,引入三轴评估协议,在ImageNet等数据集上实现SOTA生成性能,采样计算量降低50%,还可无缝扩展至视频生成。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.28737 2026-08-03 cs.LG cs.CV cs.RO 新提交 57%

Mirror Learning

镜像学习

Yunpeng Liu, Matthew Niedoba, Oluwanifemi A. Adekanye, Jason Yoo, Yingchen He, Berend Zwartsenberg, Frank Wood

机构 * University of British Columbia(不列颠哥伦比亚大学) Inverted AI Amii

专题命中 扩散模型 :diffusion(abstract);分类 cs.CV

AI总结 该研究提出镜像学习框架,通过视频扩散模型的视角变换与逆动力学模型合成镜像数据,用其增强行为克隆训练可提升策略性能,为数据收集提供替代方案。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.21529 2026-08-03 cs.CV cs.AI 版本更新 57%

ElasticTTT: Prior-Preserving Test-Time Tuning for Video Editing

ElasticTTT:用于视频编辑的保留先验的测试时调优

Yueyi Liu, Chi Zhang, Sen Cui, Miao Liu

机构 * College of AI, Tsinghua University(清华大学人工智能学院) Beijing Academy of Artificial Intelligence(北京人工智能研究院)

专题命中 扩散模型 :diffusion(abstract);分类 cs.CV

AI总结 研究针对预训练扩散模型的测试时调优中存在的问题,提出ElasticTTT框架,通过目标分布正则化、对比条件采样和异步噪声调度等方法,成功保留基础模型生成先验,在一次性视频编辑中达领先性能。

详情

展开后加载摘要…

URL PDF HTML 收藏