arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

图像生成

图像生成、文生图、图像编辑、扩散模型和可控生成。

2026-08-05 至 2026-08-05 共收录 96 信号源:cs.CV, cs.GR, cs.MM

1. 文生图 1 篇

2608.03357 2026-08-05 cs.CV 新提交 79%

Can Text-to-Image Models Draw from the Right Frame of Reference?

文本到图像模型能否从正确的参考框架中生成图像?

Zheyuan Gu, Ruihang Li, Yong Huang, Yiqian Zhang, XIangzhao Hao, Jiaxin Niu, Jiahao Hu, Zhenyu Zhang

专题命中 文生图 :text-to-image(title,abstract);分类 cs.CV

AI总结 该研究引入FoR-T2I基准,发现现有22个T2I模型在参考框架提示下的布局理解准确率远低于相机视图提示,还提出VLM门控重写方法提升了参考框架下的生成准确率。

Comments 9 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 图像编辑 4 篇

2608.03974 2026-08-05 cs.CV 新提交 79%

JoyAI-Video-Edit: Real-Time Open-Ended Video Editing with Autoregressive Diffusion

JoyAI-Video-Edit:基于自回归扩散的实时开放式视频编辑

Yicheng Xiao, Wenxun Dai, Xinran Qin, Lin Song, Maoquan Zhang, Hang Xu, Yukang Chen, Yitong Li, Guohui Zhang, Yuan Zhang, Xuying Zhang, Tommy Zhang, Jianlong Yuan, Peihao Li, Shuai Lu, Siming Fu, Chuyang Zhao, Xin Han, Jie Huang, Wenbo Li, Guoqing Ma, Wei Huang, Xiaojuan Qi, Haoyang Huang, Nan Duan

专题命中 图像编辑 :diffusion(title,abstract);分类 cs.CV

AI总结 研究针对实时视频编辑的低延迟、时序一致等需求,提出160亿参数的JoyAI-Video-Edit自回归扩散框架,结合多种蒸馏技术,在单张Nvidia B200 GPU上实现约30 FPS的720p视频编辑,性能优于现有流式编辑器且与离线系统相当。

Comments Code: https://github.com/jd-opensource/JoyAI-Video-Edit

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.03059 2026-08-05 cs.CV 新提交 79%

RIDGE: Re-Noising with Internal Dynamic Guidance for Image Editing

RIDGE:用于图像编辑的基于内部动态引导的重加噪方法

Ruiliang Gong, Zhen Wang, Yanghao Wang, Long Chen

专题命中 图像编辑 :image editing(title,abstract);分类 cs.CV

AI总结 该研究针对无反转图像编辑中等位移构造的缺陷,提出RIDGE方法,通过重加噪与内部动态引导优化编辑,在多基准实验中实现了源保留、目标对齐与感知质量的良好权衡。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.12341 2026-08-05 cs.CV 版本更新 70%

Bridging the Micro--Macro Gap: Frequency-Aware Semantic Alignment for Image Manipulation Localization

弥合微-宏观差距:面向图像操纵本地化的频率感知语义对齐

Xiaojie Liang, Zhimin Chen, Ziqi Sheng, Wei Lu

机构 * School of Computer Science Engineering, Sun Yat-sen University Guangzhou China Engineering, Sun Yat-sen University

专题命中 图像编辑 :diffusion(abstract);image editing(abstract);分类 cs.CV

AI总结 本文提出FASA框架,通过自适应双频带DCT模块提取操纵敏感频率特征,结合冻结CLIP表示的补丁级对比对齐学习语义先验,实现传统和扩散生成操纵的精准本地化。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.02841 2026-08-05 cs.CV 新提交 57%

Localize, Don't Beautify: Client-Side Control of Image-Editing APIs for Cosmetic Surgery Previews

聚焦定位,而非美化:面向整容预览的图像编辑API的客户端控制

Sukhrobbek Ilyosbekov

专题命中 图像编辑 :inpainting(abstract);分类 cs.CV

AI总结 本文针对公开图像编辑API无法提供模型内部信息的问题,提出客户端通过掩码合成可实现整容预览的区域定位,在保证身份保留的同时提升编辑区域的准确性,且效果优于仅用提示词的方式。

Comments 9 pages, 7 figures, 2 tables. Pilot study; no surgeon ratings. Code and paper source: https://github.com/suxrobGM/localize-dont-beautify

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 扩散模型 76 篇

2608.03937 2026-08-05 cs.CV cs.CR 新提交 89%

Progressive Learning of a Diffusion-based Inpainting Model for Separating Overlapped Fingerprints

用于分离重叠指纹的基于扩散模型的修复模型的渐进式学习

Noor Hussein, Anil K. Jain, Karthik Nandakumar

专题命中 扩散模型 :diffusion(title,abstract);inpainting(title,abstract);分类 cs.CV

AI总结 本研究针对重叠指纹分离问题,提出渐进式学习的基于扩散的修复模型,结合指纹先验与多通道条件的感知重叠修复,在公开数据集上实现了高匹配度的组成指纹重建。

Comments Accepted to IJCB 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.03284 2026-08-05 cs.CV cs.AI 新提交 89%

Test-Time Scaling for Safe Text-Guided Image Generation via Intermediate Clean Estimates

通过中间干净图像估计实现安全文本引导图像生成的测试时缩放

Jinya Sakurai, Shueicheng Yan, Xun Xu

专题命中 扩散模型 :diffusion(summary_cn,abstract);image generation(title);text-to-image(abstract);分类 cs.CV

AI总结 该研究针对文本到图像扩散模型的安全问题,提出利用中间干净图像估计和稀疏边际目标的测试时缩放方法,在 Stable Diffusion 上实现了更优的安全性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.03990 2026-08-05 cs.LG 新提交 88%

Assessment of Conditional Diffusion Model for Synthetic Histopathology Image Generation

用于合成组织病理学图像生成的条件扩散模型评估

Seyed Kahaki, Shijie Li, Weijie Chen, Nicholas Petrick

专题命中 扩散模型 :image generation(title,abstract);diffusion(title,abstract)

AI总结 本研究针对合成组织病理学图像生成的评估问题,提出基于数字病理学预训练基础模型改进的FID、IS及精确率-召回率指标,实验发现改进后的IS与下游细胞核分割性能相关性更高,且生成数据多样性对分割性能的提升作用强于单张图像视觉保真度。

Comments 11 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.14429 2026-08-05 cs.LG cs.AI cs.CV 版本更新 83%

CollaFuse: Collaborative Diffusion Models

CollaFuse:协同扩散模型

Simeon Allmendinger, Domenique Zipperling, Lukas Struppek, Niklas Kühl

机构 * University of Bayreuth(巴耶鲁斯大学) Fraunhofer FIT(弗劳恩霍夫 FIT) FIM Research Center for Information Management(信息管理研究所以) Technical University of Darmstadt(达姆施塔特技术大学) German Research Center for Artificial Intelligence (DFKI)(德国人工智能研究中心(DFKI))

专题命中 扩散模型 :diffusion(title,abstract);image synthesis(abstract);分类 cs.CV

AI总结 本文提出CollaFuse协同扩散模型,通过本地保留数据和轻量计算,将高计算任务转移至服务器,降低客户端负担,提升性能并减少数据泄露风险。

Comments Accepted at the Journal of Artificial Intelligence Research (JAIR)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.00064 2026-08-05 cs.CV 版本更新 81%

Noise-Robust Conditional Flow Matching: Generating Clean Samples from Noisy Datasets

噪声鲁棒条件流匹配:从噪声数据集生成干净样本

Adrian Urbański, Gabriel della Maggiora, Artur Yakimovich

机构 * Center for Advanced Systems Understanding (CASUS)(高级系统理解中心) Helmholtz-Zentrum Dresden-Rossendorf e. V. (HZDR)(德累斯顿-罗森多夫亥姆霍兹中心) Institute of Computer Science, University of Wrocław(弗罗茨瓦夫大学计算机科学学院) School of Computation, Information and Technology, Technical University of Munich(慕尼黑工业大学计算、信息与技术学院) Cluster of Excellence Physics of Life(生命物理学卓越集群)

专题命中 扩散模型 :diffusion(summary_cn,abstract);分类 cs.CV

AI总结 该研究针对科学成像中噪声数据难以获取干净参考的问题,提出NR-CFM模型,可从单张带噪图像学习生成干净样本,在多数场景优于NR-GAN,高噪声下与Ambient Diffusion相当,低信噪比科学数据上表现良好。

Comments 10 pages, 3 Figures, and an Appendix

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.23586 2026-08-05 cs.CV cs.CL cs.MM cs.SD eess.AS 版本更新 81%

Talker-T2AV: Joint Talking Audio-Video Generation with Autoregressive Diffusion Modeling

Talker-T2AV:基于自回归扩散模型的联合说话音频视频生成

Zhen Ye, Xu Tan, Aoxiong Yin, Hongzhan Lin, Guangyan Zhang, Peiwen Sun, Yiming Li, Chi-Min Chan, Wei Ye, Shikun Zhang, Wei Xue

机构 * Hong Kong University of Science and Technology(香港科学与技术大学) Zhejiang University(浙江大学) National University of Singapore(新加坡国立大学) The Chinese University of Hong Kong(香港中文大学) Peking University(北京大学) Independent Researcher(独立研究者)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV、cs.MM

AI总结 本文提出Talker-T2AV,通过共享骨干和模态特定解码器实现音频视频联合生成,提升跨模态一致性与生成效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.03938 2026-08-05 cs.RO cs.SY eess.SY 新提交 80%

Bimanual Manipulation Within an 8 GB Budget: Zero-Copy Sensing and Quantized ACT on an Entry-Level Jetson

8 GB预算内的双臂操作:入门级Jetson上的零拷贝感知与量化ACT

Ekansh Singh, Eva Samuel, Alessandra Reneau, Ryan Schmeelk, Yashvi Gandhi

专题命中 扩散模型 :diffusion(summary_cn,abstract)

AI总结 该研究在8 GB入门级Jetson上实现了双臂操作,采用零拷贝感知、量化ACT,发现ACT在相同演示下优于Diffusion Policy,INT8量化可大幅降低延迟且保留任务成功率。

Comments 9 pages, 8 tables. Work conducted at the Georgia Tech Research Institute (GTRI), Aerospace, Transportation and Advanced Systems Laboratory (ATAS)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.03540 2026-08-05 cs.CV 新提交 79%

S$^3$-Diff: Structural Semantic Synergy Diffusion Model for High Fidelity Super Resolution of Pathological Images

S³-Diff:用于病理图像高保真超分辨率的结构语义协同扩散模型

Jiaming Liang, QiHui Han, Guangye Ou, Jiawen Liu, Haolin Chen, Xi Zhong, Jiazhou Chen, Xiaoqi Sheng, Hongmin Cai

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 针对现有病理图像超分辨率技术易致形态平滑、语义漂移的问题,提出S³-Diff模型,通过SSA与SSFT实现高保真超分,性能优于现有最优方法,源代码将公开。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.03539 2026-08-05 cs.CV 新提交 79%

IRIS: Visual-Semantic Binding for Forgery-Resistant Watermarking of Diffusion Images

IRIS:用于扩散图像防伪造水印的视觉-语义绑定

Xiaoyan Feng, Zheng Gao, Tong Guan, Rui Bao, Bokang Zeng, Xiaoyu Li, Jiaojiao Jiang

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 IRIS是一种无需训练的扩散图像防伪造水印方案,通过视觉-语义绑定抵御固定图案移植与事后再生剥离,在三个提示数据集上检测可靠且保真度优异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.03335 2026-08-05 cs.CV 新提交 79%

SPADE: An Input-Adaptive Sparse Attention Engine for Fast Video Diffusion Models Inference

SPADE:用于快速视频扩散模型推理的输入自适应稀疏注意力引擎

Shanghao Liu, Renze Chen, Size Zheng, Yuanqiang Liu, Yun, Liang, Hailong Yang

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 针对视频扩散Transformer推理开销过高的问题,提出无训练的SPADE稀疏注意力引擎,通过三部分设计实现注意力2.26x-3.40x、端到端推理1.49x-1.80x的加速且保持生成质量。

Comments Published in the 63rd ACM/IEEE Design Automation Conference (DAC '26). 7 pages, 6 figures, 3 tables

Journal ref 63rd ACM/IEEE Design Automation Conference (DAC '26), 2026, 7 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.03082 2026-08-05 cs.CV 新提交 79%

DiverseDiT++: Quantifying, Analyzing, and Promoting Representation Diversity in Diffusion Transformers

DiverseDiT++:量化、分析与提升扩散Transformer的表示多样性

Binglei Li, Mengping Yang, Zhiyu Tan, Xiaomeng Yang, Zhizhong Huang, Junping Zhang, Hao Li

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 该研究针对扩散Transformer(DiTs)表示学习机制不明的问题,提出加权多样性分数(WDS)指标,进而构建DiverseDiT++框架提升表示多样性,在ImageNet数据集上实现了性能提升与收敛加速。

Comments 35 pages, 32 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.02151 2026-08-05 cs.GR 版本更新 79%

Fourier-Latent Diffusion for Constrained Generation of Triply Periodic Minimal Surfaces

用于三重周期极小曲面约束生成的傅里叶潜扩散模型

Shu Yan, Bohan Wang

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.GR

AI总结 该研究提出基于扩散的生成框架,构建含超1.8万种TPMS的数据集,训练Transformer扩散模型实现TPMS的可控生成,满足几何与弹性能约束,为TPMS逆设计提供实用工具。

Comments 11 pages, 16 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.27741 2026-08-05 cs.CV 版本更新 79%

SIFT: Self-Imagination Fine-Tuning for Physically Plausible Motion in Video Diffusion Models

SIFT: 视频扩散模型中物理合理运动的自我想象微调

Ruoyu Wang, Jialun Liu, Huayang Huang, Haibin Huang, Jiepeng Wang, Chi Zhang, Xuelong Li, Yu Wu

机构 * School of Computer Science, Wuhan University(武汉大学计算机学院) Institute of Artificial Intelligence, China Telecom (TeleAI)(中国电信人工智能研究院(TeleAI)) School of Artificial Intelligence, Wuhan University(武汉大学人工智能学院)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 针对视频扩散模型生成运动物理不合理的问题,提出自我想象微调(SIFT)范式,通过从模型自身生成视频学习而非直接重建真实视频,结合运动感知判别监督和渐进式难例重放策略,提升运动解耦与物理真实性。

Comments ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.15615 2026-08-05 cs.LG cs.CV 版本更新 79%

MoECa: Aligning Feature Reuse with Expert Decomposition in Diffusion Transformers

MoECa: 在扩散变换器中对齐特征复用与专家分解

Maoliang Li, Haojing Chen, Jiayu Chen, Zihao Zheng, Xinhao Sun, Hailong Zou, Xiang Chen

机构 * School of Computer Science, Peking University(北京大学计算机科学学院) School of Software Engineering, University of Electronic Science and Technology of China(电子科技大学软件工程学院)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 针对DiT-MoE中跨时间步的冗余计算,提出基于专家分支级别的细粒度缓存框架MoECa,实现分支级特征复用,并引入专家感知自适应控制和同步缓存更新,在多个模型上取得高达2.83倍加速且质量损失极小。

Comments Will appear in ACM MM'2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.15169 2026-08-05 cs.CV 版本更新 79%

MeSS: City Mesh-Guided Outdoor Scene Generation with Cross-View Consistent Diffusion

MeSS: 基于城市网格的户外场景生成与跨视角一致扩散

Xuyang Chen, Zhijun Zhai, Kaixuan Zhou, Zengmao Wang, Jianan He, Dong Wang, Yanfeng Zhang, mingwei Sun, Rüdiger Westermann, Konrad Schindler, Liqiu Meng

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 MeSS通过改进跨视角一致性,利用城市网格模型生成高质量且风格一致的户外场景,并结合3D高斯点划重建技术提升生成质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.23953 2026-08-05 cs.CV 版本更新 79%

T2VAttack: Adversarial Attack on Text-to-Video Diffusion Models

T2VAttack:针对文本到视频扩散模型的对抗攻击

Changzhen Li, Yuecong Min, Jie Zhang, Zheng Yuan, Shiguang Shan, Xilin Chen

机构 * Hangzhou Institute for Advanced Study, UCAS, school of Intelligent Science and Technology(杭州高等研究院,UCAS,智能科学与技术学院) State Key Laboratory of AI Safety, Institute of Computing Technology (ICT), Chinese Academy of Sciences (CAS)(人工智能安全国家重点实验室,计算技术研究所,中国科学院) University of Chinese Academy of Sciences (UCAS)(中国科学院大学)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 T2VAttack研究了文本到视频扩散模型的对抗攻击,提出两种攻击方法揭示模型在语义和时间动态上的脆弱性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.04551 2026-08-05 cs.CV 版本更新 79%

Two-Way Garment Transfer: Unified Diffusion Framework for Dressing and Undressing Synthesis

双向衣物迁移:用于穿衣和脱衣合成的统一扩散框架

Angang Zhang, Fang Deng, Hao Chen, Zhongjian Chen, Junyan Li

专题命中 扩散模型 :diffusion(title);image synthesis(abstract);分类 cs.CV

AI总结 本研究针对虚拟试穿与脱衣任务孤立研究的不足,提出双向衣物迁移模型,构建统一扩散框架,通过双向特征解纠缠和分阶段训练,在两个公开数据集上验证了方法的有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.03566 2026-08-05 stat.ML cs.LG stat.AP stat.ME 新提交 78%

Divide-and-Conquer: Towards Generalizable Amortized Bayesian Inference for the Drift Diffusion Model

分而治之:面向漂移扩散模型的可推广摊销贝叶斯推断

Yufei Wu, Shanqing Gao, Andreas Voss, Francis Tuerlinckx

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 本文针对摊销贝叶斯推断无法推广至不同研究设计的局限,提出分而治之框架,将DDM数据集分解为成对数据片后单独推断再用共识MCMC结合,在保持与MCMC相当性能的同时大幅降低计算成本,为ABI方法提供通用优化策略。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.03469 2026-08-05 stat.ML cs.LG 新提交 78%

Should the Boundary Term Be Learned in Reflected Diffusion? Conormal Trace and Reflection Masking

在反射扩散中是否应学习边界项?余法迹与反射掩蔽

Ziyue Wang, Takafumi Kanamori

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 该研究探讨有界域反射扩散的分数学习,提出无需额外参数的超矩形等域参数化方法,发现硬反射可掩盖边界分数误差,实验验证反射频率等因素对误差分离的影响。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.03769 2026-08-05 cs.CL cs.AI 新提交 78%

MDLMPE: Distribution Aware Positional Encoding for Masked Diffusion Language Models

MDLMPE:面向掩码扩散语言模型的分布感知位置编码

Tong Ling, Hang Lei, Feng Xiao, Changhui Sun, Jiahang Xie, Hao Liu, Lu Liu, Yanlong Du

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 针对掩码扩散语言模型位置编码对动态标记可用性结构不敏感的问题,提出MDLMPE,通过编码标记可用性等实现分布感知,在LLaDA、DREAM等实验中性能优于传统方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.03457 2026-08-05 cs.AI 新提交 78%

LLaDA MoE v2: Scaling Mixture-of-Experts Diffusion Language Models

LLaDA MoE v2:扩展混合专家扩散语言模型

Fengqi Zhu, Shaoxuan Xu, Jingyang Ou, Zebin You, Yipeng Xing, Huabin Liu, Xiaolu Zhang, Jun Zhou, Zhenzhong Lan, Yankai Lin, Wayne Xin Zhao, Jianguo Li, Chongxuan Li, Ji-Rong Wen

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 该研究明确MoE扩散语言模型的扩展规律,训练30B-A3B的LLaDA MoE v2,其预训练令牌量为Qwen3的65%,经微调后在多数推理编码基准上优于SDAR Chat且接近Qwen3。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.03260 2026-08-05 cs.LG 新提交 78%

ED-DiT: Physics-Guided Diffusion Pretraining for Transferable Molecular Representations from Electron Density

ED-DiT:用于从电子密度学习可迁移分子表示的物理引导扩散预训练

Liang Shuang, Haocheng Wang, Jiayi Song, Shuquan Ye, Ben Fei

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 本研究提出ED-DiT,一种物理引导的扩散Transformer,通过电子密度点云自监督预训练学习可迁移分子表示,在6项EDBench任务及低监督场景下均优于基线,展现出良好效果。

Comments 16 pages, 9 figures, 7 tables, including supplementary material

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.03244 2026-08-05 cs.AI 新提交 78%

UniNav: A Unified World-Action Diffusion Model for Visual Navigation

UniNav:用于视觉导航的统一世界-动作扩散模型

Changqing Zhou, Yueru Luo, Zeyu Jiang, Changhao Chen

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 UniNav是统一世界-动作扩散模型,通过单扩散过程生成未来视觉观测与航路点轨迹,其变体UniNav-Fast延迟0.1秒且精度无明显下降,在导航基准上ATE优于最强基线。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.03159 2026-08-05 cs.RO 新提交 78%

Accelerating Human-Aware Robot Trajectory Generation via Diffusion and Consistency Distillation

基于扩散模型与一致性蒸馏的人机感知机器人轨迹生成加速方法

Byeong-Il Ham, Hyun-Bin Kim, Kyung-Soo Kim

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 本研究针对人机交互场景下机器人轨迹生成的约束与效率问题,结合RRT/RRT*算法、扩散模型与一致性蒸馏技术,实现了快速、低加加速度的机器人轨迹生成。

Comments 8 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.03117 2026-08-05 cs.LG 新提交 78%

Simulation-free and finite-time diffusion model

无模拟且有限时间的扩散模型

Kentaro Kaba, Masayuki Ohzeki, Yuki Sughiyama

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 本文提出一种参考过程设计框架,可同时实现无模拟训练与有限时间生成,还揭示得分匹配并非扩散模型训练的基础,且条件流匹配是该框架的小噪声极限。

详情

展开后加载摘要…

URL PDF HTML 收藏