arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

图像生成

图像生成、文生图、图像编辑、扩散模型和可控生成。

2026-06-23 至 2026-06-23 共收录 173 信号源:cs.CV, cs.GR, cs.MM

1. 扩散模型 173 篇

2312.07865 2026-06-23 cs.CV 版本更新 90%

SimAC: A Simple Anti-Customization Method for Protecting Face Privacy against Text-to-Image Synthesis of Diffusion Models

SimAC: 一种针对扩散模型文本到图像合成的简单面部隐私反定制方法

Feifei Wang, Zhentao Tan, Tianyi Wei, Yue Wu, Qidong Huang

机构 * University of Science and Technology of China(中国科学技术大学) Alibaba Cloud(阿里云)

专题命中 扩散模型 :diffusion(title,abstract);text-to-image(title);image synthesis(title);分类 cs.CV

AI总结 针对扩散模型定制化技术引发的隐私问题,提出SimAC方法,通过分析时间步选择与频域感知关系及去噪过程不同层特征,设计自适应贪婪搜索和特征优化框架,有效提升身份干扰,保护用户隐私。

Comments Accepted by CVPR2024. Code: https://github.com/somuchtome/SimAC

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.23053 2026-06-23 cs.LG 版本更新 89%

Double-Diffusion: Balancing Speed, Accuracy, and Uncertainty in Probabilistic Forecasting for Urban Sensor Networks

Double-Diffusion: 城市传感器网络中概率预测的速度、准确性与不确定性的平衡

Hanlin Dong, Arian Prabowo, Hao Xue, Ao Shuang, Tianyi Zhou, Yuxuan Liang, Flora D. Salim

机构 * University of New South Wales(新南威尔士大学) University of Maryland(马里兰大学) The Hong Kong University of Science and Technology (Guangzhou)(香港科学与技术大学(广州))

专题命中 扩散模型 :diffusion(title,title_cn)

AI总结 提出Double-Diffusion方法,结合闭式图热先验与去噪扩散模型,通过短预热链从先验开始去噪,实现快速、准确且具有不确定性的概率预测,在四个真实数据集上取得最佳CRPS。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.23626 2026-06-23 cs.LG cs.AI 新提交 87%

DiT-Reward: Generative Representations for Text-to-Image Reward Modeling

DiT-Reward:文本到图像奖励建模的生成式表示

Yuanming Yang, Guoqing Ma, Bo Wang, Yuan Zhang, Wei Tang, Chenyi Li, Haoyang Huang, Nan Duan

机构 * JD Explore Academy, JD.com(京东探索研究院,京东) Tsinghua University(清华大学) Beijing Institute of Technology(北京理工大学) Peking University(北京大学)

专题命中 扩散模型 :text-to-image(title,abstract);diffusion(abstract,abstract_cn);image generation(abstract)

AI总结 提出DiT-Reward,利用预训练文本到图像扩散Transformer的生成表示进行奖励预测,在多个偏好基准上超越HPSv3,并实现1.65倍推理加速。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.23391 2026-06-23 cs.LG cs.AI 新提交 87%

Distribution-Aware Diffusion-LLM for Robust Ultra-Long-Term Time Series Forecasting

分布感知的扩散-大语言模型用于鲁棒的超长期时间序列预测

Falguni Ghosh, Vahid Hashemi, Bernhard Kainz

机构 * Friedrich-Alexander-Universität Erlangen-Nürnberg(埃尔朗根-纽伦堡大学) Imperial College London(伦敦帝国学院) AUDI AG(奥迪股份公司)

专题命中 扩散模型 :diffusion(title,summary_cn)

AI总结 提出Diffusion-LLM框架,将条件扩散模型集成到基于LLM的预测流程中,学习未来数据条件分布并改善语义对齐,在超长期和少样本预测中显著优于现有LLM基线。

Comments 18 pages, 6 figures, 8 tables. Accepted at 35th International Conference on Artificial Neural Networks (ICANN 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.22924 2026-06-23 cs.CV 新提交 86%

MythraGen: Two-Stage Retrieval Augmented Art Generation Framework

MythraGen:两阶段检索增强艺术生成框架

Quang-Khai Le, Cong-Long Nguyen, Minh-Triet Tran, Trung-Nghia Le

机构 * University of Science, Ho Chi Minh city, Vietnam(胡志明市科学大学) Vietnam National University, Ho Chi Minh city, Vietnam(越南国家大学)

专题命中 扩散模型 :diffusion(summary_cn,abstract);image generation(abstract);text-to-image(abstract);分类 cs.CV

AI总结 提出MythraGen框架,结合艺术检索与LoRA微调,通过检索与提示最相似的艺术图像微调Stable Diffusion,在WikiArt数据集上生成高质量、风格匹配的艺术作品。

Comments SOICT 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.20889 2026-06-23 cs.CV cs.AI cs.LG 版本更新 86%

Test-Time Alignment of Text-to-Image Diffusion Models via Null-Text Embedding Optimisation

文本到图像扩散模型的测试时对齐:通过空文本嵌入优化

Taehoon Kim, Henry Gouk, Timothy Hospedales

机构 * School of Informatics, University of Edinburgh(爱丁堡大学信息学院) Samsung AI Center, Cambridge(三星人工智能中心)

专题命中 扩散模型 :diffusion(title,abstract);text-to-image(title);分类 cs.CV

AI总结 提出Null-TTA方法,通过优化无分类器引导中的无条件嵌入实现测试时对齐,避免奖励黑客问题,在保持语义一致性的同时达到最先进性能。

Journal ref Published at CVPR2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.23332 2026-06-23 cs.CV 版本更新 85%

TraceMark-LDM: Authenticatable Watermarking for Latent Diffusion Models via Binary-Guided Rearrangement

TraceMark-LDM:通过二进制引导重排实现潜在扩散模型的可认证水印

Wenhao Luo, Zhangyi Shen, Ye Yao, Feng Ding, Guopu Zhu, Weizhi Meng

机构 * Hangzhou Dianzi University(杭州电子科技大学) Nanchang University(南昌大学) School of Computer Science and Technology, Harbin Institute of Technology(计算机科学与技术学院,哈尔滨工业大学) School of Computing and Communications, Lancaster University(计算与通信学院,兰卡斯特大学)

专题命中 扩散模型 :diffusion(title,abstract);image generation(abstract);text-to-image(abstract);分类 cs.CV

AI总结 提出TraceMark-LDM算法,利用水印引导重排高斯随机变量,结合分组重排和编码器微调,在不影响生成质量的前提下实现图像归属,鲁棒性优于现有方法。

Comments This paper has been accepted by Expert Systems with Applications

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.22958 2026-06-23 cs.LG cs.CV 新提交 83%

PG-MAP: Joint MAP Optimization for Inference-Time Alignment of Diffusion and Flow-Matching Models

PG-MAP:扩散与流匹配模型推理时对齐的联合MAP优化

Ruolan Sun, Pawel Polak

机构 * Stony Brook University(石溪大学)

专题命中 扩散模型 :diffusion(title,abstract);text-to-image(abstract);分类 cs.CV

AI总结 提出PG-MAP框架,通过轨迹级Gibbs-MAP/近端能量优化联合调节条件c和潜变量z_t,实现扩散与流匹配模型的推理时对齐,无需训练即可提升对齐指标。

Comments Code: https://github.com/sophialanlan/PG-MAP

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.03448 2026-06-23 cs.CV cs.AI 版本更新 83%

Hierarchical Concept-to-Appearance Guidance for Multi-Subject Image Generation

多主体图像生成的层次化概念到外观引导

Yijia Xu, Zihao Wang, Haokun Gui, Jinshi Cui

机构 * Peking University(北京大学) Hong Kong University of Science and Technology(香港科学与技术大学)

专题命中 扩散模型 :image generation(title,abstract);diffusion(abstract);分类 cs.CV

AI总结 提出层次化概念到外观引导框架(CAG),通过VAE dropout训练和对应感知掩码注意力模块,实现多主体图像生成中身份一致性和精确组合控制。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.20722 2026-06-23 cs.GR cs.CL cs.CV cs.LG 新提交 82%

Multimodal Image Colorization: Quantifying the Impact of Text-Conditioned Guidance on Grayscale-to-Color Translation

多模态图像着色:量化文本条件引导对灰度到彩色转换的影响

Colten Reissmann, Hugo Garrido-Lestache Belinchon

机构 * Department of Computer Science and Software Engineering(计算机科学与软件工程系)

专题命中 扩散模型 :diffusion(summary_cn,abstract);分类 cs.CV、cs.GR

AI总结 本文通过U-Net和Stable Diffusion 1.5两种架构,量化了CLIP文本条件对灰度图像着色质量的影响,发现文本条件显著提升了PSNR、SSIM和色彩度,降低了LPIPS。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.22717 2026-06-23 cs.CR cs.NI 新提交 82%

One-Prompt Censorship Evasion via Generative Diffusion Models

通过生成扩散模型实现单提示审查规避

Shiyi Ling, Yuhang Gan, Chen Qian

专题命中 扩散模型 :diffusion(title,abstract);image editing(abstract)

AI总结 提出FlowPaint框架,利用扩散模型的语义编辑能力,将审查流量重塑为良性模式,用户仅需自然语言指令即可对抗多种审查范式。

Comments 20 pages, 4 figures, 7 tables. Preprint, under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.05985 2026-06-23 cs.CY cs.CV 版本更新 81%

Generating Fearful Images: Investigating Potential Emotional Biases in Image-Generation Models

生成恐惧图像:探究图像生成模型中的潜在情感偏差

Maneet Mehta, Cody Buntain

机构 * Yale University(耶鲁大学) University of Maryland(马里兰大学)

专题命中 扩散模型 :diffusion(summary_cn,abstract);分类 cs.CV

AI总结 研究生成式AI模型在图像情感表达中的偏差,发现Stable Diffusion、ChatGPT和Gemini等模型生成的图像普遍倾向于引发恐惧情绪,表明存在系统性偏差。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.20764 2026-06-23 cs.CV cs.AI cs.GR cs.LG 新提交 81%

One Image is All You Need: Agentic One-Shot Image Generation via Text-Based World Models for Long-Tail Spatial Perception

一图足矣:基于文本世界模型的智能体单样本图像生成用于长尾空间感知

Keqin Zeng, Shuting Su, Shihao Lin, Ziyue Li, Rui Zhao

机构 * Tsinghua University(清华大学) SenseTime Research(商汤科技研究院) Sun Yat-Sen University(中山大学) Technical University of Munich(慕尼黑工业大学) Heilbronn Data Science Center(海尔布隆数据科学中心) Munich Data Institute(慕尼黑数据研究所)

专题命中 扩散模型 :image generation(title);diffusion(abstract);分类 cs.CV、cs.GR

AI总结 提出WMGen-v1框架,利用单张参考图像通过LVLM构建结构化场景表示,LLM进行物理合理的场景扩展,再由扩散模型生成多样化的长尾训练数据,缓解空间感知中的数据稀缺问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.23610 2026-06-23 cs.CV 新提交 80%

Vera: A Layered Diffusion Model for Content-Preserving Video Editing

Vera: 一种用于内容保持视频编辑的分层扩散模型

Hongkai Zheng, Ta-Ying Cheng, Benjamin Klein, Yisong Yue, Zhuoning Yuan

机构 * California Institute of Technology(加州理工学院) Netflix, Inc(Netflix公司)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 提出Vera分层扩散框架,通过生成编辑层和alpha遮罩与源视频合成,利用混合Transformer架构和高质量分层数据集,在保持内容的同时实现高质量编辑。

Comments https://vera-layered-diffusion.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.21414 2026-06-23 eess.IV cs.AI cs.CV 新提交 79%

2D Versus 3D Diffusion for In Silico Training of Interventional X-ray AI Models

二维与三维扩散在介入X射线AI模型模拟训练中的比较

Sampath Rapuri, Jeremy Ko, Benjamin D. Killeen, Russell H. Taylor, Mathias Unberath

机构 * Johns Hopkins University(约翰霍普金斯大学)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 本文比较了基于3D条件潜在扩散模型生成CT体数据用于DRR合成与基于视图条件的2D扩散模型直接生成合成X射线两种方法,发现2D扩散生成的合成X射线可用于训练解剖标志检测模型,性能接近真实数据训练模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.23362 2026-06-23 cs.CR cs.CV 新提交 79%

TooBad: Backdoor Diffusion Models with Ultra-Low Poison Rate and Imperceptible Trigger

TooBad: 超低投毒率和不可察觉触发器的后门扩散模型

Vu Tuan Truong, Long Bao Le

机构 * INRS, University of Quebec(INRS大学)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 提出TooBad框架,通过针对扩散模型的触发器优化技术,在极低投毒率(0.5%)下实现高攻击成功率(>85%),并保持高隐蔽性和实用性。

Journal ref ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.23298 2026-06-23 cs.CV 新提交 79%

Ocean4D: Generative Underwater 4D Reconstruction via Medium-Aware Video Diffusion

Ocean4D:通过介质感知视频扩散的生成式水下4D重建

Yuqiang Huang, Yuxi Wang, Junyu Dong, Zhaoxiang Zhang

机构 * Faculty of Information Science and Engineering, Ocean University of China(中国海洋大学信息科学与工程学部) Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 提出Ocean4D生成式框架,通过4D几何一致性条件化和介质感知去噪扩散,解决水下动态场景中吸收与散射导致的几何不稳定和跨视角不一致问题,实现单目视频到目标轨迹的高质量4D重建。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.23019 2026-06-23 cs.CV cs.AI 新提交 79%

ScalingAttention: Discovering Intrinsic Sparse Attention Topology for Video Diffusion Transformers

ScalingAttention: 发现视频扩散变换器的内在稀疏注意力拓扑

Ruiliang Zhou, Xuecheng Wu, Kang He, Guangyun Han, Bin Liu, Qinqin Chen, Wende Xu, Qingjie Zhao, Chengru Song

机构 * KlingAI Research(KlingAI研究院) Beijing Institute of Technology(北京理工大学) NVIDIA(英伟达) Tsinghua University(清华大学)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 提出ScalingAttention框架,通过权重编码的稀疏拓扑(WEST)和保真度感知灵敏度调优(FAST)实现训练无关的注意力稀疏化,在Wan2.1上获得最高1.90倍加速并保持高质量。

Comments 18 pages, 9 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.22959 2026-06-23 cs.AI cs.CV 新提交 79%

The Impact of VAE Design on Latent Pose Representations for Diffusion-based Sign Language Production

VAE设计对基于扩散的手语生成中潜在姿态表示的影响

Guilhem Fauré, Mostafa Sadeghi, Sam Bigeard, Slim Ouni

机构 * CNRS(国家科学研究中心) Inria(法国国家信息与自动化技术研究所) LORIA(洛林信息与自动化研究所)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 研究变分自编码器(VAE)架构和训练目标设计如何影响潜在空间结构,进而影响基于潜在扩散模型的手语生成性能,发现潜在空间特性比重建精度更能解释生成性能差异。

Journal ref GenSign Generative AI for Sign Language CVPR 2026 Workshop, Jun 2026, Denver (Colorado, USA), France. pp. 10631-10640

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.22702 2026-06-23 cs.CV 新提交 79%

Modular Diffusion Models for Structured Visual Recognition

模块化扩散模型用于结构化视觉识别

Siddhesh Khandelwal, Björn Ommer, Leonid Sigal

机构 * Department of Computer Science, University of British Columbia(不列颠哥伦比亚大学计算机科学系) Vector Institute for AI(向量人工智能研究所) CompVis, Ludwig Maximilian University of Munich(慕尼黑路德维希·马克西米利安大学计算机视觉实验室) Munich Center for Machine Learning(慕尼黑机器学习中心) CIFAR AI Chair(CIFAR人工智能教席)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 提出模块化扩散模型(MDMs),通过将扩散过程分解为任务特定模块,学习结构化输出的分布,以处理视觉识别中的不确定性,在目标检测、实例分割和场景图生成任务上取得优势。

Comments 34 pages, 7 figures, 4 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.22660 2026-06-23 cs.CV 新提交 79%

Prompting Diffusion Models for Zero-Shot Instance Segmentation

提示扩散模型用于零样本实例分割

Irem Zeynep Alagöz, Nils Morbitzer, Andrea Ramazzina, Nassir Navab, Federico Tombari, Stefano Gasperini

机构 * Technical University of Munich (TUM)(慕尼黑工业大学) Munich Center of Machine Learning (MCML)(慕尼黑机器学习中心) Mercedes-Benz AG(梅赛德斯-奔驰集团) Visualais

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 提出Prompt2Seg框架,通过空间条件化增强扩散模型,利用2D高斯或置信度图作为提示,实现零样本实例分割,在多个数据集上优于基线。

Comments Under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.21700 2026-06-23 cs.CV 新提交 79%

VT-DUDA: Visual Token Conditioning for Diffusion-guided Unsupervised Domain Adaptation

VT-DUDA: 扩散引导的无监督域适应的视觉令牌条件化

Xuan Qi, Daniele Berardini, Dario Serez, Vito Paolo Pastore, Vittorio Murino

机构 * Istituto Italiano di Tecnologia(意大利技术研究院) University of Genoa(热那亚大学) University of Verona(维罗纳大学)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 提出VT-DUDA框架,通过将源图像映射为视觉令牌并与文本嵌入拼接作为条件,增强扩散模型生成目标风格图像时的实例级引导,提升无监督域适应性能。

Journal ref Transactions on Machine Learning Research, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.21234 2026-06-23 cs.CV 新提交 79%

Context-Aware Autoregressive Diffusion for Gloss-Wise Sign Language Production

上下文感知的自回归扩散用于逐词汇手语生成

JungHoon Sung, Boeun Kim, Chu Xin, Hyung Jin Chang, ChangHo Kim, Sang-Il Choi, Younggeun Choi

机构 * Dankook University(檀国大学) University of Birmingham(伯明翰大学)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 提出GARD模型,通过语义和运动上下文条件化,结合词汇间过渡引导和全局运动协调器,实现逐词汇手语生成,在Phoenix-T和CSL-Daily数据集上优于现有方法。

Comments 18 pages, 5 figures, 4 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.10983 2026-06-23 cs.LG cs.AI cs.CV 版本更新 79%

TMPO: Trajectory Matching Policy Optimization for Diverse and Efficient Diffusion Alignment

TMPO:用于多样化和高效扩散对齐的轨迹匹配策略优化

Jiaming Li, Chenyu Zhu, Nanxi Yi, Youjun Bao, Li Sun, Quanying Lv, Xiang Fang, Daizong Liu, Jianjun Li, Kun He, Bowen Zhou, Zhiyuan Ma

机构 * Huazhong University of Science and Technology(华中科技大学) Kuaishou Technology(快手科技) Nanyang Technological University(南洋理工大学) Wuhan University(武汉大学) Tsinghua University(清华大学)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 本文提出TMPO,通过轨迹级奖励分布匹配提升扩散模型生成多样性,采用Softmax-TB目标和动态随机树采样,有效减少训练时间并提升性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.15098 2026-06-23 cs.CV 版本更新 79%

A Comprehensive Study on Visual Token Redundancy for Discrete Diffusion-based Multimodal Large Language Models

基于离散扩散的多模态大语言模型中视觉标记冗余的综合研究

Duo Li, Zuhao Yang, Xiaoqin Zhang, Ling Shao, Shijian Lu

机构 * CCDS, NTU, Singapore(南洋理工大学新加坡分校) CCST, ZJUT, China(浙江工业大学中国分校) Terminus AI Lab, UCAS, China(中国科学院大学人工智能实验室)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 本研究系统分析了离散扩散多模态大语言模型中视觉标记冗余的演化规律,发现其仅出现在从头训练的模型处理长答案任务时,并验证了视觉标记剪枝会导致信息损失,而层跳过和渐进剪枝分别适用于不同架构的加速。

Comments Accepted by CVPR 2026

Journal ref Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition (CVPR) Findings, 2026, pp. 2823-2833

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.14310 2026-06-23 cs.CV 版本更新 79%

Iterative Diffusion-Refined Neural Attenuation Fields for Multi-Source Stationary CT Reconstruction: NAF Meets Diffusion Model

迭代扩散精化神经衰减场用于多源静态CT重建:NAF遇见扩散模型

Jiancheng Fang, Shaoyu Wang, Junlin Wang, Weiwen Wu, Yikun Zhang, Qiegen Liu

机构 * School of Information Engineering, Nanchang University(南昌大学信息工程学院) School of Mathematics and Computer Sciences, Nanchang University(南昌大学数学与计算机科学学院) School of Biomedical Engineering, Sun Yat-sen University(中山大学生物医学工程学院) Laboratory of Image Science and Technology, School of Computer Science and Engineering, and the Key Laboratory of New Generation Artificial Intelligence Technology and Its Interdisciplinary Applications, Ministry of Education, Southeast University(东南大学计算机科学与工程学院图像科学与技术实验室,以及教育部新一代人工智能技术及其交叉应用重点实验室)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 针对超稀疏视角下多源静态CT重建质量差的问题,提出Diff-NAF框架,结合神经衰减场与双分支条件扩散模型,通过迭代投影合成与精化,显著提升重建保真度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2212.04495 2026-06-23 cs.CV 版本更新 79%

MoFusion: A Framework for Denoising-Diffusion-based Motion Synthesis

MoFusion: 一种基于去噪扩散的运动合成框架

Rishabh Dabral, Muhammad Hamza Mughal, Vladislav Golyanik, Christian Theobalt

机构 * Max Planck Institute for Informatics, SIC(马克斯·普朗克信息研究所,SIC) Saarland University(萨尔兰大学)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 提出MoFusion框架,利用去噪扩散模型实现高质量、多样化的条件人体运动合成,支持音乐和文本等多种条件,并通过调度加权策略引入运动学损失,适用于运动编辑应用。

Comments CVPR23, 11 pages, 6 figures, 2 tables; project page: https://vcai.mpi-inf.mpg.de/projects/MoFusion

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.22521 2026-06-23 stat.ML cs.LG 新提交 78%

Robust Diffusion Models via Divergence-Induced Weighted Denoising

通过散度诱导加权去噪的鲁棒扩散模型

Lei Li, Yuexiao Dong

机构 * LunarAI LLC(LunarAI公司) Fox School of Business Temple University(Temple大学商学院)

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 提出用f-散度非线性变换替代扩散模型中的MSE去噪损失,构建鲁棒训练代理,通过局部散度构造统一训练目标,在数据污染下提升性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.22239 2026-06-23 stat.ML cs.LG 新提交 78%

Variance-Tilted Diffusion Models for Diverse Sampling

方差倾斜扩散模型用于多样化采样

Iskander Azangulov, Leo Zhang, Kianoosh Ashouritaklimi

机构 * Department of Statistics, University of Oxford, Oxford, UK(牛津大学统计学系)

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 提出方差加权批分布,通过Doob h-变换导出交互粒子采样器,在扩散模型中实现多样化采样,具有透明概率目标。

Comments Accepted at SPIGM @ ICML workshop 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.21036 2026-06-23 stat.ML cs.LG 新提交 78%

Diffusion-Driven State Space Models

扩散驱动的状态空间模型

Jack Ruder, Michael Wojnowicz

机构 * Montana State University(蒙塔纳州立大学)

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 提出扩散驱动状态空间模型(DDSSM),用扩散模型替代高斯转移分布,联合训练自编码器和扩散模型,提升时间序列拟合与预测能力。

Comments Accepted to ProbML 2026 Workshop Track

详情

展开后加载摘要…

URL PDF HTML 收藏