arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

图像生成

图像生成、文生图、图像编辑、扩散模型和可控生成。

2026-05-14 至 2026-05-14 共收录 125 信号源:cs.CV, cs.GR, cs.MM

1. 扩散模型 92 篇

2605.13027 2026-05-14 cs.CV 79%

PRISM: Prior Rectification and Uncertainty-Aware Structure Modeling for Diffusion-Based Text Image Super-Resolution

PRISM:基于先验校正和不确定性感知结构建模的扩散文本图像超分辨率

Zihang Xu, Xiaoyang Liu, Zheng Chen, Yulun Zhang, Xiaokang Yang

机构 * Shanghai Jiao Tong University(上海交通大学)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 PRISM通过Flow-Matching Prior Rectification和Structure-guided Uncertainty-aware Residual Encoder解决文本超分辨率中的先验校正和局部结构细化问题,实现高精度文本生成。

Comments Code is available at https://github.com/faithxuz/PRISM

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.12957 2026-05-14 cs.CV 79%

GTA: Advancing Image-to-3D World Generation via Geometry Then Appearance Video Diffusion

GTA: 通过几何然后外观视频扩散推进图像到3D世界生成

Hanxin Zhu, Cong Wang, Peiyan Tu, Jiayi Luo, Tianyu He, Xin Jin, Zhibo Chen

机构 * College of Information Science and Electronic Engineering, Zhejiang University(浙江大学信息科学与电子工程学院)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 本文提出GTA方法,通过几何先于外观的两阶段框架提升3D场景生成的结构精度和视觉质量,同时引入随机潜在shuffle策略和测试时缩放方案,实验表明其在保真度、视觉质量和几何准确性上优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.29917 2026-05-14 cs.CV 79%

Diffusion-Based Feature Denoising with NNMF for Robust handwritten digit multi-class classification

基于NNMF的扩散特征去噪在鲁棒手写数字多类分类中的应用

Hiba Adil Al-kharsan, Róbert Rajkó

机构 * Doctoral School of Computer Science, University of Szeged(塞格德大学计算机科学博士学院) University Research and Innovation Center (EKIK), Óbuda University(奥布达大学研究与创新中心(EKIK))

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 本文提出结合扩散驱动特征去噪与混合特征表示的鲁棒多类分类框架,通过NNMF提取紧致可解释特征并结合CNN深度特征,提升噪声和对抗攻击下的分类鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.01242 2026-05-14 cs.CV cs.AI cs.CL 79%

When Diffusion Breaks Constraints: Sequential Autoregressive Generation with RL and MCTS

当扩散模型失效约束:通过强化学习和MCTS的序列自回归生成

Zirui Zhao, Boye Niu, Harold Soh, David Hsu, Wee Sun Lee

机构 * Salesforce AI Research(Salesforce人工智能研究) University of Sydney(悉尼大学) National University of Singapore(新加坡国立大学)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 本文研究了扩散模型在约束生成任务中的失效模式,通过拼图生成和简化矩形组合任务,发现扩散模型难以满足约束,提出基于自回归序列生成的约束意识生成方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.12587 2026-05-14 cs.CV 79%

TrackCraft3R: Repurposing Video Diffusion Transformers for Dense 3D Tracking

TrackCraft3R:将视频扩散变换器重新用于密集3D跟踪

Jisu Nam, Jahyeok Koo, Soowon Son, Jaewoo Jung, Honggyu An, Junhwa Hur, Seungryong Kim

机构 * KAIST AI(韩国科学技术院人工智能研究所) Google DeepMind(谷歌DeepMind)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 本文提出TrackCraft3R,通过重新利用预训练的视频扩散变换器,实现了基于单目视频的密集3D跟踪,采用双潜表示和时间RoPE对齐设计,提升了跟踪性能和效率。

Comments Project page and code are available at https://cvlab-kaist.github.io/TrackCraft3r/

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.13448 2026-05-14 stat.ML cs.LG math.PR 78%

On the Limits of Latent Reuse in Diffusion Models

扩散模型中潜在重用的极限

Yifeng Yu, Lu Yu

机构 * Department of Mathematical Sciences, Tsinghua University(清华大学数学科学系) Department of Data Science, City University of Hong Kong(香港城市大学数据科学系)

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 研究扩散模型在分布偏移下潜在重用的可靠性,分析源-目标子空间主角偏差与环境噪声对目标域得分误差的影响,提出混合源-目标训练方法以确定共享潜在维度的依赖关系。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.13404 2026-05-14 cs.SD 78%

Seconds-Aligned PCA-DAC Latent Diffusion for Symbolic-to-Audio Drum Rendering

秒级对齐的PCA-DAC潜在扩散用于符号到音频鼓渲染

Konstantinos Soiledis, Maximos Kaliakatsos Papakostas, Dimos Makris, Konstantinos Tsamis

机构 * Dept. of Music Technology and Acoustics, Hellenic Mediterranean University(音乐技术与声学系,希腊地中海大学) Athena RC(雅典研究中心)

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 本文提出Sec2Drum-DAC模型,通过PCA-DAC在符号到音频鼓渲染中实现精确的时间和动态控制,提升频谱和瞬态指标,同时优化去噪步骤与指标的平衡。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.13399 2026-05-14 cs.LG cs.IT math.IT 78%

The Diffusion Encoder

扩散编码器

Akhil Premkumar, Sarah Lucioni

机构 * Department of Physics(物理系) University of California San Diego(加州大学圣地亚哥分校) Independent Researcher(独立研究者)

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 本文提出一种新型编码器,利用扩散模型的表达能力,通过交替训练方案解决解码器与编码器之间的同步问题,保持了标准扩散模型的简单高效训练目标。

Comments 22 pages + references, 10 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.11726 2026-05-14 cs.LG 78%

Block-R1: Rethinking the Role of Block Size in Multi-domain Reinforcement Learning for Diffusion Large Language Models

Block-R1: 重新审视块大小在多领域强化学习中的作用以提升扩散大语言模型

Yan Jiang, Ruihong Qiu, Zi Huang

机构 * The University of Queensland(昆士兰大学)

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 本文从领域冲突角度研究多领域场景下扩散大语言模型强化学习中的块大小问题,提出领域块大小冲突公式、Block-R1-41K数据集、Block-R1基准和跨领域强化学习方法,通过13个数据集和7种算法验证方法有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.19185 2026-05-14 cs.LG 78%

MIDST Challenge at SaTML 2025: Membership Inference over Diffusion-models-based Synthetic Tabular data

MIDST挑战赛在SaTML 2025: 基于扩散模型的合成表格数据的成员推断

Masoumeh Shafieinejad, Xi He, Mahshid Alinoori, John Jewell, Sana Ayromlou, Wei Pang, Veronica Chatrath, Gauri Sharma, Deval Pandya

机构 * Vector Institute

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 本文探讨了基于扩散模型生成的合成表格数据在隐私保护方面的有效性,重点评估其对成员推断攻击的抗性,并开发了针对这些模型的新型攻击方法。

Comments 4 page, 1 table

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.06021 2026-05-14 stat.ML cs.LG cs.NA math.NA math.PR 78%

Diffusion Model's Generalization Can Be Characterized by Inductive Biases toward a Data-Dependent Ridge Manifold

扩散模型的泛化能力可以通过数据依赖的ridge流形的归纳偏差来表征

Ye He, Yitong Qiu, Molei Tao

机构 * Georgia Institute of Technology(佐治亚理工学院) University of Science and Technology of China(中国科学技术大学)

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 本文研究扩散模型泛化能力的几何机制,通过引入时间依赖的log-density ridge流形,揭示生成样本在流形附近的运动规律,并通过实验验证了其在多模态数据和MNIST中的有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.02791 2026-05-14 stat.ML cs.LG math.ST stat.TH 78%

Plug-In Classification of Drift Functions in Diffusion Processes Using Neural Networks

利用神经网络插件分类扩散过程中的漂移函数

Yuzhen Zhao, Jiarong Fan, Yating Liu

机构 * Université Paris-Dauphine, PSL Chaire DIALog, Fondation du Risque Institut Louis Bachelier(巴黎-第十大学,PSL DIALog研究中心,风险基金会路易·巴舍利埃研究所) LaMME, University of Paris-Saclay(LaMME,巴黎-萨克雷大学) CEREMADE, CNRS Université Paris-Dauphine, PSL(CEREMADE,国家科学研究中心巴黎-第十大学,PSL)

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 本文研究扩散过程的监督多类分类,通过神经网络估计类特定漂移函数构建插件分类器,分析了漂移估计、时间离散化和维度对分类风险的影响,并通过数值实验验证了方法的有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.21033 2026-05-14 cs.LG 78%

Predict-Project-Renoise: Sampling Diffusion Models under Hard Constraints

预测-投影-重噪:在硬约束下采样扩散模型

Omer Rochman-Sharabi, Gilles Louppe

机构 * University of Liège(利根大学)

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 本文提出PPR算法,在硬约束下采样预训练扩散模型,通过投影、重噪和迭代实现低约束违反和高分布保真度。

Comments Code coming soon

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.20570 2026-05-14 cond-mat.soft math.AP q-bio.SC 78%

Voltage laws in nanodomains revealed by asymptotics and simulations of electro-diffusion equations

通过渐近分析和电扩散方程的模拟揭示纳米域中的电压定律

Frédéric Paquin-Lefebvre, Alejandro Barea Moreno, David Holcman

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 本文通过渐近分析和模拟研究纳米域中离子电流通过膜通道驱动的局部电压分布,揭示了小和大电荷 regime 中的离子分布和电压降,验证了理论预测。

Comments 30 pages, 7 figures, 3 tables

Journal ref Multiscale Modeling and Simulation, 24(1), 365-397 (2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.13296 2026-05-14 cs.AI cs.LG cs.MA 78%

Discrete Diffusion for Complex and Congested Multi-Agent Path Finding with Sparse Social Attention

离散扩散用于复杂且拥堵的多智能体路径寻找与稀疏社交注意

Yuanzhe Wang, Tian Zhi, Zihang Wei, Hongguang Wang, Jiaming Guo, Yang Zhao, Zisheng Liu, Shiyu Quan, Xing Hu, Zidong Du, Yunji Chen

机构 * State Key Lab of Processors, Institute of Computing Technology, CAS(中国科学院计算技术研究所处理器重点实验室) School of Advanced Interdisciplinary Sciences, CAS(中国科学院高等交叉学科学院) University of Chinese Academy of Sciences(中国科学院大学) Institute of Microelectronics, CAS(中国科学院微电子研究所)

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 本文提出DiffLNS框架,结合离散去噪扩散概率模型与LNS2,通过稀疏社交注意学习多智能体轨迹先验,提升多智能体路径寻找的修复效率与成功率。

Comments 24 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.13043 2026-05-14 cs.CL 78%

Adaptive Steering and Remasking for Safe Generation in Diffusion Language Models

自适应转向与重掩码用于扩散语言模型中的安全生成

Yejin Lee, Yo-Sub Han

机构 * Department of Computer Science(计算机科学系) Yonsei University(延世大学)

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 本文提出基于去噪过程分步干预的安全防御框架,通过对比安全方向(SGD)检测有害生成并重掩码以提高安全性,实验显示有效降低逃逸成功率至0.64%。

Comments 17 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.13013 2026-05-14 cs.LG 78%

JEDI: Joint Embedding Diffusion World Model for Online Model-Based Reinforcement Learning

JEDI: 联合嵌入扩散世界模型用于在线基于模型的强化学习

Jing Yu Lim, Rushi Shah, Zarif Ikram, Samson Yu, Haozhe Ma, Tze-Yun Leong, Dianbo Liu

机构 * National University of Singapore(新加坡国立大学)

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 JEDI通过联合嵌入扩散方法,构建了首个端到端的潜在扩散世界模型,提升了在线基于模型的强化学习效率与性能,减少了显存占用并加快了训练速度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.12637 2026-05-14 astro-ph.IM astro-ph.HE 78%

On the Numerical Stability of the Diffusion Coefficient in Microscopic Simulations

关于微观模拟中扩散系数数值稳定性的研究

Vladimir Yurovsky, Ilya Kudryashov

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 本文研究了直接微观数值模拟中银河宇宙射线扩散系数计算的数值限制,发现速度误差对结果影响大于空间误差。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.08920 2026-05-14 cs.LG 78%

Diffusion-Inspired Reconfiguration of Transformers for Uncertainty Calibration

受扩散启发的Transformer重构用于不确定性校准

Manh Cuong Dao, Quang Hung Pham, Phi Le Nguyen, Thao Nguyen Truong, Bryan Kian Hsiang Low, Trong Nghia Hoang

机构 * National University of Singapore(新加坡国立大学) Hanoi University of Science and Technology(河内科学技术大学) National Institute of Advanced Industrial Science and Technology(国家先进工业科学与技术研究院) Washington State University(华盛顿州立大学)

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 本文提出一种受扩散启发的Transformer重构方法,通过概率映射模拟扩散过程,实现不确定性校准和预测精度提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.05000 2026-05-14 cs.LG cs.AI cs.CL 78%

Entropy Aware Reward Guidance for Diffusion Language Model Alignment

基于熵的奖励引导用于扩散语言模型对齐

Atula Tejaswi, Litu Rout, Constantine Caramanis, Sanjay Shakkottai, Sujay Sanghavi

机构 * The University of Texas at Austin(德克萨斯大学奥斯汀分校)

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 本文提出EntRGi机制,解决离散扩散语言模型中无法通过自然输出区分的问题,通过动态插值连续token放松与采样硬token,提升奖励模型可靠性与优化精度。

Comments Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.09675 2026-05-14 cs.CL 78%

d-TreeRPO: Towards More Reliable Policy Optimization for Diffusion Language Models

d-TreeRPO:迈向更可靠的扩散语言模型策略优化

Leyi Pan, Shuchang Tao, Yunpeng Zhai, Zheyu Fu, Liancheng Fang, Minghua He, Lingzhe Zhang, Zhaoyang Liu, Bolin Ding, Aiwei Liu, Lijie Wen

机构 * Tsinghua University(清华大学) Tongyi Lab(通义实验室) University of Illinois at Chicago(伊利诺伊大学香槟分校) Peking University(北京大学)

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 本文提出d-TreeRPO框架,通过树状回滚和可验证奖励提升扩散语言模型策略优化的可靠性,理论证明预测信心提升可减少预测概率偏差,并在多个推理基准上取得显著提升。

Comments ACL 2026 Main

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.19304 2026-05-14 cs.LG 78%

Loopholing Discrete Diffusion: Deterministic Bypass of the Sampling Wall

突破离散扩散:确定性绕过采样壁垒

Mingyu Jo, Jaesik Yoon, Justin Deschenaux, Caglar Gulcehre, Sungjin Ahn

机构 * KAIST(韩国科学技术院) EPFL(苏黎世联邦理工学院) Microsoft(微软) SAP NYU(纽约大学)

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 本文提出Loopholing机制,通过确定性潜在路径解决离散扩散模型采样瓶颈问题,显著降低生成困惑度,提升文本连贯性,并在推理任务中表现优异。

Comments Accepted at ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.18114 2026-05-14 cs.LG cs.AI stat.ML 78%

Latent-Augmented Discrete Diffusion Models

潜在增强的离散扩散模型

Dario Shariatian, Alain Durmus, Umut Simsekli, Stefano Peluchetti

机构 * Inria(法国国家信息与自动化技术研究院) PSL Research University(巴黎社会科学高等研究院) CMAP(巴黎高等理工学院应用数学与计算科学实验室) Ecole Polytechnique Palaiseau, France(法国巴黎高等理工学院Palaiseau分校) Sakana AI Tokyo, Japan(日本东京Sakana AI公司)

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 本文提出LADD模型,通过引入可学习的辅助潜在通道,在联合(token,latent)空间进行扩散,提升离散扩散模型的性能和效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.19538 2026-05-14 cs.LG cs.AI 78%

DAWM: Diffusion Action World Models for Offline Reinforcement Learning via Action-Inferred Transitions

DAWM:基于扩散的世界模型用于通过动作推断的离线强化学习

Zongyue Li, Xiao Han, Yusong Li, Niklas Strauss, Matthias Schubert

机构 * Department of Computer Science, University of Munich, Munich, Germany(慕尼黑大学计算机科学系) Munich Center for Machine Learning (MCML), Munich, Germany(慕尼黑机器学习中心(MCML))

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 DAWM通过动作推断生成未来状态-奖励轨迹,结合逆动力学模型,为离线强化学习提供高效训练方案,提升算法性能。

Comments ICML2025 workshop Building Physically Plausible World Models

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.13456 2026-05-14 cs.AI cs.RO 78%

Block-wise Adaptive Caching for Accelerating Diffusion Policy

块级自适应缓存用于加速扩散策略

Kangye Ji, Yuan Meng, Hanyun Cui, Ye Li, Jianbo Zhou, Shengjia Hua, Lei Chen, Zhi Wang

机构 * Tsinghua Shenzhen International Graduate School, Tsinghua University(清华大学深圳国际研究生院,清华大学) Department of Computer Science and Technology, Tsinghua University(清华大学计算机科学与技术系)

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 本文提出BAC方法,通过块级自适应缓存加速扩散策略,利用特征相似性非均匀时间动态特性,减少计算开销,实现无损动作生成加速。

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.15913 2026-05-14 cs.SD cs.AI cs.LG eess.AS 78%

Repurposing Image Diffusion Models for Training-Free Music Style Transfer on Mel-spectrograms

将图像扩散模型重新利用于梅尔谱图上的无训练音乐风格迁移

Heehwan Wang, Joonwoo Kwon, Sooyoung Kim, Jungwoo Seo, Shinjae Yoo, Yuewei Lin, Jiook Cha

机构 * Seoul National University(首尔国立大学) Michigan State University(密歇根州立大学) Rutgers University(罗格斯大学) Brookhaven National Laboratory(布鲁克海文国家实验室)

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 本文提出Stylus框架,利用预训练图像扩散模型实现无训练的音乐风格迁移,通过引入风格键值和相位保持重建策略提升音质,实验表明其在内容保留和感知质量上优于现有方法。

Comments Accepted by ICIP 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.12522 2026-05-14 cs.CL cs.AI 78%

Differences in Text Generated by Diffusion and Autoregressive Language Models

扩散模型与自回归语言模型生成文本的差异

Zeyang Zhang, Chengwei Liang, Xingyan Chen, Meiqi Gu, Minrui Luo, Jingzhao Zhang, Tianxing He

机构 * Shanghai Qi Zhi Institute(上海启智研究院) Institute for Interdisciplinary Information Sciences, Tsinghua University(清华大学交叉信息研究院) Xiongan AI Institute(雄安人工智能研究院)

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 研究比较了扩散模型与自回归语言模型在生成文本中的差异,发现扩散模型在语义连贯性和多样性上表现更优,但熵较低,这主要归因于双向上下文和解码算法的影响。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.08078 2026-05-14 cs.CV cs.LG 77%

Normalizing Trajectory Models

轨迹归一化模型

Jiatao Gu, Tianrong Chen, Ying Shen, David Berthelot, Shuangfei Zhai, Josh Susskind

机构 * Apple(苹果公司)

专题命中 扩散模型 :image generation(abstract);text-to-image(abstract);diffusion(abstract);分类 cs.CV

AI总结 本文提出轨迹归一化模型,通过精确的似然训练建模反向步骤作为条件归一化流,实现高效生成并在文本到图像任务中展现优越性能。

Comments 25 pages, 10 figures; corrected typos and citations

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.13586 2026-05-14 cs.CV cs.AI 74%

HetScene: Heterogeneity-Aware Diffusion for Dense Indoor Scene Generation

HetScene: 基于异质性的扩散方法用于密集室内场景生成

Zini Chen, Junming Huang, Rong Zhang, Jiamin Xu, Cheng Peng, Chi Wang, Weiwei Xu

专题命中 扩散模型 :diffusion(title);分类 cs.CV

AI总结 本文提出HetScene方法,通过将物体分解为主次物体,解决密集布局和复杂空间依赖的生成问题,提升场景生成的物理合理性和可扩展性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.12690 2026-05-14 math.AP math.OC math.PR 71%

Mean Field Games in Hilbert Spaces with Degenerate Diffusion: A Viscosity Solution Approach

Hilbert空间中退化扩散的均场游戏:粘性解方法

Andrzej Święch, Lukas Wessels

专题命中 扩散模型 :diffusion(title)

AI总结 本文研究Hilbert空间中退化二次均场游戏系统,结合Fokker-Planck方程与HJB方程,通过粘性解方法证明了解的存在性和唯一性。

详情

展开后加载摘要…

URL PDF HTML 收藏