arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

图像生成

图像生成、文生图、图像编辑、扩散模型和可控生成。

2026-05-11 至 2026-05-11 共收录 70 信号源:cs.CV, cs.GR, cs.MM

1. 扩散模型 70 篇

2605.07503 2026-05-11 cs.CV 90%

Diffusion-APO: Trajectory-Aware Direct Preference Alignment for Video Diffusion Transformers

Diffusion-APO:基于轨迹的直接偏好对齐用于视频扩散变换器

Jingyuan Zhu, Biaolong Chen, Le Zhang, Aixi Zhang, Hao Jiang, Pipei Huang

机构 * Alibaba Group(阿里巴巴集团)

专题命中 扩散模型 :diffusion(title,title_cn);分类 cs.CV

AI总结 本文提出Diffusion-APO,通过同步训练噪声与推理时的去噪路径,解决视频扩散模型与人类意图对齐的问题,采用统一的RLHF框架实现灵活的多阶段偏好对齐,提升视觉质量和指令遵循性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.14186 2026-05-11 cs.CV 87%

Setting-Matched and Semantics-Scaled Benchmarking of One-Step Generative Models Against Multistep Diffusion and Flow Models

一步生成模型与多步扩散和流模型的匹配与语义缩放基准测试

Advaith Ravishankar, Serena Liu, Mingyang Wang, Todd Zhou, Jeffrey Zhou, Arnav Sharma, Ziling Hu, Léopold Das, Abdulaziz Sobirov, Faizaan Siddique, Freddy Yu, Seungjoo Baek, Yan Luo, Mengyu Wang

机构 * Harvard AI and Robotics Lab(哈佛人工智能与机器人实验室)

专题命中 扩散模型 :diffusion(title,abstract);image generation(abstract);text-to-image(abstract);分类 cs.CV

AI总结 本文通过ImageNet验证集、ImageNetV2和reLAIONet数据集,评估了八种模型在类条件协议下的性能,发现FID和CFG选择在少步情况下可能误导,引入csFID、psFID等指标以诊断语义对齐的图像生成。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.07973 2026-05-11 cs.CV 85%

HEART: Hyperspherical Embedding Alignment via Kent-Representation Traversal in Diffusion Models

HEART:通过扩散模型中的Kent表示遍历实现超球面嵌入对齐

Arani Roy, Shristi Das Biswas, Kaushik Roy

机构 * Purdue University(普渡大学)

专题命中 扩散模型 :diffusion(title,abstract);image generation(abstract);text-to-image(abstract);分类 cs.CV

AI总结 本文提出HEART框架,通过超球面几何对齐实现图像生成中的直观精确编辑,无需微调或优化,提升控制精度与稳定性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.06699 2026-05-11 eess.IV cs.AI cs.CV cs.LG 83%

Multimodal synthesis of MRI and tabular data with diffusion in a joint latent space via cross-attention

通过交叉注意力在联合潜在空间中利用扩散模型进行MRI和表格数据的多模态合成

Daniel Mensing, Jan Kapar, Jochen G. Hirsch, Matthias Günther, Horst Hahn, Marvin N. Wright

机构 * Fraunhofer Institute for Digital Medicine MEVIS(弗劳恩霍夫数字医学研究所MEVIS) Leibniz Institute for Prevention Research and Epidemiology – BIPS(莱比锡预防研究与流行病学研究所 – BIPS) Faculty of Mathematics and Computer Science, University of Bremen(不莱梅大学数学与计算机科学学院) Faculty of Physics and Electrical Engineering, University of Bremen(不莱梅大学物理与电气工程学院)

专题命中 扩散模型 :diffusion(title,abstract);image generation(abstract);分类 cs.CV

AI总结 本文提出了一种多模态潜在扩散模型,通过交叉注意力在共享潜在空间中联合生成MRI和临床表格数据,验证了在单一扩散框架中联合建模MRI和混合类型表格数据的可行性。

Journal ref Proc. SPIE 13925, Medical Imaging 2026: Image Processing, 139252D (April 03, 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.07456 2026-05-11 cs.LG 82%

Inference-Time Attribute Distribution Alignment for Unconditional Diffusion

推理时属性分布对齐用于无条件扩散

Hao Luan, See-Kiong Ng, Chun Kai Ling

机构 * School of Computing, National University of Singapore(新加坡国立大学计算机学院) Institute of Data Science, National University of Singapore(新加坡国立大学数据科学研究所)

专题命中 扩散模型 :diffusion(title,abstract);image generation(abstract)

AI总结 本文提出在推理时对齐属性分布的方法,通过最优控制问题优化扩散过程,实现更灵活的属性分布对齐,无需重新训练模型。

Comments Preprint. 35 pages, 13 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.07571 2026-05-11 q-fin.CP q-fin.MF 82%

Forecasting implied volatility surface with generative diffusion models

用生成扩散模型预测无套利隐含波动率面

Chen Jin, Ankush Agarwal

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 本文提出基于扩散概率模型的生成模型,通过条件化市场变量预测无套利隐含波动率面,采用信号噪声比无参数加权方案解决训练数据中的套利问题,实验显示其在波动率预测上优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.08044 2026-05-11 cs.CL cs.AI cs.LG 80%

Fast Byte Latent Transformer

快速字节潜在变换器

Julie Kallini, Artidoro Pagnoni, Tomasz Limisiewicz, Gargi Ghosh, Luke Zettlemoyer, Christopher Potts, Xiaochuang Han, Srinivasan Iyer

机构 * FAIR at Meta(Meta的FAIR) Stanford University(斯坦福大学) University of Washington(华盛顿大学)

专题命中 扩散模型 :diffusion(summary_cn,abstract)

AI总结 本文提出BLT Diffusion和BLT Self-speculation等方法,通过并行生成和验证步骤提升字节级语言模型的生成速度和质量,降低内存带宽消耗。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.08054 2026-05-11 cs.CV 79%

Towards Highly-Constrained Human Motion Generation with Retrieval-Guided Diffusion Noise Optimization

面向高约束人类动作生成的检索引导扩散噪声优化

Hanchao Liu, Fang-Lue Zhang, Shining Zhang, Tai-Jiang Mu, Shi-Min Hu

机构 * Tsinghua University(清华大学) University of New South Wales(新南威尔士大学)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 本文提出基于无训练扩散噪声优化框架的检索引导方法,通过关系任务解析和奖励引导掩码优化,解决高约束下的动作生成问题,提升虚拟代理行为合成能力。

Comments Accepted to CVPR2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.07915 2026-05-11 cs.CV 79%

What Matters for Diffusion-Friendly Latent Manifold? Prior-Aligned Autoencoders for Latent Diffusion

潜在扩散 manifold 中什么因素重要?面向潜在扩散的先验对齐自编码器

Zhengrong Yue, Taihang Hu, Mengting Chen, Haiyu Zhang, Zihao Pan, Tao Liu, Zikang Wang, Jinsong Lan, Xiaoyong Zhu, Bo Zheng, Yali Wang

机构 * Shanghai Jiao Tong University(上海交通大学) Alibaba Group(阿里巴巴集团) Shenzhen Institutes of Advanced Technology, Chinese Academy of Sciences(深圳先进技术研究院,中国科学院) Beihang University(北航) Sun Yat-sen University(中山大学) Nankai University(南开大学) Shanghai AI Laboratory(上海人工智能实验室)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 本文研究潜在 manifold 组织对扩散模型生成质量的影响,提出 PAE 显式构建潜在 manifold,提升训练效率和生成质量,达到新状态的 gFID 1.03。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.02129 2026-05-11 cs.CV 79%

VDEGaussian: Video Diffusion Enhanced 4D Gaussian Splatting for Dynamic Urban Scenes Modeling

VDEGaussian:基于视频扩散的4D高斯点云用于动态城市场景建模

Yuru Xiao, Zihan Lin, Chao Lu, Deming Zhai, Kui Jiang, Wenbo Zhao, Wei Zhang, Junjun Jiang, Huanran Wang, Xianming Liu

机构 * Harbin Institute of Technology(哈尔滨工业大学)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 本文提出一种结合视频扩散的4D高斯点云方法,解决动态场景建模中快速移动物体建模难题,通过时间一致性先验和不确定性蒸馏提升新型视角合成效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.06924 2026-05-11 cs.CV cs.AI 79%

A$^2$RD: Agentic Autoregressive Diffusion for Long Video Consistency

A$^2$RD:基于代理的自回归扩散用于长视频一致性

Do Xuan Long, Yale Song, Min-Yen Kan, Tomas Pfister, Long T. Le

机构 * Google Cloud AI Research(谷歌云人工智能研究)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 A$^2$RD通过Retrieve-Synthesize-Refine-Update循环实现长视频一致性合成,提升视频生成的连贯性和叙事一致性。

Comments Project page: http://dxlong2000.github.io/AARD

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.06892 2026-05-11 cs.CV 79%

Not All Tokens Need 40 Steps: Heterogeneous Step Allocation in Diffusion Transformers for Efficient Video Generation

并非所有标记都需要40步:扩散变换器中的异质步分配用于高效视频生成

Ernie Chu, Vishal M. Patel

机构 * Johns Hopkins University(约翰霍普金斯大学)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 本文提出HSA算法,通过根据速度动态分配不同时间空间标记的步数预算,提升视频生成效率,实验表明在加速运行时表现优于现有方法。

Comments Project page: https://ernestchu.github.io/hsa

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.06829 2026-05-11 cs.LG cs.CV cs.ET cs.IT cs.NE math.IT 79%

A Unified Measure-Theoretic View of Diffusion, Score-Based, and Flow Matching Generative Models

扩散、基于分数的和流匹配生成模型的统一测度论观点

Aditya Ranganath, Mukesh Singhal

机构 * Center for Applied Scientific Computing(应用科学计算中心) Lawrence Livermore National Laboratory(劳伦斯利弗莫尔国家实验室) University of California Merced(加州默塞德大学)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 本文从测度论角度统一了扩散、基于分数和流匹配生成模型,探讨了时间依赖向量场诱导的边缘分布,并分析了采样、稳定性和计算的权衡。

Comments 62 pages, 1 figure, jmlr preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.06169 2026-05-11 cs.LG cs.CV 79%

Mean Mode Screaming: Mean--Variance Split Residuals for 1000-Layer Diffusion Transformers

均值模式尖叫:用于1000层扩散变换器的均值-方差分割残差

Pengqi Lu

机构 * Beijing, China(中国北京)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 本文提出均值-方差分割残差,解决扩散变换器在数百层时出现的均值主导崩溃问题,通过分割残差更新和泄漏主干均值替换,使模型在极端深度下保持稳定训练。

Comments 43 pages (9-page main paper + appendix)

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.13837 2026-05-11 cs.CV 79%

A Causal Diffusion Model for Video Reconstruction from Ultra-Low-Bitrate Representations

一种用于从超低比特率表示中重建视频的因果扩散模型

Cem Eteke, Batuhan Tosun, Martin Piccolrovazzi, Alexander Griessel, Wolfgang Kellerer, Eckehard Steinbach

机构 * Chair of Media Technology(媒体技术系) Chair of Communication Networks(通信网络系) Munich Institute of Robotics and Machine Intelligence(慕尼黑机器人与智能机械研究所) School of Computation Information and Technology, Technical University of Munich(计算信息与技术学院,慕尼黑技术大学)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 本文提出一种因果扩散模型,用于从超低比特率语义和高度压缩帧中重建视频,通过联合建模互补信息,提升重建质量,优于传统、神经、生成和语义基线方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.16748 2026-05-11 cs.CV 79%

Multimodal Diffusion Transformer with Memory Bank for Scalable Long-Duration Talking Video Generation

具有内存库的多模态扩散变换器用于可扩展的长时谈话视频生成

Haojie Zhang, Zhihao Liang, Ruibo Fu, Bingyan Liu, Zhengqi Wen, Xuefei Liu, Jianhua Tao, Yaling Liang

机构 * South China University of Technology(南方科技大学) Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) Beijing National Research Center for Information Science and Technology, Tsinghua University(北京信息科学研究中心,清华大学) Department of Automation, BNRist, Tsinghua University(清华大学自动化系,北京信息科学研究中心)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 本文提出 LetsTalk 框架,通过多模态指导和内存库机制解决长时谈话视频生成中的质量、一致性、时间连贯性和计算效率问题,实验表明其在生成质量和效率上达到新水平。

Comments 16 pages, 25 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.07969 2026-05-11 cs.LG cs.IT math.IT 78%

When Diffusion Model Can Ignore Dimension: An Entropy-Based Theory

扩散模型可以忽略维度:基于熵的理论

Ahmad Aghapour, Erhan Bayraktar

机构 * Department of Mathematics, University of Michigan(数学系,密歇根大学)

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 本文从信息论角度探讨扩散采样收敛性,证明高维数据下采样效率由潜在表示熵决定,而非环境维度,为高维空间高效采样提供理论支持。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.07933 2026-05-11 cs.CL 78%

How to Train Your Latent Diffusion Language Model Jointly With the Latent Space

如何与潜在空间联合训练潜在扩散语言模型

Viacheslav Meshchaninov, Alexander Shabalin, Egor Chimbulatov, Nikita Gushchin, Ilya Koziev, Alexander Korotin, Dmitry Vetrov

机构 * Constructor University(Constructor大学) HSE University(莫斯科国立高等经济大学) Applied AI Institute(应用人工智能研究所) AXXX Independent researcher(独立研究者)

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 本文提出联合训练潜在扩散语言模型,通过重塑预训练语言模型的表示构建潜在空间,提升生成性能并加快速度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.07748 2026-05-11 cs.CL 78%

TextLDM: Language Modeling with Continuous Latent Diffusion

TextLDM:基于连续潜在扩散的语言建模

Jiaxiu Jiang, Jingjing Ren, Wenbo Li, Bo Wang, Haoze Sun, Yijun Yang, Jianhui Liu, Yanbing Zhang, Shenghe Zheng, Yuan Zhang, Haoyang Huang, Nan Duan, Wangmeng Zuo

机构 * Joy Future Academy(京东探索研究院) HIT(Harbin Institute of Technology) HKUST(GZ)(Hong Kong University of Science and Technology (Guangzhou))

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 TextLDM将视觉潜在扩散框架应用于文本生成,通过Representation Alignment提升文本表示质量,在OpenWebText2上训练后优于现有扩散语言模型,匹配GPT-2性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.07701 2026-05-11 cs.CL 78%

Guidance Is Not a Hyperparameter: Learning Dynamic Control in Diffusion Language Models

指导不是超参数:在扩散语言模型中学习动态控制

Fan Zhou, Tim Van de Cruys

机构 * KU Leuven(卢森堡大学)

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 本文提出通过强化学习学习动态指导轨迹,以解决扩散模型中指导尺度固定导致的可控性与生成质量平衡问题。

Comments ReALM-GEN@ICLR2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.07625 2026-05-11 math.ST stat.ML stat.TH 78%

Statistical Convergence of Spherical First Hitting Diffusion Models

球面第一击扩散模型的统计收敛性

Simon Bienewald, Lukas Trottner

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 本文研究了具有随机自适应生成时间的球面第一击扩散模型(FHDM)的统计收敛性,证明其在总变分下达到最优收敛率,为去噪扩散建模提供了新的理论支持。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.13641 2026-05-11 math.AP 78%

Diffusion Limit with Optimal Convergence Rate of Classical Solutions to the modified Vlasov-Poisson-Boltzmann System

带有最优收敛率的经典解对修正的Vlasov-泊松-玻尔兹曼系统的扩散极限

Yanchao Li, Mingying Zhong

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 研究修正Vlasov-泊松-玻尔兹曼系统经典解的扩散极限,通过谱分析证明了强解向不可压缩纳维-斯托克斯-泊松-傅里叶系统解的收敛性及收敛速率,对初始层进行了精确估计。

Comments arXiv admin note: text overlap with arXiv:2007.01461, arXiv:2504.21729, arXiv:2404.18389

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.21951 2026-05-11 stat.ML cs.LG stat.CO 78%

Diffusion Path Samplers via Sequential Monte Carlo

通过顺序蒙特卡洛方法实现扩散路径采样

James Matthew Young, Paula Cordero-Encinar, Sebastian Reich, Andrew Duncan, O. Deniz Akyildiz

机构 * Department of Mathematics, Imperial College London, UK(伦敦帝国学院数学系,英国)

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 本文提出了一种基于扩散路径的采样方法,通过顺序蒙特卡洛方法估计时间变化分布的得分和密度,适用于已知归一化常数的目标分布,并在不同路径上进行实验验证。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.15572 2026-05-11 cond-mat.mtrl-sci cond-mat.other physics.chem-ph quant-ph 78%

First-principles simulation of spin diffusion in static solids using dynamic mean-field theory

基于动态平均场理论的静态固体中自旋扩散的原理计算

Timo Gräßer, Götz S. Uhrig, Matthias Ernst

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 本文提出利用动态平均场理论模拟静态样品中的自旋谱扩散及零量子线型,验证了该方法在大规模自旋扩散模拟中的高效性和准确性。

Comments The supplementary material is included in the same pdf

Journal ref Science Advances 12, eaee6228 (2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.15698 2026-05-11 math.NA cs.NA math.PR 78%

Weak Error Estimates of Ergodic Approximations for Monotone Jump-diffusion SODEs

关于单调跳跃扩散SODEs的ergodic近似弱误差估计

Zhihui Liu, Xiaoming Wu

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 本文研究了单调跳跃扩散SODEs中随机theta方法的指数ergodic性及后向欧拉方法的弱误差估计,探讨了时间无关估计在无跳跃情况下的收敛性。

Comments to appear at Commun. Math. Sci

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.05668 2026-05-11 cs.LG stat.ML 78%

RNE: plug-and-play diffusion inference-time control and energy-based training

RNE: 可插拔的扩散推理时间控制与基于能量的训练

Jiajun He, José Miguel Hernández-Lobato, Yuanqi Du, Francisco Vargas

机构 * University of Cambridge(剑桥大学) Cornell University(康奈尔大学) Xaira Therapeutics

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 本文提出RNE,通过路径分布密度比的概念,建立了边际密度与转移核之间的联系,统一了扩散密度估计、推理时间控制和基于能量的扩散训练。实验显示RNE在推理时间控制和训练能量扩散模型方面表现优异。

Comments Accepted at ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.07198 2026-05-11 math.DS math.AP 78%

Minimal speed of unbounded traveling wave solutions for a 1D reaction-diffusion equation and their relationship with the dynamics at infinity

一维反应扩散方程无界行波解的最小速度及其与无穷远处动力学的关系

Yu Ichida

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 本文研究了一维反应扩散方程中无界行波解的最小速度及其与无穷远处动力学的关系,通过Poincaré型紧致化方法揭示了二维常微分方程组的动力学特性,确定了行波解的分类、正负性及最小速度的显式形式。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.07101 2026-05-11 cs.MA stat.ML 78%

Decentralized Diffusion Policy Learning for Enhanced Exploration in Cooperative Multi-agent Reinforcement Learning

去中心化扩散策略学习用于增强合作多智能体强化学习中的探索

Yuyang Zhang, Haldun Balim, Na Li

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 本文提出去中心化扩散策略学习方法,通过扩散概率模型提升多智能体强化学习中的探索能力,解决了高维动作空间下的策略表达限制问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.07100 2026-05-11 stat.ML cs.LG 78%

TRACE: Transport Alignment Conformal Prediction via Diffusion and Flow Matching Models

TRACE: 通过扩散与流匹配模型进行传输对齐的置信域

Zhenhan Fang, Aixin Tan, Jian Huang

机构 * Department of Statistics and Actuarial Science University of Iowa(统计与精算科学系,爱荷华大学) Departments of Data Science and AI, and Applied Mathematics The Hong Kong Polytechnic University(数据科学与人工智能系、应用数学系,香港理工大学)

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 本文提出TRACE框架,通过扩散和流匹配模型中的传输对齐定义非符合性分数,实现多维输出的有效置信域构造,验证了其在复杂生成设置中的有效性。

Comments 22 pages, 5 figures and 5 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.07078 2026-05-11 cs.LG 78%

Test-Time Compositional Generalization in Diffusion Models via Concept Discovery

通过概念发现实现扩散模型中的测试时间组合泛化

Zekun Wang, Anant Gupta, Tianyi Zhu, Christopher J. MacLellan

机构 * Georgia Institute of Technology(佐治亚理工学院) University of Virginia(弗吉尼亚大学)

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 本文提出通过发现时间索引分数几何结构,实现扩散模型在测试时的组合生成,优于传统基线方法。

Comments 9 pages

详情

展开后加载摘要…

URL PDF HTML 收藏