arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

图像生成

图像生成、文生图、图像编辑、扩散模型和可控生成。

2026-07-21 至 2026-07-21 共收录 102 信号源:cs.CV, cs.GR, cs.MM

1. 扩散模型 102 篇

2602.04344 2026-07-21 cs.LG cs.AI 版本更新 89%

UnMaskFork: Test-Time Scaling for Masked Diffusion via Deterministic Action Branching

UnMaskFork:通过确定性动作分支实现Masked Diffusion的测试时扩展

Kou Misaki, Takuya Akiba

专题命中 扩散模型 :diffusion(title,title_cn)

AI总结 UnMaskFork通过确定性动作分支提升Masked Diffusion在测试时的扩展能力,优于现有方法并在复杂任务中表现优异。

Comments Accepted to ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.16636 2026-07-21 cs.CV 版本更新 83%

REGLUE Your Latents with Global and Local Semantics for Entangled Diffusion

利用全局和局部语义重新绑定潜在信息以进行纠缠扩散

Giorgos Petsangourakis, Christos Sgouropoulos, Bill Psomas, Theodoros Giannakopoulos, Giorgos Sfikas, Ioannis Kakogeorgiou

机构 * University of West Attica(西阿提卡大学) VRG, FEE, Czech Technical University in Prague(布拉格捷克技术大学)

专题命中 扩散模型 :diffusion(title,abstract);image synthesis(abstract);分类 cs.CV

AI总结 研究针对潜在扩散模型语义监督不足问题,提出REGLUE框架,联合建模VAE图像潜在信息、局部VFM语义和全局[CLS]令牌,用轻量级卷积语义压缩器聚合特征,经实验验证该框架能提升FID并加速收敛。

Comments ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.17657 2026-07-21 cs.CV 版本更新 83%

Improving Diffusion Generative Models via Truncated Karhunen--Loève Expansion

通过截断卡尔胡宁-勒夫展开改进扩散生成模型

Yumeng Ren, Yaofang Liu, Aitor Artola, Laurent Mertz, Raymond H. Chan, Jean-michel Morel

机构 * City University of Hong Kong(香港城市大学) Lingnan University of Hong Kong(香港理工大学)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 研究预训练扩散模型训练-采样不匹配问题,提出基于截断卡尔胡宁-勒夫展开的无训练采样策略,通过相应方程实现,无需修改网络架构,在多数据集上改进预训练模型,加快收敛并降低生成误差。

Comments 13 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.00126 2026-07-21 cs.RO 版本更新 82%

Compositional Diffusion with Guided Search for Long-Horizon Planning

用于长期规划的带引导搜索的组合扩散

Utkarsh A Mishra, David He, Yongxin Chen, Danfei Xu

机构 * Georgia Institute of Technology(佐治亚理工学院)

专题命中 扩散模型 :diffusion(title,abstract);image synthesis(abstract)

AI总结 研究针对组合生成模型在局部分布多模态时的模式平均问题,提出带引导搜索的组合扩散方法(CDGS),通过特定采样、过滤和重采样解决问题,在机器人操作任务上表现出色且跨领域通用。

Comments 38 pages, 18 figures, ICLR 2026 ORAL

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.17411 2026-07-21 cs.GR cs.LG 新提交 79%

Feature-Guided Diffusion for Non-Differentiable Inverse Rendering

用于不可微逆渲染的特征引导扩散

Andrei-Timotei Ardelean, Michael Fischer, Tim Weyrich, Tomáš Iser

机构 * Adobe Research(Adobe研究)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.GR

AI总结 研究逆渲染问题,提出完全黑箱框架FIDE,通过特征引导,利用视觉Transformer提取特征训练扩散模型,结合CMA进化策略优化,在多种逆问题上验证,显著提升收敛速度并逃离局部最小值。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.16656 2026-07-21 cs.CV 新提交 79%

DORS: Dynamic Attention Routing for Diffusion-based Object Removal in Dense Scenes

DORS:用于密集场景中基于扩散的目标移除的动态注意力路由

Haitong Tang, Haipeng Liu, Yang Wang

机构 * School of Computer Science and Information Engineering, Hefei University of Technology(合肥工业大学计算机与信息工程学院)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 针对密集场景目标移除中因语义干扰致移除不完整的问题,提出基于动态注意力路由机制的DORS框架,含实例过滤注意力和上下文引导路由组件,经实验验证其性能优于现有方法。

Comments 16 pages, 10 figures, to appear in ACM Multimedia 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.16300 2026-07-21 cs.CV 新提交 79%

FedDP-PALD: A Privacy-Preserving Federated Latent Diffusion Framework with Prototype Aggregation for Medical Data Synthesis

FedDP-PALD:一种用于医学数据合成的具有原型聚合的隐私保护联邦潜在扩散框架

Md. Sajeebul Islam Sk., Khan Enaet Hossain, Md. Mehedi Hasan Shawon

机构 * BRAC University(BRAC大学) York University(约克大学) University of Maryland(马里兰大学)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 针对医学数据合成中隐私保护及合成数据预测结构问题,提出FedDP-PALD框架,通过带掩码的门控多头注意力联合处理多模态数据,引入DP-PMA维持差分隐私,实验表明该框架能生成隐私合成表示,保持决策性能并抵抗成员推理。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.13247 2026-07-21 cs.CV 版本更新 79%

STARCaster: Spatio-Temporal AutoRegressive Video Diffusion for Identity- and View-Aware Talking Portraits

STARCaster:用于身份和视图感知的会说话肖像的时空自回归视频扩散

Foivos Paraperas Papantoniou, Stathis Galanakis, Rolandos Alexandros Potamias, Bernhard Kainz, Stefanos Zafeiriou

机构 * Imperial College London, UK(伦敦帝国理工学院) FAU Erlangen–Nürnberg, Germany(埃朗根-纽伦堡大学)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 研究提出STARCaster模型,通过重新思考参考和几何范式,采用组合方法及解耦学习,解决语音驱动肖像动画和动态视点控制问题,能有效泛化,超越先前方法。

Comments ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.19499 2026-07-21 cs.LG math.OC stat.ML 版本更新 79%

On the Interpolation Effect of Score Smoothing in Diffusion Models

在扩散模型中分数平滑的插值效应

Zhengdao Chen

机构 * Google Research(谷歌研究)

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 研究分数平滑如何通过去噪动态在一维子空间内插值训练数据,并通过理论和实验验证神经网络学习分数函数的自然效果。

Comments 35 pages, 14 figures. Code available at: https://github.com/google-research/diffusion-score-smoothing

Journal ref 14th International Conference on Learning Representations (ICLR 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.16685 2026-07-21 stat.ML cs.LG 新提交 78%

Semi-Supervised Conditional Diffusion via Label Augmentation

通过标签增强实现半监督条件扩散

Jin Su, Yuan Gao, Yong Zhou, Jian Huang

机构 * Department of Applied Mathematics, The Hong Kong Polytechnic University(应用数学系,香港理工大学) School of Statistics and Data Science, Nankai University(统计与数据科学学院,南开大学) School of Statistics, East China Normal University(统计学院,华东师范大学) Department of Data Science and AI, The Hong Kong Polytechnic University(数据科学与人工智能系,香港理工大学)

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 研究如何利用未标记数据改进条件扩散模型,提出标签增强条件扩散方法(LACD),通过给未标记数据赋平凡标签并联合去噪,在理论上保证可识别性和收敛速度,实验证明该方法在样本效率和生成性能上优于纯监督估计器。

Comments 34 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.17972 2026-07-21 cs.LG 新提交 78%

DiFA: Inference-Time Forward-Process Alignment for Diffusion Models

DiFA:扩散模型的推理时间前向过程对齐

Shigui Li, Delu Zeng

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 研究提出DiFA框架,将扩散模型推理时的数据预测细化转为顺序状态估计问题,受卡尔曼滤波启发建立前向对齐时间一致性,引入偏差引导机制,实验表明该方法在多个指标上显著提升CIFAR-10和ImageNet的生成保真度。

Comments Accepted to ICML 2026. 23 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.17884 2026-07-21 cs.AI 新提交 78%

ST-Veto: Spatio-Temporal Token Veto for Diffusion MLLMs via Taylor Prediction and Visual Grounding

ST-Veto:通过泰勒预测和视觉基础实现用于扩散多模态语言模型的时空令牌否决

Keuntae Kim, Beomseok Lee, Hyunwoo Kim, Yong Suk Choi

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 研究针对扩散多模态大语言模型推理不足问题,提出无需训练的ST-Veto方法,利用二阶泰勒预测和图像注意力质量否决不稳定及弱基础令牌,与更安全候选交换,在多基准测试中优于其他方法,提升准确率且无额外成本。

Comments ICML 2026 - main

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.17652 2026-07-21 cs.AI 新提交 78%

FlowBlock: Wavefront-Parallel Decoding for Self-Correcting Diffusion Language Models

FlowBlock:用于自校正扩散语言模型的波前并行解码

Bing Tian, Haikun Liu, Xiaocheng Zhong, Zhuohui Duan, Zhaokai Luo, Huayi Jin, Zhiyong Wang, Xiaofei Liao

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 研究针对块级扩散大语言模型块间解码串行问题,提出无需训练的\flowblock{}并行解码框架,基于门控波前解码和异构波前打包机制,相比串行模型提升了每秒令牌数、降低延迟并提高准确率,优于基于训练的基线。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.17257 2026-07-21 cs.RO cs.AI 新提交 78%

Asynchronous Multimodal Diffusion Policy Composition via Latency-Aware Guidance Fusion

通过延迟感知引导融合实现异步多模态扩散策略组合

Zihao He, Hongjie Fang, Shirun Tang, Cewu Lu, Haoshu Fang

机构 * Shanghai Jiao Tong University(上海交通大学) Noematrix(无矩阵) Shanghai Innovation Institute(上海创新研究院)

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 研究针对多模态扩散策略在模态差异下的融合问题,提出LAG - Fusion框架,通过延迟感知引导融合实现异步策略组合,推导参考帧重定位规则,在接触丰富操纵实验中提升了策略响应性和任务性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.17037 2026-07-21 cs.LG cs.CE 新提交 78%

Apeliotes: A Diffusion-Based Modeling Framework for km-scale Multi-Level Atmospheric Fields

Apeliotes:一种用于千米尺度多层大气场的基于扩散的建模框架

Evangelia Rafaela Frastali, Achyut Paudel, Maryam Golbazi, Frank Liu

机构 * Old Dominion University(奥多明尼昂大学)

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 针对高分辨率大气数据受限问题,Apeliotes框架基于全球再分析等数据构建,能提供千米尺度天气变量和多层大气场,经评估性能极具竞争力,预测垂直风廓线等有高精度表现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.16872 2026-07-21 cs.CL cs.AI cs.LG 新提交 78%

Trace-Based On-Policy Distillation for Masked Diffusion Language Models

基于轨迹的策略蒸馏用于掩码扩散语言模型

Haolin Ren, Ziyang Huang, Chenhao Yuan, Jun Zhao, Kang Liu

机构 * Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) University of Chinese Academy of Sciences(中国科学院大学)

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 研究针对扩散大语言模型推理训练后处理难的问题,提出基于轨迹的策略蒸馏(TOPD)框架,通过在目标模型去噪轨迹上监督,利用教师模型获取令牌分布并以反向KL目标更新,在数学推理基准上提升了模型准确率且减少计算量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.16674 2026-07-21 cs.LG 新提交 78%

CLDRoute: Conditional Latent Diffusion for Routability Map Generation in Physical Design

CLDRoute:用于物理设计中可布线性映射生成的条件潜扩散

Kiran Thorat, Nicole Meng, Caiwen Ding, Yingjie Lao, Zhijie Jerry Shi

机构 * University of Connecticut(康涅狄格大学) Tufts University(塔夫茨大学) University of Minnesota Twin Cities(明尼苏达大学双城分校)

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 研究针对物理设计中可布线性估计问题,提出CLDRoute框架,将其作为条件生成问题,用物理感知条件和特定任务潜变量建模,支持样本推理,在CircuitNet 2.0上取得较好实验结果,能生成预期结果及其不确定性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.16207 2026-07-21 cs.AI cs.CR 新提交 78%

JUMP: Single-Pass Membership Inference on Fine-Tuned Diffusion Language Models

JUMP:微调扩散语言模型的单通道成员推理

Yeachan Jun, Albert No

机构 * Yonsei University(延世大学)

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 研究微调离散扩散语言模型的成员推理攻击,提出JUMP单通道评分攻击,利用dLLMs任意顺序可解码性和并行可解码性,在六个MIMIR域上的微调LLaDA - 8B - Base上提升了平均ROC - AUC并改善低FPR检测,且减少查询次数。

Comments 24 pages. Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.16204 2026-07-21 cs.AI cs.LG 新提交 78%

Masked Diffusion Language Models are Strong and Steerable Text-Based World Models for Agentic RL

掩码扩散语言模型是用于智能体强化学习的强大且可控的基于文本的世界模型

Darshan Deshpande

机构 * Patronus AI(守护神人工智能公司)

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 研究强化学习中世界模型问题,对比自回归语言模型和掩码扩散语言模型,发现掩码扩散语言模型性能更优。引入GRPO训练框架,在三个OOD环境上零样本转移消融效果良好,还进行相关分析与评估,最后开源工作推动该领域研究。

Comments Dataset: https://huggingface.co/PatronusAI/world_model_corpus Training code: https://github.com/patronus-ai/mdlm_world_modeling

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.17522 2026-07-21 cs.LG cs.AI cs.IT math.IT math.PR 新提交 78%

One-step lowest-variance selection in a Gaussian random-field model motivated by masked diffusion: Total correlation and a square root collision threshold

由掩码扩散驱动的高斯随机场模型中的一步最低方差选择:总相关性和平方根碰撞阈值

Linjun Li

机构 * University of Pennsylvania(宾夕法尼亚大学)

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 受掩码离散扩散启发,研究高斯随机场模型单步选择,用局部相关非负分数场表示不确定性,通过距离相关高斯模型衡量所选位置相关性,建立两个互补结果,为理解相关因素对掩码离散扩散中基于置信度一步选择的影响提供基线。

Comments 27 pages; welcome comments

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.17396 2026-07-21 math.PR 新提交 78%

Diffusion approximation of a sequence of critical branching processes with dependent immigration

具有相关迁入的临界分支过程序列的扩散近似

Sadillo Sharipov

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 研究具有相关迁入的临界分支过程序列的扩散近似,在一般假设下,证明其缩放和归一化序列依分布收敛到扩散过程,扩展了魏和温尼基(1989)的泛函极限定理。

Comments 19 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.17087 2026-07-21 math.PR 新提交 78%

Transportation-cost inequalities for invariant measures of stochastic reaction-diffusion equations driven by space-time white noise

由时空白噪声驱动的随机反应扩散方程不变测度的运输成本不等式

Shijie Shang, Tusheng Zhang

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 研究由乘性时空白噪声驱动的随机反应扩散方程不变测度的运输成本不等式,通过获取随机卷积矩估计,建立随机控制方程解的利普希茨连续性,最终证明了不同度量下的运输成本不等式。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.16238 2026-07-21 cs.LG cs.AI physics.comp-ph physics.flu-dyn 新提交 78%

Diffusion-corrected Autoregressive Fourier Neural Operator for Droplet Evolution Prediction

用于液滴演化预测的扩散校正自回归傅里叶神经算子

Jinghao Cao, Minsung Kang, Hongyue Sun, Chi Zhou, Jihoon Chung, Xubo Yue, Sanchoy Das, Bo Shen

机构 * New Jersey Institute of Technology(新泽西理工学院) University of Georgia(佐治亚大学) University at Buffalo(纽约州立大学布法罗分校) Hanyang University(汉阳大学) Northeastern University(东北大学)

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 研究材料喷射中液滴演化预测难题,提出DiffARFNO两阶段框架,结合自回归傅里叶 - MIONet与DDIM校正器,经实验验证该方法显著优于现有模型,能为长期预测提供高保真结果。

Comments 11 figures, 4 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.16491 2026-07-21 physics.med-ph 新提交 78%

Continuous 3-D Latent Diffusion for Medical Generation and Reconstruction

用于医学生成与重建的连续3D潜扩散

Youness Mellak, Antoine De Paepe, Dimitris Visvikis, Alexandre Bousse

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 研究针对高分辨率三维医学扩散模型成本问题,提出连续3D潜扩散模型框架,核心是含特定解码器的紧凑自动编码器,经实验评估,该框架在计算效率、内存使用和重建效果间达平衡,能支持多种医学影像任务。

Comments 14 pages, 7 figures, 3 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.17837 2026-07-21 nucl-th 新提交 78%

Dissipative properties of a Fermi system within the diffusion approximation of kinetic theory

动力学理论扩散近似下费米系统的耗散性质

Sergiy V. Lukyanov

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 研究球形原子核模型费米系统在动力学理论扩散近似下的耗散性质,通过非线性扩散方程解析解表明分布函数趋近平衡费米分布,得出不同弛豫时间,解释了弛豫时间差异。

Comments 7 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.17871 2026-07-21 cond-mat.stat-mech math-ph math.MP math.PR quant-ph 新提交 78%

On the use of the Belopol'skaya-Daletskii representation of a diffusion on a Riemann manifold to construct path integrals

关于在黎曼流形上使用扩散的别洛波尔斯卡娅 - 达列茨基表示来构建路径积分

Paolo Muratore-Ginanneschi

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 研究利用黎曼流形上随机微分方程的别洛波尔斯卡娅 - 达列茨基公式,通过指数映射描述扩散增量,构建扩散路径测度有限维近似的等变表示。

Comments 20 pages, no figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.17976 2026-07-21 astro-ph.SR 新提交 78%

Evidence for elemental diffusion in the eclipsing binary star AI Phoenicis

食双星AI Phoenicis中元素扩散的证据

Pierre F. L. Maxted, Nicholas Storm, Andreas J. Korn, Marília Carlos, Matthew R. Gent, Sviatoslav B. Borisov, Paula Jofré, Maria Bergemann, Hans-Günter Ludwig, Nicola J. Miller

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 研究食双星AI Phoenicis,通过获取其光谱测量铁和镁丰度,与M67星团恒星比较,发现F7V恒星有元素扩散特征,可用于测试含元素扩散和混合的单星模型。

Comments Accepted for publication in MNRAS. 9 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.15893 2026-07-21 cs.CL cs.AI cs.LG 版本更新 78%

Induction in Both Directions: A Mechanistic Analysis of In-Context Learning in Masked Diffusion Language Models

双向归纳:掩码扩散语言模型中上下文学习的机制分析

Andy Catruna, Emilian Radoi

机构 * National University of Science and Technology POLITEHNICA Bucharest(布加勒斯特理工大学国家科技大学)

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 研究扩散语言模型(DLM)中归纳机制,对比仅注意力AR模型和吸收掩码DLM。发现DLM学习双向归纳电路,方向对称,掩码两侧可见时归纳更强,还证明其能计算掩码令牌比例作隐式时间步长。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.25781 2026-07-21 math.AP 版本更新 78%

Interfaces and non-uniqueness in a cross-diffusion system with independent drifts

具有独立漂移的交叉扩散系统中的界面与非唯一性

Charles Elbar, Guy Parker

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 研究一维交叉扩散系统中两个种群在独立外部势作用下,从单界面分离初值出发,发现解依赖于所选解的概念,粘性消失解产生重叠而分离弱解也存在,导致柯西问题在弱解类中不适定。

Comments Added: References and Appendix. 26 Pages, 1 figure

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.06547 2026-07-21 cs.LG cs.AI 版本更新 78%

FAIR-Calib: Frontier-Aware Instability-Reweighted Calibration for Post-Training Quantization of Diffusion Large Language Models

FAIR-Calib:面向扩散大语言模型训练后量化的前沿感知不稳定重加权校准

Haoyu Huang, Linlin Yang, Sheng Xu, Boyu Liu, Guodong Guo, Zhongqian Fu, Hang Zhou, Baochang Zhang

机构 * FAIR

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 针对扩散大语言模型训练后量化中前沿决策易翻转并永久锁定放大的问题,提出两阶段PTQ框架FAIR-Calib,通过前沿命中与掩码阶段可靠性估计位置先验,并利用重加权隐状态MSE校准优先保护脆弱前沿状态,理论证明其作为输出KL散度代理,实验显著优于基线。

Comments Accepted as a poster at the 43rd International Conference on Machine Learning (ICML 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏