arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

图像生成

图像生成、文生图、图像编辑、扩散模型和可控生成。

2026-06-03 至 2026-06-03 共收录 370 信号源:cs.CV, cs.GR, cs.MM

1. 扩散模型 370 篇

2606.02090 2026-06-03 cs.CV 88%

FocusDiT: Masking Queries in Diffusion Transformers for Fine-grained Image Generation

FocusDiT: 扩散Transformer中的查询掩码用于细粒度图像生成

Xueji Fang, Liyuan Ma, Jianhao Zeng, Jinjin Cao, Mingyuan Zhou, Guo-Jun Qi

机构 * Zhejiang University(浙江大学) Westlake University(西湖大学)

专题命中 扩散模型 :diffusion(title,abstract);image generation(title);text-to-image(abstract);分类 cs.CV

AI总结 提出FocusDiT方法,通过掩码关键查询令牌仅输入FFN层,增强细粒度视觉生成,实验验证其有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.02884 2026-06-03 cs.LG cs.AI 85%

Are we really tilting? The mechanics of reward guidance in flow and diffusion models

我们真的在倾斜吗?流模型和扩散模型中奖励引导的机制

Sanjit Dandapanthula, Nicholas M. Boffi

机构 * University of California, Berkeley(加州大学伯克利分校)

专题命中 扩散模型 :diffusion(title,abstract);image generation(abstract);text-to-image(abstract)

AI总结 本文通过高斯混合模型和二次奖励的闭式分析,揭示了奖励引导扩散中奖励黑客现象源于Doob h函数的有限粒子插件估计,并提出了无额外计算的闭式奖励阻尼调度来纠正模式内偏差。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.22443 2026-06-03 cs.LG cs.CV stat.CO stat.ML 84%

Weak Diffusion Priors Can Still Achieve Strong Inverse-Problem Performance

弱扩散先验仍能实现强逆问题性能

Jing Jia, Wei Yuan, Sifan Liu, Liyue Shen, Guanyang Wang

机构 * University of California, Berkeley(加州大学伯克利分校) Stanford University(斯坦福大学)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 研究弱扩散先验在逆问题中的鲁棒性,通过贝叶斯一致性和局部相关性分析揭示其在信息丰富测量下仍有效的原因。

Comments 37 pages, ICML 2026 spotlight. Code: https://github.com/jjia131/weak-diffusion-priors-inverse-problem, Project Page: https://jjia131.github.io/weak-diffusion-priors-inverse-problem/

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.03111 2026-06-03 cs.CV 83%

Inverting the Generation Process of Denoising Diffusion Implicit Models: Empirical Evaluation and a Novel Method

反转去噪扩散隐式模型的生成过程:实证评估与新方法

Yan Zeng, Masanori Suganuma, Takayuki Okatani

机构 * Graduate School of Information Sciences, Tohoku University(东北大学信息科学研究生院) RIKEN Center for AIP(理化学研究所AIP中心)

专题命中 扩散模型 :diffusion(title,abstract);image generation(abstract);分类 cs.CV

AI总结 提出一种结合梯度下降和不动点方法的混合方法,用于从生成图像中恢复DDIM的初始噪声图,显著提高了预测精度和重建质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.05312 2026-06-03 cs.CV 83%

An Improved Method for Personalizing Diffusion Models

一种改进的扩散模型个性化方法

Yan Zeng, Masanori Suganuma, Takayuki Okatani

机构 * Graduate School of Information Sciences, Tohoku University(东北大学信息科学研究生院) RIKEN Center for AIP(理化学研究所AIP研究中心)

专题命中 扩散模型 :diffusion(title,abstract);image generation(abstract);分类 cs.CV

AI总结 提出一种在整合新信息时保留模型原有知识的扩散模型个性化方法,相比Dreambooth和文本反转训练时间更短且效果更优。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.03971 2026-06-03 cs.CV 79%

Video-Mirai: Autoregressive Video Diffusion Models Need Foresight

Video-Mirai: 自回归视频扩散模型需要远见

Yonghao Yu, Lang Huang, Runyi Li, Zerun Wang, Toshihiko Yamasaki

机构 * The University of Tokyo(东京大学) National Institute of Informatics(信息处理研究所) Peking University(北京大学)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 提出Video-Mirai训练方法,通过冻结的远见编码器从完整生成序列中提取未来信息并蒸馏到因果状态,在不改变推理过程的情况下弥合表示层面的规划差距,提升长视频生成的一致性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.03915 2026-06-03 cs.CV 79%

PatchScene: Patch-based Voxel Diffusion for Large-Scale Scene Completion

PatchScene:基于体素块扩散的大规模场景补全

Qingdong Xu, Jiajun Zhu, Shilin Zhu, Xinjing He, Chao Lu, Huanran Wang, Jiyao Zhang

机构 * MEGVII Technology(MEGVII技术有限公司) Qianli Technology(千利技术) Peking University(北京大学) Northeastern University, China(中国东北大学) Northwest Polytechnical University, Xi’an(西北工业大学西安校区)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 提出PatchScene,一种基于体素块扩散的框架,通过局部3D区域细粒度生成、置信度引导的时空融合和环形流扩散策略,实现大规模LiDAR场景补全,在SemanticKITTI上达到最优性能并展现强泛化能力。

Comments 10 pages, 5 figures, 5 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.03903 2026-06-03 cs.CV 79%

An Attention-Based Denoising Model for Diffusion Weighted Imaging

一种基于注意力的扩散加权成像去噪模型

Prithviraj Verma, Pawan Kumar, Chandan Deshani, Prasun Chandra Tripathi

机构 * Institute of Infrastructure Technology Research and Management (IITRAM)(基础设施技术研究与管理研究所) University of Sheffield(谢菲尔德大学)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 提出一种结合Swin Transformer窗口注意力和多维门控精化的噪声感知注意力驱动去噪框架,用于解决DWI中信号依赖的Rician噪声问题,在1%至15%噪声水平下实现平均PSNR 33.69 dB和SSIM 0.8539。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.09708 2026-06-03 cs.LG cs.AI cs.CV cs.NA math.NA 79%

Physics-informed diffusion models in spectral space

谱空间中的物理信息扩散模型

Davide Gallon, Philippe von Wurstemberger, Patrick Cheridito, Arnulf Jentzen

机构 * ETH Zürich(苏黎世联邦理工学院)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 提出物理信息谱扩散(PISD)方法,结合生成式潜扩散模型与物理信息机器学习,在谱表示潜空间中对偏微分方程参数和解进行扩散建模,通过扩散后验采样施加物理约束和测量条件,在泊松、亥姆霍兹和不可压缩纳维-斯托克斯方程上展现出比现有扩散求解器更高的精度和计算效率。

Comments 18 pages, 10 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.09105 2026-06-03 cs.CV 79%

Hybrid Autoregressive-Diffusion Model for Real-Time Sign Language Production

混合自回归-扩散模型用于实时手语生成

Maoxiao Ye, Xinfeng Ye, Mano Manoharan

机构 * University of Auckland(奥克兰大学)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 提出HybridSign混合自回归-扩散模型,结合因果帧生成与流式扩散精炼,实现低延迟高质量手语生成,在PHOENIX14T和How2Sign上取得最佳质量-效率权衡。

Comments Accepted at ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
1202.5414 2026-06-03 math.AP cs.CV cs.NA math.NA math.RT 79%

Left-Invariant Diffusion on the Motion Group in terms of the Irreducible Representations of SO(3)

基于SO(3)不可约表示的运动群上的左不变扩散

Marco Reisert, Henrik Skibbe

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 利用SO(3)不可约表示将SE(3)上的左不变向量场表示为平移坐标的微分形式和旋转的代数形式,避免了对SO(3)或S2的显式离散化,并应用于扩散加权磁共振成像和目标检测。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.03919 2026-06-03 cs.SI cs.CY cs.DL cs.LG physics.soc-ph 79%

Forecasting Conceptual Diffusion in Science: The Case of Quantum Computing

预测科学中的概念扩散:以量子计算为例

Thomas Maillart, Thibaut Chataing, David Dosu, Paul Bagourd, Julian Jang-Jaccard, Alain Mermoud

机构 * Geneva School of Economics and Management, University of Geneva(日内瓦经济管理学院,日内瓦大学) Faculty of Medicine, University of Geneva(日内瓦大学医学院) Open Quantum Institute, CERN(开放量子研究所,欧洲核子研究中心) armasuisse Science + Technology(armasuisse 科学与技术)

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 通过构建时间分辨的概念共现网络并训练LightGBM模型,研究量子计算领域概念的内生巩固与外生扩散的可预测性,发现外生扩散和熵具有强可预测性(R²高达0.78),而内生巩固在量子计算中几乎不可预测,但在神经植入领域显著上升(R²=0.83),表明概念扩散受语义和引用环境中的稳定结构规律支配。

Comments 19 pages, 5 figures, 6 tables. Code and manuscript sources: https://github.com/wazaahhh/breakthroughs-diffusion . An earlier version was presented at the Global Tech Mining Conference (GTM) 2026 (submission #117)

详情

展开后加载摘要…

URL PDF HTML 收藏
1004.1334 2026-06-03 math.NA cs.NA 79%

Perturbed asymptotic expansions for interior-layer solutions of a semilinear reaction-diffusion problem with small diffusion

小扩散半线性反应扩散问题内层解的摄动渐近展开

Natalia Kopteva, Martin Stynes

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 针对二阶导数乘以小参数ε²的半线性反应扩散两点边值问题,构造了具有内层解的渐近展开,并建立了该展开的摄动性质,用于获得离散子解和超解以证明数值方法的收敛性。

Comments Changes from original submission: Lemma 2.5 is new --- it is needed in reference [6]. Misprint corrected in equation (2.1b)

Journal ref N.Kopteva & M.Stynes, Approximation of interior-layer solutions in a singularly perturbed semilinear reaction-diffusion problem, Numer. Math. 119 (2011), no.4, pp.787-810

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.03936 2026-06-03 cs.LG physics.geo-ph 78%

Correcting Neural Operator Spectral Bias via Diffusion Posterior Sampling with Sparse Observations

通过稀疏观测的扩散后验采样校正神经算子谱偏差

Niccolò Perrone, Fanny Lehmann, Stefania Fresca, Filippo Gatti

机构 * Université Paris-Saclay, CentraleSupélec, CNRS, ENS Paris-Saclay(巴黎-萨克雷大学,中央理工学院,国家科学研究中心,巴黎-萨克雷理工学院) Laboratoire de Mécanique Paris-Saclay UMR 9026(巴黎-萨克雷力学实验室 UMR 9026) Politecnico di Milano(米兰理工大学) ETH AI Center(苏黎世联邦理工学院人工智能中心) Department of Mechanical Engineering University of Washington(华盛顿大学机械工程系)

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 提出FreqNO-DPS方法,利用扩散后验采样结合谱形状引导分数,校正神经算子在稀疏观测下的高频衰减谱偏差,实现近零谱偏差。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.03924 2026-06-03 cs.CL 78%

Knowledge Editing in Masked Diffusion Language Models

掩码扩散语言模型中的知识编辑

Haewon Park, Yohan Jo

机构 * Graduate School of Data Science, Seoul National University(首尔国立大学数据科学研究生院)

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 研究将定位-编辑方法从自回归模型迁移到掩码扩散模型,发现编辑位置可迁移但多词编辑性能下降,并提出优化中间状态的简单修正方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.03512 2026-06-03 cs.RO cs.AI 78%

SPADE: Sketch-guided Path Planning Augmented with Diffusion Experts

SPADE: 草图引导的路径规划增强扩散专家

Charbel Abi Hana, Tatiana Ghantous, Mikael Khalil, Anthony Rizk

机构 * IDEALworks GmbH IMT Atlantique IDEALworks GmbH & Saint Joseph University of Beirut(IDEALworks GmbH及贝鲁特圣约瑟夫大学)

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 提出一种结合扩散增强的框架,通过改进的标注工具和训练策略,在保持实时性的同时提升路径规划的泛化能力和鲁棒性,显著降低姿态误差和FID。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.03347 2026-06-03 cs.LG cs.AI stat.ML 78%

AugMask: Training Diffusion Models on Incomplete Tabular Data via Stochastic Augmentation and Masking

AugMask: 通过随机增强和掩码在不完整表格数据上训练扩散模型

Jungkyu Kim, Taeyoung Park, Kibok Lee

机构 * KAIST(韩国科学技术院)

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 提出AugMask训练框架,通过条件随机增强和仅对观测坐标去噪,使标准扩散模型适应缺失表格数据,并连接Rao-Blackwellized目标实现方差加权惩罚,优于专门处理缺失的基线。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.03322 2026-06-03 cs.LG cs.AI 78%

Multi-Modal Graph Neural Network with Transformer-Guided Adaptive Diffusion for Preclinical Alzheimer Classification

多模态图神经网络与Transformer引导的自适应扩散用于临床前阿尔茨海默病分类

Jaeyoon Sim, Minjae Lee, Guorong Wu, Won Hwa Kim

机构 * Pohang University of Science and Technology(浦项科学技术大学) University of North Carolina at Chapel Hill(北卡罗来纳大学教堂山分校)

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 提出一种结合扩散核与多头注意力的图神经网络框架,通过Transformer引导自适应扩散过程,有效融合多模态特征,提升临床前阿尔茨海默病分类性能并识别关键脑区。

Comments 10 pages, Accepted to MICCAI 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.03074 2026-06-03 cs.LG cs.SY eess.SY 78%

RMPrior: Bridging Propagation Priors and Diffusion Refinement for Efficient Radio Map Construction

RMPrior: 融合传播先验与扩散精炼的高效无线电地图构建

Zixuan Guo, Xiucheng Wang, Nan Cheng

机构 * Zhejiang University(浙江大学)

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 提出一种中起点采样策略,通过将传播先验扰动至中间扩散时间步,仅执行剩余反向步骤,在加速2.01倍的同时提升重建质量,并理论分析了初始化差距的上界及截断条件。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.02607 2026-06-03 cs.LG cs.AI cs.CR 78%

Geometry-Aware Tabular Diffusion

几何感知表格扩散

David Turtora Zagardo

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 提出几何感知表格扩散(GATD),通过向扩散去噪器注入列值差异的成对角度和长度作为输入和辅助目标,以显式建模列间关系,在10个数据集上以更少参数取得SOTA性能。

Comments Accepted to the ICML 2026 main track. 24 pages, 10 figures, 22 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.03845 2026-06-03 math.NA cs.NA 78%

Embedded Trefftz DG method for reaction-diffusion problems on anisotropic meshes

各向异性网格上反应扩散问题的嵌入式Trefftz DG方法

Sergio Gómez, Chiara Perinati, Paul Stocker, Igor Voulis

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 提出一种通过嵌入张量积DG空间实现松弛局部Trefftz条件的嵌入式Trefftz间断Galerkin方法,用于各向异性网格上的反应扩散问题,在保持高阶离散逼近性质的同时缩减全局系统,并证明稳定性和拟最优性,导出各向异性先验误差估计。

Comments 22 pages, 6 figures, 1 table

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.02587 2026-06-03 math.NA cs.NA 78%

Numerical simulations for two-dimensional reaction-diffusion problems with formation of multiple dead zones

二维反应扩散问题中多个死区形成的数值模拟

Piotr Skrzypacz, Boris Golman, Jan Valdman

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 针对二维化学反应器中的等温反应扩散问题,采用集总有限元法和时间推进法数值求解稳态非线性扩散反应方程,研究反应级数和Thiele模量对浓度分布及死区大小的影响,并证明特定反应器几何形状下可形成多个死区。

Comments 14 pages, 5 figures, 2 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.03572 2026-06-03 physics.geo-ph 78%

GeoVolDiff: Taming 3D Geological Volumes with Latent Diffusion

GeoVolDiff: 用潜扩散驯服3D地质体

Qi Pang, Hongling Chen, Jinghuai Gao

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 提出GeoVolDiff生成框架,通过物理模拟构建训练语料、训练潜扩散模型捕获3D地质结构分布、合成多样结构体,以缓解地球物理数据稀缺问题,并在地震阻抗反演任务中验证了合成数据的有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.03984 2026-06-03 astro-ph.HE 78%

Diocotron Modes in Pulsar Magnetospheres: Charge Diffusion and Implications for Radio Emission Variability

脉冲星磁层中的Diocotron模式:电荷扩散及其对射电辐射变化性的影响

Matthew Goodbred, Anatoly Spitkovsky

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 通过三维粒子网格模拟研究脉冲星磁层中非轴对称的diocotron不稳定性,发现其产生稳定的m=1模式,驱动跨场扩散并调制极盖电势降和发射束角,与脉冲星消零、周期幅度调制和漂移子脉冲等变化性相关。

Comments 17 pages, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.02091 2026-06-03 cs.CL 78%

DFlare: Scaling Up Draft Capacity for Block Diffusion Speculative Decoding

DFlare: 扩展块扩散推测解码的草稿容量

Jiebin Zhang, Zhenghan Yu, Song Liu, Eugene J. Yu, Zheng Li, Dawei Zhu, Jiangshan Duo, Weimin Xiong, Yifan Song, Guanghua Yu, Jianchen Zhu, Sujian Li

机构 * School of Computer Science, Peking University(北京大学计算机科学系) Tencent(腾讯)

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 提出DFlare方法,通过轻量级逐层融合机制扩展草稿模型容量,在多个基准上实现平均5.52倍加速。

Comments 12 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.00567 2026-06-03 cs.AR cs.PF 78%

Activation Concentration: Characterizing Column-Level Output Sparsity Across Diffusion Model Architectures

正则激活集中度:跨扩散模型架构的列级输出稀疏性特征分析

Dazhi Yang, Shafayat Mowla Anik, Byeong Kil Lee, Jeeho Ryoo

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 本文首次系统表征了七种扩散工作负载的列级稀疏性,发现元素级稀疏性高估了硬件可利用稀疏性最多78个百分点,并揭示了UNet+transformer、纯transformer和运动/舞蹈变换器三类工作负载的稀疏性差异及对加速器性能的影响。

Comments 12 pages, 12 figures. Submitted to IEEE IISWC 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.00366 2026-06-03 cs.LG math.OC 78%

GLENS: Global Search via Learning from Solver Iterates with Diffusion Models

GLENS: 通过扩散模型从求解器迭代中学习进行全局搜索

Anjian Li, Bartolomeo Stellato, Ryne Beeson

机构 * Department of Electrical and Computer Engineering, Princeton University(电气工程与计算机科学系,普林斯顿大学) Department of Operations Research and Financial Engineering, Princeton University(运筹学与金融工程系,普林斯顿大学) Department of Mechanical and Aerospace Engineering, Princeton University(机械与航空航天工程系,普林斯顿大学)

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 提出GLENS方法,利用扩散模型学习求解器迭代过程中的局部几何结构,生成高质量且多样化的初始猜测,加速多模态非凸优化问题的全局搜索。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.19805 2026-06-03 cs.LG cs.AI stat.ML 78%

Latent Laplace Diffusion for Irregular Multivariate Time Series

潜在拉普拉斯扩散用于不规则多元时间序列

Zinuo You, Jin Zheng, John Cartlidge

机构 * University of Cambridge(剑桥大学)

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 提出潜在拉普拉斯扩散(LLapDiff)生成框架,通过低维潜在轨迹和拉普拉斯域参数化实现不规则时间序列的长时预测与缺失值插补。

Comments Accepted as a Spotlight at ICML 2026. The Version of Record will appear in Proceedings of Machine Learning Research (PMLR). 27 pages, 5 figures. Code: https://github.com/pixelhero98/LLapDiffusion

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.19262 2026-06-03 cs.LG cs.CR 78%

Backdooring Masked Diffusion Language Models

掩码扩散语言模型的后门攻击

Daniel Yiming Cao, Chengzhong Wang, Sheng-Yen Chou, Chengyu Huang, Pin-Yu Chen, Shengwei An

机构 * Cornell University(康奈尔大学) Virginia Tech(弗吉尼亚理工学院) IBM Research(IBM研究院)

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 提出SHADOWMASK后门攻击方法,通过修改掩码扩散语言模型的前向破坏过程,实现高成功率攻击并保持模型清洁性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.17866 2026-06-03 cs.LG 78%

DAD4TS: Data-Augmentation-Oriented Diffusion Model for Time-Series Forecasting with Small-Scale Data

DAD4TS:面向小规模数据的时间序列预测的数据增强扩散模型

Masahiro Suzuki, Bohui Xia, Hiroto Yamamoto, Masanori Miyahara

机构 * Sony Group Corporation(索尼集团公司)

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 针对小规模时间序列数据预测中数据增强生成有意义数据困难的问题,提出基于扩散模型和强化学习的DAD4TS方法,通过几何空间投影训练扩散模型,在多个数据集和模型上验证了有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏