arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

图像生成

图像生成、文生图、图像编辑、扩散模型和可控生成。

2026-06-05 至 2026-06-05 共收录 62 信号源:cs.CV, cs.GR, cs.MM

1. 扩散模型 62 篇

2606.06120 2026-06-05 cs.CV 83%

Diff-CA: Separating Common and Salient Factors with Diffusion Models

Diff-CA: 使用扩散模型分离共同因素和显著因素

Michaël Soumm, Alexandre Fournier Montgieux, Yunlong He, Pietro Gori, Alasdair Newson

机构 * INRIA at Univ. Grenoble Alpes(法国格勒诺布尔大学INRIA实验室) CEA List, Palaiseau(法国CEA列表,帕莱索) Télécom Paris, Institut Polytechnique de Paris(巴黎电信学院,巴黎理工学院)

专题命中 扩散模型 :diffusion(title,abstract);image generation(abstract);分类 cs.CV

AI总结 提出一种基于扩散模型的条件框架,通过弱监督学习将图像条件分解为共同因素和显著因素,实现对比分析中的因素分离,并保持高保真图像生成质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.06052 2026-06-05 cs.CV 83%

Attention, May I Have Your Decision? Localizing Generative Choices in Diffusion Models

注意,我可以请你决定吗?定位扩散模型中的生成选择

Katarzyna Zaleska, Łukasz Popek, Monika Wysoczańska, Kamil Deja

机构 * Warsaw University of Technology(华沙技术大学) valeo.ai IDEAS Research Institute(IDEAS研究所)

专题命中 扩散模型 :diffusion(title,abstract);text-to-image(abstract);分类 cs.CV

AI总结 本文提出基于探测的定位技术,发现自注意力层是解决模糊概念的关键,并设计ICM方法通过干预少量自注意力层实现精确去偏。

Comments CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.07583 2026-06-05 cs.CV cs.AI 83%

Mobile Video Diffusion

移动视频扩散

Haitam Ben Yahia, Denis Korzhenkov, Ioannis Lelekas, Amir Ghodrati, Amirhossein Habibian

机构 * Qualcomm AI Research(高通人工智能研究)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 本文提出了一种移动优化的视频扩散模型MobileVD,通过降低帧分辨率、引入多尺度时间表示和两种新的剪枝方案,显著降低了内存和计算成本,同时在移动设备上实现了高效的视频生成。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.21338 2026-06-05 cs.LG 82%

Masks Can Be Distracting: On Context Comprehension in Diffusion Language Models

掩码可能具有干扰性:关于扩散语言模型中的上下文理解

Julianna Piskorz, Cristina Pinneri, Alvaro Correia, Motasem Alfarra, Risheek Garrepalli, Christos Louizos

机构 * University of Cambridge(剑桥大学)

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 本文研究了扩散语言模型中掩码对上下文理解的影响,发现掩码会干扰模型对相关信息的处理,提出一种掩码无关的损失函数以提高模型的鲁棒性。

Comments Published at the Forty-Third International Conference on Machine Learning (ICML 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.06066 2026-06-05 cs.CV cs.GR 81%

FontFusion: Enhancing Generative Text in Diffusion Models with Typographic Conditioning

FontFusion: 通过排版条件增强扩散模型中的生成文本

Marian Lupascu, Nipun Jindal, Ionut Mironica, Zhaowen Wang

机构 * Adobe Research(Adobe研究院) Department of Computer Science, University of Bucharest(布加勒斯特大学计算机科学系)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV、cs.GR

AI总结 提出FontFusion框架,通过层次化token表示、位置感知嵌入和多级token丢弃策略,在扩散Transformer中实现精确字体控制与文本可读性的平衡,显著提升排版保真度。

Comments 12 pages, 8 figures, accepted at ICANN 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.05328 2026-06-05 cs.GR cs.AI cs.CV cs.LG 81%

The Invisible Hand of Physics: When Video Diffusion Models Know More Than They Show

物理的隐形之手:当视频扩散模型知道的比它们展示的更多

Parsa Esmati, Somjit Nath, Katja Hofmann, Derek Nowrouzezahrai, Samira Ebrahimi Kahou, Majid Mirmehdi

机构 * University of Bristol(布里斯托大学) McGill University(麦吉尔大学) Mila–Quebec AI Institute(魁北克AI研究院) Microsoft Research(微软研究院) University of Calgary(卡尔加里大学)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV、cs.GR

AI总结 通过逆向扩散过程探测视频扩散模型的潜在轨迹,发现物理合理性可以从扩散变换器状态中线性解码,准确率达81.27%,表明物理有意义的表示是生成式去噪的副产品。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.06477 2026-06-05 cs.CV 79%

Complexity-Balanced Diffusion Splitting

复杂度平衡的扩散分裂

Noam Issachar, Dani Lischinski, Raanan Fattal

机构 * The Hebrew University of Jerusalem(耶路撒冷希伯来大学)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 提出复杂度平衡分裂(CBS)框架,通过将扩散时间线划分为等近似负担的段并分配更多容量给困难区域,在多个架构和数据集上提升生成质量而不增加推理成本。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.06060 2026-06-05 cs.CV 79%

ReCache: Learning Budget-Aware Caching Schedules for Diffusion Models via REINFORCE

ReCache: 通过REINFORCE学习扩散模型的预算感知缓存调度

Mishan Aliev, Eva Neudachina, Ilya Bykov, Aleksandr Oganov, Kirill Struminsky, Aibek Alanov, Denis Rakitin

机构 * HSE University(俄罗斯高等经济学院) Yandex Research(Yandex研究院)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 提出ReCache,利用策略梯度学习在给定计算预算下最大化生成质量的去噪步骤重计算调度,无需标注数据且兼容多种缓存机制。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.03998 2026-06-05 eess.SP cs.CV 79%

TGSD: Topology-Guided State-Space Diffusion Framework for EEG Spatial Super-Resolution

TGSD: 拓扑引导的状态空间扩散用于EEG空间超分辨率

Zijian Kang, Weiming Zeng, Yueyang Li, Shengyu Gong, Hongjie Yan, Wai Ting Siok, Nizhuan Wang

机构 * Lab of Digital Image and Intelligent Computation, Shanghai Maritime University(数字图像与智能计算实验室,上海海洋大学) Department of Language Science and Technology, The Hong Kong Polytechnic University(语言科学与技术系,香港理工大学) Affiliated Lianyungang Hospital of Xuzhou Medical University(徐州医学院连云港医院)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 提出TGSD框架,通过拓扑引导的状态空间扩散模型,利用分层空间先验编码器和条件状态空间扩散重建器,从低密度EEG恢复高密度信号,在SEED和PhysioNet MM/I数据集上优于基线方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.19839 2026-06-05 cs.CV 79%

When Preference Labels Fall Short: Aligning Diffusion Models from Real Data

当偏好标签不足时:从真实数据对齐扩散模型

Weiyan Chen, Weijian Deng, Yao Xiao, Weijie Tu, ZiYi Dong, Ibrahim Radwan, Liang Lin, Pengxu Wei

机构 * University of Science and Technology of China(中国科学技术大学)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 本文研究了真实数据作为偏好对齐的替代监督源,通过数据驱动的方法,利用真实图像作为参考点,对比生成或扰动样本以构建偏好信号,无需手动标注的偏好对,实验证明真实数据监督能有效对齐扩散模型并达到与现有偏好方法相当的性能。

Comments ICML 2026 Camera Ready; Project Page: https://cwyxx.github.io/RealAlign

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.12336 2026-06-05 cs.CV 79%

Unsupervised Monocular 3D Keypoint Discovery from Multi-View Diffusion Priors

无监督单目多视图扩散先验的3D关键点发现

Subin Jeon, In Cho, Junyoung Hong, Woong Oh Cho, Seon Joo Kim

机构 * Yonsei University(延世大学)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 本文提出KeyDiff3D框架,通过单张图像准确预测3D关键点,利用预训练的多视图扩散模型中的几何先验,将隐式3D先验转化为显式3D特征体,实现关键点估计和3D对象操控。

Comments Accepted at CVPR 2026. Project page: https://subin6.github.io/keydiff3d-project/

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.06474 2026-06-05 cs.CL cs.AI cs.LG 78%

Self-Augmenting Retrieval for Diffusion Language Models

扩散语言模型的自增强检索

Paul Jünger, Justin Lovelace, Linxi Zhao, Dongyoung Go, Kilian Q. Weinberger

机构 * University of California, Berkeley(加州大学伯克利分校) Google Research(谷歌研究院)

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 提出SARDI框架,利用扩散语言模型去噪过程中丢弃的低置信度标记作为前瞻信号指导检索,无需训练且与检索器无关,在多跳问答基准上以高达8倍吞吐量超越现有方法。

Comments ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.06321 2026-06-05 nucl-th 78%

Equilibrium state of a Fermi system in the diffusion approximation of kinetic theory

费米系统在动力学理论扩散近似下的平衡态

Sergiy V. Lukyanov

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 通过保持粒子数守恒,从动量空间到能量空间的扩散方程变换,推导出具有一致动力学系数的能量空间一维扩散方程,并证明平衡温度在动量空间和能量空间定义等价,同时发现动力学系数的能量依赖性导致平衡温度依赖于能量并修正分布函数。

Comments 24 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.06283 2026-06-05 hep-ph hep-th nucl-th 78%

Diffusion of multiple conserved charges from entropy production

从熵产生看多重守恒荷的扩散

Samapan Bhadury, Arpan Das, Sandeep Chatterjee, Hiranmaya Mishra

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 利用Chapman-Enskog方法从动理学理论推导了包含重子数、电荷和奇异数多重守恒荷的耗散相对论流体力学方程,并得到了扩散矩阵元及其温度化学势依赖性。

Comments 21 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.06273 2026-06-05 cs.IT cs.AI math.IT 78%

Adapting Diffusion Language Models for Lossless Pixel-Level Image Transmission

适应扩散语言模型用于无损像素级图像传输

Tianqi Ren, Rongpeng Li, Xianfu Chen, Yingyu Li, Zhifeng Zhao

机构 * College of Information Science and Electronic Engineering, Zhejiang University(浙江大学信息科学与电子工程学院) Shenzhen CyberAray Network Technology Co., Ltd(深圳CyberAray网络技术有限公司) School of Mechanical Engineering and Electronic Information, China University of Geosciences(中国地质大学(武汉)机械与电子信息学院) Zhejiang Lab(浙江实验室)

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 提出基于离散扩散模型的分离源信道编码框架DDM-SSCC,通过双向注意力下的同步逆向算术编码实现无损像素级图像传输,并引入Halton引导去噪顺序、掩码率感知余弦调度和轻量温度校准模块提升性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.06236 2026-06-05 cs.LG 78%

Tracing the Oracle: Improving Diffusion Timestep Scheduling for 3D CT Reconstruction

追踪神谕:改进扩散时间步调度用于3D CT重建

Yujia Wu, Zhaoqiang Liu

机构 * School of Computer Science and Engineering, University of Electronic Science and Technology of China(电子科技大学计算机科学与工程学院)

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 针对3D CT重建中扩散模型推理计算开销大且均匀时间步调度引入大截断误差的问题,提出即插即用的TrO框架,通过动态规划优化时间步调度,在有限采样步数下显著提升重建保真度和计算效率。

Comments Accessed to ECML-PKDD2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.06231 2026-06-05 math.PR 78%

Sensitivity of SDE Solutions to Perturbations of the Diffusion and Drift

SDE解对扩散和漂移扰动的敏感性

Jeremiah Birrell

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 通过信息论不确定性量化界、函数不等式和精心选择的耦合辅助SDE,提出一种方法,对随机微分方程解关于漂移和扩散变化的敏感性进行非渐近界估计,并适用于时间平均和指数折扣可观测量的期望,以及线性抛物型PDE,对不变测度的1-Wasserstein距离给出最优缩放界。

Comments 25 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.06049 2026-06-05 cs.RO 78%

L-SDPPO: Policy Optimization of Spiking Diffusion Policy for Intra-vehicular Robotic Manipulation

L-SDPPO:用于舱内机器人操作的脉冲扩散策略优化

Liwen Zhang, Dong Zhou, Guanghui Sun, Yifei Zheng, Yuhui Hu, Kaihong Ouyang, Zuoquan Zhao

机构 * Department of Control Science and Engineering, Harbin Institute of Technology(控制科学与工程系,哈尔滨工业大学) Department of Mechanical and Automation Engineering, The Chinese University of Hong Kong(机械与自动化工程系,香港中文大学)

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 提出L-SDPPO框架,结合脉冲扩散策略与强化学习优化,并引入状态依赖延迟注入机制,在舱内机器人操作任务中实现高成功率和低能耗。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.06031 2026-06-05 cs.CL 78%

NAVIRA: Decoupled Stochastic Remasking for Masked Diffusion Language Models

NAVIRA: 解耦随机重掩码用于掩码扩散语言模型

Andrey Fomenko, Maksim Kryzhanovskiy, Svetlana Glazyrina, Roman Ischenko

机构 * Lomonosov Moscow State University(莫斯科罗蒙诺索夫莫斯科国立大学) Institute for Artificial Intelligence(人工智能研究所)

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 针对掩码扩散语言模型并行生成中的上下文污染问题,提出NAVIRA解码策略,通过解耦质量检测与重生成、随机采样重掩码位置,提升流畅性和多样性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.05783 2026-06-05 physics.flu-dyn 78%

Stochastic Multiscale Reconstruction of Lagrangian Turbulence via Guided Diffusion Models

基于引导扩散模型的拉格朗日湍流随机多尺度重建

Conghui Wang, Tianyi Li, Luca Biferale, Qinmin Zheng, Michele Buzzicotti, Fabio Bonaccorso

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 利用扩散模型以小波粗粒化的大尺度动力学为条件,从粗粒化轨迹中重建未解析的细尺度拉格朗日湍流波动,恢复间歇性统计和跨尺度相关性。

Comments 4 figures; Supplemental Material and two supplementary movies included

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.05751 2026-06-05 physics.geo-ph 78%

Multi-Condition Guided Diffusion Model for Controllable Elastic Parameter Synthesis

可控弹性参数合成的多条件引导扩散模型

Hongling Chen, Qi Pang, Chuangji Meng, Shian Shen, Jinghuai Gao

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 提出多条件引导扩散模型,利用井统计和地质特征构建训练数据集,通过隐变量细化、适配器条件和扩散后验采样投影引导策略,实现弹性参数的可控合成与反演。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.05728 2026-06-05 cs.AI cs.CL 78%

DiG-Plan: Mitigating Early Commitment for Tool-Graph Planning via Diffusion Guidance

DiG-Plan:通过扩散引导缓解工具图规划中的早期承诺问题

Yansi Li, Zhuosheng Zhang

机构 * School of Computer Science, Shanghai Jiao Tong University(上海交通大学计算机科学学院)

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 针对工具图规划中自回归解码的早期承诺问题,提出基于扩散生成器与自回归精炼器解耦的DiG-Plan框架,显著提升组合搜索覆盖率和任务性能。

Comments Accepted at IJCAI-ECAI 2026. This is an author preprint; the final version will appear in the IJCAI Proceedings

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.05649 2026-06-05 stat.CO cs.LG 78%

Diff2SP: Diffusion Models for Correlated Scenario Generation in Stochastic Programming

Diff2SP:随机规划中相关场景生成的扩散模型

Haixiang Sun, Andrew Liu

机构 * Purdue University(普渡大学)

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 提出Diff2SP扩散生成框架,将下游优化目标嵌入场景生成过程,通过理论证明和经验验证实现统计一致性与决策感知的平衡。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.05407 2026-06-05 cs.RO 78%

MoDex: A Diffusion Policy for Sequential Multi-Object Dexterous Grasping

MoDex:用于顺序多物体灵巧抓取的扩散策略

Haofei Lu, Hongjia Liu, Yifei Dong, Florian T. Pokorny, Jens Lundell, Danica Kragic

机构 * Department of Robotics, Perception and Learning, KTH Royal Institute of Technology(机器人、感知与学习系,皇家理工学院) Robotics and Autonomous Systems at University of Turku(图尔库大学机器人与自主系统)

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 提出MoDex扩散策略,通过对抗空间和点云条件预测抓取姿态,实现单只灵巧手顺序抓取多物体而不释放已抓物体,并通过两阶段训练(模仿学习+强化学习微调)提升成功率。

Comments Submitted to CoRL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.05361 2026-06-05 stat.ML cs.LG 78%

TabSODA: Tabular Diffusion based Imputation with Skip Pattern Detection and Ordinal Awareness

TabSODA: 基于表格扩散的插补方法,结合跳跃模式检测与序数感知

Yuyu Chen, Taehyo Kim, Hai Shu, Yang Feng

机构 * Department of Biostatistics NYU School of Global Public Health(生物统计学系纽约大学全球公共卫生学院)

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 提出TabSODA方法,通过EM框架下的扩散模型处理大规模调查中的结构跳跃和序数变量,在PATH和NSDUH数据集上显著提升插补精度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.05239 2026-06-05 stat.ML cs.LG 78%

HyFAD: Hybrid Time-Frequency Diffusion with Frequency-Aware Embedding for Time Series Imputation

HyFAD: 用于时间序列插值的混合时频扩散与频率感知嵌入

Hongfan Gao, Wangmeng Shen, Bin Yang, Jilin Hu

机构 * School of Data Science and Engineering(数据科学与工程学院) East China Normal University(华东师范大学)

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 提出HyFAD模型,通过耦合时频扩散框架和频率感知步嵌入,实现从时域到频域的渐进式去噪,有效解决频率敏感去噪和高频重建问题,在多个基准数据集上达到最先进性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.30747 2026-06-05 cs.AI 78%

Generating Graph-Like Logical Rules for Knowledge Graph Reasoning via Diffusion Models

通过扩散模型生成图状规则用于知识图谱推理

Haoxiang Cheng, Yunfei Wang, Chao Chen, Kewei Cheng, Zhipeng Lin, Haoxuan Li, Changjun Fan, Shixuan Liu

机构 * Laboratory for Big Data and Decision(大数据与决策实验室) National University of Defense Technology(国防科技大学) National Key Laboratory of Information Systems Engineering(信息系统工程国家重点实验室) Microsoft Corporation(微软公司) College of Computer Science and Technology(计算机科学与技术学院)

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 提出GRiD框架,利用扩散模型将图状规则发现转化为以目标关系为条件的离散生成过程,结合监督预训练和强化学习优化,实现知识图谱补全中图状规则的高效挖掘。

Comments accepted by KDD 26

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.15377 2026-06-05 physics.soc-ph 78%

Diffusion-driven pattern formation in an opinion dynamical network model

在意见动力学网络模型中由扩散驱动的图案形成

Tim Mauch, Thilo Gross

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 本文研究了在复杂系统中保持多样性的重要因素,通过基于网络的方法研究意见形成,发现局部动态与社区结构的相互作用能够生成空间模式,使少数意见通过局部主导而得以持续。

Comments 10 pages, 8 figures

Journal ref Phys. Rev. E 113, 064302 (2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.22417 2026-06-05 cs.SD eess.AS 78%

Absorbing Discrete Diffusion for Speech Enhancement

吸收式离散扩散用于语音增强

Philippe Gonzalez

机构 * Department of Health Technology, Technical University of Denmark(丹麦技术大学健康技术系)

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 本文提出了一种基于吸收式离散扩散的语音增强方法ADDSE,结合神经音频编解码器的潜在空间和扩散模型的非自回归采样过程,以提高低信噪比下的语音增强性能。

Comments Accepted at Interspeech 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.07875 2026-06-05 cs.LG 78%

Harpoon: Generalised Manifold Guidance for Conditional Tabular Diffusion

Harpoon:基于条件表格扩散的通用流形引导

Aditya Shankar, Yuandou Wang, Rihan Hai, Lydia Y. Chen

机构 * Department of Computer Science, Delft University of Technology(代尔夫特理工大学计算机科学系) Department of Computer Science, Université de Neuchâtel(日内瓦大学计算机科学系)

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 本文提出Harpoon,一种基于流形引导的条件表格扩散方法,通过扩展流形理论来处理多样化的推理目标,从而在表格数据生成中实现更精确的条件控制。

Comments Accepted at ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏