arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

图像生成

图像生成、文生图、图像编辑、扩散模型和可控生成。

2026-06-05 至 2026-06-05 共收录 83 信号源:cs.CV, cs.GR, cs.MM

1. 扩散模型 62 篇

2606.05407 2026-06-05 cs.RO 78%

MoDex: A Diffusion Policy for Sequential Multi-Object Dexterous Grasping

MoDex:用于顺序多物体灵巧抓取的扩散策略

Haofei Lu, Hongjia Liu, Yifei Dong, Florian T. Pokorny, Jens Lundell, Danica Kragic

机构 * Department of Robotics, Perception and Learning, KTH Royal Institute of Technology(机器人、感知与学习系,皇家理工学院) Robotics and Autonomous Systems at University of Turku(图尔库大学机器人与自主系统)

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 提出MoDex扩散策略,通过对抗空间和点云条件预测抓取姿态,实现单只灵巧手顺序抓取多物体而不释放已抓物体,并通过两阶段训练(模仿学习+强化学习微调)提升成功率。

Comments Submitted to CoRL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.05361 2026-06-05 stat.ML cs.LG 78%

TabSODA: Tabular Diffusion based Imputation with Skip Pattern Detection and Ordinal Awareness

TabSODA: 基于表格扩散的插补方法,结合跳跃模式检测与序数感知

Yuyu Chen, Taehyo Kim, Hai Shu, Yang Feng

机构 * Department of Biostatistics NYU School of Global Public Health(生物统计学系纽约大学全球公共卫生学院)

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 提出TabSODA方法,通过EM框架下的扩散模型处理大规模调查中的结构跳跃和序数变量,在PATH和NSDUH数据集上显著提升插补精度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.05239 2026-06-05 stat.ML cs.LG 78%

HyFAD: Hybrid Time-Frequency Diffusion with Frequency-Aware Embedding for Time Series Imputation

HyFAD: 用于时间序列插值的混合时频扩散与频率感知嵌入

Hongfan Gao, Wangmeng Shen, Bin Yang, Jilin Hu

机构 * School of Data Science and Engineering(数据科学与工程学院) East China Normal University(华东师范大学)

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 提出HyFAD模型,通过耦合时频扩散框架和频率感知步嵌入,实现从时域到频域的渐进式去噪,有效解决频率敏感去噪和高频重建问题,在多个基准数据集上达到最先进性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.30747 2026-06-05 cs.AI 78%

Generating Graph-Like Logical Rules for Knowledge Graph Reasoning via Diffusion Models

通过扩散模型生成图状规则用于知识图谱推理

Haoxiang Cheng, Yunfei Wang, Chao Chen, Kewei Cheng, Zhipeng Lin, Haoxuan Li, Changjun Fan, Shixuan Liu

机构 * Laboratory for Big Data and Decision(大数据与决策实验室) National University of Defense Technology(国防科技大学) National Key Laboratory of Information Systems Engineering(信息系统工程国家重点实验室) Microsoft Corporation(微软公司) College of Computer Science and Technology(计算机科学与技术学院)

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 提出GRiD框架,利用扩散模型将图状规则发现转化为以目标关系为条件的离散生成过程,结合监督预训练和强化学习优化,实现知识图谱补全中图状规则的高效挖掘。

Comments accepted by KDD 26

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.15377 2026-06-05 physics.soc-ph 78%

Diffusion-driven pattern formation in an opinion dynamical network model

在意见动力学网络模型中由扩散驱动的图案形成

Tim Mauch, Thilo Gross

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 本文研究了在复杂系统中保持多样性的重要因素,通过基于网络的方法研究意见形成,发现局部动态与社区结构的相互作用能够生成空间模式,使少数意见通过局部主导而得以持续。

Comments 10 pages, 8 figures

Journal ref Phys. Rev. E 113, 064302 (2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.22417 2026-06-05 cs.SD eess.AS 78%

Absorbing Discrete Diffusion for Speech Enhancement

吸收式离散扩散用于语音增强

Philippe Gonzalez

机构 * Department of Health Technology, Technical University of Denmark(丹麦技术大学健康技术系)

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 本文提出了一种基于吸收式离散扩散的语音增强方法ADDSE,结合神经音频编解码器的潜在空间和扩散模型的非自回归采样过程,以提高低信噪比下的语音增强性能。

Comments Accepted at Interspeech 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.07875 2026-06-05 cs.LG 78%

Harpoon: Generalised Manifold Guidance for Conditional Tabular Diffusion

Harpoon:基于条件表格扩散的通用流形引导

Aditya Shankar, Yuandou Wang, Rihan Hai, Lydia Y. Chen

机构 * Department of Computer Science, Delft University of Technology(代尔夫特理工大学计算机科学系) Department of Computer Science, Université de Neuchâtel(日内瓦大学计算机科学系)

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 本文提出Harpoon,一种基于流形引导的条件表格扩散方法,通过扩展流形理论来处理多样化的推理目标,从而在表格数据生成中实现更精确的条件控制。

Comments Accepted at ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.10314 2026-06-05 cs.LG 78%

Stop Training for the Worst: Progressive Unmasking Accelerates Masked Diffusion Training

停止训练于最差:渐进性解蔽加速了掩码扩散训练

Jaeyeon Kim, Jonathan Geuter, David Alvarez-Melis, Sham Kakade, Sitan Chen

机构 * Harvard University(哈佛大学) Kempner Institute(凯普纳研究所)

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 本文提出了一种名为渐进性解蔽(PUMA)的方法,通过修改前向掩码过程,使训练时间和推理时的掩码模式一致,从而加速了掩码扩散模型的训练。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.10968 2026-06-05 cs.LG stat.ML 78%

Blade: A Derivative-free Bayesian Inversion Method using Diffusion Priors

Blade:一种使用扩散先验的无导数贝叶斯反演方法

Hongkai Zheng, Austin Wang, Zihui Wu, Zhengyu Huang, Ricardo Baptista, Yisong Yue

机构 * California Institute of Technology(加州理工学院) University of Toronto(多伦多大学) Peking University(北京大学)

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 本文提出Blade方法,通过使用扩散模型作为数据驱动的先验,解决无导数贝叶斯反演中高维非线性问题的后验估计问题,实现了准确且校准良好的后验分布。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.10875 2026-06-05 cs.CL cs.AI cs.LG 78%

A Survey on Diffusion Language Models

扩散语言模型的综述

Tianyi Li, Mingda Chen, Bowei Guo, Zhiqiang Shen

机构 * VILA Lab, Mohamed bin Zayed University of Artificial Intelligence(维拉实验室,穆罕默德·本·扎耶德人工智能大学) Department of Automation, Tsinghua University(清华大学自动化系)

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 本文综述了扩散语言模型的发展现状,探讨了其与自回归模型和掩码语言模型的关系,分析了预训练策略、后训练方法以及推理优化技术,并讨论了多模态扩展、应用场景、局限性及未来研究方向。

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.03205 2026-06-05 math.NA cs.NA math.PR 78%

Multilevel Picard approximations for McKean-Vlasov stochastic differential equations with nonconstant diffusion

多级皮卡近似法用于具有非常数扩散系数的麦肯-瓦尔萨夫随机微分方程

Ariel Neufeld, Tuan Anh Nguyen, Philipp Schmocker

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 本文提出了一种多级皮卡近似法用于求解具有非常数扩散系数的麦肯-瓦尔萨夫随机微分方程,在标准Lipschitz条件下,证明该方法在L²意义下近似解,且计算成本随维度和误差容忍度的倒数呈多项式增长。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.04435 2026-06-05 q-bio.NC 78%

Cognitive Effort in the Two-Step Task: An Active Inference Drift-Diffusion Model Approach

两步任务中的认知努力:一种主动推断漂移扩散模型方法

Alvaro Garrido Perez, Viktor Lemoine, Amrapali Pednekar, Yara Khaluf, Pieter Simoens

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 本文提出了一种结合主动推断(AIF)与漂移扩散模型(DDM)的模型,以探讨该模型能否同时解释习惯违反和价值辨别性所导致的认知努力,同时提出改进两步任务以更好地测量和隔离认知努力。

Comments Paper accepted in the International Workshop on Active Inference, 2025: https://iwaiworkshop.github.io/#

Journal ref Active Inference, Communications in Computer and Information Science 2857 (2026) 24-44

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.08749 2026-06-05 cs.CV 77%

Shifting the Breaking Point of Flow Matching for Multi-Instance Editing

将流匹配的断裂点转向多实例编辑

Carmine Zaccagnino, Fabio Quattrini, Enis Simsar, Marta Tintoré Gazulla, Rita Cucchiara, Alessio Tonioni, Silvia Cascianelli

机构 * University of Bologna(博洛尼亚大学)

专题命中 扩散模型 :image generation(abstract);diffusion(abstract);image editing(abstract);分类 cs.CV

AI总结 针对流匹配模型在多实例编辑中语义纠缠的问题,提出实例解耦注意力机制,通过分割联合注意力操作强制实例-文本指令与空间区域的绑定,实现单次前向传播的实例级编辑。

Comments Accepted at ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.06009 2026-06-05 math.AP 71%

Preventing $L^p$ blow-up by local anisotropy of signal production in the Keller-Segel system with strongly differing diffusion rates

具有强扩散差异的Keller-Segel系统中信号产生的局部各向异性防止$L^p$爆破

Youshan Tao, Michael Winkler

专题命中 扩散模型 :diffusion(title)

AI总结 研究具有强扩散差异的Keller-Segel系统中信号产生的局部各向异性对解全局存在性的影响,证明了在$n\le 5$的有界光滑区域上,对于任意$D>0$和$d>0$以及非负初值,Neumann问题存在全局弱解,且满足指数可积性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.05652 2026-06-05 cs.CV 70%

CoFi-UCGen: Coarse-to-Fine Unsupervised Conditional Generation without Label Priors

CoFi-UCGen:无标签先验的粗到细无监督条件生成

Shengxi Li, Zhaokun Hu, Ce Zheng, Mai Xu, Jingyuan Xia, Si Liu

机构 * Department of Electronic Information Engineering, Beihang University(信息工程系,北航) School of Cyber Science and Technology, Beihang University(网络安全科学与技术学院,北航) College of Electronic Science, National University of Defense Technology(电子科学学院,国防科技大学) Institute of Artificial Intelligence, Beihang University(人工智能研究院,北航)

专题命中 扩散模型 :image generation(abstract);diffusion(abstract);分类 cs.CV

AI总结 提出粗到细的无监督条件生成框架CoFi-UCGen,通过对抗语义互学习理论和位编码实现无标签条件下的全局与细粒度语义解耦,并利用扩散模型层次调制机制控制生成。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.06309 2026-06-05 cs.CV 57%

RhymeFlow: Training-Free Acceleration for Video Generation with Asynchronous Denoising Flow Scheduling

RhymeFlow: 基于异步去噪流调度的无训练加速视频生成

Chensheng Dai, Shengjun Zhang, Yifan Li, Zhang Zhang, Zheng Zhu, Yueqi Duan

机构 * Tsinghua University(清华大学) GigaAI

专题命中 扩散模型 :diffusion(abstract);分类 cs.CV

AI总结 针对DiT视频生成模型推理慢的问题,提出无训练框架RhymeFlow,通过识别关键帧并仅对其密集去噪,非关键帧逐步跳过步骤,同时引入潜在轨迹投影模块保持时序一致性,实现加速并提升质量。

Comments Project Page: https://simon-dcs.github.io/Website-of-RhymeFlow/, Code: https://github.com/Simon-Dcs/RhymeFlow

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.29219 2026-06-05 cs.CV 57%

SalsaAgent: A multimodal embodied language model for interactive dance generation

SalsaAgent: 一种用于交互式舞蹈生成的多模态具身语言模型

Payam Jome Yazdian, Zoe Stanley, Angelica Lim

机构 * Simon Fraser University(西蒙弗雷泽大学)

专题命中 扩散模型 :diffusion(abstract);分类 cs.CV

AI总结 提出SalsaAgent语言模型,通过非语言运动令牌传递和两阶段令牌到扩散管道,生成与人类领舞者及音乐背景交互的全身萨尔萨舞蹈动作。

Comments Project page: https://pjyazdian.github.io/Salsa-Agent

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.08809 2026-06-05 cs.CV eess.IV 57%

Training-Free Inference for High-Resolution Sinogram Completion

无需训练的高分辨率sinogram补全

Jiaze E, Srutarshi Banerjee, Tekin Bicer, Guannan Wang, Yanfu Zhang, Bin Ren

机构 * William & Mary(威廉玛丽学院) Argonne National Laboratory(阿贡国家实验室) University of Chicago(芝加哥大学)

专题命中 扩散模型 :diffusion(abstract);分类 cs.CV

AI总结 本文提出了一种无需训练的高效扩散推理方法HRSino,用于高分辨率sinogram补全,通过自适应分配推理努力来提高计算效率和补全精度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.09989 2026-06-05 cs.RO cs.CV 57%

StereoPolicy: Improving Robotic Manipulation Policies via Stereo Perception

StereoPolicy:通过立体视觉改进机器人操作策略

Evans Han, Yunfan Jiang, Yingke Wang, Haoyue Xiao, Huang Huang, Jianwen Xie, Jiajun Wu, Li Fei-Fei, Ruohan Zhang

机构 * Stanford University(斯坦福大学) Northwestern University(西北大学) Lambda, Inc(Lambda公司)

专题命中 扩散模型 :diffusion(abstract);分类 cs.CV

AI总结 该研究提出StereoPolicy,一种利用立体视觉提升机器人操作策略的框架,通过同步立体图像对增强几何推理,无需构建显式3D表示,在多个仿真和真实机器人任务中优于RGB、RGB-D、点云等基线方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.13183 2026-06-05 cs.CV 57%

GenTract: Generative Global Tractography

GenTract:生成式全局束追踪

Alec Sargood, Lemuel Puglisi, Elinor Thompson, Mirco Musolesi, Daniel C. Alexander

机构 * Hawkes Institute and Department of Computer Science, University College London, UK(霍克斯研究所和计算机科学系,伦敦大学学院,英国) Department of Maths and Computer Science, University of Catania, Italy(数学和计算机科学系,卡塔尼亚大学,意大利) AI Centre and Department of Computer Science, University College London, UK(人工智能中心和计算机科学系,伦敦大学学院,英国)

专题命中 扩散模型 :diffusion(abstract);分类 cs.CV

AI总结 本文提出GenTract,一种基于生成模型的全局束追踪方法,通过学习从dMRI到完整解剖学合理束流的直接映射,提高了在低分辨率和噪声数据下的精度和可靠性。

Comments Upload of camera-ready

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.23300 2026-06-05 cs.CV cs.RO 57%

Learning Predictive Visuomotor Coordination

学习预测性视觉-运动协调

Wenqi Jia, Bolin Lai, Miao Liu, Danfei Xu, James M. Rehg

机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) Georgia Tech(佐治亚理工学院) Meta AI

专题命中 扩散模型 :diffusion(abstract);分类 cs.CV

AI总结 本文提出了一种基于预测的视觉-运动协调建模任务,通过结合第一人称视觉和运动学观测预测头部姿态、目光方向和上半身运动,展示了多模态整合在理解视觉-运动协调中的重要性。

Comments CVPR 2026 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.06344 2026-06-05 cs.LG cs.SC 50%

Equivariant Neural Belief Propagation

等变神经信念传播

Zehua Cheng, Wei Dai, Jiahao Sun

机构 * Department of Computer Science, University of Oxford(计算机科学系,牛津大学) FLock.io

专题命中 扩散模型 :diffusion(abstract)

AI总结 提出等变神经信念传播(ENBP),通过等变高斯混合消息和秩2精度矩阵合成,实现SE(3)对称性下的高效概率推理,在分子构象和机器人推理任务中显著超越基线。

Comments 18 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.06257 2026-06-05 cond-mat.soft physics.geo-ph 50%

Investigating frictional instability due to pressurization in granular media: insights from coupled computational fluid dynamics discrete element method

颗粒介质中加压导致摩擦失稳的研究:基于计算流体动力学-离散元耦合方法的见解

Bimal Chhushyabaga, Behrooz Ferdowsi

专题命中 扩散模型 :diffusion(abstract)

AI总结 通过三维CFD-DEM耦合模拟,研究排水条件如何通过孔隙压力扩散、排水与接触网络退化间的颗粒尺度反馈控制颗粒剪切层的失稳机制。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.06018 2026-06-05 math.ST math.AP math.DS stat.TH 50%

On statistical inference for non-linear dynamical systems evolving in their global attractor

关于在其全局吸引子上演化的非线性动力系统的统计推断

Dimitri Konen, Richard Nickl

专题命中 扩散模型 :diffusion(abstract)

AI总结 针对反应函数自然条件下带初始条件的二维周期反应扩散系统,证明全局吸引子上反向庞加莱不等式成立,进而得到L2-Lipschitz稳定性估计,并实现初始条件统计恢复和状态预测的快速近参数收敛率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.05930 2026-06-05 cond-mat.stat-mech 50%

Thermodynamics of bouncing grains

弹跳颗粒的热力学

Olivier Devauchelle, Predrag Popović, Piotr Szymczak, Anaïs Abramian, Arnaud Lazarus

专题命中 扩散模型 :diffusion(abstract)

AI总结 通过实验研究振动板上弹跳颗粒的扩散行为,发现其类似于经典分子扩散,定义了颗粒温度并验证了涨落-耗散定理,但在温度不均匀时菲克定律失效,支持一种新的输运关系。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.05923 2026-06-05 cond-mat.soft 50%

Run and tumble dynamics of a soft robotic cell

软体机器细胞的跑停动力学

Siddhant Mohapatra, Fanny Wéry, Filip Novkoski, Piotr Nowakowski, Ana-Suncana Smith, Nicolas Vandewalle

专题命中 扩散模型 :diffusion(abstract)

AI总结 通过将可编程活性粒子包裹在可变形膜内,利用膜柔软度作为单一控制参数,实现了从弹道运动到扩散的间歇性跑停动力学,并建立了可编程软活性输运的设计原理。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.05879 2026-06-05 math.AP cs.NA math.NA 50%

Convergence of a discrete-in-time Approximation to a Degenerate Parabolic-Hyperbolic System

退化抛物-双曲系统的时间离散逼近的收敛性

Julia Hauser, Hideki Murakawa, Markus Schmidtchen

专题命中 扩散模型 :diffusion(abstract)

AI总结 本文研究一个退化反应-交叉扩散系统的隐式半离散逼近,证明时间离散近似存在并收敛到弱解。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.05852 2026-06-05 cs.SD cs.AI eess.AS 50%

UniVoice: A Unified Model for Speech and Singing Voice Generation

UniVoice: 一种用于语音和歌声生成的统一模型

Junjie Zheng, Huixin Xue, Shihong Ren, Chaofan Ding, Hao Liu, Zihao Chen

机构 * Giant Network(巨量网络) Shanghai Conservatory of Music(上海音乐学院)

专题命中 扩散模型 :diffusion(abstract)

AI总结 提出UniVoice,一种基于条件流匹配的统一语音和歌声生成框架,通过将条件分解为内容、旋律和音色,并引入空旋律标记,实现单一模型同时生成自然语音和可控歌声。

Comments 9 pages, 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.05398 2026-06-05 math.AP 50%

Thin Domains, Reduction, and Slow Manifolds

薄域、降维与慢流形

Christian Kuehn, Jan-Eric Sulzbach

专题命中 扩散模型 :diffusion(abstract)

AI总结 针对薄域上的偏微分方程,提出结合边界条件分析、平均化分裂和慢流形观点的统一降维框架,并应用于Schnakenberg反应扩散系统及薄管状域。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.05209 2026-06-05 math.NA cs.NA physics.flu-dyn 50%

Entropy-Compatible Barrier Schemes for Diffusive FENE Flows

扩散FENE流的熵兼容势垒格式

Sai Peng

专题命中 扩散模型 :diffusion(abstract)

AI总结 针对FENE-P型扩散流和迹奇异FENE族闭包,提出并分析了一种保持有限可扩展性势垒的熵兼容离散格式,证明了迹势垒保持、熵兼容重构、自由能不等式和AP应力闭包等性质。

详情

展开后加载摘要…

URL PDF HTML 收藏