arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

图像生成

图像生成、文生图、图像编辑、扩散模型和可控生成。

共收录 2962 信号源:cs.CV, cs.GR, cs.MM

1. 扩散模型 2264 篇

2606.24300 2026-06-24 stat.ME stat.AP 新提交 78%

Prediction of spatio-temporal data on meshed surfaces using advection-diffusion SPDEs

基于平流-扩散SPDE的网格表面时空数据预测

Mike Pereira, Lucia Clarotto, Nicolas Desassis

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 提出基于随机偏微分方程(SPDE)的网格表面时空数据统计模型,通过Galerkin离散化实现可扩展的高斯随机场模拟与预测,并应用于球面模拟数据和全球气溶胶光学厚度实例。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.23712 2026-06-24 eess.SP cs.AI 新提交 78%

Audio-visual Contrastive Alignment for Diffusion-based Visual-conditioned Speech Enhancement

基于扩散的视觉条件语音增强中的音视频对比对齐

Colombe Mboungou, Mostafa Sadeghi, Jean-Eudes Ayilo, Romain Serizel

机构 * Université de Lorraine, CNRS, Inria, Loria, Nancy, France(洛林大学、法国国家科学研究中心、法国国家信息与自动化研究所、Loria研究所、法国南希)

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 提出在扩散训练目标中加入对比音视频损失,增强视觉信息利用,提升语音增强性能,尤其在低信噪比下改善显著。

Journal ref INTERSPEECH, Sep 2026, Sydney, Australia

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.24208 2026-06-24 cs.RO 新提交 78%

Grounding Generative Policies in Physics: Optimization-Guided Diffusion for Robot Control

将生成式策略基于物理:面向机器人控制的优化引导扩散

Sabrina Bodmer, René Zurbrügg, Tifanny Portela, Hao Ma, Alexandre Didier, Marco Hutter, Colin Jones, Melanie Zeilinger

机构 * ETH Zurich(苏黎世联邦理工学院) EPFL(洛桑联邦理工学院)

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 提出推理时优化框架,通过将扩散引导建模为约束优化问题,在采样中施加物理可行性约束,无需重训练即可提升机器人任务成功率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.24157 2026-06-24 cs.AI 新提交 78%

The Geometry Behind Diffusion and Flow Matching: Gradient Flows and Geodesics in Wasserstein Space

扩散与流匹配背后的几何:Wasserstein空间中的梯度流与测地线

Yian Yao, Weiwei Zhang

机构 * mortal world(尘世) heaven(天堂)

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 本文揭示扩散模型和流匹配模型共享Wasserstein流形几何:扩散对应自由能梯度流的JKO离散化,流匹配对应Benamou-Brenier测地线,两者沿不同路径到达相同端点。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.23920 2026-06-24 cs.LG cs.AI 新提交 78%

Catastrophic Compositional Generation: Why Vanilla Diffusion Models Fail to Extrapolate

灾难性组合生成:为什么普通扩散模型无法外推

Duncan Soiffer, Chandler Squires, Yuan Guan, Jason Hartford, Pradeep Ravikumar

机构 * Machine Learning Department, Carnegie Mellon University(卡内基梅隆大学机器学习系) Valence Labs Department of Computer Science, University of Manchester(曼彻斯特大学计算机科学系)

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 本文论证普通条件扩散模型在组合生成任务中常不可行,通过理论泛化论证和实验表明,当目标分布超出源分布范围时,分数估计误差会导致灾难性性能下降。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.23898 2026-06-24 cs.LG cs.AI 新提交 78%

ARIA: Adaptive Region-Based Importance Allocation for Conditional Diffusion Distillation

ARIA: 基于自适应区域重要性分配的条件扩散蒸馏

Loay Mualem, Vinh Tong, Samir Darouich, Mathias Niepert

机构 * Institute for AI, University of Stuttgart(斯图加特大学人工智能研究所) IMPRS-IS(国际马克斯·普朗克智能系统研究学院) Institute of Theoretical Chemistry, University of Stuttgart(斯图加特大学理论化学研究所)

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 提出ARIA框架,通过在线估计教师-学生差异,自适应分配训练资源到条件空间的不同区域,提升条件扩散模型蒸馏效率,尤其对未见和欠表示条件效果显著。

Comments 26 pages, 11 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.23690 2026-06-24 cs.SE cs.AI 新提交 78%

Beyond the Autoregressive Horizon: A Comprehensive Survey of Diffusion Models, World Modelling, and State Space Models for Code

超越自回归视野:扩散模型、世界模型和状态空间模型在代码领域的综合综述

Kishan Maharaj, Ashita Saxena, Srikanth Tamilselvam

机构 * IBM

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 综述扩散模型、代码世界模型和状态空间模型在代码生成中的潜力,以克服自回归模型在全局规划、长程依赖和执行语义方面的局限,并展望“系统2”代码生成智能体。

Comments 14 Pages, 1 Table, 1 Figure

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.24500 2026-06-24 math.NA cs.NA math.OC 新提交 78%

Certified Reachable Sets for Nonlinear Reaction--Diffusion Systems

非线性反应-扩散系统的认证可达集

Mohamed Amine Ouchdiri, Mohamed Maghenem, Saad Benjelloun, Adnane Saoud

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 针对含参数不确定性的非线性反应-扩散PDE,提出结合有限元法、本征正交分解和基于集合的可达性分析框架,量化各阶段近似误差,得到原PDE可达集的过近似。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.23962 2026-06-24 math.AP math.ST stat.TH 新提交 78%

Delay-Penalty Comparison for Sequential Testing and Quickest Detection in State-Dependent Diffusion Models

状态依赖扩散模型中序贯检验与最快检测的延迟惩罚比较

Ye Liang

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 针对漂移在两种状态间切换且信噪比依赖当前观测的扩散过程,提出基于滤波框架的序贯检验与最快检测方法,建立延迟惩罚比较原理,证明点态更大的运行延迟惩罚会缩小停止区域并导致更早停止。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.11552 2026-06-24 cs.CL cs.LG 新提交 78%

Teaching Diffusion to Speculate Left-to-Right

教导扩散模型从左到右推测

Lexington Whalen, Yuki Ito, Ryo Sakamoto

机构 * Lexington Whalen Yuki Ito Ryo Sakamoto

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 针对自回归解码的推理瓶颈,提出三种训练时干预方法(位置加权、首次错误焦点损失、链损失)来弥合块扩散草稿模型的双向生成与自回归目标模型从左到右验证之间的不对称性,显著提升接受草稿长度。

Comments 13 pages, technical report

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.22521 2026-06-23 stat.ML cs.LG 新提交 78%

Robust Diffusion Models via Divergence-Induced Weighted Denoising

通过散度诱导加权去噪的鲁棒扩散模型

Lei Li, Yuexiao Dong

机构 * LunarAI LLC(LunarAI公司) Fox School of Business Temple University(Temple大学商学院)

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 提出用f-散度非线性变换替代扩散模型中的MSE去噪损失,构建鲁棒训练代理,通过局部散度构造统一训练目标,在数据污染下提升性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.22239 2026-06-23 stat.ML cs.LG 新提交 78%

Variance-Tilted Diffusion Models for Diverse Sampling

方差倾斜扩散模型用于多样化采样

Iskander Azangulov, Leo Zhang, Kianoosh Ashouritaklimi

机构 * Department of Statistics, University of Oxford, Oxford, UK(牛津大学统计学系)

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 提出方差加权批分布,通过Doob h-变换导出交互粒子采样器,在扩散模型中实现多样化采样,具有透明概率目标。

Comments Accepted at SPIGM @ ICML workshop 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.21036 2026-06-23 stat.ML cs.LG 新提交 78%

Diffusion-Driven State Space Models

扩散驱动的状态空间模型

Jack Ruder, Michael Wojnowicz

机构 * Montana State University(蒙塔纳州立大学)

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 提出扩散驱动状态空间模型(DDSSM),用扩散模型替代高斯转移分布,联合训练自编码器和扩散模型,提升时间序列拟合与预测能力。

Comments Accepted to ProbML 2026 Workshop Track

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.23623 2026-06-23 cs.RO 新提交 78%

dVLA-RL: Reinforcement Learning over Denoising Trajectories for Discrete Diffusion Vision-Language-Action Models

dVLA-RL:基于去噪轨迹的强化学习用于离散扩散视觉-语言-动作模型

Yuhao Wu, Yitian Liu, Weijie Shen, Mishuo Han, Wenjie Xu, Haotian Liang, Zhongshan Liu, Yinan Mao, Lei Xu, Xinping Guan, Ru Ying, Ran Zheng, Wei Sui, Xiaokang Yang, Wenbo Ding, Yao Mu

机构 * Shanghai Jiao Tong University(上海交通大学) Tsinghua Shenzhen International Graduate School, Tsinghua University(清华大学深圳国际研究生院) Baidu AI Cloud D-Robotics Shanghai AI Laboratory(百度AI云D-机器人上海人工智能实验室)

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 提出dVLA-RL方法,将离散扩散VLA模型的强化学习目标从边缘动作概率转移到采样生成路径的联合概率,通过将去噪过程建模为马尔可夫决策过程,实现变步长调度,在LIBERO上达到99.7%成功率,在RoboTwin 2.0上相比SFT提升30.6%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.23567 2026-06-23 cs.LG cs.AI 新提交 78%

Scheduling Thoughts: Learning the Order of Thought in Diffusion Language Models

调度思维:在扩散语言模型中学习思维的顺序

Jiawei Xu, Minghui Liu, Aakriti Agrawal, Yifan Chen, Furong Huang

机构 * University of Maryland, College Park(马里兰大学帕克分校) University of California, Los Angeles(加州大学洛杉矶分校)

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 提出自感知调度(SAS),通过策略优化学习扩散语言模型中的去掩码顺序,显著提升Sudoku和数学推理任务的生成质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.23406 2026-06-23 cs.LG cs.AI 新提交 78%

HyperQuant: A Rate-Distortion-Optimal Quantization Pipeline for Large Language and Diffusion Models

HyperQuant: 面向大型语言和扩散模型的率失真最优量化流水线

Yuval Domb, Hadar Sackstein, Tomer Solberg

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 提出HyperQuant统一后训练量化流水线,通过随机Hadamard变换、最优格量化、无损比特剥离和近熵最优Rice编码,在权重和KV缓存上实现率失真最优,优于现有方案。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.23086 2026-06-23 cs.LG 新提交 78%

PeLAP-A: Adaptive Latent Pruning for Lightweight Latent Diffusion Models

PeLAP-A:面向轻量级潜在扩散模型的自适应潜在剪枝

Kissa Zahra, Zaib Un Nisa

机构 * National University of Computer and Emerging Sciences(国立计算机与新兴科学大学)

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 提出PeLAP-A框架,通过可学习的通道重要性预测器对潜在通道进行自适应剪枝,发现强稀疏正则化下所有通道被抑制但去噪UNet性能反而提升,揭示潜在扩散模型的信息冗余现象。

Comments 6 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.22988 2026-06-23 cs.CR 新提交 78%

Public Diffusion Models, Private Images: Key-Controlled Inversion for Conditional Reconstruction

公开扩散模型,私有图像:用于条件重建的密钥控制反演

Lijunxian Zhang, Weihai Li, Bin Liu, Zikai Xu

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 针对扩散模型参数公开的白盒场景,提出密钥控制反演框架,利用误差传播将小扰动指数放大为安全资产,确保仅正确密钥可重建原图,并证明IND-CPA安全。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.22976 2026-06-23 cs.LG cs.AI cs.CL 新提交 78%

Understanding Parallel Samplers in Masked Diffusion via Random Walks on Graphs

通过图上的随机游走理解掩码扩散中的并行采样器

Vansh Bansal, Cho Cholyeon, Syamantak Kumar, Sujay Sanghavi, Purnamrita Sarkar

机构 * UT Austin SDS(德克萨斯大学奥斯汀分校统计与数据科学系) UT Austin CS(德克萨斯大学奥斯汀分校计算机科学系) UT Austin ECE(德克萨斯大学奥斯汀分校电气与计算机工程系)

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 提出以图上随机游走为可验证沙盒,研究掩码扩散模型中的并行采样策略,理论上证明最低熵等并行采样并非普遍优于随机采样,并开发了二分采样器,实验表明不同图适用不同采样器。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.22837 2026-06-23 cs.LG cs.AI cs.CR 新提交 78%

CLIP-guided Diffusion Model for Backdoor Generation in Sensor-based Human Activity Recognition

基于CLIP引导的扩散模型在传感器人体活动识别中的后门生成

Toby Briston, Illya Kosyk, Kuniyih S

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 提出IMU-DM-CLIP方法,利用扩散模型生成带后门的合成数据,以10%注入率和10%引导数据成功攻击HAR模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.22729 2026-06-23 cs.RO 新提交 78%

Temporal Logic Guidance for Action-Only Diffusion Policies with World Models

基于时序逻辑的动作扩散策略与世界模型引导

Moritz Zoellner, Anastasios Manganaris, Rohan Paleja

机构 * German Academic Exchange Service (DAAD)(德国学术交流中心(DAAD))

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 提出一种利用世界模型实现时序逻辑鲁棒性可微评估的引导方法,在不重新训练的情况下改善动作扩散策略的约束满足,在Robomimic任务中将违规率从80%降至4%。

Comments Accepted at the ICRA 2026 Workshop on Bridging the Gap between Robot Learning and Human-Robot Interaction. 3 pages, 2 figures, 1 table

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.22630 2026-06-23 cs.LG 新提交 78%

Scalable Maximum Entropy Reinforcement Learning for Diffusion Policies via Adjoint Matching

基于伴随匹配的可扩展最大熵强化学习扩散策略

Serge Thilges, Onur Celik, Denis Blessing, Emiliyan Gospodinov, Gerhard Neumann

机构 * Autonomous Learning Robots, Karlsruhe Institute of Technology(自主学习机器人,卡尔斯鲁厄理工学院)

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 提出伴随匹配方法,实现无需模拟训练的扩散策略优化,降低计算开销,使扩散策略适用于在线强化学习。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.21935 2026-06-23 cs.RO 新提交 78%

CoRDE: Concept-Prior Routed Diffusion Experts for Structural Generalization in Robot Manipulation

CoRDE:面向机器人操作结构泛化的概念先验路由扩散专家

Haidong Huang, Xixin Zhao, Yaohua Zhou, Jiayu Song, Jiayi Zhang, Jun Ma, Haiyue Zhu, Xiaocong Li

机构 * College of Information Science and Technology, Eastern Institute of Technology, Ningbo(宁波东方理工大学(暂名)信息科学与技术学院) Zhejiang Key Laboratory of Industrial Intelligence and Digital Twin, Eastern Institute of Technology, Ningbo(浙江省工业智能与数字孪生重点实验室,宁波东方理工大学(暂名)) Department of Electrical and Computer Engineering, National University of Singapore(新加坡国立大学电气与计算机工程系) Robotics and Autonomous Systems Thrust, The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)机器人与自主系统学域) Faculty of Science and Engineering, University of Nottingham Ningbo China(宁波诺丁汉大学理工学院)

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 提出CoRDE框架,通过概念先验引导路由和低秩专家池,解决扩散模型在多任务长时程操作中的结构泛化不足和路由崩溃问题。

Comments 8 pages, 3 figures, Accepted to the 2026 IEEE/RSJ International Conference on Intelligent Robots and Systems (IROS)

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.21802 2026-06-23 cs.CL 新提交 78%

When to Plan, When to Polish: Noise Level as a Granularity Axis for Diffusion Language Models

何时规划,何时精炼:噪声水平作为扩散语言模型的粒度轴

Peihong Li, Yuanjie Shi, Yan Yan

机构 * Washington State University(华盛顿州立大学)

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 提出噪声依赖粒度控制(NDGC)方法,通过噪声水平调节训练和推理的粒度,实现从粗到细的去噪,无需显式规划器或层次结构,提升生成质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.21792 2026-06-23 cs.RO cs.AI 新提交 78%

THREAD: Trajectory Planning for Hybrid Rigid-Soft Manipulators with Environment-Aware Diffusion

THREAD: 面向混合刚柔机械臂的环境感知扩散轨迹规划

Shivani Kamtikar, Pranav Asthana, Naveen Kumar Uppalapati, Girish Krishnan, Girish Chowdhary

机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) University of Maryland College Park(马里兰大学帕克分校)

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 提出首个基于扩散的混合刚柔机械臂轨迹规划器THREAD,通过物理启发损失联合约束刚柔段,实现狭窄环境穿行,任务成功率92.4%,碰撞减少5倍。

Comments Project Page: https://robot-thread.github.io, IROS 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.21646 2026-06-23 cs.RO 新提交 78%

Energy-based Compositional Diffusion Planning

基于能量的组合扩散规划

Tao Sun, Utkarsh Aashu Mishra, Jiaxin Lu, Danfei Xu, Iro Armeni

机构 * Stanford University(斯坦福大学) Georgia Institute of Technology(佐治亚理工学院) University of Texas at Austin(德克萨斯大学奥斯汀分校)

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 提出能量基组合扩散器(ECD),将全局轨迹建模为局部桥势之和的最小化,通过保守修正场和边界反应项改进启发式拼接,实现线性时间复杂度的马尔可夫分数近似,在OGBench任务中达到最优成功率。

Comments ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.20686 2026-06-23 cs.RO cs.AI 新提交 78%

JPPD: Joint Prediction_Planning Diffusion with Differentiable Safety Guidance for Dynamic Obstacle Avoidance in Intelligent Transportation Systems

JPPD:具有可微安全引导的联合预测-规划扩散框架用于智能交通系统中的动态障碍物规避

Jiahao Wu, Shengwen Yu

机构 * The University of Hong Kong(香港大学) Guangzhou College of Commerce(广州商学院)

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 提出联合预测-规划扩散框架,将参与者预测与机器人规划视为条件轨迹生成问题,通过可微安全势引导和条件流匹配提升共享空间中的安全性与效率。

Comments 12 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.20593 2026-06-23 cs.CY 新提交 78%

Bridging the Analytics Divide: Retail Technology Diffusion in South Africa's Traditional Retail Sector

弥合分析鸿沟:南非传统零售业的技术扩散

Shaun Moloi, Adheesh Budree, Pitso Tsibolane

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 本研究基于TOE框架和DOI理论,通过15位高管的定性多案例研究,识别南非传统零售业采用分析技术的主要障碍(技术、组织、环境因素),并提出分阶段实施、高管支持和业务对齐等成功策略。

Journal ref IFIP Advances in Information and Communication Technology, Vol. 779. Springer, Cham (2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.23627 2026-06-23 stat.ML cs.LG math.ST stat.TH 新提交 78%

Diffusion Models Adapt to Low-Dimensional Structure Under Flexible Coefficient Choices

扩散模型在灵活系数选择下适应低维结构

Changxiao Cai, Yuchen Jiao, Gen Li

机构 * Department of Industrial and Operations Engineering, University of Michigan(工业与运营工程系,密歇根大学) Department of Statistics and Data Science, Chinese University of Hong Kong(统计与数据科学系,中国香港大学)

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 本文证明扩散模型在广泛系数选择下,仅需O(k/ε)次迭代即可生成ε-精确样本,独立于环境维度,从而验证了其适应低维结构的鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.23211 2026-06-23 math.NA cs.NA math.DS 新提交 78%

Turing-region preservation in matrix-oriented splitting methods for reaction-diffusion systems

反应-扩散系统矩阵导向分裂方法中的图灵区域保持

Angela Monti, Fasma Diele, Carmela Marangi

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 针对二维反应-扩散系统,提出矩阵导向的一阶分裂积分器,通过离散模态放大矩阵和Jury条件分析,揭示不同积分器诱导的离散图灵区域与连续图灵区域的偏差,并给出保持连续图灵区域的时间步长条件。

详情

展开后加载摘要…

URL PDF HTML 收藏