arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

视觉与机器人

图像生成

图像生成、文生图、图像编辑、扩散模型和可控生成。

2026-03-26 至 2026-03-26 共收录 65 信号源:cs.CV, cs.GR, cs.MM

1. 扩散模型 65 篇

2603.23903 2026-03-26 cs.CV cs.AI 85%

Latent Bias Alignment for High-Fidelity Diffusion Inversion in Real-World Image Reconstruction and Manipulation

潜在偏置对齐用于高保真扩散倒置在现实世界图像重建与操控中的应用

Weiming Chen, Qifan Liu, Siyi Liu, Yushun Tang, Yijia Wang, Zhihan Zhu, Zhihai He

机构 * Department of Electrical and Electronic Engineering, Southern University of Science and Technology(南方科技大学电子与电气工程系) Undergraduate School of Artificial Intelligence, Shenzhen Polytechnic University(深圳理工大学人工智能本科生学院) Huawei Technologies Co., Ltd.(华为技术有限公司) Pengcheng Lab(鹏城实验室)

专题命中 扩散模型 :diffusion(title,abstract);text-to-image(abstract);image editing(abstract);分类 cs.CV

AI总结 本文提出Latent Bias Optimization和Image Latent Boosting方法,解决扩散模型与现实场景衔接中的重建质量与鲁棒性问题,提升图像编辑和稀有概念生成性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.20012 2026-03-26 cs.CV 83%

Diffusion-Based Makeup Transfer with Facial Region-Aware Makeup Features

基于扩散模型的化妆转移与面部区域感知化妆特征

Zheng Gao, Debin Meng, Yunqi Miao, Zhensong Zhang, Songcen Xu, Ioannis Patras, Jifei Song

机构 * Queen Mary University of London(伦敦女王学院) Huawei London Research Center(华为伦敦研发中心)

专题命中 扩散模型 :diffusion(title,abstract);image editing(abstract);分类 cs.CV

AI总结 本文提出FRAM方法,通过微调化妆CLIP和区域感知化妆注入,提升扩散模型在面部区域特定化妆转移中的可控性与效果。

Comments Accepted by CVPR'26

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.16371 2026-03-26 cs.CV 83%

Anchored Video Generation: Decoupling Scene Construction and Temporal Synthesis in Text-to-Video Diffusion Models

锚定视频生成:解耦场景构建与时间合成在文本到视频扩散模型中

Mariam Hassan, Bastien Van Delft, Wuyang Li, Alexandre Alahi

机构 * École Polytechnique Fédérale de Lausanne (EPFL)(瑞士联邦理工学院洛桑分校)

专题命中 扩散模型 :diffusion(title,abstract);text-to-image(abstract);分类 cs.CV

AI总结 本文提出锚定视频生成方法,通过解耦场景构建与时间合成任务,提升文本到视频扩散模型在复杂场景生成和时间逻辑遵循上的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.01718 2026-03-26 cs.RO cs.CV 83%

Unified Diffusion VLA: Vision-Language-Action Model via Joint Discrete Denoising Diffusion Process

统一扩散VLA:通过联合离散去噪扩散过程实现视觉-语言-动作模型

Jiayi Chen, Wenxuan Song, Pengxiang Ding, Ziyang Zhou, Han Zhao, Feilong Tang, Donglin Wang, Haoang Li

机构 * The Hong Kong University of Science and Technology (Guangzhou)(香港科学与技术大学(广州)) Westlake University(西交大学) Zhejiang University(浙江大学) Monash University(墨尔本大学)

专题命中 扩散模型 :diffusion(title,abstract);image generation(abstract);分类 cs.CV

AI总结 本文提出统一扩散VLA模型,通过联合离散去噪扩散过程实现视觉语言动作的协同生成与执行,提升多模态任务的效率与性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.24594 2026-03-26 cs.LG cs.NA math.NA stat.ML 82%

Polynomial Speedup in Diffusion Models with the Multilevel Euler-Maruyama Method

在扩散模型中使用多级欧拉-马尔可夫方法实现多项式加速

Arthur Jacot

专题命中 扩散模型 :diffusion(title,abstract);image generation(abstract)

AI总结 本文提出多级欧拉-马尔可夫方法,通过不同精度的近似器高效求解SDE和ODE,针对HTMC区域实现比传统方法更高的计算效率,应用于扩散模型时可显著提升图像生成速度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.14187 2026-03-26 cs.GR cs.CV 81%

Establishing Stochastic Object Models from Noisy Data via Ambient Measurement-Integrated Diffusion

通过环境测量整合扩散建立随机物体模型

Xiaoning Lei, Jianwei Sun, Wenhao Cai, Xichen Xu, Yanshu Wang, Hu Gao

机构 * Contemporary Amperex Technology Co.Limited(当代爱普科技术有限公司) Shanghai Jiao Tong University(上海交通大学) East China Normal University(华东师范大学)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV、cs.GR

AI总结 本文提出AMID方法,通过整合环境测量噪声与扩散轨迹,建立清洁的随机物体模型,提升医学影像生成质量和任务基于的图像质量评估。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.24407 2026-03-26 cs.CV 79%

Teacher-Student Diffusion Model for Text-Driven 3D Hand Motion Generation

基于文本驱动的3D手部运动生成的教师-学生扩散模型

Ching-Lam Cheng, Bin Zhu, Shengfeng He

机构 * Singapore Management University(新加坡管理大学)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 本文提出TSHaMo模型,通过文本生成逼真3D手部运动,利用教师-学生扩散框架提升运动质量和多样性,支持多种辅助输入。

Comments 5 pages, accepted by ICASSP2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.24260 2026-03-26 cs.CV cs.AI 79%

Accelerating Diffusion-based Video Editing via Heterogeneous Caching: Beyond Full Computing at Sampled Denoising Timestep

通过异构缓存加速基于扩散的视频编辑:超越采样去噪时间步的全计算

Tianyi Liu, Ye Lu, Linfeng Zhang, Chen Cai, Jianjun Gao, Yi Wang, Kim-Hui Yap, Lap-Pui Chau

机构 * Nanyang Technological University(南洋理工大学) Shanghai Jiao Tong University(上海交通大学) The Hong Kong Polytechnic University(香港理工大学)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 本文提出HetCache框架,通过利用扩散基于掩码视频到视频生成中的异构性,减少冗余注意力运算,提升视频编辑效率与质量。

Comments 10 pages, 6 figures, accepted by CVPR2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.21591 2026-03-26 cs.CV 79%

CADC: Content Adaptive Diffusion-Based Generative Image Compression

CADC: 基于内容自适应的扩散生成图像压缩

Xihua Sheng, Lingyu Zhu, Tianyu Zhang, Dong Liu, Shiqi Wang, Jing Wang

机构 * City University of Hong Kong(香港城市大学) University of Science and Technology of China(中国科学技术大学) Central Media Technology Institute, Huawei(华为中央媒体技术研究院)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 本文提出CADC,通过三种创新方法解决现有图像压缩在内容自适应中的不足,实现动态对齐图像语义与结构特征。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.21542 2026-03-26 cs.RO cs.AI cs.CV cs.LG 79%

E0: Enhancing Generalization and Fine-Grained Control in VLA Models via Tweedie Discrete Diffusion

E0: 通过 Tweedie 离散扩散增强 VLA 模型的泛化能力与细粒度控制

Zhihao Zhan, Jiaying Zhou, Likui Zhang, Qinhan Lv, Hao Liu, Jusheng Zhang, Weizheng Li, Ziliang Chen, Tianshui Chen, Ruifeng Zhai, Keze Wang, Liang Lin, Guangrun Wang

机构 * Sun Yat-sen University(中山大学) Guangdong Key Laboratory of Big Data Analysis(广东大数据分析与处理重点实验室) X-Era AI Lab(X-Era人工智能实验室) Guangdong University of Technology(广东工业大学)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 本文提出 E0 框架,通过离散扩散方法提升 VLA 模型在多任务和多视角下的泛化能力,并实现精细可控的动作生成。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.23874 2026-03-26 cs.CV 79%

EnvSocial-Diff: A Diffusion-Based Crowd Simulation Model with Environmental Conditioning and Individual-Group Interaction

EnvSocial-Diff: 一种基于扩散的群体模拟模型,包含环境条件和个体-群体交互

Bingxue Zhao, Qi Zhang, Hui Huang

机构 * VCC, College of Computer Science and Software Engineering, Shenzhen University(VCC,计算机科学与软件工程学院,深圳大学)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 本文提出EnvSocial-Diff模型,结合社会物理和环境条件,通过环境编码模块和个体-群体交互模块提升群体模拟的现实性,实验表明其优于现有方法。

Comments ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.23845 2026-03-26 cs.CV 79%

3D-LLDM: Label-Guided 3D Latent Diffusion Model for Improving High-Resolution Synthetic MR Imaging in Hepatic Structure Segmentation

3D-LLDM:基于标签的3D潜在扩散模型用于提高肝结构分割的高分辨率合成MR影像

Kyeonghun Kim, Jaehyeok Bae, Youngung Han, Joo Young Bae, Seoyoung Ju, Junsu Lim, Gyeongmin Kim, Nam-Joon Kim, Woo Kyoung Jeong, Ken Ying-Kai Liao, Won Jae Lee, Pa Hong, Hyuk-Jae Lee

机构 * OUTTA, Republic of Korea(韩国OUTTA) Stanford University(斯坦福大学) Seoul National University(首尔国立大学) Sangmyung University(Sangmyung大学) Chung-Ang University(Chung-Ang大学) Samsung Medical Center(三星医疗中心) NVIDIA Sungkyunkwan University School of Medicine(成均馆大学医学院) Samsung Changwon Hospital(三星昌原医院)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 本文提出3D-LLDM模型,通过标签引导生成高质量合成MR影像,提升肝结构分割的精度,实验表明其在数据增强中提升了肝细胞癌分割的Dice得分。

Comments Accepted to ISBI 2026 (Oral). Camera-ready version

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.18719 2026-03-26 cs.CV cs.AI 79%

Ontology-Guided Diffusion for Zero-Shot Visual Sim2Real Transfer

基于本体引导的扩散模型用于零样本视觉sim2real迁移

Mohamed Youssef, Mayar Elfares, Anna-Maria Meer, Matteo Bortoletto, Andreas Bulling

机构 * University of Stuttgart, Germany(斯图加特大学)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 本文提出OGD框架,通过本体引导扩散模型实现零样本sim2real迁移,利用知识图谱和符号规划器提升图像真实感识别与生成效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.20592 2026-03-26 cs.LG cs.CV 79%

Latent Diffusion Inversion Requires Understanding the Latent Space

潜在扩散倒置需要理解潜在空间

Mingxing Rao, Bowen Qu, Daniel Moyer

机构 * Vanderbilt University(范德比大学)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 本文研究了扩散模型在潜在空间中的记忆现象,发现潜在空间中记忆分布不均,提出通过排序潜在维度来提升模型性能,实验显示在多个数据集上性能提升显著。

Comments 14 pages, 4 figures, 7 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.00430 2026-03-26 cs.LG cs.AI cs.CV 79%

PromptLoop: Plug-and-Play Prompt Refinement via Latent Feedback for Diffusion Model Alignment

PromptLoop: 通过潜在反馈实现扩散模型对齐的即插即用提示精炼

Suhyeon Lee, Jong Chul Ye

机构 * Graduate School of AI, KAIST(人工智能研究生院,韩国科学技术院)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 PromptLoop通过引入潜在反馈的逐步提示精炼方法,提升扩散模型在奖励优化、泛化能力及对抗奖励黑客方面的性能,同时保持灵活性和通用性。

Comments CVPR26 poster. 25 pages, 19 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.24495 2026-03-26 math.ST stat.ML stat.TH 78%

Reflected diffusion models adapt to low-dimensional data

反射扩散模型适应低维数据

Asbjørn Holk, Claudia Strauch, Lukas Trottner

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 本文研究了反射扩散模型在超立方体[0,1]^D上对支撑在d维线性子空间的目标分布的统计分析,通过无限级数展开过渡密度开发了分析工具,证明了在Sobolev光滑度α下,生成算法在1-瓦瑟斯坦距离上的收敛率与内在维度d一致。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.24314 2026-03-26 math.NA cs.NA 78%

A High-Order Finite Volume GENO Scheme with Implicit Time Integration for Three-Temperature Radiation Diffusion Equations

一种高阶有限体积GENO方案结合隐式时间积分用于三温辐射扩散方程

Fengxiang Zhao, Yaqing Yang, Yibing Chen, Kun Xu

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 本文提出一种高阶有限体积方案,用于三温辐射扩散方程的大时间步集成,通过能量更新自然实现守恒,采用中心型对称子 stencil 处理局部大梯度和不连续性,结合隐式时间离散方法解决刚性扩散问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.24228 2026-03-26 cond-mat.mtrl-sci 78%

Diffusion coefficients of multi-principal element alloys from first principles

多主元素合金的扩散系数从第一性原理

Damien K. J. Lee, Anirudh Raju Natarajan

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 本文提出eLCE方法,通过第一性原理计算与动能蒙特卡洛模拟计算多组分扩散系数,发现局部动能障碍主导扩散行为,通过筛选六元体系确定反迟滞扩散组成。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.00214 2026-03-26 math.PR 78%

On the local well-posedness of randomly forced reaction-diffusion equations with $L^2$ initial data and a superlinear reaction term

关于具有 $L^2$ 初始数据和超线性反应项的随机强迫反应-扩散方程局部适定性的研究

Mohammud Foondun, Davar Khoshnevisan, Eulalia Nualart

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 本文研究了在 $[0,1]$ 区间上受乘性时空白噪声驱动的抛物型随机偏微分方程,证明当初始数据属于 $L^2[0,1]$ 时方程局部适定,解决了开放性问题的强形式。

详情

展开后加载摘要…

URL PDF HTML 收藏
1606.06023 2026-03-26 cond-mat.soft physics.chem-ph 78%

Diffusion-Oscillatory Dynamics in Liquid Water on Data of Dielectric Spectroscopy

液态水中的扩散振荡动力学:介电光谱数据研究

A. A. Volkov, V. G. Artemov, A. A. Volkov, N. N. Sysoev

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 研究通过介电光谱数据揭示液态水的弛豫共振特性,提出基于粒子扩散的水结构模型,首次将直流电导率、德拜松弛和红外吸收峰联系起来,揭示水分子和离子的寿命特征。

Comments 7 pages, 4 figures

Journal ref Journal of Molecular Liquids, 248, 564-568 (2017)

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.24094 2026-03-26 physics.optics physics.app-ph 78%

The Spectral Domain Snell Law in Diffusion-Wave Fields

扩散波场中的频域斯涅尔定律

Pengfei Zhu, Julien Lecompagnon, Philipp Daniel Hirsch, Mathias Ziegler, Andreas Mandelis

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 本文揭示扩散波虽不遵循传统斯涅尔定律,但存在频域形式的斯涅尔定律,揭示了扩散动力学中的隐含波折射现象。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.23834 2026-03-26 math.AP 78%

The speeds of propagation for the monostable Lotka-Volterra competition-diffusion system in general unbounded domains

单稳Lotka-Volterra竞争扩散系统在一般无界域中的传播速度

Yang-Yang Yan, Wei-Jie Sheng

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 研究单稳Lotka-Volterra竞争扩散系统在无界域中传播速度的定义与性质,推导了扩散能力相同且相互作用较弱时的传播速度上界,并在不同域结构下获得上下界。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.23792 2026-03-26 cs.LG stat.ML 78%

Manifold Generalization Provably Proceeds Memorization in Diffusion Models

扩散模型中流形泛化可证明地优于记忆化

Zebang Shen, Ya-Ping Hsieh, Niao He

机构 * ETH Zurich(苏黎世联邦理工学院)

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 本文研究扩散模型在流形假设下如何通过粗略分数捕捉数据几何结构,从而在非光滑数据中实现比估计完整分布更快的泛化速度。

Comments The first two authors contributed equally

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.23765 2026-03-26 physics.app-ph 78%

Generalized virtual wave reconstruction for vibrothermography: Overcoming the wavefront-free behavior and quantification challenges in the diffusion-wave field

通用虚拟波重建用于振动热成像:克服波前缺失行为和扩散波场中的量化挑战

Pengfei Zhu, Julien Lecompagnon, Mathias Ziegler, Clemente Ibarra-Castanedo, Xavier Maldague

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 本文提出通用虚拟波重建框架,解决热扩散波场中波前缺失行为对定量缺陷表征的影响,通过时空映射提升数值稳定性与噪声抑制能力,实验验证其在碳纤维复合材料中的鲁棒性与性能提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.23719 2026-03-26 cs.LG cs.AI 78%

CDMT-EHR: A Continuous-Time Diffusion Framework for Generating Mixed-Type Time-Series Electronic Health Records

CDMT-EHR:一种连续时间扩散框架用于生成混合类型时间序列电子健康记录

Shaonan Liu, Yuichiro Iwashita, Soichiro Nakako, Masakazu Iwamura, Koichi Kise

机构 * Department of Core Informatics, Graduate School of Informatics, Osaka Metropolitan University(核心信息学系,信息学研究生学校,大阪 Metropolitan 大学) Smart Data & Knowledge Services Department, German Research Center for Artificial Intelligence (DFKI GmbH)(智能数据与知识服务部,德国人工智能研究中心(DFKI GmbH)) Department of Hematology and Department of Laboratory Medicine and Medical Informatics, Graduate School of Medicine, Osaka Metropolitan University(血液科和实验室医学与医学信息学系,医学研究生学校,大阪 Metropolitan 大学)

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 本文提出CDMT-EHR框架,通过连续时间扩散模型生成混合类型时间序列电子健康记录,解决传统离散时间方法的局限性,提升生成效果和效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.23507 2026-03-26 cs.CL cs.AI cs.LG 78%

Beyond Masks: Efficient, Flexible Diffusion Language Models via Deletion-Insertion Processes

超越掩码:通过删除-插入过程实现高效的、灵活的扩散语言模型

Fangyu Ding, Ding Ding, Sijin Chen, Kaibo Wang, Peng Xu, Zijin Feng, Haoli Bai, Kai Han, Youliang Yan, Binhang Yuan, Jiacheng Sun

机构 * HKUST(香港科技大学) Huawei Foundation Model Dept(华为基础模型部门) CUHK(香港中文大学)

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 本文提出删除-插入扩散语言模型(DID),通过将token删除和插入作为离散扩散过程,提高训练和推理效率,并提供更灵活的生成机制。

Comments Accepted at ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.17572 2026-03-26 eess.SY cond-mat.stat-mech cs.SY math.OC nlin.PS 78%

Optimal Control for Steady Circulation of a Diffusion Process via Spectral Decomposition of Fokker-Planck Equation

通过福克-平面方程的谱分解实现扩散过程稳态循环的最优控制

Norihisa Namura, Hiroya Nakao

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 本文提出通过福克-平面方程的谱分解进行维度约简,设计最优控制问题以实现非平衡稳态的所需循环并加速收敛到稳态分布。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.04854 2026-03-26 cs.LG q-bio.QM 78%

SigmaDock: Untwisting Molecular Docking With Fragment-Based SE(3) Diffusion

SigmaDock:基于片段的SE(3)扩散实现分子对接的解缠

Alvaro Prat, Leo Zhang, Charlotte M. Deane, Yee Whye Teh, Garrett M. Morris

机构 * Department of Statistics, University of Oxford(牛津大学统计系)

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 SigmaDock通过基于片段的SE(3)扩散模型,利用结构化学的归纳偏差分解配体为刚体片段,并在结合口袋中重新组装这些片段,实现高精度的分子对接。

Comments Camera-ready version for ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.04803 2026-03-26 eess.SP 78%

SemSteDiff: Generative Diffusion Model-based Coverless Semantic Steganography Communication

SemSteDiff:基于生成扩散模型的无载体语义隐写通信

Song Gao, Rui Meng, Xiaodong Xu, Haixiao Gao, Yiming Liu, Chenyuan Feng, Ping Zhang, Tony Q. S. Quek, Dusit Niyato

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 本文提出SemSteDiff方案,通过生成扩散模型在无载体图像中隐藏秘密信息,提升通信安全性,实验显示在不同编码框架下具有优越性能。

Comments 16 pages, 13 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2204.07127 2026-03-26 cond-mat.soft 78%

Relaxation dynamics and long-time tails explain shear-induced diffusion of soft athermal particles near jamming

松弛动力学和长时间尾部解释了接近阻塞的软无热粒子的剪切诱导扩散

Kuniyasu Saitoh, Takeshi Kawasaki

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 研究通过数值方法探讨二维软无热粒子的剪切诱导扩散,发现格林-库波公式中的均方横向速度和松弛时间在接近阻塞时符合临界标度,长时尾部导致格林-库波公式发散。

Comments 11 pages, 12 figures

Journal ref Phys. Rev. Res. 8, L012069 (2026)

详情

展开后加载摘要…

URL PDF HTML 收藏