arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

视觉与机器人

图像生成

图像生成、文生图、图像编辑、扩散模型和可控生成。

2026-03-06 至 2026-03-06 共收录 77 信号源:cs.CV, cs.GR, cs.MM

1. 文生图 2 篇

2506.03067 2026-03-06 cs.CV 90%

EDITOR: Effective and Interpretable Prompt Inversion for Text-to-Image Diffusion Models

编辑:用于文本到图像扩散模型的有效且可解释的提示倒置

Mingzhe Li, Kejing Xia, Gehao Zhang, Zhenting Wang, Guanhong Tao, Siqi Pan, Juan Zhai, Shiqing Ma

机构 * University of Massachusetts, Amherst(马萨诸塞大学阿姆赫斯特分校) Georgia Institute of Technology(佐治亚理工学院) Rutgers University(罗格斯大学) University of Utah(犹他大学) Dolby Laboratories(杜比实验室)

专题命中 文生图 :text-to-image(title,abstract);diffusion(title,abstract);image generation(abstract);image synthesis(abstract)

AI总结 本文提出\sys技术,通过预训练模型初始化、潜在空间反向工程和嵌入到文本转换,提升文本到图像扩散模型的提示倒置效果,实现更高的图像相似性和可解释性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.02015 2026-03-06 cs.CV 89%

OSPO: Object-Centric Self-Improving Preference Optimization for Text-to-Image Generation

OSPO: 以对象为中心的自我改进偏好优化用于文本到图像生成

Yoonjin Oh, Yongjin Kim, Hyomin Kim, Donghwan Chi, Sungwoong Kim

机构 * Korea University(韩国大学)

专题命中 文生图 :image generation(title,abstract);text-to-image(title,abstract);diffusion(abstract);分类 cs.CV

AI总结 OSPO通过自构造对象中心偏好数据和对象加权损失,提升文本到图像生成中对象级对齐和保真度,优于现有自我改进方法和专门扩散模型。

Comments 11 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 扩散模型 55 篇

2603.04696 2026-03-06 cs.CR cs.MM eess.IV 88%

When Denoising Becomes Unsigning: Theoretical and Empirical Analysis of Watermark Fragility Under Diffusion-Based Image Editing

去噪成为去签:扩散式图像编辑下水印脆弱性的理论与实证分析

Fai Gu, Qiyu Tang, Te Wen, Emily Davis, Finn Carter

专题命中 扩散模型 :diffusion(title,abstract);image editing(title,abstract);分类 cs.MM

AI总结 本文研究了基于扩散的图像编辑对水印鲁棒性的破坏,揭示了水印在扩散过程中的退化机制,并提出设计在生成变换时代仍具意义的水印方案的指导原则。

Comments Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.05106 2026-03-06 cs.CV cs.GR cs.LG cs.RO 86%

NeuralRemaster: Phase-Preserving Diffusion for Structure-Aligned Generation

NeuralRemaster: 保留相位的扩散用于结构对齐生成

Yu Zeng, Charles Ochoa, Mingyuan Zhou, Vishal M. Patel, Vitor Guizilini, Rowan McAllister

机构 * Toyota Research Institute(丰田研究院) University of Texas, Austin(德克萨斯大学奥斯汀分校) Johns Hopkins University(约翰霍普金斯大学)

专题命中 扩散模型 :diffusion(title,abstract);image generation(abstract);text-to-image(abstract);分类 cs.CV、cs.GR

AI总结 NeuralRemaster通过保留相位并随机化幅度,实现结构对齐的图像和视频生成,提升模拟到现实的转换性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.01639 2026-03-06 cs.RO 86%

Vision-based Tactile Image Generation via Contact Condition-guided Diffusion Model

基于视觉的触觉图像生成 via 接触条件引导的扩散模型

Xi Lin, Weiliang Xu, Yixian Mao, Jing Wang, Meixuan Lv, Lu Liu, Xihui Luo, Xinming Li

专题命中 扩散模型 :diffusion(title,abstract);image generation(title)

AI总结 本文提出了一种接触条件引导的扩散模型,通过将物体RGB图像和接触力数据映射到高保真的触觉图像,有效降低了均方误差和标记位移误差,提升了触觉视觉传感器在复杂负载下的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.05105 2026-03-06 cs.CV 83%

Diff-ES: Stage-wise Structural Diffusion Pruning via Evolutionary Search

Diff-ES: 通过进化搜索实现阶段式结构扩散剪枝

Zongfang Liu, Shengkun Tang, Zongliang Wu, Xin Yuan, Zhiqiang Shen

机构 * Zhejiang University(浙江大学) Westlake University(西湖大学) Mohamed bin Zayed University of Artificial Intelligence(穆罕默德·本·扎耶德人工智能大学)

专题命中 扩散模型 :diffusion(title,abstract);image generation(abstract);分类 cs.CV

AI总结 Diff-ES通过进化搜索优化阶段式结构化剪枝,实现高效且高质量的扩散模型压缩。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.22796 2026-03-06 cs.CV 83%

Parallel Diffusion Solver via Residual Dirichlet Policy Optimization

并行扩散求解器 via 剩余狄利克雷策略优化

Ruoyu Wang, Ziyu Li, Beier Zhu, Liangyu Yuan, Hanwang Zhang, Xun Yang, Xiaojun Chang, Chi Zhang

机构 * AGI lab, Westlake University(西溪大学AGI实验室) University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) Nanyang Technological University(南洋理工大学) Shanghai Jiao Tong University(上海交通大学) University of Science and Technology of China(中国科学技术大学)

专题命中 扩散模型 :diffusion(title,abstract);text-to-image(abstract);分类 cs.CV

AI总结 本文提出EPD-Solver,通过并行梯度评估和狄利克雷策略优化,提升扩散模型的低延迟采样性能。

Comments arXiv admin note: substantial text overlap with arXiv:2507.14797

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.21739 2026-03-06 cs.SD cs.LG eess.AS 82%

Noise-to-Notes: Diffusion-based Generation and Refinement for Automatic Drum Transcription

噪声到音符:基于扩散的生成与细化用于自动鼓件转录

Michael Yeung, Keisuke Toyama, Toya Teramoto, Shusuke Takahashi, Tamaki Kojima

机构 * Sony Group Corporation(索尼集团)

专题命中 扩散模型 :diffusion(title,abstract);inpainting(abstract)

AI总结 本研究提出N2N框架,利用扩散模型将音频条件高斯噪声转化为鼓件事件,结合退火伪Huber损失和音乐基础模型特征提升鲁棒性,实现自动鼓件转录的生成与细化。

Comments Accepted to ICASSP 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.24096 2026-03-06 cs.CV cs.AI cs.LG 80%

DiffusionHarmonizer: Bridging Neural Reconstruction and Photorealistic Simulation with Online Diffusion Enhancer

DiffusionHarmonizer: 通过在线扩散增强器连接神经重建与逼真模拟

Yuxuan Zhang, Katarína Tóthová, Zian Wang, Kangxue Yin, Haithem Turki, Riccardo de Lutio, Yen-Yu Chang, Or Litany, Sanja Fidler, Zan Gojcic

机构 * NVIDIA University of Toronto(多伦多大学) Cornell University(康奈尔大学) Technion(技术学院)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 DiffusionHarmonizer通过在线扩散增强器提升神经重建与逼真模拟的结合,解决动态物体整合与伪影问题,提高模拟保真度。

Comments For more details and updates, please visit our project website: https://research.nvidia.com/labs/sil/projects/diffusion-harmonizer

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.05315 2026-03-06 cs.CV 79%

Frequency-Aware Error-Bounded Caching for Accelerating Diffusion Transformers

面向频率的误差有界缓存用于加速扩散变换器

Guandong Li

机构 * iFLYTEK

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 SpectralCache通过统一缓存框架提升扩散变换器推理速度,实现2.46倍加速,质量与TeaCache相当。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.04638 2026-03-06 cs.CV cs.LG q-bio.QM 79%

Spinverse: Differentiable Physics for Permeability-Aware Microstructure Reconstruction from Diffusion MRI

Spinverse: 可微物理用于从扩散MRI中感知渗透性的微结构重建

Prathamesh Pradeep Khole, Mario M. Brenes, Zahra Kais Petiwala, Ehsan Mirafzali, Utkarsh Gupta, Jing-Rebecca Li, Andrada Ianus, Razvan Marinescu

机构 * University of California Santa Cruz(加州大学圣克鲁兹分校) University of California San Diego(加州大学圣地亚哥分校) Inria-Saclay(Inria-萨克莱实验室) Kings College London(伦敦国王学院)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 Spinverse通过可微物理方法从扩散MRI中感知渗透性,重建微结构并优化渗透性参数以提高边界准确性和结构有效性。

Comments 10 Pages, 5 Figures, 2 Tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.23589 2026-03-06 cs.AI cs.CV cs.LG 79%

BridgeDrive: Diffusion Bridge Policy for Closed-Loop Trajectory Planning in Autonomous Driving

BridgeDrive: 基于扩散桥的闭环轨迹规划扩散策略

Shu Liu, Wenlin Chen, Weihao Li, Zheng Wang, Lijin Yang, Jianing Huang, Yipin Zhang, Zhongzhan Huang, Ze Cheng, Hao Yang

机构 * Bosch (China) Investment Ltd(博世(中国)投资有限公司)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 BridgeDrive提出一种基于锚点的扩散桥策略,通过实时闭环轨迹规划提升自动驾驶的安全性和效率。

Comments Accepted for publication at ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.18534 2026-03-06 cs.CV cs.LG 79%

Elucidating the Design Space of Arbitrary-Noise-Based Diffusion Models

阐明基于任意噪声的扩散模型的设计空间

Xingyu Qiu, Mengying Yang, Xinghua Ma, Dong Liang, Fanding Li, Gongning Luo, Wei Wang, Kuanquan Wang, Shuo Li

机构 * Harbin Institute of Technology(哈尔滨工业大学) Case Western Reserve University(凯斯西储大学)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 EDA通过扩展噪声模式灵活性并保持模块化,提升图像恢复任务的泛化能力。

Comments 16 pages, 4 figures, accepted by CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.00844 2026-03-06 hep-ph hep-th nucl-th 78%

Covariant diffusion tensor for jet momentum broadening out of equilibrium

协变扩散张量用于非平衡条件下喷注动量展宽

Isabella Danhoni, Nicki Mullins, Jorge Noronha

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 本文提出协变扩散张量用于非平衡条件下喷注动量展宽研究,揭示了能量扩散和非对角项等新信息。

Comments Updated Refs

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.03540 2026-03-06 cs.LG cs.AI 78%

Path Planning for Masked Diffusion Model Sampling

基于掩码扩散模型采样的路径规划

Fred Zhangzhi Peng, Zachary Bezemek, Sawan Patel, Jarrid Rector-Brooks, Sherwood Yao, Avishek Joey Bose, Alexander Tong, Pranam Chatterjee

机构 * Duke University(杜克大学) Atom Bioworks(Atom生物工坊) Mila – Québec AI Institute(魁北克AI研究院) Université de Montréal(蒙特利尔大学) The University of Oxford(牛津大学) Aithyra(Aithyra公司) University of Pennsylvania(宾夕法尼亚大学)

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 本文提出路径规划策略,通过规划和去噪两个阶段提升掩码扩散模型的生成质量,实验表明在多个领域均取得显著改进。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.05139 2026-03-06 physics.chem-ph cs.AI cs.LG 78%

Particle-Guided Diffusion for Gas-Phase Reaction Kinetics

粒子引导的扩散用于气相反应动力学

Andrew Millard, Henrik Pedersen

机构 * Department of Computer and Information Science(计算机与信息科学系) Linköping University(林雪平大学) Department of Physics, Chemistry and Biology(物理、化学和生物系)

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 本文提出利用扩散模型进行物理引导采样,用于解决气相化学反应动力学问题,通过训练求解对流-反应-扩散方程的解,生成物理一致的浓度场并准确预测出口浓度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.05119 2026-03-06 q-fin.ST math.ST stat.TH 78%

Asymptotic Separability of Diffusion and Jump Components in High-Frequency CIR and CKLS Models

扩散与跳跃成分在高频CIR和CKLS模型中的渐近分离

Sourojyoti Barick

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 本文提出基于MDPDE的稳健方法,用于高频CIR和CKLS模型中扩散与跳跃成分的渐近分离及检测。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.04893 2026-03-06 cs.CL cs.AI 78%

Free Lunch for Pass@$k$? Low Cost Diverse Sampling for Diffusion Language Models

免费午餐吗?低成本的多样化采样用于扩散语言模型

Sean Lamont, Christian Walder, Paul Montague, Amir Dezfouli, Michael Norrish

机构 * Australian National University(澳大利亚国立大学) Defence Science and Technology Group(国防科学与技术集团) Google DeepMind(谷歌DeepMind) BIMLOGIQ

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 本文提出了一种低成本方法,通过修改中间样本以增强扩散语言模型的生成多样性,从而提升Pass@$k$任务的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.04844 2026-03-06 cond-mat.stat-mech cond-mat.dis-nn 78%

Diffusion disorder in the contact process

接触过程中的扩散紊乱

Valentin Anfray, Manisha Dhayal, Hong-Yan Shih, Thomas Vojta

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 研究发现接触过程中的扩散紊乱破坏了定向渗透临界点,使其属于无限随机性 universality 类,并通过有效模型解释了扩散紊乱对治愈速率的影响。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.04790 2026-03-06 cs.LG cs.RO 78%

Diffusion Policy through Conditional Proximal Policy Optimization

通过条件近端策略优化实现扩散策略

Ben Liu, Shunpeng Yang, Hua Chen

机构 * Southern University of Science and Technology, Shenzhen, China(南方科技大学) Hong Kong University of Science and Technology, Hongkong, China(香港科技大学) Zhejiang University-University of Illinois Urbana-Champaign Institute, Haining, China(浙江大学-伊利诺伊大学厄巴纳-香槟分校联合研究所)

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 本文提出了一种基于条件近端策略优化的高效方法,用于在在线强化学习中训练多模态扩散策略,解决了计算动作对数似然的难题,并在多个基准任务中取得优异性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.04752 2026-03-06 stat.ME math.ST stat.TH 78%

Robust estimation via $γ$-divergence for diffusion processes

通过γ-散度对扩散过程进行鲁棒估计

Tomoyuki Nakagawa, Yusuke Shimizu

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 本文提出通过γ-散度方法对扩散过程中的异常值进行鲁棒估计,探讨了估计量的渐近性质和影响函数的有界性。

Comments 25page

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.04514 2026-03-06 cs.AI 78%

Progressive Refinement Regulation for Accelerating Diffusion Language Model Decoding

逐步细化调节以加速扩散语言模型解码

Lipeng Wan, Jianhui Gu, Junjie Ma, Jianguo Huang, Shiguang Sun, Siyuan Li, Xuguang Lan

机构 * Department of Artificial Intelligence, Xi'an Jiaotong University(人工智能系,西安交通大学) College of Computing and Data Science, Nanyang Technological University(计算与数据科学学院,南洋理工大学) School of Computer Science and Technology, Harbin Institute of Technology(计算机科学与技术学院,哈尔滨工业大学)

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 逐步细化调节通过动态控制细化规则提升扩散语言模型解码效率并保持生成质量。

Comments 19 pages, 10 figures, Code available upon publication

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.04431 2026-03-06 cs.LG cs.AI 78%

Uncertainty-Calibrated Spatiotemporal Field Diffusion with Sparse Supervision

具有稀疏监督的不确定性校准时空场扩散

Kevin Valencia, Xihaier Luo, Shinjae Yoo, David Keetae Park

机构 * University of California, Los Angeles(加州大学洛杉矶分校) Brookhaven National Laboratory(布鲁克海文国家实验室)

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 SOLID通过稀疏监督学习时空动态,实现高精度不确定性校准的场重建。

Comments 18 pages, 9 figures, 6 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.03473 2026-03-06 math.DS math.AP 78%

On average population levels for models with directed diffusion in heterogeneous environments

关于具有定向扩散的异质环境中模型的平均种群水平

André Rickes, Elena Braverman

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 研究揭示了在异质环境中,种群总量与扩散系数及λ的关系复杂,推翻了临界λ*的假设,探讨了扩散策略参数P的影响。

Comments 22 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.13586 2026-03-06 cs.CL cs.AI cs.LG 78%

ReFusion: A Diffusion Large Language Model with Parallel Autoregressive Decoding

ReFusion:一种具有并行自回归解码的扩散大语言模型

Jia-Nan Li, Jian Guan, Wei Wu, Chongxuan Li

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 ReFusion通过整合序列重组到因果注意框架中,实现并行解码和高效生成,显著提升性能和速度,缩小与传统自回归模型的差距。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.18360 2026-03-06 nlin.AO 78%

Phase reduction of reaction-diffusion systems with delay

带有延迟的反应扩散系统的相降维

Ayumi Ozawa, Yoji Kawamura

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 本研究提出了一种针对带有延迟的反应扩散系统的相降维方法,通过双线性形式和相灵敏度函数,验证了其在Schnakenberg系统中的应用,并用于优化相位同步稳定性。

Comments 12 pages, 7 figures

Journal ref Chaos 36 (2026) 033107

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.19916 2026-03-06 cs.RO 78%

GUIDE: A Diffusion-Based Autonomous Robot Exploration Framework Using Global Graph Inference

GUIDE: 一种基于扩散的自主机器人探索框架,使用全局图推断

Zijun Che, Yinghong Zhang, Shengyi Liang, Boyu Zhou, Jun Ma, Jinni Zhou

机构 * The Hong Kong University of Science and Technology (Guangzhou)(香港科学与技术大学(广州)) Southern University of Science and Technology(南方科技大学)

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 GUIDE通过结合全局图推断与扩散决策,提升机器人在复杂环境中的自主探索效率,实现更快的覆盖完成和更少的冗余运动。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.24335 2026-03-06 cs.CV cs.LG 70%

Hyperspherical Latents Improve Continuous-Token Autoregressive Generation

超球面潜在变量改进连续令牌自回归生成

Guolin Ke, Hui Xue

机构 * DP Technology(DP技术公司) Microsoft Research(微软研究院)

专题命中 扩散模型 :image generation(abstract);diffusion(abstract);分类 cs.CV

AI总结 SphereAR通过超球面约束解决自回归生成中的方差崩溃问题,在ImageNet生成中达到新的SOTA,超越了扩散和掩码生成模型。

Comments ICLR version

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.05449 2026-03-06 cs.CV cs.AI cs.GR 62%

RealWonder: Real-Time Physical Action-Conditioned Video Generation

RealWonder: 基于实时物理动作的视频生成

Wei Liu, Ziyu Chen, Zizhang Li, Yue Wang, Hong-Xing Yu, Jiajun Wu

机构 * Stanford University(斯坦福大学) University of Southern California(南加州大学)

专题命中 扩散模型 :diffusion(abstract);分类 cs.CV、cs.GR

AI总结 RealWonder通过物理模拟实现实时动作条件视频生成,利用3D重建、物理模拟和简化视频生成器,在单张图像基础上生成高质量视频,适用于多种物理场景。

Comments The first two authors contributed equally. The last two authors advised equally. Project website: https://liuwei283.github.io/RealWonder/

详情

展开后加载摘要…

URL PDF HTML 收藏
2405.18991 2026-03-06 cs.CV cs.CL cs.MM 62%

EasyAnimate: High-Performance Video Generation Framework with Hybrid Windows Attention and Reward Backpropagation

EasyAnimate:基于混合窗口注意力和奖励反向传播的高性能视频生成框架

Jiaqi Xu, Kunzhe Huang, Xinyi Zou, Yunkuo Chen, Bo Liu, MengLi Cheng, Jun Huang, Xing Shi

机构 * Alibaba Cloud(阿里云)

专题命中 扩散模型 :diffusion(abstract);分类 cs.CV、cs.MM

AI总结 EasyAnimate通过混合窗口注意力和奖励反向传播提升视频生成效率与质量,实现高性能视频生成。

Comments 10 pages, 8 figures, ACM MM 2025

详情

展开后加载摘要…

URL PDF HTML 收藏