arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

视觉与机器人

图像生成

图像生成、文生图、图像编辑、扩散模型和可控生成。

2026-03-04 至 2026-03-04 共收录 73 信号源:cs.CV, cs.GR, cs.MM

1. 文生图 3 篇

2511.07970 2026-03-04 cs.LG 89%

Continual Unlearning for Text-to-Image Diffusion Models: A Regularization Perspective

文本到图像扩散模型的持续反学习:一种正则化视角

Justin Lee, Zheda Mai, Jinsu Yoo, Chongyu Fan, Cheng Zhang, Wei-Lun Chao

机构 * The Ohio State University(俄亥俄州立大学) Michigan State University(密歇根州立大学) Texas A&M University(德克萨斯大学安德森分校) Boston University(波士顿大学)

专题命中 文生图 :text-to-image(title,abstract);diffusion(title,abstract);image generation(abstract)

AI总结 本文提出通过正则化方法解决文本到图像扩散模型中持续反学习的问题,通过减轻参数漂移和增强语义意识,提升反学习性能并推动生成式AI的安全发展。

Comments Accepted to ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.17623 2026-03-04 cs.MM cs.CV 62%

Synthetic Perception: Can Generated Images Unlock Latent Visual Prior for Text-Centric Reasoning?

合成感知:生成图像能否解锁潜在的视觉先验以用于以文本为中心的推理?

Yuesheng Huang, Peng Zhang, Xiaoxin Wu, Riliang Liu, Jiaqi Liang

专题命中 文生图 :text-to-image(abstract);分类 cs.CV、cs.MM

AI总结 本文探讨生成图像能否解锁潜在视觉先验以提升文本中心推理,通过多模态融合架构和提示工程策略实现性能提升。

Comments Accepted as a poster at the International Conference on Machine Learning (ICML 2025) NewInML Workshop

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.03163 2026-03-04 cs.CV cs.AI 57%

Conditioned Activation Transport for T2I Safety Steering

基于条件激活传输的T2I安全引导

Maciej Chrabąszcz, Aleksander Szymczyk, Jan Dubiński, Tomasz Trzciński, Franziska Boenisch, Adam Dziedzic

机构 * NASK National Research Institute(NASK国家研究所) Warsaw University of Technology(华沙技术大学) IDEAS Research Institute(IDEAS研究 institute) CISPA Helmholtz Center for Information Security(CISPA海德堡中心 for 信息安全)

专题命中 文生图 :text-to-image(abstract);分类 cs.CV

AI总结 本文提出条件激活传输框架,通过几何条件机制和非线性传输映射,有效减少T2I生成不安全内容的风险,提升图像生成的安全性与保真度。

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 扩散模型 59 篇

2510.14765 2026-03-04 cs.CV cs.AI cs.GR 88%

Inpainting the Red Planet: Diffusion Models for the Reconstruction of Martian Environments in Virtual Reality

为虚拟现实重建火星环境的红色星球修复:扩散模型

Giuseppe Lorenzo Catalano, Agata Marta Soccini

机构 * Computer Science Department, Università degli Studi di Torino(托斯纳大学计算机科学系)

专题命中 扩散模型 :diffusion(title,abstract);inpainting(title,abstract);分类 cs.CV、cs.GR

AI总结 本文提出基于无条件扩散模型的火星表面重建方法,利用增强数据集和非均匀重缩放策略,优于传统空洞填充技术,在重建精度和感知相似性上表现更优。

Comments 21 pages, 9 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.24108 2026-03-04 cs.GR cs.AI cs.CV cs.LG 86%

Navigating with Annealing Guidance Scale in Diffusion Space

在扩散空间中利用退火引导尺度导航

Shai Yehezkel, Omer Dahary, Andrey Voynov, Daniel Cohen-Or

机构 * Tel Aviv University(特拉维夫大学) Google DeepMind(谷歌DeepMind)

专题命中 扩散模型 :diffusion(title,abstract);image generation(abstract);text-to-image(abstract);分类 cs.CV、cs.GR

AI总结 本文提出了一种退火引导调度器,通过动态调整引导尺度提升文本到图像生成的质量和对齐度,无需额外资源消耗。

Comments SIGGRAPH Asia, 2025. Project page: https://annealing-guidance.github.io/annealing-guidance/

Journal ref ACM Trans. Graph., Vol. 44, No. 6, Article 5. Publication date: December 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.02692 2026-03-04 cs.LG cs.AI 85%

Fine-Tuning Diffusion Models via Intermediate Distribution Shaping

通过中间分布塑形微调扩散模型

Gautham Govind Anil, Shaan Ul Haque, Nithish Kannen, Dheeraj Nagaraj, Sanjay Shakkottai, Karthikeyan Shanmugam

机构 * Google DeepMind(谷歌DeepMind) Georgia Institute of Technology(佐治亚理工学院) University of Texas at Austin(德克萨斯大学奥斯汀分校)

专题命中 扩散模型 :diffusion(title,abstract);image generation(abstract);text-to-image(abstract)

AI总结 通过中间分布塑形提升扩散模型微调效果,改进文本到图像生成质量

Comments Accepted at ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.15682 2026-03-04 cs.CV 83%

Evolutionary Caching to Accelerate Your Off-the-Shelf Diffusion Model

进化缓存加速现成扩散模型

Anirud Aggarwal, Abhinav Shrivastava, Matthew Gwilliam

机构 * University of Maryland, College Park(马里兰大学学院公园分校)

专题命中 扩散模型 :diffusion(title,abstract);image generation(abstract);分类 cs.CV

AI总结 ECAD通过遗传算法学习高效缓存策略,显著提升扩散模型推理速度并优化质量-延迟平衡。

Comments 39 pages, 29 figures, 15 tables. Accepted at ICLR 2026. Project page and code: https://research.aniaggarwal.com/ecad

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.09646 2026-03-04 eess.IV cs.CV cs.GR cs.LG 81%

RealOSR: Latent Guidance Boosts Diffusion-based Real-world Omnidirectional Image Super-Resolutions

RealOSR: 潜在引导提升基于扩散模型的现实世界全方位图像超分辨率

Xuhan Sheng, Runyi Li, Bin Chen, Weiqi Li, Xu Jiang, Jian Zhang

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV、cs.GR

AI总结 RealOSR通过高效潜在引导提升基于扩散模型的现实世界全方位图像超分辨率,实现视觉质量和推断速度的显著提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.03265 2026-03-04 cs.CV 79%

DuoMo: Dual Motion Diffusion for World-Space Human Reconstruction

DuoMo:用于世界空间人体重建的双动差分

Yufu Wang, Evonne Ng, Soyong Shin, Rawal Khirodkar, Yuan Dong, Zhaoen Su, Jinhyung Park, Kris Kitani, Alexander Richard, Fabian Prada, Michael Zollhofer

机构 * Meta Reality Labs University of Pennsylvania(宾夕法尼亚大学) Carnegie Mellon University(卡内基梅隆大学)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 DuoMo通过双扩散模型实现世界空间人体运动重建,有效处理噪声和不完整输入,提升重建精度。

Comments CVPR 2026. Project page: https://yufu-wang.github.io/duomo/

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.02882 2026-03-04 cs.CV 79%

SIGMark: Scalable In-Generation Watermark with Blind Extraction for Video Diffusion

SIGMark: 用于视频扩散模型的可扩展生成内水印与盲提取

Xinjie Zhu, Zijing Zhao, Hui Jin, Qingxiao Guo, Yilong Ma, Yunhao Wang, Xiaobing Guo, Weifeng Zhang

机构 * Lenovo Research(联想研究院)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 SIGMark是一种用于视频扩散模型的可扩展生成内水印框架,通过盲提取技术实现无损水印并提升鲁棒性。

Comments Accepted to ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.02710 2026-03-04 cs.CV 79%

MiM-DiT: MoE in MoE with Diffusion Transformers for All-in-One Image Restoration

MiM-DiT:基于扩散变换器的MoE在MoE中实现全功能图像修复

Lingshun Kong, Jiawei Zhang, Zhengpeng Duan, Xiaohe Wu, Yueqi Yang, Xiaotao Wang, Dongqing Zou, Lei Lei, Jinshan Pan

机构 * Nanjing University of Science and Technology(南京理工大学) Nankai University(南开大学) Harbin Institute of Technology(哈尔滨工业大学)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 MiM-DiT通过双层MoE架构与预训练扩散模型,实现对多种图像退化类型的统一修复,提升复杂真实场景下的修复效果。

Comments Project website: https://github.com/kkkls/MIM-DiT

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.02691 2026-03-04 cs.CV 79%

ReCo-Diff: Residual-Conditioned Deterministic Sampling for Cold Diffusion in Sparse-View CT

ReCo-Diff:基于残差的确定性采样用于稀疏视角CT中的冷扩散

Yong Eun Choi, Hyoung Suk Park, Kiwan Jeon, Hyun-Cheol Park, Sung Ho Kang

机构 * National Institute for Mathematical Sciences, Daejeon, 34047, Republic of Korea(韩国全南数学研究所) Department of Computer Engineering, Korea National University of Transportation, Chungju, 27469, Republic of Korea(韩国交通国立大学计算机工程系)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 ReCo-Diff通过残差条件化的确定性采样提升稀疏视角CT重建的精度与稳定性。

Comments 10 pages, 4 figures. Submitted to MICCAI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.17561 2026-03-04 cs.CV cs.AI 79%

Model Already Knows the Best Noise: Bayesian Active Noise Selection via Attention in Video Diffusion Model

模型已知最佳噪声:通过注意力的贝叶斯主动噪声选择在视频扩散模型中

Kwanyoung Kim, Sanghyun Kim

机构 * Department of AI Convergence, Gwangju Institute of Science and Technology (GIST)(人工智能融合系,光州科学技术院) Samsung Research(三星研究所)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 通过注意力机制的贝叶斯主动噪声选择方法,提升视频扩散模型的生成质量与时间一致性。

Comments Cam ready version of ICLR 26

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.02348 2026-03-04 cs.LG cs.AI cs.RO 79%

Diffusion-MPC in Discrete Domains: Feasibility Constraints, Horizon Effects, and Critic Alignment: Case study with Tetris

离散领域中的扩散-MPC:可行性约束、时间范围效应与批评者对齐:以Tetris为例

Haochuan Kevin Wang

机构 * Massachusetts Institute of Technology(麻省理工学院)

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 本文研究了离散领域中Diffusion-MPC的可行性约束、时间范围效应及批评者对齐问题,通过Tetris案例发现可行性掩码和计算选择对规划效果有显著影响。

Comments 7 pages, 3 figures, 2 tables. Includes regret diagnostics and compute-quality frontier analysis. Code and experiment configurations available in the Diffusion-Tetris repository

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.20128 2026-03-04 cs.SD 79%

Diffusion-based Symbolic Music Generation with Structured State Space Models

基于结构状态空间模型的扩散式符号音乐生成

Shenghua Yuan, Xing Tang, Jiatao Chen, Tianming Xie, Jing Wang, Bing Shi

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 SMDIM通过结合结构状态空间模型和Mamba-FeedForward-Attention块,实现了高效的符号音乐生成,兼顾可扩展性和音乐表现力。

Comments This is a duplicate submission. The updated and correct version of this paper is available at arXiv:2603.00576, Efficient Long-Sequence Diffusion Modeling for Symbolic Music Generation. Please disregard this version

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.03161 2026-03-04 math.AP 78%

Stable solutions to reaction-diffusion elliptic problems

反应扩散椭圆问题的稳定解

Xavier Cabre

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 研究反应扩散椭圆问题中稳定解的正则性和存在性,解决Brezis提出的问题,并探讨分数阶拉普拉斯算子等的相关进展。

Comments Accepted on October 8th 2025 for publication in the International Congress of Mathematicians (ICM) Proceedings 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.02761 2026-03-04 physics.chem-ph cs.CE 78%

Hybrid Machine Learning for Enhanced Prediction of Diffusion Coefficients in Liquids

混合机器学习用于液体中扩散系数的增强预测

Jens Wagner, Zeno Romero, Kerstin Münnemann, Sebastian Schmitt, Thomas Specht, Hans Hasse, Fabian Jirasek

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 本文提出了一种结合斯托克斯-艾因斯坦方程与机器学习的混合模型,用于高精度预测液体中分子的扩散系数,提升了过程设计与优化的应用价值。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.02760 2026-03-04 cs.CL cs.AI 78%

Efficient Self-Evaluation for Diffusion Language Models via Sequence Regeneration

通过序列再生实现扩散语言模型的高效自评

Linhao Zhong, Linyu Wu, Wen Wang, Yuling Xi, Chenchen Jing, Jiaheng Zhang, Hao Chen, Chunhua Shen

机构 * Zhejiang University(浙江大学) National University of Singapore(新加坡国立大学) Zhejiang University of Technology(浙江工业大学)

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 本文提出DiSE方法,通过序列再生概率实现扩散语言模型的高效自评,提升质量评估的效率和可靠性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.20587 2026-03-04 quant-ph physics.optics 78%

A Hybrid Jump-Diffusion Model for Coherent Optical Control of Quantum Emitters in hBN

一种混合跳扩散模型用于hBN中机械解耦量子发射体的相干光学控制

Saifian Farooq Bhat, Michael K. Koch, Sachin Negi, Alexander Kubanek, Vibhav Bharadwaj

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 本文提出一种混合跳扩散模型,用于研究hBN中机械解耦量子发射体的相干光学控制,通过模拟温度依赖的光谱动态和相干性,揭示了声子相关的光谱扩散和跳跃样不稳定性,并预测了临界温度下的过阻尼动力学。

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.16733 2026-03-04 eess.SP 78%

Generative Diffusion Models for Wireless Networks: Fundamental, Architecture, and State-of-the-Art

生成扩散模型用于无线网络:基础、架构与最新进展

Dayu Fan, Rui Meng, Xiaodong Xu, Yiming Liu, Guoshun Nan, Chenyuan Feng, Shujun Han, Song Gao, Bingxuan Xu, Dusit Niyato, Tony Q. S. Quek, Ping Zhang

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 本文综述了生成扩散模型在无线网络中的应用,分析了其在感知、传输和应用领域的技术演进,探讨了核心挑战与潜在解决方案。

Comments 46 pages, 10 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.11583 2026-03-04 math.NA cs.NA 78%

Convergence and long-time behavior of finite volumes for a generalized Poisson-Nernst-Planck system with cross-diffusion and size exclusion

有限体积法在具有交叉扩散和尺寸排斥的广义泊松-涅斯特-计划克系统中的收敛性与长时间行为

Clément Cancès, Maxime Herda, Annamaria Massimini

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 本文提出了一种有限体积方案,用于研究具有交叉扩散和尺寸排斥的广义泊松-涅斯特-计划克系统,证明了其热力学一致性和收敛性,并探讨了长时间行为及收敛速度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.02651 2026-03-04 cond-mat.mtrl-sci 78%

Fragmenting Diffusion Pathways Confers Extraordinary Radiation Resistance in Refractory Multicomponent Alloys

碎裂扩散路径赋予难熔多组分合金极高的辐射抗性

Bin Xing, Bijun Xie, Wanjuan Zou, Eric Lang, Evgeniy Boltynjuk, Hangman Chen, Michael P Short, George Tynan, Timothy J Rupert, Jason Trelewicz, Horst Hahn, Blas P Uberuaga, Khalid Hattar, Penghui Cao

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 通过碎裂扩散路径,研究发现多组分合金能显著提高辐射抗性,为设计抗辐射材料提供了新思路。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.02646 2026-03-04 cs.RO 78%

Compositional Visual Planning via Inference-Time Diffusion Scaling

通过推理时扩散缩放进行组合式视觉规划

Yixin Zhang, Yunhao Luo, Utkarsh Aashu Mishra, Woo Chul Shin, Yongxin Chen, Danfei Xu

机构 * Georgia Institute of Technology(佐治亚理工学院) University of Michigan(密歇根大学)

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 本文提出通过推理时扩散缩放进行组合式视觉规划,利用Tweedie估计强制边界一致,实现长时间范围的稳定规划。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.02547 2026-03-04 cs.CL cs.AI cs.LG 78%

CoDAR: Continuous Diffusion Language Models are More Powerful Than You Think

CoDAR:连续扩散语言模型比你想象的更强大

Junzhe Shen, Jieru Zhao, Ziwei He, Zhouhan Lin

机构 * LUMIA Lab(LUMIA实验室) School of Artificial Intelligence(人工智能学院) Shanghai Jiao Tong University(上海交通大学) Shanghai Innovation Institute(上海创新研究院) School of Computer Science(计算机科学学院) Shanghai AI Laboratory(上海人工智能实验室)

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 CoDAR通过改进的连续扩散模型和上下文自回归解码器,在生成质量上超越了潜在扩散,并与强离散DLMs相竞争。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.02542 2026-03-04 cs.AI 78%

AnchorDrive: LLM Scenario Rollout with Anchor-Guided Diffusion Regeneration for Safety-Critical Scenario Generation

AnchorDrive: 基于锚点引导扩散再生的LLM场景回放用于安全关键场景生成

Zhulin Jiang, Zetao Li, Cheng Wang, Ziwen Wang, Chen Xiong

机构 * School of Intelligent Systems Engineering, Sun Yat-sen University, Shenzhen, China(中山大学智能系统工程学院,深圳,中国)

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 AnchorDrive通过结合LLM的可控生成和扩散模型的真实轨迹生成,实现安全关键场景的高效合成,提升场景的真实性和可控性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.02447 2026-03-04 cs.LG 78%

Spectral Regularization for Diffusion Models

扩散模型的频谱正则化

Satish Chandran, Nicolas Roque dos Santos, Yunshu Wu, Greg Ver Steeg, Evangelos Papalexakis

机构 * ucr_math(加州大学河滨分校数学系) ucr_cs(加州大学河滨分校计算机科学系)

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 本文提出了一种基于频谱正则化的扩散模型训练方法,通过引入可微的傅里叶和小波域损失,提升生成样本的频率平衡和多尺度结构质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.02333 2026-03-04 cs.CL 78%

Characterizing Memorization in Diffusion Language Models: Generalized Extraction and Sampling Effects

刻画扩散语言模型中的记忆化:通用提取与采样效应

Xiaoyu Luo, Wenrui Yu, Qiongxiu Li, Johannes Bjerva

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 本文研究了扩散语言模型的记忆化现象,提出通用概率提取框架并验证其理论,显示DLMs在记忆化信息泄露方面优于自回归模型。

Comments 21 pages, 9 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.12274 2026-03-04 cs.LG physics.geo-ph 78%

Function-Space Decoupled Diffusion for Forward and Inverse Modeling in Carbon Capture and Storage

函数空间解耦扩散用于碳捕集与封存的正反演建模

Xin Ju, Jiachen Yao, Anima Anandkumar, Sally M. Benson, Gege Wen

机构 * Stanford University(斯坦福大学) California Institute of Technology(加州理工学院) Imperial College London(伦敦帝国学院)

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 函数空间解耦扩散方法在碳捕集与封存的正反演建模中实现高效且物理一致的参数恢复与数据同化。

Comments Accepted to ICLR AI&PDE Workshop

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.23265 2026-03-04 cs.LG 78%

CREPE: Controlling Diffusion with Replica Exchange

CREPE:通过复制交换控制扩散模型

Jiajun He, Paul Jeha, Peter Potaptchik, Leo Zhang, José Miguel Hernández-Lobato, Yuanqi Du, Saifuddin Syed, Francisco Vargas

机构 * University of Cambridge(剑桥大学) Technical University of Denmark(丹麦技术大学) University of Oxford(牛津大学) Cornell University(康奈尔大学) University of British Columbia(不列颠哥伦比亚大学) Xaira Therapeutics(Xaira制药公司)

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 CREPE通过复制交换算法在推理过程中控制扩散模型,实现样本生成的高多样性与在线优化,适用于多种任务并优于传统SMC方法。

Comments Accepted to ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.08965 2026-03-04 cs.LG cs.AI stat.ML 78%

Improving Classifier-Free Guidance in Masked Diffusion: Low-Dim Theoretical Insights with High-Dim Impact

改进屏蔽扩散中的分类器自由引导:低维理论见解与高维影响

Kevin Rojas, Ye He, Chieh-Hsin Lai, Yuhta Takida, Yuki Mitsufuji, Molei Tao

机构 * Georgia Institute of Technology(佐治亚理工学院) Sony AI(索尼人工智能)

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 本文提出了一种改进的分类器自由引导方法,通过理论分析和实验验证,解决了早期采样阶段引导过强导致的生成质量下降问题,并通过简单代码调整提升了样本质量。

详情

展开后加载摘要…

URL PDF HTML 收藏