arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

图像生成

图像生成、文生图、图像编辑、扩散模型和可控生成。

2026-08-11 至 2026-08-11 共收录 123 信号源:cs.CV, cs.GR, cs.MM

1. 扩散模型 123 篇

2608.08720 2026-08-11 cs.CV 新提交 89%

High-Quality Exposure Correction with Diffusion-Based Image Generation Priors

基于扩散模型图像生成先验的高质量曝光校正

Ziwen Li, Meng Cao, Jinpu Zhang, Chunyang Li, Long Bao, Heng Sun, Yuehuan Wang

机构 * Huazhong University of Science and Technology(华中科技大学) Mohamed bin Zayed University of Artificial Intelligence(穆罕默德·本·扎耶德人工智能大学) National University of Defense Technology(国防科技大学) Xiaomi Communications Company Ltd.(小米通讯有限公司)

专题命中 扩散模型 :diffusion(title,abstract);image generation(title,abstract);分类 cs.CV

AI总结 本文提出基于扩散先验的曝光校正框架DPEC,通过高效微调策略与联合交叉注意力模块,在多数据集上实现了优于现有方法的曝光校正性能。

Comments Accepted by IEEE Transactions on Multimedia (TMM)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.09438 2026-08-11 cs.CV 新提交 85%

Unveiling the Secret of AdaLN-Zero in Diffusion Transformer

揭示扩散Transformer中AdaLN-Zero的秘密

Jie Zhu, Mingyu Ding, Boqiang Duan, Leye Wang, Jingdong Wang

机构 * Peking University(北京大学) UC Berkeley(加州大学伯克利分校) Baidu(百度)

专题命中 扩散模型 :diffusion(title,abstract);image generation(abstract);text-to-image(abstract);分类 cs.CV

AI总结 本研究探究扩散Transformer(DiT)中AdaLN-Zero性能优于AdaLN的原因,发现零初始化是关键要素,提出AdaLN-Gaussian初始化策略与SE-adaLN-Zero机制,经多数据集实验验证其有效性与泛化性。

Comments Accept by IEEE TPAMI 2026, camera-ready version

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.02743 2026-08-11 cs.CV 版本更新 83%

MultiShadow: Multi-Object Shadow Generation for Image Compositing via Diffusion Model

MultiShadow: 基于扩散模型的多物体阴影生成用于图像合成

Waqas Ahmed, Dean Diepeveen, Ferdous Sohel

机构 * School of Information Technology, Murdoch University(信息科技学院,穆尔彻大学)

专题命中 扩散模型 :diffusion(title,abstract);text-to-image(abstract);分类 cs.CV

AI总结 本文提出基于扩散模型的多物体阴影生成方法,通过多模态特征融合和注意力对齐损失,实现多物体阴影的物理合理合成。

Comments This work is currently under consideration for publication

详情

展开后加载摘要…

URL PDF HTML 收藏
2312.12763 2026-08-11 cs.CV 版本更新 83%

AMD:Anatomical Motion Diffusion with Interpretable Motion Decomposition and Fusion

AMD:结合可解释动作分解与融合的解剖学动作扩散模型

Beibei Jing, Youjia Zhang, Zikai Song, Junqing Yu, Wei Yang

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 本文提出AMD模型,利用LLM将文本解析为解剖学脚本,结合双分支融合方案平衡文本与脚本影响,在CLCD1、CLCD2等复杂动作数据集上性能优于现有SOTA模型。

Comments Corrected missing spaces in the abstract; no changes to the paper

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.09505 2026-08-11 math.NA cs.NA 新提交 82%

Conditional Uniqueness and Optimal Energy-Norm Convergence for the Dynamic Diffusion Finite Element Method

动态扩散有限元方法的条件唯一性与最优能量范数收敛性

Isaac P. Santos

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 本文针对动态扩散有限元格式,推导其离散解的条件唯一性与最优一阶能量范数收敛估计,数值实验验证了理论结果,拓展了该格式的数学理解。

Comments 35 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.08734 2026-08-11 cs.CV 新提交 80%

IDATA: Scalable Invertible Diffusion for Unrestricted Adversarial Transfer Attack

IDATA:用于无限制对抗迁移攻击的可扩展可逆扩散模型

Yi Pan, Jun-Jie Huang, Tianrui Liu, Zihan Chen, Lin Liu, Zhao Wentao

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 IDATA是一种用于无限制对抗迁移攻击的内存高效扩散框架,通过可逆扩散模块与低频约束模块提升攻击性能,在多基准测试中优于现有方法,可用于评估深度视觉模型黑盒鲁棒性。

Comments Adversarial attack,Invertible diffusion model,Memory-efficient,Low-frequency

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.09445 2026-08-11 cs.CR cs.CV 新提交 79%

DiffSafeMerge: Mitigating Backdoor Inheritance in Diffusion Model Merging

DiffSafeMerge:缓解扩散模型合并中的后门继承问题

Jiayang Zhang, Ji Guo, Jiachen Li, Wenshu Fan, Wenbo Jiang

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 DiffSafeMerge是一种缓解扩散模型合并中后门继承的方法,通过评分源模块、收缩可疑贡献并在干净去噪损失预算下选择衰减,在多组实验中实现低攻击成功率和低FID。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.09231 2026-08-11 cs.CV 新提交 79%

BAG: Budget-Aware Gating for Diffusion Caching

BAG:面向扩散缓存的预算感知门控机制

Tong Zhao, Mingkun Lei, Yucheng Han, Chi Zhang

机构 * Westlake AGI Lab(西湖AGI实验室)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 提出BAG(预算感知门控机制),通过离线到在线调度蒸馏训练轻量门控网络,在FLUX.1-dev和Wan2.1上实现优于现有最优缓存方法的性能。

Comments 22 pages, 12 figures, and 13 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.09133 2026-08-11 cs.CV cs.AI 新提交 79%

When Latents Forget Pixels: Restoring Fidelity in Diffusion Transformer Super-Resolution

当潜变量遗忘像素时:在扩散Transformer超分辨率中恢复保真度

Yu Shi, Yuyao Zhang, Yu-wing Tai

机构 * Dartmouth College(达特茅斯学院)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 本研究针对扩散Transformer超分辨率中VAE压缩导致的保真度下降问题,提出像素锚定超分辨率框架,通过复用VAE前的像素证据提升结果的忠实度,实验验证其性能优于现有潜变量生成式超分辨率方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.08999 2026-08-11 cs.CV cs.AI 新提交 79%

DeepFreqMark: End-To-End Learnable Frequency-Domain Watermarking with Spherical Attack Simulation for Latent Diffusion Models

DeepFreqMark:面向潜在扩散模型的、结合球形攻击模拟的端到端可学习频域水印

Chen-Hsiu Huang, Mario Köppen, Ja-Ling Wu

机构 * National Taiwan University(台湾大学) Kyushu Institute of Technology(九州工业大学)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 针对潜在扩散模型生成图像的版权与虚假信息问题,提出DeepFreqMark频域水印框架,结合球形攻击模拟规避计算瓶颈,其误码率显著低于基线,消息容量可达256位。

Comments accepted by APSIPA ASC 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.08555 2026-08-11 cs.CV 新提交 79%

SC-Diff: Semantically Calibrated Diffusion for Visible-to-Infrared Image Translation

SC-Diff:用于可见光到红外图像转换的语义校准扩散模型

Junyin Zhang, Siyu Huang, Jianxiong Ye, Haowei Gong, Ruicheng Zhang, Deyu Meng, Chenqiang Gao

机构 * School of Intelligent Systems Engineering, Shenzhen Campus of Sun Yat-sen University(中山大学深圳校区智能系统工程学院) Tsinghua Shenzhen International Graduate School, Tsinghua University(清华大学深圳国际研究生院) School of Mathematics and Statistics, Xi’an Jiaotong University(西安交通大学数学与统计学院)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 SC-Diff 是一种语义校准潜扩散框架,通过结合语义先验作为条件与自注意力校准,提升可见光转红外图像的语义一致性,生成更适用于红外目标检测的合成训练数据。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.08519 2026-08-11 cs.CV 新提交 79%

eBIRD: Event-based Intensity Image Reconstruction Using Controllable Diffusion Models

eBIRD:基于可控扩散模型的事件驱动强度图像重建

Ignacio Bugueno-Cordova, Fabian Valderrama, Rodrigo Verschae

机构 * Institute of Engineering Sciences, Universidad de O’Higgins(奥伊金斯大学工程科学学院) The Iniciativa de Datos e Inteligencia Artificial, University of Chile(智利大学数据与人工智能倡议)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 本研究提出eBIRD框架,结合DDPM与ControlNet实现事件引导强度图像重建,在N-MNIST和RGBE-Gaze数据集上验证了通用与专用扩散学习策略的效果,表明可控扩散模型是该任务的有前景方法。

Journal ref The 19th European Conference on Computer Vision Workshops (ECCVW 2026); Workshop on Neuromorphic Vision (NeVi)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.07572 2026-08-11 cs.CV cs.AI 新提交 79%

BRACE: Taming Sharp Irregularities via Barycentric Rational Forecasting for Fast Diffusion Transformers Inference

BRACE:利用重心有理预测控制快速扩散Transformer推理中的尖锐不规则性

Jinlong Yang, Jinke Wu, Lizilin, Yao Zhou

机构 * Sichuan University(四川大学) School of Artificial Intelligence, Sichuan University(四川大学人工智能学院)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 本研究针对扩散Transformer(DiTs)高加速推理时的质量下降问题,提出带切比雪夫增强的重心有理预测方法BRACE,通过特征驱动的有理预测实现最优质量-效率权衡,且计算开销极低。

Comments 10 pages, 6 figures, 5 tables. Project page: https://youngkinlon.github.io/BRACE-Taming-Sharp-Irregularities-via-Barycentric-Rational-Forecasting-for-Fast-DiT-Inference/

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.27974 2026-08-11 cs.CV 版本更新 79%

Now You Have My Healthy Attention: A U-DiT for Brain-MRI Inpainting

现在你拥有我的健康注意力:用于脑部MRI修复的U-DiT

Danilo Danese, Angela Lombardi, Tommaso Di Noia

机构 * Politecnico di Bari(巴里理工大学)

专题命中 扩散模型 :inpainting(title,abstract);分类 cs.CV

AI总结 针对脑部MRI修复任务,提出U-DiT模型,结合对侧对称先验与注意力约束,在BraTS-2026验证集219例病例上取得健康区域SSIM 0.864等优异指标,提升了解剖学合理性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.14513 2026-08-11 cs.CV cs.AI 版本更新 79%

HEART: Exploiting Head Heterogeneity in Sparse Attention for Video Diffusion

HASTE:通过头级自适应稀疏注意力实现无训练视频扩散加速

Xuzhe Zheng, Yuexiao Ma, Jing Xu, Xiawu Zheng, Rongrong Ji, Fei Chao

机构 * Key Laboratory of Multimedia Trusted Perception and Efficient Computing, Ministry of Education of China, Xiamen University(中国教育部多媒体可信感知与高效计算重点实验室,厦门大学)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 本文提出HASTE框架,通过时间掩码复用和误差引导预算校准,提升无训练稀疏注意力在视频生成中的速度与质量平衡,实现在720P下1.93倍的加速效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.25003 2026-08-11 cs.LG cs.CV 版本更新 79%

Score-based Membership Inference on Diffusion Models

基于扩散模型的分数化成员推断

Mingxing Rao, Bowen Qu, Daniel Moyer

机构 * Department of Computer Science(计算机科学系)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 本文提出SimA攻击方法,通过预测噪声向量实现高效成员推断,优于现有多查询方法,在多个数据集上表现优异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.27519 2026-08-11 cs.CV 版本更新 79%

SPROUT: A Scalable Diffusion Foundation Model for Agricultural Vision

SPROUT:一种用于农业视觉的可扩展扩散基础模型

Shuai Xiang, James Burridge, Shouyang Liu, Hao Lu, Tokihiro Fukatsu, Yinqiang Zheng, Wei Guo

机构 * Graduate School of Agricultural and Life Sciences, The University of Tokyo(东京大学大学院农学生命科学研究科) National Key Laboratory of Multispectral Information Intelligent Processing Technology, School of Artificial Intelligence and Automation, Huazhong University of Science and Technology(华中科技大学多谱信息智能处理技术全国重点实验室、人工智能与自动化学院) Institute of Agricultural Machinery, NARO(日本国立研究开发法人农业·食品产业技术综合研究机构农业机械研究所) Institute of Life and Environmental Sciences, University of Tsukuba(筑波大学生命环境科学研究所)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 SPROUT是一种基于扩散去噪的多作物多任务农业基础模型,通过大规模未标注数据预训练,在多种下游任务中表现优异,且预训练成本较低。

Comments Code: https://github.com/UTokyo-FieldPhenomics-Lab/SPROUT Dataset: https://huggingface.co/datasets/XIANG-Shuai/MCD-2.6m

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.18093 2026-08-11 cs.CV 版本更新 79%

Predict to Skip: Linear Multistep Feature Forecasting for Efficient Diffusion Transformers

预测以跳过:线性多步特征预测用于高效的扩散变换器

Hanshuai Cui, Zhiqing Tang, Qianli Ma, Zhi Yao, Weijia Jia, Wei Zhao

机构 * School of Artificial Intelligence, Beijing Normal University, Beijing 100875, China(人工智能学院,北京师范大学,北京) Institute of Artificial Intelligence(人工智能研究所) Future Networks, Beijing Normal University, Zhuhai 519087, China(未来网络,北京师范大学,珠海)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 PrediT通过线性多步特征预测方法,在不训练的情况下加速扩散变换器,实现显著的延迟降低同时保持生成质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.00506 2026-08-11 cs.CV 版本更新 79%

Affordance-Guided Diffusion Prior for 3D Hand Reconstruction

用于3D手部重建的可负担性引导扩散先验

Naru Suzuki, Takehiko Ohkawa, Tatsuro Banno, Jihyun Lee, Ryosuke Furuta, Yoichi Sato

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 研究在手部大量被遮挡时3D手部姿势重建问题;核心方法是用基于扩散的生成模型,由视觉语言模型推断的可负担性描述引导;主要贡献是显著提升手部姿势估计准确性,优于现有方法。

Comments Accepted to ECCV 2026. Project page: https://narusuzuki.github.io/projects/26-affhandgen/

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.18469 2026-08-11 cs.CV 版本更新 79%

HonestFace: Towards Honest Face Restoration with One-Step Diffusion Model

HonestFace:基于单步扩散模型的诚实人脸复原方法

Jingkai Wang, Wu Miao, Jue Gong, Zheng Chen, Xing Liu, Hong Gu, Yutong Liu, Yulun Zhang

机构 * Shanghai Jiao Tong University(上海交通大学) vivo Mobile Communication Co., Ltd(vivo移动通信有限公司)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 本研究提出基于单步扩散模型的HonestFace人脸复原方法,通过身份嵌入器、掩码人脸对齐等组件构建新数据集MultiRefCeleb-Test,其性能优于现有最优方法。

Comments Published at ACM MM 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.24131 2026-08-11 math.AP 版本更新 79%

Existence of new self-similar solutions of the fast diffusion equation

快速扩散方程的新自相似解的存在性

Kin Ming Hui

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 该论文证明了快速扩散方程的两类径向对称解的存在性,推导了对应的后向相似解,并通过匹配渐近分析新证了Peletier和Zhang关于该方程唯一径向对称解的相关结果。

Comments 50 pages, sections 1-3 are rewritten, sections 4-5 are added with new proof of Peletier and Zhang's result on existence of self-similar solution of the fast diffusion equation with finite L1 norm

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.08770 2026-08-11 stat.ML cs.LG 新提交 78%

A Mean-Field Framework for Inference-Time Distributional Control of Diffusion Models

用于扩散模型推理时分布控制的平均场框架

Samuel Howard, Nikolas Nüsken

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 本研究提出一种平均场框架,将扩散模型推理时的分布控制转化为瞄准倾斜测度,推导加权交互粒子方案,为现有批量引导方法提供理论基础,并在低维及蛋白质构象任务中验证了其有效性。

Comments Preprint. Presented at SPIGM workshop, ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.08204 2026-08-11 stat.ML cs.LG 新提交 78%

Conditional Diffusion for Nonparametric Instrumental Variable Quantile Regression

用于非参数工具变量分位数回归的条件扩散模型

Xingdong Feng, Xinhong Jiang, Yuling Jiao, Lican Kang, Junwei Liu

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 本研究提出结合条件扩散建模的两阶段非参数工具变量分位数回归方法,建立了重尾分布下的理论保证,经模拟与实际数据验证,其性能优于现有方法且随维度提升优势更明显。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.09484 2026-08-11 cs.RO 新提交 78%

Graph-Guided Safe Diffuser: Topological Graph Guidance for Safe Diffusion Planning

图引导的安全扩散器:用于安全扩散规划的拓扑图引导

Nakgyu Yang, KwangBin Lee, SooJean Han

机构 * School of Electrical Engineering, Korea Advanced Institute of Science and Technology (KAIST)(韩国科学技术院电气工程学院)

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 该研究提出图引导的安全扩散器(G2SD)框架,用高层拓扑图规划器引导低层扩散模型,解决扩散规划器的流形破裂问题,在Maze2D导航等任务中大幅提升无碰撞目标到达率与任务性能。

Comments 18 pages, 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.09424 2026-08-11 cs.CL 新提交 78%

Reducing Pretraining-Generation Mismatch in Diffusion Language Models

减少扩散语言模型中的预训练-生成不匹配

Xiaocheng Lu, Huabin Liu, Song Guo, Jianguo Li

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 该研究针对扩散语言模型的预训练-生成不匹配问题,提出 PCD 方法,在不改变推理模式的情况下,在 LLaDA2-Mini 和 Qwen 模型上显著提升了性能。

Comments 12 pages, 9 figures, 1 table

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.08791 2026-08-11 cs.CL 新提交 78%

Unsure but Certain: Uncovering the Representation-Confidence Gap in Diffusion Language Models

不确定但确定:揭示扩散语言模型中的表示-置信度差距

Saurabh Yadav, Badri Narayana Patro, Vijay Srinivas Agneeswaran

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 该研究揭示扩散语言模型存在表示-置信度差距,其高置信度集中是误导性症状,现有补救措施难修复排序缺陷,提出轻量级工具利用隐藏状态信号改进排序,指出噪声下置信度可靠性是更紧迫限制。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.08721 2026-08-11 cs.CL cs.AI 新提交 78%

LibraSpec: Dynamic Diffusion-Based Speculative Decoding via Marginal-Gain-Driven Optimization

LibraSpec:基于动态扩散的推测解码,通过边际增益驱动优化

Zexun Lin, Yuan Feng, Junlin Lv, Kevin S. Zhou, Xike Xie

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 LibraSpec是一种无需训练的即插即用推测解码算法,通过边际增益驱动优化动态确定推测长度,可提升大语言模型推理速度,在多基准上较基线加速0.5~1.5倍、较自回归解码最高达8.49倍。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.08558 2026-08-11 cs.RO 新提交 78%

Vid2WAM: Distilling Video Diffusion Priors into World Action Models

Vid2WAM:将视频扩散先验蒸馏为世界动作模型

Chenhao Qiu, Ruixiang Wang, Runyi Zhao, Sixu Lin, Songen Gu, Shufeng Nan, Guiliang Liu, Kui Jia, Yanwei Fu, Simo Wu

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 Vid2WAM是将视频扩散先验蒸馏为WAM的离线框架,通过双监督通道与源感知残差动作适配,提升了机器人策略的新任务泛化性与数据效率,且推理高效。

Comments Project website: https://qch-fa.github.io/vid2wam-website/

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.08082 2026-08-11 cs.CL 新提交 78%

Commitment Before Realization: When Classifier-Free Guidance Becomes Unnecessary in Masked Diffusion Language Models

实现前的承诺:无分类器引导何时在掩码扩散语言模型中变得不必要

Fan Zhou, Weitian Wang, Tim Van de Cruys

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 该研究探究掩码扩散语言模型解码中无分类器引导(CFG)的必要性,定义承诺 horizon τ*,发现固定提示的交叉验证 horizon 时,其表现不劣于全程CFG,还可优化并行度与失败轨迹恢复效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.09623 2026-08-11 math.NA cs.NA math.ST stat.TH 新提交 78%

Diffusion Maps Kernel Ridge Regression

扩散映射核岭回归

John Harlim, Daning Huang, Jiwoo Song

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 本文提出采用扩散映射(DM)核的核岭回归,证明DM核收敛到热核,其RKHS与高斯核等距同构,且数值验证了DM核在带边界流形监督学习中的优势。

Comments 29 pages, 13 figures

详情

展开后加载摘要…

URL PDF HTML 收藏