arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

图像生成

图像生成、文生图、图像编辑、扩散模型和可控生成。

2026-08-11 至 2026-08-11 共收录 98 信号源:cs.CV, cs.GR, cs.MM

1. 文生图 1 篇

2608.09529 2026-08-11 cs.CV 新提交 83%

Towards Expressive and Faithful Audio-to-Image Generation: A Unified Multimodal Dataset and Synthesis Framework

面向表达性与忠实性的音频到图像生成:一个统一的多模态数据集与合成框架

Dongxu Ge, Shansong Liu, Cheng Gong, Xiao-Lei Zhang, Chi Zhang, Xuelong Li

机构 * University of Science and Technology of China(中国科学技术大学) China Telecom (TeleAI)(中国电信(电信人工智能研究院)) Northwest Polytechnical University(西北工业大学)

专题命中 文生图 :image generation(title,abstract);text-to-image(abstract);分类 cs.CV

AI总结 针对音频到图像生成受限于传统数据集的问题,提出A2I-Set数据集与AudioCanvas模型,实现了更优的跨模态对齐与视觉表达性。

Comments 23 pages, 16 figures

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 图像编辑 4 篇

2608.09322 2026-08-11 cs.CV 新提交 88%

Diffusion Image Editing via Asynchronous Token Decoding

基于异步令牌解码的扩散图像编辑

Yang Shi, Liangsi Lu, Minzhe Guo, Yifeng Xie, Yanhui Chen, Jingchao Wang, Xuhang Chen

机构 * Guangdong University of Technology(广东工业大学) Hong Kong Baptist University(香港浸会大学) Peking University(北京大学) Huizhou University(惠州学院)

专题命中 图像编辑 :diffusion(title,abstract);image editing(title,abstract);分类 cs.CV

AI总结 针对文本引导扩散图像编辑的全局漂移问题,提出推理时框架ATDEdit,通过逐令牌条件意外度估计可编辑位置,在PIE-Bench上实现最优保留指标且语义对齐性具竞争力。

Comments Accepted by ACMMM 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.09097 2026-08-11 cs.CV 新提交 79%

SI-Edit: Toward Sketch-Instruction Guided Local Image Editing with Pixel-Level Precision

SI-Edit:面向草图-指令引导的像素级精度局部图像编辑

Weixin Ye, Wei Wang, Hongguang Zhu, Xuecheng Nie

机构 * Institute of Information Science, Beijing Jiaotong University(北京交通大学信息科学研究所) City University of Macau(澳门城市大学) Meitu Inc(美图公司)

专题命中 图像编辑 :image editing(title,abstract);分类 cs.CV

AI总结 针对基于草图的图像编辑缺乏像素级精度及对应数据集、评估指标的问题,提出SI-Edit框架,构建SI-Data数据集并建立评估指标,实现更可靠的结构控制与像素级局部编辑效果。

Comments accepted by ACM MM 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.08676 2026-08-11 cs.CV cs.AI 新提交 77%

UniSpace: Unified Visual Representation and Scalable Multimodal Modeling

UniSpace:统一视觉表示与可扩展多模态建模

Jinbo Yan, Limeng Qiao, Jie Qin, Junyan He, Feize Wu, Guanglu Wan

机构 * Meituan(美团)

专题命中 图像编辑 :image generation(abstract);text-to-image(abstract);image editing(abstract);分类 cs.CV

AI总结 本文提出 UniSpace,通过 Patch Reparameterization 改进语义 ViT,构建 80 亿参数的 Transformer 专家混合模型,实现同一视觉空间内的理解、生成与编辑,提升重建效果,支持文本到图像生成和指令式图像编辑。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.08487 2026-08-11 cs.CV 新提交 57%

RenderMatte: Exact-Alpha Rendering and Group-Relative Alignment for Image Matting

RenderMatte:用于图像抠图的精确Alpha渲染与组相对对齐

Zecheng Ren, Yafei Hu, Jianing Zhao, Ruichen Cong, Qun Jin, Yiren Song

专题命中 图像编辑 :image editing(abstract);分类 cs.CV

AI总结 本文提出RenderMatte框架,通过微调FLUX.1 Kontext实现精确Alpha渲染,引入组相对Alpha对齐优化,并构建专属数据集,在抠图基准测试中取得最优性能,解决开放世界场景的抠图难题。

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 扩散模型 72 篇

2608.08720 2026-08-11 cs.CV 新提交 89%

High-Quality Exposure Correction with Diffusion-Based Image Generation Priors

基于扩散模型图像生成先验的高质量曝光校正

Ziwen Li, Meng Cao, Jinpu Zhang, Chunyang Li, Long Bao, Heng Sun, Yuehuan Wang

机构 * Huazhong University of Science and Technology(华中科技大学) Mohamed bin Zayed University of Artificial Intelligence(穆罕默德·本·扎耶德人工智能大学) National University of Defense Technology(国防科技大学) Xiaomi Communications Company Ltd.(小米通讯有限公司)

专题命中 扩散模型 :diffusion(title,abstract);image generation(title,abstract);分类 cs.CV

AI总结 本文提出基于扩散先验的曝光校正框架DPEC,通过高效微调策略与联合交叉注意力模块,在多数据集上实现了优于现有方法的曝光校正性能。

Comments Accepted by IEEE Transactions on Multimedia (TMM)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.09438 2026-08-11 cs.CV 新提交 85%

Unveiling the Secret of AdaLN-Zero in Diffusion Transformer

揭示扩散Transformer中AdaLN-Zero的秘密

Jie Zhu, Mingyu Ding, Boqiang Duan, Leye Wang, Jingdong Wang

机构 * Peking University(北京大学) UC Berkeley(加州大学伯克利分校) Baidu(百度)

专题命中 扩散模型 :diffusion(title,abstract);image generation(abstract);text-to-image(abstract);分类 cs.CV

AI总结 本研究探究扩散Transformer(DiT)中AdaLN-Zero性能优于AdaLN的原因,发现零初始化是关键要素,提出AdaLN-Gaussian初始化策略与SE-adaLN-Zero机制,经多数据集实验验证其有效性与泛化性。

Comments Accept by IEEE TPAMI 2026, camera-ready version

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.09505 2026-08-11 math.NA cs.NA 新提交 82%

Conditional Uniqueness and Optimal Energy-Norm Convergence for the Dynamic Diffusion Finite Element Method

动态扩散有限元方法的条件唯一性与最优能量范数收敛性

Isaac P. Santos

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 本文针对动态扩散有限元格式,推导其离散解的条件唯一性与最优一阶能量范数收敛估计,数值实验验证了理论结果,拓展了该格式的数学理解。

Comments 35 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.08734 2026-08-11 cs.CV 新提交 80%

IDATA: Scalable Invertible Diffusion for Unrestricted Adversarial Transfer Attack

IDATA:用于无限制对抗迁移攻击的可扩展可逆扩散模型

Yi Pan, Jun-Jie Huang, Tianrui Liu, Zihan Chen, Lin Liu, Zhao Wentao

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 IDATA是一种用于无限制对抗迁移攻击的内存高效扩散框架,通过可逆扩散模块与低频约束模块提升攻击性能,在多基准测试中优于现有方法,可用于评估深度视觉模型黑盒鲁棒性。

Comments Adversarial attack,Invertible diffusion model,Memory-efficient,Low-frequency

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.09445 2026-08-11 cs.CR cs.CV 新提交 79%

DiffSafeMerge: Mitigating Backdoor Inheritance in Diffusion Model Merging

DiffSafeMerge:缓解扩散模型合并中的后门继承问题

Jiayang Zhang, Ji Guo, Jiachen Li, Wenshu Fan, Wenbo Jiang

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 DiffSafeMerge是一种缓解扩散模型合并中后门继承的方法,通过评分源模块、收缩可疑贡献并在干净去噪损失预算下选择衰减,在多组实验中实现低攻击成功率和低FID。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.09231 2026-08-11 cs.CV 新提交 79%

BAG: Budget-Aware Gating for Diffusion Caching

BAG:面向扩散缓存的预算感知门控机制

Tong Zhao, Mingkun Lei, Yucheng Han, Chi Zhang

机构 * Westlake AGI Lab(西湖AGI实验室)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 提出BAG(预算感知门控机制),通过离线到在线调度蒸馏训练轻量门控网络,在FLUX.1-dev和Wan2.1上实现优于现有最优缓存方法的性能。

Comments 22 pages, 12 figures, and 13 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.09133 2026-08-11 cs.CV cs.AI 新提交 79%

When Latents Forget Pixels: Restoring Fidelity in Diffusion Transformer Super-Resolution

当潜变量遗忘像素时:在扩散Transformer超分辨率中恢复保真度

Yu Shi, Yuyao Zhang, Yu-wing Tai

机构 * Dartmouth College(达特茅斯学院)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 本研究针对扩散Transformer超分辨率中VAE压缩导致的保真度下降问题,提出像素锚定超分辨率框架,通过复用VAE前的像素证据提升结果的忠实度,实验验证其性能优于现有潜变量生成式超分辨率方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.08999 2026-08-11 cs.CV cs.AI 新提交 79%

DeepFreqMark: End-To-End Learnable Frequency-Domain Watermarking with Spherical Attack Simulation for Latent Diffusion Models

DeepFreqMark:面向潜在扩散模型的、结合球形攻击模拟的端到端可学习频域水印

Chen-Hsiu Huang, Mario Köppen, Ja-Ling Wu

机构 * National Taiwan University(台湾大学) Kyushu Institute of Technology(九州工业大学)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 针对潜在扩散模型生成图像的版权与虚假信息问题,提出DeepFreqMark频域水印框架,结合球形攻击模拟规避计算瓶颈,其误码率显著低于基线,消息容量可达256位。

Comments accepted by APSIPA ASC 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.08555 2026-08-11 cs.CV 新提交 79%

SC-Diff: Semantically Calibrated Diffusion for Visible-to-Infrared Image Translation

SC-Diff:用于可见光到红外图像转换的语义校准扩散模型

Junyin Zhang, Siyu Huang, Jianxiong Ye, Haowei Gong, Ruicheng Zhang, Deyu Meng, Chenqiang Gao

机构 * School of Intelligent Systems Engineering, Shenzhen Campus of Sun Yat-sen University(中山大学深圳校区智能系统工程学院) Tsinghua Shenzhen International Graduate School, Tsinghua University(清华大学深圳国际研究生院) School of Mathematics and Statistics, Xi’an Jiaotong University(西安交通大学数学与统计学院)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 SC-Diff 是一种语义校准潜扩散框架,通过结合语义先验作为条件与自注意力校准,提升可见光转红外图像的语义一致性,生成更适用于红外目标检测的合成训练数据。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.08519 2026-08-11 cs.CV 新提交 79%

eBIRD: Event-based Intensity Image Reconstruction Using Controllable Diffusion Models

eBIRD:基于可控扩散模型的事件驱动强度图像重建

Ignacio Bugueno-Cordova, Fabian Valderrama, Rodrigo Verschae

机构 * Institute of Engineering Sciences, Universidad de O’Higgins(奥伊金斯大学工程科学学院) The Iniciativa de Datos e Inteligencia Artificial, University of Chile(智利大学数据与人工智能倡议)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 本研究提出eBIRD框架,结合DDPM与ControlNet实现事件引导强度图像重建,在N-MNIST和RGBE-Gaze数据集上验证了通用与专用扩散学习策略的效果,表明可控扩散模型是该任务的有前景方法。

Journal ref The 19th European Conference on Computer Vision Workshops (ECCVW 2026); Workshop on Neuromorphic Vision (NeVi)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.07572 2026-08-11 cs.CV cs.AI 新提交 79%

BRACE: Taming Sharp Irregularities via Barycentric Rational Forecasting for Fast Diffusion Transformers Inference

BRACE:利用重心有理预测控制快速扩散Transformer推理中的尖锐不规则性

Jinlong Yang, Jinke Wu, Lizilin, Yao Zhou

机构 * Sichuan University(四川大学) School of Artificial Intelligence, Sichuan University(四川大学人工智能学院)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 本研究针对扩散Transformer(DiTs)高加速推理时的质量下降问题,提出带切比雪夫增强的重心有理预测方法BRACE,通过特征驱动的有理预测实现最优质量-效率权衡,且计算开销极低。

Comments 10 pages, 6 figures, 5 tables. Project page: https://youngkinlon.github.io/BRACE-Taming-Sharp-Irregularities-via-Barycentric-Rational-Forecasting-for-Fast-DiT-Inference/

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.08770 2026-08-11 stat.ML cs.LG 新提交 78%

A Mean-Field Framework for Inference-Time Distributional Control of Diffusion Models

用于扩散模型推理时分布控制的平均场框架

Samuel Howard, Nikolas Nüsken

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 本研究提出一种平均场框架,将扩散模型推理时的分布控制转化为瞄准倾斜测度,推导加权交互粒子方案,为现有批量引导方法提供理论基础,并在低维及蛋白质构象任务中验证了其有效性。

Comments Preprint. Presented at SPIGM workshop, ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.08204 2026-08-11 stat.ML cs.LG 新提交 78%

Conditional Diffusion for Nonparametric Instrumental Variable Quantile Regression

用于非参数工具变量分位数回归的条件扩散模型

Xingdong Feng, Xinhong Jiang, Yuling Jiao, Lican Kang, Junwei Liu

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 本研究提出结合条件扩散建模的两阶段非参数工具变量分位数回归方法,建立了重尾分布下的理论保证,经模拟与实际数据验证,其性能优于现有方法且随维度提升优势更明显。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.09484 2026-08-11 cs.RO 新提交 78%

Graph-Guided Safe Diffuser: Topological Graph Guidance for Safe Diffusion Planning

图引导的安全扩散器:用于安全扩散规划的拓扑图引导

Nakgyu Yang, KwangBin Lee, SooJean Han

机构 * School of Electrical Engineering, Korea Advanced Institute of Science and Technology (KAIST)(韩国科学技术院电气工程学院)

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 该研究提出图引导的安全扩散器(G2SD)框架,用高层拓扑图规划器引导低层扩散模型,解决扩散规划器的流形破裂问题,在Maze2D导航等任务中大幅提升无碰撞目标到达率与任务性能。

Comments 18 pages, 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.09424 2026-08-11 cs.CL 新提交 78%

Reducing Pretraining-Generation Mismatch in Diffusion Language Models

减少扩散语言模型中的预训练-生成不匹配

Xiaocheng Lu, Huabin Liu, Song Guo, Jianguo Li

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 该研究针对扩散语言模型的预训练-生成不匹配问题,提出 PCD 方法,在不改变推理模式的情况下,在 LLaDA2-Mini 和 Qwen 模型上显著提升了性能。

Comments 12 pages, 9 figures, 1 table

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.08791 2026-08-11 cs.CL 新提交 78%

Unsure but Certain: Uncovering the Representation-Confidence Gap in Diffusion Language Models

不确定但确定:揭示扩散语言模型中的表示-置信度差距

Saurabh Yadav, Badri Narayana Patro, Vijay Srinivas Agneeswaran

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 该研究揭示扩散语言模型存在表示-置信度差距,其高置信度集中是误导性症状,现有补救措施难修复排序缺陷,提出轻量级工具利用隐藏状态信号改进排序,指出噪声下置信度可靠性是更紧迫限制。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.08721 2026-08-11 cs.CL cs.AI 新提交 78%

LibraSpec: Dynamic Diffusion-Based Speculative Decoding via Marginal-Gain-Driven Optimization

LibraSpec:基于动态扩散的推测解码,通过边际增益驱动优化

Zexun Lin, Yuan Feng, Junlin Lv, Kevin S. Zhou, Xike Xie

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 LibraSpec是一种无需训练的即插即用推测解码算法,通过边际增益驱动优化动态确定推测长度,可提升大语言模型推理速度,在多基准上较基线加速0.5~1.5倍、较自回归解码最高达8.49倍。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.08558 2026-08-11 cs.RO 新提交 78%

Vid2WAM: Distilling Video Diffusion Priors into World Action Models

Vid2WAM:将视频扩散先验蒸馏为世界动作模型

Chenhao Qiu, Ruixiang Wang, Runyi Zhao, Sixu Lin, Songen Gu, Shufeng Nan, Guiliang Liu, Kui Jia, Yanwei Fu, Simo Wu

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 Vid2WAM是将视频扩散先验蒸馏为WAM的离线框架,通过双监督通道与源感知残差动作适配,提升了机器人策略的新任务泛化性与数据效率,且推理高效。

Comments Project website: https://qch-fa.github.io/vid2wam-website/

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.08082 2026-08-11 cs.CL 新提交 78%

Commitment Before Realization: When Classifier-Free Guidance Becomes Unnecessary in Masked Diffusion Language Models

实现前的承诺:无分类器引导何时在掩码扩散语言模型中变得不必要

Fan Zhou, Weitian Wang, Tim Van de Cruys

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 该研究探究掩码扩散语言模型解码中无分类器引导(CFG)的必要性,定义承诺 horizon τ*,发现固定提示的交叉验证 horizon 时,其表现不劣于全程CFG,还可优化并行度与失败轨迹恢复效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.09623 2026-08-11 math.NA cs.NA math.ST stat.TH 新提交 78%

Diffusion Maps Kernel Ridge Regression

扩散映射核岭回归

John Harlim, Daning Huang, Jiwoo Song

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 本文提出采用扩散映射(DM)核的核岭回归,证明DM核收敛到热核,其RKHS与高斯核等距同构,且数值验证了DM核在带边界流形监督学习中的优势。

Comments 29 pages, 13 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.09491 2026-08-11 math.AP 新提交 78%

Global boundedness and stabilization for a three-component reaction-diffusion model with dual-dependent motility

具有双依赖迁移率的三组分反应-扩散模型的全局有界性与稳定性

Hai-Yang Jin, Jingyi Mai

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 本文针对具有双依赖迁移率的三组分反应-扩散系统,通过分类讨论建立其经典解的全局存在性、有界性与渐近行为,揭示该迁移率函数对系统长期行为的关键影响。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.09319 2026-08-11 math.DS math.PR 新提交 78%

Averaging Principle and Pullback Attractor Convergence for McKean--Vlasov Stochastic Reaction--Diffusion Equations

Honglei Chen, Mengyu Cheng, Zhenxin Liu

专题命中 扩散模型 :diffusion(title,abstract)

Comments 36 pages, 0 figure

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.07675 2026-08-11 math.AP 新提交 78%

Novel Dynamics in Models of Angiogenesis with p-Laplacian diffusion

具p-拉普拉斯扩散的血管生成模型中的新动力学

Wenbo Zhang, Hossein Asgaribakhtiari, Aishwarya Pawar, Rana D. Parshad

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 本文研究具p-拉普拉斯扩散的血管生成两物种模型,证明p>3/2且初始数据足够小时系统弱适定,发现p-拉普拉斯带来的新动力学,并探讨其在心脏健康数字孪生框架中的应用。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.08919 2026-08-11 physics.med-ph cs.AI 新提交 78%

Toward CT-Equivalent Image Quality in Low-Dose Radiotherapy Planning: Conditional Diffusion-Based CBCT-to-CT Synthesis and the Impact of CBCT Input Representation

实现与CT相当的低剂量放疗计划图像质量:基于条件扩散的CBCT到CT合成及CBCT输入表示的影响

Alzahra Altalib, Chunhui Li, Christopher Hamill Taylor, Sankar Pillai, Alessandro Perelli

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 本研究开发基于条件DDPM的CBCT到CT合成框架,探究CBCT输入表示对合成性能的影响,旨在实现低剂量放疗中与CT相当的图像质量。

Comments 9 pages, 6 figures, European Conference of Radiology (ECR) 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.08152 2026-08-11 cond-mat.mtrl-sci quant-ph 新提交 78%

Denoising Diffusion Monte Carlo Electron Densities with Physically Informed Variance Stabilization: From Fourier Filters to 3D UNETs

基于物理感知方差稳定化的扩散蒙特卡洛电子密度去噪:从傅里叶滤波器到3D UNET

Kenneth O. Berard, Brenda Rubenstein, Jaron T. Krogel

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 本研究针对扩散蒙特卡洛(DMC)电子密度的统计噪声,利用密度泛函理论密度作为先验,通过方差稳定化的回归方法结合3D UNET等技术去噪,将DMC模拟成本降低10-100倍,为噪声敏感任务提供新途径。

详情

展开后加载摘要…

URL PDF HTML 收藏