arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

图像生成

图像生成、文生图、图像编辑、扩散模型和可控生成。

2026-08-03 至 2026-08-03 共收录 72 信号源:cs.CV, cs.GR, cs.MM

1. 文生图 1 篇

2602.06886 2026-08-03 cs.CV 版本更新 92%

Prompt Reinjection: Alleviating Prompt Forgetting in Multimodal Diffusion Transformers for Text-to-Image Generation

提示重注入:缓解多模态扩散变换器中的提示遗忘

Yuxuan Yao, Yuxuan Chen, Hui Li, Kaihui Cheng, Qipeng Guo, Yuwei Sun, Zilong Dong, Jingdong Wang, Siyu Zhu

机构 * University of Science and Technology of China(中国科学技术大学)

专题命中 文生图 :image generation(title,abstract);text-to-image(title,abstract);diffusion(title,abstract);分类 cs.CV

AI总结 本研究针对多模态扩散变换器中提示遗忘问题,提出一种无需训练的提示重注入方法,通过将早期层的提示表示重新注入到后期层,以提升指令遵循能力和生成质量。

Comments 19 pages

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 图像编辑 5 篇

2606.13303 2026-08-03 cs.CV 版本更新 88%

DuET: Dual Expert Trajectories for Diffusion Image Editing

DuET: 双专家轨迹用于扩散图像编辑

Lidia Troeshestova, Alexander Ustyuzhanin, Sergey Kastryulin

机构 * HSE University(高等经济大学) Yandex

专题命中 图像编辑 :diffusion(title,abstract);image editing(title);text-to-image(abstract);分类 cs.CV

AI总结 提出训练自由的DuET方法,通过临时切换到文本到图像阶段再返回编辑模式,缓解源图像条件限制,提升编辑指令相关性、语义保真度和感知质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.29367 2026-08-03 cs.CV 新提交 83%

SatEdit: Mask-Conditioned Image Editing via VLM-Guided Segment Annotation

SatEdit:基于VLM引导的区域标注的掩码条件卫星图像编辑

Muhammad Talha, Muhammad Ahmed Amer

专题命中 图像编辑 :image editing(title,abstract);inpainting(abstract);分类 cs.CV

AI总结 SatEdit是基于VLM引导区域标注的卫星图像编辑框架,通过未标注图像构建监督信号,经LoRA微调后在对比中实现最高掩码区域语义对齐,为卫星图像编辑提供了数据高效的可行方案。

Comments 14 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.27790 2026-08-03 cs.CV 版本更新 79%

Inference-time Trajectory Optimization for Structure-Preserving Manga Image Editing

漫画图像编辑中的推理时间轨迹优化

Ryosuke Furuta

机构 * Mantra Inc.(Mantra公司) The University of Tokyo(东京大学)

专题命中 图像编辑 :image editing(title,abstract);分类 cs.CV

AI总结 本文提出一种在推理时适应预训练图像编辑模型的方法,通过仅使用输入漫画图像来调整模型,以提高对漫画图像的编辑效果,同时减少计算开销。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.01207 2026-08-03 cs.CV 版本更新 57%

TRACE: High-Fidelity 3D Scene Editing via Tangible Reconstruction and Geometry-Aligned Contextual Video Masking

TRACE:通过可触觉重建和几何对齐的上下文视频遮罩实现高保真的3D场景编辑

Jiyuan Hu, Zechuan Zhang, Zongxin Yang, Yi Yang

机构 * ReLER Lab, CCAI, Zhejiang University(浙江大学计算机辅助设计与图形学全国重点实验室(CCAI)ReLER实验室) DBMI, HMS, Harvard University(哈佛大学医学院生物医学信息学系(DBMI))

专题命中 图像编辑 :diffusion(abstract);分类 cs.CV

AI总结 TRACE通过可触觉重建和几何对齐的上下文视频遮罩,实现高保真的3D场景编辑,解决了现有方法在局部姿态调整和组件替换时结构完整性不足的问题。

Comments 9 pages, 9 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.11124 2026-08-03 cs.SD cs.AI 版本更新 50%

BeatEdit: Symbolic Music Generation as Explicit Editing

BeatEdit:作为显式编辑的符号音乐生成

Haoyu Gu, Lekai Qian, Haowu Zhou, Qi Liu, Shuai Wang

机构 * School of Future Technology South China University of Technology Guangzhou China(未来技术学院 华南理工大学 广州 中国) South China University of Technology(华南理工大学) Nanjing University(南京大学)

专题命中 图像编辑 :diffusion(abstract)

AI总结 研究针对符号音乐生成中缺乏选择性修改支持的问题,提出BeatEdit框架,基于BEAT编码,含三种互补机制,共享单一编码和预训练主干,在多项任务中精度和质量更高且高效,揭示编码设计对编辑有效性有重要影响。

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 扩散模型 53 篇

2605.14270 2026-08-03 cs.CV 版本更新 85%

Diagnosing and Correcting Concept Omission in Multimodal Diffusion Transformers

诊断和纠正多模态扩散Transformer中的概念遗漏

Kanghyun Baek, Jaihyun Lew, Chaehun Shin, Jungbeom Lee, Sungroh Yoon

机构 * Interdisciplinary Program in Artificial Intelligence, Seoul National University, Seoul, South Korea Department of Electrical Computer Engineering, Seoul National University, Seoul, South Korea Department of Computer Science \& Engineering, Korea University, Seoul, South Korea ISRC, Seoul National University, Seoul, South Korea

专题命中 扩散模型 :diffusion(title,abstract);image generation(abstract);text-to-image(abstract);分类 cs.CV

AI总结 本文通过线性探测发现文本嵌入中存在表征目标概念缺失的“遗漏信号”,并提出遗漏信号干预(OSI)方法放大该信号以主动催化缺失概念的生成,在FLUX.1-Dev和SD3.5-Medium上显著缓解了概念遗漏问题。

Comments Accepted to ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.03434 2026-08-03 cs.GR cs.DC cs.LG 版本更新 85%

Paris: A Decentralized Trained Open-Weight Diffusion Model

巴黎:一种去中心化训练的开放权重扩散模型

Zhiying Jiang, Raihan Seraj, Marcos Villagra, Bidhan Roy

机构 * Bagel Labs(Bagel实验室)

专题命中 扩散模型 :diffusion(title,abstract);image generation(abstract);text-to-image(abstract);分类 cs.GR

AI总结 Paris是一种通过去中心化训练实现高质量文本到图像生成的开放权重扩散模型,无需专用GPU集群,使用更少的数据和计算资源。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.29337 2026-08-03 cs.CV cs.AI 新提交 83%

DualDiT: A Conditional Dual-Output Diffusion Transformer for Joint OCT Image and Segmentation Mask Generation

DualDiT:用于联合生成OCT图像与分割掩码的条件双输出扩散Transformer

Fernando García-Torres, Rocío del Amor, Sandra Morales, Álvaro Barroso, Peter Heiduschka, Björn Kemper, Valery Naranjo

机构 * Instituto Universitario de Investigación en Tecnología Centrada en el Ser Humano (HUMAN-tech), Universitat Politècnica de València(瓦伦西亚理工大学以人类为中心技术大学研究所) Artikode Intelligence S.L(Artikode智能公司) Biomedical Technology Center of the Medical Faculty, University of Muenster(明斯特大学医学院生物医学技术中心) Department of Ophthalmology, University of Muenster Medical Centre(明斯特大学医学中心眼科)

专题命中 扩散模型 :diffusion(title,abstract);image synthesis(abstract);分类 cs.CV

AI总结 该研究提出DualDiT模型,联合生成小鼠OCT图像与分割掩码,在生成质量、下游分割性能上优于DDPM、LDM,可用于医学图像数据增强

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.29533 2026-08-03 cs.CV 新提交 79%

OSAGEN: Object-Aware Mask Priors and Multistage Decoupled Diffusion for Industrial Anomaly Generation

OSAGEN:面向工业异常生成的感知对象掩码先验与多阶段解耦扩散

Jinyi Xu, Peng Chen, Yunkang Cao, Chengliang Liu, Xinghui Dong, Chao Huang

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 OSAGEN结合感知对象掩码先验与多阶段解耦扩散,通过QBG、ISC及轻量物质化步骤生成工业异常,在MVTec AD和VisA上实现优异的异常定位性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.29122 2026-08-03 cs.CV 新提交 79%

A Frozen Pixel-Space Diffusion Model Can Guide Itself with Its Own Samples

冻结的像素空间扩散模型可利用自身样本进行自引导

Zixuan Fu, Chong Wang, Lanqing Guo, Kailai Zhou, Jiahao Nie, Bihan Wen

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 本研究提出合成自引导(SSG)策略,通过冻结预训练像素扩散模型主干、附加轻量预测头,利用模型自身样本训练头,以预测差异为自引导方向,大幅提升像素扩散模型生成效果且训练成本极低。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.28936 2026-08-03 cs.CV cs.AI 新提交 79%

DiffAttack: Evasion Attacks Against Face Recognition via Latent Diffusion Models

DiffAttack:基于潜在扩散模型的人脸识别规避攻击

Omid Ahmadieh, Nima Karimian

机构 * University of South Florida(南佛罗里达大学) Bellini College of Artificial Intelligence, Cybersecurity and Computing(贝利尼人工智能、网络安全与计算学院)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 该研究针对人脸识别系统易受对抗攻击的问题,提出DiffAttack框架,利用潜在扩散模型生成对抗人脸,在FFHQ、CelebA-HQ等基准上攻击成功率达84.86%,可迁移性优于现有方法。

Comments Accepted at IEEE International Joint Conference on Biometrics (IJCB) 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.17303 2026-08-03 cs.CV 版本更新 79%

EMAG: Self-Rectifying Diffusion Sampling with Exponential Moving Average Guidance

EMAG: 无训练的自修正扩散采样与指数移动平均引导

Ankit Yadav, Ta Duc Huy, Lingqiao Liu

机构 * Australian Institute for Machine Learning(澳大利亚机器学习研究所) The University of Adelaide(阿德莱德大学)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 EMAG通过无训练机制改进扩散模型的引导技术,生成更困难的负样本以提升生成质量和人类偏好分数。

Comments 63 pages (Accepted at ECCV 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.20255 2026-08-03 cs.CV 版本更新 79%

AniCrafter: Customizing Realistic Human-Centric Animation via Avatar-Background Conditioning in Video Diffusion Models

AniCrafter:基于视频扩散模型中化身-背景条件的逼真以人为中心动画定制

Muyao Niu, Mingdeng Cao, Yifan Zhan, Qingtian Zhu, Weihang Ran, Yanhong Zeng, Xiao Sun, Zhihang Zhong, Yinqiang Zheng

机构 * The University of Tokyo(东京大学) Shanghai Artificial Intelligence Laboratory(上海人工智能实验室)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 本研究提出AniCrafter模型,通过在视频扩散模型中引入化身-背景条件机制,解决现有角色动画方法在开放域场景中效果受限的问题,其性能优于现有最先进方法,可生成通用且可感知遮挡的动画结果。

Comments Homepage: https://myniuuu.github.io/AniCrafter ; Codes: https://github.com/MyNiuuu/AniCrafter

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.29398 2026-08-03 cs.LG 新提交 79%

OnlineCache: Learning Dynamic Caching Policies with Error Correction for Efficient Diffusion Inference

OnlineCache:用于高效扩散推理的带误差校正的动态缓存策略学习

Zhikang Xie, Xichen Ye, Yifan Wu, Haoshen Yu, Li chenan, Peizhu Gong, Weizhong Zhang, Cheng Jin

机构 * College of Computer Science and Artificial Intelligence, Fudan University(复旦大学计算机科学与人工智能学院) School of Data Science, Fudan University(复旦大学数据科学学院)

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 本研究针对扩散模型推理延迟高的问题,提出动态缓存框架OnlineCache,结合策略梯度与可学习校正器,实现样本与时间步的自适应资源分配,在FLUX.1-dev等模型上实现加速且优于现有基线。

Comments Dynamic timestep-level cache method for diffusion acceleration via policy gradient

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.29148 2026-08-03 eess.AS 新提交 78%

Exploring Efficient Waveform Diffusion Models for Foley Sound Generation

探索用于拟音音效生成的高效波形扩散模型

Runwu Shi, Chang Li, Jiahui Li, Jiang Wang, Yaozhong Kang, Nabeela Khan, Linghan Fang, Benjamin Yen, Takeshi Ashizawa, Kazuhiro Nakadai

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 该研究针对现有波形扩散模型效率低的问题,提出双路径(DP)架构及DP-DiT、DP-U-Net两个变体,经DCASE和FSD-Kaggle2018数据集实验,3M参数变体性能可媲美50M参数模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.29177 2026-08-03 cs.LG cs.AI 新提交 78%

MBDiff: Multi-view Behavior-aware Diffusion Model for Probabilistic Utility Data Imputation

MBDiff:用于概率效用数据插补的多视图行为感知扩散模型

Rongchao Xu, Lin Jiang, Dahai Yu, Ximiao Li, Guang Wang

机构 * Florida State University(佛罗里达州立大学)

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 针对效用数据缺失问题,提出多视图行为感知扩散模型MBDiff,通过多视图用户行为提取模块和行为感知条件扩散模型,在佛罗里达州市政数据集上优于现有基线模型,提升了用电和用水块缺失插补性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.29079 2026-08-03 cs.CL 新提交 78%

Faster but Different: Diagnosing and Controlling Content Drift in Accelerated Multimodal Diffusion Language Models

更快但不同:加速多模态扩散语言模型中的内容漂移诊断与控制

Yaoxuan Dou, Yang Shu

机构 * School of Mathematics and Statistics, Beijing Institute of Technology(北京理工大学数学与统计学院) Zhejiang University(浙江大学)

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 该研究针对加速多模态扩散语言模型的内容漂移问题,通过实验诊断出漂移源于过期状态,提出缩短KV缓存刷新区间的控制方法,在1.3倍加速时实现近乎完全一致,且未发现事实错误差异。

Comments 9 pages, 4 figures, 6 tables. Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.28945 2026-08-03 cs.LG 新提交 78%

FairDiffuseVQVAE: Sampling-Time Fairness in Tabular Diffusion via Conditional Refinement of Vector-Quantized Latents

FairDiffuseVQVAE:基于向量量化隐变量条件优化的表格扩散模型采样时刻公平性

Nitish Nagesh, Mahdi Bagheri, Amir M. Rahmani

机构 * University of California, Irvine(加州大学欧文分校)

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 FairDiffuseVQVAE是将保真度与公平性解耦的两阶段表格扩散模型,在多个数据集上实现了显著的公平性提升,同时保持了优异的样本质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.29593 2026-08-03 cs.LG math.OC 新提交 78%

Convergence and Regret of the Policy Gradient for Multi-Armed Bandits in Diffusion Environment

扩散环境中多臂老虎机的策略梯度算法:收敛性与悔憾分析

Yanwei Jia, Du Ouyang

机构 * The Chinese University of Hong Kong(香港中文大学) Tsinghua University(清华大学)

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 本文针对扩散环境中多臂老虎机的策略梯度算法,证明其收敛性并推导O(log T)阶悔憾上界,改进了现有分析且可推广至离散时间算法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.29164 2026-08-03 math.AP 新提交 78%

On finite-dimensional attractor to nonsmooth reaction-diffusion equations

关于非光滑反应扩散方程的有限维吸引子

Dalibor Pražák, Buddhika Priyasad, Michael Zelina

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 针对含极大单调关系非光滑低阶项的反应扩散方程,研究证明其全局吸引子具有有限分形维数,并给出基于数据的显式上界估计。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.29639 2026-08-03 cond-mat.soft 新提交 78%

Structure, Diffusion, and Relaxation in a Charge-Neutral ProTalpha-Histone H1 Condensate

电荷中性ProTα-组蛋白H1凝聚物中的结构、扩散与弛豫

Aniket Bhattacharya

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 该研究通过粗粒度模型模拟,探究近电荷中性ProTα-组蛋白H1凝聚物的结构、扩散与弛豫特性,明确其链构象对压力不敏感、扩散系数随压力降低等规律,揭示瞬时静电接触的调控机制。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.23909 2026-08-03 cs.LG cs.RO 版本更新 78%

WorldDiT: A Unified Diffusion Architecture for World and Action Modeling

WorldDiT:用于世界和动作建模的统一扩散架构

Sen Wang, R. Gnana Praveen, Bidhan Roy, Marcos Villagra

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 研究提出WorldDiT统一扩散架构,结合动作生成与视觉世界建模,不依赖大型预训练VLM动作主干,在四个LIBERO模拟套件中表现出色,处于帕累托前沿,为未来扩展研究提供了低于十亿参数的基线。

Comments 9 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.04215 2026-08-03 cs.LG cs.AI 版本更新 78%

Predict-then-Diffuse: Adaptive Response Length for Compute-Budgeted Inference in Diffusion LLMs

预测后扩散:面向扩散大语言模型的自适应响应长度计算

Michael Rottoli, Subhankar Roy, Stefano Paraboschi

机构 * IEEE

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 本文提出Predict-then-Diffuse框架,通过自适应响应长度预测器和安全机制,实现计算预算下的高效推理,减少计算成本并保持输出质量。

Comments Accepted for publication in IJCNN 2026 (International Joint Conference on Neural Networks)

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.02685 2026-08-03 cs.LG 版本更新 78%

Expert-Data Alignment Governs Generation Quality in Decentralized Diffusion Models

专家-数据对齐决定去中心化扩散模型的生成质量

Marcos Villagra, Bidhan Roy, Raihan Seraj, Zhiying Jiang

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 专家-数据对齐决定去中心化扩散模型生成质量,而非数值稳定性。

Comments 15 pages, 4 figures. DeLTa@ICLR2026 and Sci4DL@ICLR2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.07339 2026-08-03 cs.AI cs.LG cs.RO 版本更新 78%

RAPiD: Reward-Guided Consistency Distillation of Diffusion Planners for Real-Time Autonomous Driving

RAPiD: 通过扩散行为先验实现安全高效的实时确定性轨迹规划

Ruturaj Reddy, Hrishav Bakul Barua, Junn Yong Loo, Thanh Thi Nguyen, Ganesh Krishnasamy

机构 * School of Information Technology, Monash University, Malaysia(墨尔本大学信息科技学院) Faculty of Information Technology, Monash University, Australia(墨尔本大学信息技术学院) TCS Research, India(印度TCS研究)

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 RAPiD通过扩散行为先验实现高效安全的实时轨迹规划,优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.08022 2026-08-03 stat.ML cs.LG cs.NA math.NA math.PR math.ST stat.TH 版本更新 78%

Provable Diffusion Posterior Sampling for Bayesian Inversion

可证明的扩散后验采样用于贝叶斯反问题

Jinyuan Chang, Chenguang Duan, Yuling Jiao, Ruoxuan Li, Jerry Zhijian Yang, Cheng Yuan

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 本文提出了一种基于扩散的可证明后验采样方法,通过数据学习分数以捕捉先验分布结构,并提供非渐近误差界以确保复杂多模态后验分布的收敛性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.17136 2026-08-03 cs.LG 版本更新 78%

In-situ Autoguidance: Eliciting Self-Correction in Diffusion Models

原位自引导:激发扩散模型的自校正能力

Enhao Gu, Haolin Hou

机构 * Xinjiang University, Urumqi, Xinjiang, China(新疆大学) Ocean University of China, Qingdao, Shandong, China(中国海洋大学)

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 该研究提出原位自引导方法,无需辅助模型,通过随机前向传播动态生成次优预测,实现零成本的扩散模型自校正引导,为高性价比引导建立了新基准。

Comments ICML 2025 Workshop Accepted

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.24395 2026-08-03 eess.AS cs.SD 版本更新 78%

Unsupervised Single-Channel Speech Separation with Diffusion under Speaker-Embedding Guidance

基于说话人嵌入引导的无监督单通道语音分离扩散模型

Runwu Shi, Kai Li, Yiyan Wang, Jiang Wang, Chang Li, Ragib Amin Nihal, Sihan Tan, Kazuhiro Nakadai

机构 * Institute of Science Tokyo(东京科学研究所) Tsinghua University(清华大学) University of Science and Technology of China(中国科学技术大学)

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 该研究针对无监督单通道语音分离问题,提出说话人嵌入引导与分离导向求解器,提升了基于源模型的无监督语音分离性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.29180 2026-08-03 cs.CV cs.AI 新提交 70%

MoRAE: Flow-Friendly Self-Supervised Latents for Text-to-Motion Generation

MoRAE:面向文本到动作生成的流友好型自监督隐变量

Yifei Zhu, Mingyi Shi, Yangyang Cai, Miao Cheng, Yoshifumi Kitamura, Taku Komura

专题命中 扩散模型 :image generation(abstract);diffusion(abstract);分类 cs.CV

AI总结 MoRAE针对文本到动作生成中直接采用图像生成RAE范式的失败,解决了动作空间的两个特有瓶颈,使Flow-Matching DiT实现了最先进的文本到动作生成性能。

详情

展开后加载摘要…

URL PDF HTML 收藏