arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

视觉与机器人

图像生成

图像生成、文生图、图像编辑、扩散模型和可控生成。

共收录 70051 信号源:cs.CV, cs.GR, cs.MM

1. 扩散模型 70051 篇

2411.14384 2025-10-14 cs.CV cs.GR 82%

Baking Gaussian Splatting into Diffusion Denoiser for Fast and Scalable Single-stage Image-to-3D Generation and Reconstruction

Yuanhao Cai, He Zhang, Kai Zhang, Yixun Liang, Mengwei Ren, Fujun Luan, Qing Liu, Soo Ye Kim, Jianming Zhang, Zhifei Zhang, Yuqian Zhou, Yulun Zhang, Xiaokang Yang, Zhe Lin, Alan Yuille

机构 * Johns Hopkins University(约翰霍普金斯大学) Adobe Research(Adobe研究) HKUST(香港科技大学) Shanghai Jiao Tong University(上海交通大学)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV、cs.GR

Comments ICCV 2025; A novel one-stage 3DGS-based diffusion for 3D object generation and scene reconstruction from a single view in ~6 seconds

详情

展开后加载摘要…

URL PDF HTML 收藏
2302.14368 2025-07-02 cs.CV cs.AI cs.GR 82%

Enhanced Controllability of Diffusion Models via Feature Disentanglement and Realism-Enhanced Sampling Methods

Wonwoong Cho, Hareesh Ravi, Midhun Harikumar, Vinh Khuc, Krishna Kumar Singh, Jingwan Lu, David I. Inouye, Ajinkya Kale

机构 * Purdue University(普渡大学) Adobe Applied Research(Adobe应用研究) Adobe Research(Adobe研究)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV、cs.GR

Comments ECCV 2024; Code is available at https://github.com/WonwoongCho/Towards-Enhanced-Controllability-of-Diffusion-Models

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.07111 2024-07-11 cs.CV cs.AI cs.LG cs.MM 82%

Diffusion Model-Based Video Editing: A Survey

Wenhao Sun, Rong-Cheng Tu, Jingyi Liao, Dacheng Tao

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV、cs.MM

Comments 23 pages, 12 figures, a project related to this paper can be found at https://github.com/wenhao728/awesome-diffusion-v2v

详情

展开后加载摘要…

URL PDF HTML 收藏
2404.18928 2024-04-30 cs.CV cs.AI cs.CL cs.GR cs.LG 82%

Stylus: Automatic Adapter Selection for Diffusion Models

Michael Luo, Justin Wong, Brandon Trabucco, Yanping Huang, Joseph E. Gonzalez, Zhifeng Chen, Ruslan Salakhutdinov, Ion Stoica

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV、cs.GR

Comments Project Website: https://stylus-diffusion.github.io

详情

展开后加载摘要…

URL PDF HTML 收藏
2402.14810 2024-02-23 cs.CV cs.AI cs.GR cs.LG 82%

GeneOH Diffusion: Towards Generalizable Hand-Object Interaction Denoising via Denoising Diffusion

Xueyi Liu, Li Yi

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV、cs.GR

Comments Accepted to ICLR 2024. Project website: https://meowuu7.github.io/GeneOH-Diffusion/; Huggingface Demo: https://huggingface.co/spaces/xymeow7/gene-hoi-denoising; Code: https://github.com/Meowuu7/GeneOH-Diffusion

Journal ref ICLR 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2311.15435 2023-11-28 cs.CV cs.GR cs.LG 82%

Functional Diffusion

Biao Zhang, Peter Wonka

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV、cs.GR

Comments For the project site, see https://1zb.github.io/functional-diffusion/

详情

展开后加载摘要…

URL PDF HTML 收藏
2306.11719 2023-11-20 cs.CV cs.GR cs.LG 82%

Diffusion with Forward Models: Solving Stochastic Inverse Problems Without Direct Supervision

Ayush Tewari, Tianwei Yin, George Cazenavette, Semon Rezchikov, Joshua B. Tenenbaum, Frédo Durand, William T. Freeman, Vincent Sitzmann

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV、cs.GR

Comments Project page: https://diffusion-with-forward-models.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2303.13006 2023-10-03 cs.CV cs.GR cs.LG 82%

Controllable Inversion of Black-Box Face Recognition Models via Diffusion

Manuel Kansy, Anton Raël, Graziana Mignone, Jacek Naruniec, Christopher Schroers, Markus Gross, Romann M. Weber

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV、cs.GR

Comments 8 pages main paper + 23 pages supplementary material. Moderate revisions from v1 (different template, added user study, wording). Presented at AMFG workshop at ICCV 2023. Project page: https://studios.disneyresearch.com/2023/10/02/controllable-inversion-of-black-box-face-recognition-models-via-diffusion/

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.14729 2026-08-18 cs.CV 新提交 81%

Do CNNs Internally Represent Real and Fake Images Differently? A Hidden-Layer Analysis

卷积神经网络(CNNs)是否在内部对真实图像与虚假图像的表示存在差异?隐藏层分析

Moumita Sen Sarma, Pascal Hitzler, Eugene Y. Vasserman

机构 * Kansas State University(堪萨斯州立大学)

专题命中 扩散模型 :diffusion(abstract,abstract_cn);image generation(abstract);text-to-image(abstract);分类 cs.CV

AI总结 本研究通过场景识别实验证实,CNNs对真实与虚假图像的隐藏层激活存在可统计的差异,该差异无法仅用图像退化解释,为改进虚假图像检测提供了新思路。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.19725 2026-08-07 cs.LG cs.CV 版本更新 81%

Analytic Distribution of Classifier-Free Guidance for Schedule Design

用于调度设计的无分类器指导的解析分布

Enze Jiang, Zheng Ma

专题命中 扩散模型 :diffusion(summary_cn,abstract);分类 cs.CV

AI总结 研究针对扩散模型中无分类器指导(CFG)的分布问题,通过概率流常微分方程分析并推导解析表示,提出分布引导CFG调度,经玩具模型验证,在Stable Diffusion 1.5上改进生成效果,降低采样成本。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.00064 2026-08-05 cs.CV 版本更新 81%

Noise-Robust Conditional Flow Matching: Generating Clean Samples from Noisy Datasets

噪声鲁棒条件流匹配:从噪声数据集生成干净样本

Adrian Urbański, Gabriel della Maggiora, Artur Yakimovich

机构 * Center for Advanced Systems Understanding (CASUS)(高级系统理解中心) Helmholtz-Zentrum Dresden-Rossendorf e. V. (HZDR)(德累斯顿-罗森多夫亥姆霍兹中心) Institute of Computer Science, University of Wrocław(弗罗茨瓦夫大学计算机科学学院) School of Computation, Information and Technology, Technical University of Munich(慕尼黑工业大学计算、信息与技术学院) Cluster of Excellence Physics of Life(生命物理学卓越集群)

专题命中 扩散模型 :diffusion(summary_cn,abstract);分类 cs.CV

AI总结 该研究针对科学成像中噪声数据难以获取干净参考的问题,提出NR-CFM模型,可从单张带噪图像学习生成干净样本,在多数场景优于NR-GAN,高噪声下与Ambient Diffusion相当,低信噪比科学数据上表现良好。

Comments 10 pages, 3 Figures, and an Appendix

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.27036 2026-07-30 cs.CV cs.LG 新提交 81%

Mitigating Compounding Error via Video Representation Regularization

通过视频表示正则化缓解复合误差

Taiye Chen, Qi Zhang, Yisen Wang

机构 * Peking University(北京大学)

专题命中 扩散模型 :diffusion(summary_cn,abstract);分类 cs.CV

AI总结 针对视频扩散世界模型自回归生成的复合误差问题,研究发现其与表示维度崩溃相关,提出视频表示正则化方法,在VBench指标上显著优于Diffusion Forcing,提升了长视频生成的鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.25802 2026-07-30 cs.CV 版本更新 81%

Explicit Layer Modeling for Video Object Insertion and Layer Decomposition

用于视频对象插入和层分解的显式层建模

Kyujin Han, Seungjoo Shin, Sunghyun Cho

机构 * POSTECH(浦项科技大学)

专题命中 扩散模型 :diffusion(summary_cn,abstract);分类 cs.CV

AI总结 研究针对视频编辑系统缺乏显式分层表示的问题,提出TriLayer数据集及DBL-Diffusion框架,用于视频对象插入和层分解任务,显著提升了插入保真度和分解质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.27608 2026-06-29 cs.CV cs.LG 新提交 81%

Qwen-Image-2.0-RL Technical Report

Qwen-Image-2.0-RL 技术报告

Yixian Xu, Kaiyuan Gao, Yuxiang Chen, Yilei Chen, Zecheng Tang, Zihao Liu, Zikai Zhou, Deqing Li, Hao Meng, Kuan Cao, Jiahao Li, Jie Zhang, Liang Peng, Lihan Jiang, Ningyuan Tang, Shengming Yin, Tianhe Wu, Xiaoyue Chen, Yan Shu, Yanran Zhang, Yi Wang, Yu Wu, Yujia Wu, Zekai Zhang, Zhendong Wang, Xiao Xu, Kun Yan, Chenfei Wu

专题命中 扩散模型 :image generation(abstract);text-to-image(abstract);diffusion(abstract);image editing(abstract)

AI总结 提出基于强化学习与在线蒸馏的后训练流程,通过复合奖励模型和GRPO框架提升扩散模型的视觉质量与指令遵循能力,在多个基准上取得显著提升。

Comments 16 pages, 6 figures, 1 table

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.27234 2026-06-26 cs.CY cs.AI cs.CV cs.HC 新提交 81%

From Celebrities to Anyone: Characterizing AI Nudification Content, Technology, and Community Dynamics on 4chan

从名人到普通人:4chan上AI裸化内容、技术与社区动态的特征分析

Chi Cui, Yixin Wu, Yang Zhang

机构 * CISPA Helmholtz Center for Information Security(CISPA海德堡信息安全中心)

专题命中 扩散模型 :diffusion(summary_cn,abstract);分类 cs.CV

AI总结 本研究通过分析4chan上的24,105个AI裸化内容,发现目标从名人转向普通人(占55.8%),开源模型(如Stable Diffusion)主导生成,少数活跃生产者驱动社区生态。

Comments 22 pages, 13 figures, 2 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.05985 2026-06-23 cs.CY cs.CV 版本更新 81%

Generating Fearful Images: Investigating Potential Emotional Biases in Image-Generation Models

生成恐惧图像:探究图像生成模型中的潜在情感偏差

Maneet Mehta, Cody Buntain

机构 * Yale University(耶鲁大学) University of Maryland(马里兰大学)

专题命中 扩散模型 :diffusion(summary_cn,abstract);分类 cs.CV

AI总结 研究生成式AI模型在图像情感表达中的偏差,发现Stable Diffusion、ChatGPT和Gemini等模型生成的图像普遍倾向于引发恐惧情绪,表明存在系统性偏差。

详情

展开后加载摘要…

URL PDF HTML 收藏
2311.04938 2026-05-22 cs.CV cs.AI cs.LG 81%

Improved DDIM Sampling with Moment Matching Gaussian Mixtures

改进的DDIM采样与矩匹配高斯混合模型

Prasad Gabbur

机构 * Independent Researcher(独立研究者) Apple(苹果公司)

专题命中 扩散模型 :diffusion(abstract,abstract_cn);image generation(abstract);text-to-image(abstract);分类 cs.CV

AI总结 本文提出在DDIM框架中使用高斯混合模型作为反向转换操作符,通过约束GMM参数匹配DDPM前向边缘的矩,从而在少量采样步骤下提升生成样本质量,实验表明GMM核在FID和IS指标上优于传统高斯核。

Comments 34 pages, 12 figures; Accepted to TMLR; Code open sourced

Journal ref Transactions on Machine Learning Research, 05/2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.12495 2026-05-13 cs.CV cs.AI cs.LG 81%

AlphaGRPO: Unlocking Self-Reflective Multimodal Generation in UMMs via Decompositional Verifiable Reward

AlphaGRPO:通过分解性可验证奖励解锁UMMs中的自反思多模态生成

Runhui Huang, Jie Wu, Rui Yang, Zhe Liu, Hengshuang Zhao

机构 * The University of Hong Kong(香港大学)

专题命中 扩散模型 :diffusion(abstract,abstract_cn);image generation(abstract);text-to-image(abstract);分类 cs.CV

AI总结 AlphaGRPO通过分解性可验证奖励提升多模态生成能力,实现文本到图像生成和自反思修正,验证了自反思强化方法在生成高质量输出中的有效性。

Comments ICML2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.07413 2025-08-12 cs.CV 81%

CLUE: Leveraging Low-Rank Adaptation to Capture Latent Uncovered Evidence for Image Forgery Localization

Youqi Wang, Shunquan Tan, Rongxuan Peng, Bin Li, Jiwu Huang

专题命中 扩散模型 :text-to-image(abstract);diffusion(abstract);image editing(abstract);image synthesis(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2312.08872 2024-10-10 cs.CV 81%

The Lottery Ticket Hypothesis in Denoising: Towards Semantic-Driven Initialization

Jiafeng Mao, Xueting Wang, Kiyoharu Aizawa

专题命中 扩散模型 :image generation(abstract);text-to-image(abstract);diffusion(abstract);image synthesis(abstract)

Comments ECCV 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2307.08698 2023-07-18 cs.CV cs.LG 81%

Flow Matching in Latent Space

Quan Dao, Hao Phung, Binh Nguyen, Anh Tran

专题命中 扩散模型 :image generation(abstract);diffusion(abstract);inpainting(abstract);image synthesis(abstract)

Comments Project Page: https://vinairesearch.github.io/LFM/

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.13597 2026-08-17 eess.IV cs.AI cs.CR cs.CV cs.MM 新提交 81%

Secret-Stego Dissimilarity as a Design Axis: Invertible Coverless Image Steganography with Diffusion Models

以秘密-隐写图像的差异性为设计轴:基于扩散模型的可逆无载体图像隐写术

Hongxin Xu, Jianping Mei, Can Wang, Defang Chen

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV、cs.MM

AI总结 该研究提出InvCISD可逆扩散框架,耦合秘密与参考图像潜在表示,降低秘密-隐写图像视觉相似性,提升隐写质量,为CIS抗隐写分析研究提供方向。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.23586 2026-08-05 cs.CV cs.CL cs.MM cs.SD eess.AS 版本更新 81%

Talker-T2AV: Joint Talking Audio-Video Generation with Autoregressive Diffusion Modeling

Talker-T2AV:基于自回归扩散模型的联合说话音频视频生成

Zhen Ye, Xu Tan, Aoxiong Yin, Hongzhan Lin, Guangyan Zhang, Peiwen Sun, Yiming Li, Chi-Min Chan, Wei Ye, Shikun Zhang, Wei Xue

机构 * Hong Kong University of Science and Technology(香港科学与技术大学) Zhejiang University(浙江大学) National University of Singapore(新加坡国立大学) The Chinese University of Hong Kong(香港中文大学) Peking University(北京大学) Independent Researcher(独立研究者)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV、cs.MM

AI总结 本文提出Talker-T2AV,通过共享骨干和模态特定解码器实现音频视频联合生成,提升跨模态一致性与生成效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.28164 2026-07-31 cs.CV cs.GR 新提交 81%

S-Avatar: Diffusion-Guided Gaussian Head Avatars from a Single Image

S-Avatar:基于单张图像的扩散引导高斯头部化身

Hail Song, Seokhwan Yang, Jiwon Yang, Woojin Cho, Woontack Woo

机构 * KAIST(韩国科学技术院) KAIST KI-ITC ARRC(韩国科学技术院KI-ITC ARRC)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV、cs.GR

AI总结 S-Avatar通过三阶段流水线,结合扩散引导3DGS生成与FLAME控制,从单张图像生成高逼真3D头部化身,提升了3D一致性,在新视点和表情生成上优于现有方法,适用于VR/AR应用。

Comments 15 pages, 12 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.23159 2026-07-31 cs.AI cs.CV cs.MM 版本更新 81%

CachedSearch: Training-Free Cached Exploration for Test-Time Search in Video Diffusion

CachedSearch:用于视频扩散测试时搜索的免训练缓存探索

Shreshth Saini, Neil Birkbeck, Yilin Wang, Balu Adsumilli, Alan C. Bovik

机构 * The University of Texas at Austin(德克萨斯大学奥斯汀分校)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV、cs.MM

AI总结 研究视频扩散测试时搜索中缓存对候选者排名的影响,提出CachedSearch方法,通过积极缓存探索候选者,仅全计算时重生成获胜者,在多模型多系列中有效提升效率,以低成本获高增益,且免训练、与验证器无关,可用于测试时扩展。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.24665 2026-07-28 cs.CV cs.GR cs.LG 新提交 81%

MMOE: Modernizing Diffusion Transformers with Efficient Expert Design

MMOE:通过高效专家设计使扩散变压器现代化

Yanhao Jia, Jiepeng Wang, Haibin Huang, Chi Zhang, Erik Cambria, Xuelong Li

机构 * College of Computing and Data Science, Nanyang Technological University(南洋理工大学计算与数据科学学院) Institute of Artificial Intelligence of China Telecom (TeleAI)(中国电信人工智能研究院)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV、cs.GR

AI总结 研究AIGC基础模型中扩散变压器未平衡质量与成本问题,提出MMOE对其现代化改造,将多种专家设计应用于AIGC生成,实验表明MMOE能达更好质量成本平衡,使AIGC基础模型可循大语言模型平衡扩展路径。

Comments 13 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.08016 2026-07-16 cs.CV cs.GR 版本更新 81%

LightCrafter: PBR-Conditioned Video Diffusion Refinement for Controllable and Consistent Relighting

LightCrafter:用于可控且一致的重光照的PBR条件视频扩散细化

Zixin Guo, Yehonathan Litman, Yifeng He, John Miller, Chuhan Chen, Deva Ramanan

机构 * Carnegie Mellon University(卡内基梅隆大学) University of Toronto(多伦多大学) Bosch Research(博世研究)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV、cs.GR

AI总结 研究视频重光照问题,提出LightCrafter混合管道,将其重表述为代理视频转换,利用PBR渲染并结合光度先验,在真实世界重光照基准上优于现有技术,还贡献合成基准及相关资源。

Comments Project page: https://www.zixinguo.me/lightcrafter

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.29095 2026-06-30 cs.CV cs.GR cs.LG 81%

HorizonRelight: Relighting Long-horizon Videos Consistently via Diffusion Transformers

HorizonRelight: 通过扩散变换器一致地重照明长时域视频

Jing Yang, Mayoore Jaiswal, Zian Wang, Steven Zeng, Rochelle Pereira, Yajie Zhao, Jianyuan Min

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV、cs.GR

AI总结 针对长视频重照明中的时间不连续问题,提出基于扩散变换器的框架,通过掩码目标域自条件化和热启动提示实现跨块一致重照明,显著提升时间一致性。

Comments https://research.nvidia.com/labs/sil/projects/horizonrelight/

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.24946 2026-06-25 cs.CV cs.AI cs.MM 版本更新 81%

HaineiFRDM: Structure-Preserving Diffusion for Film Restoration under Fast Motion and Diverse Defects

HaineiFRDM:面向快速运动与多样缺陷的保结构扩散电影修复方法

Rongji Xun, Junjie Yuan, Zhongjie Wang

机构 * Tongji University, Shanghai, China(同济大学) Shanghai Film Restoration Laboratory, Shanghai, China(上海电影修复实验室)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV、cs.MM

AI总结 针对电影修复中快速运动导致肢体消失和结构扭曲的问题,提出基于扩散模型的HaineiFRDM,采用内容感知修复、分块策略与位置感知全局融合模块,实现高分辨率保结构修复,并引入频率模块增强纹理一致性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.20764 2026-06-23 cs.CV cs.AI cs.GR cs.LG 新提交 81%

One Image is All You Need: Agentic One-Shot Image Generation via Text-Based World Models for Long-Tail Spatial Perception

一图足矣:基于文本世界模型的智能体单样本图像生成用于长尾空间感知

Keqin Zeng, Shuting Su, Shihao Lin, Ziyue Li, Rui Zhao

机构 * Tsinghua University(清华大学) SenseTime Research(商汤科技研究院) Sun Yat-Sen University(中山大学) Technical University of Munich(慕尼黑工业大学) Heilbronn Data Science Center(海尔布隆数据科学中心) Munich Data Institute(慕尼黑数据研究所)

专题命中 扩散模型 :image generation(title);diffusion(abstract);分类 cs.CV、cs.GR

AI总结 提出WMGen-v1框架,利用单张参考图像通过LVLM构建结构化场景表示,LLM进行物理合理的场景扩展,再由扩散模型生成多样化的长尾训练数据,缓解空间感知中的数据稀缺问题。

详情

展开后加载摘要…

URL PDF HTML 收藏