arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

图像生成

图像生成、文生图、图像编辑、扩散模型和可控生成。

共收录 69989 信号源:cs.CV, cs.GR, cs.MM

1. 扩散模型 69989 篇

2504.17525 2025-04-25 cs.CV 83%

Text-to-Image Alignment in Denoising-Based Models through Step Selection

Paul Grimal, Hervé Le Borgne, Olivier Ferret

机构 * Université Paris-Saclay, CEA, List(巴黎-萨克雷大学、法国原子能委员会、List)

专题命中 扩散模型 :text-to-image(title);image generation(abstract);diffusion(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.17179 2025-04-25 cs.AI cs.CV cs.LG cs.RO 83%

AUTHENTICATION: Identifying Rare Failure Modes in Autonomous Vehicle Perception Systems using Adversarially Guided Diffusion Models

Mohammad Zarei, Melanie A Jutras, Eliana Evans, Mike Tan, Omid Aaramoon

机构 * MITRE Corporation(MITRE公司) Cranium Booz Allen Hamilton Virginia(Booz Allen Hamilton弗吉尼亚)

专题命中 扩散模型 :diffusion(title,abstract);inpainting(abstract);分类 cs.CV

Comments 8 pages, 10 figures. Accepted to IEEE Conference on Artificial Intelligence (CAI), 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.14450 2025-04-25 cs.CV 83%

Causal Disentanglement for Robust Long-tail Medical Image Generation

Weizhi Nie, Zichun Zhang, Weijie Wang, Bruno Lepri, Anan Liu, Nicu Sebe

机构 * School of Electrical and Information Engineering, Tianjin University, China(天津大学电气与信息工程学院) Department of Information Engineering and Computer Science, University of Trento, Italy(特伦托大学信息工程与计算机科学系) Fondazione Bruno Kessler, Italy(布鲁诺·克塞勒基金会)

专题命中 扩散模型 :image generation(title,abstract);diffusion(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.13763 2025-04-24 cs.CV cs.AI 83%

Decoding Vision Transformers: the Diffusion Steering Lens

Ryota Takatsuki, Sonia Joseph, Ippei Fujisawa, Ryota Kanai

机构 * Araya Inc.(Araya公司) AI Alignment Network(AI对齐网络) The University of Tokyo(东京大学) Mila - Quebec AI Institute(魁北克AI研究所) McGill University(麦吉尔大学)

专题命中 扩散模型 :diffusion(title,abstract);text-to-image(abstract);分类 cs.CV

Comments 12 pages, 17 figures. Accepted to the CVPR 2025 Workshop on Mechanistic Interpretability for Vision (MIV)

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.14666 2025-04-22 cs.CV 83%

Generative Multimodal Pretraining with Discrete Diffusion Timestep Tokens

Kaihang Pan, Wang Lin, Zhongqi Yue, Tenglong Ao, Liyu Jia, Wei Zhao, Juncheng Li, Siliang Tang, Hanwang Zhang

机构 * Zhejiang University(浙江大学) Nanyang Technological University(新加坡国立大学) Peking University(北京大学) Huawei Singapore Research Center(华为新加坡研究中心)

专题命中 扩散模型 :diffusion(title,abstract);image generation(abstract);分类 cs.CV

Comments Accepted by CVPR 2025 (Oral)

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.19902 2025-04-22 cs.CV 83%

ICE: Intrinsic Concept Extraction from a Single Image via Diffusion Models

Fernando Julio Cendra, Kai Han

机构 * Visual AI Lab, The University of Hong Kong(香港大学视觉人工智能实验室)

专题命中 扩散模型 :diffusion(title,abstract);text-to-image(abstract);分类 cs.CV

Comments CVPR 2025, Project page: https://visual-ai.github.io/ice

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.14462 2025-04-22 cs.CV 83%

Affordance-Aware Object Insertion via Mask-Aware Dual Diffusion

Jixuan He, Wanhua Li, Ye Liu, Junsik Kim, Donglai Wei, Hanspeter Pfister

机构 * Harvard University(哈佛大学) Cornell Tech(康奈尔科技) The Hong Kong Polytechnic University(香港理工大学) Boston College(波士顿大学)

专题命中 扩散模型 :diffusion(title,abstract);image editing(abstract);分类 cs.CV

Comments Code is available at: https://github.com/KaKituken/affordance-aware-any. Project page at: https://kakituken.github.io/affordance-any.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.14267 2025-04-22 cs.CV 83%

Text-Audio-Visual-conditioned Diffusion Model for Video Saliency Prediction

Li Yu, Xuanzhe Sun, Wei Zhou, Moncef Gabbouj

机构 * School of Computer Science, Nanjing University of Information Science and Technology(信息科学与技术南京大学计算机科学学院) Jiangsu Collaborative Innovation Center of Atmospheric Environment and Equipment Technology, Nanjing University of Information Science and Technology(大气环境与设备技术江苏省协同创新中心) School of Computer Science and Informatics, Cardiff University(计算机科学与信息学院卡斯尔大学) Faculty of Information Technology and Communication Sciences, Tampere University(信息科技与通讯科学学院坦佩雷大学)

专题命中 扩散模型 :diffusion(title,abstract);image generation(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2312.01027 2025-04-21 cs.CV 83%

LDM-ISP: Enhancing Neural ISP for Low Light with Latent Diffusion Models

Qiang Wen, Zhefan Rao, Yazhou Xing, Qifeng Chen

专题命中 扩散模型 :diffusion(title,abstract);image generation(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.12395 2025-04-18 cs.CV 83%

InstantCharacter: Personalize Any Characters with a Scalable Diffusion Transformer Framework

Jiale Tao, Yanbing Zhang, Qixun Wang, Yiji Cheng, Haofan Wang, Xu Bai, Zhengguang Zhou, Ruihuang Li, Linqing Wang, Chunyu Wang, Qin Lin, Qinglin Lu

专题命中 扩散模型 :diffusion(title,abstract);image generation(abstract);分类 cs.CV

Comments Tech Report. Code is available at https://github.com/Tencent/InstantCharacter

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.12100 2025-04-17 cs.CV 83%

Generalized Visual Relation Detection with Diffusion Models

Kaifeng Gao, Siqi Chen, Hanwang Zhang, Jun Xiao, Yueting Zhuang, Qianru Sun

专题命中 扩散模型 :diffusion(title,abstract);text-to-image(abstract);分类 cs.CV

Comments Under review at IEEE TCSVT. The Appendix is provided additionally

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.10001 2025-04-17 cs.CV 83%

GaussVideoDreamer: 3D Scene Generation with Video Diffusion and Inconsistency-Aware Gaussian Splatting

Junlin Hao, Peiheng Wang, Haoyang Wang, Xinggong Zhang, Zongming Guo

专题命中 扩散模型 :diffusion(title,abstract);inpainting(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.11457 2025-04-16 cs.CV 83%

Aligning Generative Denoising with Discriminative Objectives Unleashes Diffusion for Visual Perception

Ziqi Pang, Xin Xu, Yu-Xiong Wang

专题命中 扩散模型 :diffusion(title,abstract);image generation(abstract);分类 cs.CV

Comments ICLR 2025

Journal ref ICLR 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.11423 2025-04-16 cs.CV cs.AI 83%

ADT: Tuning Diffusion Models with Adversarial Supervision

Dazhong Shen, Guanglu Song, Yi Zhang, Bingqi Ma, Lujundong Li, Dongzhi Jiang, Zhuofan Zong, Yu Liu

专题命中 扩散模型 :diffusion(title,abstract);image generation(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.09606 2025-04-15 cs.CV 83%

Early-Bird Diffusion: Investigating and Leveraging Timestep-Aware Early-Bird Tickets in Diffusion Models for Efficient Training

Lexington Whalen, Zhenbang Du, Haoran You, Chaojian Li, Sixu Li, Yingyan, Lin

专题命中 扩散模型 :diffusion(title,abstract);image generation(abstract);分类 cs.CV

Comments 10 pages, 5 figures. Accepted to the IEEE/CVF Conference on Computer Vision and Pattern Recognition 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.09513 2025-04-15 cs.CV 83%

DiffuMural: Restoring Dunhuang Murals with Multi-scale Diffusion

Puyu Han, Jiaju Kang, Yuhang Pan, Erting Pan, Zeyu Zhang, Qunchao Jin, Juntao Jiang, Zhichen Liu, Luqi Gong

专题命中 扩散模型 :diffusion(title,abstract);image generation(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.11423 2025-04-15 cs.CV 83%

Nearly Zero-Cost Protection Against Mimicry by Personalized Diffusion Models

Namhyuk Ahn, KiYoon Yoo, Wonhyuk Ahn, Daesik Kim, Seung-Hun Nam

专题命中 扩散模型 :diffusion(title,abstract);image generation(abstract);分类 cs.CV

Comments CVPR 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.08470 2025-04-14 cs.SD cs.AI cs.MM eess.AS 83%

On the Design of Diffusion-based Neural Speech Codecs

Pietro Foti, Andreas Brendel

专题命中 扩散模型 :diffusion(title,abstract);image generation(abstract);分类 cs.MM

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.07999 2025-04-14 cs.GR 83%

IGG: Image Generation Informed by Geodesic Dynamics in Deformation Spaces

Nian Wu, Nivetha Jayakumar, Jiarui Xing, Miaomiao Zhang

专题命中 扩散模型 :image generation(title,abstract);diffusion(abstract);分类 cs.GR

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.06432 2025-04-14 cs.CV 83%

D-Feat Occlusions: Diffusion Features for Robustness to Partial Visual Occlusions in Object Recognition

Rupayan Mallick, Sibo Dong, Nataniel Ruiz, Sarah Adel Bargal

专题命中 扩散模型 :diffusion(title,abstract);image generation(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.07945 2025-04-11 cs.CV cs.AI 83%

GenEAva: Generating Cartoon Avatars with Fine-Grained Facial Expressions from Realistic Diffusion-based Faces

Hao Yu, Rupayan Mallick, Margrit Betke, Sarah Adel Bargal

专题命中 扩散模型 :diffusion(title,abstract);text-to-image(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2402.18206 2025-04-11 cs.CV 83%

Balancing Act: Distribution-Guided Debiasing in Diffusion Models

Rishubh Parihar, Abhijnya Bhat, Abhipsa Basu, Saswat Mallick, Jogendra Nath Kundu, R. Venkatesh Babu

专题命中 扩散模型 :diffusion(title,abstract);image generation(abstract);分类 cs.CV

Comments CVPR 2024. Project Page : https://ab-34.github.io/balancing_act/

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.06264 2025-04-11 cs.LG cs.AI cs.CL cs.CV stat.ML 83%

Think While You Generate: Discrete Diffusion with Planned Denoising

Sulin Liu, Juno Nam, Andrew Campbell, Hannes Stärk, Yilun Xu, Tommi Jaakkola, Rafael Gómez-Bombarelli

专题命中 扩散模型 :diffusion(title,abstract);image generation(abstract);分类 cs.CV

Comments ICLR 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.06861 2025-04-10 cs.CV cs.AI 83%

EIDT-V: Exploiting Intersections in Diffusion Trajectories for Model-Agnostic, Zero-Shot, Training-Free Text-to-Video Generation

Diljeet Jagpal, Xi Chen, Vinay P. Namboodiri

专题命中 扩散模型 :diffusion(title,abstract);image generation(abstract);分类 cs.CV

Comments Accepted at IEEE/CVF Conference on Computer Vision and Pattern Recognition (CVPR) 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.03821 2025-04-08 cs.CV cs.LG eess.IV 83%

A Hybrid Wavelet-Fourier Method for Next-Generation Conditional Diffusion Models

Andrew Kiruluta, Andreas Lemos

专题命中 扩散模型 :diffusion(title,abstract);image generation(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2408.11408 2025-04-08 cs.CV 83%

Latent Feature and Attention Dual Erasure Attack against Multi-View Diffusion Models for 3D Assets Protection

Jingwei Sun, Xuchong Zhang, Changfeng Sun, Qicheng Bai, Hongbin Sun

专题命中 扩散模型 :diffusion(title,abstract);image generation(abstract);分类 cs.CV

Comments This paper has been accepted by ICME 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.02762 2025-04-04 cs.CV 83%

MD-ProjTex: Texturing 3D Shapes with Multi-Diffusion Projection

Ahmet Burak Yildirim, Mustafa Utku Aydogdu, Duygu Ceylan, Aysegul Dundar

专题命中 扩散模型 :diffusion(title,abstract);text-to-image(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.01873 2025-04-03 cs.CV 83%

A Diffusion-Based Framework for Occluded Object Movement

Zheng-Peng Duan, Jiawei Zhang, Siyu Liu, Zheng Lin, Chun-Le Guo, Dongqing Zou, Jimmy Ren, Chongyi Li

专题命中 扩散模型 :diffusion(title,abstract);image editing(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.01577 2025-04-03 eess.IV cs.CV 83%

Instance Migration Diffusion for Nuclear Instance Segmentation in Pathology

Lirui Qi, Hongliang He, Tong Wang, Siwei Feng, Guohong Fu

专题命中 扩散模型 :diffusion(title,abstract);inpainting(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.14279 2025-04-02 cs.CV 83%

ControlSR: Taming Diffusion Models for Consistent Real-World Image Super Resolution

Yuhao Wan, Peng-Tao Jiang, Qibin Hou, Hao Zhang, Jinwei Chen, Ming-Ming Cheng, Bo Li

专题命中 扩散模型 :diffusion(title,abstract);text-to-image(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏