arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

图像生成

图像生成、文生图、图像编辑、扩散模型和可控生成。

共收录 69868 信号源:cs.CV, cs.GR, cs.MM

1. 扩散模型 69868 篇

2512.08486 2026-02-11 cs.CV 85%

Temporal Concept Dynamics in Diffusion Models via Prompt-Conditioned Interventions

通过提示条件干预研究扩散模型中的时间概念动态

Ada Gorgun, Fawaz Sammani, Nikos Deligiannis, Bernt Schiele, Jonas Fischer

机构 * Max Planck Institute for Informatics(马克斯·普朗克信息研究所) ETRO Department, Vrije Universiteit Brussel and imec(ETRO部门,布鲁塞尔自由大学和imec)

专题命中 扩散模型 :diffusion(title,abstract);text-to-image(abstract);image editing(abstract);分类 cs.CV

AI总结 通过提示条件干预研究扩散模型中概念随时间动态的变化,揭示不同阶段对特定概念的适应性,提升文本驱动图像编辑的效果。

Comments Accepted at the International Conference on Learning Representations 2026 (ICLR 2026). Code is available at: https://adagorgun.github.io/PCI-Project/

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.08249 2026-02-10 eess.IV cs.CV 85%

A Unified Framework for Multimodal Image Reconstruction and Synthesis using Denoising Diffusion Models

基于去噪扩散模型的多模态图像重建与合成统一框架

Weijie Gan, Xucheng Wang, Tongyao Wang, Wenshang Wang, Chunwei Ying, Yuyang Hu, Yasheng Chen, Hongyu An, Ulugbek S. Kamilov

机构 * Department of Computer Science and Engineering, Washington University in St. Louis(华盛顿大学圣路易斯分校计算机科学与工程系) Mallinckrodt Institute of Radiology, Washington University in St. Louis(华盛顿大学圣路易斯分校马林克罗德特放射医学研究所) Department of Electrical and Systems Engineering, Washington University in St. Louis(华盛顿大学圣路易斯分校电气与系统工程系) Department of Neurology, Washington University in St. Louis(华盛顿大学圣路易斯分校神经病学系) Department of Biomedical Engineering, Washington University in St. Louis(华盛顿大学圣路易斯分校生物医学工程系) Division of Biology and Biomedical Sciences, Washington University in St. Louis(华盛顿大学圣路易斯分校生物学与生物医学科学 division) Department of Electrical and Computer Engineering, University of Wisconsin–Madison(威斯康星大学麦迪逊分校电气与计算机工程系)

专题命中 扩散模型 :diffusion(title,abstract);inpainting(abstract);image synthesis(abstract);分类 cs.CV

AI总结 Any2all通过统一框架实现多模态图像重建与合成,利用去噪扩散模型提升性能与质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.06825 2026-02-09 cs.LG cs.AI cs.CV 85%

AEGPO: Adaptive Entropy-Guided Policy Optimization for Diffusion Models

AEGPO:适应性熵引导策略优化用于扩散模型

Yuming Li, Qingyu Li, Chengyu Bai, Xiangyang Luo, Zeyue Xue, Wenyu Qin, Meng Wang, Yikai Wang, Shanghang Zhang

机构 * Peking University(北京大学) Kling Team, Kuaishou Technology(快手科技 Kling 团队) The University of Hong Kong(香港大学) Beijing Normal University(北京师范大学)

专题命中 扩散模型 :diffusion(title,abstract);image generation(abstract);text-to-image(abstract);分类 cs.CV

AI总结 AEGPO通过双信号双层自适应优化提升扩散模型策略优化效率,实现更高效的收敛和更好的对齐性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.26096 2026-02-04 cs.CV cs.IT cs.LG math.IT math.OC stat.ML 85%

EVODiff: Entropy-aware Variance Optimized Diffusion Inference

EVODiff: 基于熵的方差优化扩散推理

Shigui Li, Wei Chen, Delu Zeng

专题命中 扩散模型 :diffusion(title,abstract);image generation(abstract);text-to-image(abstract);分类 cs.CV

AI总结 EVODiff通过优化条件熵减少不确定性,提升扩散模型的推理效率和生成质量。

Comments NeurIPS 2025, 41 pages, 14 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.12203 2026-02-04 cs.CV 85%

LazyDrag: Enabling Stable Drag-Based Editing on Multi-Modal Diffusion Transformers via Explicit Correspondence

LazyDrag: 通过显式对应关系在多模态扩散变换器上实现稳定的拖拽编辑

Zixin Yin, Xili Dai, Duomin Wang, Xianfang Zeng, Lionel M. Ni, Gang Yu, Heung-Yeung Shum

机构 * The Hong Kong University of Science and Technology(香港科技大学) StepFun The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州))

专题命中 扩散模型 :diffusion(title,abstract);image editing(abstract);inpainting(abstract);分类 cs.CV

AI总结 LazyDrag通过显式对应关系实现多模态扩散变换器的稳定拖拽编辑,消除了隐式点匹配依赖,提升生成能力与精确控制。

Comments https://zxyin.github.io/LazyDrag

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.16660 2026-01-26 eess.IV cs.CV cs.LG 85%

Fast, faithful and photorealistic diffusion-based image super-resolution with enhanced Flow Map models

快速、忠实且逼真基于扩散的图像超分辨率与增强的流图模型

Maxence Noble, Gonzalo Iñaki Quintana, Benjamin Aubin, Clément Chadebec

机构 * Jasper Research(Jasper研究机构) CMAP, CNRS, Ecole polytechnique(CMAP、CNRS、巴黎高等师范学院)

专题命中 扩散模型 :diffusion(title,abstract);image generation(abstract);text-to-image(abstract);分类 cs.CV

AI总结 本文提出FlowMapSR,一种基于扩散的图像超分辨率框架,通过增强流图模型和对抗微调提升效率和逼真度,实现高 fidelity 和快速推理。

Comments Technical report

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.16060 2026-01-23 cs.CV 85%

ProGiDiff: Prompt-Guided Diffusion-Based Medical Image Segmentation

ProGiDiff: 基于提示引导的扩散模型医学图像分割

Yuan Lin, Murong Xu, Marc Hölle, Chinmay Prabhakar, Andreas Maier, Vasileios Belagiannis, Bjoern Menze, Suprosanna Shit

机构 * Friedrich-Alexander-Universität Erlangen-Nürnberg(埃朗根-纽伦堡弗里德里希-亚历山大大学) University of Zurich(苏黎世大学)

专题命中 扩散模型 :diffusion(title,abstract);image generation(abstract);text-to-image(abstract);分类 cs.CV

AI总结 ProGiDiff通过提示引导的扩散模型实现医学图像分割,结合自定义编码器和多类条件化机制,提升分割性能和跨模态适应能力。

Comments 5 pages, 4 figures. It has been accepted by IEEE ISBI

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.15473 2026-01-23 cs.CV cs.LG eess.IV 85%

Emergence and Evolution of Interpretable Concepts in Diffusion Models

扩散模型中可解释概念的涌现与演化

Berk Tinaz, Zalan Fabian, Mahdi Soltanolkotabi

机构 * Dept. of Electrical and Computer Engineering University of Southern California(电气与计算机工程系 美国南加州大学)

专题命中 扩散模型 :diffusion(title,abstract);image generation(abstract);text-to-image(abstract);分类 cs.CV

AI总结 本研究利用SAEs框架揭示扩散模型中可解释概念的涌现与演化,发现早期阶段可控制图像组成,中间阶段确定组成,后期仅能改变细节。

Comments 32 pages, 32 figures, published at the 39th Conference on Neural Information Processing Systems (NeurIPS), 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.12283 2026-01-21 cs.CV 85%

SDiT: Semantic Region-Adaptive for Diffusion Transformers

SDiT:语义区域自适应的扩散变换器

Bowen Lin, Fanjiang Ye, Yihua Liu, Zhenghui Guo, Boyuan Zhang, Weijian Zheng, Yufan Xu, Tiancheng Xing, Yuke Wang, Chengming Zhang

机构 * University of Houston(德克萨斯大学奥斯汀分校) Rice University(里奇大学) Indiana University Bloomington(印第安纳大学布卢明顿分校) Argonne National Laboratory(阿贡国家实验室) National University of Singapore(新加坡国立大学)

专题命中 扩散模型 :diffusion(title,abstract);text-to-image(abstract);image synthesis(abstract);分类 cs.CV

AI总结 SDiT通过语义区域自适应技术,在不重新训练模型的情况下,实现去噪加速,同时保持高质量的图像生成效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.06803 2026-01-15 cs.CV 85%

DyDiT++: Diffusion Transformers with Timestep and Spatial Dynamics for Efficient Visual Generation

DyDiT++: 带时间步和空间动态的扩散变换器用于高效的视觉生成

Wangbo Zhao, Yizeng Han, Jiasheng Tang, Kai Wang, Hao Luo, Yibing Song, Gao Huang, Fan Wang, Yang You

机构 * National University of Singapore(新加坡国立大学) DAMO Academy, Alibaba Group(阿里云达摩院) Hupan Lab(虎扑实验室) Tsinghua University(清华大学)

专题命中 扩散模型 :diffusion(title,abstract);image generation(abstract);text-to-image(abstract);分类 cs.CV

AI总结 DyDiT++通过动态调整时间步和空间计算,提升视觉生成效率,减少计算成本并拓展应用范围。

Comments This paper was accepted to the IEEE Transactions on Pattern Analysis and Machine Intelligence (TPAMI) on January 9, 2026. arXiv admin note: substantial text overlap with arXiv:2410.03456

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.12318 2026-01-07 cs.CV cs.AI cs.LG 85%

Compositional Discrete Latent Code for High Fidelity, Productive Diffusion Models

组合式离散潜在代码用于高保真、高效的扩散模型

Samuel Lavoie, Michael Noukhovitch, Aaron Courville

机构 * Mila, Université de Montréal(蒙特利尔大学)

专题命中 扩散模型 :diffusion(title,abstract);image generation(abstract);text-to-image(abstract);分类 cs.CV

AI总结 本文提出离散潜在代码(DLC)以提升扩散模型的生成保真度,通过组合性实现分布外样本生成,并展示其在图像生成和文本到图像生成中的应用。

Comments Published at NeurIPS, 22 pages, 7 tables, 12 figures, code and models available

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.15465 2026-01-05 cs.CV 85%

FP4DiT: Towards Effective Floating Point Quantization for Diffusion Transformers

FP4DiT: 向有效浮点量化扩散变换器迈进

Ruichen Chen, Keith G. Mills, Di Niu

机构 * Department of Electrical and Computer Engineering, Faculty of Engineering University of Alberta(电气与计算机工程系,工程学院,阿尔伯塔大学) Division of Computer Science and Engineering, College of Engineering Louisiana State University(计算机科学与工程系,工程学院,路易斯安那州立大学)

专题命中 扩散模型 :diffusion(title,abstract);text-to-image(abstract);image synthesis(abstract);分类 cs.CV

AI总结 FP4DiT通过浮点量化技术实现更高效的扩散变换器量化,提升图像生成性能。

Comments The code is available at https://github.com/cccrrrccc/FP4DiT

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.13039 2025-12-17 cs.CV cs.CR 85%

Bi-Erasing: A Bidirectional Framework for Concept Removal in Diffusion Models

双删除:一种用于扩散模型概念移除的双向框架

Hao Chen, Yiwei Wang, Songze Li

专题命中 扩散模型 :diffusion(title,abstract);image generation(abstract);text-to-image(abstract);分类 cs.CV

AI总结 Bi-Erasing通过双向框架同时实现概念抑制与安全增强,提升扩散模型在移除有害概念与保持生成质量之间的平衡。

Comments Under Review

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.11464 2025-12-15 cs.CV cs.AI cs.LG 85%

Exploring MLLM-Diffusion Information Transfer with MetaCanvas

探索MLLM-扩散信息传输与MetaCanvas

Han Lin, Xichen Pan, Ziqi Huang, Ji Hou, Jialiang Wang, Weifeng Chen, Zecheng He, Felix Juefei-Xu, Junzhe Sun, Zhipeng Fan, Ali Thabet, Mohit Bansal, Chu Wang

机构 * Meta Superintelligence Labs(Meta 超智能实验室) New York University(纽约大学) Nanyang Technological University(南洋理工大学)

专题命中 扩散模型 :diffusion(title,abstract);image generation(abstract);text-to-image(abstract);分类 cs.CV

AI总结 MetaCanvas通过使MLLMs在潜在空间中推理和规划,提升多模态生成的精确度和结构化控制。

Comments Project page: https://metacanvas.github.io

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.16302 2025-12-09 cs.LG cs.AI cs.CR cs.CV 85%

Towards Resilient Safety-driven Unlearning for Diffusion Models against Downstream Fine-tuning

面向对抗下游微调的鲁棒安全驱动遗忘方法用于扩散模型

Boheng Li, Renjie Gu, Junjie Wang, Leyi Qi, Yiming Li, Run Wang, Zhan Qin, Tianwei Zhang

机构 * Nanyang Technological University, Singapore(南洋理工大学,新加坡) Central South University, China(中南大学,中国) Key Laboratory of Aerospace Information Security and Trusted Computing, Ministry of Education, School of Cyber Science and Engineering, Wuhan University, China(航空航天信息安全部门,教育部,武汉大学,中国) State Key Laboratory of Blockchain and Data Security, Zhejiang University, China(区块链与数据安全国家重点实验室,浙江大学,中国)

专题命中 扩散模型 :diffusion(title,abstract);image generation(abstract);text-to-image(abstract);分类 cs.CV

AI总结 本文提出ResAlign,一种针对扩散模型对抗下游微调的鲁棒安全驱动遗忘框架,通过隐含优化问题建模和元学习策略提升安全性和生成能力。

Comments Accepted to the 39th Conference on Neural Information Processing Systems (NeurIPS 2025)

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.03540 2025-12-08 cs.CV cs.AI 85%

CookAnything: A Framework for Flexible and Consistent Multi-Step Recipe Image Generation

CookAnything: 一个灵活且一致的多步骤食谱图像生成框架

Ruoxuan Zhang, Bin Wen, Hongxia Xie, Yi Yao, Songhan Zuo, Jian-Yu Jiang-Lin, Hong-Han Shuai, Wen-Huang Cheng

机构 * Jilin University(吉林大学) National Yang Ming Chiao Tung University(国立阳明交通大学) National Taiwan University(国立台湾大学)

专题命中 扩散模型 :image generation(title,abstract);text-to-image(abstract);diffusion(abstract);分类 cs.CV

AI总结 CookAnything通过引入步骤式区域控制、灵活RoPE和跨步骤一致性控制,实现了灵活且一致的多步骤食谱图像生成,提升复杂烹饪指令的视觉合成质量。

Comments Accepted by ACM Multimedia 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.15432 2025-12-08 cs.CV 85%

MedDiff-FM: A Diffusion-based Foundation Model for Versatile Medical Image Applications

MedDiff-FM: 一种基于扩散的多功能医学图像应用基础模型

Yongrui Yu, Yannian Gu, Shaoting Zhang, Xiaofan Zhang

机构 * Qing Yuan Research Institute, Shanghai Jiao Tong University(上海交通大学清元研究 institute)

专题命中 扩散模型 :diffusion(title,abstract);inpainting(abstract);image synthesis(abstract);分类 cs.CV

AI总结 MedDiff-FM是一种基于扩散的医学图像基础模型,通过预训练和微调实现多种医学图像处理任务,如去噪、异常检测和超分辨率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.03247 2025-12-04 cs.CV 85%

PixPerfect: Seamless Latent Diffusion Local Editing with Discriminative Pixel-Space Refinement

PixPerfect: 基于判别像素空间的无缝潜在扩散局部编辑

Haitian Zheng, Yuan Yao, Yongsheng Yu, Yuqian Zhou, Jiebo Luo, Zhe Lin

机构 * Adobe Research(Adobe研究院) University of Rochester(罗切斯特大学)

专题命中 扩散模型 :diffusion(title,abstract);image editing(abstract);inpainting(abstract);分类 cs.CV

AI总结 PixPerfect通过判别像素空间和伪影模拟流程,实现跨不同LDM架构和任务的无缝高保真局部编辑。

Comments Published in the Thirty-ninth Annual Conference on Neural Information Processing Systems (NeurIPS 2025)

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.11253 2025-12-02 cs.CV 85%

CountSteer: Steering Attention for Object Counting in Diffusion Models

CountSteer:在扩散模型中通过引导注意力实现物体计数

Hyemin Boo, Hyoryung Kim, Myungjin Lee, Seunghyeon Lee, Jiyoung Lee, Jang-Hwan Choi, Hyunsoo Cho

专题命中 扩散模型 :diffusion(title,abstract);image generation(abstract);text-to-image(abstract);分类 cs.CV

AI总结 CountSteer通过引导扩散模型的注意力机制,提升指定物体数量的生成精度,实现更可控的图像生成。

Comments Accepted to AAAI 2026 Workshop on Shaping Responsible Synthetic Data in the Era of Foundation Models (RSD)

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.13987 2025-12-01 cs.CV cs.AI 85%

Entropy Rectifying Guidance for Diffusion and Flow Models

熵校正引导用于扩散和流模型

Tariq Berrada Ifriqi, Adriana Romero-Soriano, Michal Drozdzal, Jakob Verbeek, Karteek Alahari

机构 * FAIR at Meta(Meta 的 FAIR 部门) Univ. Grenoble Alpes(格勒诺布尔阿尔卑斯大学) Inria(法国国家信息与自动化技术研究院) CNRS(法国国家科学研究中心) Grenoble INP(格勒诺布尔研究所) LJK, France(法国劳埃德-约瑟夫-克劳德实验室) McGill University(麦吉尔大学) Mila, Quebec AI institute(魁北克人工智能研究所) Canada CIFAR AI chair(加拿大 CIFAR 人工智能主席)

专题命中 扩散模型 :diffusion(title,abstract);image generation(abstract);text-to-image(abstract);分类 cs.CV

AI总结 ERG是一种基于注意力机制变化的简单有效引导方法,能同时提升图像质量、多样性及提示一致性,适用于扩散和流模型的多种生成任务。

Comments NeurIPS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.00234 2025-12-01 cs.LG cs.CV cs.NA math.NA physics.comp-ph stat.ML 85%

Fast Solvers for Discrete Diffusion Models: Theory and Applications of High-Order Algorithms

离散扩散模型的快速求解器:高阶算法的理论与应用

Yinuo Ren, Haoxuan Chen, Yuchen Zhu, Wei Guo, Yongxin Chen, Grant M. Rotskoff, Molei Tao, Lexing Ying

机构 * Stanford University(斯坦福大学) Georgia Institute of Technology(佐治亚理工学院)

专题命中 扩散模型 :diffusion(title,abstract);image generation(abstract);image synthesis(abstract);分类 cs.CV

AI总结 本文提出高阶算法用于离散扩散模型,提升推断效率和样本质量,适用于文本、图像等生成任务。

Comments Accepted at NeurIPS 2025 as a Poster (https://openreview.net/forum?id=OuklL6Q3sO)

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.18262 2025-11-25 cs.CV 85%

MammothModa2: A Unified AR-Diffusion Framework for Multimodal Understanding and Generation

MammothModa2: 一种用于多模态理解和生成的统一AR-扩散框架

Tao Shen, Xin Wan, Taicai Chen, Rui Zhang, Junwen Pan, Dawei Lu, Fanding Lei, Zhilin Lu, Yunfei Yang, Chen Cheng, Qi She, Chang Liu, Zhenbang Sun

机构 * ByteDance(字节跳动)

专题命中 扩散模型 :diffusion(title,abstract);text-to-image(abstract);image synthesis(abstract);分类 cs.CV

AI总结 MammothModa2通过统一的AR-扩散框架实现多模态理解和生成,结合自回归语义规划与扩散生成,取得文本到图像和指令编辑的优异表现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.16986 2025-11-25 cs.CV 85%

VCE: Safe Autoregressive Image Generation via Visual Contrast Exploitation

VCE:通过视觉对比利用实现安全的自回归图像生成

Feng Han, Chao Gong, Zhipeng Wei, Jingjing Chen, Yu-Gang Jiang

专题命中 扩散模型 :image generation(title,abstract);text-to-image(abstract);diffusion(abstract);分类 cs.CV

AI总结 VCE通过视觉对比利用方法,有效保护自回归图像生成模型,实现对不安全内容的精确擦除并保持安全内容的完整性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2403.20105 2025-11-19 cs.CV 85%

FreeSeg-Diff: Training-Free Open-Vocabulary Segmentation with Diffusion Models

Barbara Toniella Corradini, Mustafa Shukor, Paul Couairon, Guillaume Couairon, Franco Scarselli, Matthieu Cord

机构 * DIISM University of Siena(DIISM锡耶纳大学) CNRS, ISIR Sorbonne University(CNRS,ISIR索邦大学) Inria, ARCHES Sorbonne University(Inria,ARCHES索邦大学) Valeo.ai Sorbonne University(Valeo.ai索邦大学)

专题命中 扩散模型 :diffusion(title,abstract);image generation(abstract);text-to-image(abstract);分类 cs.CV

Journal ref Proceedings of the 2025 International Joint Conference on Neural Networks (IJCNN 2025)

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.08075 2025-11-12 cs.CV cs.AI 85%

CLIP is All You Need for Human-like Semantic Representations in Stable Diffusion

Cameron Braunstein, Mariya Toneva, Eddy Ilg

机构 * Saarland University, Saarbrücken Germany(萨尔兰州大学) MPI for Software Systems, Saarbrücken Germany(软件系统研究所) University of Technology Nuremberg, Nuremberg Germany(纽伦堡技术大学)

专题命中 扩散模型 :diffusion(title,abstract);image generation(abstract);text-to-image(abstract);分类 cs.CV

Comments 28 pages, 8 figures, 2 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.07362 2025-11-11 cs.CV cs.AI cs.LG 85%

Inference-Time Scaling of Diffusion Models for Infrared Data Generation

Kai A. Horstmann, Maxim Clouser, Kia Khezeli

机构 * Cornell University(康奈尔大学) YRIKKA, Inc.(YRIKKA公司)

专题命中 扩散模型 :diffusion(title,abstract);image generation(abstract);text-to-image(abstract);分类 cs.CV

Comments Peer-reviewed workshop paper

Journal ref 39th Conference on Neural Information Processing Systems (NeurIPS 2025) Workshop: Learning to Sense

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.10037 2025-11-11 cs.CV 85%

Role Bias in Diffusion Models: Diagnosing and Mitigating through Intermediate Decomposition

Sina Malakouti, Adriana Kovashka

机构 * University of Pittsburgh(匹兹堡大学)

专题命中 扩散模型 :diffusion(title,abstract);image generation(abstract);text-to-image(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.15270 2025-11-03 cs.LG cs.AI cs.CV 85%

Scaling Diffusion Transformers Efficiently via $μ$P

Chenyu Zheng, Xinyu Zhang, Rongzhen Wang, Wei Huang, Zhi Tian, Weilin Huang, Jun Zhu, Chongxuan Li

机构 * Gaoling School of AI, Renmin University of China(中国人民大学人工智能学院) Beijing Key Laboratory of Research on Large Models(北京大型模型研究关键实验室) Engineering Research Center of Next-Generation Intelligent Search(下一代智能搜索与推荐工程研究中心) Tsinghua University(清华大学)

专题命中 扩散模型 :diffusion(title,abstract);image generation(abstract);text-to-image(abstract);分类 cs.CV

Comments Accepted by NeurIPS 2025, 38 pages, 10 figures, 17 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.10173 2025-10-31 cs.CV cs.AI cs.LG 85%

SPARKE: Scalable Prompt-Aware Diversity and Novelty Guidance in Diffusion Models via RKE Score

Mohammad Jalali, Haoyu Lei, Amin Gohari, Farzan Farnia

机构 * Department of Computer Science and Engineering, The Chinese University of Hong Kong(计算机科学与工程系,香港中文大学) Department of Information Engineering, The Chinese University of Hong Kong(信息工程系,香港中文大学)

专题命中 扩散模型 :diffusion(title,abstract);text-to-image(abstract);image synthesis(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.15863 2025-10-31 cs.CV 85%

EmoAttack: Emotion-to-Image Diffusion Models for Emotional Backdoor Generation

Tianyu Wei, Shanmin Pang, Qi Guo, Yizhuo Ma, Xiaofeng Cao, Qing Guo

机构 * School of Software Engineering, Xi’an Jiaotong University(西安交通大学软件工程学院) Tongji University(同济大学) College of Computer Science, Nankai University(南开大学计算机科学学院)

专题命中 扩散模型 :diffusion(title,abstract);image generation(abstract);text-to-image(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏