arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

图像生成

图像生成、文生图、图像编辑、扩散模型和可控生成。

共收录 1266 信号源:cs.CV, cs.GR, cs.MM

1. 个性化与一致性 1266 篇

2604.08364 2026-04-21 cs.CV 79%

MegaStyle: Constructing Diverse and Scalable Style Dataset via Consistent Text-to-Image Style Mapping

MegaStyle: 通过一致的文本到图像风格映射构建多样化和可扩展的风格数据集

Junyao Gao, Sibo Liu, Jiaxing Li, Yanan Sun, Yuanpeng Tu, Fei Shen, Weidong Zhang, Cairong Zhao, Jun Zhang

机构 * Tencent(腾讯) Nanyang Technological University(南洋理工大学) Hong Kong University of Science and Technology(香港科技大学) Fuzhou University(福州大学) University of Hong Kong(香港大学) National University of Singapore(新加坡国立大学)

专题命中 个性化与一致性 :text-to-image(title,abstract);分类 cs.CV

AI总结 本文提出MegaStyle数据集,通过现有大生成模型的一致文本到图像风格映射能力,构建了包含170k风格提示和400k内容提示的多样化数据集,并提出风格监督对比学习方法和FLUX风格迁移模型。

Comments project website https://jeoyal.github.io/MegaStyle/

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.20640 2026-04-14 cs.CV 79%

CraftGraffiti: Exploring Human Identity with Custom Graffiti Art via Facial-Preserving Diffusion Models

CraftGraffiti:通过面部保留扩散模型探索人类身份的定制涂鸦艺术

Ayan Banerjee, Fernando Vilariño, Josep Lladós

机构 * Computer Vision Center, Universitat Autònoma de Barcelona(巴塞罗那自治大学计算机视觉中心)

专题命中 个性化与一致性 :diffusion(title,abstract);分类 cs.CV

AI总结 CraftGraffiti通过面部保留扩散模型生成具有身份一致性的涂鸦艺术,结合风格迁移与面部一致性机制,提升艺术创作的可识别性与审美价值。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.08037 2026-04-10 cs.CR cs.AI cs.CV cs.LG 79%

PrivFedTalk: Privacy-Aware Federated Diffusion with Identity-Stable Adapters for Personalized Talking-Head Generation

PrivFedTalk: 隐私感知的联邦扩散模型与身份稳定的适配器用于个性化说话头生成

Soumya Mazumdar, Vineet Kumar Rakesh, Tapas Samanta

机构 * Engineering Sciences, Homi Bhabha National Institute(霍米·巴巴国立研究所工程科学系)

专题命中 个性化与一致性 :diffusion(title,abstract);分类 cs.CV

AI总结 本文提出PrivFedTalk框架,结合条件潜在扩散模型与参数高效的身份适应,解决个性化说话头生成中的隐私问题,通过身份稳定联邦聚合和时间去噪一致性正则化提升性能。

Comments GitHub: https://github.com/mazumdarsoumya/PrivFedTalk

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.06989 2026-04-09 cs.CV cs.AI 79%

Generative Phomosaic with Structure-Aligned and Personalized Diffusion

生成式光拼图:结构对齐与个性化扩散

Jaeyoung Chung, Hyunjin Son, Kyoung Mu Lee

机构 * Seoul National University(首尔大学)

专题命中 个性化与一致性 :diffusion(title,abstract);分类 cs.CV

AI总结 本文提出首个生成式光拼图方法,通过扩散生成技术实现结构对齐和个性化拼图,克服传统方法在多样性和结构一致性上的限制。

Comments Project page: https://robot0321.github.io/GenerativePhotomosaic/index.html

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.19575 2026-03-31 cs.CV 79%

ConceptPrism: Concept Disentanglement in Personalized Diffusion Models via Residual Token Optimization

ConceptPrism:通过残差标记优化实现个性化扩散模型的概念解耦

Minseo Kim, Minchan Kwon, Dongyeun Lee, Yunho Jeon, Junmo Kim

机构 * KAIST(韩国科学技术院) Hanbat National University(韩巴大学)

专题命中 个性化与一致性 :diffusion(title);text-to-image(abstract);分类 cs.CV

AI总结 本文提出ConceptPrism框架,通过残差标记优化实现个性化扩散模型中的概念解耦,提升生成图像的质量与准确性。

Comments Accepted to CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.21884 2026-03-24 cs.CV cs.AI cs.LG 79%

Not All Layers Are Created Equal: Adaptive LoRA Ranks for Personalized Image Generation

并非所有层都同等重要:面向个性化图像生成的自适应LoRA秩

Donald Shenaj, Federico Errica, Antonio Carta

机构 * University of Pisa(比萨大学) NEC Laboratories Europe(NEC 欧洲实验室)

专题命中 个性化与一致性 :image generation(title);diffusion(abstract);分类 cs.CV

AI总结 本文提出LoRA$^2$方法,通过自适应调整各层秩来优化个性化图像生成,实现性能与内存消耗的平衡,优于传统固定秩方法。

Comments Project page: https://donaldssh.github.io/NotAllLayersAreCreatedEqual/

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.03110 2026-03-24 cs.LG cs.CV 79%

WarmFed: Federated Learning with Warm-Start for Globalization and Personalization Via Personalized Diffusion Models

WarmFed: 通过个性化扩散模型实现全球化与个性化联邦学习的Warm-Start

Tao Feng, Jie Zhang, Xiangjian Li, Rong Huang, Huashan Liu, Zhijie Wang

专题命中 个性化与一致性 :diffusion(title,abstract);分类 cs.CV

AI总结 本文提出WarmFed,通过预训练初始化实现全球化与个性化模型的协同优化,采用LoRA生成个性化扩散模型,并结合服务器端微调与动态自我蒸馏提升模型鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.14770 2026-03-17 cs.CV 79%

AnyPhoto: Multi-Person Identity Preserving Image Generation with ID Adaptive Modulation on Location Canvas

AnyPhoto: 多人身份保持图像生成与基于ID自适应调制的定位画布

Longhui Yuan

专题命中 个性化与一致性 :image generation(title);diffusion(abstract);分类 cs.CV

AI总结 AnyPhoto通过定位画布和身份自适应调制实现多人身份保持生成,提升可控性和多样性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.04784 2026-03-17 cs.CV 79%

PaCo-RL: Advancing Reinforcement Learning for Consistent Image Generation with Pairwise Reward Modeling

PaCo-RL:通过成对奖励建模推进强化学习用于一致图像生成

Bowen Ping, Chengyou Jia, Minnan Luo, Changliang Xia, Xin Shen, Zhuohang Dang, Hangwei Qian

专题命中 个性化与一致性 :image generation(title,abstract);分类 cs.CV

AI总结 本文提出PaCo-RL框架,结合专门的 consistency 奖励模型与高效强化学习算法,提升图像生成中的一致性与稳定性,实验表明其在视觉一致性上优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.08228 2026-03-10 cs.CV 79%

GarmentPainter: Efficient 3D Garment Texture Synthesis with Character-Guided Diffusion Model

GarmentPainter: 基于字符引导扩散模型的高效3D服装纹理合成

Jinbo Wu, Xiaobo Gao, Xing Liu, Chen Zhao, Jialun Liu

机构 * Baidu Inc.(百度公司) TeleAI

专题命中 个性化与一致性 :diffusion(title,abstract);分类 cs.CV

AI总结 GarmentPainter通过基于字符引导的扩散模型,实现了高效且高质量的3D服装纹理合成,提升了纹理生成的灵活性和一致性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.20721 2026-02-25 cs.CV 79%

CleanStyle: Plug-and-Play Style Conditioning Purification for Text-to-Image Stylization

CleanStyle: 用于文本到图像风格化任务的即插即用风格条件净化框架

Xiaoman Feng, Mingkun Lei, Yang Wang, Dingwen Fu, Chi Zhang

机构 * AGI Lab, Westlake University(西lake大学AGI实验室)

专题命中 个性化与一致性 :text-to-image(title);diffusion(abstract);分类 cs.CV

AI总结 CleanStyle通过动态抑制风格嵌入的尾部成分,提升文本到图像风格化任务中提示保真度和视觉质量。

Comments 26 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.19254 2026-02-24 cs.CV 79%

RegionRoute: Regional Style Transfer with Diffusion Model

RegionRoute: 区域风格迁移与扩散模型

Bowen Chen, Jake Zuena, Alan C. Bovik, Divya Kothandaraman

机构 * The University of Texas at Austin(德克萨斯大学奥斯汀分校) Dolby Laboratories, Inc.(杜比实验室)

专题命中 个性化与一致性 :diffusion(title,abstract);分类 cs.CV

AI总结 RegionRoute提出一种注意力监督的扩散框架,通过训练对齐风格标记的注意力分数与对象掩码,实现精确的区域风格迁移,提升风格应用的局部化能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.20911 2026-01-30 cs.CV cs.AI 79%

Non-Markov Multi-Round Conversational Image Generation with History-Conditioned MLLMs

非马尔可夫多轮对话图像生成与历史条件化大语言模型

Haochen Zhang, Animesh Sinha, Felix Juefei-Xu, Haoyu Ma, Kunpeng Li, Zhipeng Fan, Meng Dong, Xiaoliang Dai, Tingbo Hou, Peizhao Zhang, Zecheng He

专题命中 个性化与一致性 :image generation(title,abstract);分类 cs.CV

AI总结 本研究提出非马尔可夫多轮对话图像生成方法,通过历史条件化框架和数据构建策略提升多轮一致性与指令遵循性,同时保持单轮编辑能力。

Comments 19 pages, 19 figures, plan for TIP

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.02359 2026-01-06 cs.CV 79%

ExposeAnyone: Personalized Audio-to-Expression Diffusion Models Are Robust Zero-Shot Face Forgery Detectors

ExposeAnyone: 基于音频到表情扩散模型的个性化人脸伪造检测器

Kaede Shiohara, Toshihiko Yamasaki, Vladislav Golyanik

机构 * The University of Tokyo(东京大学) Max Planck Institute for Informatics, SIC(信息研究所马克斯·普朗克研究院)

专题命中 个性化与一致性 :diffusion(title,abstract);分类 cs.CV

AI总结 ExposeAnyone通过基于音频生成表情的自监督扩散模型,实现个性化人脸伪造检测,优于现有方法并具备鲁棒性。

Comments 17 pages, 8 figures, 11 tables; project page: https://mapooon.github.io/ExposeAnyonePage/

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.19271 2025-12-23 cs.CV 79%

3SGen: Unified Subject, Style, and Structure-Driven Image Generation with Adaptive Task-specific Memory

3SGen: 一种统一的主体、风格和结构驱动的图像生成方法,具有自适应任务特定记忆

Xinyang Song, Libin Wang, Weining Wang, Zhiwei Li, Jianxin Sun, Dandan Zheng, Jingdong Chen, Qi Li, Zhenan Sun

机构 * School of Artificial Intelligence, UCAS(人工智能学院,UCAS) CASIA AntGroup(蚂蚁集团)

专题命中 个性化与一致性 :image generation(title,abstract);分类 cs.CV

AI总结 3SGen通过统一的框架实现主体、风格和结构驱动的图像生成,采用自适应任务特定记忆模块提升生成质量和跨任务迁移性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.19026 2025-12-23 cs.CV cs.AI 79%

Finer-Personalization Rank: Fine-Grained Retrieval Examines Identity Preservation for Personalized Generation

细粒度个性化排名:细粒度检索检验身份保持在个性化生成中

Connor Kilrain, David Carlyn, Julia Chae, Sara Beery, Wei-Lun Chao, Jianyang Gu

机构 * The Ohio State University(俄亥俄州立大学) MIT(麻省理工学院)

专题命中 个性化与一致性 :personalized generation(title,abstract);分类 cs.CV

AI总结 本文提出Finer-Personalization Rank评估协议,用于细粒度检验个性化生成中的身份保持,揭示现有方法中的身份漂移问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.18964 2025-12-23 cs.CV 79%

DVI: Disentangling Semantic and Visual Identity for Training-Free Personalized Generation

DVI: 解构语义与视觉身份以实现无训练个性化生成

Guandong Li, Yijun Ding

机构 * iFLYTEK

专题命中 个性化与一致性 :personalized generation(title);diffusion(abstract);分类 cs.CV

AI总结 DVI通过解构语义与视觉身份,实现无训练个性化生成,提升视觉一致性和氛围保真度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.12963 2025-12-16 cs.CV 79%

SCAdapter: Content-Style Disentanglement for Diffusion Style Transfer

SCAdapter: 内容-风格解耦用于扩散风格迁移

Luan Thanh Trinh, Kenji Doi, Atsuki Osanai

机构 * LY Corporation(LY公司)

专题命中 个性化与一致性 :diffusion(title,abstract);分类 cs.CV

AI总结 SCAdapter通过CLIP图像空间实现内容与风格的解耦,提升扩散模型在逼真图像迁移中的效果和效率。

Comments Accepted to WACV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.07328 2025-12-09 cs.CV cs.AI 79%

ContextAnyone: Context-Aware Diffusion for Character-Consistent Text-to-Video Generation

ContextAnyone: 基于上下文的扩散模型用于一致的文本到视频生成

Ziyang Mai, Yu-Wing Tai

机构 * Dartmouth College(达特茅斯学院)

专题命中 个性化与一致性 :diffusion(title,abstract);分类 cs.CV

AI总结 ContextAnyone通过上下文感知扩散模型实现从文本和参考图像生成一致的角色视频,结合双引导损失和Gap-RoPE位置嵌入提升视觉质量和身份一致性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.07618 2025-12-09 cs.CV cs.AI 79%

Moyun: A Diffusion-Based Model for Style-Specific Chinese Calligraphy Generation

莫云:一种基于扩散模型的风格特定中文书法生成模型

Kaiyuan Liu, Jiahao Mei, Hengyu Zhang, Yihuai Zhang, Daoguo Dong, Liang He

机构 * School of Computer Science and Technology(计算机科学与技术学院) East China Normal University(华东师范大学)

专题命中 个性化与一致性 :diffusion(title,abstract);分类 cs.CV

AI总结 莫云模型通过引入Vision Mamba和TripleLabel机制,实现了基于书法家、字体和字符风格的可控书法生成。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.11989 2025-11-24 cs.CV 79%

BeyondFacial: Identity-Preserving Personalized Generation Beyond Facial Close-ups

超越面部:身份保持的个性化生成超越面部特写

Songsong Zhang, Chuanqi Tang, Hongguang Zhang, Guijian Tang, Minglong Li, Xueqiong Li, Shaowu Yang, Yuanxi Peng, Wenjing Yang, Jing Zhao

机构 * DIDS, NUDT, China(国防科技大学) TJU, China(天津大学) Unit 32010 of the Chinese PLA(中国解放军第三二零一零单位)

专题命中 个性化与一致性 :personalized generation(title,abstract);分类 cs.CV

AI总结 本文提出了一种突破面部特写限制的IPPG方法,通过双线推断和身份自适应融合策略,提升身份保真度和场景语义生成能力。

Comments 16 pages, 16 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.11754 2025-11-18 cs.CV 79%

Batch Transformer Architecture: Case of Synthetic Image Generation for Emotion Expression Facial Recognition

Stanislav Selitskiy

专题命中 个性化与一致性 :image generation(title,abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.10382 2025-11-14 cs.CV 79%

Fragile by Design: On the Limits of Adversarial Defenses in Personalized Generation

Zhen Chen, Yi Zhang, Xiangyu Yin, Chengxuan Qin, Xingyu Zhao, Xiaowei Huang, Wenjie Ruan

机构 * Department of Computer Science, University of Liverpool, Liverpool, L69 3BX, UK(利兹大学计算机科学系) WMG, University of Warwick, Coventry, CV4 7AL, UK(沃里克大学WMG)

专题命中 个性化与一致性 :personalized generation(title,abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.05575 2025-11-11 cs.CV 79%

DiffSwap++: 3D Latent-Controlled Diffusion for Identity-Preserving Face Swapping

Weston Bondurant, Arkaprava Sinha, Hieu Le, Srijan Das, Stephanie Schuckers

机构 * UNC Charlotte(北卡罗来纳大学夏洛特分校)

专题命中 个性化与一致性 :diffusion(title,abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.16349 2025-10-24 cs.LG cs.AI cs.CR cs.CV 79%

Watermarking Autoregressive Image Generation

Nikola Jovanović, Ismail Labiad, Tomáš Souček, Martin Vechev, Pierre Fernandez

机构 * Meta FAIR ETH Zurich

专题命中 个性化与一致性 :image generation(title,abstract);分类 cs.CV

Comments NeurIPS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.12119 2025-10-15 cs.CV 79%

ImageSentinel: Protecting Visual Datasets from Unauthorized Retrieval-Augmented Image Generation

Ziyuan Luo, Yangyi Zhao, Ka Chun Cheung, Simon See, Renjie Wan

机构 * Department of Computer Science, Hong Kong Baptist University(香港 Baptist 大学计算机科学系) NVIDIA AI Technology Center, NVIDIA(NVIDIA 人工智能技术中心)

专题命中 个性化与一致性 :image generation(title,abstract);分类 cs.CV

Comments Accepted at NeurIPS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.10782 2025-10-14 cs.CV cs.AI 79%

DISC-GAN: Disentangling Style and Content for Cluster-Specific Synthetic Underwater Image Generation

Sneha Varur, Anirudh R Hanchinamani, Tarun S Bagewadi, Uma Mudenagudi, Chaitra D Desai, Sujata C, Padmashree Desai, Sumit Meharwade

机构 * KLE Technological University(KLE技术大学)

专题命中 个性化与一致性 :image generation(title);image synthesis(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.06469 2025-10-09 cs.CV 79%

SIGMA-GEN: Structure and Identity Guided Multi-subject Assembly for Image Generation

Oindrila Saha, Vojtech Krs, Radomir Mech, Subhransu Maji, Kevin Blackburn-Matzen, Matheus Gadelha

机构 * University of Massachusetts Amherst(马萨诸塞大学阿默斯特分校) Adobe Research(Adobe研究院)

专题命中 个性化与一致性 :image generation(title,abstract);分类 cs.CV

Comments Webpage: https://oindrilasaha.github.io/SIGMA-Gen/

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.04421 2025-09-30 cs.CV cs.AI cs.LG 79%

Disentangling Regional Primitives for Image Generation

Zhengting Chen, Lei Cheng, Lianghui Ding, Liang Lin, Quanshi Zhang

机构 * Shanghai Jiao Tong University(上海交通大学)

专题命中 个性化与一致性 :image generation(title,abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2312.03993 2025-09-05 cs.CV cs.AI 79%

Style Transfer to Calvin and Hobbes comics using Stable Diffusion

Asvin Kumar Venkataramanan, Sloke Shrestha, Sundar Sripada Venugopalaswamy Sriraman

机构 * Department of Electrical Computer Engineering, The University of Texas at Austin

专题命中 个性化与一致性 :diffusion(title,abstract);分类 cs.CV

Comments Updated authorship

详情

展开后加载摘要…

URL PDF HTML 收藏