arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

图像生成

图像生成、文生图、图像编辑、扩散模型和可控生成。

共收录 1266 信号源:cs.CV, cs.GR, cs.MM

1. 个性化与一致性 1266 篇

2402.16843 2024-11-20 cs.CV cs.AI cs.CL cs.GR cs.LG 84%

Multi-LoRA Composition for Image Generation

Ming Zhong, Yelong Shen, Shuohang Wang, Yadong Lu, Yizhu Jiao, Siru Ouyang, Donghan Yu, Jiawei Han, Weizhu Chen

专题命中 个性化与一致性 :image generation(title);text-to-image(abstract);image synthesis(abstract);分类 cs.CV、cs.GR

Comments Transactions on Machine Learning Research (TMLR), 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2404.11565 2024-05-07 cs.CV cs.AI cs.GR 84%

MoA: Mixture-of-Attention for Subject-Context Disentanglement in Personalized Image Generation

Kuan-Chieh Wang, Daniil Ostashev, Yuwei Fang, Sergey Tulyakov, Kfir Aberman

专题命中 个性化与一致性 :image generation(title);text-to-image(abstract);diffusion(abstract);分类 cs.CV、cs.GR

Comments Project Website: https://snap-research.github.io/mixture-of-attention, Same as previous version, only updated metadata because bib was missing an author name

详情

展开后加载摘要…

URL PDF HTML 收藏
2312.02133 2024-01-12 cs.CV cs.GR cs.LG 84%

Style Aligned Image Generation via Shared Attention

Amir Hertz, Andrey Voynov, Shlomi Fruchter, Daniel Cohen-Or

专题命中 个性化与一致性 :image generation(title);text-to-image(abstract);diffusion(abstract);分类 cs.CV、cs.GR

Comments Project page at style-aligned-gen.github.io

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.20807 2026-07-20 cs.CV 版本更新 83%

Decomposing Subject-Driven Image Generation via Intermediate Structural Prediction

通过中间结构预测分解主体驱动的图像生成

Hanzhong Guo, Yizhou Yu

机构 * School of Computing and Data Science, The University of Hong Kong(计算与数据科学学院,香港大学)

专题命中 个性化与一致性 :image generation(title,abstract);text-to-image(abstract);分类 cs.CV

AI总结 该研究提出了一种两阶段框架,通过先预测Canny图再基于源外观和预测结构生成最终图像,以解决主体驱动文本到图像生成中高频率身份细节如logo、图案和文本的保留问题,并通过自动管道构建了10万对文本感知数据集,实验结果表明中间结构预测能有效提升高保真主体驱动生成的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.17195 2026-07-07 cs.CV 版本更新 83%

DreamShot: Personalized Storyboard Synthesis with Video Diffusion Prior

DreamShot: 基于视频扩散先验的个性化分镜合成

Junjia Huang, Binbin Yang, Pengxiang Yan, Jiyang Liu, Bin Xia, Zhao Wang, Yitong Wang, Liang Lin, Guanbin Li

机构 * Sun Yat-sen University(中山大学) Peng Cheng Laboratory(鹏城实验室) ByteDance Intelligent Creation(字节跳动智能创作) Guangdong Key Laboratory of Big Data Analysis and Processing(广东省大数据分析与处理重点实验室)

专题命中 个性化与一致性 :diffusion(title,abstract);text-to-image(abstract);分类 cs.CV

AI总结 DreamShot通过视频扩散先验实现可控的多镜头合成,支持文本到镜头和参考到镜头生成,提升叙事连贯性和角色一致性。

Comments Accepted by CVPR2026 as a Highlight paper

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.25457 2026-04-29 cs.CV 83%

GramSR: Visual Feature Conditioning for Diffusion-Based Super-Resolution

GramSR: 基于视觉特征条件的扩散式超分辨率

Fabio D'Oronzio, Federico Putamorsi, Leonardo Zini, Marcella Cornia, Lorenzo Baraldi

机构 * University of Modena and Reggio Emilia(摩德纳和雷吉奥艾米利亚大学)

专题命中 个性化与一致性 :diffusion(title,abstract);分类 cs.CV

AI总结 GramSR通过利用低分辨率输入提取的密集视觉特征替代文本条件,提出了一种基于扩散的超分辨率框架,采用三阶段LoRA架构提升结构保真度和纹理真实感。

Comments Accepted at the 28th International Conference on Pattern Recognition

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.21977 2026-04-27 cs.CV 83%

When LoRA Betrays: Backdooring Text-to-Image Models by Masquerading as Benign Adapters

当LoRA背叛时:通过伪装成无害适配器对文本到图像模型进行后门攻击

Liangwei Lyu, Jiaqi Xu, Jianwei Ding, Qiyao Deng

机构 * People’s Public Security University of China(中国人民公安大学)

专题命中 个性化与一致性 :text-to-image(title,abstract);diffusion(abstract);分类 cs.CV

AI总结 研究提出MasqLoRA攻击框架,通过独立LoRA模块在文本到图像扩散模型中隐蔽注入恶意行为,实验显示其攻击成功率高达99.8%。

Comments Accepted to CVPR 2026 main track(poster)

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.01236 2026-04-10 cs.CV 83%

PSR: Scaling Multi-Subject Personalized Image Generation with Pairwise Subject-Consistency Rewards

PSR: 通过成对主体一致性奖励实现多主体个性化图像生成的扩展

Shulei Wang, Longhui Wei, Xin He, Jianbo Ouyang, Hui Lu, Zhou Zhao, Qi Tian

机构 * Zhejiang University(浙江大学) Huawei Inc.(华为技术有限公司)

专题命中 个性化与一致性 :image generation(title,abstract);personalized generation(abstract);分类 cs.CV

AI总结 本文提出PSR框架,通过多主体数据生成管道和强化学习策略,提升多主体个性化图像生成的性能和一致性。

Comments Accepted by CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.03220 2026-03-30 cs.CV 83%

PokeFusion Attention: A Lightweight Cross-Attention Mechanism for Style-Conditioned Image Generation

PokeFusion Attention:一种轻量级的跨注意力机制用于风格条件图像生成

Jingbang Tang

机构 * Independent Researcher, Vancouver, Canada(独立研究员,加拿大温哥华) School of Computing, Universiti Kebangsaan Malaysia (UKM), Malaysia(马来西亚国立大学计算机学院)

专题命中 个性化与一致性 :image generation(title);text-to-image(abstract);diffusion(abstract);分类 cs.CV

AI总结 本文提出PokeFusion Attention,一种轻量级跨注意力机制,用于风格条件图像生成,通过学习风格分布先验而非实例级条件,提升生成效果与一致性。

Comments 12 pages, 5 figures. Revised version with improved method description and corrected references

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.24043 2026-03-26 cs.CV 83%

HAM: A Training-Free Style Transfer Approach via Heterogeneous Attention Modulation for Diffusion Models

HAM: 一种通过异构注意力调节的无训练风格迁移方法用于扩散模型

Yeqi He, Liang Li, Zhiwen Yang, Xichun Sheng, Zhidong Zhao, Chenggang Yan

机构 * Hangzhou Dianzi University(杭州电子科技大学) Institute of Computing Technology, Chinese Academy of Sciences(中国科学院计算技术研究所) Macao Polytechnic University(澳门 polytechnic 大学)

专题命中 个性化与一致性 :diffusion(title,abstract);image generation(abstract);分类 cs.CV

AI总结 本文提出一种无训练的风格迁移方法HAM,通过异构注意力调节保护内容图像的身份信息,解决风格与内容的平衡问题。

Comments Accepted in CVPR 2026 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.13695 2026-03-17 cs.HC cs.CV 83%

Steering Generative Models for Accessibility: EasyRead Image Generation

引导生成模型以提升可及性:EasyRead图像生成

Nicolas Dickenmann, Yanis Merzouki, Sonia Laguna, Thy Nowak-Tran, Emanuele Palumbo, Julia E. Vogt, Gerda Binder

专题命中 个性化与一致性 :image generation(title,abstract);diffusion(abstract);分类 cs.CV

AI总结 本文通过微调Stable Diffusion模型生成EasyRead图像,提出EasyRead评分标准,展示扩散模型可生成一致的简单图像,提升无障碍内容的可及性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.04565 2026-03-06 cs.CV 83%

Structure-Guided Histopathology Synthesis via Dual-LoRA Diffusion

基于结构引导的组织病理学合成 via 双LoRA扩散

Xuan Xu, Prateek Prasanna

机构 * Stony Brook University(石溪大学)

专题命中 个性化与一致性 :diffusion(title,abstract);image synthesis(abstract);分类 cs.CV

AI总结 本文提出Dual-LoRA可控扩散框架,通过多类核质心和LoRA适配器实现局部结构修复与全局结构合成,提升组织病理学图像的真实感和一致性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.19497 2026-02-24 cs.CV 83%

MICON-Bench: Benchmarking and Enhancing Multi-Image Context Image Generation in Unified Multimodal Models

MICON-Bench: 多图像上下文图像生成的基准测试与增强

Mingrui Wu, Hang Liu, Jiayi Ji, Xiaoshuai Sun, Rongrong Ji

机构 * Key Laboratory of Multimedia Trusted Perception and Efficient Computing, Ministry of Education of China, Xiamen University(多媒体可信感知与高效计算重点实验室,中国教育部,厦门大学) Zhongguancun Academy, Beijing, China(中关村学院,北京,中国)

专题命中 个性化与一致性 :image generation(title);text-to-image(abstract);image editing(abstract);分类 cs.CV

AI总结 MICON-Bench通过六个任务评估多图像上下文生成能力,并提出DAR机制提升生成质量与连贯性。

Comments CVPR2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.13637 2026-02-17 cs.CV 83%

DCDM: Divide-and-Conquer Diffusion Models for Consistency-Preserving Video Generation

DCDM:分而治之扩散模型用于保持一致性视频生成

Haoyu Zhao, Yuang Zhang, Junqi Cheng, Jiaxi Gu, Zenghui Lu, Peng Shu, Zuxuan Wu, Yu-Gang Jiang

机构 * Fudan University(复旦大学) Tencent(腾讯)

专题命中 个性化与一致性 :diffusion(title,abstract);text-to-image(abstract);分类 cs.CV

AI总结 DCDM通过分而治之的扩散模型,解决视频生成中的语义、几何和身份一致性问题,提升视频生成的连贯性和可控性。

Comments 7 pages, 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.02388 2026-02-05 cs.CV cs.LG 83%

Personalized Image Generation via Human-in-the-loop Bayesian Optimization

通过人机协作的贝叶斯优化实现个性化图像生成

Rajalaxmi Rajagopalan, Debottam Dutta, Yu-Lin Wei, Romit Roy Choudhury

机构 * University of Illinois, Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校)

专题命中 个性化与一致性 :image generation(title,abstract);diffusion(abstract);分类 cs.CV

AI总结 本文提出MultiBO方法,通过人类偏好反馈缩小生成图像与目标图像的差距,实现个性化图像生成。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.00639 2026-02-03 cs.CV 83%

Diff-PC: Identity-preserving and 3D-aware Controllable Diffusion for Zero-shot Portrait Customization

Diff-PC: 保持身份和3D感知的可控扩散用于零样本肖像定制

Yifang Xu, Benxiang Zhai, Chenyu Zhang, Ming Li, Yang Li, Sidan Du

机构 * School of Electronic Science and Engineering, Nanjing University(南京大学电子科学与工程学院) School of Business, Hohai University(河海大学商学院) School of Artificial Intelligence, Nanjing University of Information Science and Technology(南京信息工程大学人工智能学院)

专题命中 个性化与一致性 :diffusion(title,abstract);text-to-image(abstract);分类 cs.CV

AI总结 Diff-PC通过3D感知和可控扩散方法实现零样本肖像定制,提升身份保持和面部可控性。

Comments Accepted by Information Fusion 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.00267 2026-02-03 cs.CV cs.AI 83%

PLACID: Identity-Preserving Multi-Object Compositing via Video Diffusion with Synthetic Trajectories

PLACID:通过视频扩散与合成轨迹实现身份保持的多物体合成

Gemma Canet Tarrés, Manel Baradad, Francesc Moreno-Noguer, Yumeng Li

机构 * Amazon Barcelona(亚马逊巴塞罗那)

专题命中 个性化与一致性 :diffusion(title,abstract);image synthesis(abstract);分类 cs.CV

AI总结 PLACID通过视频扩散与合成轨迹实现多物体合成,保持物体身份和背景细节,提升合成效果与视觉吸引力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.20820 2025-11-26 cs.CV 83%

LayerComposer: Multi-Human Personalized Generation via Layered Canvas

LayerComposer: 通过分层画布实现多人类个性化生成

Guocheng Gordon Qian, Ruihang Zhang, Tsai-Shien Chen, Yusuf Dalva, Anujraaj Argo Goyal, Willi Menapace, Ivan Skorokhodov, Meng Dong, Arpit Sahni, Daniil Ostashev, Ju Hu, Sergey Tulyakov, Kuan-Chieh Jackson Wang

机构 * Snap Inc. University of Toronto(多伦多大学) UC Merced(加州大学默塞德分校) Virginia Tech(弗吉尼亚理工大学)

专题命中 个性化与一致性 :personalized generation(title,abstract);image generation(abstract);分类 cs.CV

AI总结 LayerComposer通过分层画布实现多人类个性化生成,提供直观的人类注入和高效 scalable 的生成框架。

Comments 17 pages including appendix, preprint. Project page: https://snap-research.github.io/layercomposer/

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.08061 2025-11-12 cs.CV cs.AI 83%

Taming Identity Consistency and Prompt Diversity in Diffusion Models via Latent Concatenation and Masked Conditional Flow Matching

Aditi Singhania, Arushi Jain, Krutik Malani, Riddhi Dhawan, Souymodip Chakraborty, Vineet Batra, Ankit Phogat

专题命中 个性化与一致性 :diffusion(title,abstract);image generation(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.03156 2025-11-06 cs.CV 83%

Finetuning-Free Personalization of Text to Image Generation via Hypernetworks

Sagar Shrestha, Gopal Sharma, Luowei Zhou, Suren Kumar

机构 * Samsung AI Center Mountain View(三星AI中心山景)

专题命中 个性化与一致性 :image generation(title);text-to-image(abstract);diffusion(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.18766 2025-10-31 cs.CV cs.AI 83%

StyleGuard: Preventing Text-to-Image-Model-based Style Mimicry Attacks by Style Perturbations

Yanjie Li, Wenxuan Zhang, Xinqi Lyu, Yihao Liu, Bin Xiao

机构 * Department of Computing, Hong Kong Polytechnic University(计算机学系,香港理工大学)

专题命中 个性化与一致性 :text-to-image(title,abstract);diffusion(abstract);分类 cs.CV

Comments Accepted by NIPS2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.25084 2025-10-30 cs.CV 83%

PSTF-AttControl: Per-Subject-Tuning-Free Personalized Image Generation with Controllable Face Attributes

Xiang liu, Zhaoxiang Liu, Huan Hu, Zipeng Wang, Ping Chen, Zezhou Chen, Kai Wang, Shiguo Lian

机构 * organization= Data Science \& Artificial Intelligence Research Institute , addressline= China Unicom , city= Beijing , postcode= 100013 , country= P.R.China

专题命中 个性化与一致性 :image generation(title,abstract);image synthesis(abstract);分类 cs.CV

Comments Accepted by Image and Vision Computing (18 pages, 8 figures)

Journal ref Image and Vision Computing, 105790 (2025)

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.01347 2025-10-03 cs.CV 83%

Image Generation Based on Image Style Extraction

Shuochen Chang

专题命中 个性化与一致性 :image generation(title,abstract);text-to-image(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.21433 2025-09-29 cs.CV cs.AI cs.LG 83%

DyME: Dynamic Multi-Concept Erasure in Diffusion Models with Bi-Level Orthogonal LoRA Adaptation

Jiaqi Liu, Lan Zhang, Xiaoyong Yuan

机构 * Clemson University(克莱姆森大学)

专题命中 个性化与一致性 :diffusion(title,abstract);text-to-image(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.03039 2025-09-29 cs.CV cs.AI cs.LG 83%

Leveraging Model Guidance to Extract Training Data from Personalized Diffusion Models

Xiaoyu Wu, Jiaru Zhang, Zhiwei Steven Wu

机构 * Carnegie Mellon University(卡内基梅隆大学) Purdue University(普渡大学)

专题命中 个性化与一致性 :diffusion(title,abstract);image generation(abstract);分类 cs.CV

Comments Accepted at the International Conference on Machine Learning (ICML) 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.16863 2025-08-26 cs.CV 83%

Delta-SVD: Efficient Compression for Personalized Text-to-Image Models

Tangyuan Zhang, Shangyu Chen, Qixiang Chen, Jianfei Cai

机构 * Monash University(墨尔本大学)

专题命中 个性化与一致性 :text-to-image(title,abstract);diffusion(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.21291 2025-07-29 cs.CV 83%

MIGE: Mutually Enhanced Multimodal Instruction-Based Image Generation and Editing

Xueyun Tian, Wei Li, Bingbing Xu, Yige Yuan, Yuanzhuo Wang, Huawei Shen

机构 * State Key Laboratory of AI Safety, Institute of Computing Technology, Chinese Academy of Sciences(人工智能安全国家重点实验室,计算技术研究所,中国科学院) University of Chinese Academy of Sciences(中国科学院大学)

专题命中 个性化与一致性 :image generation(title,abstract);diffusion(abstract);分类 cs.CV

Comments This paper have been accepted by ACM MM25

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.04963 2025-07-28 cs.CV 83%

ViCTr: Vital Consistency Transfer for Pathology Aware Image Synthesis

Onkar Susladkar, Gayatri Deshmukh, Yalcin Tur, Gorkhem Durak, Ulas Bagci

机构 * Northwestern University(西北大学) Stanford University(斯坦福大学)

专题命中 个性化与一致性 :image synthesis(title,abstract);diffusion(abstract);分类 cs.CV

Comments Accepted in ICCV 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.10217 2025-07-22 cs.CV 83%

From Wardrobe to Canvas: Wardrobe Polyptych LoRA for Part-level Controllable Human Image Generation

Jeongho Kim, Sunghyun Park, Hyoungwoo Park, Sungrack Yun, Jaegul Choo, Seokeon Choi

机构 * Qualcomm AI Research(高通人工智能研究)

专题命中 个性化与一致性 :image generation(title,abstract);diffusion(abstract);分类 cs.CV

Comments 10 pages, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.03313 2025-07-08 cs.CV cs.AI 83%

Personalized Image Generation from an Author Writing Style

Sagar Gandhi, Vishal Gandhi

机构 * Joyspace AI

专题命中 个性化与一致性 :image generation(title);text-to-image(abstract);diffusion(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏