Multi-LoRA Composition for Image Generation
专题命中 个性化与一致性 :image generation(title);text-to-image(abstract);image synthesis(abstract);分类 cs.CV、cs.GR
Comments Transactions on Machine Learning Research (TMLR), 2024
视觉与机器人
图像生成、文生图、图像编辑、扩散模型和可控生成。
专题命中 个性化与一致性 :image generation(title);text-to-image(abstract);image synthesis(abstract);分类 cs.CV、cs.GR
Comments Transactions on Machine Learning Research (TMLR), 2024
专题命中 个性化与一致性 :image generation(title);text-to-image(abstract);diffusion(abstract);分类 cs.CV、cs.GR
Comments Project Website: https://snap-research.github.io/mixture-of-attention, Same as previous version, only updated metadata because bib was missing an author name
专题命中 个性化与一致性 :image generation(title);text-to-image(abstract);diffusion(abstract);分类 cs.CV、cs.GR
Comments Project page at style-aligned-gen.github.io
通过中间结构预测分解主体驱动的图像生成
机构 * School of Computing and Data Science, The University of Hong Kong(计算与数据科学学院,香港大学)
专题命中 个性化与一致性 :image generation(title,abstract);text-to-image(abstract);分类 cs.CV
AI总结 该研究提出了一种两阶段框架,通过先预测Canny图再基于源外观和预测结构生成最终图像,以解决主体驱动文本到图像生成中高频率身份细节如logo、图案和文本的保留问题,并通过自动管道构建了10万对文本感知数据集,实验结果表明中间结构预测能有效提升高保真主体驱动生成的性能。
DreamShot: 基于视频扩散先验的个性化分镜合成
机构 * Sun Yat-sen University(中山大学) ; Peng Cheng Laboratory(鹏城实验室) ; ByteDance Intelligent Creation(字节跳动智能创作) ; Guangdong Key Laboratory of Big Data Analysis and Processing(广东省大数据分析与处理重点实验室)
专题命中 个性化与一致性 :diffusion(title,abstract);text-to-image(abstract);分类 cs.CV
AI总结 DreamShot通过视频扩散先验实现可控的多镜头合成,支持文本到镜头和参考到镜头生成,提升叙事连贯性和角色一致性。
Comments Accepted by CVPR2026 as a Highlight paper
GramSR: 基于视觉特征条件的扩散式超分辨率
机构 * University of Modena and Reggio Emilia(摩德纳和雷吉奥艾米利亚大学)
专题命中 个性化与一致性 :diffusion(title,abstract);分类 cs.CV
AI总结 GramSR通过利用低分辨率输入提取的密集视觉特征替代文本条件,提出了一种基于扩散的超分辨率框架,采用三阶段LoRA架构提升结构保真度和纹理真实感。
Comments Accepted at the 28th International Conference on Pattern Recognition
当LoRA背叛时:通过伪装成无害适配器对文本到图像模型进行后门攻击
机构 * People’s Public Security University of China(中国人民公安大学)
专题命中 个性化与一致性 :text-to-image(title,abstract);diffusion(abstract);分类 cs.CV
AI总结 研究提出MasqLoRA攻击框架,通过独立LoRA模块在文本到图像扩散模型中隐蔽注入恶意行为,实验显示其攻击成功率高达99.8%。
Comments Accepted to CVPR 2026 main track(poster)
PSR: 通过成对主体一致性奖励实现多主体个性化图像生成的扩展
机构 * Zhejiang University(浙江大学) ; Huawei Inc.(华为技术有限公司)
专题命中 个性化与一致性 :image generation(title,abstract);personalized generation(abstract);分类 cs.CV
AI总结 本文提出PSR框架,通过多主体数据生成管道和强化学习策略,提升多主体个性化图像生成的性能和一致性。
Comments Accepted by CVPR 2026
PokeFusion Attention:一种轻量级的跨注意力机制用于风格条件图像生成
机构 * Independent Researcher, Vancouver, Canada(独立研究员,加拿大温哥华) ; School of Computing, Universiti Kebangsaan Malaysia (UKM), Malaysia(马来西亚国立大学计算机学院)
专题命中 个性化与一致性 :image generation(title);text-to-image(abstract);diffusion(abstract);分类 cs.CV
AI总结 本文提出PokeFusion Attention,一种轻量级跨注意力机制,用于风格条件图像生成,通过学习风格分布先验而非实例级条件,提升生成效果与一致性。
Comments 12 pages, 5 figures. Revised version with improved method description and corrected references
HAM: 一种通过异构注意力调节的无训练风格迁移方法用于扩散模型
机构 * Hangzhou Dianzi University(杭州电子科技大学) ; Institute of Computing Technology, Chinese Academy of Sciences(中国科学院计算技术研究所) ; Macao Polytechnic University(澳门 polytechnic 大学)
专题命中 个性化与一致性 :diffusion(title,abstract);image generation(abstract);分类 cs.CV
AI总结 本文提出一种无训练的风格迁移方法HAM,通过异构注意力调节保护内容图像的身份信息,解决风格与内容的平衡问题。
Comments Accepted in CVPR 2026 Findings
引导生成模型以提升可及性:EasyRead图像生成
专题命中 个性化与一致性 :image generation(title,abstract);diffusion(abstract);分类 cs.CV
AI总结 本文通过微调Stable Diffusion模型生成EasyRead图像,提出EasyRead评分标准,展示扩散模型可生成一致的简单图像,提升无障碍内容的可及性。
基于结构引导的组织病理学合成 via 双LoRA扩散
机构 * Stony Brook University(石溪大学)
专题命中 个性化与一致性 :diffusion(title,abstract);image synthesis(abstract);分类 cs.CV
AI总结 本文提出Dual-LoRA可控扩散框架,通过多类核质心和LoRA适配器实现局部结构修复与全局结构合成,提升组织病理学图像的真实感和一致性。
MICON-Bench: 多图像上下文图像生成的基准测试与增强
机构 * Key Laboratory of Multimedia Trusted Perception and Efficient Computing, Ministry of Education of China, Xiamen University(多媒体可信感知与高效计算重点实验室,中国教育部,厦门大学) ; Zhongguancun Academy, Beijing, China(中关村学院,北京,中国)
专题命中 个性化与一致性 :image generation(title);text-to-image(abstract);image editing(abstract);分类 cs.CV
AI总结 MICON-Bench通过六个任务评估多图像上下文生成能力,并提出DAR机制提升生成质量与连贯性。
Comments CVPR2026
DCDM:分而治之扩散模型用于保持一致性视频生成
机构 * Fudan University(复旦大学) ; Tencent(腾讯)
专题命中 个性化与一致性 :diffusion(title,abstract);text-to-image(abstract);分类 cs.CV
AI总结 DCDM通过分而治之的扩散模型,解决视频生成中的语义、几何和身份一致性问题,提升视频生成的连贯性和可控性。
Comments 7 pages, 2 figures
通过人机协作的贝叶斯优化实现个性化图像生成
机构 * University of Illinois, Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校)
专题命中 个性化与一致性 :image generation(title,abstract);diffusion(abstract);分类 cs.CV
AI总结 本文提出MultiBO方法,通过人类偏好反馈缩小生成图像与目标图像的差距,实现个性化图像生成。
Diff-PC: 保持身份和3D感知的可控扩散用于零样本肖像定制
机构 * School of Electronic Science and Engineering, Nanjing University(南京大学电子科学与工程学院) ; School of Business, Hohai University(河海大学商学院) ; School of Artificial Intelligence, Nanjing University of Information Science and Technology(南京信息工程大学人工智能学院)
专题命中 个性化与一致性 :diffusion(title,abstract);text-to-image(abstract);分类 cs.CV
AI总结 Diff-PC通过3D感知和可控扩散方法实现零样本肖像定制,提升身份保持和面部可控性。
Comments Accepted by Information Fusion 2025
PLACID:通过视频扩散与合成轨迹实现身份保持的多物体合成
机构 * Amazon Barcelona(亚马逊巴塞罗那)
专题命中 个性化与一致性 :diffusion(title,abstract);image synthesis(abstract);分类 cs.CV
AI总结 PLACID通过视频扩散与合成轨迹实现多物体合成,保持物体身份和背景细节,提升合成效果与视觉吸引力。
LayerComposer: 通过分层画布实现多人类个性化生成
机构 * Snap Inc. ; University of Toronto(多伦多大学) ; UC Merced(加州大学默塞德分校) ; Virginia Tech(弗吉尼亚理工大学)
专题命中 个性化与一致性 :personalized generation(title,abstract);image generation(abstract);分类 cs.CV
AI总结 LayerComposer通过分层画布实现多人类个性化生成,提供直观的人类注入和高效 scalable 的生成框架。
Comments 17 pages including appendix, preprint. Project page: https://snap-research.github.io/layercomposer/
专题命中 个性化与一致性 :diffusion(title,abstract);image generation(abstract);分类 cs.CV
机构 * Samsung AI Center Mountain View(三星AI中心山景)
专题命中 个性化与一致性 :image generation(title);text-to-image(abstract);diffusion(abstract);分类 cs.CV
机构 * Department of Computing, Hong Kong Polytechnic University(计算机学系,香港理工大学)
专题命中 个性化与一致性 :text-to-image(title,abstract);diffusion(abstract);分类 cs.CV
Comments Accepted by NIPS2025
机构 * organization= Data Science \& Artificial Intelligence Research Institute , addressline= China Unicom , city= Beijing , postcode= 100013 , country= P.R.China
专题命中 个性化与一致性 :image generation(title,abstract);image synthesis(abstract);分类 cs.CV
Comments Accepted by Image and Vision Computing (18 pages, 8 figures)
Journal ref Image and Vision Computing, 105790 (2025)
专题命中 个性化与一致性 :image generation(title,abstract);text-to-image(abstract);分类 cs.CV
机构 * Clemson University(克莱姆森大学)
专题命中 个性化与一致性 :diffusion(title,abstract);text-to-image(abstract);分类 cs.CV
机构 * Carnegie Mellon University(卡内基梅隆大学) ; Purdue University(普渡大学)
专题命中 个性化与一致性 :diffusion(title,abstract);image generation(abstract);分类 cs.CV
Comments Accepted at the International Conference on Machine Learning (ICML) 2025
机构 * Monash University(墨尔本大学)
专题命中 个性化与一致性 :text-to-image(title,abstract);diffusion(abstract);分类 cs.CV
机构 * State Key Laboratory of AI Safety, Institute of Computing Technology, Chinese Academy of Sciences(人工智能安全国家重点实验室,计算技术研究所,中国科学院) ; University of Chinese Academy of Sciences(中国科学院大学)
专题命中 个性化与一致性 :image generation(title,abstract);diffusion(abstract);分类 cs.CV
Comments This paper have been accepted by ACM MM25
机构 * Northwestern University(西北大学) ; Stanford University(斯坦福大学)
专题命中 个性化与一致性 :image synthesis(title,abstract);diffusion(abstract);分类 cs.CV
Comments Accepted in ICCV 2025
机构 * Qualcomm AI Research(高通人工智能研究)
专题命中 个性化与一致性 :image generation(title,abstract);diffusion(abstract);分类 cs.CV
Comments 10 pages, 8 figures
机构 * Joyspace AI
专题命中 个性化与一致性 :image generation(title);text-to-image(abstract);diffusion(abstract);分类 cs.CV