Identity Encoder for Personalized Diffusion
专题命中 个性化与一致性 :diffusion(title,abstract);image generation(abstract);分类 cs.CV
视觉与机器人
图像生成、文生图、图像编辑、扩散模型和可控生成。
专题命中 个性化与一致性 :diffusion(title,abstract);image generation(abstract);分类 cs.CV
专题命中 个性化与一致性 :image synthesis(title,abstract);image generation(abstract);分类 cs.CV
Comments 24 pages, 19 figures. Project page: http://jiataogu.me/style_nerf/
基于Style-Diffusion TTS模型潜在空间适配的零样本人脸到语音合成
专题命中 个性化与一致性 :diffusion(title,title_cn)
AI总结 该研究提出基于StyleTTS 2的人脸到语音合成框架,通过人脸适配器实现静态人脸到语音的零样本生成,在LRS3数据集上验证了效果,且映射具有语言无关性。
Comments 5 pages, 1 figure, 5 tables, submitted to IberSPEECH 2026
推荐超越目录的个性化图像生成
机构 * University of Michigan(密歇根大学)
专题命中 个性化与一致性 :image generation(title,abstract);diffusion(abstract)
AI总结 REBECA通过直接学习隐含反馈信号实现高效个性化图像生成,无需微调扩散模型,提升大规模用户群体的个性化效果。
专题命中 个性化与一致性 :image generation(title,abstract);text-to-image(abstract)
Comments Accepted to the 30th International Conference on Intelligent User Interfaces (IUI '25), March 24-27, 2025, Cagliari, Italy ; Link to code https://github.com/Bill2462/prompt-map
专题命中 个性化与一致性 :image generation(title,abstract);diffusion(abstract)
Comments Appearing in the Proceedings of the 18th ACM Conference on Recommender Systems (RecSys'24) as an Industry Track paper
专题命中 个性化与一致性 :diffusion(title,abstract);分类 cs.CV、cs.GR
Comments https://chenganhsieh.github.io/spritesheet-diffusion/
重定向流:通过注意力分布偏移实现图像定制
机构 * State Key Laboratory for Novel Software Technology, Nanjing University(南京大学计算机软件新技术国家重点实验室) ; School of Artificial Intelligence, Nanjing University(南京大学人工智能学院) ; School of Computer Science, Nanjing University(南京大学计算机科学与技术学院) ; School of Electronic Science and Engineering, Nanjing University(南京大学电子科学与工程学院)
专题命中 个性化与一致性 :diffusion(abstract,abstract_cn);image generation(abstract);text-to-image(abstract);分类 cs.CV
AI总结 提出基于最大熵理论的Conditional Attention Distribution Shift方法,通过双分支架构CustomShift实现高效主题驱动图像生成,在DreamBooth和Custom101基准上优于现有方法。
CPC-VAR:视觉自回归模型中的持续个性化与组合生成
机构 * Harbin Institute of Technology, Shenzhen(哈尔滨工业大学(深圳)) ; Tsinghua Shenzhen International Graduate School, Tsinghua University(清华大学深圳国际研究生院) ; Peng Cheng Laboratory(鹏城实验室) ; South China University of Technology(华南理工大学)
专题命中 个性化与一致性 :image generation(abstract);text-to-image(abstract);image synthesis(abstract);personalized generation(abstract)
AI总结 本文研究了视觉自回归模型中的持续个性化生成问题,提出了一种统一框架,通过梯度基概念神经元选择和上下文感知组合策略,解决了连续单概念学习和多概念合成中的关键挑战,提升了长序列持续个性化和多概念图像合成的性能。
LongCat-Image 技术报告
机构 * Meituan LongCat Team(美团LongCat团队)
专题命中 个性化与一致性 :image generation(abstract);text-to-image(abstract);diffusion(abstract);image editing(abstract)
AI总结 LongCat-Image通过双语开源模型提升多语言图像生成与编辑能力,实现高效部署与高质量输出。
机构 * Shanghai Jiao Tong University(上海交通大学)
专题命中 个性化与一致性 :image generation(abstract);text-to-image(abstract);diffusion(abstract);image editing(abstract)
专题命中 个性化与一致性 :image generation(abstract);text-to-image(abstract);diffusion(abstract);image synthesis(abstract)
Comments Technical Report, project page available at https://instantid.github.io/
机构 * Department of Electrical and Computer Engineering(电气与计算机工程系) ; University of Pittsburgh(匹兹堡大学)
专题命中 个性化与一致性 :image generation(title,abstract);分类 cs.CV、cs.MM
机构 * Southwest University(西南大学) ; Stony Brook University(石溪大学)
专题命中 个性化与一致性 :image generation(title,abstract);分类 cs.CV、cs.MM
Comments 12 pages, 9 figures
专题命中 个性化与一致性 :text-to-image(title);diffusion(abstract);分类 cs.CV、cs.GR
Comments project page: https://hyperdreambooth.github.io
超越面部一致性:具有整体身份保留的个性化人物图像生成
机构 * Black Forest Labs(黑森林实验室)
专题命中 个性化与一致性 :image generation(title,abstract);分类 cs.CV
AI总结 研究个性化人物图像生成中面部保真度与外观一致性权衡问题,提出双分支基线及动态平衡缩放策略DBS,由自适应时间门控和区域感知优化组成,实验表明DBS比现有基线更好,为整体身份建模提供可控框架。
基于扩散先验的无噪声单步LoRA用于任务驱动的图像恢复
机构 * Seoul National University(首尔国立大学) ; IPAI, Seoul National University(首尔国立大学IPAI)
专题命中 个性化与一致性 :diffusion(title,abstract);分类 cs.CV
AI总结 研究针对退化图像影响下游任务的问题,提出基于扩散先验的无噪声单步LoRA方法用于任务驱动的图像恢复,通过特定适配模块及新训练策略,经实验验证该方法在多任务上优于先前方法且具泛化能力。
Comments Code: https://github.com/JaehaKim97/NOLA-IR
用于多模态遥感图像生成的对比参数解缠
机构 * School of Information and Communication Engineering, Dalian University of Technology(大连理工大学信息与通信工程学院) ; Unit 92728 of PLA(中国人民解放军92728部队)
专题命中 个性化与一致性 :image generation(title,abstract);分类 cs.CV
AI总结 针对现有遥感图像生成方法局限,提出对比参数解缠框架,通过对比参数解缠模块、解缠优化策略及查询-键结构转移机制,实现多模态遥感图像高质量生成,在相关任务中性能优越。
探索开源模型生态系统:艺术图像生成中创作者实践的实证研究
机构 * The Hong Kong University of Science and Technology (Guangzhou)(香港科学与技术大学(广州))
专题命中 个性化与一致性 :image generation(title,abstract);分类 cs.CV
AI总结 本文针对开源图像生成生态系统中创作者模型使用行为展开实证研究,构建含600万张图像及生成元数据的数据集,关联基础模型与LoRA模型使用情况,揭示其优劣势,公开数据集,为创作者和研究人员提供参考。
Comments Accepted to MM'26: The 34th ACM International Conference on Multimedia
EmoStyle:用于情感图像生成的风格专家情感调节
机构 * University of Science and Technology of China(中国科学技术大学) ; Harbin Institute of Technology(哈尔滨工业大学)
专题命中 个性化与一致性 :image generation(title,abstract);分类 cs.CV
AI总结 针对情感感知艺术图像生成中训练与测试时属性不一致造成的控制差距问题,提出EmoStyle框架,利用语言模型推理器预测情感线索,编码情感字段指导生成,训练专用LoRA适配器结合风格表达情感,经视觉语言模型引导排序,在挑战赛中获佳绩。
HairWeaver:基于仿真到现实引导视频扩散的少样本逼真头发运动合成
机构 * Meta University of Southern California(Meta 美国南加州大学)
专题命中 个性化与一致性 :diffusion(title,abstract);分类 cs.CV
AI总结 HairWeaver旨在解决现有方法在头发运动控制上的不足,通过运动上下文LoRA和风格对齐LoRA两个模块,结合CG模拟器生成的数据集训练视频扩散主干,实现对头发运动的精细控制,生成高度逼真且具动态细节的头发动画,达到新的技术水平。
Comments Accepted by ECCV 2026. Website: https://boese0601.github.io/hairweaver/
FADRA:用于视频人脸识别的频率感知扩散与残差自适应
机构 * United Arab Emirates University (UAEU)(阿联酋大学) ; Ocean University of China (OUC)(中国海洋大学) ; Mohamed bin Zayed University of Artificial Intelligence (MBZUAI)(穆罕默德·本·扎耶德人工智能大学)
专题命中 个性化与一致性 :diffusion(title,abstract);分类 cs.CV
AI总结 研究针对视频人脸识别在复杂退化下难以平衡空间保真度和时间连贯性的问题,提出FADRA框架,利用预训练模型的时间一致性,通过LoRA适配器、重复残差自适应头及频率感知损失等实现,实验证明其在恢复面部结构和保持时间一致性上优于现有方法。
测量子空间一致性:加速MRI重建中扩散后验采样的即插即用算子
机构 * Interdisciplinary Program in Cancer Biology, Seoul National University College of Medicine(首尔国立大学医学院癌症生物学跨学科项目) ; Department of Radiology, Seoul National University College of Medicine, Seoul National University Hospital(首尔国立大学医学院放射科,首尔国立大学医院) ; Healthcare AI Research Institute, Seoul National University Hospital(首尔国立大学医院医疗人工智能研究机构)
专题命中 个性化与一致性 :diffusion(title,abstract);分类 cs.CV
AI总结 针对加速MRI中扩散后验采样在已测量k空间上产生不一致的问题,提出测量子空间一致性(MSC)作为无训练的后验修正算子,通过经典一致性锁减少测量子空间泄漏,保持未测量子空间多样性,无需重新训练或调参。
RAVA: 检索增强的视角对齐用于主题驱动图像生成
机构 * WeChat AI, Tencent Inc.(腾讯微信人工智能实验室)
专题命中 个性化与一致性 :image generation(title,abstract);分类 cs.CV
AI总结 提出RAVA框架,通过检索增强提供几何证据,解决跨主体视角对齐中的视角漂移和结构不匹配问题,在保持身份的同时实现可靠视角控制。
SSR-Merge: 面向扩散模型中免训练的LoRA合并的子空间信号路由
机构 * Stanford University(斯坦福大学)
专题命中 个性化与一致性 :diffusion(title,abstract);分类 cs.CV
AI总结 提出子空间信号路由(SSR)方法,通过沿秩维度拼接LoRA构建统一子空间,利用逆相关矩阵去相关和方向引导矩阵分离信号,解决参数合并中的干扰问题,理论证明其等价于OLS最优解,并设计流式算法降低开销。
Comments Accepted at ICML 2026
Scone:通过统一理解-生成建模弥合主体驱动图像生成中的组合与区分
机构 * Peking University(北京大学) ; Kling Team, Kuaishou Technology(快手科技 Kling 团队) ; Zhongguancun Academy(中关村学院) ; HKUST(香港科技大学) ; Beijing Key Laboratory of Data Intelligence and Security (Peking University)(北京数据智能与安全重点实验室(北京大学))
专题命中 个性化与一致性 :image generation(title,abstract);分类 cs.CV
AI总结 提出Scone方法,通过统一理解-生成模型结合组合与区分能力,采用两阶段训练实现主体身份保持与干扰最小化,在双基准上优于现有开源模型。
Comments CVPR 2026 Highlight. Code: https://github.com/Ryann-Ran/Scone
Polaris: 将指令引导的图像生成扩展到数百万个性化风格需求
机构 * Tsinghua University(清华大学)
专题命中 个性化与一致性 :image generation(title,abstract);分类 cs.CV
AI总结 提出Polaris智能检索框架,通过索引和检索超过6500个检查点和75000个适配器,自动选择和集成最相关的模型组件,实现无需额外训练的可扩展、可控且对齐的指令驱动图像生成。
VISTA: 基于扩散变换器的三元组监督视频风格迁移
机构 * Show Lab, National University of Singapore(新加坡国立大学Show实验室) ; Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) ; Lovart AI(Lovart人工智能)
专题命中 个性化与一致性 :diffusion(title,abstract);分类 cs.CV
AI总结 本文提出VISTA方法,通过引入大规模三元组数据和基于扩散变换器的框架,解决视频风格迁移中风格、内容和运动的联合建模与解耦问题,实现了高质量的风格迁移效果。
StyleText: 一个大规模数据集和基准,用于具有风格保留的场景文本修复
机构 * Adobe Inc.(Adobe公司)
专题命中 个性化与一致性 :inpainting(title,abstract);分类 cs.CV
AI总结 本文提出StyleText,一个用于具有风格保留的场景文本修复的大规模数据集和基准,通过控制评估文本可读性和视觉一致性,利用共享场景上下文。
Comments Accepted at the SynData4CV Workshop, CVPR 2026. 8 pages + 1 page of references, 5 figures, 4 tables
UniVidX:一种基于扩散先验的统一多模态框架,用于 versatile 视频生成
机构 * Beihang University(北京航空航天大学) ; Nanjing University(南京大学) ; Stanford University(斯坦福大学) ; Tsinghua University(清华大学)
专题命中 个性化与一致性 :diffusion(title,abstract);分类 cs.CV
AI总结 UniVidX 提出一种统一多模态框架,通过扩散先验实现 versatile 视频生成,采用随机条件掩码、解耦门控LoRA和跨模态自注意力等设计,提升多模态一致性与生成性能。
Comments Project page: https://houyuanchen111.github.io/UniVidX.github.io/ Accepted to ACM Transactions on Graphics (Proceedings of SIGGRAPH 2026)
Journal ref ACM Trans. Graph. 45, 4, Article 51 (July 2026)