arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

图像生成

图像生成、文生图、图像编辑、扩散模型和可控生成。

共收录 1266 信号源:cs.CV, cs.GR, cs.MM

1. 个性化与一致性 1266 篇

2304.07429 2023-04-18 cs.CV 83%

Identity Encoder for Personalized Diffusion

Yu-Chuan Su, Kelvin C. K. Chan, Yandong Li, Yang Zhao, Han Zhang, Boqing Gong, Huisheng Wang, Xuhui Jia

专题命中 个性化与一致性 :diffusion(title,abstract);image generation(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2110.08985 2021-10-19 cs.CV stat.ML 83%

StyleNeRF: A Style-based 3D-Aware Generator for High-resolution Image Synthesis

Jiatao Gu, Lingjie Liu, Peng Wang, Christian Theobalt

专题命中 个性化与一致性 :image synthesis(title,abstract);image generation(abstract);分类 cs.CV

Comments 24 pages, 19 figures. Project page: http://jiataogu.me/style_nerf/

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.26742 2026-07-30 eess.AS cs.AI cs.SD 新提交 82%

Zero-Shot Face-to-Speech Synthesis via Latent Space Adaptation of a Style-Diffusion TTS Model

基于Style-Diffusion TTS模型潜在空间适配的零样本人脸到语音合成

Carlos Muñoz-Romero, Jose A. Gonzalez-Lopez

专题命中 个性化与一致性 :diffusion(title,title_cn)

AI总结 该研究提出基于StyleTTS 2的人脸到语音合成框架,通过人脸适配器实现静态人脸到语音的零样本生成,在LRS3数据集上验证了效果,且映射具有语言无关性。

Comments 5 pages, 1 figure, 5 tables, submitted to IberSPEECH 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.18477 2025-11-27 cs.IR cs.AI cs.LG 82%

Personalized Image Generation for Recommendations Beyond Catalogs

推荐超越目录的个性化图像生成

Gabriel Patron, Zhiwei Xu, Ishan Kapnadak, Felipe Maia Polo

机构 * University of Michigan(密歇根大学)

专题命中 个性化与一致性 :image generation(title,abstract);diffusion(abstract)

AI总结 REBECA通过直接学习隐含反馈信号实现高效个性化图像生成,无需微调扩散模型,提升大规模用户群体的个性化效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.09436 2025-04-04 cs.HC cs.AI 82%

PromptMap: An Alternative Interaction Style for AI-Based Image Generation

Krzysztof Adamkiewicz, Paweł W. Woźniak, Julia Dominiak, Andrzej Romanowski, Jakob Karolus, Stanislav Frolov

专题命中 个性化与一致性 :image generation(title,abstract);text-to-image(abstract)

Comments Accepted to the 30th International Conference on Intelligent User Interfaces (IUI '25), March 24-27, 2025, Cagliari, Italy ; Link to code https://github.com/Bill2462/prompt-map

详情

展开后加载摘要…

URL PDF HTML 收藏
2408.12392 2024-08-23 cs.IR 82%

Dynamic Product Image Generation and Recommendation at Scale for Personalized E-commerce

Ádám Tibor Czapp, Mátyás Jani, Bálint Domián, Balázs Hidasi

专题命中 个性化与一致性 :image generation(title,abstract);diffusion(abstract)

Comments Appearing in the Proceedings of the 18th ACM Conference on Recommender Systems (RecSys'24) as an Industry Track paper

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.03685 2025-03-18 cs.GR cs.CV 82%

Sprite Sheet Diffusion: Generate Game Character for Animation

Cheng-An Hsieh, Jing Zhang, Ava Yan

专题命中 个性化与一致性 :diffusion(title,abstract);分类 cs.CV、cs.GR

Comments https://chenganhsieh.github.io/spritesheet-diffusion/

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.16866 2026-06-16 cs.CV 新提交 81%

Redirecting the Flow: Image Customization through Attention Distribution Shift

重定向流:通过注意力分布偏移实现图像定制

Jie Li, Suorong Yang, Jian Zhao, Furao Shen

机构 * State Key Laboratory for Novel Software Technology, Nanjing University(南京大学计算机软件新技术国家重点实验室) School of Artificial Intelligence, Nanjing University(南京大学人工智能学院) School of Computer Science, Nanjing University(南京大学计算机科学与技术学院) School of Electronic Science and Engineering, Nanjing University(南京大学电子科学与工程学院)

专题命中 个性化与一致性 :diffusion(abstract,abstract_cn);image generation(abstract);text-to-image(abstract);分类 cs.CV

AI总结 提出基于最大熵理论的Conditional Attention Distribution Shift方法,通过双分支架构CustomShift实现高效主题驱动图像生成,在DreamBooth和Custom101基准上优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.19750 2026-05-20 cs.CV 81%

CPC-VAR:Continual Personalized and Compositional Generation in Visual Autoregressive Models

CPC-VAR:视觉自回归模型中的持续个性化与组合生成

Junhao Li, Xinhao Zhong, Yi sun, Yuxia Qiao, Bin Chen, Shu-Tao Xia, Yaowei Wang

机构 * Harbin Institute of Technology, Shenzhen(哈尔滨工业大学(深圳)) Tsinghua Shenzhen International Graduate School, Tsinghua University(清华大学深圳国际研究生院) Peng Cheng Laboratory(鹏城实验室) South China University of Technology(华南理工大学)

专题命中 个性化与一致性 :image generation(abstract);text-to-image(abstract);image synthesis(abstract);personalized generation(abstract)

AI总结 本文研究了视觉自回归模型中的持续个性化生成问题,提出了一种统一框架,通过梯度基概念神经元选择和上下文感知组合策略,解决了连续单概念学习和多概念合成中的关键挑战,提升了长序列持续个性化和多概念图像合成的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.07584 2025-12-09 cs.CV 81%

LongCat-Image Technical Report

LongCat-Image 技术报告

Meituan LongCat Team, Hanghang Ma, Haoxian Tan, Jiale Huang, Junqiang Wu, Jun-Yan He, Lishuai Gao, Songlin Xiao, Xiaoming Wei, Xiaoqi Ma, Xunliang Cai, Yayong Guan, Jie Hu

机构 * Meituan LongCat Team(美团LongCat团队)

专题命中 个性化与一致性 :image generation(abstract);text-to-image(abstract);diffusion(abstract);image editing(abstract)

AI总结 LongCat-Image通过双语开源模型提升多语言图像生成与编辑能力,实现高效部署与高质量输出。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.20756 2025-09-26 cs.CV 81%

FreeInsert: Personalized Object Insertion with Geometric and Style Control

Yuhong Zhang, Han Wang, Yiwen Wang, Rong Xie, Li Song

机构 * Shanghai Jiao Tong University(上海交通大学)

专题命中 个性化与一致性 :image generation(abstract);text-to-image(abstract);diffusion(abstract);image editing(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2401.07519 2024-02-05 cs.CV cs.AI 81%

InstantID: Zero-shot Identity-Preserving Generation in Seconds

Qixun Wang, Xu Bai, Haofan Wang, Zekui Qin, Anthony Chen, Huaxia Li, Xu Tang, Yao Hu

专题命中 个性化与一致性 :image generation(abstract);text-to-image(abstract);diffusion(abstract);image synthesis(abstract)

Comments Technical Report, project page available at https://instantid.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.01932 2025-11-05 cs.LG cs.AI cs.CV cs.MM 81%

Deciphering Personalization: Towards Fine-Grained Explainability in Natural Language for Personalized Image Generation Models

Haoming Wang, Wei Gao

机构 * Department of Electrical and Computer Engineering(电气与计算机工程系) University of Pittsburgh(匹兹堡大学)

专题命中 个性化与一致性 :image generation(title,abstract);分类 cs.CV、cs.MM

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.12173 2025-06-24 cs.CV cs.MM 81%

LAPIG: Language Guided Projector Image Generation with Surface Adaptation and Stylization

Yuchen Deng, Haibin Ling, Bingyao Huang

机构 * Southwest University(西南大学) Stony Brook University(石溪大学)

专题命中 个性化与一致性 :image generation(title,abstract);分类 cs.CV、cs.MM

Comments 12 pages, 9 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2307.06949 2024-10-18 cs.CV cs.AI cs.GR cs.LG 81%

HyperDreamBooth: HyperNetworks for Fast Personalization of Text-to-Image Models

Nataniel Ruiz, Yuanzhen Li, Varun Jampani, Wei Wei, Tingbo Hou, Yael Pritch, Neal Wadhwa, Michael Rubinstein, Kfir Aberman

专题命中 个性化与一致性 :text-to-image(title);diffusion(abstract);分类 cs.CV、cs.GR

Comments project page: https://hyperdreambooth.github.io

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.25622 2026-07-29 cs.CV 新提交 79%

Beyond Facial Consistency: Personalized Person Image Generation with Holistic Identity Preservation

超越面部一致性:具有整体身份保留的个性化人物图像生成

Yuxuan Xiao, Shanshan Zhang, Jian Yang, Shengcai Liao

机构 * Black Forest Labs(黑森林实验室)

专题命中 个性化与一致性 :image generation(title,abstract);分类 cs.CV

AI总结 研究个性化人物图像生成中面部保真度与外观一致性权衡问题,提出双分支基线及动态平衡缩放策略DBS,由自适应时间门控和区域感知优化组成,实验表明DBS比现有基线更好,为整体身份建模提供可控框架。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.25390 2026-07-29 cs.CV 新提交 79%

Noise-Free One-Step LoRA for Task-Driven Image Restoration with Diffusion Priors

基于扩散先验的无噪声单步LoRA用于任务驱动的图像恢复

Jaeha Kim, Kyoung Mu Lee

机构 * Seoul National University(首尔国立大学) IPAI, Seoul National University(首尔国立大学IPAI)

专题命中 个性化与一致性 :diffusion(title,abstract);分类 cs.CV

AI总结 研究针对退化图像影响下游任务的问题,提出基于扩散先验的无噪声单步LoRA方法用于任务驱动的图像恢复,通过特定适配模块及新训练策略,经实验验证该方法在多任务上优于先前方法且具泛化能力。

Comments Code: https://github.com/JaehaKim97/NOLA-IR

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.23673 2026-07-28 cs.CV 新提交 79%

Contrastive Parameter Disentanglement for Multi-modal Remote Sensing Image Generation

用于多模态遥感图像生成的对比参数解缠

Yu Zhang, Wenda Zhao, Haojun Tang, Haipeng Wang

机构 * School of Information and Communication Engineering, Dalian University of Technology(大连理工大学信息与通信工程学院) Unit 92728 of PLA(中国人民解放军92728部队)

专题命中 个性化与一致性 :image generation(title,abstract);分类 cs.CV

AI总结 针对现有遥感图像生成方法局限,提出对比参数解缠框架,通过对比参数解缠模块、解缠优化策略及查询-键结构转移机制,实现多模态遥感图像高质量生成,在相关任务中性能优越。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.10538 2026-07-14 cs.HC cs.CV cs.CY 新提交 79%

Navigating the Open-Source Model Ecosystem: An Empirical Study of Creator Practices in Artistic Image Generation

探索开源模型生态系统:艺术图像生成中创作者实践的实证研究

Yiluo Wei, Yupeng He, Qiming Ye, Gareth Tyson

机构 * The Hong Kong University of Science and Technology (Guangzhou)(香港科学与技术大学(广州))

专题命中 个性化与一致性 :image generation(title,abstract);分类 cs.CV

AI总结 本文针对开源图像生成生态系统中创作者模型使用行为展开实证研究,构建含600万张图像及生成元数据的数据集,关联基础模型与LoRA模型使用情况,揭示其优劣势,公开数据集,为创作者和研究人员提供参考。

Comments Accepted to MM'26: The 34th ACM International Conference on Multimedia

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.10165 2026-07-14 cs.CV cs.AI 新提交 79%

EmoStyle: Affective Conditioning of Style-Specialist Experts for Emotional Image Generation

EmoStyle:用于情感图像生成的风格专家情感调节

Dexiang Hong, Yijie Guo, Weidong Chen, Xinyan Liu, Zixuan Zou, Zhendong Mao, Yongdong Zhang

机构 * University of Science and Technology of China(中国科学技术大学) Harbin Institute of Technology(哈尔滨工业大学)

专题命中 个性化与一致性 :image generation(title,abstract);分类 cs.CV

AI总结 针对情感感知艺术图像生成中训练与测试时属性不一致造成的控制差距问题,提出EmoStyle框架,利用语言模型推理器预测情感线索,编码情感字段指导生成,训练专用LoRA适配器结合风格表达情感,经视觉语言模型引导排序,在挑战赛中获佳绩。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.11117 2026-07-10 cs.CV 版本更新 79%

HairWeaver: Few-Shot Photorealistic Hair Motion Synthesis with Sim-to-Real Guided Video Diffusion

HairWeaver:基于仿真到现实引导视频扩散的少样本逼真头发运动合成

Di Chang, Ji Hou, Aljaz Bozic, Assaf Neuberger, Felix Juefei-Xu, Olivier Maury, Gene Wei-Chin Lin, Tuur Stuyck, Doug Roble, Mohammad Soleymani, Stephane Grabli

机构 * Meta University of Southern California(Meta 美国南加州大学)

专题命中 个性化与一致性 :diffusion(title,abstract);分类 cs.CV

AI总结 HairWeaver旨在解决现有方法在头发运动控制上的不足,通过运动上下文LoRA和风格对齐LoRA两个模块,结合CG模拟器生成的数据集训练视频扩散主干,实现对头发运动的精细控制,生成高度逼真且具动态细节的头发动画,达到新的技术水平。

Comments Accepted by ECCV 2026. Website: https://boese0601.github.io/hairweaver/

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.06389 2026-07-08 cs.CV 新提交 79%

FADRA: Frequency-Aware Diffusion with Residual Adaptation for Video Face Restoration

FADRA:用于视频人脸识别的频率感知扩散与残差自适应

Jin Jiang, Jia Wang, Panwen Hu, Weiran Zhao, Shengcai Liao

机构 * United Arab Emirates University (UAEU)(阿联酋大学) Ocean University of China (OUC)(中国海洋大学) Mohamed bin Zayed University of Artificial Intelligence (MBZUAI)(穆罕默德·本·扎耶德人工智能大学)

专题命中 个性化与一致性 :diffusion(title,abstract);分类 cs.CV

AI总结 研究针对视频人脸识别在复杂退化下难以平衡空间保真度和时间连贯性的问题,提出FADRA框架,利用预训练模型的时间一致性,通过LoRA适配器、重复残差自适应头及频率感知损失等实现,实验证明其在恢复面部结构和保持时间一致性上优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.28448 2026-06-30 eess.IV cs.CV 79%

Measured-Subspace Consistency: A Plug-and-Play Operator for Diffusion Posterior Sampling in Accelerated MRI Reconstruction

测量子空间一致性:加速MRI重建中扩散后验采样的即插即用算子

Junhyeok Lee, Kyu Sung Choi

机构 * Interdisciplinary Program in Cancer Biology, Seoul National University College of Medicine(首尔国立大学医学院癌症生物学跨学科项目) Department of Radiology, Seoul National University College of Medicine, Seoul National University Hospital(首尔国立大学医学院放射科,首尔国立大学医院) Healthcare AI Research Institute, Seoul National University Hospital(首尔国立大学医院医疗人工智能研究机构)

专题命中 个性化与一致性 :diffusion(title,abstract);分类 cs.CV

AI总结 针对加速MRI中扩散后验采样在已测量k空间上产生不一致的问题,提出测量子空间一致性(MSC)作为无训练的后验修正算子,通过经典一致性锁减少测量子空间泄漏,保持未测量子空间多样性,无需重新训练或调参。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.17619 2026-06-17 cs.CV 新提交 79%

RAVA: Retrieval-Augmented Viewpoint Alignment for Subject-Driven Image Generation

RAVA: 检索增强的视角对齐用于主题驱动图像生成

Qiwei Yan, Zhiqiang Yuan, Chongyang Li, Jiapei Zhang, Ying Deng, Jinchao Zhang, Jie Zhou

机构 * WeChat AI, Tencent Inc.(腾讯微信人工智能实验室)

专题命中 个性化与一致性 :image generation(title,abstract);分类 cs.CV

AI总结 提出RAVA框架,通过检索增强提供几何证据,解决跨主体视角对齐中的视角漂移和结构不匹配问题,在保持身份的同时实现可靠视角控制。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.10617 2026-06-10 cs.CV 新提交 79%

SSR-Merge: Subspace Signal Routing for Training-Free LoRA Merging in Diffusion Models

SSR-Merge: 面向扩散模型中免训练的LoRA合并的子空间信号路由

Zhengxuan Wei, Yi Dong, Zonghui Li, Xianhui Lin, Xing Liu, Hong Gu, Shaofeng Zhang, Wenbin Li, Qi Fan

机构 * Stanford University(斯坦福大学)

专题命中 个性化与一致性 :diffusion(title,abstract);分类 cs.CV

AI总结 提出子空间信号路由(SSR)方法,通过沿秩维度拼接LoRA构建统一子空间,利用逆相关矩阵去相关和方向引导矩阵分离信号,解决参数合并中的干扰问题,理论证明其等价于OLS最优解,并设计流式算法降低开销。

Comments Accepted at ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.12675 2026-06-10 cs.CV cs.AI 版本更新 79%

Scone: Bridging Composition and Distinction in Subject-Driven Image Generation via Unified Understanding-Generation Modeling

Scone:通过统一理解-生成建模弥合主体驱动图像生成中的组合与区分

Yuran Wang, Bohan Zeng, Chengzhuo Tong, Wenxuan Liu, Yang Shi, Xiaochen Ma, Hao Liang, Yuanxing Zhang, Wentao Zhang

机构 * Peking University(北京大学) Kling Team, Kuaishou Technology(快手科技 Kling 团队) Zhongguancun Academy(中关村学院) HKUST(香港科技大学) Beijing Key Laboratory of Data Intelligence and Security (Peking University)(北京数据智能与安全重点实验室(北京大学))

专题命中 个性化与一致性 :image generation(title,abstract);分类 cs.CV

AI总结 提出Scone方法,通过统一理解-生成模型结合组合与区分能力,采用两阶段训练实现主体身份保持与干扰最小化,在双基准上优于现有开源模型。

Comments CVPR 2026 Highlight. Code: https://github.com/Ryann-Ran/Scone

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.01858 2026-06-02 cs.CV 79%

Polaris: Scaling Up Instruction-Guided Image Generation Towards Millions of Personalized Style Needs

Polaris: 将指令引导的图像生成扩展到数百万个性化风格需求

Zhi-Kai Chen, Jun-Peng Jiang, Jun-Jie Tao, De-Chuan Zhan, Han-Jia Ye

机构 * Tsinghua University(清华大学)

专题命中 个性化与一致性 :image generation(title,abstract);分类 cs.CV

AI总结 提出Polaris智能检索框架,通过索引和检索超过6500个检查点和75000个适配器,自动选择和集成最相关的模型组件,实现无需额外训练的可扩展、可控且对齐的指令驱动图像生成。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.17312 2026-05-19 cs.CV 79%

VISTA: Triplet-Supervised Video Style Transfer with Diffusion Transformers

VISTA: 基于扩散变换器的三元组监督视频风格迁移

Yiren Song, Wangzi Yao, Haofan Wang, Mike Zheng Shou

机构 * Show Lab, National University of Singapore(新加坡国立大学Show实验室) Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) Lovart AI(Lovart人工智能)

专题命中 个性化与一致性 :diffusion(title,abstract);分类 cs.CV

AI总结 本文提出VISTA方法,通过引入大规模三元组数据和基于扩散变换器的框架,解决视频风格迁移中风格、内容和运动的联合建模与解耦问题,实现了高质量的风格迁移效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.17309 2026-05-19 cs.CV cs.AI 79%

StyleText: A Large-Scale Dataset and Benchmark for Stylized Scene Text Inpainting

StyleText: 一个大规模数据集和基准,用于具有风格保留的场景文本修复

Aleksandr Simonyan, Nipun Jindal

机构 * Adobe Inc.(Adobe公司)

专题命中 个性化与一致性 :inpainting(title,abstract);分类 cs.CV

AI总结 本文提出StyleText,一个用于具有风格保留的场景文本修复的大规模数据集和基准,通过控制评估文本可读性和视觉一致性,利用共享场景上下文。

Comments Accepted at the SynData4CV Workshop, CVPR 2026. 8 pages + 1 page of references, 5 figures, 4 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.00658 2026-05-04 cs.CV 79%

UniVidX: A Unified Multimodal Framework for Versatile Video Generation via Diffusion Priors

UniVidX:一种基于扩散先验的统一多模态框架,用于 versatile 视频生成

Houyuan Chen, Hong Li, Xianghao Kong, Tianrui Zhu, Shaocong Xu, Weiqing Xiao, Yuwei Guo, Chongjie Ye, Lvmin Zhang, Hao Zhao, Anyi Rao

机构 * Beihang University(北京航空航天大学) Nanjing University(南京大学) Stanford University(斯坦福大学) Tsinghua University(清华大学)

专题命中 个性化与一致性 :diffusion(title,abstract);分类 cs.CV

AI总结 UniVidX 提出一种统一多模态框架,通过扩散先验实现 versatile 视频生成,采用随机条件掩码、解耦门控LoRA和跨模态自注意力等设计,提升多模态一致性与生成性能。

Comments Project page: https://houyuanchen111.github.io/UniVidX.github.io/ Accepted to ACM Transactions on Graphics (Proceedings of SIGGRAPH 2026)

Journal ref ACM Trans. Graph. 45, 4, Article 51 (July 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏