DiffusionRig: Learning Personalized Priors for Facial Appearance Editing
专题命中 个性化与一致性 :diffusion(abstract);分类 cs.CV、cs.GR
Comments CVPR 2023. Project website: https://diffusionrig.github.io
视觉与机器人
图像生成、文生图、图像编辑、扩散模型和可控生成。
专题命中 个性化与一致性 :diffusion(abstract);分类 cs.CV、cs.GR
Comments CVPR 2023. Project website: https://diffusionrig.github.io
专题命中 个性化与一致性 :text-to-image(abstract);分类 cs.CV、cs.GR
Comments Project page at https://dreambooth3d.github.io/ Video Summary at https://youtu.be/kKVDrbfvOoA
专题命中 个性化与一致性 :inpainting(abstract);分类 cs.CV、cs.GR
Comments SIGGRAPH ASIA 2022, Project webpage: https://mystyle-personalized-prior.github.io/, Video: https://youtu.be/QvOdQR3tlOc
专题命中 个性化与一致性 :image editing(abstract);分类 cs.CV、cs.MM
Journal ref MM'21: Proceedings of the 29th ACM International Conference on MultimediaOctober 2021
专题命中 个性化与一致性 :inpainting(abstract);分类 cs.CV、cs.MM
Comments 11 pages, 13 figures
专题命中 个性化与一致性 :image generation(abstract);分类 cs.CV、cs.GR
Comments Camera-Ready version. Paper was accepted as oral to CVPR 2022. Added discussions and figures from the rebuttal to the supplementary material (sections C & F). Project Webpage: https://stylesdf.github.io/
专题命中 个性化与一致性 :diffusion(abstract);分类 cs.CV、cs.GR
Comments Accompanying video: https://youtu.be/RXK2iv980nU
专题命中 个性化与一致性 :image generation(abstract);分类 cs.CV、cs.GR
Comments CVPR 2021
专题命中 个性化与一致性 :image generation(abstract);分类 cs.CV、cs.GR
ReCap:轻量级指代 grounding 以实现连贯故事可视化
机构 * 1 Technical University of Darmstadt \& hessian.AI, Germany -2em
专题命中 个性化与一致性 :diffusion(abstract,comments);分类 cs.CV
AI总结 ReCap 提出一种轻量级框架,通过视觉锚点提升角色稳定性与视觉一致性,无需修改基础扩散模型,在两个故事可视化基准上取得新高。
Comments Diffusion Models, Story Visualization
机构 * Virginia Tech(弗吉尼亚理工大学) ; Intuit AI Research(Intuit AI研究院) ; Meta AI ; The Chinese University of Hong Kong(香港中文大学) ; University of California, Davis(加州大学戴维斯分校)
专题命中 个性化与一致性 :image generation(abstract,comments);分类 cs.CV
Comments 8 Pages, interleaved instruction tuning, parameter-efficient tuning, image understanding, image generation
基于视觉语言模型的图像传输个性化数字语义通信
专题命中 个性化与一致性 :diffusion(abstract);分类 cs.MM
AI总结 针对现有语义通信方案忽略接收端依赖语义的问题,提出整合VLM与LDM的PDSC框架,构建容量受限的个性化语义率失真问题,实验证实其在带宽受限场景下的源语义一致性与个性化表现优于CDDM、MoS等基线。
Comments Accepted by IEEE GLOBECOM 2026
CRAFT:无需组合目标的主题个性化的注意力微调约束奖励
机构 * DGIST(大邱科技研究院) ; Baidu, Inc.(百度公司) ; KAIST(韩国科学技术院)
专题命中 个性化与一致性 :diffusion(abstract);分类 cs.CV
AI总结 本文提出无需组合目标监督的CRAFT框架,通过LoRA适配器微调参考感知MMDiT,仅用1万张参考样本,在XVerseBench上实现图像主题个性化的最先进性能,且可迁移至其他骨干网络。
Comments 20 pages, 8 figures, ACM SIGGRAPH Asia 2026
UniSwap:用于说话视频的流音频-视觉身份交换
机构 * The Chinese University of Hong Kong(香港中文大学) ; Qwen Applications Business Group of Alibaba(阿里巴巴通义千问应用业务集团)
专题命中 个性化与一致性 :diffusion(abstract);分类 cs.CV
AI总结 UniSwap是首个流音频-视觉身份替换框架,通过多阶段适配技术解决现有方法音视频一致性差等问题,实现高效稳定的说话视频身份替换。
Wan-Animate-2:拓展角色动画的应用边界
机构 * Tongyi Lab, Alibaba Group(阿里巴巴集团通义实验室)
专题命中 个性化与一致性 :diffusion(abstract);分类 cs.CV
AI总结 本文提出Wan-Animate-2角色动画框架,通过消除中间运动提取器提升动画保真度,新增文本驱动视角控制,推出实时高效变体Wan-Animate-2-Lite,将发布其基础模型权重。
Comments Project page: https://humanaigc.github.io/wan-animate-2/
机构 * Idiap Research Institute(Idiap研究机构)
专题命中 个性化与一致性 :diffusion(abstract);分类 cs.CV
Comments Accepted for publication in IEEE International Joint Conference on Biometrics (IJCB), 2025
StyleComposer:无需训练的多参考风格合成
专题命中 个性化与一致性 :diffusion(abstract);分类 cs.CV
AI总结 针对现有参考引导风格方法无法控制各属性来源与强度的问题,提出无需训练的StyleComposer,通过将各风格属性路由至最佳表示并协调去噪时间,实现更贴合多参考与提示的风格合成,且支持各属性强度调节。
SEED: 用于可解释文本伪造检测的简单ViT与演化框架
机构 * State Key Laboratory of Internet of Things for Smart City, Department of Computer and Information Science, University of Macau(澳门大学计算机与信息科学系智慧城市物联网国家重点实验室) ; School of Information and Software Engineering, University of Electronic Science and Technology of China(电子科技大学信息与软件工程学院)
专题命中 个性化与一致性 :image editing(abstract);分类 cs.CV
AI总结 提出SEED系统,结合相似性引导数据增强、单一ViT联合检测与定位、以及基于MLLM的演化报告生成,在ACM MM 2026文本伪造挑战赛中获得第三名。
面向以人为中心场景中AI生成图像检测的视觉证据定位与解释
专题命中 个性化与一致性 :image generation(abstract);分类 cs.CV
AI总结 针对以人为中心场景AI生成图像检测的证据定位与解释局限,提出HAVE数据集及PAVE框架,实现真伪预测、证据定位与解释生成,实验表现优异。
FusionRS: 用于双模态视觉-语言基础模型的大规模RGB-红外遥感数据集
机构 * China University of Petroleum-Beijing at Karamay(中国石油大学(北京)克拉玛依校区) ; University of Electronic Science and Technology of China(电子科技大学) ; Tianjin University(天津大学)
专题命中 个性化与一致性 :generative vision(abstract);分类 cs.CV
AI总结 针对遥感视觉-语言模型缺乏红外数据的问题,提出首个大规模RGB-红外-文本数据集FusionRS,通过翻译RGB图像为红外风格并配以红外感知描述,训练双模态基础模型,提升RGB-红外对齐和双模态字幕生成性能。
InkShield:抵御未授权笔迹模仿的书写风格保护
专题命中 个性化与一致性 :image editing(abstract);分类 cs.CV
AI总结 InkShield是一种主动书写风格防御方案,通过限制扰动在墨迹笔画边缘保护手写参考图像,可降低未授权笔迹模仿的检索率,且视觉质量与可读性良好。
Bunraku:将单张插图转换为可编辑的Live2D角色
机构 * Tsinghua University(清华大学) ; Nanyang Technological University(南洋理工大学) ; SparcAI Inc.(SparcAI公司)
专题命中 个性化与一致性 :diffusion(abstract);分类 cs.CV
AI总结 本文提出Bunraku系统,可从单张插图端到端生成可编辑Live2D角色,构建分层扩散与联合位移预测方法,发布首个相关基准Live2D-Bench及8884模型语料库,解决了Live2D模型手动构建效率低的问题。
Comments Project page: https://bunraku-live2d.github.io/
从合成到真实:迈向身份一致的化妆转移的合成与真实数据
机构 * College of Computer Science and Artificial Intelligence, Fudan University(复旦大学计算机科学与人工智能学院) ; Institute of Trustworthy Embodied AI, Fudan University(复旦大学可信具身人工智能研究院)
专题命中 个性化与一致性 :diffusion(abstract);分类 cs.CV
AI总结 本文提出ConsistentBeauty和RealBeauty方法,通过合成数据筛选和强化学习提升化妆转移的逼真度与身份一致性,并建立多样化基准测试以评估模型在复杂真实场景中的性能。
ID-Guard:一种通过破坏身份特征来对抗面部操纵的通用框架
专题命中 个性化与一致性 :inpainting(abstract);分类 cs.CV
AI总结 本研究针对面部操纵滥用的问题,提出ID-Guard通用框架,通过身份破坏模块生成跨模型可迁移扰动,可防御多种操纵模型并集成到其他任务中。
MoSAIC:用于局部部位动作迁移的对齐干预监督
机构 * The University of Texas at San Antonio(德克萨斯大学圣安东尼奥分校)
专题命中 个性化与一致性 :diffusion(abstract);分类 cs.CV
AI总结 MoSAIC是一种局部部位参考条件动作风格迁移的潜在扩散框架,通过对齐干预监督优化响应与保留的权衡,在评估中降低了误差并提升了选中区域响应与路由影响浓度。
Comments 23 pages, 6 figures, 11 tables. Project page: https://utsa-virlab.github.io/MoSAIC/
对抗性深度伪造生成与基于净化的对抗性检测研究
机构 * Soonchunhyang University(顺天乡大学)
专题命中 个性化与一致性 :image generation(abstract);分类 cs.CV
AI总结 该研究参与ImageCLEF 2026深度伪造检测与生成任务,图像生成采用FLUX.1-dev等方法,检测用SigLIP+DINOv2等组合。还自主研究基于净化的对抗性检测,发现特定信号可有效区分对抗与干净输入,反驳相关假设并揭示质量悬崖。
Comments Accepted at CLEF 2026, ImageCLEF-Deepfake task. Published in CEUR-WS CLEF 2026 Working Notes
OmniMate:用于交互式虚拟化身的开放式实时流视听生成
机构 * China Telecom Artificial Intelligence Technology (Beijing) Co., Ltd.(中国电信人工智能技术(北京)有限公司)
专题命中 个性化与一致性 :diffusion(abstract);分类 cs.CV
AI总结 研究针对实时交互式流中生成范围未知和跨模态身份一致性退化的挑战,提出OmniMate框架,通过生成进度控制器和多参考条件模块,实现高质量、低延迟的开放式实时交互式视听虚拟化身生成及长期跨模态身份一致性。
使用角色-环境协调视频生成模型的电影级合成
机构 * City University of Hong Kong(香港城市大学) ; Independent Researcher(独立研究员)
专题命中 个性化与一致性 :diffusion(abstract);分类 cs.CV
AI总结 提出端到端视频扩散框架,通过三掩码引导和RGB-D联合去噪建模角色与环境的双向物理与光照交互,实现高质量动态视频合成。
Comments Project Page: https://cehcomposition.github.io/demo/
Oxygen-TryOn:用于任意物品虚拟试穿的时尚原生基础模型
机构 * Oxygen AIGC Group(氧气AIGC集团) ; Joy Future Academy(京东探索研究院)
专题命中 个性化与一致性 :inpainting(abstract);分类 cs.CV
AI总结 研究提出时尚原生的Oxygen-TryOn基础模型,用于任意物品虚拟试穿。通过专用数据引擎和特定训练构建,重新定义试穿任务,设计三阶段训练方法,在单物品和多物品试穿中取得先进成果,超越多个系统。
自适应身份锚定:用于视频人脸交换中合成配对监督的闭环关键帧放置
专题命中 个性化与一致性 :diffusion(abstract);分类 cs.CV
AI总结 研究视频人脸交换缺乏自然配对监督问题,提出自适应身份锚定(AIA)方法,通过闭环反馈放置锚定并结合现实参考纹理恢复,还给出可证伪实验,有望解决合成身份漂移及过度平滑皮肤问题。