arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

图像生成

图像生成、文生图、图像编辑、扩散模型和可控生成。

共收录 1266 信号源:cs.CV, cs.GR, cs.MM

1. 个性化与一致性 1266 篇

2304.06711 2023-04-14 cs.CV cs.GR 62%

DiffusionRig: Learning Personalized Priors for Facial Appearance Editing

Zheng Ding, Xuaner Zhang, Zhihao Xia, Lars Jebe, Zhuowen Tu, Xiuming Zhang

专题命中 个性化与一致性 :diffusion(abstract);分类 cs.CV、cs.GR

Comments CVPR 2023. Project website: https://diffusionrig.github.io

详情

展开后加载摘要…

URL PDF HTML 收藏
2303.13508 2023-03-28 cs.CV cs.AI cs.GR 62%

DreamBooth3D: Subject-Driven Text-to-3D Generation

Amit Raj, Srinivas Kaza, Ben Poole, Michael Niemeyer, Nataniel Ruiz, Ben Mildenhall, Shiran Zada, Kfir Aberman, Michael Rubinstein, Jonathan Barron, Yuanzhen Li, Varun Jampani

专题命中 个性化与一致性 :text-to-image(abstract);分类 cs.CV、cs.GR

Comments Project page at https://dreambooth3d.github.io/ Video Summary at https://youtu.be/kKVDrbfvOoA

详情

展开后加载摘要…

URL PDF HTML 收藏
2203.17272 2022-10-07 cs.CV cs.GR cs.LG 62%

MyStyle: A Personalized Generative Prior

Yotam Nitzan, Kfir Aberman, Qiurui He, Orly Liba, Michal Yarom, Yossi Gandelsman, Inbar Mosseri, Yael Pritch, Daniel Cohen-or

专题命中 个性化与一致性 :inpainting(abstract);分类 cs.CV、cs.GR

Comments SIGGRAPH ASIA 2022, Project webpage: https://mystyle-personalized-prior.github.io/, Video: https://youtu.be/QvOdQR3tlOc

详情

展开后加载摘要…

URL PDF HTML 收藏
2205.02538 2022-05-06 cs.CV cs.MM 62%

Parametric Reshaping of Portraits in Videos

Xiangjun Tang, Wenxin Sun, Yong-Liang Yang, Xiaogang Jin

专题命中 个性化与一致性 :image editing(abstract);分类 cs.CV、cs.MM

Journal ref MM'21: Proceedings of the 29th ACM International Conference on MultimediaOctober 2021

详情

展开后加载摘要…

URL PDF HTML 收藏
2204.10973 2022-04-26 cs.CV cs.MM 62%

Detecting Recolored Image by Spatial Correlation

Yushu Zhang, Nuo Chen, Shuren Qi, Mingfu Xue, Xiaochun Cao

专题命中 个性化与一致性 :inpainting(abstract);分类 cs.CV、cs.MM

Comments 11 pages, 13 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2112.11427 2022-03-31 cs.CV cs.AI cs.GR cs.LG 62%

StyleSDF: High-Resolution 3D-Consistent Image and Geometry Generation

Roy Or-El, Xuan Luo, Mengyi Shan, Eli Shechtman, Jeong Joon Park, Ira Kemelmacher-Shlizerman

专题命中 个性化与一致性 :image generation(abstract);分类 cs.CV、cs.GR

Comments Camera-Ready version. Paper was accepted as oral to CVPR 2022. Added discussions and figures from the rebuttal to the supplementary material (sections C & F). Project Webpage: https://stylesdf.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2109.01018 2021-09-03 cs.GR cs.CV 62%

Dynamic Scene Novel View Synthesis via Deferred Spatio-temporal Consistency

Beatrix-Emőke Fülöp-Balogh, Eleanor Tursman, James Tompkin, Julie Digne, Nicolas Bonneel

专题命中 个性化与一致性 :diffusion(abstract);分类 cs.CV、cs.GR

Comments Accompanying video: https://youtu.be/RXK2iv980nU

详情

展开后加载摘要…

URL PDF HTML 收藏
2103.14338 2021-03-29 cs.CV cs.GR 62%

Few-Shot Human Motion Transfer by Personalized Geometry and Texture Modeling

Zhichao Huang, Xintong Han, Jia Xu, Tong Zhang

专题命中 个性化与一致性 :image generation(abstract);分类 cs.CV、cs.GR

Comments CVPR 2021

详情

展开后加载摘要…

URL PDF HTML 收藏
1811.07023 2018-11-20 cs.GR cs.CV cs.LG stat.ML 62%

An Infinite Parade of Giraffes: Expressive Augmentation and Complexity Layers for Cartoon Drawing

K. G. Greene

专题命中 个性化与一致性 :image generation(abstract);分类 cs.CV、cs.GR

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.18575 2026-04-21 cs.CV 61%

ReCap: Lightweight Referential Grounding for Coherent Story Visualization

ReCap:轻量级指代 grounding 以实现连贯故事可视化

Aditya Arora, Akshita Gupta, Pau Rodriguez, Marcus Rohrbach

机构 * 1 Technical University of Darmstadt \& hessian.AI, Germany -2em

专题命中 个性化与一致性 :diffusion(abstract,comments);分类 cs.CV

AI总结 ReCap 提出一种轻量级框架,通过视觉锚点提升角色稳定性与视觉一致性,无需修改基础扩散模型,在两个故事可视化基准上取得新高。

Comments Diffusion Models, Story Visualization

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.03604 2025-06-10 cs.CL cs.CV 61%

Modality-Specialized Synergizers for Interleaved Vision-Language Generalists

Zhiyang Xu, Minqian Liu, Ying Shen, Joy Rimchala, Jiaxin Zhang, Qifan Wang, Yu Cheng, Lifu Huang

机构 * Virginia Tech(弗吉尼亚理工大学) Intuit AI Research(Intuit AI研究院) Meta AI The Chinese University of Hong Kong(香港中文大学) University of California, Davis(加州大学戴维斯分校)

专题命中 个性化与一致性 :image generation(abstract,comments);分类 cs.CV

Comments 8 Pages, interleaved instruction tuning, parameter-efficient tuning, image understanding, image generation

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.14260 2026-08-17 eess.IV cs.MM 新提交 57%

Personalized Digital Semantic Communication for Image Transmission with Vision-Language Models

基于视觉语言模型的图像传输个性化数字语义通信

Nan Li, Li Zhou, Haijun Wang, Jun Xiong, Haitao Zhao, Jibo Wei

专题命中 个性化与一致性 :diffusion(abstract);分类 cs.MM

AI总结 针对现有语义通信方案忽略接收端依赖语义的问题,提出整合VLM与LDM的PDSC框架,构建容量受限的个性化语义率失真问题,实验证实其在带宽受限场景下的源语义一致性与个性化表现优于CDDM、MoS等基线。

Comments Accepted by IEEE GLOBECOM 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.14403 2026-08-17 cs.CV 新提交 57%

CRAFT: Constrained Reward via Attention Fine-Tuning for Subject Personalization without Composed Targets

CRAFT:无需组合目标的主题个性化的注意力微调约束奖励

Jihun Park, Kyoungmin Lee, Jongmin Gim, Hyeonseo Jo, Jaeyeul Kim, Han Zou, Zhenpeng Zhan, Yan Zhang, Sunghoon Im

机构 * DGIST(大邱科技研究院) Baidu, Inc.(百度公司) KAIST(韩国科学技术院)

专题命中 个性化与一致性 :diffusion(abstract);分类 cs.CV

AI总结 本文提出无需组合目标监督的CRAFT框架,通过LoRA适配器微调参考感知MMDiT,仅用1万张参考样本,在XVerseBench上实现图像主题个性化的最先进性能,且可迁移至其他骨干网络。

Comments 20 pages, 8 figures, ACM SIGGRAPH Asia 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.11752 2026-08-14 cs.CV cs.SD 版本更新 57%

UniSwap: Streaming Audio-Visual Identity Swapping for Talking Videos

UniSwap:用于说话视频的流音频-视觉身份交换

Yuxuan Zhang, Haozhong Xiong, Jiayi Song, Jinpeng Yu, Yang Shi, Jiaming Liu, Ruihua Huang, Liwei Wang

机构 * The Chinese University of Hong Kong(香港中文大学) Qwen Applications Business Group of Alibaba(阿里巴巴通义千问应用业务集团)

专题命中 个性化与一致性 :diffusion(abstract);分类 cs.CV

AI总结 UniSwap是首个流音频-视觉身份替换框架,通过多阶段适配技术解决现有方法音视频一致性差等问题,实现高效稳定的说话视频身份替换。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.06009 2026-08-11 cs.CV 版本更新 57%

Wan-Animate-2: Pushing the Application Boundaries of Character Animation

Wan-Animate-2:拓展角色动画的应用边界

Guangyuan Wang, Li Hu, Dechao Meng, Zhongyi Zhang, Peng Zhang, Xindi Zhang, Mingyang Huang, Ruoshi Zhang, Ke Sun, Zhe Zhang, Xingjun Wang, Gang Cheng, Hai Xu, Bang Zhang

机构 * Tongyi Lab, Alibaba Group(阿里巴巴集团通义实验室)

专题命中 个性化与一致性 :diffusion(abstract);分类 cs.CV

AI总结 本文提出Wan-Animate-2角色动画框架,通过消除中间运动提取器提升动画保真度,新增文本驱动视角控制,推出实时高效变体Wan-Animate-2-Lite,将发布其基础模型权重。

Comments Project page: https://humanaigc.github.io/wan-animate-2/

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.08808 2026-08-10 cs.CV 57%

Identity-Preserving Aging and De-Aging of Faces in the StyleGAN Latent Space

Luis S. Luevano, Pavel Korshunov, Sebastien Marcel

机构 * Idiap Research Institute(Idiap研究机构)

专题命中 个性化与一致性 :diffusion(abstract);分类 cs.CV

Comments Accepted for publication in IEEE International Joint Conference on Biometrics (IJCB), 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.05213 2026-08-07 cs.CV 新提交 57%

StyleComposer: Training-Free Multi-Reference Style Composition

StyleComposer:无需训练的多参考风格合成

Sanghyeok Lee, Jihye Kang, Namhyuk Ahn

专题命中 个性化与一致性 :diffusion(abstract);分类 cs.CV

AI总结 针对现有参考引导风格方法无法控制各属性来源与强度的问题,提出无需训练的StyleComposer,通过将各风格属性路由至最佳表示并协调去噪时间,实现更贴合多参考与提示的风格合成,且支持各属性强度调节。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.21138 2026-08-07 cs.CV 版本更新 57%

SEED: Simple ViT and Evolving Harness for Explainable Text Forgery Detection

SEED: 用于可解释文本伪造检测的简单ViT与演化框架

Kahim Wong, Kemou Li, Yiming Chen, Haiwei Wu, Jiantao Zhou

机构 * State Key Laboratory of Internet of Things for Smart City, Department of Computer and Information Science, University of Macau(澳门大学计算机与信息科学系智慧城市物联网国家重点实验室) School of Information and Software Engineering, University of Electronic Science and Technology of China(电子科技大学信息与软件工程学院)

专题命中 个性化与一致性 :image editing(abstract);分类 cs.CV

AI总结 提出SEED系统,结合相似性引导数据增强、单一ViT联合检测与定位、以及基于MLLM的演化报告生成,在ACM MM 2026文本伪造挑战赛中获得第三名。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.01988 2026-08-04 cs.CV 新提交 57%

Grounding and Explaining Visual Evidence for AI-Generated Image Detection in Human-Centric Scenes

面向以人为中心场景中AI生成图像检测的视觉证据定位与解释

Kun Guo, Yuzhou Yang, Haoyue Wang, Qichao Ying, Sheng Li, Zhenxing Qian

专题命中 个性化与一致性 :image generation(abstract);分类 cs.CV

AI总结 针对以人为中心场景AI生成图像检测的证据定位与解释局限,提出HAVE数据集及PAVE框架,实现真伪预测、证据定位与解释生成,实验表现优异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.17020 2026-08-04 cs.CV cs.AI 版本更新 57%

FusionRS: A Large-Scale RGB-Infrared-Style Remote Sensing Dataset for Cross-Modal Vision-Language Learning

FusionRS: 用于双模态视觉-语言基础模型的大规模RGB-红外遥感数据集

Jiaju Han, Ben Zhang, Xuemeng Sun, Qike Zhang, Yuxian Dong, Dingyi Lu, Chengyin Hu, Luwei Yang, Fengyu Zhang, Yiwei Wei, Jiujiang Guo

机构 * China University of Petroleum-Beijing at Karamay(中国石油大学(北京)克拉玛依校区) University of Electronic Science and Technology of China(电子科技大学) Tianjin University(天津大学)

专题命中 个性化与一致性 :generative vision(abstract);分类 cs.CV

AI总结 针对遥感视觉-语言模型缺乏红外数据的问题,提出首个大规模RGB-红外-文本数据集FusionRS,通过翻译RGB图像为红外风格并配以红外感知描述,训练双模态基础模型,提升RGB-红外对齐和双模态字幕生成性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.26976 2026-08-03 cs.CR cs.CV 版本更新 57%

InkShield: Writing Style Protection Against Unauthorized Handwriting Mimicry

InkShield:抵御未授权笔迹模仿的书写风格保护

Jian Xiong, Wenbo Jiang, Zihan Wang, Rui Zhang, Wenshu Fan, Hongwei Li, Guowen Xu

专题命中 个性化与一致性 :image editing(abstract);分类 cs.CV

AI总结 InkShield是一种主动书写风格防御方案,通过限制扰动在墨迹笔画边缘保护手写参考图像,可降低未授权笔迹模仿的检索率,且视觉质量与可读性良好。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.27348 2026-07-31 cs.CV 新提交 57%

Bunraku: Turning a Single Illustration into an Editable Live2D Character

Bunraku:将单张插图转换为可编辑的Live2D角色

Junhao Chen, Jingjia Mao, Dayong Li, Chenghai Li, Saining Zhang, Zhihao Li, Hao Zhao, Yufei Wang, Ruqi Huang

机构 * Tsinghua University(清华大学) Nanyang Technological University(南洋理工大学) SparcAI Inc.(SparcAI公司)

专题命中 个性化与一致性 :diffusion(abstract);分类 cs.CV

AI总结 本文提出Bunraku系统,可从单张插图端到端生成可编辑Live2D角色,构建分层扩散与联合位移预测方法,发布首个相关基准Live2D-Bench及8884模型语料库,解决了Live2D模型手动构建效率低的问题。

Comments Project page: https://bunraku-live2d.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.07861 2026-07-31 cs.CV 版本更新 57%

From Synthetic to Real: Toward Identity-Consistent Makeup Transfer with Synthetic and Real Data

从合成到真实:迈向身份一致的化妆转移的合成与真实数据

Yue Yu, Jiayu Wang, Jiajia Shi, Zhiyu Tan, Hao Li, Jingjing Chen

机构 * College of Computer Science and Artificial Intelligence, Fudan University(复旦大学计算机科学与人工智能学院) Institute of Trustworthy Embodied AI, Fudan University(复旦大学可信具身人工智能研究院)

专题命中 个性化与一致性 :diffusion(abstract);分类 cs.CV

AI总结 本文提出ConsistentBeauty和RealBeauty方法,通过合成数据筛选和强化学习提升化妆转移的逼真度与身份一致性,并建立多样化基准测试以评估模型在复杂真实场景中的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.13349 2026-07-31 cs.CV cs.AI 版本更新 57%

ID-Guard: A Universal Framework for Combating Facial Manipulation via Breaking Identification

ID-Guard:一种通过破坏身份特征来对抗面部操纵的通用框架

Zuomin Qu, Wei Lu, Xiangyang Luo, Qian Wang, Xiaochun Cao

专题命中 个性化与一致性 :inpainting(abstract);分类 cs.CV

AI总结 本研究针对面部操纵滥用的问题,提出ID-Guard通用框架,通过身份破坏模块生成跨模型可迁移扰动,可防御多种操纵模型并集成到其他任务中。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.26304 2026-07-30 cs.CV 新提交 57%

MoSAIC: Aligned Intervention Supervision for Part-Local Motion Style Transfer

MoSAIC:用于局部部位动作迁移的对齐干预监督

Nazanin Amini, Kevin Desai

机构 * The University of Texas at San Antonio(德克萨斯大学圣安东尼奥分校)

专题命中 个性化与一致性 :diffusion(abstract);分类 cs.CV

AI总结 MoSAIC是一种局部部位参考条件动作风格迁移的潜在扩散框架,通过对齐干预监督优化响应与保留的权衡,在评估中降低了误差并提升了选中区域响应与路由影响浓度。

Comments 23 pages, 6 figures, 11 tables. Project page: https://utsa-virlab.github.io/MoSAIC/

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.25842 2026-07-29 cs.CV cs.CR 新提交 57%

Adversarial Deepfake Generation and an Investigation of Purification-Based Adversarial Detection

对抗性深度伪造生成与基于净化的对抗性检测研究

Junghyun Kim, Seunghyun Kim, Jiyoung Woo

机构 * Soonchunhyang University(顺天乡大学)

专题命中 个性化与一致性 :image generation(abstract);分类 cs.CV

AI总结 该研究参与ImageCLEF 2026深度伪造检测与生成任务,图像生成采用FLUX.1-dev等方法,检测用SigLIP+DINOv2等组合。还自主研究基于净化的对抗性检测,发现特定信号可有效区分对抗与干净输入,反驳相关假设并揭示质量悬崖。

Comments Accepted at CLEF 2026, ImageCLEF-Deepfake task. Published in CEUR-WS CLEF 2026 Working Notes

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.23023 2026-07-29 cs.CV 版本更新 57%

OmniMate: Open-Ended Real-Time Streaming Audio-Visual Generation for Interactive Avatars

OmniMate:用于交互式虚拟化身的开放式实时流视听生成

Quanyue Song, Yishan He, Yanbo Ding, Zhixiang He, Yongxiang Li, Caigui Jiang, Zhi Zhi Guo

机构 * China Telecom Artificial Intelligence Technology (Beijing) Co., Ltd.(中国电信人工智能技术(北京)有限公司)

专题命中 个性化与一致性 :diffusion(abstract);分类 cs.CV

AI总结 研究针对实时交互式流中生成范围未知和跨模态身份一致性退化的挑战,提出OmniMate框架,通过生成进度控制器和多参考条件模块,实现高质量、低延迟的开放式实时交互式视听虚拟化身生成及长期跨模态身份一致性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.20233 2026-07-29 cs.CV 版本更新 57%

Cinematic Compositing Using Character-Environment-Harmonized Video Generation Models

使用角色-环境协调视频生成模型的电影级合成

Tianyi Xiang, Mingming He, Li Ma, Jing Liao

机构 * City University of Hong Kong(香港城市大学) Independent Researcher(独立研究员)

专题命中 个性化与一致性 :diffusion(abstract);分类 cs.CV

AI总结 提出端到端视频扩散框架,通过三掩码引导和RGB-D联合去噪建模角色与环境的双向物理与光照交互,实现高质量动态视频合成。

Comments Project Page: https://cehcomposition.github.io/demo/

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.21694 2026-07-27 cs.CV 新提交 57%

Oxygen-TryOn: Fashion-Native Foundation Model for Any-item Virtual Try-On

Oxygen-TryOn:用于任意物品虚拟试穿的时尚原生基础模型

Yong Liu, Xiaolong Fu, Zihang Xu, Wen Xue, Xueheng Li, Lin Song, Yuan Zhang, Chuyang Zhao, Haoyang Huang, Nan Duan, Yipeng Sun, Yan Li, Simiu Gu

机构 * Oxygen AIGC Group(氧气AIGC集团) Joy Future Academy(京东探索研究院)

专题命中 个性化与一致性 :inpainting(abstract);分类 cs.CV

AI总结 研究提出时尚原生的Oxygen-TryOn基础模型,用于任意物品虚拟试穿。通过专用数据引擎和特定训练构建,重新定义试穿任务,设计三阶段训练方法,在单物品和多物品试穿中取得先进成果,超越多个系统。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.21434 2026-07-24 cs.CV cs.AI 新提交 57%

Adaptive Identity Anchoring: Closed-Loop Keyframe Placement for Synthetic Paired Supervision in Video Face Swapping

自适应身份锚定:用于视频人脸交换中合成配对监督的闭环关键帧放置

Logan Robbins

专题命中 个性化与一致性 :diffusion(abstract);分类 cs.CV

AI总结 研究视频人脸交换缺乏自然配对监督问题,提出自适应身份锚定(AIA)方法,通过闭环反馈放置锚定并结合现实参考纹理恢复,还给出可证伪实验,有望解决合成身份漂移及过度平滑皮肤问题。

详情

展开后加载摘要…

URL PDF HTML 收藏