arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

图像生成

图像生成、文生图、图像编辑、扩散模型和可控生成。

2026-05-19 至 2026-05-19 共收录 6 信号源:cs.CV, cs.GR, cs.MM

1. 个性化与一致性 6 篇

2605.17312 2026-05-19 cs.CV 79%

VISTA: Triplet-Supervised Video Style Transfer with Diffusion Transformers

VISTA: 基于扩散变换器的三元组监督视频风格迁移

Yiren Song, Wangzi Yao, Haofan Wang, Mike Zheng Shou

机构 * Show Lab, National University of Singapore(新加坡国立大学Show实验室) Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) Lovart AI(Lovart人工智能)

专题命中 个性化与一致性 :diffusion(title,abstract);分类 cs.CV

AI总结 本文提出VISTA方法,通过引入大规模三元组数据和基于扩散变换器的框架,解决视频风格迁移中风格、内容和运动的联合建模与解耦问题,实现了高质量的风格迁移效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.17309 2026-05-19 cs.CV cs.AI 79%

StyleText: A Large-Scale Dataset and Benchmark for Stylized Scene Text Inpainting

StyleText: 一个大规模数据集和基准,用于具有风格保留的场景文本修复

Aleksandr Simonyan, Nipun Jindal

机构 * Adobe Inc.(Adobe公司)

专题命中 个性化与一致性 :inpainting(title,abstract);分类 cs.CV

AI总结 本文提出StyleText,一个用于具有风格保留的场景文本修复的大规模数据集和基准,通过控制评估文本可读性和视觉一致性,利用共享场景上下文。

Comments Accepted at the SynData4CV Workshop, CVPR 2026. 8 pages + 1 page of references, 5 figures, 4 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.00607 2026-05-19 cs.CV cs.AI 70%

IdGlow: Dynamic Identity Modulation for Multi-Subject Generation

IdGlow: 多主体生成中的动态身份调节

Honghao Cai, Xiangyuan Wang, Jing Li, Yunhao Bai, Tianze Zhou, Haohua Chen, Chao Hui, Changhao Qiao, Runqi Wang, Sijie Xu, Yuyang Hao, Zezhou Cui, Yuyuan Yang, Wei Zhu, Yibo Chen, Xu Tang, Yao Hu, Zhen Li

机构 * Xiaohongshu Inc.(小红书公司) The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳)) Peking University(北京大学) Tsinghua University(清华大学)

专题命中 个性化与一致性 :image generation(abstract);diffusion(abstract);分类 cs.CV

AI总结 本文提出IdGlow框架,通过任务自适应的时间步调度和视觉语言模型解决多主体生成中的稳定性与可塑性矛盾,提升面部真实感与商业级美学质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.18365 2026-05-19 cs.CV 57%

GeoFlow: Enforcing Implicit Geometric Consistency in Video Generation

GeoFlow: 在视频生成中强制隐式几何一致性

Jan Ackermann, Shengqu Cai, Boyang Deng, Zhengfei Kuang, Songyou Peng, Gordon Wetzstein

机构 * Stanford University(斯坦福大学) Google DeepMind(谷歌DeepMind)

专题命中 个性化与一致性 :diffusion(abstract);分类 cs.CV

AI总结 本文提出GeoFlow,一种通过强化学习微调来增强视频生成中几何一致性的方法,通过引入几何一致性奖励,有效减少时间上的几何伪影,同时保持感知质量。

Comments Project Page: https://geometryflow.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.16406 2026-05-19 cs.CV 57%

Contrastive-SDXL: Annotation-Preserving Night-Time Augmentation for Pedestrian Detection

对比-SDXL:保留标注的夜间增强用于行人检测

Franky George, Muhammad Khalid, Adil Khan

专题命中 个性化与一致性 :diffusion(abstract);分类 cs.CV

AI总结 本文提出Contrastive-SDXL框架,利用SDXL-Turbo和LoRA微调,通过语义对比损失和对象一致性损失生成逼真夜间图像,提升行人检测性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.17827 2026-05-19 cs.LG cs.AI 50%

Content-Style Identification via Differential Independence

通过微分独立性进行内容-风格识别

Subash Timilsina, Hoang-Son Nguyen, Sagar Shrestha, Xiao Fu

机构 * School of Electrical Engineering and Computer Science, Oregon State University, Corvallis, Oregon, USA(电气工程与计算机科学学院,俄勒冈州立大学,科瓦利斯,俄勒冈,美国)

专题命中 个性化与一致性 :image generation(abstract)

AI总结 本文提出了一种新的结构条件,即内容-风格微分独立性(CSDI),用于在内容和风格可能依赖的情况下实现生成分析中的可识别性,通过在雅可比子空间上施加块状正交约束,并设计了基于数值雅可比近似的随机正则化器以支持高维生成模型。

Comments 24 pages, 15 figures, ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏