arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

图像生成

图像生成、文生图、图像编辑、扩散模型和可控生成。

2026-04-21 至 2026-04-21 共收录 5 信号源:cs.CV, cs.GR, cs.MM

1. 个性化与一致性 5 篇

2604.08364 2026-04-21 cs.CV 79%

MegaStyle: Constructing Diverse and Scalable Style Dataset via Consistent Text-to-Image Style Mapping

MegaStyle: 通过一致的文本到图像风格映射构建多样化和可扩展的风格数据集

Junyao Gao, Sibo Liu, Jiaxing Li, Yanan Sun, Yuanpeng Tu, Fei Shen, Weidong Zhang, Cairong Zhao, Jun Zhang

机构 * Tencent(腾讯) Nanyang Technological University(南洋理工大学) Hong Kong University of Science and Technology(香港科技大学) Fuzhou University(福州大学) University of Hong Kong(香港大学) National University of Singapore(新加坡国立大学)

专题命中 个性化与一致性 :text-to-image(title,abstract);分类 cs.CV

AI总结 本文提出MegaStyle数据集,通过现有大生成模型的一致文本到图像风格映射能力,构建了包含170k风格提示和400k内容提示的多样化数据集,并提出风格监督对比学习方法和FLUX风格迁移模型。

Comments project website https://jeoyal.github.io/MegaStyle/

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.18537 2026-04-21 cs.CV 77%

MetaCloak-JPEG: JPEG-Robust Adversarial Perturbation for Preventing Unauthorized DreamBooth-Based Deepfake Generation

MetaCloak-JPEG:用于防止未经授权的基于DreamBooth的深度伪造生成的JPEG鲁棒对抗扰动

Tanjim Rahaman Fardin, S M Zunaid Alam, Mahadi Hasan Fahim, Md Faysal Mahfuz

机构 * Computer Science and Engineering(计算机科学与工程)

专题命中 个性化与一致性 :text-to-image(abstract);diffusion(abstract);image synthesis(abstract);分类 cs.CV

AI总结 针对DreamBooth驱动的文本到图像合成,提出MetaCloak-JPEG,通过在JPEG压缩管道中引入可微JPEG层,提升对抗扰动效果,实现高PSNR和高JPEG生存率。

Comments 8 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.18575 2026-04-21 cs.CV 61%

ReCap: Lightweight Referential Grounding for Coherent Story Visualization

ReCap:轻量级指代 grounding 以实现连贯故事可视化

Aditya Arora, Akshita Gupta, Pau Rodriguez, Marcus Rohrbach

机构 * 1 Technical University of Darmstadt \& hessian.AI, Germany -2em

专题命中 个性化与一致性 :diffusion(abstract,comments);分类 cs.CV

AI总结 ReCap 提出一种轻量级框架,通过视觉锚点提升角色稳定性与视觉一致性,无需修改基础扩散模型,在两个故事可视化基准上取得新高。

Comments Diffusion Models, Story Visualization

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.00296 2026-04-21 cs.CV 57%

TimeColor: Flexible Reference Colorization via Temporal Concatenation

TimeColor:通过时间拼接实现灵活的参考着色

Bryan Constantine Sadihin, Yihao Meng, Michael Hua Wang, Matteo Jiahao Chen, Hang Su

机构 * Computer Science and Technology(计算机科学与技术) Tsinghua University(清华大学)

专题命中 个性化与一致性 :diffusion(abstract);分类 cs.CV

AI总结 TimeColor通过时间拼接技术实现灵活的参考着色,利用显式每参考区域分配支持异构、可变数量的参考,提高颜色保真度、身份一致性和时间稳定性。

Comments Our project page is available at https://bconstantine.github.io/TimeColor/

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.16958 2026-04-21 cs.CV 57%

Self-Reasoning Agentic Framework for Narrative Product Grid-Collage Generation

具有自我推理代理机制的叙事产品网格-拼贴生成框架

Minyan Luo, Yuxin Zhang, Yifei Li, Xincan Wang, Fuzhang Wu, Tong-Yee Lee, Oliver Deussen, Weiming Dong

机构 * MAIS,Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所马克思主义学院) Tsinghua University(清华大学) Shanghai Theatre Academy(上海戏剧学院) Institute of Software, Chinese Academy of Sciences(中国科学院软件研究所) National Cheng Kung University(国立成功大学) University of Konstanz(康斯坦茨大学)

专题命中 个性化与一致性 :image generation(abstract);分类 cs.CV

AI总结 本文提出一种自我推理代理框架,用于生成叙事产品网格拼贴,通过构建产品叙事框架和约束-aware提示,提升视觉一致性和叙事丰富度。

详情

展开后加载摘要…

URL PDF HTML 收藏