arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

图像生成

图像生成、文生图、图像编辑、扩散模型和可控生成。

2026-07-29 至 2026-07-29 共收录 7 信号源:cs.CV, cs.GR, cs.MM

1. 个性化与一致性 7 篇

2607.25622 2026-07-29 cs.CV 新提交 79%

Beyond Facial Consistency: Personalized Person Image Generation with Holistic Identity Preservation

超越面部一致性:具有整体身份保留的个性化人物图像生成

Yuxuan Xiao, Shanshan Zhang, Jian Yang, Shengcai Liao

机构 * Black Forest Labs(黑森林实验室)

专题命中 个性化与一致性 :image generation(title,abstract);分类 cs.CV

AI总结 研究个性化人物图像生成中面部保真度与外观一致性权衡问题,提出双分支基线及动态平衡缩放策略DBS,由自适应时间门控和区域感知优化组成,实验表明DBS比现有基线更好,为整体身份建模提供可控框架。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.25390 2026-07-29 cs.CV 新提交 79%

Noise-Free One-Step LoRA for Task-Driven Image Restoration with Diffusion Priors

基于扩散先验的无噪声单步LoRA用于任务驱动的图像恢复

Jaeha Kim, Kyoung Mu Lee

机构 * Seoul National University(首尔国立大学) IPAI, Seoul National University(首尔国立大学IPAI)

专题命中 个性化与一致性 :diffusion(title,abstract);分类 cs.CV

AI总结 研究针对退化图像影响下游任务的问题,提出基于扩散先验的无噪声单步LoRA方法用于任务驱动的图像恢复,通过特定适配模块及新训练策略,经实验验证该方法在多任务上优于先前方法且具泛化能力。

Comments Code: https://github.com/JaehaKim97/NOLA-IR

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.25750 2026-07-29 cs.LG cs.CY 新提交 78%

Detecting CSAM Text-to-Image LoRAs From Weights

从权重中检测用于生成儿童性虐待材料的文本到图像的LoRA

David Demitri Africa, Cate Heine, Nadine Staes-Polet, Kimberly Mai

专题命中 个性化与一致性 :text-to-image(title);image generation(abstract)

AI总结 研究如何从权重中检测用于生成CSAM的文本到图像的LoRA,利用LoRA更新的左上角奇异向量形成的指纹$u_1$,以人类主体年龄为代理,发现其能识别训练内容、跨模型泛化且对良性内容不判断,可直接从权重筛选有害LoRA。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.25962 2026-07-29 cs.CV 新提交 70%

LaP-Forensics: Latent-Pixel Consistency Guided Multimodal Reasoning for Deepfake Detection

LaP-Forensics:用于深度伪造检测的潜在像素一致性引导的多模态推理

Can Wang, Yuhao Wang, Yushe Cao, Canran Xiao, Fei Shen

机构 * The Hong Kong Polytechnic University(香港理工大学) University College London(伦敦大学学院) Tsinghua University(清华大学) Sun Yat-sen University(中山大学) National University of Singapore(新加坡国立大学)

专题命中 个性化与一致性 :diffusion(abstract,abstract_cn);分类 cs.CV

AI总结 研究针对深度伪造检测问题,提出LaP-Forensics多模态框架,利用基于重建的取证证据及结构化模型预测,经组相对策略优化,实现跨生成器检测和伪影定位,实验验证了残差流效用,但后处理下文本忠实性和可靠性有局限。

Comments Accepted at ACM Multimedia 2026 (ACM MM 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.25842 2026-07-29 cs.CV cs.CR 新提交 57%

Adversarial Deepfake Generation and an Investigation of Purification-Based Adversarial Detection

对抗性深度伪造生成与基于净化的对抗性检测研究

Junghyun Kim, Seunghyun Kim, Jiyoung Woo

机构 * Soonchunhyang University(顺天乡大学)

专题命中 个性化与一致性 :image generation(abstract);分类 cs.CV

AI总结 该研究参与ImageCLEF 2026深度伪造检测与生成任务,图像生成采用FLUX.1-dev等方法,检测用SigLIP+DINOv2等组合。还自主研究基于净化的对抗性检测,发现特定信号可有效区分对抗与干净输入,反驳相关假设并揭示质量悬崖。

Comments Accepted at CLEF 2026, ImageCLEF-Deepfake task. Published in CEUR-WS CLEF 2026 Working Notes

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.23023 2026-07-29 cs.CV 版本更新 57%

OmniMate: Open-Ended Real-Time Streaming Audio-Visual Generation for Interactive Avatars

OmniMate:用于交互式虚拟化身的开放式实时流视听生成

Quanyue Song, Yishan He, Yanbo Ding, Zhixiang He, Yongxiang Li, Caigui Jiang, Zhi Zhi Guo

机构 * China Telecom Artificial Intelligence Technology (Beijing) Co., Ltd.(中国电信人工智能技术(北京)有限公司)

专题命中 个性化与一致性 :diffusion(abstract);分类 cs.CV

AI总结 研究针对实时交互式流中生成范围未知和跨模态身份一致性退化的挑战,提出OmniMate框架,通过生成进度控制器和多参考条件模块,实现高质量、低延迟的开放式实时交互式视听虚拟化身生成及长期跨模态身份一致性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.20233 2026-07-29 cs.CV 版本更新 57%

Cinematic Compositing Using Character-Environment-Harmonized Video Generation Models

使用角色-环境协调视频生成模型的电影级合成

Tianyi Xiang, Mingming He, Li Ma, Jing Liao

机构 * City University of Hong Kong(香港城市大学) Independent Researcher(独立研究员)

专题命中 个性化与一致性 :diffusion(abstract);分类 cs.CV

AI总结 提出端到端视频扩散框架,通过三掩码引导和RGB-D联合去噪建模角色与环境的双向物理与光照交互,实现高质量动态视频合成。

Comments Project Page: https://cehcomposition.github.io/demo/

详情

展开后加载摘要…

URL PDF HTML 收藏