arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

图像生成

图像生成、文生图、图像编辑、扩散模型和可控生成。

2026-07-30 至 2026-07-30 共收录 3 信号源:cs.CV, cs.GR, cs.MM

1. 个性化与一致性 3 篇

2607.26742 2026-07-30 eess.AS cs.AI cs.SD 新提交 82%

Zero-Shot Face-to-Speech Synthesis via Latent Space Adaptation of a Style-Diffusion TTS Model

基于Style-Diffusion TTS模型潜在空间适配的零样本人脸到语音合成

Carlos Muñoz-Romero, Jose A. Gonzalez-Lopez

专题命中 个性化与一致性 :diffusion(title,title_cn)

AI总结 该研究提出基于StyleTTS 2的人脸到语音合成框架,通过人脸适配器实现静态人脸到语音的零样本生成,在LRS3数据集上验证了效果,且映射具有语言无关性。

Comments 5 pages, 1 figure, 5 tables, submitted to IberSPEECH 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.26304 2026-07-30 cs.CV 新提交 57%

MoSAIC: Aligned Intervention Supervision for Part-Local Motion Style Transfer

MoSAIC:用于局部部位动作迁移的对齐干预监督

Nazanin Amini, Kevin Desai

机构 * The University of Texas at San Antonio(德克萨斯大学圣安东尼奥分校)

专题命中 个性化与一致性 :diffusion(abstract);分类 cs.CV

AI总结 MoSAIC是一种局部部位参考条件动作风格迁移的潜在扩散框架,通过对齐干预监督优化响应与保留的权衡,在评估中降低了误差并提升了选中区域响应与路由影响浓度。

Comments 23 pages, 6 figures, 11 tables. Project page: https://utsa-virlab.github.io/MoSAIC/

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.02240 2026-07-30 cond-mat.mtrl-sci physics.app-ph 50%

Improving atomic force microscopy structure discovery via style-translation

Jie Huang, Niko Oinonen, Fabio Priante, Filippo Federici Canova, Lauri Kurki, Chen Xu, Adam S. Foster

专题命中 个性化与一致性 :image generation(abstract)

Comments 14 pages, 7 figures

Journal ref npj Computational Materials (2026)

详情

展开后加载摘要…

URL PDF HTML 收藏