arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

图像生成

图像生成、文生图、图像编辑、扩散模型和可控生成。

2026-05-22 至 2026-05-22 共收录 3 信号源:cs.CV, cs.GR, cs.MM

1. 个性化与一致性 3 篇

2605.22743 2026-05-22 cs.LG 75%

SeqLoRA: Bilevel Orthogonal Adaptation for Continual Multi-Concept Generation

SeqLoRA: 为持续多概念生成的双水平正则化适应

Javad Parsa, Enis Simsar, Amir Joudaki, Thomas Hofmann, André M. H. Teixeira

机构 * Uppsala University(乌普萨拉大学) ETH Zurich(苏黎世联邦理工学院) Sweden(瑞典)

专题命中 个性化与一致性 :image generation(abstract);text-to-image(abstract);diffusion(abstract)

AI总结 本文提出SeqLoRA,一种双水平优化框架,通过联合优化LoRA因素来解决文本到图像扩散模型中多自定义概念组合时的表示干扰问题,提高了身份保持性和可扩展性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.22448 2026-05-22 cs.AI 67%

S2ED: From Story to Executable Descriptions for Consistency-Aware Story Illustration

S2ED:从故事到可执行描述以实现一致性感知的故事插图

Sijing Yin, Jiamou Liu, Xiao Tang, Yaser Shakib, Qian Liu

机构 * University of Auckland(奥克兰大学) Wuhan College of Communication(武汉通信学院)

专题命中 个性化与一致性 :image generation(abstract);text-to-image(abstract)

AI总结 本文提出S2ED框架,通过将完整故事转换为可编辑的可执行描述,提升故事插图的一致性和角色真实性,适用于多帧故事插图的长时程一致性需求。

Comments 6 pages, 5 figures. Accepted by IEEE ICME 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.18094 2026-05-22 eess.AS cs.SD 50%

OneVoice: One Model, Triple Scenarios-Towards Unified Zero-shot Voice Conversion

OneVoice: 一个模型,三种场景——迈向统一的零样本语音转换

Zhichao Wang, Tao Li, Wenshuo Ge, Zihao Cui, Shilei Zhang, Junlan Feng

机构 * JIUTIAN Research(钧天研究院) China Mobile(中国移动) Beijing, China(北京,中国)

专题命中 个性化与一致性 :diffusion(abstract)

AI总结 本文提出OneVoice,一种能够统一处理语音转换三种场景(语音克隆、语言保护和歌唱)的零样本框架,通过混合专家机制和双路径路由机制实现统一建模,并采用两阶段训练策略解决数据不平衡问题。

详情

展开后加载摘要…

URL PDF HTML 收藏