arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

图像生成

图像生成、文生图、图像编辑、扩散模型和可控生成。

2026-06-26 至 2026-06-26 共收录 2 信号源:cs.CV, cs.GR, cs.MM

1. 个性化与一致性 2 篇

2606.26171 2026-06-26 cs.CV cs.AI 新提交 85%

LCG: Long-Context Consistent Image Generation with Sparse Relational Attention

LCG: 基于稀疏关系注意力的一致长上下文图像生成

Zihao Wang, Yijia Xu, Haoze Zheng, Xuran Ma, Haokun Gui, Harry Yang

机构 * Huazhong University of Science and Technology(华中科技大学) Peking University(北京大学) Hong Kong University of Science and Technology(香港科技大学)

专题命中 个性化与一致性 :image generation(title,abstract);text-to-image(abstract);image synthesis(abstract);分类 cs.CV

AI总结 提出LCG框架,利用稀疏关系注意力(SRA)和路由一致性约束(RCC),在长序列图像生成中保持语义和外观一致性,并构建了大规模数据集LCCD进行训练和评估。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.26618 2026-06-26 cs.CL 新提交 50%

Closing the Quality Gap in Low-Resource Text-to-Speech: LoRA Fine-Tuning of VoxCPM2 for Khmer and Korean

缩小低资源文本转语音的质量差距:针对高棉语和韩语的VoxCPM2 LoRA微调

Phannet Pov, Sovandara Chhoun, Hyun Woo Park, Wan-Sup Cho, Saksonita Khoeurn

机构 * Department of Big Data, Chungbuk National University(Chungbuk National University大数据系) Institute of Digital Research and Innovation, Cambodia Academy of Digital Technology(柬埔寨数字技术研究院) Department of Management Information Systems, Chungbuk National University(Chungbuk National University管理信息系) BigData Labs Co., Ltd.(BigData Labs公司)

专题命中 个性化与一致性 :diffusion(abstract)

AI总结 针对高棉语和韩语,使用LoRA微调VoxCPM2模型,在仅训练0.19%-3.03%参数的情况下,高棉语MOS从3.85提升至4.23,而韩语无提升,表明适配主要帮助基础模型表现差的语言。

Comments 5 pages, 1 figure, 4 tables. IEEE conference format (IEEEtran)

详情

展开后加载摘要…

URL PDF HTML 收藏