Fluent Alignment with Disfluent Judges: Post-training for Lower-resource Languages
流畅对齐与不流畅评判:低资源语言的后训练方法
机构 * Language Technology Group, University of Oslo(奥斯陆大学语言技术组)
专题命中 后训练与偏好优化 :post-training(title,abstract);language model(abstract);preference optimization(abstract);分类 cs.CL、cs.AI
AI总结 本文提出一种低资源语言的后训练方法,通过不流畅评判模型保持语言模型的流畅性,通过挪威语案例研究验证了基于策略的训练方法在无需额外数据时的有效性。
Journal ref The Fourteenth International Conference on Learning Representations (ICLR 2026)