Mending the Holes: Mitigating Reward Hacking in Reinforcement Learning for Multilingual Translation
修补漏洞:在多语言翻译中缓解奖励黑客
机构 * Carnegie Mellon University(卡内基梅隆大学)
专题命中 后训练与偏好优化 :LLM(abstract);large language model(abstract);language model(abstract);post-training(abstract)
AI总结 本文提出WALAR方法,通过单语文本提升低资源语言翻译能力,同时保持高资源语言性能。通过词对齐和语言对齐技术缓解现有质量评估模型的漏洞,实验显示在Flores-101数据集上优于LLaMAX。
Comments Our code is available at https://github.com/LeiLiLab/WALAR