PolyFact: Comparing Consistency-Driven Post-training Methods for Cross-Lingual Factual Recall
通过一致性驱动的强化学习改进跨语言事实回忆
机构 * University College London(伦敦大学学院) ; Centre for Artificial Intelligence(人工智能中心)
专题命中 后训练与偏好优化 :post-training(title,abstract);SFT(abstract,abstract_cn);large language model(abstract);language model(abstract)
AI总结 提出PolyFact数据集,利用GRPO强化学习方法提升大语言模型的跨语言事实回忆一致性,优于监督微调,并揭示其通过减少语言专用表示实现跨语言共享的机制。
Comments Under Review at EACL 2026