Teaching LLM to be Persuasive: Reward-Enhanced Policy Optimization for Alignment from Heterogeneous Rewards
教LLM变得有说服力:来自异质奖励的强化学习后训练政策优化
机构 * Fliggy Alibaba(飞猪阿里)
专题命中 后训练与偏好优化 :LLM(title,title_cn);large language model(abstract);language model(abstract);post-training(abstract)
AI总结 本文提出REPO方法,通过结合偏好训练奖励模型、LLM作为判断者和规则奖励函数,提升在线旅行社的价格谈判对话质量,实验显示在对话评分、优秀回应比例和坏案例修复率上均有显著提升。
Comments accepted by ACL 2026 indusry track