Optimizing RAG Rerankers with LLM Feedback via Reinforcement Learning
通过强化学习优化RAG重排序器与LLM反馈
机构 * Nanjing University of Science and Technology(南京理工大学) ; Nanjing University(南京大学)
专题命中 检索器与排序 :RAG(title,title_cn);retrieval-augmented generation(abstract);分类 cs.IR、cs.CL、cs.AI
AI总结 本文提出RRPO框架,通过强化学习将重排序与LLM生成质量对齐,消除了对昂贵人工标注的依赖,实验显示其在知识密集型基准上优于基线模型。
Comments 17 pages