Beyond Correctness: Rewarding Faithful Reasoning in Retrieval-Augmented Generation
超越正确性:在检索增强生成中奖励忠实推理
机构 * AWS AI Fundamental Research(AWS人工智能基础研究) ; The Pennsylvania State University(宾夕法尼亚州立大学) ; Yale University(耶鲁大学)
专题命中 规划决策 :agentic(abstract);分类 cs.CL
AI总结 本文提出VERITAS框架,通过细粒度轮次级忠实性奖励强化学习,提升检索增强生成中推理步骤的忠实性,同时改善任务性能。
Comments TMLR Camera Ready Update