TruthRL: Incentivizing Truthful LLMs via Reinforcement Learning
TruthRL: 通过强化学习激励诚实的LLM
机构 * University of California, Berkeley(加州大学伯克利分校)
AI总结 提出TruthRL框架,使用GRPO和三值奖励直接优化LLM的诚实性,减少幻觉并允许不确定时弃权,在知识密集型基准上显著提升诚实性。
Comments ICML 2026. Code: https://github.com/facebookresearch/TruthRL