Evaluating RL Explainability Methods by How Much They Help Fix Bugs in Agents
通过可解释强化学习(XRL)方法对修复智能体Bug的帮助程度来评估XRL方法
机构 * University of California, Berkeley(加州大学伯克利分校) ; Tufts University(塔夫茨大学) ; Carnegie Mellon University(卡内基梅隆大学)
AI总结 本文提出EvalXRL基准,通过大型语言模型编码智能体结合XRL方法诊断修复RL智能体故障的效果,实现对多种XRL方法的首次闭环直接对比评估。