R$^3$L: Reflect-then-Retry Reinforcement Learning with Language-Guided Exploration, Pivotal Credit, and Positive Amplification
R$^3$L: 反思-重试强化学习与语言引导探索、关键信用和正向放大
机构 * Tongyi Lab(通义实验室) ; Soochow University(苏州大学) ; Hong Kong University of Science and Technology(香港科技大学)
专题命中 规划决策 :agentic(abstract);分类 cs.AI、cs.LG
AI总结 提出R$^3$L框架,通过反思-重试机制合成高质量轨迹,结合关键信用分配和正向放大,解决强化学习在LLM推理和智能体任务中的探索与利用难题,在多个任务上取得5%到52%的相对提升。