TR-ICRL: Test-Time Rethinking for In-Context Reinforcement Learning
TR-ICRL:基于上下文的强化学习中的测试时重新思考
机构 * The Hong Kong Polytechnic University(香港理工大学) ; Meituan(美团) ; Institute of Computing Technology, Chinese Academy of Sciences(中国科学院计算技术研究所) ; Xi’an Jiaotong University(西安交通大学) ; East China Normal University(华东师范大学) ; Northeastern University(东北大学)
AI总结 TR-ICRL通过在推理过程中重新思考来解决ICRL中的奖励估计问题,通过伪标签生成反馈,提升模型在推理和知识密集型任务中的性能。
Comments 14 pages, 7 figures