Can LLMs Guide Their Own Exploration? Gradient-Guided Reinforcement Learning for LLM Reasoning
大语言模型能否引导自身探索?基于梯度引导的强化学习用于大语言模型推理
机构 * Tencent AI Lab(腾讯AI实验室) ; University of Notre Dame(诺丁汉大学)
专题命中 数学推理 :reasoning(title,abstract);分类 cs.AI、cs.LG
AI总结 G2RL通过利用模型自身的梯度几何特性,改进大语言模型的推理能力,优于传统探索方法。