Uncertainty-Aware LLM-Guided Policy Shaping for Sparse-Reward Reinforcement Learning
不确定性感知的LLM引导策略塑形用于稀疏奖励强化学习
机构 * USD AI Research Lab(USD人工智能研究实验室)
专题命中 后训练与偏好优化 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.LG
AI总结 提出ULPS框架,结合校准的大语言模型与不确定性估计,通过A*轨迹微调BERT模型提供动作建议,并用熵机制平衡LLM引导与PPO策略,在MiniGridUnlockPickup基准上显著提升成功率、奖励效率和样本复杂度。
Comments Accepted to the 2026 IEEE Conference on Artificial Intelligence (IEEE CAI). 6 pages, 3 figures. Code available at: https://github.com/USD-AI-ResearchLab/uncertainty-aware-llm-rl