LLM-as-a-Tutor: Policy-Aware Prompt Adaptation for Non-Verifiable RL
大语言模型作为导师:不可验证强化学习中的策略感知提示适应
机构 * KAIST(韩国科学技术院) ; Upstage ; University of Toronto(多伦多大学) ; Carnegie Mellon University(卡内基梅隆大学) ; NVIDIA(英伟达)
AI总结 针对不可验证强化学习中训练提示静态导致的问题,提出LLM-as-a-Tutor框架,让大语言模型从评判扩展为导师,通过对比策略展开检测无挑战性提示并添加约束,提升性能。