When are LLMs Sufficient Policy Optimizers for Sequential RL Tasks?
何时LLMs足以作为序列RL任务的策略优化器?
机构 * Department of Computer Science, Stanford University(计算机科学系,斯坦福大学)
AI总结 提出PromptPO方法,利用LLM通过Python描述状态空间、动作空间和奖励函数,基于rollout反馈迭代生成和优化可执行策略,在多种环境中匹配或超越标准RL基线,但在细粒度连续控制任务中表现不足。