A Hessian-Free Actor-Critic Algorithm for Bi-Level Reinforcement Learning with Applications to LLM Fine-Tuning
一种用于双层强化学习的无Hessian演员-评论员算法及其在大语言模型微调中的应用
机构 * JPMorgan AI Research(摩根大通AI研究) ; Johns Hopkins University Applied Physics Laboratory(约翰霍普金斯大学应用物理实验室)
AI总结 本文提出一种单循环一阶演员-评论员算法,用于解决双层优化问题,通过惩罚重述法优化双层目标,引入衰减熵正则化以实现无偏上层超梯度估计,且在特殊Polyak-Lojasiewicz条件下证明了有限时间与样本收敛性。