Stabilizing Off-Policy Training for Long-Horizon LLM Agent via Turn-Level Importance Sampling and Clipping-Triggered Normalization
通过回合级重要性采样和触发式归一化稳定长时程LLM代理的离策略训练
机构 * Texas A&M University(德克萨斯A&M大学) ; GE HealthCare(通用电气医疗) ; University of Minnesota(明尼苏达大学)
专题命中 规划决策 :agent(title,abstract);agentic(abstract);分类 cs.AI、cs.CL、cs.LG
AI总结 SORL通过回合级重要性采样和触发式归一化稳定长时程LLM代理的离策略训练,减少梯度方差并防止优化崩溃。