Listwise Policy Optimization: Group-based RLVR as Target-Projection on the LLM Response Simplex
列表式策略优化:基于组的RLVR作为LLM响应单纯形上的目标投影
机构 * Department of Automation, Tsinghua University(清华大学自动化系) ; LLM Department, Tencent(腾讯LLM部门)
专题命中 其他推理 :reasoning(abstract);分类 cs.AI、cs.LG
AI总结 本文提出列表式策略优化(LPO),通过显式执行目标投影来解构隐式目标,利用响应单纯形限制近端RL目标,并通过精确散度最小化进行策略投影,从而在多样推理任务和LLM基础上提升训练性能,同时保持优化稳定性和响应多样性。