EPO: Explicit Policy Optimization for Strategic Reasoning in LLMs via Reinforcement Learning
机构 * University of Chinese Academy of Sciences(中国科学院大学) ; Tongyi Lab(通义实验室) ; The Key Laboratory of Cognition and Decision Intelligence for Complex Systems, Institute of Automation, Chinese Academy of Sciences(复杂系统认知与决策智能重点实验室,中国科学院自动化研究所)
专题命中 模仿学习与强化学习 :navigation(abstract)
Comments ACL2025 main