HTPO: Towards Exploration-Exploitation Balanced Policy Optimization via Hierarchical Token-level Objective Control
HTPO: 通过分层令牌级目标控制实现探索-利用平衡的策略优化
机构 * School of Information Science and Electronic Engineering, Shanghai Jiao Tong University(上海交通大学信息科学与电子工程学院) ; Xiaohongshu Inc.(小红书公司) ; MoE Key Lab of Artificial Intelligence, AI Institute, Shanghai Jiao Tong University(上海交通大学人工智能研究院)
专题命中 测试时计算 :CoT(abstract,abstract_cn);reasoning(abstract);chain-of-thought(abstract);test-time compute(abstract)
AI总结 本文提出HTPO算法,通过分层划分响应令牌为功能组,设计专用优化目标以平衡探索与利用,实验验证其在推理基准上的优越性。
Comments 29 pages