Hista and Numca: Estimate State Value Effectively for LLM Reinforcement Learning
Hista 和 Numca:为 LLM 强化学习有效估计状态值
机构 * Department of Computer Science and Engineering, The Chinese University of Hong Kong(香港中文大学计算机科学与工程系) ; Huawei Technologies Ltd(华为技术有限公司)
专题命中 后训练与偏好优化 :LLM(title,title_cn);large language model(abstract);language model(abstract);post-training(abstract)
AI总结 针对 LLM 强化学习中状态值估计不准确的问题,提出 Numca(利用数值跨度作为可分级里程碑)和 Hista(利用隐藏状态加权平均不连续轨迹及其回报)两种方法,显著提升估计精度和训练性能。
Comments Accepted at ICML 2026