OPERA: Aligning Open-Ended Reasoning via Objective Perplexity-based Reinforcement Learning
OPERA: 通过基于客观困惑度的强化学习对齐开放式推理
机构 * The Hong Kong Polytechnic University(香港理工大学) ; Meituan Longcat Team(美团龙猫团队) ; Peking University(北京大学) ; Nanjing University of Science and Technology(南京理工大学)
AI总结 提出OPERA方法,利用困惑度动态作为内在奖励信号,结合冷启动数据合成和困惑度优先的推理轨迹选择,实现开放式任务中对齐,在Qwen3-8B上达到开源模型最优。
Comments 21 pages, 8 figures