MASPO: Unifying Gradient Utilization, Probability Mass, and Signal Reliability for Robust and Sample-Efficient LLM Reasoning
MASPO:统一梯度利用、概率质量与信号可靠性以实现鲁棒且样本高效的LLM推理
机构 * Meituan(美团) ; Fudan University(复旦大学) ; Tsinghua University(清华大学) ; University of Science and Technology of China(中国科学技术大学) ; Peking University(北京大学)
AI总结 MASPO通过统一框架解决RLVR方法中梯度利用低效、概率质量不敏感和信号可靠性不对称的问题,提升LLM推理的鲁棒性和样本效率。