Distributional Biases in Post-Training: A Markovian Analysis of Reasoning Trajectories
后训练中的分布偏差:推理轨迹的马尔可夫分析
机构 * City University of Hong Kong(香港城市大学) ; Center for Advanced Intelligence Project, RIKEN(RIKEN高级智能研究中心) ; The Institute of Statistical Mathematics(统计数学研究所) ; University of Sydney(悉尼大学) ; CFAR and IHPC, Agency for Science, Technology and Research (A*STAR)(A*STAR的CFAR和IHPC) ; Nanyang Technological University(南洋理工大学) ; The University of Tokyo(东京大学)
专题命中 其他推理 :CoT(summary_cn,abstract);reasoning(title,abstract);分类 cs.AI、cs.LG
AI总结 通过马尔可夫链模型分析后训练策略(如RLVR和ORM/PRM)如何强化高概率路径而遗忘稀有但关键的推理步骤,并证明探索策略(如拒绝简单实例和KL正则化)有助于保留稀有CoT。