Drop the Act: Probe-Filtered RL for Faithful Chain-of-Thought Reasoning
摒弃表演:用于忠实推理链的探针过滤强化学习
机构 * Intuit
专题命中 测试时计算 :reasoning(title,abstract);chain-of-thought(title,abstract);verifier(abstract);分类 cs.AI、cs.LG
AI总结 本文提出ProFIL方法,通过探针过滤强化学习减少推理链中的表演现象,提升推理链的忠实度并缩短链长,同时在多个领域和模型架构中验证了其有效性。