Multi-Path Collaborative Reasoning via Reinforcement Learning
基于强化学习的多路径协作推理
机构 * Sichuan University(四川大学) ; GigaAI ; Tsinghua University(清华大学)
专题命中 复杂问题求解 :reasoning(title,abstract);chain-of-thought(abstract);CoT(abstract);分类 cs.AI、cs.LG
AI总结 本文提出M3PO框架,通过多路径协作机制提升大语言模型的推理能力,实现更可靠和高效的多步推理。