$\textbf{Re}^{2}$: Unlocking LLM Reasoning via Reinforcement Learning with Re-solving
Re²:通过强化学习与重解解锁LLM推理
专题命中 测试时计算 :reasoning(title,abstract);chain-of-thought(abstract);CoT(abstract);test-time compute(abstract)
AI总结 Re²通过强化学习与重解方法,使LLM能够灵活放弃无效推理路径并重新开始,从而提升推理性能和测试效率。
Comments Accepted by ICLR 2026