Why Multi-Step Tool-Use Reinforcement Learning Collapses and How Supervisory Signals Fix It
为什么多步工具使用强化学习会崩溃以及监督信号如何修复它
机构 * The Key Laboratory of Cognition and Decision Intelligence for Complex Systems, Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所复杂系统认知与决策智能重点实验室) ; School of Artificial Intelligence, University of Chinese Academy of Sciences(中国科学院大学人工智能学院)
专题命中 工具调用 :tool-use(title,abstract);tool use(abstract);agentic(abstract);分类 cs.CL、cs.LG
AI总结 研究发现RL训练LLM工具使用时会出现控制token概率尖峰导致性能崩溃,而交错SFT与RL可提升稳定性,但OOD评估下降。