ToolVerse: Unlocking Massive Environments and Long-Horizon Tasks for Agentic Reinforcement Learning
ToolVerse:为智能强化学习解锁大规模环境和长时任务
机构 * LongCat Interaction Team, Meituan(美团长猫互动团队) ; Peking University(北京大学) ; Fudan University(复旦大学) ; Wuhan University(武汉大学)
AI总结 研究针对LLM智能体在复杂环境中工具集成问题,提出ToolVerse框架。通过构建大规模训练环境、设计任务策略及提出新算法,经实验验证该框架能增强LLM长时工具使用能力,提升性能与推理能力。