SciAgentGym: Benchmarking Multi-Step Scientific Tool-use in LLM Agents
SciAgentGym:LLM代理中多步科学工具使用的基准测试
机构 * Fudan NLP Group(复旦大学自然语言处理组)
专题命中 领域大模型 :LLM(title,title_cn);分类 cs.CL
AI总结 为解决当前基准忽视代理在科学工作流中编排工具能力的问题,提出包含1780个领域特定工具的可扩展交互环境SciAgentGym和分层评估套件SciAgentBench,并设计数据合成方法SciForge,通过微调使SciAgent-8B超越更大模型,展示科学工具使用能力的跨领域正迁移。