Benchmarking LLM Tool-Use in the Wild
在真实环境中评估大语言模型工具使用能力
机构 * Tencent(腾讯)
专题命中 工具调用 :tool-use(title,abstract);agentic(abstract);分类 cs.AI、cs.CL
AI总结 本文提出WildToolBench基准测试,通过评估57个LLM在真实用户行为下的表现,揭示LLM在工具使用中的鲁棒性不足,强调需重新考虑LLM、用户与工具之间的交互。
Comments accepted by ICLR 2026