Beyond the Leaderboard: A Synthesis of Tool-Use, Planning, and Reasoning Failures in Large Language Model Agents
超越排行榜:大语言模型智能体中工具使用、规划和推理失败的综合分析
机构 * University of Oxford(牛津大学)
专题命中 规划推理 :reasoning(title,abstract);planning(title,abstract);分类 cs.AI
AI总结 本文综合多篇论文形成大语言模型智能体局限性交叉分类法,识别出六个失败集群,通过迭代分组得出分类法,发现失败与任务长度非线性相关,单个子任务性能不能保证端到端成功,额外脚手架效果不佳,同时在部分任务上有进展。
Comments 16 pages, 3 tables, 1 figure