The Long-Horizon Task Mirage? Diagnosing Where and Why Agentic Systems Break
长远任务的幻觉?诊断代理系统何时及为何失效
机构 * University of Wisconsin–Madison(威斯康星大学麦迪逊分校) ; University of California, Berkeley(加州大学伯克利分校) ; Georgia Institute of Technology(佐治亚理工学院)
AI总结 本文通过HORIZON基准测试分析LLM代理在长周期任务中的失效模式,提出轨迹驱动的评估方法,并通过人类标注验证其有效性,为构建更可靠的代理系统提供指导。