"LLM Agent Performance" Is Not a Single Evaluation Target
基于LLM的智能体评估统一框架的必要性
机构 * Beijing University of Posts and Telecommunications(北京邮电大学) ; University of Illinois Chicago(伊利诺伊大学芝加哥分校) ; Chongqing University of Posts and Telecommunications(重庆邮电大学)
专题命中 Agent评测 :agent(title,abstract);分类 cs.AI
AI总结 针对当前LLM智能体评估受系统提示、工具集和环境动态等混杂因素影响的问题,提出标准化统一评估框架以提升公平性和可复现性。