HAS-Bench: Evaluating LLM-Based Human-Agent Systems under Configurable Human Participation
HAS-Bench:在可配置人类参与下评估基于大语言模型的人机系统
机构 * The University of Tokyo(东京大学) ; University of Illinois Chicago(伊利诺伊大学芝加哥分校) ; MBZUAI ; McGill University(麦吉尔大学) ; Zhejiang University(浙江大学)
专题命中 Agent评测 :agent(title,abstract);分类 cs.AI
AI总结 介绍基于图的HAS-Framework框架,在此基础上HAS-Bench在多方面可配置人类参与下评估人机系统,测量任务结果与协作行为,实验表明人类参与可提升任务完成等,但收益取决于参与方式等。