$π$-Bench: Evaluating Proactive Personal Assistant Agents in Long-Horizon Workflows
$π$-Bench:评估长周期工作流中主动型个人助理代理
机构 * Shanghai Jiao Tong University(上海交通大学) ; Shanghai AI Laboratory(上海人工智能实验室) ; Fudan University(复旦大学) ; University of Science and Technology of China(中国科学技术大学) ; Peking University(北京大学) ; Nanjing University(南京大学) ; Zhejiang University(浙江大学) ; Tongji University(同济大学) ; Soochow University(苏州大学) ; The Chinese University of Hong Kong(香港中文大学)
AI总结 本文提出$π$-Bench基准,用于评估个人助理代理在长周期工作流中的主动协助能力,通过100个多轮任务和5种特定领域用户角色,验证代理在未明确表达意图前识别和执行隐藏意图的能力,揭示主动协助的挑战及前期交互对后续任务的重要性。
Comments 44 pages