SPIEval: Evaluating Large Language Models as Mobile Assistants over Scattered Personal Information
SPIEval:评估大型语言模型作为处理分散个人信息的移动助手的能力
机构 * Fudan University(复旦大学) ; Tencent Hunyuan Team(腾讯混元团队)
AI总结 本研究推出基于五种认知能力的人工策划基准SPIEval,评估9种LLMs作为移动助手处理分散个人信息的能力,发现其准确率最高仅57.3%,存在信息定位等显著局限。