MirrorBench: A Benchmark to Evaluate Conversational User-Proxy Agents for Human-Likeness
MirrorBench: 一个评估对话用户代理人类化能力的基准测试
机构 * SAP Labs(SAP实验室)
AI总结 本文提出MirrorBench基准测试,用于评估对话用户代理的人类化能力,通过结合多种词汇多样性指标和LLM评估指标,揭示用户代理与真实人类用户之间的系统性差距。
Comments KDD 2026 (Dataset & Benchmark Track)