Benchmarking LLM Judges for Mobile Agent Evaluation
面向移动智能体评估的LLM评判基准测试
机构 * Mila – Québec AI Institute(米拉-魁北克人工智能研究所) ; Concordia University(康考迪亚大学) ; University of Toronto(多伦多大学) ; Shanghai University(上海大学) ; McMaster University(麦克马斯特大学)
AI总结 该研究推出MobileJudgeBench基准,评估6种LLM评判器方法在移动智能体轨迹上的可靠性,发现简单基线评判器具竞争力、基准质量指标可预测评判器效用,且不同LLM后端故障特征相反。