UXBench: Measuring the Actionability of LLM-Generated UX Critiques
UXBench: 衡量LLM生成的UX评论的可操作性
机构 * University of Notre Dame(诺丁汉大学) ; University of Pennsylvania(宾夕法尼亚大学) ; University of Rochester(罗切斯特大学) ; Carnegie Mellon University(卡内基梅隆大学) ; Massachusetts Institute of Technology(麻省理工学院) ; Harvard University(哈佛大学) ; LMU Munich(慕尼黑路德维希-马克西米利安大学)
AI总结 提出UXBench基准,通过下游修复代理能否基于评论改进界面来评估LLM作为UX评判者的可操作性,发现不同模型在报告可操作性、修复特征和可靠性上存在显著差异。
Comments 30 pages