Shopping Reasoning Bench: An Expert-Authored Benchmark for Multi-Turn Conversational Shopping Assistants
购物推理基准:面向多轮对话购物助手的专家编写基准
机构 * Amazon(亚马逊)
专题命中 代码评测 :code generation(abstract);分类 cs.CL、cs.LG
AI总结 提出一个由零售专家编写的525个任务的多轮对话购物推理基准,包含10863个加权评分标准,评估9个模型显示通过率仅57-77%,多轮任务性能下降4-18分。