CEI: A Benchmark for Evaluating Pragmatic Reasoning in Language Models
CEI:一种评估语言模型隐含推理能力的基准
机构 * Kenyon College(肯尼恩学院) ; US NIST AI Consortium(美国NIST人工智能联合体) ; Schmidt Science HAVI(施密特科学HAVI)
专题命中 推理评测 :reasoning(title,abstract);分类 cs.CL、cs.AI
AI总结 CEI基准通过300个经人类验证的场景评估语言模型在处理隐含意义复杂语句时的歧义消除能力,涵盖讽刺、混合信号等五种隐含子类型,采用三种权力配置进行测试。
Comments 38 pages, 10 figures