STRIVE: Probing Reasoning Limits in Graded Plausibility Generation and Evaluation
STRIVE:探究分级合理性生成与评估中的推理极限
机构 * University of Pittsburgh(匹兹堡大学) ; University of Wisconsin–Madison(威斯康星大学麦迪逊分校)
AI总结 STRIVE是基于LLM的框架,可联合生成评估跨越合理性类别与难度的受控事件集,实验中其优化后高质量事件集生成率达75.0%,为心理语言学研究减少手动工作量。
Comments Under Review