Beyond Averages: Evaluating LLMs on Human Survey Replication at the Distributional Level
超越平均值:在分布层面评估LLM对人类调查的复现能力
机构 * Ewha Womans University(梨花女子大学)
专题命中 安全评测 :alignment(abstract);分类 cs.CL
AI总结 本研究通过非公开的韩国方便面购买实验,在分布层面评估LLM复现人类调查响应的能力,发现均值匹配的模型可能产生更偏离人类的分布,且结构化角色和多模态输入提升对齐度,而推理提示则降低。