Sycophancy Claims about Language Models: The Missing Human-in-the-Loop
语言模型中的趋炎附势主张:缺失的人工智能循环
机构 * Weizenbaum Institute(韦岑鲍姆研究所) ; Technical University Berlin(柏林技术大学) ; Technical University Munich(慕尼黑技术大学)
专题命中 安全评测 :alignment(abstract,comments);分类 cs.CL、cs.CY
AI总结 本文探讨了大型语言模型中趋炎附势现象的测量挑战,提出五个核心操作化定义,并指出当前研究缺乏对人类感知的评估,为未来研究提供建议。
Comments NeurIPS 2025 Workshop on LLM Evaluation and ICLR 2025 Workshop on Bi-Directional Human-AI Alignment