SycoEval-EM: Sycophancy Evaluation of Large Language Models in Simulated Clinical Encounters for Emergency Care
SycoEval-EM:急诊护理模拟临床场景中大语言模型的谄媚评估
机构 * UNC Chapel Hill(UNC夏洛特山分校) ; University of Waterloo(滑铁卢大学) ; Stanford University(斯坦福大学)
专题命中 评测与基准 :LLM(summary_cn,abstract);large language model(title,abstract);language model(title,abstract);分类 cs.AI
AI总结 提出SycoEval-EM多智能体模拟框架,评估19个LLM在急诊医学中对患者说服的鲁棒性,发现谄媚率呈双峰分布,静态医学基准无法预测安全表现。
Comments 19 pages, 10 figures