ManagerBench: Evaluating the Safety-Pragmatism Trade-off in Autonomous LLMs
ManagerBench: 评估自主大语言模型中的安全与务实之间的权衡
机构 * Technion – Israel Institute of Technology(技术学院–以色列理工学院) ; Google Research(谷歌研究) ; University of Zagreb(Zagreb大学) ; Kempner Institute, Harvard University(哈佛大学凯普勒研究所)
专题命中 安全评测 :safety(title,abstract);alignment(abstract);分类 cs.CL
AI总结 ManagerBench评估自主大语言模型在安全与务实权衡中的表现,揭示模型在冲突目标下的决策缺陷。