The Scales of Justitia: A Comprehensive Survey on Safety Evaluation of LLMs
正义的尺度:关于大语言模型安全评估的全面调查
机构 * Beijing University of Posts and Telecommunications(北京邮电大学) ; Jinan University(暨南大学) ; Beihang University(北京航空航天大学) ; China Academy of Information and Communications Technology(中国信息通信研究院)
专题命中 安全评测 :safety(title,abstract);分类 cs.CL、cs.AI
AI总结 本文系统调研了大语言模型的安全评估现状,提出四维分类框架,分析评估原因、内容、场景及方法,指出当前挑战并提出研究方向,强调安全评估对可靠部署的重要性。
Comments 20 pages, preprint
Journal ref Information Fusion 136 (2026) 104579