A Multi-Perspective Benchmark and Moderation Model for Evaluating Safety and Adversarial Robustness
一种多视角基准和评估模型用于评估安全性和对抗鲁棒性
Naseem Machlovi, Maryam Saleki, Ruhul Amin, Mohamed Rahouti, Shawqi Al-Maliki, Junaid Qadir, Mohamed M. Abdallah, Ala Al-Fuqaha
机构
*
Department of Computer and Information Science, Fordham University(福德汉大学计算机与信息科学系)
;
College of Science and Engineering, Hamad Bin Khalifa University(哈马德·本·卡西姆大学科学与工程学院)
;
Department of Computer Science and Engineering, Qatar University(卡塔尔大学计算机科学与工程系)
Building Trust in Mental Health Chatbots: Safety Metrics and LLM-Based Evaluation Tools
Jung In Park, Mahyar Abbasian, Iman Azimi, Dawn T. Bounds, Angela Jun, Jaesu Han, Robert M. McCarron, Jessica Borelli, Parmida Safavi, Sanaz Mirbaha, Jia Li, Mona Mahmoudi, Carmen Wiedenhoeft, Amir M. Rahmani