A Red Teaming Framework for Large Language Models: A Case Study on Faithfulness Evaluation
大型语言模型的红队框架:以忠实性评估为例
机构 * King Fahd University of Petroleum & Minerals(法赫德国王石油矿产大学) ; Imam Abdulrahman Bin Faisal University(伊玛目阿卜杜勒拉赫曼·本·费萨尔大学) ; SDAIA-KFUPM Joint Research Center for Artificial Intelligence(沙特数据与人工智能局-法赫德国王石油矿产大学人工智能联合研究中心)
专题命中 红队测试 :red teaming(title,abstract);safety(abstract);分类 cs.CL、cs.AI
AI总结 提出一种多角色红队框架,通过攻击者和陪审模型暴露LLM的不忠实问题,在问答任务中攻击成功率提升7.9%,并揭示结构约束和架构设计对安全性的影响。
Comments Preprint submitted to SQJ