GUARD: Guideline Upholding Test through Adaptive Role-play and Jailbreak Diagnostics for LLMs
GUARD:通过自适应角色扮演和 Jailbreak 诊断进行 LLM 的指南合规性测试
机构 * Hong Kong University of Science and Technology(香港理工大学) ; Lapis Labs(Lapis实验室) ; Capital One
专题命中 越狱攻击 :jailbreak(title,title_cn);safety(abstract);trustworthy(abstract);分类 cs.CL、cs.AI
AI总结 GUARD 通过自适应角色扮演和 Jailbreak 诊断,将指南转化为具体违规问题,验证 LLM 的合规性,经八种 LLM 测试验证有效性。
Comments 56 pages