SRTJ: Self-Evolving Rule-Driven Training-Free LLM Jailbreaking
SRTJ:自演化规则驱动的无训练LLM jailbreaking
机构 * HKUST (GZ)(香港科技大学(广州)) ; Jilin University(吉林大学) ; Yale University(耶鲁大学)
专题命中 越狱攻击 :jailbreak(abstract,abstract_cn);alignment(abstract);safety(abstract);分类 cs.CL
AI总结 SRTJ通过交互反馈系统发现、组合和优化攻击策略,无需更新模型参数,有效平衡探索与利用,提升攻击鲁棒性和泛化能力。