Divergence-based Safety Measure for Large Language Models via Rational Inattention
基于散度的语言模型安全度量:理性疏忽视角
专题命中 其他LLM :large language model(title,abstract);language model(title,abstract);LLM(summary_cn,abstract_cn)
AI总结 针对嵌入输入攻击,提出一种基于KL散度的LLM安全度量,利用注意力机制与理性疏忽的等价性构建隐蔽约束,并通过Bregman散度推导上界,应用于GPT-2和GPT-Neo-125M以区分模型安全特性。
Comments 16 pages and 2 figures