From Inaudible Inputs to Model Failures: Low-Frequency Safety Risks in LALMs
从不可听输入到模型失效:LALMs中的低频安全风险
机构 * Beijing University of Posts and Telecommunications(北京邮电大学) ; Institute of Information Engineering, Chinese Academy of Sciences(中国科学院信息工程研究所) ; Nanyang Technological University(南洋理工大学) ; JIUTIAN Research(九天研究院) ; Tencent ARC Lab(腾讯ARC实验室) ; Chongqing University of Posts and Telecommunications(重庆邮电大学)
专题命中 红队测试 :safety(title,abstract);red teaming(abstract);分类 cs.AI
AI总结 本文提出不可听红队测试方法ILL评估LALMs的低频安全风险,发现其可降低LALMs准确率达67个百分点,同时提出DRG防护方法可提升受攻击后的准确率,明确了LALMs此前被忽视的安全风险。