SAVeS: Steering Safety Judgments in Vision-Language Models via Semantic Cues
SAVeS: 通过语义线索引导视觉-语言模型中的安全判断
机构 * King Abdullah University of Science and Technology(国王阿卜杜勒-阿齐兹大学科学与技术学院) ; Technical University of Munich(慕尼黑技术大学)
专题命中 幻觉与鲁棒性 :vision-language model(title,abstract);分类 cs.CV、cs.AI、cs.LG
AI总结 研究通过语义线索引导视觉-语言模型的安全判断,提出SAVeS基准和评估协议,验证安全决策对语义线索的敏感性,揭示模型对视觉-语言关联的依赖及潜在安全漏洞。