When Safety Overrides Vision: Exploring Dynamics between Vision Influence and Safety Alignment in Vision-Language Models
当安全覆盖视觉时:探索视觉语言模型中视觉影响与安全对齐之间的动态关系
专题命中 幻觉与鲁棒性 :vision-language model(title,abstract);visual reasoning(abstract);grounding(abstract);分类 cs.CV
AI总结 该研究探究对齐视觉语言模型中安全诱导弃权的内部解码动态,发现安全对齐未抑制感知接地,抑制拒绝相关表征可恢复接地回答,揭示了其一种新的失败模式。