Gaslight, Gatekeep, V1-V3: Early Visual Cortex Alignment Shields Vision-Language Models from Sycophantic Manipulation
Gaslight, Gatekeep, V1-V3: 早期视觉皮层对齐保护视觉语言模型免受阿谀操控
机构 * Indian Institute of Technology Gandhinagar(印度理工学院加尔各答分校) ; Asian Institute of Technology(亚洲理工学院)
专题命中 其他安全 :alignment(title,abstract);safety(abstract);AI safety(abstract);分类 cs.AI
AI总结 本文研究了视觉语言模型在高风险场景中的脆弱性,通过评估12种模型的脑部对齐和顺从性,发现早期视觉皮层对齐能有效降低模型对阿谀操控的敏感性。
Comments 28 pages, 9 figures, 13 tables