Risk Awareness Injection: Calibrating Vision-Language Models for Safety without Compromising Utility
风险感知注入:为安全校准视觉-语言模型而不牺牲实用性
机构 * Shien-Ming Wu School of Intelligent Engineering, South China University of Technology(华南理工大学吴贤铭智能工程学院) ; Guangdong Laboratory of Artificial Intelligence and Digital Economy (SZ)(广东省人工智能与数字经济实验室(深圳)) ; Computer Science and Engineering, The Hong Kong University of Science and Technology(香港科技大学计算机科学与工程系) ; University of Electronic Science and Technology of China(电子科技大学)
专题命中 幻觉与鲁棒性 :vision-language model(title);vision language model(abstract);分类 cs.AI、cs.LG
AI总结 本文提出RAI框架,通过增强不安全信号恢复视觉-语言模型的安全识别能力,同时保持语义完整性,实验显示有效降低攻击成功率。