SafeCap: Improving LVLM Safety with Image Captioning Reinforcement Learning
SafeCap:通过图像字幕强化学习提升大型视觉语言模型(LVLM)的安全性
专题命中 安全训练 :safety(title,abstract);DPO(abstract,abstract_cn);alignment(abstract);jailbreak(abstract)
AI总结 SafeCap是一种通过图像字幕强化学习提升LVLM安全性的框架,在多模态安全基准上安全得分提升3.7-19.0个百分点,且视觉效用相当或更优,性能优于安全SFT等方法。
Comments 16pages, 4 figures. Preprint. Project page: https://safe-vlm.github.io/SafeCap/ ; code: https://github.com/Safe-VLM/SafeCap