Stealth Fine-Tuning: Efficiently Breaking Alignment in RVLMs Using Self-Generated CoT
隐形微调:通过自动生成的CoT打破RVLMs的对齐
机构 * Machine Intelligence Laboratory, Sichuan University(四川大学人工智能实验室) ; University of Wisconsin--Madison(威斯康星大学麦迪逊分校) ; Department of Automation, Tsinghua University(清华大学自动化系) ; Global Innovation Exchange, Tsinghua University(清华大学全球创新交流中心)
专题命中 其他推理 :CoT(title,abstract);reasoning(abstract);chain-of-thought(abstract);分类 cs.CL
AI总结 本文提出隐形微调方法,通过分段干扰和自动生成输出,有效绕过RVLMs的安全对齐防御,实现更高的ASR性能同时保持推理能力。
Comments 15 pages, 7 figures