Comparative Analysis of LLM Abliteration Methods: A Cross-Architecture Evaluation
大语言模型擦除方法的比较分析:跨架构评估
机构 * University of Nevada Las Vegas(内华达大学拉斯维加斯分校)
专题命中 安全评测 :alignment(abstract);safety(abstract);分类 cs.CL
AI总结 本研究比较了四种擦除工具在不同模型架构上的效果,发现数学推理能力对擦除干预最敏感,且单次通过方法在保持能力方面表现更优。
Comments 25 pages, 6 figures, 8 tables