SteeringSafety: Benchmarking Representation Steering in LLMs Across Safety Perspectives
SteeringSafety:针对大语言模型在多安全视角下的表征引导基准测试
机构 * University of California, Santa Cruz(加州大学圣克鲁兹分校) ; Washington University in St. Louis(华盛顿大学圣路易斯分校) ; University of California, Berkeley(加州大学伯克利分校)
AI总结 本研究推出SteeringSafety基准,测试DIM等引导方法在3款大模型的9种安全视角表现,发现方法与模型、视角的匹配影响性能,且存在多视角纠缠问题,需多安全角度评估引导方法。
Comments Accepted at ICML 2026