Steering Instruction Hierarchies at Inference Time
推理时的指令层级调控
专题命中 提示注入 :safety(abstract);分类 cs.CL
AI总结 针对前沿大语言模型常违反指令层级的问题,提出无需训练的V-Steer方法,通过编辑缓存值向量调控指令层级,提升角色冲突基准准确率,性能优于仅提示基线,部分场景达到SoTA训练方法水平。
Comments Published as a conference paper at COLM '26; the first two authors contributed equally to the work. 24 pages, 9 figures