Inference-Time Vulnerability Beyond Shallow Safety: Alignment Along Generation Trajectories
超越浅层安全的推理时脆弱性:沿生成轨迹的对齐
机构 * Hankuk University of Foreign Studies(翰江大学外国语大学) ; Seoul National University(首尔国立大学)
专题命中 安全训练 :alignment(title,abstract);safety(title,abstract);分类 cs.CL、cs.AI、cs.LG
AI总结 本文揭示安全对齐的大语言模型在推理时存在更广泛的脆弱性,即任意生成步骤的短标记注入都能显著改变后续安全行为,并提出通过直接在生成轨迹上对齐模型来提升鲁棒性。