Safety Recovery in Reasoning Models Is Only a Few Early Steering Steps Away
推理模型中的安全恢复仅需几步早期引导步骤
机构 * University of Maryland, College Park(马里兰大学哥伦比亚学院) ; IIT, Bombay(孟买印度理工学院) ; University of Central Florida(佛罗里达中央大学)
专题命中 逻辑推理 :reasoning(title,abstract);chain-of-thought(abstract);分类 cs.CL、cs.AI
AI总结 SafeThink通过在推理早期干预减少攻击成功率,提升推理模型的安全性