Disentangled Safety Adapters Enable Efficient Guardrails and Flexible Inference-Time Alignment
解耦安全适配器实现高效的防护措施和灵活的推理时对齐
机构 * Apple(苹果公司)
专题命中 安全训练 :alignment(title,abstract);safety(title,abstract);AI safety(abstract);分类 cs.CL、cs.AI、cs.LG
AI总结 本文提出解耦安全适配器框架,通过分离安全计算与任务优化基础模型,提升推理效率和开发灵活性,实验证明其在 hate speech 分类等任务中显著优于传统模型。
Comments ICLR 2026 Workshop: Principled Design for Trustworthy AI