On-Policy Distillation for LLM Safety: A Routing Approach to Template-Robust Realignment
面向大语言模型安全的在线策略蒸馏:一种针对模板鲁棒性的重对齐路由方法
机构 * Tsinghua University(清华大学) ; Swinburne University of Technology(斯威本科技大学) ; EPFL(洛桑联邦理工学院)
AI总结 针对现有LLM安全防御的模板鲁棒性不足等问题,提出ROPD框架,通过建模输出分布差异实现重对齐,大幅降低模板不匹配风险,在防御有效性和能力保留上优于基线方法,建立了新的鲁棒重对齐标准。