PolicyAlign: Direct Policy-Based Safety Alignment for Large Language Models
PolicyAlign: 大型语言模型的直接基于策略的安全对齐
机构 * Qwen Large Model Application Team, Alibaba(阿里巴巴通义千问大模型应用团队) ; National University of Singapore(新加坡国立大学) ; Zhongguancun Academy(中关村学院)
专题命中 效率与部署 :LLM(summary_cn,abstract);large language model(title,abstract);language model(title,abstract);分类 cs.CL
AI总结 提出PolicyAlign框架,通过合成违规指令和策略敏感过滤,直接根据自然语言安全策略对齐LLM,提升安全性并保持低过度拒绝和通用能力。