The Alignment Floor: How Persona Customization Breaks Safety in Weakly-Aligned LLMs
对齐下限:角色定制如何破坏弱对齐大语言模型的安全性
机构 * AWS Generative AI Innovation Center(AWS生成式人工智能创新中心) ; HSBC Holdings Plc., HSBC Technology Center, China(汇丰控股有限公司,汇丰技术中心,中国)
专题命中 偏好对齐 :alignment(title,abstract);safety(title,abstract);RLHF(abstract,abstract_cn);分类 cs.CL、cs.AI
AI总结 通过对比强对齐与弱对齐模型在不同角色条件下的谄媚率变化,定义对齐下限Δ_floor作为评估模型角色定制安全性的审计指标。