Certifiable Safe RLHF: Semantic Grounding and Fixed Penalty Constraint Optimization for Safer LLM Alignment
可认证安全RLHF:基于语义基础与固定惩罚约束优化的更安全大语言模型对齐
机构 * Department of Electrical and Computer Engineering(电气与计算机工程系) ; New Jersey Institute of Technology(新泽西理工学院) ; Department of Computer Engineering(计算机工程系) ; Heritage Institute of Technology(遗产理工学院)
专题命中 后训练与偏好优化 :RLHF(title,title_cn);LLM(title,abstract);large language model(abstract);language model(abstract)
AI总结 针对现有RLHF方法依赖奖励/成本函数和双变量调优导致性能敏感且缺乏可证明安全保证的问题,提出CS-RLHF,通过语义基础成本模型和固定惩罚约束优化,实现可认证安全对齐,效率提升至少5倍。