Implicit Safety Alignment from Crowd Preferences
从大众偏好中隐式安全对齐
机构 * Kahlert School of Computing, University of Utah(犹他大学计算学校)
专题命中 偏好对齐 :safety(title,abstract);alignment(title);RLHF(abstract,abstract_cn);分类 cs.AI
AI总结 本文研究如何从大众偏好数据中提取共享的安全标准,并将其转移到下游强化学习任务中以规范智能体行为并确保安全。提出了一种基于大众偏好的安全强化学习框架,通过高级策略将安全对齐的技能组合起来,以安全地解决下游任务。
Comments Accepted to ICML 2026. Conference paper