PREFINE: Preference-Based Implicit Reward and Cost Fine-Tuning for Safety Alignment
PREFINE: 基于偏好的隐式奖励和成本微调以实现安全对齐
机构 * TCS Research, \ of CSE, IIT Madras India ; Department of Computing Science, \ of Alberta Canada ; Qatar Computing Research Institute, \ Bin Khalifa University Qatar ; Department of Data Science \& AI, Wadhwani School of Data Science \& AI, IIT Madras India ; TCS Research, \ of CSE, IIT Madras ; Department of Computing Science, \ of Alberta ; Qatar Computing Research Institute, \ Bin Khalifa University ; Department of Data Science \& AI, Wadhwani School of Data Science \& AI, IIT Madras
专题命中 偏好对齐 :alignment(title,abstract);safety(title,abstract);RLHF(abstract,abstract_cn);DPO(abstract,abstract_cn)
AI总结 该研究提出PREFINE方法,通过基于偏好的隐式奖励和成本微调,在连续控制环境中实现安全策略对齐,通过微调预训练强化学习策略以生成低成本行为同时保持高奖励。
Comments Accepted at AAMAS 2026 as a full paper