CausalRM: Causal-Theoretic Reward Modeling for RLHF from Observational User Feedbacks
CausalRM:基于观察性用户反馈的因果理论奖励建模用于RLHF
机构 * Peking University(北京大学) ; Xiaohongshu Inc.(小红书公司) ; Zhejiang University(浙江大学)
AI总结 本文提出CausalRM框架,通过因果理论处理观察性用户反馈中的噪声和偏见问题,提升RLHF任务性能,实验显示在WildGuardMix和HarmBench上分别提升49.2%和32.7%。