DT2IT-MRM: Debiased Preference Construction and Iterative Training for Multimodal Reward Modeling
DT2IT-MRM:去偏偏好构建与迭代训练用于多模态奖励建模
机构 * University of Science and Technology of China(中国科学技术大学)
专题命中 偏好对齐 :RLHF(abstract,abstract_cn);分类 cs.AI
AI总结 本文提出DT2IT-MRM方法,通过去偏偏好构建、文本到图像偏好数据重构和迭代训练框架,解决多模态奖励建模中偏好数据的偏差、噪声和不一致问题,并在三个基准测试中取得新突破。
Comments code will be uploaded to https://github.com/zhang123434/DT2IT-MRM